niceeval 0.6.1 → 0.6.2
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/dist/agents/types.d.ts +67 -5
- package/dist/context/types.d.ts +32 -12
- package/dist/i18n/en.d.ts +54 -0
- package/dist/i18n/zh-CN.d.ts +55 -1
- package/dist/o11y/types.d.ts +16 -2
- package/dist/report/aggregate.d.ts +5 -3
- package/dist/report/aggregate.js +32 -5
- package/dist/report/built-ins/experiment-comparison.d.ts +39 -1
- package/dist/report/built-ins/experiment-comparison.js +116 -10
- package/dist/report/built-ins/index.d.ts +1 -0
- package/dist/report/built-ins/index.js +1 -1
- package/dist/report/components.d.ts +8 -2
- package/dist/report/components.js +3 -3
- package/dist/report/compute.d.ts +11 -18
- package/dist/report/compute.js +54 -34
- package/dist/report/flag.d.ts +16 -1
- package/dist/report/flag.js +19 -1
- package/dist/report/format.d.ts +16 -8
- package/dist/report/format.js +27 -12
- package/dist/report/index.d.ts +4 -3
- package/dist/report/index.js +5 -4
- package/dist/report/locale.d.ts +11 -2
- package/dist/report/locale.js +23 -5
- package/dist/report/metrics.d.ts +13 -1
- package/dist/report/metrics.js +65 -14
- package/dist/report/primitives.d.ts +6 -0
- package/dist/report/react/AttemptList.d.ts +2 -2
- package/dist/report/react/AttemptList.js +5 -6
- package/dist/report/react/EvalList.d.ts +1 -1
- package/dist/report/react/EvalList.js +0 -0
- package/dist/report/react/ExperimentComparison.d.ts +8 -0
- package/dist/report/react/ExperimentComparison.js +11 -0
- package/dist/report/react/ExperimentList.d.ts +2 -1
- package/dist/report/react/ExperimentList.js +8 -10
- package/dist/report/react/MetricScatter.js +5 -11
- package/dist/report/react/chart-math.d.ts +23 -6
- package/dist/report/react/chart-math.js +71 -19
- package/dist/report/react/fixtures.d.ts +3 -3
- package/dist/report/react/fixtures.js +21 -14
- package/dist/report/report.d.ts +5 -1
- package/dist/report/report.js +6 -2
- package/dist/report/text/faces.d.ts +1 -1
- package/dist/report/text/faces.js +42 -41
- package/dist/report/text/table.js +36 -5
- package/dist/report/types.d.ts +39 -21
- package/dist/results/types.d.ts +11 -0
- package/dist/runner/feedback/sink.d.ts +110 -0
- package/dist/runner/types.d.ts +513 -22
- package/dist/sandbox/docker.d.ts +23 -2
- package/dist/sandbox/e2b.d.ts +15 -1
- package/dist/sandbox/errors.d.ts +30 -3
- package/dist/sandbox/io-retry.d.ts +17 -0
- package/dist/sandbox/registry.d.ts +2 -0
- package/dist/sandbox/resolve.d.ts +18 -5
- package/dist/sandbox/retry.d.ts +11 -1
- package/dist/sandbox/types.d.ts +39 -5
- package/dist/sandbox/vercel.d.ts +7 -1
- package/dist/scoring/coverage.d.ts +30 -0
- package/dist/scoring/display.d.ts +21 -0
- package/dist/scoring/display.js +120 -0
- package/dist/scoring/types.d.ts +103 -20
- package/dist/shared/aggregate.d.ts +1 -0
- package/dist/shared/aggregate.js +3 -3
- package/dist/shared/types.d.ts +28 -0
- package/dist/tty-line.d.ts +0 -4
- package/dist/util.d.ts +23 -0
- package/docs-site/zh/concepts/adapter.mdx +22 -4
- package/docs-site/zh/concepts/experiment.mdx +1 -1
- package/docs-site/zh/concepts/overview.mdx +6 -6
- package/docs-site/zh/guides/agent-feedback-loop.mdx +28 -26
- package/docs-site/zh/guides/authoring.mdx +33 -0
- package/docs-site/zh/guides/ci-integration.mdx +23 -12
- package/docs-site/zh/guides/connect-your-agent.mdx +29 -3
- package/docs-site/zh/guides/custom-reports.mdx +29 -34
- package/docs-site/zh/guides/dataset-fanout.mdx +25 -3
- package/docs-site/zh/guides/debug-sandbox.mdx +57 -0
- package/docs-site/zh/guides/debugging.mdx +210 -0
- package/docs-site/zh/guides/experiments.mdx +10 -3
- package/docs-site/zh/guides/official-adapters.mdx +26 -2
- package/docs-site/zh/guides/publish-report.mdx +30 -16
- package/docs-site/zh/guides/report-components.mdx +42 -30
- package/docs-site/zh/guides/reporters.mdx +2 -2
- package/docs-site/zh/guides/results-data.mdx +17 -9
- package/docs-site/zh/guides/runner.mdx +17 -7
- package/docs-site/zh/guides/sandbox-agent.mdx +56 -7
- package/docs-site/zh/guides/sandbox-providers.mdx +257 -9
- package/docs-site/zh/guides/scoring-guide.mdx +4 -4
- package/docs-site/zh/guides/viewing-results.mdx +79 -36
- package/docs-site/zh/guides/write-experiment.mdx +5 -3
- package/docs-site/zh/guides/write-send.mdx +17 -1
- package/docs-site/zh/index.mdx +1 -1
- package/docs-site/zh/reference/builtin-agents.mdx +27 -0
- package/docs-site/zh/reference/capabilities.mdx +2 -2
- package/docs-site/zh/reference/cli.mdx +33 -7
- package/docs-site/zh/reference/define-agent.mdx +57 -4
- package/docs-site/zh/reference/define-config.mdx +1 -1
- package/docs-site/zh/reference/define-eval.mdx +42 -9
- package/docs-site/zh/reference/expect.mdx +26 -1
- package/package.json +5 -1
- package/src/agents/ai-sdk-otel.test.ts +1 -0
- package/src/agents/ai-sdk.test.ts +3 -0
- package/src/agents/ai-sdk.ts +3 -0
- package/src/agents/bub-install-spec.test.ts +34 -0
- package/src/agents/bub-install-spec.ts +32 -0
- package/src/agents/bub.ts +31 -32
- package/src/agents/claude-code.test.ts +130 -9
- package/src/agents/claude-code.ts +76 -4
- package/src/agents/codex.test.ts +189 -40
- package/src/agents/codex.ts +155 -14
- package/src/agents/coding-cli-versions.test.ts +15 -0
- package/src/agents/coding-cli-versions.ts +3 -0
- package/src/agents/index.ts +11 -0
- package/src/agents/langgraph.test.ts +204 -0
- package/src/agents/langgraph.ts +495 -0
- package/src/agents/marketplace.ts +85 -0
- package/src/agents/native-config.test.ts +179 -0
- package/src/agents/native-config.ts +267 -0
- package/src/agents/openai-compat.test.ts +1 -0
- package/src/agents/openclaw.test.ts +31 -0
- package/src/agents/openclaw.ts +171 -0
- package/src/agents/plugin-config.test.ts +1 -0
- package/src/agents/sdk-streams.test.ts +79 -0
- package/src/agents/sdk-streams.ts +55 -10
- package/src/agents/skills.test.ts +1 -0
- package/src/agents/streaming.test.ts +3 -9
- package/src/agents/types.ts +68 -5
- package/src/agents/ui-message-stream.test.ts +3 -0
- package/src/cli.ts +411 -108
- package/src/context/context.test.ts +51 -12
- package/src/context/context.ts +161 -29
- package/src/context/session.test.ts +1 -0
- package/src/context/session.ts +114 -6
- package/src/context/types.ts +30 -12
- package/src/define.test.ts +13 -8
- package/src/define.ts +25 -4
- package/src/expect/index.ts +53 -23
- package/src/i18n/en.ts +64 -2
- package/src/i18n/zh-CN.ts +65 -3
- package/src/o11y/cost.test.ts +1 -0
- package/src/o11y/execution-tree.test.ts +1 -20
- package/src/o11y/otlp/mappers/claude-code.test.ts +1 -0
- package/src/o11y/otlp/parse.test.ts +1 -0
- package/src/o11y/otlp/turn-otel.test.ts +1 -0
- package/src/o11y/parsers/bub.test.ts +1 -0
- package/src/o11y/parsers/claude-code.test.ts +1 -34
- package/src/o11y/parsers/openclaw.test.ts +154 -0
- package/src/o11y/parsers/openclaw.ts +310 -0
- package/src/o11y/prices.json +746 -311
- package/src/o11y/tool-names.test.ts +1 -0
- package/src/o11y/types.ts +16 -2
- package/src/report/aggregate.ts +34 -5
- package/src/report/built-in-user-parity.test.tsx +110 -153
- package/src/report/built-ins/experiment-comparison.tsx +173 -13
- package/src/report/built-ins/index.ts +6 -1
- package/src/report/components.tsx +9 -3
- package/src/report/compute.ts +70 -40
- package/src/report/dual-render.test.tsx +194 -67
- package/src/report/flag.ts +30 -2
- package/src/report/format.ts +35 -11
- package/src/report/index.ts +22 -4
- package/src/report/locale.ts +25 -5
- package/src/report/metrics.ts +67 -14
- package/src/report/primitives.tsx +6 -0
- package/src/report/react/AttemptList.tsx +6 -31
- package/src/report/react/EvalList.tsx +0 -0
- package/src/report/react/ExperimentComparison.tsx +68 -0
- package/src/report/react/ExperimentList.tsx +15 -9
- package/src/report/react/MetricScatter.tsx +12 -14
- package/src/report/react/chart-math.test.ts +85 -0
- package/src/report/react/chart-math.ts +101 -22
- package/src/report/react/enhance.js +33 -1
- package/src/report/react/fixtures.ts +24 -17
- package/src/report/react/render.test.tsx +9 -64
- package/src/report/react/styles.css +73 -2
- package/src/report/report.test.ts +306 -98
- package/src/report/report.ts +6 -2
- package/src/report/text/faces.ts +47 -43
- package/src/report/text/table.ts +42 -5
- package/src/report/types.ts +41 -21
- package/src/results/annotated-source.test.ts +62 -9
- package/src/results/annotated-source.ts +64 -6
- package/src/results/attempt-evidence.test.ts +9 -7
- package/src/results/attempt-evidence.ts +15 -8
- package/src/results/attempt-source.ts +6 -3
- package/src/results/copy.ts +145 -55
- package/src/results/host-equivalence.test.ts +8 -6
- package/src/results/index.ts +2 -0
- package/src/results/locator.test.ts +1 -22
- package/src/results/open.ts +7 -1
- package/src/results/publish.ts +149 -0
- package/src/results/results.test.ts +85 -51
- package/src/results/truncate.ts +90 -0
- package/src/results/types.ts +7 -0
- package/src/results/writer.ts +31 -13
- package/src/runner/attempt.test.ts +138 -7
- package/src/runner/attempt.ts +603 -104
- package/src/runner/discover.test.ts +47 -0
- package/src/runner/discover.ts +36 -2
- package/src/runner/eval-source.test.ts +1 -27
- package/src/runner/feedback/agent.test.ts +504 -0
- package/src/runner/feedback/agent.ts +409 -0
- package/src/runner/feedback/ci.test.ts +562 -0
- package/src/runner/feedback/ci.ts +401 -0
- package/src/runner/feedback/coordinator.test.ts +317 -0
- package/src/runner/feedback/coordinator.ts +397 -0
- package/src/runner/feedback/failure.ts +40 -0
- package/src/runner/feedback/human.test.ts +616 -0
- package/src/runner/feedback/human.ts +535 -0
- package/src/runner/feedback/index.ts +66 -0
- package/src/runner/feedback/io.ts +78 -0
- package/src/runner/feedback/profile.test.ts +50 -0
- package/src/runner/feedback/profile.ts +58 -0
- package/src/runner/feedback/reducer.test.ts +395 -0
- package/src/runner/feedback/reducer.ts +260 -0
- package/src/runner/feedback/renderer.ts +82 -0
- package/src/runner/feedback/sink.ts +203 -0
- package/src/runner/feedback/testing.ts +106 -0
- package/src/runner/ledger.test.ts +230 -0
- package/src/runner/ledger.ts +329 -0
- package/src/runner/report.test.ts +128 -3
- package/src/runner/report.ts +33 -9
- package/src/runner/reporters/artifacts.ts +8 -2
- package/src/runner/reporters/braintrust.test.ts +8 -7
- package/src/runner/reporters/braintrust.ts +9 -2
- package/src/runner/reporters/index.ts +2 -2
- package/src/runner/reporters/json.test.ts +162 -0
- package/src/runner/reporters/json.ts +35 -8
- package/src/runner/reporters/shared.ts +1 -5
- package/src/runner/run.test.ts +760 -3
- package/src/runner/run.ts +242 -36
- package/src/runner/sandbox-prep.ts +3 -42
- package/src/runner/timing.ts +158 -0
- package/src/runner/types.ts +518 -22
- package/src/sandbox/checkpoint.test.ts +55 -0
- package/src/sandbox/checkpoint.ts +29 -8
- package/src/sandbox/cli-commands.ts +407 -0
- package/src/sandbox/docker.ts +115 -16
- package/src/sandbox/e2b-agent-template.test.ts +56 -0
- package/src/sandbox/e2b-agent-template.ts +94 -0
- package/src/sandbox/e2b.ts +74 -9
- package/src/sandbox/errors.ts +111 -4
- package/src/sandbox/index.ts +2 -0
- package/src/sandbox/io-retry.test.ts +58 -0
- package/src/sandbox/io-retry.ts +45 -0
- package/src/sandbox/keep-registry.test.ts +86 -0
- package/src/sandbox/keep-registry.ts +142 -0
- package/src/sandbox/keep.ts +178 -0
- package/src/sandbox/paths.test.ts +1 -0
- package/src/sandbox/paths.ts +19 -8
- package/src/sandbox/registry.ts +20 -3
- package/src/sandbox/resolve.ts +76 -11
- package/src/sandbox/retry.test.ts +70 -0
- package/src/sandbox/retry.ts +46 -4
- package/src/sandbox/types.ts +44 -6
- package/src/sandbox/vercel.ts +43 -20
- package/src/scoring/collector.ts +60 -17
- package/src/scoring/coverage.ts +95 -0
- package/src/scoring/diff.ts +81 -0
- package/src/scoring/display.test.ts +121 -0
- package/src/scoring/display.ts +133 -0
- package/src/scoring/evidence.test.ts +189 -0
- package/src/scoring/judge.test.ts +142 -0
- package/src/scoring/judge.ts +15 -18
- package/src/scoring/scoped.ts +217 -50
- package/src/scoring/types.ts +117 -20
- package/src/scoring/verdict.ts +16 -4
- package/src/shared/aggregate.ts +3 -2
- package/src/shared/types.ts +31 -0
- package/src/show/compose.ts +2 -2
- package/src/show/index.ts +21 -1
- package/src/show/render.ts +619 -104
- package/src/show/show.test.ts +235 -19
- package/src/tty-line.ts +8 -26
- package/src/util.test.ts +1 -0
- package/src/util.ts +41 -0
- package/src/view/app/components/AttemptModal.tsx +153 -2
- package/src/view/app/components/CodeView.tsx +32 -11
- package/src/view/app/components/CopyControls.tsx +2 -2
- package/src/view/app/i18n.ts +6 -0
- package/src/view/app/lib/attempt-route.test.ts +1 -0
- package/src/view/app/lib/verdict.ts +7 -9
- package/src/view/artifact-serving.test.ts +2 -1
- package/src/view/client-dist/app.css +1 -1
- package/src/view/client-dist/app.js +17 -17
- package/src/view/data.test.ts +1 -0
- package/src/view/data.ts +11 -1
- package/src/view/index.ts +11 -0
- package/src/view/server.ts +2 -0
- package/src/view/styles.css +3 -0
- package/src/view/view-report.test.ts +6 -5
- package/src/runner/reporters/console.ts +0 -70
- package/src/runner/reporters/live.test.ts +0 -56
- package/src/runner/reporters/live.ts +0 -247
- package/src/runner/reporters/quiet.test.ts +0 -66
- package/src/runner/reporters/quiet.ts +0 -49
- package/src/runner/reporters/table.ts +0 -277
|
@@ -4,29 +4,26 @@ sidebarTitle: "查看结果"
|
|
|
4
4
|
description: "每次运行写入 .niceeval/ 的结构化 artifact 有两扇门:niceeval show 在终端用 @<locator> 精确定位一次 Attempt,逐级下钻 Eval 源码、执行记录与 diff;niceeval view 在网页看同一份证据。"
|
|
5
5
|
---
|
|
6
6
|
|
|
7
|
-
每次运行后,[NiceEval](https://niceeval.com/) 都会把结构化结果写入该实验的**结果快照**目录 `.niceeval/<experiment>/<快照>/`。看结果有两扇门,读的是同一批 artifact:`niceeval show` 是终端读法,人和 coding agent 都能用;`niceeval view`
|
|
7
|
+
每次运行后,[NiceEval](https://niceeval.com/) 都会把结构化结果写入该实验的**结果快照**目录 `.niceeval/<experiment>/<快照>/`。看结果有两扇门,读的是同一批 artifact:`niceeval show` 是终端读法,人和 coding agent 都能用;`niceeval view` 是网页读法,适合人浏览证据。两扇门共用判定公式、选结果规则和默认报告:对每个 experiment 的每道 eval,取时间上最新的那份判定,同一个 experiment 跨多次运行拼出来;再按 experiment id 的父目录分组,只在同组内比较。`show` 输出文本面,`view` 输出网页面。
|
|
8
8
|
|
|
9
9
|
## 控制台输出
|
|
10
10
|
|
|
11
11
|
```text
|
|
12
|
-
|
|
13
|
-
|
|
14
|
-
|
|
15
|
-
|
|
16
|
-
|
|
17
|
-
|
|
18
|
-
|
|
19
|
-
|
|
20
|
-
|
|
21
|
-
|
|
22
|
-
|
|
23
|
-
|
|
24
|
-
Results: 2 passed, 1 failed, 0 errored, 0 skipped
|
|
25
|
-
Structured results: .niceeval/compare_web-agent/2026-07-09T10-00-00-000Z-x1f2/
|
|
26
|
-
(snapshot.json + 每 attempt 的 result.json / events.json / trace.json / diff.json)
|
|
12
|
+
Plan: 45 attempts · 9 evals × 5 configs · concurrency 19
|
|
13
|
+
✗ @12h8m4k1 fixtures/button [compare/claude-e2b] errored · sandbox.create
|
|
14
|
+
sandbox-rate-limit: E2B sandbox allocation failed after 5 attempts
|
|
15
|
+
Inspect: niceeval show @12h8m4k1
|
|
16
|
+
|
|
17
|
+
niceeval exp compare 2m 14s
|
|
18
|
+
45 total · 6 reused · 19 running · 12 queued · 8 completed $0.84
|
|
19
|
+
|
|
20
|
+
ACTIVE
|
|
21
|
+
● memory/agent-029-use-cache compare/bub-e2b 1m 42s running tests
|
|
22
|
+
● memory/agent-030-app-route compare/codex 1m 18s editing src/app.ts
|
|
23
|
+
… 17 more active
|
|
27
24
|
```
|
|
28
25
|
|
|
29
|
-
|
|
26
|
+
Human profile 只原位更新当前总数和 active slots,不把历史帧推入 scrollback。失败、错误和去重后的 diagnostic 永久追加,并带 locator。结束块只保留摘要、失败 locator、下钻命令和结果路径。这段输出怎么进「跑→读→修→再跑」的循环,见 [Agent 反馈闭环](/zh/guides/agent-feedback-loop)。
|
|
30
27
|
|
|
31
28
|
## `.niceeval/<experiment>/<快照>/`
|
|
32
29
|
|
|
@@ -38,7 +35,7 @@ Structured results: .niceeval/compare_web-agent/2026-07-09T10-00-00-000Z-x1f2/
|
|
|
38
35
|
└─ 2026-07-09T10-00-00-000Z-x1f2/ # 快照目录:时间戳 + 随机后缀
|
|
39
36
|
├─ snapshot.json # 快照元数据(开始时写,收尾补 completedAt)
|
|
40
37
|
└─ weather-tool/a0/ # 单个 eval attempt 的目录
|
|
41
|
-
├─ result.json #
|
|
38
|
+
├─ result.json # 判定、断言、结构化错误/diagnostics、用量
|
|
42
39
|
├─ events.json
|
|
43
40
|
├─ sources.json
|
|
44
41
|
├─ trace.json
|
|
@@ -51,39 +48,44 @@ Structured results: .niceeval/compare_web-agent/2026-07-09T10-00-00-000Z-x1f2/
|
|
|
51
48
|
`niceeval show` 的位置参数有两种形态:eval id 前缀选「看哪些 eval」,`@<locator>` 精确指名「看哪一次 Attempt」。flag 选「看哪个切面」:
|
|
52
49
|
|
|
53
50
|
```bash
|
|
54
|
-
niceeval show #
|
|
51
|
+
niceeval show # 默认报告:按实验组分区,组内比较配置并下钻到 Attempt
|
|
55
52
|
niceeval show weather # 前缀过滤:weather/* 下每个 eval 的判定
|
|
56
53
|
niceeval show weather/brooklyn # 单个 eval:各 experiment 的 attempt 行(含 @<locator>)、默认 attempt 的断言明细
|
|
57
54
|
niceeval show @1k2m9qrs # 精确到一次 Attempt:紧凑全景(断言/执行/diff 摘要 + 可用证据一览)
|
|
58
55
|
niceeval show @1k2m9qrs --eval # 该 Attempt 运行时保存的 Eval 源码,断言标回源码行
|
|
59
56
|
niceeval show @1k2m9qrs --execution # 该 Attempt 的消息、thinking、Skill 加载、工具调用,有 OTel 时补时间
|
|
57
|
+
niceeval show @1c3h6twx --timing # 有界诊断时间树:phase、hook、operation、shell、turn、OTel 与收尾
|
|
58
|
+
niceeval show @1c3h6twx --timing=full # 同一棵时间树逐节点完整展开
|
|
60
59
|
niceeval show @1c3h6twx --diff # sandbox 里的文件改动
|
|
61
60
|
niceeval show weather/brooklyn --history # 跨 run 时间轴:抖动与回归拐点
|
|
62
61
|
```
|
|
63
62
|
|
|
64
|
-
`@<locator>` 是一次 Attempt 的持久、不透明身份,形如 `@1k2m9qrs`:由 `{experimentId, 快照时刻, evalId, attempt 序号}` 这个身份元组确定性派生,同一份落盘结果反复解析恒得到同一个值。它出现在 `niceeval show`
|
|
63
|
+
`@<locator>` 是一次 Attempt 的持久、不透明身份,形如 `@1k2m9qrs`:由 `{experimentId, 快照时刻, evalId, attempt 序号}` 这个身份元组确定性派生,同一份落盘结果反复解析恒得到同一个值。它出现在 `niceeval show` 的分组明细里,直接复制粘贴就能定位到那一次运行。列表里的 locator 只打印 `@<id>`,不追加判定或证据能力缩写;打开 Attempt 首页后,`available` 会列出实际可用的证据命令。
|
|
64
|
+
|
|
65
|
+
Sandbox 创建、setup 或 teardown 错误不依赖 trace。`result.json` 保存错误的 `code`、`message`、生命周期阶段(`phase`)、有限 cause/stack 和 diagnostics;trace 只在存在时补调用关系与耗时。Attempt 在 cleanup、teardown 和 sandbox stop 结束后才封口写入,因此收尾 diagnostic 也能回顾。
|
|
65
66
|
|
|
66
67
|
同一个实验多次跑会留下多份结果,不带 `@<locator>` 的默认视图只回答一个问题——「现在整体怎样」:每个 experiment × eval 取时间上最新的那份判定,同一个 experiment 跨多次运行拼出来。按前缀只重跑了部分 eval 时,其余 eval 的判定从更早的运行补齐,报告永远是全局最新,不会因为一次局部重跑变残缺。合成是有标注的:每份判定都带上它产生的时间,能看出报告是从哪几次运行拼出来的。合成结果可能混着不同版本的被测代码——所以收工判定以 `--force` 全量重跑为准,迭代途中的 `show` 负责快、收尾的全量跑负责真。
|
|
67
68
|
|
|
68
|
-
单个 eval 视图里,多 experiment、多 Attempt 时的断言明细块默认挑最新一次失败的 Attempt 展开;没有失败就挑最新一次。这只是一个默认展开的启发式,不是精确选择——需要精确看某一次 Attempt,复制那一行的 `@<locator>` 直接 `show` 它即可。`--experiment`
|
|
69
|
+
单个 eval 视图里,多 experiment、多 Attempt 时的断言明细块默认挑最新一次失败的 Attempt 展开;没有失败就挑最新一次。这只是一个默认展开的启发式,不是精确选择——需要精确看某一次 Attempt,复制那一行的 `@<locator>` 直接 `show` 它即可。`--experiment compare` 按路径段前缀把 Selection 收窄到整个 `compare` 组,`--experiment compare/bub` 只留一个 experiment;`--run <目录>` 钉死看某一次历史 run,`--history` 看跨 run 趋势。`--report <文件>` 同时替换 `show` / `view` 的默认报告。位置前缀、`--run`、`--experiment` 对自定义报告同样生效;`--history` 与 `--report` 互斥。
|
|
69
70
|
|
|
70
71
|
`niceeval view` 的每个视图都有 CLI 对应物:
|
|
71
72
|
|
|
72
73
|
| `niceeval view` 里的视图 | 终端对应 |
|
|
73
74
|
| --- | --- |
|
|
74
|
-
|
|
|
75
|
+
| 当前结果的分组比较报告 | `niceeval show` |
|
|
75
76
|
| 该 eval 各 experiment 的判定行 + 默认 attempt 的断言明细 | `niceeval show <eval id>` |
|
|
76
77
|
| 单次 Attempt 的紧凑全景(断言、执行、diff 摘要与证据可用性) | `niceeval show @<locator>` |
|
|
77
78
|
| Eval 源码标注(断言标回源码行) | `niceeval show @<locator> --eval` |
|
|
78
79
|
| AI 对话、thinking、Skill 加载与工具调用(有 OTel 时补时间) | `niceeval show @<locator> --execution` |
|
|
80
|
+
| 单次 Attempt 的阶段耗时分解 | `niceeval show @<locator> --timing`;逐节点审计用 `--timing=full` |
|
|
79
81
|
| 文件改动 | `niceeval show @<locator> --diff` |
|
|
80
82
|
| 历史 run 列表 | `niceeval show <eval id> --history`;钉死某一次用 `--run <目录>` |
|
|
81
83
|
|
|
82
|
-
###
|
|
84
|
+
### 默认分组比较报告
|
|
83
85
|
|
|
84
|
-
不带 flag 的 `niceeval show`
|
|
86
|
+
不带 flag 的 `niceeval show` 如果命中多个可比组,只列组索引和可直接执行的 `niceeval show --experiment <group>` 命令;Selection 只剩一个组时才输出该组的成本 × 端到端成功率图和实验列表。组的边界来自 experiment id 的完整父目录:`compare/*` 与 `dev-e2b/*` 不共享坐标系、连线、排序或汇总数字;顶层 experiment 各自形成单例组。
|
|
85
87
|
|
|
86
|
-
|
|
88
|
+
组内实验列表先给固定列汇总,再按 experiment → Eval → Attempt 展开。locator 只保留 `@<id>`,失败原因优先显示期望值/实际值或命令退出码;完整断言和 evidence 留在 `niceeval show @<locator>`。某组只有一个 experiment 时散点仍显示单点,不出现“至少两个实验才能比较”的空态。快照未完成、过旧或覆盖不全的 warning 位于组索引前,同一条 warning 只显示一次。
|
|
87
89
|
|
|
88
90
|
### 单个 eval
|
|
89
91
|
|
|
@@ -126,7 +128,7 @@ failures:
|
|
|
126
128
|
source: evals/memory/swelancer-manager-proposals.eval.ts:40:11
|
|
127
129
|
|
|
128
130
|
execution: 2 events · 0 skill loads · 0 tool calls · 1 AI messages
|
|
129
|
-
timing:
|
|
131
|
+
timing: eval.run 40.8s · scoring.evaluate 0.3s
|
|
130
132
|
|
|
131
133
|
changes: diff unavailable · no workspace diff was recorded for this attempt
|
|
132
134
|
|
|
@@ -134,13 +136,14 @@ artifacts: .niceeval/compare_codex-gpt-5.4/2026-07-09T10-00-00-000Z-x1f2/weather
|
|
|
134
136
|
available:
|
|
135
137
|
niceeval show @1k2m9qrs --eval
|
|
136
138
|
niceeval show @1k2m9qrs --execution
|
|
139
|
+
niceeval show @1k2m9qrs --timing
|
|
137
140
|
```
|
|
138
141
|
|
|
139
142
|
这份全景只给摘要,不复现某个切面的完整内容——完整源码、完整事件流或完整文件列表分别要对应的证据 flag 才给。`changes` 一行永远说明 diff 不可用的具体原因:这里是「这次 Attempt 从未收集过 diff」(`weather/brooklyn` 不是 sandbox eval,压根不会有工作区改动可收集);如果是 sandbox eval 但 agent 确实没碰任何文件,会是另一句「没有产生工作区文件改动」;两种「不可用」原因不同,不共用一句含糊的提示。
|
|
140
143
|
|
|
141
|
-
### `--eval`、`--execution`、`--diff
|
|
144
|
+
### `--eval`、`--execution`、`--timing`、`--diff`:四个证据切面
|
|
142
145
|
|
|
143
|
-
|
|
146
|
+
四个证据 flag 既可以加在 `@<locator>` 后面(精确到一次 Attempt),也可以加在能唯一收窄到一个 eval 的前缀后面(挑同一套默认启发式选中的 attempt——最新一次失败,没有失败就挑最新一次,与单 eval 详情块展开的是同一次);前缀撞到不止一个 eval 时会报错,报错正文直接给出每个候选 eval 的 `@<locator>`,照抄一个继续即可。可以同时传多个证据 flag,一次输出全部要看的切面。
|
|
144
147
|
|
|
145
148
|
`--eval` 是运行时保存的 Eval 源码,按行标注每条断言、gate 失败与 soft 分数直接排在对应源码行下面,源码里没能对应到具体行的断言(没有位置信息,或位置指向另一个文件)单独成一段,永不丢弃:
|
|
146
149
|
|
|
@@ -231,6 +234,45 @@ timing unavailable · OTel trace was not collected
|
|
|
231
234
|
full events: .niceeval/compare_codex-gpt-5.4/2026-07-09T10-00-00-000Z-x1f2/weather/brooklyn/a2/events.json
|
|
232
235
|
```
|
|
233
236
|
|
|
237
|
+
`--timing` 回答「整个 Attempt 的时间花在哪里」。runner 把 lifecycle、setup/teardown hook、批量工作的 operation、所有经 Sandbox API 发出的 shell 命令,以及每个 session/turn 的 send 墙钟包络记进 `result.json`;某轮有 OTel 时,再按 `traceId` 把 agent/model/tool span 挂到该轮下面。没有 OTel 时,phase、hook、operation、shell 与 turn 时间仍完整,只缺轮内细分。出错或超时的 Attempt 在已知的最深节点用 `✗` 标出死在哪里:
|
|
238
|
+
|
|
239
|
+
```text
|
|
240
|
+
$ niceeval show @1c3h6twx --timing
|
|
241
|
+
@1c3h6twx · fixtures/button · compare/bub-gpt-5.4 · errored
|
|
242
|
+
total 2m 4s
|
|
243
|
+
|
|
244
|
+
sandbox.queue 0.3s
|
|
245
|
+
sandbox.create 8.2s
|
|
246
|
+
sandbox.setup 21.6s
|
|
247
|
+
├─ restoreCache 18.9s
|
|
248
|
+
│ └─ shell · tar xzf … 18.8s
|
|
249
|
+
└─ setup#2 2.7s
|
|
250
|
+
└─ shell · pnpm config set … 2.7s
|
|
251
|
+
workspace.baseline 0.2s
|
|
252
|
+
└─ shell · git init && git commit … 0.2s
|
|
253
|
+
agent.setup 41.5s
|
|
254
|
+
├─ shell · npm install -g @openai/codex… 39.8s
|
|
255
|
+
└─ shell · write ~/.codex/config.toml 1.7s
|
|
256
|
+
eval.run 50.9s
|
|
257
|
+
└─ turn s1/t1 50.9s ✗ agent-runtime-error
|
|
258
|
+
└─ shell · codex exec … 50.7s
|
|
259
|
+
├─ agent · codex.exec 50.5s OTel
|
|
260
|
+
└─ model · chat 44.2s OTel
|
|
261
|
+
|
|
262
|
+
teardown (not counted in total):
|
|
263
|
+
agent.teardown 0.4s
|
|
264
|
+
sandbox.teardown 3.1s
|
|
265
|
+
└─ persistCache 3.1s
|
|
266
|
+
└─ shell · tar czf … 3.0s
|
|
267
|
+
sandbox.stop 1.2s
|
|
268
|
+
```
|
|
269
|
+
|
|
270
|
+
收尾阶段不计入 Attempt 总耗时,单独分组列出——「判定早就出了、进程还在等收尾」这类问题看这一组。缩进表示包含关系,不表示子项可以相加:命令、turn 和 OTel span 都可能嵌套或并发。
|
|
271
|
+
|
|
272
|
+
裸 `--timing` 会完整列出 phase,并把 phase 下的细节控制在 80 个节点内。超过上限时,它优先保留失败路径、最慢节点与首尾时序,在省略位置显示节点数、未展示的失败数,并给出 `--timing=full`。小树中两种模式输出相同;`--timing=full` 不设节点上限,适合审计旧结果或把完整树重定向到文件。NiceEval 不自动启动 pager,因此管道、CI 和 coding agent 不会等待键盘输入。命令可能并发,省略行不会把子节点耗时相加。
|
|
273
|
+
|
|
274
|
+
operation 的名称由执行这段工作的组件在采集时写入。例如一次 workspace diff 导出可以显示成 `export workspace diff · 1 window · 3,302 files`,下面只有一条真实的批量 shell。展示层不会解析 `git show` 等命令文本、猜出一个 `git show ×N` 分组;如果旧 artifact 确实记录了几千次调用,默认模式有界摘要,`--timing=full` 仍能逐条核对。一次超时到底是 Sandbox 创建慢、某条安装命令慢,还是一轮里的模型/工具慢,`--timing` 一眼可判。旧结果或第三方写入的结果没有阶段数据时,两种模式都如实提示 `phase timing unavailable`。
|
|
275
|
+
|
|
234
276
|
`--diff` 默认给文件级摘要(落盘的 diff 只有改动后的全文,没有基线可比对增删行数,所以每个改动过的文件都标 `M`、后面跟它现在的行数,不区分新建与修改);看单个文件的完整内容用 `--diff=<文件路径>`——路径必须用 `=` 连写,位置参数永远留给 eval id 前缀 / `@<locator>`:
|
|
235
277
|
|
|
236
278
|
```text
|
|
@@ -255,12 +297,12 @@ $ niceeval show @1c3h6twx --diff=src/components/Button.tsx
|
|
|
255
297
|
2. 运行 niceeval show <eval-id>,读取该题各 experiment 的判定、默认 attempt 的断言明细,
|
|
256
298
|
以及每行末尾的 @<locator>。
|
|
257
299
|
3. 运行 niceeval show @<locator>,看紧凑全景确认这次 Attempt 实际捕获到了哪些证据。
|
|
258
|
-
4. 按问题选择 --eval、--execution 或 --diff;可以同时传多个证据 flag。
|
|
300
|
+
4. 按问题选择 --eval、--execution、--timing 或 --diff;可以同时传多个证据 flag。
|
|
259
301
|
5. 输出被截断时,读取末尾标出的 sources.json、events.json、trace.json 或 diff.json 原始路径。
|
|
260
302
|
6. 修复后重跑该 eval,再用 niceeval show <eval-id> 验证新的 @<locator>;收工前用 --force 全量重跑确认整体结果。
|
|
261
303
|
```
|
|
262
304
|
|
|
263
|
-
`--eval` 回答“这道题实际检查了什么、哪条断言为什么过或没过”,`--execution` 回答“agent
|
|
305
|
+
`--eval` 回答“这道题实际检查了什么、哪条断言为什么过或没过”,`--execution` 回答“agent 做了什么、调用了什么”(可关联时附 OTel 时间),`--timing` 回答“整个 Attempt 的时间花在哪里”,`--diff` 回答“沙箱里的文件实际改成了什么”。先按问题选证据,不需要每次把四份都读完。
|
|
264
306
|
|
|
265
307
|
### 历史与抖动:`--history`
|
|
266
308
|
|
|
@@ -293,9 +335,9 @@ npx niceeval view
|
|
|
293
335
|
失败后立刻运行 `npx niceeval view`,可以直接打开刚刚那次运行的 artifacts。
|
|
294
336
|
</Tip>
|
|
295
337
|
|
|
296
|
-
`view` 的首页是一份报告:不传 `--report`
|
|
338
|
+
`view` 的首页是一份报告:不传 `--report` 时完整加载当前结果并显示全部可比组索引,选中一组后只显示该组的成本 × 端到端成功率散点图与实验表。切组只改变页面状态,不重新读取或计算;不同组不会混进同一张图或榜单。浏览器禁用 JS 时,每组作为独立的 `<details>` 完整可读;启用 JS 后一次聚焦一组。传了 `--report` 就换成你自己的报告(与 `show --report` 吃同一个文件),见[自定义报告](/zh/guides/custom-reports)。证据部分(Attempt 弹窗、transcript、trace 瀑布、run 列表)始终保留。
|
|
297
339
|
|
|
298
|
-
|
|
340
|
+
网页版多几样浏览操作:切换可比组、点表头就地排序、在当前组的过滤框里筛行、点开一个 experiment 行看它每道题的判定与原因、悬停散点看数值——这些只影响眼前的视图,不改判定口径,刷新即恢复。Attempt 弹窗里有与 `show --timing` 同源的统一时间树:Sandbox 启动、setup hook 及其 shell、agent 安装命令、每轮 send 与可关联的 OTel model/tool、评分与收尾都能逐层展开。报告上方有 **Copy fix prompt** 按钮,把全部失败打包成可直接粘给 coding agent 的修复 prompt(attempt 弹窗里有单条版)。报告文案有中英两份,随界面语言切换。
|
|
299
341
|
|
|
300
342
|
## 导出与静态托管
|
|
301
343
|
|
|
@@ -318,7 +360,7 @@ NiceEval 写入 `<dir>/index.html`,并把查看器要读取的 artifact(`sou
|
|
|
318
360
|
- `diff.json` 和 `o11y.json` 不会被复制。查看器不读取它们,且 diff 可能达到上百 MB。
|
|
319
361
|
- 用 `file://` 直接打开 `index.html` 时浏览器不允许 fetch artifact,代码视图会提示源码不可用。本地预览用 http 服务打开。
|
|
320
362
|
|
|
321
|
-
最简单的流程是在跑过 eval 的机器上导出,把产物目录直接部署,不需要额外步骤。要让站点随 push
|
|
363
|
+
最简单的流程是在跑过 eval 的机器上导出,把产物目录直接部署,不需要额外步骤。要让站点随 push 自动更新,先用 `copySnapshots` 生成经过单文件预算检查的发布结果根,把它提交进仓库,再让 CI 对这个目录运行 `view --run <目录> --out`——workflow 与平台接线见[通过 CI 发布报告](/zh/guides/publish-report)。
|
|
322
364
|
|
|
323
365
|
## Artifact 说明
|
|
324
366
|
|
|
@@ -328,7 +370,7 @@ NiceEval 写入 `<dir>/index.html`,并把查看器要读取的 artifact(`sou
|
|
|
328
370
|
|
|
329
371
|
### `result.json`
|
|
330
372
|
|
|
331
|
-
单个
|
|
373
|
+
单个 Attempt 的权威记录:判定、断言、正式阶段耗时、结构化 error、去重后的 diagnostics、用量和成本。cleanup、teardown 与 Sandbox stop 完成后一次写成,之后不再改写。`progress` 的短期 message/current/total 不落盘。
|
|
332
374
|
|
|
333
375
|
### `events.json`
|
|
334
376
|
|
|
@@ -344,7 +386,7 @@ eval 源码位置和断言位置,用于查看器把失败断言对应回代码
|
|
|
344
386
|
|
|
345
387
|
### `trace.json`
|
|
346
388
|
|
|
347
|
-
OTLP trace 或标准化后的 span
|
|
389
|
+
OTLP trace 或标准化后的 span 数据。它是可选的执行关系和耗时证据,不是错误存储:沙箱创建(`sandbox.create`)可能早于 telemetry,teardown 可能晚于 trace collect。
|
|
348
390
|
|
|
349
391
|
### `o11y.json`
|
|
350
392
|
|
|
@@ -365,6 +407,7 @@ Soft 断言的分数记录在 `assertions[].score` 里;非 `--strict` 模式
|
|
|
365
407
|
|
|
366
408
|
- 榜单里失败/错误的题每条自带下钻命令:`niceeval show <eval id>` 先看断言明细,行尾的 `@<locator>` 可以直接精确下钻到某一次 Attempt。
|
|
367
409
|
- 想知道 eval 实际检查了什么、断言为什么过或没过,看 `--eval`(标回源码行的断言标注)。
|
|
368
|
-
- 想知道 agent
|
|
410
|
+
- 想知道 agent 做了什么、调用了什么,看 `--execution`;关联成功的 OTel 时间会贴在同一事件旁。
|
|
369
411
|
- coding-agent 失败时看 `--diff` 和 `--execution` 里的工具调用;两者结合能看出「改错了文件」还是「压根没调用该调用的工具」。
|
|
412
|
+
- Sandbox eval 跑得慢或超时,先看 `--timing`:排队、Sandbox 启动、setup hook 里的每条 shell、agent 安装命令、每轮 send 与可关联的 OTel model/tool 各花多久,一眼可判;收尾卡住也在这里单独列出。
|
|
370
413
|
- 判断缺陷在被测程序还是 eval 本身、修完怎么重跑,流程见 [Agent 反馈闭环](/zh/guides/agent-feedback-loop)。
|
|
@@ -104,7 +104,7 @@ npx niceeval exp prompt-variants/concise
|
|
|
104
104
|
| `timeoutMs` | 单个 attempt 的超时 |
|
|
105
105
|
| `budget` | 这一格配置的预算上限 |
|
|
106
106
|
| `maxConcurrency` | 这一格配置的并发上限 |
|
|
107
|
-
| `sandbox` | sandbox agent
|
|
107
|
+
| `sandbox` | sandbox agent 使用的 provider,如 `dockerSandbox()` / `e2bSandbox()`;spec 上可以链 `.setup()` / `.teardown()` 挂按实验变化的环境钩子 |
|
|
108
108
|
|
|
109
109
|
Experiment 本身是纯配置数据,没有 `setup` / `teardown` 这类字段。要在跑 agent 前按实验准备环境(装二进制、预热、跨 attempt 载入和回存状态),挂在 `sandbox` 字段的 spec 上:
|
|
110
110
|
|
|
@@ -112,12 +112,14 @@ Experiment 本身是纯配置数据,没有 `setup` / `teardown` 这类字段
|
|
|
112
112
|
export default defineExperiment({
|
|
113
113
|
agent: codexAgent({ mcpServers: [mempalMcp] }),
|
|
114
114
|
sandbox: e2bSandbox({ template: "fasteval-agents" })
|
|
115
|
-
.setup(mempalSetup("codex")) //
|
|
115
|
+
.setup(mempalSetup("codex")) // 预检、写动态配置、预热、载入状态
|
|
116
116
|
.teardown(mempalTeardown("codex")), // 回存状态
|
|
117
117
|
maxConcurrency: 1, // 载入和回存之间不能并发,声明串行
|
|
118
118
|
});
|
|
119
119
|
```
|
|
120
120
|
|
|
121
|
-
|
|
121
|
+
固定的 Agent CLI、系统包和大模型缓存应先做进 image/template/snapshot;`.setup()` 不应在每个 Attempt 重建同一套环境。如何从官方 Docker 镜像、E2B 模板或 Vercel runtime 继续派生来提速,见 [沙箱 provider · 从官方基线继续构建以提速](/zh/guides/sandbox-providers#从官方基线继续构建以提速)。
|
|
122
|
+
|
|
123
|
+
钩子的执行时机、多钩子顺序和失败语义见 [沙箱 provider · 环境钩子](/zh/guides/sandbox-providers#环境钩子)。
|
|
122
124
|
|
|
123
125
|
跨配置比较的设计建议见[实验矩阵](/zh/guides/experiments)。adapter 如何消费 `ctx.model` 和 `ctx.flags` 见[Adapter](/zh/concepts/adapter)。
|
|
@@ -6,10 +6,11 @@ description: "手写 Adapter 的 send 函数,一条主线七步走:发消息
|
|
|
6
6
|
|
|
7
7
|
[Adapter](/zh/concepts/adapter) 讲了契约:`send` 传入 `TurnInput` 和 `AgentContext`,返回 `Turn`。这一页讲怎么写它——从"发一条消息拿到回复"的最小形态起步,一步一步加到完整接入。每一步只在上一步的代码上多几行,前面已有的部分在代码里用 `// ……省略` 标出;每一步末尾说明这几行解锁了哪些断言。改完任何一步都能立刻验证:把新解锁的断言写进一条 eval 重跑 `npx niceeval exp`,`niceeval view` 里能看到这一步新增的数据——多轮轨迹、用量、工具事件、待回答请求。
|
|
8
8
|
|
|
9
|
-
|
|
9
|
+
三个贯穿全文的原则:
|
|
10
10
|
|
|
11
11
|
- **接的位置永远是用户前端本来就在用的那个接口。** 页面调哪个端点、收什么格式,Adapter 就调哪个端点、收什么格式——不为 eval 开新接口,也不 import 应用内部代码直调函数(为什么,见[接入你的 Agent](/zh/guides/connect-your-agent))。
|
|
12
12
|
- **你唯一真正手写的是 transport**——URL、鉴权、请求体每家本来就不一样。解析(原始返回 → 标准事件流)有官方转换器,从 `niceeval/adapter` 导出;编排(会话续接、HITL 暂停恢复)的状态槽就挂在 `ctx.session` 上,取用即可,不需要额外声明什么。
|
|
13
|
+
- **运行反馈走 `ctx`,不直接写终端。** 长步骤用 `ctx.progress(...)`;需要在运行后回顾的退化或异常上下文用 `ctx.diagnostic(...)`;无法继续时抛错。不要从 Adapter 调用 `console.log/error` 或写 `process.stdout/stderr`。
|
|
13
14
|
|
|
14
15
|

|
|
15
16
|
|
|
@@ -38,6 +39,7 @@ const BASE_URL = "http://localhost:8080"; // 要按 experiment 切换地址,
|
|
|
38
39
|
export default defineAgent({
|
|
39
40
|
name: "chat-app",
|
|
40
41
|
async send(input, ctx) {
|
|
42
|
+
ctx.progress({ message: "等待 Chat API" });
|
|
41
43
|
const res = await fetch(`${BASE_URL}/v1/chat/completions`, { // ← 前端本来就在用的接口
|
|
42
44
|
method: "POST",
|
|
43
45
|
headers: { "content-type": "application/json" },
|
|
@@ -56,6 +58,20 @@ export default defineAgent({
|
|
|
56
58
|
});
|
|
57
59
|
```
|
|
58
60
|
|
|
61
|
+
如果接口返回了可继续处理、但证据不完整的响应,报告 diagnostic 而不是把原始响应全部打印出来:
|
|
62
|
+
|
|
63
|
+
```ts
|
|
64
|
+
if (!res.requestId) {
|
|
65
|
+
ctx.diagnostic({
|
|
66
|
+
code: "missing-request-id",
|
|
67
|
+
level: "warning",
|
|
68
|
+
message: "响应没有 request id,无法与服务端日志关联",
|
|
69
|
+
});
|
|
70
|
+
}
|
|
71
|
+
```
|
|
72
|
+
|
|
73
|
+
`progress` 不落盘;diagnostic 会随 Attempt 保存并可通过 locator 回顾。HTTP 连接失败或响应无法解析时直接抛错,runner 会记录错误发生在 `agent.run`,并把 Attempt 标为 `errored`。
|
|
74
|
+
|
|
59
75
|
**这一步解锁**:`t.reply`、`t.messageIncludes()`、judge 的全部对话材料,以及 experiment 侧的**模型对比**(`ctx.model` 就是 experiment 声明的 `model`,运行器原样递给你、Adapter 不解释含义,只转发——不需要等到后面的步骤,也不需要应用配合做任何改造,分档见 [Tier](/zh/concepts/tier))。
|
|
60
76
|
|
|
61
77
|
它有两个明显的局限:每轮都是一场全新对话(第二次 `t.send` 接不上第一次),工具调用完全看不见。后面两步各解决一个。
|
package/docs-site/zh/index.mdx
CHANGED
|
@@ -166,7 +166,7 @@ READ https://raw.githubusercontent.com/CorrectRoadH/niceeval/refs/heads/main/doc
|
|
|
166
166
|
|
|
167
167
|
<AccordionGroup>
|
|
168
168
|
<Accordion title="需要注册账号吗?">
|
|
169
|
-
不需要。跑 eval 和 `niceeval view` 看报告全在本地完成;只有被测对象本身是需要隔离工作区的 coding agent 时,才会用到 Docker 或 E2B 这类 sandbox
|
|
169
|
+
不需要。跑 eval 和 `niceeval view` 看报告全在本地完成;只有被测对象本身是需要隔离工作区的 coding agent 时,才会用到 Docker 或 E2B 这类 sandbox provider。
|
|
170
170
|
</Accordion>
|
|
171
171
|
<Accordion title="我的 Agent 不是用 TypeScript / JavaScript 写的,能接吗?">
|
|
172
172
|
能。Adapter 只是对着应用本来暴露的接口(HTTP、gRPC、WebSocket 都行)收发;应用本身用什么语言写、部署在哪里,[NiceEval](https://niceeval.com/) 不关心,见 [Adapter](/zh/concepts/adapter)。
|
|
@@ -112,6 +112,19 @@ plugins?: ClaudeCodePluginSpec[];
|
|
|
112
112
|
|
|
113
113
|
Claude Code 原生 Plugin(先连 Marketplace,再从中装指定 Plugin)。
|
|
114
114
|
|
|
115
|
+
#### `settingsFile`
|
|
116
|
+
|
|
117
|
+
```ts
|
|
118
|
+
settingsFile?: string;
|
|
119
|
+
```
|
|
120
|
+
|
|
121
|
+
一份完整的 Claude Code `settings.json`(官方格式)在本地项目里的路径 —— 相对运行
|
|
122
|
+
niceeval 的项目根(含 `niceeval.config.ts` 的目录)解析,不是 Sandbox 内路径;只接受
|
|
123
|
+
项目根内的相对路径,包含 `..` 的路径、绝对路径、`~` 路径和解析后逃出项目根的符号链接
|
|
124
|
+
都在 setup 阶段报错。原始字节原样上传为沙箱里原本为空的用户级 `~/.claude/settings.json`
|
|
125
|
+
(不继承宿主机配置、不拼接、不重新序列化);保留键 `model` 与 `env` 出现在文件里
|
|
126
|
+
setup 报错。manifest 只记项目相对路径与字节 SHA-256,不落正文。
|
|
127
|
+
|
|
115
128
|
### `CodexConfig`
|
|
116
129
|
|
|
117
130
|
#### `apiKey`
|
|
@@ -157,6 +170,20 @@ plugins?: CodexPluginSpec[];
|
|
|
157
170
|
|
|
158
171
|
Codex 原生 Plugin(先连 Marketplace,再从中装指定 Plugin)。
|
|
159
172
|
|
|
173
|
+
#### `configFile`
|
|
174
|
+
|
|
175
|
+
```ts
|
|
176
|
+
configFile?: string;
|
|
177
|
+
```
|
|
178
|
+
|
|
179
|
+
一份完整的 Codex `config.toml`(官方 TOML 格式)在本地项目里的路径 —— 相对运行
|
|
180
|
+
niceeval 的项目根(含 `niceeval.config.ts` 的目录)解析,不是 Sandbox 内路径;只接受
|
|
181
|
+
项目根内的相对路径,包含 `..` 的路径、绝对路径、`~` 路径和解析后逃出项目根的符号链接
|
|
182
|
+
都在 setup 阶段报错。原始字节原样并入沙箱里原本为空的用户级 `~/.codex/config.toml`
|
|
183
|
+
(不继承宿主机配置、不解析后重写);保留键 `model`、`model_provider`、`model_providers`、
|
|
184
|
+
`model_reasoning_effort`、`mcp_servers`、`otel` 出现在文件里 setup 报错。manifest 只记
|
|
185
|
+
项目相对路径与字节 SHA-256,不落正文。
|
|
186
|
+
|
|
160
187
|
### `BubConfig`
|
|
161
188
|
|
|
162
189
|
#### `apiKey`
|
|
@@ -22,13 +22,13 @@ description: "NiceEval 怎么知道你的 adapter 做到了什么:没有声明
|
|
|
22
22
|
|
|
23
23
|
## 为什么没有声明这一层
|
|
24
24
|
|
|
25
|
-
|
|
25
|
+
NiceEval 不设 `capabilities: { conversation, toolObservability }` 这类布尔声明层来补"代码证明不了的部分",因为这类声明承诺的事情本身就不该由声明来担保:
|
|
26
26
|
|
|
27
27
|
- **构造即证明**:用了 `defineSandboxAgent`,说明被测对象在沙箱里改文件——不需要再声明一遍 `workspace: true`。
|
|
28
28
|
- **字段即证明**:写了 `tracing`(怎么把 OTLP 端点交给 CLI),tracing 就成立。字段本身就是使用凭证,不需要旁边再放一个布尔值重复一遍。
|
|
29
29
|
- **来源即证明**:`fromAiSdk(result)` 消费的 `result.steps` 是 AI SDK 契约保证的**全量**工具循环记录,返回值自带"事件流完整"的证明;内置 CLI 的 parser 同理。手工映射时,事件完不完整取决于你的映射代码写没写全——这不是一个可以靠声明担保的东西,声明了也不会让代码更完整。
|
|
30
30
|
- **行为即证明**:HITL 没有能力位——`send` 返回 `status: "waiting"` + `input.requested` 事件,行为本身可见。
|
|
31
|
-
-
|
|
31
|
+
- **接了就续得上**:会话续接没有"声明了才有"的开关。`ctx.session` 一直都在;用了 `id`/`capture` 或 `history` 存取器就会续接上下文,不用就每轮都是全新会话——两种都是正常状态,都不会报错,区别只在你的 adapter 实际怎么写。
|
|
32
32
|
|
|
33
33
|
```ts
|
|
34
34
|
export default defineAgent({
|
|
@@ -64,7 +64,7 @@ npx niceeval exp compare-models weather
|
|
|
64
64
|
|
|
65
65
|
## 常用 flags
|
|
66
66
|
|
|
67
|
-
下表由 CLI 的 flag 解析表生成,表外的 flag 一律按未知 flag 报错并以非零状态退出。**没有**用于选择 sandbox
|
|
67
|
+
下表由 CLI 的 flag 解析表生成,表外的 flag 一律按未知 flag 报错并以非零状态退出。**没有**用于选择 sandbox provider 的 CLI flag:sandbox provider 只能写在代码里——在 experiment(`defineExperiment`)里设置 `sandbox`,或者在 `niceeval.config.ts`(`defineConfig`)里设置作为项目级兜底,值来自 `niceeval/sandbox` 的 `dockerSandbox()` / `vercelSandbox()` / `e2bSandbox()`。
|
|
68
68
|
|
|
69
69
|
{/* GENERATED:BEGIN cli-flags */}
|
|
70
70
|
|
|
@@ -78,20 +78,27 @@ npx niceeval exp compare-models weather
|
|
|
78
78
|
| `--max-concurrency` | number | 设置同时运行的 eval 数量。 |
|
|
79
79
|
| `--timeout` | number | 单个 attempt 的超时时间,单位毫秒。 |
|
|
80
80
|
| `--budget` | number | 整次运行的预算上限(美元)。 |
|
|
81
|
+
| `--keep-sandbox` | boolean | `exp` 命令专用:跑完留下 failed/errored attempt 的沙箱现场(= `--keep-sandbox=failed`);`--keep-sandbox=all` 连 passed 也留。事后用 `niceeval sandbox list/enter/stop` 查看与销毁。 |
|
|
82
|
+
| `--all` | boolean | `sandbox stop` 专用:销毁全部留存沙箱。 |
|
|
83
|
+
| `--window` | string | `sandbox diff` 专用:只看某个 send 窗口(如 `--window s1/t2`);省略输出全部窗口的串联视图。 |
|
|
84
|
+
| `--path` | string | `sandbox diff` 专用:只看某个文件的 patch;省略输出该窗口的全部文件。 |
|
|
85
|
+
| `--leave-running` | boolean | `sandbox enter` 专用:shell 退出后让现场保持运行,不送回休眠。 |
|
|
81
86
|
| `--tag` | string | 只运行带有该 tag 的 eval(见 `defineEval` 的 `tags`)。 |
|
|
82
87
|
| `--junit` | string | 额外写一份 JUnit XML 报告到指定路径,供 CI 消费。 |
|
|
83
88
|
| `--json` | string | 额外写一份 JSON 结果(`RunSummary` 原样序列化)到指定路径,供 CI 或下游脚本消费。 |
|
|
84
89
|
| `--out` | string | `view` 命令专用:把结果查看器静态导出到指定目录。 |
|
|
85
90
|
| `--port` | number | `view` 命令专用:指定本地服务器监听端口。 |
|
|
91
|
+
| `--allow-sensitive-artifacts` | boolean | `view --out` 专用:对非发布根(快照没有 publish:{redaction:"applied"} 标记)导出时的显式确认——静态站会原样携带未消毒的证据文件。 |
|
|
86
92
|
| `--eval` | boolean | `show` 命令专用:该 attempt 运行时保存的 Eval 源码,gate/soft 断言标回源码行(证据切面)。 |
|
|
87
93
|
| `--execution` | boolean | `show` 命令专用:该 attempt 的标准执行事件流(消息、thinking、Skill load、工具调用/结果);有 OTel 时同一节点补时间(证据切面)。 |
|
|
94
|
+
| `--timing` | boolean | `show` 命令专用:整个 Attempt 的统一时间树;裸 `--timing` 给有界诊断投影,`--timing=full` 逐节点展开全部 runner/已关联 OTel 节点。 |
|
|
88
95
|
| `--diff` | boolean | `show` 命令专用:sandbox 里的文件改动摘要;`--diff=<文件路径>` 看单个文件的完整改动(路径必须 `=` 连写)。 |
|
|
89
96
|
| `--history` | boolean | `show` 命令专用:跨 run 时间轴,只列真实执行;与 `--report` 互斥。 |
|
|
90
|
-
| `--experiment` | string | `show` / `view`
|
|
97
|
+
| `--experiment` | string | `show` / `view` 命令专用:按路径段前缀收窄 experiment;组名会选中组内全部配置。 |
|
|
91
98
|
| `--run` | string | `show` / `view` 命令专用:钉死看某一个结果目录(某次快照或 `copySnapshots` 产物)。 |
|
|
92
|
-
| `--report` | string | `show` / `view`
|
|
93
|
-
| `--dry` | boolean | 只打印本次会匹配到的 eval ×
|
|
94
|
-
| `--
|
|
99
|
+
| `--report` | string | `show` / `view` 命令专用:用文件默认导出的 `defineReport(...)` 替换两者共用的默认报告。 |
|
|
100
|
+
| `--dry` | boolean | 只打印本次会匹配到的 eval × 运行配置,不实际执行(按下面 `--output` 选中的 profile 给出预览)。 |
|
|
101
|
+
| `--output` | string | 反馈 profile:`auto`(默认)按环境自动选择,`human` / `agent` / `ci` 强制指定;只改变终端展示,不改变选择、调度、判定、artifact 或退出码。`auto` 依次判定:stderr 是 TTY → human;否则 `CI`(或其它常见 CI 平台环境变量)存在 → ci;否则 → agent。 |
|
|
95
102
|
| `--force` | boolean | 忽略上次运行结果,不跳过已通过的 (experiment, eval) 组合,强制全部重跑。 |
|
|
96
103
|
| `--strict` | boolean | CI 中推荐使用:让软阈值(`soft`)失败也计入整条 eval 的 verdict。 |
|
|
97
104
|
| `--early-exit` / `--no-early-exit` | boolean | 某个 eval 的一次 attempt 通过后,停止该 eval 剩余的 attempts。 |
|
|
@@ -118,13 +125,32 @@ npx niceeval exp compare-models weather-tool
|
|
|
118
125
|
|
|
119
126
|
运行命名 experiment,用矩阵比较 agents、models 或 flags。第二个参数开始是 eval ID 前缀过滤。
|
|
120
127
|
|
|
128
|
+
`show` 与 `view` 是顶层命令,应写成 `npx niceeval show`、`npx niceeval view`。误写成 `npx niceeval exp show` / `exp view` 且没有同名 experiment 时,CLI 会在“不存在的实验”错误后提示正确命令;仓库确实存在同名 experiment 时仍按合法 id 执行。
|
|
129
|
+
|
|
130
|
+
## `--output`:human / agent / ci
|
|
131
|
+
|
|
132
|
+
`--output` 选一种终端反馈模型,只改变展示,不改变选择、调度、判定、artifact 或退出码;省略时的默认值 `auto` 按环境自动选择。三种消费者各有推荐命令:
|
|
133
|
+
|
|
134
|
+
```bash
|
|
135
|
+
# 人在 TTY 前:动态 dashboard + 永久失败/诊断行
|
|
136
|
+
npx niceeval exp compare --output human
|
|
137
|
+
|
|
138
|
+
# coding agent / 自动修复循环:低频 checkpoint + 有界 handoff block
|
|
139
|
+
npx niceeval exp compare --output agent
|
|
140
|
+
|
|
141
|
+
# CI job:单一有序 stdout 事件流 + 退出码 + JSON/JUnit
|
|
142
|
+
npx niceeval exp compare --output ci --strict --json .niceeval/ci-summary.json --junit .niceeval/junit.xml
|
|
143
|
+
```
|
|
144
|
+
|
|
145
|
+
三种 profile 的完整对比见[运行器 · Reporter](/zh/guides/runner#reporter);人在终端里怎么读 dashboard 与结束摘要见上面的[常用 flags](#常用-flags)与本页各命令示例;AI 反馈闭环的完整用法(读输出、按 locator 下钻、局部重跑)见 [AI 反馈闭环](/zh/guides/agent-feedback-loop);CI 集成(GitHub Actions、退出码、JSON/JUnit)见 [CI 集成](/zh/guides/ci-integration)。
|
|
146
|
+
|
|
121
147
|
## `view`
|
|
122
148
|
|
|
123
149
|
```bash
|
|
124
150
|
npx niceeval view
|
|
125
151
|
```
|
|
126
152
|
|
|
127
|
-
打开本地结果查看器。它和 `show` 共用同一份默认报告和同一套默认选择——对每个 experiment、每个 eval,取历次运行里最新的那份判定;只补跑部分 eval 时,其余 eval
|
|
153
|
+
打开本地结果查看器。它和 `show` 共用同一份默认报告和同一套默认选择——对每个 experiment、每个 eval,取历次运行里最新的那份判定;只补跑部分 eval 时,其余 eval 从更早的运行补齐。默认报告按 experiment id 的父目录分组,只在同组内比较。`show` 输出终端文本,`view` 输出网页并提供可交互的证据浏览;eval ID 前缀、`--experiment`、`--run` 对两者的收窄一致。完整说明见[查看结果](/zh/guides/viewing-results)。
|
|
128
154
|
|
|
129
155
|
## `show [id-prefix...]`
|
|
130
156
|
|
|
@@ -138,7 +164,7 @@ npx niceeval show fixtures/button --diff
|
|
|
138
164
|
npx niceeval show weather/brooklyn --history
|
|
139
165
|
```
|
|
140
166
|
|
|
141
|
-
`show` 是终端结果入口,适合人直接阅读,也适合 coding agent 在上下文窗口里逐级下钻。位置参数选「看哪些 eval」(ID 前缀)或直接用 `@<locator>` 精确选一个 attempt
|
|
167
|
+
`show` 是终端结果入口,适合人直接阅读,也适合 coding agent 在上下文窗口里逐级下钻。位置参数选「看哪些 eval」(ID 前缀)或直接用 `@<locator>` 精确选一个 attempt;不带位置参数时显示按实验组分区的默认比较报告,指定 eval ID 前缀只收窄报告覆盖的 Eval,不改变组边界。
|
|
142
168
|
|
|
143
169
|
`@<locator>` 不带证据 flag 时给出该 attempt 的紧凑全景(断言摘要、执行摘要、可选 OTel 时间、diff 摘要);`--eval`、`--execution`、`--diff` 是同一 attempt 的证据切面,分别展开运行时保存的 Eval 源码、标准执行事件流、工作区文件改动,因此必须搭配 `@<locator>` 精确指名一个 attempt。`--run` 钉住某次结果目录,`--history` 查看跨 run 趋势。完整的阅读顺序、输出示例和 artifact 说明见[查看结果](/zh/guides/viewing-results)。
|
|
144
170
|
|
|
@@ -92,6 +92,14 @@ name: string;
|
|
|
92
92
|
|
|
93
93
|
agent 的显示名/标识,原样进入 `Agent.name`——不是注册表查找 key,只用于展示、结果归属与去重指纹。
|
|
94
94
|
|
|
95
|
+
#### `coverage`
|
|
96
|
+
|
|
97
|
+
```ts
|
|
98
|
+
coverage?: EvidenceCoverage;
|
|
99
|
+
```
|
|
100
|
+
|
|
101
|
+
该 Adapter 的常态证据覆盖声明(完整采集的用 `completeCoverage` 常量);省略 = 全通道 unknown。
|
|
102
|
+
|
|
95
103
|
#### `setup`
|
|
96
104
|
|
|
97
105
|
```ts
|
|
@@ -145,6 +153,14 @@ name: string;
|
|
|
145
153
|
|
|
146
154
|
agent 的显示名/标识,原样进入 `Agent.name`——不是注册表查找 key,只用于展示、结果归属与去重指纹。
|
|
147
155
|
|
|
156
|
+
#### `coverage`
|
|
157
|
+
|
|
158
|
+
```ts
|
|
159
|
+
coverage?: EvidenceCoverage;
|
|
160
|
+
```
|
|
161
|
+
|
|
162
|
+
该 Adapter 的常态证据覆盖声明(完整采集的用 `completeCoverage` 常量);省略 = 全通道 unknown。
|
|
163
|
+
|
|
148
164
|
#### `setup`
|
|
149
165
|
|
|
150
166
|
```ts
|
|
@@ -268,16 +284,35 @@ spread 进 send;file-based 的在 tracing.configure 里写配置。远程 HTTP
|
|
|
268
284
|
只需要把 headers spread 进请求头(每轮一个新 traceparent);端点是启动期配置
|
|
269
285
|
(defineConfig({ telemetry: { port } }))固定的,不从这里传。
|
|
270
286
|
|
|
287
|
+
#### `progress`
|
|
288
|
+
|
|
289
|
+
```ts
|
|
290
|
+
progress(update: ProgressUpdate): void;
|
|
291
|
+
```
|
|
292
|
+
|
|
293
|
+
作用域反馈:报告此刻正在做什么(turn / tool / 安装进度)。短命状态——Human profile
|
|
294
|
+
更新 active 行,`agent`/`ci` 不逐条打印,也不进最终结果;不要每个 token/delta 都调用。
|
|
295
|
+
runner 按当前回调所处的生命周期阶段(agent.setup / agent.run / agent.teardown)归因,
|
|
296
|
+
调用方不能冒充其它阶段(见 docs/feature/experiments/library.md)。
|
|
297
|
+
|
|
298
|
+
#### `diagnostic`
|
|
299
|
+
|
|
300
|
+
```ts
|
|
301
|
+
diagnostic(input: DiagnosticInput): void;
|
|
302
|
+
```
|
|
303
|
+
|
|
304
|
+
作用域反馈:报告运行结束后仍应保留的问题(协议降级、数据不完整、cleanup 问题)。
|
|
305
|
+
永久事件,落进 attempt 的 diagnostics 并进各 profile 的永久输出;`dedupeKey` 去重。
|
|
306
|
+
即使 level 为 "error" 也不改变 Turn.status / verdict——无法继续时抛异常。
|
|
307
|
+
|
|
271
308
|
#### `log`
|
|
272
309
|
|
|
273
310
|
```ts
|
|
274
311
|
log(msg: string): void;
|
|
275
312
|
```
|
|
276
313
|
|
|
277
|
-
|
|
278
|
-
|
|
279
|
-
与 `Sandbox.appendLog` 是两回事:那个是把一行写进容器自己的原生日志
|
|
280
|
-
(`docker logs` 能看到),这里只是运行器的观测通道。
|
|
314
|
+
`progress({ message: msg })` 的别名,不是第二条通道(见 docs/feature/experiments/cli.md
|
|
315
|
+
「Attempt 阶段」)。超时失败时最近若干行会并入结果的 error 信息,方便定位卡在哪一步。
|
|
281
316
|
|
|
282
317
|
{/* GENERATED:END agent-def */}
|
|
283
318
|
|
|
@@ -458,6 +493,24 @@ stream?: boolean;
|
|
|
458
493
|
日志里看到 agent 的【原始输出】。provider 各自实现(docker:tee 到 PID1 tail 的文件;
|
|
459
494
|
不支持的 provider 忽略)—— 日志怎么浮现是 provider 的事,adapter 只声明意图。
|
|
460
495
|
|
|
496
|
+
#### `onStdout`
|
|
497
|
+
|
|
498
|
+
```ts
|
|
499
|
+
onStdout?: (chunk: string) => void | Promise<void>;
|
|
500
|
+
```
|
|
501
|
+
|
|
502
|
+
命令 stdout 每到一块就调用一次。回调只用于运行中的短命反馈;完整 stdout 仍会原样
|
|
503
|
+
出现在返回的 `CommandResult` 里。provider 不支持真流时,至少会在命令结束后按完整
|
|
504
|
+
stdout 调用一次,不能静默丢掉。
|
|
505
|
+
|
|
506
|
+
#### `onStderr`
|
|
507
|
+
|
|
508
|
+
```ts
|
|
509
|
+
onStderr?: (chunk: string) => void | Promise<void>;
|
|
510
|
+
```
|
|
511
|
+
|
|
512
|
+
`onStdout` 的 stderr 对应物;完整 stderr 仍保留在 `CommandResult`。
|
|
513
|
+
|
|
461
514
|
#### `root`
|
|
462
515
|
|
|
463
516
|
```ts
|
|
@@ -106,4 +106,4 @@ pricing?: Record<string, PriceOverride>;
|
|
|
106
106
|
|
|
107
107
|
{/* GENERATED:END config-fields */}
|
|
108
108
|
|
|
109
|
-
[NiceEval](https://niceeval.com/) 把环境准备放在普通代码里:eval 自己需要的文件写在 `test(t)`,agent 自己的准备写在 adapter 的 `setup`。sandbox
|
|
109
|
+
[NiceEval](https://niceeval.com/) 把环境准备放在普通代码里:eval 自己需要的文件写在 `test(t)`,agent 自己的准备写在 adapter 的 `setup`。sandbox provider 只来自代码里的 `sandbox` 字段,不做环境变量自动探测,也没有对应的 CLI flag——用 `niceeval/sandbox` 里的 `dockerSandbox()` / `vercelSandbox()` / `e2bSandbox()` 构造后填进 `sandbox` 字段(可以直接写在 experiment 上,也可以只写在这里作为项目级兜底:`exp.sandbox ?? config.sandbox`)。
|