niceeval 0.6.1 → 0.6.2

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (296) hide show
  1. package/dist/agents/types.d.ts +67 -5
  2. package/dist/context/types.d.ts +32 -12
  3. package/dist/i18n/en.d.ts +54 -0
  4. package/dist/i18n/zh-CN.d.ts +55 -1
  5. package/dist/o11y/types.d.ts +16 -2
  6. package/dist/report/aggregate.d.ts +5 -3
  7. package/dist/report/aggregate.js +32 -5
  8. package/dist/report/built-ins/experiment-comparison.d.ts +39 -1
  9. package/dist/report/built-ins/experiment-comparison.js +116 -10
  10. package/dist/report/built-ins/index.d.ts +1 -0
  11. package/dist/report/built-ins/index.js +1 -1
  12. package/dist/report/components.d.ts +8 -2
  13. package/dist/report/components.js +3 -3
  14. package/dist/report/compute.d.ts +11 -18
  15. package/dist/report/compute.js +54 -34
  16. package/dist/report/flag.d.ts +16 -1
  17. package/dist/report/flag.js +19 -1
  18. package/dist/report/format.d.ts +16 -8
  19. package/dist/report/format.js +27 -12
  20. package/dist/report/index.d.ts +4 -3
  21. package/dist/report/index.js +5 -4
  22. package/dist/report/locale.d.ts +11 -2
  23. package/dist/report/locale.js +23 -5
  24. package/dist/report/metrics.d.ts +13 -1
  25. package/dist/report/metrics.js +65 -14
  26. package/dist/report/primitives.d.ts +6 -0
  27. package/dist/report/react/AttemptList.d.ts +2 -2
  28. package/dist/report/react/AttemptList.js +5 -6
  29. package/dist/report/react/EvalList.d.ts +1 -1
  30. package/dist/report/react/EvalList.js +0 -0
  31. package/dist/report/react/ExperimentComparison.d.ts +8 -0
  32. package/dist/report/react/ExperimentComparison.js +11 -0
  33. package/dist/report/react/ExperimentList.d.ts +2 -1
  34. package/dist/report/react/ExperimentList.js +8 -10
  35. package/dist/report/react/MetricScatter.js +5 -11
  36. package/dist/report/react/chart-math.d.ts +23 -6
  37. package/dist/report/react/chart-math.js +71 -19
  38. package/dist/report/react/fixtures.d.ts +3 -3
  39. package/dist/report/react/fixtures.js +21 -14
  40. package/dist/report/report.d.ts +5 -1
  41. package/dist/report/report.js +6 -2
  42. package/dist/report/text/faces.d.ts +1 -1
  43. package/dist/report/text/faces.js +42 -41
  44. package/dist/report/text/table.js +36 -5
  45. package/dist/report/types.d.ts +39 -21
  46. package/dist/results/types.d.ts +11 -0
  47. package/dist/runner/feedback/sink.d.ts +110 -0
  48. package/dist/runner/types.d.ts +513 -22
  49. package/dist/sandbox/docker.d.ts +23 -2
  50. package/dist/sandbox/e2b.d.ts +15 -1
  51. package/dist/sandbox/errors.d.ts +30 -3
  52. package/dist/sandbox/io-retry.d.ts +17 -0
  53. package/dist/sandbox/registry.d.ts +2 -0
  54. package/dist/sandbox/resolve.d.ts +18 -5
  55. package/dist/sandbox/retry.d.ts +11 -1
  56. package/dist/sandbox/types.d.ts +39 -5
  57. package/dist/sandbox/vercel.d.ts +7 -1
  58. package/dist/scoring/coverage.d.ts +30 -0
  59. package/dist/scoring/display.d.ts +21 -0
  60. package/dist/scoring/display.js +120 -0
  61. package/dist/scoring/types.d.ts +103 -20
  62. package/dist/shared/aggregate.d.ts +1 -0
  63. package/dist/shared/aggregate.js +3 -3
  64. package/dist/shared/types.d.ts +28 -0
  65. package/dist/tty-line.d.ts +0 -4
  66. package/dist/util.d.ts +23 -0
  67. package/docs-site/zh/concepts/adapter.mdx +22 -4
  68. package/docs-site/zh/concepts/experiment.mdx +1 -1
  69. package/docs-site/zh/concepts/overview.mdx +6 -6
  70. package/docs-site/zh/guides/agent-feedback-loop.mdx +28 -26
  71. package/docs-site/zh/guides/authoring.mdx +33 -0
  72. package/docs-site/zh/guides/ci-integration.mdx +23 -12
  73. package/docs-site/zh/guides/connect-your-agent.mdx +29 -3
  74. package/docs-site/zh/guides/custom-reports.mdx +29 -34
  75. package/docs-site/zh/guides/dataset-fanout.mdx +25 -3
  76. package/docs-site/zh/guides/debug-sandbox.mdx +57 -0
  77. package/docs-site/zh/guides/debugging.mdx +210 -0
  78. package/docs-site/zh/guides/experiments.mdx +10 -3
  79. package/docs-site/zh/guides/official-adapters.mdx +26 -2
  80. package/docs-site/zh/guides/publish-report.mdx +30 -16
  81. package/docs-site/zh/guides/report-components.mdx +42 -30
  82. package/docs-site/zh/guides/reporters.mdx +2 -2
  83. package/docs-site/zh/guides/results-data.mdx +17 -9
  84. package/docs-site/zh/guides/runner.mdx +17 -7
  85. package/docs-site/zh/guides/sandbox-agent.mdx +56 -7
  86. package/docs-site/zh/guides/sandbox-providers.mdx +257 -9
  87. package/docs-site/zh/guides/scoring-guide.mdx +4 -4
  88. package/docs-site/zh/guides/viewing-results.mdx +79 -36
  89. package/docs-site/zh/guides/write-experiment.mdx +5 -3
  90. package/docs-site/zh/guides/write-send.mdx +17 -1
  91. package/docs-site/zh/index.mdx +1 -1
  92. package/docs-site/zh/reference/builtin-agents.mdx +27 -0
  93. package/docs-site/zh/reference/capabilities.mdx +2 -2
  94. package/docs-site/zh/reference/cli.mdx +33 -7
  95. package/docs-site/zh/reference/define-agent.mdx +57 -4
  96. package/docs-site/zh/reference/define-config.mdx +1 -1
  97. package/docs-site/zh/reference/define-eval.mdx +42 -9
  98. package/docs-site/zh/reference/expect.mdx +26 -1
  99. package/package.json +5 -1
  100. package/src/agents/ai-sdk-otel.test.ts +1 -0
  101. package/src/agents/ai-sdk.test.ts +3 -0
  102. package/src/agents/ai-sdk.ts +3 -0
  103. package/src/agents/bub-install-spec.test.ts +34 -0
  104. package/src/agents/bub-install-spec.ts +32 -0
  105. package/src/agents/bub.ts +31 -32
  106. package/src/agents/claude-code.test.ts +130 -9
  107. package/src/agents/claude-code.ts +76 -4
  108. package/src/agents/codex.test.ts +189 -40
  109. package/src/agents/codex.ts +155 -14
  110. package/src/agents/coding-cli-versions.test.ts +15 -0
  111. package/src/agents/coding-cli-versions.ts +3 -0
  112. package/src/agents/index.ts +11 -0
  113. package/src/agents/langgraph.test.ts +204 -0
  114. package/src/agents/langgraph.ts +495 -0
  115. package/src/agents/marketplace.ts +85 -0
  116. package/src/agents/native-config.test.ts +179 -0
  117. package/src/agents/native-config.ts +267 -0
  118. package/src/agents/openai-compat.test.ts +1 -0
  119. package/src/agents/openclaw.test.ts +31 -0
  120. package/src/agents/openclaw.ts +171 -0
  121. package/src/agents/plugin-config.test.ts +1 -0
  122. package/src/agents/sdk-streams.test.ts +79 -0
  123. package/src/agents/sdk-streams.ts +55 -10
  124. package/src/agents/skills.test.ts +1 -0
  125. package/src/agents/streaming.test.ts +3 -9
  126. package/src/agents/types.ts +68 -5
  127. package/src/agents/ui-message-stream.test.ts +3 -0
  128. package/src/cli.ts +411 -108
  129. package/src/context/context.test.ts +51 -12
  130. package/src/context/context.ts +161 -29
  131. package/src/context/session.test.ts +1 -0
  132. package/src/context/session.ts +114 -6
  133. package/src/context/types.ts +30 -12
  134. package/src/define.test.ts +13 -8
  135. package/src/define.ts +25 -4
  136. package/src/expect/index.ts +53 -23
  137. package/src/i18n/en.ts +64 -2
  138. package/src/i18n/zh-CN.ts +65 -3
  139. package/src/o11y/cost.test.ts +1 -0
  140. package/src/o11y/execution-tree.test.ts +1 -20
  141. package/src/o11y/otlp/mappers/claude-code.test.ts +1 -0
  142. package/src/o11y/otlp/parse.test.ts +1 -0
  143. package/src/o11y/otlp/turn-otel.test.ts +1 -0
  144. package/src/o11y/parsers/bub.test.ts +1 -0
  145. package/src/o11y/parsers/claude-code.test.ts +1 -34
  146. package/src/o11y/parsers/openclaw.test.ts +154 -0
  147. package/src/o11y/parsers/openclaw.ts +310 -0
  148. package/src/o11y/prices.json +746 -311
  149. package/src/o11y/tool-names.test.ts +1 -0
  150. package/src/o11y/types.ts +16 -2
  151. package/src/report/aggregate.ts +34 -5
  152. package/src/report/built-in-user-parity.test.tsx +110 -153
  153. package/src/report/built-ins/experiment-comparison.tsx +173 -13
  154. package/src/report/built-ins/index.ts +6 -1
  155. package/src/report/components.tsx +9 -3
  156. package/src/report/compute.ts +70 -40
  157. package/src/report/dual-render.test.tsx +194 -67
  158. package/src/report/flag.ts +30 -2
  159. package/src/report/format.ts +35 -11
  160. package/src/report/index.ts +22 -4
  161. package/src/report/locale.ts +25 -5
  162. package/src/report/metrics.ts +67 -14
  163. package/src/report/primitives.tsx +6 -0
  164. package/src/report/react/AttemptList.tsx +6 -31
  165. package/src/report/react/EvalList.tsx +0 -0
  166. package/src/report/react/ExperimentComparison.tsx +68 -0
  167. package/src/report/react/ExperimentList.tsx +15 -9
  168. package/src/report/react/MetricScatter.tsx +12 -14
  169. package/src/report/react/chart-math.test.ts +85 -0
  170. package/src/report/react/chart-math.ts +101 -22
  171. package/src/report/react/enhance.js +33 -1
  172. package/src/report/react/fixtures.ts +24 -17
  173. package/src/report/react/render.test.tsx +9 -64
  174. package/src/report/react/styles.css +73 -2
  175. package/src/report/report.test.ts +306 -98
  176. package/src/report/report.ts +6 -2
  177. package/src/report/text/faces.ts +47 -43
  178. package/src/report/text/table.ts +42 -5
  179. package/src/report/types.ts +41 -21
  180. package/src/results/annotated-source.test.ts +62 -9
  181. package/src/results/annotated-source.ts +64 -6
  182. package/src/results/attempt-evidence.test.ts +9 -7
  183. package/src/results/attempt-evidence.ts +15 -8
  184. package/src/results/attempt-source.ts +6 -3
  185. package/src/results/copy.ts +145 -55
  186. package/src/results/host-equivalence.test.ts +8 -6
  187. package/src/results/index.ts +2 -0
  188. package/src/results/locator.test.ts +1 -22
  189. package/src/results/open.ts +7 -1
  190. package/src/results/publish.ts +149 -0
  191. package/src/results/results.test.ts +85 -51
  192. package/src/results/truncate.ts +90 -0
  193. package/src/results/types.ts +7 -0
  194. package/src/results/writer.ts +31 -13
  195. package/src/runner/attempt.test.ts +138 -7
  196. package/src/runner/attempt.ts +603 -104
  197. package/src/runner/discover.test.ts +47 -0
  198. package/src/runner/discover.ts +36 -2
  199. package/src/runner/eval-source.test.ts +1 -27
  200. package/src/runner/feedback/agent.test.ts +504 -0
  201. package/src/runner/feedback/agent.ts +409 -0
  202. package/src/runner/feedback/ci.test.ts +562 -0
  203. package/src/runner/feedback/ci.ts +401 -0
  204. package/src/runner/feedback/coordinator.test.ts +317 -0
  205. package/src/runner/feedback/coordinator.ts +397 -0
  206. package/src/runner/feedback/failure.ts +40 -0
  207. package/src/runner/feedback/human.test.ts +616 -0
  208. package/src/runner/feedback/human.ts +535 -0
  209. package/src/runner/feedback/index.ts +66 -0
  210. package/src/runner/feedback/io.ts +78 -0
  211. package/src/runner/feedback/profile.test.ts +50 -0
  212. package/src/runner/feedback/profile.ts +58 -0
  213. package/src/runner/feedback/reducer.test.ts +395 -0
  214. package/src/runner/feedback/reducer.ts +260 -0
  215. package/src/runner/feedback/renderer.ts +82 -0
  216. package/src/runner/feedback/sink.ts +203 -0
  217. package/src/runner/feedback/testing.ts +106 -0
  218. package/src/runner/ledger.test.ts +230 -0
  219. package/src/runner/ledger.ts +329 -0
  220. package/src/runner/report.test.ts +128 -3
  221. package/src/runner/report.ts +33 -9
  222. package/src/runner/reporters/artifacts.ts +8 -2
  223. package/src/runner/reporters/braintrust.test.ts +8 -7
  224. package/src/runner/reporters/braintrust.ts +9 -2
  225. package/src/runner/reporters/index.ts +2 -2
  226. package/src/runner/reporters/json.test.ts +162 -0
  227. package/src/runner/reporters/json.ts +35 -8
  228. package/src/runner/reporters/shared.ts +1 -5
  229. package/src/runner/run.test.ts +760 -3
  230. package/src/runner/run.ts +242 -36
  231. package/src/runner/sandbox-prep.ts +3 -42
  232. package/src/runner/timing.ts +158 -0
  233. package/src/runner/types.ts +518 -22
  234. package/src/sandbox/checkpoint.test.ts +55 -0
  235. package/src/sandbox/checkpoint.ts +29 -8
  236. package/src/sandbox/cli-commands.ts +407 -0
  237. package/src/sandbox/docker.ts +115 -16
  238. package/src/sandbox/e2b-agent-template.test.ts +56 -0
  239. package/src/sandbox/e2b-agent-template.ts +94 -0
  240. package/src/sandbox/e2b.ts +74 -9
  241. package/src/sandbox/errors.ts +111 -4
  242. package/src/sandbox/index.ts +2 -0
  243. package/src/sandbox/io-retry.test.ts +58 -0
  244. package/src/sandbox/io-retry.ts +45 -0
  245. package/src/sandbox/keep-registry.test.ts +86 -0
  246. package/src/sandbox/keep-registry.ts +142 -0
  247. package/src/sandbox/keep.ts +178 -0
  248. package/src/sandbox/paths.test.ts +1 -0
  249. package/src/sandbox/paths.ts +19 -8
  250. package/src/sandbox/registry.ts +20 -3
  251. package/src/sandbox/resolve.ts +76 -11
  252. package/src/sandbox/retry.test.ts +70 -0
  253. package/src/sandbox/retry.ts +46 -4
  254. package/src/sandbox/types.ts +44 -6
  255. package/src/sandbox/vercel.ts +43 -20
  256. package/src/scoring/collector.ts +60 -17
  257. package/src/scoring/coverage.ts +95 -0
  258. package/src/scoring/diff.ts +81 -0
  259. package/src/scoring/display.test.ts +121 -0
  260. package/src/scoring/display.ts +133 -0
  261. package/src/scoring/evidence.test.ts +189 -0
  262. package/src/scoring/judge.test.ts +142 -0
  263. package/src/scoring/judge.ts +15 -18
  264. package/src/scoring/scoped.ts +217 -50
  265. package/src/scoring/types.ts +117 -20
  266. package/src/scoring/verdict.ts +16 -4
  267. package/src/shared/aggregate.ts +3 -2
  268. package/src/shared/types.ts +31 -0
  269. package/src/show/compose.ts +2 -2
  270. package/src/show/index.ts +21 -1
  271. package/src/show/render.ts +619 -104
  272. package/src/show/show.test.ts +235 -19
  273. package/src/tty-line.ts +8 -26
  274. package/src/util.test.ts +1 -0
  275. package/src/util.ts +41 -0
  276. package/src/view/app/components/AttemptModal.tsx +153 -2
  277. package/src/view/app/components/CodeView.tsx +32 -11
  278. package/src/view/app/components/CopyControls.tsx +2 -2
  279. package/src/view/app/i18n.ts +6 -0
  280. package/src/view/app/lib/attempt-route.test.ts +1 -0
  281. package/src/view/app/lib/verdict.ts +7 -9
  282. package/src/view/artifact-serving.test.ts +2 -1
  283. package/src/view/client-dist/app.css +1 -1
  284. package/src/view/client-dist/app.js +17 -17
  285. package/src/view/data.test.ts +1 -0
  286. package/src/view/data.ts +11 -1
  287. package/src/view/index.ts +11 -0
  288. package/src/view/server.ts +2 -0
  289. package/src/view/styles.css +3 -0
  290. package/src/view/view-report.test.ts +6 -5
  291. package/src/runner/reporters/console.ts +0 -70
  292. package/src/runner/reporters/live.test.ts +0 -56
  293. package/src/runner/reporters/live.ts +0 -247
  294. package/src/runner/reporters/quiet.test.ts +0 -66
  295. package/src/runner/reporters/quiet.ts +0 -49
  296. package/src/runner/reporters/table.ts +0 -277
@@ -4,29 +4,26 @@ sidebarTitle: "查看结果"
4
4
  description: "每次运行写入 .niceeval/ 的结构化 artifact 有两扇门:niceeval show 在终端用 @<locator> 精确定位一次 Attempt,逐级下钻 Eval 源码、执行记录与 diff;niceeval view 在网页看同一份证据。"
5
5
  ---
6
6
 
7
- 每次运行后,[NiceEval](https://niceeval.com/) 都会把结构化结果写入该实验的**结果快照**目录 `.niceeval/<experiment>/<快照>/`。看结果有两扇门,读的是同一批 artifact:`niceeval show` 是终端读法,人和 coding agent 都能用;`niceeval view` 是网页读法,适合人浏览证据。两扇门共用判定公式与选结果规则:对每个 experiment 的每道 eval,取时间上最新的那份判定,同一个 experiment 跨多次运行拼出来。默认首页针对媒介不同:`show` 先给可下钻的 Attempt 表,`view` 先给图表分析;传入同一个 `--report` 文件时则共用报告组件与数据口径。
7
+ 每次运行后,[NiceEval](https://niceeval.com/) 都会把结构化结果写入该实验的**结果快照**目录 `.niceeval/<experiment>/<快照>/`。看结果有两扇门,读的是同一批 artifact:`niceeval show` 是终端读法,人和 coding agent 都能用;`niceeval view` 是网页读法,适合人浏览证据。两扇门共用判定公式、选结果规则和默认报告:对每个 experiment 的每道 eval,取时间上最新的那份判定,同一个 experiment 跨多次运行拼出来;再按 experiment id 的父目录分组,只在同组内比较。`show` 输出文本面,`view` 输出网页面。
8
8
 
9
9
  ## 控制台输出
10
10
 
11
11
  ```text
12
- Discovered 3 evals
13
-
14
- classify (12ms)
15
- weather/brooklyn (456ms)
16
- ✗ api-validation (38s)
17
- - gate: expected src/routes/users.ts to include .safeParse() [FAILED]
18
-
19
- Failing:
20
- ✗ api-validation
21
- gate fileIncludes("src/routes/users.ts", ".safeParse()")
22
- niceeval show api-validation
23
-
24
- Results: 2 passed, 1 failed, 0 errored, 0 skipped
25
- Structured results: .niceeval/compare_web-agent/2026-07-09T10-00-00-000Z-x1f2/
26
- (snapshot.json + 每 attempt 的 result.json / events.json / trace.json / diff.json)
12
+ Plan: 45 attempts · 9 evals × 5 configs · concurrency 19
13
+ ✗ @12h8m4k1 fixtures/button [compare/claude-e2b] errored · sandbox.create
14
+ sandbox-rate-limit: E2B sandbox allocation failed after 5 attempts
15
+ Inspect: niceeval show @12h8m4k1
16
+
17
+ niceeval exp compare 2m 14s
18
+ 45 total · 6 reused · 19 running · 12 queued · 8 completed $0.84
19
+
20
+ ACTIVE
21
+ memory/agent-029-use-cache compare/bub-e2b 1m 42s running tests
22
+ memory/agent-030-app-route compare/codex 1m 18s editing src/app.ts
23
+ … 17 more active
27
24
  ```
28
25
 
29
- 运行中每个 eval 一条流式行,失败断言内联展开;运行结束的收尾块把失败集中重放一遍,每条自带下钻命令,末尾是本次实验的快照目录。这段输出怎么进「跑→读→修→再跑」的循环,见 [Agent 反馈闭环](/zh/guides/agent-feedback-loop)。
26
+ Human profile 只原位更新当前总数和 active slots,不把历史帧推入 scrollback。失败、错误和去重后的 diagnostic 永久追加,并带 locator。结束块只保留摘要、失败 locator、下钻命令和结果路径。这段输出怎么进「跑→读→修→再跑」的循环,见 [Agent 反馈闭环](/zh/guides/agent-feedback-loop)。
30
27
 
31
28
  ## `.niceeval/<experiment>/<快照>/`
32
29
 
@@ -38,7 +35,7 @@ Structured results: .niceeval/compare_web-agent/2026-07-09T10-00-00-000Z-x1f2/
38
35
  └─ 2026-07-09T10-00-00-000Z-x1f2/ # 快照目录:时间戳 + 随机后缀
39
36
  ├─ snapshot.json # 快照元数据(开始时写,收尾补 completedAt)
40
37
  └─ weather-tool/a0/ # 单个 eval attempt 的目录
41
- ├─ result.json # 判决、断言、用量 —— attempt 完成时一次写成
38
+ ├─ result.json # 判定、断言、结构化错误/diagnostics、用量
42
39
  ├─ events.json
43
40
  ├─ sources.json
44
41
  ├─ trace.json
@@ -51,39 +48,44 @@ Structured results: .niceeval/compare_web-agent/2026-07-09T10-00-00-000Z-x1f2/
51
48
  `niceeval show` 的位置参数有两种形态:eval id 前缀选「看哪些 eval」,`@<locator>` 精确指名「看哪一次 Attempt」。flag 选「看哪个切面」:
52
49
 
53
50
  ```bash
54
- niceeval show # 榜单:每个 Attempt 的判定、eval、locator、短原因、耗时与成本
51
+ niceeval show # 默认报告:按实验组分区,组内比较配置并下钻到 Attempt
55
52
  niceeval show weather # 前缀过滤:weather/* 下每个 eval 的判定
56
53
  niceeval show weather/brooklyn # 单个 eval:各 experiment 的 attempt 行(含 @<locator>)、默认 attempt 的断言明细
57
54
  niceeval show @1k2m9qrs # 精确到一次 Attempt:紧凑全景(断言/执行/diff 摘要 + 可用证据一览)
58
55
  niceeval show @1k2m9qrs --eval # 该 Attempt 运行时保存的 Eval 源码,断言标回源码行
59
56
  niceeval show @1k2m9qrs --execution # 该 Attempt 的消息、thinking、Skill 加载、工具调用,有 OTel 时补时间
57
+ niceeval show @1c3h6twx --timing # 有界诊断时间树:phase、hook、operation、shell、turn、OTel 与收尾
58
+ niceeval show @1c3h6twx --timing=full # 同一棵时间树逐节点完整展开
60
59
  niceeval show @1c3h6twx --diff # sandbox 里的文件改动
61
60
  niceeval show weather/brooklyn --history # 跨 run 时间轴:抖动与回归拐点
62
61
  ```
63
62
 
64
- `@<locator>` 是一次 Attempt 的持久、不透明身份,形如 `@1k2m9qrs`:由 `{experimentId, 快照时刻, evalId, attempt 序号}` 这个身份元组确定性派生,同一份落盘结果反复解析恒得到同一个值。它出现在 `niceeval show` 的紧凑索引里,直接复制粘贴就能定位到那一次运行。裸 `show` 的 locator 列只打印 `@<id>`,不追加判定或证据能力缩写;打开 Attempt 首页后,`available` 会列出实际可用的证据命令。
63
+ `@<locator>` 是一次 Attempt 的持久、不透明身份,形如 `@1k2m9qrs`:由 `{experimentId, 快照时刻, evalId, attempt 序号}` 这个身份元组确定性派生,同一份落盘结果反复解析恒得到同一个值。它出现在 `niceeval show` 的分组明细里,直接复制粘贴就能定位到那一次运行。列表里的 locator 只打印 `@<id>`,不追加判定或证据能力缩写;打开 Attempt 首页后,`available` 会列出实际可用的证据命令。
64
+
65
+ Sandbox 创建、setup 或 teardown 错误不依赖 trace。`result.json` 保存错误的 `code`、`message`、生命周期阶段(`phase`)、有限 cause/stack 和 diagnostics;trace 只在存在时补调用关系与耗时。Attempt 在 cleanup、teardown 和 sandbox stop 结束后才封口写入,因此收尾 diagnostic 也能回顾。
65
66
 
66
67
  同一个实验多次跑会留下多份结果,不带 `@<locator>` 的默认视图只回答一个问题——「现在整体怎样」:每个 experiment × eval 取时间上最新的那份判定,同一个 experiment 跨多次运行拼出来。按前缀只重跑了部分 eval 时,其余 eval 的判定从更早的运行补齐,报告永远是全局最新,不会因为一次局部重跑变残缺。合成是有标注的:每份判定都带上它产生的时间,能看出报告是从哪几次运行拼出来的。合成结果可能混着不同版本的被测代码——所以收工判定以 `--force` 全量重跑为准,迭代途中的 `show` 负责快、收尾的全量跑负责真。
67
68
 
68
- 单个 eval 视图里,多 experiment、多 Attempt 时的断言明细块默认挑最新一次失败的 Attempt 展开;没有失败就挑最新一次。这只是一个默认展开的启发式,不是精确选择——需要精确看某一次 Attempt,复制那一行的 `@<locator>` 直接 `show` 它即可。`--experiment` Selection 收窄到一个实验,`--run <目录>` 钉死看某一次历史 run,`--history` 看跨 run 趋势。不带 `--report` `show` 渲染专用 Attempt 索引;`--report <文件>` 换成你自己的报告,同一个文件也能喂给 `view`。位置前缀、`--run`、`--experiment` 对 `--report` 同样生效;`--history` 与 `--report` 互斥。
69
+ 单个 eval 视图里,多 experiment、多 Attempt 时的断言明细块默认挑最新一次失败的 Attempt 展开;没有失败就挑最新一次。这只是一个默认展开的启发式,不是精确选择——需要精确看某一次 Attempt,复制那一行的 `@<locator>` 直接 `show` 它即可。`--experiment compare` 按路径段前缀把 Selection 收窄到整个 `compare` 组,`--experiment compare/bub` 只留一个 experiment;`--run <目录>` 钉死看某一次历史 run,`--history` 看跨 run 趋势。`--report <文件>` 同时替换 `show` / `view` 的默认报告。位置前缀、`--run`、`--experiment` 对自定义报告同样生效;`--history` 与 `--report` 互斥。
69
70
 
70
71
  `niceeval view` 的每个视图都有 CLI 对应物:
71
72
 
72
73
  | `niceeval view` 里的视图 | 终端对应 |
73
74
  | --- | --- |
74
- | 当前结果的同构 Attempt 表 | `niceeval show` |
75
+ | 当前结果的分组比较报告 | `niceeval show` |
75
76
  | 该 eval 各 experiment 的判定行 + 默认 attempt 的断言明细 | `niceeval show <eval id>` |
76
77
  | 单次 Attempt 的紧凑全景(断言、执行、diff 摘要与证据可用性) | `niceeval show @<locator>` |
77
78
  | Eval 源码标注(断言标回源码行) | `niceeval show @<locator> --eval` |
78
79
  | AI 对话、thinking、Skill 加载与工具调用(有 OTel 时补时间) | `niceeval show @<locator> --execution` |
80
+ | 单次 Attempt 的阶段耗时分解 | `niceeval show @<locator> --timing`;逐节点审计用 `--timing=full` |
79
81
  | 文件改动 | `niceeval show @<locator> --diff` |
80
82
  | 历史 run 列表 | `niceeval show <eval id> --history`;钉死某一次用 `--run <目录>` |
81
83
 
82
- ### 默认 Attempt 索引
84
+ ### 默认分组比较报告
83
85
 
84
- 不带 flag 的 `niceeval show` 先按 experiment 打印摘要,再用同构表列出每个 Attempt。列固定为 `STATUS / EVAL / ATTEMPT / RESULT / DURATION / COST`:四态判定同时给图标与完整单词,locator 只保留 `@<id>`,失败原因优先显示期望值/实际值或命令退出码。完整断言和 evidence 留在 `niceeval show @<locator>`。
86
+ 不带 flag 的 `niceeval show` 如果命中多个可比组,只列组索引和可直接执行的 `niceeval show --experiment <group>` 命令;Selection 只剩一个组时才输出该组的成本 × 端到端成功率图和实验列表。组的边界来自 experiment id 的完整父目录:`compare/*` `dev-e2b/*` 不共享坐标系、连线、排序或汇总数字;顶层 experiment 各自形成单例组。
85
87
 
86
- 只有一个 experiment 时直接显示它的表,不出现“至少两个实验才能比较”的无关空态。有两个及以上 experiment 时,前面增加紧凑比较表;成本 × 通过率散点留给 `niceeval view`。快照未完成、过旧或覆盖不全的 warning 位于索引前;自定义报告摆了 `RunOverview` 时,同一条 warning 也只显示一次。
88
+ 组内实验列表先给固定列汇总,再按 experiment Eval Attempt 展开。locator 只保留 `@<id>`,失败原因优先显示期望值/实际值或命令退出码;完整断言和 evidence 留在 `niceeval show @<locator>`。某组只有一个 experiment 时散点仍显示单点,不出现“至少两个实验才能比较”的空态。快照未完成、过旧或覆盖不全的 warning 位于组索引前,同一条 warning 只显示一次。
87
89
 
88
90
  ### 单个 eval
89
91
 
@@ -126,7 +128,7 @@ failures:
126
128
  source: evals/memory/swelancer-manager-proposals.eval.ts:40:11
127
129
 
128
130
  execution: 2 events · 0 skill loads · 0 tool calls · 1 AI messages
129
- timing: OTel spans recorded for this attempt — see --execution for per-step timing.
131
+ timing: eval.run 40.8s · scoring.evaluate 0.3s
130
132
 
131
133
  changes: diff unavailable · no workspace diff was recorded for this attempt
132
134
 
@@ -134,13 +136,14 @@ artifacts: .niceeval/compare_codex-gpt-5.4/2026-07-09T10-00-00-000Z-x1f2/weather
134
136
  available:
135
137
  niceeval show @1k2m9qrs --eval
136
138
  niceeval show @1k2m9qrs --execution
139
+ niceeval show @1k2m9qrs --timing
137
140
  ```
138
141
 
139
142
  这份全景只给摘要,不复现某个切面的完整内容——完整源码、完整事件流或完整文件列表分别要对应的证据 flag 才给。`changes` 一行永远说明 diff 不可用的具体原因:这里是「这次 Attempt 从未收集过 diff」(`weather/brooklyn` 不是 sandbox eval,压根不会有工作区改动可收集);如果是 sandbox eval 但 agent 确实没碰任何文件,会是另一句「没有产生工作区文件改动」;两种「不可用」原因不同,不共用一句含糊的提示。
140
143
 
141
- ### `--eval`、`--execution`、`--diff`:三个证据切面
144
+ ### `--eval`、`--execution`、`--timing`、`--diff`:四个证据切面
142
145
 
143
- 三个证据 flag 既可以加在 `@<locator>` 后面(精确到一次 Attempt),也可以加在能唯一收窄到一个 eval 的前缀后面(挑同一套默认启发式选中的 attempt——最新一次失败,没有失败就挑最新一次,与单 eval 详情块展开的是同一次);前缀撞到不止一个 eval 时会报错,报错正文直接给出每个候选 eval 的 `@<locator>`,照抄一个继续即可。可以同时传多个证据 flag,一次输出全部要看的切面。
146
+ 四个证据 flag 既可以加在 `@<locator>` 后面(精确到一次 Attempt),也可以加在能唯一收窄到一个 eval 的前缀后面(挑同一套默认启发式选中的 attempt——最新一次失败,没有失败就挑最新一次,与单 eval 详情块展开的是同一次);前缀撞到不止一个 eval 时会报错,报错正文直接给出每个候选 eval 的 `@<locator>`,照抄一个继续即可。可以同时传多个证据 flag,一次输出全部要看的切面。
144
147
 
145
148
  `--eval` 是运行时保存的 Eval 源码,按行标注每条断言、gate 失败与 soft 分数直接排在对应源码行下面,源码里没能对应到具体行的断言(没有位置信息,或位置指向另一个文件)单独成一段,永不丢弃:
146
149
 
@@ -231,6 +234,45 @@ timing unavailable · OTel trace was not collected
231
234
  full events: .niceeval/compare_codex-gpt-5.4/2026-07-09T10-00-00-000Z-x1f2/weather/brooklyn/a2/events.json
232
235
  ```
233
236
 
237
+ `--timing` 回答「整个 Attempt 的时间花在哪里」。runner 把 lifecycle、setup/teardown hook、批量工作的 operation、所有经 Sandbox API 发出的 shell 命令,以及每个 session/turn 的 send 墙钟包络记进 `result.json`;某轮有 OTel 时,再按 `traceId` 把 agent/model/tool span 挂到该轮下面。没有 OTel 时,phase、hook、operation、shell 与 turn 时间仍完整,只缺轮内细分。出错或超时的 Attempt 在已知的最深节点用 `✗` 标出死在哪里:
238
+
239
+ ```text
240
+ $ niceeval show @1c3h6twx --timing
241
+ @1c3h6twx · fixtures/button · compare/bub-gpt-5.4 · errored
242
+ total 2m 4s
243
+
244
+ sandbox.queue 0.3s
245
+ sandbox.create 8.2s
246
+ sandbox.setup 21.6s
247
+ ├─ restoreCache 18.9s
248
+ │ └─ shell · tar xzf … 18.8s
249
+ └─ setup#2 2.7s
250
+ └─ shell · pnpm config set … 2.7s
251
+ workspace.baseline 0.2s
252
+ └─ shell · git init && git commit … 0.2s
253
+ agent.setup 41.5s
254
+ ├─ shell · npm install -g @openai/codex… 39.8s
255
+ └─ shell · write ~/.codex/config.toml 1.7s
256
+ eval.run 50.9s
257
+ └─ turn s1/t1 50.9s ✗ agent-runtime-error
258
+ └─ shell · codex exec … 50.7s
259
+ ├─ agent · codex.exec 50.5s OTel
260
+ └─ model · chat 44.2s OTel
261
+
262
+ teardown (not counted in total):
263
+ agent.teardown 0.4s
264
+ sandbox.teardown 3.1s
265
+ └─ persistCache 3.1s
266
+ └─ shell · tar czf … 3.0s
267
+ sandbox.stop 1.2s
268
+ ```
269
+
270
+ 收尾阶段不计入 Attempt 总耗时,单独分组列出——「判定早就出了、进程还在等收尾」这类问题看这一组。缩进表示包含关系,不表示子项可以相加:命令、turn 和 OTel span 都可能嵌套或并发。
271
+
272
+ 裸 `--timing` 会完整列出 phase,并把 phase 下的细节控制在 80 个节点内。超过上限时,它优先保留失败路径、最慢节点与首尾时序,在省略位置显示节点数、未展示的失败数,并给出 `--timing=full`。小树中两种模式输出相同;`--timing=full` 不设节点上限,适合审计旧结果或把完整树重定向到文件。NiceEval 不自动启动 pager,因此管道、CI 和 coding agent 不会等待键盘输入。命令可能并发,省略行不会把子节点耗时相加。
273
+
274
+ operation 的名称由执行这段工作的组件在采集时写入。例如一次 workspace diff 导出可以显示成 `export workspace diff · 1 window · 3,302 files`,下面只有一条真实的批量 shell。展示层不会解析 `git show` 等命令文本、猜出一个 `git show ×N` 分组;如果旧 artifact 确实记录了几千次调用,默认模式有界摘要,`--timing=full` 仍能逐条核对。一次超时到底是 Sandbox 创建慢、某条安装命令慢,还是一轮里的模型/工具慢,`--timing` 一眼可判。旧结果或第三方写入的结果没有阶段数据时,两种模式都如实提示 `phase timing unavailable`。
275
+
234
276
  `--diff` 默认给文件级摘要(落盘的 diff 只有改动后的全文,没有基线可比对增删行数,所以每个改动过的文件都标 `M`、后面跟它现在的行数,不区分新建与修改);看单个文件的完整内容用 `--diff=<文件路径>`——路径必须用 `=` 连写,位置参数永远留给 eval id 前缀 / `@<locator>`:
235
277
 
236
278
  ```text
@@ -255,12 +297,12 @@ $ niceeval show @1c3h6twx --diff=src/components/Button.tsx
255
297
  2. 运行 niceeval show <eval-id>,读取该题各 experiment 的判定、默认 attempt 的断言明细,
256
298
  以及每行末尾的 @<locator>。
257
299
  3. 运行 niceeval show @<locator>,看紧凑全景确认这次 Attempt 实际捕获到了哪些证据。
258
- 4. 按问题选择 --eval、--execution 或 --diff;可以同时传多个证据 flag。
300
+ 4. 按问题选择 --eval、--execution、--timing 或 --diff;可以同时传多个证据 flag。
259
301
  5. 输出被截断时,读取末尾标出的 sources.json、events.json、trace.json 或 diff.json 原始路径。
260
302
  6. 修复后重跑该 eval,再用 niceeval show <eval-id> 验证新的 @<locator>;收工前用 --force 全量重跑确认整体结果。
261
303
  ```
262
304
 
263
- `--eval` 回答“这道题实际检查了什么、哪条断言为什么过或没过”,`--execution` 回答“agent 做了什么、调用了什么、时间花在哪里”,`--diff` 回答“沙箱里的文件实际改成了什么”。先按问题选证据,不需要每次把三份都读完。
305
+ `--eval` 回答“这道题实际检查了什么、哪条断言为什么过或没过”,`--execution` 回答“agent 做了什么、调用了什么”(可关联时附 OTel 时间),`--timing` 回答“整个 Attempt 的时间花在哪里”,`--diff` 回答“沙箱里的文件实际改成了什么”。先按问题选证据,不需要每次把四份都读完。
264
306
 
265
307
  ### 历史与抖动:`--history`
266
308
 
@@ -293,9 +335,9 @@ npx niceeval view
293
335
  失败后立刻运行 `npx niceeval view`,可以直接打开刚刚那次运行的 artifacts。
294
336
  </Tip>
295
337
 
296
- `view` 的首页是一份报告:不传 `--report` 时是成本 × 通过率散点图与逐实验表,适合人在网页比较;传了 `--report` 就换成你自己的报告(与 `show --report` 吃同一个文件),见[自定义报告](/zh/guides/custom-reports)。裸 `show` 则使用更适合终端 agent 循环的 Attempt 索引。证据部分(Attempt 弹窗、transcript、trace 瀑布、run 列表)始终保留。
338
+ `view` 的首页是一份报告:不传 `--report` 时完整加载当前结果并显示全部可比组索引,选中一组后只显示该组的成本 × 端到端成功率散点图与实验表。切组只改变页面状态,不重新读取或计算;不同组不会混进同一张图或榜单。浏览器禁用 JS 时,每组作为独立的 `<details>` 完整可读;启用 JS 后一次聚焦一组。传了 `--report` 就换成你自己的报告(与 `show --report` 吃同一个文件),见[自定义报告](/zh/guides/custom-reports)。证据部分(Attempt 弹窗、transcript、trace 瀑布、run 列表)始终保留。
297
339
 
298
- 网页版多几样浏览操作:点表头就地排序、在榜单的过滤框里筛行、点开一个 experiment 行看它每道题的判定与原因、悬停散点看数值——这些只影响眼前的视图,不改判定口径,刷新即恢复。报告上方有 **Copy fix prompt** 按钮,把全部失败打包成可直接粘给 coding agent 的修复 prompt(attempt 弹窗里有单条版)。报告文案有中英两份,随界面语言切换。
340
+ 网页版多几样浏览操作:切换可比组、点表头就地排序、在当前组的过滤框里筛行、点开一个 experiment 行看它每道题的判定与原因、悬停散点看数值——这些只影响眼前的视图,不改判定口径,刷新即恢复。Attempt 弹窗里有与 `show --timing` 同源的统一时间树:Sandbox 启动、setup hook 及其 shell、agent 安装命令、每轮 send 与可关联的 OTel model/tool、评分与收尾都能逐层展开。报告上方有 **Copy fix prompt** 按钮,把全部失败打包成可直接粘给 coding agent 的修复 prompt(attempt 弹窗里有单条版)。报告文案有中英两份,随界面语言切换。
299
341
 
300
342
  ## 导出与静态托管
301
343
 
@@ -318,7 +360,7 @@ NiceEval 写入 `<dir>/index.html`,并把查看器要读取的 artifact(`sou
318
360
  - `diff.json` 和 `o11y.json` 不会被复制。查看器不读取它们,且 diff 可能达到上百 MB。
319
361
  - 用 `file://` 直接打开 `index.html` 时浏览器不允许 fetch artifact,代码视图会提示源码不可用。本地预览用 http 服务打开。
320
362
 
321
- 最简单的流程是在跑过 eval 的机器上导出,把产物目录直接部署,不需要额外步骤。要让站点随 push 自动更新,把 `.niceeval/` 提交进仓库、CI 上一行 `view --out` 导出——workflow 与平台接线见[通过 CI 发布报告](/zh/guides/publish-report)。
363
+ 最简单的流程是在跑过 eval 的机器上导出,把产物目录直接部署,不需要额外步骤。要让站点随 push 自动更新,先用 `copySnapshots` 生成经过单文件预算检查的发布结果根,把它提交进仓库,再让 CI 对这个目录运行 `view --run <目录> --out`——workflow 与平台接线见[通过 CI 发布报告](/zh/guides/publish-report)。
322
364
 
323
365
  ## Artifact 说明
324
366
 
@@ -328,7 +370,7 @@ NiceEval 写入 `<dir>/index.html`,并把查看器要读取的 artifact(`sou
328
370
 
329
371
  ### `result.json`
330
372
 
331
- 单个 attempt 的权威记录:判定、断言、耗时、用量、成本。attempt 完成时一次写成,之后不再改写。
373
+ 单个 Attempt 的权威记录:判定、断言、正式阶段耗时、结构化 error、去重后的 diagnostics、用量和成本。cleanup、teardown 与 Sandbox stop 完成后一次写成,之后不再改写。`progress` 的短期 message/current/total 不落盘。
332
374
 
333
375
  ### `events.json`
334
376
 
@@ -344,7 +386,7 @@ eval 源码位置和断言位置,用于查看器把失败断言对应回代码
344
386
 
345
387
  ### `trace.json`
346
388
 
347
- OTLP trace 或标准化后的 span 数据。
389
+ OTLP trace 或标准化后的 span 数据。它是可选的执行关系和耗时证据,不是错误存储:沙箱创建(`sandbox.create`)可能早于 telemetry,teardown 可能晚于 trace collect。
348
390
 
349
391
  ### `o11y.json`
350
392
 
@@ -365,6 +407,7 @@ Soft 断言的分数记录在 `assertions[].score` 里;非 `--strict` 模式
365
407
 
366
408
  - 榜单里失败/错误的题每条自带下钻命令:`niceeval show <eval id>` 先看断言明细,行尾的 `@<locator>` 可以直接精确下钻到某一次 Attempt。
367
409
  - 想知道 eval 实际检查了什么、断言为什么过或没过,看 `--eval`(标回源码行的断言标注)。
368
- - 想知道 agent 做了什么、调用了什么、时间花在哪里,看 `--execution`(或 view 的证据面板)。
410
+ - 想知道 agent 做了什么、调用了什么,看 `--execution`;关联成功的 OTel 时间会贴在同一事件旁。
369
411
  - coding-agent 失败时看 `--diff` 和 `--execution` 里的工具调用;两者结合能看出「改错了文件」还是「压根没调用该调用的工具」。
412
+ - Sandbox eval 跑得慢或超时,先看 `--timing`:排队、Sandbox 启动、setup hook 里的每条 shell、agent 安装命令、每轮 send 与可关联的 OTel model/tool 各花多久,一眼可判;收尾卡住也在这里单独列出。
370
413
  - 判断缺陷在被测程序还是 eval 本身、修完怎么重跑,流程见 [Agent 反馈闭环](/zh/guides/agent-feedback-loop)。
@@ -104,7 +104,7 @@ npx niceeval exp prompt-variants/concise
104
104
  | `timeoutMs` | 单个 attempt 的超时 |
105
105
  | `budget` | 这一格配置的预算上限 |
106
106
  | `maxConcurrency` | 这一格配置的并发上限 |
107
- | `sandbox` | sandbox agent 使用的后端,如 `dockerSandbox()` / `e2bSandbox()`;spec 上可以链 `.setup()` / `.teardown()` 挂按实验变化的环境钩子 |
107
+ | `sandbox` | sandbox agent 使用的 provider,如 `dockerSandbox()` / `e2bSandbox()`;spec 上可以链 `.setup()` / `.teardown()` 挂按实验变化的环境钩子 |
108
108
 
109
109
  Experiment 本身是纯配置数据,没有 `setup` / `teardown` 这类字段。要在跑 agent 前按实验准备环境(装二进制、预热、跨 attempt 载入和回存状态),挂在 `sandbox` 字段的 spec 上:
110
110
 
@@ -112,12 +112,14 @@ Experiment 本身是纯配置数据,没有 `setup` / `teardown` 这类字段
112
112
  export default defineExperiment({
113
113
  agent: codexAgent({ mcpServers: [mempalMcp] }),
114
114
  sandbox: e2bSandbox({ template: "fasteval-agents" })
115
- .setup(mempalSetup("codex")) // 装二进制、预热、写 hook、载入状态
115
+ .setup(mempalSetup("codex")) // 预检、写动态配置、预热、载入状态
116
116
  .teardown(mempalTeardown("codex")), // 回存状态
117
117
  maxConcurrency: 1, // 载入和回存之间不能并发,声明串行
118
118
  });
119
119
  ```
120
120
 
121
- 钩子的执行时机、多钩子顺序和失败语义见 [Sandbox 后端 · 环境钩子](/zh/guides/sandbox-providers#环境钩子)。
121
+ 固定的 Agent CLI、系统包和大模型缓存应先做进 image/template/snapshot;`.setup()` 不应在每个 Attempt 重建同一套环境。如何从官方 Docker 镜像、E2B 模板或 Vercel runtime 继续派生来提速,见 [沙箱 provider · 从官方基线继续构建以提速](/zh/guides/sandbox-providers#从官方基线继续构建以提速)。
122
+
123
+ 钩子的执行时机、多钩子顺序和失败语义见 [沙箱 provider · 环境钩子](/zh/guides/sandbox-providers#环境钩子)。
122
124
 
123
125
  跨配置比较的设计建议见[实验矩阵](/zh/guides/experiments)。adapter 如何消费 `ctx.model` 和 `ctx.flags` 见[Adapter](/zh/concepts/adapter)。
@@ -6,10 +6,11 @@ description: "手写 Adapter 的 send 函数,一条主线七步走:发消息
6
6
 
7
7
  [Adapter](/zh/concepts/adapter) 讲了契约:`send` 传入 `TurnInput` 和 `AgentContext`,返回 `Turn`。这一页讲怎么写它——从"发一条消息拿到回复"的最小形态起步,一步一步加到完整接入。每一步只在上一步的代码上多几行,前面已有的部分在代码里用 `// ……省略` 标出;每一步末尾说明这几行解锁了哪些断言。改完任何一步都能立刻验证:把新解锁的断言写进一条 eval 重跑 `npx niceeval exp`,`niceeval view` 里能看到这一步新增的数据——多轮轨迹、用量、工具事件、待回答请求。
8
8
 
9
- 两个贯穿全文的原则:
9
+ 三个贯穿全文的原则:
10
10
 
11
11
  - **接的位置永远是用户前端本来就在用的那个接口。** 页面调哪个端点、收什么格式,Adapter 就调哪个端点、收什么格式——不为 eval 开新接口,也不 import 应用内部代码直调函数(为什么,见[接入你的 Agent](/zh/guides/connect-your-agent))。
12
12
  - **你唯一真正手写的是 transport**——URL、鉴权、请求体每家本来就不一样。解析(原始返回 → 标准事件流)有官方转换器,从 `niceeval/adapter` 导出;编排(会话续接、HITL 暂停恢复)的状态槽就挂在 `ctx.session` 上,取用即可,不需要额外声明什么。
13
+ - **运行反馈走 `ctx`,不直接写终端。** 长步骤用 `ctx.progress(...)`;需要在运行后回顾的退化或异常上下文用 `ctx.diagnostic(...)`;无法继续时抛错。不要从 Adapter 调用 `console.log/error` 或写 `process.stdout/stderr`。
13
14
 
14
15
  ![一次 t.send 的完整往返:eval 调用 t.send,运行器组装 TurnInput 与 ctx,adapter 调用你的应用并返回标准事件流 Turn。](/images/agent-turn-roundtrip-zh.svg)
15
16
 
@@ -38,6 +39,7 @@ const BASE_URL = "http://localhost:8080"; // 要按 experiment 切换地址,
38
39
  export default defineAgent({
39
40
  name: "chat-app",
40
41
  async send(input, ctx) {
42
+ ctx.progress({ message: "等待 Chat API" });
41
43
  const res = await fetch(`${BASE_URL}/v1/chat/completions`, { // ← 前端本来就在用的接口
42
44
  method: "POST",
43
45
  headers: { "content-type": "application/json" },
@@ -56,6 +58,20 @@ export default defineAgent({
56
58
  });
57
59
  ```
58
60
 
61
+ 如果接口返回了可继续处理、但证据不完整的响应,报告 diagnostic 而不是把原始响应全部打印出来:
62
+
63
+ ```ts
64
+ if (!res.requestId) {
65
+ ctx.diagnostic({
66
+ code: "missing-request-id",
67
+ level: "warning",
68
+ message: "响应没有 request id,无法与服务端日志关联",
69
+ });
70
+ }
71
+ ```
72
+
73
+ `progress` 不落盘;diagnostic 会随 Attempt 保存并可通过 locator 回顾。HTTP 连接失败或响应无法解析时直接抛错,runner 会记录错误发生在 `agent.run`,并把 Attempt 标为 `errored`。
74
+
59
75
  **这一步解锁**:`t.reply`、`t.messageIncludes()`、judge 的全部对话材料,以及 experiment 侧的**模型对比**(`ctx.model` 就是 experiment 声明的 `model`,运行器原样递给你、Adapter 不解释含义,只转发——不需要等到后面的步骤,也不需要应用配合做任何改造,分档见 [Tier](/zh/concepts/tier))。
60
76
 
61
77
  它有两个明显的局限:每轮都是一场全新对话(第二次 `t.send` 接不上第一次),工具调用完全看不见。后面两步各解决一个。
@@ -166,7 +166,7 @@ READ https://raw.githubusercontent.com/CorrectRoadH/niceeval/refs/heads/main/doc
166
166
 
167
167
  <AccordionGroup>
168
168
  <Accordion title="需要注册账号吗?">
169
- 不需要。跑 eval 和 `niceeval view` 看报告全在本地完成;只有被测对象本身是需要隔离工作区的 coding agent 时,才会用到 Docker 或 E2B 这类 sandbox 后端。
169
+ 不需要。跑 eval 和 `niceeval view` 看报告全在本地完成;只有被测对象本身是需要隔离工作区的 coding agent 时,才会用到 Docker 或 E2B 这类 sandbox provider。
170
170
  </Accordion>
171
171
  <Accordion title="我的 Agent 不是用 TypeScript / JavaScript 写的,能接吗?">
172
172
  能。Adapter 只是对着应用本来暴露的接口(HTTP、gRPC、WebSocket 都行)收发;应用本身用什么语言写、部署在哪里,[NiceEval](https://niceeval.com/) 不关心,见 [Adapter](/zh/concepts/adapter)。
@@ -112,6 +112,19 @@ plugins?: ClaudeCodePluginSpec[];
112
112
 
113
113
  Claude Code 原生 Plugin(先连 Marketplace,再从中装指定 Plugin)。
114
114
 
115
+ #### `settingsFile`
116
+
117
+ ```ts
118
+ settingsFile?: string;
119
+ ```
120
+
121
+ 一份完整的 Claude Code `settings.json`(官方格式)在本地项目里的路径 —— 相对运行
122
+ niceeval 的项目根(含 `niceeval.config.ts` 的目录)解析,不是 Sandbox 内路径;只接受
123
+ 项目根内的相对路径,包含 `..` 的路径、绝对路径、`~` 路径和解析后逃出项目根的符号链接
124
+ 都在 setup 阶段报错。原始字节原样上传为沙箱里原本为空的用户级 `~/.claude/settings.json`
125
+ (不继承宿主机配置、不拼接、不重新序列化);保留键 `model` 与 `env` 出现在文件里
126
+ setup 报错。manifest 只记项目相对路径与字节 SHA-256,不落正文。
127
+
115
128
  ### `CodexConfig`
116
129
 
117
130
  #### `apiKey`
@@ -157,6 +170,20 @@ plugins?: CodexPluginSpec[];
157
170
 
158
171
  Codex 原生 Plugin(先连 Marketplace,再从中装指定 Plugin)。
159
172
 
173
+ #### `configFile`
174
+
175
+ ```ts
176
+ configFile?: string;
177
+ ```
178
+
179
+ 一份完整的 Codex `config.toml`(官方 TOML 格式)在本地项目里的路径 —— 相对运行
180
+ niceeval 的项目根(含 `niceeval.config.ts` 的目录)解析,不是 Sandbox 内路径;只接受
181
+ 项目根内的相对路径,包含 `..` 的路径、绝对路径、`~` 路径和解析后逃出项目根的符号链接
182
+ 都在 setup 阶段报错。原始字节原样并入沙箱里原本为空的用户级 `~/.codex/config.toml`
183
+ (不继承宿主机配置、不解析后重写);保留键 `model`、`model_provider`、`model_providers`、
184
+ `model_reasoning_effort`、`mcp_servers`、`otel` 出现在文件里 setup 报错。manifest 只记
185
+ 项目相对路径与字节 SHA-256,不落正文。
186
+
160
187
  ### `BubConfig`
161
188
 
162
189
  #### `apiKey`
@@ -22,13 +22,13 @@ description: "NiceEval 怎么知道你的 adapter 做到了什么:没有声明
22
22
 
23
23
  ## 为什么没有声明这一层
24
24
 
25
- 上一版设计里有 `capabilities: { conversation, toolObservability }` 这类布尔声明,用来补"代码证明不了的部分"。这一层已经被拿掉,原因是它承诺的事情本身就不该由声明来担保:
25
+ NiceEval 不设 `capabilities: { conversation, toolObservability }` 这类布尔声明层来补"代码证明不了的部分",因为这类声明承诺的事情本身就不该由声明来担保:
26
26
 
27
27
  - **构造即证明**:用了 `defineSandboxAgent`,说明被测对象在沙箱里改文件——不需要再声明一遍 `workspace: true`。
28
28
  - **字段即证明**:写了 `tracing`(怎么把 OTLP 端点交给 CLI),tracing 就成立。字段本身就是使用凭证,不需要旁边再放一个布尔值重复一遍。
29
29
  - **来源即证明**:`fromAiSdk(result)` 消费的 `result.steps` 是 AI SDK 契约保证的**全量**工具循环记录,返回值自带"事件流完整"的证明;内置 CLI 的 parser 同理。手工映射时,事件完不完整取决于你的映射代码写没写全——这不是一个可以靠声明担保的东西,声明了也不会让代码更完整。
30
30
  - **行为即证明**:HITL 没有能力位——`send` 返回 `status: "waiting"` + `input.requested` 事件,行为本身可见。
31
- - **接了就续得上**:会话续接不再是"声明了才有"的开关。`ctx.session` 一直都在;用了 `id`/`capture` 或 `history` 存取器就会续接上下文,不用就每轮都是全新会话——两种都是正常状态,都不会报错,区别只在你的 adapter 实际怎么写。
31
+ - **接了就续得上**:会话续接没有"声明了才有"的开关。`ctx.session` 一直都在;用了 `id`/`capture` 或 `history` 存取器就会续接上下文,不用就每轮都是全新会话——两种都是正常状态,都不会报错,区别只在你的 adapter 实际怎么写。
32
32
 
33
33
  ```ts
34
34
  export default defineAgent({
@@ -64,7 +64,7 @@ npx niceeval exp compare-models weather
64
64
 
65
65
  ## 常用 flags
66
66
 
67
- 下表由 CLI 的 flag 解析表生成,表外的 flag 一律按未知 flag 报错并以非零状态退出。**没有**用于选择 sandbox 后端的 CLI flag:sandbox 后端只能写在代码里——在 experiment(`defineExperiment`)里设置 `sandbox`,或者在 `niceeval.config.ts`(`defineConfig`)里设置作为项目级兜底,值来自 `niceeval/sandbox` 的 `dockerSandbox()` / `vercelSandbox()` / `e2bSandbox()`。
67
+ 下表由 CLI 的 flag 解析表生成,表外的 flag 一律按未知 flag 报错并以非零状态退出。**没有**用于选择 sandbox provider CLI flag:sandbox provider 只能写在代码里——在 experiment(`defineExperiment`)里设置 `sandbox`,或者在 `niceeval.config.ts`(`defineConfig`)里设置作为项目级兜底,值来自 `niceeval/sandbox` 的 `dockerSandbox()` / `vercelSandbox()` / `e2bSandbox()`。
68
68
 
69
69
  {/* GENERATED:BEGIN cli-flags */}
70
70
 
@@ -78,20 +78,27 @@ npx niceeval exp compare-models weather
78
78
  | `--max-concurrency` | number | 设置同时运行的 eval 数量。 |
79
79
  | `--timeout` | number | 单个 attempt 的超时时间,单位毫秒。 |
80
80
  | `--budget` | number | 整次运行的预算上限(美元)。 |
81
+ | `--keep-sandbox` | boolean | `exp` 命令专用:跑完留下 failed/errored attempt 的沙箱现场(= `--keep-sandbox=failed`);`--keep-sandbox=all` 连 passed 也留。事后用 `niceeval sandbox list/enter/stop` 查看与销毁。 |
82
+ | `--all` | boolean | `sandbox stop` 专用:销毁全部留存沙箱。 |
83
+ | `--window` | string | `sandbox diff` 专用:只看某个 send 窗口(如 `--window s1/t2`);省略输出全部窗口的串联视图。 |
84
+ | `--path` | string | `sandbox diff` 专用:只看某个文件的 patch;省略输出该窗口的全部文件。 |
85
+ | `--leave-running` | boolean | `sandbox enter` 专用:shell 退出后让现场保持运行,不送回休眠。 |
81
86
  | `--tag` | string | 只运行带有该 tag 的 eval(见 `defineEval` 的 `tags`)。 |
82
87
  | `--junit` | string | 额外写一份 JUnit XML 报告到指定路径,供 CI 消费。 |
83
88
  | `--json` | string | 额外写一份 JSON 结果(`RunSummary` 原样序列化)到指定路径,供 CI 或下游脚本消费。 |
84
89
  | `--out` | string | `view` 命令专用:把结果查看器静态导出到指定目录。 |
85
90
  | `--port` | number | `view` 命令专用:指定本地服务器监听端口。 |
91
+ | `--allow-sensitive-artifacts` | boolean | `view --out` 专用:对非发布根(快照没有 publish:&#123;redaction:"applied"&#125; 标记)导出时的显式确认——静态站会原样携带未消毒的证据文件。 |
86
92
  | `--eval` | boolean | `show` 命令专用:该 attempt 运行时保存的 Eval 源码,gate/soft 断言标回源码行(证据切面)。 |
87
93
  | `--execution` | boolean | `show` 命令专用:该 attempt 的标准执行事件流(消息、thinking、Skill load、工具调用/结果);有 OTel 时同一节点补时间(证据切面)。 |
94
+ | `--timing` | boolean | `show` 命令专用:整个 Attempt 的统一时间树;裸 `--timing` 给有界诊断投影,`--timing=full` 逐节点展开全部 runner/已关联 OTel 节点。 |
88
95
  | `--diff` | boolean | `show` 命令专用:sandbox 里的文件改动摘要;`--diff=<文件路径>` 看单个文件的完整改动(路径必须 `=` 连写)。 |
89
96
  | `--history` | boolean | `show` 命令专用:跨 run 时间轴,只列真实执行;与 `--report` 互斥。 |
90
- | `--experiment` | string | `show` / `view` 命令专用:Selection 只留该实验。 |
97
+ | `--experiment` | string | `show` / `view` 命令专用:按路径段前缀收窄 experiment;组名会选中组内全部配置。 |
91
98
  | `--run` | string | `show` / `view` 命令专用:钉死看某一个结果目录(某次快照或 `copySnapshots` 产物)。 |
92
- | `--report` | string | `show` / `view` 命令专用:渲染你的报告文件(文件默认导出 `defineReport(...)`);show 用它替换 Attempt 索引,view 用它替换默认分析报告。 |
93
- | `--dry` | boolean | 只打印本次会匹配到的 eval × 运行配置,不实际执行。 |
94
- | `--quiet` | boolean | 关闭控制台 / live 的逐条结果与末尾汇总(attempt 进度行仍写 stderr);errored / failed 的结果各在 stderr 补一行摘要,passed / skipped 静默;reporter 仍会写 artifacts。 |
99
+ | `--report` | string | `show` / `view` 命令专用:用文件默认导出的 `defineReport(...)` 替换两者共用的默认报告。 |
100
+ | `--dry` | boolean | 只打印本次会匹配到的 eval × 运行配置,不实际执行(按下面 `--output` 选中的 profile 给出预览)。 |
101
+ | `--output` | string | 反馈 profile:`auto`(默认)按环境自动选择,`human` / `agent` / `ci` 强制指定;只改变终端展示,不改变选择、调度、判定、artifact 或退出码。`auto` 依次判定:stderr TTY human;否则 `CI`(或其它常见 CI 平台环境变量)存在 ci;否则 → agent。 |
95
102
  | `--force` | boolean | 忽略上次运行结果,不跳过已通过的 (experiment, eval) 组合,强制全部重跑。 |
96
103
  | `--strict` | boolean | CI 中推荐使用:让软阈值(`soft`)失败也计入整条 eval 的 verdict。 |
97
104
  | `--early-exit` / `--no-early-exit` | boolean | 某个 eval 的一次 attempt 通过后,停止该 eval 剩余的 attempts。 |
@@ -118,13 +125,32 @@ npx niceeval exp compare-models weather-tool
118
125
 
119
126
  运行命名 experiment,用矩阵比较 agents、models 或 flags。第二个参数开始是 eval ID 前缀过滤。
120
127
 
128
+ `show` 与 `view` 是顶层命令,应写成 `npx niceeval show`、`npx niceeval view`。误写成 `npx niceeval exp show` / `exp view` 且没有同名 experiment 时,CLI 会在“不存在的实验”错误后提示正确命令;仓库确实存在同名 experiment 时仍按合法 id 执行。
129
+
130
+ ## `--output`:human / agent / ci
131
+
132
+ `--output` 选一种终端反馈模型,只改变展示,不改变选择、调度、判定、artifact 或退出码;省略时的默认值 `auto` 按环境自动选择。三种消费者各有推荐命令:
133
+
134
+ ```bash
135
+ # 人在 TTY 前:动态 dashboard + 永久失败/诊断行
136
+ npx niceeval exp compare --output human
137
+
138
+ # coding agent / 自动修复循环:低频 checkpoint + 有界 handoff block
139
+ npx niceeval exp compare --output agent
140
+
141
+ # CI job:单一有序 stdout 事件流 + 退出码 + JSON/JUnit
142
+ npx niceeval exp compare --output ci --strict --json .niceeval/ci-summary.json --junit .niceeval/junit.xml
143
+ ```
144
+
145
+ 三种 profile 的完整对比见[运行器 · Reporter](/zh/guides/runner#reporter);人在终端里怎么读 dashboard 与结束摘要见上面的[常用 flags](#常用-flags)与本页各命令示例;AI 反馈闭环的完整用法(读输出、按 locator 下钻、局部重跑)见 [AI 反馈闭环](/zh/guides/agent-feedback-loop);CI 集成(GitHub Actions、退出码、JSON/JUnit)见 [CI 集成](/zh/guides/ci-integration)。
146
+
121
147
  ## `view`
122
148
 
123
149
  ```bash
124
150
  npx niceeval view
125
151
  ```
126
152
 
127
- 打开本地结果查看器。它和 `show` 共用同一份默认报告和同一套默认选择——对每个 experiment、每个 eval,取历次运行里最新的那份判定;只补跑部分 eval 时,其余 eval 从更早的运行补齐。`show` 输出终端文本,`view` 输出网页并提供可交互的证据浏览;eval ID 前缀、`--experiment`、`--run` 对两者的收窄一致。完整说明见[查看结果](/zh/guides/viewing-results)。
153
+ 打开本地结果查看器。它和 `show` 共用同一份默认报告和同一套默认选择——对每个 experiment、每个 eval,取历次运行里最新的那份判定;只补跑部分 eval 时,其余 eval 从更早的运行补齐。默认报告按 experiment id 的父目录分组,只在同组内比较。`show` 输出终端文本,`view` 输出网页并提供可交互的证据浏览;eval ID 前缀、`--experiment`、`--run` 对两者的收窄一致。完整说明见[查看结果](/zh/guides/viewing-results)。
128
154
 
129
155
  ## `show [id-prefix...]`
130
156
 
@@ -138,7 +164,7 @@ npx niceeval show fixtures/button --diff
138
164
  npx niceeval show weather/brooklyn --history
139
165
  ```
140
166
 
141
- `show` 是终端结果入口,适合人直接阅读,也适合 coding agent 在上下文窗口里逐级下钻。位置参数选「看哪些 eval」(ID 前缀)或直接用 `@<locator>` 精确选一个 attempt;不带位置参数时显示同一张紧凑 attempt 表,指定 eval ID 前缀只是收窄这张表的行数,不会切换成另一种视图。
167
+ `show` 是终端结果入口,适合人直接阅读,也适合 coding agent 在上下文窗口里逐级下钻。位置参数选「看哪些 eval」(ID 前缀)或直接用 `@<locator>` 精确选一个 attempt;不带位置参数时显示按实验组分区的默认比较报告,指定 eval ID 前缀只收窄报告覆盖的 Eval,不改变组边界。
142
168
 
143
169
  `@<locator>` 不带证据 flag 时给出该 attempt 的紧凑全景(断言摘要、执行摘要、可选 OTel 时间、diff 摘要);`--eval`、`--execution`、`--diff` 是同一 attempt 的证据切面,分别展开运行时保存的 Eval 源码、标准执行事件流、工作区文件改动,因此必须搭配 `@<locator>` 精确指名一个 attempt。`--run` 钉住某次结果目录,`--history` 查看跨 run 趋势。完整的阅读顺序、输出示例和 artifact 说明见[查看结果](/zh/guides/viewing-results)。
144
170
 
@@ -92,6 +92,14 @@ name: string;
92
92
 
93
93
  agent 的显示名/标识,原样进入 `Agent.name`——不是注册表查找 key,只用于展示、结果归属与去重指纹。
94
94
 
95
+ #### `coverage`
96
+
97
+ ```ts
98
+ coverage?: EvidenceCoverage;
99
+ ```
100
+
101
+ 该 Adapter 的常态证据覆盖声明(完整采集的用 `completeCoverage` 常量);省略 = 全通道 unknown。
102
+
95
103
  #### `setup`
96
104
 
97
105
  ```ts
@@ -145,6 +153,14 @@ name: string;
145
153
 
146
154
  agent 的显示名/标识,原样进入 `Agent.name`——不是注册表查找 key,只用于展示、结果归属与去重指纹。
147
155
 
156
+ #### `coverage`
157
+
158
+ ```ts
159
+ coverage?: EvidenceCoverage;
160
+ ```
161
+
162
+ 该 Adapter 的常态证据覆盖声明(完整采集的用 `completeCoverage` 常量);省略 = 全通道 unknown。
163
+
148
164
  #### `setup`
149
165
 
150
166
  ```ts
@@ -268,16 +284,35 @@ spread 进 send;file-based 的在 tracing.configure 里写配置。远程 HTTP
268
284
  只需要把 headers spread 进请求头(每轮一个新 traceparent);端点是启动期配置
269
285
  (defineConfig(&#123; telemetry: &#123; port &#125; &#125;))固定的,不从这里传。
270
286
 
287
+ #### `progress`
288
+
289
+ ```ts
290
+ progress(update: ProgressUpdate): void;
291
+ ```
292
+
293
+ 作用域反馈:报告此刻正在做什么(turn / tool / 安装进度)。短命状态——Human profile
294
+ 更新 active 行,`agent`/`ci` 不逐条打印,也不进最终结果;不要每个 token/delta 都调用。
295
+ runner 按当前回调所处的生命周期阶段(agent.setup / agent.run / agent.teardown)归因,
296
+ 调用方不能冒充其它阶段(见 docs/feature/experiments/library.md)。
297
+
298
+ #### `diagnostic`
299
+
300
+ ```ts
301
+ diagnostic(input: DiagnosticInput): void;
302
+ ```
303
+
304
+ 作用域反馈:报告运行结束后仍应保留的问题(协议降级、数据不完整、cleanup 问题)。
305
+ 永久事件,落进 attempt 的 diagnostics 并进各 profile 的永久输出;`dedupeKey` 去重。
306
+ 即使 level 为 "error" 也不改变 Turn.status / verdict——无法继续时抛异常。
307
+
271
308
  #### `log`
272
309
 
273
310
  ```ts
274
311
  log(msg: string): void;
275
312
  ```
276
313
 
277
- 写一行进运行器自身的进度日志( stderr,或调用方传入的 `onProgress` 回调)。
278
- 超时失败时,最近若干行会并入结果的 error 信息,方便定位卡在哪一步。
279
- 与 `Sandbox.appendLog` 是两回事:那个是把一行写进容器自己的原生日志
280
- (`docker logs` 能看到),这里只是运行器的观测通道。
314
+ `progress({ message: msg })` 的别名,不是第二条通道(见 docs/feature/experiments/cli.md
315
+ 「Attempt 阶段」)。超时失败时最近若干行会并入结果的 error 信息,方便定位卡在哪一步。
281
316
 
282
317
  {/* GENERATED:END agent-def */}
283
318
 
@@ -458,6 +493,24 @@ stream?: boolean;
458
493
  日志里看到 agent 的【原始输出】。provider 各自实现(docker:tee 到 PID1 tail 的文件;
459
494
  不支持的 provider 忽略)—— 日志怎么浮现是 provider 的事,adapter 只声明意图。
460
495
 
496
+ #### `onStdout`
497
+
498
+ ```ts
499
+ onStdout?: (chunk: string) => void | Promise<void>;
500
+ ```
501
+
502
+ 命令 stdout 每到一块就调用一次。回调只用于运行中的短命反馈;完整 stdout 仍会原样
503
+ 出现在返回的 `CommandResult` 里。provider 不支持真流时,至少会在命令结束后按完整
504
+ stdout 调用一次,不能静默丢掉。
505
+
506
+ #### `onStderr`
507
+
508
+ ```ts
509
+ onStderr?: (chunk: string) => void | Promise<void>;
510
+ ```
511
+
512
+ `onStdout` 的 stderr 对应物;完整 stderr 仍保留在 `CommandResult`。
513
+
461
514
  #### `root`
462
515
 
463
516
  ```ts
@@ -106,4 +106,4 @@ pricing?: Record<string, PriceOverride>;
106
106
 
107
107
  {/* GENERATED:END config-fields */}
108
108
 
109
- [NiceEval](https://niceeval.com/) 把环境准备放在普通代码里:eval 自己需要的文件写在 `test(t)`,agent 自己的准备写在 adapter 的 `setup`。sandbox 后端不再从环境变量自动探测,也没有对应的 CLI flag——用 `niceeval/sandbox` 里的 `dockerSandbox()` / `vercelSandbox()` / `e2bSandbox()` 构造后填进 `sandbox` 字段(可以直接写在 experiment 上,也可以只写在这里作为项目级兜底:`exp.sandbox ?? config.sandbox`)。
109
+ [NiceEval](https://niceeval.com/) 把环境准备放在普通代码里:eval 自己需要的文件写在 `test(t)`,agent 自己的准备写在 adapter 的 `setup`。sandbox provider 只来自代码里的 `sandbox` 字段,不做环境变量自动探测,也没有对应的 CLI flag——用 `niceeval/sandbox` 里的 `dockerSandbox()` / `vercelSandbox()` / `e2bSandbox()` 构造后填进 `sandbox` 字段(可以直接写在 experiment 上,也可以只写在这里作为项目级兜底:`exp.sandbox ?? config.sandbox`)。