niceeval 0.6.2 → 0.7.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (216) hide show
  1. package/INDEX.md +23 -23
  2. package/README.zh.md +6 -6
  3. package/dist/agents/types.d.ts +2 -2
  4. package/dist/i18n/zh-CN.d.ts +3 -3
  5. package/dist/report/aggregate.d.ts +32 -26
  6. package/dist/report/aggregate.js +157 -76
  7. package/dist/report/built-in/index.d.ts +2 -0
  8. package/dist/report/built-in/index.js +8 -0
  9. package/dist/report/components.d.ts +91 -164
  10. package/dist/report/components.js +377 -114
  11. package/dist/report/compute.d.ts +86 -73
  12. package/dist/report/compute.js +592 -432
  13. package/dist/report/flag.d.ts +28 -17
  14. package/dist/report/flag.js +86 -16
  15. package/dist/report/format.d.ts +11 -11
  16. package/dist/report/format.js +17 -15
  17. package/dist/report/index.d.ts +16 -17
  18. package/dist/report/index.js +20 -22
  19. package/dist/report/load.js +3 -2
  20. package/dist/report/locale.d.ts +49 -34
  21. package/dist/report/locale.js +106 -58
  22. package/dist/report/metrics.d.ts +10 -3
  23. package/dist/report/metrics.js +46 -12
  24. package/dist/report/primitives.d.ts +42 -15
  25. package/dist/report/primitives.js +135 -26
  26. package/dist/report/react/AttemptList.d.ts +10 -8
  27. package/dist/report/react/AttemptList.js +18 -10
  28. package/dist/report/react/DeltaTable.js +19 -18
  29. package/dist/report/react/EvalList.d.ts +3 -3
  30. package/dist/report/react/EvalList.js +0 -0
  31. package/dist/report/react/ExperimentComparison.d.ts +4 -2
  32. package/dist/report/react/ExperimentComparison.js +5 -4
  33. package/dist/report/react/ExperimentList.d.ts +3 -3
  34. package/dist/report/react/ExperimentList.js +16 -15
  35. package/dist/report/react/MetricBars.js +5 -4
  36. package/dist/report/react/MetricLine.js +12 -5
  37. package/dist/report/react/MetricMatrix.js +1 -1
  38. package/dist/report/react/MetricScatter.js +54 -17
  39. package/dist/report/react/MetricTable.js +2 -12
  40. package/dist/report/react/ScopeSummary.d.ts +10 -0
  41. package/dist/report/react/ScopeSummary.js +17 -0
  42. package/dist/report/react/Scoreboard.js +6 -6
  43. package/dist/report/react/cell.js +2 -2
  44. package/dist/report/react/fixtures.d.ts +5 -9
  45. package/dist/report/react/fixtures.js +105 -149
  46. package/dist/report/react/index.d.ts +15 -5
  47. package/dist/report/react/index.js +18 -7
  48. package/dist/report/report.d.ts +137 -20
  49. package/dist/report/report.js +261 -34
  50. package/dist/report/text/faces.d.ts +17 -19
  51. package/dist/report/text/faces.js +225 -157
  52. package/dist/report/text/plot.js +1 -1
  53. package/dist/report/text/table.js +2 -2
  54. package/dist/report/tree.d.ts +90 -40
  55. package/dist/report/tree.js +252 -94
  56. package/dist/report/types.d.ts +245 -300
  57. package/dist/report/types.js +4 -3
  58. package/dist/report/web.d.ts +21 -5
  59. package/dist/report/web.js +42 -16
  60. package/dist/results/select.d.ts +38 -16
  61. package/dist/results/select.js +73 -25
  62. package/dist/results/types.d.ts +38 -14
  63. package/dist/shared/aggregate.d.ts +3 -2
  64. package/dist/shared/aggregate.js +5 -4
  65. package/docs-site/zh/README.md +44 -0
  66. package/docs-site/zh/examples/ai-agent-application.mdx +63 -0
  67. package/docs-site/zh/examples/coding-agent-extensions.mdx +57 -0
  68. package/docs-site/zh/examples/index.mdx +50 -0
  69. package/docs-site/zh/{concepts → explanation}/adapter.mdx +11 -11
  70. package/docs-site/zh/{concepts → explanation}/assert.mdx +7 -7
  71. package/docs-site/zh/{concepts → explanation}/drive.mdx +8 -8
  72. package/docs-site/zh/{concepts → explanation}/evals.mdx +4 -4
  73. package/docs-site/zh/{concepts → explanation}/experiment.mdx +8 -8
  74. package/docs-site/zh/{concepts → explanation}/hitl.mdx +8 -8
  75. package/docs-site/zh/{concepts → explanation}/judge.mdx +5 -5
  76. package/docs-site/zh/{concepts → explanation}/overview.mdx +5 -5
  77. package/docs-site/zh/{guides → explanation}/runner.mdx +1 -1
  78. package/docs-site/zh/{concepts → explanation}/tier.mdx +6 -6
  79. package/docs-site/zh/{guides → how-to}/agent-feedback-loop.mdx +7 -7
  80. package/docs-site/zh/{guides → how-to}/authoring.mdx +2 -2
  81. package/docs-site/zh/{guides → how-to}/connect-otel.mdx +6 -6
  82. package/docs-site/zh/{guides → how-to}/connect-your-agent.mdx +18 -18
  83. package/docs-site/zh/{guides → how-to}/custom-reports.mdx +6 -6
  84. package/docs-site/zh/{guides → how-to}/experiments.mdx +3 -3
  85. package/docs-site/zh/{guides → how-to}/publish-report.mdx +2 -2
  86. package/docs-site/zh/{guides → how-to}/sandbox-agent.mdx +2 -2
  87. package/docs-site/zh/{guides → how-to}/sandbox-providers.mdx +1 -1
  88. package/docs-site/zh/{guides → how-to}/viewing-results.mdx +6 -6
  89. package/docs-site/zh/{guides → how-to}/write-experiment.mdx +3 -3
  90. package/docs-site/zh/{guides → how-to}/write-send.mdx +13 -13
  91. package/docs-site/zh/index.mdx +23 -25
  92. package/docs-site/zh/introduction.mdx +8 -8
  93. package/docs-site/zh/reference/builtin-agents.mdx +5 -5
  94. package/docs-site/zh/reference/capabilities.mdx +6 -6
  95. package/docs-site/zh/reference/cli.mdx +9 -7
  96. package/docs-site/zh/reference/define-agent.mdx +1 -1
  97. package/docs-site/zh/reference/events.mdx +3 -3
  98. package/docs-site/zh/{guides → reference}/official-adapters.mdx +7 -7
  99. package/docs-site/zh/{guides → reference}/report-components.mdx +5 -5
  100. package/docs-site/zh/{guides → reference}/results-data.mdx +5 -5
  101. package/docs-site/zh/{guides → troubleshooting}/debug-sandbox.mdx +2 -2
  102. package/docs-site/zh/{guides → troubleshooting}/debugging.mdx +4 -2
  103. package/docs-site/zh/{quickstart.mdx → tutorials/quickstart.mdx} +5 -17
  104. package/package.json +6 -2
  105. package/src/agents/index.ts +2 -2
  106. package/src/agents/openai-compat.ts +1 -1
  107. package/src/agents/streaming.ts +2 -2
  108. package/src/agents/types.ts +3 -3
  109. package/src/cli.ts +42 -23
  110. package/src/context/context.ts +1 -1
  111. package/src/context/session.test.ts +1 -1
  112. package/src/context/session.ts +1 -1
  113. package/src/i18n/en.ts +18 -16
  114. package/src/i18n/zh-CN.ts +16 -15
  115. package/src/report/aggregate.ts +175 -87
  116. package/src/report/built-in/index.tsx +9 -0
  117. package/src/report/components.tsx +625 -285
  118. package/src/report/compute.ts +717 -515
  119. package/src/report/dual-render.test.tsx +738 -1148
  120. package/src/report/flag.ts +97 -33
  121. package/src/report/format.ts +18 -22
  122. package/src/report/index.ts +113 -58
  123. package/src/report/load.ts +3 -2
  124. package/src/report/locale.ts +120 -69
  125. package/src/report/metrics.ts +42 -12
  126. package/src/report/primitives.tsx +190 -45
  127. package/src/report/react/AttemptList.tsx +32 -20
  128. package/src/report/react/DeltaTable.tsx +63 -45
  129. package/src/report/react/EvalList.tsx +0 -0
  130. package/src/report/react/ExperimentComparison.tsx +12 -7
  131. package/src/report/react/ExperimentList.tsx +38 -26
  132. package/src/report/react/MetricBars.tsx +5 -4
  133. package/src/report/react/MetricLine.tsx +13 -8
  134. package/src/report/react/MetricMatrix.tsx +2 -2
  135. package/src/report/react/MetricScatter.tsx +74 -20
  136. package/src/report/react/MetricTable.tsx +4 -76
  137. package/src/report/react/ScopeSummary.tsx +86 -0
  138. package/src/report/react/Scoreboard.tsx +28 -10
  139. package/src/report/react/cell.tsx +2 -2
  140. package/src/report/react/enhance.js +57 -5
  141. package/src/report/react/fixtures.ts +109 -156
  142. package/src/report/react/index.tsx +24 -39
  143. package/src/report/react/render.test.tsx +139 -104
  144. package/src/report/react/styles.css +181 -91
  145. package/src/report/report.test.ts +761 -1031
  146. package/src/report/report.ts +425 -47
  147. package/src/report/text/faces.ts +257 -164
  148. package/src/report/text/plot.ts +1 -1
  149. package/src/report/text/table.ts +2 -2
  150. package/src/report/tree.ts +362 -104
  151. package/src/report/types.ts +257 -287
  152. package/src/report/web.ts +63 -20
  153. package/src/results/attempt-evidence.test.ts +4 -4
  154. package/src/results/attempt-evidence.ts +5 -5
  155. package/src/results/copy.ts +6 -6
  156. package/src/results/host-equivalence.test.ts +26 -14
  157. package/src/results/index.ts +10 -4
  158. package/src/results/open.ts +8 -4
  159. package/src/results/results.test.ts +4 -3
  160. package/src/results/select.ts +104 -34
  161. package/src/results/types.ts +36 -14
  162. package/src/runner/feedback/human.test.ts +1 -1
  163. package/src/runner/run.ts +1 -1
  164. package/src/sandbox/cli-commands.ts +2 -2
  165. package/src/scoring/judge.test.ts +1 -1
  166. package/src/shared/aggregate.ts +5 -4
  167. package/src/show/compose.ts +50 -67
  168. package/src/show/index.ts +107 -56
  169. package/src/show/render.ts +43 -27
  170. package/src/show/report-host.test.ts +188 -0
  171. package/src/show/report-host.ts +375 -0
  172. package/src/show/show.test.ts +86 -36
  173. package/src/view/app/App.test.tsx +69 -0
  174. package/src/view/app/App.tsx +144 -48
  175. package/src/view/app/components/AttemptModal.tsx +324 -63
  176. package/src/view/app/components/CodeView.tsx +10 -4
  177. package/src/view/app/i18n.ts +31 -17
  178. package/src/view/app/main.tsx +13 -8
  179. package/src/view/app/pages/{RunsPage.tsx → AttemptsPage.tsx} +6 -6
  180. package/src/view/app/types.ts +4 -1
  181. package/src/view/client-dist/app.css +1 -1
  182. package/src/view/client-dist/app.js +14 -14
  183. package/src/view/data.test.ts +9 -3
  184. package/src/view/data.ts +145 -49
  185. package/src/view/index.ts +48 -44
  186. package/src/view/server.ts +35 -15
  187. package/src/view/shared/types.ts +34 -5
  188. package/src/view/styles.css +224 -0
  189. package/src/view/view-report.test.ts +161 -57
  190. package/dist/report/built-ins/experiment-comparison.d.ts +0 -39
  191. package/dist/report/built-ins/experiment-comparison.js +0 -119
  192. package/dist/report/built-ins/index.d.ts +0 -2
  193. package/dist/report/built-ins/index.js +0 -2
  194. package/dist/report/react/GroupSummary.d.ts +0 -8
  195. package/dist/report/react/GroupSummary.js +0 -8
  196. package/dist/report/react/RunOverview.d.ts +0 -8
  197. package/dist/report/react/RunOverview.js +0 -12
  198. package/docs-site/zh/example/ai-agent-application.mdx +0 -152
  199. package/docs-site/zh/example/claude-code-codex-plugin.mdx +0 -167
  200. package/docs-site/zh/example/claude-code-codex-skill.mdx +0 -152
  201. package/docs-site/zh/example/showcase.mdx +0 -39
  202. package/src/report/built-in-user-parity.test.tsx +0 -597
  203. package/src/report/built-ins/experiment-comparison.tsx +0 -179
  204. package/src/report/built-ins/index.ts +0 -7
  205. package/src/report/react/GroupSummary.tsx +0 -66
  206. package/src/report/react/RunOverview.tsx +0 -109
  207. /package/docs-site/zh/{example/tier1-ai-sdk-v7.mdx → examples/integrations/ai-sdk-v7.mdx} +0 -0
  208. /package/docs-site/zh/{example/tier1-claude-sdk.mdx → examples/integrations/claude-sdk.mdx} +0 -0
  209. /package/docs-site/zh/{example/tier1-codex-sdk.mdx → examples/integrations/codex-sdk.mdx} +0 -0
  210. /package/docs-site/zh/{example/tier1-langgraph.mdx → examples/integrations/langgraph.mdx} +0 -0
  211. /package/docs-site/zh/{example/tier1-pi-sdk.mdx → examples/integrations/pi-sdk.mdx} +0 -0
  212. /package/docs-site/zh/{guides → how-to}/ci-integration.mdx +0 -0
  213. /package/docs-site/zh/{guides → how-to}/dataset-fanout.mdx +0 -0
  214. /package/docs-site/zh/{guides → how-to}/fixtures.mdx +0 -0
  215. /package/docs-site/zh/{guides → how-to}/reporters.mdx +0 -0
  216. /package/docs-site/zh/{guides → how-to}/scoring-guide.mdx +0 -0
@@ -1,30 +1,34 @@
1
- // niceeval/report 的公开类型:指标(Metric)、维度(Dimension / flag())与计算函数
2
- // 产物(即组件的 data props)。数据契约照 docs/feature/reports/library.md「数据计算与缓存边界」;
3
- // 这些不是持久化格式,没有 format / schemaVersion 信封,兼容性跟随 npm 版本。
1
+ // niceeval/report 的公开类型:指标(Metric)、维度(Dimension / flag() / runConfig())与
2
+ // 计算函数产物(即组件的 data)。数据契约照 docs/feature/reports/library/ 各分篇;
3
+ // 这些不是持久化格式,没有 format / schemaVersion 信封,兼容性跟随 npm 版本
4
+ // (组件消费 data 时校验结构,不符按完整用户反馈报错并提示版本漂移)。
4
5
 
5
- import type { AttemptHandle, SelectionWarning } from "../results/types.ts";
6
+ import type { AttemptHandle, Scope, ScopeWarning, Snapshot } from "../results/types.ts";
6
7
  import type { AttemptLocator } from "../results/locator.ts";
7
- import type { AssertionResult, AttemptError, DiagnosticRecord, Verdict } from "../types.ts";
8
- import type { LocalizedLabel, ReportLocale } from "./locale.ts";
8
+ import type { ExperimentRunInfo, JsonValue, Verdict } from "../types.ts";
9
+ import type { LocalizedText, ReportLocale } from "./locale.ts";
9
10
 
10
- export type { SelectionWarning };
11
+ export type { ScopeWarning };
11
12
  export type { AttemptLocator };
12
- export type { LocalizedLabel, ReportLocale };
13
+ export type { LocalizedText, ReportLocale };
14
+
15
+ /** 所有官方计算函数的第一参:Scope(warnings 随行)或手工挑的快照数组(没有挑选过程,自然无警告)。 */
16
+ export type ReportInput = Scope | readonly Snapshot[];
13
17
 
14
18
  // ───────────────────────── 指标与聚合 ─────────────────────────
15
19
 
16
20
  /** 两级聚合里单级的折叠方式。 */
17
- export type Aggregator = "mean" | "sum" | "min" | "max" | ((values: number[]) => number);
21
+ export type Aggregator = "mean" | "sum" | "min" | "max" | ((values: readonly number[]) => number);
18
22
 
19
23
  /**
20
24
  * 两级聚合:「每格 attempt 数相等」是幻觉(earlyExit 让失败的题天然比通过的题样本多),
21
25
  * 平铺求均值会让分数和重试策略纠缠;所以先题内折叠、再跨题折叠,默认宏平均。
22
26
  */
23
27
  export interface MetricAggregate {
24
- /** 第一级:同一 (eval × 快照) 的多 attempt 一个题级值;默认 "mean"。 */
28
+ /** 第一级:同一 experiment × eval 的多个 attempt 先折成题级值;默认 "mean"。 */
25
29
  perEval?: Aggregator;
26
- /** 第二级:分组内的题级值 格子终值;默认 "mean"。 */
27
- across?: Aggregator;
30
+ /** 第二级:题级值再跨 experiment × eval 折成终值;默认 "mean"。 */
31
+ acrossEvals?: Aggregator;
28
32
  }
29
33
 
30
34
  /**
@@ -36,16 +40,13 @@ export interface MetricAggregate {
36
40
  export interface Metric<Name extends string = string> {
37
41
  /** MetricColumn.key 与列头的来源;同一次计算里重名是错误。 */
38
42
  name: Name;
39
- /**
40
- * 列头;省略时用 name。可以给按 locale 的字典({ en, "zh-CN" }),
41
- * 渲染面按宿主 locale 解析,缺项回退 en(display 是 format 产物,不本地化)。
42
- */
43
- label?: LocalizedLabel;
44
- description?: string;
45
- /** 渲染提示:越高越好还是越低越好(排序方向、轴向、涨跌配色用)。 */
46
- better?: "higher" | "lower";
43
+ /** 列头;省略时用 name。渲染面按 locale 解析,缺项走 LocalizedText 回退规则。 */
44
+ label?: LocalizedText;
45
+ description?: LocalizedText;
47
46
  /** 驱动内置格式化:"%" → 87%、"ms" → 1.2s、"$" → $0.31、其余 → 1.2k 缩写。 */
48
47
  unit?: string;
48
+ /** 渲染提示:越高越好还是越低越好(排序方向、轴向、涨跌配色用)。 */
49
+ better?: "higher" | "lower";
49
50
  /**
50
51
  * 声明式前置:不满足 → null,语义等价于在 value 开头 return null。
51
52
  * 单独设字段是因为这一步最容易忘(忘了它,code-golf 会奖励「写得短的坏代码」)。
@@ -53,65 +54,71 @@ export interface Metric<Name extends string = string> {
53
54
  where?: (attempt: AttemptHandle) => boolean;
54
55
  value(attempt: AttemptHandle): number | null | Promise<number | null>;
55
56
  aggregate?: MetricAggregate;
56
- /** 覆盖 unit 驱动的内置格式化。 */
57
- display?: (value: number) => string;
57
+ /** 覆盖 unit 驱动的内置格式化;只格式化同一个终值,不按 locale 分裂计算口径。 */
58
+ display?: (value: number, locale: ReportLocale) => string;
58
59
  }
59
60
 
60
- // ───────────────────────── 维度 ─────────────────────────
61
+ // ───────────────────────── 维度与数值轴 ─────────────────────────
61
62
 
62
63
  /**
63
- * 维度:attempt 分到哪一组。内置维度就是结果已有的身份字段;自定义维度是一个函数。
64
- * - "evalGroup" = eval id 的第一段:"algebra/quadratic" → "algebra"(考试里的「科目」)
65
- * - "snapshot" = "<experimentId> @ <startedAt>",把两次快照并排成行,与 view 的 Compare 同口径
64
+ * 内置维度就是结果已有的身份字段。
65
+ * - "evalGroup" = eval id 的完整父路径("a/b/c" → "a/b";无 "/" 取完整 id,与可比组同一条派生规则)
66
+ * - "snapshot" = "<experimentId> @ <startedAt>",把两次快照并排成行
66
67
  */
67
- export type Dimension =
68
- | "agent"
69
- | "model"
70
- | "experiment"
71
- | "eval"
72
- | "evalGroup"
73
- | "snapshot"
74
- | { name: string; of: (attempt: AttemptHandle) => string };
68
+ export type BuiltInDimension = "agent" | "model" | "experiment" | "eval" | "evalGroup" | "snapshot";
75
69
 
76
- /**
77
- * flag() 的产物:把 experiment 声明的 flags 当维度(series / rows / columns / points
78
- * 槽,按声明值分组)或轴(MetricLine 的 x 槽,要求数值并驱动刻度)。
79
- * 未声明该 flag 的 experiment 不猜:分组如实归「(unset)」,作轴不画点、注脚报数。
80
- */
81
- export interface FlagRef {
82
- readonly kind: "flag";
83
- readonly name: string;
84
- /** 组标签 / 轴标签;函数形态把声明值折成组名(如 `(v) => \`${v} agents\``)。 */
85
- readonly label?: string | ((value: string | number | boolean) => string);
86
- readonly unit?: string;
70
+ /** 自定义维度:一个函数把 attempt 分到组。 */
71
+ export interface CustomDimension {
72
+ name: string;
73
+ of(attempt: AttemptHandle): string;
87
74
  }
88
75
 
89
76
  /**
90
- * config() 的产物:把顶层运行配置(快照 `ExperimentRunInfo` 投影的字段全集,外加桥接到
91
- * 快照顶层权威字段的 `model` / `agent` 两个键)当维度或轴,槽位用法与 {@link FlagRef} 一致。
92
- * 未投影的值不猜:分组如实归「(unset)」,作轴不画点、注脚报数。
77
+ * flag() / runConfig() 的产物:把 experiment 声明的 flag 或顶层运行配置当分组维度。
78
+ * 读取的 JSON 值可能是任意形状,分组显示键按稳定 JSON 规则生成;缺失值显示内置文案
79
+ * `(missing)`,不同原始值撞出同一显示键时计算报错并要求改用 CustomDimension。
93
80
  */
94
- export interface ConfigRef {
95
- readonly kind: "config";
81
+ export interface DimensionRef {
82
+ readonly kind: "flag" | "runConfig";
96
83
  readonly name: string;
97
- /** 组标签 / 轴标签;函数形态把投影值折成组名。 */
98
- readonly label?: string | ((value: string | number | boolean) => string);
84
+ readonly label?: LocalizedText;
99
85
  readonly unit?: string;
100
86
  }
101
87
 
102
- /** MetricLine x 轴输入:experiment 声明的 flag,或顶层运行配置(config())。 */
103
- export type AxisInput = FlagRef | ConfigRef;
88
+ /** 维度槽的输入:内置维度、自定义维度,或 flag() / runConfig() 的产物。 */
89
+ export type DimensionInput = BuiltInDimension | CustomDimension | DimensionRef;
90
+
91
+ /** MetricLine 的 x 轴:必须是数值;字符串配置显式映射,组件不猜 low < medium < high。 */
92
+ export interface NumericAxis {
93
+ name: string;
94
+ label?: LocalizedText;
95
+ unit?: string;
96
+ of(attempt: AttemptHandle): number | null;
97
+ }
98
+
99
+ export interface DimensionOptions {
100
+ label?: LocalizedText;
101
+ unit?: string;
102
+ }
103
+
104
+ export interface NumericAxisOptions extends DimensionOptions {}
105
+
106
+ export interface NumericRunConfigAxisOptions extends NumericAxisOptions {
107
+ /** 字符串配置到数值轴的显式映射;数值配置不需要。 */
108
+ map?: Readonly<Record<string, number>>;
109
+ }
104
110
 
105
- /** 维度槽的输入:内置/自定义维度、experiment 声明的 flag,或顶层运行配置(config())。 */
106
- export type DimensionInput = Dimension | FlagRef | ConfigRef;
111
+ /** runConfig() 的可用键:ExperimentRunInfo 字段全集,外加桥接到快照顶层权威字段的 model / agent。 */
112
+ export type RunConfigKey = keyof ExperimentRunInfo | "model" | "agent";
107
113
 
108
- // ───────────────────────── 计算产物(组件 data props)─────────────────────────
114
+ // ───────────────────────── 计算产物(组件 data)─────────────────────────
109
115
 
110
116
  export interface MetricColumn {
111
117
  /** = metric.name,与 cells 的键对应。 */
112
118
  key: string;
113
- /** 数据层原样携带 metric.label(可本地化);渲染面用 resolveMetricLabel 按 locale 解析。 */
114
- label: LocalizedLabel;
119
+ /** 数据层原样携带 metric.label(可本地化);渲染面按 locale 解析。 */
120
+ label: LocalizedText;
121
+ description?: LocalizedText;
115
122
  unit?: string;
116
123
  /** 渲染提示:排序方向、轴向、涨跌配色。 */
117
124
  better?: "higher" | "lower";
@@ -120,318 +127,281 @@ export interface MetricColumn {
120
127
  export interface MetricCell {
121
128
  /** 聚合后的值;null = 该组没有任何有效样本。 */
122
129
  value: number | null;
123
- /** 已格式化("87%" / "1.2k lines" / "$0.31"),前端可直接渲染。 */
124
- display: string;
125
- /** 有效 attempt 数(值为 null 的不计入) */
130
+ /**
131
+ * 已格式化的显示值;计算函数为官方生成面覆盖的每个 locale(当前 en、zh-CN)生成,
132
+ * renderer LocalizedText 回退规则选择,其它 locale 回退 en
133
+ */
134
+ display: LocalizedText;
135
+ /** 有效 attempt 数(指标返回非 null 的 attempt)。 */
126
136
  samples: number;
127
- /** 组内 attempt 总数;samples < total = 有 attempt 测不了这个指标。 */
137
+ /** 本格子覆盖的 attempt 总数,包含值为 null attempt */
128
138
  total: number;
129
139
  /**
130
- * 这个格子由哪些 attempt 算出 —— 回到证据的引用。必填(可空数组):
140
+ * 本格子覆盖的全部 attempt(包含指标值为 null 的证据)—— 回到证据的引用。必填(可空数组):
131
141
  * 「每个数字点进去就是证据」是页面的核心承诺,可选字段会让深链静默缺失。
132
142
  */
133
143
  refs: AttemptLocator[];
134
144
  }
135
145
 
136
146
  /**
137
- * 榜单行的元信息:rows: "experiment" 时随行(experiment 行天然有唯一的 agent/model 身份、
138
- * eval 级折叠计票与「这行覆盖了多少题/多少次尝试/最近何时跑的」);其它维度不携带。
139
- * web / text 面在 meta 在场时补 Model / Agent / Verdicts 列,`evals`/`attempts`/
140
- * `lastRunAt` 则渲染成行键下的一行紧凑摘要——与 view 原生榜单同一份信息密度。
141
- * `MetricTable` 只表达维度 × 指标,没有实体下钻——要展开到 experiment 的 Eval 或
142
- * Eval 的 Attempt,用 `ExperimentList` / `EvalList`,这里不再有 `subRows`。
147
+ * 数据形状的字段命名规则(docs/feature/reports/library/metric-views.md「共用数据形状」):
148
+ * 维度名字段 = 产生它的选项名 + `Dimension` 后缀,值是解析后的维度 name;
149
+ * 条目数组一律叫 `rows`(Matrix 的稀疏格子叫 `cells`);条目内的 key / series 是维度值,不带后缀。
143
150
  */
144
- export interface TableRowMeta<K extends string = string> {
145
- agent?: string;
146
- model?: string;
147
- /** eval 级折叠计票(foldEvalVerdict 口径,与 view 榜单同一套):每题折成单一判定后计数。 */
148
- verdicts?: { passed: number; failed: number; errored: number; skipped: number };
149
- /**
150
- * `rows: "experiment"` 专属:这一行覆盖的 eval 数(去重后,summarizeItems 口径,与
151
- * `verdicts` 四项之和一致)。其它行维度(agent/eval/自定义…)没有「这一行是几道题」的
152
- * 独立语义(题本身就是行),不携带这个字段。
153
- */
154
- evals?: number;
155
- /**
156
- * `rows: "experiment"` 专属:这一行覆盖的 attempt 总数(原始计数,含多轮重试)。
157
- * 大于 `evals` 说明存在多轮重试(early-exit 复测 / flaky 重跑);等于 `evals` 说明
158
- * 每题只跑了一轮。同上,只在 `rows: "experiment"` 时语义成立。
159
- */
160
- attempts?: number;
161
- /**
162
- * `rows: "experiment"` 专属:这一行覆盖范围内快照 `startedAt` 的最大值(最近一次运行
163
- * 时间,ISO 8601,字符串比较即可比大小)。组内没有任何 item 时缺席。
164
- */
165
- lastRunAt?: string;
166
- }
167
-
168
- /** 列键 K 来自 columns 元组的字面量 name:拼错列名编译不过,不是运行时 undefined。 */
169
- export interface TableData<K extends string = string> {
170
- /** 行维度名,如 "agent"。 */
171
- dimension: string;
151
+ export interface TableData {
152
+ rowDimension: string;
172
153
  columns: MetricColumn[];
173
- rows: { key: string; cells: Record<K, MetricCell>; meta?: TableRowMeta<K> }[];
154
+ rows: Array<{
155
+ key: string;
156
+ cells: Record<string, MetricCell>;
157
+ }>;
174
158
  }
175
159
 
176
160
  export interface MatrixData {
177
- /** 行维度名,如 "eval"。 */
178
- rows: string;
179
- /** 列维度名,如 "agent"。 */
180
- columns: string;
161
+ rowDimension: string;
162
+ columnDimension: string;
181
163
  metric: MetricColumn;
182
- /** 稀疏:没有样本的格子不出现。 */
183
- cells: { row: string; column: string; cell: MetricCell }[];
184
- }
185
-
186
- export interface ScoreboardData {
187
- /**
188
- * 被打分的维度名,如 "agent"。
189
- * (计算函数的维度槽叫 rows,与 MetricTable.data 统一;数据形状上行数组已占用
190
- * rows 一词,维度名沿用 TableData 的 dimension。)
191
- */
192
- dimension: string;
193
- fullMarks: number;
194
- /** 实际生效的权重表(按匹配顺序:最长前缀在前)—— 成绩单可审计。 */
195
- weights: { prefix: string; weight: number }[];
196
- rows: {
197
- key: string;
198
- /** 已折算到 fullMarks。 */
199
- total: { value: number; display: string };
200
- subjects: {
201
- /** 科目(subjects 维度的值)。 */
202
- key: string;
203
- /** 加权得分。 */
204
- earned: number;
205
- /** 科目分值合计。 */
206
- possible: number;
207
- /** 题数。 */
208
- evals: number;
209
- /** 无任何样本、按 0 计的题数 —— 固定分母的如实注脚。 */
210
- missing: number;
211
- }[];
212
- }[];
164
+ /** 稀疏格子:没有 attempt 的组合不生成格子。 */
165
+ cells: Array<{ row: string; column: string; cell: MetricCell }>;
213
166
  }
214
167
 
215
168
  export interface ScatterData {
216
- /** 点维度名,如 "experiment"。 */
217
- points: string;
218
- /** 系列维度名,如 "agent"。 */
219
- series?: string;
220
- /** better: "lower" → 组件反向画轴,「好」的角落恒在右上。 */
169
+ pointDimension: string;
170
+ seriesDimension?: string;
171
+ /** 轴方向跟随 better:lower 反向渲染(值大在左/下),「更好」恒指向右上;刻度显示真实值。 */
221
172
  x: MetricColumn;
222
173
  y: MetricColumn;
223
- rows: {
224
- /** 点的键,如 "compare/bub-high"。 */
174
+ rows: Array<{
225
175
  key: string;
226
- /** 所属系列,如 "bub"。 */
227
176
  series?: string;
228
177
  x: MetricCell;
229
178
  /** 任一为 null 的点组件不画,注脚如实报数(点仍留在 rows 里,可数)。 */
230
179
  y: MetricCell;
231
- }[];
232
- }
233
-
234
- /** MetricLine 的 x 轴:experiment 声明的 flag,数值驱动刻度。 */
235
- export interface LineAxis {
236
- /** flag 名。 */
237
- key: string;
238
- label: string;
239
- unit?: string;
180
+ }>;
240
181
  }
241
182
 
242
183
  export interface LineData {
243
- x: LineAxis;
244
- /** 系列维度名(flag 或普通维度)。 */
245
- series?: string;
184
+ x: { key: string; label: LocalizedText; unit?: string };
185
+ seriesDimension?: string;
246
186
  y: MetricColumn;
247
- rows: {
248
- /** 点的键(experiment id):每个点 = 一个 experiment 的聚合。 */
187
+ rows: Array<{
188
+ /** 点身份 = (series, x):x 值的稳定十进制字符串,同一 series 内唯一。 */
249
189
  key: string;
250
190
  series?: string;
251
- /** flag 声明值;未声明或非数值 → null,点不画、注脚报数。 */
252
191
  x: number | null;
253
- /** 已格式化的 x("300 ms");x 为 null 时为空串。 */
254
- xDisplay: string;
192
+ xDisplay: LocalizedText;
255
193
  y: MetricCell;
256
- }[];
257
- }
258
-
259
- /**
260
- * 一组 experiment(如自定义报告里同一 `<Section>` 内的全部 experiment)的摘要:
261
- * experiment/eval/attempt 数量、eval 级折叠计票、通过率、总成本、最后运行时间——
262
- * 恢复旧 `GroupSelector` 卡片曾展示的信息密度,但通过率是官方 `MetricCell` 形态,
263
- * 不是裸数字,渲染面不用另外拼格式。
264
- */
265
- export interface GroupSummaryData {
266
- /** 组内 experiment 数(去重后的 experimentId 个数)。 */
267
- experiments: number;
268
- /**
269
- * 组内 eval 数,按完整身份键(experimentId + eval id)去重——多 experiment 的组里
270
- * 两个 experiment 各自的同名 eval(如都叫 "algebra/a")算两道题,不会被误合并成一道。
271
- */
272
- evals: number;
273
- /** 组内 attempt 总数(原始计数,一轮 attempt 一票,不折叠)。 */
274
- attempts: number;
275
- /**
276
- * eval 级折叠计票:同一 eval 的多轮 attempt 先折成一个判定(`foldEvalVerdict`,任一轮
277
- * 通过则通过,否则取最严重的),再计数——与 `TableRowMeta.verdicts`、view 榜单同一口径,
278
- * 不是 attempt 原始票数的直接计票。
279
- */
280
- verdicts: { passed: number; failed: number; errored: number; skipped: number };
281
- /**
282
- * 组的通过率:eval 级折叠计票的 `passed / (passed + failed + errored)`(`skipped` 不进
283
- * 分母)——这是旧 `GroupSelector` 卡片的口径,不是 `OverviewData.totals.passRate` 那种
284
- * `computeCell` 两级聚合(两者服务不同问题:「这组题多少算过」vs「每次运行成功多少」)。
285
- * 分母为 0(组内没有任何已跑的 eval)时 `value` 为 `null`,不编 0%。
286
- */
287
- passRate: MetricCell;
288
- /** 组内可测成本(`attemptCostUSD`)求和;一次 attempt 都没报成本 = `null`,不编 `0`。 */
289
- totalCostUSD: number | null;
290
- /** 组内快照 `startedAt` 的最大值(字符串比较,ISO 8601 天然可比);组内没有任何 item 时缺席。 */
291
- lastRunAt?: string;
194
+ }>;
292
195
  }
293
196
 
294
- export interface OverviewData {
295
- snapshots: { experimentId: string; agent: string; model?: string; startedAt: string }[];
296
- totals: {
297
- evals: number;
298
- attempts: number;
299
- /**
300
- * 四个 attempt 原始判定计票(一个 attempt 一票),独立于 `passRate`:驱动页头的
301
- * 判定计数展示,不是通过率公式的输入——不要从这四个数现场重算百分比。
302
- */
303
- passed: number;
304
- failed: number;
305
- errored: number;
306
- skipped: number;
307
- /**
308
- * 默认成功率的唯一官方口径:`computeCell(endToEndPassRate, items)`,与 `MetricTable.data(...,
309
- * columns: [endToEndPassRate])` 同一台两级聚合引擎(题内折叠 perEval、跨题折叠 across,默认都是
310
- * mean)——一道题内多个 attempt 部分通过,贡献的是小数份额而不是二元票。`samples`/`total`
311
- * 是两级聚合口径下的 attempt 计数(`total` 含 skipped 与 errored——endToEndPassRate 对
312
- * errored 记 0、只对 skipped 记 null,`samples` 因此只不含 skipped),不等于上面四个
313
- * verdict 计票的任何一个之和。
314
- */
315
- passRate: MetricCell;
316
- /** 任一 attempt 报了成本才有;全缺 = null,不编 0。 */
317
- costUSD: number | null;
318
- durationMs: number;
319
- };
320
- /** Selection 的警告随行(结构化,含渲染好的 message),RunOverview 直接渲染。 */
321
- warnings: SelectionWarning[];
197
+ export interface ScoreboardData {
198
+ rowDimension: string;
199
+ questions: string[];
200
+ fullMarks: number;
201
+ /** 实际生效的权重表(最长前缀在前)—— 成绩单可审计。 */
202
+ weights: Array<{ prefix: string; weight: number }>;
203
+ /** Scope 中存在但不在题集内、被忽略的 eval 数(注脚显示) */
204
+ ignoredEvals: number;
205
+ rows: Array<{
206
+ key: string;
207
+ total: {
208
+ /** fullMarks × earned / possible。 */
209
+ value: number;
210
+ display: LocalizedText;
211
+ /** 题集中该行完全没有 attempt 的题数( 0 计,分开计数) */
212
+ notRun: number;
213
+ /** attempt 但指标为 null(测不了)的题数(按 0 计,分开计数)。 */
214
+ unscorable: number;
215
+ refs: AttemptLocator[];
216
+ };
217
+ subjects: Array<{
218
+ key: string;
219
+ /** 加权后的 [0, 1] 题目分数之和。 */
220
+ earned: number;
221
+ /** 本分科题目的权重之和。 */
222
+ possible: number;
223
+ questions: number;
224
+ notRun: number;
225
+ unscorable: number;
226
+ display: LocalizedText;
227
+ refs: AttemptLocator[];
228
+ }>;
229
+ }>;
322
230
  }
323
231
 
324
- export interface DeltaData<K extends string = string> {
232
+ export interface DeltaData {
233
+ byDimension: string;
325
234
  columns: MetricColumn[];
326
- rows: {
327
- /** pair 的 label,如 "bub"。 */
235
+ /** FlagPairs 派生形态下的配对域实验数;字面 pairs 不携带(空态文案用)。 */
236
+ experiments?: number;
237
+ rows: Array<{
328
238
  key: string;
329
- /** 基线侧:experiment id 或快照键 "<experimentId> @ <startedAt>"。 */
330
- a: { experimentId: string };
331
- /** 对比侧。 */
332
- b: { experimentId: string };
239
+ /** 作者在 DeltaPair 里声明(或派生规则生成)的 label,原样透传;renderer 据此显示行名。 */
240
+ label: LocalizedText;
241
+ a: { key: string };
242
+ b: { key: string };
333
243
  cells: Record<
334
- K,
244
+ string,
335
245
  {
336
246
  a: MetricCell;
337
247
  b: MetricCell;
338
- /** b.value - a.value;任一侧 null → null,不硬算。 */
248
+ /** b.value - a.value;任一侧缺失则为 null */
339
249
  delta: number | null;
340
- /** 已带符号("+12%" / "-$0.80" / "±0"),涨跌好坏由 better 判定。 */
341
- display: string;
250
+ display: LocalizedText;
251
+ outcome: "improved" | "regressed" | "unchanged" | "unavailable";
342
252
  }
343
253
  >;
344
- }[];
254
+ }>;
255
+ }
256
+
257
+ export interface DeltaPair {
258
+ label: LocalizedText;
259
+ a: string;
260
+ b: string;
261
+ }
262
+
263
+ /** pairsByFlag() 的产物:按一个 flag 机械导出全部 A/B 对;只在 by 为 "experiment" 时成立。 */
264
+ export interface FlagPairs {
265
+ readonly kind: "flagPairs";
266
+ readonly flag: string;
267
+ /** a 侧的 flag 取值;缺省表示「未声明该 flag」的实验作 a。 */
268
+ readonly baseline?: JsonValue;
269
+ }
270
+
271
+ // ───────────────────────── 概览(ScopeSummary / ExperimentComparison)─────────────────────────
272
+
273
+ export interface VerdictTally {
274
+ passed: number;
275
+ failed: number;
276
+ errored: number;
277
+ skipped: number;
278
+ }
279
+
280
+ /**
281
+ * 一个范围的摘要:快照时间窗、experiment / eval / attempt 数、两级判定计票、端到端成功率
282
+ * 和总成本。eval 的身份键是 experimentId + evalId;data 恒携带两级计票,渲染面显示哪一级
283
+ * 由呈现 prop `votes` 决定,不改变 data(docs/feature/reports/library/summaries.md)。
284
+ */
285
+ export interface ScopeSummaryData {
286
+ /** 贡献当前数据的快照时间范围;空范围为 null,不编造当前时间。 */
287
+ range: { earliestStartedAt: string | null; latestStartedAt: string | null };
288
+ experiments: number;
289
+ /** experimentId + evalId 的去重计数,与 evalVerdicts 同分母。 */
290
+ evals: number;
291
+ attempts: number;
292
+ /** 每个 experimentId + evalId 先折成最终 verdict 后计票。 */
293
+ evalVerdicts: VerdictTally;
294
+ /** attempt 原始计票,不折叠。 */
295
+ attemptVerdicts: VerdictTally;
296
+ /** 官方两级 endToEndPassRate,不从任一计票重算。 */
297
+ endToEndPassRate: MetricCell;
298
+ /** costUSD 按 attempt 求和;缺失成本不伪造为 0。 */
299
+ totalCostUSD: MetricCell;
300
+ }
301
+
302
+ /** 一个可比组的数据;三个子块都只消费本组快照,不能含其它父目录的引用。 */
303
+ export interface ExperimentComparisonGroupData {
304
+ /** experiment id 的完整父路径;根目录 experiment 使用完整 id。 */
305
+ key: string;
306
+ summary: ScopeSummaryData;
307
+ scatter: ScatterData;
308
+ experiments: ExperimentListItem[];
309
+ }
310
+
311
+ export interface ExperimentComparisonData {
312
+ groups: ExperimentComparisonGroupData[];
345
313
  }
346
314
 
347
315
  // ───────────────────────── 实体列表(ExperimentList / EvalList / AttemptList)─────────────────────────
348
316
  //
349
317
  // 三个组件按「experiment → experimentId × eval → attempt」逐级下钻,固定展示实体事实,
350
- // 没有列配置(docs/feature/reports/library.md「实体列表」)。每一级都以下一级的 `AttemptListItem[]`
351
- // 收尾——同一个类型既是 `AttemptList` 自己的 items,也是 `ExperimentListEvalRow.attempts` /
352
- // `EvalListItem.attempts` 的元素,报告作者可以直接把这些嵌套数组喂给 `<AttemptList items={...} />`。
318
+ // 没有列配置。每一级都以下一级的 `AttemptListItem[]` 收尾——同一个类型既是 `AttemptList`
319
+ // 自己的 data,也是 `ExperimentListEvalRow.attempts` / `EvalListItem.attempts` 的元素。
353
320
 
354
321
  /**
355
- * `AttemptList` 一项 = 一个 Attempt:身份、判定、断言、结构化 error、diagnostics、耗时、
356
- * 成本和 locator。`ExperimentList` / `EvalList` 的下钻数组复用同一个类型,不是各自的精简版。
357
- * 渲染面只显示一条主失败断言摘要或 error 的一层摘要;完整 assertions、cause / stack 与
358
- * diagnostics 属于 locator 下钻详情,不塞进比较列表,但随数据携带 —— `AttemptList.data` 的 `redact`
359
- * 钩子覆盖它们的自由文本(见 docs/feature/reports/library.md「AttemptList」)。
322
+ * `AttemptList` 一项 = 一次 attempt:身份、判定、算好的单行结果摘要与证据引用。
323
+ * 完整 assertions、Judge evidence、diagnostics、cause stack 不进列表 data;
324
+ * 需要完整结构时经 locator 回读取面(resolveLocator AttemptHandle)。
360
325
  */
361
326
  export interface AttemptListItem {
362
- evalId: string;
363
327
  experimentId: string;
328
+ evalId: string;
364
329
  attempt: number;
365
330
  agent: string;
366
331
  verdict: Verdict;
367
- /** 结构化执行错误(与 `EvalResult.error` 同构):列表只显示 `message` 一层摘要。 */
368
- error?: AttemptError;
369
- /** attempt 的有界诊断(teardown / cleanup 失败等,与 verdict 独立);属于下钻详情。 */
370
- diagnostics?: DiagnosticRecord[];
371
- assertions: AssertionResult[];
332
+ /**
333
+ * 该轮的单行结果摘要,已按 Scoring display 契约折好:failed 取主失败断言摘要,
334
+ * errored 取结构化 error 的一层摘要(phase · code · message),passed / skipped 为 null。
335
+ * 渲染面只做宽度截断,不重算摘要。
336
+ */
337
+ failureSummary: string | null;
338
+ /** 主失败之外还有几条失败断言("+N more failures" 的 N);无失败为 0。 */
339
+ moreFailures: number;
340
+ /** 当前 attempt 的 examScore 与证据引用。 */
341
+ examScore: MetricCell;
372
342
  durationMs: number;
373
- costUSD?: number;
343
+ /** 缺失为 null(测不了),不伪造 0;attempt 级条目的缺失一律用 null,不用省略字段。 */
344
+ costUSD: number | null;
374
345
  locator: AttemptLocator;
375
346
  }
376
347
 
377
348
  /**
378
- * `ExperimentList` 一项里,一个 Eval 的展开行:折叠判定(`foldEvalVerdict`)、该 Eval
379
- * attempt 的平均耗时/成本(两级聚合引擎在单一 eval 上退化成组内均值),以及这道题的全部
380
- * Attempt(升序,供进一步展开到 `AttemptList`)。失败原因属于各 Attempt,不在父行挑一轮重复。
349
+ * `EvalList` 一项 = 一个 `experimentId + evalId`(同一个 Eval 跑在两个 experiment 上是
350
+ * 两条不同结果,不合并)。失败原因只存在于各 AttemptListItem,不在 Eval 父项重复一份。
381
351
  */
352
+ export interface EvalListItem {
353
+ experimentId: string;
354
+ evalId: string;
355
+ /** 任一轮 passed 即 passed,否则 failed > errored > skipped。 */
356
+ verdict: Verdict;
357
+ examScore: MetricCell;
358
+ durationMs: MetricCell;
359
+ costUSD: MetricCell;
360
+ attempts: AttemptListItem[];
361
+ }
362
+
363
+ /** `ExperimentList` 一项里,一个 Eval 的展开行。 */
382
364
  export interface ExperimentListEvalRow {
383
365
  evalId: string;
384
- /** 折叠判定(任一 attempt 通过则通过,否则取最严重的)。 */
385
366
  verdict: Verdict;
386
- /** 这道题内 attempt 的平均耗时(`computeCell(durationMs, …)`,单一 eval 分组下即均值)。 */
387
- duration: MetricCell;
388
- /** 这道题内 attempt 的平均成本。 */
389
- cost: MetricCell;
390
- /** 这道题的全部 Attempt,按 attempt 序号升序。 */
367
+ durationMs: MetricCell;
368
+ costUSD: MetricCell;
391
369
  attempts: AttemptListItem[];
392
370
  }
393
371
 
394
372
  /**
395
- * `ExperimentList.data(selection)` 的一项 = 一个 experiment:身份(experimentId/agent/model)、
396
- * 声明的 flags、Eval 判定构成(`foldEvalVerdict` 计票,与 view 榜单同一口径)、官方两级聚合
397
- * 汇总指标(endToEndPassRate/cost/duration/tokens,直接来自 `computeCell`,不现场重算),以及展开到
398
- * 这个 experiment 每道 Eval 的 `evalRows`(按 eval id 升序)。
373
+ * `experimentListData` 的一项 = 一个 experiment:身份(experimentId/agent/model)、
374
+ * 声明的 flags、eval 级最终 verdict 计票、官方两级聚合汇总指标,以及展开到每道 Eval 的
375
+ * `evalRows`(按 eval id 升序)。一行只有一套 agent / model / flags 是输入约束:
376
+ * 同一 experiment 混入不一致可比性配置时计算按完整用户反馈失败。
399
377
  */
400
378
  export interface ExperimentListItem {
401
379
  experimentId: string;
402
380
  agent: string;
403
381
  model?: string;
404
- flags?: Record<string, unknown>;
405
- /** eval 级折叠计票(foldEvalVerdict 口径,与 `TableRowMeta.verdicts`、view 榜单同一套)。 */
406
- verdicts: { passed: number; failed: number; errored: number; skipped: number };
407
- /** 官方两级聚合口径(endToEndPassRate),与 `MetricTable.data(..., columns: [endToEndPassRate])` 同一台引擎。 */
408
- passRate: MetricCell;
409
- cost: MetricCell;
410
- duration: MetricCell;
382
+ flags?: Record<string, JsonValue>;
383
+ /** eval 级最终 verdict 计票(Result 列的构成)。 */
384
+ evalVerdicts: VerdictTally;
385
+ endToEndPassRate: MetricCell;
386
+ costUSD: MetricCell;
387
+ durationMs: MetricCell;
411
388
  tokens: MetricCell;
412
- /** 这个 experiment 覆盖的 eval 数(去重后,与 `verdicts` 四项之和一致)。 */
389
+ /** 这个 experiment 覆盖的 eval 数(去重后,与 evalVerdicts 四项之和一致)。 */
413
390
  evals: number;
414
391
  /** 这个 experiment 覆盖的 attempt 总数(原始计数,含多轮重试)。 */
415
392
  attempts: number;
416
393
  /** 所含快照中最近的 startedAt。 */
417
394
  lastRunAt: string;
418
- /** 展开到这个 experiment 的 Eval,按 eval id 升序。 */
419
395
  evalRows: ExperimentListEvalRow[];
420
396
  }
421
397
 
422
- /**
423
- * `EvalList.data(selection)` 的一项 = 一个 `experimentId + evalId`(同一个 Eval 跑在两个
424
- * experiment 上是两条不同结果,不合并)。判定、分数(examScore 的两级聚合)、这道题内 attempt
425
- * 的平均耗时/成本,外加展开到这道题全部 Attempt 的 `attempts`(按 attempt 序号升序)。失败
426
- * 原因只存在于各 `AttemptListItem` 的 error / assertions,不会在 Eval 父项重复一份。
427
- */
428
- export interface EvalListItem {
429
- evalId: string;
430
- experimentId: string;
431
- verdict: Verdict;
432
- /** examScore 的两级聚合;单一 eval 分组下即这道题的题级分数。 */
433
- score: MetricCell;
434
- duration: MetricCell;
435
- cost: MetricCell;
436
- attempts: AttemptListItem[];
398
+ /** 三个实体列表共用的计算选项。 */
399
+ export interface EntityListDataOptions {
400
+ /**
401
+ * 展示层遮蔽:只改写这次组件数据中的自由文本——条目本身与任何嵌套 attempt 条目的
402
+ * `failureSummary`;身份与分类字段(experimentId、evalId、locator、数值指标)不经它。
403
+ * 只作用于这次计算产出的组件数据,不改盘上或任何导出目录里的 artifact;
404
+ * 发布 artifact 的脱敏用 copySnapshots({ redact })。
405
+ */
406
+ redact?: (text: string) => string;
437
407
  }