niceeval 0.6.1 → 0.7.0
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/INDEX.md +23 -23
- package/README.zh.md +6 -6
- package/dist/agents/types.d.ts +69 -7
- package/dist/context/types.d.ts +32 -12
- package/dist/i18n/en.d.ts +54 -0
- package/dist/i18n/zh-CN.d.ts +57 -3
- package/dist/o11y/types.d.ts +16 -2
- package/dist/report/aggregate.d.ts +32 -24
- package/dist/report/aggregate.js +158 -50
- package/dist/report/built-in/index.d.ts +2 -0
- package/dist/report/built-in/index.js +8 -0
- package/dist/report/components.d.ts +93 -160
- package/dist/report/components.js +377 -114
- package/dist/report/compute.d.ts +87 -81
- package/dist/report/compute.js +597 -417
- package/dist/report/flag.d.ts +32 -6
- package/dist/report/flag.js +92 -4
- package/dist/report/format.d.ts +19 -11
- package/dist/report/format.js +30 -13
- package/dist/report/index.d.ts +16 -16
- package/dist/report/index.js +20 -21
- package/dist/report/load.js +3 -2
- package/dist/report/locale.d.ts +57 -33
- package/dist/report/locale.js +122 -56
- package/dist/report/metrics.d.ts +23 -4
- package/dist/report/metrics.js +110 -25
- package/dist/report/primitives.d.ts +48 -15
- package/dist/report/primitives.js +135 -26
- package/dist/report/react/AttemptList.d.ts +9 -7
- package/dist/report/react/AttemptList.js +17 -10
- package/dist/report/react/DeltaTable.js +19 -18
- package/dist/report/react/EvalList.d.ts +4 -4
- package/dist/report/react/EvalList.js +0 -0
- package/dist/report/react/ExperimentComparison.d.ts +10 -0
- package/dist/report/react/ExperimentComparison.js +12 -0
- package/dist/report/react/ExperimentList.d.ts +4 -3
- package/dist/report/react/ExperimentList.js +17 -18
- package/dist/report/react/MetricBars.js +5 -4
- package/dist/report/react/MetricLine.js +12 -5
- package/dist/report/react/MetricMatrix.js +1 -1
- package/dist/report/react/MetricScatter.js +59 -28
- package/dist/report/react/MetricTable.js +2 -12
- package/dist/report/react/ScopeSummary.d.ts +10 -0
- package/dist/report/react/ScopeSummary.js +17 -0
- package/dist/report/react/Scoreboard.js +6 -6
- package/dist/report/react/cell.js +2 -2
- package/dist/report/react/chart-math.d.ts +23 -6
- package/dist/report/react/chart-math.js +71 -19
- package/dist/report/react/fixtures.d.ts +5 -9
- package/dist/report/react/fixtures.js +110 -147
- package/dist/report/react/index.d.ts +15 -5
- package/dist/report/react/index.js +18 -7
- package/dist/report/report.d.ts +137 -16
- package/dist/report/report.js +259 -28
- package/dist/report/text/faces.d.ts +17 -19
- package/dist/report/text/faces.js +253 -184
- package/dist/report/text/plot.js +1 -1
- package/dist/report/text/table.js +38 -7
- package/dist/report/tree.d.ts +90 -40
- package/dist/report/tree.js +252 -94
- package/dist/report/types.d.ts +247 -284
- package/dist/report/types.js +4 -3
- package/dist/report/web.d.ts +21 -5
- package/dist/report/web.js +42 -16
- package/dist/results/select.d.ts +38 -16
- package/dist/results/select.js +73 -25
- package/dist/results/types.d.ts +49 -14
- package/dist/runner/feedback/sink.d.ts +110 -0
- package/dist/runner/types.d.ts +513 -22
- package/dist/sandbox/docker.d.ts +23 -2
- package/dist/sandbox/e2b.d.ts +15 -1
- package/dist/sandbox/errors.d.ts +30 -3
- package/dist/sandbox/io-retry.d.ts +17 -0
- package/dist/sandbox/registry.d.ts +2 -0
- package/dist/sandbox/resolve.d.ts +18 -5
- package/dist/sandbox/retry.d.ts +11 -1
- package/dist/sandbox/types.d.ts +39 -5
- package/dist/sandbox/vercel.d.ts +7 -1
- package/dist/scoring/coverage.d.ts +30 -0
- package/dist/scoring/display.d.ts +21 -0
- package/dist/scoring/display.js +120 -0
- package/dist/scoring/types.d.ts +103 -20
- package/dist/shared/aggregate.d.ts +4 -2
- package/dist/shared/aggregate.js +8 -7
- package/dist/shared/types.d.ts +28 -0
- package/dist/tty-line.d.ts +0 -4
- package/dist/util.d.ts +23 -0
- package/docs-site/zh/README.md +44 -0
- package/docs-site/zh/examples/ai-agent-application.mdx +63 -0
- package/docs-site/zh/examples/coding-agent-extensions.mdx +57 -0
- package/docs-site/zh/examples/index.mdx +50 -0
- package/docs-site/zh/{concepts → explanation}/adapter.mdx +31 -13
- package/docs-site/zh/{concepts → explanation}/assert.mdx +7 -7
- package/docs-site/zh/{concepts → explanation}/drive.mdx +8 -8
- package/docs-site/zh/{concepts → explanation}/evals.mdx +4 -4
- package/docs-site/zh/{concepts → explanation}/experiment.mdx +8 -8
- package/docs-site/zh/{concepts → explanation}/hitl.mdx +8 -8
- package/docs-site/zh/{concepts → explanation}/judge.mdx +5 -5
- package/docs-site/zh/{concepts → explanation}/overview.mdx +11 -11
- package/docs-site/zh/{guides → explanation}/runner.mdx +18 -8
- package/docs-site/zh/{concepts → explanation}/tier.mdx +6 -6
- package/docs-site/zh/{guides → how-to}/agent-feedback-loop.mdx +35 -33
- package/docs-site/zh/{guides → how-to}/authoring.mdx +35 -2
- package/docs-site/zh/{guides → how-to}/ci-integration.mdx +23 -12
- package/docs-site/zh/{guides → how-to}/connect-otel.mdx +6 -6
- package/docs-site/zh/{guides → how-to}/connect-your-agent.mdx +47 -21
- package/docs-site/zh/{guides → how-to}/custom-reports.mdx +34 -39
- package/docs-site/zh/{guides → how-to}/dataset-fanout.mdx +25 -3
- package/docs-site/zh/{guides → how-to}/experiments.mdx +12 -5
- package/docs-site/zh/how-to/publish-report.mdx +105 -0
- package/docs-site/zh/{guides → how-to}/reporters.mdx +2 -2
- package/docs-site/zh/{guides → how-to}/sandbox-agent.mdx +56 -7
- package/docs-site/zh/how-to/sandbox-providers.mdx +350 -0
- package/docs-site/zh/{guides → how-to}/scoring-guide.mdx +4 -4
- package/docs-site/zh/{guides → how-to}/viewing-results.mdx +82 -39
- package/docs-site/zh/{guides → how-to}/write-experiment.mdx +6 -4
- package/docs-site/zh/{guides → how-to}/write-send.mdx +30 -14
- package/docs-site/zh/index.mdx +24 -26
- package/docs-site/zh/introduction.mdx +8 -8
- package/docs-site/zh/reference/builtin-agents.mdx +32 -5
- package/docs-site/zh/reference/capabilities.mdx +8 -8
- package/docs-site/zh/reference/cli.mdx +40 -12
- package/docs-site/zh/reference/define-agent.mdx +58 -5
- package/docs-site/zh/reference/define-config.mdx +1 -1
- package/docs-site/zh/reference/define-eval.mdx +42 -9
- package/docs-site/zh/reference/events.mdx +3 -3
- package/docs-site/zh/reference/expect.mdx +26 -1
- package/docs-site/zh/{guides → reference}/official-adapters.mdx +32 -8
- package/docs-site/zh/{guides → reference}/report-components.mdx +45 -33
- package/docs-site/zh/{guides → reference}/results-data.mdx +21 -13
- package/docs-site/zh/troubleshooting/debug-sandbox.mdx +57 -0
- package/docs-site/zh/troubleshooting/debugging.mdx +212 -0
- package/docs-site/zh/{quickstart.mdx → tutorials/quickstart.mdx} +5 -17
- package/package.json +10 -2
- package/src/agents/ai-sdk-otel.test.ts +1 -0
- package/src/agents/ai-sdk.test.ts +3 -0
- package/src/agents/ai-sdk.ts +3 -0
- package/src/agents/bub-install-spec.test.ts +34 -0
- package/src/agents/bub-install-spec.ts +32 -0
- package/src/agents/bub.ts +31 -32
- package/src/agents/claude-code.test.ts +130 -9
- package/src/agents/claude-code.ts +76 -4
- package/src/agents/codex.test.ts +189 -40
- package/src/agents/codex.ts +155 -14
- package/src/agents/coding-cli-versions.test.ts +15 -0
- package/src/agents/coding-cli-versions.ts +3 -0
- package/src/agents/index.ts +13 -2
- package/src/agents/langgraph.test.ts +204 -0
- package/src/agents/langgraph.ts +495 -0
- package/src/agents/marketplace.ts +85 -0
- package/src/agents/native-config.test.ts +179 -0
- package/src/agents/native-config.ts +267 -0
- package/src/agents/openai-compat.test.ts +1 -0
- package/src/agents/openai-compat.ts +1 -1
- package/src/agents/openclaw.test.ts +31 -0
- package/src/agents/openclaw.ts +171 -0
- package/src/agents/plugin-config.test.ts +1 -0
- package/src/agents/sdk-streams.test.ts +79 -0
- package/src/agents/sdk-streams.ts +55 -10
- package/src/agents/skills.test.ts +1 -0
- package/src/agents/streaming.test.ts +3 -9
- package/src/agents/streaming.ts +2 -2
- package/src/agents/types.ts +71 -8
- package/src/agents/ui-message-stream.test.ts +3 -0
- package/src/cli.ts +446 -124
- package/src/context/context.test.ts +51 -12
- package/src/context/context.ts +162 -30
- package/src/context/session.test.ts +2 -1
- package/src/context/session.ts +115 -7
- package/src/context/types.ts +30 -12
- package/src/define.test.ts +13 -8
- package/src/define.ts +25 -4
- package/src/expect/index.ts +53 -23
- package/src/i18n/en.ts +81 -17
- package/src/i18n/zh-CN.ts +80 -17
- package/src/o11y/cost.test.ts +1 -0
- package/src/o11y/execution-tree.test.ts +1 -20
- package/src/o11y/otlp/mappers/claude-code.test.ts +1 -0
- package/src/o11y/otlp/parse.test.ts +1 -0
- package/src/o11y/otlp/turn-otel.test.ts +1 -0
- package/src/o11y/parsers/bub.test.ts +1 -0
- package/src/o11y/parsers/claude-code.test.ts +1 -34
- package/src/o11y/parsers/openclaw.test.ts +154 -0
- package/src/o11y/parsers/openclaw.ts +310 -0
- package/src/o11y/prices.json +746 -311
- package/src/o11y/tool-names.test.ts +1 -0
- package/src/o11y/types.ts +16 -2
- package/src/report/aggregate.ts +178 -61
- package/src/report/built-in/index.tsx +9 -0
- package/src/report/components.tsx +625 -279
- package/src/report/compute.ts +723 -491
- package/src/report/dual-render.test.tsx +741 -1024
- package/src/report/flag.ts +104 -12
- package/src/report/format.ts +32 -12
- package/src/report/index.ts +119 -46
- package/src/report/load.ts +3 -2
- package/src/report/locale.ts +136 -65
- package/src/report/metrics.ts +108 -25
- package/src/report/primitives.tsx +196 -45
- package/src/report/react/AttemptList.tsx +30 -43
- package/src/report/react/DeltaTable.tsx +63 -45
- package/src/report/react/EvalList.tsx +0 -0
- package/src/report/react/ExperimentComparison.tsx +73 -0
- package/src/report/react/ExperimentList.tsx +50 -32
- package/src/report/react/MetricBars.tsx +5 -4
- package/src/report/react/MetricLine.tsx +13 -8
- package/src/report/react/MetricMatrix.tsx +2 -2
- package/src/report/react/MetricScatter.tsx +86 -34
- package/src/report/react/MetricTable.tsx +4 -76
- package/src/report/react/ScopeSummary.tsx +86 -0
- package/src/report/react/Scoreboard.tsx +28 -10
- package/src/report/react/cell.tsx +2 -2
- package/src/report/react/chart-math.test.ts +85 -0
- package/src/report/react/chart-math.ts +101 -22
- package/src/report/react/enhance.js +89 -5
- package/src/report/react/fixtures.ts +114 -154
- package/src/report/react/index.tsx +24 -39
- package/src/report/react/render.test.tsx +138 -158
- package/src/report/react/styles.css +243 -82
- package/src/report/report.test.ts +779 -841
- package/src/report/report.ts +423 -41
- package/src/report/text/faces.ts +290 -193
- package/src/report/text/plot.ts +1 -1
- package/src/report/text/table.ts +44 -7
- package/src/report/tree.ts +362 -104
- package/src/report/types.ts +261 -271
- package/src/report/web.ts +63 -20
- package/src/results/annotated-source.test.ts +62 -9
- package/src/results/annotated-source.ts +64 -6
- package/src/results/attempt-evidence.test.ts +13 -11
- package/src/results/attempt-evidence.ts +20 -13
- package/src/results/attempt-source.ts +6 -3
- package/src/results/copy.ts +150 -60
- package/src/results/host-equivalence.test.ts +34 -20
- package/src/results/index.ts +12 -4
- package/src/results/locator.test.ts +1 -22
- package/src/results/open.ts +15 -5
- package/src/results/publish.ts +149 -0
- package/src/results/results.test.ts +89 -54
- package/src/results/select.ts +104 -34
- package/src/results/truncate.ts +90 -0
- package/src/results/types.ts +43 -14
- package/src/results/writer.ts +31 -13
- package/src/runner/attempt.test.ts +138 -7
- package/src/runner/attempt.ts +603 -104
- package/src/runner/discover.test.ts +47 -0
- package/src/runner/discover.ts +36 -2
- package/src/runner/eval-source.test.ts +1 -27
- package/src/runner/feedback/agent.test.ts +504 -0
- package/src/runner/feedback/agent.ts +409 -0
- package/src/runner/feedback/ci.test.ts +562 -0
- package/src/runner/feedback/ci.ts +401 -0
- package/src/runner/feedback/coordinator.test.ts +317 -0
- package/src/runner/feedback/coordinator.ts +397 -0
- package/src/runner/feedback/failure.ts +40 -0
- package/src/runner/feedback/human.test.ts +616 -0
- package/src/runner/feedback/human.ts +535 -0
- package/src/runner/feedback/index.ts +66 -0
- package/src/runner/feedback/io.ts +78 -0
- package/src/runner/feedback/profile.test.ts +50 -0
- package/src/runner/feedback/profile.ts +58 -0
- package/src/runner/feedback/reducer.test.ts +395 -0
- package/src/runner/feedback/reducer.ts +260 -0
- package/src/runner/feedback/renderer.ts +82 -0
- package/src/runner/feedback/sink.ts +203 -0
- package/src/runner/feedback/testing.ts +106 -0
- package/src/runner/ledger.test.ts +230 -0
- package/src/runner/ledger.ts +329 -0
- package/src/runner/report.test.ts +128 -3
- package/src/runner/report.ts +33 -9
- package/src/runner/reporters/artifacts.ts +8 -2
- package/src/runner/reporters/braintrust.test.ts +8 -7
- package/src/runner/reporters/braintrust.ts +9 -2
- package/src/runner/reporters/index.ts +2 -2
- package/src/runner/reporters/json.test.ts +162 -0
- package/src/runner/reporters/json.ts +35 -8
- package/src/runner/reporters/shared.ts +1 -5
- package/src/runner/run.test.ts +760 -3
- package/src/runner/run.ts +243 -37
- package/src/runner/sandbox-prep.ts +3 -42
- package/src/runner/timing.ts +158 -0
- package/src/runner/types.ts +518 -22
- package/src/sandbox/checkpoint.test.ts +55 -0
- package/src/sandbox/checkpoint.ts +29 -8
- package/src/sandbox/cli-commands.ts +407 -0
- package/src/sandbox/docker.ts +115 -16
- package/src/sandbox/e2b-agent-template.test.ts +56 -0
- package/src/sandbox/e2b-agent-template.ts +94 -0
- package/src/sandbox/e2b.ts +74 -9
- package/src/sandbox/errors.ts +111 -4
- package/src/sandbox/index.ts +2 -0
- package/src/sandbox/io-retry.test.ts +58 -0
- package/src/sandbox/io-retry.ts +45 -0
- package/src/sandbox/keep-registry.test.ts +86 -0
- package/src/sandbox/keep-registry.ts +142 -0
- package/src/sandbox/keep.ts +178 -0
- package/src/sandbox/paths.test.ts +1 -0
- package/src/sandbox/paths.ts +19 -8
- package/src/sandbox/registry.ts +20 -3
- package/src/sandbox/resolve.ts +76 -11
- package/src/sandbox/retry.test.ts +70 -0
- package/src/sandbox/retry.ts +46 -4
- package/src/sandbox/types.ts +44 -6
- package/src/sandbox/vercel.ts +43 -20
- package/src/scoring/collector.ts +60 -17
- package/src/scoring/coverage.ts +95 -0
- package/src/scoring/diff.ts +81 -0
- package/src/scoring/display.test.ts +121 -0
- package/src/scoring/display.ts +133 -0
- package/src/scoring/evidence.test.ts +189 -0
- package/src/scoring/judge.test.ts +142 -0
- package/src/scoring/judge.ts +15 -18
- package/src/scoring/scoped.ts +217 -50
- package/src/scoring/types.ts +117 -20
- package/src/scoring/verdict.ts +16 -4
- package/src/shared/aggregate.ts +8 -6
- package/src/shared/types.ts +31 -0
- package/src/show/compose.ts +50 -67
- package/src/show/index.ts +127 -56
- package/src/show/render.ts +662 -131
- package/src/show/report-host.test.ts +188 -0
- package/src/show/report-host.ts +375 -0
- package/src/show/show.test.ts +320 -54
- package/src/tty-line.ts +8 -26
- package/src/util.test.ts +1 -0
- package/src/util.ts +41 -0
- package/src/view/app/App.test.tsx +69 -0
- package/src/view/app/App.tsx +144 -48
- package/src/view/app/components/AttemptModal.tsx +423 -11
- package/src/view/app/components/CodeView.tsx +41 -14
- package/src/view/app/components/CopyControls.tsx +2 -2
- package/src/view/app/i18n.ts +37 -17
- package/src/view/app/lib/attempt-route.test.ts +1 -0
- package/src/view/app/lib/verdict.ts +7 -9
- package/src/view/app/main.tsx +13 -8
- package/src/view/app/pages/{RunsPage.tsx → AttemptsPage.tsx} +6 -6
- package/src/view/app/types.ts +4 -1
- package/src/view/artifact-serving.test.ts +2 -1
- package/src/view/client-dist/app.css +1 -1
- package/src/view/client-dist/app.js +17 -17
- package/src/view/data.test.ts +10 -3
- package/src/view/data.ts +155 -49
- package/src/view/index.ts +56 -41
- package/src/view/server.ts +37 -15
- package/src/view/shared/types.ts +34 -5
- package/src/view/styles.css +227 -0
- package/src/view/view-report.test.ts +167 -62
- package/dist/report/built-ins/experiment-comparison.d.ts +0 -1
- package/dist/report/built-ins/experiment-comparison.js +0 -13
- package/dist/report/built-ins/index.d.ts +0 -1
- package/dist/report/built-ins/index.js +0 -2
- package/dist/report/react/GroupSummary.d.ts +0 -8
- package/dist/report/react/GroupSummary.js +0 -8
- package/dist/report/react/RunOverview.d.ts +0 -8
- package/dist/report/react/RunOverview.js +0 -12
- package/docs-site/zh/example/ai-agent-application.mdx +0 -152
- package/docs-site/zh/example/claude-code-codex-plugin.mdx +0 -167
- package/docs-site/zh/example/claude-code-codex-skill.mdx +0 -152
- package/docs-site/zh/example/showcase.mdx +0 -39
- package/docs-site/zh/guides/publish-report.mdx +0 -91
- package/docs-site/zh/guides/sandbox-providers.mdx +0 -102
- package/src/report/built-in-user-parity.test.tsx +0 -640
- package/src/report/built-ins/experiment-comparison.tsx +0 -19
- package/src/report/built-ins/index.ts +0 -2
- package/src/report/react/GroupSummary.tsx +0 -66
- package/src/report/react/RunOverview.tsx +0 -109
- package/src/runner/reporters/console.ts +0 -70
- package/src/runner/reporters/live.test.ts +0 -56
- package/src/runner/reporters/live.ts +0 -247
- package/src/runner/reporters/quiet.test.ts +0 -66
- package/src/runner/reporters/quiet.ts +0 -49
- package/src/runner/reporters/table.ts +0 -277
- /package/docs-site/zh/{example/tier1-ai-sdk-v7.mdx → examples/integrations/ai-sdk-v7.mdx} +0 -0
- /package/docs-site/zh/{example/tier1-claude-sdk.mdx → examples/integrations/claude-sdk.mdx} +0 -0
- /package/docs-site/zh/{example/tier1-codex-sdk.mdx → examples/integrations/codex-sdk.mdx} +0 -0
- /package/docs-site/zh/{example/tier1-langgraph.mdx → examples/integrations/langgraph.mdx} +0 -0
- /package/docs-site/zh/{example/tier1-pi-sdk.mdx → examples/integrations/pi-sdk.mdx} +0 -0
- /package/docs-site/zh/{guides → how-to}/fixtures.mdx +0 -0
|
@@ -0,0 +1,50 @@
|
|
|
1
|
+
// cases: docs/engineering/unit-tests/experiments-runner/cases.md
|
|
2
|
+
import { describe, expect, it } from "vitest";
|
|
3
|
+
import { isCIEnvironment, resolveOutputProfile } from "./profile.ts";
|
|
4
|
+
|
|
5
|
+
describe("resolveOutputProfile", () => {
|
|
6
|
+
it("显式值永远覆盖自动检测,无论 isTTY/env 是什么", () => {
|
|
7
|
+
expect(resolveOutputProfile({ explicit: "agent", isTTY: true, env: { CI: "true" } })).toBe("agent");
|
|
8
|
+
expect(resolveOutputProfile({ explicit: "ci", isTTY: true, env: {} })).toBe("ci");
|
|
9
|
+
expect(resolveOutputProfile({ explicit: "human", isTTY: false, env: { CI: "true" } })).toBe("human");
|
|
10
|
+
});
|
|
11
|
+
|
|
12
|
+
it("auto:stderr 是 TTY → human,即便同时设了 CI 环境标记(TTY 优先于 CI 探测)", () => {
|
|
13
|
+
expect(resolveOutputProfile({ explicit: "auto", isTTY: true, env: { CI: "true" } })).toBe("human");
|
|
14
|
+
});
|
|
15
|
+
|
|
16
|
+
it("auto:非 TTY + CI 环境标记 → ci", () => {
|
|
17
|
+
expect(resolveOutputProfile({ explicit: "auto", isTTY: false, env: { CI: "true" } })).toBe("ci");
|
|
18
|
+
});
|
|
19
|
+
|
|
20
|
+
it("auto:非 TTY + 无 CI 环境标记 → agent", () => {
|
|
21
|
+
expect(resolveOutputProfile({ explicit: "auto", isTTY: false, env: {} })).toBe("agent");
|
|
22
|
+
});
|
|
23
|
+
});
|
|
24
|
+
|
|
25
|
+
describe("isCIEnvironment", () => {
|
|
26
|
+
it("命中任意已知 CI 平台变量即为 true", () => {
|
|
27
|
+
expect(isCIEnvironment({ CI: "true" })).toBe(true);
|
|
28
|
+
expect(isCIEnvironment({ GITHUB_ACTIONS: "true" })).toBe(true);
|
|
29
|
+
expect(isCIEnvironment({ GITLAB_CI: "true" })).toBe(true);
|
|
30
|
+
expect(isCIEnvironment({ CIRCLECI: "true" })).toBe(true);
|
|
31
|
+
expect(isCIEnvironment({ TRAVIS: "true" })).toBe(true);
|
|
32
|
+
expect(isCIEnvironment({ BUILDKITE: "true" })).toBe(true);
|
|
33
|
+
expect(isCIEnvironment({ JENKINS_URL: "https://ci.example.com" })).toBe(true);
|
|
34
|
+
expect(isCIEnvironment({ TEAMCITY_VERSION: "2024.1" })).toBe(true);
|
|
35
|
+
expect(isCIEnvironment({ APPVEYOR: "true" })).toBe(true);
|
|
36
|
+
expect(isCIEnvironment({ TF_BUILD: "true" })).toBe(true);
|
|
37
|
+
});
|
|
38
|
+
|
|
39
|
+
it("空对象、无关变量都不算 CI", () => {
|
|
40
|
+
expect(isCIEnvironment({})).toBe(false);
|
|
41
|
+
expect(isCIEnvironment({ PATH: "/usr/bin", HOME: "/root" })).toBe(false);
|
|
42
|
+
});
|
|
43
|
+
|
|
44
|
+
it("显式关闭(空串 / \"false\" / \"0\")不算已设置,不该被误判成在 CI 里", () => {
|
|
45
|
+
expect(isCIEnvironment({ CI: "" })).toBe(false);
|
|
46
|
+
expect(isCIEnvironment({ CI: "false" })).toBe(false);
|
|
47
|
+
expect(isCIEnvironment({ CI: "0" })).toBe(false);
|
|
48
|
+
expect(isCIEnvironment({ CI: undefined })).toBe(false);
|
|
49
|
+
});
|
|
50
|
+
});
|
|
@@ -0,0 +1,58 @@
|
|
|
1
|
+
// `--output auto` 的纯环境判定(见 docs/feature/experiments/cli.md「三种反馈模型」)。
|
|
2
|
+
// 只依赖调用方传入的 isTTY/env,不读全局 `process` —— CLI flag 解析层(--output 本身的
|
|
3
|
+
// 语法校验、非法值报错)不在这里,那是 flag 解析层的职责;这里只处理「已知合法输入」到
|
|
4
|
+
// 「三选一 profile」的映射,好让这条判定可以脱离真实终端/环境变量单测。
|
|
5
|
+
|
|
6
|
+
import type { OutputProfile } from "../types.ts";
|
|
7
|
+
|
|
8
|
+
/** `--output` 显式值的合法输入,含默认值 `"auto"`。 */
|
|
9
|
+
export type OutputProfileFlag = OutputProfile | "auto";
|
|
10
|
+
|
|
11
|
+
export interface ResolveOutputProfileInput {
|
|
12
|
+
/** 已解析、已校验的 --output 值。 */
|
|
13
|
+
explicit: OutputProfileFlag;
|
|
14
|
+
/** 通常取 `stderr.isTTY`(见 docs:human dashboard 依赖 stderr 可交互重画,不是 stdout)。 */
|
|
15
|
+
isTTY: boolean;
|
|
16
|
+
env: Readonly<Record<string, string | undefined>>;
|
|
17
|
+
}
|
|
18
|
+
|
|
19
|
+
/**
|
|
20
|
+
* 常见 CI 平台会设置的环境变量标记,命中任意一个即视为 CI 环境。`CI` 是事实标准
|
|
21
|
+
* (GitHub Actions / GitLab CI / CircleCI / Travis CI / Buildkite / Vercel 等均会设置);
|
|
22
|
+
* 其余是没有通用 `CI` 变量、或希望在缺失 `CI=true` 时也能命中的平台专属兜底。列表只在
|
|
23
|
+
* 这里维护一份 —— `isCIEnvironment` 的测试逐项覆盖,新增平台直接加进这个数组。
|
|
24
|
+
*/
|
|
25
|
+
const CI_ENV_VARS = [
|
|
26
|
+
"CI",
|
|
27
|
+
"GITHUB_ACTIONS",
|
|
28
|
+
"GITLAB_CI",
|
|
29
|
+
"CIRCLECI",
|
|
30
|
+
"TRAVIS",
|
|
31
|
+
"BUILDKITE",
|
|
32
|
+
"JENKINS_URL",
|
|
33
|
+
"TEAMCITY_VERSION",
|
|
34
|
+
"APPVEYOR",
|
|
35
|
+
"TF_BUILD", // Azure Pipelines
|
|
36
|
+
] as const;
|
|
37
|
+
|
|
38
|
+
/** 值为空串 / "false" / "0" 视为未设置 —— 本地开发者 shell 里 `export CI=false` 之类的
|
|
39
|
+
* 显式关闭不该被误判成「在 CI 里」。 */
|
|
40
|
+
function isSetTruthy(value: string | undefined): boolean {
|
|
41
|
+
return value !== undefined && value !== "" && value !== "false" && value !== "0";
|
|
42
|
+
}
|
|
43
|
+
|
|
44
|
+
export function isCIEnvironment(env: Readonly<Record<string, string | undefined>>): boolean {
|
|
45
|
+
return CI_ENV_VARS.some((name) => isSetTruthy(env[name]));
|
|
46
|
+
}
|
|
47
|
+
|
|
48
|
+
/**
|
|
49
|
+
* 优先级:显式值 > stderr 是否 TTY > CI 环境标记 > 其余一律 agent(见 docs 的三行判定表)。
|
|
50
|
+
* TTY 检查先于 CI 环境标记 —— 显式在伪 TTY(如 CI 平台分配了 pty 的场景)里跑仍希望拿到
|
|
51
|
+
* 人可读的 dashboard,只有确认不是 TTY 之后才继续问「是不是 CI」。
|
|
52
|
+
*/
|
|
53
|
+
export function resolveOutputProfile(input: ResolveOutputProfileInput): OutputProfile {
|
|
54
|
+
if (input.explicit !== "auto") return input.explicit;
|
|
55
|
+
if (input.isTTY) return "human";
|
|
56
|
+
if (isCIEnvironment(input.env)) return "ci";
|
|
57
|
+
return "agent";
|
|
58
|
+
}
|
|
@@ -0,0 +1,395 @@
|
|
|
1
|
+
// cases: docs/engineering/unit-tests/experiments-runner/cases.md
|
|
2
|
+
// 表驱动测试:RunFeedbackEvent 序列 → RunFeedbackState。核心断言是「任何时刻」都满足
|
|
3
|
+
// total = reused + running + queued + completed(见 docs/feature/experiments/cli.md 的守恒公式)——
|
|
4
|
+
// 每处理一个事件就断言一次,不是只在序列末尾断言。辅助不变量 active.size === running 一并核对
|
|
5
|
+
// (active map 按设计只存「正在运行」的 attempt,见 ../types.ts 的 ActiveAttempt 注释)。
|
|
6
|
+
|
|
7
|
+
import { describe, expect, it } from "vitest";
|
|
8
|
+
import { createInitialRunFeedbackState, reduceRunFeedback } from "./reducer.ts";
|
|
9
|
+
import { encodeAttemptKey, type AttemptRef, type RunFeedbackEvent, type RunFeedbackState } from "../types.ts";
|
|
10
|
+
import type { AttemptLocator } from "../../results/locator.ts";
|
|
11
|
+
|
|
12
|
+
function locator(id: string): AttemptLocator {
|
|
13
|
+
return `@1${id}` as AttemptLocator;
|
|
14
|
+
}
|
|
15
|
+
|
|
16
|
+
function ref(evalId: string, attempt = 0, experimentId?: string): AttemptRef {
|
|
17
|
+
return experimentId ? { experimentId, evalId, attempt } : { evalId, attempt };
|
|
18
|
+
}
|
|
19
|
+
|
|
20
|
+
/** 依次喂事件,每一步都断言守恒公式与 active/running 一致,返回最终状态供调用方追加断言。 */
|
|
21
|
+
function replay(events: readonly RunFeedbackEvent[]): RunFeedbackState {
|
|
22
|
+
let state = createInitialRunFeedbackState();
|
|
23
|
+
for (const [i, event] of events.entries()) {
|
|
24
|
+
state = reduceRunFeedback(state, event);
|
|
25
|
+
expect(
|
|
26
|
+
state.total,
|
|
27
|
+
`after event #${i} (${event.type}): total should equal reused+running+queued+completed`,
|
|
28
|
+
).toBe(state.reused + state.running + state.queued + state.completed);
|
|
29
|
+
expect(
|
|
30
|
+
state.active.size,
|
|
31
|
+
`after event #${i} (${event.type}): active map size should equal running count`,
|
|
32
|
+
).toBe(state.running);
|
|
33
|
+
// 四个桶(reused/running/queued/completed)本身永远非负 —— 负数意味着某个事件把不存在的
|
|
34
|
+
// attempt 又"完成"了一次,是 reducer 或 emitter 的 bug,不该被吞掉。
|
|
35
|
+
expect(state.reused, `after event #${i}: reused must not go negative`).toBeGreaterThanOrEqual(0);
|
|
36
|
+
expect(state.running, `after event #${i}: running must not go negative`).toBeGreaterThanOrEqual(0);
|
|
37
|
+
expect(state.queued, `after event #${i}: queued must not go negative`).toBeGreaterThanOrEqual(0);
|
|
38
|
+
expect(state.completed, `after event #${i}: completed must not go negative`).toBeGreaterThanOrEqual(0);
|
|
39
|
+
}
|
|
40
|
+
return state;
|
|
41
|
+
}
|
|
42
|
+
|
|
43
|
+
describe("reduceRunFeedback: 守恒公式", () => {
|
|
44
|
+
it("普通运行:plan → start × N → complete × N,计数逐步从 queued 转移到 completed", () => {
|
|
45
|
+
const a = ref("memory/a");
|
|
46
|
+
const b = ref("memory/b");
|
|
47
|
+
const c = ref("memory/c");
|
|
48
|
+
const state = replay([
|
|
49
|
+
{ type: "plan", at: 0, plan: { shape: { evals: 3, configs: 1, totalRuns: 3, maxConcurrency: 3 }, reused: 0, reusedFailures: [] } },
|
|
50
|
+
{ type: "attempt:start", at: 1, identity: a, who: "codex", phase: "sandbox.create" },
|
|
51
|
+
{ type: "attempt:start", at: 1, identity: b, who: "codex", phase: "sandbox.create" },
|
|
52
|
+
{ type: "attempt:start", at: 1, identity: c, who: "codex", phase: "sandbox.create" },
|
|
53
|
+
{ type: "attempt:phase", at: 2, identity: a, phase: "eval.run" },
|
|
54
|
+
{ type: "attempt:progress", at: 3, identity: a, detail: "turn 2" },
|
|
55
|
+
{ type: "attempt:complete", at: 4, identity: a, who: "codex", verdict: "passed", tokenCount: 15, estimatedCostUSD: 0.1 },
|
|
56
|
+
{ type: "attempt:complete", at: 5, identity: b, who: "codex", verdict: "passed", tokenCount: 25, estimatedCostUSD: 0.2 },
|
|
57
|
+
{ type: "attempt:complete", at: 6, identity: c, who: "codex", verdict: "passed", estimatedCostUSD: 0.05 },
|
|
58
|
+
]);
|
|
59
|
+
expect(state).toMatchObject({ total: 3, reused: 0, running: 0, queued: 0, completed: 3 });
|
|
60
|
+
expect(state.estimatedCostUSD).toBeCloseTo(0.35, 5);
|
|
61
|
+
expect(state.newTokenCount).toBe(40);
|
|
62
|
+
expect(state.active.size).toBe(0);
|
|
63
|
+
expect(state.failures).toEqual([]);
|
|
64
|
+
});
|
|
65
|
+
|
|
66
|
+
it("plan 静态注入复用失败;fresh failure 单独计数且同 locator 幂等", () => {
|
|
67
|
+
const carriedLocator = locator("carried");
|
|
68
|
+
const freshLocator = locator("fresh");
|
|
69
|
+
let state = reduceRunFeedback(createInitialRunFeedbackState(), {
|
|
70
|
+
type: "plan",
|
|
71
|
+
at: 0,
|
|
72
|
+
plan: {
|
|
73
|
+
shape: { evals: 2, configs: 1, totalRuns: 2, maxConcurrency: 1 },
|
|
74
|
+
reused: 1,
|
|
75
|
+
reusedFailures: [{
|
|
76
|
+
locator: carriedLocator,
|
|
77
|
+
identity: ref("memory/carried", 0, "compare/bub-e2b"),
|
|
78
|
+
who: "compare/bub-e2b",
|
|
79
|
+
verdict: "failed",
|
|
80
|
+
reason: "carried failure",
|
|
81
|
+
}],
|
|
82
|
+
},
|
|
83
|
+
});
|
|
84
|
+
expect(state.failures.map((failure) => failure.locator)).toEqual([carriedLocator]);
|
|
85
|
+
expect(state.freshFailureCount).toBe(0);
|
|
86
|
+
|
|
87
|
+
const event = {
|
|
88
|
+
type: "failure" as const,
|
|
89
|
+
at: 1,
|
|
90
|
+
locator: freshLocator,
|
|
91
|
+
identity: ref("memory/fresh", 0, "compare/bub-e2b"),
|
|
92
|
+
who: "compare/bub-e2b",
|
|
93
|
+
verdict: "failed" as const,
|
|
94
|
+
reason: "fresh failure",
|
|
95
|
+
};
|
|
96
|
+
state = reduceRunFeedback(state, event);
|
|
97
|
+
state = reduceRunFeedback(state, event);
|
|
98
|
+
expect(state.failures).toHaveLength(2);
|
|
99
|
+
expect(state.freshFailureCount).toBe(1);
|
|
100
|
+
});
|
|
101
|
+
|
|
102
|
+
it("carry:携入结果在 plan 那一刻就计入 reused,守恒公式在第一个事件后就成立", () => {
|
|
103
|
+
const state1 = reduceRunFeedback(createInitialRunFeedbackState(), {
|
|
104
|
+
type: "plan",
|
|
105
|
+
at: 0,
|
|
106
|
+
plan: {
|
|
107
|
+
shape: { evals: 5, configs: 1, totalRuns: 5, maxConcurrency: 5 },
|
|
108
|
+
reused: 2,
|
|
109
|
+
reusedFailures: [],
|
|
110
|
+
},
|
|
111
|
+
});
|
|
112
|
+
// plan 之后立刻(在任何 attempt 事件之前)守恒公式就应成立:2 个 reused + 3 个 queued。
|
|
113
|
+
expect(state1.total).toBe(state1.reused + state1.running + state1.queued + state1.completed);
|
|
114
|
+
expect(state1).toMatchObject({ total: 5, reused: 2, running: 0, queued: 3, completed: 0 });
|
|
115
|
+
|
|
116
|
+
const a = ref("memory/a", 0, "compare/bub-e2b");
|
|
117
|
+
const b = ref("memory/b", 0, "compare/bub-e2b");
|
|
118
|
+
const c = ref("memory/c", 0, "compare/bub-e2b");
|
|
119
|
+
const final = replay([
|
|
120
|
+
{ type: "plan", at: 0, plan: { shape: { evals: 5, configs: 1, totalRuns: 5, maxConcurrency: 5 }, reused: 2, reusedFailures: [] } },
|
|
121
|
+
{ type: "attempt:start", at: 1, identity: a, who: "bub-e2b", phase: "sandbox.create" },
|
|
122
|
+
{ type: "attempt:start", at: 1, identity: b, who: "bub-e2b", phase: "sandbox.create" },
|
|
123
|
+
{ type: "attempt:start", at: 1, identity: c, who: "bub-e2b", phase: "sandbox.create" },
|
|
124
|
+
{ type: "attempt:complete", at: 5, identity: a, who: "bub-e2b", verdict: "passed" },
|
|
125
|
+
{ type: "attempt:complete", at: 5, identity: b, who: "bub-e2b", verdict: "passed" },
|
|
126
|
+
{ type: "attempt:complete", at: 5, identity: c, who: "bub-e2b", verdict: "passed" },
|
|
127
|
+
]);
|
|
128
|
+
expect(final).toMatchObject({ total: 5, reused: 2, running: 0, queued: 0, completed: 3 });
|
|
129
|
+
});
|
|
130
|
+
|
|
131
|
+
it("并发完成:多个 active attempt 以任意顺序结束,active map 逐条精确摘除", () => {
|
|
132
|
+
const a = ref("memory/a");
|
|
133
|
+
const b = ref("memory/b");
|
|
134
|
+
const c = ref("memory/c");
|
|
135
|
+
const d = ref("memory/d");
|
|
136
|
+
let state = createInitialRunFeedbackState();
|
|
137
|
+
state = reduceRunFeedback(state, {
|
|
138
|
+
type: "plan",
|
|
139
|
+
at: 0,
|
|
140
|
+
plan: { shape: { evals: 4, configs: 1, totalRuns: 4, maxConcurrency: 4 }, reused: 0, reusedFailures: [] },
|
|
141
|
+
});
|
|
142
|
+
for (const identity of [a, b, c, d]) {
|
|
143
|
+
state = reduceRunFeedback(state, { type: "attempt:start", at: 1, identity, who: "codex", phase: "eval.run" });
|
|
144
|
+
}
|
|
145
|
+
expect(state.running).toBe(4);
|
|
146
|
+
expect(state.active.size).toBe(4);
|
|
147
|
+
|
|
148
|
+
// 乱序完成:C 最先完成,然后 A,再 D(errored + failure),最后 B。
|
|
149
|
+
const order: Array<{ identity: AttemptRef; verdict: "passed" | "failed" | "errored" }> = [
|
|
150
|
+
{ identity: c, verdict: "passed" },
|
|
151
|
+
{ identity: a, verdict: "passed" },
|
|
152
|
+
{ identity: d, verdict: "errored" },
|
|
153
|
+
{ identity: b, verdict: "failed" },
|
|
154
|
+
];
|
|
155
|
+
for (const { identity, verdict } of order) {
|
|
156
|
+
state = reduceRunFeedback(state, { type: "attempt:complete", at: 2, identity, who: "codex", verdict });
|
|
157
|
+
expect(state.total).toBe(state.reused + state.running + state.queued + state.completed);
|
|
158
|
+
expect(state.active.size).toBe(state.running);
|
|
159
|
+
// 每次完成后,已完成的那个 identity 必须已经从 active 里摘除,其余仍在的必须还在。
|
|
160
|
+
expect(state.active.has(encodeAttemptKey(identity))).toBe(false);
|
|
161
|
+
}
|
|
162
|
+
expect(state).toMatchObject({ running: 0, completed: 4, queued: 0 });
|
|
163
|
+
});
|
|
164
|
+
|
|
165
|
+
it("early exit:未派发的重复轮次折进 completed,不产生 failures/diagnostics", () => {
|
|
166
|
+
const first = ref("memory/retry", 0);
|
|
167
|
+
const retry1 = ref("memory/retry", 1);
|
|
168
|
+
const retry2 = ref("memory/retry", 2);
|
|
169
|
+
const state = replay([
|
|
170
|
+
{ type: "plan", at: 0, plan: { shape: { evals: 1, configs: 1, totalRuns: 3, maxConcurrency: 3 }, reused: 0, reusedFailures: [] } },
|
|
171
|
+
{ type: "attempt:start", at: 1, identity: first, who: "codex", phase: "eval.run" },
|
|
172
|
+
{ type: "attempt:complete", at: 2, identity: first, who: "codex", verdict: "passed" },
|
|
173
|
+
{ type: "attempt:early-exit", at: 3, identity: retry1, who: "codex" },
|
|
174
|
+
{ type: "attempt:early-exit", at: 4, identity: retry2, who: "codex" },
|
|
175
|
+
]);
|
|
176
|
+
expect(state).toMatchObject({ total: 3, reused: 0, running: 0, queued: 0, completed: 3 });
|
|
177
|
+
expect(state.failures).toEqual([]);
|
|
178
|
+
expect(state.diagnostics).toEqual([]);
|
|
179
|
+
});
|
|
180
|
+
|
|
181
|
+
it("errored:失败事件带 locator 写入 failures,重复同一 locator 幂等覆盖而不是重复追加", () => {
|
|
182
|
+
const a = ref("memory/agent-029");
|
|
183
|
+
let state = createInitialRunFeedbackState();
|
|
184
|
+
state = reduceRunFeedback(state, {
|
|
185
|
+
type: "plan",
|
|
186
|
+
at: 0,
|
|
187
|
+
plan: { shape: { evals: 1, configs: 1, totalRuns: 1, maxConcurrency: 1 }, reused: 0, reusedFailures: [] },
|
|
188
|
+
});
|
|
189
|
+
state = reduceRunFeedback(state, {
|
|
190
|
+
type: "attempt:start",
|
|
191
|
+
at: 1,
|
|
192
|
+
identity: a,
|
|
193
|
+
who: "compare/claude-e2b",
|
|
194
|
+
phase: "sandbox.create",
|
|
195
|
+
});
|
|
196
|
+
state = reduceRunFeedback(state, {
|
|
197
|
+
type: "attempt:complete",
|
|
198
|
+
at: 2,
|
|
199
|
+
identity: a,
|
|
200
|
+
who: "compare/claude-e2b",
|
|
201
|
+
verdict: "errored",
|
|
202
|
+
});
|
|
203
|
+
state = reduceRunFeedback(state, {
|
|
204
|
+
type: "failure",
|
|
205
|
+
at: 2,
|
|
206
|
+
locator: locator("2h8m4k1"),
|
|
207
|
+
identity: a,
|
|
208
|
+
who: "compare/claude-e2b",
|
|
209
|
+
verdict: "errored",
|
|
210
|
+
reason: "sandbox-rate-limit: E2B sandbox allocation failed after 5 attempts",
|
|
211
|
+
phase: "sandbox.create",
|
|
212
|
+
});
|
|
213
|
+
expect(state.failures).toHaveLength(1);
|
|
214
|
+
expect(state.failures[0]?.reason).toContain("sandbox-rate-limit");
|
|
215
|
+
expect(state).toMatchObject({ total: 1, running: 0, completed: 1, queued: 0 });
|
|
216
|
+
|
|
217
|
+
// 同一 locator 再来一次(比如 coordinator 重放/去抖动),覆盖而不是变成两条。
|
|
218
|
+
state = reduceRunFeedback(state, {
|
|
219
|
+
type: "failure",
|
|
220
|
+
at: 3,
|
|
221
|
+
locator: locator("2h8m4k1"),
|
|
222
|
+
identity: a,
|
|
223
|
+
who: "compare/claude-e2b",
|
|
224
|
+
verdict: "errored",
|
|
225
|
+
reason: "updated reason",
|
|
226
|
+
phase: "sandbox.create",
|
|
227
|
+
});
|
|
228
|
+
expect(state.failures).toHaveLength(1);
|
|
229
|
+
expect(state.failures[0]?.reason).toBe("updated reason");
|
|
230
|
+
});
|
|
231
|
+
|
|
232
|
+
it("budget:每次因预算跳过一个 attempt 就折进 completed,诊断按 experimentId 去重并累加 count", () => {
|
|
233
|
+
const a = ref("memory/a", 0, "regression/codex");
|
|
234
|
+
const b = ref("memory/b", 0, "regression/codex");
|
|
235
|
+
let state = createInitialRunFeedbackState();
|
|
236
|
+
state = reduceRunFeedback(state, {
|
|
237
|
+
type: "plan",
|
|
238
|
+
at: 0,
|
|
239
|
+
plan: { shape: { evals: 4, configs: 1, totalRuns: 4, maxConcurrency: 4 }, reused: 0, reusedFailures: [] },
|
|
240
|
+
});
|
|
241
|
+
state = reduceRunFeedback(state, { type: "attempt:start", at: 1, identity: a, who: "regression/codex", phase: "eval.run" });
|
|
242
|
+
state = reduceRunFeedback(state, { type: "attempt:start", at: 1, identity: b, who: "regression/codex", phase: "eval.run" });
|
|
243
|
+
state = reduceRunFeedback(state, { type: "attempt:complete", at: 2, identity: a, who: "regression/codex", verdict: "passed" });
|
|
244
|
+
expect(state).toMatchObject({ total: 4, running: 1, queued: 2, completed: 1 });
|
|
245
|
+
|
|
246
|
+
state = reduceRunFeedback(state, {
|
|
247
|
+
type: "budget-exhausted",
|
|
248
|
+
at: 3,
|
|
249
|
+
experimentId: "regression/codex",
|
|
250
|
+
spent: 25.1,
|
|
251
|
+
unstarted: 1,
|
|
252
|
+
});
|
|
253
|
+
expect(state).toMatchObject({ total: 4, running: 1, queued: 1, completed: 2 });
|
|
254
|
+
expect(state.diagnostics).toHaveLength(1);
|
|
255
|
+
expect(state.diagnostics[0]).toMatchObject({ key: "budget-exhausted:regression/codex", count: 1, severity: "warning" });
|
|
256
|
+
expect(state.diagnostics[0]?.data).toMatchObject({ experimentId: "regression/codex", spent: 25.1, unstarted: 1 });
|
|
257
|
+
|
|
258
|
+
state = reduceRunFeedback(state, {
|
|
259
|
+
type: "budget-exhausted",
|
|
260
|
+
at: 4,
|
|
261
|
+
experimentId: "regression/codex",
|
|
262
|
+
spent: 25.31,
|
|
263
|
+
unstarted: 2,
|
|
264
|
+
});
|
|
265
|
+
expect(state).toMatchObject({ total: 4, running: 1, queued: 0, completed: 3 });
|
|
266
|
+
// 去重:同一个 experimentId 仍然只有一条诊断,count 累加到 2,data 更新到最新一次的值。
|
|
267
|
+
expect(state.diagnostics).toHaveLength(1);
|
|
268
|
+
expect(state.diagnostics[0]).toMatchObject({ count: 2 });
|
|
269
|
+
expect(state.diagnostics[0]?.data).toMatchObject({ spent: 25.31, unstarted: 2 });
|
|
270
|
+
|
|
271
|
+
state = reduceRunFeedback(state, { type: "attempt:complete", at: 5, identity: b, who: "regression/codex", verdict: "passed" });
|
|
272
|
+
expect(state).toMatchObject({ total: 4, reused: 0, running: 0, queued: 0, completed: 4 });
|
|
273
|
+
});
|
|
274
|
+
|
|
275
|
+
it("interrupted:只追加一条去重诊断,不擅自改变 running/queued 计数(中断时的进行中 attempt 保持原状)", () => {
|
|
276
|
+
const a = ref("memory/a");
|
|
277
|
+
const b = ref("memory/b");
|
|
278
|
+
let state = createInitialRunFeedbackState();
|
|
279
|
+
state = reduceRunFeedback(state, {
|
|
280
|
+
type: "plan",
|
|
281
|
+
at: 0,
|
|
282
|
+
plan: { shape: { evals: 3, configs: 1, totalRuns: 3, maxConcurrency: 3 }, reused: 0, reusedFailures: [] },
|
|
283
|
+
});
|
|
284
|
+
state = reduceRunFeedback(state, { type: "attempt:start", at: 1, identity: a, who: "codex", phase: "eval.run" });
|
|
285
|
+
const beforeInterrupt = state;
|
|
286
|
+
state = reduceRunFeedback(state, { type: "interrupted", at: 2 });
|
|
287
|
+
expect(state).toMatchObject({ total: 3, running: 1, queued: 2, completed: 0 });
|
|
288
|
+
expect(state.diagnostics).toHaveLength(1);
|
|
289
|
+
expect(state.diagnostics[0]).toMatchObject({ key: "interrupted", severity: "warning", count: 1 });
|
|
290
|
+
// interrupted 只追加诊断,counts/active 与中断前完全一致(除了 diagnostics 数组本身)。
|
|
291
|
+
expect(state.total).toBe(beforeInterrupt.total);
|
|
292
|
+
expect(state.running).toBe(beforeInterrupt.running);
|
|
293
|
+
expect(state.queued).toBe(beforeInterrupt.queued);
|
|
294
|
+
expect(state.completed).toBe(beforeInterrupt.completed);
|
|
295
|
+
expect(state.active).toBe(beforeInterrupt.active);
|
|
296
|
+
|
|
297
|
+
// 再来一次 interrupted(理论上不该发生,防御性验证不会重复追加成两条)。
|
|
298
|
+
state = reduceRunFeedback(state, { type: "interrupted", at: 3 });
|
|
299
|
+
expect(state.diagnostics).toHaveLength(1);
|
|
300
|
+
expect(state.diagnostics[0]).toMatchObject({ count: 2 });
|
|
301
|
+
|
|
302
|
+
void b; // 未派发的第三个 attempt 停留在 queued,不需要单独事件也满足守恒公式。
|
|
303
|
+
});
|
|
304
|
+
|
|
305
|
+
it("summary / saved / attempt:queued 是纯粹的只读挂点:不改变任何计数或 active,原样返回同一份状态", () => {
|
|
306
|
+
let state = createInitialRunFeedbackState();
|
|
307
|
+
state = reduceRunFeedback(state, {
|
|
308
|
+
type: "plan",
|
|
309
|
+
at: 0,
|
|
310
|
+
plan: { shape: { evals: 1, configs: 1, totalRuns: 1, maxConcurrency: 1 }, reused: 0, reusedFailures: [] },
|
|
311
|
+
});
|
|
312
|
+
const afterQueuedNoop = reduceRunFeedback(state, {
|
|
313
|
+
type: "attempt:queued",
|
|
314
|
+
at: 1,
|
|
315
|
+
identity: ref("memory/a"),
|
|
316
|
+
who: "codex",
|
|
317
|
+
});
|
|
318
|
+
expect(afterQueuedNoop).toBe(state); // 引用相等:真正的 no-op,不产生垃圾对象
|
|
319
|
+
|
|
320
|
+
const afterSummary = reduceRunFeedback(state, {
|
|
321
|
+
type: "summary",
|
|
322
|
+
at: 5,
|
|
323
|
+
summary: {
|
|
324
|
+
agent: "codex",
|
|
325
|
+
startedAt: "2026-07-13T00:00:00.000Z",
|
|
326
|
+
completedAt: "2026-07-13T00:01:00.000Z",
|
|
327
|
+
passed: 1,
|
|
328
|
+
failed: 0,
|
|
329
|
+
skipped: 0,
|
|
330
|
+
errored: 0,
|
|
331
|
+
durationMs: 60_000,
|
|
332
|
+
results: [],
|
|
333
|
+
},
|
|
334
|
+
completion: { status: "complete", unstarted: 0, earlyExitUnstarted: 0, reporterErrors: [] },
|
|
335
|
+
});
|
|
336
|
+
expect(afterSummary).toBe(state);
|
|
337
|
+
|
|
338
|
+
const afterSaved = reduceRunFeedback(state, { type: "saved", at: 6, paths: [".niceeval/compare/bub-e2b/2026-07-13T000000Z"] });
|
|
339
|
+
expect(afterSaved).toBe(state);
|
|
340
|
+
});
|
|
341
|
+
|
|
342
|
+
it("tick 只更新 elapsedMs,不影响其它任何字段", () => {
|
|
343
|
+
let state = createInitialRunFeedbackState();
|
|
344
|
+
state = reduceRunFeedback(state, {
|
|
345
|
+
type: "plan",
|
|
346
|
+
at: 0,
|
|
347
|
+
plan: { shape: { evals: 1, configs: 1, totalRuns: 1, maxConcurrency: 1 }, reused: 0, reusedFailures: [] },
|
|
348
|
+
});
|
|
349
|
+
const before = state;
|
|
350
|
+
state = reduceRunFeedback(state, { type: "tick", at: 1000, elapsedMs: 1000 });
|
|
351
|
+
expect(state.elapsedMs).toBe(1000);
|
|
352
|
+
expect(state.total).toBe(before.total);
|
|
353
|
+
expect(state.queued).toBe(before.queued);
|
|
354
|
+
expect(state.active).toBe(before.active);
|
|
355
|
+
});
|
|
356
|
+
|
|
357
|
+
it("diagnostic:并发 attempt 报同一 warning 只保留一条,count 累加受影响次数", () => {
|
|
358
|
+
const attempts = [ref("memory/a"), ref("memory/b"), ref("memory/c")];
|
|
359
|
+
let state = createInitialRunFeedbackState();
|
|
360
|
+
state = reduceRunFeedback(state, {
|
|
361
|
+
type: "plan",
|
|
362
|
+
at: 0,
|
|
363
|
+
plan: { shape: { evals: 3, configs: 1, totalRuns: 3, maxConcurrency: 3 }, reused: 0, reusedFailures: [] },
|
|
364
|
+
});
|
|
365
|
+
for (const identity of attempts) {
|
|
366
|
+
state = reduceRunFeedback(state, {
|
|
367
|
+
type: "diagnostic",
|
|
368
|
+
at: 1,
|
|
369
|
+
key: "memory-warmup-degraded",
|
|
370
|
+
severity: "warning",
|
|
371
|
+
message: "Memory warmup failed; continuing with a cold index",
|
|
372
|
+
identity,
|
|
373
|
+
});
|
|
374
|
+
}
|
|
375
|
+
expect(state.diagnostics).toHaveLength(1);
|
|
376
|
+
expect(state.diagnostics[0]).toMatchObject({ key: "memory-warmup-degraded", count: 3 });
|
|
377
|
+
});
|
|
378
|
+
|
|
379
|
+
it("phase 变化清空上一个 phase 的 detail,不把旧阶段的次要文本带进新阶段", () => {
|
|
380
|
+
const a = ref("memory/a");
|
|
381
|
+
let state = createInitialRunFeedbackState();
|
|
382
|
+
state = reduceRunFeedback(state, {
|
|
383
|
+
type: "plan",
|
|
384
|
+
at: 0,
|
|
385
|
+
plan: { shape: { evals: 1, configs: 1, totalRuns: 1, maxConcurrency: 1 }, reused: 0, reusedFailures: [] },
|
|
386
|
+
});
|
|
387
|
+
state = reduceRunFeedback(state, { type: "attempt:start", at: 1, identity: a, who: "codex", phase: "eval.run" });
|
|
388
|
+
state = reduceRunFeedback(state, { type: "attempt:progress", at: 2, identity: a, detail: "tool: shell" });
|
|
389
|
+
expect([...state.active.values()][0]?.detail).toBe("tool: shell");
|
|
390
|
+
state = reduceRunFeedback(state, { type: "attempt:phase", at: 3, identity: a, phase: "workspace.diff" });
|
|
391
|
+
const activeAfterPhase = [...state.active.values()][0];
|
|
392
|
+
expect(activeAfterPhase?.phase).toBe("workspace.diff");
|
|
393
|
+
expect(activeAfterPhase?.detail).toBeUndefined();
|
|
394
|
+
});
|
|
395
|
+
});
|