@tangle-network/agent-eval 0.94.0 → 0.95.0
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/CHANGELOG.md +15 -0
- package/README.md +44 -30
- package/dist/action-policy.d.ts +24 -0
- package/dist/action-policy.d.ts.map +1 -0
- package/dist/action-policy.test.d.ts +2 -0
- package/dist/action-policy.test.d.ts.map +1 -0
- package/dist/active-learning.d.ts +41 -0
- package/dist/active-learning.d.ts.map +1 -0
- package/dist/adapters/http.d.ts +15 -21
- package/dist/adapters/http.d.ts.map +1 -0
- package/dist/adapters/http.js.map +1 -1
- package/dist/adapters/langchain.d.ts +7 -13
- package/dist/adapters/langchain.d.ts.map +1 -0
- package/dist/adapters/otel.d.ts +13 -24
- package/dist/adapters/otel.d.ts.map +1 -0
- package/dist/agent-profile-cell.d.ts +101 -0
- package/dist/agent-profile-cell.d.ts.map +1 -0
- package/dist/agent-profile.d.ts +27 -0
- package/dist/agent-profile.d.ts.map +1 -0
- package/dist/agent-profile.test.d.ts +2 -0
- package/dist/agent-profile.test.d.ts.map +1 -0
- package/dist/analyst/adapters.d.ts +62 -0
- package/dist/analyst/adapters.d.ts.map +1 -0
- package/dist/analyst/analyst.test.d.ts +2 -0
- package/dist/analyst/analyst.test.d.ts.map +1 -0
- package/dist/analyst/ax-service.d.ts +27 -0
- package/dist/analyst/ax-service.d.ts.map +1 -0
- package/dist/analyst/behavioral-analyst.d.ts +28 -0
- package/dist/analyst/behavioral-analyst.d.ts.map +1 -0
- package/dist/analyst/chat-client.d.ts +91 -0
- package/dist/analyst/chat-client.d.ts.map +1 -0
- package/dist/analyst/default-registry.d.ts +27 -0
- package/dist/analyst/default-registry.d.ts.map +1 -0
- package/dist/analyst/default-registry.test.d.ts +2 -0
- package/dist/analyst/default-registry.test.d.ts.map +1 -0
- package/dist/analyst/finding-signature.d.ts +48 -0
- package/dist/analyst/finding-signature.d.ts.map +1 -0
- package/dist/analyst/finding-subject.d.ts +146 -0
- package/dist/analyst/finding-subject.d.ts.map +1 -0
- package/dist/analyst/finding-subject.test.d.ts +2 -0
- package/dist/analyst/finding-subject.test.d.ts.map +1 -0
- package/dist/analyst/findings-store.d.ts +75 -0
- package/dist/analyst/findings-store.d.ts.map +1 -0
- package/dist/analyst/index.d.ts +28 -256
- package/dist/analyst/index.d.ts.map +1 -0
- package/dist/analyst/index.js +5 -65
- package/dist/analyst/index.js.map +1 -1
- package/dist/{kind-factory-0BhLSI27.d.ts → analyst/kind-factory.d.ts} +11 -63
- package/dist/analyst/kind-factory.d.ts.map +1 -0
- package/dist/analyst/kinds/failure-mode.d.ts +19 -0
- package/dist/analyst/kinds/failure-mode.d.ts.map +1 -0
- package/dist/analyst/kinds/improvement.d.ts +23 -0
- package/dist/analyst/kinds/improvement.d.ts.map +1 -0
- package/dist/analyst/kinds/index.d.ts +22 -0
- package/dist/analyst/kinds/index.d.ts.map +1 -0
- package/dist/analyst/kinds/kinds.test.d.ts +2 -0
- package/dist/analyst/kinds/kinds.test.d.ts.map +1 -0
- package/dist/analyst/kinds/knowledge-gap.d.ts +28 -0
- package/dist/analyst/kinds/knowledge-gap.d.ts.map +1 -0
- package/dist/analyst/kinds/knowledge-poisoning.d.ts +22 -0
- package/dist/analyst/kinds/knowledge-poisoning.d.ts.map +1 -0
- package/dist/analyst/kinds/skill-usage.d.ts +84 -0
- package/dist/analyst/kinds/skill-usage.d.ts.map +1 -0
- package/dist/analyst/kinds/skill-usage.test.d.ts +2 -0
- package/dist/analyst/kinds/skill-usage.test.d.ts.map +1 -0
- package/dist/analyst/parse-tolerant.d.ts +26 -0
- package/dist/analyst/parse-tolerant.d.ts.map +1 -0
- package/dist/analyst/parse-tolerant.test.d.ts +2 -0
- package/dist/analyst/parse-tolerant.test.d.ts.map +1 -0
- package/dist/analyst/registry.budget.test.d.ts +2 -0
- package/dist/analyst/registry.budget.test.d.ts.map +1 -0
- package/dist/{default-registry-6dhErQbs.d.ts → analyst/registry.d.ts} +8 -37
- package/dist/analyst/registry.d.ts.map +1 -0
- package/dist/analyst/steer-firewall.d.ts +35 -0
- package/dist/analyst/steer-firewall.d.ts.map +1 -0
- package/dist/analyst/steer-firewall.test.d.ts +2 -0
- package/dist/analyst/steer-firewall.test.d.ts.map +1 -0
- package/dist/analyst/structure-findings.d.ts +37 -0
- package/dist/analyst/structure-findings.d.ts.map +1 -0
- package/dist/analyst/structure-findings.test.d.ts +2 -0
- package/dist/analyst/structure-findings.test.d.ts.map +1 -0
- package/dist/analyst/tool-groups.d.ts +34 -0
- package/dist/analyst/tool-groups.d.ts.map +1 -0
- package/dist/{types-Ce17tDlG.d.ts → analyst/types.d.ts} +19 -112
- package/dist/analyst/types.d.ts.map +1 -0
- package/dist/anti-slop.d.ts +59 -0
- package/dist/anti-slop.d.ts.map +1 -0
- package/dist/artifact-validator.d.ts +74 -0
- package/dist/artifact-validator.d.ts.map +1 -0
- package/dist/attestation.d.ts +63 -0
- package/dist/attestation.d.ts.map +1 -0
- package/dist/attestation.test.d.ts +2 -0
- package/dist/attestation.test.d.ts.map +1 -0
- package/dist/authenticity/index.d.ts +15 -16
- package/dist/authenticity/index.d.ts.map +1 -0
- package/dist/authenticity/index.test.d.ts +2 -0
- package/dist/authenticity/index.test.d.ts.map +1 -0
- package/dist/auto-pr.d.ts +120 -0
- package/dist/auto-pr.d.ts.map +1 -0
- package/dist/{baseline-Bbid3WoO.d.ts → baseline.d.ts} +8 -44
- package/dist/baseline.d.ts.map +1 -0
- package/dist/behavior-dsl.d.ts +73 -0
- package/dist/behavior-dsl.d.ts.map +1 -0
- package/dist/belief-state/calibration.d.ts +10 -0
- package/dist/belief-state/calibration.d.ts.map +1 -0
- package/dist/belief-state/calibration.test.d.ts +2 -0
- package/dist/belief-state/calibration.test.d.ts.map +1 -0
- package/dist/belief-state/code-agent-corpus.d.ts +66 -0
- package/dist/belief-state/code-agent-corpus.d.ts.map +1 -0
- package/dist/belief-state/code-agent-corpus.test.d.ts +2 -0
- package/dist/belief-state/code-agent-corpus.test.d.ts.map +1 -0
- package/dist/belief-state/code-agent-evidence.d.ts +22 -0
- package/dist/belief-state/code-agent-evidence.d.ts.map +1 -0
- package/dist/belief-state/code-agent-evidence.test.d.ts +2 -0
- package/dist/belief-state/code-agent-evidence.test.d.ts.map +1 -0
- package/dist/belief-state/extract.d.ts +7 -0
- package/dist/belief-state/extract.d.ts.map +1 -0
- package/dist/belief-state/extract.test.d.ts +2 -0
- package/dist/belief-state/extract.test.d.ts.map +1 -0
- package/dist/belief-state/index.d.ts +14 -604
- package/dist/belief-state/index.d.ts.map +1 -0
- package/dist/belief-state/ope.d.ts +17 -0
- package/dist/belief-state/ope.d.ts.map +1 -0
- package/dist/belief-state/ope.test.d.ts +2 -0
- package/dist/belief-state/ope.test.d.ts.map +1 -0
- package/dist/belief-state/phase0-measurement.d.ts +55 -0
- package/dist/belief-state/phase0-measurement.d.ts.map +1 -0
- package/dist/belief-state/report.d.ts +17 -0
- package/dist/belief-state/report.d.ts.map +1 -0
- package/dist/belief-state/report.test.d.ts +2 -0
- package/dist/belief-state/report.test.d.ts.map +1 -0
- package/dist/belief-state/research-evidence.d.ts +23 -0
- package/dist/belief-state/research-evidence.d.ts.map +1 -0
- package/dist/belief-state/research-evidence.test.d.ts +2 -0
- package/dist/belief-state/research-evidence.test.d.ts.map +1 -0
- package/dist/belief-state/runtime-benchmark-corpus.d.ts +32 -0
- package/dist/belief-state/runtime-benchmark-corpus.d.ts.map +1 -0
- package/dist/belief-state/runtime-hooks.d.ts +87 -0
- package/dist/belief-state/runtime-hooks.d.ts.map +1 -0
- package/dist/belief-state/runtime-hooks.test.d.ts +2 -0
- package/dist/belief-state/runtime-hooks.test.d.ts.map +1 -0
- package/dist/belief-state/selective.d.ts +15 -0
- package/dist/belief-state/selective.d.ts.map +1 -0
- package/dist/belief-state/selective.test.d.ts +2 -0
- package/dist/belief-state/selective.test.d.ts.map +1 -0
- package/dist/belief-state/shadow-probe.d.ts +80 -0
- package/dist/belief-state/shadow-probe.d.ts.map +1 -0
- package/dist/belief-state/shadow-probe.test.d.ts +2 -0
- package/dist/belief-state/shadow-probe.test.d.ts.map +1 -0
- package/dist/belief-state/types.d.ts +195 -0
- package/dist/belief-state/types.d.ts.map +1 -0
- package/dist/belief-state/types.test.d.ts +2 -0
- package/dist/belief-state/types.test.d.ts.map +1 -0
- package/dist/benchmark.d.ts +14 -0
- package/dist/benchmark.d.ts.map +1 -0
- package/dist/benchmarks/index.d.ts +23 -4
- package/dist/benchmarks/index.d.ts.map +1 -0
- package/dist/benchmarks/routing/dataset.d.ts +34 -0
- package/dist/benchmarks/routing/dataset.d.ts.map +1 -0
- package/dist/benchmarks/routing/index.d.ts +34 -0
- package/dist/benchmarks/routing/index.d.ts.map +1 -0
- package/dist/benchmarks/types.d.ts +49 -0
- package/dist/benchmarks/types.d.ts.map +1 -0
- package/dist/bisector.d.ts +81 -0
- package/dist/bisector.d.ts.map +1 -0
- package/dist/budget-guard.d.ts +31 -0
- package/dist/budget-guard.d.ts.map +1 -0
- package/dist/builder-eval/builder-session.d.ts +111 -0
- package/dist/builder-eval/builder-session.d.ts.map +1 -0
- package/dist/builder-eval/correlation.d.ts +32 -0
- package/dist/builder-eval/correlation.d.ts.map +1 -0
- package/dist/builder-eval/index.d.ts +5 -250
- package/dist/builder-eval/index.d.ts.map +1 -0
- package/dist/builder-eval/project-registry.d.ts +51 -0
- package/dist/builder-eval/project-registry.d.ts.map +1 -0
- package/dist/builder-eval/three-layer-eval.d.ts +55 -0
- package/dist/builder-eval/three-layer-eval.d.ts.map +1 -0
- package/dist/campaign/analyst-surface.d.ts +108 -0
- package/dist/campaign/analyst-surface.d.ts.map +1 -0
- package/dist/campaign/analyst-surface.test.d.ts +2 -0
- package/dist/campaign/analyst-surface.test.d.ts.map +1 -0
- package/dist/campaign/auto-pr.d.ts +46 -0
- package/dist/campaign/auto-pr.d.ts.map +1 -0
- package/dist/campaign/distillation/agreement-judge.d.ts +69 -0
- package/dist/campaign/distillation/agreement-judge.d.ts.map +1 -0
- package/dist/campaign/distillation/cli.d.ts +35 -0
- package/dist/campaign/distillation/cli.d.ts.map +1 -0
- package/dist/campaign/distillation/distillation.test.d.ts +2 -0
- package/dist/campaign/distillation/distillation.test.d.ts.map +1 -0
- package/dist/campaign/distillation/gold-scenarios.d.ts +54 -0
- package/dist/campaign/distillation/gold-scenarios.d.ts.map +1 -0
- package/dist/campaign/distillation/run-distillation.d.ts +119 -0
- package/dist/campaign/distillation/run-distillation.d.ts.map +1 -0
- package/dist/campaign/gates/compose.d.ts +12 -0
- package/dist/campaign/gates/compose.d.ts.map +1 -0
- package/dist/campaign/gates/default-production-gate.d.ts +58 -0
- package/dist/campaign/gates/default-production-gate.d.ts.map +1 -0
- package/dist/campaign/gates/heldout-gate.d.ts +12 -0
- package/dist/campaign/gates/heldout-gate.d.ts.map +1 -0
- package/dist/campaign/gates/promotion-policy.d.ts +125 -0
- package/dist/campaign/gates/promotion-policy.d.ts.map +1 -0
- package/dist/campaign/gates/promotion-policy.test.d.ts +2 -0
- package/dist/campaign/gates/promotion-policy.test.d.ts.map +1 -0
- package/dist/campaign/gates/sequential.d.ts +146 -0
- package/dist/campaign/gates/sequential.d.ts.map +1 -0
- package/dist/campaign/gates/sequential.test.d.ts +2 -0
- package/dist/campaign/gates/sequential.test.d.ts.map +1 -0
- package/dist/campaign/gates/statistical-heldout.d.ts +99 -0
- package/dist/campaign/gates/statistical-heldout.d.ts.map +1 -0
- package/dist/campaign/gates/statistical-heldout.test.d.ts +2 -0
- package/dist/campaign/gates/statistical-heldout.test.d.ts.map +1 -0
- package/dist/campaign/index.d.ts +38 -1341
- package/dist/campaign/index.d.ts.map +1 -0
- package/dist/campaign/index.js +1863 -1316
- package/dist/campaign/index.js.map +1 -1
- package/dist/campaign/labeled-store/fs-adapter.d.ts +59 -0
- package/dist/campaign/labeled-store/fs-adapter.d.ts.map +1 -0
- package/dist/campaign/presets/compare-proposers.d.ts +146 -0
- package/dist/campaign/presets/compare-proposers.d.ts.map +1 -0
- package/dist/campaign/presets/playback.d.ts +120 -0
- package/dist/campaign/presets/playback.d.ts.map +1 -0
- package/dist/campaign/presets/playback.test.d.ts +2 -0
- package/dist/campaign/presets/playback.test.d.ts.map +1 -0
- package/dist/campaign/presets/run-eval.d.ts +14 -0
- package/dist/campaign/presets/run-eval.d.ts.map +1 -0
- package/dist/campaign/presets/run-improvement-loop.d.ts +63 -0
- package/dist/campaign/presets/run-improvement-loop.d.ts.map +1 -0
- package/dist/campaign/presets/run-improvement-loop.test.d.ts +2 -0
- package/dist/campaign/presets/run-improvement-loop.test.d.ts.map +1 -0
- package/dist/campaign/presets/run-optimization.d.ts +92 -0
- package/dist/campaign/presets/run-optimization.d.ts.map +1 -0
- package/dist/campaign/presets/run-profile-matrix.d.ts +151 -0
- package/dist/campaign/presets/run-profile-matrix.d.ts.map +1 -0
- package/dist/campaign/presets/run-skill-opt.d.ts +96 -0
- package/dist/campaign/presets/run-skill-opt.d.ts.map +1 -0
- package/dist/campaign/proposers/_findings-text.d.ts +22 -0
- package/dist/campaign/proposers/_findings-text.d.ts.map +1 -0
- package/dist/campaign/proposers/ace.d.ts +33 -0
- package/dist/campaign/proposers/ace.d.ts.map +1 -0
- package/dist/campaign/proposers/ace.test.d.ts +2 -0
- package/dist/campaign/proposers/ace.test.d.ts.map +1 -0
- package/dist/campaign/proposers/analysis-edit.d.ts +32 -0
- package/dist/campaign/proposers/analysis-edit.d.ts.map +1 -0
- package/dist/campaign/proposers/evolutionary.d.ts +20 -0
- package/dist/campaign/proposers/evolutionary.d.ts.map +1 -0
- package/dist/campaign/proposers/fapo.d.ts +120 -0
- package/dist/campaign/proposers/fapo.d.ts.map +1 -0
- package/dist/campaign/proposers/gepa.d.ts +86 -0
- package/dist/campaign/proposers/gepa.d.ts.map +1 -0
- package/dist/campaign/proposers/halo.d.ts +44 -0
- package/dist/campaign/proposers/halo.d.ts.map +1 -0
- package/dist/campaign/proposers/halo.test.d.ts +2 -0
- package/dist/campaign/proposers/halo.test.d.ts.map +1 -0
- package/dist/campaign/proposers/memory.d.ts +47 -0
- package/dist/campaign/proposers/memory.d.ts.map +1 -0
- package/dist/campaign/proposers/memory.test.d.ts +2 -0
- package/dist/campaign/proposers/memory.test.d.ts.map +1 -0
- package/dist/campaign/proposers/skill-opt.d.ts +88 -0
- package/dist/campaign/proposers/skill-opt.d.ts.map +1 -0
- package/dist/campaign/proposers/trace-analyst.d.ts +48 -0
- package/dist/campaign/proposers/trace-analyst.d.ts.map +1 -0
- package/dist/campaign/proposers/trace-analyst.test.d.ts +2 -0
- package/dist/campaign/proposers/trace-analyst.test.d.ts.map +1 -0
- package/dist/campaign/provenance.d.ts +185 -0
- package/dist/campaign/provenance.d.ts.map +1 -0
- package/dist/campaign/run-campaign.d.ts +90 -0
- package/dist/campaign/run-campaign.d.ts.map +1 -0
- package/dist/campaign/score-utils.d.ts +26 -0
- package/dist/campaign/score-utils.d.ts.map +1 -0
- package/dist/campaign/skill-patch.d.ts +62 -0
- package/dist/campaign/skill-patch.d.ts.map +1 -0
- package/dist/campaign/storage.d.ts +38 -0
- package/dist/campaign/storage.d.ts.map +1 -0
- package/dist/{types-BU-7W85F.d.ts → campaign/types.d.ts} +98 -99
- package/dist/campaign/types.d.ts.map +1 -0
- package/dist/campaign/worktree/index.d.ts +53 -0
- package/dist/campaign/worktree/index.d.ts.map +1 -0
- package/dist/canary.d.ts +101 -0
- package/dist/canary.d.ts.map +1 -0
- package/dist/causal-attribution.d.ts +45 -0
- package/dist/causal-attribution.d.ts.map +1 -0
- package/dist/{chunk-2K6UUZ7P.js → chunk-2T4EZACH.js} +1 -1
- package/dist/chunk-2T4EZACH.js.map +1 -0
- package/dist/{chunk-CTBHKLEU.js → chunk-77T4STFI.js} +59 -86
- package/dist/chunk-77T4STFI.js.map +1 -0
- package/dist/{chunk-EGPMSBEZ.js → chunk-7QTQKIDD.js} +178 -177
- package/dist/chunk-7QTQKIDD.js.map +1 -0
- package/dist/{chunk-MIFZUPEK.js → chunk-AQ5WQAIV.js} +21 -6
- package/dist/chunk-AQ5WQAIV.js.map +1 -0
- package/dist/chunk-DJWX3GVS.js +81 -0
- package/dist/chunk-DJWX3GVS.js.map +1 -0
- package/dist/{chunk-S6OZEZQK.js → chunk-HMA63UEO.js} +37 -9
- package/dist/{chunk-S6OZEZQK.js.map → chunk-HMA63UEO.js.map} +1 -1
- package/dist/{chunk-TBDR6PAI.js → chunk-IZCEK2HR.js} +2 -2
- package/dist/{chunk-SD2YFWQQ.js → chunk-KKWJD5E6.js} +20 -20
- package/dist/chunk-KKWJD5E6.js.map +1 -0
- package/dist/{chunk-KWRRMR3J.js → chunk-LO6IOIJ2.js} +10 -10
- package/dist/chunk-LO6IOIJ2.js.map +1 -0
- package/dist/{chunk-E4GH6USR.js → chunk-NZEQVRH5.js} +2 -2
- package/dist/chunk-NZEQVRH5.js.map +1 -0
- package/dist/{chunk-MPQWFX6Y.js → chunk-PSWWQXHF.js} +13 -88
- package/dist/chunk-PSWWQXHF.js.map +1 -0
- package/dist/{chunk-Q5LIB7BC.js → chunk-S4SYLDFX.js} +2 -2
- package/dist/chunk-S4SYLDFX.js.map +1 -0
- package/dist/{chunk-KW53MSA5.js → chunk-X74V6ESX.js} +2 -2
- package/dist/{chunk-QMUEXQJS.js → chunk-YBIGNSCZ.js} +81 -4
- package/dist/chunk-YBIGNSCZ.js.map +1 -0
- package/dist/{chunk-2KNZHH3P.js → chunk-Z6L6YSU6.js} +2 -2
- package/dist/ci-gate.d.ts +44 -0
- package/dist/ci-gate.d.ts.map +1 -0
- package/dist/cli.d.ts +2 -0
- package/dist/cli.d.ts.map +1 -0
- package/dist/client.d.ts +77 -0
- package/dist/client.d.ts.map +1 -0
- package/dist/client.test.d.ts +2 -0
- package/dist/client.test.d.ts.map +1 -0
- package/dist/command-runner.d.ts +74 -0
- package/dist/command-runner.d.ts.map +1 -0
- package/dist/command-runner.test.d.ts +2 -0
- package/dist/command-runner.test.d.ts.map +1 -0
- package/dist/completion-verifier.d.ts +147 -0
- package/dist/completion-verifier.d.ts.map +1 -0
- package/dist/completion-verifier.test.d.ts +9 -0
- package/dist/completion-verifier.test.d.ts.map +1 -0
- package/dist/concurrency.d.ts +23 -0
- package/dist/concurrency.d.ts.map +1 -0
- package/dist/contamination-guard.d.ts +81 -0
- package/dist/contamination-guard.d.ts.map +1 -0
- package/dist/{analyze-runs-B6Ljo_dI.d.ts → contract/analyze-runs.d.ts} +9 -10
- package/dist/contract/analyze-runs.d.ts.map +1 -0
- package/dist/contract/define-agent-eval.d.ts +52 -0
- package/dist/contract/define-agent-eval.d.ts.map +1 -0
- package/dist/contract/diff.d.ts +114 -0
- package/dist/contract/diff.d.ts.map +1 -0
- package/dist/contract/index.d.ts +106 -640
- package/dist/contract/index.d.ts.map +1 -0
- package/dist/contract/index.js +127 -17
- package/dist/contract/index.js.map +1 -1
- package/dist/{insight-report-DWl3z9tl.d.ts → contract/insight-report.d.ts} +16 -19
- package/dist/contract/insight-report.d.ts.map +1 -0
- package/dist/contract/insight-types-fwd.d.ts +7 -0
- package/dist/contract/insight-types-fwd.d.ts.map +1 -0
- package/dist/contract/intake/agent-trace.d.ts +97 -0
- package/dist/contract/intake/agent-trace.d.ts.map +1 -0
- package/dist/{code-agent-session-BO8nCnv3.d.ts → contract/intake/code-agent-session.d.ts} +15 -17
- package/dist/contract/intake/code-agent-session.d.ts.map +1 -0
- package/dist/contract/intake/feedback-table.d.ts +87 -0
- package/dist/contract/intake/feedback-table.d.ts.map +1 -0
- package/dist/contract/intake/index.d.ts +22 -0
- package/dist/contract/intake/index.d.ts.map +1 -0
- package/dist/contract/intake/otel-spans.d.ts +33 -0
- package/dist/contract/intake/otel-spans.d.ts.map +1 -0
- package/dist/contract/self-improve.d.ts +284 -0
- package/dist/contract/self-improve.d.ts.map +1 -0
- package/dist/{control-runtime-Acf9CGhw.d.ts → control-runtime.d.ts} +23 -26
- package/dist/control-runtime.d.ts.map +1 -0
- package/dist/control-runtime.test.d.ts +2 -0
- package/dist/control-runtime.test.d.ts.map +1 -0
- package/dist/control.d.ts +11 -9
- package/dist/control.d.ts.map +1 -0
- package/dist/control.js +2 -2
- package/dist/convergence.d.ts +29 -0
- package/dist/convergence.d.ts.map +1 -0
- package/dist/{cost-ledger-DuSqlw5B.d.ts → cost-ledger.d.ts} +10 -11
- package/dist/cost-ledger.d.ts.map +1 -0
- package/dist/cost-ledger.test.d.ts +2 -0
- package/dist/cost-ledger.test.d.ts.map +1 -0
- package/dist/cost-report.d.ts +43 -0
- package/dist/cost-report.d.ts.map +1 -0
- package/dist/cost-report.test.d.ts +2 -0
- package/dist/cost-report.test.d.ts.map +1 -0
- package/dist/cost-tracker.d.ts +76 -0
- package/dist/cost-tracker.d.ts.map +1 -0
- package/dist/{counterfactual-DlOz8PBx.d.ts → counterfactual.d.ts} +12 -13
- package/dist/counterfactual.d.ts.map +1 -0
- package/dist/cross-trace-diff.d.ts +56 -0
- package/dist/cross-trace-diff.d.ts.map +1 -0
- package/dist/{dataset-BbGkaN2I.d.ts → dataset.d.ts} +11 -14
- package/dist/dataset.d.ts.map +1 -0
- package/dist/deploy-gate-layer.d.ts +125 -0
- package/dist/deploy-gate-layer.d.ts.map +1 -0
- package/dist/deploy-gate-layer.test.d.ts +2 -0
- package/dist/deploy-gate-layer.test.d.ts.map +1 -0
- package/dist/description-length-gate.d.ts +119 -0
- package/dist/description-length-gate.d.ts.map +1 -0
- package/dist/detectors/edge.test.d.ts +2 -0
- package/dist/detectors/edge.test.d.ts.map +1 -0
- package/dist/detectors/index.d.ts +81 -0
- package/dist/detectors/index.d.ts.map +1 -0
- package/dist/detectors/index.test.d.ts +2 -0
- package/dist/detectors/index.test.d.ts.map +1 -0
- package/dist/diagnose/causal-sweep.d.ts +100 -0
- package/dist/diagnose/causal-sweep.d.ts.map +1 -0
- package/dist/diagnose/index.d.ts +36 -0
- package/dist/diagnose/index.d.ts.map +1 -0
- package/dist/diagnose/remediation.d.ts +68 -0
- package/dist/diagnose/remediation.d.ts.map +1 -0
- package/dist/diagnose/repair.d.ts +77 -0
- package/dist/diagnose/repair.d.ts.map +1 -0
- package/dist/diagnose.d.ts +1 -251
- package/dist/diagnose.js +1 -1
- package/dist/discover-personas.d.ts +35 -0
- package/dist/discover-personas.d.ts.map +1 -0
- package/dist/driver.d.ts +95 -0
- package/dist/driver.d.ts.map +1 -0
- package/dist/driver.test.d.ts +8 -0
- package/dist/driver.test.d.ts.map +1 -0
- package/dist/dual-agent-bench.d.ts +81 -0
- package/dist/dual-agent-bench.d.ts.map +1 -0
- package/dist/error-count-extractor.d.ts +47 -0
- package/dist/error-count-extractor.d.ts.map +1 -0
- package/dist/error-count-extractor.test.d.ts +2 -0
- package/dist/error-count-extractor.test.d.ts.map +1 -0
- package/dist/{errors-CzMUYo7b.d.ts → errors.d.ts} +10 -11
- package/dist/errors.d.ts.map +1 -0
- package/dist/{researcher-B0C2_fVO.d.ts → eval-campaign.d.ts} +34 -156
- package/dist/eval-campaign.d.ts.map +1 -0
- package/dist/eval-campaign.test.d.ts +2 -0
- package/dist/eval-campaign.test.d.ts.map +1 -0
- package/dist/eval-tools.d.ts +55 -0
- package/dist/eval-tools.d.ts.map +1 -0
- package/dist/eval-trace-store.d.ts +107 -0
- package/dist/eval-trace-store.d.ts.map +1 -0
- package/dist/eval-trace-store.test.d.ts +2 -0
- package/dist/eval-trace-store.test.d.ts.map +1 -0
- package/dist/executor.d.ts +38 -0
- package/dist/executor.d.ts.map +1 -0
- package/dist/executor.test.d.ts +10 -0
- package/dist/executor.test.d.ts.map +1 -0
- package/dist/experiment-tracker.d.ts +178 -0
- package/dist/experiment-tracker.d.ts.map +1 -0
- package/dist/experiment-tracker.test.d.ts +2 -0
- package/dist/experiment-tracker.test.d.ts.map +1 -0
- package/dist/failure-taxonomy.d.ts +38 -0
- package/dist/failure-taxonomy.d.ts.map +1 -0
- package/dist/{feedback-trajectory-BxY0cKfs.d.ts → feedback-trajectory.d.ts} +36 -38
- package/dist/feedback-trajectory.d.ts.map +1 -0
- package/dist/feedback-trajectory.test.d.ts +2 -0
- package/dist/feedback-trajectory.test.d.ts.map +1 -0
- package/dist/flow-layer.d.ts +90 -0
- package/dist/flow-layer.d.ts.map +1 -0
- package/dist/flow-layer.test.d.ts +2 -0
- package/dist/flow-layer.test.d.ts.map +1 -0
- package/dist/fuzz/capsule.d.ts +46 -0
- package/dist/fuzz/capsule.d.ts.map +1 -0
- package/dist/fuzz/cube.d.ts +36 -0
- package/dist/fuzz/cube.d.ts.map +1 -0
- package/dist/fuzz/explorer-cost.test.d.ts +2 -0
- package/dist/fuzz/explorer-cost.test.d.ts.map +1 -0
- package/dist/fuzz/explorer.d.ts +64 -0
- package/dist/fuzz/explorer.d.ts.map +1 -0
- package/dist/fuzz/fuzz-agent.d.ts +16 -0
- package/dist/fuzz/fuzz-agent.d.ts.map +1 -0
- package/dist/fuzz/fuzz-agent.test.d.ts +2 -0
- package/dist/fuzz/fuzz-agent.test.d.ts.map +1 -0
- package/dist/fuzz/gates.d.ts +33 -0
- package/dist/fuzz/gates.d.ts.map +1 -0
- package/dist/fuzz/index.d.ts +26 -0
- package/dist/fuzz/index.d.ts.map +1 -0
- package/dist/fuzz/policies.d.ts +28 -0
- package/dist/fuzz/policies.d.ts.map +1 -0
- package/dist/fuzz/tools.d.ts +20 -0
- package/dist/fuzz/tools.d.ts.map +1 -0
- package/dist/fuzz/types.d.ts +307 -0
- package/dist/fuzz/types.d.ts.map +1 -0
- package/dist/fuzz.d.ts +1 -547
- package/dist/golden-matcher.d.ts +71 -0
- package/dist/golden-matcher.d.ts.map +1 -0
- package/dist/governance/eu-ai-act.d.ts +37 -0
- package/dist/governance/eu-ai-act.d.ts.map +1 -0
- package/dist/governance/index.d.ts +5 -135
- package/dist/governance/index.d.ts.map +1 -0
- package/dist/governance/nist-ai-rmf.d.ts +15 -0
- package/dist/governance/nist-ai-rmf.d.ts.map +1 -0
- package/dist/governance/soc2.d.ts +12 -0
- package/dist/governance/soc2.d.ts.map +1 -0
- package/dist/governance/types.d.ts +66 -0
- package/dist/governance/types.d.ts.map +1 -0
- package/dist/harness-optimizer.d.ts +82 -0
- package/dist/harness-optimizer.d.ts.map +1 -0
- package/dist/held-out-gate.d.ts +135 -0
- package/dist/held-out-gate.d.ts.map +1 -0
- package/dist/hosted/client.d.ts +73 -0
- package/dist/hosted/client.d.ts.map +1 -0
- package/dist/hosted/from-env.test.d.ts +8 -0
- package/dist/hosted/from-env.test.d.ts.map +1 -0
- package/dist/hosted/index.d.ts +10 -238
- package/dist/hosted/index.d.ts.map +1 -0
- package/dist/hosted/types.d.ts +159 -0
- package/dist/hosted/types.d.ts.map +1 -0
- package/dist/index.d.ts +277 -5665
- package/dist/index.d.ts.map +1 -0
- package/dist/index.js +66 -31
- package/dist/index.js.map +1 -1
- package/dist/integrity/backend-integrity.d.ts +71 -0
- package/dist/integrity/backend-integrity.d.ts.map +1 -0
- package/dist/integrity/preflight.d.ts +72 -0
- package/dist/integrity/preflight.d.ts.map +1 -0
- package/dist/integrity/preflight.test.d.ts +2 -0
- package/dist/integrity/preflight.test.d.ts.map +1 -0
- package/dist/integrity/single-backend.d.ts +67 -0
- package/dist/integrity/single-backend.d.ts.map +1 -0
- package/dist/intent-match-judge.d.ts +69 -0
- package/dist/intent-match-judge.d.ts.map +1 -0
- package/dist/intent-match-judge.test.d.ts +2 -0
- package/dist/intent-match-judge.test.d.ts.map +1 -0
- package/dist/{judge-calibration-0p2QcWNE.d.ts → judge-calibration.d.ts} +16 -17
- package/dist/judge-calibration.d.ts.map +1 -0
- package/dist/judge-ensemble.d.ts +66 -0
- package/dist/judge-ensemble.d.ts.map +1 -0
- package/dist/judge-ensemble.test.d.ts +8 -0
- package/dist/judge-ensemble.test.d.ts.map +1 -0
- package/dist/judge-families.d.ts +38 -0
- package/dist/judge-families.d.ts.map +1 -0
- package/dist/judge-panel.d.ts +65 -0
- package/dist/judge-panel.d.ts.map +1 -0
- package/dist/judge-retry.d.ts +70 -0
- package/dist/judge-retry.d.ts.map +1 -0
- package/dist/judge-runner.d.ts +36 -0
- package/dist/judge-runner.d.ts.map +1 -0
- package/dist/judge-runner.test.d.ts +2 -0
- package/dist/judge-runner.test.d.ts.map +1 -0
- package/dist/judges.d.ts +74 -0
- package/dist/judges.d.ts.map +1 -0
- package/dist/keyword-coverage-judge.d.ts +89 -0
- package/dist/keyword-coverage-judge.d.ts.map +1 -0
- package/dist/keyword-coverage-judge.test.d.ts +2 -0
- package/dist/keyword-coverage-judge.test.d.ts.map +1 -0
- package/dist/knowledge/index.d.ts +3 -103
- package/dist/knowledge/index.d.ts.map +1 -0
- package/dist/knowledge/readiness.d.ts +26 -0
- package/dist/knowledge/readiness.d.ts.map +1 -0
- package/dist/knowledge/types.d.ts +75 -0
- package/dist/knowledge/types.d.ts.map +1 -0
- package/dist/live-proof.d.ts +62 -0
- package/dist/live-proof.d.ts.map +1 -0
- package/dist/{llm-client-Bj7g0rqu.d.ts → llm-client.d.ts} +21 -23
- package/dist/llm-client.d.ts.map +1 -0
- package/dist/llm-client.test.d.ts +2 -0
- package/dist/llm-client.test.d.ts.map +1 -0
- package/dist/locked-jsonl-appender.d.ts +19 -0
- package/dist/locked-jsonl-appender.d.ts.map +1 -0
- package/dist/matrix/aggregation.d.ts +16 -0
- package/dist/matrix/aggregation.d.ts.map +1 -0
- package/dist/matrix/index.d.ts +12 -30
- package/dist/matrix/index.d.ts.map +1 -0
- package/dist/matrix/runner.d.ts +15 -0
- package/dist/matrix/runner.d.ts.map +1 -0
- package/dist/{types-mn5Aqk7x.d.ts → matrix/types.d.ts} +11 -15
- package/dist/matrix/types.d.ts.map +1 -0
- package/dist/meta-eval/calibration.d.ts +47 -0
- package/dist/meta-eval/calibration.d.ts.map +1 -0
- package/dist/meta-eval/correlation-study.d.ts +53 -0
- package/dist/meta-eval/correlation-study.d.ts.map +1 -0
- package/dist/meta-eval/index.d.ts +6 -181
- package/dist/meta-eval/index.d.ts.map +1 -0
- package/dist/{outcome-store-rnXLEqSn.d.ts → meta-eval/outcome-store.d.ts} +7 -8
- package/dist/meta-eval/outcome-store.d.ts.map +1 -0
- package/dist/{rubric-predictive-validity-Cy_W-hWZ.d.ts → meta-eval/rubric-predictive-validity.d.ts} +8 -11
- package/dist/meta-eval/rubric-predictive-validity.d.ts.map +1 -0
- package/dist/meta-eval/sentinel.d.ts +169 -0
- package/dist/meta-eval/sentinel.d.ts.map +1 -0
- package/dist/metrics.d.ts +63 -0
- package/dist/metrics.d.ts.map +1 -0
- package/dist/model-seats.d.ts +71 -0
- package/dist/model-seats.d.ts.map +1 -0
- package/dist/model-seats.test.d.ts +2 -0
- package/dist/model-seats.test.d.ts.map +1 -0
- package/dist/muffled-gate-scanner.d.ts +102 -0
- package/dist/muffled-gate-scanner.d.ts.map +1 -0
- package/dist/{multi-layer-verifier-DUZXrPDA.d.ts → multi-layer-verifier.d.ts} +12 -15
- package/dist/multi-layer-verifier.d.ts.map +1 -0
- package/dist/multi-layer-verifier.test.d.ts +2 -0
- package/dist/multi-layer-verifier.test.d.ts.map +1 -0
- package/dist/multi-toolchain-layer.d.ts +80 -0
- package/dist/multi-toolchain-layer.d.ts.map +1 -0
- package/dist/multi-toolchain-layer.test.d.ts +2 -0
- package/dist/multi-toolchain-layer.test.d.ts.map +1 -0
- package/dist/multishot/default-tools.d.ts +34 -0
- package/dist/multishot/default-tools.d.ts.map +1 -0
- package/dist/multishot/index.d.ts +7 -290
- package/dist/multishot/index.d.ts.map +1 -0
- package/dist/multishot/index.js.map +1 -1
- package/dist/multishot/judges.d.ts +32 -0
- package/dist/multishot/judges.d.ts.map +1 -0
- package/dist/multishot/matrix.d.ts +107 -0
- package/dist/multishot/matrix.d.ts.map +1 -0
- package/dist/multishot/multishot.d.ts +23 -0
- package/dist/multishot/multishot.d.ts.map +1 -0
- package/dist/multishot/router.d.ts +37 -0
- package/dist/multishot/router.d.ts.map +1 -0
- package/dist/multishot/types.d.ts +60 -0
- package/dist/multishot/types.d.ts.map +1 -0
- package/dist/observability.d.ts +71 -0
- package/dist/observability.d.ts.map +1 -0
- package/dist/openapi.json +1 -1
- package/dist/oracle.d.ts +55 -0
- package/dist/oracle.d.ts.map +1 -0
- package/dist/orthogonality.d.ts +35 -0
- package/dist/orthogonality.d.ts.map +1 -0
- package/dist/otel-pipeline.d.ts +31 -0
- package/dist/otel-pipeline.d.ts.map +1 -0
- package/dist/paraphrase.d.ts +107 -0
- package/dist/paraphrase.d.ts.map +1 -0
- package/dist/{pareto-E-pembql.d.ts → pareto.d.ts} +9 -10
- package/dist/pareto.d.ts.map +1 -0
- package/dist/partition-held-out.d.ts +70 -0
- package/dist/partition-held-out.d.ts.map +1 -0
- package/dist/partition-held-out.test.d.ts +2 -0
- package/dist/partition-held-out.test.d.ts.map +1 -0
- package/dist/perf/index.d.ts +13 -119
- package/dist/perf/index.d.ts.map +1 -0
- package/dist/perf/integrity.d.ts +30 -0
- package/dist/perf/integrity.d.ts.map +1 -0
- package/dist/perf/journey.d.ts +45 -0
- package/dist/perf/journey.d.ts.map +1 -0
- package/dist/perf/ratchet.d.ts +47 -0
- package/dist/perf/ratchet.d.ts.map +1 -0
- package/dist/pipelines/budget-breach.d.ts +31 -0
- package/dist/pipelines/budget-breach.d.ts.map +1 -0
- package/dist/pipelines/budget-breach.test.d.ts +2 -0
- package/dist/pipelines/budget-breach.test.d.ts.map +1 -0
- package/dist/pipelines/failure-cluster.d.ts +38 -0
- package/dist/pipelines/failure-cluster.d.ts.map +1 -0
- package/dist/pipelines/failure-cluster.test.d.ts +2 -0
- package/dist/pipelines/failure-cluster.test.d.ts.map +1 -0
- package/dist/pipelines/first-divergence.d.ts +26 -0
- package/dist/pipelines/first-divergence.d.ts.map +1 -0
- package/dist/pipelines/first-divergence.test.d.ts +2 -0
- package/dist/pipelines/first-divergence.test.d.ts.map +1 -0
- package/dist/pipelines/index.d.ts +8 -173
- package/dist/pipelines/index.d.ts.map +1 -0
- package/dist/pipelines/judge-agreement.d.ts +26 -0
- package/dist/pipelines/judge-agreement.d.ts.map +1 -0
- package/dist/pipelines/judge-agreement.test.d.ts +2 -0
- package/dist/pipelines/judge-agreement.test.d.ts.map +1 -0
- package/dist/pipelines/regression.d.ts +23 -0
- package/dist/pipelines/regression.d.ts.map +1 -0
- package/dist/pipelines/regression.test.d.ts +2 -0
- package/dist/pipelines/regression.test.d.ts.map +1 -0
- package/dist/pipelines/stuck-loop.d.ts +32 -0
- package/dist/pipelines/stuck-loop.d.ts.map +1 -0
- package/dist/pipelines/stuck-loop.test.d.ts +2 -0
- package/dist/pipelines/stuck-loop.test.d.ts.map +1 -0
- package/dist/pipelines/tool-waste.d.ts +34 -0
- package/dist/pipelines/tool-waste.d.ts.map +1 -0
- package/dist/pipelines/tool-waste.test.d.ts +2 -0
- package/dist/pipelines/tool-waste.test.d.ts.map +1 -0
- package/dist/playbook.d.ts +16 -0
- package/dist/playbook.d.ts.map +1 -0
- package/dist/pr-review-benchmark.d.ts +88 -0
- package/dist/pr-review-benchmark.d.ts.map +1 -0
- package/dist/pr-review-benchmark.test.d.ts +2 -0
- package/dist/pr-review-benchmark.test.d.ts.map +1 -0
- package/dist/pre-registration.d.ts +125 -0
- package/dist/pre-registration.d.ts.map +1 -0
- package/dist/prm/builtin-rubrics.d.ts +33 -0
- package/dist/prm/builtin-rubrics.d.ts.map +1 -0
- package/dist/prm/index.d.ts +5 -104
- package/dist/prm/index.d.ts.map +1 -0
- package/dist/prm/inference.d.ts +29 -0
- package/dist/prm/inference.d.ts.map +1 -0
- package/dist/prm/inference.test.d.ts +2 -0
- package/dist/prm/inference.test.d.ts.map +1 -0
- package/dist/{rubric-Cc6UHvUb.d.ts → prm/rubric.d.ts} +10 -13
- package/dist/prm/rubric.d.ts.map +1 -0
- package/dist/prm/training-export.d.ts +38 -0
- package/dist/prm/training-export.d.ts.map +1 -0
- package/dist/produced-state.d.ts +63 -0
- package/dist/produced-state.d.ts.map +1 -0
- package/dist/produced-state.test.d.ts +8 -0
- package/dist/produced-state.test.d.ts.map +1 -0
- package/dist/profile/baselines.d.ts +37 -0
- package/dist/profile/baselines.d.ts.map +1 -0
- package/dist/profile/index.d.ts +105 -0
- package/dist/profile/index.d.ts.map +1 -0
- package/dist/promotion-gate.d.ts +93 -0
- package/dist/promotion-gate.d.ts.map +1 -0
- package/dist/prompt-registry.d.ts +41 -0
- package/dist/prompt-registry.d.ts.map +1 -0
- package/dist/propose-review-control.d.ts +49 -0
- package/dist/propose-review-control.d.ts.map +1 -0
- package/dist/propose-review-control.test.d.ts +2 -0
- package/dist/propose-review-control.test.d.ts.map +1 -0
- package/dist/propose-review.d.ts +155 -0
- package/dist/propose-review.d.ts.map +1 -0
- package/dist/{red-team-BWdoyleI.d.ts → red-team.d.ts} +14 -16
- package/dist/red-team.d.ts.map +1 -0
- package/dist/reference-replay-steering.d.ts +11 -0
- package/dist/reference-replay-steering.d.ts.map +1 -0
- package/dist/reference-replay.d.ts +176 -0
- package/dist/reference-replay.d.ts.map +1 -0
- package/dist/reflective-mutation.d.ts +79 -0
- package/dist/reflective-mutation.d.ts.map +1 -0
- package/dist/registry.d.ts +31 -0
- package/dist/registry.d.ts.map +1 -0
- package/dist/release-confidence.d.ts +128 -0
- package/dist/release-confidence.d.ts.map +1 -0
- package/dist/release-report.d.ts +11 -0
- package/dist/release-report.d.ts.map +1 -0
- package/dist/replay.d.ts +120 -0
- package/dist/replay.d.ts.map +1 -0
- package/dist/reporter.d.ts +14 -0
- package/dist/reporter.d.ts.map +1 -0
- package/dist/reporting.d.ts +15 -15
- package/dist/reporting.d.ts.map +1 -0
- package/dist/researcher.d.ts +140 -0
- package/dist/researcher.d.ts.map +1 -0
- package/dist/reviewer.d.ts +118 -0
- package/dist/reviewer.d.ts.map +1 -0
- package/dist/reviewer.test.d.ts +2 -0
- package/dist/reviewer.test.d.ts.map +1 -0
- package/dist/reward-model-export.d.ts +60 -0
- package/dist/reward-model-export.d.ts.map +1 -0
- package/dist/rl/active-curriculum.d.ts +110 -0
- package/dist/rl/active-curriculum.d.ts.map +1 -0
- package/dist/rl/adaptation-eval.d.ts +109 -0
- package/dist/rl/adaptation-eval.d.ts.map +1 -0
- package/dist/{adversarial-DIVcDoI_.d.ts → rl/adversarial.d.ts} +6 -7
- package/dist/rl/adversarial.d.ts.map +1 -0
- package/dist/rl/compute-curves.d.ts +127 -0
- package/dist/rl/compute-curves.d.ts.map +1 -0
- package/dist/rl/contamination.d.ts +117 -0
- package/dist/rl/contamination.d.ts.map +1 -0
- package/dist/rl/corpus.d.ts +55 -0
- package/dist/rl/corpus.d.ts.map +1 -0
- package/dist/rl/corpus.test.d.ts +2 -0
- package/dist/rl/corpus.test.d.ts.map +1 -0
- package/dist/rl/dataset.d.ts +102 -0
- package/dist/rl/dataset.d.ts.map +1 -0
- package/dist/rl/dataset.test.d.ts +2 -0
- package/dist/rl/dataset.test.d.ts.map +1 -0
- package/dist/rl/exporters.d.ts +141 -0
- package/dist/rl/exporters.d.ts.map +1 -0
- package/dist/rl/index.d.ts +49 -0
- package/dist/rl/index.d.ts.map +1 -0
- package/dist/{off-policy-DiwuKKg7.d.ts → rl/off-policy.d.ts} +8 -9
- package/dist/rl/off-policy.d.ts.map +1 -0
- package/dist/rl/predictive-validity-researcher.d.ts +69 -0
- package/dist/rl/predictive-validity-researcher.d.ts.map +1 -0
- package/dist/rl/preferences.d.ts +141 -0
- package/dist/rl/preferences.d.ts.map +1 -0
- package/dist/rl/process-reward.d.ts +122 -0
- package/dist/rl/process-reward.d.ts.map +1 -0
- package/dist/rl/reward-hacking.d.ts +104 -0
- package/dist/rl/reward-hacking.d.ts.map +1 -0
- package/dist/rl/rl-campaign.d.ts +85 -0
- package/dist/rl/rl-campaign.d.ts.map +1 -0
- package/dist/rl/run-record-adapters.d.ts +56 -0
- package/dist/rl/run-record-adapters.d.ts.map +1 -0
- package/dist/rl/sim-fidelity.d.ts +166 -0
- package/dist/rl/sim-fidelity.d.ts.map +1 -0
- package/dist/rl/sim-fidelity.test.d.ts +2 -0
- package/dist/rl/sim-fidelity.test.d.ts.map +1 -0
- package/dist/rl/tournament.d.ts +115 -0
- package/dist/rl/tournament.d.ts.map +1 -0
- package/dist/rl/verifiable-reward.d.ts +124 -0
- package/dist/rl/verifiable-reward.d.ts.map +1 -0
- package/dist/rl.d.ts +1 -1192
- package/dist/rl.js +612 -612
- package/dist/rl.js.map +1 -1
- package/dist/{run-campaign-7WNXMDSN.js → run-campaign-WXY7KI67.js} +2 -2
- package/dist/run-critic.d.ts +23 -0
- package/dist/run-critic.d.ts.map +1 -0
- package/dist/run-evidence.d.ts +32 -0
- package/dist/run-evidence.d.ts.map +1 -0
- package/dist/{run-record-e7vj1uZQ.d.ts → run-record.d.ts} +16 -122
- package/dist/run-record.d.ts.map +1 -0
- package/dist/run-record.test.d.ts +2 -0
- package/dist/run-record.test.d.ts.map +1 -0
- package/dist/run-score.d.ts +31 -0
- package/dist/run-score.d.ts.map +1 -0
- package/dist/runtime-trajectory.d.ts +47 -0
- package/dist/runtime-trajectory.d.ts.map +1 -0
- package/dist/{test-graded-scenario-DeODGLra.d.ts → sandbox-harness.d.ts} +15 -60
- package/dist/sandbox-harness.d.ts.map +1 -0
- package/dist/sandbox-harness.test.d.ts +2 -0
- package/dist/sandbox-harness.test.d.ts.map +1 -0
- package/dist/sandbox-pool.d.ts +74 -0
- package/dist/sandbox-pool.d.ts.map +1 -0
- package/dist/sandbox-pool.test.d.ts +2 -0
- package/dist/sandbox-pool.test.d.ts.map +1 -0
- package/dist/scorecard.d.ts +133 -0
- package/dist/scorecard.d.ts.map +1 -0
- package/dist/scorecard.test.d.ts +2 -0
- package/dist/scorecard.test.d.ts.map +1 -0
- package/dist/self-play.d.ts +69 -0
- package/dist/self-play.d.ts.map +1 -0
- package/dist/semantic-concept-judge.d.ts +135 -0
- package/dist/semantic-concept-judge.d.ts.map +1 -0
- package/dist/semantic-concept-judge.test.d.ts +2 -0
- package/dist/semantic-concept-judge.test.d.ts.map +1 -0
- package/dist/{sequential-5iSVfzl2.d.ts → sequential.d.ts} +9 -10
- package/dist/sequential.d.ts.map +1 -0
- package/dist/{series-convergence-D5OWMBg6.d.ts → series-convergence.d.ts} +4 -5
- package/dist/series-convergence.d.ts.map +1 -0
- package/dist/slo.d.ts +48 -0
- package/dist/slo.d.ts.map +1 -0
- package/dist/state-continuity.d.ts +47 -0
- package/dist/state-continuity.d.ts.map +1 -0
- package/dist/{statistics-CCJpTGOS.d.ts → statistics.d.ts} +46 -48
- package/dist/statistics.d.ts.map +1 -0
- package/dist/statistics.test.d.ts +2 -0
- package/dist/statistics.test.d.ts.map +1 -0
- package/dist/steering-optimizer.d.ts +58 -0
- package/dist/steering-optimizer.d.ts.map +1 -0
- package/dist/steering.d.ts +24 -0
- package/dist/steering.d.ts.map +1 -0
- package/dist/storyboard/code-edit.d.ts +64 -0
- package/dist/storyboard/code-edit.d.ts.map +1 -0
- package/dist/storyboard/code-edit.test.d.ts +2 -0
- package/dist/storyboard/code-edit.test.d.ts.map +1 -0
- package/dist/storyboard/index.d.ts +16 -81
- package/dist/storyboard/index.d.ts.map +1 -0
- package/dist/storyboard/index.test.d.ts +2 -0
- package/dist/storyboard/index.test.d.ts.map +1 -0
- package/dist/{summary-report-BDOFevaT.d.ts → summary-report.d.ts} +23 -160
- package/dist/summary-report.d.ts.map +1 -0
- package/dist/telemetry/client.d.ts +35 -0
- package/dist/telemetry/client.d.ts.map +1 -0
- package/dist/telemetry/index.d.ts +17 -35
- package/dist/telemetry/index.d.ts.map +1 -0
- package/dist/telemetry/schema.d.ts +61 -0
- package/dist/telemetry/schema.d.ts.map +1 -0
- package/dist/telemetry/sink-fetch.d.ts +39 -0
- package/dist/telemetry/sink-fetch.d.ts.map +1 -0
- package/dist/telemetry/{file.d.ts → sink-file.d.ts} +5 -7
- package/dist/telemetry/sink-file.d.ts.map +1 -0
- package/dist/test-graded-scenario.d.ts +42 -0
- package/dist/test-graded-scenario.d.ts.map +1 -0
- package/dist/testing.d.ts +5 -0
- package/dist/testing.d.ts.map +1 -0
- package/dist/testing.js +8 -0
- package/dist/testing.js.map +1 -0
- package/dist/tool-use-metrics.d.ts +35 -0
- package/dist/tool-use-metrics.d.ts.map +1 -0
- package/dist/trace/capture-fetch.d.ts +48 -0
- package/dist/trace/capture-fetch.d.ts.map +1 -0
- package/dist/trace/capture-fetch.test.d.ts +2 -0
- package/dist/trace/capture-fetch.test.d.ts.map +1 -0
- package/dist/{emitter-C2rqGH_l.d.ts → trace/emitter.d.ts} +9 -12
- package/dist/trace/emitter.d.ts.map +1 -0
- package/dist/trace/extract-usage.d.ts +46 -0
- package/dist/trace/extract-usage.d.ts.map +1 -0
- package/dist/trace/extract-usage.test.d.ts +2 -0
- package/dist/trace/extract-usage.test.d.ts.map +1 -0
- package/dist/trace/index.d.ts +15 -0
- package/dist/trace/index.d.ts.map +1 -0
- package/dist/{integrity-D2t12mMw.d.ts → trace/integrity.d.ts} +11 -14
- package/dist/trace/integrity.d.ts.map +1 -0
- package/dist/trace/otel-bridge.d.ts +29 -0
- package/dist/trace/otel-bridge.d.ts.map +1 -0
- package/dist/trace/otel-export.d.ts +52 -0
- package/dist/trace/otel-export.d.ts.map +1 -0
- package/dist/trace/otel.d.ts +57 -0
- package/dist/trace/otel.d.ts.map +1 -0
- package/dist/trace/otlp-attributes.d.ts +17 -0
- package/dist/trace/otlp-attributes.d.ts.map +1 -0
- package/dist/trace/query.d.ts +29 -0
- package/dist/trace/query.d.ts.map +1 -0
- package/dist/trace/query.test.d.ts +2 -0
- package/dist/trace/query.test.d.ts.map +1 -0
- package/dist/{raw-provider-sink-C46HDghv.d.ts → trace/raw-provider-sink.d.ts} +13 -14
- package/dist/trace/raw-provider-sink.d.ts.map +1 -0
- package/dist/{redact-B40YG2M_.d.ts → trace/redact.d.ts} +7 -8
- package/dist/trace/redact.d.ts.map +1 -0
- package/dist/{schema-m0gsnbt3.d.ts → trace/schema.d.ts} +29 -30
- package/dist/trace/schema.d.ts.map +1 -0
- package/dist/trace/store-to-otlp.d.ts +72 -0
- package/dist/trace/store-to-otlp.d.ts.map +1 -0
- package/dist/trace/store-to-otlp.test.d.ts +2 -0
- package/dist/trace/store-to-otlp.test.d.ts.map +1 -0
- package/dist/{store-BcFXE6LG.d.ts → trace/store.d.ts} +21 -12
- package/dist/trace/store.d.ts.map +1 -0
- package/dist/trace/store.test.d.ts +2 -0
- package/dist/trace/store.test.d.ts.map +1 -0
- package/dist/{analyst-C8HHvfJp.d.ts → trace-analyst/analyst.d.ts} +12 -14
- package/dist/trace-analyst/analyst.d.ts.map +1 -0
- package/dist/trace-analyst/analyst.test.d.ts +2 -0
- package/dist/trace-analyst/analyst.test.d.ts.map +1 -0
- package/dist/trace-analyst/behavioral-metrics.d.ts +40 -0
- package/dist/trace-analyst/behavioral-metrics.d.ts.map +1 -0
- package/dist/trace-analyst/behavioral-metrics.test.d.ts +2 -0
- package/dist/trace-analyst/behavioral-metrics.test.d.ts.map +1 -0
- package/dist/trace-analyst/hook.d.ts +55 -0
- package/dist/trace-analyst/hook.d.ts.map +1 -0
- package/dist/trace-analyst/index.d.ts +18 -0
- package/dist/trace-analyst/index.d.ts.map +1 -0
- package/dist/trace-analyst/insights.d.ts +71 -0
- package/dist/trace-analyst/insights.d.ts.map +1 -0
- package/dist/trace-analyst/insights.test.d.ts +2 -0
- package/dist/trace-analyst/insights.test.d.ts.map +1 -0
- package/dist/trace-analyst/otlp-flatten.d.ts +42 -0
- package/dist/trace-analyst/otlp-flatten.d.ts.map +1 -0
- package/dist/trace-analyst/otlp-span.d.ts +85 -0
- package/dist/trace-analyst/otlp-span.d.ts.map +1 -0
- package/dist/trace-analyst/otlp-span.test.d.ts +2 -0
- package/dist/trace-analyst/otlp-span.test.d.ts.map +1 -0
- package/dist/trace-analyst/otlp-to-run-records.d.ts +115 -0
- package/dist/trace-analyst/otlp-to-run-records.d.ts.map +1 -0
- package/dist/trace-analyst/otlp-to-run-records.test.d.ts +2 -0
- package/dist/trace-analyst/otlp-to-run-records.test.d.ts.map +1 -0
- package/dist/trace-analyst/otlp-to-run-records.timestamps.test.d.ts +2 -0
- package/dist/trace-analyst/otlp-to-run-records.timestamps.test.d.ts.map +1 -0
- package/dist/trace-analyst/prompts.d.ts +6 -0
- package/dist/trace-analyst/prompts.d.ts.map +1 -0
- package/dist/trace-analyst/store-otlp.d.ts +126 -0
- package/dist/trace-analyst/store-otlp.d.ts.map +1 -0
- package/dist/trace-analyst/store-otlp.test.d.ts +8 -0
- package/dist/trace-analyst/store-otlp.test.d.ts.map +1 -0
- package/dist/trace-analyst/store-otlp.timestamps.test.d.ts +2 -0
- package/dist/trace-analyst/store-otlp.timestamps.test.d.ts.map +1 -0
- package/dist/trace-analyst/store.d.ts +63 -0
- package/dist/trace-analyst/store.d.ts.map +1 -0
- package/dist/trace-analyst/tools.d.ts +44 -0
- package/dist/trace-analyst/tools.d.ts.map +1 -0
- package/dist/trace-analyst/tools.test.d.ts +10 -0
- package/dist/trace-analyst/tools.test.d.ts.map +1 -0
- package/dist/{store-C1YxJDEK.d.ts → trace-analyst/types.d.ts} +18 -74
- package/dist/trace-analyst/types.d.ts.map +1 -0
- package/dist/trace-contracts.d.ts +180 -0
- package/dist/trace-contracts.d.ts.map +1 -0
- package/dist/traced-analyst.d.ts +26 -0
- package/dist/traced-analyst.d.ts.map +1 -0
- package/dist/traced-judges.d.ts +27 -0
- package/dist/traced-judges.d.ts.map +1 -0
- package/dist/traces.d.ts +4 -960
- package/dist/traces.d.ts.map +1 -0
- package/dist/traces.js +41 -11
- package/dist/{trajectory-2TkpSEVh.d.ts → trajectory.d.ts} +8 -9
- package/dist/trajectory.d.ts.map +1 -0
- package/dist/{types-C7DGg5ex.d.ts → types.d.ts} +31 -33
- package/dist/types.d.ts.map +1 -0
- package/dist/ui-finding.d.ts +104 -0
- package/dist/ui-finding.d.ts.map +1 -0
- package/dist/verdict-cache.d.ts +78 -0
- package/dist/verdict-cache.d.ts.map +1 -0
- package/dist/verdict-cache.test.d.ts +2 -0
- package/dist/verdict-cache.test.d.ts.map +1 -0
- package/dist/{verdict-C9MlYujm.d.ts → verdict.d.ts} +2 -3
- package/dist/verdict.d.ts.map +1 -0
- package/dist/visual-diff.d.ts +32 -0
- package/dist/visual-diff.d.ts.map +1 -0
- package/dist/wire/handlers.d.ts +54 -0
- package/dist/wire/handlers.d.ts.map +1 -0
- package/dist/wire/index.d.ts +13 -570
- package/dist/wire/index.d.ts.map +1 -0
- package/dist/wire/openapi.d.ts +3 -0
- package/dist/wire/openapi.d.ts.map +1 -0
- package/dist/wire/rpc.d.ts +21 -0
- package/dist/wire/rpc.d.ts.map +1 -0
- package/dist/wire/rubrics.d.ts +34 -0
- package/dist/wire/rubrics.d.ts.map +1 -0
- package/dist/wire/schemas.d.ts +410 -0
- package/dist/wire/schemas.d.ts.map +1 -0
- package/dist/wire/server.d.ts +60 -0
- package/dist/wire/server.d.ts.map +1 -0
- package/dist/workflow/event-schema.d.ts +5 -0
- package/dist/workflow/event-schema.d.ts.map +1 -0
- package/dist/workflow/feedback-pack.d.ts +99 -0
- package/dist/workflow/feedback-pack.d.ts.map +1 -0
- package/dist/workflow/index.d.ts +22 -495
- package/dist/workflow/index.d.ts.map +1 -0
- package/dist/workflow/index.js +1 -1
- package/dist/workflow/intelligence-export.d.ts +62 -0
- package/dist/workflow/intelligence-export.d.ts.map +1 -0
- package/dist/workflow/partner-report.d.ts +49 -0
- package/dist/workflow/partner-report.d.ts.map +1 -0
- package/dist/workflow/phase-graph.d.ts +43 -0
- package/dist/workflow/phase-graph.d.ts.map +1 -0
- package/dist/workflow/promotion-gate.d.ts +61 -0
- package/dist/workflow/promotion-gate.d.ts.map +1 -0
- package/dist/workflow/run-record.d.ts +12 -0
- package/dist/workflow/run-record.d.ts.map +1 -0
- package/dist/workflow/runtime-adapter.d.ts +20 -0
- package/dist/workflow/runtime-adapter.d.ts.map +1 -0
- package/dist/workflow/sanitize.d.ts +21 -0
- package/dist/workflow/sanitize.d.ts.map +1 -0
- package/dist/workflow/schema.d.ts +5 -0
- package/dist/workflow/schema.d.ts.map +1 -0
- package/dist/workflow/summary.d.ts +43 -0
- package/dist/workflow/summary.d.ts.map +1 -0
- package/dist/workflow/trace-event-fields.d.ts +6 -0
- package/dist/workflow/trace-event-fields.d.ts.map +1 -0
- package/dist/workflow/trajectory.d.ts +15 -0
- package/dist/workflow/trajectory.d.ts.map +1 -0
- package/dist/workflow/types.d.ts +68 -0
- package/dist/workflow/types.d.ts.map +1 -0
- package/dist/workspace-inspector.d.ts +67 -0
- package/dist/workspace-inspector.d.ts.map +1 -0
- package/dist/wrangler-deploy-runner.test.d.ts +2 -0
- package/dist/wrangler-deploy-runner.test.d.ts.map +1 -0
- package/docs/campaign-proposers.md +170 -0
- package/docs/concepts.md +8 -4
- package/docs/customer-journeys.md +15 -13
- package/docs/design/loop-taxonomy.md +34 -66
- package/docs/distributed-driver.md +14 -14
- package/docs/feature-guide.md +1 -1
- package/docs/hosted-ingest-spec.md +2 -3
- package/docs/multi-shot-optimization.md +8 -8
- package/docs/product-eval-adoption.md +1 -1
- package/docs/self-improvement-map.md +33 -29
- package/package.json +9 -15
- package/dist/calibration-BPmzuVPk.d.ts +0 -101
- package/dist/chunk-2K6UUZ7P.js.map +0 -1
- package/dist/chunk-CTBHKLEU.js.map +0 -1
- package/dist/chunk-E4GH6USR.js.map +0 -1
- package/dist/chunk-EGPMSBEZ.js.map +0 -1
- package/dist/chunk-KWRRMR3J.js.map +0 -1
- package/dist/chunk-MIFZUPEK.js.map +0 -1
- package/dist/chunk-MPQWFX6Y.js.map +0 -1
- package/dist/chunk-Q5LIB7BC.js.map +0 -1
- package/dist/chunk-QMUEXQJS.js.map +0 -1
- package/dist/chunk-SD2YFWQQ.js.map +0 -1
- package/dist/control-D6qwHXIR.d.ts +0 -259
- package/dist/corpus-B8A4BDR3.d.ts +0 -560
- package/dist/failure-cluster-DH9Flgcf.d.ts +0 -76
- package/dist/harness-optimizer-mOl9XX_O.d.ts +0 -106
- package/dist/index-Bx3gZ8xl.d.ts +0 -159
- package/dist/pre-registration-mAnCugl9.d.ts +0 -523
- package/dist/provenance-P-bCL2Fo.d.ts +0 -441
- package/dist/query-B7GGjRox.d.ts +0 -32
- package/dist/release-report-BEbWmVYj.d.ts +0 -233
- package/dist/run-critic-CmMf05uV.d.ts +0 -56
- package/dist/run-improvement-loop-DBahB8Ax.d.ts +0 -427
- package/dist/runtime-trajectory-BDgfGZSr.d.ts +0 -49
- package/dist/semantic-concept-judge-B9MgmBnM.d.ts +0 -624
- package/dist/sink-fetch-B1Yg4Til.d.ts +0 -101
- package/docs/design/external-agent-wedge.md +0 -89
- package/docs/design/phase-d-rfc.md +0 -125
- package/docs/design/phase4-consumer-migration.md +0 -70
- package/docs/design/primitives-integration-spec.md +0 -393
- package/docs/design/product-self-improvement-loop.md +0 -146
- package/docs/design/self-improvement-engine.md +0 -140
- package/docs/design/self-improvement-protocol.md +0 -223
- package/docs/design/self-improvement-roadmap.md +0 -106
- package/docs/design/substrate-gaps.md +0 -118
- package/docs/phase-b-pairing-kit.md +0 -188
- package/docs/phase-b-runbook.md +0 -176
- package/docs/pilot/README.md +0 -62
- package/docs/pilot/customer-checklist.md +0 -90
- package/docs/pilot/integration-foreign-stack.md +0 -296
- package/docs/pilot/integration-tangle-stack.md +0 -248
- package/docs/pilot/one-pager.md +0 -161
- package/docs/pilot/sample-insight-report.json +0 -172
- package/docs/quickstart-external.md +0 -229
- package/docs/research/belief-state-agent-eval-roadmap.md +0 -593
- package/docs/research/research-roadmap.md +0 -205
- package/docs/specs/driver-honest-spec.md +0 -251
- package/docs/specs/hermes-self-improvement-audit.md +0 -93
- package/docs/specs/profile-versioning.md +0 -291
- package/docs/three-package-architecture.md +0 -168
- /package/dist/{chunk-TBDR6PAI.js.map → chunk-IZCEK2HR.js.map} +0 -0
- /package/dist/{chunk-KW53MSA5.js.map → chunk-X74V6ESX.js.map} +0 -0
- /package/dist/{chunk-2KNZHH3P.js.map → chunk-Z6L6YSU6.js.map} +0 -0
- /package/dist/{run-campaign-7WNXMDSN.js.map → run-campaign-WXY7KI67.js.map} +0 -0
|
@@ -0,0 +1,127 @@
|
|
|
1
|
+
/**
|
|
2
|
+
* Test-time compute scaling curves.
|
|
3
|
+
*
|
|
4
|
+
* The test-time-compute frontier paper (Snell et al. 2024) and the
|
|
5
|
+
* subsequent o1-style scaling work both show that LLM-agent capability
|
|
6
|
+
* is a function of the compute budget at inference, not just of the
|
|
7
|
+
* training run. The right way to characterize a candidate is therefore
|
|
8
|
+
* a *curve* — score at compute budgets {1×, 4×, 16×, …} — not a single
|
|
9
|
+
* point.
|
|
10
|
+
*
|
|
11
|
+
* This module ships:
|
|
12
|
+
*
|
|
13
|
+
* 1. The compute-curve harness — `runComputeCurve(runner, budgets)` —
|
|
14
|
+
* that evaluates one candidate at a sequence of compute budgets
|
|
15
|
+
* and returns the (compute, score) curve.
|
|
16
|
+
* 2. A best-of-N evaluator — `bestOfN(runner, n, scoreFn)` — the
|
|
17
|
+
* simplest test-time-compute scaling primitive: sample N
|
|
18
|
+
* independent rollouts, return the best.
|
|
19
|
+
* 3. A self-consistency evaluator — `selfConsistency(runner, n)` —
|
|
20
|
+
* the majority-vote variant of best-of-N for tasks with a small
|
|
21
|
+
* categorical answer space.
|
|
22
|
+
* 4. Pareto-frontier extraction over multiple candidates — given
|
|
23
|
+
* (candidate, compute, score) tuples, return the set of
|
|
24
|
+
* candidate-compute combinations that aren't dominated.
|
|
25
|
+
*
|
|
26
|
+
* Caveat: "compute" here is the caller's notion of a compute unit. For
|
|
27
|
+
* agent eval that's typically wall-time × parallelism, or token budget,
|
|
28
|
+
* or LLM-call count. We accept whatever the caller provides; the curve
|
|
29
|
+
* is on whatever axis they pick.
|
|
30
|
+
*/
|
|
31
|
+
export interface ComputeCurveBudget {
|
|
32
|
+
/** Identifier — for the report. Common: '1x', '4x', '16x'. */
|
|
33
|
+
id: string;
|
|
34
|
+
/** Numeric value on the chosen axis (tokens, calls, USD, ms — caller picks). */
|
|
35
|
+
cost: number;
|
|
36
|
+
/** Free-form metadata (the caller can carry per-budget config). */
|
|
37
|
+
meta?: Record<string, unknown>;
|
|
38
|
+
}
|
|
39
|
+
export interface ComputeCurvePoint {
|
|
40
|
+
budgetId: string;
|
|
41
|
+
cost: number;
|
|
42
|
+
score: number;
|
|
43
|
+
/** Number of underlying samples used at this budget. */
|
|
44
|
+
samples: number;
|
|
45
|
+
/** Optional spread / variance information. */
|
|
46
|
+
std?: number;
|
|
47
|
+
/** Any extra metrics the runner returned. */
|
|
48
|
+
metrics?: Record<string, number>;
|
|
49
|
+
}
|
|
50
|
+
export interface ComputeCurve {
|
|
51
|
+
candidateId: string;
|
|
52
|
+
points: ComputeCurvePoint[];
|
|
53
|
+
/** Rough exponent fit: score ≈ a + b * log(cost). Useful for "how steep is the curve?" */
|
|
54
|
+
logSlope: number | null;
|
|
55
|
+
/** Best (highest-score) point on the curve. */
|
|
56
|
+
best: ComputeCurvePoint;
|
|
57
|
+
}
|
|
58
|
+
export interface RunComputeCurveOptions {
|
|
59
|
+
candidateId: string;
|
|
60
|
+
budgets: ComputeCurveBudget[];
|
|
61
|
+
/**
|
|
62
|
+
* Run the candidate at one budget. Returns the realized score plus
|
|
63
|
+
* optional spread + extra metrics.
|
|
64
|
+
*/
|
|
65
|
+
runAtBudget: (budget: ComputeCurveBudget) => Promise<{
|
|
66
|
+
score: number;
|
|
67
|
+
samples: number;
|
|
68
|
+
std?: number;
|
|
69
|
+
metrics?: Record<string, number>;
|
|
70
|
+
}>;
|
|
71
|
+
}
|
|
72
|
+
export declare function runComputeCurve(opts: RunComputeCurveOptions): Promise<ComputeCurve>;
|
|
73
|
+
export interface ComputeBestOfNOptions<O> {
|
|
74
|
+
/** Number of independent samples to draw. */
|
|
75
|
+
n: number;
|
|
76
|
+
/** Sampler — produces one rollout. */
|
|
77
|
+
sample: (sampleIdx: number) => Promise<O>;
|
|
78
|
+
/** Score one rollout. */
|
|
79
|
+
scoreFn: (rollout: O) => Promise<number> | number;
|
|
80
|
+
}
|
|
81
|
+
export interface ComputeBestOfNResult<O> {
|
|
82
|
+
best: O;
|
|
83
|
+
bestScore: number;
|
|
84
|
+
scores: number[];
|
|
85
|
+
meanScore: number;
|
|
86
|
+
/** Index of the best rollout, for diagnostics. */
|
|
87
|
+
bestIndex: number;
|
|
88
|
+
}
|
|
89
|
+
/** The simplest test-time scaling primitive. */
|
|
90
|
+
export declare function bestOfN<O>(opts: ComputeBestOfNOptions<O>): Promise<ComputeBestOfNResult<O>>;
|
|
91
|
+
export interface SelfConsistencyOptions<O> {
|
|
92
|
+
n: number;
|
|
93
|
+
sample: (sampleIdx: number) => Promise<O>;
|
|
94
|
+
/** Extract the canonical answer key (string) from a rollout. */
|
|
95
|
+
answerKey: (rollout: O) => string;
|
|
96
|
+
}
|
|
97
|
+
export interface SelfConsistencyResult<O> {
|
|
98
|
+
/** Modal answer (the majority vote). */
|
|
99
|
+
answer: string;
|
|
100
|
+
/** Fraction of samples voting for the modal answer in [0, 1]. */
|
|
101
|
+
agreement: number;
|
|
102
|
+
/** Histogram of all answers. */
|
|
103
|
+
histogram: Record<string, number>;
|
|
104
|
+
/** A representative rollout that voted for the modal answer. */
|
|
105
|
+
representative: O;
|
|
106
|
+
/** All rollouts. */
|
|
107
|
+
rollouts: O[];
|
|
108
|
+
}
|
|
109
|
+
/**
|
|
110
|
+
* Self-consistency / majority-vote test-time scaling. For tasks with a
|
|
111
|
+
* small categorical answer space (math problems, multiple choice).
|
|
112
|
+
*/
|
|
113
|
+
export declare function selfConsistency<O>(opts: SelfConsistencyOptions<O>): Promise<SelfConsistencyResult<O>>;
|
|
114
|
+
/**
|
|
115
|
+
* Pareto frontier over (candidate, compute, score) tuples. A point is on
|
|
116
|
+
* the frontier iff no other point dominates it in both score (higher
|
|
117
|
+
* better) and cost (lower better). Returns the frontier sorted ascending
|
|
118
|
+
* by cost.
|
|
119
|
+
*/
|
|
120
|
+
export interface ParetoPointInput {
|
|
121
|
+
candidateId: string;
|
|
122
|
+
budgetId: string;
|
|
123
|
+
cost: number;
|
|
124
|
+
score: number;
|
|
125
|
+
}
|
|
126
|
+
export declare function paretoFrontier(points: ParetoPointInput[]): ParetoPointInput[];
|
|
127
|
+
//# sourceMappingURL=compute-curves.d.ts.map
|
|
@@ -0,0 +1 @@
|
|
|
1
|
+
{"version":3,"file":"compute-curves.d.ts","sourceRoot":"","sources":["../../src/rl/compute-curves.ts"],"names":[],"mappings":"AAAA;;;;;;;;;;;;;;;;;;;;;;;;;;;;;GA6BG;AAIH,MAAM,WAAW,kBAAkB;IACjC,8DAA8D;IAC9D,EAAE,EAAE,MAAM,CAAA;IACV,gFAAgF;IAChF,IAAI,EAAE,MAAM,CAAA;IACZ,mEAAmE;IACnE,IAAI,CAAC,EAAE,MAAM,CAAC,MAAM,EAAE,OAAO,CAAC,CAAA;CAC/B;AAED,MAAM,WAAW,iBAAiB;IAChC,QAAQ,EAAE,MAAM,CAAA;IAChB,IAAI,EAAE,MAAM,CAAA;IACZ,KAAK,EAAE,MAAM,CAAA;IACb,wDAAwD;IACxD,OAAO,EAAE,MAAM,CAAA;IACf,8CAA8C;IAC9C,GAAG,CAAC,EAAE,MAAM,CAAA;IACZ,6CAA6C;IAC7C,OAAO,CAAC,EAAE,MAAM,CAAC,MAAM,EAAE,MAAM,CAAC,CAAA;CACjC;AAED,MAAM,WAAW,YAAY;IAC3B,WAAW,EAAE,MAAM,CAAA;IACnB,MAAM,EAAE,iBAAiB,EAAE,CAAA;IAC3B,0FAA0F;IAC1F,QAAQ,EAAE,MAAM,GAAG,IAAI,CAAA;IACvB,+CAA+C;IAC/C,IAAI,EAAE,iBAAiB,CAAA;CACxB;AAED,MAAM,WAAW,sBAAsB;IACrC,WAAW,EAAE,MAAM,CAAA;IACnB,OAAO,EAAE,kBAAkB,EAAE,CAAA;IAC7B;;;OAGG;IACH,WAAW,EAAE,CAAC,MAAM,EAAE,kBAAkB,KAAK,OAAO,CAAC;QACnD,KAAK,EAAE,MAAM,CAAA;QACb,OAAO,EAAE,MAAM,CAAA;QACf,GAAG,CAAC,EAAE,MAAM,CAAA;QACZ,OAAO,CAAC,EAAE,MAAM,CAAC,MAAM,EAAE,MAAM,CAAC,CAAA;KACjC,CAAC,CAAA;CACH;AAED,wBAAsB,eAAe,CAAC,IAAI,EAAE,sBAAsB,GAAG,OAAO,CAAC,YAAY,CAAC,CAiBzF;AAED,MAAM,WAAW,qBAAqB,CAAC,CAAC;IACtC,6CAA6C;IAC7C,CAAC,EAAE,MAAM,CAAA;IACT,sCAAsC;IACtC,MAAM,EAAE,CAAC,SAAS,EAAE,MAAM,KAAK,OAAO,CAAC,CAAC,CAAC,CAAA;IACzC,yBAAyB;IACzB,OAAO,EAAE,CAAC,OAAO,EAAE,CAAC,KAAK,OAAO,CAAC,MAAM,CAAC,GAAG,MAAM,CAAA;CAClD;AAED,MAAM,WAAW,oBAAoB,CAAC,CAAC;IACrC,IAAI,EAAE,CAAC,CAAA;IACP,SAAS,EAAE,MAAM,CAAA;IACjB,MAAM,EAAE,MAAM,EAAE,CAAA;IAChB,SAAS,EAAE,MAAM,CAAA;IACjB,kDAAkD;IAClD,SAAS,EAAE,MAAM,CAAA;CAClB;AAED,gDAAgD;AAChD,wBAAsB,OAAO,CAAC,CAAC,EAAE,IAAI,EAAE,qBAAqB,CAAC,CAAC,CAAC,GAAG,OAAO,CAAC,oBAAoB,CAAC,CAAC,CAAC,CAAC,CAmBjG;AAED,MAAM,WAAW,sBAAsB,CAAC,CAAC;IACvC,CAAC,EAAE,MAAM,CAAA;IACT,MAAM,EAAE,CAAC,SAAS,EAAE,MAAM,KAAK,OAAO,CAAC,CAAC,CAAC,CAAA;IACzC,gEAAgE;IAChE,SAAS,EAAE,CAAC,OAAO,EAAE,CAAC,KAAK,MAAM,CAAA;CAClC;AAED,MAAM,WAAW,qBAAqB,CAAC,CAAC;IACtC,wCAAwC;IACxC,MAAM,EAAE,MAAM,CAAA;IACd,iEAAiE;IACjE,SAAS,EAAE,MAAM,CAAA;IACjB,gCAAgC;IAChC,SAAS,EAAE,MAAM,CAAC,MAAM,EAAE,MAAM,CAAC,CAAA;IACjC,gEAAgE;IAChE,cAAc,EAAE,CAAC,CAAA;IACjB,oBAAoB;IACpB,QAAQ,EAAE,CAAC,EAAE,CAAA;CACd;AAED;;;GAGG;AACH,wBAAsB,eAAe,CAAC,CAAC,EACrC,IAAI,EAAE,sBAAsB,CAAC,CAAC,CAAC,GAC9B,OAAO,CAAC,qBAAqB,CAAC,CAAC,CAAC,CAAC,CA0BnC;AAED;;;;;GAKG;AACH,MAAM,WAAW,gBAAgB;IAC/B,WAAW,EAAE,MAAM,CAAA;IACnB,QAAQ,EAAE,MAAM,CAAA;IAChB,IAAI,EAAE,MAAM,CAAA;IACZ,KAAK,EAAE,MAAM,CAAA;CACd;AAED,wBAAgB,cAAc,CAAC,MAAM,EAAE,gBAAgB,EAAE,GAAG,gBAAgB,EAAE,CAU7E"}
|
|
@@ -0,0 +1,117 @@
|
|
|
1
|
+
/**
|
|
2
|
+
* Contamination probe — held-out perturbation tests.
|
|
3
|
+
*
|
|
4
|
+
* The bug class: once a benchmark scenario set is published, models train
|
|
5
|
+
* on it, and your scores become invalid. SWE-Bench-Verified, GPQA, and
|
|
6
|
+
* MMLU-Pro all exist because their predecessors got contaminated within
|
|
7
|
+
* months. The right defense is to keep a held-out *perturbed* version of
|
|
8
|
+
* every scenario — same task, slightly different surface — and check
|
|
9
|
+
* whether scores diverge significantly. Genuine capability transfers; rote
|
|
10
|
+
* memorization doesn't.
|
|
11
|
+
*
|
|
12
|
+
* This module ships the probe contract:
|
|
13
|
+
*
|
|
14
|
+
* 1. A `ScenarioPerturbation` strategy type — function that produces a
|
|
15
|
+
* perturbed scenario from an original.
|
|
16
|
+
* 2. `runContaminationProbe({ originals, perturbed, scoreFn })` — runs
|
|
17
|
+
* both halves and reports per-scenario score divergence + a global
|
|
18
|
+
* contamination verdict via paired Wilcoxon.
|
|
19
|
+
* 3. Several stock perturbations: `renameVariables`, `shuffleOrder`,
|
|
20
|
+
* `paraphrasePrompt`, `injectIrrelevantClause`. Each preserves the
|
|
21
|
+
* task's structural difficulty while breaking surface memorization.
|
|
22
|
+
*
|
|
23
|
+
* The verdict is conservative: if the perturbed-vs-original score
|
|
24
|
+
* difference is statistically significant (BH-adjusted p < 0.05) AND
|
|
25
|
+
* the median drop is > 5 percentage points, we flag *contamination
|
|
26
|
+
* suspected*. False positives are possible (the perturbation might
|
|
27
|
+
* actually be harder); the default is to flag for review, not to
|
|
28
|
+
* autoreject.
|
|
29
|
+
*/
|
|
30
|
+
export type ScenarioPerturbationKind = 'rename_variables' | 'shuffle_order' | 'paraphrase' | 'inject_irrelevant_clause' | 'custom';
|
|
31
|
+
export interface ScenarioPerturbation<S> {
|
|
32
|
+
kind: ScenarioPerturbationKind;
|
|
33
|
+
/** Apply to one scenario, return its perturbed sibling. */
|
|
34
|
+
apply: (scenario: S) => Promise<S> | S;
|
|
35
|
+
/** Optional id — for the report. */
|
|
36
|
+
id?: string;
|
|
37
|
+
}
|
|
38
|
+
export interface ContaminationProbeInput<S> {
|
|
39
|
+
/** Identity of every scenario. The probe's `runFingerprint` keys on these. */
|
|
40
|
+
scenarioId: (s: S) => string;
|
|
41
|
+
/** Original scenarios. */
|
|
42
|
+
originals: S[];
|
|
43
|
+
/**
|
|
44
|
+
* Either pre-computed perturbations (one per original, same order) OR a
|
|
45
|
+
* `perturbation` strategy that synthesizes them on the fly.
|
|
46
|
+
*/
|
|
47
|
+
perturbed?: S[];
|
|
48
|
+
perturbation?: ScenarioPerturbation<S>;
|
|
49
|
+
/**
|
|
50
|
+
* Run the policy/agent against one scenario and return a scalar score
|
|
51
|
+
* in [0, 1]. The probe doesn't care what the policy is — that's the
|
|
52
|
+
* caller's contract.
|
|
53
|
+
*/
|
|
54
|
+
scoreFn: (s: S) => Promise<number>;
|
|
55
|
+
}
|
|
56
|
+
export interface ContaminationProbeOptions {
|
|
57
|
+
/** Drop scores below this from the probe; treats partial failures separately. Default 0. */
|
|
58
|
+
scoreFloor?: number;
|
|
59
|
+
/**
|
|
60
|
+
* BH-FDR threshold for declaring contamination on each per-scenario
|
|
61
|
+
* delta. Default 0.05.
|
|
62
|
+
*/
|
|
63
|
+
fdr?: number;
|
|
64
|
+
/**
|
|
65
|
+
* Minimum median per-scenario drop to flag global contamination. Default
|
|
66
|
+
* 0.05 (5 percentage points). Smaller drops may be noise.
|
|
67
|
+
*/
|
|
68
|
+
minMedianDrop?: number;
|
|
69
|
+
}
|
|
70
|
+
export interface ContaminationProbeReport {
|
|
71
|
+
perScenario: Array<{
|
|
72
|
+
scenarioId: string;
|
|
73
|
+
originalScore: number;
|
|
74
|
+
perturbedScore: number;
|
|
75
|
+
delta: number;
|
|
76
|
+
/** Per-scenario q-value (single-test BH for a single scenario). Mainly for display. */
|
|
77
|
+
qValue: number;
|
|
78
|
+
}>;
|
|
79
|
+
/** Wilcoxon paired-test on the deltas. */
|
|
80
|
+
pairedTest: {
|
|
81
|
+
w: number;
|
|
82
|
+
p: number;
|
|
83
|
+
};
|
|
84
|
+
medianDelta: number;
|
|
85
|
+
meanDelta: number;
|
|
86
|
+
contaminationSuspected: boolean;
|
|
87
|
+
reason: string;
|
|
88
|
+
/** Number of scenarios processed. */
|
|
89
|
+
n: number;
|
|
90
|
+
}
|
|
91
|
+
export declare function runContaminationProbe<S>(input: ContaminationProbeInput<S>, opts?: ContaminationProbeOptions): Promise<ContaminationProbeReport>;
|
|
92
|
+
/**
|
|
93
|
+
* Identifier-rename perturbation for code/text scenarios. Replaces every
|
|
94
|
+
* occurrence of the listed identifiers with synthesized aliases. Use when
|
|
95
|
+
* the scenario's structural difficulty is independent of variable names
|
|
96
|
+
* (e.g. SWE-Bench-style coding tasks).
|
|
97
|
+
*/
|
|
98
|
+
export declare function renameVariables<S extends {
|
|
99
|
+
prompt: string;
|
|
100
|
+
}>(identifiers: string[], rename?: (name: string, idx: number) => string): ScenarioPerturbation<S>;
|
|
101
|
+
/**
|
|
102
|
+
* Order-shuffle perturbation. Reshuffles a list-shaped section of the
|
|
103
|
+
* prompt (for QA scenarios that present options A/B/C/D — answer depends
|
|
104
|
+
* on the option labels, not order). Caller provides the section extractor.
|
|
105
|
+
*/
|
|
106
|
+
export declare function shuffleOrder<S extends {
|
|
107
|
+
prompt: string;
|
|
108
|
+
}>(shuffleSection: (prompt: string, rng: () => number) => string, seed: number): ScenarioPerturbation<S>;
|
|
109
|
+
/**
|
|
110
|
+
* Inject-irrelevant-clause perturbation. Adds a benign sentence that
|
|
111
|
+
* shouldn't change the answer. Tests for "did the model just memorize
|
|
112
|
+
* the input string."
|
|
113
|
+
*/
|
|
114
|
+
export declare function injectIrrelevantClause<S extends {
|
|
115
|
+
prompt: string;
|
|
116
|
+
}>(clause: string, position?: 'prefix' | 'suffix'): ScenarioPerturbation<S>;
|
|
117
|
+
//# sourceMappingURL=contamination.d.ts.map
|
|
@@ -0,0 +1 @@
|
|
|
1
|
+
{"version":3,"file":"contamination.d.ts","sourceRoot":"","sources":["../../src/rl/contamination.ts"],"names":[],"mappings":"AAAA;;;;;;;;;;;;;;;;;;;;;;;;;;;;GA4BG;AAKH,MAAM,MAAM,wBAAwB,GAChC,kBAAkB,GAClB,eAAe,GACf,YAAY,GACZ,0BAA0B,GAC1B,QAAQ,CAAA;AAEZ,MAAM,WAAW,oBAAoB,CAAC,CAAC;IACrC,IAAI,EAAE,wBAAwB,CAAA;IAC9B,2DAA2D;IAC3D,KAAK,EAAE,CAAC,QAAQ,EAAE,CAAC,KAAK,OAAO,CAAC,CAAC,CAAC,GAAG,CAAC,CAAA;IACtC,oCAAoC;IACpC,EAAE,CAAC,EAAE,MAAM,CAAA;CACZ;AAED,MAAM,WAAW,uBAAuB,CAAC,CAAC;IACxC,8EAA8E;IAC9E,UAAU,EAAE,CAAC,CAAC,EAAE,CAAC,KAAK,MAAM,CAAA;IAC5B,0BAA0B;IAC1B,SAAS,EAAE,CAAC,EAAE,CAAA;IACd;;;OAGG;IACH,SAAS,CAAC,EAAE,CAAC,EAAE,CAAA;IACf,YAAY,CAAC,EAAE,oBAAoB,CAAC,CAAC,CAAC,CAAA;IACtC;;;;OAIG;IACH,OAAO,EAAE,CAAC,CAAC,EAAE,CAAC,KAAK,OAAO,CAAC,MAAM,CAAC,CAAA;CACnC;AAED,MAAM,WAAW,yBAAyB;IACxC,4FAA4F;IAC5F,UAAU,CAAC,EAAE,MAAM,CAAA;IACnB;;;OAGG;IACH,GAAG,CAAC,EAAE,MAAM,CAAA;IACZ;;;OAGG;IACH,aAAa,CAAC,EAAE,MAAM,CAAA;CACvB;AAED,MAAM,WAAW,wBAAwB;IACvC,WAAW,EAAE,KAAK,CAAC;QACjB,UAAU,EAAE,MAAM,CAAA;QAClB,aAAa,EAAE,MAAM,CAAA;QACrB,cAAc,EAAE,MAAM,CAAA;QACtB,KAAK,EAAE,MAAM,CAAA;QACb,uFAAuF;QACvF,MAAM,EAAE,MAAM,CAAA;KACf,CAAC,CAAA;IACF,0CAA0C;IAC1C,UAAU,EAAE;QAAE,CAAC,EAAE,MAAM,CAAC;QAAC,CAAC,EAAE,MAAM,CAAA;KAAE,CAAA;IACpC,WAAW,EAAE,MAAM,CAAA;IACnB,SAAS,EAAE,MAAM,CAAA;IACjB,sBAAsB,EAAE,OAAO,CAAA;IAC/B,MAAM,EAAE,MAAM,CAAA;IACd,qCAAqC;IACrC,CAAC,EAAE,MAAM,CAAA;CACV;AAED,wBAAsB,qBAAqB,CAAC,CAAC,EAC3C,KAAK,EAAE,uBAAuB,CAAC,CAAC,CAAC,EACjC,IAAI,GAAE,yBAA8B,GACnC,OAAO,CAAC,wBAAwB,CAAC,CAgFnC;AAID;;;;;GAKG;AACH,wBAAgB,eAAe,CAAC,CAAC,SAAS;IAAE,MAAM,EAAE,MAAM,CAAA;CAAE,EAC1D,WAAW,EAAE,MAAM,EAAE,EACrB,MAAM,GAAE,CAAC,IAAI,EAAE,MAAM,EAAE,GAAG,EAAE,MAAM,KAAK,MAAyD,GAC/F,oBAAoB,CAAC,CAAC,CAAC,CAazB;AAED;;;;GAIG;AACH,wBAAgB,YAAY,CAAC,CAAC,SAAS;IAAE,MAAM,EAAE,MAAM,CAAA;CAAE,EACvD,cAAc,EAAE,CAAC,MAAM,EAAE,MAAM,EAAE,GAAG,EAAE,MAAM,MAAM,KAAK,MAAM,EAC7D,IAAI,EAAE,MAAM,GACX,oBAAoB,CAAC,CAAC,CAAC,CAgBzB;AAED;;;;GAIG;AACH,wBAAgB,sBAAsB,CAAC,CAAC,SAAS;IAAE,MAAM,EAAE,MAAM,CAAA;CAAE,EACjE,MAAM,EAAE,MAAM,EACd,QAAQ,GAAE,QAAQ,GAAG,QAAmB,GACvC,oBAAoB,CAAC,CAAC,CAAC,CASzB"}
|
|
@@ -0,0 +1,55 @@
|
|
|
1
|
+
/**
|
|
2
|
+
* RL corpus — the durable, append-only accumulation of graded RunRecords that
|
|
3
|
+
* every eval run deposits BY DEFAULT.
|
|
4
|
+
*
|
|
5
|
+
* The dataset is the free exhaust of the normal eval process: we run evals
|
|
6
|
+
* constantly to get an agent production-ready, and those runs already produce
|
|
7
|
+
* graded trajectories. Instead of writing them to an ephemeral run dir and
|
|
8
|
+
* throwing them away, `appendToCorpus` accumulates them into a durable corpus;
|
|
9
|
+
* `buildDatasetFromCorpus` later harvests the whole corpus into a publishable
|
|
10
|
+
* bundle. No separate data-collection campaign — the data accrues from work we
|
|
11
|
+
* do anyway. This is the "best things for free by our process" layer.
|
|
12
|
+
*
|
|
13
|
+
* Trajectory text rides on the record as top-level `prompt` / `completion`
|
|
14
|
+
* (what the eval harnesses capture; the RunRecord validator ignores the extra
|
|
15
|
+
* keys). The harvest reads them directly — no trace store round-trip needed.
|
|
16
|
+
*/
|
|
17
|
+
import type { RunRecord } from '../run-record';
|
|
18
|
+
import { type RlDatasetBundle, type RlDatasetConfig } from './dataset';
|
|
19
|
+
/** A corpus record is a RunRecord carrying the trajectory text the harness
|
|
20
|
+
* captured. `prompt`/`completion` are top-level (the validator ignores extras). */
|
|
21
|
+
export type CorpusRecord = RunRecord & {
|
|
22
|
+
prompt?: string;
|
|
23
|
+
completion?: string;
|
|
24
|
+
};
|
|
25
|
+
export interface CorpusAppendResult {
|
|
26
|
+
appended: number;
|
|
27
|
+
/** Skipped because a record with the same runId was already in the corpus
|
|
28
|
+
* (idempotent appends — NOT re-run collapsing; re-runs get fresh runIds). */
|
|
29
|
+
skipped: number;
|
|
30
|
+
total: number;
|
|
31
|
+
}
|
|
32
|
+
/**
|
|
33
|
+
* Append graded records to the corpus (append-only JSONL). Deduplicates by
|
|
34
|
+
* `runId` against what's already on disk so re-running the same harness is
|
|
35
|
+
* idempotent. Creates the file and parent dir. This is the call every eval
|
|
36
|
+
* harness makes by default after producing its records.
|
|
37
|
+
*/
|
|
38
|
+
export declare function appendToCorpus(records: CorpusRecord[], corpusPath: string): CorpusAppendResult;
|
|
39
|
+
/** Read the full corpus. Returns [] if the corpus does not exist yet. */
|
|
40
|
+
export declare function readCorpus(corpusPath: string): CorpusRecord[];
|
|
41
|
+
export interface HarvestOptions {
|
|
42
|
+
/** Keep only records scoring >= this (rejection-sampling for SFT). */
|
|
43
|
+
minScore?: number;
|
|
44
|
+
/** Keep only these splits (e.g. ['holdout'] for an eval-only dataset). */
|
|
45
|
+
splits?: RunRecord['splitTag'][];
|
|
46
|
+
}
|
|
47
|
+
/**
|
|
48
|
+
* Harvest the accumulated corpus into a publishable RL dataset bundle. Reads
|
|
49
|
+
* trajectory text from each record's top-level `prompt`/`completion`; records
|
|
50
|
+
* missing either are excluded (a graded score with no trajectory can't train).
|
|
51
|
+
* Optionally filters by score / split. Throws (via buildRlDataset) if nothing
|
|
52
|
+
* survives — an empty dataset must never be published.
|
|
53
|
+
*/
|
|
54
|
+
export declare function buildDatasetFromCorpus(corpusPath: string, config: RlDatasetConfig, opts?: HarvestOptions): Promise<RlDatasetBundle>;
|
|
55
|
+
//# sourceMappingURL=corpus.d.ts.map
|
|
@@ -0,0 +1 @@
|
|
|
1
|
+
{"version":3,"file":"corpus.d.ts","sourceRoot":"","sources":["../../src/rl/corpus.ts"],"names":[],"mappings":"AAAA;;;;;;;;;;;;;;;GAeG;AAIH,OAAO,KAAK,EAAE,SAAS,EAAE,MAAM,eAAe,CAAA;AAC9C,OAAO,EAAkB,KAAK,eAAe,EAAE,KAAK,eAAe,EAAE,MAAM,WAAW,CAAA;AAEtF;oFACoF;AACpF,MAAM,MAAM,YAAY,GAAG,SAAS,GAAG;IAAE,MAAM,CAAC,EAAE,MAAM,CAAC;IAAC,UAAU,CAAC,EAAE,MAAM,CAAA;CAAE,CAAA;AAE/E,MAAM,WAAW,kBAAkB;IACjC,QAAQ,EAAE,MAAM,CAAA;IAChB;kFAC8E;IAC9E,OAAO,EAAE,MAAM,CAAA;IACf,KAAK,EAAE,MAAM,CAAA;CACd;AAED;;;;;GAKG;AACH,wBAAgB,cAAc,CAAC,OAAO,EAAE,YAAY,EAAE,EAAE,UAAU,EAAE,MAAM,GAAG,kBAAkB,CAkB9F;AAED,yEAAyE;AACzE,wBAAgB,UAAU,CAAC,UAAU,EAAE,MAAM,GAAG,YAAY,EAAE,CAO7D;AAOD,MAAM,WAAW,cAAc;IAC7B,sEAAsE;IACtE,QAAQ,CAAC,EAAE,MAAM,CAAA;IACjB,0EAA0E;IAC1E,MAAM,CAAC,EAAE,SAAS,CAAC,UAAU,CAAC,EAAE,CAAA;CACjC;AAED;;;;;;GAMG;AACH,wBAAsB,sBAAsB,CAC1C,UAAU,EAAE,MAAM,EAClB,MAAM,EAAE,eAAe,EACvB,IAAI,GAAE,cAAmB,GACxB,OAAO,CAAC,eAAe,CAAC,CAe1B"}
|
|
@@ -0,0 +1 @@
|
|
|
1
|
+
{"version":3,"file":"corpus.test.d.ts","sourceRoot":"","sources":["../../src/rl/corpus.test.ts"],"names":[],"mappings":""}
|
|
@@ -0,0 +1,102 @@
|
|
|
1
|
+
/**
|
|
2
|
+
* RL dataset packaging + datasheet — the publishable, sellable bundle.
|
|
3
|
+
*
|
|
4
|
+
* The format exporters (`toGrpoRows` / `toSftRows` / `toDpoRows`) already
|
|
5
|
+
* produce trainer-ready shapes (prime-rl GRPO, TRL DPO, conversational SFT).
|
|
6
|
+
* What turns that into a dataset someone can PUBLISH or BUY is the provenance
|
|
7
|
+
* + a datasheet: which models produced it, which prompt/agent versions, how the
|
|
8
|
+
* reward was derived (deterministic verifiable vs probabilistic judge — the
|
|
9
|
+
* credibility axis a buyer checks first), the split discipline, the reward
|
|
10
|
+
* distribution, the quality gates, the license, and the intended/out-of-scope
|
|
11
|
+
* uses. This module computes those facts from the `RunRecord[]` and renders a
|
|
12
|
+
* "Datasheet for Datasets" (Gebru et al. 2018) card alongside the format files.
|
|
13
|
+
*
|
|
14
|
+
* It composes the existing `rl/exporters` — it does not reimplement any trainer
|
|
15
|
+
* format. The renderers token-identity step (DeepSeek/Kimi/Qwen tokenization
|
|
16
|
+
* with per-token loss masks) is a downstream Python stage that consumes the
|
|
17
|
+
* `messages`/`completions` this bundle emits.
|
|
18
|
+
*/
|
|
19
|
+
import type { RunRecord, RunSplitTag } from '../run-record';
|
|
20
|
+
import { type DpoLookups, type GrpoLookups, type SftLookups } from './exporters';
|
|
21
|
+
import type { PreferenceTriple } from './preferences';
|
|
22
|
+
export type RewardKind = 'deterministic' | 'probabilistic' | 'mixed';
|
|
23
|
+
export type DatasetFormat = 'grpo' | 'sft' | 'dpo';
|
|
24
|
+
/** Caller-declared context — the qualitative half of the datasheet that can't
|
|
25
|
+
* be computed from records. */
|
|
26
|
+
export interface RlDatasetConfig {
|
|
27
|
+
name: string;
|
|
28
|
+
version: string;
|
|
29
|
+
/** Product/task domain, e.g. 'legal-m&a', 'tax-1040'. */
|
|
30
|
+
domain: string;
|
|
31
|
+
/** SPDX id or a named commercial license. Required — an unlicensed dataset
|
|
32
|
+
* cannot be published or sold. */
|
|
33
|
+
license: string;
|
|
34
|
+
/** How the reward was produced. `kind: 'deterministic'` (a test/schema/XPath
|
|
35
|
+
* decided it) is the credibility signal; 'probabilistic' = LLM-judge. */
|
|
36
|
+
reward: {
|
|
37
|
+
kind: RewardKind;
|
|
38
|
+
source: string;
|
|
39
|
+
description: string;
|
|
40
|
+
};
|
|
41
|
+
intendedUse: string;
|
|
42
|
+
outOfScope: string;
|
|
43
|
+
limitations: string;
|
|
44
|
+
/** ISO timestamp — passed in (the substrate forbids Date.now()). */
|
|
45
|
+
createdAtIso: string;
|
|
46
|
+
/** Default: ['grpo', 'sft']. */
|
|
47
|
+
formats?: DatasetFormat[];
|
|
48
|
+
/** Quality gates already run, recorded on the card for the buyer. */
|
|
49
|
+
qualityGates?: {
|
|
50
|
+
contaminationProbe?: 'passed' | 'failed' | 'not-run';
|
|
51
|
+
dedup?: boolean;
|
|
52
|
+
verifiableRewardFilter?: boolean;
|
|
53
|
+
};
|
|
54
|
+
}
|
|
55
|
+
export interface RewardStats {
|
|
56
|
+
n: number;
|
|
57
|
+
mean: number;
|
|
58
|
+
median: number;
|
|
59
|
+
min: number;
|
|
60
|
+
max: number;
|
|
61
|
+
std: number;
|
|
62
|
+
}
|
|
63
|
+
export interface RlDatasetStats {
|
|
64
|
+
records: number;
|
|
65
|
+
/** Record count per split — a publishable dataset must declare its holdout. */
|
|
66
|
+
splits: Record<RunSplitTag, number>;
|
|
67
|
+
reward: RewardStats;
|
|
68
|
+
/** Distinct snapshot-pinned models that produced the trajectories. */
|
|
69
|
+
models: string[];
|
|
70
|
+
/** Distinct effective-prompt hashes (the agent profile/prompt versions). */
|
|
71
|
+
promptHashes: string[];
|
|
72
|
+
commitShas: string[];
|
|
73
|
+
totalTokens: {
|
|
74
|
+
input: number;
|
|
75
|
+
output: number;
|
|
76
|
+
};
|
|
77
|
+
totalCostUsd: number;
|
|
78
|
+
}
|
|
79
|
+
export interface RlDatasetManifest extends RlDatasetConfig {
|
|
80
|
+
formats: DatasetFormat[];
|
|
81
|
+
rowCounts: Partial<Record<DatasetFormat, number>>;
|
|
82
|
+
stats: RlDatasetStats;
|
|
83
|
+
}
|
|
84
|
+
export interface RlDatasetBundle {
|
|
85
|
+
manifest: RlDatasetManifest;
|
|
86
|
+
/** Relative filename -> contents. Write these to a directory to publish. */
|
|
87
|
+
files: Record<string, string>;
|
|
88
|
+
}
|
|
89
|
+
/**
|
|
90
|
+
* Package graded `RunRecord[]` into a publishable RL dataset bundle: the
|
|
91
|
+
* trainer-format JSONL files + a manifest + a datasheet. DPO requires
|
|
92
|
+
* pre-extracted preference triples (pass `preferences`); GRPO/SFT derive from
|
|
93
|
+
* the records directly via the supplied lookups. Throws on an empty corpus —
|
|
94
|
+
* an empty dataset must never be published.
|
|
95
|
+
*/
|
|
96
|
+
export declare function buildRlDataset(records: RunRecord[], lookups: GrpoLookups & SftLookups, config: RlDatasetConfig, preferences?: {
|
|
97
|
+
triples: PreferenceTriple[];
|
|
98
|
+
lookups: DpoLookups;
|
|
99
|
+
}): Promise<RlDatasetBundle>;
|
|
100
|
+
/** Render the "Datasheet for Datasets" card — the artifact a buyer reads. */
|
|
101
|
+
export declare function datasheetToMarkdown(m: RlDatasetManifest): string;
|
|
102
|
+
//# sourceMappingURL=dataset.d.ts.map
|
|
@@ -0,0 +1 @@
|
|
|
1
|
+
{"version":3,"file":"dataset.d.ts","sourceRoot":"","sources":["../../src/rl/dataset.ts"],"names":[],"mappings":"AAAA;;;;;;;;;;;;;;;;;GAiBG;AAEH,OAAO,KAAK,EAAE,SAAS,EAAE,WAAW,EAAE,MAAM,eAAe,CAAA;AAC3D,OAAO,EACL,KAAK,UAAU,EACf,KAAK,WAAW,EAChB,KAAK,UAAU,EAOhB,MAAM,aAAa,CAAA;AACpB,OAAO,KAAK,EAAE,gBAAgB,EAAE,MAAM,eAAe,CAAA;AAErD,MAAM,MAAM,UAAU,GAAG,eAAe,GAAG,eAAe,GAAG,OAAO,CAAA;AACpE,MAAM,MAAM,aAAa,GAAG,MAAM,GAAG,KAAK,GAAG,KAAK,CAAA;AAElD;gCACgC;AAChC,MAAM,WAAW,eAAe;IAC9B,IAAI,EAAE,MAAM,CAAA;IACZ,OAAO,EAAE,MAAM,CAAA;IACf,yDAAyD;IACzD,MAAM,EAAE,MAAM,CAAA;IACd;uCACmC;IACnC,OAAO,EAAE,MAAM,CAAA;IACf;8EAC0E;IAC1E,MAAM,EAAE;QAAE,IAAI,EAAE,UAAU,CAAC;QAAC,MAAM,EAAE,MAAM,CAAC;QAAC,WAAW,EAAE,MAAM,CAAA;KAAE,CAAA;IACjE,WAAW,EAAE,MAAM,CAAA;IACnB,UAAU,EAAE,MAAM,CAAA;IAClB,WAAW,EAAE,MAAM,CAAA;IACnB,oEAAoE;IACpE,YAAY,EAAE,MAAM,CAAA;IACpB,gCAAgC;IAChC,OAAO,CAAC,EAAE,aAAa,EAAE,CAAA;IACzB,qEAAqE;IACrE,YAAY,CAAC,EAAE;QACb,kBAAkB,CAAC,EAAE,QAAQ,GAAG,QAAQ,GAAG,SAAS,CAAA;QACpD,KAAK,CAAC,EAAE,OAAO,CAAA;QACf,sBAAsB,CAAC,EAAE,OAAO,CAAA;KACjC,CAAA;CACF;AAED,MAAM,WAAW,WAAW;IAC1B,CAAC,EAAE,MAAM,CAAA;IACT,IAAI,EAAE,MAAM,CAAA;IACZ,MAAM,EAAE,MAAM,CAAA;IACd,GAAG,EAAE,MAAM,CAAA;IACX,GAAG,EAAE,MAAM,CAAA;IACX,GAAG,EAAE,MAAM,CAAA;CACZ;AAED,MAAM,WAAW,cAAc;IAC7B,OAAO,EAAE,MAAM,CAAA;IACf,+EAA+E;IAC/E,MAAM,EAAE,MAAM,CAAC,WAAW,EAAE,MAAM,CAAC,CAAA;IACnC,MAAM,EAAE,WAAW,CAAA;IACnB,sEAAsE;IACtE,MAAM,EAAE,MAAM,EAAE,CAAA;IAChB,4EAA4E;IAC5E,YAAY,EAAE,MAAM,EAAE,CAAA;IACtB,UAAU,EAAE,MAAM,EAAE,CAAA;IACpB,WAAW,EAAE;QAAE,KAAK,EAAE,MAAM,CAAC;QAAC,MAAM,EAAE,MAAM,CAAA;KAAE,CAAA;IAC9C,YAAY,EAAE,MAAM,CAAA;CACrB;AAED,MAAM,WAAW,iBAAkB,SAAQ,eAAe;IACxD,OAAO,EAAE,aAAa,EAAE,CAAA;IACxB,SAAS,EAAE,OAAO,CAAC,MAAM,CAAC,aAAa,EAAE,MAAM,CAAC,CAAC,CAAA;IACjD,KAAK,EAAE,cAAc,CAAA;CACtB;AAED,MAAM,WAAW,eAAe;IAC9B,QAAQ,EAAE,iBAAiB,CAAA;IAC3B,4EAA4E;IAC5E,KAAK,EAAE,MAAM,CAAC,MAAM,EAAE,MAAM,CAAC,CAAA;CAC9B;AAgDD;;;;;;GAMG;AACH,wBAAsB,cAAc,CAClC,OAAO,EAAE,SAAS,EAAE,EACpB,OAAO,EAAE,WAAW,GAAG,UAAU,EACjC,MAAM,EAAE,eAAe,EACvB,WAAW,CAAC,EAAE;IAAE,OAAO,EAAE,gBAAgB,EAAE,CAAC;IAAC,OAAO,EAAE,UAAU,CAAA;CAAE,GACjE,OAAO,CAAC,eAAe,CAAC,CAoC1B;AAMD,6EAA6E;AAC7E,wBAAgB,mBAAmB,CAAC,CAAC,EAAE,iBAAiB,GAAG,MAAM,CAiDhE"}
|
|
@@ -0,0 +1 @@
|
|
|
1
|
+
{"version":3,"file":"dataset.test.d.ts","sourceRoot":"","sources":["../../src/rl/dataset.test.ts"],"names":[],"mappings":""}
|
|
@@ -0,0 +1,141 @@
|
|
|
1
|
+
/**
|
|
2
|
+
* Trainer-format exporters.
|
|
3
|
+
*
|
|
4
|
+
* agent-eval produces canonical artifacts (`RunRecord[]`, `PreferenceTriple[]`,
|
|
5
|
+
* `StepReward[]`, `PrmTrainingTriple[]`). RL training pipelines consume
|
|
6
|
+
* different shapes — Hugging Face TRL, Prime Intellect's prime-rl, OpenAI
|
|
7
|
+
* fine-tuning, Anthropic finetuning, OpenRLHF, verl. Each has its own
|
|
8
|
+
* JSONL conventions. Rather than ship N adapters, this module ships the
|
|
9
|
+
* canonical formats most production pipelines accept and ergonomic helpers
|
|
10
|
+
* for the rest.
|
|
11
|
+
*
|
|
12
|
+
* Shapes:
|
|
13
|
+
* - **DPO / IPO / KTO** — `{prompt, chosen, rejected}` JSONL. Consumed
|
|
14
|
+
* by HuggingFace TRL, prime-rl's offline DPO, OpenRLHF.
|
|
15
|
+
* - **GRPO offline** — `{prompt, completions[], rewards[]}` JSONL.
|
|
16
|
+
* Consumed by prime-rl GRPO, verl, OpenRLHF.
|
|
17
|
+
* - **SFT** — `{messages[]}` JSONL with chosen completion as the final
|
|
18
|
+
* assistant turn. Consumed by HF SFT trainers, OpenAI fine-tuning,
|
|
19
|
+
* Anthropic finetuning.
|
|
20
|
+
* - **PRM** — `{prompt, prefix_steps[], chosen_step, rejected_step}` JSONL.
|
|
21
|
+
* Consumed by Lightman-style PRM trainers and prime-rl's PRM mode.
|
|
22
|
+
*
|
|
23
|
+
* Why ship this in agent-eval rather than a separate adapter package: the
|
|
24
|
+
* canonical artifacts (`RunRecord[]`, `PreferenceTriple[]`, etc.) are
|
|
25
|
+
* agent-eval's contract; without first-party exporters consumers reverse-
|
|
26
|
+
* engineer the mapping every release. The exporters codify it.
|
|
27
|
+
*
|
|
28
|
+
* The exporters take callbacks for any field that isn't on the canonical
|
|
29
|
+
* artifact (specifically: prompt + completion text, since the package
|
|
30
|
+
* stores only their hashes by design — full text is the consumer's
|
|
31
|
+
* trace store / raw event log).
|
|
32
|
+
*/
|
|
33
|
+
import type { RunRecord } from '../run-record';
|
|
34
|
+
import type { PreferenceTriple } from './preferences';
|
|
35
|
+
import type { PrmTrainingTriple, StepReward } from './process-reward';
|
|
36
|
+
export interface DpoLookups {
|
|
37
|
+
/** Resolve the prompt text for a run (typically from a trace store / raw event sink). */
|
|
38
|
+
promptOf: (runId: string) => string | Promise<string>;
|
|
39
|
+
/** Resolve the assistant completion text for a run. */
|
|
40
|
+
completionOf: (runId: string) => string | Promise<string>;
|
|
41
|
+
}
|
|
42
|
+
export interface DpoExportRow {
|
|
43
|
+
prompt: string;
|
|
44
|
+
chosen: string;
|
|
45
|
+
rejected: string;
|
|
46
|
+
/** Carried-through margin. Some KTO / IPO variants use this. */
|
|
47
|
+
margin?: number;
|
|
48
|
+
/** Free-form metadata for downstream filtering / sharding. */
|
|
49
|
+
meta?: Record<string, unknown>;
|
|
50
|
+
}
|
|
51
|
+
/**
|
|
52
|
+
* Convert preference triples to TRL-compatible DPO rows. The shape
|
|
53
|
+
* `{prompt, chosen, rejected}` is the canonical HuggingFace DPODataset
|
|
54
|
+
* entry; every major DPO trainer accepts it.
|
|
55
|
+
*/
|
|
56
|
+
export declare function toDpoRows(triples: PreferenceTriple[], lookups: DpoLookups): Promise<DpoExportRow[]>;
|
|
57
|
+
/** Serialize DPO rows as JSONL. One line per row. */
|
|
58
|
+
export declare function toDpoJsonl(rows: DpoExportRow[]): string;
|
|
59
|
+
export interface GrpoLookups {
|
|
60
|
+
promptOf: (runId: string) => string | Promise<string>;
|
|
61
|
+
completionOf: (runId: string) => string | Promise<string>;
|
|
62
|
+
/** Optional: derive a custom reward from the run. Defaults to score. */
|
|
63
|
+
rewardOf?: (run: RunRecord) => number | null;
|
|
64
|
+
}
|
|
65
|
+
export interface GrpoExportRow {
|
|
66
|
+
prompt: string;
|
|
67
|
+
completions: string[];
|
|
68
|
+
rewards: number[];
|
|
69
|
+
/** runIds in the same order as `completions[]` for traceability. */
|
|
70
|
+
runIds: string[];
|
|
71
|
+
meta?: Record<string, unknown>;
|
|
72
|
+
}
|
|
73
|
+
/**
|
|
74
|
+
* Convert RunRecord[] grouped by `(scenarioId)` into GRPO offline rows —
|
|
75
|
+
* one row per scenario, with one completion per run on that scenario.
|
|
76
|
+
*
|
|
77
|
+
* GRPO (Shao et al. 2024 / DeepSeek-R1) trains on relative advantages
|
|
78
|
+
* within a group of completions for the same prompt; this is the
|
|
79
|
+
* canonical input format.
|
|
80
|
+
*/
|
|
81
|
+
export declare function toGrpoRows(runs: RunRecord[], lookups: GrpoLookups): Promise<GrpoExportRow[]>;
|
|
82
|
+
export declare function toGrpoJsonl(rows: GrpoExportRow[]): string;
|
|
83
|
+
export interface SftLookups {
|
|
84
|
+
promptOf: (runId: string) => string | Promise<string>;
|
|
85
|
+
completionOf: (runId: string) => string | Promise<string>;
|
|
86
|
+
/** Optional system message. Default omits. */
|
|
87
|
+
systemOf?: (run: RunRecord) => string | null | undefined;
|
|
88
|
+
/** Filter — return false to skip the run (e.g., low score, failed cases). */
|
|
89
|
+
include?: (run: RunRecord) => boolean;
|
|
90
|
+
}
|
|
91
|
+
export interface SftExportRow {
|
|
92
|
+
messages: Array<{
|
|
93
|
+
role: 'system' | 'user' | 'assistant';
|
|
94
|
+
content: string;
|
|
95
|
+
}>;
|
|
96
|
+
meta?: Record<string, unknown>;
|
|
97
|
+
}
|
|
98
|
+
/**
|
|
99
|
+
* Convert RunRecord[] into Hugging Face / OpenAI / Anthropic-style
|
|
100
|
+
* conversational SFT rows. By default every record becomes one row;
|
|
101
|
+
* pass `include` to filter (e.g., keep only `score >= 0.8` for
|
|
102
|
+
* rejection-sampling SFT).
|
|
103
|
+
*/
|
|
104
|
+
export declare function toSftRows(runs: RunRecord[], lookups: SftLookups): Promise<SftExportRow[]>;
|
|
105
|
+
export declare function toSftJsonl(rows: SftExportRow[]): string;
|
|
106
|
+
export interface PrmLookups {
|
|
107
|
+
/** Resolve the prompt text for a run. */
|
|
108
|
+
promptOf: (runId: string) => string | Promise<string>;
|
|
109
|
+
/** Resolve the trajectory step text for a (runId, spanId) pair. */
|
|
110
|
+
stepTextOf: (runId: string, spanId: string) => string | Promise<string>;
|
|
111
|
+
/** Optional: sequence of prefix span ids leading up to the divergence. */
|
|
112
|
+
prefixOf?: (runId: string, prefixStepIndex: number) => string[] | Promise<string[]>;
|
|
113
|
+
}
|
|
114
|
+
export interface PrmExportRow {
|
|
115
|
+
prompt: string;
|
|
116
|
+
/** Span ids for the steps before divergence — caller resolves text via `stepTextOf`. */
|
|
117
|
+
prefixSpanIds: string[];
|
|
118
|
+
prefixStepText: string[];
|
|
119
|
+
chosenStep: string;
|
|
120
|
+
rejectedStep: string;
|
|
121
|
+
chosenReward: number;
|
|
122
|
+
rejectedReward: number;
|
|
123
|
+
marginScore: number;
|
|
124
|
+
meta?: Record<string, unknown>;
|
|
125
|
+
}
|
|
126
|
+
/**
|
|
127
|
+
* Convert PRM training triples to JSONL rows. Caller's `stepTextOf`
|
|
128
|
+
* callback resolves span text from the consumer's trace store.
|
|
129
|
+
*/
|
|
130
|
+
export declare function toPrmRows(triples: PrmTrainingTriple[], lookups: PrmLookups): Promise<PrmExportRow[]>;
|
|
131
|
+
export declare function toPrmJsonl(rows: PrmExportRow[]): string;
|
|
132
|
+
export interface StepRewardJsonlRow {
|
|
133
|
+
runId: string;
|
|
134
|
+
spanId: string;
|
|
135
|
+
stepIndex: number;
|
|
136
|
+
reward: number;
|
|
137
|
+
determinism: 'deterministic' | 'probabilistic';
|
|
138
|
+
weight: number;
|
|
139
|
+
}
|
|
140
|
+
export declare function stepRewardsToJsonl(stepRewards: StepReward[]): string;
|
|
141
|
+
//# sourceMappingURL=exporters.d.ts.map
|
|
@@ -0,0 +1 @@
|
|
|
1
|
+
{"version":3,"file":"exporters.d.ts","sourceRoot":"","sources":["../../src/rl/exporters.ts"],"names":[],"mappings":"AAAA;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;GA+BG;AAEH,OAAO,KAAK,EAAE,SAAS,EAAE,MAAM,eAAe,CAAA;AAC9C,OAAO,KAAK,EAAE,gBAAgB,EAAE,MAAM,eAAe,CAAA;AACrD,OAAO,KAAK,EAAE,iBAAiB,EAAE,UAAU,EAAE,MAAM,kBAAkB,CAAA;AAIrE,MAAM,WAAW,UAAU;IACzB,yFAAyF;IACzF,QAAQ,EAAE,CAAC,KAAK,EAAE,MAAM,KAAK,MAAM,GAAG,OAAO,CAAC,MAAM,CAAC,CAAA;IACrD,uDAAuD;IACvD,YAAY,EAAE,CAAC,KAAK,EAAE,MAAM,KAAK,MAAM,GAAG,OAAO,CAAC,MAAM,CAAC,CAAA;CAC1D;AAED,MAAM,WAAW,YAAY;IAC3B,MAAM,EAAE,MAAM,CAAA;IACd,MAAM,EAAE,MAAM,CAAA;IACd,QAAQ,EAAE,MAAM,CAAA;IAChB,gEAAgE;IAChE,MAAM,CAAC,EAAE,MAAM,CAAA;IACf,8DAA8D;IAC9D,IAAI,CAAC,EAAE,MAAM,CAAC,MAAM,EAAE,OAAO,CAAC,CAAA;CAC/B;AAED;;;;GAIG;AACH,wBAAsB,SAAS,CAC7B,OAAO,EAAE,gBAAgB,EAAE,EAC3B,OAAO,EAAE,UAAU,GAClB,OAAO,CAAC,YAAY,EAAE,CAAC,CAyBzB;AAED,qDAAqD;AACrD,wBAAgB,UAAU,CAAC,IAAI,EAAE,YAAY,EAAE,GAAG,MAAM,CAEvD;AAID,MAAM,WAAW,WAAW;IAC1B,QAAQ,EAAE,CAAC,KAAK,EAAE,MAAM,KAAK,MAAM,GAAG,OAAO,CAAC,MAAM,CAAC,CAAA;IACrD,YAAY,EAAE,CAAC,KAAK,EAAE,MAAM,KAAK,MAAM,GAAG,OAAO,CAAC,MAAM,CAAC,CAAA;IACzD,wEAAwE;IACxE,QAAQ,CAAC,EAAE,CAAC,GAAG,EAAE,SAAS,KAAK,MAAM,GAAG,IAAI,CAAA;CAC7C;AAED,MAAM,WAAW,aAAa;IAC5B,MAAM,EAAE,MAAM,CAAA;IACd,WAAW,EAAE,MAAM,EAAE,CAAA;IACrB,OAAO,EAAE,MAAM,EAAE,CAAA;IACjB,oEAAoE;IACpE,MAAM,EAAE,MAAM,EAAE,CAAA;IAChB,IAAI,CAAC,EAAE,MAAM,CAAC,MAAM,EAAE,OAAO,CAAC,CAAA;CAC/B;AAED;;;;;;;GAOG;AACH,wBAAsB,UAAU,CAC9B,IAAI,EAAE,SAAS,EAAE,EACjB,OAAO,EAAE,WAAW,GACnB,OAAO,CAAC,aAAa,EAAE,CAAC,CAwC1B;AAED,wBAAgB,WAAW,CAAC,IAAI,EAAE,aAAa,EAAE,GAAG,MAAM,CAEzD;AAID,MAAM,WAAW,UAAU;IACzB,QAAQ,EAAE,CAAC,KAAK,EAAE,MAAM,KAAK,MAAM,GAAG,OAAO,CAAC,MAAM,CAAC,CAAA;IACrD,YAAY,EAAE,CAAC,KAAK,EAAE,MAAM,KAAK,MAAM,GAAG,OAAO,CAAC,MAAM,CAAC,CAAA;IACzD,8CAA8C;IAC9C,QAAQ,CAAC,EAAE,CAAC,GAAG,EAAE,SAAS,KAAK,MAAM,GAAG,IAAI,GAAG,SAAS,CAAA;IACxD,6EAA6E;IAC7E,OAAO,CAAC,EAAE,CAAC,GAAG,EAAE,SAAS,KAAK,OAAO,CAAA;CACtC;AAED,MAAM,WAAW,YAAY;IAC3B,QAAQ,EAAE,KAAK,CAAC;QAAE,IAAI,EAAE,QAAQ,GAAG,MAAM,GAAG,WAAW,CAAC;QAAC,OAAO,EAAE,MAAM,CAAA;KAAE,CAAC,CAAA;IAC3E,IAAI,CAAC,EAAE,MAAM,CAAC,MAAM,EAAE,OAAO,CAAC,CAAA;CAC/B;AAED;;;;;GAKG;AACH,wBAAsB,SAAS,CAAC,IAAI,EAAE,SAAS,EAAE,EAAE,OAAO,EAAE,UAAU,GAAG,OAAO,CAAC,YAAY,EAAE,CAAC,CA0B/F;AAED,wBAAgB,UAAU,CAAC,IAAI,EAAE,YAAY,EAAE,GAAG,MAAM,CAEvD;AAID,MAAM,WAAW,UAAU;IACzB,yCAAyC;IACzC,QAAQ,EAAE,CAAC,KAAK,EAAE,MAAM,KAAK,MAAM,GAAG,OAAO,CAAC,MAAM,CAAC,CAAA;IACrD,mEAAmE;IACnE,UAAU,EAAE,CAAC,KAAK,EAAE,MAAM,EAAE,MAAM,EAAE,MAAM,KAAK,MAAM,GAAG,OAAO,CAAC,MAAM,CAAC,CAAA;IACvE,0EAA0E;IAC1E,QAAQ,CAAC,EAAE,CAAC,KAAK,EAAE,MAAM,EAAE,eAAe,EAAE,MAAM,KAAK,MAAM,EAAE,GAAG,OAAO,CAAC,MAAM,EAAE,CAAC,CAAA;CACpF;AAED,MAAM,WAAW,YAAY;IAC3B,MAAM,EAAE,MAAM,CAAA;IACd,wFAAwF;IACxF,aAAa,EAAE,MAAM,EAAE,CAAA;IACvB,cAAc,EAAE,MAAM,EAAE,CAAA;IACxB,UAAU,EAAE,MAAM,CAAA;IAClB,YAAY,EAAE,MAAM,CAAA;IACpB,YAAY,EAAE,MAAM,CAAA;IACpB,cAAc,EAAE,MAAM,CAAA;IACtB,WAAW,EAAE,MAAM,CAAA;IACnB,IAAI,CAAC,EAAE,MAAM,CAAC,MAAM,EAAE,OAAO,CAAC,CAAA;CAC/B;AAED;;;GAGG;AACH,wBAAsB,SAAS,CAC7B,OAAO,EAAE,iBAAiB,EAAE,EAC5B,OAAO,EAAE,UAAU,GAClB,OAAO,CAAC,YAAY,EAAE,CAAC,CAgCzB;AAED,wBAAgB,UAAU,CAAC,IAAI,EAAE,YAAY,EAAE,GAAG,MAAM,CAEvD;AAID,MAAM,WAAW,kBAAkB;IACjC,KAAK,EAAE,MAAM,CAAA;IACb,MAAM,EAAE,MAAM,CAAA;IACd,SAAS,EAAE,MAAM,CAAA;IACjB,MAAM,EAAE,MAAM,CAAA;IACd,WAAW,EAAE,eAAe,GAAG,eAAe,CAAA;IAC9C,MAAM,EAAE,MAAM,CAAA;CACf;AAED,wBAAgB,kBAAkB,CAAC,WAAW,EAAE,UAAU,EAAE,GAAG,MAAM,CAUpE"}
|
|
@@ -0,0 +1,49 @@
|
|
|
1
|
+
/**
|
|
2
|
+
* RL/data bridge.
|
|
3
|
+
*
|
|
4
|
+
* This subpath groups everything that turns eval output into training signal:
|
|
5
|
+
* stable adapters/rewards, dataset packaging, trainer-format exporters,
|
|
6
|
+
* process rewards, and closed-loop campaign research. Keeping it off the root
|
|
7
|
+
* import path makes the default API smaller without hiding useful capability.
|
|
8
|
+
*/
|
|
9
|
+
/** Advanced budget allocation across (variant, scenario) cells. */
|
|
10
|
+
export * from './active-curriculum';
|
|
11
|
+
/** Advanced adaptation eval — does the policy actually learn from feedback? */
|
|
12
|
+
export * from './adaptation-eval';
|
|
13
|
+
/** Advanced scenario search for inputs the policy fails on. */
|
|
14
|
+
export * from './adversarial';
|
|
15
|
+
/** @stable Compute curves: best-of-N, self-consistency, Pareto frontier across budgets. */
|
|
16
|
+
export * from './compute-curves';
|
|
17
|
+
/** @stable Held-out perturbation probes for benchmark contamination (paired Wilcoxon). */
|
|
18
|
+
export * from './contamination';
|
|
19
|
+
/** @stable Durable corpus: every eval run appends graded trajectories by default; harvest → buildRlDataset (datasets for free). */
|
|
20
|
+
export * from './corpus';
|
|
21
|
+
/** @stable Publishable/sellable dataset bundle: format exporters + provenance + a Datasheet-for-Datasets card. */
|
|
22
|
+
export * from './dataset';
|
|
23
|
+
/** Trainer-format exporters (HuggingFace datasets, JSONL, parquet). */
|
|
24
|
+
export * from './exporters';
|
|
25
|
+
/** @stable Off-policy value estimation: IPS, SNIPS, doubly-robust. */
|
|
26
|
+
export * from './off-policy';
|
|
27
|
+
/** Researcher that re-weights rubrics by deployment outcome correlation. */
|
|
28
|
+
export * from './predictive-validity-researcher';
|
|
29
|
+
/** @stable (chosen, rejected) preference triples for DPO / KTO / PPO. */
|
|
30
|
+
export * from './preferences';
|
|
31
|
+
/** Step-level rewards and process-reward training pairs. */
|
|
32
|
+
export * from './process-reward';
|
|
33
|
+
/** Reward-hacking signatures: reward divergence, distribution shift, judge drift. */
|
|
34
|
+
export * from './reward-hacking';
|
|
35
|
+
/** Closed-loop campaign runner: eval → preferences → mutate → re-eval. */
|
|
36
|
+
export * from './rl-campaign';
|
|
37
|
+
/** @stable Canonical `RunRecord` adapters: trials → records, verification reports → records. */
|
|
38
|
+
export * from './run-record-adapters';
|
|
39
|
+
/** Simulator fidelity between simulated and production RunRecords. */
|
|
40
|
+
export * from './sim-fidelity';
|
|
41
|
+
/** @stable Bradley-Terry MLE + online Elo for pairwise tournament ratings. */
|
|
42
|
+
export * from './tournament';
|
|
43
|
+
/** @stable Verifiable reward extraction (compile / test / schema) with judge-noise filtering. */
|
|
44
|
+
export * from './verifiable-reward';
|
|
45
|
+
/** @stable In-memory + filesystem stores for deployment outcomes;
|
|
46
|
+
* consumed by `predictive-validity-researcher` to calibrate the gate
|
|
47
|
+
* against observed downstream metrics, not just held-out judge scores. */
|
|
48
|
+
export { type DeploymentOutcome, FileSystemOutcomeStore, type FileSystemOutcomeStoreOptions, InMemoryOutcomeStore, type OutcomeStore, } from '../meta-eval/outcome-store';
|
|
49
|
+
//# sourceMappingURL=index.d.ts.map
|
|
@@ -0,0 +1 @@
|
|
|
1
|
+
{"version":3,"file":"index.d.ts","sourceRoot":"","sources":["../../src/rl/index.ts"],"names":[],"mappings":"AAAA;;;;;;;GAOG;AAEH,mEAAmE;AACnE,cAAc,qBAAqB,CAAA;AACnC,+EAA+E;AAC/E,cAAc,mBAAmB,CAAA;AACjC,+DAA+D;AAC/D,cAAc,eAAe,CAAA;AAC7B,2FAA2F;AAC3F,cAAc,kBAAkB,CAAA;AAChC,0FAA0F;AAC1F,cAAc,iBAAiB,CAAA;AAC/B,mIAAmI;AACnI,cAAc,UAAU,CAAA;AACxB,kHAAkH;AAClH,cAAc,WAAW,CAAA;AACzB,uEAAuE;AACvE,cAAc,aAAa,CAAA;AAC3B,sEAAsE;AACtE,cAAc,cAAc,CAAA;AAC5B,4EAA4E;AAC5E,cAAc,kCAAkC,CAAA;AAChD,yEAAyE;AACzE,cAAc,eAAe,CAAA;AAC7B,4DAA4D;AAC5D,cAAc,kBAAkB,CAAA;AAChC,qFAAqF;AACrF,cAAc,kBAAkB,CAAA;AAChC,0EAA0E;AAC1E,cAAc,eAAe,CAAA;AAC7B,gGAAgG;AAChG,cAAc,uBAAuB,CAAA;AACrC,sEAAsE;AACtE,cAAc,gBAAgB,CAAA;AAC9B,8EAA8E;AAC9E,cAAc,cAAc,CAAA;AAC5B,iGAAiG;AACjG,cAAc,qBAAqB,CAAA;AAQnC;;2EAE2E;AAC3E,OAAO,EACL,KAAK,iBAAiB,EACtB,sBAAsB,EACtB,KAAK,6BAA6B,EAClC,oBAAoB,EACpB,KAAK,YAAY,GAClB,MAAM,4BAA4B,CAAA"}
|