@tangle-network/agent-eval 0.95.0 → 0.95.1
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/CHANGELOG.md +17 -0
- package/dist/adapters/http.d.ts +17 -10
- package/dist/adapters/langchain.d.ts +14 -7
- package/dist/adapters/otel.d.ts +25 -13
- package/dist/{rl/adversarial.d.ts → adversarial-DIVcDoI_.d.ts} +7 -6
- package/dist/analyst/index.d.ts +236 -28
- package/dist/{trace-analyst/analyst.d.ts → analyst-C8HHvfJp.d.ts} +14 -12
- package/dist/{contract/analyze-runs.d.ts → analyze-runs-DtT6F_6T.d.ts} +10 -9
- package/dist/authenticity/index.d.ts +16 -15
- package/dist/{baseline.d.ts → baseline-Bbid3WoO.d.ts} +44 -8
- package/dist/belief-state/index.d.ts +605 -14
- package/dist/benchmarks/index.d.ts +5 -23
- package/dist/builder-eval/index.d.ts +250 -5
- package/dist/calibration-BPmzuVPk.d.ts +101 -0
- package/dist/campaign/index.d.ts +1452 -38
- package/dist/cli.d.ts +0 -2
- package/dist/{contract/intake/code-agent-session.d.ts → code-agent-session-CPHRCb4-.d.ts} +17 -15
- package/dist/contract/index.d.ts +688 -106
- package/dist/control-Doncu-B_.d.ts +259 -0
- package/dist/{control-runtime.d.ts → control-runtime-Acf9CGhw.d.ts} +26 -23
- package/dist/control.d.ts +10 -11
- package/dist/corpus-D4YW9UoJ.d.ts +560 -0
- package/dist/{cost-ledger.d.ts → cost-ledger-DuSqlw5B.d.ts} +11 -10
- package/dist/{counterfactual.d.ts → counterfactual-DlOz8PBx.d.ts} +13 -12
- package/dist/{dataset.d.ts → dataset-BbGkaN2I.d.ts} +14 -11
- package/dist/{analyst/registry.d.ts → default-registry-GyE8X5SP.d.ts} +37 -8
- package/dist/diagnose.d.ts +252 -1
- package/dist/{trace/emitter.d.ts → emitter-C2rqGH_l.d.ts} +12 -9
- package/dist/{errors.d.ts → errors-CzMUYo7b.d.ts} +11 -10
- package/dist/failure-cluster-DH9Flgcf.d.ts +76 -0
- package/dist/{feedback-trajectory.d.ts → feedback-trajectory-BxY0cKfs.d.ts} +38 -36
- package/dist/fuzz.d.ts +547 -1
- package/dist/gepa-C1NCIZ9o.d.ts +414 -0
- package/dist/governance/index.d.ts +135 -5
- package/dist/harness-optimizer-mOl9XX_O.d.ts +106 -0
- package/dist/hosted/index.d.ts +239 -10
- package/dist/index-_Y4oNOOb.d.ts +159 -0
- package/dist/index.d.ts +5660 -277
- package/dist/{contract/insight-report.d.ts → insight-report-BnRjTibG.d.ts} +19 -16
- package/dist/{trace/integrity.d.ts → integrity-D2t12mMw.d.ts} +14 -11
- package/dist/{judge-calibration.d.ts → judge-calibration-0p2QcWNE.d.ts} +17 -16
- package/dist/{analyst/kind-factory.d.ts → kind-factory-X3eDYbKn.d.ts} +61 -10
- package/dist/knowledge/index.d.ts +103 -3
- package/dist/{llm-client.d.ts → llm-client-Bj7g0rqu.d.ts} +23 -21
- package/dist/matrix/index.d.ts +30 -12
- package/dist/meta-eval/index.d.ts +182 -6
- package/dist/{multi-layer-verifier.d.ts → multi-layer-verifier-DUZXrPDA.d.ts} +15 -12
- package/dist/multishot/index.d.ts +290 -7
- package/dist/{rl/off-policy.d.ts → off-policy-DiwuKKg7.d.ts} +9 -8
- package/dist/openapi.json +1 -1
- package/dist/{meta-eval/outcome-store.d.ts → outcome-store-rnXLEqSn.d.ts} +8 -7
- package/dist/{pareto.d.ts → pareto-E-pembql.d.ts} +10 -9
- package/dist/perf/index.d.ts +119 -13
- package/dist/pipelines/index.d.ts +173 -8
- package/dist/pre-registration-nfUdc9EQ.d.ts +483 -0
- package/dist/prm/index.d.ts +104 -5
- package/dist/provenance-CncDq9qE.d.ts +426 -0
- package/dist/query-B7GGjRox.d.ts +32 -0
- package/dist/{trace/raw-provider-sink.d.ts → raw-provider-sink-C46HDghv.d.ts} +14 -13
- package/dist/{red-team.d.ts → red-team-BWdoyleI.d.ts} +16 -14
- package/dist/{trace/redact.d.ts → redact-B40YG2M_.d.ts} +8 -7
- package/dist/release-report-pidWUMZ2.d.ts +233 -0
- package/dist/reporting.d.ts +16 -15
- package/dist/{eval-campaign.d.ts → researcher-Jr8ME1dZ.d.ts} +156 -34
- package/dist/rl.d.ts +1193 -1
- package/dist/{prm/rubric.d.ts → rubric-Cc6UHvUb.d.ts} +13 -10
- package/dist/{meta-eval/rubric-predictive-validity.d.ts → rubric-predictive-validity-C2hDKM8Z.d.ts} +11 -8
- package/dist/run-critic-CmMf05uV.d.ts +56 -0
- package/dist/{run-record.d.ts → run-record-CP2ObebC.d.ts} +117 -15
- package/dist/runtime-trajectory-BOUUjI0y.d.ts +49 -0
- package/dist/{trace/schema.d.ts → schema-m0gsnbt3.d.ts} +30 -29
- package/dist/semantic-concept-judge-DSBB2Cfp.d.ts +624 -0
- package/dist/{sequential.d.ts → sequential-5iSVfzl2.d.ts} +10 -9
- package/dist/{series-convergence.d.ts → series-convergence-D5OWMBg6.d.ts} +5 -4
- package/dist/sink-fetch-B1Yg4Til.d.ts +101 -0
- package/dist/{statistics.d.ts → statistics-CCJpTGOS.d.ts} +48 -46
- package/dist/{trace/store.d.ts → store-BcFXE6LG.d.ts} +12 -21
- package/dist/{trace-analyst/types.d.ts → store-C1YxJDEK.d.ts} +74 -18
- package/dist/storyboard/index.d.ts +81 -16
- package/dist/{summary-report.d.ts → summary-report-CInXwsza.d.ts} +160 -23
- package/dist/telemetry/{sink-file.d.ts → file.d.ts} +7 -5
- package/dist/telemetry/index.d.ts +35 -17
- package/dist/{sandbox-harness.d.ts → test-graded-scenario-DeODGLra.d.ts} +60 -15
- package/dist/{locked-jsonl-appender.d.ts → testing-C21CHsq2.d.ts} +4 -3
- package/dist/testing.d.ts +1 -5
- package/dist/traces.d.ts +976 -4
- package/dist/{trajectory.d.ts → trajectory-2TkpSEVh.d.ts} +9 -8
- package/dist/{analyst/types.d.ts → types-B5x54y6n.d.ts} +112 -19
- package/dist/{matrix/types.d.ts → types-BUxNaJ8c.d.ts} +11 -9
- package/dist/{types.d.ts → types-C7DGg5ex.d.ts} +33 -31
- package/dist/{campaign/types.d.ts → types-DQRY8ZT-.d.ts} +47 -44
- package/dist/{verdict.d.ts → verdict-C9MlYujm.d.ts} +3 -2
- package/dist/wire/index.d.ts +570 -13
- package/dist/workflow/index.d.ts +496 -22
- package/package.json +2 -2
- package/dist/action-policy.d.ts +0 -24
- package/dist/action-policy.d.ts.map +0 -1
- package/dist/action-policy.test.d.ts +0 -2
- package/dist/action-policy.test.d.ts.map +0 -1
- package/dist/active-learning.d.ts +0 -41
- package/dist/active-learning.d.ts.map +0 -1
- package/dist/adapters/http.d.ts.map +0 -1
- package/dist/adapters/langchain.d.ts.map +0 -1
- package/dist/adapters/otel.d.ts.map +0 -1
- package/dist/agent-profile-cell.d.ts +0 -101
- package/dist/agent-profile-cell.d.ts.map +0 -1
- package/dist/agent-profile.d.ts +0 -27
- package/dist/agent-profile.d.ts.map +0 -1
- package/dist/agent-profile.test.d.ts +0 -2
- package/dist/agent-profile.test.d.ts.map +0 -1
- package/dist/analyst/adapters.d.ts +0 -62
- package/dist/analyst/adapters.d.ts.map +0 -1
- package/dist/analyst/analyst.test.d.ts +0 -2
- package/dist/analyst/analyst.test.d.ts.map +0 -1
- package/dist/analyst/ax-service.d.ts +0 -27
- package/dist/analyst/ax-service.d.ts.map +0 -1
- package/dist/analyst/behavioral-analyst.d.ts +0 -28
- package/dist/analyst/behavioral-analyst.d.ts.map +0 -1
- package/dist/analyst/chat-client.d.ts +0 -91
- package/dist/analyst/chat-client.d.ts.map +0 -1
- package/dist/analyst/default-registry.d.ts +0 -27
- package/dist/analyst/default-registry.d.ts.map +0 -1
- package/dist/analyst/default-registry.test.d.ts +0 -2
- package/dist/analyst/default-registry.test.d.ts.map +0 -1
- package/dist/analyst/finding-signature.d.ts +0 -48
- package/dist/analyst/finding-signature.d.ts.map +0 -1
- package/dist/analyst/finding-subject.d.ts +0 -146
- package/dist/analyst/finding-subject.d.ts.map +0 -1
- package/dist/analyst/finding-subject.test.d.ts +0 -2
- package/dist/analyst/finding-subject.test.d.ts.map +0 -1
- package/dist/analyst/findings-store.d.ts +0 -75
- package/dist/analyst/findings-store.d.ts.map +0 -1
- package/dist/analyst/index.d.ts.map +0 -1
- package/dist/analyst/kind-factory.d.ts.map +0 -1
- package/dist/analyst/kinds/failure-mode.d.ts +0 -19
- package/dist/analyst/kinds/failure-mode.d.ts.map +0 -1
- package/dist/analyst/kinds/improvement.d.ts +0 -23
- package/dist/analyst/kinds/improvement.d.ts.map +0 -1
- package/dist/analyst/kinds/index.d.ts +0 -22
- package/dist/analyst/kinds/index.d.ts.map +0 -1
- package/dist/analyst/kinds/kinds.test.d.ts +0 -2
- package/dist/analyst/kinds/kinds.test.d.ts.map +0 -1
- package/dist/analyst/kinds/knowledge-gap.d.ts +0 -28
- package/dist/analyst/kinds/knowledge-gap.d.ts.map +0 -1
- package/dist/analyst/kinds/knowledge-poisoning.d.ts +0 -22
- package/dist/analyst/kinds/knowledge-poisoning.d.ts.map +0 -1
- package/dist/analyst/kinds/skill-usage.d.ts +0 -84
- package/dist/analyst/kinds/skill-usage.d.ts.map +0 -1
- package/dist/analyst/kinds/skill-usage.test.d.ts +0 -2
- package/dist/analyst/kinds/skill-usage.test.d.ts.map +0 -1
- package/dist/analyst/parse-tolerant.d.ts +0 -26
- package/dist/analyst/parse-tolerant.d.ts.map +0 -1
- package/dist/analyst/parse-tolerant.test.d.ts +0 -2
- package/dist/analyst/parse-tolerant.test.d.ts.map +0 -1
- package/dist/analyst/registry.budget.test.d.ts +0 -2
- package/dist/analyst/registry.budget.test.d.ts.map +0 -1
- package/dist/analyst/registry.d.ts.map +0 -1
- package/dist/analyst/steer-firewall.d.ts +0 -35
- package/dist/analyst/steer-firewall.d.ts.map +0 -1
- package/dist/analyst/steer-firewall.test.d.ts +0 -2
- package/dist/analyst/steer-firewall.test.d.ts.map +0 -1
- package/dist/analyst/structure-findings.d.ts +0 -37
- package/dist/analyst/structure-findings.d.ts.map +0 -1
- package/dist/analyst/structure-findings.test.d.ts +0 -2
- package/dist/analyst/structure-findings.test.d.ts.map +0 -1
- package/dist/analyst/tool-groups.d.ts +0 -34
- package/dist/analyst/tool-groups.d.ts.map +0 -1
- package/dist/analyst/types.d.ts.map +0 -1
- package/dist/anti-slop.d.ts +0 -59
- package/dist/anti-slop.d.ts.map +0 -1
- package/dist/artifact-validator.d.ts +0 -74
- package/dist/artifact-validator.d.ts.map +0 -1
- package/dist/attestation.d.ts +0 -63
- package/dist/attestation.d.ts.map +0 -1
- package/dist/attestation.test.d.ts +0 -2
- package/dist/attestation.test.d.ts.map +0 -1
- package/dist/authenticity/index.d.ts.map +0 -1
- package/dist/authenticity/index.test.d.ts +0 -2
- package/dist/authenticity/index.test.d.ts.map +0 -1
- package/dist/auto-pr.d.ts +0 -120
- package/dist/auto-pr.d.ts.map +0 -1
- package/dist/baseline.d.ts.map +0 -1
- package/dist/behavior-dsl.d.ts +0 -73
- package/dist/behavior-dsl.d.ts.map +0 -1
- package/dist/belief-state/calibration.d.ts +0 -10
- package/dist/belief-state/calibration.d.ts.map +0 -1
- package/dist/belief-state/calibration.test.d.ts +0 -2
- package/dist/belief-state/calibration.test.d.ts.map +0 -1
- package/dist/belief-state/code-agent-corpus.d.ts +0 -66
- package/dist/belief-state/code-agent-corpus.d.ts.map +0 -1
- package/dist/belief-state/code-agent-corpus.test.d.ts +0 -2
- package/dist/belief-state/code-agent-corpus.test.d.ts.map +0 -1
- package/dist/belief-state/code-agent-evidence.d.ts +0 -22
- package/dist/belief-state/code-agent-evidence.d.ts.map +0 -1
- package/dist/belief-state/code-agent-evidence.test.d.ts +0 -2
- package/dist/belief-state/code-agent-evidence.test.d.ts.map +0 -1
- package/dist/belief-state/extract.d.ts +0 -7
- package/dist/belief-state/extract.d.ts.map +0 -1
- package/dist/belief-state/extract.test.d.ts +0 -2
- package/dist/belief-state/extract.test.d.ts.map +0 -1
- package/dist/belief-state/index.d.ts.map +0 -1
- package/dist/belief-state/ope.d.ts +0 -17
- package/dist/belief-state/ope.d.ts.map +0 -1
- package/dist/belief-state/ope.test.d.ts +0 -2
- package/dist/belief-state/ope.test.d.ts.map +0 -1
- package/dist/belief-state/phase0-measurement.d.ts +0 -55
- package/dist/belief-state/phase0-measurement.d.ts.map +0 -1
- package/dist/belief-state/report.d.ts +0 -17
- package/dist/belief-state/report.d.ts.map +0 -1
- package/dist/belief-state/report.test.d.ts +0 -2
- package/dist/belief-state/report.test.d.ts.map +0 -1
- package/dist/belief-state/research-evidence.d.ts +0 -23
- package/dist/belief-state/research-evidence.d.ts.map +0 -1
- package/dist/belief-state/research-evidence.test.d.ts +0 -2
- package/dist/belief-state/research-evidence.test.d.ts.map +0 -1
- package/dist/belief-state/runtime-benchmark-corpus.d.ts +0 -32
- package/dist/belief-state/runtime-benchmark-corpus.d.ts.map +0 -1
- package/dist/belief-state/runtime-hooks.d.ts +0 -87
- package/dist/belief-state/runtime-hooks.d.ts.map +0 -1
- package/dist/belief-state/runtime-hooks.test.d.ts +0 -2
- package/dist/belief-state/runtime-hooks.test.d.ts.map +0 -1
- package/dist/belief-state/selective.d.ts +0 -15
- package/dist/belief-state/selective.d.ts.map +0 -1
- package/dist/belief-state/selective.test.d.ts +0 -2
- package/dist/belief-state/selective.test.d.ts.map +0 -1
- package/dist/belief-state/shadow-probe.d.ts +0 -80
- package/dist/belief-state/shadow-probe.d.ts.map +0 -1
- package/dist/belief-state/shadow-probe.test.d.ts +0 -2
- package/dist/belief-state/shadow-probe.test.d.ts.map +0 -1
- package/dist/belief-state/types.d.ts +0 -195
- package/dist/belief-state/types.d.ts.map +0 -1
- package/dist/belief-state/types.test.d.ts +0 -2
- package/dist/belief-state/types.test.d.ts.map +0 -1
- package/dist/benchmark.d.ts +0 -14
- package/dist/benchmark.d.ts.map +0 -1
- package/dist/benchmarks/index.d.ts.map +0 -1
- package/dist/benchmarks/routing/dataset.d.ts +0 -34
- package/dist/benchmarks/routing/dataset.d.ts.map +0 -1
- package/dist/benchmarks/routing/index.d.ts +0 -34
- package/dist/benchmarks/routing/index.d.ts.map +0 -1
- package/dist/benchmarks/types.d.ts +0 -49
- package/dist/benchmarks/types.d.ts.map +0 -1
- package/dist/bisector.d.ts +0 -81
- package/dist/bisector.d.ts.map +0 -1
- package/dist/budget-guard.d.ts +0 -31
- package/dist/budget-guard.d.ts.map +0 -1
- package/dist/builder-eval/builder-session.d.ts +0 -111
- package/dist/builder-eval/builder-session.d.ts.map +0 -1
- package/dist/builder-eval/correlation.d.ts +0 -32
- package/dist/builder-eval/correlation.d.ts.map +0 -1
- package/dist/builder-eval/index.d.ts.map +0 -1
- package/dist/builder-eval/project-registry.d.ts +0 -51
- package/dist/builder-eval/project-registry.d.ts.map +0 -1
- package/dist/builder-eval/three-layer-eval.d.ts +0 -55
- package/dist/builder-eval/three-layer-eval.d.ts.map +0 -1
- package/dist/campaign/analyst-surface.d.ts +0 -108
- package/dist/campaign/analyst-surface.d.ts.map +0 -1
- package/dist/campaign/analyst-surface.test.d.ts +0 -2
- package/dist/campaign/analyst-surface.test.d.ts.map +0 -1
- package/dist/campaign/auto-pr.d.ts +0 -46
- package/dist/campaign/auto-pr.d.ts.map +0 -1
- package/dist/campaign/distillation/agreement-judge.d.ts +0 -69
- package/dist/campaign/distillation/agreement-judge.d.ts.map +0 -1
- package/dist/campaign/distillation/cli.d.ts +0 -35
- package/dist/campaign/distillation/cli.d.ts.map +0 -1
- package/dist/campaign/distillation/distillation.test.d.ts +0 -2
- package/dist/campaign/distillation/distillation.test.d.ts.map +0 -1
- package/dist/campaign/distillation/gold-scenarios.d.ts +0 -54
- package/dist/campaign/distillation/gold-scenarios.d.ts.map +0 -1
- package/dist/campaign/distillation/run-distillation.d.ts +0 -119
- package/dist/campaign/distillation/run-distillation.d.ts.map +0 -1
- package/dist/campaign/gates/compose.d.ts +0 -12
- package/dist/campaign/gates/compose.d.ts.map +0 -1
- package/dist/campaign/gates/default-production-gate.d.ts +0 -58
- package/dist/campaign/gates/default-production-gate.d.ts.map +0 -1
- package/dist/campaign/gates/heldout-gate.d.ts +0 -12
- package/dist/campaign/gates/heldout-gate.d.ts.map +0 -1
- package/dist/campaign/gates/promotion-policy.d.ts +0 -125
- package/dist/campaign/gates/promotion-policy.d.ts.map +0 -1
- package/dist/campaign/gates/promotion-policy.test.d.ts +0 -2
- package/dist/campaign/gates/promotion-policy.test.d.ts.map +0 -1
- package/dist/campaign/gates/sequential.d.ts +0 -146
- package/dist/campaign/gates/sequential.d.ts.map +0 -1
- package/dist/campaign/gates/sequential.test.d.ts +0 -2
- package/dist/campaign/gates/sequential.test.d.ts.map +0 -1
- package/dist/campaign/gates/statistical-heldout.d.ts +0 -99
- package/dist/campaign/gates/statistical-heldout.d.ts.map +0 -1
- package/dist/campaign/gates/statistical-heldout.test.d.ts +0 -2
- package/dist/campaign/gates/statistical-heldout.test.d.ts.map +0 -1
- package/dist/campaign/index.d.ts.map +0 -1
- package/dist/campaign/labeled-store/fs-adapter.d.ts +0 -59
- package/dist/campaign/labeled-store/fs-adapter.d.ts.map +0 -1
- package/dist/campaign/presets/compare-proposers.d.ts +0 -146
- package/dist/campaign/presets/compare-proposers.d.ts.map +0 -1
- package/dist/campaign/presets/playback.d.ts +0 -120
- package/dist/campaign/presets/playback.d.ts.map +0 -1
- package/dist/campaign/presets/playback.test.d.ts +0 -2
- package/dist/campaign/presets/playback.test.d.ts.map +0 -1
- package/dist/campaign/presets/run-eval.d.ts +0 -14
- package/dist/campaign/presets/run-eval.d.ts.map +0 -1
- package/dist/campaign/presets/run-improvement-loop.d.ts +0 -63
- package/dist/campaign/presets/run-improvement-loop.d.ts.map +0 -1
- package/dist/campaign/presets/run-improvement-loop.test.d.ts +0 -2
- package/dist/campaign/presets/run-improvement-loop.test.d.ts.map +0 -1
- package/dist/campaign/presets/run-optimization.d.ts +0 -92
- package/dist/campaign/presets/run-optimization.d.ts.map +0 -1
- package/dist/campaign/presets/run-profile-matrix.d.ts +0 -151
- package/dist/campaign/presets/run-profile-matrix.d.ts.map +0 -1
- package/dist/campaign/presets/run-skill-opt.d.ts +0 -96
- package/dist/campaign/presets/run-skill-opt.d.ts.map +0 -1
- package/dist/campaign/proposers/_findings-text.d.ts +0 -22
- package/dist/campaign/proposers/_findings-text.d.ts.map +0 -1
- package/dist/campaign/proposers/ace.d.ts +0 -33
- package/dist/campaign/proposers/ace.d.ts.map +0 -1
- package/dist/campaign/proposers/ace.test.d.ts +0 -2
- package/dist/campaign/proposers/ace.test.d.ts.map +0 -1
- package/dist/campaign/proposers/analysis-edit.d.ts +0 -32
- package/dist/campaign/proposers/analysis-edit.d.ts.map +0 -1
- package/dist/campaign/proposers/evolutionary.d.ts +0 -20
- package/dist/campaign/proposers/evolutionary.d.ts.map +0 -1
- package/dist/campaign/proposers/fapo.d.ts +0 -120
- package/dist/campaign/proposers/fapo.d.ts.map +0 -1
- package/dist/campaign/proposers/gepa.d.ts +0 -86
- package/dist/campaign/proposers/gepa.d.ts.map +0 -1
- package/dist/campaign/proposers/halo.d.ts +0 -44
- package/dist/campaign/proposers/halo.d.ts.map +0 -1
- package/dist/campaign/proposers/halo.test.d.ts +0 -2
- package/dist/campaign/proposers/halo.test.d.ts.map +0 -1
- package/dist/campaign/proposers/memory.d.ts +0 -47
- package/dist/campaign/proposers/memory.d.ts.map +0 -1
- package/dist/campaign/proposers/memory.test.d.ts +0 -2
- package/dist/campaign/proposers/memory.test.d.ts.map +0 -1
- package/dist/campaign/proposers/skill-opt.d.ts +0 -88
- package/dist/campaign/proposers/skill-opt.d.ts.map +0 -1
- package/dist/campaign/proposers/trace-analyst.d.ts +0 -48
- package/dist/campaign/proposers/trace-analyst.d.ts.map +0 -1
- package/dist/campaign/proposers/trace-analyst.test.d.ts +0 -2
- package/dist/campaign/proposers/trace-analyst.test.d.ts.map +0 -1
- package/dist/campaign/provenance.d.ts +0 -185
- package/dist/campaign/provenance.d.ts.map +0 -1
- package/dist/campaign/run-campaign.d.ts +0 -90
- package/dist/campaign/run-campaign.d.ts.map +0 -1
- package/dist/campaign/score-utils.d.ts +0 -26
- package/dist/campaign/score-utils.d.ts.map +0 -1
- package/dist/campaign/skill-patch.d.ts +0 -62
- package/dist/campaign/skill-patch.d.ts.map +0 -1
- package/dist/campaign/storage.d.ts +0 -38
- package/dist/campaign/storage.d.ts.map +0 -1
- package/dist/campaign/types.d.ts.map +0 -1
- package/dist/campaign/worktree/index.d.ts +0 -53
- package/dist/campaign/worktree/index.d.ts.map +0 -1
- package/dist/canary.d.ts +0 -101
- package/dist/canary.d.ts.map +0 -1
- package/dist/causal-attribution.d.ts +0 -45
- package/dist/causal-attribution.d.ts.map +0 -1
- package/dist/ci-gate.d.ts +0 -44
- package/dist/ci-gate.d.ts.map +0 -1
- package/dist/cli.d.ts.map +0 -1
- package/dist/client.d.ts +0 -77
- package/dist/client.d.ts.map +0 -1
- package/dist/client.test.d.ts +0 -2
- package/dist/client.test.d.ts.map +0 -1
- package/dist/command-runner.d.ts +0 -74
- package/dist/command-runner.d.ts.map +0 -1
- package/dist/command-runner.test.d.ts +0 -2
- package/dist/command-runner.test.d.ts.map +0 -1
- package/dist/completion-verifier.d.ts +0 -147
- package/dist/completion-verifier.d.ts.map +0 -1
- package/dist/completion-verifier.test.d.ts +0 -9
- package/dist/completion-verifier.test.d.ts.map +0 -1
- package/dist/concurrency.d.ts +0 -23
- package/dist/concurrency.d.ts.map +0 -1
- package/dist/contamination-guard.d.ts +0 -81
- package/dist/contamination-guard.d.ts.map +0 -1
- package/dist/contract/analyze-runs.d.ts.map +0 -1
- package/dist/contract/define-agent-eval.d.ts +0 -52
- package/dist/contract/define-agent-eval.d.ts.map +0 -1
- package/dist/contract/diff.d.ts +0 -114
- package/dist/contract/diff.d.ts.map +0 -1
- package/dist/contract/index.d.ts.map +0 -1
- package/dist/contract/insight-report.d.ts.map +0 -1
- package/dist/contract/insight-types-fwd.d.ts +0 -7
- package/dist/contract/insight-types-fwd.d.ts.map +0 -1
- package/dist/contract/intake/agent-trace.d.ts +0 -97
- package/dist/contract/intake/agent-trace.d.ts.map +0 -1
- package/dist/contract/intake/code-agent-session.d.ts.map +0 -1
- package/dist/contract/intake/feedback-table.d.ts +0 -87
- package/dist/contract/intake/feedback-table.d.ts.map +0 -1
- package/dist/contract/intake/index.d.ts +0 -22
- package/dist/contract/intake/index.d.ts.map +0 -1
- package/dist/contract/intake/otel-spans.d.ts +0 -33
- package/dist/contract/intake/otel-spans.d.ts.map +0 -1
- package/dist/contract/self-improve.d.ts +0 -284
- package/dist/contract/self-improve.d.ts.map +0 -1
- package/dist/control-runtime.d.ts.map +0 -1
- package/dist/control-runtime.test.d.ts +0 -2
- package/dist/control-runtime.test.d.ts.map +0 -1
- package/dist/control.d.ts.map +0 -1
- package/dist/convergence.d.ts +0 -29
- package/dist/convergence.d.ts.map +0 -1
- package/dist/cost-ledger.d.ts.map +0 -1
- package/dist/cost-ledger.test.d.ts +0 -2
- package/dist/cost-ledger.test.d.ts.map +0 -1
- package/dist/cost-report.d.ts +0 -43
- package/dist/cost-report.d.ts.map +0 -1
- package/dist/cost-report.test.d.ts +0 -2
- package/dist/cost-report.test.d.ts.map +0 -1
- package/dist/cost-tracker.d.ts +0 -76
- package/dist/cost-tracker.d.ts.map +0 -1
- package/dist/counterfactual.d.ts.map +0 -1
- package/dist/cross-trace-diff.d.ts +0 -56
- package/dist/cross-trace-diff.d.ts.map +0 -1
- package/dist/dataset.d.ts.map +0 -1
- package/dist/deploy-gate-layer.d.ts +0 -125
- package/dist/deploy-gate-layer.d.ts.map +0 -1
- package/dist/deploy-gate-layer.test.d.ts +0 -2
- package/dist/deploy-gate-layer.test.d.ts.map +0 -1
- package/dist/description-length-gate.d.ts +0 -119
- package/dist/description-length-gate.d.ts.map +0 -1
- package/dist/detectors/edge.test.d.ts +0 -2
- package/dist/detectors/edge.test.d.ts.map +0 -1
- package/dist/detectors/index.d.ts +0 -81
- package/dist/detectors/index.d.ts.map +0 -1
- package/dist/detectors/index.test.d.ts +0 -2
- package/dist/detectors/index.test.d.ts.map +0 -1
- package/dist/diagnose/causal-sweep.d.ts +0 -100
- package/dist/diagnose/causal-sweep.d.ts.map +0 -1
- package/dist/diagnose/index.d.ts +0 -36
- package/dist/diagnose/index.d.ts.map +0 -1
- package/dist/diagnose/remediation.d.ts +0 -68
- package/dist/diagnose/remediation.d.ts.map +0 -1
- package/dist/diagnose/repair.d.ts +0 -77
- package/dist/diagnose/repair.d.ts.map +0 -1
- package/dist/discover-personas.d.ts +0 -35
- package/dist/discover-personas.d.ts.map +0 -1
- package/dist/driver.d.ts +0 -95
- package/dist/driver.d.ts.map +0 -1
- package/dist/driver.test.d.ts +0 -8
- package/dist/driver.test.d.ts.map +0 -1
- package/dist/dual-agent-bench.d.ts +0 -81
- package/dist/dual-agent-bench.d.ts.map +0 -1
- package/dist/error-count-extractor.d.ts +0 -47
- package/dist/error-count-extractor.d.ts.map +0 -1
- package/dist/error-count-extractor.test.d.ts +0 -2
- package/dist/error-count-extractor.test.d.ts.map +0 -1
- package/dist/errors.d.ts.map +0 -1
- package/dist/eval-campaign.d.ts.map +0 -1
- package/dist/eval-campaign.test.d.ts +0 -2
- package/dist/eval-campaign.test.d.ts.map +0 -1
- package/dist/eval-tools.d.ts +0 -55
- package/dist/eval-tools.d.ts.map +0 -1
- package/dist/eval-trace-store.d.ts +0 -107
- package/dist/eval-trace-store.d.ts.map +0 -1
- package/dist/eval-trace-store.test.d.ts +0 -2
- package/dist/eval-trace-store.test.d.ts.map +0 -1
- package/dist/executor.d.ts +0 -38
- package/dist/executor.d.ts.map +0 -1
- package/dist/executor.test.d.ts +0 -10
- package/dist/executor.test.d.ts.map +0 -1
- package/dist/experiment-tracker.d.ts +0 -178
- package/dist/experiment-tracker.d.ts.map +0 -1
- package/dist/experiment-tracker.test.d.ts +0 -2
- package/dist/experiment-tracker.test.d.ts.map +0 -1
- package/dist/failure-taxonomy.d.ts +0 -38
- package/dist/failure-taxonomy.d.ts.map +0 -1
- package/dist/feedback-trajectory.d.ts.map +0 -1
- package/dist/feedback-trajectory.test.d.ts +0 -2
- package/dist/feedback-trajectory.test.d.ts.map +0 -1
- package/dist/flow-layer.d.ts +0 -90
- package/dist/flow-layer.d.ts.map +0 -1
- package/dist/flow-layer.test.d.ts +0 -2
- package/dist/flow-layer.test.d.ts.map +0 -1
- package/dist/fuzz/capsule.d.ts +0 -46
- package/dist/fuzz/capsule.d.ts.map +0 -1
- package/dist/fuzz/cube.d.ts +0 -36
- package/dist/fuzz/cube.d.ts.map +0 -1
- package/dist/fuzz/explorer-cost.test.d.ts +0 -2
- package/dist/fuzz/explorer-cost.test.d.ts.map +0 -1
- package/dist/fuzz/explorer.d.ts +0 -64
- package/dist/fuzz/explorer.d.ts.map +0 -1
- package/dist/fuzz/fuzz-agent.d.ts +0 -16
- package/dist/fuzz/fuzz-agent.d.ts.map +0 -1
- package/dist/fuzz/fuzz-agent.test.d.ts +0 -2
- package/dist/fuzz/fuzz-agent.test.d.ts.map +0 -1
- package/dist/fuzz/gates.d.ts +0 -33
- package/dist/fuzz/gates.d.ts.map +0 -1
- package/dist/fuzz/index.d.ts +0 -26
- package/dist/fuzz/index.d.ts.map +0 -1
- package/dist/fuzz/policies.d.ts +0 -28
- package/dist/fuzz/policies.d.ts.map +0 -1
- package/dist/fuzz/tools.d.ts +0 -20
- package/dist/fuzz/tools.d.ts.map +0 -1
- package/dist/fuzz/types.d.ts +0 -307
- package/dist/fuzz/types.d.ts.map +0 -1
- package/dist/golden-matcher.d.ts +0 -71
- package/dist/golden-matcher.d.ts.map +0 -1
- package/dist/governance/eu-ai-act.d.ts +0 -37
- package/dist/governance/eu-ai-act.d.ts.map +0 -1
- package/dist/governance/index.d.ts.map +0 -1
- package/dist/governance/nist-ai-rmf.d.ts +0 -15
- package/dist/governance/nist-ai-rmf.d.ts.map +0 -1
- package/dist/governance/soc2.d.ts +0 -12
- package/dist/governance/soc2.d.ts.map +0 -1
- package/dist/governance/types.d.ts +0 -66
- package/dist/governance/types.d.ts.map +0 -1
- package/dist/harness-optimizer.d.ts +0 -82
- package/dist/harness-optimizer.d.ts.map +0 -1
- package/dist/held-out-gate.d.ts +0 -135
- package/dist/held-out-gate.d.ts.map +0 -1
- package/dist/hosted/client.d.ts +0 -73
- package/dist/hosted/client.d.ts.map +0 -1
- package/dist/hosted/from-env.test.d.ts +0 -8
- package/dist/hosted/from-env.test.d.ts.map +0 -1
- package/dist/hosted/index.d.ts.map +0 -1
- package/dist/hosted/types.d.ts +0 -159
- package/dist/hosted/types.d.ts.map +0 -1
- package/dist/index.d.ts.map +0 -1
- package/dist/integrity/backend-integrity.d.ts +0 -71
- package/dist/integrity/backend-integrity.d.ts.map +0 -1
- package/dist/integrity/preflight.d.ts +0 -72
- package/dist/integrity/preflight.d.ts.map +0 -1
- package/dist/integrity/preflight.test.d.ts +0 -2
- package/dist/integrity/preflight.test.d.ts.map +0 -1
- package/dist/integrity/single-backend.d.ts +0 -67
- package/dist/integrity/single-backend.d.ts.map +0 -1
- package/dist/intent-match-judge.d.ts +0 -69
- package/dist/intent-match-judge.d.ts.map +0 -1
- package/dist/intent-match-judge.test.d.ts +0 -2
- package/dist/intent-match-judge.test.d.ts.map +0 -1
- package/dist/judge-calibration.d.ts.map +0 -1
- package/dist/judge-ensemble.d.ts +0 -66
- package/dist/judge-ensemble.d.ts.map +0 -1
- package/dist/judge-ensemble.test.d.ts +0 -8
- package/dist/judge-ensemble.test.d.ts.map +0 -1
- package/dist/judge-families.d.ts +0 -38
- package/dist/judge-families.d.ts.map +0 -1
- package/dist/judge-panel.d.ts +0 -65
- package/dist/judge-panel.d.ts.map +0 -1
- package/dist/judge-retry.d.ts +0 -70
- package/dist/judge-retry.d.ts.map +0 -1
- package/dist/judge-runner.d.ts +0 -36
- package/dist/judge-runner.d.ts.map +0 -1
- package/dist/judge-runner.test.d.ts +0 -2
- package/dist/judge-runner.test.d.ts.map +0 -1
- package/dist/judges.d.ts +0 -74
- package/dist/judges.d.ts.map +0 -1
- package/dist/keyword-coverage-judge.d.ts +0 -89
- package/dist/keyword-coverage-judge.d.ts.map +0 -1
- package/dist/keyword-coverage-judge.test.d.ts +0 -2
- package/dist/keyword-coverage-judge.test.d.ts.map +0 -1
- package/dist/knowledge/index.d.ts.map +0 -1
- package/dist/knowledge/readiness.d.ts +0 -26
- package/dist/knowledge/readiness.d.ts.map +0 -1
- package/dist/knowledge/types.d.ts +0 -75
- package/dist/knowledge/types.d.ts.map +0 -1
- package/dist/live-proof.d.ts +0 -62
- package/dist/live-proof.d.ts.map +0 -1
- package/dist/llm-client.d.ts.map +0 -1
- package/dist/llm-client.test.d.ts +0 -2
- package/dist/llm-client.test.d.ts.map +0 -1
- package/dist/locked-jsonl-appender.d.ts.map +0 -1
- package/dist/matrix/aggregation.d.ts +0 -16
- package/dist/matrix/aggregation.d.ts.map +0 -1
- package/dist/matrix/index.d.ts.map +0 -1
- package/dist/matrix/runner.d.ts +0 -15
- package/dist/matrix/runner.d.ts.map +0 -1
- package/dist/matrix/types.d.ts.map +0 -1
- package/dist/meta-eval/calibration.d.ts +0 -47
- package/dist/meta-eval/calibration.d.ts.map +0 -1
- package/dist/meta-eval/correlation-study.d.ts +0 -53
- package/dist/meta-eval/correlation-study.d.ts.map +0 -1
- package/dist/meta-eval/index.d.ts.map +0 -1
- package/dist/meta-eval/outcome-store.d.ts.map +0 -1
- package/dist/meta-eval/rubric-predictive-validity.d.ts.map +0 -1
- package/dist/meta-eval/sentinel.d.ts +0 -169
- package/dist/meta-eval/sentinel.d.ts.map +0 -1
- package/dist/metrics.d.ts +0 -63
- package/dist/metrics.d.ts.map +0 -1
- package/dist/model-seats.d.ts +0 -71
- package/dist/model-seats.d.ts.map +0 -1
- package/dist/model-seats.test.d.ts +0 -2
- package/dist/model-seats.test.d.ts.map +0 -1
- package/dist/muffled-gate-scanner.d.ts +0 -102
- package/dist/muffled-gate-scanner.d.ts.map +0 -1
- package/dist/multi-layer-verifier.d.ts.map +0 -1
- package/dist/multi-layer-verifier.test.d.ts +0 -2
- package/dist/multi-layer-verifier.test.d.ts.map +0 -1
- package/dist/multi-toolchain-layer.d.ts +0 -80
- package/dist/multi-toolchain-layer.d.ts.map +0 -1
- package/dist/multi-toolchain-layer.test.d.ts +0 -2
- package/dist/multi-toolchain-layer.test.d.ts.map +0 -1
- package/dist/multishot/default-tools.d.ts +0 -34
- package/dist/multishot/default-tools.d.ts.map +0 -1
- package/dist/multishot/index.d.ts.map +0 -1
- package/dist/multishot/judges.d.ts +0 -32
- package/dist/multishot/judges.d.ts.map +0 -1
- package/dist/multishot/matrix.d.ts +0 -107
- package/dist/multishot/matrix.d.ts.map +0 -1
- package/dist/multishot/multishot.d.ts +0 -23
- package/dist/multishot/multishot.d.ts.map +0 -1
- package/dist/multishot/router.d.ts +0 -37
- package/dist/multishot/router.d.ts.map +0 -1
- package/dist/multishot/types.d.ts +0 -60
- package/dist/multishot/types.d.ts.map +0 -1
- package/dist/observability.d.ts +0 -71
- package/dist/observability.d.ts.map +0 -1
- package/dist/oracle.d.ts +0 -55
- package/dist/oracle.d.ts.map +0 -1
- package/dist/orthogonality.d.ts +0 -35
- package/dist/orthogonality.d.ts.map +0 -1
- package/dist/otel-pipeline.d.ts +0 -31
- package/dist/otel-pipeline.d.ts.map +0 -1
- package/dist/paraphrase.d.ts +0 -107
- package/dist/paraphrase.d.ts.map +0 -1
- package/dist/pareto.d.ts.map +0 -1
- package/dist/partition-held-out.d.ts +0 -70
- package/dist/partition-held-out.d.ts.map +0 -1
- package/dist/partition-held-out.test.d.ts +0 -2
- package/dist/partition-held-out.test.d.ts.map +0 -1
- package/dist/perf/index.d.ts.map +0 -1
- package/dist/perf/integrity.d.ts +0 -30
- package/dist/perf/integrity.d.ts.map +0 -1
- package/dist/perf/journey.d.ts +0 -45
- package/dist/perf/journey.d.ts.map +0 -1
- package/dist/perf/ratchet.d.ts +0 -47
- package/dist/perf/ratchet.d.ts.map +0 -1
- package/dist/pipelines/budget-breach.d.ts +0 -31
- package/dist/pipelines/budget-breach.d.ts.map +0 -1
- package/dist/pipelines/budget-breach.test.d.ts +0 -2
- package/dist/pipelines/budget-breach.test.d.ts.map +0 -1
- package/dist/pipelines/failure-cluster.d.ts +0 -38
- package/dist/pipelines/failure-cluster.d.ts.map +0 -1
- package/dist/pipelines/failure-cluster.test.d.ts +0 -2
- package/dist/pipelines/failure-cluster.test.d.ts.map +0 -1
- package/dist/pipelines/first-divergence.d.ts +0 -26
- package/dist/pipelines/first-divergence.d.ts.map +0 -1
- package/dist/pipelines/first-divergence.test.d.ts +0 -2
- package/dist/pipelines/first-divergence.test.d.ts.map +0 -1
- package/dist/pipelines/index.d.ts.map +0 -1
- package/dist/pipelines/judge-agreement.d.ts +0 -26
- package/dist/pipelines/judge-agreement.d.ts.map +0 -1
- package/dist/pipelines/judge-agreement.test.d.ts +0 -2
- package/dist/pipelines/judge-agreement.test.d.ts.map +0 -1
- package/dist/pipelines/regression.d.ts +0 -23
- package/dist/pipelines/regression.d.ts.map +0 -1
- package/dist/pipelines/regression.test.d.ts +0 -2
- package/dist/pipelines/regression.test.d.ts.map +0 -1
- package/dist/pipelines/stuck-loop.d.ts +0 -32
- package/dist/pipelines/stuck-loop.d.ts.map +0 -1
- package/dist/pipelines/stuck-loop.test.d.ts +0 -2
- package/dist/pipelines/stuck-loop.test.d.ts.map +0 -1
- package/dist/pipelines/tool-waste.d.ts +0 -34
- package/dist/pipelines/tool-waste.d.ts.map +0 -1
- package/dist/pipelines/tool-waste.test.d.ts +0 -2
- package/dist/pipelines/tool-waste.test.d.ts.map +0 -1
- package/dist/playbook.d.ts +0 -16
- package/dist/playbook.d.ts.map +0 -1
- package/dist/pr-review-benchmark.d.ts +0 -88
- package/dist/pr-review-benchmark.d.ts.map +0 -1
- package/dist/pr-review-benchmark.test.d.ts +0 -2
- package/dist/pr-review-benchmark.test.d.ts.map +0 -1
- package/dist/pre-registration.d.ts +0 -125
- package/dist/pre-registration.d.ts.map +0 -1
- package/dist/prm/builtin-rubrics.d.ts +0 -33
- package/dist/prm/builtin-rubrics.d.ts.map +0 -1
- package/dist/prm/index.d.ts.map +0 -1
- package/dist/prm/inference.d.ts +0 -29
- package/dist/prm/inference.d.ts.map +0 -1
- package/dist/prm/inference.test.d.ts +0 -2
- package/dist/prm/inference.test.d.ts.map +0 -1
- package/dist/prm/rubric.d.ts.map +0 -1
- package/dist/prm/training-export.d.ts +0 -38
- package/dist/prm/training-export.d.ts.map +0 -1
- package/dist/produced-state.d.ts +0 -63
- package/dist/produced-state.d.ts.map +0 -1
- package/dist/produced-state.test.d.ts +0 -8
- package/dist/produced-state.test.d.ts.map +0 -1
- package/dist/profile/baselines.d.ts +0 -37
- package/dist/profile/baselines.d.ts.map +0 -1
- package/dist/profile/index.d.ts +0 -105
- package/dist/profile/index.d.ts.map +0 -1
- package/dist/promotion-gate.d.ts +0 -93
- package/dist/promotion-gate.d.ts.map +0 -1
- package/dist/prompt-registry.d.ts +0 -41
- package/dist/prompt-registry.d.ts.map +0 -1
- package/dist/propose-review-control.d.ts +0 -49
- package/dist/propose-review-control.d.ts.map +0 -1
- package/dist/propose-review-control.test.d.ts +0 -2
- package/dist/propose-review-control.test.d.ts.map +0 -1
- package/dist/propose-review.d.ts +0 -155
- package/dist/propose-review.d.ts.map +0 -1
- package/dist/red-team.d.ts.map +0 -1
- package/dist/reference-replay-steering.d.ts +0 -11
- package/dist/reference-replay-steering.d.ts.map +0 -1
- package/dist/reference-replay.d.ts +0 -176
- package/dist/reference-replay.d.ts.map +0 -1
- package/dist/reflective-mutation.d.ts +0 -79
- package/dist/reflective-mutation.d.ts.map +0 -1
- package/dist/registry.d.ts +0 -31
- package/dist/registry.d.ts.map +0 -1
- package/dist/release-confidence.d.ts +0 -128
- package/dist/release-confidence.d.ts.map +0 -1
- package/dist/release-report.d.ts +0 -11
- package/dist/release-report.d.ts.map +0 -1
- package/dist/replay.d.ts +0 -120
- package/dist/replay.d.ts.map +0 -1
- package/dist/reporter.d.ts +0 -14
- package/dist/reporter.d.ts.map +0 -1
- package/dist/reporting.d.ts.map +0 -1
- package/dist/researcher.d.ts +0 -140
- package/dist/researcher.d.ts.map +0 -1
- package/dist/reviewer.d.ts +0 -118
- package/dist/reviewer.d.ts.map +0 -1
- package/dist/reviewer.test.d.ts +0 -2
- package/dist/reviewer.test.d.ts.map +0 -1
- package/dist/reward-model-export.d.ts +0 -60
- package/dist/reward-model-export.d.ts.map +0 -1
- package/dist/rl/active-curriculum.d.ts +0 -110
- package/dist/rl/active-curriculum.d.ts.map +0 -1
- package/dist/rl/adaptation-eval.d.ts +0 -109
- package/dist/rl/adaptation-eval.d.ts.map +0 -1
- package/dist/rl/adversarial.d.ts.map +0 -1
- package/dist/rl/compute-curves.d.ts +0 -127
- package/dist/rl/compute-curves.d.ts.map +0 -1
- package/dist/rl/contamination.d.ts +0 -117
- package/dist/rl/contamination.d.ts.map +0 -1
- package/dist/rl/corpus.d.ts +0 -55
- package/dist/rl/corpus.d.ts.map +0 -1
- package/dist/rl/corpus.test.d.ts +0 -2
- package/dist/rl/corpus.test.d.ts.map +0 -1
- package/dist/rl/dataset.d.ts +0 -102
- package/dist/rl/dataset.d.ts.map +0 -1
- package/dist/rl/dataset.test.d.ts +0 -2
- package/dist/rl/dataset.test.d.ts.map +0 -1
- package/dist/rl/exporters.d.ts +0 -141
- package/dist/rl/exporters.d.ts.map +0 -1
- package/dist/rl/index.d.ts +0 -49
- package/dist/rl/index.d.ts.map +0 -1
- package/dist/rl/off-policy.d.ts.map +0 -1
- package/dist/rl/predictive-validity-researcher.d.ts +0 -69
- package/dist/rl/predictive-validity-researcher.d.ts.map +0 -1
- package/dist/rl/preferences.d.ts +0 -141
- package/dist/rl/preferences.d.ts.map +0 -1
- package/dist/rl/process-reward.d.ts +0 -122
- package/dist/rl/process-reward.d.ts.map +0 -1
- package/dist/rl/reward-hacking.d.ts +0 -104
- package/dist/rl/reward-hacking.d.ts.map +0 -1
- package/dist/rl/rl-campaign.d.ts +0 -85
- package/dist/rl/rl-campaign.d.ts.map +0 -1
- package/dist/rl/run-record-adapters.d.ts +0 -56
- package/dist/rl/run-record-adapters.d.ts.map +0 -1
- package/dist/rl/sim-fidelity.d.ts +0 -166
- package/dist/rl/sim-fidelity.d.ts.map +0 -1
- package/dist/rl/sim-fidelity.test.d.ts +0 -2
- package/dist/rl/sim-fidelity.test.d.ts.map +0 -1
- package/dist/rl/tournament.d.ts +0 -115
- package/dist/rl/tournament.d.ts.map +0 -1
- package/dist/rl/verifiable-reward.d.ts +0 -124
- package/dist/rl/verifiable-reward.d.ts.map +0 -1
- package/dist/run-critic.d.ts +0 -23
- package/dist/run-critic.d.ts.map +0 -1
- package/dist/run-evidence.d.ts +0 -32
- package/dist/run-evidence.d.ts.map +0 -1
- package/dist/run-record.d.ts.map +0 -1
- package/dist/run-record.test.d.ts +0 -2
- package/dist/run-record.test.d.ts.map +0 -1
- package/dist/run-score.d.ts +0 -31
- package/dist/run-score.d.ts.map +0 -1
- package/dist/runtime-trajectory.d.ts +0 -47
- package/dist/runtime-trajectory.d.ts.map +0 -1
- package/dist/sandbox-harness.d.ts.map +0 -1
- package/dist/sandbox-harness.test.d.ts +0 -2
- package/dist/sandbox-harness.test.d.ts.map +0 -1
- package/dist/sandbox-pool.d.ts +0 -74
- package/dist/sandbox-pool.d.ts.map +0 -1
- package/dist/sandbox-pool.test.d.ts +0 -2
- package/dist/sandbox-pool.test.d.ts.map +0 -1
- package/dist/scorecard.d.ts +0 -133
- package/dist/scorecard.d.ts.map +0 -1
- package/dist/scorecard.test.d.ts +0 -2
- package/dist/scorecard.test.d.ts.map +0 -1
- package/dist/self-play.d.ts +0 -69
- package/dist/self-play.d.ts.map +0 -1
- package/dist/semantic-concept-judge.d.ts +0 -135
- package/dist/semantic-concept-judge.d.ts.map +0 -1
- package/dist/semantic-concept-judge.test.d.ts +0 -2
- package/dist/semantic-concept-judge.test.d.ts.map +0 -1
- package/dist/sequential.d.ts.map +0 -1
- package/dist/series-convergence.d.ts.map +0 -1
- package/dist/slo.d.ts +0 -48
- package/dist/slo.d.ts.map +0 -1
- package/dist/state-continuity.d.ts +0 -47
- package/dist/state-continuity.d.ts.map +0 -1
- package/dist/statistics.d.ts.map +0 -1
- package/dist/statistics.test.d.ts +0 -2
- package/dist/statistics.test.d.ts.map +0 -1
- package/dist/steering-optimizer.d.ts +0 -58
- package/dist/steering-optimizer.d.ts.map +0 -1
- package/dist/steering.d.ts +0 -24
- package/dist/steering.d.ts.map +0 -1
- package/dist/storyboard/code-edit.d.ts +0 -64
- package/dist/storyboard/code-edit.d.ts.map +0 -1
- package/dist/storyboard/code-edit.test.d.ts +0 -2
- package/dist/storyboard/code-edit.test.d.ts.map +0 -1
- package/dist/storyboard/index.d.ts.map +0 -1
- package/dist/storyboard/index.test.d.ts +0 -2
- package/dist/storyboard/index.test.d.ts.map +0 -1
- package/dist/summary-report.d.ts.map +0 -1
- package/dist/telemetry/client.d.ts +0 -35
- package/dist/telemetry/client.d.ts.map +0 -1
- package/dist/telemetry/index.d.ts.map +0 -1
- package/dist/telemetry/schema.d.ts +0 -61
- package/dist/telemetry/schema.d.ts.map +0 -1
- package/dist/telemetry/sink-fetch.d.ts +0 -39
- package/dist/telemetry/sink-fetch.d.ts.map +0 -1
- package/dist/telemetry/sink-file.d.ts.map +0 -1
- package/dist/test-graded-scenario.d.ts +0 -42
- package/dist/test-graded-scenario.d.ts.map +0 -1
- package/dist/testing.d.ts.map +0 -1
- package/dist/tool-use-metrics.d.ts +0 -35
- package/dist/tool-use-metrics.d.ts.map +0 -1
- package/dist/trace/capture-fetch.d.ts +0 -48
- package/dist/trace/capture-fetch.d.ts.map +0 -1
- package/dist/trace/capture-fetch.test.d.ts +0 -2
- package/dist/trace/capture-fetch.test.d.ts.map +0 -1
- package/dist/trace/emitter.d.ts.map +0 -1
- package/dist/trace/extract-usage.d.ts +0 -46
- package/dist/trace/extract-usage.d.ts.map +0 -1
- package/dist/trace/extract-usage.test.d.ts +0 -2
- package/dist/trace/extract-usage.test.d.ts.map +0 -1
- package/dist/trace/index.d.ts +0 -15
- package/dist/trace/index.d.ts.map +0 -1
- package/dist/trace/integrity.d.ts.map +0 -1
- package/dist/trace/otel-bridge.d.ts +0 -29
- package/dist/trace/otel-bridge.d.ts.map +0 -1
- package/dist/trace/otel-export.d.ts +0 -52
- package/dist/trace/otel-export.d.ts.map +0 -1
- package/dist/trace/otel.d.ts +0 -57
- package/dist/trace/otel.d.ts.map +0 -1
- package/dist/trace/otlp-attributes.d.ts +0 -17
- package/dist/trace/otlp-attributes.d.ts.map +0 -1
- package/dist/trace/query.d.ts +0 -29
- package/dist/trace/query.d.ts.map +0 -1
- package/dist/trace/query.test.d.ts +0 -2
- package/dist/trace/query.test.d.ts.map +0 -1
- package/dist/trace/raw-provider-sink.d.ts.map +0 -1
- package/dist/trace/redact.d.ts.map +0 -1
- package/dist/trace/schema.d.ts.map +0 -1
- package/dist/trace/store-to-otlp.d.ts +0 -72
- package/dist/trace/store-to-otlp.d.ts.map +0 -1
- package/dist/trace/store-to-otlp.test.d.ts +0 -2
- package/dist/trace/store-to-otlp.test.d.ts.map +0 -1
- package/dist/trace/store.d.ts.map +0 -1
- package/dist/trace/store.test.d.ts +0 -2
- package/dist/trace/store.test.d.ts.map +0 -1
- package/dist/trace-analyst/analyst.d.ts.map +0 -1
- package/dist/trace-analyst/analyst.test.d.ts +0 -2
- package/dist/trace-analyst/analyst.test.d.ts.map +0 -1
- package/dist/trace-analyst/behavioral-metrics.d.ts +0 -40
- package/dist/trace-analyst/behavioral-metrics.d.ts.map +0 -1
- package/dist/trace-analyst/behavioral-metrics.test.d.ts +0 -2
- package/dist/trace-analyst/behavioral-metrics.test.d.ts.map +0 -1
- package/dist/trace-analyst/hook.d.ts +0 -55
- package/dist/trace-analyst/hook.d.ts.map +0 -1
- package/dist/trace-analyst/index.d.ts +0 -18
- package/dist/trace-analyst/index.d.ts.map +0 -1
- package/dist/trace-analyst/insights.d.ts +0 -71
- package/dist/trace-analyst/insights.d.ts.map +0 -1
- package/dist/trace-analyst/insights.test.d.ts +0 -2
- package/dist/trace-analyst/insights.test.d.ts.map +0 -1
- package/dist/trace-analyst/otlp-flatten.d.ts +0 -42
- package/dist/trace-analyst/otlp-flatten.d.ts.map +0 -1
- package/dist/trace-analyst/otlp-span.d.ts +0 -85
- package/dist/trace-analyst/otlp-span.d.ts.map +0 -1
- package/dist/trace-analyst/otlp-span.test.d.ts +0 -2
- package/dist/trace-analyst/otlp-span.test.d.ts.map +0 -1
- package/dist/trace-analyst/otlp-to-run-records.d.ts +0 -115
- package/dist/trace-analyst/otlp-to-run-records.d.ts.map +0 -1
- package/dist/trace-analyst/otlp-to-run-records.test.d.ts +0 -2
- package/dist/trace-analyst/otlp-to-run-records.test.d.ts.map +0 -1
- package/dist/trace-analyst/otlp-to-run-records.timestamps.test.d.ts +0 -2
- package/dist/trace-analyst/otlp-to-run-records.timestamps.test.d.ts.map +0 -1
- package/dist/trace-analyst/prompts.d.ts +0 -6
- package/dist/trace-analyst/prompts.d.ts.map +0 -1
- package/dist/trace-analyst/store-otlp.d.ts +0 -126
- package/dist/trace-analyst/store-otlp.d.ts.map +0 -1
- package/dist/trace-analyst/store-otlp.test.d.ts +0 -8
- package/dist/trace-analyst/store-otlp.test.d.ts.map +0 -1
- package/dist/trace-analyst/store-otlp.timestamps.test.d.ts +0 -2
- package/dist/trace-analyst/store-otlp.timestamps.test.d.ts.map +0 -1
- package/dist/trace-analyst/store.d.ts +0 -63
- package/dist/trace-analyst/store.d.ts.map +0 -1
- package/dist/trace-analyst/tools.d.ts +0 -44
- package/dist/trace-analyst/tools.d.ts.map +0 -1
- package/dist/trace-analyst/tools.test.d.ts +0 -10
- package/dist/trace-analyst/tools.test.d.ts.map +0 -1
- package/dist/trace-analyst/types.d.ts.map +0 -1
- package/dist/trace-contracts.d.ts +0 -180
- package/dist/trace-contracts.d.ts.map +0 -1
- package/dist/traced-analyst.d.ts +0 -26
- package/dist/traced-analyst.d.ts.map +0 -1
- package/dist/traced-judges.d.ts +0 -27
- package/dist/traced-judges.d.ts.map +0 -1
- package/dist/traces.d.ts.map +0 -1
- package/dist/trajectory.d.ts.map +0 -1
- package/dist/types.d.ts.map +0 -1
- package/dist/ui-finding.d.ts +0 -104
- package/dist/ui-finding.d.ts.map +0 -1
- package/dist/verdict-cache.d.ts +0 -78
- package/dist/verdict-cache.d.ts.map +0 -1
- package/dist/verdict-cache.test.d.ts +0 -2
- package/dist/verdict-cache.test.d.ts.map +0 -1
- package/dist/verdict.d.ts.map +0 -1
- package/dist/visual-diff.d.ts +0 -32
- package/dist/visual-diff.d.ts.map +0 -1
- package/dist/wire/handlers.d.ts +0 -54
- package/dist/wire/handlers.d.ts.map +0 -1
- package/dist/wire/index.d.ts.map +0 -1
- package/dist/wire/openapi.d.ts +0 -3
- package/dist/wire/openapi.d.ts.map +0 -1
- package/dist/wire/rpc.d.ts +0 -21
- package/dist/wire/rpc.d.ts.map +0 -1
- package/dist/wire/rubrics.d.ts +0 -34
- package/dist/wire/rubrics.d.ts.map +0 -1
- package/dist/wire/schemas.d.ts +0 -410
- package/dist/wire/schemas.d.ts.map +0 -1
- package/dist/wire/server.d.ts +0 -60
- package/dist/wire/server.d.ts.map +0 -1
- package/dist/workflow/event-schema.d.ts +0 -5
- package/dist/workflow/event-schema.d.ts.map +0 -1
- package/dist/workflow/feedback-pack.d.ts +0 -99
- package/dist/workflow/feedback-pack.d.ts.map +0 -1
- package/dist/workflow/index.d.ts.map +0 -1
- package/dist/workflow/intelligence-export.d.ts +0 -62
- package/dist/workflow/intelligence-export.d.ts.map +0 -1
- package/dist/workflow/partner-report.d.ts +0 -49
- package/dist/workflow/partner-report.d.ts.map +0 -1
- package/dist/workflow/phase-graph.d.ts +0 -43
- package/dist/workflow/phase-graph.d.ts.map +0 -1
- package/dist/workflow/promotion-gate.d.ts +0 -61
- package/dist/workflow/promotion-gate.d.ts.map +0 -1
- package/dist/workflow/run-record.d.ts +0 -12
- package/dist/workflow/run-record.d.ts.map +0 -1
- package/dist/workflow/runtime-adapter.d.ts +0 -20
- package/dist/workflow/runtime-adapter.d.ts.map +0 -1
- package/dist/workflow/sanitize.d.ts +0 -21
- package/dist/workflow/sanitize.d.ts.map +0 -1
- package/dist/workflow/schema.d.ts +0 -5
- package/dist/workflow/schema.d.ts.map +0 -1
- package/dist/workflow/summary.d.ts +0 -43
- package/dist/workflow/summary.d.ts.map +0 -1
- package/dist/workflow/trace-event-fields.d.ts +0 -6
- package/dist/workflow/trace-event-fields.d.ts.map +0 -1
- package/dist/workflow/trajectory.d.ts +0 -15
- package/dist/workflow/trajectory.d.ts.map +0 -1
- package/dist/workflow/types.d.ts +0 -68
- package/dist/workflow/types.d.ts.map +0 -1
- package/dist/workspace-inspector.d.ts +0 -67
- package/dist/workspace-inspector.d.ts.map +0 -1
- package/dist/wrangler-deploy-runner.test.d.ts +0 -2
- package/dist/wrangler-deploy-runner.test.d.ts.map +0 -1
|
@@ -1,110 +0,0 @@
|
|
|
1
|
-
/**
|
|
2
|
-
* Adaptive curriculum / active scenario selection.
|
|
3
|
-
*
|
|
4
|
-
* Fixed scenario sets waste sample budget on cells the policy already
|
|
5
|
-
* passes (no information left) and cells the policy never passes (no
|
|
6
|
-
* gradient available either). Active learning over scenarios fixes this
|
|
7
|
-
* by allocating the next sample budget to cells where the policy's
|
|
8
|
-
* outcome is *uncertain* — those carry the most decision-relevant signal.
|
|
9
|
-
*
|
|
10
|
-
* This module ships two complementary strategies:
|
|
11
|
-
*
|
|
12
|
-
* 1. **Variance-based** — score each (variant, scenario) cell by the
|
|
13
|
-
* empirical variance of past observations. Allocate next-round budget
|
|
14
|
-
* proportional to variance. Standard active-learning-by-uncertainty
|
|
15
|
-
* heuristic; works well when the policy is non-deterministic and
|
|
16
|
-
* cells differ in observation noise.
|
|
17
|
-
*
|
|
18
|
-
* 2. **Bandit-based (Thompson sampling)** — model each (variant,
|
|
19
|
-
* scenario) cell as a Beta-Bernoulli arm; sample a posterior; pick
|
|
20
|
-
* cells whose posterior mean is closest to the per-scenario decision
|
|
21
|
-
* threshold. The right primitive when scenarios are
|
|
22
|
-
* "pass/fail" rather than continuous, and when promotion gates fire
|
|
23
|
-
* at a known threshold (e.g., 0.5).
|
|
24
|
-
*
|
|
25
|
-
* The output is a *next-round budget allocation* — a list of (variant,
|
|
26
|
-
* scenario, count) triples. The consumer's matrix runner consumes the
|
|
27
|
-
* allocation, runs those cells, feeds the new observations back. Loop.
|
|
28
|
-
*
|
|
29
|
-
* Out of scope (deliberate): scenario *generation* — that's the
|
|
30
|
-
* adversarial primitive's job. This module allocates over an existing
|
|
31
|
-
* scenario pool.
|
|
32
|
-
*/
|
|
33
|
-
import type { RunRecord } from '../run-record';
|
|
34
|
-
export interface CellObservation {
|
|
35
|
-
variantId: string;
|
|
36
|
-
scenarioId: string;
|
|
37
|
-
/** Observed score in [0, 1]. */
|
|
38
|
-
score: number;
|
|
39
|
-
/** For Bernoulli arms — derive from the score with a threshold if needed. */
|
|
40
|
-
pass?: boolean;
|
|
41
|
-
}
|
|
42
|
-
export interface CurriculumAllocation {
|
|
43
|
-
variantId: string;
|
|
44
|
-
scenarioId: string;
|
|
45
|
-
/** How many additional reps to run on this cell. */
|
|
46
|
-
count: number;
|
|
47
|
-
/** Strategy-specific reason for the allocation. */
|
|
48
|
-
reason: string;
|
|
49
|
-
}
|
|
50
|
-
export interface VarianceCurriculumOptions {
|
|
51
|
-
/** Total reps to allocate across all cells. */
|
|
52
|
-
budget: number;
|
|
53
|
-
/**
|
|
54
|
-
* Smoothing prior on variance — keeps the allocator from concentrating
|
|
55
|
-
* on a cell with one observation just because its 1-sample variance is
|
|
56
|
-
* 0. Default 0.05.
|
|
57
|
-
*/
|
|
58
|
-
variancePrior?: number;
|
|
59
|
-
/**
|
|
60
|
-
* Minimum reps per cell — even when the variance estimate is low, give
|
|
61
|
-
* every cell at least this many. Default 1.
|
|
62
|
-
*/
|
|
63
|
-
floorPerCell?: number;
|
|
64
|
-
}
|
|
65
|
-
/**
|
|
66
|
-
* Variance-proportional allocation. For each cell, estimate variance from
|
|
67
|
-
* past observations + a prior, then allocate the budget proportional to
|
|
68
|
-
* (sqrt(variance) + 1/sqrt(n)) — a classical optimal-allocation rule
|
|
69
|
-
* (Neyman 1934) that balances "explore noisy cells" with "explore
|
|
70
|
-
* under-sampled cells."
|
|
71
|
-
*/
|
|
72
|
-
export declare function varianceBasedCurriculum(observations: CellObservation[], candidateCells: Array<{
|
|
73
|
-
variantId: string;
|
|
74
|
-
scenarioId: string;
|
|
75
|
-
}>, opts: VarianceCurriculumOptions): CurriculumAllocation[];
|
|
76
|
-
export interface ThompsonCurriculumOptions {
|
|
77
|
-
budget: number;
|
|
78
|
-
/**
|
|
79
|
-
* The per-scenario decision threshold. Cells whose posterior mean is
|
|
80
|
-
* closest to this get the most budget — that's where the next observation
|
|
81
|
-
* has the highest information value for the gate decision. Default 0.5.
|
|
82
|
-
*/
|
|
83
|
-
decisionThreshold?: number;
|
|
84
|
-
/** Beta prior parameters. Default α=β=1 (uniform). */
|
|
85
|
-
priorAlpha?: number;
|
|
86
|
-
priorBeta?: number;
|
|
87
|
-
/** Seed the Thompson sampler. Default unset (Math.random). */
|
|
88
|
-
seed?: number;
|
|
89
|
-
}
|
|
90
|
-
/**
|
|
91
|
-
* Thompson-sampling-style allocation for pass/fail cells. For each cell:
|
|
92
|
-
*
|
|
93
|
-
* - Maintain Beta(α + passes, β + failures) posterior on pass-rate
|
|
94
|
-
* - Allocation weight ∝ exp(-((sampledMean - threshold) / σ)^2):
|
|
95
|
-
* cells whose sampled posterior straddles the decision boundary get
|
|
96
|
-
* the most weight; cells already clearly above or below get less.
|
|
97
|
-
*
|
|
98
|
-
* This is the right primitive when promotion gates fire at a known
|
|
99
|
-
* threshold and you want to sharpen the posterior near the boundary.
|
|
100
|
-
*/
|
|
101
|
-
export declare function thompsonCurriculum(observations: CellObservation[], candidateCells: Array<{
|
|
102
|
-
variantId: string;
|
|
103
|
-
scenarioId: string;
|
|
104
|
-
}>, opts: ThompsonCurriculumOptions): CurriculumAllocation[];
|
|
105
|
-
/** Convenience: extract `CellObservation[]` directly from `RunRecord[]`. */
|
|
106
|
-
export declare function observationsFromRunRecords(runs: RunRecord[], opts?: {
|
|
107
|
-
passThreshold?: number;
|
|
108
|
-
useHoldout?: boolean;
|
|
109
|
-
}): CellObservation[];
|
|
110
|
-
//# sourceMappingURL=active-curriculum.d.ts.map
|
|
@@ -1 +0,0 @@
|
|
|
1
|
-
{"version":3,"file":"active-curriculum.d.ts","sourceRoot":"","sources":["../../src/rl/active-curriculum.ts"],"names":[],"mappings":"AAAA;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;GA+BG;AAEH,OAAO,KAAK,EAAE,SAAS,EAAE,MAAM,eAAe,CAAA;AAE9C,MAAM,WAAW,eAAe;IAC9B,SAAS,EAAE,MAAM,CAAA;IACjB,UAAU,EAAE,MAAM,CAAA;IAClB,gCAAgC;IAChC,KAAK,EAAE,MAAM,CAAA;IACb,6EAA6E;IAC7E,IAAI,CAAC,EAAE,OAAO,CAAA;CACf;AAED,MAAM,WAAW,oBAAoB;IACnC,SAAS,EAAE,MAAM,CAAA;IACjB,UAAU,EAAE,MAAM,CAAA;IAClB,oDAAoD;IACpD,KAAK,EAAE,MAAM,CAAA;IACb,mDAAmD;IACnD,MAAM,EAAE,MAAM,CAAA;CACf;AAED,MAAM,WAAW,yBAAyB;IACxC,+CAA+C;IAC/C,MAAM,EAAE,MAAM,CAAA;IACd;;;;OAIG;IACH,aAAa,CAAC,EAAE,MAAM,CAAA;IACtB;;;OAGG;IACH,YAAY,CAAC,EAAE,MAAM,CAAA;CACtB;AAED;;;;;;GAMG;AACH,wBAAgB,uBAAuB,CACrC,YAAY,EAAE,eAAe,EAAE,EAC/B,cAAc,EAAE,KAAK,CAAC;IAAE,SAAS,EAAE,MAAM,CAAC;IAAC,UAAU,EAAE,MAAM,CAAA;CAAE,CAAC,EAChE,IAAI,EAAE,yBAAyB,GAC9B,oBAAoB,EAAE,CAkDxB;AAED,MAAM,WAAW,yBAAyB;IACxC,MAAM,EAAE,MAAM,CAAA;IACd;;;;OAIG;IACH,iBAAiB,CAAC,EAAE,MAAM,CAAA;IAC1B,sDAAsD;IACtD,UAAU,CAAC,EAAE,MAAM,CAAA;IACnB,SAAS,CAAC,EAAE,MAAM,CAAA;IAClB,8DAA8D;IAC9D,IAAI,CAAC,EAAE,MAAM,CAAA;CACd;AAED;;;;;;;;;;GAUG;AACH,wBAAgB,kBAAkB,CAChC,YAAY,EAAE,eAAe,EAAE,EAC/B,cAAc,EAAE,KAAK,CAAC;IAAE,SAAS,EAAE,MAAM,CAAC;IAAC,UAAU,EAAE,MAAM,CAAA;CAAE,CAAC,EAChE,IAAI,EAAE,yBAAyB,GAC9B,oBAAoB,EAAE,CAmDxB;AAED,4EAA4E;AAC5E,wBAAgB,0BAA0B,CACxC,IAAI,EAAE,SAAS,EAAE,EACjB,IAAI,GAAE;IAAE,aAAa,CAAC,EAAE,MAAM,CAAC;IAAC,UAAU,CAAC,EAAE,OAAO,CAAA;CAAO,GAC1D,eAAe,EAAE,CAkBnB"}
|
|
@@ -1,109 +0,0 @@
|
|
|
1
|
-
/**
|
|
2
|
-
* Sample-efficient adaptation evaluation.
|
|
3
|
-
*
|
|
4
|
-
* For foundation-model-based agents, the load-bearing capability isn't
|
|
5
|
-
* raw end-state performance — it's *how fast the agent reaches that
|
|
6
|
-
* performance from cold start*. The same model with a worse prompt that
|
|
7
|
-
* adapts in 5 demonstrations beats the same model with a better prompt
|
|
8
|
-
* that needs 50. Standard meta-learning eval (Finn et al., MAML, RL² lit)
|
|
9
|
-
* reports an *adaptation curve*: score after k=0, 1, 2, 4, 8, 16, …
|
|
10
|
-
* in-context examples or fine-tune steps.
|
|
11
|
-
*
|
|
12
|
-
* This module ships:
|
|
13
|
-
*
|
|
14
|
-
* 1. `runAdaptationCurve` — given a runner that takes k demonstrations
|
|
15
|
-
* and returns a score, produce the (k, score) curve.
|
|
16
|
-
* 2. `compareAdaptationCurves` — paired comparison across two policies.
|
|
17
|
-
* Returns per-k delta with bootstrap CIs and an "area-under-curve"
|
|
18
|
-
* summary statistic.
|
|
19
|
-
* 3. `firstPassK` — for pass/fail evaluation, the minimum k at which
|
|
20
|
-
* the policy reliably passes (≥ pass-rate threshold over reps).
|
|
21
|
-
*
|
|
22
|
-
* Use cases:
|
|
23
|
-
* - Compare two prompt designs that have similar end-state performance
|
|
24
|
-
* but different in-context efficiency.
|
|
25
|
-
* - Decide between fine-tuning and prompting based on adaptation cost.
|
|
26
|
-
* - Detect when a policy "memorizes" k=0 inputs vs. genuinely adapts.
|
|
27
|
-
*/
|
|
28
|
-
export interface AdaptationRunner<S> {
|
|
29
|
-
/**
|
|
30
|
-
* Runs the policy on `scenario` with `k` demonstrations. Returns a
|
|
31
|
-
* scalar score in [0, 1]. The runner is responsible for any caching;
|
|
32
|
-
* the harness calls it once per (scenario, k, rep) cell.
|
|
33
|
-
*/
|
|
34
|
-
run(args: {
|
|
35
|
-
scenario: S;
|
|
36
|
-
k: number;
|
|
37
|
-
rep: number;
|
|
38
|
-
}): Promise<number>;
|
|
39
|
-
}
|
|
40
|
-
export interface RunAdaptationCurveOptions<S> {
|
|
41
|
-
scenarios: S[];
|
|
42
|
-
/** Number-of-shots to evaluate at. Default `[0, 1, 2, 4, 8, 16]`. */
|
|
43
|
-
ks?: number[];
|
|
44
|
-
/** Reps per (scenario, k) cell. Default 3. */
|
|
45
|
-
reps?: number;
|
|
46
|
-
runner: AdaptationRunner<S>;
|
|
47
|
-
/** Pass-rate threshold for `firstPassK` reporting. Default 0.5. */
|
|
48
|
-
passThreshold?: number;
|
|
49
|
-
}
|
|
50
|
-
export interface AdaptationPoint {
|
|
51
|
-
k: number;
|
|
52
|
-
meanScore: number;
|
|
53
|
-
passRate: number;
|
|
54
|
-
std: number;
|
|
55
|
-
n: number;
|
|
56
|
-
/** Per-scenario means at this k. */
|
|
57
|
-
perScenario: Array<{
|
|
58
|
-
scenarioId: string;
|
|
59
|
-
meanScore: number;
|
|
60
|
-
passes: number;
|
|
61
|
-
total: number;
|
|
62
|
-
}>;
|
|
63
|
-
}
|
|
64
|
-
export interface AdaptationCurve {
|
|
65
|
-
points: AdaptationPoint[];
|
|
66
|
-
/**
|
|
67
|
-
* Smallest `k` at which `passRate ≥ passThreshold`. `null` if no `k`
|
|
68
|
-
* tested reaches it.
|
|
69
|
-
*/
|
|
70
|
-
firstPassK: number | null;
|
|
71
|
-
/**
|
|
72
|
-
* Area under the (k, meanScore) curve, normalized by max-k. A
|
|
73
|
-
* single-number summary of "how well does this policy adapt from
|
|
74
|
-
* cold-start to fully-conditioned." Higher = better adapter.
|
|
75
|
-
*/
|
|
76
|
-
adaptationArea: number;
|
|
77
|
-
}
|
|
78
|
-
export declare function runAdaptationCurve<S extends {
|
|
79
|
-
scenarioId?: string;
|
|
80
|
-
}>(opts: RunAdaptationCurveOptions<S>): Promise<AdaptationCurve>;
|
|
81
|
-
export interface CompareCurvesResult {
|
|
82
|
-
perK: Array<{
|
|
83
|
-
k: number;
|
|
84
|
-
deltaMean: number;
|
|
85
|
-
aLow: number;
|
|
86
|
-
aHigh: number;
|
|
87
|
-
bLow: number;
|
|
88
|
-
bHigh: number;
|
|
89
|
-
}>;
|
|
90
|
-
areaDelta: number;
|
|
91
|
-
firstPassKDelta: number | null;
|
|
92
|
-
/** Verdict: 'a_better' | 'b_better' | 'similar'. */
|
|
93
|
-
verdict: 'a_better' | 'b_better' | 'similar';
|
|
94
|
-
/** Rationale, ready to render. */
|
|
95
|
-
rationale: string;
|
|
96
|
-
}
|
|
97
|
-
/**
|
|
98
|
-
* Paired comparison of two adaptation curves. Per-k deltas with 95%
|
|
99
|
-
* bootstrap CIs (constructed from each curve's `perScenario` per-k means
|
|
100
|
-
* — the bootstrap unit is the scenario, not the rep).
|
|
101
|
-
*/
|
|
102
|
-
export declare function compareAdaptationCurves(a: AdaptationCurve, b: AdaptationCurve, opts?: {
|
|
103
|
-
confidence?: number;
|
|
104
|
-
bootstrapResamples?: number;
|
|
105
|
-
seed?: number;
|
|
106
|
-
}): CompareCurvesResult;
|
|
107
|
-
/** First k at which the curve's per-scenario pass rate reliably hits the threshold. */
|
|
108
|
-
export declare function firstPassK(curve: AdaptationCurve, threshold?: number): number | null;
|
|
109
|
-
//# sourceMappingURL=adaptation-eval.d.ts.map
|
|
@@ -1 +0,0 @@
|
|
|
1
|
-
{"version":3,"file":"adaptation-eval.d.ts","sourceRoot":"","sources":["../../src/rl/adaptation-eval.ts"],"names":[],"mappings":"AAAA;;;;;;;;;;;;;;;;;;;;;;;;;;GA0BG;AAEH,MAAM,WAAW,gBAAgB,CAAC,CAAC;IACjC;;;;OAIG;IACH,GAAG,CAAC,IAAI,EAAE;QAAE,QAAQ,EAAE,CAAC,CAAC;QAAC,CAAC,EAAE,MAAM,CAAC;QAAC,GAAG,EAAE,MAAM,CAAA;KAAE,GAAG,OAAO,CAAC,MAAM,CAAC,CAAA;CACpE;AAED,MAAM,WAAW,yBAAyB,CAAC,CAAC;IAC1C,SAAS,EAAE,CAAC,EAAE,CAAA;IACd,qEAAqE;IACrE,EAAE,CAAC,EAAE,MAAM,EAAE,CAAA;IACb,8CAA8C;IAC9C,IAAI,CAAC,EAAE,MAAM,CAAA;IACb,MAAM,EAAE,gBAAgB,CAAC,CAAC,CAAC,CAAA;IAC3B,mEAAmE;IACnE,aAAa,CAAC,EAAE,MAAM,CAAA;CACvB;AAED,MAAM,WAAW,eAAe;IAC9B,CAAC,EAAE,MAAM,CAAA;IACT,SAAS,EAAE,MAAM,CAAA;IACjB,QAAQ,EAAE,MAAM,CAAA;IAChB,GAAG,EAAE,MAAM,CAAA;IACX,CAAC,EAAE,MAAM,CAAA;IACT,oCAAoC;IACpC,WAAW,EAAE,KAAK,CAAC;QAAE,UAAU,EAAE,MAAM,CAAC;QAAC,SAAS,EAAE,MAAM,CAAC;QAAC,MAAM,EAAE,MAAM,CAAC;QAAC,KAAK,EAAE,MAAM,CAAA;KAAE,CAAC,CAAA;CAC7F;AAED,MAAM,WAAW,eAAe;IAC9B,MAAM,EAAE,eAAe,EAAE,CAAA;IACzB;;;OAGG;IACH,UAAU,EAAE,MAAM,GAAG,IAAI,CAAA;IACzB;;;;OAIG;IACH,cAAc,EAAE,MAAM,CAAA;CACvB;AAED,wBAAsB,kBAAkB,CAAC,CAAC,SAAS;IAAE,UAAU,CAAC,EAAE,MAAM,CAAA;CAAE,EACxE,IAAI,EAAE,yBAAyB,CAAC,CAAC,CAAC,GACjC,OAAO,CAAC,eAAe,CAAC,CAwD1B;AAED,MAAM,WAAW,mBAAmB;IAClC,IAAI,EAAE,KAAK,CAAC;QACV,CAAC,EAAE,MAAM,CAAA;QACT,SAAS,EAAE,MAAM,CAAA;QACjB,IAAI,EAAE,MAAM,CAAA;QACZ,KAAK,EAAE,MAAM,CAAA;QACb,IAAI,EAAE,MAAM,CAAA;QACZ,KAAK,EAAE,MAAM,CAAA;KACd,CAAC,CAAA;IACF,SAAS,EAAE,MAAM,CAAA;IACjB,eAAe,EAAE,MAAM,GAAG,IAAI,CAAA;IAC9B,oDAAoD;IACpD,OAAO,EAAE,UAAU,GAAG,UAAU,GAAG,SAAS,CAAA;IAC5C,kCAAkC;IAClC,SAAS,EAAE,MAAM,CAAA;CAClB;AAED;;;;GAIG;AACH,wBAAgB,uBAAuB,CACrC,CAAC,EAAE,eAAe,EAClB,CAAC,EAAE,eAAe,EAClB,IAAI,GAAE;IAAE,UAAU,CAAC,EAAE,MAAM,CAAC;IAAC,kBAAkB,CAAC,EAAE,MAAM,CAAC;IAAC,IAAI,CAAC,EAAE,MAAM,CAAA;CAAO,GAC7E,mBAAmB,CA2CrB;AAED,uFAAuF;AACvF,wBAAgB,UAAU,CAAC,KAAK,EAAE,eAAe,EAAE,SAAS,SAAM,GAAG,MAAM,GAAG,IAAI,CAEjF"}
|
|
@@ -1 +0,0 @@
|
|
|
1
|
-
{"version":3,"file":"adversarial.d.ts","sourceRoot":"","sources":["../../src/rl/adversarial.ts"],"names":[],"mappings":"AAAA;;;;;;;;;;;;;;;;;;;;;;;GAuBG;AAEH,MAAM,WAAW,mBAAmB,CAAC,CAAC;IACpC,+DAA+D;IAC/D,EAAE,EAAE,MAAM,CAAA;IACV,2EAA2E;IAC3E,UAAU,EAAE,MAAM,CAAA;IAClB,yEAAyE;IACzE,QAAQ,EAAE,MAAM,GAAG,IAAI,CAAA;IACvB,QAAQ,EAAE,CAAC,CAAA;IACX,kEAAkE;IAClE,KAAK,EAAE,MAAM,GAAG,IAAI,CAAA;IACpB,6DAA6D;IAC7D,gBAAgB,EAAE,MAAM,GAAG,IAAI,CAAA;CAChC;AAED,MAAM,WAAW,mBAAmB,CAAC,CAAC;IACpC,EAAE,EAAE,MAAM,CAAA;IACV;;;OAGG;IACH,MAAM,CAAC,MAAM,EAAE,CAAC,EAAE,GAAG,EAAE,MAAM,MAAM,GAAG,OAAO,CAAC,CAAC,EAAE,CAAC,GAAG,CAAC,EAAE,CAAA;CACzD;AAED,MAAM,WAAW,wBAAwB,CAAC,CAAC;IACzC,uEAAuE;IACvE,KAAK,EAAE,CAAC,EAAE,CAAA;IACV,oCAAoC;IACpC,gBAAgB,EAAE,CAAC,CAAC,EAAE,CAAC,KAAK,MAAM,CAAA;IAClC,2BAA2B;IAC3B,SAAS,EAAE,mBAAmB,CAAC,CAAC,CAAC,EAAE,CAAA;IACnC;;;OAGG;IACH,OAAO,EAAE,CAAC,CAAC,EAAE,CAAC,KAAK,OAAO,CAAC,MAAM,CAAC,CAAA;IAClC;;;OAGG;IACH,gBAAgB,CAAC,EAAE,MAAM,CAAA;IACzB,4CAA4C;IAC5C,MAAM,CAAC,EAAE,MAAM,CAAA;IACf,gDAAgD;IAChD,iBAAiB,CAAC,EAAE,MAAM,CAAA;IAC1B,0DAA0D;IAC1D,MAAM,CAAC,EAAE,MAAM,CAAA;IACf,iDAAiD;IACjD,IAAI,CAAC,EAAE,MAAM,CAAA;CACd;AAED,MAAM,WAAW,uBAAuB,CAAC,CAAC;IACxC,SAAS,EAAE,mBAAmB,CAAC,CAAC,CAAC,EAAE,CAAA;IACnC,qDAAqD;IACrD,QAAQ,EAAE,mBAAmB,CAAC,CAAC,CAAC,EAAE,CAAA;IAClC,6BAA6B;IAC7B,YAAY,EAAE,KAAK,CAAC;QAAE,UAAU,EAAE,MAAM,CAAC;QAAC,KAAK,EAAE,MAAM,CAAC;QAAC,QAAQ,EAAE,MAAM,CAAC;QAAC,SAAS,EAAE,MAAM,CAAA;KAAE,CAAC,CAAA;IAC/F,0CAA0C;IAC1C,UAAU,EAAE,MAAM,CAAA;CACnB;AAED,wBAAsB,yBAAyB,CAAC,CAAC,EAC/C,IAAI,EAAE,wBAAwB,CAAC,CAAC,CAAC,GAChC,OAAO,CAAC,uBAAuB,CAAC,CAAC,CAAC,CAAC,CA2ErC"}
|
|
@@ -1,127 +0,0 @@
|
|
|
1
|
-
/**
|
|
2
|
-
* Test-time compute scaling curves.
|
|
3
|
-
*
|
|
4
|
-
* The test-time-compute frontier paper (Snell et al. 2024) and the
|
|
5
|
-
* subsequent o1-style scaling work both show that LLM-agent capability
|
|
6
|
-
* is a function of the compute budget at inference, not just of the
|
|
7
|
-
* training run. The right way to characterize a candidate is therefore
|
|
8
|
-
* a *curve* — score at compute budgets {1×, 4×, 16×, …} — not a single
|
|
9
|
-
* point.
|
|
10
|
-
*
|
|
11
|
-
* This module ships:
|
|
12
|
-
*
|
|
13
|
-
* 1. The compute-curve harness — `runComputeCurve(runner, budgets)` —
|
|
14
|
-
* that evaluates one candidate at a sequence of compute budgets
|
|
15
|
-
* and returns the (compute, score) curve.
|
|
16
|
-
* 2. A best-of-N evaluator — `bestOfN(runner, n, scoreFn)` — the
|
|
17
|
-
* simplest test-time-compute scaling primitive: sample N
|
|
18
|
-
* independent rollouts, return the best.
|
|
19
|
-
* 3. A self-consistency evaluator — `selfConsistency(runner, n)` —
|
|
20
|
-
* the majority-vote variant of best-of-N for tasks with a small
|
|
21
|
-
* categorical answer space.
|
|
22
|
-
* 4. Pareto-frontier extraction over multiple candidates — given
|
|
23
|
-
* (candidate, compute, score) tuples, return the set of
|
|
24
|
-
* candidate-compute combinations that aren't dominated.
|
|
25
|
-
*
|
|
26
|
-
* Caveat: "compute" here is the caller's notion of a compute unit. For
|
|
27
|
-
* agent eval that's typically wall-time × parallelism, or token budget,
|
|
28
|
-
* or LLM-call count. We accept whatever the caller provides; the curve
|
|
29
|
-
* is on whatever axis they pick.
|
|
30
|
-
*/
|
|
31
|
-
export interface ComputeCurveBudget {
|
|
32
|
-
/** Identifier — for the report. Common: '1x', '4x', '16x'. */
|
|
33
|
-
id: string;
|
|
34
|
-
/** Numeric value on the chosen axis (tokens, calls, USD, ms — caller picks). */
|
|
35
|
-
cost: number;
|
|
36
|
-
/** Free-form metadata (the caller can carry per-budget config). */
|
|
37
|
-
meta?: Record<string, unknown>;
|
|
38
|
-
}
|
|
39
|
-
export interface ComputeCurvePoint {
|
|
40
|
-
budgetId: string;
|
|
41
|
-
cost: number;
|
|
42
|
-
score: number;
|
|
43
|
-
/** Number of underlying samples used at this budget. */
|
|
44
|
-
samples: number;
|
|
45
|
-
/** Optional spread / variance information. */
|
|
46
|
-
std?: number;
|
|
47
|
-
/** Any extra metrics the runner returned. */
|
|
48
|
-
metrics?: Record<string, number>;
|
|
49
|
-
}
|
|
50
|
-
export interface ComputeCurve {
|
|
51
|
-
candidateId: string;
|
|
52
|
-
points: ComputeCurvePoint[];
|
|
53
|
-
/** Rough exponent fit: score ≈ a + b * log(cost). Useful for "how steep is the curve?" */
|
|
54
|
-
logSlope: number | null;
|
|
55
|
-
/** Best (highest-score) point on the curve. */
|
|
56
|
-
best: ComputeCurvePoint;
|
|
57
|
-
}
|
|
58
|
-
export interface RunComputeCurveOptions {
|
|
59
|
-
candidateId: string;
|
|
60
|
-
budgets: ComputeCurveBudget[];
|
|
61
|
-
/**
|
|
62
|
-
* Run the candidate at one budget. Returns the realized score plus
|
|
63
|
-
* optional spread + extra metrics.
|
|
64
|
-
*/
|
|
65
|
-
runAtBudget: (budget: ComputeCurveBudget) => Promise<{
|
|
66
|
-
score: number;
|
|
67
|
-
samples: number;
|
|
68
|
-
std?: number;
|
|
69
|
-
metrics?: Record<string, number>;
|
|
70
|
-
}>;
|
|
71
|
-
}
|
|
72
|
-
export declare function runComputeCurve(opts: RunComputeCurveOptions): Promise<ComputeCurve>;
|
|
73
|
-
export interface ComputeBestOfNOptions<O> {
|
|
74
|
-
/** Number of independent samples to draw. */
|
|
75
|
-
n: number;
|
|
76
|
-
/** Sampler — produces one rollout. */
|
|
77
|
-
sample: (sampleIdx: number) => Promise<O>;
|
|
78
|
-
/** Score one rollout. */
|
|
79
|
-
scoreFn: (rollout: O) => Promise<number> | number;
|
|
80
|
-
}
|
|
81
|
-
export interface ComputeBestOfNResult<O> {
|
|
82
|
-
best: O;
|
|
83
|
-
bestScore: number;
|
|
84
|
-
scores: number[];
|
|
85
|
-
meanScore: number;
|
|
86
|
-
/** Index of the best rollout, for diagnostics. */
|
|
87
|
-
bestIndex: number;
|
|
88
|
-
}
|
|
89
|
-
/** The simplest test-time scaling primitive. */
|
|
90
|
-
export declare function bestOfN<O>(opts: ComputeBestOfNOptions<O>): Promise<ComputeBestOfNResult<O>>;
|
|
91
|
-
export interface SelfConsistencyOptions<O> {
|
|
92
|
-
n: number;
|
|
93
|
-
sample: (sampleIdx: number) => Promise<O>;
|
|
94
|
-
/** Extract the canonical answer key (string) from a rollout. */
|
|
95
|
-
answerKey: (rollout: O) => string;
|
|
96
|
-
}
|
|
97
|
-
export interface SelfConsistencyResult<O> {
|
|
98
|
-
/** Modal answer (the majority vote). */
|
|
99
|
-
answer: string;
|
|
100
|
-
/** Fraction of samples voting for the modal answer in [0, 1]. */
|
|
101
|
-
agreement: number;
|
|
102
|
-
/** Histogram of all answers. */
|
|
103
|
-
histogram: Record<string, number>;
|
|
104
|
-
/** A representative rollout that voted for the modal answer. */
|
|
105
|
-
representative: O;
|
|
106
|
-
/** All rollouts. */
|
|
107
|
-
rollouts: O[];
|
|
108
|
-
}
|
|
109
|
-
/**
|
|
110
|
-
* Self-consistency / majority-vote test-time scaling. For tasks with a
|
|
111
|
-
* small categorical answer space (math problems, multiple choice).
|
|
112
|
-
*/
|
|
113
|
-
export declare function selfConsistency<O>(opts: SelfConsistencyOptions<O>): Promise<SelfConsistencyResult<O>>;
|
|
114
|
-
/**
|
|
115
|
-
* Pareto frontier over (candidate, compute, score) tuples. A point is on
|
|
116
|
-
* the frontier iff no other point dominates it in both score (higher
|
|
117
|
-
* better) and cost (lower better). Returns the frontier sorted ascending
|
|
118
|
-
* by cost.
|
|
119
|
-
*/
|
|
120
|
-
export interface ParetoPointInput {
|
|
121
|
-
candidateId: string;
|
|
122
|
-
budgetId: string;
|
|
123
|
-
cost: number;
|
|
124
|
-
score: number;
|
|
125
|
-
}
|
|
126
|
-
export declare function paretoFrontier(points: ParetoPointInput[]): ParetoPointInput[];
|
|
127
|
-
//# sourceMappingURL=compute-curves.d.ts.map
|
|
@@ -1 +0,0 @@
|
|
|
1
|
-
{"version":3,"file":"compute-curves.d.ts","sourceRoot":"","sources":["../../src/rl/compute-curves.ts"],"names":[],"mappings":"AAAA;;;;;;;;;;;;;;;;;;;;;;;;;;;;;GA6BG;AAIH,MAAM,WAAW,kBAAkB;IACjC,8DAA8D;IAC9D,EAAE,EAAE,MAAM,CAAA;IACV,gFAAgF;IAChF,IAAI,EAAE,MAAM,CAAA;IACZ,mEAAmE;IACnE,IAAI,CAAC,EAAE,MAAM,CAAC,MAAM,EAAE,OAAO,CAAC,CAAA;CAC/B;AAED,MAAM,WAAW,iBAAiB;IAChC,QAAQ,EAAE,MAAM,CAAA;IAChB,IAAI,EAAE,MAAM,CAAA;IACZ,KAAK,EAAE,MAAM,CAAA;IACb,wDAAwD;IACxD,OAAO,EAAE,MAAM,CAAA;IACf,8CAA8C;IAC9C,GAAG,CAAC,EAAE,MAAM,CAAA;IACZ,6CAA6C;IAC7C,OAAO,CAAC,EAAE,MAAM,CAAC,MAAM,EAAE,MAAM,CAAC,CAAA;CACjC;AAED,MAAM,WAAW,YAAY;IAC3B,WAAW,EAAE,MAAM,CAAA;IACnB,MAAM,EAAE,iBAAiB,EAAE,CAAA;IAC3B,0FAA0F;IAC1F,QAAQ,EAAE,MAAM,GAAG,IAAI,CAAA;IACvB,+CAA+C;IAC/C,IAAI,EAAE,iBAAiB,CAAA;CACxB;AAED,MAAM,WAAW,sBAAsB;IACrC,WAAW,EAAE,MAAM,CAAA;IACnB,OAAO,EAAE,kBAAkB,EAAE,CAAA;IAC7B;;;OAGG;IACH,WAAW,EAAE,CAAC,MAAM,EAAE,kBAAkB,KAAK,OAAO,CAAC;QACnD,KAAK,EAAE,MAAM,CAAA;QACb,OAAO,EAAE,MAAM,CAAA;QACf,GAAG,CAAC,EAAE,MAAM,CAAA;QACZ,OAAO,CAAC,EAAE,MAAM,CAAC,MAAM,EAAE,MAAM,CAAC,CAAA;KACjC,CAAC,CAAA;CACH;AAED,wBAAsB,eAAe,CAAC,IAAI,EAAE,sBAAsB,GAAG,OAAO,CAAC,YAAY,CAAC,CAiBzF;AAED,MAAM,WAAW,qBAAqB,CAAC,CAAC;IACtC,6CAA6C;IAC7C,CAAC,EAAE,MAAM,CAAA;IACT,sCAAsC;IACtC,MAAM,EAAE,CAAC,SAAS,EAAE,MAAM,KAAK,OAAO,CAAC,CAAC,CAAC,CAAA;IACzC,yBAAyB;IACzB,OAAO,EAAE,CAAC,OAAO,EAAE,CAAC,KAAK,OAAO,CAAC,MAAM,CAAC,GAAG,MAAM,CAAA;CAClD;AAED,MAAM,WAAW,oBAAoB,CAAC,CAAC;IACrC,IAAI,EAAE,CAAC,CAAA;IACP,SAAS,EAAE,MAAM,CAAA;IACjB,MAAM,EAAE,MAAM,EAAE,CAAA;IAChB,SAAS,EAAE,MAAM,CAAA;IACjB,kDAAkD;IAClD,SAAS,EAAE,MAAM,CAAA;CAClB;AAED,gDAAgD;AAChD,wBAAsB,OAAO,CAAC,CAAC,EAAE,IAAI,EAAE,qBAAqB,CAAC,CAAC,CAAC,GAAG,OAAO,CAAC,oBAAoB,CAAC,CAAC,CAAC,CAAC,CAmBjG;AAED,MAAM,WAAW,sBAAsB,CAAC,CAAC;IACvC,CAAC,EAAE,MAAM,CAAA;IACT,MAAM,EAAE,CAAC,SAAS,EAAE,MAAM,KAAK,OAAO,CAAC,CAAC,CAAC,CAAA;IACzC,gEAAgE;IAChE,SAAS,EAAE,CAAC,OAAO,EAAE,CAAC,KAAK,MAAM,CAAA;CAClC;AAED,MAAM,WAAW,qBAAqB,CAAC,CAAC;IACtC,wCAAwC;IACxC,MAAM,EAAE,MAAM,CAAA;IACd,iEAAiE;IACjE,SAAS,EAAE,MAAM,CAAA;IACjB,gCAAgC;IAChC,SAAS,EAAE,MAAM,CAAC,MAAM,EAAE,MAAM,CAAC,CAAA;IACjC,gEAAgE;IAChE,cAAc,EAAE,CAAC,CAAA;IACjB,oBAAoB;IACpB,QAAQ,EAAE,CAAC,EAAE,CAAA;CACd;AAED;;;GAGG;AACH,wBAAsB,eAAe,CAAC,CAAC,EACrC,IAAI,EAAE,sBAAsB,CAAC,CAAC,CAAC,GAC9B,OAAO,CAAC,qBAAqB,CAAC,CAAC,CAAC,CAAC,CA0BnC;AAED;;;;;GAKG;AACH,MAAM,WAAW,gBAAgB;IAC/B,WAAW,EAAE,MAAM,CAAA;IACnB,QAAQ,EAAE,MAAM,CAAA;IAChB,IAAI,EAAE,MAAM,CAAA;IACZ,KAAK,EAAE,MAAM,CAAA;CACd;AAED,wBAAgB,cAAc,CAAC,MAAM,EAAE,gBAAgB,EAAE,GAAG,gBAAgB,EAAE,CAU7E"}
|
|
@@ -1,117 +0,0 @@
|
|
|
1
|
-
/**
|
|
2
|
-
* Contamination probe — held-out perturbation tests.
|
|
3
|
-
*
|
|
4
|
-
* The bug class: once a benchmark scenario set is published, models train
|
|
5
|
-
* on it, and your scores become invalid. SWE-Bench-Verified, GPQA, and
|
|
6
|
-
* MMLU-Pro all exist because their predecessors got contaminated within
|
|
7
|
-
* months. The right defense is to keep a held-out *perturbed* version of
|
|
8
|
-
* every scenario — same task, slightly different surface — and check
|
|
9
|
-
* whether scores diverge significantly. Genuine capability transfers; rote
|
|
10
|
-
* memorization doesn't.
|
|
11
|
-
*
|
|
12
|
-
* This module ships the probe contract:
|
|
13
|
-
*
|
|
14
|
-
* 1. A `ScenarioPerturbation` strategy type — function that produces a
|
|
15
|
-
* perturbed scenario from an original.
|
|
16
|
-
* 2. `runContaminationProbe({ originals, perturbed, scoreFn })` — runs
|
|
17
|
-
* both halves and reports per-scenario score divergence + a global
|
|
18
|
-
* contamination verdict via paired Wilcoxon.
|
|
19
|
-
* 3. Several stock perturbations: `renameVariables`, `shuffleOrder`,
|
|
20
|
-
* `paraphrasePrompt`, `injectIrrelevantClause`. Each preserves the
|
|
21
|
-
* task's structural difficulty while breaking surface memorization.
|
|
22
|
-
*
|
|
23
|
-
* The verdict is conservative: if the perturbed-vs-original score
|
|
24
|
-
* difference is statistically significant (BH-adjusted p < 0.05) AND
|
|
25
|
-
* the median drop is > 5 percentage points, we flag *contamination
|
|
26
|
-
* suspected*. False positives are possible (the perturbation might
|
|
27
|
-
* actually be harder); the default is to flag for review, not to
|
|
28
|
-
* autoreject.
|
|
29
|
-
*/
|
|
30
|
-
export type ScenarioPerturbationKind = 'rename_variables' | 'shuffle_order' | 'paraphrase' | 'inject_irrelevant_clause' | 'custom';
|
|
31
|
-
export interface ScenarioPerturbation<S> {
|
|
32
|
-
kind: ScenarioPerturbationKind;
|
|
33
|
-
/** Apply to one scenario, return its perturbed sibling. */
|
|
34
|
-
apply: (scenario: S) => Promise<S> | S;
|
|
35
|
-
/** Optional id — for the report. */
|
|
36
|
-
id?: string;
|
|
37
|
-
}
|
|
38
|
-
export interface ContaminationProbeInput<S> {
|
|
39
|
-
/** Identity of every scenario. The probe's `runFingerprint` keys on these. */
|
|
40
|
-
scenarioId: (s: S) => string;
|
|
41
|
-
/** Original scenarios. */
|
|
42
|
-
originals: S[];
|
|
43
|
-
/**
|
|
44
|
-
* Either pre-computed perturbations (one per original, same order) OR a
|
|
45
|
-
* `perturbation` strategy that synthesizes them on the fly.
|
|
46
|
-
*/
|
|
47
|
-
perturbed?: S[];
|
|
48
|
-
perturbation?: ScenarioPerturbation<S>;
|
|
49
|
-
/**
|
|
50
|
-
* Run the policy/agent against one scenario and return a scalar score
|
|
51
|
-
* in [0, 1]. The probe doesn't care what the policy is — that's the
|
|
52
|
-
* caller's contract.
|
|
53
|
-
*/
|
|
54
|
-
scoreFn: (s: S) => Promise<number>;
|
|
55
|
-
}
|
|
56
|
-
export interface ContaminationProbeOptions {
|
|
57
|
-
/** Drop scores below this from the probe; treats partial failures separately. Default 0. */
|
|
58
|
-
scoreFloor?: number;
|
|
59
|
-
/**
|
|
60
|
-
* BH-FDR threshold for declaring contamination on each per-scenario
|
|
61
|
-
* delta. Default 0.05.
|
|
62
|
-
*/
|
|
63
|
-
fdr?: number;
|
|
64
|
-
/**
|
|
65
|
-
* Minimum median per-scenario drop to flag global contamination. Default
|
|
66
|
-
* 0.05 (5 percentage points). Smaller drops may be noise.
|
|
67
|
-
*/
|
|
68
|
-
minMedianDrop?: number;
|
|
69
|
-
}
|
|
70
|
-
export interface ContaminationProbeReport {
|
|
71
|
-
perScenario: Array<{
|
|
72
|
-
scenarioId: string;
|
|
73
|
-
originalScore: number;
|
|
74
|
-
perturbedScore: number;
|
|
75
|
-
delta: number;
|
|
76
|
-
/** Per-scenario q-value (single-test BH for a single scenario). Mainly for display. */
|
|
77
|
-
qValue: number;
|
|
78
|
-
}>;
|
|
79
|
-
/** Wilcoxon paired-test on the deltas. */
|
|
80
|
-
pairedTest: {
|
|
81
|
-
w: number;
|
|
82
|
-
p: number;
|
|
83
|
-
};
|
|
84
|
-
medianDelta: number;
|
|
85
|
-
meanDelta: number;
|
|
86
|
-
contaminationSuspected: boolean;
|
|
87
|
-
reason: string;
|
|
88
|
-
/** Number of scenarios processed. */
|
|
89
|
-
n: number;
|
|
90
|
-
}
|
|
91
|
-
export declare function runContaminationProbe<S>(input: ContaminationProbeInput<S>, opts?: ContaminationProbeOptions): Promise<ContaminationProbeReport>;
|
|
92
|
-
/**
|
|
93
|
-
* Identifier-rename perturbation for code/text scenarios. Replaces every
|
|
94
|
-
* occurrence of the listed identifiers with synthesized aliases. Use when
|
|
95
|
-
* the scenario's structural difficulty is independent of variable names
|
|
96
|
-
* (e.g. SWE-Bench-style coding tasks).
|
|
97
|
-
*/
|
|
98
|
-
export declare function renameVariables<S extends {
|
|
99
|
-
prompt: string;
|
|
100
|
-
}>(identifiers: string[], rename?: (name: string, idx: number) => string): ScenarioPerturbation<S>;
|
|
101
|
-
/**
|
|
102
|
-
* Order-shuffle perturbation. Reshuffles a list-shaped section of the
|
|
103
|
-
* prompt (for QA scenarios that present options A/B/C/D — answer depends
|
|
104
|
-
* on the option labels, not order). Caller provides the section extractor.
|
|
105
|
-
*/
|
|
106
|
-
export declare function shuffleOrder<S extends {
|
|
107
|
-
prompt: string;
|
|
108
|
-
}>(shuffleSection: (prompt: string, rng: () => number) => string, seed: number): ScenarioPerturbation<S>;
|
|
109
|
-
/**
|
|
110
|
-
* Inject-irrelevant-clause perturbation. Adds a benign sentence that
|
|
111
|
-
* shouldn't change the answer. Tests for "did the model just memorize
|
|
112
|
-
* the input string."
|
|
113
|
-
*/
|
|
114
|
-
export declare function injectIrrelevantClause<S extends {
|
|
115
|
-
prompt: string;
|
|
116
|
-
}>(clause: string, position?: 'prefix' | 'suffix'): ScenarioPerturbation<S>;
|
|
117
|
-
//# sourceMappingURL=contamination.d.ts.map
|
|
@@ -1 +0,0 @@
|
|
|
1
|
-
{"version":3,"file":"contamination.d.ts","sourceRoot":"","sources":["../../src/rl/contamination.ts"],"names":[],"mappings":"AAAA;;;;;;;;;;;;;;;;;;;;;;;;;;;;GA4BG;AAKH,MAAM,MAAM,wBAAwB,GAChC,kBAAkB,GAClB,eAAe,GACf,YAAY,GACZ,0BAA0B,GAC1B,QAAQ,CAAA;AAEZ,MAAM,WAAW,oBAAoB,CAAC,CAAC;IACrC,IAAI,EAAE,wBAAwB,CAAA;IAC9B,2DAA2D;IAC3D,KAAK,EAAE,CAAC,QAAQ,EAAE,CAAC,KAAK,OAAO,CAAC,CAAC,CAAC,GAAG,CAAC,CAAA;IACtC,oCAAoC;IACpC,EAAE,CAAC,EAAE,MAAM,CAAA;CACZ;AAED,MAAM,WAAW,uBAAuB,CAAC,CAAC;IACxC,8EAA8E;IAC9E,UAAU,EAAE,CAAC,CAAC,EAAE,CAAC,KAAK,MAAM,CAAA;IAC5B,0BAA0B;IAC1B,SAAS,EAAE,CAAC,EAAE,CAAA;IACd;;;OAGG;IACH,SAAS,CAAC,EAAE,CAAC,EAAE,CAAA;IACf,YAAY,CAAC,EAAE,oBAAoB,CAAC,CAAC,CAAC,CAAA;IACtC;;;;OAIG;IACH,OAAO,EAAE,CAAC,CAAC,EAAE,CAAC,KAAK,OAAO,CAAC,MAAM,CAAC,CAAA;CACnC;AAED,MAAM,WAAW,yBAAyB;IACxC,4FAA4F;IAC5F,UAAU,CAAC,EAAE,MAAM,CAAA;IACnB;;;OAGG;IACH,GAAG,CAAC,EAAE,MAAM,CAAA;IACZ;;;OAGG;IACH,aAAa,CAAC,EAAE,MAAM,CAAA;CACvB;AAED,MAAM,WAAW,wBAAwB;IACvC,WAAW,EAAE,KAAK,CAAC;QACjB,UAAU,EAAE,MAAM,CAAA;QAClB,aAAa,EAAE,MAAM,CAAA;QACrB,cAAc,EAAE,MAAM,CAAA;QACtB,KAAK,EAAE,MAAM,CAAA;QACb,uFAAuF;QACvF,MAAM,EAAE,MAAM,CAAA;KACf,CAAC,CAAA;IACF,0CAA0C;IAC1C,UAAU,EAAE;QAAE,CAAC,EAAE,MAAM,CAAC;QAAC,CAAC,EAAE,MAAM,CAAA;KAAE,CAAA;IACpC,WAAW,EAAE,MAAM,CAAA;IACnB,SAAS,EAAE,MAAM,CAAA;IACjB,sBAAsB,EAAE,OAAO,CAAA;IAC/B,MAAM,EAAE,MAAM,CAAA;IACd,qCAAqC;IACrC,CAAC,EAAE,MAAM,CAAA;CACV;AAED,wBAAsB,qBAAqB,CAAC,CAAC,EAC3C,KAAK,EAAE,uBAAuB,CAAC,CAAC,CAAC,EACjC,IAAI,GAAE,yBAA8B,GACnC,OAAO,CAAC,wBAAwB,CAAC,CAgFnC;AAID;;;;;GAKG;AACH,wBAAgB,eAAe,CAAC,CAAC,SAAS;IAAE,MAAM,EAAE,MAAM,CAAA;CAAE,EAC1D,WAAW,EAAE,MAAM,EAAE,EACrB,MAAM,GAAE,CAAC,IAAI,EAAE,MAAM,EAAE,GAAG,EAAE,MAAM,KAAK,MAAyD,GAC/F,oBAAoB,CAAC,CAAC,CAAC,CAazB;AAED;;;;GAIG;AACH,wBAAgB,YAAY,CAAC,CAAC,SAAS;IAAE,MAAM,EAAE,MAAM,CAAA;CAAE,EACvD,cAAc,EAAE,CAAC,MAAM,EAAE,MAAM,EAAE,GAAG,EAAE,MAAM,MAAM,KAAK,MAAM,EAC7D,IAAI,EAAE,MAAM,GACX,oBAAoB,CAAC,CAAC,CAAC,CAgBzB;AAED;;;;GAIG;AACH,wBAAgB,sBAAsB,CAAC,CAAC,SAAS;IAAE,MAAM,EAAE,MAAM,CAAA;CAAE,EACjE,MAAM,EAAE,MAAM,EACd,QAAQ,GAAE,QAAQ,GAAG,QAAmB,GACvC,oBAAoB,CAAC,CAAC,CAAC,CASzB"}
|
package/dist/rl/corpus.d.ts
DELETED
|
@@ -1,55 +0,0 @@
|
|
|
1
|
-
/**
|
|
2
|
-
* RL corpus — the durable, append-only accumulation of graded RunRecords that
|
|
3
|
-
* every eval run deposits BY DEFAULT.
|
|
4
|
-
*
|
|
5
|
-
* The dataset is the free exhaust of the normal eval process: we run evals
|
|
6
|
-
* constantly to get an agent production-ready, and those runs already produce
|
|
7
|
-
* graded trajectories. Instead of writing them to an ephemeral run dir and
|
|
8
|
-
* throwing them away, `appendToCorpus` accumulates them into a durable corpus;
|
|
9
|
-
* `buildDatasetFromCorpus` later harvests the whole corpus into a publishable
|
|
10
|
-
* bundle. No separate data-collection campaign — the data accrues from work we
|
|
11
|
-
* do anyway. This is the "best things for free by our process" layer.
|
|
12
|
-
*
|
|
13
|
-
* Trajectory text rides on the record as top-level `prompt` / `completion`
|
|
14
|
-
* (what the eval harnesses capture; the RunRecord validator ignores the extra
|
|
15
|
-
* keys). The harvest reads them directly — no trace store round-trip needed.
|
|
16
|
-
*/
|
|
17
|
-
import type { RunRecord } from '../run-record';
|
|
18
|
-
import { type RlDatasetBundle, type RlDatasetConfig } from './dataset';
|
|
19
|
-
/** A corpus record is a RunRecord carrying the trajectory text the harness
|
|
20
|
-
* captured. `prompt`/`completion` are top-level (the validator ignores extras). */
|
|
21
|
-
export type CorpusRecord = RunRecord & {
|
|
22
|
-
prompt?: string;
|
|
23
|
-
completion?: string;
|
|
24
|
-
};
|
|
25
|
-
export interface CorpusAppendResult {
|
|
26
|
-
appended: number;
|
|
27
|
-
/** Skipped because a record with the same runId was already in the corpus
|
|
28
|
-
* (idempotent appends — NOT re-run collapsing; re-runs get fresh runIds). */
|
|
29
|
-
skipped: number;
|
|
30
|
-
total: number;
|
|
31
|
-
}
|
|
32
|
-
/**
|
|
33
|
-
* Append graded records to the corpus (append-only JSONL). Deduplicates by
|
|
34
|
-
* `runId` against what's already on disk so re-running the same harness is
|
|
35
|
-
* idempotent. Creates the file and parent dir. This is the call every eval
|
|
36
|
-
* harness makes by default after producing its records.
|
|
37
|
-
*/
|
|
38
|
-
export declare function appendToCorpus(records: CorpusRecord[], corpusPath: string): CorpusAppendResult;
|
|
39
|
-
/** Read the full corpus. Returns [] if the corpus does not exist yet. */
|
|
40
|
-
export declare function readCorpus(corpusPath: string): CorpusRecord[];
|
|
41
|
-
export interface HarvestOptions {
|
|
42
|
-
/** Keep only records scoring >= this (rejection-sampling for SFT). */
|
|
43
|
-
minScore?: number;
|
|
44
|
-
/** Keep only these splits (e.g. ['holdout'] for an eval-only dataset). */
|
|
45
|
-
splits?: RunRecord['splitTag'][];
|
|
46
|
-
}
|
|
47
|
-
/**
|
|
48
|
-
* Harvest the accumulated corpus into a publishable RL dataset bundle. Reads
|
|
49
|
-
* trajectory text from each record's top-level `prompt`/`completion`; records
|
|
50
|
-
* missing either are excluded (a graded score with no trajectory can't train).
|
|
51
|
-
* Optionally filters by score / split. Throws (via buildRlDataset) if nothing
|
|
52
|
-
* survives — an empty dataset must never be published.
|
|
53
|
-
*/
|
|
54
|
-
export declare function buildDatasetFromCorpus(corpusPath: string, config: RlDatasetConfig, opts?: HarvestOptions): Promise<RlDatasetBundle>;
|
|
55
|
-
//# sourceMappingURL=corpus.d.ts.map
|
package/dist/rl/corpus.d.ts.map
DELETED
|
@@ -1 +0,0 @@
|
|
|
1
|
-
{"version":3,"file":"corpus.d.ts","sourceRoot":"","sources":["../../src/rl/corpus.ts"],"names":[],"mappings":"AAAA;;;;;;;;;;;;;;;GAeG;AAIH,OAAO,KAAK,EAAE,SAAS,EAAE,MAAM,eAAe,CAAA;AAC9C,OAAO,EAAkB,KAAK,eAAe,EAAE,KAAK,eAAe,EAAE,MAAM,WAAW,CAAA;AAEtF;oFACoF;AACpF,MAAM,MAAM,YAAY,GAAG,SAAS,GAAG;IAAE,MAAM,CAAC,EAAE,MAAM,CAAC;IAAC,UAAU,CAAC,EAAE,MAAM,CAAA;CAAE,CAAA;AAE/E,MAAM,WAAW,kBAAkB;IACjC,QAAQ,EAAE,MAAM,CAAA;IAChB;kFAC8E;IAC9E,OAAO,EAAE,MAAM,CAAA;IACf,KAAK,EAAE,MAAM,CAAA;CACd;AAED;;;;;GAKG;AACH,wBAAgB,cAAc,CAAC,OAAO,EAAE,YAAY,EAAE,EAAE,UAAU,EAAE,MAAM,GAAG,kBAAkB,CAkB9F;AAED,yEAAyE;AACzE,wBAAgB,UAAU,CAAC,UAAU,EAAE,MAAM,GAAG,YAAY,EAAE,CAO7D;AAOD,MAAM,WAAW,cAAc;IAC7B,sEAAsE;IACtE,QAAQ,CAAC,EAAE,MAAM,CAAA;IACjB,0EAA0E;IAC1E,MAAM,CAAC,EAAE,SAAS,CAAC,UAAU,CAAC,EAAE,CAAA;CACjC;AAED;;;;;;GAMG;AACH,wBAAsB,sBAAsB,CAC1C,UAAU,EAAE,MAAM,EAClB,MAAM,EAAE,eAAe,EACvB,IAAI,GAAE,cAAmB,GACxB,OAAO,CAAC,eAAe,CAAC,CAe1B"}
|
package/dist/rl/corpus.test.d.ts
DELETED
|
@@ -1 +0,0 @@
|
|
|
1
|
-
{"version":3,"file":"corpus.test.d.ts","sourceRoot":"","sources":["../../src/rl/corpus.test.ts"],"names":[],"mappings":""}
|
package/dist/rl/dataset.d.ts
DELETED
|
@@ -1,102 +0,0 @@
|
|
|
1
|
-
/**
|
|
2
|
-
* RL dataset packaging + datasheet — the publishable, sellable bundle.
|
|
3
|
-
*
|
|
4
|
-
* The format exporters (`toGrpoRows` / `toSftRows` / `toDpoRows`) already
|
|
5
|
-
* produce trainer-ready shapes (prime-rl GRPO, TRL DPO, conversational SFT).
|
|
6
|
-
* What turns that into a dataset someone can PUBLISH or BUY is the provenance
|
|
7
|
-
* + a datasheet: which models produced it, which prompt/agent versions, how the
|
|
8
|
-
* reward was derived (deterministic verifiable vs probabilistic judge — the
|
|
9
|
-
* credibility axis a buyer checks first), the split discipline, the reward
|
|
10
|
-
* distribution, the quality gates, the license, and the intended/out-of-scope
|
|
11
|
-
* uses. This module computes those facts from the `RunRecord[]` and renders a
|
|
12
|
-
* "Datasheet for Datasets" (Gebru et al. 2018) card alongside the format files.
|
|
13
|
-
*
|
|
14
|
-
* It composes the existing `rl/exporters` — it does not reimplement any trainer
|
|
15
|
-
* format. The renderers token-identity step (DeepSeek/Kimi/Qwen tokenization
|
|
16
|
-
* with per-token loss masks) is a downstream Python stage that consumes the
|
|
17
|
-
* `messages`/`completions` this bundle emits.
|
|
18
|
-
*/
|
|
19
|
-
import type { RunRecord, RunSplitTag } from '../run-record';
|
|
20
|
-
import { type DpoLookups, type GrpoLookups, type SftLookups } from './exporters';
|
|
21
|
-
import type { PreferenceTriple } from './preferences';
|
|
22
|
-
export type RewardKind = 'deterministic' | 'probabilistic' | 'mixed';
|
|
23
|
-
export type DatasetFormat = 'grpo' | 'sft' | 'dpo';
|
|
24
|
-
/** Caller-declared context — the qualitative half of the datasheet that can't
|
|
25
|
-
* be computed from records. */
|
|
26
|
-
export interface RlDatasetConfig {
|
|
27
|
-
name: string;
|
|
28
|
-
version: string;
|
|
29
|
-
/** Product/task domain, e.g. 'legal-m&a', 'tax-1040'. */
|
|
30
|
-
domain: string;
|
|
31
|
-
/** SPDX id or a named commercial license. Required — an unlicensed dataset
|
|
32
|
-
* cannot be published or sold. */
|
|
33
|
-
license: string;
|
|
34
|
-
/** How the reward was produced. `kind: 'deterministic'` (a test/schema/XPath
|
|
35
|
-
* decided it) is the credibility signal; 'probabilistic' = LLM-judge. */
|
|
36
|
-
reward: {
|
|
37
|
-
kind: RewardKind;
|
|
38
|
-
source: string;
|
|
39
|
-
description: string;
|
|
40
|
-
};
|
|
41
|
-
intendedUse: string;
|
|
42
|
-
outOfScope: string;
|
|
43
|
-
limitations: string;
|
|
44
|
-
/** ISO timestamp — passed in (the substrate forbids Date.now()). */
|
|
45
|
-
createdAtIso: string;
|
|
46
|
-
/** Default: ['grpo', 'sft']. */
|
|
47
|
-
formats?: DatasetFormat[];
|
|
48
|
-
/** Quality gates already run, recorded on the card for the buyer. */
|
|
49
|
-
qualityGates?: {
|
|
50
|
-
contaminationProbe?: 'passed' | 'failed' | 'not-run';
|
|
51
|
-
dedup?: boolean;
|
|
52
|
-
verifiableRewardFilter?: boolean;
|
|
53
|
-
};
|
|
54
|
-
}
|
|
55
|
-
export interface RewardStats {
|
|
56
|
-
n: number;
|
|
57
|
-
mean: number;
|
|
58
|
-
median: number;
|
|
59
|
-
min: number;
|
|
60
|
-
max: number;
|
|
61
|
-
std: number;
|
|
62
|
-
}
|
|
63
|
-
export interface RlDatasetStats {
|
|
64
|
-
records: number;
|
|
65
|
-
/** Record count per split — a publishable dataset must declare its holdout. */
|
|
66
|
-
splits: Record<RunSplitTag, number>;
|
|
67
|
-
reward: RewardStats;
|
|
68
|
-
/** Distinct snapshot-pinned models that produced the trajectories. */
|
|
69
|
-
models: string[];
|
|
70
|
-
/** Distinct effective-prompt hashes (the agent profile/prompt versions). */
|
|
71
|
-
promptHashes: string[];
|
|
72
|
-
commitShas: string[];
|
|
73
|
-
totalTokens: {
|
|
74
|
-
input: number;
|
|
75
|
-
output: number;
|
|
76
|
-
};
|
|
77
|
-
totalCostUsd: number;
|
|
78
|
-
}
|
|
79
|
-
export interface RlDatasetManifest extends RlDatasetConfig {
|
|
80
|
-
formats: DatasetFormat[];
|
|
81
|
-
rowCounts: Partial<Record<DatasetFormat, number>>;
|
|
82
|
-
stats: RlDatasetStats;
|
|
83
|
-
}
|
|
84
|
-
export interface RlDatasetBundle {
|
|
85
|
-
manifest: RlDatasetManifest;
|
|
86
|
-
/** Relative filename -> contents. Write these to a directory to publish. */
|
|
87
|
-
files: Record<string, string>;
|
|
88
|
-
}
|
|
89
|
-
/**
|
|
90
|
-
* Package graded `RunRecord[]` into a publishable RL dataset bundle: the
|
|
91
|
-
* trainer-format JSONL files + a manifest + a datasheet. DPO requires
|
|
92
|
-
* pre-extracted preference triples (pass `preferences`); GRPO/SFT derive from
|
|
93
|
-
* the records directly via the supplied lookups. Throws on an empty corpus —
|
|
94
|
-
* an empty dataset must never be published.
|
|
95
|
-
*/
|
|
96
|
-
export declare function buildRlDataset(records: RunRecord[], lookups: GrpoLookups & SftLookups, config: RlDatasetConfig, preferences?: {
|
|
97
|
-
triples: PreferenceTriple[];
|
|
98
|
-
lookups: DpoLookups;
|
|
99
|
-
}): Promise<RlDatasetBundle>;
|
|
100
|
-
/** Render the "Datasheet for Datasets" card — the artifact a buyer reads. */
|
|
101
|
-
export declare function datasheetToMarkdown(m: RlDatasetManifest): string;
|
|
102
|
-
//# sourceMappingURL=dataset.d.ts.map
|