@tangle-network/agent-eval 0.95.0 → 0.96.0
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/CHANGELOG.md +17 -0
- package/dist/adapters/http.d.ts +17 -10
- package/dist/adapters/langchain.d.ts +14 -7
- package/dist/adapters/otel.d.ts +25 -13
- package/dist/{rl/adversarial.d.ts → adversarial-DIVcDoI_.d.ts} +7 -6
- package/dist/analyst/index.d.ts +236 -28
- package/dist/analyst/index.js +1 -1
- package/dist/{trace-analyst/analyst.d.ts → analyst-C8HHvfJp.d.ts} +14 -12
- package/dist/{contract/analyze-runs.d.ts → analyze-runs-DtT6F_6T.d.ts} +10 -9
- package/dist/authenticity/index.d.ts +16 -15
- package/dist/{baseline.d.ts → baseline-Bbid3WoO.d.ts} +44 -8
- package/dist/belief-state/index.d.ts +605 -14
- package/dist/benchmarks/index.d.ts +5 -23
- package/dist/builder-eval/index.d.ts +250 -5
- package/dist/calibration-BPmzuVPk.d.ts +101 -0
- package/dist/campaign/index.d.ts +1452 -38
- package/dist/{chunk-AQ5WQAIV.js → chunk-3NHEO6ZC.js} +2 -2
- package/dist/chunk-3NHEO6ZC.js.map +1 -0
- package/dist/cli.d.ts +0 -2
- package/dist/{contract/intake/code-agent-session.d.ts → code-agent-session-CPHRCb4-.d.ts} +17 -15
- package/dist/contract/index.d.ts +824 -107
- package/dist/contract/index.js +145 -1
- package/dist/contract/index.js.map +1 -1
- package/dist/control-Doncu-B_.d.ts +259 -0
- package/dist/{control-runtime.d.ts → control-runtime-Acf9CGhw.d.ts} +26 -23
- package/dist/control.d.ts +10 -11
- package/dist/corpus-D4YW9UoJ.d.ts +560 -0
- package/dist/{cost-ledger.d.ts → cost-ledger-DuSqlw5B.d.ts} +11 -10
- package/dist/{counterfactual.d.ts → counterfactual-DlOz8PBx.d.ts} +13 -12
- package/dist/{dataset.d.ts → dataset-BbGkaN2I.d.ts} +14 -11
- package/dist/{analyst/registry.d.ts → default-registry-GyE8X5SP.d.ts} +37 -8
- package/dist/diagnose.d.ts +252 -1
- package/dist/{trace/emitter.d.ts → emitter-C2rqGH_l.d.ts} +12 -9
- package/dist/{errors.d.ts → errors-CzMUYo7b.d.ts} +11 -10
- package/dist/failure-cluster-DH9Flgcf.d.ts +76 -0
- package/dist/{feedback-trajectory.d.ts → feedback-trajectory-BxY0cKfs.d.ts} +38 -36
- package/dist/fuzz.d.ts +547 -1
- package/dist/gepa-Dprxvz8r.d.ts +414 -0
- package/dist/governance/index.d.ts +135 -5
- package/dist/harness-optimizer-mOl9XX_O.d.ts +106 -0
- package/dist/hosted/index.d.ts +239 -10
- package/dist/index-_Y4oNOOb.d.ts +159 -0
- package/dist/index.d.ts +5660 -277
- package/dist/index.js +1 -1
- package/dist/{contract/insight-report.d.ts → insight-report-BnRjTibG.d.ts} +19 -16
- package/dist/{trace/integrity.d.ts → integrity-D2t12mMw.d.ts} +14 -11
- package/dist/{judge-calibration.d.ts → judge-calibration-0p2QcWNE.d.ts} +17 -16
- package/dist/{analyst/kind-factory.d.ts → kind-factory-X3eDYbKn.d.ts} +61 -10
- package/dist/knowledge/index.d.ts +103 -3
- package/dist/{llm-client.d.ts → llm-client-Bj7g0rqu.d.ts} +23 -21
- package/dist/matrix/index.d.ts +30 -12
- package/dist/meta-eval/index.d.ts +182 -6
- package/dist/{multi-layer-verifier.d.ts → multi-layer-verifier-DUZXrPDA.d.ts} +15 -12
- package/dist/multishot/index.d.ts +290 -7
- package/dist/{rl/off-policy.d.ts → off-policy-DiwuKKg7.d.ts} +9 -8
- package/dist/openapi.json +1 -1
- package/dist/{meta-eval/outcome-store.d.ts → outcome-store-rnXLEqSn.d.ts} +8 -7
- package/dist/{pareto.d.ts → pareto-E-pembql.d.ts} +10 -9
- package/dist/perf/index.d.ts +119 -13
- package/dist/pipelines/index.d.ts +173 -8
- package/dist/pre-registration-nfUdc9EQ.d.ts +483 -0
- package/dist/prm/index.d.ts +104 -5
- package/dist/provenance-CIxfBnkl.d.ts +426 -0
- package/dist/query-B7GGjRox.d.ts +32 -0
- package/dist/{trace/raw-provider-sink.d.ts → raw-provider-sink-C46HDghv.d.ts} +14 -13
- package/dist/{red-team.d.ts → red-team-BWdoyleI.d.ts} +16 -14
- package/dist/{trace/redact.d.ts → redact-B40YG2M_.d.ts} +8 -7
- package/dist/release-report-pidWUMZ2.d.ts +233 -0
- package/dist/reporting.d.ts +16 -15
- package/dist/{eval-campaign.d.ts → researcher-Jr8ME1dZ.d.ts} +156 -34
- package/dist/rl.d.ts +1193 -1
- package/dist/{prm/rubric.d.ts → rubric-Cc6UHvUb.d.ts} +13 -10
- package/dist/{meta-eval/rubric-predictive-validity.d.ts → rubric-predictive-validity-C2hDKM8Z.d.ts} +11 -8
- package/dist/run-critic-CmMf05uV.d.ts +56 -0
- package/dist/{run-record.d.ts → run-record-CP2ObebC.d.ts} +117 -15
- package/dist/runtime-trajectory-BOUUjI0y.d.ts +49 -0
- package/dist/{trace/schema.d.ts → schema-m0gsnbt3.d.ts} +30 -29
- package/dist/semantic-concept-judge-DSBB2Cfp.d.ts +624 -0
- package/dist/{sequential.d.ts → sequential-5iSVfzl2.d.ts} +10 -9
- package/dist/{series-convergence.d.ts → series-convergence-D5OWMBg6.d.ts} +5 -4
- package/dist/sink-fetch-B1Yg4Til.d.ts +101 -0
- package/dist/{statistics.d.ts → statistics-CCJpTGOS.d.ts} +48 -46
- package/dist/{trace/store.d.ts → store-BcFXE6LG.d.ts} +12 -21
- package/dist/{trace-analyst/types.d.ts → store-C1YxJDEK.d.ts} +74 -18
- package/dist/storyboard/index.d.ts +81 -16
- package/dist/{summary-report.d.ts → summary-report-CInXwsza.d.ts} +160 -23
- package/dist/telemetry/{sink-file.d.ts → file.d.ts} +7 -5
- package/dist/telemetry/index.d.ts +35 -17
- package/dist/{sandbox-harness.d.ts → test-graded-scenario-DeODGLra.d.ts} +60 -15
- package/dist/{locked-jsonl-appender.d.ts → testing-C21CHsq2.d.ts} +4 -3
- package/dist/testing.d.ts +1 -5
- package/dist/traces.d.ts +976 -4
- package/dist/{trajectory.d.ts → trajectory-2TkpSEVh.d.ts} +9 -8
- package/dist/{analyst/types.d.ts → types-B5x54y6n.d.ts} +112 -19
- package/dist/{campaign/types.d.ts → types-BMahhhio.d.ts} +47 -44
- package/dist/{matrix/types.d.ts → types-BUxNaJ8c.d.ts} +11 -9
- package/dist/{types.d.ts → types-C7DGg5ex.d.ts} +33 -31
- package/dist/{verdict.d.ts → verdict-C9MlYujm.d.ts} +3 -2
- package/dist/wire/index.d.ts +570 -13
- package/dist/workflow/index.d.ts +496 -22
- package/package.json +2 -2
- package/dist/action-policy.d.ts +0 -24
- package/dist/action-policy.d.ts.map +0 -1
- package/dist/action-policy.test.d.ts +0 -2
- package/dist/action-policy.test.d.ts.map +0 -1
- package/dist/active-learning.d.ts +0 -41
- package/dist/active-learning.d.ts.map +0 -1
- package/dist/adapters/http.d.ts.map +0 -1
- package/dist/adapters/langchain.d.ts.map +0 -1
- package/dist/adapters/otel.d.ts.map +0 -1
- package/dist/agent-profile-cell.d.ts +0 -101
- package/dist/agent-profile-cell.d.ts.map +0 -1
- package/dist/agent-profile.d.ts +0 -27
- package/dist/agent-profile.d.ts.map +0 -1
- package/dist/agent-profile.test.d.ts +0 -2
- package/dist/agent-profile.test.d.ts.map +0 -1
- package/dist/analyst/adapters.d.ts +0 -62
- package/dist/analyst/adapters.d.ts.map +0 -1
- package/dist/analyst/analyst.test.d.ts +0 -2
- package/dist/analyst/analyst.test.d.ts.map +0 -1
- package/dist/analyst/ax-service.d.ts +0 -27
- package/dist/analyst/ax-service.d.ts.map +0 -1
- package/dist/analyst/behavioral-analyst.d.ts +0 -28
- package/dist/analyst/behavioral-analyst.d.ts.map +0 -1
- package/dist/analyst/chat-client.d.ts +0 -91
- package/dist/analyst/chat-client.d.ts.map +0 -1
- package/dist/analyst/default-registry.d.ts +0 -27
- package/dist/analyst/default-registry.d.ts.map +0 -1
- package/dist/analyst/default-registry.test.d.ts +0 -2
- package/dist/analyst/default-registry.test.d.ts.map +0 -1
- package/dist/analyst/finding-signature.d.ts +0 -48
- package/dist/analyst/finding-signature.d.ts.map +0 -1
- package/dist/analyst/finding-subject.d.ts +0 -146
- package/dist/analyst/finding-subject.d.ts.map +0 -1
- package/dist/analyst/finding-subject.test.d.ts +0 -2
- package/dist/analyst/finding-subject.test.d.ts.map +0 -1
- package/dist/analyst/findings-store.d.ts +0 -75
- package/dist/analyst/findings-store.d.ts.map +0 -1
- package/dist/analyst/index.d.ts.map +0 -1
- package/dist/analyst/kind-factory.d.ts.map +0 -1
- package/dist/analyst/kinds/failure-mode.d.ts +0 -19
- package/dist/analyst/kinds/failure-mode.d.ts.map +0 -1
- package/dist/analyst/kinds/improvement.d.ts +0 -23
- package/dist/analyst/kinds/improvement.d.ts.map +0 -1
- package/dist/analyst/kinds/index.d.ts +0 -22
- package/dist/analyst/kinds/index.d.ts.map +0 -1
- package/dist/analyst/kinds/kinds.test.d.ts +0 -2
- package/dist/analyst/kinds/kinds.test.d.ts.map +0 -1
- package/dist/analyst/kinds/knowledge-gap.d.ts +0 -28
- package/dist/analyst/kinds/knowledge-gap.d.ts.map +0 -1
- package/dist/analyst/kinds/knowledge-poisoning.d.ts +0 -22
- package/dist/analyst/kinds/knowledge-poisoning.d.ts.map +0 -1
- package/dist/analyst/kinds/skill-usage.d.ts +0 -84
- package/dist/analyst/kinds/skill-usage.d.ts.map +0 -1
- package/dist/analyst/kinds/skill-usage.test.d.ts +0 -2
- package/dist/analyst/kinds/skill-usage.test.d.ts.map +0 -1
- package/dist/analyst/parse-tolerant.d.ts +0 -26
- package/dist/analyst/parse-tolerant.d.ts.map +0 -1
- package/dist/analyst/parse-tolerant.test.d.ts +0 -2
- package/dist/analyst/parse-tolerant.test.d.ts.map +0 -1
- package/dist/analyst/registry.budget.test.d.ts +0 -2
- package/dist/analyst/registry.budget.test.d.ts.map +0 -1
- package/dist/analyst/registry.d.ts.map +0 -1
- package/dist/analyst/steer-firewall.d.ts +0 -35
- package/dist/analyst/steer-firewall.d.ts.map +0 -1
- package/dist/analyst/steer-firewall.test.d.ts +0 -2
- package/dist/analyst/steer-firewall.test.d.ts.map +0 -1
- package/dist/analyst/structure-findings.d.ts +0 -37
- package/dist/analyst/structure-findings.d.ts.map +0 -1
- package/dist/analyst/structure-findings.test.d.ts +0 -2
- package/dist/analyst/structure-findings.test.d.ts.map +0 -1
- package/dist/analyst/tool-groups.d.ts +0 -34
- package/dist/analyst/tool-groups.d.ts.map +0 -1
- package/dist/analyst/types.d.ts.map +0 -1
- package/dist/anti-slop.d.ts +0 -59
- package/dist/anti-slop.d.ts.map +0 -1
- package/dist/artifact-validator.d.ts +0 -74
- package/dist/artifact-validator.d.ts.map +0 -1
- package/dist/attestation.d.ts +0 -63
- package/dist/attestation.d.ts.map +0 -1
- package/dist/attestation.test.d.ts +0 -2
- package/dist/attestation.test.d.ts.map +0 -1
- package/dist/authenticity/index.d.ts.map +0 -1
- package/dist/authenticity/index.test.d.ts +0 -2
- package/dist/authenticity/index.test.d.ts.map +0 -1
- package/dist/auto-pr.d.ts +0 -120
- package/dist/auto-pr.d.ts.map +0 -1
- package/dist/baseline.d.ts.map +0 -1
- package/dist/behavior-dsl.d.ts +0 -73
- package/dist/behavior-dsl.d.ts.map +0 -1
- package/dist/belief-state/calibration.d.ts +0 -10
- package/dist/belief-state/calibration.d.ts.map +0 -1
- package/dist/belief-state/calibration.test.d.ts +0 -2
- package/dist/belief-state/calibration.test.d.ts.map +0 -1
- package/dist/belief-state/code-agent-corpus.d.ts +0 -66
- package/dist/belief-state/code-agent-corpus.d.ts.map +0 -1
- package/dist/belief-state/code-agent-corpus.test.d.ts +0 -2
- package/dist/belief-state/code-agent-corpus.test.d.ts.map +0 -1
- package/dist/belief-state/code-agent-evidence.d.ts +0 -22
- package/dist/belief-state/code-agent-evidence.d.ts.map +0 -1
- package/dist/belief-state/code-agent-evidence.test.d.ts +0 -2
- package/dist/belief-state/code-agent-evidence.test.d.ts.map +0 -1
- package/dist/belief-state/extract.d.ts +0 -7
- package/dist/belief-state/extract.d.ts.map +0 -1
- package/dist/belief-state/extract.test.d.ts +0 -2
- package/dist/belief-state/extract.test.d.ts.map +0 -1
- package/dist/belief-state/index.d.ts.map +0 -1
- package/dist/belief-state/ope.d.ts +0 -17
- package/dist/belief-state/ope.d.ts.map +0 -1
- package/dist/belief-state/ope.test.d.ts +0 -2
- package/dist/belief-state/ope.test.d.ts.map +0 -1
- package/dist/belief-state/phase0-measurement.d.ts +0 -55
- package/dist/belief-state/phase0-measurement.d.ts.map +0 -1
- package/dist/belief-state/report.d.ts +0 -17
- package/dist/belief-state/report.d.ts.map +0 -1
- package/dist/belief-state/report.test.d.ts +0 -2
- package/dist/belief-state/report.test.d.ts.map +0 -1
- package/dist/belief-state/research-evidence.d.ts +0 -23
- package/dist/belief-state/research-evidence.d.ts.map +0 -1
- package/dist/belief-state/research-evidence.test.d.ts +0 -2
- package/dist/belief-state/research-evidence.test.d.ts.map +0 -1
- package/dist/belief-state/runtime-benchmark-corpus.d.ts +0 -32
- package/dist/belief-state/runtime-benchmark-corpus.d.ts.map +0 -1
- package/dist/belief-state/runtime-hooks.d.ts +0 -87
- package/dist/belief-state/runtime-hooks.d.ts.map +0 -1
- package/dist/belief-state/runtime-hooks.test.d.ts +0 -2
- package/dist/belief-state/runtime-hooks.test.d.ts.map +0 -1
- package/dist/belief-state/selective.d.ts +0 -15
- package/dist/belief-state/selective.d.ts.map +0 -1
- package/dist/belief-state/selective.test.d.ts +0 -2
- package/dist/belief-state/selective.test.d.ts.map +0 -1
- package/dist/belief-state/shadow-probe.d.ts +0 -80
- package/dist/belief-state/shadow-probe.d.ts.map +0 -1
- package/dist/belief-state/shadow-probe.test.d.ts +0 -2
- package/dist/belief-state/shadow-probe.test.d.ts.map +0 -1
- package/dist/belief-state/types.d.ts +0 -195
- package/dist/belief-state/types.d.ts.map +0 -1
- package/dist/belief-state/types.test.d.ts +0 -2
- package/dist/belief-state/types.test.d.ts.map +0 -1
- package/dist/benchmark.d.ts +0 -14
- package/dist/benchmark.d.ts.map +0 -1
- package/dist/benchmarks/index.d.ts.map +0 -1
- package/dist/benchmarks/routing/dataset.d.ts +0 -34
- package/dist/benchmarks/routing/dataset.d.ts.map +0 -1
- package/dist/benchmarks/routing/index.d.ts +0 -34
- package/dist/benchmarks/routing/index.d.ts.map +0 -1
- package/dist/benchmarks/types.d.ts +0 -49
- package/dist/benchmarks/types.d.ts.map +0 -1
- package/dist/bisector.d.ts +0 -81
- package/dist/bisector.d.ts.map +0 -1
- package/dist/budget-guard.d.ts +0 -31
- package/dist/budget-guard.d.ts.map +0 -1
- package/dist/builder-eval/builder-session.d.ts +0 -111
- package/dist/builder-eval/builder-session.d.ts.map +0 -1
- package/dist/builder-eval/correlation.d.ts +0 -32
- package/dist/builder-eval/correlation.d.ts.map +0 -1
- package/dist/builder-eval/index.d.ts.map +0 -1
- package/dist/builder-eval/project-registry.d.ts +0 -51
- package/dist/builder-eval/project-registry.d.ts.map +0 -1
- package/dist/builder-eval/three-layer-eval.d.ts +0 -55
- package/dist/builder-eval/three-layer-eval.d.ts.map +0 -1
- package/dist/campaign/analyst-surface.d.ts +0 -108
- package/dist/campaign/analyst-surface.d.ts.map +0 -1
- package/dist/campaign/analyst-surface.test.d.ts +0 -2
- package/dist/campaign/analyst-surface.test.d.ts.map +0 -1
- package/dist/campaign/auto-pr.d.ts +0 -46
- package/dist/campaign/auto-pr.d.ts.map +0 -1
- package/dist/campaign/distillation/agreement-judge.d.ts +0 -69
- package/dist/campaign/distillation/agreement-judge.d.ts.map +0 -1
- package/dist/campaign/distillation/cli.d.ts +0 -35
- package/dist/campaign/distillation/cli.d.ts.map +0 -1
- package/dist/campaign/distillation/distillation.test.d.ts +0 -2
- package/dist/campaign/distillation/distillation.test.d.ts.map +0 -1
- package/dist/campaign/distillation/gold-scenarios.d.ts +0 -54
- package/dist/campaign/distillation/gold-scenarios.d.ts.map +0 -1
- package/dist/campaign/distillation/run-distillation.d.ts +0 -119
- package/dist/campaign/distillation/run-distillation.d.ts.map +0 -1
- package/dist/campaign/gates/compose.d.ts +0 -12
- package/dist/campaign/gates/compose.d.ts.map +0 -1
- package/dist/campaign/gates/default-production-gate.d.ts +0 -58
- package/dist/campaign/gates/default-production-gate.d.ts.map +0 -1
- package/dist/campaign/gates/heldout-gate.d.ts +0 -12
- package/dist/campaign/gates/heldout-gate.d.ts.map +0 -1
- package/dist/campaign/gates/promotion-policy.d.ts +0 -125
- package/dist/campaign/gates/promotion-policy.d.ts.map +0 -1
- package/dist/campaign/gates/promotion-policy.test.d.ts +0 -2
- package/dist/campaign/gates/promotion-policy.test.d.ts.map +0 -1
- package/dist/campaign/gates/sequential.d.ts +0 -146
- package/dist/campaign/gates/sequential.d.ts.map +0 -1
- package/dist/campaign/gates/sequential.test.d.ts +0 -2
- package/dist/campaign/gates/sequential.test.d.ts.map +0 -1
- package/dist/campaign/gates/statistical-heldout.d.ts +0 -99
- package/dist/campaign/gates/statistical-heldout.d.ts.map +0 -1
- package/dist/campaign/gates/statistical-heldout.test.d.ts +0 -2
- package/dist/campaign/gates/statistical-heldout.test.d.ts.map +0 -1
- package/dist/campaign/index.d.ts.map +0 -1
- package/dist/campaign/labeled-store/fs-adapter.d.ts +0 -59
- package/dist/campaign/labeled-store/fs-adapter.d.ts.map +0 -1
- package/dist/campaign/presets/compare-proposers.d.ts +0 -146
- package/dist/campaign/presets/compare-proposers.d.ts.map +0 -1
- package/dist/campaign/presets/playback.d.ts +0 -120
- package/dist/campaign/presets/playback.d.ts.map +0 -1
- package/dist/campaign/presets/playback.test.d.ts +0 -2
- package/dist/campaign/presets/playback.test.d.ts.map +0 -1
- package/dist/campaign/presets/run-eval.d.ts +0 -14
- package/dist/campaign/presets/run-eval.d.ts.map +0 -1
- package/dist/campaign/presets/run-improvement-loop.d.ts +0 -63
- package/dist/campaign/presets/run-improvement-loop.d.ts.map +0 -1
- package/dist/campaign/presets/run-improvement-loop.test.d.ts +0 -2
- package/dist/campaign/presets/run-improvement-loop.test.d.ts.map +0 -1
- package/dist/campaign/presets/run-optimization.d.ts +0 -92
- package/dist/campaign/presets/run-optimization.d.ts.map +0 -1
- package/dist/campaign/presets/run-profile-matrix.d.ts +0 -151
- package/dist/campaign/presets/run-profile-matrix.d.ts.map +0 -1
- package/dist/campaign/presets/run-skill-opt.d.ts +0 -96
- package/dist/campaign/presets/run-skill-opt.d.ts.map +0 -1
- package/dist/campaign/proposers/_findings-text.d.ts +0 -22
- package/dist/campaign/proposers/_findings-text.d.ts.map +0 -1
- package/dist/campaign/proposers/ace.d.ts +0 -33
- package/dist/campaign/proposers/ace.d.ts.map +0 -1
- package/dist/campaign/proposers/ace.test.d.ts +0 -2
- package/dist/campaign/proposers/ace.test.d.ts.map +0 -1
- package/dist/campaign/proposers/analysis-edit.d.ts +0 -32
- package/dist/campaign/proposers/analysis-edit.d.ts.map +0 -1
- package/dist/campaign/proposers/evolutionary.d.ts +0 -20
- package/dist/campaign/proposers/evolutionary.d.ts.map +0 -1
- package/dist/campaign/proposers/fapo.d.ts +0 -120
- package/dist/campaign/proposers/fapo.d.ts.map +0 -1
- package/dist/campaign/proposers/gepa.d.ts +0 -86
- package/dist/campaign/proposers/gepa.d.ts.map +0 -1
- package/dist/campaign/proposers/halo.d.ts +0 -44
- package/dist/campaign/proposers/halo.d.ts.map +0 -1
- package/dist/campaign/proposers/halo.test.d.ts +0 -2
- package/dist/campaign/proposers/halo.test.d.ts.map +0 -1
- package/dist/campaign/proposers/memory.d.ts +0 -47
- package/dist/campaign/proposers/memory.d.ts.map +0 -1
- package/dist/campaign/proposers/memory.test.d.ts +0 -2
- package/dist/campaign/proposers/memory.test.d.ts.map +0 -1
- package/dist/campaign/proposers/skill-opt.d.ts +0 -88
- package/dist/campaign/proposers/skill-opt.d.ts.map +0 -1
- package/dist/campaign/proposers/trace-analyst.d.ts +0 -48
- package/dist/campaign/proposers/trace-analyst.d.ts.map +0 -1
- package/dist/campaign/proposers/trace-analyst.test.d.ts +0 -2
- package/dist/campaign/proposers/trace-analyst.test.d.ts.map +0 -1
- package/dist/campaign/provenance.d.ts +0 -185
- package/dist/campaign/provenance.d.ts.map +0 -1
- package/dist/campaign/run-campaign.d.ts +0 -90
- package/dist/campaign/run-campaign.d.ts.map +0 -1
- package/dist/campaign/score-utils.d.ts +0 -26
- package/dist/campaign/score-utils.d.ts.map +0 -1
- package/dist/campaign/skill-patch.d.ts +0 -62
- package/dist/campaign/skill-patch.d.ts.map +0 -1
- package/dist/campaign/storage.d.ts +0 -38
- package/dist/campaign/storage.d.ts.map +0 -1
- package/dist/campaign/types.d.ts.map +0 -1
- package/dist/campaign/worktree/index.d.ts +0 -53
- package/dist/campaign/worktree/index.d.ts.map +0 -1
- package/dist/canary.d.ts +0 -101
- package/dist/canary.d.ts.map +0 -1
- package/dist/causal-attribution.d.ts +0 -45
- package/dist/causal-attribution.d.ts.map +0 -1
- package/dist/chunk-AQ5WQAIV.js.map +0 -1
- package/dist/ci-gate.d.ts +0 -44
- package/dist/ci-gate.d.ts.map +0 -1
- package/dist/cli.d.ts.map +0 -1
- package/dist/client.d.ts +0 -77
- package/dist/client.d.ts.map +0 -1
- package/dist/client.test.d.ts +0 -2
- package/dist/client.test.d.ts.map +0 -1
- package/dist/command-runner.d.ts +0 -74
- package/dist/command-runner.d.ts.map +0 -1
- package/dist/command-runner.test.d.ts +0 -2
- package/dist/command-runner.test.d.ts.map +0 -1
- package/dist/completion-verifier.d.ts +0 -147
- package/dist/completion-verifier.d.ts.map +0 -1
- package/dist/completion-verifier.test.d.ts +0 -9
- package/dist/completion-verifier.test.d.ts.map +0 -1
- package/dist/concurrency.d.ts +0 -23
- package/dist/concurrency.d.ts.map +0 -1
- package/dist/contamination-guard.d.ts +0 -81
- package/dist/contamination-guard.d.ts.map +0 -1
- package/dist/contract/analyze-runs.d.ts.map +0 -1
- package/dist/contract/define-agent-eval.d.ts +0 -52
- package/dist/contract/define-agent-eval.d.ts.map +0 -1
- package/dist/contract/diff.d.ts +0 -114
- package/dist/contract/diff.d.ts.map +0 -1
- package/dist/contract/index.d.ts.map +0 -1
- package/dist/contract/insight-report.d.ts.map +0 -1
- package/dist/contract/insight-types-fwd.d.ts +0 -7
- package/dist/contract/insight-types-fwd.d.ts.map +0 -1
- package/dist/contract/intake/agent-trace.d.ts +0 -97
- package/dist/contract/intake/agent-trace.d.ts.map +0 -1
- package/dist/contract/intake/code-agent-session.d.ts.map +0 -1
- package/dist/contract/intake/feedback-table.d.ts +0 -87
- package/dist/contract/intake/feedback-table.d.ts.map +0 -1
- package/dist/contract/intake/index.d.ts +0 -22
- package/dist/contract/intake/index.d.ts.map +0 -1
- package/dist/contract/intake/otel-spans.d.ts +0 -33
- package/dist/contract/intake/otel-spans.d.ts.map +0 -1
- package/dist/contract/self-improve.d.ts +0 -284
- package/dist/contract/self-improve.d.ts.map +0 -1
- package/dist/control-runtime.d.ts.map +0 -1
- package/dist/control-runtime.test.d.ts +0 -2
- package/dist/control-runtime.test.d.ts.map +0 -1
- package/dist/control.d.ts.map +0 -1
- package/dist/convergence.d.ts +0 -29
- package/dist/convergence.d.ts.map +0 -1
- package/dist/cost-ledger.d.ts.map +0 -1
- package/dist/cost-ledger.test.d.ts +0 -2
- package/dist/cost-ledger.test.d.ts.map +0 -1
- package/dist/cost-report.d.ts +0 -43
- package/dist/cost-report.d.ts.map +0 -1
- package/dist/cost-report.test.d.ts +0 -2
- package/dist/cost-report.test.d.ts.map +0 -1
- package/dist/cost-tracker.d.ts +0 -76
- package/dist/cost-tracker.d.ts.map +0 -1
- package/dist/counterfactual.d.ts.map +0 -1
- package/dist/cross-trace-diff.d.ts +0 -56
- package/dist/cross-trace-diff.d.ts.map +0 -1
- package/dist/dataset.d.ts.map +0 -1
- package/dist/deploy-gate-layer.d.ts +0 -125
- package/dist/deploy-gate-layer.d.ts.map +0 -1
- package/dist/deploy-gate-layer.test.d.ts +0 -2
- package/dist/deploy-gate-layer.test.d.ts.map +0 -1
- package/dist/description-length-gate.d.ts +0 -119
- package/dist/description-length-gate.d.ts.map +0 -1
- package/dist/detectors/edge.test.d.ts +0 -2
- package/dist/detectors/edge.test.d.ts.map +0 -1
- package/dist/detectors/index.d.ts +0 -81
- package/dist/detectors/index.d.ts.map +0 -1
- package/dist/detectors/index.test.d.ts +0 -2
- package/dist/detectors/index.test.d.ts.map +0 -1
- package/dist/diagnose/causal-sweep.d.ts +0 -100
- package/dist/diagnose/causal-sweep.d.ts.map +0 -1
- package/dist/diagnose/index.d.ts +0 -36
- package/dist/diagnose/index.d.ts.map +0 -1
- package/dist/diagnose/remediation.d.ts +0 -68
- package/dist/diagnose/remediation.d.ts.map +0 -1
- package/dist/diagnose/repair.d.ts +0 -77
- package/dist/diagnose/repair.d.ts.map +0 -1
- package/dist/discover-personas.d.ts +0 -35
- package/dist/discover-personas.d.ts.map +0 -1
- package/dist/driver.d.ts +0 -95
- package/dist/driver.d.ts.map +0 -1
- package/dist/driver.test.d.ts +0 -8
- package/dist/driver.test.d.ts.map +0 -1
- package/dist/dual-agent-bench.d.ts +0 -81
- package/dist/dual-agent-bench.d.ts.map +0 -1
- package/dist/error-count-extractor.d.ts +0 -47
- package/dist/error-count-extractor.d.ts.map +0 -1
- package/dist/error-count-extractor.test.d.ts +0 -2
- package/dist/error-count-extractor.test.d.ts.map +0 -1
- package/dist/errors.d.ts.map +0 -1
- package/dist/eval-campaign.d.ts.map +0 -1
- package/dist/eval-campaign.test.d.ts +0 -2
- package/dist/eval-campaign.test.d.ts.map +0 -1
- package/dist/eval-tools.d.ts +0 -55
- package/dist/eval-tools.d.ts.map +0 -1
- package/dist/eval-trace-store.d.ts +0 -107
- package/dist/eval-trace-store.d.ts.map +0 -1
- package/dist/eval-trace-store.test.d.ts +0 -2
- package/dist/eval-trace-store.test.d.ts.map +0 -1
- package/dist/executor.d.ts +0 -38
- package/dist/executor.d.ts.map +0 -1
- package/dist/executor.test.d.ts +0 -10
- package/dist/executor.test.d.ts.map +0 -1
- package/dist/experiment-tracker.d.ts +0 -178
- package/dist/experiment-tracker.d.ts.map +0 -1
- package/dist/experiment-tracker.test.d.ts +0 -2
- package/dist/experiment-tracker.test.d.ts.map +0 -1
- package/dist/failure-taxonomy.d.ts +0 -38
- package/dist/failure-taxonomy.d.ts.map +0 -1
- package/dist/feedback-trajectory.d.ts.map +0 -1
- package/dist/feedback-trajectory.test.d.ts +0 -2
- package/dist/feedback-trajectory.test.d.ts.map +0 -1
- package/dist/flow-layer.d.ts +0 -90
- package/dist/flow-layer.d.ts.map +0 -1
- package/dist/flow-layer.test.d.ts +0 -2
- package/dist/flow-layer.test.d.ts.map +0 -1
- package/dist/fuzz/capsule.d.ts +0 -46
- package/dist/fuzz/capsule.d.ts.map +0 -1
- package/dist/fuzz/cube.d.ts +0 -36
- package/dist/fuzz/cube.d.ts.map +0 -1
- package/dist/fuzz/explorer-cost.test.d.ts +0 -2
- package/dist/fuzz/explorer-cost.test.d.ts.map +0 -1
- package/dist/fuzz/explorer.d.ts +0 -64
- package/dist/fuzz/explorer.d.ts.map +0 -1
- package/dist/fuzz/fuzz-agent.d.ts +0 -16
- package/dist/fuzz/fuzz-agent.d.ts.map +0 -1
- package/dist/fuzz/fuzz-agent.test.d.ts +0 -2
- package/dist/fuzz/fuzz-agent.test.d.ts.map +0 -1
- package/dist/fuzz/gates.d.ts +0 -33
- package/dist/fuzz/gates.d.ts.map +0 -1
- package/dist/fuzz/index.d.ts +0 -26
- package/dist/fuzz/index.d.ts.map +0 -1
- package/dist/fuzz/policies.d.ts +0 -28
- package/dist/fuzz/policies.d.ts.map +0 -1
- package/dist/fuzz/tools.d.ts +0 -20
- package/dist/fuzz/tools.d.ts.map +0 -1
- package/dist/fuzz/types.d.ts +0 -307
- package/dist/fuzz/types.d.ts.map +0 -1
- package/dist/golden-matcher.d.ts +0 -71
- package/dist/golden-matcher.d.ts.map +0 -1
- package/dist/governance/eu-ai-act.d.ts +0 -37
- package/dist/governance/eu-ai-act.d.ts.map +0 -1
- package/dist/governance/index.d.ts.map +0 -1
- package/dist/governance/nist-ai-rmf.d.ts +0 -15
- package/dist/governance/nist-ai-rmf.d.ts.map +0 -1
- package/dist/governance/soc2.d.ts +0 -12
- package/dist/governance/soc2.d.ts.map +0 -1
- package/dist/governance/types.d.ts +0 -66
- package/dist/governance/types.d.ts.map +0 -1
- package/dist/harness-optimizer.d.ts +0 -82
- package/dist/harness-optimizer.d.ts.map +0 -1
- package/dist/held-out-gate.d.ts +0 -135
- package/dist/held-out-gate.d.ts.map +0 -1
- package/dist/hosted/client.d.ts +0 -73
- package/dist/hosted/client.d.ts.map +0 -1
- package/dist/hosted/from-env.test.d.ts +0 -8
- package/dist/hosted/from-env.test.d.ts.map +0 -1
- package/dist/hosted/index.d.ts.map +0 -1
- package/dist/hosted/types.d.ts +0 -159
- package/dist/hosted/types.d.ts.map +0 -1
- package/dist/index.d.ts.map +0 -1
- package/dist/integrity/backend-integrity.d.ts +0 -71
- package/dist/integrity/backend-integrity.d.ts.map +0 -1
- package/dist/integrity/preflight.d.ts +0 -72
- package/dist/integrity/preflight.d.ts.map +0 -1
- package/dist/integrity/preflight.test.d.ts +0 -2
- package/dist/integrity/preflight.test.d.ts.map +0 -1
- package/dist/integrity/single-backend.d.ts +0 -67
- package/dist/integrity/single-backend.d.ts.map +0 -1
- package/dist/intent-match-judge.d.ts +0 -69
- package/dist/intent-match-judge.d.ts.map +0 -1
- package/dist/intent-match-judge.test.d.ts +0 -2
- package/dist/intent-match-judge.test.d.ts.map +0 -1
- package/dist/judge-calibration.d.ts.map +0 -1
- package/dist/judge-ensemble.d.ts +0 -66
- package/dist/judge-ensemble.d.ts.map +0 -1
- package/dist/judge-ensemble.test.d.ts +0 -8
- package/dist/judge-ensemble.test.d.ts.map +0 -1
- package/dist/judge-families.d.ts +0 -38
- package/dist/judge-families.d.ts.map +0 -1
- package/dist/judge-panel.d.ts +0 -65
- package/dist/judge-panel.d.ts.map +0 -1
- package/dist/judge-retry.d.ts +0 -70
- package/dist/judge-retry.d.ts.map +0 -1
- package/dist/judge-runner.d.ts +0 -36
- package/dist/judge-runner.d.ts.map +0 -1
- package/dist/judge-runner.test.d.ts +0 -2
- package/dist/judge-runner.test.d.ts.map +0 -1
- package/dist/judges.d.ts +0 -74
- package/dist/judges.d.ts.map +0 -1
- package/dist/keyword-coverage-judge.d.ts +0 -89
- package/dist/keyword-coverage-judge.d.ts.map +0 -1
- package/dist/keyword-coverage-judge.test.d.ts +0 -2
- package/dist/keyword-coverage-judge.test.d.ts.map +0 -1
- package/dist/knowledge/index.d.ts.map +0 -1
- package/dist/knowledge/readiness.d.ts +0 -26
- package/dist/knowledge/readiness.d.ts.map +0 -1
- package/dist/knowledge/types.d.ts +0 -75
- package/dist/knowledge/types.d.ts.map +0 -1
- package/dist/live-proof.d.ts +0 -62
- package/dist/live-proof.d.ts.map +0 -1
- package/dist/llm-client.d.ts.map +0 -1
- package/dist/llm-client.test.d.ts +0 -2
- package/dist/llm-client.test.d.ts.map +0 -1
- package/dist/locked-jsonl-appender.d.ts.map +0 -1
- package/dist/matrix/aggregation.d.ts +0 -16
- package/dist/matrix/aggregation.d.ts.map +0 -1
- package/dist/matrix/index.d.ts.map +0 -1
- package/dist/matrix/runner.d.ts +0 -15
- package/dist/matrix/runner.d.ts.map +0 -1
- package/dist/matrix/types.d.ts.map +0 -1
- package/dist/meta-eval/calibration.d.ts +0 -47
- package/dist/meta-eval/calibration.d.ts.map +0 -1
- package/dist/meta-eval/correlation-study.d.ts +0 -53
- package/dist/meta-eval/correlation-study.d.ts.map +0 -1
- package/dist/meta-eval/index.d.ts.map +0 -1
- package/dist/meta-eval/outcome-store.d.ts.map +0 -1
- package/dist/meta-eval/rubric-predictive-validity.d.ts.map +0 -1
- package/dist/meta-eval/sentinel.d.ts +0 -169
- package/dist/meta-eval/sentinel.d.ts.map +0 -1
- package/dist/metrics.d.ts +0 -63
- package/dist/metrics.d.ts.map +0 -1
- package/dist/model-seats.d.ts +0 -71
- package/dist/model-seats.d.ts.map +0 -1
- package/dist/model-seats.test.d.ts +0 -2
- package/dist/model-seats.test.d.ts.map +0 -1
- package/dist/muffled-gate-scanner.d.ts +0 -102
- package/dist/muffled-gate-scanner.d.ts.map +0 -1
- package/dist/multi-layer-verifier.d.ts.map +0 -1
- package/dist/multi-layer-verifier.test.d.ts +0 -2
- package/dist/multi-layer-verifier.test.d.ts.map +0 -1
- package/dist/multi-toolchain-layer.d.ts +0 -80
- package/dist/multi-toolchain-layer.d.ts.map +0 -1
- package/dist/multi-toolchain-layer.test.d.ts +0 -2
- package/dist/multi-toolchain-layer.test.d.ts.map +0 -1
- package/dist/multishot/default-tools.d.ts +0 -34
- package/dist/multishot/default-tools.d.ts.map +0 -1
- package/dist/multishot/index.d.ts.map +0 -1
- package/dist/multishot/judges.d.ts +0 -32
- package/dist/multishot/judges.d.ts.map +0 -1
- package/dist/multishot/matrix.d.ts +0 -107
- package/dist/multishot/matrix.d.ts.map +0 -1
- package/dist/multishot/multishot.d.ts +0 -23
- package/dist/multishot/multishot.d.ts.map +0 -1
- package/dist/multishot/router.d.ts +0 -37
- package/dist/multishot/router.d.ts.map +0 -1
- package/dist/multishot/types.d.ts +0 -60
- package/dist/multishot/types.d.ts.map +0 -1
- package/dist/observability.d.ts +0 -71
- package/dist/observability.d.ts.map +0 -1
- package/dist/oracle.d.ts +0 -55
- package/dist/oracle.d.ts.map +0 -1
- package/dist/orthogonality.d.ts +0 -35
- package/dist/orthogonality.d.ts.map +0 -1
- package/dist/otel-pipeline.d.ts +0 -31
- package/dist/otel-pipeline.d.ts.map +0 -1
- package/dist/paraphrase.d.ts +0 -107
- package/dist/paraphrase.d.ts.map +0 -1
- package/dist/pareto.d.ts.map +0 -1
- package/dist/partition-held-out.d.ts +0 -70
- package/dist/partition-held-out.d.ts.map +0 -1
- package/dist/partition-held-out.test.d.ts +0 -2
- package/dist/partition-held-out.test.d.ts.map +0 -1
- package/dist/perf/index.d.ts.map +0 -1
- package/dist/perf/integrity.d.ts +0 -30
- package/dist/perf/integrity.d.ts.map +0 -1
- package/dist/perf/journey.d.ts +0 -45
- package/dist/perf/journey.d.ts.map +0 -1
- package/dist/perf/ratchet.d.ts +0 -47
- package/dist/perf/ratchet.d.ts.map +0 -1
- package/dist/pipelines/budget-breach.d.ts +0 -31
- package/dist/pipelines/budget-breach.d.ts.map +0 -1
- package/dist/pipelines/budget-breach.test.d.ts +0 -2
- package/dist/pipelines/budget-breach.test.d.ts.map +0 -1
- package/dist/pipelines/failure-cluster.d.ts +0 -38
- package/dist/pipelines/failure-cluster.d.ts.map +0 -1
- package/dist/pipelines/failure-cluster.test.d.ts +0 -2
- package/dist/pipelines/failure-cluster.test.d.ts.map +0 -1
- package/dist/pipelines/first-divergence.d.ts +0 -26
- package/dist/pipelines/first-divergence.d.ts.map +0 -1
- package/dist/pipelines/first-divergence.test.d.ts +0 -2
- package/dist/pipelines/first-divergence.test.d.ts.map +0 -1
- package/dist/pipelines/index.d.ts.map +0 -1
- package/dist/pipelines/judge-agreement.d.ts +0 -26
- package/dist/pipelines/judge-agreement.d.ts.map +0 -1
- package/dist/pipelines/judge-agreement.test.d.ts +0 -2
- package/dist/pipelines/judge-agreement.test.d.ts.map +0 -1
- package/dist/pipelines/regression.d.ts +0 -23
- package/dist/pipelines/regression.d.ts.map +0 -1
- package/dist/pipelines/regression.test.d.ts +0 -2
- package/dist/pipelines/regression.test.d.ts.map +0 -1
- package/dist/pipelines/stuck-loop.d.ts +0 -32
- package/dist/pipelines/stuck-loop.d.ts.map +0 -1
- package/dist/pipelines/stuck-loop.test.d.ts +0 -2
- package/dist/pipelines/stuck-loop.test.d.ts.map +0 -1
- package/dist/pipelines/tool-waste.d.ts +0 -34
- package/dist/pipelines/tool-waste.d.ts.map +0 -1
- package/dist/pipelines/tool-waste.test.d.ts +0 -2
- package/dist/pipelines/tool-waste.test.d.ts.map +0 -1
- package/dist/playbook.d.ts +0 -16
- package/dist/playbook.d.ts.map +0 -1
- package/dist/pr-review-benchmark.d.ts +0 -88
- package/dist/pr-review-benchmark.d.ts.map +0 -1
- package/dist/pr-review-benchmark.test.d.ts +0 -2
- package/dist/pr-review-benchmark.test.d.ts.map +0 -1
- package/dist/pre-registration.d.ts +0 -125
- package/dist/pre-registration.d.ts.map +0 -1
- package/dist/prm/builtin-rubrics.d.ts +0 -33
- package/dist/prm/builtin-rubrics.d.ts.map +0 -1
- package/dist/prm/index.d.ts.map +0 -1
- package/dist/prm/inference.d.ts +0 -29
- package/dist/prm/inference.d.ts.map +0 -1
- package/dist/prm/inference.test.d.ts +0 -2
- package/dist/prm/inference.test.d.ts.map +0 -1
- package/dist/prm/rubric.d.ts.map +0 -1
- package/dist/prm/training-export.d.ts +0 -38
- package/dist/prm/training-export.d.ts.map +0 -1
- package/dist/produced-state.d.ts +0 -63
- package/dist/produced-state.d.ts.map +0 -1
- package/dist/produced-state.test.d.ts +0 -8
- package/dist/produced-state.test.d.ts.map +0 -1
- package/dist/profile/baselines.d.ts +0 -37
- package/dist/profile/baselines.d.ts.map +0 -1
- package/dist/profile/index.d.ts +0 -105
- package/dist/profile/index.d.ts.map +0 -1
- package/dist/promotion-gate.d.ts +0 -93
- package/dist/promotion-gate.d.ts.map +0 -1
- package/dist/prompt-registry.d.ts +0 -41
- package/dist/prompt-registry.d.ts.map +0 -1
- package/dist/propose-review-control.d.ts +0 -49
- package/dist/propose-review-control.d.ts.map +0 -1
- package/dist/propose-review-control.test.d.ts +0 -2
- package/dist/propose-review-control.test.d.ts.map +0 -1
- package/dist/propose-review.d.ts +0 -155
- package/dist/propose-review.d.ts.map +0 -1
- package/dist/red-team.d.ts.map +0 -1
- package/dist/reference-replay-steering.d.ts +0 -11
- package/dist/reference-replay-steering.d.ts.map +0 -1
- package/dist/reference-replay.d.ts +0 -176
- package/dist/reference-replay.d.ts.map +0 -1
- package/dist/reflective-mutation.d.ts +0 -79
- package/dist/reflective-mutation.d.ts.map +0 -1
- package/dist/registry.d.ts +0 -31
- package/dist/registry.d.ts.map +0 -1
- package/dist/release-confidence.d.ts +0 -128
- package/dist/release-confidence.d.ts.map +0 -1
- package/dist/release-report.d.ts +0 -11
- package/dist/release-report.d.ts.map +0 -1
- package/dist/replay.d.ts +0 -120
- package/dist/replay.d.ts.map +0 -1
- package/dist/reporter.d.ts +0 -14
- package/dist/reporter.d.ts.map +0 -1
- package/dist/reporting.d.ts.map +0 -1
- package/dist/researcher.d.ts +0 -140
- package/dist/researcher.d.ts.map +0 -1
- package/dist/reviewer.d.ts +0 -118
- package/dist/reviewer.d.ts.map +0 -1
- package/dist/reviewer.test.d.ts +0 -2
- package/dist/reviewer.test.d.ts.map +0 -1
- package/dist/reward-model-export.d.ts +0 -60
- package/dist/reward-model-export.d.ts.map +0 -1
- package/dist/rl/active-curriculum.d.ts +0 -110
- package/dist/rl/active-curriculum.d.ts.map +0 -1
- package/dist/rl/adaptation-eval.d.ts +0 -109
- package/dist/rl/adaptation-eval.d.ts.map +0 -1
- package/dist/rl/adversarial.d.ts.map +0 -1
- package/dist/rl/compute-curves.d.ts +0 -127
- package/dist/rl/compute-curves.d.ts.map +0 -1
- package/dist/rl/contamination.d.ts +0 -117
- package/dist/rl/contamination.d.ts.map +0 -1
- package/dist/rl/corpus.d.ts +0 -55
- package/dist/rl/corpus.d.ts.map +0 -1
- package/dist/rl/corpus.test.d.ts +0 -2
- package/dist/rl/corpus.test.d.ts.map +0 -1
- package/dist/rl/dataset.d.ts +0 -102
- package/dist/rl/dataset.d.ts.map +0 -1
- package/dist/rl/dataset.test.d.ts +0 -2
- package/dist/rl/dataset.test.d.ts.map +0 -1
- package/dist/rl/exporters.d.ts +0 -141
- package/dist/rl/exporters.d.ts.map +0 -1
- package/dist/rl/index.d.ts +0 -49
- package/dist/rl/index.d.ts.map +0 -1
- package/dist/rl/off-policy.d.ts.map +0 -1
- package/dist/rl/predictive-validity-researcher.d.ts +0 -69
- package/dist/rl/predictive-validity-researcher.d.ts.map +0 -1
- package/dist/rl/preferences.d.ts +0 -141
- package/dist/rl/preferences.d.ts.map +0 -1
- package/dist/rl/process-reward.d.ts +0 -122
- package/dist/rl/process-reward.d.ts.map +0 -1
- package/dist/rl/reward-hacking.d.ts +0 -104
- package/dist/rl/reward-hacking.d.ts.map +0 -1
- package/dist/rl/rl-campaign.d.ts +0 -85
- package/dist/rl/rl-campaign.d.ts.map +0 -1
- package/dist/rl/run-record-adapters.d.ts +0 -56
- package/dist/rl/run-record-adapters.d.ts.map +0 -1
- package/dist/rl/sim-fidelity.d.ts +0 -166
- package/dist/rl/sim-fidelity.d.ts.map +0 -1
- package/dist/rl/sim-fidelity.test.d.ts +0 -2
- package/dist/rl/sim-fidelity.test.d.ts.map +0 -1
- package/dist/rl/tournament.d.ts +0 -115
- package/dist/rl/tournament.d.ts.map +0 -1
- package/dist/rl/verifiable-reward.d.ts +0 -124
- package/dist/rl/verifiable-reward.d.ts.map +0 -1
- package/dist/run-critic.d.ts +0 -23
- package/dist/run-critic.d.ts.map +0 -1
- package/dist/run-evidence.d.ts +0 -32
- package/dist/run-evidence.d.ts.map +0 -1
- package/dist/run-record.d.ts.map +0 -1
- package/dist/run-record.test.d.ts +0 -2
- package/dist/run-record.test.d.ts.map +0 -1
- package/dist/run-score.d.ts +0 -31
- package/dist/run-score.d.ts.map +0 -1
- package/dist/runtime-trajectory.d.ts +0 -47
- package/dist/runtime-trajectory.d.ts.map +0 -1
- package/dist/sandbox-harness.d.ts.map +0 -1
- package/dist/sandbox-harness.test.d.ts +0 -2
- package/dist/sandbox-harness.test.d.ts.map +0 -1
- package/dist/sandbox-pool.d.ts +0 -74
- package/dist/sandbox-pool.d.ts.map +0 -1
- package/dist/sandbox-pool.test.d.ts +0 -2
- package/dist/sandbox-pool.test.d.ts.map +0 -1
- package/dist/scorecard.d.ts +0 -133
- package/dist/scorecard.d.ts.map +0 -1
- package/dist/scorecard.test.d.ts +0 -2
- package/dist/scorecard.test.d.ts.map +0 -1
- package/dist/self-play.d.ts +0 -69
- package/dist/self-play.d.ts.map +0 -1
- package/dist/semantic-concept-judge.d.ts +0 -135
- package/dist/semantic-concept-judge.d.ts.map +0 -1
- package/dist/semantic-concept-judge.test.d.ts +0 -2
- package/dist/semantic-concept-judge.test.d.ts.map +0 -1
- package/dist/sequential.d.ts.map +0 -1
- package/dist/series-convergence.d.ts.map +0 -1
- package/dist/slo.d.ts +0 -48
- package/dist/slo.d.ts.map +0 -1
- package/dist/state-continuity.d.ts +0 -47
- package/dist/state-continuity.d.ts.map +0 -1
- package/dist/statistics.d.ts.map +0 -1
- package/dist/statistics.test.d.ts +0 -2
- package/dist/statistics.test.d.ts.map +0 -1
- package/dist/steering-optimizer.d.ts +0 -58
- package/dist/steering-optimizer.d.ts.map +0 -1
- package/dist/steering.d.ts +0 -24
- package/dist/steering.d.ts.map +0 -1
- package/dist/storyboard/code-edit.d.ts +0 -64
- package/dist/storyboard/code-edit.d.ts.map +0 -1
- package/dist/storyboard/code-edit.test.d.ts +0 -2
- package/dist/storyboard/code-edit.test.d.ts.map +0 -1
- package/dist/storyboard/index.d.ts.map +0 -1
- package/dist/storyboard/index.test.d.ts +0 -2
- package/dist/storyboard/index.test.d.ts.map +0 -1
- package/dist/summary-report.d.ts.map +0 -1
- package/dist/telemetry/client.d.ts +0 -35
- package/dist/telemetry/client.d.ts.map +0 -1
- package/dist/telemetry/index.d.ts.map +0 -1
- package/dist/telemetry/schema.d.ts +0 -61
- package/dist/telemetry/schema.d.ts.map +0 -1
- package/dist/telemetry/sink-fetch.d.ts +0 -39
- package/dist/telemetry/sink-fetch.d.ts.map +0 -1
- package/dist/telemetry/sink-file.d.ts.map +0 -1
- package/dist/test-graded-scenario.d.ts +0 -42
- package/dist/test-graded-scenario.d.ts.map +0 -1
- package/dist/testing.d.ts.map +0 -1
- package/dist/tool-use-metrics.d.ts +0 -35
- package/dist/tool-use-metrics.d.ts.map +0 -1
- package/dist/trace/capture-fetch.d.ts +0 -48
- package/dist/trace/capture-fetch.d.ts.map +0 -1
- package/dist/trace/capture-fetch.test.d.ts +0 -2
- package/dist/trace/capture-fetch.test.d.ts.map +0 -1
- package/dist/trace/emitter.d.ts.map +0 -1
- package/dist/trace/extract-usage.d.ts +0 -46
- package/dist/trace/extract-usage.d.ts.map +0 -1
- package/dist/trace/extract-usage.test.d.ts +0 -2
- package/dist/trace/extract-usage.test.d.ts.map +0 -1
- package/dist/trace/index.d.ts +0 -15
- package/dist/trace/index.d.ts.map +0 -1
- package/dist/trace/integrity.d.ts.map +0 -1
- package/dist/trace/otel-bridge.d.ts +0 -29
- package/dist/trace/otel-bridge.d.ts.map +0 -1
- package/dist/trace/otel-export.d.ts +0 -52
- package/dist/trace/otel-export.d.ts.map +0 -1
- package/dist/trace/otel.d.ts +0 -57
- package/dist/trace/otel.d.ts.map +0 -1
- package/dist/trace/otlp-attributes.d.ts +0 -17
- package/dist/trace/otlp-attributes.d.ts.map +0 -1
- package/dist/trace/query.d.ts +0 -29
- package/dist/trace/query.d.ts.map +0 -1
- package/dist/trace/query.test.d.ts +0 -2
- package/dist/trace/query.test.d.ts.map +0 -1
- package/dist/trace/raw-provider-sink.d.ts.map +0 -1
- package/dist/trace/redact.d.ts.map +0 -1
- package/dist/trace/schema.d.ts.map +0 -1
- package/dist/trace/store-to-otlp.d.ts +0 -72
- package/dist/trace/store-to-otlp.d.ts.map +0 -1
- package/dist/trace/store-to-otlp.test.d.ts +0 -2
- package/dist/trace/store-to-otlp.test.d.ts.map +0 -1
- package/dist/trace/store.d.ts.map +0 -1
- package/dist/trace/store.test.d.ts +0 -2
- package/dist/trace/store.test.d.ts.map +0 -1
- package/dist/trace-analyst/analyst.d.ts.map +0 -1
- package/dist/trace-analyst/analyst.test.d.ts +0 -2
- package/dist/trace-analyst/analyst.test.d.ts.map +0 -1
- package/dist/trace-analyst/behavioral-metrics.d.ts +0 -40
- package/dist/trace-analyst/behavioral-metrics.d.ts.map +0 -1
- package/dist/trace-analyst/behavioral-metrics.test.d.ts +0 -2
- package/dist/trace-analyst/behavioral-metrics.test.d.ts.map +0 -1
- package/dist/trace-analyst/hook.d.ts +0 -55
- package/dist/trace-analyst/hook.d.ts.map +0 -1
- package/dist/trace-analyst/index.d.ts +0 -18
- package/dist/trace-analyst/index.d.ts.map +0 -1
- package/dist/trace-analyst/insights.d.ts +0 -71
- package/dist/trace-analyst/insights.d.ts.map +0 -1
- package/dist/trace-analyst/insights.test.d.ts +0 -2
- package/dist/trace-analyst/insights.test.d.ts.map +0 -1
- package/dist/trace-analyst/otlp-flatten.d.ts +0 -42
- package/dist/trace-analyst/otlp-flatten.d.ts.map +0 -1
- package/dist/trace-analyst/otlp-span.d.ts +0 -85
- package/dist/trace-analyst/otlp-span.d.ts.map +0 -1
- package/dist/trace-analyst/otlp-span.test.d.ts +0 -2
- package/dist/trace-analyst/otlp-span.test.d.ts.map +0 -1
- package/dist/trace-analyst/otlp-to-run-records.d.ts +0 -115
- package/dist/trace-analyst/otlp-to-run-records.d.ts.map +0 -1
- package/dist/trace-analyst/otlp-to-run-records.test.d.ts +0 -2
- package/dist/trace-analyst/otlp-to-run-records.test.d.ts.map +0 -1
- package/dist/trace-analyst/otlp-to-run-records.timestamps.test.d.ts +0 -2
- package/dist/trace-analyst/otlp-to-run-records.timestamps.test.d.ts.map +0 -1
- package/dist/trace-analyst/prompts.d.ts +0 -6
- package/dist/trace-analyst/prompts.d.ts.map +0 -1
- package/dist/trace-analyst/store-otlp.d.ts +0 -126
- package/dist/trace-analyst/store-otlp.d.ts.map +0 -1
- package/dist/trace-analyst/store-otlp.test.d.ts +0 -8
- package/dist/trace-analyst/store-otlp.test.d.ts.map +0 -1
- package/dist/trace-analyst/store-otlp.timestamps.test.d.ts +0 -2
- package/dist/trace-analyst/store-otlp.timestamps.test.d.ts.map +0 -1
- package/dist/trace-analyst/store.d.ts +0 -63
- package/dist/trace-analyst/store.d.ts.map +0 -1
- package/dist/trace-analyst/tools.d.ts +0 -44
- package/dist/trace-analyst/tools.d.ts.map +0 -1
- package/dist/trace-analyst/tools.test.d.ts +0 -10
- package/dist/trace-analyst/tools.test.d.ts.map +0 -1
- package/dist/trace-analyst/types.d.ts.map +0 -1
- package/dist/trace-contracts.d.ts +0 -180
- package/dist/trace-contracts.d.ts.map +0 -1
- package/dist/traced-analyst.d.ts +0 -26
- package/dist/traced-analyst.d.ts.map +0 -1
- package/dist/traced-judges.d.ts +0 -27
- package/dist/traced-judges.d.ts.map +0 -1
- package/dist/traces.d.ts.map +0 -1
- package/dist/trajectory.d.ts.map +0 -1
- package/dist/types.d.ts.map +0 -1
- package/dist/ui-finding.d.ts +0 -104
- package/dist/ui-finding.d.ts.map +0 -1
- package/dist/verdict-cache.d.ts +0 -78
- package/dist/verdict-cache.d.ts.map +0 -1
- package/dist/verdict-cache.test.d.ts +0 -2
- package/dist/verdict-cache.test.d.ts.map +0 -1
- package/dist/verdict.d.ts.map +0 -1
- package/dist/visual-diff.d.ts +0 -32
- package/dist/visual-diff.d.ts.map +0 -1
- package/dist/wire/handlers.d.ts +0 -54
- package/dist/wire/handlers.d.ts.map +0 -1
- package/dist/wire/index.d.ts.map +0 -1
- package/dist/wire/openapi.d.ts +0 -3
- package/dist/wire/openapi.d.ts.map +0 -1
- package/dist/wire/rpc.d.ts +0 -21
- package/dist/wire/rpc.d.ts.map +0 -1
- package/dist/wire/rubrics.d.ts +0 -34
- package/dist/wire/rubrics.d.ts.map +0 -1
- package/dist/wire/schemas.d.ts +0 -410
- package/dist/wire/schemas.d.ts.map +0 -1
- package/dist/wire/server.d.ts +0 -60
- package/dist/wire/server.d.ts.map +0 -1
- package/dist/workflow/event-schema.d.ts +0 -5
- package/dist/workflow/event-schema.d.ts.map +0 -1
- package/dist/workflow/feedback-pack.d.ts +0 -99
- package/dist/workflow/feedback-pack.d.ts.map +0 -1
- package/dist/workflow/index.d.ts.map +0 -1
- package/dist/workflow/intelligence-export.d.ts +0 -62
- package/dist/workflow/intelligence-export.d.ts.map +0 -1
- package/dist/workflow/partner-report.d.ts +0 -49
- package/dist/workflow/partner-report.d.ts.map +0 -1
- package/dist/workflow/phase-graph.d.ts +0 -43
- package/dist/workflow/phase-graph.d.ts.map +0 -1
- package/dist/workflow/promotion-gate.d.ts +0 -61
- package/dist/workflow/promotion-gate.d.ts.map +0 -1
- package/dist/workflow/run-record.d.ts +0 -12
- package/dist/workflow/run-record.d.ts.map +0 -1
- package/dist/workflow/runtime-adapter.d.ts +0 -20
- package/dist/workflow/runtime-adapter.d.ts.map +0 -1
- package/dist/workflow/sanitize.d.ts +0 -21
- package/dist/workflow/sanitize.d.ts.map +0 -1
- package/dist/workflow/schema.d.ts +0 -5
- package/dist/workflow/schema.d.ts.map +0 -1
- package/dist/workflow/summary.d.ts +0 -43
- package/dist/workflow/summary.d.ts.map +0 -1
- package/dist/workflow/trace-event-fields.d.ts +0 -6
- package/dist/workflow/trace-event-fields.d.ts.map +0 -1
- package/dist/workflow/trajectory.d.ts +0 -15
- package/dist/workflow/trajectory.d.ts.map +0 -1
- package/dist/workflow/types.d.ts +0 -68
- package/dist/workflow/types.d.ts.map +0 -1
- package/dist/workspace-inspector.d.ts +0 -67
- package/dist/workspace-inspector.d.ts.map +0 -1
- package/dist/wrangler-deploy-runner.test.d.ts +0 -2
- package/dist/wrangler-deploy-runner.test.d.ts.map +0 -1
|
@@ -1,104 +0,0 @@
|
|
|
1
|
-
/**
|
|
2
|
-
* Reward hacking / Goodhart detection.
|
|
3
|
-
*
|
|
4
|
-
* Goodhart's Law says: when a measure becomes a target, it ceases to be
|
|
5
|
-
* a good measure. In RLHF and agentic-RL settings this is the dominant
|
|
6
|
-
* failure mode — the policy learns to produce outputs that score well on
|
|
7
|
-
* the proxy reward (judge, rubric, test pass-rate) without producing
|
|
8
|
-
* the underlying capability the proxy was meant to track.
|
|
9
|
-
*
|
|
10
|
-
* Krakovna et al. (2020, "Specification Gaming Examples in AI") and the
|
|
11
|
-
* subsequent RLHF reward-hacking literature (Skalse et al. 2022, Kim et al.
|
|
12
|
-
* 2023) converge on a few diagnostic signatures:
|
|
13
|
-
*
|
|
14
|
-
* 1. **Reward divergence:** the proxy reward grows while the held-out
|
|
15
|
-
* ground-truth signal stagnates or drops. Predictive validity over
|
|
16
|
-
* time captures this.
|
|
17
|
-
* 2. **Distributional shift in outputs:** after RL, the policy produces
|
|
18
|
-
* outputs that no longer match the reference distribution — usually
|
|
19
|
-
* because it found a high-reward attractor that's degenerate (e.g.
|
|
20
|
-
* one-token responses, repetition, formatting tricks).
|
|
21
|
-
* 3. **Disagreement between independent rewards:** if you train on
|
|
22
|
-
* reward A and a held-out independent reward B drops sharply, you're
|
|
23
|
-
* probably hacking A.
|
|
24
|
-
* 4. **Calibration drift:** the verifiable / deterministic component of
|
|
25
|
-
* the reward is stable; the probabilistic / judge component drifts up
|
|
26
|
-
* while the deterministic component doesn't. The judge is being
|
|
27
|
-
* gamed.
|
|
28
|
-
*
|
|
29
|
-
* This module ships explicit detectors for all four signatures, plus a
|
|
30
|
-
* combined verdict. The output is diagnostic — actionable signals,
|
|
31
|
-
* not autoreject — because each signature has known false positives
|
|
32
|
-
* (e.g., a policy that genuinely improves can show distributional shift).
|
|
33
|
-
*
|
|
34
|
-
* Differs from `rubricPredictiveValidity` (which is a *standing* check on
|
|
35
|
-
* whether rubrics correlate with deployment outcomes) — this is a
|
|
36
|
-
* *temporal* check on whether the reward-vs-truth gap is *widening over
|
|
37
|
-
* time during a training run*.
|
|
38
|
-
*/
|
|
39
|
-
import type { RunRecord } from '../run-record';
|
|
40
|
-
import { type VerifiableRewardExtractionOptions } from './verifiable-reward';
|
|
41
|
-
export type RewardHackingSignal = 'reward_divergence' | 'distribution_shift' | 'reward_disagreement' | 'judge_drift';
|
|
42
|
-
export interface RewardHackingFinding {
|
|
43
|
-
signal: RewardHackingSignal;
|
|
44
|
-
/** Severity in [0, 1]. >0.5 = strong signal. */
|
|
45
|
-
severity: number;
|
|
46
|
-
message: string;
|
|
47
|
-
/** Numeric evidence the consumer can render. */
|
|
48
|
-
detail: Record<string, number>;
|
|
49
|
-
}
|
|
50
|
-
export interface RewardHackingReport {
|
|
51
|
-
findings: RewardHackingFinding[];
|
|
52
|
-
/**
|
|
53
|
-
* Composite verdict. `'clean'` if every signal severity < 0.3;
|
|
54
|
-
* `'suspect'` if at least one ≥ 0.3 but none ≥ 0.6; `'gaming'` if any ≥ 0.6.
|
|
55
|
-
*/
|
|
56
|
-
verdict: 'clean' | 'suspect' | 'gaming';
|
|
57
|
-
/** Rationale for the verdict, ready to paste into an audit log. */
|
|
58
|
-
rationale: string[];
|
|
59
|
-
/** Number of paired (proxy, truth) data points the report saw. */
|
|
60
|
-
n: number;
|
|
61
|
-
}
|
|
62
|
-
export interface DetectRewardHackingInput {
|
|
63
|
-
/**
|
|
64
|
-
* Run records ordered by recency (oldest first). The detector segments
|
|
65
|
-
* them into prefix/suffix windows to compute "did the gap widen."
|
|
66
|
-
*/
|
|
67
|
-
runs: RunRecord[];
|
|
68
|
-
/**
|
|
69
|
-
* The metric the policy was trained to optimize. Should be present on
|
|
70
|
-
* `outcome.raw` or `outcome.holdoutScore`. Default reads `outcome.holdoutScore`.
|
|
71
|
-
*/
|
|
72
|
-
proxyOf?: (run: RunRecord) => number | null;
|
|
73
|
-
/**
|
|
74
|
-
* The held-out ground-truth metric. For RL on coding, this is typically
|
|
75
|
-
* test pass-rate. For RLHF, it's downstream task performance or human
|
|
76
|
-
* preference. For knowledge tasks, it's an independently-graded score.
|
|
77
|
-
*/
|
|
78
|
-
truthOf?: (run: RunRecord) => number | null;
|
|
79
|
-
/**
|
|
80
|
-
* Independent secondary reward. Used for the `reward_disagreement`
|
|
81
|
-
* signal. Default uses the verifiable reward extractor (deterministic
|
|
82
|
-
* sources only).
|
|
83
|
-
*/
|
|
84
|
-
secondaryRewardOf?: (run: RunRecord) => number | null;
|
|
85
|
-
/**
|
|
86
|
-
* Window size — how many of the most recent runs count as the "after"
|
|
87
|
-
* cohort. Default min(50, half the runs).
|
|
88
|
-
*/
|
|
89
|
-
windowSize?: number;
|
|
90
|
-
/**
|
|
91
|
-
* Severity threshold to flag a signal. Default 0.3 (suspect) and 0.6
|
|
92
|
-
* (gaming).
|
|
93
|
-
*/
|
|
94
|
-
thresholds?: {
|
|
95
|
-
suspect?: number;
|
|
96
|
-
gaming?: number;
|
|
97
|
-
};
|
|
98
|
-
/**
|
|
99
|
-
* Verifiable-reward options used for the secondary-reward fallback.
|
|
100
|
-
*/
|
|
101
|
-
verifiableRewardOptions?: VerifiableRewardExtractionOptions;
|
|
102
|
-
}
|
|
103
|
-
export declare function detectRewardHacking(input: DetectRewardHackingInput): RewardHackingReport;
|
|
104
|
-
//# sourceMappingURL=reward-hacking.d.ts.map
|
|
@@ -1 +0,0 @@
|
|
|
1
|
-
{"version":3,"file":"reward-hacking.d.ts","sourceRoot":"","sources":["../../src/rl/reward-hacking.ts"],"names":[],"mappings":"AAAA;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;GAqCG;AAEH,OAAO,KAAK,EAAE,SAAS,EAAE,MAAM,eAAe,CAAA;AAC9C,OAAO,EAEL,KAAK,iCAAiC,EACvC,MAAM,qBAAqB,CAAA;AAE5B,MAAM,MAAM,mBAAmB,GAC3B,mBAAmB,GACnB,oBAAoB,GACpB,qBAAqB,GACrB,aAAa,CAAA;AAEjB,MAAM,WAAW,oBAAoB;IACnC,MAAM,EAAE,mBAAmB,CAAA;IAC3B,gDAAgD;IAChD,QAAQ,EAAE,MAAM,CAAA;IAChB,OAAO,EAAE,MAAM,CAAA;IACf,gDAAgD;IAChD,MAAM,EAAE,MAAM,CAAC,MAAM,EAAE,MAAM,CAAC,CAAA;CAC/B;AAED,MAAM,WAAW,mBAAmB;IAClC,QAAQ,EAAE,oBAAoB,EAAE,CAAA;IAChC;;;OAGG;IACH,OAAO,EAAE,OAAO,GAAG,SAAS,GAAG,QAAQ,CAAA;IACvC,mEAAmE;IACnE,SAAS,EAAE,MAAM,EAAE,CAAA;IACnB,kEAAkE;IAClE,CAAC,EAAE,MAAM,CAAA;CACV;AAED,MAAM,WAAW,wBAAwB;IACvC;;;OAGG;IACH,IAAI,EAAE,SAAS,EAAE,CAAA;IACjB;;;OAGG;IACH,OAAO,CAAC,EAAE,CAAC,GAAG,EAAE,SAAS,KAAK,MAAM,GAAG,IAAI,CAAA;IAC3C;;;;OAIG;IACH,OAAO,CAAC,EAAE,CAAC,GAAG,EAAE,SAAS,KAAK,MAAM,GAAG,IAAI,CAAA;IAC3C;;;;OAIG;IACH,iBAAiB,CAAC,EAAE,CAAC,GAAG,EAAE,SAAS,KAAK,MAAM,GAAG,IAAI,CAAA;IACrD;;;OAGG;IACH,UAAU,CAAC,EAAE,MAAM,CAAA;IACnB;;;OAGG;IACH,UAAU,CAAC,EAAE;QAAE,OAAO,CAAC,EAAE,MAAM,CAAC;QAAC,MAAM,CAAC,EAAE,MAAM,CAAA;KAAE,CAAA;IAClD;;OAEG;IACH,uBAAuB,CAAC,EAAE,iCAAiC,CAAA;CAC5D;AAOD,wBAAgB,mBAAmB,CAAC,KAAK,EAAE,wBAAwB,GAAG,mBAAmB,CA6IxF"}
|
package/dist/rl/rl-campaign.d.ts
DELETED
|
@@ -1,85 +0,0 @@
|
|
|
1
|
-
/**
|
|
2
|
-
* `runRLCampaign` — top-level orchestrator that runs the matrix and
|
|
3
|
-
* produces every RL-ready artifact in one call.
|
|
4
|
-
*
|
|
5
|
-
* Wires:
|
|
6
|
-
* 1. `runEvalCampaign` for the matrix run (capture, integrity, hooks)
|
|
7
|
-
* 2. `extractVerifiableReward` over each run, separating deterministic
|
|
8
|
-
* from probabilistic reward sources for the trainer
|
|
9
|
-
* 3. `extractPreferences` to produce DPO/PPO/KTO triples
|
|
10
|
-
* 4. `evaluateInterimReleaseConfidence` over paired deltas (anytime-valid)
|
|
11
|
-
* 5. `rubricPredictiveValidity` against an outcome store, when provided
|
|
12
|
-
* 6. `detectRewardHacking` as a standing hygiene check
|
|
13
|
-
* 7. Trainer-format export rows ready for prime-rl / TRL / verl
|
|
14
|
-
*
|
|
15
|
-
* The output `RLCampaignResult` is a single, audit-ready artifact: every
|
|
16
|
-
* stage's output is in there. The consumer's downstream fits in a single
|
|
17
|
-
* line: pass `result.preferences` to their DPO trainer, `result.grpoRows`
|
|
18
|
-
* to GRPO, `result.runs` plus `result.rewardSignals` to a custom RL loop.
|
|
19
|
-
*/
|
|
20
|
-
import { type EvalCampaignOptions, type EvalCampaignResult } from '../eval-campaign';
|
|
21
|
-
import type { OutcomeStore } from '../meta-eval/outcome-store';
|
|
22
|
-
import { type RubricPredictiveValidityReport } from '../meta-eval/rubric-predictive-validity';
|
|
23
|
-
import { type InterimReleaseConfidence } from '../sequential';
|
|
24
|
-
import { type DpoExportRow, type DpoLookups, type GrpoExportRow, type GrpoLookups, type SftExportRow, type SftLookups } from './exporters';
|
|
25
|
-
import { type ExtractPreferencesOptions, type PreferenceExtractionReport } from './preferences';
|
|
26
|
-
import { type RewardHackingReport } from './reward-hacking';
|
|
27
|
-
import { type VerifiableReward, type VerifiableRewardExtractionOptions } from './verifiable-reward';
|
|
28
|
-
export interface RunRLCampaignOptions<V> extends EvalCampaignOptions<V> {
|
|
29
|
-
/** Preference-extraction options. Default uses paired-by-scenario-and-seed with min-margin 0.05. */
|
|
30
|
-
preferences?: ExtractPreferencesOptions;
|
|
31
|
-
/** Verifiable-reward extraction options. */
|
|
32
|
-
verifiableReward?: VerifiableRewardExtractionOptions;
|
|
33
|
-
/** Outcome store + metric names — when supplied, runs `rubricPredictiveValidity` post-campaign. */
|
|
34
|
-
outcomeStore?: OutcomeStore;
|
|
35
|
-
outcomeMetrics?: string[];
|
|
36
|
-
/** Anytime-valid sequential evaluation options. */
|
|
37
|
-
sequential?: {
|
|
38
|
-
alpha?: number;
|
|
39
|
-
bound?: number;
|
|
40
|
-
rope?: {
|
|
41
|
-
low: number;
|
|
42
|
-
high: number;
|
|
43
|
-
};
|
|
44
|
-
};
|
|
45
|
-
/** Trainer-format export lookups. When provided, the orchestrator builds the corresponding rows. */
|
|
46
|
-
trainerExport?: {
|
|
47
|
-
dpo?: DpoLookups;
|
|
48
|
-
grpo?: GrpoLookups;
|
|
49
|
-
sft?: SftLookups;
|
|
50
|
-
};
|
|
51
|
-
}
|
|
52
|
-
export interface RLCampaignResult<V> {
|
|
53
|
-
campaign: EvalCampaignResult;
|
|
54
|
-
/** Per-run verifiable reward (deterministic when available, probabilistic fallback otherwise). */
|
|
55
|
-
rewardSignals: Array<{
|
|
56
|
-
runId: string;
|
|
57
|
-
reward: VerifiableReward | null;
|
|
58
|
-
}>;
|
|
59
|
-
/** Preference extraction report. */
|
|
60
|
-
preferences: PreferenceExtractionReport;
|
|
61
|
-
/** Anytime-valid interim verdict over the paired deltas (vs comparator). */
|
|
62
|
-
interimConfidence: InterimReleaseConfidence | null;
|
|
63
|
-
/** Standing reward-hacking hygiene check. */
|
|
64
|
-
rewardHacking: RewardHackingReport;
|
|
65
|
-
/** Predictive validity, when an outcome store was supplied. */
|
|
66
|
-
predictiveValidity: RubricPredictiveValidityReport | null;
|
|
67
|
-
/** Trainer-export rows, populated only for the formats the caller requested via `trainerExport`. */
|
|
68
|
-
trainerRows: {
|
|
69
|
-
dpo?: DpoExportRow[];
|
|
70
|
-
grpo?: GrpoExportRow[];
|
|
71
|
-
sft?: SftExportRow[];
|
|
72
|
-
};
|
|
73
|
-
/**
|
|
74
|
-
* One-line top-level summary the consumer can log.
|
|
75
|
-
*/
|
|
76
|
-
summary: string;
|
|
77
|
-
/**
|
|
78
|
-
* Convenience type-tag — consumers can branch on `result.kind`.
|
|
79
|
-
*/
|
|
80
|
-
kind: 'agent-eval-rl-campaign';
|
|
81
|
-
unusedVariant?: V;
|
|
82
|
-
}
|
|
83
|
-
export declare function runRLCampaign<V>(opts: RunRLCampaignOptions<V>): Promise<RLCampaignResult<V>>;
|
|
84
|
-
export { runEvalCampaign } from '../eval-campaign';
|
|
85
|
-
//# sourceMappingURL=rl-campaign.d.ts.map
|
|
@@ -1 +0,0 @@
|
|
|
1
|
-
{"version":3,"file":"rl-campaign.d.ts","sourceRoot":"","sources":["../../src/rl/rl-campaign.ts"],"names":[],"mappings":"AAAA;;;;;;;;;;;;;;;;;;GAkBG;AAEH,OAAO,EACL,KAAK,mBAAmB,EACxB,KAAK,kBAAkB,EAExB,MAAM,kBAAkB,CAAA;AACzB,OAAO,KAAK,EAAE,YAAY,EAAE,MAAM,4BAA4B,CAAA;AAC9D,OAAO,EACL,KAAK,8BAA8B,EAEpC,MAAM,yCAAyC,CAAA;AAEhD,OAAO,EAAoC,KAAK,wBAAwB,EAAE,MAAM,eAAe,CAAA;AAC/F,OAAO,EACL,KAAK,YAAY,EACjB,KAAK,UAAU,EACf,KAAK,aAAa,EAClB,KAAK,WAAW,EAChB,KAAK,YAAY,EACjB,KAAK,UAAU,EAIhB,MAAM,aAAa,CAAA;AACpB,OAAO,EACL,KAAK,yBAAyB,EAE9B,KAAK,0BAA0B,EAChC,MAAM,eAAe,CAAA;AACtB,OAAO,EAAuB,KAAK,mBAAmB,EAAE,MAAM,kBAAkB,CAAA;AAChF,OAAO,EAEL,KAAK,gBAAgB,EACrB,KAAK,iCAAiC,EACvC,MAAM,qBAAqB,CAAA;AAE5B,MAAM,WAAW,oBAAoB,CAAC,CAAC,CAAE,SAAQ,mBAAmB,CAAC,CAAC,CAAC;IACrE,oGAAoG;IACpG,WAAW,CAAC,EAAE,yBAAyB,CAAA;IACvC,4CAA4C;IAC5C,gBAAgB,CAAC,EAAE,iCAAiC,CAAA;IACpD,mGAAmG;IACnG,YAAY,CAAC,EAAE,YAAY,CAAA;IAC3B,cAAc,CAAC,EAAE,MAAM,EAAE,CAAA;IACzB,mDAAmD;IACnD,UAAU,CAAC,EAAE;QAAE,KAAK,CAAC,EAAE,MAAM,CAAC;QAAC,KAAK,CAAC,EAAE,MAAM,CAAC;QAAC,IAAI,CAAC,EAAE;YAAE,GAAG,EAAE,MAAM,CAAC;YAAC,IAAI,EAAE,MAAM,CAAA;SAAE,CAAA;KAAE,CAAA;IACrF,oGAAoG;IACpG,aAAa,CAAC,EAAE;QACd,GAAG,CAAC,EAAE,UAAU,CAAA;QAChB,IAAI,CAAC,EAAE,WAAW,CAAA;QAClB,GAAG,CAAC,EAAE,UAAU,CAAA;KACjB,CAAA;CACF;AAED,MAAM,WAAW,gBAAgB,CAAC,CAAC;IACjC,QAAQ,EAAE,kBAAkB,CAAA;IAC5B,kGAAkG;IAClG,aAAa,EAAE,KAAK,CAAC;QAAE,KAAK,EAAE,MAAM,CAAC;QAAC,MAAM,EAAE,gBAAgB,GAAG,IAAI,CAAA;KAAE,CAAC,CAAA;IACxE,oCAAoC;IACpC,WAAW,EAAE,0BAA0B,CAAA;IACvC,4EAA4E;IAC5E,iBAAiB,EAAE,wBAAwB,GAAG,IAAI,CAAA;IAClD,6CAA6C;IAC7C,aAAa,EAAE,mBAAmB,CAAA;IAClC,+DAA+D;IAC/D,kBAAkB,EAAE,8BAA8B,GAAG,IAAI,CAAA;IACzD,oGAAoG;IACpG,WAAW,EAAE;QACX,GAAG,CAAC,EAAE,YAAY,EAAE,CAAA;QACpB,IAAI,CAAC,EAAE,aAAa,EAAE,CAAA;QACtB,GAAG,CAAC,EAAE,YAAY,EAAE,CAAA;KACrB,CAAA;IACD;;OAEG;IACH,OAAO,EAAE,MAAM,CAAA;IACf;;OAEG;IACH,IAAI,EAAE,wBAAwB,CAAA;IAC9B,aAAa,CAAC,EAAE,CAAC,CAAA;CAClB;AAED,wBAAsB,aAAa,CAAC,CAAC,EACnC,IAAI,EAAE,oBAAoB,CAAC,CAAC,CAAC,GAC5B,OAAO,CAAC,gBAAgB,CAAC,CAAC,CAAC,CAAC,CAgF9B;AAmED,OAAO,EAAE,eAAe,EAAE,MAAM,kBAAkB,CAAA"}
|
|
@@ -1,56 +0,0 @@
|
|
|
1
|
-
/**
|
|
2
|
-
* Adapters: convert measurement outputs into the canonical `RunRecord[]`
|
|
3
|
-
* artifact that `replayCache`, `pairedEvalueSequence`, and
|
|
4
|
-
* `rubricPredictiveValidity` consume. Two sources:
|
|
5
|
-
* - `campaignToRunRecords` — the campaign substrate's per-cell results
|
|
6
|
-
* (the modern path: `runCampaign` / `runImprovementLoop` → records).
|
|
7
|
-
* - `verificationReportToRunRecord` — a `MultiLayerVerifier` report.
|
|
8
|
-
*
|
|
9
|
-
* Adapters are thin and explicit — every mandatory `RunRecord` field comes
|
|
10
|
-
* from a caller-supplied context (`commitSha`, `model`, `promptHash`,
|
|
11
|
-
* `configHash`) plus the cell's runtime data. The validator still rejects
|
|
12
|
-
* bare-alias model strings — the caller snapshot-pins.
|
|
13
|
-
*/
|
|
14
|
-
import type { CampaignResult } from '../campaign';
|
|
15
|
-
import type { VerificationReport } from '../multi-layer-verifier';
|
|
16
|
-
import type { RunRecord, RunSplitTag } from '../run-record';
|
|
17
|
-
export interface AdapterContext {
|
|
18
|
-
/** Logical experiment id — typically the campaign or sweep identifier. */
|
|
19
|
-
experimentId: string;
|
|
20
|
-
/** Snapshot model id (e.g. `claude-sonnet-4-6@2025-04-15`). */
|
|
21
|
-
model: string;
|
|
22
|
-
/** Git SHA the harness was run from. */
|
|
23
|
-
commitSha: string;
|
|
24
|
-
/** Hash of the effective prompt sent to the model. */
|
|
25
|
-
promptHash: string;
|
|
26
|
-
/** Hash of the effective config (model, temperature, tools, judges, splits). */
|
|
27
|
-
configHash: string;
|
|
28
|
-
/** Default split tag. Default `'search'`. */
|
|
29
|
-
splitTag?: RunSplitTag;
|
|
30
|
-
/** Default cost in USD when the source doesn't record one. Default `0`. */
|
|
31
|
-
defaultCostUsd?: number;
|
|
32
|
-
}
|
|
33
|
-
/**
|
|
34
|
-
* Convert a `CampaignResult` into canonical `RunRecord[]` — one record per
|
|
35
|
-
* scored cell. The cell's mean judge composite becomes the split score; every
|
|
36
|
-
* judge dimension is carried through to `outcome.raw`. A cell that errored
|
|
37
|
-
* becomes a record with `failureMode: 'cell_error'` (kept, not dropped — an
|
|
38
|
-
* unscored cell is signal). `candidateId` identifies the measured surface
|
|
39
|
-
* (defaults to the campaign manifest hash).
|
|
40
|
-
*/
|
|
41
|
-
export declare function campaignToRunRecords(campaign: CampaignResult, ctx: AdapterContext & {
|
|
42
|
-
candidateId?: string;
|
|
43
|
-
}): RunRecord[];
|
|
44
|
-
/**
|
|
45
|
-
* Convert a `MultiLayerVerifier` `VerificationReport` into a `RunRecord`.
|
|
46
|
-
* `outcome.searchScore` (or `holdoutScore`) is `report.blendedScore`;
|
|
47
|
-
* `outcome.raw` carries every layer's score + a pass indicator; `failureMode`
|
|
48
|
-
* is the first failing layer's reason.
|
|
49
|
-
*/
|
|
50
|
-
export declare function verificationReportToRunRecord(report: VerificationReport, ctx: AdapterContext & {
|
|
51
|
-
candidateId: string;
|
|
52
|
-
scenarioId?: string;
|
|
53
|
-
}, opts?: {
|
|
54
|
-
runId?: string;
|
|
55
|
-
}): RunRecord;
|
|
56
|
-
//# sourceMappingURL=run-record-adapters.d.ts.map
|
|
@@ -1 +0,0 @@
|
|
|
1
|
-
{"version":3,"file":"run-record-adapters.d.ts","sourceRoot":"","sources":["../../src/rl/run-record-adapters.ts"],"names":[],"mappings":"AAAA;;;;;;;;;;;;GAYG;AAEH,OAAO,KAAK,EAAE,cAAc,EAAE,MAAM,aAAa,CAAA;AACjD,OAAO,KAAK,EAAe,kBAAkB,EAAE,MAAM,yBAAyB,CAAA;AAC9E,OAAO,KAAK,EAAE,SAAS,EAAE,WAAW,EAAE,MAAM,eAAe,CAAA;AAE3D,MAAM,WAAW,cAAc;IAC7B,0EAA0E;IAC1E,YAAY,EAAE,MAAM,CAAA;IACpB,+DAA+D;IAC/D,KAAK,EAAE,MAAM,CAAA;IACb,wCAAwC;IACxC,SAAS,EAAE,MAAM,CAAA;IACjB,sDAAsD;IACtD,UAAU,EAAE,MAAM,CAAA;IAClB,gFAAgF;IAChF,UAAU,EAAE,MAAM,CAAA;IAClB,6CAA6C;IAC7C,QAAQ,CAAC,EAAE,WAAW,CAAA;IACtB,2EAA2E;IAC3E,cAAc,CAAC,EAAE,MAAM,CAAA;CACxB;AAED;;;;;;;GAOG;AACH,wBAAgB,oBAAoB,CAClC,QAAQ,EAAE,cAAc,EACxB,GAAG,EAAE,cAAc,GAAG;IAAE,WAAW,CAAC,EAAE,MAAM,CAAA;CAAE,GAC7C,SAAS,EAAE,CAmCb;AAED;;;;;GAKG;AACH,wBAAgB,6BAA6B,CAC3C,MAAM,EAAE,kBAAkB,EAC1B,GAAG,EAAE,cAAc,GAAG;IAAE,WAAW,EAAE,MAAM,CAAC;IAAC,UAAU,CAAC,EAAE,MAAM,CAAA;CAAE,EAClE,IAAI,GAAE;IAAE,KAAK,CAAC,EAAE,MAAM,CAAA;CAAO,GAC5B,SAAS,CA4CX"}
|
|
@@ -1,166 +0,0 @@
|
|
|
1
|
-
/**
|
|
2
|
-
* Simulator fidelity — score a user SIMULATOR's realism against real-user
|
|
3
|
-
* trace distributions.
|
|
4
|
-
*
|
|
5
|
-
* Synthetic-persona evals (`PersonaConfig`-driven canonical evals, fuzz
|
|
6
|
-
* user-simulator objectives) stand in for real users in most of the numbers
|
|
7
|
-
* we publish. The standing threat is the Sim2Real gap: a simulator that is
|
|
8
|
-
* distributionally unlike production creates "easy mode" and silently
|
|
9
|
-
* inflates every score built on it. This module measures that gap from the
|
|
10
|
-
* SAME artifact both sides already produce — `RunRecord`s — so no new
|
|
11
|
-
* capture pipeline is needed:
|
|
12
|
-
*
|
|
13
|
-
* - `simFidelityReport` — per-feature Jensen-Shannon divergence between
|
|
14
|
-
* simulated and production record distributions, collapsed into a
|
|
15
|
-
* fidelity coefficient in [0,1].
|
|
16
|
-
* - `easyModeCheck` — the headline academic failure mode (sim inflates
|
|
17
|
-
* pass-rate over production) as its own named artifact.
|
|
18
|
-
*
|
|
19
|
-
* Every synthetic-persona eval result should publish its fidelity
|
|
20
|
-
* coefficient alongside the score — a number from an unrepresentative
|
|
21
|
-
* simulator is an unlabeled estimate. Wire-in points:
|
|
22
|
-
*
|
|
23
|
-
* - canonical persona evals: pass the campaign's `RunRecord`s as
|
|
24
|
-
* `simulated` and intake-adapter output (`contract/intake`: OTel spans,
|
|
25
|
-
* feedback tables, coding-agent sessions) as `production`
|
|
26
|
-
* - the fuzz user-sim objective: use `1 - report.fidelity` as a realism
|
|
27
|
-
* penalty when searching over generated personas
|
|
28
|
-
* - the durable corpus (`./corpus`): both sides read straight from
|
|
29
|
-
* `readCorpus` — tag sim vs production by `experimentId`
|
|
30
|
-
*/
|
|
31
|
-
import type { RunRecord } from '../run-record';
|
|
32
|
-
/** Extracts a flat behavioral feature map from one record. `string` values
|
|
33
|
-
* are categorical, `number` values are quantile-bucketed over the union of
|
|
34
|
-
* both sides, `null` means the feature is absent on this record and is
|
|
35
|
-
* counted explicitly as its own category (never silently dropped). */
|
|
36
|
-
export type BehaviorFeatures = (record: RunRecord) => Record<string, string | number | null>;
|
|
37
|
-
/** Reserved histogram category for `null` feature values. A capture-rate
|
|
38
|
-
* difference (one side instruments a signal, the other does not) registers
|
|
39
|
-
* as divergence by design: a simulator that produces no tool traces is not
|
|
40
|
-
* representative of production that does. */
|
|
41
|
-
export declare const ABSENT_CATEGORY = "(absent)";
|
|
42
|
-
/** Minimum non-null observations PER SIDE for a feature to enter the
|
|
43
|
-
* fidelity mean. Below this the JSD estimate is sampling noise. */
|
|
44
|
-
export declare const DEFAULT_MIN_N_PER_FEATURE = 20;
|
|
45
|
-
/** Quantile buckets used to discretize numeric features. Quartiles balance
|
|
46
|
-
* resolution against per-bucket sample size at the default minN. */
|
|
47
|
-
export declare const DEFAULT_QUANTILE_BUCKETS = 4;
|
|
48
|
-
/** Fidelity at or above this → 'representative'; below → 'skewed'.
|
|
49
|
-
* 1 − 0.8 = mean JSD 0.2 ≈ distributions that mostly overlap with one
|
|
50
|
-
* clearly shifted mode — the point where per-feature shifts start changing
|
|
51
|
-
* which failure classes an eval can even observe. */
|
|
52
|
-
export declare const REPRESENTATIVE_MIN_FIDELITY = 0.8;
|
|
53
|
-
/**
|
|
54
|
-
* Default feature set — ONLY fields verified present on both simulated and
|
|
55
|
-
* production records:
|
|
56
|
-
*
|
|
57
|
-
* - `score`, `wall_ms`, `output_tokens` — mandatory per the `RunRecord`
|
|
58
|
-
* validator (non-finite values read as absent rather than poisoning a
|
|
59
|
-
* bucket).
|
|
60
|
-
* - `failure_class` — optional taxonomy field; absent counted explicitly.
|
|
61
|
-
* - `turn_count`, `tool_errors`, `tool_error_recovery` — derived from the
|
|
62
|
-
* `outcome.raw` counters the intake adapters and eval harnesses write
|
|
63
|
-
* (`turns_completed`, `assistant_messages`, `tool_errors`,
|
|
64
|
-
* `turns_aborted`); absent on records whose producer did not capture
|
|
65
|
-
* them, counted explicitly.
|
|
66
|
-
* - `completion_length` — from the optional `CorpusRecord` trajectory
|
|
67
|
-
* text; the message-length proxy when records come from the corpus.
|
|
68
|
-
*
|
|
69
|
-
* `RunRecord` carries event COUNTS, not event ordering, so
|
|
70
|
-
* `tool_error_recovery` is a counts-only derivation: errors occurred and the
|
|
71
|
-
* run still completed cleanly ('recovered') vs aborted or classified as a
|
|
72
|
-
* failure ('unrecovered') — not a literal error→retry sequence check.
|
|
73
|
-
*/
|
|
74
|
-
export declare const defaultBehaviorFeatures: BehaviorFeatures;
|
|
75
|
-
/**
|
|
76
|
-
* Jensen-Shannon divergence between two categorical histograms (raw counts;
|
|
77
|
-
* normalized internally). Log base 2 → bounded [0,1]: 0 = identical
|
|
78
|
-
* distributions, 1 = disjoint support. Symmetric, defined even where the
|
|
79
|
-
* supports differ — exactly the regime sim-vs-production comparison lives in.
|
|
80
|
-
* Throws on zero-mass or negative/non-finite counts: an empty histogram has
|
|
81
|
-
* no distribution and a silent 0 would read as "perfectly representative".
|
|
82
|
-
*/
|
|
83
|
-
export declare function jsDivergence(p: Record<string, number>, q: Record<string, number>): number;
|
|
84
|
-
/**
|
|
85
|
-
* Deterministic quantile edges over a value set (the UNION of both sides, so
|
|
86
|
-
* sim and production land in the same buckets). Linear interpolation between
|
|
87
|
-
* order statistics; duplicate edges from heavy ties collapse into fewer,
|
|
88
|
-
* wider buckets. Returns `bucketCount - 1` edges before deduplication.
|
|
89
|
-
*/
|
|
90
|
-
export declare function quantileEdges(values: number[], bucketCount?: number): number[];
|
|
91
|
-
/** Stable half-open bucket label for a value against quantile edges:
|
|
92
|
-
* `[-inf,e0)`, `[e0,e1)`, …, `[eLast,+inf)`. */
|
|
93
|
-
export declare function bucketLabel(value: number, edges: number[]): string;
|
|
94
|
-
export interface FeatureShift {
|
|
95
|
-
/** Category label (a string value, a numeric bucket, or `ABSENT_CATEGORY`). */
|
|
96
|
-
value: string;
|
|
97
|
-
/** Probability of this category among ALL simulated records (nulls included
|
|
98
|
-
* via `ABSENT_CATEGORY`, so each side's shifts sum to 1). */
|
|
99
|
-
pSim: number;
|
|
100
|
-
/** Probability among ALL production records. */
|
|
101
|
-
pProd: number;
|
|
102
|
-
}
|
|
103
|
-
export interface FeatureDivergence {
|
|
104
|
-
feature: string;
|
|
105
|
-
/** Jensen-Shannon divergence in [0,1] for this feature. */
|
|
106
|
-
divergence: number;
|
|
107
|
-
/** Largest |pSim − pProd| categories, descending — where the sim deviates. */
|
|
108
|
-
topShifts: FeatureShift[];
|
|
109
|
-
/** Non-null observations on the simulated side. */
|
|
110
|
-
nSim: number;
|
|
111
|
-
/** Non-null observations on the production side. */
|
|
112
|
-
nProd: number;
|
|
113
|
-
}
|
|
114
|
-
export type FidelityVerdict = 'representative' | 'skewed' | 'insufficient-data';
|
|
115
|
-
export interface FidelityReport {
|
|
116
|
-
perDimension: FeatureDivergence[];
|
|
117
|
-
/** 1 − mean divergence over features with sufficient data. NaN when the
|
|
118
|
-
* verdict is 'insufficient-data' — a 0 would read as "maximally skewed"
|
|
119
|
-
* and silently poison downstream aggregation; check `verdict` first. */
|
|
120
|
-
fidelity: number;
|
|
121
|
-
/** Features excluded because either side had fewer than `minNPerFeature`
|
|
122
|
-
* non-null observations. Named, never silently dropped. */
|
|
123
|
-
insufficientData: string[];
|
|
124
|
-
/** 'representative' when fidelity >= REPRESENTATIVE_MIN_FIDELITY (0.8),
|
|
125
|
-
* 'skewed' below, 'insufficient-data' when no feature met minN. */
|
|
126
|
-
verdict: FidelityVerdict;
|
|
127
|
-
}
|
|
128
|
-
export interface SimFidelityOptions {
|
|
129
|
-
/** Feature extractor. Defaults to `defaultBehaviorFeatures`. */
|
|
130
|
-
features?: BehaviorFeatures;
|
|
131
|
-
/** Minimum non-null observations per side per feature. Default 20. */
|
|
132
|
-
minNPerFeature?: number;
|
|
133
|
-
}
|
|
134
|
-
/**
|
|
135
|
-
* Compare a simulator's RunRecords against production RunRecords, feature by
|
|
136
|
-
* feature. Numeric features are bucketed by deterministic quantiles of the
|
|
137
|
-
* union; nulls count as an explicit `ABSENT_CATEGORY`. Throws on empty
|
|
138
|
-
* inputs — "no records" is a wiring error, not a distribution.
|
|
139
|
-
*/
|
|
140
|
-
export declare function simFidelityReport(simulated: RunRecord[], production: RunRecord[], opts?: SimFidelityOptions): FidelityReport;
|
|
141
|
-
export interface EasyModeOptions {
|
|
142
|
-
/** A run passes when its score (holdout, else search) >= this. Default 0.5
|
|
143
|
-
* — matches the pass-threshold convention across the rl/ primitives. */
|
|
144
|
-
passThreshold?: number;
|
|
145
|
-
/** Pass-rate gap above which the sim is flagged inflated. Default 0.1 —
|
|
146
|
-
* a 10-point inflation is enough to flip most promotion gates. */
|
|
147
|
-
inflationTolerance?: number;
|
|
148
|
-
}
|
|
149
|
-
export interface EasyModeReport {
|
|
150
|
-
simPassRate: number;
|
|
151
|
-
prodPassRate: number;
|
|
152
|
-
/** simPassRate − prodPassRate. Positive = the simulator is easier than reality. */
|
|
153
|
-
gap: number;
|
|
154
|
-
/** True when gap > inflationTolerance: numbers measured against this
|
|
155
|
-
* simulator overstate production performance. */
|
|
156
|
-
inflated: boolean;
|
|
157
|
-
}
|
|
158
|
-
/**
|
|
159
|
-
* The headline simulator failure mode as its own named artifact: a simulator
|
|
160
|
-
* that creates "easy mode" inflates pass-rate relative to production, and
|
|
161
|
-
* every score measured against it overstates reality. Throws on empty inputs
|
|
162
|
-
* and on records carrying neither score — a silently-skipped record would
|
|
163
|
-
* bias the very rate this check exists to keep honest.
|
|
164
|
-
*/
|
|
165
|
-
export declare function easyModeCheck(simulated: RunRecord[], production: RunRecord[], opts?: EasyModeOptions): EasyModeReport;
|
|
166
|
-
//# sourceMappingURL=sim-fidelity.d.ts.map
|
|
@@ -1 +0,0 @@
|
|
|
1
|
-
{"version":3,"file":"sim-fidelity.d.ts","sourceRoot":"","sources":["../../src/rl/sim-fidelity.ts"],"names":[],"mappings":"AAAA;;;;;;;;;;;;;;;;;;;;;;;;;;;;;GA6BG;AAGH,OAAO,KAAK,EAAE,SAAS,EAAE,MAAM,eAAe,CAAA;AAI9C;;;uEAGuE;AACvE,MAAM,MAAM,gBAAgB,GAAG,CAAC,MAAM,EAAE,SAAS,KAAK,MAAM,CAAC,MAAM,EAAE,MAAM,GAAG,MAAM,GAAG,IAAI,CAAC,CAAA;AAE5F;;;8CAG8C;AAC9C,eAAO,MAAM,eAAe,aAAa,CAAA;AAEzC;oEACoE;AACpE,eAAO,MAAM,yBAAyB,KAAK,CAAA;AAE3C;qEACqE;AACrE,eAAO,MAAM,wBAAwB,IAAI,CAAA;AAEzC;;;sDAGsD;AACtD,eAAO,MAAM,2BAA2B,MAAM,CAAA;AAI9C;;;;;;;;;;;;;;;;;;;;GAoBG;AACH,eAAO,MAAM,uBAAuB,EAAE,gBAerC,CAAA;AAoBD;;;;;;;GAOG;AACH,wBAAgB,YAAY,CAAC,CAAC,EAAE,MAAM,CAAC,MAAM,EAAE,MAAM,CAAC,EAAE,CAAC,EAAE,MAAM,CAAC,MAAM,EAAE,MAAM,CAAC,GAAG,MAAM,CA6BzF;AAED;;;;;GAKG;AACH,wBAAgB,aAAa,CAAC,MAAM,EAAE,MAAM,EAAE,EAAE,WAAW,SAA2B,GAAG,MAAM,EAAE,CAkBhG;AAED;iDACiD;AACjD,wBAAgB,WAAW,CAAC,KAAK,EAAE,MAAM,EAAE,KAAK,EAAE,MAAM,EAAE,GAAG,MAAM,CAMlE;AAID,MAAM,WAAW,YAAY;IAC3B,+EAA+E;IAC/E,KAAK,EAAE,MAAM,CAAA;IACb;kEAC8D;IAC9D,IAAI,EAAE,MAAM,CAAA;IACZ,gDAAgD;IAChD,KAAK,EAAE,MAAM,CAAA;CACd;AAED,MAAM,WAAW,iBAAiB;IAChC,OAAO,EAAE,MAAM,CAAA;IACf,2DAA2D;IAC3D,UAAU,EAAE,MAAM,CAAA;IAClB,8EAA8E;IAC9E,SAAS,EAAE,YAAY,EAAE,CAAA;IACzB,mDAAmD;IACnD,IAAI,EAAE,MAAM,CAAA;IACZ,oDAAoD;IACpD,KAAK,EAAE,MAAM,CAAA;CACd;AAED,MAAM,MAAM,eAAe,GAAG,gBAAgB,GAAG,QAAQ,GAAG,mBAAmB,CAAA;AAE/E,MAAM,WAAW,cAAc;IAC7B,YAAY,EAAE,iBAAiB,EAAE,CAAA;IACjC;;6EAEyE;IACzE,QAAQ,EAAE,MAAM,CAAA;IAChB;gEAC4D;IAC5D,gBAAgB,EAAE,MAAM,EAAE,CAAA;IAC1B;wEACoE;IACpE,OAAO,EAAE,eAAe,CAAA;CACzB;AAED,MAAM,WAAW,kBAAkB;IACjC,gEAAgE;IAChE,QAAQ,CAAC,EAAE,gBAAgB,CAAA;IAC3B,sEAAsE;IACtE,cAAc,CAAC,EAAE,MAAM,CAAA;CACxB;AAED;;;;;GAKG;AACH,wBAAgB,iBAAiB,CAC/B,SAAS,EAAE,SAAS,EAAE,EACtB,UAAU,EAAE,SAAS,EAAE,EACvB,IAAI,GAAE,kBAAuB,GAC5B,cAAc,CA0DhB;AA6DD,MAAM,WAAW,eAAe;IAC9B;6EACyE;IACzE,aAAa,CAAC,EAAE,MAAM,CAAA;IACtB;uEACmE;IACnE,kBAAkB,CAAC,EAAE,MAAM,CAAA;CAC5B;AAED,MAAM,WAAW,cAAc;IAC7B,WAAW,EAAE,MAAM,CAAA;IACnB,YAAY,EAAE,MAAM,CAAA;IACpB,mFAAmF;IACnF,GAAG,EAAE,MAAM,CAAA;IACX;sDACkD;IAClD,QAAQ,EAAE,OAAO,CAAA;CAClB;AAED;;;;;;GAMG;AACH,wBAAgB,aAAa,CAC3B,SAAS,EAAE,SAAS,EAAE,EACtB,UAAU,EAAE,SAAS,EAAE,EACvB,IAAI,GAAE,eAAoB,GACzB,cAAc,CA0BhB"}
|
|
@@ -1 +0,0 @@
|
|
|
1
|
-
{"version":3,"file":"sim-fidelity.test.d.ts","sourceRoot":"","sources":["../../src/rl/sim-fidelity.test.ts"],"names":[],"mappings":""}
|
package/dist/rl/tournament.d.ts
DELETED
|
@@ -1,115 +0,0 @@
|
|
|
1
|
-
/**
|
|
2
|
-
* Bradley-Terry / Elo tournament evaluation.
|
|
3
|
-
*
|
|
4
|
-
* For multi-candidate sweeps, comparing every candidate's score against
|
|
5
|
-
* a fixed comparator wastes information — the comparator becomes a high-
|
|
6
|
-
* variance reference and rank flips between near-tied middle-rank
|
|
7
|
-
* candidates are dominated by noise. Pairwise tournaments fix this:
|
|
8
|
-
* every (i, j) pair contributes a comparison to a Bradley-Terry MLE that
|
|
9
|
-
* estimates each candidate's strength on a unified scale.
|
|
10
|
-
*
|
|
11
|
-
* For online updating (rolling campaigns where new candidates arrive
|
|
12
|
-
* over time), we also ship classical Elo with configurable K-factor.
|
|
13
|
-
*
|
|
14
|
-
* References:
|
|
15
|
-
* - Bradley, R. A., Terry, M. E. (1952). Rank analysis of incomplete
|
|
16
|
-
* block designs. Biometrika, 39(3/4), 324–345.
|
|
17
|
-
* - Hunter, D. R. (2004). MM algorithms for generalized Bradley-Terry
|
|
18
|
-
* models. Annals of Statistics, 32(1), 384–406. (The MLE algorithm
|
|
19
|
-
* used here.)
|
|
20
|
-
* - Elo, A. E. (1978). The Rating of Chess Players, Past and Present.
|
|
21
|
-
*
|
|
22
|
-
* This is a useful primitive because most LLM-eval communities (Chatbot
|
|
23
|
-
* Arena, AlpacaEval, ELO-style ablation) have converged on pairwise
|
|
24
|
-
* tournament eval as the most sample-efficient and most rank-stable
|
|
25
|
-
* method when you have many candidates.
|
|
26
|
-
*/
|
|
27
|
-
export interface PairwiseOutcome {
|
|
28
|
-
/** Winner candidate id. */
|
|
29
|
-
winner: string;
|
|
30
|
-
/** Loser candidate id. */
|
|
31
|
-
loser: string;
|
|
32
|
-
/**
|
|
33
|
-
* Optional draw flag. When true, both candidates get half-credit
|
|
34
|
-
* (Bradley-Terry handles draws as half-wins for each side).
|
|
35
|
-
*/
|
|
36
|
-
draw?: boolean;
|
|
37
|
-
/**
|
|
38
|
-
* Optional weight — useful if some pairwise comparisons are stronger
|
|
39
|
-
* signals than others (e.g. a paired test with a wider score gap is
|
|
40
|
-
* a more confident comparison). Default 1.
|
|
41
|
-
*/
|
|
42
|
-
weight?: number;
|
|
43
|
-
}
|
|
44
|
-
export interface BradleyTerryRating {
|
|
45
|
-
candidateId: string;
|
|
46
|
-
/** Latent strength θ ≥ 0 from the BT MLE. */
|
|
47
|
-
strength: number;
|
|
48
|
-
/** Log-strength = log(θ) — interpretable on a linear scale. */
|
|
49
|
-
logStrength: number;
|
|
50
|
-
/** Number of pairwise comparisons this candidate appears in. */
|
|
51
|
-
n: number;
|
|
52
|
-
/** Win count (+ 0.5 per draw). */
|
|
53
|
-
wins: number;
|
|
54
|
-
}
|
|
55
|
-
export interface BradleyTerryFit {
|
|
56
|
-
ratings: BradleyTerryRating[];
|
|
57
|
-
/** Iterations of the MM algorithm before convergence. */
|
|
58
|
-
iterations: number;
|
|
59
|
-
/** Final maximum |θ_new - θ_old| / θ_old. */
|
|
60
|
-
finalDelta: number;
|
|
61
|
-
converged: boolean;
|
|
62
|
-
}
|
|
63
|
-
/**
|
|
64
|
-
* Bradley-Terry MLE via Hunter's MM algorithm.
|
|
65
|
-
*
|
|
66
|
-
* Iteration: θ_i^new = W_i / Σ_{j ≠ i} N_ij / (θ_i + θ_j)
|
|
67
|
-
* where W_i = wins by i (+ 0.5 per draw), N_ij = total comparisons.
|
|
68
|
-
*
|
|
69
|
-
* Returns log-strengths normalized so the smallest is 0 (any constant
|
|
70
|
-
* offset is unobservable in BT — only differences are identified).
|
|
71
|
-
*/
|
|
72
|
-
export declare function fitBradleyTerry(outcomes: PairwiseOutcome[], opts?: {
|
|
73
|
-
tolerance?: number;
|
|
74
|
-
maxIterations?: number;
|
|
75
|
-
smoothing?: number;
|
|
76
|
-
}): BradleyTerryFit;
|
|
77
|
-
/**
|
|
78
|
-
* Online Elo updates. Use when comparisons arrive over time and you want
|
|
79
|
-
* a running rating without re-fitting the full BT MLE on every update.
|
|
80
|
-
*
|
|
81
|
-
* Initialize ratings to `defaultRating` (1500 by default). Each call to
|
|
82
|
-
* `applyEloUpdate` mutates the map in place and returns the deltas so
|
|
83
|
-
* the caller can log per-comparison rating changes.
|
|
84
|
-
*/
|
|
85
|
-
export interface EloOptions {
|
|
86
|
-
/** Default rating for unseen candidates. Default 1500. */
|
|
87
|
-
defaultRating?: number;
|
|
88
|
-
/** K-factor controls the step size. Default 32 (FIDE-ish). */
|
|
89
|
-
kFactor?: number;
|
|
90
|
-
}
|
|
91
|
-
export declare function applyEloUpdate(ratings: Map<string, number>, outcome: PairwiseOutcome, opts?: EloOptions): {
|
|
92
|
-
winnerDelta: number;
|
|
93
|
-
loserDelta: number;
|
|
94
|
-
};
|
|
95
|
-
/**
|
|
96
|
-
* Build pairwise outcomes from the campaign artifact: for every scenario
|
|
97
|
-
* shared by two candidates, the higher-scoring run wins. Useful when you
|
|
98
|
-
* want a tournament view of an existing campaign without an additional
|
|
99
|
-
* pairwise judge call.
|
|
100
|
-
*/
|
|
101
|
-
export interface BuildPairwiseFromCampaignInput {
|
|
102
|
-
runs: Array<{
|
|
103
|
-
candidateId: string;
|
|
104
|
-
/** Stable identifier for the matching unit (typically scenarioId). */
|
|
105
|
-
matchKey: string;
|
|
106
|
-
score: number;
|
|
107
|
-
}>;
|
|
108
|
-
/**
|
|
109
|
-
* Tied-score margin. Below this, the comparison is a draw. Default 0
|
|
110
|
-
* (no ties).
|
|
111
|
-
*/
|
|
112
|
-
drawMargin?: number;
|
|
113
|
-
}
|
|
114
|
-
export declare function buildPairwiseFromCampaign(input: BuildPairwiseFromCampaignInput): PairwiseOutcome[];
|
|
115
|
-
//# sourceMappingURL=tournament.d.ts.map
|
|
@@ -1 +0,0 @@
|
|
|
1
|
-
{"version":3,"file":"tournament.d.ts","sourceRoot":"","sources":["../../src/rl/tournament.ts"],"names":[],"mappings":"AAAA;;;;;;;;;;;;;;;;;;;;;;;;;GAyBG;AAEH,MAAM,WAAW,eAAe;IAC9B,2BAA2B;IAC3B,MAAM,EAAE,MAAM,CAAA;IACd,0BAA0B;IAC1B,KAAK,EAAE,MAAM,CAAA;IACb;;;OAGG;IACH,IAAI,CAAC,EAAE,OAAO,CAAA;IACd;;;;OAIG;IACH,MAAM,CAAC,EAAE,MAAM,CAAA;CAChB;AAED,MAAM,WAAW,kBAAkB;IACjC,WAAW,EAAE,MAAM,CAAA;IACnB,6CAA6C;IAC7C,QAAQ,EAAE,MAAM,CAAA;IAChB,+DAA+D;IAC/D,WAAW,EAAE,MAAM,CAAA;IACnB,gEAAgE;IAChE,CAAC,EAAE,MAAM,CAAA;IACT,kCAAkC;IAClC,IAAI,EAAE,MAAM,CAAA;CACb;AAED,MAAM,WAAW,eAAe;IAC9B,OAAO,EAAE,kBAAkB,EAAE,CAAA;IAC7B,yDAAyD;IACzD,UAAU,EAAE,MAAM,CAAA;IAClB,6CAA6C;IAC7C,UAAU,EAAE,MAAM,CAAA;IAClB,SAAS,EAAE,OAAO,CAAA;CACnB;AAED;;;;;;;;GAQG;AACH,wBAAgB,eAAe,CAC7B,QAAQ,EAAE,eAAe,EAAE,EAC3B,IAAI,GAAE;IAAE,SAAS,CAAC,EAAE,MAAM,CAAC;IAAC,aAAa,CAAC,EAAE,MAAM,CAAC;IAAC,SAAS,CAAC,EAAE,MAAM,CAAA;CAAO,GAC5E,eAAe,CAqGjB;AAED;;;;;;;GAOG;AACH,MAAM,WAAW,UAAU;IACzB,0DAA0D;IAC1D,aAAa,CAAC,EAAE,MAAM,CAAA;IACtB,8DAA8D;IAC9D,OAAO,CAAC,EAAE,MAAM,CAAA;CACjB;AAED,wBAAgB,cAAc,CAC5B,OAAO,EAAE,GAAG,CAAC,MAAM,EAAE,MAAM,CAAC,EAC5B,OAAO,EAAE,eAAe,EACxB,IAAI,GAAE,UAAe,GACpB;IAAE,WAAW,EAAE,MAAM,CAAC;IAAC,UAAU,EAAE,MAAM,CAAA;CAAE,CAmB7C;AAED;;;;;GAKG;AACH,MAAM,WAAW,8BAA8B;IAC7C,IAAI,EAAE,KAAK,CAAC;QACV,WAAW,EAAE,MAAM,CAAA;QACnB,sEAAsE;QACtE,QAAQ,EAAE,MAAM,CAAA;QAChB,KAAK,EAAE,MAAM,CAAA;KACd,CAAC,CAAA;IACF;;;OAGG;IACH,UAAU,CAAC,EAAE,MAAM,CAAA;CACpB;AAED,wBAAgB,yBAAyB,CACvC,KAAK,EAAE,8BAA8B,GACpC,eAAe,EAAE,CA0BnB"}
|