@tangle-network/agent-eval 0.95.0 → 0.95.1
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/CHANGELOG.md +17 -0
- package/dist/adapters/http.d.ts +17 -10
- package/dist/adapters/langchain.d.ts +14 -7
- package/dist/adapters/otel.d.ts +25 -13
- package/dist/{rl/adversarial.d.ts → adversarial-DIVcDoI_.d.ts} +7 -6
- package/dist/analyst/index.d.ts +236 -28
- package/dist/{trace-analyst/analyst.d.ts → analyst-C8HHvfJp.d.ts} +14 -12
- package/dist/{contract/analyze-runs.d.ts → analyze-runs-DtT6F_6T.d.ts} +10 -9
- package/dist/authenticity/index.d.ts +16 -15
- package/dist/{baseline.d.ts → baseline-Bbid3WoO.d.ts} +44 -8
- package/dist/belief-state/index.d.ts +605 -14
- package/dist/benchmarks/index.d.ts +5 -23
- package/dist/builder-eval/index.d.ts +250 -5
- package/dist/calibration-BPmzuVPk.d.ts +101 -0
- package/dist/campaign/index.d.ts +1452 -38
- package/dist/cli.d.ts +0 -2
- package/dist/{contract/intake/code-agent-session.d.ts → code-agent-session-CPHRCb4-.d.ts} +17 -15
- package/dist/contract/index.d.ts +688 -106
- package/dist/control-Doncu-B_.d.ts +259 -0
- package/dist/{control-runtime.d.ts → control-runtime-Acf9CGhw.d.ts} +26 -23
- package/dist/control.d.ts +10 -11
- package/dist/corpus-D4YW9UoJ.d.ts +560 -0
- package/dist/{cost-ledger.d.ts → cost-ledger-DuSqlw5B.d.ts} +11 -10
- package/dist/{counterfactual.d.ts → counterfactual-DlOz8PBx.d.ts} +13 -12
- package/dist/{dataset.d.ts → dataset-BbGkaN2I.d.ts} +14 -11
- package/dist/{analyst/registry.d.ts → default-registry-GyE8X5SP.d.ts} +37 -8
- package/dist/diagnose.d.ts +252 -1
- package/dist/{trace/emitter.d.ts → emitter-C2rqGH_l.d.ts} +12 -9
- package/dist/{errors.d.ts → errors-CzMUYo7b.d.ts} +11 -10
- package/dist/failure-cluster-DH9Flgcf.d.ts +76 -0
- package/dist/{feedback-trajectory.d.ts → feedback-trajectory-BxY0cKfs.d.ts} +38 -36
- package/dist/fuzz.d.ts +547 -1
- package/dist/gepa-C1NCIZ9o.d.ts +414 -0
- package/dist/governance/index.d.ts +135 -5
- package/dist/harness-optimizer-mOl9XX_O.d.ts +106 -0
- package/dist/hosted/index.d.ts +239 -10
- package/dist/index-_Y4oNOOb.d.ts +159 -0
- package/dist/index.d.ts +5660 -277
- package/dist/{contract/insight-report.d.ts → insight-report-BnRjTibG.d.ts} +19 -16
- package/dist/{trace/integrity.d.ts → integrity-D2t12mMw.d.ts} +14 -11
- package/dist/{judge-calibration.d.ts → judge-calibration-0p2QcWNE.d.ts} +17 -16
- package/dist/{analyst/kind-factory.d.ts → kind-factory-X3eDYbKn.d.ts} +61 -10
- package/dist/knowledge/index.d.ts +103 -3
- package/dist/{llm-client.d.ts → llm-client-Bj7g0rqu.d.ts} +23 -21
- package/dist/matrix/index.d.ts +30 -12
- package/dist/meta-eval/index.d.ts +182 -6
- package/dist/{multi-layer-verifier.d.ts → multi-layer-verifier-DUZXrPDA.d.ts} +15 -12
- package/dist/multishot/index.d.ts +290 -7
- package/dist/{rl/off-policy.d.ts → off-policy-DiwuKKg7.d.ts} +9 -8
- package/dist/openapi.json +1 -1
- package/dist/{meta-eval/outcome-store.d.ts → outcome-store-rnXLEqSn.d.ts} +8 -7
- package/dist/{pareto.d.ts → pareto-E-pembql.d.ts} +10 -9
- package/dist/perf/index.d.ts +119 -13
- package/dist/pipelines/index.d.ts +173 -8
- package/dist/pre-registration-nfUdc9EQ.d.ts +483 -0
- package/dist/prm/index.d.ts +104 -5
- package/dist/provenance-CncDq9qE.d.ts +426 -0
- package/dist/query-B7GGjRox.d.ts +32 -0
- package/dist/{trace/raw-provider-sink.d.ts → raw-provider-sink-C46HDghv.d.ts} +14 -13
- package/dist/{red-team.d.ts → red-team-BWdoyleI.d.ts} +16 -14
- package/dist/{trace/redact.d.ts → redact-B40YG2M_.d.ts} +8 -7
- package/dist/release-report-pidWUMZ2.d.ts +233 -0
- package/dist/reporting.d.ts +16 -15
- package/dist/{eval-campaign.d.ts → researcher-Jr8ME1dZ.d.ts} +156 -34
- package/dist/rl.d.ts +1193 -1
- package/dist/{prm/rubric.d.ts → rubric-Cc6UHvUb.d.ts} +13 -10
- package/dist/{meta-eval/rubric-predictive-validity.d.ts → rubric-predictive-validity-C2hDKM8Z.d.ts} +11 -8
- package/dist/run-critic-CmMf05uV.d.ts +56 -0
- package/dist/{run-record.d.ts → run-record-CP2ObebC.d.ts} +117 -15
- package/dist/runtime-trajectory-BOUUjI0y.d.ts +49 -0
- package/dist/{trace/schema.d.ts → schema-m0gsnbt3.d.ts} +30 -29
- package/dist/semantic-concept-judge-DSBB2Cfp.d.ts +624 -0
- package/dist/{sequential.d.ts → sequential-5iSVfzl2.d.ts} +10 -9
- package/dist/{series-convergence.d.ts → series-convergence-D5OWMBg6.d.ts} +5 -4
- package/dist/sink-fetch-B1Yg4Til.d.ts +101 -0
- package/dist/{statistics.d.ts → statistics-CCJpTGOS.d.ts} +48 -46
- package/dist/{trace/store.d.ts → store-BcFXE6LG.d.ts} +12 -21
- package/dist/{trace-analyst/types.d.ts → store-C1YxJDEK.d.ts} +74 -18
- package/dist/storyboard/index.d.ts +81 -16
- package/dist/{summary-report.d.ts → summary-report-CInXwsza.d.ts} +160 -23
- package/dist/telemetry/{sink-file.d.ts → file.d.ts} +7 -5
- package/dist/telemetry/index.d.ts +35 -17
- package/dist/{sandbox-harness.d.ts → test-graded-scenario-DeODGLra.d.ts} +60 -15
- package/dist/{locked-jsonl-appender.d.ts → testing-C21CHsq2.d.ts} +4 -3
- package/dist/testing.d.ts +1 -5
- package/dist/traces.d.ts +976 -4
- package/dist/{trajectory.d.ts → trajectory-2TkpSEVh.d.ts} +9 -8
- package/dist/{analyst/types.d.ts → types-B5x54y6n.d.ts} +112 -19
- package/dist/{matrix/types.d.ts → types-BUxNaJ8c.d.ts} +11 -9
- package/dist/{types.d.ts → types-C7DGg5ex.d.ts} +33 -31
- package/dist/{campaign/types.d.ts → types-DQRY8ZT-.d.ts} +47 -44
- package/dist/{verdict.d.ts → verdict-C9MlYujm.d.ts} +3 -2
- package/dist/wire/index.d.ts +570 -13
- package/dist/workflow/index.d.ts +496 -22
- package/package.json +2 -2
- package/dist/action-policy.d.ts +0 -24
- package/dist/action-policy.d.ts.map +0 -1
- package/dist/action-policy.test.d.ts +0 -2
- package/dist/action-policy.test.d.ts.map +0 -1
- package/dist/active-learning.d.ts +0 -41
- package/dist/active-learning.d.ts.map +0 -1
- package/dist/adapters/http.d.ts.map +0 -1
- package/dist/adapters/langchain.d.ts.map +0 -1
- package/dist/adapters/otel.d.ts.map +0 -1
- package/dist/agent-profile-cell.d.ts +0 -101
- package/dist/agent-profile-cell.d.ts.map +0 -1
- package/dist/agent-profile.d.ts +0 -27
- package/dist/agent-profile.d.ts.map +0 -1
- package/dist/agent-profile.test.d.ts +0 -2
- package/dist/agent-profile.test.d.ts.map +0 -1
- package/dist/analyst/adapters.d.ts +0 -62
- package/dist/analyst/adapters.d.ts.map +0 -1
- package/dist/analyst/analyst.test.d.ts +0 -2
- package/dist/analyst/analyst.test.d.ts.map +0 -1
- package/dist/analyst/ax-service.d.ts +0 -27
- package/dist/analyst/ax-service.d.ts.map +0 -1
- package/dist/analyst/behavioral-analyst.d.ts +0 -28
- package/dist/analyst/behavioral-analyst.d.ts.map +0 -1
- package/dist/analyst/chat-client.d.ts +0 -91
- package/dist/analyst/chat-client.d.ts.map +0 -1
- package/dist/analyst/default-registry.d.ts +0 -27
- package/dist/analyst/default-registry.d.ts.map +0 -1
- package/dist/analyst/default-registry.test.d.ts +0 -2
- package/dist/analyst/default-registry.test.d.ts.map +0 -1
- package/dist/analyst/finding-signature.d.ts +0 -48
- package/dist/analyst/finding-signature.d.ts.map +0 -1
- package/dist/analyst/finding-subject.d.ts +0 -146
- package/dist/analyst/finding-subject.d.ts.map +0 -1
- package/dist/analyst/finding-subject.test.d.ts +0 -2
- package/dist/analyst/finding-subject.test.d.ts.map +0 -1
- package/dist/analyst/findings-store.d.ts +0 -75
- package/dist/analyst/findings-store.d.ts.map +0 -1
- package/dist/analyst/index.d.ts.map +0 -1
- package/dist/analyst/kind-factory.d.ts.map +0 -1
- package/dist/analyst/kinds/failure-mode.d.ts +0 -19
- package/dist/analyst/kinds/failure-mode.d.ts.map +0 -1
- package/dist/analyst/kinds/improvement.d.ts +0 -23
- package/dist/analyst/kinds/improvement.d.ts.map +0 -1
- package/dist/analyst/kinds/index.d.ts +0 -22
- package/dist/analyst/kinds/index.d.ts.map +0 -1
- package/dist/analyst/kinds/kinds.test.d.ts +0 -2
- package/dist/analyst/kinds/kinds.test.d.ts.map +0 -1
- package/dist/analyst/kinds/knowledge-gap.d.ts +0 -28
- package/dist/analyst/kinds/knowledge-gap.d.ts.map +0 -1
- package/dist/analyst/kinds/knowledge-poisoning.d.ts +0 -22
- package/dist/analyst/kinds/knowledge-poisoning.d.ts.map +0 -1
- package/dist/analyst/kinds/skill-usage.d.ts +0 -84
- package/dist/analyst/kinds/skill-usage.d.ts.map +0 -1
- package/dist/analyst/kinds/skill-usage.test.d.ts +0 -2
- package/dist/analyst/kinds/skill-usage.test.d.ts.map +0 -1
- package/dist/analyst/parse-tolerant.d.ts +0 -26
- package/dist/analyst/parse-tolerant.d.ts.map +0 -1
- package/dist/analyst/parse-tolerant.test.d.ts +0 -2
- package/dist/analyst/parse-tolerant.test.d.ts.map +0 -1
- package/dist/analyst/registry.budget.test.d.ts +0 -2
- package/dist/analyst/registry.budget.test.d.ts.map +0 -1
- package/dist/analyst/registry.d.ts.map +0 -1
- package/dist/analyst/steer-firewall.d.ts +0 -35
- package/dist/analyst/steer-firewall.d.ts.map +0 -1
- package/dist/analyst/steer-firewall.test.d.ts +0 -2
- package/dist/analyst/steer-firewall.test.d.ts.map +0 -1
- package/dist/analyst/structure-findings.d.ts +0 -37
- package/dist/analyst/structure-findings.d.ts.map +0 -1
- package/dist/analyst/structure-findings.test.d.ts +0 -2
- package/dist/analyst/structure-findings.test.d.ts.map +0 -1
- package/dist/analyst/tool-groups.d.ts +0 -34
- package/dist/analyst/tool-groups.d.ts.map +0 -1
- package/dist/analyst/types.d.ts.map +0 -1
- package/dist/anti-slop.d.ts +0 -59
- package/dist/anti-slop.d.ts.map +0 -1
- package/dist/artifact-validator.d.ts +0 -74
- package/dist/artifact-validator.d.ts.map +0 -1
- package/dist/attestation.d.ts +0 -63
- package/dist/attestation.d.ts.map +0 -1
- package/dist/attestation.test.d.ts +0 -2
- package/dist/attestation.test.d.ts.map +0 -1
- package/dist/authenticity/index.d.ts.map +0 -1
- package/dist/authenticity/index.test.d.ts +0 -2
- package/dist/authenticity/index.test.d.ts.map +0 -1
- package/dist/auto-pr.d.ts +0 -120
- package/dist/auto-pr.d.ts.map +0 -1
- package/dist/baseline.d.ts.map +0 -1
- package/dist/behavior-dsl.d.ts +0 -73
- package/dist/behavior-dsl.d.ts.map +0 -1
- package/dist/belief-state/calibration.d.ts +0 -10
- package/dist/belief-state/calibration.d.ts.map +0 -1
- package/dist/belief-state/calibration.test.d.ts +0 -2
- package/dist/belief-state/calibration.test.d.ts.map +0 -1
- package/dist/belief-state/code-agent-corpus.d.ts +0 -66
- package/dist/belief-state/code-agent-corpus.d.ts.map +0 -1
- package/dist/belief-state/code-agent-corpus.test.d.ts +0 -2
- package/dist/belief-state/code-agent-corpus.test.d.ts.map +0 -1
- package/dist/belief-state/code-agent-evidence.d.ts +0 -22
- package/dist/belief-state/code-agent-evidence.d.ts.map +0 -1
- package/dist/belief-state/code-agent-evidence.test.d.ts +0 -2
- package/dist/belief-state/code-agent-evidence.test.d.ts.map +0 -1
- package/dist/belief-state/extract.d.ts +0 -7
- package/dist/belief-state/extract.d.ts.map +0 -1
- package/dist/belief-state/extract.test.d.ts +0 -2
- package/dist/belief-state/extract.test.d.ts.map +0 -1
- package/dist/belief-state/index.d.ts.map +0 -1
- package/dist/belief-state/ope.d.ts +0 -17
- package/dist/belief-state/ope.d.ts.map +0 -1
- package/dist/belief-state/ope.test.d.ts +0 -2
- package/dist/belief-state/ope.test.d.ts.map +0 -1
- package/dist/belief-state/phase0-measurement.d.ts +0 -55
- package/dist/belief-state/phase0-measurement.d.ts.map +0 -1
- package/dist/belief-state/report.d.ts +0 -17
- package/dist/belief-state/report.d.ts.map +0 -1
- package/dist/belief-state/report.test.d.ts +0 -2
- package/dist/belief-state/report.test.d.ts.map +0 -1
- package/dist/belief-state/research-evidence.d.ts +0 -23
- package/dist/belief-state/research-evidence.d.ts.map +0 -1
- package/dist/belief-state/research-evidence.test.d.ts +0 -2
- package/dist/belief-state/research-evidence.test.d.ts.map +0 -1
- package/dist/belief-state/runtime-benchmark-corpus.d.ts +0 -32
- package/dist/belief-state/runtime-benchmark-corpus.d.ts.map +0 -1
- package/dist/belief-state/runtime-hooks.d.ts +0 -87
- package/dist/belief-state/runtime-hooks.d.ts.map +0 -1
- package/dist/belief-state/runtime-hooks.test.d.ts +0 -2
- package/dist/belief-state/runtime-hooks.test.d.ts.map +0 -1
- package/dist/belief-state/selective.d.ts +0 -15
- package/dist/belief-state/selective.d.ts.map +0 -1
- package/dist/belief-state/selective.test.d.ts +0 -2
- package/dist/belief-state/selective.test.d.ts.map +0 -1
- package/dist/belief-state/shadow-probe.d.ts +0 -80
- package/dist/belief-state/shadow-probe.d.ts.map +0 -1
- package/dist/belief-state/shadow-probe.test.d.ts +0 -2
- package/dist/belief-state/shadow-probe.test.d.ts.map +0 -1
- package/dist/belief-state/types.d.ts +0 -195
- package/dist/belief-state/types.d.ts.map +0 -1
- package/dist/belief-state/types.test.d.ts +0 -2
- package/dist/belief-state/types.test.d.ts.map +0 -1
- package/dist/benchmark.d.ts +0 -14
- package/dist/benchmark.d.ts.map +0 -1
- package/dist/benchmarks/index.d.ts.map +0 -1
- package/dist/benchmarks/routing/dataset.d.ts +0 -34
- package/dist/benchmarks/routing/dataset.d.ts.map +0 -1
- package/dist/benchmarks/routing/index.d.ts +0 -34
- package/dist/benchmarks/routing/index.d.ts.map +0 -1
- package/dist/benchmarks/types.d.ts +0 -49
- package/dist/benchmarks/types.d.ts.map +0 -1
- package/dist/bisector.d.ts +0 -81
- package/dist/bisector.d.ts.map +0 -1
- package/dist/budget-guard.d.ts +0 -31
- package/dist/budget-guard.d.ts.map +0 -1
- package/dist/builder-eval/builder-session.d.ts +0 -111
- package/dist/builder-eval/builder-session.d.ts.map +0 -1
- package/dist/builder-eval/correlation.d.ts +0 -32
- package/dist/builder-eval/correlation.d.ts.map +0 -1
- package/dist/builder-eval/index.d.ts.map +0 -1
- package/dist/builder-eval/project-registry.d.ts +0 -51
- package/dist/builder-eval/project-registry.d.ts.map +0 -1
- package/dist/builder-eval/three-layer-eval.d.ts +0 -55
- package/dist/builder-eval/three-layer-eval.d.ts.map +0 -1
- package/dist/campaign/analyst-surface.d.ts +0 -108
- package/dist/campaign/analyst-surface.d.ts.map +0 -1
- package/dist/campaign/analyst-surface.test.d.ts +0 -2
- package/dist/campaign/analyst-surface.test.d.ts.map +0 -1
- package/dist/campaign/auto-pr.d.ts +0 -46
- package/dist/campaign/auto-pr.d.ts.map +0 -1
- package/dist/campaign/distillation/agreement-judge.d.ts +0 -69
- package/dist/campaign/distillation/agreement-judge.d.ts.map +0 -1
- package/dist/campaign/distillation/cli.d.ts +0 -35
- package/dist/campaign/distillation/cli.d.ts.map +0 -1
- package/dist/campaign/distillation/distillation.test.d.ts +0 -2
- package/dist/campaign/distillation/distillation.test.d.ts.map +0 -1
- package/dist/campaign/distillation/gold-scenarios.d.ts +0 -54
- package/dist/campaign/distillation/gold-scenarios.d.ts.map +0 -1
- package/dist/campaign/distillation/run-distillation.d.ts +0 -119
- package/dist/campaign/distillation/run-distillation.d.ts.map +0 -1
- package/dist/campaign/gates/compose.d.ts +0 -12
- package/dist/campaign/gates/compose.d.ts.map +0 -1
- package/dist/campaign/gates/default-production-gate.d.ts +0 -58
- package/dist/campaign/gates/default-production-gate.d.ts.map +0 -1
- package/dist/campaign/gates/heldout-gate.d.ts +0 -12
- package/dist/campaign/gates/heldout-gate.d.ts.map +0 -1
- package/dist/campaign/gates/promotion-policy.d.ts +0 -125
- package/dist/campaign/gates/promotion-policy.d.ts.map +0 -1
- package/dist/campaign/gates/promotion-policy.test.d.ts +0 -2
- package/dist/campaign/gates/promotion-policy.test.d.ts.map +0 -1
- package/dist/campaign/gates/sequential.d.ts +0 -146
- package/dist/campaign/gates/sequential.d.ts.map +0 -1
- package/dist/campaign/gates/sequential.test.d.ts +0 -2
- package/dist/campaign/gates/sequential.test.d.ts.map +0 -1
- package/dist/campaign/gates/statistical-heldout.d.ts +0 -99
- package/dist/campaign/gates/statistical-heldout.d.ts.map +0 -1
- package/dist/campaign/gates/statistical-heldout.test.d.ts +0 -2
- package/dist/campaign/gates/statistical-heldout.test.d.ts.map +0 -1
- package/dist/campaign/index.d.ts.map +0 -1
- package/dist/campaign/labeled-store/fs-adapter.d.ts +0 -59
- package/dist/campaign/labeled-store/fs-adapter.d.ts.map +0 -1
- package/dist/campaign/presets/compare-proposers.d.ts +0 -146
- package/dist/campaign/presets/compare-proposers.d.ts.map +0 -1
- package/dist/campaign/presets/playback.d.ts +0 -120
- package/dist/campaign/presets/playback.d.ts.map +0 -1
- package/dist/campaign/presets/playback.test.d.ts +0 -2
- package/dist/campaign/presets/playback.test.d.ts.map +0 -1
- package/dist/campaign/presets/run-eval.d.ts +0 -14
- package/dist/campaign/presets/run-eval.d.ts.map +0 -1
- package/dist/campaign/presets/run-improvement-loop.d.ts +0 -63
- package/dist/campaign/presets/run-improvement-loop.d.ts.map +0 -1
- package/dist/campaign/presets/run-improvement-loop.test.d.ts +0 -2
- package/dist/campaign/presets/run-improvement-loop.test.d.ts.map +0 -1
- package/dist/campaign/presets/run-optimization.d.ts +0 -92
- package/dist/campaign/presets/run-optimization.d.ts.map +0 -1
- package/dist/campaign/presets/run-profile-matrix.d.ts +0 -151
- package/dist/campaign/presets/run-profile-matrix.d.ts.map +0 -1
- package/dist/campaign/presets/run-skill-opt.d.ts +0 -96
- package/dist/campaign/presets/run-skill-opt.d.ts.map +0 -1
- package/dist/campaign/proposers/_findings-text.d.ts +0 -22
- package/dist/campaign/proposers/_findings-text.d.ts.map +0 -1
- package/dist/campaign/proposers/ace.d.ts +0 -33
- package/dist/campaign/proposers/ace.d.ts.map +0 -1
- package/dist/campaign/proposers/ace.test.d.ts +0 -2
- package/dist/campaign/proposers/ace.test.d.ts.map +0 -1
- package/dist/campaign/proposers/analysis-edit.d.ts +0 -32
- package/dist/campaign/proposers/analysis-edit.d.ts.map +0 -1
- package/dist/campaign/proposers/evolutionary.d.ts +0 -20
- package/dist/campaign/proposers/evolutionary.d.ts.map +0 -1
- package/dist/campaign/proposers/fapo.d.ts +0 -120
- package/dist/campaign/proposers/fapo.d.ts.map +0 -1
- package/dist/campaign/proposers/gepa.d.ts +0 -86
- package/dist/campaign/proposers/gepa.d.ts.map +0 -1
- package/dist/campaign/proposers/halo.d.ts +0 -44
- package/dist/campaign/proposers/halo.d.ts.map +0 -1
- package/dist/campaign/proposers/halo.test.d.ts +0 -2
- package/dist/campaign/proposers/halo.test.d.ts.map +0 -1
- package/dist/campaign/proposers/memory.d.ts +0 -47
- package/dist/campaign/proposers/memory.d.ts.map +0 -1
- package/dist/campaign/proposers/memory.test.d.ts +0 -2
- package/dist/campaign/proposers/memory.test.d.ts.map +0 -1
- package/dist/campaign/proposers/skill-opt.d.ts +0 -88
- package/dist/campaign/proposers/skill-opt.d.ts.map +0 -1
- package/dist/campaign/proposers/trace-analyst.d.ts +0 -48
- package/dist/campaign/proposers/trace-analyst.d.ts.map +0 -1
- package/dist/campaign/proposers/trace-analyst.test.d.ts +0 -2
- package/dist/campaign/proposers/trace-analyst.test.d.ts.map +0 -1
- package/dist/campaign/provenance.d.ts +0 -185
- package/dist/campaign/provenance.d.ts.map +0 -1
- package/dist/campaign/run-campaign.d.ts +0 -90
- package/dist/campaign/run-campaign.d.ts.map +0 -1
- package/dist/campaign/score-utils.d.ts +0 -26
- package/dist/campaign/score-utils.d.ts.map +0 -1
- package/dist/campaign/skill-patch.d.ts +0 -62
- package/dist/campaign/skill-patch.d.ts.map +0 -1
- package/dist/campaign/storage.d.ts +0 -38
- package/dist/campaign/storage.d.ts.map +0 -1
- package/dist/campaign/types.d.ts.map +0 -1
- package/dist/campaign/worktree/index.d.ts +0 -53
- package/dist/campaign/worktree/index.d.ts.map +0 -1
- package/dist/canary.d.ts +0 -101
- package/dist/canary.d.ts.map +0 -1
- package/dist/causal-attribution.d.ts +0 -45
- package/dist/causal-attribution.d.ts.map +0 -1
- package/dist/ci-gate.d.ts +0 -44
- package/dist/ci-gate.d.ts.map +0 -1
- package/dist/cli.d.ts.map +0 -1
- package/dist/client.d.ts +0 -77
- package/dist/client.d.ts.map +0 -1
- package/dist/client.test.d.ts +0 -2
- package/dist/client.test.d.ts.map +0 -1
- package/dist/command-runner.d.ts +0 -74
- package/dist/command-runner.d.ts.map +0 -1
- package/dist/command-runner.test.d.ts +0 -2
- package/dist/command-runner.test.d.ts.map +0 -1
- package/dist/completion-verifier.d.ts +0 -147
- package/dist/completion-verifier.d.ts.map +0 -1
- package/dist/completion-verifier.test.d.ts +0 -9
- package/dist/completion-verifier.test.d.ts.map +0 -1
- package/dist/concurrency.d.ts +0 -23
- package/dist/concurrency.d.ts.map +0 -1
- package/dist/contamination-guard.d.ts +0 -81
- package/dist/contamination-guard.d.ts.map +0 -1
- package/dist/contract/analyze-runs.d.ts.map +0 -1
- package/dist/contract/define-agent-eval.d.ts +0 -52
- package/dist/contract/define-agent-eval.d.ts.map +0 -1
- package/dist/contract/diff.d.ts +0 -114
- package/dist/contract/diff.d.ts.map +0 -1
- package/dist/contract/index.d.ts.map +0 -1
- package/dist/contract/insight-report.d.ts.map +0 -1
- package/dist/contract/insight-types-fwd.d.ts +0 -7
- package/dist/contract/insight-types-fwd.d.ts.map +0 -1
- package/dist/contract/intake/agent-trace.d.ts +0 -97
- package/dist/contract/intake/agent-trace.d.ts.map +0 -1
- package/dist/contract/intake/code-agent-session.d.ts.map +0 -1
- package/dist/contract/intake/feedback-table.d.ts +0 -87
- package/dist/contract/intake/feedback-table.d.ts.map +0 -1
- package/dist/contract/intake/index.d.ts +0 -22
- package/dist/contract/intake/index.d.ts.map +0 -1
- package/dist/contract/intake/otel-spans.d.ts +0 -33
- package/dist/contract/intake/otel-spans.d.ts.map +0 -1
- package/dist/contract/self-improve.d.ts +0 -284
- package/dist/contract/self-improve.d.ts.map +0 -1
- package/dist/control-runtime.d.ts.map +0 -1
- package/dist/control-runtime.test.d.ts +0 -2
- package/dist/control-runtime.test.d.ts.map +0 -1
- package/dist/control.d.ts.map +0 -1
- package/dist/convergence.d.ts +0 -29
- package/dist/convergence.d.ts.map +0 -1
- package/dist/cost-ledger.d.ts.map +0 -1
- package/dist/cost-ledger.test.d.ts +0 -2
- package/dist/cost-ledger.test.d.ts.map +0 -1
- package/dist/cost-report.d.ts +0 -43
- package/dist/cost-report.d.ts.map +0 -1
- package/dist/cost-report.test.d.ts +0 -2
- package/dist/cost-report.test.d.ts.map +0 -1
- package/dist/cost-tracker.d.ts +0 -76
- package/dist/cost-tracker.d.ts.map +0 -1
- package/dist/counterfactual.d.ts.map +0 -1
- package/dist/cross-trace-diff.d.ts +0 -56
- package/dist/cross-trace-diff.d.ts.map +0 -1
- package/dist/dataset.d.ts.map +0 -1
- package/dist/deploy-gate-layer.d.ts +0 -125
- package/dist/deploy-gate-layer.d.ts.map +0 -1
- package/dist/deploy-gate-layer.test.d.ts +0 -2
- package/dist/deploy-gate-layer.test.d.ts.map +0 -1
- package/dist/description-length-gate.d.ts +0 -119
- package/dist/description-length-gate.d.ts.map +0 -1
- package/dist/detectors/edge.test.d.ts +0 -2
- package/dist/detectors/edge.test.d.ts.map +0 -1
- package/dist/detectors/index.d.ts +0 -81
- package/dist/detectors/index.d.ts.map +0 -1
- package/dist/detectors/index.test.d.ts +0 -2
- package/dist/detectors/index.test.d.ts.map +0 -1
- package/dist/diagnose/causal-sweep.d.ts +0 -100
- package/dist/diagnose/causal-sweep.d.ts.map +0 -1
- package/dist/diagnose/index.d.ts +0 -36
- package/dist/diagnose/index.d.ts.map +0 -1
- package/dist/diagnose/remediation.d.ts +0 -68
- package/dist/diagnose/remediation.d.ts.map +0 -1
- package/dist/diagnose/repair.d.ts +0 -77
- package/dist/diagnose/repair.d.ts.map +0 -1
- package/dist/discover-personas.d.ts +0 -35
- package/dist/discover-personas.d.ts.map +0 -1
- package/dist/driver.d.ts +0 -95
- package/dist/driver.d.ts.map +0 -1
- package/dist/driver.test.d.ts +0 -8
- package/dist/driver.test.d.ts.map +0 -1
- package/dist/dual-agent-bench.d.ts +0 -81
- package/dist/dual-agent-bench.d.ts.map +0 -1
- package/dist/error-count-extractor.d.ts +0 -47
- package/dist/error-count-extractor.d.ts.map +0 -1
- package/dist/error-count-extractor.test.d.ts +0 -2
- package/dist/error-count-extractor.test.d.ts.map +0 -1
- package/dist/errors.d.ts.map +0 -1
- package/dist/eval-campaign.d.ts.map +0 -1
- package/dist/eval-campaign.test.d.ts +0 -2
- package/dist/eval-campaign.test.d.ts.map +0 -1
- package/dist/eval-tools.d.ts +0 -55
- package/dist/eval-tools.d.ts.map +0 -1
- package/dist/eval-trace-store.d.ts +0 -107
- package/dist/eval-trace-store.d.ts.map +0 -1
- package/dist/eval-trace-store.test.d.ts +0 -2
- package/dist/eval-trace-store.test.d.ts.map +0 -1
- package/dist/executor.d.ts +0 -38
- package/dist/executor.d.ts.map +0 -1
- package/dist/executor.test.d.ts +0 -10
- package/dist/executor.test.d.ts.map +0 -1
- package/dist/experiment-tracker.d.ts +0 -178
- package/dist/experiment-tracker.d.ts.map +0 -1
- package/dist/experiment-tracker.test.d.ts +0 -2
- package/dist/experiment-tracker.test.d.ts.map +0 -1
- package/dist/failure-taxonomy.d.ts +0 -38
- package/dist/failure-taxonomy.d.ts.map +0 -1
- package/dist/feedback-trajectory.d.ts.map +0 -1
- package/dist/feedback-trajectory.test.d.ts +0 -2
- package/dist/feedback-trajectory.test.d.ts.map +0 -1
- package/dist/flow-layer.d.ts +0 -90
- package/dist/flow-layer.d.ts.map +0 -1
- package/dist/flow-layer.test.d.ts +0 -2
- package/dist/flow-layer.test.d.ts.map +0 -1
- package/dist/fuzz/capsule.d.ts +0 -46
- package/dist/fuzz/capsule.d.ts.map +0 -1
- package/dist/fuzz/cube.d.ts +0 -36
- package/dist/fuzz/cube.d.ts.map +0 -1
- package/dist/fuzz/explorer-cost.test.d.ts +0 -2
- package/dist/fuzz/explorer-cost.test.d.ts.map +0 -1
- package/dist/fuzz/explorer.d.ts +0 -64
- package/dist/fuzz/explorer.d.ts.map +0 -1
- package/dist/fuzz/fuzz-agent.d.ts +0 -16
- package/dist/fuzz/fuzz-agent.d.ts.map +0 -1
- package/dist/fuzz/fuzz-agent.test.d.ts +0 -2
- package/dist/fuzz/fuzz-agent.test.d.ts.map +0 -1
- package/dist/fuzz/gates.d.ts +0 -33
- package/dist/fuzz/gates.d.ts.map +0 -1
- package/dist/fuzz/index.d.ts +0 -26
- package/dist/fuzz/index.d.ts.map +0 -1
- package/dist/fuzz/policies.d.ts +0 -28
- package/dist/fuzz/policies.d.ts.map +0 -1
- package/dist/fuzz/tools.d.ts +0 -20
- package/dist/fuzz/tools.d.ts.map +0 -1
- package/dist/fuzz/types.d.ts +0 -307
- package/dist/fuzz/types.d.ts.map +0 -1
- package/dist/golden-matcher.d.ts +0 -71
- package/dist/golden-matcher.d.ts.map +0 -1
- package/dist/governance/eu-ai-act.d.ts +0 -37
- package/dist/governance/eu-ai-act.d.ts.map +0 -1
- package/dist/governance/index.d.ts.map +0 -1
- package/dist/governance/nist-ai-rmf.d.ts +0 -15
- package/dist/governance/nist-ai-rmf.d.ts.map +0 -1
- package/dist/governance/soc2.d.ts +0 -12
- package/dist/governance/soc2.d.ts.map +0 -1
- package/dist/governance/types.d.ts +0 -66
- package/dist/governance/types.d.ts.map +0 -1
- package/dist/harness-optimizer.d.ts +0 -82
- package/dist/harness-optimizer.d.ts.map +0 -1
- package/dist/held-out-gate.d.ts +0 -135
- package/dist/held-out-gate.d.ts.map +0 -1
- package/dist/hosted/client.d.ts +0 -73
- package/dist/hosted/client.d.ts.map +0 -1
- package/dist/hosted/from-env.test.d.ts +0 -8
- package/dist/hosted/from-env.test.d.ts.map +0 -1
- package/dist/hosted/index.d.ts.map +0 -1
- package/dist/hosted/types.d.ts +0 -159
- package/dist/hosted/types.d.ts.map +0 -1
- package/dist/index.d.ts.map +0 -1
- package/dist/integrity/backend-integrity.d.ts +0 -71
- package/dist/integrity/backend-integrity.d.ts.map +0 -1
- package/dist/integrity/preflight.d.ts +0 -72
- package/dist/integrity/preflight.d.ts.map +0 -1
- package/dist/integrity/preflight.test.d.ts +0 -2
- package/dist/integrity/preflight.test.d.ts.map +0 -1
- package/dist/integrity/single-backend.d.ts +0 -67
- package/dist/integrity/single-backend.d.ts.map +0 -1
- package/dist/intent-match-judge.d.ts +0 -69
- package/dist/intent-match-judge.d.ts.map +0 -1
- package/dist/intent-match-judge.test.d.ts +0 -2
- package/dist/intent-match-judge.test.d.ts.map +0 -1
- package/dist/judge-calibration.d.ts.map +0 -1
- package/dist/judge-ensemble.d.ts +0 -66
- package/dist/judge-ensemble.d.ts.map +0 -1
- package/dist/judge-ensemble.test.d.ts +0 -8
- package/dist/judge-ensemble.test.d.ts.map +0 -1
- package/dist/judge-families.d.ts +0 -38
- package/dist/judge-families.d.ts.map +0 -1
- package/dist/judge-panel.d.ts +0 -65
- package/dist/judge-panel.d.ts.map +0 -1
- package/dist/judge-retry.d.ts +0 -70
- package/dist/judge-retry.d.ts.map +0 -1
- package/dist/judge-runner.d.ts +0 -36
- package/dist/judge-runner.d.ts.map +0 -1
- package/dist/judge-runner.test.d.ts +0 -2
- package/dist/judge-runner.test.d.ts.map +0 -1
- package/dist/judges.d.ts +0 -74
- package/dist/judges.d.ts.map +0 -1
- package/dist/keyword-coverage-judge.d.ts +0 -89
- package/dist/keyword-coverage-judge.d.ts.map +0 -1
- package/dist/keyword-coverage-judge.test.d.ts +0 -2
- package/dist/keyword-coverage-judge.test.d.ts.map +0 -1
- package/dist/knowledge/index.d.ts.map +0 -1
- package/dist/knowledge/readiness.d.ts +0 -26
- package/dist/knowledge/readiness.d.ts.map +0 -1
- package/dist/knowledge/types.d.ts +0 -75
- package/dist/knowledge/types.d.ts.map +0 -1
- package/dist/live-proof.d.ts +0 -62
- package/dist/live-proof.d.ts.map +0 -1
- package/dist/llm-client.d.ts.map +0 -1
- package/dist/llm-client.test.d.ts +0 -2
- package/dist/llm-client.test.d.ts.map +0 -1
- package/dist/locked-jsonl-appender.d.ts.map +0 -1
- package/dist/matrix/aggregation.d.ts +0 -16
- package/dist/matrix/aggregation.d.ts.map +0 -1
- package/dist/matrix/index.d.ts.map +0 -1
- package/dist/matrix/runner.d.ts +0 -15
- package/dist/matrix/runner.d.ts.map +0 -1
- package/dist/matrix/types.d.ts.map +0 -1
- package/dist/meta-eval/calibration.d.ts +0 -47
- package/dist/meta-eval/calibration.d.ts.map +0 -1
- package/dist/meta-eval/correlation-study.d.ts +0 -53
- package/dist/meta-eval/correlation-study.d.ts.map +0 -1
- package/dist/meta-eval/index.d.ts.map +0 -1
- package/dist/meta-eval/outcome-store.d.ts.map +0 -1
- package/dist/meta-eval/rubric-predictive-validity.d.ts.map +0 -1
- package/dist/meta-eval/sentinel.d.ts +0 -169
- package/dist/meta-eval/sentinel.d.ts.map +0 -1
- package/dist/metrics.d.ts +0 -63
- package/dist/metrics.d.ts.map +0 -1
- package/dist/model-seats.d.ts +0 -71
- package/dist/model-seats.d.ts.map +0 -1
- package/dist/model-seats.test.d.ts +0 -2
- package/dist/model-seats.test.d.ts.map +0 -1
- package/dist/muffled-gate-scanner.d.ts +0 -102
- package/dist/muffled-gate-scanner.d.ts.map +0 -1
- package/dist/multi-layer-verifier.d.ts.map +0 -1
- package/dist/multi-layer-verifier.test.d.ts +0 -2
- package/dist/multi-layer-verifier.test.d.ts.map +0 -1
- package/dist/multi-toolchain-layer.d.ts +0 -80
- package/dist/multi-toolchain-layer.d.ts.map +0 -1
- package/dist/multi-toolchain-layer.test.d.ts +0 -2
- package/dist/multi-toolchain-layer.test.d.ts.map +0 -1
- package/dist/multishot/default-tools.d.ts +0 -34
- package/dist/multishot/default-tools.d.ts.map +0 -1
- package/dist/multishot/index.d.ts.map +0 -1
- package/dist/multishot/judges.d.ts +0 -32
- package/dist/multishot/judges.d.ts.map +0 -1
- package/dist/multishot/matrix.d.ts +0 -107
- package/dist/multishot/matrix.d.ts.map +0 -1
- package/dist/multishot/multishot.d.ts +0 -23
- package/dist/multishot/multishot.d.ts.map +0 -1
- package/dist/multishot/router.d.ts +0 -37
- package/dist/multishot/router.d.ts.map +0 -1
- package/dist/multishot/types.d.ts +0 -60
- package/dist/multishot/types.d.ts.map +0 -1
- package/dist/observability.d.ts +0 -71
- package/dist/observability.d.ts.map +0 -1
- package/dist/oracle.d.ts +0 -55
- package/dist/oracle.d.ts.map +0 -1
- package/dist/orthogonality.d.ts +0 -35
- package/dist/orthogonality.d.ts.map +0 -1
- package/dist/otel-pipeline.d.ts +0 -31
- package/dist/otel-pipeline.d.ts.map +0 -1
- package/dist/paraphrase.d.ts +0 -107
- package/dist/paraphrase.d.ts.map +0 -1
- package/dist/pareto.d.ts.map +0 -1
- package/dist/partition-held-out.d.ts +0 -70
- package/dist/partition-held-out.d.ts.map +0 -1
- package/dist/partition-held-out.test.d.ts +0 -2
- package/dist/partition-held-out.test.d.ts.map +0 -1
- package/dist/perf/index.d.ts.map +0 -1
- package/dist/perf/integrity.d.ts +0 -30
- package/dist/perf/integrity.d.ts.map +0 -1
- package/dist/perf/journey.d.ts +0 -45
- package/dist/perf/journey.d.ts.map +0 -1
- package/dist/perf/ratchet.d.ts +0 -47
- package/dist/perf/ratchet.d.ts.map +0 -1
- package/dist/pipelines/budget-breach.d.ts +0 -31
- package/dist/pipelines/budget-breach.d.ts.map +0 -1
- package/dist/pipelines/budget-breach.test.d.ts +0 -2
- package/dist/pipelines/budget-breach.test.d.ts.map +0 -1
- package/dist/pipelines/failure-cluster.d.ts +0 -38
- package/dist/pipelines/failure-cluster.d.ts.map +0 -1
- package/dist/pipelines/failure-cluster.test.d.ts +0 -2
- package/dist/pipelines/failure-cluster.test.d.ts.map +0 -1
- package/dist/pipelines/first-divergence.d.ts +0 -26
- package/dist/pipelines/first-divergence.d.ts.map +0 -1
- package/dist/pipelines/first-divergence.test.d.ts +0 -2
- package/dist/pipelines/first-divergence.test.d.ts.map +0 -1
- package/dist/pipelines/index.d.ts.map +0 -1
- package/dist/pipelines/judge-agreement.d.ts +0 -26
- package/dist/pipelines/judge-agreement.d.ts.map +0 -1
- package/dist/pipelines/judge-agreement.test.d.ts +0 -2
- package/dist/pipelines/judge-agreement.test.d.ts.map +0 -1
- package/dist/pipelines/regression.d.ts +0 -23
- package/dist/pipelines/regression.d.ts.map +0 -1
- package/dist/pipelines/regression.test.d.ts +0 -2
- package/dist/pipelines/regression.test.d.ts.map +0 -1
- package/dist/pipelines/stuck-loop.d.ts +0 -32
- package/dist/pipelines/stuck-loop.d.ts.map +0 -1
- package/dist/pipelines/stuck-loop.test.d.ts +0 -2
- package/dist/pipelines/stuck-loop.test.d.ts.map +0 -1
- package/dist/pipelines/tool-waste.d.ts +0 -34
- package/dist/pipelines/tool-waste.d.ts.map +0 -1
- package/dist/pipelines/tool-waste.test.d.ts +0 -2
- package/dist/pipelines/tool-waste.test.d.ts.map +0 -1
- package/dist/playbook.d.ts +0 -16
- package/dist/playbook.d.ts.map +0 -1
- package/dist/pr-review-benchmark.d.ts +0 -88
- package/dist/pr-review-benchmark.d.ts.map +0 -1
- package/dist/pr-review-benchmark.test.d.ts +0 -2
- package/dist/pr-review-benchmark.test.d.ts.map +0 -1
- package/dist/pre-registration.d.ts +0 -125
- package/dist/pre-registration.d.ts.map +0 -1
- package/dist/prm/builtin-rubrics.d.ts +0 -33
- package/dist/prm/builtin-rubrics.d.ts.map +0 -1
- package/dist/prm/index.d.ts.map +0 -1
- package/dist/prm/inference.d.ts +0 -29
- package/dist/prm/inference.d.ts.map +0 -1
- package/dist/prm/inference.test.d.ts +0 -2
- package/dist/prm/inference.test.d.ts.map +0 -1
- package/dist/prm/rubric.d.ts.map +0 -1
- package/dist/prm/training-export.d.ts +0 -38
- package/dist/prm/training-export.d.ts.map +0 -1
- package/dist/produced-state.d.ts +0 -63
- package/dist/produced-state.d.ts.map +0 -1
- package/dist/produced-state.test.d.ts +0 -8
- package/dist/produced-state.test.d.ts.map +0 -1
- package/dist/profile/baselines.d.ts +0 -37
- package/dist/profile/baselines.d.ts.map +0 -1
- package/dist/profile/index.d.ts +0 -105
- package/dist/profile/index.d.ts.map +0 -1
- package/dist/promotion-gate.d.ts +0 -93
- package/dist/promotion-gate.d.ts.map +0 -1
- package/dist/prompt-registry.d.ts +0 -41
- package/dist/prompt-registry.d.ts.map +0 -1
- package/dist/propose-review-control.d.ts +0 -49
- package/dist/propose-review-control.d.ts.map +0 -1
- package/dist/propose-review-control.test.d.ts +0 -2
- package/dist/propose-review-control.test.d.ts.map +0 -1
- package/dist/propose-review.d.ts +0 -155
- package/dist/propose-review.d.ts.map +0 -1
- package/dist/red-team.d.ts.map +0 -1
- package/dist/reference-replay-steering.d.ts +0 -11
- package/dist/reference-replay-steering.d.ts.map +0 -1
- package/dist/reference-replay.d.ts +0 -176
- package/dist/reference-replay.d.ts.map +0 -1
- package/dist/reflective-mutation.d.ts +0 -79
- package/dist/reflective-mutation.d.ts.map +0 -1
- package/dist/registry.d.ts +0 -31
- package/dist/registry.d.ts.map +0 -1
- package/dist/release-confidence.d.ts +0 -128
- package/dist/release-confidence.d.ts.map +0 -1
- package/dist/release-report.d.ts +0 -11
- package/dist/release-report.d.ts.map +0 -1
- package/dist/replay.d.ts +0 -120
- package/dist/replay.d.ts.map +0 -1
- package/dist/reporter.d.ts +0 -14
- package/dist/reporter.d.ts.map +0 -1
- package/dist/reporting.d.ts.map +0 -1
- package/dist/researcher.d.ts +0 -140
- package/dist/researcher.d.ts.map +0 -1
- package/dist/reviewer.d.ts +0 -118
- package/dist/reviewer.d.ts.map +0 -1
- package/dist/reviewer.test.d.ts +0 -2
- package/dist/reviewer.test.d.ts.map +0 -1
- package/dist/reward-model-export.d.ts +0 -60
- package/dist/reward-model-export.d.ts.map +0 -1
- package/dist/rl/active-curriculum.d.ts +0 -110
- package/dist/rl/active-curriculum.d.ts.map +0 -1
- package/dist/rl/adaptation-eval.d.ts +0 -109
- package/dist/rl/adaptation-eval.d.ts.map +0 -1
- package/dist/rl/adversarial.d.ts.map +0 -1
- package/dist/rl/compute-curves.d.ts +0 -127
- package/dist/rl/compute-curves.d.ts.map +0 -1
- package/dist/rl/contamination.d.ts +0 -117
- package/dist/rl/contamination.d.ts.map +0 -1
- package/dist/rl/corpus.d.ts +0 -55
- package/dist/rl/corpus.d.ts.map +0 -1
- package/dist/rl/corpus.test.d.ts +0 -2
- package/dist/rl/corpus.test.d.ts.map +0 -1
- package/dist/rl/dataset.d.ts +0 -102
- package/dist/rl/dataset.d.ts.map +0 -1
- package/dist/rl/dataset.test.d.ts +0 -2
- package/dist/rl/dataset.test.d.ts.map +0 -1
- package/dist/rl/exporters.d.ts +0 -141
- package/dist/rl/exporters.d.ts.map +0 -1
- package/dist/rl/index.d.ts +0 -49
- package/dist/rl/index.d.ts.map +0 -1
- package/dist/rl/off-policy.d.ts.map +0 -1
- package/dist/rl/predictive-validity-researcher.d.ts +0 -69
- package/dist/rl/predictive-validity-researcher.d.ts.map +0 -1
- package/dist/rl/preferences.d.ts +0 -141
- package/dist/rl/preferences.d.ts.map +0 -1
- package/dist/rl/process-reward.d.ts +0 -122
- package/dist/rl/process-reward.d.ts.map +0 -1
- package/dist/rl/reward-hacking.d.ts +0 -104
- package/dist/rl/reward-hacking.d.ts.map +0 -1
- package/dist/rl/rl-campaign.d.ts +0 -85
- package/dist/rl/rl-campaign.d.ts.map +0 -1
- package/dist/rl/run-record-adapters.d.ts +0 -56
- package/dist/rl/run-record-adapters.d.ts.map +0 -1
- package/dist/rl/sim-fidelity.d.ts +0 -166
- package/dist/rl/sim-fidelity.d.ts.map +0 -1
- package/dist/rl/sim-fidelity.test.d.ts +0 -2
- package/dist/rl/sim-fidelity.test.d.ts.map +0 -1
- package/dist/rl/tournament.d.ts +0 -115
- package/dist/rl/tournament.d.ts.map +0 -1
- package/dist/rl/verifiable-reward.d.ts +0 -124
- package/dist/rl/verifiable-reward.d.ts.map +0 -1
- package/dist/run-critic.d.ts +0 -23
- package/dist/run-critic.d.ts.map +0 -1
- package/dist/run-evidence.d.ts +0 -32
- package/dist/run-evidence.d.ts.map +0 -1
- package/dist/run-record.d.ts.map +0 -1
- package/dist/run-record.test.d.ts +0 -2
- package/dist/run-record.test.d.ts.map +0 -1
- package/dist/run-score.d.ts +0 -31
- package/dist/run-score.d.ts.map +0 -1
- package/dist/runtime-trajectory.d.ts +0 -47
- package/dist/runtime-trajectory.d.ts.map +0 -1
- package/dist/sandbox-harness.d.ts.map +0 -1
- package/dist/sandbox-harness.test.d.ts +0 -2
- package/dist/sandbox-harness.test.d.ts.map +0 -1
- package/dist/sandbox-pool.d.ts +0 -74
- package/dist/sandbox-pool.d.ts.map +0 -1
- package/dist/sandbox-pool.test.d.ts +0 -2
- package/dist/sandbox-pool.test.d.ts.map +0 -1
- package/dist/scorecard.d.ts +0 -133
- package/dist/scorecard.d.ts.map +0 -1
- package/dist/scorecard.test.d.ts +0 -2
- package/dist/scorecard.test.d.ts.map +0 -1
- package/dist/self-play.d.ts +0 -69
- package/dist/self-play.d.ts.map +0 -1
- package/dist/semantic-concept-judge.d.ts +0 -135
- package/dist/semantic-concept-judge.d.ts.map +0 -1
- package/dist/semantic-concept-judge.test.d.ts +0 -2
- package/dist/semantic-concept-judge.test.d.ts.map +0 -1
- package/dist/sequential.d.ts.map +0 -1
- package/dist/series-convergence.d.ts.map +0 -1
- package/dist/slo.d.ts +0 -48
- package/dist/slo.d.ts.map +0 -1
- package/dist/state-continuity.d.ts +0 -47
- package/dist/state-continuity.d.ts.map +0 -1
- package/dist/statistics.d.ts.map +0 -1
- package/dist/statistics.test.d.ts +0 -2
- package/dist/statistics.test.d.ts.map +0 -1
- package/dist/steering-optimizer.d.ts +0 -58
- package/dist/steering-optimizer.d.ts.map +0 -1
- package/dist/steering.d.ts +0 -24
- package/dist/steering.d.ts.map +0 -1
- package/dist/storyboard/code-edit.d.ts +0 -64
- package/dist/storyboard/code-edit.d.ts.map +0 -1
- package/dist/storyboard/code-edit.test.d.ts +0 -2
- package/dist/storyboard/code-edit.test.d.ts.map +0 -1
- package/dist/storyboard/index.d.ts.map +0 -1
- package/dist/storyboard/index.test.d.ts +0 -2
- package/dist/storyboard/index.test.d.ts.map +0 -1
- package/dist/summary-report.d.ts.map +0 -1
- package/dist/telemetry/client.d.ts +0 -35
- package/dist/telemetry/client.d.ts.map +0 -1
- package/dist/telemetry/index.d.ts.map +0 -1
- package/dist/telemetry/schema.d.ts +0 -61
- package/dist/telemetry/schema.d.ts.map +0 -1
- package/dist/telemetry/sink-fetch.d.ts +0 -39
- package/dist/telemetry/sink-fetch.d.ts.map +0 -1
- package/dist/telemetry/sink-file.d.ts.map +0 -1
- package/dist/test-graded-scenario.d.ts +0 -42
- package/dist/test-graded-scenario.d.ts.map +0 -1
- package/dist/testing.d.ts.map +0 -1
- package/dist/tool-use-metrics.d.ts +0 -35
- package/dist/tool-use-metrics.d.ts.map +0 -1
- package/dist/trace/capture-fetch.d.ts +0 -48
- package/dist/trace/capture-fetch.d.ts.map +0 -1
- package/dist/trace/capture-fetch.test.d.ts +0 -2
- package/dist/trace/capture-fetch.test.d.ts.map +0 -1
- package/dist/trace/emitter.d.ts.map +0 -1
- package/dist/trace/extract-usage.d.ts +0 -46
- package/dist/trace/extract-usage.d.ts.map +0 -1
- package/dist/trace/extract-usage.test.d.ts +0 -2
- package/dist/trace/extract-usage.test.d.ts.map +0 -1
- package/dist/trace/index.d.ts +0 -15
- package/dist/trace/index.d.ts.map +0 -1
- package/dist/trace/integrity.d.ts.map +0 -1
- package/dist/trace/otel-bridge.d.ts +0 -29
- package/dist/trace/otel-bridge.d.ts.map +0 -1
- package/dist/trace/otel-export.d.ts +0 -52
- package/dist/trace/otel-export.d.ts.map +0 -1
- package/dist/trace/otel.d.ts +0 -57
- package/dist/trace/otel.d.ts.map +0 -1
- package/dist/trace/otlp-attributes.d.ts +0 -17
- package/dist/trace/otlp-attributes.d.ts.map +0 -1
- package/dist/trace/query.d.ts +0 -29
- package/dist/trace/query.d.ts.map +0 -1
- package/dist/trace/query.test.d.ts +0 -2
- package/dist/trace/query.test.d.ts.map +0 -1
- package/dist/trace/raw-provider-sink.d.ts.map +0 -1
- package/dist/trace/redact.d.ts.map +0 -1
- package/dist/trace/schema.d.ts.map +0 -1
- package/dist/trace/store-to-otlp.d.ts +0 -72
- package/dist/trace/store-to-otlp.d.ts.map +0 -1
- package/dist/trace/store-to-otlp.test.d.ts +0 -2
- package/dist/trace/store-to-otlp.test.d.ts.map +0 -1
- package/dist/trace/store.d.ts.map +0 -1
- package/dist/trace/store.test.d.ts +0 -2
- package/dist/trace/store.test.d.ts.map +0 -1
- package/dist/trace-analyst/analyst.d.ts.map +0 -1
- package/dist/trace-analyst/analyst.test.d.ts +0 -2
- package/dist/trace-analyst/analyst.test.d.ts.map +0 -1
- package/dist/trace-analyst/behavioral-metrics.d.ts +0 -40
- package/dist/trace-analyst/behavioral-metrics.d.ts.map +0 -1
- package/dist/trace-analyst/behavioral-metrics.test.d.ts +0 -2
- package/dist/trace-analyst/behavioral-metrics.test.d.ts.map +0 -1
- package/dist/trace-analyst/hook.d.ts +0 -55
- package/dist/trace-analyst/hook.d.ts.map +0 -1
- package/dist/trace-analyst/index.d.ts +0 -18
- package/dist/trace-analyst/index.d.ts.map +0 -1
- package/dist/trace-analyst/insights.d.ts +0 -71
- package/dist/trace-analyst/insights.d.ts.map +0 -1
- package/dist/trace-analyst/insights.test.d.ts +0 -2
- package/dist/trace-analyst/insights.test.d.ts.map +0 -1
- package/dist/trace-analyst/otlp-flatten.d.ts +0 -42
- package/dist/trace-analyst/otlp-flatten.d.ts.map +0 -1
- package/dist/trace-analyst/otlp-span.d.ts +0 -85
- package/dist/trace-analyst/otlp-span.d.ts.map +0 -1
- package/dist/trace-analyst/otlp-span.test.d.ts +0 -2
- package/dist/trace-analyst/otlp-span.test.d.ts.map +0 -1
- package/dist/trace-analyst/otlp-to-run-records.d.ts +0 -115
- package/dist/trace-analyst/otlp-to-run-records.d.ts.map +0 -1
- package/dist/trace-analyst/otlp-to-run-records.test.d.ts +0 -2
- package/dist/trace-analyst/otlp-to-run-records.test.d.ts.map +0 -1
- package/dist/trace-analyst/otlp-to-run-records.timestamps.test.d.ts +0 -2
- package/dist/trace-analyst/otlp-to-run-records.timestamps.test.d.ts.map +0 -1
- package/dist/trace-analyst/prompts.d.ts +0 -6
- package/dist/trace-analyst/prompts.d.ts.map +0 -1
- package/dist/trace-analyst/store-otlp.d.ts +0 -126
- package/dist/trace-analyst/store-otlp.d.ts.map +0 -1
- package/dist/trace-analyst/store-otlp.test.d.ts +0 -8
- package/dist/trace-analyst/store-otlp.test.d.ts.map +0 -1
- package/dist/trace-analyst/store-otlp.timestamps.test.d.ts +0 -2
- package/dist/trace-analyst/store-otlp.timestamps.test.d.ts.map +0 -1
- package/dist/trace-analyst/store.d.ts +0 -63
- package/dist/trace-analyst/store.d.ts.map +0 -1
- package/dist/trace-analyst/tools.d.ts +0 -44
- package/dist/trace-analyst/tools.d.ts.map +0 -1
- package/dist/trace-analyst/tools.test.d.ts +0 -10
- package/dist/trace-analyst/tools.test.d.ts.map +0 -1
- package/dist/trace-analyst/types.d.ts.map +0 -1
- package/dist/trace-contracts.d.ts +0 -180
- package/dist/trace-contracts.d.ts.map +0 -1
- package/dist/traced-analyst.d.ts +0 -26
- package/dist/traced-analyst.d.ts.map +0 -1
- package/dist/traced-judges.d.ts +0 -27
- package/dist/traced-judges.d.ts.map +0 -1
- package/dist/traces.d.ts.map +0 -1
- package/dist/trajectory.d.ts.map +0 -1
- package/dist/types.d.ts.map +0 -1
- package/dist/ui-finding.d.ts +0 -104
- package/dist/ui-finding.d.ts.map +0 -1
- package/dist/verdict-cache.d.ts +0 -78
- package/dist/verdict-cache.d.ts.map +0 -1
- package/dist/verdict-cache.test.d.ts +0 -2
- package/dist/verdict-cache.test.d.ts.map +0 -1
- package/dist/verdict.d.ts.map +0 -1
- package/dist/visual-diff.d.ts +0 -32
- package/dist/visual-diff.d.ts.map +0 -1
- package/dist/wire/handlers.d.ts +0 -54
- package/dist/wire/handlers.d.ts.map +0 -1
- package/dist/wire/index.d.ts.map +0 -1
- package/dist/wire/openapi.d.ts +0 -3
- package/dist/wire/openapi.d.ts.map +0 -1
- package/dist/wire/rpc.d.ts +0 -21
- package/dist/wire/rpc.d.ts.map +0 -1
- package/dist/wire/rubrics.d.ts +0 -34
- package/dist/wire/rubrics.d.ts.map +0 -1
- package/dist/wire/schemas.d.ts +0 -410
- package/dist/wire/schemas.d.ts.map +0 -1
- package/dist/wire/server.d.ts +0 -60
- package/dist/wire/server.d.ts.map +0 -1
- package/dist/workflow/event-schema.d.ts +0 -5
- package/dist/workflow/event-schema.d.ts.map +0 -1
- package/dist/workflow/feedback-pack.d.ts +0 -99
- package/dist/workflow/feedback-pack.d.ts.map +0 -1
- package/dist/workflow/index.d.ts.map +0 -1
- package/dist/workflow/intelligence-export.d.ts +0 -62
- package/dist/workflow/intelligence-export.d.ts.map +0 -1
- package/dist/workflow/partner-report.d.ts +0 -49
- package/dist/workflow/partner-report.d.ts.map +0 -1
- package/dist/workflow/phase-graph.d.ts +0 -43
- package/dist/workflow/phase-graph.d.ts.map +0 -1
- package/dist/workflow/promotion-gate.d.ts +0 -61
- package/dist/workflow/promotion-gate.d.ts.map +0 -1
- package/dist/workflow/run-record.d.ts +0 -12
- package/dist/workflow/run-record.d.ts.map +0 -1
- package/dist/workflow/runtime-adapter.d.ts +0 -20
- package/dist/workflow/runtime-adapter.d.ts.map +0 -1
- package/dist/workflow/sanitize.d.ts +0 -21
- package/dist/workflow/sanitize.d.ts.map +0 -1
- package/dist/workflow/schema.d.ts +0 -5
- package/dist/workflow/schema.d.ts.map +0 -1
- package/dist/workflow/summary.d.ts +0 -43
- package/dist/workflow/summary.d.ts.map +0 -1
- package/dist/workflow/trace-event-fields.d.ts +0 -6
- package/dist/workflow/trace-event-fields.d.ts.map +0 -1
- package/dist/workflow/trajectory.d.ts +0 -15
- package/dist/workflow/trajectory.d.ts.map +0 -1
- package/dist/workflow/types.d.ts +0 -68
- package/dist/workflow/types.d.ts.map +0 -1
- package/dist/workspace-inspector.d.ts +0 -67
- package/dist/workspace-inspector.d.ts.map +0 -1
- package/dist/wrangler-deploy-runner.test.d.ts +0 -2
- package/dist/wrangler-deploy-runner.test.d.ts.map +0 -1
package/dist/rl/dataset.d.ts.map
DELETED
|
@@ -1 +0,0 @@
|
|
|
1
|
-
{"version":3,"file":"dataset.d.ts","sourceRoot":"","sources":["../../src/rl/dataset.ts"],"names":[],"mappings":"AAAA;;;;;;;;;;;;;;;;;GAiBG;AAEH,OAAO,KAAK,EAAE,SAAS,EAAE,WAAW,EAAE,MAAM,eAAe,CAAA;AAC3D,OAAO,EACL,KAAK,UAAU,EACf,KAAK,WAAW,EAChB,KAAK,UAAU,EAOhB,MAAM,aAAa,CAAA;AACpB,OAAO,KAAK,EAAE,gBAAgB,EAAE,MAAM,eAAe,CAAA;AAErD,MAAM,MAAM,UAAU,GAAG,eAAe,GAAG,eAAe,GAAG,OAAO,CAAA;AACpE,MAAM,MAAM,aAAa,GAAG,MAAM,GAAG,KAAK,GAAG,KAAK,CAAA;AAElD;gCACgC;AAChC,MAAM,WAAW,eAAe;IAC9B,IAAI,EAAE,MAAM,CAAA;IACZ,OAAO,EAAE,MAAM,CAAA;IACf,yDAAyD;IACzD,MAAM,EAAE,MAAM,CAAA;IACd;uCACmC;IACnC,OAAO,EAAE,MAAM,CAAA;IACf;8EAC0E;IAC1E,MAAM,EAAE;QAAE,IAAI,EAAE,UAAU,CAAC;QAAC,MAAM,EAAE,MAAM,CAAC;QAAC,WAAW,EAAE,MAAM,CAAA;KAAE,CAAA;IACjE,WAAW,EAAE,MAAM,CAAA;IACnB,UAAU,EAAE,MAAM,CAAA;IAClB,WAAW,EAAE,MAAM,CAAA;IACnB,oEAAoE;IACpE,YAAY,EAAE,MAAM,CAAA;IACpB,gCAAgC;IAChC,OAAO,CAAC,EAAE,aAAa,EAAE,CAAA;IACzB,qEAAqE;IACrE,YAAY,CAAC,EAAE;QACb,kBAAkB,CAAC,EAAE,QAAQ,GAAG,QAAQ,GAAG,SAAS,CAAA;QACpD,KAAK,CAAC,EAAE,OAAO,CAAA;QACf,sBAAsB,CAAC,EAAE,OAAO,CAAA;KACjC,CAAA;CACF;AAED,MAAM,WAAW,WAAW;IAC1B,CAAC,EAAE,MAAM,CAAA;IACT,IAAI,EAAE,MAAM,CAAA;IACZ,MAAM,EAAE,MAAM,CAAA;IACd,GAAG,EAAE,MAAM,CAAA;IACX,GAAG,EAAE,MAAM,CAAA;IACX,GAAG,EAAE,MAAM,CAAA;CACZ;AAED,MAAM,WAAW,cAAc;IAC7B,OAAO,EAAE,MAAM,CAAA;IACf,+EAA+E;IAC/E,MAAM,EAAE,MAAM,CAAC,WAAW,EAAE,MAAM,CAAC,CAAA;IACnC,MAAM,EAAE,WAAW,CAAA;IACnB,sEAAsE;IACtE,MAAM,EAAE,MAAM,EAAE,CAAA;IAChB,4EAA4E;IAC5E,YAAY,EAAE,MAAM,EAAE,CAAA;IACtB,UAAU,EAAE,MAAM,EAAE,CAAA;IACpB,WAAW,EAAE;QAAE,KAAK,EAAE,MAAM,CAAC;QAAC,MAAM,EAAE,MAAM,CAAA;KAAE,CAAA;IAC9C,YAAY,EAAE,MAAM,CAAA;CACrB;AAED,MAAM,WAAW,iBAAkB,SAAQ,eAAe;IACxD,OAAO,EAAE,aAAa,EAAE,CAAA;IACxB,SAAS,EAAE,OAAO,CAAC,MAAM,CAAC,aAAa,EAAE,MAAM,CAAC,CAAC,CAAA;IACjD,KAAK,EAAE,cAAc,CAAA;CACtB;AAED,MAAM,WAAW,eAAe;IAC9B,QAAQ,EAAE,iBAAiB,CAAA;IAC3B,4EAA4E;IAC5E,KAAK,EAAE,MAAM,CAAC,MAAM,EAAE,MAAM,CAAC,CAAA;CAC9B;AAgDD;;;;;;GAMG;AACH,wBAAsB,cAAc,CAClC,OAAO,EAAE,SAAS,EAAE,EACpB,OAAO,EAAE,WAAW,GAAG,UAAU,EACjC,MAAM,EAAE,eAAe,EACvB,WAAW,CAAC,EAAE;IAAE,OAAO,EAAE,gBAAgB,EAAE,CAAC;IAAC,OAAO,EAAE,UAAU,CAAA;CAAE,GACjE,OAAO,CAAC,eAAe,CAAC,CAoC1B;AAMD,6EAA6E;AAC7E,wBAAgB,mBAAmB,CAAC,CAAC,EAAE,iBAAiB,GAAG,MAAM,CAiDhE"}
|
|
@@ -1 +0,0 @@
|
|
|
1
|
-
{"version":3,"file":"dataset.test.d.ts","sourceRoot":"","sources":["../../src/rl/dataset.test.ts"],"names":[],"mappings":""}
|
package/dist/rl/exporters.d.ts
DELETED
|
@@ -1,141 +0,0 @@
|
|
|
1
|
-
/**
|
|
2
|
-
* Trainer-format exporters.
|
|
3
|
-
*
|
|
4
|
-
* agent-eval produces canonical artifacts (`RunRecord[]`, `PreferenceTriple[]`,
|
|
5
|
-
* `StepReward[]`, `PrmTrainingTriple[]`). RL training pipelines consume
|
|
6
|
-
* different shapes — Hugging Face TRL, Prime Intellect's prime-rl, OpenAI
|
|
7
|
-
* fine-tuning, Anthropic finetuning, OpenRLHF, verl. Each has its own
|
|
8
|
-
* JSONL conventions. Rather than ship N adapters, this module ships the
|
|
9
|
-
* canonical formats most production pipelines accept and ergonomic helpers
|
|
10
|
-
* for the rest.
|
|
11
|
-
*
|
|
12
|
-
* Shapes:
|
|
13
|
-
* - **DPO / IPO / KTO** — `{prompt, chosen, rejected}` JSONL. Consumed
|
|
14
|
-
* by HuggingFace TRL, prime-rl's offline DPO, OpenRLHF.
|
|
15
|
-
* - **GRPO offline** — `{prompt, completions[], rewards[]}` JSONL.
|
|
16
|
-
* Consumed by prime-rl GRPO, verl, OpenRLHF.
|
|
17
|
-
* - **SFT** — `{messages[]}` JSONL with chosen completion as the final
|
|
18
|
-
* assistant turn. Consumed by HF SFT trainers, OpenAI fine-tuning,
|
|
19
|
-
* Anthropic finetuning.
|
|
20
|
-
* - **PRM** — `{prompt, prefix_steps[], chosen_step, rejected_step}` JSONL.
|
|
21
|
-
* Consumed by Lightman-style PRM trainers and prime-rl's PRM mode.
|
|
22
|
-
*
|
|
23
|
-
* Why ship this in agent-eval rather than a separate adapter package: the
|
|
24
|
-
* canonical artifacts (`RunRecord[]`, `PreferenceTriple[]`, etc.) are
|
|
25
|
-
* agent-eval's contract; without first-party exporters consumers reverse-
|
|
26
|
-
* engineer the mapping every release. The exporters codify it.
|
|
27
|
-
*
|
|
28
|
-
* The exporters take callbacks for any field that isn't on the canonical
|
|
29
|
-
* artifact (specifically: prompt + completion text, since the package
|
|
30
|
-
* stores only their hashes by design — full text is the consumer's
|
|
31
|
-
* trace store / raw event log).
|
|
32
|
-
*/
|
|
33
|
-
import type { RunRecord } from '../run-record';
|
|
34
|
-
import type { PreferenceTriple } from './preferences';
|
|
35
|
-
import type { PrmTrainingTriple, StepReward } from './process-reward';
|
|
36
|
-
export interface DpoLookups {
|
|
37
|
-
/** Resolve the prompt text for a run (typically from a trace store / raw event sink). */
|
|
38
|
-
promptOf: (runId: string) => string | Promise<string>;
|
|
39
|
-
/** Resolve the assistant completion text for a run. */
|
|
40
|
-
completionOf: (runId: string) => string | Promise<string>;
|
|
41
|
-
}
|
|
42
|
-
export interface DpoExportRow {
|
|
43
|
-
prompt: string;
|
|
44
|
-
chosen: string;
|
|
45
|
-
rejected: string;
|
|
46
|
-
/** Carried-through margin. Some KTO / IPO variants use this. */
|
|
47
|
-
margin?: number;
|
|
48
|
-
/** Free-form metadata for downstream filtering / sharding. */
|
|
49
|
-
meta?: Record<string, unknown>;
|
|
50
|
-
}
|
|
51
|
-
/**
|
|
52
|
-
* Convert preference triples to TRL-compatible DPO rows. The shape
|
|
53
|
-
* `{prompt, chosen, rejected}` is the canonical HuggingFace DPODataset
|
|
54
|
-
* entry; every major DPO trainer accepts it.
|
|
55
|
-
*/
|
|
56
|
-
export declare function toDpoRows(triples: PreferenceTriple[], lookups: DpoLookups): Promise<DpoExportRow[]>;
|
|
57
|
-
/** Serialize DPO rows as JSONL. One line per row. */
|
|
58
|
-
export declare function toDpoJsonl(rows: DpoExportRow[]): string;
|
|
59
|
-
export interface GrpoLookups {
|
|
60
|
-
promptOf: (runId: string) => string | Promise<string>;
|
|
61
|
-
completionOf: (runId: string) => string | Promise<string>;
|
|
62
|
-
/** Optional: derive a custom reward from the run. Defaults to score. */
|
|
63
|
-
rewardOf?: (run: RunRecord) => number | null;
|
|
64
|
-
}
|
|
65
|
-
export interface GrpoExportRow {
|
|
66
|
-
prompt: string;
|
|
67
|
-
completions: string[];
|
|
68
|
-
rewards: number[];
|
|
69
|
-
/** runIds in the same order as `completions[]` for traceability. */
|
|
70
|
-
runIds: string[];
|
|
71
|
-
meta?: Record<string, unknown>;
|
|
72
|
-
}
|
|
73
|
-
/**
|
|
74
|
-
* Convert RunRecord[] grouped by `(scenarioId)` into GRPO offline rows —
|
|
75
|
-
* one row per scenario, with one completion per run on that scenario.
|
|
76
|
-
*
|
|
77
|
-
* GRPO (Shao et al. 2024 / DeepSeek-R1) trains on relative advantages
|
|
78
|
-
* within a group of completions for the same prompt; this is the
|
|
79
|
-
* canonical input format.
|
|
80
|
-
*/
|
|
81
|
-
export declare function toGrpoRows(runs: RunRecord[], lookups: GrpoLookups): Promise<GrpoExportRow[]>;
|
|
82
|
-
export declare function toGrpoJsonl(rows: GrpoExportRow[]): string;
|
|
83
|
-
export interface SftLookups {
|
|
84
|
-
promptOf: (runId: string) => string | Promise<string>;
|
|
85
|
-
completionOf: (runId: string) => string | Promise<string>;
|
|
86
|
-
/** Optional system message. Default omits. */
|
|
87
|
-
systemOf?: (run: RunRecord) => string | null | undefined;
|
|
88
|
-
/** Filter — return false to skip the run (e.g., low score, failed cases). */
|
|
89
|
-
include?: (run: RunRecord) => boolean;
|
|
90
|
-
}
|
|
91
|
-
export interface SftExportRow {
|
|
92
|
-
messages: Array<{
|
|
93
|
-
role: 'system' | 'user' | 'assistant';
|
|
94
|
-
content: string;
|
|
95
|
-
}>;
|
|
96
|
-
meta?: Record<string, unknown>;
|
|
97
|
-
}
|
|
98
|
-
/**
|
|
99
|
-
* Convert RunRecord[] into Hugging Face / OpenAI / Anthropic-style
|
|
100
|
-
* conversational SFT rows. By default every record becomes one row;
|
|
101
|
-
* pass `include` to filter (e.g., keep only `score >= 0.8` for
|
|
102
|
-
* rejection-sampling SFT).
|
|
103
|
-
*/
|
|
104
|
-
export declare function toSftRows(runs: RunRecord[], lookups: SftLookups): Promise<SftExportRow[]>;
|
|
105
|
-
export declare function toSftJsonl(rows: SftExportRow[]): string;
|
|
106
|
-
export interface PrmLookups {
|
|
107
|
-
/** Resolve the prompt text for a run. */
|
|
108
|
-
promptOf: (runId: string) => string | Promise<string>;
|
|
109
|
-
/** Resolve the trajectory step text for a (runId, spanId) pair. */
|
|
110
|
-
stepTextOf: (runId: string, spanId: string) => string | Promise<string>;
|
|
111
|
-
/** Optional: sequence of prefix span ids leading up to the divergence. */
|
|
112
|
-
prefixOf?: (runId: string, prefixStepIndex: number) => string[] | Promise<string[]>;
|
|
113
|
-
}
|
|
114
|
-
export interface PrmExportRow {
|
|
115
|
-
prompt: string;
|
|
116
|
-
/** Span ids for the steps before divergence — caller resolves text via `stepTextOf`. */
|
|
117
|
-
prefixSpanIds: string[];
|
|
118
|
-
prefixStepText: string[];
|
|
119
|
-
chosenStep: string;
|
|
120
|
-
rejectedStep: string;
|
|
121
|
-
chosenReward: number;
|
|
122
|
-
rejectedReward: number;
|
|
123
|
-
marginScore: number;
|
|
124
|
-
meta?: Record<string, unknown>;
|
|
125
|
-
}
|
|
126
|
-
/**
|
|
127
|
-
* Convert PRM training triples to JSONL rows. Caller's `stepTextOf`
|
|
128
|
-
* callback resolves span text from the consumer's trace store.
|
|
129
|
-
*/
|
|
130
|
-
export declare function toPrmRows(triples: PrmTrainingTriple[], lookups: PrmLookups): Promise<PrmExportRow[]>;
|
|
131
|
-
export declare function toPrmJsonl(rows: PrmExportRow[]): string;
|
|
132
|
-
export interface StepRewardJsonlRow {
|
|
133
|
-
runId: string;
|
|
134
|
-
spanId: string;
|
|
135
|
-
stepIndex: number;
|
|
136
|
-
reward: number;
|
|
137
|
-
determinism: 'deterministic' | 'probabilistic';
|
|
138
|
-
weight: number;
|
|
139
|
-
}
|
|
140
|
-
export declare function stepRewardsToJsonl(stepRewards: StepReward[]): string;
|
|
141
|
-
//# sourceMappingURL=exporters.d.ts.map
|
|
@@ -1 +0,0 @@
|
|
|
1
|
-
{"version":3,"file":"exporters.d.ts","sourceRoot":"","sources":["../../src/rl/exporters.ts"],"names":[],"mappings":"AAAA;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;GA+BG;AAEH,OAAO,KAAK,EAAE,SAAS,EAAE,MAAM,eAAe,CAAA;AAC9C,OAAO,KAAK,EAAE,gBAAgB,EAAE,MAAM,eAAe,CAAA;AACrD,OAAO,KAAK,EAAE,iBAAiB,EAAE,UAAU,EAAE,MAAM,kBAAkB,CAAA;AAIrE,MAAM,WAAW,UAAU;IACzB,yFAAyF;IACzF,QAAQ,EAAE,CAAC,KAAK,EAAE,MAAM,KAAK,MAAM,GAAG,OAAO,CAAC,MAAM,CAAC,CAAA;IACrD,uDAAuD;IACvD,YAAY,EAAE,CAAC,KAAK,EAAE,MAAM,KAAK,MAAM,GAAG,OAAO,CAAC,MAAM,CAAC,CAAA;CAC1D;AAED,MAAM,WAAW,YAAY;IAC3B,MAAM,EAAE,MAAM,CAAA;IACd,MAAM,EAAE,MAAM,CAAA;IACd,QAAQ,EAAE,MAAM,CAAA;IAChB,gEAAgE;IAChE,MAAM,CAAC,EAAE,MAAM,CAAA;IACf,8DAA8D;IAC9D,IAAI,CAAC,EAAE,MAAM,CAAC,MAAM,EAAE,OAAO,CAAC,CAAA;CAC/B;AAED;;;;GAIG;AACH,wBAAsB,SAAS,CAC7B,OAAO,EAAE,gBAAgB,EAAE,EAC3B,OAAO,EAAE,UAAU,GAClB,OAAO,CAAC,YAAY,EAAE,CAAC,CAyBzB;AAED,qDAAqD;AACrD,wBAAgB,UAAU,CAAC,IAAI,EAAE,YAAY,EAAE,GAAG,MAAM,CAEvD;AAID,MAAM,WAAW,WAAW;IAC1B,QAAQ,EAAE,CAAC,KAAK,EAAE,MAAM,KAAK,MAAM,GAAG,OAAO,CAAC,MAAM,CAAC,CAAA;IACrD,YAAY,EAAE,CAAC,KAAK,EAAE,MAAM,KAAK,MAAM,GAAG,OAAO,CAAC,MAAM,CAAC,CAAA;IACzD,wEAAwE;IACxE,QAAQ,CAAC,EAAE,CAAC,GAAG,EAAE,SAAS,KAAK,MAAM,GAAG,IAAI,CAAA;CAC7C;AAED,MAAM,WAAW,aAAa;IAC5B,MAAM,EAAE,MAAM,CAAA;IACd,WAAW,EAAE,MAAM,EAAE,CAAA;IACrB,OAAO,EAAE,MAAM,EAAE,CAAA;IACjB,oEAAoE;IACpE,MAAM,EAAE,MAAM,EAAE,CAAA;IAChB,IAAI,CAAC,EAAE,MAAM,CAAC,MAAM,EAAE,OAAO,CAAC,CAAA;CAC/B;AAED;;;;;;;GAOG;AACH,wBAAsB,UAAU,CAC9B,IAAI,EAAE,SAAS,EAAE,EACjB,OAAO,EAAE,WAAW,GACnB,OAAO,CAAC,aAAa,EAAE,CAAC,CAwC1B;AAED,wBAAgB,WAAW,CAAC,IAAI,EAAE,aAAa,EAAE,GAAG,MAAM,CAEzD;AAID,MAAM,WAAW,UAAU;IACzB,QAAQ,EAAE,CAAC,KAAK,EAAE,MAAM,KAAK,MAAM,GAAG,OAAO,CAAC,MAAM,CAAC,CAAA;IACrD,YAAY,EAAE,CAAC,KAAK,EAAE,MAAM,KAAK,MAAM,GAAG,OAAO,CAAC,MAAM,CAAC,CAAA;IACzD,8CAA8C;IAC9C,QAAQ,CAAC,EAAE,CAAC,GAAG,EAAE,SAAS,KAAK,MAAM,GAAG,IAAI,GAAG,SAAS,CAAA;IACxD,6EAA6E;IAC7E,OAAO,CAAC,EAAE,CAAC,GAAG,EAAE,SAAS,KAAK,OAAO,CAAA;CACtC;AAED,MAAM,WAAW,YAAY;IAC3B,QAAQ,EAAE,KAAK,CAAC;QAAE,IAAI,EAAE,QAAQ,GAAG,MAAM,GAAG,WAAW,CAAC;QAAC,OAAO,EAAE,MAAM,CAAA;KAAE,CAAC,CAAA;IAC3E,IAAI,CAAC,EAAE,MAAM,CAAC,MAAM,EAAE,OAAO,CAAC,CAAA;CAC/B;AAED;;;;;GAKG;AACH,wBAAsB,SAAS,CAAC,IAAI,EAAE,SAAS,EAAE,EAAE,OAAO,EAAE,UAAU,GAAG,OAAO,CAAC,YAAY,EAAE,CAAC,CA0B/F;AAED,wBAAgB,UAAU,CAAC,IAAI,EAAE,YAAY,EAAE,GAAG,MAAM,CAEvD;AAID,MAAM,WAAW,UAAU;IACzB,yCAAyC;IACzC,QAAQ,EAAE,CAAC,KAAK,EAAE,MAAM,KAAK,MAAM,GAAG,OAAO,CAAC,MAAM,CAAC,CAAA;IACrD,mEAAmE;IACnE,UAAU,EAAE,CAAC,KAAK,EAAE,MAAM,EAAE,MAAM,EAAE,MAAM,KAAK,MAAM,GAAG,OAAO,CAAC,MAAM,CAAC,CAAA;IACvE,0EAA0E;IAC1E,QAAQ,CAAC,EAAE,CAAC,KAAK,EAAE,MAAM,EAAE,eAAe,EAAE,MAAM,KAAK,MAAM,EAAE,GAAG,OAAO,CAAC,MAAM,EAAE,CAAC,CAAA;CACpF;AAED,MAAM,WAAW,YAAY;IAC3B,MAAM,EAAE,MAAM,CAAA;IACd,wFAAwF;IACxF,aAAa,EAAE,MAAM,EAAE,CAAA;IACvB,cAAc,EAAE,MAAM,EAAE,CAAA;IACxB,UAAU,EAAE,MAAM,CAAA;IAClB,YAAY,EAAE,MAAM,CAAA;IACpB,YAAY,EAAE,MAAM,CAAA;IACpB,cAAc,EAAE,MAAM,CAAA;IACtB,WAAW,EAAE,MAAM,CAAA;IACnB,IAAI,CAAC,EAAE,MAAM,CAAC,MAAM,EAAE,OAAO,CAAC,CAAA;CAC/B;AAED;;;GAGG;AACH,wBAAsB,SAAS,CAC7B,OAAO,EAAE,iBAAiB,EAAE,EAC5B,OAAO,EAAE,UAAU,GAClB,OAAO,CAAC,YAAY,EAAE,CAAC,CAgCzB;AAED,wBAAgB,UAAU,CAAC,IAAI,EAAE,YAAY,EAAE,GAAG,MAAM,CAEvD;AAID,MAAM,WAAW,kBAAkB;IACjC,KAAK,EAAE,MAAM,CAAA;IACb,MAAM,EAAE,MAAM,CAAA;IACd,SAAS,EAAE,MAAM,CAAA;IACjB,MAAM,EAAE,MAAM,CAAA;IACd,WAAW,EAAE,eAAe,GAAG,eAAe,CAAA;IAC9C,MAAM,EAAE,MAAM,CAAA;CACf;AAED,wBAAgB,kBAAkB,CAAC,WAAW,EAAE,UAAU,EAAE,GAAG,MAAM,CAUpE"}
|
package/dist/rl/index.d.ts
DELETED
|
@@ -1,49 +0,0 @@
|
|
|
1
|
-
/**
|
|
2
|
-
* RL/data bridge.
|
|
3
|
-
*
|
|
4
|
-
* This subpath groups everything that turns eval output into training signal:
|
|
5
|
-
* stable adapters/rewards, dataset packaging, trainer-format exporters,
|
|
6
|
-
* process rewards, and closed-loop campaign research. Keeping it off the root
|
|
7
|
-
* import path makes the default API smaller without hiding useful capability.
|
|
8
|
-
*/
|
|
9
|
-
/** Advanced budget allocation across (variant, scenario) cells. */
|
|
10
|
-
export * from './active-curriculum';
|
|
11
|
-
/** Advanced adaptation eval — does the policy actually learn from feedback? */
|
|
12
|
-
export * from './adaptation-eval';
|
|
13
|
-
/** Advanced scenario search for inputs the policy fails on. */
|
|
14
|
-
export * from './adversarial';
|
|
15
|
-
/** @stable Compute curves: best-of-N, self-consistency, Pareto frontier across budgets. */
|
|
16
|
-
export * from './compute-curves';
|
|
17
|
-
/** @stable Held-out perturbation probes for benchmark contamination (paired Wilcoxon). */
|
|
18
|
-
export * from './contamination';
|
|
19
|
-
/** @stable Durable corpus: every eval run appends graded trajectories by default; harvest → buildRlDataset (datasets for free). */
|
|
20
|
-
export * from './corpus';
|
|
21
|
-
/** @stable Publishable/sellable dataset bundle: format exporters + provenance + a Datasheet-for-Datasets card. */
|
|
22
|
-
export * from './dataset';
|
|
23
|
-
/** Trainer-format exporters (HuggingFace datasets, JSONL, parquet). */
|
|
24
|
-
export * from './exporters';
|
|
25
|
-
/** @stable Off-policy value estimation: IPS, SNIPS, doubly-robust. */
|
|
26
|
-
export * from './off-policy';
|
|
27
|
-
/** Researcher that re-weights rubrics by deployment outcome correlation. */
|
|
28
|
-
export * from './predictive-validity-researcher';
|
|
29
|
-
/** @stable (chosen, rejected) preference triples for DPO / KTO / PPO. */
|
|
30
|
-
export * from './preferences';
|
|
31
|
-
/** Step-level rewards and process-reward training pairs. */
|
|
32
|
-
export * from './process-reward';
|
|
33
|
-
/** Reward-hacking signatures: reward divergence, distribution shift, judge drift. */
|
|
34
|
-
export * from './reward-hacking';
|
|
35
|
-
/** Closed-loop campaign runner: eval → preferences → mutate → re-eval. */
|
|
36
|
-
export * from './rl-campaign';
|
|
37
|
-
/** @stable Canonical `RunRecord` adapters: trials → records, verification reports → records. */
|
|
38
|
-
export * from './run-record-adapters';
|
|
39
|
-
/** Simulator fidelity between simulated and production RunRecords. */
|
|
40
|
-
export * from './sim-fidelity';
|
|
41
|
-
/** @stable Bradley-Terry MLE + online Elo for pairwise tournament ratings. */
|
|
42
|
-
export * from './tournament';
|
|
43
|
-
/** @stable Verifiable reward extraction (compile / test / schema) with judge-noise filtering. */
|
|
44
|
-
export * from './verifiable-reward';
|
|
45
|
-
/** @stable In-memory + filesystem stores for deployment outcomes;
|
|
46
|
-
* consumed by `predictive-validity-researcher` to calibrate the gate
|
|
47
|
-
* against observed downstream metrics, not just held-out judge scores. */
|
|
48
|
-
export { type DeploymentOutcome, FileSystemOutcomeStore, type FileSystemOutcomeStoreOptions, InMemoryOutcomeStore, type OutcomeStore, } from '../meta-eval/outcome-store';
|
|
49
|
-
//# sourceMappingURL=index.d.ts.map
|
package/dist/rl/index.d.ts.map
DELETED
|
@@ -1 +0,0 @@
|
|
|
1
|
-
{"version":3,"file":"index.d.ts","sourceRoot":"","sources":["../../src/rl/index.ts"],"names":[],"mappings":"AAAA;;;;;;;GAOG;AAEH,mEAAmE;AACnE,cAAc,qBAAqB,CAAA;AACnC,+EAA+E;AAC/E,cAAc,mBAAmB,CAAA;AACjC,+DAA+D;AAC/D,cAAc,eAAe,CAAA;AAC7B,2FAA2F;AAC3F,cAAc,kBAAkB,CAAA;AAChC,0FAA0F;AAC1F,cAAc,iBAAiB,CAAA;AAC/B,mIAAmI;AACnI,cAAc,UAAU,CAAA;AACxB,kHAAkH;AAClH,cAAc,WAAW,CAAA;AACzB,uEAAuE;AACvE,cAAc,aAAa,CAAA;AAC3B,sEAAsE;AACtE,cAAc,cAAc,CAAA;AAC5B,4EAA4E;AAC5E,cAAc,kCAAkC,CAAA;AAChD,yEAAyE;AACzE,cAAc,eAAe,CAAA;AAC7B,4DAA4D;AAC5D,cAAc,kBAAkB,CAAA;AAChC,qFAAqF;AACrF,cAAc,kBAAkB,CAAA;AAChC,0EAA0E;AAC1E,cAAc,eAAe,CAAA;AAC7B,gGAAgG;AAChG,cAAc,uBAAuB,CAAA;AACrC,sEAAsE;AACtE,cAAc,gBAAgB,CAAA;AAC9B,8EAA8E;AAC9E,cAAc,cAAc,CAAA;AAC5B,iGAAiG;AACjG,cAAc,qBAAqB,CAAA;AAQnC;;2EAE2E;AAC3E,OAAO,EACL,KAAK,iBAAiB,EACtB,sBAAsB,EACtB,KAAK,6BAA6B,EAClC,oBAAoB,EACpB,KAAK,YAAY,GAClB,MAAM,4BAA4B,CAAA"}
|
|
@@ -1 +0,0 @@
|
|
|
1
|
-
{"version":3,"file":"off-policy.d.ts","sourceRoot":"","sources":["../../src/rl/off-policy.ts"],"names":[],"mappings":"AAAA;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;GAqCG;AAIH,MAAM,WAAW,mBAAmB;IAClC,uDAAuD;IACvD,KAAK,EAAE,MAAM,CAAA;IACb,wEAAwE;IACxE,MAAM,EAAE,MAAM,CAAA;IACd;;;;OAIG;IACH,YAAY,EAAE,MAAM,CAAA;IACpB;;;;OAIG;IACH,UAAU,EAAE,MAAM,CAAA;IAClB;;;OAGG;IACH,IAAI,CAAC,EAAE,MAAM,GAAG,IAAI,CAAA;CACrB;AAED,MAAM,WAAW,iBAAiB;IAChC,4CAA4C;IAC5C,KAAK,EAAE,MAAM,CAAA;IACb,sCAAsC;IACtC,aAAa,EAAE,MAAM,CAAA;IACrB,6FAA6F;IAC7F,mBAAmB,EAAE,MAAM,CAAA;IAC3B,mCAAmC;IACnC,CAAC,EAAE,MAAM,CAAA;IACT;;;OAGG;IACH,mBAAmB,EAAE,MAAM,CAAA;CAC5B;AAED,MAAM,WAAW,gBAAgB;IAC/B;;;;OAIG;IACH,SAAS,CAAC,EAAE,MAAM,CAAA;IAClB,+CAA+C;IAC/C,UAAU,CAAC,EAAE;QAAE,GAAG,EAAE,MAAM,CAAC;QAAC,IAAI,EAAE,MAAM,CAAA;KAAE,CAAA;CAC3C;AAED;;;;GAIG;AACH,wBAAgB,2BAA2B,CACzC,YAAY,EAAE,mBAAmB,EAAE,EACnC,IAAI,GAAE,gBAAqB,GAC1B,iBAAiB,CAqCnB;AAED;;;;GAIG;AACH,wBAAgB,iCAAiC,CAC/C,YAAY,EAAE,mBAAmB,EAAE,EACnC,IAAI,GAAE,gBAAqB,GAC1B,iBAAiB,CAkCnB;AAED;;;;;;;;;;;;;;;;;GAiBG;AACH,wBAAgB,YAAY,CAC1B,YAAY,EAAE,mBAAmB,EAAE,EACnC,IAAI,GAAE,gBAAqB,GAC1B,iBAAiB,CAuCnB;AAED;;;;GAIG;AACH,wBAAgB,oBAAoB,CAClC,YAAY,EAAE,mBAAmB,EAAE,EACnC,IAAI,GAAE,gBAAqB,GAC1B;IAAE,GAAG,EAAE,iBAAiB,CAAC;IAAC,KAAK,EAAE,iBAAiB,CAAC;IAAC,EAAE,EAAE,iBAAiB,CAAA;CAAE,CAM7E"}
|
|
@@ -1,69 +0,0 @@
|
|
|
1
|
-
/**
|
|
2
|
-
* `PredictiveValidityResearcher` — concrete `Researcher` implementation
|
|
3
|
-
* that drives selection from outcome-anchored predictive validity.
|
|
4
|
-
*
|
|
5
|
-
* Each method:
|
|
6
|
-
*
|
|
7
|
-
* - `inspectFailures(runs)` — synthesizes failure modes from the
|
|
8
|
-
* bottom-quartile of `RunRecord`s on the configured proxy reward.
|
|
9
|
-
* - `proposeChange(failures)` — proposes steering changes that target
|
|
10
|
-
* the rubrics with the lowest predictive validity (decorative ones).
|
|
11
|
-
* Either reduce their weight in the composite, or recalibrate them.
|
|
12
|
-
* - `applyChange(changes, baseline)` — merges the proposed steering
|
|
13
|
-
* into the experiment plan.
|
|
14
|
-
* - `evaluateChange(plan)` — re-runs the predictive-validity check on
|
|
15
|
-
* the post-change runs and reports the delta.
|
|
16
|
-
*
|
|
17
|
-
* The result is a closed loop: the rubric weights drift toward the ones
|
|
18
|
-
* that actually predict deployment outcomes, automatically. Pair with
|
|
19
|
-
* `runRLCampaign` for the full auto-research story.
|
|
20
|
-
*/
|
|
21
|
-
import type { OutcomeStore } from '../meta-eval/outcome-store';
|
|
22
|
-
import { type RubricPredictiveValidityReport } from '../meta-eval/rubric-predictive-validity';
|
|
23
|
-
import type { ExperimentPlan, ExperimentResult, FailureMode, Researcher, SteeringChange } from '../researcher';
|
|
24
|
-
import type { RunRecord } from '../run-record';
|
|
25
|
-
export interface PredictiveValidityResearcherOptions {
|
|
26
|
-
outcomes: OutcomeStore;
|
|
27
|
-
outcomeMetrics: string[];
|
|
28
|
-
/** Score threshold below which a run counts as a "failure." Default 0.5. */
|
|
29
|
-
failureThreshold?: number;
|
|
30
|
-
/** Spearman bucket below which a rubric is "decorative." Default 0.4. */
|
|
31
|
-
decorativeThreshold?: number;
|
|
32
|
-
/** Optional steering-namespace prefix for proposed changes. Default `'rubric_weight'`. */
|
|
33
|
-
steeringNamespace?: string;
|
|
34
|
-
/** Override the rubric set the researcher inspects. Default: every numeric `outcome.raw` key seen. */
|
|
35
|
-
rubrics?: string[];
|
|
36
|
-
/**
|
|
37
|
-
* Snapshot stash hook — called with the most recent predictive-validity
|
|
38
|
-
* report. Useful when a downstream system wants to log rubric drift over
|
|
39
|
-
* time. Default no-op.
|
|
40
|
-
*/
|
|
41
|
-
onReport?: (report: RubricPredictiveValidityReport) => void | Promise<void>;
|
|
42
|
-
}
|
|
43
|
-
/**
|
|
44
|
-
* Concrete `Researcher` driven by `rubricPredictiveValidity`. The brain:
|
|
45
|
-
* rubrics that don't predict deployment outcomes don't earn weight.
|
|
46
|
-
*/
|
|
47
|
-
export declare class PredictiveValidityResearcher implements Researcher {
|
|
48
|
-
private opts;
|
|
49
|
-
private lastReport;
|
|
50
|
-
constructor(opts: PredictiveValidityResearcherOptions);
|
|
51
|
-
inspectFailures(runs: RunRecord[]): Promise<FailureMode[]>;
|
|
52
|
-
proposeChange(failures: FailureMode[]): Promise<SteeringChange[]>;
|
|
53
|
-
applyChange(changes: SteeringChange[], baseline: ExperimentPlan): Promise<ExperimentPlan>;
|
|
54
|
-
evaluateChange(plan: ExperimentPlan): Promise<ExperimentResult>;
|
|
55
|
-
/**
|
|
56
|
-
* Run the predictive-validity check explicitly against a fresh RunRecord
|
|
57
|
-
* set. Updates the researcher's cached report so subsequent
|
|
58
|
-
* `proposeChange` calls have evidence to draw from.
|
|
59
|
-
*/
|
|
60
|
-
runValidityCheck(runs: RunRecord[]): Promise<RubricPredictiveValidityReport>;
|
|
61
|
-
/**
|
|
62
|
-
* Force-feed a predictive-validity report into the researcher state —
|
|
63
|
-
* useful when the consumer ran the report out-of-band and wants the
|
|
64
|
-
* researcher's later proposals informed by it.
|
|
65
|
-
*/
|
|
66
|
-
setReport(report: RubricPredictiveValidityReport): void;
|
|
67
|
-
getLastReport(): RubricPredictiveValidityReport | null;
|
|
68
|
-
}
|
|
69
|
-
//# sourceMappingURL=predictive-validity-researcher.d.ts.map
|
|
@@ -1 +0,0 @@
|
|
|
1
|
-
{"version":3,"file":"predictive-validity-researcher.d.ts","sourceRoot":"","sources":["../../src/rl/predictive-validity-researcher.ts"],"names":[],"mappings":"AAAA;;;;;;;;;;;;;;;;;;;GAmBG;AAGH,OAAO,KAAK,EAAE,YAAY,EAAE,MAAM,4BAA4B,CAAA;AAC9D,OAAO,EACL,KAAK,8BAA8B,EAEpC,MAAM,yCAAyC,CAAA;AAChD,OAAO,KAAK,EACV,cAAc,EACd,gBAAgB,EAChB,WAAW,EACX,UAAU,EACV,cAAc,EACf,MAAM,eAAe,CAAA;AACtB,OAAO,KAAK,EAAE,SAAS,EAAE,MAAM,eAAe,CAAA;AAE9C,MAAM,WAAW,mCAAmC;IAClD,QAAQ,EAAE,YAAY,CAAA;IACtB,cAAc,EAAE,MAAM,EAAE,CAAA;IACxB,4EAA4E;IAC5E,gBAAgB,CAAC,EAAE,MAAM,CAAA;IACzB,yEAAyE;IACzE,mBAAmB,CAAC,EAAE,MAAM,CAAA;IAC5B,0FAA0F;IAC1F,iBAAiB,CAAC,EAAE,MAAM,CAAA;IAC1B,sGAAsG;IACtG,OAAO,CAAC,EAAE,MAAM,EAAE,CAAA;IAClB;;;;OAIG;IACH,QAAQ,CAAC,EAAE,CAAC,MAAM,EAAE,8BAA8B,KAAK,IAAI,GAAG,OAAO,CAAC,IAAI,CAAC,CAAA;CAC5E;AAED;;;GAGG;AACH,qBAAa,4BAA6B,YAAW,UAAU;IAC7D,OAAO,CAAC,IAAI,CAAqC;IACjD,OAAO,CAAC,UAAU,CAA8C;gBAEpD,IAAI,EAAE,mCAAmC;IAI/C,eAAe,CAAC,IAAI,EAAE,SAAS,EAAE,GAAG,OAAO,CAAC,WAAW,EAAE,CAAC;IAoC1D,aAAa,CAAC,QAAQ,EAAE,WAAW,EAAE,GAAG,OAAO,CAAC,cAAc,EAAE,CAAC;IAmDjE,WAAW,CAAC,OAAO,EAAE,cAAc,EAAE,EAAE,QAAQ,EAAE,cAAc,GAAG,OAAO,CAAC,cAAc,CAAC;IASzF,cAAc,CAAC,IAAI,EAAE,cAAc,GAAG,OAAO,CAAC,gBAAgB,CAAC;IAgCrE;;;;OAIG;IACG,gBAAgB,CAAC,IAAI,EAAE,SAAS,EAAE,GAAG,OAAO,CAAC,8BAA8B,CAAC;IAYlF;;;;OAIG;IACH,SAAS,CAAC,MAAM,EAAE,8BAA8B,GAAG,IAAI;IAIvD,aAAa,IAAI,8BAA8B,GAAG,IAAI;CAGvD"}
|
package/dist/rl/preferences.d.ts
DELETED
|
@@ -1,141 +0,0 @@
|
|
|
1
|
-
/**
|
|
2
|
-
* Preference dataset extraction — bridge from `RunRecord[]` to RL training.
|
|
3
|
-
*
|
|
4
|
-
* Production RLHF / DPO / KTO / SimPO pipelines need preference triples:
|
|
5
|
-
* `(prompt, chosen, rejected)`. The campaign artifact already contains the
|
|
6
|
-
* ingredients — every (variantId, scenarioId, seed) cell is a candidate
|
|
7
|
-
* that ran the same prompt against the same scenario, scored by the same
|
|
8
|
-
* judge — but turning that into a clean preference dataset requires
|
|
9
|
-
* deciding *what counts as a preference*.
|
|
10
|
-
*
|
|
11
|
-
* This module ships three preference-extraction strategies with explicit
|
|
12
|
-
* tradeoffs, plus a unified output type compatible with HuggingFace TRL,
|
|
13
|
-
* Anthropic finetuning JSONL, and OpenAI fine-tuning APIs. The strategies
|
|
14
|
-
* are deliberately not auto-magical — picking the wrong one corrupts the
|
|
15
|
-
* gradient.
|
|
16
|
-
*
|
|
17
|
-
* Strategies:
|
|
18
|
-
*
|
|
19
|
-
* 1. **`paired-by-scenario-and-seed`** — exact-match comparisons. For
|
|
20
|
-
* each scenario × seed pair, compare every (variantA, variantB) on
|
|
21
|
-
* that exact (scenario, seed). Matches scenarios so the comparison
|
|
22
|
-
* isolates variant effects. Highest signal-to-noise; smallest
|
|
23
|
-
* dataset (only matched pairs count).
|
|
24
|
-
*
|
|
25
|
-
* 2. **`paired-by-scenario`** — looser matching. For each scenario,
|
|
26
|
-
* compare every (variantA, variantB) where both have ≥ 1 run on the
|
|
27
|
-
* same scenario. Aggregates across seeds to compute mean scores per
|
|
28
|
-
* (variant, scenario), then forms preferences from the means. More
|
|
29
|
-
* data, lower per-pair signal.
|
|
30
|
-
*
|
|
31
|
-
* 3. **`top-vs-bottom`** — coarsest. Within each scenario, the highest-
|
|
32
|
-
* scoring run is `chosen`, the lowest is `rejected`. Smallest dataset
|
|
33
|
-
* per scenario but biggest score gap per pair. Useful for early
|
|
34
|
-
* bootstrapping when you have few variants.
|
|
35
|
-
*
|
|
36
|
-
* The output `PreferenceTriple` is *agent-eval-canonical* but trivially
|
|
37
|
-
* mappable to TRL's `DPODataset` shape (`prompt`, `chosen`, `rejected`)
|
|
38
|
-
* via the `toTRLFormat` helper.
|
|
39
|
-
*/
|
|
40
|
-
import type { RunRecord } from '../run-record';
|
|
41
|
-
export type PreferenceStrategy = 'paired-by-scenario-and-seed' | 'paired-by-scenario' | 'top-vs-bottom';
|
|
42
|
-
export interface PreferenceTriple {
|
|
43
|
-
/** The scenario (input) the variants were run against. */
|
|
44
|
-
scenarioId: string;
|
|
45
|
-
/** RunRecord ids on each side, for traceability. */
|
|
46
|
-
chosenRunId: string;
|
|
47
|
-
rejectedRunId: string;
|
|
48
|
-
/** Variant ids — load-bearing for the RL update. */
|
|
49
|
-
chosenVariantId: string;
|
|
50
|
-
rejectedVariantId: string;
|
|
51
|
-
/** The score gap between chosen and rejected. Larger = stronger signal. */
|
|
52
|
-
marginScore: number;
|
|
53
|
-
/**
|
|
54
|
-
* Optional `(chosen_score, rejected_score)` pair for soft-margin DPO
|
|
55
|
-
* variants. Omitted for `top-vs-bottom` runs that don't carry meaningful
|
|
56
|
-
* scalar gaps.
|
|
57
|
-
*/
|
|
58
|
-
scores?: {
|
|
59
|
-
chosen: number;
|
|
60
|
-
rejected: number;
|
|
61
|
-
};
|
|
62
|
-
/** Tie-breaker — when multiple seeds match this scenario, the one used. */
|
|
63
|
-
seed?: number;
|
|
64
|
-
/**
|
|
65
|
-
* Free-form metadata propagated from the run records — e.g. original
|
|
66
|
-
* prompt-hash, model, etc. Lets the RL trainer reconstruct the prompt.
|
|
67
|
-
*/
|
|
68
|
-
meta: {
|
|
69
|
-
chosenPromptHash: string;
|
|
70
|
-
rejectedPromptHash: string;
|
|
71
|
-
chosenConfigHash: string;
|
|
72
|
-
rejectedConfigHash: string;
|
|
73
|
-
chosenModel: string;
|
|
74
|
-
rejectedModel: string;
|
|
75
|
-
};
|
|
76
|
-
}
|
|
77
|
-
export interface ExtractPreferencesOptions {
|
|
78
|
-
strategy?: PreferenceStrategy;
|
|
79
|
-
/**
|
|
80
|
-
* Minimum score gap required to admit a pair. Pairs below this are
|
|
81
|
-
* dropped — they're noise, not signal. Default 0.05 (5% of [0,1]).
|
|
82
|
-
*/
|
|
83
|
-
minMargin?: number;
|
|
84
|
-
/**
|
|
85
|
-
* Optional split tag filter — restrict to runs from one split. Default
|
|
86
|
-
* `'holdout'` (the canonical "real" signal).
|
|
87
|
-
*/
|
|
88
|
-
splitTag?: RunRecord['splitTag'];
|
|
89
|
-
/**
|
|
90
|
-
* Optional reward extractor that overrides `outcome.holdoutScore` /
|
|
91
|
-
* `outcome.searchScore`. Use to drive preferences off a verifiable
|
|
92
|
-
* reward instead of the headline score.
|
|
93
|
-
*/
|
|
94
|
-
rewardOf?: (run: RunRecord) => number | null;
|
|
95
|
-
}
|
|
96
|
-
export interface PreferenceExtractionReport {
|
|
97
|
-
pairs: PreferenceTriple[];
|
|
98
|
-
/** Number of (scenario, seed) cells inspected. */
|
|
99
|
-
cellsInspected: number;
|
|
100
|
-
/** Number of pairs filtered by `minMargin`. */
|
|
101
|
-
pairsBelowMargin: number;
|
|
102
|
-
/** Number of cells with only one variant (no comparison possible). */
|
|
103
|
-
cellsSingleton: number;
|
|
104
|
-
/** Strategy used. */
|
|
105
|
-
strategy: PreferenceStrategy;
|
|
106
|
-
}
|
|
107
|
-
/**
|
|
108
|
-
* Convert `RunRecord[]` to preference triples for RL training.
|
|
109
|
-
*
|
|
110
|
-
* Returns a structured report so callers can see how much data was
|
|
111
|
-
* dropped and why (low-margin pairs, singleton cells). For production
|
|
112
|
-
* pipelines, you usually want to:
|
|
113
|
-
*
|
|
114
|
-
* 1. Run a campaign producing 5–10 variants × 50–200 scenarios × 3 seeds
|
|
115
|
-
* 2. Call this with `strategy: 'paired-by-scenario-and-seed'` and a
|
|
116
|
-
* verifiable-reward extractor as `rewardOf`
|
|
117
|
-
* 3. Pass `report.pairs` to `toTRLFormat` and pipe to your DPO trainer
|
|
118
|
-
*/
|
|
119
|
-
export declare function extractPreferences(runs: RunRecord[], opts?: ExtractPreferencesOptions): PreferenceExtractionReport;
|
|
120
|
-
/**
|
|
121
|
-
* TRL-compatible export. TRL's `DPODataset` is `{ prompt, chosen, rejected }`
|
|
122
|
-
* but the prompt isn't stored on the RunRecord — only its hash. The caller
|
|
123
|
-
* passes a `promptOf(promptHash)` lookup that the TRL trainer can use.
|
|
124
|
-
*/
|
|
125
|
-
export declare function toTRLFormat(triples: PreferenceTriple[], promptOf: (hash: string) => string): Array<{
|
|
126
|
-
prompt: string;
|
|
127
|
-
chosen: string;
|
|
128
|
-
rejected: string;
|
|
129
|
-
}>;
|
|
130
|
-
/**
|
|
131
|
-
* Anthropic finetuning JSONL export — `{ system, user, assistant_chosen, assistant_rejected }`
|
|
132
|
-
* shape. Same caveat as TRL: prompt + outputs are content the caller has
|
|
133
|
-
* to map back from the run record / raw event log.
|
|
134
|
-
*/
|
|
135
|
-
export declare function toAnthropicFormat(triples: PreferenceTriple[]): Array<{
|
|
136
|
-
scenarioId: string;
|
|
137
|
-
chosenRunId: string;
|
|
138
|
-
rejectedRunId: string;
|
|
139
|
-
margin: number;
|
|
140
|
-
}>;
|
|
141
|
-
//# sourceMappingURL=preferences.d.ts.map
|
|
@@ -1 +0,0 @@
|
|
|
1
|
-
{"version":3,"file":"preferences.d.ts","sourceRoot":"","sources":["../../src/rl/preferences.ts"],"names":[],"mappings":"AAAA;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;GAsCG;AAEH,OAAO,KAAK,EAAE,SAAS,EAAE,MAAM,eAAe,CAAA;AAE9C,MAAM,MAAM,kBAAkB,GAC1B,6BAA6B,GAC7B,oBAAoB,GACpB,eAAe,CAAA;AAEnB,MAAM,WAAW,gBAAgB;IAC/B,0DAA0D;IAC1D,UAAU,EAAE,MAAM,CAAA;IAClB,oDAAoD;IACpD,WAAW,EAAE,MAAM,CAAA;IACnB,aAAa,EAAE,MAAM,CAAA;IACrB,oDAAoD;IACpD,eAAe,EAAE,MAAM,CAAA;IACvB,iBAAiB,EAAE,MAAM,CAAA;IACzB,2EAA2E;IAC3E,WAAW,EAAE,MAAM,CAAA;IACnB;;;;OAIG;IACH,MAAM,CAAC,EAAE;QAAE,MAAM,EAAE,MAAM,CAAC;QAAC,QAAQ,EAAE,MAAM,CAAA;KAAE,CAAA;IAC7C,2EAA2E;IAC3E,IAAI,CAAC,EAAE,MAAM,CAAA;IACb;;;OAGG;IACH,IAAI,EAAE;QACJ,gBAAgB,EAAE,MAAM,CAAA;QACxB,kBAAkB,EAAE,MAAM,CAAA;QAC1B,gBAAgB,EAAE,MAAM,CAAA;QACxB,kBAAkB,EAAE,MAAM,CAAA;QAC1B,WAAW,EAAE,MAAM,CAAA;QACnB,aAAa,EAAE,MAAM,CAAA;KACtB,CAAA;CACF;AAED,MAAM,WAAW,yBAAyB;IACxC,QAAQ,CAAC,EAAE,kBAAkB,CAAA;IAC7B;;;OAGG;IACH,SAAS,CAAC,EAAE,MAAM,CAAA;IAClB;;;OAGG;IACH,QAAQ,CAAC,EAAE,SAAS,CAAC,UAAU,CAAC,CAAA;IAChC;;;;OAIG;IACH,QAAQ,CAAC,EAAE,CAAC,GAAG,EAAE,SAAS,KAAK,MAAM,GAAG,IAAI,CAAA;CAC7C;AAED,MAAM,WAAW,0BAA0B;IACzC,KAAK,EAAE,gBAAgB,EAAE,CAAA;IACzB,kDAAkD;IAClD,cAAc,EAAE,MAAM,CAAA;IACtB,+CAA+C;IAC/C,gBAAgB,EAAE,MAAM,CAAA;IACxB,sEAAsE;IACtE,cAAc,EAAE,MAAM,CAAA;IACtB,qBAAqB;IACrB,QAAQ,EAAE,kBAAkB,CAAA;CAC7B;AASD;;;;;;;;;;;GAWG;AACH,wBAAgB,kBAAkB,CAChC,IAAI,EAAE,SAAS,EAAE,EACjB,IAAI,GAAE,yBAA8B,GACnC,0BAA0B,CAoH5B;AAED;;;;GAIG;AACH,wBAAgB,WAAW,CACzB,OAAO,EAAE,gBAAgB,EAAE,EAC3B,QAAQ,EAAE,CAAC,IAAI,EAAE,MAAM,KAAK,MAAM,GACjC,KAAK,CAAC;IAAE,MAAM,EAAE,MAAM,CAAC;IAAC,MAAM,EAAE,MAAM,CAAC;IAAC,QAAQ,EAAE,MAAM,CAAA;CAAE,CAAC,CAM7D;AAED;;;;GAIG;AACH,wBAAgB,iBAAiB,CAC/B,OAAO,EAAE,gBAAgB,EAAE,GAC1B,KAAK,CAAC;IAAE,UAAU,EAAE,MAAM,CAAC;IAAC,WAAW,EAAE,MAAM,CAAC;IAAC,aAAa,EAAE,MAAM,CAAC;IAAC,MAAM,EAAE,MAAM,CAAA;CAAE,CAAC,CAO3F"}
|
|
@@ -1,122 +0,0 @@
|
|
|
1
|
-
/**
|
|
2
|
-
* Process reward extraction — step-level credit assignment from trace spans.
|
|
3
|
-
*
|
|
4
|
-
* RL on long-horizon agents needs *step-level* rewards, not run-level
|
|
5
|
-
* ones. The classic credit-assignment problem (Sutton & Barto) requires
|
|
6
|
-
* knowing which sub-decisions in a trajectory contributed to the
|
|
7
|
-
* outcome. Modern systems (DeepSeek-R1, OpenAI o-series, Lightman et al.
|
|
8
|
-
* "Let's Verify Step by Step" 2023) train *process reward models* (PRMs)
|
|
9
|
-
* that score every step, then do RL with the PRM as the reward signal.
|
|
10
|
-
*
|
|
11
|
-
* This module extracts `StepReward[]` from trace spans — one per
|
|
12
|
-
* meaningful step — and ships:
|
|
13
|
-
*
|
|
14
|
-
* 1. `extractStepRewards(store, runId, opts)` — span → step-reward
|
|
15
|
-
* conversion using configurable per-span scorers (LLM judge over the
|
|
16
|
-
* span output, deterministic checkers, or a learned PRM).
|
|
17
|
-
* 2. `runwiseStepRewardSummary(stepRewards)` — aggregate the per-step
|
|
18
|
-
* signal into a credit-assignment-aware run-level score.
|
|
19
|
-
* 3. `prmTrainingPairs(stepRewards, options)` — produce the
|
|
20
|
-
* `(prefix, suffix_chosen, suffix_rejected)` triples that PRM
|
|
21
|
-
* training pipelines consume.
|
|
22
|
-
*
|
|
23
|
-
* What we ship: the *extraction* and *aggregation* infrastructure plus
|
|
24
|
-
* the data shape PRM training expects. We do NOT ship the actual PRM
|
|
25
|
-
* training (gradient descent over a transformer is out of scope for a
|
|
26
|
-
* TS package). The interface is the contract; downstream consumers wire
|
|
27
|
-
* their preferred trainer.
|
|
28
|
-
*
|
|
29
|
-
* Caveat the panel will land: this is descriptive credit assignment
|
|
30
|
-
* (which steps correlate with outcome), not causal credit assignment
|
|
31
|
-
* (which steps caused outcome). For causal claims you need
|
|
32
|
-
* counterfactual rollouts or a learned dynamics model. Future work; the
|
|
33
|
-
* descriptive version is what production PRM training actually uses.
|
|
34
|
-
*/
|
|
35
|
-
import type { Span } from '../trace/schema';
|
|
36
|
-
import type { TraceStore } from '../trace/store';
|
|
37
|
-
export interface StepReward {
|
|
38
|
-
/** Trace span this reward attaches to. */
|
|
39
|
-
spanId: string;
|
|
40
|
-
runId: string;
|
|
41
|
-
/** Index in the trajectory (0-based, in started-at order). */
|
|
42
|
-
stepIndex: number;
|
|
43
|
-
/** Span kind (typically 'tool', 'llm', 'judge'). */
|
|
44
|
-
kind: Span['kind'];
|
|
45
|
-
/** Span name — for the consumer's downstream filtering. */
|
|
46
|
-
name: string;
|
|
47
|
-
/** Step-level reward in [0, 1]. */
|
|
48
|
-
reward: number;
|
|
49
|
-
/**
|
|
50
|
-
* Determinism class. Mirrors the verifiable-reward distinction:
|
|
51
|
-
* deterministic = test/compile/schema check; probabilistic = LLM judge.
|
|
52
|
-
*/
|
|
53
|
-
determinism: 'deterministic' | 'probabilistic';
|
|
54
|
-
/** Optional rationale / evidence — the trainer typically discards. */
|
|
55
|
-
rationale?: string;
|
|
56
|
-
/** Optional weight — how much this step contributes to credit assignment. */
|
|
57
|
-
weight?: number;
|
|
58
|
-
}
|
|
59
|
-
export interface StepScorer {
|
|
60
|
-
/** Span kinds this scorer applies to. */
|
|
61
|
-
appliesTo: Span['kind'][];
|
|
62
|
-
/** Returns null to skip the span; returns a `StepReward` shape (without index/runId/spanId, which are filled in). */
|
|
63
|
-
score(span: Span): Promise<Omit<StepReward, 'spanId' | 'runId' | 'stepIndex'>> | null | undefined;
|
|
64
|
-
}
|
|
65
|
-
export interface ExtractStepRewardsOptions {
|
|
66
|
-
/**
|
|
67
|
-
* Ordered list of scorers. Each span runs through scorers in order;
|
|
68
|
-
* the first non-null result wins. If no scorer applies, the span is
|
|
69
|
-
* skipped (not all spans are training-worthy).
|
|
70
|
-
*/
|
|
71
|
-
scorers: StepScorer[];
|
|
72
|
-
/** Optional filter — return null to drop the span entirely before scoring. */
|
|
73
|
-
preFilter?: (span: Span) => boolean;
|
|
74
|
-
}
|
|
75
|
-
export declare function extractStepRewards(store: TraceStore, runId: string, opts: ExtractStepRewardsOptions): Promise<StepReward[]>;
|
|
76
|
-
export interface RunwiseStepSummary {
|
|
77
|
-
runId: string;
|
|
78
|
-
totalSteps: number;
|
|
79
|
-
meanReward: number;
|
|
80
|
-
/** Sum-of-rewards (weighted by `weight ?? 1`). Use as the run-level proxy. */
|
|
81
|
-
sumWeightedReward: number;
|
|
82
|
-
/** Fraction of steps where reward < 0.5 — proxy for "where the policy was wrong." */
|
|
83
|
-
failureFraction: number;
|
|
84
|
-
/** Maximum drop in reward between consecutive steps — diagnoses a step where things went sideways. */
|
|
85
|
-
worstStepDelta: number;
|
|
86
|
-
worstStepIndex: number | null;
|
|
87
|
-
}
|
|
88
|
-
export declare function runwiseStepRewardSummary(stepRewards: StepReward[]): RunwiseStepSummary;
|
|
89
|
-
export interface PrmTrainingTriple {
|
|
90
|
-
/** Prefix run-id (or composite key) — the trajectory up to step k-1. */
|
|
91
|
-
prefixRunId: string;
|
|
92
|
-
prefixStepIndex: number;
|
|
93
|
-
/** The step that came next on a high-reward trajectory. */
|
|
94
|
-
chosenSpanId: string;
|
|
95
|
-
chosenReward: number;
|
|
96
|
-
/** A step from a divergent low-reward trajectory at the same prefix length. */
|
|
97
|
-
rejectedSpanId: string;
|
|
98
|
-
rejectedReward: number;
|
|
99
|
-
/** The prefix run came from this run; the rejected step came from `rejectedRunId`. */
|
|
100
|
-
rejectedRunId: string;
|
|
101
|
-
marginScore: number;
|
|
102
|
-
}
|
|
103
|
-
/**
|
|
104
|
-
* Build PRM training triples. The shape: pair runs that share an early
|
|
105
|
-
* prefix (same scenario, same first N steps) and diverge later — at the
|
|
106
|
-
* point of divergence, the high-reward run's next step is `chosen`, the
|
|
107
|
-
* low-reward run's next step is `rejected`. This is the canonical PRM
|
|
108
|
-
* training data shape from Lightman et al. and DeepSeek-R1 process
|
|
109
|
-
* supervision.
|
|
110
|
-
*
|
|
111
|
-
* Implementation note: we don't have a way to detect "same prefix" in
|
|
112
|
-
* the general agent setting (token-level prefixes require hashing model
|
|
113
|
-
* outputs). The current heuristic groups by `(scenarioId, prefixSpanName
|
|
114
|
-
* sequence)` — runs are paired when their first K span names match. For
|
|
115
|
-
* production use this should be replaced with a proper trajectory-prefix
|
|
116
|
-
* hash; the heuristic is good enough for early-stage scaffolding.
|
|
117
|
-
*/
|
|
118
|
-
export declare function prmTrainingPairs(stepRewardsByRun: Map<string, StepReward[]>, opts?: {
|
|
119
|
-
minMargin?: number;
|
|
120
|
-
minPrefixLength?: number;
|
|
121
|
-
}): PrmTrainingTriple[];
|
|
122
|
-
//# sourceMappingURL=process-reward.d.ts.map
|
|
@@ -1 +0,0 @@
|
|
|
1
|
-
{"version":3,"file":"process-reward.d.ts","sourceRoot":"","sources":["../../src/rl/process-reward.ts"],"names":[],"mappings":"AAAA;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;GAiCG;AAEH,OAAO,KAAK,EAAE,IAAI,EAAE,MAAM,iBAAiB,CAAA;AAC3C,OAAO,KAAK,EAAE,UAAU,EAAE,MAAM,gBAAgB,CAAA;AAEhD,MAAM,WAAW,UAAU;IACzB,0CAA0C;IAC1C,MAAM,EAAE,MAAM,CAAA;IACd,KAAK,EAAE,MAAM,CAAA;IACb,8DAA8D;IAC9D,SAAS,EAAE,MAAM,CAAA;IACjB,oDAAoD;IACpD,IAAI,EAAE,IAAI,CAAC,MAAM,CAAC,CAAA;IAClB,2DAA2D;IAC3D,IAAI,EAAE,MAAM,CAAA;IACZ,mCAAmC;IACnC,MAAM,EAAE,MAAM,CAAA;IACd;;;OAGG;IACH,WAAW,EAAE,eAAe,GAAG,eAAe,CAAA;IAC9C,sEAAsE;IACtE,SAAS,CAAC,EAAE,MAAM,CAAA;IAClB,6EAA6E;IAC7E,MAAM,CAAC,EAAE,MAAM,CAAA;CAChB;AAED,MAAM,WAAW,UAAU;IACzB,yCAAyC;IACzC,SAAS,EAAE,IAAI,CAAC,MAAM,CAAC,EAAE,CAAA;IACzB,qHAAqH;IACrH,KAAK,CAAC,IAAI,EAAE,IAAI,GAAG,OAAO,CAAC,IAAI,CAAC,UAAU,EAAE,QAAQ,GAAG,OAAO,GAAG,WAAW,CAAC,CAAC,GAAG,IAAI,GAAG,SAAS,CAAA;CAClG;AAED,MAAM,WAAW,yBAAyB;IACxC;;;;OAIG;IACH,OAAO,EAAE,UAAU,EAAE,CAAA;IACrB,8EAA8E;IAC9E,SAAS,CAAC,EAAE,CAAC,IAAI,EAAE,IAAI,KAAK,OAAO,CAAA;CACpC;AAED,wBAAsB,kBAAkB,CACtC,KAAK,EAAE,UAAU,EACjB,KAAK,EAAE,MAAM,EACb,IAAI,EAAE,yBAAyB,GAC9B,OAAO,CAAC,UAAU,EAAE,CAAC,CA8BvB;AAED,MAAM,WAAW,kBAAkB;IACjC,KAAK,EAAE,MAAM,CAAA;IACb,UAAU,EAAE,MAAM,CAAA;IAClB,UAAU,EAAE,MAAM,CAAA;IAClB,8EAA8E;IAC9E,iBAAiB,EAAE,MAAM,CAAA;IACzB,qFAAqF;IACrF,eAAe,EAAE,MAAM,CAAA;IACvB,sGAAsG;IACtG,cAAc,EAAE,MAAM,CAAA;IACtB,cAAc,EAAE,MAAM,GAAG,IAAI,CAAA;CAC9B;AAED,wBAAgB,wBAAwB,CAAC,WAAW,EAAE,UAAU,EAAE,GAAG,kBAAkB,CA6CtF;AAED,MAAM,WAAW,iBAAiB;IAChC,wEAAwE;IACxE,WAAW,EAAE,MAAM,CAAA;IACnB,eAAe,EAAE,MAAM,CAAA;IACvB,2DAA2D;IAC3D,YAAY,EAAE,MAAM,CAAA;IACpB,YAAY,EAAE,MAAM,CAAA;IACpB,+EAA+E;IAC/E,cAAc,EAAE,MAAM,CAAA;IACtB,cAAc,EAAE,MAAM,CAAA;IACtB,sFAAsF;IACtF,aAAa,EAAE,MAAM,CAAA;IACrB,WAAW,EAAE,MAAM,CAAA;CACpB;AAED;;;;;;;;;;;;;;GAcG;AACH,wBAAgB,gBAAgB,CAC9B,gBAAgB,EAAE,GAAG,CAAC,MAAM,EAAE,UAAU,EAAE,CAAC,EAC3C,IAAI,GAAE;IAAE,SAAS,CAAC,EAAE,MAAM,CAAC;IAAC,eAAe,CAAC,EAAE,MAAM,CAAA;CAAO,GAC1D,iBAAiB,EAAE,CAsDrB"}
|