@tangle-network/agent-eval 0.93.0 → 0.95.0
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/CHANGELOG.md +15 -0
- package/README.md +44 -30
- package/dist/action-policy.d.ts +24 -0
- package/dist/action-policy.d.ts.map +1 -0
- package/dist/action-policy.test.d.ts +2 -0
- package/dist/action-policy.test.d.ts.map +1 -0
- package/dist/active-learning.d.ts +41 -0
- package/dist/active-learning.d.ts.map +1 -0
- package/dist/adapters/http.d.ts +15 -21
- package/dist/adapters/http.d.ts.map +1 -0
- package/dist/adapters/http.js.map +1 -1
- package/dist/adapters/langchain.d.ts +7 -13
- package/dist/adapters/langchain.d.ts.map +1 -0
- package/dist/adapters/otel.d.ts +13 -24
- package/dist/adapters/otel.d.ts.map +1 -0
- package/dist/agent-profile-cell.d.ts +101 -0
- package/dist/agent-profile-cell.d.ts.map +1 -0
- package/dist/agent-profile.d.ts +27 -0
- package/dist/agent-profile.d.ts.map +1 -0
- package/dist/agent-profile.test.d.ts +2 -0
- package/dist/agent-profile.test.d.ts.map +1 -0
- package/dist/analyst/adapters.d.ts +62 -0
- package/dist/analyst/adapters.d.ts.map +1 -0
- package/dist/analyst/analyst.test.d.ts +2 -0
- package/dist/analyst/analyst.test.d.ts.map +1 -0
- package/dist/analyst/ax-service.d.ts +27 -0
- package/dist/analyst/ax-service.d.ts.map +1 -0
- package/dist/analyst/behavioral-analyst.d.ts +28 -0
- package/dist/analyst/behavioral-analyst.d.ts.map +1 -0
- package/dist/analyst/chat-client.d.ts +91 -0
- package/dist/analyst/chat-client.d.ts.map +1 -0
- package/dist/analyst/default-registry.d.ts +27 -0
- package/dist/analyst/default-registry.d.ts.map +1 -0
- package/dist/analyst/default-registry.test.d.ts +2 -0
- package/dist/analyst/default-registry.test.d.ts.map +1 -0
- package/dist/analyst/finding-signature.d.ts +48 -0
- package/dist/analyst/finding-signature.d.ts.map +1 -0
- package/dist/analyst/finding-subject.d.ts +146 -0
- package/dist/analyst/finding-subject.d.ts.map +1 -0
- package/dist/analyst/finding-subject.test.d.ts +2 -0
- package/dist/analyst/finding-subject.test.d.ts.map +1 -0
- package/dist/analyst/findings-store.d.ts +75 -0
- package/dist/analyst/findings-store.d.ts.map +1 -0
- package/dist/analyst/index.d.ts +28 -256
- package/dist/analyst/index.d.ts.map +1 -0
- package/dist/analyst/index.js +6 -66
- package/dist/analyst/index.js.map +1 -1
- package/dist/{kind-factory-5b7xXXOr.d.ts → analyst/kind-factory.d.ts} +11 -63
- package/dist/analyst/kind-factory.d.ts.map +1 -0
- package/dist/analyst/kinds/failure-mode.d.ts +19 -0
- package/dist/analyst/kinds/failure-mode.d.ts.map +1 -0
- package/dist/analyst/kinds/improvement.d.ts +23 -0
- package/dist/analyst/kinds/improvement.d.ts.map +1 -0
- package/dist/analyst/kinds/index.d.ts +22 -0
- package/dist/analyst/kinds/index.d.ts.map +1 -0
- package/dist/analyst/kinds/kinds.test.d.ts +2 -0
- package/dist/analyst/kinds/kinds.test.d.ts.map +1 -0
- package/dist/analyst/kinds/knowledge-gap.d.ts +28 -0
- package/dist/analyst/kinds/knowledge-gap.d.ts.map +1 -0
- package/dist/analyst/kinds/knowledge-poisoning.d.ts +22 -0
- package/dist/analyst/kinds/knowledge-poisoning.d.ts.map +1 -0
- package/dist/analyst/kinds/skill-usage.d.ts +84 -0
- package/dist/analyst/kinds/skill-usage.d.ts.map +1 -0
- package/dist/analyst/kinds/skill-usage.test.d.ts +2 -0
- package/dist/analyst/kinds/skill-usage.test.d.ts.map +1 -0
- package/dist/analyst/parse-tolerant.d.ts +26 -0
- package/dist/analyst/parse-tolerant.d.ts.map +1 -0
- package/dist/analyst/parse-tolerant.test.d.ts +2 -0
- package/dist/analyst/parse-tolerant.test.d.ts.map +1 -0
- package/dist/analyst/registry.budget.test.d.ts +2 -0
- package/dist/analyst/registry.budget.test.d.ts.map +1 -0
- package/dist/{default-registry-zoGHUQEH.d.ts → analyst/registry.d.ts} +8 -37
- package/dist/analyst/registry.d.ts.map +1 -0
- package/dist/analyst/steer-firewall.d.ts +35 -0
- package/dist/analyst/steer-firewall.d.ts.map +1 -0
- package/dist/analyst/steer-firewall.test.d.ts +2 -0
- package/dist/analyst/steer-firewall.test.d.ts.map +1 -0
- package/dist/analyst/structure-findings.d.ts +37 -0
- package/dist/analyst/structure-findings.d.ts.map +1 -0
- package/dist/analyst/structure-findings.test.d.ts +2 -0
- package/dist/analyst/structure-findings.test.d.ts.map +1 -0
- package/dist/analyst/tool-groups.d.ts +34 -0
- package/dist/analyst/tool-groups.d.ts.map +1 -0
- package/dist/{types-2VVIL04s.d.ts → analyst/types.d.ts} +19 -112
- package/dist/analyst/types.d.ts.map +1 -0
- package/dist/anti-slop.d.ts +59 -0
- package/dist/anti-slop.d.ts.map +1 -0
- package/dist/artifact-validator.d.ts +74 -0
- package/dist/artifact-validator.d.ts.map +1 -0
- package/dist/attestation.d.ts +63 -0
- package/dist/attestation.d.ts.map +1 -0
- package/dist/attestation.test.d.ts +2 -0
- package/dist/attestation.test.d.ts.map +1 -0
- package/dist/authenticity/index.d.ts +15 -16
- package/dist/authenticity/index.d.ts.map +1 -0
- package/dist/authenticity/index.test.d.ts +2 -0
- package/dist/authenticity/index.test.d.ts.map +1 -0
- package/dist/auto-pr.d.ts +120 -0
- package/dist/auto-pr.d.ts.map +1 -0
- package/dist/{baseline-DE36-Np7.d.ts → baseline.d.ts} +8 -44
- package/dist/baseline.d.ts.map +1 -0
- package/dist/behavior-dsl.d.ts +73 -0
- package/dist/behavior-dsl.d.ts.map +1 -0
- package/dist/belief-state/calibration.d.ts +10 -0
- package/dist/belief-state/calibration.d.ts.map +1 -0
- package/dist/belief-state/calibration.test.d.ts +2 -0
- package/dist/belief-state/calibration.test.d.ts.map +1 -0
- package/dist/belief-state/code-agent-corpus.d.ts +66 -0
- package/dist/belief-state/code-agent-corpus.d.ts.map +1 -0
- package/dist/belief-state/code-agent-corpus.test.d.ts +2 -0
- package/dist/belief-state/code-agent-corpus.test.d.ts.map +1 -0
- package/dist/belief-state/code-agent-evidence.d.ts +22 -0
- package/dist/belief-state/code-agent-evidence.d.ts.map +1 -0
- package/dist/belief-state/code-agent-evidence.test.d.ts +2 -0
- package/dist/belief-state/code-agent-evidence.test.d.ts.map +1 -0
- package/dist/belief-state/extract.d.ts +7 -0
- package/dist/belief-state/extract.d.ts.map +1 -0
- package/dist/belief-state/extract.test.d.ts +2 -0
- package/dist/belief-state/extract.test.d.ts.map +1 -0
- package/dist/belief-state/index.d.ts +14 -604
- package/dist/belief-state/index.d.ts.map +1 -0
- package/dist/belief-state/index.js +1 -1
- package/dist/belief-state/ope.d.ts +17 -0
- package/dist/belief-state/ope.d.ts.map +1 -0
- package/dist/belief-state/ope.test.d.ts +2 -0
- package/dist/belief-state/ope.test.d.ts.map +1 -0
- package/dist/belief-state/phase0-measurement.d.ts +55 -0
- package/dist/belief-state/phase0-measurement.d.ts.map +1 -0
- package/dist/belief-state/report.d.ts +17 -0
- package/dist/belief-state/report.d.ts.map +1 -0
- package/dist/belief-state/report.test.d.ts +2 -0
- package/dist/belief-state/report.test.d.ts.map +1 -0
- package/dist/belief-state/research-evidence.d.ts +23 -0
- package/dist/belief-state/research-evidence.d.ts.map +1 -0
- package/dist/belief-state/research-evidence.test.d.ts +2 -0
- package/dist/belief-state/research-evidence.test.d.ts.map +1 -0
- package/dist/belief-state/runtime-benchmark-corpus.d.ts +32 -0
- package/dist/belief-state/runtime-benchmark-corpus.d.ts.map +1 -0
- package/dist/belief-state/runtime-hooks.d.ts +87 -0
- package/dist/belief-state/runtime-hooks.d.ts.map +1 -0
- package/dist/belief-state/runtime-hooks.test.d.ts +2 -0
- package/dist/belief-state/runtime-hooks.test.d.ts.map +1 -0
- package/dist/belief-state/selective.d.ts +15 -0
- package/dist/belief-state/selective.d.ts.map +1 -0
- package/dist/belief-state/selective.test.d.ts +2 -0
- package/dist/belief-state/selective.test.d.ts.map +1 -0
- package/dist/belief-state/shadow-probe.d.ts +80 -0
- package/dist/belief-state/shadow-probe.d.ts.map +1 -0
- package/dist/belief-state/shadow-probe.test.d.ts +2 -0
- package/dist/belief-state/shadow-probe.test.d.ts.map +1 -0
- package/dist/belief-state/types.d.ts +195 -0
- package/dist/belief-state/types.d.ts.map +1 -0
- package/dist/belief-state/types.test.d.ts +2 -0
- package/dist/belief-state/types.test.d.ts.map +1 -0
- package/dist/benchmark.d.ts +14 -0
- package/dist/benchmark.d.ts.map +1 -0
- package/dist/benchmarks/index.d.ts +23 -4
- package/dist/benchmarks/index.d.ts.map +1 -0
- package/dist/benchmarks/routing/dataset.d.ts +34 -0
- package/dist/benchmarks/routing/dataset.d.ts.map +1 -0
- package/dist/benchmarks/routing/index.d.ts +34 -0
- package/dist/benchmarks/routing/index.d.ts.map +1 -0
- package/dist/benchmarks/types.d.ts +49 -0
- package/dist/benchmarks/types.d.ts.map +1 -0
- package/dist/bisector.d.ts +81 -0
- package/dist/bisector.d.ts.map +1 -0
- package/dist/budget-guard.d.ts +31 -0
- package/dist/budget-guard.d.ts.map +1 -0
- package/dist/builder-eval/builder-session.d.ts +111 -0
- package/dist/builder-eval/builder-session.d.ts.map +1 -0
- package/dist/builder-eval/correlation.d.ts +32 -0
- package/dist/builder-eval/correlation.d.ts.map +1 -0
- package/dist/builder-eval/index.d.ts +5 -250
- package/dist/builder-eval/index.d.ts.map +1 -0
- package/dist/builder-eval/index.js +2 -2
- package/dist/builder-eval/project-registry.d.ts +51 -0
- package/dist/builder-eval/project-registry.d.ts.map +1 -0
- package/dist/builder-eval/three-layer-eval.d.ts +55 -0
- package/dist/builder-eval/three-layer-eval.d.ts.map +1 -0
- package/dist/campaign/analyst-surface.d.ts +108 -0
- package/dist/campaign/analyst-surface.d.ts.map +1 -0
- package/dist/campaign/analyst-surface.test.d.ts +2 -0
- package/dist/campaign/analyst-surface.test.d.ts.map +1 -0
- package/dist/campaign/auto-pr.d.ts +46 -0
- package/dist/campaign/auto-pr.d.ts.map +1 -0
- package/dist/campaign/distillation/agreement-judge.d.ts +69 -0
- package/dist/campaign/distillation/agreement-judge.d.ts.map +1 -0
- package/dist/campaign/distillation/cli.d.ts +35 -0
- package/dist/campaign/distillation/cli.d.ts.map +1 -0
- package/dist/campaign/distillation/distillation.test.d.ts +2 -0
- package/dist/campaign/distillation/distillation.test.d.ts.map +1 -0
- package/dist/campaign/distillation/gold-scenarios.d.ts +54 -0
- package/dist/campaign/distillation/gold-scenarios.d.ts.map +1 -0
- package/dist/campaign/distillation/run-distillation.d.ts +119 -0
- package/dist/campaign/distillation/run-distillation.d.ts.map +1 -0
- package/dist/campaign/gates/compose.d.ts +12 -0
- package/dist/campaign/gates/compose.d.ts.map +1 -0
- package/dist/campaign/gates/default-production-gate.d.ts +58 -0
- package/dist/campaign/gates/default-production-gate.d.ts.map +1 -0
- package/dist/campaign/gates/heldout-gate.d.ts +12 -0
- package/dist/campaign/gates/heldout-gate.d.ts.map +1 -0
- package/dist/campaign/gates/promotion-policy.d.ts +125 -0
- package/dist/campaign/gates/promotion-policy.d.ts.map +1 -0
- package/dist/campaign/gates/promotion-policy.test.d.ts +2 -0
- package/dist/campaign/gates/promotion-policy.test.d.ts.map +1 -0
- package/dist/campaign/gates/sequential.d.ts +146 -0
- package/dist/campaign/gates/sequential.d.ts.map +1 -0
- package/dist/campaign/gates/sequential.test.d.ts +2 -0
- package/dist/campaign/gates/sequential.test.d.ts.map +1 -0
- package/dist/campaign/gates/statistical-heldout.d.ts +99 -0
- package/dist/campaign/gates/statistical-heldout.d.ts.map +1 -0
- package/dist/campaign/gates/statistical-heldout.test.d.ts +2 -0
- package/dist/campaign/gates/statistical-heldout.test.d.ts.map +1 -0
- package/dist/campaign/index.d.ts +38 -1341
- package/dist/campaign/index.d.ts.map +1 -0
- package/dist/campaign/index.js +1865 -1318
- package/dist/campaign/index.js.map +1 -1
- package/dist/campaign/labeled-store/fs-adapter.d.ts +59 -0
- package/dist/campaign/labeled-store/fs-adapter.d.ts.map +1 -0
- package/dist/campaign/presets/compare-proposers.d.ts +146 -0
- package/dist/campaign/presets/compare-proposers.d.ts.map +1 -0
- package/dist/campaign/presets/playback.d.ts +120 -0
- package/dist/campaign/presets/playback.d.ts.map +1 -0
- package/dist/campaign/presets/playback.test.d.ts +2 -0
- package/dist/campaign/presets/playback.test.d.ts.map +1 -0
- package/dist/campaign/presets/run-eval.d.ts +14 -0
- package/dist/campaign/presets/run-eval.d.ts.map +1 -0
- package/dist/campaign/presets/run-improvement-loop.d.ts +63 -0
- package/dist/campaign/presets/run-improvement-loop.d.ts.map +1 -0
- package/dist/campaign/presets/run-improvement-loop.test.d.ts +2 -0
- package/dist/campaign/presets/run-improvement-loop.test.d.ts.map +1 -0
- package/dist/campaign/presets/run-optimization.d.ts +92 -0
- package/dist/campaign/presets/run-optimization.d.ts.map +1 -0
- package/dist/campaign/presets/run-profile-matrix.d.ts +151 -0
- package/dist/campaign/presets/run-profile-matrix.d.ts.map +1 -0
- package/dist/campaign/presets/run-skill-opt.d.ts +96 -0
- package/dist/campaign/presets/run-skill-opt.d.ts.map +1 -0
- package/dist/campaign/proposers/_findings-text.d.ts +22 -0
- package/dist/campaign/proposers/_findings-text.d.ts.map +1 -0
- package/dist/campaign/proposers/ace.d.ts +33 -0
- package/dist/campaign/proposers/ace.d.ts.map +1 -0
- package/dist/campaign/proposers/ace.test.d.ts +2 -0
- package/dist/campaign/proposers/ace.test.d.ts.map +1 -0
- package/dist/campaign/proposers/analysis-edit.d.ts +32 -0
- package/dist/campaign/proposers/analysis-edit.d.ts.map +1 -0
- package/dist/campaign/proposers/evolutionary.d.ts +20 -0
- package/dist/campaign/proposers/evolutionary.d.ts.map +1 -0
- package/dist/campaign/proposers/fapo.d.ts +120 -0
- package/dist/campaign/proposers/fapo.d.ts.map +1 -0
- package/dist/campaign/proposers/gepa.d.ts +86 -0
- package/dist/campaign/proposers/gepa.d.ts.map +1 -0
- package/dist/campaign/proposers/halo.d.ts +44 -0
- package/dist/campaign/proposers/halo.d.ts.map +1 -0
- package/dist/campaign/proposers/halo.test.d.ts +2 -0
- package/dist/campaign/proposers/halo.test.d.ts.map +1 -0
- package/dist/campaign/proposers/memory.d.ts +47 -0
- package/dist/campaign/proposers/memory.d.ts.map +1 -0
- package/dist/campaign/proposers/memory.test.d.ts +2 -0
- package/dist/campaign/proposers/memory.test.d.ts.map +1 -0
- package/dist/campaign/proposers/skill-opt.d.ts +88 -0
- package/dist/campaign/proposers/skill-opt.d.ts.map +1 -0
- package/dist/campaign/proposers/trace-analyst.d.ts +48 -0
- package/dist/campaign/proposers/trace-analyst.d.ts.map +1 -0
- package/dist/campaign/proposers/trace-analyst.test.d.ts +2 -0
- package/dist/campaign/proposers/trace-analyst.test.d.ts.map +1 -0
- package/dist/campaign/provenance.d.ts +185 -0
- package/dist/campaign/provenance.d.ts.map +1 -0
- package/dist/campaign/run-campaign.d.ts +90 -0
- package/dist/campaign/run-campaign.d.ts.map +1 -0
- package/dist/campaign/score-utils.d.ts +26 -0
- package/dist/campaign/score-utils.d.ts.map +1 -0
- package/dist/campaign/skill-patch.d.ts +62 -0
- package/dist/campaign/skill-patch.d.ts.map +1 -0
- package/dist/campaign/storage.d.ts +38 -0
- package/dist/campaign/storage.d.ts.map +1 -0
- package/dist/{types-BU-7W85F.d.ts → campaign/types.d.ts} +98 -99
- package/dist/campaign/types.d.ts.map +1 -0
- package/dist/campaign/worktree/index.d.ts +53 -0
- package/dist/campaign/worktree/index.d.ts.map +1 -0
- package/dist/canary.d.ts +101 -0
- package/dist/canary.d.ts.map +1 -0
- package/dist/causal-attribution.d.ts +45 -0
- package/dist/causal-attribution.d.ts.map +1 -0
- package/dist/{chunk-TWS7AZEY.js → chunk-2T4EZACH.js} +2 -2
- package/dist/chunk-2T4EZACH.js.map +1 -0
- package/dist/{chunk-LMZQ2Z4U.js → chunk-56GC6VYO.js} +126 -1
- package/dist/chunk-56GC6VYO.js.map +1 -0
- package/dist/{chunk-QG2OVF2D.js → chunk-77T4STFI.js} +154 -112
- package/dist/chunk-77T4STFI.js.map +1 -0
- package/dist/{chunk-ZFIBGEOL.js → chunk-7QTQKIDD.js} +179 -178
- package/dist/chunk-7QTQKIDD.js.map +1 -0
- package/dist/{chunk-UMMZHCPB.js → chunk-AQ5WQAIV.js} +26 -9
- package/dist/chunk-AQ5WQAIV.js.map +1 -0
- package/dist/{chunk-CVVHBFGN.js → chunk-CWNP4DV4.js} +53 -5
- package/dist/chunk-CWNP4DV4.js.map +1 -0
- package/dist/{chunk-QS3RBQPI.js → chunk-D5KBVULY.js} +2 -2
- package/dist/chunk-DJWX3GVS.js +81 -0
- package/dist/chunk-DJWX3GVS.js.map +1 -0
- package/dist/{chunk-S6OZEZQK.js → chunk-HMA63UEO.js} +37 -9
- package/dist/{chunk-S6OZEZQK.js.map → chunk-HMA63UEO.js.map} +1 -1
- package/dist/{chunk-UHMJT4T7.js → chunk-IZCEK2HR.js} +2 -2
- package/dist/{chunk-6SOJM3VR.js → chunk-KKWJD5E6.js} +21 -21
- package/dist/chunk-KKWJD5E6.js.map +1 -0
- package/dist/{chunk-KWRRMR3J.js → chunk-LO6IOIJ2.js} +10 -10
- package/dist/chunk-LO6IOIJ2.js.map +1 -0
- package/dist/{chunk-L3JOU6XM.js → chunk-NACM5RS7.js} +3 -3
- package/dist/{chunk-E4GH6USR.js → chunk-NZEQVRH5.js} +2 -2
- package/dist/chunk-NZEQVRH5.js.map +1 -0
- package/dist/{chunk-XY4DDNEG.js → chunk-PSWWQXHF.js} +14 -89
- package/dist/chunk-PSWWQXHF.js.map +1 -0
- package/dist/{chunk-4FBZZIYD.js → chunk-QTMYW64F.js} +2 -2
- package/dist/{chunk-D3V5B42D.js → chunk-S4SYLDFX.js} +7 -4
- package/dist/chunk-S4SYLDFX.js.map +1 -0
- package/dist/{chunk-47X6LRCE.js → chunk-UFSG7ACU.js} +10 -7
- package/dist/chunk-UFSG7ACU.js.map +1 -0
- package/dist/{chunk-CY6U5S3X.js → chunk-URWVKRCS.js} +2 -2
- package/dist/{chunk-GSH6QNNS.js → chunk-X74V6ESX.js} +102 -79
- package/dist/chunk-X74V6ESX.js.map +1 -0
- package/dist/{chunk-QAY5UIJO.js → chunk-YBIGNSCZ.js} +178 -59
- package/dist/chunk-YBIGNSCZ.js.map +1 -0
- package/dist/{chunk-Y47J2LJ3.js → chunk-Z6L6YSU6.js} +5 -5
- package/dist/{chunk-T375SUOZ.js → chunk-ZOPLCJSY.js} +86 -31
- package/dist/chunk-ZOPLCJSY.js.map +1 -0
- package/dist/ci-gate.d.ts +44 -0
- package/dist/ci-gate.d.ts.map +1 -0
- package/dist/cli.d.ts +2 -0
- package/dist/cli.d.ts.map +1 -0
- package/dist/cli.js +2 -2
- package/dist/client.d.ts +77 -0
- package/dist/client.d.ts.map +1 -0
- package/dist/client.test.d.ts +2 -0
- package/dist/client.test.d.ts.map +1 -0
- package/dist/command-runner.d.ts +74 -0
- package/dist/command-runner.d.ts.map +1 -0
- package/dist/command-runner.test.d.ts +2 -0
- package/dist/command-runner.test.d.ts.map +1 -0
- package/dist/completion-verifier.d.ts +147 -0
- package/dist/completion-verifier.d.ts.map +1 -0
- package/dist/completion-verifier.test.d.ts +9 -0
- package/dist/completion-verifier.test.d.ts.map +1 -0
- package/dist/concurrency.d.ts +23 -0
- package/dist/concurrency.d.ts.map +1 -0
- package/dist/contamination-guard.d.ts +81 -0
- package/dist/contamination-guard.d.ts.map +1 -0
- package/dist/{analyze-runs-DwCEkpO_.d.ts → contract/analyze-runs.d.ts} +9 -10
- package/dist/contract/analyze-runs.d.ts.map +1 -0
- package/dist/contract/define-agent-eval.d.ts +52 -0
- package/dist/contract/define-agent-eval.d.ts.map +1 -0
- package/dist/contract/diff.d.ts +114 -0
- package/dist/contract/diff.d.ts.map +1 -0
- package/dist/contract/index.d.ts +106 -640
- package/dist/contract/index.d.ts.map +1 -0
- package/dist/contract/index.js +131 -21
- package/dist/contract/index.js.map +1 -1
- package/dist/{insight-report-BBwvOh6x.d.ts → contract/insight-report.d.ts} +16 -19
- package/dist/contract/insight-report.d.ts.map +1 -0
- package/dist/contract/insight-types-fwd.d.ts +7 -0
- package/dist/contract/insight-types-fwd.d.ts.map +1 -0
- package/dist/contract/intake/agent-trace.d.ts +97 -0
- package/dist/contract/intake/agent-trace.d.ts.map +1 -0
- package/dist/{code-agent-session-BO8nCnv3.d.ts → contract/intake/code-agent-session.d.ts} +15 -17
- package/dist/contract/intake/code-agent-session.d.ts.map +1 -0
- package/dist/contract/intake/feedback-table.d.ts +87 -0
- package/dist/contract/intake/feedback-table.d.ts.map +1 -0
- package/dist/contract/intake/index.d.ts +22 -0
- package/dist/contract/intake/index.d.ts.map +1 -0
- package/dist/contract/intake/otel-spans.d.ts +33 -0
- package/dist/contract/intake/otel-spans.d.ts.map +1 -0
- package/dist/contract/self-improve.d.ts +284 -0
- package/dist/contract/self-improve.d.ts.map +1 -0
- package/dist/{control-runtime-DuFBYg7A.d.ts → control-runtime.d.ts} +23 -26
- package/dist/control-runtime.d.ts.map +1 -0
- package/dist/control-runtime.test.d.ts +2 -0
- package/dist/control-runtime.test.d.ts.map +1 -0
- package/dist/control.d.ts +11 -9
- package/dist/control.d.ts.map +1 -0
- package/dist/control.js +2 -2
- package/dist/convergence.d.ts +29 -0
- package/dist/convergence.d.ts.map +1 -0
- package/dist/{cost-ledger-DuSqlw5B.d.ts → cost-ledger.d.ts} +10 -11
- package/dist/cost-ledger.d.ts.map +1 -0
- package/dist/cost-ledger.test.d.ts +2 -0
- package/dist/cost-ledger.test.d.ts.map +1 -0
- package/dist/cost-report.d.ts +43 -0
- package/dist/cost-report.d.ts.map +1 -0
- package/dist/cost-report.test.d.ts +2 -0
- package/dist/cost-report.test.d.ts.map +1 -0
- package/dist/cost-tracker.d.ts +76 -0
- package/dist/cost-tracker.d.ts.map +1 -0
- package/dist/{counterfactual-Dwibr5IW.d.ts → counterfactual.d.ts} +12 -13
- package/dist/counterfactual.d.ts.map +1 -0
- package/dist/cross-trace-diff.d.ts +56 -0
- package/dist/cross-trace-diff.d.ts.map +1 -0
- package/dist/{dataset-BbGkaN2I.d.ts → dataset.d.ts} +11 -14
- package/dist/dataset.d.ts.map +1 -0
- package/dist/deploy-gate-layer.d.ts +125 -0
- package/dist/deploy-gate-layer.d.ts.map +1 -0
- package/dist/deploy-gate-layer.test.d.ts +2 -0
- package/dist/deploy-gate-layer.test.d.ts.map +1 -0
- package/dist/description-length-gate.d.ts +119 -0
- package/dist/description-length-gate.d.ts.map +1 -0
- package/dist/detectors/edge.test.d.ts +2 -0
- package/dist/detectors/edge.test.d.ts.map +1 -0
- package/dist/detectors/index.d.ts +81 -0
- package/dist/detectors/index.d.ts.map +1 -0
- package/dist/detectors/index.test.d.ts +2 -0
- package/dist/detectors/index.test.d.ts.map +1 -0
- package/dist/diagnose/causal-sweep.d.ts +100 -0
- package/dist/diagnose/causal-sweep.d.ts.map +1 -0
- package/dist/diagnose/index.d.ts +36 -0
- package/dist/diagnose/index.d.ts.map +1 -0
- package/dist/diagnose/remediation.d.ts +68 -0
- package/dist/diagnose/remediation.d.ts.map +1 -0
- package/dist/diagnose/repair.d.ts +77 -0
- package/dist/diagnose/repair.d.ts.map +1 -0
- package/dist/diagnose.d.ts +1 -251
- package/dist/diagnose.js +2 -2
- package/dist/discover-personas.d.ts +35 -0
- package/dist/discover-personas.d.ts.map +1 -0
- package/dist/driver.d.ts +95 -0
- package/dist/driver.d.ts.map +1 -0
- package/dist/driver.test.d.ts +8 -0
- package/dist/driver.test.d.ts.map +1 -0
- package/dist/dual-agent-bench.d.ts +81 -0
- package/dist/dual-agent-bench.d.ts.map +1 -0
- package/dist/error-count-extractor.d.ts +47 -0
- package/dist/error-count-extractor.d.ts.map +1 -0
- package/dist/error-count-extractor.test.d.ts +2 -0
- package/dist/error-count-extractor.test.d.ts.map +1 -0
- package/dist/{errors-CzMUYo7b.d.ts → errors.d.ts} +10 -11
- package/dist/errors.d.ts.map +1 -0
- package/dist/{researcher-DE6Gpnb4.d.ts → eval-campaign.d.ts} +34 -156
- package/dist/eval-campaign.d.ts.map +1 -0
- package/dist/eval-campaign.test.d.ts +2 -0
- package/dist/eval-campaign.test.d.ts.map +1 -0
- package/dist/eval-tools.d.ts +55 -0
- package/dist/eval-tools.d.ts.map +1 -0
- package/dist/eval-trace-store.d.ts +107 -0
- package/dist/eval-trace-store.d.ts.map +1 -0
- package/dist/eval-trace-store.test.d.ts +2 -0
- package/dist/eval-trace-store.test.d.ts.map +1 -0
- package/dist/executor.d.ts +38 -0
- package/dist/executor.d.ts.map +1 -0
- package/dist/executor.test.d.ts +10 -0
- package/dist/executor.test.d.ts.map +1 -0
- package/dist/experiment-tracker.d.ts +178 -0
- package/dist/experiment-tracker.d.ts.map +1 -0
- package/dist/experiment-tracker.test.d.ts +2 -0
- package/dist/experiment-tracker.test.d.ts.map +1 -0
- package/dist/failure-taxonomy.d.ts +38 -0
- package/dist/failure-taxonomy.d.ts.map +1 -0
- package/dist/{feedback-trajectory-D9OVLrg9.d.ts → feedback-trajectory.d.ts} +36 -38
- package/dist/feedback-trajectory.d.ts.map +1 -0
- package/dist/feedback-trajectory.test.d.ts +2 -0
- package/dist/feedback-trajectory.test.d.ts.map +1 -0
- package/dist/flow-layer.d.ts +90 -0
- package/dist/flow-layer.d.ts.map +1 -0
- package/dist/flow-layer.test.d.ts +2 -0
- package/dist/flow-layer.test.d.ts.map +1 -0
- package/dist/fuzz/capsule.d.ts +46 -0
- package/dist/fuzz/capsule.d.ts.map +1 -0
- package/dist/fuzz/cube.d.ts +36 -0
- package/dist/fuzz/cube.d.ts.map +1 -0
- package/dist/fuzz/explorer-cost.test.d.ts +2 -0
- package/dist/fuzz/explorer-cost.test.d.ts.map +1 -0
- package/dist/fuzz/explorer.d.ts +64 -0
- package/dist/fuzz/explorer.d.ts.map +1 -0
- package/dist/fuzz/fuzz-agent.d.ts +16 -0
- package/dist/fuzz/fuzz-agent.d.ts.map +1 -0
- package/dist/fuzz/fuzz-agent.test.d.ts +2 -0
- package/dist/fuzz/fuzz-agent.test.d.ts.map +1 -0
- package/dist/fuzz/gates.d.ts +33 -0
- package/dist/fuzz/gates.d.ts.map +1 -0
- package/dist/fuzz/index.d.ts +26 -0
- package/dist/fuzz/index.d.ts.map +1 -0
- package/dist/fuzz/policies.d.ts +28 -0
- package/dist/fuzz/policies.d.ts.map +1 -0
- package/dist/fuzz/tools.d.ts +20 -0
- package/dist/fuzz/tools.d.ts.map +1 -0
- package/dist/fuzz/types.d.ts +307 -0
- package/dist/fuzz/types.d.ts.map +1 -0
- package/dist/fuzz.d.ts +1 -547
- package/dist/golden-matcher.d.ts +71 -0
- package/dist/golden-matcher.d.ts.map +1 -0
- package/dist/governance/eu-ai-act.d.ts +37 -0
- package/dist/governance/eu-ai-act.d.ts.map +1 -0
- package/dist/governance/index.d.ts +5 -135
- package/dist/governance/index.d.ts.map +1 -0
- package/dist/governance/nist-ai-rmf.d.ts +15 -0
- package/dist/governance/nist-ai-rmf.d.ts.map +1 -0
- package/dist/governance/soc2.d.ts +12 -0
- package/dist/governance/soc2.d.ts.map +1 -0
- package/dist/governance/types.d.ts +66 -0
- package/dist/governance/types.d.ts.map +1 -0
- package/dist/harness-optimizer.d.ts +82 -0
- package/dist/harness-optimizer.d.ts.map +1 -0
- package/dist/held-out-gate.d.ts +135 -0
- package/dist/held-out-gate.d.ts.map +1 -0
- package/dist/hosted/client.d.ts +73 -0
- package/dist/hosted/client.d.ts.map +1 -0
- package/dist/hosted/from-env.test.d.ts +8 -0
- package/dist/hosted/from-env.test.d.ts.map +1 -0
- package/dist/hosted/index.d.ts +10 -238
- package/dist/hosted/index.d.ts.map +1 -0
- package/dist/hosted/types.d.ts +159 -0
- package/dist/hosted/types.d.ts.map +1 -0
- package/dist/index.d.ts +277 -5643
- package/dist/index.d.ts.map +1 -0
- package/dist/index.js +317 -108
- package/dist/index.js.map +1 -1
- package/dist/integrity/backend-integrity.d.ts +71 -0
- package/dist/integrity/backend-integrity.d.ts.map +1 -0
- package/dist/integrity/preflight.d.ts +72 -0
- package/dist/integrity/preflight.d.ts.map +1 -0
- package/dist/integrity/preflight.test.d.ts +2 -0
- package/dist/integrity/preflight.test.d.ts.map +1 -0
- package/dist/integrity/single-backend.d.ts +67 -0
- package/dist/integrity/single-backend.d.ts.map +1 -0
- package/dist/intent-match-judge.d.ts +69 -0
- package/dist/intent-match-judge.d.ts.map +1 -0
- package/dist/intent-match-judge.test.d.ts +2 -0
- package/dist/intent-match-judge.test.d.ts.map +1 -0
- package/dist/{judge-calibration-0p2QcWNE.d.ts → judge-calibration.d.ts} +16 -17
- package/dist/judge-calibration.d.ts.map +1 -0
- package/dist/judge-ensemble.d.ts +66 -0
- package/dist/judge-ensemble.d.ts.map +1 -0
- package/dist/judge-ensemble.test.d.ts +8 -0
- package/dist/judge-ensemble.test.d.ts.map +1 -0
- package/dist/judge-families.d.ts +38 -0
- package/dist/judge-families.d.ts.map +1 -0
- package/dist/judge-panel.d.ts +65 -0
- package/dist/judge-panel.d.ts.map +1 -0
- package/dist/judge-retry.d.ts +70 -0
- package/dist/judge-retry.d.ts.map +1 -0
- package/dist/judge-runner.d.ts +36 -0
- package/dist/judge-runner.d.ts.map +1 -0
- package/dist/judge-runner.test.d.ts +2 -0
- package/dist/judge-runner.test.d.ts.map +1 -0
- package/dist/judges.d.ts +74 -0
- package/dist/judges.d.ts.map +1 -0
- package/dist/keyword-coverage-judge.d.ts +89 -0
- package/dist/keyword-coverage-judge.d.ts.map +1 -0
- package/dist/keyword-coverage-judge.test.d.ts +2 -0
- package/dist/keyword-coverage-judge.test.d.ts.map +1 -0
- package/dist/knowledge/index.d.ts +3 -103
- package/dist/knowledge/index.d.ts.map +1 -0
- package/dist/knowledge/readiness.d.ts +26 -0
- package/dist/knowledge/readiness.d.ts.map +1 -0
- package/dist/knowledge/types.d.ts +75 -0
- package/dist/knowledge/types.d.ts.map +1 -0
- package/dist/live-proof.d.ts +62 -0
- package/dist/live-proof.d.ts.map +1 -0
- package/dist/{llm-client-BeEcAokY.d.ts → llm-client.d.ts} +52 -23
- package/dist/llm-client.d.ts.map +1 -0
- package/dist/llm-client.test.d.ts +2 -0
- package/dist/llm-client.test.d.ts.map +1 -0
- package/dist/locked-jsonl-appender.d.ts +19 -0
- package/dist/locked-jsonl-appender.d.ts.map +1 -0
- package/dist/matrix/aggregation.d.ts +16 -0
- package/dist/matrix/aggregation.d.ts.map +1 -0
- package/dist/matrix/index.d.ts +12 -30
- package/dist/matrix/index.d.ts.map +1 -0
- package/dist/matrix/runner.d.ts +15 -0
- package/dist/matrix/runner.d.ts.map +1 -0
- package/dist/{types-mn5Aqk7x.d.ts → matrix/types.d.ts} +11 -15
- package/dist/matrix/types.d.ts.map +1 -0
- package/dist/meta-eval/calibration.d.ts +47 -0
- package/dist/meta-eval/calibration.d.ts.map +1 -0
- package/dist/meta-eval/correlation-study.d.ts +53 -0
- package/dist/meta-eval/correlation-study.d.ts.map +1 -0
- package/dist/meta-eval/index.d.ts +6 -181
- package/dist/meta-eval/index.d.ts.map +1 -0
- package/dist/meta-eval/index.js +1 -1
- package/dist/{outcome-store-rnXLEqSn.d.ts → meta-eval/outcome-store.d.ts} +7 -8
- package/dist/meta-eval/outcome-store.d.ts.map +1 -0
- package/dist/{rubric-predictive-validity-Cy_W-hWZ.d.ts → meta-eval/rubric-predictive-validity.d.ts} +8 -11
- package/dist/meta-eval/rubric-predictive-validity.d.ts.map +1 -0
- package/dist/meta-eval/sentinel.d.ts +169 -0
- package/dist/meta-eval/sentinel.d.ts.map +1 -0
- package/dist/metrics.d.ts +63 -0
- package/dist/metrics.d.ts.map +1 -0
- package/dist/model-seats.d.ts +71 -0
- package/dist/model-seats.d.ts.map +1 -0
- package/dist/model-seats.test.d.ts +2 -0
- package/dist/model-seats.test.d.ts.map +1 -0
- package/dist/muffled-gate-scanner.d.ts +102 -0
- package/dist/muffled-gate-scanner.d.ts.map +1 -0
- package/dist/{multi-layer-verifier-DUZXrPDA.d.ts → multi-layer-verifier.d.ts} +12 -15
- package/dist/multi-layer-verifier.d.ts.map +1 -0
- package/dist/multi-layer-verifier.test.d.ts +2 -0
- package/dist/multi-layer-verifier.test.d.ts.map +1 -0
- package/dist/multi-toolchain-layer.d.ts +80 -0
- package/dist/multi-toolchain-layer.d.ts.map +1 -0
- package/dist/multi-toolchain-layer.test.d.ts +2 -0
- package/dist/multi-toolchain-layer.test.d.ts.map +1 -0
- package/dist/multishot/default-tools.d.ts +34 -0
- package/dist/multishot/default-tools.d.ts.map +1 -0
- package/dist/multishot/index.d.ts +7 -290
- package/dist/multishot/index.d.ts.map +1 -0
- package/dist/multishot/index.js.map +1 -1
- package/dist/multishot/judges.d.ts +32 -0
- package/dist/multishot/judges.d.ts.map +1 -0
- package/dist/multishot/matrix.d.ts +107 -0
- package/dist/multishot/matrix.d.ts.map +1 -0
- package/dist/multishot/multishot.d.ts +23 -0
- package/dist/multishot/multishot.d.ts.map +1 -0
- package/dist/multishot/router.d.ts +37 -0
- package/dist/multishot/router.d.ts.map +1 -0
- package/dist/multishot/types.d.ts +60 -0
- package/dist/multishot/types.d.ts.map +1 -0
- package/dist/observability.d.ts +71 -0
- package/dist/observability.d.ts.map +1 -0
- package/dist/openapi.json +1 -1
- package/dist/oracle.d.ts +55 -0
- package/dist/oracle.d.ts.map +1 -0
- package/dist/orthogonality.d.ts +35 -0
- package/dist/orthogonality.d.ts.map +1 -0
- package/dist/otel-pipeline.d.ts +31 -0
- package/dist/otel-pipeline.d.ts.map +1 -0
- package/dist/paraphrase.d.ts +107 -0
- package/dist/paraphrase.d.ts.map +1 -0
- package/dist/{pareto-E-pembql.d.ts → pareto.d.ts} +9 -10
- package/dist/pareto.d.ts.map +1 -0
- package/dist/partition-held-out.d.ts +70 -0
- package/dist/partition-held-out.d.ts.map +1 -0
- package/dist/partition-held-out.test.d.ts +2 -0
- package/dist/partition-held-out.test.d.ts.map +1 -0
- package/dist/perf/index.d.ts +13 -119
- package/dist/perf/index.d.ts.map +1 -0
- package/dist/perf/integrity.d.ts +30 -0
- package/dist/perf/integrity.d.ts.map +1 -0
- package/dist/perf/journey.d.ts +45 -0
- package/dist/perf/journey.d.ts.map +1 -0
- package/dist/perf/ratchet.d.ts +47 -0
- package/dist/perf/ratchet.d.ts.map +1 -0
- package/dist/pipelines/budget-breach.d.ts +31 -0
- package/dist/pipelines/budget-breach.d.ts.map +1 -0
- package/dist/pipelines/budget-breach.test.d.ts +2 -0
- package/dist/pipelines/budget-breach.test.d.ts.map +1 -0
- package/dist/pipelines/failure-cluster.d.ts +38 -0
- package/dist/pipelines/failure-cluster.d.ts.map +1 -0
- package/dist/pipelines/failure-cluster.test.d.ts +2 -0
- package/dist/pipelines/failure-cluster.test.d.ts.map +1 -0
- package/dist/pipelines/first-divergence.d.ts +26 -0
- package/dist/pipelines/first-divergence.d.ts.map +1 -0
- package/dist/pipelines/first-divergence.test.d.ts +2 -0
- package/dist/pipelines/first-divergence.test.d.ts.map +1 -0
- package/dist/pipelines/index.d.ts +8 -173
- package/dist/pipelines/index.d.ts.map +1 -0
- package/dist/pipelines/index.js +40 -15
- package/dist/pipelines/index.js.map +1 -1
- package/dist/pipelines/judge-agreement.d.ts +26 -0
- package/dist/pipelines/judge-agreement.d.ts.map +1 -0
- package/dist/pipelines/judge-agreement.test.d.ts +2 -0
- package/dist/pipelines/judge-agreement.test.d.ts.map +1 -0
- package/dist/pipelines/regression.d.ts +23 -0
- package/dist/pipelines/regression.d.ts.map +1 -0
- package/dist/pipelines/regression.test.d.ts +2 -0
- package/dist/pipelines/regression.test.d.ts.map +1 -0
- package/dist/pipelines/stuck-loop.d.ts +32 -0
- package/dist/pipelines/stuck-loop.d.ts.map +1 -0
- package/dist/pipelines/stuck-loop.test.d.ts +2 -0
- package/dist/pipelines/stuck-loop.test.d.ts.map +1 -0
- package/dist/pipelines/tool-waste.d.ts +34 -0
- package/dist/pipelines/tool-waste.d.ts.map +1 -0
- package/dist/pipelines/tool-waste.test.d.ts +2 -0
- package/dist/pipelines/tool-waste.test.d.ts.map +1 -0
- package/dist/playbook.d.ts +16 -0
- package/dist/playbook.d.ts.map +1 -0
- package/dist/pr-review-benchmark.d.ts +88 -0
- package/dist/pr-review-benchmark.d.ts.map +1 -0
- package/dist/pr-review-benchmark.test.d.ts +2 -0
- package/dist/pr-review-benchmark.test.d.ts.map +1 -0
- package/dist/pre-registration.d.ts +125 -0
- package/dist/pre-registration.d.ts.map +1 -0
- package/dist/prm/builtin-rubrics.d.ts +33 -0
- package/dist/prm/builtin-rubrics.d.ts.map +1 -0
- package/dist/prm/index.d.ts +5 -100
- package/dist/prm/index.d.ts.map +1 -0
- package/dist/prm/index.js +55 -12
- package/dist/prm/index.js.map +1 -1
- package/dist/prm/inference.d.ts +29 -0
- package/dist/prm/inference.d.ts.map +1 -0
- package/dist/prm/inference.test.d.ts +2 -0
- package/dist/prm/inference.test.d.ts.map +1 -0
- package/dist/{rubric-BOfxn4ja.d.ts → prm/rubric.d.ts} +10 -13
- package/dist/prm/rubric.d.ts.map +1 -0
- package/dist/prm/training-export.d.ts +38 -0
- package/dist/prm/training-export.d.ts.map +1 -0
- package/dist/produced-state.d.ts +63 -0
- package/dist/produced-state.d.ts.map +1 -0
- package/dist/produced-state.test.d.ts +8 -0
- package/dist/produced-state.test.d.ts.map +1 -0
- package/dist/profile/baselines.d.ts +37 -0
- package/dist/profile/baselines.d.ts.map +1 -0
- package/dist/profile/index.d.ts +105 -0
- package/dist/profile/index.d.ts.map +1 -0
- package/dist/promotion-gate.d.ts +93 -0
- package/dist/promotion-gate.d.ts.map +1 -0
- package/dist/prompt-registry.d.ts +41 -0
- package/dist/prompt-registry.d.ts.map +1 -0
- package/dist/propose-review-control.d.ts +49 -0
- package/dist/propose-review-control.d.ts.map +1 -0
- package/dist/propose-review-control.test.d.ts +2 -0
- package/dist/propose-review-control.test.d.ts.map +1 -0
- package/dist/propose-review.d.ts +155 -0
- package/dist/propose-review.d.ts.map +1 -0
- package/dist/{red-team-BXHil6c8.d.ts → red-team.d.ts} +14 -16
- package/dist/red-team.d.ts.map +1 -0
- package/dist/reference-replay-steering.d.ts +11 -0
- package/dist/reference-replay-steering.d.ts.map +1 -0
- package/dist/reference-replay.d.ts +176 -0
- package/dist/reference-replay.d.ts.map +1 -0
- package/dist/reflective-mutation.d.ts +79 -0
- package/dist/reflective-mutation.d.ts.map +1 -0
- package/dist/registry.d.ts +31 -0
- package/dist/registry.d.ts.map +1 -0
- package/dist/release-confidence.d.ts +128 -0
- package/dist/release-confidence.d.ts.map +1 -0
- package/dist/release-report.d.ts +11 -0
- package/dist/release-report.d.ts.map +1 -0
- package/dist/replay.d.ts +120 -0
- package/dist/replay.d.ts.map +1 -0
- package/dist/reporter.d.ts +14 -0
- package/dist/reporter.d.ts.map +1 -0
- package/dist/reporting.d.ts +15 -15
- package/dist/reporting.d.ts.map +1 -0
- package/dist/reporting.js +3 -3
- package/dist/researcher.d.ts +140 -0
- package/dist/researcher.d.ts.map +1 -0
- package/dist/reviewer.d.ts +118 -0
- package/dist/reviewer.d.ts.map +1 -0
- package/dist/reviewer.test.d.ts +2 -0
- package/dist/reviewer.test.d.ts.map +1 -0
- package/dist/reward-model-export.d.ts +60 -0
- package/dist/reward-model-export.d.ts.map +1 -0
- package/dist/rl/active-curriculum.d.ts +110 -0
- package/dist/rl/active-curriculum.d.ts.map +1 -0
- package/dist/rl/adaptation-eval.d.ts +109 -0
- package/dist/rl/adaptation-eval.d.ts.map +1 -0
- package/dist/{adversarial-DIVcDoI_.d.ts → rl/adversarial.d.ts} +6 -7
- package/dist/rl/adversarial.d.ts.map +1 -0
- package/dist/rl/compute-curves.d.ts +127 -0
- package/dist/rl/compute-curves.d.ts.map +1 -0
- package/dist/rl/contamination.d.ts +117 -0
- package/dist/rl/contamination.d.ts.map +1 -0
- package/dist/rl/corpus.d.ts +55 -0
- package/dist/rl/corpus.d.ts.map +1 -0
- package/dist/rl/corpus.test.d.ts +2 -0
- package/dist/rl/corpus.test.d.ts.map +1 -0
- package/dist/rl/dataset.d.ts +102 -0
- package/dist/rl/dataset.d.ts.map +1 -0
- package/dist/rl/dataset.test.d.ts +2 -0
- package/dist/rl/dataset.test.d.ts.map +1 -0
- package/dist/rl/exporters.d.ts +141 -0
- package/dist/rl/exporters.d.ts.map +1 -0
- package/dist/rl/index.d.ts +49 -0
- package/dist/rl/index.d.ts.map +1 -0
- package/dist/{off-policy-DiwuKKg7.d.ts → rl/off-policy.d.ts} +8 -9
- package/dist/rl/off-policy.d.ts.map +1 -0
- package/dist/rl/predictive-validity-researcher.d.ts +69 -0
- package/dist/rl/predictive-validity-researcher.d.ts.map +1 -0
- package/dist/rl/preferences.d.ts +141 -0
- package/dist/rl/preferences.d.ts.map +1 -0
- package/dist/rl/process-reward.d.ts +122 -0
- package/dist/rl/process-reward.d.ts.map +1 -0
- package/dist/rl/reward-hacking.d.ts +104 -0
- package/dist/rl/reward-hacking.d.ts.map +1 -0
- package/dist/rl/rl-campaign.d.ts +85 -0
- package/dist/rl/rl-campaign.d.ts.map +1 -0
- package/dist/rl/run-record-adapters.d.ts +56 -0
- package/dist/rl/run-record-adapters.d.ts.map +1 -0
- package/dist/rl/sim-fidelity.d.ts +166 -0
- package/dist/rl/sim-fidelity.d.ts.map +1 -0
- package/dist/rl/sim-fidelity.test.d.ts +2 -0
- package/dist/rl/sim-fidelity.test.d.ts.map +1 -0
- package/dist/rl/tournament.d.ts +115 -0
- package/dist/rl/tournament.d.ts.map +1 -0
- package/dist/rl/verifiable-reward.d.ts +124 -0
- package/dist/rl/verifiable-reward.d.ts.map +1 -0
- package/dist/rl.d.ts +1 -1192
- package/dist/rl.js +615 -615
- package/dist/rl.js.map +1 -1
- package/dist/{run-campaign-RDGAM5KJ.js → run-campaign-WXY7KI67.js} +3 -3
- package/dist/run-critic.d.ts +23 -0
- package/dist/run-critic.d.ts.map +1 -0
- package/dist/run-evidence.d.ts +32 -0
- package/dist/run-evidence.d.ts.map +1 -0
- package/dist/{run-record-e7vj1uZQ.d.ts → run-record.d.ts} +16 -122
- package/dist/run-record.d.ts.map +1 -0
- package/dist/run-record.test.d.ts +2 -0
- package/dist/run-record.test.d.ts.map +1 -0
- package/dist/run-score.d.ts +31 -0
- package/dist/run-score.d.ts.map +1 -0
- package/dist/runtime-trajectory.d.ts +47 -0
- package/dist/runtime-trajectory.d.ts.map +1 -0
- package/dist/{test-graded-scenario-BdVaPyHT.d.ts → sandbox-harness.d.ts} +34 -60
- package/dist/sandbox-harness.d.ts.map +1 -0
- package/dist/sandbox-harness.test.d.ts +2 -0
- package/dist/sandbox-harness.test.d.ts.map +1 -0
- package/dist/sandbox-pool.d.ts +74 -0
- package/dist/sandbox-pool.d.ts.map +1 -0
- package/dist/sandbox-pool.test.d.ts +2 -0
- package/dist/sandbox-pool.test.d.ts.map +1 -0
- package/dist/scorecard.d.ts +133 -0
- package/dist/scorecard.d.ts.map +1 -0
- package/dist/scorecard.test.d.ts +2 -0
- package/dist/scorecard.test.d.ts.map +1 -0
- package/dist/self-play.d.ts +69 -0
- package/dist/self-play.d.ts.map +1 -0
- package/dist/semantic-concept-judge.d.ts +135 -0
- package/dist/semantic-concept-judge.d.ts.map +1 -0
- package/dist/semantic-concept-judge.test.d.ts +2 -0
- package/dist/semantic-concept-judge.test.d.ts.map +1 -0
- package/dist/{sequential-5iSVfzl2.d.ts → sequential.d.ts} +9 -10
- package/dist/sequential.d.ts.map +1 -0
- package/dist/{series-convergence-D5OWMBg6.d.ts → series-convergence.d.ts} +4 -5
- package/dist/series-convergence.d.ts.map +1 -0
- package/dist/slo.d.ts +48 -0
- package/dist/slo.d.ts.map +1 -0
- package/dist/state-continuity.d.ts +47 -0
- package/dist/state-continuity.d.ts.map +1 -0
- package/dist/{statistics-C7PozGrZ.d.ts → statistics.d.ts} +152 -39
- package/dist/statistics.d.ts.map +1 -0
- package/dist/statistics.test.d.ts +2 -0
- package/dist/statistics.test.d.ts.map +1 -0
- package/dist/steering-optimizer.d.ts +58 -0
- package/dist/steering-optimizer.d.ts.map +1 -0
- package/dist/steering.d.ts +24 -0
- package/dist/steering.d.ts.map +1 -0
- package/dist/storyboard/code-edit.d.ts +64 -0
- package/dist/storyboard/code-edit.d.ts.map +1 -0
- package/dist/storyboard/code-edit.test.d.ts +2 -0
- package/dist/storyboard/code-edit.test.d.ts.map +1 -0
- package/dist/storyboard/index.d.ts +16 -81
- package/dist/storyboard/index.d.ts.map +1 -0
- package/dist/storyboard/index.test.d.ts +2 -0
- package/dist/storyboard/index.test.d.ts.map +1 -0
- package/dist/{summary-report-DGmUucwQ.d.ts → summary-report.d.ts} +23 -160
- package/dist/summary-report.d.ts.map +1 -0
- package/dist/telemetry/client.d.ts +35 -0
- package/dist/telemetry/client.d.ts.map +1 -0
- package/dist/telemetry/index.d.ts +17 -35
- package/dist/telemetry/index.d.ts.map +1 -0
- package/dist/telemetry/schema.d.ts +61 -0
- package/dist/telemetry/schema.d.ts.map +1 -0
- package/dist/telemetry/sink-fetch.d.ts +39 -0
- package/dist/telemetry/sink-fetch.d.ts.map +1 -0
- package/dist/telemetry/{file.d.ts → sink-file.d.ts} +5 -7
- package/dist/telemetry/sink-file.d.ts.map +1 -0
- package/dist/test-graded-scenario.d.ts +42 -0
- package/dist/test-graded-scenario.d.ts.map +1 -0
- package/dist/testing.d.ts +5 -0
- package/dist/testing.d.ts.map +1 -0
- package/dist/testing.js +8 -0
- package/dist/testing.js.map +1 -0
- package/dist/tool-use-metrics.d.ts +35 -0
- package/dist/tool-use-metrics.d.ts.map +1 -0
- package/dist/trace/capture-fetch.d.ts +48 -0
- package/dist/trace/capture-fetch.d.ts.map +1 -0
- package/dist/trace/capture-fetch.test.d.ts +2 -0
- package/dist/trace/capture-fetch.test.d.ts.map +1 -0
- package/dist/{emitter-DEZwY14K.d.ts → trace/emitter.d.ts} +9 -12
- package/dist/trace/emitter.d.ts.map +1 -0
- package/dist/trace/extract-usage.d.ts +46 -0
- package/dist/trace/extract-usage.d.ts.map +1 -0
- package/dist/trace/extract-usage.test.d.ts +2 -0
- package/dist/trace/extract-usage.test.d.ts.map +1 -0
- package/dist/trace/index.d.ts +15 -0
- package/dist/trace/index.d.ts.map +1 -0
- package/dist/{integrity-VJ9A7aST.d.ts → trace/integrity.d.ts} +11 -14
- package/dist/trace/integrity.d.ts.map +1 -0
- package/dist/trace/otel-bridge.d.ts +29 -0
- package/dist/trace/otel-bridge.d.ts.map +1 -0
- package/dist/trace/otel-export.d.ts +52 -0
- package/dist/trace/otel-export.d.ts.map +1 -0
- package/dist/trace/otel.d.ts +57 -0
- package/dist/trace/otel.d.ts.map +1 -0
- package/dist/trace/otlp-attributes.d.ts +17 -0
- package/dist/trace/otlp-attributes.d.ts.map +1 -0
- package/dist/trace/query.d.ts +29 -0
- package/dist/trace/query.d.ts.map +1 -0
- package/dist/trace/query.test.d.ts +2 -0
- package/dist/trace/query.test.d.ts.map +1 -0
- package/dist/{raw-provider-sink-C46HDghv.d.ts → trace/raw-provider-sink.d.ts} +13 -14
- package/dist/trace/raw-provider-sink.d.ts.map +1 -0
- package/dist/{redact-B40YG2M_.d.ts → trace/redact.d.ts} +7 -8
- package/dist/trace/redact.d.ts.map +1 -0
- package/dist/{schema-m0gsnbt3.d.ts → trace/schema.d.ts} +29 -30
- package/dist/trace/schema.d.ts.map +1 -0
- package/dist/trace/store-to-otlp.d.ts +72 -0
- package/dist/trace/store-to-otlp.d.ts.map +1 -0
- package/dist/trace/store-to-otlp.test.d.ts +2 -0
- package/dist/trace/store-to-otlp.test.d.ts.map +1 -0
- package/dist/{store-CKUAgsJz.d.ts → trace/store.d.ts} +37 -13
- package/dist/trace/store.d.ts.map +1 -0
- package/dist/trace/store.test.d.ts +2 -0
- package/dist/trace/store.test.d.ts.map +1 -0
- package/dist/{analyst-C8HHvfJp.d.ts → trace-analyst/analyst.d.ts} +12 -14
- package/dist/trace-analyst/analyst.d.ts.map +1 -0
- package/dist/trace-analyst/analyst.test.d.ts +2 -0
- package/dist/trace-analyst/analyst.test.d.ts.map +1 -0
- package/dist/trace-analyst/behavioral-metrics.d.ts +40 -0
- package/dist/trace-analyst/behavioral-metrics.d.ts.map +1 -0
- package/dist/trace-analyst/behavioral-metrics.test.d.ts +2 -0
- package/dist/trace-analyst/behavioral-metrics.test.d.ts.map +1 -0
- package/dist/trace-analyst/hook.d.ts +55 -0
- package/dist/trace-analyst/hook.d.ts.map +1 -0
- package/dist/trace-analyst/index.d.ts +18 -0
- package/dist/trace-analyst/index.d.ts.map +1 -0
- package/dist/trace-analyst/insights.d.ts +71 -0
- package/dist/trace-analyst/insights.d.ts.map +1 -0
- package/dist/trace-analyst/insights.test.d.ts +2 -0
- package/dist/trace-analyst/insights.test.d.ts.map +1 -0
- package/dist/trace-analyst/otlp-flatten.d.ts +42 -0
- package/dist/trace-analyst/otlp-flatten.d.ts.map +1 -0
- package/dist/trace-analyst/otlp-span.d.ts +85 -0
- package/dist/trace-analyst/otlp-span.d.ts.map +1 -0
- package/dist/trace-analyst/otlp-span.test.d.ts +2 -0
- package/dist/trace-analyst/otlp-span.test.d.ts.map +1 -0
- package/dist/trace-analyst/otlp-to-run-records.d.ts +115 -0
- package/dist/trace-analyst/otlp-to-run-records.d.ts.map +1 -0
- package/dist/trace-analyst/otlp-to-run-records.test.d.ts +2 -0
- package/dist/trace-analyst/otlp-to-run-records.test.d.ts.map +1 -0
- package/dist/trace-analyst/otlp-to-run-records.timestamps.test.d.ts +2 -0
- package/dist/trace-analyst/otlp-to-run-records.timestamps.test.d.ts.map +1 -0
- package/dist/trace-analyst/prompts.d.ts +6 -0
- package/dist/trace-analyst/prompts.d.ts.map +1 -0
- package/dist/trace-analyst/store-otlp.d.ts +126 -0
- package/dist/trace-analyst/store-otlp.d.ts.map +1 -0
- package/dist/trace-analyst/store-otlp.test.d.ts +8 -0
- package/dist/trace-analyst/store-otlp.test.d.ts.map +1 -0
- package/dist/trace-analyst/store-otlp.timestamps.test.d.ts +2 -0
- package/dist/trace-analyst/store-otlp.timestamps.test.d.ts.map +1 -0
- package/dist/trace-analyst/store.d.ts +63 -0
- package/dist/trace-analyst/store.d.ts.map +1 -0
- package/dist/trace-analyst/tools.d.ts +44 -0
- package/dist/trace-analyst/tools.d.ts.map +1 -0
- package/dist/trace-analyst/tools.test.d.ts +10 -0
- package/dist/trace-analyst/tools.test.d.ts.map +1 -0
- package/dist/{store-C1YxJDEK.d.ts → trace-analyst/types.d.ts} +18 -74
- package/dist/trace-analyst/types.d.ts.map +1 -0
- package/dist/trace-contracts.d.ts +180 -0
- package/dist/trace-contracts.d.ts.map +1 -0
- package/dist/traced-analyst.d.ts +26 -0
- package/dist/traced-analyst.d.ts.map +1 -0
- package/dist/traced-judges.d.ts +27 -0
- package/dist/traced-judges.d.ts.map +1 -0
- package/dist/traces.d.ts +4 -947
- package/dist/traces.d.ts.map +1 -0
- package/dist/traces.js +42 -12
- package/dist/{trajectory-GEdXJCL5.d.ts → trajectory.d.ts} +8 -9
- package/dist/trajectory.d.ts.map +1 -0
- package/dist/{types-Croy5h7V.d.ts → types.d.ts} +33 -33
- package/dist/types.d.ts.map +1 -0
- package/dist/ui-finding.d.ts +104 -0
- package/dist/ui-finding.d.ts.map +1 -0
- package/dist/verdict-cache.d.ts +78 -0
- package/dist/verdict-cache.d.ts.map +1 -0
- package/dist/verdict-cache.test.d.ts +2 -0
- package/dist/verdict-cache.test.d.ts.map +1 -0
- package/dist/{verdict-C9MlYujm.d.ts → verdict.d.ts} +2 -3
- package/dist/verdict.d.ts.map +1 -0
- package/dist/visual-diff.d.ts +32 -0
- package/dist/visual-diff.d.ts.map +1 -0
- package/dist/wire/handlers.d.ts +54 -0
- package/dist/wire/handlers.d.ts.map +1 -0
- package/dist/wire/index.d.ts +13 -570
- package/dist/wire/index.d.ts.map +1 -0
- package/dist/wire/index.js +2 -2
- package/dist/wire/openapi.d.ts +3 -0
- package/dist/wire/openapi.d.ts.map +1 -0
- package/dist/wire/rpc.d.ts +21 -0
- package/dist/wire/rpc.d.ts.map +1 -0
- package/dist/wire/rubrics.d.ts +34 -0
- package/dist/wire/rubrics.d.ts.map +1 -0
- package/dist/wire/schemas.d.ts +410 -0
- package/dist/wire/schemas.d.ts.map +1 -0
- package/dist/wire/server.d.ts +60 -0
- package/dist/wire/server.d.ts.map +1 -0
- package/dist/workflow/event-schema.d.ts +5 -0
- package/dist/workflow/event-schema.d.ts.map +1 -0
- package/dist/workflow/feedback-pack.d.ts +99 -0
- package/dist/workflow/feedback-pack.d.ts.map +1 -0
- package/dist/workflow/index.d.ts +22 -495
- package/dist/workflow/index.d.ts.map +1 -0
- package/dist/workflow/index.js +2 -2
- package/dist/workflow/intelligence-export.d.ts +62 -0
- package/dist/workflow/intelligence-export.d.ts.map +1 -0
- package/dist/workflow/partner-report.d.ts +49 -0
- package/dist/workflow/partner-report.d.ts.map +1 -0
- package/dist/workflow/phase-graph.d.ts +43 -0
- package/dist/workflow/phase-graph.d.ts.map +1 -0
- package/dist/workflow/promotion-gate.d.ts +61 -0
- package/dist/workflow/promotion-gate.d.ts.map +1 -0
- package/dist/workflow/run-record.d.ts +12 -0
- package/dist/workflow/run-record.d.ts.map +1 -0
- package/dist/workflow/runtime-adapter.d.ts +20 -0
- package/dist/workflow/runtime-adapter.d.ts.map +1 -0
- package/dist/workflow/sanitize.d.ts +21 -0
- package/dist/workflow/sanitize.d.ts.map +1 -0
- package/dist/workflow/schema.d.ts +5 -0
- package/dist/workflow/schema.d.ts.map +1 -0
- package/dist/workflow/summary.d.ts +43 -0
- package/dist/workflow/summary.d.ts.map +1 -0
- package/dist/workflow/trace-event-fields.d.ts +6 -0
- package/dist/workflow/trace-event-fields.d.ts.map +1 -0
- package/dist/workflow/trajectory.d.ts +15 -0
- package/dist/workflow/trajectory.d.ts.map +1 -0
- package/dist/workflow/types.d.ts +68 -0
- package/dist/workflow/types.d.ts.map +1 -0
- package/dist/workspace-inspector.d.ts +67 -0
- package/dist/workspace-inspector.d.ts.map +1 -0
- package/dist/wrangler-deploy-runner.test.d.ts +2 -0
- package/dist/wrangler-deploy-runner.test.d.ts.map +1 -0
- package/docs/campaign-proposers.md +170 -0
- package/docs/concepts.md +8 -4
- package/docs/customer-journeys.md +15 -13
- package/docs/design/loop-taxonomy.md +34 -66
- package/docs/distributed-driver.md +14 -14
- package/docs/feature-guide.md +1 -1
- package/docs/hosted-ingest-spec.md +2 -3
- package/docs/multi-shot-optimization.md +8 -8
- package/docs/product-eval-adoption.md +1 -1
- package/docs/self-improvement-map.md +33 -29
- package/package.json +9 -15
- package/dist/calibration-Cpr3WaX3.d.ts +0 -101
- package/dist/chunk-47X6LRCE.js.map +0 -1
- package/dist/chunk-6SOJM3VR.js.map +0 -1
- package/dist/chunk-CVVHBFGN.js.map +0 -1
- package/dist/chunk-D3V5B42D.js.map +0 -1
- package/dist/chunk-E4GH6USR.js.map +0 -1
- package/dist/chunk-GSH6QNNS.js.map +0 -1
- package/dist/chunk-KWRRMR3J.js.map +0 -1
- package/dist/chunk-LMZQ2Z4U.js.map +0 -1
- package/dist/chunk-QAY5UIJO.js.map +0 -1
- package/dist/chunk-QG2OVF2D.js.map +0 -1
- package/dist/chunk-T375SUOZ.js.map +0 -1
- package/dist/chunk-TWS7AZEY.js.map +0 -1
- package/dist/chunk-UMMZHCPB.js.map +0 -1
- package/dist/chunk-XY4DDNEG.js.map +0 -1
- package/dist/chunk-ZFIBGEOL.js.map +0 -1
- package/dist/control-_Qb7skHX.d.ts +0 -259
- package/dist/corpus-BoR-041R.d.ts +0 -560
- package/dist/failure-cluster-CL7IVgkJ.d.ts +0 -76
- package/dist/harness-optimizer-EnEnQPsr.d.ts +0 -106
- package/dist/index-Bx3gZ8xl.d.ts +0 -159
- package/dist/pre-registration-mAnCugl9.d.ts +0 -523
- package/dist/provenance-LnqRT0sS.d.ts +0 -441
- package/dist/query-CqTxMwDw.d.ts +0 -31
- package/dist/release-report-euXIV_Sk.d.ts +0 -233
- package/dist/run-critic-BAIjX99r.d.ts +0 -56
- package/dist/run-improvement-loop-5z_l5zDz.d.ts +0 -427
- package/dist/runtime-trajectory-BDgfGZSr.d.ts +0 -49
- package/dist/semantic-concept-judge-Dn8Z6KEG.d.ts +0 -624
- package/dist/sink-fetch-B1Yg4Til.d.ts +0 -101
- package/docs/design/external-agent-wedge.md +0 -89
- package/docs/design/phase-d-rfc.md +0 -125
- package/docs/design/phase4-consumer-migration.md +0 -70
- package/docs/design/primitives-integration-spec.md +0 -393
- package/docs/design/product-self-improvement-loop.md +0 -146
- package/docs/design/self-improvement-engine.md +0 -140
- package/docs/design/self-improvement-protocol.md +0 -223
- package/docs/design/self-improvement-roadmap.md +0 -106
- package/docs/design/substrate-gaps.md +0 -118
- package/docs/phase-b-pairing-kit.md +0 -188
- package/docs/phase-b-runbook.md +0 -176
- package/docs/pilot/README.md +0 -62
- package/docs/pilot/customer-checklist.md +0 -90
- package/docs/pilot/integration-foreign-stack.md +0 -296
- package/docs/pilot/integration-tangle-stack.md +0 -248
- package/docs/pilot/one-pager.md +0 -161
- package/docs/pilot/sample-insight-report.json +0 -172
- package/docs/quickstart-external.md +0 -229
- package/docs/research/belief-state-agent-eval-roadmap.md +0 -593
- package/docs/research/research-roadmap.md +0 -205
- package/docs/specs/driver-honest-spec.md +0 -251
- package/docs/specs/hermes-self-improvement-audit.md +0 -93
- package/docs/specs/profile-versioning.md +0 -291
- package/docs/three-package-architecture.md +0 -168
- /package/dist/{chunk-QS3RBQPI.js.map → chunk-D5KBVULY.js.map} +0 -0
- /package/dist/{chunk-UHMJT4T7.js.map → chunk-IZCEK2HR.js.map} +0 -0
- /package/dist/{chunk-L3JOU6XM.js.map → chunk-NACM5RS7.js.map} +0 -0
- /package/dist/{chunk-4FBZZIYD.js.map → chunk-QTMYW64F.js.map} +0 -0
- /package/dist/{chunk-CY6U5S3X.js.map → chunk-URWVKRCS.js.map} +0 -0
- /package/dist/{chunk-Y47J2LJ3.js.map → chunk-Z6L6YSU6.js.map} +0 -0
- /package/dist/{run-campaign-RDGAM5KJ.js.map → run-campaign-WXY7KI67.js.map} +0 -0
package/dist/contract/index.d.ts
CHANGED
|
@@ -1,642 +1,108 @@
|
|
|
1
|
-
import { S as Scenario, M as MutableSurface, b as DispatchContext, a as JudgeConfig, I as ImprovementDriver, G as Gate, L as LabeledScenarioStore, c as GateDecision } from '../types-BU-7W85F.js';
|
|
2
|
-
export { C as CampaignAggregates, d as CampaignArtifactWriter, e as CampaignCellResult, f as CampaignCostMeter, g as CampaignResult, h as CampaignTraceWriter, i as CodeSurface, D as Dispatch, j as GateContext, k as GateResult, l as GenerationCandidate, m as GenerationRecord, n as JudgeDimension, J as JudgeScore, o as Mutator, O as OptimizerConfig, p as SessionScript } from '../types-BU-7W85F.js';
|
|
3
|
-
import { L as LoopProvenanceRecord } from '../provenance-LnqRT0sS.js';
|
|
4
|
-
export { A as AxisEvidence, a as AxisVerdict, B as BuildEvidenceVectorOptions, D as DefaultProductionGateOptions, E as EvidenceVector, b as EvolutionaryDriverOptions, H as HeldOutGateOptions, O as ObjectiveSource, P as ParetoSignificanceGateOptions, c as PromotionObjective, d as PromotionPolicy, R as RunEvalOptions, e as buildEvidenceVector, f as composeGate, g as defaultProductionGate, h as evolutionaryDriver, i as heldOutGate, p as paretoPolicy, j as paretoSignificanceGate, r as runEval } from '../provenance-LnqRT0sS.js';
|
|
5
|
-
import { C as CampaignStorage, R as RunOptimizationOptions, a as RunImprovementLoopResult } from '../run-improvement-loop-5z_l5zDz.js';
|
|
6
|
-
export { G as GepaDriverOptions, b as RunCampaignOptions, c as RunImprovementLoopOptions, f as fsCampaignStorage, g as gepaDriver, i as inMemoryCampaignStorage, r as runCampaign, d as runImprovementLoop } from '../run-improvement-loop-5z_l5zDz.js';
|
|
7
|
-
export { D as DeploymentOutcome, F as FileSystemOutcomeStore, a as FileSystemOutcomeStoreOptions, I as InMemoryOutcomeStore, b as OutcomeStore } from '../outcome-store-rnXLEqSn.js';
|
|
8
|
-
import { HostedTenant, EvalRunCellScore, EvalRunGenerationSnapshot, EvalRunEvent, TraceSpanEvent } from '../hosted/index.js';
|
|
9
|
-
import { R as RunRecord, a as RunSplitTag } from '../run-record-e7vj1uZQ.js';
|
|
10
|
-
import { I as InsightReport } from '../insight-report-BBwvOh6x.js';
|
|
11
|
-
export { F as FailureClusterInsight, a as InterRaterInsight, J as JudgeInsight, L as LiftInsight, O as OutcomeCorrelationInsight, R as Recommendation, b as ReleaseSummary, S as ScalarDistribution } from '../insight-report-BBwvOh6x.js';
|
|
12
|
-
export { D as DefaultAnalystRegistryOptions, b as buildDefaultAnalystRegistry } from '../default-registry-zoGHUQEH.js';
|
|
13
|
-
export { c as AnalystFinding } from '../types-2VVIL04s.js';
|
|
14
|
-
export { A as AnalyzeRunsOptions, a as analyzeRuns } from '../analyze-runs-DwCEkpO_.js';
|
|
15
|
-
export { C as CodeAgentSessionDiagnostic, a as CodeAgentSessionIntakeOptions, b as CodeAgentSessionIntakeResult, c as CodeAgentSessionMetrics, d as CodeAgentSessionSource, P as ParsedCodeAgentJsonl, f as fromClaudeCodeSession, e as fromCodexSession, g as fromKimiCodeSession, h as fromOpenCodeSession, i as fromPiSession, j as fromPigraphSession, p as parseCodeAgentJsonl } from '../code-agent-session-BO8nCnv3.js';
|
|
16
|
-
import '../red-team-BXHil6c8.js';
|
|
17
|
-
import '../dataset-BbGkaN2I.js';
|
|
18
|
-
import '../errors-CzMUYo7b.js';
|
|
19
|
-
import '../store-CKUAgsJz.js';
|
|
20
|
-
import '../schema-m0gsnbt3.js';
|
|
21
|
-
import '../pareto-E-pembql.js';
|
|
22
|
-
import '../statistics-C7PozGrZ.js';
|
|
23
|
-
import '../judge-calibration-0p2QcWNE.js';
|
|
24
|
-
import '../types-Croy5h7V.js';
|
|
25
|
-
import '@tangle-network/tcloud';
|
|
26
|
-
import '../llm-client-BeEcAokY.js';
|
|
27
|
-
import '../raw-provider-sink-C46HDghv.js';
|
|
28
|
-
import '../summary-report-DGmUucwQ.js';
|
|
29
|
-
import '../failure-cluster-CL7IVgkJ.js';
|
|
30
|
-
import '@ax-llm/ax';
|
|
31
|
-
import '../kind-factory-5b7xXXOr.js';
|
|
32
|
-
import '../store-C1YxJDEK.js';
|
|
33
|
-
import 'zod';
|
|
34
|
-
|
|
35
1
|
/**
|
|
36
|
-
* # `
|
|
37
|
-
*
|
|
38
|
-
*
|
|
39
|
-
*
|
|
40
|
-
*
|
|
41
|
-
*
|
|
42
|
-
*
|
|
43
|
-
*
|
|
44
|
-
*
|
|
45
|
-
*
|
|
46
|
-
*
|
|
47
|
-
*
|
|
48
|
-
*
|
|
49
|
-
*
|
|
50
|
-
*
|
|
51
|
-
*
|
|
52
|
-
*
|
|
53
|
-
*
|
|
54
|
-
*
|
|
55
|
-
*
|
|
56
|
-
*
|
|
57
|
-
|
|
58
|
-
|
|
59
|
-
|
|
60
|
-
|
|
61
|
-
|
|
62
|
-
|
|
63
|
-
|
|
64
|
-
|
|
65
|
-
|
|
66
|
-
|
|
67
|
-
|
|
68
|
-
|
|
69
|
-
|
|
70
|
-
|
|
71
|
-
|
|
72
|
-
|
|
73
|
-
|
|
74
|
-
|
|
75
|
-
|
|
76
|
-
|
|
77
|
-
|
|
78
|
-
|
|
79
|
-
|
|
80
|
-
|
|
81
|
-
|
|
82
|
-
|
|
83
|
-
|
|
84
|
-
|
|
85
|
-
|
|
86
|
-
|
|
87
|
-
|
|
88
|
-
|
|
89
|
-
|
|
90
|
-
|
|
91
|
-
|
|
92
|
-
|
|
93
|
-
|
|
94
|
-
|
|
95
|
-
|
|
96
|
-
|
|
97
|
-
|
|
98
|
-
|
|
99
|
-
|
|
100
|
-
|
|
101
|
-
|
|
102
|
-
|
|
103
|
-
|
|
104
|
-
|
|
105
|
-
|
|
106
|
-
|
|
107
|
-
|
|
108
|
-
|
|
109
|
-
|
|
110
|
-
|
|
111
|
-
|
|
112
|
-
|
|
113
|
-
|
|
114
|
-
|
|
115
|
-
|
|
116
|
-
|
|
117
|
-
|
|
118
|
-
|
|
119
|
-
* agent: (_surface, scenario, ctx) => yourPlainDispatch(scenario, ctx)
|
|
120
|
-
*
|
|
121
|
-
* That mode evaluates without mutating any surface — useful as a
|
|
122
|
-
* baseline-only run (set `budget.generations = 0`).
|
|
123
|
-
*/
|
|
124
|
-
agent: (surface: MutableSurface, scenario: TScenario, ctx: DispatchContext) => Promise<TArtifact>;
|
|
125
|
-
/** Scenarios to evaluate against. Train/holdout split is computed from
|
|
126
|
-
* these unless `budget.holdoutScenarios` is set explicitly. */
|
|
127
|
-
scenarios: TScenario[];
|
|
128
|
-
/** Judge that scores artifacts. Bring your own; use `langchainJudge`
|
|
129
|
-
* from `/adapters/langchain` for a Runnable-shaped one. */
|
|
130
|
-
judge: JudgeConfig<TArtifact, TScenario>;
|
|
131
|
-
/** Starting surface — system prompt, JSON config, anything `MutableSurface`
|
|
132
|
-
* accepts. The driver mutates this each generation. */
|
|
133
|
-
baselineSurface: MutableSurface;
|
|
134
|
-
/** Budget + loop shape. All fields optional; defaults pick the LAND-tier
|
|
135
|
-
* story. */
|
|
136
|
-
budget?: SelfImproveBudget;
|
|
137
|
-
/** Custom driver. Default is `gepaDriver` configured from `llm` +
|
|
138
|
-
* `mutationPrimitives`. */
|
|
139
|
-
driver?: ImprovementDriver;
|
|
140
|
-
/** Default-driver overrides — used when `driver` is unset. */
|
|
141
|
-
mutationPrimitives?: string[];
|
|
142
|
-
driverTarget?: string;
|
|
143
|
-
/** Custom gate. Default is `defaultProductionGate` with
|
|
144
|
-
* `deltaThreshold: 0.05` on the held-out split. */
|
|
145
|
-
gate?: Gate<TArtifact, TScenario>;
|
|
146
|
-
/** LLM config consumed by the default `gepaDriver`. Ignored if you pass
|
|
147
|
-
* your own `driver`. */
|
|
148
|
-
llm?: SelfImproveLlm;
|
|
149
|
-
/** Storage backend. Default is DURABLE: when a real (non-`mem://`) `runDir`
|
|
150
|
-
* is available, the substrate defaults to `fsCampaignStorage()` so the
|
|
151
|
-
* provenance record + OTel spans survive the call. Pass
|
|
152
|
-
* `inMemoryCampaignStorage()` explicitly to opt OUT (tests, edge runtimes).
|
|
153
|
-
* Default when `runDir` is `mem://...` (or unset): in-memory. */
|
|
154
|
-
storage?: CampaignStorage;
|
|
155
|
-
/** Run directory (logical for in-memory storage, real path for fs).
|
|
156
|
-
* Default `mem://selfImprove-<timestamp>` (in-memory, non-durable). Pass a
|
|
157
|
-
* real path to persist the provenance record + spans. */
|
|
158
|
-
runDir?: string;
|
|
159
|
-
/**
|
|
160
|
-
* Worker call records for backend provenance. The agent is opaque to the
|
|
161
|
-
* substrate (it returns an artifact, not token usage), so to capture an
|
|
162
|
-
* `assertRealBackend`-grade verdict + worker call count + model in the
|
|
163
|
-
* provenance record, the agent reports its per-call `RunRecord`s here.
|
|
164
|
-
* Called once after the loop; return the records the agent accumulated.
|
|
165
|
-
* When unset, backend provenance is derived from campaign cells (cost only;
|
|
166
|
-
* verdict will read `stub` without token usage — the honest signal that no
|
|
167
|
-
* token channel was wired).
|
|
168
|
-
*/
|
|
169
|
-
collectWorkerRecords?: () => RunRecord[];
|
|
170
|
-
/** Fires once the durable provenance record + OTel spans are emitted.
|
|
171
|
-
* Receives the structured record for inline assertions / custom routing. */
|
|
172
|
-
onProvenance?: (record: LoopProvenanceRecord) => void;
|
|
173
|
-
/** Distributed-driver seam — same as `RunCampaignOptions.cellPlacement`.
|
|
174
|
-
* Returns an opaque placement key the substrate forwards to your agent
|
|
175
|
-
* as `ctx.placement`. Combined with `httpDispatch` from
|
|
176
|
-
* `/adapters/http`, fans cells across regions. */
|
|
177
|
-
cellPlacement?: (input: {
|
|
178
|
-
scenario: TScenario;
|
|
179
|
-
rep: number;
|
|
180
|
-
generation?: number;
|
|
181
|
-
}) => string | undefined;
|
|
182
|
-
/** Streaming hook — fires on baseline + each generation + gate decision.
|
|
183
|
-
* Consumer routes events wherever (UI, dashboard, logs). */
|
|
184
|
-
onProgress?: (event: SelfImproveProgressEvent) => void;
|
|
185
|
-
/** Auto-promotion behavior on a ship decision. Default `'none'` — we
|
|
186
|
-
* return the winner; you ship it however you ship. `'pr'` opens a
|
|
187
|
-
* GitHub PR via `openAutoPr`; requires `ghOwner` + `ghRepo`. */
|
|
188
|
-
autoOnPromote?: 'pr' | 'none';
|
|
189
|
-
ghOwner?: string;
|
|
190
|
-
ghRepo?: string;
|
|
191
|
-
/**
|
|
192
|
-
* Opt-in: ship eval-run events to a hosted orchestrator (ours, your
|
|
193
|
-
* self-hosted one, or any compatible implementation of the
|
|
194
|
-
* `docs/hosted-ingest-spec.md` wire format). When set, the substrate
|
|
195
|
-
* POSTs the final `EvalRunEvent` to `${endpoint}/v1/ingest/eval-runs`
|
|
196
|
-
* after the loop completes. Failures are logged but do not fail the
|
|
197
|
-
* loop — local result is always returned.
|
|
198
|
-
*
|
|
199
|
-
* For our orchestrator: `{ endpoint: 'https://orchestrator.tangle.tools/v1', apiKey, tenantId }`.
|
|
200
|
-
*
|
|
201
|
-
* For your self-hosted: any URL serving the wire format. See
|
|
202
|
-
* `examples/hosted-ingest-server/` for the reference receiver.
|
|
203
|
-
*/
|
|
204
|
-
hostedTenant?: HostedTenant;
|
|
205
|
-
/** Free-form labels attached to the hosted event (env, branch, model id,
|
|
206
|
-
* etc.). Ignored when `hostedTenant` is unset. */
|
|
207
|
-
hostedLabels?: Record<string, string>;
|
|
208
|
-
/** Capture every artifact + judge score to this store (labeled-example
|
|
209
|
-
* corpus the driver may read for few-shot, and the dataset you ship). Pass
|
|
210
|
-
* `'off'` to disable. Default: off. */
|
|
211
|
-
labeledStore?: LabeledScenarioStore | 'off';
|
|
212
|
-
/** Capture-source tag for `labeledStore`. Default `'eval-run'`. */
|
|
213
|
-
captureSource?: 'production-trace' | 'eval-run' | 'manual' | 'red-team' | 'synthetic';
|
|
214
|
-
/**
|
|
215
|
-
* Per-cell backend-integrity expectation — the fail-loud guard. A cell that
|
|
216
|
-
* produced an artifact but reported `costUsd === 0` AND zero tokens is a
|
|
217
|
-
* stub. Modes: `'assert'` throws on the first such cell, `'warn'` logs it,
|
|
218
|
-
* `'off'` skips the check (offline/replay). Default `'assert'` — `selfImprove`
|
|
219
|
-
* is the real-run path, so a stub fails loud rather than scoring a clean 0.
|
|
220
|
-
*/
|
|
221
|
-
expectUsage?: 'assert' | 'warn' | 'off';
|
|
222
|
-
/**
|
|
223
|
-
* Per-generation findings producer (the EYES→HANDS closure). After each
|
|
224
|
-
* generation is scored, this is called; whatever it returns REPLACES the
|
|
225
|
-
* driver's `findings` for the next generation's `propose()`. Plug a
|
|
226
|
-
* trace-analyst registry / HALO here. When absent, findings stay
|
|
227
|
-
* `opts.findings`.
|
|
228
|
-
*/
|
|
229
|
-
analyzeGeneration?: RunOptimizationOptions<TScenario, TArtifact>['analyzeGeneration'];
|
|
230
|
-
/** Static findings forwarded to the driver's `propose()` as `ctx.findings`
|
|
231
|
-
* (a findings-grounded driver consumes them). Default: none. */
|
|
232
|
-
findings?: unknown[];
|
|
233
|
-
}
|
|
234
|
-
interface SelfImproveResult<TScenario extends Scenario, TArtifact> {
|
|
235
|
-
/** Composite mean across all scenarios, baseline run. */
|
|
236
|
-
baseline: {
|
|
237
|
-
compositeMean: number;
|
|
238
|
-
perScenario: Record<string, number>;
|
|
239
|
-
};
|
|
240
|
-
/** Composite mean on the held-out set, winner run. */
|
|
241
|
-
winner: {
|
|
242
|
-
compositeMean: number;
|
|
243
|
-
perScenario: Record<string, number>;
|
|
244
|
-
surface: MutableSurface;
|
|
245
|
-
/** Driver label for the promoted change. Absent ⇒ winner == baseline or
|
|
246
|
-
* a bare-surface mutator. */
|
|
247
|
-
label?: string;
|
|
248
|
-
/** Driver rationale — the "because Z" that motivated the promoted change.
|
|
249
|
-
* Threaded from the driver's `ProposedCandidate` through the loop.
|
|
250
|
-
* Absent ⇒ winner == baseline. */
|
|
251
|
-
rationale?: string;
|
|
252
|
-
};
|
|
253
|
-
/** `winner.compositeMean - baselineOnHoldout.compositeMean`. Positive
|
|
254
|
-
* means the gate observed improvement. */
|
|
255
|
-
lift: number;
|
|
256
|
-
/** The explicit baseline→winner unified diff. Always present (empty string
|
|
257
|
-
* when winner == baseline). */
|
|
258
|
-
diff: string;
|
|
259
|
-
/** Durable, queryable provenance record: candidate→cell→gate→promote chain +
|
|
260
|
-
* rationale + diff + backend provenance. The artifact the hosted ingest
|
|
261
|
-
* path stores; the +lift RECOMPUTES from `record.heldOutLift`. */
|
|
262
|
-
provenance: LoopProvenanceRecord;
|
|
263
|
-
/** `defaultProductionGate.decide()` result. */
|
|
264
|
-
gateDecision: 'ship' | 'hold' | 'need_more_work' | 'model_ceiling' | 'arch_ceiling';
|
|
265
|
-
/** Number of generations actually explored (may be less than the
|
|
266
|
-
* budget if the driver gave up early). */
|
|
267
|
-
generationsExplored: number;
|
|
268
|
-
/** Wall-clock total. */
|
|
269
|
-
durationMs: number;
|
|
270
|
-
/** Total cost across baseline + every generation. */
|
|
271
|
-
totalCostUsd: number;
|
|
272
|
-
/**
|
|
273
|
-
* Rigor packet: distributional summary, paired-bootstrap lift CI,
|
|
274
|
-
* judge stats, contamination check, recommendations. Wired through
|
|
275
|
-
* `analyzeRuns()` on the baseline + winner cells of the campaign.
|
|
276
|
-
* Hosted-tier dashboards render this as the v3-vs-v4 decision view.
|
|
277
|
-
*/
|
|
278
|
-
insight: InsightReport;
|
|
279
|
-
/**
|
|
280
|
-
* Raw substrate result for advanced inspection — full per-generation
|
|
281
|
-
* candidates, full campaign artifacts, all judge scores. Useful for
|
|
282
|
-
* debugging or reporting beyond the summary.
|
|
283
|
-
*/
|
|
284
|
-
raw: RunImprovementLoopResult<TArtifact, TScenario>;
|
|
285
|
-
}
|
|
286
|
-
/**
|
|
287
|
-
* One-shot self-improvement loop. See module docstring for defaults +
|
|
288
|
-
* extension points.
|
|
289
|
-
*
|
|
290
|
-
* @example Minimum (LAND tier):
|
|
291
|
-
*
|
|
292
|
-
* const result = await selfImprove({
|
|
293
|
-
* agent: (surface, scenario, ctx) => myAgent(surface, scenario, ctx.signal),
|
|
294
|
-
* scenarios,
|
|
295
|
-
* judge,
|
|
296
|
-
* baselineSurface: DEFAULT_PROMPT,
|
|
297
|
-
* })
|
|
298
|
-
* console.log(`lift: ${result.lift.toFixed(3)} (${result.gateDecision})`)
|
|
299
|
-
*
|
|
300
|
-
* @example Distributed (workers in three regions):
|
|
301
|
-
*
|
|
302
|
-
* await selfImprove({
|
|
303
|
-
* agent: httpDispatch({ resolveUrl: ({ placement }) => REGION_URLS[placement!] }),
|
|
304
|
-
* scenarios,
|
|
305
|
-
* judge,
|
|
306
|
-
* baselineSurface: DEFAULT_PROMPT,
|
|
307
|
-
* cellPlacement: ({ scenario }) => scenario.region,
|
|
308
|
-
* budget: { maxConcurrency: 12 },
|
|
309
|
-
* })
|
|
310
|
-
*/
|
|
311
|
-
declare function selfImprove<TScenario extends Scenario, TArtifact>(opts: SelfImproveOptions<TScenario, TArtifact>): Promise<SelfImproveResult<TScenario, TArtifact>>;
|
|
312
|
-
|
|
313
|
-
/**
|
|
314
|
-
* # `@tangle-network/agent-eval/contract` — eval-run diff primitive.
|
|
315
|
-
*
|
|
316
|
-
* The substrate side of the v-N-versus-v-N+1 dashboard view. Given two
|
|
317
|
-
* `EvalRunEvent`s (or two `EvalRunGenerationSnapshot`s from one run), this
|
|
318
|
-
* returns a normalised diff: per-cell composite + per-judge/per-dimension
|
|
319
|
-
* deltas, surface-hash change, aggregate cost + duration shifts.
|
|
320
|
-
*
|
|
321
|
-
* Consumed by:
|
|
322
|
-
* - The hosted-tier dashboard (intelligence-web) — renders v3 vs v4
|
|
323
|
-
* comparisons of cells × judges × dimensions.
|
|
324
|
-
* - CI reporting — emits a "shipped: composite +0.07, cost +$1.20" line
|
|
325
|
-
* in PR review for autonomous-improvement runs.
|
|
326
|
-
* - Any downstream consumer that needs "what actually changed" without
|
|
327
|
-
* reimplementing the matching + arithmetic.
|
|
328
|
-
*
|
|
329
|
-
* Cells are matched on the natural composite key `(scenarioId, rep)`.
|
|
330
|
-
* Unmatched cells surface as `removed` / `added` so callers can tell
|
|
331
|
-
* "this cell got worse" from "this cell wasn't run."
|
|
332
|
-
*/
|
|
333
|
-
|
|
334
|
-
/** Per-dimension delta. `before` / `after` are null when the judge did not
|
|
335
|
-
* emit a value for that side. `delta` is `after - before`; null when
|
|
336
|
-
* either side is null. */
|
|
337
|
-
interface EvalDimensionDelta {
|
|
338
|
-
before: number | null;
|
|
339
|
-
after: number | null;
|
|
340
|
-
delta: number | null;
|
|
341
|
-
}
|
|
342
|
-
/** Per-cell delta, keyed on `(scenarioId, rep)`. */
|
|
343
|
-
interface EvalCellScoreDelta {
|
|
344
|
-
scenarioId: string;
|
|
345
|
-
rep: number;
|
|
346
|
-
compositeBefore: number;
|
|
347
|
-
compositeAfter: number;
|
|
348
|
-
compositeDelta: number;
|
|
349
|
-
/** Per-judge → per-dimension deltas. Outer key = judge name from
|
|
350
|
-
* `EvalRunCellScore.dimensions`; inner key = dimension name. */
|
|
351
|
-
dimensions: Record<string, Record<string, EvalDimensionDelta>>;
|
|
352
|
-
}
|
|
353
|
-
/** Diff between two generation snapshots — the unit the dashboard renders
|
|
354
|
-
* for a single "v3 vs v4" comparison. */
|
|
355
|
-
interface EvalGenerationDiff {
|
|
356
|
-
beforeIndex: number;
|
|
357
|
-
afterIndex: number;
|
|
358
|
-
beforeSurfaceHash: string;
|
|
359
|
-
afterSurfaceHash: string;
|
|
360
|
-
surfaceChanged: boolean;
|
|
361
|
-
/** Cells present in both snapshots, matched on `(scenarioId, rep)`. */
|
|
362
|
-
matched: EvalCellScoreDelta[];
|
|
363
|
-
/** Cells present in `before` but missing from `after`. */
|
|
364
|
-
removed: EvalRunCellScore[];
|
|
365
|
-
/** Cells present in `after` but missing from `before`. */
|
|
366
|
-
added: EvalRunCellScore[];
|
|
367
|
-
/** Aggregate composite mean across all cells in the snapshot. */
|
|
368
|
-
compositeBefore: number;
|
|
369
|
-
compositeAfter: number;
|
|
370
|
-
compositeDelta: number;
|
|
371
|
-
costUsdBefore: number;
|
|
372
|
-
costUsdAfter: number;
|
|
373
|
-
costUsdDelta: number;
|
|
374
|
-
durationMsBefore: number;
|
|
375
|
-
durationMsAfter: number;
|
|
376
|
-
durationMsDelta: number;
|
|
377
|
-
}
|
|
378
|
-
/** Diff between two full eval-runs. Includes both baseline-vs-baseline and
|
|
379
|
-
* winner-vs-winner generation diffs when both sides expose them, plus
|
|
380
|
-
* run-level metadata. */
|
|
381
|
-
interface EvalRunDiff {
|
|
382
|
-
beforeRunId: string;
|
|
383
|
-
afterRunId: string;
|
|
384
|
-
beforeTimestamp: string;
|
|
385
|
-
afterTimestamp: string;
|
|
386
|
-
beforeGateDecision: GateDecision | null;
|
|
387
|
-
afterGateDecision: GateDecision | null;
|
|
388
|
-
beforeHoldoutLift: number | null;
|
|
389
|
-
afterHoldoutLift: number | null;
|
|
390
|
-
holdoutLiftDelta: number | null;
|
|
391
|
-
beforeTotalCostUsd: number;
|
|
392
|
-
afterTotalCostUsd: number;
|
|
393
|
-
totalCostUsdDelta: number;
|
|
394
|
-
beforeTotalDurationMs: number;
|
|
395
|
-
afterTotalDurationMs: number;
|
|
396
|
-
totalDurationMsDelta: number;
|
|
397
|
-
/** Baseline-vs-baseline diff. Null when either run has no baseline. */
|
|
398
|
-
baselineDiff: EvalGenerationDiff | null;
|
|
399
|
-
/** Highest-index-generation comparison. Null when either run has no
|
|
400
|
-
* recorded generations (e.g. baseline-only or errored before any
|
|
401
|
-
* generation completed). */
|
|
402
|
-
winnersDiff: EvalGenerationDiff | null;
|
|
403
|
-
}
|
|
404
|
-
/**
|
|
405
|
-
* Diff two generation snapshots. Cells are matched on `(scenarioId, rep)`;
|
|
406
|
-
* unmatched cells surface in `added` / `removed`. Aggregate fields are
|
|
407
|
-
* recomputed from the snapshot's stored fields, not re-derived from cells —
|
|
408
|
-
* this keeps the diff consistent with whatever aggregation the substrate
|
|
409
|
-
* actually reported.
|
|
410
|
-
*/
|
|
411
|
-
declare function diffGenerations(before: EvalRunGenerationSnapshot, after: EvalRunGenerationSnapshot): EvalGenerationDiff;
|
|
412
|
-
/**
|
|
413
|
-
* Diff two full eval-runs. Produces baseline-vs-baseline and
|
|
414
|
-
* winner-vs-winner generation diffs when both sides expose them, plus
|
|
415
|
-
* run-level cost / lift / gate-decision deltas.
|
|
416
|
-
*/
|
|
417
|
-
declare function diffRuns(before: EvalRunEvent, after: EvalRunEvent): EvalRunDiff;
|
|
418
|
-
/**
|
|
419
|
-
* Within-run baseline → winning-generation diff. The natural "what did the
|
|
420
|
-
* improvement loop produce" view for a single run. Returns null when the
|
|
421
|
-
* run never reached a generation past baseline (errored early, or the gate
|
|
422
|
-
* shipped the baseline as-is).
|
|
423
|
-
*/
|
|
424
|
-
declare function diffRunBaselineToWinner(run: EvalRunEvent): EvalGenerationDiff | null;
|
|
425
|
-
|
|
426
|
-
/**
|
|
427
|
-
* `fromAgentTrace` — provenance correlation from Cursor's Agent Trace spec
|
|
428
|
-
* (https://github.com/cursor/agent-trace, RFC v0.1.0).
|
|
429
|
-
*
|
|
430
|
-
* Agent Trace is NOT a run/quality trace — it carries no outcome, score, or
|
|
431
|
-
* cost. It records *code authorship*: for a VCS revision, which AI model /
|
|
432
|
-
* conversation authored which file ranges. It explicitly disclaims quality
|
|
433
|
-
* assessment — which is exactly what `analyzeRuns` adds.
|
|
434
|
-
*
|
|
435
|
-
* The two layers join on a key the substrate already has: a `RunRecord`
|
|
436
|
-
* carries `commitSha`, and an Agent Trace record is keyed by
|
|
437
|
-
* `vcs.revision`. So this adapter does not produce `RunRecord`s — it builds a
|
|
438
|
-
* provenance index by commit and partitions existing runs by their authoring
|
|
439
|
-
* model. Feed each cohort to `analyzeRuns` (or pass one as `baselineRuns`) to
|
|
440
|
-
* answer the question no run-only trace can: *which authoring agent's code
|
|
441
|
-
* fails / regresses / costs more.*
|
|
442
|
-
*
|
|
443
|
-
* Granularity is commit-level (the SHA join). Per-file/per-line correlation
|
|
444
|
-
* would require runs to record which files they exercised — out of scope.
|
|
445
|
-
*/
|
|
446
|
-
|
|
447
|
-
type AgentTraceContributorType = 'human' | 'ai' | 'mixed' | 'unknown';
|
|
448
|
-
interface AgentTraceContributor {
|
|
449
|
-
type: AgentTraceContributorType;
|
|
450
|
-
/** models.dev id, e.g. `anthropic/claude-opus-4-5-20251101`. */
|
|
451
|
-
model_id?: string;
|
|
452
|
-
}
|
|
453
|
-
interface AgentTraceRange {
|
|
454
|
-
start_line: number;
|
|
455
|
-
end_line: number;
|
|
456
|
-
content_hash?: string;
|
|
457
|
-
/** Per-range contributor override (agent handoffs). Wins over the
|
|
458
|
-
* conversation-level contributor for these lines. */
|
|
459
|
-
contributor?: AgentTraceContributor;
|
|
460
|
-
}
|
|
461
|
-
interface AgentTraceConversation {
|
|
462
|
-
url?: string;
|
|
463
|
-
contributor?: AgentTraceContributor;
|
|
464
|
-
ranges: AgentTraceRange[];
|
|
465
|
-
}
|
|
466
|
-
interface AgentTraceFile {
|
|
467
|
-
path: string;
|
|
468
|
-
conversations: AgentTraceConversation[];
|
|
469
|
-
}
|
|
470
|
-
interface AgentTraceRecord {
|
|
471
|
-
version: string;
|
|
472
|
-
id: string;
|
|
473
|
-
timestamp: string;
|
|
474
|
-
vcs?: {
|
|
475
|
-
type: string;
|
|
476
|
-
revision: string;
|
|
477
|
-
};
|
|
478
|
-
tool?: {
|
|
479
|
-
name?: string;
|
|
480
|
-
version?: string;
|
|
481
|
-
};
|
|
482
|
-
files: AgentTraceFile[];
|
|
483
|
-
}
|
|
484
|
-
/** Authorship provenance for one VCS revision, aggregated across the record's
|
|
485
|
-
* files/conversations/ranges. */
|
|
486
|
-
interface AuthoringProvenance {
|
|
487
|
-
commitSha: string;
|
|
488
|
-
/** Unique AI model ids that authored code in this commit (type ai|mixed). */
|
|
489
|
-
aiModels: string[];
|
|
490
|
-
/** Tools that produced the records (e.g. `cursor`). */
|
|
491
|
-
tools: string[];
|
|
492
|
-
conversationCount: number;
|
|
493
|
-
fileCount: number;
|
|
494
|
-
/** Total attributed lines (sum of range spans). */
|
|
495
|
-
lineCount: number;
|
|
496
|
-
/** True if any range was authored (in whole or part) by a human. */
|
|
497
|
-
humanInvolved: boolean;
|
|
498
|
-
}
|
|
499
|
-
type AgentTraceIndex = Map<string, AuthoringProvenance>;
|
|
500
|
-
/**
|
|
501
|
-
* Build a commit → provenance index from Agent Trace records. Multiple records
|
|
502
|
-
* for the same revision are merged. Records without `vcs.revision` are skipped
|
|
503
|
-
* (the SHA is the join key — without it there is nothing to correlate against).
|
|
504
|
-
*/
|
|
505
|
-
declare function parseAgentTrace(records: AgentTraceRecord[]): AgentTraceIndex;
|
|
506
|
-
interface PartitionByAuthoringModelResult {
|
|
507
|
-
/** Runs grouped by each AI model that authored code in the run's commit. A
|
|
508
|
-
* run whose commit had multiple authoring models appears under EACH — the
|
|
509
|
-
* cohorts overlap by construction at commit granularity. */
|
|
510
|
-
byModel: Map<string, RunRecord[]>;
|
|
511
|
-
/** Runs whose `commitSha` had no Agent Trace provenance (no record, or no
|
|
512
|
-
* AI authorship). Kept separate — never silently folded into a cohort. */
|
|
513
|
-
unattributed: RunRecord[];
|
|
514
|
-
}
|
|
515
|
-
/**
|
|
516
|
-
* Partition runs by the AI model(s) that authored the code at each run's
|
|
517
|
-
* `commitSha`. Feed `byModel.get(modelId)` to `analyzeRuns`, or compare two
|
|
518
|
-
* model cohorts via `analyzeRuns({ runs: a, baselineRuns: b })` for a lift CI
|
|
519
|
-
* on "model A's code vs model B's code".
|
|
520
|
-
*/
|
|
521
|
-
declare function partitionRunsByAuthoringModel(runs: RunRecord[], index: AgentTraceIndex): PartitionByAuthoringModelResult;
|
|
522
|
-
|
|
523
|
-
/**
|
|
524
|
-
* # `intake/feedback-table` — multi-rater approve/reject corpus → `RunRecord[]`.
|
|
525
|
-
*
|
|
526
|
-
* The generic shape behind Obsidian's `#approved` / `#rejected` tags, a
|
|
527
|
-
* Google Sheet, a Postgres `feedback` table, or any CSV with ratings.
|
|
528
|
-
*
|
|
529
|
-
* Caller supplies one row per (run, rater) tuple plus per-run metadata; the
|
|
530
|
-
* adapter rolls them up into the substrate-canonical `RunRecord` shape so
|
|
531
|
-
* `analyzeRuns({ runs, raterScores })` can produce inter-rater agreement,
|
|
532
|
-
* disagreement triage, and downstream recommendations.
|
|
533
|
-
*
|
|
534
|
-
* Per-run `RunRecord.outcome.searchScore` is the rater-mean rating
|
|
535
|
-
* (normalised to 0..1 when scale is supplied); `outcome.raw` carries the
|
|
536
|
-
* per-rater scores keyed by rater id for downstream attribution.
|
|
537
|
-
*/
|
|
538
|
-
|
|
539
|
-
interface FeedbackTableRow {
|
|
540
|
-
/** Stable id for this run — the unit a rater scored. Drives pairing
|
|
541
|
-
* across analysis primitives. */
|
|
542
|
-
runId: string;
|
|
543
|
-
/** Identifier of the rater that produced this rating. */
|
|
544
|
-
rater: string;
|
|
545
|
-
/** The rating itself. Accepts boolean (approve/reject), 0..1 scalar,
|
|
546
|
-
* or any numeric scale — see `scale`. */
|
|
547
|
-
rating: number | boolean;
|
|
548
|
-
/** Optional metadata carried through to `RunRecord.outcome.raw` and the
|
|
549
|
-
* custom-shape metadata bag. */
|
|
550
|
-
metadata?: Record<string, unknown>;
|
|
551
|
-
}
|
|
552
|
-
interface FeedbackTableMeta {
|
|
553
|
-
runId: string;
|
|
554
|
-
/** When omitted, defaults to `'feedback-corpus'`. Used to group related
|
|
555
|
-
* runs in `analyzeRuns()` lift analysis. */
|
|
556
|
-
experimentId?: string;
|
|
557
|
-
/** When omitted, defaults to `runId` — each run is its own candidate. */
|
|
558
|
-
candidateId?: string;
|
|
559
|
-
/** Cost in USD, when available. Set to 0 when unknown — the consumer's
|
|
560
|
-
* cost analysis sections will collapse gracefully. */
|
|
561
|
-
costUsd?: number;
|
|
562
|
-
/** Wall-clock ms, when available. Defaults to 0. */
|
|
563
|
-
wallMs?: number;
|
|
564
|
-
/** Model identifier including snapshot. Default `unknown@unknown`. */
|
|
565
|
-
model?: string;
|
|
566
|
-
/** Optional sha256 of the prompt; default `'sha256:unknown'`. */
|
|
567
|
-
promptHash?: string;
|
|
568
|
-
/** Default `'sha256:unknown'`. */
|
|
569
|
-
configHash?: string;
|
|
570
|
-
/** Default `'unknown'`. */
|
|
571
|
-
commitSha?: string;
|
|
572
|
-
/** Default `'holdout'` — feedback corpora are by nature the holdout
|
|
573
|
-
* signal a closed-loop improvement aims at. */
|
|
574
|
-
splitTag?: RunSplitTag;
|
|
575
|
-
/** Free-form metadata available to consumers via the cast-out path on
|
|
576
|
-
* the resulting RunRecord. */
|
|
577
|
-
extras?: Record<string, unknown>;
|
|
578
|
-
}
|
|
579
|
-
interface FromFeedbackTableOptions {
|
|
580
|
-
/** Per-(run, rater) ratings. */
|
|
581
|
-
ratings: FeedbackTableRow[];
|
|
582
|
-
/** Per-run metadata. When a runId appears in `ratings` but not here, the
|
|
583
|
-
* adapter synthesises minimal metadata with defaults documented above. */
|
|
584
|
-
meta?: FeedbackTableMeta[];
|
|
585
|
-
/** Rating scale. Provide `{ min, max }` for non-0..1 numeric scales.
|
|
586
|
-
* Booleans are normalised: true → 1, false → 0. Default: assumes
|
|
587
|
-
* ratings are already 0..1. */
|
|
588
|
-
scale?: {
|
|
589
|
-
min: number;
|
|
590
|
-
max: number;
|
|
591
|
-
};
|
|
592
|
-
/** When true, the rater scores are emitted into `raterScores` (a sibling
|
|
593
|
-
* array `analyzeRuns()` accepts) instead of being averaged into the
|
|
594
|
-
* run's `outcome.searchScore`. Default `true` — preserves rater-level
|
|
595
|
-
* signal for inter-rater analysis. */
|
|
596
|
-
emitRaterScores?: boolean;
|
|
597
|
-
}
|
|
598
|
-
interface FromFeedbackTableResult {
|
|
599
|
-
runs: RunRecord[];
|
|
600
|
-
/** Rater-level scores ready to pass into `analyzeRuns({ raterScores })`
|
|
601
|
-
* for inter-rater agreement + disagreement triage. */
|
|
602
|
-
raterScores: Array<{
|
|
603
|
-
runId: string;
|
|
604
|
-
rater: string;
|
|
605
|
-
score: number;
|
|
606
|
-
}>;
|
|
607
|
-
}
|
|
608
|
-
declare function fromFeedbackTable(opts: FromFeedbackTableOptions): FromFeedbackTableResult;
|
|
609
|
-
|
|
610
|
-
/**
|
|
611
|
-
* # `intake/otel-spans` — OTel `TraceSpanEvent[]` → `RunRecord[]`.
|
|
612
|
-
*
|
|
613
|
-
* Turns an existing observability stream into the substrate-canonical
|
|
614
|
-
* `RunRecord` shape so consumers with logs but no eval discipline can
|
|
615
|
-
* call `analyzeRuns()` against their production traffic immediately.
|
|
616
|
-
*
|
|
617
|
-
* Pivot rule: spans are grouped by `tangle.runId` (the same attribute the
|
|
618
|
-
* hosted-tier wire format uses) or, when absent, by `traceId`. One group
|
|
619
|
-
* becomes one `RunRecord`. The root span (no `parentSpanId`) supplies:
|
|
620
|
-
*
|
|
621
|
-
* - `runId` (the group key)
|
|
622
|
-
* - `wallMs` from `endTimeUnixNano - startTimeUnixNano`
|
|
623
|
-
* - `model` from `gen_ai.request.model` / `llm.model` / `tangle.model`
|
|
624
|
-
* - cost from `cost.usd` / `gen_ai.usage.cost_usd` / `tangle.cost.usd`
|
|
625
|
-
* - token usage from `gen_ai.usage.{input,output}_tokens`
|
|
626
|
-
* - `outcome.searchScore` from `tangle.score` / `eval.score` when
|
|
627
|
-
* present; `outcome.raw` collects every numeric attribute.
|
|
628
|
-
*
|
|
629
|
-
* Spans that ERRORed (`status.code === 'ERROR'`) populate `failureMode`
|
|
630
|
-
* with their `name` so `analyzeRuns()`'s failure clustering sees them.
|
|
2
|
+
* # `@tangle-network/agent-eval/contract` - the app-facing public surface.
|
|
3
|
+
*
|
|
4
|
+
* **Stability:** every export in this file is the frozen public API for
|
|
5
|
+
* foreign-agent consumers. New minors only ADD; nothing here changes shape
|
|
6
|
+
* or disappears in a 0.x minor. Wire your agent against these imports and
|
|
7
|
+
* expect them to keep working across `agent-eval` upgrades.
|
|
8
|
+
*
|
|
9
|
+
* ## What this gives you
|
|
10
|
+
*
|
|
11
|
+
* The minimum surface area to evaluate + self-improve any agent — yours,
|
|
12
|
+
* a partner's, anything that returns text or a structured artifact. No
|
|
13
|
+
* Tangle sandbox required. No Tangle account required. Local files,
|
|
14
|
+
* stdout, your own LLM endpoint.
|
|
15
|
+
*
|
|
16
|
+
* ## The five types you need to know
|
|
17
|
+
*
|
|
18
|
+
* 1. **`Scenario`** — what you evaluate against. Stable `id` + `kind` +
|
|
19
|
+
* optional `tags`; extend with your domain fields.
|
|
20
|
+
* 2. **`Dispatch<TScenario, TArtifact>`** — the seam. One function:
|
|
21
|
+
* scenario in, artifact out. Whatever your agent is, wrap it as a
|
|
22
|
+
* `Dispatch` and the eval engine drives it. The campaign internals call
|
|
23
|
+
* the same shape `DispatchFn`; `/contract` exports it as `Dispatch`.
|
|
24
|
+
* 3. **`JudgeConfig<TArtifact, TScenario>`** — pluggable dimensional
|
|
25
|
+
* scorer. Bring an LLM judge, a deterministic check, an ensemble —
|
|
26
|
+
* the engine only cares about `score(input) → JudgeScore`.
|
|
27
|
+
* 4. **`SurfaceProposer`** — proposes next candidate surfaces for the
|
|
28
|
+
* optimization loop. Use `gepaProposer` (reflective LLM proposal) or
|
|
29
|
+
* `evolutionaryProposer`, or write your own.
|
|
30
|
+
* 5. **`Gate`** — promotion guard. Returns `'ship'` / `'hold'` /
|
|
31
|
+
* `'need_more_work'` / others for each candidate; the loop only ships
|
|
32
|
+
* what passes. `defaultProductionGate` is the composite default;
|
|
33
|
+
* `paretoSignificanceGate` decides over the multi-objective evidence
|
|
34
|
+
* vector (per-axis significance + Pareto dominance, no scalar collapse)
|
|
35
|
+
* and is itself factored as a pluggable `PromotionPolicy` over a
|
|
36
|
+
* `buildEvidenceVector` bus so competing strategies share one evidence set.
|
|
37
|
+
*
|
|
38
|
+
* ## The five functions you'll call
|
|
39
|
+
*
|
|
40
|
+
* 1. **`defineAgentEval(options)`** — define scenarios, agent, judge, and
|
|
41
|
+
* baseline once; call `.evaluate()` for a score or `.improve()` for the
|
|
42
|
+
* closed loop.
|
|
43
|
+
* 2. **`runEval(options)`** — one-off evaluation across scenarios. Use
|
|
44
|
+
* when you just want a score.
|
|
45
|
+
* 3. **`runCampaign(options)`** — structured set of cells (scenarios ×
|
|
46
|
+
* seeds × replicates) that emits a `CampaignResult` downstream tools
|
|
47
|
+
* can read.
|
|
48
|
+
* 4. **`runImprovementLoop(options)`** — the closed self-improvement
|
|
49
|
+
* loop: campaign → judge → mutator → gate → next generation. Stops
|
|
50
|
+
* when the gate ships or the budget exhausts.
|
|
51
|
+
* 5. **`defaultProductionGate(options)`** — the standard held-out gate
|
|
52
|
+
* most consumers want; compose with `composeGate` to add custom
|
|
53
|
+
* checks (regression deltas, cost caps, red-team signals).
|
|
54
|
+
*
|
|
55
|
+
* ## Two storage backends you'll pick from
|
|
56
|
+
*
|
|
57
|
+
* - **`fsCampaignStorage()`** — writes traces, artifacts, and campaign
|
|
58
|
+
* manifests to a local directory. The default for Node consumers.
|
|
59
|
+
* - **`inMemoryCampaignStorage()`** — Cloudflare Workers, edge, tests,
|
|
60
|
+
* any environment without filesystem. Same interface; runs the same
|
|
61
|
+
* campaigns; nothing persists past the process.
|
|
62
|
+
*
|
|
63
|
+
* ## Optional: deployment-outcome store (predictive validity)
|
|
64
|
+
*
|
|
65
|
+
* Record which candidates shipped + whether downstream metrics actually
|
|
66
|
+
* improved. Feeds back into the gate so promotion decisions calibrate
|
|
67
|
+
* against observed reality, not just held-out scores.
|
|
68
|
+
*
|
|
69
|
+
* ## Optional: RL bridge
|
|
70
|
+
*
|
|
71
|
+
* If you want to feed campaign output into RL training (TRL, prime-rl,
|
|
72
|
+
* in-house), the RL bridge converts a `CampaignResult` to canonical
|
|
73
|
+
* `RunRecord` + preference shapes. Pull those from
|
|
74
|
+
* `@tangle-network/agent-eval/rl` directly - RL is opt-in and not part
|
|
75
|
+
* of the app-facing contract.
|
|
76
|
+
*
|
|
77
|
+
* ## What's NOT here
|
|
78
|
+
*
|
|
79
|
+
* Anything below this barrel is internal substrate that may move
|
|
80
|
+
* between minors. If you find yourself reaching for an import path other
|
|
81
|
+
* than `/contract`, `/campaign`, `/rl`, `/belief-state`, `/reporting`,
|
|
82
|
+
* `/control`, `/telemetry`, `/analyst`, `/traces`, `/testing`, or another
|
|
83
|
+
* named package export, you're using internals. Open an issue so we can
|
|
84
|
+
* promote what you need into a named subpath.
|
|
631
85
|
*/
|
|
632
|
-
|
|
633
|
-
|
|
634
|
-
|
|
635
|
-
|
|
636
|
-
|
|
637
|
-
|
|
638
|
-
|
|
639
|
-
}
|
|
640
|
-
|
|
641
|
-
|
|
642
|
-
export { type
|
|
86
|
+
export type { CampaignAggregates, CampaignArtifactWriter, CampaignCellResult, CampaignCostMeter, CampaignResult, CampaignTraceWriter, CodeSurface, DispatchContext, DispatchFn as Dispatch, Gate, GateContext, GateDecision, GateResult, GenerationCandidate, GenerationRecord, JudgeConfig, JudgeDimension, JudgeScore, MutableSurface, Mutator, OptimizationProposer, OptimizerConfig, Scenario, SessionScript, SurfaceProposer, } from '../campaign/types';
|
|
87
|
+
export { type RunEvalOptions, runEval } from '../campaign/presets/run-eval';
|
|
88
|
+
export { type RunImprovementLoopOptions, type RunImprovementLoopResult, runImprovementLoop, } from '../campaign/presets/run-improvement-loop';
|
|
89
|
+
export { type RunCampaignOptions, runCampaign } from '../campaign/run-campaign';
|
|
90
|
+
export { type EvolutionaryProposerOptions, evolutionaryProposer, } from '../campaign/proposers/evolutionary';
|
|
91
|
+
export { type GepaProposerOptions, gepaProposer } from '../campaign/proposers/gepa';
|
|
92
|
+
export { composeGate } from '../campaign/gates/compose';
|
|
93
|
+
export { type DefaultProductionGateOptions, defaultProductionGate, } from '../campaign/gates/default-production-gate';
|
|
94
|
+
export { type HeldOutGateOptions, heldOutGate } from '../campaign/gates/heldout-gate';
|
|
95
|
+
export { type AxisEvidence, type AxisVerdict, type BuildEvidenceVectorOptions, buildEvidenceVector, type EvidenceVector, type ObjectiveSource, type ParetoSignificanceGateOptions, type PromotionObjective, type PromotionPolicy, paretoPolicy, paretoSignificanceGate, } from '../campaign/gates/promotion-policy';
|
|
96
|
+
export { type CampaignStorage, fsCampaignStorage, inMemoryCampaignStorage, } from '../campaign/storage';
|
|
97
|
+
export { type DeploymentOutcome, FileSystemOutcomeStore, type FileSystemOutcomeStoreOptions, InMemoryOutcomeStore, type OutcomeStore, } from '../meta-eval/outcome-store';
|
|
98
|
+
export type { HostedTenant } from '../hosted/client';
|
|
99
|
+
export { type AgentEvalAgent, type AgentEvalEvaluateOptions, type AgentEvalImproveOptions, type DefineAgentEvalOptions, type DefinedAgentEval, defineAgentEval, } from './define-agent-eval';
|
|
100
|
+
export { type SelfImproveBudget, type SelfImproveLlm, type SelfImproveOptions, type SelfImproveProgressEvent, type SelfImproveResult, selfImprove, } from './self-improve';
|
|
101
|
+
export { buildDefaultAnalystRegistry, type DefaultAnalystRegistryOptions, } from '../analyst/default-registry';
|
|
102
|
+
export type { AnalystFinding } from '../analyst/types';
|
|
103
|
+
export type { AnalyzeRunsOptions } from './analyze-runs';
|
|
104
|
+
export { analyzeRuns } from './analyze-runs';
|
|
105
|
+
export type { FailureClusterInsight, InsightReport, InterRaterInsight, JudgeInsight, LiftInsight, OutcomeCorrelationInsight, Recommendation, ReleaseSummary, ScalarDistribution, } from './insight-report';
|
|
106
|
+
export { diffGenerations, diffRunBaselineToWinner, diffRuns, type EvalCellScoreDelta, type EvalDimensionDelta, type EvalGenerationDiff, type EvalRunDiff, } from './diff';
|
|
107
|
+
export { type AgentTraceContributor, type AgentTraceContributorType, type AgentTraceConversation, type AgentTraceFile, type AgentTraceIndex, type AgentTraceRange, type AgentTraceRecord, type AuthoringProvenance, type CodeAgentSessionDiagnostic, type CodeAgentSessionIntakeOptions, type CodeAgentSessionIntakeResult, type CodeAgentSessionMetrics, type CodeAgentSessionSource, type FeedbackTableMeta, type FeedbackTableRow, type FromFeedbackTableOptions, type FromFeedbackTableResult, type FromOtelSpansOptions, fromClaudeCodeSession, fromCodexSession, fromFeedbackTable, fromKimiCodeSession, fromOpenCodeSession, fromOtelSpans, fromPigraphSession, fromPiSession, type ParsedCodeAgentJsonl, type PartitionByAuthoringModelResult, parseAgentTrace, parseCodeAgentJsonl, partitionRunsByAuthoringModel, } from './intake';
|
|
108
|
+
//# sourceMappingURL=index.d.ts.map
|