@tangle-network/agent-eval 0.95.0 → 0.96.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (968) hide show
  1. package/CHANGELOG.md +17 -0
  2. package/dist/adapters/http.d.ts +17 -10
  3. package/dist/adapters/langchain.d.ts +14 -7
  4. package/dist/adapters/otel.d.ts +25 -13
  5. package/dist/{rl/adversarial.d.ts → adversarial-DIVcDoI_.d.ts} +7 -6
  6. package/dist/analyst/index.d.ts +236 -28
  7. package/dist/analyst/index.js +1 -1
  8. package/dist/{trace-analyst/analyst.d.ts → analyst-C8HHvfJp.d.ts} +14 -12
  9. package/dist/{contract/analyze-runs.d.ts → analyze-runs-DtT6F_6T.d.ts} +10 -9
  10. package/dist/authenticity/index.d.ts +16 -15
  11. package/dist/{baseline.d.ts → baseline-Bbid3WoO.d.ts} +44 -8
  12. package/dist/belief-state/index.d.ts +605 -14
  13. package/dist/benchmarks/index.d.ts +5 -23
  14. package/dist/builder-eval/index.d.ts +250 -5
  15. package/dist/calibration-BPmzuVPk.d.ts +101 -0
  16. package/dist/campaign/index.d.ts +1452 -38
  17. package/dist/{chunk-AQ5WQAIV.js → chunk-3NHEO6ZC.js} +2 -2
  18. package/dist/chunk-3NHEO6ZC.js.map +1 -0
  19. package/dist/cli.d.ts +0 -2
  20. package/dist/{contract/intake/code-agent-session.d.ts → code-agent-session-CPHRCb4-.d.ts} +17 -15
  21. package/dist/contract/index.d.ts +824 -107
  22. package/dist/contract/index.js +145 -1
  23. package/dist/contract/index.js.map +1 -1
  24. package/dist/control-Doncu-B_.d.ts +259 -0
  25. package/dist/{control-runtime.d.ts → control-runtime-Acf9CGhw.d.ts} +26 -23
  26. package/dist/control.d.ts +10 -11
  27. package/dist/corpus-D4YW9UoJ.d.ts +560 -0
  28. package/dist/{cost-ledger.d.ts → cost-ledger-DuSqlw5B.d.ts} +11 -10
  29. package/dist/{counterfactual.d.ts → counterfactual-DlOz8PBx.d.ts} +13 -12
  30. package/dist/{dataset.d.ts → dataset-BbGkaN2I.d.ts} +14 -11
  31. package/dist/{analyst/registry.d.ts → default-registry-GyE8X5SP.d.ts} +37 -8
  32. package/dist/diagnose.d.ts +252 -1
  33. package/dist/{trace/emitter.d.ts → emitter-C2rqGH_l.d.ts} +12 -9
  34. package/dist/{errors.d.ts → errors-CzMUYo7b.d.ts} +11 -10
  35. package/dist/failure-cluster-DH9Flgcf.d.ts +76 -0
  36. package/dist/{feedback-trajectory.d.ts → feedback-trajectory-BxY0cKfs.d.ts} +38 -36
  37. package/dist/fuzz.d.ts +547 -1
  38. package/dist/gepa-Dprxvz8r.d.ts +414 -0
  39. package/dist/governance/index.d.ts +135 -5
  40. package/dist/harness-optimizer-mOl9XX_O.d.ts +106 -0
  41. package/dist/hosted/index.d.ts +239 -10
  42. package/dist/index-_Y4oNOOb.d.ts +159 -0
  43. package/dist/index.d.ts +5660 -277
  44. package/dist/index.js +1 -1
  45. package/dist/{contract/insight-report.d.ts → insight-report-BnRjTibG.d.ts} +19 -16
  46. package/dist/{trace/integrity.d.ts → integrity-D2t12mMw.d.ts} +14 -11
  47. package/dist/{judge-calibration.d.ts → judge-calibration-0p2QcWNE.d.ts} +17 -16
  48. package/dist/{analyst/kind-factory.d.ts → kind-factory-X3eDYbKn.d.ts} +61 -10
  49. package/dist/knowledge/index.d.ts +103 -3
  50. package/dist/{llm-client.d.ts → llm-client-Bj7g0rqu.d.ts} +23 -21
  51. package/dist/matrix/index.d.ts +30 -12
  52. package/dist/meta-eval/index.d.ts +182 -6
  53. package/dist/{multi-layer-verifier.d.ts → multi-layer-verifier-DUZXrPDA.d.ts} +15 -12
  54. package/dist/multishot/index.d.ts +290 -7
  55. package/dist/{rl/off-policy.d.ts → off-policy-DiwuKKg7.d.ts} +9 -8
  56. package/dist/openapi.json +1 -1
  57. package/dist/{meta-eval/outcome-store.d.ts → outcome-store-rnXLEqSn.d.ts} +8 -7
  58. package/dist/{pareto.d.ts → pareto-E-pembql.d.ts} +10 -9
  59. package/dist/perf/index.d.ts +119 -13
  60. package/dist/pipelines/index.d.ts +173 -8
  61. package/dist/pre-registration-nfUdc9EQ.d.ts +483 -0
  62. package/dist/prm/index.d.ts +104 -5
  63. package/dist/provenance-CIxfBnkl.d.ts +426 -0
  64. package/dist/query-B7GGjRox.d.ts +32 -0
  65. package/dist/{trace/raw-provider-sink.d.ts → raw-provider-sink-C46HDghv.d.ts} +14 -13
  66. package/dist/{red-team.d.ts → red-team-BWdoyleI.d.ts} +16 -14
  67. package/dist/{trace/redact.d.ts → redact-B40YG2M_.d.ts} +8 -7
  68. package/dist/release-report-pidWUMZ2.d.ts +233 -0
  69. package/dist/reporting.d.ts +16 -15
  70. package/dist/{eval-campaign.d.ts → researcher-Jr8ME1dZ.d.ts} +156 -34
  71. package/dist/rl.d.ts +1193 -1
  72. package/dist/{prm/rubric.d.ts → rubric-Cc6UHvUb.d.ts} +13 -10
  73. package/dist/{meta-eval/rubric-predictive-validity.d.ts → rubric-predictive-validity-C2hDKM8Z.d.ts} +11 -8
  74. package/dist/run-critic-CmMf05uV.d.ts +56 -0
  75. package/dist/{run-record.d.ts → run-record-CP2ObebC.d.ts} +117 -15
  76. package/dist/runtime-trajectory-BOUUjI0y.d.ts +49 -0
  77. package/dist/{trace/schema.d.ts → schema-m0gsnbt3.d.ts} +30 -29
  78. package/dist/semantic-concept-judge-DSBB2Cfp.d.ts +624 -0
  79. package/dist/{sequential.d.ts → sequential-5iSVfzl2.d.ts} +10 -9
  80. package/dist/{series-convergence.d.ts → series-convergence-D5OWMBg6.d.ts} +5 -4
  81. package/dist/sink-fetch-B1Yg4Til.d.ts +101 -0
  82. package/dist/{statistics.d.ts → statistics-CCJpTGOS.d.ts} +48 -46
  83. package/dist/{trace/store.d.ts → store-BcFXE6LG.d.ts} +12 -21
  84. package/dist/{trace-analyst/types.d.ts → store-C1YxJDEK.d.ts} +74 -18
  85. package/dist/storyboard/index.d.ts +81 -16
  86. package/dist/{summary-report.d.ts → summary-report-CInXwsza.d.ts} +160 -23
  87. package/dist/telemetry/{sink-file.d.ts → file.d.ts} +7 -5
  88. package/dist/telemetry/index.d.ts +35 -17
  89. package/dist/{sandbox-harness.d.ts → test-graded-scenario-DeODGLra.d.ts} +60 -15
  90. package/dist/{locked-jsonl-appender.d.ts → testing-C21CHsq2.d.ts} +4 -3
  91. package/dist/testing.d.ts +1 -5
  92. package/dist/traces.d.ts +976 -4
  93. package/dist/{trajectory.d.ts → trajectory-2TkpSEVh.d.ts} +9 -8
  94. package/dist/{analyst/types.d.ts → types-B5x54y6n.d.ts} +112 -19
  95. package/dist/{campaign/types.d.ts → types-BMahhhio.d.ts} +47 -44
  96. package/dist/{matrix/types.d.ts → types-BUxNaJ8c.d.ts} +11 -9
  97. package/dist/{types.d.ts → types-C7DGg5ex.d.ts} +33 -31
  98. package/dist/{verdict.d.ts → verdict-C9MlYujm.d.ts} +3 -2
  99. package/dist/wire/index.d.ts +570 -13
  100. package/dist/workflow/index.d.ts +496 -22
  101. package/package.json +2 -2
  102. package/dist/action-policy.d.ts +0 -24
  103. package/dist/action-policy.d.ts.map +0 -1
  104. package/dist/action-policy.test.d.ts +0 -2
  105. package/dist/action-policy.test.d.ts.map +0 -1
  106. package/dist/active-learning.d.ts +0 -41
  107. package/dist/active-learning.d.ts.map +0 -1
  108. package/dist/adapters/http.d.ts.map +0 -1
  109. package/dist/adapters/langchain.d.ts.map +0 -1
  110. package/dist/adapters/otel.d.ts.map +0 -1
  111. package/dist/agent-profile-cell.d.ts +0 -101
  112. package/dist/agent-profile-cell.d.ts.map +0 -1
  113. package/dist/agent-profile.d.ts +0 -27
  114. package/dist/agent-profile.d.ts.map +0 -1
  115. package/dist/agent-profile.test.d.ts +0 -2
  116. package/dist/agent-profile.test.d.ts.map +0 -1
  117. package/dist/analyst/adapters.d.ts +0 -62
  118. package/dist/analyst/adapters.d.ts.map +0 -1
  119. package/dist/analyst/analyst.test.d.ts +0 -2
  120. package/dist/analyst/analyst.test.d.ts.map +0 -1
  121. package/dist/analyst/ax-service.d.ts +0 -27
  122. package/dist/analyst/ax-service.d.ts.map +0 -1
  123. package/dist/analyst/behavioral-analyst.d.ts +0 -28
  124. package/dist/analyst/behavioral-analyst.d.ts.map +0 -1
  125. package/dist/analyst/chat-client.d.ts +0 -91
  126. package/dist/analyst/chat-client.d.ts.map +0 -1
  127. package/dist/analyst/default-registry.d.ts +0 -27
  128. package/dist/analyst/default-registry.d.ts.map +0 -1
  129. package/dist/analyst/default-registry.test.d.ts +0 -2
  130. package/dist/analyst/default-registry.test.d.ts.map +0 -1
  131. package/dist/analyst/finding-signature.d.ts +0 -48
  132. package/dist/analyst/finding-signature.d.ts.map +0 -1
  133. package/dist/analyst/finding-subject.d.ts +0 -146
  134. package/dist/analyst/finding-subject.d.ts.map +0 -1
  135. package/dist/analyst/finding-subject.test.d.ts +0 -2
  136. package/dist/analyst/finding-subject.test.d.ts.map +0 -1
  137. package/dist/analyst/findings-store.d.ts +0 -75
  138. package/dist/analyst/findings-store.d.ts.map +0 -1
  139. package/dist/analyst/index.d.ts.map +0 -1
  140. package/dist/analyst/kind-factory.d.ts.map +0 -1
  141. package/dist/analyst/kinds/failure-mode.d.ts +0 -19
  142. package/dist/analyst/kinds/failure-mode.d.ts.map +0 -1
  143. package/dist/analyst/kinds/improvement.d.ts +0 -23
  144. package/dist/analyst/kinds/improvement.d.ts.map +0 -1
  145. package/dist/analyst/kinds/index.d.ts +0 -22
  146. package/dist/analyst/kinds/index.d.ts.map +0 -1
  147. package/dist/analyst/kinds/kinds.test.d.ts +0 -2
  148. package/dist/analyst/kinds/kinds.test.d.ts.map +0 -1
  149. package/dist/analyst/kinds/knowledge-gap.d.ts +0 -28
  150. package/dist/analyst/kinds/knowledge-gap.d.ts.map +0 -1
  151. package/dist/analyst/kinds/knowledge-poisoning.d.ts +0 -22
  152. package/dist/analyst/kinds/knowledge-poisoning.d.ts.map +0 -1
  153. package/dist/analyst/kinds/skill-usage.d.ts +0 -84
  154. package/dist/analyst/kinds/skill-usage.d.ts.map +0 -1
  155. package/dist/analyst/kinds/skill-usage.test.d.ts +0 -2
  156. package/dist/analyst/kinds/skill-usage.test.d.ts.map +0 -1
  157. package/dist/analyst/parse-tolerant.d.ts +0 -26
  158. package/dist/analyst/parse-tolerant.d.ts.map +0 -1
  159. package/dist/analyst/parse-tolerant.test.d.ts +0 -2
  160. package/dist/analyst/parse-tolerant.test.d.ts.map +0 -1
  161. package/dist/analyst/registry.budget.test.d.ts +0 -2
  162. package/dist/analyst/registry.budget.test.d.ts.map +0 -1
  163. package/dist/analyst/registry.d.ts.map +0 -1
  164. package/dist/analyst/steer-firewall.d.ts +0 -35
  165. package/dist/analyst/steer-firewall.d.ts.map +0 -1
  166. package/dist/analyst/steer-firewall.test.d.ts +0 -2
  167. package/dist/analyst/steer-firewall.test.d.ts.map +0 -1
  168. package/dist/analyst/structure-findings.d.ts +0 -37
  169. package/dist/analyst/structure-findings.d.ts.map +0 -1
  170. package/dist/analyst/structure-findings.test.d.ts +0 -2
  171. package/dist/analyst/structure-findings.test.d.ts.map +0 -1
  172. package/dist/analyst/tool-groups.d.ts +0 -34
  173. package/dist/analyst/tool-groups.d.ts.map +0 -1
  174. package/dist/analyst/types.d.ts.map +0 -1
  175. package/dist/anti-slop.d.ts +0 -59
  176. package/dist/anti-slop.d.ts.map +0 -1
  177. package/dist/artifact-validator.d.ts +0 -74
  178. package/dist/artifact-validator.d.ts.map +0 -1
  179. package/dist/attestation.d.ts +0 -63
  180. package/dist/attestation.d.ts.map +0 -1
  181. package/dist/attestation.test.d.ts +0 -2
  182. package/dist/attestation.test.d.ts.map +0 -1
  183. package/dist/authenticity/index.d.ts.map +0 -1
  184. package/dist/authenticity/index.test.d.ts +0 -2
  185. package/dist/authenticity/index.test.d.ts.map +0 -1
  186. package/dist/auto-pr.d.ts +0 -120
  187. package/dist/auto-pr.d.ts.map +0 -1
  188. package/dist/baseline.d.ts.map +0 -1
  189. package/dist/behavior-dsl.d.ts +0 -73
  190. package/dist/behavior-dsl.d.ts.map +0 -1
  191. package/dist/belief-state/calibration.d.ts +0 -10
  192. package/dist/belief-state/calibration.d.ts.map +0 -1
  193. package/dist/belief-state/calibration.test.d.ts +0 -2
  194. package/dist/belief-state/calibration.test.d.ts.map +0 -1
  195. package/dist/belief-state/code-agent-corpus.d.ts +0 -66
  196. package/dist/belief-state/code-agent-corpus.d.ts.map +0 -1
  197. package/dist/belief-state/code-agent-corpus.test.d.ts +0 -2
  198. package/dist/belief-state/code-agent-corpus.test.d.ts.map +0 -1
  199. package/dist/belief-state/code-agent-evidence.d.ts +0 -22
  200. package/dist/belief-state/code-agent-evidence.d.ts.map +0 -1
  201. package/dist/belief-state/code-agent-evidence.test.d.ts +0 -2
  202. package/dist/belief-state/code-agent-evidence.test.d.ts.map +0 -1
  203. package/dist/belief-state/extract.d.ts +0 -7
  204. package/dist/belief-state/extract.d.ts.map +0 -1
  205. package/dist/belief-state/extract.test.d.ts +0 -2
  206. package/dist/belief-state/extract.test.d.ts.map +0 -1
  207. package/dist/belief-state/index.d.ts.map +0 -1
  208. package/dist/belief-state/ope.d.ts +0 -17
  209. package/dist/belief-state/ope.d.ts.map +0 -1
  210. package/dist/belief-state/ope.test.d.ts +0 -2
  211. package/dist/belief-state/ope.test.d.ts.map +0 -1
  212. package/dist/belief-state/phase0-measurement.d.ts +0 -55
  213. package/dist/belief-state/phase0-measurement.d.ts.map +0 -1
  214. package/dist/belief-state/report.d.ts +0 -17
  215. package/dist/belief-state/report.d.ts.map +0 -1
  216. package/dist/belief-state/report.test.d.ts +0 -2
  217. package/dist/belief-state/report.test.d.ts.map +0 -1
  218. package/dist/belief-state/research-evidence.d.ts +0 -23
  219. package/dist/belief-state/research-evidence.d.ts.map +0 -1
  220. package/dist/belief-state/research-evidence.test.d.ts +0 -2
  221. package/dist/belief-state/research-evidence.test.d.ts.map +0 -1
  222. package/dist/belief-state/runtime-benchmark-corpus.d.ts +0 -32
  223. package/dist/belief-state/runtime-benchmark-corpus.d.ts.map +0 -1
  224. package/dist/belief-state/runtime-hooks.d.ts +0 -87
  225. package/dist/belief-state/runtime-hooks.d.ts.map +0 -1
  226. package/dist/belief-state/runtime-hooks.test.d.ts +0 -2
  227. package/dist/belief-state/runtime-hooks.test.d.ts.map +0 -1
  228. package/dist/belief-state/selective.d.ts +0 -15
  229. package/dist/belief-state/selective.d.ts.map +0 -1
  230. package/dist/belief-state/selective.test.d.ts +0 -2
  231. package/dist/belief-state/selective.test.d.ts.map +0 -1
  232. package/dist/belief-state/shadow-probe.d.ts +0 -80
  233. package/dist/belief-state/shadow-probe.d.ts.map +0 -1
  234. package/dist/belief-state/shadow-probe.test.d.ts +0 -2
  235. package/dist/belief-state/shadow-probe.test.d.ts.map +0 -1
  236. package/dist/belief-state/types.d.ts +0 -195
  237. package/dist/belief-state/types.d.ts.map +0 -1
  238. package/dist/belief-state/types.test.d.ts +0 -2
  239. package/dist/belief-state/types.test.d.ts.map +0 -1
  240. package/dist/benchmark.d.ts +0 -14
  241. package/dist/benchmark.d.ts.map +0 -1
  242. package/dist/benchmarks/index.d.ts.map +0 -1
  243. package/dist/benchmarks/routing/dataset.d.ts +0 -34
  244. package/dist/benchmarks/routing/dataset.d.ts.map +0 -1
  245. package/dist/benchmarks/routing/index.d.ts +0 -34
  246. package/dist/benchmarks/routing/index.d.ts.map +0 -1
  247. package/dist/benchmarks/types.d.ts +0 -49
  248. package/dist/benchmarks/types.d.ts.map +0 -1
  249. package/dist/bisector.d.ts +0 -81
  250. package/dist/bisector.d.ts.map +0 -1
  251. package/dist/budget-guard.d.ts +0 -31
  252. package/dist/budget-guard.d.ts.map +0 -1
  253. package/dist/builder-eval/builder-session.d.ts +0 -111
  254. package/dist/builder-eval/builder-session.d.ts.map +0 -1
  255. package/dist/builder-eval/correlation.d.ts +0 -32
  256. package/dist/builder-eval/correlation.d.ts.map +0 -1
  257. package/dist/builder-eval/index.d.ts.map +0 -1
  258. package/dist/builder-eval/project-registry.d.ts +0 -51
  259. package/dist/builder-eval/project-registry.d.ts.map +0 -1
  260. package/dist/builder-eval/three-layer-eval.d.ts +0 -55
  261. package/dist/builder-eval/three-layer-eval.d.ts.map +0 -1
  262. package/dist/campaign/analyst-surface.d.ts +0 -108
  263. package/dist/campaign/analyst-surface.d.ts.map +0 -1
  264. package/dist/campaign/analyst-surface.test.d.ts +0 -2
  265. package/dist/campaign/analyst-surface.test.d.ts.map +0 -1
  266. package/dist/campaign/auto-pr.d.ts +0 -46
  267. package/dist/campaign/auto-pr.d.ts.map +0 -1
  268. package/dist/campaign/distillation/agreement-judge.d.ts +0 -69
  269. package/dist/campaign/distillation/agreement-judge.d.ts.map +0 -1
  270. package/dist/campaign/distillation/cli.d.ts +0 -35
  271. package/dist/campaign/distillation/cli.d.ts.map +0 -1
  272. package/dist/campaign/distillation/distillation.test.d.ts +0 -2
  273. package/dist/campaign/distillation/distillation.test.d.ts.map +0 -1
  274. package/dist/campaign/distillation/gold-scenarios.d.ts +0 -54
  275. package/dist/campaign/distillation/gold-scenarios.d.ts.map +0 -1
  276. package/dist/campaign/distillation/run-distillation.d.ts +0 -119
  277. package/dist/campaign/distillation/run-distillation.d.ts.map +0 -1
  278. package/dist/campaign/gates/compose.d.ts +0 -12
  279. package/dist/campaign/gates/compose.d.ts.map +0 -1
  280. package/dist/campaign/gates/default-production-gate.d.ts +0 -58
  281. package/dist/campaign/gates/default-production-gate.d.ts.map +0 -1
  282. package/dist/campaign/gates/heldout-gate.d.ts +0 -12
  283. package/dist/campaign/gates/heldout-gate.d.ts.map +0 -1
  284. package/dist/campaign/gates/promotion-policy.d.ts +0 -125
  285. package/dist/campaign/gates/promotion-policy.d.ts.map +0 -1
  286. package/dist/campaign/gates/promotion-policy.test.d.ts +0 -2
  287. package/dist/campaign/gates/promotion-policy.test.d.ts.map +0 -1
  288. package/dist/campaign/gates/sequential.d.ts +0 -146
  289. package/dist/campaign/gates/sequential.d.ts.map +0 -1
  290. package/dist/campaign/gates/sequential.test.d.ts +0 -2
  291. package/dist/campaign/gates/sequential.test.d.ts.map +0 -1
  292. package/dist/campaign/gates/statistical-heldout.d.ts +0 -99
  293. package/dist/campaign/gates/statistical-heldout.d.ts.map +0 -1
  294. package/dist/campaign/gates/statistical-heldout.test.d.ts +0 -2
  295. package/dist/campaign/gates/statistical-heldout.test.d.ts.map +0 -1
  296. package/dist/campaign/index.d.ts.map +0 -1
  297. package/dist/campaign/labeled-store/fs-adapter.d.ts +0 -59
  298. package/dist/campaign/labeled-store/fs-adapter.d.ts.map +0 -1
  299. package/dist/campaign/presets/compare-proposers.d.ts +0 -146
  300. package/dist/campaign/presets/compare-proposers.d.ts.map +0 -1
  301. package/dist/campaign/presets/playback.d.ts +0 -120
  302. package/dist/campaign/presets/playback.d.ts.map +0 -1
  303. package/dist/campaign/presets/playback.test.d.ts +0 -2
  304. package/dist/campaign/presets/playback.test.d.ts.map +0 -1
  305. package/dist/campaign/presets/run-eval.d.ts +0 -14
  306. package/dist/campaign/presets/run-eval.d.ts.map +0 -1
  307. package/dist/campaign/presets/run-improvement-loop.d.ts +0 -63
  308. package/dist/campaign/presets/run-improvement-loop.d.ts.map +0 -1
  309. package/dist/campaign/presets/run-improvement-loop.test.d.ts +0 -2
  310. package/dist/campaign/presets/run-improvement-loop.test.d.ts.map +0 -1
  311. package/dist/campaign/presets/run-optimization.d.ts +0 -92
  312. package/dist/campaign/presets/run-optimization.d.ts.map +0 -1
  313. package/dist/campaign/presets/run-profile-matrix.d.ts +0 -151
  314. package/dist/campaign/presets/run-profile-matrix.d.ts.map +0 -1
  315. package/dist/campaign/presets/run-skill-opt.d.ts +0 -96
  316. package/dist/campaign/presets/run-skill-opt.d.ts.map +0 -1
  317. package/dist/campaign/proposers/_findings-text.d.ts +0 -22
  318. package/dist/campaign/proposers/_findings-text.d.ts.map +0 -1
  319. package/dist/campaign/proposers/ace.d.ts +0 -33
  320. package/dist/campaign/proposers/ace.d.ts.map +0 -1
  321. package/dist/campaign/proposers/ace.test.d.ts +0 -2
  322. package/dist/campaign/proposers/ace.test.d.ts.map +0 -1
  323. package/dist/campaign/proposers/analysis-edit.d.ts +0 -32
  324. package/dist/campaign/proposers/analysis-edit.d.ts.map +0 -1
  325. package/dist/campaign/proposers/evolutionary.d.ts +0 -20
  326. package/dist/campaign/proposers/evolutionary.d.ts.map +0 -1
  327. package/dist/campaign/proposers/fapo.d.ts +0 -120
  328. package/dist/campaign/proposers/fapo.d.ts.map +0 -1
  329. package/dist/campaign/proposers/gepa.d.ts +0 -86
  330. package/dist/campaign/proposers/gepa.d.ts.map +0 -1
  331. package/dist/campaign/proposers/halo.d.ts +0 -44
  332. package/dist/campaign/proposers/halo.d.ts.map +0 -1
  333. package/dist/campaign/proposers/halo.test.d.ts +0 -2
  334. package/dist/campaign/proposers/halo.test.d.ts.map +0 -1
  335. package/dist/campaign/proposers/memory.d.ts +0 -47
  336. package/dist/campaign/proposers/memory.d.ts.map +0 -1
  337. package/dist/campaign/proposers/memory.test.d.ts +0 -2
  338. package/dist/campaign/proposers/memory.test.d.ts.map +0 -1
  339. package/dist/campaign/proposers/skill-opt.d.ts +0 -88
  340. package/dist/campaign/proposers/skill-opt.d.ts.map +0 -1
  341. package/dist/campaign/proposers/trace-analyst.d.ts +0 -48
  342. package/dist/campaign/proposers/trace-analyst.d.ts.map +0 -1
  343. package/dist/campaign/proposers/trace-analyst.test.d.ts +0 -2
  344. package/dist/campaign/proposers/trace-analyst.test.d.ts.map +0 -1
  345. package/dist/campaign/provenance.d.ts +0 -185
  346. package/dist/campaign/provenance.d.ts.map +0 -1
  347. package/dist/campaign/run-campaign.d.ts +0 -90
  348. package/dist/campaign/run-campaign.d.ts.map +0 -1
  349. package/dist/campaign/score-utils.d.ts +0 -26
  350. package/dist/campaign/score-utils.d.ts.map +0 -1
  351. package/dist/campaign/skill-patch.d.ts +0 -62
  352. package/dist/campaign/skill-patch.d.ts.map +0 -1
  353. package/dist/campaign/storage.d.ts +0 -38
  354. package/dist/campaign/storage.d.ts.map +0 -1
  355. package/dist/campaign/types.d.ts.map +0 -1
  356. package/dist/campaign/worktree/index.d.ts +0 -53
  357. package/dist/campaign/worktree/index.d.ts.map +0 -1
  358. package/dist/canary.d.ts +0 -101
  359. package/dist/canary.d.ts.map +0 -1
  360. package/dist/causal-attribution.d.ts +0 -45
  361. package/dist/causal-attribution.d.ts.map +0 -1
  362. package/dist/chunk-AQ5WQAIV.js.map +0 -1
  363. package/dist/ci-gate.d.ts +0 -44
  364. package/dist/ci-gate.d.ts.map +0 -1
  365. package/dist/cli.d.ts.map +0 -1
  366. package/dist/client.d.ts +0 -77
  367. package/dist/client.d.ts.map +0 -1
  368. package/dist/client.test.d.ts +0 -2
  369. package/dist/client.test.d.ts.map +0 -1
  370. package/dist/command-runner.d.ts +0 -74
  371. package/dist/command-runner.d.ts.map +0 -1
  372. package/dist/command-runner.test.d.ts +0 -2
  373. package/dist/command-runner.test.d.ts.map +0 -1
  374. package/dist/completion-verifier.d.ts +0 -147
  375. package/dist/completion-verifier.d.ts.map +0 -1
  376. package/dist/completion-verifier.test.d.ts +0 -9
  377. package/dist/completion-verifier.test.d.ts.map +0 -1
  378. package/dist/concurrency.d.ts +0 -23
  379. package/dist/concurrency.d.ts.map +0 -1
  380. package/dist/contamination-guard.d.ts +0 -81
  381. package/dist/contamination-guard.d.ts.map +0 -1
  382. package/dist/contract/analyze-runs.d.ts.map +0 -1
  383. package/dist/contract/define-agent-eval.d.ts +0 -52
  384. package/dist/contract/define-agent-eval.d.ts.map +0 -1
  385. package/dist/contract/diff.d.ts +0 -114
  386. package/dist/contract/diff.d.ts.map +0 -1
  387. package/dist/contract/index.d.ts.map +0 -1
  388. package/dist/contract/insight-report.d.ts.map +0 -1
  389. package/dist/contract/insight-types-fwd.d.ts +0 -7
  390. package/dist/contract/insight-types-fwd.d.ts.map +0 -1
  391. package/dist/contract/intake/agent-trace.d.ts +0 -97
  392. package/dist/contract/intake/agent-trace.d.ts.map +0 -1
  393. package/dist/contract/intake/code-agent-session.d.ts.map +0 -1
  394. package/dist/contract/intake/feedback-table.d.ts +0 -87
  395. package/dist/contract/intake/feedback-table.d.ts.map +0 -1
  396. package/dist/contract/intake/index.d.ts +0 -22
  397. package/dist/contract/intake/index.d.ts.map +0 -1
  398. package/dist/contract/intake/otel-spans.d.ts +0 -33
  399. package/dist/contract/intake/otel-spans.d.ts.map +0 -1
  400. package/dist/contract/self-improve.d.ts +0 -284
  401. package/dist/contract/self-improve.d.ts.map +0 -1
  402. package/dist/control-runtime.d.ts.map +0 -1
  403. package/dist/control-runtime.test.d.ts +0 -2
  404. package/dist/control-runtime.test.d.ts.map +0 -1
  405. package/dist/control.d.ts.map +0 -1
  406. package/dist/convergence.d.ts +0 -29
  407. package/dist/convergence.d.ts.map +0 -1
  408. package/dist/cost-ledger.d.ts.map +0 -1
  409. package/dist/cost-ledger.test.d.ts +0 -2
  410. package/dist/cost-ledger.test.d.ts.map +0 -1
  411. package/dist/cost-report.d.ts +0 -43
  412. package/dist/cost-report.d.ts.map +0 -1
  413. package/dist/cost-report.test.d.ts +0 -2
  414. package/dist/cost-report.test.d.ts.map +0 -1
  415. package/dist/cost-tracker.d.ts +0 -76
  416. package/dist/cost-tracker.d.ts.map +0 -1
  417. package/dist/counterfactual.d.ts.map +0 -1
  418. package/dist/cross-trace-diff.d.ts +0 -56
  419. package/dist/cross-trace-diff.d.ts.map +0 -1
  420. package/dist/dataset.d.ts.map +0 -1
  421. package/dist/deploy-gate-layer.d.ts +0 -125
  422. package/dist/deploy-gate-layer.d.ts.map +0 -1
  423. package/dist/deploy-gate-layer.test.d.ts +0 -2
  424. package/dist/deploy-gate-layer.test.d.ts.map +0 -1
  425. package/dist/description-length-gate.d.ts +0 -119
  426. package/dist/description-length-gate.d.ts.map +0 -1
  427. package/dist/detectors/edge.test.d.ts +0 -2
  428. package/dist/detectors/edge.test.d.ts.map +0 -1
  429. package/dist/detectors/index.d.ts +0 -81
  430. package/dist/detectors/index.d.ts.map +0 -1
  431. package/dist/detectors/index.test.d.ts +0 -2
  432. package/dist/detectors/index.test.d.ts.map +0 -1
  433. package/dist/diagnose/causal-sweep.d.ts +0 -100
  434. package/dist/diagnose/causal-sweep.d.ts.map +0 -1
  435. package/dist/diagnose/index.d.ts +0 -36
  436. package/dist/diagnose/index.d.ts.map +0 -1
  437. package/dist/diagnose/remediation.d.ts +0 -68
  438. package/dist/diagnose/remediation.d.ts.map +0 -1
  439. package/dist/diagnose/repair.d.ts +0 -77
  440. package/dist/diagnose/repair.d.ts.map +0 -1
  441. package/dist/discover-personas.d.ts +0 -35
  442. package/dist/discover-personas.d.ts.map +0 -1
  443. package/dist/driver.d.ts +0 -95
  444. package/dist/driver.d.ts.map +0 -1
  445. package/dist/driver.test.d.ts +0 -8
  446. package/dist/driver.test.d.ts.map +0 -1
  447. package/dist/dual-agent-bench.d.ts +0 -81
  448. package/dist/dual-agent-bench.d.ts.map +0 -1
  449. package/dist/error-count-extractor.d.ts +0 -47
  450. package/dist/error-count-extractor.d.ts.map +0 -1
  451. package/dist/error-count-extractor.test.d.ts +0 -2
  452. package/dist/error-count-extractor.test.d.ts.map +0 -1
  453. package/dist/errors.d.ts.map +0 -1
  454. package/dist/eval-campaign.d.ts.map +0 -1
  455. package/dist/eval-campaign.test.d.ts +0 -2
  456. package/dist/eval-campaign.test.d.ts.map +0 -1
  457. package/dist/eval-tools.d.ts +0 -55
  458. package/dist/eval-tools.d.ts.map +0 -1
  459. package/dist/eval-trace-store.d.ts +0 -107
  460. package/dist/eval-trace-store.d.ts.map +0 -1
  461. package/dist/eval-trace-store.test.d.ts +0 -2
  462. package/dist/eval-trace-store.test.d.ts.map +0 -1
  463. package/dist/executor.d.ts +0 -38
  464. package/dist/executor.d.ts.map +0 -1
  465. package/dist/executor.test.d.ts +0 -10
  466. package/dist/executor.test.d.ts.map +0 -1
  467. package/dist/experiment-tracker.d.ts +0 -178
  468. package/dist/experiment-tracker.d.ts.map +0 -1
  469. package/dist/experiment-tracker.test.d.ts +0 -2
  470. package/dist/experiment-tracker.test.d.ts.map +0 -1
  471. package/dist/failure-taxonomy.d.ts +0 -38
  472. package/dist/failure-taxonomy.d.ts.map +0 -1
  473. package/dist/feedback-trajectory.d.ts.map +0 -1
  474. package/dist/feedback-trajectory.test.d.ts +0 -2
  475. package/dist/feedback-trajectory.test.d.ts.map +0 -1
  476. package/dist/flow-layer.d.ts +0 -90
  477. package/dist/flow-layer.d.ts.map +0 -1
  478. package/dist/flow-layer.test.d.ts +0 -2
  479. package/dist/flow-layer.test.d.ts.map +0 -1
  480. package/dist/fuzz/capsule.d.ts +0 -46
  481. package/dist/fuzz/capsule.d.ts.map +0 -1
  482. package/dist/fuzz/cube.d.ts +0 -36
  483. package/dist/fuzz/cube.d.ts.map +0 -1
  484. package/dist/fuzz/explorer-cost.test.d.ts +0 -2
  485. package/dist/fuzz/explorer-cost.test.d.ts.map +0 -1
  486. package/dist/fuzz/explorer.d.ts +0 -64
  487. package/dist/fuzz/explorer.d.ts.map +0 -1
  488. package/dist/fuzz/fuzz-agent.d.ts +0 -16
  489. package/dist/fuzz/fuzz-agent.d.ts.map +0 -1
  490. package/dist/fuzz/fuzz-agent.test.d.ts +0 -2
  491. package/dist/fuzz/fuzz-agent.test.d.ts.map +0 -1
  492. package/dist/fuzz/gates.d.ts +0 -33
  493. package/dist/fuzz/gates.d.ts.map +0 -1
  494. package/dist/fuzz/index.d.ts +0 -26
  495. package/dist/fuzz/index.d.ts.map +0 -1
  496. package/dist/fuzz/policies.d.ts +0 -28
  497. package/dist/fuzz/policies.d.ts.map +0 -1
  498. package/dist/fuzz/tools.d.ts +0 -20
  499. package/dist/fuzz/tools.d.ts.map +0 -1
  500. package/dist/fuzz/types.d.ts +0 -307
  501. package/dist/fuzz/types.d.ts.map +0 -1
  502. package/dist/golden-matcher.d.ts +0 -71
  503. package/dist/golden-matcher.d.ts.map +0 -1
  504. package/dist/governance/eu-ai-act.d.ts +0 -37
  505. package/dist/governance/eu-ai-act.d.ts.map +0 -1
  506. package/dist/governance/index.d.ts.map +0 -1
  507. package/dist/governance/nist-ai-rmf.d.ts +0 -15
  508. package/dist/governance/nist-ai-rmf.d.ts.map +0 -1
  509. package/dist/governance/soc2.d.ts +0 -12
  510. package/dist/governance/soc2.d.ts.map +0 -1
  511. package/dist/governance/types.d.ts +0 -66
  512. package/dist/governance/types.d.ts.map +0 -1
  513. package/dist/harness-optimizer.d.ts +0 -82
  514. package/dist/harness-optimizer.d.ts.map +0 -1
  515. package/dist/held-out-gate.d.ts +0 -135
  516. package/dist/held-out-gate.d.ts.map +0 -1
  517. package/dist/hosted/client.d.ts +0 -73
  518. package/dist/hosted/client.d.ts.map +0 -1
  519. package/dist/hosted/from-env.test.d.ts +0 -8
  520. package/dist/hosted/from-env.test.d.ts.map +0 -1
  521. package/dist/hosted/index.d.ts.map +0 -1
  522. package/dist/hosted/types.d.ts +0 -159
  523. package/dist/hosted/types.d.ts.map +0 -1
  524. package/dist/index.d.ts.map +0 -1
  525. package/dist/integrity/backend-integrity.d.ts +0 -71
  526. package/dist/integrity/backend-integrity.d.ts.map +0 -1
  527. package/dist/integrity/preflight.d.ts +0 -72
  528. package/dist/integrity/preflight.d.ts.map +0 -1
  529. package/dist/integrity/preflight.test.d.ts +0 -2
  530. package/dist/integrity/preflight.test.d.ts.map +0 -1
  531. package/dist/integrity/single-backend.d.ts +0 -67
  532. package/dist/integrity/single-backend.d.ts.map +0 -1
  533. package/dist/intent-match-judge.d.ts +0 -69
  534. package/dist/intent-match-judge.d.ts.map +0 -1
  535. package/dist/intent-match-judge.test.d.ts +0 -2
  536. package/dist/intent-match-judge.test.d.ts.map +0 -1
  537. package/dist/judge-calibration.d.ts.map +0 -1
  538. package/dist/judge-ensemble.d.ts +0 -66
  539. package/dist/judge-ensemble.d.ts.map +0 -1
  540. package/dist/judge-ensemble.test.d.ts +0 -8
  541. package/dist/judge-ensemble.test.d.ts.map +0 -1
  542. package/dist/judge-families.d.ts +0 -38
  543. package/dist/judge-families.d.ts.map +0 -1
  544. package/dist/judge-panel.d.ts +0 -65
  545. package/dist/judge-panel.d.ts.map +0 -1
  546. package/dist/judge-retry.d.ts +0 -70
  547. package/dist/judge-retry.d.ts.map +0 -1
  548. package/dist/judge-runner.d.ts +0 -36
  549. package/dist/judge-runner.d.ts.map +0 -1
  550. package/dist/judge-runner.test.d.ts +0 -2
  551. package/dist/judge-runner.test.d.ts.map +0 -1
  552. package/dist/judges.d.ts +0 -74
  553. package/dist/judges.d.ts.map +0 -1
  554. package/dist/keyword-coverage-judge.d.ts +0 -89
  555. package/dist/keyword-coverage-judge.d.ts.map +0 -1
  556. package/dist/keyword-coverage-judge.test.d.ts +0 -2
  557. package/dist/keyword-coverage-judge.test.d.ts.map +0 -1
  558. package/dist/knowledge/index.d.ts.map +0 -1
  559. package/dist/knowledge/readiness.d.ts +0 -26
  560. package/dist/knowledge/readiness.d.ts.map +0 -1
  561. package/dist/knowledge/types.d.ts +0 -75
  562. package/dist/knowledge/types.d.ts.map +0 -1
  563. package/dist/live-proof.d.ts +0 -62
  564. package/dist/live-proof.d.ts.map +0 -1
  565. package/dist/llm-client.d.ts.map +0 -1
  566. package/dist/llm-client.test.d.ts +0 -2
  567. package/dist/llm-client.test.d.ts.map +0 -1
  568. package/dist/locked-jsonl-appender.d.ts.map +0 -1
  569. package/dist/matrix/aggregation.d.ts +0 -16
  570. package/dist/matrix/aggregation.d.ts.map +0 -1
  571. package/dist/matrix/index.d.ts.map +0 -1
  572. package/dist/matrix/runner.d.ts +0 -15
  573. package/dist/matrix/runner.d.ts.map +0 -1
  574. package/dist/matrix/types.d.ts.map +0 -1
  575. package/dist/meta-eval/calibration.d.ts +0 -47
  576. package/dist/meta-eval/calibration.d.ts.map +0 -1
  577. package/dist/meta-eval/correlation-study.d.ts +0 -53
  578. package/dist/meta-eval/correlation-study.d.ts.map +0 -1
  579. package/dist/meta-eval/index.d.ts.map +0 -1
  580. package/dist/meta-eval/outcome-store.d.ts.map +0 -1
  581. package/dist/meta-eval/rubric-predictive-validity.d.ts.map +0 -1
  582. package/dist/meta-eval/sentinel.d.ts +0 -169
  583. package/dist/meta-eval/sentinel.d.ts.map +0 -1
  584. package/dist/metrics.d.ts +0 -63
  585. package/dist/metrics.d.ts.map +0 -1
  586. package/dist/model-seats.d.ts +0 -71
  587. package/dist/model-seats.d.ts.map +0 -1
  588. package/dist/model-seats.test.d.ts +0 -2
  589. package/dist/model-seats.test.d.ts.map +0 -1
  590. package/dist/muffled-gate-scanner.d.ts +0 -102
  591. package/dist/muffled-gate-scanner.d.ts.map +0 -1
  592. package/dist/multi-layer-verifier.d.ts.map +0 -1
  593. package/dist/multi-layer-verifier.test.d.ts +0 -2
  594. package/dist/multi-layer-verifier.test.d.ts.map +0 -1
  595. package/dist/multi-toolchain-layer.d.ts +0 -80
  596. package/dist/multi-toolchain-layer.d.ts.map +0 -1
  597. package/dist/multi-toolchain-layer.test.d.ts +0 -2
  598. package/dist/multi-toolchain-layer.test.d.ts.map +0 -1
  599. package/dist/multishot/default-tools.d.ts +0 -34
  600. package/dist/multishot/default-tools.d.ts.map +0 -1
  601. package/dist/multishot/index.d.ts.map +0 -1
  602. package/dist/multishot/judges.d.ts +0 -32
  603. package/dist/multishot/judges.d.ts.map +0 -1
  604. package/dist/multishot/matrix.d.ts +0 -107
  605. package/dist/multishot/matrix.d.ts.map +0 -1
  606. package/dist/multishot/multishot.d.ts +0 -23
  607. package/dist/multishot/multishot.d.ts.map +0 -1
  608. package/dist/multishot/router.d.ts +0 -37
  609. package/dist/multishot/router.d.ts.map +0 -1
  610. package/dist/multishot/types.d.ts +0 -60
  611. package/dist/multishot/types.d.ts.map +0 -1
  612. package/dist/observability.d.ts +0 -71
  613. package/dist/observability.d.ts.map +0 -1
  614. package/dist/oracle.d.ts +0 -55
  615. package/dist/oracle.d.ts.map +0 -1
  616. package/dist/orthogonality.d.ts +0 -35
  617. package/dist/orthogonality.d.ts.map +0 -1
  618. package/dist/otel-pipeline.d.ts +0 -31
  619. package/dist/otel-pipeline.d.ts.map +0 -1
  620. package/dist/paraphrase.d.ts +0 -107
  621. package/dist/paraphrase.d.ts.map +0 -1
  622. package/dist/pareto.d.ts.map +0 -1
  623. package/dist/partition-held-out.d.ts +0 -70
  624. package/dist/partition-held-out.d.ts.map +0 -1
  625. package/dist/partition-held-out.test.d.ts +0 -2
  626. package/dist/partition-held-out.test.d.ts.map +0 -1
  627. package/dist/perf/index.d.ts.map +0 -1
  628. package/dist/perf/integrity.d.ts +0 -30
  629. package/dist/perf/integrity.d.ts.map +0 -1
  630. package/dist/perf/journey.d.ts +0 -45
  631. package/dist/perf/journey.d.ts.map +0 -1
  632. package/dist/perf/ratchet.d.ts +0 -47
  633. package/dist/perf/ratchet.d.ts.map +0 -1
  634. package/dist/pipelines/budget-breach.d.ts +0 -31
  635. package/dist/pipelines/budget-breach.d.ts.map +0 -1
  636. package/dist/pipelines/budget-breach.test.d.ts +0 -2
  637. package/dist/pipelines/budget-breach.test.d.ts.map +0 -1
  638. package/dist/pipelines/failure-cluster.d.ts +0 -38
  639. package/dist/pipelines/failure-cluster.d.ts.map +0 -1
  640. package/dist/pipelines/failure-cluster.test.d.ts +0 -2
  641. package/dist/pipelines/failure-cluster.test.d.ts.map +0 -1
  642. package/dist/pipelines/first-divergence.d.ts +0 -26
  643. package/dist/pipelines/first-divergence.d.ts.map +0 -1
  644. package/dist/pipelines/first-divergence.test.d.ts +0 -2
  645. package/dist/pipelines/first-divergence.test.d.ts.map +0 -1
  646. package/dist/pipelines/index.d.ts.map +0 -1
  647. package/dist/pipelines/judge-agreement.d.ts +0 -26
  648. package/dist/pipelines/judge-agreement.d.ts.map +0 -1
  649. package/dist/pipelines/judge-agreement.test.d.ts +0 -2
  650. package/dist/pipelines/judge-agreement.test.d.ts.map +0 -1
  651. package/dist/pipelines/regression.d.ts +0 -23
  652. package/dist/pipelines/regression.d.ts.map +0 -1
  653. package/dist/pipelines/regression.test.d.ts +0 -2
  654. package/dist/pipelines/regression.test.d.ts.map +0 -1
  655. package/dist/pipelines/stuck-loop.d.ts +0 -32
  656. package/dist/pipelines/stuck-loop.d.ts.map +0 -1
  657. package/dist/pipelines/stuck-loop.test.d.ts +0 -2
  658. package/dist/pipelines/stuck-loop.test.d.ts.map +0 -1
  659. package/dist/pipelines/tool-waste.d.ts +0 -34
  660. package/dist/pipelines/tool-waste.d.ts.map +0 -1
  661. package/dist/pipelines/tool-waste.test.d.ts +0 -2
  662. package/dist/pipelines/tool-waste.test.d.ts.map +0 -1
  663. package/dist/playbook.d.ts +0 -16
  664. package/dist/playbook.d.ts.map +0 -1
  665. package/dist/pr-review-benchmark.d.ts +0 -88
  666. package/dist/pr-review-benchmark.d.ts.map +0 -1
  667. package/dist/pr-review-benchmark.test.d.ts +0 -2
  668. package/dist/pr-review-benchmark.test.d.ts.map +0 -1
  669. package/dist/pre-registration.d.ts +0 -125
  670. package/dist/pre-registration.d.ts.map +0 -1
  671. package/dist/prm/builtin-rubrics.d.ts +0 -33
  672. package/dist/prm/builtin-rubrics.d.ts.map +0 -1
  673. package/dist/prm/index.d.ts.map +0 -1
  674. package/dist/prm/inference.d.ts +0 -29
  675. package/dist/prm/inference.d.ts.map +0 -1
  676. package/dist/prm/inference.test.d.ts +0 -2
  677. package/dist/prm/inference.test.d.ts.map +0 -1
  678. package/dist/prm/rubric.d.ts.map +0 -1
  679. package/dist/prm/training-export.d.ts +0 -38
  680. package/dist/prm/training-export.d.ts.map +0 -1
  681. package/dist/produced-state.d.ts +0 -63
  682. package/dist/produced-state.d.ts.map +0 -1
  683. package/dist/produced-state.test.d.ts +0 -8
  684. package/dist/produced-state.test.d.ts.map +0 -1
  685. package/dist/profile/baselines.d.ts +0 -37
  686. package/dist/profile/baselines.d.ts.map +0 -1
  687. package/dist/profile/index.d.ts +0 -105
  688. package/dist/profile/index.d.ts.map +0 -1
  689. package/dist/promotion-gate.d.ts +0 -93
  690. package/dist/promotion-gate.d.ts.map +0 -1
  691. package/dist/prompt-registry.d.ts +0 -41
  692. package/dist/prompt-registry.d.ts.map +0 -1
  693. package/dist/propose-review-control.d.ts +0 -49
  694. package/dist/propose-review-control.d.ts.map +0 -1
  695. package/dist/propose-review-control.test.d.ts +0 -2
  696. package/dist/propose-review-control.test.d.ts.map +0 -1
  697. package/dist/propose-review.d.ts +0 -155
  698. package/dist/propose-review.d.ts.map +0 -1
  699. package/dist/red-team.d.ts.map +0 -1
  700. package/dist/reference-replay-steering.d.ts +0 -11
  701. package/dist/reference-replay-steering.d.ts.map +0 -1
  702. package/dist/reference-replay.d.ts +0 -176
  703. package/dist/reference-replay.d.ts.map +0 -1
  704. package/dist/reflective-mutation.d.ts +0 -79
  705. package/dist/reflective-mutation.d.ts.map +0 -1
  706. package/dist/registry.d.ts +0 -31
  707. package/dist/registry.d.ts.map +0 -1
  708. package/dist/release-confidence.d.ts +0 -128
  709. package/dist/release-confidence.d.ts.map +0 -1
  710. package/dist/release-report.d.ts +0 -11
  711. package/dist/release-report.d.ts.map +0 -1
  712. package/dist/replay.d.ts +0 -120
  713. package/dist/replay.d.ts.map +0 -1
  714. package/dist/reporter.d.ts +0 -14
  715. package/dist/reporter.d.ts.map +0 -1
  716. package/dist/reporting.d.ts.map +0 -1
  717. package/dist/researcher.d.ts +0 -140
  718. package/dist/researcher.d.ts.map +0 -1
  719. package/dist/reviewer.d.ts +0 -118
  720. package/dist/reviewer.d.ts.map +0 -1
  721. package/dist/reviewer.test.d.ts +0 -2
  722. package/dist/reviewer.test.d.ts.map +0 -1
  723. package/dist/reward-model-export.d.ts +0 -60
  724. package/dist/reward-model-export.d.ts.map +0 -1
  725. package/dist/rl/active-curriculum.d.ts +0 -110
  726. package/dist/rl/active-curriculum.d.ts.map +0 -1
  727. package/dist/rl/adaptation-eval.d.ts +0 -109
  728. package/dist/rl/adaptation-eval.d.ts.map +0 -1
  729. package/dist/rl/adversarial.d.ts.map +0 -1
  730. package/dist/rl/compute-curves.d.ts +0 -127
  731. package/dist/rl/compute-curves.d.ts.map +0 -1
  732. package/dist/rl/contamination.d.ts +0 -117
  733. package/dist/rl/contamination.d.ts.map +0 -1
  734. package/dist/rl/corpus.d.ts +0 -55
  735. package/dist/rl/corpus.d.ts.map +0 -1
  736. package/dist/rl/corpus.test.d.ts +0 -2
  737. package/dist/rl/corpus.test.d.ts.map +0 -1
  738. package/dist/rl/dataset.d.ts +0 -102
  739. package/dist/rl/dataset.d.ts.map +0 -1
  740. package/dist/rl/dataset.test.d.ts +0 -2
  741. package/dist/rl/dataset.test.d.ts.map +0 -1
  742. package/dist/rl/exporters.d.ts +0 -141
  743. package/dist/rl/exporters.d.ts.map +0 -1
  744. package/dist/rl/index.d.ts +0 -49
  745. package/dist/rl/index.d.ts.map +0 -1
  746. package/dist/rl/off-policy.d.ts.map +0 -1
  747. package/dist/rl/predictive-validity-researcher.d.ts +0 -69
  748. package/dist/rl/predictive-validity-researcher.d.ts.map +0 -1
  749. package/dist/rl/preferences.d.ts +0 -141
  750. package/dist/rl/preferences.d.ts.map +0 -1
  751. package/dist/rl/process-reward.d.ts +0 -122
  752. package/dist/rl/process-reward.d.ts.map +0 -1
  753. package/dist/rl/reward-hacking.d.ts +0 -104
  754. package/dist/rl/reward-hacking.d.ts.map +0 -1
  755. package/dist/rl/rl-campaign.d.ts +0 -85
  756. package/dist/rl/rl-campaign.d.ts.map +0 -1
  757. package/dist/rl/run-record-adapters.d.ts +0 -56
  758. package/dist/rl/run-record-adapters.d.ts.map +0 -1
  759. package/dist/rl/sim-fidelity.d.ts +0 -166
  760. package/dist/rl/sim-fidelity.d.ts.map +0 -1
  761. package/dist/rl/sim-fidelity.test.d.ts +0 -2
  762. package/dist/rl/sim-fidelity.test.d.ts.map +0 -1
  763. package/dist/rl/tournament.d.ts +0 -115
  764. package/dist/rl/tournament.d.ts.map +0 -1
  765. package/dist/rl/verifiable-reward.d.ts +0 -124
  766. package/dist/rl/verifiable-reward.d.ts.map +0 -1
  767. package/dist/run-critic.d.ts +0 -23
  768. package/dist/run-critic.d.ts.map +0 -1
  769. package/dist/run-evidence.d.ts +0 -32
  770. package/dist/run-evidence.d.ts.map +0 -1
  771. package/dist/run-record.d.ts.map +0 -1
  772. package/dist/run-record.test.d.ts +0 -2
  773. package/dist/run-record.test.d.ts.map +0 -1
  774. package/dist/run-score.d.ts +0 -31
  775. package/dist/run-score.d.ts.map +0 -1
  776. package/dist/runtime-trajectory.d.ts +0 -47
  777. package/dist/runtime-trajectory.d.ts.map +0 -1
  778. package/dist/sandbox-harness.d.ts.map +0 -1
  779. package/dist/sandbox-harness.test.d.ts +0 -2
  780. package/dist/sandbox-harness.test.d.ts.map +0 -1
  781. package/dist/sandbox-pool.d.ts +0 -74
  782. package/dist/sandbox-pool.d.ts.map +0 -1
  783. package/dist/sandbox-pool.test.d.ts +0 -2
  784. package/dist/sandbox-pool.test.d.ts.map +0 -1
  785. package/dist/scorecard.d.ts +0 -133
  786. package/dist/scorecard.d.ts.map +0 -1
  787. package/dist/scorecard.test.d.ts +0 -2
  788. package/dist/scorecard.test.d.ts.map +0 -1
  789. package/dist/self-play.d.ts +0 -69
  790. package/dist/self-play.d.ts.map +0 -1
  791. package/dist/semantic-concept-judge.d.ts +0 -135
  792. package/dist/semantic-concept-judge.d.ts.map +0 -1
  793. package/dist/semantic-concept-judge.test.d.ts +0 -2
  794. package/dist/semantic-concept-judge.test.d.ts.map +0 -1
  795. package/dist/sequential.d.ts.map +0 -1
  796. package/dist/series-convergence.d.ts.map +0 -1
  797. package/dist/slo.d.ts +0 -48
  798. package/dist/slo.d.ts.map +0 -1
  799. package/dist/state-continuity.d.ts +0 -47
  800. package/dist/state-continuity.d.ts.map +0 -1
  801. package/dist/statistics.d.ts.map +0 -1
  802. package/dist/statistics.test.d.ts +0 -2
  803. package/dist/statistics.test.d.ts.map +0 -1
  804. package/dist/steering-optimizer.d.ts +0 -58
  805. package/dist/steering-optimizer.d.ts.map +0 -1
  806. package/dist/steering.d.ts +0 -24
  807. package/dist/steering.d.ts.map +0 -1
  808. package/dist/storyboard/code-edit.d.ts +0 -64
  809. package/dist/storyboard/code-edit.d.ts.map +0 -1
  810. package/dist/storyboard/code-edit.test.d.ts +0 -2
  811. package/dist/storyboard/code-edit.test.d.ts.map +0 -1
  812. package/dist/storyboard/index.d.ts.map +0 -1
  813. package/dist/storyboard/index.test.d.ts +0 -2
  814. package/dist/storyboard/index.test.d.ts.map +0 -1
  815. package/dist/summary-report.d.ts.map +0 -1
  816. package/dist/telemetry/client.d.ts +0 -35
  817. package/dist/telemetry/client.d.ts.map +0 -1
  818. package/dist/telemetry/index.d.ts.map +0 -1
  819. package/dist/telemetry/schema.d.ts +0 -61
  820. package/dist/telemetry/schema.d.ts.map +0 -1
  821. package/dist/telemetry/sink-fetch.d.ts +0 -39
  822. package/dist/telemetry/sink-fetch.d.ts.map +0 -1
  823. package/dist/telemetry/sink-file.d.ts.map +0 -1
  824. package/dist/test-graded-scenario.d.ts +0 -42
  825. package/dist/test-graded-scenario.d.ts.map +0 -1
  826. package/dist/testing.d.ts.map +0 -1
  827. package/dist/tool-use-metrics.d.ts +0 -35
  828. package/dist/tool-use-metrics.d.ts.map +0 -1
  829. package/dist/trace/capture-fetch.d.ts +0 -48
  830. package/dist/trace/capture-fetch.d.ts.map +0 -1
  831. package/dist/trace/capture-fetch.test.d.ts +0 -2
  832. package/dist/trace/capture-fetch.test.d.ts.map +0 -1
  833. package/dist/trace/emitter.d.ts.map +0 -1
  834. package/dist/trace/extract-usage.d.ts +0 -46
  835. package/dist/trace/extract-usage.d.ts.map +0 -1
  836. package/dist/trace/extract-usage.test.d.ts +0 -2
  837. package/dist/trace/extract-usage.test.d.ts.map +0 -1
  838. package/dist/trace/index.d.ts +0 -15
  839. package/dist/trace/index.d.ts.map +0 -1
  840. package/dist/trace/integrity.d.ts.map +0 -1
  841. package/dist/trace/otel-bridge.d.ts +0 -29
  842. package/dist/trace/otel-bridge.d.ts.map +0 -1
  843. package/dist/trace/otel-export.d.ts +0 -52
  844. package/dist/trace/otel-export.d.ts.map +0 -1
  845. package/dist/trace/otel.d.ts +0 -57
  846. package/dist/trace/otel.d.ts.map +0 -1
  847. package/dist/trace/otlp-attributes.d.ts +0 -17
  848. package/dist/trace/otlp-attributes.d.ts.map +0 -1
  849. package/dist/trace/query.d.ts +0 -29
  850. package/dist/trace/query.d.ts.map +0 -1
  851. package/dist/trace/query.test.d.ts +0 -2
  852. package/dist/trace/query.test.d.ts.map +0 -1
  853. package/dist/trace/raw-provider-sink.d.ts.map +0 -1
  854. package/dist/trace/redact.d.ts.map +0 -1
  855. package/dist/trace/schema.d.ts.map +0 -1
  856. package/dist/trace/store-to-otlp.d.ts +0 -72
  857. package/dist/trace/store-to-otlp.d.ts.map +0 -1
  858. package/dist/trace/store-to-otlp.test.d.ts +0 -2
  859. package/dist/trace/store-to-otlp.test.d.ts.map +0 -1
  860. package/dist/trace/store.d.ts.map +0 -1
  861. package/dist/trace/store.test.d.ts +0 -2
  862. package/dist/trace/store.test.d.ts.map +0 -1
  863. package/dist/trace-analyst/analyst.d.ts.map +0 -1
  864. package/dist/trace-analyst/analyst.test.d.ts +0 -2
  865. package/dist/trace-analyst/analyst.test.d.ts.map +0 -1
  866. package/dist/trace-analyst/behavioral-metrics.d.ts +0 -40
  867. package/dist/trace-analyst/behavioral-metrics.d.ts.map +0 -1
  868. package/dist/trace-analyst/behavioral-metrics.test.d.ts +0 -2
  869. package/dist/trace-analyst/behavioral-metrics.test.d.ts.map +0 -1
  870. package/dist/trace-analyst/hook.d.ts +0 -55
  871. package/dist/trace-analyst/hook.d.ts.map +0 -1
  872. package/dist/trace-analyst/index.d.ts +0 -18
  873. package/dist/trace-analyst/index.d.ts.map +0 -1
  874. package/dist/trace-analyst/insights.d.ts +0 -71
  875. package/dist/trace-analyst/insights.d.ts.map +0 -1
  876. package/dist/trace-analyst/insights.test.d.ts +0 -2
  877. package/dist/trace-analyst/insights.test.d.ts.map +0 -1
  878. package/dist/trace-analyst/otlp-flatten.d.ts +0 -42
  879. package/dist/trace-analyst/otlp-flatten.d.ts.map +0 -1
  880. package/dist/trace-analyst/otlp-span.d.ts +0 -85
  881. package/dist/trace-analyst/otlp-span.d.ts.map +0 -1
  882. package/dist/trace-analyst/otlp-span.test.d.ts +0 -2
  883. package/dist/trace-analyst/otlp-span.test.d.ts.map +0 -1
  884. package/dist/trace-analyst/otlp-to-run-records.d.ts +0 -115
  885. package/dist/trace-analyst/otlp-to-run-records.d.ts.map +0 -1
  886. package/dist/trace-analyst/otlp-to-run-records.test.d.ts +0 -2
  887. package/dist/trace-analyst/otlp-to-run-records.test.d.ts.map +0 -1
  888. package/dist/trace-analyst/otlp-to-run-records.timestamps.test.d.ts +0 -2
  889. package/dist/trace-analyst/otlp-to-run-records.timestamps.test.d.ts.map +0 -1
  890. package/dist/trace-analyst/prompts.d.ts +0 -6
  891. package/dist/trace-analyst/prompts.d.ts.map +0 -1
  892. package/dist/trace-analyst/store-otlp.d.ts +0 -126
  893. package/dist/trace-analyst/store-otlp.d.ts.map +0 -1
  894. package/dist/trace-analyst/store-otlp.test.d.ts +0 -8
  895. package/dist/trace-analyst/store-otlp.test.d.ts.map +0 -1
  896. package/dist/trace-analyst/store-otlp.timestamps.test.d.ts +0 -2
  897. package/dist/trace-analyst/store-otlp.timestamps.test.d.ts.map +0 -1
  898. package/dist/trace-analyst/store.d.ts +0 -63
  899. package/dist/trace-analyst/store.d.ts.map +0 -1
  900. package/dist/trace-analyst/tools.d.ts +0 -44
  901. package/dist/trace-analyst/tools.d.ts.map +0 -1
  902. package/dist/trace-analyst/tools.test.d.ts +0 -10
  903. package/dist/trace-analyst/tools.test.d.ts.map +0 -1
  904. package/dist/trace-analyst/types.d.ts.map +0 -1
  905. package/dist/trace-contracts.d.ts +0 -180
  906. package/dist/trace-contracts.d.ts.map +0 -1
  907. package/dist/traced-analyst.d.ts +0 -26
  908. package/dist/traced-analyst.d.ts.map +0 -1
  909. package/dist/traced-judges.d.ts +0 -27
  910. package/dist/traced-judges.d.ts.map +0 -1
  911. package/dist/traces.d.ts.map +0 -1
  912. package/dist/trajectory.d.ts.map +0 -1
  913. package/dist/types.d.ts.map +0 -1
  914. package/dist/ui-finding.d.ts +0 -104
  915. package/dist/ui-finding.d.ts.map +0 -1
  916. package/dist/verdict-cache.d.ts +0 -78
  917. package/dist/verdict-cache.d.ts.map +0 -1
  918. package/dist/verdict-cache.test.d.ts +0 -2
  919. package/dist/verdict-cache.test.d.ts.map +0 -1
  920. package/dist/verdict.d.ts.map +0 -1
  921. package/dist/visual-diff.d.ts +0 -32
  922. package/dist/visual-diff.d.ts.map +0 -1
  923. package/dist/wire/handlers.d.ts +0 -54
  924. package/dist/wire/handlers.d.ts.map +0 -1
  925. package/dist/wire/index.d.ts.map +0 -1
  926. package/dist/wire/openapi.d.ts +0 -3
  927. package/dist/wire/openapi.d.ts.map +0 -1
  928. package/dist/wire/rpc.d.ts +0 -21
  929. package/dist/wire/rpc.d.ts.map +0 -1
  930. package/dist/wire/rubrics.d.ts +0 -34
  931. package/dist/wire/rubrics.d.ts.map +0 -1
  932. package/dist/wire/schemas.d.ts +0 -410
  933. package/dist/wire/schemas.d.ts.map +0 -1
  934. package/dist/wire/server.d.ts +0 -60
  935. package/dist/wire/server.d.ts.map +0 -1
  936. package/dist/workflow/event-schema.d.ts +0 -5
  937. package/dist/workflow/event-schema.d.ts.map +0 -1
  938. package/dist/workflow/feedback-pack.d.ts +0 -99
  939. package/dist/workflow/feedback-pack.d.ts.map +0 -1
  940. package/dist/workflow/index.d.ts.map +0 -1
  941. package/dist/workflow/intelligence-export.d.ts +0 -62
  942. package/dist/workflow/intelligence-export.d.ts.map +0 -1
  943. package/dist/workflow/partner-report.d.ts +0 -49
  944. package/dist/workflow/partner-report.d.ts.map +0 -1
  945. package/dist/workflow/phase-graph.d.ts +0 -43
  946. package/dist/workflow/phase-graph.d.ts.map +0 -1
  947. package/dist/workflow/promotion-gate.d.ts +0 -61
  948. package/dist/workflow/promotion-gate.d.ts.map +0 -1
  949. package/dist/workflow/run-record.d.ts +0 -12
  950. package/dist/workflow/run-record.d.ts.map +0 -1
  951. package/dist/workflow/runtime-adapter.d.ts +0 -20
  952. package/dist/workflow/runtime-adapter.d.ts.map +0 -1
  953. package/dist/workflow/sanitize.d.ts +0 -21
  954. package/dist/workflow/sanitize.d.ts.map +0 -1
  955. package/dist/workflow/schema.d.ts +0 -5
  956. package/dist/workflow/schema.d.ts.map +0 -1
  957. package/dist/workflow/summary.d.ts +0 -43
  958. package/dist/workflow/summary.d.ts.map +0 -1
  959. package/dist/workflow/trace-event-fields.d.ts +0 -6
  960. package/dist/workflow/trace-event-fields.d.ts.map +0 -1
  961. package/dist/workflow/trajectory.d.ts +0 -15
  962. package/dist/workflow/trajectory.d.ts.map +0 -1
  963. package/dist/workflow/types.d.ts +0 -68
  964. package/dist/workflow/types.d.ts.map +0 -1
  965. package/dist/workspace-inspector.d.ts +0 -67
  966. package/dist/workspace-inspector.d.ts.map +0 -1
  967. package/dist/wrangler-deploy-runner.test.d.ts +0 -2
  968. package/dist/wrangler-deploy-runner.test.d.ts.map +0 -1
@@ -0,0 +1,233 @@
1
+ import { D as DatasetSplit, c as DatasetManifest, a as DatasetScenario } from './dataset-BbGkaN2I.js';
2
+ import { m as GateDecision } from './summary-report-CInXwsza.js';
3
+ import { R as RunRecord, a as RunSplitTag } from './run-record-CP2ObebC.js';
4
+
5
+ /**
6
+ * Release confidence gate.
7
+ *
8
+ * This is the production-facing composition layer over the lower-level
9
+ * primitives:
10
+ * - Dataset manifests prove corpus/version coverage.
11
+ * - RunRecord rows prove reproducible search/holdout outcomes.
12
+ * - Multi-shot trace evidence carries turn counts and ASI diagnostics.
13
+ * - HeldOutGate decisions remain the paired promotion authority.
14
+ *
15
+ * The gate is intentionally pure and conservative. Missing declared evidence
16
+ * fails closed instead of being treated as a neutral zero.
17
+ */
18
+
19
+ /** Severity of an actionable finding attached to a run/trace. */
20
+ type AsiSeverity = 'info' | 'warning' | 'error' | 'critical';
21
+ /** Actionable side-info — a diagnosed finding the loop can act on. */
22
+ interface ActionableSideInfo {
23
+ /** Stable expectation/check id when available. */
24
+ expectationId?: string;
25
+ /** Human-readable diagnosis of what happened. */
26
+ message: string;
27
+ severity?: AsiSeverity;
28
+ /** Concrete trace excerpt, file path, tool call, screenshot id, etc. */
29
+ evidence?: string;
30
+ /** Prompt/tool/context surface likely responsible. */
31
+ responsibleSurface?: string;
32
+ /** Suggested fix in natural language. */
33
+ suggestion?: string;
34
+ /** Whether this expectation was satisfied. Defaults to false for ASI rows. */
35
+ matched?: boolean;
36
+ metadata?: Record<string, unknown>;
37
+ }
38
+ type ReleaseConfidenceStatus = 'pass' | 'warn' | 'fail';
39
+ type ReleaseConfidenceAxisName = 'corpus' | 'quality' | 'generalization' | 'diagnostics' | 'efficiency';
40
+ interface ReleaseTraceEvidence {
41
+ scenarioId: string;
42
+ candidateId?: string;
43
+ split?: RunSplitTag;
44
+ score?: number;
45
+ ok?: boolean;
46
+ turnCount?: number;
47
+ costUsd?: number;
48
+ durationMs?: number;
49
+ failureMode?: string;
50
+ asi?: ActionableSideInfo[];
51
+ metadata?: Record<string, unknown>;
52
+ }
53
+ interface ReleaseConfidenceThresholds {
54
+ /** Require a Dataset manifest or explicit scenarios. Default true. */
55
+ requireCorpus?: boolean;
56
+ minScenarioCount?: number;
57
+ minSearchRuns?: number;
58
+ minHoldoutRuns?: number;
59
+ /** Require at least one holdout scenario/run. Default true. */
60
+ requireHoldout?: boolean;
61
+ minPassRate?: number;
62
+ minMeanScore?: number;
63
+ /** Search mean may exceed holdout mean by at most this much. */
64
+ maxOverfitGap?: number;
65
+ maxMeanCostUsd?: number;
66
+ maxP95WallMs?: number;
67
+ /** Low-score/failed rows must carry ASI. Default true. */
68
+ requireAsiForFailures?: boolean;
69
+ /** Score below this is considered a failure for ASI coverage. Default 0.5. */
70
+ failureScoreThreshold?: number;
71
+ }
72
+ interface ReleaseConfidenceInput {
73
+ target: string;
74
+ candidateId?: string;
75
+ baselineId?: string;
76
+ dataset?: DatasetManifest;
77
+ scenarios?: readonly DatasetScenario[];
78
+ runs?: readonly RunRecord[];
79
+ traces?: readonly ReleaseTraceEvidence[];
80
+ gateDecision?: GateDecision | null;
81
+ thresholds?: ReleaseConfidenceThresholds;
82
+ }
83
+ interface ReleaseConfidenceAxis {
84
+ name: ReleaseConfidenceAxisName;
85
+ status: ReleaseConfidenceStatus;
86
+ score: number;
87
+ detail: string;
88
+ }
89
+ interface ReleaseConfidenceIssue {
90
+ axis: ReleaseConfidenceAxisName;
91
+ severity: 'critical' | 'warning';
92
+ code: string;
93
+ detail: string;
94
+ }
95
+ interface ReleaseConfidenceMetrics {
96
+ scenarioCount: number;
97
+ searchRuns: number;
98
+ holdoutRuns: number;
99
+ passRate: number;
100
+ meanScore: number;
101
+ searchMeanScore: number;
102
+ holdoutMeanScore: number;
103
+ overfitGap: number;
104
+ meanCostUsd: number;
105
+ p95WallMs: number;
106
+ failedRows: number;
107
+ failuresWithAsi: number;
108
+ singleShotTraces: number;
109
+ multiShotTraces: number;
110
+ splitCounts: Record<DatasetSplit, number>;
111
+ domainCounts: Record<string, number>;
112
+ failureModeCounts: Record<string, number>;
113
+ responsibleSurfaceCounts: Record<string, number>;
114
+ }
115
+ interface ReleaseConfidenceScorecard {
116
+ target: string;
117
+ candidateId: string | null;
118
+ baselineId: string | null;
119
+ status: ReleaseConfidenceStatus;
120
+ promote: boolean;
121
+ axes: ReleaseConfidenceAxis[];
122
+ issues: ReleaseConfidenceIssue[];
123
+ metrics: ReleaseConfidenceMetrics;
124
+ dataset: DatasetManifest | null;
125
+ gateDecision: GateDecision | null;
126
+ summary: string;
127
+ }
128
+ declare function evaluateReleaseConfidence(input: ReleaseConfidenceInput): ReleaseConfidenceScorecard;
129
+ declare function assertReleaseConfidence(input: ReleaseConfidenceInput): ReleaseConfidenceScorecard;
130
+
131
+ /**
132
+ * Bootstrap-CI promotion gate.
133
+ *
134
+ * In any iterative-improvement loop (GEPA, prompt evolution, dataset
135
+ * curation), the question is "did this generation actually improve, or are
136
+ * we celebrating noise?". With small N and noisy outcomes, point-estimate
137
+ * deltas lie. Bootstrap confidence intervals tell the operator whether the
138
+ * delta is real before code or prompts get promoted.
139
+ *
140
+ * This module is pure functions — no I/O, no model calls. Easy to unit-test
141
+ * and to compose into any verdict gate.
142
+ *
143
+ * Default gate:
144
+ * - Bootstrap mean baseline vs candidate (1k resamples).
145
+ * - Compute the delta distribution; pass if the lower CI bound > 0.
146
+ * - Tunable confidence (default 95%) and resample count.
147
+ *
148
+ * Verdict semantics intentionally match the existing `experiments.jsonl`
149
+ * vocabulary:
150
+ * - ADVANCE: candidate's CI lower bound > baseline mean (real win)
151
+ * - KEEP: overlap, but candidate point estimate >= baseline (neutral)
152
+ * - REVERT: candidate's CI upper bound < baseline mean (real regression)
153
+ * - INCONCLUSIVE: not enough samples or CI straddles zero with no signal
154
+ */
155
+ type Verdict = 'ADVANCE' | 'KEEP' | 'REVERT' | 'INCONCLUSIVE';
156
+ interface BootstrapResult {
157
+ baselineMean: number;
158
+ candidateMean: number;
159
+ /** candidateMean - baselineMean, point estimate. */
160
+ delta: number;
161
+ /** Lower bound of the (1 - alpha) CI on the delta. */
162
+ ciLower: number;
163
+ /** Upper bound of the (1 - alpha) CI on the delta. */
164
+ ciUpper: number;
165
+ /** Number of bootstrap resamples used. */
166
+ iterations: number;
167
+ alpha: number;
168
+ verdict: Verdict;
169
+ }
170
+ interface BootstrapOptions {
171
+ /** Confidence level alpha (default 0.05 → 95% CI). */
172
+ alpha?: number;
173
+ /** Number of resamples (default 1000). */
174
+ iterations?: number;
175
+ /**
176
+ * Minimum total samples (baseline + candidate) below which we always
177
+ * return INCONCLUSIVE — bootstrap with too few samples is meaningless.
178
+ * Default 6 (combined).
179
+ */
180
+ minTotalSamples?: number;
181
+ /** RNG seed for reproducibility. Default: Math.random. */
182
+ seed?: number;
183
+ }
184
+ /**
185
+ * Compute the bootstrap CI on (candidateMean - baselineMean) and a verdict.
186
+ *
187
+ * Uses simple percentile bootstrap on the difference of resampled means.
188
+ * That's the standard non-parametric primitive — no distributional
189
+ * assumptions, robust to skew, easy to reason about.
190
+ */
191
+ declare function bootstrapCi(baseline: number[], candidate: number[], options?: BootstrapOptions): BootstrapResult;
192
+ /**
193
+ * Judge-replay promotion gate.
194
+ *
195
+ * The cheap inner-loop judge that drives an evolution run is by definition
196
+ * fast and noisy. When you're about to promote a winning variant to the
197
+ * canonical default, you want a STRONGER judge (a more expensive model, a
198
+ * human grader, a separately-trained reward model) to confirm the win
199
+ * generalises beyond the inner loop.
200
+ *
201
+ * This helper takes raw winner + baseline outputs, scores both through the
202
+ * stronger judge, and applies `bootstrapCi`. ADVANCE means the stronger
203
+ * judge agrees the winner is real with the configured confidence. Doesn't
204
+ * matter what shape your "output" is — pass a string, an object, anything
205
+ * the judge can read.
206
+ */
207
+ interface JudgeReplayGateArgs<TOutput> {
208
+ baselineOutputs: TOutput[];
209
+ candidateOutputs: TOutput[];
210
+ /** Stronger judge — async to allow LLM calls. Return a 0..N scalar score. */
211
+ judge: (output: TOutput) => Promise<number> | number;
212
+ alpha?: number;
213
+ iterations?: number;
214
+ /** RNG seed for reproducibility. */
215
+ seed?: number;
216
+ /** Maximum concurrent judge calls. Default 4. */
217
+ judgeConcurrency?: number;
218
+ }
219
+ declare function judgeReplayGate<TOutput>(args: JudgeReplayGateArgs<TOutput>): Promise<BootstrapResult & {
220
+ baselineSamples: number;
221
+ candidateSamples: number;
222
+ }>;
223
+
224
+ interface RenderReleaseReportOptions {
225
+ title?: string;
226
+ runs?: readonly RunRecord[];
227
+ comparator?: string;
228
+ traceAnalystFindings?: readonly string[];
229
+ nextActions?: readonly string[];
230
+ }
231
+ declare function renderReleaseReport(scorecard: ReleaseConfidenceScorecard, options?: RenderReleaseReportOptions): string;
232
+
233
+ export { type ActionableSideInfo as A, type BootstrapOptions as B, type JudgeReplayGateArgs as J, type ReleaseConfidenceAxis as R, type Verdict as V, type BootstrapResult as a, type ReleaseConfidenceAxisName as b, type ReleaseConfidenceInput as c, type ReleaseConfidenceIssue as d, type ReleaseConfidenceMetrics as e, type ReleaseConfidenceScorecard as f, type ReleaseConfidenceStatus as g, type ReleaseConfidenceThresholds as h, type ReleaseTraceEvidence as i, type RenderReleaseReportOptions as j, assertReleaseConfidence as k, bootstrapCi as l, evaluateReleaseConfidence as m, judgeReplayGate as n, type AsiSeverity as o, renderReleaseReport as r };
@@ -1,15 +1,16 @@
1
- export type { RubricOutcomePair, RubricPredictiveValidityInput, RubricPredictiveValidityReport, RubricRanking, } from './meta-eval/rubric-predictive-validity';
2
- export { rubricPredictiveValidity } from './meta-eval/rubric-predictive-validity';
3
- export type { BootstrapOptions, BootstrapResult, JudgeReplayGateArgs, Verdict, } from './promotion-gate';
4
- export { bootstrapCi, judgeReplayGate, } from './promotion-gate';
5
- export type { ReleaseConfidenceAxis, ReleaseConfidenceAxisName, ReleaseConfidenceInput, ReleaseConfidenceIssue, ReleaseConfidenceMetrics, ReleaseConfidenceScorecard, ReleaseConfidenceStatus, ReleaseConfidenceThresholds, ReleaseTraceEvidence, } from './release-confidence';
6
- export { assertReleaseConfidence, evaluateReleaseConfidence } from './release-confidence';
7
- export type { RenderReleaseReportOptions } from './release-report';
8
- export { renderReleaseReport } from './release-report';
9
- export type { InterimReleaseConfidence, InterimReleaseConfidenceInput, PairedEvalueOptions, PairedEvalueSequence, PairedEvalueStep, SequentialDecision, } from './sequential';
10
- export { evaluateInterimReleaseConfidence, pairedEvalueSequence, } from './sequential';
11
- export type { PairedBootstrapOptions, PairedBootstrapResult, } from './statistics';
12
- export { benjaminiHochberg, pairedBootstrap, wilcoxonSignedRank, } from './statistics';
13
- export type { GainDistributionBin, GainDistributionFigureSpec, GainDistributionOptions, ParetoFigureSpec, ParetoPoint, ResearchReport, ResearchReportCandidate, ResearchReportDecision, ResearchReportMethodology, ResearchReportOptions, ResearchReportRecommendation, SummaryTable, SummaryTableOptions, SummaryTableRow, } from './summary-report';
14
- export { gainHistogram, paretoChart, RESEARCH_REPORT_HARD_PAIR_FLOOR, researchReport, summaryTable, } from './summary-report';
15
- //# sourceMappingURL=reporting.d.ts.map
1
+ export { R as RubricOutcomePair, a as RubricPredictiveValidityInput, b as RubricPredictiveValidityReport, c as RubricRanking, r as rubricPredictiveValidity } from './rubric-predictive-validity-C2hDKM8Z.js';
2
+ export { B as BootstrapOptions, a as BootstrapResult, J as JudgeReplayGateArgs, R as ReleaseConfidenceAxis, b as ReleaseConfidenceAxisName, c as ReleaseConfidenceInput, d as ReleaseConfidenceIssue, e as ReleaseConfidenceMetrics, f as ReleaseConfidenceScorecard, g as ReleaseConfidenceStatus, h as ReleaseConfidenceThresholds, i as ReleaseTraceEvidence, j as RenderReleaseReportOptions, V as Verdict, k as assertReleaseConfidence, l as bootstrapCi, m as evaluateReleaseConfidence, n as judgeReplayGate, r as renderReleaseReport } from './release-report-pidWUMZ2.js';
3
+ export { I as InterimReleaseConfidence, a as InterimReleaseConfidenceInput, P as PairedEvalueOptions, b as PairedEvalueSequence, c as PairedEvalueStep, S as SequentialDecision, e as evaluateInterimReleaseConfidence, p as pairedEvalueSequence } from './sequential-5iSVfzl2.js';
4
+ export { P as PairedBootstrapOptions, a as PairedBootstrapResult, b as benjaminiHochberg, p as pairedBootstrap, w as wilcoxonSignedRank } from './statistics-CCJpTGOS.js';
5
+ export { G as GainDistributionBin, a as GainDistributionFigureSpec, b as GainDistributionOptions, P as ParetoFigureSpec, c as ParetoPoint, R as RESEARCH_REPORT_HARD_PAIR_FLOOR, d as ResearchReport, e as ResearchReportCandidate, f as ResearchReportDecision, g as ResearchReportMethodology, h as ResearchReportOptions, i as ResearchReportRecommendation, S as SummaryTable, j as SummaryTableOptions, k as SummaryTableRow, l as gainHistogram, p as paretoChart, r as researchReport, s as summaryTable } from './summary-report-CInXwsza.js';
6
+ import './run-record-CP2ObebC.js';
7
+ import '@tangle-network/agent-interface';
8
+ import './errors-CzMUYo7b.js';
9
+ import './schema-m0gsnbt3.js';
10
+ import './outcome-store-rnXLEqSn.js';
11
+ import './dataset-BbGkaN2I.js';
12
+ import './judge-calibration-0p2QcWNE.js';
13
+ import './types-C7DGg5ex.js';
14
+ import '@tangle-network/tcloud';
15
+ import './failure-cluster-DH9Flgcf.js';
16
+ import './store-BcFXE6LG.js';
@@ -1,3 +1,12 @@
1
+ import { a as RunSplitTag, b as RunTokenUsage, c as RunJudgeMetadata, J as JudgeScoresRecord, A as AgentProfileCell, d as AgentProfileCellInput, R as RunRecord } from './run-record-CP2ObebC.js';
2
+ import { L as LlmClientOptions, a as LlmRouteRequirements } from './llm-client-Bj7g0rqu.js';
3
+ import { h as ResearchReportOptions, d as ResearchReport, m as GateDecision } from './summary-report-CInXwsza.js';
4
+ import { T as TraceEmitter, R as RunCompleteHook } from './emitter-C2rqGH_l.js';
5
+ import { R as RunIntegrityExpectations, a as RunIntegrityReport } from './integrity-D2t12mMw.js';
6
+ import { R as RawProviderSink } from './raw-provider-sink-C46HDghv.js';
7
+ import { F as FailureClass } from './schema-m0gsnbt3.js';
8
+ import { T as TraceStore } from './store-BcFXE6LG.js';
9
+
1
10
  /**
2
11
  * EvalCampaign — opinionated matrix runner that wires the four
3
12
  * capture-integrity directives by construction.
@@ -37,26 +46,17 @@
37
46
  * - Resume from partial state across crashes
38
47
  * - LLM-call retry beyond what `LlmClient` already does
39
48
  */
40
- import { type AgentProfileCell, type AgentProfileCellInput } from './agent-profile-cell';
41
- import { type LlmClientOptions, type LlmRouteRequirements } from './llm-client';
42
- import type { JudgeScoresRecord, RunJudgeMetadata, RunRecord, RunSplitTag, RunTokenUsage } from './run-record';
43
- import { type ResearchReport, type ResearchReportOptions } from './summary-report';
44
- import type { RunCompleteHook } from './trace/emitter';
45
- import { TraceEmitter } from './trace/emitter';
46
- import { type RunIntegrityExpectations, type RunIntegrityReport } from './trace/integrity';
47
- import { type RawProviderSink } from './trace/raw-provider-sink';
48
- import type { FailureClass } from './trace/schema';
49
- import type { TraceStore } from './trace/store';
50
- export interface CampaignVariant<V> {
49
+
50
+ interface CampaignVariant<V> {
51
51
  id: string;
52
52
  payload: V;
53
53
  }
54
- export interface CampaignScenario {
54
+ interface CampaignScenario {
55
55
  scenarioId: string;
56
56
  /** Free-form metadata propagated to runs and reports. */
57
57
  tags?: Record<string, string>;
58
58
  }
59
- export interface CampaignRunContext<V> {
59
+ interface CampaignRunContext<V> {
60
60
  /** Stable run id. The campaign generates this; the runner does not. */
61
61
  runId: string;
62
62
  /** Logical experiment id (campaignId by default; overridable per-run via opts). */
@@ -83,7 +83,7 @@ export interface CampaignRunContext<V> {
83
83
  */
84
84
  llmOpts: LlmClientOptions;
85
85
  }
86
- export interface CampaignRunOutcome {
86
+ interface CampaignRunOutcome {
87
87
  /** Did the run pass? Mirrors `RunOutcome.pass` semantics. */
88
88
  pass: boolean;
89
89
  /** Score for the run on its split. Maps to `searchScore` or `holdoutScore`. */
@@ -120,9 +120,9 @@ export interface CampaignRunOutcome {
120
120
  */
121
121
  agentProfile?: AgentProfileCell | AgentProfileCellInput;
122
122
  }
123
- export type CampaignRunner<V> = (ctx: CampaignRunContext<V>) => Promise<CampaignRunOutcome>;
124
- export type CampaignIntegrityPolicy = 'throw' | 'mark_failed' | 'log';
125
- export interface EvalCampaignOptions<V> {
123
+ type CampaignRunner<V> = (ctx: CampaignRunContext<V>) => Promise<CampaignRunOutcome>;
124
+ type CampaignIntegrityPolicy = 'throw' | 'mark_failed' | 'log';
125
+ interface EvalCampaignOptions<V> {
126
126
  /**
127
127
  * Stable id for the campaign. Used as the default `experimentId` on
128
128
  * every run, and folded into the campaign fingerprint.
@@ -215,14 +215,14 @@ export interface EvalCampaignOptions<V> {
215
215
  scenarioTags: Record<string, string>;
216
216
  }) => AgentProfileCell | AgentProfileCellInput | Promise<AgentProfileCell | AgentProfileCellInput>);
217
217
  }
218
- export interface CampaignFactoryParams {
218
+ interface CampaignFactoryParams {
219
219
  campaignId: string;
220
220
  runId: string;
221
221
  variantId: string;
222
222
  scenarioId: string;
223
223
  seed: number;
224
224
  }
225
- export interface FailedRun {
225
+ interface FailedRun {
226
226
  runId: string;
227
227
  variantId: string;
228
228
  scenarioId: string;
@@ -230,7 +230,7 @@ export interface FailedRun {
230
230
  reason: string;
231
231
  error?: string;
232
232
  }
233
- export interface EvalCampaignResult {
233
+ interface EvalCampaignResult {
234
234
  campaignId: string;
235
235
  /** SHA-256 over canonicalised `(variantIds, scenarioIds, seeds, comparator, splitTag, baseUrl, provider, preregistrationHash)`. */
236
236
  campaignFingerprint: string;
@@ -245,21 +245,143 @@ export interface EvalCampaignResult {
245
245
  startedAt: string;
246
246
  endedAt: string;
247
247
  }
248
- export declare function runEvalCampaign<V>(opts: EvalCampaignOptions<V>): Promise<EvalCampaignResult>;
248
+ declare function runEvalCampaign<V>(opts: EvalCampaignOptions<V>): Promise<EvalCampaignResult>;
249
+
249
250
  /**
250
- * Abort a run whose owning work threw or was orphaned by a sibling's genuine
251
- * error, finalizing the emitter so hooks fire and the store records a terminal
252
- * status. Safe to call unconditionally: it only aborts runs that are still
253
- * `running`. Two no-op cases are intentional and benign:
251
+ * Researcher interface stable hook for an external autonomous-research
252
+ * agent to drive the meta-loop.
254
253
  *
255
- * - the run was never started (absent from the store) nothing to finalize
256
- * - the run is already terminal (`completed` / `failed` / `aborted`)
257
- * finalizing again would overwrite the real outcome (e.g. flip a passed run
258
- * to `aborted` with `{ pass: false, notes: reason }`), so we leave it alone
254
+ * Implementations live downstream (typically in a private repo that
255
+ * runs the actual LLM). This package ships only the contract + a
256
+ * `NoopResearcher` so consumers can wire the surface without being
257
+ * forced to implement every method up front.
259
258
  *
260
- * Any OTHER failure of the store read or the abort write (disk full, FS fault,
261
- * backend down) is a genuine diagnostic and propagates rather than being
262
- * swallowed.
259
+ * The four methods mirror the four stages of the paper "Two Loops,
260
+ * Three Roles":
261
+ *
262
+ * inspectFailures — given the observed runs, what failure modes
263
+ * are present? (data → diagnosis)
264
+ * proposeChange — given diagnosed failure modes, what
265
+ * structural changes should we try?
266
+ * (diagnosis → plan delta)
267
+ * applyChange — fold the proposed deltas into a concrete
268
+ * experiment plan against an existing baseline.
269
+ * (plan delta → executable plan)
270
+ * evaluateChange — run the plan, return runs + the gate verdict.
271
+ * (executable plan → verdict)
272
+ *
273
+ * Composition is the discipline: a Researcher implementation MUST
274
+ * keep these four steps separate and inspectable. Conflating
275
+ * "diagnose + propose + run" into a single LLM call defeats the
276
+ * point of the framework — you can't audit which step lied.
277
+ *
278
+ * THIS INTERFACE IS STABLE. Breaking changes require a new module
279
+ * (e.g. `Researcher2`) so existing implementations keep working.
263
280
  */
264
- export declare function finalizeAbort(emitter: TraceEmitter, runId: string, reason: string): Promise<void>;
265
- //# sourceMappingURL=eval-campaign.d.ts.map
281
+
282
+ /** A diagnosed failure mode with the run-IDs that exhibit it. */
283
+ interface FailureMode {
284
+ /** Short machine-readable code. Must be stable across runs of the
285
+ * same researcher to enable longitudinal tracking. */
286
+ code: string;
287
+ /** Human-readable description for the paper / dashboard. */
288
+ description: string;
289
+ evidence: {
290
+ /** Run IDs (from `RunRecord.runId`) where this failure mode was
291
+ * observed. */
292
+ runIds: string[];
293
+ /** Number of run samples that informed the diagnosis. */
294
+ samples: number;
295
+ };
296
+ }
297
+ /** A single steering change the researcher wants to try. */
298
+ interface SteeringChange {
299
+ kind: 'reviewer_prompt' | 'skill_add' | 'skill_remove' | 'threshold' | 'budget';
300
+ /** Implementation-specific payload. Researcher implementations
301
+ * define the schema — keep this `unknown` here to avoid coupling
302
+ * the public interface to any one researcher's internal model. */
303
+ payload: unknown;
304
+ /** Why the researcher proposed this change. Goes into the audit
305
+ * trail next to the failure-mode evidence. */
306
+ rationale: string;
307
+ /** Optional self-reported expected delta on the headline metric. */
308
+ expectedDelta?: number;
309
+ }
310
+ /** A single experiment plan, mapped onto the search/holdout splits. */
311
+ interface ExperimentPlan {
312
+ baselineCandidateId: string;
313
+ proposedCandidateId: string;
314
+ changes: SteeringChange[];
315
+ /** USD ceiling for the entire experiment. The runner must stop
316
+ * before exceeding this and report a partial result. */
317
+ evaluationBudgetUsd: number;
318
+ /** Item IDs (your dataset keys) for the search vs holdout splits. */
319
+ splits: {
320
+ search: string[];
321
+ holdout: string[];
322
+ };
323
+ }
324
+ /** Result of running a plan: every run, plus the gate verdict. */
325
+ interface ExperimentResult {
326
+ plan: ExperimentPlan;
327
+ runs: RunRecord[];
328
+ gateDecision: GateDecision;
329
+ }
330
+ /**
331
+ * The researcher loop. Stable, four-step, inspectable.
332
+ *
333
+ * ┌──────────┐ inspectFailures ┌──────────┐ proposeChange ┌──────────┐
334
+ * │ runs │ ─────────────────▶│ failures │ ──────────────▶│ changes │
335
+ * └──────────┘ └──────────┘ └────┬─────┘
336
+ * │
337
+ * ▼
338
+ * ┌────────────────┐ applyChange ┌────────┐
339
+ * │ ExperimentPlan │ ◀────────────│ base │
340
+ * └────────┬───────┘ └────────┘
341
+ * │
342
+ * evaluateChange ▼
343
+ * ┌────────────────┐
344
+ * │ ExperimentResult│
345
+ * └────────────────┘
346
+ */
347
+ interface Researcher {
348
+ inspectFailures(runs: RunRecord[]): Promise<FailureMode[]>;
349
+ proposeChange(failures: FailureMode[]): Promise<SteeringChange[]>;
350
+ applyChange(changes: SteeringChange[], baseline: ExperimentPlan): Promise<ExperimentPlan>;
351
+ evaluateChange(plan: ExperimentPlan): Promise<ExperimentResult>;
352
+ }
353
+ interface CallbackResearcherOptions {
354
+ inspectFailures: Researcher['inspectFailures'];
355
+ proposeChange: Researcher['proposeChange'];
356
+ applyChange: Researcher['applyChange'];
357
+ evaluateChange: Researcher['evaluateChange'];
358
+ }
359
+ /**
360
+ * Minimal concrete researcher for tests, scripts, and small integrations.
361
+ * Larger autonomous researchers can still implement `Researcher` directly.
362
+ */
363
+ declare class CallbackResearcher implements Researcher {
364
+ private readonly callbacks;
365
+ constructor(callbacks: CallbackResearcherOptions);
366
+ inspectFailures(runs: RunRecord[]): Promise<FailureMode[]>;
367
+ proposeChange(failures: FailureMode[]): Promise<SteeringChange[]>;
368
+ applyChange(changes: SteeringChange[], baseline: ExperimentPlan): Promise<ExperimentPlan>;
369
+ evaluateChange(plan: ExperimentPlan): Promise<ExperimentResult>;
370
+ }
371
+ /**
372
+ * No-op researcher — fails loud on every method. Use as a placeholder
373
+ * in code paths that wire the interface but don't have an implementation
374
+ * yet. Importantly, this does NOT silently succeed: a no-op researcher
375
+ * that returned empty arrays would muffle the loop's signal that
376
+ * nobody implemented the brain.
377
+ */
378
+ declare class NoopResearcher implements Researcher {
379
+ private readonly hint;
380
+ constructor(hint?: string);
381
+ inspectFailures(_runs: RunRecord[]): Promise<FailureMode[]>;
382
+ proposeChange(_failures: FailureMode[]): Promise<SteeringChange[]>;
383
+ applyChange(_changes: SteeringChange[], _baseline: ExperimentPlan): Promise<ExperimentPlan>;
384
+ evaluateChange(_plan: ExperimentPlan): Promise<ExperimentResult>;
385
+ }
386
+
387
+ export { CallbackResearcher as C, type ExperimentPlan as E, type FailureMode as F, NoopResearcher as N, type Researcher as R, type SteeringChange as S, type ExperimentResult as a, type EvalCampaignResult as b, type EvalCampaignOptions as c, type CallbackResearcherOptions as d, type CampaignFactoryParams as e, type CampaignIntegrityPolicy as f, type CampaignRunContext as g, type CampaignRunOutcome as h, type CampaignRunner as i, type CampaignScenario as j, type CampaignVariant as k, type FailedRun as l, runEvalCampaign as r };