@tangle-network/agent-eval 0.95.0 → 0.96.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (968) hide show
  1. package/CHANGELOG.md +17 -0
  2. package/dist/adapters/http.d.ts +17 -10
  3. package/dist/adapters/langchain.d.ts +14 -7
  4. package/dist/adapters/otel.d.ts +25 -13
  5. package/dist/{rl/adversarial.d.ts → adversarial-DIVcDoI_.d.ts} +7 -6
  6. package/dist/analyst/index.d.ts +236 -28
  7. package/dist/analyst/index.js +1 -1
  8. package/dist/{trace-analyst/analyst.d.ts → analyst-C8HHvfJp.d.ts} +14 -12
  9. package/dist/{contract/analyze-runs.d.ts → analyze-runs-DtT6F_6T.d.ts} +10 -9
  10. package/dist/authenticity/index.d.ts +16 -15
  11. package/dist/{baseline.d.ts → baseline-Bbid3WoO.d.ts} +44 -8
  12. package/dist/belief-state/index.d.ts +605 -14
  13. package/dist/benchmarks/index.d.ts +5 -23
  14. package/dist/builder-eval/index.d.ts +250 -5
  15. package/dist/calibration-BPmzuVPk.d.ts +101 -0
  16. package/dist/campaign/index.d.ts +1452 -38
  17. package/dist/{chunk-AQ5WQAIV.js → chunk-3NHEO6ZC.js} +2 -2
  18. package/dist/chunk-3NHEO6ZC.js.map +1 -0
  19. package/dist/cli.d.ts +0 -2
  20. package/dist/{contract/intake/code-agent-session.d.ts → code-agent-session-CPHRCb4-.d.ts} +17 -15
  21. package/dist/contract/index.d.ts +824 -107
  22. package/dist/contract/index.js +145 -1
  23. package/dist/contract/index.js.map +1 -1
  24. package/dist/control-Doncu-B_.d.ts +259 -0
  25. package/dist/{control-runtime.d.ts → control-runtime-Acf9CGhw.d.ts} +26 -23
  26. package/dist/control.d.ts +10 -11
  27. package/dist/corpus-D4YW9UoJ.d.ts +560 -0
  28. package/dist/{cost-ledger.d.ts → cost-ledger-DuSqlw5B.d.ts} +11 -10
  29. package/dist/{counterfactual.d.ts → counterfactual-DlOz8PBx.d.ts} +13 -12
  30. package/dist/{dataset.d.ts → dataset-BbGkaN2I.d.ts} +14 -11
  31. package/dist/{analyst/registry.d.ts → default-registry-GyE8X5SP.d.ts} +37 -8
  32. package/dist/diagnose.d.ts +252 -1
  33. package/dist/{trace/emitter.d.ts → emitter-C2rqGH_l.d.ts} +12 -9
  34. package/dist/{errors.d.ts → errors-CzMUYo7b.d.ts} +11 -10
  35. package/dist/failure-cluster-DH9Flgcf.d.ts +76 -0
  36. package/dist/{feedback-trajectory.d.ts → feedback-trajectory-BxY0cKfs.d.ts} +38 -36
  37. package/dist/fuzz.d.ts +547 -1
  38. package/dist/gepa-Dprxvz8r.d.ts +414 -0
  39. package/dist/governance/index.d.ts +135 -5
  40. package/dist/harness-optimizer-mOl9XX_O.d.ts +106 -0
  41. package/dist/hosted/index.d.ts +239 -10
  42. package/dist/index-_Y4oNOOb.d.ts +159 -0
  43. package/dist/index.d.ts +5660 -277
  44. package/dist/index.js +1 -1
  45. package/dist/{contract/insight-report.d.ts → insight-report-BnRjTibG.d.ts} +19 -16
  46. package/dist/{trace/integrity.d.ts → integrity-D2t12mMw.d.ts} +14 -11
  47. package/dist/{judge-calibration.d.ts → judge-calibration-0p2QcWNE.d.ts} +17 -16
  48. package/dist/{analyst/kind-factory.d.ts → kind-factory-X3eDYbKn.d.ts} +61 -10
  49. package/dist/knowledge/index.d.ts +103 -3
  50. package/dist/{llm-client.d.ts → llm-client-Bj7g0rqu.d.ts} +23 -21
  51. package/dist/matrix/index.d.ts +30 -12
  52. package/dist/meta-eval/index.d.ts +182 -6
  53. package/dist/{multi-layer-verifier.d.ts → multi-layer-verifier-DUZXrPDA.d.ts} +15 -12
  54. package/dist/multishot/index.d.ts +290 -7
  55. package/dist/{rl/off-policy.d.ts → off-policy-DiwuKKg7.d.ts} +9 -8
  56. package/dist/openapi.json +1 -1
  57. package/dist/{meta-eval/outcome-store.d.ts → outcome-store-rnXLEqSn.d.ts} +8 -7
  58. package/dist/{pareto.d.ts → pareto-E-pembql.d.ts} +10 -9
  59. package/dist/perf/index.d.ts +119 -13
  60. package/dist/pipelines/index.d.ts +173 -8
  61. package/dist/pre-registration-nfUdc9EQ.d.ts +483 -0
  62. package/dist/prm/index.d.ts +104 -5
  63. package/dist/provenance-CIxfBnkl.d.ts +426 -0
  64. package/dist/query-B7GGjRox.d.ts +32 -0
  65. package/dist/{trace/raw-provider-sink.d.ts → raw-provider-sink-C46HDghv.d.ts} +14 -13
  66. package/dist/{red-team.d.ts → red-team-BWdoyleI.d.ts} +16 -14
  67. package/dist/{trace/redact.d.ts → redact-B40YG2M_.d.ts} +8 -7
  68. package/dist/release-report-pidWUMZ2.d.ts +233 -0
  69. package/dist/reporting.d.ts +16 -15
  70. package/dist/{eval-campaign.d.ts → researcher-Jr8ME1dZ.d.ts} +156 -34
  71. package/dist/rl.d.ts +1193 -1
  72. package/dist/{prm/rubric.d.ts → rubric-Cc6UHvUb.d.ts} +13 -10
  73. package/dist/{meta-eval/rubric-predictive-validity.d.ts → rubric-predictive-validity-C2hDKM8Z.d.ts} +11 -8
  74. package/dist/run-critic-CmMf05uV.d.ts +56 -0
  75. package/dist/{run-record.d.ts → run-record-CP2ObebC.d.ts} +117 -15
  76. package/dist/runtime-trajectory-BOUUjI0y.d.ts +49 -0
  77. package/dist/{trace/schema.d.ts → schema-m0gsnbt3.d.ts} +30 -29
  78. package/dist/semantic-concept-judge-DSBB2Cfp.d.ts +624 -0
  79. package/dist/{sequential.d.ts → sequential-5iSVfzl2.d.ts} +10 -9
  80. package/dist/{series-convergence.d.ts → series-convergence-D5OWMBg6.d.ts} +5 -4
  81. package/dist/sink-fetch-B1Yg4Til.d.ts +101 -0
  82. package/dist/{statistics.d.ts → statistics-CCJpTGOS.d.ts} +48 -46
  83. package/dist/{trace/store.d.ts → store-BcFXE6LG.d.ts} +12 -21
  84. package/dist/{trace-analyst/types.d.ts → store-C1YxJDEK.d.ts} +74 -18
  85. package/dist/storyboard/index.d.ts +81 -16
  86. package/dist/{summary-report.d.ts → summary-report-CInXwsza.d.ts} +160 -23
  87. package/dist/telemetry/{sink-file.d.ts → file.d.ts} +7 -5
  88. package/dist/telemetry/index.d.ts +35 -17
  89. package/dist/{sandbox-harness.d.ts → test-graded-scenario-DeODGLra.d.ts} +60 -15
  90. package/dist/{locked-jsonl-appender.d.ts → testing-C21CHsq2.d.ts} +4 -3
  91. package/dist/testing.d.ts +1 -5
  92. package/dist/traces.d.ts +976 -4
  93. package/dist/{trajectory.d.ts → trajectory-2TkpSEVh.d.ts} +9 -8
  94. package/dist/{analyst/types.d.ts → types-B5x54y6n.d.ts} +112 -19
  95. package/dist/{campaign/types.d.ts → types-BMahhhio.d.ts} +47 -44
  96. package/dist/{matrix/types.d.ts → types-BUxNaJ8c.d.ts} +11 -9
  97. package/dist/{types.d.ts → types-C7DGg5ex.d.ts} +33 -31
  98. package/dist/{verdict.d.ts → verdict-C9MlYujm.d.ts} +3 -2
  99. package/dist/wire/index.d.ts +570 -13
  100. package/dist/workflow/index.d.ts +496 -22
  101. package/package.json +2 -2
  102. package/dist/action-policy.d.ts +0 -24
  103. package/dist/action-policy.d.ts.map +0 -1
  104. package/dist/action-policy.test.d.ts +0 -2
  105. package/dist/action-policy.test.d.ts.map +0 -1
  106. package/dist/active-learning.d.ts +0 -41
  107. package/dist/active-learning.d.ts.map +0 -1
  108. package/dist/adapters/http.d.ts.map +0 -1
  109. package/dist/adapters/langchain.d.ts.map +0 -1
  110. package/dist/adapters/otel.d.ts.map +0 -1
  111. package/dist/agent-profile-cell.d.ts +0 -101
  112. package/dist/agent-profile-cell.d.ts.map +0 -1
  113. package/dist/agent-profile.d.ts +0 -27
  114. package/dist/agent-profile.d.ts.map +0 -1
  115. package/dist/agent-profile.test.d.ts +0 -2
  116. package/dist/agent-profile.test.d.ts.map +0 -1
  117. package/dist/analyst/adapters.d.ts +0 -62
  118. package/dist/analyst/adapters.d.ts.map +0 -1
  119. package/dist/analyst/analyst.test.d.ts +0 -2
  120. package/dist/analyst/analyst.test.d.ts.map +0 -1
  121. package/dist/analyst/ax-service.d.ts +0 -27
  122. package/dist/analyst/ax-service.d.ts.map +0 -1
  123. package/dist/analyst/behavioral-analyst.d.ts +0 -28
  124. package/dist/analyst/behavioral-analyst.d.ts.map +0 -1
  125. package/dist/analyst/chat-client.d.ts +0 -91
  126. package/dist/analyst/chat-client.d.ts.map +0 -1
  127. package/dist/analyst/default-registry.d.ts +0 -27
  128. package/dist/analyst/default-registry.d.ts.map +0 -1
  129. package/dist/analyst/default-registry.test.d.ts +0 -2
  130. package/dist/analyst/default-registry.test.d.ts.map +0 -1
  131. package/dist/analyst/finding-signature.d.ts +0 -48
  132. package/dist/analyst/finding-signature.d.ts.map +0 -1
  133. package/dist/analyst/finding-subject.d.ts +0 -146
  134. package/dist/analyst/finding-subject.d.ts.map +0 -1
  135. package/dist/analyst/finding-subject.test.d.ts +0 -2
  136. package/dist/analyst/finding-subject.test.d.ts.map +0 -1
  137. package/dist/analyst/findings-store.d.ts +0 -75
  138. package/dist/analyst/findings-store.d.ts.map +0 -1
  139. package/dist/analyst/index.d.ts.map +0 -1
  140. package/dist/analyst/kind-factory.d.ts.map +0 -1
  141. package/dist/analyst/kinds/failure-mode.d.ts +0 -19
  142. package/dist/analyst/kinds/failure-mode.d.ts.map +0 -1
  143. package/dist/analyst/kinds/improvement.d.ts +0 -23
  144. package/dist/analyst/kinds/improvement.d.ts.map +0 -1
  145. package/dist/analyst/kinds/index.d.ts +0 -22
  146. package/dist/analyst/kinds/index.d.ts.map +0 -1
  147. package/dist/analyst/kinds/kinds.test.d.ts +0 -2
  148. package/dist/analyst/kinds/kinds.test.d.ts.map +0 -1
  149. package/dist/analyst/kinds/knowledge-gap.d.ts +0 -28
  150. package/dist/analyst/kinds/knowledge-gap.d.ts.map +0 -1
  151. package/dist/analyst/kinds/knowledge-poisoning.d.ts +0 -22
  152. package/dist/analyst/kinds/knowledge-poisoning.d.ts.map +0 -1
  153. package/dist/analyst/kinds/skill-usage.d.ts +0 -84
  154. package/dist/analyst/kinds/skill-usage.d.ts.map +0 -1
  155. package/dist/analyst/kinds/skill-usage.test.d.ts +0 -2
  156. package/dist/analyst/kinds/skill-usage.test.d.ts.map +0 -1
  157. package/dist/analyst/parse-tolerant.d.ts +0 -26
  158. package/dist/analyst/parse-tolerant.d.ts.map +0 -1
  159. package/dist/analyst/parse-tolerant.test.d.ts +0 -2
  160. package/dist/analyst/parse-tolerant.test.d.ts.map +0 -1
  161. package/dist/analyst/registry.budget.test.d.ts +0 -2
  162. package/dist/analyst/registry.budget.test.d.ts.map +0 -1
  163. package/dist/analyst/registry.d.ts.map +0 -1
  164. package/dist/analyst/steer-firewall.d.ts +0 -35
  165. package/dist/analyst/steer-firewall.d.ts.map +0 -1
  166. package/dist/analyst/steer-firewall.test.d.ts +0 -2
  167. package/dist/analyst/steer-firewall.test.d.ts.map +0 -1
  168. package/dist/analyst/structure-findings.d.ts +0 -37
  169. package/dist/analyst/structure-findings.d.ts.map +0 -1
  170. package/dist/analyst/structure-findings.test.d.ts +0 -2
  171. package/dist/analyst/structure-findings.test.d.ts.map +0 -1
  172. package/dist/analyst/tool-groups.d.ts +0 -34
  173. package/dist/analyst/tool-groups.d.ts.map +0 -1
  174. package/dist/analyst/types.d.ts.map +0 -1
  175. package/dist/anti-slop.d.ts +0 -59
  176. package/dist/anti-slop.d.ts.map +0 -1
  177. package/dist/artifact-validator.d.ts +0 -74
  178. package/dist/artifact-validator.d.ts.map +0 -1
  179. package/dist/attestation.d.ts +0 -63
  180. package/dist/attestation.d.ts.map +0 -1
  181. package/dist/attestation.test.d.ts +0 -2
  182. package/dist/attestation.test.d.ts.map +0 -1
  183. package/dist/authenticity/index.d.ts.map +0 -1
  184. package/dist/authenticity/index.test.d.ts +0 -2
  185. package/dist/authenticity/index.test.d.ts.map +0 -1
  186. package/dist/auto-pr.d.ts +0 -120
  187. package/dist/auto-pr.d.ts.map +0 -1
  188. package/dist/baseline.d.ts.map +0 -1
  189. package/dist/behavior-dsl.d.ts +0 -73
  190. package/dist/behavior-dsl.d.ts.map +0 -1
  191. package/dist/belief-state/calibration.d.ts +0 -10
  192. package/dist/belief-state/calibration.d.ts.map +0 -1
  193. package/dist/belief-state/calibration.test.d.ts +0 -2
  194. package/dist/belief-state/calibration.test.d.ts.map +0 -1
  195. package/dist/belief-state/code-agent-corpus.d.ts +0 -66
  196. package/dist/belief-state/code-agent-corpus.d.ts.map +0 -1
  197. package/dist/belief-state/code-agent-corpus.test.d.ts +0 -2
  198. package/dist/belief-state/code-agent-corpus.test.d.ts.map +0 -1
  199. package/dist/belief-state/code-agent-evidence.d.ts +0 -22
  200. package/dist/belief-state/code-agent-evidence.d.ts.map +0 -1
  201. package/dist/belief-state/code-agent-evidence.test.d.ts +0 -2
  202. package/dist/belief-state/code-agent-evidence.test.d.ts.map +0 -1
  203. package/dist/belief-state/extract.d.ts +0 -7
  204. package/dist/belief-state/extract.d.ts.map +0 -1
  205. package/dist/belief-state/extract.test.d.ts +0 -2
  206. package/dist/belief-state/extract.test.d.ts.map +0 -1
  207. package/dist/belief-state/index.d.ts.map +0 -1
  208. package/dist/belief-state/ope.d.ts +0 -17
  209. package/dist/belief-state/ope.d.ts.map +0 -1
  210. package/dist/belief-state/ope.test.d.ts +0 -2
  211. package/dist/belief-state/ope.test.d.ts.map +0 -1
  212. package/dist/belief-state/phase0-measurement.d.ts +0 -55
  213. package/dist/belief-state/phase0-measurement.d.ts.map +0 -1
  214. package/dist/belief-state/report.d.ts +0 -17
  215. package/dist/belief-state/report.d.ts.map +0 -1
  216. package/dist/belief-state/report.test.d.ts +0 -2
  217. package/dist/belief-state/report.test.d.ts.map +0 -1
  218. package/dist/belief-state/research-evidence.d.ts +0 -23
  219. package/dist/belief-state/research-evidence.d.ts.map +0 -1
  220. package/dist/belief-state/research-evidence.test.d.ts +0 -2
  221. package/dist/belief-state/research-evidence.test.d.ts.map +0 -1
  222. package/dist/belief-state/runtime-benchmark-corpus.d.ts +0 -32
  223. package/dist/belief-state/runtime-benchmark-corpus.d.ts.map +0 -1
  224. package/dist/belief-state/runtime-hooks.d.ts +0 -87
  225. package/dist/belief-state/runtime-hooks.d.ts.map +0 -1
  226. package/dist/belief-state/runtime-hooks.test.d.ts +0 -2
  227. package/dist/belief-state/runtime-hooks.test.d.ts.map +0 -1
  228. package/dist/belief-state/selective.d.ts +0 -15
  229. package/dist/belief-state/selective.d.ts.map +0 -1
  230. package/dist/belief-state/selective.test.d.ts +0 -2
  231. package/dist/belief-state/selective.test.d.ts.map +0 -1
  232. package/dist/belief-state/shadow-probe.d.ts +0 -80
  233. package/dist/belief-state/shadow-probe.d.ts.map +0 -1
  234. package/dist/belief-state/shadow-probe.test.d.ts +0 -2
  235. package/dist/belief-state/shadow-probe.test.d.ts.map +0 -1
  236. package/dist/belief-state/types.d.ts +0 -195
  237. package/dist/belief-state/types.d.ts.map +0 -1
  238. package/dist/belief-state/types.test.d.ts +0 -2
  239. package/dist/belief-state/types.test.d.ts.map +0 -1
  240. package/dist/benchmark.d.ts +0 -14
  241. package/dist/benchmark.d.ts.map +0 -1
  242. package/dist/benchmarks/index.d.ts.map +0 -1
  243. package/dist/benchmarks/routing/dataset.d.ts +0 -34
  244. package/dist/benchmarks/routing/dataset.d.ts.map +0 -1
  245. package/dist/benchmarks/routing/index.d.ts +0 -34
  246. package/dist/benchmarks/routing/index.d.ts.map +0 -1
  247. package/dist/benchmarks/types.d.ts +0 -49
  248. package/dist/benchmarks/types.d.ts.map +0 -1
  249. package/dist/bisector.d.ts +0 -81
  250. package/dist/bisector.d.ts.map +0 -1
  251. package/dist/budget-guard.d.ts +0 -31
  252. package/dist/budget-guard.d.ts.map +0 -1
  253. package/dist/builder-eval/builder-session.d.ts +0 -111
  254. package/dist/builder-eval/builder-session.d.ts.map +0 -1
  255. package/dist/builder-eval/correlation.d.ts +0 -32
  256. package/dist/builder-eval/correlation.d.ts.map +0 -1
  257. package/dist/builder-eval/index.d.ts.map +0 -1
  258. package/dist/builder-eval/project-registry.d.ts +0 -51
  259. package/dist/builder-eval/project-registry.d.ts.map +0 -1
  260. package/dist/builder-eval/three-layer-eval.d.ts +0 -55
  261. package/dist/builder-eval/three-layer-eval.d.ts.map +0 -1
  262. package/dist/campaign/analyst-surface.d.ts +0 -108
  263. package/dist/campaign/analyst-surface.d.ts.map +0 -1
  264. package/dist/campaign/analyst-surface.test.d.ts +0 -2
  265. package/dist/campaign/analyst-surface.test.d.ts.map +0 -1
  266. package/dist/campaign/auto-pr.d.ts +0 -46
  267. package/dist/campaign/auto-pr.d.ts.map +0 -1
  268. package/dist/campaign/distillation/agreement-judge.d.ts +0 -69
  269. package/dist/campaign/distillation/agreement-judge.d.ts.map +0 -1
  270. package/dist/campaign/distillation/cli.d.ts +0 -35
  271. package/dist/campaign/distillation/cli.d.ts.map +0 -1
  272. package/dist/campaign/distillation/distillation.test.d.ts +0 -2
  273. package/dist/campaign/distillation/distillation.test.d.ts.map +0 -1
  274. package/dist/campaign/distillation/gold-scenarios.d.ts +0 -54
  275. package/dist/campaign/distillation/gold-scenarios.d.ts.map +0 -1
  276. package/dist/campaign/distillation/run-distillation.d.ts +0 -119
  277. package/dist/campaign/distillation/run-distillation.d.ts.map +0 -1
  278. package/dist/campaign/gates/compose.d.ts +0 -12
  279. package/dist/campaign/gates/compose.d.ts.map +0 -1
  280. package/dist/campaign/gates/default-production-gate.d.ts +0 -58
  281. package/dist/campaign/gates/default-production-gate.d.ts.map +0 -1
  282. package/dist/campaign/gates/heldout-gate.d.ts +0 -12
  283. package/dist/campaign/gates/heldout-gate.d.ts.map +0 -1
  284. package/dist/campaign/gates/promotion-policy.d.ts +0 -125
  285. package/dist/campaign/gates/promotion-policy.d.ts.map +0 -1
  286. package/dist/campaign/gates/promotion-policy.test.d.ts +0 -2
  287. package/dist/campaign/gates/promotion-policy.test.d.ts.map +0 -1
  288. package/dist/campaign/gates/sequential.d.ts +0 -146
  289. package/dist/campaign/gates/sequential.d.ts.map +0 -1
  290. package/dist/campaign/gates/sequential.test.d.ts +0 -2
  291. package/dist/campaign/gates/sequential.test.d.ts.map +0 -1
  292. package/dist/campaign/gates/statistical-heldout.d.ts +0 -99
  293. package/dist/campaign/gates/statistical-heldout.d.ts.map +0 -1
  294. package/dist/campaign/gates/statistical-heldout.test.d.ts +0 -2
  295. package/dist/campaign/gates/statistical-heldout.test.d.ts.map +0 -1
  296. package/dist/campaign/index.d.ts.map +0 -1
  297. package/dist/campaign/labeled-store/fs-adapter.d.ts +0 -59
  298. package/dist/campaign/labeled-store/fs-adapter.d.ts.map +0 -1
  299. package/dist/campaign/presets/compare-proposers.d.ts +0 -146
  300. package/dist/campaign/presets/compare-proposers.d.ts.map +0 -1
  301. package/dist/campaign/presets/playback.d.ts +0 -120
  302. package/dist/campaign/presets/playback.d.ts.map +0 -1
  303. package/dist/campaign/presets/playback.test.d.ts +0 -2
  304. package/dist/campaign/presets/playback.test.d.ts.map +0 -1
  305. package/dist/campaign/presets/run-eval.d.ts +0 -14
  306. package/dist/campaign/presets/run-eval.d.ts.map +0 -1
  307. package/dist/campaign/presets/run-improvement-loop.d.ts +0 -63
  308. package/dist/campaign/presets/run-improvement-loop.d.ts.map +0 -1
  309. package/dist/campaign/presets/run-improvement-loop.test.d.ts +0 -2
  310. package/dist/campaign/presets/run-improvement-loop.test.d.ts.map +0 -1
  311. package/dist/campaign/presets/run-optimization.d.ts +0 -92
  312. package/dist/campaign/presets/run-optimization.d.ts.map +0 -1
  313. package/dist/campaign/presets/run-profile-matrix.d.ts +0 -151
  314. package/dist/campaign/presets/run-profile-matrix.d.ts.map +0 -1
  315. package/dist/campaign/presets/run-skill-opt.d.ts +0 -96
  316. package/dist/campaign/presets/run-skill-opt.d.ts.map +0 -1
  317. package/dist/campaign/proposers/_findings-text.d.ts +0 -22
  318. package/dist/campaign/proposers/_findings-text.d.ts.map +0 -1
  319. package/dist/campaign/proposers/ace.d.ts +0 -33
  320. package/dist/campaign/proposers/ace.d.ts.map +0 -1
  321. package/dist/campaign/proposers/ace.test.d.ts +0 -2
  322. package/dist/campaign/proposers/ace.test.d.ts.map +0 -1
  323. package/dist/campaign/proposers/analysis-edit.d.ts +0 -32
  324. package/dist/campaign/proposers/analysis-edit.d.ts.map +0 -1
  325. package/dist/campaign/proposers/evolutionary.d.ts +0 -20
  326. package/dist/campaign/proposers/evolutionary.d.ts.map +0 -1
  327. package/dist/campaign/proposers/fapo.d.ts +0 -120
  328. package/dist/campaign/proposers/fapo.d.ts.map +0 -1
  329. package/dist/campaign/proposers/gepa.d.ts +0 -86
  330. package/dist/campaign/proposers/gepa.d.ts.map +0 -1
  331. package/dist/campaign/proposers/halo.d.ts +0 -44
  332. package/dist/campaign/proposers/halo.d.ts.map +0 -1
  333. package/dist/campaign/proposers/halo.test.d.ts +0 -2
  334. package/dist/campaign/proposers/halo.test.d.ts.map +0 -1
  335. package/dist/campaign/proposers/memory.d.ts +0 -47
  336. package/dist/campaign/proposers/memory.d.ts.map +0 -1
  337. package/dist/campaign/proposers/memory.test.d.ts +0 -2
  338. package/dist/campaign/proposers/memory.test.d.ts.map +0 -1
  339. package/dist/campaign/proposers/skill-opt.d.ts +0 -88
  340. package/dist/campaign/proposers/skill-opt.d.ts.map +0 -1
  341. package/dist/campaign/proposers/trace-analyst.d.ts +0 -48
  342. package/dist/campaign/proposers/trace-analyst.d.ts.map +0 -1
  343. package/dist/campaign/proposers/trace-analyst.test.d.ts +0 -2
  344. package/dist/campaign/proposers/trace-analyst.test.d.ts.map +0 -1
  345. package/dist/campaign/provenance.d.ts +0 -185
  346. package/dist/campaign/provenance.d.ts.map +0 -1
  347. package/dist/campaign/run-campaign.d.ts +0 -90
  348. package/dist/campaign/run-campaign.d.ts.map +0 -1
  349. package/dist/campaign/score-utils.d.ts +0 -26
  350. package/dist/campaign/score-utils.d.ts.map +0 -1
  351. package/dist/campaign/skill-patch.d.ts +0 -62
  352. package/dist/campaign/skill-patch.d.ts.map +0 -1
  353. package/dist/campaign/storage.d.ts +0 -38
  354. package/dist/campaign/storage.d.ts.map +0 -1
  355. package/dist/campaign/types.d.ts.map +0 -1
  356. package/dist/campaign/worktree/index.d.ts +0 -53
  357. package/dist/campaign/worktree/index.d.ts.map +0 -1
  358. package/dist/canary.d.ts +0 -101
  359. package/dist/canary.d.ts.map +0 -1
  360. package/dist/causal-attribution.d.ts +0 -45
  361. package/dist/causal-attribution.d.ts.map +0 -1
  362. package/dist/chunk-AQ5WQAIV.js.map +0 -1
  363. package/dist/ci-gate.d.ts +0 -44
  364. package/dist/ci-gate.d.ts.map +0 -1
  365. package/dist/cli.d.ts.map +0 -1
  366. package/dist/client.d.ts +0 -77
  367. package/dist/client.d.ts.map +0 -1
  368. package/dist/client.test.d.ts +0 -2
  369. package/dist/client.test.d.ts.map +0 -1
  370. package/dist/command-runner.d.ts +0 -74
  371. package/dist/command-runner.d.ts.map +0 -1
  372. package/dist/command-runner.test.d.ts +0 -2
  373. package/dist/command-runner.test.d.ts.map +0 -1
  374. package/dist/completion-verifier.d.ts +0 -147
  375. package/dist/completion-verifier.d.ts.map +0 -1
  376. package/dist/completion-verifier.test.d.ts +0 -9
  377. package/dist/completion-verifier.test.d.ts.map +0 -1
  378. package/dist/concurrency.d.ts +0 -23
  379. package/dist/concurrency.d.ts.map +0 -1
  380. package/dist/contamination-guard.d.ts +0 -81
  381. package/dist/contamination-guard.d.ts.map +0 -1
  382. package/dist/contract/analyze-runs.d.ts.map +0 -1
  383. package/dist/contract/define-agent-eval.d.ts +0 -52
  384. package/dist/contract/define-agent-eval.d.ts.map +0 -1
  385. package/dist/contract/diff.d.ts +0 -114
  386. package/dist/contract/diff.d.ts.map +0 -1
  387. package/dist/contract/index.d.ts.map +0 -1
  388. package/dist/contract/insight-report.d.ts.map +0 -1
  389. package/dist/contract/insight-types-fwd.d.ts +0 -7
  390. package/dist/contract/insight-types-fwd.d.ts.map +0 -1
  391. package/dist/contract/intake/agent-trace.d.ts +0 -97
  392. package/dist/contract/intake/agent-trace.d.ts.map +0 -1
  393. package/dist/contract/intake/code-agent-session.d.ts.map +0 -1
  394. package/dist/contract/intake/feedback-table.d.ts +0 -87
  395. package/dist/contract/intake/feedback-table.d.ts.map +0 -1
  396. package/dist/contract/intake/index.d.ts +0 -22
  397. package/dist/contract/intake/index.d.ts.map +0 -1
  398. package/dist/contract/intake/otel-spans.d.ts +0 -33
  399. package/dist/contract/intake/otel-spans.d.ts.map +0 -1
  400. package/dist/contract/self-improve.d.ts +0 -284
  401. package/dist/contract/self-improve.d.ts.map +0 -1
  402. package/dist/control-runtime.d.ts.map +0 -1
  403. package/dist/control-runtime.test.d.ts +0 -2
  404. package/dist/control-runtime.test.d.ts.map +0 -1
  405. package/dist/control.d.ts.map +0 -1
  406. package/dist/convergence.d.ts +0 -29
  407. package/dist/convergence.d.ts.map +0 -1
  408. package/dist/cost-ledger.d.ts.map +0 -1
  409. package/dist/cost-ledger.test.d.ts +0 -2
  410. package/dist/cost-ledger.test.d.ts.map +0 -1
  411. package/dist/cost-report.d.ts +0 -43
  412. package/dist/cost-report.d.ts.map +0 -1
  413. package/dist/cost-report.test.d.ts +0 -2
  414. package/dist/cost-report.test.d.ts.map +0 -1
  415. package/dist/cost-tracker.d.ts +0 -76
  416. package/dist/cost-tracker.d.ts.map +0 -1
  417. package/dist/counterfactual.d.ts.map +0 -1
  418. package/dist/cross-trace-diff.d.ts +0 -56
  419. package/dist/cross-trace-diff.d.ts.map +0 -1
  420. package/dist/dataset.d.ts.map +0 -1
  421. package/dist/deploy-gate-layer.d.ts +0 -125
  422. package/dist/deploy-gate-layer.d.ts.map +0 -1
  423. package/dist/deploy-gate-layer.test.d.ts +0 -2
  424. package/dist/deploy-gate-layer.test.d.ts.map +0 -1
  425. package/dist/description-length-gate.d.ts +0 -119
  426. package/dist/description-length-gate.d.ts.map +0 -1
  427. package/dist/detectors/edge.test.d.ts +0 -2
  428. package/dist/detectors/edge.test.d.ts.map +0 -1
  429. package/dist/detectors/index.d.ts +0 -81
  430. package/dist/detectors/index.d.ts.map +0 -1
  431. package/dist/detectors/index.test.d.ts +0 -2
  432. package/dist/detectors/index.test.d.ts.map +0 -1
  433. package/dist/diagnose/causal-sweep.d.ts +0 -100
  434. package/dist/diagnose/causal-sweep.d.ts.map +0 -1
  435. package/dist/diagnose/index.d.ts +0 -36
  436. package/dist/diagnose/index.d.ts.map +0 -1
  437. package/dist/diagnose/remediation.d.ts +0 -68
  438. package/dist/diagnose/remediation.d.ts.map +0 -1
  439. package/dist/diagnose/repair.d.ts +0 -77
  440. package/dist/diagnose/repair.d.ts.map +0 -1
  441. package/dist/discover-personas.d.ts +0 -35
  442. package/dist/discover-personas.d.ts.map +0 -1
  443. package/dist/driver.d.ts +0 -95
  444. package/dist/driver.d.ts.map +0 -1
  445. package/dist/driver.test.d.ts +0 -8
  446. package/dist/driver.test.d.ts.map +0 -1
  447. package/dist/dual-agent-bench.d.ts +0 -81
  448. package/dist/dual-agent-bench.d.ts.map +0 -1
  449. package/dist/error-count-extractor.d.ts +0 -47
  450. package/dist/error-count-extractor.d.ts.map +0 -1
  451. package/dist/error-count-extractor.test.d.ts +0 -2
  452. package/dist/error-count-extractor.test.d.ts.map +0 -1
  453. package/dist/errors.d.ts.map +0 -1
  454. package/dist/eval-campaign.d.ts.map +0 -1
  455. package/dist/eval-campaign.test.d.ts +0 -2
  456. package/dist/eval-campaign.test.d.ts.map +0 -1
  457. package/dist/eval-tools.d.ts +0 -55
  458. package/dist/eval-tools.d.ts.map +0 -1
  459. package/dist/eval-trace-store.d.ts +0 -107
  460. package/dist/eval-trace-store.d.ts.map +0 -1
  461. package/dist/eval-trace-store.test.d.ts +0 -2
  462. package/dist/eval-trace-store.test.d.ts.map +0 -1
  463. package/dist/executor.d.ts +0 -38
  464. package/dist/executor.d.ts.map +0 -1
  465. package/dist/executor.test.d.ts +0 -10
  466. package/dist/executor.test.d.ts.map +0 -1
  467. package/dist/experiment-tracker.d.ts +0 -178
  468. package/dist/experiment-tracker.d.ts.map +0 -1
  469. package/dist/experiment-tracker.test.d.ts +0 -2
  470. package/dist/experiment-tracker.test.d.ts.map +0 -1
  471. package/dist/failure-taxonomy.d.ts +0 -38
  472. package/dist/failure-taxonomy.d.ts.map +0 -1
  473. package/dist/feedback-trajectory.d.ts.map +0 -1
  474. package/dist/feedback-trajectory.test.d.ts +0 -2
  475. package/dist/feedback-trajectory.test.d.ts.map +0 -1
  476. package/dist/flow-layer.d.ts +0 -90
  477. package/dist/flow-layer.d.ts.map +0 -1
  478. package/dist/flow-layer.test.d.ts +0 -2
  479. package/dist/flow-layer.test.d.ts.map +0 -1
  480. package/dist/fuzz/capsule.d.ts +0 -46
  481. package/dist/fuzz/capsule.d.ts.map +0 -1
  482. package/dist/fuzz/cube.d.ts +0 -36
  483. package/dist/fuzz/cube.d.ts.map +0 -1
  484. package/dist/fuzz/explorer-cost.test.d.ts +0 -2
  485. package/dist/fuzz/explorer-cost.test.d.ts.map +0 -1
  486. package/dist/fuzz/explorer.d.ts +0 -64
  487. package/dist/fuzz/explorer.d.ts.map +0 -1
  488. package/dist/fuzz/fuzz-agent.d.ts +0 -16
  489. package/dist/fuzz/fuzz-agent.d.ts.map +0 -1
  490. package/dist/fuzz/fuzz-agent.test.d.ts +0 -2
  491. package/dist/fuzz/fuzz-agent.test.d.ts.map +0 -1
  492. package/dist/fuzz/gates.d.ts +0 -33
  493. package/dist/fuzz/gates.d.ts.map +0 -1
  494. package/dist/fuzz/index.d.ts +0 -26
  495. package/dist/fuzz/index.d.ts.map +0 -1
  496. package/dist/fuzz/policies.d.ts +0 -28
  497. package/dist/fuzz/policies.d.ts.map +0 -1
  498. package/dist/fuzz/tools.d.ts +0 -20
  499. package/dist/fuzz/tools.d.ts.map +0 -1
  500. package/dist/fuzz/types.d.ts +0 -307
  501. package/dist/fuzz/types.d.ts.map +0 -1
  502. package/dist/golden-matcher.d.ts +0 -71
  503. package/dist/golden-matcher.d.ts.map +0 -1
  504. package/dist/governance/eu-ai-act.d.ts +0 -37
  505. package/dist/governance/eu-ai-act.d.ts.map +0 -1
  506. package/dist/governance/index.d.ts.map +0 -1
  507. package/dist/governance/nist-ai-rmf.d.ts +0 -15
  508. package/dist/governance/nist-ai-rmf.d.ts.map +0 -1
  509. package/dist/governance/soc2.d.ts +0 -12
  510. package/dist/governance/soc2.d.ts.map +0 -1
  511. package/dist/governance/types.d.ts +0 -66
  512. package/dist/governance/types.d.ts.map +0 -1
  513. package/dist/harness-optimizer.d.ts +0 -82
  514. package/dist/harness-optimizer.d.ts.map +0 -1
  515. package/dist/held-out-gate.d.ts +0 -135
  516. package/dist/held-out-gate.d.ts.map +0 -1
  517. package/dist/hosted/client.d.ts +0 -73
  518. package/dist/hosted/client.d.ts.map +0 -1
  519. package/dist/hosted/from-env.test.d.ts +0 -8
  520. package/dist/hosted/from-env.test.d.ts.map +0 -1
  521. package/dist/hosted/index.d.ts.map +0 -1
  522. package/dist/hosted/types.d.ts +0 -159
  523. package/dist/hosted/types.d.ts.map +0 -1
  524. package/dist/index.d.ts.map +0 -1
  525. package/dist/integrity/backend-integrity.d.ts +0 -71
  526. package/dist/integrity/backend-integrity.d.ts.map +0 -1
  527. package/dist/integrity/preflight.d.ts +0 -72
  528. package/dist/integrity/preflight.d.ts.map +0 -1
  529. package/dist/integrity/preflight.test.d.ts +0 -2
  530. package/dist/integrity/preflight.test.d.ts.map +0 -1
  531. package/dist/integrity/single-backend.d.ts +0 -67
  532. package/dist/integrity/single-backend.d.ts.map +0 -1
  533. package/dist/intent-match-judge.d.ts +0 -69
  534. package/dist/intent-match-judge.d.ts.map +0 -1
  535. package/dist/intent-match-judge.test.d.ts +0 -2
  536. package/dist/intent-match-judge.test.d.ts.map +0 -1
  537. package/dist/judge-calibration.d.ts.map +0 -1
  538. package/dist/judge-ensemble.d.ts +0 -66
  539. package/dist/judge-ensemble.d.ts.map +0 -1
  540. package/dist/judge-ensemble.test.d.ts +0 -8
  541. package/dist/judge-ensemble.test.d.ts.map +0 -1
  542. package/dist/judge-families.d.ts +0 -38
  543. package/dist/judge-families.d.ts.map +0 -1
  544. package/dist/judge-panel.d.ts +0 -65
  545. package/dist/judge-panel.d.ts.map +0 -1
  546. package/dist/judge-retry.d.ts +0 -70
  547. package/dist/judge-retry.d.ts.map +0 -1
  548. package/dist/judge-runner.d.ts +0 -36
  549. package/dist/judge-runner.d.ts.map +0 -1
  550. package/dist/judge-runner.test.d.ts +0 -2
  551. package/dist/judge-runner.test.d.ts.map +0 -1
  552. package/dist/judges.d.ts +0 -74
  553. package/dist/judges.d.ts.map +0 -1
  554. package/dist/keyword-coverage-judge.d.ts +0 -89
  555. package/dist/keyword-coverage-judge.d.ts.map +0 -1
  556. package/dist/keyword-coverage-judge.test.d.ts +0 -2
  557. package/dist/keyword-coverage-judge.test.d.ts.map +0 -1
  558. package/dist/knowledge/index.d.ts.map +0 -1
  559. package/dist/knowledge/readiness.d.ts +0 -26
  560. package/dist/knowledge/readiness.d.ts.map +0 -1
  561. package/dist/knowledge/types.d.ts +0 -75
  562. package/dist/knowledge/types.d.ts.map +0 -1
  563. package/dist/live-proof.d.ts +0 -62
  564. package/dist/live-proof.d.ts.map +0 -1
  565. package/dist/llm-client.d.ts.map +0 -1
  566. package/dist/llm-client.test.d.ts +0 -2
  567. package/dist/llm-client.test.d.ts.map +0 -1
  568. package/dist/locked-jsonl-appender.d.ts.map +0 -1
  569. package/dist/matrix/aggregation.d.ts +0 -16
  570. package/dist/matrix/aggregation.d.ts.map +0 -1
  571. package/dist/matrix/index.d.ts.map +0 -1
  572. package/dist/matrix/runner.d.ts +0 -15
  573. package/dist/matrix/runner.d.ts.map +0 -1
  574. package/dist/matrix/types.d.ts.map +0 -1
  575. package/dist/meta-eval/calibration.d.ts +0 -47
  576. package/dist/meta-eval/calibration.d.ts.map +0 -1
  577. package/dist/meta-eval/correlation-study.d.ts +0 -53
  578. package/dist/meta-eval/correlation-study.d.ts.map +0 -1
  579. package/dist/meta-eval/index.d.ts.map +0 -1
  580. package/dist/meta-eval/outcome-store.d.ts.map +0 -1
  581. package/dist/meta-eval/rubric-predictive-validity.d.ts.map +0 -1
  582. package/dist/meta-eval/sentinel.d.ts +0 -169
  583. package/dist/meta-eval/sentinel.d.ts.map +0 -1
  584. package/dist/metrics.d.ts +0 -63
  585. package/dist/metrics.d.ts.map +0 -1
  586. package/dist/model-seats.d.ts +0 -71
  587. package/dist/model-seats.d.ts.map +0 -1
  588. package/dist/model-seats.test.d.ts +0 -2
  589. package/dist/model-seats.test.d.ts.map +0 -1
  590. package/dist/muffled-gate-scanner.d.ts +0 -102
  591. package/dist/muffled-gate-scanner.d.ts.map +0 -1
  592. package/dist/multi-layer-verifier.d.ts.map +0 -1
  593. package/dist/multi-layer-verifier.test.d.ts +0 -2
  594. package/dist/multi-layer-verifier.test.d.ts.map +0 -1
  595. package/dist/multi-toolchain-layer.d.ts +0 -80
  596. package/dist/multi-toolchain-layer.d.ts.map +0 -1
  597. package/dist/multi-toolchain-layer.test.d.ts +0 -2
  598. package/dist/multi-toolchain-layer.test.d.ts.map +0 -1
  599. package/dist/multishot/default-tools.d.ts +0 -34
  600. package/dist/multishot/default-tools.d.ts.map +0 -1
  601. package/dist/multishot/index.d.ts.map +0 -1
  602. package/dist/multishot/judges.d.ts +0 -32
  603. package/dist/multishot/judges.d.ts.map +0 -1
  604. package/dist/multishot/matrix.d.ts +0 -107
  605. package/dist/multishot/matrix.d.ts.map +0 -1
  606. package/dist/multishot/multishot.d.ts +0 -23
  607. package/dist/multishot/multishot.d.ts.map +0 -1
  608. package/dist/multishot/router.d.ts +0 -37
  609. package/dist/multishot/router.d.ts.map +0 -1
  610. package/dist/multishot/types.d.ts +0 -60
  611. package/dist/multishot/types.d.ts.map +0 -1
  612. package/dist/observability.d.ts +0 -71
  613. package/dist/observability.d.ts.map +0 -1
  614. package/dist/oracle.d.ts +0 -55
  615. package/dist/oracle.d.ts.map +0 -1
  616. package/dist/orthogonality.d.ts +0 -35
  617. package/dist/orthogonality.d.ts.map +0 -1
  618. package/dist/otel-pipeline.d.ts +0 -31
  619. package/dist/otel-pipeline.d.ts.map +0 -1
  620. package/dist/paraphrase.d.ts +0 -107
  621. package/dist/paraphrase.d.ts.map +0 -1
  622. package/dist/pareto.d.ts.map +0 -1
  623. package/dist/partition-held-out.d.ts +0 -70
  624. package/dist/partition-held-out.d.ts.map +0 -1
  625. package/dist/partition-held-out.test.d.ts +0 -2
  626. package/dist/partition-held-out.test.d.ts.map +0 -1
  627. package/dist/perf/index.d.ts.map +0 -1
  628. package/dist/perf/integrity.d.ts +0 -30
  629. package/dist/perf/integrity.d.ts.map +0 -1
  630. package/dist/perf/journey.d.ts +0 -45
  631. package/dist/perf/journey.d.ts.map +0 -1
  632. package/dist/perf/ratchet.d.ts +0 -47
  633. package/dist/perf/ratchet.d.ts.map +0 -1
  634. package/dist/pipelines/budget-breach.d.ts +0 -31
  635. package/dist/pipelines/budget-breach.d.ts.map +0 -1
  636. package/dist/pipelines/budget-breach.test.d.ts +0 -2
  637. package/dist/pipelines/budget-breach.test.d.ts.map +0 -1
  638. package/dist/pipelines/failure-cluster.d.ts +0 -38
  639. package/dist/pipelines/failure-cluster.d.ts.map +0 -1
  640. package/dist/pipelines/failure-cluster.test.d.ts +0 -2
  641. package/dist/pipelines/failure-cluster.test.d.ts.map +0 -1
  642. package/dist/pipelines/first-divergence.d.ts +0 -26
  643. package/dist/pipelines/first-divergence.d.ts.map +0 -1
  644. package/dist/pipelines/first-divergence.test.d.ts +0 -2
  645. package/dist/pipelines/first-divergence.test.d.ts.map +0 -1
  646. package/dist/pipelines/index.d.ts.map +0 -1
  647. package/dist/pipelines/judge-agreement.d.ts +0 -26
  648. package/dist/pipelines/judge-agreement.d.ts.map +0 -1
  649. package/dist/pipelines/judge-agreement.test.d.ts +0 -2
  650. package/dist/pipelines/judge-agreement.test.d.ts.map +0 -1
  651. package/dist/pipelines/regression.d.ts +0 -23
  652. package/dist/pipelines/regression.d.ts.map +0 -1
  653. package/dist/pipelines/regression.test.d.ts +0 -2
  654. package/dist/pipelines/regression.test.d.ts.map +0 -1
  655. package/dist/pipelines/stuck-loop.d.ts +0 -32
  656. package/dist/pipelines/stuck-loop.d.ts.map +0 -1
  657. package/dist/pipelines/stuck-loop.test.d.ts +0 -2
  658. package/dist/pipelines/stuck-loop.test.d.ts.map +0 -1
  659. package/dist/pipelines/tool-waste.d.ts +0 -34
  660. package/dist/pipelines/tool-waste.d.ts.map +0 -1
  661. package/dist/pipelines/tool-waste.test.d.ts +0 -2
  662. package/dist/pipelines/tool-waste.test.d.ts.map +0 -1
  663. package/dist/playbook.d.ts +0 -16
  664. package/dist/playbook.d.ts.map +0 -1
  665. package/dist/pr-review-benchmark.d.ts +0 -88
  666. package/dist/pr-review-benchmark.d.ts.map +0 -1
  667. package/dist/pr-review-benchmark.test.d.ts +0 -2
  668. package/dist/pr-review-benchmark.test.d.ts.map +0 -1
  669. package/dist/pre-registration.d.ts +0 -125
  670. package/dist/pre-registration.d.ts.map +0 -1
  671. package/dist/prm/builtin-rubrics.d.ts +0 -33
  672. package/dist/prm/builtin-rubrics.d.ts.map +0 -1
  673. package/dist/prm/index.d.ts.map +0 -1
  674. package/dist/prm/inference.d.ts +0 -29
  675. package/dist/prm/inference.d.ts.map +0 -1
  676. package/dist/prm/inference.test.d.ts +0 -2
  677. package/dist/prm/inference.test.d.ts.map +0 -1
  678. package/dist/prm/rubric.d.ts.map +0 -1
  679. package/dist/prm/training-export.d.ts +0 -38
  680. package/dist/prm/training-export.d.ts.map +0 -1
  681. package/dist/produced-state.d.ts +0 -63
  682. package/dist/produced-state.d.ts.map +0 -1
  683. package/dist/produced-state.test.d.ts +0 -8
  684. package/dist/produced-state.test.d.ts.map +0 -1
  685. package/dist/profile/baselines.d.ts +0 -37
  686. package/dist/profile/baselines.d.ts.map +0 -1
  687. package/dist/profile/index.d.ts +0 -105
  688. package/dist/profile/index.d.ts.map +0 -1
  689. package/dist/promotion-gate.d.ts +0 -93
  690. package/dist/promotion-gate.d.ts.map +0 -1
  691. package/dist/prompt-registry.d.ts +0 -41
  692. package/dist/prompt-registry.d.ts.map +0 -1
  693. package/dist/propose-review-control.d.ts +0 -49
  694. package/dist/propose-review-control.d.ts.map +0 -1
  695. package/dist/propose-review-control.test.d.ts +0 -2
  696. package/dist/propose-review-control.test.d.ts.map +0 -1
  697. package/dist/propose-review.d.ts +0 -155
  698. package/dist/propose-review.d.ts.map +0 -1
  699. package/dist/red-team.d.ts.map +0 -1
  700. package/dist/reference-replay-steering.d.ts +0 -11
  701. package/dist/reference-replay-steering.d.ts.map +0 -1
  702. package/dist/reference-replay.d.ts +0 -176
  703. package/dist/reference-replay.d.ts.map +0 -1
  704. package/dist/reflective-mutation.d.ts +0 -79
  705. package/dist/reflective-mutation.d.ts.map +0 -1
  706. package/dist/registry.d.ts +0 -31
  707. package/dist/registry.d.ts.map +0 -1
  708. package/dist/release-confidence.d.ts +0 -128
  709. package/dist/release-confidence.d.ts.map +0 -1
  710. package/dist/release-report.d.ts +0 -11
  711. package/dist/release-report.d.ts.map +0 -1
  712. package/dist/replay.d.ts +0 -120
  713. package/dist/replay.d.ts.map +0 -1
  714. package/dist/reporter.d.ts +0 -14
  715. package/dist/reporter.d.ts.map +0 -1
  716. package/dist/reporting.d.ts.map +0 -1
  717. package/dist/researcher.d.ts +0 -140
  718. package/dist/researcher.d.ts.map +0 -1
  719. package/dist/reviewer.d.ts +0 -118
  720. package/dist/reviewer.d.ts.map +0 -1
  721. package/dist/reviewer.test.d.ts +0 -2
  722. package/dist/reviewer.test.d.ts.map +0 -1
  723. package/dist/reward-model-export.d.ts +0 -60
  724. package/dist/reward-model-export.d.ts.map +0 -1
  725. package/dist/rl/active-curriculum.d.ts +0 -110
  726. package/dist/rl/active-curriculum.d.ts.map +0 -1
  727. package/dist/rl/adaptation-eval.d.ts +0 -109
  728. package/dist/rl/adaptation-eval.d.ts.map +0 -1
  729. package/dist/rl/adversarial.d.ts.map +0 -1
  730. package/dist/rl/compute-curves.d.ts +0 -127
  731. package/dist/rl/compute-curves.d.ts.map +0 -1
  732. package/dist/rl/contamination.d.ts +0 -117
  733. package/dist/rl/contamination.d.ts.map +0 -1
  734. package/dist/rl/corpus.d.ts +0 -55
  735. package/dist/rl/corpus.d.ts.map +0 -1
  736. package/dist/rl/corpus.test.d.ts +0 -2
  737. package/dist/rl/corpus.test.d.ts.map +0 -1
  738. package/dist/rl/dataset.d.ts +0 -102
  739. package/dist/rl/dataset.d.ts.map +0 -1
  740. package/dist/rl/dataset.test.d.ts +0 -2
  741. package/dist/rl/dataset.test.d.ts.map +0 -1
  742. package/dist/rl/exporters.d.ts +0 -141
  743. package/dist/rl/exporters.d.ts.map +0 -1
  744. package/dist/rl/index.d.ts +0 -49
  745. package/dist/rl/index.d.ts.map +0 -1
  746. package/dist/rl/off-policy.d.ts.map +0 -1
  747. package/dist/rl/predictive-validity-researcher.d.ts +0 -69
  748. package/dist/rl/predictive-validity-researcher.d.ts.map +0 -1
  749. package/dist/rl/preferences.d.ts +0 -141
  750. package/dist/rl/preferences.d.ts.map +0 -1
  751. package/dist/rl/process-reward.d.ts +0 -122
  752. package/dist/rl/process-reward.d.ts.map +0 -1
  753. package/dist/rl/reward-hacking.d.ts +0 -104
  754. package/dist/rl/reward-hacking.d.ts.map +0 -1
  755. package/dist/rl/rl-campaign.d.ts +0 -85
  756. package/dist/rl/rl-campaign.d.ts.map +0 -1
  757. package/dist/rl/run-record-adapters.d.ts +0 -56
  758. package/dist/rl/run-record-adapters.d.ts.map +0 -1
  759. package/dist/rl/sim-fidelity.d.ts +0 -166
  760. package/dist/rl/sim-fidelity.d.ts.map +0 -1
  761. package/dist/rl/sim-fidelity.test.d.ts +0 -2
  762. package/dist/rl/sim-fidelity.test.d.ts.map +0 -1
  763. package/dist/rl/tournament.d.ts +0 -115
  764. package/dist/rl/tournament.d.ts.map +0 -1
  765. package/dist/rl/verifiable-reward.d.ts +0 -124
  766. package/dist/rl/verifiable-reward.d.ts.map +0 -1
  767. package/dist/run-critic.d.ts +0 -23
  768. package/dist/run-critic.d.ts.map +0 -1
  769. package/dist/run-evidence.d.ts +0 -32
  770. package/dist/run-evidence.d.ts.map +0 -1
  771. package/dist/run-record.d.ts.map +0 -1
  772. package/dist/run-record.test.d.ts +0 -2
  773. package/dist/run-record.test.d.ts.map +0 -1
  774. package/dist/run-score.d.ts +0 -31
  775. package/dist/run-score.d.ts.map +0 -1
  776. package/dist/runtime-trajectory.d.ts +0 -47
  777. package/dist/runtime-trajectory.d.ts.map +0 -1
  778. package/dist/sandbox-harness.d.ts.map +0 -1
  779. package/dist/sandbox-harness.test.d.ts +0 -2
  780. package/dist/sandbox-harness.test.d.ts.map +0 -1
  781. package/dist/sandbox-pool.d.ts +0 -74
  782. package/dist/sandbox-pool.d.ts.map +0 -1
  783. package/dist/sandbox-pool.test.d.ts +0 -2
  784. package/dist/sandbox-pool.test.d.ts.map +0 -1
  785. package/dist/scorecard.d.ts +0 -133
  786. package/dist/scorecard.d.ts.map +0 -1
  787. package/dist/scorecard.test.d.ts +0 -2
  788. package/dist/scorecard.test.d.ts.map +0 -1
  789. package/dist/self-play.d.ts +0 -69
  790. package/dist/self-play.d.ts.map +0 -1
  791. package/dist/semantic-concept-judge.d.ts +0 -135
  792. package/dist/semantic-concept-judge.d.ts.map +0 -1
  793. package/dist/semantic-concept-judge.test.d.ts +0 -2
  794. package/dist/semantic-concept-judge.test.d.ts.map +0 -1
  795. package/dist/sequential.d.ts.map +0 -1
  796. package/dist/series-convergence.d.ts.map +0 -1
  797. package/dist/slo.d.ts +0 -48
  798. package/dist/slo.d.ts.map +0 -1
  799. package/dist/state-continuity.d.ts +0 -47
  800. package/dist/state-continuity.d.ts.map +0 -1
  801. package/dist/statistics.d.ts.map +0 -1
  802. package/dist/statistics.test.d.ts +0 -2
  803. package/dist/statistics.test.d.ts.map +0 -1
  804. package/dist/steering-optimizer.d.ts +0 -58
  805. package/dist/steering-optimizer.d.ts.map +0 -1
  806. package/dist/steering.d.ts +0 -24
  807. package/dist/steering.d.ts.map +0 -1
  808. package/dist/storyboard/code-edit.d.ts +0 -64
  809. package/dist/storyboard/code-edit.d.ts.map +0 -1
  810. package/dist/storyboard/code-edit.test.d.ts +0 -2
  811. package/dist/storyboard/code-edit.test.d.ts.map +0 -1
  812. package/dist/storyboard/index.d.ts.map +0 -1
  813. package/dist/storyboard/index.test.d.ts +0 -2
  814. package/dist/storyboard/index.test.d.ts.map +0 -1
  815. package/dist/summary-report.d.ts.map +0 -1
  816. package/dist/telemetry/client.d.ts +0 -35
  817. package/dist/telemetry/client.d.ts.map +0 -1
  818. package/dist/telemetry/index.d.ts.map +0 -1
  819. package/dist/telemetry/schema.d.ts +0 -61
  820. package/dist/telemetry/schema.d.ts.map +0 -1
  821. package/dist/telemetry/sink-fetch.d.ts +0 -39
  822. package/dist/telemetry/sink-fetch.d.ts.map +0 -1
  823. package/dist/telemetry/sink-file.d.ts.map +0 -1
  824. package/dist/test-graded-scenario.d.ts +0 -42
  825. package/dist/test-graded-scenario.d.ts.map +0 -1
  826. package/dist/testing.d.ts.map +0 -1
  827. package/dist/tool-use-metrics.d.ts +0 -35
  828. package/dist/tool-use-metrics.d.ts.map +0 -1
  829. package/dist/trace/capture-fetch.d.ts +0 -48
  830. package/dist/trace/capture-fetch.d.ts.map +0 -1
  831. package/dist/trace/capture-fetch.test.d.ts +0 -2
  832. package/dist/trace/capture-fetch.test.d.ts.map +0 -1
  833. package/dist/trace/emitter.d.ts.map +0 -1
  834. package/dist/trace/extract-usage.d.ts +0 -46
  835. package/dist/trace/extract-usage.d.ts.map +0 -1
  836. package/dist/trace/extract-usage.test.d.ts +0 -2
  837. package/dist/trace/extract-usage.test.d.ts.map +0 -1
  838. package/dist/trace/index.d.ts +0 -15
  839. package/dist/trace/index.d.ts.map +0 -1
  840. package/dist/trace/integrity.d.ts.map +0 -1
  841. package/dist/trace/otel-bridge.d.ts +0 -29
  842. package/dist/trace/otel-bridge.d.ts.map +0 -1
  843. package/dist/trace/otel-export.d.ts +0 -52
  844. package/dist/trace/otel-export.d.ts.map +0 -1
  845. package/dist/trace/otel.d.ts +0 -57
  846. package/dist/trace/otel.d.ts.map +0 -1
  847. package/dist/trace/otlp-attributes.d.ts +0 -17
  848. package/dist/trace/otlp-attributes.d.ts.map +0 -1
  849. package/dist/trace/query.d.ts +0 -29
  850. package/dist/trace/query.d.ts.map +0 -1
  851. package/dist/trace/query.test.d.ts +0 -2
  852. package/dist/trace/query.test.d.ts.map +0 -1
  853. package/dist/trace/raw-provider-sink.d.ts.map +0 -1
  854. package/dist/trace/redact.d.ts.map +0 -1
  855. package/dist/trace/schema.d.ts.map +0 -1
  856. package/dist/trace/store-to-otlp.d.ts +0 -72
  857. package/dist/trace/store-to-otlp.d.ts.map +0 -1
  858. package/dist/trace/store-to-otlp.test.d.ts +0 -2
  859. package/dist/trace/store-to-otlp.test.d.ts.map +0 -1
  860. package/dist/trace/store.d.ts.map +0 -1
  861. package/dist/trace/store.test.d.ts +0 -2
  862. package/dist/trace/store.test.d.ts.map +0 -1
  863. package/dist/trace-analyst/analyst.d.ts.map +0 -1
  864. package/dist/trace-analyst/analyst.test.d.ts +0 -2
  865. package/dist/trace-analyst/analyst.test.d.ts.map +0 -1
  866. package/dist/trace-analyst/behavioral-metrics.d.ts +0 -40
  867. package/dist/trace-analyst/behavioral-metrics.d.ts.map +0 -1
  868. package/dist/trace-analyst/behavioral-metrics.test.d.ts +0 -2
  869. package/dist/trace-analyst/behavioral-metrics.test.d.ts.map +0 -1
  870. package/dist/trace-analyst/hook.d.ts +0 -55
  871. package/dist/trace-analyst/hook.d.ts.map +0 -1
  872. package/dist/trace-analyst/index.d.ts +0 -18
  873. package/dist/trace-analyst/index.d.ts.map +0 -1
  874. package/dist/trace-analyst/insights.d.ts +0 -71
  875. package/dist/trace-analyst/insights.d.ts.map +0 -1
  876. package/dist/trace-analyst/insights.test.d.ts +0 -2
  877. package/dist/trace-analyst/insights.test.d.ts.map +0 -1
  878. package/dist/trace-analyst/otlp-flatten.d.ts +0 -42
  879. package/dist/trace-analyst/otlp-flatten.d.ts.map +0 -1
  880. package/dist/trace-analyst/otlp-span.d.ts +0 -85
  881. package/dist/trace-analyst/otlp-span.d.ts.map +0 -1
  882. package/dist/trace-analyst/otlp-span.test.d.ts +0 -2
  883. package/dist/trace-analyst/otlp-span.test.d.ts.map +0 -1
  884. package/dist/trace-analyst/otlp-to-run-records.d.ts +0 -115
  885. package/dist/trace-analyst/otlp-to-run-records.d.ts.map +0 -1
  886. package/dist/trace-analyst/otlp-to-run-records.test.d.ts +0 -2
  887. package/dist/trace-analyst/otlp-to-run-records.test.d.ts.map +0 -1
  888. package/dist/trace-analyst/otlp-to-run-records.timestamps.test.d.ts +0 -2
  889. package/dist/trace-analyst/otlp-to-run-records.timestamps.test.d.ts.map +0 -1
  890. package/dist/trace-analyst/prompts.d.ts +0 -6
  891. package/dist/trace-analyst/prompts.d.ts.map +0 -1
  892. package/dist/trace-analyst/store-otlp.d.ts +0 -126
  893. package/dist/trace-analyst/store-otlp.d.ts.map +0 -1
  894. package/dist/trace-analyst/store-otlp.test.d.ts +0 -8
  895. package/dist/trace-analyst/store-otlp.test.d.ts.map +0 -1
  896. package/dist/trace-analyst/store-otlp.timestamps.test.d.ts +0 -2
  897. package/dist/trace-analyst/store-otlp.timestamps.test.d.ts.map +0 -1
  898. package/dist/trace-analyst/store.d.ts +0 -63
  899. package/dist/trace-analyst/store.d.ts.map +0 -1
  900. package/dist/trace-analyst/tools.d.ts +0 -44
  901. package/dist/trace-analyst/tools.d.ts.map +0 -1
  902. package/dist/trace-analyst/tools.test.d.ts +0 -10
  903. package/dist/trace-analyst/tools.test.d.ts.map +0 -1
  904. package/dist/trace-analyst/types.d.ts.map +0 -1
  905. package/dist/trace-contracts.d.ts +0 -180
  906. package/dist/trace-contracts.d.ts.map +0 -1
  907. package/dist/traced-analyst.d.ts +0 -26
  908. package/dist/traced-analyst.d.ts.map +0 -1
  909. package/dist/traced-judges.d.ts +0 -27
  910. package/dist/traced-judges.d.ts.map +0 -1
  911. package/dist/traces.d.ts.map +0 -1
  912. package/dist/trajectory.d.ts.map +0 -1
  913. package/dist/types.d.ts.map +0 -1
  914. package/dist/ui-finding.d.ts +0 -104
  915. package/dist/ui-finding.d.ts.map +0 -1
  916. package/dist/verdict-cache.d.ts +0 -78
  917. package/dist/verdict-cache.d.ts.map +0 -1
  918. package/dist/verdict-cache.test.d.ts +0 -2
  919. package/dist/verdict-cache.test.d.ts.map +0 -1
  920. package/dist/verdict.d.ts.map +0 -1
  921. package/dist/visual-diff.d.ts +0 -32
  922. package/dist/visual-diff.d.ts.map +0 -1
  923. package/dist/wire/handlers.d.ts +0 -54
  924. package/dist/wire/handlers.d.ts.map +0 -1
  925. package/dist/wire/index.d.ts.map +0 -1
  926. package/dist/wire/openapi.d.ts +0 -3
  927. package/dist/wire/openapi.d.ts.map +0 -1
  928. package/dist/wire/rpc.d.ts +0 -21
  929. package/dist/wire/rpc.d.ts.map +0 -1
  930. package/dist/wire/rubrics.d.ts +0 -34
  931. package/dist/wire/rubrics.d.ts.map +0 -1
  932. package/dist/wire/schemas.d.ts +0 -410
  933. package/dist/wire/schemas.d.ts.map +0 -1
  934. package/dist/wire/server.d.ts +0 -60
  935. package/dist/wire/server.d.ts.map +0 -1
  936. package/dist/workflow/event-schema.d.ts +0 -5
  937. package/dist/workflow/event-schema.d.ts.map +0 -1
  938. package/dist/workflow/feedback-pack.d.ts +0 -99
  939. package/dist/workflow/feedback-pack.d.ts.map +0 -1
  940. package/dist/workflow/index.d.ts.map +0 -1
  941. package/dist/workflow/intelligence-export.d.ts +0 -62
  942. package/dist/workflow/intelligence-export.d.ts.map +0 -1
  943. package/dist/workflow/partner-report.d.ts +0 -49
  944. package/dist/workflow/partner-report.d.ts.map +0 -1
  945. package/dist/workflow/phase-graph.d.ts +0 -43
  946. package/dist/workflow/phase-graph.d.ts.map +0 -1
  947. package/dist/workflow/promotion-gate.d.ts +0 -61
  948. package/dist/workflow/promotion-gate.d.ts.map +0 -1
  949. package/dist/workflow/run-record.d.ts +0 -12
  950. package/dist/workflow/run-record.d.ts.map +0 -1
  951. package/dist/workflow/runtime-adapter.d.ts +0 -20
  952. package/dist/workflow/runtime-adapter.d.ts.map +0 -1
  953. package/dist/workflow/sanitize.d.ts +0 -21
  954. package/dist/workflow/sanitize.d.ts.map +0 -1
  955. package/dist/workflow/schema.d.ts +0 -5
  956. package/dist/workflow/schema.d.ts.map +0 -1
  957. package/dist/workflow/summary.d.ts +0 -43
  958. package/dist/workflow/summary.d.ts.map +0 -1
  959. package/dist/workflow/trace-event-fields.d.ts +0 -6
  960. package/dist/workflow/trace-event-fields.d.ts.map +0 -1
  961. package/dist/workflow/trajectory.d.ts +0 -15
  962. package/dist/workflow/trajectory.d.ts.map +0 -1
  963. package/dist/workflow/types.d.ts +0 -68
  964. package/dist/workflow/types.d.ts.map +0 -1
  965. package/dist/workspace-inspector.d.ts +0 -67
  966. package/dist/workspace-inspector.d.ts.map +0 -1
  967. package/dist/wrangler-deploy-runner.test.d.ts +0 -2
  968. package/dist/wrangler-deploy-runner.test.d.ts.map +0 -1
@@ -1,108 +1,825 @@
1
+ import { S as Scenario, M as MutableSurface, b as DispatchContext, a as JudgeConfig, e as SurfaceProposer, f as Gate, L as LabeledScenarioStore, C as CampaignResult, i as GateDecision } from '../types-BMahhhio.js';
2
+ export { j as CampaignAggregates, k as CampaignArtifactWriter, l as CampaignCellResult, m as CampaignCostMeter, c as CampaignTraceWriter, n as CodeSurface, D as Dispatch, g as GateContext, G as GateResult, o as GenerationCandidate, d as GenerationRecord, p as JudgeDimension, J as JudgeScore, h as Mutator, O as OptimizationProposer, q as OptimizerConfig, r as SessionScript } from '../types-BMahhhio.js';
3
+ import { L as LoopProvenanceRecord, R as RunEvalOptions } from '../provenance-CIxfBnkl.js';
4
+ export { A as AxisEvidence, a as AxisVerdict, B as BuildEvidenceVectorOptions, D as DefaultProductionGateOptions, E as EvidenceVector, b as EvolutionaryProposerOptions, H as HeldOutGateOptions, O as ObjectiveSource, P as ParetoSignificanceGateOptions, c as PromotionObjective, d as PromotionPolicy, e as buildEvidenceVector, f as composeGate, g as defaultProductionGate, h as evolutionaryProposer, i as heldOutGate, p as paretoPolicy, j as paretoSignificanceGate, r as runEval } from '../provenance-CIxfBnkl.js';
5
+ import { C as CampaignStorage, a as RunOptimizationOptions, b as RunImprovementLoopResult } from '../gepa-Dprxvz8r.js';
6
+ export { G as GepaProposerOptions, R as RunCampaignOptions, c as RunImprovementLoopOptions, f as fsCampaignStorage, g as gepaProposer, i as inMemoryCampaignStorage, r as runCampaign, d as runImprovementLoop } from '../gepa-Dprxvz8r.js';
7
+ export { D as DeploymentOutcome, F as FileSystemOutcomeStore, a as FileSystemOutcomeStoreOptions, I as InMemoryOutcomeStore, b as OutcomeStore } from '../outcome-store-rnXLEqSn.js';
8
+ import { HostedTenant, EvalRunCellScore, EvalRunGenerationSnapshot, EvalRunEvent, TraceSpanEvent } from '../hosted/index.js';
9
+ import { R as RunRecord, a as RunSplitTag } from '../run-record-CP2ObebC.js';
10
+ import { I as InsightReport } from '../insight-report-BnRjTibG.js';
11
+ export { F as FailureClusterInsight, a as InterRaterInsight, J as JudgeInsight, L as LiftInsight, O as OutcomeCorrelationInsight, R as Recommendation, b as ReleaseSummary, S as ScalarDistribution } from '../insight-report-BnRjTibG.js';
12
+ export { D as DefaultAnalystRegistryOptions, c as buildDefaultAnalystRegistry } from '../default-registry-GyE8X5SP.js';
13
+ export { c as AnalystFinding } from '../types-B5x54y6n.js';
14
+ import { A as AnalyzeRunsOptions } from '../analyze-runs-DtT6F_6T.js';
15
+ export { a as analyzeRuns } from '../analyze-runs-DtT6F_6T.js';
16
+ export { C as CodeAgentSessionDiagnostic, a as CodeAgentSessionIntakeOptions, b as CodeAgentSessionIntakeResult, c as CodeAgentSessionMetrics, d as CodeAgentSessionSource, P as ParsedCodeAgentJsonl, f as fromClaudeCodeSession, e as fromCodexSession, g as fromKimiCodeSession, h as fromOpenCodeSession, i as fromPiSession, j as fromPigraphSession, p as parseCodeAgentJsonl } from '../code-agent-session-CPHRCb4-.js';
17
+ import '../red-team-BWdoyleI.js';
18
+ import '../dataset-BbGkaN2I.js';
19
+ import '../errors-CzMUYo7b.js';
20
+ import '../store-BcFXE6LG.js';
21
+ import '../schema-m0gsnbt3.js';
22
+ import '../pareto-E-pembql.js';
23
+ import '../statistics-CCJpTGOS.js';
24
+ import '../judge-calibration-0p2QcWNE.js';
25
+ import '../types-C7DGg5ex.js';
26
+ import '@tangle-network/tcloud';
27
+ import '../llm-client-Bj7g0rqu.js';
28
+ import '../raw-provider-sink-C46HDghv.js';
29
+ import '@tangle-network/agent-interface';
30
+ import '../summary-report-CInXwsza.js';
31
+ import '../failure-cluster-DH9Flgcf.js';
32
+ import '@ax-llm/ax';
33
+ import '../kind-factory-X3eDYbKn.js';
34
+ import '../store-C1YxJDEK.js';
35
+ import 'zod';
36
+
1
37
  /**
2
- * # `@tangle-network/agent-eval/contract` - the app-facing public surface.
3
- *
4
- * **Stability:** every export in this file is the frozen public API for
5
- * foreign-agent consumers. New minors only ADD; nothing here changes shape
6
- * or disappears in a 0.x minor. Wire your agent against these imports and
7
- * expect them to keep working across `agent-eval` upgrades.
8
- *
9
- * ## What this gives you
10
- *
11
- * The minimum surface area to evaluate + self-improve any agent yours,
12
- * a partner's, anything that returns text or a structured artifact. No
13
- * Tangle sandbox required. No Tangle account required. Local files,
14
- * stdout, your own LLM endpoint.
15
- *
16
- * ## The five types you need to know
17
- *
18
- * 1. **`Scenario`** — what you evaluate against. Stable `id` + `kind` +
19
- * optional `tags`; extend with your domain fields.
20
- * 2. **`Dispatch<TScenario, TArtifact>`** the seam. One function:
21
- * scenario in, artifact out. Whatever your agent is, wrap it as a
22
- * `Dispatch` and the eval engine drives it. The campaign internals call
23
- * the same shape `DispatchFn`; `/contract` exports it as `Dispatch`.
24
- * 3. **`JudgeConfig<TArtifact, TScenario>`** — pluggable dimensional
25
- * scorer. Bring an LLM judge, a deterministic check, an ensemble —
26
- * the engine only cares about `score(input) JudgeScore`.
27
- * 4. **`SurfaceProposer`** proposes next candidate surfaces for the
28
- * optimization loop. Use `gepaProposer` (reflective LLM proposal) or
29
- * `evolutionaryProposer`, or write your own.
30
- * 5. **`Gate`** promotion guard. Returns `'ship'` / `'hold'` /
31
- * `'need_more_work'` / others for each candidate; the loop only ships
32
- * what passes. `defaultProductionGate` is the composite default;
33
- * `paretoSignificanceGate` decides over the multi-objective evidence
34
- * vector (per-axis significance + Pareto dominance, no scalar collapse)
35
- * and is itself factored as a pluggable `PromotionPolicy` over a
36
- * `buildEvidenceVector` bus so competing strategies share one evidence set.
37
- *
38
- * ## The five functions you'll call
39
- *
40
- * 1. **`defineAgentEval(options)`** — define scenarios, agent, judge, and
41
- * baseline once; call `.evaluate()` for a score or `.improve()` for the
42
- * closed loop.
43
- * 2. **`runEval(options)`** one-off evaluation across scenarios. Use
44
- * when you just want a score.
45
- * 3. **`runCampaign(options)`** — structured set of cells (scenarios ×
46
- * seeds × replicates) that emits a `CampaignResult` downstream tools
47
- * can read.
48
- * 4. **`runImprovementLoop(options)`** — the closed self-improvement
49
- * loop: campaign judge → mutator → gate → next generation. Stops
50
- * when the gate ships or the budget exhausts.
51
- * 5. **`defaultProductionGate(options)`** the standard held-out gate
52
- * most consumers want; compose with `composeGate` to add custom
53
- * checks (regression deltas, cost caps, red-team signals).
54
- *
55
- * ## Two storage backends you'll pick from
56
- *
57
- * - **`fsCampaignStorage()`** — writes traces, artifacts, and campaign
58
- * manifests to a local directory. The default for Node consumers.
59
- * - **`inMemoryCampaignStorage()`** — Cloudflare Workers, edge, tests,
60
- * any environment without filesystem. Same interface; runs the same
61
- * campaigns; nothing persists past the process.
62
- *
63
- * ## Optional: deployment-outcome store (predictive validity)
64
- *
65
- * Record which candidates shipped + whether downstream metrics actually
66
- * improved. Feeds back into the gate so promotion decisions calibrate
67
- * against observed reality, not just held-out scores.
68
- *
69
- * ## Optional: RL bridge
70
- *
71
- * If you want to feed campaign output into RL training (TRL, prime-rl,
72
- * in-house), the RL bridge converts a `CampaignResult` to canonical
73
- * `RunRecord` + preference shapes. Pull those from
74
- * `@tangle-network/agent-eval/rl` directly - RL is opt-in and not part
75
- * of the app-facing contract.
76
- *
77
- * ## What's NOT here
78
- *
79
- * Anything below this barrel is internal substrate that may move
80
- * between minors. If you find yourself reaching for an import path other
81
- * than `/contract`, `/campaign`, `/rl`, `/belief-state`, `/reporting`,
82
- * `/control`, `/telemetry`, `/analyst`, `/traces`, `/testing`, or another
83
- * named package export, you're using internals. Open an issue so we can
84
- * promote what you need into a named subpath.
85
- */
86
- export type { CampaignAggregates, CampaignArtifactWriter, CampaignCellResult, CampaignCostMeter, CampaignResult, CampaignTraceWriter, CodeSurface, DispatchContext, DispatchFn as Dispatch, Gate, GateContext, GateDecision, GateResult, GenerationCandidate, GenerationRecord, JudgeConfig, JudgeDimension, JudgeScore, MutableSurface, Mutator, OptimizationProposer, OptimizerConfig, Scenario, SessionScript, SurfaceProposer, } from '../campaign/types';
87
- export { type RunEvalOptions, runEval } from '../campaign/presets/run-eval';
88
- export { type RunImprovementLoopOptions, type RunImprovementLoopResult, runImprovementLoop, } from '../campaign/presets/run-improvement-loop';
89
- export { type RunCampaignOptions, runCampaign } from '../campaign/run-campaign';
90
- export { type EvolutionaryProposerOptions, evolutionaryProposer, } from '../campaign/proposers/evolutionary';
91
- export { type GepaProposerOptions, gepaProposer } from '../campaign/proposers/gepa';
92
- export { composeGate } from '../campaign/gates/compose';
93
- export { type DefaultProductionGateOptions, defaultProductionGate, } from '../campaign/gates/default-production-gate';
94
- export { type HeldOutGateOptions, heldOutGate } from '../campaign/gates/heldout-gate';
95
- export { type AxisEvidence, type AxisVerdict, type BuildEvidenceVectorOptions, buildEvidenceVector, type EvidenceVector, type ObjectiveSource, type ParetoSignificanceGateOptions, type PromotionObjective, type PromotionPolicy, paretoPolicy, paretoSignificanceGate, } from '../campaign/gates/promotion-policy';
96
- export { type CampaignStorage, fsCampaignStorage, inMemoryCampaignStorage, } from '../campaign/storage';
97
- export { type DeploymentOutcome, FileSystemOutcomeStore, type FileSystemOutcomeStoreOptions, InMemoryOutcomeStore, type OutcomeStore, } from '../meta-eval/outcome-store';
98
- export type { HostedTenant } from '../hosted/client';
99
- export { type AgentEvalAgent, type AgentEvalEvaluateOptions, type AgentEvalImproveOptions, type DefineAgentEvalOptions, type DefinedAgentEval, defineAgentEval, } from './define-agent-eval';
100
- export { type SelfImproveBudget, type SelfImproveLlm, type SelfImproveOptions, type SelfImproveProgressEvent, type SelfImproveResult, selfImprove, } from './self-improve';
101
- export { buildDefaultAnalystRegistry, type DefaultAnalystRegistryOptions, } from '../analyst/default-registry';
102
- export type { AnalystFinding } from '../analyst/types';
103
- export type { AnalyzeRunsOptions } from './analyze-runs';
104
- export { analyzeRuns } from './analyze-runs';
105
- export type { FailureClusterInsight, InsightReport, InterRaterInsight, JudgeInsight, LiftInsight, OutcomeCorrelationInsight, Recommendation, ReleaseSummary, ScalarDistribution, } from './insight-report';
106
- export { diffGenerations, diffRunBaselineToWinner, diffRuns, type EvalCellScoreDelta, type EvalDimensionDelta, type EvalGenerationDiff, type EvalRunDiff, } from './diff';
107
- export { type AgentTraceContributor, type AgentTraceContributorType, type AgentTraceConversation, type AgentTraceFile, type AgentTraceIndex, type AgentTraceRange, type AgentTraceRecord, type AuthoringProvenance, type CodeAgentSessionDiagnostic, type CodeAgentSessionIntakeOptions, type CodeAgentSessionIntakeResult, type CodeAgentSessionMetrics, type CodeAgentSessionSource, type FeedbackTableMeta, type FeedbackTableRow, type FromFeedbackTableOptions, type FromFeedbackTableResult, type FromOtelSpansOptions, fromClaudeCodeSession, fromCodexSession, fromFeedbackTable, fromKimiCodeSession, fromOpenCodeSession, fromOtelSpans, fromPigraphSession, fromPiSession, type ParsedCodeAgentJsonl, type PartitionByAuthoringModelResult, parseAgentTrace, parseCodeAgentJsonl, partitionRunsByAuthoringModel, } from './intake';
108
- //# sourceMappingURL=index.d.ts.map
38
+ * # `selfImprove()` - the one-call improvement loop.
39
+ *
40
+ * The cheapest possible call site to run a real closed-loop self-
41
+ * improvement over your agent. Wraps `runImprovementLoop` with smart
42
+ * defaults and a budget-shaped options API; every escape hatch the
43
+ * substrate exposes is reachable from here without losing the
44
+ * one-function feel.
45
+ *
46
+ * Defaults:
47
+ * - In-memory storage (no filesystem touch).
48
+ * - `gepaProposer` reflective mutation with copywriting-flavored primitives
49
+ * (override `proposer` or `mutationPrimitives` for any domain).
50
+ * - `defaultProductionGate` with `deltaThreshold: 0.05`.
51
+ * - Held-out split = 25% of scenarios, deterministic by id hash.
52
+ * - 3 generations × population 2 (raise via `budget` for more search).
53
+ * - `autoOnPromote: 'none'` (we don't open PRs unless you ask).
54
+ *
55
+ * Want one-click? Provide `agent` + `scenarios` + `judge`. Done.
56
+ * Want distributed? Pass `cellPlacement` + an `httpDispatch`-backed
57
+ * agent. Want a code-tier surface? Pass a `MutableSurface` + your own
58
+ * `proposer`. Same function.
59
+ */
60
+
61
+ interface SelfImproveBudget {
62
+ /** Hard $ ceiling across all cells in baseline + every generation. Cells
63
+ * beyond the ceiling are skipped (cost-aware, not aborted). */
64
+ dollars?: number;
65
+ /** How many improvement generations to explore. Default 3. Set 0 to
66
+ * skip improvement entirely (selfImprove becomes a baseline-only run). */
67
+ generations?: number;
68
+ /** Candidates the proposer emits per generation. Default 2. */
69
+ populationSize?: number;
70
+ /** Max concurrent cells across the loop. Default 2. */
71
+ maxConcurrency?: number;
72
+ /** Fraction of `scenarios` held out from training, used for the gate.
73
+ * Default 0.25. Ignored when `holdoutScenarios` is set explicitly. */
74
+ holdoutFraction?: number;
75
+ /** Explicit held-out scenarios; overrides `holdoutFraction`. */
76
+ holdoutScenarios?: Scenario[];
77
+ /** Per-scenario replicates per cell raises bootstrap-CI tightness. Default 1. */
78
+ reps?: number;
79
+ /** Top-scoring candidates carried into the next generation. Default 2. */
80
+ promoteTopK?: number;
81
+ }
82
+ interface SelfImproveLlm {
83
+ /** Endpoint base URL. Default Tangle Router. */
84
+ baseUrl?: string;
85
+ /** Bearer token. Default `process.env.OPENAI_API_KEY`. */
86
+ apiKey?: string;
87
+ /** Model id used by `gepaProposer` reflection. Default
88
+ * `anthropic/claude-sonnet-4.6`. */
89
+ model?: string;
90
+ }
91
+ type SelfImproveProgressEvent = {
92
+ kind: 'baseline.started';
93
+ scenarios: number;
94
+ } | {
95
+ kind: 'baseline.completed';
96
+ compositeMean: number;
97
+ durationMs: number;
98
+ } | {
99
+ kind: 'generation.started';
100
+ index: number;
101
+ populationSize: number;
102
+ } | {
103
+ kind: 'generation.completed';
104
+ index: number;
105
+ bestComposite: number;
106
+ durationMs: number;
107
+ } | {
108
+ kind: 'gate.decided';
109
+ decision: string;
110
+ lift: number;
111
+ };
112
+ interface SelfImproveOptions<TScenario extends Scenario, TArtifact> {
113
+ /**
114
+ * Your agent — a function that takes the current `MutableSurface`
115
+ * (typically a system prompt the loop is optimizing) plus the
116
+ * scenario + cell ctx, and returns the artifact your judge scores.
117
+ *
118
+ * Same shape as `RunOptimizationOptions.dispatchWithSurface`. Wrap a
119
+ * plain `Dispatch` if you don't have a surface seam:
120
+ *
121
+ * agent: (_surface, scenario, ctx) => yourPlainDispatch(scenario, ctx)
122
+ *
123
+ * That mode evaluates without mutating any surface — useful as a
124
+ * baseline-only run (set `budget.generations = 0`).
125
+ */
126
+ agent: (surface: MutableSurface, scenario: TScenario, ctx: DispatchContext) => Promise<TArtifact>;
127
+ /** Scenarios to evaluate against. Train/holdout split is computed from
128
+ * these unless `budget.holdoutScenarios` is set explicitly. */
129
+ scenarios: TScenario[];
130
+ /** Judge that scores artifacts. Bring your own; use `langchainJudge`
131
+ * from `/adapters/langchain` for a Runnable-shaped one. */
132
+ judge: JudgeConfig<TArtifact, TScenario>;
133
+ /** Starting surface system prompt, JSON config, anything `MutableSurface`
134
+ * accepts. The proposer mutates this each generation. */
135
+ baselineSurface: MutableSurface;
136
+ /** Budget + loop shape. All fields optional. */
137
+ budget?: SelfImproveBudget;
138
+ /** Custom surface proposer. Default is `gepaProposer` configured from `llm` +
139
+ * `mutationPrimitives`. */
140
+ proposer?: SurfaceProposer;
141
+ /** Default-proposer overrides used when `proposer` is unset. */
142
+ mutationPrimitives?: string[];
143
+ proposerTarget?: string;
144
+ /** Custom gate. Default is `defaultProductionGate` with
145
+ * `deltaThreshold: 0.05` on the held-out split. */
146
+ gate?: Gate<TArtifact, TScenario>;
147
+ /** LLM config consumed by the default `gepaProposer`. Ignored if you pass
148
+ * your own `proposer`. */
149
+ llm?: SelfImproveLlm;
150
+ /** Storage backend. Default is DURABLE: when a real (non-`mem://`) `runDir`
151
+ * is available, the substrate defaults to `fsCampaignStorage()` so the
152
+ * provenance record + OTel spans survive the call. Pass
153
+ * `inMemoryCampaignStorage()` explicitly to opt OUT (tests, edge runtimes).
154
+ * Default when `runDir` is `mem://...` (or unset): in-memory. */
155
+ storage?: CampaignStorage;
156
+ /** Run directory (logical for in-memory storage, real path for fs).
157
+ * Default `mem://selfImprove-<timestamp>` (in-memory, non-durable). Pass a
158
+ * real path to persist the provenance record + spans. */
159
+ runDir?: string;
160
+ /**
161
+ * Worker call records for backend provenance. The agent is opaque to the
162
+ * substrate (it returns an artifact, not token usage), so to capture an
163
+ * `assertRealBackend`-grade verdict + worker call count + model in the
164
+ * provenance record, the agent reports its per-call `RunRecord`s here.
165
+ * Called once after the loop; return the records the agent accumulated.
166
+ * When unset, backend provenance is derived from campaign cells (cost only;
167
+ * verdict will read `stub` without token usage — the honest signal that no
168
+ * token channel was wired).
169
+ */
170
+ collectWorkerRecords?: () => RunRecord[];
171
+ /** Fires once the durable provenance record + OTel spans are emitted.
172
+ * Receives the structured record for inline assertions / custom routing. */
173
+ onProvenance?: (record: LoopProvenanceRecord) => void;
174
+ /** Distributed execution seam — same as `RunCampaignOptions.cellPlacement`.
175
+ * Returns an opaque placement key the substrate forwards to your agent
176
+ * as `ctx.placement`. Combined with `httpDispatch` from
177
+ * `/adapters/http`, fans cells across regions. */
178
+ cellPlacement?: (input: {
179
+ scenario: TScenario;
180
+ rep: number;
181
+ generation?: number;
182
+ }) => string | undefined;
183
+ /** Streaming hook — fires on baseline + each generation + gate decision.
184
+ * Consumer routes events wherever (UI, dashboard, logs). */
185
+ onProgress?: (event: SelfImproveProgressEvent) => void;
186
+ /** Auto-promotion behavior on a ship decision. Default `'none'` — we
187
+ * return the winner; you ship it however you ship. `'pr'` opens a
188
+ * GitHub PR via `openAutoPr`; requires `ghOwner` + `ghRepo`. */
189
+ autoOnPromote?: 'pr' | 'none';
190
+ ghOwner?: string;
191
+ ghRepo?: string;
192
+ /**
193
+ * Opt-in: ship eval-run events to a hosted orchestrator (ours, your
194
+ * self-hosted one, or any compatible implementation of the
195
+ * `docs/hosted-ingest-spec.md` wire format). When set, the substrate
196
+ * POSTs the final `EvalRunEvent` to `${endpoint}/v1/ingest/eval-runs`
197
+ * after the loop completes. Failures are logged but do not fail the
198
+ * loop — local result is always returned.
199
+ *
200
+ * For our orchestrator: `{ endpoint: 'https://orchestrator.tangle.tools/v1', apiKey, tenantId }`.
201
+ *
202
+ * For your self-hosted: any URL serving the wire format. See
203
+ * `examples/hosted-ingest-server/` for the reference receiver.
204
+ */
205
+ hostedTenant?: HostedTenant;
206
+ /** Free-form labels attached to the hosted event (env, branch, model id,
207
+ * etc.). Ignored when `hostedTenant` is unset. */
208
+ hostedLabels?: Record<string, string>;
209
+ /** Capture every artifact + judge score to this store (labeled-example
210
+ * corpus the proposer may read for few-shot, and the dataset you ship). Pass
211
+ * `'off'` to disable. Default: off. */
212
+ labeledStore?: LabeledScenarioStore | 'off';
213
+ /** Capture-source tag for `labeledStore`. Default `'eval-run'`. */
214
+ captureSource?: 'production-trace' | 'eval-run' | 'manual' | 'red-team' | 'synthetic';
215
+ /**
216
+ * Per-cell backend-integrity expectation — the fail-loud guard. A cell that
217
+ * produced an artifact but reported `costUsd === 0` AND zero tokens is a
218
+ * stub. Modes: `'assert'` throws on the first such cell, `'warn'` logs it,
219
+ * `'off'` skips the check (offline/replay). Default `'assert'` — `selfImprove`
220
+ * is the real-run path, so a stub fails loud rather than scoring a clean 0.
221
+ */
222
+ expectUsage?: 'assert' | 'warn' | 'off';
223
+ /**
224
+ * Per-generation findings producer. After each
225
+ * generation is scored, this is called; whatever it returns REPLACES the
226
+ * proposer's `findings` for the next generation's `propose()`. Plug a
227
+ * trace-analyst registry / HALO here. When absent, findings stay
228
+ * `opts.findings`.
229
+ */
230
+ analyzeGeneration?: RunOptimizationOptions<TScenario, TArtifact>['analyzeGeneration'];
231
+ /** Static findings forwarded to the proposer's `propose()` as `ctx.findings`
232
+ * (a findings-grounded proposer consumes them). Default: none. */
233
+ findings?: unknown[];
234
+ }
235
+ interface SelfImproveResult<TScenario extends Scenario, TArtifact> {
236
+ /** Composite mean across all scenarios, baseline run. */
237
+ baseline: {
238
+ compositeMean: number;
239
+ perScenario: Record<string, number>;
240
+ };
241
+ /** Composite mean on the held-out set, winner run. */
242
+ winner: {
243
+ compositeMean: number;
244
+ perScenario: Record<string, number>;
245
+ surface: MutableSurface;
246
+ /** Proposer label for the promoted change. Absent ⇒ winner == baseline or
247
+ * a bare-surface mutator. */
248
+ label?: string;
249
+ /** Proposer rationale — the "because Z" that motivated the promoted change.
250
+ * Threaded from the proposer's `ProposedCandidate` through the loop.
251
+ * Absent ⇒ winner == baseline. */
252
+ rationale?: string;
253
+ };
254
+ /** `winner.compositeMean - baselineOnHoldout.compositeMean`. Positive
255
+ * means the gate observed improvement. */
256
+ lift: number;
257
+ /** The explicit baseline→winner unified diff. Always present (empty string
258
+ * when winner == baseline). */
259
+ diff: string;
260
+ /** Durable, queryable provenance record: candidate→cell→gate→promote chain +
261
+ * rationale + diff + backend provenance. The artifact the hosted ingest
262
+ * path stores; the +lift RECOMPUTES from `record.heldOutLift`. */
263
+ provenance: LoopProvenanceRecord;
264
+ /** `defaultProductionGate.decide()` result. */
265
+ gateDecision: 'ship' | 'hold' | 'need_more_work' | 'model_ceiling' | 'arch_ceiling';
266
+ /** Number of generations actually explored (may be less than the
267
+ * budget if the proposer gave up early). */
268
+ generationsExplored: number;
269
+ /** Wall-clock total. */
270
+ durationMs: number;
271
+ /** Total cost across baseline + every generation. */
272
+ totalCostUsd: number;
273
+ /**
274
+ * Rigor packet: distributional summary, paired-bootstrap lift CI,
275
+ * judge stats, contamination check, recommendations. Wired through
276
+ * `analyzeRuns()` on the baseline + winner cells of the campaign.
277
+ * Hosted-tier dashboards render this as the v3-vs-v4 decision view.
278
+ */
279
+ insight: InsightReport;
280
+ /**
281
+ * Raw substrate result for advanced inspection — full per-generation
282
+ * candidates, full campaign artifacts, all judge scores. Useful for
283
+ * debugging or reporting beyond the summary.
284
+ */
285
+ raw: RunImprovementLoopResult<TArtifact, TScenario>;
286
+ }
287
+ /**
288
+ * One-shot self-improvement loop. See module docstring for defaults +
289
+ * extension points.
290
+ *
291
+ * @example Minimum:
292
+ *
293
+ * const result = await selfImprove({
294
+ * agent: (surface, scenario, ctx) => myAgent(surface, scenario, ctx.signal),
295
+ * scenarios,
296
+ * judge,
297
+ * baselineSurface: DEFAULT_PROMPT,
298
+ * })
299
+ * console.log(`lift: ${result.lift.toFixed(3)} (${result.gateDecision})`)
300
+ *
301
+ * @example Distributed (workers in three regions):
302
+ *
303
+ * await selfImprove({
304
+ * agent: httpDispatch({ resolveUrl: ({ placement }) => REGION_URLS[placement!] }),
305
+ * scenarios,
306
+ * judge,
307
+ * baselineSurface: DEFAULT_PROMPT,
308
+ * cellPlacement: ({ scenario }) => scenario.region,
309
+ * budget: { maxConcurrency: 12 },
310
+ * })
311
+ */
312
+ declare function selfImprove<TScenario extends Scenario, TArtifact>(opts: SelfImproveOptions<TScenario, TArtifact>): Promise<SelfImproveResult<TScenario, TArtifact>>;
313
+
314
+ type AgentEvalAgent<TScenario extends Scenario, TArtifact> = (surface: MutableSurface, scenario: TScenario, ctx: DispatchContext) => Promise<TArtifact>;
315
+ type DefineAgentEvalOptions<TScenario extends Scenario, TArtifact> = SelfImproveOptions<TScenario, TArtifact>;
316
+ interface AgentEvalEvaluateOptions<TScenario extends Scenario, TArtifact> extends Omit<RunEvalOptions<TScenario, TArtifact>, 'dispatch' | 'judges' | 'runDir' | 'scenarios'> {
317
+ /** Scenario set to evaluate. Defaults to the scenarios passed to `defineAgentEval`. */
318
+ scenarios?: TScenario[];
319
+ /** Surface to evaluate. Defaults to the baseline surface passed to `defineAgentEval`. */
320
+ surface?: MutableSurface;
321
+ /** Agent to evaluate. Defaults to the agent passed to `defineAgentEval`. */
322
+ agent?: AgentEvalAgent<TScenario, TArtifact>;
323
+ /** Single judge override. Ignored when `judges` is set. */
324
+ judge?: JudgeConfig<TArtifact, TScenario>;
325
+ /** Full judge list override. Defaults to the single judge passed to `defineAgentEval`. */
326
+ judges?: JudgeConfig<TArtifact, TScenario>[];
327
+ /** Logical or filesystem run directory. Defaults to an in-memory run. */
328
+ runDir?: string;
329
+ }
330
+ type AgentEvalImproveOptions<TScenario extends Scenario, TArtifact> = Omit<Partial<SelfImproveOptions<TScenario, TArtifact>>, 'budget' | 'hostedTenant' | 'llm'> & {
331
+ budget?: Partial<SelfImproveBudget>;
332
+ hostedTenant?: Partial<HostedTenant>;
333
+ llm?: Partial<SelfImproveLlm>;
334
+ };
335
+ interface DefinedAgentEval<TScenario extends Scenario, TArtifact> {
336
+ /** The default scenarios used by `evaluate()` and `improve()`. */
337
+ readonly scenarios: readonly TScenario[];
338
+ /** The default baseline surface used by `evaluate()` and `improve()`. */
339
+ readonly baselineSurface: MutableSurface;
340
+ /**
341
+ * Run one scored evaluation. Use this for a baseline score or to score one
342
+ * candidate surface without running an improvement loop.
343
+ */
344
+ evaluate(opts?: AgentEvalEvaluateOptions<TScenario, TArtifact>): Promise<CampaignResult<TArtifact, TScenario>>;
345
+ /**
346
+ * Run the closed improvement loop. Per-call overrides replace the definition
347
+ * except for nested config objects (`budget`, `llm`, `hostedTenant`), which
348
+ * are merged field-by-field so callers can override one knob without
349
+ * repeating secrets or budget defaults.
350
+ */
351
+ improve(opts?: AgentEvalImproveOptions<TScenario, TArtifact>): Promise<SelfImproveResult<TScenario, TArtifact>>;
352
+ }
353
+ /**
354
+ * Define an agent eval once, then either score a surface with `evaluate()` or
355
+ * run the closed loop with `improve()`.
356
+ *
357
+ * This is a DX wrapper only: it delegates to `runEval()` and `selfImprove()` and
358
+ * returns their native result shapes.
359
+ */
360
+ declare function defineAgentEval<TScenario extends Scenario, TArtifact>(defaults: DefineAgentEvalOptions<TScenario, TArtifact>): DefinedAgentEval<TScenario, TArtifact>;
361
+
362
+ /**
363
+ * # `intake/run-record-dir` — load a directory or file of `RunRecord`s.
364
+ *
365
+ * The on-disk counterpart to the in-memory intake adapters: point it at a
366
+ * single `.json` (array) / `.jsonl` (one record per line) file or at a
367
+ * directory of such files, and it returns the substrate-canonical
368
+ * `RunRecord[]` ready for `analyzeRuns({ runs })`.
369
+ *
370
+ * Validation is at the boundary: each parsed object goes through
371
+ * `parseRunRecordSafe`. By default an invalid record fails loud with its
372
+ * file + index; pass `onInvalid: 'collect'` to keep the valid records and
373
+ * receive the rejects as structured diagnostics instead.
374
+ */
375
+
376
+ /** A record that failed boundary validation, with enough context to fix it. */
377
+ interface RunRecordRejection {
378
+ /** Absolute or caller-relative path to the file the record came from. */
379
+ file: string;
380
+ /** Zero-based position within the file (array index or JSONL line number). */
381
+ index: number;
382
+ /** The validator's message. */
383
+ reason: string;
384
+ }
385
+ interface FromRunRecordDirOptions {
386
+ /**
387
+ * How to treat a record that fails `parseRunRecordSafe`:
388
+ * - `'throw'` (default) — fail loud on the first invalid record.
389
+ * - `'collect'` — drop it, keep the rest, and return it under `rejected`.
390
+ */
391
+ onInvalid?: 'throw' | 'collect';
392
+ /**
393
+ * When the input is a directory, only files matching this predicate are
394
+ * read. Default: any file ending in `.json` or `.jsonl`. The `analysis.json`
395
+ * artifact `evalReportingSuite` writes is always skipped so a re-run never
396
+ * ingests its own output.
397
+ */
398
+ include?: (fileName: string) => boolean;
399
+ /**
400
+ * Recurse into subdirectories when the input is a directory. Default false —
401
+ * a flat run directory is the common case and recursion can silently pull in
402
+ * unrelated corpora.
403
+ */
404
+ recursive?: boolean;
405
+ }
406
+ interface FromRunRecordDirResult {
407
+ /** Records that passed boundary validation, in file-then-index order. */
408
+ runs: RunRecord[];
409
+ /** Records that failed validation. Empty unless `onInvalid: 'collect'`. */
410
+ rejected: RunRecordRejection[];
411
+ /** The files that were read, in the order they were processed. */
412
+ files: string[];
413
+ }
414
+ /**
415
+ * Resolve a file or directory path into validated `RunRecord[]`.
416
+ *
417
+ * A `.json` file must parse to a top-level array; a `.jsonl` file is one
418
+ * record per non-empty line. Directories are read shallowly by default
419
+ * (set `recursive` to descend); the `analysis.json` output artifact is
420
+ * always excluded.
421
+ */
422
+ declare function fromRunRecordDir(path: string, options?: FromRunRecordDirOptions): Promise<FromRunRecordDirResult>;
423
+
424
+ /**
425
+ * # `evalReportingSuite` — one call from runs (or a run dir) to `analysis.json`.
426
+ *
427
+ * A thin wrapper over the analysis primitive (`analyzeRuns`) and the on-disk
428
+ * intake adapter (`fromRunRecordDir`). It does NOT reimplement any statistics,
429
+ * distributions, or clustering — it resolves the input into validated
430
+ * `RunRecord[]`, calls `analyzeRuns` with the options you'd pass it directly,
431
+ * wraps the result in a small provenance envelope, and (optionally) writes a
432
+ * single `analysis.json` artifact.
433
+ *
434
+ * ```ts
435
+ * // From a directory of run files, write ./runs/analysis.json:
436
+ * const suite = await evalReportingSuite('./runs', { write: true })
437
+ * // From records already in memory, no write:
438
+ * const suite = await evalReportingSuite(records, { analyze: { decisionThreshold: 0.03 } })
439
+ * suite.report // the InsightReport — distributions, paired lift, findings rollup
440
+ * ```
441
+ */
442
+
443
+ /** Either records in hand or a path to a `.json` / `.jsonl` file or a
444
+ * directory of them. */
445
+ type EvalReportingSuiteInput = RunRecord[] | string;
446
+ interface EvalReportingSuiteOptions {
447
+ /** Forwarded verbatim to `analyzeRuns` (everything except `runs`, which the
448
+ * suite supplies from the resolved input). Use this for split selection,
449
+ * baseline/candidate ids, canaries, prior-period runs, the analyst registry,
450
+ * etc. */
451
+ analyze?: Omit<AnalyzeRunsOptions, 'runs'>;
452
+ /** Loader options used only when the input is a path. */
453
+ load?: FromRunRecordDirOptions;
454
+ /**
455
+ * Write the suite result as a single `analysis.json`.
456
+ * - `true` — write to `<dir>/analysis.json` when the input is a directory,
457
+ * or alongside the input file; throws if the input is in-memory records
458
+ * (no directory to anchor to — pass an explicit path instead).
459
+ * - a string — write to exactly this path (a directory path gets
460
+ * `analysis.json` appended; any other path is used verbatim).
461
+ * - omitted / false — do not write.
462
+ */
463
+ write?: boolean | string;
464
+ }
465
+ /** The suite artifact — the `analyzeRuns` report plus provenance. This is the
466
+ * exact shape serialized to `analysis.json`. */
467
+ interface EvalReportingSuiteResult {
468
+ /** The analysis itself — distributions, paired stats/lift, failure rollup,
469
+ * recommendations. Produced by `analyzeRuns`. */
470
+ report: InsightReport;
471
+ /** How the suite was run, so a reader can verify provenance. */
472
+ provenance: {
473
+ /** ISO timestamp the suite ran. */
474
+ generatedAt: string;
475
+ /** Number of records analyzed (mirrors `report.n`). */
476
+ runCount: number;
477
+ /** The source path when the input was a directory/file; null for
478
+ * in-memory records. */
479
+ sourcePath: string | null;
480
+ /** Files read when loading from disk; empty for in-memory input. */
481
+ files: string[];
482
+ /** Records dropped at the validation boundary. Always empty unless
483
+ * `load.onInvalid` was set to `'collect'`. */
484
+ rejected: FromRunRecordDirResult['rejected'];
485
+ };
486
+ /** The path `analysis.json` was written to, or null when `write` was unset. */
487
+ writtenTo: string | null;
488
+ }
489
+ /**
490
+ * Resolve runs (or a run dir/file), run `analyzeRuns`, and optionally persist a
491
+ * single `analysis.json`. The only analysis logic lives in `analyzeRuns`; this
492
+ * function is composition + I/O.
493
+ */
494
+ declare function evalReportingSuite(input: EvalReportingSuiteInput, options?: EvalReportingSuiteOptions): Promise<EvalReportingSuiteResult>;
495
+
496
+ /**
497
+ * # `@tangle-network/agent-eval/contract` — eval-run diff primitive.
498
+ *
499
+ * The substrate side of the v-N-versus-v-N+1 dashboard view. Given two
500
+ * `EvalRunEvent`s (or two `EvalRunGenerationSnapshot`s from one run), this
501
+ * returns a normalised diff: per-cell composite + per-judge/per-dimension
502
+ * deltas, surface-hash change, aggregate cost + duration shifts.
503
+ *
504
+ * Consumed by:
505
+ * - The hosted-tier dashboard (intelligence-web) — renders v3 vs v4
506
+ * comparisons of cells × judges × dimensions.
507
+ * - CI reporting — emits a "shipped: composite +0.07, cost +$1.20" line
508
+ * in PR review for autonomous-improvement runs.
509
+ * - Any downstream consumer that needs "what actually changed" without
510
+ * reimplementing the matching + arithmetic.
511
+ *
512
+ * Cells are matched on the natural composite key `(scenarioId, rep)`.
513
+ * Unmatched cells surface as `removed` / `added` so callers can tell
514
+ * "this cell got worse" from "this cell wasn't run."
515
+ */
516
+
517
+ /** Per-dimension delta. `before` / `after` are null when the judge did not
518
+ * emit a value for that side. `delta` is `after - before`; null when
519
+ * either side is null. */
520
+ interface EvalDimensionDelta {
521
+ before: number | null;
522
+ after: number | null;
523
+ delta: number | null;
524
+ }
525
+ /** Per-cell delta, keyed on `(scenarioId, rep)`. */
526
+ interface EvalCellScoreDelta {
527
+ scenarioId: string;
528
+ rep: number;
529
+ compositeBefore: number;
530
+ compositeAfter: number;
531
+ compositeDelta: number;
532
+ /** Per-judge → per-dimension deltas. Outer key = judge name from
533
+ * `EvalRunCellScore.dimensions`; inner key = dimension name. */
534
+ dimensions: Record<string, Record<string, EvalDimensionDelta>>;
535
+ }
536
+ /** Diff between two generation snapshots — the unit the dashboard renders
537
+ * for a single "v3 vs v4" comparison. */
538
+ interface EvalGenerationDiff {
539
+ beforeIndex: number;
540
+ afterIndex: number;
541
+ beforeSurfaceHash: string;
542
+ afterSurfaceHash: string;
543
+ surfaceChanged: boolean;
544
+ /** Cells present in both snapshots, matched on `(scenarioId, rep)`. */
545
+ matched: EvalCellScoreDelta[];
546
+ /** Cells present in `before` but missing from `after`. */
547
+ removed: EvalRunCellScore[];
548
+ /** Cells present in `after` but missing from `before`. */
549
+ added: EvalRunCellScore[];
550
+ /** Aggregate composite mean across all cells in the snapshot. */
551
+ compositeBefore: number;
552
+ compositeAfter: number;
553
+ compositeDelta: number;
554
+ costUsdBefore: number;
555
+ costUsdAfter: number;
556
+ costUsdDelta: number;
557
+ durationMsBefore: number;
558
+ durationMsAfter: number;
559
+ durationMsDelta: number;
560
+ }
561
+ /** Diff between two full eval-runs. Includes both baseline-vs-baseline and
562
+ * winner-vs-winner generation diffs when both sides expose them, plus
563
+ * run-level metadata. */
564
+ interface EvalRunDiff {
565
+ beforeRunId: string;
566
+ afterRunId: string;
567
+ beforeTimestamp: string;
568
+ afterTimestamp: string;
569
+ beforeGateDecision: GateDecision | null;
570
+ afterGateDecision: GateDecision | null;
571
+ beforeHoldoutLift: number | null;
572
+ afterHoldoutLift: number | null;
573
+ holdoutLiftDelta: number | null;
574
+ beforeTotalCostUsd: number;
575
+ afterTotalCostUsd: number;
576
+ totalCostUsdDelta: number;
577
+ beforeTotalDurationMs: number;
578
+ afterTotalDurationMs: number;
579
+ totalDurationMsDelta: number;
580
+ /** Baseline-vs-baseline diff. Null when either run has no baseline. */
581
+ baselineDiff: EvalGenerationDiff | null;
582
+ /** Highest-index-generation comparison. Null when either run has no
583
+ * recorded generations (e.g. baseline-only or errored before any
584
+ * generation completed). */
585
+ winnersDiff: EvalGenerationDiff | null;
586
+ }
587
+ /**
588
+ * Diff two generation snapshots. Cells are matched on `(scenarioId, rep)`;
589
+ * unmatched cells surface in `added` / `removed`. Aggregate fields are
590
+ * recomputed from the snapshot's stored fields, not re-derived from cells —
591
+ * this keeps the diff consistent with whatever aggregation the substrate
592
+ * actually reported.
593
+ */
594
+ declare function diffGenerations(before: EvalRunGenerationSnapshot, after: EvalRunGenerationSnapshot): EvalGenerationDiff;
595
+ /**
596
+ * Diff two full eval-runs. Produces baseline-vs-baseline and
597
+ * winner-vs-winner generation diffs when both sides expose them, plus
598
+ * run-level cost / lift / gate-decision deltas.
599
+ */
600
+ declare function diffRuns(before: EvalRunEvent, after: EvalRunEvent): EvalRunDiff;
601
+ /**
602
+ * Within-run baseline → winning-generation diff. The natural "what did the
603
+ * improvement loop produce" view for a single run. Returns null when the
604
+ * run never reached a generation past baseline (errored early, or the gate
605
+ * shipped the baseline as-is).
606
+ */
607
+ declare function diffRunBaselineToWinner(run: EvalRunEvent): EvalGenerationDiff | null;
608
+
609
+ /**
610
+ * `fromAgentTrace` — provenance correlation from Cursor's Agent Trace spec
611
+ * (https://github.com/cursor/agent-trace, RFC v0.1.0).
612
+ *
613
+ * Agent Trace is NOT a run/quality trace — it carries no outcome, score, or
614
+ * cost. It records *code authorship*: for a VCS revision, which AI model /
615
+ * conversation authored which file ranges. It explicitly disclaims quality
616
+ * assessment — which is exactly what `analyzeRuns` adds.
617
+ *
618
+ * The two layers join on a key the substrate already has: a `RunRecord`
619
+ * carries `commitSha`, and an Agent Trace record is keyed by
620
+ * `vcs.revision`. So this adapter does not produce `RunRecord`s — it builds a
621
+ * provenance index by commit and partitions existing runs by their authoring
622
+ * model. Feed each cohort to `analyzeRuns` (or pass one as `baselineRuns`) to
623
+ * answer the question no run-only trace can: *which authoring agent's code
624
+ * fails / regresses / costs more.*
625
+ *
626
+ * Granularity is commit-level (the SHA join). Per-file/per-line correlation
627
+ * would require runs to record which files they exercised — out of scope.
628
+ */
629
+
630
+ type AgentTraceContributorType = 'human' | 'ai' | 'mixed' | 'unknown';
631
+ interface AgentTraceContributor {
632
+ type: AgentTraceContributorType;
633
+ /** models.dev id, e.g. `anthropic/claude-opus-4-5-20251101`. */
634
+ model_id?: string;
635
+ }
636
+ interface AgentTraceRange {
637
+ start_line: number;
638
+ end_line: number;
639
+ content_hash?: string;
640
+ /** Per-range contributor override (agent handoffs). Wins over the
641
+ * conversation-level contributor for these lines. */
642
+ contributor?: AgentTraceContributor;
643
+ }
644
+ interface AgentTraceConversation {
645
+ url?: string;
646
+ contributor?: AgentTraceContributor;
647
+ ranges: AgentTraceRange[];
648
+ }
649
+ interface AgentTraceFile {
650
+ path: string;
651
+ conversations: AgentTraceConversation[];
652
+ }
653
+ interface AgentTraceRecord {
654
+ version: string;
655
+ id: string;
656
+ timestamp: string;
657
+ vcs?: {
658
+ type: string;
659
+ revision: string;
660
+ };
661
+ tool?: {
662
+ name?: string;
663
+ version?: string;
664
+ };
665
+ files: AgentTraceFile[];
666
+ }
667
+ /** Authorship provenance for one VCS revision, aggregated across the record's
668
+ * files/conversations/ranges. */
669
+ interface AuthoringProvenance {
670
+ commitSha: string;
671
+ /** Unique AI model ids that authored code in this commit (type ai|mixed). */
672
+ aiModels: string[];
673
+ /** Tools that produced the records (e.g. `cursor`). */
674
+ tools: string[];
675
+ conversationCount: number;
676
+ fileCount: number;
677
+ /** Total attributed lines (sum of range spans). */
678
+ lineCount: number;
679
+ /** True if any range was authored (in whole or part) by a human. */
680
+ humanInvolved: boolean;
681
+ }
682
+ type AgentTraceIndex = Map<string, AuthoringProvenance>;
683
+ /**
684
+ * Build a commit → provenance index from Agent Trace records. Multiple records
685
+ * for the same revision are merged. Records without `vcs.revision` are skipped
686
+ * (the SHA is the join key — without it there is nothing to correlate against).
687
+ */
688
+ declare function parseAgentTrace(records: AgentTraceRecord[]): AgentTraceIndex;
689
+ interface PartitionByAuthoringModelResult {
690
+ /** Runs grouped by each AI model that authored code in the run's commit. A
691
+ * run whose commit had multiple authoring models appears under EACH — the
692
+ * cohorts overlap by construction at commit granularity. */
693
+ byModel: Map<string, RunRecord[]>;
694
+ /** Runs whose `commitSha` had no Agent Trace provenance (no record, or no
695
+ * AI authorship). Kept separate — never silently folded into a cohort. */
696
+ unattributed: RunRecord[];
697
+ }
698
+ /**
699
+ * Partition runs by the AI model(s) that authored the code at each run's
700
+ * `commitSha`. Feed `byModel.get(modelId)` to `analyzeRuns`, or compare two
701
+ * model cohorts via `analyzeRuns({ runs: a, baselineRuns: b })` for a lift CI
702
+ * on "model A's code vs model B's code".
703
+ */
704
+ declare function partitionRunsByAuthoringModel(runs: RunRecord[], index: AgentTraceIndex): PartitionByAuthoringModelResult;
705
+
706
+ /**
707
+ * # `intake/feedback-table` — multi-rater approve/reject corpus → `RunRecord[]`.
708
+ *
709
+ * The generic shape behind Obsidian's `#approved` / `#rejected` tags, a
710
+ * Google Sheet, a Postgres `feedback` table, or any CSV with ratings.
711
+ *
712
+ * Caller supplies one row per (run, rater) tuple plus per-run metadata; the
713
+ * adapter rolls them up into the substrate-canonical `RunRecord` shape so
714
+ * `analyzeRuns({ runs, raterScores })` can produce inter-rater agreement,
715
+ * disagreement triage, and downstream recommendations.
716
+ *
717
+ * Per-run `RunRecord.outcome.searchScore` is the rater-mean rating
718
+ * (normalised to 0..1 when scale is supplied); `outcome.raw` carries the
719
+ * per-rater scores keyed by rater id for downstream attribution.
720
+ */
721
+
722
+ interface FeedbackTableRow {
723
+ /** Stable id for this run — the unit a rater scored. Drives pairing
724
+ * across analysis primitives. */
725
+ runId: string;
726
+ /** Identifier of the rater that produced this rating. */
727
+ rater: string;
728
+ /** The rating itself. Accepts boolean (approve/reject), 0..1 scalar,
729
+ * or any numeric scale — see `scale`. */
730
+ rating: number | boolean;
731
+ /** Optional metadata carried through to `RunRecord.outcome.raw` and the
732
+ * custom-shape metadata bag. */
733
+ metadata?: Record<string, unknown>;
734
+ }
735
+ interface FeedbackTableMeta {
736
+ runId: string;
737
+ /** When omitted, defaults to `'feedback-corpus'`. Used to group related
738
+ * runs in `analyzeRuns()` lift analysis. */
739
+ experimentId?: string;
740
+ /** When omitted, defaults to `runId` — each run is its own candidate. */
741
+ candidateId?: string;
742
+ /** Cost in USD, when available. Set to 0 when unknown — the consumer's
743
+ * cost analysis sections will collapse gracefully. */
744
+ costUsd?: number;
745
+ /** Wall-clock ms, when available. Defaults to 0. */
746
+ wallMs?: number;
747
+ /** Model identifier including snapshot. Default `unknown@unknown`. */
748
+ model?: string;
749
+ /** Optional sha256 of the prompt; default `'sha256:unknown'`. */
750
+ promptHash?: string;
751
+ /** Default `'sha256:unknown'`. */
752
+ configHash?: string;
753
+ /** Default `'unknown'`. */
754
+ commitSha?: string;
755
+ /** Default `'holdout'` — feedback corpora are by nature the holdout
756
+ * signal a closed-loop improvement aims at. */
757
+ splitTag?: RunSplitTag;
758
+ /** Free-form metadata available to consumers via the cast-out path on
759
+ * the resulting RunRecord. */
760
+ extras?: Record<string, unknown>;
761
+ }
762
+ interface FromFeedbackTableOptions {
763
+ /** Per-(run, rater) ratings. */
764
+ ratings: FeedbackTableRow[];
765
+ /** Per-run metadata. When a runId appears in `ratings` but not here, the
766
+ * adapter synthesises minimal metadata with defaults documented above. */
767
+ meta?: FeedbackTableMeta[];
768
+ /** Rating scale. Provide `{ min, max }` for non-0..1 numeric scales.
769
+ * Booleans are normalised: true → 1, false → 0. Default: assumes
770
+ * ratings are already 0..1. */
771
+ scale?: {
772
+ min: number;
773
+ max: number;
774
+ };
775
+ /** When true, the rater scores are emitted into `raterScores` (a sibling
776
+ * array `analyzeRuns()` accepts) instead of being averaged into the
777
+ * run's `outcome.searchScore`. Default `true` — preserves rater-level
778
+ * signal for inter-rater analysis. */
779
+ emitRaterScores?: boolean;
780
+ }
781
+ interface FromFeedbackTableResult {
782
+ runs: RunRecord[];
783
+ /** Rater-level scores ready to pass into `analyzeRuns({ raterScores })`
784
+ * for inter-rater agreement + disagreement triage. */
785
+ raterScores: Array<{
786
+ runId: string;
787
+ rater: string;
788
+ score: number;
789
+ }>;
790
+ }
791
+ declare function fromFeedbackTable(opts: FromFeedbackTableOptions): FromFeedbackTableResult;
792
+
793
+ /**
794
+ * # `intake/otel-spans` — OTel `TraceSpanEvent[]` → `RunRecord[]`.
795
+ *
796
+ * Turns an existing observability stream into the substrate-canonical
797
+ * `RunRecord` shape so consumers with logs but no eval discipline can
798
+ * call `analyzeRuns()` against their production traffic immediately.
799
+ *
800
+ * Pivot rule: spans are grouped by `tangle.runId` (the same attribute the
801
+ * hosted-tier wire format uses) or, when absent, by `traceId`. One group
802
+ * becomes one `RunRecord`. The root span (no `parentSpanId`) supplies:
803
+ *
804
+ * - `runId` (the group key)
805
+ * - `wallMs` from `endTimeUnixNano - startTimeUnixNano`
806
+ * - `model` from `gen_ai.request.model` / `llm.model` / `tangle.model`
807
+ * - cost from `cost.usd` / `gen_ai.usage.cost_usd` / `tangle.cost.usd`
808
+ * - token usage from `gen_ai.usage.{input,output}_tokens`
809
+ * - `outcome.searchScore` from `tangle.score` / `eval.score` when
810
+ * present; `outcome.raw` collects every numeric attribute.
811
+ *
812
+ * Spans that ERRORed (`status.code === 'ERROR'`) populate `failureMode`
813
+ * with their `name` so `analyzeRuns()`'s failure clustering sees them.
814
+ */
815
+
816
+ interface FromOtelSpansOptions {
817
+ spans: TraceSpanEvent[];
818
+ /** Default split tag for synthesized records. Defaults to `'holdout'`. */
819
+ defaultSplit?: RunSplitTag;
820
+ /** Default `experimentId` when not present on any span. */
821
+ experimentId?: string;
822
+ }
823
+ declare function fromOtelSpans(opts: FromOtelSpansOptions): RunRecord[];
824
+
825
+ export { type AgentEvalAgent, type AgentEvalEvaluateOptions, type AgentEvalImproveOptions, type AgentTraceContributor, type AgentTraceContributorType, type AgentTraceConversation, type AgentTraceFile, type AgentTraceIndex, type AgentTraceRange, type AgentTraceRecord, AnalyzeRunsOptions, type AuthoringProvenance, CampaignResult, CampaignStorage, type DefineAgentEvalOptions, type DefinedAgentEval, DispatchContext, type EvalCellScoreDelta, type EvalDimensionDelta, type EvalGenerationDiff, type EvalReportingSuiteInput, type EvalReportingSuiteOptions, type EvalReportingSuiteResult, type EvalRunDiff, type FeedbackTableMeta, type FeedbackTableRow, type FromFeedbackTableOptions, type FromFeedbackTableResult, type FromOtelSpansOptions, type FromRunRecordDirOptions, type FromRunRecordDirResult, Gate, GateDecision, HostedTenant, InsightReport, JudgeConfig, MutableSurface, type PartitionByAuthoringModelResult, RunEvalOptions, RunImprovementLoopResult, type RunRecordRejection, Scenario, type SelfImproveBudget, type SelfImproveLlm, type SelfImproveOptions, type SelfImproveProgressEvent, type SelfImproveResult, SurfaceProposer, defineAgentEval, diffGenerations, diffRunBaselineToWinner, diffRuns, evalReportingSuite, fromFeedbackTable, fromOtelSpans, fromRunRecordDir, parseAgentTrace, partitionRunsByAuthoringModel, selfImprove };