@tangle-network/agent-eval 0.94.0 → 0.95.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (1056) hide show
  1. package/CHANGELOG.md +15 -0
  2. package/README.md +44 -30
  3. package/dist/action-policy.d.ts +24 -0
  4. package/dist/action-policy.d.ts.map +1 -0
  5. package/dist/action-policy.test.d.ts +2 -0
  6. package/dist/action-policy.test.d.ts.map +1 -0
  7. package/dist/active-learning.d.ts +41 -0
  8. package/dist/active-learning.d.ts.map +1 -0
  9. package/dist/adapters/http.d.ts +15 -21
  10. package/dist/adapters/http.d.ts.map +1 -0
  11. package/dist/adapters/http.js.map +1 -1
  12. package/dist/adapters/langchain.d.ts +7 -13
  13. package/dist/adapters/langchain.d.ts.map +1 -0
  14. package/dist/adapters/otel.d.ts +13 -24
  15. package/dist/adapters/otel.d.ts.map +1 -0
  16. package/dist/agent-profile-cell.d.ts +101 -0
  17. package/dist/agent-profile-cell.d.ts.map +1 -0
  18. package/dist/agent-profile.d.ts +27 -0
  19. package/dist/agent-profile.d.ts.map +1 -0
  20. package/dist/agent-profile.test.d.ts +2 -0
  21. package/dist/agent-profile.test.d.ts.map +1 -0
  22. package/dist/analyst/adapters.d.ts +62 -0
  23. package/dist/analyst/adapters.d.ts.map +1 -0
  24. package/dist/analyst/analyst.test.d.ts +2 -0
  25. package/dist/analyst/analyst.test.d.ts.map +1 -0
  26. package/dist/analyst/ax-service.d.ts +27 -0
  27. package/dist/analyst/ax-service.d.ts.map +1 -0
  28. package/dist/analyst/behavioral-analyst.d.ts +28 -0
  29. package/dist/analyst/behavioral-analyst.d.ts.map +1 -0
  30. package/dist/analyst/chat-client.d.ts +91 -0
  31. package/dist/analyst/chat-client.d.ts.map +1 -0
  32. package/dist/analyst/default-registry.d.ts +27 -0
  33. package/dist/analyst/default-registry.d.ts.map +1 -0
  34. package/dist/analyst/default-registry.test.d.ts +2 -0
  35. package/dist/analyst/default-registry.test.d.ts.map +1 -0
  36. package/dist/analyst/finding-signature.d.ts +48 -0
  37. package/dist/analyst/finding-signature.d.ts.map +1 -0
  38. package/dist/analyst/finding-subject.d.ts +146 -0
  39. package/dist/analyst/finding-subject.d.ts.map +1 -0
  40. package/dist/analyst/finding-subject.test.d.ts +2 -0
  41. package/dist/analyst/finding-subject.test.d.ts.map +1 -0
  42. package/dist/analyst/findings-store.d.ts +75 -0
  43. package/dist/analyst/findings-store.d.ts.map +1 -0
  44. package/dist/analyst/index.d.ts +28 -256
  45. package/dist/analyst/index.d.ts.map +1 -0
  46. package/dist/analyst/index.js +5 -65
  47. package/dist/analyst/index.js.map +1 -1
  48. package/dist/{kind-factory-0BhLSI27.d.ts → analyst/kind-factory.d.ts} +11 -63
  49. package/dist/analyst/kind-factory.d.ts.map +1 -0
  50. package/dist/analyst/kinds/failure-mode.d.ts +19 -0
  51. package/dist/analyst/kinds/failure-mode.d.ts.map +1 -0
  52. package/dist/analyst/kinds/improvement.d.ts +23 -0
  53. package/dist/analyst/kinds/improvement.d.ts.map +1 -0
  54. package/dist/analyst/kinds/index.d.ts +22 -0
  55. package/dist/analyst/kinds/index.d.ts.map +1 -0
  56. package/dist/analyst/kinds/kinds.test.d.ts +2 -0
  57. package/dist/analyst/kinds/kinds.test.d.ts.map +1 -0
  58. package/dist/analyst/kinds/knowledge-gap.d.ts +28 -0
  59. package/dist/analyst/kinds/knowledge-gap.d.ts.map +1 -0
  60. package/dist/analyst/kinds/knowledge-poisoning.d.ts +22 -0
  61. package/dist/analyst/kinds/knowledge-poisoning.d.ts.map +1 -0
  62. package/dist/analyst/kinds/skill-usage.d.ts +84 -0
  63. package/dist/analyst/kinds/skill-usage.d.ts.map +1 -0
  64. package/dist/analyst/kinds/skill-usage.test.d.ts +2 -0
  65. package/dist/analyst/kinds/skill-usage.test.d.ts.map +1 -0
  66. package/dist/analyst/parse-tolerant.d.ts +26 -0
  67. package/dist/analyst/parse-tolerant.d.ts.map +1 -0
  68. package/dist/analyst/parse-tolerant.test.d.ts +2 -0
  69. package/dist/analyst/parse-tolerant.test.d.ts.map +1 -0
  70. package/dist/analyst/registry.budget.test.d.ts +2 -0
  71. package/dist/analyst/registry.budget.test.d.ts.map +1 -0
  72. package/dist/{default-registry-6dhErQbs.d.ts → analyst/registry.d.ts} +8 -37
  73. package/dist/analyst/registry.d.ts.map +1 -0
  74. package/dist/analyst/steer-firewall.d.ts +35 -0
  75. package/dist/analyst/steer-firewall.d.ts.map +1 -0
  76. package/dist/analyst/steer-firewall.test.d.ts +2 -0
  77. package/dist/analyst/steer-firewall.test.d.ts.map +1 -0
  78. package/dist/analyst/structure-findings.d.ts +37 -0
  79. package/dist/analyst/structure-findings.d.ts.map +1 -0
  80. package/dist/analyst/structure-findings.test.d.ts +2 -0
  81. package/dist/analyst/structure-findings.test.d.ts.map +1 -0
  82. package/dist/analyst/tool-groups.d.ts +34 -0
  83. package/dist/analyst/tool-groups.d.ts.map +1 -0
  84. package/dist/{types-Ce17tDlG.d.ts → analyst/types.d.ts} +19 -112
  85. package/dist/analyst/types.d.ts.map +1 -0
  86. package/dist/anti-slop.d.ts +59 -0
  87. package/dist/anti-slop.d.ts.map +1 -0
  88. package/dist/artifact-validator.d.ts +74 -0
  89. package/dist/artifact-validator.d.ts.map +1 -0
  90. package/dist/attestation.d.ts +63 -0
  91. package/dist/attestation.d.ts.map +1 -0
  92. package/dist/attestation.test.d.ts +2 -0
  93. package/dist/attestation.test.d.ts.map +1 -0
  94. package/dist/authenticity/index.d.ts +15 -16
  95. package/dist/authenticity/index.d.ts.map +1 -0
  96. package/dist/authenticity/index.test.d.ts +2 -0
  97. package/dist/authenticity/index.test.d.ts.map +1 -0
  98. package/dist/auto-pr.d.ts +120 -0
  99. package/dist/auto-pr.d.ts.map +1 -0
  100. package/dist/{baseline-Bbid3WoO.d.ts → baseline.d.ts} +8 -44
  101. package/dist/baseline.d.ts.map +1 -0
  102. package/dist/behavior-dsl.d.ts +73 -0
  103. package/dist/behavior-dsl.d.ts.map +1 -0
  104. package/dist/belief-state/calibration.d.ts +10 -0
  105. package/dist/belief-state/calibration.d.ts.map +1 -0
  106. package/dist/belief-state/calibration.test.d.ts +2 -0
  107. package/dist/belief-state/calibration.test.d.ts.map +1 -0
  108. package/dist/belief-state/code-agent-corpus.d.ts +66 -0
  109. package/dist/belief-state/code-agent-corpus.d.ts.map +1 -0
  110. package/dist/belief-state/code-agent-corpus.test.d.ts +2 -0
  111. package/dist/belief-state/code-agent-corpus.test.d.ts.map +1 -0
  112. package/dist/belief-state/code-agent-evidence.d.ts +22 -0
  113. package/dist/belief-state/code-agent-evidence.d.ts.map +1 -0
  114. package/dist/belief-state/code-agent-evidence.test.d.ts +2 -0
  115. package/dist/belief-state/code-agent-evidence.test.d.ts.map +1 -0
  116. package/dist/belief-state/extract.d.ts +7 -0
  117. package/dist/belief-state/extract.d.ts.map +1 -0
  118. package/dist/belief-state/extract.test.d.ts +2 -0
  119. package/dist/belief-state/extract.test.d.ts.map +1 -0
  120. package/dist/belief-state/index.d.ts +14 -604
  121. package/dist/belief-state/index.d.ts.map +1 -0
  122. package/dist/belief-state/ope.d.ts +17 -0
  123. package/dist/belief-state/ope.d.ts.map +1 -0
  124. package/dist/belief-state/ope.test.d.ts +2 -0
  125. package/dist/belief-state/ope.test.d.ts.map +1 -0
  126. package/dist/belief-state/phase0-measurement.d.ts +55 -0
  127. package/dist/belief-state/phase0-measurement.d.ts.map +1 -0
  128. package/dist/belief-state/report.d.ts +17 -0
  129. package/dist/belief-state/report.d.ts.map +1 -0
  130. package/dist/belief-state/report.test.d.ts +2 -0
  131. package/dist/belief-state/report.test.d.ts.map +1 -0
  132. package/dist/belief-state/research-evidence.d.ts +23 -0
  133. package/dist/belief-state/research-evidence.d.ts.map +1 -0
  134. package/dist/belief-state/research-evidence.test.d.ts +2 -0
  135. package/dist/belief-state/research-evidence.test.d.ts.map +1 -0
  136. package/dist/belief-state/runtime-benchmark-corpus.d.ts +32 -0
  137. package/dist/belief-state/runtime-benchmark-corpus.d.ts.map +1 -0
  138. package/dist/belief-state/runtime-hooks.d.ts +87 -0
  139. package/dist/belief-state/runtime-hooks.d.ts.map +1 -0
  140. package/dist/belief-state/runtime-hooks.test.d.ts +2 -0
  141. package/dist/belief-state/runtime-hooks.test.d.ts.map +1 -0
  142. package/dist/belief-state/selective.d.ts +15 -0
  143. package/dist/belief-state/selective.d.ts.map +1 -0
  144. package/dist/belief-state/selective.test.d.ts +2 -0
  145. package/dist/belief-state/selective.test.d.ts.map +1 -0
  146. package/dist/belief-state/shadow-probe.d.ts +80 -0
  147. package/dist/belief-state/shadow-probe.d.ts.map +1 -0
  148. package/dist/belief-state/shadow-probe.test.d.ts +2 -0
  149. package/dist/belief-state/shadow-probe.test.d.ts.map +1 -0
  150. package/dist/belief-state/types.d.ts +195 -0
  151. package/dist/belief-state/types.d.ts.map +1 -0
  152. package/dist/belief-state/types.test.d.ts +2 -0
  153. package/dist/belief-state/types.test.d.ts.map +1 -0
  154. package/dist/benchmark.d.ts +14 -0
  155. package/dist/benchmark.d.ts.map +1 -0
  156. package/dist/benchmarks/index.d.ts +23 -4
  157. package/dist/benchmarks/index.d.ts.map +1 -0
  158. package/dist/benchmarks/routing/dataset.d.ts +34 -0
  159. package/dist/benchmarks/routing/dataset.d.ts.map +1 -0
  160. package/dist/benchmarks/routing/index.d.ts +34 -0
  161. package/dist/benchmarks/routing/index.d.ts.map +1 -0
  162. package/dist/benchmarks/types.d.ts +49 -0
  163. package/dist/benchmarks/types.d.ts.map +1 -0
  164. package/dist/bisector.d.ts +81 -0
  165. package/dist/bisector.d.ts.map +1 -0
  166. package/dist/budget-guard.d.ts +31 -0
  167. package/dist/budget-guard.d.ts.map +1 -0
  168. package/dist/builder-eval/builder-session.d.ts +111 -0
  169. package/dist/builder-eval/builder-session.d.ts.map +1 -0
  170. package/dist/builder-eval/correlation.d.ts +32 -0
  171. package/dist/builder-eval/correlation.d.ts.map +1 -0
  172. package/dist/builder-eval/index.d.ts +5 -250
  173. package/dist/builder-eval/index.d.ts.map +1 -0
  174. package/dist/builder-eval/project-registry.d.ts +51 -0
  175. package/dist/builder-eval/project-registry.d.ts.map +1 -0
  176. package/dist/builder-eval/three-layer-eval.d.ts +55 -0
  177. package/dist/builder-eval/three-layer-eval.d.ts.map +1 -0
  178. package/dist/campaign/analyst-surface.d.ts +108 -0
  179. package/dist/campaign/analyst-surface.d.ts.map +1 -0
  180. package/dist/campaign/analyst-surface.test.d.ts +2 -0
  181. package/dist/campaign/analyst-surface.test.d.ts.map +1 -0
  182. package/dist/campaign/auto-pr.d.ts +46 -0
  183. package/dist/campaign/auto-pr.d.ts.map +1 -0
  184. package/dist/campaign/distillation/agreement-judge.d.ts +69 -0
  185. package/dist/campaign/distillation/agreement-judge.d.ts.map +1 -0
  186. package/dist/campaign/distillation/cli.d.ts +35 -0
  187. package/dist/campaign/distillation/cli.d.ts.map +1 -0
  188. package/dist/campaign/distillation/distillation.test.d.ts +2 -0
  189. package/dist/campaign/distillation/distillation.test.d.ts.map +1 -0
  190. package/dist/campaign/distillation/gold-scenarios.d.ts +54 -0
  191. package/dist/campaign/distillation/gold-scenarios.d.ts.map +1 -0
  192. package/dist/campaign/distillation/run-distillation.d.ts +119 -0
  193. package/dist/campaign/distillation/run-distillation.d.ts.map +1 -0
  194. package/dist/campaign/gates/compose.d.ts +12 -0
  195. package/dist/campaign/gates/compose.d.ts.map +1 -0
  196. package/dist/campaign/gates/default-production-gate.d.ts +58 -0
  197. package/dist/campaign/gates/default-production-gate.d.ts.map +1 -0
  198. package/dist/campaign/gates/heldout-gate.d.ts +12 -0
  199. package/dist/campaign/gates/heldout-gate.d.ts.map +1 -0
  200. package/dist/campaign/gates/promotion-policy.d.ts +125 -0
  201. package/dist/campaign/gates/promotion-policy.d.ts.map +1 -0
  202. package/dist/campaign/gates/promotion-policy.test.d.ts +2 -0
  203. package/dist/campaign/gates/promotion-policy.test.d.ts.map +1 -0
  204. package/dist/campaign/gates/sequential.d.ts +146 -0
  205. package/dist/campaign/gates/sequential.d.ts.map +1 -0
  206. package/dist/campaign/gates/sequential.test.d.ts +2 -0
  207. package/dist/campaign/gates/sequential.test.d.ts.map +1 -0
  208. package/dist/campaign/gates/statistical-heldout.d.ts +99 -0
  209. package/dist/campaign/gates/statistical-heldout.d.ts.map +1 -0
  210. package/dist/campaign/gates/statistical-heldout.test.d.ts +2 -0
  211. package/dist/campaign/gates/statistical-heldout.test.d.ts.map +1 -0
  212. package/dist/campaign/index.d.ts +38 -1341
  213. package/dist/campaign/index.d.ts.map +1 -0
  214. package/dist/campaign/index.js +1863 -1316
  215. package/dist/campaign/index.js.map +1 -1
  216. package/dist/campaign/labeled-store/fs-adapter.d.ts +59 -0
  217. package/dist/campaign/labeled-store/fs-adapter.d.ts.map +1 -0
  218. package/dist/campaign/presets/compare-proposers.d.ts +146 -0
  219. package/dist/campaign/presets/compare-proposers.d.ts.map +1 -0
  220. package/dist/campaign/presets/playback.d.ts +120 -0
  221. package/dist/campaign/presets/playback.d.ts.map +1 -0
  222. package/dist/campaign/presets/playback.test.d.ts +2 -0
  223. package/dist/campaign/presets/playback.test.d.ts.map +1 -0
  224. package/dist/campaign/presets/run-eval.d.ts +14 -0
  225. package/dist/campaign/presets/run-eval.d.ts.map +1 -0
  226. package/dist/campaign/presets/run-improvement-loop.d.ts +63 -0
  227. package/dist/campaign/presets/run-improvement-loop.d.ts.map +1 -0
  228. package/dist/campaign/presets/run-improvement-loop.test.d.ts +2 -0
  229. package/dist/campaign/presets/run-improvement-loop.test.d.ts.map +1 -0
  230. package/dist/campaign/presets/run-optimization.d.ts +92 -0
  231. package/dist/campaign/presets/run-optimization.d.ts.map +1 -0
  232. package/dist/campaign/presets/run-profile-matrix.d.ts +151 -0
  233. package/dist/campaign/presets/run-profile-matrix.d.ts.map +1 -0
  234. package/dist/campaign/presets/run-skill-opt.d.ts +96 -0
  235. package/dist/campaign/presets/run-skill-opt.d.ts.map +1 -0
  236. package/dist/campaign/proposers/_findings-text.d.ts +22 -0
  237. package/dist/campaign/proposers/_findings-text.d.ts.map +1 -0
  238. package/dist/campaign/proposers/ace.d.ts +33 -0
  239. package/dist/campaign/proposers/ace.d.ts.map +1 -0
  240. package/dist/campaign/proposers/ace.test.d.ts +2 -0
  241. package/dist/campaign/proposers/ace.test.d.ts.map +1 -0
  242. package/dist/campaign/proposers/analysis-edit.d.ts +32 -0
  243. package/dist/campaign/proposers/analysis-edit.d.ts.map +1 -0
  244. package/dist/campaign/proposers/evolutionary.d.ts +20 -0
  245. package/dist/campaign/proposers/evolutionary.d.ts.map +1 -0
  246. package/dist/campaign/proposers/fapo.d.ts +120 -0
  247. package/dist/campaign/proposers/fapo.d.ts.map +1 -0
  248. package/dist/campaign/proposers/gepa.d.ts +86 -0
  249. package/dist/campaign/proposers/gepa.d.ts.map +1 -0
  250. package/dist/campaign/proposers/halo.d.ts +44 -0
  251. package/dist/campaign/proposers/halo.d.ts.map +1 -0
  252. package/dist/campaign/proposers/halo.test.d.ts +2 -0
  253. package/dist/campaign/proposers/halo.test.d.ts.map +1 -0
  254. package/dist/campaign/proposers/memory.d.ts +47 -0
  255. package/dist/campaign/proposers/memory.d.ts.map +1 -0
  256. package/dist/campaign/proposers/memory.test.d.ts +2 -0
  257. package/dist/campaign/proposers/memory.test.d.ts.map +1 -0
  258. package/dist/campaign/proposers/skill-opt.d.ts +88 -0
  259. package/dist/campaign/proposers/skill-opt.d.ts.map +1 -0
  260. package/dist/campaign/proposers/trace-analyst.d.ts +48 -0
  261. package/dist/campaign/proposers/trace-analyst.d.ts.map +1 -0
  262. package/dist/campaign/proposers/trace-analyst.test.d.ts +2 -0
  263. package/dist/campaign/proposers/trace-analyst.test.d.ts.map +1 -0
  264. package/dist/campaign/provenance.d.ts +185 -0
  265. package/dist/campaign/provenance.d.ts.map +1 -0
  266. package/dist/campaign/run-campaign.d.ts +90 -0
  267. package/dist/campaign/run-campaign.d.ts.map +1 -0
  268. package/dist/campaign/score-utils.d.ts +26 -0
  269. package/dist/campaign/score-utils.d.ts.map +1 -0
  270. package/dist/campaign/skill-patch.d.ts +62 -0
  271. package/dist/campaign/skill-patch.d.ts.map +1 -0
  272. package/dist/campaign/storage.d.ts +38 -0
  273. package/dist/campaign/storage.d.ts.map +1 -0
  274. package/dist/{types-BU-7W85F.d.ts → campaign/types.d.ts} +98 -99
  275. package/dist/campaign/types.d.ts.map +1 -0
  276. package/dist/campaign/worktree/index.d.ts +53 -0
  277. package/dist/campaign/worktree/index.d.ts.map +1 -0
  278. package/dist/canary.d.ts +101 -0
  279. package/dist/canary.d.ts.map +1 -0
  280. package/dist/causal-attribution.d.ts +45 -0
  281. package/dist/causal-attribution.d.ts.map +1 -0
  282. package/dist/{chunk-2K6UUZ7P.js → chunk-2T4EZACH.js} +1 -1
  283. package/dist/chunk-2T4EZACH.js.map +1 -0
  284. package/dist/{chunk-CTBHKLEU.js → chunk-77T4STFI.js} +59 -86
  285. package/dist/chunk-77T4STFI.js.map +1 -0
  286. package/dist/{chunk-EGPMSBEZ.js → chunk-7QTQKIDD.js} +178 -177
  287. package/dist/chunk-7QTQKIDD.js.map +1 -0
  288. package/dist/{chunk-MIFZUPEK.js → chunk-AQ5WQAIV.js} +21 -6
  289. package/dist/chunk-AQ5WQAIV.js.map +1 -0
  290. package/dist/chunk-DJWX3GVS.js +81 -0
  291. package/dist/chunk-DJWX3GVS.js.map +1 -0
  292. package/dist/{chunk-S6OZEZQK.js → chunk-HMA63UEO.js} +37 -9
  293. package/dist/{chunk-S6OZEZQK.js.map → chunk-HMA63UEO.js.map} +1 -1
  294. package/dist/{chunk-TBDR6PAI.js → chunk-IZCEK2HR.js} +2 -2
  295. package/dist/{chunk-SD2YFWQQ.js → chunk-KKWJD5E6.js} +20 -20
  296. package/dist/chunk-KKWJD5E6.js.map +1 -0
  297. package/dist/{chunk-KWRRMR3J.js → chunk-LO6IOIJ2.js} +10 -10
  298. package/dist/chunk-LO6IOIJ2.js.map +1 -0
  299. package/dist/{chunk-E4GH6USR.js → chunk-NZEQVRH5.js} +2 -2
  300. package/dist/chunk-NZEQVRH5.js.map +1 -0
  301. package/dist/{chunk-MPQWFX6Y.js → chunk-PSWWQXHF.js} +13 -88
  302. package/dist/chunk-PSWWQXHF.js.map +1 -0
  303. package/dist/{chunk-Q5LIB7BC.js → chunk-S4SYLDFX.js} +2 -2
  304. package/dist/chunk-S4SYLDFX.js.map +1 -0
  305. package/dist/{chunk-KW53MSA5.js → chunk-X74V6ESX.js} +2 -2
  306. package/dist/{chunk-QMUEXQJS.js → chunk-YBIGNSCZ.js} +81 -4
  307. package/dist/chunk-YBIGNSCZ.js.map +1 -0
  308. package/dist/{chunk-2KNZHH3P.js → chunk-Z6L6YSU6.js} +2 -2
  309. package/dist/ci-gate.d.ts +44 -0
  310. package/dist/ci-gate.d.ts.map +1 -0
  311. package/dist/cli.d.ts +2 -0
  312. package/dist/cli.d.ts.map +1 -0
  313. package/dist/client.d.ts +77 -0
  314. package/dist/client.d.ts.map +1 -0
  315. package/dist/client.test.d.ts +2 -0
  316. package/dist/client.test.d.ts.map +1 -0
  317. package/dist/command-runner.d.ts +74 -0
  318. package/dist/command-runner.d.ts.map +1 -0
  319. package/dist/command-runner.test.d.ts +2 -0
  320. package/dist/command-runner.test.d.ts.map +1 -0
  321. package/dist/completion-verifier.d.ts +147 -0
  322. package/dist/completion-verifier.d.ts.map +1 -0
  323. package/dist/completion-verifier.test.d.ts +9 -0
  324. package/dist/completion-verifier.test.d.ts.map +1 -0
  325. package/dist/concurrency.d.ts +23 -0
  326. package/dist/concurrency.d.ts.map +1 -0
  327. package/dist/contamination-guard.d.ts +81 -0
  328. package/dist/contamination-guard.d.ts.map +1 -0
  329. package/dist/{analyze-runs-B6Ljo_dI.d.ts → contract/analyze-runs.d.ts} +9 -10
  330. package/dist/contract/analyze-runs.d.ts.map +1 -0
  331. package/dist/contract/define-agent-eval.d.ts +52 -0
  332. package/dist/contract/define-agent-eval.d.ts.map +1 -0
  333. package/dist/contract/diff.d.ts +114 -0
  334. package/dist/contract/diff.d.ts.map +1 -0
  335. package/dist/contract/index.d.ts +106 -640
  336. package/dist/contract/index.d.ts.map +1 -0
  337. package/dist/contract/index.js +127 -17
  338. package/dist/contract/index.js.map +1 -1
  339. package/dist/{insight-report-DWl3z9tl.d.ts → contract/insight-report.d.ts} +16 -19
  340. package/dist/contract/insight-report.d.ts.map +1 -0
  341. package/dist/contract/insight-types-fwd.d.ts +7 -0
  342. package/dist/contract/insight-types-fwd.d.ts.map +1 -0
  343. package/dist/contract/intake/agent-trace.d.ts +97 -0
  344. package/dist/contract/intake/agent-trace.d.ts.map +1 -0
  345. package/dist/{code-agent-session-BO8nCnv3.d.ts → contract/intake/code-agent-session.d.ts} +15 -17
  346. package/dist/contract/intake/code-agent-session.d.ts.map +1 -0
  347. package/dist/contract/intake/feedback-table.d.ts +87 -0
  348. package/dist/contract/intake/feedback-table.d.ts.map +1 -0
  349. package/dist/contract/intake/index.d.ts +22 -0
  350. package/dist/contract/intake/index.d.ts.map +1 -0
  351. package/dist/contract/intake/otel-spans.d.ts +33 -0
  352. package/dist/contract/intake/otel-spans.d.ts.map +1 -0
  353. package/dist/contract/self-improve.d.ts +284 -0
  354. package/dist/contract/self-improve.d.ts.map +1 -0
  355. package/dist/{control-runtime-Acf9CGhw.d.ts → control-runtime.d.ts} +23 -26
  356. package/dist/control-runtime.d.ts.map +1 -0
  357. package/dist/control-runtime.test.d.ts +2 -0
  358. package/dist/control-runtime.test.d.ts.map +1 -0
  359. package/dist/control.d.ts +11 -9
  360. package/dist/control.d.ts.map +1 -0
  361. package/dist/control.js +2 -2
  362. package/dist/convergence.d.ts +29 -0
  363. package/dist/convergence.d.ts.map +1 -0
  364. package/dist/{cost-ledger-DuSqlw5B.d.ts → cost-ledger.d.ts} +10 -11
  365. package/dist/cost-ledger.d.ts.map +1 -0
  366. package/dist/cost-ledger.test.d.ts +2 -0
  367. package/dist/cost-ledger.test.d.ts.map +1 -0
  368. package/dist/cost-report.d.ts +43 -0
  369. package/dist/cost-report.d.ts.map +1 -0
  370. package/dist/cost-report.test.d.ts +2 -0
  371. package/dist/cost-report.test.d.ts.map +1 -0
  372. package/dist/cost-tracker.d.ts +76 -0
  373. package/dist/cost-tracker.d.ts.map +1 -0
  374. package/dist/{counterfactual-DlOz8PBx.d.ts → counterfactual.d.ts} +12 -13
  375. package/dist/counterfactual.d.ts.map +1 -0
  376. package/dist/cross-trace-diff.d.ts +56 -0
  377. package/dist/cross-trace-diff.d.ts.map +1 -0
  378. package/dist/{dataset-BbGkaN2I.d.ts → dataset.d.ts} +11 -14
  379. package/dist/dataset.d.ts.map +1 -0
  380. package/dist/deploy-gate-layer.d.ts +125 -0
  381. package/dist/deploy-gate-layer.d.ts.map +1 -0
  382. package/dist/deploy-gate-layer.test.d.ts +2 -0
  383. package/dist/deploy-gate-layer.test.d.ts.map +1 -0
  384. package/dist/description-length-gate.d.ts +119 -0
  385. package/dist/description-length-gate.d.ts.map +1 -0
  386. package/dist/detectors/edge.test.d.ts +2 -0
  387. package/dist/detectors/edge.test.d.ts.map +1 -0
  388. package/dist/detectors/index.d.ts +81 -0
  389. package/dist/detectors/index.d.ts.map +1 -0
  390. package/dist/detectors/index.test.d.ts +2 -0
  391. package/dist/detectors/index.test.d.ts.map +1 -0
  392. package/dist/diagnose/causal-sweep.d.ts +100 -0
  393. package/dist/diagnose/causal-sweep.d.ts.map +1 -0
  394. package/dist/diagnose/index.d.ts +36 -0
  395. package/dist/diagnose/index.d.ts.map +1 -0
  396. package/dist/diagnose/remediation.d.ts +68 -0
  397. package/dist/diagnose/remediation.d.ts.map +1 -0
  398. package/dist/diagnose/repair.d.ts +77 -0
  399. package/dist/diagnose/repair.d.ts.map +1 -0
  400. package/dist/diagnose.d.ts +1 -251
  401. package/dist/diagnose.js +1 -1
  402. package/dist/discover-personas.d.ts +35 -0
  403. package/dist/discover-personas.d.ts.map +1 -0
  404. package/dist/driver.d.ts +95 -0
  405. package/dist/driver.d.ts.map +1 -0
  406. package/dist/driver.test.d.ts +8 -0
  407. package/dist/driver.test.d.ts.map +1 -0
  408. package/dist/dual-agent-bench.d.ts +81 -0
  409. package/dist/dual-agent-bench.d.ts.map +1 -0
  410. package/dist/error-count-extractor.d.ts +47 -0
  411. package/dist/error-count-extractor.d.ts.map +1 -0
  412. package/dist/error-count-extractor.test.d.ts +2 -0
  413. package/dist/error-count-extractor.test.d.ts.map +1 -0
  414. package/dist/{errors-CzMUYo7b.d.ts → errors.d.ts} +10 -11
  415. package/dist/errors.d.ts.map +1 -0
  416. package/dist/{researcher-B0C2_fVO.d.ts → eval-campaign.d.ts} +34 -156
  417. package/dist/eval-campaign.d.ts.map +1 -0
  418. package/dist/eval-campaign.test.d.ts +2 -0
  419. package/dist/eval-campaign.test.d.ts.map +1 -0
  420. package/dist/eval-tools.d.ts +55 -0
  421. package/dist/eval-tools.d.ts.map +1 -0
  422. package/dist/eval-trace-store.d.ts +107 -0
  423. package/dist/eval-trace-store.d.ts.map +1 -0
  424. package/dist/eval-trace-store.test.d.ts +2 -0
  425. package/dist/eval-trace-store.test.d.ts.map +1 -0
  426. package/dist/executor.d.ts +38 -0
  427. package/dist/executor.d.ts.map +1 -0
  428. package/dist/executor.test.d.ts +10 -0
  429. package/dist/executor.test.d.ts.map +1 -0
  430. package/dist/experiment-tracker.d.ts +178 -0
  431. package/dist/experiment-tracker.d.ts.map +1 -0
  432. package/dist/experiment-tracker.test.d.ts +2 -0
  433. package/dist/experiment-tracker.test.d.ts.map +1 -0
  434. package/dist/failure-taxonomy.d.ts +38 -0
  435. package/dist/failure-taxonomy.d.ts.map +1 -0
  436. package/dist/{feedback-trajectory-BxY0cKfs.d.ts → feedback-trajectory.d.ts} +36 -38
  437. package/dist/feedback-trajectory.d.ts.map +1 -0
  438. package/dist/feedback-trajectory.test.d.ts +2 -0
  439. package/dist/feedback-trajectory.test.d.ts.map +1 -0
  440. package/dist/flow-layer.d.ts +90 -0
  441. package/dist/flow-layer.d.ts.map +1 -0
  442. package/dist/flow-layer.test.d.ts +2 -0
  443. package/dist/flow-layer.test.d.ts.map +1 -0
  444. package/dist/fuzz/capsule.d.ts +46 -0
  445. package/dist/fuzz/capsule.d.ts.map +1 -0
  446. package/dist/fuzz/cube.d.ts +36 -0
  447. package/dist/fuzz/cube.d.ts.map +1 -0
  448. package/dist/fuzz/explorer-cost.test.d.ts +2 -0
  449. package/dist/fuzz/explorer-cost.test.d.ts.map +1 -0
  450. package/dist/fuzz/explorer.d.ts +64 -0
  451. package/dist/fuzz/explorer.d.ts.map +1 -0
  452. package/dist/fuzz/fuzz-agent.d.ts +16 -0
  453. package/dist/fuzz/fuzz-agent.d.ts.map +1 -0
  454. package/dist/fuzz/fuzz-agent.test.d.ts +2 -0
  455. package/dist/fuzz/fuzz-agent.test.d.ts.map +1 -0
  456. package/dist/fuzz/gates.d.ts +33 -0
  457. package/dist/fuzz/gates.d.ts.map +1 -0
  458. package/dist/fuzz/index.d.ts +26 -0
  459. package/dist/fuzz/index.d.ts.map +1 -0
  460. package/dist/fuzz/policies.d.ts +28 -0
  461. package/dist/fuzz/policies.d.ts.map +1 -0
  462. package/dist/fuzz/tools.d.ts +20 -0
  463. package/dist/fuzz/tools.d.ts.map +1 -0
  464. package/dist/fuzz/types.d.ts +307 -0
  465. package/dist/fuzz/types.d.ts.map +1 -0
  466. package/dist/fuzz.d.ts +1 -547
  467. package/dist/golden-matcher.d.ts +71 -0
  468. package/dist/golden-matcher.d.ts.map +1 -0
  469. package/dist/governance/eu-ai-act.d.ts +37 -0
  470. package/dist/governance/eu-ai-act.d.ts.map +1 -0
  471. package/dist/governance/index.d.ts +5 -135
  472. package/dist/governance/index.d.ts.map +1 -0
  473. package/dist/governance/nist-ai-rmf.d.ts +15 -0
  474. package/dist/governance/nist-ai-rmf.d.ts.map +1 -0
  475. package/dist/governance/soc2.d.ts +12 -0
  476. package/dist/governance/soc2.d.ts.map +1 -0
  477. package/dist/governance/types.d.ts +66 -0
  478. package/dist/governance/types.d.ts.map +1 -0
  479. package/dist/harness-optimizer.d.ts +82 -0
  480. package/dist/harness-optimizer.d.ts.map +1 -0
  481. package/dist/held-out-gate.d.ts +135 -0
  482. package/dist/held-out-gate.d.ts.map +1 -0
  483. package/dist/hosted/client.d.ts +73 -0
  484. package/dist/hosted/client.d.ts.map +1 -0
  485. package/dist/hosted/from-env.test.d.ts +8 -0
  486. package/dist/hosted/from-env.test.d.ts.map +1 -0
  487. package/dist/hosted/index.d.ts +10 -238
  488. package/dist/hosted/index.d.ts.map +1 -0
  489. package/dist/hosted/types.d.ts +159 -0
  490. package/dist/hosted/types.d.ts.map +1 -0
  491. package/dist/index.d.ts +277 -5665
  492. package/dist/index.d.ts.map +1 -0
  493. package/dist/index.js +66 -31
  494. package/dist/index.js.map +1 -1
  495. package/dist/integrity/backend-integrity.d.ts +71 -0
  496. package/dist/integrity/backend-integrity.d.ts.map +1 -0
  497. package/dist/integrity/preflight.d.ts +72 -0
  498. package/dist/integrity/preflight.d.ts.map +1 -0
  499. package/dist/integrity/preflight.test.d.ts +2 -0
  500. package/dist/integrity/preflight.test.d.ts.map +1 -0
  501. package/dist/integrity/single-backend.d.ts +67 -0
  502. package/dist/integrity/single-backend.d.ts.map +1 -0
  503. package/dist/intent-match-judge.d.ts +69 -0
  504. package/dist/intent-match-judge.d.ts.map +1 -0
  505. package/dist/intent-match-judge.test.d.ts +2 -0
  506. package/dist/intent-match-judge.test.d.ts.map +1 -0
  507. package/dist/{judge-calibration-0p2QcWNE.d.ts → judge-calibration.d.ts} +16 -17
  508. package/dist/judge-calibration.d.ts.map +1 -0
  509. package/dist/judge-ensemble.d.ts +66 -0
  510. package/dist/judge-ensemble.d.ts.map +1 -0
  511. package/dist/judge-ensemble.test.d.ts +8 -0
  512. package/dist/judge-ensemble.test.d.ts.map +1 -0
  513. package/dist/judge-families.d.ts +38 -0
  514. package/dist/judge-families.d.ts.map +1 -0
  515. package/dist/judge-panel.d.ts +65 -0
  516. package/dist/judge-panel.d.ts.map +1 -0
  517. package/dist/judge-retry.d.ts +70 -0
  518. package/dist/judge-retry.d.ts.map +1 -0
  519. package/dist/judge-runner.d.ts +36 -0
  520. package/dist/judge-runner.d.ts.map +1 -0
  521. package/dist/judge-runner.test.d.ts +2 -0
  522. package/dist/judge-runner.test.d.ts.map +1 -0
  523. package/dist/judges.d.ts +74 -0
  524. package/dist/judges.d.ts.map +1 -0
  525. package/dist/keyword-coverage-judge.d.ts +89 -0
  526. package/dist/keyword-coverage-judge.d.ts.map +1 -0
  527. package/dist/keyword-coverage-judge.test.d.ts +2 -0
  528. package/dist/keyword-coverage-judge.test.d.ts.map +1 -0
  529. package/dist/knowledge/index.d.ts +3 -103
  530. package/dist/knowledge/index.d.ts.map +1 -0
  531. package/dist/knowledge/readiness.d.ts +26 -0
  532. package/dist/knowledge/readiness.d.ts.map +1 -0
  533. package/dist/knowledge/types.d.ts +75 -0
  534. package/dist/knowledge/types.d.ts.map +1 -0
  535. package/dist/live-proof.d.ts +62 -0
  536. package/dist/live-proof.d.ts.map +1 -0
  537. package/dist/{llm-client-Bj7g0rqu.d.ts → llm-client.d.ts} +21 -23
  538. package/dist/llm-client.d.ts.map +1 -0
  539. package/dist/llm-client.test.d.ts +2 -0
  540. package/dist/llm-client.test.d.ts.map +1 -0
  541. package/dist/locked-jsonl-appender.d.ts +19 -0
  542. package/dist/locked-jsonl-appender.d.ts.map +1 -0
  543. package/dist/matrix/aggregation.d.ts +16 -0
  544. package/dist/matrix/aggregation.d.ts.map +1 -0
  545. package/dist/matrix/index.d.ts +12 -30
  546. package/dist/matrix/index.d.ts.map +1 -0
  547. package/dist/matrix/runner.d.ts +15 -0
  548. package/dist/matrix/runner.d.ts.map +1 -0
  549. package/dist/{types-mn5Aqk7x.d.ts → matrix/types.d.ts} +11 -15
  550. package/dist/matrix/types.d.ts.map +1 -0
  551. package/dist/meta-eval/calibration.d.ts +47 -0
  552. package/dist/meta-eval/calibration.d.ts.map +1 -0
  553. package/dist/meta-eval/correlation-study.d.ts +53 -0
  554. package/dist/meta-eval/correlation-study.d.ts.map +1 -0
  555. package/dist/meta-eval/index.d.ts +6 -181
  556. package/dist/meta-eval/index.d.ts.map +1 -0
  557. package/dist/{outcome-store-rnXLEqSn.d.ts → meta-eval/outcome-store.d.ts} +7 -8
  558. package/dist/meta-eval/outcome-store.d.ts.map +1 -0
  559. package/dist/{rubric-predictive-validity-Cy_W-hWZ.d.ts → meta-eval/rubric-predictive-validity.d.ts} +8 -11
  560. package/dist/meta-eval/rubric-predictive-validity.d.ts.map +1 -0
  561. package/dist/meta-eval/sentinel.d.ts +169 -0
  562. package/dist/meta-eval/sentinel.d.ts.map +1 -0
  563. package/dist/metrics.d.ts +63 -0
  564. package/dist/metrics.d.ts.map +1 -0
  565. package/dist/model-seats.d.ts +71 -0
  566. package/dist/model-seats.d.ts.map +1 -0
  567. package/dist/model-seats.test.d.ts +2 -0
  568. package/dist/model-seats.test.d.ts.map +1 -0
  569. package/dist/muffled-gate-scanner.d.ts +102 -0
  570. package/dist/muffled-gate-scanner.d.ts.map +1 -0
  571. package/dist/{multi-layer-verifier-DUZXrPDA.d.ts → multi-layer-verifier.d.ts} +12 -15
  572. package/dist/multi-layer-verifier.d.ts.map +1 -0
  573. package/dist/multi-layer-verifier.test.d.ts +2 -0
  574. package/dist/multi-layer-verifier.test.d.ts.map +1 -0
  575. package/dist/multi-toolchain-layer.d.ts +80 -0
  576. package/dist/multi-toolchain-layer.d.ts.map +1 -0
  577. package/dist/multi-toolchain-layer.test.d.ts +2 -0
  578. package/dist/multi-toolchain-layer.test.d.ts.map +1 -0
  579. package/dist/multishot/default-tools.d.ts +34 -0
  580. package/dist/multishot/default-tools.d.ts.map +1 -0
  581. package/dist/multishot/index.d.ts +7 -290
  582. package/dist/multishot/index.d.ts.map +1 -0
  583. package/dist/multishot/index.js.map +1 -1
  584. package/dist/multishot/judges.d.ts +32 -0
  585. package/dist/multishot/judges.d.ts.map +1 -0
  586. package/dist/multishot/matrix.d.ts +107 -0
  587. package/dist/multishot/matrix.d.ts.map +1 -0
  588. package/dist/multishot/multishot.d.ts +23 -0
  589. package/dist/multishot/multishot.d.ts.map +1 -0
  590. package/dist/multishot/router.d.ts +37 -0
  591. package/dist/multishot/router.d.ts.map +1 -0
  592. package/dist/multishot/types.d.ts +60 -0
  593. package/dist/multishot/types.d.ts.map +1 -0
  594. package/dist/observability.d.ts +71 -0
  595. package/dist/observability.d.ts.map +1 -0
  596. package/dist/openapi.json +1 -1
  597. package/dist/oracle.d.ts +55 -0
  598. package/dist/oracle.d.ts.map +1 -0
  599. package/dist/orthogonality.d.ts +35 -0
  600. package/dist/orthogonality.d.ts.map +1 -0
  601. package/dist/otel-pipeline.d.ts +31 -0
  602. package/dist/otel-pipeline.d.ts.map +1 -0
  603. package/dist/paraphrase.d.ts +107 -0
  604. package/dist/paraphrase.d.ts.map +1 -0
  605. package/dist/{pareto-E-pembql.d.ts → pareto.d.ts} +9 -10
  606. package/dist/pareto.d.ts.map +1 -0
  607. package/dist/partition-held-out.d.ts +70 -0
  608. package/dist/partition-held-out.d.ts.map +1 -0
  609. package/dist/partition-held-out.test.d.ts +2 -0
  610. package/dist/partition-held-out.test.d.ts.map +1 -0
  611. package/dist/perf/index.d.ts +13 -119
  612. package/dist/perf/index.d.ts.map +1 -0
  613. package/dist/perf/integrity.d.ts +30 -0
  614. package/dist/perf/integrity.d.ts.map +1 -0
  615. package/dist/perf/journey.d.ts +45 -0
  616. package/dist/perf/journey.d.ts.map +1 -0
  617. package/dist/perf/ratchet.d.ts +47 -0
  618. package/dist/perf/ratchet.d.ts.map +1 -0
  619. package/dist/pipelines/budget-breach.d.ts +31 -0
  620. package/dist/pipelines/budget-breach.d.ts.map +1 -0
  621. package/dist/pipelines/budget-breach.test.d.ts +2 -0
  622. package/dist/pipelines/budget-breach.test.d.ts.map +1 -0
  623. package/dist/pipelines/failure-cluster.d.ts +38 -0
  624. package/dist/pipelines/failure-cluster.d.ts.map +1 -0
  625. package/dist/pipelines/failure-cluster.test.d.ts +2 -0
  626. package/dist/pipelines/failure-cluster.test.d.ts.map +1 -0
  627. package/dist/pipelines/first-divergence.d.ts +26 -0
  628. package/dist/pipelines/first-divergence.d.ts.map +1 -0
  629. package/dist/pipelines/first-divergence.test.d.ts +2 -0
  630. package/dist/pipelines/first-divergence.test.d.ts.map +1 -0
  631. package/dist/pipelines/index.d.ts +8 -173
  632. package/dist/pipelines/index.d.ts.map +1 -0
  633. package/dist/pipelines/judge-agreement.d.ts +26 -0
  634. package/dist/pipelines/judge-agreement.d.ts.map +1 -0
  635. package/dist/pipelines/judge-agreement.test.d.ts +2 -0
  636. package/dist/pipelines/judge-agreement.test.d.ts.map +1 -0
  637. package/dist/pipelines/regression.d.ts +23 -0
  638. package/dist/pipelines/regression.d.ts.map +1 -0
  639. package/dist/pipelines/regression.test.d.ts +2 -0
  640. package/dist/pipelines/regression.test.d.ts.map +1 -0
  641. package/dist/pipelines/stuck-loop.d.ts +32 -0
  642. package/dist/pipelines/stuck-loop.d.ts.map +1 -0
  643. package/dist/pipelines/stuck-loop.test.d.ts +2 -0
  644. package/dist/pipelines/stuck-loop.test.d.ts.map +1 -0
  645. package/dist/pipelines/tool-waste.d.ts +34 -0
  646. package/dist/pipelines/tool-waste.d.ts.map +1 -0
  647. package/dist/pipelines/tool-waste.test.d.ts +2 -0
  648. package/dist/pipelines/tool-waste.test.d.ts.map +1 -0
  649. package/dist/playbook.d.ts +16 -0
  650. package/dist/playbook.d.ts.map +1 -0
  651. package/dist/pr-review-benchmark.d.ts +88 -0
  652. package/dist/pr-review-benchmark.d.ts.map +1 -0
  653. package/dist/pr-review-benchmark.test.d.ts +2 -0
  654. package/dist/pr-review-benchmark.test.d.ts.map +1 -0
  655. package/dist/pre-registration.d.ts +125 -0
  656. package/dist/pre-registration.d.ts.map +1 -0
  657. package/dist/prm/builtin-rubrics.d.ts +33 -0
  658. package/dist/prm/builtin-rubrics.d.ts.map +1 -0
  659. package/dist/prm/index.d.ts +5 -104
  660. package/dist/prm/index.d.ts.map +1 -0
  661. package/dist/prm/inference.d.ts +29 -0
  662. package/dist/prm/inference.d.ts.map +1 -0
  663. package/dist/prm/inference.test.d.ts +2 -0
  664. package/dist/prm/inference.test.d.ts.map +1 -0
  665. package/dist/{rubric-Cc6UHvUb.d.ts → prm/rubric.d.ts} +10 -13
  666. package/dist/prm/rubric.d.ts.map +1 -0
  667. package/dist/prm/training-export.d.ts +38 -0
  668. package/dist/prm/training-export.d.ts.map +1 -0
  669. package/dist/produced-state.d.ts +63 -0
  670. package/dist/produced-state.d.ts.map +1 -0
  671. package/dist/produced-state.test.d.ts +8 -0
  672. package/dist/produced-state.test.d.ts.map +1 -0
  673. package/dist/profile/baselines.d.ts +37 -0
  674. package/dist/profile/baselines.d.ts.map +1 -0
  675. package/dist/profile/index.d.ts +105 -0
  676. package/dist/profile/index.d.ts.map +1 -0
  677. package/dist/promotion-gate.d.ts +93 -0
  678. package/dist/promotion-gate.d.ts.map +1 -0
  679. package/dist/prompt-registry.d.ts +41 -0
  680. package/dist/prompt-registry.d.ts.map +1 -0
  681. package/dist/propose-review-control.d.ts +49 -0
  682. package/dist/propose-review-control.d.ts.map +1 -0
  683. package/dist/propose-review-control.test.d.ts +2 -0
  684. package/dist/propose-review-control.test.d.ts.map +1 -0
  685. package/dist/propose-review.d.ts +155 -0
  686. package/dist/propose-review.d.ts.map +1 -0
  687. package/dist/{red-team-BWdoyleI.d.ts → red-team.d.ts} +14 -16
  688. package/dist/red-team.d.ts.map +1 -0
  689. package/dist/reference-replay-steering.d.ts +11 -0
  690. package/dist/reference-replay-steering.d.ts.map +1 -0
  691. package/dist/reference-replay.d.ts +176 -0
  692. package/dist/reference-replay.d.ts.map +1 -0
  693. package/dist/reflective-mutation.d.ts +79 -0
  694. package/dist/reflective-mutation.d.ts.map +1 -0
  695. package/dist/registry.d.ts +31 -0
  696. package/dist/registry.d.ts.map +1 -0
  697. package/dist/release-confidence.d.ts +128 -0
  698. package/dist/release-confidence.d.ts.map +1 -0
  699. package/dist/release-report.d.ts +11 -0
  700. package/dist/release-report.d.ts.map +1 -0
  701. package/dist/replay.d.ts +120 -0
  702. package/dist/replay.d.ts.map +1 -0
  703. package/dist/reporter.d.ts +14 -0
  704. package/dist/reporter.d.ts.map +1 -0
  705. package/dist/reporting.d.ts +15 -15
  706. package/dist/reporting.d.ts.map +1 -0
  707. package/dist/researcher.d.ts +140 -0
  708. package/dist/researcher.d.ts.map +1 -0
  709. package/dist/reviewer.d.ts +118 -0
  710. package/dist/reviewer.d.ts.map +1 -0
  711. package/dist/reviewer.test.d.ts +2 -0
  712. package/dist/reviewer.test.d.ts.map +1 -0
  713. package/dist/reward-model-export.d.ts +60 -0
  714. package/dist/reward-model-export.d.ts.map +1 -0
  715. package/dist/rl/active-curriculum.d.ts +110 -0
  716. package/dist/rl/active-curriculum.d.ts.map +1 -0
  717. package/dist/rl/adaptation-eval.d.ts +109 -0
  718. package/dist/rl/adaptation-eval.d.ts.map +1 -0
  719. package/dist/{adversarial-DIVcDoI_.d.ts → rl/adversarial.d.ts} +6 -7
  720. package/dist/rl/adversarial.d.ts.map +1 -0
  721. package/dist/rl/compute-curves.d.ts +127 -0
  722. package/dist/rl/compute-curves.d.ts.map +1 -0
  723. package/dist/rl/contamination.d.ts +117 -0
  724. package/dist/rl/contamination.d.ts.map +1 -0
  725. package/dist/rl/corpus.d.ts +55 -0
  726. package/dist/rl/corpus.d.ts.map +1 -0
  727. package/dist/rl/corpus.test.d.ts +2 -0
  728. package/dist/rl/corpus.test.d.ts.map +1 -0
  729. package/dist/rl/dataset.d.ts +102 -0
  730. package/dist/rl/dataset.d.ts.map +1 -0
  731. package/dist/rl/dataset.test.d.ts +2 -0
  732. package/dist/rl/dataset.test.d.ts.map +1 -0
  733. package/dist/rl/exporters.d.ts +141 -0
  734. package/dist/rl/exporters.d.ts.map +1 -0
  735. package/dist/rl/index.d.ts +49 -0
  736. package/dist/rl/index.d.ts.map +1 -0
  737. package/dist/{off-policy-DiwuKKg7.d.ts → rl/off-policy.d.ts} +8 -9
  738. package/dist/rl/off-policy.d.ts.map +1 -0
  739. package/dist/rl/predictive-validity-researcher.d.ts +69 -0
  740. package/dist/rl/predictive-validity-researcher.d.ts.map +1 -0
  741. package/dist/rl/preferences.d.ts +141 -0
  742. package/dist/rl/preferences.d.ts.map +1 -0
  743. package/dist/rl/process-reward.d.ts +122 -0
  744. package/dist/rl/process-reward.d.ts.map +1 -0
  745. package/dist/rl/reward-hacking.d.ts +104 -0
  746. package/dist/rl/reward-hacking.d.ts.map +1 -0
  747. package/dist/rl/rl-campaign.d.ts +85 -0
  748. package/dist/rl/rl-campaign.d.ts.map +1 -0
  749. package/dist/rl/run-record-adapters.d.ts +56 -0
  750. package/dist/rl/run-record-adapters.d.ts.map +1 -0
  751. package/dist/rl/sim-fidelity.d.ts +166 -0
  752. package/dist/rl/sim-fidelity.d.ts.map +1 -0
  753. package/dist/rl/sim-fidelity.test.d.ts +2 -0
  754. package/dist/rl/sim-fidelity.test.d.ts.map +1 -0
  755. package/dist/rl/tournament.d.ts +115 -0
  756. package/dist/rl/tournament.d.ts.map +1 -0
  757. package/dist/rl/verifiable-reward.d.ts +124 -0
  758. package/dist/rl/verifiable-reward.d.ts.map +1 -0
  759. package/dist/rl.d.ts +1 -1192
  760. package/dist/rl.js +612 -612
  761. package/dist/rl.js.map +1 -1
  762. package/dist/{run-campaign-7WNXMDSN.js → run-campaign-WXY7KI67.js} +2 -2
  763. package/dist/run-critic.d.ts +23 -0
  764. package/dist/run-critic.d.ts.map +1 -0
  765. package/dist/run-evidence.d.ts +32 -0
  766. package/dist/run-evidence.d.ts.map +1 -0
  767. package/dist/{run-record-e7vj1uZQ.d.ts → run-record.d.ts} +16 -122
  768. package/dist/run-record.d.ts.map +1 -0
  769. package/dist/run-record.test.d.ts +2 -0
  770. package/dist/run-record.test.d.ts.map +1 -0
  771. package/dist/run-score.d.ts +31 -0
  772. package/dist/run-score.d.ts.map +1 -0
  773. package/dist/runtime-trajectory.d.ts +47 -0
  774. package/dist/runtime-trajectory.d.ts.map +1 -0
  775. package/dist/{test-graded-scenario-DeODGLra.d.ts → sandbox-harness.d.ts} +15 -60
  776. package/dist/sandbox-harness.d.ts.map +1 -0
  777. package/dist/sandbox-harness.test.d.ts +2 -0
  778. package/dist/sandbox-harness.test.d.ts.map +1 -0
  779. package/dist/sandbox-pool.d.ts +74 -0
  780. package/dist/sandbox-pool.d.ts.map +1 -0
  781. package/dist/sandbox-pool.test.d.ts +2 -0
  782. package/dist/sandbox-pool.test.d.ts.map +1 -0
  783. package/dist/scorecard.d.ts +133 -0
  784. package/dist/scorecard.d.ts.map +1 -0
  785. package/dist/scorecard.test.d.ts +2 -0
  786. package/dist/scorecard.test.d.ts.map +1 -0
  787. package/dist/self-play.d.ts +69 -0
  788. package/dist/self-play.d.ts.map +1 -0
  789. package/dist/semantic-concept-judge.d.ts +135 -0
  790. package/dist/semantic-concept-judge.d.ts.map +1 -0
  791. package/dist/semantic-concept-judge.test.d.ts +2 -0
  792. package/dist/semantic-concept-judge.test.d.ts.map +1 -0
  793. package/dist/{sequential-5iSVfzl2.d.ts → sequential.d.ts} +9 -10
  794. package/dist/sequential.d.ts.map +1 -0
  795. package/dist/{series-convergence-D5OWMBg6.d.ts → series-convergence.d.ts} +4 -5
  796. package/dist/series-convergence.d.ts.map +1 -0
  797. package/dist/slo.d.ts +48 -0
  798. package/dist/slo.d.ts.map +1 -0
  799. package/dist/state-continuity.d.ts +47 -0
  800. package/dist/state-continuity.d.ts.map +1 -0
  801. package/dist/{statistics-CCJpTGOS.d.ts → statistics.d.ts} +46 -48
  802. package/dist/statistics.d.ts.map +1 -0
  803. package/dist/statistics.test.d.ts +2 -0
  804. package/dist/statistics.test.d.ts.map +1 -0
  805. package/dist/steering-optimizer.d.ts +58 -0
  806. package/dist/steering-optimizer.d.ts.map +1 -0
  807. package/dist/steering.d.ts +24 -0
  808. package/dist/steering.d.ts.map +1 -0
  809. package/dist/storyboard/code-edit.d.ts +64 -0
  810. package/dist/storyboard/code-edit.d.ts.map +1 -0
  811. package/dist/storyboard/code-edit.test.d.ts +2 -0
  812. package/dist/storyboard/code-edit.test.d.ts.map +1 -0
  813. package/dist/storyboard/index.d.ts +16 -81
  814. package/dist/storyboard/index.d.ts.map +1 -0
  815. package/dist/storyboard/index.test.d.ts +2 -0
  816. package/dist/storyboard/index.test.d.ts.map +1 -0
  817. package/dist/{summary-report-BDOFevaT.d.ts → summary-report.d.ts} +23 -160
  818. package/dist/summary-report.d.ts.map +1 -0
  819. package/dist/telemetry/client.d.ts +35 -0
  820. package/dist/telemetry/client.d.ts.map +1 -0
  821. package/dist/telemetry/index.d.ts +17 -35
  822. package/dist/telemetry/index.d.ts.map +1 -0
  823. package/dist/telemetry/schema.d.ts +61 -0
  824. package/dist/telemetry/schema.d.ts.map +1 -0
  825. package/dist/telemetry/sink-fetch.d.ts +39 -0
  826. package/dist/telemetry/sink-fetch.d.ts.map +1 -0
  827. package/dist/telemetry/{file.d.ts → sink-file.d.ts} +5 -7
  828. package/dist/telemetry/sink-file.d.ts.map +1 -0
  829. package/dist/test-graded-scenario.d.ts +42 -0
  830. package/dist/test-graded-scenario.d.ts.map +1 -0
  831. package/dist/testing.d.ts +5 -0
  832. package/dist/testing.d.ts.map +1 -0
  833. package/dist/testing.js +8 -0
  834. package/dist/testing.js.map +1 -0
  835. package/dist/tool-use-metrics.d.ts +35 -0
  836. package/dist/tool-use-metrics.d.ts.map +1 -0
  837. package/dist/trace/capture-fetch.d.ts +48 -0
  838. package/dist/trace/capture-fetch.d.ts.map +1 -0
  839. package/dist/trace/capture-fetch.test.d.ts +2 -0
  840. package/dist/trace/capture-fetch.test.d.ts.map +1 -0
  841. package/dist/{emitter-C2rqGH_l.d.ts → trace/emitter.d.ts} +9 -12
  842. package/dist/trace/emitter.d.ts.map +1 -0
  843. package/dist/trace/extract-usage.d.ts +46 -0
  844. package/dist/trace/extract-usage.d.ts.map +1 -0
  845. package/dist/trace/extract-usage.test.d.ts +2 -0
  846. package/dist/trace/extract-usage.test.d.ts.map +1 -0
  847. package/dist/trace/index.d.ts +15 -0
  848. package/dist/trace/index.d.ts.map +1 -0
  849. package/dist/{integrity-D2t12mMw.d.ts → trace/integrity.d.ts} +11 -14
  850. package/dist/trace/integrity.d.ts.map +1 -0
  851. package/dist/trace/otel-bridge.d.ts +29 -0
  852. package/dist/trace/otel-bridge.d.ts.map +1 -0
  853. package/dist/trace/otel-export.d.ts +52 -0
  854. package/dist/trace/otel-export.d.ts.map +1 -0
  855. package/dist/trace/otel.d.ts +57 -0
  856. package/dist/trace/otel.d.ts.map +1 -0
  857. package/dist/trace/otlp-attributes.d.ts +17 -0
  858. package/dist/trace/otlp-attributes.d.ts.map +1 -0
  859. package/dist/trace/query.d.ts +29 -0
  860. package/dist/trace/query.d.ts.map +1 -0
  861. package/dist/trace/query.test.d.ts +2 -0
  862. package/dist/trace/query.test.d.ts.map +1 -0
  863. package/dist/{raw-provider-sink-C46HDghv.d.ts → trace/raw-provider-sink.d.ts} +13 -14
  864. package/dist/trace/raw-provider-sink.d.ts.map +1 -0
  865. package/dist/{redact-B40YG2M_.d.ts → trace/redact.d.ts} +7 -8
  866. package/dist/trace/redact.d.ts.map +1 -0
  867. package/dist/{schema-m0gsnbt3.d.ts → trace/schema.d.ts} +29 -30
  868. package/dist/trace/schema.d.ts.map +1 -0
  869. package/dist/trace/store-to-otlp.d.ts +72 -0
  870. package/dist/trace/store-to-otlp.d.ts.map +1 -0
  871. package/dist/trace/store-to-otlp.test.d.ts +2 -0
  872. package/dist/trace/store-to-otlp.test.d.ts.map +1 -0
  873. package/dist/{store-BcFXE6LG.d.ts → trace/store.d.ts} +21 -12
  874. package/dist/trace/store.d.ts.map +1 -0
  875. package/dist/trace/store.test.d.ts +2 -0
  876. package/dist/trace/store.test.d.ts.map +1 -0
  877. package/dist/{analyst-C8HHvfJp.d.ts → trace-analyst/analyst.d.ts} +12 -14
  878. package/dist/trace-analyst/analyst.d.ts.map +1 -0
  879. package/dist/trace-analyst/analyst.test.d.ts +2 -0
  880. package/dist/trace-analyst/analyst.test.d.ts.map +1 -0
  881. package/dist/trace-analyst/behavioral-metrics.d.ts +40 -0
  882. package/dist/trace-analyst/behavioral-metrics.d.ts.map +1 -0
  883. package/dist/trace-analyst/behavioral-metrics.test.d.ts +2 -0
  884. package/dist/trace-analyst/behavioral-metrics.test.d.ts.map +1 -0
  885. package/dist/trace-analyst/hook.d.ts +55 -0
  886. package/dist/trace-analyst/hook.d.ts.map +1 -0
  887. package/dist/trace-analyst/index.d.ts +18 -0
  888. package/dist/trace-analyst/index.d.ts.map +1 -0
  889. package/dist/trace-analyst/insights.d.ts +71 -0
  890. package/dist/trace-analyst/insights.d.ts.map +1 -0
  891. package/dist/trace-analyst/insights.test.d.ts +2 -0
  892. package/dist/trace-analyst/insights.test.d.ts.map +1 -0
  893. package/dist/trace-analyst/otlp-flatten.d.ts +42 -0
  894. package/dist/trace-analyst/otlp-flatten.d.ts.map +1 -0
  895. package/dist/trace-analyst/otlp-span.d.ts +85 -0
  896. package/dist/trace-analyst/otlp-span.d.ts.map +1 -0
  897. package/dist/trace-analyst/otlp-span.test.d.ts +2 -0
  898. package/dist/trace-analyst/otlp-span.test.d.ts.map +1 -0
  899. package/dist/trace-analyst/otlp-to-run-records.d.ts +115 -0
  900. package/dist/trace-analyst/otlp-to-run-records.d.ts.map +1 -0
  901. package/dist/trace-analyst/otlp-to-run-records.test.d.ts +2 -0
  902. package/dist/trace-analyst/otlp-to-run-records.test.d.ts.map +1 -0
  903. package/dist/trace-analyst/otlp-to-run-records.timestamps.test.d.ts +2 -0
  904. package/dist/trace-analyst/otlp-to-run-records.timestamps.test.d.ts.map +1 -0
  905. package/dist/trace-analyst/prompts.d.ts +6 -0
  906. package/dist/trace-analyst/prompts.d.ts.map +1 -0
  907. package/dist/trace-analyst/store-otlp.d.ts +126 -0
  908. package/dist/trace-analyst/store-otlp.d.ts.map +1 -0
  909. package/dist/trace-analyst/store-otlp.test.d.ts +8 -0
  910. package/dist/trace-analyst/store-otlp.test.d.ts.map +1 -0
  911. package/dist/trace-analyst/store-otlp.timestamps.test.d.ts +2 -0
  912. package/dist/trace-analyst/store-otlp.timestamps.test.d.ts.map +1 -0
  913. package/dist/trace-analyst/store.d.ts +63 -0
  914. package/dist/trace-analyst/store.d.ts.map +1 -0
  915. package/dist/trace-analyst/tools.d.ts +44 -0
  916. package/dist/trace-analyst/tools.d.ts.map +1 -0
  917. package/dist/trace-analyst/tools.test.d.ts +10 -0
  918. package/dist/trace-analyst/tools.test.d.ts.map +1 -0
  919. package/dist/{store-C1YxJDEK.d.ts → trace-analyst/types.d.ts} +18 -74
  920. package/dist/trace-analyst/types.d.ts.map +1 -0
  921. package/dist/trace-contracts.d.ts +180 -0
  922. package/dist/trace-contracts.d.ts.map +1 -0
  923. package/dist/traced-analyst.d.ts +26 -0
  924. package/dist/traced-analyst.d.ts.map +1 -0
  925. package/dist/traced-judges.d.ts +27 -0
  926. package/dist/traced-judges.d.ts.map +1 -0
  927. package/dist/traces.d.ts +4 -960
  928. package/dist/traces.d.ts.map +1 -0
  929. package/dist/traces.js +41 -11
  930. package/dist/{trajectory-2TkpSEVh.d.ts → trajectory.d.ts} +8 -9
  931. package/dist/trajectory.d.ts.map +1 -0
  932. package/dist/{types-C7DGg5ex.d.ts → types.d.ts} +31 -33
  933. package/dist/types.d.ts.map +1 -0
  934. package/dist/ui-finding.d.ts +104 -0
  935. package/dist/ui-finding.d.ts.map +1 -0
  936. package/dist/verdict-cache.d.ts +78 -0
  937. package/dist/verdict-cache.d.ts.map +1 -0
  938. package/dist/verdict-cache.test.d.ts +2 -0
  939. package/dist/verdict-cache.test.d.ts.map +1 -0
  940. package/dist/{verdict-C9MlYujm.d.ts → verdict.d.ts} +2 -3
  941. package/dist/verdict.d.ts.map +1 -0
  942. package/dist/visual-diff.d.ts +32 -0
  943. package/dist/visual-diff.d.ts.map +1 -0
  944. package/dist/wire/handlers.d.ts +54 -0
  945. package/dist/wire/handlers.d.ts.map +1 -0
  946. package/dist/wire/index.d.ts +13 -570
  947. package/dist/wire/index.d.ts.map +1 -0
  948. package/dist/wire/openapi.d.ts +3 -0
  949. package/dist/wire/openapi.d.ts.map +1 -0
  950. package/dist/wire/rpc.d.ts +21 -0
  951. package/dist/wire/rpc.d.ts.map +1 -0
  952. package/dist/wire/rubrics.d.ts +34 -0
  953. package/dist/wire/rubrics.d.ts.map +1 -0
  954. package/dist/wire/schemas.d.ts +410 -0
  955. package/dist/wire/schemas.d.ts.map +1 -0
  956. package/dist/wire/server.d.ts +60 -0
  957. package/dist/wire/server.d.ts.map +1 -0
  958. package/dist/workflow/event-schema.d.ts +5 -0
  959. package/dist/workflow/event-schema.d.ts.map +1 -0
  960. package/dist/workflow/feedback-pack.d.ts +99 -0
  961. package/dist/workflow/feedback-pack.d.ts.map +1 -0
  962. package/dist/workflow/index.d.ts +22 -495
  963. package/dist/workflow/index.d.ts.map +1 -0
  964. package/dist/workflow/index.js +1 -1
  965. package/dist/workflow/intelligence-export.d.ts +62 -0
  966. package/dist/workflow/intelligence-export.d.ts.map +1 -0
  967. package/dist/workflow/partner-report.d.ts +49 -0
  968. package/dist/workflow/partner-report.d.ts.map +1 -0
  969. package/dist/workflow/phase-graph.d.ts +43 -0
  970. package/dist/workflow/phase-graph.d.ts.map +1 -0
  971. package/dist/workflow/promotion-gate.d.ts +61 -0
  972. package/dist/workflow/promotion-gate.d.ts.map +1 -0
  973. package/dist/workflow/run-record.d.ts +12 -0
  974. package/dist/workflow/run-record.d.ts.map +1 -0
  975. package/dist/workflow/runtime-adapter.d.ts +20 -0
  976. package/dist/workflow/runtime-adapter.d.ts.map +1 -0
  977. package/dist/workflow/sanitize.d.ts +21 -0
  978. package/dist/workflow/sanitize.d.ts.map +1 -0
  979. package/dist/workflow/schema.d.ts +5 -0
  980. package/dist/workflow/schema.d.ts.map +1 -0
  981. package/dist/workflow/summary.d.ts +43 -0
  982. package/dist/workflow/summary.d.ts.map +1 -0
  983. package/dist/workflow/trace-event-fields.d.ts +6 -0
  984. package/dist/workflow/trace-event-fields.d.ts.map +1 -0
  985. package/dist/workflow/trajectory.d.ts +15 -0
  986. package/dist/workflow/trajectory.d.ts.map +1 -0
  987. package/dist/workflow/types.d.ts +68 -0
  988. package/dist/workflow/types.d.ts.map +1 -0
  989. package/dist/workspace-inspector.d.ts +67 -0
  990. package/dist/workspace-inspector.d.ts.map +1 -0
  991. package/dist/wrangler-deploy-runner.test.d.ts +2 -0
  992. package/dist/wrangler-deploy-runner.test.d.ts.map +1 -0
  993. package/docs/campaign-proposers.md +170 -0
  994. package/docs/concepts.md +8 -4
  995. package/docs/customer-journeys.md +15 -13
  996. package/docs/design/loop-taxonomy.md +34 -66
  997. package/docs/distributed-driver.md +14 -14
  998. package/docs/feature-guide.md +1 -1
  999. package/docs/hosted-ingest-spec.md +2 -3
  1000. package/docs/multi-shot-optimization.md +8 -8
  1001. package/docs/product-eval-adoption.md +1 -1
  1002. package/docs/self-improvement-map.md +33 -29
  1003. package/package.json +9 -15
  1004. package/dist/calibration-BPmzuVPk.d.ts +0 -101
  1005. package/dist/chunk-2K6UUZ7P.js.map +0 -1
  1006. package/dist/chunk-CTBHKLEU.js.map +0 -1
  1007. package/dist/chunk-E4GH6USR.js.map +0 -1
  1008. package/dist/chunk-EGPMSBEZ.js.map +0 -1
  1009. package/dist/chunk-KWRRMR3J.js.map +0 -1
  1010. package/dist/chunk-MIFZUPEK.js.map +0 -1
  1011. package/dist/chunk-MPQWFX6Y.js.map +0 -1
  1012. package/dist/chunk-Q5LIB7BC.js.map +0 -1
  1013. package/dist/chunk-QMUEXQJS.js.map +0 -1
  1014. package/dist/chunk-SD2YFWQQ.js.map +0 -1
  1015. package/dist/control-D6qwHXIR.d.ts +0 -259
  1016. package/dist/corpus-B8A4BDR3.d.ts +0 -560
  1017. package/dist/failure-cluster-DH9Flgcf.d.ts +0 -76
  1018. package/dist/harness-optimizer-mOl9XX_O.d.ts +0 -106
  1019. package/dist/index-Bx3gZ8xl.d.ts +0 -159
  1020. package/dist/pre-registration-mAnCugl9.d.ts +0 -523
  1021. package/dist/provenance-P-bCL2Fo.d.ts +0 -441
  1022. package/dist/query-B7GGjRox.d.ts +0 -32
  1023. package/dist/release-report-BEbWmVYj.d.ts +0 -233
  1024. package/dist/run-critic-CmMf05uV.d.ts +0 -56
  1025. package/dist/run-improvement-loop-DBahB8Ax.d.ts +0 -427
  1026. package/dist/runtime-trajectory-BDgfGZSr.d.ts +0 -49
  1027. package/dist/semantic-concept-judge-B9MgmBnM.d.ts +0 -624
  1028. package/dist/sink-fetch-B1Yg4Til.d.ts +0 -101
  1029. package/docs/design/external-agent-wedge.md +0 -89
  1030. package/docs/design/phase-d-rfc.md +0 -125
  1031. package/docs/design/phase4-consumer-migration.md +0 -70
  1032. package/docs/design/primitives-integration-spec.md +0 -393
  1033. package/docs/design/product-self-improvement-loop.md +0 -146
  1034. package/docs/design/self-improvement-engine.md +0 -140
  1035. package/docs/design/self-improvement-protocol.md +0 -223
  1036. package/docs/design/self-improvement-roadmap.md +0 -106
  1037. package/docs/design/substrate-gaps.md +0 -118
  1038. package/docs/phase-b-pairing-kit.md +0 -188
  1039. package/docs/phase-b-runbook.md +0 -176
  1040. package/docs/pilot/README.md +0 -62
  1041. package/docs/pilot/customer-checklist.md +0 -90
  1042. package/docs/pilot/integration-foreign-stack.md +0 -296
  1043. package/docs/pilot/integration-tangle-stack.md +0 -248
  1044. package/docs/pilot/one-pager.md +0 -161
  1045. package/docs/pilot/sample-insight-report.json +0 -172
  1046. package/docs/quickstart-external.md +0 -229
  1047. package/docs/research/belief-state-agent-eval-roadmap.md +0 -593
  1048. package/docs/research/research-roadmap.md +0 -205
  1049. package/docs/specs/driver-honest-spec.md +0 -251
  1050. package/docs/specs/hermes-self-improvement-audit.md +0 -93
  1051. package/docs/specs/profile-versioning.md +0 -291
  1052. package/docs/three-package-architecture.md +0 -168
  1053. /package/dist/{chunk-TBDR6PAI.js.map → chunk-IZCEK2HR.js.map} +0 -0
  1054. /package/dist/{chunk-KW53MSA5.js.map → chunk-X74V6ESX.js.map} +0 -0
  1055. /package/dist/{chunk-2KNZHH3P.js.map → chunk-Z6L6YSU6.js.map} +0 -0
  1056. /package/dist/{run-campaign-7WNXMDSN.js.map → run-campaign-WXY7KI67.js.map} +0 -0
@@ -1,248 +0,0 @@
1
- # Integration — Tangle Intelligence on the Tangle stack (sandbox + tcloud)
2
-
3
- Step-by-step. This is what we run with you on the onboarding call.
4
-
5
- ## Zero-setup demo first (30 seconds, no install)
6
-
7
- ```sh
8
- npx @tangle-network/intelligence demo
9
- ```
10
-
11
- End-to-end loop against synthetic data — agent + judge + scenarios + selfImprove. Prints the `InsightReport` shape you'll get on your real data. Useful to confirm the output is what you want before any integration. Hosted equivalent: open **[staging-intelligence.tangle.tools](https://staging-intelligence.tangle.tools)**.
12
-
13
- ## Prerequisites you already have
14
-
15
- - `@tangle-network/sandbox` running your agent in a session
16
- - `@tangle-network/tcloud` for LLM routing (or any OpenAI-compat router)
17
- - Your scenarios (the inputs your agent handles) listed somewhere — even as YAML or a TS array
18
- - A judge function for scoring outputs — LLM-as-judge is fine for v1
19
-
20
- ## Install
21
-
22
- The CLI scaffolds and runs everything; you only add the substrate package if your code calls primitives directly:
23
-
24
- ```sh
25
- # CLI (zero-install via npx, or add to your repo as a dev-dep)
26
- npx @tangle-network/intelligence init
27
-
28
- # Optional — only if your code imports analyzeRuns / selfImprove directly
29
- pnpm add @tangle-network/agent-eval
30
- # or for Python customers:
31
- pip install agent-eval-rpc
32
- ```
33
-
34
- `@tangle-network/intelligence` is the customer-facing CLI + hosted product (binary `tangle-intel`). `@tangle-network/agent-eval` is the substrate it wraps — install only if you want to script directly against the primitives.
35
-
36
- ## Step 1 — Ingest your trace stream
37
-
38
- You already emit traces via sandbox sessions. Pull them into canonical `RunRecord[]`:
39
-
40
- ```ts
41
- import { fromTangleSandbox } from '@tangle-network/agent-eval/adapters/sandbox'
42
-
43
- const runs = await fromTangleSandbox({
44
- sessionIds: ['session_abc', 'session_def'], // your current week
45
- fromMs: lastReportTime,
46
- toMs: Date.now(),
47
- })
48
- // runs is RunRecord[] — canonical wire shape, ready for any downstream substrate primitive
49
- ```
50
-
51
- If your agent emits OTel directly instead of going through `@tangle-network/sandbox`:
52
-
53
- ```ts
54
- import { fromOtelSpans } from '@tangle-network/agent-eval'
55
-
56
- const runs = fromOtelSpans({ spans: yourOtelSpans })
57
- ```
58
-
59
- ## Step 2 — Get the decision packet (no LLM cost)
60
-
61
- ```ts
62
- import { analyzeRuns } from '@tangle-network/agent-eval/contract'
63
-
64
- const report = await analyzeRuns({
65
- runs: thisWeek,
66
- baselineRuns: lastWeek, // optional — gives you the "did my change help?" answer
67
- baselineLabel: 'vs prior 7 days',
68
- })
69
-
70
- console.log(report.composite.mean) // overall score
71
- console.log(report.composite.tailRuns) // worst 5 runs by name
72
- console.log(report.priorPeriodComparison?.improvedMetrics) // ['composite'] if significantly better
73
- console.log(report.priorPeriodComparison?.regressedMetrics) // ['cost'] if cost went up significantly
74
- console.log(report.recommendations) // priority-ranked actions
75
- ```
76
-
77
- That's the **full deterministic flow** — no LLM, $0 cost, runs in ms.
78
-
79
- Render in your dashboard or pipe to Slack:
80
-
81
- ```ts
82
- for (const rec of report.recommendations) {
83
- if (rec.priority === 'critical') {
84
- await slack.post(`🔴 ${rec.title}\n${rec.detail}`)
85
- }
86
- }
87
- ```
88
-
89
- ## Step 3 — Wire the closed loop (real LLM cost — opt-in)
90
-
91
- Pick the surface you want to optimize. For most customers this is the agent's system-prompt addendum:
92
-
93
- ```ts
94
- import { selfImprove, gepaDriver } from '@tangle-network/agent-eval/contract'
95
-
96
- const result = await selfImprove({
97
- scenarios: yourScenarios, // 20-50 representative inputs
98
- agent: async (surface, scenario) => {
99
- // Your existing agent invocation, with the substrate-proposed surface
100
- // injected as the system-prompt addendum.
101
- return await runYourAgent({
102
- ...scenario,
103
- systemPromptAddendum: surface as string,
104
- })
105
- },
106
- judge: yourJudge, // function (artifact) → { composite, dimensions }
107
- baselineSurface: currentAddendum, // the production string today
108
- driver: gepaDriver({
109
- llm: { apiKey: tcloudKey, baseUrl: 'https://router.tangle.tools/v1' },
110
- model: 'anthropic/claude-sonnet-4.6',
111
- target: 'agent system-prompt addendum',
112
- }),
113
- budget: {
114
- generations: 3,
115
- populationSize: 4,
116
- holdoutFraction: 0.3,
117
- maxUsd: 25, // hard ceiling — refuses to overspend
118
- },
119
- })
120
-
121
- console.log(`gate: ${result.gateDecision.kind}`)
122
- console.log(`lift: ${result.lift.delta.toFixed(3)} CI=[${result.lift.ci95.join(', ')}]`)
123
- console.log(`cost spent: $${result.totalCostUsd.toFixed(2)}`)
124
- ```
125
-
126
- `result.gateDecision` is one of:
127
- - `ship-substrate` — winner statistically beats baseline; safe to deploy
128
- - `inconclusive` — CI straddles zero; either run more rollouts or expand corpus
129
- - `ship-harness` / `merge` — only when `driftPolicy: 'benchmark-branches'` is on (advanced)
130
-
131
- ## Step 4 — Auto-PR the winner
132
-
133
- ```ts
134
- if (result.gateDecision.kind === 'ship-substrate') {
135
- await openAutoPr({
136
- title: `eval: auto-improve ${target} (composite +${result.lift.delta.toFixed(3)})`,
137
- body: `${result.gateDecision.reason}\n\n${formatInsight(result.insight)}`,
138
- filePath: 'src/lib/.server/production-loop/prompt-addendum.ts',
139
- newContent: result.diff.kind === 'replace' ? result.diff.content : applyDiff(currentAddendum, result.diff),
140
- })
141
- }
142
- ```
143
-
144
- We ship `openAutoPr` from `@tangle-network/agent-eval/contract`. It wraps the GitHub PR flow with your existing token.
145
-
146
- ## The full canonical flow (script you copy and run)
147
-
148
- ```ts
149
- // scripts/weekly-improvement.ts — run from a cron / GitHub Action
150
-
151
- import { fromTangleSandbox } from '@tangle-network/agent-eval/adapters/sandbox'
152
- import {
153
- analyzeRuns,
154
- gepaDriver,
155
- openAutoPr,
156
- selfImprove,
157
- } from '@tangle-network/agent-eval/contract'
158
- import { scenarios } from './eval/scenarios'
159
- import { judge } from './eval/judges'
160
- import { runYourAgent } from './src/agent'
161
- import { PRODUCTION_ADDENDUM } from './src/lib/.server/production-loop/prompt-addendum'
162
-
163
- const lastWeek = Date.now() - 7 * 24 * 60 * 60 * 1000
164
- const twoWeeksAgo = lastWeek - 7 * 24 * 60 * 60 * 1000
165
-
166
- const thisWeekRuns = await fromTangleSandbox({ fromMs: lastWeek, toMs: Date.now() })
167
- const lastWeekRuns = await fromTangleSandbox({ fromMs: twoWeeksAgo, toMs: lastWeek })
168
-
169
- // 1. Deterministic packet — always
170
- const report = await analyzeRuns({
171
- runs: thisWeekRuns,
172
- baselineRuns: lastWeekRuns,
173
- baselineLabel: 'vs prior 7 days',
174
- })
175
-
176
- // 2. Closed loop — only if composite regressed OR we haven't tried in a while
177
- const shouldRun =
178
- report.priorPeriodComparison?.regressedMetrics.includes('composite') ||
179
- daysSinceLastImprovement() > 7
180
-
181
- if (!shouldRun) {
182
- console.log('No regression + recent run; skipping.')
183
- process.exit(0)
184
- }
185
-
186
- const result = await selfImprove({
187
- scenarios,
188
- agent: (surface, scenario) =>
189
- runYourAgent({ ...scenario, systemPromptAddendum: surface as string }),
190
- judge,
191
- baselineSurface: PRODUCTION_ADDENDUM,
192
- driver: gepaDriver({
193
- llm: { apiKey: process.env.TANGLE_KEY!, baseUrl: 'https://router.tangle.tools/v1' },
194
- model: 'anthropic/claude-sonnet-4.6',
195
- target: 'production agent system-prompt addendum',
196
- }),
197
- budget: { generations: 3, populationSize: 4, holdoutFraction: 0.3, maxUsd: 50 },
198
- })
199
-
200
- if (result.gateDecision.kind === 'ship-substrate') {
201
- await openAutoPr({
202
- title: `eval: auto-improve addendum (composite +${result.lift.delta.toFixed(3)})`,
203
- body: renderInsightAsPrBody(result.insight),
204
- filePath: 'src/lib/.server/production-loop/prompt-addendum.ts',
205
- newContent: result.diff.kind === 'replace' ? result.diff.content : '...',
206
- })
207
- }
208
- ```
209
-
210
- ## What we'll do together on the onboarding call
211
-
212
- 1. **Map your existing setup** — where do your traces emit? which sandbox sessions? which scenarios exist already?
213
- 2. **Stub the judge** — even a single dimension is enough to start
214
- 3. **Run a deterministic `analyzeRuns()` against your live data** — first decision packet rendered live
215
- 4. **Wire one selfImprove cycle** — small budget, single generation, see the loop fire
216
- 5. **Schedule the cron + auto-PR target** — the loop runs autonomously thereafter
217
-
218
- Time budget: ~90 minutes. By the end you have a working pilot.
219
-
220
- ## What our hosted tier adds on top
221
-
222
- - Decision packet rendered weekly in the Intelligence dashboard — no code changes needed
223
- - Slack / email digest on `regressedMetrics`
224
- - Pareto chart, judge calibration, failure-cluster drilldown in the UI
225
- - Multi-week trend lines
226
- - Stripe-billed usage tracking
227
-
228
- If you want self-hosted only, every primitive above works locally. The hosted tier is a convenience.
229
-
230
- ## FAQ
231
-
232
- **Q: What's the smallest scenario corpus that gives useful results?**
233
- A: ~15 scenarios for the deterministic packet (you get distributional stats + recommendations). For `selfImprove`'s held-out gate you want ≥20 since `holdoutFraction: 0.3` reserves 6 for the gate. Below that, the gate often returns `inconclusive`.
234
-
235
- **Q: What if my judge isn't reliable yet?**
236
- A: That's normal. Use multi-rater intake (`fromFeedbackTable`) to get inter-rater agreement (κ) first, then iterate on the judge until raters agree. Substrate has an `interRater` block in InsightReport showing exactly which scenarios raters disagree on.
237
-
238
- **Q: What if a `selfImprove` campaign returns `inconclusive`?**
239
- A: It refused to claim improvement because the CI straddles zero. Either expand the corpus, raise `holdoutFraction`, or run more generations. Better than shipping noise.
240
-
241
- **Q: Can I use a non-tcloud LLM provider?**
242
- A: Yes — `gepaDriver` accepts any `LlmClientOptions` (any OpenAI-compatible endpoint). We default to tcloud because we already have your auth.
243
-
244
- **Q: How do I see what changed when the gate ships?**
245
- A: `result.diff` is a structured patch. We also ship `diffRuns()` separately if you want to compare two campaign outputs.
246
-
247
- **Q: What if my agent self-modifies (Hermes / Claude Code skills)?**
248
- A: This is the offline/online drift case. We have the architecture spec ready (`docs/specs/profile-versioning.md`) but the implementation is gated on a forcing-function experiment. For v0.5x pilots we assume the substrate is the only writer to your agent's optimizable surface.
@@ -1,161 +0,0 @@
1
- # Statistical self-improvement for your agent — one-pager
2
-
3
- **For:** teams running an agent on the Tangle stack (sandbox + tcloud), OR any agent emitting OTel traces, OR LangChain / LlamaIndex / Anthropic SDK / OpenAI Assistants / OpenRouter / custom — we meet you where you are.
4
- **The pitch:** every week, get a statistically-rigorous answer to *"did my last change help?"* + a closed loop that proposes the next improvement + a held-out gate that refuses to ship regressions.
5
-
6
- ## What you get
7
-
8
- | Deliverable | Cadence | LLM cost |
9
- |---|---|---|
10
- | **Decision packet** — composite distribution, per-dimension judges, cost-quality Pareto, failure clusters, named worst-N runs, ranked recommendations | Whenever you want it. Hosted runs on a 15-min schedule by default. | $0 (deterministic) |
11
- | **Prior-period comparison** — Welch CI on composite / cost / duration / per-dimension deltas vs your prior week, with regressed + improved metrics named | Same cadence | $0 |
12
- | **Closed-loop improvement** — `selfImprove()` proposes prompt edits, runs scenarios, gates on paired-bootstrap CI, auto-PRs the winner | On-demand, opt-in | Real $; you set a `maxUsd` ceiling |
13
-
14
- Every claim is falsifiable: `n=`, `CI95=[a, b]`, `p=`, `Cohen's d=`. No vibes, no "score went up." Where the data doesn't support a section, the report says so explicitly instead of inventing signal.
15
-
16
- ## Why this is different
17
-
18
- | | LangSmith / Braintrust / Phoenix | Hermes / Claude Code skills | **Tangle** |
19
- |---|---|---|---|
20
- | Trace ingest | proprietary | own runtime | universal (sandbox + tcloud + OTel + any custom) |
21
- | Decision packet | scorecards (no CI) | none | **paired-bootstrap CI on every claim** |
22
- | Closed loop | none | heuristic, no gate | **statistically-gated; refuses regressions** |
23
- | Prior-period delta | none | none | **Welch CI on every metric** |
24
- | Sample-size guidance | none | none | **MDE-aware** |
25
- | Auto-PR promotion | none | none | **opt-in, on green gate only** |
26
-
27
- ## Integration paths — pick your stack
28
-
29
- | Your stack | Intake adapter | LLM provider for closed loop |
30
- |---|---|---|
31
- | **Tangle (sandbox + tcloud)** | `fromTangleSandbox` | tcloud (already wired) |
32
- | Any OTel exporter (Datadog APM, Honeycomb, NewRelic, OpenInference) | `fromOtelSpans` | any OpenAI-compat |
33
- | LangChain (LangSmith) | LangSmith → OTel export → `fromOtelSpans` today; `fromLangChain` queued 0.55.0 | OpenAI, Anthropic, OpenRouter, tcloud |
34
- | LlamaIndex | `OpenInferenceCallbackHandler` → OTel → ingest | any OpenAI-compat |
35
- | Anthropic SDK direct | OTel wrapping (~20 LOC) → `fromOtelSpans`; `fromAnthropicSDK` queued | Anthropic, OpenRouter |
36
- | OpenAI Assistants API | Custom mapper (~20 LOC) today; `fromOpenAIAssistants` queued | OpenAI, OpenRouter |
37
- | OpenRouter (any model on any path) | Whatever you already use for tracing | OpenRouter (OpenAI-compat baseUrl) |
38
- | vLLM / Ollama / LMStudio / self-hosted | OTel wrap | Your local OpenAI-compat endpoint |
39
- | Multi-rater human feedback (no automated judge yet) | `fromFeedbackTable` | n/a — gives you κ + disagreement triage |
40
- | Custom logs / DB rows | ~20-line mapper to `RunRecord` | any OpenAI-compat |
41
-
42
- Full integration walkthroughs:
43
- - **Tangle stack** → [`integration-tangle-stack.md`](./integration-tangle-stack.md)
44
- - **Everything else** → [`integration-foreign-stack.md`](./integration-foreign-stack.md)
45
-
46
- ## Zero-setup demo first — 30 seconds
47
-
48
- Before any integration, run the demo against synthetic data so you see the output shape live:
49
-
50
- ```sh
51
- npx @tangle-network/intelligence demo
52
- ```
53
-
54
- No install, no key, no data. Synthetic agent runs through synthetic scenarios; the CLI prints a real `InsightReport` with composite distribution + Pareto + prior-period delta + ranked recommendations. Same output shape you'll get on your real data once we integrate.
55
-
56
- When you're ready to integrate, the same CLI scaffolds your repo:
57
-
58
- ```sh
59
- npx @tangle-network/intelligence init # creates eval/scenarios.json + judges.ts + pnpm scripts + .runs/
60
- npx @tangle-network/intelligence report # renders InsightReport from your latest traces
61
- npx @tangle-network/intelligence improve --max-usd 25 # runs selfImprove with cost ceiling, opens auto-PR on green gate
62
- ```
63
-
64
- Hosted equivalent: **[staging-intelligence.tangle.tools](https://staging-intelligence.tangle.tools)** — open in your browser, ingest your traces, see the dashboard render the same packet your CLI produces.
65
-
66
- ## How you integrate (Tangle stack — 4 steps)
67
-
68
- ```ts
69
- import { fromTangleSandbox } from '@tangle-network/agent-eval/adapters/sandbox'
70
- import { analyzeRuns, selfImprove, gepaDriver } from '@tangle-network/agent-eval/contract'
71
-
72
- // 1. You already emit traces via @tangle-network/sandbox + tcloud.
73
- // Pull them into canonical RunRecord[]:
74
- const runs = fromTangleSandbox({ sessionId, sinceMs: lastReportTime })
75
-
76
- // 2. Get the decision packet — no LLM cost.
77
- const report = await analyzeRuns({ runs, baselineRuns: priorWeekRuns })
78
- // → report.composite + .priorPeriodComparison + .recommendations
79
-
80
- // 3. When you want to actually improve, run the closed loop.
81
- const result = await selfImprove({
82
- scenarios: yourScenarios, // we help you build these
83
- agent: (surface, scenario) => runYourAgent(scenario, surface),
84
- judge: yourJudge, // any function (artifact) → JudgeScore
85
- baselineSurface: currentSystemPrompt,
86
- driver: gepaDriver({ llm: tcloud, model: 'claude-sonnet-4.6', target: 'agent prompt' }),
87
- budget: { generations: 3, populationSize: 4, holdoutFraction: 0.3, maxUsd: 25 },
88
- })
89
-
90
- // 4. Result is a verifiable diff with statistical evidence.
91
- // Auto-PR if result.gateDecision === 'ship-substrate'.
92
- ```
93
-
94
- That's it. ~30 lines of integration code; the rest is your existing agent + tcloud setup.
95
-
96
- ## What we need from you
97
-
98
- - API key for tcloud (you already have this)
99
- - Read access to your sandbox session traces
100
- - A list of 20-50 representative scenarios your agent should handle
101
- - A judge function — even a simple LLM-as-judge gets you 80% of the value
102
- - An LLM-cost budget for the closed loop (default: $25/campaign)
103
-
104
- ## What you ship back to your customers
105
-
106
- The substrate produces a single JSON `InsightReport` your dashboard renders. Live demo embedded in the Tangle Intelligence dashboard. Example below — every section optional based on what your data supports.
107
-
108
- ```json
109
- {
110
- "n": 36,
111
- "composite": {
112
- "mean": 0.823, "p50": 0.85, "p95": 0.96, "stddev": 0.11,
113
- "tailRuns": [
114
- { "runId": "scenario::checkout-bug", "score": 0.41 },
115
- { "runId": "scenario::refund-policy", "score": 0.48 }
116
- ]
117
- },
118
- "priorPeriodComparison": {
119
- "baselineN": 34,
120
- "currentN": 36,
121
- "windowLabel": "vs prior 7 days",
122
- "metrics": {
123
- "composite": {
124
- "current": 0.823, "baseline": 0.731, "delta": 0.092,
125
- "ci95": [0.041, 0.143], "pValue": 0.0008,
126
- "cohensD": 0.84, "significant": true
127
- }
128
- },
129
- "improvedMetrics": ["composite"],
130
- "regressedMetrics": []
131
- },
132
- "recommendations": [
133
- {
134
- "priority": "low",
135
- "kind": "ship",
136
- "title": "composite improved from 0.731 → 0.823 vs prior 7 days",
137
- "detail": "Welch CI95=[0.041, 0.143], p=0.0008, Cohen's d=0.84 (n_current=36, n_baseline=34). Statistically significant improvement worth flagging."
138
- },
139
- {
140
- "priority": "high",
141
- "kind": "investigate",
142
- "title": "Top failure cluster: refund-policy (12% of failures)",
143
- "detail": "4 runs failed. Largest cluster groups by intent — agent missed compliance flag in 3 of 4."
144
- }
145
- ]
146
- }
147
- ```
148
-
149
- ## Pricing for the pilot
150
-
151
- - Free for the first 30 days
152
- - Hosted decision-packet generation: included
153
- - LLM cost on closed-loop campaigns: pass-through to your tcloud account
154
- - Post-pilot: per-campaign pricing tied to budget cap + per-decision-packet billed monthly
155
-
156
- ## Next step
157
-
158
- Reply with: which agent + which week you want to start, and we'll set up the integration on a shared call. ~1 hour to first running report.
159
-
160
-
161
- *Tangle Network · @tangle-network/agent-eval @0.53.0 · MIT · Self-hostable*
@@ -1,172 +0,0 @@
1
- {
2
- "n": 36,
3
- "composite": {
4
- "n": 36,
5
- "mean": 0.823,
6
- "p50": 0.85,
7
- "p95": 0.96,
8
- "stddev": 0.114,
9
- "min": 0.41,
10
- "max": 0.98,
11
- "tailRuns": [
12
- { "runId": "scenario::checkout-bug", "score": 0.41 },
13
- { "runId": "scenario::refund-policy-edge", "score": 0.48 },
14
- { "runId": "scenario::multi-tenant-isolation", "score": 0.52 },
15
- { "runId": "scenario::stale-cache-invalidation", "score": 0.55 },
16
- { "runId": "scenario::partial-payment", "score": 0.61 }
17
- ],
18
- "histogram": [
19
- { "lo": 0.40, "hi": 0.46, "count": 1 },
20
- { "lo": 0.46, "hi": 0.51, "count": 1 },
21
- { "lo": 0.51, "hi": 0.57, "count": 1 },
22
- { "lo": 0.57, "hi": 0.62, "count": 1 },
23
- { "lo": 0.62, "hi": 0.68, "count": 2 },
24
- { "lo": 0.68, "hi": 0.74, "count": 2 },
25
- { "lo": 0.74, "hi": 0.80, "count": 4 },
26
- { "lo": 0.80, "hi": 0.85, "count": 9 },
27
- { "lo": 0.85, "hi": 0.91, "count": 8 },
28
- { "lo": 0.91, "hi": 0.96, "count": 6 },
29
- { "lo": 0.96, "hi": 1.0, "count": 1 }
30
- ]
31
- },
32
- "perDimension": {
33
- "intent-recognition": {
34
- "n": 36, "mean": 0.89, "p50": 0.92, "p95": 0.98, "stddev": 0.08
35
- },
36
- "compliance-flagging": {
37
- "n": 36, "mean": 0.71, "p50": 0.75, "p95": 0.92, "stddev": 0.18
38
- },
39
- "tone": {
40
- "n": 36, "mean": 0.94, "p50": 0.95, "p95": 0.99, "stddev": 0.04
41
- }
42
- },
43
- "costQuality": {
44
- "cost": {
45
- "n": 36, "mean": 0.087, "p50": 0.082, "p95": 0.124, "stddev": 0.021
46
- },
47
- "pareto": {
48
- "kind": "pareto-cost-quality",
49
- "split": "holdout",
50
- "axes": { "x": "costUsd", "y": "score" },
51
- "points": [
52
- { "candidateId": "baseline-v3.1", "cost": 0.087, "quality": 0.823, "n": 36, "onFrontier": true }
53
- ]
54
- }
55
- },
56
- "judges": {
57
- "claude-sonnet-4.6": {
58
- "n": 36,
59
- "meanScore": 0.831,
60
- "calibration": null
61
- }
62
- },
63
- "lift": null,
64
- "failureClusters": {
65
- "totalFailures": 4,
66
- "clusters": [
67
- {
68
- "id": "cluster_refund_compliance",
69
- "name": "refund-policy missed compliance flag",
70
- "share": 0.75,
71
- "exemplars": [
72
- "scenario::refund-policy-edge",
73
- "scenario::partial-payment",
74
- "scenario::cross-border-refund"
75
- ],
76
- "suggestedFix": "Add explicit step to the addendum: when refund amount > $100 OR cross-border, surface compliance flag before responding."
77
- }
78
- ]
79
- },
80
- "priorPeriodComparison": {
81
- "baselineN": 34,
82
- "currentN": 36,
83
- "windowLabel": "vs prior 7 days",
84
- "metrics": {
85
- "composite": {
86
- "current": 0.823,
87
- "baseline": 0.731,
88
- "delta": 0.092,
89
- "ci95": [0.041, 0.143],
90
- "pValue": 0.0008,
91
- "cohensD": 0.84,
92
- "baselineN": 34,
93
- "currentN": 36,
94
- "significant": true
95
- },
96
- "cost": {
97
- "current": 0.087,
98
- "baseline": 0.082,
99
- "delta": 0.005,
100
- "ci95": [-0.003, 0.013],
101
- "pValue": 0.21,
102
- "cohensD": 0.23,
103
- "baselineN": 34,
104
- "currentN": 36,
105
- "significant": false
106
- },
107
- "duration": {
108
- "current": 4820,
109
- "baseline": 5340,
110
- "delta": -520,
111
- "ci95": [-840, -200],
112
- "pValue": 0.002,
113
- "cohensD": -0.71,
114
- "baselineN": 34,
115
- "currentN": 36,
116
- "significant": true
117
- },
118
- "dim.compliance-flagging": {
119
- "current": 0.71,
120
- "baseline": 0.58,
121
- "delta": 0.13,
122
- "ci95": [0.06, 0.20],
123
- "pValue": 0.0004,
124
- "cohensD": 0.79,
125
- "baselineN": 34,
126
- "currentN": 36,
127
- "significant": true
128
- }
129
- },
130
- "improvedMetrics": ["composite", "duration", "dim.compliance-flagging"],
131
- "regressedMetrics": []
132
- },
133
- "release": {
134
- "status": "pass",
135
- "axes": [
136
- { "name": "quality-lift", "status": "pass", "detail": "no candidate/baseline pair within campaign; relying on priorPeriodComparison" },
137
- { "name": "contamination", "status": "pass", "detail": "no canaries supplied" },
138
- { "name": "composite-distribution", "status": "pass", "detail": "mean=0.823, p50=0.85, p95=0.96 over n=36" }
139
- ],
140
- "issues": []
141
- },
142
- "recommendations": [
143
- {
144
- "priority": "low",
145
- "kind": "ship",
146
- "title": "composite improved from 0.731 → 0.823 vs prior 7 days",
147
- "detail": "Welch CI95=[0.041, 0.143], p=0.0008, Cohen's d=0.84 (n_current=36, n_baseline=34). Statistically significant improvement worth flagging.",
148
- "evidencePath": "priorPeriodComparison.metrics.composite"
149
- },
150
- {
151
- "priority": "low",
152
- "kind": "ship",
153
- "title": "compliance-flagging dimension improved from 0.58 → 0.71",
154
- "detail": "Welch CI95=[0.06, 0.20], p=0.0004, Cohen's d=0.79. The fix from last week's PR is statistically validated.",
155
- "evidencePath": "priorPeriodComparison.metrics.dim.compliance-flagging"
156
- },
157
- {
158
- "priority": "high",
159
- "kind": "investigate",
160
- "title": "Top failure cluster: refund-policy missed compliance flag (75% of failures)",
161
- "detail": "3 of 4 failed runs cluster here. Suggested fix: add explicit step to addendum for refund > $100 OR cross-border → surface compliance flag.",
162
- "evidencePath": "failureClusters.clusters[0]"
163
- },
164
- {
165
- "priority": "low",
166
- "kind": "ship",
167
- "title": "duration improved from 5340ms → 4820ms vs prior 7 days",
168
- "detail": "Welch CI95=[-840, -200]ms, p=0.002, Cohen's d=-0.71. Agent is meaningfully faster — worth keeping the optimization that drove this.",
169
- "evidencePath": "priorPeriodComparison.metrics.duration"
170
- }
171
- ]
172
- }