@tangle-network/agent-eval 0.136.0 → 0.138.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (231) hide show
  1. package/CHANGELOG.md +86 -1
  2. package/README.md +37 -2
  3. package/dist/{agent-profile-cell-OhuTee9n.js → agent-profile-cell-CbfBm2g6.js} +2 -2
  4. package/dist/{agent-profile-cell-OhuTee9n.js.map → agent-profile-cell-CbfBm2g6.js.map} +1 -1
  5. package/dist/{agent-profile-cell-CCm3l2v2.d.ts → agent-profile-cell-Cw0PVwDr.d.ts} +2 -2
  6. package/dist/{agent-profile-cell-CCm3l2v2.d.ts.map → agent-profile-cell-Cw0PVwDr.d.ts.map} +1 -1
  7. package/dist/analyst/index.d.ts +574 -18
  8. package/dist/analyst/index.d.ts.map +1 -1
  9. package/dist/analyst/index.js +25 -5
  10. package/dist/analyst/index.js.map +1 -1
  11. package/dist/{analyze-runs-jjCmF8pU.js → analyze-runs-BScZvqMV.js} +6 -6
  12. package/dist/{analyze-runs-jjCmF8pU.js.map → analyze-runs-BScZvqMV.js.map} +1 -1
  13. package/dist/{analyze-runs-Cda5Xkj1.d.ts → analyze-runs-CPYxfPWT.d.ts} +6 -6
  14. package/dist/{analyze-runs-Cda5Xkj1.d.ts.map → analyze-runs-CPYxfPWT.d.ts.map} +1 -1
  15. package/dist/{baseline-BUeFcgrn.js → baseline-C-GocmIW.js} +2 -2
  16. package/dist/{baseline-BUeFcgrn.js.map → baseline-C-GocmIW.js.map} +1 -1
  17. package/dist/benchmark-D8dkki-J.js +554 -0
  18. package/dist/benchmark-D8dkki-J.js.map +1 -0
  19. package/dist/benchmark-DlQgU_XI.d.ts +236 -0
  20. package/dist/benchmark-DlQgU_XI.d.ts.map +1 -0
  21. package/dist/benchmark-command-CMqVqReF.js +4332 -0
  22. package/dist/benchmark-command-CMqVqReF.js.map +1 -0
  23. package/dist/benchmarks/index.d.ts +1 -1
  24. package/dist/benchmarks/index.js +1 -1
  25. package/dist/{benchmarks-Dfgm9ts5.js → benchmarks-BJ_xK5rQ.js} +4 -3
  26. package/dist/{benchmarks-Dfgm9ts5.js.map → benchmarks-BJ_xK5rQ.js.map} +1 -1
  27. package/dist/builder-eval/index.js +2 -2
  28. package/dist/campaign/index.d.ts +6 -6
  29. package/dist/campaign/index.js +4 -4
  30. package/dist/{campaign-Dz8uQnhC.js → campaign-BIBS-NHV.js} +219 -78
  31. package/dist/campaign-BIBS-NHV.js.map +1 -0
  32. package/dist/cli.js +9 -2
  33. package/dist/cli.js.map +1 -1
  34. package/dist/client-BwPKohkJ.d.ts +202 -0
  35. package/dist/client-BwPKohkJ.d.ts.map +1 -0
  36. package/dist/completion-verifier-B4-IMYcS.d.ts +240 -0
  37. package/dist/completion-verifier-B4-IMYcS.d.ts.map +1 -0
  38. package/dist/contract/index.d.ts +10 -9
  39. package/dist/contract/index.d.ts.map +1 -1
  40. package/dist/contract/index.js +13 -13
  41. package/dist/control.d.ts +2 -2
  42. package/dist/control.js +1 -1
  43. package/dist/{cost-ledger-fGS_u_O1.d.ts → cost-ledger-B1D3COAc.d.ts} +6 -5
  44. package/dist/{cost-ledger-fGS_u_O1.d.ts.map → cost-ledger-B1D3COAc.d.ts.map} +1 -1
  45. package/dist/{cost-ledger-DHAjwNj7.js → cost-ledger-CHDLA0Ss.js} +91 -46
  46. package/dist/cost-ledger-CHDLA0Ss.js.map +1 -0
  47. package/dist/{dataset-BvtnC8Dc.d.ts → dataset-v_Y5902-.d.ts} +2 -2
  48. package/dist/{dataset-BvtnC8Dc.d.ts.map → dataset-v_Y5902-.d.ts.map} +1 -1
  49. package/dist/{default-registry-Brxr728w.d.ts → default-registry-PUhIVRWz.d.ts} +77 -138
  50. package/dist/default-registry-PUhIVRWz.d.ts.map +1 -0
  51. package/dist/{default-registry-CHmdy2An.js → default-registry-lp5R0lve.js} +1617 -291
  52. package/dist/default-registry-lp5R0lve.js.map +1 -0
  53. package/dist/{errors-8YnH8WlF.js → errors-D-LKuDhb.js} +8 -2
  54. package/dist/errors-D-LKuDhb.js.map +1 -0
  55. package/dist/{errors-CEk209JS.d.ts → errors-DkfjIDvD.d.ts} +9 -3
  56. package/dist/errors-DkfjIDvD.d.ts.map +1 -0
  57. package/dist/{eval-campaign-Cc8WZJ6b.js → eval-campaign-9MozgKL7.js} +6 -6
  58. package/dist/{eval-campaign-Cc8WZJ6b.js.map → eval-campaign-9MozgKL7.js.map} +1 -1
  59. package/dist/exact-types-Dpw2LeHA.d.ts +234 -0
  60. package/dist/exact-types-Dpw2LeHA.d.ts.map +1 -0
  61. package/dist/{extract-usage-DIQpN-ww.js → extract-usage-CS391dOE.js} +3 -3
  62. package/dist/{extract-usage-DIQpN-ww.js.map → extract-usage-CS391dOE.js.map} +1 -1
  63. package/dist/{feedback-trajectory-CVaeREXV.d.ts → feedback-trajectory-CoNep7rl.d.ts} +91 -3
  64. package/dist/feedback-trajectory-CoNep7rl.d.ts.map +1 -0
  65. package/dist/fuzz.d.ts +1 -1
  66. package/dist/fuzz.js +2 -2
  67. package/dist/hosted/index.d.ts +3 -2
  68. package/dist/hosted/index.d.ts.map +1 -1
  69. package/dist/{index-AbhwHp0V.d.ts → index-B2-IxCMB.d.ts} +2 -2
  70. package/dist/{index-AbhwHp0V.d.ts.map → index-B2-IxCMB.d.ts.map} +1 -1
  71. package/dist/index-BipJlj-C.d.ts +316 -0
  72. package/dist/index-BipJlj-C.d.ts.map +1 -0
  73. package/dist/{index-CQsJcqch.d.ts → index-CjVYlVBK.d.ts} +5 -5
  74. package/dist/{index-CQsJcqch.d.ts.map → index-CjVYlVBK.d.ts.map} +1 -1
  75. package/dist/{index-B4Fjfo5U.d.ts → index-D0cxAdaV.d.ts} +89 -317
  76. package/dist/index-D0cxAdaV.d.ts.map +1 -0
  77. package/dist/{index-DuhJaaiH.d.ts → index-DEb46kc6.d.ts} +2 -2
  78. package/dist/index-DEb46kc6.d.ts.map +1 -0
  79. package/dist/{index-C2fkZhv_.d.ts → index-sMN_hI4E.d.ts} +3 -3
  80. package/dist/{index-C2fkZhv_.d.ts.map → index-sMN_hI4E.d.ts.map} +1 -1
  81. package/dist/index.d.ts +30 -70
  82. package/dist/index.d.ts.map +1 -1
  83. package/dist/index.js +175 -35
  84. package/dist/index.js.map +1 -1
  85. package/dist/{client-DcvgkaZi.d.ts → insight-report-CXd8VBDR.d.ts} +5 -203
  86. package/dist/insight-report-CXd8VBDR.d.ts.map +1 -0
  87. package/dist/{integrity-rmVhXWA7.d.ts → integrity-B-MLFz0I.d.ts} +3 -3
  88. package/dist/{integrity-rmVhXWA7.d.ts.map → integrity-B-MLFz0I.d.ts.map} +1 -1
  89. package/dist/integrity-CCXTftiL.js +1360 -0
  90. package/dist/integrity-CCXTftiL.js.map +1 -0
  91. package/dist/{integrity-BzRbCHzi.js → integrity-fdt8XPAv.js} +2 -2
  92. package/dist/{integrity-BzRbCHzi.js.map → integrity-fdt8XPAv.js.map} +1 -1
  93. package/dist/ledger-core/index.d.ts +1 -1
  94. package/dist/ledger-core/index.js +1 -1
  95. package/dist/{ledger-core-DAKFKRzi.js → ledger-core-C0Yx1I14.js} +303 -110
  96. package/dist/ledger-core-C0Yx1I14.js.map +1 -0
  97. package/dist/{llm-client-DHx8pzyJ.js → llm-client-Cj3c7PEm.js} +6 -6
  98. package/dist/llm-client-Cj3c7PEm.js.map +1 -0
  99. package/dist/meta-eval/index.d.ts +2 -2
  100. package/dist/meta-eval/index.js +3 -3
  101. package/dist/{mint-DyRUc9k6.js → mint-Ctwk079K.js} +4 -4
  102. package/dist/{mint-DyRUc9k6.js.map → mint-Ctwk079K.js.map} +1 -1
  103. package/dist/multishot/index.d.ts +2 -2
  104. package/dist/openapi.json +1 -1
  105. package/dist/{paired-arms-BbFKrAU-.js → paired-arms-iZ08VFMN.js} +3 -3
  106. package/dist/{paired-arms-BbFKrAU-.js.map → paired-arms-iZ08VFMN.js.map} +1 -1
  107. package/dist/pipelines/index.js +2 -2
  108. package/dist/profile-cell.d.ts +1 -1
  109. package/dist/profile-cell.js +1 -1
  110. package/dist/{proposal-findings-DCawte-y.js → proposal-findings-2GIUo1et.js} +2 -68
  111. package/dist/proposal-findings-2GIUo1et.js.map +1 -0
  112. package/dist/{propose-review-control-SQ-n9-We.js → propose-review-control-DLXz4FCX.js} +2 -2
  113. package/dist/{propose-review-control-SQ-n9-We.js.map → propose-review-control-DLXz4FCX.js.map} +1 -1
  114. package/dist/registry-C4yJTza7.d.ts +178 -0
  115. package/dist/registry-C4yJTza7.d.ts.map +1 -0
  116. package/dist/{release-report-DooPguBc.js → release-report-B5XPBvAU.js} +4 -4
  117. package/dist/{release-report-DooPguBc.js.map → release-report-B5XPBvAU.js.map} +1 -1
  118. package/dist/{release-report-DpBxGGI1.d.ts → release-report-CoyvyLBs.d.ts} +4 -4
  119. package/dist/{release-report-DpBxGGI1.d.ts.map → release-report-CoyvyLBs.d.ts.map} +1 -1
  120. package/dist/{replay-C6wRg47C.js → replay-Cb-4Vf0k.js} +249 -8
  121. package/dist/replay-Cb-4Vf0k.js.map +1 -0
  122. package/dist/{replay-BRfMIs81.d.ts → replay-DbIYwso6.d.ts} +227 -52
  123. package/dist/replay-DbIYwso6.d.ts.map +1 -0
  124. package/dist/reporting.d.ts +4 -4
  125. package/dist/reporting.js +4 -4
  126. package/dist/{researcher-Doo95b50.d.ts → researcher-BCeOEjtR.d.ts} +6 -7
  127. package/dist/researcher-BCeOEjtR.d.ts.map +1 -0
  128. package/dist/{reward-hacking-a-kYs0-i.js → reward-hacking-GyN0kMd8.js} +3 -3
  129. package/dist/{reward-hacking-a-kYs0-i.js.map → reward-hacking-GyN0kMd8.js.map} +1 -1
  130. package/dist/{reward-hacking-D-QqXvg-.d.ts → reward-hacking-sE2l_NV6.d.ts} +2 -2
  131. package/dist/{reward-hacking-D-QqXvg-.d.ts.map → reward-hacking-sE2l_NV6.d.ts.map} +1 -1
  132. package/dist/rl.d.ts +6 -6
  133. package/dist/rl.js +9 -9
  134. package/dist/rollout/index.d.ts +1 -1
  135. package/dist/rollout/index.js +3 -3
  136. package/dist/{rollout-DLSUIWLu.js → rollout-DQFl0UXA.js} +2 -2
  137. package/dist/{rollout-DLSUIWLu.js.map → rollout-DQFl0UXA.js.map} +1 -1
  138. package/dist/{rubric-predictive-validity-BJf-8ejY.js → rubric-predictive-validity-BRR632r1.js} +2 -2
  139. package/dist/{rubric-predictive-validity-BJf-8ejY.js.map → rubric-predictive-validity-BRR632r1.js.map} +1 -1
  140. package/dist/{rubric-predictive-validity-C1dCLcvb.d.ts → rubric-predictive-validity-w2klGv1u.d.ts} +2 -2
  141. package/dist/{rubric-predictive-validity-C1dCLcvb.d.ts.map → rubric-predictive-validity-w2klGv1u.d.ts.map} +1 -1
  142. package/dist/{run-evidence-DokQtX0-.d.ts → run-evidence-CbE0A8Xg.d.ts} +3 -3
  143. package/dist/{run-evidence-DokQtX0-.d.ts.map → run-evidence-CbE0A8Xg.d.ts.map} +1 -1
  144. package/dist/{run-record-DcObtIGh.d.ts → run-record-DwHMk1Ai.d.ts} +4 -4
  145. package/dist/{run-record-DcObtIGh.d.ts.map → run-record-DwHMk1Ai.d.ts.map} +1 -1
  146. package/dist/{run-record-BIwU2wdV.js → run-record-vRgqWmJw.js} +3 -3
  147. package/dist/{run-record-BIwU2wdV.js.map → run-record-vRgqWmJw.js.map} +1 -1
  148. package/dist/{semantic-concept-judge-Btozx3Vc.js → semantic-concept-judge-DYXDPZW0.js} +12 -6
  149. package/dist/semantic-concept-judge-DYXDPZW0.js.map +1 -0
  150. package/dist/{server-Bz3WQJs6.js → server-DLEvyW2z.js} +3 -3
  151. package/dist/{server-Bz3WQJs6.js.map → server-DLEvyW2z.js.map} +1 -1
  152. package/dist/single-run-lock-D_bS5xhj.js +318 -0
  153. package/dist/single-run-lock-D_bS5xhj.js.map +1 -0
  154. package/dist/{skill-usage-BDQVPIG1.d.ts → skill-usage-Bv3G4VkA.d.ts} +36 -48
  155. package/dist/skill-usage-Bv3G4VkA.d.ts.map +1 -0
  156. package/dist/{skillopt-optimization-method-0UmPD6aP.js → skillopt-optimization-method-CjKMZy0d.js} +10 -185
  157. package/dist/skillopt-optimization-method-CjKMZy0d.js.map +1 -0
  158. package/dist/{skillopt-optimization-method-CwSYkv35.d.ts → skillopt-optimization-method-CzfnA8O-.d.ts} +11 -12
  159. package/dist/skillopt-optimization-method-CzfnA8O-.d.ts.map +1 -0
  160. package/dist/{statistics-CnGCLLqc.js → statistics-ByxzSiOM.js} +2 -2
  161. package/dist/{statistics-CnGCLLqc.js.map → statistics-ByxzSiOM.js.map} +1 -1
  162. package/dist/{statistics-CKOqre5S.d.ts → statistics-mf70aXKp.d.ts} +2 -2
  163. package/dist/{statistics-CKOqre5S.d.ts.map → statistics-mf70aXKp.d.ts.map} +1 -1
  164. package/dist/store-otlp-BenKynPE.js +1688 -0
  165. package/dist/store-otlp-BenKynPE.js.map +1 -0
  166. package/dist/{summary-report-BEk8OFLs.js → summary-report-9A5y7EsK.js} +4 -4
  167. package/dist/{summary-report-BEk8OFLs.js.map → summary-report-9A5y7EsK.js.map} +1 -1
  168. package/dist/{summary-report-CPMINBqs.d.ts → summary-report-BKinV4yD.d.ts} +3 -3
  169. package/dist/{summary-report-CPMINBqs.d.ts.map → summary-report-BKinV4yD.d.ts.map} +1 -1
  170. package/dist/supervisor-run/index.d.ts +3 -2
  171. package/dist/supervisor-run/index.js +3 -2
  172. package/dist/{supervisor-run-Dr5HnTup.js → supervisor-run-B2EWUmQY.js} +28 -454
  173. package/dist/supervisor-run-B2EWUmQY.js.map +1 -0
  174. package/dist/{test-graded-scenario-BsqWLmPt.js → test-graded-scenario-JHcKQNpq.js} +2 -2
  175. package/dist/{test-graded-scenario-BsqWLmPt.js.map → test-graded-scenario-JHcKQNpq.js.map} +1 -1
  176. package/dist/tools-DZGdROtG.js +255 -0
  177. package/dist/tools-DZGdROtG.js.map +1 -0
  178. package/dist/traces.d.ts +6 -7
  179. package/dist/traces.js +6 -6
  180. package/dist/types-5q2T25iW.d.ts +804 -0
  181. package/dist/types-5q2T25iW.d.ts.map +1 -0
  182. package/dist/{types-DVjczBM9.d.ts → types-BtJhn8v6.d.ts} +260 -6
  183. package/dist/types-BtJhn8v6.d.ts.map +1 -0
  184. package/dist/{index-CyC1BTmn.d.ts → types-Dea6tiVI.d.ts} +16 -238
  185. package/dist/types-Dea6tiVI.d.ts.map +1 -0
  186. package/dist/{types-DiWLru6Z.d.ts → types-zFYez3PK.d.ts} +5 -5
  187. package/dist/{types-DiWLru6Z.d.ts.map → types-zFYez3PK.d.ts.map} +1 -1
  188. package/dist/wire/index.d.ts +3 -3
  189. package/dist/wire/index.js +1 -1
  190. package/docs/feedback-trajectories.md +100 -1
  191. package/docs/trace-analysis.md +494 -58
  192. package/package.json +9 -3
  193. package/dist/analyst-BkTS3C58.d.ts +0 -89
  194. package/dist/analyst-BkTS3C58.d.ts.map +0 -1
  195. package/dist/analyst-j5je5J7c.js +0 -152
  196. package/dist/analyst-j5je5J7c.js.map +0 -1
  197. package/dist/campaign-Dz8uQnhC.js.map +0 -1
  198. package/dist/client-DcvgkaZi.d.ts.map +0 -1
  199. package/dist/concurrency-MUjT7VjM.js +0 -109
  200. package/dist/concurrency-MUjT7VjM.js.map +0 -1
  201. package/dist/cost-ledger-DHAjwNj7.js.map +0 -1
  202. package/dist/default-registry-Brxr728w.d.ts.map +0 -1
  203. package/dist/default-registry-CHmdy2An.js.map +0 -1
  204. package/dist/errors-8YnH8WlF.js.map +0 -1
  205. package/dist/errors-CEk209JS.d.ts.map +0 -1
  206. package/dist/feedback-trajectory-CVaeREXV.d.ts.map +0 -1
  207. package/dist/index-B4Fjfo5U.d.ts.map +0 -1
  208. package/dist/index-CyC1BTmn.d.ts.map +0 -1
  209. package/dist/index-DuhJaaiH.d.ts.map +0 -1
  210. package/dist/ledger-core-DAKFKRzi.js.map +0 -1
  211. package/dist/llm-client-BiK4HW0u.d.ts +0 -290
  212. package/dist/llm-client-BiK4HW0u.d.ts.map +0 -1
  213. package/dist/llm-client-DHx8pzyJ.js.map +0 -1
  214. package/dist/proposal-findings-DCawte-y.js.map +0 -1
  215. package/dist/raw-provider-sink-BU29Sh8h.d.ts +0 -134
  216. package/dist/raw-provider-sink-BU29Sh8h.d.ts.map +0 -1
  217. package/dist/replay-BRfMIs81.d.ts.map +0 -1
  218. package/dist/replay-C6wRg47C.js.map +0 -1
  219. package/dist/researcher-Doo95b50.d.ts.map +0 -1
  220. package/dist/semantic-concept-judge-Btozx3Vc.js.map +0 -1
  221. package/dist/skill-usage-BDQVPIG1.d.ts.map +0 -1
  222. package/dist/skillopt-optimization-method-0UmPD6aP.js.map +0 -1
  223. package/dist/skillopt-optimization-method-CwSYkv35.d.ts.map +0 -1
  224. package/dist/store-CxJry_cs.d.ts +0 -229
  225. package/dist/store-CxJry_cs.d.ts.map +0 -1
  226. package/dist/supervisor-run-Dr5HnTup.js.map +0 -1
  227. package/dist/tools-D8yTtNSN.js +0 -1190
  228. package/dist/tools-D8yTtNSN.js.map +0 -1
  229. package/dist/types-Cc3qbqzj.d.ts +0 -387
  230. package/dist/types-Cc3qbqzj.d.ts.map +0 -1
  231. package/dist/types-DVjczBM9.d.ts.map +0 -1
@@ -1,11 +1,12 @@
1
1
  import { a as MultiLayerVerifier, l as VerifyOptions, o as Severity } from "../multi-layer-verifier-BHY1gWAc.js";
2
- import { C as FindingSubjectKind, D as parseFindingSubject, E as findingSubjectGrammarPromptFor, F as createAnalystAi, H as SemanticConceptJudgeInput, O as renderFindingSubject, P as CreateAnalystAiConfig, S as FindingSubject, T as KIND_EXPECTED_SUBJECTS, U as SemanticConceptJudgeOptions, Y as RunTrace, _ as defaultIsMaterial, a as SkillUsageScanConfig, b as FINDING_SUBJECT_KINDS, c as DEFAULT_TRACE_ANALYST_KINDS, d as IMPROVEMENT_KIND_SPEC, f as FAILURE_MODE_KIND_SPEC, g as PersistedFinding, h as FindingsStore, i as SkillUsageReport, k as BehavioralMetrics, l as KNOWLEDGE_POISONING_KIND_SPEC, m as FindingsDiff, n as SkillUsageAnalyst, o as buildSkillUsageReport, p as DiffPolicy, q as RunCritic, r as SkillUsageRecord, s as emitSkillUsageFindings, t as SKILL_USAGE_ANALYST, u as KNOWLEDGE_GAP_KIND_SPEC, v as diffFindings, w as FindingSubjectStringSchema, x as FINDING_SUBJECT_SYNTAX, y as FINDING_SUBJECT_GRAMMAR_PROMPT } from "../skill-usage-BDQVPIG1.js";
3
- import { c as CostLedgerHandle } from "../cost-ledger-fGS_u_O1.js";
4
- import { o as LlmClientOptions } from "../llm-client-BiK4HW0u.js";
5
- import { A as ChatClient, B as SandboxSdkTransportOpts, F as CreateChatClientOpts, I as CustomTransportOpts, L as DirectProviderTransportOpts, M as ChatResponse, N as ChatTransport, P as CliBridgeTransportOpts, R as MockTransportOpts, V as createChatClient, j as ChatRequest, k as ChatCallOpts, m as JudgeInput, p as JudgeFn, z as RouterTransportOpts } from "../types-Cc3qbqzj.js";
6
- import { t as TraceAnalysisStore } from "../store-CxJry_cs.js";
7
- import { _ as makeFinding, a as AnalystInputKind, c as AnalystRunInputs, d as AnalystSeverity, f as AnalystUsageReceipt, g as computeFindingId, h as ProposalFindingOrigin, i as AnalystFinding, l as AnalystRunResult, m as ProposalFinding, n as AnalystContext, o as AnalystRequirements, p as EvidenceRef, r as AnalystCost, s as AnalystRunEvent, t as Analyst, u as AnalystRunSummary, v as makeProposalFinding } from "../types-DVjczBM9.js";
8
- import { _ as RawAnalystEvidenceSchema, a as AnalystRegistryOptions, b as evidenceRefsFromRawFinding, c as CreateTraceAnalystKindOpts, d as createTraceAnalystKind, f as renderPriorFindings, g as RawAnalystEvidence, h as RAW_FINDING_SCHEMA_PROMPT, i as AnalystRegistry, l as TraceAnalystGolden, m as ANALYST_SEVERITIES, n as buildDefaultAnalystRegistry, o as BudgetPolicy, p as renderUpstreamFindings, r as AnalystHooks, s as RegistryRunOpts, t as DefaultAnalystRegistryOptions, u as TraceAnalystKindSpec, v as RawAnalystFinding, x as parseRawFinding, y as RawAnalystFindingSchema } from "../default-registry-Brxr728w.js";
2
+ import { A as parseFindingSubject, B as SemanticConceptJudgeInput, C as FINDING_SUBJECT_KINDS, D as FindingSubjectStringSchema, E as FindingSubjectKind, G as RunCritic, M as CreateAnalystAiConfig, N as createAnalystAi, O as KIND_EXPECTED_SUBJECTS, S as FINDING_SUBJECT_GRAMMAR_PROMPT, T as FindingSubject, V as SemanticConceptJudgeOptions, _ as FindingsDiff, a as SkillUsageScanConfig, b as defaultIsMaterial, c as DEFAULT_TRACE_ANALYST_KINDS, d as IMPROVEMENT_KIND_SPEC, f as FAILURE_MODE_KIND_SPEC, g as DiffPolicy, h as emitControlIntegrityFindings, i as SkillUsageReport, j as renderFindingSubject, k as findingSubjectGrammarPromptFor, l as KNOWLEDGE_POISONING_KIND_SPEC, m as ControlIntegrityAnalyst, n as SkillUsageAnalyst, o as buildSkillUsageReport, p as CONTROL_INTEGRITY_ANALYST, q as RunTrace, r as SkillUsageRecord, s as emitSkillUsageFindings, t as SKILL_USAGE_ANALYST, u as KNOWLEDGE_GAP_KIND_SPEC, v as FindingsStore, w as FINDING_SUBJECT_SYNTAX, x as diffFindings, y as PersistedFinding } from "../skill-usage-Bv3G4VkA.js";
3
+ import { c as CostLedgerHandle } from "../cost-ledger-B1D3COAc.js";
4
+ import { A as ChatClient, B as SandboxSdkTransportOpts, F as CreateChatClientOpts, I as CustomTransportOpts, L as DirectProviderTransportOpts, M as ChatResponse, N as ChatTransport, P as CliBridgeTransportOpts, R as MockTransportOpts, V as createChatClient, j as ChatRequest, k as ChatCallOpts, m as JudgeInput, p as JudgeFn, q as LlmClientOptions, z as RouterTransportOpts } from "../types-5q2T25iW.js";
5
+ import { _ as makeFinding, a as AnalystInputKind, c as AnalystRunInputs, d as AnalystSeverity, f as AnalystUsageReceipt, g as computeFindingId, h as ProposalFindingOrigin, i as AnalystFinding, l as AnalystRunResult, m as ProposalFinding, n as AnalystContext, o as AnalystRequirements, p as EvidenceRef, r as AnalystCost, s as AnalystRunEvent, t as Analyst, u as AnalystRunSummary, v as makeProposalFinding, x as TraceAnalysisStore } from "../types-BtJhn8v6.js";
6
+ import { _ as behavioralAnalyst, a as createTraceAnalystKind, c as ANALYST_SEVERITIES, d as RawAnalystEvidenceSchema, f as RawAnalystFinding, g as BehavioralAnalystOptions, h as parseRawFinding, i as TraceAnalystKindSpec, l as RAW_FINDING_SCHEMA_PROMPT, m as evidenceRefsFromRawFinding, n as buildDefaultAnalystRegistry, o as renderPriorFindings, p as RawAnalystFindingSchema, r as CreateTraceAnalystKindOpts, s as renderUpstreamFindings, t as DefaultAnalystRegistryOptions, u as RawAnalystEvidence, v as deriveEfficiencyFindings } from "../default-registry-PUhIVRWz.js";
7
+ import { a as ExactAnalystRunPolicySnapshot, c as ExactAnalystSnapshot, d as ExactExecutionComponentSnapshot, i as ExactAnalystRunEvent, l as ExactCapableAnalyst, n as ExactAnalystExecutionPlanSnapshot, o as ExactAnalystRunResult, r as ExactAnalystRunCompletion, s as ExactAnalystRunSummary, t as ExactAnalystBudgetSnapshot, u as ExactExecutionComponentIdentity } from "../exact-types-Dpw2LeHA.js";
8
+ import { a as ExactAnalystBudgetPolicy, c as RegistryRunOpts, i as BudgetPolicy, l as assertExactRegistryRunOpts, n as AnalystRegistry, o as ExactAnalystRunExecutionError, r as AnalystRegistryOptions, s as ExactRegistryRunOpts, t as AnalystHooks } from "../registry-C4yJTza7.js";
9
+ import { C as scoreAnalystFindings, S as traceStoreEvidenceResolver, _ as AnalystIssueExpectation, a as AnalystBenchmarkLabelState, b as registryBenchmarkRunner, c as AnalystBenchmarkProvenance, d as AnalystBenchmarkSummary, f as AnalystEvidenceExpectation, g as AnalystFindingScore, h as AnalystEvidenceResolver, i as AnalystBenchmarkError, l as AnalystBenchmarkResult, m as AnalystEvidenceResolutionError, n as AnalystBenchmarkDatasetRef, o as AnalystBenchmarkObservation, p as AnalystEvidenceResolution, r as AnalystBenchmarkDescriptor, s as AnalystBenchmarkOutput, t as AnalystBenchmarkCase, u as AnalystBenchmarkRunner, v as AnalystLatencyDistribution, x as runAnalystBenchmark, y as RunAnalystBenchmarkOptions } from "../benchmark-DlQgU_XI.js";
9
10
  import { AxFunction } from "@ax-llm/ax";
10
11
  //#region src/analyst/adapters.d.ts
11
12
  declare function liftSeverity(s: Severity): AnalystSeverity;
@@ -50,17 +51,570 @@ interface SemanticConceptJudgeAdapterOpts {
50
51
  }
51
52
  declare function createSemanticConceptJudgeAdapter(opts?: SemanticConceptJudgeAdapterOpts): Analyst<SemanticConceptJudgeInput>;
52
53
  //#endregion
53
- //#region src/analyst/behavioral-analyst.d.ts
54
- /**
55
- * Map computed signals → structured AnalystFindings. Pure: no LLM, no clock
56
- * dependence beyond `produced_at` (overridable for deterministic tests).
57
- */
58
- declare function deriveEfficiencyFindings(metrics: BehavioralMetrics, opts?: {
54
+ //#region src/analyst/benchmark-agentrx-calibration.d.ts
55
+ declare const AGENT_RX_UPSTREAM_REVISION = "f228165bfec60a801fd5fedd9d8ffe0f9de0c69d";
56
+ interface AgentRxCalibrationRunnerSummary {
57
+ runnerId: string;
58
+ selectedRuns: number;
59
+ completedRuns: number;
60
+ failedRuns: number;
61
+ predictedRuns: number;
62
+ missingPredictionRuns: number;
63
+ exactStepAccuracy: number | null;
64
+ stepAccuracyWithin1: number | null;
65
+ stepAccuracyWithin2: number | null;
66
+ stepAccuracyWithin3: number | null;
67
+ stepAccuracyWithin4: number | null;
68
+ stepAccuracyWithin5: number | null;
69
+ meanStepDistance: number | null;
70
+ normalizedMeanStepDistance: number | null;
71
+ normalizedDistanceRuns: number;
72
+ normalizedDistanceUnknownRuns: number;
73
+ rootCauseCategoryAccuracy: number | null;
74
+ anyFailureCategoryAccuracy: number | null;
75
+ earliestFailureCategoryAccuracy: number | null;
76
+ terminalFailureCategoryAccuracy: number | null;
77
+ }
78
+ interface AgentRxCalibrationSummary {
79
+ protocol: 'official-agentrx-root-cause';
80
+ upstreamRevision: string;
81
+ rationale: string;
82
+ runners: AgentRxCalibrationRunnerSummary[];
83
+ }
84
+ declare function summarizeAgentRxCalibration(result: AnalystBenchmarkResult, upstreamRevision: string): AgentRxCalibrationSummary;
85
+ declare function renderAgentRxCalibrationMarkdown(summary: AgentRxCalibrationSummary): string;
86
+ //#endregion
87
+ //#region src/analyst/benchmark-dataset-types.d.ts
88
+ type ExternalId = string | number;
89
+ interface AgentRxFailure {
90
+ failure_id: ExternalId;
91
+ step_number: number;
92
+ step_reason: string;
93
+ failure_category: string;
94
+ category_reason?: string;
95
+ failed_agent?: string;
96
+ }
97
+ interface AgentRxRow {
98
+ trajectory_id: ExternalId;
99
+ failures: readonly AgentRxFailure[];
100
+ root_cause?: {
101
+ failure_id: ExternalId;
102
+ reason_for_root_cause?: string;
103
+ };
104
+ root_cause_failure_id?: ExternalId;
105
+ root_cause_reason?: string;
106
+ failure_summary?: string;
107
+ num_failures?: number;
108
+ }
109
+ interface AgentRxPrediction {
110
+ task_id?: ExternalId;
111
+ failure_case: number | string;
112
+ step_number: number;
113
+ description?: string;
114
+ checklist_reasoning?: string | null;
115
+ }
116
+ interface AgentRxPredictionReport {
117
+ task_id?: ExternalId;
118
+ failures: readonly AgentRxPrediction[];
119
+ num_judges?: number;
120
+ trajectory_length?: number;
121
+ most_common_failure?: number | string;
122
+ modes?: readonly (number | string)[];
123
+ step_mean?: number;
124
+ }
125
+ interface CodeTraceStageAnnotation {
126
+ stage_id: number;
127
+ incorrect_step_ids?: readonly number[];
128
+ unuseful_step_ids?: readonly number[];
129
+ reasoning?: string;
130
+ }
131
+ interface CodeTracerStepLabel {
132
+ step_id: number;
133
+ stage?: string | number;
134
+ stage_name?: string | number;
135
+ stage_id?: string | number;
136
+ label: 'incorrect' | 'unuseful';
137
+ rationale?: string;
138
+ reason?: string;
139
+ note?: string;
140
+ comment?: string;
141
+ }
142
+ interface CodeTracerLabelGroup {
143
+ stage?: string | number;
144
+ stage_name?: string | number;
145
+ stage_id?: string | number;
146
+ labels: readonly CodeTracerStepLabel[];
147
+ }
148
+ type CodeTracerPredictions = string | readonly CodeTraceStageAnnotation[] | readonly CodeTracerStepLabel[] | readonly CodeTracerLabelGroup[];
149
+ interface CodeTraceBenchRow {
150
+ traj_id: string;
151
+ agent: string;
152
+ model: string;
153
+ task_name: string;
154
+ /** Native artifact extraction path in the public CodeTraceBench manifest. */
155
+ source_relpath?: string;
156
+ difficulty?: string;
157
+ category?: string;
158
+ tags?: string | readonly string[];
159
+ solved?: boolean | null;
160
+ step_count: number;
161
+ incorrect_stages: string | readonly CodeTraceStageAnnotation[];
162
+ }
163
+ interface StepLabelAdapterOptions {
164
+ evidenceKind?: EvidenceRef['kind'];
165
+ stepUri?: (trajectoryId: string, step: number) => string;
166
+ }
167
+ type CodeTraceBenchLabelSet = 'incorrect-only' | 'incorrect-and-unuseful';
168
+ interface CodeTraceBenchLabelOptions {
169
+ /**
170
+ * CodeTraceBench's published metric scores incorrect steps only.
171
+ * Include unuseful steps only for an explicitly combined experiment.
172
+ */
173
+ labelSet?: CodeTraceBenchLabelSet;
174
+ }
175
+ interface CodeTraceBenchCaseOptions extends StepLabelAdapterOptions, CodeTraceBenchLabelOptions {}
176
+ interface AgentRxBenchmarkCaseOptions extends StepLabelAdapterOptions {
177
+ stepCount?: number;
178
+ /** AgentRx's published task is root-cause localization. */
179
+ target?: 'root-cause' | 'all-failures';
180
+ }
181
+ interface UpstreamPredictionAdapterOptions extends StepLabelAdapterOptions {
59
182
  analystId?: string;
60
183
  producedAt?: string;
61
- }): AnalystFinding[];
62
- /** The deterministic behavioral/efficiency analyst (no LLM, any-model). */
63
- declare function behavioralAnalyst(): Analyst<TraceAnalysisStore>;
184
+ confidence?: number;
185
+ stepCount?: number;
186
+ }
187
+ interface CodeTracerPredictionAdapterOptions extends UpstreamPredictionAdapterOptions, CodeTraceBenchLabelOptions {}
188
+ //#endregion
189
+ //#region src/analyst/benchmark-dataset-agentrx.d.ts
190
+ declare function agentRxBenchmarkCase<TInput>(row: AgentRxRow, input: TInput, options?: AgentRxBenchmarkCaseOptions): AnalystBenchmarkCase<TInput>;
191
+ /** Translate AgentRx `Report.to_dict()` output or its `failures` array into findings. */
192
+ declare function agentRxPredictionsToFindings(trajectoryIdValue: ExternalId, output: unknown, options?: UpstreamPredictionAdapterOptions): AnalystFinding[];
193
+ declare function normalizeAgentRxCategory(value: string): string;
194
+ /** Match Python's round() behavior used by AgentRx for consensus steps. */
195
+ declare function roundAgentRxStep(value: number): number;
196
+ //#endregion
197
+ //#region src/analyst/benchmark-dataset-codetrace.d.ts
198
+ declare function codeTraceBenchCase<TInput>(row: CodeTraceBenchRow, input: TInput, options?: CodeTraceBenchCaseOptions): AnalystBenchmarkCase<TInput>;
199
+ /** Translate CodeTracer's `codetracer_labels.json` into shared findings. */
200
+ declare function codeTracerPredictionsToFindings(trajectoryIdValue: string, predictions: CodeTracerPredictions, options?: CodeTracerPredictionAdapterOptions): AnalystFinding[];
201
+ //#endregion
202
+ //#region src/analyst/benchmark-dataset-utils.d.ts
203
+ declare function normalizeBenchmarkLabel(value: string): string;
204
+ //#endregion
205
+ //#region src/analyst/benchmark-verification-outcome.d.ts
206
+ type VerificationOutcomeStatus = 'passed' | 'failed' | 'unavailable';
207
+ interface VerificationOutcomeSource {
208
+ path: string;
209
+ format: 'terminal-bench' | 'swe-bench' | 'swe-multi';
210
+ status: VerificationOutcomeStatus;
211
+ }
212
+ interface VerificationOutcome {
213
+ status: VerificationOutcomeStatus;
214
+ reason?: 'missing-result' | 'result-output-unavailable' | 'result-parse-error' | 'result-label-disagreement';
215
+ parseError?: {
216
+ class: string;
217
+ message: string;
218
+ };
219
+ sources: VerificationOutcomeSource[];
220
+ passedCheckCount: number;
221
+ failedCheckCount: number;
222
+ passedChecks: string[];
223
+ failedChecks: string[];
224
+ }
225
+ interface VerificationResultFile {
226
+ relativePath: string;
227
+ content: string;
228
+ }
229
+ declare function parseVerificationOutcome(files: readonly VerificationResultFile[]): VerificationOutcome;
230
+ //#endregion
231
+ //#region src/analyst/benchmark-verification-artifacts.d.ts
232
+ declare const DEFAULT_MAX_VERIFICATION_ARTIFACT_BYTES: number;
233
+ type VerificationArtifactRole = 'final-test-output' | 'final-result' | 'final-metrics';
234
+ interface VerificationArtifactFile {
235
+ role: VerificationArtifactRole;
236
+ path: string;
237
+ relativePath: string;
238
+ sha256: string;
239
+ bytes: number;
240
+ spanId: string;
241
+ }
242
+ interface VerificationArtifactManifest {
243
+ traceId: string;
244
+ status: 'present' | 'missing';
245
+ outcome: VerificationOutcome;
246
+ outcomeSpanId: string;
247
+ caseDirectory: string;
248
+ caseDirectoriesSearched: string[];
249
+ totalBytes: number;
250
+ maxBytes: number;
251
+ files: VerificationArtifactFile[];
252
+ missingRoles: VerificationArtifactRole[];
253
+ searched: Record<VerificationArtifactRole, string[]>;
254
+ }
255
+ interface LoadedVerificationArtifacts {
256
+ manifest: VerificationArtifactManifest;
257
+ outcome: VerificationOutcome;
258
+ files: Array<VerificationArtifactFile & {
259
+ content: string;
260
+ }>;
261
+ }
262
+ declare function loadCodeTraceVerificationArtifacts(options: {
263
+ artifactDir: string;
264
+ row: CodeTraceBenchRow;
265
+ maxBytes?: number;
266
+ }): Promise<LoadedVerificationArtifacts>;
267
+ declare function appendVerificationArtifactsToOtlp(otlpText: string, traceId: string, artifacts: LoadedVerificationArtifacts, afterTimestamp: string): string;
268
+ //#endregion
269
+ //#region src/analyst/benchmark-public-types.d.ts
270
+ type PublicAnalystBenchmarkDataset = 'agentrx' | 'codetracebench';
271
+ interface PublicAnalystBenchmarkModelConfig {
272
+ baseUrl: string;
273
+ apiKey: string;
274
+ model: string;
275
+ maxOutputTokens: number;
276
+ timeoutMs: number;
277
+ costLedger?: CostLedgerHandle;
278
+ durability?: {
279
+ runIdentitySha256: string;
280
+ responseCacheDir: string;
281
+ };
282
+ /** Test-only transport injection. */
283
+ fetchImpl?: typeof fetch;
284
+ }
285
+ interface PreparedPublicAnalystBenchmark {
286
+ cases: AnalystBenchmarkCase<AnalystRunInputs>[];
287
+ sourceRowCount: number;
288
+ selectedCaseIds: string[];
289
+ labelsSha256: string;
290
+ traceFiles: Array<{
291
+ traceId: string;
292
+ relativePath: string;
293
+ sha256: string;
294
+ }>;
295
+ verificationArtifacts: VerificationArtifactManifest[];
296
+ selection: PublicBenchmarkSelectionReport;
297
+ }
298
+ interface PublicBenchmarkValueDistribution {
299
+ total: number;
300
+ missing: number;
301
+ counts: Record<string, number>;
302
+ }
303
+ interface PublicBenchmarkDistributions {
304
+ class: PublicBenchmarkValueDistribution;
305
+ agent: PublicBenchmarkValueDistribution;
306
+ model: PublicBenchmarkValueDistribution;
307
+ difficulty: PublicBenchmarkValueDistribution;
308
+ solved: PublicBenchmarkValueDistribution;
309
+ }
310
+ interface PublicBenchmarkSelectionReport {
311
+ method: 'census' | 'deterministic-hash';
312
+ seed: number;
313
+ sourceCount: number;
314
+ selectedCount: number;
315
+ stratified: false;
316
+ representativeOfInput: boolean;
317
+ source: PublicBenchmarkDistributions;
318
+ selected: PublicBenchmarkDistributions;
319
+ }
320
+ //#endregion
321
+ //#region src/analyst/benchmark-public-adapters.d.ts
322
+ declare function emptyPublicBenchmarkRunner(): AnalystBenchmarkRunner<AnalystRunInputs>;
323
+ declare function adaptPublicBenchmarkFindings(dataset: PublicAnalystBenchmarkDataset, trajectoryId: string, findings: readonly AnalystFinding[], analystId: string): AnalystFinding[];
324
+ //#endregion
325
+ //#region src/analyst/benchmark-public-data.d.ts
326
+ declare function loadPublicBenchmarkRows(path: string): Promise<Array<Record<string, unknown>>>;
327
+ declare function selectPublicBenchmarkRows(dataset: PublicAnalystBenchmarkDataset, rows: readonly Record<string, unknown>[], options: {
328
+ limit: number;
329
+ seed: number;
330
+ }): Array<Record<string, unknown>>;
331
+ declare function publicBenchmarkDistributions(dataset: PublicAnalystBenchmarkDataset, rows: readonly Record<string, unknown>[]): PublicBenchmarkDistributions;
332
+ declare function publicBenchmarkSelectionReport(dataset: PublicAnalystBenchmarkDataset, source: readonly Record<string, unknown>[], selected: readonly Record<string, unknown>[], seed: number): PublicBenchmarkSelectionReport;
333
+ declare function preparePublicAnalystBenchmark(options: {
334
+ dataset: PublicAnalystBenchmarkDataset;
335
+ labelsPath: string;
336
+ traceDir: string;
337
+ artifactDir?: string;
338
+ maxArtifactBytes?: number;
339
+ limit: number;
340
+ seed: number;
341
+ }): Promise<PreparedPublicAnalystBenchmark>;
342
+ //#endregion
343
+ //#region src/analyst/benchmark-public-model.d.ts
344
+ declare function createPublicBenchmarkModelRunner(dataset: PublicAnalystBenchmarkDataset, config: PublicAnalystBenchmarkModelConfig): AnalystBenchmarkRunner<AnalystRunInputs>;
345
+ declare function publicBenchmarkProtocolSha256(dataset: PublicAnalystBenchmarkDataset): string;
346
+ declare const CODE_TRACE_BENCH_ANALYST_PROMPT = "Analyze exactly one coding-agent trajectory and its attached final verification.\nYour task is the CodeTraceBench incorrect-step task: identify every wrong state-changing action, bad hypothesis that drives an action, and regression.\nAn incorrect step remains incorrect when the agent later recovers or the final verification passes.\nInspect the complete supplied trace data.\nUse the final-verification outcome as evidence about the final state, not as a rule for whether earlier steps were incorrect.\nFor each candidate, inspect the assistant action and its following observation.\nLabel a failed command when the assistant caused it through a wrong action or unsupported hypothesis.\nLabel the later corrective action only when that action is itself wrong.\nDo not label a diagnostic probe merely because it exposes an earlier defect.\nDo not label a redundant but correct read or search; CodeTraceBench scores unuseful steps separately, and this run scores incorrect steps only.\nDo not label a step solely because final verification failed.\nWhen final verification is unavailable, use only directly observed trajectory evidence.\nEmit one finding per incorrect assistant step.\nEach finding's step MUST be the positive integer n from an existing assistant LLM span named step-<n>.\nNever select an EVALUATOR, TOOL, CHAIN, final-verification, benchmark-verification, or message-<n> span.\nBefore emitting a finding, inspect its candidate span's attributes.content and describe only the action shown there.\nWhen the trajectory has no incorrect steps, return an empty findings array.";
347
+ //#endregion
348
+ //#region src/analyst/benchmark-comparison.d.ts
349
+ type AnalystComparisonMetric = 'completion' | 'issueRecall' | 'findingPrecision' | 'f1' | 'criticalStepAccuracy' | 'citationCoverage' | 'citationExcerptCoverage' | 'citationLabelAgreement' | 'citationResolution' | 'trustedNegativeAccuracy' | 'latencyMs' | 'calls' | 'inputTokens' | 'outputTokens' | 'reasoningTokens' | 'cachedTokens' | 'cacheWriteTokens' | 'costUsd';
350
+ interface AnalystMetricComparison {
351
+ metric: AnalystComparisonMetric;
352
+ direction: 'higher' | 'lower';
353
+ /** Trajectories with at least one complete pair for this metric. */
354
+ pairedCases: number;
355
+ /** Independent task or incident groups resampled by the interval. */
356
+ pairedClusters: number;
357
+ /** Same-run pairs where this metric applies before missing values are removed. */
358
+ eligibleObservations: number;
359
+ pairedObservations: number;
360
+ baselineMissingObservations: number;
361
+ candidateMissingObservations: number;
362
+ asymmetricMissingObservations: number;
363
+ survivorOnly: boolean;
364
+ baselineMean: number | null;
365
+ candidateMean: number | null;
366
+ meanDelta: number | null;
367
+ intervalLow: number | null;
368
+ intervalHigh: number | null;
369
+ confidence: number;
370
+ resamples: number;
371
+ minimumSampleMet: boolean;
372
+ populationInferenceEligible: boolean;
373
+ inferenceLimitations: string[];
374
+ }
375
+ interface AnalystRunnerComparison {
376
+ baselineRunnerId: string;
377
+ candidateRunnerId: string;
378
+ metrics: AnalystMetricComparison[];
379
+ }
380
+ declare function compareAnalystRunners(result: AnalystBenchmarkResult, options: {
381
+ baselineRunnerId: string;
382
+ candidateRunnerId: string;
383
+ confidence?: number;
384
+ resamples?: number;
385
+ seed?: number;
386
+ }): AnalystRunnerComparison;
387
+ //#endregion
388
+ //#region src/analyst/benchmark-public-calibration.d.ts
389
+ interface CodeTraceCalibrationRunnerSummary {
390
+ runnerId: string;
391
+ selectedRuns: number;
392
+ positiveRuns: number;
393
+ trustedNegativeRuns: number;
394
+ unlabeledRuns: number;
395
+ failedLabelEmptyRuns: number;
396
+ unknownLabelEmptyRuns: number;
397
+ completedRuns: number;
398
+ failedRuns: number;
399
+ expectedIncorrectSteps: number;
400
+ predictedIncorrectSteps: number;
401
+ matchedIncorrectSteps: number;
402
+ /** CodeTraceBench's published mean per-row incorrect-step F1 over every row. */
403
+ officialAllRowF1: number | null;
404
+ officialAllRowRuns: number;
405
+ precision: number | null;
406
+ recall: number | null;
407
+ f1: number | null;
408
+ trustedNegativeFalsePositiveRate: number | null;
409
+ trustedNegativeFailureRate: number | null;
410
+ unlabeledPredictionRate: number | null;
411
+ unlabeledFailureRate: number | null;
412
+ }
413
+ interface CodeTraceCalibrationSummary {
414
+ protocol: 'labeled-positive-and-solved-negative';
415
+ rationale: string;
416
+ runners: CodeTraceCalibrationRunnerSummary[];
417
+ }
418
+ declare function summarizeCodeTraceCalibration(result: AnalystBenchmarkResult): CodeTraceCalibrationSummary;
419
+ declare function renderCodeTraceCalibrationMarkdown(summary: CodeTraceCalibrationSummary): string;
420
+ //#endregion
421
+ //#region src/analyst/benchmark-command-artifact.d.ts
422
+ interface AnalystBenchmarkArtifact {
423
+ kind: 'agent-eval/analyst-benchmark-result';
424
+ runIdentitySha256: string;
425
+ inputs: {
426
+ dataset: PublicAnalystBenchmarkDataset;
427
+ datasetRevision: string;
428
+ datasetSplit: string;
429
+ labelsSha256: string;
430
+ sourceRowCount: number;
431
+ traceFiles: Array<{
432
+ traceId: string;
433
+ relativePath: string;
434
+ sha256: string;
435
+ }>;
436
+ verificationArtifacts: VerificationArtifactManifest[];
437
+ verificationAvailability: VerificationAvailabilitySummary;
438
+ selection: {
439
+ limit: number;
440
+ seed: number;
441
+ selectedCaseIds: string[];
442
+ report: PublicBenchmarkSelectionReport;
443
+ };
444
+ execution: {
445
+ repetitions: number;
446
+ concurrency: number;
447
+ model: string;
448
+ maxOutputTokens: number;
449
+ timeoutMs: number;
450
+ maxCostUsd: number;
451
+ maxArtifactBytes: number;
452
+ analystProtocolSha256: string;
453
+ implementationSha256: string;
454
+ dependencyLockSha256: string;
455
+ };
456
+ };
457
+ result: AnalystBenchmarkResult;
458
+ comparisons: AnalystRunnerComparison[];
459
+ codeTraceCalibration?: CodeTraceCalibrationSummary;
460
+ agentRxCalibration?: AgentRxCalibrationSummary;
461
+ }
462
+ interface VerificationAvailabilitySummary {
463
+ cases: number;
464
+ resultFilesPresent: number;
465
+ resultFilesMissing: number;
466
+ outcomes: {
467
+ passed: number;
468
+ failed: number;
469
+ unavailable: number;
470
+ };
471
+ }
472
+ interface AnalystBenchmarkRunIdentity {
473
+ config: {
474
+ dataset: PublicAnalystBenchmarkDataset;
475
+ datasetRevision: string;
476
+ datasetSplit: string;
477
+ model: {
478
+ id: string;
479
+ maxOutputTokens: number;
480
+ timeoutMs: number;
481
+ };
482
+ limit: number;
483
+ seed: number;
484
+ concurrency: number;
485
+ repetitions: number;
486
+ maxCostUsd: number;
487
+ maxArtifactBytes: number;
488
+ analystProtocolSha256: string;
489
+ implementationSha256: string;
490
+ dependencyLockSha256: string;
491
+ runnerIds: readonly ['empty', 'model'];
492
+ };
493
+ inputs: {
494
+ labelsSha256: string;
495
+ sourceRowCount: number;
496
+ selectedCaseIds: string[];
497
+ traceFiles: Array<{
498
+ traceId: string;
499
+ relativePath: string;
500
+ sha256: string;
501
+ }>;
502
+ verificationArtifactsSha256: string;
503
+ caseDefinitionsSha256: string;
504
+ };
505
+ }
506
+ interface AnalystBenchmarkRunManifest {
507
+ kind: 'agent-eval/analyst-benchmark-run';
508
+ createdAt: string;
509
+ identitySha256: string;
510
+ localIdentitySha256: string;
511
+ identity: AnalystBenchmarkRunIdentity;
512
+ }
513
+ interface AnalystBenchmarkLocalRunReceipt {
514
+ kind: 'agent-eval/analyst-benchmark-local-run';
515
+ runIdentitySha256: string;
516
+ localIdentitySha256: string;
517
+ local: {
518
+ labelsPath: string;
519
+ traceDir: string;
520
+ artifactDir?: string;
521
+ outputDir: string;
522
+ baseUrl: string;
523
+ apiKeyEnvironment: string;
524
+ };
525
+ command: string;
526
+ environment: {
527
+ node: string;
528
+ platform: string;
529
+ arch: string;
530
+ };
531
+ files: {
532
+ manifest: string;
533
+ observations: string;
534
+ costLedger: string;
535
+ modelResponses: string;
536
+ result: string;
537
+ report: string;
538
+ };
539
+ }
540
+ interface AnalystBenchmarkProgressRow {
541
+ sequence: number;
542
+ runIdentitySha256: string;
543
+ previousRowSha256: string | null;
544
+ observation: AnalystBenchmarkObservation;
545
+ rowSha256: string;
546
+ }
547
+ declare const ANALYST_BENCHMARK_MANIFEST_FILE = "manifest.json";
548
+ declare const ANALYST_BENCHMARK_OBSERVATIONS_FILE = "observations.jsonl";
549
+ declare const ANALYST_BENCHMARK_LOCAL_RECEIPT_FILE = "run.local.json";
550
+ declare const ANALYST_BENCHMARK_COST_LEDGER_FILE = "cost-ledger.jsonl";
551
+ //#endregion
552
+ //#region src/analyst/benchmark-command-result.d.ts
553
+ declare function readAnalystBenchmarkArtifact(path: string): Promise<AnalystBenchmarkArtifact>;
554
+ //#endregion
555
+ //#region src/analyst/benchmark-command.d.ts
556
+ interface AnalystBenchmarkCommandDependencies {
557
+ createModelRunner?: (dataset: PublicAnalystBenchmarkDataset, config: PublicAnalystBenchmarkModelConfig) => AnalystBenchmarkRunner<AnalystRunInputs>;
558
+ }
559
+ interface AnalystBenchmarkCommandConfig {
560
+ dataset: PublicAnalystBenchmarkDataset;
561
+ labelsPath: string;
562
+ traceDir: string;
563
+ artifactDir?: string;
564
+ outDir: string;
565
+ revision: string;
566
+ split: string;
567
+ model: PublicAnalystBenchmarkModelConfig;
568
+ limit: number;
569
+ seed: number;
570
+ concurrency: number;
571
+ repetitions: number;
572
+ maxCostUsd: number;
573
+ maxArtifactBytes: number;
574
+ apiKeyEnv: string;
575
+ command: string;
576
+ resume: boolean;
577
+ }
578
+ declare function runAnalystBenchmarkCommand(argv: readonly string[], env?: NodeJS.ProcessEnv, dependencies?: AnalystBenchmarkCommandDependencies): Promise<number>;
579
+ declare const ANALYST_BENCHMARK_HELP = "agent-eval analyst-benchmark\n\nRun a real-model trace analyst against public AgentRx or CodeTraceBench labels.\n\nRequired:\n --dataset agentrx|codetracebench\n --labels <dataset.json|dataset.jsonl>\n --trace-dir <one-trace-per-file OTLP JSONL directory>\n --artifact-dir <extracted artifact root> Required for CodeTraceBench\n --out <new output directory>\n --revision <full 40- or 64-character hex digest>\n --split <dataset split>\n --base-url <OpenAI-compatible /v1 URL>\n --api-key-env <environment variable containing the bearer>\n --model <provider model id>\n --limit <positive case count>\n\nControls:\n --resume Continue an interrupted run in --out\n --seed <integer> Case-selection and comparison seed. Default: 0\n --concurrency <positive integer> Parallel benchmark jobs. Default: 1\n --repetitions <positive integer> Runs per case and runner. Default: 1\n --max-output-tokens <positive> Model output limit per call. Default: 4096\n --timeout-ms <positive> Model analyst deadline per case. Default: 300000\n --max-cost-usd <positive> Run-wide spend limit. Default: 5\n --max-artifact-bytes <positive> Final evidence bytes per case. Default: 8388608\n\nWrites result.json with every observation, metric, usage field, error, comparison,\ninput digest, artifact digest, case distribution, selected case id, and explicit\nunknown cost. Limited deterministic-hash subsets are marked non-representative.\nCompleted observations are fsynced to observations.jsonl. Shareable output is in\nresult.json and report.md. Machine-local paths, endpoint, and command are isolated\nin run.local.json.\nThe key is read from the named environment variable and is never written.";
580
+ //#endregion
581
+ //#region src/analyst/benchmark-implementation.d.ts
582
+ declare const ANALYST_BENCHMARK_IMPLEMENTATION_DIGEST_ALGORITHM = "sha256-canonical-source-manifest";
583
+ declare const ANALYST_BENCHMARK_DEPENDENCY_LOCK_DIGEST_ALGORITHM = "sha256-canonical-file-manifest";
584
+ declare const ANALYST_BENCHMARK_DEPENDENCY_LOCK_FILES: readonly string[];
585
+ declare const ANALYST_BENCHMARK_DEPENDENCY_LOCK_SHA256 = "d06e3e3f171cc6bd5cf36b14325f507f34b1c6a9d5129ce8a85bf3c1681f8223";
586
+ /** The published benchmark evidence was produced at this package version.
587
+ * A release changes package.json's version field, which is part of the lock
588
+ * manifest but cannot change benchmark behavior, so the evidence stays bound
589
+ * to the digest at its creation. A test proves the current lock differs from
590
+ * the evidence lock by the version stamp alone; any real dependency change
591
+ * still forces a new benchmark run or explicit retirement of the evidence. */
592
+ declare const ANALYST_BENCHMARK_EVIDENCE_PACKAGE_VERSION = "0.137.0";
593
+ declare const ANALYST_BENCHMARK_EVIDENCE_DEPENDENCY_LOCK_SHA256 = "1e03f2daed356d60316aabefb407ec1e437ac94d408d61eea4ae096e9c6fbb5b";
594
+ declare const ANALYST_BENCHMARK_IMPLEMENTATION_FILES: readonly string[];
595
+ declare const ANALYST_BENCHMARK_IMPLEMENTATION_SHA256 = "4dba263b6256a30d56c7fdb2d992d3a953c0035d731f359b704db806f68f75ac";
596
+ declare function analystBenchmarkImplementationDigest(): string;
597
+ declare function analystBenchmarkDependencyLockDigest(): string;
598
+ //#endregion
599
+ //#region src/analyst/benchmark-report.d.ts
600
+ declare function renderAnalystBenchmarkMarkdown(result: AnalystBenchmarkResult, comparisons?: readonly AnalystRunnerComparison[]): string;
601
+ //#endregion
602
+ //#region src/analyst/define.d.ts
603
+ interface DefineTraceAnalystOptions {
604
+ id: string;
605
+ description: string;
606
+ version?: string;
607
+ cost: AnalystCost;
608
+ analyze: Analyst<TraceAnalysisStore>['analyze'];
609
+ }
610
+ interface DefineExactTraceAnalystOptions extends DefineTraceAnalystOptions {
611
+ /** Canonical JSON for behavior knobs not already bound by `version`. */
612
+ executionConfig: Readonly<Record<string, unknown>>;
613
+ }
614
+ /** Define a custom trace analyst without repeating fixed registry fields. */
615
+ declare function defineTraceAnalyst(options: DefineExactTraceAnalystOptions): ExactCapableAnalyst<TraceAnalysisStore>;
616
+ declare function defineTraceAnalyst(options: DefineTraceAnalystOptions): Analyst<TraceAnalysisStore>;
617
+ type TraceAnalystAnalyze = (store: TraceAnalysisStore, context: Parameters<Analyst<TraceAnalysisStore>['analyze']>[1]) => Promise<AnalystFinding[]>;
64
618
  //#endregion
65
619
  //#region src/analyst/parse-tolerant.d.ts
66
620
  /**
@@ -142,7 +696,9 @@ type TraceToolGroupName =
142
696
  /** Discovery + search tools. For pattern-matching across many traces. */
143
697
  'discoveryAndSearch' |
144
698
  /** Discovery + viewSpans + searchSpan. Targeted-span work after another kind narrows down. */
145
- 'targeted';
699
+ 'targeted' |
700
+ /** One known-small trace: overview, bounded reads, and in-trace search. */
701
+ 'singleTrace';
146
702
  /**
147
703
  * Build the tool set for a named group bound to a specific trace store.
148
704
  *
@@ -152,5 +708,5 @@ type TraceToolGroupName =
152
708
  */
153
709
  declare function buildTraceToolsForGroup(group: TraceToolGroupName, store: TraceAnalysisStore): AxFunction[];
154
710
  //#endregion
155
- export { ANALYST_SEVERITIES, type Analyst, type AnalystContext, type AnalystCost, type AnalystFinding, type AnalystHooks, type AnalystInputKind, AnalystRegistry, type AnalystRegistryOptions, type AnalystRequirements, type AnalystRunEvent, type AnalystRunInputs, type AnalystRunResult, type AnalystRunSummary, type AnalystSeverity, type AnalystUsageReceipt, type BudgetPolicy, type ChatCallOpts, type ChatClient, type ChatRequest, type ChatResponse, type ChatTransport, type CliBridgeTransportOpts, type CreateAnalystAiConfig, type CreateChatClientOpts, type CreateTraceAnalystKindOpts, type CustomTransportOpts, DEFAULT_TRACE_ANALYST_KINDS, type DefaultAnalystRegistryOptions, type DiffPolicy, type DirectProviderTransportOpts, type EvidenceRef, FAILURE_MODE_KIND_SPEC, FINDING_SUBJECT_GRAMMAR_PROMPT, FINDING_SUBJECT_KINDS, FINDING_SUBJECT_SYNTAX, type FindingSubject, type FindingSubjectKind, FindingSubjectStringSchema, type FindingsDiff, FindingsStore, IMPROVEMENT_KIND_SPEC, type JudgeAdapterOpts, KIND_EXPECTED_SUBJECTS, KNOWLEDGE_GAP_KIND_SPEC, KNOWLEDGE_POISONING_KIND_SPEC, type MockTransportOpts, type PersistedFinding, type ProposalFinding, type ProposalFindingOrigin, RAW_FINDING_SCHEMA_PROMPT, type RawAnalystEvidence, RawAnalystEvidenceSchema, type RawAnalystFinding, RawAnalystFindingSchema, type RegistryRunOpts, type RouterTransportOpts, type RunCriticAdapterOpts, SKILL_USAGE_ANALYST, type SandboxSdkTransportOpts, type SemanticConceptJudgeAdapterOpts, SkillUsageAnalyst, type SkillUsageRecord, type SkillUsageReport, type SkillUsageScanConfig, type StructureFindingsOptions, type StructureFindingsResult, type TraceAnalystGolden, type TraceAnalystKindSpec, type TraceToolGroupName, type VerifierAdapterOpts, assertProposalFindings, behavioralAnalyst, buildDefaultAnalystRegistry, buildSkillUsageReport, buildTraceToolsForGroup, coerceJson, coerceToFindingRows, computeFindingId, createAnalystAi, createChatClient, createJudgeAdapter, createRunCriticAdapter, createSemanticConceptJudgeAdapter, createTraceAnalystKind, createVerifierAdapter, defaultIsMaterial, deriveEfficiencyFindings, diffFindings, emitSkillUsageFindings, evidenceRefsFromRawFinding, findingSubjectGrammarPromptFor, isProposalFinding, liftSeverity, makeFinding, makeProposalFinding, parseFindingSubject, parseRawFinding, renderFindingSubject, renderPriorFindings, renderUpstreamFindings, stripCodeFences, structureFindings };
711
+ export { AGENT_RX_UPSTREAM_REVISION, ANALYST_BENCHMARK_COST_LEDGER_FILE, ANALYST_BENCHMARK_DEPENDENCY_LOCK_DIGEST_ALGORITHM, ANALYST_BENCHMARK_DEPENDENCY_LOCK_FILES, ANALYST_BENCHMARK_DEPENDENCY_LOCK_SHA256, ANALYST_BENCHMARK_EVIDENCE_DEPENDENCY_LOCK_SHA256, ANALYST_BENCHMARK_EVIDENCE_PACKAGE_VERSION, ANALYST_BENCHMARK_HELP, ANALYST_BENCHMARK_IMPLEMENTATION_DIGEST_ALGORITHM, ANALYST_BENCHMARK_IMPLEMENTATION_FILES, ANALYST_BENCHMARK_IMPLEMENTATION_SHA256, ANALYST_BENCHMARK_LOCAL_RECEIPT_FILE, ANALYST_BENCHMARK_MANIFEST_FILE, ANALYST_BENCHMARK_OBSERVATIONS_FILE, ANALYST_SEVERITIES, type AgentRxBenchmarkCaseOptions, type AgentRxCalibrationRunnerSummary, type AgentRxCalibrationSummary, type AgentRxFailure, type AgentRxPrediction, type AgentRxPredictionReport, type AgentRxRow, type Analyst, type AnalystBenchmarkArtifact, type AnalystBenchmarkCase, type AnalystBenchmarkCommandConfig, type AnalystBenchmarkCommandDependencies, type AnalystBenchmarkDatasetRef, type AnalystBenchmarkDescriptor, type AnalystBenchmarkError, type AnalystBenchmarkLabelState, type AnalystBenchmarkLocalRunReceipt, type AnalystBenchmarkObservation, type AnalystBenchmarkOutput, type AnalystBenchmarkProgressRow, type AnalystBenchmarkProvenance, type AnalystBenchmarkResult, type AnalystBenchmarkRunIdentity, type AnalystBenchmarkRunManifest, type AnalystBenchmarkRunner, type AnalystBenchmarkSummary, type AnalystComparisonMetric, type AnalystContext, type AnalystCost, type AnalystEvidenceExpectation, type AnalystEvidenceResolution, type AnalystEvidenceResolutionError, type AnalystEvidenceResolver, type AnalystFinding, type AnalystFindingScore, type AnalystHooks, type AnalystInputKind, type AnalystIssueExpectation, type AnalystLatencyDistribution, type AnalystMetricComparison, AnalystRegistry, type AnalystRegistryOptions, type AnalystRequirements, type AnalystRunEvent, type AnalystRunInputs, type AnalystRunResult, type AnalystRunSummary, type AnalystRunnerComparison, type AnalystSeverity, type AnalystUsageReceipt, type BehavioralAnalystOptions, type BudgetPolicy, CODE_TRACE_BENCH_ANALYST_PROMPT, CONTROL_INTEGRITY_ANALYST, type ChatCallOpts, type ChatClient, type ChatRequest, type ChatResponse, type ChatTransport, type CliBridgeTransportOpts, type CodeTraceBenchCaseOptions, type CodeTraceBenchLabelOptions, type CodeTraceBenchLabelSet, type CodeTraceBenchRow, type CodeTraceCalibrationRunnerSummary, type CodeTraceCalibrationSummary, type CodeTraceStageAnnotation, type CodeTracerLabelGroup, type CodeTracerPredictionAdapterOptions, type CodeTracerPredictions, type CodeTracerStepLabel, ControlIntegrityAnalyst, type CreateAnalystAiConfig, type CreateChatClientOpts, type CreateTraceAnalystKindOpts, type CustomTransportOpts, DEFAULT_MAX_VERIFICATION_ARTIFACT_BYTES, DEFAULT_TRACE_ANALYST_KINDS, type DefaultAnalystRegistryOptions, type DefineExactTraceAnalystOptions, type DefineTraceAnalystOptions, type DiffPolicy, type DirectProviderTransportOpts, type EvidenceRef, type ExactAnalystBudgetPolicy, type ExactAnalystBudgetSnapshot, type ExactAnalystExecutionPlanSnapshot, type ExactAnalystRunCompletion, type ExactAnalystRunEvent, ExactAnalystRunExecutionError, type ExactAnalystRunPolicySnapshot, type ExactAnalystRunResult, type ExactAnalystRunSummary, type ExactAnalystSnapshot, type ExactCapableAnalyst, type ExactExecutionComponentIdentity, type ExactExecutionComponentSnapshot, type ExactRegistryRunOpts, FAILURE_MODE_KIND_SPEC, FINDING_SUBJECT_GRAMMAR_PROMPT, FINDING_SUBJECT_KINDS, FINDING_SUBJECT_SYNTAX, type FindingSubject, type FindingSubjectKind, FindingSubjectStringSchema, type FindingsDiff, FindingsStore, IMPROVEMENT_KIND_SPEC, type JudgeAdapterOpts, KIND_EXPECTED_SUBJECTS, KNOWLEDGE_GAP_KIND_SPEC, KNOWLEDGE_POISONING_KIND_SPEC, type LoadedVerificationArtifacts, type MockTransportOpts, type PersistedFinding, type PreparedPublicAnalystBenchmark, type ProposalFinding, type ProposalFindingOrigin, type PublicAnalystBenchmarkDataset, type PublicAnalystBenchmarkModelConfig, type PublicBenchmarkDistributions, type PublicBenchmarkSelectionReport, type PublicBenchmarkValueDistribution, RAW_FINDING_SCHEMA_PROMPT, type RawAnalystEvidence, RawAnalystEvidenceSchema, type RawAnalystFinding, RawAnalystFindingSchema, type RegistryRunOpts, type RouterTransportOpts, type RunAnalystBenchmarkOptions, type RunCriticAdapterOpts, SKILL_USAGE_ANALYST, type SandboxSdkTransportOpts, type SemanticConceptJudgeAdapterOpts, SkillUsageAnalyst, type SkillUsageRecord, type SkillUsageReport, type SkillUsageScanConfig, type StepLabelAdapterOptions, type StructureFindingsOptions, type StructureFindingsResult, type TraceAnalystAnalyze, type TraceAnalystKindSpec, type TraceToolGroupName, type UpstreamPredictionAdapterOptions, type VerificationArtifactFile, type VerificationArtifactManifest, type VerificationArtifactRole, type VerificationAvailabilitySummary, type VerificationOutcome, type VerificationOutcomeSource, type VerificationOutcomeStatus, type VerificationResultFile, type VerifierAdapterOpts, adaptPublicBenchmarkFindings, agentRxBenchmarkCase, agentRxPredictionsToFindings, analystBenchmarkDependencyLockDigest, analystBenchmarkImplementationDigest, appendVerificationArtifactsToOtlp, assertExactRegistryRunOpts, assertProposalFindings, behavioralAnalyst, buildDefaultAnalystRegistry, buildSkillUsageReport, buildTraceToolsForGroup, codeTraceBenchCase, codeTracerPredictionsToFindings, coerceJson, coerceToFindingRows, compareAnalystRunners, computeFindingId, createAnalystAi, createChatClient, createJudgeAdapter, createPublicBenchmarkModelRunner, createRunCriticAdapter, createSemanticConceptJudgeAdapter, createTraceAnalystKind, createVerifierAdapter, defaultIsMaterial, defineTraceAnalyst, deriveEfficiencyFindings, diffFindings, emitControlIntegrityFindings, emitSkillUsageFindings, emptyPublicBenchmarkRunner, evidenceRefsFromRawFinding, findingSubjectGrammarPromptFor, isProposalFinding, liftSeverity, loadCodeTraceVerificationArtifacts, loadPublicBenchmarkRows, makeFinding, makeProposalFinding, normalizeAgentRxCategory, normalizeBenchmarkLabel, parseFindingSubject, parseRawFinding, parseVerificationOutcome, preparePublicAnalystBenchmark, publicBenchmarkDistributions, publicBenchmarkProtocolSha256, publicBenchmarkSelectionReport, readAnalystBenchmarkArtifact, registryBenchmarkRunner, renderAgentRxCalibrationMarkdown, renderAnalystBenchmarkMarkdown, renderCodeTraceCalibrationMarkdown, renderFindingSubject, renderPriorFindings, renderUpstreamFindings, roundAgentRxStep, runAnalystBenchmark, runAnalystBenchmarkCommand, scoreAnalystFindings, selectPublicBenchmarkRows, stripCodeFences, structureFindings, summarizeAgentRxCalibration, summarizeCodeTraceCalibration, traceStoreEvidenceResolver };
156
712
  //# sourceMappingURL=index.d.ts.map
@@ -1 +1 @@
1
- {"version":3,"file":"index.d.ts","names":[],"sources":["../../src/analyst/adapters.ts","../../src/analyst/behavioral-analyst.ts","../../src/analyst/parse-tolerant.ts","../../src/analyst/proposal-findings.ts","../../src/analyst/structure-findings.ts","../../src/analyst/tool-groups.ts"],"mappings":";;;;;;;;;;iBA4CgB,aAAa,GAAG,WAAgB;UAe/B,oBAAoB;EACnC;EACA;EACA,UAAU,mBAAmB;;;;;EAK7B,UAAU,KAAK,cAAc;;iBAGf,sBAAsB,KAAK,MAAM,oBAAoB,OAAO,QAAQ;UAwEnE;EACf;EACA;EACA,SAAS;;EAET;;iBAGc,uBAAuB,OAAM,uBAA4B,QAAQ;UAiEhE;EACf;EACA;EACA,OAAO;;EAEP,MAAM;;EAEN,OAAO;;EAEP;;iBAGc,mBAAmB,MAAM,mBAAmB,QAAQ;UAiDnD;EACf;EACA;;EAEA,UAAU,KAAK;;EAEf;;iBAGc,kCACd,OAAM,kCACL,QAAQ;;;;;;;iBC5OK,yBACd,SAAS,mBACT;EAAQ;EAAoB;IAC3B;;iBAkCa,qBAAqB,QAAQ;;;;;;;;;;;;;;;iBC3E7B,gBAAgB;;;;;iBAgBhB,WAAW;;;;;;;iBAeX,oBAAoB;;;;iBCXpB,kBAAkB,mBAAmB,WAAW;;;;;;iBAShD,uBACd,mBACA,mBACC,cAAc;;;UCXA;;EAEf;EACA;;EAEA;EACA;EACA;EACA;;EAEA,aAAa;EACb;EACA,WAAW;EACX;EACA,SAAS;;EAET;;EAEA,cAAc,KAAK,sBAAsB;;EAEzC,kBAAkB;;EAElB,YAAY;;UAGG;EACf,UAAU;EACV;;iBAuCoB,kBACpB,MAAM,2BACL,QAAQ;;;;KCrFC;;;;;;;;;;;;;;;;;;iBAuCI,wBACd,OAAO,oBACP,OAAO,qBACN"}
1
+ {"version":3,"file":"index.d.ts","names":[],"sources":["../../src/analyst/adapters.ts","../../src/analyst/benchmark-agentrx-calibration.ts","../../src/analyst/benchmark-dataset-types.ts","../../src/analyst/benchmark-dataset-agentrx.ts","../../src/analyst/benchmark-dataset-codetrace.ts","../../src/analyst/benchmark-dataset-utils.ts","../../src/analyst/benchmark-verification-outcome.ts","../../src/analyst/benchmark-verification-artifacts.ts","../../src/analyst/benchmark-public-types.ts","../../src/analyst/benchmark-public-adapters.ts","../../src/analyst/benchmark-public-data.ts","../../src/analyst/benchmark-public-model.ts","../../src/analyst/benchmark-comparison.ts","../../src/analyst/benchmark-public-calibration.ts","../../src/analyst/benchmark-command-artifact.ts","../../src/analyst/benchmark-command-result.ts","../../src/analyst/benchmark-command.ts","../../src/analyst/benchmark-implementation.ts","../../src/analyst/benchmark-report.ts","../../src/analyst/define.ts","../../src/analyst/parse-tolerant.ts","../../src/analyst/proposal-findings.ts","../../src/analyst/structure-findings.ts","../../src/analyst/tool-groups.ts"],"mappings":";;;;;;;;;;;iBA4CgB,aAAa,GAAG,WAAgB;UAe/B,oBAAoB;EACnC;EACA;EACA,UAAU,mBAAmB;;;;;EAK7B,UAAU,KAAK,cAAc;;iBAGf,sBAAsB,KAAK,MAAM,oBAAoB,OAAO,QAAQ;UAwEnE;EACf;EACA;EACA,SAAS;;EAET;;iBAGc,uBAAuB,OAAM,uBAA4B,QAAQ;UAiEhE;EACf;EACA;EACA,OAAO;;EAEP,MAAM;;EAEN,OAAO;;EAEP;;iBAGc,mBAAmB,MAAM,mBAAmB,QAAQ;UAiDnD;EACf;EACA;;EAEA,UAAU,KAAK;;EAEf;;iBAGc,kCACd,OAAM,kCACL,QAAQ;;;cC5RE;UAEI;EACf;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;;UAGe;EACf;EACA;EACA;EACA,SAAS;;iBAGK,4BACd,QAAQ,wBACR,2BACC;iBAkBa,iCAAiC,SAAS;;;KCtD9C;UAEK;EACf,YAAY;EACZ;EACA;EACA;EACA;EACA;;UAGe;EACf,eAAe;EACf,mBAAmB;EACnB;IAAe,YAAY;IAAY;;EACvC,wBAAwB;EACxB;EACA;EACA;;UAGe;EACf,UAAU;EACV;EACA;EACA;EACA;;UAGe;EACf,UAAU;EACV,mBAAmB;EACnB;EACA;EACA;EACA;EACA;;UAGe;EACf;EACA;EACA;EACA;;UAGe;EACf;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;;UAGe;EACf;EACA;EACA;EACA,iBAAiB;;KAGP,0CAEC,sCACA,iCACA;UAEI;EACf;EACA;EACA;EACA;;EAEA;EACA;EACA;EACA;EACA;EACA;EACA,oCAAoC;;UAGrB;EACf,eAAe;EACf,WAAW,sBAAsB;;KAGvB;UAEK;;;;;EAKf,WAAW;;UAGI,kCACP,yBACN;UAEa,oCAAoC;EACnD;;EAEA;;UAGe,yCAAyC;EACxD;EACA;EACA;EACA;;UAGe,2CACP,kCACN;;;iBCtGY,qBAAqB,QACnC,KAAK,YACL,OAAO,QACP,UAAS,8BACR,qBAAqB;;iBAoGR,6BACd,mBAAmB,YACnB,iBACA,UAAS,mCACR;iBA6Ea,yBAAyB;;iBAoNzB,iBAAiB;;;iBC7YjB,mBAAmB,QACjC,KAAK,mBACL,OAAO,QACP,UAAS,4BACR,qBAAqB;;iBAwFR,gCACd,2BACA,aAAa,uBACb,UAAS,qCACR;;;iBClHa,wBAAwB;;;KCA5B;UAEK;EACf;EACA;EACA,QAAQ;;UAGO;EACf,QAAQ;EACR;EAKA;IAAe;IAAe;;EAC9B,SAAS;EACT;EACA;EACA;EACA;;UAGe;EACf;EACA;;iBA8Ec,yBACd,gBAAgB,2BACf;;;cChGU;KAED;UAEK;EACf,MAAM;EACN;EACA;EACA;EACA;EACA;;UAGe;EACf;EACA;EACA,SAAS;EACT;EACA;EACA;EACA;EACA;EACA,OAAO;EACP,cAAc;EACd,UAAU,OAAO;;UAGF;EACf,UAAU;EACV,SAAS;EACT,OAAO,MAAM;IAA6B;;;iBAatB,mCAAmC;EACvD;EACA,KAAK;EACL;IACE,QAAQ;iBAwHI,kCACd,kBACA,iBACA,WAAW,6BACX;;;KCjLU;UAEK;EACf;EACA;EACA;EACA;EACA;EACA,aAAa;EACb;IACE;IACA;;;EAGF,mBAAmB;;UAGJ;EACf,OAAO,qBAAqB;EAC5B;EACA;EACA;EACA,YAAY;IACV;IACA;IACA;;EAEF,uBAAuB;EACvB,WAAW;;UAGI;EACf;EACA;EACA,QAAQ;;UAGO;EACf,OAAO;EACP,OAAO;EACP,OAAO;EACP,YAAY;EACZ,QAAQ;;UAGO;EACf;EACA;EACA;EACA;EACA;EACA;EACA,QAAQ;EACR,UAAU;;;;iBChDI,8BAA8B,uBAAuB;iBAiBrD,6BACd,SAAS,+BACT,sBACA,mBAAmB,kBACnB,oBACC;;;iBCgBmB,wBACpB,eACC,QAAQ,MAAM;iBA2BD,0BACd,SAAS,+BACT,eAAe,2BACf;EAAW;EAAe;IACzB,MAAM;iBAwBO,6BACd,SAAS,+BACT,eAAe,4BACd;iBAyCa,+BACd,SAAS,+BACT,iBAAiB,2BACjB,mBAAmB,2BACnB,eACC;iBAcmB,8BAA8B;EAClD,SAAS;EACT;EACA;EACA;EACA;EACA;EACA;IACE,QAAQ;;;iBC9HI,iCACd,SAAS,+BACT,QAAQ,oCACP,uBAAuB;iBAofV,8BAA8B,SAAS;cAoE1C;;;KC1mBD;UAoBK;EACf,QAAQ;EACR;;EAEA;;EAEA;;EAEA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;;UAGe;EACf;EACA;EACA,SAAS;;iBASK,sBACd,QAAQ,wBACR;EACE;EACA;EACA;EACA;EACA;IAED;;;UCnEc;EACf;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;;EAEA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;;UAGe;EACf;EACA;EACA,SAAS;;iBAGK,8BACd,QAAQ,yBACP;iBAca,mCAAmC,SAAS;;;UCrC3C;EACf;EACA;EACA;IACE,SAAS;IACT;IACA;IACA;IACA;IACA,YAAY;MAAQ;MAAiB;MAAsB;;IAC3D,uBAAuB;IACvB,0BAA0B;IAC1B;MACE;MACA;MACA;MACA,QAAQ;;IAEV;MACE;MACA;MACA;MACA;MACA;MACA;MACA;MACA;MACA;MACA;;;EAGJ,QAAQ;EACR,aAAa;EACb,uBAAuB;EACvB,qBAAqB;;UAGN;EACf;EACA;EACA;EACA;IACE;IACA;IACA;;;UAIa;EACf;IACE,SAAS;IACT;IACA;IACA;MACE;MACA;MACA;;IAEF;IACA;IACA;IACA;IACA;IACA;IACA;IACA;IACA;IACA;;EAEF;IACE;IACA;IACA;IACA,YAAY;MAAQ;MAAiB;MAAsB;;IAC3D;IACA;;;UAIa;EACf;EACA;EACA;EACA;EACA,UAAU;;UAGK;EACf;EACA;EACA;EACA;IACE;IACA;IACA;IACA;IACA;IACA;;EAEF;EACA;IACE;IACA;IACA;;EAEF;IACE;IACA;IACA;IACA;IACA;IACA;;;UAIa;EACf;EACA;EACA;EACA,aAAa;EACb;;cAGW;cACA;cACA;cACA;;;iBCxHS,6BACpB,eACC,QAAQ;;;UCyDM;EACf,qBACE,SAAS,+BACT,QAAQ,sCACL,uBAAuB;;UAGb;EACf,SAAS;EACT;EACA;EACA;EACA;EACA;EACA;EACA,OAAO;EACP;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;;iBAKoB,2BACpB,yBACA,MAAK,OAAO,YACZ,eAAc,sCACb;cA8QU;;;cC7XA;cAEA;cAEA;cAKA;;;;;;;cASA;cAEA;cAGA;cAgEA;iBAGG;iBAIA;;;iBC3FA,+BACd,QAAQ,wBACR,uBAAsB;;;UCDP;EACf;EACA;EACA;EACA,MAAM;EACN,SAAS,QAAQ;;UAGF,uCAAuC;;EAEtD,iBAAiB,SAAS;;;iBAIZ,mBACd,SAAS,iCACR,oBAAoB;iBACP,mBAAmB,SAAS,4BAA4B,QAAQ;KA8BpE,uBACV,OAAO,oBACP,SAAS,WAAW,QAAQ,uCACzB,QAAQ;;;;;;;;;;;;;;;iBCzCG,gBAAgB;;;;;iBAgBhB,WAAW;;;;;;;iBAeX,oBAAoB;;;;iBCXpB,kBAAkB,mBAAmB,WAAW;;;;;;iBAShD,uBACd,mBACA,mBACC,cAAc;;;UCXA;;EAEf;EACA;;EAEA;EACA;EACA;EACA;;EAEA,aAAa;EACb;EACA,WAAW;EACX;EACA,SAAS;;EAET;;EAEA,cAAc,KAAK,sBAAsB;;EAEzC,kBAAkB;;EAElB,YAAY;;UAGG;EACf,UAAU;EACV;;iBAuCoB,kBACpB,MAAM,2BACL,QAAQ;;;;KCrFC;;;;;;;;;;;;;;;;;;;;iBAgDI,wBACd,OAAO,oBACP,OAAO,qBACN"}