@tangle-network/agent-eval 0.129.0 → 0.130.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (427) hide show
  1. package/CHANGELOG.md +14 -0
  2. package/README.md +1 -0
  3. package/dist/active-curriculum-C4mk67HP.js +214 -0
  4. package/dist/active-curriculum-C4mk67HP.js.map +1 -0
  5. package/dist/adversarial-smnADNFS.d.ts +21 -0
  6. package/dist/adversarial-smnADNFS.d.ts.map +1 -0
  7. package/dist/analyst/index.d.ts +81 -2872
  8. package/dist/analyst/index.d.ts.map +1 -0
  9. package/dist/analyst/index.js +319 -360
  10. package/dist/analyst/index.js.map +1 -1
  11. package/dist/analyst-BkTS3C58.d.ts +89 -0
  12. package/dist/analyst-BkTS3C58.d.ts.map +1 -0
  13. package/dist/analyst-LsnNpSkm.js +152 -0
  14. package/dist/analyst-LsnNpSkm.js.map +1 -0
  15. package/dist/analyze-runs-C1CavBMk.js +1067 -0
  16. package/dist/analyze-runs-C1CavBMk.js.map +1 -0
  17. package/dist/analyze-runs-FsgYCinh.d.ts +72 -0
  18. package/dist/analyze-runs-FsgYCinh.d.ts.map +1 -0
  19. package/dist/attribute-vocabulary-DLJ6303h.d.ts +54 -0
  20. package/dist/attribute-vocabulary-DLJ6303h.d.ts.map +1 -0
  21. package/dist/authenticity/index.d.ts +81 -79
  22. package/dist/authenticity/index.d.ts.map +1 -0
  23. package/dist/authenticity/index.js +209 -193
  24. package/dist/authenticity/index.js.map +1 -1
  25. package/dist/baseline-HsBvw_dk.js +550 -0
  26. package/dist/baseline-HsBvw_dk.js.map +1 -0
  27. package/dist/baseline-hG3K85h4.d.ts +125 -0
  28. package/dist/baseline-hG3K85h4.d.ts.map +1 -0
  29. package/dist/belief-state/index.d.ts +448 -1188
  30. package/dist/belief-state/index.d.ts.map +1 -0
  31. package/dist/belief-state/index.js +1617 -1709
  32. package/dist/belief-state/index.js.map +1 -1
  33. package/dist/benchmarks/index.d.ts +2 -891
  34. package/dist/benchmarks/index.js +2 -60
  35. package/dist/benchmarks-DviOvUNr.js +754 -0
  36. package/dist/benchmarks-DviOvUNr.js.map +1 -0
  37. package/dist/builder-eval/index.d.ts +150 -662
  38. package/dist/builder-eval/index.d.ts.map +1 -0
  39. package/dist/builder-eval/index.js +356 -345
  40. package/dist/builder-eval/index.js.map +1 -1
  41. package/dist/calibration-CNWWA6K8.js +94 -0
  42. package/dist/calibration-CNWWA6K8.js.map +1 -0
  43. package/dist/campaign/index.d.ts +5 -6381
  44. package/dist/campaign/index.js +3 -213
  45. package/dist/campaign-CBKZvQ1H.js +3885 -0
  46. package/dist/campaign-CBKZvQ1H.js.map +1 -0
  47. package/dist/cli.d.ts +1 -1
  48. package/dist/cli.js +164 -175
  49. package/dist/cli.js.map +1 -1
  50. package/dist/client-C97NMzqi.d.ts +581 -0
  51. package/dist/client-C97NMzqi.d.ts.map +1 -0
  52. package/dist/client-CYzbdJOZ.js +637 -0
  53. package/dist/client-CYzbdJOZ.js.map +1 -0
  54. package/dist/code-agent-session-BjkMTQ7H.js +1390 -0
  55. package/dist/code-agent-session-BjkMTQ7H.js.map +1 -0
  56. package/dist/code-agent-session-DqqgOJaz.d.ts +143 -0
  57. package/dist/code-agent-session-DqqgOJaz.d.ts.map +1 -0
  58. package/dist/concurrency-DIxRZF_J.js +85 -0
  59. package/dist/concurrency-DIxRZF_J.js.map +1 -0
  60. package/dist/contract/index.d.ts +645 -5565
  61. package/dist/contract/index.d.ts.map +1 -0
  62. package/dist/contract/index.js +1730 -1938
  63. package/dist/contract/index.js.map +1 -1
  64. package/dist/control.d.ts +3 -1030
  65. package/dist/control.js +2 -33
  66. package/dist/cost-ledger-DIgQUFZZ.js +801 -0
  67. package/dist/cost-ledger-DIgQUFZZ.js.map +1 -0
  68. package/dist/cost-ledger-Dye6jCgg.d.ts +236 -0
  69. package/dist/cost-ledger-Dye6jCgg.d.ts.map +1 -0
  70. package/dist/dataset-BvtnC8Dc.d.ts +115 -0
  71. package/dist/dataset-BvtnC8Dc.d.ts.map +1 -0
  72. package/dist/default-registry-C-vFCSEc.js +2579 -0
  73. package/dist/default-registry-C-vFCSEc.js.map +1 -0
  74. package/dist/default-registry-CNPo-Vsb.d.ts +540 -0
  75. package/dist/default-registry-CNPo-Vsb.d.ts.map +1 -0
  76. package/dist/emitter-CPBAhxum.js +266 -0
  77. package/dist/emitter-CPBAhxum.js.map +1 -0
  78. package/dist/emitter-DGQGoLyj.d.ts +113 -0
  79. package/dist/emitter-DGQGoLyj.d.ts.map +1 -0
  80. package/dist/errors-8YnH8WlF.js +64 -0
  81. package/dist/errors-8YnH8WlF.js.map +1 -0
  82. package/dist/errors-CEk209JS.d.ts +76 -0
  83. package/dist/errors-CEk209JS.d.ts.map +1 -0
  84. package/dist/eval-campaign-DEm6c8ru.js +349 -0
  85. package/dist/eval-campaign-DEm6c8ru.js.map +1 -0
  86. package/dist/execution-tracks-CpgFPpS5.js +93 -0
  87. package/dist/execution-tracks-CpgFPpS5.js.map +1 -0
  88. package/dist/exporters-q9iL-2Jf.js +148 -0
  89. package/dist/exporters-q9iL-2Jf.js.map +1 -0
  90. package/dist/extract-usage-BrQ8mCLX.js +155 -0
  91. package/dist/extract-usage-BrQ8mCLX.js.map +1 -0
  92. package/dist/failure-cluster-CqcvCcdR.d.ts +59 -0
  93. package/dist/failure-cluster-CqcvCcdR.d.ts.map +1 -0
  94. package/dist/feedback-trajectory-CVaeREXV.d.ts +340 -0
  95. package/dist/feedback-trajectory-CVaeREXV.d.ts.map +1 -0
  96. package/dist/fuzz.d.ts +320 -646
  97. package/dist/fuzz.d.ts.map +1 -0
  98. package/dist/fuzz.js +670 -618
  99. package/dist/fuzz.js.map +1 -1
  100. package/dist/hf-dataset-DBJXXoY1.js +763 -0
  101. package/dist/hf-dataset-DBJXXoY1.js.map +1 -0
  102. package/dist/hosted/index.d.ts +11 -831
  103. package/dist/hosted/index.d.ts.map +1 -0
  104. package/dist/hosted/index.js +2 -37
  105. package/dist/index-2JJSA6-r2.d.ts +926 -0
  106. package/dist/index-2JJSA6-r2.d.ts.map +1 -0
  107. package/dist/index-6N0aYmpW.d.ts +217 -0
  108. package/dist/index-6N0aYmpW.d.ts.map +1 -0
  109. package/dist/index-BAvgST_9.d.ts +131 -0
  110. package/dist/index-BAvgST_9.d.ts.map +1 -0
  111. package/dist/index-BvnJuTGD.d.ts +68 -0
  112. package/dist/index-BvnJuTGD.d.ts.map +1 -0
  113. package/dist/index-C61Wi7yg.d.ts +547 -0
  114. package/dist/index-C61Wi7yg.d.ts.map +1 -0
  115. package/dist/index-CAPUUKaM.d.ts +335 -0
  116. package/dist/index-CAPUUKaM.d.ts.map +1 -0
  117. package/dist/index-DE5fb3EC.d.ts +2244 -0
  118. package/dist/index-DE5fb3EC.d.ts.map +1 -0
  119. package/dist/index-DSC51roc.d.ts +102 -0
  120. package/dist/index-DSC51roc.d.ts.map +1 -0
  121. package/dist/index.d.ts +3755 -15555
  122. package/dist/index.d.ts.map +1 -0
  123. package/dist/index.js +11182 -11216
  124. package/dist/index.js.map +1 -1
  125. package/dist/integrity-BzRbCHzi.js +424 -0
  126. package/dist/integrity-BzRbCHzi.js.map +1 -0
  127. package/dist/integrity-rmVhXWA7.d.ts +61 -0
  128. package/dist/integrity-rmVhXWA7.d.ts.map +1 -0
  129. package/dist/judge-calibration-DFtEMlde.d.ts +146 -0
  130. package/dist/judge-calibration-DFtEMlde.d.ts.map +1 -0
  131. package/dist/ledger-core/index.d.ts +2 -0
  132. package/dist/ledger-core/index.js +2 -0
  133. package/dist/ledger-core-DtZz1RG0.js +388 -0
  134. package/dist/ledger-core-DtZz1RG0.js.map +1 -0
  135. package/dist/llm-client--GR4JbZE.js +687 -0
  136. package/dist/llm-client--GR4JbZE.js.map +1 -0
  137. package/dist/llm-client-B_nIBlYo.d.ts +290 -0
  138. package/dist/llm-client-B_nIBlYo.d.ts.map +1 -0
  139. package/dist/matrix/index.d.ts +3 -155
  140. package/dist/matrix/index.js +2 -8
  141. package/dist/matrix-BzQnu2S6.js +270 -0
  142. package/dist/matrix-BzQnu2S6.js.map +1 -0
  143. package/dist/meta-eval/index.d.ts +4 -1027
  144. package/dist/meta-eval/index.js +393 -390
  145. package/dist/meta-eval/index.js.map +1 -1
  146. package/dist/metrics-C9YY1OcL.js +239 -0
  147. package/dist/metrics-C9YY1OcL.js.map +1 -0
  148. package/dist/mint-yN2M2eh0.js +201 -0
  149. package/dist/mint-yN2M2eh0.js.map +1 -0
  150. package/dist/multi-layer-verifier-BHY1gWAc.d.ts +138 -0
  151. package/dist/multi-layer-verifier-BHY1gWAc.d.ts.map +1 -0
  152. package/dist/multishot/index.d.ts +273 -480
  153. package/dist/multishot/index.d.ts.map +1 -0
  154. package/dist/multishot/index.js +595 -548
  155. package/dist/multishot/index.js.map +1 -1
  156. package/dist/off-policy-DvgzvtIx.js +220 -0
  157. package/dist/off-policy-DvgzvtIx.js.map +1 -0
  158. package/dist/off-policy-mskQw8Mb.d.ts +153 -0
  159. package/dist/off-policy-mskQw8Mb.d.ts.map +1 -0
  160. package/dist/openapi.json +1 -1
  161. package/dist/opencode-sqlite-BGrHeDu3.js +318 -0
  162. package/dist/opencode-sqlite-BGrHeDu3.js.map +1 -0
  163. package/dist/outcome-store-BYHIuO0e.d.ts +65 -0
  164. package/dist/outcome-store-BYHIuO0e.d.ts.map +1 -0
  165. package/dist/outcome-store-ChBKlTd_.js +75 -0
  166. package/dist/outcome-store-ChBKlTd_.js.map +1 -0
  167. package/dist/paired-arms-D9D0wXj2.js +260 -0
  168. package/dist/paired-arms-D9D0wXj2.js.map +1 -0
  169. package/dist/pipelines/index.d.ts +95 -532
  170. package/dist/pipelines/index.d.ts.map +1 -0
  171. package/dist/pipelines/index.js +497 -478
  172. package/dist/pipelines/index.js.map +1 -1
  173. package/dist/pre-registration-DakwTRXk.js +96 -0
  174. package/dist/pre-registration-DakwTRXk.js.map +1 -0
  175. package/dist/propose-review-control-LhIWGzHl.js +1458 -0
  176. package/dist/propose-review-control-LhIWGzHl.js.map +1 -0
  177. package/dist/query-CJ_DX8vl.d.ts +28 -0
  178. package/dist/query-CJ_DX8vl.d.ts.map +1 -0
  179. package/dist/query-Di7eEQ79.js +83 -0
  180. package/dist/query-Di7eEQ79.js.map +1 -0
  181. package/dist/raw-provider-sink-BQd7mzyT.js +201 -0
  182. package/dist/raw-provider-sink-BQd7mzyT.js.map +1 -0
  183. package/dist/raw-provider-sink-BU29Sh8h.d.ts +134 -0
  184. package/dist/raw-provider-sink-BU29Sh8h.d.ts.map +1 -0
  185. package/dist/redact-7Aq1ukl-.js +107 -0
  186. package/dist/redact-7Aq1ukl-.js.map +1 -0
  187. package/dist/release-report-Cz9NKH39.js +603 -0
  188. package/dist/release-report-Cz9NKH39.js.map +1 -0
  189. package/dist/release-report-mvB2G4_J.d.ts +244 -0
  190. package/dist/release-report-mvB2G4_J.d.ts.map +1 -0
  191. package/dist/replay-GnyotH0J.js +1741 -0
  192. package/dist/replay-GnyotH0J.js.map +1 -0
  193. package/dist/replay-OoidtG1E.d.ts +749 -0
  194. package/dist/replay-OoidtG1E.d.ts.map +1 -0
  195. package/dist/reporting.d.ts +6 -1312
  196. package/dist/reporting.js +6 -51
  197. package/dist/researcher-CwTdwXG1.d.ts +314 -0
  198. package/dist/researcher-CwTdwXG1.d.ts.map +1 -0
  199. package/dist/reward-hacking-eAnOsynk.d.ts +224 -0
  200. package/dist/reward-hacking-eAnOsynk.d.ts.map +1 -0
  201. package/dist/reward-hacking-qipEpKvY.js +596 -0
  202. package/dist/reward-hacking-qipEpKvY.js.map +1 -0
  203. package/dist/reward-nw2xZGZG.js +137 -0
  204. package/dist/reward-nw2xZGZG.js.map +1 -0
  205. package/dist/rl.d.ts +760 -4010
  206. package/dist/rl.d.ts.map +1 -0
  207. package/dist/rl.js +2325 -1958
  208. package/dist/rl.js.map +1 -1
  209. package/dist/rolldown-runtime-8H4AJuhK.js +14 -0
  210. package/dist/rollout/index.d.ts +3 -2087
  211. package/dist/rollout/index.js +8 -168
  212. package/dist/rollout-BOYjemfR.js +624 -0
  213. package/dist/rollout-BOYjemfR.js.map +1 -0
  214. package/dist/rubric-predictive-validity-B3xmbmS1.js +141 -0
  215. package/dist/rubric-predictive-validity-B3xmbmS1.js.map +1 -0
  216. package/dist/rubric-predictive-validity-Ku_clp_1.d.ts +74 -0
  217. package/dist/rubric-predictive-validity-Ku_clp_1.d.ts.map +1 -0
  218. package/dist/run-evidence-ClRX_8A9.d.ts +225 -0
  219. package/dist/run-evidence-ClRX_8A9.d.ts.map +1 -0
  220. package/dist/run-record-BuoE80Dq.js +467 -0
  221. package/dist/{chunk-56TAVBOK.js.map → run-record-BuoE80Dq.js.map} +1 -1
  222. package/dist/run-record-CnZu_gjl.d.ts +357 -0
  223. package/dist/run-record-CnZu_gjl.d.ts.map +1 -0
  224. package/dist/run-score-iEEAWiBY.js +41 -0
  225. package/dist/run-score-iEEAWiBY.js.map +1 -0
  226. package/dist/runtime-trajectory-1gyaTOoC.js +93 -0
  227. package/dist/runtime-trajectory-1gyaTOoC.js.map +1 -0
  228. package/dist/runtime-trajectory-BvSZcCHD.d.ts +50 -0
  229. package/dist/runtime-trajectory-BvSZcCHD.d.ts.map +1 -0
  230. package/dist/schema-BtVldJ3T.d.ts +206 -0
  231. package/dist/schema-BtVldJ3T.d.ts.map +1 -0
  232. package/dist/schema-C6DW4ZHR.js +821 -0
  233. package/dist/schema-C6DW4ZHR.js.map +1 -0
  234. package/dist/schema-CRhEY1SO.js +69 -0
  235. package/dist/schema-CRhEY1SO.js.map +1 -0
  236. package/dist/schema-Cef2cFmb.d.ts +408 -0
  237. package/dist/schema-Cef2cFmb.d.ts.map +1 -0
  238. package/dist/semantic-concept-judge-B6cWNJ2K.js +725 -0
  239. package/dist/semantic-concept-judge-B6cWNJ2K.js.map +1 -0
  240. package/dist/sequential-Br0mAPHA.js +148 -0
  241. package/dist/sequential-Br0mAPHA.js.map +1 -0
  242. package/dist/sequential-CYwq6Ff_.d.ts +141 -0
  243. package/dist/sequential-CYwq6Ff_.d.ts.map +1 -0
  244. package/dist/series-convergence-CjO2QdRW.js +43 -0
  245. package/dist/series-convergence-CjO2QdRW.js.map +1 -0
  246. package/dist/series-convergence-ofsqPWhs.d.ts +35 -0
  247. package/dist/series-convergence-ofsqPWhs.d.ts.map +1 -0
  248. package/dist/server-m5D9cvnG.js +1040 -0
  249. package/dist/server-m5D9cvnG.js.map +1 -0
  250. package/dist/skill-usage-C_pXm7lP.d.ts +534 -0
  251. package/dist/skill-usage-C_pXm7lP.d.ts.map +1 -0
  252. package/dist/skillopt-optimization-method-B7wX7XkF.d.ts +1739 -0
  253. package/dist/skillopt-optimization-method-B7wX7XkF.d.ts.map +1 -0
  254. package/dist/skillopt-optimization-method-D4ODwFVV.js +7712 -0
  255. package/dist/skillopt-optimization-method-D4ODwFVV.js.map +1 -0
  256. package/dist/statistics-Cmj6nynr.d.ts +514 -0
  257. package/dist/statistics-Cmj6nynr.d.ts.map +1 -0
  258. package/dist/statistics-CnnxdpOg.js +1437 -0
  259. package/dist/statistics-CnnxdpOg.js.map +1 -0
  260. package/dist/store-CT9YIIve.d.ts +117 -0
  261. package/dist/store-CT9YIIve.d.ts.map +1 -0
  262. package/dist/store-CxJry_cs.d.ts +229 -0
  263. package/dist/store-CxJry_cs.d.ts.map +1 -0
  264. package/dist/storyboard/index.d.ts +84 -203
  265. package/dist/storyboard/index.d.ts.map +1 -0
  266. package/dist/storyboard/index.js +609 -542
  267. package/dist/storyboard/index.js.map +1 -1
  268. package/dist/summary-report-BNs5nmXI.js +862 -0
  269. package/dist/summary-report-BNs5nmXI.js.map +1 -0
  270. package/dist/summary-report-Cj9gdw4i.d.ts +407 -0
  271. package/dist/summary-report-Cj9gdw4i.d.ts.map +1 -0
  272. package/dist/supervisor-run/index.d.ts +2 -959
  273. package/dist/supervisor-run/index.js +2 -65
  274. package/dist/supervisor-run-_lnTLM3z.js +1679 -0
  275. package/dist/supervisor-run-_lnTLM3z.js.map +1 -0
  276. package/dist/task-failure-attributes-CQZlB3et.js +311 -0
  277. package/dist/task-failure-attributes-CQZlB3et.js.map +1 -0
  278. package/dist/test-graded-scenario-BsqWLmPt.js +318 -0
  279. package/dist/test-graded-scenario-BsqWLmPt.js.map +1 -0
  280. package/dist/test-graded-scenario-D1TaI2va.d.ts +141 -0
  281. package/dist/test-graded-scenario-D1TaI2va.d.ts.map +1 -0
  282. package/dist/tools-BmuN627J.js +1085 -0
  283. package/dist/tools-BmuN627J.js.map +1 -0
  284. package/dist/trace-attributes.d.ts +2 -52
  285. package/dist/trace-attributes.js +131 -61
  286. package/dist/trace-attributes.js.map +1 -1
  287. package/dist/traces.d.ts +12 -2365
  288. package/dist/traces.js +12 -252
  289. package/dist/trajectory-D_7rLrvE.js +56 -0
  290. package/dist/trajectory-D_7rLrvE.js.map +1 -0
  291. package/dist/types-DGsxbAEd.d.ts +387 -0
  292. package/dist/types-DGsxbAEd.d.ts.map +1 -0
  293. package/dist/types-k9tZGKUg.d.ts +640 -0
  294. package/dist/types-k9tZGKUg.d.ts.map +1 -0
  295. package/dist/verdict-Dps8_okt.d.ts +37 -0
  296. package/dist/verdict-Dps8_okt.d.ts.map +1 -0
  297. package/dist/wire/index.d.ts +702 -1173
  298. package/dist/wire/index.d.ts.map +1 -0
  299. package/dist/wire/index.js +2 -81
  300. package/package.json +17 -9
  301. package/dist/benchmarks/index.js.map +0 -1
  302. package/dist/campaign/index.js.map +0 -1
  303. package/dist/chunk-2QU3YOPR.js +0 -7374
  304. package/dist/chunk-2QU3YOPR.js.map +0 -1
  305. package/dist/chunk-3OCR4R5I.js +0 -728
  306. package/dist/chunk-3OCR4R5I.js.map +0 -1
  307. package/dist/chunk-3RF76KTD.js +0 -84
  308. package/dist/chunk-3RF76KTD.js.map +0 -1
  309. package/dist/chunk-56TAVBOK.js +0 -698
  310. package/dist/chunk-5DTSBUL2.js +0 -159
  311. package/dist/chunk-5DTSBUL2.js.map +0 -1
  312. package/dist/chunk-7FO3TNPI.js +0 -232
  313. package/dist/chunk-7FO3TNPI.js.map +0 -1
  314. package/dist/chunk-7ZZMD7UK.js +0 -386
  315. package/dist/chunk-7ZZMD7UK.js.map +0 -1
  316. package/dist/chunk-BOD4O7OF.js +0 -40
  317. package/dist/chunk-BOD4O7OF.js.map +0 -1
  318. package/dist/chunk-BSO5JDQH.js +0 -2335
  319. package/dist/chunk-BSO5JDQH.js.map +0 -1
  320. package/dist/chunk-C6LXANRU.js +0 -1550
  321. package/dist/chunk-C6LXANRU.js.map +0 -1
  322. package/dist/chunk-DODXQREJ.js +0 -752
  323. package/dist/chunk-DODXQREJ.js.map +0 -1
  324. package/dist/chunk-DRYIUNWY.js +0 -622
  325. package/dist/chunk-DRYIUNWY.js.map +0 -1
  326. package/dist/chunk-E7QXT7SX.js +0 -183
  327. package/dist/chunk-E7QXT7SX.js.map +0 -1
  328. package/dist/chunk-EG66UGL4.js +0 -341
  329. package/dist/chunk-EG66UGL4.js.map +0 -1
  330. package/dist/chunk-FXTVJPYD.js +0 -576
  331. package/dist/chunk-FXTVJPYD.js.map +0 -1
  332. package/dist/chunk-G7MGMCZD.js +0 -153
  333. package/dist/chunk-G7MGMCZD.js.map +0 -1
  334. package/dist/chunk-GGE4NNQT.js +0 -65
  335. package/dist/chunk-GGE4NNQT.js.map +0 -1
  336. package/dist/chunk-H23X7XKK.js +0 -181
  337. package/dist/chunk-H23X7XKK.js.map +0 -1
  338. package/dist/chunk-HHWE3POT.js +0 -94
  339. package/dist/chunk-HHWE3POT.js.map +0 -1
  340. package/dist/chunk-HPWUNB47.js +0 -289
  341. package/dist/chunk-HPWUNB47.js.map +0 -1
  342. package/dist/chunk-IYCLP2N2.js +0 -766
  343. package/dist/chunk-IYCLP2N2.js.map +0 -1
  344. package/dist/chunk-JHCHEVET.js +0 -274
  345. package/dist/chunk-JHCHEVET.js.map +0 -1
  346. package/dist/chunk-JQSF5DQT.js +0 -701
  347. package/dist/chunk-JQSF5DQT.js.map +0 -1
  348. package/dist/chunk-K4DBDHLK.js +0 -158
  349. package/dist/chunk-K4DBDHLK.js.map +0 -1
  350. package/dist/chunk-K6N6XJJX.js +0 -306
  351. package/dist/chunk-K6N6XJJX.js.map +0 -1
  352. package/dist/chunk-M4YBQKIJ.js +0 -1040
  353. package/dist/chunk-M4YBQKIJ.js.map +0 -1
  354. package/dist/chunk-MA6HLL3S.js +0 -65
  355. package/dist/chunk-MA6HLL3S.js.map +0 -1
  356. package/dist/chunk-MAZ26DC7.js +0 -99
  357. package/dist/chunk-MAZ26DC7.js.map +0 -1
  358. package/dist/chunk-NPCTHQIO.js +0 -91
  359. package/dist/chunk-NPCTHQIO.js.map +0 -1
  360. package/dist/chunk-NY44NC4A.js +0 -1056
  361. package/dist/chunk-NY44NC4A.js.map +0 -1
  362. package/dist/chunk-OIUOT4QD.js +0 -44
  363. package/dist/chunk-OIUOT4QD.js.map +0 -1
  364. package/dist/chunk-ONWEPEDO.js +0 -57
  365. package/dist/chunk-ONWEPEDO.js.map +0 -1
  366. package/dist/chunk-OWN5NPMC.js +0 -152
  367. package/dist/chunk-OWN5NPMC.js.map +0 -1
  368. package/dist/chunk-P6FYH6K4.js +0 -1161
  369. package/dist/chunk-P6FYH6K4.js.map +0 -1
  370. package/dist/chunk-PC4UYEBM.js +0 -166
  371. package/dist/chunk-PC4UYEBM.js.map +0 -1
  372. package/dist/chunk-PC5DOSM7.js +0 -579
  373. package/dist/chunk-PC5DOSM7.js.map +0 -1
  374. package/dist/chunk-PXE2VKMX.js +0 -140
  375. package/dist/chunk-PXE2VKMX.js.map +0 -1
  376. package/dist/chunk-PZ5AY32C.js +0 -10
  377. package/dist/chunk-PZ5AY32C.js.map +0 -1
  378. package/dist/chunk-QB6BDBP2.js +0 -4464
  379. package/dist/chunk-QB6BDBP2.js.map +0 -1
  380. package/dist/chunk-RXHCETDZ.js +0 -536
  381. package/dist/chunk-RXHCETDZ.js.map +0 -1
  382. package/dist/chunk-RZTMDUO7.js +0 -49
  383. package/dist/chunk-RZTMDUO7.js.map +0 -1
  384. package/dist/chunk-SFLLL76A.js +0 -669
  385. package/dist/chunk-SFLLL76A.js.map +0 -1
  386. package/dist/chunk-SZLVEKMJ.js +0 -1446
  387. package/dist/chunk-SZLVEKMJ.js.map +0 -1
  388. package/dist/chunk-T4SQEITX.js +0 -95
  389. package/dist/chunk-T4SQEITX.js.map +0 -1
  390. package/dist/chunk-T6RLYGAD.js +0 -158
  391. package/dist/chunk-T6RLYGAD.js.map +0 -1
  392. package/dist/chunk-TJVT4QFF.js +0 -911
  393. package/dist/chunk-TJVT4QFF.js.map +0 -1
  394. package/dist/chunk-TQ7LNKZ3.js +0 -136
  395. package/dist/chunk-TQ7LNKZ3.js.map +0 -1
  396. package/dist/chunk-U4L7JRPZ.js +0 -1706
  397. package/dist/chunk-U4L7JRPZ.js.map +0 -1
  398. package/dist/chunk-U4PHLT2N.js +0 -419
  399. package/dist/chunk-U4PHLT2N.js.map +0 -1
  400. package/dist/chunk-VCZ5FQYW.js +0 -928
  401. package/dist/chunk-VCZ5FQYW.js.map +0 -1
  402. package/dist/chunk-VI2UW6B6.js +0 -162
  403. package/dist/chunk-VI2UW6B6.js.map +0 -1
  404. package/dist/chunk-VQMK5FMP.js +0 -247
  405. package/dist/chunk-VQMK5FMP.js.map +0 -1
  406. package/dist/chunk-WGXIEX7P.js +0 -116
  407. package/dist/chunk-WGXIEX7P.js.map +0 -1
  408. package/dist/chunk-WVATSFCP.js +0 -1553
  409. package/dist/chunk-WVATSFCP.js.map +0 -1
  410. package/dist/chunk-X4YIBDER.js +0 -1662
  411. package/dist/chunk-X4YIBDER.js.map +0 -1
  412. package/dist/chunk-YQN4ICPP.js +0 -355
  413. package/dist/chunk-YQN4ICPP.js.map +0 -1
  414. package/dist/chunk-ZET2UAYW.js +0 -89
  415. package/dist/chunk-ZET2UAYW.js.map +0 -1
  416. package/dist/chunk-ZHTZ4EYI.js +0 -1212
  417. package/dist/chunk-ZHTZ4EYI.js.map +0 -1
  418. package/dist/control.js.map +0 -1
  419. package/dist/hosted/index.js.map +0 -1
  420. package/dist/matrix/index.js.map +0 -1
  421. package/dist/reporting.js.map +0 -1
  422. package/dist/rollout/index.js.map +0 -1
  423. package/dist/run-campaign-OJJ7CZF4.js +0 -18
  424. package/dist/run-campaign-OJJ7CZF4.js.map +0 -1
  425. package/dist/supervisor-run/index.js.map +0 -1
  426. package/dist/traces.js.map +0 -1
  427. package/dist/wire/index.js.map +0 -1
@@ -1,384 +1,343 @@
1
- import {
2
- FindingsStore,
3
- RunCritic,
4
- SEMANTIC_CONCEPT_JUDGE_VERSION,
5
- SKILL_USAGE_ANALYST,
6
- SkillUsageAnalyst,
7
- buildSkillUsageReport,
8
- defaultIsMaterial,
9
- diffFindings,
10
- emitSkillUsageFindings,
11
- runSemanticConceptJudge
12
- } from "../chunk-DODXQREJ.js";
13
- import {
14
- ANALYST_SEVERITIES,
15
- AnalystRegistry,
16
- DEFAULT_TRACE_ANALYST_KINDS,
17
- FAILURE_MODE_KIND_SPEC,
18
- FINDING_SUBJECT_GRAMMAR_PROMPT,
19
- FINDING_SUBJECT_KINDS,
20
- FINDING_SUBJECT_SYNTAX,
21
- FindingSubjectStringSchema,
22
- IMPROVEMENT_KIND_SPEC,
23
- KIND_EXPECTED_SUBJECTS,
24
- KNOWLEDGE_GAP_KIND_SPEC,
25
- KNOWLEDGE_POISONING_KIND_SPEC,
26
- RAW_FINDING_SCHEMA_PROMPT,
27
- RawAnalystEvidenceSchema,
28
- RawAnalystFindingSchema,
29
- behavioralAnalyst,
30
- buildDefaultAnalystRegistry,
31
- buildTraceToolsForGroup,
32
- coerceJson,
33
- coerceToFindingRows,
34
- computeFindingId,
35
- createAnalystAi,
36
- createChatClient,
37
- createTraceAnalystKind,
38
- deriveEfficiencyFindings,
39
- evidenceRefsFromRawFinding,
40
- findingSubjectGrammarPromptFor,
41
- makeFinding,
42
- parseFindingSubject,
43
- parseRawFinding,
44
- renderFindingSubject,
45
- renderPriorFindings,
46
- renderUpstreamFindings,
47
- settleUsageReceiptFromCostLedger,
48
- stripCodeFences,
49
- structureFindings,
50
- validateUsageSettlementTimeout
51
- } from "../chunk-BSO5JDQH.js";
52
- import "../chunk-HHWE3POT.js";
53
- import "../chunk-WGXIEX7P.js";
54
- import "../chunk-SFLLL76A.js";
55
- import {
56
- CostLedger
57
- } from "../chunk-VCZ5FQYW.js";
58
- import "../chunk-VI2UW6B6.js";
59
- import "../chunk-P6FYH6K4.js";
60
- import "../chunk-PC4UYEBM.js";
61
- import "../chunk-ONWEPEDO.js";
62
- import "../chunk-K4DBDHLK.js";
63
- import "../chunk-PZ5AY32C.js";
64
-
65
- // src/analyst/adapters.ts
66
- var ADAPTER_REV = "1";
1
+ import { A as parseFindingSubject, C as stripCodeFences, D as FindingSubjectStringSchema, E as FINDING_SUBJECT_SYNTAX, F as makeFinding, L as createChatClient, M as behavioralAnalyst, N as deriveEfficiencyFindings, O as KIND_EXPECTED_SUBJECTS, P as computeFindingId, R as createAnalystAi, S as coerceToFindingRows, T as FINDING_SUBJECT_KINDS, _ as RawAnalystEvidenceSchema, a as KNOWLEDGE_GAP_KIND_SPEC, b as parseRawFinding, c as buildTraceToolsForGroup, d as renderUpstreamFindings, f as settleUsageReceiptFromCostLedger, g as RAW_FINDING_SCHEMA_PROMPT, h as ANALYST_SEVERITIES, i as KNOWLEDGE_POISONING_KIND_SPEC, j as renderFindingSubject, k as findingSubjectGrammarPromptFor, l as createTraceAnalystKind, m as structureFindings, n as AnalystRegistry, o as IMPROVEMENT_KIND_SPEC, p as validateUsageSettlementTimeout, r as DEFAULT_TRACE_ANALYST_KINDS, s as FAILURE_MODE_KIND_SPEC, t as buildDefaultAnalystRegistry, u as renderPriorFindings, v as RawAnalystFindingSchema, w as FINDING_SUBJECT_GRAMMAR_PROMPT, x as coerceJson, y as evidenceRefsFromRawFinding } from "../default-registry-C-vFCSEc.js";
2
+ import { i as CostLedger } from "../cost-ledger-DIgQUFZZ.js";
3
+ import { a as RunCritic, c as buildSkillUsageReport, d as defaultIsMaterial, f as diffFindings, i as runSemanticConceptJudge, l as emitSkillUsageFindings, n as SEMANTIC_CONCEPT_JUDGE_VERSION, o as SKILL_USAGE_ANALYST, s as SkillUsageAnalyst, u as FindingsStore } from "../semantic-concept-judge-B6cWNJ2K.js";
4
+ //#region src/analyst/adapters.ts
5
+ /**
6
+ * Adapter factories — lift each existing agent-eval primitive into the
7
+ * Analyst contract without re-implementing it.
8
+ *
9
+ * Five primitives, five factories. Each one:
10
+ * - Builds an Analyst with a stable id (caller chooses; defaults
11
+ * given), a sensible default `inputKind`, a version derived from
12
+ * the wrapped primitive's version + an adapter revision, and an
13
+ * `analyze()` that calls the primitive and lifts its output to
14
+ * AnalystFinding[] using `makeFinding()`.
15
+ * - Maps severities: the existing `Severity` ('critical' | 'major' |
16
+ * 'minor' | 'info') projects onto AnalystSeverity ('critical' |
17
+ * 'high' | 'medium' | 'low' | 'info'); 'major' → 'high', 'minor' →
18
+ * 'medium'. Domain analysts that want finer-grained mapping override.
19
+ *
20
+ * Adapters never own state. Calling the same factory twice with the
21
+ * same primitive instance is safe.
22
+ */
23
+ const ADAPTER_REV = "1";
67
24
  function liftSeverity(s) {
68
- switch (s) {
69
- case "critical":
70
- return "critical";
71
- case "major":
72
- return "high";
73
- case "minor":
74
- return "medium";
75
- case "info":
76
- return "info";
77
- }
25
+ switch (s) {
26
+ case "critical": return "critical";
27
+ case "major": return "high";
28
+ case "minor": return "medium";
29
+ case "info": return "info";
30
+ }
78
31
  }
79
32
  function createVerifierAdapter(opts) {
80
- const id = opts.id ?? "multi-layer-verifier";
81
- const area = opts.area ?? "verification";
82
- return {
83
- id,
84
- description: "Runs a MultiLayerVerifier and lifts each layer's findings into the analyst envelope.",
85
- inputKind: "custom",
86
- cost: { kind: "deterministic" },
87
- version: `verifier-${ADAPTER_REV}`,
88
- async analyze(env, ctx) {
89
- const report = await opts.verifier.run({ env, ...opts.options });
90
- const out = [];
91
- for (const layer of report.layers) {
92
- for (const finding of layer.findings) {
93
- out.push(liftLayerFinding(id, area, layer.layer, finding));
94
- }
95
- if (layer.status === "fail" || layer.status === "error" || layer.status === "timeout") {
96
- out.push(
97
- makeFinding({
98
- analyst_id: id,
99
- area,
100
- subject: layer.layer,
101
- claim: `layer "${layer.layer}" ${layer.status}: ${layer.reason ?? "no reason given"}`,
102
- severity: layer.status === "error" ? "high" : layer.status === "timeout" ? "medium" : "high",
103
- confidence: 1,
104
- evidence_refs: [],
105
- metadata: {
106
- layer_status: layer.status,
107
- duration_ms: layer.durationMs,
108
- score: layer.score,
109
- diagnostics: layer.diagnostics
110
- }
111
- })
112
- );
113
- }
114
- }
115
- ctx.log?.("verifier complete", {
116
- layers: report.layers.length,
117
- blended: report.blendedScore,
118
- all_pass: report.allPass
119
- });
120
- return out;
121
- }
122
- };
33
+ const id = opts.id ?? "multi-layer-verifier";
34
+ const area = opts.area ?? "verification";
35
+ return {
36
+ id,
37
+ description: "Runs a MultiLayerVerifier and lifts each layer's findings into the analyst envelope.",
38
+ inputKind: "custom",
39
+ cost: { kind: "deterministic" },
40
+ version: `verifier-${ADAPTER_REV}`,
41
+ async analyze(env, ctx) {
42
+ const report = await opts.verifier.run({
43
+ env,
44
+ ...opts.options
45
+ });
46
+ const out = [];
47
+ for (const layer of report.layers) {
48
+ for (const finding of layer.findings) out.push(liftLayerFinding(id, area, layer.layer, finding));
49
+ if (layer.status === "fail" || layer.status === "error" || layer.status === "timeout") out.push(makeFinding({
50
+ analyst_id: id,
51
+ area,
52
+ subject: layer.layer,
53
+ claim: `layer "${layer.layer}" ${layer.status}: ${layer.reason ?? "no reason given"}`,
54
+ severity: layer.status === "error" ? "high" : layer.status === "timeout" ? "medium" : "high",
55
+ confidence: 1,
56
+ evidence_refs: [],
57
+ metadata: {
58
+ layer_status: layer.status,
59
+ duration_ms: layer.durationMs,
60
+ score: layer.score,
61
+ diagnostics: layer.diagnostics
62
+ }
63
+ }));
64
+ }
65
+ ctx.log?.("verifier complete", {
66
+ layers: report.layers.length,
67
+ blended: report.blendedScore,
68
+ all_pass: report.allPass
69
+ });
70
+ return out;
71
+ }
72
+ };
123
73
  }
124
74
  function liftLayerFinding(analyst_id, area, layer, f) {
125
- return makeFinding({
126
- analyst_id,
127
- area,
128
- subject: f.layer ?? layer,
129
- claim: f.message,
130
- severity: liftSeverity(f.severity),
131
- confidence: 0.85,
132
- evidence_refs: f.evidence ? [{ kind: "artifact", uri: "inline:evidence", excerpt: f.evidence }] : [],
133
- metadata: f.detail
134
- });
75
+ return makeFinding({
76
+ analyst_id,
77
+ area,
78
+ subject: f.layer ?? layer,
79
+ claim: f.message,
80
+ severity: liftSeverity(f.severity),
81
+ confidence: .85,
82
+ evidence_refs: f.evidence ? [{
83
+ kind: "artifact",
84
+ uri: "inline:evidence",
85
+ excerpt: f.evidence
86
+ }] : [],
87
+ metadata: f.detail
88
+ });
135
89
  }
136
90
  function createRunCriticAdapter(opts = {}) {
137
- const id = opts.id ?? "run-critic";
138
- const area = opts.area ?? "run-quality";
139
- const critic = opts.critic ?? new RunCritic();
140
- const threshold = opts.threshold ?? 0.5;
141
- return {
142
- id,
143
- description: "Scores a single run across success / grounding / drift / tool-quality and surfaces below-threshold dimensions.",
144
- inputKind: "custom",
145
- cost: { kind: "deterministic" },
146
- version: `run-critic-${ADAPTER_REV}`,
147
- async analyze(trace) {
148
- const score = critic.scoreTrace(trace);
149
- const out = [];
150
- const dims = [
151
- ["success", "critical", "run did not complete successfully"],
152
- ["goalProgress", "high", "goal progress is low"],
153
- ["repoGroundedness", "high", "output is poorly grounded in the repository"],
154
- ["toolUseQuality", "medium", "tool use quality is low"],
155
- ["patchQuality", "medium", "no real patch/edit evidence"],
156
- ["testReality", "high", "no real test/build evidence"],
157
- ["finalGate", "critical", "final gate is blocking"]
158
- ];
159
- for (const [dim, sev, msg] of dims) {
160
- const value = score[dim];
161
- if (typeof value === "number" && value < threshold) {
162
- out.push(
163
- makeFinding({
164
- analyst_id: id,
165
- area,
166
- subject: dim,
167
- claim: msg,
168
- rationale: `${dim}=${value.toFixed(2)} below threshold ${threshold}`,
169
- severity: sev,
170
- confidence: 1,
171
- evidence_refs: [],
172
- metadata: { dimension: dim, value, threshold, run_id: trace.run.runId }
173
- })
174
- );
175
- }
176
- }
177
- if (score.driftPenalty > 1 - threshold) {
178
- out.push(
179
- makeFinding({
180
- analyst_id: id,
181
- area,
182
- subject: "drift",
183
- claim: "agent output drifted from repository signal",
184
- rationale: `driftPenalty=${score.driftPenalty.toFixed(2)}`,
185
- severity: "medium",
186
- confidence: 0.9,
187
- evidence_refs: [],
188
- metadata: { drift_penalty: score.driftPenalty, notes: score.notes }
189
- })
190
- );
191
- }
192
- return out;
193
- }
194
- };
91
+ const id = opts.id ?? "run-critic";
92
+ const area = opts.area ?? "run-quality";
93
+ const critic = opts.critic ?? new RunCritic();
94
+ const threshold = opts.threshold ?? .5;
95
+ return {
96
+ id,
97
+ description: "Scores a single run across success / grounding / drift / tool-quality and surfaces below-threshold dimensions.",
98
+ inputKind: "custom",
99
+ cost: { kind: "deterministic" },
100
+ version: `run-critic-${ADAPTER_REV}`,
101
+ async analyze(trace) {
102
+ const score = critic.scoreTrace(trace);
103
+ const out = [];
104
+ for (const [dim, sev, msg] of [
105
+ [
106
+ "success",
107
+ "critical",
108
+ "run did not complete successfully"
109
+ ],
110
+ [
111
+ "goalProgress",
112
+ "high",
113
+ "goal progress is low"
114
+ ],
115
+ [
116
+ "repoGroundedness",
117
+ "high",
118
+ "output is poorly grounded in the repository"
119
+ ],
120
+ [
121
+ "toolUseQuality",
122
+ "medium",
123
+ "tool use quality is low"
124
+ ],
125
+ [
126
+ "patchQuality",
127
+ "medium",
128
+ "no real patch/edit evidence"
129
+ ],
130
+ [
131
+ "testReality",
132
+ "high",
133
+ "no real test/build evidence"
134
+ ],
135
+ [
136
+ "finalGate",
137
+ "critical",
138
+ "final gate is blocking"
139
+ ]
140
+ ]) {
141
+ const value = score[dim];
142
+ if (typeof value === "number" && value < threshold) out.push(makeFinding({
143
+ analyst_id: id,
144
+ area,
145
+ subject: dim,
146
+ claim: msg,
147
+ rationale: `${dim}=${value.toFixed(2)} below threshold ${threshold}`,
148
+ severity: sev,
149
+ confidence: 1,
150
+ evidence_refs: [],
151
+ metadata: {
152
+ dimension: dim,
153
+ value,
154
+ threshold,
155
+ run_id: trace.run.runId
156
+ }
157
+ }));
158
+ }
159
+ if (score.driftPenalty > 1 - threshold) out.push(makeFinding({
160
+ analyst_id: id,
161
+ area,
162
+ subject: "drift",
163
+ claim: "agent output drifted from repository signal",
164
+ rationale: `driftPenalty=${score.driftPenalty.toFixed(2)}`,
165
+ severity: "medium",
166
+ confidence: .9,
167
+ evidence_refs: [],
168
+ metadata: {
169
+ drift_penalty: score.driftPenalty,
170
+ notes: score.notes
171
+ }
172
+ }));
173
+ return out;
174
+ }
175
+ };
195
176
  }
196
177
  function createJudgeAdapter(opts) {
197
- const id = opts.id ?? "judge";
198
- const area = opts.area ?? "judge";
199
- const threshold = opts.threshold ?? 6;
200
- return {
201
- id,
202
- description: "Wraps an agent-eval JudgeFn into an analyst; below-threshold dimensions surface as findings.",
203
- inputKind: "judge-input",
204
- cost: opts.cost ?? { kind: "llm" },
205
- version: `judge-${ADAPTER_REV}`,
206
- async analyze(input) {
207
- const scores = await opts.judge(opts.chat, input);
208
- return scores.filter((s) => normalize10(s.score) < threshold).map((s) => liftJudgeScore(id, area, s));
209
- }
210
- };
178
+ const id = opts.id ?? "judge";
179
+ const area = opts.area ?? "judge";
180
+ const threshold = opts.threshold ?? 6;
181
+ return {
182
+ id,
183
+ description: "Wraps an agent-eval JudgeFn into an analyst; below-threshold dimensions surface as findings.",
184
+ inputKind: "judge-input",
185
+ cost: opts.cost ?? { kind: "llm" },
186
+ version: `judge-${ADAPTER_REV}`,
187
+ async analyze(input) {
188
+ return (await opts.judge(opts.chat, input)).filter((s) => normalize10(s.score) < threshold).map((s) => liftJudgeScore(id, area, s));
189
+ }
190
+ };
211
191
  }
212
192
  function normalize10(s) {
213
- return s <= 1 ? s * 10 : s;
193
+ return s <= 1 ? s * 10 : s;
214
194
  }
215
195
  function liftJudgeScore(analyst_id, area, s) {
216
- const score10 = normalize10(s.score);
217
- const severity = score10 < 3 ? "critical" : score10 < 5 ? "high" : score10 < 7 ? "medium" : "low";
218
- return makeFinding({
219
- analyst_id,
220
- area,
221
- subject: s.dimension,
222
- claim: `${s.judgeName}/${s.dimension} scored ${score10.toFixed(1)}/10`,
223
- rationale: s.reasoning,
224
- severity,
225
- confidence: 0.8,
226
- evidence_refs: s.evidence ? [{ kind: "artifact", uri: "inline:evidence", excerpt: s.evidence }] : [],
227
- // Provenance: this finding IS a judge verdict (an acceptance score), not an
228
- // observation of behavior. The steer firewall (assertNoJudgeVerdict) rejects
229
- // it from steering — even when it cites an artifact above — because letting a
230
- // verdict steer the next attempt is the held-out judge leaking into the loop.
231
- derived_from_judge: true,
232
- metadata: { judge_name: s.judgeName, dimension: s.dimension, score_10: score10 }
233
- });
196
+ const score10 = normalize10(s.score);
197
+ const severity = score10 < 3 ? "critical" : score10 < 5 ? "high" : score10 < 7 ? "medium" : "low";
198
+ return makeFinding({
199
+ analyst_id,
200
+ area,
201
+ subject: s.dimension,
202
+ claim: `${s.judgeName}/${s.dimension} scored ${score10.toFixed(1)}/10`,
203
+ rationale: s.reasoning,
204
+ severity,
205
+ confidence: .8,
206
+ evidence_refs: s.evidence ? [{
207
+ kind: "artifact",
208
+ uri: "inline:evidence",
209
+ excerpt: s.evidence
210
+ }] : [],
211
+ derived_from_judge: true,
212
+ metadata: {
213
+ judge_name: s.judgeName,
214
+ dimension: s.dimension,
215
+ score_10: score10
216
+ }
217
+ });
234
218
  }
235
219
  function createSemanticConceptJudgeAdapter(opts = {}) {
236
- const id = opts.id ?? "semantic-concept-judge";
237
- const area = opts.area ?? "concept-coverage";
238
- const settlementTimeoutMs = validateUsageSettlementTimeout(opts.settlementTimeoutMs);
239
- return {
240
- id,
241
- description: "Runs the semantic-concept judge and surfaces missing / weak concepts as findings.",
242
- inputKind: "custom",
243
- cost: {
244
- kind: "llm",
245
- models: opts.options?.model ? [opts.options.model] : void 0,
246
- settlement_timeout_ms: settlementTimeoutMs
247
- },
248
- version: `${SEMANTIC_CONCEPT_JUDGE_VERSION}-adapter-${ADAPTER_REV}`,
249
- async analyze(input, ctx) {
250
- const costLedger = new CostLedger(ctx.budgetUsd);
251
- let result;
252
- try {
253
- result = await runSemanticConceptJudge(input, {
254
- ...opts.options,
255
- costLedger,
256
- signal: ctx.signal
257
- });
258
- } finally {
259
- const usage = await settleUsageReceiptFromCostLedger(costLedger, {
260
- channel: "judge",
261
- timeoutMs: settlementTimeoutMs
262
- });
263
- if (!usage.settled) {
264
- ctx.log?.("semantic-concept judge provider settlement timed out", {
265
- pending_calls: usage.pendingCalls,
266
- timeout_ms: settlementTimeoutMs
267
- });
268
- }
269
- ctx.recordUsage?.(usage.receipt);
270
- }
271
- if (!result.available) {
272
- return [
273
- makeFinding({
274
- analyst_id: id,
275
- area,
276
- claim: "semantic-concept judge unavailable",
277
- rationale: result.error,
278
- severity: "info",
279
- confidence: 1,
280
- evidence_refs: [],
281
- metadata: { reason: result.error }
282
- })
283
- ];
284
- }
285
- const out = [];
286
- for (const f of result.findings) {
287
- if (f.present && f.score >= 7) continue;
288
- out.push(
289
- makeFinding({
290
- analyst_id: id,
291
- area,
292
- subject: f.concept,
293
- claim: f.present ? `concept "${f.concept}" is weak (${f.score}/10)` : `concept "${f.concept}" is missing`,
294
- rationale: f.evidence,
295
- severity: liftSeverity(f.severity),
296
- confidence: 0.85,
297
- evidence_refs: [{ kind: "artifact", uri: "inline:evidence", excerpt: f.evidence }],
298
- metadata: {
299
- concept: f.concept,
300
- present: f.present,
301
- score_10: f.score
302
- }
303
- })
304
- );
305
- }
306
- return out;
307
- }
308
- };
220
+ const id = opts.id ?? "semantic-concept-judge";
221
+ const area = opts.area ?? "concept-coverage";
222
+ const settlementTimeoutMs = validateUsageSettlementTimeout(opts.settlementTimeoutMs);
223
+ return {
224
+ id,
225
+ description: "Runs the semantic-concept judge and surfaces missing / weak concepts as findings.",
226
+ inputKind: "custom",
227
+ cost: {
228
+ kind: "llm",
229
+ models: opts.options?.model ? [opts.options.model] : void 0,
230
+ settlement_timeout_ms: settlementTimeoutMs
231
+ },
232
+ version: `${SEMANTIC_CONCEPT_JUDGE_VERSION}-adapter-${ADAPTER_REV}`,
233
+ async analyze(input, ctx) {
234
+ const costLedger = new CostLedger(ctx.budgetUsd);
235
+ let result;
236
+ try {
237
+ result = await runSemanticConceptJudge(input, {
238
+ ...opts.options,
239
+ costLedger,
240
+ signal: ctx.signal
241
+ });
242
+ } finally {
243
+ const usage = await settleUsageReceiptFromCostLedger(costLedger, {
244
+ channel: "judge",
245
+ timeoutMs: settlementTimeoutMs
246
+ });
247
+ if (!usage.settled) ctx.log?.("semantic-concept judge provider settlement timed out", {
248
+ pending_calls: usage.pendingCalls,
249
+ timeout_ms: settlementTimeoutMs
250
+ });
251
+ ctx.recordUsage?.(usage.receipt);
252
+ }
253
+ if (!result.available) return [makeFinding({
254
+ analyst_id: id,
255
+ area,
256
+ claim: "semantic-concept judge unavailable",
257
+ rationale: result.error,
258
+ severity: "info",
259
+ confidence: 1,
260
+ evidence_refs: [],
261
+ metadata: { reason: result.error }
262
+ })];
263
+ const out = [];
264
+ for (const f of result.findings) {
265
+ if (f.present && f.score >= 7) continue;
266
+ out.push(makeFinding({
267
+ analyst_id: id,
268
+ area,
269
+ subject: f.concept,
270
+ claim: f.present ? `concept "${f.concept}" is weak (${f.score}/10)` : `concept "${f.concept}" is missing`,
271
+ rationale: f.evidence,
272
+ severity: liftSeverity(f.severity),
273
+ confidence: .85,
274
+ evidence_refs: [{
275
+ kind: "artifact",
276
+ uri: "inline:evidence",
277
+ excerpt: f.evidence
278
+ }],
279
+ metadata: {
280
+ concept: f.concept,
281
+ present: f.present,
282
+ score_10: f.score
283
+ }
284
+ }));
285
+ }
286
+ return out;
287
+ }
288
+ };
309
289
  }
310
-
311
- // src/analyst/steer-firewall.ts
312
- var OBSERVABLE_KINDS = /* @__PURE__ */ new Set([
313
- "span",
314
- "event",
315
- "artifact"
290
+ //#endregion
291
+ //#region src/analyst/steer-firewall.ts
292
+ /** Evidence grounded in the agent's OWN execution: OTLP trace elements
293
+ * (`span`/`event`) or the artifact it produced (`artifact`). */
294
+ const OBSERVABLE_KINDS = /* @__PURE__ */ new Set([
295
+ "span",
296
+ "event",
297
+ "artifact"
316
298
  ]);
299
+ /** DESCRIPTIVE predicate: does the finding cite at least one observable
300
+ * (span/event/artifact) evidence ref. Useful for ranking evidence quality or
301
+ * rendering — it is NOT the steer gate. Evidence presence is the WRONG
302
+ * discriminator for steering: a legitimate trace-analyst observation may cite
303
+ * nothing (it would be wrongly rejected), and a judge verdict may cite an
304
+ * artifact (it would be wrongly admitted). Use `assertNoJudgeVerdict` to gate
305
+ * steering; use this only where "is this grounded in observable evidence" is the
306
+ * literal question. */
317
307
  function isTraceObservable(finding) {
318
- return finding.evidence_refs.some((ref) => OBSERVABLE_KINDS.has(ref.kind));
308
+ return finding.evidence_refs.some((ref) => OBSERVABLE_KINDS.has(ref.kind));
319
309
  }
310
+ /** True iff the finding is a JUDGE VERDICT (an acceptance score lifted into a
311
+ * finding), identified by provenance set at the lift site — independent of
312
+ * whatever evidence it cites. */
320
313
  function isJudgeVerdict(finding) {
321
- return finding.derived_from_judge === true;
314
+ return finding.derived_from_judge === true;
322
315
  }
316
+ /**
317
+ * THE steer firewall. Fail-loud guard for any path that admits analyst findings
318
+ * as STEERING input (the `f(trace)` role): rejects — naming the offenders — any
319
+ * finding whose provenance is a judge verdict, rather than let `J` leak into the
320
+ * loop. Returns the findings unchanged for chaining.
321
+ *
322
+ * Call this at the chokepoint where a detector that ALSO scores/gates has its
323
+ * findings turned into a steer (the judge-and-steer dual-role case). It keys on
324
+ * provenance, so it correctly admits evidence-less trace-analyst observations and
325
+ * correctly rejects an artifact-citing judge verdict — the cases an evidence
326
+ * check gets backwards.
327
+ *
328
+ * It is necessary, not sufficient: it stops PROVENANCE-tagged verdicts. A judge
329
+ * whose output is laundered through a hand-built finding with no provenance flag
330
+ * is out of its reach — provenance must be honestly set at every judge→finding
331
+ * lift (today: createJudgeAdapter). That is why the integrity rule lives at the
332
+ * lift site, and why ProposeContext.judgeScores?: never is the complementary
333
+ * compile-time tripwire on the obvious direct channel.
334
+ */
323
335
  function assertNoJudgeVerdict(findings, context = "steer") {
324
- const leaks = findings.filter(isJudgeVerdict);
325
- if (leaks.length > 0) {
326
- throw new Error(
327
- `${context}: a judge verdict cannot be admitted as steering input \u2014 that is the held-out judge leaking into the loop. Offending judge-derived findings: [${leaks.map((f) => f.finding_id).join(", ")}]. Steering consumes observations of behavior, never acceptance verdicts.`
328
- );
329
- }
330
- return findings;
336
+ const leaks = findings.filter(isJudgeVerdict);
337
+ if (leaks.length > 0) throw new Error(`${context}: a judge verdict cannot be admitted as steering input — that is the held-out judge leaking into the loop. Offending judge-derived findings: [${leaks.map((f) => f.finding_id).join(", ")}]. Steering consumes observations of behavior, never acceptance verdicts.`);
338
+ return findings;
331
339
  }
332
- export {
333
- ANALYST_SEVERITIES,
334
- AnalystRegistry,
335
- DEFAULT_TRACE_ANALYST_KINDS,
336
- FAILURE_MODE_KIND_SPEC,
337
- FINDING_SUBJECT_GRAMMAR_PROMPT,
338
- FINDING_SUBJECT_KINDS,
339
- FINDING_SUBJECT_SYNTAX,
340
- FindingSubjectStringSchema,
341
- FindingsStore,
342
- IMPROVEMENT_KIND_SPEC,
343
- KIND_EXPECTED_SUBJECTS,
344
- KNOWLEDGE_GAP_KIND_SPEC,
345
- KNOWLEDGE_POISONING_KIND_SPEC,
346
- RAW_FINDING_SCHEMA_PROMPT,
347
- RawAnalystEvidenceSchema,
348
- RawAnalystFindingSchema,
349
- SKILL_USAGE_ANALYST,
350
- SkillUsageAnalyst,
351
- assertNoJudgeVerdict,
352
- behavioralAnalyst,
353
- buildDefaultAnalystRegistry,
354
- buildSkillUsageReport,
355
- buildTraceToolsForGroup,
356
- coerceJson,
357
- coerceToFindingRows,
358
- computeFindingId,
359
- createAnalystAi,
360
- createChatClient,
361
- createJudgeAdapter,
362
- createRunCriticAdapter,
363
- createSemanticConceptJudgeAdapter,
364
- createTraceAnalystKind,
365
- createVerifierAdapter,
366
- defaultIsMaterial,
367
- deriveEfficiencyFindings,
368
- diffFindings,
369
- emitSkillUsageFindings,
370
- evidenceRefsFromRawFinding,
371
- findingSubjectGrammarPromptFor,
372
- isJudgeVerdict,
373
- isTraceObservable,
374
- liftSeverity,
375
- makeFinding,
376
- parseFindingSubject,
377
- parseRawFinding,
378
- renderFindingSubject,
379
- renderPriorFindings,
380
- renderUpstreamFindings,
381
- stripCodeFences,
382
- structureFindings
383
- };
340
+ //#endregion
341
+ export { ANALYST_SEVERITIES, AnalystRegistry, DEFAULT_TRACE_ANALYST_KINDS, FAILURE_MODE_KIND_SPEC, FINDING_SUBJECT_GRAMMAR_PROMPT, FINDING_SUBJECT_KINDS, FINDING_SUBJECT_SYNTAX, FindingSubjectStringSchema, FindingsStore, IMPROVEMENT_KIND_SPEC, KIND_EXPECTED_SUBJECTS, KNOWLEDGE_GAP_KIND_SPEC, KNOWLEDGE_POISONING_KIND_SPEC, RAW_FINDING_SCHEMA_PROMPT, RawAnalystEvidenceSchema, RawAnalystFindingSchema, SKILL_USAGE_ANALYST, SkillUsageAnalyst, assertNoJudgeVerdict, behavioralAnalyst, buildDefaultAnalystRegistry, buildSkillUsageReport, buildTraceToolsForGroup, coerceJson, coerceToFindingRows, computeFindingId, createAnalystAi, createChatClient, createJudgeAdapter, createRunCriticAdapter, createSemanticConceptJudgeAdapter, createTraceAnalystKind, createVerifierAdapter, defaultIsMaterial, deriveEfficiencyFindings, diffFindings, emitSkillUsageFindings, evidenceRefsFromRawFinding, findingSubjectGrammarPromptFor, isJudgeVerdict, isTraceObservable, liftSeverity, makeFinding, parseFindingSubject, parseRawFinding, renderFindingSubject, renderPriorFindings, renderUpstreamFindings, stripCodeFences, structureFindings };
342
+
384
343
  //# sourceMappingURL=index.js.map