@tangle-network/agent-eval 0.132.0 → 0.133.1

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (140) hide show
  1. package/CHANGELOG.md +15 -0
  2. package/README.md +1 -1
  3. package/dist/agent-profile-cell-OhuTee9n.js +335 -0
  4. package/dist/agent-profile-cell-OhuTee9n.js.map +1 -0
  5. package/dist/analyst/index.js +3 -3
  6. package/dist/{analyze-runs-BjPn_fOS.js → analyze-runs-B-afTpCv.js} +6 -19
  7. package/dist/analyze-runs-B-afTpCv.js.map +1 -0
  8. package/dist/{analyze-runs-AFDI5RI0.d.ts → analyze-runs-DZr7JW-m.d.ts} +2 -2
  9. package/dist/{analyze-runs-AFDI5RI0.d.ts.map → analyze-runs-DZr7JW-m.d.ts.map} +1 -1
  10. package/dist/{baseline-HsBvw_dk.js → baseline-DcX5hQDv.js} +2 -70
  11. package/dist/{baseline-HsBvw_dk.js.map → baseline-DcX5hQDv.js.map} +1 -1
  12. package/dist/baseline-hG3K85h4.d.ts.map +1 -1
  13. package/dist/benchmarks/index.d.ts +1 -1
  14. package/dist/benchmarks/index.js +1 -1
  15. package/dist/{benchmarks-DTrT3UH-.js → benchmarks-BU7P6PCW.js} +3 -3
  16. package/dist/{benchmarks-DTrT3UH-.js.map → benchmarks-BU7P6PCW.js.map} +1 -1
  17. package/dist/builder-eval/index.js +1 -1
  18. package/dist/campaign/index.d.ts +3 -3
  19. package/dist/campaign/index.js +2 -2
  20. package/dist/{campaign-Cx6CfMR4.js → campaign-CnzHQndg.js} +21 -15
  21. package/dist/{campaign-Cx6CfMR4.js.map → campaign-CnzHQndg.js.map} +1 -1
  22. package/dist/cli.js +1 -1
  23. package/dist/{client-aZDHJiKO.d.ts → client-D4F9hdzR.d.ts} +2 -2
  24. package/dist/{client-aZDHJiKO.d.ts.map → client-D4F9hdzR.d.ts.map} +1 -1
  25. package/dist/contract/index.d.ts +145 -6
  26. package/dist/contract/index.d.ts.map +1 -1
  27. package/dist/contract/index.js +1395 -11
  28. package/dist/contract/index.js.map +1 -1
  29. package/dist/control.js +1 -1
  30. package/dist/{cost-ledger-ZAa_P4r0.js → cost-ledger-BrJxbrMy.js} +238 -3
  31. package/dist/cost-ledger-BrJxbrMy.js.map +1 -0
  32. package/dist/{default-registry-B1JcpnRv.js → default-registry-D3T9XbuY.js} +3 -3
  33. package/dist/{default-registry-B1JcpnRv.js.map → default-registry-D3T9XbuY.js.map} +1 -1
  34. package/dist/{eval-campaign-mDKhkdUq.js → eval-campaign-DXhpZghy.js} +5 -6
  35. package/dist/{eval-campaign-mDKhkdUq.js.map → eval-campaign-DXhpZghy.js.map} +1 -1
  36. package/dist/{task-failure-attributes-CQZlB3et.js → extract-usage-2j25whHw.js} +154 -2
  37. package/dist/extract-usage-2j25whHw.js.map +1 -0
  38. package/dist/fuzz.js +1 -1
  39. package/dist/hosted/index.d.ts +1 -1
  40. package/dist/{index-3cdlURSk2.d.ts → index-3cdlURSk.d.ts} +1 -1
  41. package/dist/index-3cdlURSk.d.ts.map +1 -0
  42. package/dist/{index-FpfWFsKm.d.ts → index-Ba636PKl.d.ts} +29 -6
  43. package/dist/{index-FpfWFsKm.d.ts.map → index-Ba636PKl.d.ts.map} +1 -1
  44. package/dist/{index-p2TR_iWJ.d.ts → index-Wek5mU0y.d.ts} +3 -3
  45. package/dist/{index-p2TR_iWJ.d.ts.map → index-Wek5mU0y.d.ts.map} +1 -1
  46. package/dist/{index-BAvgST_9.d.ts → index-nhIYz9hn.d.ts} +67 -9
  47. package/dist/index-nhIYz9hn.d.ts.map +1 -0
  48. package/dist/index.d.ts +55 -9
  49. package/dist/index.d.ts.map +1 -1
  50. package/dist/index.js +111 -24
  51. package/dist/index.js.map +1 -1
  52. package/dist/ledger-core/index.d.ts +2 -2
  53. package/dist/ledger-core/index.js +2 -2
  54. package/dist/ledger-core-CPZfcrC2.js +620 -0
  55. package/dist/ledger-core-CPZfcrC2.js.map +1 -0
  56. package/dist/{llm-client-BNcP4v08.js → llm-client-ClPW-dWB.js} +2 -2
  57. package/dist/{llm-client-BNcP4v08.js.map → llm-client-ClPW-dWB.js.map} +1 -1
  58. package/dist/meta-eval/index.d.ts +215 -2
  59. package/dist/{index-CXs7QlR5.d.ts.map → meta-eval/index.d.ts.map} +1 -1
  60. package/dist/meta-eval/index.js +93 -3
  61. package/dist/meta-eval/index.js.map +1 -1
  62. package/dist/{mint-D5_87M5L.js → mint-BvkwcYZU.js} +2 -2
  63. package/dist/{mint-D5_87M5L.js.map → mint-BvkwcYZU.js.map} +1 -1
  64. package/dist/openapi.json +1 -1
  65. package/dist/{paired-arms-D9D0wXj2.js → paired-arms-6XItKzd1.js} +2 -2
  66. package/dist/{paired-arms-D9D0wXj2.js.map → paired-arms-6XItKzd1.js.map} +1 -1
  67. package/dist/pipelines/index.js +2 -2
  68. package/dist/profile-cell.js +1 -242
  69. package/dist/{propose-review-control-Bqb7daEJ.js → propose-review-control-SQ-n9-We.js} +2 -2
  70. package/dist/{propose-review-control-Bqb7daEJ.js.map → propose-review-control-SQ-n9-We.js.map} +1 -1
  71. package/dist/{release-report-oWt9f2k-.js → release-report-wuilQkvK.js} +3 -3
  72. package/dist/{release-report-oWt9f2k-.js.map → release-report-wuilQkvK.js.map} +1 -1
  73. package/dist/{replay-D18-pBAA.js → replay-CJfGLdx4.js} +4 -5
  74. package/dist/{replay-D18-pBAA.js.map → replay-CJfGLdx4.js.map} +1 -1
  75. package/dist/reporting.d.ts +1 -1
  76. package/dist/reporting.js +4 -4
  77. package/dist/{reward-hacking-BEvjdUtD.js → reward-hacking-Dl2UBzej.js} +3 -3
  78. package/dist/{reward-hacking-BEvjdUtD.js.map → reward-hacking-Dl2UBzej.js.map} +1 -1
  79. package/dist/rl.d.ts +153 -3
  80. package/dist/rl.d.ts.map +1 -1
  81. package/dist/rl.js +222 -7
  82. package/dist/rl.js.map +1 -1
  83. package/dist/rollout/index.d.ts +1 -1
  84. package/dist/rollout/index.js +2 -2
  85. package/dist/{rollout-VEo41J0N.js → rollout-CeTlDrf6.js} +2 -2
  86. package/dist/{rollout-VEo41J0N.js.map → rollout-CeTlDrf6.js.map} +1 -1
  87. package/dist/{rubric-predictive-validity-B3xmbmS1.js → rubric-predictive-validity-QG7ydk0s.js} +2 -2
  88. package/dist/{rubric-predictive-validity-B3xmbmS1.js.map → rubric-predictive-validity-QG7ydk0s.js.map} +1 -1
  89. package/dist/{run-record-CN8Zd21B.js → run-record-BIwU2wdV.js} +2 -2
  90. package/dist/{run-record-CN8Zd21B.js.map → run-record-BIwU2wdV.js.map} +1 -1
  91. package/dist/{semantic-concept-judge-DKCtoOz8.js → semantic-concept-judge-BypLt6Fw.js} +4 -4
  92. package/dist/{semantic-concept-judge-DKCtoOz8.js.map → semantic-concept-judge-BypLt6Fw.js.map} +1 -1
  93. package/dist/{server-Dc_lsOYd.js → server-BPqlDBWK.js} +3 -3
  94. package/dist/{server-Dc_lsOYd.js.map → server-BPqlDBWK.js.map} +1 -1
  95. package/dist/{skillopt-optimization-method-CQlz8GQM.js → skillopt-optimization-method-BoIzh7Dl.js} +6 -6
  96. package/dist/{skillopt-optimization-method-CQlz8GQM.js.map → skillopt-optimization-method-BoIzh7Dl.js.map} +1 -1
  97. package/dist/{skillopt-optimization-method-C9M_lxdo.d.ts → skillopt-optimization-method-CAASpcS3.d.ts} +3 -3
  98. package/dist/{skillopt-optimization-method-C9M_lxdo.d.ts.map → skillopt-optimization-method-CAASpcS3.d.ts.map} +1 -1
  99. package/dist/{statistics-CnnxdpOg.js → statistics-DWM_AyLe.js} +90 -76
  100. package/dist/statistics-DWM_AyLe.js.map +1 -0
  101. package/dist/statistics-DbvkkDPa.d.ts.map +1 -1
  102. package/dist/{summary-report-BNs5nmXI.js → summary-report-Ci17nIdU.js} +4 -4
  103. package/dist/{summary-report-BNs5nmXI.js.map → summary-report-Ci17nIdU.js.map} +1 -1
  104. package/dist/traces.js +2 -2
  105. package/dist/wire/index.js +1 -1
  106. package/package.json +2 -7
  107. package/dist/analyze-runs-BjPn_fOS.js.map +0 -1
  108. package/dist/belief-state/index.d.ts +0 -622
  109. package/dist/belief-state/index.d.ts.map +0 -1
  110. package/dist/belief-state/index.js +0 -1819
  111. package/dist/belief-state/index.js.map +0 -1
  112. package/dist/calibration-CNWWA6K8.js +0 -94
  113. package/dist/calibration-CNWWA6K8.js.map +0 -1
  114. package/dist/code-agent-session-BjkMTQ7H.js +0 -1390
  115. package/dist/code-agent-session-BjkMTQ7H.js.map +0 -1
  116. package/dist/code-agent-session-D5URqc3_.d.ts +0 -143
  117. package/dist/code-agent-session-D5URqc3_.d.ts.map +0 -1
  118. package/dist/cost-ledger-ZAa_P4r0.js.map +0 -1
  119. package/dist/extract-usage-BrQ8mCLX.js +0 -155
  120. package/dist/extract-usage-BrQ8mCLX.js.map +0 -1
  121. package/dist/index-3cdlURSk2.d.ts.map +0 -1
  122. package/dist/index-BAvgST_9.d.ts.map +0 -1
  123. package/dist/index-CXs7QlR5.d.ts +0 -217
  124. package/dist/ledger-core-eqaI3PCD.js +0 -388
  125. package/dist/ledger-core-eqaI3PCD.js.map +0 -1
  126. package/dist/metrics-C9YY1OcL.js +0 -239
  127. package/dist/metrics-C9YY1OcL.js.map +0 -1
  128. package/dist/off-policy-DvgzvtIx.js +0 -220
  129. package/dist/off-policy-DvgzvtIx.js.map +0 -1
  130. package/dist/off-policy-mskQw8Mb.d.ts +0 -153
  131. package/dist/off-policy-mskQw8Mb.d.ts.map +0 -1
  132. package/dist/pre-registration-DakwTRXk.js +0 -96
  133. package/dist/pre-registration-DakwTRXk.js.map +0 -1
  134. package/dist/profile-cell.js.map +0 -1
  135. package/dist/runtime-trajectory-1gyaTOoC.js +0 -93
  136. package/dist/runtime-trajectory-1gyaTOoC.js.map +0 -1
  137. package/dist/runtime-trajectory-BW9Wszb-.d.ts +0 -50
  138. package/dist/runtime-trajectory-BW9Wszb-.d.ts.map +0 -1
  139. package/dist/statistics-CnnxdpOg.js.map +0 -1
  140. package/dist/task-failure-attributes-CQZlB3et.js.map +0 -1
package/dist/index.js CHANGED
@@ -1,47 +1,44 @@
1
1
  import { t as __exportAll } from "./rolldown-runtime-8H4AJuhK.js";
2
- import { _ as observeAll, a as jsonlReviewStore, c as scoreFromEvals, d as runAgentControlLoop, f as stopOnNoProgress, g as noProgressDetector, h as errorStreakDetector, i as inMemoryReviewStore, l as allCriticalPassed, m as subjectiveEval, n as runProposeReviewAsControlLoop, o as runProposeReview, p as stopOnRepeatedAction, r as createLlmReviewer, s as controlRunToRunRecord, t as controlFailureClassFromVerification, u as objectiveEval, v as repeatedActionDetector, y as evaluateActionPolicy } from "./propose-review-control-Bqb7daEJ.js";
2
+ import { _ as observeAll, a as jsonlReviewStore, c as scoreFromEvals, d as runAgentControlLoop, f as stopOnNoProgress, g as noProgressDetector, h as errorStreakDetector, i as inMemoryReviewStore, l as allCriticalPassed, m as subjectiveEval, n as runProposeReviewAsControlLoop, o as runProposeReview, p as stopOnRepeatedAction, r as createLlmReviewer, s as controlRunToRunRecord, t as controlFailureClassFromVerification, u as objectiveEval, v as repeatedActionDetector, y as evaluateActionPolicy } from "./propose-review-control-SQ-n9-We.js";
3
3
  import { a as NotFoundError, c as VerificationError, i as JudgeError, n as CaptureIntegrityError, o as ReplayError, r as ConfigError, s as ValidationError, t as AgentEvalError } from "./errors-8YnH8WlF.js";
4
- import { a as verifyManifest, i as signManifest, n as evaluateHypothesis, r as hashJson, t as canonicalize } from "./pre-registration-DakwTRXk.js";
5
- import { AGENT_PROFILE_KINDS, AgentProfileCellValidationError, agentProfileCellHashMaterial, agentProfileCellKey, assertRunAgentProfileCell, buildAgentInterfaceProfileCell, buildAgentProfileCell, groupRunsByAgentProfileCell, requireAgentProfileCell, toAgentProfileJson, validateAgentProfileCell, verifyAgentProfileCell } from "./profile-cell.js";
6
- import { F as makeFinding, I as computeTraceMetrics, L as createChatClient, P as computeFindingId, R as createAnalystAi, a as KNOWLEDGE_GAP_KIND_SPEC, d as renderUpstreamFindings, i as KNOWLEDGE_POISONING_KIND_SPEC, l as createTraceAnalystKind, n as AnalystRegistry, o as IMPROVEMENT_KIND_SPEC, r as DEFAULT_TRACE_ANALYST_KINDS, s as FAILURE_MODE_KIND_SPEC, t as buildDefaultAnalystRegistry, u as renderPriorFindings } from "./default-registry-B1JcpnRv.js";
7
- import { a as estimateTokens, i as estimateCost, n as MetricsCollector, o as isModelPriced, r as TokenCounter, s as resolveModelPricing, t as MODEL_PRICING } from "./metrics-C9YY1OcL.js";
8
- import { a as CostLedgerPersistenceError, c as costForTokenPricing, i as CostLedger, l as costForUsage, n as CostCallConflictError, o as CostReceiptCaptureError, r as CostCeilingReachedError, s as CostReservationExceededError, t as CostAccountingIncompleteError, u as modelPriceKey } from "./cost-ledger-ZAa_P4r0.js";
4
+ import { _ as verifyManifest, a as assertRunAgentProfileCell, c as groupRunsByAgentProfileCell, d as validateAgentProfileCell, f as verifyAgentProfileCell, g as signManifest, h as hashJson, i as agentProfileCellKey, l as requireAgentProfileCell, m as evaluateHypothesis, n as AgentProfileCellValidationError, o as buildAgentInterfaceProfileCell, p as canonicalize, r as agentProfileCellHashMaterial, s as buildAgentProfileCell, t as AGENT_PROFILE_KINDS, u as toAgentProfileJson } from "./agent-profile-cell-OhuTee9n.js";
5
+ import { F as makeFinding, I as computeTraceMetrics, L as createChatClient, P as computeFindingId, R as createAnalystAi, a as KNOWLEDGE_GAP_KIND_SPEC, d as renderUpstreamFindings, i as KNOWLEDGE_POISONING_KIND_SPEC, l as createTraceAnalystKind, n as AnalystRegistry, o as IMPROVEMENT_KIND_SPEC, r as DEFAULT_TRACE_ANALYST_KINDS, s as FAILURE_MODE_KIND_SPEC, t as buildDefaultAnalystRegistry, u as renderPriorFindings } from "./default-registry-D3T9XbuY.js";
6
+ import { _ as resolveModelPricing, a as CostLedgerPersistenceError, c as costForTokenPricing, d as MODEL_PRICING, f as MetricsCollector, g as isModelPriced, h as estimateTokens, i as CostLedger, l as costForUsage, m as estimateCost, n as CostCallConflictError, o as CostReceiptCaptureError, p as TokenCounter, r as CostCeilingReachedError, s as CostReservationExceededError, t as CostAccountingIncompleteError, u as modelPriceKey } from "./cost-ledger-BrJxbrMy.js";
9
7
  import { a as providerFromBaseUrl, i as defaultProviderRedactor, n as InMemoryRawProviderSink, r as NoopRawProviderSink, t as FileSystemRawProviderSink } from "./raw-provider-sink-BQd7mzyT.js";
10
- import { a as assertLlmRoute, c as callLlmJson, d as isTransientLlmError, f as maximumChargeForLlmRequest, i as LlmRouteAssertionError, l as costReceiptFromLlm, m as stripFencedJson, n as LlmClient, o as backoffMs, p as probeLlm, r as LlmResponseError, s as callLlm, t as LlmCallError, u as costReceiptFromLlmError } from "./llm-client-BNcP4v08.js";
8
+ import { a as assertLlmRoute, c as callLlmJson, d as isTransientLlmError, f as maximumChargeForLlmRequest, i as LlmRouteAssertionError, l as costReceiptFromLlm, m as stripFencedJson, n as LlmClient, o as backoffMs, p as probeLlm, r as LlmResponseError, s as callLlm, t as LlmCallError, u as costReceiptFromLlmError } from "./llm-client-ClPW-dWB.js";
11
9
  import { INPUT_VALUE, LLM_CACHED_TOKENS, LLM_CACHED_TOKEN_ATTR_KEYS, LLM_CACHE_WRITE_TOKENS, LLM_CACHE_WRITE_TOKEN_ATTR_KEYS, LLM_CONTEXT_TOKENS, LLM_COST_ATTR_KEYS, LLM_COST_USD, LLM_INPUT_TOKENS, LLM_INPUT_TOKEN_ATTR_KEYS, LLM_MODEL_ATTR_KEYS, LLM_MODEL_NAME, LLM_OUTPUT_TOKENS, LLM_OUTPUT_TOKEN_ATTR_KEYS, LLM_REASONING_TOKENS, LLM_REASONING_TOKEN_ATTR_KEYS, OPENINFERENCE_SPAN_KIND, OUTPUT_VALUE, RUN_COST_ATTR_KEYS, SPAN_KIND_ATTR_KEYS, TOOL_ARGS_CAPTURED, TOOL_LATENCY_MS, TOOL_NAME, TOOL_NAME_ATTR_KEYS, applyLlmSpanOtlpAttributes, asNumber, contextInputTokens, firstNumberAttr } from "./trace-attributes.js";
12
10
  import { S as traceSpanKindToOpenInferenceKind, a as SpanNotFoundError, b as classifyOtlpSpanRole, c as DEFAULT_TRACE_ANALYST_BUDGETS, f as extractOtlpAttributes, g as readOtlpStatus, h as projectOtlpFlatLine, i as OtlpFileTraceStore, l as TRACE_ANALYST_TRUNCATION_MARKER_PREFIX, m as inferOtlpKind, n as traceAnalystFunctionGroup, o as TraceFileMissingError, p as firstStringAttr, s as TraceNotFoundError, t as buildTraceAnalystTools, u as asString, v as stringField, x as isOtlpModelCall, y as applyToolSpanOtlpAttributes } from "./tools-BmuN627J.js";
13
11
  import { n as aggregateRunScore, r as clamp01, t as DEFAULT_RUN_SCORE_WEIGHTS } from "./run-score-iEEAWiBY.js";
14
12
  import { n as mapConcurrent, t as Mutex } from "./concurrency-MUjT7VjM.js";
15
- import { a as RunCritic, d as defaultIsMaterial, f as diffFindings, i as runSemanticConceptJudge, n as SEMANTIC_CONCEPT_JUDGE_VERSION, o as SKILL_USAGE_ANALYST, p as LockedJsonlAppender, r as createSemanticConceptJudge, s as SkillUsageAnalyst, t as DEFAULT_COMPLEXITY_WEIGHTS, u as FindingsStore } from "./semantic-concept-judge-DKCtoOz8.js";
16
- import { At as dominates, B as surfaceContentHash, Bt as JudgeParseError, Ct as llmJudge, D as runCanaries, Dt as fileVerdictCache, Et as contentHash, Ft as BackendIntegrityError, G as DEFAULT_MUTATION_PRIMITIVES, It as assertRealAgentReceipts, K as buildReflectionPrompt, Lt as assertRealBackend, Mt as paretoFrontierWithCrowding, Nt as scalarScore, Ot as inMemoryVerdictCache, Rt as summarizeAgentReceiptIntegrity, St as hashScenarios, Tt as canonicalJson, _t as redTeamReport, bt as Dataset, dt as REFERENCE_EQUIVALENCE_INPUT_LIMITS, ft as REFERENCE_EQUIVALENCE_JUDGE_VERSION, gt as redTeamDataset, ht as DEFAULT_RED_TEAM_CORPUS, jt as paretoFrontier, kt as crowdingDistance, mt as runReferenceEquivalenceJudge, pt as createReferenceEquivalenceJudge, q as parseReflectionResponse, vt as scoreRedTeamOutput, wt as cachedJudge, xt as HoldoutLockedError, yt as toolNamesForRun, zt as summarizeBackendIntegrity } from "./skillopt-optimization-method-CQlz8GQM.js";
17
- import { A as spearmanR, B as verbosityBias, C as pairedTTest, D as ranks, E as pearsonR, F as calibrateJudge, I as calibrateJudgeContinuous, L as continuousAgreement, M as weightedMean, N as wilcoxonSignedRank, O as requiredPairedSampleSize, P as wilson, R as positionalBias, S as pairedSignTest, T as passAtK, _ as normalizeScores, a as confidenceInterval, b as pairedMde, c as eProcess, d as interpretCliffs, f as mannWhitneyU, g as mulberry32, h as mcnemarRequiredN, i as cohensD, j as weightedComposite, k as requiredSampleSize, l as holm, m as mcnemarPower, n as bonferroni, o as corpusInterRaterAgreement, p as mcnemar, r as cliffsDelta, s as corpusInterRaterAgreementFromJudgeScores, t as benjaminiHochberg, u as interRaterReliability, v as pairedBootstrap, w as partialCredit, x as pairedRiskDifference, y as pairedCohensDz, z as selfPreference } from "./statistics-CnnxdpOg.js";
18
- import { n as pairArms, r as pairRunRecords, t as comparePairedArms } from "./paired-arms-D9D0wXj2.js";
13
+ import { a as RunCritic, d as defaultIsMaterial, f as diffFindings, i as runSemanticConceptJudge, n as SEMANTIC_CONCEPT_JUDGE_VERSION, o as SKILL_USAGE_ANALYST, p as LockedJsonlAppender, r as createSemanticConceptJudge, s as SkillUsageAnalyst, t as DEFAULT_COMPLEXITY_WEIGHTS, u as FindingsStore } from "./semantic-concept-judge-BypLt6Fw.js";
14
+ import { At as dominates, B as surfaceContentHash, Bt as JudgeParseError, Ct as llmJudge, D as runCanaries, Dt as fileVerdictCache, Et as contentHash, Ft as BackendIntegrityError, G as DEFAULT_MUTATION_PRIMITIVES, It as assertRealAgentReceipts, K as buildReflectionPrompt, Lt as assertRealBackend, Mt as paretoFrontierWithCrowding, Nt as scalarScore, Ot as inMemoryVerdictCache, Rt as summarizeAgentReceiptIntegrity, St as hashScenarios, Tt as canonicalJson, _t as redTeamReport, bt as Dataset, dt as REFERENCE_EQUIVALENCE_INPUT_LIMITS, ft as REFERENCE_EQUIVALENCE_JUDGE_VERSION, gt as redTeamDataset, ht as DEFAULT_RED_TEAM_CORPUS, jt as paretoFrontier, kt as crowdingDistance, mt as runReferenceEquivalenceJudge, pt as createReferenceEquivalenceJudge, q as parseReflectionResponse, vt as scoreRedTeamOutput, wt as cachedJudge, xt as HoldoutLockedError, yt as toolNamesForRun, zt as summarizeBackendIntegrity } from "./skillopt-optimization-method-BoIzh7Dl.js";
15
+ import { A as spearmanR, B as positionalBias, C as pairedTTest, D as ranks, E as pearsonR, H as verbosityBias, L as calibrateJudge, M as weightedMean, N as wilcoxonSignedRank, O as requiredPairedSampleSize, P as wilson, R as calibrateJudgeContinuous, S as pairedSignTest, T as passAtK, V as selfPreference, _ as normalizeScores, a as confidenceInterval, b as pairedMde, c as eProcess, d as interpretCliffs, f as mannWhitneyU, g as mulberry32, h as mcnemarRequiredN, i as cohensD, j as weightedComposite, k as requiredSampleSize, l as holm, m as mcnemarPower, n as bonferroni, o as corpusInterRaterAgreement, p as mcnemar, r as cliffsDelta, s as corpusInterRaterAgreementFromJudgeScores, t as benjaminiHochberg, u as interRaterReliability, v as pairedBootstrap, w as partialCredit, x as pairedRiskDifference, y as pairedCohensDz, z as continuousAgreement } from "./statistics-DWM_AyLe.js";
16
+ import { n as pairArms, r as pairRunRecords, t as comparePairedArms } from "./paired-arms-6XItKzd1.js";
19
17
  import { n as llmSpanFromProvider, t as TraceEmitter } from "./emitter-CPBAhxum.js";
20
18
  import { a as scoreOrigin, n as observedScore, o as trainingReward, r as observedSplitScore, s as trainingScore, t as isRealnessGated } from "./reward-nw2xZGZG.js";
21
19
  import { a as isRetrievalSpan, i as isLlmSpan, n as TRACE_SCHEMA_VERSION, o as isSandboxSpan, r as isJudgeSpan, s as isToolSpan, t as FAILURE_CLASSES } from "./schema-CRhEY1SO.js";
22
- import { a as roundTripRunRecord, i as parseRunRecordSafe, n as isRunRecord, o as runTaskScore, r as modelHasSnapshot, s as validateRunRecord, t as RunRecordValidationError } from "./run-record-CN8Zd21B.js";
23
- import { a as evaluateReleaseConfidence, i as assertReleaseConfidence, n as bootstrapCi, r as judgeReplayGate, t as renderReleaseReport } from "./release-report-oWt9f2k-.js";
20
+ import { a as roundTripRunRecord, i as parseRunRecordSafe, n as isRunRecord, o as runTaskScore, r as modelHasSnapshot, s as validateRunRecord, t as RunRecordValidationError } from "./run-record-BIwU2wdV.js";
21
+ import { a as evaluateReleaseConfidence, i as assertReleaseConfidence, n as bootstrapCi, r as judgeReplayGate, t as renderReleaseReport } from "./release-report-wuilQkvK.js";
24
22
  import { c as assertMintedLines, f as isRolloutLine, i as ROLLOUT_SCHEMA, m as validateRolloutLine, p as isTrainableSplit, s as assertMinted, u as assertRolloutLine } from "./schema-C6DW4ZHR.js";
25
23
  import { i as toRewardRows, r as toJsonl, s as toSftRows } from "./exporters-q9iL-2Jf.js";
26
- import { a as toHarborTrajectories, i as relabelImportedSplit, n as HARBOR_IMPORT_GAP, o as toHarborTrajectory, r as fromHarborTrajectory, t as ATIF_SCHEMA_VERSION } from "./rollout-VEo41J0N.js";
24
+ import { a as toHarborTrajectories, i as relabelImportedSplit, n as HARBOR_IMPORT_GAP, o as toHarborTrajectory, r as fromHarborTrajectory, t as ATIF_SCHEMA_VERSION } from "./rollout-CeTlDrf6.js";
27
25
  import { t as buildTrajectory } from "./trajectory-D_7rLrvE.js";
28
- import { t as mintRolloutRows } from "./mint-D5_87M5L.js";
26
+ import { t as mintRolloutRows } from "./mint-BvkwcYZU.js";
29
27
  import { D as showMeasured, E as isUnavailable, S as rollupSupervisorRuns, T as SUPERVISOR_RUN_SCHEMA, _ as claudeCodeSupervisorRunReader, f as renderSupervisorRunHeadline, l as writeSupervisorRunReport, n as analyzeSupervisorRun, p as renderSupervisorRunMarkdown, t as supervisorRunRolloutLines, v as readClaudeCodeSupervisorRun, y as analyzeSupervisorRunSources } from "./supervisor-run-_lnTLM3z.js";
30
28
  import { n as TRACE_ANALYST_ACTOR_DESCRIPTION, r as TRACE_ANALYST_ACTOR_DESCRIPTION_VERSION, t as analyzeTraces } from "./analyst-LsnNpSkm.js";
31
- import { C as planTraceInsightQuestions, E as traceAnalystOnRunComplete, S as inferDomainKeywords, T as tokenizeDomainWords, _ as buildTraceInsightContext, a as convertTraceStoresToOtlp, b as describeTraceInsightScope, c as otelRunCompleteHook, d as captureFetchToRawSink, f as otlpRowsToRunRecords, g as flattenOtlpExportToNdjson, h as otlpToTraceRunRecords, i as iterateRawCalls, l as OTEL_AGENT_EVAL_SCOPE, m as otlpToRunRecords, n as ReplayCacheMissError, o as createOtelExporter, p as otlpRowsToTraceRunRecords, r as createReplayFetch, s as createOtelTracingStore, t as ReplayCache, u as exportRunAsOtlp, v as buildTraceInsightPrompt, w as scoreTraceInsightReadiness, x as domainEvidencePattern, y as defaultTraceInsightPanel } from "./replay-D18-pBAA.js";
32
- import { B as harnessAxisOf, F as HARNESS_NATIVE_MODEL, G as parseCorrectnessResponse, H as completionVerdict, I as agentProfileHash, K as verifyCompletion, L as agentProfileId, P as CODING_HARNESSES, R as agentProfileModelId, U as createLlmCorrectnessChecker, V as extractProducedState, W as createTokenRecallChecker, z as expandProfileAxes } from "./campaign-Cx6CfMR4.js";
29
+ import { C as planTraceInsightQuestions, E as traceAnalystOnRunComplete, S as inferDomainKeywords, T as tokenizeDomainWords, _ as buildTraceInsightContext, a as convertTraceStoresToOtlp, b as describeTraceInsightScope, c as otelRunCompleteHook, d as captureFetchToRawSink, f as otlpRowsToRunRecords, g as flattenOtlpExportToNdjson, h as otlpToTraceRunRecords, i as iterateRawCalls, l as OTEL_AGENT_EVAL_SCOPE, m as otlpToRunRecords, n as ReplayCacheMissError, o as createOtelExporter, p as otlpRowsToTraceRunRecords, r as createReplayFetch, s as createOtelTracingStore, t as ReplayCache, u as exportRunAsOtlp, v as buildTraceInsightPrompt, w as scoreTraceInsightReadiness, x as domainEvidencePattern, y as defaultTraceInsightPanel } from "./replay-CJfGLdx4.js";
30
+ import { n as extractUsageFromResponse, r as extractUsageFromSse, t as extractUsage } from "./extract-usage-2j25whHw.js";
31
+ import { B as harnessAxisOf, F as HARNESS_NATIVE_MODEL, G as parseCorrectnessResponse, H as completionVerdict, I as agentProfileHash, K as verifyCompletion, L as agentProfileId, P as CODING_HARNESSES, R as agentProfileModelId, U as createLlmCorrectnessChecker, V as extractProducedState, W as createTokenRecallChecker, z as expandProfileAxes } from "./campaign-CnzHQndg.js";
33
32
  import { a as judgeSpans, c as runsForScenario, i as hasCapturedToolArgs, l as toolSpans, n as argHash, o as llmSpans, r as groupBy, s as runFailureClass, t as aggregateLlm } from "./query-Di7eEQ79.js";
34
- import { a as checkBehavioralCanary, i as canaryLeakView, o as checkCanaries, r as HoldoutAuditor, s as runBehavioralCanaries, t as analyzeRuns } from "./analyze-runs-BjPn_fOS.js";
35
- import { a as summaryTable, i as researchReport, n as gainHistogram, r as paretoChart, t as RESEARCH_REPORT_HARD_PAIR_FLOOR } from "./summary-report-BNs5nmXI.js";
33
+ import { a as checkBehavioralCanary, i as canaryLeakView, o as checkCanaries, r as HoldoutAuditor, s as runBehavioralCanaries, t as analyzeRuns } from "./analyze-runs-B-afTpCv.js";
34
+ import { a as summaryTable, i as researchReport, n as gainHistogram, r as paretoChart, t as RESEARCH_REPORT_HARD_PAIR_FLOOR } from "./summary-report-Ci17nIdU.js";
36
35
  import { a as composeParsers, c as vitestTestParser, i as SubprocessSandboxDriver, n as DockerSandboxDriver, o as jestTestParser, r as SandboxHarness, s as pytestTestParser, t as runTestGradedScenario } from "./test-graded-scenario-BsqWLmPt.js";
37
36
  import { a as InMemoryTraceStore, i as FileSystemTraceStore, n as assertRunCaptured, r as throwIfRunIncomplete, t as RunIntegrityError } from "./integrity-BzRbCHzi.js";
38
- import { n as extractUsageFromResponse, r as extractUsageFromSse, t as extractUsage } from "./extract-usage-BrQ8mCLX.js";
39
37
  import { i as redactValue, n as REDACTION_VERSION, r as redactString, t as DEFAULT_REDACTION_RULES } from "./redact-7Aq1ukl-.js";
40
- import { a as DEFAULT_RULES, i as computeToolUseMetrics, n as iqr, o as classifyFailure, r as welchsTTest, t as compareToBaseline } from "./baseline-HsBvw_dk.js";
41
- import { n as projectRuntimeTrajectoryEvidence, t as parseRuntimeTrajectoryHookEvent } from "./runtime-trajectory-1gyaTOoC.js";
38
+ import { a as DEFAULT_RULES, i as computeToolUseMetrics, n as iqr, o as classifyFailure, r as welchsTTest, t as compareToBaseline } from "./baseline-DcX5hQDv.js";
42
39
  import { t as analyzeSeries } from "./series-convergence-CjO2QdRW.js";
43
- import { _ as deterministicSplit, g as BENCHMARK_SPLIT_SEED, t as benchmarks_exports } from "./benchmarks-DTrT3UH-.js";
44
- import { t as runEvalCampaign } from "./eval-campaign-mDKhkdUq.js";
40
+ import { _ as deterministicSplit, g as BENCHMARK_SPLIT_SEED, t as benchmarks_exports } from "./benchmarks-BU7P6PCW.js";
41
+ import { t as runEvalCampaign } from "./eval-campaign-DXhpZghy.js";
45
42
  import { n as pairedEvalueSequence, t as evaluateInterimReleaseConfidence } from "./sequential-Br0mAPHA.js";
46
43
  import { AxGEPA, AxSignature, ax } from "@ax-llm/ax";
47
44
  import { accessSync, appendFileSync, constants, cpSync, existsSync, mkdirSync, promises, readFileSync, readdirSync, statSync, writeFileSync } from "node:fs";
@@ -4587,6 +4584,96 @@ function clampUnit(value) {
4587
4584
  return Math.max(0, Math.min(1, value));
4588
4585
  }
4589
4586
  //#endregion
4587
+ //#region src/runtime-trajectory.ts
4588
+ const DEFAULT_SPLIT_TAG = "search";
4589
+ function projectRuntimeTrajectoryEvidence(options) {
4590
+ const diagnostics = [];
4591
+ const runsById = /* @__PURE__ */ new Map();
4592
+ const events = [];
4593
+ let recordWithRuntimeEventsCount = 0;
4594
+ let defaultedSplitCount = 0;
4595
+ for (let recordIndex = 0; recordIndex < options.records.length; recordIndex += 1) {
4596
+ const record = options.records[recordIndex];
4597
+ const key = runtimeTrajectoryRecordKey(record, recordIndex, options.recordIdOf);
4598
+ const splitTag = record.splitTag ?? options.defaultSplitTag ?? DEFAULT_SPLIT_TAG;
4599
+ if (record.splitTag === void 0) defaultedSplitCount += 1;
4600
+ const rawEvents = record.runtimeEvents;
4601
+ if (!Array.isArray(rawEvents)) {
4602
+ diagnostics.push(`${key}: runtimeEvents is not an array; no runtime run join can be extracted`);
4603
+ continue;
4604
+ }
4605
+ if (rawEvents.length === 0) {
4606
+ diagnostics.push(`${key}: no runtimeEvents; no runtime run join can be extracted`);
4607
+ continue;
4608
+ }
4609
+ recordWithRuntimeEventsCount += 1;
4610
+ for (let index = 0; index < rawEvents.length; index += 1) {
4611
+ const event = parseRuntimeTrajectoryHookEvent(rawEvents[index]);
4612
+ if (!event) {
4613
+ diagnostics.push(`${key}: runtimeEvents[${index}] is not a RuntimeHookEvent`);
4614
+ continue;
4615
+ }
4616
+ events.push(event);
4617
+ const scenarioId = event.scenarioId ?? stringOrUndefined(options.scenarioIdOf?.(record, recordIndex)) ?? stringOrUndefined(record.scenarioId);
4618
+ const prior = runsById.get(event.runId);
4619
+ if (!prior) {
4620
+ runsById.set(event.runId, {
4621
+ runId: event.runId,
4622
+ scenarioId,
4623
+ splitTag
4624
+ });
4625
+ continue;
4626
+ }
4627
+ if (prior.scenarioId !== scenarioId || prior.splitTag !== splitTag) diagnostics.push(`${key}: runId ${event.runId} has conflicting scenario/split metadata`);
4628
+ }
4629
+ }
4630
+ const runs = [...runsById.values()];
4631
+ return {
4632
+ runs,
4633
+ events,
4634
+ summary: {
4635
+ recordCount: options.records.length,
4636
+ recordWithRuntimeEventsCount,
4637
+ runtimeRunCount: runs.length,
4638
+ lifecycleEventCount: events.length,
4639
+ defaultedSplitCount
4640
+ },
4641
+ diagnostics
4642
+ };
4643
+ }
4644
+ function parseRuntimeTrajectoryHookEvent(input) {
4645
+ if (!isRecord(input)) return null;
4646
+ if (typeof input.id !== "string" || input.id.length === 0) return null;
4647
+ if (typeof input.runId !== "string" || input.runId.length === 0) return null;
4648
+ if (typeof input.target !== "string" || input.target.length === 0) return null;
4649
+ if (typeof input.phase !== "string" || input.phase.length === 0) return null;
4650
+ if (typeof input.timestamp !== "number" || !Number.isFinite(input.timestamp)) return null;
4651
+ return {
4652
+ id: input.id,
4653
+ runId: input.runId,
4654
+ scenarioId: stringOrUndefined(input.scenarioId),
4655
+ target: input.target,
4656
+ phase: input.phase,
4657
+ timestamp: input.timestamp,
4658
+ stepIndex: finiteNumberOrUndefined(input.stepIndex),
4659
+ parentId: stringOrUndefined(input.parentId),
4660
+ payload: input.payload,
4661
+ metadata: isRecord(input.metadata) ? { ...input.metadata } : void 0
4662
+ };
4663
+ }
4664
+ function runtimeTrajectoryRecordKey(record, index, recordIdOf) {
4665
+ return stringOrUndefined(recordIdOf?.(record, index)) ?? stringOrUndefined(record.id) ?? `record[${index}]`;
4666
+ }
4667
+ function isRecord(value) {
4668
+ return typeof value === "object" && value !== null && !Array.isArray(value);
4669
+ }
4670
+ function stringOrUndefined(value) {
4671
+ return typeof value === "string" && value.length > 0 ? value : void 0;
4672
+ }
4673
+ function finiteNumberOrUndefined(value) {
4674
+ return typeof value === "number" && Number.isFinite(value) ? value : void 0;
4675
+ }
4676
+ //#endregion
4590
4677
  //#region src/cost-tracker.ts
4591
4678
  /**
4592
4679
  * Cost tracker — token + USD accounting per scenario and per run.