@tangle-network/agent-eval 0.144.7 → 0.144.9

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (118) hide show
  1. package/CHANGELOG.md +12 -0
  2. package/dist/{agent-profile-CgDTo40f.d.ts → agent-profile-DPi7IZg7.d.ts} +3 -3
  3. package/dist/{agent-profile-CgDTo40f.d.ts.map → agent-profile-DPi7IZg7.d.ts.map} +1 -1
  4. package/dist/analyst/index.d.ts +9 -9
  5. package/dist/analyst/index.js +1 -1
  6. package/dist/{analyze-runs-BNNK7irB.js → analyze-runs-C30yljDJ.js} +2 -2
  7. package/dist/{analyze-runs-BNNK7irB.js.map → analyze-runs-C30yljDJ.js.map} +1 -1
  8. package/dist/{benchmark-command-BCafwNrf.js → benchmark-command-Dtym4pA-.js} +2 -2
  9. package/dist/{benchmark-command-BCafwNrf.js.map → benchmark-command-Dtym4pA-.js.map} +1 -1
  10. package/dist/benchmarks/index.d.ts +1 -1
  11. package/dist/benchmarks/index.js +1 -1
  12. package/dist/{benchmarks-CDSolHq7.js → benchmarks-Ce4Ae5fX.js} +3 -3
  13. package/dist/{benchmarks-CDSolHq7.js.map → benchmarks-Ce4Ae5fX.js.map} +1 -1
  14. package/dist/campaign/index.d.ts +6 -6
  15. package/dist/campaign/index.js +2 -2
  16. package/dist/{campaign-Tdy3h62h.js → campaign-FG3thH2m.js} +4 -4
  17. package/dist/{campaign-Tdy3h62h.js.map → campaign-FG3thH2m.js.map} +1 -1
  18. package/dist/cli.js +1 -1
  19. package/dist/{client-DjXROWpx.d.ts → client-C9gzZE59.d.ts} +4 -4
  20. package/dist/{client-DjXROWpx.d.ts.map → client-C9gzZE59.d.ts.map} +1 -1
  21. package/dist/{completion-verifier-foUCLif_.d.ts → completion-verifier-DJA5BhPb.d.ts} +3 -3
  22. package/dist/{completion-verifier-foUCLif_.d.ts.map → completion-verifier-DJA5BhPb.d.ts.map} +1 -1
  23. package/dist/contract/index.d.ts +9 -9
  24. package/dist/contract/index.js +4 -4
  25. package/dist/contract/index.js.map +1 -1
  26. package/dist/control.d.ts +2 -2
  27. package/dist/control.js +1 -1
  28. package/dist/{default-registry-BZhStdjl.d.ts → default-registry-Bf8Woqmq.d.ts} +6 -6
  29. package/dist/{default-registry-BZhStdjl.d.ts.map → default-registry-Bf8Woqmq.d.ts.map} +1 -1
  30. package/dist/{engine-nB64f48I.d.ts → engine-3hL-XqwJ.d.ts} +7 -7
  31. package/dist/{engine-nB64f48I.d.ts.map → engine-3hL-XqwJ.d.ts.map} +1 -1
  32. package/dist/{eval-campaign-DNjCvAm-.js → eval-campaign-B_7wcnav.js} +2 -2
  33. package/dist/{eval-campaign-DNjCvAm-.js.map → eval-campaign-B_7wcnav.js.map} +1 -1
  34. package/dist/{exact-types-Djvzosly.d.ts → exact-types-DSFFpLLI.d.ts} +2 -2
  35. package/dist/{exact-types-Djvzosly.d.ts.map → exact-types-DSFFpLLI.d.ts.map} +1 -1
  36. package/dist/experiment/index.d.ts +2 -2
  37. package/dist/{feedback-trajectory-Rh280oXo.d.ts → feedback-trajectory-CacHpxsp.d.ts} +3 -3
  38. package/dist/{feedback-trajectory-Rh280oXo.d.ts.map → feedback-trajectory-CacHpxsp.d.ts.map} +1 -1
  39. package/dist/hosted/index.d.ts +3 -3
  40. package/dist/{index-CvXXlyz7.d.ts → index-BnEuDAK2.d.ts} +2 -2
  41. package/dist/{index-CvXXlyz7.d.ts.map → index-BnEuDAK2.d.ts.map} +1 -1
  42. package/dist/{index-Sh2I0DRc.d.ts → index-CBEMKO8d.d.ts} +9 -9
  43. package/dist/{index-Sh2I0DRc.d.ts.map → index-CBEMKO8d.d.ts.map} +1 -1
  44. package/dist/{index-C5HOo4ZF2.d.ts → index-CLKMJTJF2.d.ts} +5 -5
  45. package/dist/{index-C5HOo4ZF2.d.ts.map → index-CLKMJTJF2.d.ts.map} +1 -1
  46. package/dist/{index-CwDrUMe0.d.ts → index-CQTZ-4XN.d.ts} +2 -2
  47. package/dist/{index-CwDrUMe0.d.ts.map → index-CQTZ-4XN.d.ts.map} +1 -1
  48. package/dist/index.d.ts +22 -22
  49. package/dist/index.js +11 -11
  50. package/dist/{insight-report-C6h6F_4L.d.ts → insight-report-CgX_s0Ez.d.ts} +3 -3
  51. package/dist/{insight-report-C6h6F_4L.d.ts.map → insight-report-CgX_s0Ez.d.ts.map} +1 -1
  52. package/dist/meta-eval/index.d.ts +1 -1
  53. package/dist/{mint-CGEkzPLf.js → mint-B2O60ACG.js} +2 -2
  54. package/dist/{mint-CGEkzPLf.js.map → mint-B2O60ACG.js.map} +1 -1
  55. package/dist/multishot/index.d.ts +1 -1
  56. package/dist/openapi.json +1 -1
  57. package/dist/{promotion-policy-ChWhTDBH.d.ts → promotion-policy-Ckjhzg_4.d.ts} +2 -2
  58. package/dist/{promotion-policy-ChWhTDBH.d.ts.map → promotion-policy-Ckjhzg_4.d.ts.map} +1 -1
  59. package/dist/{propose-review-control-qgWLA6E9.js → propose-review-control-dSNPjFUH.js} +2 -2
  60. package/dist/{propose-review-control-qgWLA6E9.js.map → propose-review-control-dSNPjFUH.js.map} +1 -1
  61. package/dist/{release-report-Dy39cbFF.js → release-report-BUYmoKo2.js} +2 -2
  62. package/dist/{release-report-Dy39cbFF.js.map → release-report-BUYmoKo2.js.map} +1 -1
  63. package/dist/{release-report-CI8uisI1.d.ts → release-report-DA2BCu5a.d.ts} +3 -3
  64. package/dist/{release-report-CI8uisI1.d.ts.map → release-report-DA2BCu5a.d.ts.map} +1 -1
  65. package/dist/{replay-DyBLaKFc.js → replay-B3gACG_H.js} +2 -2
  66. package/dist/{replay-DyBLaKFc.js.map → replay-B3gACG_H.js.map} +1 -1
  67. package/dist/{replay-DFf-teiC.d.ts → replay-DbhZ4Ked.d.ts} +5 -5
  68. package/dist/{replay-DFf-teiC.d.ts.map → replay-DbhZ4Ked.d.ts.map} +1 -1
  69. package/dist/reporting.d.ts +3 -3
  70. package/dist/reporting.js +1 -1
  71. package/dist/{researcher-BoaxeCzP.d.ts → researcher-BchpD55R.d.ts} +3 -3
  72. package/dist/{researcher-BoaxeCzP.d.ts.map → researcher-BchpD55R.d.ts.map} +1 -1
  73. package/dist/{reward-hacking-B2tPL9a3.js → reward-hacking-BDToousL.js} +4 -3
  74. package/dist/reward-hacking-BDToousL.js.map +1 -0
  75. package/dist/{reward-hacking-Cf1PtEOz.d.ts → reward-hacking-BI0OMAlo.d.ts} +2 -2
  76. package/dist/{reward-hacking-Cf1PtEOz.d.ts.map → reward-hacking-BI0OMAlo.d.ts.map} +1 -1
  77. package/dist/rl.d.ts +5 -5
  78. package/dist/rl.js +4 -4
  79. package/dist/rollout/index.d.ts +1 -1
  80. package/dist/rollout/index.js +2 -2
  81. package/dist/{rollout-2ECTXb2N.js → rollout-DRrksrcV.js} +2 -2
  82. package/dist/{rollout-2ECTXb2N.js.map → rollout-DRrksrcV.js.map} +1 -1
  83. package/dist/{rubric-predictive-validity-9qAwzkZm.d.ts → rubric-predictive-validity-DvkjPYCe.d.ts} +2 -2
  84. package/dist/{rubric-predictive-validity-9qAwzkZm.d.ts.map → rubric-predictive-validity-DvkjPYCe.d.ts.map} +1 -1
  85. package/dist/{run-evidence-BDFFai9R.d.ts → run-evidence-Dhi3C81V.d.ts} +3 -3
  86. package/dist/{run-evidence-BDFFai9R.d.ts.map → run-evidence-Dhi3C81V.d.ts.map} +1 -1
  87. package/dist/{run-record-DqOw5X6_.js → run-record-BmSPWXJR.js} +2 -1
  88. package/dist/run-record-BmSPWXJR.js.map +1 -0
  89. package/dist/{run-record-DdSa93_W.d.ts → run-record-CF4Dwpxr.d.ts} +4 -1
  90. package/dist/run-record-CF4Dwpxr.d.ts.map +1 -0
  91. package/dist/{skill-usage-CJlWEUFt.d.ts → skill-usage-CO9OLRBx.d.ts} +6 -6
  92. package/dist/{skill-usage-CJlWEUFt.d.ts.map → skill-usage-CO9OLRBx.d.ts.map} +1 -1
  93. package/dist/{skillopt-optimization-method-BO7NAl3b.d.ts → skillopt-optimization-method-D8wysvU1.d.ts} +6 -6
  94. package/dist/{skillopt-optimization-method-BO7NAl3b.d.ts.map → skillopt-optimization-method-D8wysvU1.d.ts.map} +1 -1
  95. package/dist/{skillopt-optimization-method-CQwZ-ZX8.js → skillopt-optimization-method-Dtzp7QpP.js} +14 -4
  96. package/dist/skillopt-optimization-method-Dtzp7QpP.js.map +1 -0
  97. package/dist/{statistical-heldout-Dn9ruizm.d.ts → statistical-heldout-TQ-4CYiN.d.ts} +3 -3
  98. package/dist/{statistical-heldout-Dn9ruizm.d.ts.map → statistical-heldout-TQ-4CYiN.d.ts.map} +1 -1
  99. package/dist/{summary-report-DuUS_i7W.d.ts → summary-report-BNR7DWTj.d.ts} +2 -2
  100. package/dist/{summary-report-DuUS_i7W.d.ts.map → summary-report-BNR7DWTj.d.ts.map} +1 -1
  101. package/dist/{tool-groups-DIVBnJyl.d.ts → tool-groups-CZPGGlHf.d.ts} +3 -3
  102. package/dist/tool-groups-CZPGGlHf.d.ts.map +1 -0
  103. package/dist/trace-repair/index.d.ts +2 -2
  104. package/dist/traces.d.ts +4 -4
  105. package/dist/traces.js +1 -1
  106. package/dist/{types-DYuNHo9R.d.ts → types-BnjdJ70P.d.ts} +3 -3
  107. package/dist/{types-DYuNHo9R.d.ts.map → types-BnjdJ70P.d.ts.map} +1 -1
  108. package/dist/{types-DF_Udrp-.d.ts → types-BvDKaULh.d.ts} +2 -2
  109. package/dist/{types-DF_Udrp-.d.ts.map → types-BvDKaULh.d.ts.map} +1 -1
  110. package/dist/wire/index.d.ts +1 -1
  111. package/docs/campaign-proposers.md +5 -0
  112. package/docs/concepts.md +1 -0
  113. package/package.json +1 -1
  114. package/dist/reward-hacking-B2tPL9a3.js.map +0 -1
  115. package/dist/run-record-DdSa93_W.d.ts.map +0 -1
  116. package/dist/run-record-DqOw5X6_.js.map +0 -1
  117. package/dist/skillopt-optimization-method-CQwZ-ZX8.js.map +0 -1
  118. package/dist/tool-groups-DIVBnJyl.d.ts.map +0 -1
package/dist/index.d.ts CHANGED
@@ -2,50 +2,50 @@ import { a as JudgeError, c as ReplayError, i as ConfigError, l as ValidationErr
2
2
  import { C as verifyAgentProfileCell, S as validateAgentProfileCell, _ as buildAgentInterfaceProfileCell, a as AgentProfileCellSchemaVersion, b as requireAgentProfileCell, c as AgentProfileHarness, d as AgentProfileKind, f as AgentProfileSource, g as assertRunAgentProfileCell, h as agentProfileCellKey, i as AgentProfileCellInput, l as AgentProfileJson, m as agentProfileCellHashMaterial, n as AgentInterfaceProfileLike, o as AgentProfileCellValidationError, p as AgentProfileSourceInput, r as AgentProfileCell, s as AgentProfileDimensionValue, t as AGENT_PROFILE_KINDS, u as AgentProfileJsonObject, v as buildAgentProfileCell, x as toAgentProfileJson, y as groupRunsByAgentProfileCell } from "./agent-profile-cell-BOP-iA9Q.js";
3
3
  import { a as StrategyChecker, c as VerificationStrategyProfile, i as CheckerOutcome, l as VerificationStrategySource, n as VerdictCertification, o as VERIFICATION_STRATEGIES, r as CheckerIdentity, s as VERIFICATION_STRATEGY_SOURCES, t as DefaultVerdict } from "./verdict-DExhxfgR.js";
4
4
  import { a as MultiLayerVerifier, c as VerifyContext, i as LayerStatus, l as VerifyOptions, n as Layer, o as Severity, r as LayerResult, s as VerificationReport, t as Finding, u as gradeSemanticStatus } from "./multi-layer-verifier-DnAqwl0h.js";
5
- import { $ as RunScore, B as ConceptSpec, E as FindingSubjectKind, G as SemanticConceptJudgeOptions, H as DEFAULT_COMPLEXITY_WEIGHTS, J as runSemanticConceptJudge, K as SemanticConceptJudgeResult, L as defineTraceAnalyst, M as DspyRlmTraceEngineOptions, N as createDspyRlmTraceEngine, Q as DEFAULT_RUN_SCORE_WEIGHTS, R as ConceptComplexity, T as FindingSubject, U as SEMANTIC_CONCEPT_JUDGE_VERSION, V as ConceptWeightStrategy, W as SemanticConceptJudgeInput, X as RunCriticOptions, Y as RunCritic, Z as RunTrace, _ as FindingsDiff, b as defaultIsMaterial, c as DEFAULT_TRACE_ANALYST_KINDS, d as IMPROVEMENT_KIND_SPEC, et as RunScoreWeights, f as FAILURE_MODE_KIND_SPEC, g as DiffPolicy, h as emitControlIntegrityFindings, l as KNOWLEDGE_POISONING_KIND_SPEC, m as ControlIntegrityAnalyst, n as SkillUsageAnalyst, nt as clamp01, p as CONTROL_INTEGRITY_ANALYST, q as createSemanticConceptJudge, t as SKILL_USAGE_ANALYST, tt as aggregateRunScore, u as KNOWLEDGE_GAP_KIND_SPEC, v as FindingsStore, x as diffFindings, y as PersistedFinding, z as ConceptFinding } from "./skill-usage-CJlWEUFt.js";
5
+ import { $ as RunScore, B as ConceptSpec, E as FindingSubjectKind, G as SemanticConceptJudgeOptions, H as DEFAULT_COMPLEXITY_WEIGHTS, J as runSemanticConceptJudge, K as SemanticConceptJudgeResult, L as defineTraceAnalyst, M as DspyRlmTraceEngineOptions, N as createDspyRlmTraceEngine, Q as DEFAULT_RUN_SCORE_WEIGHTS, R as ConceptComplexity, T as FindingSubject, U as SEMANTIC_CONCEPT_JUDGE_VERSION, V as ConceptWeightStrategy, W as SemanticConceptJudgeInput, X as RunCriticOptions, Y as RunCritic, Z as RunTrace, _ as FindingsDiff, b as defaultIsMaterial, c as DEFAULT_TRACE_ANALYST_KINDS, d as IMPROVEMENT_KIND_SPEC, et as RunScoreWeights, f as FAILURE_MODE_KIND_SPEC, g as DiffPolicy, h as emitControlIntegrityFindings, l as KNOWLEDGE_POISONING_KIND_SPEC, m as ControlIntegrityAnalyst, n as SkillUsageAnalyst, nt as clamp01, p as CONTROL_INTEGRITY_ANALYST, q as createSemanticConceptJudge, t as SKILL_USAGE_ANALYST, tt as aggregateRunScore, u as KNOWLEDGE_GAP_KIND_SPEC, v as FindingsStore, x as diffFindings, y as PersistedFinding, z as ConceptFinding } from "./skill-usage-CO9OLRBx.js";
6
6
  import { C as PendingCostCall, D as costForUsage, E as costForTokenPricing, O as modelPriceKey, S as PaidCallResult, T as RunPaidCallInput, _ as CostReservationExceededError, a as CostChannel, b as CustomTokenPricing, c as CostLedgerHandle, d as CostLedgerPersistenceError, f as CostLedgerSummary, g as CostReceiptInput, h as CostReceiptCaptureError, i as CostCeilingReachedError, l as CostLedgerOptions, m as CostReceipt, n as CostAccountingIncompleteError, o as CostLedger, p as CostProvenance, r as CostCallConflictError, s as CostLedgerFilter, t as ChannelRollup, u as CostLedgerPersistence, v as CostResult, w as PendingCostCallView, x as MaximumCharge, y as CostUsage } from "./cost-ledger-Bv_e8XHY.js";
7
7
  import { C as TraceEvent, D as isSandboxSpan, E as isRetrievalSpan, O as isToolSpan, S as ToolSpan, T as isLlmSpan, _ as Span, a as FAILURE_CLASSES, b as SpanStatus, c as JudgeSpan, d as RetrievalSpan, f as Run, g as SandboxSpan, h as RunStatus, i as EventKind, l as LlmSpan, n as BudgetLedgerEntry, o as FailureClass, p as RunLayer, r as BudgetSpec, s as GenericSpan, t as Artifact, u as Message, v as SpanBase, w as isJudgeSpan, x as TRACE_SCHEMA_VERSION, y as SpanKind } from "./schema-BtVldJ3T.js";
8
- import { a as RunRecord, c as RunTaskFailure, d as isRunRecord, f as modelHasSnapshot, g as validateRunRecord, h as runTaskScore, i as RunOutcome, l as RunTerminalOutcome, m as roundTripRunRecord, n as RunCostProvenance, o as RunRecordValidationError, p as parseRunRecordSafe, r as RunJudgeMetadata, s as RunSplitTag, t as JudgeScoresRecord, u as RunTokenUsage } from "./run-record-DdSa93_W.js";
9
- import { a as ExtractedUsage, c as extractUsageFromResponse, i as ExtractUsageFromSseOptions, l as extractUsageFromSse, n as CaptureFetchOptions, o as SseUsageMode, r as captureFetchToRawSink, s as extractUsage, t as CaptureFetchContext } from "./index-CwDrUMe0.js";
8
+ import { a as RunRecord, c as RunTaskFailure, d as isRunRecord, f as modelHasSnapshot, g as validateRunRecord, h as runTaskScore, i as RunOutcome, l as RunTerminalOutcome, m as roundTripRunRecord, n as RunCostProvenance, o as RunRecordValidationError, p as parseRunRecordSafe, r as RunJudgeMetadata, s as RunSplitTag, t as JudgeScoresRecord, u as RunTokenUsage } from "./run-record-CF4Dwpxr.js";
9
+ import { a as ExtractedUsage, c as extractUsageFromResponse, i as ExtractUsageFromSseOptions, l as extractUsageFromSse, n as CaptureFetchOptions, o as SseUsageMode, r as captureFetchToRawSink, s as extractUsage, t as CaptureFetchContext } from "./index-CQTZ-4XN.js";
10
10
  import { $ as assertLlmRoute, A as ChatClient, At as InMemoryRawProviderSinkOptions, B as SandboxSdkTransportOpts, C as ScenarioFile, Ct as CrossFamilyError, D as TurnMetrics, Dt as FileSystemRawProviderSink, E as Turn, Et as judgeFamily, F as CreateChatClientOpts, Ft as RawProviderSink, G as LlmCallResult, H as LlmCallError, I as CustomTransportOpts, It as RawProviderSinkFilter, J as LlmMessage, K as LlmClient, L as DirectProviderTransportOpts, Lt as defaultProviderRedactor, M as ChatResponse, Mt as ProviderRedactor, N as ChatTransport, Nt as RawProviderDirection, O as TurnResult, Ot as FileSystemRawProviderSinkOptions, P as CliBridgeTransportOpts, Pt as RawProviderEvent, Q as LlmUsage, R as MockTransportOpts, Rt as providerFromBaseUrl, S as Scenario, St as AssertCrossFamilyOptions, T as TestResult, Tt as assertCrossFamily, U as LlmCallMetadata, V as createChatClient, W as LlmCallRequest, X as LlmRouteAssertionError, Y as LlmResponseError, Z as LlmRouteRequirements, _ as PersonaConfig, _t as assertServedModel, a as CheckResult, at as isTransientLlmError, b as RouteMap, bt as normalizeModelId, c as DriverResult, ct as stripFencedJson, d as FeedbackPattern, dt as ModelSubstitutionError, et as backoffMs, f as JudgeConfig, ft as PROBE_MAX_TOKENS, g as JudgeScore, gt as assertCrossFamilyServed, h as JudgeRubric, ht as ServedModelVerdict, i as BenchmarkRunnerConfig, it as costReceiptFromLlmError, j as ChatRequest, jt as NoopRawProviderSink, k as ChatCallOpts, kt as InMemoryRawProviderSink, l as DriverState, lt as AssertCrossFamilyServedOptions, m as JudgeInput, mt as ServedModelCheck, n as ArtifactResult, nt as callLlmJson, o as CollectedArtifacts, ot as maximumChargeForLlmRequest, p as JudgeFn, pt as ServedCrossFamilyError, q as LlmClientOptions, r as BenchmarkReport, rt as costReceiptFromLlm, s as CompletionCriterion, st as probeLlm, t as ArtifactCheck, tt as callLlm, u as EvalResult, ut as AssertServedModelOptions, v as PersonaRigor, vt as assertServedModels, w as ScenarioResult, wt as JudgeFamily, x as RubricDimension, xt as servedModelAcceptable, y as ProductClientConfig, yt as checkServedModel, z as RouterTransportOpts } from "./types-D216SgwM.js";
11
11
  import { a as RunFilter, i as InMemoryTraceStore, n as FileSystemTraceStore, o as SpanFilter, r as FileSystemTraceStoreOptions, s as TraceStore, t as EventFilter } from "./store-CT9YIIve.js";
12
12
  import { a as TraceEmitterOptions, i as TraceEmitter, n as RunCompleteHookContext, o as llmSpanFromProvider, r as SpanHandle, t as RunCompleteHook } from "./emitter-DGQGoLyj.js";
13
13
  import { a as RunIntegrityReport, i as RunIntegrityIssueCode, n as RunIntegrityExpectations, o as assertRunCaptured, r as RunIntegrityIssue, s as throwIfRunIncomplete, t as RunIntegrityError } from "./integrity-BuqEKu-x.js";
14
- import { $ as traceAnalystOnRunComplete, A as stringField, At as OtlpSpanRoleInput, B as TraceInsightReadiness, Bt as exportRunAsOtlp, C as ProjectedOtlpSpan, Ct as createOtelTracingStore, D as inferOtlpKind, Dt as OtelExporter, E as firstStringAttr, Et as OtelExportConfig, F as TraceInsightFinding, Ft as traceSpanKindToOpenInferenceKind, G as defaultTraceInsightPanel, H as TraceInsightTask, I as TraceInsightPanelRole, It as OTEL_AGENT_EVAL_SCOPE, J as inferDomainKeywords, K as describeTraceInsightScope, L as TraceInsightPromptInput, Lt as OtlpExport, M as flattenOtlpExportToNdjson, Mt as applyToolSpanOtlpAttributes, N as OtlpFlatLine, Nt as classifyOtlpSpanRole, O as projectOtlpFlatLine, Ot as createOtelExporter, P as TraceInsightContext, Pt as isOtlpModelCall, Q as TraceAnalystHookOptions, R as TraceInsightQualityGate, Rt as OtlpResourceSpans, S as otlpToTraceRunRecords, St as redactValue, T as extractOtlpAttributes, Tt as ExportableSpan, U as buildTraceInsightContext, V as TraceInsightSuite, W as buildTraceInsightPrompt, X as scoreTraceInsightReadiness, Y as planTraceInsightQuestions, Z as tokenizeDomainWords, _ as OtlpTraceRunRecord, _t as DEFAULT_REDACTION_RULES, a as ReplayFetchOptions, at as TraceFileMissingError, b as otlpRowsToTraceRunRecords, bt as RedactionRule, c as ToolTraceMissingError, ct as AnalyzeTracesInput, d as OtlpFileTraceStoreOptions, dt as analyzeTraces, et as SpanNotFoundError, f as ToolSpansToTraceAnalysisStoreOptions, ft as createBoundedTraceAnalysisStore, g as OtlpToRunRecordsOptions, gt as convertTraceStoresToOtlp, h as TRACE_ANALYST_ACTOR_DESCRIPTION_VERSION, ht as TracesToOtlpResult, i as ReplayCacheStats, it as TraceFileMalformedError, j as FlattenOtlpOptions, jt as ToolSpanOtlpInput, k as readOtlpStatus, kt as OtlpSpanRole, l as toolSpansToTraceAnalysisStore, lt as AnalyzeTracesOptions, m as TRACE_ANALYST_ACTOR_DESCRIPTION, mt as TraceStoreToOtlpOptions, n as ReplayCacheEntry, nt as TraceAnalysisStoreContractError, o as createReplayFetch, ot as TraceFileTooLargeError, p as otlpTextToTraceAnalysisStore, pt as TraceStoreSource, q as domainEvidencePattern, r as ReplayCacheMissError, rt as TraceAnalysisValidationError, s as iterateRawCalls, st as TraceNotFoundError, t as ReplayCache, tt as TraceAnalysisLimitError, u as OtlpFileTraceStore, ut as AnalyzeTracesResult, v as TraceAggregate, vt as REDACTION_VERSION, w as asString, wt as otelRunCompleteHook, x as otlpToRunRecords, xt as redactString, y as otlpRowsToRunRecords, yt as RedactionReport, z as TraceInsightQuestion, zt as OtlpSpan } from "./replay-DFf-teiC.js";
14
+ import { $ as traceAnalystOnRunComplete, A as stringField, At as OtlpSpanRoleInput, B as TraceInsightReadiness, Bt as exportRunAsOtlp, C as ProjectedOtlpSpan, Ct as createOtelTracingStore, D as inferOtlpKind, Dt as OtelExporter, E as firstStringAttr, Et as OtelExportConfig, F as TraceInsightFinding, Ft as traceSpanKindToOpenInferenceKind, G as defaultTraceInsightPanel, H as TraceInsightTask, I as TraceInsightPanelRole, It as OTEL_AGENT_EVAL_SCOPE, J as inferDomainKeywords, K as describeTraceInsightScope, L as TraceInsightPromptInput, Lt as OtlpExport, M as flattenOtlpExportToNdjson, Mt as applyToolSpanOtlpAttributes, N as OtlpFlatLine, Nt as classifyOtlpSpanRole, O as projectOtlpFlatLine, Ot as createOtelExporter, P as TraceInsightContext, Pt as isOtlpModelCall, Q as TraceAnalystHookOptions, R as TraceInsightQualityGate, Rt as OtlpResourceSpans, S as otlpToTraceRunRecords, St as redactValue, T as extractOtlpAttributes, Tt as ExportableSpan, U as buildTraceInsightContext, V as TraceInsightSuite, W as buildTraceInsightPrompt, X as scoreTraceInsightReadiness, Y as planTraceInsightQuestions, Z as tokenizeDomainWords, _ as OtlpTraceRunRecord, _t as DEFAULT_REDACTION_RULES, a as ReplayFetchOptions, at as TraceFileMissingError, b as otlpRowsToTraceRunRecords, bt as RedactionRule, c as ToolTraceMissingError, ct as AnalyzeTracesInput, d as OtlpFileTraceStoreOptions, dt as analyzeTraces, et as SpanNotFoundError, f as ToolSpansToTraceAnalysisStoreOptions, ft as createBoundedTraceAnalysisStore, g as OtlpToRunRecordsOptions, gt as convertTraceStoresToOtlp, h as TRACE_ANALYST_ACTOR_DESCRIPTION_VERSION, ht as TracesToOtlpResult, i as ReplayCacheStats, it as TraceFileMalformedError, j as FlattenOtlpOptions, jt as ToolSpanOtlpInput, k as readOtlpStatus, kt as OtlpSpanRole, l as toolSpansToTraceAnalysisStore, lt as AnalyzeTracesOptions, m as TRACE_ANALYST_ACTOR_DESCRIPTION, mt as TraceStoreToOtlpOptions, n as ReplayCacheEntry, nt as TraceAnalysisStoreContractError, o as createReplayFetch, ot as TraceFileTooLargeError, p as otlpTextToTraceAnalysisStore, pt as TraceStoreSource, q as domainEvidencePattern, r as ReplayCacheMissError, rt as TraceAnalysisValidationError, s as iterateRawCalls, st as TraceNotFoundError, t as ReplayCache, tt as TraceAnalysisLimitError, u as OtlpFileTraceStore, ut as AnalyzeTracesResult, v as TraceAggregate, vt as REDACTION_VERSION, w as asString, wt as otelRunCompleteHook, x as otlpToRunRecords, xt as redactString, y as otlpRowsToRunRecords, yt as RedactionReport, z as TraceInsightQuestion, zt as OtlpSpan } from "./replay-DbhZ4Ked.js";
15
15
  import { C as TOOL_LATENCY_MS, D as asNumber, E as applyLlmSpanOtlpAttributes, O as contextInputTokens, S as TOOL_ARGS_CAPTURED, T as TOOL_NAME_ATTR_KEYS, _ as LlmSpanOtlpInput, a as LLM_CACHE_WRITE_TOKEN_ATTR_KEYS, b as RUN_COST_ATTR_KEYS, c as LLM_COST_USD, d as LLM_MODEL_ATTR_KEYS, f as LLM_MODEL_NAME, g as LLM_REASONING_TOKEN_ATTR_KEYS, h as LLM_REASONING_TOKENS, i as LLM_CACHE_WRITE_TOKENS, k as firstNumberAttr, l as LLM_INPUT_TOKENS, m as LLM_OUTPUT_TOKEN_ATTR_KEYS, n as LLM_CACHED_TOKENS, o as LLM_CONTEXT_TOKENS, p as LLM_OUTPUT_TOKENS, r as LLM_CACHED_TOKEN_ATTR_KEYS, s as LLM_COST_ATTR_KEYS, t as INPUT_VALUE, u as LLM_INPUT_TOKEN_ATTR_KEYS, v as OPENINFERENCE_SPAN_KIND, w as TOOL_NAME, x as SPAN_KIND_ATTR_KEYS, y as OUTPUT_VALUE } from "./attribute-vocabulary-DLJ6303h.js";
16
16
  import { a as judgeSpans, c as runsForScenario, i as hasCapturedToolArgs, l as toolSpans, n as argHash, o as llmSpans, r as groupBy, s as runFailureClass, t as aggregateLlm } from "./query-CJ_DX8vl.js";
17
- import { A as SearchSpanResult, B as ViewSpansResult, C as TRACE_ANALYSIS_LIMITS, D as DatasetOverview, E as DEFAULT_TRACE_ANALYST_BUDGETS, F as TraceAnalystFilters, H as ViewTraceResult, I as TraceAnalystSpan, L as TraceAnalystSpanKind, M as SpanMatchRecord, N as TRACE_ANALYST_TRUNCATION_MARKER_PREFIX, O as ErrorCluster, P as TraceAnalystByteBudgets, R as TraceAnalystSpanStatus, S as BoundedTraceAnalysisStoreOptions, T as TraceAnalysisStoreContext, V as ViewTraceOversized, _ as ProposalFinding, a as AnalystInputKind, b as makeFinding, c as AnalystRunInputs, d as AnalystSeverity, f as AnalystUsageReceipt, g as ExecutionProbeRequest, h as ExecutionProbeOutcome, i as AnalystFinding, j as SearchTraceResult, k as QueryTracesPage, l as AnalystRunResult, m as ExecutionProbe, n as AnalystContext, o as AnalystRequirements, p as EvidenceRef, r as AnalystCost, s as AnalystRunEvent, t as Analyst, u as AnalystRunSummary, v as ProposalFindingOrigin, w as TraceAnalysisStore, x as makeProposalFinding, y as computeFindingId, z as TraceAnalystTraceSummary } from "./types-DF_Udrp-.js";
18
- import { a as createTraceAnalyst, c as runTraceAnalyst, f as BehavioralMetrics, g as computeTraceMetrics, h as SuboptimalSignal, i as TraceAnalystDefinition, m as SuboptimalCode, n as buildDefaultAnalystRegistry, o as renderPriorFindings, p as BehavioralTokenSequence, r as CreateTraceAnalystOptions, s as renderUpstreamFindings, t as DefaultAnalystRegistryOptions } from "./default-registry-BZhStdjl.js";
19
- import { a as ExactAnalystRunPolicySnapshot, c as ExactAnalystSnapshot, d as ExactExecutionComponentSnapshot, i as ExactAnalystRunEvent, l as ExactCapableAnalyst, n as ExactAnalystExecutionPlanSnapshot, o as ExactAnalystRunResult, r as ExactAnalystRunCompletion, s as ExactAnalystRunSummary, t as ExactAnalystBudgetSnapshot, u as ExactExecutionComponentIdentity } from "./exact-types-Djvzosly.js";
20
- import { A as ExactAnalystRunExecutionError, C as jsonHasKeys, D as AnalystRegistryOptions, E as AnalystRegistry, M as RegistryRunOpts, N as assertExactRegistryRunOpts, O as BudgetPolicy, S as containsAll, T as AnalystHooks, _ as ValidationContext, a as ProducedProposal, b as byteLengthRange, c as SatisfiedBy, d as createLlmCorrectnessChecker, f as createTokenRecallChecker, g as ArtifactValidator, h as Artifact$1, i as LlmCorrectnessCheckerOpts, j as ExactRegistryRunOpts, k as ExactAnalystBudgetPolicy, l as TaskGold, m as verifyCompletion, n as CompletionVerdict, o as ProducedState, p as parseCorrectnessResponse, r as CorrectnessChecker, s as RequirementCheck, t as CompletionRequirement, u as completionVerdict, v as ValidationIssue, w as regexMatch, x as composeValidators, y as ValidationResult } from "./completion-verifier-foUCLif_.js";
21
- import { a as ProfileAxisSpec, c as agentProfileModelId, i as HarnessType, l as expandProfileAxes, n as CODING_HARNESSES, o as agentProfileHash, r as HARNESS_NATIVE_MODEL, s as agentProfileId, t as AgentProfile, u as harnessAxisOf } from "./agent-profile-CgDTo40f.js";
22
- import { R as Scenario$1, S as JudgeConfig$1, w as JudgeScore$1 } from "./types-DYuNHo9R.js";
17
+ import { A as SearchSpanResult, B as ViewSpansResult, C as TRACE_ANALYSIS_LIMITS, D as DatasetOverview, E as DEFAULT_TRACE_ANALYST_BUDGETS, F as TraceAnalystFilters, H as ViewTraceResult, I as TraceAnalystSpan, L as TraceAnalystSpanKind, M as SpanMatchRecord, N as TRACE_ANALYST_TRUNCATION_MARKER_PREFIX, O as ErrorCluster, P as TraceAnalystByteBudgets, R as TraceAnalystSpanStatus, S as BoundedTraceAnalysisStoreOptions, T as TraceAnalysisStoreContext, V as ViewTraceOversized, _ as ProposalFinding, a as AnalystInputKind, b as makeFinding, c as AnalystRunInputs, d as AnalystSeverity, f as AnalystUsageReceipt, g as ExecutionProbeRequest, h as ExecutionProbeOutcome, i as AnalystFinding, j as SearchTraceResult, k as QueryTracesPage, l as AnalystRunResult, m as ExecutionProbe, n as AnalystContext, o as AnalystRequirements, p as EvidenceRef, r as AnalystCost, s as AnalystRunEvent, t as Analyst, u as AnalystRunSummary, v as ProposalFindingOrigin, w as TraceAnalysisStore, x as makeProposalFinding, y as computeFindingId, z as TraceAnalystTraceSummary } from "./types-BvDKaULh.js";
18
+ import { a as createTraceAnalyst, c as runTraceAnalyst, f as BehavioralMetrics, g as computeTraceMetrics, h as SuboptimalSignal, i as TraceAnalystDefinition, m as SuboptimalCode, n as buildDefaultAnalystRegistry, o as renderPriorFindings, p as BehavioralTokenSequence, r as CreateTraceAnalystOptions, s as renderUpstreamFindings, t as DefaultAnalystRegistryOptions } from "./default-registry-Bf8Woqmq.js";
19
+ import { a as ExactAnalystRunPolicySnapshot, c as ExactAnalystSnapshot, d as ExactExecutionComponentSnapshot, i as ExactAnalystRunEvent, l as ExactCapableAnalyst, n as ExactAnalystExecutionPlanSnapshot, o as ExactAnalystRunResult, r as ExactAnalystRunCompletion, s as ExactAnalystRunSummary, t as ExactAnalystBudgetSnapshot, u as ExactExecutionComponentIdentity } from "./exact-types-DSFFpLLI.js";
20
+ import { A as ExactAnalystRunExecutionError, C as jsonHasKeys, D as AnalystRegistryOptions, E as AnalystRegistry, M as RegistryRunOpts, N as assertExactRegistryRunOpts, O as BudgetPolicy, S as containsAll, T as AnalystHooks, _ as ValidationContext, a as ProducedProposal, b as byteLengthRange, c as SatisfiedBy, d as createLlmCorrectnessChecker, f as createTokenRecallChecker, g as ArtifactValidator, h as Artifact$1, i as LlmCorrectnessCheckerOpts, j as ExactRegistryRunOpts, k as ExactAnalystBudgetPolicy, l as TaskGold, m as verifyCompletion, n as CompletionVerdict, o as ProducedState, p as parseCorrectnessResponse, r as CorrectnessChecker, s as RequirementCheck, t as CompletionRequirement, u as completionVerdict, v as ValidationIssue, w as regexMatch, x as composeValidators, y as ValidationResult } from "./completion-verifier-DJA5BhPb.js";
21
+ import { a as ProfileAxisSpec, c as agentProfileModelId, i as HarnessType, l as expandProfileAxes, n as CODING_HARNESSES, o as agentProfileHash, r as HARNESS_NATIVE_MODEL, s as agentProfileId, t as AgentProfile, u as harnessAxisOf } from "./agent-profile-DPi7IZg7.js";
22
+ import { R as Scenario$1, S as JudgeConfig$1, w as JudgeScore$1 } from "./types-BnjdJ70P.js";
23
23
  import { a as DatasetScenario, c as SliceOptions, i as DatasetProvenance, l as hashScenarios, n as DatasetDifficulty, o as DatasetSplit, r as DatasetManifest, s as HoldoutLockedError, t as Dataset } from "./dataset-C8xaLXdY.js";
24
24
  import { $ as pairedCohensDz, A as WeightedCompositeInput, At as positionalBias, B as eProcess, C as RankTestMethod, Ct as GoldenItem, D as ScoreRiskDifferenceResult, Dt as calibrateJudge, E as RiskDifferenceResult, Et as VerbosityBiasResult, F as cliffsDelta, G as mannWhitneyU, H as interRaterReliability, I as cohensD, J as mcnemarRequiredN, K as mcnemar, L as confidenceInterval, M as WilcoxonSignedRankResult, Mt as verbosityBias, N as benjaminiHochberg, O as SignTestAlternative, Ot as calibrateJudgeContinuous, P as bonferroni, Q as pairedBootstrap, R as corpusInterRaterAgreement, S as ProportionInterval, St as ContinuousCalibrationResult, T as RankTestOptions, Tt as SelfPreferenceResult, U as interpretCliffs, V as holm, W as isBinaryOutcomeVector, X as normalizeScores, Y as mulberry32, Z as pairedBinaryScale, _ as McNemarResult, _t as wilson, a as CorpusAgreementReport, at as pairedSignTest, b as PairedSignTestResult, bt as ContinuousAgreement, c as DEFAULT_PERMUTATIONS, ct as passAtK, d as EProcessState, dt as requiredPairedSampleSize, et as pairedDeltaTieFraction, f as EProcessStep, ft as requiredSampleSize, g as MannWhitneyResult, gt as wilcoxonSignedRank, h as MANN_WHITNEY_EXACT_MAX_WORK, ht as weightedMean, i as CorpusAgreementPerDimension, it as pairedRiskDifferenceScore, j as WeightedCompositeResult, jt as selfPreference, k as WILCOXON_EXACT_MAX_N, kt as continuousAgreement, l as EProcess, lt as pearsonR, m as MANN_WHITNEY_EXACT_MAX_STATES, mt as weightedComposite, n as CliffsMagnitude, nt as pairedRiskDifference, o as CorpusScoreRecord, ot as pairedTTest, p as ExactRiskDifferenceResult, pt as spearmanR, q as mcnemarPower, r as CorpusAgreementOptions, rt as pairedRiskDifferenceExact, s as DECISION_PAIRED_DELTA_STATISTIC, st as partialCredit, t as BOOTSTRAP_GATE_MIN_N, tt as pairedMde, u as EProcessOptions, ut as ranks, v as PairedBootstrapOptions, vt as CalibrationResult, w as RankTestMethodRequest, wt as PositionalBiasResult, x as PairedTTestResult, xt as ContinuousAgreementOptions, y as PairedBootstrapResult, yt as CandidateScore, z as corpusInterRaterAgreementFromJudgeScores } from "./statistics-D6Uebe_4.js";
25
25
  import { a as PairedPromotionDecision, c as pairedDecisionShape, i as PairedMcNemarEvidence, n as PairedDecisionShape, o as PairedPromotionDecisionOptions, r as PairedDecisionStatistic, s as decidePairedPromotion, t as PairedDecisionMethod } from "./paired-promotion-decision-B6zJ3gYM.js";
26
- import { C as HeldOutGate, E as SplitCoverage, S as GateEvidence, T as HeldOutGateRejectionCode, _ as paretoChart, a as ParetoPoint, b as DeltaStatistic, c as ResearchReportCandidate, d as ResearchReportOptions, f as ResearchReportRecommendation, g as gainHistogram, h as SummaryTableRow, i as ParetoFigureSpec, l as ResearchReportDecision, m as SummaryTableOptions, n as GainDistributionFigureSpec, o as RESEARCH_REPORT_HARD_PAIR_FLOOR, p as SummaryTable, r as GainDistributionOptions, s as ResearchReport, t as GainDistributionBin, u as ResearchReportMethodology, v as researchReport, w as HeldOutGateConfig, x as GateDecision, y as summaryTable } from "./summary-report-DuUS_i7W.js";
26
+ import { C as HeldOutGate, E as SplitCoverage, S as GateEvidence, T as HeldOutGateRejectionCode, _ as paretoChart, a as ParetoPoint, b as DeltaStatistic, c as ResearchReportCandidate, d as ResearchReportOptions, f as ResearchReportRecommendation, g as gainHistogram, h as SummaryTableRow, i as ParetoFigureSpec, l as ResearchReportDecision, m as SummaryTableOptions, n as GainDistributionFigureSpec, o as RESEARCH_REPORT_HARD_PAIR_FLOOR, p as SummaryTable, r as GainDistributionOptions, s as ResearchReport, t as GainDistributionBin, u as ResearchReportMethodology, v as researchReport, w as HeldOutGateConfig, x as GateDecision, y as summaryTable } from "./summary-report-BNR7DWTj.js";
27
27
  import { a as FailureClassification, c as classifyFailure, i as DEFAULT_RULES, o as FailureContext, s as FailureRule } from "./failure-cluster-CqcvCcdR.js";
28
- import { C as toOpenAiTool, S as makeEvalTools, _ as TraceAnalysisToolDescriptor, a as TraceAnalystLimits, b as EvalToolDef, d as RawAnalystFinding, g as TRACE_ANALYST_TOOL_NAMESPACE, h as BuildTraceAnalysisToolsOptions, i as TraceAnalysisEngineResult, l as RawAnalystEvidence, n as TraceAnalysisEngine, o as resolveTraceAnalystLimits, r as TraceAnalysisEngineRequest, t as DEFAULT_TRACE_ANALYST_LIMITS, v as buildTraceAnalysisToolDescriptors, x as MakeEvalToolsConfig, y as traceAnalystFunctionGroup } from "./engine-nB64f48I.js";
28
+ import { C as toOpenAiTool, S as makeEvalTools, _ as TraceAnalysisToolDescriptor, a as TraceAnalystLimits, b as EvalToolDef, d as RawAnalystFinding, g as TRACE_ANALYST_TOOL_NAMESPACE, h as BuildTraceAnalysisToolsOptions, i as TraceAnalysisEngineResult, l as RawAnalystEvidence, n as TraceAnalysisEngine, o as resolveTraceAnalystLimits, r as TraceAnalysisEngineRequest, t as DEFAULT_TRACE_ANALYST_LIMITS, v as buildTraceAnalysisToolDescriptors, x as MakeEvalToolsConfig, y as traceAnalystFunctionGroup } from "./engine-3hL-XqwJ.js";
29
29
  import { A as isTrainableSplit, D as assertRolloutLine, E as assertMintedLines, T as assertMinted, b as RolloutSplit, h as RolloutLine, i as ChatToolCall, j as validateRolloutLine, k as isRolloutLine, n as ChatMessage, o as MintedRolloutLine, p as RolloutCapture, s as MintedRolloutOutcome, u as ROLLOUT_SCHEMA, w as ToolDef, x as RolloutStep, y as RolloutRole } from "./schema-Cef2cFmb2.js";
30
30
  import { C as Unavailable, D as showMeasured, E as isUnavailable, S as SupervisorRunTreeGapCode, _ as SupervisorRunReport, b as SupervisorRunTree, f as SUPERVISOR_RUN_SCHEMA, g as SupervisorRunReader, h as SupervisorRunNodeRole, p as SourceLimits, r as Measured, v as SupervisorRunRollup, x as SupervisorRunTreeGap, y as SupervisorRunSources } from "./types-D4mog56g.js";
31
- import { B as BenchmarkSource, F as BenchmarkDatasetItem, H as deterministicSplit, I as BenchmarkEvaluation, L as BenchmarkFamily, N as BENCHMARK_SPLIT_SEED, P as BenchmarkAdapter, R as BenchmarkResponder, V as BenchmarkTaskKind, t as index_d_exports, z as BenchmarkScenario } from "./index-C5HOo4ZF2.js";
32
- import { $ as redTeamDataset, J as RedTeamCase, Q as RedTeamReport, X as RedTeamFinding, Y as RedTeamCategory, Z as RedTeamPayload, an as ReferenceEquivalenceScenario, at as CanaryKind, cn as LlmJudgeDimension, ct as CanarySeverity, en as REFERENCE_EQUIVALENCE_INPUT_LIMITS, et as redTeamReport, in as ReferenceEquivalenceJudgeResult, it as CanaryEvaluation, ln as LlmJudgeOptions, lt as runCanaries, nn as ReferenceEquivalenceJudgeInput, nt as toolNamesForRun, on as createReferenceEquivalenceJudge, ot as CanaryOptions, q as DEFAULT_RED_TEAM_CORPUS, rn as ReferenceEquivalenceJudgeOptions, rt as CanaryAlert, sn as runReferenceEquivalenceJudge, st as CanaryReport, tn as REFERENCE_EQUIVALENCE_JUDGE_VERSION, tt as scoreRedTeamOutput, un as llmJudge } from "./skillopt-optimization-method-BO7NAl3b.js";
33
- import { $t as ToolCallEventLike, Gt as BackendIntegrityReport, Jt as summarizeAgentReceiptIntegrity, Kt as assertRealAgentReceipts, Qt as RuntimeEventLike, Wt as BackendIntegrityError, Xt as ArtifactEventLike, Yt as summarizeBackendIntegrity, Zt as ProposalEventLike, en as extractProducedState, qt as assertRealBackend } from "./index-Sh2I0DRc.js";
34
- import { A as PairArmsResult, C as hashJson, D as MatchedPair, E as ComparePairedArmsOptions, F as PairedMetricDelta, I as comparePairedArms, L as pairArms, M as PairedArmRow, N as PairedArmsComparison, O as MatchedRunRecordPair, P as PairedCorrectness, R as pairRunRecords, S as evaluateHypothesis, T as verifyManifest, _ as HypothesisManifest, b as SignedManifestAlgo, j as PairRunRecordsResult, k as PairArmsOptions, v as HypothesisResult, w as signManifest, x as canonicalize, y as SignedManifest } from "./statistical-heldout-Dn9ruizm.js";
35
- import { _ as paretoFrontier, f as Direction, g as dominates, h as crowdingDistance, m as ParetoResult, p as Objective, v as paretoFrontierWithCrowding, y as scalarScore } from "./promotion-policy-ChWhTDBH.js";
31
+ import { B as BenchmarkSource, F as BenchmarkDatasetItem, H as deterministicSplit, I as BenchmarkEvaluation, L as BenchmarkFamily, N as BENCHMARK_SPLIT_SEED, P as BenchmarkAdapter, R as BenchmarkResponder, V as BenchmarkTaskKind, t as index_d_exports, z as BenchmarkScenario } from "./index-CLKMJTJF2.js";
32
+ import { $ as redTeamDataset, J as RedTeamCase, Q as RedTeamReport, X as RedTeamFinding, Y as RedTeamCategory, Z as RedTeamPayload, an as ReferenceEquivalenceScenario, at as CanaryKind, cn as LlmJudgeDimension, ct as CanarySeverity, en as REFERENCE_EQUIVALENCE_INPUT_LIMITS, et as redTeamReport, in as ReferenceEquivalenceJudgeResult, it as CanaryEvaluation, ln as LlmJudgeOptions, lt as runCanaries, nn as ReferenceEquivalenceJudgeInput, nt as toolNamesForRun, on as createReferenceEquivalenceJudge, ot as CanaryOptions, q as DEFAULT_RED_TEAM_CORPUS, rn as ReferenceEquivalenceJudgeOptions, rt as CanaryAlert, sn as runReferenceEquivalenceJudge, st as CanaryReport, tn as REFERENCE_EQUIVALENCE_JUDGE_VERSION, tt as scoreRedTeamOutput, un as llmJudge } from "./skillopt-optimization-method-D8wysvU1.js";
33
+ import { $t as ToolCallEventLike, Gt as BackendIntegrityReport, Jt as summarizeAgentReceiptIntegrity, Kt as assertRealAgentReceipts, Qt as RuntimeEventLike, Wt as BackendIntegrityError, Xt as ArtifactEventLike, Yt as summarizeBackendIntegrity, Zt as ProposalEventLike, en as extractProducedState, qt as assertRealBackend } from "./index-CBEMKO8d.js";
34
+ import { A as PairArmsResult, C as hashJson, D as MatchedPair, E as ComparePairedArmsOptions, F as PairedMetricDelta, I as comparePairedArms, L as pairArms, M as PairedArmRow, N as PairedArmsComparison, O as MatchedRunRecordPair, P as PairedCorrectness, R as pairRunRecords, S as evaluateHypothesis, T as verifyManifest, _ as HypothesisManifest, b as SignedManifestAlgo, j as PairRunRecordsResult, k as PairArmsOptions, v as HypothesisResult, w as signManifest, x as canonicalize, y as SignedManifest } from "./statistical-heldout-TQ-4CYiN.js";
35
+ import { _ as paretoFrontier, f as Direction, g as dominates, h as crowdingDistance, m as ParetoResult, p as Objective, v as paretoFrontierWithCrowding, y as scalarScore } from "./promotion-policy-Ckjhzg_4.js";
36
36
  import { _ as vitestTestParser, a as DockerSandboxDriver, c as SandboxHarness, d as SubprocessSandboxDriver, f as SubprocessSandboxDriverOptions, g as pytestTestParser, h as jestTestParser, i as runTestGradedScenario, l as SandboxHarnessResult, m as composeParsers, n as TestGradedRunResult, o as HarnessConfig, p as TestOutputParser, r as TestGradedScenario, s as SandboxDriver, t as TestGradedRunOptions, u as SandboxResult } from "./test-graded-scenario-D1TaI2va.js";
37
- import { $ as ControlRunResult, A as feedbackTrajectoryToOptimizerRow, B as AnalystReviewCounts, C as analystRunToReviewRequests, D as feedbackTrajectoriesToDatasetScenarios, E as createFeedbackTrajectory, F as serializeFeedbackTrajectoriesJsonl, G as analystFindingDigest, H as AnalystReviewQuality, I as summarizePreferenceMemory, J as ControlActionOutcome, K as analystRunDigest, L as withAssignedFeedbackSplit, M as renderPreferenceMemoryMarkdown, N as replayFeedbackTrajectories, O as feedbackTrajectoriesToOptimizerRows, P as replayFeedbackTrajectory, Q as ControlEvalResult, R as AnalystFindingDigest, S as analystRunToFeedbackTrajectory, T as controlRunToFeedbackTrajectory, U as AnalystReviewSource, V as AnalystReviewDecision, W as AnalystRunDigest, X as ControlContext, Y as ControlBudget, Z as ControlDecision, _ as FeedbackTrajectoryStore, a as FeedbackLabel, at as StopDecision, b as PreferenceMemoryEntry, c as FeedbackOptimizerRow, ct as runAgentControlLoop, d as FeedbackReplayResult, dt as subjectiveEval, et as ControlRuntimeConfig, f as FeedbackSeverity, g as FeedbackTrajectoryFilter, h as FeedbackTrajectory, i as FeedbackAttempt, it as ControlStopPolicies, j as parseFeedbackTrajectoriesJsonl, k as feedbackTrajectoryToDatasetScenario, l as FeedbackOutcome, lt as stopOnNoProgress, m as FeedbackTask, n as AnalystReviewRequest, nt as ControlSeverity, o as FeedbackLabelKind, ot as allCriticalPassed, p as FeedbackSplitPolicy, q as ControlActionFailureMode, r as FeedbackArtifactType, rt as ControlStep, s as FeedbackLabelSource, st as objectiveEval, t as AnalystFeedbackTrajectoryOptions, tt as ControlRuntimeError, u as FeedbackReplayAdapter, ut as stopOnRepeatedAction, v as FileSystemFeedbackTrajectoryStore, w as assignFeedbackSplit, x as ProposedSideEffect, y as InMemoryFeedbackTrajectoryStore, z as AnalystMissedIssue } from "./feedback-trajectory-Rh280oXo.js";
38
- import { A as ActionExecutionPolicy, C as ReviewMemoryStore, D as inMemoryReviewStore, E as createLlmReviewer, M as evaluateActionPolicy, O as jsonlReviewStore, S as ReviewMemoryEntry, T as VerifyFn, _ as ProposeReviewReport, a as ProposeReviewControlAction, b as ReviewFn, c as ProposeReviewControlState, d as LlmJsonCall, f as LlmReviewerConfig, g as ProposeReviewConfig, h as ProposeOutput, i as scoreFromEvals, j as ActionPolicyDecision, k as runProposeReview, l as controlFailureClassFromVerification, m as ProposeInput, n as RunEvidenceMetadata, o as ProposeReviewControlConfig, p as ProposeFn, r as controlRunToRunRecord, s as ProposeReviewControlResult, t as ControlRunToRunRecordOptions, u as runProposeReviewAsControlLoop, v as ProposeReviewShot, w as Verification, x as ReviewInput, y as Review } from "./run-evidence-BDFFai9R.js";
37
+ import { $ as ControlRunResult, A as feedbackTrajectoryToOptimizerRow, B as AnalystReviewCounts, C as analystRunToReviewRequests, D as feedbackTrajectoriesToDatasetScenarios, E as createFeedbackTrajectory, F as serializeFeedbackTrajectoriesJsonl, G as analystFindingDigest, H as AnalystReviewQuality, I as summarizePreferenceMemory, J as ControlActionOutcome, K as analystRunDigest, L as withAssignedFeedbackSplit, M as renderPreferenceMemoryMarkdown, N as replayFeedbackTrajectories, O as feedbackTrajectoriesToOptimizerRows, P as replayFeedbackTrajectory, Q as ControlEvalResult, R as AnalystFindingDigest, S as analystRunToFeedbackTrajectory, T as controlRunToFeedbackTrajectory, U as AnalystReviewSource, V as AnalystReviewDecision, W as AnalystRunDigest, X as ControlContext, Y as ControlBudget, Z as ControlDecision, _ as FeedbackTrajectoryStore, a as FeedbackLabel, at as StopDecision, b as PreferenceMemoryEntry, c as FeedbackOptimizerRow, ct as runAgentControlLoop, d as FeedbackReplayResult, dt as subjectiveEval, et as ControlRuntimeConfig, f as FeedbackSeverity, g as FeedbackTrajectoryFilter, h as FeedbackTrajectory, i as FeedbackAttempt, it as ControlStopPolicies, j as parseFeedbackTrajectoriesJsonl, k as feedbackTrajectoryToDatasetScenario, l as FeedbackOutcome, lt as stopOnNoProgress, m as FeedbackTask, n as AnalystReviewRequest, nt as ControlSeverity, o as FeedbackLabelKind, ot as allCriticalPassed, p as FeedbackSplitPolicy, q as ControlActionFailureMode, r as FeedbackArtifactType, rt as ControlStep, s as FeedbackLabelSource, st as objectiveEval, t as AnalystFeedbackTrajectoryOptions, tt as ControlRuntimeError, u as FeedbackReplayAdapter, ut as stopOnRepeatedAction, v as FileSystemFeedbackTrajectoryStore, w as assignFeedbackSplit, x as ProposedSideEffect, y as InMemoryFeedbackTrajectoryStore, z as AnalystMissedIssue } from "./feedback-trajectory-CacHpxsp.js";
38
+ import { A as ActionExecutionPolicy, C as ReviewMemoryStore, D as inMemoryReviewStore, E as createLlmReviewer, M as evaluateActionPolicy, O as jsonlReviewStore, S as ReviewMemoryEntry, T as VerifyFn, _ as ProposeReviewReport, a as ProposeReviewControlAction, b as ReviewFn, c as ProposeReviewControlState, d as LlmJsonCall, f as LlmReviewerConfig, g as ProposeReviewConfig, h as ProposeOutput, i as scoreFromEvals, j as ActionPolicyDecision, k as runProposeReview, l as controlFailureClassFromVerification, m as ProposeInput, n as RunEvidenceMetadata, o as ProposeReviewControlConfig, p as ProposeFn, r as controlRunToRunRecord, s as ProposeReviewControlResult, t as ControlRunToRunRecordOptions, u as runProposeReviewAsControlLoop, v as ProposeReviewShot, w as Verification, x as ReviewInput, y as Review } from "./run-evidence-Dhi3C81V.js";
39
39
  import { C as ClusteredPairedBinaryOptions, E as clusteredPairedBinary, S as ClusteredMatchedPair, T as ClusteredPairedBinaryStatistics, _ as inMemoryExperimentStore, a as ExperimentStats, b as ClusterSignFlipResult, c as ExperimentTrackerOptions, d as ImprovementVerdictResult, f as ProvenanceReader, g as improvementVerdict, h as gitProvenanceReader, i as ExperimentRep, l as ExperimentVerdict, m as fileExperimentStore, n as Experiment, o as ExperimentStore, p as computeExperimentStats, r as ExperimentProvenance, s as ExperimentTracker, t as CreateExperimentInput, u as ImprovementThresholds, v as ClusterBootstrapInterval, w as ClusteredPairedBinaryResult, x as ClusteredBinaryCluster, y as ClusterSignFlipAlternative } from "./experiment-tracker-IMntXr6J.js";
40
40
  import { a as PairedEvalueStep, c as pairedEvalueSequence, i as PairedEvalueSequence, n as InterimReleaseConfidenceInput, o as SequentialDecision, r as PairedEvalueOptions, s as evaluateInterimReleaseConfidence, t as InterimReleaseConfidence } from "./sequential-CYwq6Ff_.js";
41
- import { _ as ReleaseConfidenceStatus, a as JudgeReplayGateArgs, b as assertReleaseConfidence, c as judgeReplayGate, d as ReleaseConfidenceAxis, f as ReleaseConfidenceAxisName, g as ReleaseConfidenceScorecard, h as ReleaseConfidenceMetrics, i as BootstrapResult, l as ActionableSideInfo, m as ReleaseConfidenceIssue, n as renderReleaseReport, o as Verdict, p as ReleaseConfidenceInput, r as BootstrapOptions, s as bootstrapCi, t as RenderReleaseReportOptions, u as AsiSeverity, v as ReleaseConfidenceThresholds, x as evaluateReleaseConfidence, y as ReleaseTraceEvidence } from "./release-report-CI8uisI1.js";
42
- import { $ as ScoreOrigin, $t as toSftRows, Ct as HarborSubagentTrajectoryRef, Dt as relabelImportedSplit, Et as fromHarborTrajectory, Gt as SftRow, Ht as RewardRow, J as MintRolloutOptions, Ot as toHarborTrajectories, Q as unmintableReasons, St as HarborStepSource, Tt as HarborTrajectory, Wt as SftExportOptions, X as RolloutScrubber, Xt as toRewardRows, Y as MintRolloutResult, Yt as toJsonl, Z as mintRolloutRows, _t as HarborImageSource, at as trainingReward, bt as HarborObservationResult, dt as ATIF_SCHEMA_VERSION, et as ScorePreference, ft as FromHarborOptions, gt as HarborFinalMetrics, ht as HarborContentPart, it as scoreOrigin, kt as toHarborTrajectory, mt as HarborAgent, nt as observedScore, ot as trainingScore, pt as HARBOR_IMPORT_GAP, rt as observedSplitScore, tt as isRealnessGated, vt as HarborMetrics, wt as HarborToolCall, xt as HarborStep, yt as HarborObservation } from "./index-CvXXlyz7.js";
41
+ import { _ as ReleaseConfidenceStatus, a as JudgeReplayGateArgs, b as assertReleaseConfidence, c as judgeReplayGate, d as ReleaseConfidenceAxis, f as ReleaseConfidenceAxisName, g as ReleaseConfidenceScorecard, h as ReleaseConfidenceMetrics, i as BootstrapResult, l as ActionableSideInfo, m as ReleaseConfidenceIssue, n as renderReleaseReport, o as Verdict, p as ReleaseConfidenceInput, r as BootstrapOptions, s as bootstrapCi, t as RenderReleaseReportOptions, u as AsiSeverity, v as ReleaseConfidenceThresholds, x as evaluateReleaseConfidence, y as ReleaseTraceEvidence } from "./release-report-DA2BCu5a.js";
42
+ import { $ as ScoreOrigin, $t as toSftRows, Ct as HarborSubagentTrajectoryRef, Dt as relabelImportedSplit, Et as fromHarborTrajectory, Gt as SftRow, Ht as RewardRow, J as MintRolloutOptions, Ot as toHarborTrajectories, Q as unmintableReasons, St as HarborStepSource, Tt as HarborTrajectory, Wt as SftExportOptions, X as RolloutScrubber, Xt as toRewardRows, Y as MintRolloutResult, Yt as toJsonl, Z as mintRolloutRows, _t as HarborImageSource, at as trainingReward, bt as HarborObservationResult, dt as ATIF_SCHEMA_VERSION, et as ScorePreference, ft as FromHarborOptions, gt as HarborFinalMetrics, ht as HarborContentPart, it as scoreOrigin, kt as toHarborTrajectory, mt as HarborAgent, nt as observedScore, ot as trainingScore, pt as HARBOR_IMPORT_GAP, rt as observedSplitScore, tt as isRealnessGated, vt as HarborMetrics, wt as HarborToolCall, xt as HarborStep, yt as HarborObservation } from "./index-BnEuDAK2.js";
43
43
  import { C as SupervisorRunIntegrityIssue, D as SupervisorRunIntegritySeverity, E as SupervisorRunIntegrityReport, F as analyzeSupervisorRunSources, L as rollupSupervisorRuns, N as claudeCodeSupervisorRunReader, O as SupervisorRunSourceOnlyCheckCode, P as readClaudeCodeSupervisorRun, S as SupervisorRunIntegrityEvidence, T as SupervisorRunIntegrityOptions, a as supervisorRunRolloutLines, b as analyzeSupervisorRunIntegrity, c as renderSupervisorRunMarkdown, d as analyzeSupervisorRun, n as readRuntimeSupervisorRun, r as runtimeSupervisorRunReader, s as renderSupervisorRunHeadline, t as isRuntimeSupervisorRunDir, v as writeSupervisorRunReport, w as SupervisorRunIntegrityIssueCode, x as SUPERVISOR_RUN_INTEGRITY_SCHEMA } from "./index-BZ3-y4YL.js";
44
44
  import { a as WelchTestResult, c as iqr, d as ToolUseMetrics, f as ToolUseOptions, i as MetricVerdict, l as welchsTTest, n as BaselineReport, o as WelchTestStatus, p as computeToolUseMetrics, r as MetricSamples, s as compareToBaseline, t as BaselineOptions, u as ToolStats } from "./baseline-CavEbRyH.js";
45
45
  import { n as TrajectoryStep, r as buildTrajectory, t as Trajectory } from "./trajectory-YC15QDYQ.js";
46
46
  import { n as SeriesConvergenceResult, r as analyzeSeries, t as SeriesConvergenceOptions } from "./series-convergence-ofsqPWhs.js";
47
47
  import { a as attributeCounterfactuals, i as CounterfactualRunner, n as CounterfactualMutation, o as runCounterfactual, r as CounterfactualResult, t as CounterfactualContext } from "./counterfactual-CxmxAONP.js";
48
- import { _ as EvalCampaignResult, a as FailureMode, c as SteeringChange, d as CampaignRunContext, f as CampaignRunOutcome, g as EvalCampaignOptions, h as CampaignVariant, i as ExperimentResult, l as CampaignFactoryParams, m as CampaignScenario, n as CallbackResearcherOptions, o as NoopResearcher, p as CampaignRunner, r as ExperimentPlan, s as Researcher, t as CallbackResearcher, u as CampaignIntegrityPolicy, v as FailedRun, y as runEvalCampaign } from "./researcher-BoaxeCzP.js";
48
+ import { _ as EvalCampaignResult, a as FailureMode, c as SteeringChange, d as CampaignRunContext, f as CampaignRunOutcome, g as EvalCampaignOptions, h as CampaignVariant, i as ExperimentResult, l as CampaignFactoryParams, m as CampaignScenario, n as CallbackResearcherOptions, o as NoopResearcher, p as CampaignRunner, r as ExperimentPlan, s as Researcher, t as CallbackResearcher, u as CampaignIntegrityPolicy, v as FailedRun, y as runEvalCampaign } from "./researcher-BchpD55R.js";
49
49
  //#region src/auto-pr.d.ts
50
50
  /**
51
51
  * Automated pull-request transports for the production loop.
package/dist/index.js CHANGED
@@ -1,5 +1,5 @@
1
1
  import { t as __exportAll } from "./rolldown-runtime-8H4AJuhK.js";
2
- import { _ as observeAll, a as jsonlReviewStore, c as scoreFromEvals, d as runAgentControlLoop, f as stopOnNoProgress, g as noProgressDetector, h as errorStreakDetector, i as inMemoryReviewStore, l as allCriticalPassed, m as subjectiveEval, n as runProposeReviewAsControlLoop, o as runProposeReview, p as stopOnRepeatedAction, r as createLlmReviewer, s as controlRunToRunRecord, t as controlFailureClassFromVerification, u as objectiveEval, v as repeatedActionDetector, y as evaluateActionPolicy } from "./propose-review-control-qgWLA6E9.js";
2
+ import { _ as observeAll, a as jsonlReviewStore, c as scoreFromEvals, d as runAgentControlLoop, f as stopOnNoProgress, g as noProgressDetector, h as errorStreakDetector, i as inMemoryReviewStore, l as allCriticalPassed, m as subjectiveEval, n as runProposeReviewAsControlLoop, o as runProposeReview, p as stopOnRepeatedAction, r as createLlmReviewer, s as controlRunToRunRecord, t as controlFailureClassFromVerification, u as objectiveEval, v as repeatedActionDetector, y as evaluateActionPolicy } from "./propose-review-control-dSNPjFUH.js";
3
3
  import { a as LimitExceededError, c as ValidationError, i as JudgeError, l as VerificationError, n as CaptureIntegrityError, o as NotFoundError, r as ConfigError, s as ReplayError, t as AgentEvalError } from "./errors-D-LKuDhb.js";
4
4
  import { a as verifyManifest, i as signManifest, n as evaluateHypothesis, r as hashJson, t as canonicalize } from "./pre-registration-DakwTRXk.js";
5
5
  import { AGENT_PROFILE_KINDS, AgentProfileCellValidationError, agentProfileCellHashMaterial, agentProfileCellKey, assertRunAgentProfileCell, buildAgentInterfaceProfileCell, buildAgentProfileCell, groupRunsByAgentProfileCell, requireAgentProfileCell, toAgentProfileJson, validateAgentProfileCell, verifyAgentProfileCell } from "./profile-cell.js";
@@ -19,27 +19,27 @@ import { a as RunCritic, d as defaultIsMaterial, f as diffFindings, h as defineT
19
19
  import { a as inMemoryVerdictCache, i as fileVerdictCache, n as canonicalJson, r as contentHash, t as cachedJudge } from "./verdict-cache-BCcOh0kF.js";
20
20
  import { t as createDspyRlmTraceEngine } from "./dspy-rlm-engine-BiN49gK6.js";
21
21
  import { f as Mutex, p as mapConcurrent } from "./ledger-core-DXZIqu17.js";
22
- import { $ as runReferenceEquivalenceJudge, L as DEFAULT_MUTATION_PRIMITIVES, M as surfaceContentHash, Q as createReferenceEquivalenceJudge, R as buildReflectionPrompt, X as REFERENCE_EQUIVALENCE_INPUT_LIMITS, Z as REFERENCE_EQUIVALENCE_JUDGE_VERSION, _t as assertRealBackend, at as Dataset, bt as JudgeParseError, ct as llmJudge, dt as paretoFrontier, et as DEFAULT_RED_TEAM_CORPUS, ft as paretoFrontierWithCrowding, gt as assertRealAgentReceipts, ht as BackendIntegrityError, it as toolNamesForRun, lt as crowdingDistance, nt as redTeamReport, ot as HoldoutLockedError, pt as scalarScore, rt as scoreRedTeamOutput, st as hashScenarios, tt as redTeamDataset, ut as dominates, vt as summarizeAgentReceiptIntegrity, y as runCanaries, yt as summarizeBackendIntegrity, z as parseReflectionResponse } from "./skillopt-optimization-method-CQwZ-ZX8.js";
22
+ import { $ as runReferenceEquivalenceJudge, L as DEFAULT_MUTATION_PRIMITIVES, M as surfaceContentHash, Q as createReferenceEquivalenceJudge, R as buildReflectionPrompt, X as REFERENCE_EQUIVALENCE_INPUT_LIMITS, Z as REFERENCE_EQUIVALENCE_JUDGE_VERSION, _t as assertRealBackend, at as Dataset, bt as JudgeParseError, ct as llmJudge, dt as paretoFrontier, et as DEFAULT_RED_TEAM_CORPUS, ft as paretoFrontierWithCrowding, gt as assertRealAgentReceipts, ht as BackendIntegrityError, it as toolNamesForRun, lt as crowdingDistance, nt as redTeamReport, ot as HoldoutLockedError, pt as scalarScore, rt as scoreRedTeamOutput, st as hashScenarios, tt as redTeamDataset, ut as dominates, vt as summarizeAgentReceiptIntegrity, y as runCanaries, yt as summarizeBackendIntegrity, z as parseReflectionResponse } from "./skillopt-optimization-method-Dtzp7QpP.js";
23
23
  import { $ as selfPreference, A as pairedRiskDifference, B as requiredSampleSize, C as mulberry32, D as pairedCohensDz, E as pairedBootstrap, F as partialCredit, G as wilson, H as weightedComposite, I as passAtK, J as normalCdf, K as studentTCdf, L as pearsonR, M as pairedRiskDifferenceScore, N as pairedSignTest, O as pairedDeltaTieFraction, P as pairedTTest, Q as positionalBias, R as ranks, S as mcnemarRequiredN, T as pairedBinaryScale, U as weightedMean, V as spearmanR, W as wilcoxonSignedRank, X as calibrateJudgeContinuous, Y as calibrateJudge, Z as continuousAgreement, _ as interpretCliffs, a as MANN_WHITNEY_EXACT_MAX_WORK, b as mcnemar, c as bonferroni, d as confidenceInterval, et as verbosityBias, f as corpusInterRaterAgreement, g as interRaterReliability, h as holm, i as MANN_WHITNEY_EXACT_MAX_STATES, j as pairedRiskDifferenceExact, k as pairedMde, l as cliffsDelta, m as eProcess, n as DECISION_PAIRED_DELTA_STATISTIC, o as WILCOXON_EXACT_MAX_N, p as corpusInterRaterAgreementFromJudgeScores, r as DEFAULT_PERMUTATIONS, s as benjaminiHochberg, t as BOOTSTRAP_GATE_MIN_N, u as cohensD, v as isBinaryOutcomeVector, w as normalizeScores, x as mcnemarPower, y as mannWhitneyU, z as requiredPairedSampleSize } from "./statistics-ByxzSiOM.js";
24
24
  import { n as pairArms, r as pairRunRecords, t as comparePairedArms } from "./paired-arms-iZ08VFMN.js";
25
25
  import { a as improvementVerdict, i as gitProvenanceReader, n as computeExperimentStats, o as inMemoryExperimentStore, r as fileExperimentStore, s as clusteredPairedBinary, t as ExperimentTracker } from "./experiment-tracker-CnRICnMl.js";
26
26
  import { n as llmSpanFromProvider, t as TraceEmitter } from "./emitter-CPBAhxum.js";
27
27
  import { a as isRetrievalSpan, i as isLlmSpan, n as TRACE_SCHEMA_VERSION, o as isSandboxSpan, r as isJudgeSpan, s as isToolSpan, t as FAILURE_CLASSES } from "./schema-CRhEY1SO.js";
28
- import { a as roundTripRunRecord, i as parseRunRecordSafe, n as isRunRecord, o as runTaskScore, r as modelHasSnapshot, s as validateRunRecord, t as RunRecordValidationError } from "./run-record-DqOw5X6_.js";
29
- import { a as evaluateReleaseConfidence, i as assertReleaseConfidence, n as bootstrapCi, r as judgeReplayGate, t as renderReleaseReport } from "./release-report-Dy39cbFF.js";
28
+ import { a as roundTripRunRecord, i as parseRunRecordSafe, n as isRunRecord, o as runTaskScore, r as modelHasSnapshot, s as validateRunRecord, t as RunRecordValidationError } from "./run-record-BmSPWXJR.js";
29
+ import { a as evaluateReleaseConfidence, i as assertReleaseConfidence, n as bootstrapCi, r as judgeReplayGate, t as renderReleaseReport } from "./release-report-BUYmoKo2.js";
30
30
  import { d as pairedDecisionShape, f as minimumPairsForPairedDeltaTest, p as pairedDeltaTest, u as decidePairedPromotion } from "./promotion-policy-CrLrmys8.js";
31
31
  import { i as toRewardRows, r as toJsonl, s as toSftRows } from "./exporters-q9iL-2Jf.js";
32
- import { a as toHarborTrajectories, i as relabelImportedSplit, n as HARBOR_IMPORT_GAP, o as toHarborTrajectory, r as fromHarborTrajectory, t as ATIF_SCHEMA_VERSION } from "./rollout-2ECTXb2N.js";
32
+ import { a as toHarborTrajectories, i as relabelImportedSplit, n as HARBOR_IMPORT_GAP, o as toHarborTrajectory, r as fromHarborTrajectory, t as ATIF_SCHEMA_VERSION } from "./rollout-DRrksrcV.js";
33
33
  import { t as buildTrajectory } from "./trajectory-D_7rLrvE.js";
34
- import { n as unmintableReasons, t as mintRolloutRows } from "./mint-CGEkzPLf.js";
34
+ import { n as unmintableReasons, t as mintRolloutRows } from "./mint-B2O60ACG.js";
35
35
  import { C as rollupSupervisorRuns, D as isUnavailable, E as SUPERVISOR_RUN_SCHEMA, O as showMeasured, b as readClaudeCodeSupervisorRun, c as writeSupervisorRunReport, d as readRuntimeSupervisorRun, f as runtimeSupervisorRunReader, h as renderSupervisorRunMarkdown, m as renderSupervisorRunHeadline, t as analyzeSupervisorRun, u as isRuntimeSupervisorRunDir, x as analyzeSupervisorRunSources, y as claudeCodeSupervisorRunReader } from "./supervisor-run-D_sokXcO.js";
36
- import { A as TRACE_ANALYST_ACTOR_DESCRIPTION, C as domainEvidencePattern, D as tokenizeDomainWords, E as scoreTraceInsightReadiness, O as traceAnalystOnRunComplete, S as describeTraceInsightScope, T as planTraceInsightQuestions, _ as otlpToTraceRunRecords, a as convertTraceStoresToOtlp, b as buildTraceInsightPrompt, c as otelRunCompleteHook, d as captureFetchToRawSink, f as ToolTraceMissingError, g as otlpToRunRecords, h as otlpRowsToTraceRunRecords, i as iterateRawCalls, j as TRACE_ANALYST_ACTOR_DESCRIPTION_VERSION, k as analyzeTraces, l as OTEL_AGENT_EVAL_SCOPE, m as otlpRowsToRunRecords, n as ReplayCacheMissError, o as createOtelExporter, p as toolSpansToTraceAnalysisStore, r as createReplayFetch, s as createOtelTracingStore, t as ReplayCache, u as exportRunAsOtlp, v as flattenOtlpExportToNdjson, w as inferDomainKeywords, x as defaultTraceInsightPanel, y as buildTraceInsightContext } from "./replay-DyBLaKFc.js";
36
+ import { A as TRACE_ANALYST_ACTOR_DESCRIPTION, C as domainEvidencePattern, D as tokenizeDomainWords, E as scoreTraceInsightReadiness, O as traceAnalystOnRunComplete, S as describeTraceInsightScope, T as planTraceInsightQuestions, _ as otlpToTraceRunRecords, a as convertTraceStoresToOtlp, b as buildTraceInsightPrompt, c as otelRunCompleteHook, d as captureFetchToRawSink, f as ToolTraceMissingError, g as otlpToRunRecords, h as otlpRowsToTraceRunRecords, i as iterateRawCalls, j as TRACE_ANALYST_ACTOR_DESCRIPTION_VERSION, k as analyzeTraces, l as OTEL_AGENT_EVAL_SCOPE, m as otlpRowsToRunRecords, n as ReplayCacheMissError, o as createOtelExporter, p as toolSpansToTraceAnalysisStore, r as createReplayFetch, s as createOtelTracingStore, t as ReplayCache, u as exportRunAsOtlp, v as flattenOtlpExportToNdjson, w as inferDomainKeywords, x as defaultTraceInsightPanel, y as buildTraceInsightContext } from "./replay-B3gACG_H.js";
37
37
  import { i as otlpTextToTraceAnalysisStore, n as OtlpFileTraceStore } from "./store-otlp-CKtTpRhv.js";
38
38
  import { n as extractUsageFromResponse, r as extractUsageFromSse, t as extractUsage } from "./extract-usage-BW27f3XW.js";
39
- import { B as harnessAxisOf, F as HARNESS_NATIVE_MODEL, G as parseCorrectnessResponse, H as completionVerdict, I as agentProfileHash, K as verifyCompletion, L as agentProfileId, P as CODING_HARNESSES, R as agentProfileModelId, U as createLlmCorrectnessChecker, V as extractProducedState, W as createTokenRecallChecker, z as expandProfileAxes } from "./campaign-Tdy3h62h.js";
39
+ import { B as harnessAxisOf, F as HARNESS_NATIVE_MODEL, G as parseCorrectnessResponse, H as completionVerdict, I as agentProfileHash, K as verifyCompletion, L as agentProfileId, P as CODING_HARNESSES, R as agentProfileModelId, U as createLlmCorrectnessChecker, V as extractProducedState, W as createTokenRecallChecker, z as expandProfileAxes } from "./campaign-FG3thH2m.js";
40
40
  import { n as iqr, r as welchsTTest, t as compareToBaseline } from "./baseline-C-GocmIW.js";
41
41
  import { a as judgeSpans, c as runsForScenario, i as hasCapturedToolArgs, l as toolSpans, n as argHash, o as llmSpans, r as groupBy, s as runFailureClass, t as aggregateLlm } from "./query-Di7eEQ79.js";
42
- import { a as checkBehavioralCanary, i as canaryLeakView, o as checkCanaries, r as HoldoutAuditor, s as runBehavioralCanaries, t as analyzeRuns } from "./analyze-runs-BNNK7irB.js";
42
+ import { a as checkBehavioralCanary, i as canaryLeakView, o as checkCanaries, r as HoldoutAuditor, s as runBehavioralCanaries, t as analyzeRuns } from "./analyze-runs-C30yljDJ.js";
43
43
  import { a as summaryTable, i as researchReport, n as gainHistogram, r as paretoChart, t as RESEARCH_REPORT_HARD_PAIR_FLOOR } from "./summary-report-Lf-5I7xh.js";
44
44
  import { a as composeParsers, c as vitestTestParser, i as SubprocessSandboxDriver, n as DockerSandboxDriver, o as jestTestParser, r as SandboxHarness, s as pytestTestParser, t as runTestGradedScenario } from "./test-graded-scenario-JHcKQNpq.js";
45
45
  import { n as InMemoryTraceStore, t as FileSystemTraceStore } from "./store-DNe_Uv1Q.js";
@@ -48,8 +48,8 @@ import { i as redactValue, n as REDACTION_VERSION, r as redactString, t as DEFAU
48
48
  import { n as DEFAULT_RULES, r as classifyFailure, t as computeToolUseMetrics } from "./tool-use-metrics-DEGMKycK.js";
49
49
  import { t as analyzeSeries } from "./series-convergence-CjO2QdRW.js";
50
50
  import { n as runCounterfactual, t as attributeCounterfactuals } from "./counterfactual-CWPTrMH7.js";
51
- import { _ as deterministicSplit, g as BENCHMARK_SPLIT_SEED, t as benchmarks_exports } from "./benchmarks-CDSolHq7.js";
52
- import { t as runEvalCampaign } from "./eval-campaign-DNjCvAm-.js";
51
+ import { _ as deterministicSplit, g as BENCHMARK_SPLIT_SEED, t as benchmarks_exports } from "./benchmarks-Ce4Ae5fX.js";
52
+ import { t as runEvalCampaign } from "./eval-campaign-B_7wcnav.js";
53
53
  import { n as pairedEvalueSequence, t as evaluateInterimReleaseConfidence } from "./sequential-Br0mAPHA.js";
54
54
  import { accessSync, appendFileSync, constants, cpSync, existsSync, mkdirSync, promises, readFileSync, readdirSync, statSync, writeFileSync } from "node:fs";
55
55
  import { basename, delimiter, dirname, extname, isAbsolute, join, relative, resolve } from "node:path";
@@ -1,7 +1,7 @@
1
1
  import { o as FailureClass } from "./schema-BtVldJ3T.js";
2
- import { l as RunTerminalOutcome } from "./run-record-DdSa93_W.js";
2
+ import { l as RunTerminalOutcome } from "./run-record-CF4Dwpxr.js";
3
3
  import { bt as ContinuousAgreement } from "./statistics-D6Uebe_4.js";
4
- import { i as ParetoFigureSpec, t as GainDistributionBin } from "./summary-report-DuUS_i7W.js";
4
+ import { i as ParetoFigureSpec, t as GainDistributionBin } from "./summary-report-BNR7DWTj.js";
5
5
  //#region src/contract/insight-report.d.ts
6
6
  interface InsightReport {
7
7
  /** Number of runs analyzed. */
@@ -403,4 +403,4 @@ interface Recommendation {
403
403
  }
404
404
  //#endregion
405
405
  export { FailureClusterInsight as a, JudgeInsight as c, Recommendation as d, ReleaseSummary as f, FailureClassTally as i, LiftInsight as l, TokenUsageInsight as m, ExecutionErrorOutcomeCell as n, InsightReport as o, ScalarDistribution as p, ExecutionInsight as r, InterRaterInsight as s, CostProvenanceSummary as t, OutcomeCorrelationInsight as u };
406
- //# sourceMappingURL=insight-report-C6h6F_4L.d.ts.map
406
+ //# sourceMappingURL=insight-report-CgX_s0Ez.d.ts.map
@@ -1 +1 @@
1
- {"version":3,"file":"insight-report-C6h6F_4L.d.ts","names":[],"sources":["../src/contract/insight-report.ts"],"mappings":";;;;;UAqCiB;;EAEf;;;;EAKA,WAAW;;EAGX,WAAW;;;EAIX,cAAc,eAAe;;EAG7B;IACE,MAAM;IACN,QAAQ;;;;IAIR,aAAa;;;;;IAKb;MAAa;MAAe;;;;;;EAM9B,QAAQ,eAAe;;;;EAKvB,aAAa;;;;EAKb,OAAO;;;EAIP,kBAAkB;;;EAIlB,gBAAgB;;;;;EAMhB,qBAAqB;;;;;EAMrB,SAAS;;;;;;EAOT,wBAAwB;;;;EAKxB,iBAAiB;;;EAIjB,iBAAiB;;UAGF;EACf;IAAY;IAAW;;EACvB;IAAa;IAAW;;EACxB;IAAc;;EACd;;UAGe;;EAEf,YAAY;;EAEZ,SAAS;;;EAGT,YAAY;;;EAGZ;IACE;IACA,YAAY;IACZ,SAAS;IACT;;;EAGF,QAAQ;IAAQ;IAAe;;;;;EAI/B;IACE;IACA;IACA;;;;;EAKF;IACE;;;IAGA;;IAEA;;IAEA;;IAEA;;IAEA;;;;;IAKA,mBAAmB,OAAO,oBAAoB;;;;EAIhD;IACE;IACA;IACA;IACA;IACA;;;UAIa;;EAEf;;EAEA;;EAEA;;UAGe;EACf,OAAO;EACP,QAAQ;EACR,WAAW;EACX,QAAQ;EACR,YAAY;EACZ;IACE;IACA;IACA;IACA;IACA;;;;UAOa;;EAEf;;EAEA;;EAEA;;EAEA;;EAEA;;EAEA;;EAEA;;EAEA,WAAW;;;;;EAKX,WAAW;IAAQ;IAAe;;;UAGnB;;EAEf;;EAEA;;;EAGA,cAAc;;;EAGd;;;EAGA;;;EAGA;;UAGe;;EAEf;;EAEA;;EAEA;;EAEA;;EAEA;;EAEA;;EAEA,SAAS;;EAET,mBAAmB;IACjB;IACA,SAAS;MAAQ;MAAe;;IAChC;;;UAIa;EACf;EACA;;EAEA;;EAEA;;;EAGA;;EAEA;;EAEA;;;;;;;;;;;EAWA;;EAEA;;EAEA;;EAEA;;EAEA;;EAEA;;UAGe;;EAEf,UAAU;IACR;IACA;;IAEA;;IAEA;;IAEA;;EAEF;;;;;UAMe;;EAEf,cAAc;;EAEd;;EAEA;;UAGe;;EAEf;;;EAGA;EACA,UAAU;IAAQ;IAAe;IAAgB;;;UAGlC;;;EAGf;;EAEA;;EAEA;;EAEA;;EAEA;IACE;IACA;IACA;;;UAIa;;;EAGf;EACA,MAAM;IACJ;IACA;IACA;;;;EAIF;;UAGQ;;EAER;;EAEA;;;;EAIA;;EAEA;EACA;;KAGU,eACP;EACC;;EAEA;;EAEA;;EAEA;;EAEA;MAED;EACC;;EAEA;EACA;EACA;EACA;;UAGW;;EAEf;EACA;;EAEA;;;;EAIA,SAAS,eAAe;;;EAGxB;;EAEA;;EAEA;;UAGe;EACf;EACA;EACA;EACA;;EAEA"}
1
+ {"version":3,"file":"insight-report-CgX_s0Ez.d.ts","names":[],"sources":["../src/contract/insight-report.ts"],"mappings":";;;;;UAqCiB;;EAEf;;;;EAKA,WAAW;;EAGX,WAAW;;;EAIX,cAAc,eAAe;;EAG7B;IACE,MAAM;IACN,QAAQ;;;;IAIR,aAAa;;;;;IAKb;MAAa;MAAe;;;;;;EAM9B,QAAQ,eAAe;;;;EAKvB,aAAa;;;;EAKb,OAAO;;;EAIP,kBAAkB;;;EAIlB,gBAAgB;;;;;EAMhB,qBAAqB;;;;;EAMrB,SAAS;;;;;;EAOT,wBAAwB;;;;EAKxB,iBAAiB;;;EAIjB,iBAAiB;;UAGF;EACf;IAAY;IAAW;;EACvB;IAAa;IAAW;;EACxB;IAAc;;EACd;;UAGe;;EAEf,YAAY;;EAEZ,SAAS;;;EAGT,YAAY;;;EAGZ;IACE;IACA,YAAY;IACZ,SAAS;IACT;;;EAGF,QAAQ;IAAQ;IAAe;;;;;EAI/B;IACE;IACA;IACA;;;;;EAKF;IACE;;;IAGA;;IAEA;;IAEA;;IAEA;;IAEA;;;;;IAKA,mBAAmB,OAAO,oBAAoB;;;;EAIhD;IACE;IACA;IACA;IACA;IACA;;;UAIa;;EAEf;;EAEA;;EAEA;;UAGe;EACf,OAAO;EACP,QAAQ;EACR,WAAW;EACX,QAAQ;EACR,YAAY;EACZ;IACE;IACA;IACA;IACA;IACA;;;;UAOa;;EAEf;;EAEA;;EAEA;;EAEA;;EAEA;;EAEA;;EAEA;;EAEA,WAAW;;;;;EAKX,WAAW;IAAQ;IAAe;;;UAGnB;;EAEf;;EAEA;;;EAGA,cAAc;;;EAGd;;;EAGA;;;EAGA;;UAGe;;EAEf;;EAEA;;EAEA;;EAEA;;EAEA;;EAEA;;EAEA,SAAS;;EAET,mBAAmB;IACjB;IACA,SAAS;MAAQ;MAAe;;IAChC;;;UAIa;EACf;EACA;;EAEA;;EAEA;;;EAGA;;EAEA;;EAEA;;;;;;;;;;;EAWA;;EAEA;;EAEA;;EAEA;;EAEA;;EAEA;;UAGe;;EAEf,UAAU;IACR;IACA;;IAEA;;IAEA;;IAEA;;EAEF;;;;;UAMe;;EAEf,cAAc;;EAEd;;EAEA;;UAGe;;EAEf;;;EAGA;EACA,UAAU;IAAQ;IAAe;IAAgB;;;UAGlC;;;EAGf;;EAEA;;EAEA;;EAEA;;EAEA;IACE;IACA;IACA;;;UAIa;;;EAGf;EACA,MAAM;IACJ;IACA;IACA;;;;EAIF;;UAGQ;;EAER;;EAEA;;;;EAIA;;EAEA;EACA;;KAGU,eACP;EACC;;EAEA;;EAEA;;EAEA;;EAEA;MAED;EACC;;EAEA;EACA;EACA;EACA;;UAGW;;EAEf;EACA;;EAEA;;;;EAIA,SAAS,eAAe;;;EAGxB;;EAEA;;EAEA;;UAGe;EACf;EACA;EACA;EACA;;EAEA"}
@@ -3,7 +3,7 @@ import { s as TraceStore } from "../store-CT9YIIve.js";
3
3
  import { Ct as GoldenItem, St as ContinuousCalibrationResult, a as CorpusAgreementReport, bt as ContinuousAgreement, vt as CalibrationResult, yt as CandidateScore } from "../statistics-D6Uebe_4.js";
4
4
  import { a as OutcomeFilter, i as InMemoryOutcomeStore, n as FileSystemOutcomeStore, o as OutcomeStore, r as FileSystemOutcomeStoreOptions, t as DeploymentOutcome } from "../outcome-store-BYHIuO0e.js";
5
5
  import { n as SeriesConvergenceResult, t as SeriesConvergenceOptions } from "../series-convergence-ofsqPWhs.js";
6
- import { a as rubricPredictiveValidity, i as RubricRanking, n as RubricPredictiveValidityInput, r as RubricPredictiveValidityReport, t as RubricOutcomePair } from "../rubric-predictive-validity-9qAwzkZm.js";
6
+ import { a as rubricPredictiveValidity, i as RubricRanking, n as RubricPredictiveValidityInput, r as RubricPredictiveValidityReport, t as RubricOutcomePair } from "../rubric-predictive-validity-DvkjPYCe.js";
7
7
  //#region src/meta-eval/correlation-study.d.ts
8
8
  interface EvalMetricSpec {
9
9
  id: string;
@@ -1,7 +1,7 @@
1
1
  import { c as ValidationError } from "./errors-D-LKuDhb.js";
2
2
  import { i as ROLLOUT_SCHEMA, s as assertMinted } from "./schema-C6DW4ZHR.js";
3
3
  import { a as scoreOrigin, i as rolloutRewardFields } from "./reward-nw2xZGZG.js";
4
- import { o as runTaskScore } from "./run-record-DqOw5X6_.js";
4
+ import { o as runTaskScore } from "./run-record-BmSPWXJR.js";
5
5
  import { t as buildTrajectory } from "./trajectory-D_7rLrvE.js";
6
6
  //#region src/rollout/mint.ts
7
7
  /**
@@ -315,4 +315,4 @@ async function mintRolloutRows(records, store, options = {}) {
315
315
  //#endregion
316
316
  export { unmintableReasons as n, mintRolloutRows as t };
317
317
 
318
- //# sourceMappingURL=mint-CGEkzPLf.js.map
318
+ //# sourceMappingURL=mint-B2O60ACG.js.map
@@ -1 +1 @@
1
- {"version":3,"file":"mint-CGEkzPLf.js","names":[],"sources":["../src/rollout/mint.ts"],"sourcesContent":["/**\n * Rollout minting — `tangle.rollout.v1` lines joined from the records the\n * substrate ALREADY keeps. There is no separate rollout store: a rollout\n * is the JOIN of a RunRecord (identity, provenance, cost, outcome) with\n * its trace (spans share `runId`), projected into the canonical line.\n *\n * Composition, not duplication:\n * - identity/provenance → `RunRecord` (candidateId, splitTag, agentProfile, hashes)\n * - step structure → `buildTrajectory` over the shared TraceStore\n * - preference-pair export → `feedbackTrajectoryToOptimizerRow` (feedback-trajectory.ts)\n * - PRM / reward-model → `reward-model-export.ts`\n *\n * Anti-Goodhart invariant: a run whose `outcome.realness.gated` is true is\n * never exported with a positive reward OR with any of the numbers that reward\n * was computed from. The gate travels into the training data (`reward` forced\n * to 0, `realness_gated: true`) and the whole outcome is transformed by\n * `gateGamedOutcome` inside `assertMinted` below, which relocates `metrics` and\n * `verdict` to `provenance.gated_evidence`. Mint returns\n * `MintedRolloutLine[]`: the brand the training exporters require, which only\n * this function, `readRolloutLedger`, and an explicit `assertMinted` can mint.\n *\n * A record carrying NEITHER split score is REJECTED (`ValidationError`), never\n * minted at 0 — \"nobody graded this\" is not the same claim as \"graded a total\n * failure\", and a trainer reading 0 learns the second. Lines that already\n * carry `reward: null` (interchange imports, existing ledgers) remain valid on\n * the wire; only the RunRecord→line door refuses.\n *\n * Records without spans become labeled GAP LINES (messages: [],\n * provenance.gap) — present in the output AND surfaced in\n * `missingTraces`; a capture gap is a finding, never a silent omission.\n */\n\nimport { ValidationError } from '../errors'\nimport { type RunRecord, runTaskScore } from '../run-record'\nimport type { LlmSpan, Message, Span, ToolSpan } from '../trace/schema'\nimport type { TraceStore } from '../trace/store'\nimport { buildTrajectory } from '../trajectory'\nimport { rolloutRewardFields, scoreOrigin } from './reward'\nimport {\n assertMinted,\n type ChatMessage,\n type MintedRolloutLine,\n ROLLOUT_SCHEMA,\n type RolloutRole,\n type RolloutSplit,\n type RolloutStep,\n} from './schema'\n\n/** Redactor applied to every exported string (secrets, PII). Identity by default. */\nexport type RolloutScrubber = (text: string) => string\n\nexport interface MintRolloutOptions {\n scrub?: RolloutScrubber\n /** Cap steps per line (longest runs first drop middle steps). Default: no cap. */\n maxSteps?: number\n /** Role recorded on every minted line. Default 'agent' (a solo eval run). */\n role?: RolloutRole\n /** Task suite label. Default: the record's `experimentId`. */\n suite?: string\n /** Injected clock for deterministic output. */\n now?: () => Date\n}\n\nexport interface MintRolloutResult {\n rows: MintedRolloutLine[]\n /** runIds that had a RunRecord but no spans — emitted as gap lines AND listed here. */\n missingTraces: string[]\n}\n\nconst asText = (v: unknown, scrub: RolloutScrubber): string => {\n const s = typeof v === 'string' ? v : JSON.stringify(v)\n return scrub(s ?? '')\n}\n\nfunction projectStep(span: Span, scrub: RolloutScrubber): RolloutStep {\n const base: RolloutStep = {\n kind: span.kind,\n name: scrub(span.name),\n status: span.status,\n durationMs: span.endedAt !== undefined ? span.endedAt - span.startedAt : undefined,\n }\n if (span.kind === 'llm') {\n const llm = span as LlmSpan\n const last = llm.messages[llm.messages.length - 1]\n if (last) base.input = scrub(last.content)\n if (llm.output !== undefined) base.output = scrub(llm.output)\n } else if (span.kind === 'tool') {\n const tool = span as ToolSpan\n base.input = asText(tool.args, scrub)\n if (tool.result !== undefined) base.output = asText(tool.result, scrub)\n }\n return base\n}\n\n/** The final llm span's history + output is the completed conversation. */\nfunction finalConversation(spans: Span[], scrub: RolloutScrubber): ChatMessage[] {\n const llms = spans.filter((s): s is LlmSpan => s.kind === 'llm')\n const last = llms[llms.length - 1]\n if (!last) return []\n const messages: ChatMessage[] = last.messages.map((m: Message) => ({\n role: m.role,\n content: scrub(m.content),\n }))\n if (last.output !== undefined && last.output !== '') {\n messages.push({ role: 'assistant', content: scrub(last.output) })\n }\n return messages\n}\n\n// The reward derivations live in the leaf module `./reward` so gate and\n// reporting code can import them without dragging in the trace store; they are\n// re-exported here because the derivations shipped from this path.\nexport {\n isRealnessGated,\n observedScore,\n observedSplitScore,\n type ScoreOrigin,\n type ScorePreference,\n scoreOrigin,\n trainingReward,\n trainingScore,\n} from './reward'\n\nconst REWARD_SOURCE: Record<ReturnType<typeof scoreOrigin>, string> = {\n holdout: 'run-record/holdout-score',\n search: 'run-record/search-score',\n unscored: 'run-record/unscored',\n}\n\n/**\n * The mint door refuses an execution-only record: a missing training label is\n * not a zero reward, and not a mintable line either. Lines that already carry\n * `reward: null` — interchange imports, existing ledgers — stay valid on the\n * wire and keep their labeled gap; this guard is only about the\n * RunRecord→line door, where the producer can still be told to go score the\n * run instead of shipping an unlabeled row.\n */\nfunction requireTaskScore(record: RunRecord): void {\n if (runTaskScore(record) === undefined) {\n throw new ValidationError(`Cannot mint rollout for run ${record.runId}: task score is missing`)\n }\n}\n\nconst isObject = (value: unknown): value is Record<string, unknown> =>\n typeof value === 'object' && value !== null\n\ninterface MintFieldCheck {\n /** The RunRecord path, spelled the way the caller has to fix it. */\n readonly field: string\n /** True when the record carries something the line can honestly be built from. */\n readonly present: (bag: Record<string, unknown>) => boolean\n /** What the caller writes onto the record, and why that value and not another. */\n readonly remedy: string\n}\n\n/**\n * The RunRecord fields mint reads that a record can be missing even though the\n * TYPE says it cannot. There are exactly two ways that happens:\n *\n * 1. The field was OPTIONAL when the record was serialized. `costProvenance`,\n * `terminalOutcome` and `scenarioId` were optional through agent-eval\n * 0.125 and became required in 0.126, with no on-disk migration — so every\n * ledger written before 0.126 is full of records the type calls complete.\n * 2. Mint reads a level DEEPER than the record's own type is checked at:\n * `outcome.raw`, `tokenUsage.input`, `tokenUsage.output`.\n *\n * Nothing else needs a check here. Every other field mint copies is a top-level\n * scalar landing in a typed slot on the line, where an absent value arrives as\n * `undefined` and `assertMinted` refuses it by name. These are the ones where an\n * absent value instead kills the join with `TypeError: Cannot read properties of\n * undefined`, or — worse — mints a line that reads as measured.\n *\n * This is deliberately NOT `validateRunRecord`. That validator answers \"is this\n * a valid RunRecord\", which is a wider question than \"can a rollout line be\n * built from this one\": it also enforces model-snapshot discipline, the\n * `terminalFailureReason` coupling, and the `costUsd === costProvenance.usd`\n * agreement. Routing the mint door through it would refuse records mint can\n * mint honestly today (a model alias with no snapshot date, for one), which is\n * a policy change with its own blast radius and not this bug. The door asks the\n * narrower question and answers it precisely.\n */\nconst MINT_FIELD_CHECKS: readonly MintFieldCheck[] = [\n {\n field: 'costProvenance',\n present: (bag) => isObject(bag.costProvenance) && typeof bag.costProvenance.kind === 'string',\n remedy:\n \"Records written before agent-eval 0.126 predate this field and carry `costUsd: 0` as the documented uncaptured sentinel, which is NOT an observed zero. Backfill it as costProvenance: { kind: 'uncaptured', usd: null } WITH costUsd: null — an uncaptured cost whose costUsd is non-null is rejected by validateRunRecord, so provenance alone leaves the record invalid.\",\n },\n {\n field: 'tokenUsage',\n present: (bag) => isObject(bag.tokenUsage),\n remedy:\n \"The line's cost.tokens_in and cost.tokens_out are read from it. Backfill it from the provider's usage report; mint will not write 0 for tokens nobody counted.\",\n },\n {\n field: 'tokenUsage.input',\n present: (bag) => !isObject(bag.tokenUsage) || typeof bag.tokenUsage.input === 'number',\n remedy: \"The line's cost.tokens_in is read from it, and a missing count is not a zero count.\",\n },\n {\n field: 'tokenUsage.output',\n present: (bag) => !isObject(bag.tokenUsage) || typeof bag.tokenUsage.output === 'number',\n remedy: \"The line's cost.tokens_out is read from it, and a missing count is not a zero count.\",\n },\n {\n field: 'outcome',\n present: (bag) => isObject(bag.outcome),\n remedy:\n \"The line's reward, reward_source and metrics are all read from it. A record with no outcome carries no training label at all, and mint refuses an unlabeled row.\",\n },\n {\n field: 'outcome.raw',\n // Reported only when `outcome` itself is present: one absent field should\n // produce one reason per CAUSE, not one per path that dereferences it.\n present: (bag) => !isObject(bag.outcome) || isObject(bag.outcome.raw),\n remedy:\n 'It is the metric bag copied verbatim into the line\\'s outcome.metrics. `{ ...undefined }` spreads to `{}` without complaint, so an absent bag would mint as \"this run reported no metrics\" — a different claim from \"this record predates the field\". Backfill it as {} only when that is what you mean.',\n },\n {\n field: 'terminalOutcome',\n present: (bag) => typeof bag.terminalOutcome === 'string',\n remedy:\n \"It became required in agent-eval 0.126. Backfill it from root-run or process evidence, or as 'unknown' when the producer has none — mint will not decide the line's is_completed and is_truncated for you.\",\n },\n {\n field: 'scenarioId',\n present: (bag) => typeof bag.scenarioId === 'string' && bag.scenarioId.length > 0,\n remedy:\n \"It became required in agent-eval 0.126 and becomes the line's task.instance_id, which must be a non-empty string. Backfill it from the scenario the run was dealt (pre-0.126 producers often left it in outcome.raw.scenario_id).\",\n },\n]\n\n/**\n * Why a record cannot be minted, one entry per missing field, empty when it can.\n *\n * Exported so a caller can partition a whole ledger — \"which of my 2742 records\n * predate 0.126\" — without catching an exception per record, and without\n * re-deriving the field list on their side. A re-derived list is a list that\n * drifts from the door it is supposed to predict.\n *\n * Takes a `RunRecord` because that is what the caller holds and what the\n * compiler agrees they hold. The type is precisely the thing that is wrong, so\n * the checks read the record as the untyped bag it actually is on disk.\n */\nexport function unmintableReasons(record: RunRecord): string[] {\n const bag = record as unknown as Record<string, unknown>\n return MINT_FIELD_CHECKS.filter((check) => !check.present(bag)).map(\n (check) => `${check.field} is missing. ${check.remedy}`,\n )\n}\n\n/**\n * The mint door THROWS on a record it cannot build a line from. It does NOT\n * normalise an absent `costProvenance` to `{kind:'uncaptured', usd:null}`, and\n * the choice is not stylistic:\n *\n * - Normalising cannot cover the record, only part of it. `terminalOutcome`\n * feeds `is_completed` and `is_truncated`, which the rollout schema requires\n * to be BOOLEAN — there is no null to fall back to, so every possible\n * default is a claim about how the run ended. A door that quietly fixes the\n * cost and invents the ending is a door no caller can predict.\n * - Normalising the cost requires knowing what `costUsd: 0` meant, and mint\n * cannot know. A genuinely free run and an uncaptured one are the same bytes\n * in a pre-0.126 record; only the producer can tell them apart. Guessing is\n * exactly the failure this guard exists to stop — the 0.125 optional chain\n * `record.costProvenance?.kind === 'uncaptured'` already made that guess,\n * silently, and every record it touched minted `cost.usd: 0`: an unmeasured\n * cost published as a measured zero, into a training dataset.\n * - `requireTaskScore`, directly above, already refuses an unlabeled record\n * for the same reason: \"nobody graded this\" is not \"graded zero\". \"Nobody\n * billed this\" is not \"billed zero\".\n *\n * The caller who wants historical records minted backfills them at their store,\n * in one pass, where `costUsd` can be corrected alongside `costProvenance` —\n * which is the only place that decision can be made correctly. The refusal names\n * the run, names every missing field, and spells the value to write.\n */\nfunction requireMintableRecord(record: RunRecord): void {\n const reasons = unmintableReasons(record)\n if (reasons.length === 0) return\n throw new ValidationError(`Cannot mint rollout for run ${record.runId}: ${reasons.join('\\n ')}`)\n}\n\nconst SPLIT_FROM_TAG: Record<RunRecord['splitTag'], RolloutSplit> = {\n search: 'search',\n dev: 'dev',\n holdout: 'holdout',\n}\n\nfunction mintLine(\n record: RunRecord,\n steps: RolloutStep[],\n messages: ChatMessage[],\n options: MintRolloutOptions,\n capturedAt: string,\n gap?: string,\n): MintedRolloutLine {\n // Field presence first, and BEFORE `requireTaskScore`: that guard reads\n // `record.outcome.searchScore` on its way to the answer, so an absent\n // `outcome` would throw a bare TypeError from inside the guard whose whole\n // job is to produce a clean refusal.\n //\n // Both branches of `mintRolloutRows` — the traced line and the gap line —\n // land here, which is the point: `mintLine` is the only constructor of a\n // `MintedRolloutLine` from a RunRecord, so there is no path into the waist\n // that skips the check and no way to get this wrong from the outside.\n requireMintableRecord(record)\n // A missing task score is refused before anything is built: an\n // execution-only record has no training label, and a missing label is\n // neither a zero reward nor a mintable row.\n requireTaskScore(record)\n // `reward` and `realness_gated` come out of one call, so neither door into\n // the waist can write one and forget the other.\n const rewardFields = rolloutRewardFields(record)\n const uncaptured = record.costProvenance.kind === 'uncaptured'\n const terminalOutcome = record.terminalOutcome\n const isCompleted = terminalOutcome === 'succeeded' || terminalOutcome === 'failed'\n const isTruncated = terminalOutcome === 'cancelled' || terminalOutcome === 'incomplete'\n const terminalError =\n terminalOutcome === 'failed' ||\n terminalOutcome === 'cancelled' ||\n terminalOutcome === 'incomplete'\n ? (record.terminalFailureReason ?? `run ended ${terminalOutcome}`)\n : null\n // `assertMinted` rather than a cast: mint is the producer the whole gate\n // rests on, so it proves the line it just built is valid instead of asserting\n // it by fiat. The brand is unforgeable precisely because nobody casts to it.\n return assertMinted(\n {\n schema: ROLLOUT_SCHEMA,\n rollout_id: record.runId,\n parent_rollout_id: null,\n run_id: record.runId,\n experiment_id: record.experimentId,\n candidate_id: record.candidateId,\n generation: null,\n candidate_index: null,\n role: options.role ?? 'agent',\n task: {\n suite: options.suite ?? record.experimentId,\n instance_id: record.scenarioId,\n split: SPLIT_FROM_TAG[record.splitTag],\n seed: record.seed,\n rep: 0,\n },\n policy: {\n harness: null,\n harness_version: null,\n model: record.model,\n provider: null,\n profile_commit: record.commitSha,\n prompt_hash: record.promptHash,\n config_hash: record.configHash,\n agent_profile_cell_id: record.agentProfile?.cellId ?? null,\n sampling: null,\n },\n messages,\n tool_defs: [],\n ...(steps.length > 0 ? { steps } : {}),\n outcome: {\n ...rewardFields,\n reward_source: REWARD_SOURCE[scoreOrigin(record)],\n verdict: null,\n // A verbatim bulk copy, deliberately UNFILTERED here. `outcome.raw`\n // holds the per-layer verifier scores (`layer.*`) that the reward was\n // derived from, so on a gated run this dict is the reward signal in\n // component form — but filtering it at this call site is the pattern\n // that has now leaked twice, because the next producer to write a\n // reward-bearing field forgets. The gate is applied to the whole\n // outcome once, in `assertMinted` below (`gateGamedOutcome`), which\n // moves the block to `provenance.gated_evidence` when the run is gated\n // and leaves it here untouched when it is not.\n metrics: { ...record.outcome.raw },\n is_completed: isCompleted,\n is_truncated: isTruncated,\n error: terminalError,\n },\n cost: {\n usd: uncaptured ? null : record.costUsd,\n tokens_in: record.tokenUsage.input,\n tokens_out: record.tokenUsage.output,\n tokens_reasoning: record.tokenUsage.reasoning ?? null,\n cache_read: record.tokenUsage.cached ?? null,\n cache_write: record.tokenUsage.cacheWrite ?? null,\n wall_s: Math.round(record.wallMs / 1000),\n },\n artifacts: { patch_path: null, run_dir: null, transcript_ref: null },\n provenance: {\n captured_at: capturedAt,\n capture: 'mint',\n ...(gap !== undefined ? { gap } : {}),\n },\n },\n `minted rollout line for run ${record.runId}`,\n )\n}\n\n/**\n * Join RunRecords with their traces into canonical rollout lines. Records\n * without spans are emitted as labeled gap lines and reported in\n * `missingTraces`. Execution-only records without a task score are rejected\n * because a missing training label is not a zero reward.\n */\nexport async function mintRolloutRows(\n records: RunRecord[],\n store: TraceStore,\n options: MintRolloutOptions = {},\n): Promise<MintRolloutResult> {\n const scrub = options.scrub ?? ((t) => t)\n const capturedAt = (options.now?.() ?? new Date()).toISOString()\n const rows: MintedRolloutLine[] = []\n const missingTraces: string[] = []\n for (const record of records) {\n const trajectory = await buildTrajectory(store, record.runId)\n if (trajectory.steps.length === 0) {\n missingTraces.push(record.runId)\n rows.push(\n mintLine(record, [], [], options, capturedAt, 'no trace spans recorded for this runId'),\n )\n continue\n }\n let steps = trajectory.steps.map((s) => projectStep(s.span, scrub))\n if (options.maxSteps !== undefined && steps.length > options.maxSteps) {\n // Keep the head and tail — the middle of a long run is the least\n // informative for outcome attribution.\n const head = Math.ceil(options.maxSteps / 2)\n const tail = options.maxSteps - head\n steps = [...steps.slice(0, head), ...steps.slice(steps.length - tail)]\n }\n const conversation = finalConversation(\n trajectory.steps.map((s) => s.span),\n scrub,\n )\n const gap =\n conversation.length === 0 ? 'trace has no llm spans — no conversation to inline' : undefined\n rows.push(mintLine(record, steps, conversation, options, capturedAt, gap))\n }\n return { rows, missingTraces }\n}\n"],"mappings":";;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;AAqEA,MAAM,UAAU,GAAY,UAAmC;CAE7D,OAAO,OADG,OAAO,MAAM,WAAW,IAAI,KAAK,UAAU,CAAC,MACpC,EAAE;AACtB;AAEA,SAAS,YAAY,MAAY,OAAqC;CACpE,MAAM,OAAoB;EACxB,MAAM,KAAK;EACX,MAAM,MAAM,KAAK,IAAI;EACrB,QAAQ,KAAK;EACb,YAAY,KAAK,YAAY,KAAA,IAAY,KAAK,UAAU,KAAK,YAAY,KAAA;CAC3E;CACA,IAAI,KAAK,SAAS,OAAO;EACvB,MAAM,MAAM;EACZ,MAAM,OAAO,IAAI,SAAS,IAAI,SAAS,SAAS;EAChD,IAAI,MAAM,KAAK,QAAQ,MAAM,KAAK,OAAO;EACzC,IAAI,IAAI,WAAW,KAAA,GAAW,KAAK,SAAS,MAAM,IAAI,MAAM;CAC9D,OAAO,IAAI,KAAK,SAAS,QAAQ;EAC/B,MAAM,OAAO;EACb,KAAK,QAAQ,OAAO,KAAK,MAAM,KAAK;EACpC,IAAI,KAAK,WAAW,KAAA,GAAW,KAAK,SAAS,OAAO,KAAK,QAAQ,KAAK;CACxE;CACA,OAAO;AACT;;AAGA,SAAS,kBAAkB,OAAe,OAAuC;CAC/E,MAAM,OAAO,MAAM,QAAQ,MAAoB,EAAE,SAAS,KAAK;CAC/D,MAAM,OAAO,KAAK,KAAK,SAAS;CAChC,IAAI,CAAC,MAAM,OAAO,CAAC;CACnB,MAAM,WAA0B,KAAK,SAAS,KAAK,OAAgB;EACjE,MAAM,EAAE;EACR,SAAS,MAAM,EAAE,OAAO;CAC1B,EAAE;CACF,IAAI,KAAK,WAAW,KAAA,KAAa,KAAK,WAAW,IAC/C,SAAS,KAAK;EAAE,MAAM;EAAa,SAAS,MAAM,KAAK,MAAM;CAAE,CAAC;CAElE,OAAO;AACT;AAgBA,MAAM,gBAAgE;CACpE,SAAS;CACT,QAAQ;CACR,UAAU;AACZ;;;;;;;;;AAUA,SAAS,iBAAiB,QAAyB;CACjD,IAAI,aAAa,MAAM,MAAM,KAAA,GAC3B,MAAM,IAAI,gBAAgB,+BAA+B,OAAO,MAAM,wBAAwB;AAElG;AAEA,MAAM,YAAY,UAChB,OAAO,UAAU,YAAY,UAAU;;;;;;;;;;;;;;;;;;;;;;;;;;;AAqCzC,MAAM,oBAA+C;CACnD;EACE,OAAO;EACP,UAAU,QAAQ,SAAS,IAAI,cAAc,KAAK,OAAO,IAAI,eAAe,SAAS;EACrF,QACE;CACJ;CACA;EACE,OAAO;EACP,UAAU,QAAQ,SAAS,IAAI,UAAU;EACzC,QACE;CACJ;CACA;EACE,OAAO;EACP,UAAU,QAAQ,CAAC,SAAS,IAAI,UAAU,KAAK,OAAO,IAAI,WAAW,UAAU;EAC/E,QAAQ;CACV;CACA;EACE,OAAO;EACP,UAAU,QAAQ,CAAC,SAAS,IAAI,UAAU,KAAK,OAAO,IAAI,WAAW,WAAW;EAChF,QAAQ;CACV;CACA;EACE,OAAO;EACP,UAAU,QAAQ,SAAS,IAAI,OAAO;EACtC,QACE;CACJ;CACA;EACE,OAAO;EAGP,UAAU,QAAQ,CAAC,SAAS,IAAI,OAAO,KAAK,SAAS,IAAI,QAAQ,GAAG;EACpE,QACE;CACJ;CACA;EACE,OAAO;EACP,UAAU,QAAQ,OAAO,IAAI,oBAAoB;EACjD,QACE;CACJ;CACA;EACE,OAAO;EACP,UAAU,QAAQ,OAAO,IAAI,eAAe,YAAY,IAAI,WAAW,SAAS;EAChF,QACE;CACJ;AACF;;;;;;;;;;;;;AAcA,SAAgB,kBAAkB,QAA6B;CAC7D,MAAM,MAAM;CACZ,OAAO,kBAAkB,QAAQ,UAAU,CAAC,MAAM,QAAQ,GAAG,CAAC,CAAC,CAAC,KAC7D,UAAU,GAAG,MAAM,MAAM,eAAe,MAAM,QACjD;AACF;;;;;;;;;;;;;;;;;;;;;;;;;;;AA4BA,SAAS,sBAAsB,QAAyB;CACtD,MAAM,UAAU,kBAAkB,MAAM;CACxC,IAAI,QAAQ,WAAW,GAAG;CAC1B,MAAM,IAAI,gBAAgB,+BAA+B,OAAO,MAAM,IAAI,QAAQ,KAAK,MAAM,GAAG;AAClG;AAEA,MAAM,iBAA8D;CAClE,QAAQ;CACR,KAAK;CACL,SAAS;AACX;AAEA,SAAS,SACP,QACA,OACA,UACA,SACA,YACA,KACmB;CAUnB,sBAAsB,MAAM;CAI5B,iBAAiB,MAAM;CAGvB,MAAM,eAAe,oBAAoB,MAAM;CAC/C,MAAM,aAAa,OAAO,eAAe,SAAS;CAClD,MAAM,kBAAkB,OAAO;CAC/B,MAAM,cAAc,oBAAoB,eAAe,oBAAoB;CAC3E,MAAM,cAAc,oBAAoB,eAAe,oBAAoB;CAC3E,MAAM,gBACJ,oBAAoB,YACpB,oBAAoB,eACpB,oBAAoB,eACf,OAAO,yBAAyB,aAAa,oBAC9C;CAIN,OAAO,aACL;EACE,QAAQ;EACR,YAAY,OAAO;EACnB,mBAAmB;EACnB,QAAQ,OAAO;EACf,eAAe,OAAO;EACtB,cAAc,OAAO;EACrB,YAAY;EACZ,iBAAiB;EACjB,MAAM,QAAQ,QAAQ;EACtB,MAAM;GACJ,OAAO,QAAQ,SAAS,OAAO;GAC/B,aAAa,OAAO;GACpB,OAAO,eAAe,OAAO;GAC7B,MAAM,OAAO;GACb,KAAK;EACP;EACA,QAAQ;GACN,SAAS;GACT,iBAAiB;GACjB,OAAO,OAAO;GACd,UAAU;GACV,gBAAgB,OAAO;GACvB,aAAa,OAAO;GACpB,aAAa,OAAO;GACpB,uBAAuB,OAAO,cAAc,UAAU;GACtD,UAAU;EACZ;EACA;EACA,WAAW,CAAC;EACZ,GAAI,MAAM,SAAS,IAAI,EAAE,MAAM,IAAI,CAAC;EACpC,SAAS;GACP,GAAG;GACH,eAAe,cAAc,YAAY,MAAM;GAC/C,SAAS;GAUT,SAAS,EAAE,GAAG,OAAO,QAAQ,IAAI;GACjC,cAAc;GACd,cAAc;GACd,OAAO;EACT;EACA,MAAM;GACJ,KAAK,aAAa,OAAO,OAAO;GAChC,WAAW,OAAO,WAAW;GAC7B,YAAY,OAAO,WAAW;GAC9B,kBAAkB,OAAO,WAAW,aAAa;GACjD,YAAY,OAAO,WAAW,UAAU;GACxC,aAAa,OAAO,WAAW,cAAc;GAC7C,QAAQ,KAAK,MAAM,OAAO,SAAS,GAAI;EACzC;EACA,WAAW;GAAE,YAAY;GAAM,SAAS;GAAM,gBAAgB;EAAK;EACnE,YAAY;GACV,aAAa;GACb,SAAS;GACT,GAAI,QAAQ,KAAA,IAAY,EAAE,IAAI,IAAI,CAAC;EACrC;CACF,GACA,+BAA+B,OAAO,OACxC;AACF;;;;;;;AAQA,eAAsB,gBACpB,SACA,OACA,UAA8B,CAAC,GACH;CAC5B,MAAM,QAAQ,QAAQ,WAAW,MAAM;CACvC,MAAM,cAAc,QAAQ,MAAM,qBAAK,IAAI,KAAK,EAAA,CAAG,YAAY;CAC/D,MAAM,OAA4B,CAAC;CACnC,MAAM,gBAA0B,CAAC;CACjC,KAAK,MAAM,UAAU,SAAS;EAC5B,MAAM,aAAa,MAAM,gBAAgB,OAAO,OAAO,KAAK;EAC5D,IAAI,WAAW,MAAM,WAAW,GAAG;GACjC,cAAc,KAAK,OAAO,KAAK;GAC/B,KAAK,KACH,SAAS,QAAQ,CAAC,GAAG,CAAC,GAAG,SAAS,YAAY,wCAAwC,CACxF;GACA;EACF;EACA,IAAI,QAAQ,WAAW,MAAM,KAAK,MAAM,YAAY,EAAE,MAAM,KAAK,CAAC;EAClE,IAAI,QAAQ,aAAa,KAAA,KAAa,MAAM,SAAS,QAAQ,UAAU;GAGrE,MAAM,OAAO,KAAK,KAAK,QAAQ,WAAW,CAAC;GAC3C,MAAM,OAAO,QAAQ,WAAW;GAChC,QAAQ,CAAC,GAAG,MAAM,MAAM,GAAG,IAAI,GAAG,GAAG,MAAM,MAAM,MAAM,SAAS,IAAI,CAAC;EACvE;EACA,MAAM,eAAe,kBACnB,WAAW,MAAM,KAAK,MAAM,EAAE,IAAI,GAClC,KACF;EACA,MAAM,MACJ,aAAa,WAAW,IAAI,uDAAuD,KAAA;EACrF,KAAK,KAAK,SAAS,QAAQ,OAAO,cAAc,SAAS,YAAY,GAAG,CAAC;CAC3E;CACA,OAAO;EAAE;EAAM;CAAc;AAC/B"}
1
+ {"version":3,"file":"mint-B2O60ACG.js","names":[],"sources":["../src/rollout/mint.ts"],"sourcesContent":["/**\n * Rollout minting — `tangle.rollout.v1` lines joined from the records the\n * substrate ALREADY keeps. There is no separate rollout store: a rollout\n * is the JOIN of a RunRecord (identity, provenance, cost, outcome) with\n * its trace (spans share `runId`), projected into the canonical line.\n *\n * Composition, not duplication:\n * - identity/provenance → `RunRecord` (candidateId, splitTag, agentProfile, hashes)\n * - step structure → `buildTrajectory` over the shared TraceStore\n * - preference-pair export → `feedbackTrajectoryToOptimizerRow` (feedback-trajectory.ts)\n * - PRM / reward-model → `reward-model-export.ts`\n *\n * Anti-Goodhart invariant: a run whose `outcome.realness.gated` is true is\n * never exported with a positive reward OR with any of the numbers that reward\n * was computed from. The gate travels into the training data (`reward` forced\n * to 0, `realness_gated: true`) and the whole outcome is transformed by\n * `gateGamedOutcome` inside `assertMinted` below, which relocates `metrics` and\n * `verdict` to `provenance.gated_evidence`. Mint returns\n * `MintedRolloutLine[]`: the brand the training exporters require, which only\n * this function, `readRolloutLedger`, and an explicit `assertMinted` can mint.\n *\n * A record carrying NEITHER split score is REJECTED (`ValidationError`), never\n * minted at 0 — \"nobody graded this\" is not the same claim as \"graded a total\n * failure\", and a trainer reading 0 learns the second. Lines that already\n * carry `reward: null` (interchange imports, existing ledgers) remain valid on\n * the wire; only the RunRecord→line door refuses.\n *\n * Records without spans become labeled GAP LINES (messages: [],\n * provenance.gap) — present in the output AND surfaced in\n * `missingTraces`; a capture gap is a finding, never a silent omission.\n */\n\nimport { ValidationError } from '../errors'\nimport { type RunRecord, runTaskScore } from '../run-record'\nimport type { LlmSpan, Message, Span, ToolSpan } from '../trace/schema'\nimport type { TraceStore } from '../trace/store'\nimport { buildTrajectory } from '../trajectory'\nimport { rolloutRewardFields, scoreOrigin } from './reward'\nimport {\n assertMinted,\n type ChatMessage,\n type MintedRolloutLine,\n ROLLOUT_SCHEMA,\n type RolloutRole,\n type RolloutSplit,\n type RolloutStep,\n} from './schema'\n\n/** Redactor applied to every exported string (secrets, PII). Identity by default. */\nexport type RolloutScrubber = (text: string) => string\n\nexport interface MintRolloutOptions {\n scrub?: RolloutScrubber\n /** Cap steps per line (longest runs first drop middle steps). Default: no cap. */\n maxSteps?: number\n /** Role recorded on every minted line. Default 'agent' (a solo eval run). */\n role?: RolloutRole\n /** Task suite label. Default: the record's `experimentId`. */\n suite?: string\n /** Injected clock for deterministic output. */\n now?: () => Date\n}\n\nexport interface MintRolloutResult {\n rows: MintedRolloutLine[]\n /** runIds that had a RunRecord but no spans — emitted as gap lines AND listed here. */\n missingTraces: string[]\n}\n\nconst asText = (v: unknown, scrub: RolloutScrubber): string => {\n const s = typeof v === 'string' ? v : JSON.stringify(v)\n return scrub(s ?? '')\n}\n\nfunction projectStep(span: Span, scrub: RolloutScrubber): RolloutStep {\n const base: RolloutStep = {\n kind: span.kind,\n name: scrub(span.name),\n status: span.status,\n durationMs: span.endedAt !== undefined ? span.endedAt - span.startedAt : undefined,\n }\n if (span.kind === 'llm') {\n const llm = span as LlmSpan\n const last = llm.messages[llm.messages.length - 1]\n if (last) base.input = scrub(last.content)\n if (llm.output !== undefined) base.output = scrub(llm.output)\n } else if (span.kind === 'tool') {\n const tool = span as ToolSpan\n base.input = asText(tool.args, scrub)\n if (tool.result !== undefined) base.output = asText(tool.result, scrub)\n }\n return base\n}\n\n/** The final llm span's history + output is the completed conversation. */\nfunction finalConversation(spans: Span[], scrub: RolloutScrubber): ChatMessage[] {\n const llms = spans.filter((s): s is LlmSpan => s.kind === 'llm')\n const last = llms[llms.length - 1]\n if (!last) return []\n const messages: ChatMessage[] = last.messages.map((m: Message) => ({\n role: m.role,\n content: scrub(m.content),\n }))\n if (last.output !== undefined && last.output !== '') {\n messages.push({ role: 'assistant', content: scrub(last.output) })\n }\n return messages\n}\n\n// The reward derivations live in the leaf module `./reward` so gate and\n// reporting code can import them without dragging in the trace store; they are\n// re-exported here because the derivations shipped from this path.\nexport {\n isRealnessGated,\n observedScore,\n observedSplitScore,\n type ScoreOrigin,\n type ScorePreference,\n scoreOrigin,\n trainingReward,\n trainingScore,\n} from './reward'\n\nconst REWARD_SOURCE: Record<ReturnType<typeof scoreOrigin>, string> = {\n holdout: 'run-record/holdout-score',\n search: 'run-record/search-score',\n unscored: 'run-record/unscored',\n}\n\n/**\n * The mint door refuses an execution-only record: a missing training label is\n * not a zero reward, and not a mintable line either. Lines that already carry\n * `reward: null` — interchange imports, existing ledgers — stay valid on the\n * wire and keep their labeled gap; this guard is only about the\n * RunRecord→line door, where the producer can still be told to go score the\n * run instead of shipping an unlabeled row.\n */\nfunction requireTaskScore(record: RunRecord): void {\n if (runTaskScore(record) === undefined) {\n throw new ValidationError(`Cannot mint rollout for run ${record.runId}: task score is missing`)\n }\n}\n\nconst isObject = (value: unknown): value is Record<string, unknown> =>\n typeof value === 'object' && value !== null\n\ninterface MintFieldCheck {\n /** The RunRecord path, spelled the way the caller has to fix it. */\n readonly field: string\n /** True when the record carries something the line can honestly be built from. */\n readonly present: (bag: Record<string, unknown>) => boolean\n /** What the caller writes onto the record, and why that value and not another. */\n readonly remedy: string\n}\n\n/**\n * The RunRecord fields mint reads that a record can be missing even though the\n * TYPE says it cannot. There are exactly two ways that happens:\n *\n * 1. The field was OPTIONAL when the record was serialized. `costProvenance`,\n * `terminalOutcome` and `scenarioId` were optional through agent-eval\n * 0.125 and became required in 0.126, with no on-disk migration — so every\n * ledger written before 0.126 is full of records the type calls complete.\n * 2. Mint reads a level DEEPER than the record's own type is checked at:\n * `outcome.raw`, `tokenUsage.input`, `tokenUsage.output`.\n *\n * Nothing else needs a check here. Every other field mint copies is a top-level\n * scalar landing in a typed slot on the line, where an absent value arrives as\n * `undefined` and `assertMinted` refuses it by name. These are the ones where an\n * absent value instead kills the join with `TypeError: Cannot read properties of\n * undefined`, or — worse — mints a line that reads as measured.\n *\n * This is deliberately NOT `validateRunRecord`. That validator answers \"is this\n * a valid RunRecord\", which is a wider question than \"can a rollout line be\n * built from this one\": it also enforces model-snapshot discipline, the\n * `terminalFailureReason` coupling, and the `costUsd === costProvenance.usd`\n * agreement. Routing the mint door through it would refuse records mint can\n * mint honestly today (a model alias with no snapshot date, for one), which is\n * a policy change with its own blast radius and not this bug. The door asks the\n * narrower question and answers it precisely.\n */\nconst MINT_FIELD_CHECKS: readonly MintFieldCheck[] = [\n {\n field: 'costProvenance',\n present: (bag) => isObject(bag.costProvenance) && typeof bag.costProvenance.kind === 'string',\n remedy:\n \"Records written before agent-eval 0.126 predate this field and carry `costUsd: 0` as the documented uncaptured sentinel, which is NOT an observed zero. Backfill it as costProvenance: { kind: 'uncaptured', usd: null } WITH costUsd: null — an uncaptured cost whose costUsd is non-null is rejected by validateRunRecord, so provenance alone leaves the record invalid.\",\n },\n {\n field: 'tokenUsage',\n present: (bag) => isObject(bag.tokenUsage),\n remedy:\n \"The line's cost.tokens_in and cost.tokens_out are read from it. Backfill it from the provider's usage report; mint will not write 0 for tokens nobody counted.\",\n },\n {\n field: 'tokenUsage.input',\n present: (bag) => !isObject(bag.tokenUsage) || typeof bag.tokenUsage.input === 'number',\n remedy: \"The line's cost.tokens_in is read from it, and a missing count is not a zero count.\",\n },\n {\n field: 'tokenUsage.output',\n present: (bag) => !isObject(bag.tokenUsage) || typeof bag.tokenUsage.output === 'number',\n remedy: \"The line's cost.tokens_out is read from it, and a missing count is not a zero count.\",\n },\n {\n field: 'outcome',\n present: (bag) => isObject(bag.outcome),\n remedy:\n \"The line's reward, reward_source and metrics are all read from it. A record with no outcome carries no training label at all, and mint refuses an unlabeled row.\",\n },\n {\n field: 'outcome.raw',\n // Reported only when `outcome` itself is present: one absent field should\n // produce one reason per CAUSE, not one per path that dereferences it.\n present: (bag) => !isObject(bag.outcome) || isObject(bag.outcome.raw),\n remedy:\n 'It is the metric bag copied verbatim into the line\\'s outcome.metrics. `{ ...undefined }` spreads to `{}` without complaint, so an absent bag would mint as \"this run reported no metrics\" — a different claim from \"this record predates the field\". Backfill it as {} only when that is what you mean.',\n },\n {\n field: 'terminalOutcome',\n present: (bag) => typeof bag.terminalOutcome === 'string',\n remedy:\n \"It became required in agent-eval 0.126. Backfill it from root-run or process evidence, or as 'unknown' when the producer has none — mint will not decide the line's is_completed and is_truncated for you.\",\n },\n {\n field: 'scenarioId',\n present: (bag) => typeof bag.scenarioId === 'string' && bag.scenarioId.length > 0,\n remedy:\n \"It became required in agent-eval 0.126 and becomes the line's task.instance_id, which must be a non-empty string. Backfill it from the scenario the run was dealt (pre-0.126 producers often left it in outcome.raw.scenario_id).\",\n },\n]\n\n/**\n * Why a record cannot be minted, one entry per missing field, empty when it can.\n *\n * Exported so a caller can partition a whole ledger — \"which of my 2742 records\n * predate 0.126\" — without catching an exception per record, and without\n * re-deriving the field list on their side. A re-derived list is a list that\n * drifts from the door it is supposed to predict.\n *\n * Takes a `RunRecord` because that is what the caller holds and what the\n * compiler agrees they hold. The type is precisely the thing that is wrong, so\n * the checks read the record as the untyped bag it actually is on disk.\n */\nexport function unmintableReasons(record: RunRecord): string[] {\n const bag = record as unknown as Record<string, unknown>\n return MINT_FIELD_CHECKS.filter((check) => !check.present(bag)).map(\n (check) => `${check.field} is missing. ${check.remedy}`,\n )\n}\n\n/**\n * The mint door THROWS on a record it cannot build a line from. It does NOT\n * normalise an absent `costProvenance` to `{kind:'uncaptured', usd:null}`, and\n * the choice is not stylistic:\n *\n * - Normalising cannot cover the record, only part of it. `terminalOutcome`\n * feeds `is_completed` and `is_truncated`, which the rollout schema requires\n * to be BOOLEAN — there is no null to fall back to, so every possible\n * default is a claim about how the run ended. A door that quietly fixes the\n * cost and invents the ending is a door no caller can predict.\n * - Normalising the cost requires knowing what `costUsd: 0` meant, and mint\n * cannot know. A genuinely free run and an uncaptured one are the same bytes\n * in a pre-0.126 record; only the producer can tell them apart. Guessing is\n * exactly the failure this guard exists to stop — the 0.125 optional chain\n * `record.costProvenance?.kind === 'uncaptured'` already made that guess,\n * silently, and every record it touched minted `cost.usd: 0`: an unmeasured\n * cost published as a measured zero, into a training dataset.\n * - `requireTaskScore`, directly above, already refuses an unlabeled record\n * for the same reason: \"nobody graded this\" is not \"graded zero\". \"Nobody\n * billed this\" is not \"billed zero\".\n *\n * The caller who wants historical records minted backfills them at their store,\n * in one pass, where `costUsd` can be corrected alongside `costProvenance` —\n * which is the only place that decision can be made correctly. The refusal names\n * the run, names every missing field, and spells the value to write.\n */\nfunction requireMintableRecord(record: RunRecord): void {\n const reasons = unmintableReasons(record)\n if (reasons.length === 0) return\n throw new ValidationError(`Cannot mint rollout for run ${record.runId}: ${reasons.join('\\n ')}`)\n}\n\nconst SPLIT_FROM_TAG: Record<RunRecord['splitTag'], RolloutSplit> = {\n search: 'search',\n dev: 'dev',\n holdout: 'holdout',\n}\n\nfunction mintLine(\n record: RunRecord,\n steps: RolloutStep[],\n messages: ChatMessage[],\n options: MintRolloutOptions,\n capturedAt: string,\n gap?: string,\n): MintedRolloutLine {\n // Field presence first, and BEFORE `requireTaskScore`: that guard reads\n // `record.outcome.searchScore` on its way to the answer, so an absent\n // `outcome` would throw a bare TypeError from inside the guard whose whole\n // job is to produce a clean refusal.\n //\n // Both branches of `mintRolloutRows` — the traced line and the gap line —\n // land here, which is the point: `mintLine` is the only constructor of a\n // `MintedRolloutLine` from a RunRecord, so there is no path into the waist\n // that skips the check and no way to get this wrong from the outside.\n requireMintableRecord(record)\n // A missing task score is refused before anything is built: an\n // execution-only record has no training label, and a missing label is\n // neither a zero reward nor a mintable row.\n requireTaskScore(record)\n // `reward` and `realness_gated` come out of one call, so neither door into\n // the waist can write one and forget the other.\n const rewardFields = rolloutRewardFields(record)\n const uncaptured = record.costProvenance.kind === 'uncaptured'\n const terminalOutcome = record.terminalOutcome\n const isCompleted = terminalOutcome === 'succeeded' || terminalOutcome === 'failed'\n const isTruncated = terminalOutcome === 'cancelled' || terminalOutcome === 'incomplete'\n const terminalError =\n terminalOutcome === 'failed' ||\n terminalOutcome === 'cancelled' ||\n terminalOutcome === 'incomplete'\n ? (record.terminalFailureReason ?? `run ended ${terminalOutcome}`)\n : null\n // `assertMinted` rather than a cast: mint is the producer the whole gate\n // rests on, so it proves the line it just built is valid instead of asserting\n // it by fiat. The brand is unforgeable precisely because nobody casts to it.\n return assertMinted(\n {\n schema: ROLLOUT_SCHEMA,\n rollout_id: record.runId,\n parent_rollout_id: null,\n run_id: record.runId,\n experiment_id: record.experimentId,\n candidate_id: record.candidateId,\n generation: null,\n candidate_index: null,\n role: options.role ?? 'agent',\n task: {\n suite: options.suite ?? record.experimentId,\n instance_id: record.scenarioId,\n split: SPLIT_FROM_TAG[record.splitTag],\n seed: record.seed,\n rep: 0,\n },\n policy: {\n harness: null,\n harness_version: null,\n model: record.model,\n provider: null,\n profile_commit: record.commitSha,\n prompt_hash: record.promptHash,\n config_hash: record.configHash,\n agent_profile_cell_id: record.agentProfile?.cellId ?? null,\n sampling: null,\n },\n messages,\n tool_defs: [],\n ...(steps.length > 0 ? { steps } : {}),\n outcome: {\n ...rewardFields,\n reward_source: REWARD_SOURCE[scoreOrigin(record)],\n verdict: null,\n // A verbatim bulk copy, deliberately UNFILTERED here. `outcome.raw`\n // holds the per-layer verifier scores (`layer.*`) that the reward was\n // derived from, so on a gated run this dict is the reward signal in\n // component form — but filtering it at this call site is the pattern\n // that has now leaked twice, because the next producer to write a\n // reward-bearing field forgets. The gate is applied to the whole\n // outcome once, in `assertMinted` below (`gateGamedOutcome`), which\n // moves the block to `provenance.gated_evidence` when the run is gated\n // and leaves it here untouched when it is not.\n metrics: { ...record.outcome.raw },\n is_completed: isCompleted,\n is_truncated: isTruncated,\n error: terminalError,\n },\n cost: {\n usd: uncaptured ? null : record.costUsd,\n tokens_in: record.tokenUsage.input,\n tokens_out: record.tokenUsage.output,\n tokens_reasoning: record.tokenUsage.reasoning ?? null,\n cache_read: record.tokenUsage.cached ?? null,\n cache_write: record.tokenUsage.cacheWrite ?? null,\n wall_s: Math.round(record.wallMs / 1000),\n },\n artifacts: { patch_path: null, run_dir: null, transcript_ref: null },\n provenance: {\n captured_at: capturedAt,\n capture: 'mint',\n ...(gap !== undefined ? { gap } : {}),\n },\n },\n `minted rollout line for run ${record.runId}`,\n )\n}\n\n/**\n * Join RunRecords with their traces into canonical rollout lines. Records\n * without spans are emitted as labeled gap lines and reported in\n * `missingTraces`. Execution-only records without a task score are rejected\n * because a missing training label is not a zero reward.\n */\nexport async function mintRolloutRows(\n records: RunRecord[],\n store: TraceStore,\n options: MintRolloutOptions = {},\n): Promise<MintRolloutResult> {\n const scrub = options.scrub ?? ((t) => t)\n const capturedAt = (options.now?.() ?? new Date()).toISOString()\n const rows: MintedRolloutLine[] = []\n const missingTraces: string[] = []\n for (const record of records) {\n const trajectory = await buildTrajectory(store, record.runId)\n if (trajectory.steps.length === 0) {\n missingTraces.push(record.runId)\n rows.push(\n mintLine(record, [], [], options, capturedAt, 'no trace spans recorded for this runId'),\n )\n continue\n }\n let steps = trajectory.steps.map((s) => projectStep(s.span, scrub))\n if (options.maxSteps !== undefined && steps.length > options.maxSteps) {\n // Keep the head and tail — the middle of a long run is the least\n // informative for outcome attribution.\n const head = Math.ceil(options.maxSteps / 2)\n const tail = options.maxSteps - head\n steps = [...steps.slice(0, head), ...steps.slice(steps.length - tail)]\n }\n const conversation = finalConversation(\n trajectory.steps.map((s) => s.span),\n scrub,\n )\n const gap =\n conversation.length === 0 ? 'trace has no llm spans — no conversation to inline' : undefined\n rows.push(mintLine(record, steps, conversation, options, capturedAt, gap))\n }\n return { rows, missingTraces }\n}\n"],"mappings":";;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;AAqEA,MAAM,UAAU,GAAY,UAAmC;CAE7D,OAAO,OADG,OAAO,MAAM,WAAW,IAAI,KAAK,UAAU,CAAC,MACpC,EAAE;AACtB;AAEA,SAAS,YAAY,MAAY,OAAqC;CACpE,MAAM,OAAoB;EACxB,MAAM,KAAK;EACX,MAAM,MAAM,KAAK,IAAI;EACrB,QAAQ,KAAK;EACb,YAAY,KAAK,YAAY,KAAA,IAAY,KAAK,UAAU,KAAK,YAAY,KAAA;CAC3E;CACA,IAAI,KAAK,SAAS,OAAO;EACvB,MAAM,MAAM;EACZ,MAAM,OAAO,IAAI,SAAS,IAAI,SAAS,SAAS;EAChD,IAAI,MAAM,KAAK,QAAQ,MAAM,KAAK,OAAO;EACzC,IAAI,IAAI,WAAW,KAAA,GAAW,KAAK,SAAS,MAAM,IAAI,MAAM;CAC9D,OAAO,IAAI,KAAK,SAAS,QAAQ;EAC/B,MAAM,OAAO;EACb,KAAK,QAAQ,OAAO,KAAK,MAAM,KAAK;EACpC,IAAI,KAAK,WAAW,KAAA,GAAW,KAAK,SAAS,OAAO,KAAK,QAAQ,KAAK;CACxE;CACA,OAAO;AACT;;AAGA,SAAS,kBAAkB,OAAe,OAAuC;CAC/E,MAAM,OAAO,MAAM,QAAQ,MAAoB,EAAE,SAAS,KAAK;CAC/D,MAAM,OAAO,KAAK,KAAK,SAAS;CAChC,IAAI,CAAC,MAAM,OAAO,CAAC;CACnB,MAAM,WAA0B,KAAK,SAAS,KAAK,OAAgB;EACjE,MAAM,EAAE;EACR,SAAS,MAAM,EAAE,OAAO;CAC1B,EAAE;CACF,IAAI,KAAK,WAAW,KAAA,KAAa,KAAK,WAAW,IAC/C,SAAS,KAAK;EAAE,MAAM;EAAa,SAAS,MAAM,KAAK,MAAM;CAAE,CAAC;CAElE,OAAO;AACT;AAgBA,MAAM,gBAAgE;CACpE,SAAS;CACT,QAAQ;CACR,UAAU;AACZ;;;;;;;;;AAUA,SAAS,iBAAiB,QAAyB;CACjD,IAAI,aAAa,MAAM,MAAM,KAAA,GAC3B,MAAM,IAAI,gBAAgB,+BAA+B,OAAO,MAAM,wBAAwB;AAElG;AAEA,MAAM,YAAY,UAChB,OAAO,UAAU,YAAY,UAAU;;;;;;;;;;;;;;;;;;;;;;;;;;;AAqCzC,MAAM,oBAA+C;CACnD;EACE,OAAO;EACP,UAAU,QAAQ,SAAS,IAAI,cAAc,KAAK,OAAO,IAAI,eAAe,SAAS;EACrF,QACE;CACJ;CACA;EACE,OAAO;EACP,UAAU,QAAQ,SAAS,IAAI,UAAU;EACzC,QACE;CACJ;CACA;EACE,OAAO;EACP,UAAU,QAAQ,CAAC,SAAS,IAAI,UAAU,KAAK,OAAO,IAAI,WAAW,UAAU;EAC/E,QAAQ;CACV;CACA;EACE,OAAO;EACP,UAAU,QAAQ,CAAC,SAAS,IAAI,UAAU,KAAK,OAAO,IAAI,WAAW,WAAW;EAChF,QAAQ;CACV;CACA;EACE,OAAO;EACP,UAAU,QAAQ,SAAS,IAAI,OAAO;EACtC,QACE;CACJ;CACA;EACE,OAAO;EAGP,UAAU,QAAQ,CAAC,SAAS,IAAI,OAAO,KAAK,SAAS,IAAI,QAAQ,GAAG;EACpE,QACE;CACJ;CACA;EACE,OAAO;EACP,UAAU,QAAQ,OAAO,IAAI,oBAAoB;EACjD,QACE;CACJ;CACA;EACE,OAAO;EACP,UAAU,QAAQ,OAAO,IAAI,eAAe,YAAY,IAAI,WAAW,SAAS;EAChF,QACE;CACJ;AACF;;;;;;;;;;;;;AAcA,SAAgB,kBAAkB,QAA6B;CAC7D,MAAM,MAAM;CACZ,OAAO,kBAAkB,QAAQ,UAAU,CAAC,MAAM,QAAQ,GAAG,CAAC,CAAC,CAAC,KAC7D,UAAU,GAAG,MAAM,MAAM,eAAe,MAAM,QACjD;AACF;;;;;;;;;;;;;;;;;;;;;;;;;;;AA4BA,SAAS,sBAAsB,QAAyB;CACtD,MAAM,UAAU,kBAAkB,MAAM;CACxC,IAAI,QAAQ,WAAW,GAAG;CAC1B,MAAM,IAAI,gBAAgB,+BAA+B,OAAO,MAAM,IAAI,QAAQ,KAAK,MAAM,GAAG;AAClG;AAEA,MAAM,iBAA8D;CAClE,QAAQ;CACR,KAAK;CACL,SAAS;AACX;AAEA,SAAS,SACP,QACA,OACA,UACA,SACA,YACA,KACmB;CAUnB,sBAAsB,MAAM;CAI5B,iBAAiB,MAAM;CAGvB,MAAM,eAAe,oBAAoB,MAAM;CAC/C,MAAM,aAAa,OAAO,eAAe,SAAS;CAClD,MAAM,kBAAkB,OAAO;CAC/B,MAAM,cAAc,oBAAoB,eAAe,oBAAoB;CAC3E,MAAM,cAAc,oBAAoB,eAAe,oBAAoB;CAC3E,MAAM,gBACJ,oBAAoB,YACpB,oBAAoB,eACpB,oBAAoB,eACf,OAAO,yBAAyB,aAAa,oBAC9C;CAIN,OAAO,aACL;EACE,QAAQ;EACR,YAAY,OAAO;EACnB,mBAAmB;EACnB,QAAQ,OAAO;EACf,eAAe,OAAO;EACtB,cAAc,OAAO;EACrB,YAAY;EACZ,iBAAiB;EACjB,MAAM,QAAQ,QAAQ;EACtB,MAAM;GACJ,OAAO,QAAQ,SAAS,OAAO;GAC/B,aAAa,OAAO;GACpB,OAAO,eAAe,OAAO;GAC7B,MAAM,OAAO;GACb,KAAK;EACP;EACA,QAAQ;GACN,SAAS;GACT,iBAAiB;GACjB,OAAO,OAAO;GACd,UAAU;GACV,gBAAgB,OAAO;GACvB,aAAa,OAAO;GACpB,aAAa,OAAO;GACpB,uBAAuB,OAAO,cAAc,UAAU;GACtD,UAAU;EACZ;EACA;EACA,WAAW,CAAC;EACZ,GAAI,MAAM,SAAS,IAAI,EAAE,MAAM,IAAI,CAAC;EACpC,SAAS;GACP,GAAG;GACH,eAAe,cAAc,YAAY,MAAM;GAC/C,SAAS;GAUT,SAAS,EAAE,GAAG,OAAO,QAAQ,IAAI;GACjC,cAAc;GACd,cAAc;GACd,OAAO;EACT;EACA,MAAM;GACJ,KAAK,aAAa,OAAO,OAAO;GAChC,WAAW,OAAO,WAAW;GAC7B,YAAY,OAAO,WAAW;GAC9B,kBAAkB,OAAO,WAAW,aAAa;GACjD,YAAY,OAAO,WAAW,UAAU;GACxC,aAAa,OAAO,WAAW,cAAc;GAC7C,QAAQ,KAAK,MAAM,OAAO,SAAS,GAAI;EACzC;EACA,WAAW;GAAE,YAAY;GAAM,SAAS;GAAM,gBAAgB;EAAK;EACnE,YAAY;GACV,aAAa;GACb,SAAS;GACT,GAAI,QAAQ,KAAA,IAAY,EAAE,IAAI,IAAI,CAAC;EACrC;CACF,GACA,+BAA+B,OAAO,OACxC;AACF;;;;;;;AAQA,eAAsB,gBACpB,SACA,OACA,UAA8B,CAAC,GACH;CAC5B,MAAM,QAAQ,QAAQ,WAAW,MAAM;CACvC,MAAM,cAAc,QAAQ,MAAM,qBAAK,IAAI,KAAK,EAAA,CAAG,YAAY;CAC/D,MAAM,OAA4B,CAAC;CACnC,MAAM,gBAA0B,CAAC;CACjC,KAAK,MAAM,UAAU,SAAS;EAC5B,MAAM,aAAa,MAAM,gBAAgB,OAAO,OAAO,KAAK;EAC5D,IAAI,WAAW,MAAM,WAAW,GAAG;GACjC,cAAc,KAAK,OAAO,KAAK;GAC/B,KAAK,KACH,SAAS,QAAQ,CAAC,GAAG,CAAC,GAAG,SAAS,YAAY,wCAAwC,CACxF;GACA;EACF;EACA,IAAI,QAAQ,WAAW,MAAM,KAAK,MAAM,YAAY,EAAE,MAAM,KAAK,CAAC;EAClE,IAAI,QAAQ,aAAa,KAAA,KAAa,MAAM,SAAS,QAAQ,UAAU;GAGrE,MAAM,OAAO,KAAK,KAAK,QAAQ,WAAW,CAAC;GAC3C,MAAM,OAAO,QAAQ,WAAW;GAChC,QAAQ,CAAC,GAAG,MAAM,MAAM,GAAG,IAAI,GAAG,GAAG,MAAM,MAAM,MAAM,SAAS,IAAI,CAAC;EACvE;EACA,MAAM,eAAe,kBACnB,WAAW,MAAM,KAAK,MAAM,EAAE,IAAI,GAClC,KACF;EACA,MAAM,MACJ,aAAa,WAAW,IAAI,uDAAuD,KAAA;EACrF,KAAK,KAAK,SAAS,QAAQ,OAAO,cAAc,SAAS,YAAY,GAAG,CAAC;CAC3E;CACA,OAAO;EAAE;EAAM;CAAc;AAC/B"}
@@ -1,5 +1,5 @@
1
1
  import { p as CostProvenance } from "../cost-ledger-Bv_e8XHY.js";
2
- import { w as JudgeScore } from "../types-DYuNHo9R.js";
2
+ import { w as JudgeScore } from "../types-BnjdJ70P.js";
3
3
  import { o as MatrixResult } from "../index-C3ssXVLv.js";
4
4
  import { AgentProfile } from "@tangle-network/agent-interface";
5
5
  //#region src/multishot/types.d.ts
package/dist/openapi.json CHANGED
@@ -2,7 +2,7 @@
2
2
  "openapi": "3.1.0",
3
3
  "info": {
4
4
  "title": "@tangle-network/agent-eval — wire protocol",
5
- "version": "0.144.7",
5
+ "version": "0.144.9",
6
6
  "description": "HTTP and stdio RPC interface to agent-eval. The TypeScript runtime is the source of truth; this spec is the contract that cross-language clients (Python, Rust, Go) generate from.\n\nWire-protocol version: 1.0.0. Bumps on breaking changes to request/response schemas.",
7
7
  "contact": {
8
8
  "name": "Tangle Network",
@@ -1,4 +1,4 @@
1
- import { R as Scenario, h as GateContext, p as Gate, v as GateResult } from "./types-DYuNHo9R.js";
1
+ import { R as Scenario, h as GateContext, p as Gate, v as GateResult } from "./types-BnjdJ70P.js";
2
2
  import { y as PairedBootstrapResult } from "./statistics-D6Uebe_4.js";
3
3
  import { i as PairedMcNemarEvidence, r as PairedDecisionStatistic, t as PairedDecisionMethod } from "./paired-promotion-decision-B6zJ3gYM.js";
4
4
  //#region src/campaign/gates/power-preflight.d.ts
@@ -286,4 +286,4 @@ interface ParetoSignificanceGateOptions extends BuildEvidenceVectorOptions {
286
286
  declare function paretoSignificanceGate<TArtifact = unknown, TScenario extends Scenario = Scenario>(options: ParetoSignificanceGateOptions): Gate<TArtifact, TScenario>;
287
287
  //#endregion
288
288
  export { powerPreflight as S, paretoFrontier as _, ObjectiveSource as a, PowerPreflight as b, PromotionPolicy as c, paretoSignificanceGate as d, Direction as f, dominates as g, crowdingDistance as h, EvidenceVector as i, buildEvidenceVector as l, ParetoResult as m, AxisVerdict as n, ParetoSignificanceGateOptions as o, Objective as p, BuildEvidenceVectorOptions as r, PromotionObjective as s, AxisEvidence as t, paretoPolicy as u, paretoFrontierWithCrowding as v, PowerPreflightOptions as x, scalarScore as y };
289
- //# sourceMappingURL=promotion-policy-ChWhTDBH.d.ts.map
289
+ //# sourceMappingURL=promotion-policy-Ckjhzg_4.d.ts.map
@@ -1 +1 @@
1
- {"version":3,"file":"promotion-policy-ChWhTDBH.d.ts","names":[],"sources":["../src/campaign/gates/power-preflight.ts","../src/pareto.ts","../src/campaign/gates/promotion-policy.ts"],"mappings":";;;;;;;;;;;;;;;;;;;;;;;;;;;UAwBiB;;EAEf;;;EAGA;;EAEA;;EAEA;;;;;;;EAOA;;UAGe;;EAEf;;EAEA;;EAEA;;EAEA;;EAEA;;;;EAIA;;;EAGA;EACA;EACA;;;EAGA;;EAEA;;;;;;iBAec,eAAe,MAAM,wBAAwB;;;;;;;;;;;;;;;;;;KClEjD;UAEK,UAAU;;EAEzB;EACA,WAAW;EACX,QAAQ,WAAW;;UAGJ,aAAa;EAC5B,UAAU;EACV,WAAW;;EAEX,cAAc;IAAQ,WAAW;IAAG,WAAW;;;;iBAIjC,UAAU,GAAG,GAAG,GAAG,GAAG,GAAG,YAAY,UAAU;;;;;;iBAmB/C,eAAe,GAAG,YAAY,KAAK,YAAY,UAAU,OAAO,aAAa;;;;;;;;;;iBA4B7E,YAAY,GAC1B,YAAY,KACZ,YAAY,UAAU,MACtB;EAAW,UAAU,QAAQ;IAC5B;EAAQ,WAAW;EAAG;;;;;;;;;;;;;;iBAyCT,iBAAiB,GAC/B,YAAY,KACZ,YAAY,UAAU,OACrB;EAAQ,WAAW;EAAG;;;;;;;iBA6BT,2BAA2B,GACzC,YAAY,KACZ,YAAY,UAAU,OACrB;EAAQ,WAAW;EAAG;;;;;;KCtHb;EAAoB;;EAAwB;EAAmB;;UAE1D;;EAEf;EACA,QAAQ;;;EAGR,WAAW;;;;EAIX;;;;;EAKA;;;KAIU;UAEK;EACf;EACA,QAAQ;EACR,WAAW;;;;;;;;EAQX,WAAW;;;;;EAKX;;;EAGA;IAAM;IAAa;;;EAEnB,mBAAmB;;EAEnB,SAAS;;;EAGT;;EAEA;EACA;EACA,gBAAgB;EAChB;EACA;EACA,SAAS;;UAGM;;EAEf,MAAM;;;EAGN;;;EAGA;IAAQ;IAAmB;;;;;;KAMjB,mBAAmB,IAAI,mBAAmB;UAErC;;;;EAIf;;EAEA;;EAEA;;EAEA;;;EAGA;;;;;;;;iBASc,oBAAoB,WAAW,kBAAkB,UAC/D,KAAK,YAAY,WAAW,YAC5B,YAAY,sBACZ,OAAM,6BACL;;;;;;;;cAwIU,cAAc;UAiFV,sCAAsC;;EAErD,YAAY;;;EAGZ,SAAS;;EAET;;;;;;;iBAQc,uBAAuB,qBAAqB,kBAAkB,WAAW,UACvF,SAAS,gCACR,KAAK,WAAW"}
1
+ {"version":3,"file":"promotion-policy-Ckjhzg_4.d.ts","names":[],"sources":["../src/campaign/gates/power-preflight.ts","../src/pareto.ts","../src/campaign/gates/promotion-policy.ts"],"mappings":";;;;;;;;;;;;;;;;;;;;;;;;;;;UAwBiB;;EAEf;;;EAGA;;EAEA;;EAEA;;;;;;;EAOA;;UAGe;;EAEf;;EAEA;;EAEA;;EAEA;;EAEA;;;;EAIA;;;EAGA;EACA;EACA;;;EAGA;;EAEA;;;;;;iBAec,eAAe,MAAM,wBAAwB;;;;;;;;;;;;;;;;;;KClEjD;UAEK,UAAU;;EAEzB;EACA,WAAW;EACX,QAAQ,WAAW;;UAGJ,aAAa;EAC5B,UAAU;EACV,WAAW;;EAEX,cAAc;IAAQ,WAAW;IAAG,WAAW;;;;iBAIjC,UAAU,GAAG,GAAG,GAAG,GAAG,GAAG,YAAY,UAAU;;;;;;iBAmB/C,eAAe,GAAG,YAAY,KAAK,YAAY,UAAU,OAAO,aAAa;;;;;;;;;;iBA4B7E,YAAY,GAC1B,YAAY,KACZ,YAAY,UAAU,MACtB;EAAW,UAAU,QAAQ;IAC5B;EAAQ,WAAW;EAAG;;;;;;;;;;;;;;iBAyCT,iBAAiB,GAC/B,YAAY,KACZ,YAAY,UAAU,OACrB;EAAQ,WAAW;EAAG;;;;;;;iBA6BT,2BAA2B,GACzC,YAAY,KACZ,YAAY,UAAU,OACrB;EAAQ,WAAW;EAAG;;;;;;KCtHb;EAAoB;;EAAwB;EAAmB;;UAE1D;;EAEf;EACA,QAAQ;;;EAGR,WAAW;;;;EAIX;;;;;EAKA;;;KAIU;UAEK;EACf;EACA,QAAQ;EACR,WAAW;;;;;;;;EAQX,WAAW;;;;;EAKX;;;EAGA;IAAM;IAAa;;;EAEnB,mBAAmB;;EAEnB,SAAS;;;EAGT;;EAEA;EACA;EACA,gBAAgB;EAChB;EACA;EACA,SAAS;;UAGM;;EAEf,MAAM;;;EAGN;;;EAGA;IAAQ;IAAmB;;;;;;KAMjB,mBAAmB,IAAI,mBAAmB;UAErC;;;;EAIf;;EAEA;;EAEA;;EAEA;;;EAGA;;;;;;;;iBASc,oBAAoB,WAAW,kBAAkB,UAC/D,KAAK,YAAY,WAAW,YAC5B,YAAY,sBACZ,OAAM,6BACL;;;;;;;;cAwIU,cAAc;UAiFV,sCAAsC;;EAErD,YAAY;;;EAGZ,SAAS;;EAET;;;;;;;iBAQc,uBAAuB,qBAAqB,kBAAkB,WAAW,UACvF,SAAS,gCACR,KAAK,WAAW"}
@@ -1,5 +1,5 @@
1
1
  import { t as TraceEmitter } from "./emitter-CPBAhxum.js";
2
- import { s as validateRunRecord } from "./run-record-DqOw5X6_.js";
2
+ import { s as validateRunRecord } from "./run-record-BmSPWXJR.js";
3
3
  import { appendFileSync, existsSync, mkdirSync, readFileSync } from "node:fs";
4
4
  import { dirname } from "node:path";
5
5
  //#region src/action-policy.ts
@@ -1455,4 +1455,4 @@ function controlFailureClassFromVerification(verification) {
1455
1455
  //#endregion
1456
1456
  export { observeAll as _, jsonlReviewStore as a, scoreFromEvals as c, runAgentControlLoop as d, stopOnNoProgress as f, noProgressDetector as g, errorStreakDetector as h, inMemoryReviewStore as i, allCriticalPassed as l, subjectiveEval as m, runProposeReviewAsControlLoop as n, runProposeReview as o, stopOnRepeatedAction as p, createLlmReviewer as r, controlRunToRunRecord as s, controlFailureClassFromVerification as t, objectiveEval as u, repeatedActionDetector as v, evaluateActionPolicy as y };
1457
1457
 
1458
- //# sourceMappingURL=propose-review-control-qgWLA6E9.js.map
1458
+ //# sourceMappingURL=propose-review-control-dSNPjFUH.js.map