@tangle-network/agent-eval 0.137.0 → 0.138.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (150) hide show
  1. package/CHANGELOG.md +48 -0
  2. package/README.md +33 -0
  3. package/dist/analyst/index.d.ts +473 -39
  4. package/dist/analyst/index.d.ts.map +1 -1
  5. package/dist/analyst/index.js +11 -593
  6. package/dist/analyst/index.js.map +1 -1
  7. package/dist/{analyze-runs-PVtnfjvA.d.ts → analyze-runs-CPYxfPWT.d.ts} +5 -5
  8. package/dist/{analyze-runs-PVtnfjvA.d.ts.map → analyze-runs-CPYxfPWT.d.ts.map} +1 -1
  9. package/dist/{benchmark-YDrpumqB.js → benchmark-D8dkki-J.js} +299 -159
  10. package/dist/benchmark-D8dkki-J.js.map +1 -0
  11. package/dist/{benchmark-CHX4orG7.d.ts → benchmark-DlQgU_XI.d.ts} +67 -15
  12. package/dist/benchmark-DlQgU_XI.d.ts.map +1 -0
  13. package/dist/benchmark-command-CMqVqReF.js +4332 -0
  14. package/dist/benchmark-command-CMqVqReF.js.map +1 -0
  15. package/dist/benchmarks/index.d.ts +1 -1
  16. package/dist/benchmarks/index.js +1 -1
  17. package/dist/{benchmarks-DCLkQOmc.js → benchmarks-BJ_xK5rQ.js} +4 -3
  18. package/dist/{benchmarks-DCLkQOmc.js.map → benchmarks-BJ_xK5rQ.js.map} +1 -1
  19. package/dist/campaign/index.d.ts +5 -5
  20. package/dist/campaign/index.js +3 -3
  21. package/dist/{campaign-lgObcHFC.js → campaign-BIBS-NHV.js} +16 -9
  22. package/dist/campaign-BIBS-NHV.js.map +1 -0
  23. package/dist/cli.js +9 -2
  24. package/dist/cli.js.map +1 -1
  25. package/dist/{client-C8L6h6Wf.d.ts → client-BwPKohkJ.d.ts} +4 -4
  26. package/dist/{client-C8L6h6Wf.d.ts.map → client-BwPKohkJ.d.ts.map} +1 -1
  27. package/dist/{completion-verifier-DSyRNVzU.d.ts → completion-verifier-B4-IMYcS.d.ts} +3 -3
  28. package/dist/{completion-verifier-DSyRNVzU.d.ts.map → completion-verifier-B4-IMYcS.d.ts.map} +1 -1
  29. package/dist/contract/index.d.ts +10 -10
  30. package/dist/contract/index.js +8 -8
  31. package/dist/control.d.ts +2 -2
  32. package/dist/{cost-ledger-D2o6JOrL.d.ts → cost-ledger-B1D3COAc.d.ts} +5 -4
  33. package/dist/{cost-ledger-D2o6JOrL.d.ts.map → cost-ledger-B1D3COAc.d.ts.map} +1 -1
  34. package/dist/{cost-ledger-D-5_-dhi.js → cost-ledger-CHDLA0Ss.js} +90 -45
  35. package/dist/cost-ledger-CHDLA0Ss.js.map +1 -0
  36. package/dist/{default-registry-Dc5D_Loc.d.ts → default-registry-PUhIVRWz.d.ts} +18 -5
  37. package/dist/default-registry-PUhIVRWz.d.ts.map +1 -0
  38. package/dist/{default-registry-CLXbRt0f.js → default-registry-lp5R0lve.js} +1503 -258
  39. package/dist/default-registry-lp5R0lve.js.map +1 -0
  40. package/dist/{eval-campaign-CHqfLnff.js → eval-campaign-9MozgKL7.js} +2 -2
  41. package/dist/{eval-campaign-CHqfLnff.js.map → eval-campaign-9MozgKL7.js.map} +1 -1
  42. package/dist/exact-types-Dpw2LeHA.d.ts +234 -0
  43. package/dist/exact-types-Dpw2LeHA.d.ts.map +1 -0
  44. package/dist/{extract-usage-p-56bh8q.js → extract-usage-CS391dOE.js} +2 -2
  45. package/dist/{extract-usage-p-56bh8q.js.map → extract-usage-CS391dOE.js.map} +1 -1
  46. package/dist/{feedback-trajectory-N_F0PwHz.d.ts → feedback-trajectory-CoNep7rl.d.ts} +3 -2
  47. package/dist/feedback-trajectory-CoNep7rl.d.ts.map +1 -0
  48. package/dist/fuzz.d.ts +1 -1
  49. package/dist/fuzz.js +1 -1
  50. package/dist/hosted/index.d.ts +3 -3
  51. package/dist/{index-U3RHOShi.d.ts → index-B2-IxCMB.d.ts} +2 -2
  52. package/dist/{index-U3RHOShi.d.ts.map → index-B2-IxCMB.d.ts.map} +1 -1
  53. package/dist/{index-BnP1QJUv.d.ts → index-CjVYlVBK.d.ts} +5 -5
  54. package/dist/{index-BnP1QJUv.d.ts.map → index-CjVYlVBK.d.ts.map} +1 -1
  55. package/dist/{index-C-Pr4OWg.d.ts → index-D0cxAdaV.d.ts} +11 -10
  56. package/dist/index-D0cxAdaV.d.ts.map +1 -0
  57. package/dist/index-DEb46kc6.d.ts.map +1 -1
  58. package/dist/{index-DRNl6g_N.d.ts → index-sMN_hI4E.d.ts} +3 -3
  59. package/dist/{index-DRNl6g_N.d.ts.map → index-sMN_hI4E.d.ts.map} +1 -1
  60. package/dist/index.d.ts +24 -23
  61. package/dist/index.d.ts.map +1 -1
  62. package/dist/index.js +19 -353
  63. package/dist/index.js.map +1 -1
  64. package/dist/{insight-report-B9ooYH_g.d.ts → insight-report-CXd8VBDR.d.ts} +4 -4
  65. package/dist/{insight-report-B9ooYH_g.d.ts.map → insight-report-CXd8VBDR.d.ts.map} +1 -1
  66. package/dist/{integrity-CKxosZ5Z.d.ts → integrity-B-MLFz0I.d.ts} +2 -2
  67. package/dist/{integrity-CKxosZ5Z.d.ts.map → integrity-B-MLFz0I.d.ts.map} +1 -1
  68. package/dist/ledger-core/index.js +1 -1
  69. package/dist/{ledger-core-t6sItivm.js → ledger-core-C0Yx1I14.js} +220 -27
  70. package/dist/ledger-core-C0Yx1I14.js.map +1 -0
  71. package/dist/{llm-client-DKB25jV8.js → llm-client-Cj3c7PEm.js} +5 -5
  72. package/dist/llm-client-Cj3c7PEm.js.map +1 -0
  73. package/dist/meta-eval/index.d.ts +2 -2
  74. package/dist/multishot/index.d.ts +2 -2
  75. package/dist/openapi.json +1 -1
  76. package/dist/{proposal-findings-DCawte-y.js → proposal-findings-2GIUo1et.js} +2 -68
  77. package/dist/proposal-findings-2GIUo1et.js.map +1 -0
  78. package/dist/{registry-BdM7SuTr.d.ts → registry-C4yJTza7.d.ts} +60 -6
  79. package/dist/registry-C4yJTza7.d.ts.map +1 -0
  80. package/dist/{release-report-CofgVNZt.d.ts → release-report-CoyvyLBs.d.ts} +3 -3
  81. package/dist/{release-report-CofgVNZt.d.ts.map → release-report-CoyvyLBs.d.ts.map} +1 -1
  82. package/dist/{replay-Bju0T8Ls.js → replay-Cb-4Vf0k.js} +8 -7
  83. package/dist/replay-Cb-4Vf0k.js.map +1 -0
  84. package/dist/{replay-K8FaC0CB.d.ts → replay-DbIYwso6.d.ts} +7 -7
  85. package/dist/{replay-K8FaC0CB.d.ts.map → replay-DbIYwso6.d.ts.map} +1 -1
  86. package/dist/reporting.d.ts +4 -4
  87. package/dist/{researcher-Da0Wj-bt.d.ts → researcher-BCeOEjtR.d.ts} +5 -5
  88. package/dist/{researcher-Da0Wj-bt.d.ts.map → researcher-BCeOEjtR.d.ts.map} +1 -1
  89. package/dist/{reward-hacking-CQ3hTCO3.d.ts → reward-hacking-sE2l_NV6.d.ts} +2 -2
  90. package/dist/{reward-hacking-CQ3hTCO3.d.ts.map → reward-hacking-sE2l_NV6.d.ts.map} +1 -1
  91. package/dist/rl.d.ts +5 -5
  92. package/dist/rl.js +1 -1
  93. package/dist/rollout/index.d.ts +1 -1
  94. package/dist/{rubric-predictive-validity-C4sztLR3.d.ts → rubric-predictive-validity-w2klGv1u.d.ts} +2 -2
  95. package/dist/{rubric-predictive-validity-C4sztLR3.d.ts.map → rubric-predictive-validity-w2klGv1u.d.ts.map} +1 -1
  96. package/dist/{run-evidence-BDIircdA.d.ts → run-evidence-CbE0A8Xg.d.ts} +3 -3
  97. package/dist/{run-evidence-BDIircdA.d.ts.map → run-evidence-CbE0A8Xg.d.ts.map} +1 -1
  98. package/dist/{run-record-BPCa2rQ8.d.ts → run-record-DwHMk1Ai.d.ts} +2 -2
  99. package/dist/{run-record-BPCa2rQ8.d.ts.map → run-record-DwHMk1Ai.d.ts.map} +1 -1
  100. package/dist/{semantic-concept-judge-Bz64IckK.js → semantic-concept-judge-DYXDPZW0.js} +11 -5
  101. package/dist/semantic-concept-judge-DYXDPZW0.js.map +1 -0
  102. package/dist/{server-KjXZZUDX.js → server-DLEvyW2z.js} +3 -3
  103. package/dist/{server-KjXZZUDX.js.map → server-DLEvyW2z.js.map} +1 -1
  104. package/dist/single-run-lock-D_bS5xhj.js +318 -0
  105. package/dist/single-run-lock-D_bS5xhj.js.map +1 -0
  106. package/dist/{skill-usage-CFDLLlhF.d.ts → skill-usage-Bv3G4VkA.d.ts} +18 -8
  107. package/dist/skill-usage-Bv3G4VkA.d.ts.map +1 -0
  108. package/dist/{skillopt-optimization-method-f4o9sUT4.js → skillopt-optimization-method-CjKMZy0d.js} +7 -182
  109. package/dist/skillopt-optimization-method-CjKMZy0d.js.map +1 -0
  110. package/dist/{skillopt-optimization-method-BpbnlvAZ.d.ts → skillopt-optimization-method-CzfnA8O-.d.ts} +10 -10
  111. package/dist/{skillopt-optimization-method-BpbnlvAZ.d.ts.map → skillopt-optimization-method-CzfnA8O-.d.ts.map} +1 -1
  112. package/dist/{statistics-_7P642CN.d.ts → statistics-mf70aXKp.d.ts} +2 -2
  113. package/dist/{statistics-_7P642CN.d.ts.map → statistics-mf70aXKp.d.ts.map} +1 -1
  114. package/dist/{tools-DZk2Jn64.js → store-otlp-BenKynPE.js} +4 -192
  115. package/dist/store-otlp-BenKynPE.js.map +1 -0
  116. package/dist/{summary-report-DHipz9Kx.d.ts → summary-report-BKinV4yD.d.ts} +3 -3
  117. package/dist/{summary-report-DHipz9Kx.d.ts.map → summary-report-BKinV4yD.d.ts.map} +1 -1
  118. package/dist/tools-DZGdROtG.js +255 -0
  119. package/dist/tools-DZGdROtG.js.map +1 -0
  120. package/dist/traces.d.ts +5 -5
  121. package/dist/traces.js +4 -3
  122. package/dist/{types-CTvKfr5F.d.ts → types-5q2T25iW.d.ts} +2 -2
  123. package/dist/{types-CTvKfr5F.d.ts.map → types-5q2T25iW.d.ts.map} +1 -1
  124. package/dist/{types-CKswbJGO.d.ts → types-BtJhn8v6.d.ts} +4 -4
  125. package/dist/{types-CKswbJGO.d.ts.map → types-BtJhn8v6.d.ts.map} +1 -1
  126. package/dist/{types-CTGbIm57.d.ts → types-zFYez3PK.d.ts} +5 -5
  127. package/dist/{types-CTGbIm57.d.ts.map → types-zFYez3PK.d.ts.map} +1 -1
  128. package/dist/wire/index.d.ts +3 -3
  129. package/dist/wire/index.js +1 -1
  130. package/docs/trace-analysis.md +123 -3
  131. package/package.json +5 -3
  132. package/dist/benchmark-CHX4orG7.d.ts.map +0 -1
  133. package/dist/benchmark-YDrpumqB.js.map +0 -1
  134. package/dist/campaign-lgObcHFC.js.map +0 -1
  135. package/dist/concurrency-MUjT7VjM.js +0 -109
  136. package/dist/concurrency-MUjT7VjM.js.map +0 -1
  137. package/dist/cost-ledger-D-5_-dhi.js.map +0 -1
  138. package/dist/default-registry-CLXbRt0f.js.map +0 -1
  139. package/dist/default-registry-Dc5D_Loc.d.ts.map +0 -1
  140. package/dist/feedback-trajectory-N_F0PwHz.d.ts.map +0 -1
  141. package/dist/index-C-Pr4OWg.d.ts.map +0 -1
  142. package/dist/ledger-core-t6sItivm.js.map +0 -1
  143. package/dist/llm-client-DKB25jV8.js.map +0 -1
  144. package/dist/proposal-findings-DCawte-y.js.map +0 -1
  145. package/dist/registry-BdM7SuTr.d.ts.map +0 -1
  146. package/dist/replay-Bju0T8Ls.js.map +0 -1
  147. package/dist/semantic-concept-judge-Bz64IckK.js.map +0 -1
  148. package/dist/skill-usage-CFDLLlhF.d.ts.map +0 -1
  149. package/dist/skillopt-optimization-method-f4o9sUT4.js.map +0 -1
  150. package/dist/tools-DZk2Jn64.js.map +0 -1
@@ -1,11 +1,12 @@
1
1
  import { a as MultiLayerVerifier, l as VerifyOptions, o as Severity } from "../multi-layer-verifier-BHY1gWAc.js";
2
- import { A as parseFindingSubject, B as SemanticConceptJudgeInput, C as FINDING_SUBJECT_KINDS, D as FindingSubjectStringSchema, E as FindingSubjectKind, G as RunCritic, M as CreateAnalystAiConfig, N as createAnalystAi, O as KIND_EXPECTED_SUBJECTS, S as FINDING_SUBJECT_GRAMMAR_PROMPT, T as FindingSubject, V as SemanticConceptJudgeOptions, _ as FindingsDiff, a as SkillUsageScanConfig, b as defaultIsMaterial, c as DEFAULT_TRACE_ANALYST_KINDS, d as IMPROVEMENT_KIND_SPEC, f as FAILURE_MODE_KIND_SPEC, g as DiffPolicy, h as emitControlIntegrityFindings, i as SkillUsageReport, j as renderFindingSubject, k as findingSubjectGrammarPromptFor, l as KNOWLEDGE_POISONING_KIND_SPEC, m as ControlIntegrityAnalyst, n as SkillUsageAnalyst, o as buildSkillUsageReport, p as CONTROL_INTEGRITY_ANALYST, q as RunTrace, r as SkillUsageRecord, s as emitSkillUsageFindings, t as SKILL_USAGE_ANALYST, u as KNOWLEDGE_GAP_KIND_SPEC, v as FindingsStore, w as FINDING_SUBJECT_SYNTAX, x as diffFindings, y as PersistedFinding } from "../skill-usage-CFDLLlhF.js";
3
- import { c as CostLedgerHandle } from "../cost-ledger-D2o6JOrL.js";
4
- import { A as ChatClient, B as SandboxSdkTransportOpts, F as CreateChatClientOpts, I as CustomTransportOpts, L as DirectProviderTransportOpts, M as ChatResponse, N as ChatTransport, P as CliBridgeTransportOpts, R as MockTransportOpts, V as createChatClient, j as ChatRequest, k as ChatCallOpts, m as JudgeInput, p as JudgeFn, q as LlmClientOptions, z as RouterTransportOpts } from "../types-CTvKfr5F.js";
5
- import { _ as makeFinding, a as AnalystInputKind, c as AnalystRunInputs, d as AnalystSeverity, f as AnalystUsageReceipt, g as computeFindingId, h as ProposalFindingOrigin, i as AnalystFinding, l as AnalystRunResult, m as ProposalFinding, n as AnalystContext, o as AnalystRequirements, p as EvidenceRef, r as AnalystCost, s as AnalystRunEvent, t as Analyst, u as AnalystRunSummary, v as makeProposalFinding, x as TraceAnalysisStore } from "../types-CKswbJGO.js";
6
- import { _ as behavioralAnalyst, a as createTraceAnalystKind, c as ANALYST_SEVERITIES, d as RawAnalystEvidenceSchema, f as RawAnalystFinding, g as BehavioralAnalystOptions, h as parseRawFinding, i as TraceAnalystKindSpec, l as RAW_FINDING_SCHEMA_PROMPT, m as evidenceRefsFromRawFinding, n as buildDefaultAnalystRegistry, o as renderPriorFindings, p as RawAnalystFindingSchema, r as CreateTraceAnalystKindOpts, s as renderUpstreamFindings, t as DefaultAnalystRegistryOptions, u as RawAnalystEvidence, v as deriveEfficiencyFindings } from "../default-registry-Dc5D_Loc.js";
7
- import { a as RegistryRunOpts, i as BudgetPolicy, n as AnalystRegistry, r as AnalystRegistryOptions, t as AnalystHooks } from "../registry-BdM7SuTr.js";
8
- import { _ as RunAnalystBenchmarkOptions, a as AnalystBenchmarkOutput, b as scoreAnalystFindings, c as AnalystBenchmarkRunner, d as AnalystEvidenceResolution, f as AnalystEvidenceResolutionError, g as AnalystLatencyDistribution, h as AnalystIssueExpectation, i as AnalystBenchmarkObservation, l as AnalystBenchmarkSummary, m as AnalystFindingScore, n as AnalystBenchmarkDatasetRef, o as AnalystBenchmarkProvenance, p as AnalystEvidenceResolver, r as AnalystBenchmarkDescriptor, s as AnalystBenchmarkResult, t as AnalystBenchmarkCase, u as AnalystEvidenceExpectation, v as registryBenchmarkRunner, x as traceStoreEvidenceResolver, y as runAnalystBenchmark } from "../benchmark-CHX4orG7.js";
2
+ import { A as parseFindingSubject, B as SemanticConceptJudgeInput, C as FINDING_SUBJECT_KINDS, D as FindingSubjectStringSchema, E as FindingSubjectKind, G as RunCritic, M as CreateAnalystAiConfig, N as createAnalystAi, O as KIND_EXPECTED_SUBJECTS, S as FINDING_SUBJECT_GRAMMAR_PROMPT, T as FindingSubject, V as SemanticConceptJudgeOptions, _ as FindingsDiff, a as SkillUsageScanConfig, b as defaultIsMaterial, c as DEFAULT_TRACE_ANALYST_KINDS, d as IMPROVEMENT_KIND_SPEC, f as FAILURE_MODE_KIND_SPEC, g as DiffPolicy, h as emitControlIntegrityFindings, i as SkillUsageReport, j as renderFindingSubject, k as findingSubjectGrammarPromptFor, l as KNOWLEDGE_POISONING_KIND_SPEC, m as ControlIntegrityAnalyst, n as SkillUsageAnalyst, o as buildSkillUsageReport, p as CONTROL_INTEGRITY_ANALYST, q as RunTrace, r as SkillUsageRecord, s as emitSkillUsageFindings, t as SKILL_USAGE_ANALYST, u as KNOWLEDGE_GAP_KIND_SPEC, v as FindingsStore, w as FINDING_SUBJECT_SYNTAX, x as diffFindings, y as PersistedFinding } from "../skill-usage-Bv3G4VkA.js";
3
+ import { c as CostLedgerHandle } from "../cost-ledger-B1D3COAc.js";
4
+ import { A as ChatClient, B as SandboxSdkTransportOpts, F as CreateChatClientOpts, I as CustomTransportOpts, L as DirectProviderTransportOpts, M as ChatResponse, N as ChatTransport, P as CliBridgeTransportOpts, R as MockTransportOpts, V as createChatClient, j as ChatRequest, k as ChatCallOpts, m as JudgeInput, p as JudgeFn, q as LlmClientOptions, z as RouterTransportOpts } from "../types-5q2T25iW.js";
5
+ import { _ as makeFinding, a as AnalystInputKind, c as AnalystRunInputs, d as AnalystSeverity, f as AnalystUsageReceipt, g as computeFindingId, h as ProposalFindingOrigin, i as AnalystFinding, l as AnalystRunResult, m as ProposalFinding, n as AnalystContext, o as AnalystRequirements, p as EvidenceRef, r as AnalystCost, s as AnalystRunEvent, t as Analyst, u as AnalystRunSummary, v as makeProposalFinding, x as TraceAnalysisStore } from "../types-BtJhn8v6.js";
6
+ import { _ as behavioralAnalyst, a as createTraceAnalystKind, c as ANALYST_SEVERITIES, d as RawAnalystEvidenceSchema, f as RawAnalystFinding, g as BehavioralAnalystOptions, h as parseRawFinding, i as TraceAnalystKindSpec, l as RAW_FINDING_SCHEMA_PROMPT, m as evidenceRefsFromRawFinding, n as buildDefaultAnalystRegistry, o as renderPriorFindings, p as RawAnalystFindingSchema, r as CreateTraceAnalystKindOpts, s as renderUpstreamFindings, t as DefaultAnalystRegistryOptions, u as RawAnalystEvidence, v as deriveEfficiencyFindings } from "../default-registry-PUhIVRWz.js";
7
+ import { a as ExactAnalystRunPolicySnapshot, c as ExactAnalystSnapshot, d as ExactExecutionComponentSnapshot, i as ExactAnalystRunEvent, l as ExactCapableAnalyst, n as ExactAnalystExecutionPlanSnapshot, o as ExactAnalystRunResult, r as ExactAnalystRunCompletion, s as ExactAnalystRunSummary, t as ExactAnalystBudgetSnapshot, u as ExactExecutionComponentIdentity } from "../exact-types-Dpw2LeHA.js";
8
+ import { a as ExactAnalystBudgetPolicy, c as RegistryRunOpts, i as BudgetPolicy, l as assertExactRegistryRunOpts, n as AnalystRegistry, o as ExactAnalystRunExecutionError, r as AnalystRegistryOptions, s as ExactRegistryRunOpts, t as AnalystHooks } from "../registry-C4yJTza7.js";
9
+ import { C as scoreAnalystFindings, S as traceStoreEvidenceResolver, _ as AnalystIssueExpectation, a as AnalystBenchmarkLabelState, b as registryBenchmarkRunner, c as AnalystBenchmarkProvenance, d as AnalystBenchmarkSummary, f as AnalystEvidenceExpectation, g as AnalystFindingScore, h as AnalystEvidenceResolver, i as AnalystBenchmarkError, l as AnalystBenchmarkResult, m as AnalystEvidenceResolutionError, n as AnalystBenchmarkDatasetRef, o as AnalystBenchmarkObservation, p as AnalystEvidenceResolution, r as AnalystBenchmarkDescriptor, s as AnalystBenchmarkOutput, t as AnalystBenchmarkCase, u as AnalystBenchmarkRunner, v as AnalystLatencyDistribution, x as runAnalystBenchmark, y as RunAnalystBenchmarkOptions } from "../benchmark-DlQgU_XI.js";
9
10
  import { AxFunction } from "@ax-llm/ax";
10
11
  //#region src/analyst/adapters.d.ts
11
12
  declare function liftSeverity(s: Severity): AnalystSeverity;
@@ -50,36 +51,40 @@ interface SemanticConceptJudgeAdapterOpts {
50
51
  }
51
52
  declare function createSemanticConceptJudgeAdapter(opts?: SemanticConceptJudgeAdapterOpts): Analyst<SemanticConceptJudgeInput>;
52
53
  //#endregion
53
- //#region src/analyst/benchmark-comparison.d.ts
54
- type AnalystComparisonMetric = 'completion' | 'issueRecall' | 'findingPrecision' | 'f1' | 'criticalStepAccuracy' | 'citationCoverage' | 'citationLabelAgreement' | 'citationResolution' | 'cleanAccuracy' | 'latencyMs' | 'calls' | 'inputTokens' | 'outputTokens' | 'reasoningTokens' | 'cachedTokens' | 'cacheWriteTokens' | 'costUsd';
55
- interface AnalystMetricComparison {
56
- metric: AnalystComparisonMetric;
57
- direction: 'higher' | 'lower';
58
- pairedCases: number;
59
- pairedObservations: number;
60
- baselineMean: number;
61
- candidateMean: number;
62
- meanDelta: number;
63
- intervalLow: number;
64
- intervalHigh: number;
65
- confidence: number;
66
- resamples: number;
67
- enoughCasesForInference: boolean;
54
+ //#region src/analyst/benchmark-agentrx-calibration.d.ts
55
+ declare const AGENT_RX_UPSTREAM_REVISION = "f228165bfec60a801fd5fedd9d8ffe0f9de0c69d";
56
+ interface AgentRxCalibrationRunnerSummary {
57
+ runnerId: string;
58
+ selectedRuns: number;
59
+ completedRuns: number;
60
+ failedRuns: number;
61
+ predictedRuns: number;
62
+ missingPredictionRuns: number;
63
+ exactStepAccuracy: number | null;
64
+ stepAccuracyWithin1: number | null;
65
+ stepAccuracyWithin2: number | null;
66
+ stepAccuracyWithin3: number | null;
67
+ stepAccuracyWithin4: number | null;
68
+ stepAccuracyWithin5: number | null;
69
+ meanStepDistance: number | null;
70
+ normalizedMeanStepDistance: number | null;
71
+ normalizedDistanceRuns: number;
72
+ normalizedDistanceUnknownRuns: number;
73
+ rootCauseCategoryAccuracy: number | null;
74
+ anyFailureCategoryAccuracy: number | null;
75
+ earliestFailureCategoryAccuracy: number | null;
76
+ terminalFailureCategoryAccuracy: number | null;
68
77
  }
69
- interface AnalystRunnerComparison {
70
- baselineRunnerId: string;
71
- candidateRunnerId: string;
72
- metrics: AnalystMetricComparison[];
78
+ interface AgentRxCalibrationSummary {
79
+ protocol: 'official-agentrx-root-cause';
80
+ upstreamRevision: string;
81
+ rationale: string;
82
+ runners: AgentRxCalibrationRunnerSummary[];
73
83
  }
74
- declare function compareAnalystRunners(result: AnalystBenchmarkResult, options: {
75
- baselineRunnerId: string;
76
- candidateRunnerId: string;
77
- confidence?: number;
78
- resamples?: number;
79
- seed?: number;
80
- }): AnalystRunnerComparison;
84
+ declare function summarizeAgentRxCalibration(result: AnalystBenchmarkResult, upstreamRevision: string): AgentRxCalibrationSummary;
85
+ declare function renderAgentRxCalibrationMarkdown(summary: AgentRxCalibrationSummary): string;
81
86
  //#endregion
82
- //#region src/analyst/benchmark-datasets.d.ts
87
+ //#region src/analyst/benchmark-dataset-types.d.ts
83
88
  type ExternalId = string | number;
84
89
  interface AgentRxFailure {
85
90
  failure_id: ExternalId;
@@ -123,11 +128,31 @@ interface CodeTraceStageAnnotation {
123
128
  unuseful_step_ids?: readonly number[];
124
129
  reasoning?: string;
125
130
  }
131
+ interface CodeTracerStepLabel {
132
+ step_id: number;
133
+ stage?: string | number;
134
+ stage_name?: string | number;
135
+ stage_id?: string | number;
136
+ label: 'incorrect' | 'unuseful';
137
+ rationale?: string;
138
+ reason?: string;
139
+ note?: string;
140
+ comment?: string;
141
+ }
142
+ interface CodeTracerLabelGroup {
143
+ stage?: string | number;
144
+ stage_name?: string | number;
145
+ stage_id?: string | number;
146
+ labels: readonly CodeTracerStepLabel[];
147
+ }
148
+ type CodeTracerPredictions = string | readonly CodeTraceStageAnnotation[] | readonly CodeTracerStepLabel[] | readonly CodeTracerLabelGroup[];
126
149
  interface CodeTraceBenchRow {
127
150
  traj_id: string;
128
151
  agent: string;
129
152
  model: string;
130
153
  task_name: string;
154
+ /** Native artifact extraction path in the public CodeTraceBench manifest. */
155
+ source_relpath?: string;
131
156
  difficulty?: string;
132
157
  category?: string;
133
158
  tags?: string | readonly string[];
@@ -160,14 +185,416 @@ interface UpstreamPredictionAdapterOptions extends StepLabelAdapterOptions {
160
185
  stepCount?: number;
161
186
  }
162
187
  interface CodeTracerPredictionAdapterOptions extends UpstreamPredictionAdapterOptions, CodeTraceBenchLabelOptions {}
188
+ //#endregion
189
+ //#region src/analyst/benchmark-dataset-agentrx.d.ts
163
190
  declare function agentRxBenchmarkCase<TInput>(row: AgentRxRow, input: TInput, options?: AgentRxBenchmarkCaseOptions): AnalystBenchmarkCase<TInput>;
164
- declare function codeTraceBenchCase<TInput>(row: CodeTraceBenchRow, input: TInput, options?: CodeTraceBenchCaseOptions): AnalystBenchmarkCase<TInput>;
165
191
  /** Translate AgentRx `Report.to_dict()` output or its `failures` array into findings. */
166
192
  declare function agentRxPredictionsToFindings(trajectoryIdValue: ExternalId, output: unknown, options?: UpstreamPredictionAdapterOptions): AnalystFinding[];
193
+ declare function normalizeAgentRxCategory(value: string): string;
194
+ /** Match Python's round() behavior used by AgentRx for consensus steps. */
195
+ declare function roundAgentRxStep(value: number): number;
196
+ //#endregion
197
+ //#region src/analyst/benchmark-dataset-codetrace.d.ts
198
+ declare function codeTraceBenchCase<TInput>(row: CodeTraceBenchRow, input: TInput, options?: CodeTraceBenchCaseOptions): AnalystBenchmarkCase<TInput>;
167
199
  /** Translate CodeTracer's `codetracer_labels.json` into shared findings. */
168
- declare function codeTracerPredictionsToFindings(trajectoryIdValue: string, predictions: string | readonly CodeTraceStageAnnotation[], options?: CodeTracerPredictionAdapterOptions): AnalystFinding[];
200
+ declare function codeTracerPredictionsToFindings(trajectoryIdValue: string, predictions: CodeTracerPredictions, options?: CodeTracerPredictionAdapterOptions): AnalystFinding[];
201
+ //#endregion
202
+ //#region src/analyst/benchmark-dataset-utils.d.ts
169
203
  declare function normalizeBenchmarkLabel(value: string): string;
170
- declare function normalizeAgentRxCategory(value: string): string;
204
+ //#endregion
205
+ //#region src/analyst/benchmark-verification-outcome.d.ts
206
+ type VerificationOutcomeStatus = 'passed' | 'failed' | 'unavailable';
207
+ interface VerificationOutcomeSource {
208
+ path: string;
209
+ format: 'terminal-bench' | 'swe-bench' | 'swe-multi';
210
+ status: VerificationOutcomeStatus;
211
+ }
212
+ interface VerificationOutcome {
213
+ status: VerificationOutcomeStatus;
214
+ reason?: 'missing-result' | 'result-output-unavailable' | 'result-parse-error' | 'result-label-disagreement';
215
+ parseError?: {
216
+ class: string;
217
+ message: string;
218
+ };
219
+ sources: VerificationOutcomeSource[];
220
+ passedCheckCount: number;
221
+ failedCheckCount: number;
222
+ passedChecks: string[];
223
+ failedChecks: string[];
224
+ }
225
+ interface VerificationResultFile {
226
+ relativePath: string;
227
+ content: string;
228
+ }
229
+ declare function parseVerificationOutcome(files: readonly VerificationResultFile[]): VerificationOutcome;
230
+ //#endregion
231
+ //#region src/analyst/benchmark-verification-artifacts.d.ts
232
+ declare const DEFAULT_MAX_VERIFICATION_ARTIFACT_BYTES: number;
233
+ type VerificationArtifactRole = 'final-test-output' | 'final-result' | 'final-metrics';
234
+ interface VerificationArtifactFile {
235
+ role: VerificationArtifactRole;
236
+ path: string;
237
+ relativePath: string;
238
+ sha256: string;
239
+ bytes: number;
240
+ spanId: string;
241
+ }
242
+ interface VerificationArtifactManifest {
243
+ traceId: string;
244
+ status: 'present' | 'missing';
245
+ outcome: VerificationOutcome;
246
+ outcomeSpanId: string;
247
+ caseDirectory: string;
248
+ caseDirectoriesSearched: string[];
249
+ totalBytes: number;
250
+ maxBytes: number;
251
+ files: VerificationArtifactFile[];
252
+ missingRoles: VerificationArtifactRole[];
253
+ searched: Record<VerificationArtifactRole, string[]>;
254
+ }
255
+ interface LoadedVerificationArtifacts {
256
+ manifest: VerificationArtifactManifest;
257
+ outcome: VerificationOutcome;
258
+ files: Array<VerificationArtifactFile & {
259
+ content: string;
260
+ }>;
261
+ }
262
+ declare function loadCodeTraceVerificationArtifacts(options: {
263
+ artifactDir: string;
264
+ row: CodeTraceBenchRow;
265
+ maxBytes?: number;
266
+ }): Promise<LoadedVerificationArtifacts>;
267
+ declare function appendVerificationArtifactsToOtlp(otlpText: string, traceId: string, artifacts: LoadedVerificationArtifacts, afterTimestamp: string): string;
268
+ //#endregion
269
+ //#region src/analyst/benchmark-public-types.d.ts
270
+ type PublicAnalystBenchmarkDataset = 'agentrx' | 'codetracebench';
271
+ interface PublicAnalystBenchmarkModelConfig {
272
+ baseUrl: string;
273
+ apiKey: string;
274
+ model: string;
275
+ maxOutputTokens: number;
276
+ timeoutMs: number;
277
+ costLedger?: CostLedgerHandle;
278
+ durability?: {
279
+ runIdentitySha256: string;
280
+ responseCacheDir: string;
281
+ };
282
+ /** Test-only transport injection. */
283
+ fetchImpl?: typeof fetch;
284
+ }
285
+ interface PreparedPublicAnalystBenchmark {
286
+ cases: AnalystBenchmarkCase<AnalystRunInputs>[];
287
+ sourceRowCount: number;
288
+ selectedCaseIds: string[];
289
+ labelsSha256: string;
290
+ traceFiles: Array<{
291
+ traceId: string;
292
+ relativePath: string;
293
+ sha256: string;
294
+ }>;
295
+ verificationArtifacts: VerificationArtifactManifest[];
296
+ selection: PublicBenchmarkSelectionReport;
297
+ }
298
+ interface PublicBenchmarkValueDistribution {
299
+ total: number;
300
+ missing: number;
301
+ counts: Record<string, number>;
302
+ }
303
+ interface PublicBenchmarkDistributions {
304
+ class: PublicBenchmarkValueDistribution;
305
+ agent: PublicBenchmarkValueDistribution;
306
+ model: PublicBenchmarkValueDistribution;
307
+ difficulty: PublicBenchmarkValueDistribution;
308
+ solved: PublicBenchmarkValueDistribution;
309
+ }
310
+ interface PublicBenchmarkSelectionReport {
311
+ method: 'census' | 'deterministic-hash';
312
+ seed: number;
313
+ sourceCount: number;
314
+ selectedCount: number;
315
+ stratified: false;
316
+ representativeOfInput: boolean;
317
+ source: PublicBenchmarkDistributions;
318
+ selected: PublicBenchmarkDistributions;
319
+ }
320
+ //#endregion
321
+ //#region src/analyst/benchmark-public-adapters.d.ts
322
+ declare function emptyPublicBenchmarkRunner(): AnalystBenchmarkRunner<AnalystRunInputs>;
323
+ declare function adaptPublicBenchmarkFindings(dataset: PublicAnalystBenchmarkDataset, trajectoryId: string, findings: readonly AnalystFinding[], analystId: string): AnalystFinding[];
324
+ //#endregion
325
+ //#region src/analyst/benchmark-public-data.d.ts
326
+ declare function loadPublicBenchmarkRows(path: string): Promise<Array<Record<string, unknown>>>;
327
+ declare function selectPublicBenchmarkRows(dataset: PublicAnalystBenchmarkDataset, rows: readonly Record<string, unknown>[], options: {
328
+ limit: number;
329
+ seed: number;
330
+ }): Array<Record<string, unknown>>;
331
+ declare function publicBenchmarkDistributions(dataset: PublicAnalystBenchmarkDataset, rows: readonly Record<string, unknown>[]): PublicBenchmarkDistributions;
332
+ declare function publicBenchmarkSelectionReport(dataset: PublicAnalystBenchmarkDataset, source: readonly Record<string, unknown>[], selected: readonly Record<string, unknown>[], seed: number): PublicBenchmarkSelectionReport;
333
+ declare function preparePublicAnalystBenchmark(options: {
334
+ dataset: PublicAnalystBenchmarkDataset;
335
+ labelsPath: string;
336
+ traceDir: string;
337
+ artifactDir?: string;
338
+ maxArtifactBytes?: number;
339
+ limit: number;
340
+ seed: number;
341
+ }): Promise<PreparedPublicAnalystBenchmark>;
342
+ //#endregion
343
+ //#region src/analyst/benchmark-public-model.d.ts
344
+ declare function createPublicBenchmarkModelRunner(dataset: PublicAnalystBenchmarkDataset, config: PublicAnalystBenchmarkModelConfig): AnalystBenchmarkRunner<AnalystRunInputs>;
345
+ declare function publicBenchmarkProtocolSha256(dataset: PublicAnalystBenchmarkDataset): string;
346
+ declare const CODE_TRACE_BENCH_ANALYST_PROMPT = "Analyze exactly one coding-agent trajectory and its attached final verification.\nYour task is the CodeTraceBench incorrect-step task: identify every wrong state-changing action, bad hypothesis that drives an action, and regression.\nAn incorrect step remains incorrect when the agent later recovers or the final verification passes.\nInspect the complete supplied trace data.\nUse the final-verification outcome as evidence about the final state, not as a rule for whether earlier steps were incorrect.\nFor each candidate, inspect the assistant action and its following observation.\nLabel a failed command when the assistant caused it through a wrong action or unsupported hypothesis.\nLabel the later corrective action only when that action is itself wrong.\nDo not label a diagnostic probe merely because it exposes an earlier defect.\nDo not label a redundant but correct read or search; CodeTraceBench scores unuseful steps separately, and this run scores incorrect steps only.\nDo not label a step solely because final verification failed.\nWhen final verification is unavailable, use only directly observed trajectory evidence.\nEmit one finding per incorrect assistant step.\nEach finding's step MUST be the positive integer n from an existing assistant LLM span named step-<n>.\nNever select an EVALUATOR, TOOL, CHAIN, final-verification, benchmark-verification, or message-<n> span.\nBefore emitting a finding, inspect its candidate span's attributes.content and describe only the action shown there.\nWhen the trajectory has no incorrect steps, return an empty findings array.";
347
+ //#endregion
348
+ //#region src/analyst/benchmark-comparison.d.ts
349
+ type AnalystComparisonMetric = 'completion' | 'issueRecall' | 'findingPrecision' | 'f1' | 'criticalStepAccuracy' | 'citationCoverage' | 'citationExcerptCoverage' | 'citationLabelAgreement' | 'citationResolution' | 'trustedNegativeAccuracy' | 'latencyMs' | 'calls' | 'inputTokens' | 'outputTokens' | 'reasoningTokens' | 'cachedTokens' | 'cacheWriteTokens' | 'costUsd';
350
+ interface AnalystMetricComparison {
351
+ metric: AnalystComparisonMetric;
352
+ direction: 'higher' | 'lower';
353
+ /** Trajectories with at least one complete pair for this metric. */
354
+ pairedCases: number;
355
+ /** Independent task or incident groups resampled by the interval. */
356
+ pairedClusters: number;
357
+ /** Same-run pairs where this metric applies before missing values are removed. */
358
+ eligibleObservations: number;
359
+ pairedObservations: number;
360
+ baselineMissingObservations: number;
361
+ candidateMissingObservations: number;
362
+ asymmetricMissingObservations: number;
363
+ survivorOnly: boolean;
364
+ baselineMean: number | null;
365
+ candidateMean: number | null;
366
+ meanDelta: number | null;
367
+ intervalLow: number | null;
368
+ intervalHigh: number | null;
369
+ confidence: number;
370
+ resamples: number;
371
+ minimumSampleMet: boolean;
372
+ populationInferenceEligible: boolean;
373
+ inferenceLimitations: string[];
374
+ }
375
+ interface AnalystRunnerComparison {
376
+ baselineRunnerId: string;
377
+ candidateRunnerId: string;
378
+ metrics: AnalystMetricComparison[];
379
+ }
380
+ declare function compareAnalystRunners(result: AnalystBenchmarkResult, options: {
381
+ baselineRunnerId: string;
382
+ candidateRunnerId: string;
383
+ confidence?: number;
384
+ resamples?: number;
385
+ seed?: number;
386
+ }): AnalystRunnerComparison;
387
+ //#endregion
388
+ //#region src/analyst/benchmark-public-calibration.d.ts
389
+ interface CodeTraceCalibrationRunnerSummary {
390
+ runnerId: string;
391
+ selectedRuns: number;
392
+ positiveRuns: number;
393
+ trustedNegativeRuns: number;
394
+ unlabeledRuns: number;
395
+ failedLabelEmptyRuns: number;
396
+ unknownLabelEmptyRuns: number;
397
+ completedRuns: number;
398
+ failedRuns: number;
399
+ expectedIncorrectSteps: number;
400
+ predictedIncorrectSteps: number;
401
+ matchedIncorrectSteps: number;
402
+ /** CodeTraceBench's published mean per-row incorrect-step F1 over every row. */
403
+ officialAllRowF1: number | null;
404
+ officialAllRowRuns: number;
405
+ precision: number | null;
406
+ recall: number | null;
407
+ f1: number | null;
408
+ trustedNegativeFalsePositiveRate: number | null;
409
+ trustedNegativeFailureRate: number | null;
410
+ unlabeledPredictionRate: number | null;
411
+ unlabeledFailureRate: number | null;
412
+ }
413
+ interface CodeTraceCalibrationSummary {
414
+ protocol: 'labeled-positive-and-solved-negative';
415
+ rationale: string;
416
+ runners: CodeTraceCalibrationRunnerSummary[];
417
+ }
418
+ declare function summarizeCodeTraceCalibration(result: AnalystBenchmarkResult): CodeTraceCalibrationSummary;
419
+ declare function renderCodeTraceCalibrationMarkdown(summary: CodeTraceCalibrationSummary): string;
420
+ //#endregion
421
+ //#region src/analyst/benchmark-command-artifact.d.ts
422
+ interface AnalystBenchmarkArtifact {
423
+ kind: 'agent-eval/analyst-benchmark-result';
424
+ runIdentitySha256: string;
425
+ inputs: {
426
+ dataset: PublicAnalystBenchmarkDataset;
427
+ datasetRevision: string;
428
+ datasetSplit: string;
429
+ labelsSha256: string;
430
+ sourceRowCount: number;
431
+ traceFiles: Array<{
432
+ traceId: string;
433
+ relativePath: string;
434
+ sha256: string;
435
+ }>;
436
+ verificationArtifacts: VerificationArtifactManifest[];
437
+ verificationAvailability: VerificationAvailabilitySummary;
438
+ selection: {
439
+ limit: number;
440
+ seed: number;
441
+ selectedCaseIds: string[];
442
+ report: PublicBenchmarkSelectionReport;
443
+ };
444
+ execution: {
445
+ repetitions: number;
446
+ concurrency: number;
447
+ model: string;
448
+ maxOutputTokens: number;
449
+ timeoutMs: number;
450
+ maxCostUsd: number;
451
+ maxArtifactBytes: number;
452
+ analystProtocolSha256: string;
453
+ implementationSha256: string;
454
+ dependencyLockSha256: string;
455
+ };
456
+ };
457
+ result: AnalystBenchmarkResult;
458
+ comparisons: AnalystRunnerComparison[];
459
+ codeTraceCalibration?: CodeTraceCalibrationSummary;
460
+ agentRxCalibration?: AgentRxCalibrationSummary;
461
+ }
462
+ interface VerificationAvailabilitySummary {
463
+ cases: number;
464
+ resultFilesPresent: number;
465
+ resultFilesMissing: number;
466
+ outcomes: {
467
+ passed: number;
468
+ failed: number;
469
+ unavailable: number;
470
+ };
471
+ }
472
+ interface AnalystBenchmarkRunIdentity {
473
+ config: {
474
+ dataset: PublicAnalystBenchmarkDataset;
475
+ datasetRevision: string;
476
+ datasetSplit: string;
477
+ model: {
478
+ id: string;
479
+ maxOutputTokens: number;
480
+ timeoutMs: number;
481
+ };
482
+ limit: number;
483
+ seed: number;
484
+ concurrency: number;
485
+ repetitions: number;
486
+ maxCostUsd: number;
487
+ maxArtifactBytes: number;
488
+ analystProtocolSha256: string;
489
+ implementationSha256: string;
490
+ dependencyLockSha256: string;
491
+ runnerIds: readonly ['empty', 'model'];
492
+ };
493
+ inputs: {
494
+ labelsSha256: string;
495
+ sourceRowCount: number;
496
+ selectedCaseIds: string[];
497
+ traceFiles: Array<{
498
+ traceId: string;
499
+ relativePath: string;
500
+ sha256: string;
501
+ }>;
502
+ verificationArtifactsSha256: string;
503
+ caseDefinitionsSha256: string;
504
+ };
505
+ }
506
+ interface AnalystBenchmarkRunManifest {
507
+ kind: 'agent-eval/analyst-benchmark-run';
508
+ createdAt: string;
509
+ identitySha256: string;
510
+ localIdentitySha256: string;
511
+ identity: AnalystBenchmarkRunIdentity;
512
+ }
513
+ interface AnalystBenchmarkLocalRunReceipt {
514
+ kind: 'agent-eval/analyst-benchmark-local-run';
515
+ runIdentitySha256: string;
516
+ localIdentitySha256: string;
517
+ local: {
518
+ labelsPath: string;
519
+ traceDir: string;
520
+ artifactDir?: string;
521
+ outputDir: string;
522
+ baseUrl: string;
523
+ apiKeyEnvironment: string;
524
+ };
525
+ command: string;
526
+ environment: {
527
+ node: string;
528
+ platform: string;
529
+ arch: string;
530
+ };
531
+ files: {
532
+ manifest: string;
533
+ observations: string;
534
+ costLedger: string;
535
+ modelResponses: string;
536
+ result: string;
537
+ report: string;
538
+ };
539
+ }
540
+ interface AnalystBenchmarkProgressRow {
541
+ sequence: number;
542
+ runIdentitySha256: string;
543
+ previousRowSha256: string | null;
544
+ observation: AnalystBenchmarkObservation;
545
+ rowSha256: string;
546
+ }
547
+ declare const ANALYST_BENCHMARK_MANIFEST_FILE = "manifest.json";
548
+ declare const ANALYST_BENCHMARK_OBSERVATIONS_FILE = "observations.jsonl";
549
+ declare const ANALYST_BENCHMARK_LOCAL_RECEIPT_FILE = "run.local.json";
550
+ declare const ANALYST_BENCHMARK_COST_LEDGER_FILE = "cost-ledger.jsonl";
551
+ //#endregion
552
+ //#region src/analyst/benchmark-command-result.d.ts
553
+ declare function readAnalystBenchmarkArtifact(path: string): Promise<AnalystBenchmarkArtifact>;
554
+ //#endregion
555
+ //#region src/analyst/benchmark-command.d.ts
556
+ interface AnalystBenchmarkCommandDependencies {
557
+ createModelRunner?: (dataset: PublicAnalystBenchmarkDataset, config: PublicAnalystBenchmarkModelConfig) => AnalystBenchmarkRunner<AnalystRunInputs>;
558
+ }
559
+ interface AnalystBenchmarkCommandConfig {
560
+ dataset: PublicAnalystBenchmarkDataset;
561
+ labelsPath: string;
562
+ traceDir: string;
563
+ artifactDir?: string;
564
+ outDir: string;
565
+ revision: string;
566
+ split: string;
567
+ model: PublicAnalystBenchmarkModelConfig;
568
+ limit: number;
569
+ seed: number;
570
+ concurrency: number;
571
+ repetitions: number;
572
+ maxCostUsd: number;
573
+ maxArtifactBytes: number;
574
+ apiKeyEnv: string;
575
+ command: string;
576
+ resume: boolean;
577
+ }
578
+ declare function runAnalystBenchmarkCommand(argv: readonly string[], env?: NodeJS.ProcessEnv, dependencies?: AnalystBenchmarkCommandDependencies): Promise<number>;
579
+ declare const ANALYST_BENCHMARK_HELP = "agent-eval analyst-benchmark\n\nRun a real-model trace analyst against public AgentRx or CodeTraceBench labels.\n\nRequired:\n --dataset agentrx|codetracebench\n --labels <dataset.json|dataset.jsonl>\n --trace-dir <one-trace-per-file OTLP JSONL directory>\n --artifact-dir <extracted artifact root> Required for CodeTraceBench\n --out <new output directory>\n --revision <full 40- or 64-character hex digest>\n --split <dataset split>\n --base-url <OpenAI-compatible /v1 URL>\n --api-key-env <environment variable containing the bearer>\n --model <provider model id>\n --limit <positive case count>\n\nControls:\n --resume Continue an interrupted run in --out\n --seed <integer> Case-selection and comparison seed. Default: 0\n --concurrency <positive integer> Parallel benchmark jobs. Default: 1\n --repetitions <positive integer> Runs per case and runner. Default: 1\n --max-output-tokens <positive> Model output limit per call. Default: 4096\n --timeout-ms <positive> Model analyst deadline per case. Default: 300000\n --max-cost-usd <positive> Run-wide spend limit. Default: 5\n --max-artifact-bytes <positive> Final evidence bytes per case. Default: 8388608\n\nWrites result.json with every observation, metric, usage field, error, comparison,\ninput digest, artifact digest, case distribution, selected case id, and explicit\nunknown cost. Limited deterministic-hash subsets are marked non-representative.\nCompleted observations are fsynced to observations.jsonl. Shareable output is in\nresult.json and report.md. Machine-local paths, endpoint, and command are isolated\nin run.local.json.\nThe key is read from the named environment variable and is never written.";
580
+ //#endregion
581
+ //#region src/analyst/benchmark-implementation.d.ts
582
+ declare const ANALYST_BENCHMARK_IMPLEMENTATION_DIGEST_ALGORITHM = "sha256-canonical-source-manifest";
583
+ declare const ANALYST_BENCHMARK_DEPENDENCY_LOCK_DIGEST_ALGORITHM = "sha256-canonical-file-manifest";
584
+ declare const ANALYST_BENCHMARK_DEPENDENCY_LOCK_FILES: readonly string[];
585
+ declare const ANALYST_BENCHMARK_DEPENDENCY_LOCK_SHA256 = "d06e3e3f171cc6bd5cf36b14325f507f34b1c6a9d5129ce8a85bf3c1681f8223";
586
+ /** The published benchmark evidence was produced at this package version.
587
+ * A release changes package.json's version field, which is part of the lock
588
+ * manifest but cannot change benchmark behavior, so the evidence stays bound
589
+ * to the digest at its creation. A test proves the current lock differs from
590
+ * the evidence lock by the version stamp alone; any real dependency change
591
+ * still forces a new benchmark run or explicit retirement of the evidence. */
592
+ declare const ANALYST_BENCHMARK_EVIDENCE_PACKAGE_VERSION = "0.137.0";
593
+ declare const ANALYST_BENCHMARK_EVIDENCE_DEPENDENCY_LOCK_SHA256 = "1e03f2daed356d60316aabefb407ec1e437ac94d408d61eea4ae096e9c6fbb5b";
594
+ declare const ANALYST_BENCHMARK_IMPLEMENTATION_FILES: readonly string[];
595
+ declare const ANALYST_BENCHMARK_IMPLEMENTATION_SHA256 = "4dba263b6256a30d56c7fdb2d992d3a953c0035d731f359b704db806f68f75ac";
596
+ declare function analystBenchmarkImplementationDigest(): string;
597
+ declare function analystBenchmarkDependencyLockDigest(): string;
171
598
  //#endregion
172
599
  //#region src/analyst/benchmark-report.d.ts
173
600
  declare function renderAnalystBenchmarkMarkdown(result: AnalystBenchmarkResult, comparisons?: readonly AnalystRunnerComparison[]): string;
@@ -180,7 +607,12 @@ interface DefineTraceAnalystOptions {
180
607
  cost: AnalystCost;
181
608
  analyze: Analyst<TraceAnalysisStore>['analyze'];
182
609
  }
610
+ interface DefineExactTraceAnalystOptions extends DefineTraceAnalystOptions {
611
+ /** Canonical JSON for behavior knobs not already bound by `version`. */
612
+ executionConfig: Readonly<Record<string, unknown>>;
613
+ }
183
614
  /** Define a custom trace analyst without repeating fixed registry fields. */
615
+ declare function defineTraceAnalyst(options: DefineExactTraceAnalystOptions): ExactCapableAnalyst<TraceAnalysisStore>;
184
616
  declare function defineTraceAnalyst(options: DefineTraceAnalystOptions): Analyst<TraceAnalysisStore>;
185
617
  type TraceAnalystAnalyze = (store: TraceAnalysisStore, context: Parameters<Analyst<TraceAnalysisStore>['analyze']>[1]) => Promise<AnalystFinding[]>;
186
618
  //#endregion
@@ -264,7 +696,9 @@ type TraceToolGroupName =
264
696
  /** Discovery + search tools. For pattern-matching across many traces. */
265
697
  'discoveryAndSearch' |
266
698
  /** Discovery + viewSpans + searchSpan. Targeted-span work after another kind narrows down. */
267
- 'targeted';
699
+ 'targeted' |
700
+ /** One known-small trace: overview, bounded reads, and in-trace search. */
701
+ 'singleTrace';
268
702
  /**
269
703
  * Build the tool set for a named group bound to a specific trace store.
270
704
  *
@@ -274,5 +708,5 @@ type TraceToolGroupName =
274
708
  */
275
709
  declare function buildTraceToolsForGroup(group: TraceToolGroupName, store: TraceAnalysisStore): AxFunction[];
276
710
  //#endregion
277
- export { ANALYST_SEVERITIES, type AgentRxBenchmarkCaseOptions, type AgentRxFailure, type AgentRxPrediction, type AgentRxPredictionReport, type AgentRxRow, type Analyst, type AnalystBenchmarkCase, type AnalystBenchmarkDatasetRef, type AnalystBenchmarkDescriptor, type AnalystBenchmarkObservation, type AnalystBenchmarkOutput, type AnalystBenchmarkProvenance, type AnalystBenchmarkResult, type AnalystBenchmarkRunner, type AnalystBenchmarkSummary, type AnalystComparisonMetric, type AnalystContext, type AnalystCost, type AnalystEvidenceExpectation, type AnalystEvidenceResolution, type AnalystEvidenceResolutionError, type AnalystEvidenceResolver, type AnalystFinding, type AnalystFindingScore, type AnalystHooks, type AnalystInputKind, type AnalystIssueExpectation, type AnalystLatencyDistribution, type AnalystMetricComparison, AnalystRegistry, type AnalystRegistryOptions, type AnalystRequirements, type AnalystRunEvent, type AnalystRunInputs, type AnalystRunResult, type AnalystRunSummary, type AnalystRunnerComparison, type AnalystSeverity, type AnalystUsageReceipt, type BehavioralAnalystOptions, type BudgetPolicy, CONTROL_INTEGRITY_ANALYST, type ChatCallOpts, type ChatClient, type ChatRequest, type ChatResponse, type ChatTransport, type CliBridgeTransportOpts, type CodeTraceBenchCaseOptions, type CodeTraceBenchLabelOptions, type CodeTraceBenchLabelSet, type CodeTraceBenchRow, type CodeTraceStageAnnotation, type CodeTracerPredictionAdapterOptions, ControlIntegrityAnalyst, type CreateAnalystAiConfig, type CreateChatClientOpts, type CreateTraceAnalystKindOpts, type CustomTransportOpts, DEFAULT_TRACE_ANALYST_KINDS, type DefaultAnalystRegistryOptions, type DefineTraceAnalystOptions, type DiffPolicy, type DirectProviderTransportOpts, type EvidenceRef, FAILURE_MODE_KIND_SPEC, FINDING_SUBJECT_GRAMMAR_PROMPT, FINDING_SUBJECT_KINDS, FINDING_SUBJECT_SYNTAX, type FindingSubject, type FindingSubjectKind, FindingSubjectStringSchema, type FindingsDiff, FindingsStore, IMPROVEMENT_KIND_SPEC, type JudgeAdapterOpts, KIND_EXPECTED_SUBJECTS, KNOWLEDGE_GAP_KIND_SPEC, KNOWLEDGE_POISONING_KIND_SPEC, type MockTransportOpts, type PersistedFinding, type ProposalFinding, type ProposalFindingOrigin, RAW_FINDING_SCHEMA_PROMPT, type RawAnalystEvidence, RawAnalystEvidenceSchema, type RawAnalystFinding, RawAnalystFindingSchema, type RegistryRunOpts, type RouterTransportOpts, type RunAnalystBenchmarkOptions, type RunCriticAdapterOpts, SKILL_USAGE_ANALYST, type SandboxSdkTransportOpts, type SemanticConceptJudgeAdapterOpts, SkillUsageAnalyst, type SkillUsageRecord, type SkillUsageReport, type SkillUsageScanConfig, type StepLabelAdapterOptions, type StructureFindingsOptions, type StructureFindingsResult, type TraceAnalystAnalyze, type TraceAnalystKindSpec, type TraceToolGroupName, type UpstreamPredictionAdapterOptions, type VerifierAdapterOpts, agentRxBenchmarkCase, agentRxPredictionsToFindings, assertProposalFindings, behavioralAnalyst, buildDefaultAnalystRegistry, buildSkillUsageReport, buildTraceToolsForGroup, codeTraceBenchCase, codeTracerPredictionsToFindings, coerceJson, coerceToFindingRows, compareAnalystRunners, computeFindingId, createAnalystAi, createChatClient, createJudgeAdapter, createRunCriticAdapter, createSemanticConceptJudgeAdapter, createTraceAnalystKind, createVerifierAdapter, defaultIsMaterial, defineTraceAnalyst, deriveEfficiencyFindings, diffFindings, emitControlIntegrityFindings, emitSkillUsageFindings, evidenceRefsFromRawFinding, findingSubjectGrammarPromptFor, isProposalFinding, liftSeverity, makeFinding, makeProposalFinding, normalizeAgentRxCategory, normalizeBenchmarkLabel, parseFindingSubject, parseRawFinding, registryBenchmarkRunner, renderAnalystBenchmarkMarkdown, renderFindingSubject, renderPriorFindings, renderUpstreamFindings, runAnalystBenchmark, scoreAnalystFindings, stripCodeFences, structureFindings, traceStoreEvidenceResolver };
711
+ export { AGENT_RX_UPSTREAM_REVISION, ANALYST_BENCHMARK_COST_LEDGER_FILE, ANALYST_BENCHMARK_DEPENDENCY_LOCK_DIGEST_ALGORITHM, ANALYST_BENCHMARK_DEPENDENCY_LOCK_FILES, ANALYST_BENCHMARK_DEPENDENCY_LOCK_SHA256, ANALYST_BENCHMARK_EVIDENCE_DEPENDENCY_LOCK_SHA256, ANALYST_BENCHMARK_EVIDENCE_PACKAGE_VERSION, ANALYST_BENCHMARK_HELP, ANALYST_BENCHMARK_IMPLEMENTATION_DIGEST_ALGORITHM, ANALYST_BENCHMARK_IMPLEMENTATION_FILES, ANALYST_BENCHMARK_IMPLEMENTATION_SHA256, ANALYST_BENCHMARK_LOCAL_RECEIPT_FILE, ANALYST_BENCHMARK_MANIFEST_FILE, ANALYST_BENCHMARK_OBSERVATIONS_FILE, ANALYST_SEVERITIES, type AgentRxBenchmarkCaseOptions, type AgentRxCalibrationRunnerSummary, type AgentRxCalibrationSummary, type AgentRxFailure, type AgentRxPrediction, type AgentRxPredictionReport, type AgentRxRow, type Analyst, type AnalystBenchmarkArtifact, type AnalystBenchmarkCase, type AnalystBenchmarkCommandConfig, type AnalystBenchmarkCommandDependencies, type AnalystBenchmarkDatasetRef, type AnalystBenchmarkDescriptor, type AnalystBenchmarkError, type AnalystBenchmarkLabelState, type AnalystBenchmarkLocalRunReceipt, type AnalystBenchmarkObservation, type AnalystBenchmarkOutput, type AnalystBenchmarkProgressRow, type AnalystBenchmarkProvenance, type AnalystBenchmarkResult, type AnalystBenchmarkRunIdentity, type AnalystBenchmarkRunManifest, type AnalystBenchmarkRunner, type AnalystBenchmarkSummary, type AnalystComparisonMetric, type AnalystContext, type AnalystCost, type AnalystEvidenceExpectation, type AnalystEvidenceResolution, type AnalystEvidenceResolutionError, type AnalystEvidenceResolver, type AnalystFinding, type AnalystFindingScore, type AnalystHooks, type AnalystInputKind, type AnalystIssueExpectation, type AnalystLatencyDistribution, type AnalystMetricComparison, AnalystRegistry, type AnalystRegistryOptions, type AnalystRequirements, type AnalystRunEvent, type AnalystRunInputs, type AnalystRunResult, type AnalystRunSummary, type AnalystRunnerComparison, type AnalystSeverity, type AnalystUsageReceipt, type BehavioralAnalystOptions, type BudgetPolicy, CODE_TRACE_BENCH_ANALYST_PROMPT, CONTROL_INTEGRITY_ANALYST, type ChatCallOpts, type ChatClient, type ChatRequest, type ChatResponse, type ChatTransport, type CliBridgeTransportOpts, type CodeTraceBenchCaseOptions, type CodeTraceBenchLabelOptions, type CodeTraceBenchLabelSet, type CodeTraceBenchRow, type CodeTraceCalibrationRunnerSummary, type CodeTraceCalibrationSummary, type CodeTraceStageAnnotation, type CodeTracerLabelGroup, type CodeTracerPredictionAdapterOptions, type CodeTracerPredictions, type CodeTracerStepLabel, ControlIntegrityAnalyst, type CreateAnalystAiConfig, type CreateChatClientOpts, type CreateTraceAnalystKindOpts, type CustomTransportOpts, DEFAULT_MAX_VERIFICATION_ARTIFACT_BYTES, DEFAULT_TRACE_ANALYST_KINDS, type DefaultAnalystRegistryOptions, type DefineExactTraceAnalystOptions, type DefineTraceAnalystOptions, type DiffPolicy, type DirectProviderTransportOpts, type EvidenceRef, type ExactAnalystBudgetPolicy, type ExactAnalystBudgetSnapshot, type ExactAnalystExecutionPlanSnapshot, type ExactAnalystRunCompletion, type ExactAnalystRunEvent, ExactAnalystRunExecutionError, type ExactAnalystRunPolicySnapshot, type ExactAnalystRunResult, type ExactAnalystRunSummary, type ExactAnalystSnapshot, type ExactCapableAnalyst, type ExactExecutionComponentIdentity, type ExactExecutionComponentSnapshot, type ExactRegistryRunOpts, FAILURE_MODE_KIND_SPEC, FINDING_SUBJECT_GRAMMAR_PROMPT, FINDING_SUBJECT_KINDS, FINDING_SUBJECT_SYNTAX, type FindingSubject, type FindingSubjectKind, FindingSubjectStringSchema, type FindingsDiff, FindingsStore, IMPROVEMENT_KIND_SPEC, type JudgeAdapterOpts, KIND_EXPECTED_SUBJECTS, KNOWLEDGE_GAP_KIND_SPEC, KNOWLEDGE_POISONING_KIND_SPEC, type LoadedVerificationArtifacts, type MockTransportOpts, type PersistedFinding, type PreparedPublicAnalystBenchmark, type ProposalFinding, type ProposalFindingOrigin, type PublicAnalystBenchmarkDataset, type PublicAnalystBenchmarkModelConfig, type PublicBenchmarkDistributions, type PublicBenchmarkSelectionReport, type PublicBenchmarkValueDistribution, RAW_FINDING_SCHEMA_PROMPT, type RawAnalystEvidence, RawAnalystEvidenceSchema, type RawAnalystFinding, RawAnalystFindingSchema, type RegistryRunOpts, type RouterTransportOpts, type RunAnalystBenchmarkOptions, type RunCriticAdapterOpts, SKILL_USAGE_ANALYST, type SandboxSdkTransportOpts, type SemanticConceptJudgeAdapterOpts, SkillUsageAnalyst, type SkillUsageRecord, type SkillUsageReport, type SkillUsageScanConfig, type StepLabelAdapterOptions, type StructureFindingsOptions, type StructureFindingsResult, type TraceAnalystAnalyze, type TraceAnalystKindSpec, type TraceToolGroupName, type UpstreamPredictionAdapterOptions, type VerificationArtifactFile, type VerificationArtifactManifest, type VerificationArtifactRole, type VerificationAvailabilitySummary, type VerificationOutcome, type VerificationOutcomeSource, type VerificationOutcomeStatus, type VerificationResultFile, type VerifierAdapterOpts, adaptPublicBenchmarkFindings, agentRxBenchmarkCase, agentRxPredictionsToFindings, analystBenchmarkDependencyLockDigest, analystBenchmarkImplementationDigest, appendVerificationArtifactsToOtlp, assertExactRegistryRunOpts, assertProposalFindings, behavioralAnalyst, buildDefaultAnalystRegistry, buildSkillUsageReport, buildTraceToolsForGroup, codeTraceBenchCase, codeTracerPredictionsToFindings, coerceJson, coerceToFindingRows, compareAnalystRunners, computeFindingId, createAnalystAi, createChatClient, createJudgeAdapter, createPublicBenchmarkModelRunner, createRunCriticAdapter, createSemanticConceptJudgeAdapter, createTraceAnalystKind, createVerifierAdapter, defaultIsMaterial, defineTraceAnalyst, deriveEfficiencyFindings, diffFindings, emitControlIntegrityFindings, emitSkillUsageFindings, emptyPublicBenchmarkRunner, evidenceRefsFromRawFinding, findingSubjectGrammarPromptFor, isProposalFinding, liftSeverity, loadCodeTraceVerificationArtifacts, loadPublicBenchmarkRows, makeFinding, makeProposalFinding, normalizeAgentRxCategory, normalizeBenchmarkLabel, parseFindingSubject, parseRawFinding, parseVerificationOutcome, preparePublicAnalystBenchmark, publicBenchmarkDistributions, publicBenchmarkProtocolSha256, publicBenchmarkSelectionReport, readAnalystBenchmarkArtifact, registryBenchmarkRunner, renderAgentRxCalibrationMarkdown, renderAnalystBenchmarkMarkdown, renderCodeTraceCalibrationMarkdown, renderFindingSubject, renderPriorFindings, renderUpstreamFindings, roundAgentRxStep, runAnalystBenchmark, runAnalystBenchmarkCommand, scoreAnalystFindings, selectPublicBenchmarkRows, stripCodeFences, structureFindings, summarizeAgentRxCalibration, summarizeCodeTraceCalibration, traceStoreEvidenceResolver };
278
712
  //# sourceMappingURL=index.d.ts.map
@@ -1 +1 @@
1
- {"version":3,"file":"index.d.ts","names":[],"sources":["../../src/analyst/adapters.ts","../../src/analyst/benchmark-comparison.ts","../../src/analyst/benchmark-datasets.ts","../../src/analyst/benchmark-report.ts","../../src/analyst/define.ts","../../src/analyst/parse-tolerant.ts","../../src/analyst/proposal-findings.ts","../../src/analyst/structure-findings.ts","../../src/analyst/tool-groups.ts"],"mappings":";;;;;;;;;;iBA4CgB,aAAa,GAAG,WAAgB;UAe/B,oBAAoB;EACnC;EACA;EACA,UAAU,mBAAmB;;;;;EAK7B,UAAU,KAAK,cAAc;;iBAGf,sBAAsB,KAAK,MAAM,oBAAoB,OAAO,QAAQ;UAwEnE;EACf;EACA;EACA,SAAS;;EAET;;iBAGc,uBAAuB,OAAM,uBAA4B,QAAQ;UAiEhE;EACf;EACA;EACA,OAAO;;EAEP,MAAM;;EAEN,OAAO;;EAEP;;iBAGc,mBAAmB,MAAM,mBAAmB,QAAQ;UAiDnD;EACf;EACA;;EAEA,UAAU,KAAK;;EAEf;;iBAGc,kCACd,OAAM,kCACL,QAAQ;;;KC5RC;UAmBK;EACf,QAAQ;EACR;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;;UAGe;EACf;EACA;EACA,SAAS;;iBAGK,sBACd,QAAQ,wBACR;EACE;EACA;EACA;EACA;EACA;IAED;;;KCjDE;UAEY;EACf,YAAY;EACZ;EACA;EACA;EACA;EACA;;UAGe;EACf,eAAe;EACf,mBAAmB;EACnB;IAAe,YAAY;IAAY;;EACvC,wBAAwB;EACxB;EACA;EACA;;UAGe;EACf,UAAU;EACV;EACA;EACA;EACA;;UAGe;EACf,UAAU;EACV,mBAAmB;EACnB;EACA;EACA;EACA;EACA;;UAGe;EACf;EACA;EACA;EACA;;UAGe;EACf;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA,oCAAoC;;UAGrB;EACf,eAAe;EACf,WAAW,sBAAsB;;KAGvB;UAEK;;;;;EAKf,WAAW;;UAGI,kCACP,yBACN;UAEa,oCAAoC;EACnD;;EAEA;;UAGe,yCAAyC;EACxD;EACA;EACA;EACA;;UAGe,2CACP,kCACN;iBAEY,qBAAqB,QACnC,KAAK,YACL,OAAO,QACP,UAAS,8BACR,qBAAqB;iBA2ER,mBAAmB,QACjC,KAAK,mBACL,OAAO,QACP,UAAS,4BACR,qBAAqB;;iBA8DR,6BACd,mBAAmB,YACnB,iBACA,UAAS,mCACR;;iBAwDa,gCACd,2BACA,+BAA+B,4BAC/B,UAAS,qCACR;iBAoDa,wBAAwB;iBAmFxB,yBAAyB;;;iBCvbzB,+BACd,QAAQ,wBACR,uBAAsB;;;UCFP;EACf;EACA;EACA;EACA,MAAM;EACN,SAAS,QAAQ;;;iBAIH,mBACd,SAAS,4BACR,QAAQ;KAkBC,uBACV,OAAO,oBACP,SAAS,WAAW,QAAQ,uCACzB,QAAQ;;;;;;;;;;;;;;;iBCtBG,gBAAgB;;;;;iBAgBhB,WAAW;;;;;;;iBAeX,oBAAoB;;;;iBCXpB,kBAAkB,mBAAmB,WAAW;;;;;;iBAShD,uBACd,mBACA,mBACC,cAAc;;;UCXA;;EAEf;EACA;;EAEA;EACA;EACA;EACA;;EAEA,aAAa;EACb;EACA,WAAW;EACX;EACA,SAAS;;EAET;;EAEA,cAAc,KAAK,sBAAsB;;EAEzC,kBAAkB;;EAElB,YAAY;;UAGG;EACf,UAAU;EACV;;iBAuCoB,kBACpB,MAAM,2BACL,QAAQ;;;;KCrFC;;;;;;;;;;;;;;;;;;iBAuCI,wBACd,OAAO,oBACP,OAAO,qBACN"}
1
+ {"version":3,"file":"index.d.ts","names":[],"sources":["../../src/analyst/adapters.ts","../../src/analyst/benchmark-agentrx-calibration.ts","../../src/analyst/benchmark-dataset-types.ts","../../src/analyst/benchmark-dataset-agentrx.ts","../../src/analyst/benchmark-dataset-codetrace.ts","../../src/analyst/benchmark-dataset-utils.ts","../../src/analyst/benchmark-verification-outcome.ts","../../src/analyst/benchmark-verification-artifacts.ts","../../src/analyst/benchmark-public-types.ts","../../src/analyst/benchmark-public-adapters.ts","../../src/analyst/benchmark-public-data.ts","../../src/analyst/benchmark-public-model.ts","../../src/analyst/benchmark-comparison.ts","../../src/analyst/benchmark-public-calibration.ts","../../src/analyst/benchmark-command-artifact.ts","../../src/analyst/benchmark-command-result.ts","../../src/analyst/benchmark-command.ts","../../src/analyst/benchmark-implementation.ts","../../src/analyst/benchmark-report.ts","../../src/analyst/define.ts","../../src/analyst/parse-tolerant.ts","../../src/analyst/proposal-findings.ts","../../src/analyst/structure-findings.ts","../../src/analyst/tool-groups.ts"],"mappings":";;;;;;;;;;;iBA4CgB,aAAa,GAAG,WAAgB;UAe/B,oBAAoB;EACnC;EACA;EACA,UAAU,mBAAmB;;;;;EAK7B,UAAU,KAAK,cAAc;;iBAGf,sBAAsB,KAAK,MAAM,oBAAoB,OAAO,QAAQ;UAwEnE;EACf;EACA;EACA,SAAS;;EAET;;iBAGc,uBAAuB,OAAM,uBAA4B,QAAQ;UAiEhE;EACf;EACA;EACA,OAAO;;EAEP,MAAM;;EAEN,OAAO;;EAEP;;iBAGc,mBAAmB,MAAM,mBAAmB,QAAQ;UAiDnD;EACf;EACA;;EAEA,UAAU,KAAK;;EAEf;;iBAGc,kCACd,OAAM,kCACL,QAAQ;;;cC5RE;UAEI;EACf;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;;UAGe;EACf;EACA;EACA;EACA,SAAS;;iBAGK,4BACd,QAAQ,wBACR,2BACC;iBAkBa,iCAAiC,SAAS;;;KCtD9C;UAEK;EACf,YAAY;EACZ;EACA;EACA;EACA;EACA;;UAGe;EACf,eAAe;EACf,mBAAmB;EACnB;IAAe,YAAY;IAAY;;EACvC,wBAAwB;EACxB;EACA;EACA;;UAGe;EACf,UAAU;EACV;EACA;EACA;EACA;;UAGe;EACf,UAAU;EACV,mBAAmB;EACnB;EACA;EACA;EACA;EACA;;UAGe;EACf;EACA;EACA;EACA;;UAGe;EACf;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;;UAGe;EACf;EACA;EACA;EACA,iBAAiB;;KAGP,0CAEC,sCACA,iCACA;UAEI;EACf;EACA;EACA;EACA;;EAEA;EACA;EACA;EACA;EACA;EACA;EACA,oCAAoC;;UAGrB;EACf,eAAe;EACf,WAAW,sBAAsB;;KAGvB;UAEK;;;;;EAKf,WAAW;;UAGI,kCACP,yBACN;UAEa,oCAAoC;EACnD;;EAEA;;UAGe,yCAAyC;EACxD;EACA;EACA;EACA;;UAGe,2CACP,kCACN;;;iBCtGY,qBAAqB,QACnC,KAAK,YACL,OAAO,QACP,UAAS,8BACR,qBAAqB;;iBAoGR,6BACd,mBAAmB,YACnB,iBACA,UAAS,mCACR;iBA6Ea,yBAAyB;;iBAoNzB,iBAAiB;;;iBC7YjB,mBAAmB,QACjC,KAAK,mBACL,OAAO,QACP,UAAS,4BACR,qBAAqB;;iBAwFR,gCACd,2BACA,aAAa,uBACb,UAAS,qCACR;;;iBClHa,wBAAwB;;;KCA5B;UAEK;EACf;EACA;EACA,QAAQ;;UAGO;EACf,QAAQ;EACR;EAKA;IAAe;IAAe;;EAC9B,SAAS;EACT;EACA;EACA;EACA;;UAGe;EACf;EACA;;iBA8Ec,yBACd,gBAAgB,2BACf;;;cChGU;KAED;UAEK;EACf,MAAM;EACN;EACA;EACA;EACA;EACA;;UAGe;EACf;EACA;EACA,SAAS;EACT;EACA;EACA;EACA;EACA;EACA,OAAO;EACP,cAAc;EACd,UAAU,OAAO;;UAGF;EACf,UAAU;EACV,SAAS;EACT,OAAO,MAAM;IAA6B;;;iBAatB,mCAAmC;EACvD;EACA,KAAK;EACL;IACE,QAAQ;iBAwHI,kCACd,kBACA,iBACA,WAAW,6BACX;;;KCjLU;UAEK;EACf;EACA;EACA;EACA;EACA;EACA,aAAa;EACb;IACE;IACA;;;EAGF,mBAAmB;;UAGJ;EACf,OAAO,qBAAqB;EAC5B;EACA;EACA;EACA,YAAY;IACV;IACA;IACA;;EAEF,uBAAuB;EACvB,WAAW;;UAGI;EACf;EACA;EACA,QAAQ;;UAGO;EACf,OAAO;EACP,OAAO;EACP,OAAO;EACP,YAAY;EACZ,QAAQ;;UAGO;EACf;EACA;EACA;EACA;EACA;EACA;EACA,QAAQ;EACR,UAAU;;;;iBChDI,8BAA8B,uBAAuB;iBAiBrD,6BACd,SAAS,+BACT,sBACA,mBAAmB,kBACnB,oBACC;;;iBCgBmB,wBACpB,eACC,QAAQ,MAAM;iBA2BD,0BACd,SAAS,+BACT,eAAe,2BACf;EAAW;EAAe;IACzB,MAAM;iBAwBO,6BACd,SAAS,+BACT,eAAe,4BACd;iBAyCa,+BACd,SAAS,+BACT,iBAAiB,2BACjB,mBAAmB,2BACnB,eACC;iBAcmB,8BAA8B;EAClD,SAAS;EACT;EACA;EACA;EACA;EACA;EACA;IACE,QAAQ;;;iBC9HI,iCACd,SAAS,+BACT,QAAQ,oCACP,uBAAuB;iBAofV,8BAA8B,SAAS;cAoE1C;;;KC1mBD;UAoBK;EACf,QAAQ;EACR;;EAEA;;EAEA;;EAEA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;;UAGe;EACf;EACA;EACA,SAAS;;iBASK,sBACd,QAAQ,wBACR;EACE;EACA;EACA;EACA;EACA;IAED;;;UCnEc;EACf;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;;EAEA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;;UAGe;EACf;EACA;EACA,SAAS;;iBAGK,8BACd,QAAQ,yBACP;iBAca,mCAAmC,SAAS;;;UCrC3C;EACf;EACA;EACA;IACE,SAAS;IACT;IACA;IACA;IACA;IACA,YAAY;MAAQ;MAAiB;MAAsB;;IAC3D,uBAAuB;IACvB,0BAA0B;IAC1B;MACE;MACA;MACA;MACA,QAAQ;;IAEV;MACE;MACA;MACA;MACA;MACA;MACA;MACA;MACA;MACA;MACA;;;EAGJ,QAAQ;EACR,aAAa;EACb,uBAAuB;EACvB,qBAAqB;;UAGN;EACf;EACA;EACA;EACA;IACE;IACA;IACA;;;UAIa;EACf;IACE,SAAS;IACT;IACA;IACA;MACE;MACA;MACA;;IAEF;IACA;IACA;IACA;IACA;IACA;IACA;IACA;IACA;IACA;;EAEF;IACE;IACA;IACA;IACA,YAAY;MAAQ;MAAiB;MAAsB;;IAC3D;IACA;;;UAIa;EACf;EACA;EACA;EACA;EACA,UAAU;;UAGK;EACf;EACA;EACA;EACA;IACE;IACA;IACA;IACA;IACA;IACA;;EAEF;EACA;IACE;IACA;IACA;;EAEF;IACE;IACA;IACA;IACA;IACA;IACA;;;UAIa;EACf;EACA;EACA;EACA,aAAa;EACb;;cAGW;cACA;cACA;cACA;;;iBCxHS,6BACpB,eACC,QAAQ;;;UCyDM;EACf,qBACE,SAAS,+BACT,QAAQ,sCACL,uBAAuB;;UAGb;EACf,SAAS;EACT;EACA;EACA;EACA;EACA;EACA;EACA,OAAO;EACP;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;;iBAKoB,2BACpB,yBACA,MAAK,OAAO,YACZ,eAAc,sCACb;cA8QU;;;cC7XA;cAEA;cAEA;cAKA;;;;;;;cASA;cAEA;cAGA;cAgEA;iBAGG;iBAIA;;;iBC3FA,+BACd,QAAQ,wBACR,uBAAsB;;;UCDP;EACf;EACA;EACA;EACA,MAAM;EACN,SAAS,QAAQ;;UAGF,uCAAuC;;EAEtD,iBAAiB,SAAS;;;iBAIZ,mBACd,SAAS,iCACR,oBAAoB;iBACP,mBAAmB,SAAS,4BAA4B,QAAQ;KA8BpE,uBACV,OAAO,oBACP,SAAS,WAAW,QAAQ,uCACzB,QAAQ;;;;;;;;;;;;;;;iBCzCG,gBAAgB;;;;;iBAgBhB,WAAW;;;;;;;iBAeX,oBAAoB;;;;iBCXpB,kBAAkB,mBAAmB,WAAW;;;;;;iBAShD,uBACd,mBACA,mBACC,cAAc;;;UCXA;;EAEf;EACA;;EAEA;EACA;EACA;EACA;;EAEA,aAAa;EACb;EACA,WAAW;EACX;EACA,SAAS;;EAET;;EAEA,cAAc,KAAK,sBAAsB;;EAEzC,kBAAkB;;EAElB,YAAY;;UAGG;EACf,UAAU;EACV;;iBAuCoB,kBACpB,MAAM,2BACL,QAAQ;;;;KCrFC;;;;;;;;;;;;;;;;;;;;iBAgDI,wBACd,OAAO,oBACP,OAAO,qBACN"}