@tangle-network/agent-eval 0.137.0 → 0.138.0
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/CHANGELOG.md +48 -0
- package/README.md +33 -0
- package/dist/analyst/index.d.ts +473 -39
- package/dist/analyst/index.d.ts.map +1 -1
- package/dist/analyst/index.js +11 -593
- package/dist/analyst/index.js.map +1 -1
- package/dist/{analyze-runs-PVtnfjvA.d.ts → analyze-runs-CPYxfPWT.d.ts} +5 -5
- package/dist/{analyze-runs-PVtnfjvA.d.ts.map → analyze-runs-CPYxfPWT.d.ts.map} +1 -1
- package/dist/{benchmark-YDrpumqB.js → benchmark-D8dkki-J.js} +299 -159
- package/dist/benchmark-D8dkki-J.js.map +1 -0
- package/dist/{benchmark-CHX4orG7.d.ts → benchmark-DlQgU_XI.d.ts} +67 -15
- package/dist/benchmark-DlQgU_XI.d.ts.map +1 -0
- package/dist/benchmark-command-CMqVqReF.js +4332 -0
- package/dist/benchmark-command-CMqVqReF.js.map +1 -0
- package/dist/benchmarks/index.d.ts +1 -1
- package/dist/benchmarks/index.js +1 -1
- package/dist/{benchmarks-DCLkQOmc.js → benchmarks-BJ_xK5rQ.js} +4 -3
- package/dist/{benchmarks-DCLkQOmc.js.map → benchmarks-BJ_xK5rQ.js.map} +1 -1
- package/dist/campaign/index.d.ts +5 -5
- package/dist/campaign/index.js +3 -3
- package/dist/{campaign-lgObcHFC.js → campaign-BIBS-NHV.js} +16 -9
- package/dist/campaign-BIBS-NHV.js.map +1 -0
- package/dist/cli.js +9 -2
- package/dist/cli.js.map +1 -1
- package/dist/{client-C8L6h6Wf.d.ts → client-BwPKohkJ.d.ts} +4 -4
- package/dist/{client-C8L6h6Wf.d.ts.map → client-BwPKohkJ.d.ts.map} +1 -1
- package/dist/{completion-verifier-DSyRNVzU.d.ts → completion-verifier-B4-IMYcS.d.ts} +3 -3
- package/dist/{completion-verifier-DSyRNVzU.d.ts.map → completion-verifier-B4-IMYcS.d.ts.map} +1 -1
- package/dist/contract/index.d.ts +10 -10
- package/dist/contract/index.js +8 -8
- package/dist/control.d.ts +2 -2
- package/dist/{cost-ledger-D2o6JOrL.d.ts → cost-ledger-B1D3COAc.d.ts} +5 -4
- package/dist/{cost-ledger-D2o6JOrL.d.ts.map → cost-ledger-B1D3COAc.d.ts.map} +1 -1
- package/dist/{cost-ledger-D-5_-dhi.js → cost-ledger-CHDLA0Ss.js} +90 -45
- package/dist/cost-ledger-CHDLA0Ss.js.map +1 -0
- package/dist/{default-registry-Dc5D_Loc.d.ts → default-registry-PUhIVRWz.d.ts} +18 -5
- package/dist/default-registry-PUhIVRWz.d.ts.map +1 -0
- package/dist/{default-registry-CLXbRt0f.js → default-registry-lp5R0lve.js} +1503 -258
- package/dist/default-registry-lp5R0lve.js.map +1 -0
- package/dist/{eval-campaign-CHqfLnff.js → eval-campaign-9MozgKL7.js} +2 -2
- package/dist/{eval-campaign-CHqfLnff.js.map → eval-campaign-9MozgKL7.js.map} +1 -1
- package/dist/exact-types-Dpw2LeHA.d.ts +234 -0
- package/dist/exact-types-Dpw2LeHA.d.ts.map +1 -0
- package/dist/{extract-usage-p-56bh8q.js → extract-usage-CS391dOE.js} +2 -2
- package/dist/{extract-usage-p-56bh8q.js.map → extract-usage-CS391dOE.js.map} +1 -1
- package/dist/{feedback-trajectory-N_F0PwHz.d.ts → feedback-trajectory-CoNep7rl.d.ts} +3 -2
- package/dist/feedback-trajectory-CoNep7rl.d.ts.map +1 -0
- package/dist/fuzz.d.ts +1 -1
- package/dist/fuzz.js +1 -1
- package/dist/hosted/index.d.ts +3 -3
- package/dist/{index-U3RHOShi.d.ts → index-B2-IxCMB.d.ts} +2 -2
- package/dist/{index-U3RHOShi.d.ts.map → index-B2-IxCMB.d.ts.map} +1 -1
- package/dist/{index-BnP1QJUv.d.ts → index-CjVYlVBK.d.ts} +5 -5
- package/dist/{index-BnP1QJUv.d.ts.map → index-CjVYlVBK.d.ts.map} +1 -1
- package/dist/{index-C-Pr4OWg.d.ts → index-D0cxAdaV.d.ts} +11 -10
- package/dist/index-D0cxAdaV.d.ts.map +1 -0
- package/dist/index-DEb46kc6.d.ts.map +1 -1
- package/dist/{index-DRNl6g_N.d.ts → index-sMN_hI4E.d.ts} +3 -3
- package/dist/{index-DRNl6g_N.d.ts.map → index-sMN_hI4E.d.ts.map} +1 -1
- package/dist/index.d.ts +24 -23
- package/dist/index.d.ts.map +1 -1
- package/dist/index.js +19 -353
- package/dist/index.js.map +1 -1
- package/dist/{insight-report-B9ooYH_g.d.ts → insight-report-CXd8VBDR.d.ts} +4 -4
- package/dist/{insight-report-B9ooYH_g.d.ts.map → insight-report-CXd8VBDR.d.ts.map} +1 -1
- package/dist/{integrity-CKxosZ5Z.d.ts → integrity-B-MLFz0I.d.ts} +2 -2
- package/dist/{integrity-CKxosZ5Z.d.ts.map → integrity-B-MLFz0I.d.ts.map} +1 -1
- package/dist/ledger-core/index.js +1 -1
- package/dist/{ledger-core-t6sItivm.js → ledger-core-C0Yx1I14.js} +220 -27
- package/dist/ledger-core-C0Yx1I14.js.map +1 -0
- package/dist/{llm-client-DKB25jV8.js → llm-client-Cj3c7PEm.js} +5 -5
- package/dist/llm-client-Cj3c7PEm.js.map +1 -0
- package/dist/meta-eval/index.d.ts +2 -2
- package/dist/multishot/index.d.ts +2 -2
- package/dist/openapi.json +1 -1
- package/dist/{proposal-findings-DCawte-y.js → proposal-findings-2GIUo1et.js} +2 -68
- package/dist/proposal-findings-2GIUo1et.js.map +1 -0
- package/dist/{registry-BdM7SuTr.d.ts → registry-C4yJTza7.d.ts} +60 -6
- package/dist/registry-C4yJTza7.d.ts.map +1 -0
- package/dist/{release-report-CofgVNZt.d.ts → release-report-CoyvyLBs.d.ts} +3 -3
- package/dist/{release-report-CofgVNZt.d.ts.map → release-report-CoyvyLBs.d.ts.map} +1 -1
- package/dist/{replay-Bju0T8Ls.js → replay-Cb-4Vf0k.js} +8 -7
- package/dist/replay-Cb-4Vf0k.js.map +1 -0
- package/dist/{replay-K8FaC0CB.d.ts → replay-DbIYwso6.d.ts} +7 -7
- package/dist/{replay-K8FaC0CB.d.ts.map → replay-DbIYwso6.d.ts.map} +1 -1
- package/dist/reporting.d.ts +4 -4
- package/dist/{researcher-Da0Wj-bt.d.ts → researcher-BCeOEjtR.d.ts} +5 -5
- package/dist/{researcher-Da0Wj-bt.d.ts.map → researcher-BCeOEjtR.d.ts.map} +1 -1
- package/dist/{reward-hacking-CQ3hTCO3.d.ts → reward-hacking-sE2l_NV6.d.ts} +2 -2
- package/dist/{reward-hacking-CQ3hTCO3.d.ts.map → reward-hacking-sE2l_NV6.d.ts.map} +1 -1
- package/dist/rl.d.ts +5 -5
- package/dist/rl.js +1 -1
- package/dist/rollout/index.d.ts +1 -1
- package/dist/{rubric-predictive-validity-C4sztLR3.d.ts → rubric-predictive-validity-w2klGv1u.d.ts} +2 -2
- package/dist/{rubric-predictive-validity-C4sztLR3.d.ts.map → rubric-predictive-validity-w2klGv1u.d.ts.map} +1 -1
- package/dist/{run-evidence-BDIircdA.d.ts → run-evidence-CbE0A8Xg.d.ts} +3 -3
- package/dist/{run-evidence-BDIircdA.d.ts.map → run-evidence-CbE0A8Xg.d.ts.map} +1 -1
- package/dist/{run-record-BPCa2rQ8.d.ts → run-record-DwHMk1Ai.d.ts} +2 -2
- package/dist/{run-record-BPCa2rQ8.d.ts.map → run-record-DwHMk1Ai.d.ts.map} +1 -1
- package/dist/{semantic-concept-judge-Bz64IckK.js → semantic-concept-judge-DYXDPZW0.js} +11 -5
- package/dist/semantic-concept-judge-DYXDPZW0.js.map +1 -0
- package/dist/{server-KjXZZUDX.js → server-DLEvyW2z.js} +3 -3
- package/dist/{server-KjXZZUDX.js.map → server-DLEvyW2z.js.map} +1 -1
- package/dist/single-run-lock-D_bS5xhj.js +318 -0
- package/dist/single-run-lock-D_bS5xhj.js.map +1 -0
- package/dist/{skill-usage-CFDLLlhF.d.ts → skill-usage-Bv3G4VkA.d.ts} +18 -8
- package/dist/skill-usage-Bv3G4VkA.d.ts.map +1 -0
- package/dist/{skillopt-optimization-method-f4o9sUT4.js → skillopt-optimization-method-CjKMZy0d.js} +7 -182
- package/dist/skillopt-optimization-method-CjKMZy0d.js.map +1 -0
- package/dist/{skillopt-optimization-method-BpbnlvAZ.d.ts → skillopt-optimization-method-CzfnA8O-.d.ts} +10 -10
- package/dist/{skillopt-optimization-method-BpbnlvAZ.d.ts.map → skillopt-optimization-method-CzfnA8O-.d.ts.map} +1 -1
- package/dist/{statistics-_7P642CN.d.ts → statistics-mf70aXKp.d.ts} +2 -2
- package/dist/{statistics-_7P642CN.d.ts.map → statistics-mf70aXKp.d.ts.map} +1 -1
- package/dist/{tools-DZk2Jn64.js → store-otlp-BenKynPE.js} +4 -192
- package/dist/store-otlp-BenKynPE.js.map +1 -0
- package/dist/{summary-report-DHipz9Kx.d.ts → summary-report-BKinV4yD.d.ts} +3 -3
- package/dist/{summary-report-DHipz9Kx.d.ts.map → summary-report-BKinV4yD.d.ts.map} +1 -1
- package/dist/tools-DZGdROtG.js +255 -0
- package/dist/tools-DZGdROtG.js.map +1 -0
- package/dist/traces.d.ts +5 -5
- package/dist/traces.js +4 -3
- package/dist/{types-CTvKfr5F.d.ts → types-5q2T25iW.d.ts} +2 -2
- package/dist/{types-CTvKfr5F.d.ts.map → types-5q2T25iW.d.ts.map} +1 -1
- package/dist/{types-CKswbJGO.d.ts → types-BtJhn8v6.d.ts} +4 -4
- package/dist/{types-CKswbJGO.d.ts.map → types-BtJhn8v6.d.ts.map} +1 -1
- package/dist/{types-CTGbIm57.d.ts → types-zFYez3PK.d.ts} +5 -5
- package/dist/{types-CTGbIm57.d.ts.map → types-zFYez3PK.d.ts.map} +1 -1
- package/dist/wire/index.d.ts +3 -3
- package/dist/wire/index.js +1 -1
- package/docs/trace-analysis.md +123 -3
- package/package.json +5 -3
- package/dist/benchmark-CHX4orG7.d.ts.map +0 -1
- package/dist/benchmark-YDrpumqB.js.map +0 -1
- package/dist/campaign-lgObcHFC.js.map +0 -1
- package/dist/concurrency-MUjT7VjM.js +0 -109
- package/dist/concurrency-MUjT7VjM.js.map +0 -1
- package/dist/cost-ledger-D-5_-dhi.js.map +0 -1
- package/dist/default-registry-CLXbRt0f.js.map +0 -1
- package/dist/default-registry-Dc5D_Loc.d.ts.map +0 -1
- package/dist/feedback-trajectory-N_F0PwHz.d.ts.map +0 -1
- package/dist/index-C-Pr4OWg.d.ts.map +0 -1
- package/dist/ledger-core-t6sItivm.js.map +0 -1
- package/dist/llm-client-DKB25jV8.js.map +0 -1
- package/dist/proposal-findings-DCawte-y.js.map +0 -1
- package/dist/registry-BdM7SuTr.d.ts.map +0 -1
- package/dist/replay-Bju0T8Ls.js.map +0 -1
- package/dist/semantic-concept-judge-Bz64IckK.js.map +0 -1
- package/dist/skill-usage-CFDLLlhF.d.ts.map +0 -1
- package/dist/skillopt-optimization-method-f4o9sUT4.js.map +0 -1
- package/dist/tools-DZk2Jn64.js.map +0 -1
package/dist/analyst/index.d.ts
CHANGED
|
@@ -1,11 +1,12 @@
|
|
|
1
1
|
import { a as MultiLayerVerifier, l as VerifyOptions, o as Severity } from "../multi-layer-verifier-BHY1gWAc.js";
|
|
2
|
-
import { A as parseFindingSubject, B as SemanticConceptJudgeInput, C as FINDING_SUBJECT_KINDS, D as FindingSubjectStringSchema, E as FindingSubjectKind, G as RunCritic, M as CreateAnalystAiConfig, N as createAnalystAi, O as KIND_EXPECTED_SUBJECTS, S as FINDING_SUBJECT_GRAMMAR_PROMPT, T as FindingSubject, V as SemanticConceptJudgeOptions, _ as FindingsDiff, a as SkillUsageScanConfig, b as defaultIsMaterial, c as DEFAULT_TRACE_ANALYST_KINDS, d as IMPROVEMENT_KIND_SPEC, f as FAILURE_MODE_KIND_SPEC, g as DiffPolicy, h as emitControlIntegrityFindings, i as SkillUsageReport, j as renderFindingSubject, k as findingSubjectGrammarPromptFor, l as KNOWLEDGE_POISONING_KIND_SPEC, m as ControlIntegrityAnalyst, n as SkillUsageAnalyst, o as buildSkillUsageReport, p as CONTROL_INTEGRITY_ANALYST, q as RunTrace, r as SkillUsageRecord, s as emitSkillUsageFindings, t as SKILL_USAGE_ANALYST, u as KNOWLEDGE_GAP_KIND_SPEC, v as FindingsStore, w as FINDING_SUBJECT_SYNTAX, x as diffFindings, y as PersistedFinding } from "../skill-usage-
|
|
3
|
-
import { c as CostLedgerHandle } from "../cost-ledger-
|
|
4
|
-
import { A as ChatClient, B as SandboxSdkTransportOpts, F as CreateChatClientOpts, I as CustomTransportOpts, L as DirectProviderTransportOpts, M as ChatResponse, N as ChatTransport, P as CliBridgeTransportOpts, R as MockTransportOpts, V as createChatClient, j as ChatRequest, k as ChatCallOpts, m as JudgeInput, p as JudgeFn, q as LlmClientOptions, z as RouterTransportOpts } from "../types-
|
|
5
|
-
import { _ as makeFinding, a as AnalystInputKind, c as AnalystRunInputs, d as AnalystSeverity, f as AnalystUsageReceipt, g as computeFindingId, h as ProposalFindingOrigin, i as AnalystFinding, l as AnalystRunResult, m as ProposalFinding, n as AnalystContext, o as AnalystRequirements, p as EvidenceRef, r as AnalystCost, s as AnalystRunEvent, t as Analyst, u as AnalystRunSummary, v as makeProposalFinding, x as TraceAnalysisStore } from "../types-
|
|
6
|
-
import { _ as behavioralAnalyst, a as createTraceAnalystKind, c as ANALYST_SEVERITIES, d as RawAnalystEvidenceSchema, f as RawAnalystFinding, g as BehavioralAnalystOptions, h as parseRawFinding, i as TraceAnalystKindSpec, l as RAW_FINDING_SCHEMA_PROMPT, m as evidenceRefsFromRawFinding, n as buildDefaultAnalystRegistry, o as renderPriorFindings, p as RawAnalystFindingSchema, r as CreateTraceAnalystKindOpts, s as renderUpstreamFindings, t as DefaultAnalystRegistryOptions, u as RawAnalystEvidence, v as deriveEfficiencyFindings } from "../default-registry-
|
|
7
|
-
import { a as
|
|
8
|
-
import {
|
|
2
|
+
import { A as parseFindingSubject, B as SemanticConceptJudgeInput, C as FINDING_SUBJECT_KINDS, D as FindingSubjectStringSchema, E as FindingSubjectKind, G as RunCritic, M as CreateAnalystAiConfig, N as createAnalystAi, O as KIND_EXPECTED_SUBJECTS, S as FINDING_SUBJECT_GRAMMAR_PROMPT, T as FindingSubject, V as SemanticConceptJudgeOptions, _ as FindingsDiff, a as SkillUsageScanConfig, b as defaultIsMaterial, c as DEFAULT_TRACE_ANALYST_KINDS, d as IMPROVEMENT_KIND_SPEC, f as FAILURE_MODE_KIND_SPEC, g as DiffPolicy, h as emitControlIntegrityFindings, i as SkillUsageReport, j as renderFindingSubject, k as findingSubjectGrammarPromptFor, l as KNOWLEDGE_POISONING_KIND_SPEC, m as ControlIntegrityAnalyst, n as SkillUsageAnalyst, o as buildSkillUsageReport, p as CONTROL_INTEGRITY_ANALYST, q as RunTrace, r as SkillUsageRecord, s as emitSkillUsageFindings, t as SKILL_USAGE_ANALYST, u as KNOWLEDGE_GAP_KIND_SPEC, v as FindingsStore, w as FINDING_SUBJECT_SYNTAX, x as diffFindings, y as PersistedFinding } from "../skill-usage-Bv3G4VkA.js";
|
|
3
|
+
import { c as CostLedgerHandle } from "../cost-ledger-B1D3COAc.js";
|
|
4
|
+
import { A as ChatClient, B as SandboxSdkTransportOpts, F as CreateChatClientOpts, I as CustomTransportOpts, L as DirectProviderTransportOpts, M as ChatResponse, N as ChatTransport, P as CliBridgeTransportOpts, R as MockTransportOpts, V as createChatClient, j as ChatRequest, k as ChatCallOpts, m as JudgeInput, p as JudgeFn, q as LlmClientOptions, z as RouterTransportOpts } from "../types-5q2T25iW.js";
|
|
5
|
+
import { _ as makeFinding, a as AnalystInputKind, c as AnalystRunInputs, d as AnalystSeverity, f as AnalystUsageReceipt, g as computeFindingId, h as ProposalFindingOrigin, i as AnalystFinding, l as AnalystRunResult, m as ProposalFinding, n as AnalystContext, o as AnalystRequirements, p as EvidenceRef, r as AnalystCost, s as AnalystRunEvent, t as Analyst, u as AnalystRunSummary, v as makeProposalFinding, x as TraceAnalysisStore } from "../types-BtJhn8v6.js";
|
|
6
|
+
import { _ as behavioralAnalyst, a as createTraceAnalystKind, c as ANALYST_SEVERITIES, d as RawAnalystEvidenceSchema, f as RawAnalystFinding, g as BehavioralAnalystOptions, h as parseRawFinding, i as TraceAnalystKindSpec, l as RAW_FINDING_SCHEMA_PROMPT, m as evidenceRefsFromRawFinding, n as buildDefaultAnalystRegistry, o as renderPriorFindings, p as RawAnalystFindingSchema, r as CreateTraceAnalystKindOpts, s as renderUpstreamFindings, t as DefaultAnalystRegistryOptions, u as RawAnalystEvidence, v as deriveEfficiencyFindings } from "../default-registry-PUhIVRWz.js";
|
|
7
|
+
import { a as ExactAnalystRunPolicySnapshot, c as ExactAnalystSnapshot, d as ExactExecutionComponentSnapshot, i as ExactAnalystRunEvent, l as ExactCapableAnalyst, n as ExactAnalystExecutionPlanSnapshot, o as ExactAnalystRunResult, r as ExactAnalystRunCompletion, s as ExactAnalystRunSummary, t as ExactAnalystBudgetSnapshot, u as ExactExecutionComponentIdentity } from "../exact-types-Dpw2LeHA.js";
|
|
8
|
+
import { a as ExactAnalystBudgetPolicy, c as RegistryRunOpts, i as BudgetPolicy, l as assertExactRegistryRunOpts, n as AnalystRegistry, o as ExactAnalystRunExecutionError, r as AnalystRegistryOptions, s as ExactRegistryRunOpts, t as AnalystHooks } from "../registry-C4yJTza7.js";
|
|
9
|
+
import { C as scoreAnalystFindings, S as traceStoreEvidenceResolver, _ as AnalystIssueExpectation, a as AnalystBenchmarkLabelState, b as registryBenchmarkRunner, c as AnalystBenchmarkProvenance, d as AnalystBenchmarkSummary, f as AnalystEvidenceExpectation, g as AnalystFindingScore, h as AnalystEvidenceResolver, i as AnalystBenchmarkError, l as AnalystBenchmarkResult, m as AnalystEvidenceResolutionError, n as AnalystBenchmarkDatasetRef, o as AnalystBenchmarkObservation, p as AnalystEvidenceResolution, r as AnalystBenchmarkDescriptor, s as AnalystBenchmarkOutput, t as AnalystBenchmarkCase, u as AnalystBenchmarkRunner, v as AnalystLatencyDistribution, x as runAnalystBenchmark, y as RunAnalystBenchmarkOptions } from "../benchmark-DlQgU_XI.js";
|
|
9
10
|
import { AxFunction } from "@ax-llm/ax";
|
|
10
11
|
//#region src/analyst/adapters.d.ts
|
|
11
12
|
declare function liftSeverity(s: Severity): AnalystSeverity;
|
|
@@ -50,36 +51,40 @@ interface SemanticConceptJudgeAdapterOpts {
|
|
|
50
51
|
}
|
|
51
52
|
declare function createSemanticConceptJudgeAdapter(opts?: SemanticConceptJudgeAdapterOpts): Analyst<SemanticConceptJudgeInput>;
|
|
52
53
|
//#endregion
|
|
53
|
-
//#region src/analyst/benchmark-
|
|
54
|
-
|
|
55
|
-
interface
|
|
56
|
-
|
|
57
|
-
|
|
58
|
-
|
|
59
|
-
|
|
60
|
-
|
|
61
|
-
|
|
62
|
-
|
|
63
|
-
|
|
64
|
-
|
|
65
|
-
|
|
66
|
-
|
|
67
|
-
|
|
54
|
+
//#region src/analyst/benchmark-agentrx-calibration.d.ts
|
|
55
|
+
declare const AGENT_RX_UPSTREAM_REVISION = "f228165bfec60a801fd5fedd9d8ffe0f9de0c69d";
|
|
56
|
+
interface AgentRxCalibrationRunnerSummary {
|
|
57
|
+
runnerId: string;
|
|
58
|
+
selectedRuns: number;
|
|
59
|
+
completedRuns: number;
|
|
60
|
+
failedRuns: number;
|
|
61
|
+
predictedRuns: number;
|
|
62
|
+
missingPredictionRuns: number;
|
|
63
|
+
exactStepAccuracy: number | null;
|
|
64
|
+
stepAccuracyWithin1: number | null;
|
|
65
|
+
stepAccuracyWithin2: number | null;
|
|
66
|
+
stepAccuracyWithin3: number | null;
|
|
67
|
+
stepAccuracyWithin4: number | null;
|
|
68
|
+
stepAccuracyWithin5: number | null;
|
|
69
|
+
meanStepDistance: number | null;
|
|
70
|
+
normalizedMeanStepDistance: number | null;
|
|
71
|
+
normalizedDistanceRuns: number;
|
|
72
|
+
normalizedDistanceUnknownRuns: number;
|
|
73
|
+
rootCauseCategoryAccuracy: number | null;
|
|
74
|
+
anyFailureCategoryAccuracy: number | null;
|
|
75
|
+
earliestFailureCategoryAccuracy: number | null;
|
|
76
|
+
terminalFailureCategoryAccuracy: number | null;
|
|
68
77
|
}
|
|
69
|
-
interface
|
|
70
|
-
|
|
71
|
-
|
|
72
|
-
|
|
78
|
+
interface AgentRxCalibrationSummary {
|
|
79
|
+
protocol: 'official-agentrx-root-cause';
|
|
80
|
+
upstreamRevision: string;
|
|
81
|
+
rationale: string;
|
|
82
|
+
runners: AgentRxCalibrationRunnerSummary[];
|
|
73
83
|
}
|
|
74
|
-
declare function
|
|
75
|
-
|
|
76
|
-
candidateRunnerId: string;
|
|
77
|
-
confidence?: number;
|
|
78
|
-
resamples?: number;
|
|
79
|
-
seed?: number;
|
|
80
|
-
}): AnalystRunnerComparison;
|
|
84
|
+
declare function summarizeAgentRxCalibration(result: AnalystBenchmarkResult, upstreamRevision: string): AgentRxCalibrationSummary;
|
|
85
|
+
declare function renderAgentRxCalibrationMarkdown(summary: AgentRxCalibrationSummary): string;
|
|
81
86
|
//#endregion
|
|
82
|
-
//#region src/analyst/benchmark-
|
|
87
|
+
//#region src/analyst/benchmark-dataset-types.d.ts
|
|
83
88
|
type ExternalId = string | number;
|
|
84
89
|
interface AgentRxFailure {
|
|
85
90
|
failure_id: ExternalId;
|
|
@@ -123,11 +128,31 @@ interface CodeTraceStageAnnotation {
|
|
|
123
128
|
unuseful_step_ids?: readonly number[];
|
|
124
129
|
reasoning?: string;
|
|
125
130
|
}
|
|
131
|
+
interface CodeTracerStepLabel {
|
|
132
|
+
step_id: number;
|
|
133
|
+
stage?: string | number;
|
|
134
|
+
stage_name?: string | number;
|
|
135
|
+
stage_id?: string | number;
|
|
136
|
+
label: 'incorrect' | 'unuseful';
|
|
137
|
+
rationale?: string;
|
|
138
|
+
reason?: string;
|
|
139
|
+
note?: string;
|
|
140
|
+
comment?: string;
|
|
141
|
+
}
|
|
142
|
+
interface CodeTracerLabelGroup {
|
|
143
|
+
stage?: string | number;
|
|
144
|
+
stage_name?: string | number;
|
|
145
|
+
stage_id?: string | number;
|
|
146
|
+
labels: readonly CodeTracerStepLabel[];
|
|
147
|
+
}
|
|
148
|
+
type CodeTracerPredictions = string | readonly CodeTraceStageAnnotation[] | readonly CodeTracerStepLabel[] | readonly CodeTracerLabelGroup[];
|
|
126
149
|
interface CodeTraceBenchRow {
|
|
127
150
|
traj_id: string;
|
|
128
151
|
agent: string;
|
|
129
152
|
model: string;
|
|
130
153
|
task_name: string;
|
|
154
|
+
/** Native artifact extraction path in the public CodeTraceBench manifest. */
|
|
155
|
+
source_relpath?: string;
|
|
131
156
|
difficulty?: string;
|
|
132
157
|
category?: string;
|
|
133
158
|
tags?: string | readonly string[];
|
|
@@ -160,14 +185,416 @@ interface UpstreamPredictionAdapterOptions extends StepLabelAdapterOptions {
|
|
|
160
185
|
stepCount?: number;
|
|
161
186
|
}
|
|
162
187
|
interface CodeTracerPredictionAdapterOptions extends UpstreamPredictionAdapterOptions, CodeTraceBenchLabelOptions {}
|
|
188
|
+
//#endregion
|
|
189
|
+
//#region src/analyst/benchmark-dataset-agentrx.d.ts
|
|
163
190
|
declare function agentRxBenchmarkCase<TInput>(row: AgentRxRow, input: TInput, options?: AgentRxBenchmarkCaseOptions): AnalystBenchmarkCase<TInput>;
|
|
164
|
-
declare function codeTraceBenchCase<TInput>(row: CodeTraceBenchRow, input: TInput, options?: CodeTraceBenchCaseOptions): AnalystBenchmarkCase<TInput>;
|
|
165
191
|
/** Translate AgentRx `Report.to_dict()` output or its `failures` array into findings. */
|
|
166
192
|
declare function agentRxPredictionsToFindings(trajectoryIdValue: ExternalId, output: unknown, options?: UpstreamPredictionAdapterOptions): AnalystFinding[];
|
|
193
|
+
declare function normalizeAgentRxCategory(value: string): string;
|
|
194
|
+
/** Match Python's round() behavior used by AgentRx for consensus steps. */
|
|
195
|
+
declare function roundAgentRxStep(value: number): number;
|
|
196
|
+
//#endregion
|
|
197
|
+
//#region src/analyst/benchmark-dataset-codetrace.d.ts
|
|
198
|
+
declare function codeTraceBenchCase<TInput>(row: CodeTraceBenchRow, input: TInput, options?: CodeTraceBenchCaseOptions): AnalystBenchmarkCase<TInput>;
|
|
167
199
|
/** Translate CodeTracer's `codetracer_labels.json` into shared findings. */
|
|
168
|
-
declare function codeTracerPredictionsToFindings(trajectoryIdValue: string, predictions:
|
|
200
|
+
declare function codeTracerPredictionsToFindings(trajectoryIdValue: string, predictions: CodeTracerPredictions, options?: CodeTracerPredictionAdapterOptions): AnalystFinding[];
|
|
201
|
+
//#endregion
|
|
202
|
+
//#region src/analyst/benchmark-dataset-utils.d.ts
|
|
169
203
|
declare function normalizeBenchmarkLabel(value: string): string;
|
|
170
|
-
|
|
204
|
+
//#endregion
|
|
205
|
+
//#region src/analyst/benchmark-verification-outcome.d.ts
|
|
206
|
+
type VerificationOutcomeStatus = 'passed' | 'failed' | 'unavailable';
|
|
207
|
+
interface VerificationOutcomeSource {
|
|
208
|
+
path: string;
|
|
209
|
+
format: 'terminal-bench' | 'swe-bench' | 'swe-multi';
|
|
210
|
+
status: VerificationOutcomeStatus;
|
|
211
|
+
}
|
|
212
|
+
interface VerificationOutcome {
|
|
213
|
+
status: VerificationOutcomeStatus;
|
|
214
|
+
reason?: 'missing-result' | 'result-output-unavailable' | 'result-parse-error' | 'result-label-disagreement';
|
|
215
|
+
parseError?: {
|
|
216
|
+
class: string;
|
|
217
|
+
message: string;
|
|
218
|
+
};
|
|
219
|
+
sources: VerificationOutcomeSource[];
|
|
220
|
+
passedCheckCount: number;
|
|
221
|
+
failedCheckCount: number;
|
|
222
|
+
passedChecks: string[];
|
|
223
|
+
failedChecks: string[];
|
|
224
|
+
}
|
|
225
|
+
interface VerificationResultFile {
|
|
226
|
+
relativePath: string;
|
|
227
|
+
content: string;
|
|
228
|
+
}
|
|
229
|
+
declare function parseVerificationOutcome(files: readonly VerificationResultFile[]): VerificationOutcome;
|
|
230
|
+
//#endregion
|
|
231
|
+
//#region src/analyst/benchmark-verification-artifacts.d.ts
|
|
232
|
+
declare const DEFAULT_MAX_VERIFICATION_ARTIFACT_BYTES: number;
|
|
233
|
+
type VerificationArtifactRole = 'final-test-output' | 'final-result' | 'final-metrics';
|
|
234
|
+
interface VerificationArtifactFile {
|
|
235
|
+
role: VerificationArtifactRole;
|
|
236
|
+
path: string;
|
|
237
|
+
relativePath: string;
|
|
238
|
+
sha256: string;
|
|
239
|
+
bytes: number;
|
|
240
|
+
spanId: string;
|
|
241
|
+
}
|
|
242
|
+
interface VerificationArtifactManifest {
|
|
243
|
+
traceId: string;
|
|
244
|
+
status: 'present' | 'missing';
|
|
245
|
+
outcome: VerificationOutcome;
|
|
246
|
+
outcomeSpanId: string;
|
|
247
|
+
caseDirectory: string;
|
|
248
|
+
caseDirectoriesSearched: string[];
|
|
249
|
+
totalBytes: number;
|
|
250
|
+
maxBytes: number;
|
|
251
|
+
files: VerificationArtifactFile[];
|
|
252
|
+
missingRoles: VerificationArtifactRole[];
|
|
253
|
+
searched: Record<VerificationArtifactRole, string[]>;
|
|
254
|
+
}
|
|
255
|
+
interface LoadedVerificationArtifacts {
|
|
256
|
+
manifest: VerificationArtifactManifest;
|
|
257
|
+
outcome: VerificationOutcome;
|
|
258
|
+
files: Array<VerificationArtifactFile & {
|
|
259
|
+
content: string;
|
|
260
|
+
}>;
|
|
261
|
+
}
|
|
262
|
+
declare function loadCodeTraceVerificationArtifacts(options: {
|
|
263
|
+
artifactDir: string;
|
|
264
|
+
row: CodeTraceBenchRow;
|
|
265
|
+
maxBytes?: number;
|
|
266
|
+
}): Promise<LoadedVerificationArtifacts>;
|
|
267
|
+
declare function appendVerificationArtifactsToOtlp(otlpText: string, traceId: string, artifacts: LoadedVerificationArtifacts, afterTimestamp: string): string;
|
|
268
|
+
//#endregion
|
|
269
|
+
//#region src/analyst/benchmark-public-types.d.ts
|
|
270
|
+
type PublicAnalystBenchmarkDataset = 'agentrx' | 'codetracebench';
|
|
271
|
+
interface PublicAnalystBenchmarkModelConfig {
|
|
272
|
+
baseUrl: string;
|
|
273
|
+
apiKey: string;
|
|
274
|
+
model: string;
|
|
275
|
+
maxOutputTokens: number;
|
|
276
|
+
timeoutMs: number;
|
|
277
|
+
costLedger?: CostLedgerHandle;
|
|
278
|
+
durability?: {
|
|
279
|
+
runIdentitySha256: string;
|
|
280
|
+
responseCacheDir: string;
|
|
281
|
+
};
|
|
282
|
+
/** Test-only transport injection. */
|
|
283
|
+
fetchImpl?: typeof fetch;
|
|
284
|
+
}
|
|
285
|
+
interface PreparedPublicAnalystBenchmark {
|
|
286
|
+
cases: AnalystBenchmarkCase<AnalystRunInputs>[];
|
|
287
|
+
sourceRowCount: number;
|
|
288
|
+
selectedCaseIds: string[];
|
|
289
|
+
labelsSha256: string;
|
|
290
|
+
traceFiles: Array<{
|
|
291
|
+
traceId: string;
|
|
292
|
+
relativePath: string;
|
|
293
|
+
sha256: string;
|
|
294
|
+
}>;
|
|
295
|
+
verificationArtifacts: VerificationArtifactManifest[];
|
|
296
|
+
selection: PublicBenchmarkSelectionReport;
|
|
297
|
+
}
|
|
298
|
+
interface PublicBenchmarkValueDistribution {
|
|
299
|
+
total: number;
|
|
300
|
+
missing: number;
|
|
301
|
+
counts: Record<string, number>;
|
|
302
|
+
}
|
|
303
|
+
interface PublicBenchmarkDistributions {
|
|
304
|
+
class: PublicBenchmarkValueDistribution;
|
|
305
|
+
agent: PublicBenchmarkValueDistribution;
|
|
306
|
+
model: PublicBenchmarkValueDistribution;
|
|
307
|
+
difficulty: PublicBenchmarkValueDistribution;
|
|
308
|
+
solved: PublicBenchmarkValueDistribution;
|
|
309
|
+
}
|
|
310
|
+
interface PublicBenchmarkSelectionReport {
|
|
311
|
+
method: 'census' | 'deterministic-hash';
|
|
312
|
+
seed: number;
|
|
313
|
+
sourceCount: number;
|
|
314
|
+
selectedCount: number;
|
|
315
|
+
stratified: false;
|
|
316
|
+
representativeOfInput: boolean;
|
|
317
|
+
source: PublicBenchmarkDistributions;
|
|
318
|
+
selected: PublicBenchmarkDistributions;
|
|
319
|
+
}
|
|
320
|
+
//#endregion
|
|
321
|
+
//#region src/analyst/benchmark-public-adapters.d.ts
|
|
322
|
+
declare function emptyPublicBenchmarkRunner(): AnalystBenchmarkRunner<AnalystRunInputs>;
|
|
323
|
+
declare function adaptPublicBenchmarkFindings(dataset: PublicAnalystBenchmarkDataset, trajectoryId: string, findings: readonly AnalystFinding[], analystId: string): AnalystFinding[];
|
|
324
|
+
//#endregion
|
|
325
|
+
//#region src/analyst/benchmark-public-data.d.ts
|
|
326
|
+
declare function loadPublicBenchmarkRows(path: string): Promise<Array<Record<string, unknown>>>;
|
|
327
|
+
declare function selectPublicBenchmarkRows(dataset: PublicAnalystBenchmarkDataset, rows: readonly Record<string, unknown>[], options: {
|
|
328
|
+
limit: number;
|
|
329
|
+
seed: number;
|
|
330
|
+
}): Array<Record<string, unknown>>;
|
|
331
|
+
declare function publicBenchmarkDistributions(dataset: PublicAnalystBenchmarkDataset, rows: readonly Record<string, unknown>[]): PublicBenchmarkDistributions;
|
|
332
|
+
declare function publicBenchmarkSelectionReport(dataset: PublicAnalystBenchmarkDataset, source: readonly Record<string, unknown>[], selected: readonly Record<string, unknown>[], seed: number): PublicBenchmarkSelectionReport;
|
|
333
|
+
declare function preparePublicAnalystBenchmark(options: {
|
|
334
|
+
dataset: PublicAnalystBenchmarkDataset;
|
|
335
|
+
labelsPath: string;
|
|
336
|
+
traceDir: string;
|
|
337
|
+
artifactDir?: string;
|
|
338
|
+
maxArtifactBytes?: number;
|
|
339
|
+
limit: number;
|
|
340
|
+
seed: number;
|
|
341
|
+
}): Promise<PreparedPublicAnalystBenchmark>;
|
|
342
|
+
//#endregion
|
|
343
|
+
//#region src/analyst/benchmark-public-model.d.ts
|
|
344
|
+
declare function createPublicBenchmarkModelRunner(dataset: PublicAnalystBenchmarkDataset, config: PublicAnalystBenchmarkModelConfig): AnalystBenchmarkRunner<AnalystRunInputs>;
|
|
345
|
+
declare function publicBenchmarkProtocolSha256(dataset: PublicAnalystBenchmarkDataset): string;
|
|
346
|
+
declare const CODE_TRACE_BENCH_ANALYST_PROMPT = "Analyze exactly one coding-agent trajectory and its attached final verification.\nYour task is the CodeTraceBench incorrect-step task: identify every wrong state-changing action, bad hypothesis that drives an action, and regression.\nAn incorrect step remains incorrect when the agent later recovers or the final verification passes.\nInspect the complete supplied trace data.\nUse the final-verification outcome as evidence about the final state, not as a rule for whether earlier steps were incorrect.\nFor each candidate, inspect the assistant action and its following observation.\nLabel a failed command when the assistant caused it through a wrong action or unsupported hypothesis.\nLabel the later corrective action only when that action is itself wrong.\nDo not label a diagnostic probe merely because it exposes an earlier defect.\nDo not label a redundant but correct read or search; CodeTraceBench scores unuseful steps separately, and this run scores incorrect steps only.\nDo not label a step solely because final verification failed.\nWhen final verification is unavailable, use only directly observed trajectory evidence.\nEmit one finding per incorrect assistant step.\nEach finding's step MUST be the positive integer n from an existing assistant LLM span named step-<n>.\nNever select an EVALUATOR, TOOL, CHAIN, final-verification, benchmark-verification, or message-<n> span.\nBefore emitting a finding, inspect its candidate span's attributes.content and describe only the action shown there.\nWhen the trajectory has no incorrect steps, return an empty findings array.";
|
|
347
|
+
//#endregion
|
|
348
|
+
//#region src/analyst/benchmark-comparison.d.ts
|
|
349
|
+
type AnalystComparisonMetric = 'completion' | 'issueRecall' | 'findingPrecision' | 'f1' | 'criticalStepAccuracy' | 'citationCoverage' | 'citationExcerptCoverage' | 'citationLabelAgreement' | 'citationResolution' | 'trustedNegativeAccuracy' | 'latencyMs' | 'calls' | 'inputTokens' | 'outputTokens' | 'reasoningTokens' | 'cachedTokens' | 'cacheWriteTokens' | 'costUsd';
|
|
350
|
+
interface AnalystMetricComparison {
|
|
351
|
+
metric: AnalystComparisonMetric;
|
|
352
|
+
direction: 'higher' | 'lower';
|
|
353
|
+
/** Trajectories with at least one complete pair for this metric. */
|
|
354
|
+
pairedCases: number;
|
|
355
|
+
/** Independent task or incident groups resampled by the interval. */
|
|
356
|
+
pairedClusters: number;
|
|
357
|
+
/** Same-run pairs where this metric applies before missing values are removed. */
|
|
358
|
+
eligibleObservations: number;
|
|
359
|
+
pairedObservations: number;
|
|
360
|
+
baselineMissingObservations: number;
|
|
361
|
+
candidateMissingObservations: number;
|
|
362
|
+
asymmetricMissingObservations: number;
|
|
363
|
+
survivorOnly: boolean;
|
|
364
|
+
baselineMean: number | null;
|
|
365
|
+
candidateMean: number | null;
|
|
366
|
+
meanDelta: number | null;
|
|
367
|
+
intervalLow: number | null;
|
|
368
|
+
intervalHigh: number | null;
|
|
369
|
+
confidence: number;
|
|
370
|
+
resamples: number;
|
|
371
|
+
minimumSampleMet: boolean;
|
|
372
|
+
populationInferenceEligible: boolean;
|
|
373
|
+
inferenceLimitations: string[];
|
|
374
|
+
}
|
|
375
|
+
interface AnalystRunnerComparison {
|
|
376
|
+
baselineRunnerId: string;
|
|
377
|
+
candidateRunnerId: string;
|
|
378
|
+
metrics: AnalystMetricComparison[];
|
|
379
|
+
}
|
|
380
|
+
declare function compareAnalystRunners(result: AnalystBenchmarkResult, options: {
|
|
381
|
+
baselineRunnerId: string;
|
|
382
|
+
candidateRunnerId: string;
|
|
383
|
+
confidence?: number;
|
|
384
|
+
resamples?: number;
|
|
385
|
+
seed?: number;
|
|
386
|
+
}): AnalystRunnerComparison;
|
|
387
|
+
//#endregion
|
|
388
|
+
//#region src/analyst/benchmark-public-calibration.d.ts
|
|
389
|
+
interface CodeTraceCalibrationRunnerSummary {
|
|
390
|
+
runnerId: string;
|
|
391
|
+
selectedRuns: number;
|
|
392
|
+
positiveRuns: number;
|
|
393
|
+
trustedNegativeRuns: number;
|
|
394
|
+
unlabeledRuns: number;
|
|
395
|
+
failedLabelEmptyRuns: number;
|
|
396
|
+
unknownLabelEmptyRuns: number;
|
|
397
|
+
completedRuns: number;
|
|
398
|
+
failedRuns: number;
|
|
399
|
+
expectedIncorrectSteps: number;
|
|
400
|
+
predictedIncorrectSteps: number;
|
|
401
|
+
matchedIncorrectSteps: number;
|
|
402
|
+
/** CodeTraceBench's published mean per-row incorrect-step F1 over every row. */
|
|
403
|
+
officialAllRowF1: number | null;
|
|
404
|
+
officialAllRowRuns: number;
|
|
405
|
+
precision: number | null;
|
|
406
|
+
recall: number | null;
|
|
407
|
+
f1: number | null;
|
|
408
|
+
trustedNegativeFalsePositiveRate: number | null;
|
|
409
|
+
trustedNegativeFailureRate: number | null;
|
|
410
|
+
unlabeledPredictionRate: number | null;
|
|
411
|
+
unlabeledFailureRate: number | null;
|
|
412
|
+
}
|
|
413
|
+
interface CodeTraceCalibrationSummary {
|
|
414
|
+
protocol: 'labeled-positive-and-solved-negative';
|
|
415
|
+
rationale: string;
|
|
416
|
+
runners: CodeTraceCalibrationRunnerSummary[];
|
|
417
|
+
}
|
|
418
|
+
declare function summarizeCodeTraceCalibration(result: AnalystBenchmarkResult): CodeTraceCalibrationSummary;
|
|
419
|
+
declare function renderCodeTraceCalibrationMarkdown(summary: CodeTraceCalibrationSummary): string;
|
|
420
|
+
//#endregion
|
|
421
|
+
//#region src/analyst/benchmark-command-artifact.d.ts
|
|
422
|
+
interface AnalystBenchmarkArtifact {
|
|
423
|
+
kind: 'agent-eval/analyst-benchmark-result';
|
|
424
|
+
runIdentitySha256: string;
|
|
425
|
+
inputs: {
|
|
426
|
+
dataset: PublicAnalystBenchmarkDataset;
|
|
427
|
+
datasetRevision: string;
|
|
428
|
+
datasetSplit: string;
|
|
429
|
+
labelsSha256: string;
|
|
430
|
+
sourceRowCount: number;
|
|
431
|
+
traceFiles: Array<{
|
|
432
|
+
traceId: string;
|
|
433
|
+
relativePath: string;
|
|
434
|
+
sha256: string;
|
|
435
|
+
}>;
|
|
436
|
+
verificationArtifacts: VerificationArtifactManifest[];
|
|
437
|
+
verificationAvailability: VerificationAvailabilitySummary;
|
|
438
|
+
selection: {
|
|
439
|
+
limit: number;
|
|
440
|
+
seed: number;
|
|
441
|
+
selectedCaseIds: string[];
|
|
442
|
+
report: PublicBenchmarkSelectionReport;
|
|
443
|
+
};
|
|
444
|
+
execution: {
|
|
445
|
+
repetitions: number;
|
|
446
|
+
concurrency: number;
|
|
447
|
+
model: string;
|
|
448
|
+
maxOutputTokens: number;
|
|
449
|
+
timeoutMs: number;
|
|
450
|
+
maxCostUsd: number;
|
|
451
|
+
maxArtifactBytes: number;
|
|
452
|
+
analystProtocolSha256: string;
|
|
453
|
+
implementationSha256: string;
|
|
454
|
+
dependencyLockSha256: string;
|
|
455
|
+
};
|
|
456
|
+
};
|
|
457
|
+
result: AnalystBenchmarkResult;
|
|
458
|
+
comparisons: AnalystRunnerComparison[];
|
|
459
|
+
codeTraceCalibration?: CodeTraceCalibrationSummary;
|
|
460
|
+
agentRxCalibration?: AgentRxCalibrationSummary;
|
|
461
|
+
}
|
|
462
|
+
interface VerificationAvailabilitySummary {
|
|
463
|
+
cases: number;
|
|
464
|
+
resultFilesPresent: number;
|
|
465
|
+
resultFilesMissing: number;
|
|
466
|
+
outcomes: {
|
|
467
|
+
passed: number;
|
|
468
|
+
failed: number;
|
|
469
|
+
unavailable: number;
|
|
470
|
+
};
|
|
471
|
+
}
|
|
472
|
+
interface AnalystBenchmarkRunIdentity {
|
|
473
|
+
config: {
|
|
474
|
+
dataset: PublicAnalystBenchmarkDataset;
|
|
475
|
+
datasetRevision: string;
|
|
476
|
+
datasetSplit: string;
|
|
477
|
+
model: {
|
|
478
|
+
id: string;
|
|
479
|
+
maxOutputTokens: number;
|
|
480
|
+
timeoutMs: number;
|
|
481
|
+
};
|
|
482
|
+
limit: number;
|
|
483
|
+
seed: number;
|
|
484
|
+
concurrency: number;
|
|
485
|
+
repetitions: number;
|
|
486
|
+
maxCostUsd: number;
|
|
487
|
+
maxArtifactBytes: number;
|
|
488
|
+
analystProtocolSha256: string;
|
|
489
|
+
implementationSha256: string;
|
|
490
|
+
dependencyLockSha256: string;
|
|
491
|
+
runnerIds: readonly ['empty', 'model'];
|
|
492
|
+
};
|
|
493
|
+
inputs: {
|
|
494
|
+
labelsSha256: string;
|
|
495
|
+
sourceRowCount: number;
|
|
496
|
+
selectedCaseIds: string[];
|
|
497
|
+
traceFiles: Array<{
|
|
498
|
+
traceId: string;
|
|
499
|
+
relativePath: string;
|
|
500
|
+
sha256: string;
|
|
501
|
+
}>;
|
|
502
|
+
verificationArtifactsSha256: string;
|
|
503
|
+
caseDefinitionsSha256: string;
|
|
504
|
+
};
|
|
505
|
+
}
|
|
506
|
+
interface AnalystBenchmarkRunManifest {
|
|
507
|
+
kind: 'agent-eval/analyst-benchmark-run';
|
|
508
|
+
createdAt: string;
|
|
509
|
+
identitySha256: string;
|
|
510
|
+
localIdentitySha256: string;
|
|
511
|
+
identity: AnalystBenchmarkRunIdentity;
|
|
512
|
+
}
|
|
513
|
+
interface AnalystBenchmarkLocalRunReceipt {
|
|
514
|
+
kind: 'agent-eval/analyst-benchmark-local-run';
|
|
515
|
+
runIdentitySha256: string;
|
|
516
|
+
localIdentitySha256: string;
|
|
517
|
+
local: {
|
|
518
|
+
labelsPath: string;
|
|
519
|
+
traceDir: string;
|
|
520
|
+
artifactDir?: string;
|
|
521
|
+
outputDir: string;
|
|
522
|
+
baseUrl: string;
|
|
523
|
+
apiKeyEnvironment: string;
|
|
524
|
+
};
|
|
525
|
+
command: string;
|
|
526
|
+
environment: {
|
|
527
|
+
node: string;
|
|
528
|
+
platform: string;
|
|
529
|
+
arch: string;
|
|
530
|
+
};
|
|
531
|
+
files: {
|
|
532
|
+
manifest: string;
|
|
533
|
+
observations: string;
|
|
534
|
+
costLedger: string;
|
|
535
|
+
modelResponses: string;
|
|
536
|
+
result: string;
|
|
537
|
+
report: string;
|
|
538
|
+
};
|
|
539
|
+
}
|
|
540
|
+
interface AnalystBenchmarkProgressRow {
|
|
541
|
+
sequence: number;
|
|
542
|
+
runIdentitySha256: string;
|
|
543
|
+
previousRowSha256: string | null;
|
|
544
|
+
observation: AnalystBenchmarkObservation;
|
|
545
|
+
rowSha256: string;
|
|
546
|
+
}
|
|
547
|
+
declare const ANALYST_BENCHMARK_MANIFEST_FILE = "manifest.json";
|
|
548
|
+
declare const ANALYST_BENCHMARK_OBSERVATIONS_FILE = "observations.jsonl";
|
|
549
|
+
declare const ANALYST_BENCHMARK_LOCAL_RECEIPT_FILE = "run.local.json";
|
|
550
|
+
declare const ANALYST_BENCHMARK_COST_LEDGER_FILE = "cost-ledger.jsonl";
|
|
551
|
+
//#endregion
|
|
552
|
+
//#region src/analyst/benchmark-command-result.d.ts
|
|
553
|
+
declare function readAnalystBenchmarkArtifact(path: string): Promise<AnalystBenchmarkArtifact>;
|
|
554
|
+
//#endregion
|
|
555
|
+
//#region src/analyst/benchmark-command.d.ts
|
|
556
|
+
interface AnalystBenchmarkCommandDependencies {
|
|
557
|
+
createModelRunner?: (dataset: PublicAnalystBenchmarkDataset, config: PublicAnalystBenchmarkModelConfig) => AnalystBenchmarkRunner<AnalystRunInputs>;
|
|
558
|
+
}
|
|
559
|
+
interface AnalystBenchmarkCommandConfig {
|
|
560
|
+
dataset: PublicAnalystBenchmarkDataset;
|
|
561
|
+
labelsPath: string;
|
|
562
|
+
traceDir: string;
|
|
563
|
+
artifactDir?: string;
|
|
564
|
+
outDir: string;
|
|
565
|
+
revision: string;
|
|
566
|
+
split: string;
|
|
567
|
+
model: PublicAnalystBenchmarkModelConfig;
|
|
568
|
+
limit: number;
|
|
569
|
+
seed: number;
|
|
570
|
+
concurrency: number;
|
|
571
|
+
repetitions: number;
|
|
572
|
+
maxCostUsd: number;
|
|
573
|
+
maxArtifactBytes: number;
|
|
574
|
+
apiKeyEnv: string;
|
|
575
|
+
command: string;
|
|
576
|
+
resume: boolean;
|
|
577
|
+
}
|
|
578
|
+
declare function runAnalystBenchmarkCommand(argv: readonly string[], env?: NodeJS.ProcessEnv, dependencies?: AnalystBenchmarkCommandDependencies): Promise<number>;
|
|
579
|
+
declare const ANALYST_BENCHMARK_HELP = "agent-eval analyst-benchmark\n\nRun a real-model trace analyst against public AgentRx or CodeTraceBench labels.\n\nRequired:\n --dataset agentrx|codetracebench\n --labels <dataset.json|dataset.jsonl>\n --trace-dir <one-trace-per-file OTLP JSONL directory>\n --artifact-dir <extracted artifact root> Required for CodeTraceBench\n --out <new output directory>\n --revision <full 40- or 64-character hex digest>\n --split <dataset split>\n --base-url <OpenAI-compatible /v1 URL>\n --api-key-env <environment variable containing the bearer>\n --model <provider model id>\n --limit <positive case count>\n\nControls:\n --resume Continue an interrupted run in --out\n --seed <integer> Case-selection and comparison seed. Default: 0\n --concurrency <positive integer> Parallel benchmark jobs. Default: 1\n --repetitions <positive integer> Runs per case and runner. Default: 1\n --max-output-tokens <positive> Model output limit per call. Default: 4096\n --timeout-ms <positive> Model analyst deadline per case. Default: 300000\n --max-cost-usd <positive> Run-wide spend limit. Default: 5\n --max-artifact-bytes <positive> Final evidence bytes per case. Default: 8388608\n\nWrites result.json with every observation, metric, usage field, error, comparison,\ninput digest, artifact digest, case distribution, selected case id, and explicit\nunknown cost. Limited deterministic-hash subsets are marked non-representative.\nCompleted observations are fsynced to observations.jsonl. Shareable output is in\nresult.json and report.md. Machine-local paths, endpoint, and command are isolated\nin run.local.json.\nThe key is read from the named environment variable and is never written.";
|
|
580
|
+
//#endregion
|
|
581
|
+
//#region src/analyst/benchmark-implementation.d.ts
|
|
582
|
+
declare const ANALYST_BENCHMARK_IMPLEMENTATION_DIGEST_ALGORITHM = "sha256-canonical-source-manifest";
|
|
583
|
+
declare const ANALYST_BENCHMARK_DEPENDENCY_LOCK_DIGEST_ALGORITHM = "sha256-canonical-file-manifest";
|
|
584
|
+
declare const ANALYST_BENCHMARK_DEPENDENCY_LOCK_FILES: readonly string[];
|
|
585
|
+
declare const ANALYST_BENCHMARK_DEPENDENCY_LOCK_SHA256 = "d06e3e3f171cc6bd5cf36b14325f507f34b1c6a9d5129ce8a85bf3c1681f8223";
|
|
586
|
+
/** The published benchmark evidence was produced at this package version.
|
|
587
|
+
* A release changes package.json's version field, which is part of the lock
|
|
588
|
+
* manifest but cannot change benchmark behavior, so the evidence stays bound
|
|
589
|
+
* to the digest at its creation. A test proves the current lock differs from
|
|
590
|
+
* the evidence lock by the version stamp alone; any real dependency change
|
|
591
|
+
* still forces a new benchmark run or explicit retirement of the evidence. */
|
|
592
|
+
declare const ANALYST_BENCHMARK_EVIDENCE_PACKAGE_VERSION = "0.137.0";
|
|
593
|
+
declare const ANALYST_BENCHMARK_EVIDENCE_DEPENDENCY_LOCK_SHA256 = "1e03f2daed356d60316aabefb407ec1e437ac94d408d61eea4ae096e9c6fbb5b";
|
|
594
|
+
declare const ANALYST_BENCHMARK_IMPLEMENTATION_FILES: readonly string[];
|
|
595
|
+
declare const ANALYST_BENCHMARK_IMPLEMENTATION_SHA256 = "4dba263b6256a30d56c7fdb2d992d3a953c0035d731f359b704db806f68f75ac";
|
|
596
|
+
declare function analystBenchmarkImplementationDigest(): string;
|
|
597
|
+
declare function analystBenchmarkDependencyLockDigest(): string;
|
|
171
598
|
//#endregion
|
|
172
599
|
//#region src/analyst/benchmark-report.d.ts
|
|
173
600
|
declare function renderAnalystBenchmarkMarkdown(result: AnalystBenchmarkResult, comparisons?: readonly AnalystRunnerComparison[]): string;
|
|
@@ -180,7 +607,12 @@ interface DefineTraceAnalystOptions {
|
|
|
180
607
|
cost: AnalystCost;
|
|
181
608
|
analyze: Analyst<TraceAnalysisStore>['analyze'];
|
|
182
609
|
}
|
|
610
|
+
interface DefineExactTraceAnalystOptions extends DefineTraceAnalystOptions {
|
|
611
|
+
/** Canonical JSON for behavior knobs not already bound by `version`. */
|
|
612
|
+
executionConfig: Readonly<Record<string, unknown>>;
|
|
613
|
+
}
|
|
183
614
|
/** Define a custom trace analyst without repeating fixed registry fields. */
|
|
615
|
+
declare function defineTraceAnalyst(options: DefineExactTraceAnalystOptions): ExactCapableAnalyst<TraceAnalysisStore>;
|
|
184
616
|
declare function defineTraceAnalyst(options: DefineTraceAnalystOptions): Analyst<TraceAnalysisStore>;
|
|
185
617
|
type TraceAnalystAnalyze = (store: TraceAnalysisStore, context: Parameters<Analyst<TraceAnalysisStore>['analyze']>[1]) => Promise<AnalystFinding[]>;
|
|
186
618
|
//#endregion
|
|
@@ -264,7 +696,9 @@ type TraceToolGroupName =
|
|
|
264
696
|
/** Discovery + search tools. For pattern-matching across many traces. */
|
|
265
697
|
'discoveryAndSearch' |
|
|
266
698
|
/** Discovery + viewSpans + searchSpan. Targeted-span work after another kind narrows down. */
|
|
267
|
-
'targeted'
|
|
699
|
+
'targeted' |
|
|
700
|
+
/** One known-small trace: overview, bounded reads, and in-trace search. */
|
|
701
|
+
'singleTrace';
|
|
268
702
|
/**
|
|
269
703
|
* Build the tool set for a named group bound to a specific trace store.
|
|
270
704
|
*
|
|
@@ -274,5 +708,5 @@ type TraceToolGroupName =
|
|
|
274
708
|
*/
|
|
275
709
|
declare function buildTraceToolsForGroup(group: TraceToolGroupName, store: TraceAnalysisStore): AxFunction[];
|
|
276
710
|
//#endregion
|
|
277
|
-
export { ANALYST_SEVERITIES, type AgentRxBenchmarkCaseOptions, type AgentRxFailure, type AgentRxPrediction, type AgentRxPredictionReport, type AgentRxRow, type Analyst, type AnalystBenchmarkCase, type AnalystBenchmarkDatasetRef, type AnalystBenchmarkDescriptor, type AnalystBenchmarkObservation, type AnalystBenchmarkOutput, type AnalystBenchmarkProvenance, type AnalystBenchmarkResult, type AnalystBenchmarkRunner, type AnalystBenchmarkSummary, type AnalystComparisonMetric, type AnalystContext, type AnalystCost, type AnalystEvidenceExpectation, type AnalystEvidenceResolution, type AnalystEvidenceResolutionError, type AnalystEvidenceResolver, type AnalystFinding, type AnalystFindingScore, type AnalystHooks, type AnalystInputKind, type AnalystIssueExpectation, type AnalystLatencyDistribution, type AnalystMetricComparison, AnalystRegistry, type AnalystRegistryOptions, type AnalystRequirements, type AnalystRunEvent, type AnalystRunInputs, type AnalystRunResult, type AnalystRunSummary, type AnalystRunnerComparison, type AnalystSeverity, type AnalystUsageReceipt, type BehavioralAnalystOptions, type BudgetPolicy, CONTROL_INTEGRITY_ANALYST, type ChatCallOpts, type ChatClient, type ChatRequest, type ChatResponse, type ChatTransport, type CliBridgeTransportOpts, type CodeTraceBenchCaseOptions, type CodeTraceBenchLabelOptions, type CodeTraceBenchLabelSet, type CodeTraceBenchRow, type CodeTraceStageAnnotation, type CodeTracerPredictionAdapterOptions, ControlIntegrityAnalyst, type CreateAnalystAiConfig, type CreateChatClientOpts, type CreateTraceAnalystKindOpts, type CustomTransportOpts, DEFAULT_TRACE_ANALYST_KINDS, type DefaultAnalystRegistryOptions, type DefineTraceAnalystOptions, type DiffPolicy, type DirectProviderTransportOpts, type EvidenceRef, FAILURE_MODE_KIND_SPEC, FINDING_SUBJECT_GRAMMAR_PROMPT, FINDING_SUBJECT_KINDS, FINDING_SUBJECT_SYNTAX, type FindingSubject, type FindingSubjectKind, FindingSubjectStringSchema, type FindingsDiff, FindingsStore, IMPROVEMENT_KIND_SPEC, type JudgeAdapterOpts, KIND_EXPECTED_SUBJECTS, KNOWLEDGE_GAP_KIND_SPEC, KNOWLEDGE_POISONING_KIND_SPEC, type MockTransportOpts, type PersistedFinding, type ProposalFinding, type ProposalFindingOrigin, RAW_FINDING_SCHEMA_PROMPT, type RawAnalystEvidence, RawAnalystEvidenceSchema, type RawAnalystFinding, RawAnalystFindingSchema, type RegistryRunOpts, type RouterTransportOpts, type RunAnalystBenchmarkOptions, type RunCriticAdapterOpts, SKILL_USAGE_ANALYST, type SandboxSdkTransportOpts, type SemanticConceptJudgeAdapterOpts, SkillUsageAnalyst, type SkillUsageRecord, type SkillUsageReport, type SkillUsageScanConfig, type StepLabelAdapterOptions, type StructureFindingsOptions, type StructureFindingsResult, type TraceAnalystAnalyze, type TraceAnalystKindSpec, type TraceToolGroupName, type UpstreamPredictionAdapterOptions, type VerifierAdapterOpts, agentRxBenchmarkCase, agentRxPredictionsToFindings, assertProposalFindings, behavioralAnalyst, buildDefaultAnalystRegistry, buildSkillUsageReport, buildTraceToolsForGroup, codeTraceBenchCase, codeTracerPredictionsToFindings, coerceJson, coerceToFindingRows, compareAnalystRunners, computeFindingId, createAnalystAi, createChatClient, createJudgeAdapter, createRunCriticAdapter, createSemanticConceptJudgeAdapter, createTraceAnalystKind, createVerifierAdapter, defaultIsMaterial, defineTraceAnalyst, deriveEfficiencyFindings, diffFindings, emitControlIntegrityFindings, emitSkillUsageFindings, evidenceRefsFromRawFinding, findingSubjectGrammarPromptFor, isProposalFinding, liftSeverity, makeFinding, makeProposalFinding, normalizeAgentRxCategory, normalizeBenchmarkLabel, parseFindingSubject, parseRawFinding, registryBenchmarkRunner, renderAnalystBenchmarkMarkdown, renderFindingSubject, renderPriorFindings, renderUpstreamFindings, runAnalystBenchmark, scoreAnalystFindings, stripCodeFences, structureFindings, traceStoreEvidenceResolver };
|
|
711
|
+
export { AGENT_RX_UPSTREAM_REVISION, ANALYST_BENCHMARK_COST_LEDGER_FILE, ANALYST_BENCHMARK_DEPENDENCY_LOCK_DIGEST_ALGORITHM, ANALYST_BENCHMARK_DEPENDENCY_LOCK_FILES, ANALYST_BENCHMARK_DEPENDENCY_LOCK_SHA256, ANALYST_BENCHMARK_EVIDENCE_DEPENDENCY_LOCK_SHA256, ANALYST_BENCHMARK_EVIDENCE_PACKAGE_VERSION, ANALYST_BENCHMARK_HELP, ANALYST_BENCHMARK_IMPLEMENTATION_DIGEST_ALGORITHM, ANALYST_BENCHMARK_IMPLEMENTATION_FILES, ANALYST_BENCHMARK_IMPLEMENTATION_SHA256, ANALYST_BENCHMARK_LOCAL_RECEIPT_FILE, ANALYST_BENCHMARK_MANIFEST_FILE, ANALYST_BENCHMARK_OBSERVATIONS_FILE, ANALYST_SEVERITIES, type AgentRxBenchmarkCaseOptions, type AgentRxCalibrationRunnerSummary, type AgentRxCalibrationSummary, type AgentRxFailure, type AgentRxPrediction, type AgentRxPredictionReport, type AgentRxRow, type Analyst, type AnalystBenchmarkArtifact, type AnalystBenchmarkCase, type AnalystBenchmarkCommandConfig, type AnalystBenchmarkCommandDependencies, type AnalystBenchmarkDatasetRef, type AnalystBenchmarkDescriptor, type AnalystBenchmarkError, type AnalystBenchmarkLabelState, type AnalystBenchmarkLocalRunReceipt, type AnalystBenchmarkObservation, type AnalystBenchmarkOutput, type AnalystBenchmarkProgressRow, type AnalystBenchmarkProvenance, type AnalystBenchmarkResult, type AnalystBenchmarkRunIdentity, type AnalystBenchmarkRunManifest, type AnalystBenchmarkRunner, type AnalystBenchmarkSummary, type AnalystComparisonMetric, type AnalystContext, type AnalystCost, type AnalystEvidenceExpectation, type AnalystEvidenceResolution, type AnalystEvidenceResolutionError, type AnalystEvidenceResolver, type AnalystFinding, type AnalystFindingScore, type AnalystHooks, type AnalystInputKind, type AnalystIssueExpectation, type AnalystLatencyDistribution, type AnalystMetricComparison, AnalystRegistry, type AnalystRegistryOptions, type AnalystRequirements, type AnalystRunEvent, type AnalystRunInputs, type AnalystRunResult, type AnalystRunSummary, type AnalystRunnerComparison, type AnalystSeverity, type AnalystUsageReceipt, type BehavioralAnalystOptions, type BudgetPolicy, CODE_TRACE_BENCH_ANALYST_PROMPT, CONTROL_INTEGRITY_ANALYST, type ChatCallOpts, type ChatClient, type ChatRequest, type ChatResponse, type ChatTransport, type CliBridgeTransportOpts, type CodeTraceBenchCaseOptions, type CodeTraceBenchLabelOptions, type CodeTraceBenchLabelSet, type CodeTraceBenchRow, type CodeTraceCalibrationRunnerSummary, type CodeTraceCalibrationSummary, type CodeTraceStageAnnotation, type CodeTracerLabelGroup, type CodeTracerPredictionAdapterOptions, type CodeTracerPredictions, type CodeTracerStepLabel, ControlIntegrityAnalyst, type CreateAnalystAiConfig, type CreateChatClientOpts, type CreateTraceAnalystKindOpts, type CustomTransportOpts, DEFAULT_MAX_VERIFICATION_ARTIFACT_BYTES, DEFAULT_TRACE_ANALYST_KINDS, type DefaultAnalystRegistryOptions, type DefineExactTraceAnalystOptions, type DefineTraceAnalystOptions, type DiffPolicy, type DirectProviderTransportOpts, type EvidenceRef, type ExactAnalystBudgetPolicy, type ExactAnalystBudgetSnapshot, type ExactAnalystExecutionPlanSnapshot, type ExactAnalystRunCompletion, type ExactAnalystRunEvent, ExactAnalystRunExecutionError, type ExactAnalystRunPolicySnapshot, type ExactAnalystRunResult, type ExactAnalystRunSummary, type ExactAnalystSnapshot, type ExactCapableAnalyst, type ExactExecutionComponentIdentity, type ExactExecutionComponentSnapshot, type ExactRegistryRunOpts, FAILURE_MODE_KIND_SPEC, FINDING_SUBJECT_GRAMMAR_PROMPT, FINDING_SUBJECT_KINDS, FINDING_SUBJECT_SYNTAX, type FindingSubject, type FindingSubjectKind, FindingSubjectStringSchema, type FindingsDiff, FindingsStore, IMPROVEMENT_KIND_SPEC, type JudgeAdapterOpts, KIND_EXPECTED_SUBJECTS, KNOWLEDGE_GAP_KIND_SPEC, KNOWLEDGE_POISONING_KIND_SPEC, type LoadedVerificationArtifacts, type MockTransportOpts, type PersistedFinding, type PreparedPublicAnalystBenchmark, type ProposalFinding, type ProposalFindingOrigin, type PublicAnalystBenchmarkDataset, type PublicAnalystBenchmarkModelConfig, type PublicBenchmarkDistributions, type PublicBenchmarkSelectionReport, type PublicBenchmarkValueDistribution, RAW_FINDING_SCHEMA_PROMPT, type RawAnalystEvidence, RawAnalystEvidenceSchema, type RawAnalystFinding, RawAnalystFindingSchema, type RegistryRunOpts, type RouterTransportOpts, type RunAnalystBenchmarkOptions, type RunCriticAdapterOpts, SKILL_USAGE_ANALYST, type SandboxSdkTransportOpts, type SemanticConceptJudgeAdapterOpts, SkillUsageAnalyst, type SkillUsageRecord, type SkillUsageReport, type SkillUsageScanConfig, type StepLabelAdapterOptions, type StructureFindingsOptions, type StructureFindingsResult, type TraceAnalystAnalyze, type TraceAnalystKindSpec, type TraceToolGroupName, type UpstreamPredictionAdapterOptions, type VerificationArtifactFile, type VerificationArtifactManifest, type VerificationArtifactRole, type VerificationAvailabilitySummary, type VerificationOutcome, type VerificationOutcomeSource, type VerificationOutcomeStatus, type VerificationResultFile, type VerifierAdapterOpts, adaptPublicBenchmarkFindings, agentRxBenchmarkCase, agentRxPredictionsToFindings, analystBenchmarkDependencyLockDigest, analystBenchmarkImplementationDigest, appendVerificationArtifactsToOtlp, assertExactRegistryRunOpts, assertProposalFindings, behavioralAnalyst, buildDefaultAnalystRegistry, buildSkillUsageReport, buildTraceToolsForGroup, codeTraceBenchCase, codeTracerPredictionsToFindings, coerceJson, coerceToFindingRows, compareAnalystRunners, computeFindingId, createAnalystAi, createChatClient, createJudgeAdapter, createPublicBenchmarkModelRunner, createRunCriticAdapter, createSemanticConceptJudgeAdapter, createTraceAnalystKind, createVerifierAdapter, defaultIsMaterial, defineTraceAnalyst, deriveEfficiencyFindings, diffFindings, emitControlIntegrityFindings, emitSkillUsageFindings, emptyPublicBenchmarkRunner, evidenceRefsFromRawFinding, findingSubjectGrammarPromptFor, isProposalFinding, liftSeverity, loadCodeTraceVerificationArtifacts, loadPublicBenchmarkRows, makeFinding, makeProposalFinding, normalizeAgentRxCategory, normalizeBenchmarkLabel, parseFindingSubject, parseRawFinding, parseVerificationOutcome, preparePublicAnalystBenchmark, publicBenchmarkDistributions, publicBenchmarkProtocolSha256, publicBenchmarkSelectionReport, readAnalystBenchmarkArtifact, registryBenchmarkRunner, renderAgentRxCalibrationMarkdown, renderAnalystBenchmarkMarkdown, renderCodeTraceCalibrationMarkdown, renderFindingSubject, renderPriorFindings, renderUpstreamFindings, roundAgentRxStep, runAnalystBenchmark, runAnalystBenchmarkCommand, scoreAnalystFindings, selectPublicBenchmarkRows, stripCodeFences, structureFindings, summarizeAgentRxCalibration, summarizeCodeTraceCalibration, traceStoreEvidenceResolver };
|
|
278
712
|
//# sourceMappingURL=index.d.ts.map
|
|
@@ -1 +1 @@
|
|
|
1
|
-
{"version":3,"file":"index.d.ts","names":[],"sources":["../../src/analyst/adapters.ts","../../src/analyst/benchmark-comparison.ts","../../src/analyst/benchmark-
|
|
1
|
+
{"version":3,"file":"index.d.ts","names":[],"sources":["../../src/analyst/adapters.ts","../../src/analyst/benchmark-agentrx-calibration.ts","../../src/analyst/benchmark-dataset-types.ts","../../src/analyst/benchmark-dataset-agentrx.ts","../../src/analyst/benchmark-dataset-codetrace.ts","../../src/analyst/benchmark-dataset-utils.ts","../../src/analyst/benchmark-verification-outcome.ts","../../src/analyst/benchmark-verification-artifacts.ts","../../src/analyst/benchmark-public-types.ts","../../src/analyst/benchmark-public-adapters.ts","../../src/analyst/benchmark-public-data.ts","../../src/analyst/benchmark-public-model.ts","../../src/analyst/benchmark-comparison.ts","../../src/analyst/benchmark-public-calibration.ts","../../src/analyst/benchmark-command-artifact.ts","../../src/analyst/benchmark-command-result.ts","../../src/analyst/benchmark-command.ts","../../src/analyst/benchmark-implementation.ts","../../src/analyst/benchmark-report.ts","../../src/analyst/define.ts","../../src/analyst/parse-tolerant.ts","../../src/analyst/proposal-findings.ts","../../src/analyst/structure-findings.ts","../../src/analyst/tool-groups.ts"],"mappings":";;;;;;;;;;;iBA4CgB,aAAa,GAAG,WAAgB;UAe/B,oBAAoB;EACnC;EACA;EACA,UAAU,mBAAmB;;;;;EAK7B,UAAU,KAAK,cAAc;;iBAGf,sBAAsB,KAAK,MAAM,oBAAoB,OAAO,QAAQ;UAwEnE;EACf;EACA;EACA,SAAS;;EAET;;iBAGc,uBAAuB,OAAM,uBAA4B,QAAQ;UAiEhE;EACf;EACA;EACA,OAAO;;EAEP,MAAM;;EAEN,OAAO;;EAEP;;iBAGc,mBAAmB,MAAM,mBAAmB,QAAQ;UAiDnD;EACf;EACA;;EAEA,UAAU,KAAK;;EAEf;;iBAGc,kCACd,OAAM,kCACL,QAAQ;;;cC5RE;UAEI;EACf;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;;UAGe;EACf;EACA;EACA;EACA,SAAS;;iBAGK,4BACd,QAAQ,wBACR,2BACC;iBAkBa,iCAAiC,SAAS;;;KCtD9C;UAEK;EACf,YAAY;EACZ;EACA;EACA;EACA;EACA;;UAGe;EACf,eAAe;EACf,mBAAmB;EACnB;IAAe,YAAY;IAAY;;EACvC,wBAAwB;EACxB;EACA;EACA;;UAGe;EACf,UAAU;EACV;EACA;EACA;EACA;;UAGe;EACf,UAAU;EACV,mBAAmB;EACnB;EACA;EACA;EACA;EACA;;UAGe;EACf;EACA;EACA;EACA;;UAGe;EACf;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;;UAGe;EACf;EACA;EACA;EACA,iBAAiB;;KAGP,0CAEC,sCACA,iCACA;UAEI;EACf;EACA;EACA;EACA;;EAEA;EACA;EACA;EACA;EACA;EACA;EACA,oCAAoC;;UAGrB;EACf,eAAe;EACf,WAAW,sBAAsB;;KAGvB;UAEK;;;;;EAKf,WAAW;;UAGI,kCACP,yBACN;UAEa,oCAAoC;EACnD;;EAEA;;UAGe,yCAAyC;EACxD;EACA;EACA;EACA;;UAGe,2CACP,kCACN;;;iBCtGY,qBAAqB,QACnC,KAAK,YACL,OAAO,QACP,UAAS,8BACR,qBAAqB;;iBAoGR,6BACd,mBAAmB,YACnB,iBACA,UAAS,mCACR;iBA6Ea,yBAAyB;;iBAoNzB,iBAAiB;;;iBC7YjB,mBAAmB,QACjC,KAAK,mBACL,OAAO,QACP,UAAS,4BACR,qBAAqB;;iBAwFR,gCACd,2BACA,aAAa,uBACb,UAAS,qCACR;;;iBClHa,wBAAwB;;;KCA5B;UAEK;EACf;EACA;EACA,QAAQ;;UAGO;EACf,QAAQ;EACR;EAKA;IAAe;IAAe;;EAC9B,SAAS;EACT;EACA;EACA;EACA;;UAGe;EACf;EACA;;iBA8Ec,yBACd,gBAAgB,2BACf;;;cChGU;KAED;UAEK;EACf,MAAM;EACN;EACA;EACA;EACA;EACA;;UAGe;EACf;EACA;EACA,SAAS;EACT;EACA;EACA;EACA;EACA;EACA,OAAO;EACP,cAAc;EACd,UAAU,OAAO;;UAGF;EACf,UAAU;EACV,SAAS;EACT,OAAO,MAAM;IAA6B;;;iBAatB,mCAAmC;EACvD;EACA,KAAK;EACL;IACE,QAAQ;iBAwHI,kCACd,kBACA,iBACA,WAAW,6BACX;;;KCjLU;UAEK;EACf;EACA;EACA;EACA;EACA;EACA,aAAa;EACb;IACE;IACA;;;EAGF,mBAAmB;;UAGJ;EACf,OAAO,qBAAqB;EAC5B;EACA;EACA;EACA,YAAY;IACV;IACA;IACA;;EAEF,uBAAuB;EACvB,WAAW;;UAGI;EACf;EACA;EACA,QAAQ;;UAGO;EACf,OAAO;EACP,OAAO;EACP,OAAO;EACP,YAAY;EACZ,QAAQ;;UAGO;EACf;EACA;EACA;EACA;EACA;EACA;EACA,QAAQ;EACR,UAAU;;;;iBChDI,8BAA8B,uBAAuB;iBAiBrD,6BACd,SAAS,+BACT,sBACA,mBAAmB,kBACnB,oBACC;;;iBCgBmB,wBACpB,eACC,QAAQ,MAAM;iBA2BD,0BACd,SAAS,+BACT,eAAe,2BACf;EAAW;EAAe;IACzB,MAAM;iBAwBO,6BACd,SAAS,+BACT,eAAe,4BACd;iBAyCa,+BACd,SAAS,+BACT,iBAAiB,2BACjB,mBAAmB,2BACnB,eACC;iBAcmB,8BAA8B;EAClD,SAAS;EACT;EACA;EACA;EACA;EACA;EACA;IACE,QAAQ;;;iBC9HI,iCACd,SAAS,+BACT,QAAQ,oCACP,uBAAuB;iBAofV,8BAA8B,SAAS;cAoE1C;;;KC1mBD;UAoBK;EACf,QAAQ;EACR;;EAEA;;EAEA;;EAEA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;;UAGe;EACf;EACA;EACA,SAAS;;iBASK,sBACd,QAAQ,wBACR;EACE;EACA;EACA;EACA;EACA;IAED;;;UCnEc;EACf;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;;EAEA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;;UAGe;EACf;EACA;EACA,SAAS;;iBAGK,8BACd,QAAQ,yBACP;iBAca,mCAAmC,SAAS;;;UCrC3C;EACf;EACA;EACA;IACE,SAAS;IACT;IACA;IACA;IACA;IACA,YAAY;MAAQ;MAAiB;MAAsB;;IAC3D,uBAAuB;IACvB,0BAA0B;IAC1B;MACE;MACA;MACA;MACA,QAAQ;;IAEV;MACE;MACA;MACA;MACA;MACA;MACA;MACA;MACA;MACA;MACA;;;EAGJ,QAAQ;EACR,aAAa;EACb,uBAAuB;EACvB,qBAAqB;;UAGN;EACf;EACA;EACA;EACA;IACE;IACA;IACA;;;UAIa;EACf;IACE,SAAS;IACT;IACA;IACA;MACE;MACA;MACA;;IAEF;IACA;IACA;IACA;IACA;IACA;IACA;IACA;IACA;IACA;;EAEF;IACE;IACA;IACA;IACA,YAAY;MAAQ;MAAiB;MAAsB;;IAC3D;IACA;;;UAIa;EACf;EACA;EACA;EACA;EACA,UAAU;;UAGK;EACf;EACA;EACA;EACA;IACE;IACA;IACA;IACA;IACA;IACA;;EAEF;EACA;IACE;IACA;IACA;;EAEF;IACE;IACA;IACA;IACA;IACA;IACA;;;UAIa;EACf;EACA;EACA;EACA,aAAa;EACb;;cAGW;cACA;cACA;cACA;;;iBCxHS,6BACpB,eACC,QAAQ;;;UCyDM;EACf,qBACE,SAAS,+BACT,QAAQ,sCACL,uBAAuB;;UAGb;EACf,SAAS;EACT;EACA;EACA;EACA;EACA;EACA;EACA,OAAO;EACP;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;;iBAKoB,2BACpB,yBACA,MAAK,OAAO,YACZ,eAAc,sCACb;cA8QU;;;cC7XA;cAEA;cAEA;cAKA;;;;;;;cASA;cAEA;cAGA;cAgEA;iBAGG;iBAIA;;;iBC3FA,+BACd,QAAQ,wBACR,uBAAsB;;;UCDP;EACf;EACA;EACA;EACA,MAAM;EACN,SAAS,QAAQ;;UAGF,uCAAuC;;EAEtD,iBAAiB,SAAS;;;iBAIZ,mBACd,SAAS,iCACR,oBAAoB;iBACP,mBAAmB,SAAS,4BAA4B,QAAQ;KA8BpE,uBACV,OAAO,oBACP,SAAS,WAAW,QAAQ,uCACzB,QAAQ;;;;;;;;;;;;;;;iBCzCG,gBAAgB;;;;;iBAgBhB,WAAW;;;;;;;iBAeX,oBAAoB;;;;iBCXpB,kBAAkB,mBAAmB,WAAW;;;;;;iBAShD,uBACd,mBACA,mBACC,cAAc;;;UCXA;;EAEf;EACA;;EAEA;EACA;EACA;EACA;;EAEA,aAAa;EACb;EACA,WAAW;EACX;EACA,SAAS;;EAET;;EAEA,cAAc,KAAK,sBAAsB;;EAEzC,kBAAkB;;EAElB,YAAY;;UAGG;EACf,UAAU;EACV;;iBAuCoB,kBACpB,MAAM,2BACL,QAAQ;;;;KCrFC;;;;;;;;;;;;;;;;;;;;iBAgDI,wBACd,OAAO,oBACP,OAAO,qBACN"}
|