@tangle-network/agent-eval 0.133.0 → 0.133.1

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (78) hide show
  1. package/CHANGELOG.md +8 -0
  2. package/README.md +1 -1
  3. package/dist/agent-profile-cell-OhuTee9n.js +335 -0
  4. package/dist/agent-profile-cell-OhuTee9n.js.map +1 -0
  5. package/dist/{analyze-runs-BjPn_fOS.js → analyze-runs-B-afTpCv.js} +6 -19
  6. package/dist/analyze-runs-B-afTpCv.js.map +1 -0
  7. package/dist/analyze-runs-DZr7JW-m.d.ts.map +1 -1
  8. package/dist/{baseline-HsBvw_dk.js → baseline-DcX5hQDv.js} +2 -70
  9. package/dist/{baseline-HsBvw_dk.js.map → baseline-DcX5hQDv.js.map} +1 -1
  10. package/dist/baseline-hG3K85h4.d.ts.map +1 -1
  11. package/dist/benchmarks/index.d.ts +1 -1
  12. package/dist/benchmarks/index.js +1 -1
  13. package/dist/{benchmarks-DncrVrSr.js → benchmarks-BU7P6PCW.js} +3 -3
  14. package/dist/{benchmarks-DncrVrSr.js.map → benchmarks-BU7P6PCW.js.map} +1 -1
  15. package/dist/builder-eval/index.js +1 -1
  16. package/dist/campaign/index.d.ts +2 -2
  17. package/dist/campaign/index.js +2 -2
  18. package/dist/{campaign-CyQMCCEU.js → campaign-CnzHQndg.js} +19 -13
  19. package/dist/{campaign-CyQMCCEU.js.map → campaign-CnzHQndg.js.map} +1 -1
  20. package/dist/contract/index.js +5 -5
  21. package/dist/control.js +1 -1
  22. package/dist/{eval-campaign-CYkUME2T.js → eval-campaign-DXhpZghy.js} +4 -5
  23. package/dist/{eval-campaign-CYkUME2T.js.map → eval-campaign-DXhpZghy.js.map} +1 -1
  24. package/dist/{index-B_eUhU9K.d.ts → index-Ba636PKl.d.ts} +27 -4
  25. package/dist/{index-B_eUhU9K.d.ts.map → index-Ba636PKl.d.ts.map} +1 -1
  26. package/dist/{index-CiP2DRCj.d.ts → index-Wek5mU0y.d.ts} +2 -2
  27. package/dist/{index-CiP2DRCj.d.ts.map → index-Wek5mU0y.d.ts.map} +1 -1
  28. package/dist/{index-BAvgST_9.d.ts → index-nhIYz9hn.d.ts} +67 -9
  29. package/dist/index-nhIYz9hn.d.ts.map +1 -0
  30. package/dist/index.d.ts +2 -2
  31. package/dist/index.js +16 -17
  32. package/dist/index.js.map +1 -1
  33. package/dist/ledger-core/index.d.ts +2 -2
  34. package/dist/ledger-core/index.js +2 -2
  35. package/dist/ledger-core-CPZfcrC2.js +620 -0
  36. package/dist/ledger-core-CPZfcrC2.js.map +1 -0
  37. package/dist/meta-eval/index.js +2 -2
  38. package/dist/{mint-D5_87M5L.js → mint-BvkwcYZU.js} +2 -2
  39. package/dist/{mint-D5_87M5L.js.map → mint-BvkwcYZU.js.map} +1 -1
  40. package/dist/openapi.json +1 -1
  41. package/dist/{paired-arms-D9D0wXj2.js → paired-arms-6XItKzd1.js} +2 -2
  42. package/dist/{paired-arms-D9D0wXj2.js.map → paired-arms-6XItKzd1.js.map} +1 -1
  43. package/dist/pipelines/index.js +2 -2
  44. package/dist/profile-cell.js +1 -242
  45. package/dist/{propose-review-control-Bqb7daEJ.js → propose-review-control-SQ-n9-We.js} +2 -2
  46. package/dist/{propose-review-control-Bqb7daEJ.js.map → propose-review-control-SQ-n9-We.js.map} +1 -1
  47. package/dist/{release-report-oWt9f2k-.js → release-report-wuilQkvK.js} +3 -3
  48. package/dist/{release-report-oWt9f2k-.js.map → release-report-wuilQkvK.js.map} +1 -1
  49. package/dist/{replay-BMR4TEYY.js → replay-CJfGLdx4.js} +3 -3
  50. package/dist/{replay-BMR4TEYY.js.map → replay-CJfGLdx4.js.map} +1 -1
  51. package/dist/reporting.js +4 -4
  52. package/dist/{reward-hacking-BEvjdUtD.js → reward-hacking-Dl2UBzej.js} +3 -3
  53. package/dist/{reward-hacking-BEvjdUtD.js.map → reward-hacking-Dl2UBzej.js.map} +1 -1
  54. package/dist/rl.js +6 -6
  55. package/dist/rollout/index.js +2 -2
  56. package/dist/{rollout-VEo41J0N.js → rollout-CeTlDrf6.js} +2 -2
  57. package/dist/{rollout-VEo41J0N.js.map → rollout-CeTlDrf6.js.map} +1 -1
  58. package/dist/{rubric-predictive-validity-B3xmbmS1.js → rubric-predictive-validity-QG7ydk0s.js} +2 -2
  59. package/dist/{rubric-predictive-validity-B3xmbmS1.js.map → rubric-predictive-validity-QG7ydk0s.js.map} +1 -1
  60. package/dist/{run-record-CN8Zd21B.js → run-record-BIwU2wdV.js} +2 -2
  61. package/dist/{run-record-CN8Zd21B.js.map → run-record-BIwU2wdV.js.map} +1 -1
  62. package/dist/{skillopt-optimization-method-DgN7U9iR.js → skillopt-optimization-method-BoIzh7Dl.js} +4 -4
  63. package/dist/{skillopt-optimization-method-DgN7U9iR.js.map → skillopt-optimization-method-BoIzh7Dl.js.map} +1 -1
  64. package/dist/{statistics-CnnxdpOg.js → statistics-DWM_AyLe.js} +90 -76
  65. package/dist/statistics-DWM_AyLe.js.map +1 -0
  66. package/dist/statistics-DbvkkDPa.d.ts.map +1 -1
  67. package/dist/{summary-report-BNs5nmXI.js → summary-report-Ci17nIdU.js} +4 -4
  68. package/dist/{summary-report-BNs5nmXI.js.map → summary-report-Ci17nIdU.js.map} +1 -1
  69. package/dist/traces.js +1 -1
  70. package/package.json +1 -1
  71. package/dist/analyze-runs-BjPn_fOS.js.map +0 -1
  72. package/dist/index-BAvgST_9.d.ts.map +0 -1
  73. package/dist/ledger-core-eqaI3PCD.js +0 -388
  74. package/dist/ledger-core-eqaI3PCD.js.map +0 -1
  75. package/dist/pre-registration-DakwTRXk.js +0 -96
  76. package/dist/pre-registration-DakwTRXk.js.map +0 -1
  77. package/dist/profile-cell.js.map +0 -1
  78. package/dist/statistics-CnnxdpOg.js.map +0 -1
package/dist/index.js CHANGED
@@ -1,8 +1,7 @@
1
1
  import { t as __exportAll } from "./rolldown-runtime-8H4AJuhK.js";
2
- import { _ as observeAll, a as jsonlReviewStore, c as scoreFromEvals, d as runAgentControlLoop, f as stopOnNoProgress, g as noProgressDetector, h as errorStreakDetector, i as inMemoryReviewStore, l as allCriticalPassed, m as subjectiveEval, n as runProposeReviewAsControlLoop, o as runProposeReview, p as stopOnRepeatedAction, r as createLlmReviewer, s as controlRunToRunRecord, t as controlFailureClassFromVerification, u as objectiveEval, v as repeatedActionDetector, y as evaluateActionPolicy } from "./propose-review-control-Bqb7daEJ.js";
2
+ import { _ as observeAll, a as jsonlReviewStore, c as scoreFromEvals, d as runAgentControlLoop, f as stopOnNoProgress, g as noProgressDetector, h as errorStreakDetector, i as inMemoryReviewStore, l as allCriticalPassed, m as subjectiveEval, n as runProposeReviewAsControlLoop, o as runProposeReview, p as stopOnRepeatedAction, r as createLlmReviewer, s as controlRunToRunRecord, t as controlFailureClassFromVerification, u as objectiveEval, v as repeatedActionDetector, y as evaluateActionPolicy } from "./propose-review-control-SQ-n9-We.js";
3
3
  import { a as NotFoundError, c as VerificationError, i as JudgeError, n as CaptureIntegrityError, o as ReplayError, r as ConfigError, s as ValidationError, t as AgentEvalError } from "./errors-8YnH8WlF.js";
4
- import { a as verifyManifest, i as signManifest, n as evaluateHypothesis, r as hashJson, t as canonicalize } from "./pre-registration-DakwTRXk.js";
5
- import { AGENT_PROFILE_KINDS, AgentProfileCellValidationError, agentProfileCellHashMaterial, agentProfileCellKey, assertRunAgentProfileCell, buildAgentInterfaceProfileCell, buildAgentProfileCell, groupRunsByAgentProfileCell, requireAgentProfileCell, toAgentProfileJson, validateAgentProfileCell, verifyAgentProfileCell } from "./profile-cell.js";
4
+ import { _ as verifyManifest, a as assertRunAgentProfileCell, c as groupRunsByAgentProfileCell, d as validateAgentProfileCell, f as verifyAgentProfileCell, g as signManifest, h as hashJson, i as agentProfileCellKey, l as requireAgentProfileCell, m as evaluateHypothesis, n as AgentProfileCellValidationError, o as buildAgentInterfaceProfileCell, p as canonicalize, r as agentProfileCellHashMaterial, s as buildAgentProfileCell, t as AGENT_PROFILE_KINDS, u as toAgentProfileJson } from "./agent-profile-cell-OhuTee9n.js";
6
5
  import { F as makeFinding, I as computeTraceMetrics, L as createChatClient, P as computeFindingId, R as createAnalystAi, a as KNOWLEDGE_GAP_KIND_SPEC, d as renderUpstreamFindings, i as KNOWLEDGE_POISONING_KIND_SPEC, l as createTraceAnalystKind, n as AnalystRegistry, o as IMPROVEMENT_KIND_SPEC, r as DEFAULT_TRACE_ANALYST_KINDS, s as FAILURE_MODE_KIND_SPEC, t as buildDefaultAnalystRegistry, u as renderPriorFindings } from "./default-registry-D3T9XbuY.js";
7
6
  import { _ as resolveModelPricing, a as CostLedgerPersistenceError, c as costForTokenPricing, d as MODEL_PRICING, f as MetricsCollector, g as isModelPriced, h as estimateTokens, i as CostLedger, l as costForUsage, m as estimateCost, n as CostCallConflictError, o as CostReceiptCaptureError, p as TokenCounter, r as CostCeilingReachedError, s as CostReservationExceededError, t as CostAccountingIncompleteError, u as modelPriceKey } from "./cost-ledger-BrJxbrMy.js";
8
7
  import { a as providerFromBaseUrl, i as defaultProviderRedactor, n as InMemoryRawProviderSink, r as NoopRawProviderSink, t as FileSystemRawProviderSink } from "./raw-provider-sink-BQd7mzyT.js";
@@ -12,34 +11,34 @@ import { S as traceSpanKindToOpenInferenceKind, a as SpanNotFoundError, b as cla
12
11
  import { n as aggregateRunScore, r as clamp01, t as DEFAULT_RUN_SCORE_WEIGHTS } from "./run-score-iEEAWiBY.js";
13
12
  import { n as mapConcurrent, t as Mutex } from "./concurrency-MUjT7VjM.js";
14
13
  import { a as RunCritic, d as defaultIsMaterial, f as diffFindings, i as runSemanticConceptJudge, n as SEMANTIC_CONCEPT_JUDGE_VERSION, o as SKILL_USAGE_ANALYST, p as LockedJsonlAppender, r as createSemanticConceptJudge, s as SkillUsageAnalyst, t as DEFAULT_COMPLEXITY_WEIGHTS, u as FindingsStore } from "./semantic-concept-judge-BypLt6Fw.js";
15
- import { At as dominates, B as surfaceContentHash, Bt as JudgeParseError, Ct as llmJudge, D as runCanaries, Dt as fileVerdictCache, Et as contentHash, Ft as BackendIntegrityError, G as DEFAULT_MUTATION_PRIMITIVES, It as assertRealAgentReceipts, K as buildReflectionPrompt, Lt as assertRealBackend, Mt as paretoFrontierWithCrowding, Nt as scalarScore, Ot as inMemoryVerdictCache, Rt as summarizeAgentReceiptIntegrity, St as hashScenarios, Tt as canonicalJson, _t as redTeamReport, bt as Dataset, dt as REFERENCE_EQUIVALENCE_INPUT_LIMITS, ft as REFERENCE_EQUIVALENCE_JUDGE_VERSION, gt as redTeamDataset, ht as DEFAULT_RED_TEAM_CORPUS, jt as paretoFrontier, kt as crowdingDistance, mt as runReferenceEquivalenceJudge, pt as createReferenceEquivalenceJudge, q as parseReflectionResponse, vt as scoreRedTeamOutput, wt as cachedJudge, xt as HoldoutLockedError, yt as toolNamesForRun, zt as summarizeBackendIntegrity } from "./skillopt-optimization-method-DgN7U9iR.js";
16
- import { A as spearmanR, B as verbosityBias, C as pairedTTest, D as ranks, E as pearsonR, F as calibrateJudge, I as calibrateJudgeContinuous, L as continuousAgreement, M as weightedMean, N as wilcoxonSignedRank, O as requiredPairedSampleSize, P as wilson, R as positionalBias, S as pairedSignTest, T as passAtK, _ as normalizeScores, a as confidenceInterval, b as pairedMde, c as eProcess, d as interpretCliffs, f as mannWhitneyU, g as mulberry32, h as mcnemarRequiredN, i as cohensD, j as weightedComposite, k as requiredSampleSize, l as holm, m as mcnemarPower, n as bonferroni, o as corpusInterRaterAgreement, p as mcnemar, r as cliffsDelta, s as corpusInterRaterAgreementFromJudgeScores, t as benjaminiHochberg, u as interRaterReliability, v as pairedBootstrap, w as partialCredit, x as pairedRiskDifference, y as pairedCohensDz, z as selfPreference } from "./statistics-CnnxdpOg.js";
17
- import { n as pairArms, r as pairRunRecords, t as comparePairedArms } from "./paired-arms-D9D0wXj2.js";
14
+ import { At as dominates, B as surfaceContentHash, Bt as JudgeParseError, Ct as llmJudge, D as runCanaries, Dt as fileVerdictCache, Et as contentHash, Ft as BackendIntegrityError, G as DEFAULT_MUTATION_PRIMITIVES, It as assertRealAgentReceipts, K as buildReflectionPrompt, Lt as assertRealBackend, Mt as paretoFrontierWithCrowding, Nt as scalarScore, Ot as inMemoryVerdictCache, Rt as summarizeAgentReceiptIntegrity, St as hashScenarios, Tt as canonicalJson, _t as redTeamReport, bt as Dataset, dt as REFERENCE_EQUIVALENCE_INPUT_LIMITS, ft as REFERENCE_EQUIVALENCE_JUDGE_VERSION, gt as redTeamDataset, ht as DEFAULT_RED_TEAM_CORPUS, jt as paretoFrontier, kt as crowdingDistance, mt as runReferenceEquivalenceJudge, pt as createReferenceEquivalenceJudge, q as parseReflectionResponse, vt as scoreRedTeamOutput, wt as cachedJudge, xt as HoldoutLockedError, yt as toolNamesForRun, zt as summarizeBackendIntegrity } from "./skillopt-optimization-method-BoIzh7Dl.js";
15
+ import { A as spearmanR, B as positionalBias, C as pairedTTest, D as ranks, E as pearsonR, H as verbosityBias, L as calibrateJudge, M as weightedMean, N as wilcoxonSignedRank, O as requiredPairedSampleSize, P as wilson, R as calibrateJudgeContinuous, S as pairedSignTest, T as passAtK, V as selfPreference, _ as normalizeScores, a as confidenceInterval, b as pairedMde, c as eProcess, d as interpretCliffs, f as mannWhitneyU, g as mulberry32, h as mcnemarRequiredN, i as cohensD, j as weightedComposite, k as requiredSampleSize, l as holm, m as mcnemarPower, n as bonferroni, o as corpusInterRaterAgreement, p as mcnemar, r as cliffsDelta, s as corpusInterRaterAgreementFromJudgeScores, t as benjaminiHochberg, u as interRaterReliability, v as pairedBootstrap, w as partialCredit, x as pairedRiskDifference, y as pairedCohensDz, z as continuousAgreement } from "./statistics-DWM_AyLe.js";
16
+ import { n as pairArms, r as pairRunRecords, t as comparePairedArms } from "./paired-arms-6XItKzd1.js";
18
17
  import { n as llmSpanFromProvider, t as TraceEmitter } from "./emitter-CPBAhxum.js";
19
18
  import { a as scoreOrigin, n as observedScore, o as trainingReward, r as observedSplitScore, s as trainingScore, t as isRealnessGated } from "./reward-nw2xZGZG.js";
20
19
  import { a as isRetrievalSpan, i as isLlmSpan, n as TRACE_SCHEMA_VERSION, o as isSandboxSpan, r as isJudgeSpan, s as isToolSpan, t as FAILURE_CLASSES } from "./schema-CRhEY1SO.js";
21
- import { a as roundTripRunRecord, i as parseRunRecordSafe, n as isRunRecord, o as runTaskScore, r as modelHasSnapshot, s as validateRunRecord, t as RunRecordValidationError } from "./run-record-CN8Zd21B.js";
22
- import { a as evaluateReleaseConfidence, i as assertReleaseConfidence, n as bootstrapCi, r as judgeReplayGate, t as renderReleaseReport } from "./release-report-oWt9f2k-.js";
20
+ import { a as roundTripRunRecord, i as parseRunRecordSafe, n as isRunRecord, o as runTaskScore, r as modelHasSnapshot, s as validateRunRecord, t as RunRecordValidationError } from "./run-record-BIwU2wdV.js";
21
+ import { a as evaluateReleaseConfidence, i as assertReleaseConfidence, n as bootstrapCi, r as judgeReplayGate, t as renderReleaseReport } from "./release-report-wuilQkvK.js";
23
22
  import { c as assertMintedLines, f as isRolloutLine, i as ROLLOUT_SCHEMA, m as validateRolloutLine, p as isTrainableSplit, s as assertMinted, u as assertRolloutLine } from "./schema-C6DW4ZHR.js";
24
23
  import { i as toRewardRows, r as toJsonl, s as toSftRows } from "./exporters-q9iL-2Jf.js";
25
- import { a as toHarborTrajectories, i as relabelImportedSplit, n as HARBOR_IMPORT_GAP, o as toHarborTrajectory, r as fromHarborTrajectory, t as ATIF_SCHEMA_VERSION } from "./rollout-VEo41J0N.js";
24
+ import { a as toHarborTrajectories, i as relabelImportedSplit, n as HARBOR_IMPORT_GAP, o as toHarborTrajectory, r as fromHarborTrajectory, t as ATIF_SCHEMA_VERSION } from "./rollout-CeTlDrf6.js";
26
25
  import { t as buildTrajectory } from "./trajectory-D_7rLrvE.js";
27
- import { t as mintRolloutRows } from "./mint-D5_87M5L.js";
26
+ import { t as mintRolloutRows } from "./mint-BvkwcYZU.js";
28
27
  import { D as showMeasured, E as isUnavailable, S as rollupSupervisorRuns, T as SUPERVISOR_RUN_SCHEMA, _ as claudeCodeSupervisorRunReader, f as renderSupervisorRunHeadline, l as writeSupervisorRunReport, n as analyzeSupervisorRun, p as renderSupervisorRunMarkdown, t as supervisorRunRolloutLines, v as readClaudeCodeSupervisorRun, y as analyzeSupervisorRunSources } from "./supervisor-run-_lnTLM3z.js";
29
28
  import { n as TRACE_ANALYST_ACTOR_DESCRIPTION, r as TRACE_ANALYST_ACTOR_DESCRIPTION_VERSION, t as analyzeTraces } from "./analyst-LsnNpSkm.js";
30
- import { C as planTraceInsightQuestions, E as traceAnalystOnRunComplete, S as inferDomainKeywords, T as tokenizeDomainWords, _ as buildTraceInsightContext, a as convertTraceStoresToOtlp, b as describeTraceInsightScope, c as otelRunCompleteHook, d as captureFetchToRawSink, f as otlpRowsToRunRecords, g as flattenOtlpExportToNdjson, h as otlpToTraceRunRecords, i as iterateRawCalls, l as OTEL_AGENT_EVAL_SCOPE, m as otlpToRunRecords, n as ReplayCacheMissError, o as createOtelExporter, p as otlpRowsToTraceRunRecords, r as createReplayFetch, s as createOtelTracingStore, t as ReplayCache, u as exportRunAsOtlp, v as buildTraceInsightPrompt, w as scoreTraceInsightReadiness, x as domainEvidencePattern, y as defaultTraceInsightPanel } from "./replay-BMR4TEYY.js";
29
+ import { C as planTraceInsightQuestions, E as traceAnalystOnRunComplete, S as inferDomainKeywords, T as tokenizeDomainWords, _ as buildTraceInsightContext, a as convertTraceStoresToOtlp, b as describeTraceInsightScope, c as otelRunCompleteHook, d as captureFetchToRawSink, f as otlpRowsToRunRecords, g as flattenOtlpExportToNdjson, h as otlpToTraceRunRecords, i as iterateRawCalls, l as OTEL_AGENT_EVAL_SCOPE, m as otlpToRunRecords, n as ReplayCacheMissError, o as createOtelExporter, p as otlpRowsToTraceRunRecords, r as createReplayFetch, s as createOtelTracingStore, t as ReplayCache, u as exportRunAsOtlp, v as buildTraceInsightPrompt, w as scoreTraceInsightReadiness, x as domainEvidencePattern, y as defaultTraceInsightPanel } from "./replay-CJfGLdx4.js";
31
30
  import { n as extractUsageFromResponse, r as extractUsageFromSse, t as extractUsage } from "./extract-usage-2j25whHw.js";
32
- import { B as harnessAxisOf, F as HARNESS_NATIVE_MODEL, G as parseCorrectnessResponse, H as completionVerdict, I as agentProfileHash, K as verifyCompletion, L as agentProfileId, P as CODING_HARNESSES, R as agentProfileModelId, U as createLlmCorrectnessChecker, V as extractProducedState, W as createTokenRecallChecker, z as expandProfileAxes } from "./campaign-CyQMCCEU.js";
31
+ import { B as harnessAxisOf, F as HARNESS_NATIVE_MODEL, G as parseCorrectnessResponse, H as completionVerdict, I as agentProfileHash, K as verifyCompletion, L as agentProfileId, P as CODING_HARNESSES, R as agentProfileModelId, U as createLlmCorrectnessChecker, V as extractProducedState, W as createTokenRecallChecker, z as expandProfileAxes } from "./campaign-CnzHQndg.js";
33
32
  import { a as judgeSpans, c as runsForScenario, i as hasCapturedToolArgs, l as toolSpans, n as argHash, o as llmSpans, r as groupBy, s as runFailureClass, t as aggregateLlm } from "./query-Di7eEQ79.js";
34
- import { a as checkBehavioralCanary, i as canaryLeakView, o as checkCanaries, r as HoldoutAuditor, s as runBehavioralCanaries, t as analyzeRuns } from "./analyze-runs-BjPn_fOS.js";
35
- import { a as summaryTable, i as researchReport, n as gainHistogram, r as paretoChart, t as RESEARCH_REPORT_HARD_PAIR_FLOOR } from "./summary-report-BNs5nmXI.js";
33
+ import { a as checkBehavioralCanary, i as canaryLeakView, o as checkCanaries, r as HoldoutAuditor, s as runBehavioralCanaries, t as analyzeRuns } from "./analyze-runs-B-afTpCv.js";
34
+ import { a as summaryTable, i as researchReport, n as gainHistogram, r as paretoChart, t as RESEARCH_REPORT_HARD_PAIR_FLOOR } from "./summary-report-Ci17nIdU.js";
36
35
  import { a as composeParsers, c as vitestTestParser, i as SubprocessSandboxDriver, n as DockerSandboxDriver, o as jestTestParser, r as SandboxHarness, s as pytestTestParser, t as runTestGradedScenario } from "./test-graded-scenario-BsqWLmPt.js";
37
36
  import { a as InMemoryTraceStore, i as FileSystemTraceStore, n as assertRunCaptured, r as throwIfRunIncomplete, t as RunIntegrityError } from "./integrity-BzRbCHzi.js";
38
37
  import { i as redactValue, n as REDACTION_VERSION, r as redactString, t as DEFAULT_REDACTION_RULES } from "./redact-7Aq1ukl-.js";
39
- import { a as DEFAULT_RULES, i as computeToolUseMetrics, n as iqr, o as classifyFailure, r as welchsTTest, t as compareToBaseline } from "./baseline-HsBvw_dk.js";
38
+ import { a as DEFAULT_RULES, i as computeToolUseMetrics, n as iqr, o as classifyFailure, r as welchsTTest, t as compareToBaseline } from "./baseline-DcX5hQDv.js";
40
39
  import { t as analyzeSeries } from "./series-convergence-CjO2QdRW.js";
41
- import { _ as deterministicSplit, g as BENCHMARK_SPLIT_SEED, t as benchmarks_exports } from "./benchmarks-DncrVrSr.js";
42
- import { t as runEvalCampaign } from "./eval-campaign-CYkUME2T.js";
40
+ import { _ as deterministicSplit, g as BENCHMARK_SPLIT_SEED, t as benchmarks_exports } from "./benchmarks-BU7P6PCW.js";
41
+ import { t as runEvalCampaign } from "./eval-campaign-DXhpZghy.js";
43
42
  import { n as pairedEvalueSequence, t as evaluateInterimReleaseConfidence } from "./sequential-Br0mAPHA.js";
44
43
  import { AxGEPA, AxSignature, ax } from "@ax-llm/ax";
45
44
  import { accessSync, appendFileSync, constants, cpSync, existsSync, mkdirSync, promises, readFileSync, readdirSync, statSync, writeFileSync } from "node:fs";