@tangle-network/agent-eval 0.147.0 → 0.148.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (50) hide show
  1. package/CHANGELOG.md +22 -0
  2. package/README.md +7 -0
  3. package/dist/analyst/index.d.ts +1 -1
  4. package/dist/analyst/index.js +1 -1
  5. package/dist/{benchmark-command-BTiysiYU.js → benchmark-command-Cz4fDmsk.js} +2 -2
  6. package/dist/{benchmark-command-BTiysiYU.js.map → benchmark-command-Cz4fDmsk.js.map} +1 -1
  7. package/dist/benchmarks/index.d.ts +2 -2
  8. package/dist/benchmarks/index.js +2 -2
  9. package/dist/campaign/index.d.ts +4 -4
  10. package/dist/campaign/index.js +4 -4
  11. package/dist/{campaign-DCDdhuv2.js → campaign-BcfXzmPM.js} +4 -4
  12. package/dist/{campaign-DCDdhuv2.js.map → campaign-BcfXzmPM.js.map} +1 -1
  13. package/dist/cli.js +1 -1
  14. package/dist/contract/index.d.ts +3 -3
  15. package/dist/contract/index.js +3 -3
  16. package/dist/{define-agent-eval-BqWFz3sK.js → define-agent-eval-CvZQW4u9.js} +2 -2
  17. package/dist/{define-agent-eval-BqWFz3sK.js.map → define-agent-eval-CvZQW4u9.js.map} +1 -1
  18. package/dist/{define-agent-eval-D52ClbX2.d.ts → define-agent-eval-hXLUBKtb.d.ts} +2 -2
  19. package/dist/{define-agent-eval-D52ClbX2.d.ts.map → define-agent-eval-hXLUBKtb.d.ts.map} +1 -1
  20. package/dist/experiment/index.d.ts +117 -1
  21. package/dist/experiment/index.d.ts.map +1 -1
  22. package/dist/experiment/index.js +217 -1
  23. package/dist/experiment/index.js.map +1 -1
  24. package/dist/{index-BjBjxiVv.d.ts → index-Dzn8Q3C2.d.ts} +12 -358
  25. package/dist/index-Dzn8Q3C2.d.ts.map +1 -0
  26. package/dist/index.d.ts +2 -2
  27. package/dist/index.js +3 -3
  28. package/dist/{llm-judge-DrzsVS5k.js → llm-judge-DWq1Ptco.js} +259 -5
  29. package/dist/llm-judge-DWq1Ptco.js.map +1 -0
  30. package/dist/{matrix-C-2Qx1Zr.d.ts → matrix-Bc111FKv.d.ts} +17 -1
  31. package/dist/{matrix-C-2Qx1Zr.d.ts.map → matrix-Bc111FKv.d.ts.map} +1 -1
  32. package/dist/multishot/golden/index.d.ts +1 -1
  33. package/dist/multishot/index.d.ts +1 -1
  34. package/dist/multishot/index.js +16 -0
  35. package/dist/multishot/index.js.map +1 -1
  36. package/dist/openapi.json +1 -1
  37. package/dist/{produced-state-Dtx60bUQ.js → produced-state-C0oJ4vr-.js} +2 -2
  38. package/dist/{produced-state-Dtx60bUQ.js.map → produced-state-C0oJ4vr-.js.map} +1 -1
  39. package/dist/{provenance-LrOEOHQb.d.ts → provenance-DA-Pmyfv.d.ts} +441 -2
  40. package/dist/provenance-DA-Pmyfv.d.ts.map +1 -0
  41. package/dist/{skillopt-optimization-method-BoC1Qccx.d.ts → skillopt-optimization-method-CrY0OG17.d.ts} +2 -2
  42. package/dist/{skillopt-optimization-method-BoC1Qccx.d.ts.map → skillopt-optimization-method-CrY0OG17.d.ts.map} +1 -1
  43. package/dist/{skillopt-optimization-method-C_UrqZs2.js → skillopt-optimization-method-Donmq4sq.js} +2 -2
  44. package/dist/{skillopt-optimization-method-C_UrqZs2.js.map → skillopt-optimization-method-Donmq4sq.js.map} +1 -1
  45. package/docs/multishot-golden-records.md +12 -1
  46. package/docs/search-history-receipts.md +139 -0
  47. package/package.json +2 -2
  48. package/dist/index-BjBjxiVv.d.ts.map +0 -1
  49. package/dist/llm-judge-DrzsVS5k.js.map +0 -1
  50. package/dist/provenance-LrOEOHQb.d.ts.map +0 -1
package/dist/cli.js CHANGED
@@ -1,6 +1,6 @@
1
1
  #!/usr/bin/env node
2
2
  import { o as runRolloutReleaseCli } from "./hf-dataset-XggBupCr.js";
3
- import { n as runAnalystBenchmarkCommand } from "./benchmark-command-BTiysiYU.js";
3
+ import { n as runAnalystBenchmarkCommand } from "./benchmark-command-Cz4fDmsk.js";
4
4
  import { a as runRpcBatch, o as runRpcOnce, p as handleVersion, r as startServerAsync, s as buildOpenApi } from "./server-D9wQclzG.js";
5
5
  import { writeFileSync } from "node:fs";
6
6
  //#region src/cli-config.ts
@@ -6,12 +6,12 @@ import { n as buildDefaultAnalystRegistry, t as DefaultAnalystRegistryOptions }
6
6
  import { C as JudgeDimension, H as SurfaceProposer, M as OptimizerConfig, R as Scenario, S as JudgeConfig, V as SessionScript, _ as GateDecision, a as CampaignResult, b as GenerationRecord, c as CampaignTraceWriter, d as DispatchContext, f as DispatchFn, g as GateContribution, h as GateContext, i as CampaignCostMeter, j as MutableSurface, l as CodeSurface, m as GateCheckStatus, n as CampaignArtifactWriter, p as Gate, r as CampaignCellResult, t as CampaignAggregates, v as GateResult, w as JudgeScore, y as GenerationCandidate } from "../types-C1Bmeb8X.js";
7
7
  import { a as FailureClusterInsight, c as JudgeInsight, d as Recommendation, f as ReleaseSummary, i as FailureClassTally, l as LiftInsight, m as TokenUsageInsight, n as ExecutionErrorOutcomeCell, o as InsightReport, p as ScalarDistribution, r as ExecutionInsight, s as InterRaterInsight, t as CostProvenanceSummary, u as OutcomeCorrelationInsight } from "../insight-report-BeT8KCgI.js";
8
8
  import { C as analyzeRuns, S as SummarizeExecutionOptions, b as AnalyzeRunsOptions, w as summarizeExecution, x as ExecutionReport } from "../engine-CIy18RTX.js";
9
- import { $ as OptimizationTokenUsage, D as runEval, Dt as fsCampaignStorage, E as RunEvalOptions, G as OptimizationMethodComparison, H as CompareOptimizationMethodsOptions, J as OptimizationMethodProvenance, K as OptimizationMethodInput, Mt as LlmJudgeDimension, Nt as LlmJudgeOptions, Ot as inMemoryCampaignStorage, Pt as llmJudge, Q as OptimizationPackageSource, Tt as CampaignStorage, U as ComparisonCost, W as OptimizationMethod, Y as OptimizationMethodResult, b as RunImprovementLoopResult, bt as runCampaign, tt as compareOptimizationMethods, vt as CampaignCellFailureReceipt, x as runImprovementLoop, y as RunImprovementLoopOptions, yt as RunCampaignOptions } from "../provenance-LrOEOHQb.js";
10
- import { B as runReferenceEquivalenceJudge, C as ExternalTextOptimizerContext, E as ExternalTextEvaluationResponse, F as ReferenceEquivalenceJudgeInput, I as ReferenceEquivalenceJudgeOptions, L as ReferenceEquivalenceJudgeResult, N as REFERENCE_EQUIVALENCE_INPUT_LIMITS, P as REFERENCE_EQUIVALENCE_JUDGE_VERSION, R as ReferenceEquivalenceScenario, S as ExternalTextOptimizationMethodConfig, T as ExternalOptimizationExample, _ as DefaultProductionGateOptions, a as GepaAdaptiveEngineRun, b as composeGate, c as GepaOptimizationMethodConfig, d as gepaOptimizationMethod, f as OpenAICompatibleOptimizerModel, g as DefaultProductionGateCheck, h as heldOutGate, i as skillOptOptimizationMethod, j as campaignSplitDigest, l as GepaOptimizationRecipe, m as HeldOutGateOptions, n as SkillOptRunnerCommand, o as GepaEngineOptions, p as OptimizerModelBudget, r as SkillOptTrainerConfig, s as GepaEngineRun, t as SkillOptOptimizationMethodConfig, u as GepaRunnerCommand, v as DefaultProductionRewardHackingOptions, w as ExternalTextOptimizerResult, x as externalTextOptimizationMethod, y as defaultProductionGate, z as createReferenceEquivalenceJudge } from "../skillopt-optimization-method-BoC1Qccx.js";
9
+ import { $ as OptimizationTokenUsage, An as LlmJudgeDimension, Cn as CampaignStorage, D as runEval, E as RunEvalOptions, En as inMemoryCampaignStorage, G as OptimizationMethodComparison, H as CompareOptimizationMethodsOptions, J as OptimizationMethodProvenance, K as OptimizationMethodInput, Mn as llmJudge, Q as OptimizationPackageSource, Tn as fsCampaignStorage, U as ComparisonCost, W as OptimizationMethod, Y as OptimizationMethodResult, _n as RunCampaignOptions, b as RunImprovementLoopResult, gn as CampaignCellFailureReceipt, jn as LlmJudgeOptions, tt as compareOptimizationMethods, vn as runCampaign, x as runImprovementLoop, y as RunImprovementLoopOptions } from "../provenance-DA-Pmyfv.js";
10
+ import { B as runReferenceEquivalenceJudge, C as ExternalTextOptimizerContext, E as ExternalTextEvaluationResponse, F as ReferenceEquivalenceJudgeInput, I as ReferenceEquivalenceJudgeOptions, L as ReferenceEquivalenceJudgeResult, N as REFERENCE_EQUIVALENCE_INPUT_LIMITS, P as REFERENCE_EQUIVALENCE_JUDGE_VERSION, R as ReferenceEquivalenceScenario, S as ExternalTextOptimizationMethodConfig, T as ExternalOptimizationExample, _ as DefaultProductionGateOptions, a as GepaAdaptiveEngineRun, b as composeGate, c as GepaOptimizationMethodConfig, d as gepaOptimizationMethod, f as OpenAICompatibleOptimizerModel, g as DefaultProductionGateCheck, h as heldOutGate, i as skillOptOptimizationMethod, j as campaignSplitDigest, l as GepaOptimizationRecipe, m as HeldOutGateOptions, n as SkillOptRunnerCommand, o as GepaEngineOptions, p as OptimizerModelBudget, r as SkillOptTrainerConfig, s as GepaEngineRun, t as SkillOptOptimizationMethodConfig, u as GepaRunnerCommand, v as DefaultProductionRewardHackingOptions, w as ExternalTextOptimizerResult, x as externalTextOptimizationMethod, y as defaultProductionGate, z as createReferenceEquivalenceJudge } from "../skillopt-optimization-method-CrY0OG17.js";
11
11
  import { a as ObjectiveSource, c as PromotionPolicy, d as paretoSignificanceGate, i as EvidenceVector, l as buildEvidenceVector, n as AxisVerdict, o as ParetoSignificanceGateOptions, r as BuildEvidenceVectorOptions, s as PromotionObjective, t as AxisEvidence, u as paretoPolicy } from "../promotion-policy-CewdjfCJ.js";
12
12
  import { c as EvalRunGenerationSnapshot, g as TraceSpanEvent, n as HostedTenant, o as EvalRunCellScore, s as EvalRunEvent } from "../client-BV7icIfy.js";
13
13
  import { i as InMemoryOutcomeStore, n as FileSystemOutcomeStore, o as OutcomeStore, r as FileSystemOutcomeStoreOptions, t as DeploymentOutcome } from "../outcome-store-BYHIuO0e.js";
14
- import { a as DefinedAgentEval, c as SelfImproveOptions, d as SelfImproveRunError, f as selfImprove, i as DefineAgentEvalOptions, l as SelfImproveProgressEvent, n as AgentEvalEvaluateOptions, o as defineAgentEval, r as AgentEvalImproveOptions, s as SelfImproveBudget, t as AgentEvalAgent, u as SelfImproveResult } from "../define-agent-eval-D52ClbX2.js";
14
+ import { a as DefinedAgentEval, c as SelfImproveOptions, d as SelfImproveRunError, f as selfImprove, i as DefineAgentEvalOptions, l as SelfImproveProgressEvent, n as AgentEvalEvaluateOptions, o as defineAgentEval, r as AgentEvalImproveOptions, s as SelfImproveBudget, t as AgentEvalAgent, u as SelfImproveResult } from "../define-agent-eval-hXLUBKtb.js";
15
15
  import { AgentCandidateBenchmarkCellRef, AgentCandidateBenchmarkSuiteInputs, AgentCandidateBenchmarkTask, AgentCandidateBenchmarkTaskMaterial, AgentCandidateBundle, AgentCandidateEvaluationPolicy, AgentCandidateExperiment, AgentCandidateExperimentMaterial, AgentCandidateExperimentMeasurement, AgentImprovementCost, AgentImprovementMeasuredComparison, AgentProfileImprovementExperiment, AgentProfileImprovementExperimentMaterial, AgentProfileImprovementMeasuredComparison, AgentProfileImprovementMeasurement, AgentProfileImprovementRunCell, AgentProfileImprovementRunReceipt, AgentProfileImprovementSuiteInputs, AgentProfileImprovementTask, AgentProfileImprovementTaskMaterial, CandidateExecutionEvidence, Sha256Digest } from "@tangle-network/agent-interface";
16
16
  //#region src/contract/measured-comparison.d.ts
17
17
  interface SealCandidateBenchmarkSuiteOptions {
@@ -1,8 +1,8 @@
1
1
  import { s as ValidationError } from "../errors-Dngq5h35.js";
2
2
  import { r as pairedBootstrap } from "../paired-tests-BHIhYVdu.js";
3
- import { a as summarizeExecution, i as analyzeRuns, n as SelfImproveRunError, r as selfImprove, t as defineAgentEval } from "../define-agent-eval-BqWFz3sK.js";
3
+ import { a as summarizeExecution, i as analyzeRuns, n as SelfImproveRunError, r as selfImprove, t as defineAgentEval } from "../define-agent-eval-CvZQW4u9.js";
4
4
  import { a as parseRunRecordSafe } from "../run-record-D2lDdSAz.js";
5
- import { G as runEval, K as runCampaign, f as runImprovementLoop, nt as campaignSplitDigest, t as llmJudge, x as compareOptimizationMethods, z as defaultProductionGate } from "../llm-judge-DrzsVS5k.js";
5
+ import { $ as runEval, et as runCampaign, f as runImprovementLoop, q as defaultProductionGate, t as llmJudge, ut as campaignSplitDigest, x as compareOptimizationMethods } from "../llm-judge-DWq1Ptco.js";
6
6
  import { i as isModelPriced, n as estimateCost } from "../metrics-Qv-cpptD.js";
7
7
  import { i as CostLedger } from "../cost-ledger-B1qx30B4.js";
8
8
  import { d as mapConcurrentRange } from "../ledger-core-DTae9rv_.js";
@@ -15,7 +15,7 @@ import { LLM_MODEL_ATTR_KEYS, SPAN_KIND_ATTR_KEYS } from "../trace-attributes.js
15
15
  import { t as extractUsage } from "../extract-usage-BrQ8mCLX.js";
16
16
  import { n as InMemoryOutcomeStore, t as FileSystemOutcomeStore } from "../outcome-store-ChBKlTd_.js";
17
17
  import { i as summarizeTraceErrors, n as recordAggregateMeasurements, r as summarizeExecutionMeasurements, t as readTaskFailureLabels } from "../task-failure-attributes--ZTP3tYO.js";
18
- import { a as externalTextOptimizationMethod, c as REFERENCE_EQUIVALENCE_INPUT_LIMITS, d as runReferenceEquivalenceJudge, i as composeGate, l as REFERENCE_EQUIVALENCE_JUDGE_VERSION, n as gepaOptimizationMethod, r as heldOutGate, t as skillOptOptimizationMethod, u as createReferenceEquivalenceJudge } from "../skillopt-optimization-method-C_UrqZs2.js";
18
+ import { a as externalTextOptimizationMethod, c as REFERENCE_EQUIVALENCE_INPUT_LIMITS, d as runReferenceEquivalenceJudge, i as composeGate, l as REFERENCE_EQUIVALENCE_JUDGE_VERSION, n as gepaOptimizationMethod, r as heldOutGate, t as skillOptOptimizationMethod, u as createReferenceEquivalenceJudge } from "../skillopt-optimization-method-Donmq4sq.js";
19
19
  import { n as paretoPolicy, r as paretoSignificanceGate, t as buildEvidenceVector } from "../promotion-policy-xzA40Evo.js";
20
20
  import { createHash } from "node:crypto";
21
21
  import { agentCandidateBenchmarkSuiteSchema, agentCandidateBenchmarkTaskSchema, agentCandidateBundleSchema, agentCandidateEvaluationPolicySchema, agentCandidateExperimentSchema, agentImprovementMeasuredComparisonSchema, agentProfileImprovementExperimentSchema, agentProfileImprovementMeasuredComparisonSchema, agentProfileImprovementRunCellSchema, agentProfileImprovementRunReceiptSchema, agentProfileImprovementSuiteInputsSchema, agentProfileImprovementSuiteSchema, agentProfileImprovementTaskSchema, candidateExecutionEvidenceSchema, canonicalCandidateDigest, canonicalCandidateJson, numbersApproximatelyEqual, omitTopLevelDigest } from "@tangle-network/agent-interface";
@@ -9,7 +9,7 @@ import { r as welchsTTest } from "./baseline-BhPRQBVn.js";
9
9
  import { r as observedSplitScore } from "./reward-nw2xZGZG.js";
10
10
  import { c as validateRunRecord, i as modelHasSnapshot } from "./run-record-D2lDdSAz.js";
11
11
  import { r as paretoChart } from "./summary-report-Blysd6Z2.js";
12
- import { A as surfaceHash, G as runEval, J as resolveRunDir, f as runImprovementLoop, k as surfaceContentHash, o as emitLoopProvenance, s as loopProvenanceArgsFromResult, y as assertOptimizationResult, z as defaultProductionGate } from "./llm-judge-DrzsVS5k.js";
12
+ import { $ as runEval, A as surfaceHash, f as runImprovementLoop, k as surfaceContentHash, nt as resolveRunDir, o as emitLoopProvenance, q as defaultProductionGate, s as loopProvenanceArgsFromResult, y as assertOptimizationResult } from "./llm-judge-DWq1Ptco.js";
13
13
  import { c as campaignCellTaskScore, l as campaignCellToRunRecord, o as campaignCellExecutionEvidence, s as campaignCellJudgeDimensions } from "./reward-hacking-DFo2FU5J.js";
14
14
  import { S as inMemoryCampaignStorage, b as createRunCostLedger, x as fsCampaignStorage } from "./external-optimizer-subprocess-DU1KM8yV.js";
15
15
  import { t as powerPreflight } from "./power-preflight-DEw-uC7q.js";
@@ -1491,4 +1491,4 @@ function requirePositiveInteger(value, field) {
1491
1491
  //#endregion
1492
1492
  export { summarizeExecution as a, analyzeRuns as i, SelfImproveRunError as n, checkCanaries as o, selfImprove as r, defineAgentEval as t };
1493
1493
 
1494
- //# sourceMappingURL=define-agent-eval-BqWFz3sK.js.map
1494
+ //# sourceMappingURL=define-agent-eval-CvZQW4u9.js.map