@tangle-network/agent-eval 0.147.0 → 0.148.0
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/CHANGELOG.md +22 -0
- package/README.md +7 -0
- package/dist/analyst/index.d.ts +1 -1
- package/dist/analyst/index.js +1 -1
- package/dist/{benchmark-command-BTiysiYU.js → benchmark-command-Cz4fDmsk.js} +2 -2
- package/dist/{benchmark-command-BTiysiYU.js.map → benchmark-command-Cz4fDmsk.js.map} +1 -1
- package/dist/benchmarks/index.d.ts +2 -2
- package/dist/benchmarks/index.js +2 -2
- package/dist/campaign/index.d.ts +4 -4
- package/dist/campaign/index.js +4 -4
- package/dist/{campaign-DCDdhuv2.js → campaign-BcfXzmPM.js} +4 -4
- package/dist/{campaign-DCDdhuv2.js.map → campaign-BcfXzmPM.js.map} +1 -1
- package/dist/cli.js +1 -1
- package/dist/contract/index.d.ts +3 -3
- package/dist/contract/index.js +3 -3
- package/dist/{define-agent-eval-BqWFz3sK.js → define-agent-eval-CvZQW4u9.js} +2 -2
- package/dist/{define-agent-eval-BqWFz3sK.js.map → define-agent-eval-CvZQW4u9.js.map} +1 -1
- package/dist/{define-agent-eval-D52ClbX2.d.ts → define-agent-eval-hXLUBKtb.d.ts} +2 -2
- package/dist/{define-agent-eval-D52ClbX2.d.ts.map → define-agent-eval-hXLUBKtb.d.ts.map} +1 -1
- package/dist/experiment/index.d.ts +117 -1
- package/dist/experiment/index.d.ts.map +1 -1
- package/dist/experiment/index.js +217 -1
- package/dist/experiment/index.js.map +1 -1
- package/dist/{index-BjBjxiVv.d.ts → index-Dzn8Q3C2.d.ts} +12 -358
- package/dist/index-Dzn8Q3C2.d.ts.map +1 -0
- package/dist/index.d.ts +2 -2
- package/dist/index.js +3 -3
- package/dist/{llm-judge-DrzsVS5k.js → llm-judge-DWq1Ptco.js} +259 -5
- package/dist/llm-judge-DWq1Ptco.js.map +1 -0
- package/dist/{matrix-C-2Qx1Zr.d.ts → matrix-Bc111FKv.d.ts} +17 -1
- package/dist/{matrix-C-2Qx1Zr.d.ts.map → matrix-Bc111FKv.d.ts.map} +1 -1
- package/dist/multishot/golden/index.d.ts +1 -1
- package/dist/multishot/index.d.ts +1 -1
- package/dist/multishot/index.js +16 -0
- package/dist/multishot/index.js.map +1 -1
- package/dist/openapi.json +1 -1
- package/dist/{produced-state-Dtx60bUQ.js → produced-state-C0oJ4vr-.js} +2 -2
- package/dist/{produced-state-Dtx60bUQ.js.map → produced-state-C0oJ4vr-.js.map} +1 -1
- package/dist/{provenance-LrOEOHQb.d.ts → provenance-DA-Pmyfv.d.ts} +441 -2
- package/dist/provenance-DA-Pmyfv.d.ts.map +1 -0
- package/dist/{skillopt-optimization-method-BoC1Qccx.d.ts → skillopt-optimization-method-CrY0OG17.d.ts} +2 -2
- package/dist/{skillopt-optimization-method-BoC1Qccx.d.ts.map → skillopt-optimization-method-CrY0OG17.d.ts.map} +1 -1
- package/dist/{skillopt-optimization-method-C_UrqZs2.js → skillopt-optimization-method-Donmq4sq.js} +2 -2
- package/dist/{skillopt-optimization-method-C_UrqZs2.js.map → skillopt-optimization-method-Donmq4sq.js.map} +1 -1
- package/docs/multishot-golden-records.md +12 -1
- package/docs/search-history-receipts.md +139 -0
- package/package.json +2 -2
- package/dist/index-BjBjxiVv.d.ts.map +0 -1
- package/dist/llm-judge-DrzsVS5k.js.map +0 -1
- package/dist/provenance-LrOEOHQb.d.ts.map +0 -1
package/dist/cli.js
CHANGED
|
@@ -1,6 +1,6 @@
|
|
|
1
1
|
#!/usr/bin/env node
|
|
2
2
|
import { o as runRolloutReleaseCli } from "./hf-dataset-XggBupCr.js";
|
|
3
|
-
import { n as runAnalystBenchmarkCommand } from "./benchmark-command-
|
|
3
|
+
import { n as runAnalystBenchmarkCommand } from "./benchmark-command-Cz4fDmsk.js";
|
|
4
4
|
import { a as runRpcBatch, o as runRpcOnce, p as handleVersion, r as startServerAsync, s as buildOpenApi } from "./server-D9wQclzG.js";
|
|
5
5
|
import { writeFileSync } from "node:fs";
|
|
6
6
|
//#region src/cli-config.ts
|
package/dist/contract/index.d.ts
CHANGED
|
@@ -6,12 +6,12 @@ import { n as buildDefaultAnalystRegistry, t as DefaultAnalystRegistryOptions }
|
|
|
6
6
|
import { C as JudgeDimension, H as SurfaceProposer, M as OptimizerConfig, R as Scenario, S as JudgeConfig, V as SessionScript, _ as GateDecision, a as CampaignResult, b as GenerationRecord, c as CampaignTraceWriter, d as DispatchContext, f as DispatchFn, g as GateContribution, h as GateContext, i as CampaignCostMeter, j as MutableSurface, l as CodeSurface, m as GateCheckStatus, n as CampaignArtifactWriter, p as Gate, r as CampaignCellResult, t as CampaignAggregates, v as GateResult, w as JudgeScore, y as GenerationCandidate } from "../types-C1Bmeb8X.js";
|
|
7
7
|
import { a as FailureClusterInsight, c as JudgeInsight, d as Recommendation, f as ReleaseSummary, i as FailureClassTally, l as LiftInsight, m as TokenUsageInsight, n as ExecutionErrorOutcomeCell, o as InsightReport, p as ScalarDistribution, r as ExecutionInsight, s as InterRaterInsight, t as CostProvenanceSummary, u as OutcomeCorrelationInsight } from "../insight-report-BeT8KCgI.js";
|
|
8
8
|
import { C as analyzeRuns, S as SummarizeExecutionOptions, b as AnalyzeRunsOptions, w as summarizeExecution, x as ExecutionReport } from "../engine-CIy18RTX.js";
|
|
9
|
-
import { $ as OptimizationTokenUsage,
|
|
10
|
-
import { B as runReferenceEquivalenceJudge, C as ExternalTextOptimizerContext, E as ExternalTextEvaluationResponse, F as ReferenceEquivalenceJudgeInput, I as ReferenceEquivalenceJudgeOptions, L as ReferenceEquivalenceJudgeResult, N as REFERENCE_EQUIVALENCE_INPUT_LIMITS, P as REFERENCE_EQUIVALENCE_JUDGE_VERSION, R as ReferenceEquivalenceScenario, S as ExternalTextOptimizationMethodConfig, T as ExternalOptimizationExample, _ as DefaultProductionGateOptions, a as GepaAdaptiveEngineRun, b as composeGate, c as GepaOptimizationMethodConfig, d as gepaOptimizationMethod, f as OpenAICompatibleOptimizerModel, g as DefaultProductionGateCheck, h as heldOutGate, i as skillOptOptimizationMethod, j as campaignSplitDigest, l as GepaOptimizationRecipe, m as HeldOutGateOptions, n as SkillOptRunnerCommand, o as GepaEngineOptions, p as OptimizerModelBudget, r as SkillOptTrainerConfig, s as GepaEngineRun, t as SkillOptOptimizationMethodConfig, u as GepaRunnerCommand, v as DefaultProductionRewardHackingOptions, w as ExternalTextOptimizerResult, x as externalTextOptimizationMethod, y as defaultProductionGate, z as createReferenceEquivalenceJudge } from "../skillopt-optimization-method-
|
|
9
|
+
import { $ as OptimizationTokenUsage, An as LlmJudgeDimension, Cn as CampaignStorage, D as runEval, E as RunEvalOptions, En as inMemoryCampaignStorage, G as OptimizationMethodComparison, H as CompareOptimizationMethodsOptions, J as OptimizationMethodProvenance, K as OptimizationMethodInput, Mn as llmJudge, Q as OptimizationPackageSource, Tn as fsCampaignStorage, U as ComparisonCost, W as OptimizationMethod, Y as OptimizationMethodResult, _n as RunCampaignOptions, b as RunImprovementLoopResult, gn as CampaignCellFailureReceipt, jn as LlmJudgeOptions, tt as compareOptimizationMethods, vn as runCampaign, x as runImprovementLoop, y as RunImprovementLoopOptions } from "../provenance-DA-Pmyfv.js";
|
|
10
|
+
import { B as runReferenceEquivalenceJudge, C as ExternalTextOptimizerContext, E as ExternalTextEvaluationResponse, F as ReferenceEquivalenceJudgeInput, I as ReferenceEquivalenceJudgeOptions, L as ReferenceEquivalenceJudgeResult, N as REFERENCE_EQUIVALENCE_INPUT_LIMITS, P as REFERENCE_EQUIVALENCE_JUDGE_VERSION, R as ReferenceEquivalenceScenario, S as ExternalTextOptimizationMethodConfig, T as ExternalOptimizationExample, _ as DefaultProductionGateOptions, a as GepaAdaptiveEngineRun, b as composeGate, c as GepaOptimizationMethodConfig, d as gepaOptimizationMethod, f as OpenAICompatibleOptimizerModel, g as DefaultProductionGateCheck, h as heldOutGate, i as skillOptOptimizationMethod, j as campaignSplitDigest, l as GepaOptimizationRecipe, m as HeldOutGateOptions, n as SkillOptRunnerCommand, o as GepaEngineOptions, p as OptimizerModelBudget, r as SkillOptTrainerConfig, s as GepaEngineRun, t as SkillOptOptimizationMethodConfig, u as GepaRunnerCommand, v as DefaultProductionRewardHackingOptions, w as ExternalTextOptimizerResult, x as externalTextOptimizationMethod, y as defaultProductionGate, z as createReferenceEquivalenceJudge } from "../skillopt-optimization-method-CrY0OG17.js";
|
|
11
11
|
import { a as ObjectiveSource, c as PromotionPolicy, d as paretoSignificanceGate, i as EvidenceVector, l as buildEvidenceVector, n as AxisVerdict, o as ParetoSignificanceGateOptions, r as BuildEvidenceVectorOptions, s as PromotionObjective, t as AxisEvidence, u as paretoPolicy } from "../promotion-policy-CewdjfCJ.js";
|
|
12
12
|
import { c as EvalRunGenerationSnapshot, g as TraceSpanEvent, n as HostedTenant, o as EvalRunCellScore, s as EvalRunEvent } from "../client-BV7icIfy.js";
|
|
13
13
|
import { i as InMemoryOutcomeStore, n as FileSystemOutcomeStore, o as OutcomeStore, r as FileSystemOutcomeStoreOptions, t as DeploymentOutcome } from "../outcome-store-BYHIuO0e.js";
|
|
14
|
-
import { a as DefinedAgentEval, c as SelfImproveOptions, d as SelfImproveRunError, f as selfImprove, i as DefineAgentEvalOptions, l as SelfImproveProgressEvent, n as AgentEvalEvaluateOptions, o as defineAgentEval, r as AgentEvalImproveOptions, s as SelfImproveBudget, t as AgentEvalAgent, u as SelfImproveResult } from "../define-agent-eval-
|
|
14
|
+
import { a as DefinedAgentEval, c as SelfImproveOptions, d as SelfImproveRunError, f as selfImprove, i as DefineAgentEvalOptions, l as SelfImproveProgressEvent, n as AgentEvalEvaluateOptions, o as defineAgentEval, r as AgentEvalImproveOptions, s as SelfImproveBudget, t as AgentEvalAgent, u as SelfImproveResult } from "../define-agent-eval-hXLUBKtb.js";
|
|
15
15
|
import { AgentCandidateBenchmarkCellRef, AgentCandidateBenchmarkSuiteInputs, AgentCandidateBenchmarkTask, AgentCandidateBenchmarkTaskMaterial, AgentCandidateBundle, AgentCandidateEvaluationPolicy, AgentCandidateExperiment, AgentCandidateExperimentMaterial, AgentCandidateExperimentMeasurement, AgentImprovementCost, AgentImprovementMeasuredComparison, AgentProfileImprovementExperiment, AgentProfileImprovementExperimentMaterial, AgentProfileImprovementMeasuredComparison, AgentProfileImprovementMeasurement, AgentProfileImprovementRunCell, AgentProfileImprovementRunReceipt, AgentProfileImprovementSuiteInputs, AgentProfileImprovementTask, AgentProfileImprovementTaskMaterial, CandidateExecutionEvidence, Sha256Digest } from "@tangle-network/agent-interface";
|
|
16
16
|
//#region src/contract/measured-comparison.d.ts
|
|
17
17
|
interface SealCandidateBenchmarkSuiteOptions {
|
package/dist/contract/index.js
CHANGED
|
@@ -1,8 +1,8 @@
|
|
|
1
1
|
import { s as ValidationError } from "../errors-Dngq5h35.js";
|
|
2
2
|
import { r as pairedBootstrap } from "../paired-tests-BHIhYVdu.js";
|
|
3
|
-
import { a as summarizeExecution, i as analyzeRuns, n as SelfImproveRunError, r as selfImprove, t as defineAgentEval } from "../define-agent-eval-
|
|
3
|
+
import { a as summarizeExecution, i as analyzeRuns, n as SelfImproveRunError, r as selfImprove, t as defineAgentEval } from "../define-agent-eval-CvZQW4u9.js";
|
|
4
4
|
import { a as parseRunRecordSafe } from "../run-record-D2lDdSAz.js";
|
|
5
|
-
import {
|
|
5
|
+
import { $ as runEval, et as runCampaign, f as runImprovementLoop, q as defaultProductionGate, t as llmJudge, ut as campaignSplitDigest, x as compareOptimizationMethods } from "../llm-judge-DWq1Ptco.js";
|
|
6
6
|
import { i as isModelPriced, n as estimateCost } from "../metrics-Qv-cpptD.js";
|
|
7
7
|
import { i as CostLedger } from "../cost-ledger-B1qx30B4.js";
|
|
8
8
|
import { d as mapConcurrentRange } from "../ledger-core-DTae9rv_.js";
|
|
@@ -15,7 +15,7 @@ import { LLM_MODEL_ATTR_KEYS, SPAN_KIND_ATTR_KEYS } from "../trace-attributes.js
|
|
|
15
15
|
import { t as extractUsage } from "../extract-usage-BrQ8mCLX.js";
|
|
16
16
|
import { n as InMemoryOutcomeStore, t as FileSystemOutcomeStore } from "../outcome-store-ChBKlTd_.js";
|
|
17
17
|
import { i as summarizeTraceErrors, n as recordAggregateMeasurements, r as summarizeExecutionMeasurements, t as readTaskFailureLabels } from "../task-failure-attributes--ZTP3tYO.js";
|
|
18
|
-
import { a as externalTextOptimizationMethod, c as REFERENCE_EQUIVALENCE_INPUT_LIMITS, d as runReferenceEquivalenceJudge, i as composeGate, l as REFERENCE_EQUIVALENCE_JUDGE_VERSION, n as gepaOptimizationMethod, r as heldOutGate, t as skillOptOptimizationMethod, u as createReferenceEquivalenceJudge } from "../skillopt-optimization-method-
|
|
18
|
+
import { a as externalTextOptimizationMethod, c as REFERENCE_EQUIVALENCE_INPUT_LIMITS, d as runReferenceEquivalenceJudge, i as composeGate, l as REFERENCE_EQUIVALENCE_JUDGE_VERSION, n as gepaOptimizationMethod, r as heldOutGate, t as skillOptOptimizationMethod, u as createReferenceEquivalenceJudge } from "../skillopt-optimization-method-Donmq4sq.js";
|
|
19
19
|
import { n as paretoPolicy, r as paretoSignificanceGate, t as buildEvidenceVector } from "../promotion-policy-xzA40Evo.js";
|
|
20
20
|
import { createHash } from "node:crypto";
|
|
21
21
|
import { agentCandidateBenchmarkSuiteSchema, agentCandidateBenchmarkTaskSchema, agentCandidateBundleSchema, agentCandidateEvaluationPolicySchema, agentCandidateExperimentSchema, agentImprovementMeasuredComparisonSchema, agentProfileImprovementExperimentSchema, agentProfileImprovementMeasuredComparisonSchema, agentProfileImprovementRunCellSchema, agentProfileImprovementRunReceiptSchema, agentProfileImprovementSuiteInputsSchema, agentProfileImprovementSuiteSchema, agentProfileImprovementTaskSchema, candidateExecutionEvidenceSchema, canonicalCandidateDigest, canonicalCandidateJson, numbersApproximatelyEqual, omitTopLevelDigest } from "@tangle-network/agent-interface";
|
|
@@ -9,7 +9,7 @@ import { r as welchsTTest } from "./baseline-BhPRQBVn.js";
|
|
|
9
9
|
import { r as observedSplitScore } from "./reward-nw2xZGZG.js";
|
|
10
10
|
import { c as validateRunRecord, i as modelHasSnapshot } from "./run-record-D2lDdSAz.js";
|
|
11
11
|
import { r as paretoChart } from "./summary-report-Blysd6Z2.js";
|
|
12
|
-
import {
|
|
12
|
+
import { $ as runEval, A as surfaceHash, f as runImprovementLoop, k as surfaceContentHash, nt as resolveRunDir, o as emitLoopProvenance, q as defaultProductionGate, s as loopProvenanceArgsFromResult, y as assertOptimizationResult } from "./llm-judge-DWq1Ptco.js";
|
|
13
13
|
import { c as campaignCellTaskScore, l as campaignCellToRunRecord, o as campaignCellExecutionEvidence, s as campaignCellJudgeDimensions } from "./reward-hacking-DFo2FU5J.js";
|
|
14
14
|
import { S as inMemoryCampaignStorage, b as createRunCostLedger, x as fsCampaignStorage } from "./external-optimizer-subprocess-DU1KM8yV.js";
|
|
15
15
|
import { t as powerPreflight } from "./power-preflight-DEw-uC7q.js";
|
|
@@ -1491,4 +1491,4 @@ function requirePositiveInteger(value, field) {
|
|
|
1491
1491
|
//#endregion
|
|
1492
1492
|
export { summarizeExecution as a, analyzeRuns as i, SelfImproveRunError as n, checkCanaries as o, selfImprove as r, defineAgentEval as t };
|
|
1493
1493
|
|
|
1494
|
-
//# sourceMappingURL=define-agent-eval-
|
|
1494
|
+
//# sourceMappingURL=define-agent-eval-CvZQW4u9.js.map
|