@tangle-network/agent-eval 0.177.0 → 0.179.0
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/CHANGELOG.md +9 -0
- package/dist/adapters/http.d.ts +2 -2
- package/dist/{agent-profile-_xPxqVJt.d.ts → agent-profile-B7yErX0q.d.ts} +3 -3
- package/dist/{agent-profile-_xPxqVJt.d.ts.map → agent-profile-B7yErX0q.d.ts.map} +1 -1
- package/dist/analyst/index.d.ts +10 -10
- package/dist/analyst/index.js +5 -5
- package/dist/{benchmark-command-BrsZhMSk.js → benchmark-command-CY6Dg5t5.js} +6 -6
- package/dist/{benchmark-command-BrsZhMSk.js.map → benchmark-command-CY6Dg5t5.js.map} +1 -1
- package/dist/benchmarks/index.d.ts +3 -3
- package/dist/benchmarks/index.js +2 -2
- package/dist/campaign/index.d.ts +5 -5
- package/dist/campaign/index.js +3 -3
- package/dist/{campaign-CIn-ErlJ.js → campaign-BGEurASO.js} +8 -4
- package/dist/campaign-BGEurASO.js.map +1 -0
- package/dist/cli.js +1 -1
- package/dist/{client-vyYQg3bm.d.ts → client-CuQgX33c.d.ts} +2 -2
- package/dist/{client-vyYQg3bm.d.ts.map → client-CuQgX33c.d.ts.map} +1 -1
- package/dist/contract/index.d.ts +9 -9
- package/dist/contract/index.js +6 -6
- package/dist/{default-registry-DBqVI4pq.js → default-registry-BryMEmr8.js} +2 -2
- package/dist/{default-registry-DBqVI4pq.js.map → default-registry-BryMEmr8.js.map} +1 -1
- package/dist/{default-registry-FfNzaUHV.d.ts → default-registry-IGDE9XIC.d.ts} +6 -6
- package/dist/{default-registry-FfNzaUHV.d.ts.map → default-registry-IGDE9XIC.d.ts.map} +1 -1
- package/dist/{define-agent-eval-CqmlXUfQ.d.ts → define-agent-eval-Cx4Ls9ta.d.ts} +6 -6
- package/dist/{define-agent-eval-CqmlXUfQ.d.ts.map → define-agent-eval-Cx4Ls9ta.d.ts.map} +1 -1
- package/dist/{define-agent-eval-CJG7LD9M.js → define-agent-eval-Dzidv34q.js} +2 -2
- package/dist/{define-agent-eval-CJG7LD9M.js.map → define-agent-eval-Dzidv34q.js.map} +1 -1
- package/dist/{dspy-rlm-engine-DqjER2sV.js → dspy-rlm-engine-xKiWmj_G.js} +2 -2
- package/dist/{dspy-rlm-engine-DqjER2sV.js.map → dspy-rlm-engine-xKiWmj_G.js.map} +1 -1
- package/dist/{engine-CvW_I72-.d.ts → engine-CX8ReXkn.d.ts} +5 -5
- package/dist/{engine-CvW_I72-.d.ts.map → engine-CX8ReXkn.d.ts.map} +1 -1
- package/dist/{exact-types-BKOEILRP.d.ts → exact-types-B7LC1EyX.d.ts} +2 -2
- package/dist/{exact-types-BKOEILRP.d.ts.map → exact-types-B7LC1EyX.d.ts.map} +1 -1
- package/dist/experiment/index.d.ts +2 -2
- package/dist/{experiment-tracker-CNwqCZFD.d.ts → experiment-tracker-B3TiF5-u.d.ts} +2 -2
- package/dist/{experiment-tracker-CNwqCZFD.d.ts.map → experiment-tracker-B3TiF5-u.d.ts.map} +1 -1
- package/dist/{feedback-trajectory-CMnv_uYs.d.ts → feedback-trajectory-eHWNv5Aj.d.ts} +3 -3
- package/dist/{feedback-trajectory-CMnv_uYs.d.ts.map → feedback-trajectory-eHWNv5Aj.d.ts.map} +1 -1
- package/dist/hosted/index.d.ts +1 -1
- package/dist/{index-CtGf6e6X.d.ts → index-BxWvILU8.d.ts} +10 -6
- package/dist/index-BxWvILU8.d.ts.map +1 -0
- package/dist/{index-BAAiSF3_.d.ts → index-CbLmrWCa.d.ts} +6 -6
- package/dist/{index-BAAiSF3_.d.ts.map → index-CbLmrWCa.d.ts.map} +1 -1
- package/dist/{index-DuaNwvse.d.ts → index-DxNYmx4a.d.ts} +9 -9
- package/dist/{index-DuaNwvse.d.ts.map → index-DxNYmx4a.d.ts.map} +1 -1
- package/dist/index.d.ts +15 -15
- package/dist/index.js +9 -9
- package/dist/{kind-factory-BLvL-E44.js → kind-factory-D5HOW3R0.js} +119 -15
- package/dist/kind-factory-D5HOW3R0.js.map +1 -0
- package/dist/{llm-judge-CV80fkYA.js → llm-judge-v80Kmu9g.js} +4 -3
- package/dist/{llm-judge-CV80fkYA.js.map → llm-judge-v80Kmu9g.js.map} +1 -1
- package/dist/{matrix-CJtXz1ky.d.ts → matrix-DeMmnWrP.d.ts} +2 -2
- package/dist/{matrix-CJtXz1ky.d.ts.map → matrix-DeMmnWrP.d.ts.map} +1 -1
- package/dist/multishot/golden/index.d.ts +1 -1
- package/dist/multishot/index.d.ts +2 -2
- package/dist/openapi.json +1 -1
- package/dist/{produced-state-CQFi465p.js → produced-state-Cv0kJJuP.js} +2 -2
- package/dist/{produced-state-CQFi465p.js.map → produced-state-Cv0kJJuP.js.map} +1 -1
- package/dist/{registry-7pOUBrtX.d.ts → registry-ByVld1-5.d.ts} +3 -3
- package/dist/{registry-7pOUBrtX.d.ts.map → registry-ByVld1-5.d.ts.map} +1 -1
- package/dist/rl.d.ts +1 -1
- package/dist/{semantic-concept-judge-Dw-f7TEs.js → semantic-concept-judge-Bi6_iGqg.js} +3 -3
- package/dist/{semantic-concept-judge-Dw-f7TEs.js.map → semantic-concept-judge-Bi6_iGqg.js.map} +1 -1
- package/dist/{skillopt-optimization-method-D0o2c2yM.js → skillopt-optimization-method-C3oYul8v.js} +2 -2
- package/dist/{skillopt-optimization-method-D0o2c2yM.js.map → skillopt-optimization-method-C3oYul8v.js.map} +1 -1
- package/dist/{statistical-heldout-Z9NROFFS.d.ts → statistical-heldout-0La5ZTlv.d.ts} +2 -2
- package/dist/{statistical-heldout-Z9NROFFS.d.ts.map → statistical-heldout-0La5ZTlv.d.ts.map} +1 -1
- package/dist/{store-otlp-DV_H2HDu.js → store-otlp-DWGUwlyj.js} +7 -2
- package/dist/store-otlp-DWGUwlyj.js.map +1 -0
- package/dist/{store-tool-spans-4o55ABER.d.ts → store-tool-spans-4J1EDElP.d.ts} +7 -4
- package/dist/{store-tool-spans-4o55ABER.d.ts.map → store-tool-spans-4J1EDElP.d.ts.map} +1 -1
- package/dist/{store-tool-spans-B9tjys_h.js → store-tool-spans-ceJoiUgS.js} +3 -3
- package/dist/{store-tool-spans-B9tjys_h.js.map → store-tool-spans-ceJoiUgS.js.map} +1 -1
- package/dist/{task-failure-attributes-CUy9mkIY.js → task-failure-attributes-B072KO_n.js} +2 -2
- package/dist/{task-failure-attributes-CUy9mkIY.js.map → task-failure-attributes-B072KO_n.js.map} +1 -1
- package/dist/{tool-groups-DAe1t6zb.d.ts → tool-groups-2QA0S7dK.d.ts} +4 -4
- package/dist/tool-groups-2QA0S7dK.d.ts.map +1 -0
- package/dist/trace-repair/index.d.ts +1 -1
- package/dist/traces.d.ts +4 -4
- package/dist/traces.js +4 -4
- package/dist/{types-Dd1ejaeI.d.ts → types-BmlkCrg0.d.ts} +2 -2
- package/dist/{types-Dd1ejaeI.d.ts.map → types-BmlkCrg0.d.ts.map} +1 -1
- package/dist/{types-BJz2CPTM.d.ts → types-C34V4Vto.d.ts} +2 -2
- package/dist/{types-BJz2CPTM.d.ts.map → types-C34V4Vto.d.ts.map} +1 -1
- package/dist/{types-DN2WdT5S.d.ts → types-DzuaM493.d.ts} +40 -2
- package/dist/types-DzuaM493.d.ts.map +1 -0
- package/dist/wire/index.d.ts +1 -1
- package/docs/campaign-proposers.md +7 -0
- package/docs/trace-analysis.md +45 -0
- package/package.json +1 -1
- package/dist/campaign-CIn-ErlJ.js.map +0 -1
- package/dist/index-CtGf6e6X.d.ts.map +0 -1
- package/dist/kind-factory-BLvL-E44.js.map +0 -1
- package/dist/store-otlp-DV_H2HDu.js.map +0 -1
- package/dist/tool-groups-DAe1t6zb.d.ts.map +0 -1
- package/dist/types-DN2WdT5S.d.ts.map +0 -1
package/dist/cli.js
CHANGED
|
@@ -1,7 +1,7 @@
|
|
|
1
1
|
#!/usr/bin/env node
|
|
2
2
|
import { i as runRolloutReleaseCli } from "./hf-dataset-D8_RNIis.js";
|
|
3
3
|
import { t as createChatClient } from "./chat-client-CkmjYlfB.js";
|
|
4
|
-
import { t as runAnalystBenchmarkCommand } from "./benchmark-command-
|
|
4
|
+
import { t as runAnalystBenchmarkCommand } from "./benchmark-command-CY6Dg5t5.js";
|
|
5
5
|
import { a as runRpcBatch, o as runRpcOnce, p as handleVersion, r as startServerAsync, s as buildOpenApi } from "./server-D_cjseFN.js";
|
|
6
6
|
import { t as runSupervisorRunCommand } from "./report-command-DKlXfU5r.js";
|
|
7
7
|
import { writeFileSync } from "node:fs";
|
|
@@ -1,5 +1,5 @@
|
|
|
1
1
|
import { l as RunTerminalOutcome } from "./run-record-DTv1MdjK.js";
|
|
2
|
-
import { _ as GateDecision, j as MutableSurface } from "./types-
|
|
2
|
+
import { _ as GateDecision, j as MutableSurface } from "./types-C34V4Vto.js";
|
|
3
3
|
import { o as InsightReport } from "./insight-report-DETqPc_A.js";
|
|
4
4
|
//#region src/hosted/types.d.ts
|
|
5
5
|
declare const HOSTED_WIRE_VERSION: '2026-07-24.v1';
|
|
@@ -199,4 +199,4 @@ declare function hostedClientFromEnv(overrides?: Partial<HostedTenant> & {
|
|
|
199
199
|
}): HostedClient | undefined;
|
|
200
200
|
//#endregion
|
|
201
201
|
export { UnixNanoTimestamp as _, hostedTenantFromEnv as a, EvalRunGenerationSnapshot as c, HostedIngestHeaders as d, HostedWireVersion as f, TraceSpanEvent as g, IngestTracesRequest as h, hostedClientFromEnv as i, EvalRunStatus as l, IngestResponse as m, HostedTenant as n, EvalRunCellScore as o, IngestEvalRunsRequest as p, createHostedClient as r, EvalRunEvent as s, HostedClient as t, HOSTED_WIRE_VERSION as u };
|
|
202
|
-
//# sourceMappingURL=client-
|
|
202
|
+
//# sourceMappingURL=client-CuQgX33c.d.ts.map
|
|
@@ -1 +1 @@
|
|
|
1
|
-
{"version":3,"file":"client-
|
|
1
|
+
{"version":3,"file":"client-CuQgX33c.d.ts","names":[],"sources":["../src/hosted/types.ts","../src/hosted/client.ts"],"mappings":";;;;cAgCa;KACD,2BAA2B;;UAKtB;;EAEf;;EAEA;;EAEA,yBAAyB;;EAEzB;;;KAMU;UAQK;;EAEf;;EAEA;;EAEA;;EAEA,YAAY,eAAe;;EAE3B,iBAAiB;;EAEjB;;EAEA;;UAGe;;EAEf;;;EAGA;;;EAGA,UAAU;;EAEV,OAAO;;EAEP;;EAEA;;EAEA;;;;;;;UAQe;;EAEf;;EAEA;;EAEA;;EAEA,QAAQ;;EAER,QAAQ;;EAER,WAAW;;EAEX,aAAa;;EAEb,eAAe;;EAEf;;EAEA;;EAEA;;EAEA;;;;;;EAMA,gBAAgB;;;;;;KASN;;;;;;UAOK;EACf;EACA;EACA;EACA;EACA,mBAAmB;EACnB,iBAAiB;EACjB,YAAY;EACZ,SAAS;IACP,cAAc;IACd;IACA,aAAa;;EAEf;IAAW;IAAgC;;;EAE3C;;EAEA;;EAEA;;EAEA;;UAKe;EACf,aAAa;EACb,QAAQ;;UAGO;EACf,aAAa;EACb,OAAO;;UAGQ;;EAEf;;EAEA,UAAU;IAAQ;IAAe;;;;;UC1JlB;;EAEf;;EAEA;;EAEA;;EAEA,mBAAmB;;EAEnB;;EAEA;;UAGe;EACf,cAAc,OAAO,cAAc,0BAA0B,QAAQ;EACrE,eAAe,QAAQ,gBAAgB,0BAA0B,QAAQ;EACzE,aAAa,OAAO,kBAAkB,0BAA0B,QAAQ;WAC/D,QAAQ;WACR,aAAa;;iBAyGR,mBAAmB,QAAQ,eAAe;;;;;;;;;;;;;;;;;;;;;;;;;;;iBAsE1C,oBACd,YAAW,QAAQ;EAAkB,MAAM;IAC1C;iBAiBa,oBACd,YAAW,QAAQ;EAAkB,MAAM;IAC1C"}
|
package/dist/contract/index.d.ts
CHANGED
|
@@ -1,14 +1,14 @@
|
|
|
1
1
|
import { c as CostLedgerHandle } from "../cost-ledger-DbQdN3nO.js";
|
|
2
|
-
import { _ as ProposalFinding, i as AnalystFinding, v as ProposalFindingOrigin, x as makeProposalFinding } from "../types-
|
|
2
|
+
import { _ as ProposalFinding, i as AnalystFinding, v as ProposalFindingOrigin, x as makeProposalFinding } from "../types-DzuaM493.js";
|
|
3
3
|
import { S as createChatClient, _ as CreateChatClientOpts, p as ChatClient } from "../types-gvRsyJLh.js";
|
|
4
|
-
import { $ as paretoSignificanceGate, G as BuildEvidenceVectorOptions, J as ParetoSignificanceGateOptions, K as EvidenceVector, Q as paretoPolicy, U as AxisEvidence, W as AxisVerdict, X as PromotionPolicy, Y as PromotionObjective, Z as buildEvidenceVector, q as ObjectiveSource } from "../statistical-heldout-
|
|
5
|
-
import { C as JudgeDimension, H as SurfaceProposer, M as OptimizerConfig, R as Scenario, S as JudgeConfig, V as SessionScript, _ as GateDecision, a as CampaignResult, b as GenerationRecord, c as CampaignTraceWriter, d as DispatchContext, f as DispatchFn, g as GateContribution, h as GateContext, i as CampaignCostMeter, j as MutableSurface, l as CodeSurface, m as GateCheckStatus, n as CampaignArtifactWriter, p as Gate, r as CampaignCellResult, t as CampaignAggregates, v as GateResult, w as JudgeScore, y as GenerationCandidate } from "../types-
|
|
6
|
-
import { Ar as SkillOptOptimizationMethodConfig, Br as gepaOptimizationMethod, Ci as ReferenceEquivalenceScenario, Di as LlmJudgeOptions, Do as inMemoryCampaignStorage, Ei as LlmJudgeDimension, Eo as fsCampaignStorage, Fi as runImprovementLoop, Fr as GepaEngineOptions, Gr as ExternalTextOptimizerContext, Hr as OptimizerModelBudget, Ir as GepaEngineRun, Jr as ExternalTextEvaluationResponse, Kr as ExternalTextOptimizerResult, Lr as GepaOptimizationMethodConfig, Mi as transientDispatchFailure, Mr as SkillOptTrainerConfig, Ni as RunImprovementLoopOptions, Nr as skillOptOptimizationMethod, Oi as llmJudge, Pi as RunImprovementLoopResult, Pr as GepaAdaptiveEngineRun, Qr as OptimizationMethodComparison, Rr as GepaOptimizationRecipe, Si as ReferenceEquivalenceJudgeResult, Ti as runReferenceEquivalenceJudge, Ur as externalTextOptimizationMethod, Vr as OpenAICompatibleOptimizerModel, Wr as ExternalTextOptimizationMethodConfig, Xr as CompareOptimizationMethodsOptions, Zr as OptimizationMethod, bi as ReferenceEquivalenceJudgeInput, ci as compareOptimizationMethods, co as RunEvalOptions, do as CampaignCellRetryPolicy, dr as DefaultProductionGateCheck, ei as OptimizationMethodInput, fo as RunCampaignOptions, fr as DefaultProductionGateOptions, jo as campaignSplitDigest, jr as SkillOptRunnerCommand, kr as composeGate, lo as runEval, lr as HeldOutGateOptions, mr as defaultProductionGate, ni as OptimizationMethodProvenance, oi as OptimizationPackageSource, po as runCampaign, pr as DefaultProductionRewardHackingOptions, qr as ExternalOptimizationExample, ri as OptimizationMethodResult, si as OptimizationTokenUsage, ui as ComparisonCost, uo as CampaignCellFailureReceipt, ur as heldOutGate, vi as REFERENCE_EQUIVALENCE_INPUT_LIMITS, wi as createReferenceEquivalenceJudge, wo as CampaignStorage, xi as ReferenceEquivalenceJudgeOptions, yi as REFERENCE_EQUIVALENCE_JUDGE_VERSION, zr as GepaRunnerCommand } from "../index-
|
|
4
|
+
import { $ as paretoSignificanceGate, G as BuildEvidenceVectorOptions, J as ParetoSignificanceGateOptions, K as EvidenceVector, Q as paretoPolicy, U as AxisEvidence, W as AxisVerdict, X as PromotionPolicy, Y as PromotionObjective, Z as buildEvidenceVector, q as ObjectiveSource } from "../statistical-heldout-0La5ZTlv.js";
|
|
5
|
+
import { C as JudgeDimension, H as SurfaceProposer, M as OptimizerConfig, R as Scenario, S as JudgeConfig, V as SessionScript, _ as GateDecision, a as CampaignResult, b as GenerationRecord, c as CampaignTraceWriter, d as DispatchContext, f as DispatchFn, g as GateContribution, h as GateContext, i as CampaignCostMeter, j as MutableSurface, l as CodeSurface, m as GateCheckStatus, n as CampaignArtifactWriter, p as Gate, r as CampaignCellResult, t as CampaignAggregates, v as GateResult, w as JudgeScore, y as GenerationCandidate } from "../types-C34V4Vto.js";
|
|
6
|
+
import { Ar as SkillOptOptimizationMethodConfig, Br as gepaOptimizationMethod, Ci as ReferenceEquivalenceScenario, Di as LlmJudgeOptions, Do as inMemoryCampaignStorage, Ei as LlmJudgeDimension, Eo as fsCampaignStorage, Fi as runImprovementLoop, Fr as GepaEngineOptions, Gr as ExternalTextOptimizerContext, Hr as OptimizerModelBudget, Ir as GepaEngineRun, Jr as ExternalTextEvaluationResponse, Kr as ExternalTextOptimizerResult, Lr as GepaOptimizationMethodConfig, Mi as transientDispatchFailure, Mr as SkillOptTrainerConfig, Ni as RunImprovementLoopOptions, Nr as skillOptOptimizationMethod, Oi as llmJudge, Pi as RunImprovementLoopResult, Pr as GepaAdaptiveEngineRun, Qr as OptimizationMethodComparison, Rr as GepaOptimizationRecipe, Si as ReferenceEquivalenceJudgeResult, Ti as runReferenceEquivalenceJudge, Ur as externalTextOptimizationMethod, Vr as OpenAICompatibleOptimizerModel, Wr as ExternalTextOptimizationMethodConfig, Xr as CompareOptimizationMethodsOptions, Zr as OptimizationMethod, bi as ReferenceEquivalenceJudgeInput, ci as compareOptimizationMethods, co as RunEvalOptions, do as CampaignCellRetryPolicy, dr as DefaultProductionGateCheck, ei as OptimizationMethodInput, fo as RunCampaignOptions, fr as DefaultProductionGateOptions, jo as campaignSplitDigest, jr as SkillOptRunnerCommand, kr as composeGate, lo as runEval, lr as HeldOutGateOptions, mr as defaultProductionGate, ni as OptimizationMethodProvenance, oi as OptimizationPackageSource, po as runCampaign, pr as DefaultProductionRewardHackingOptions, qr as ExternalOptimizationExample, ri as OptimizationMethodResult, si as OptimizationTokenUsage, ui as ComparisonCost, uo as CampaignCellFailureReceipt, ur as heldOutGate, vi as REFERENCE_EQUIVALENCE_INPUT_LIMITS, wi as createReferenceEquivalenceJudge, wo as CampaignStorage, xi as ReferenceEquivalenceJudgeOptions, yi as REFERENCE_EQUIVALENCE_JUDGE_VERSION, zr as GepaRunnerCommand } from "../index-BxWvILU8.js";
|
|
7
7
|
import { i as InMemoryOutcomeStore, n as FileSystemOutcomeStore, o as OutcomeStore, r as FileSystemOutcomeStoreOptions, t as DeploymentOutcome } from "../outcome-store-BYHIuO0e.js";
|
|
8
8
|
import { a as FailureClusterInsight, c as JudgeInsight, d as Recommendation, f as ReleaseSummary, i as FailureClassTally, l as LiftInsight, m as TokenUsageInsight, n as ExecutionErrorOutcomeCell, o as InsightReport, p as ScalarDistribution, r as ExecutionInsight, s as InterRaterInsight, t as CostProvenanceSummary, u as OutcomeCorrelationInsight } from "../insight-report-DETqPc_A.js";
|
|
9
|
-
import { n as HostedTenant } from "../client-
|
|
10
|
-
import { _ as SelfImproveMethodResult, a as DefinedAgentEval, c as SelfImproveMethodOptions, d as SelfImproveProposerOptions, f as SelfImproveProposerResult, g as SelfImproveMethodProvenance, h as selfImprove, i as DefineAgentEvalOptions, l as SelfImproveOptions, m as SelfImproveRunError, n as AgentEvalEvaluateOptions, o as defineAgentEval, p as SelfImproveResult, r as AgentEvalImproveOptions, s as SelfImproveBudget, t as AgentEvalAgent, u as SelfImproveProgressEvent } from "../define-agent-eval-
|
|
11
|
-
import { $ as diffRunBaselineToWinner, A as CodeAgentSessionActionStatus, At as measuredComparisonFromCandidateExperiment, B as AgentTraceFile, C as fromOpenCodeSession, Ct as EvaluatePairedMeasurementsOptions, D as streamCodeAgentJsonlFile, Dt as RunCandidateExperimentOptions, E as parseCodeAgentJsonlFile, Et as PairedMeasurementEvaluation, F as CodeAgentSessionTerminalStatus, Ft as verifyCandidateExperiment, G as PartitionByAuthoringModelResult, H as AgentTraceRange, I as observeCodeAgentSession, It as verifyCandidateExperimentComparison, J as EvalCellScoreDelta, K as parseAgentTrace, L as AgentTraceContributor, M as CodeAgentSessionExecutionReceipt, Mt as sealCandidateBenchmarkSuite, N as CodeAgentSessionObservation, Nt as sealCandidateBenchmarkTask, O as CodeAgentSessionAction, Ot as SealCandidateBenchmarkSuiteOptions, P as CodeAgentSessionSource, Pt as sealCandidateExperiment, Q as diffGenerations, R as AgentTraceContributorType, S as fromKimiCodeSession, St as CompareCandidateExperimentOptions, T as parseCodeAgentJsonl, Tt as PairedMeasurementAdapter, U as AgentTraceRecord, V as AgentTraceIndex, W as AuthoringProvenance, X as EvalGenerationDiff, Y as EvalDimensionDelta, Z as EvalRunDiff, _ as CodeAgentSessionIntakeResult, _t as sealAgentProfileImprovementSuite, a as FromFeedbackTableOptions, at as FromRunRecordDirOptions, b as fromClaudeCodeSession, bt as CandidateExperimentExecutionInput, c as CodeAgentStoreObservation, ct as fromRunRecordDir, d as CodeAgentStoreScope, dt as CompareAgentProfileImprovementExperimentOptions, et as diffRuns, f as CodeAgentStoreSession, ft as RunAgentProfileImprovementExperimentOptions, g as CodeAgentSessionIntakeOptions, gt as sealAgentProfileImprovementExperiment, h as CodeAgentSessionDiagnostic, ht as runAgentProfileImprovementExperiment, i as FeedbackTableRow, it as evalReportingSuite, j as CodeAgentSessionActionSurface, jt as runCandidateExperiment, k as CodeAgentSessionActionKind, kt as evaluatePairedMeasurements, l as CodeAgentStoreRejection, lt as AgentProfileImprovementExperimentExecutionInput, m as CodeAgentJsonlLine, mt as measuredComparisonFromAgentProfileImprovementExperiment, n as fromOtelSpans, nt as EvalReportingSuiteOptions, o as FromFeedbackTableResult, ot as FromRunRecordDirResult, p as observeCodeAgentStore, pt as SealAgentProfileImprovementSuiteOptions, q as partitionRunsByAuthoringModel, r as FeedbackTableMeta, rt as EvalReportingSuiteResult, s as fromFeedbackTable, st as RunRecordRejection, t as FromOtelSpansOptions, tt as EvalReportingSuiteInput, u as CodeAgentStoreRejections, ut as AgentProfileImprovementExperimentRun, v as CodeAgentSessionMetrics, vt as sealAgentProfileImprovementTask, w as fromPiSession, wt as PairedMeasurement, x as fromCodexSession, xt as CandidateExperimentRun, y as ParsedCodeAgentJsonl, yt as verifyAgentProfileImprovementExperimentComparison, z as AgentTraceConversation } from "../index-
|
|
12
|
-
import { n as buildDefaultAnalystRegistry, t as DefaultAnalystRegistryOptions } from "../default-registry-
|
|
13
|
-
import { S as summarizeExecution, b as SummarizeExecutionOptions, v as AnalyzeRunsOptions, x as analyzeRuns, y as ExecutionReport } from "../engine-
|
|
9
|
+
import { n as HostedTenant } from "../client-CuQgX33c.js";
|
|
10
|
+
import { _ as SelfImproveMethodResult, a as DefinedAgentEval, c as SelfImproveMethodOptions, d as SelfImproveProposerOptions, f as SelfImproveProposerResult, g as SelfImproveMethodProvenance, h as selfImprove, i as DefineAgentEvalOptions, l as SelfImproveOptions, m as SelfImproveRunError, n as AgentEvalEvaluateOptions, o as defineAgentEval, p as SelfImproveResult, r as AgentEvalImproveOptions, s as SelfImproveBudget, t as AgentEvalAgent, u as SelfImproveProgressEvent } from "../define-agent-eval-Cx4Ls9ta.js";
|
|
11
|
+
import { $ as diffRunBaselineToWinner, A as CodeAgentSessionActionStatus, At as measuredComparisonFromCandidateExperiment, B as AgentTraceFile, C as fromOpenCodeSession, Ct as EvaluatePairedMeasurementsOptions, D as streamCodeAgentJsonlFile, Dt as RunCandidateExperimentOptions, E as parseCodeAgentJsonlFile, Et as PairedMeasurementEvaluation, F as CodeAgentSessionTerminalStatus, Ft as verifyCandidateExperiment, G as PartitionByAuthoringModelResult, H as AgentTraceRange, I as observeCodeAgentSession, It as verifyCandidateExperimentComparison, J as EvalCellScoreDelta, K as parseAgentTrace, L as AgentTraceContributor, M as CodeAgentSessionExecutionReceipt, Mt as sealCandidateBenchmarkSuite, N as CodeAgentSessionObservation, Nt as sealCandidateBenchmarkTask, O as CodeAgentSessionAction, Ot as SealCandidateBenchmarkSuiteOptions, P as CodeAgentSessionSource, Pt as sealCandidateExperiment, Q as diffGenerations, R as AgentTraceContributorType, S as fromKimiCodeSession, St as CompareCandidateExperimentOptions, T as parseCodeAgentJsonl, Tt as PairedMeasurementAdapter, U as AgentTraceRecord, V as AgentTraceIndex, W as AuthoringProvenance, X as EvalGenerationDiff, Y as EvalDimensionDelta, Z as EvalRunDiff, _ as CodeAgentSessionIntakeResult, _t as sealAgentProfileImprovementSuite, a as FromFeedbackTableOptions, at as FromRunRecordDirOptions, b as fromClaudeCodeSession, bt as CandidateExperimentExecutionInput, c as CodeAgentStoreObservation, ct as fromRunRecordDir, d as CodeAgentStoreScope, dt as CompareAgentProfileImprovementExperimentOptions, et as diffRuns, f as CodeAgentStoreSession, ft as RunAgentProfileImprovementExperimentOptions, g as CodeAgentSessionIntakeOptions, gt as sealAgentProfileImprovementExperiment, h as CodeAgentSessionDiagnostic, ht as runAgentProfileImprovementExperiment, i as FeedbackTableRow, it as evalReportingSuite, j as CodeAgentSessionActionSurface, jt as runCandidateExperiment, k as CodeAgentSessionActionKind, kt as evaluatePairedMeasurements, l as CodeAgentStoreRejection, lt as AgentProfileImprovementExperimentExecutionInput, m as CodeAgentJsonlLine, mt as measuredComparisonFromAgentProfileImprovementExperiment, n as fromOtelSpans, nt as EvalReportingSuiteOptions, o as FromFeedbackTableResult, ot as FromRunRecordDirResult, p as observeCodeAgentStore, pt as SealAgentProfileImprovementSuiteOptions, q as partitionRunsByAuthoringModel, r as FeedbackTableMeta, rt as EvalReportingSuiteResult, s as fromFeedbackTable, st as RunRecordRejection, t as FromOtelSpansOptions, tt as EvalReportingSuiteInput, u as CodeAgentStoreRejections, ut as AgentProfileImprovementExperimentRun, v as CodeAgentSessionMetrics, vt as sealAgentProfileImprovementTask, w as fromPiSession, wt as PairedMeasurement, x as fromCodexSession, xt as CandidateExperimentRun, y as ParsedCodeAgentJsonl, yt as verifyAgentProfileImprovementExperimentComparison, z as AgentTraceConversation } from "../index-DxNYmx4a.js";
|
|
12
|
+
import { n as buildDefaultAnalystRegistry, t as DefaultAnalystRegistryOptions } from "../default-registry-IGDE9XIC.js";
|
|
13
|
+
import { S as summarizeExecution, b as SummarizeExecutionOptions, v as AnalyzeRunsOptions, x as analyzeRuns, y as ExecutionReport } from "../engine-CX8ReXkn.js";
|
|
14
14
|
export { type AgentEvalAgent, type AgentEvalEvaluateOptions, type AgentEvalImproveOptions, type AgentProfileImprovementExperimentExecutionInput, type AgentProfileImprovementExperimentRun, type AgentTraceContributor, type AgentTraceContributorType, type AgentTraceConversation, type AgentTraceFile, type AgentTraceIndex, type AgentTraceRange, type AgentTraceRecord, type AnalystFinding, type AnalyzeRunsOptions, type AuthoringProvenance, type AxisEvidence, type AxisVerdict, type BuildEvidenceVectorOptions, type CampaignAggregates, type CampaignArtifactWriter, type CampaignCellFailureReceipt, type CampaignCellResult, type CampaignCellRetryPolicy, type CampaignCostMeter, type CampaignResult, type CampaignStorage, type CampaignTraceWriter, type CandidateExperimentExecutionInput, type CandidateExperimentRun, type ChatClient, type CodeAgentJsonlLine, type CodeAgentSessionAction, type CodeAgentSessionActionKind, type CodeAgentSessionActionStatus, type CodeAgentSessionActionSurface, type CodeAgentSessionDiagnostic, type CodeAgentSessionExecutionReceipt, type CodeAgentSessionIntakeOptions, type CodeAgentSessionIntakeResult, type CodeAgentSessionMetrics, type CodeAgentSessionObservation, type CodeAgentSessionSource, type CodeAgentSessionTerminalStatus, type CodeAgentStoreObservation, type CodeAgentStoreRejection, type CodeAgentStoreRejections, type CodeAgentStoreScope, type CodeAgentStoreSession, type CodeSurface, type CompareAgentProfileImprovementExperimentOptions, type CompareCandidateExperimentOptions, type CompareOptimizationMethodsOptions, type ComparisonCost, type CostLedgerHandle, type CostProvenanceSummary, type CreateChatClientOpts, type DefaultAnalystRegistryOptions, type DefaultProductionGateCheck, type DefaultProductionGateOptions, type DefaultProductionRewardHackingOptions, type DefineAgentEvalOptions, type DefinedAgentEval, type DeploymentOutcome, type DispatchFn as Dispatch, type DispatchContext, type EvalCellScoreDelta, type EvalDimensionDelta, type EvalGenerationDiff, type EvalReportingSuiteInput, type EvalReportingSuiteOptions, type EvalReportingSuiteResult, type EvalRunDiff, type EvaluatePairedMeasurementsOptions, type EvidenceVector, type ExecutionErrorOutcomeCell, type ExecutionInsight, type ExecutionReport, type ExternalOptimizationExample, type ExternalTextEvaluationResponse, type ExternalTextOptimizationMethodConfig, type ExternalTextOptimizerContext, type ExternalTextOptimizerResult, type FailureClassTally, type FailureClusterInsight, type FeedbackTableMeta, type FeedbackTableRow, FileSystemOutcomeStore, type FileSystemOutcomeStoreOptions, type FromFeedbackTableOptions, type FromFeedbackTableResult, type FromOtelSpansOptions, type FromRunRecordDirOptions, type FromRunRecordDirResult, type Gate, type GateCheckStatus, type GateContext, type GateContribution, type GateDecision, type GateResult, type GenerationCandidate, type GenerationRecord, type GepaAdaptiveEngineRun, type GepaEngineOptions, type GepaEngineRun, type GepaOptimizationMethodConfig, type GepaOptimizationRecipe, type GepaRunnerCommand, type HeldOutGateOptions, type HostedTenant, InMemoryOutcomeStore, type InsightReport, type InterRaterInsight, type JudgeConfig, type JudgeDimension, type JudgeInsight, type JudgeScore, type LiftInsight, type LlmJudgeDimension, type LlmJudgeOptions, type MutableSurface, type ObjectiveSource, type OpenAICompatibleOptimizerModel, type OptimizationMethod, type OptimizationMethodComparison, type OptimizationMethodInput, type OptimizationMethodProvenance, type OptimizationMethodResult, type OptimizationPackageSource, type OptimizationTokenUsage, type OptimizerConfig, type OptimizerModelBudget, type OutcomeCorrelationInsight, type OutcomeStore, type PairedMeasurement, type PairedMeasurementAdapter, type PairedMeasurementEvaluation, type ParetoSignificanceGateOptions, type ParsedCodeAgentJsonl, type PartitionByAuthoringModelResult, type PromotionObjective, type PromotionPolicy, type ProposalFinding, type ProposalFindingOrigin, REFERENCE_EQUIVALENCE_INPUT_LIMITS, REFERENCE_EQUIVALENCE_JUDGE_VERSION, type Recommendation, type ReferenceEquivalenceJudgeInput, type ReferenceEquivalenceJudgeOptions, type ReferenceEquivalenceJudgeResult, type ReferenceEquivalenceScenario, type ReleaseSummary, type RunAgentProfileImprovementExperimentOptions, type RunCampaignOptions, type RunCandidateExperimentOptions, type RunEvalOptions, type RunImprovementLoopOptions, type RunImprovementLoopResult, type RunRecordRejection, type ScalarDistribution, type Scenario, type SealAgentProfileImprovementSuiteOptions, type SealCandidateBenchmarkSuiteOptions, type SelfImproveBudget, type SelfImproveMethodOptions, type SelfImproveMethodProvenance, type SelfImproveMethodResult, type SelfImproveOptions, type SelfImproveProgressEvent, type SelfImproveProposerOptions, type SelfImproveProposerResult, type SelfImproveResult, SelfImproveRunError, type SessionScript, type SkillOptOptimizationMethodConfig, type SkillOptRunnerCommand, type SkillOptTrainerConfig, type SummarizeExecutionOptions, type SurfaceProposer, type TokenUsageInsight, analyzeRuns, buildDefaultAnalystRegistry, buildEvidenceVector, campaignSplitDigest, compareOptimizationMethods, composeGate, createChatClient, createReferenceEquivalenceJudge, defaultProductionGate, defineAgentEval, diffGenerations, diffRunBaselineToWinner, diffRuns, evalReportingSuite, evaluatePairedMeasurements, externalTextOptimizationMethod, fromClaudeCodeSession, fromCodexSession, fromFeedbackTable, fromKimiCodeSession, fromOpenCodeSession, fromOtelSpans, fromPiSession, fromRunRecordDir, fsCampaignStorage, gepaOptimizationMethod, heldOutGate, inMemoryCampaignStorage, llmJudge, makeProposalFinding, measuredComparisonFromAgentProfileImprovementExperiment, measuredComparisonFromCandidateExperiment, observeCodeAgentSession, observeCodeAgentStore, paretoPolicy, paretoSignificanceGate, parseAgentTrace, parseCodeAgentJsonl, parseCodeAgentJsonlFile, partitionRunsByAuthoringModel, runAgentProfileImprovementExperiment, runCampaign, runCandidateExperiment, runEval, runImprovementLoop, runReferenceEquivalenceJudge, sealAgentProfileImprovementExperiment, sealAgentProfileImprovementSuite, sealAgentProfileImprovementTask, sealCandidateBenchmarkSuite, sealCandidateBenchmarkTask, sealCandidateExperiment, selfImprove, skillOptOptimizationMethod, streamCodeAgentJsonlFile, summarizeExecution, transientDispatchFailure, verifyAgentProfileImprovementExperimentComparison, verifyCandidateExperiment, verifyCandidateExperimentComparison };
|
package/dist/contract/index.js
CHANGED
|
@@ -1,23 +1,23 @@
|
|
|
1
1
|
import { s as ValidationError } from "../errors-Dngq5h35.js";
|
|
2
2
|
import { a as hashCanonical } from "../canonical-DPyQ_rpt.js";
|
|
3
3
|
import { r as pairedBootstrap } from "../paired-tests-C8iCsioC.js";
|
|
4
|
-
import { a as summarizeExecution, i as analyzeRuns, n as SelfImproveRunError, r as selfImprove, t as defineAgentEval } from "../define-agent-eval-
|
|
4
|
+
import { a as summarizeExecution, i as analyzeRuns, n as SelfImproveRunError, r as selfImprove, t as defineAgentEval } from "../define-agent-eval-Dzidv34q.js";
|
|
5
5
|
import { a as parseRunRecordSafe } from "../run-record-DQpSf7t-.js";
|
|
6
|
-
import { G as runCampaign, R as defaultProductionGate, W as runEval, a as transientDispatchFailure, c as compareOptimizationMethods, h as runImprovementLoop, t as llmJudge } from "../llm-judge-
|
|
6
|
+
import { G as runCampaign, R as defaultProductionGate, W as runEval, a as transientDispatchFailure, c as compareOptimizationMethods, h as runImprovementLoop, t as llmJudge } from "../llm-judge-v80Kmu9g.js";
|
|
7
7
|
import { i as isModelPriced, n as estimateCost } from "../metrics-Qv-cpptD.js";
|
|
8
8
|
import { i as CostLedger } from "../cost-ledger-B1qx30B4.js";
|
|
9
9
|
import { M as heldoutSignificance, P as decidePairedPromotion, et as campaignSplitDigest } from "../campaign-evidence-D8DBLqLI.js";
|
|
10
10
|
import { f as mapConcurrentRange } from "../ledger-core-Cs9f7385.js";
|
|
11
11
|
import { C as inMemoryCampaignStorage, S as fsCampaignStorage } from "../external-optimizer-subprocess-q3VzlGAO.js";
|
|
12
12
|
import { i as makeProposalFinding } from "../types-DQ0e2E7y.js";
|
|
13
|
-
import {
|
|
14
|
-
import { t as buildDefaultAnalystRegistry } from "../default-registry-
|
|
13
|
+
import { K as classifyOtlpSpanRole, q as isOtlpModelCall } from "../kind-factory-D5HOW3R0.js";
|
|
14
|
+
import { t as buildDefaultAnalystRegistry } from "../default-registry-BryMEmr8.js";
|
|
15
15
|
import { LLM_MODEL_ATTR_KEYS, SPAN_KIND_ATTR_KEYS } from "../trace-attributes.js";
|
|
16
16
|
import { t as extractUsage } from "../extract-usage-BrQ8mCLX.js";
|
|
17
17
|
import { t as createChatClient } from "../chat-client-CkmjYlfB.js";
|
|
18
18
|
import { n as InMemoryOutcomeStore, t as FileSystemOutcomeStore } from "../outcome-store-ChBKlTd_.js";
|
|
19
|
-
import { i as summarizeTraceErrors, n as recordAggregateMeasurements, r as summarizeExecutionMeasurements, t as readTaskFailureLabels } from "../task-failure-attributes-
|
|
20
|
-
import { a as externalTextOptimizationMethod, c as REFERENCE_EQUIVALENCE_INPUT_LIMITS, d as runReferenceEquivalenceJudge, i as composeGate, l as REFERENCE_EQUIVALENCE_JUDGE_VERSION, n as gepaOptimizationMethod, r as heldOutGate, t as skillOptOptimizationMethod, u as createReferenceEquivalenceJudge } from "../skillopt-optimization-method-
|
|
19
|
+
import { i as summarizeTraceErrors, n as recordAggregateMeasurements, r as summarizeExecutionMeasurements, t as readTaskFailureLabels } from "../task-failure-attributes-B072KO_n.js";
|
|
20
|
+
import { a as externalTextOptimizationMethod, c as REFERENCE_EQUIVALENCE_INPUT_LIMITS, d as runReferenceEquivalenceJudge, i as composeGate, l as REFERENCE_EQUIVALENCE_JUDGE_VERSION, n as gepaOptimizationMethod, r as heldOutGate, t as skillOptOptimizationMethod, u as createReferenceEquivalenceJudge } from "../skillopt-optimization-method-C3oYul8v.js";
|
|
21
21
|
import { n as paretoPolicy, r as paretoSignificanceGate, t as buildEvidenceVector } from "../promotion-policy-DWOm70gx.js";
|
|
22
22
|
import { createHash } from "node:crypto";
|
|
23
23
|
import { agentCandidateBenchmarkSuiteSchema, agentCandidateBenchmarkTaskSchema, agentCandidateBundleSchema, agentCandidateEvaluationPolicySchema, agentCandidateExperimentSchema, agentImprovementMeasuredComparisonSchema, agentProfileImprovementExperimentSchema, agentProfileImprovementMeasuredComparisonSchema, agentProfileImprovementRunCellSchema, agentProfileImprovementRunReceiptSchema, agentProfileImprovementSuiteInputsSchema, agentProfileImprovementSuiteSchema, agentProfileImprovementTaskSchema, candidateExecutionEvidenceSchema, canonicalCandidateDigest, canonicalCandidateJson, numbersApproximatelyEqual, omitTopLevelDigest } from "@tangle-network/agent-interface";
|
|
@@ -1,7 +1,7 @@
|
|
|
1
1
|
import { a as hashCanonical, r as canonicalString } from "./canonical-DPyQ_rpt.js";
|
|
2
2
|
import { t as combineAbortSignals } from "./abort-signal-CtzAM_sJ.js";
|
|
3
3
|
import { a as assertValidAnalystUsageReceipt, c as validateUsageSettlementTimeout, l as deepFreezeCanonicalJson, r as makeFinding } from "./types-DQ0e2E7y.js";
|
|
4
|
-
import {
|
|
4
|
+
import { B as findingSubjectGrammarPromptFor, X as snapshotExactExecutionPlan, Y as snapshotExactExecutionComponentIdentity, k as spanEpochMillis, t as createTraceAnalyst } from "./kind-factory-D5HOW3R0.js";
|
|
5
5
|
import { LLM_CONTEXT_TOKENS, LLM_INPUT_TOKEN_ATTR_KEYS, LLM_OUTPUT_TOKEN_ATTR_KEYS, TOOL_NAME_ATTR_KEYS } from "./trace-attributes.js";
|
|
6
6
|
import { t as executionTrackByLane } from "./execution-tracks-CpgFPpS5.js";
|
|
7
7
|
import { t as analyzeSupervisorRunIntegrity } from "./integrity-DsHWCebQ.js";
|
|
@@ -2363,4 +2363,4 @@ function buildDefaultAnalystRegistry(options = {}) {
|
|
|
2363
2363
|
//#endregion
|
|
2364
2364
|
export { completedAnalystReviewQuality as _, KNOWLEDGE_POISONING_KIND_SPEC as a, validateAnalystReviewDecisions as b, FAILURE_MODE_KIND_SPEC as c, emitControlIntegrityFindings as d, behavioralAnalyst as f, assertUniqueFindingIds as g, analystRunDigest as h, DEFAULT_TRACE_ANALYST_KINDS as i, CONTROL_INTEGRITY_ANALYST as l, analystFindingDigest as m, AnalystRegistry as n, KNOWLEDGE_GAP_KIND_SPEC as o, deriveEfficiencyFindings as p, ExactAnalystRunExecutionError as r, IMPROVEMENT_KIND_SPEC as s, buildDefaultAnalystRegistry as t, ControlIntegrityAnalyst as u, readAnalystReview as v, snapshotAnalystRun as y };
|
|
2365
2365
|
|
|
2366
|
-
//# sourceMappingURL=default-registry-
|
|
2366
|
+
//# sourceMappingURL=default-registry-BryMEmr8.js.map
|