@tangle-network/agent-eval 0.173.1 → 0.173.2
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/CHANGELOG.md +9 -0
- package/dist/analyst/index.d.ts +2 -2
- package/dist/analyst/index.js +4 -4
- package/dist/{benchmark-command-k-fOGzt8.js → benchmark-command-CS6gVHVq.js} +7 -7
- package/dist/{benchmark-command-k-fOGzt8.js.map → benchmark-command-CS6gVHVq.js.map} +1 -1
- package/dist/benchmarks/index.js +3 -3
- package/dist/campaign/index.js +5 -5
- package/dist/{campaign-pxS0wmo4.js → campaign-B3kPMU8S.js} +6 -6
- package/dist/{campaign-pxS0wmo4.js.map → campaign-B3kPMU8S.js.map} +1 -1
- package/dist/{chat-client-Db4bqYfA.js → chat-client-CkmjYlfB.js} +2 -2
- package/dist/{chat-client-Db4bqYfA.js.map → chat-client-CkmjYlfB.js.map} +1 -1
- package/dist/{chat-json-call-C26igCih.js → chat-json-call-B_Xv2oJK.js} +2 -2
- package/dist/{chat-json-call-C26igCih.js.map → chat-json-call-B_Xv2oJK.js.map} +1 -1
- package/dist/cli.js +3 -3
- package/dist/contract/index.js +5 -5
- package/dist/{define-agent-eval-D_i_s69h.js → define-agent-eval-8h3lXXee.js} +3 -3
- package/dist/{define-agent-eval-D_i_s69h.js.map → define-agent-eval-8h3lXXee.js.map} +1 -1
- package/dist/{dspy-rlm-engine-D5byiHn9.js → dspy-rlm-engine-CF0t2ITD.js} +2 -2
- package/dist/{dspy-rlm-engine-D5byiHn9.js.map → dspy-rlm-engine-CF0t2ITD.js.map} +1 -1
- package/dist/{external-optimizer-process-Cq_Pg15r.js → external-optimizer-process-BwITA9Jp.js} +2 -2
- package/dist/{external-optimizer-process-Cq_Pg15r.js.map → external-optimizer-process-BwITA9Jp.js.map} +1 -1
- package/dist/{external-optimizer-subprocess-DgNebftP.js → external-optimizer-subprocess-wBWeoG6A.js} +2 -2
- package/dist/{external-optimizer-subprocess-DgNebftP.js.map → external-optimizer-subprocess-wBWeoG6A.js.map} +1 -1
- package/dist/index.js +8 -8
- package/dist/{llm-client-CxQtdtd6.js → llm-client-CGlSi8sb.js} +2 -1
- package/dist/llm-client-CGlSi8sb.js.map +1 -0
- package/dist/{llm-judge-B2YxbAJb.js → llm-judge-BfqMFo4h.js} +3 -3
- package/dist/{llm-judge-B2YxbAJb.js.map → llm-judge-BfqMFo4h.js.map} +1 -1
- package/dist/openapi.json +1 -1
- package/dist/{produced-state-7VYDwtkk.js → produced-state-D91uDvQw.js} +3 -3
- package/dist/{produced-state-7VYDwtkk.js.map → produced-state-D91uDvQw.js.map} +1 -1
- package/dist/{semantic-concept-judge-Ct3QU7t5.js → semantic-concept-judge-Dok7_35a.js} +4 -4
- package/dist/{semantic-concept-judge-Ct3QU7t5.js.map → semantic-concept-judge-Dok7_35a.js.map} +1 -1
- package/dist/{server-BR6onwZB.js → server-D_cjseFN.js} +2 -2
- package/dist/{server-BR6onwZB.js.map → server-D_cjseFN.js.map} +1 -1
- package/dist/{skillopt-optimization-method-BzdphODy.js → skillopt-optimization-method-DDw3v3gA.js} +5 -5
- package/dist/{skillopt-optimization-method-BzdphODy.js.map → skillopt-optimization-method-DDw3v3gA.js.map} +1 -1
- package/dist/supervisor-run/index.d.ts.map +1 -1
- package/dist/supervisor-run/index.js +22 -15
- package/dist/supervisor-run/index.js.map +1 -1
- package/dist/types-gvRsyJLh.d.ts.map +1 -1
- package/dist/wire/index.js +1 -1
- package/package.json +2 -2
- package/dist/llm-client-CxQtdtd6.js.map +0 -1
package/dist/benchmarks/index.js
CHANGED
|
@@ -1,7 +1,7 @@
|
|
|
1
1
|
import { t as __exportAll } from "../rolldown-runtime-8H4AJuhK.js";
|
|
2
|
-
import { at as runCampaign } from "../llm-judge-
|
|
3
|
-
import { S as fsCampaignStorage } from "../external-optimizer-subprocess-
|
|
4
|
-
import "../campaign-
|
|
2
|
+
import { at as runCampaign } from "../llm-judge-BfqMFo4h.js";
|
|
3
|
+
import { S as fsCampaignStorage } from "../external-optimizer-subprocess-wBWeoG6A.js";
|
|
4
|
+
import "../campaign-B3kPMU8S.js";
|
|
5
5
|
import { join } from "node:path";
|
|
6
6
|
//#region src/benchmarks/calibration.ts
|
|
7
7
|
async function calibrateBenchmarkMetric(options) {
|
package/dist/campaign/index.js
CHANGED
|
@@ -1,10 +1,10 @@
|
|
|
1
|
-
import { A as costFromLedgerSummary, B as assertSearchHistoryMatchesReplay, E as openAutoPr, F as renderSurfaceDiff, G as campaignMeanComposite, H as searchHistoryCoverageRow, I as surfaceContentHash, K as compareRankKeys, L as surfaceHash, M as assertCodeSurfaceIdentity, N as codeSurfaceIdentityMaterial, O as combineComparisonCosts, P as componentSurfaceIdentityMaterial, Q as defaultProductionGate, R as SearchHistoryRequiredError, S as recordCandidatePopulationSearch, U as verifySearchHistoryReceipt, V as createSearchHistoryReceipt, W as campaignBreakdown, Z as readGepaCandidatePopulationArtifact, _ as runImprovementLoop, _t as readCachedCell, a as transientDispatchFailure, at as runCampaign, b as labelTrustRank, c as buildLoopProvenanceRecord, ct as tangleTracesRoot, d as emitLoopProvenance, f as loopProvenanceArgsFromResult, ft as assertCampaignDesign, g as verifyLoopProvenanceRecord, gt as campaignSplitDigestFromIdentities, h as provenanceSpansPath, ht as campaignSplitDigest, i as quotaExhaustedUntil, it as runEval, j as optimizationTokenUsageFromSummary, k as compareOptimizationMethods, l as campaignMeasurementDigest, m as provenanceRecordPath, mt as campaignScenarioIdentity, ot as planCampaignRun, p as loopProvenanceSpans, pt as assertCampaignSplitIdentity, r as isTransientTransportFailure, st as resolveRunDir, t as llmJudge, u as canonicalDigest, v as runOptimization, vt as buildCellSchedule, x as SearchRecorder, y as isProposedCandidate, yt as cellCachePath, z as assertCompleteSearchHistory } from "../llm-judge-
|
|
2
|
-
import { C as inMemoryCampaignStorage, D as SearchLedgerIntegrityError, E as SearchLedgerError, S as fsCampaignStorage, T as SearchLedgerConflictError, l as DEFAULT_EXTERNAL_OPTIMIZER_CALLBACK_LIMITS, u as DEFAULT_EXTERNAL_OPTIMIZER_PROCESS_LIMITS, v as resolveExternalOptimizerCallbackLimits, x as createRunCostLedger, y as resolveExternalOptimizerProcessLimits } from "../external-optimizer-subprocess-
|
|
1
|
+
import { A as costFromLedgerSummary, B as assertSearchHistoryMatchesReplay, E as openAutoPr, F as renderSurfaceDiff, G as campaignMeanComposite, H as searchHistoryCoverageRow, I as surfaceContentHash, K as compareRankKeys, L as surfaceHash, M as assertCodeSurfaceIdentity, N as codeSurfaceIdentityMaterial, O as combineComparisonCosts, P as componentSurfaceIdentityMaterial, Q as defaultProductionGate, R as SearchHistoryRequiredError, S as recordCandidatePopulationSearch, U as verifySearchHistoryReceipt, V as createSearchHistoryReceipt, W as campaignBreakdown, Z as readGepaCandidatePopulationArtifact, _ as runImprovementLoop, _t as readCachedCell, a as transientDispatchFailure, at as runCampaign, b as labelTrustRank, c as buildLoopProvenanceRecord, ct as tangleTracesRoot, d as emitLoopProvenance, f as loopProvenanceArgsFromResult, ft as assertCampaignDesign, g as verifyLoopProvenanceRecord, gt as campaignSplitDigestFromIdentities, h as provenanceSpansPath, ht as campaignSplitDigest, i as quotaExhaustedUntil, it as runEval, j as optimizationTokenUsageFromSummary, k as compareOptimizationMethods, l as campaignMeasurementDigest, m as provenanceRecordPath, mt as campaignScenarioIdentity, ot as planCampaignRun, p as loopProvenanceSpans, pt as assertCampaignSplitIdentity, r as isTransientTransportFailure, st as resolveRunDir, t as llmJudge, u as canonicalDigest, v as runOptimization, vt as buildCellSchedule, x as SearchRecorder, y as isProposedCandidate, yt as cellCachePath, z as assertCompleteSearchHistory } from "../llm-judge-BfqMFo4h.js";
|
|
2
|
+
import { C as inMemoryCampaignStorage, D as SearchLedgerIntegrityError, E as SearchLedgerError, S as fsCampaignStorage, T as SearchLedgerConflictError, l as DEFAULT_EXTERNAL_OPTIMIZER_CALLBACK_LIMITS, u as DEFAULT_EXTERNAL_OPTIMIZER_PROCESS_LIMITS, v as resolveExternalOptimizerCallbackLimits, x as createRunCostLedger, y as resolveExternalOptimizerProcessLimits } from "../external-optimizer-subprocess-wBWeoG6A.js";
|
|
3
3
|
import { a as heldoutSignificance, i as dimensionRegressions, o as pairHoldout, r as detectScale, t as powerPreflight } from "../power-preflight-CFXm0Vjo.js";
|
|
4
4
|
import { i as makeProposalFinding } from "../types-CiWITkGo.js";
|
|
5
|
-
import { n as acquireSingleRunLock } from "../external-optimizer-process-
|
|
6
|
-
import { a as validateSearchLedgerEvent, c as externalTextOptimizationMethod, i as openSearchLedger, l as decodeExternalTextCandidate, n as gepaOptimizationMethod, o as heldOutGate, p as createReferenceEquivalenceJudge, r as FileSearchLedger, s as composeGate, t as skillOptOptimizationMethod, u as readExternalOptimizerObservationArtifact } from "../skillopt-optimization-method-
|
|
7
|
-
import { A as analyzeCrossSurfaceInteractions, C as classifyUngroundedLiterals, D as loadEvalFixture, E as discoverEvalFixtures, M as traceAnalystQualityJudge, O as loadEvalFixtureScenarios, S as LabeledScenarioStoreError, T as neutralizationGate, _ as scoreboardSummary, a as autoevalsScorerJudge, b as neutralizeText, c as selectDiscriminative, d as runProfileMatrixSegment, f as ProfileMatrixError, g as scoreUserStory, h as renderScoreboardMarkdown, i as verifyCodeSurface, j as buildTraceAnalystSurfaceDispatch, k as planEvalFixtureRun, l as createProfileMatrixPlan, m as makePlaybackDispatch, n as gitWorktreeAdapter, o as phoenixEvaluatorJudge, p as runProfileMatrix, r as resolveWorktreePath, s as scoreDiscrimination, t as WorktreeAdapterError, u as finalizeProfileMatrix, v as userStoryScoreboard, w as rolloutArgumentDiff, x as FsLabeledScenarioStore, y as crowdedFrontierParent } from "../campaign-
|
|
5
|
+
import { n as acquireSingleRunLock } from "../external-optimizer-process-BwITA9Jp.js";
|
|
6
|
+
import { a as validateSearchLedgerEvent, c as externalTextOptimizationMethod, i as openSearchLedger, l as decodeExternalTextCandidate, n as gepaOptimizationMethod, o as heldOutGate, p as createReferenceEquivalenceJudge, r as FileSearchLedger, s as composeGate, t as skillOptOptimizationMethod, u as readExternalOptimizerObservationArtifact } from "../skillopt-optimization-method-DDw3v3gA.js";
|
|
7
|
+
import { A as analyzeCrossSurfaceInteractions, C as classifyUngroundedLiterals, D as loadEvalFixture, E as discoverEvalFixtures, M as traceAnalystQualityJudge, O as loadEvalFixtureScenarios, S as LabeledScenarioStoreError, T as neutralizationGate, _ as scoreboardSummary, a as autoevalsScorerJudge, b as neutralizeText, c as selectDiscriminative, d as runProfileMatrixSegment, f as ProfileMatrixError, g as scoreUserStory, h as renderScoreboardMarkdown, i as verifyCodeSurface, j as buildTraceAnalystSurfaceDispatch, k as planEvalFixtureRun, l as createProfileMatrixPlan, m as makePlaybackDispatch, n as gitWorktreeAdapter, o as phoenixEvaluatorJudge, p as runProfileMatrix, r as resolveWorktreePath, s as scoreDiscrimination, t as WorktreeAdapterError, u as finalizeProfileMatrix, v as userStoryScoreboard, w as rolloutArgumentDiff, x as FsLabeledScenarioStore, y as crowdedFrontierParent } from "../campaign-B3kPMU8S.js";
|
|
8
8
|
import { n as paretoPolicy, r as paretoSignificanceGate, t as buildEvidenceVector } from "../promotion-policy-LY9mVQ7W.js";
|
|
9
9
|
import { n as sequentialPairedGate, t as sequentialDecide } from "../sequential-B51qAYE4.js";
|
|
10
10
|
export { DEFAULT_EXTERNAL_OPTIMIZER_CALLBACK_LIMITS, DEFAULT_EXTERNAL_OPTIMIZER_PROCESS_LIMITS, FileSearchLedger, FsLabeledScenarioStore, LabeledScenarioStoreError, ProfileMatrixError, SearchHistoryRequiredError, SearchLedgerConflictError, SearchLedgerError, SearchLedgerIntegrityError, SearchRecorder, WorktreeAdapterError, acquireSingleRunLock, analyzeCrossSurfaceInteractions, assertCampaignDesign, assertCampaignSplitIdentity, assertCodeSurfaceIdentity, assertCompleteSearchHistory, assertSearchHistoryMatchesReplay, autoevalsScorerJudge, buildCellSchedule, buildEvidenceVector, buildLoopProvenanceRecord, buildTraceAnalystSurfaceDispatch, campaignBreakdown, campaignMeanComposite, campaignMeasurementDigest, campaignScenarioIdentity, campaignSplitDigest, campaignSplitDigestFromIdentities, canonicalDigest, cellCachePath, classifyUngroundedLiterals, codeSurfaceIdentityMaterial, combineComparisonCosts, compareOptimizationMethods, compareRankKeys, componentSurfaceIdentityMaterial, composeGate, costFromLedgerSummary, createProfileMatrixPlan, createReferenceEquivalenceJudge, createRunCostLedger, createSearchHistoryReceipt, crowdedFrontierParent, decodeExternalTextCandidate, defaultProductionGate, detectScale, dimensionRegressions, discoverEvalFixtures, emitLoopProvenance, externalTextOptimizationMethod, finalizeProfileMatrix, fsCampaignStorage, gepaOptimizationMethod, gitWorktreeAdapter, heldOutGate, heldoutSignificance, inMemoryCampaignStorage, isProposedCandidate, isTransientTransportFailure, labelTrustRank, llmJudge, loadEvalFixture, loadEvalFixtureScenarios, loopProvenanceArgsFromResult, loopProvenanceSpans, makePlaybackDispatch, makeProposalFinding, neutralizationGate, neutralizeText, openAutoPr, openSearchLedger, optimizationTokenUsageFromSummary, pairHoldout, paretoPolicy, paretoSignificanceGate, phoenixEvaluatorJudge, planCampaignRun, planEvalFixtureRun, powerPreflight, provenanceRecordPath, provenanceSpansPath, quotaExhaustedUntil, readCachedCell, readExternalOptimizerObservationArtifact, readGepaCandidatePopulationArtifact, recordCandidatePopulationSearch, renderScoreboardMarkdown, renderSurfaceDiff, resolveExternalOptimizerCallbackLimits, resolveExternalOptimizerProcessLimits, resolveRunDir, resolveWorktreePath, rolloutArgumentDiff, runCampaign, runEval, runImprovementLoop, runOptimization, runProfileMatrix, runProfileMatrixSegment, scoreDiscrimination, scoreUserStory, scoreboardSummary, searchHistoryCoverageRow, selectDiscriminative, sequentialDecide, sequentialPairedGate, skillOptOptimizationMethod, surfaceContentHash, surfaceHash, tangleTracesRoot, traceAnalystQualityJudge, transientDispatchFailure, userStoryScoreboard, validateSearchLedgerEvent, verifyCodeSurface, verifyLoopProvenanceRecord, verifySearchHistoryReceipt };
|
|
@@ -1,21 +1,21 @@
|
|
|
1
1
|
import { s as ValidationError, t as AgentEvalError } from "./errors-Dngq5h35.js";
|
|
2
2
|
import { i as compareCodeUnits } from "./canonical-DPyQ_rpt.js";
|
|
3
|
-
import { c as agentProfileId, d as harnessAxisOf, i as verifyCompletion, l as agentProfileModelId, s as agentProfileHash, t as extractProducedState } from "./produced-state-
|
|
3
|
+
import { c as agentProfileId, d as harnessAxisOf, i as verifyCompletion, l as agentProfileModelId, s as agentProfileHash, t as extractProducedState } from "./produced-state-D91uDvQw.js";
|
|
4
4
|
import { buildAgentProfileCell } from "./profile-cell.js";
|
|
5
5
|
import { t as mulberry32 } from "./random-Dn5fPWkt.js";
|
|
6
6
|
import { t as comparePairedArms } from "./paired-arms-D4aeIHUy.js";
|
|
7
7
|
import { r as pairedBootstrap } from "./paired-tests-C8iCsioC.js";
|
|
8
8
|
import { c as validateRunRecord, i as modelHasSnapshot, n as UNKNOWN_MODEL, s as runTaskScore } from "./run-record-ZIsR9Fif.js";
|
|
9
9
|
import { n as contentHash, t as canonicalJson } from "./verdict-cache-B3eCVQtY.js";
|
|
10
|
-
import { I as surfaceContentHash, M as assertCodeSurfaceIdentity, T as paretoFrontierWithCrowding, at as runCampaign, b as labelTrustRank, bt as computeManifestHash, dt as summarizeBackendIntegrity, ft as assertCampaignDesign, mt as campaignScenarioIdentity, ot as planCampaignRun, st as resolveRunDir, ut as assertRealBackend, yt as cellCachePath } from "./llm-judge-
|
|
10
|
+
import { I as surfaceContentHash, M as assertCodeSurfaceIdentity, T as paretoFrontierWithCrowding, at as runCampaign, b as labelTrustRank, bt as computeManifestHash, dt as summarizeBackendIntegrity, ft as assertCampaignDesign, mt as campaignScenarioIdentity, ot as planCampaignRun, st as resolveRunDir, ut as assertRealBackend, yt as cellCachePath } from "./llm-judge-BfqMFo4h.js";
|
|
11
11
|
import { a as campaignCellCostProvenance, l as campaignCellToRunRecord, u as projectCampaignCellQuality } from "./reward-hacking-CKW4teig.js";
|
|
12
12
|
import { t as CostAccountingIncompleteError } from "./cost-ledger-B1qx30B4.js";
|
|
13
13
|
import { u as mapConcurrent } from "./ledger-core-PIfjCbKn.js";
|
|
14
|
-
import { S as fsCampaignStorage } from "./external-optimizer-subprocess-
|
|
14
|
+
import { S as fsCampaignStorage } from "./external-optimizer-subprocess-wBWeoG6A.js";
|
|
15
15
|
import { o as pairHoldout } from "./power-preflight-CFXm0Vjo.js";
|
|
16
16
|
import { a as scoreAnalystFindings } from "./benchmark-C4wk_Sjr.js";
|
|
17
|
-
import "./external-optimizer-process-
|
|
18
|
-
import "./skillopt-optimization-method-
|
|
17
|
+
import "./external-optimizer-process-BwITA9Jp.js";
|
|
18
|
+
import "./skillopt-optimization-method-DDw3v3gA.js";
|
|
19
19
|
import "./sequential-B51qAYE4.js";
|
|
20
20
|
import { createHash } from "node:crypto";
|
|
21
21
|
import { closeSync, constants, existsSync, fstatSync, lstatSync, mkdirSync, mkdtempSync, openSync, readFileSync, readSync, readdirSync, readlinkSync, realpathSync, rmSync, statSync, writeFileSync } from "node:fs";
|
|
@@ -3050,4 +3050,4 @@ function resolveWorktreePath(surface, worktreeDir) {
|
|
|
3050
3050
|
//#endregion
|
|
3051
3051
|
export { analyzeCrossSurfaceInteractions as A, classifyUngroundedLiterals as C, loadEvalFixture as D, discoverEvalFixtures as E, traceAnalystQualityJudge as M, loadEvalFixtureScenarios as O, LabeledScenarioStoreError as S, neutralizationGate as T, scoreboardSummary as _, autoevalsScorerJudge as a, neutralizeText as b, selectDiscriminative as c, runProfileMatrixSegment as d, ProfileMatrixError as f, scoreUserStory as g, renderScoreboardMarkdown as h, verifyCodeSurface as i, buildTraceAnalystSurfaceDispatch as j, planEvalFixtureRun as k, createProfileMatrixPlan as l, makePlaybackDispatch as m, gitWorktreeAdapter as n, phoenixEvaluatorJudge as o, runProfileMatrix as p, resolveWorktreePath as r, scoreDiscrimination as s, WorktreeAdapterError as t, finalizeProfileMatrix as u, userStoryScoreboard as v, rolloutArgumentDiff as w, FsLabeledScenarioStore as x, crowdedFrontierParent as y };
|
|
3052
3052
|
|
|
3053
|
-
//# sourceMappingURL=campaign-
|
|
3053
|
+
//# sourceMappingURL=campaign-B3kPMU8S.js.map
|