@tangle-network/agent-eval 0.173.3 → 0.175.0
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/CHANGELOG.md +54 -0
- package/README.md +1 -1
- package/dist/{proposal-findings-bko3GGy-.js → abort-signal-CtzAM_sJ.js} +11 -11
- package/dist/abort-signal-CtzAM_sJ.js.map +1 -0
- package/dist/adapters/http.d.ts +2 -2
- package/dist/agent-profile-_xPxqVJt.d.ts +488 -0
- package/dist/agent-profile-_xPxqVJt.d.ts.map +1 -0
- package/dist/analyst/index.d.ts +7 -9
- package/dist/analyst/index.d.ts.map +1 -1
- package/dist/analyst/index.js +8 -8
- package/dist/{benchmark-C4wk_Sjr.js → benchmark-DQKzykkO.js} +2 -2
- package/dist/{benchmark-C4wk_Sjr.js.map → benchmark-DQKzykkO.js.map} +1 -1
- package/dist/{benchmark-command-BY9oscke.js → benchmark-command-D_5xG9LG.js} +13 -13
- package/dist/{benchmark-command-BY9oscke.js.map → benchmark-command-D_5xG9LG.js.map} +1 -1
- package/dist/benchmarks/index.d.ts +3 -4
- package/dist/benchmarks/index.d.ts.map +1 -1
- package/dist/benchmarks/index.js +3 -3
- package/dist/campaign/index.d.ts +5 -9
- package/dist/campaign/index.js +7 -7
- package/dist/{campaign-B3kPMU8S.js → campaign-BzMSCejE.js} +8 -8
- package/dist/{campaign-B3kPMU8S.js.map → campaign-BzMSCejE.js.map} +1 -1
- package/dist/{opencode-sqlite-eK6HW6dr.js → claude-jsonl-CxZZrDJ3.js} +9 -149
- package/dist/claude-jsonl-CxZZrDJ3.js.map +1 -0
- package/dist/cli.js +9 -2
- package/dist/cli.js.map +1 -1
- package/dist/{client-DlqdbM7n.d.ts → client-vyYQg3bm.d.ts} +2 -2
- package/dist/{client-DlqdbM7n.d.ts.map → client-vyYQg3bm.d.ts.map} +1 -1
- package/dist/contract/index.d.ts +9 -10
- package/dist/contract/index.js +8 -8
- package/dist/{default-registry-B0bKikCb.js → default-registry-DBqVI4pq.js} +5 -5
- package/dist/{default-registry-B0bKikCb.js.map → default-registry-DBqVI4pq.js.map} +1 -1
- package/dist/{default-registry-BKwc8bN5.d.ts → default-registry-FfNzaUHV.d.ts} +3 -3
- package/dist/{default-registry-BKwc8bN5.d.ts.map → default-registry-FfNzaUHV.d.ts.map} +1 -1
- package/dist/{define-agent-eval-CY6qdlGV.d.ts → define-agent-eval-V1jQyCDR.d.ts} +102 -11
- package/dist/define-agent-eval-V1jQyCDR.d.ts.map +1 -0
- package/dist/{define-agent-eval-8h3lXXee.js → define-agent-eval-ox5McL6e.js} +331 -144
- package/dist/define-agent-eval-ox5McL6e.js.map +1 -0
- package/dist/{dspy-rlm-engine-CF0t2ITD.js → dspy-rlm-engine-Caz2pl4L.js} +3 -3
- package/dist/{dspy-rlm-engine-CF0t2ITD.js.map → dspy-rlm-engine-Caz2pl4L.js.map} +1 -1
- package/dist/{engine-DhFir3Ys.d.ts → engine-CvW_I72-.d.ts} +2 -2
- package/dist/{engine-DhFir3Ys.d.ts.map → engine-CvW_I72-.d.ts.map} +1 -1
- package/dist/experiment/index.d.ts +1 -4
- package/dist/experiment/index.d.ts.map +1 -1
- package/dist/{external-optimizer-process-BwITA9Jp.js → external-optimizer-process-CxnFL1hd.js} +2 -2
- package/dist/{external-optimizer-process-BwITA9Jp.js.map → external-optimizer-process-CxnFL1hd.js.map} +1 -1
- package/dist/{external-optimizer-subprocess-wBWeoG6A.js → external-optimizer-subprocess-CQi27uEI.js} +2 -2
- package/dist/{external-optimizer-subprocess-wBWeoG6A.js.map → external-optimizer-subprocess-CQi27uEI.js.map} +1 -1
- package/dist/fuzz.js +1 -1
- package/dist/fuzz.js.map +1 -1
- package/dist/hosted/index.d.ts +1 -1
- package/dist/{index-D0Db5X-4.d.ts → index-BAAiSF3_.d.ts} +5 -5
- package/dist/{index-D0Db5X-4.d.ts.map → index-BAAiSF3_.d.ts.map} +1 -1
- package/dist/{index-BQqOjerE.d.ts → index-BTrx5s8m.d.ts} +8 -9
- package/dist/index-BTrx5s8m.d.ts.map +1 -0
- package/dist/index-DKXuBPXf.d.ts +3840 -0
- package/dist/index-DKXuBPXf.d.ts.map +1 -0
- package/dist/index.d.ts +11 -13
- package/dist/index.d.ts.map +1 -1
- package/dist/index.js +11 -11
- package/dist/{integrity-BWywb34E.js → integrity-DsHWCebQ.js} +11 -435
- package/dist/integrity-DsHWCebQ.js.map +1 -0
- package/dist/{kind-factory-gP6lDySe.js → kind-factory-BLvL-E44.js} +2 -2
- package/dist/{kind-factory-gP6lDySe.js.map → kind-factory-BLvL-E44.js.map} +1 -1
- package/dist/{llm-judge-BfqMFo4h.js → llm-judge-DmNaBrXB.js} +2541 -2435
- package/dist/llm-judge-DmNaBrXB.js.map +1 -0
- package/dist/{matrix-DGu8KhSs.d.ts → matrix-CJtXz1ky.d.ts} +2 -2
- package/dist/{matrix-DGu8KhSs.d.ts.map → matrix-CJtXz1ky.d.ts.map} +1 -1
- package/dist/multishot/golden/index.d.ts +1 -1
- package/dist/multishot/index.d.ts +2 -2
- package/dist/openapi.json +1 -1
- package/dist/opencode-sqlite-CNw3vubS.js +145 -0
- package/dist/opencode-sqlite-CNw3vubS.js.map +1 -0
- package/dist/{produced-state-D91uDvQw.js → produced-state-B8mw6zj9.js} +2 -2
- package/dist/{produced-state-D91uDvQw.js.map → produced-state-B8mw6zj9.js.map} +1 -1
- package/dist/report-command-DKlXfU5r.js +1528 -0
- package/dist/report-command-DKlXfU5r.js.map +1 -0
- package/dist/rl.d.ts +1 -1
- package/dist/rl.d.ts.map +1 -1
- package/dist/rl.js.map +1 -1
- package/dist/rollout/index.js +3 -2
- package/dist/{rollout-C-znbbYg.js → rollout-CGlDq1GI.js} +3 -2
- package/dist/{rollout-C-znbbYg.js.map → rollout-CGlDq1GI.js.map} +1 -1
- package/dist/{semantic-concept-judge-Dok7_35a.js → semantic-concept-judge-E3s_fEjB.js} +3 -3
- package/dist/{semantic-concept-judge-Dok7_35a.js.map → semantic-concept-judge-E3s_fEjB.js.map} +1 -1
- package/dist/{skillopt-optimization-method-DDw3v3gA.js → skillopt-optimization-method-f7399oGb.js} +5 -5
- package/dist/{skillopt-optimization-method-DDw3v3gA.js.map → skillopt-optimization-method-f7399oGb.js.map} +1 -1
- package/dist/statistical-heldout-Cqb73yE9.d.ts +1127 -0
- package/dist/statistical-heldout-Cqb73yE9.d.ts.map +1 -0
- package/dist/{store-otlp-Dow0pk_5.js → store-otlp-DV_H2HDu.js} +2 -2
- package/dist/{store-otlp-Dow0pk_5.js.map → store-otlp-DV_H2HDu.js.map} +1 -1
- package/dist/{store-tool-spans-CCZNsihA.d.ts → store-tool-spans-4o55ABER.d.ts} +3 -3
- package/dist/{store-tool-spans-CCZNsihA.d.ts.map → store-tool-spans-4o55ABER.d.ts.map} +1 -1
- package/dist/{store-tool-spans-CeNj_m2L.js → store-tool-spans-B9tjys_h.js} +3 -3
- package/dist/{store-tool-spans-CeNj_m2L.js.map → store-tool-spans-B9tjys_h.js.map} +1 -1
- package/dist/supervisor-run/index.d.ts +71 -6
- package/dist/supervisor-run/index.d.ts.map +1 -1
- package/dist/supervisor-run/index.js +6 -1357
- package/dist/supervisor-run/index.js.map +1 -1
- package/dist/{task-failure-attributes-CZjZeBsY.js → task-failure-attributes-CUy9mkIY.js} +2 -2
- package/dist/{task-failure-attributes-CZjZeBsY.js.map → task-failure-attributes-CUy9mkIY.js.map} +1 -1
- package/dist/terminal-record-Ce9_UjRz.js +539 -0
- package/dist/terminal-record-Ce9_UjRz.js.map +1 -0
- package/dist/{tool-groups-Cp4Xdzrp.d.ts → tool-groups-DAe1t6zb.d.ts} +2 -2
- package/dist/tool-groups-DAe1t6zb.d.ts.map +1 -0
- package/dist/trace-repair/index.d.ts +1 -1
- package/dist/traces.d.ts +2 -2
- package/dist/traces.js +4 -4
- package/dist/{types-Ba5UQyVD.d.ts → types-BJz2CPTM.d.ts} +2 -2
- package/dist/{types-Ba5UQyVD.d.ts.map → types-BJz2CPTM.d.ts.map} +1 -1
- package/dist/{types-CiWITkGo.js → types-DQ0e2E7y.js} +2 -2
- package/dist/types-DQ0e2E7y.js.map +1 -0
- package/dist/{types-BDV4PiMR.d.ts → types-Dd1ejaeI.d.ts} +2 -2
- package/dist/{types-BDV4PiMR.d.ts.map → types-Dd1ejaeI.d.ts.map} +1 -1
- package/dist/{types-CoPUTiXb.d.ts → types-vUdAx2Cj.d.ts} +65 -3
- package/dist/types-vUdAx2Cj.d.ts.map +1 -0
- package/docs/campaign-proposers.md +42 -0
- package/package.json +1 -1
- package/dist/agent-profile-B9_GGsG8.d.ts +0 -84
- package/dist/agent-profile-B9_GGsG8.d.ts.map +0 -1
- package/dist/backend-integrity-CeuTgqsd.d.ts +0 -280
- package/dist/backend-integrity-CeuTgqsd.d.ts.map +0 -1
- package/dist/benchmark-BjLGkfnN.d.ts +0 -236
- package/dist/benchmark-BjLGkfnN.d.ts.map +0 -1
- package/dist/define-agent-eval-8h3lXXee.js.map +0 -1
- package/dist/define-agent-eval-CY6qdlGV.d.ts.map +0 -1
- package/dist/external-optimizer-contracts-CQCpyrIL.d.ts +0 -172
- package/dist/external-optimizer-contracts-CQCpyrIL.d.ts.map +0 -1
- package/dist/heldout-gate-Df5hsqmm.d.ts +0 -453
- package/dist/heldout-gate-Df5hsqmm.d.ts.map +0 -1
- package/dist/index-BQqOjerE.d.ts.map +0 -1
- package/dist/index-CFDffsKz.d.ts +0 -1135
- package/dist/index-CFDffsKz.d.ts.map +0 -1
- package/dist/integrity-BWywb34E.js.map +0 -1
- package/dist/llm-judge-BfqMFo4h.js.map +0 -1
- package/dist/opencode-sqlite-eK6HW6dr.js.map +0 -1
- package/dist/power-preflight-Ptse_Kq7.d.ts +0 -117
- package/dist/power-preflight-Ptse_Kq7.d.ts.map +0 -1
- package/dist/pre-registration-BoI4ucR3.d.ts +0 -592
- package/dist/pre-registration-BoI4ucR3.d.ts.map +0 -1
- package/dist/promotion-policy-CvMda3kU.d.ts +0 -134
- package/dist/promotion-policy-CvMda3kU.d.ts.map +0 -1
- package/dist/proposal-findings-bko3GGy-.js.map +0 -1
- package/dist/provenance-CRY67X50.d.ts +0 -1995
- package/dist/provenance-CRY67X50.d.ts.map +0 -1
- package/dist/statistical-heldout-DTyB_6-1.d.ts +0 -295
- package/dist/statistical-heldout-DTyB_6-1.d.ts.map +0 -1
- package/dist/tool-groups-Cp4Xdzrp.d.ts.map +0 -1
- package/dist/types-CiWITkGo.js.map +0 -1
- package/dist/types-CoPUTiXb.d.ts.map +0 -1
|
@@ -1,453 +0,0 @@
|
|
|
1
|
-
import { c as CostLedgerHandle } from "./cost-ledger-DbQdN3nO.js";
|
|
2
|
-
import { a as RunRecord } from "./run-record-DTv1MdjK.js";
|
|
3
|
-
import { it as ServedModelPolicy, p as ChatClient, w as LlmCallMetadata } from "./types-gvRsyJLh.js";
|
|
4
|
-
import { R as Scenario, S as JudgeConfig, i as CampaignCostMeter, j as MutableSurface, o as CampaignScenarioIdentity, p as Gate } from "./types-Ba5UQyVD.js";
|
|
5
|
-
import { A as CanaryOptions, F as OptimizationMethod, U as OptimizationPackageSource, b as RedTeamCase, bt as SearchRunIdentity } from "./provenance-CRY67X50.js";
|
|
6
|
-
import { _ as ExternalTextCandidate, c as ExternalOptimizerModelBudget, h as ExternalOptimizerRunnerCommand, l as ExternalOptimizerModelCall, m as ExternalOptimizerResumeMode, r as ExternalOptimizerCallbackLimits, v as ExternalTextEvaluationRequest } from "./external-optimizer-contracts-CQCpyrIL.js";
|
|
7
|
-
import { t as DetectRewardHackingInput } from "./reward-hacking-ZXEi9VCq.js";
|
|
8
|
-
//#region src/campaign/coverage.d.ts
|
|
9
|
-
/** Reject campaign designs whose denominator cannot be identified exactly. */
|
|
10
|
-
declare function assertCampaignDesign<TScenario extends Scenario>(scenarios: readonly TScenario[], reps: number): void;
|
|
11
|
-
/** Redacted but independently verifiable identity of one complete scenario. */
|
|
12
|
-
declare function campaignScenarioIdentity<TScenario extends Scenario>(scenario: TScenario): CampaignScenarioIdentity & Pick<TScenario, 'id' | 'kind'>;
|
|
13
|
-
/** Canonical split identity reconstructed from redacted scenario identities. */
|
|
14
|
-
declare function campaignSplitDigestFromIdentities(scenarios: readonly CampaignScenarioIdentity[], reps: number): `sha256:${string}`;
|
|
15
|
-
/** Canonical identity of the exact scenario payloads and replicate count. */
|
|
16
|
-
declare function campaignSplitDigest<TScenario extends Scenario>(scenarios: readonly TScenario[], reps: number): `sha256:${string}`;
|
|
17
|
-
/** Refuse a campaign whose retained task identities contradict its split digest. */
|
|
18
|
-
declare function assertCampaignSplitIdentity(scenarios: readonly CampaignScenarioIdentity[], reps: number, splitDigest: string): void;
|
|
19
|
-
//#endregion
|
|
20
|
-
//#region src/reference-equivalence-judge.d.ts
|
|
21
|
-
declare const REFERENCE_EQUIVALENCE_JUDGE_VERSION = "reference-equivalence-judge-v1-2026-07-13";
|
|
22
|
-
declare const REFERENCE_EQUIVALENCE_INPUT_LIMITS: {
|
|
23
|
-
readonly userRequest: 8000;
|
|
24
|
-
readonly expectedAnswer: 32000;
|
|
25
|
-
readonly candidateOutput: 32000;
|
|
26
|
-
};
|
|
27
|
-
interface ReferenceEquivalenceScenario extends Scenario {
|
|
28
|
-
userRequest: string;
|
|
29
|
-
expectedAnswer: string;
|
|
30
|
-
}
|
|
31
|
-
interface ReferenceEquivalenceJudgeInput {
|
|
32
|
-
userRequest: string;
|
|
33
|
-
expectedAnswer: string;
|
|
34
|
-
candidateOutput: string;
|
|
35
|
-
}
|
|
36
|
-
interface ReferenceEquivalenceJudgeOptions {
|
|
37
|
-
/** Injected transport. No implicit provider or credentials are selected. */
|
|
38
|
-
chat: ChatClient;
|
|
39
|
-
/** Falls back to the ChatClient's default model. */
|
|
40
|
-
model?: string;
|
|
41
|
-
/** Used only by the direct-call adapter. */
|
|
42
|
-
signal?: AbortSignal;
|
|
43
|
-
/** Optional receipt destination for direct calls; campaigns supply their own. */
|
|
44
|
-
costLedger?: CostLedgerHandle;
|
|
45
|
-
}
|
|
46
|
-
interface ReferenceEquivalenceJudgeResult extends LlmCallMetadata {
|
|
47
|
-
kind: 'reference-equivalence';
|
|
48
|
-
version: string;
|
|
49
|
-
score: number;
|
|
50
|
-
rationale: string;
|
|
51
|
-
}
|
|
52
|
-
/** Build the campaign-native expected-answer judge. */
|
|
53
|
-
declare function createReferenceEquivalenceJudge(options: ReferenceEquivalenceJudgeOptions): JudgeConfig<string, ReferenceEquivalenceScenario>;
|
|
54
|
-
/** Direct-call adapter over the campaign judge for product callers. */
|
|
55
|
-
declare function runReferenceEquivalenceJudge(input: ReferenceEquivalenceJudgeInput, options: ReferenceEquivalenceJudgeOptions): Promise<ReferenceEquivalenceJudgeResult>;
|
|
56
|
-
//#endregion
|
|
57
|
-
//#region src/campaign/external-text-evaluation.d.ts
|
|
58
|
-
interface ExternalOptimizationExample {
|
|
59
|
-
id: string;
|
|
60
|
-
data: unknown;
|
|
61
|
-
}
|
|
62
|
-
interface ExternalTextEvaluationResponse {
|
|
63
|
-
score: number;
|
|
64
|
-
info: {
|
|
65
|
-
scenarioId: string;
|
|
66
|
-
dimensions: Record<string, number>;
|
|
67
|
-
notes?: string;
|
|
68
|
-
artifact?: unknown;
|
|
69
|
-
/** The optimizer score is a finite protocol value; Eval remains the
|
|
70
|
-
* authority for whether the underlying cell actually produced a score. */
|
|
71
|
-
status?: 'scored' | 'failed';
|
|
72
|
-
error?: {
|
|
73
|
-
stage: 'dispatch' | 'judge' | 'unknown';
|
|
74
|
-
message: string;
|
|
75
|
-
};
|
|
76
|
-
};
|
|
77
|
-
}
|
|
78
|
-
declare function decodeExternalTextCandidate(candidate: ExternalTextCandidate): MutableSurface;
|
|
79
|
-
//#endregion
|
|
80
|
-
//#region src/campaign/external-text-optimization-contract.d.ts
|
|
81
|
-
interface ExternalTextOptimizerContext {
|
|
82
|
-
readonly runId: string;
|
|
83
|
-
readonly name: string;
|
|
84
|
-
readonly objective: string;
|
|
85
|
-
readonly evaluationId: string;
|
|
86
|
-
readonly background?: string;
|
|
87
|
-
readonly seedCandidate: ExternalTextCandidate;
|
|
88
|
-
readonly trainSet: readonly ExternalOptimizationExample[];
|
|
89
|
-
readonly selectionSet: readonly ExternalOptimizationExample[];
|
|
90
|
-
readonly maxEvaluations: number;
|
|
91
|
-
readonly seed: number;
|
|
92
|
-
/** Stable directory for optimizer checkpoints from compatible attempts. */
|
|
93
|
-
readonly stateDir: string;
|
|
94
|
-
readonly restoreRequested: boolean;
|
|
95
|
-
readonly artifactDir: string;
|
|
96
|
-
readonly signal: AbortSignal;
|
|
97
|
-
/** Record every optimizer-owned paid call through this attributed account. */
|
|
98
|
-
readonly cost: CampaignCostMeter;
|
|
99
|
-
readonly evaluate: (request: ExternalTextEvaluationRequest) => Promise<ExternalTextEvaluationResponse>;
|
|
100
|
-
}
|
|
101
|
-
interface ExternalTextOptimizerResult {
|
|
102
|
-
bestCandidate: ExternalTextCandidate;
|
|
103
|
-
resumed: boolean;
|
|
104
|
-
costAccounting: {
|
|
105
|
-
kind: 'metered';
|
|
106
|
-
} | {
|
|
107
|
-
kind: 'no-paid-work';
|
|
108
|
-
} | {
|
|
109
|
-
kind: 'external';
|
|
110
|
-
reason: string;
|
|
111
|
-
};
|
|
112
|
-
}
|
|
113
|
-
/**
|
|
114
|
-
* Configuration for adapting another text optimizer.
|
|
115
|
-
*
|
|
116
|
-
* `run` owns search. Agent Eval owns split isolation, bounded candidate
|
|
117
|
-
* evaluation, exact cost collection, provenance, and final comparison.
|
|
118
|
-
*/
|
|
119
|
-
interface ExternalTextOptimizationMethodConfig<TScenario extends Scenario, TArtifact = unknown> {
|
|
120
|
-
name: string;
|
|
121
|
-
source: Omit<OptimizationPackageSource, 'evidence'>;
|
|
122
|
-
objective: string;
|
|
123
|
-
evaluationId: string;
|
|
124
|
-
background?: string;
|
|
125
|
-
maxEvaluations: number;
|
|
126
|
-
/** Hard limit for calls made through `context.cost`. Use 0 for no paid work. */
|
|
127
|
-
maxOptimizerCostUsd: number;
|
|
128
|
-
/** Abort `context.signal` after this duration. Default: 30 minutes. */
|
|
129
|
-
timeoutMs?: number;
|
|
130
|
-
/** Default: `never`. Compatible runs reuse one state directory. */
|
|
131
|
-
resume?: ExternalOptimizerResumeMode;
|
|
132
|
-
maxCandidateChars?: number;
|
|
133
|
-
maxEvidenceChars?: number;
|
|
134
|
-
describeScenario?: (scenario: TScenario) => unknown;
|
|
135
|
-
describeArtifact?: (artifact: TArtifact, scenario: TScenario) => unknown;
|
|
136
|
-
run: (context: ExternalTextOptimizerContext) => Promise<ExternalTextOptimizerResult>;
|
|
137
|
-
}
|
|
138
|
-
//#endregion
|
|
139
|
-
//#region src/campaign/external-text-optimization.d.ts
|
|
140
|
-
/**
|
|
141
|
-
* Adapt a third-party text optimizer without reimplementing its search.
|
|
142
|
-
*
|
|
143
|
-
* The callback never receives final test cases. Calls to `evaluate` are
|
|
144
|
-
* counted before execution and stop at `maxEvaluations`.
|
|
145
|
-
*/
|
|
146
|
-
declare function externalTextOptimizationMethod<TScenario extends Scenario, TArtifact>(config: ExternalTextOptimizationMethodConfig<TScenario, TArtifact>): OptimizationMethod<TScenario, TArtifact>;
|
|
147
|
-
//#endregion
|
|
148
|
-
//#region src/campaign/optimizer-model.d.ts
|
|
149
|
-
type OptimizerModelBudget = ExternalOptimizerModelBudget;
|
|
150
|
-
/** One metered model path supplied by the package that owns execution. */
|
|
151
|
-
interface OpenAICompatibleOptimizerModel {
|
|
152
|
-
model: string;
|
|
153
|
-
budget: OptimizerModelBudget;
|
|
154
|
-
/** Caller-owned execution path, such as Runtime's exact AgentProfile adapter. */
|
|
155
|
-
call: ExternalOptimizerModelCall;
|
|
156
|
-
/** Stable public identity included in resumable-run compatibility. */
|
|
157
|
-
callRef: string;
|
|
158
|
-
/**
|
|
159
|
-
* Served-model acceptance for every proxied call. Default `'exact'`, which
|
|
160
|
-
* rejects any substitution with a 502 to the child.
|
|
161
|
-
* `'allow-within-family'` accepts a different model of the same provider
|
|
162
|
-
* family; it keeps family-level claims valid and forfeits per-model claims.
|
|
163
|
-
*/
|
|
164
|
-
servedModelPolicy?: ServedModelPolicy;
|
|
165
|
-
/**
|
|
166
|
-
* Also expose this metered model over the Anthropic Messages API
|
|
167
|
-
* (`POST /v1/messages`) on the loopback proxy. Required for GEPA agent
|
|
168
|
-
* engines that drive a `claude` CLI subprocess. Agent engines are chatty:
|
|
169
|
-
* size `budget.maxRequests` for tens of calls per engine run. Default: false.
|
|
170
|
-
*/
|
|
171
|
-
anthropicEndpoint?: boolean;
|
|
172
|
-
}
|
|
173
|
-
//#endregion
|
|
174
|
-
//#region src/campaign/gepa-optimization-method.d.ts
|
|
175
|
-
/** Shared settings for one bounded GEPA engine invocation. */
|
|
176
|
-
interface GepaEngineOptions {
|
|
177
|
-
/** GEPA engine name. GEPA validates names available in its Python runtime. */
|
|
178
|
-
engine: string;
|
|
179
|
-
/** Optional billed-USD stop. Omit when the execution owner reports USD as unknown. */
|
|
180
|
-
maxProposerCostUsd?: number;
|
|
181
|
-
/** Maximum concurrent evaluations inside this engine. Default: 1. */
|
|
182
|
-
maxConcurrency?: number;
|
|
183
|
-
/** Stop the engine after it reaches this score. */
|
|
184
|
-
stopAtScore?: number;
|
|
185
|
-
/** Isolate agent-based engines. Default: true. */
|
|
186
|
-
sandbox?: boolean;
|
|
187
|
-
/**
|
|
188
|
-
* JSON-safe configuration for the registered GEPA engine.
|
|
189
|
-
* Python callables and class instances cannot cross the process boundary.
|
|
190
|
-
*/
|
|
191
|
-
engineConfig?: Record<string, unknown>;
|
|
192
|
-
}
|
|
193
|
-
/** One independently budgeted GEPA engine invocation. */
|
|
194
|
-
interface GepaEngineRun extends GepaEngineOptions {
|
|
195
|
-
/** Maximum callback evaluations this engine may consume. */
|
|
196
|
-
maxEvaluations: number;
|
|
197
|
-
}
|
|
198
|
-
/** An engine in an adaptive run. All engines share the recipe evaluation limit. */
|
|
199
|
-
type GepaAdaptiveEngineRun = GepaEngineOptions;
|
|
200
|
-
/**
|
|
201
|
-
* A direct mapping to a GEPA optimization recipe.
|
|
202
|
-
*
|
|
203
|
-
* GEPA owns every search and composition operation represented here. Tangle
|
|
204
|
-
* supplies the candidate, data, execution callback, judges, and budgets.
|
|
205
|
-
*/
|
|
206
|
-
type GepaOptimizationRecipe = {
|
|
207
|
-
kind: 'engine';
|
|
208
|
-
run: GepaEngineRun;
|
|
209
|
-
} | {
|
|
210
|
-
kind: 'sequential';
|
|
211
|
-
runs: readonly GepaEngineRun[];
|
|
212
|
-
} | {
|
|
213
|
-
kind: 'adaptive-sequential';
|
|
214
|
-
runs: readonly GepaAdaptiveEngineRun[];
|
|
215
|
-
/** One evaluation budget shared by every adaptive stage. */
|
|
216
|
-
maxEvaluations: number;
|
|
217
|
-
/** Switch engines after this many evaluations without improvement. */
|
|
218
|
-
plateauEvaluations: number;
|
|
219
|
-
patience?: number;
|
|
220
|
-
minEvaluationsPerStage?: number;
|
|
221
|
-
improvementEpsilon?: number;
|
|
222
|
-
cycle?: boolean;
|
|
223
|
-
maxSwitches?: number;
|
|
224
|
-
maxConcurrency?: number;
|
|
225
|
-
} | {
|
|
226
|
-
kind: 'best-of';
|
|
227
|
-
runs: readonly GepaEngineRun[];
|
|
228
|
-
maxWorkers?: number;
|
|
229
|
-
} | {
|
|
230
|
-
kind: 'vote';
|
|
231
|
-
runs: readonly GepaEngineRun[];
|
|
232
|
-
maxWorkers?: number;
|
|
233
|
-
} | {
|
|
234
|
-
kind: 'omni';
|
|
235
|
-
explore: readonly GepaEngineRun[];
|
|
236
|
-
continueWith: GepaEngineRun;
|
|
237
|
-
maxWorkers?: number;
|
|
238
|
-
};
|
|
239
|
-
/** The command that runs the Python GEPA bridge. */
|
|
240
|
-
type GepaRunnerCommand = ExternalOptimizerRunnerCommand;
|
|
241
|
-
interface GepaOptimizationMethodConfig<TScenario extends Scenario, TArtifact = unknown> {
|
|
242
|
-
/** Unique comparison-method name. Default identifies the GEPA recipe. */
|
|
243
|
-
name?: string;
|
|
244
|
-
/** A direct GEPA recipe. */
|
|
245
|
-
recipe: GepaOptimizationRecipe;
|
|
246
|
-
/** Plain-language goal shown to the external optimizer. */
|
|
247
|
-
objective: string;
|
|
248
|
-
/** Stable identity for the dispatch, judges, model settings, and scoring logic. */
|
|
249
|
-
evaluationId: string;
|
|
250
|
-
/** Optional bounded context about the surface and task. */
|
|
251
|
-
background?: string;
|
|
252
|
-
/**
|
|
253
|
-
* Public dotted Python modules imported before GEPA resolves engine names.
|
|
254
|
-
* Each module should call GEPA's official `register_engine()` API at import.
|
|
255
|
-
*/
|
|
256
|
-
engineModules?: readonly string[];
|
|
257
|
-
/** Reject external candidates longer than this. Default: 200,000 characters. */
|
|
258
|
-
maxCandidateChars?: number;
|
|
259
|
-
/** Reject serialized score evidence longer than this. Default: 100,000 characters. */
|
|
260
|
-
maxEvidenceChars?: number;
|
|
261
|
-
/** Candidate-evaluation callback byte limits. Omitted fields use finite defaults. */
|
|
262
|
-
evaluationCallbackLimits?: Partial<ExternalOptimizerCallbackLimits>;
|
|
263
|
-
/** End the bridge process after this many milliseconds. Default: 30 minutes. */
|
|
264
|
-
timeoutMs?: number;
|
|
265
|
-
/**
|
|
266
|
-
* OpenAI-compatible model used by standard GEPA reflection.
|
|
267
|
-
* Calls pass through Agent Eval's local model proxy. Every recipe engine must
|
|
268
|
-
* be `gepa` when this is set.
|
|
269
|
-
*/
|
|
270
|
-
optimizer?: OpenAICompatibleOptimizerModel;
|
|
271
|
-
/**
|
|
272
|
-
* Decide what the external optimizer may read for a train or selection case.
|
|
273
|
-
* The returned value must be JSON-serializable. The final comparison cases
|
|
274
|
-
* are not accepted by this API and cannot be serialized here.
|
|
275
|
-
*/
|
|
276
|
-
describeScenario?: (scenario: TScenario) => unknown;
|
|
277
|
-
/** Optional bounded artifact evidence returned to GEPA after each evaluation. */
|
|
278
|
-
describeArtifact?: (artifact: TArtifact, scenario: TScenario) => unknown;
|
|
279
|
-
/** Default: `never`. Compatible runs resume only when explicitly enabled. */
|
|
280
|
-
resume?: ExternalOptimizerResumeMode;
|
|
281
|
-
/**
|
|
282
|
-
* Required for resumable direct GEPA runs because upstream state uses Python
|
|
283
|
-
* pickle. Enable only for state created locally in a directory you control.
|
|
284
|
-
*/
|
|
285
|
-
trustResumeState?: boolean;
|
|
286
|
-
runner?: GepaRunnerCommand;
|
|
287
|
-
/**
|
|
288
|
-
* Record GEPA's own candidate population into the canonical `SearchLedger`
|
|
289
|
-
* and return the bounded receipt on the method result, so a comparison run
|
|
290
|
-
* under `searchHistoryPolicy: 'require-complete'` accepts this method.
|
|
291
|
-
*
|
|
292
|
-
* `identity` declares the immutable revisions and the model snapshot the
|
|
293
|
-
* ledger requires and the bridge does not report. `path` defaults to
|
|
294
|
-
* `<runDir>/search-ledger.jsonl`.
|
|
295
|
-
*/
|
|
296
|
-
searchLedger?: {
|
|
297
|
-
identity: SearchRunIdentity;
|
|
298
|
-
path?: string;
|
|
299
|
-
};
|
|
300
|
-
}
|
|
301
|
-
declare function gepaOptimizationMethod<TScenario extends Scenario, TArtifact>(config: GepaOptimizationMethodConfig<TScenario, TArtifact>): OptimizationMethod<TScenario, TArtifact>;
|
|
302
|
-
//#endregion
|
|
303
|
-
//#region src/campaign/skillopt-optimization-method.d.ts
|
|
304
|
-
interface SkillOptTrainerConfig {
|
|
305
|
-
epochs: number;
|
|
306
|
-
batchSize: number;
|
|
307
|
-
accumulation?: number;
|
|
308
|
-
editBudget?: number;
|
|
309
|
-
minEditBudget?: number;
|
|
310
|
-
analystWorkers?: number;
|
|
311
|
-
minibatchSize?: number;
|
|
312
|
-
mergeBatchSize?: number;
|
|
313
|
-
maxAnalystRounds?: number;
|
|
314
|
-
evaluationWorkers?: number;
|
|
315
|
-
learningRateSchedule?: 'constant' | 'linear' | 'cosine' | 'autonomous';
|
|
316
|
-
learningRateControl?: 'fixed' | 'autonomous' | 'none';
|
|
317
|
-
updateMode?: 'patch' | 'rewrite_from_suggestions' | 'full_rewrite_minibatch';
|
|
318
|
-
failureOnly?: boolean;
|
|
319
|
-
useSlowUpdate?: boolean;
|
|
320
|
-
useMetaSkill?: boolean;
|
|
321
|
-
/**
|
|
322
|
-
* Additional flat SkillOpt trainer settings. Tangle overwrites data,
|
|
323
|
-
* output, split, seed, validation, and activation settings.
|
|
324
|
-
*/
|
|
325
|
-
overrides?: Record<string, unknown>;
|
|
326
|
-
}
|
|
327
|
-
type SkillOptRunnerCommand = ExternalOptimizerRunnerCommand;
|
|
328
|
-
interface SkillOptOptimizationMethodConfig<TScenario extends Scenario, TArtifact = unknown> {
|
|
329
|
-
name?: string;
|
|
330
|
-
/** Goal included with every described train and selection case. */
|
|
331
|
-
objective: string;
|
|
332
|
-
background?: string;
|
|
333
|
-
/** Stable identity for the dispatch, judges, model settings, and scoring logic. */
|
|
334
|
-
evaluationId: string;
|
|
335
|
-
trainer: SkillOptTrainerConfig;
|
|
336
|
-
/**
|
|
337
|
-
* OpenAI-compatible model connection and hard limits for SkillOpt's own
|
|
338
|
-
* optimizer calls.
|
|
339
|
-
*/
|
|
340
|
-
optimizer: OpenAICompatibleOptimizerModel;
|
|
341
|
-
/** Hard cap on candidate-case callback requests. */
|
|
342
|
-
maxEvaluations: number;
|
|
343
|
-
/** Scores at or above this value count as hard successes. Default: 1. */
|
|
344
|
-
hardScoreThreshold?: number;
|
|
345
|
-
maxCandidateChars?: number;
|
|
346
|
-
/** Maximum serialized scenario plus evaluation evidence. Default: 100,000. */
|
|
347
|
-
maxEvidenceChars?: number;
|
|
348
|
-
/** Candidate-evaluation callback byte limits. Omitted fields use finite defaults. */
|
|
349
|
-
evaluationCallbackLimits?: Partial<ExternalOptimizerCallbackLimits>;
|
|
350
|
-
timeoutMs?: number;
|
|
351
|
-
describeScenario?: (scenario: TScenario) => unknown;
|
|
352
|
-
describeArtifact?: (artifact: TArtifact, scenario: TScenario) => unknown;
|
|
353
|
-
resume?: ExternalOptimizerResumeMode;
|
|
354
|
-
runner?: SkillOptRunnerCommand;
|
|
355
|
-
}
|
|
356
|
-
/** Run Microsoft's SkillOpt trainer as a complete optimization method. */
|
|
357
|
-
declare function skillOptOptimizationMethod<TScenario extends Scenario, TArtifact>(config: SkillOptOptimizationMethodConfig<TScenario, TArtifact>): OptimizationMethod<TScenario, TArtifact>;
|
|
358
|
-
//#endregion
|
|
359
|
-
//#region src/campaign/gates/compose.d.ts
|
|
360
|
-
/** Compose gates — all must `ship` for the composite to `ship`. First
|
|
361
|
-
* non-ship verdict short-circuits the composite verdict, but ALL gates run
|
|
362
|
-
* (so the result records every gate's reason — useful for diagnostics). */
|
|
363
|
-
declare function composeGate<TArtifact = unknown, TScenario extends Scenario = Scenario>(...gates: Array<Gate<TArtifact, TScenario>>): Gate<TArtifact, TScenario>;
|
|
364
|
-
//#endregion
|
|
365
|
-
//#region src/campaign/gates/default-production-gate.d.ts
|
|
366
|
-
type DefaultProductionGateCheck = 'dimension-regression' | 'budget' | 'red-team' | 'reward-hacking' | 'canary';
|
|
367
|
-
type DefaultProductionRewardHackingOptions = Omit<DetectRewardHackingInput, 'runs' | 'truthOf'> & {
|
|
368
|
-
truthOf: NonNullable<DetectRewardHackingInput['truthOf']>;
|
|
369
|
-
};
|
|
370
|
-
interface DefaultProductionGateOptions {
|
|
371
|
-
/** Required: scenarios held out from training; substrate compares
|
|
372
|
-
* candidate-on-holdout vs baseline-on-holdout. */
|
|
373
|
-
holdoutScenarios: Scenario[];
|
|
374
|
-
/** Minimum held-out lift the **paired-bootstrap CI lower bound** must clear
|
|
375
|
-
* to ship — NOT a point estimate. Default 0 ⇒ "confidently positive at the
|
|
376
|
-
* confidence level". Interpreted in the judge's native composite scale (set
|
|
377
|
-
* e.g. 2 for a 0-100 rubric to require a ≥2-point significant gain). */
|
|
378
|
-
deltaThreshold?: number;
|
|
379
|
-
/** Confidence level for the held-out + dimension bootstraps. Default 0.95. */
|
|
380
|
-
confidence?: number;
|
|
381
|
-
/** Bootstrap resamples. Default 2000. */
|
|
382
|
-
bootstrapResamples?: number;
|
|
383
|
-
/** Fixed bootstrap seed for a deterministic verdict. Default 1337. */
|
|
384
|
-
bootstrapSeed?: number;
|
|
385
|
-
/** Minimum paired holdout observations (scenarios × reps) before a
|
|
386
|
-
* significance claim is allowed. The exact small-sample test may require
|
|
387
|
-
* more observations at the selected confidence. Default 3. */
|
|
388
|
-
minProductiveRuns?: number;
|
|
389
|
-
/** Ship statistic for the held-out significance test. Default `'mean'`
|
|
390
|
-
* (tie-robust — see `heldoutSignificance`). Pass `'median'` for
|
|
391
|
-
* outlier-robustness at the cost of tie-blindness. */
|
|
392
|
-
heldoutStatistic?: 'mean' | 'median';
|
|
393
|
-
/** Critical judge dimensions that must NOT significantly regress even when
|
|
394
|
-
* the net composite rises (anti-Goodhart). The gate HOLDS if any listed
|
|
395
|
-
* dimension's paired-delta CI lower bound < −`regressionTolerance`. E.g.
|
|
396
|
-
* `['hallucination_free']` for a legal agent. */
|
|
397
|
-
criticalDimensions?: string[];
|
|
398
|
-
/** Tolerance for the per-dimension regression guard, in the dimension's
|
|
399
|
-
* native scale. When omitted it auto-scales off observed magnitudes:
|
|
400
|
-
* 0.05 on [0,1], 5 on 0-100. */
|
|
401
|
-
regressionTolerance?: number;
|
|
402
|
-
/** Total $ budget for the complete improvement run. Requires
|
|
403
|
-
* `GateContext.costLedger`; missing or incomplete accounting holds. */
|
|
404
|
-
budgetUsd?: number;
|
|
405
|
-
/** Static artifact-screening cases. Only `expected: 'ignore'` cases without
|
|
406
|
-
* tool assertions are valid because this check does not dispatch case inputs
|
|
407
|
-
* or observe tool calls. */
|
|
408
|
-
redTeamBattery?: RedTeamCase[];
|
|
409
|
-
/** Shared run history, oldest first. Supplying history does not enable either
|
|
410
|
-
* monitoring check; configure `rewardHacking` and/or `canary` explicitly. */
|
|
411
|
-
recentRuns?: RunRecord[];
|
|
412
|
-
/** Enable reward-hacking monitoring with a caller-owned independent truth channel. */
|
|
413
|
-
rewardHacking?: DefaultProductionRewardHackingOptions;
|
|
414
|
-
/** Enable canary monitoring. Pass `{}` to use the canary defaults. */
|
|
415
|
-
canary?: CanaryOptions;
|
|
416
|
-
/** Optional checks that must be evaluated even when their normal input is
|
|
417
|
-
* absent. Configuring a check's input also makes that check required.
|
|
418
|
-
* Missing evidence always records `not_evaluated`; required unevaluated
|
|
419
|
-
* checks hold the release decision. Held-out significance is always required. */
|
|
420
|
-
requiredChecks?: DefaultProductionGateCheck[];
|
|
421
|
-
}
|
|
422
|
-
/**
|
|
423
|
-
* Opinionated production gate composing held-out significance, red-team, reward-hacking, and canary checks into a single `Gate.decide` decision.
|
|
424
|
-
*/
|
|
425
|
-
declare function defaultProductionGate<TArtifact, TScenario extends Scenario>(options: DefaultProductionGateOptions): Gate<TArtifact, TScenario>;
|
|
426
|
-
//#endregion
|
|
427
|
-
//#region src/campaign/gates/heldout-gate.d.ts
|
|
428
|
-
interface HeldOutGateOptions<TScenario extends Scenario = Scenario> {
|
|
429
|
-
scenarios: TScenario[];
|
|
430
|
-
/** Effect-size threshold the CI lower bound must clear, in the judge's native
|
|
431
|
-
* scale. Default 0.5. Equality holds; CI.low must be greater than this value. */
|
|
432
|
-
deltaThreshold?: number;
|
|
433
|
-
/** Bootstrap CI confidence. Default 0.95. */
|
|
434
|
-
confidence?: number;
|
|
435
|
-
/** Minimum paired holdout observations to claim significance. The exact
|
|
436
|
-
* small-sample test may require more observations at the selected
|
|
437
|
-
* confidence. Default 3. */
|
|
438
|
-
minProductiveRuns?: number;
|
|
439
|
-
/** Bootstrap resamples. Default 2000. */
|
|
440
|
-
resamples?: number;
|
|
441
|
-
/** Fixed bootstrap seed for deterministic verdicts. Default 1337. */
|
|
442
|
-
bootstrapSeed?: number;
|
|
443
|
-
}
|
|
444
|
-
/**
|
|
445
|
-
* Composable held-out gate: ships only when the lower bound of the DECIDING
|
|
446
|
-
* paired interval on the candidate-minus-baseline composite delta clears
|
|
447
|
-
* `deltaThreshold` — Tango's score interval on a pass/fail holdout, the mean
|
|
448
|
-
* bootstrap otherwise. See {@link decidePairedPromotion}.
|
|
449
|
-
*/
|
|
450
|
-
declare function heldOutGate<TArtifact, TScenario extends Scenario>(options: HeldOutGateOptions<TScenario>): Gate<TArtifact, TScenario>;
|
|
451
|
-
//#endregion
|
|
452
|
-
export { ReferenceEquivalenceJudgeInput as A, campaignSplitDigestFromIdentities as B, ExternalTextOptimizerContext as C, decodeExternalTextCandidate as D, ExternalTextEvaluationResponse as E, runReferenceEquivalenceJudge as F, assertCampaignDesign as I, assertCampaignSplitIdentity as L, ReferenceEquivalenceJudgeResult as M, ReferenceEquivalenceScenario as N, REFERENCE_EQUIVALENCE_INPUT_LIMITS as O, createReferenceEquivalenceJudge as P, campaignScenarioIdentity as R, ExternalTextOptimizationMethodConfig as S, ExternalOptimizationExample as T, GepaRunnerCommand as _, DefaultProductionRewardHackingOptions as a, OptimizerModelBudget as b, SkillOptOptimizationMethodConfig as c, skillOptOptimizationMethod as d, GepaAdaptiveEngineRun as f, GepaOptimizationRecipe as g, GepaOptimizationMethodConfig as h, DefaultProductionGateOptions as i, ReferenceEquivalenceJudgeOptions as j, REFERENCE_EQUIVALENCE_JUDGE_VERSION as k, SkillOptRunnerCommand as l, GepaEngineRun as m, heldOutGate as n, defaultProductionGate as o, GepaEngineOptions as p, DefaultProductionGateCheck as r, composeGate as s, HeldOutGateOptions as t, SkillOptTrainerConfig as u, gepaOptimizationMethod as v, ExternalTextOptimizerResult as w, externalTextOptimizationMethod as x, OpenAICompatibleOptimizerModel as y, campaignSplitDigest as z };
|
|
453
|
-
//# sourceMappingURL=heldout-gate-Df5hsqmm.d.ts.map
|
|
@@ -1 +0,0 @@
|
|
|
1
|
-
{"version":3,"file":"heldout-gate-Df5hsqmm.d.ts","names":[],"sources":["../src/campaign/coverage.ts","../src/reference-equivalence-judge.ts","../src/campaign/external-text-evaluation.ts","../src/campaign/external-text-optimization-contract.ts","../src/campaign/external-text-optimization.ts","../src/campaign/optimizer-model.ts","../src/campaign/gepa-optimization-method.ts","../src/campaign/skillopt-optimization-method.ts","../src/campaign/gates/compose.ts","../src/campaign/gates/default-production-gate.ts","../src/campaign/gates/heldout-gate.ts"],"mappings":";;;;;;;;;iBAWgB,qBAAqB,kBAAkB,UACrD,oBAAoB,aACpB;;iBA2Bc,yBAAyB,kBAAkB,UACzD,UAAU,YACT,2BAA2B,KAAK;;iBAUnB,kCACd,oBAAoB,4BACpB;;iBAgBc,oBAAoB,kBAAkB,UACpD,oBAAoB,aACpB;;iBAOc,4BACd,oBAAoB,4BACpB,cACA;;;cC3EW;cAEA;WACX;WACA;WACA;;UAGe,qCAAqC;EACpD;EACA;;UAGe;EACf;EACA;EACA;;UAGe;;EAEf,MAAM;;EAEN;;EAEA,SAAS;;EAET,aAAa;;UAGE,wCAAwC;EACvD;EACA;EACA;EACA;;;iBA0Bc,gCACd,SAAS,mCACR,oBAAoB;;iBA2CD,6BACpB,OAAO,gCACP,SAAS,mCACR,QAAQ;;;UCrGM;EACf;EACA;;UAGe;EACf;EACA;IACE;IACA,YAAY;IACZ;IACA;;;IAGA;IACA;MACE;MACA;;;;iBAwHU,4BAA4B,WAAW,wBAAwB;;;UC3I9D;WACN;WACA;WACA;WACA;WACA;WACA,eAAe;WACf,mBAAmB;WACnB,uBAAuB;WACvB;WACA;;WAEA;WACA;WACA;WACA,QAAQ;;WAER,MAAM;WACN,WACP,SAFa,kCAGV,QAAQ;;UAGE;EACf,eAAe;EACf;EACA;IACM;;IACA;;IACA;IAAkB;;;;;;;;;UAqBT,qCACf,kBAAkB,UAClB;EAEA;EACA,QAAQ,KAAK;EACb;EACA;EACA;EACA;;EAEA;;EAEA;;EAEA,SAAS;EACT;EACA;EACA,oBAAoB,UAAU;EAC9B,oBAAoB,UAAU,WAAW,UAAU;EACnD,MAAM,SAAS,iCAAiC,QAAQ;;;;;;;;;;iBCN1C,+BAA+B,kBAAkB,UAAU,WACzE,QAAQ,qCAAqC,WAAW,aACvD,mBAAmB,WAAW;;;KCvErB,uBAAuB;;UAGlB;EACf;EACA,QAAQ;;EAER,MAAM;;EAEN;;;;;;;EAOA,oBAAoB;;;;;;;EAOpB;;;;;UCyCe;;EAEf;;EAEA;;EAEA;;EAEA;;EAEA;;;;;EAKA,eAAe;;;UAIA,sBAAsB;;EAErC;;;KAIU,wBAAwB;;;;;;;KAQxB;EAEN;EACA,KAAK;;EAGL;EACA,eAAe;;EAGf;EACA,eAAe;;EAEf;;EAEA;EACA;EACA;EACA;EACA;EACA;EACA;;EAGA;EACA,eAAe;EACf;;EAGA;EACA,eAAe;EACf;;EAGA;EACA,kBAAkB;EAClB,cAAc;EACd;;;KAIM,oBAAoB;UAEf,6BAA6B,kBAAkB,UAAU;;EAExE;;EAEA,QAAQ;;EAER;;EAEA;;EAEA;;;;;EAKA;;EAEA;;EAEA;;EAEA,2BAA2B,QAAQ;;EAEnC;;;;;;EAMA,YAAY;;;;;;EAMZ,oBAAoB,UAAU;;EAE9B,oBAAoB,UAAU,WAAW,UAAU;;EAEnD,SAAS;;;;;EAKT;EACA,SAAS;;;;;;;;;;EAUT;IAAiB,UAAU;IAAmB;;;iBA6ChC,uBAAuB,kBAAkB,UAAU,WACjE,QAAQ,6BAA6B,WAAW,aAC/C,mBAAmB,WAAW;;;UC7LhB;EACf;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;;;;;EAKA,YAAY;;KAGF,wBAAwB;UAEnB,iCAAiC,kBAAkB,UAAU;EAC5E;;EAEA;EACA;;EAEA;EACA,SAAS;;;;;EAKT,WAAW;;EAEX;;EAEA;EACA;;EAEA;;EAEA,2BAA2B,QAAQ;EACnC;EACA,oBAAoB,UAAU;EAC9B,oBAAoB,UAAU,WAAW,UAAU;EACnD,SAAS;EACT,SAAS;;;iBAIK,2BAA2B,kBAAkB,UAAU,WACrE,QAAQ,iCAAiC,WAAW,aACnD,mBAAmB,WAAW;;;;;;iBC1GjB,YAAY,qBAAqB,kBAAkB,WAAW,aACzE,OAAO,MAAM,KAAK,WAAW,cAC/B,KAAK,WAAW;;;KCaP;KAOA,wCAAwC,KAClD;EAGA,SAAS,YAAY;;UAGN;;;EAGf,kBAAkB;;;;;EAKlB;;EAEA;;EAEA;;EAEA;;;;EAIA;;;;EAIA;;;;;EAKA;;;;EAIA;;;EAGA;;;;EAIA,iBAAiB;;;EAGjB,aAAa;;EAEb,gBAAgB;;EAEhB,SAAS;;;;;EAKT,iBAAiB;;;;;iBAMH,sBAAsB,WAAW,kBAAkB,UACjE,SAAS,+BACR,KAAK,WAAW;;;UC/EF,mBAAmB,kBAAkB,WAAW;EAC/D,WAAW;;;EAGX;;EAEA;;;;EAIA;;EAEA;;EAEA;;;;;;;;iBASc,YAAY,WAAW,kBAAkB,UACvD,SAAS,mBAAmB,aAC3B,KAAK,WAAW"}
|
|
@@ -1 +0,0 @@
|
|
|
1
|
-
{"version":3,"file":"index-BQqOjerE.d.ts","names":[],"sources":["../src/contract/measured-comparison.ts","../src/contract/profile-measured-comparison.ts","../src/contract/intake/run-record-dir.ts","../src/contract/eval-reporting-suite.ts","../src/contract/diff.ts","../src/contract/intake/agent-trace.ts","../src/contract/intake/code-agent-observation.ts","../src/contract/intake/code-agent-session.ts","../src/contract/intake/code-agent-store.ts","../src/contract/intake/feedback-table.ts","../src/contract/intake/otel-spans.ts"],"mappings":";;;;;;;;;;;;;;UAiCiB;EACf,QAAQ,gCAAgC;EACxC;EACA;;UAGe;EACf,YAAY;EACZ;EACA,QAAQ;EACR,MAAM;EACN,eAAe;EACf;EACA,SAAS;;UAGM;EACf,YAAY;EACZ,QAAQ,OAAO,oCAAoC,QAAQ;;EAE3D;;EAEA,aAAa;EACb,SAAS;;UAGM;EACf,cAAc;EACd;IACE;IACA,MAAM;;;UAIO;EACf,YAAY;EACZ,cAAc;EACd;IACE;IACA,MAAM;;EAER,aAAa;EACb;EACA,YAAY;EACZ;EACA,WAAW;;;UAII,kBAAkB;EACjC;EACA,UAAU;EACV,WAAW;;;UAII,yBAAyB;EACxC,MAAM,KAAK;EACX,WAAW,KAAK;IAAkB;IAAc;;EAChD,QAAQ,KAAK;EACb,eAAe,KAAK,OAAO;EAC3B,UAAU,KAAK;EACf,UAAU,KAAK;EACf,OAAO,KAAK;;UAGG,kCAAkC;EACjD,uBAAuB,kBAAkB;EACzC,QAAQ;EACR,SAAS,yBAAyB;;EAElC;;EAEA,kBAAkB;;EAElB,kBAAkB;;;KAIR,8BAA8B,KACxC;EAGA,iBAAiB;EACjB,WAAW;EACX;;;iBAIc,2BACd,UAAU,sCACT;;iBAQa,4BACd,SAAS,qCACR;;iBAiBa,wBACd,UAAU,mCACT;iBAQa,0BAA0B,iBAAiB;;iBAarC,uBACpB,SAAS,gCACR,QAAQ;;;;;;;;iBAkEK,2BAA2B,MACzC,SAAS,kCAAkC,QAC1C;;iBA8Ya,0CACd,SAAS,oCACR;;iBAuEa,oCACd,iBACC;;;UCjrBc;EACf,aAAa;EACb,QAAQ,gCAAgC;EACxC;EACA;;UAGe;EACf,YAAY;EACZ;EACA,aAAa;EACb,MAAM;EACN,SAAS;EACT;EACA,SAAS;;UAGM;EACf,YAAY;EACZ,QACE,OAAO,kDACN,QAAQ;;EAEX;;EAEA,aAAa;EACb,SAAS;;UAGM;EACf,cAAc;EACd;IACE;IACA,MAAM;;;UAIO;EACf,YAAY;EACZ,cAAc;EACd;IACE;IACA,MAAM;;EAER,aAAa;EACb;EACA,YAAY;EACZ;EACA,WAAW;;;iBAIG,gCACd,UAAU,sCACT;;iBAQa,iCACd,SAAS,0CACR;;iBAqBa,sCACd,UAAU,4CACT;;;;;;iBAsBmB,qCACpB,SAAS,8CACR,QAAQ;;iBA0CK,wDACd,SAAS,kDACR;;iBAuEa,kDACd,iBACC;;;;UC7Oc;;EAEf;;EAEA;;EAEA;;UAGe;;;;;;EAMf;;;;;;;EAOA,WAAW;;;;;;EAMX;;UAGe;;EAEf,MAAM;;EAEN,UAAU;;EAEV;;;;;;;;;;iBAkBoB,iBACpB,cACA,UAAS,0BACR,QAAQ;;;;;KC7CC,0BAA0B;UAErB;;;;;EAKf,UAAU,KAAK;;EAEf,OAAO;;;;;;;;;;EAUP;;;;UAKe;;;EAGf,QAAQ;;EAER;;IAEE;;IAEA;;;IAGA;;IAEA;;;IAGA,UAAU;;;EAGZ;;;;;;;iBAUoB,mBACpB,OAAO,yBACP,UAAS,4BACR,QAAQ;;;;;;UC5DM;EACf;EACA;EACA;;;UAIe;EACf;EACA;EACA;EACA;EACA;;;EAGA,YAAY,eAAe,eAAe;;;;UAK3B;EACf;EACA;EACA;EACA;EACA;;EAEA,SAAS;;EAET,SAAS;;EAET,OAAO;;EAEP;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;;;;;UAMe;EACf;EACA;EACA;EACA;EACA,oBAAoB;EACpB,mBAAmB;EACnB;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;;EAEA,cAAc;;;;EAId,aAAa;;;;;;;;;iBAoDC,gBACd,QAAQ,2BACR,OAAO,4BACN;;;;;;iBAqEa,SAAS,QAAQ,cAAc,OAAO,eAAe;;;;;;;iBAsCrD,wBAAwB,KAAK,eAAe;;;KC1OhD;UAEK;EACf,MAAM;;EAEN;;UAGe;EACf;EACA;EACA;;;EAGA,cAAc;;UAGC;EACf;EACA,cAAc;EACd,QAAQ;;UAGO;EACf;EACA,eAAe;;UAGA;EACf;EACA;EACA;EACA;IAAQ;IAAc;;EACtB;IAAS;IAAe;;EACxB,OAAO;;;;UAOQ;EACf;;EAEA;;EAEA;EACA;EACA;;EAEA;;EAEA;;KAGU,kBAAkB,YAAY;;;;;;iBAW1B,gBAAgB,SAAS,qBAAqB;UAmE7C;;;;EAIf,SAAS,YAAY;;;EAGrB,cAAc;;;;;;;;iBASA,8BACd,MAAM,aACN,OAAO,kBACN;;;KCjLS;KAEA;KAEA;KAEA;KASA;UAEK;EACf;EACA;EACA;;UAGe;EACf;EACA;EACA,MAAM;EACN,SAAS;EACT;EACA,QAAQ;EACR;EACA;EACA,UAAU;;UAGK;EACf,QAAQ;EACR;EACA;EACA;IACE,QAAQ;IACR;;EAEF,SAAS;;UAGM;EACf,QAAQ;EACR;EACA;EACA,YAAY;;;;;;;iBAeE,wBACd,SAAS,iCACR;;;UCjCc;EACf;EACA;;UAGe;EACf;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;;UAGe;EACf,QAAQ;EACR;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA;EACA,WAAW;EACX;;UAGe;EACf,MAAM;EACN,aAAa;EACb,SAAS;EACT,cAAc;;UAGC;EACf;EACA;EACA;EACA;EACA;EACA;EACA,WAAW;EACX;EACA;EACA;EACA;EACA;EACA;;;EAGA,iBAAiB;;;EAGjB,YAAY;;;;KAKF;EACN;EAAe;EAAoB;;EACnC;EAAmB;;iBAcT,oBAAoB,gBAAgB;;;;;;;;;;iBAuB7B,yBAAyB,eAAe,eAAe;;;;;iBA6BxD,wBAAwB,eAAe,QAAQ;iBAUrD,iBACd,SAAS,gCACR;iBAIa,sBACd,SAAS,gCACR;iBAIa,oBACd,SAAS,gCACR;iBAIa,oBACd,SAAS,gCACR;iBAIa,cACd,SAAS,gCACR;;;;UC/Lc;;;;;WAKN;;WAEA,QAAQ;;;;;WAKR;;;;;WAKA;aACE;;aAEA;;;;KAKD;;UAUK;WACN;WACA;WACA;WACA;WACA,aAAa;;;UAIP;WACN;WACA,UAAU,SAAS,QAAQ,OAAO;;WAElC,QAAQ;aACN;aACA,QAAQ;;;;;;;;;KAUT;WAEG;WACA,OAAO;WACP;WACA,mBAAmB;;WAEnB;;WAEA;;WAEA;WACA,WAAW,SAAS,QAAQ,OAAO;WACnC,YAAY;;WAGZ;WACA,OAAO;WACP;;WAEA;WACA,YAAY;;;;;;;;;iBAaL,sBACpB,OAAO,sBACN,QAAQ;;;UCtHM;;;EAGf;;EAEA;;;EAGA;;;EAGA,WAAW;;UAGI;EACf;;;EAGA;;EAEA;;EAEA;;EAEA;;EAEA;;EAEA;;EAEA;;EAEA;;EAEA;;;EAGA,WAAW;;;EAGX,SAAS;;UAGM;;EAEf,SAAS;;;EAGT,OAAO;;;;EAIP;IAAU;IAAa;;;;;EAIvB;;UAGe;EACf,MAAM;;;EAGN,aAAa;IAAQ;IAAe;IAAe;;;iBAGrC,kBAAkB,MAAM,2BAA2B;;;UCvBlD;EACf,OAAO;;EAEP,eAAe;;EAEf;;;;;;EAMA,eAAe,eAAe,gBAAgB;;iBAGhC,cAAc,MAAM,uBAAuB"}
|