@tangle-network/agent-eval 0.133.0 → 0.133.2
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/CHANGELOG.md +17 -0
- package/README.md +1 -1
- package/dist/agent-profile-cell-OhuTee9n.js +335 -0
- package/dist/agent-profile-cell-OhuTee9n.js.map +1 -0
- package/dist/{analyze-runs-BjPn_fOS.js → analyze-runs-B-afTpCv.js} +6 -19
- package/dist/analyze-runs-B-afTpCv.js.map +1 -0
- package/dist/{analyze-runs-DZr7JW-m.d.ts → analyze-runs-BmX-h_yn.d.ts} +3 -3
- package/dist/{analyze-runs-DZr7JW-m.d.ts.map → analyze-runs-BmX-h_yn.d.ts.map} +1 -1
- package/dist/{baseline-HsBvw_dk.js → baseline-DcX5hQDv.js} +2 -70
- package/dist/{baseline-HsBvw_dk.js.map → baseline-DcX5hQDv.js.map} +1 -1
- package/dist/baseline-hG3K85h4.d.ts.map +1 -1
- package/dist/benchmarks/index.d.ts +1 -1
- package/dist/benchmarks/index.js +1 -1
- package/dist/{benchmarks-DncrVrSr.js → benchmarks-CJr1H1_a.js} +3 -3
- package/dist/{benchmarks-DncrVrSr.js.map → benchmarks-CJr1H1_a.js.map} +1 -1
- package/dist/builder-eval/index.js +1 -1
- package/dist/campaign/index.d.ts +3 -3
- package/dist/campaign/index.js +2 -2
- package/dist/{campaign-CyQMCCEU.js → campaign-BJjn1rhw.js} +19 -13
- package/dist/{campaign-CyQMCCEU.js.map → campaign-BJjn1rhw.js.map} +1 -1
- package/dist/{client-D4F9hdzR.d.ts → client-COvaLoQG.d.ts} +2 -2
- package/dist/{client-D4F9hdzR.d.ts.map → client-COvaLoQG.d.ts.map} +1 -1
- package/dist/contract/index.d.ts +3 -3
- package/dist/contract/index.js +5 -5
- package/dist/control.js +1 -1
- package/dist/{eval-campaign-CYkUME2T.js → eval-campaign-DXhpZghy.js} +4 -5
- package/dist/{eval-campaign-CYkUME2T.js.map → eval-campaign-DXhpZghy.js.map} +1 -1
- package/dist/hosted/index.d.ts +1 -1
- package/dist/index-3cdlURSk.d.ts.map +1 -1
- package/dist/{index-CiP2DRCj.d.ts → index-BREtv3ZZ.d.ts} +3 -3
- package/dist/{index-CiP2DRCj.d.ts.map → index-BREtv3ZZ.d.ts.map} +1 -1
- package/dist/{index-B_eUhU9K.d.ts → index-C7Wue8R6.d.ts} +28 -5
- package/dist/{index-B_eUhU9K.d.ts.map → index-C7Wue8R6.d.ts.map} +1 -1
- package/dist/{index-BAvgST_9.d.ts → index-nhIYz9hn.d.ts} +67 -9
- package/dist/index-nhIYz9hn.d.ts.map +1 -0
- package/dist/index.d.ts +7 -7
- package/dist/index.js +25 -18
- package/dist/index.js.map +1 -1
- package/dist/ledger-core/index.d.ts +2 -2
- package/dist/ledger-core/index.js +2 -2
- package/dist/ledger-core-CPZfcrC2.js +620 -0
- package/dist/ledger-core-CPZfcrC2.js.map +1 -0
- package/dist/meta-eval/index.js +2 -2
- package/dist/{mint-D5_87M5L.js → mint-BvkwcYZU.js} +2 -2
- package/dist/{mint-D5_87M5L.js.map → mint-BvkwcYZU.js.map} +1 -1
- package/dist/openapi.json +1 -1
- package/dist/{opencode-sqlite-BGrHeDu3.js → opencode-sqlite-8r6WUfHc.js} +2 -3
- package/dist/opencode-sqlite-8r6WUfHc.js.map +1 -0
- package/dist/{paired-arms-D9D0wXj2.js → paired-arms-6XItKzd1.js} +2 -2
- package/dist/{paired-arms-D9D0wXj2.js.map → paired-arms-6XItKzd1.js.map} +1 -1
- package/dist/pipelines/index.js +2 -2
- package/dist/profile-cell.js +1 -242
- package/dist/{propose-review-control-Bqb7daEJ.js → propose-review-control-SQ-n9-We.js} +2 -2
- package/dist/{propose-review-control-Bqb7daEJ.js.map → propose-review-control-SQ-n9-We.js.map} +1 -1
- package/dist/{release-report-DfmKSIEE.d.ts → release-report-CjHWa8Ia.d.ts} +2 -2
- package/dist/{release-report-DfmKSIEE.d.ts.map → release-report-CjHWa8Ia.d.ts.map} +1 -1
- package/dist/{release-report-oWt9f2k-.js → release-report-wuilQkvK.js} +3 -3
- package/dist/{release-report-oWt9f2k-.js.map → release-report-wuilQkvK.js.map} +1 -1
- package/dist/{replay-BMR4TEYY.js → replay-CJfGLdx4.js} +3 -3
- package/dist/{replay-BMR4TEYY.js.map → replay-CJfGLdx4.js.map} +1 -1
- package/dist/reporting.d.ts +2 -2
- package/dist/reporting.js +4 -4
- package/dist/{researcher-DMimgHtN.d.ts → researcher-CbSKhK8z.d.ts} +2 -2
- package/dist/{researcher-DMimgHtN.d.ts.map → researcher-CbSKhK8z.d.ts.map} +1 -1
- package/dist/{reward-hacking-BEvjdUtD.js → reward-hacking-Dl2UBzej.js} +3 -3
- package/dist/{reward-hacking-BEvjdUtD.js.map → reward-hacking-Dl2UBzej.js.map} +1 -1
- package/dist/rl.d.ts +1 -1
- package/dist/rl.js +6 -6
- package/dist/rollout/index.js +3 -3
- package/dist/{rollout-VEo41J0N.js → rollout-CreDz__7.js} +3 -3
- package/dist/{rollout-VEo41J0N.js.map → rollout-CreDz__7.js.map} +1 -1
- package/dist/{rubric-predictive-validity-B3xmbmS1.js → rubric-predictive-validity-QG7ydk0s.js} +2 -2
- package/dist/{rubric-predictive-validity-B3xmbmS1.js.map → rubric-predictive-validity-QG7ydk0s.js.map} +1 -1
- package/dist/{run-record-CN8Zd21B.js → run-record-BIwU2wdV.js} +2 -2
- package/dist/{run-record-CN8Zd21B.js.map → run-record-BIwU2wdV.js.map} +1 -1
- package/dist/{skillopt-optimization-method-DgN7U9iR.js → skillopt-optimization-method-CF6a327Q.js} +8 -4
- package/dist/{skillopt-optimization-method-DgN7U9iR.js.map → skillopt-optimization-method-CF6a327Q.js.map} +1 -1
- package/dist/{skillopt-optimization-method-CAASpcS3.d.ts → skillopt-optimization-method-wHF5xsUv.d.ts} +2 -2
- package/dist/{skillopt-optimization-method-CAASpcS3.d.ts.map → skillopt-optimization-method-wHF5xsUv.d.ts.map} +1 -1
- package/dist/{statistics-CnnxdpOg.js → statistics-DWM_AyLe.js} +90 -76
- package/dist/statistics-DWM_AyLe.js.map +1 -0
- package/dist/statistics-DbvkkDPa.d.ts.map +1 -1
- package/dist/{summary-report-DnUcjVpV.d.ts → summary-report-CFnQgNfg.d.ts} +2 -2
- package/dist/{summary-report-DnUcjVpV.d.ts.map → summary-report-CFnQgNfg.d.ts.map} +1 -1
- package/dist/{summary-report-BNs5nmXI.js → summary-report-Ci17nIdU.js} +4 -4
- package/dist/{summary-report-BNs5nmXI.js.map → summary-report-Ci17nIdU.js.map} +1 -1
- package/dist/supervisor-run/index.js +1 -1
- package/dist/{supervisor-run-_lnTLM3z.js → supervisor-run-B7lUGoyZ.js} +2 -2
- package/dist/{supervisor-run-_lnTLM3z.js.map → supervisor-run-B7lUGoyZ.js.map} +1 -1
- package/dist/traces.js +1 -1
- package/package.json +1 -1
- package/dist/analyze-runs-BjPn_fOS.js.map +0 -1
- package/dist/index-BAvgST_9.d.ts.map +0 -1
- package/dist/ledger-core-eqaI3PCD.js +0 -388
- package/dist/ledger-core-eqaI3PCD.js.map +0 -1
- package/dist/opencode-sqlite-BGrHeDu3.js.map +0 -1
- package/dist/pre-registration-DakwTRXk.js +0 -96
- package/dist/pre-registration-DakwTRXk.js.map +0 -1
- package/dist/profile-cell.js.map +0 -1
- package/dist/statistics-CnnxdpOg.js.map +0 -1
|
@@ -1,3 +1,4 @@
|
|
|
1
|
+
import { c as ValidationError } from "./errors-CEk209JS.js";
|
|
1
2
|
//#region src/ledger-core/atomic-file-lock.d.ts
|
|
2
3
|
/** Crash-safe filesystem lock shared by campaign persistence and run exclusion. */
|
|
3
4
|
interface AtomicFileLockOwner {
|
|
@@ -38,6 +39,18 @@ declare function probeAtomicFileLock(options: AtomicFileLockOptions): AtomicFile
|
|
|
38
39
|
*/
|
|
39
40
|
declare function tryAcquireAtomicFileLock(options: AtomicFileLockOptions): AtomicFileLockAcquisition;
|
|
40
41
|
//#endregion
|
|
42
|
+
//#region src/ledger-core/canonical.d.ts
|
|
43
|
+
type LedgerHash = `sha256:${string}`;
|
|
44
|
+
/** Shape of every ledger digest: `sha256:` followed by 64 lowercase hex chars. */
|
|
45
|
+
declare const LEDGER_HASH_PATTERN: RegExp;
|
|
46
|
+
/** A value has no faithful canonical-JSON form, so it cannot be stored or hashed. */
|
|
47
|
+
declare class LedgerCanonicalizationError extends ValidationError {}
|
|
48
|
+
/** Canonical JSON encoding (RFC 8785): object keys sorted by UTF-16 code unit,
|
|
49
|
+
* recursively. This is the byte form that is hashed and stored, so equal values
|
|
50
|
+
* always encode identically. */
|
|
51
|
+
declare function canonicalString(value: unknown): string;
|
|
52
|
+
declare function hashCanonical(value: unknown): LedgerHash;
|
|
53
|
+
//#endregion
|
|
41
54
|
//#region src/ledger-core/journal-file.d.ts
|
|
42
55
|
/** Filesystem durability and cross-process exclusion for append-only journal files. */
|
|
43
56
|
/** How a journal binding reports file-layer faults in its own error taxonomy. */
|
|
@@ -51,6 +64,10 @@ interface LedgerFileContext {
|
|
|
51
64
|
/** Append one already-serialized line; the write is fsynced (file and directory)
|
|
52
65
|
* before returning so an acknowledged append survives a crash. */
|
|
53
66
|
declare function appendLedgerLine(path: string, line: string, context: LedgerFileContext): void;
|
|
67
|
+
/** Replace a small sidecar file whole: write a temporary sibling, fsync it,
|
|
68
|
+
* then rename over the target. A reader therefore sees the previous contents
|
|
69
|
+
* or the new ones, never a partial file. */
|
|
70
|
+
declare function writeLedgerFileAtomically(path: string, contents: string, context: LedgerFileContext): void;
|
|
54
71
|
declare function withLedgerFileLock<T>(path: string, context: LedgerFileContext, run: () => T): T;
|
|
55
72
|
type FileLockResult<T> = {
|
|
56
73
|
acquired: true;
|
|
@@ -60,12 +77,26 @@ type FileLockResult<T> = {
|
|
|
60
77
|
};
|
|
61
78
|
declare function tryWithLedgerFileLock<T>(path: string, context: LedgerFileContext, run: () => T): FileLockResult<T>;
|
|
62
79
|
//#endregion
|
|
80
|
+
//#region src/ledger-core/trusted-head.d.ts
|
|
81
|
+
/** A `(sequence, entryHash)` pair a writer pinned outside the journal. */
|
|
82
|
+
interface LedgerTrustedHead {
|
|
83
|
+
sequence: number;
|
|
84
|
+
entryHash: LedgerHash;
|
|
85
|
+
}
|
|
86
|
+
/** Minimum entry shape the anchor check needs. */
|
|
87
|
+
interface LedgerAnchoredEntry {
|
|
88
|
+
sequence: number;
|
|
89
|
+
entryHash: LedgerHash;
|
|
90
|
+
}
|
|
91
|
+
/** Sibling pin file for a journal — deliberately NOT the journal, so rewriting
|
|
92
|
+
* the log is not enough to rewrite the trust recorded about it. */
|
|
93
|
+
declare function trustedHeadPathFor(journalPath: string): string;
|
|
94
|
+
/** The entry at exactly `head.sequence` must still carry `head.entryHash`.
|
|
95
|
+
* Entries must already have passed chain verification, which is what makes
|
|
96
|
+
* index and sequence interchangeable here. */
|
|
97
|
+
declare function verifyEntriesAgainstTrustedHead(entries: readonly LedgerAnchoredEntry[], head: LedgerTrustedHead, context: LedgerFileContext, subject: string): void;
|
|
98
|
+
//#endregion
|
|
63
99
|
//#region src/ledger-core/journal.d.ts
|
|
64
|
-
type LedgerHash = `sha256:${string}`;
|
|
65
|
-
/** Canonical JSON encoding: object keys sorted recursively. This is the byte
|
|
66
|
-
* form that is hashed and stored, so identical values always encode identically. */
|
|
67
|
-
declare function canonicalString(value: unknown): string;
|
|
68
|
-
declare function hashCanonical(value: unknown): LedgerHash;
|
|
69
100
|
/** Minimum shape of a journal event: the idempotency key. */
|
|
70
101
|
interface LedgerEventBase {
|
|
71
102
|
eventId: string;
|
|
@@ -113,19 +144,46 @@ interface LedgerAppendResult<Entry, Projection> {
|
|
|
113
144
|
appended: boolean;
|
|
114
145
|
projection: Projection;
|
|
115
146
|
}
|
|
147
|
+
interface LedgerAppendOptions {
|
|
148
|
+
/** Record the appended entry as this journal's trusted head, so a later read
|
|
149
|
+
* can prove nothing was deleted from the end. Ignored on the idempotent
|
|
150
|
+
* path: acknowledging an event that was already durable writes nothing, and
|
|
151
|
+
* moving the pin there would jump trust forward past entries this caller
|
|
152
|
+
* never saw. */
|
|
153
|
+
pinHead?: boolean;
|
|
154
|
+
}
|
|
155
|
+
interface FileLedgerJournalOptions {
|
|
156
|
+
/** Refuse to read a non-empty journal that has no trusted head.
|
|
157
|
+
*
|
|
158
|
+
* Off by default because journals written before pinning have no pin and
|
|
159
|
+
* must keep opening. Turn it on for a journal this process pins: without it,
|
|
160
|
+
* deleting the sibling pin file silently downgrades the journal back to a
|
|
161
|
+
* chain that cannot detect deletion. */
|
|
162
|
+
requireTrustedHead?: boolean;
|
|
163
|
+
}
|
|
116
164
|
/** Durable filesystem journal. Construction performs no I/O; `append` and
|
|
117
165
|
* `replay` validate the complete existing file under the locks. */
|
|
118
166
|
declare class FileLedgerJournal<Header extends object, Event extends LedgerEventBase, Projection> {
|
|
119
167
|
readonly path: string;
|
|
168
|
+
/** Sibling file holding this journal's trusted head. */
|
|
169
|
+
readonly trustedHeadPath: string;
|
|
120
170
|
private readonly codec;
|
|
121
171
|
private readonly mutex;
|
|
122
|
-
|
|
172
|
+
private readonly requireTrustedHead;
|
|
173
|
+
constructor(path: string, codec: LedgerJournalCodec<Header, Event, Projection>, options?: FileLedgerJournalOptions);
|
|
123
174
|
replay(): Promise<LedgerReplayResult<LedgerEntryOf<Header, Event>, Projection>>;
|
|
124
|
-
append(event: Event): Promise<LedgerAppendResult<LedgerEntryOf<Header, Event>, Projection>>;
|
|
175
|
+
append(event: Event, options?: LedgerAppendOptions): Promise<LedgerAppendResult<LedgerEntryOf<Header, Event>, Projection>>;
|
|
176
|
+
/** The pinned head, or null when this journal has never been pinned. */
|
|
177
|
+
trustedHead(): Promise<LedgerTrustedHead | null>;
|
|
178
|
+
/** Pin the current verified head. The chain and any existing pin are checked
|
|
179
|
+
* first, so the pin only ever moves forward along a journal that still
|
|
180
|
+
* carries the history it already recorded. */
|
|
181
|
+
pinTrustedHead(): Promise<LedgerTrustedHead>;
|
|
125
182
|
private replayLocked;
|
|
183
|
+
private verifyTrustedHead;
|
|
126
184
|
private readEntries;
|
|
127
185
|
private project;
|
|
128
186
|
}
|
|
129
187
|
//#endregion
|
|
130
|
-
export {
|
|
131
|
-
//# sourceMappingURL=index-
|
|
188
|
+
export { AtomicFileLockOptions as A, LedgerCanonicalizationError as C, AtomicFileLock as D, hashCanonical as E, AtomicFileLockUnavailable as M, probeAtomicFileLock as N, AtomicFileLockAcquisition as O, tryAcquireAtomicFileLock as P, LEDGER_HASH_PATTERN as S, canonicalString as T, LedgerFileContext as _, LedgerChainFields as a, withLedgerFileLock as b, LedgerJournalCodec as c, LedgerReplayResult as d, LedgerAnchoredEntry as f, FileLockResult as g, verifyEntriesAgainstTrustedHead as h, LedgerAppendResult as i, AtomicFileLockOwner as j, AtomicFileLockError as k, LedgerLineContext as l, trustedHeadPathFor as m, FileLedgerJournalOptions as n, LedgerEntryOf as o, LedgerTrustedHead as p, LedgerAppendOptions as r, LedgerEventBase as s, FileLedgerJournal as t, LedgerProjector as u, appendLedgerLine as v, LedgerHash as w, writeLedgerFileAtomically as x, tryWithLedgerFileLock as y };
|
|
189
|
+
//# sourceMappingURL=index-nhIYz9hn.d.ts.map
|
|
@@ -0,0 +1 @@
|
|
|
1
|
+
{"version":3,"file":"index-nhIYz9hn.d.ts","names":[],"sources":["../src/ledger-core/atomic-file-lock.ts","../src/ledger-core/canonical.ts","../src/ledger-core/journal-file.ts","../src/ledger-core/trusted-head.ts","../src/ledger-core/journal.ts"],"mappings":";;;UAiBiB;WACN;WACA;WACA;;UAGM;WACN,OAAO;EAChB;;KAGU;WACG;WAA0B;WAAyB,QAAQ;;WAC3D;WAA0B;;KAE7B;WACG;WAAyB,MAAM;IAC1C;UAEa;WACN;WACA;;cAGE,4BAA4B;WACrB;;;iBASJ,oBACd,SAAS,wBACR;;;;;;;iBAea,yBACd,SAAS,wBACR;;;KCjDS;;cAGC,qBAAmB;;cAGnB,oCAAoC;;;;iBAKjC,gBAAgB;iBAQhB,cAAc,iBAAiB;;;;;UCzB9B;;EAEf;EACA,eAAe,iBAAiB;IAAY;MAAoB;;;;iBAKlD,iBAAiB,cAAc,cAAc,SAAS;;;;iBAetD,0BACd,cACA,kBACA,SAAS;iBAoBK,mBAAmB,GAAG,cAAc,SAAS,mBAAmB,WAAW,IAAI;KAQnF,eAAe;EAAO;EAAgB,OAAO;;EAAQ;;iBAEjD,sBAAsB,GACpC,cACA,SAAS,mBACT,WAAW,IACV,eAAe;;;;UC7BD;EACf;EACA,WAAW;;;UAII;EACf;EACA,WAAW;;;;iBAKG,mBAAmB;;;;iBA4DnB,gCACd,kBAAkB,uBAClB,MAAM,mBACN,SAAS,mBACT;;;;UCtFe;EACf;;;;;UAMe,kBAAkB,cAAc;EAC/C;EACA,cAAc;EACd,OAAO;EACP,WAAW;;KAGD,cAAc,uBAAuB,cAAc,mBAAmB,SAChF,kBAAkB;UAEH;EACf;EACA;;;;;UAMe,gBAAgB,OAAO;EACtC,MAAM,OAAO,OAAO;EACpB,OAAO,SAAS,UAAU;;UAGX,mBACf,uBACA,cAAc,iBACd,oBACQ;;EAER,QAAQ;EACR,cAAc,kBAAkB;;;;EAIhC,WAAW,cAAc,SAAS,oBAAoB,cAAc,QAAQ;;EAE5E,iBAAiB,OAAO,cAAc,QAAQ,QAAQ;EACtD,mBAAmB,gBAAgB,cAAc,QAAQ,QAAQ;;UAGlD,mBAAmB,OAAO;EACzC,SAAS;EACT,YAAY;;UAGG,mBAAmB,OAAO;EACzC,OAAO;;EAEP;EACA,YAAY;;UAGG;;;;;;EAMf;;UAGe;;;;;;;EAOf;;;;cAiBW,kBAAkB,uBAAuB,cAAc,iBAAiB;WAC1E;;WAEA;mBACQ;mBACA;mBACA;EAEjB,YACE,cACA,OAAO,mBAAmB,QAAQ,OAAO,aACzC,UAAS;EASL,UAAU,QAAQ,mBAAmB,cAAc,QAAQ,QAAQ;EAMnE,OACJ,OAAO,OACP,UAAS,sBACR,QAAQ,mBAAmB,cAAc,QAAQ,QAAQ;;EA2CtD,eAAe,QAAQ;;;;EAWvB,kBAAkB,QAAQ;UAqBxB;UAUA;UAkBA;UAgDA"}
|
package/dist/index.d.ts
CHANGED
|
@@ -19,26 +19,26 @@ import { A as ChatClient, B as SandboxSdkTransportOpts, C as ScenarioFile, D as
|
|
|
19
19
|
import { _ as ViewTraceOversized, a as QueryTracesPage, c as SpanMatchRecord, d as TraceAnalystFilters, f as TraceAnalystSpan, g as ViewSpansResult, h as TraceAnalystTraceSummary, i as ErrorCluster, l as TRACE_ANALYST_TRUNCATION_MARKER_PREFIX, m as TraceAnalystSpanStatus, n as DEFAULT_TRACE_ANALYST_BUDGETS, o as SearchSpanResult, p as TraceAnalystSpanKind, r as DatasetOverview, s as SearchTraceResult, t as TraceAnalysisStore, u as TraceAnalystByteBudgets, v as ViewTraceResult } from "./store-CxJry_cs.js";
|
|
20
20
|
import { A as AnalystRunResult, C as AnalystContext, D as AnalystRequirements, E as AnalystInputKind, F as computeFindingId, I as makeFinding, M as AnalystSeverity, N as AnalystUsageReceipt, O as AnalystRunEvent, P as EvidenceRef, S as Analyst, T as AnalystFinding, a as AnalystRegistryOptions, c as CreateTraceAnalystKindOpts, d as createTraceAnalystKind, f as renderPriorFindings, g as RawAnalystEvidence, i as AnalystRegistry, j as AnalystRunSummary, k as AnalystRunInputs, l as TraceAnalystGolden, n as buildDefaultAnalystRegistry, o as BudgetPolicy, p as renderUpstreamFindings, r as AnalystHooks, s as RegistryRunOpts, t as DefaultAnalystRegistryOptions, u as TraceAnalystKindSpec, v as RawAnalystFinding, w as AnalystCost } from "./default-registry-Cl3pHo4n.js";
|
|
21
21
|
import { R as Scenario$1, S as JudgeConfig$1, w as JudgeScore$1 } from "./types-BokuXvOG.js";
|
|
22
|
-
import { B as BenchmarkSource, F as BenchmarkDatasetItem, H as deterministicSplit, I as BenchmarkEvaluation, L as BenchmarkFamily, N as BENCHMARK_SPLIT_SEED, P as BenchmarkAdapter, R as BenchmarkResponder, V as BenchmarkTaskKind, t as index_d_exports, z as BenchmarkScenario } from "./index-
|
|
23
|
-
import { $ as Objective, At as CanarySeverity, Cn as ReferenceEquivalenceJudgeResult, Ct as scoreRedTeamOutput, Dn as LlmJudgeDimension, Dt as CanaryKind, En as runReferenceEquivalenceJudge, Et as CanaryEvaluation, On as LlmJudgeOptions, Ot as CanaryOptions, Q as Direction, Sn as ReferenceEquivalenceJudgeOptions, St as redTeamReport, Tn as createReferenceEquivalenceJudge, Tt as CanaryAlert, _t as RedTeamCategory, at as scalarScore, bn as REFERENCE_EQUIVALENCE_JUDGE_VERSION, bt as RedTeamReport, et as ParetoResult, gt as RedTeamCase, ht as DEFAULT_RED_TEAM_CORPUS, it as paretoFrontierWithCrowding, jt as runCanaries, kn as llmJudge, kt as CanaryReport, nt as dominates, rt as paretoFrontier, tt as crowdingDistance, vt as RedTeamFinding, wn as ReferenceEquivalenceScenario, wt as toolNamesForRun, xn as ReferenceEquivalenceJudgeInput, xt as redTeamDataset, yn as REFERENCE_EQUIVALENCE_INPUT_LIMITS, yt as RedTeamPayload } from "./skillopt-optimization-method-
|
|
22
|
+
import { B as BenchmarkSource, F as BenchmarkDatasetItem, H as deterministicSplit, I as BenchmarkEvaluation, L as BenchmarkFamily, N as BENCHMARK_SPLIT_SEED, P as BenchmarkAdapter, R as BenchmarkResponder, V as BenchmarkTaskKind, t as index_d_exports, z as BenchmarkScenario } from "./index-BREtv3ZZ.js";
|
|
23
|
+
import { $ as Objective, At as CanarySeverity, Cn as ReferenceEquivalenceJudgeResult, Ct as scoreRedTeamOutput, Dn as LlmJudgeDimension, Dt as CanaryKind, En as runReferenceEquivalenceJudge, Et as CanaryEvaluation, On as LlmJudgeOptions, Ot as CanaryOptions, Q as Direction, Sn as ReferenceEquivalenceJudgeOptions, St as redTeamReport, Tn as createReferenceEquivalenceJudge, Tt as CanaryAlert, _t as RedTeamCategory, at as scalarScore, bn as REFERENCE_EQUIVALENCE_JUDGE_VERSION, bt as RedTeamReport, et as ParetoResult, gt as RedTeamCase, ht as DEFAULT_RED_TEAM_CORPUS, it as paretoFrontierWithCrowding, jt as runCanaries, kn as llmJudge, kt as CanaryReport, nt as dominates, rt as paretoFrontier, tt as crowdingDistance, vt as RedTeamFinding, wn as ReferenceEquivalenceScenario, wt as toolNamesForRun, xn as ReferenceEquivalenceJudgeInput, xt as redTeamDataset, yn as REFERENCE_EQUIVALENCE_INPUT_LIMITS, yt as RedTeamPayload } from "./skillopt-optimization-method-wHF5xsUv.js";
|
|
24
24
|
import { a as analyzeTraces, i as AnalyzeTracesTurnSnapshot, n as AnalyzeTracesOptions, r as AnalyzeTracesResult, t as AnalyzeTracesInput } from "./analyst-BkTS3C58.js";
|
|
25
|
-
import { $t as
|
|
25
|
+
import { $t as harnessAxisOf, Bt as assertRealAgentReceipts, Cn as ValidationResult, Dn as jsonHasKeys, En as containsAll, Gt as CODING_HARNESSES, Ht as summarizeAgentReceiptIntegrity, Jt as ProfileAxisSpec, Kt as HARNESS_NATIVE_MODEL, On as regexMatch, Qt as expandProfileAxes, Rt as BackendIntegrityError, Sn as ValidationIssue, Tn as composeValidators, Ut as summarizeBackendIntegrity, Vt as assertRealBackend, Wt as AgentProfile, Xt as agentProfileId, Yt as agentProfileHash, Zt as agentProfileModelId, _i as pairRunRecords, _n as parseCorrectnessResponse, ai as ComparePairedArmsOptions, an as CompletionRequirement, ar as SignedManifestAlgo, bn as ArtifactValidator, ci as PairArmsOptions, cn as LlmCorrectnessCheckerOpts, cr as hashJson, di as PairedArmRow, dn as RequirementCheck, en as ArtifactEventLike, fi as PairedArmsComparison, fn as SatisfiedBy, gi as pairArms, gn as createTokenRecallChecker, hi as comparePairedArms, hn as createLlmCorrectnessChecker, in as extractProducedState, ir as SignedManifest, li as PairArmsResult, ln as ProducedProposal, lr as signManifest, mi as PairedMetricDelta, mn as completionVerdict, nn as RuntimeEventLike, nr as HypothesisManifest, oi as MatchedPair, on as CompletionVerdict, or as canonicalize, pi as PairedCorrectness, pn as TaskGold, qt as HarnessType, rn as ToolCallEventLike, rr as HypothesisResult, si as MatchedRunRecordPair, sn as CorrectnessChecker, sr as evaluateHypothesis, tn as ProposalEventLike, ui as PairRunRecordsResult, un as ProducedState, ur as verifyManifest, vn as verifyCompletion, wn as byteLengthRange, xn as ValidationContext, yn as Artifact$1, zt as BackendIntegrityReport } from "./index-C7Wue8R6.js";
|
|
26
26
|
import { a as ContinuousCalibrationResult, c as SelfPreferenceResult, d as calibrateJudgeContinuous, f as continuousAgreement, h as verbosityBias, i as ContinuousAgreementOptions, l as VerbosityBiasResult, m as selfPreference, n as CandidateScore, o as GoldenItem, p as positionalBias, r as ContinuousAgreement, s as PositionalBiasResult, t as CalibrationResult, u as calibrateJudge } from "./judge-calibration-DFtEMlde.js";
|
|
27
27
|
import { A as mannWhitneyU, B as pairedSignTest, C as confidenceInterval, D as holm, E as eProcess, F as normalizeScores, G as ranks, H as partialCredit, I as pairedBootstrap, J as spearmanR, K as requiredPairedSampleSize, L as pairedCohensDz, M as mcnemarPower, N as mcnemarRequiredN, O as interRaterReliability, P as mulberry32, Q as wilson, R as pairedMde, S as cohensD, T as corpusInterRaterAgreementFromJudgeScores, U as passAtK, V as pairedTTest, W as pearsonR, X as weightedMean, Y as weightedComposite, Z as wilcoxonSignedRank, _ as WeightedCompositeInput, a as CorpusScoreRecord, b as bonferroni, c as EProcessState, d as PairedBootstrapOptions, f as PairedBootstrapResult, g as SignTestAlternative, h as RiskDifferenceResult, i as CorpusAgreementReport, j as mcnemar, k as interpretCliffs, l as EProcessStep, m as ProportionInterval, n as CorpusAgreementOptions, o as EProcess, p as PairedSignTestResult, q as requiredSampleSize, r as CorpusAgreementPerDimension, s as EProcessOptions, t as CliffsMagnitude, u as McNemarResult, v as WeightedCompositeResult, w as corpusInterRaterAgreement, x as cliffsDelta, y as benjaminiHochberg, z as pairedRiskDifference } from "./statistics-DbvkkDPa.js";
|
|
28
28
|
import { a as DatasetScenario, c as SliceOptions, i as DatasetProvenance, l as hashScenarios, n as DatasetDifficulty, o as DatasetSplit, r as DatasetManifest, s as HoldoutLockedError, t as Dataset } from "./dataset-BvtnC8Dc.js";
|
|
29
|
-
import { C as HeldOutGateConfig, S as HeldOutGate, _ as paretoChart, a as ParetoPoint, b as GateDecision, c as ResearchReportCandidate, d as ResearchReportOptions, f as ResearchReportRecommendation, g as gainHistogram, h as SummaryTableRow, i as ParetoFigureSpec, l as ResearchReportDecision, m as SummaryTableOptions, n as GainDistributionFigureSpec, o as RESEARCH_REPORT_HARD_PAIR_FLOOR, p as SummaryTable, r as GainDistributionOptions, s as ResearchReport, t as GainDistributionBin, u as ResearchReportMethodology, v as researchReport, w as HeldOutGateRejectionCode, x as GateEvidence, y as summaryTable } from "./summary-report-
|
|
29
|
+
import { C as HeldOutGateConfig, S as HeldOutGate, _ as paretoChart, a as ParetoPoint, b as GateDecision, c as ResearchReportCandidate, d as ResearchReportOptions, f as ResearchReportRecommendation, g as gainHistogram, h as SummaryTableRow, i as ParetoFigureSpec, l as ResearchReportDecision, m as SummaryTableOptions, n as GainDistributionFigureSpec, o as RESEARCH_REPORT_HARD_PAIR_FLOOR, p as SummaryTable, r as GainDistributionOptions, s as ResearchReport, t as GainDistributionBin, u as ResearchReportMethodology, v as researchReport, w as HeldOutGateRejectionCode, x as GateEvidence, y as summaryTable } from "./summary-report-CFnQgNfg.js";
|
|
30
30
|
import { a as FailureClassification, c as classifyFailure, i as DEFAULT_RULES, o as FailureContext, s as FailureRule } from "./failure-cluster-CqcvCcdR.js";
|
|
31
31
|
import { _ as vitestTestParser, a as DockerSandboxDriver, c as SandboxHarness, d as SubprocessSandboxDriver, f as SubprocessSandboxDriverOptions, g as pytestTestParser, h as jestTestParser, i as runTestGradedScenario, l as SandboxHarnessResult, m as composeParsers, n as TestGradedRunResult, o as HarnessConfig, p as TestOutputParser, r as TestGradedScenario, s as SandboxDriver, t as TestGradedRunOptions, u as SandboxResult } from "./test-graded-scenario-D1TaI2va.js";
|
|
32
|
-
import { t as AnalyzeRunsOptions } from "./analyze-runs-
|
|
32
|
+
import { t as AnalyzeRunsOptions } from "./analyze-runs-BmX-h_yn.js";
|
|
33
33
|
import { A as replayFeedbackTrajectory, B as ControlRunResult, C as feedbackTrajectoriesToDatasetScenarios, D as parseFeedbackTrajectoriesJsonl, E as feedbackTrajectoryToOptimizerRow, F as ControlActionOutcome, G as ControlStopPolicies, H as ControlRuntimeError, I as ControlBudget, J as objectiveEval, K as StopDecision, L as ControlContext, M as summarizePreferenceMemory, N as withAssignedFeedbackSplit, O as renderPreferenceMemoryMarkdown, P as ControlActionFailureMode, Q as subjectiveEval, R as ControlDecision, S as createFeedbackTrajectory, T as feedbackTrajectoryToDatasetScenario, U as ControlSeverity, V as ControlRuntimeConfig, W as ControlStep, X as stopOnNoProgress, Y as runAgentControlLoop, Z as stopOnRepeatedAction, _ as InMemoryFeedbackTrajectoryStore, a as FeedbackLabelSource, b as assignFeedbackSplit, c as FeedbackReplayAdapter, d as FeedbackSplitPolicy, f as FeedbackTask, g as FileSystemFeedbackTrajectoryStore, h as FeedbackTrajectoryStore, i as FeedbackLabelKind, j as serializeFeedbackTrajectoriesJsonl, k as replayFeedbackTrajectories, l as FeedbackReplayResult, m as FeedbackTrajectoryFilter, n as FeedbackAttempt, o as FeedbackOptimizerRow, p as FeedbackTrajectory, q as allCriticalPassed, r as FeedbackLabel, s as FeedbackOutcome, t as FeedbackArtifactType, u as FeedbackSeverity, v as PreferenceMemoryEntry, w as feedbackTrajectoriesToOptimizerRows, x as controlRunToFeedbackTrajectory, y as ProposedSideEffect, z as ControlEvalResult } from "./feedback-trajectory-CVaeREXV.js";
|
|
34
34
|
import { A as ActionExecutionPolicy, C as ReviewMemoryStore, D as inMemoryReviewStore, E as createLlmReviewer, M as evaluateActionPolicy, O as jsonlReviewStore, S as ReviewMemoryEntry, T as VerifyFn, _ as ProposeReviewReport, a as ProposeReviewControlAction, b as ReviewFn, c as ProposeReviewControlState, d as LlmJsonCall, f as LlmReviewerConfig, g as ProposeReviewConfig, h as ProposeOutput, i as scoreFromEvals, j as ActionPolicyDecision, k as runProposeReview, l as controlFailureClassFromVerification, m as ProposeInput, n as RunEvidenceMetadata, o as ProposeReviewControlConfig, p as ProposeFn, r as controlRunToRunRecord, s as ProposeReviewControlResult, t as ControlRunToRunRecordOptions, u as runProposeReviewAsControlLoop, v as ProposeReviewShot, w as Verification, x as ReviewInput, y as Review } from "./run-evidence-DokQtX0-.js";
|
|
35
|
-
import { _ as ReleaseConfidenceStatus, a as JudgeReplayGateArgs, b as assertReleaseConfidence, c as judgeReplayGate, d as ReleaseConfidenceAxis, f as ReleaseConfidenceAxisName, g as ReleaseConfidenceScorecard, h as ReleaseConfidenceMetrics, i as BootstrapResult, l as ActionableSideInfo, m as ReleaseConfidenceIssue, n as renderReleaseReport, o as Verdict, p as ReleaseConfidenceInput, r as BootstrapOptions, s as bootstrapCi, t as RenderReleaseReportOptions, u as AsiSeverity, v as ReleaseConfidenceThresholds, x as evaluateReleaseConfidence, y as ReleaseTraceEvidence } from "./release-report-
|
|
35
|
+
import { _ as ReleaseConfidenceStatus, a as JudgeReplayGateArgs, b as assertReleaseConfidence, c as judgeReplayGate, d as ReleaseConfidenceAxis, f as ReleaseConfidenceAxisName, g as ReleaseConfidenceScorecard, h as ReleaseConfidenceMetrics, i as BootstrapResult, l as ActionableSideInfo, m as ReleaseConfidenceIssue, n as renderReleaseReport, o as Verdict, p as ReleaseConfidenceInput, r as BootstrapOptions, s as bootstrapCi, t as RenderReleaseReportOptions, u as AsiSeverity, v as ReleaseConfidenceThresholds, x as evaluateReleaseConfidence, y as ReleaseTraceEvidence } from "./release-report-CjHWa8Ia.js";
|
|
36
36
|
import { A as isTrainableSplit, D as assertRolloutLine, E as assertMintedLines, T as assertMinted, b as RolloutSplit, h as RolloutLine, i as ChatToolCall, j as validateRolloutLine, k as isRolloutLine, n as ChatMessage, o as MintedRolloutLine, p as RolloutCapture, s as MintedRolloutOutcome, u as ROLLOUT_SCHEMA, w as ToolDef, x as RolloutStep, y as RolloutRole } from "./schema-Cef2cFmb.js";
|
|
37
37
|
import { $ as ScorePreference, Ct as HarborToolCall, Dt as toHarborTrajectories, Et as relabelImportedSplit, J as MintRolloutOptions, Jt as toJsonl, Ot as toHarborTrajectory, Q as ScoreOrigin, Qt as toSftRows, St as HarborSubagentTrajectoryRef, Tt as fromHarborTrajectory, Ut as SftExportOptions, Vt as RewardRow, Wt as SftRow, X as RolloutScrubber, Y as MintRolloutResult, Yt as toRewardRows, Z as mintRolloutRows, _t as HarborMetrics, at as trainingScore, bt as HarborStep, dt as FromHarborOptions, et as isRealnessGated, ft as HARBOR_IMPORT_GAP, gt as HarborImageSource, ht as HarborFinalMetrics, it as trainingReward, mt as HarborContentPart, nt as observedSplitScore, pt as HarborAgent, rt as scoreOrigin, tt as observedScore, ut as ATIF_SCHEMA_VERSION, vt as HarborObservation, wt as HarborTrajectory, xt as HarborStepSource, yt as HarborObservationResult } from "./index-3cdlURSk.js";
|
|
38
38
|
import { $ as isUnavailable, A as rollupSupervisorRuns, D as analyzeSupervisorRunSources, G as SupervisorRunReader, H as SUPERVISOR_RUN_SCHEMA, J as SupervisorRunSources, K as SupervisorRunReport, N as Measured, S as readClaudeCodeSupervisorRun, U as SourceLimits, X as Unavailable, Y as SupervisorRunTree, a as renderSupervisorRunMarkdown, c as analyzeSupervisorRun, et as showMeasured, h as writeSupervisorRunReport, i as renderSupervisorRunHeadline, n as supervisorRunRolloutLines, q as SupervisorRunRollup, x as claudeCodeSupervisorRunReader } from "./index-C61Wi7yg.js";
|
|
39
39
|
import { a as compareToBaseline, c as Trajectory, d as ToolStats, f as ToolUseMetrics, i as MetricVerdict, l as TrajectoryStep, m as computeToolUseMetrics, n as BaselineReport, o as iqr, p as ToolUseOptions, r as MetricSamples, s as welchsTTest, t as BaselineOptions, u as buildTrajectory } from "./baseline-hG3K85h4.js";
|
|
40
40
|
import { n as SeriesConvergenceResult, r as analyzeSeries, t as SeriesConvergenceOptions } from "./series-convergence-ofsqPWhs.js";
|
|
41
|
-
import { _ as EvalCampaignResult, a as FailureMode, c as SteeringChange, d as CampaignRunContext, f as CampaignRunOutcome, g as EvalCampaignOptions, h as CampaignVariant, i as ExperimentResult, l as CampaignFactoryParams, m as CampaignScenario, n as CallbackResearcherOptions, o as NoopResearcher, p as CampaignRunner, r as ExperimentPlan, s as Researcher, t as CallbackResearcher, u as CampaignIntegrityPolicy, v as FailedRun, y as runEvalCampaign } from "./researcher-
|
|
41
|
+
import { _ as EvalCampaignResult, a as FailureMode, c as SteeringChange, d as CampaignRunContext, f as CampaignRunOutcome, g as EvalCampaignOptions, h as CampaignVariant, i as ExperimentResult, l as CampaignFactoryParams, m as CampaignScenario, n as CallbackResearcherOptions, o as NoopResearcher, p as CampaignRunner, r as ExperimentPlan, s as Researcher, t as CallbackResearcher, u as CampaignIntegrityPolicy, v as FailedRun, y as runEvalCampaign } from "./researcher-CbSKhK8z.js";
|
|
42
42
|
import { a as PairedEvalueStep, c as pairedEvalueSequence, i as PairedEvalueSequence, n as InterimReleaseConfidenceInput, o as SequentialDecision, r as PairedEvalueOptions, s as evaluateInterimReleaseConfidence, t as InterimReleaseConfidence } from "./sequential-CYwq6Ff_.js";
|
|
43
43
|
//#region src/auto-pr.d.ts
|
|
44
44
|
/**
|
package/dist/index.js
CHANGED
|
@@ -1,8 +1,7 @@
|
|
|
1
1
|
import { t as __exportAll } from "./rolldown-runtime-8H4AJuhK.js";
|
|
2
|
-
import { _ as observeAll, a as jsonlReviewStore, c as scoreFromEvals, d as runAgentControlLoop, f as stopOnNoProgress, g as noProgressDetector, h as errorStreakDetector, i as inMemoryReviewStore, l as allCriticalPassed, m as subjectiveEval, n as runProposeReviewAsControlLoop, o as runProposeReview, p as stopOnRepeatedAction, r as createLlmReviewer, s as controlRunToRunRecord, t as controlFailureClassFromVerification, u as objectiveEval, v as repeatedActionDetector, y as evaluateActionPolicy } from "./propose-review-control-
|
|
2
|
+
import { _ as observeAll, a as jsonlReviewStore, c as scoreFromEvals, d as runAgentControlLoop, f as stopOnNoProgress, g as noProgressDetector, h as errorStreakDetector, i as inMemoryReviewStore, l as allCriticalPassed, m as subjectiveEval, n as runProposeReviewAsControlLoop, o as runProposeReview, p as stopOnRepeatedAction, r as createLlmReviewer, s as controlRunToRunRecord, t as controlFailureClassFromVerification, u as objectiveEval, v as repeatedActionDetector, y as evaluateActionPolicy } from "./propose-review-control-SQ-n9-We.js";
|
|
3
3
|
import { a as NotFoundError, c as VerificationError, i as JudgeError, n as CaptureIntegrityError, o as ReplayError, r as ConfigError, s as ValidationError, t as AgentEvalError } from "./errors-8YnH8WlF.js";
|
|
4
|
-
import {
|
|
5
|
-
import { AGENT_PROFILE_KINDS, AgentProfileCellValidationError, agentProfileCellHashMaterial, agentProfileCellKey, assertRunAgentProfileCell, buildAgentInterfaceProfileCell, buildAgentProfileCell, groupRunsByAgentProfileCell, requireAgentProfileCell, toAgentProfileJson, validateAgentProfileCell, verifyAgentProfileCell } from "./profile-cell.js";
|
|
4
|
+
import { _ as verifyManifest, a as assertRunAgentProfileCell, c as groupRunsByAgentProfileCell, d as validateAgentProfileCell, f as verifyAgentProfileCell, g as signManifest, h as hashJson, i as agentProfileCellKey, l as requireAgentProfileCell, m as evaluateHypothesis, n as AgentProfileCellValidationError, o as buildAgentInterfaceProfileCell, p as canonicalize, r as agentProfileCellHashMaterial, s as buildAgentProfileCell, t as AGENT_PROFILE_KINDS, u as toAgentProfileJson } from "./agent-profile-cell-OhuTee9n.js";
|
|
6
5
|
import { F as makeFinding, I as computeTraceMetrics, L as createChatClient, P as computeFindingId, R as createAnalystAi, a as KNOWLEDGE_GAP_KIND_SPEC, d as renderUpstreamFindings, i as KNOWLEDGE_POISONING_KIND_SPEC, l as createTraceAnalystKind, n as AnalystRegistry, o as IMPROVEMENT_KIND_SPEC, r as DEFAULT_TRACE_ANALYST_KINDS, s as FAILURE_MODE_KIND_SPEC, t as buildDefaultAnalystRegistry, u as renderPriorFindings } from "./default-registry-D3T9XbuY.js";
|
|
7
6
|
import { _ as resolveModelPricing, a as CostLedgerPersistenceError, c as costForTokenPricing, d as MODEL_PRICING, f as MetricsCollector, g as isModelPriced, h as estimateTokens, i as CostLedger, l as costForUsage, m as estimateCost, n as CostCallConflictError, o as CostReceiptCaptureError, p as TokenCounter, r as CostCeilingReachedError, s as CostReservationExceededError, t as CostAccountingIncompleteError, u as modelPriceKey } from "./cost-ledger-BrJxbrMy.js";
|
|
8
7
|
import { a as providerFromBaseUrl, i as defaultProviderRedactor, n as InMemoryRawProviderSink, r as NoopRawProviderSink, t as FileSystemRawProviderSink } from "./raw-provider-sink-BQd7mzyT.js";
|
|
@@ -12,34 +11,34 @@ import { S as traceSpanKindToOpenInferenceKind, a as SpanNotFoundError, b as cla
|
|
|
12
11
|
import { n as aggregateRunScore, r as clamp01, t as DEFAULT_RUN_SCORE_WEIGHTS } from "./run-score-iEEAWiBY.js";
|
|
13
12
|
import { n as mapConcurrent, t as Mutex } from "./concurrency-MUjT7VjM.js";
|
|
14
13
|
import { a as RunCritic, d as defaultIsMaterial, f as diffFindings, i as runSemanticConceptJudge, n as SEMANTIC_CONCEPT_JUDGE_VERSION, o as SKILL_USAGE_ANALYST, p as LockedJsonlAppender, r as createSemanticConceptJudge, s as SkillUsageAnalyst, t as DEFAULT_COMPLEXITY_WEIGHTS, u as FindingsStore } from "./semantic-concept-judge-BypLt6Fw.js";
|
|
15
|
-
import { At as dominates, B as surfaceContentHash, Bt as JudgeParseError, Ct as llmJudge, D as runCanaries, Dt as fileVerdictCache, Et as contentHash, Ft as BackendIntegrityError, G as DEFAULT_MUTATION_PRIMITIVES, It as assertRealAgentReceipts, K as buildReflectionPrompt, Lt as assertRealBackend, Mt as paretoFrontierWithCrowding, Nt as scalarScore, Ot as inMemoryVerdictCache, Rt as summarizeAgentReceiptIntegrity, St as hashScenarios, Tt as canonicalJson, _t as redTeamReport, bt as Dataset, dt as REFERENCE_EQUIVALENCE_INPUT_LIMITS, ft as REFERENCE_EQUIVALENCE_JUDGE_VERSION, gt as redTeamDataset, ht as DEFAULT_RED_TEAM_CORPUS, jt as paretoFrontier, kt as crowdingDistance, mt as runReferenceEquivalenceJudge, pt as createReferenceEquivalenceJudge, q as parseReflectionResponse, vt as scoreRedTeamOutput, wt as cachedJudge, xt as HoldoutLockedError, yt as toolNamesForRun, zt as summarizeBackendIntegrity } from "./skillopt-optimization-method-
|
|
16
|
-
import { A as spearmanR, B as
|
|
17
|
-
import { n as pairArms, r as pairRunRecords, t as comparePairedArms } from "./paired-arms-
|
|
14
|
+
import { At as dominates, B as surfaceContentHash, Bt as JudgeParseError, Ct as llmJudge, D as runCanaries, Dt as fileVerdictCache, Et as contentHash, Ft as BackendIntegrityError, G as DEFAULT_MUTATION_PRIMITIVES, It as assertRealAgentReceipts, K as buildReflectionPrompt, Lt as assertRealBackend, Mt as paretoFrontierWithCrowding, Nt as scalarScore, Ot as inMemoryVerdictCache, Rt as summarizeAgentReceiptIntegrity, St as hashScenarios, Tt as canonicalJson, _t as redTeamReport, bt as Dataset, dt as REFERENCE_EQUIVALENCE_INPUT_LIMITS, ft as REFERENCE_EQUIVALENCE_JUDGE_VERSION, gt as redTeamDataset, ht as DEFAULT_RED_TEAM_CORPUS, jt as paretoFrontier, kt as crowdingDistance, mt as runReferenceEquivalenceJudge, pt as createReferenceEquivalenceJudge, q as parseReflectionResponse, vt as scoreRedTeamOutput, wt as cachedJudge, xt as HoldoutLockedError, yt as toolNamesForRun, zt as summarizeBackendIntegrity } from "./skillopt-optimization-method-CF6a327Q.js";
|
|
15
|
+
import { A as spearmanR, B as positionalBias, C as pairedTTest, D as ranks, E as pearsonR, H as verbosityBias, L as calibrateJudge, M as weightedMean, N as wilcoxonSignedRank, O as requiredPairedSampleSize, P as wilson, R as calibrateJudgeContinuous, S as pairedSignTest, T as passAtK, V as selfPreference, _ as normalizeScores, a as confidenceInterval, b as pairedMde, c as eProcess, d as interpretCliffs, f as mannWhitneyU, g as mulberry32, h as mcnemarRequiredN, i as cohensD, j as weightedComposite, k as requiredSampleSize, l as holm, m as mcnemarPower, n as bonferroni, o as corpusInterRaterAgreement, p as mcnemar, r as cliffsDelta, s as corpusInterRaterAgreementFromJudgeScores, t as benjaminiHochberg, u as interRaterReliability, v as pairedBootstrap, w as partialCredit, x as pairedRiskDifference, y as pairedCohensDz, z as continuousAgreement } from "./statistics-DWM_AyLe.js";
|
|
16
|
+
import { n as pairArms, r as pairRunRecords, t as comparePairedArms } from "./paired-arms-6XItKzd1.js";
|
|
18
17
|
import { n as llmSpanFromProvider, t as TraceEmitter } from "./emitter-CPBAhxum.js";
|
|
19
18
|
import { a as scoreOrigin, n as observedScore, o as trainingReward, r as observedSplitScore, s as trainingScore, t as isRealnessGated } from "./reward-nw2xZGZG.js";
|
|
20
19
|
import { a as isRetrievalSpan, i as isLlmSpan, n as TRACE_SCHEMA_VERSION, o as isSandboxSpan, r as isJudgeSpan, s as isToolSpan, t as FAILURE_CLASSES } from "./schema-CRhEY1SO.js";
|
|
21
|
-
import { a as roundTripRunRecord, i as parseRunRecordSafe, n as isRunRecord, o as runTaskScore, r as modelHasSnapshot, s as validateRunRecord, t as RunRecordValidationError } from "./run-record-
|
|
22
|
-
import { a as evaluateReleaseConfidence, i as assertReleaseConfidence, n as bootstrapCi, r as judgeReplayGate, t as renderReleaseReport } from "./release-report-
|
|
20
|
+
import { a as roundTripRunRecord, i as parseRunRecordSafe, n as isRunRecord, o as runTaskScore, r as modelHasSnapshot, s as validateRunRecord, t as RunRecordValidationError } from "./run-record-BIwU2wdV.js";
|
|
21
|
+
import { a as evaluateReleaseConfidence, i as assertReleaseConfidence, n as bootstrapCi, r as judgeReplayGate, t as renderReleaseReport } from "./release-report-wuilQkvK.js";
|
|
23
22
|
import { c as assertMintedLines, f as isRolloutLine, i as ROLLOUT_SCHEMA, m as validateRolloutLine, p as isTrainableSplit, s as assertMinted, u as assertRolloutLine } from "./schema-C6DW4ZHR.js";
|
|
24
23
|
import { i as toRewardRows, r as toJsonl, s as toSftRows } from "./exporters-q9iL-2Jf.js";
|
|
25
|
-
import { a as toHarborTrajectories, i as relabelImportedSplit, n as HARBOR_IMPORT_GAP, o as toHarborTrajectory, r as fromHarborTrajectory, t as ATIF_SCHEMA_VERSION } from "./rollout-
|
|
24
|
+
import { a as toHarborTrajectories, i as relabelImportedSplit, n as HARBOR_IMPORT_GAP, o as toHarborTrajectory, r as fromHarborTrajectory, t as ATIF_SCHEMA_VERSION } from "./rollout-CreDz__7.js";
|
|
26
25
|
import { t as buildTrajectory } from "./trajectory-D_7rLrvE.js";
|
|
27
|
-
import { t as mintRolloutRows } from "./mint-
|
|
28
|
-
import { D as showMeasured, E as isUnavailable, S as rollupSupervisorRuns, T as SUPERVISOR_RUN_SCHEMA, _ as claudeCodeSupervisorRunReader, f as renderSupervisorRunHeadline, l as writeSupervisorRunReport, n as analyzeSupervisorRun, p as renderSupervisorRunMarkdown, t as supervisorRunRolloutLines, v as readClaudeCodeSupervisorRun, y as analyzeSupervisorRunSources } from "./supervisor-run-
|
|
26
|
+
import { t as mintRolloutRows } from "./mint-BvkwcYZU.js";
|
|
27
|
+
import { D as showMeasured, E as isUnavailable, S as rollupSupervisorRuns, T as SUPERVISOR_RUN_SCHEMA, _ as claudeCodeSupervisorRunReader, f as renderSupervisorRunHeadline, l as writeSupervisorRunReport, n as analyzeSupervisorRun, p as renderSupervisorRunMarkdown, t as supervisorRunRolloutLines, v as readClaudeCodeSupervisorRun, y as analyzeSupervisorRunSources } from "./supervisor-run-B7lUGoyZ.js";
|
|
29
28
|
import { n as TRACE_ANALYST_ACTOR_DESCRIPTION, r as TRACE_ANALYST_ACTOR_DESCRIPTION_VERSION, t as analyzeTraces } from "./analyst-LsnNpSkm.js";
|
|
30
|
-
import { C as planTraceInsightQuestions, E as traceAnalystOnRunComplete, S as inferDomainKeywords, T as tokenizeDomainWords, _ as buildTraceInsightContext, a as convertTraceStoresToOtlp, b as describeTraceInsightScope, c as otelRunCompleteHook, d as captureFetchToRawSink, f as otlpRowsToRunRecords, g as flattenOtlpExportToNdjson, h as otlpToTraceRunRecords, i as iterateRawCalls, l as OTEL_AGENT_EVAL_SCOPE, m as otlpToRunRecords, n as ReplayCacheMissError, o as createOtelExporter, p as otlpRowsToTraceRunRecords, r as createReplayFetch, s as createOtelTracingStore, t as ReplayCache, u as exportRunAsOtlp, v as buildTraceInsightPrompt, w as scoreTraceInsightReadiness, x as domainEvidencePattern, y as defaultTraceInsightPanel } from "./replay-
|
|
29
|
+
import { C as planTraceInsightQuestions, E as traceAnalystOnRunComplete, S as inferDomainKeywords, T as tokenizeDomainWords, _ as buildTraceInsightContext, a as convertTraceStoresToOtlp, b as describeTraceInsightScope, c as otelRunCompleteHook, d as captureFetchToRawSink, f as otlpRowsToRunRecords, g as flattenOtlpExportToNdjson, h as otlpToTraceRunRecords, i as iterateRawCalls, l as OTEL_AGENT_EVAL_SCOPE, m as otlpToRunRecords, n as ReplayCacheMissError, o as createOtelExporter, p as otlpRowsToTraceRunRecords, r as createReplayFetch, s as createOtelTracingStore, t as ReplayCache, u as exportRunAsOtlp, v as buildTraceInsightPrompt, w as scoreTraceInsightReadiness, x as domainEvidencePattern, y as defaultTraceInsightPanel } from "./replay-CJfGLdx4.js";
|
|
31
30
|
import { n as extractUsageFromResponse, r as extractUsageFromSse, t as extractUsage } from "./extract-usage-2j25whHw.js";
|
|
32
|
-
import { B as harnessAxisOf, F as HARNESS_NATIVE_MODEL, G as parseCorrectnessResponse, H as completionVerdict, I as agentProfileHash, K as verifyCompletion, L as agentProfileId, P as CODING_HARNESSES, R as agentProfileModelId, U as createLlmCorrectnessChecker, V as extractProducedState, W as createTokenRecallChecker, z as expandProfileAxes } from "./campaign-
|
|
31
|
+
import { B as harnessAxisOf, F as HARNESS_NATIVE_MODEL, G as parseCorrectnessResponse, H as completionVerdict, I as agentProfileHash, K as verifyCompletion, L as agentProfileId, P as CODING_HARNESSES, R as agentProfileModelId, U as createLlmCorrectnessChecker, V as extractProducedState, W as createTokenRecallChecker, z as expandProfileAxes } from "./campaign-BJjn1rhw.js";
|
|
33
32
|
import { a as judgeSpans, c as runsForScenario, i as hasCapturedToolArgs, l as toolSpans, n as argHash, o as llmSpans, r as groupBy, s as runFailureClass, t as aggregateLlm } from "./query-Di7eEQ79.js";
|
|
34
|
-
import { a as checkBehavioralCanary, i as canaryLeakView, o as checkCanaries, r as HoldoutAuditor, s as runBehavioralCanaries, t as analyzeRuns } from "./analyze-runs-
|
|
35
|
-
import { a as summaryTable, i as researchReport, n as gainHistogram, r as paretoChart, t as RESEARCH_REPORT_HARD_PAIR_FLOOR } from "./summary-report-
|
|
33
|
+
import { a as checkBehavioralCanary, i as canaryLeakView, o as checkCanaries, r as HoldoutAuditor, s as runBehavioralCanaries, t as analyzeRuns } from "./analyze-runs-B-afTpCv.js";
|
|
34
|
+
import { a as summaryTable, i as researchReport, n as gainHistogram, r as paretoChart, t as RESEARCH_REPORT_HARD_PAIR_FLOOR } from "./summary-report-Ci17nIdU.js";
|
|
36
35
|
import { a as composeParsers, c as vitestTestParser, i as SubprocessSandboxDriver, n as DockerSandboxDriver, o as jestTestParser, r as SandboxHarness, s as pytestTestParser, t as runTestGradedScenario } from "./test-graded-scenario-BsqWLmPt.js";
|
|
37
36
|
import { a as InMemoryTraceStore, i as FileSystemTraceStore, n as assertRunCaptured, r as throwIfRunIncomplete, t as RunIntegrityError } from "./integrity-BzRbCHzi.js";
|
|
38
37
|
import { i as redactValue, n as REDACTION_VERSION, r as redactString, t as DEFAULT_REDACTION_RULES } from "./redact-7Aq1ukl-.js";
|
|
39
|
-
import { a as DEFAULT_RULES, i as computeToolUseMetrics, n as iqr, o as classifyFailure, r as welchsTTest, t as compareToBaseline } from "./baseline-
|
|
38
|
+
import { a as DEFAULT_RULES, i as computeToolUseMetrics, n as iqr, o as classifyFailure, r as welchsTTest, t as compareToBaseline } from "./baseline-DcX5hQDv.js";
|
|
40
39
|
import { t as analyzeSeries } from "./series-convergence-CjO2QdRW.js";
|
|
41
|
-
import { _ as deterministicSplit, g as BENCHMARK_SPLIT_SEED, t as benchmarks_exports } from "./benchmarks-
|
|
42
|
-
import { t as runEvalCampaign } from "./eval-campaign-
|
|
40
|
+
import { _ as deterministicSplit, g as BENCHMARK_SPLIT_SEED, t as benchmarks_exports } from "./benchmarks-CJr1H1_a.js";
|
|
41
|
+
import { t as runEvalCampaign } from "./eval-campaign-DXhpZghy.js";
|
|
43
42
|
import { n as pairedEvalueSequence, t as evaluateInterimReleaseConfidence } from "./sequential-Br0mAPHA.js";
|
|
44
43
|
import { AxGEPA, AxSignature, ax } from "@ax-llm/ax";
|
|
45
44
|
import { accessSync, appendFileSync, constants, cpSync, existsSync, mkdirSync, promises, readFileSync, readdirSync, statSync, writeFileSync } from "node:fs";
|
|
@@ -10226,6 +10225,14 @@ var HeldOutGate = class {
|
|
|
10226
10225
|
},
|
|
10227
10226
|
pairedPValue: wilcoxon.p
|
|
10228
10227
|
};
|
|
10228
|
+
if (!Number.isFinite(ci.low) || !Number.isFinite(ci.high) || ci.low === 0 && ci.high === 0) return {
|
|
10229
|
+
promote: false,
|
|
10230
|
+
candidateId,
|
|
10231
|
+
baselineId,
|
|
10232
|
+
evidence,
|
|
10233
|
+
reason: `indeterminate_delta: paired holdout median CI=[${fmt(ci.low)}, ${fmt(ci.high)}] carries no direction`,
|
|
10234
|
+
rejectionCode: "indeterminate_delta"
|
|
10235
|
+
};
|
|
10229
10236
|
if (!(ci.low > this.pairedDeltaThreshold)) return {
|
|
10230
10237
|
promote: false,
|
|
10231
10238
|
candidateId,
|