@tangle-network/agent-eval 0.99.0 → 0.100.1
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/dist/adapters/http.d.ts +2 -2
- package/dist/adapters/langchain.d.ts +2 -2
- package/dist/adapters/otel.d.ts +4 -4
- package/dist/analyst/index.d.ts +8 -7
- package/dist/analyst/index.js +36 -28
- package/dist/analyst/index.js.map +1 -1
- package/dist/{analyze-runs-DtT6F_6T.d.ts → analyze-runs-BlJRBniC.d.ts} +3 -3
- package/dist/belief-state/index.d.ts +3 -3
- package/dist/benchmarks/index.d.ts +2 -2
- package/dist/campaign/index.d.ts +37 -13
- package/dist/campaign/index.js +76 -7
- package/dist/campaign/index.js.map +1 -1
- package/dist/{chunk-WMBLMTUE.js → chunk-2KTBHICD.js} +139 -16
- package/dist/chunk-2KTBHICD.js.map +1 -0
- package/dist/{chunk-IZCEK2HR.js → chunk-2MLIEQSN.js} +3 -2
- package/dist/{chunk-IZCEK2HR.js.map → chunk-2MLIEQSN.js.map} +1 -1
- package/dist/{chunk-OKQ2LAT7.js → chunk-4LWD6GC7.js} +7 -5
- package/dist/{chunk-OKQ2LAT7.js.map → chunk-4LWD6GC7.js.map} +1 -1
- package/dist/{chunk-LO6IOIJ2.js → chunk-ABOIVNXL.js} +2 -240
- package/dist/chunk-ABOIVNXL.js.map +1 -0
- package/dist/{chunk-NZEQVRH5.js → chunk-BOETF6BU.js} +2 -2
- package/dist/{chunk-S4SYLDFX.js → chunk-FRI6RG3P.js} +3 -2
- package/dist/chunk-FRI6RG3P.js.map +1 -0
- package/dist/chunk-G6S73VA7.js +248 -0
- package/dist/chunk-G6S73VA7.js.map +1 -0
- package/dist/{chunk-GMGRBNVT.js → chunk-G7IB3GJ5.js} +2 -2
- package/dist/chunk-IN3SHQML.js +664 -0
- package/dist/chunk-IN3SHQML.js.map +1 -0
- package/dist/{chunk-SJISCGWD.js → chunk-JU6ZX3CX.js} +2 -2
- package/dist/{chunk-3NHEO6ZC.js → chunk-L5TVEZFT.js} +2 -2
- package/dist/{chunk-77T4STFI.js → chunk-PMF5WIBX.js} +3 -3
- package/dist/{chunk-OYU4D7FY.js → chunk-VWQ6PO5O.js} +2 -2
- package/dist/{code-agent-session-CPHRCb4-.d.ts → code-agent-session-B6ZcDwyA.d.ts} +1 -1
- package/dist/contract/index.d.ts +16 -16
- package/dist/contract/index.js +6 -5
- package/dist/contract/index.js.map +1 -1
- package/dist/{control-Doncu-B_.d.ts → control-DC8TELh0.d.ts} +1 -1
- package/dist/control.d.ts +2 -2
- package/dist/control.js +3 -2
- package/dist/{corpus-D4YW9UoJ.d.ts → corpus-ONOzGFmG.d.ts} +1 -1
- package/dist/{default-registry-GyE8X5SP.d.ts → default-registry-Dhrc__SE.d.ts} +2 -2
- package/dist/diagnose.d.ts +3 -3
- package/dist/diagnose.js +2 -1
- package/dist/diagnose.js.map +1 -1
- package/dist/{gepa-H6mlM0KN.d.ts → gepa-BRgNnmGZ.d.ts} +1 -1
- package/dist/groundedness/index.d.ts +112 -0
- package/dist/groundedness/index.js +77 -0
- package/dist/groundedness/index.js.map +1 -0
- package/dist/hosted/index.d.ts +4 -4
- package/dist/{index-_Y4oNOOb.d.ts → index-W96macmS.d.ts} +1 -1
- package/dist/index.d.ts +338 -24
- package/dist/index.js +208 -24
- package/dist/index.js.map +1 -1
- package/dist/{insight-report-BnRjTibG.d.ts → insight-report-C02J3q4T.d.ts} +1 -1
- package/dist/{kind-factory-X3eDYbKn.d.ts → kind-factory-OgqQSvLi.d.ts} +1 -1
- package/dist/meta-eval/index.d.ts +2 -2
- package/dist/multishot/index.d.ts +2 -2
- package/dist/openapi.json +1 -1
- package/dist/policy-edit-Dccm9tyA.d.ts +103 -0
- package/dist/{pre-registration-CMm8cvrh.d.ts → pre-registration-DB8oDqZJ.d.ts} +3 -3
- package/dist/{provenance-Bg_RttR8.d.ts → provenance-B0SZw1z2.d.ts} +3 -3
- package/dist/{release-report-pidWUMZ2.d.ts → release-report-B1tA6pKu.d.ts} +2 -2
- package/dist/reporting.d.ts +4 -4
- package/dist/{researcher-Jr8ME1dZ.d.ts → researcher-Ba2y1Foi.d.ts} +2 -2
- package/dist/rl.d.ts +8 -8
- package/dist/rl.js +3 -2
- package/dist/rl.js.map +1 -1
- package/dist/{rubric-predictive-validity-C2hDKM8Z.d.ts → rubric-predictive-validity-w7tun-q3.d.ts} +1 -1
- package/dist/{run-record-CP2ObebC.d.ts → run-record-DEwidcqn.d.ts} +1 -1
- package/dist/{runtime-trajectory-BOUUjI0y.d.ts → runtime-trajectory-OJDaTYHN.d.ts} +1 -1
- package/dist/{semantic-concept-judge-DSBB2Cfp.d.ts → semantic-concept-judge-J8xvjdc3.d.ts} +2 -2
- package/dist/{summary-report-CInXwsza.d.ts → summary-report-C4uzRWh8.d.ts} +1 -1
- package/dist/traces.d.ts +1 -1
- package/dist/traces.js +4 -3
- package/dist/{types-B5x54y6n.d.ts → types-BEzCBMQD.d.ts} +2 -2
- package/dist/{types-BTI16iFl.d.ts → types-Cv1bo4_a.d.ts} +1 -1
- package/dist/workflow/index.d.ts +4 -4
- package/dist/workflow/index.js +2 -1
- package/dist/workflow/index.js.map +1 -1
- package/package.json +6 -1
- package/dist/chunk-BUTW4RGG.js +0 -32
- package/dist/chunk-BUTW4RGG.js.map +0 -1
- package/dist/chunk-LO6IOIJ2.js.map +0 -1
- package/dist/chunk-S4SYLDFX.js.map +0 -1
- package/dist/chunk-WMBLMTUE.js.map +0 -1
- /package/dist/{chunk-NZEQVRH5.js.map → chunk-BOETF6BU.js.map} +0 -0
- /package/dist/{chunk-GMGRBNVT.js.map → chunk-G7IB3GJ5.js.map} +0 -0
- /package/dist/{chunk-SJISCGWD.js.map → chunk-JU6ZX3CX.js.map} +0 -0
- /package/dist/{chunk-3NHEO6ZC.js.map → chunk-L5TVEZFT.js.map} +0 -0
- /package/dist/{chunk-77T4STFI.js.map → chunk-PMF5WIBX.js.map} +0 -0
- /package/dist/{chunk-OYU4D7FY.js.map → chunk-VWQ6PO5O.js.map} +0 -0
|
@@ -1,4 +1,4 @@
|
|
|
1
|
-
import { G as GainDistributionBin, P as ParetoFigureSpec } from './summary-report-
|
|
1
|
+
import { G as GainDistributionBin, P as ParetoFigureSpec } from './summary-report-C4uzRWh8.js';
|
|
2
2
|
import { C as ContinuousAgreement } from './judge-calibration-0p2QcWNE.js';
|
|
3
3
|
|
|
4
4
|
/**
|
|
@@ -1,7 +1,7 @@
|
|
|
1
1
|
import { AxAIService, AxFunction } from '@ax-llm/ax';
|
|
2
2
|
import { T as TraceAnalysisStore } from './store-C1YxJDEK.js';
|
|
3
3
|
import { z } from 'zod';
|
|
4
|
-
import { g as AnalystCost,
|
|
4
|
+
import { g as AnalystCost, b as AnalystContext, a as Analyst } from './types-BEzCBMQD.js';
|
|
5
5
|
|
|
6
6
|
/**
|
|
7
7
|
* Typed Ax output for analyst findings.
|
|
@@ -1,12 +1,12 @@
|
|
|
1
1
|
export { C as CalibrationBin, a as CalibrationOptions, b as CalibrationPair, c as CalibrationReport, d as CorrelationResult, e as CorrelationStudyOptions, f as CorrelationStudyResult, E as EvalMetricSpec, O as OutcomePair, g as calibrationCurve, h as calibrationFromPairs, i as correlationStudy } from '../calibration-BPmzuVPk.js';
|
|
2
2
|
export { D as DeploymentOutcome, F as FileSystemOutcomeStore, a as FileSystemOutcomeStoreOptions, I as InMemoryOutcomeStore, O as OutcomeFilter, b as OutcomeStore } from '../outcome-store-rnXLEqSn.js';
|
|
3
|
-
export { R as RubricOutcomePair, a as RubricPredictiveValidityInput, b as RubricPredictiveValidityReport, c as RubricRanking, r as rubricPredictiveValidity } from '../rubric-predictive-validity-
|
|
3
|
+
export { R as RubricOutcomePair, a as RubricPredictiveValidityInput, b as RubricPredictiveValidityReport, c as RubricRanking, r as rubricPredictiveValidity } from '../rubric-predictive-validity-w7tun-q3.js';
|
|
4
4
|
import { C as ContinuousAgreement, a as CalibrationResult, b as ContinuousCalibrationResult, c as CandidateScore, G as GoldenItem } from '../judge-calibration-0p2QcWNE.js';
|
|
5
5
|
import { S as SeriesConvergenceOptions, a as SeriesConvergenceResult } from '../series-convergence-D5OWMBg6.js';
|
|
6
6
|
import { C as CorpusAgreementReport } from '../statistics-xP-cWc5k.js';
|
|
7
7
|
import '../store-BcFXE6LG.js';
|
|
8
8
|
import '../schema-m0gsnbt3.js';
|
|
9
|
-
import '../run-record-
|
|
9
|
+
import '../run-record-DEwidcqn.js';
|
|
10
10
|
import '@tangle-network/agent-interface';
|
|
11
11
|
import '../errors-CzMUYo7b.js';
|
|
12
12
|
import '../types-C7DGg5ex.js';
|
|
@@ -1,7 +1,7 @@
|
|
|
1
|
-
import { J as JudgeScore } from '../types-
|
|
1
|
+
import { J as JudgeScore } from '../types-Cv1bo4_a.js';
|
|
2
2
|
import { AgentProfile } from '@tangle-network/agent-interface';
|
|
3
3
|
import { M as MatrixResult } from '../types-BUxNaJ8c.js';
|
|
4
|
-
import '../run-record-
|
|
4
|
+
import '../run-record-DEwidcqn.js';
|
|
5
5
|
import '../errors-CzMUYo7b.js';
|
|
6
6
|
import '../schema-m0gsnbt3.js';
|
|
7
7
|
import '../verdict-C9MlYujm.js';
|
package/dist/openapi.json
CHANGED
|
@@ -2,7 +2,7 @@
|
|
|
2
2
|
"openapi": "3.1.0",
|
|
3
3
|
"info": {
|
|
4
4
|
"title": "@tangle-network/agent-eval — wire protocol",
|
|
5
|
-
"version": "0.
|
|
5
|
+
"version": "0.100.1",
|
|
6
6
|
"description": "HTTP and stdio RPC interface to agent-eval. The TypeScript runtime is the source of truth; this spec is the contract that cross-language clients (Python, Rust, Go) generate from.\n\nWire-protocol version: 1.0.0. Bumps on breaking changes to request/response schemas.",
|
|
7
7
|
"contact": {
|
|
8
8
|
"name": "Tangle Network",
|
|
@@ -0,0 +1,103 @@
|
|
|
1
|
+
import { A as AgentProfileCell, a as AgentProfileJson } from './run-record-DEwidcqn.js';
|
|
2
|
+
import { V as ValidationError } from './errors-CzMUYo7b.js';
|
|
3
|
+
import { A as AnalystFinding, E as EvidenceRef } from './types-BEzCBMQD.js';
|
|
4
|
+
|
|
5
|
+
type PolicyEditSchemaVersion = 'policy-edit/v1';
|
|
6
|
+
declare const POLICY_EDIT_AXES: readonly ["carrier", "representation", "budget", "sampling", "output_contract", "tool_contract", "routing", "memory", "agent_profile", "deployment_target"];
|
|
7
|
+
type PolicyEditAxis = (typeof POLICY_EDIT_AXES)[number];
|
|
8
|
+
declare const POLICY_EDIT_TARGET_SURFACES: readonly ["prompt", "tool-contract", "runtime-config", "memory", "agent-profile", "deployment"];
|
|
9
|
+
type PolicyEditTargetSurface = (typeof POLICY_EDIT_TARGET_SURFACES)[number];
|
|
10
|
+
type PolicyEditRisk = 'low' | 'medium' | 'high' | 'unknown';
|
|
11
|
+
type PolicyEditGainDirection = 'increase' | 'decrease';
|
|
12
|
+
type PolicyEditGainUnit = 'absolute' | 'relative' | 'percent' | 'score';
|
|
13
|
+
interface PolicyEditTarget {
|
|
14
|
+
surface: PolicyEditTargetSurface;
|
|
15
|
+
/** Stable path inside the target surface, for example `system-prompt:tools`
|
|
16
|
+
* or `budget.maxTurns`. */
|
|
17
|
+
path?: string;
|
|
18
|
+
/** Optional canonical deployment identity. Store the existing cell, not a
|
|
19
|
+
* local profile shape. */
|
|
20
|
+
agentProfileCell?: AgentProfileCell;
|
|
21
|
+
/** Human label when the path is not enough for a readable audit trail. */
|
|
22
|
+
label?: string;
|
|
23
|
+
}
|
|
24
|
+
type PolicyEditChange = {
|
|
25
|
+
kind: 'text';
|
|
26
|
+
mode: 'append' | 'prepend' | 'replace';
|
|
27
|
+
value: string;
|
|
28
|
+
/** Required when `mode === 'replace'`; exact match only. */
|
|
29
|
+
find?: string;
|
|
30
|
+
} | {
|
|
31
|
+
kind: 'json';
|
|
32
|
+
mode: 'set' | 'merge' | 'remove';
|
|
33
|
+
path: string;
|
|
34
|
+
value?: AgentProfileJson;
|
|
35
|
+
};
|
|
36
|
+
interface PolicyEditExpectedGain {
|
|
37
|
+
/** Metric this edit is expected to move, e.g. `holdout.composite`. */
|
|
38
|
+
metric: string;
|
|
39
|
+
direction: PolicyEditGainDirection;
|
|
40
|
+
/** Positive magnitude in the metric's native units. */
|
|
41
|
+
amount: number;
|
|
42
|
+
unit?: PolicyEditGainUnit;
|
|
43
|
+
rationale?: string;
|
|
44
|
+
}
|
|
45
|
+
interface PolicyEditSource {
|
|
46
|
+
findingIds: string[];
|
|
47
|
+
analystIds: string[];
|
|
48
|
+
evidenceRefs: EvidenceRef[];
|
|
49
|
+
/** Mirrors `AnalystFinding.derived_from_judge`; admission rejects it. */
|
|
50
|
+
derivedFromJudge?: boolean;
|
|
51
|
+
}
|
|
52
|
+
interface PolicyEdit {
|
|
53
|
+
schemaVersion: PolicyEditSchemaVersion;
|
|
54
|
+
editId: string;
|
|
55
|
+
axis: PolicyEditAxis;
|
|
56
|
+
target: PolicyEditTarget;
|
|
57
|
+
change: PolicyEditChange;
|
|
58
|
+
claim: string;
|
|
59
|
+
expectedGain: PolicyEditExpectedGain;
|
|
60
|
+
confidence: number;
|
|
61
|
+
risk: PolicyEditRisk;
|
|
62
|
+
source: PolicyEditSource;
|
|
63
|
+
rationale?: string;
|
|
64
|
+
validationPlan?: string;
|
|
65
|
+
metadata?: Record<string, unknown>;
|
|
66
|
+
}
|
|
67
|
+
type PolicyEditInit = Omit<PolicyEdit, 'schemaVersion' | 'editId'> & {
|
|
68
|
+
schemaVersion?: PolicyEditSchemaVersion;
|
|
69
|
+
editId?: string;
|
|
70
|
+
};
|
|
71
|
+
declare class PolicyEditValidationError extends ValidationError {
|
|
72
|
+
readonly path: string;
|
|
73
|
+
constructor(message: string, path?: string);
|
|
74
|
+
}
|
|
75
|
+
interface FindingToPolicyEditOptions {
|
|
76
|
+
expectedGain?: PolicyEditExpectedGain | ((finding: AnalystFinding) => PolicyEditExpectedGain | null | undefined);
|
|
77
|
+
risk?: PolicyEditRisk | ((finding: AnalystFinding) => PolicyEditRisk);
|
|
78
|
+
defaultAxis?: PolicyEditAxis;
|
|
79
|
+
defaultTargetSurface?: PolicyEditTargetSurface;
|
|
80
|
+
}
|
|
81
|
+
interface PolicyEditAdmissionOptions {
|
|
82
|
+
minScore?: number;
|
|
83
|
+
minExpectedGain?: number;
|
|
84
|
+
allowHighRisk?: boolean;
|
|
85
|
+
requireEvidence?: boolean;
|
|
86
|
+
}
|
|
87
|
+
interface PolicyEditAdmission {
|
|
88
|
+
edit: PolicyEdit;
|
|
89
|
+
decision: 'admit' | 'reject';
|
|
90
|
+
score: number;
|
|
91
|
+
reasons: string[];
|
|
92
|
+
}
|
|
93
|
+
declare function makePolicyEdit(init: PolicyEditInit): PolicyEdit;
|
|
94
|
+
declare function computePolicyEditId(edit: Omit<PolicyEdit, 'editId'> | PolicyEdit): string;
|
|
95
|
+
declare function validatePolicyEdit(input: unknown): PolicyEdit;
|
|
96
|
+
declare function isPolicyEdit(input: unknown): input is PolicyEdit;
|
|
97
|
+
declare function policyEditsFromFindings(findings: ReadonlyArray<AnalystFinding>, opts?: FindingToPolicyEditOptions): PolicyEdit[];
|
|
98
|
+
declare function policyEditFromFinding(finding: AnalystFinding, opts?: FindingToPolicyEditOptions): PolicyEdit | null;
|
|
99
|
+
declare function scorePolicyEditReadiness(edit: PolicyEdit, opts?: PolicyEditAdmissionOptions): number;
|
|
100
|
+
declare function admitPolicyEdit(edit: PolicyEdit, opts?: PolicyEditAdmissionOptions): PolicyEditAdmission;
|
|
101
|
+
declare function applyPolicyEditToSurface(surface: unknown, edit: PolicyEdit): unknown;
|
|
102
|
+
|
|
103
|
+
export { type FindingToPolicyEditOptions as F, POLICY_EDIT_AXES as P, POLICY_EDIT_TARGET_SURFACES as a, type PolicyEdit as b, type PolicyEditAdmission as c, type PolicyEditAdmissionOptions as d, type PolicyEditAxis as e, type PolicyEditChange as f, type PolicyEditExpectedGain as g, type PolicyEditGainDirection as h, type PolicyEditGainUnit as i, type PolicyEditInit as j, type PolicyEditRisk as k, type PolicyEditSchemaVersion as l, type PolicyEditSource as m, type PolicyEditTarget as n, type PolicyEditTargetSurface as o, PolicyEditValidationError as p, admitPolicyEdit as q, applyPolicyEditToSurface as r, computePolicyEditId as s, isPolicyEdit as t, makePolicyEdit as u, policyEditFromFinding as v, policyEditsFromFindings as w, scorePolicyEditReadiness as x, validatePolicyEdit as y };
|
|
@@ -1,7 +1,7 @@
|
|
|
1
1
|
import { A as AgentEvalError } from './errors-CzMUYo7b.js';
|
|
2
|
-
import { R as RunRecord } from './run-record-
|
|
3
|
-
import { C as ChatClient } from './types-
|
|
4
|
-
import { c as JudgeDimension, S as Scenario, a as JudgeConfig } from './types-
|
|
2
|
+
import { R as RunRecord } from './run-record-DEwidcqn.js';
|
|
3
|
+
import { C as ChatClient } from './types-BEzCBMQD.js';
|
|
4
|
+
import { c as JudgeDimension, S as Scenario, a as JudgeConfig } from './types-Cv1bo4_a.js';
|
|
5
5
|
import { TCloud } from '@tangle-network/tcloud';
|
|
6
6
|
import { D as DefaultVerdict } from './verdict-C9MlYujm.js';
|
|
7
7
|
|
|
@@ -1,9 +1,9 @@
|
|
|
1
|
-
import { S as Scenario, g as Gate, G as GateResult, h as GateContext, C as CampaignResult, i as Mutator, f as SurfaceProposer, M as MutableSurface, j as GateDecision } from './types-
|
|
1
|
+
import { S as Scenario, g as Gate, G as GateResult, h as GateContext, C as CampaignResult, i as Mutator, f as SurfaceProposer, M as MutableSurface, j as GateDecision } from './types-Cv1bo4_a.js';
|
|
2
2
|
import { R as RedTeamCase } from './red-team-BWdoyleI.js';
|
|
3
|
-
import { R as RunRecord } from './run-record-
|
|
3
|
+
import { R as RunRecord } from './run-record-DEwidcqn.js';
|
|
4
4
|
import { D as Direction } from './pareto-E-pembql.js';
|
|
5
5
|
import { a as PairedBootstrapResult } from './statistics-xP-cWc5k.js';
|
|
6
|
-
import { R as RunCampaignOptions, C as CampaignStorage } from './gepa-
|
|
6
|
+
import { R as RunCampaignOptions, C as CampaignStorage } from './gepa-BRgNnmGZ.js';
|
|
7
7
|
import { HostedClient, TraceSpanEvent } from './hosted/index.js';
|
|
8
8
|
|
|
9
9
|
/**
|
|
@@ -1,6 +1,6 @@
|
|
|
1
1
|
import { D as DatasetSplit, c as DatasetManifest, a as DatasetScenario } from './dataset-BbGkaN2I.js';
|
|
2
|
-
import { m as GateDecision } from './summary-report-
|
|
3
|
-
import { R as RunRecord,
|
|
2
|
+
import { m as GateDecision } from './summary-report-C4uzRWh8.js';
|
|
3
|
+
import { R as RunRecord, b as RunSplitTag } from './run-record-DEwidcqn.js';
|
|
4
4
|
|
|
5
5
|
/**
|
|
6
6
|
* Release confidence gate.
|
package/dist/reporting.d.ts
CHANGED
|
@@ -1,9 +1,9 @@
|
|
|
1
|
-
export { R as RubricOutcomePair, a as RubricPredictiveValidityInput, b as RubricPredictiveValidityReport, c as RubricRanking, r as rubricPredictiveValidity } from './rubric-predictive-validity-
|
|
2
|
-
export { B as BootstrapOptions, a as BootstrapResult, J as JudgeReplayGateArgs, R as ReleaseConfidenceAxis, b as ReleaseConfidenceAxisName, c as ReleaseConfidenceInput, d as ReleaseConfidenceIssue, e as ReleaseConfidenceMetrics, f as ReleaseConfidenceScorecard, g as ReleaseConfidenceStatus, h as ReleaseConfidenceThresholds, i as ReleaseTraceEvidence, j as RenderReleaseReportOptions, V as Verdict, k as assertReleaseConfidence, l as bootstrapCi, m as evaluateReleaseConfidence, n as judgeReplayGate, r as renderReleaseReport } from './release-report-
|
|
1
|
+
export { R as RubricOutcomePair, a as RubricPredictiveValidityInput, b as RubricPredictiveValidityReport, c as RubricRanking, r as rubricPredictiveValidity } from './rubric-predictive-validity-w7tun-q3.js';
|
|
2
|
+
export { B as BootstrapOptions, a as BootstrapResult, J as JudgeReplayGateArgs, R as ReleaseConfidenceAxis, b as ReleaseConfidenceAxisName, c as ReleaseConfidenceInput, d as ReleaseConfidenceIssue, e as ReleaseConfidenceMetrics, f as ReleaseConfidenceScorecard, g as ReleaseConfidenceStatus, h as ReleaseConfidenceThresholds, i as ReleaseTraceEvidence, j as RenderReleaseReportOptions, V as Verdict, k as assertReleaseConfidence, l as bootstrapCi, m as evaluateReleaseConfidence, n as judgeReplayGate, r as renderReleaseReport } from './release-report-B1tA6pKu.js';
|
|
3
3
|
export { I as InterimReleaseConfidence, a as InterimReleaseConfidenceInput, P as PairedEvalueOptions, b as PairedEvalueSequence, c as PairedEvalueStep, S as SequentialDecision, e as evaluateInterimReleaseConfidence, p as pairedEvalueSequence } from './sequential-5iSVfzl2.js';
|
|
4
4
|
export { P as PairedBootstrapOptions, a as PairedBootstrapResult, b as benjaminiHochberg, p as pairedBootstrap, w as wilcoxonSignedRank } from './statistics-xP-cWc5k.js';
|
|
5
|
-
export { G as GainDistributionBin, a as GainDistributionFigureSpec, b as GainDistributionOptions, P as ParetoFigureSpec, c as ParetoPoint, R as RESEARCH_REPORT_HARD_PAIR_FLOOR, d as ResearchReport, e as ResearchReportCandidate, f as ResearchReportDecision, g as ResearchReportMethodology, h as ResearchReportOptions, i as ResearchReportRecommendation, S as SummaryTable, j as SummaryTableOptions, k as SummaryTableRow, l as gainHistogram, p as paretoChart, r as researchReport, s as summaryTable } from './summary-report-
|
|
6
|
-
import './run-record-
|
|
5
|
+
export { G as GainDistributionBin, a as GainDistributionFigureSpec, b as GainDistributionOptions, P as ParetoFigureSpec, c as ParetoPoint, R as RESEARCH_REPORT_HARD_PAIR_FLOOR, d as ResearchReport, e as ResearchReportCandidate, f as ResearchReportDecision, g as ResearchReportMethodology, h as ResearchReportOptions, i as ResearchReportRecommendation, S as SummaryTable, j as SummaryTableOptions, k as SummaryTableRow, l as gainHistogram, p as paretoChart, r as researchReport, s as summaryTable } from './summary-report-C4uzRWh8.js';
|
|
6
|
+
import './run-record-DEwidcqn.js';
|
|
7
7
|
import '@tangle-network/agent-interface';
|
|
8
8
|
import './errors-CzMUYo7b.js';
|
|
9
9
|
import './schema-m0gsnbt3.js';
|
|
@@ -1,6 +1,6 @@
|
|
|
1
|
-
import {
|
|
1
|
+
import { b as RunSplitTag, c as RunTokenUsage, d as RunJudgeMetadata, J as JudgeScoresRecord, A as AgentProfileCell, e as AgentProfileCellInput, R as RunRecord } from './run-record-DEwidcqn.js';
|
|
2
2
|
import { L as LlmClientOptions, a as LlmRouteRequirements } from './llm-client-Bj7g0rqu.js';
|
|
3
|
-
import { h as ResearchReportOptions, d as ResearchReport, m as GateDecision } from './summary-report-
|
|
3
|
+
import { h as ResearchReportOptions, d as ResearchReport, m as GateDecision } from './summary-report-C4uzRWh8.js';
|
|
4
4
|
import { T as TraceEmitter, R as RunCompleteHook } from './emitter-C2rqGH_l.js';
|
|
5
5
|
import { R as RunIntegrityExpectations, a as RunIntegrityReport } from './integrity-D2t12mMw.js';
|
|
6
6
|
import { R as RawProviderSink } from './raw-provider-sink-C46HDghv.js';
|
package/dist/rl.d.ts
CHANGED
|
@@ -1,23 +1,23 @@
|
|
|
1
|
-
import { R as RunRecord,
|
|
1
|
+
import { R as RunRecord, b as RunSplitTag } from './run-record-DEwidcqn.js';
|
|
2
2
|
export { A as AdversarialMutation } from './adversarial-B7loGVVX.js';
|
|
3
|
-
import { P as PreferenceExtractionReport, D as DpoExportRow, G as GrpoExportRow, S as SftExportRow, E as ExtractPreferencesOptions, a as DpoLookups, b as GrpoLookups, c as SftLookups } from './corpus-
|
|
4
|
-
export { d as CorpusAppendResult, C as CorpusRecord, e as DatasetFormat, f as ExtractStepRewardsOptions, H as HarvestOptions, g as PreferenceStrategy, h as PreferenceTriple, i as PrmExportRow, j as PrmLookups, k as PrmTrainingTriple, R as RewardKind, l as RewardStats, m as RlDatasetBundle, n as RlDatasetConfig, o as RlDatasetManifest, p as RlDatasetStats, q as RunwiseStepSummary, r as StepReward, s as StepRewardJsonlRow, t as StepScorer, u as appendToCorpus, v as buildDatasetFromCorpus, w as buildRlDataset, x as datasheetToMarkdown, y as extractPreferences, z as extractStepRewards, A as prmTrainingPairs, B as readCorpus, F as runwiseStepRewardSummary, I as stepRewardsToJsonl, J as toAnthropicFormat, K as toDpoJsonl, L as toDpoRows, M as toGrpoJsonl, N as toGrpoRows, O as toPrmJsonl, Q as toPrmRows, T as toSftJsonl, U as toSftRows, V as toTRLFormat } from './corpus-
|
|
3
|
+
import { P as PreferenceExtractionReport, D as DpoExportRow, G as GrpoExportRow, S as SftExportRow, E as ExtractPreferencesOptions, a as DpoLookups, b as GrpoLookups, c as SftLookups } from './corpus-ONOzGFmG.js';
|
|
4
|
+
export { d as CorpusAppendResult, C as CorpusRecord, e as DatasetFormat, f as ExtractStepRewardsOptions, H as HarvestOptions, g as PreferenceStrategy, h as PreferenceTriple, i as PrmExportRow, j as PrmLookups, k as PrmTrainingTriple, R as RewardKind, l as RewardStats, m as RlDatasetBundle, n as RlDatasetConfig, o as RlDatasetManifest, p as RlDatasetStats, q as RunwiseStepSummary, r as StepReward, s as StepRewardJsonlRow, t as StepScorer, u as appendToCorpus, v as buildDatasetFromCorpus, w as buildRlDataset, x as datasheetToMarkdown, y as extractPreferences, z as extractStepRewards, A as prmTrainingPairs, B as readCorpus, F as runwiseStepRewardSummary, I as stepRewardsToJsonl, J as toAnthropicFormat, K as toDpoJsonl, L as toDpoRows, M as toGrpoJsonl, N as toGrpoRows, O as toPrmJsonl, Q as toPrmRows, T as toSftJsonl, U as toSftRows, V as toTRLFormat } from './corpus-ONOzGFmG.js';
|
|
5
5
|
export { O as OffPolicyEstimate, a as OffPolicyOptions, b as OffPolicyTrajectory, d as doublyRobust, i as inverseProbabilityWeighting, o as offPolicyEstimateAll, s as selfNormalizedImportanceWeighting } from './off-policy-DiwuKKg7.js';
|
|
6
6
|
import { b as OutcomeStore } from './outcome-store-rnXLEqSn.js';
|
|
7
7
|
export { D as DeploymentOutcome, F as FileSystemOutcomeStore, a as FileSystemOutcomeStoreOptions, I as InMemoryOutcomeStore } from './outcome-store-rnXLEqSn.js';
|
|
8
|
-
import { b as RubricPredictiveValidityReport } from './rubric-predictive-validity-
|
|
9
|
-
import { R as Researcher, F as FailureMode, S as SteeringChange, E as ExperimentPlan, a as ExperimentResult, b as EvalCampaignResult, c as EvalCampaignOptions } from './researcher-
|
|
10
|
-
export { r as runEvalCampaign } from './researcher-
|
|
8
|
+
import { b as RubricPredictiveValidityReport } from './rubric-predictive-validity-w7tun-q3.js';
|
|
9
|
+
import { R as Researcher, F as FailureMode, S as SteeringChange, E as ExperimentPlan, a as ExperimentResult, b as EvalCampaignResult, c as EvalCampaignOptions } from './researcher-Ba2y1Foi.js';
|
|
10
|
+
export { r as runEvalCampaign } from './researcher-Ba2y1Foi.js';
|
|
11
11
|
import { a as VerificationReport } from './multi-layer-verifier-DUZXrPDA.js';
|
|
12
12
|
import { I as InterimReleaseConfidence } from './sequential-5iSVfzl2.js';
|
|
13
|
-
import { C as CampaignResult } from './types-
|
|
13
|
+
import { C as CampaignResult } from './types-Cv1bo4_a.js';
|
|
14
14
|
import '@tangle-network/agent-interface';
|
|
15
15
|
import './errors-CzMUYo7b.js';
|
|
16
16
|
import './schema-m0gsnbt3.js';
|
|
17
17
|
import './store-BcFXE6LG.js';
|
|
18
18
|
import './llm-client-Bj7g0rqu.js';
|
|
19
19
|
import './raw-provider-sink-C46HDghv.js';
|
|
20
|
-
import './summary-report-
|
|
20
|
+
import './summary-report-C4uzRWh8.js';
|
|
21
21
|
import './failure-cluster-DH9Flgcf.js';
|
|
22
22
|
import './emitter-C2rqGH_l.js';
|
|
23
23
|
import './integrity-D2t12mMw.js';
|
package/dist/rl.js
CHANGED
|
@@ -16,7 +16,7 @@ import {
|
|
|
16
16
|
} from "./chunk-3RF76KTD.js";
|
|
17
17
|
import {
|
|
18
18
|
runEvalCampaign
|
|
19
|
-
} from "./chunk-
|
|
19
|
+
} from "./chunk-4LWD6GC7.js";
|
|
20
20
|
import "./chunk-CWNP4DV4.js";
|
|
21
21
|
import {
|
|
22
22
|
rubricPredictiveValidity
|
|
@@ -36,8 +36,9 @@ import {
|
|
|
36
36
|
} from "./chunk-VZSRQ272.js";
|
|
37
37
|
import "./chunk-SBCB6VZY.js";
|
|
38
38
|
import "./chunk-PC4UYEBM.js";
|
|
39
|
-
import "./chunk-
|
|
39
|
+
import "./chunk-G6S73VA7.js";
|
|
40
40
|
import "./chunk-TVVP3ZZQ.js";
|
|
41
|
+
import "./chunk-ABOIVNXL.js";
|
|
41
42
|
import "./chunk-VSMTAMNK.js";
|
|
42
43
|
import {
|
|
43
44
|
ValidationError
|