@tangle-network/agent-eval 0.103.0 → 0.103.1
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/dist/adapters/http.d.ts +2 -2
- package/dist/adapters/langchain.d.ts +2 -2
- package/dist/adapters/otel.d.ts +5 -5
- package/dist/analyst/index.d.ts +9 -9
- package/dist/analyst/index.js +3 -3
- package/dist/{analyze-runs-Cd-A_K4l.d.ts → analyze-runs-rF2eGxZ_.d.ts} +3 -3
- package/dist/belief-state/index.d.ts +3 -3
- package/dist/belief-state/index.js +1 -1
- package/dist/benchmarks/index.d.ts +2 -2
- package/dist/builder-eval/index.js +2 -2
- package/dist/campaign/index.d.ts +42 -15
- package/dist/campaign/index.js +9 -9
- package/dist/campaign/index.js.map +1 -1
- package/dist/{chunk-NTVWIH24.js → chunk-2B4HPFXN.js} +3 -3
- package/dist/chunk-2B4HPFXN.js.map +1 -0
- package/dist/{chunk-7RBJANJD.js → chunk-3722PKPB.js} +2 -2
- package/dist/{chunk-HV5PBTJF.js → chunk-66T25VWE.js} +5 -5
- package/dist/chunk-66T25VWE.js.map +1 -0
- package/dist/{chunk-6FIAJHCU.js → chunk-6YVAN6R3.js} +4 -4
- package/dist/{chunk-ABOIVNXL.js → chunk-AGYDMORK.js} +1 -1
- package/dist/chunk-AGYDMORK.js.map +1 -0
- package/dist/{chunk-B2TMQM62.js → chunk-BHCFJGL4.js} +2 -2
- package/dist/{chunk-IH7LYRHL.js → chunk-BXZVBX3D.js} +3 -3
- package/dist/{chunk-6GT4NI4V.js → chunk-CLS3374R.js} +2 -2
- package/dist/{chunk-HRGUJTER.js → chunk-HYGRFL7C.js} +1 -1
- package/dist/{chunk-HRGUJTER.js.map → chunk-HYGRFL7C.js.map} +1 -1
- package/dist/{chunk-2NSLDY4B.js → chunk-J5MUFXEY.js} +2 -2
- package/dist/{chunk-UFSG7ACU.js → chunk-JZXGWLK5.js} +1 -1
- package/dist/chunk-JZXGWLK5.js.map +1 -0
- package/dist/{chunk-IN3SHQML.js → chunk-LMSQ6EFA.js} +2 -2
- package/dist/{chunk-AIGWQEME.js → chunk-LOZOZYHU.js} +2 -2
- package/dist/{chunk-NF7OZ4J7.js → chunk-QCBB6ZIU.js} +2 -2
- package/dist/{chunk-JU6ZX3CX.js → chunk-SMCACT4Z.js} +2 -2
- package/dist/{chunk-U3IDYATS.js → chunk-TCPP4Z5Q.js} +5 -5
- package/dist/{chunk-VDGPPGE3.js → chunk-UMEAR2FI.js} +2 -2
- package/dist/{chunk-VDGPPGE3.js.map → chunk-UMEAR2FI.js.map} +1 -1
- package/dist/{chunk-XKA6ZGEY.js → chunk-VNM52AGA.js} +2 -2
- package/dist/chunk-VNM52AGA.js.map +1 -0
- package/dist/{chunk-IXOV77YF.js → chunk-YFYIOSNV.js} +4 -4
- package/dist/{code-agent-session-Ce-9u7YM.d.ts → code-agent-session-Cen-qD2y.d.ts} +1 -1
- package/dist/contract/index.d.ts +18 -18
- package/dist/contract/index.js +10 -10
- package/dist/{control-C8RmK9H4.d.ts → control-KofK3gfG.d.ts} +1 -1
- package/dist/control.d.ts +2 -2
- package/dist/control.js +3 -3
- package/dist/{corpus-CiSzzLa5.d.ts → corpus-CysLCiK4.d.ts} +1 -1
- package/dist/{default-registry-ZhqsTr4K.d.ts → default-registry-Ez4cxuZ4.d.ts} +2 -2
- package/dist/diagnose.d.ts +3 -3
- package/dist/diagnose.js +3 -3
- package/dist/{gepa-DeyPTlvx.d.ts → gepa-COlCAkHN.d.ts} +22 -1
- package/dist/governance/index.d.ts +1 -1
- package/dist/hosted/index.d.ts +5 -5
- package/dist/{index-B-bFgiAF.d.ts → index-unCSYRJJ.d.ts} +1 -1
- package/dist/index.d.ts +31 -27
- package/dist/index.js +16 -16
- package/dist/index.js.map +1 -1
- package/dist/{insight-report-k0sRTzKg.d.ts → insight-report-DumCfEur.d.ts} +2 -2
- package/dist/{judge-calibration-0p2QcWNE.d.ts → judge-calibration-7C-IDmKr.d.ts} +3 -0
- package/dist/{kind-factory-D0nk7AKV.d.ts → kind-factory-BLHxwX71.d.ts} +1 -1
- package/dist/meta-eval/index.d.ts +4 -4
- package/dist/meta-eval/index.js +3 -3
- package/dist/{multi-layer-verifier-DUZXrPDA.d.ts → multi-layer-verifier-CI4jdX-q.d.ts} +3 -0
- package/dist/multishot/index.d.ts +2 -2
- package/dist/openapi.json +1 -1
- package/dist/pipelines/index.d.ts +1 -1
- package/dist/pipelines/index.js +3 -3
- package/dist/{policy-edit-BDQzzsBU.d.ts → policy-edit-nUhuFtLF.d.ts} +2 -2
- package/dist/{pre-registration-mWG2w8d-.d.ts → pre-registration-CUOSGAZK.d.ts} +3 -3
- package/dist/product-benchmark/index.d.ts +1 -1
- package/dist/{provenance-BhJm32vN.d.ts → provenance-B2VsP0jP.d.ts} +20 -4
- package/dist/{query-B7GGjRox.d.ts → query-0aTmbmQe.d.ts} +1 -0
- package/dist/{release-report-BQ1Ziyu-.d.ts → release-report-DkaCZ9k4.d.ts} +5 -2
- package/dist/reporting.d.ts +6 -6
- package/dist/reporting.js +4 -4
- package/dist/{researcher-B_ODTAJs.d.ts → researcher-SDAezfML.d.ts} +2 -2
- package/dist/rl.d.ts +9 -9
- package/dist/rl.js +7 -7
- package/dist/{rubric-predictive-validity-0MdjTt8R.d.ts → rubric-predictive-validity-ZGIlJNce.d.ts} +1 -1
- package/dist/{run-campaign-2L4WCJHR.js → run-campaign-DAHKO5CT.js} +3 -3
- package/dist/{run-record-MRdJ-Kq2.d.ts → run-record-CPfd1ARZ.d.ts} +3 -0
- package/dist/{runtime-trajectory-8w0_jmtR.d.ts → runtime-trajectory-DZ8ei-Jo.d.ts} +1 -1
- package/dist/{semantic-concept-judge-D-IlH5v1.d.ts → semantic-concept-judge-C6mDEBIo.d.ts} +3 -3
- package/dist/{statistics-xP-cWc5k.d.ts → statistics-D88peojY.d.ts} +1 -1
- package/dist/{summary-report-C0nnxOD8.d.ts → summary-report-Fc_YFJat.d.ts} +1 -1
- package/dist/traces.d.ts +2 -2
- package/dist/traces.js +4 -4
- package/dist/{types-DFI_Z-ZL.d.ts → types-Bihq6-a3.d.ts} +1 -1
- package/dist/{types-Dz9cKF0g.d.ts → types-DA9yj-Jd.d.ts} +1 -1
- package/dist/workflow/index.d.ts +7 -7
- package/dist/workflow/index.js +3 -3
- package/package.json +1 -1
- package/dist/chunk-ABOIVNXL.js.map +0 -1
- package/dist/chunk-HV5PBTJF.js.map +0 -1
- package/dist/chunk-NTVWIH24.js.map +0 -1
- package/dist/chunk-UFSG7ACU.js.map +0 -1
- package/dist/chunk-XKA6ZGEY.js.map +0 -1
- /package/dist/{chunk-7RBJANJD.js.map → chunk-3722PKPB.js.map} +0 -0
- /package/dist/{chunk-6FIAJHCU.js.map → chunk-6YVAN6R3.js.map} +0 -0
- /package/dist/{chunk-B2TMQM62.js.map → chunk-BHCFJGL4.js.map} +0 -0
- /package/dist/{chunk-IH7LYRHL.js.map → chunk-BXZVBX3D.js.map} +0 -0
- /package/dist/{chunk-6GT4NI4V.js.map → chunk-CLS3374R.js.map} +0 -0
- /package/dist/{chunk-2NSLDY4B.js.map → chunk-J5MUFXEY.js.map} +0 -0
- /package/dist/{chunk-IN3SHQML.js.map → chunk-LMSQ6EFA.js.map} +0 -0
- /package/dist/{chunk-AIGWQEME.js.map → chunk-LOZOZYHU.js.map} +0 -0
- /package/dist/{chunk-NF7OZ4J7.js.map → chunk-QCBB6ZIU.js.map} +0 -0
- /package/dist/{chunk-JU6ZX3CX.js.map → chunk-SMCACT4Z.js.map} +0 -0
- /package/dist/{chunk-U3IDYATS.js.map → chunk-TCPP4Z5Q.js.map} +0 -0
- /package/dist/{chunk-IXOV77YF.js.map → chunk-YFYIOSNV.js.map} +0 -0
- /package/dist/{run-campaign-2L4WCJHR.js.map → run-campaign-DAHKO5CT.js.map} +0 -0
package/dist/adapters/http.d.ts
CHANGED
|
@@ -1,5 +1,5 @@
|
|
|
1
|
-
import { S as Scenario, D as DispatchFn, b as DispatchContext } from '../types-
|
|
2
|
-
import '../run-record-
|
|
1
|
+
import { S as Scenario, D as DispatchFn, b as DispatchContext } from '../types-Bihq6-a3.js';
|
|
2
|
+
import '../run-record-CPfd1ARZ.js';
|
|
3
3
|
import '@tangle-network/agent-interface';
|
|
4
4
|
import '../errors-CzMUYo7b.js';
|
|
5
5
|
import '../schema-m0gsnbt3.js';
|
|
@@ -1,5 +1,5 @@
|
|
|
1
|
-
import { S as Scenario, J as JudgeScore, D as DispatchFn, a as JudgeConfig } from '../types-
|
|
2
|
-
import '../run-record-
|
|
1
|
+
import { S as Scenario, J as JudgeScore, D as DispatchFn, a as JudgeConfig } from '../types-Bihq6-a3.js';
|
|
2
|
+
import '../run-record-CPfd1ARZ.js';
|
|
3
3
|
import '@tangle-network/agent-interface';
|
|
4
4
|
import '../errors-CzMUYo7b.js';
|
|
5
5
|
import '../schema-m0gsnbt3.js';
|
package/dist/adapters/otel.d.ts
CHANGED
|
@@ -1,14 +1,14 @@
|
|
|
1
1
|
import { TraceSpanEvent, HostedClient } from '../hosted/index.js';
|
|
2
|
-
import '../types-
|
|
3
|
-
import '../run-record-
|
|
2
|
+
import '../types-Bihq6-a3.js';
|
|
3
|
+
import '../run-record-CPfd1ARZ.js';
|
|
4
4
|
import '@tangle-network/agent-interface';
|
|
5
5
|
import '../errors-CzMUYo7b.js';
|
|
6
6
|
import '../schema-m0gsnbt3.js';
|
|
7
|
-
import '../insight-report-
|
|
8
|
-
import '../summary-report-
|
|
7
|
+
import '../insight-report-DumCfEur.js';
|
|
8
|
+
import '../summary-report-Fc_YFJat.js';
|
|
9
9
|
import '../failure-cluster-DH9Flgcf.js';
|
|
10
10
|
import '../store-BcFXE6LG.js';
|
|
11
|
-
import '../judge-calibration-
|
|
11
|
+
import '../judge-calibration-7C-IDmKr.js';
|
|
12
12
|
|
|
13
13
|
/**
|
|
14
14
|
* # `@tangle-network/agent-eval/adapters/otel` — OTel→hosted bridge.
|
package/dist/analyst/index.d.ts
CHANGED
|
@@ -1,22 +1,22 @@
|
|
|
1
|
-
import { M as MultiLayerVerifier, V as VerifyOptions, S as Severity } from '../multi-layer-verifier-
|
|
1
|
+
import { M as MultiLayerVerifier, V as VerifyOptions, S as Severity } from '../multi-layer-verifier-CI4jdX-q.js';
|
|
2
2
|
import { c as RunCritic, a as RunTrace } from '../run-critic-CmMf05uV.js';
|
|
3
|
-
import { S as SemanticConceptJudgeOptions, a as SemanticConceptJudgeInput, B as BehavioralMetrics } from '../semantic-concept-judge-
|
|
4
|
-
export { C as CreateAnalystAiConfig, D as DEFAULT_TRACE_ANALYST_KINDS, b as DiffPolicy, F as FAILURE_MODE_KIND_SPEC, c as FINDING_SUBJECT_GRAMMAR_PROMPT, d as FINDING_SUBJECT_KINDS, e as FindingSubject, f as FindingSubjectKind, g as FindingSubjectStringSchema, h as FindingsDiff, i as FindingsStore, I as IMPROVEMENT_KIND_SPEC, K as KIND_EXPECTED_SUBJECTS, j as KNOWLEDGE_GAP_KIND_SPEC, k as KNOWLEDGE_POISONING_KIND_SPEC, P as PersistedFinding, l as SKILL_USAGE_ANALYST, m as SkillUsageAnalyst, n as SkillUsageRecord, o as SkillUsageReport, p as SkillUsageScanConfig, q as buildSkillUsageReport, r as createAnalystAi, s as defaultIsMaterial, t as diffFindings, u as emitSkillUsageFindings, v as parseFindingSubject, w as renderFindingSubject } from '../semantic-concept-judge-
|
|
3
|
+
import { S as SemanticConceptJudgeOptions, a as SemanticConceptJudgeInput, B as BehavioralMetrics } from '../semantic-concept-judge-C6mDEBIo.js';
|
|
4
|
+
export { C as CreateAnalystAiConfig, D as DEFAULT_TRACE_ANALYST_KINDS, b as DiffPolicy, F as FAILURE_MODE_KIND_SPEC, c as FINDING_SUBJECT_GRAMMAR_PROMPT, d as FINDING_SUBJECT_KINDS, e as FindingSubject, f as FindingSubjectKind, g as FindingSubjectStringSchema, h as FindingsDiff, i as FindingsStore, I as IMPROVEMENT_KIND_SPEC, K as KIND_EXPECTED_SUBJECTS, j as KNOWLEDGE_GAP_KIND_SPEC, k as KNOWLEDGE_POISONING_KIND_SPEC, P as PersistedFinding, l as SKILL_USAGE_ANALYST, m as SkillUsageAnalyst, n as SkillUsageRecord, o as SkillUsageReport, p as SkillUsageScanConfig, q as buildSkillUsageReport, r as createAnalystAi, s as defaultIsMaterial, t as diffFindings, u as emitSkillUsageFindings, v as parseFindingSubject, w as renderFindingSubject } from '../semantic-concept-judge-C6mDEBIo.js';
|
|
5
5
|
import { b as JudgeFn, a as JudgeInput } from '../types-C7DGg5ex.js';
|
|
6
|
-
import { a as Analyst, h as AnalystSeverity, A as AnalystFinding } from '../types-
|
|
7
|
-
export { b as AnalystContext, g as AnalystCost, i as AnalystInputKind, j as AnalystRequirements, f as AnalystRunEvent, e as AnalystRunInputs, d as AnalystRunResult, c as AnalystRunSummary, k as ChatCallOpts, C as ChatClient, l as ChatRequest, m as ChatResponse, n as ChatTransport, o as CliBridgeTransportOpts, p as CreateChatClientOpts, D as DirectProviderTransportOpts, E as EvidenceRef, M as MockTransportOpts, R as RouterTransportOpts, S as SandboxSdkTransportOpts, q as computeFindingId, r as createChatClient, s as makeFinding } from '../types-
|
|
6
|
+
import { a as Analyst, h as AnalystSeverity, A as AnalystFinding } from '../types-DA9yj-Jd.js';
|
|
7
|
+
export { b as AnalystContext, g as AnalystCost, i as AnalystInputKind, j as AnalystRequirements, f as AnalystRunEvent, e as AnalystRunInputs, d as AnalystRunResult, c as AnalystRunSummary, k as ChatCallOpts, C as ChatClient, l as ChatRequest, m as ChatResponse, n as ChatTransport, o as CliBridgeTransportOpts, p as CreateChatClientOpts, D as DirectProviderTransportOpts, E as EvidenceRef, M as MockTransportOpts, R as RouterTransportOpts, S as SandboxSdkTransportOpts, q as computeFindingId, r as createChatClient, s as makeFinding } from '../types-DA9yj-Jd.js';
|
|
8
8
|
import { TCloud } from '@tangle-network/tcloud';
|
|
9
9
|
import { T as TraceAnalysisStore } from '../store-C1YxJDEK.js';
|
|
10
|
-
export { a as AnalystHooks, A as AnalystRegistry, b as AnalystRegistryOptions, B as BudgetPolicy, D as DefaultAnalystRegistryOptions, R as RegistryRunOpts, c as buildDefaultAnalystRegistry } from '../default-registry-
|
|
11
|
-
export { A as ANALYST_SEVERITIES, C as CreateTraceAnalystKindOpts, R as RAW_FINDING_SCHEMA_PROMPT, a as RawAnalystFinding, b as RawAnalystFindingSchema, c as TraceAnalystGolden, T as TraceAnalystKindSpec, d as createTraceAnalystKind, p as parseRawFinding, r as renderPriorFindings } from '../kind-factory-
|
|
12
|
-
export { F as FindingToPolicyEditOptions, P as POLICY_EDIT_AXES, a as POLICY_EDIT_TARGET_SURFACES, b as PolicyEdit, c as PolicyEditAdmission, d as PolicyEditAdmissionOptions, e as PolicyEditAxis, f as PolicyEditChange, g as PolicyEditExpectedGain, h as PolicyEditGainDirection, i as PolicyEditGainUnit, j as PolicyEditInit, k as PolicyEditRisk, l as PolicyEditSchemaVersion, m as PolicyEditSource, n as PolicyEditTarget, o as PolicyEditTargetSurface, p as PolicyEditValidationError, q as admitPolicyEdit, r as applyPolicyEditToSurface, s as computePolicyEditId, t as isPolicyEdit, u as makePolicyEdit, v as policyEditFromFinding, w as policyEditsFromFindings, x as scorePolicyEditReadiness, y as validatePolicyEdit } from '../policy-edit-
|
|
10
|
+
export { a as AnalystHooks, A as AnalystRegistry, b as AnalystRegistryOptions, B as BudgetPolicy, D as DefaultAnalystRegistryOptions, R as RegistryRunOpts, c as buildDefaultAnalystRegistry } from '../default-registry-Ez4cxuZ4.js';
|
|
11
|
+
export { A as ANALYST_SEVERITIES, C as CreateTraceAnalystKindOpts, R as RAW_FINDING_SCHEMA_PROMPT, a as RawAnalystFinding, b as RawAnalystFindingSchema, c as TraceAnalystGolden, T as TraceAnalystKindSpec, d as createTraceAnalystKind, p as parseRawFinding, r as renderPriorFindings } from '../kind-factory-BLHxwX71.js';
|
|
12
|
+
export { F as FindingToPolicyEditOptions, P as POLICY_EDIT_AXES, a as POLICY_EDIT_TARGET_SURFACES, b as PolicyEdit, c as PolicyEditAdmission, d as PolicyEditAdmissionOptions, e as PolicyEditAxis, f as PolicyEditChange, g as PolicyEditExpectedGain, h as PolicyEditGainDirection, i as PolicyEditGainUnit, j as PolicyEditInit, k as PolicyEditRisk, l as PolicyEditSchemaVersion, m as PolicyEditSource, n as PolicyEditTarget, o as PolicyEditTargetSurface, p as PolicyEditValidationError, q as admitPolicyEdit, r as applyPolicyEditToSurface, s as computePolicyEditId, t as isPolicyEdit, u as makePolicyEdit, v as policyEditFromFinding, w as policyEditsFromFindings, x as scorePolicyEditReadiness, y as validatePolicyEdit } from '../policy-edit-nUhuFtLF.js';
|
|
13
13
|
import { L as LlmClientOptions } from '../llm-client-Bj7g0rqu.js';
|
|
14
14
|
import { AxFunction } from '@ax-llm/ax';
|
|
15
15
|
import '../verdict-C9MlYujm.js';
|
|
16
16
|
import '../schema-m0gsnbt3.js';
|
|
17
17
|
import '../store-BcFXE6LG.js';
|
|
18
18
|
import 'zod';
|
|
19
|
-
import '../run-record-
|
|
19
|
+
import '../run-record-CPfd1ARZ.js';
|
|
20
20
|
import '@tangle-network/agent-interface';
|
|
21
21
|
import '../errors-CzMUYo7b.js';
|
|
22
22
|
import '../raw-provider-sink-C46HDghv.js';
|
package/dist/analyst/index.js
CHANGED
|
@@ -11,7 +11,7 @@ import {
|
|
|
11
11
|
diffFindings,
|
|
12
12
|
emitSkillUsageFindings,
|
|
13
13
|
runSemanticConceptJudge
|
|
14
|
-
} from "../chunk-
|
|
14
|
+
} from "../chunk-SMCACT4Z.js";
|
|
15
15
|
import "../chunk-DJWX3GVS.js";
|
|
16
16
|
import {
|
|
17
17
|
behavioralAnalyst,
|
|
@@ -34,7 +34,7 @@ import {
|
|
|
34
34
|
policyEditsFromFindings,
|
|
35
35
|
scorePolicyEditReadiness,
|
|
36
36
|
validatePolicyEdit
|
|
37
|
-
} from "../chunk-
|
|
37
|
+
} from "../chunk-LMSQ6EFA.js";
|
|
38
38
|
import {
|
|
39
39
|
ANALYST_SEVERITIES,
|
|
40
40
|
AnalystRegistry,
|
|
@@ -67,7 +67,7 @@ import {
|
|
|
67
67
|
} from "../chunk-45EEMHTC.js";
|
|
68
68
|
import "../chunk-YBIGNSCZ.js";
|
|
69
69
|
import "../chunk-PC4UYEBM.js";
|
|
70
|
-
import "../chunk-
|
|
70
|
+
import "../chunk-AGYDMORK.js";
|
|
71
71
|
import "../chunk-VSMTAMNK.js";
|
|
72
72
|
import "../chunk-3BFEG2F6.js";
|
|
73
73
|
import "../chunk-PZ5AY32C.js";
|
|
@@ -1,7 +1,7 @@
|
|
|
1
|
-
import { A as AnalystRegistry } from './default-registry-
|
|
1
|
+
import { A as AnalystRegistry } from './default-registry-Ez4cxuZ4.js';
|
|
2
2
|
import { a as DatasetScenario } from './dataset-BbGkaN2I.js';
|
|
3
|
-
import { R as RunRecord } from './run-record-
|
|
4
|
-
import { I as InsightReport } from './insight-report-
|
|
3
|
+
import { R as RunRecord } from './run-record-CPfd1ARZ.js';
|
|
4
|
+
import { I as InsightReport } from './insight-report-DumCfEur.js';
|
|
5
5
|
|
|
6
6
|
/**
|
|
7
7
|
* # `analyzeRuns()` — turn a set of agent runs into an actionable decision packet.
|
|
@@ -1,9 +1,9 @@
|
|
|
1
1
|
import { c as CalibrationReport } from '../calibration-BPmzuVPk.js';
|
|
2
2
|
import { O as OffPolicyEstimate, a as OffPolicyOptions, b as OffPolicyTrajectory } from '../off-policy-DiwuKKg7.js';
|
|
3
|
-
import { d as CodeAgentSessionSource, a as CodeAgentSessionIntakeOptions, c as CodeAgentSessionMetrics, C as CodeAgentSessionDiagnostic } from '../code-agent-session-
|
|
4
|
-
import { R as RunRecord, b as RunSplitTag } from '../run-record-
|
|
3
|
+
import { d as CodeAgentSessionSource, a as CodeAgentSessionIntakeOptions, c as CodeAgentSessionMetrics, C as CodeAgentSessionDiagnostic } from '../code-agent-session-Cen-qD2y.js';
|
|
4
|
+
import { R as RunRecord, b as RunSplitTag } from '../run-record-CPfd1ARZ.js';
|
|
5
5
|
import { T as TraceStore } from '../store-BcFXE6LG.js';
|
|
6
|
-
import { R as RuntimeTrajectoryRecord, P as ProjectRuntimeTrajectoryEvidenceOptions, a as RuntimeTrajectoryEvidenceProjection } from '../runtime-trajectory-
|
|
6
|
+
import { R as RuntimeTrajectoryRecord, P as ProjectRuntimeTrajectoryEvidenceOptions, a as RuntimeTrajectoryEvidenceProjection } from '../runtime-trajectory-DZ8ei-Jo.js';
|
|
7
7
|
import '../schema-m0gsnbt3.js';
|
|
8
8
|
import '../outcome-store-rnXLEqSn.js';
|
|
9
9
|
import '@tangle-network/agent-interface';
|
|
@@ -1,5 +1,5 @@
|
|
|
1
|
-
export { B as BENCHMARK_SPLIT_SEED, a as BenchmarkAdapter, b as BenchmarkDatasetItem, c as BenchmarkEvaluation, d as deterministicSplit, e as routing } from '../index-
|
|
2
|
-
import '../run-record-
|
|
1
|
+
export { B as BENCHMARK_SPLIT_SEED, a as BenchmarkAdapter, b as BenchmarkDatasetItem, c as BenchmarkEvaluation, d as deterministicSplit, e as routing } from '../index-unCSYRJJ.js';
|
|
2
|
+
import '../run-record-CPfd1ARZ.js';
|
|
3
3
|
import '@tangle-network/agent-interface';
|
|
4
4
|
import '../errors-CzMUYo7b.js';
|
|
5
5
|
import '../schema-m0gsnbt3.js';
|
|
@@ -5,10 +5,10 @@ import {
|
|
|
5
5
|
import {
|
|
6
6
|
pearsonR,
|
|
7
7
|
spearmanR
|
|
8
|
-
} from "../chunk-
|
|
8
|
+
} from "../chunk-HYGRFL7C.js";
|
|
9
9
|
import {
|
|
10
10
|
judgeSpans
|
|
11
|
-
} from "../chunk-
|
|
11
|
+
} from "../chunk-JZXGWLK5.js";
|
|
12
12
|
import "../chunk-5BKGXME7.js";
|
|
13
13
|
import {
|
|
14
14
|
TraceEmitter
|
package/dist/campaign/index.d.ts
CHANGED
|
@@ -1,19 +1,19 @@
|
|
|
1
|
-
import { S as SignedManifest, B as BackendIntegrityReport, C as CompletionRequirement, R as RuntimeEventLike, a as CompletionVerdict, P as ProducedState, b as CorrectnessChecker } from '../pre-registration-
|
|
2
|
-
export { L as LlmJudgeDimension, c as LlmJudgeOptions, l as llmJudge } from '../pre-registration-
|
|
1
|
+
import { S as SignedManifest, B as BackendIntegrityReport, C as CompletionRequirement, R as RuntimeEventLike, a as CompletionVerdict, P as ProducedState, b as CorrectnessChecker } from '../pre-registration-CUOSGAZK.js';
|
|
2
|
+
export { L as LlmJudgeDimension, c as LlmJudgeOptions, l as llmJudge } from '../pre-registration-CUOSGAZK.js';
|
|
3
3
|
import { A as AnalyzeTracesOptions, a as AnalyzeTracesInput, b as AnalyzeTracesResult } from '../analyst-C8HHvfJp.js';
|
|
4
|
-
import { S as Scenario, M as MutableSurface, b as DispatchContext, a as JudgeConfig, e as GenerationRecord, g as Gate, J as JudgeScore, L as LabeledScenarioStore, s as LabeledScenarioWrite, t as LabeledScenarioSampleArgs, u as LabeledScenarioRecord, v as LabelTrust, f as SurfaceProposer, w as ProposedCandidate, x as ProposeContext, y as LabeledScenarioSource, C as CampaignResult, o as CodeSurface } from '../types-
|
|
5
|
-
export { k as CampaignAggregates, l as CampaignArtifactWriter, m as CampaignCellResult, n as CampaignCostMeter, z as CampaignTokenUsage, d as CampaignTraceWriter, D as DispatchFn, h as GateContext, j as GateDecision, G as GateResult, p as GenerationCandidate, A as JudgeAggregate, c as JudgeDimension, i as Mutator, O as OptimizationProposer, q as OptimizerConfig, P as ParetoParent, R as RedactionStatus, B as ScenarioAggregate, r as SessionScript, T as TraceSpan, E as isProposedCandidate, F as labelTrustRank } from '../types-
|
|
6
|
-
import { e as CampaignRunPlan, P as PlanCampaignRunOptions, C as CampaignStorage, R as RunCampaignOptions, c as RunImprovementLoopOptions } from '../gepa-
|
|
7
|
-
export { h as CampaignRunPlanCell, j as GepaProposerConstraints, G as GepaProposerOptions, O as OpenAutoPrOptions, k as OpenAutoPrResult, b as RunImprovementLoopResult, a as RunOptimizationOptions, l as RunOptimizationResult, m as countSentenceEdits, n as defaultRenderDiff, o as extractH2Sections, f as fsCampaignStorage, g as gepaProposer, i as inMemoryCampaignStorage, p as openAutoPr, q as planCampaignRun, r as runCampaign, d as runImprovementLoop, s as runOptimization, t as surfaceHash } from '../gepa-
|
|
8
|
-
export { A as AxisEvidence, a as AxisVerdict, B as BuildEvidenceVectorOptions, k as BuildLoopProvenanceArgs, D as DefaultProductionGateOptions, l as EmitLoopProvenanceArgs, m as EmitLoopProvenanceResult, E as EvidenceVector, b as EvolutionaryProposerOptions, H as HeldOutGateOptions, n as LoopProvenanceBackend, o as LoopProvenanceCandidate, L as LoopProvenanceRecord, O as ObjectiveSource, P as ParetoSignificanceGateOptions, c as PromotionObjective, d as PromotionPolicy, R as RunEvalOptions, e as buildEvidenceVector, q as buildLoopProvenanceRecord, f as composeGate, g as defaultProductionGate, s as emitLoopProvenance, h as evolutionaryProposer, i as heldOutGate, t as loopProvenanceSpans, p as paretoPolicy, j as paretoSignificanceGate, u as provenanceRecordPath, v as provenanceSpansPath, r as runEval, w as surfaceContentHash } from '../provenance-
|
|
9
|
-
import { E as EProcessState, a as PairedBootstrapResult } from '../statistics-
|
|
4
|
+
import { S as Scenario, M as MutableSurface, b as DispatchContext, a as JudgeConfig, e as GenerationRecord, g as Gate, J as JudgeScore, L as LabeledScenarioStore, s as LabeledScenarioWrite, t as LabeledScenarioSampleArgs, u as LabeledScenarioRecord, v as LabelTrust, f as SurfaceProposer, w as ProposedCandidate, x as ProposeContext, y as LabeledScenarioSource, C as CampaignResult, o as CodeSurface } from '../types-Bihq6-a3.js';
|
|
5
|
+
export { k as CampaignAggregates, l as CampaignArtifactWriter, m as CampaignCellResult, n as CampaignCostMeter, z as CampaignTokenUsage, d as CampaignTraceWriter, D as DispatchFn, h as GateContext, j as GateDecision, G as GateResult, p as GenerationCandidate, A as JudgeAggregate, c as JudgeDimension, i as Mutator, O as OptimizationProposer, q as OptimizerConfig, P as ParetoParent, R as RedactionStatus, B as ScenarioAggregate, r as SessionScript, T as TraceSpan, E as isProposedCandidate, F as labelTrustRank } from '../types-Bihq6-a3.js';
|
|
6
|
+
import { e as CampaignRunPlan, P as PlanCampaignRunOptions, C as CampaignStorage, R as RunCampaignOptions, c as RunImprovementLoopOptions } from '../gepa-COlCAkHN.js';
|
|
7
|
+
export { h as CampaignRunPlanCell, j as GepaProposerConstraints, G as GepaProposerOptions, O as OpenAutoPrOptions, k as OpenAutoPrResult, b as RunImprovementLoopResult, a as RunOptimizationOptions, l as RunOptimizationResult, m as countSentenceEdits, n as defaultRenderDiff, o as extractH2Sections, f as fsCampaignStorage, g as gepaProposer, i as inMemoryCampaignStorage, p as openAutoPr, q as planCampaignRun, r as runCampaign, d as runImprovementLoop, s as runOptimization, t as surfaceHash } from '../gepa-COlCAkHN.js';
|
|
8
|
+
export { A as AxisEvidence, a as AxisVerdict, B as BuildEvidenceVectorOptions, k as BuildLoopProvenanceArgs, D as DefaultProductionGateOptions, l as EmitLoopProvenanceArgs, m as EmitLoopProvenanceResult, E as EvidenceVector, b as EvolutionaryProposerOptions, H as HeldOutGateOptions, n as LoopProvenanceBackend, o as LoopProvenanceCandidate, L as LoopProvenanceRecord, O as ObjectiveSource, P as ParetoSignificanceGateOptions, c as PromotionObjective, d as PromotionPolicy, R as RunEvalOptions, e as buildEvidenceVector, q as buildLoopProvenanceRecord, f as composeGate, g as defaultProductionGate, s as emitLoopProvenance, h as evolutionaryProposer, i as heldOutGate, t as loopProvenanceSpans, p as paretoPolicy, j as paretoSignificanceGate, u as provenanceRecordPath, v as provenanceSpansPath, r as runEval, w as surfaceContentHash } from '../provenance-B2VsP0jP.js';
|
|
9
|
+
import { E as EProcessState, a as PairedBootstrapResult } from '../statistics-D88peojY.js';
|
|
10
10
|
import { L as LlmClientOptions } from '../llm-client-Bj7g0rqu.js';
|
|
11
11
|
import { AgentProfile } from '@tangle-network/agent-interface';
|
|
12
12
|
import { A as AgentEvalError } from '../errors-CzMUYo7b.js';
|
|
13
|
-
import { b as RunSplitTag, R as RunRecord } from '../run-record-
|
|
14
|
-
import { b as PolicyEdit, F as FindingToPolicyEditOptions, d as PolicyEditAdmissionOptions, c as PolicyEditAdmission } from '../policy-edit-
|
|
15
|
-
import { T as TraceAnalystKindSpec } from '../kind-factory-
|
|
16
|
-
import { A as AnalystFinding } from '../types-
|
|
13
|
+
import { b as RunSplitTag, R as RunRecord } from '../run-record-CPfd1ARZ.js';
|
|
14
|
+
import { b as PolicyEdit, F as FindingToPolicyEditOptions, d as PolicyEditAdmissionOptions, c as PolicyEditAdmission } from '../policy-edit-nUhuFtLF.js';
|
|
15
|
+
import { T as TraceAnalystKindSpec } from '../kind-factory-BLHxwX71.js';
|
|
16
|
+
import { A as AnalystFinding } from '../types-DA9yj-Jd.js';
|
|
17
17
|
import '@tangle-network/tcloud';
|
|
18
18
|
import '../raw-provider-sink-C46HDghv.js';
|
|
19
19
|
import '../verdict-C9MlYujm.js';
|
|
@@ -25,10 +25,10 @@ import '../store-BcFXE6LG.js';
|
|
|
25
25
|
import '../schema-m0gsnbt3.js';
|
|
26
26
|
import '../pareto-E-pembql.js';
|
|
27
27
|
import '../hosted/index.js';
|
|
28
|
-
import '../insight-report-
|
|
29
|
-
import '../summary-report-
|
|
28
|
+
import '../insight-report-DumCfEur.js';
|
|
29
|
+
import '../summary-report-Fc_YFJat.js';
|
|
30
30
|
import '../failure-cluster-DH9Flgcf.js';
|
|
31
|
-
import '../judge-calibration-
|
|
31
|
+
import '../judge-calibration-7C-IDmKr.js';
|
|
32
32
|
import '../types-C7DGg5ex.js';
|
|
33
33
|
import 'zod';
|
|
34
34
|
|
|
@@ -583,6 +583,9 @@ interface FapoProposerOptions<TFindings = unknown> {
|
|
|
583
583
|
}
|
|
584
584
|
/** Build a FAPO policy proposer from level-specific candidate generators. */
|
|
585
585
|
declare function fapoProposer<TFindings = unknown>(opts: FapoProposerOptions<TFindings>): SurfaceProposer<TFindings>;
|
|
586
|
+
/**
|
|
587
|
+
* Scan a findings array and extract FAPO attribution signals — per-level counts and failure clusters used to decide which optimization level to escalate to next.
|
|
588
|
+
*/
|
|
586
589
|
declare function extractFapoAttributionSignals(findings: readonly unknown[]): FapoAttributionSignals;
|
|
587
590
|
type JsonPrimitive = string | number | boolean | null;
|
|
588
591
|
type JsonValue = JsonPrimitive | JsonValue[] | {
|
|
@@ -687,6 +690,9 @@ interface CompareProposersOptions<TScenario extends Scenario, TArtifact> extends
|
|
|
687
690
|
/** CI confidence. Default 0.95. */
|
|
688
691
|
confidence?: number;
|
|
689
692
|
}
|
|
693
|
+
/**
|
|
694
|
+
* Run a head-to-head lift benchmark across surface proposers on a shared holdout, returning per-proposer lift CIs and pairwise "who wins" verdicts.
|
|
695
|
+
*/
|
|
690
696
|
declare function compareProposers<TScenario extends Scenario, TArtifact>(opts: CompareProposersOptions<TScenario, TArtifact>): Promise<ProposerComparison>;
|
|
691
697
|
/** Shared corpus + transport for the three built-in optimizer entries. */
|
|
692
698
|
interface OptimizerEntryConfig<TScenario extends Scenario, TArtifact> {
|
|
@@ -750,6 +756,9 @@ interface FapoEntryConfig<TScenario extends Scenario, TArtifact> extends Optimiz
|
|
|
750
756
|
/** FAPO policy knobs: scope, reviewer, plateau thresholds. */
|
|
751
757
|
fapo?: Omit<FapoProposerOptions, 'proposers' | 'promptProposer' | 'parameterProposer' | 'structuralProposer'>;
|
|
752
758
|
}
|
|
759
|
+
/**
|
|
760
|
+
* Build a `ProposerEntry` that runs the full FAPO escalation policy (prompt → parameter → structural) as a single comparable optimizer entry.
|
|
761
|
+
*/
|
|
753
762
|
declare function fapoEscalationEntry<TScenario extends Scenario, TArtifact>(config: FapoEntryConfig<TScenario, TArtifact>, name?: string): ProposerEntry;
|
|
754
763
|
|
|
755
764
|
/**
|
|
@@ -896,6 +905,9 @@ interface RunProfileMatrixResult<TArtifact, TScenario extends Scenario> {
|
|
|
896
905
|
/** The raw per-profile campaign results, keyed by profile id. */
|
|
897
906
|
campaigns: Record<string, CampaignResult<TArtifact, TScenario>>;
|
|
898
907
|
}
|
|
908
|
+
/**
|
|
909
|
+
* Profile × scenario matrix runner: fan N agent profiles across M scenarios, project each cell to a validated `RunRecord` with real token usage, and enforce the backend-integrity guard before returning.
|
|
910
|
+
*/
|
|
899
911
|
declare function runProfileMatrix<TScenario extends Scenario, TArtifact>(opts: RunProfileMatrixOptions<TScenario, TArtifact>): Promise<RunProfileMatrixResult<TArtifact, TScenario>>;
|
|
900
912
|
|
|
901
913
|
/**
|
|
@@ -1151,6 +1163,9 @@ interface SkillOptProposer extends SurfaceProposer {
|
|
|
1151
1163
|
* acceptance/budget/buffer). Returns structured patches, NOT surfaces. */
|
|
1152
1164
|
proposePatches(args: ProposePatchesArgs): Promise<SkillPatch[]>;
|
|
1153
1165
|
}
|
|
1166
|
+
/**
|
|
1167
|
+
* SkillOpt proposer: proposes bounded, anchored patch operations (add/delete/replace) on a skill document, conforming to both the patch-native `SkillOptProposer` and the generic `SurfaceProposer` interfaces.
|
|
1168
|
+
*/
|
|
1154
1169
|
declare function skillOptProposer(opts: SkillOptProposerOptions): SkillOptProposer;
|
|
1155
1170
|
/** Parse + validate the patch response. Throws `SkillPatchParseError` when the
|
|
1156
1171
|
* response is not valid JSON at all (a router/model failure the caller must
|
|
@@ -1160,6 +1175,9 @@ declare function skillOptProposer(opts: SkillOptProposerOptions): SkillOptPropos
|
|
|
1160
1175
|
declare class SkillPatchParseError extends Error {
|
|
1161
1176
|
constructor(message: string);
|
|
1162
1177
|
}
|
|
1178
|
+
/**
|
|
1179
|
+
* Parse a SkillOpt LLM response into validated `SkillPatch` objects, throwing `SkillPatchParseError` on malformed JSON and silently dropping ops that violate the edit budget.
|
|
1180
|
+
*/
|
|
1163
1181
|
declare function parseSkillPatchResponse(raw: string, maxPatches: number, editBudget: number): SkillPatch[];
|
|
1164
1182
|
|
|
1165
1183
|
/**
|
|
@@ -1254,6 +1272,9 @@ interface RunSkillOptResult {
|
|
|
1254
1272
|
* acceptance) the hill-climb ran. */
|
|
1255
1273
|
totalCostUsd: number;
|
|
1256
1274
|
}
|
|
1275
|
+
/**
|
|
1276
|
+
* SkillOpt sequential hill-climb: each epoch reflects on train-scenario weaknesses, proposes bounded patches, accepts the first patch that strictly improves the held-out composite, and anneals the edit budget on consecutive rejections.
|
|
1277
|
+
*/
|
|
1257
1278
|
declare function runSkillOpt<TScenario extends Scenario, TArtifact>(opts: RunSkillOptOptions<TScenario, TArtifact>): Promise<RunSkillOptResult>;
|
|
1258
1279
|
|
|
1259
1280
|
/**
|
|
@@ -1287,6 +1308,9 @@ interface AceProposerOptions {
|
|
|
1287
1308
|
/** Heading rendered above the bullets inside the block. */
|
|
1288
1309
|
sectionHeading?: string;
|
|
1289
1310
|
}
|
|
1311
|
+
/**
|
|
1312
|
+
* Append-only context engineering proposer: grows a skill playbook by appending generation-tagged lessons without merging or overwriting prior entries.
|
|
1313
|
+
*/
|
|
1290
1314
|
declare function aceProposer(opts?: AceProposerOptions): SurfaceProposer;
|
|
1291
1315
|
|
|
1292
1316
|
/**
|
|
@@ -1531,6 +1555,9 @@ interface GitWorktreeAdapterOptions {
|
|
|
1531
1555
|
/** Test seam — defaults to a real `git` runner. */
|
|
1532
1556
|
git?: (args: string[], cwd: string) => string;
|
|
1533
1557
|
}
|
|
1558
|
+
/**
|
|
1559
|
+
* Git-backed `WorktreeAdapter`: creates isolated worktrees on fresh branches, commits agent changes, and discards losers.
|
|
1560
|
+
*/
|
|
1534
1561
|
declare function gitWorktreeAdapter(opts: GitWorktreeAdapterOptions): WorktreeAdapter;
|
|
1535
1562
|
/** Resolve a `CodeSurface`'s worktreeRef to a directory the measurement can
|
|
1536
1563
|
* run the worker in. A path ref is returned as-is; anything else is treated
|
package/dist/campaign/index.js
CHANGED
|
@@ -10,7 +10,7 @@ import {
|
|
|
10
10
|
paretoPolicy,
|
|
11
11
|
paretoSignificanceGate,
|
|
12
12
|
runEval
|
|
13
|
-
} from "../chunk-
|
|
13
|
+
} from "../chunk-66T25VWE.js";
|
|
14
14
|
import {
|
|
15
15
|
HARNESS_NATIVE_MODEL,
|
|
16
16
|
agentProfileHash,
|
|
@@ -20,7 +20,7 @@ import {
|
|
|
20
20
|
harnessAxisOf,
|
|
21
21
|
llmJudge,
|
|
22
22
|
verifyCompletion
|
|
23
|
-
} from "../chunk-
|
|
23
|
+
} from "../chunk-YFYIOSNV.js";
|
|
24
24
|
import {
|
|
25
25
|
buildLoopProvenanceRecord,
|
|
26
26
|
campaignBreakdown,
|
|
@@ -42,7 +42,7 @@ import {
|
|
|
42
42
|
runOptimization,
|
|
43
43
|
surfaceContentHash,
|
|
44
44
|
surfaceHash
|
|
45
|
-
} from "../chunk-
|
|
45
|
+
} from "../chunk-2B4HPFXN.js";
|
|
46
46
|
import {
|
|
47
47
|
assertRealBackend,
|
|
48
48
|
contentHash,
|
|
@@ -53,7 +53,7 @@ import {
|
|
|
53
53
|
runCampaign,
|
|
54
54
|
summarizeBackendIntegrity,
|
|
55
55
|
tangleTracesRoot
|
|
56
|
-
} from "../chunk-
|
|
56
|
+
} from "../chunk-VNM52AGA.js";
|
|
57
57
|
import {
|
|
58
58
|
estimateCost,
|
|
59
59
|
isModelPriced
|
|
@@ -63,13 +63,13 @@ import {
|
|
|
63
63
|
applyPolicyEditToSurface,
|
|
64
64
|
isPolicyEdit,
|
|
65
65
|
policyEditsFromFindings
|
|
66
|
-
} from "../chunk-
|
|
66
|
+
} from "../chunk-LMSQ6EFA.js";
|
|
67
67
|
import {
|
|
68
68
|
AnalystRegistry,
|
|
69
69
|
DEFAULT_TRACE_ANALYST_KINDS,
|
|
70
70
|
createTraceAnalystKind
|
|
71
71
|
} from "../chunk-FRI6RG3P.js";
|
|
72
|
-
import "../chunk-
|
|
72
|
+
import "../chunk-LOZOZYHU.js";
|
|
73
73
|
import {
|
|
74
74
|
callLlm
|
|
75
75
|
} from "../chunk-CWNP4DV4.js";
|
|
@@ -78,7 +78,7 @@ import {
|
|
|
78
78
|
eProcess,
|
|
79
79
|
mulberry32,
|
|
80
80
|
pairedBootstrap
|
|
81
|
-
} from "../chunk-
|
|
81
|
+
} from "../chunk-HYGRFL7C.js";
|
|
82
82
|
import {
|
|
83
83
|
analyzeTraces
|
|
84
84
|
} from "../chunk-2MLIEQSN.js";
|
|
@@ -90,10 +90,10 @@ import "../chunk-PC4UYEBM.js";
|
|
|
90
90
|
import {
|
|
91
91
|
modelHasSnapshot,
|
|
92
92
|
validateRunRecord
|
|
93
|
-
} from "../chunk-
|
|
93
|
+
} from "../chunk-J5MUFXEY.js";
|
|
94
94
|
import {
|
|
95
95
|
buildAgentProfileCell
|
|
96
|
-
} from "../chunk-
|
|
96
|
+
} from "../chunk-AGYDMORK.js";
|
|
97
97
|
import {
|
|
98
98
|
canonicalize
|
|
99
99
|
} from "../chunk-VSMTAMNK.js";
|