@tangle-network/agent-eval 0.102.1 → 0.103.1
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/dist/adapters/http.d.ts +2 -2
- package/dist/adapters/langchain.d.ts +2 -2
- package/dist/adapters/otel.d.ts +5 -5
- package/dist/analyst/index.d.ts +9 -9
- package/dist/analyst/index.js +3 -3
- package/dist/{analyze-runs-Cd-A_K4l.d.ts → analyze-runs-rF2eGxZ_.d.ts} +3 -3
- package/dist/belief-state/index.d.ts +3 -3
- package/dist/belief-state/index.js +1 -1
- package/dist/benchmarks/index.d.ts +2 -2
- package/dist/builder-eval/index.js +2 -2
- package/dist/campaign/index.d.ts +43 -16
- package/dist/campaign/index.js +9 -9
- package/dist/campaign/index.js.map +1 -1
- package/dist/{chunk-Z3FLN24V.js → chunk-2B4HPFXN.js} +104 -43
- package/dist/chunk-2B4HPFXN.js.map +1 -0
- package/dist/{chunk-7RBJANJD.js → chunk-3722PKPB.js} +2 -2
- package/dist/{chunk-YLKDN7JV.js → chunk-66T25VWE.js} +5 -5
- package/dist/chunk-66T25VWE.js.map +1 -0
- package/dist/{chunk-6FIAJHCU.js → chunk-6YVAN6R3.js} +4 -4
- package/dist/{chunk-ABOIVNXL.js → chunk-AGYDMORK.js} +1 -1
- package/dist/chunk-AGYDMORK.js.map +1 -0
- package/dist/{chunk-B2TMQM62.js → chunk-BHCFJGL4.js} +2 -2
- package/dist/{chunk-IH7LYRHL.js → chunk-BXZVBX3D.js} +3 -3
- package/dist/{chunk-6GT4NI4V.js → chunk-CLS3374R.js} +2 -2
- package/dist/{chunk-HRGUJTER.js → chunk-HYGRFL7C.js} +1 -1
- package/dist/{chunk-HRGUJTER.js.map → chunk-HYGRFL7C.js.map} +1 -1
- package/dist/{chunk-2NSLDY4B.js → chunk-J5MUFXEY.js} +2 -2
- package/dist/{chunk-UFSG7ACU.js → chunk-JZXGWLK5.js} +1 -1
- package/dist/chunk-JZXGWLK5.js.map +1 -0
- package/dist/{chunk-IN3SHQML.js → chunk-LMSQ6EFA.js} +2 -2
- package/dist/{chunk-AIGWQEME.js → chunk-LOZOZYHU.js} +2 -2
- package/dist/{chunk-NF7OZ4J7.js → chunk-QCBB6ZIU.js} +2 -2
- package/dist/chunk-RQNOLV3I.js +855 -0
- package/dist/chunk-RQNOLV3I.js.map +1 -0
- package/dist/{chunk-JU6ZX3CX.js → chunk-SMCACT4Z.js} +2 -2
- package/dist/{chunk-6Q2DYRWV.js → chunk-TCPP4Z5Q.js} +5 -5
- package/dist/{chunk-VDGPPGE3.js → chunk-UMEAR2FI.js} +2 -2
- package/dist/{chunk-VDGPPGE3.js.map → chunk-UMEAR2FI.js.map} +1 -1
- package/dist/{chunk-QIT2XZ4E.js → chunk-VNM52AGA.js} +3 -3
- package/dist/chunk-VNM52AGA.js.map +1 -0
- package/dist/{chunk-CMJSTXUR.js → chunk-YFYIOSNV.js} +107 -20
- package/dist/chunk-YFYIOSNV.js.map +1 -0
- package/dist/{code-agent-session-Ce-9u7YM.d.ts → code-agent-session-Cen-qD2y.d.ts} +1 -1
- package/dist/contract/index.d.ts +18 -18
- package/dist/contract/index.js +10 -10
- package/dist/{control-C8RmK9H4.d.ts → control-KofK3gfG.d.ts} +1 -1
- package/dist/control.d.ts +2 -2
- package/dist/control.js +3 -3
- package/dist/{corpus-CiSzzLa5.d.ts → corpus-CysLCiK4.d.ts} +1 -1
- package/dist/{default-registry-ZhqsTr4K.d.ts → default-registry-Ez4cxuZ4.d.ts} +2 -2
- package/dist/diagnose.d.ts +3 -3
- package/dist/diagnose.js +3 -3
- package/dist/{gepa-DeyPTlvx.d.ts → gepa-COlCAkHN.d.ts} +22 -1
- package/dist/governance/index.d.ts +1 -1
- package/dist/hosted/index.d.ts +5 -5
- package/dist/{index-B-bFgiAF.d.ts → index-unCSYRJJ.d.ts} +1 -1
- package/dist/index.d.ts +36 -28
- package/dist/index.js +32 -18
- package/dist/index.js.map +1 -1
- package/dist/{insight-report-k0sRTzKg.d.ts → insight-report-DumCfEur.d.ts} +2 -2
- package/dist/{judge-calibration-0p2QcWNE.d.ts → judge-calibration-7C-IDmKr.d.ts} +3 -0
- package/dist/{kind-factory-D0nk7AKV.d.ts → kind-factory-BLHxwX71.d.ts} +1 -1
- package/dist/meta-eval/index.d.ts +4 -4
- package/dist/meta-eval/index.js +3 -3
- package/dist/{multi-layer-verifier-DUZXrPDA.d.ts → multi-layer-verifier-CI4jdX-q.d.ts} +3 -0
- package/dist/multishot/index.d.ts +2 -2
- package/dist/openapi.json +1 -1
- package/dist/pipelines/index.d.ts +1 -1
- package/dist/pipelines/index.js +3 -3
- package/dist/{policy-edit-BDQzzsBU.d.ts → policy-edit-nUhuFtLF.d.ts} +2 -2
- package/dist/{pre-registration-Dzg61IQA.d.ts → pre-registration-CUOSGAZK.d.ts} +45 -12
- package/dist/product-benchmark/index.d.ts +104 -1
- package/dist/product-benchmark/index.js +15 -1
- package/dist/{provenance-BhJm32vN.d.ts → provenance-B2VsP0jP.d.ts} +20 -4
- package/dist/{query-B7GGjRox.d.ts → query-0aTmbmQe.d.ts} +1 -0
- package/dist/{release-report-BQ1Ziyu-.d.ts → release-report-DkaCZ9k4.d.ts} +5 -2
- package/dist/reporting.d.ts +6 -6
- package/dist/reporting.js +4 -4
- package/dist/{researcher-B_ODTAJs.d.ts → researcher-SDAezfML.d.ts} +2 -2
- package/dist/rl.d.ts +9 -9
- package/dist/rl.js +7 -7
- package/dist/{rubric-predictive-validity-0MdjTt8R.d.ts → rubric-predictive-validity-ZGIlJNce.d.ts} +1 -1
- package/dist/{run-campaign-3NWW5PLF.js → run-campaign-DAHKO5CT.js} +3 -3
- package/dist/{run-record-MRdJ-Kq2.d.ts → run-record-CPfd1ARZ.d.ts} +3 -0
- package/dist/{runtime-trajectory-8w0_jmtR.d.ts → runtime-trajectory-DZ8ei-Jo.d.ts} +1 -1
- package/dist/{semantic-concept-judge-D-IlH5v1.d.ts → semantic-concept-judge-C6mDEBIo.d.ts} +3 -3
- package/dist/{statistics-xP-cWc5k.d.ts → statistics-D88peojY.d.ts} +1 -1
- package/dist/{summary-report-C0nnxOD8.d.ts → summary-report-Fc_YFJat.d.ts} +1 -1
- package/dist/traces.d.ts +2 -2
- package/dist/traces.js +4 -4
- package/dist/{types-DFI_Z-ZL.d.ts → types-Bihq6-a3.d.ts} +1 -1
- package/dist/{types-Dz9cKF0g.d.ts → types-DA9yj-Jd.d.ts} +1 -1
- package/dist/workflow/index.d.ts +7 -7
- package/dist/workflow/index.js +3 -3
- package/package.json +1 -1
- package/dist/chunk-63MBSQTX.js +0 -350
- package/dist/chunk-63MBSQTX.js.map +0 -1
- package/dist/chunk-ABOIVNXL.js.map +0 -1
- package/dist/chunk-CMJSTXUR.js.map +0 -1
- package/dist/chunk-QIT2XZ4E.js.map +0 -1
- package/dist/chunk-UFSG7ACU.js.map +0 -1
- package/dist/chunk-YLKDN7JV.js.map +0 -1
- package/dist/chunk-Z3FLN24V.js.map +0 -1
- /package/dist/{chunk-7RBJANJD.js.map → chunk-3722PKPB.js.map} +0 -0
- /package/dist/{chunk-6FIAJHCU.js.map → chunk-6YVAN6R3.js.map} +0 -0
- /package/dist/{chunk-B2TMQM62.js.map → chunk-BHCFJGL4.js.map} +0 -0
- /package/dist/{chunk-IH7LYRHL.js.map → chunk-BXZVBX3D.js.map} +0 -0
- /package/dist/{chunk-6GT4NI4V.js.map → chunk-CLS3374R.js.map} +0 -0
- /package/dist/{chunk-2NSLDY4B.js.map → chunk-J5MUFXEY.js.map} +0 -0
- /package/dist/{chunk-IN3SHQML.js.map → chunk-LMSQ6EFA.js.map} +0 -0
- /package/dist/{chunk-AIGWQEME.js.map → chunk-LOZOZYHU.js.map} +0 -0
- /package/dist/{chunk-NF7OZ4J7.js.map → chunk-QCBB6ZIU.js.map} +0 -0
- /package/dist/{chunk-JU6ZX3CX.js.map → chunk-SMCACT4Z.js.map} +0 -0
- /package/dist/{chunk-6Q2DYRWV.js.map → chunk-TCPP4Z5Q.js.map} +0 -0
- /package/dist/{run-campaign-3NWW5PLF.js.map → run-campaign-DAHKO5CT.js.map} +0 -0
package/dist/adapters/http.d.ts
CHANGED
|
@@ -1,5 +1,5 @@
|
|
|
1
|
-
import { S as Scenario, D as DispatchFn, b as DispatchContext } from '../types-
|
|
2
|
-
import '../run-record-
|
|
1
|
+
import { S as Scenario, D as DispatchFn, b as DispatchContext } from '../types-Bihq6-a3.js';
|
|
2
|
+
import '../run-record-CPfd1ARZ.js';
|
|
3
3
|
import '@tangle-network/agent-interface';
|
|
4
4
|
import '../errors-CzMUYo7b.js';
|
|
5
5
|
import '../schema-m0gsnbt3.js';
|
|
@@ -1,5 +1,5 @@
|
|
|
1
|
-
import { S as Scenario, J as JudgeScore, D as DispatchFn, a as JudgeConfig } from '../types-
|
|
2
|
-
import '../run-record-
|
|
1
|
+
import { S as Scenario, J as JudgeScore, D as DispatchFn, a as JudgeConfig } from '../types-Bihq6-a3.js';
|
|
2
|
+
import '../run-record-CPfd1ARZ.js';
|
|
3
3
|
import '@tangle-network/agent-interface';
|
|
4
4
|
import '../errors-CzMUYo7b.js';
|
|
5
5
|
import '../schema-m0gsnbt3.js';
|
package/dist/adapters/otel.d.ts
CHANGED
|
@@ -1,14 +1,14 @@
|
|
|
1
1
|
import { TraceSpanEvent, HostedClient } from '../hosted/index.js';
|
|
2
|
-
import '../types-
|
|
3
|
-
import '../run-record-
|
|
2
|
+
import '../types-Bihq6-a3.js';
|
|
3
|
+
import '../run-record-CPfd1ARZ.js';
|
|
4
4
|
import '@tangle-network/agent-interface';
|
|
5
5
|
import '../errors-CzMUYo7b.js';
|
|
6
6
|
import '../schema-m0gsnbt3.js';
|
|
7
|
-
import '../insight-report-
|
|
8
|
-
import '../summary-report-
|
|
7
|
+
import '../insight-report-DumCfEur.js';
|
|
8
|
+
import '../summary-report-Fc_YFJat.js';
|
|
9
9
|
import '../failure-cluster-DH9Flgcf.js';
|
|
10
10
|
import '../store-BcFXE6LG.js';
|
|
11
|
-
import '../judge-calibration-
|
|
11
|
+
import '../judge-calibration-7C-IDmKr.js';
|
|
12
12
|
|
|
13
13
|
/**
|
|
14
14
|
* # `@tangle-network/agent-eval/adapters/otel` — OTel→hosted bridge.
|
package/dist/analyst/index.d.ts
CHANGED
|
@@ -1,22 +1,22 @@
|
|
|
1
|
-
import { M as MultiLayerVerifier, V as VerifyOptions, S as Severity } from '../multi-layer-verifier-
|
|
1
|
+
import { M as MultiLayerVerifier, V as VerifyOptions, S as Severity } from '../multi-layer-verifier-CI4jdX-q.js';
|
|
2
2
|
import { c as RunCritic, a as RunTrace } from '../run-critic-CmMf05uV.js';
|
|
3
|
-
import { S as SemanticConceptJudgeOptions, a as SemanticConceptJudgeInput, B as BehavioralMetrics } from '../semantic-concept-judge-
|
|
4
|
-
export { C as CreateAnalystAiConfig, D as DEFAULT_TRACE_ANALYST_KINDS, b as DiffPolicy, F as FAILURE_MODE_KIND_SPEC, c as FINDING_SUBJECT_GRAMMAR_PROMPT, d as FINDING_SUBJECT_KINDS, e as FindingSubject, f as FindingSubjectKind, g as FindingSubjectStringSchema, h as FindingsDiff, i as FindingsStore, I as IMPROVEMENT_KIND_SPEC, K as KIND_EXPECTED_SUBJECTS, j as KNOWLEDGE_GAP_KIND_SPEC, k as KNOWLEDGE_POISONING_KIND_SPEC, P as PersistedFinding, l as SKILL_USAGE_ANALYST, m as SkillUsageAnalyst, n as SkillUsageRecord, o as SkillUsageReport, p as SkillUsageScanConfig, q as buildSkillUsageReport, r as createAnalystAi, s as defaultIsMaterial, t as diffFindings, u as emitSkillUsageFindings, v as parseFindingSubject, w as renderFindingSubject } from '../semantic-concept-judge-
|
|
3
|
+
import { S as SemanticConceptJudgeOptions, a as SemanticConceptJudgeInput, B as BehavioralMetrics } from '../semantic-concept-judge-C6mDEBIo.js';
|
|
4
|
+
export { C as CreateAnalystAiConfig, D as DEFAULT_TRACE_ANALYST_KINDS, b as DiffPolicy, F as FAILURE_MODE_KIND_SPEC, c as FINDING_SUBJECT_GRAMMAR_PROMPT, d as FINDING_SUBJECT_KINDS, e as FindingSubject, f as FindingSubjectKind, g as FindingSubjectStringSchema, h as FindingsDiff, i as FindingsStore, I as IMPROVEMENT_KIND_SPEC, K as KIND_EXPECTED_SUBJECTS, j as KNOWLEDGE_GAP_KIND_SPEC, k as KNOWLEDGE_POISONING_KIND_SPEC, P as PersistedFinding, l as SKILL_USAGE_ANALYST, m as SkillUsageAnalyst, n as SkillUsageRecord, o as SkillUsageReport, p as SkillUsageScanConfig, q as buildSkillUsageReport, r as createAnalystAi, s as defaultIsMaterial, t as diffFindings, u as emitSkillUsageFindings, v as parseFindingSubject, w as renderFindingSubject } from '../semantic-concept-judge-C6mDEBIo.js';
|
|
5
5
|
import { b as JudgeFn, a as JudgeInput } from '../types-C7DGg5ex.js';
|
|
6
|
-
import { a as Analyst, h as AnalystSeverity, A as AnalystFinding } from '../types-
|
|
7
|
-
export { b as AnalystContext, g as AnalystCost, i as AnalystInputKind, j as AnalystRequirements, f as AnalystRunEvent, e as AnalystRunInputs, d as AnalystRunResult, c as AnalystRunSummary, k as ChatCallOpts, C as ChatClient, l as ChatRequest, m as ChatResponse, n as ChatTransport, o as CliBridgeTransportOpts, p as CreateChatClientOpts, D as DirectProviderTransportOpts, E as EvidenceRef, M as MockTransportOpts, R as RouterTransportOpts, S as SandboxSdkTransportOpts, q as computeFindingId, r as createChatClient, s as makeFinding } from '../types-
|
|
6
|
+
import { a as Analyst, h as AnalystSeverity, A as AnalystFinding } from '../types-DA9yj-Jd.js';
|
|
7
|
+
export { b as AnalystContext, g as AnalystCost, i as AnalystInputKind, j as AnalystRequirements, f as AnalystRunEvent, e as AnalystRunInputs, d as AnalystRunResult, c as AnalystRunSummary, k as ChatCallOpts, C as ChatClient, l as ChatRequest, m as ChatResponse, n as ChatTransport, o as CliBridgeTransportOpts, p as CreateChatClientOpts, D as DirectProviderTransportOpts, E as EvidenceRef, M as MockTransportOpts, R as RouterTransportOpts, S as SandboxSdkTransportOpts, q as computeFindingId, r as createChatClient, s as makeFinding } from '../types-DA9yj-Jd.js';
|
|
8
8
|
import { TCloud } from '@tangle-network/tcloud';
|
|
9
9
|
import { T as TraceAnalysisStore } from '../store-C1YxJDEK.js';
|
|
10
|
-
export { a as AnalystHooks, A as AnalystRegistry, b as AnalystRegistryOptions, B as BudgetPolicy, D as DefaultAnalystRegistryOptions, R as RegistryRunOpts, c as buildDefaultAnalystRegistry } from '../default-registry-
|
|
11
|
-
export { A as ANALYST_SEVERITIES, C as CreateTraceAnalystKindOpts, R as RAW_FINDING_SCHEMA_PROMPT, a as RawAnalystFinding, b as RawAnalystFindingSchema, c as TraceAnalystGolden, T as TraceAnalystKindSpec, d as createTraceAnalystKind, p as parseRawFinding, r as renderPriorFindings } from '../kind-factory-
|
|
12
|
-
export { F as FindingToPolicyEditOptions, P as POLICY_EDIT_AXES, a as POLICY_EDIT_TARGET_SURFACES, b as PolicyEdit, c as PolicyEditAdmission, d as PolicyEditAdmissionOptions, e as PolicyEditAxis, f as PolicyEditChange, g as PolicyEditExpectedGain, h as PolicyEditGainDirection, i as PolicyEditGainUnit, j as PolicyEditInit, k as PolicyEditRisk, l as PolicyEditSchemaVersion, m as PolicyEditSource, n as PolicyEditTarget, o as PolicyEditTargetSurface, p as PolicyEditValidationError, q as admitPolicyEdit, r as applyPolicyEditToSurface, s as computePolicyEditId, t as isPolicyEdit, u as makePolicyEdit, v as policyEditFromFinding, w as policyEditsFromFindings, x as scorePolicyEditReadiness, y as validatePolicyEdit } from '../policy-edit-
|
|
10
|
+
export { a as AnalystHooks, A as AnalystRegistry, b as AnalystRegistryOptions, B as BudgetPolicy, D as DefaultAnalystRegistryOptions, R as RegistryRunOpts, c as buildDefaultAnalystRegistry } from '../default-registry-Ez4cxuZ4.js';
|
|
11
|
+
export { A as ANALYST_SEVERITIES, C as CreateTraceAnalystKindOpts, R as RAW_FINDING_SCHEMA_PROMPT, a as RawAnalystFinding, b as RawAnalystFindingSchema, c as TraceAnalystGolden, T as TraceAnalystKindSpec, d as createTraceAnalystKind, p as parseRawFinding, r as renderPriorFindings } from '../kind-factory-BLHxwX71.js';
|
|
12
|
+
export { F as FindingToPolicyEditOptions, P as POLICY_EDIT_AXES, a as POLICY_EDIT_TARGET_SURFACES, b as PolicyEdit, c as PolicyEditAdmission, d as PolicyEditAdmissionOptions, e as PolicyEditAxis, f as PolicyEditChange, g as PolicyEditExpectedGain, h as PolicyEditGainDirection, i as PolicyEditGainUnit, j as PolicyEditInit, k as PolicyEditRisk, l as PolicyEditSchemaVersion, m as PolicyEditSource, n as PolicyEditTarget, o as PolicyEditTargetSurface, p as PolicyEditValidationError, q as admitPolicyEdit, r as applyPolicyEditToSurface, s as computePolicyEditId, t as isPolicyEdit, u as makePolicyEdit, v as policyEditFromFinding, w as policyEditsFromFindings, x as scorePolicyEditReadiness, y as validatePolicyEdit } from '../policy-edit-nUhuFtLF.js';
|
|
13
13
|
import { L as LlmClientOptions } from '../llm-client-Bj7g0rqu.js';
|
|
14
14
|
import { AxFunction } from '@ax-llm/ax';
|
|
15
15
|
import '../verdict-C9MlYujm.js';
|
|
16
16
|
import '../schema-m0gsnbt3.js';
|
|
17
17
|
import '../store-BcFXE6LG.js';
|
|
18
18
|
import 'zod';
|
|
19
|
-
import '../run-record-
|
|
19
|
+
import '../run-record-CPfd1ARZ.js';
|
|
20
20
|
import '@tangle-network/agent-interface';
|
|
21
21
|
import '../errors-CzMUYo7b.js';
|
|
22
22
|
import '../raw-provider-sink-C46HDghv.js';
|
package/dist/analyst/index.js
CHANGED
|
@@ -11,7 +11,7 @@ import {
|
|
|
11
11
|
diffFindings,
|
|
12
12
|
emitSkillUsageFindings,
|
|
13
13
|
runSemanticConceptJudge
|
|
14
|
-
} from "../chunk-
|
|
14
|
+
} from "../chunk-SMCACT4Z.js";
|
|
15
15
|
import "../chunk-DJWX3GVS.js";
|
|
16
16
|
import {
|
|
17
17
|
behavioralAnalyst,
|
|
@@ -34,7 +34,7 @@ import {
|
|
|
34
34
|
policyEditsFromFindings,
|
|
35
35
|
scorePolicyEditReadiness,
|
|
36
36
|
validatePolicyEdit
|
|
37
|
-
} from "../chunk-
|
|
37
|
+
} from "../chunk-LMSQ6EFA.js";
|
|
38
38
|
import {
|
|
39
39
|
ANALYST_SEVERITIES,
|
|
40
40
|
AnalystRegistry,
|
|
@@ -67,7 +67,7 @@ import {
|
|
|
67
67
|
} from "../chunk-45EEMHTC.js";
|
|
68
68
|
import "../chunk-YBIGNSCZ.js";
|
|
69
69
|
import "../chunk-PC4UYEBM.js";
|
|
70
|
-
import "../chunk-
|
|
70
|
+
import "../chunk-AGYDMORK.js";
|
|
71
71
|
import "../chunk-VSMTAMNK.js";
|
|
72
72
|
import "../chunk-3BFEG2F6.js";
|
|
73
73
|
import "../chunk-PZ5AY32C.js";
|
|
@@ -1,7 +1,7 @@
|
|
|
1
|
-
import { A as AnalystRegistry } from './default-registry-
|
|
1
|
+
import { A as AnalystRegistry } from './default-registry-Ez4cxuZ4.js';
|
|
2
2
|
import { a as DatasetScenario } from './dataset-BbGkaN2I.js';
|
|
3
|
-
import { R as RunRecord } from './run-record-
|
|
4
|
-
import { I as InsightReport } from './insight-report-
|
|
3
|
+
import { R as RunRecord } from './run-record-CPfd1ARZ.js';
|
|
4
|
+
import { I as InsightReport } from './insight-report-DumCfEur.js';
|
|
5
5
|
|
|
6
6
|
/**
|
|
7
7
|
* # `analyzeRuns()` — turn a set of agent runs into an actionable decision packet.
|
|
@@ -1,9 +1,9 @@
|
|
|
1
1
|
import { c as CalibrationReport } from '../calibration-BPmzuVPk.js';
|
|
2
2
|
import { O as OffPolicyEstimate, a as OffPolicyOptions, b as OffPolicyTrajectory } from '../off-policy-DiwuKKg7.js';
|
|
3
|
-
import { d as CodeAgentSessionSource, a as CodeAgentSessionIntakeOptions, c as CodeAgentSessionMetrics, C as CodeAgentSessionDiagnostic } from '../code-agent-session-
|
|
4
|
-
import { R as RunRecord, b as RunSplitTag } from '../run-record-
|
|
3
|
+
import { d as CodeAgentSessionSource, a as CodeAgentSessionIntakeOptions, c as CodeAgentSessionMetrics, C as CodeAgentSessionDiagnostic } from '../code-agent-session-Cen-qD2y.js';
|
|
4
|
+
import { R as RunRecord, b as RunSplitTag } from '../run-record-CPfd1ARZ.js';
|
|
5
5
|
import { T as TraceStore } from '../store-BcFXE6LG.js';
|
|
6
|
-
import { R as RuntimeTrajectoryRecord, P as ProjectRuntimeTrajectoryEvidenceOptions, a as RuntimeTrajectoryEvidenceProjection } from '../runtime-trajectory-
|
|
6
|
+
import { R as RuntimeTrajectoryRecord, P as ProjectRuntimeTrajectoryEvidenceOptions, a as RuntimeTrajectoryEvidenceProjection } from '../runtime-trajectory-DZ8ei-Jo.js';
|
|
7
7
|
import '../schema-m0gsnbt3.js';
|
|
8
8
|
import '../outcome-store-rnXLEqSn.js';
|
|
9
9
|
import '@tangle-network/agent-interface';
|
|
@@ -1,5 +1,5 @@
|
|
|
1
|
-
export { B as BENCHMARK_SPLIT_SEED, a as BenchmarkAdapter, b as BenchmarkDatasetItem, c as BenchmarkEvaluation, d as deterministicSplit, e as routing } from '../index-
|
|
2
|
-
import '../run-record-
|
|
1
|
+
export { B as BENCHMARK_SPLIT_SEED, a as BenchmarkAdapter, b as BenchmarkDatasetItem, c as BenchmarkEvaluation, d as deterministicSplit, e as routing } from '../index-unCSYRJJ.js';
|
|
2
|
+
import '../run-record-CPfd1ARZ.js';
|
|
3
3
|
import '@tangle-network/agent-interface';
|
|
4
4
|
import '../errors-CzMUYo7b.js';
|
|
5
5
|
import '../schema-m0gsnbt3.js';
|
|
@@ -5,10 +5,10 @@ import {
|
|
|
5
5
|
import {
|
|
6
6
|
pearsonR,
|
|
7
7
|
spearmanR
|
|
8
|
-
} from "../chunk-
|
|
8
|
+
} from "../chunk-HYGRFL7C.js";
|
|
9
9
|
import {
|
|
10
10
|
judgeSpans
|
|
11
|
-
} from "../chunk-
|
|
11
|
+
} from "../chunk-JZXGWLK5.js";
|
|
12
12
|
import "../chunk-5BKGXME7.js";
|
|
13
13
|
import {
|
|
14
14
|
TraceEmitter
|
package/dist/campaign/index.d.ts
CHANGED
|
@@ -1,20 +1,21 @@
|
|
|
1
|
-
import { S as SignedManifest, B as BackendIntegrityReport, C as CompletionRequirement, R as RuntimeEventLike, a as CompletionVerdict, P as ProducedState, b as CorrectnessChecker } from '../pre-registration-
|
|
2
|
-
export { L as LlmJudgeDimension, c as LlmJudgeOptions, l as llmJudge } from '../pre-registration-
|
|
1
|
+
import { S as SignedManifest, B as BackendIntegrityReport, C as CompletionRequirement, R as RuntimeEventLike, a as CompletionVerdict, P as ProducedState, b as CorrectnessChecker } from '../pre-registration-CUOSGAZK.js';
|
|
2
|
+
export { L as LlmJudgeDimension, c as LlmJudgeOptions, l as llmJudge } from '../pre-registration-CUOSGAZK.js';
|
|
3
3
|
import { A as AnalyzeTracesOptions, a as AnalyzeTracesInput, b as AnalyzeTracesResult } from '../analyst-C8HHvfJp.js';
|
|
4
|
-
import { S as Scenario, M as MutableSurface, b as DispatchContext, a as JudgeConfig, e as GenerationRecord, g as Gate, J as JudgeScore, L as LabeledScenarioStore, s as LabeledScenarioWrite, t as LabeledScenarioSampleArgs, u as LabeledScenarioRecord, v as LabelTrust, f as SurfaceProposer, w as ProposedCandidate, x as ProposeContext, y as LabeledScenarioSource, C as CampaignResult, o as CodeSurface } from '../types-
|
|
5
|
-
export { k as CampaignAggregates, l as CampaignArtifactWriter, m as CampaignCellResult, n as CampaignCostMeter, z as CampaignTokenUsage, d as CampaignTraceWriter, D as DispatchFn, h as GateContext, j as GateDecision, G as GateResult, p as GenerationCandidate, A as JudgeAggregate, c as JudgeDimension, i as Mutator, O as OptimizationProposer, q as OptimizerConfig, P as ParetoParent, R as RedactionStatus, B as ScenarioAggregate, r as SessionScript, T as TraceSpan, E as isProposedCandidate, F as labelTrustRank } from '../types-
|
|
6
|
-
import { e as CampaignRunPlan, P as PlanCampaignRunOptions, C as CampaignStorage, R as RunCampaignOptions, c as RunImprovementLoopOptions } from '../gepa-
|
|
7
|
-
export { h as CampaignRunPlanCell, j as GepaProposerConstraints, G as GepaProposerOptions, O as OpenAutoPrOptions, k as OpenAutoPrResult, b as RunImprovementLoopResult, a as RunOptimizationOptions, l as RunOptimizationResult, m as countSentenceEdits, n as defaultRenderDiff, o as extractH2Sections, f as fsCampaignStorage, g as gepaProposer, i as inMemoryCampaignStorage, p as openAutoPr, q as planCampaignRun, r as runCampaign, d as runImprovementLoop, s as runOptimization, t as surfaceHash } from '../gepa-
|
|
8
|
-
export { A as AxisEvidence, a as AxisVerdict, B as BuildEvidenceVectorOptions, k as BuildLoopProvenanceArgs, D as DefaultProductionGateOptions, l as EmitLoopProvenanceArgs, m as EmitLoopProvenanceResult, E as EvidenceVector, b as EvolutionaryProposerOptions, H as HeldOutGateOptions, n as LoopProvenanceBackend, o as LoopProvenanceCandidate, L as LoopProvenanceRecord, O as ObjectiveSource, P as ParetoSignificanceGateOptions, c as PromotionObjective, d as PromotionPolicy, R as RunEvalOptions, e as buildEvidenceVector, q as buildLoopProvenanceRecord, f as composeGate, g as defaultProductionGate, s as emitLoopProvenance, h as evolutionaryProposer, i as heldOutGate, t as loopProvenanceSpans, p as paretoPolicy, j as paretoSignificanceGate, u as provenanceRecordPath, v as provenanceSpansPath, r as runEval, w as surfaceContentHash } from '../provenance-
|
|
9
|
-
import { E as EProcessState, a as PairedBootstrapResult } from '../statistics-
|
|
4
|
+
import { S as Scenario, M as MutableSurface, b as DispatchContext, a as JudgeConfig, e as GenerationRecord, g as Gate, J as JudgeScore, L as LabeledScenarioStore, s as LabeledScenarioWrite, t as LabeledScenarioSampleArgs, u as LabeledScenarioRecord, v as LabelTrust, f as SurfaceProposer, w as ProposedCandidate, x as ProposeContext, y as LabeledScenarioSource, C as CampaignResult, o as CodeSurface } from '../types-Bihq6-a3.js';
|
|
5
|
+
export { k as CampaignAggregates, l as CampaignArtifactWriter, m as CampaignCellResult, n as CampaignCostMeter, z as CampaignTokenUsage, d as CampaignTraceWriter, D as DispatchFn, h as GateContext, j as GateDecision, G as GateResult, p as GenerationCandidate, A as JudgeAggregate, c as JudgeDimension, i as Mutator, O as OptimizationProposer, q as OptimizerConfig, P as ParetoParent, R as RedactionStatus, B as ScenarioAggregate, r as SessionScript, T as TraceSpan, E as isProposedCandidate, F as labelTrustRank } from '../types-Bihq6-a3.js';
|
|
6
|
+
import { e as CampaignRunPlan, P as PlanCampaignRunOptions, C as CampaignStorage, R as RunCampaignOptions, c as RunImprovementLoopOptions } from '../gepa-COlCAkHN.js';
|
|
7
|
+
export { h as CampaignRunPlanCell, j as GepaProposerConstraints, G as GepaProposerOptions, O as OpenAutoPrOptions, k as OpenAutoPrResult, b as RunImprovementLoopResult, a as RunOptimizationOptions, l as RunOptimizationResult, m as countSentenceEdits, n as defaultRenderDiff, o as extractH2Sections, f as fsCampaignStorage, g as gepaProposer, i as inMemoryCampaignStorage, p as openAutoPr, q as planCampaignRun, r as runCampaign, d as runImprovementLoop, s as runOptimization, t as surfaceHash } from '../gepa-COlCAkHN.js';
|
|
8
|
+
export { A as AxisEvidence, a as AxisVerdict, B as BuildEvidenceVectorOptions, k as BuildLoopProvenanceArgs, D as DefaultProductionGateOptions, l as EmitLoopProvenanceArgs, m as EmitLoopProvenanceResult, E as EvidenceVector, b as EvolutionaryProposerOptions, H as HeldOutGateOptions, n as LoopProvenanceBackend, o as LoopProvenanceCandidate, L as LoopProvenanceRecord, O as ObjectiveSource, P as ParetoSignificanceGateOptions, c as PromotionObjective, d as PromotionPolicy, R as RunEvalOptions, e as buildEvidenceVector, q as buildLoopProvenanceRecord, f as composeGate, g as defaultProductionGate, s as emitLoopProvenance, h as evolutionaryProposer, i as heldOutGate, t as loopProvenanceSpans, p as paretoPolicy, j as paretoSignificanceGate, u as provenanceRecordPath, v as provenanceSpansPath, r as runEval, w as surfaceContentHash } from '../provenance-B2VsP0jP.js';
|
|
9
|
+
import { E as EProcessState, a as PairedBootstrapResult } from '../statistics-D88peojY.js';
|
|
10
10
|
import { L as LlmClientOptions } from '../llm-client-Bj7g0rqu.js';
|
|
11
11
|
import { AgentProfile } from '@tangle-network/agent-interface';
|
|
12
12
|
import { A as AgentEvalError } from '../errors-CzMUYo7b.js';
|
|
13
|
-
import { b as RunSplitTag, R as RunRecord } from '../run-record-
|
|
14
|
-
import { b as PolicyEdit, F as FindingToPolicyEditOptions, d as PolicyEditAdmissionOptions, c as PolicyEditAdmission } from '../policy-edit-
|
|
15
|
-
import { T as TraceAnalystKindSpec } from '../kind-factory-
|
|
16
|
-
import { A as AnalystFinding } from '../types-
|
|
13
|
+
import { b as RunSplitTag, R as RunRecord } from '../run-record-CPfd1ARZ.js';
|
|
14
|
+
import { b as PolicyEdit, F as FindingToPolicyEditOptions, d as PolicyEditAdmissionOptions, c as PolicyEditAdmission } from '../policy-edit-nUhuFtLF.js';
|
|
15
|
+
import { T as TraceAnalystKindSpec } from '../kind-factory-BLHxwX71.js';
|
|
16
|
+
import { A as AnalystFinding } from '../types-DA9yj-Jd.js';
|
|
17
17
|
import '@tangle-network/tcloud';
|
|
18
|
+
import '../raw-provider-sink-C46HDghv.js';
|
|
18
19
|
import '../verdict-C9MlYujm.js';
|
|
19
20
|
import '@ax-llm/ax';
|
|
20
21
|
import '../store-C1YxJDEK.js';
|
|
@@ -24,12 +25,11 @@ import '../store-BcFXE6LG.js';
|
|
|
24
25
|
import '../schema-m0gsnbt3.js';
|
|
25
26
|
import '../pareto-E-pembql.js';
|
|
26
27
|
import '../hosted/index.js';
|
|
27
|
-
import '../insight-report-
|
|
28
|
-
import '../summary-report-
|
|
28
|
+
import '../insight-report-DumCfEur.js';
|
|
29
|
+
import '../summary-report-Fc_YFJat.js';
|
|
29
30
|
import '../failure-cluster-DH9Flgcf.js';
|
|
30
|
-
import '../judge-calibration-
|
|
31
|
+
import '../judge-calibration-7C-IDmKr.js';
|
|
31
32
|
import '../types-C7DGg5ex.js';
|
|
32
|
-
import '../raw-provider-sink-C46HDghv.js';
|
|
33
33
|
import 'zod';
|
|
34
34
|
|
|
35
35
|
/**
|
|
@@ -583,6 +583,9 @@ interface FapoProposerOptions<TFindings = unknown> {
|
|
|
583
583
|
}
|
|
584
584
|
/** Build a FAPO policy proposer from level-specific candidate generators. */
|
|
585
585
|
declare function fapoProposer<TFindings = unknown>(opts: FapoProposerOptions<TFindings>): SurfaceProposer<TFindings>;
|
|
586
|
+
/**
|
|
587
|
+
* Scan a findings array and extract FAPO attribution signals — per-level counts and failure clusters used to decide which optimization level to escalate to next.
|
|
588
|
+
*/
|
|
586
589
|
declare function extractFapoAttributionSignals(findings: readonly unknown[]): FapoAttributionSignals;
|
|
587
590
|
type JsonPrimitive = string | number | boolean | null;
|
|
588
591
|
type JsonValue = JsonPrimitive | JsonValue[] | {
|
|
@@ -687,6 +690,9 @@ interface CompareProposersOptions<TScenario extends Scenario, TArtifact> extends
|
|
|
687
690
|
/** CI confidence. Default 0.95. */
|
|
688
691
|
confidence?: number;
|
|
689
692
|
}
|
|
693
|
+
/**
|
|
694
|
+
* Run a head-to-head lift benchmark across surface proposers on a shared holdout, returning per-proposer lift CIs and pairwise "who wins" verdicts.
|
|
695
|
+
*/
|
|
690
696
|
declare function compareProposers<TScenario extends Scenario, TArtifact>(opts: CompareProposersOptions<TScenario, TArtifact>): Promise<ProposerComparison>;
|
|
691
697
|
/** Shared corpus + transport for the three built-in optimizer entries. */
|
|
692
698
|
interface OptimizerEntryConfig<TScenario extends Scenario, TArtifact> {
|
|
@@ -750,6 +756,9 @@ interface FapoEntryConfig<TScenario extends Scenario, TArtifact> extends Optimiz
|
|
|
750
756
|
/** FAPO policy knobs: scope, reviewer, plateau thresholds. */
|
|
751
757
|
fapo?: Omit<FapoProposerOptions, 'proposers' | 'promptProposer' | 'parameterProposer' | 'structuralProposer'>;
|
|
752
758
|
}
|
|
759
|
+
/**
|
|
760
|
+
* Build a `ProposerEntry` that runs the full FAPO escalation policy (prompt → parameter → structural) as a single comparable optimizer entry.
|
|
761
|
+
*/
|
|
753
762
|
declare function fapoEscalationEntry<TScenario extends Scenario, TArtifact>(config: FapoEntryConfig<TScenario, TArtifact>, name?: string): ProposerEntry;
|
|
754
763
|
|
|
755
764
|
/**
|
|
@@ -896,6 +905,9 @@ interface RunProfileMatrixResult<TArtifact, TScenario extends Scenario> {
|
|
|
896
905
|
/** The raw per-profile campaign results, keyed by profile id. */
|
|
897
906
|
campaigns: Record<string, CampaignResult<TArtifact, TScenario>>;
|
|
898
907
|
}
|
|
908
|
+
/**
|
|
909
|
+
* Profile × scenario matrix runner: fan N agent profiles across M scenarios, project each cell to a validated `RunRecord` with real token usage, and enforce the backend-integrity guard before returning.
|
|
910
|
+
*/
|
|
899
911
|
declare function runProfileMatrix<TScenario extends Scenario, TArtifact>(opts: RunProfileMatrixOptions<TScenario, TArtifact>): Promise<RunProfileMatrixResult<TArtifact, TScenario>>;
|
|
900
912
|
|
|
901
913
|
/**
|
|
@@ -1151,6 +1163,9 @@ interface SkillOptProposer extends SurfaceProposer {
|
|
|
1151
1163
|
* acceptance/budget/buffer). Returns structured patches, NOT surfaces. */
|
|
1152
1164
|
proposePatches(args: ProposePatchesArgs): Promise<SkillPatch[]>;
|
|
1153
1165
|
}
|
|
1166
|
+
/**
|
|
1167
|
+
* SkillOpt proposer: proposes bounded, anchored patch operations (add/delete/replace) on a skill document, conforming to both the patch-native `SkillOptProposer` and the generic `SurfaceProposer` interfaces.
|
|
1168
|
+
*/
|
|
1154
1169
|
declare function skillOptProposer(opts: SkillOptProposerOptions): SkillOptProposer;
|
|
1155
1170
|
/** Parse + validate the patch response. Throws `SkillPatchParseError` when the
|
|
1156
1171
|
* response is not valid JSON at all (a router/model failure the caller must
|
|
@@ -1160,6 +1175,9 @@ declare function skillOptProposer(opts: SkillOptProposerOptions): SkillOptPropos
|
|
|
1160
1175
|
declare class SkillPatchParseError extends Error {
|
|
1161
1176
|
constructor(message: string);
|
|
1162
1177
|
}
|
|
1178
|
+
/**
|
|
1179
|
+
* Parse a SkillOpt LLM response into validated `SkillPatch` objects, throwing `SkillPatchParseError` on malformed JSON and silently dropping ops that violate the edit budget.
|
|
1180
|
+
*/
|
|
1163
1181
|
declare function parseSkillPatchResponse(raw: string, maxPatches: number, editBudget: number): SkillPatch[];
|
|
1164
1182
|
|
|
1165
1183
|
/**
|
|
@@ -1254,6 +1272,9 @@ interface RunSkillOptResult {
|
|
|
1254
1272
|
* acceptance) the hill-climb ran. */
|
|
1255
1273
|
totalCostUsd: number;
|
|
1256
1274
|
}
|
|
1275
|
+
/**
|
|
1276
|
+
* SkillOpt sequential hill-climb: each epoch reflects on train-scenario weaknesses, proposes bounded patches, accepts the first patch that strictly improves the held-out composite, and anneals the edit budget on consecutive rejections.
|
|
1277
|
+
*/
|
|
1257
1278
|
declare function runSkillOpt<TScenario extends Scenario, TArtifact>(opts: RunSkillOptOptions<TScenario, TArtifact>): Promise<RunSkillOptResult>;
|
|
1258
1279
|
|
|
1259
1280
|
/**
|
|
@@ -1287,6 +1308,9 @@ interface AceProposerOptions {
|
|
|
1287
1308
|
/** Heading rendered above the bullets inside the block. */
|
|
1288
1309
|
sectionHeading?: string;
|
|
1289
1310
|
}
|
|
1311
|
+
/**
|
|
1312
|
+
* Append-only context engineering proposer: grows a skill playbook by appending generation-tagged lessons without merging or overwriting prior entries.
|
|
1313
|
+
*/
|
|
1290
1314
|
declare function aceProposer(opts?: AceProposerOptions): SurfaceProposer;
|
|
1291
1315
|
|
|
1292
1316
|
/**
|
|
@@ -1531,6 +1555,9 @@ interface GitWorktreeAdapterOptions {
|
|
|
1531
1555
|
/** Test seam — defaults to a real `git` runner. */
|
|
1532
1556
|
git?: (args: string[], cwd: string) => string;
|
|
1533
1557
|
}
|
|
1558
|
+
/**
|
|
1559
|
+
* Git-backed `WorktreeAdapter`: creates isolated worktrees on fresh branches, commits agent changes, and discards losers.
|
|
1560
|
+
*/
|
|
1534
1561
|
declare function gitWorktreeAdapter(opts: GitWorktreeAdapterOptions): WorktreeAdapter;
|
|
1535
1562
|
/** Resolve a `CodeSurface`'s worktreeRef to a directory the measurement can
|
|
1536
1563
|
* run the worker in. A path ref is returned as-is; anything else is treated
|
package/dist/campaign/index.js
CHANGED
|
@@ -10,7 +10,7 @@ import {
|
|
|
10
10
|
paretoPolicy,
|
|
11
11
|
paretoSignificanceGate,
|
|
12
12
|
runEval
|
|
13
|
-
} from "../chunk-
|
|
13
|
+
} from "../chunk-66T25VWE.js";
|
|
14
14
|
import {
|
|
15
15
|
HARNESS_NATIVE_MODEL,
|
|
16
16
|
agentProfileHash,
|
|
@@ -20,7 +20,7 @@ import {
|
|
|
20
20
|
harnessAxisOf,
|
|
21
21
|
llmJudge,
|
|
22
22
|
verifyCompletion
|
|
23
|
-
} from "../chunk-
|
|
23
|
+
} from "../chunk-YFYIOSNV.js";
|
|
24
24
|
import {
|
|
25
25
|
buildLoopProvenanceRecord,
|
|
26
26
|
campaignBreakdown,
|
|
@@ -42,7 +42,7 @@ import {
|
|
|
42
42
|
runOptimization,
|
|
43
43
|
surfaceContentHash,
|
|
44
44
|
surfaceHash
|
|
45
|
-
} from "../chunk-
|
|
45
|
+
} from "../chunk-2B4HPFXN.js";
|
|
46
46
|
import {
|
|
47
47
|
assertRealBackend,
|
|
48
48
|
contentHash,
|
|
@@ -53,7 +53,7 @@ import {
|
|
|
53
53
|
runCampaign,
|
|
54
54
|
summarizeBackendIntegrity,
|
|
55
55
|
tangleTracesRoot
|
|
56
|
-
} from "../chunk-
|
|
56
|
+
} from "../chunk-VNM52AGA.js";
|
|
57
57
|
import {
|
|
58
58
|
estimateCost,
|
|
59
59
|
isModelPriced
|
|
@@ -63,13 +63,13 @@ import {
|
|
|
63
63
|
applyPolicyEditToSurface,
|
|
64
64
|
isPolicyEdit,
|
|
65
65
|
policyEditsFromFindings
|
|
66
|
-
} from "../chunk-
|
|
66
|
+
} from "../chunk-LMSQ6EFA.js";
|
|
67
67
|
import {
|
|
68
68
|
AnalystRegistry,
|
|
69
69
|
DEFAULT_TRACE_ANALYST_KINDS,
|
|
70
70
|
createTraceAnalystKind
|
|
71
71
|
} from "../chunk-FRI6RG3P.js";
|
|
72
|
-
import "../chunk-
|
|
72
|
+
import "../chunk-LOZOZYHU.js";
|
|
73
73
|
import {
|
|
74
74
|
callLlm
|
|
75
75
|
} from "../chunk-CWNP4DV4.js";
|
|
@@ -78,7 +78,7 @@ import {
|
|
|
78
78
|
eProcess,
|
|
79
79
|
mulberry32,
|
|
80
80
|
pairedBootstrap
|
|
81
|
-
} from "../chunk-
|
|
81
|
+
} from "../chunk-HYGRFL7C.js";
|
|
82
82
|
import {
|
|
83
83
|
analyzeTraces
|
|
84
84
|
} from "../chunk-2MLIEQSN.js";
|
|
@@ -90,10 +90,10 @@ import "../chunk-PC4UYEBM.js";
|
|
|
90
90
|
import {
|
|
91
91
|
modelHasSnapshot,
|
|
92
92
|
validateRunRecord
|
|
93
|
-
} from "../chunk-
|
|
93
|
+
} from "../chunk-J5MUFXEY.js";
|
|
94
94
|
import {
|
|
95
95
|
buildAgentProfileCell
|
|
96
|
-
} from "../chunk-
|
|
96
|
+
} from "../chunk-AGYDMORK.js";
|
|
97
97
|
import {
|
|
98
98
|
canonicalize
|
|
99
99
|
} from "../chunk-VSMTAMNK.js";
|