@tangle-network/agent-eval 0.103.0 → 0.103.2
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/dist/adapters/http.d.ts +3 -3
- package/dist/adapters/langchain.d.ts +3 -3
- package/dist/adapters/otel.d.ts +6 -6
- package/dist/analyst/index.d.ts +11 -11
- package/dist/analyst/index.js +8 -8
- package/dist/{analyze-runs-Cd-A_K4l.d.ts → analyze-runs-DJYpep3L.d.ts} +4 -4
- package/dist/belief-state/index.d.ts +4 -4
- package/dist/belief-state/index.js +3 -3
- package/dist/benchmarks/index.d.ts +3 -3
- package/dist/builder-eval/index.js +4 -4
- package/dist/campaign/index.d.ts +66 -19
- package/dist/campaign/index.js +14 -14
- package/dist/campaign/index.js.map +1 -1
- package/dist/{chunk-FRI6RG3P.js → chunk-2OGPXHOB.js} +3 -3
- package/dist/{chunk-XKA6ZGEY.js → chunk-3PFZBGMR.js} +3 -3
- package/dist/chunk-3PFZBGMR.js.map +1 -0
- package/dist/{chunk-JU6ZX3CX.js → chunk-5PK3626Q.js} +4 -4
- package/dist/{chunk-VDGPPGE3.js → chunk-6HFYGEZ3.js} +3 -3
- package/dist/{chunk-VDGPPGE3.js.map → chunk-6HFYGEZ3.js.map} +1 -1
- package/dist/{chunk-6GT4NI4V.js → chunk-6MFFKPZ4.js} +2 -2
- package/dist/{chunk-REVYNR6C.js → chunk-6SK5VFYK.js} +2 -2
- package/dist/{chunk-IXOV77YF.js → chunk-BBQILVBH.js} +5 -5
- package/dist/{chunk-IH7LYRHL.js → chunk-DBDRR6GF.js} +3 -3
- package/dist/{chunk-D5KBVULY.js → chunk-DRPIZQIT.js} +2 -2
- package/dist/{chunk-4DIJWVUT.js → chunk-DTJ6QUQB.js} +2 -2
- package/dist/{chunk-RQNOLV3I.js → chunk-FOUG2VVS.js} +2 -2
- package/dist/{chunk-CWNP4DV4.js → chunk-FUCQVFMU.js} +2 -2
- package/dist/{chunk-U3IDYATS.js → chunk-GDZAWO2I.js} +5 -5
- package/dist/{chunk-ZOPLCJSY.js → chunk-HZHNRYHK.js} +2 -2
- package/dist/{chunk-UFSG7ACU.js → chunk-JZXGWLK5.js} +1 -1
- package/dist/chunk-JZXGWLK5.js.map +1 -0
- package/dist/{chunk-B2TMQM62.js → chunk-K7QEIHHJ.js} +2 -2
- package/dist/{chunk-6FIAJHCU.js → chunk-LIEJUH2I.js} +6 -6
- package/dist/{chunk-YBIGNSCZ.js → chunk-LNQEP766.js} +2 -2
- package/dist/{chunk-IN3SHQML.js → chunk-LOJ2QVCE.js} +4 -4
- package/dist/{chunk-AIGWQEME.js → chunk-N22ZO7FV.js} +2 -2
- package/dist/{chunk-3BFEG2F6.js → chunk-ONWEPEDO.js} +1 -1
- package/dist/chunk-ONWEPEDO.js.map +1 -0
- package/dist/{chunk-L5TVEZFT.js → chunk-QRVS7MX4.js} +3 -3
- package/dist/{chunk-2MLIEQSN.js → chunk-RPDDVKI7.js} +2 -2
- package/dist/{chunk-SBCB6VZY.js → chunk-TT4KNT67.js} +2 -2
- package/dist/{chunk-7RBJANJD.js → chunk-V7HNA47Z.js} +5 -5
- package/dist/{chunk-2NSLDY4B.js → chunk-VK6HBGAE.js} +3 -3
- package/dist/{chunk-NF7OZ4J7.js → chunk-X6NIXVOD.js} +2 -2
- package/dist/{chunk-ABOIVNXL.js → chunk-XJYR7XFV.js} +2 -2
- package/dist/chunk-XJYR7XFV.js.map +1 -0
- package/dist/{chunk-HRGUJTER.js → chunk-XMSYF4A7.js} +2 -2
- package/dist/{chunk-HRGUJTER.js.map → chunk-XMSYF4A7.js.map} +1 -1
- package/dist/{chunk-HV5PBTJF.js → chunk-Z7FK73R5.js} +5 -5
- package/dist/chunk-Z7FK73R5.js.map +1 -0
- package/dist/{chunk-NTVWIH24.js → chunk-ZKIL3VOD.js} +5 -5
- package/dist/chunk-ZKIL3VOD.js.map +1 -0
- package/dist/cli.js +3 -3
- package/dist/{code-agent-session-Ce-9u7YM.d.ts → code-agent-session-rnJKlqmT.d.ts} +1 -1
- package/dist/contract/index.d.ts +22 -22
- package/dist/contract/index.js +15 -15
- package/dist/{control-C8RmK9H4.d.ts → control-B8UthSBL.d.ts} +2 -2
- package/dist/control.d.ts +5 -5
- package/dist/control.js +4 -4
- package/dist/{corpus-CiSzzLa5.d.ts → corpus-eBVwhCp1.d.ts} +1 -1
- package/dist/{dataset-BbGkaN2I.d.ts → dataset-DS7ytHZU.d.ts} +1 -1
- package/dist/{default-registry-ZhqsTr4K.d.ts → default-registry-BswHCXnU.d.ts} +2 -2
- package/dist/diagnose.d.ts +5 -5
- package/dist/diagnose.js +5 -5
- package/dist/{errors-CzMUYo7b.d.ts → errors-oeQrLqXC.d.ts} +4 -0
- package/dist/{feedback-trajectory-BxY0cKfs.d.ts → feedback-trajectory-C9KCo8ag.d.ts} +1 -1
- package/dist/fuzz.js +1 -1
- package/dist/{gepa-DeyPTlvx.d.ts → gepa-Dn0gtj9n.d.ts} +27 -2
- package/dist/governance/index.d.ts +4 -4
- package/dist/hosted/index.d.ts +6 -6
- package/dist/{index-B-bFgiAF.d.ts → index-C2CC_dry.d.ts} +1 -1
- package/dist/index.d.ts +41 -37
- package/dist/index.js +26 -26
- package/dist/index.js.map +1 -1
- package/dist/{insight-report-k0sRTzKg.d.ts → insight-report-B4xrdwEK.d.ts} +2 -2
- package/dist/{integrity-D2t12mMw.d.ts → integrity-DqGZg3st.d.ts} +1 -1
- package/dist/{judge-calibration-0p2QcWNE.d.ts → judge-calibration-7C-IDmKr.d.ts} +3 -0
- package/dist/{kind-factory-D0nk7AKV.d.ts → kind-factory-DvIGo_cP.d.ts} +1 -1
- package/dist/{llm-client-Bj7g0rqu.d.ts → llm-client-DyqEH4jH.d.ts} +1 -1
- package/dist/meta-eval/index.d.ts +5 -5
- package/dist/meta-eval/index.js +4 -4
- package/dist/{multi-layer-verifier-DUZXrPDA.d.ts → multi-layer-verifier-CI4jdX-q.d.ts} +3 -0
- package/dist/multishot/index.d.ts +3 -3
- package/dist/openapi.json +1 -1
- package/dist/pipelines/index.d.ts +1 -1
- package/dist/pipelines/index.js +4 -4
- package/dist/{policy-edit-BDQzzsBU.d.ts → policy-edit-DQUXYMDm.d.ts} +3 -3
- package/dist/{pre-registration-mWG2w8d-.d.ts → pre-registration-D8Zr8-rr.d.ts} +4 -4
- package/dist/product-benchmark/index.d.ts +2 -2
- package/dist/product-benchmark/index.js +2 -2
- package/dist/{provenance-BhJm32vN.d.ts → provenance-phkRBl4h.d.ts} +21 -5
- package/dist/{query-B7GGjRox.d.ts → query-0aTmbmQe.d.ts} +1 -0
- package/dist/{red-team-BWdoyleI.d.ts → red-team-KmmiqBlY.d.ts} +1 -1
- package/dist/{release-report-BQ1Ziyu-.d.ts → release-report-DeJpsBiA.d.ts} +6 -3
- package/dist/reporting.d.ts +8 -8
- package/dist/reporting.js +5 -5
- package/dist/{researcher-B_ODTAJs.d.ts → researcher-Wc7dx6GM.d.ts} +4 -4
- package/dist/rl.d.ts +12 -12
- package/dist/rl.js +11 -11
- package/dist/{rubric-predictive-validity-0MdjTt8R.d.ts → rubric-predictive-validity-DPnyG-CE.d.ts} +1 -1
- package/dist/run-campaign-PNHAJIT2.js +12 -0
- package/dist/{run-record-MRdJ-Kq2.d.ts → run-record-I-Z3JNvO.d.ts} +4 -1
- package/dist/{runtime-trajectory-8w0_jmtR.d.ts → runtime-trajectory-iW9IhV3e.d.ts} +1 -1
- package/dist/{semantic-concept-judge-D-IlH5v1.d.ts → semantic-concept-judge-BmNZPB_j.d.ts} +4 -4
- package/dist/{statistics-xP-cWc5k.d.ts → statistics-D88peojY.d.ts} +1 -1
- package/dist/{summary-report-C0nnxOD8.d.ts → summary-report-QMZVe3P-.d.ts} +1 -1
- package/dist/traces.d.ts +4 -4
- package/dist/traces.js +8 -8
- package/dist/{types-Dz9cKF0g.d.ts → types-D1ytG0Yg.d.ts} +2 -2
- package/dist/{types-DFI_Z-ZL.d.ts → types-Mh6I44ub.d.ts} +1 -1
- package/dist/wire/index.d.ts +3 -3
- package/dist/wire/index.js +3 -3
- package/dist/workflow/index.d.ts +11 -11
- package/dist/workflow/index.js +4 -4
- package/package.json +1 -1
- package/dist/chunk-3BFEG2F6.js.map +0 -1
- package/dist/chunk-ABOIVNXL.js.map +0 -1
- package/dist/chunk-HV5PBTJF.js.map +0 -1
- package/dist/chunk-NTVWIH24.js.map +0 -1
- package/dist/chunk-UFSG7ACU.js.map +0 -1
- package/dist/chunk-XKA6ZGEY.js.map +0 -1
- package/dist/run-campaign-2L4WCJHR.js +0 -12
- /package/dist/{chunk-FRI6RG3P.js.map → chunk-2OGPXHOB.js.map} +0 -0
- /package/dist/{chunk-JU6ZX3CX.js.map → chunk-5PK3626Q.js.map} +0 -0
- /package/dist/{chunk-6GT4NI4V.js.map → chunk-6MFFKPZ4.js.map} +0 -0
- /package/dist/{chunk-REVYNR6C.js.map → chunk-6SK5VFYK.js.map} +0 -0
- /package/dist/{chunk-IXOV77YF.js.map → chunk-BBQILVBH.js.map} +0 -0
- /package/dist/{chunk-IH7LYRHL.js.map → chunk-DBDRR6GF.js.map} +0 -0
- /package/dist/{chunk-D5KBVULY.js.map → chunk-DRPIZQIT.js.map} +0 -0
- /package/dist/{chunk-4DIJWVUT.js.map → chunk-DTJ6QUQB.js.map} +0 -0
- /package/dist/{chunk-RQNOLV3I.js.map → chunk-FOUG2VVS.js.map} +0 -0
- /package/dist/{chunk-CWNP4DV4.js.map → chunk-FUCQVFMU.js.map} +0 -0
- /package/dist/{chunk-U3IDYATS.js.map → chunk-GDZAWO2I.js.map} +0 -0
- /package/dist/{chunk-ZOPLCJSY.js.map → chunk-HZHNRYHK.js.map} +0 -0
- /package/dist/{chunk-B2TMQM62.js.map → chunk-K7QEIHHJ.js.map} +0 -0
- /package/dist/{chunk-6FIAJHCU.js.map → chunk-LIEJUH2I.js.map} +0 -0
- /package/dist/{chunk-YBIGNSCZ.js.map → chunk-LNQEP766.js.map} +0 -0
- /package/dist/{chunk-IN3SHQML.js.map → chunk-LOJ2QVCE.js.map} +0 -0
- /package/dist/{chunk-AIGWQEME.js.map → chunk-N22ZO7FV.js.map} +0 -0
- /package/dist/{chunk-L5TVEZFT.js.map → chunk-QRVS7MX4.js.map} +0 -0
- /package/dist/{chunk-2MLIEQSN.js.map → chunk-RPDDVKI7.js.map} +0 -0
- /package/dist/{chunk-SBCB6VZY.js.map → chunk-TT4KNT67.js.map} +0 -0
- /package/dist/{chunk-7RBJANJD.js.map → chunk-V7HNA47Z.js.map} +0 -0
- /package/dist/{chunk-2NSLDY4B.js.map → chunk-VK6HBGAE.js.map} +0 -0
- /package/dist/{chunk-NF7OZ4J7.js.map → chunk-X6NIXVOD.js.map} +0 -0
- /package/dist/{run-campaign-2L4WCJHR.js.map → run-campaign-PNHAJIT2.js.map} +0 -0
package/dist/adapters/http.d.ts
CHANGED
|
@@ -1,7 +1,7 @@
|
|
|
1
|
-
import { S as Scenario, D as DispatchFn, b as DispatchContext } from '../types-
|
|
2
|
-
import '../run-record-
|
|
1
|
+
import { S as Scenario, D as DispatchFn, b as DispatchContext } from '../types-Mh6I44ub.js';
|
|
2
|
+
import '../run-record-I-Z3JNvO.js';
|
|
3
3
|
import '@tangle-network/agent-interface';
|
|
4
|
-
import '../errors-
|
|
4
|
+
import '../errors-oeQrLqXC.js';
|
|
5
5
|
import '../schema-m0gsnbt3.js';
|
|
6
6
|
|
|
7
7
|
/**
|
|
@@ -1,7 +1,7 @@
|
|
|
1
|
-
import { S as Scenario, J as JudgeScore, D as DispatchFn, a as JudgeConfig } from '../types-
|
|
2
|
-
import '../run-record-
|
|
1
|
+
import { S as Scenario, J as JudgeScore, D as DispatchFn, a as JudgeConfig } from '../types-Mh6I44ub.js';
|
|
2
|
+
import '../run-record-I-Z3JNvO.js';
|
|
3
3
|
import '@tangle-network/agent-interface';
|
|
4
|
-
import '../errors-
|
|
4
|
+
import '../errors-oeQrLqXC.js';
|
|
5
5
|
import '../schema-m0gsnbt3.js';
|
|
6
6
|
|
|
7
7
|
/**
|
package/dist/adapters/otel.d.ts
CHANGED
|
@@ -1,14 +1,14 @@
|
|
|
1
1
|
import { TraceSpanEvent, HostedClient } from '../hosted/index.js';
|
|
2
|
-
import '../types-
|
|
3
|
-
import '../run-record-
|
|
2
|
+
import '../types-Mh6I44ub.js';
|
|
3
|
+
import '../run-record-I-Z3JNvO.js';
|
|
4
4
|
import '@tangle-network/agent-interface';
|
|
5
|
-
import '../errors-
|
|
5
|
+
import '../errors-oeQrLqXC.js';
|
|
6
6
|
import '../schema-m0gsnbt3.js';
|
|
7
|
-
import '../insight-report-
|
|
8
|
-
import '../summary-report-
|
|
7
|
+
import '../insight-report-B4xrdwEK.js';
|
|
8
|
+
import '../summary-report-QMZVe3P-.js';
|
|
9
9
|
import '../failure-cluster-DH9Flgcf.js';
|
|
10
10
|
import '../store-BcFXE6LG.js';
|
|
11
|
-
import '../judge-calibration-
|
|
11
|
+
import '../judge-calibration-7C-IDmKr.js';
|
|
12
12
|
|
|
13
13
|
/**
|
|
14
14
|
* # `@tangle-network/agent-eval/adapters/otel` — OTel→hosted bridge.
|
package/dist/analyst/index.d.ts
CHANGED
|
@@ -1,24 +1,24 @@
|
|
|
1
|
-
import { M as MultiLayerVerifier, V as VerifyOptions, S as Severity } from '../multi-layer-verifier-
|
|
1
|
+
import { M as MultiLayerVerifier, V as VerifyOptions, S as Severity } from '../multi-layer-verifier-CI4jdX-q.js';
|
|
2
2
|
import { c as RunCritic, a as RunTrace } from '../run-critic-CmMf05uV.js';
|
|
3
|
-
import { S as SemanticConceptJudgeOptions, a as SemanticConceptJudgeInput, B as BehavioralMetrics } from '../semantic-concept-judge-
|
|
4
|
-
export { C as CreateAnalystAiConfig, D as DEFAULT_TRACE_ANALYST_KINDS, b as DiffPolicy, F as FAILURE_MODE_KIND_SPEC, c as FINDING_SUBJECT_GRAMMAR_PROMPT, d as FINDING_SUBJECT_KINDS, e as FindingSubject, f as FindingSubjectKind, g as FindingSubjectStringSchema, h as FindingsDiff, i as FindingsStore, I as IMPROVEMENT_KIND_SPEC, K as KIND_EXPECTED_SUBJECTS, j as KNOWLEDGE_GAP_KIND_SPEC, k as KNOWLEDGE_POISONING_KIND_SPEC, P as PersistedFinding, l as SKILL_USAGE_ANALYST, m as SkillUsageAnalyst, n as SkillUsageRecord, o as SkillUsageReport, p as SkillUsageScanConfig, q as buildSkillUsageReport, r as createAnalystAi, s as defaultIsMaterial, t as diffFindings, u as emitSkillUsageFindings, v as parseFindingSubject, w as renderFindingSubject } from '../semantic-concept-judge-
|
|
3
|
+
import { S as SemanticConceptJudgeOptions, a as SemanticConceptJudgeInput, B as BehavioralMetrics } from '../semantic-concept-judge-BmNZPB_j.js';
|
|
4
|
+
export { C as CreateAnalystAiConfig, D as DEFAULT_TRACE_ANALYST_KINDS, b as DiffPolicy, F as FAILURE_MODE_KIND_SPEC, c as FINDING_SUBJECT_GRAMMAR_PROMPT, d as FINDING_SUBJECT_KINDS, e as FindingSubject, f as FindingSubjectKind, g as FindingSubjectStringSchema, h as FindingsDiff, i as FindingsStore, I as IMPROVEMENT_KIND_SPEC, K as KIND_EXPECTED_SUBJECTS, j as KNOWLEDGE_GAP_KIND_SPEC, k as KNOWLEDGE_POISONING_KIND_SPEC, P as PersistedFinding, l as SKILL_USAGE_ANALYST, m as SkillUsageAnalyst, n as SkillUsageRecord, o as SkillUsageReport, p as SkillUsageScanConfig, q as buildSkillUsageReport, r as createAnalystAi, s as defaultIsMaterial, t as diffFindings, u as emitSkillUsageFindings, v as parseFindingSubject, w as renderFindingSubject } from '../semantic-concept-judge-BmNZPB_j.js';
|
|
5
5
|
import { b as JudgeFn, a as JudgeInput } from '../types-C7DGg5ex.js';
|
|
6
|
-
import { a as Analyst, h as AnalystSeverity, A as AnalystFinding } from '../types-
|
|
7
|
-
export { b as AnalystContext, g as AnalystCost, i as AnalystInputKind, j as AnalystRequirements, f as AnalystRunEvent, e as AnalystRunInputs, d as AnalystRunResult, c as AnalystRunSummary, k as ChatCallOpts, C as ChatClient, l as ChatRequest, m as ChatResponse, n as ChatTransport, o as CliBridgeTransportOpts, p as CreateChatClientOpts, D as DirectProviderTransportOpts, E as EvidenceRef, M as MockTransportOpts, R as RouterTransportOpts, S as SandboxSdkTransportOpts, q as computeFindingId, r as createChatClient, s as makeFinding } from '../types-
|
|
6
|
+
import { a as Analyst, h as AnalystSeverity, A as AnalystFinding } from '../types-D1ytG0Yg.js';
|
|
7
|
+
export { b as AnalystContext, g as AnalystCost, i as AnalystInputKind, j as AnalystRequirements, f as AnalystRunEvent, e as AnalystRunInputs, d as AnalystRunResult, c as AnalystRunSummary, k as ChatCallOpts, C as ChatClient, l as ChatRequest, m as ChatResponse, n as ChatTransport, o as CliBridgeTransportOpts, p as CreateChatClientOpts, D as DirectProviderTransportOpts, E as EvidenceRef, M as MockTransportOpts, R as RouterTransportOpts, S as SandboxSdkTransportOpts, q as computeFindingId, r as createChatClient, s as makeFinding } from '../types-D1ytG0Yg.js';
|
|
8
8
|
import { TCloud } from '@tangle-network/tcloud';
|
|
9
9
|
import { T as TraceAnalysisStore } from '../store-C1YxJDEK.js';
|
|
10
|
-
export { a as AnalystHooks, A as AnalystRegistry, b as AnalystRegistryOptions, B as BudgetPolicy, D as DefaultAnalystRegistryOptions, R as RegistryRunOpts, c as buildDefaultAnalystRegistry } from '../default-registry-
|
|
11
|
-
export { A as ANALYST_SEVERITIES, C as CreateTraceAnalystKindOpts, R as RAW_FINDING_SCHEMA_PROMPT, a as RawAnalystFinding, b as RawAnalystFindingSchema, c as TraceAnalystGolden, T as TraceAnalystKindSpec, d as createTraceAnalystKind, p as parseRawFinding, r as renderPriorFindings } from '../kind-factory-
|
|
12
|
-
export { F as FindingToPolicyEditOptions, P as POLICY_EDIT_AXES, a as POLICY_EDIT_TARGET_SURFACES, b as PolicyEdit, c as PolicyEditAdmission, d as PolicyEditAdmissionOptions, e as PolicyEditAxis, f as PolicyEditChange, g as PolicyEditExpectedGain, h as PolicyEditGainDirection, i as PolicyEditGainUnit, j as PolicyEditInit, k as PolicyEditRisk, l as PolicyEditSchemaVersion, m as PolicyEditSource, n as PolicyEditTarget, o as PolicyEditTargetSurface, p as PolicyEditValidationError, q as admitPolicyEdit, r as applyPolicyEditToSurface, s as computePolicyEditId, t as isPolicyEdit, u as makePolicyEdit, v as policyEditFromFinding, w as policyEditsFromFindings, x as scorePolicyEditReadiness, y as validatePolicyEdit } from '../policy-edit-
|
|
13
|
-
import { L as LlmClientOptions } from '../llm-client-
|
|
10
|
+
export { a as AnalystHooks, A as AnalystRegistry, b as AnalystRegistryOptions, B as BudgetPolicy, D as DefaultAnalystRegistryOptions, R as RegistryRunOpts, c as buildDefaultAnalystRegistry } from '../default-registry-BswHCXnU.js';
|
|
11
|
+
export { A as ANALYST_SEVERITIES, C as CreateTraceAnalystKindOpts, R as RAW_FINDING_SCHEMA_PROMPT, a as RawAnalystFinding, b as RawAnalystFindingSchema, c as TraceAnalystGolden, T as TraceAnalystKindSpec, d as createTraceAnalystKind, p as parseRawFinding, r as renderPriorFindings } from '../kind-factory-DvIGo_cP.js';
|
|
12
|
+
export { F as FindingToPolicyEditOptions, P as POLICY_EDIT_AXES, a as POLICY_EDIT_TARGET_SURFACES, b as PolicyEdit, c as PolicyEditAdmission, d as PolicyEditAdmissionOptions, e as PolicyEditAxis, f as PolicyEditChange, g as PolicyEditExpectedGain, h as PolicyEditGainDirection, i as PolicyEditGainUnit, j as PolicyEditInit, k as PolicyEditRisk, l as PolicyEditSchemaVersion, m as PolicyEditSource, n as PolicyEditTarget, o as PolicyEditTargetSurface, p as PolicyEditValidationError, q as admitPolicyEdit, r as applyPolicyEditToSurface, s as computePolicyEditId, t as isPolicyEdit, u as makePolicyEdit, v as policyEditFromFinding, w as policyEditsFromFindings, x as scorePolicyEditReadiness, y as validatePolicyEdit } from '../policy-edit-DQUXYMDm.js';
|
|
13
|
+
import { L as LlmClientOptions } from '../llm-client-DyqEH4jH.js';
|
|
14
14
|
import { AxFunction } from '@ax-llm/ax';
|
|
15
15
|
import '../verdict-C9MlYujm.js';
|
|
16
16
|
import '../schema-m0gsnbt3.js';
|
|
17
17
|
import '../store-BcFXE6LG.js';
|
|
18
18
|
import 'zod';
|
|
19
|
-
import '../run-record-
|
|
19
|
+
import '../run-record-I-Z3JNvO.js';
|
|
20
20
|
import '@tangle-network/agent-interface';
|
|
21
|
-
import '../errors-
|
|
21
|
+
import '../errors-oeQrLqXC.js';
|
|
22
22
|
import '../raw-provider-sink-C46HDghv.js';
|
|
23
23
|
|
|
24
24
|
/**
|
package/dist/analyst/index.js
CHANGED
|
@@ -11,13 +11,13 @@ import {
|
|
|
11
11
|
diffFindings,
|
|
12
12
|
emitSkillUsageFindings,
|
|
13
13
|
runSemanticConceptJudge
|
|
14
|
-
} from "../chunk-
|
|
14
|
+
} from "../chunk-5PK3626Q.js";
|
|
15
15
|
import "../chunk-DJWX3GVS.js";
|
|
16
16
|
import {
|
|
17
17
|
behavioralAnalyst,
|
|
18
18
|
buildDefaultAnalystRegistry,
|
|
19
19
|
deriveEfficiencyFindings
|
|
20
|
-
} from "../chunk-
|
|
20
|
+
} from "../chunk-QRVS7MX4.js";
|
|
21
21
|
import {
|
|
22
22
|
POLICY_EDIT_AXES,
|
|
23
23
|
POLICY_EDIT_TARGET_SURFACES,
|
|
@@ -34,7 +34,7 @@ import {
|
|
|
34
34
|
policyEditsFromFindings,
|
|
35
35
|
scorePolicyEditReadiness,
|
|
36
36
|
validatePolicyEdit
|
|
37
|
-
} from "../chunk-
|
|
37
|
+
} from "../chunk-LOJ2QVCE.js";
|
|
38
38
|
import {
|
|
39
39
|
ANALYST_SEVERITIES,
|
|
40
40
|
AnalystRegistry,
|
|
@@ -59,17 +59,17 @@ import {
|
|
|
59
59
|
renderPriorFindings,
|
|
60
60
|
stripCodeFences,
|
|
61
61
|
structureFindings
|
|
62
|
-
} from "../chunk-
|
|
63
|
-
import "../chunk-
|
|
62
|
+
} from "../chunk-2OGPXHOB.js";
|
|
63
|
+
import "../chunk-FUCQVFMU.js";
|
|
64
64
|
import {
|
|
65
65
|
computeFindingId,
|
|
66
66
|
makeFinding
|
|
67
67
|
} from "../chunk-45EEMHTC.js";
|
|
68
|
-
import "../chunk-
|
|
68
|
+
import "../chunk-LNQEP766.js";
|
|
69
69
|
import "../chunk-PC4UYEBM.js";
|
|
70
|
-
import "../chunk-
|
|
70
|
+
import "../chunk-XJYR7XFV.js";
|
|
71
71
|
import "../chunk-VSMTAMNK.js";
|
|
72
|
-
import "../chunk-
|
|
72
|
+
import "../chunk-ONWEPEDO.js";
|
|
73
73
|
import "../chunk-PZ5AY32C.js";
|
|
74
74
|
|
|
75
75
|
// src/analyst/adapters.ts
|
|
@@ -1,7 +1,7 @@
|
|
|
1
|
-
import { A as AnalystRegistry } from './default-registry-
|
|
2
|
-
import { a as DatasetScenario } from './dataset-
|
|
3
|
-
import { R as RunRecord } from './run-record-
|
|
4
|
-
import { I as InsightReport } from './insight-report-
|
|
1
|
+
import { A as AnalystRegistry } from './default-registry-BswHCXnU.js';
|
|
2
|
+
import { a as DatasetScenario } from './dataset-DS7ytHZU.js';
|
|
3
|
+
import { R as RunRecord } from './run-record-I-Z3JNvO.js';
|
|
4
|
+
import { I as InsightReport } from './insight-report-B4xrdwEK.js';
|
|
5
5
|
|
|
6
6
|
/**
|
|
7
7
|
* # `analyzeRuns()` — turn a set of agent runs into an actionable decision packet.
|
|
@@ -1,13 +1,13 @@
|
|
|
1
1
|
import { c as CalibrationReport } from '../calibration-BPmzuVPk.js';
|
|
2
2
|
import { O as OffPolicyEstimate, a as OffPolicyOptions, b as OffPolicyTrajectory } from '../off-policy-DiwuKKg7.js';
|
|
3
|
-
import { d as CodeAgentSessionSource, a as CodeAgentSessionIntakeOptions, c as CodeAgentSessionMetrics, C as CodeAgentSessionDiagnostic } from '../code-agent-session-
|
|
4
|
-
import { R as RunRecord, b as RunSplitTag } from '../run-record-
|
|
3
|
+
import { d as CodeAgentSessionSource, a as CodeAgentSessionIntakeOptions, c as CodeAgentSessionMetrics, C as CodeAgentSessionDiagnostic } from '../code-agent-session-rnJKlqmT.js';
|
|
4
|
+
import { R as RunRecord, b as RunSplitTag } from '../run-record-I-Z3JNvO.js';
|
|
5
5
|
import { T as TraceStore } from '../store-BcFXE6LG.js';
|
|
6
|
-
import { R as RuntimeTrajectoryRecord, P as ProjectRuntimeTrajectoryEvidenceOptions, a as RuntimeTrajectoryEvidenceProjection } from '../runtime-trajectory-
|
|
6
|
+
import { R as RuntimeTrajectoryRecord, P as ProjectRuntimeTrajectoryEvidenceOptions, a as RuntimeTrajectoryEvidenceProjection } from '../runtime-trajectory-iW9IhV3e.js';
|
|
7
7
|
import '../schema-m0gsnbt3.js';
|
|
8
8
|
import '../outcome-store-rnXLEqSn.js';
|
|
9
9
|
import '@tangle-network/agent-interface';
|
|
10
|
-
import '../errors-
|
|
10
|
+
import '../errors-oeQrLqXC.js';
|
|
11
11
|
|
|
12
12
|
declare const BELIEF_DECISION_KINDS: readonly ["continue", "verify", "ask", "retry", "stop", "memory-write", "memory-read", "tool-select", "skill-select", "workflow-select", "surface-promote"];
|
|
13
13
|
type BeliefDecisionKind = (typeof BELIEF_DECISION_KINDS)[number];
|
|
@@ -14,13 +14,13 @@ import {
|
|
|
14
14
|
import "../chunk-VI2UW6B6.js";
|
|
15
15
|
import {
|
|
16
16
|
offPolicyEstimateAll
|
|
17
|
-
} from "../chunk-
|
|
17
|
+
} from "../chunk-DTJ6QUQB.js";
|
|
18
18
|
import {
|
|
19
19
|
confidenceInterval
|
|
20
|
-
} from "../chunk-
|
|
20
|
+
} from "../chunk-XMSYF4A7.js";
|
|
21
21
|
import {
|
|
22
22
|
ValidationError
|
|
23
|
-
} from "../chunk-
|
|
23
|
+
} from "../chunk-ONWEPEDO.js";
|
|
24
24
|
import "../chunk-PZ5AY32C.js";
|
|
25
25
|
|
|
26
26
|
// src/belief-state/calibration.ts
|
|
@@ -1,5 +1,5 @@
|
|
|
1
|
-
export { B as BENCHMARK_SPLIT_SEED, a as BenchmarkAdapter, b as BenchmarkDatasetItem, c as BenchmarkEvaluation, d as deterministicSplit, e as routing } from '../index-
|
|
2
|
-
import '../run-record-
|
|
1
|
+
export { B as BENCHMARK_SPLIT_SEED, a as BenchmarkAdapter, b as BenchmarkDatasetItem, c as BenchmarkEvaluation, d as deterministicSplit, e as routing } from '../index-C2CC_dry.js';
|
|
2
|
+
import '../run-record-I-Z3JNvO.js';
|
|
3
3
|
import '@tangle-network/agent-interface';
|
|
4
|
-
import '../errors-
|
|
4
|
+
import '../errors-oeQrLqXC.js';
|
|
5
5
|
import '../schema-m0gsnbt3.js';
|
|
@@ -1,19 +1,19 @@
|
|
|
1
1
|
import {
|
|
2
2
|
SandboxHarness,
|
|
3
3
|
runTestGradedScenario
|
|
4
|
-
} from "../chunk-
|
|
4
|
+
} from "../chunk-HZHNRYHK.js";
|
|
5
5
|
import {
|
|
6
6
|
pearsonR,
|
|
7
7
|
spearmanR
|
|
8
|
-
} from "../chunk-
|
|
8
|
+
} from "../chunk-XMSYF4A7.js";
|
|
9
9
|
import {
|
|
10
10
|
judgeSpans
|
|
11
|
-
} from "../chunk-
|
|
11
|
+
} from "../chunk-JZXGWLK5.js";
|
|
12
12
|
import "../chunk-5BKGXME7.js";
|
|
13
13
|
import {
|
|
14
14
|
TraceEmitter
|
|
15
15
|
} from "../chunk-TVVP3ZZQ.js";
|
|
16
|
-
import "../chunk-
|
|
16
|
+
import "../chunk-ONWEPEDO.js";
|
|
17
17
|
import "../chunk-PZ5AY32C.js";
|
|
18
18
|
|
|
19
19
|
// src/builder-eval/builder-session.ts
|
package/dist/campaign/index.d.ts
CHANGED
|
@@ -1,34 +1,34 @@
|
|
|
1
|
-
import { S as SignedManifest, B as BackendIntegrityReport, C as CompletionRequirement, R as RuntimeEventLike, a as CompletionVerdict, P as ProducedState, b as CorrectnessChecker } from '../pre-registration-
|
|
2
|
-
export { L as LlmJudgeDimension, c as LlmJudgeOptions, l as llmJudge } from '../pre-registration-
|
|
1
|
+
import { S as SignedManifest, B as BackendIntegrityReport, C as CompletionRequirement, R as RuntimeEventLike, a as CompletionVerdict, P as ProducedState, b as CorrectnessChecker } from '../pre-registration-D8Zr8-rr.js';
|
|
2
|
+
export { L as LlmJudgeDimension, c as LlmJudgeOptions, l as llmJudge } from '../pre-registration-D8Zr8-rr.js';
|
|
3
3
|
import { A as AnalyzeTracesOptions, a as AnalyzeTracesInput, b as AnalyzeTracesResult } from '../analyst-C8HHvfJp.js';
|
|
4
|
-
import { S as Scenario, M as MutableSurface, b as DispatchContext, a as JudgeConfig, e as GenerationRecord, g as Gate, J as JudgeScore, L as LabeledScenarioStore, s as LabeledScenarioWrite, t as LabeledScenarioSampleArgs, u as LabeledScenarioRecord, v as LabelTrust, f as SurfaceProposer, w as ProposedCandidate, x as ProposeContext, y as LabeledScenarioSource, C as CampaignResult, o as CodeSurface } from '../types-
|
|
5
|
-
export { k as CampaignAggregates, l as CampaignArtifactWriter, m as CampaignCellResult, n as CampaignCostMeter, z as CampaignTokenUsage, d as CampaignTraceWriter, D as DispatchFn, h as GateContext, j as GateDecision, G as GateResult, p as GenerationCandidate, A as JudgeAggregate, c as JudgeDimension, i as Mutator, O as OptimizationProposer, q as OptimizerConfig, P as ParetoParent, R as RedactionStatus, B as ScenarioAggregate, r as SessionScript, T as TraceSpan, E as isProposedCandidate, F as labelTrustRank } from '../types-
|
|
6
|
-
import { e as CampaignRunPlan, P as PlanCampaignRunOptions, C as CampaignStorage, R as RunCampaignOptions, c as RunImprovementLoopOptions } from '../gepa-
|
|
7
|
-
export { h as CampaignRunPlanCell, j as GepaProposerConstraints, G as GepaProposerOptions, O as OpenAutoPrOptions, k as OpenAutoPrResult, b as RunImprovementLoopResult, a as RunOptimizationOptions, l as RunOptimizationResult, m as countSentenceEdits, n as defaultRenderDiff, o as extractH2Sections, f as fsCampaignStorage, g as gepaProposer, i as inMemoryCampaignStorage, p as openAutoPr, q as planCampaignRun, r as runCampaign, d as runImprovementLoop, s as runOptimization, t as surfaceHash } from '../gepa-
|
|
8
|
-
export { A as AxisEvidence, a as AxisVerdict, B as BuildEvidenceVectorOptions, k as BuildLoopProvenanceArgs, D as DefaultProductionGateOptions, l as EmitLoopProvenanceArgs, m as EmitLoopProvenanceResult, E as EvidenceVector, b as EvolutionaryProposerOptions, H as HeldOutGateOptions, n as LoopProvenanceBackend, o as LoopProvenanceCandidate, L as LoopProvenanceRecord, O as ObjectiveSource, P as ParetoSignificanceGateOptions, c as PromotionObjective, d as PromotionPolicy, R as RunEvalOptions, e as buildEvidenceVector, q as buildLoopProvenanceRecord, f as composeGate, g as defaultProductionGate, s as emitLoopProvenance, h as evolutionaryProposer, i as heldOutGate, t as loopProvenanceSpans, p as paretoPolicy, j as paretoSignificanceGate, u as provenanceRecordPath, v as provenanceSpansPath, r as runEval, w as surfaceContentHash } from '../provenance-
|
|
9
|
-
import { E as EProcessState, a as PairedBootstrapResult } from '../statistics-
|
|
10
|
-
import { L as LlmClientOptions } from '../llm-client-
|
|
4
|
+
import { S as Scenario, M as MutableSurface, b as DispatchContext, a as JudgeConfig, e as GenerationRecord, g as Gate, J as JudgeScore, L as LabeledScenarioStore, s as LabeledScenarioWrite, t as LabeledScenarioSampleArgs, u as LabeledScenarioRecord, v as LabelTrust, f as SurfaceProposer, w as ProposedCandidate, x as ProposeContext, y as LabeledScenarioSource, C as CampaignResult, o as CodeSurface } from '../types-Mh6I44ub.js';
|
|
5
|
+
export { k as CampaignAggregates, l as CampaignArtifactWriter, m as CampaignCellResult, n as CampaignCostMeter, z as CampaignTokenUsage, d as CampaignTraceWriter, D as DispatchFn, h as GateContext, j as GateDecision, G as GateResult, p as GenerationCandidate, A as JudgeAggregate, c as JudgeDimension, i as Mutator, O as OptimizationProposer, q as OptimizerConfig, P as ParetoParent, R as RedactionStatus, B as ScenarioAggregate, r as SessionScript, T as TraceSpan, E as isProposedCandidate, F as labelTrustRank } from '../types-Mh6I44ub.js';
|
|
6
|
+
import { e as CampaignRunPlan, P as PlanCampaignRunOptions, C as CampaignStorage, R as RunCampaignOptions, c as RunImprovementLoopOptions } from '../gepa-Dn0gtj9n.js';
|
|
7
|
+
export { h as CampaignRunPlanCell, j as GepaProposerConstraints, G as GepaProposerOptions, O as OpenAutoPrOptions, k as OpenAutoPrResult, b as RunImprovementLoopResult, a as RunOptimizationOptions, l as RunOptimizationResult, m as countSentenceEdits, n as defaultRenderDiff, o as extractH2Sections, f as fsCampaignStorage, g as gepaProposer, i as inMemoryCampaignStorage, p as openAutoPr, q as planCampaignRun, r as runCampaign, d as runImprovementLoop, s as runOptimization, t as surfaceHash } from '../gepa-Dn0gtj9n.js';
|
|
8
|
+
export { A as AxisEvidence, a as AxisVerdict, B as BuildEvidenceVectorOptions, k as BuildLoopProvenanceArgs, D as DefaultProductionGateOptions, l as EmitLoopProvenanceArgs, m as EmitLoopProvenanceResult, E as EvidenceVector, b as EvolutionaryProposerOptions, H as HeldOutGateOptions, n as LoopProvenanceBackend, o as LoopProvenanceCandidate, L as LoopProvenanceRecord, O as ObjectiveSource, P as ParetoSignificanceGateOptions, c as PromotionObjective, d as PromotionPolicy, R as RunEvalOptions, e as buildEvidenceVector, q as buildLoopProvenanceRecord, f as composeGate, g as defaultProductionGate, s as emitLoopProvenance, h as evolutionaryProposer, i as heldOutGate, t as loopProvenanceSpans, p as paretoPolicy, j as paretoSignificanceGate, u as provenanceRecordPath, v as provenanceSpansPath, r as runEval, w as surfaceContentHash } from '../provenance-phkRBl4h.js';
|
|
9
|
+
import { E as EProcessState, a as PairedBootstrapResult } from '../statistics-D88peojY.js';
|
|
10
|
+
import { L as LlmClientOptions } from '../llm-client-DyqEH4jH.js';
|
|
11
11
|
import { AgentProfile } from '@tangle-network/agent-interface';
|
|
12
|
-
import { A as AgentEvalError } from '../errors-
|
|
13
|
-
import { b as RunSplitTag, R as RunRecord } from '../run-record-
|
|
14
|
-
import { b as PolicyEdit, F as FindingToPolicyEditOptions, d as PolicyEditAdmissionOptions, c as PolicyEditAdmission } from '../policy-edit-
|
|
15
|
-
import { T as TraceAnalystKindSpec } from '../kind-factory-
|
|
16
|
-
import { A as AnalystFinding } from '../types-
|
|
12
|
+
import { A as AgentEvalError } from '../errors-oeQrLqXC.js';
|
|
13
|
+
import { b as RunSplitTag, R as RunRecord } from '../run-record-I-Z3JNvO.js';
|
|
14
|
+
import { b as PolicyEdit, F as FindingToPolicyEditOptions, d as PolicyEditAdmissionOptions, c as PolicyEditAdmission } from '../policy-edit-DQUXYMDm.js';
|
|
15
|
+
import { T as TraceAnalystKindSpec } from '../kind-factory-DvIGo_cP.js';
|
|
16
|
+
import { A as AnalystFinding } from '../types-D1ytG0Yg.js';
|
|
17
17
|
import '@tangle-network/tcloud';
|
|
18
18
|
import '../raw-provider-sink-C46HDghv.js';
|
|
19
19
|
import '../verdict-C9MlYujm.js';
|
|
20
20
|
import '@ax-llm/ax';
|
|
21
21
|
import '../store-C1YxJDEK.js';
|
|
22
|
-
import '../red-team-
|
|
23
|
-
import '../dataset-
|
|
22
|
+
import '../red-team-KmmiqBlY.js';
|
|
23
|
+
import '../dataset-DS7ytHZU.js';
|
|
24
24
|
import '../store-BcFXE6LG.js';
|
|
25
25
|
import '../schema-m0gsnbt3.js';
|
|
26
26
|
import '../pareto-E-pembql.js';
|
|
27
27
|
import '../hosted/index.js';
|
|
28
|
-
import '../insight-report-
|
|
29
|
-
import '../summary-report-
|
|
28
|
+
import '../insight-report-B4xrdwEK.js';
|
|
29
|
+
import '../summary-report-QMZVe3P-.js';
|
|
30
30
|
import '../failure-cluster-DH9Flgcf.js';
|
|
31
|
-
import '../judge-calibration-
|
|
31
|
+
import '../judge-calibration-7C-IDmKr.js';
|
|
32
32
|
import '../types-C7DGg5ex.js';
|
|
33
33
|
import 'zod';
|
|
34
34
|
|
|
@@ -184,9 +184,19 @@ interface PlanEvalFixtureRunOptions<TArtifact = unknown> extends Pick<PlanCampai
|
|
|
184
184
|
type EvalFixtureRunPlan = CampaignRunPlan & {
|
|
185
185
|
fixtures: Array<Pick<EvalFixtureScenario, 'fixtureName' | 'fixturePath' | 'fingerprint'>>;
|
|
186
186
|
};
|
|
187
|
+
/** Walk `evalsDir` and return the relative name of every fixture directory (one containing an exact-case `PROMPT.md`). */
|
|
187
188
|
declare function discoverEvalFixtures(evalsDir: string): string[];
|
|
189
|
+
/**
|
|
190
|
+
* Load ONE fixture by name: reads `PROMPT.md` (plus `EVAL.ts`/`EVAL.tsx` and `package.json` under
|
|
191
|
+
* `vitest` validation) and content-fingerprints the full file set for cache identity.
|
|
192
|
+
*/
|
|
188
193
|
declare function loadEvalFixture(evalsDir: string, name: string, options?: EvalFixtureLoadOptions): EvalFixture;
|
|
194
|
+
/** Load fixtures (all discovered, or just `names`) as campaign `Scenario`s tagged `eval-fixture`. */
|
|
189
195
|
declare function loadEvalFixtureScenarios(evalsDir: string, options?: LoadEvalFixtureScenariosOptions): EvalFixtureScenario[];
|
|
196
|
+
/**
|
|
197
|
+
* Dry-run planner for a fixture campaign: loads the scenarios, delegates to `planCampaignRun`,
|
|
198
|
+
* and returns the plan plus each fixture's name/path/fingerprint.
|
|
199
|
+
*/
|
|
190
200
|
declare function planEvalFixtureRun<TArtifact = unknown>(options: PlanEvalFixtureRunOptions<TArtifact>): EvalFixtureRunPlan;
|
|
191
201
|
|
|
192
202
|
/**
|
|
@@ -467,10 +477,15 @@ interface FsLabeledScenarioStoreOptions {
|
|
|
467
477
|
/** Test seam — override `Date.now()` for deterministic tests. */
|
|
468
478
|
now?: () => number;
|
|
469
479
|
}
|
|
480
|
+
/** Typed rejection from a labeled-scenario store (bad provenance, rate limit, invalid sample args) — carries a stable string `code`. */
|
|
470
481
|
declare class LabeledScenarioStoreError extends Error {
|
|
471
482
|
readonly code: string;
|
|
472
483
|
constructor(code: string, message: string);
|
|
473
484
|
}
|
|
485
|
+
/**
|
|
486
|
+
* Filesystem `LabeledScenarioStore`: appends one JSONL file per source with provenance and
|
|
487
|
+
* rate-limit guards. For tests, local dev, and small workloads — high-throughput lands in Turso.
|
|
488
|
+
*/
|
|
474
489
|
declare class FsLabeledScenarioStore implements LabeledScenarioStore {
|
|
475
490
|
private readonly options;
|
|
476
491
|
private readonly now;
|
|
@@ -583,6 +598,9 @@ interface FapoProposerOptions<TFindings = unknown> {
|
|
|
583
598
|
}
|
|
584
599
|
/** Build a FAPO policy proposer from level-specific candidate generators. */
|
|
585
600
|
declare function fapoProposer<TFindings = unknown>(opts: FapoProposerOptions<TFindings>): SurfaceProposer<TFindings>;
|
|
601
|
+
/**
|
|
602
|
+
* Scan a findings array and extract FAPO attribution signals — per-level counts and failure clusters used to decide which optimization level to escalate to next.
|
|
603
|
+
*/
|
|
586
604
|
declare function extractFapoAttributionSignals(findings: readonly unknown[]): FapoAttributionSignals;
|
|
587
605
|
type JsonPrimitive = string | number | boolean | null;
|
|
588
606
|
type JsonValue = JsonPrimitive | JsonValue[] | {
|
|
@@ -687,6 +705,9 @@ interface CompareProposersOptions<TScenario extends Scenario, TArtifact> extends
|
|
|
687
705
|
/** CI confidence. Default 0.95. */
|
|
688
706
|
confidence?: number;
|
|
689
707
|
}
|
|
708
|
+
/**
|
|
709
|
+
* Run a head-to-head lift benchmark across surface proposers on a shared holdout, returning per-proposer lift CIs and pairwise "who wins" verdicts.
|
|
710
|
+
*/
|
|
690
711
|
declare function compareProposers<TScenario extends Scenario, TArtifact>(opts: CompareProposersOptions<TScenario, TArtifact>): Promise<ProposerComparison>;
|
|
691
712
|
/** Shared corpus + transport for the three built-in optimizer entries. */
|
|
692
713
|
interface OptimizerEntryConfig<TScenario extends Scenario, TArtifact> {
|
|
@@ -750,6 +771,9 @@ interface FapoEntryConfig<TScenario extends Scenario, TArtifact> extends Optimiz
|
|
|
750
771
|
/** FAPO policy knobs: scope, reviewer, plateau thresholds. */
|
|
751
772
|
fapo?: Omit<FapoProposerOptions, 'proposers' | 'promptProposer' | 'parameterProposer' | 'structuralProposer'>;
|
|
752
773
|
}
|
|
774
|
+
/**
|
|
775
|
+
* Build a `ProposerEntry` that runs the full FAPO escalation policy (prompt → parameter → structural) as a single comparable optimizer entry.
|
|
776
|
+
*/
|
|
753
777
|
declare function fapoEscalationEntry<TScenario extends Scenario, TArtifact>(config: FapoEntryConfig<TScenario, TArtifact>, name?: string): ProposerEntry;
|
|
754
778
|
|
|
755
779
|
/**
|
|
@@ -896,6 +920,9 @@ interface RunProfileMatrixResult<TArtifact, TScenario extends Scenario> {
|
|
|
896
920
|
/** The raw per-profile campaign results, keyed by profile id. */
|
|
897
921
|
campaigns: Record<string, CampaignResult<TArtifact, TScenario>>;
|
|
898
922
|
}
|
|
923
|
+
/**
|
|
924
|
+
* Profile × scenario matrix runner: fan N agent profiles across M scenarios, project each cell to a validated `RunRecord` with real token usage, and enforce the backend-integrity guard before returning.
|
|
925
|
+
*/
|
|
899
926
|
declare function runProfileMatrix<TScenario extends Scenario, TArtifact>(opts: RunProfileMatrixOptions<TScenario, TArtifact>): Promise<RunProfileMatrixResult<TArtifact, TScenario>>;
|
|
900
927
|
|
|
901
928
|
/**
|
|
@@ -1151,6 +1178,9 @@ interface SkillOptProposer extends SurfaceProposer {
|
|
|
1151
1178
|
* acceptance/budget/buffer). Returns structured patches, NOT surfaces. */
|
|
1152
1179
|
proposePatches(args: ProposePatchesArgs): Promise<SkillPatch[]>;
|
|
1153
1180
|
}
|
|
1181
|
+
/**
|
|
1182
|
+
* SkillOpt proposer: proposes bounded, anchored patch operations (add/delete/replace) on a skill document, conforming to both the patch-native `SkillOptProposer` and the generic `SurfaceProposer` interfaces.
|
|
1183
|
+
*/
|
|
1154
1184
|
declare function skillOptProposer(opts: SkillOptProposerOptions): SkillOptProposer;
|
|
1155
1185
|
/** Parse + validate the patch response. Throws `SkillPatchParseError` when the
|
|
1156
1186
|
* response is not valid JSON at all (a router/model failure the caller must
|
|
@@ -1160,6 +1190,9 @@ declare function skillOptProposer(opts: SkillOptProposerOptions): SkillOptPropos
|
|
|
1160
1190
|
declare class SkillPatchParseError extends Error {
|
|
1161
1191
|
constructor(message: string);
|
|
1162
1192
|
}
|
|
1193
|
+
/**
|
|
1194
|
+
* Parse a SkillOpt LLM response into validated `SkillPatch` objects, throwing `SkillPatchParseError` on malformed JSON and silently dropping ops that violate the edit budget.
|
|
1195
|
+
*/
|
|
1163
1196
|
declare function parseSkillPatchResponse(raw: string, maxPatches: number, editBudget: number): SkillPatch[];
|
|
1164
1197
|
|
|
1165
1198
|
/**
|
|
@@ -1254,6 +1287,9 @@ interface RunSkillOptResult {
|
|
|
1254
1287
|
* acceptance) the hill-climb ran. */
|
|
1255
1288
|
totalCostUsd: number;
|
|
1256
1289
|
}
|
|
1290
|
+
/**
|
|
1291
|
+
* SkillOpt sequential hill-climb: each epoch reflects on train-scenario weaknesses, proposes bounded patches, accepts the first patch that strictly improves the held-out composite, and anneals the edit budget on consecutive rejections.
|
|
1292
|
+
*/
|
|
1257
1293
|
declare function runSkillOpt<TScenario extends Scenario, TArtifact>(opts: RunSkillOptOptions<TScenario, TArtifact>): Promise<RunSkillOptResult>;
|
|
1258
1294
|
|
|
1259
1295
|
/**
|
|
@@ -1287,6 +1323,9 @@ interface AceProposerOptions {
|
|
|
1287
1323
|
/** Heading rendered above the bullets inside the block. */
|
|
1288
1324
|
sectionHeading?: string;
|
|
1289
1325
|
}
|
|
1326
|
+
/**
|
|
1327
|
+
* Append-only context engineering proposer: grows a skill playbook by appending generation-tagged lessons without merging or overwriting prior entries.
|
|
1328
|
+
*/
|
|
1290
1329
|
declare function aceProposer(opts?: AceProposerOptions): SurfaceProposer;
|
|
1291
1330
|
|
|
1292
1331
|
/**
|
|
@@ -1399,6 +1438,10 @@ interface PolicyEditProposerOptions {
|
|
|
1399
1438
|
/** Optional callback for audit UIs/tests that need rejected edit reasons. */
|
|
1400
1439
|
onAdmission?: (admission: PolicyEditAdmission) => void;
|
|
1401
1440
|
}
|
|
1441
|
+
/**
|
|
1442
|
+
* `SurfaceProposer` that admission-checks typed analyst `PolicyEdit`s and applies each
|
|
1443
|
+
* admitted edit to the current surface as one measured candidate.
|
|
1444
|
+
*/
|
|
1402
1445
|
declare function policyEditProposer(opts?: PolicyEditProposerOptions): SurfaceProposer;
|
|
1403
1446
|
|
|
1404
1447
|
/**
|
|
@@ -1517,6 +1560,7 @@ interface WorktreeAdapter {
|
|
|
1517
1560
|
/** Remove the worktree (and its branch) — called for losing candidates. */
|
|
1518
1561
|
discard(worktree: Worktree): Promise<void>;
|
|
1519
1562
|
}
|
|
1563
|
+
/** Typed failure from a `WorktreeAdapter` operation (create/finalize/discard) — wraps the underlying git error as `cause`. */
|
|
1520
1564
|
declare class WorktreeAdapterError extends Error {
|
|
1521
1565
|
readonly cause?: unknown | undefined;
|
|
1522
1566
|
constructor(message: string, cause?: unknown | undefined);
|
|
@@ -1531,6 +1575,9 @@ interface GitWorktreeAdapterOptions {
|
|
|
1531
1575
|
/** Test seam — defaults to a real `git` runner. */
|
|
1532
1576
|
git?: (args: string[], cwd: string) => string;
|
|
1533
1577
|
}
|
|
1578
|
+
/**
|
|
1579
|
+
* Git-backed `WorktreeAdapter`: creates isolated worktrees on fresh branches, commits agent changes, and discards losers.
|
|
1580
|
+
*/
|
|
1534
1581
|
declare function gitWorktreeAdapter(opts: GitWorktreeAdapterOptions): WorktreeAdapter;
|
|
1535
1582
|
/** Resolve a `CodeSurface`'s worktreeRef to a directory the measurement can
|
|
1536
1583
|
* run the worker in. A path ref is returned as-is; anything else is treated
|
package/dist/campaign/index.js
CHANGED
|
@@ -10,7 +10,7 @@ import {
|
|
|
10
10
|
paretoPolicy,
|
|
11
11
|
paretoSignificanceGate,
|
|
12
12
|
runEval
|
|
13
|
-
} from "../chunk-
|
|
13
|
+
} from "../chunk-Z7FK73R5.js";
|
|
14
14
|
import {
|
|
15
15
|
HARNESS_NATIVE_MODEL,
|
|
16
16
|
agentProfileHash,
|
|
@@ -20,7 +20,7 @@ import {
|
|
|
20
20
|
harnessAxisOf,
|
|
21
21
|
llmJudge,
|
|
22
22
|
verifyCompletion
|
|
23
|
-
} from "../chunk-
|
|
23
|
+
} from "../chunk-BBQILVBH.js";
|
|
24
24
|
import {
|
|
25
25
|
buildLoopProvenanceRecord,
|
|
26
26
|
campaignBreakdown,
|
|
@@ -42,7 +42,7 @@ import {
|
|
|
42
42
|
runOptimization,
|
|
43
43
|
surfaceContentHash,
|
|
44
44
|
surfaceHash
|
|
45
|
-
} from "../chunk-
|
|
45
|
+
} from "../chunk-ZKIL3VOD.js";
|
|
46
46
|
import {
|
|
47
47
|
assertRealBackend,
|
|
48
48
|
contentHash,
|
|
@@ -53,7 +53,7 @@ import {
|
|
|
53
53
|
runCampaign,
|
|
54
54
|
summarizeBackendIntegrity,
|
|
55
55
|
tangleTracesRoot
|
|
56
|
-
} from "../chunk-
|
|
56
|
+
} from "../chunk-3PFZBGMR.js";
|
|
57
57
|
import {
|
|
58
58
|
estimateCost,
|
|
59
59
|
isModelPriced
|
|
@@ -63,43 +63,43 @@ import {
|
|
|
63
63
|
applyPolicyEditToSurface,
|
|
64
64
|
isPolicyEdit,
|
|
65
65
|
policyEditsFromFindings
|
|
66
|
-
} from "../chunk-
|
|
66
|
+
} from "../chunk-LOJ2QVCE.js";
|
|
67
67
|
import {
|
|
68
68
|
AnalystRegistry,
|
|
69
69
|
DEFAULT_TRACE_ANALYST_KINDS,
|
|
70
70
|
createTraceAnalystKind
|
|
71
|
-
} from "../chunk-
|
|
72
|
-
import "../chunk-
|
|
71
|
+
} from "../chunk-2OGPXHOB.js";
|
|
72
|
+
import "../chunk-N22ZO7FV.js";
|
|
73
73
|
import {
|
|
74
74
|
callLlm
|
|
75
|
-
} from "../chunk-
|
|
75
|
+
} from "../chunk-FUCQVFMU.js";
|
|
76
76
|
import "../chunk-45EEMHTC.js";
|
|
77
77
|
import {
|
|
78
78
|
eProcess,
|
|
79
79
|
mulberry32,
|
|
80
80
|
pairedBootstrap
|
|
81
|
-
} from "../chunk-
|
|
81
|
+
} from "../chunk-XMSYF4A7.js";
|
|
82
82
|
import {
|
|
83
83
|
analyzeTraces
|
|
84
|
-
} from "../chunk-
|
|
84
|
+
} from "../chunk-RPDDVKI7.js";
|
|
85
85
|
import "../chunk-GGE4NNQT.js";
|
|
86
86
|
import {
|
|
87
87
|
OtlpFileTraceStore
|
|
88
|
-
} from "../chunk-
|
|
88
|
+
} from "../chunk-LNQEP766.js";
|
|
89
89
|
import "../chunk-PC4UYEBM.js";
|
|
90
90
|
import {
|
|
91
91
|
modelHasSnapshot,
|
|
92
92
|
validateRunRecord
|
|
93
|
-
} from "../chunk-
|
|
93
|
+
} from "../chunk-VK6HBGAE.js";
|
|
94
94
|
import {
|
|
95
95
|
buildAgentProfileCell
|
|
96
|
-
} from "../chunk-
|
|
96
|
+
} from "../chunk-XJYR7XFV.js";
|
|
97
97
|
import {
|
|
98
98
|
canonicalize
|
|
99
99
|
} from "../chunk-VSMTAMNK.js";
|
|
100
100
|
import {
|
|
101
101
|
AgentEvalError
|
|
102
|
-
} from "../chunk-
|
|
102
|
+
} from "../chunk-ONWEPEDO.js";
|
|
103
103
|
import "../chunk-PZ5AY32C.js";
|
|
104
104
|
|
|
105
105
|
// src/campaign/analyst-surface.ts
|