@tangle-network/agent-eval 0.80.0 → 0.82.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (95) hide show
  1. package/CHANGELOG.md +27 -0
  2. package/README.md +53 -152
  3. package/dist/adapters/http.d.ts +2 -2
  4. package/dist/adapters/langchain.d.ts +2 -2
  5. package/dist/adapters/otel.d.ts +4 -4
  6. package/dist/{agent-profile-aSEaJ9Pl.d.ts → agent-profile-D0PBIWlV.d.ts} +14 -2
  7. package/dist/analyst/index.d.ts +10 -10
  8. package/dist/analyst/index.js +3 -3
  9. package/dist/{analyst-t7zZS3TV.d.ts → analyst-C8HHvfJp.d.ts} +1 -1
  10. package/dist/belief-state/index.d.ts +344 -8
  11. package/dist/belief-state/index.js +1518 -142
  12. package/dist/belief-state/index.js.map +1 -1
  13. package/dist/benchmarks/index.d.ts +2 -2
  14. package/dist/campaign/index.d.ts +40 -120
  15. package/dist/campaign/index.js +129 -238
  16. package/dist/campaign/index.js.map +1 -1
  17. package/dist/{chunk-RPLZ4OIB.js → chunk-BABOZOSN.js} +7 -4
  18. package/dist/{chunk-RPLZ4OIB.js.map → chunk-BABOZOSN.js.map} +1 -1
  19. package/dist/{chunk-IHDHUN2X.js → chunk-CVVHBFGN.js} +3 -3
  20. package/dist/chunk-CVVHBFGN.js.map +1 -0
  21. package/dist/{chunk-B26KI423.js → chunk-FZWAFVAA.js} +2 -2
  22. package/dist/{chunk-ITBRCT73.js → chunk-IDVBLYCY.js} +2 -10
  23. package/dist/chunk-IDVBLYCY.js.map +1 -0
  24. package/dist/{chunk-5LVWPNS5.js → chunk-L5G7OUKD.js} +4 -4
  25. package/dist/{chunk-5LVWPNS5.js.map → chunk-L5G7OUKD.js.map} +1 -1
  26. package/dist/{chunk-GXHLRXDI.js → chunk-OTYQPHPL.js} +4 -4
  27. package/dist/{chunk-6REHLN5J.js → chunk-QS3RBQPI.js} +2 -2
  28. package/dist/{chunk-GWGO2K6Y.js → chunk-RBNA5AZT.js} +2 -2
  29. package/dist/chunk-S42AWHMP.js +697 -0
  30. package/dist/chunk-S42AWHMP.js.map +1 -0
  31. package/dist/chunk-VI2UW6B6.js +162 -0
  32. package/dist/chunk-VI2UW6B6.js.map +1 -0
  33. package/dist/{chunk-CF67I6QY.js → chunk-VIDQF3F5.js} +2 -2
  34. package/dist/{chunk-XXNIODOM.js → chunk-WJL2NJXN.js} +3 -3
  35. package/dist/{chunk-LB2UOI5F.js → chunk-YGYXHNAQ.js} +47 -160
  36. package/dist/chunk-YGYXHNAQ.js.map +1 -0
  37. package/dist/{chunk-KX6F6NCG.js → chunk-Z7VFTS2J.js} +2 -2
  38. package/dist/{chunk-ZPSKPT3V.js → chunk-ZZ2HOPME.js} +5 -2
  39. package/dist/chunk-ZZ2HOPME.js.map +1 -0
  40. package/dist/cli.js +2 -2
  41. package/dist/code-agent-session-BRXmavYv.d.ts +80 -0
  42. package/dist/contract/index.d.ts +45 -15
  43. package/dist/contract/index.js +32 -7
  44. package/dist/contract/index.js.map +1 -1
  45. package/dist/{control-CehLtoET.d.ts → control-GeE8OhpN.d.ts} +1 -1
  46. package/dist/control.d.ts +2 -2
  47. package/dist/hosted/index.d.ts +4 -4
  48. package/dist/{index-B1RKber3.d.ts → index-DE3RXAXD.d.ts} +1 -1
  49. package/dist/index.d.ts +78 -287
  50. package/dist/index.js +87 -410
  51. package/dist/index.js.map +1 -1
  52. package/dist/{insight-report-dlpEzQDi.d.ts → insight-report-3ADTfClO.d.ts} +1 -1
  53. package/dist/{kind-factory-DqV2t1Xk.d.ts → kind-factory-CVecZZG_.d.ts} +2 -2
  54. package/dist/{llm-client-DbjLfz-K.d.ts → llm-client-CuUg2Mn3.d.ts} +1 -1
  55. package/dist/meta-eval/index.d.ts +2 -2
  56. package/dist/openapi.json +1 -1
  57. package/dist/pipelines/index.js +2 -2
  58. package/dist/{provenance-jG-Gngg8.d.ts → provenance-DPpNIOJD.d.ts} +4 -4
  59. package/dist/{registry-BK0Zee01.d.ts → registry-DrEQ3Luj.d.ts} +1 -1
  60. package/dist/{release-report-CXXZlR8g.d.ts → release-report-hlNtD12q.d.ts} +2 -2
  61. package/dist/reporting.d.ts +5 -5
  62. package/dist/reporting.js +3 -3
  63. package/dist/{researcher-rInLj9De.d.ts → researcher-BLPHBbNV.d.ts} +3 -3
  64. package/dist/rl.d.ts +7 -7
  65. package/dist/rl.js +4 -4
  66. package/dist/{rubric-predictive-validity-CLPuwiUw.d.ts → rubric-predictive-validity-CnEl9Jc8.d.ts} +1 -1
  67. package/dist/{run-campaign-OVEZF24D.js → run-campaign-4Y5V5CN3.js} +3 -3
  68. package/dist/{run-improvement-loop-BAl_aVOZ.d.ts → run-improvement-loop-CNqQckTj.d.ts} +3 -3
  69. package/dist/{run-record-sItO5ftF.d.ts → run-record-De9VarXR.d.ts} +1 -1
  70. package/dist/{semantic-concept-judge-qXEUV2w7.d.ts → semantic-concept-judge-DIEgr_6v.d.ts} +6 -6
  71. package/dist/{statistics-B7yCbi9i.d.ts → statistics-CnC1FMbx.d.ts} +3 -7
  72. package/dist/{store-GmBE2pZZ.d.ts → store-C1YxJDEK.d.ts} +1 -1
  73. package/dist/{summary-report-BTaXq1TS.d.ts → summary-report-Db0dDSWP.d.ts} +1 -1
  74. package/dist/traces.d.ts +5 -5
  75. package/dist/{types-DRvV0zRo.d.ts → types-Cu3u_x59.d.ts} +3 -3
  76. package/dist/{types-4mm2msnR.d.ts → types-D7lLRYe9.d.ts} +1 -1
  77. package/dist/wire/index.js +2 -2
  78. package/dist/workflow/index.d.ts +7 -7
  79. package/dist/workflow/index.js +1 -1
  80. package/docs/concepts.md +1 -0
  81. package/docs/research/belief-state-agent-eval-roadmap.md +39 -7
  82. package/docs/self-improvement-map.md +111 -0
  83. package/package.json +2 -2
  84. package/dist/chunk-IHDHUN2X.js.map +0 -1
  85. package/dist/chunk-ITBRCT73.js.map +0 -1
  86. package/dist/chunk-LB2UOI5F.js.map +0 -1
  87. package/dist/chunk-ZPSKPT3V.js.map +0 -1
  88. /package/dist/{chunk-B26KI423.js.map → chunk-FZWAFVAA.js.map} +0 -0
  89. /package/dist/{chunk-GXHLRXDI.js.map → chunk-OTYQPHPL.js.map} +0 -0
  90. /package/dist/{chunk-6REHLN5J.js.map → chunk-QS3RBQPI.js.map} +0 -0
  91. /package/dist/{chunk-GWGO2K6Y.js.map → chunk-RBNA5AZT.js.map} +0 -0
  92. /package/dist/{chunk-CF67I6QY.js.map → chunk-VIDQF3F5.js.map} +0 -0
  93. /package/dist/{chunk-XXNIODOM.js.map → chunk-WJL2NJXN.js.map} +0 -0
  94. /package/dist/{chunk-KX6F6NCG.js.map → chunk-Z7VFTS2J.js.map} +0 -0
  95. /package/dist/{run-campaign-OVEZF24D.js.map → run-campaign-4Y5V5CN3.js.map} +0 -0
@@ -1,11 +1,78 @@
1
1
  import { c as CalibrationReport } from '../calibration-Cpr3WaX3.js';
2
2
  import { O as OffPolicyEstimate, a as OffPolicyOptions, b as OffPolicyTrajectory } from '../off-policy-DiwuKKg7.js';
3
+ import { d as CodeAgentSessionSource, a as CodeAgentSessionIntakeOptions, c as CodeAgentSessionMetrics, C as CodeAgentSessionDiagnostic } from '../code-agent-session-BRXmavYv.js';
4
+ import { R as RunRecord } from '../run-record-De9VarXR.js';
3
5
  import { T as TraceStore } from '../store-CKUAgsJz.js';
4
6
  import '../schema-m0gsnbt3.js';
5
7
  import '../outcome-store-rnXLEqSn.js';
8
+ import '../errors-Dwqw-T_m.js';
6
9
 
7
- type BeliefDecisionKind = 'continue' | 'verify' | 'ask' | 'retry' | 'stop' | 'memory-write' | 'memory-read' | 'tool-select' | 'skill-select' | 'workflow-select' | 'surface-promote';
8
- type BeliefEvidenceSource = 'run' | 'span' | 'event' | 'finding' | 'memory' | 'knowledge' | 'policy';
10
+ declare const BELIEF_DECISION_KINDS: readonly ["continue", "verify", "ask", "retry", "stop", "memory-write", "memory-read", "tool-select", "skill-select", "workflow-select", "surface-promote"];
11
+ type BeliefDecisionKind = (typeof BELIEF_DECISION_KINDS)[number];
12
+ declare const BELIEF_EVIDENCE_SOURCES: readonly ["run", "span", "event", "finding", "memory", "knowledge", "policy"];
13
+ type BeliefEvidenceSource = (typeof BELIEF_EVIDENCE_SOURCES)[number];
14
+ declare const BELIEF_EVIDENCE_QUALITIES: readonly ["direct", "derived", "self-reported", "unverified", "stale", "contradicted"];
15
+ type BeliefEvidenceQuality = (typeof BELIEF_EVIDENCE_QUALITIES)[number];
16
+ declare const BELIEF_EVALUATION_CRITERIA: readonly [{
17
+ readonly id: "capture-integrity";
18
+ readonly label: "Capture integrity";
19
+ readonly reasonCodes: readonly ["trace-missing", "run-record-missing", "backend-integrity-missing"];
20
+ }, {
21
+ readonly id: "decision-completeness";
22
+ readonly label: "Decision completeness";
23
+ readonly reasonCodes: readonly ["candidate-actions-missing", "chosen-action-missing", "decision-evidence-missing"];
24
+ }, {
25
+ readonly id: "evidence-quality";
26
+ readonly label: "Evidence quality";
27
+ readonly reasonCodes: readonly ["evidence-stale", "evidence-contradictory", "evidence-unverified", "evidence-self-reported"];
28
+ }, {
29
+ readonly id: "outcome-quality";
30
+ readonly label: "Outcome quality";
31
+ readonly reasonCodes: readonly ["outcome-missing", "outcome-delayed", "cost-missing"];
32
+ }, {
33
+ readonly id: "calibration";
34
+ readonly label: "Calibration";
35
+ readonly reasonCodes: readonly ["confidence-missing", "calibration-unsupported", "calibration-gap-high"];
36
+ }, {
37
+ readonly id: "accepted-region-risk";
38
+ readonly label: "Accepted-region risk";
39
+ readonly reasonCodes: readonly ["accepted-error-high", "coverage-too-low"];
40
+ }, {
41
+ readonly id: "policy-value";
42
+ readonly label: "Policy value";
43
+ readonly reasonCodes: readonly ["utility-lift-missing", "baseline-dominates", "cost-too-high"];
44
+ }, {
45
+ readonly id: "ope-support";
46
+ readonly label: "OPE support";
47
+ readonly reasonCodes: readonly ["behavior-propensity-missing", "behavior-propensity-invalid", "target-propensity-missing", "target-propensity-invalid", "effective-sample-size-low", "importance-weight-high"];
48
+ }, {
49
+ readonly id: "memory-health";
50
+ readonly label: "Memory health";
51
+ readonly reasonCodes: readonly ["memory-stale", "memory-poisoning-risk", "context-bloat", "memory-write-unverified"];
52
+ }, {
53
+ readonly id: "surface-attribution";
54
+ readonly label: "Surface attribution";
55
+ readonly reasonCodes: readonly ["surface-claim-unsupported", "causal-attribution-missing"];
56
+ }, {
57
+ readonly id: "generalization";
58
+ readonly label: "Generalization";
59
+ readonly reasonCodes: readonly ["split-missing", "holdout-regression", "task-family-coverage-low", "leakage-risk"];
60
+ }, {
61
+ readonly id: "promotion";
62
+ readonly label: "Promotion";
63
+ readonly reasonCodes: readonly ["negative-control-failed", "promotion-gate-failed", "human-review-required"];
64
+ }];
65
+ type BeliefEvaluationCriterionId = (typeof BELIEF_EVALUATION_CRITERIA)[number]['id'];
66
+ type BeliefDecisionReasonCode = (typeof BELIEF_EVALUATION_CRITERIA)[number]['reasonCodes'][number];
67
+ interface BeliefDecisionReason {
68
+ code: BeliefDecisionReasonCode;
69
+ criterion?: BeliefEvaluationCriterionId;
70
+ detail?: string;
71
+ evidenceIds?: string[];
72
+ metadata?: Record<string, unknown>;
73
+ }
74
+ declare function isBeliefDecisionKind(value: unknown): value is BeliefDecisionKind;
75
+ declare function isBeliefEvidenceSource(value: unknown): value is BeliefEvidenceSource;
9
76
  interface BeliefEvidenceRef {
10
77
  source: BeliefEvidenceSource;
11
78
  id: string;
@@ -13,6 +80,8 @@ interface BeliefEvidenceRef {
13
80
  spanId?: string;
14
81
  eventId?: string;
15
82
  detail?: string;
83
+ quality?: BeliefEvidenceQuality;
84
+ observedAt?: string;
16
85
  metadata?: Record<string, unknown>;
17
86
  }
18
87
  interface BeliefDecisionOutcome {
@@ -38,6 +107,7 @@ interface BeliefDecisionPoint {
38
107
  costUsd?: number;
39
108
  evidence: BeliefEvidenceRef[];
40
109
  outcome?: BeliefDecisionOutcome;
110
+ reasons?: BeliefDecisionReason[];
41
111
  metadata?: Record<string, unknown>;
42
112
  }
43
113
  interface BeliefDecisionExtractionDiagnostic {
@@ -57,6 +127,7 @@ interface BeliefPolicyDecision {
57
127
  targetProb?: number;
58
128
  qHat?: number | null;
59
129
  reason?: string;
130
+ reasons?: BeliefDecisionReason[];
60
131
  }
61
132
  interface BeliefSelectivePolicy {
62
133
  id: string;
@@ -138,11 +209,6 @@ interface BeliefCalibrationOptions {
138
209
  }
139
210
  declare function calibrateBeliefDecisions(points: BeliefDecisionPoint[], options?: BeliefCalibrationOptions): CalibrationReport | null;
140
211
 
141
- interface ExtractBeliefDecisionPointsOptions {
142
- runIds?: string[];
143
- }
144
- declare function extractBeliefDecisionPoints(store: TraceStore, options?: ExtractBeliefDecisionPointsOptions): Promise<BeliefDecisionExtractionReport>;
145
-
146
212
  interface BeliefOpeOptions extends OffPolicyOptions {
147
213
  minEffectiveSampleSize?: number;
148
214
  minEffectiveSampleRatio?: number;
@@ -185,4 +251,274 @@ interface AnalyzeBeliefPolicyOptions {
185
251
  }
186
252
  declare function analyzeBeliefPolicy(options: AnalyzeBeliefPolicyOptions): BeliefPolicyEvaluationReport;
187
253
 
188
- export { type AnalyzeBeliefPolicyOpeOptions, type AnalyzeBeliefPolicyOptions, type BeliefCalibrationOptions, type BeliefCalibrationRegion, type BeliefCalibrationStatus, type BeliefDecisionExtractionDiagnostic, type BeliefDecisionExtractionReport, type BeliefDecisionKind, type BeliefDecisionOutcome, type BeliefDecisionPoint, type BeliefEvaluationStatus, type BeliefEvidenceRef, type BeliefEvidenceSource, type BeliefOffPolicyTrajectoryReport, type BeliefOpeOptions, type BeliefOpeReport, type BeliefOpeStatus, type BeliefOpeSupportDiagnostics, type BeliefOpeTargetPolicy, type BeliefPolicyAction, type BeliefPolicyDecision, type BeliefPolicyEvaluationReport, type BeliefSelectivePolicy, type BeliefSelectivePolicyMetrics, type BeliefUtilityOptions, type EvaluateBeliefSelectivePolicyOptions, type ExtractBeliefDecisionPointsOptions, analyzeBeliefPolicy, beliefDecisionsToOffPolicyTrajectories, calibrateBeliefDecisions, embeddedBeliefOpeTargetPolicy, evaluateBeliefOffPolicy, evaluateBeliefSelectivePolicy, extractBeliefDecisionPoints, thresholdSelectivePolicy };
254
+ type CodeAgentBeliefDecisionTargetId = 'failure-recovery' | 'tool-selection' | 'graph-completion';
255
+ interface ExtractCodeAgentBeliefDecisionPointsOptions {
256
+ source: CodeAgentSessionSource;
257
+ entries: unknown[];
258
+ run: Pick<RunRecord, 'runId' | 'scenarioId' | 'outcome' | 'costUsd'>;
259
+ sourcePath?: string;
260
+ }
261
+ interface BeliefDecisionInventoryBucket {
262
+ id: string;
263
+ kind?: BeliefDecisionKind;
264
+ targetId?: CodeAgentBeliefDecisionTargetId;
265
+ n: number;
266
+ withOutcome: number;
267
+ withConfidence: number;
268
+ withCandidateActions: number;
269
+ withBehaviorProb: number;
270
+ withTargetProb: number;
271
+ successRate: number | null;
272
+ meanScore: number | null;
273
+ meanConfidence: number | null;
274
+ }
275
+ interface BeliefDecisionInventoryReport {
276
+ n: number;
277
+ byKind: BeliefDecisionInventoryBucket[];
278
+ byTarget: BeliefDecisionInventoryBucket[];
279
+ diagnostics: string[];
280
+ }
281
+ interface BeliefDecisionTargetSelection {
282
+ id: CodeAgentBeliefDecisionTargetId;
283
+ label: string;
284
+ points: BeliefDecisionPoint[];
285
+ support: BeliefDecisionInventoryBucket;
286
+ reasons: string[];
287
+ }
288
+ interface SelectBeliefDecisionTargetOptions {
289
+ minN?: number;
290
+ minOutcomeCoverage?: number;
291
+ preferredTargets?: CodeAgentBeliefDecisionTargetId[];
292
+ }
293
+ interface AnalyzeBeliefDecisionCorpusOptions {
294
+ points: BeliefDecisionPoint[];
295
+ targetId?: CodeAgentBeliefDecisionTargetId;
296
+ minN?: number;
297
+ minOutcomeCoverage?: number;
298
+ minAccepted?: number;
299
+ confidenceThreshold?: number;
300
+ policy?: BeliefSelectivePolicy;
301
+ requireOpe?: boolean;
302
+ policyOptions?: Partial<AnalyzeBeliefPolicyOptions>;
303
+ }
304
+ interface BeliefDecisionCorpusEvaluation {
305
+ inventory: BeliefDecisionInventoryReport;
306
+ target?: BeliefDecisionTargetSelection;
307
+ policy?: BeliefSelectivePolicy;
308
+ evaluation?: BeliefPolicyEvaluationReport;
309
+ diagnostics: string[];
310
+ }
311
+ declare function extractCodeAgentBeliefDecisionPoints(options: ExtractCodeAgentBeliefDecisionPointsOptions): BeliefDecisionExtractionReport;
312
+ declare function inventoryBeliefDecisionPoints(points: BeliefDecisionPoint[]): BeliefDecisionInventoryReport;
313
+ declare function selectBeliefDecisionTarget(points: BeliefDecisionPoint[], options?: SelectBeliefDecisionTargetOptions): BeliefDecisionTargetSelection | null;
314
+ declare function analyzeBeliefDecisionCorpus(options: AnalyzeBeliefDecisionCorpusOptions): BeliefDecisionCorpusEvaluation;
315
+
316
+ type BeliefResearchClaimScope = 'selective' | 'counterfactual';
317
+ type BeliefResearchEvidenceStatus = 'supported' | 'blocked';
318
+ type BeliefResearchGateId = 'corpus' | 'selective' | 'calibration' | 'ope';
319
+ interface BeliefResearchEvidenceGate {
320
+ id: BeliefResearchGateId;
321
+ status: BeliefResearchEvidenceStatus;
322
+ blockers: string[];
323
+ caveats: string[];
324
+ }
325
+ interface BeliefDecisionResearchEvidencePacket {
326
+ claimScope: BeliefResearchClaimScope;
327
+ status: BeliefResearchEvidenceStatus;
328
+ analysis: BeliefDecisionCorpusEvaluation;
329
+ gates: BeliefResearchEvidenceGate[];
330
+ blockers: string[];
331
+ caveats: string[];
332
+ }
333
+ interface BuildBeliefDecisionResearchEvidencePacketOptions extends AnalyzeBeliefDecisionCorpusOptions {
334
+ claimScope?: BeliefResearchClaimScope;
335
+ }
336
+ declare function buildBeliefDecisionResearchEvidencePacket(options: BuildBeliefDecisionResearchEvidencePacketOptions): BeliefDecisionResearchEvidencePacket;
337
+
338
+ interface CodeAgentBeliefSession extends CodeAgentSessionIntakeOptions {
339
+ source: CodeAgentSessionSource;
340
+ }
341
+ interface BuildCodeAgentBeliefEvidenceCorpusOptions extends Omit<BuildBeliefDecisionResearchEvidencePacketOptions, 'points'> {
342
+ sessions: CodeAgentBeliefSession[];
343
+ }
344
+ interface CodeAgentBeliefEvidenceCorpus {
345
+ runs: RunRecord[];
346
+ metrics: CodeAgentSessionMetrics[];
347
+ intakeDiagnostics: CodeAgentSessionDiagnostic[];
348
+ extractionDiagnostics: BeliefDecisionExtractionDiagnostic[];
349
+ decisions: BeliefDecisionPoint[];
350
+ inventory: BeliefDecisionInventoryReport;
351
+ evidence: BeliefDecisionResearchEvidencePacket;
352
+ }
353
+ declare function buildCodeAgentBeliefEvidenceCorpus(options: BuildCodeAgentBeliefEvidenceCorpusOptions): CodeAgentBeliefEvidenceCorpus;
354
+
355
+ interface ExtractBeliefDecisionPointsOptions {
356
+ runIds?: string[];
357
+ }
358
+ declare function extractBeliefDecisionPoints(store: TraceStore, options?: ExtractBeliefDecisionPointsOptions): Promise<BeliefDecisionExtractionReport>;
359
+
360
+ interface BeliefShadowProbeInput {
361
+ probeId: string;
362
+ decisionId: string;
363
+ runId: string;
364
+ scenarioId?: string;
365
+ stepIndex: number;
366
+ decisionKind: BeliefDecisionKind;
367
+ candidateActions: string[];
368
+ observedAction?: string;
369
+ evidence: BeliefShadowProbeEvidenceRef[];
370
+ context?: string;
371
+ metadata?: Record<string, unknown>;
372
+ }
373
+ interface BeliefShadowProbeEvidenceRef {
374
+ id: string;
375
+ source: string;
376
+ detail?: string;
377
+ quality?: BeliefEvidenceQuality;
378
+ }
379
+ interface BeliefShadowProbeResponse {
380
+ predictedAction: string;
381
+ confidence: number;
382
+ beliefSummary?: string;
383
+ uncertainty?: string[];
384
+ evidenceRefs?: string[];
385
+ wouldChangeMindIf?: string[];
386
+ targetProb?: number;
387
+ qHat?: number | null;
388
+ metadata?: Record<string, unknown>;
389
+ }
390
+ interface BeliefShadowProbeRecord extends BeliefShadowProbeResponse {
391
+ probeId: string;
392
+ decisionId: string;
393
+ runId: string;
394
+ scenarioId?: string;
395
+ stepIndex: number;
396
+ decisionKind: BeliefDecisionKind;
397
+ candidateActions: string[];
398
+ observedAction: string;
399
+ agreesWithObservedAction: boolean;
400
+ outcome?: BeliefDecisionOutcome;
401
+ }
402
+ interface BeliefShadowProbeDiagnostic {
403
+ decisionId: string;
404
+ severity: 'warning' | 'error';
405
+ reason: string;
406
+ }
407
+ interface BeliefShadowProbeSummary {
408
+ attempted: number;
409
+ completed: number;
410
+ dropped: number;
411
+ withOutcome: number;
412
+ withTargetProb: number;
413
+ meanConfidence: number | null;
414
+ observedAgreementRate: number | null;
415
+ }
416
+ interface BeliefShadowProbeRun {
417
+ probeId: string;
418
+ records: BeliefShadowProbeRecord[];
419
+ diagnostics: BeliefShadowProbeDiagnostic[];
420
+ summary: BeliefShadowProbeSummary;
421
+ }
422
+ interface RunBeliefShadowProbeOptions {
423
+ probeId: string;
424
+ points: BeliefDecisionPoint[];
425
+ probe: (input: BeliefShadowProbeInput) => BeliefShadowProbeResponse | Promise<BeliefShadowProbeResponse>;
426
+ contextOf?: (point: BeliefDecisionPoint) => string | undefined | Promise<string | undefined>;
427
+ metadataOf?: (point: BeliefDecisionPoint) => Record<string, unknown> | undefined | Promise<Record<string, unknown> | undefined>;
428
+ includeObservedAction?: boolean;
429
+ includeEvidenceDetail?: boolean;
430
+ includeOutcomeInRecord?: boolean;
431
+ requireCandidateActions?: boolean;
432
+ allowOutOfSetActions?: boolean;
433
+ concurrency?: number;
434
+ maxContextChars?: number;
435
+ }
436
+ declare function runBeliefShadowProbe(options: RunBeliefShadowProbeOptions): Promise<BeliefShadowProbeRun>;
437
+ declare function formatBeliefShadowProbePrompt(input: BeliefShadowProbeInput): string;
438
+
439
+ interface RuntimeBeliefDecisionEvidenceRef {
440
+ source: string;
441
+ id: string;
442
+ detail?: string;
443
+ quality?: BeliefEvidenceQuality;
444
+ metadata?: Record<string, unknown>;
445
+ }
446
+ interface RuntimeBeliefDecisionPoint {
447
+ id: string;
448
+ runId: string;
449
+ scenarioId?: string;
450
+ stepIndex: number;
451
+ kind: string;
452
+ candidateActions?: string[];
453
+ context?: string;
454
+ evidence?: RuntimeBeliefDecisionEvidenceRef[];
455
+ metadata?: Record<string, unknown>;
456
+ }
457
+ interface RuntimeBeliefHookEvent {
458
+ id: string;
459
+ runId: string;
460
+ scenarioId?: string;
461
+ target: string;
462
+ phase: string;
463
+ timestamp: number;
464
+ stepIndex?: number;
465
+ parentId?: string;
466
+ payload?: unknown;
467
+ metadata?: Record<string, unknown>;
468
+ }
469
+ interface RuntimeBeliefHookContext {
470
+ signal?: AbortSignal;
471
+ }
472
+ interface RuntimeBeliefHooks {
473
+ onEvent?: (event: RuntimeBeliefHookEvent, context: RuntimeBeliefHookContext) => void | Promise<void>;
474
+ onDecisionPoint?: (point: RuntimeBeliefDecisionPoint, context: RuntimeBeliefHookContext) => void | Promise<void>;
475
+ }
476
+ interface RuntimeBeliefConversionDiagnostic {
477
+ decisionId: string;
478
+ severity: 'warning' | 'error';
479
+ reason: string;
480
+ }
481
+ interface RuntimeBeliefShadowProbeInputOptions {
482
+ probeId: string;
483
+ decisionKind?: BeliefDecisionKind;
484
+ includeEvidenceDetail?: boolean;
485
+ includeLifecycleEvidence?: boolean;
486
+ lifecycleEvents?: RuntimeBeliefHookEvent[];
487
+ maxContextChars?: number;
488
+ }
489
+ interface RuntimeBeliefDecisionPointOptions {
490
+ chosenAction?: string;
491
+ decisionKind?: BeliefDecisionKind;
492
+ confidence?: number;
493
+ behaviorProb?: number;
494
+ targetProb?: number;
495
+ qHat?: number | null;
496
+ costUsd?: number;
497
+ outcome?: BeliefDecisionOutcome;
498
+ metadata?: Record<string, unknown>;
499
+ includeLifecycleEvidence?: boolean;
500
+ lifecycleEvents?: RuntimeBeliefHookEvent[];
501
+ }
502
+ interface RuntimeBeliefShadowProbeInputReport {
503
+ input?: BeliefShadowProbeInput;
504
+ diagnostics: RuntimeBeliefConversionDiagnostic[];
505
+ }
506
+ interface RuntimeBeliefDecisionPointReport {
507
+ point?: BeliefDecisionPoint;
508
+ diagnostics: RuntimeBeliefConversionDiagnostic[];
509
+ }
510
+ interface BeliefRuntimeHookCollector {
511
+ hooks: RuntimeBeliefHooks;
512
+ decisions: RuntimeBeliefDecisionPoint[];
513
+ events: RuntimeBeliefHookEvent[];
514
+ toShadowProbeInputs(options?: Partial<RuntimeBeliefShadowProbeInputOptions>): {
515
+ inputs: BeliefShadowProbeInput[];
516
+ diagnostics: RuntimeBeliefConversionDiagnostic[];
517
+ };
518
+ clear(): void;
519
+ }
520
+ declare function runtimeDecisionPointToBeliefShadowProbeInput(point: RuntimeBeliefDecisionPoint, options: RuntimeBeliefShadowProbeInputOptions): RuntimeBeliefShadowProbeInputReport;
521
+ declare function runtimeDecisionPointToBeliefDecisionPoint(point: RuntimeBeliefDecisionPoint, options: RuntimeBeliefDecisionPointOptions): RuntimeBeliefDecisionPointReport;
522
+ declare function createBeliefRuntimeHookCollector(defaults: RuntimeBeliefShadowProbeInputOptions): BeliefRuntimeHookCollector;
523
+
524
+ export { type AnalyzeBeliefDecisionCorpusOptions, type AnalyzeBeliefPolicyOpeOptions, type AnalyzeBeliefPolicyOptions, BELIEF_DECISION_KINDS, BELIEF_EVALUATION_CRITERIA, BELIEF_EVIDENCE_QUALITIES, BELIEF_EVIDENCE_SOURCES, type BeliefCalibrationOptions, type BeliefCalibrationRegion, type BeliefCalibrationStatus, type BeliefDecisionCorpusEvaluation, type BeliefDecisionExtractionDiagnostic, type BeliefDecisionExtractionReport, type BeliefDecisionInventoryBucket, type BeliefDecisionInventoryReport, type BeliefDecisionKind, type BeliefDecisionOutcome, type BeliefDecisionPoint, type BeliefDecisionReason, type BeliefDecisionReasonCode, type BeliefDecisionResearchEvidencePacket, type BeliefDecisionTargetSelection, type BeliefEvaluationCriterionId, type BeliefEvaluationStatus, type BeliefEvidenceQuality, type BeliefEvidenceRef, type BeliefEvidenceSource, type BeliefOffPolicyTrajectoryReport, type BeliefOpeOptions, type BeliefOpeReport, type BeliefOpeStatus, type BeliefOpeSupportDiagnostics, type BeliefOpeTargetPolicy, type BeliefPolicyAction, type BeliefPolicyDecision, type BeliefPolicyEvaluationReport, type BeliefResearchClaimScope, type BeliefResearchEvidenceGate, type BeliefResearchEvidenceStatus, type BeliefResearchGateId, type BeliefRuntimeHookCollector, type BeliefSelectivePolicy, type BeliefSelectivePolicyMetrics, type BeliefShadowProbeDiagnostic, type BeliefShadowProbeEvidenceRef, type BeliefShadowProbeInput, type BeliefShadowProbeRecord, type BeliefShadowProbeResponse, type BeliefShadowProbeRun, type BeliefShadowProbeSummary, type BeliefUtilityOptions, type BuildBeliefDecisionResearchEvidencePacketOptions, type BuildCodeAgentBeliefEvidenceCorpusOptions, type CodeAgentBeliefDecisionTargetId, type CodeAgentBeliefEvidenceCorpus, type CodeAgentBeliefSession, type EvaluateBeliefSelectivePolicyOptions, type ExtractBeliefDecisionPointsOptions, type ExtractCodeAgentBeliefDecisionPointsOptions, type RunBeliefShadowProbeOptions, type RuntimeBeliefConversionDiagnostic, type RuntimeBeliefDecisionEvidenceRef, type RuntimeBeliefDecisionPoint, type RuntimeBeliefDecisionPointOptions, type RuntimeBeliefDecisionPointReport, type RuntimeBeliefHookContext, type RuntimeBeliefHookEvent, type RuntimeBeliefHooks, type RuntimeBeliefShadowProbeInputOptions, type RuntimeBeliefShadowProbeInputReport, type SelectBeliefDecisionTargetOptions, analyzeBeliefDecisionCorpus, analyzeBeliefPolicy, beliefDecisionsToOffPolicyTrajectories, buildBeliefDecisionResearchEvidencePacket, buildCodeAgentBeliefEvidenceCorpus, calibrateBeliefDecisions, createBeliefRuntimeHookCollector, embeddedBeliefOpeTargetPolicy, evaluateBeliefOffPolicy, evaluateBeliefSelectivePolicy, extractBeliefDecisionPoints, extractCodeAgentBeliefDecisionPoints, formatBeliefShadowProbePrompt, inventoryBeliefDecisionPoints, isBeliefDecisionKind, isBeliefEvidenceSource, runBeliefShadowProbe, runtimeDecisionPointToBeliefDecisionPoint, runtimeDecisionPointToBeliefShadowProbeInput, selectBeliefDecisionTarget, thresholdSelectivePolicy };