@tangle-network/agent-knowledge 3.2.1 → 4.0.0
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/CHANGELOG.md +37 -0
- package/README.md +306 -40
- package/dist/benchmarks/index.d.ts +1 -2
- package/dist/benchmarks/index.js +1 -4
- package/dist/chunk-DW6APRTX.js +3292 -0
- package/dist/chunk-DW6APRTX.js.map +1 -0
- package/dist/chunk-UWOTQNBI.js +4740 -0
- package/dist/chunk-UWOTQNBI.js.map +1 -0
- package/dist/index-Bqg1mBPt.d.ts +822 -0
- package/dist/index.d.ts +3 -4
- package/dist/index.js +44 -8
- package/dist/index.js.map +1 -1
- package/dist/memory/index.d.ts +491 -4
- package/dist/memory/index.js +44 -3
- package/package.json +7 -5
- package/dist/chunk-RIHIYCX2.js +0 -1853
- package/dist/chunk-RIHIYCX2.js.map +0 -1
- package/dist/chunk-VN2OGUUP.js +0 -851
- package/dist/chunk-VN2OGUUP.js.map +0 -1
- package/dist/chunk-XVU5FFQA.js +0 -49
- package/dist/chunk-XVU5FFQA.js.map +0 -1
- package/dist/index-BHQk7jOT.d.ts +0 -429
- package/dist/types-BFRyr390.d.ts +0 -319
package/dist/index-BHQk7jOT.d.ts
DELETED
|
@@ -1,429 +0,0 @@
|
|
|
1
|
-
import { JsonValue, Scenario, DispatchContext, RunImprovementLoopResult, ParameterCandidate, JudgeConfig, Gate, RunImprovementLoopOptions, MutableSurface, SurfaceProposer, CampaignStorage, CampaignResult } from '@tangle-network/agent-eval/campaign';
|
|
2
|
-
import { A as AgentMemoryAdapter, a as AgentMemoryScope } from './types-BFRyr390.js';
|
|
3
|
-
import { c as KnowledgeIndex } from './types-6x0OpfW6.js';
|
|
4
|
-
|
|
5
|
-
type RetrievalConfig = Record<string, JsonValue>;
|
|
6
|
-
type RetrievalParameterSearchSpace = Record<string, readonly JsonValue[]>;
|
|
7
|
-
type RetrievalGoldTarget = {
|
|
8
|
-
kind: 'page';
|
|
9
|
-
pageId: string;
|
|
10
|
-
} | {
|
|
11
|
-
kind: 'page-path';
|
|
12
|
-
path: string;
|
|
13
|
-
} | {
|
|
14
|
-
kind: 'source';
|
|
15
|
-
sourceId: string;
|
|
16
|
-
} | {
|
|
17
|
-
kind: 'source-anchor';
|
|
18
|
-
sourceId: string;
|
|
19
|
-
anchorId: string;
|
|
20
|
-
} | {
|
|
21
|
-
kind: 'source-span';
|
|
22
|
-
sourceId: string;
|
|
23
|
-
charStart: number;
|
|
24
|
-
charEnd: number;
|
|
25
|
-
};
|
|
26
|
-
interface RetrievalEvalScenario extends Scenario {
|
|
27
|
-
kind: 'retrieval-eval';
|
|
28
|
-
query: string;
|
|
29
|
-
expected: RetrievalGoldTarget | readonly RetrievalGoldTarget[];
|
|
30
|
-
k?: number;
|
|
31
|
-
}
|
|
32
|
-
interface RetrievedSourceSpan {
|
|
33
|
-
sourceId: string;
|
|
34
|
-
anchorId?: string;
|
|
35
|
-
charStart?: number;
|
|
36
|
-
charEnd?: number;
|
|
37
|
-
}
|
|
38
|
-
interface RetrievedKnowledgeHit {
|
|
39
|
-
pageId: string;
|
|
40
|
-
path: string;
|
|
41
|
-
title?: string;
|
|
42
|
-
rank: number;
|
|
43
|
-
score?: number;
|
|
44
|
-
normalizedScore?: number;
|
|
45
|
-
sourceIds?: readonly string[];
|
|
46
|
-
sourceSpans?: readonly RetrievedSourceSpan[];
|
|
47
|
-
snippet?: string;
|
|
48
|
-
metadata?: Record<string, JsonValue>;
|
|
49
|
-
}
|
|
50
|
-
interface RetrievalEvalArtifact {
|
|
51
|
-
config: RetrievalConfig;
|
|
52
|
-
query: string;
|
|
53
|
-
requestedK: number;
|
|
54
|
-
hits: readonly RetrievedKnowledgeHit[];
|
|
55
|
-
durationMs: number;
|
|
56
|
-
/** Informational copy. Billable retrievers account through context.cost.runPaidCall. */
|
|
57
|
-
costUsd?: number;
|
|
58
|
-
metadata?: Record<string, JsonValue>;
|
|
59
|
-
}
|
|
60
|
-
interface RetrievalMetricSummary {
|
|
61
|
-
recall: number;
|
|
62
|
-
mrr: number;
|
|
63
|
-
ndcg: number;
|
|
64
|
-
precisionAtK: number;
|
|
65
|
-
expectedCount: number;
|
|
66
|
-
matchedCount: number;
|
|
67
|
-
relevantHitCount: number;
|
|
68
|
-
firstHitRank: number | null;
|
|
69
|
-
matchedTargetIds: readonly string[];
|
|
70
|
-
}
|
|
71
|
-
interface RetrievalEvalRetrieverInput {
|
|
72
|
-
index?: KnowledgeIndex;
|
|
73
|
-
config: RetrievalConfig;
|
|
74
|
-
scenario: RetrievalEvalScenario;
|
|
75
|
-
k: number;
|
|
76
|
-
signal: AbortSignal;
|
|
77
|
-
context: DispatchContext;
|
|
78
|
-
}
|
|
79
|
-
interface RetrievalEvalRetrieverResult {
|
|
80
|
-
hits: readonly RetrievedKnowledgeHit[];
|
|
81
|
-
/** Informational copy. Billable retrievers account through context.cost.runPaidCall. */
|
|
82
|
-
costUsd?: number;
|
|
83
|
-
metadata?: Record<string, JsonValue>;
|
|
84
|
-
}
|
|
85
|
-
type RetrievalEvalRetriever = (input: RetrievalEvalRetrieverInput) => Promise<readonly RetrievedKnowledgeHit[] | RetrievalEvalRetrieverResult>;
|
|
86
|
-
interface BuildRetrievalEvalDispatchOptions {
|
|
87
|
-
index?: KnowledgeIndex;
|
|
88
|
-
defaultK?: number;
|
|
89
|
-
retrieve?: RetrievalEvalRetriever;
|
|
90
|
-
}
|
|
91
|
-
interface RetrievalMetricWeights {
|
|
92
|
-
recall?: number;
|
|
93
|
-
mrr?: number;
|
|
94
|
-
ndcg?: number;
|
|
95
|
-
precisionAtK?: number;
|
|
96
|
-
}
|
|
97
|
-
interface RetrievalRecallJudgeOptions {
|
|
98
|
-
name?: string;
|
|
99
|
-
weights?: RetrievalMetricWeights;
|
|
100
|
-
}
|
|
101
|
-
interface BuildRetrievalParameterCandidatesOptions {
|
|
102
|
-
baseline?: RetrievalConfig;
|
|
103
|
-
}
|
|
104
|
-
interface RetrievalParameterSweepProposerOptions {
|
|
105
|
-
candidates?: readonly ParameterCandidate[];
|
|
106
|
-
searchSpace?: RetrievalParameterSearchSpace;
|
|
107
|
-
baseline?: RetrievalConfig;
|
|
108
|
-
}
|
|
109
|
-
type RetrievalLoopBaseOptions = RunImprovementLoopOptions<RetrievalEvalScenario, RetrievalEvalArtifact>;
|
|
110
|
-
interface RunRetrievalImprovementLoopOptions {
|
|
111
|
-
baseline: RetrievalConfig;
|
|
112
|
-
scenarios: readonly RetrievalEvalScenario[];
|
|
113
|
-
holdoutScenarios?: readonly RetrievalEvalScenario[];
|
|
114
|
-
index?: KnowledgeIndex;
|
|
115
|
-
defaultK?: number;
|
|
116
|
-
retrieve?: RetrievalEvalRetriever;
|
|
117
|
-
candidates?: readonly ParameterCandidate[];
|
|
118
|
-
searchSpace?: RetrievalParameterSearchSpace;
|
|
119
|
-
judges?: readonly JudgeConfig<RetrievalEvalArtifact, RetrievalEvalScenario>[];
|
|
120
|
-
gate?: Gate<RetrievalEvalArtifact, RetrievalEvalScenario>;
|
|
121
|
-
metricWeights?: RetrievalMetricWeights;
|
|
122
|
-
targetRecall?: number;
|
|
123
|
-
holdoutFraction?: number;
|
|
124
|
-
splitSeed?: number;
|
|
125
|
-
deltaThreshold?: number;
|
|
126
|
-
runDir?: RetrievalLoopBaseOptions['runDir'];
|
|
127
|
-
seed?: RetrievalLoopBaseOptions['seed'];
|
|
128
|
-
reps?: RetrievalLoopBaseOptions['reps'];
|
|
129
|
-
resumable?: RetrievalLoopBaseOptions['resumable'];
|
|
130
|
-
costCeiling?: RetrievalLoopBaseOptions['costCeiling'];
|
|
131
|
-
maxConcurrency?: RetrievalLoopBaseOptions['maxConcurrency'];
|
|
132
|
-
dispatchTimeoutMs?: RetrievalLoopBaseOptions['dispatchTimeoutMs'];
|
|
133
|
-
expectUsage?: RetrievalLoopBaseOptions['expectUsage'];
|
|
134
|
-
tracing?: RetrievalLoopBaseOptions['tracing'];
|
|
135
|
-
storage?: RetrievalLoopBaseOptions['storage'];
|
|
136
|
-
populationSize?: RetrievalLoopBaseOptions['populationSize'];
|
|
137
|
-
maxGenerations?: RetrievalLoopBaseOptions['maxGenerations'];
|
|
138
|
-
promoteTopK?: RetrievalLoopBaseOptions['promoteTopK'];
|
|
139
|
-
maxImprovementShots?: RetrievalLoopBaseOptions['maxImprovementShots'];
|
|
140
|
-
report?: RetrievalLoopBaseOptions['report'];
|
|
141
|
-
findings?: RetrievalLoopBaseOptions['findings'];
|
|
142
|
-
now?: RetrievalLoopBaseOptions['now'];
|
|
143
|
-
}
|
|
144
|
-
interface RunRetrievalImprovementLoopResult extends RunImprovementLoopResult<RetrievalEvalArtifact, RetrievalEvalScenario> {
|
|
145
|
-
baselineConfig: RetrievalConfig;
|
|
146
|
-
winnerConfig: RetrievalConfig;
|
|
147
|
-
trainScenarios: readonly RetrievalEvalScenario[];
|
|
148
|
-
holdoutScenarios: readonly RetrievalEvalScenario[];
|
|
149
|
-
candidates: readonly ParameterCandidate[];
|
|
150
|
-
targetRecall?: number;
|
|
151
|
-
}
|
|
152
|
-
declare function retrievalConfigSurface(config: RetrievalConfig): string;
|
|
153
|
-
declare function retrievalConfigFromSurface(surface: MutableSurface): RetrievalConfig;
|
|
154
|
-
declare function buildRetrievalEvalDispatch(options: BuildRetrievalEvalDispatchOptions): (surface: MutableSurface, scenario: RetrievalEvalScenario, context: DispatchContext) => Promise<RetrievalEvalArtifact>;
|
|
155
|
-
declare function retrievalRecallJudge(options?: RetrievalRecallJudgeOptions): JudgeConfig<RetrievalEvalArtifact, RetrievalEvalScenario>;
|
|
156
|
-
declare function scoreRetrievalArtifact(artifact: RetrievalEvalArtifact, scenario: RetrievalEvalScenario): RetrievalMetricSummary;
|
|
157
|
-
declare function buildRetrievalParameterCandidates(searchSpace: RetrievalParameterSearchSpace, options?: BuildRetrievalParameterCandidatesOptions): ParameterCandidate[];
|
|
158
|
-
declare function retrievalParameterSweepProposer(options: RetrievalParameterSweepProposerOptions): SurfaceProposer;
|
|
159
|
-
declare function runRetrievalImprovementLoop(options: RunRetrievalImprovementLoopOptions): Promise<RunRetrievalImprovementLoopResult>;
|
|
160
|
-
|
|
161
|
-
type KnowledgeBenchmarkTaskKind = 'retrieval' | 'rag-answer' | 'hallucination' | 'kb-improvement' | 'memory-ingest' | 'memory-recall' | 'memory-temporal' | 'memory-update' | 'memory-forgetting' | 'memory-reasoning' | 'memory-summarization' | 'memory-recommendation' | 'memory-multiparty';
|
|
162
|
-
type KnowledgeAnswerBenchmarkTaskKind = 'rag-answer' | 'hallucination' | 'kb-improvement';
|
|
163
|
-
type KnowledgeMemoryBenchmarkTaskKind = Exclude<KnowledgeBenchmarkTaskKind, 'retrieval' | KnowledgeAnswerBenchmarkTaskKind>;
|
|
164
|
-
type KnowledgeBenchmarkFamily = 'beir' | 'mteb-retrieval' | 'msmarco' | 'trec-dl' | 'miracl' | 'lotte' | 'bright' | 'crag' | 'hotpotqa' | 'kilt' | 'ragtruth' | 'faithbench' | 'locomo' | 'longmemeval' | 'longmemeval-v2' | 'memora' | 'memoryagentbench' | 'memorybank' | 'groupmembench' | 'first-party' | 'custom';
|
|
165
|
-
type KnowledgeBenchmarkSplit = 'search' | 'dev' | 'holdout' | string;
|
|
166
|
-
interface KnowledgeBenchmarkSource {
|
|
167
|
-
name?: string;
|
|
168
|
-
url?: string;
|
|
169
|
-
version?: string;
|
|
170
|
-
license?: string;
|
|
171
|
-
citation?: string;
|
|
172
|
-
}
|
|
173
|
-
interface KnowledgeBenchmarkSpec {
|
|
174
|
-
id: string;
|
|
175
|
-
family: KnowledgeBenchmarkFamily;
|
|
176
|
-
taskKind: KnowledgeBenchmarkTaskKind;
|
|
177
|
-
primaryMetrics: readonly string[];
|
|
178
|
-
adapter: string;
|
|
179
|
-
notes: string;
|
|
180
|
-
}
|
|
181
|
-
interface KnowledgeBenchmarkCaseBase {
|
|
182
|
-
id: string;
|
|
183
|
-
family: KnowledgeBenchmarkFamily | string;
|
|
184
|
-
taskKind: KnowledgeBenchmarkTaskKind;
|
|
185
|
-
split?: KnowledgeBenchmarkSplit;
|
|
186
|
-
tags?: readonly string[];
|
|
187
|
-
source?: KnowledgeBenchmarkSource;
|
|
188
|
-
metadata?: Record<string, unknown>;
|
|
189
|
-
}
|
|
190
|
-
interface KnowledgeRetrievalBenchmarkCase extends KnowledgeBenchmarkCaseBase {
|
|
191
|
-
taskKind: 'retrieval';
|
|
192
|
-
query: string;
|
|
193
|
-
expected: RetrievalGoldTarget | readonly RetrievalGoldTarget[];
|
|
194
|
-
k?: number;
|
|
195
|
-
}
|
|
196
|
-
interface KnowledgeClaimMatcher {
|
|
197
|
-
id: string;
|
|
198
|
-
anyOf: readonly string[];
|
|
199
|
-
weight?: number;
|
|
200
|
-
}
|
|
201
|
-
interface KnowledgeMemoryEvent {
|
|
202
|
-
id: string;
|
|
203
|
-
text: string;
|
|
204
|
-
actorId?: string;
|
|
205
|
-
sessionId?: string;
|
|
206
|
-
timestamp?: string;
|
|
207
|
-
metadata?: Record<string, unknown>;
|
|
208
|
-
}
|
|
209
|
-
interface KnowledgeMemoryFactMatcher extends KnowledgeClaimMatcher {
|
|
210
|
-
sourceEventIds?: readonly string[];
|
|
211
|
-
validAt?: string;
|
|
212
|
-
obsolete?: boolean;
|
|
213
|
-
}
|
|
214
|
-
interface KnowledgeAnswerBenchmarkCase extends KnowledgeBenchmarkCaseBase {
|
|
215
|
-
taskKind: KnowledgeAnswerBenchmarkTaskKind;
|
|
216
|
-
prompt: string;
|
|
217
|
-
requiredClaims?: readonly KnowledgeClaimMatcher[];
|
|
218
|
-
forbiddenClaims?: readonly KnowledgeClaimMatcher[];
|
|
219
|
-
expectedSourceIds?: readonly string[];
|
|
220
|
-
referenceAnswer?: string;
|
|
221
|
-
}
|
|
222
|
-
interface KnowledgeMemoryBenchmarkCase extends KnowledgeBenchmarkCaseBase {
|
|
223
|
-
taskKind: KnowledgeMemoryBenchmarkTaskKind;
|
|
224
|
-
events: readonly KnowledgeMemoryEvent[];
|
|
225
|
-
prompt: string;
|
|
226
|
-
requiredFacts?: readonly KnowledgeMemoryFactMatcher[];
|
|
227
|
-
forbiddenFacts?: readonly KnowledgeMemoryFactMatcher[];
|
|
228
|
-
expectedEventIds?: readonly string[];
|
|
229
|
-
expectedActorIds?: readonly string[];
|
|
230
|
-
referenceAnswer?: string;
|
|
231
|
-
}
|
|
232
|
-
type KnowledgeBenchmarkCase = KnowledgeRetrievalBenchmarkCase | KnowledgeAnswerBenchmarkCase | KnowledgeMemoryBenchmarkCase;
|
|
233
|
-
interface KnowledgeBenchmarkArtifact {
|
|
234
|
-
answer?: string;
|
|
235
|
-
text?: string;
|
|
236
|
-
hits?: readonly RetrievedKnowledgeHit[];
|
|
237
|
-
citedSourceIds?: readonly string[];
|
|
238
|
-
rememberedFacts?: readonly string[];
|
|
239
|
-
citedEventIds?: readonly string[];
|
|
240
|
-
usedMemoryIds?: readonly string[];
|
|
241
|
-
actorIds?: readonly string[];
|
|
242
|
-
/** Informational copy. Billable responders account through context.cost.runPaidCall. */
|
|
243
|
-
costUsd?: number;
|
|
244
|
-
durationMs?: number;
|
|
245
|
-
metadata?: Record<string, unknown>;
|
|
246
|
-
}
|
|
247
|
-
interface KnowledgeBenchmarkEvaluation {
|
|
248
|
-
score: number;
|
|
249
|
-
passed: boolean;
|
|
250
|
-
dimensions: Record<string, number>;
|
|
251
|
-
notes: string;
|
|
252
|
-
raw: Record<string, unknown>;
|
|
253
|
-
}
|
|
254
|
-
interface KnowledgeBenchmarkScenario extends Scenario {
|
|
255
|
-
kind: 'knowledge-benchmark';
|
|
256
|
-
family: KnowledgeBenchmarkFamily | string;
|
|
257
|
-
taskKind: KnowledgeBenchmarkTaskKind;
|
|
258
|
-
splitTag: KnowledgeBenchmarkSplit;
|
|
259
|
-
case: KnowledgeBenchmarkCase;
|
|
260
|
-
}
|
|
261
|
-
type KnowledgeBenchmarkResponder<TArtifact = KnowledgeBenchmarkArtifact> = (input: {
|
|
262
|
-
case: KnowledgeBenchmarkCase;
|
|
263
|
-
scenario: KnowledgeBenchmarkScenario;
|
|
264
|
-
context: DispatchContext;
|
|
265
|
-
}) => Promise<TArtifact> | TArtifact;
|
|
266
|
-
interface RunKnowledgeBenchmarkSuiteOptions<TArtifact = KnowledgeBenchmarkArtifact> {
|
|
267
|
-
cases: readonly KnowledgeBenchmarkCase[];
|
|
268
|
-
respond: KnowledgeBenchmarkResponder<TArtifact>;
|
|
269
|
-
runDir: string;
|
|
270
|
-
splits?: readonly KnowledgeBenchmarkSplit[];
|
|
271
|
-
repo?: string;
|
|
272
|
-
seed?: number;
|
|
273
|
-
reps?: number;
|
|
274
|
-
resumable?: boolean;
|
|
275
|
-
costCeiling?: number;
|
|
276
|
-
maxConcurrency?: number;
|
|
277
|
-
dispatchTimeoutMs?: number;
|
|
278
|
-
expectUsage?: 'assert' | 'warn' | 'off';
|
|
279
|
-
storage?: CampaignStorage;
|
|
280
|
-
now?: () => Date;
|
|
281
|
-
}
|
|
282
|
-
interface KnowledgeBenchmarkDistribution {
|
|
283
|
-
n: number;
|
|
284
|
-
min: number;
|
|
285
|
-
mean: number;
|
|
286
|
-
median: number;
|
|
287
|
-
p90: number;
|
|
288
|
-
max: number;
|
|
289
|
-
}
|
|
290
|
-
interface KnowledgeBenchmarkSliceSummary {
|
|
291
|
-
n: number;
|
|
292
|
-
meanScore: number;
|
|
293
|
-
passRate: number;
|
|
294
|
-
score: KnowledgeBenchmarkDistribution;
|
|
295
|
-
}
|
|
296
|
-
interface KnowledgeBenchmarkReport {
|
|
297
|
-
totalCases: number;
|
|
298
|
-
totalCells: number;
|
|
299
|
-
cellsFailed: number;
|
|
300
|
-
cellsCached: number;
|
|
301
|
-
totalCostUsd: number;
|
|
302
|
-
bySplit: Record<string, KnowledgeBenchmarkSliceSummary>;
|
|
303
|
-
byFamily: Record<string, KnowledgeBenchmarkSliceSummary>;
|
|
304
|
-
byTaskKind: Record<string, KnowledgeBenchmarkSliceSummary>;
|
|
305
|
-
dimensions: Record<string, KnowledgeBenchmarkDistribution>;
|
|
306
|
-
score: KnowledgeBenchmarkDistribution;
|
|
307
|
-
}
|
|
308
|
-
interface RunKnowledgeBenchmarkSuiteResult<TArtifact = KnowledgeBenchmarkArtifact> {
|
|
309
|
-
scenarios: readonly KnowledgeBenchmarkScenario[];
|
|
310
|
-
campaign: CampaignResult<TArtifact, KnowledgeBenchmarkScenario>;
|
|
311
|
-
report: KnowledgeBenchmarkReport;
|
|
312
|
-
reportJsonPath: string;
|
|
313
|
-
reportMarkdownPath: string;
|
|
314
|
-
}
|
|
315
|
-
interface MemoryAdapterBenchmarkCandidate {
|
|
316
|
-
id: string;
|
|
317
|
-
label?: string;
|
|
318
|
-
createAdapter: () => AgentMemoryAdapter | Promise<AgentMemoryAdapter>;
|
|
319
|
-
searchLimit?: number;
|
|
320
|
-
costUsdPerCase?: number;
|
|
321
|
-
scope?: AgentMemoryScope;
|
|
322
|
-
}
|
|
323
|
-
interface RunMemoryAdapterBenchmarkOptions {
|
|
324
|
-
cases: readonly KnowledgeMemoryBenchmarkCase[];
|
|
325
|
-
candidates: readonly MemoryAdapterBenchmarkCandidate[];
|
|
326
|
-
runDir: string;
|
|
327
|
-
storage?: CampaignStorage;
|
|
328
|
-
repo?: string;
|
|
329
|
-
seed?: number;
|
|
330
|
-
reps?: number;
|
|
331
|
-
resumable?: boolean;
|
|
332
|
-
costCeiling?: number;
|
|
333
|
-
maxConcurrency?: number;
|
|
334
|
-
dispatchTimeoutMs?: number;
|
|
335
|
-
expectUsage?: 'assert' | 'warn' | 'off';
|
|
336
|
-
now?: () => Date;
|
|
337
|
-
}
|
|
338
|
-
interface MemoryAdapterBenchmarkRankingRow {
|
|
339
|
-
rank: number;
|
|
340
|
-
candidateId: string;
|
|
341
|
-
label: string;
|
|
342
|
-
adapterId: string;
|
|
343
|
-
scoreMean: number;
|
|
344
|
-
passRate: number;
|
|
345
|
-
totalCases: number;
|
|
346
|
-
totalCells: number;
|
|
347
|
-
cellsFailed: number;
|
|
348
|
-
totalCostUsd: number;
|
|
349
|
-
reportJsonPath: string;
|
|
350
|
-
reportMarkdownPath: string;
|
|
351
|
-
report: KnowledgeBenchmarkReport;
|
|
352
|
-
}
|
|
353
|
-
interface RunMemoryAdapterBenchmarkResult {
|
|
354
|
-
rows: readonly MemoryAdapterBenchmarkRankingRow[];
|
|
355
|
-
rankingJsonPath: string;
|
|
356
|
-
rankingMarkdownPath: string;
|
|
357
|
-
}
|
|
358
|
-
interface KnowledgeRetrievalBenchmarkQuery {
|
|
359
|
-
id: string;
|
|
360
|
-
text: string;
|
|
361
|
-
split?: KnowledgeBenchmarkSplit;
|
|
362
|
-
tags?: readonly string[];
|
|
363
|
-
metadata?: Record<string, unknown>;
|
|
364
|
-
}
|
|
365
|
-
interface KnowledgeRetrievalBenchmarkQrel {
|
|
366
|
-
queryId: string;
|
|
367
|
-
documentId: string;
|
|
368
|
-
score: number;
|
|
369
|
-
}
|
|
370
|
-
interface BuildRetrievalBenchmarkCasesFromQrelsOptions {
|
|
371
|
-
benchmarkId: string;
|
|
372
|
-
family: KnowledgeBenchmarkFamily | string;
|
|
373
|
-
queries: readonly KnowledgeRetrievalBenchmarkQuery[];
|
|
374
|
-
qrels: readonly KnowledgeRetrievalBenchmarkQrel[];
|
|
375
|
-
source?: KnowledgeBenchmarkSource;
|
|
376
|
-
tags?: readonly string[];
|
|
377
|
-
k?: number;
|
|
378
|
-
targetKind?: 'page' | 'page-path' | 'source';
|
|
379
|
-
documentTarget?: (documentId: string, qrel: KnowledgeRetrievalBenchmarkQrel) => RetrievalGoldTarget;
|
|
380
|
-
splitOf?: (queryId: string) => KnowledgeBenchmarkSplit;
|
|
381
|
-
}
|
|
382
|
-
declare const INDUSTRY_RAG_BENCHMARKS: readonly (KnowledgeBenchmarkSpec & {
|
|
383
|
-
taskKind: 'retrieval' | KnowledgeAnswerBenchmarkTaskKind;
|
|
384
|
-
})[];
|
|
385
|
-
declare const INDUSTRY_MEMORY_BENCHMARKS: readonly (KnowledgeBenchmarkSpec & {
|
|
386
|
-
taskKind: KnowledgeMemoryBenchmarkTaskKind;
|
|
387
|
-
})[];
|
|
388
|
-
declare function buildIndustryRagBenchmarkSmokeCases(specs?: readonly (KnowledgeBenchmarkSpec & {
|
|
389
|
-
taskKind: 'retrieval' | KnowledgeAnswerBenchmarkTaskKind;
|
|
390
|
-
})[]): KnowledgeBenchmarkCase[];
|
|
391
|
-
declare function respondToIndustryRagBenchmarkSmokeCase(input: {
|
|
392
|
-
case: KnowledgeBenchmarkCase;
|
|
393
|
-
}): KnowledgeBenchmarkArtifact;
|
|
394
|
-
declare function buildIndustryMemoryBenchmarkSmokeCases(specs?: readonly (KnowledgeBenchmarkSpec & {
|
|
395
|
-
taskKind: KnowledgeMemoryBenchmarkTaskKind;
|
|
396
|
-
})[]): KnowledgeMemoryBenchmarkCase[];
|
|
397
|
-
declare function respondToIndustryMemoryBenchmarkSmokeCase(input: {
|
|
398
|
-
case: KnowledgeMemoryBenchmarkCase;
|
|
399
|
-
}): KnowledgeBenchmarkArtifact;
|
|
400
|
-
declare function buildFirstPartyMemoryLifecycleBenchmarkCases(): KnowledgeMemoryBenchmarkCase[];
|
|
401
|
-
declare function createMemoryAdapterBenchmarkResponder(options: {
|
|
402
|
-
adapter: AgentMemoryAdapter;
|
|
403
|
-
candidateId: string;
|
|
404
|
-
searchLimit?: number;
|
|
405
|
-
scope?: AgentMemoryScope;
|
|
406
|
-
costUsdPerCase?: number;
|
|
407
|
-
now?: () => Date;
|
|
408
|
-
}): KnowledgeBenchmarkResponder<KnowledgeBenchmarkArtifact>;
|
|
409
|
-
declare function runMemoryAdapterBenchmark(options: RunMemoryAdapterBenchmarkOptions): Promise<RunMemoryAdapterBenchmarkResult>;
|
|
410
|
-
declare function createNoopMemoryBenchmarkAdapter(id?: string): AgentMemoryAdapter;
|
|
411
|
-
declare function createInMemoryBenchmarkAdapter(options?: {
|
|
412
|
-
id?: string;
|
|
413
|
-
}): AgentMemoryAdapter;
|
|
414
|
-
declare function parseKnowledgeBenchmarkJsonl<T = unknown>(text: string): T[];
|
|
415
|
-
declare function parseKnowledgeBenchmarkQrels(text: string): KnowledgeRetrievalBenchmarkQrel[];
|
|
416
|
-
declare function buildRetrievalBenchmarkCasesFromQrels(options: BuildRetrievalBenchmarkCasesFromQrelsOptions): KnowledgeRetrievalBenchmarkCase[];
|
|
417
|
-
declare function runKnowledgeBenchmarkSuite<TArtifact = KnowledgeBenchmarkArtifact>(options: RunKnowledgeBenchmarkSuiteOptions<TArtifact>): Promise<RunKnowledgeBenchmarkSuiteResult<TArtifact>>;
|
|
418
|
-
declare function renderKnowledgeBenchmarkReportMarkdown(report: KnowledgeBenchmarkReport): string;
|
|
419
|
-
declare function buildKnowledgeBenchmarkScenarios(cases: readonly KnowledgeBenchmarkCase[], splits?: readonly KnowledgeBenchmarkSplit[]): KnowledgeBenchmarkScenario[];
|
|
420
|
-
declare function knowledgeBenchmarkJudge<TArtifact = KnowledgeBenchmarkArtifact>(): JudgeConfig<TArtifact, KnowledgeBenchmarkScenario>;
|
|
421
|
-
declare function scoreKnowledgeBenchmarkArtifact<TArtifact>(testCase: KnowledgeBenchmarkCase, artifact: TArtifact): KnowledgeBenchmarkEvaluation;
|
|
422
|
-
declare function summarizeKnowledgeBenchmarkCampaign<TArtifact>(input: {
|
|
423
|
-
scenarios: readonly KnowledgeBenchmarkScenario[];
|
|
424
|
-
campaign: CampaignResult<TArtifact, KnowledgeBenchmarkScenario>;
|
|
425
|
-
}): KnowledgeBenchmarkReport;
|
|
426
|
-
declare function scoreMemoryBenchmarkArtifact<TArtifact>(testCase: KnowledgeMemoryBenchmarkCase, artifact: TArtifact): KnowledgeBenchmarkEvaluation;
|
|
427
|
-
declare function isKnowledgeMemoryBenchmarkCase(testCase: KnowledgeBenchmarkCase): testCase is KnowledgeMemoryBenchmarkCase;
|
|
428
|
-
|
|
429
|
-
export { buildIndustryRagBenchmarkSmokeCases as $, type KnowledgeRetrievalBenchmarkQuery as A, type BuildRetrievalBenchmarkCasesFromQrelsOptions as B, type MemoryAdapterBenchmarkRankingRow as C, type RetrievalConfig as D, type RetrievalEvalArtifact as E, type RetrievalEvalRetriever as F, type RetrievalEvalRetrieverInput as G, type RetrievalEvalRetrieverResult as H, INDUSTRY_MEMORY_BENCHMARKS as I, type RetrievalEvalScenario as J, type KnowledgeAnswerBenchmarkCase as K, type RetrievalGoldTarget as L, type MemoryAdapterBenchmarkCandidate as M, type RetrievalMetricSummary as N, type RetrievalMetricWeights as O, type RetrievalParameterSearchSpace as P, type RetrievalParameterSweepProposerOptions as Q, type RunRetrievalImprovementLoopResult as R, type RetrievalRecallJudgeOptions as S, type RetrievedKnowledgeHit as T, type RetrievedSourceSpan as U, type RunKnowledgeBenchmarkSuiteOptions as V, type RunKnowledgeBenchmarkSuiteResult as W, type RunMemoryAdapterBenchmarkOptions as X, type RunMemoryAdapterBenchmarkResult as Y, buildFirstPartyMemoryLifecycleBenchmarkCases as Z, buildIndustryMemoryBenchmarkSmokeCases as _, type RunRetrievalImprovementLoopOptions as a, buildKnowledgeBenchmarkScenarios as a0, buildRetrievalBenchmarkCasesFromQrels as a1, buildRetrievalEvalDispatch as a2, buildRetrievalParameterCandidates as a3, createInMemoryBenchmarkAdapter as a4, createMemoryAdapterBenchmarkResponder as a5, createNoopMemoryBenchmarkAdapter as a6, isKnowledgeMemoryBenchmarkCase as a7, knowledgeBenchmarkJudge as a8, parseKnowledgeBenchmarkJsonl as a9, parseKnowledgeBenchmarkQrels as aa, renderKnowledgeBenchmarkReportMarkdown as ab, respondToIndustryMemoryBenchmarkSmokeCase as ac, respondToIndustryRagBenchmarkSmokeCase as ad, retrievalConfigFromSurface as ae, retrievalConfigSurface as af, retrievalParameterSweepProposer as ag, retrievalRecallJudge as ah, runKnowledgeBenchmarkSuite as ai, runMemoryAdapterBenchmark as aj, runRetrievalImprovementLoop as ak, scoreKnowledgeBenchmarkArtifact as al, scoreMemoryBenchmarkArtifact as am, scoreRetrievalArtifact as an, summarizeKnowledgeBenchmarkCampaign as ao, type BuildRetrievalEvalDispatchOptions as b, type BuildRetrievalParameterCandidatesOptions as c, INDUSTRY_RAG_BENCHMARKS as d, type KnowledgeAnswerBenchmarkTaskKind as e, type KnowledgeBenchmarkArtifact as f, type KnowledgeBenchmarkCase as g, type KnowledgeBenchmarkCaseBase as h, type KnowledgeBenchmarkDistribution as i, type KnowledgeBenchmarkEvaluation as j, type KnowledgeBenchmarkFamily as k, type KnowledgeBenchmarkReport as l, type KnowledgeBenchmarkResponder as m, type KnowledgeBenchmarkScenario as n, type KnowledgeBenchmarkSliceSummary as o, type KnowledgeBenchmarkSource as p, type KnowledgeBenchmarkSpec as q, type KnowledgeBenchmarkSplit as r, type KnowledgeBenchmarkTaskKind as s, type KnowledgeClaimMatcher as t, type KnowledgeMemoryBenchmarkCase as u, type KnowledgeMemoryBenchmarkTaskKind as v, type KnowledgeMemoryEvent as w, type KnowledgeMemoryFactMatcher as x, type KnowledgeRetrievalBenchmarkCase as y, type KnowledgeRetrievalBenchmarkQrel as z };
|