@modusensus/dsh-mneme 0.6.9 → 0.6.11
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/LICENSE +21 -21
- package/README.md +469 -219
- package/{dsh-mneme/cordis.patch.yml → cordis.patch.yml} +15 -15
- package/{dsh-mneme/src → lib}/api.js +783 -783
- package/{dsh-mneme/lib → lib}/client.js +1754 -1757
- package/{dsh-mneme/src → lib}/commands.js +64 -64
- package/{dsh-mneme/lib → lib}/config.js +298 -298
- package/{dsh-mneme/lib → lib}/dream/clustering.js +118 -118
- package/{dsh-mneme/lib → lib}/dream/decisions.js +488 -488
- package/{dsh-mneme/lib → lib}/dream/sleep.js +561 -561
- package/{dsh-mneme/src → lib}/dream/tag-extractor.js +156 -156
- package/{dsh-mneme/lib → lib}/dream.js +958 -958
- package/{dsh-mneme/src → lib}/embedding.js +154 -154
- package/{dsh-mneme/src → lib}/entities/extractor.js +242 -242
- package/{dsh-mneme/lib → lib}/hot-memory.js +53 -53
- package/{dsh-mneme/lib → lib}/index.js +361 -361
- package/{dsh-mneme/src → lib}/inject.js +208 -208
- package/{dsh-mneme/lib → lib}/local-embedder.js +282 -282
- package/{dsh-mneme/lib → lib}/mirror.js +170 -170
- package/{dsh-mneme/lib → lib}/parser/tag.js +59 -59
- package/{dsh-mneme/lib → lib}/parser/wiki-link.js +38 -38
- package/{dsh-mneme/src → lib}/quality-filter.js +123 -123
- package/{dsh-mneme/lib → lib}/reranker.js +218 -218
- package/{dsh-mneme/src → lib}/search/adaptive.js +22 -22
- package/{dsh-mneme/src → lib}/search/bm25.js +96 -96
- package/{dsh-mneme/src → lib}/search/tag-boost.js +61 -61
- package/{dsh-mneme/src → lib}/service.js +1726 -1726
- package/{dsh-mneme/lib → lib}/settings.js +172 -172
- package/{dsh-mneme/src → lib}/store.js +2238 -2238
- package/{dsh-mneme/src → lib}/summarize.js +236 -236
- package/{dsh-mneme/src → lib}/tools.js +452 -290
- package/{dsh-mneme/lib → lib}/vector-index.js +116 -116
- package/package.json +40 -18
- package/{dsh-mneme/scripts → scripts}/benchmark-embed.js +201 -201
- package/{dsh-mneme/scripts → scripts}/benchmark-recall.js +133 -133
- package/{dsh-mneme/scripts → scripts}/benchmark-rerank.js +166 -166
- package/{dsh-mneme/scripts → scripts}/e2e-dsh.js +218 -218
- package/{dsh-mneme/scripts → scripts}/stress-dsh.js +255 -255
- package/{dsh-mneme/scripts → scripts}/sync-lib.js +52 -52
- package/{dsh-mneme/lib → src}/api.js +783 -783
- package/{dsh-mneme/lib → src}/commands.js +64 -64
- package/{dsh-mneme/src → src}/config.js +298 -298
- package/{dsh-mneme/src → src}/dream/clustering.js +118 -118
- package/{dsh-mneme/src → src}/dream/decisions.js +488 -488
- package/{dsh-mneme/src → src}/dream/sleep.js +561 -561
- package/{dsh-mneme/lib → src}/dream/tag-extractor.js +156 -156
- package/{dsh-mneme/src → src}/dream.js +958 -958
- package/{dsh-mneme/lib → src}/embedding.js +154 -154
- package/{dsh-mneme/lib → src}/entities/extractor.js +242 -242
- package/{dsh-mneme/src → src}/hot-memory.js +53 -53
- package/{dsh-mneme/src → src}/index.js +361 -361
- package/{dsh-mneme/lib → src}/inject.js +208 -208
- package/{dsh-mneme/src → src}/local-embedder.js +282 -282
- package/{dsh-mneme/src → src}/mirror.js +170 -170
- package/{dsh-mneme/src → src}/parser/tag.js +59 -59
- package/{dsh-mneme/src → src}/parser/wiki-link.js +38 -38
- package/{dsh-mneme/lib → src}/quality-filter.js +123 -123
- package/{dsh-mneme/src → src}/reranker.js +218 -218
- package/{dsh-mneme/lib → src}/search/adaptive.js +22 -22
- package/{dsh-mneme/lib → src}/search/bm25.js +96 -96
- package/{dsh-mneme/lib → src}/search/tag-boost.js +61 -61
- package/{dsh-mneme/lib → src}/service.js +1726 -1726
- package/{dsh-mneme/src → src}/settings.js +172 -172
- package/{dsh-mneme/lib → src}/store.js +2238 -2238
- package/{dsh-mneme/lib → src}/summarize.js +236 -236
- package/{dsh-mneme/lib → src}/tools.js +452 -290
- package/{dsh-mneme/src → src}/vector-index.js +116 -116
- package/{dsh-mneme/test → test}/api.test.js +594 -594
- package/{dsh-mneme/test → test}/audit.test.js +448 -448
- package/{dsh-mneme/test → test}/benchmark.test.js +35 -35
- package/{dsh-mneme/test → test}/boundary-v0625.test.js +82 -82
- package/{dsh-mneme/test → test}/client.test.js +368 -368
- package/{dsh-mneme/test → test}/clustering.test.js +100 -100
- package/{dsh-mneme/test → test}/commands.test.js +69 -69
- package/{dsh-mneme/test → test}/config.test.js +50 -50
- package/{dsh-mneme/test → test}/conflict-freeze.test.js +290 -290
- package/{dsh-mneme/test → test}/directory.test.js +134 -134
- package/{dsh-mneme/test → test}/dream.test.js +1060 -1060
- package/{dsh-mneme/test → test}/entities.test.js +522 -522
- package/{dsh-mneme/test → test}/epistemic.test.js +298 -298
- package/{dsh-mneme/test → test}/fnew-0112.test.js +311 -311
- package/{dsh-mneme/test → test}/fnew-03.test.js +422 -422
- package/{dsh-mneme/test → test}/graph-api.test.js +175 -175
- package/{dsh-mneme/test → test}/helpers/dream-mock.js +82 -82
- package/{dsh-mneme/test → test}/hot-memory.test.js +174 -174
- package/{dsh-mneme/test → test}/inject.test.js +103 -103
- package/{dsh-mneme/test → test}/llm-audit.test.js +279 -279
- package/{dsh-mneme/test → test}/local-embedder.test.js +227 -227
- package/{dsh-mneme/test → test}/mirror-dirty.test.js +424 -424
- package/{dsh-mneme/test → test}/mirror-edit-digest.test.js +187 -187
- package/{dsh-mneme/test → test}/mirror-generation.test.js +499 -499
- package/{dsh-mneme/test → test}/mirror.test.js +249 -249
- package/{dsh-mneme/test → test}/normalize-decisions.test.js +120 -120
- package/{dsh-mneme/test → test}/peer-blockers.test.js +190 -190
- package/{dsh-mneme/test → test}/policy-epoch.test.js +259 -259
- package/{dsh-mneme/test → test}/provenance.test.js +103 -103
- package/{dsh-mneme/test → test}/quality-filter.test.js +118 -118
- package/{dsh-mneme/test → test}/reasoning-effort.test.js +199 -199
- package/{dsh-mneme/test → test}/recall-evals.test.js +235 -235
- package/{dsh-mneme/test → test}/recall-layer.test.js +315 -315
- package/{dsh-mneme/test → test}/receipt-chain.test.js +451 -451
- package/{dsh-mneme/test → test}/reflection.test.js +226 -226
- package/{dsh-mneme/test → test}/reranker.test.js +240 -240
- package/{dsh-mneme/test → test}/search-fusion.test.js +90 -90
- package/{dsh-mneme/test → test}/semantic.test.js +124 -124
- package/{dsh-mneme/test → test}/service-search.test.js +199 -199
- package/{dsh-mneme/test → test}/service.test.js +435 -435
- package/{dsh-mneme/test → test}/settings.test.js +118 -118
- package/{dsh-mneme/test → test}/sleep.test.js +365 -365
- package/{dsh-mneme/test → test}/store.test.js +436 -436
- package/{dsh-mneme/test → test}/stress.test.js +209 -209
- package/{dsh-mneme/test → test}/summarize.test.js +191 -191
- package/{dsh-mneme/test → test}/tag-boost.test.js +125 -125
- package/{dsh-mneme/test → test}/tag.test.js +312 -312
- package/{dsh-mneme/test → test}/tools.test.js +541 -285
- package/{dsh-mneme/test → test}/vector-index.test.js +221 -221
- package/{dsh-mneme/test → test}/wiki-link.test.js +332 -332
- package/.github/workflows/test.yml +0 -32
- package/.release-notes-v0.6.9.md +0 -13
- package/CHANGELOG.md +0 -89
- package/SECURITY.md +0 -544
- package/docs/devlog/2026-08-14-dsh-mneme-dev-log.md +0 -247
- package/docs/devlog/2026-08-15-dsh-mneme-audit-stress-dev-log.md +0 -145
- package/docs/devlog/2026-08-15-dsh-mneme-pipeline-dev-log.md +0 -56
- package/docs/devlog/2026-08-15-dsh-mneme-reflection-dev-log.md +0 -77
- package/docs/devlog/2026-08-15-dsh-mneme-review-fixes-dev-log.md +0 -64
- package/docs/devlog/2026-08-15-dsh-mneme-semantic-dev-log.md +0 -90
- package/dsh-mneme/CHANGELOG.md +0 -248
- package/dsh-mneme/LICENSE +0 -21
- package/dsh-mneme/README.md +0 -465
- package/dsh-mneme/docs/AGENT_MEMORY_RESEARCH.md +0 -183
- package/dsh-mneme/docs/ENTITIES.md +0 -245
- package/dsh-mneme/docs/LOCAL_MODEL.md +0 -141
- package/dsh-mneme/docs/MIGRATION.md +0 -127
- package/dsh-mneme/docs/SEMANTIC.md +0 -256
- package/dsh-mneme/docs/SLEEP.md +0 -163
- package/dsh-mneme/package-lock.json +0 -1936
- package/dsh-mneme/package.json +0 -80
- package//346/250/252/345/271/205.png +0 -0
|
@@ -1,133 +1,133 @@
|
|
|
1
|
-
// Recall benchmark (v0.5.0 评测体系): a self-contained harness that seeds an
|
|
2
|
-
// in-memory store with labelled memories, runs a standard query set through
|
|
3
|
-
// the real searchMemories pipeline, and reports Recall@K / MRR per case and
|
|
4
|
-
// in aggregate. Runs in two configurations so the BM25/third-path lift is
|
|
5
|
-
// visible: `legacy` (bm25 + adaptive + dedup off) vs `fused` (defaults on).
|
|
6
|
-
//
|
|
7
|
-
// Usage:
|
|
8
|
-
// node scripts/benchmark-recall.js # run both configurations
|
|
9
|
-
// node scripts/benchmark-recall.js --json # machine-readable output
|
|
10
|
-
// The harness exports runBenchmark()/TEST_CASES for the test suite; the CLI
|
|
11
|
-
// path below only executes when invoked directly.
|
|
12
|
-
import { createStore } from "../src/store.js";
|
|
13
|
-
import { createService } from "../src/service.js";
|
|
14
|
-
import { createVectorIndex } from "../src/vector-index.js";
|
|
15
|
-
|
|
16
|
-
// Deterministic toy embedder: bag-of-words hashed into a fixed-dimension
|
|
17
|
-
// vector, so cosine similarity ≈ lexical overlap. Good enough to exercise
|
|
18
|
-
// the vector path mechanically — semantic quality is not under test here.
|
|
19
|
-
const DIM = 256;
|
|
20
|
-
function hashVec(text) {
|
|
21
|
-
const v = new Array(DIM).fill(0);
|
|
22
|
-
const tokens = String(text ?? "").toLowerCase().split(/[^\p{L}\p{N}]+/u).filter(Boolean);
|
|
23
|
-
for (const t of tokens) {
|
|
24
|
-
let h = 0;
|
|
25
|
-
for (const ch of t) h = (h * 31 + ch.codePointAt(0)) >>> 0;
|
|
26
|
-
v[h % DIM] += 1;
|
|
27
|
-
}
|
|
28
|
-
const norm = Math.sqrt(v.reduce((s, x) => s + x * x, 0)) || 1;
|
|
29
|
-
return v.map((x) => x / norm);
|
|
30
|
-
}
|
|
31
|
-
|
|
32
|
-
const SEED = [
|
|
33
|
-
{ id: "mem_user_pref", type: "preference", title: "编辑器偏好", content: "用户偏好 VS Code,深色主题,等宽字体 JetBrains Mono", importance: 4, tags: ["editor"] },
|
|
34
|
-
{ id: "mem_user_project", type: "project", title: "dsh-mneme 插件项目", content: "用户在开发 dsh-mneme 记忆插件,TypeScript 与 cordis 框架", importance: 5, tags: ["plugin"] },
|
|
35
|
-
{ id: "mem_rust_switch", type: "decision", title: "语言迁移决策", content: "项目编译模块从 Go 迁移到 Rust,理由是内存安全", importance: 4, tags: ["rust"] },
|
|
36
|
-
{ id: "mem_zfs_bug", type: "project", title: "ZFS-4421 数据损坏", content: "线上池 ZFS-4421 出现 checksum 错误,根因是 HBA 固件 bug", importance: 5, tags: ["ops"] },
|
|
37
|
-
{ id: "mem_city_thesis", type: "project", title: "湿地论文", content: "毕业论文研究城市湿地公园周边开发案例,ArcGIS 空间分析", importance: 4, tags: ["thesis"] },
|
|
38
|
-
{ id: "mem_async_pattern", type: "decision", title: "异步并发模式", content: "async runtime 选用 tokio,任务用 spawn 管理,channel 通信", importance: 3, tags: ["rust"] },
|
|
39
|
-
{ id: "mem_python_etl", type: "project", title: "ETL 脚本", content: "夜间 ETL 用 Python 编写,pandas 清洗,SQLite 落地", importance: 3, tags: ["etl"] },
|
|
40
|
-
{ id: "mem_ui_style", type: "preference", title: "界面审美", content: "喜欢编辑风 brutalism 排版,低饱和度配色,衬线标题", importance: 3, tags: ["design"] }
|
|
41
|
-
];
|
|
42
|
-
|
|
43
|
-
// Standard query set: each case is a query plus the ids that MUST appear in
|
|
44
|
-
// the top-K for the case to count as a hit. Covers the three recall paths —
|
|
45
|
-
// multi-term lexical (BM25's home turf), identifier lookup, and semantic.
|
|
46
|
-
export const TEST_CASES = [
|
|
47
|
-
{ query: "rust 异步", expected: ["mem_async_pattern", "mem_rust_switch"], note: "scattered terms — BM25 territory" },
|
|
48
|
-
{ query: "ZFS-4421 checksum", expected: ["mem_zfs_bug"], note: "identifier + keyword" },
|
|
49
|
-
{ query: "插件 开发", expected: ["mem_user_project"], note: "multi-term CJK" },
|
|
50
|
-
{ query: "论文 空间分析", expected: ["mem_city_thesis"], note: "scattered CJK terms" },
|
|
51
|
-
{ query: "ETL 脚本", expected: ["mem_python_etl"], note: "mixed" },
|
|
52
|
-
{ query: "深色主题", expected: ["mem_user_pref"], note: "substring match" },
|
|
53
|
-
{ query: "channel 通信 任务", expected: ["mem_async_pattern"], note: "scattered terms" },
|
|
54
|
-
{ query: "内存安全 语言", expected: ["mem_rust_switch"], note: "scattered terms" },
|
|
55
|
-
{ query: "配色 审美", expected: ["mem_ui_style"], note: "scattered CJK" },
|
|
56
|
-
{ query: "HBA 固件", expected: ["mem_zfs_bug"], note: "scattered terms" }
|
|
57
|
-
];
|
|
58
|
-
|
|
59
|
-
function seedService(overrides = {}) {
|
|
60
|
-
const store = createStore(":memory:");
|
|
61
|
-
const config = {
|
|
62
|
-
bm25SearchEnabled: true,
|
|
63
|
-
adaptiveThresholdEnabled: true,
|
|
64
|
-
searchSemanticDedup: true,
|
|
65
|
-
searchSemanticDedupThreshold: 0.95,
|
|
66
|
-
selectiveInjectEnabled: true,
|
|
67
|
-
entitySearchEnabled: false,
|
|
68
|
-
...overrides
|
|
69
|
-
};
|
|
70
|
-
const service = createService({ store, mirror: null, config, logger: null });
|
|
71
|
-
const vectorIndex = createVectorIndex({ store, logger: null });
|
|
72
|
-
service.setVectorIndex(vectorIndex);
|
|
73
|
-
service.setEmbedder({
|
|
74
|
-
embedSingle: async (text) => hashVec(text)
|
|
75
|
-
});
|
|
76
|
-
for (const m of SEED) {
|
|
77
|
-
const row = store.save({ type: m.type, title: m.title, content: m.content, tags: m.tags, importance: m.importance, source: "seed" });
|
|
78
|
-
store.setEmbedding(row.id, hashVec(`${m.title} ${m.content}`));
|
|
79
|
-
}
|
|
80
|
-
return service;
|
|
81
|
-
}
|
|
82
|
-
|
|
83
|
-
export async function runBenchmark({ topK = 5, mode = "auto" } = {}) {
|
|
84
|
-
const configs = [
|
|
85
|
-
{ name: "legacy", overrides: { bm25SearchEnabled: false, adaptiveThresholdEnabled: false, searchSemanticDedup: false } },
|
|
86
|
-
{ name: "fused", overrides: {} }
|
|
87
|
-
];
|
|
88
|
-
const runs = [];
|
|
89
|
-
for (const cfg of configs) {
|
|
90
|
-
const service = seedService(cfg.overrides);
|
|
91
|
-
const rows = [];
|
|
92
|
-
let hits = 0;
|
|
93
|
-
let mrrSum = 0;
|
|
94
|
-
for (const tc of TEST_CASES) {
|
|
95
|
-
const results = await service.searchMemories(tc.query, { mode, topK, useRerank: false });
|
|
96
|
-
const ids = results.map((r) => r.id);
|
|
97
|
-
const metrics = service.computeRetrievalMetrics(ids, tc.expected);
|
|
98
|
-
if (metrics.recall === 1) hits++;
|
|
99
|
-
mrrSum += metrics.mrr;
|
|
100
|
-
rows.push({ query: tc.query, note: tc.note, expected: tc.expected, got: ids, ...metrics });
|
|
101
|
-
}
|
|
102
|
-
runs.push({
|
|
103
|
-
config: cfg.name,
|
|
104
|
-
recallAtK: +(hits / TEST_CASES.length).toFixed(3),
|
|
105
|
-
avgMrr: +(mrrSum / TEST_CASES.length).toFixed(3),
|
|
106
|
-
rows
|
|
107
|
-
});
|
|
108
|
-
}
|
|
109
|
-
return { topK, mode, runs };
|
|
110
|
-
}
|
|
111
|
-
|
|
112
|
-
function printReport(report) {
|
|
113
|
-
for (const run of report.runs) {
|
|
114
|
-
console.log(`\n=== ${run.config} (topK=${report.topK}, mode=${report.mode}) ===`);
|
|
115
|
-
for (const r of run.rows) {
|
|
116
|
-
const ok = r.recall === 1 ? "PASS" : "MISS";
|
|
117
|
-
console.log(` [${ok}] "${r.query}" (${r.note}) recall=${r.recall} mrr=${r.mrr}`);
|
|
118
|
-
if (r.recall < 1) console.log(` expected ⊇ ${r.expected.join(", ")} got: ${r.got.join(", ") || "—"}`);
|
|
119
|
-
}
|
|
120
|
-
console.log(` → Recall@${report.topK}: ${(run.recallAtK * 100).toFixed(1)}% avg MRR: ${run.avgMrr}`);
|
|
121
|
-
}
|
|
122
|
-
const [legacy, fused] = report.runs;
|
|
123
|
-
const lift = ((fused.recallAtK - legacy.recallAtK) * 100).toFixed(1);
|
|
124
|
-
console.log(`\n三路融合 vs 旧两路: Recall@${report.topK} ${legacy.recallAtK * 100}% → ${fused.recallAtK * 100}% (${lift >= 0 ? "+" : ""}${lift}pp)`);
|
|
125
|
-
}
|
|
126
|
-
|
|
127
|
-
const invokedDirectly = process.argv[1] && import.meta.url.endsWith(process.argv[1].replace(/\\/g, "/").split("/").pop() ?? "");
|
|
128
|
-
if (invokedDirectly) {
|
|
129
|
-
const asJson = process.argv.includes("--json");
|
|
130
|
-
const report = await runBenchmark({});
|
|
131
|
-
if (asJson) console.log(JSON.stringify(report, null, 2));
|
|
132
|
-
else printReport(report);
|
|
133
|
-
}
|
|
1
|
+
// Recall benchmark (v0.5.0 评测体系): a self-contained harness that seeds an
|
|
2
|
+
// in-memory store with labelled memories, runs a standard query set through
|
|
3
|
+
// the real searchMemories pipeline, and reports Recall@K / MRR per case and
|
|
4
|
+
// in aggregate. Runs in two configurations so the BM25/third-path lift is
|
|
5
|
+
// visible: `legacy` (bm25 + adaptive + dedup off) vs `fused` (defaults on).
|
|
6
|
+
//
|
|
7
|
+
// Usage:
|
|
8
|
+
// node scripts/benchmark-recall.js # run both configurations
|
|
9
|
+
// node scripts/benchmark-recall.js --json # machine-readable output
|
|
10
|
+
// The harness exports runBenchmark()/TEST_CASES for the test suite; the CLI
|
|
11
|
+
// path below only executes when invoked directly.
|
|
12
|
+
import { createStore } from "../src/store.js";
|
|
13
|
+
import { createService } from "../src/service.js";
|
|
14
|
+
import { createVectorIndex } from "../src/vector-index.js";
|
|
15
|
+
|
|
16
|
+
// Deterministic toy embedder: bag-of-words hashed into a fixed-dimension
|
|
17
|
+
// vector, so cosine similarity ≈ lexical overlap. Good enough to exercise
|
|
18
|
+
// the vector path mechanically — semantic quality is not under test here.
|
|
19
|
+
const DIM = 256;
|
|
20
|
+
function hashVec(text) {
|
|
21
|
+
const v = new Array(DIM).fill(0);
|
|
22
|
+
const tokens = String(text ?? "").toLowerCase().split(/[^\p{L}\p{N}]+/u).filter(Boolean);
|
|
23
|
+
for (const t of tokens) {
|
|
24
|
+
let h = 0;
|
|
25
|
+
for (const ch of t) h = (h * 31 + ch.codePointAt(0)) >>> 0;
|
|
26
|
+
v[h % DIM] += 1;
|
|
27
|
+
}
|
|
28
|
+
const norm = Math.sqrt(v.reduce((s, x) => s + x * x, 0)) || 1;
|
|
29
|
+
return v.map((x) => x / norm);
|
|
30
|
+
}
|
|
31
|
+
|
|
32
|
+
const SEED = [
|
|
33
|
+
{ id: "mem_user_pref", type: "preference", title: "编辑器偏好", content: "用户偏好 VS Code,深色主题,等宽字体 JetBrains Mono", importance: 4, tags: ["editor"] },
|
|
34
|
+
{ id: "mem_user_project", type: "project", title: "dsh-mneme 插件项目", content: "用户在开发 dsh-mneme 记忆插件,TypeScript 与 cordis 框架", importance: 5, tags: ["plugin"] },
|
|
35
|
+
{ id: "mem_rust_switch", type: "decision", title: "语言迁移决策", content: "项目编译模块从 Go 迁移到 Rust,理由是内存安全", importance: 4, tags: ["rust"] },
|
|
36
|
+
{ id: "mem_zfs_bug", type: "project", title: "ZFS-4421 数据损坏", content: "线上池 ZFS-4421 出现 checksum 错误,根因是 HBA 固件 bug", importance: 5, tags: ["ops"] },
|
|
37
|
+
{ id: "mem_city_thesis", type: "project", title: "湿地论文", content: "毕业论文研究城市湿地公园周边开发案例,ArcGIS 空间分析", importance: 4, tags: ["thesis"] },
|
|
38
|
+
{ id: "mem_async_pattern", type: "decision", title: "异步并发模式", content: "async runtime 选用 tokio,任务用 spawn 管理,channel 通信", importance: 3, tags: ["rust"] },
|
|
39
|
+
{ id: "mem_python_etl", type: "project", title: "ETL 脚本", content: "夜间 ETL 用 Python 编写,pandas 清洗,SQLite 落地", importance: 3, tags: ["etl"] },
|
|
40
|
+
{ id: "mem_ui_style", type: "preference", title: "界面审美", content: "喜欢编辑风 brutalism 排版,低饱和度配色,衬线标题", importance: 3, tags: ["design"] }
|
|
41
|
+
];
|
|
42
|
+
|
|
43
|
+
// Standard query set: each case is a query plus the ids that MUST appear in
|
|
44
|
+
// the top-K for the case to count as a hit. Covers the three recall paths —
|
|
45
|
+
// multi-term lexical (BM25's home turf), identifier lookup, and semantic.
|
|
46
|
+
export const TEST_CASES = [
|
|
47
|
+
{ query: "rust 异步", expected: ["mem_async_pattern", "mem_rust_switch"], note: "scattered terms — BM25 territory" },
|
|
48
|
+
{ query: "ZFS-4421 checksum", expected: ["mem_zfs_bug"], note: "identifier + keyword" },
|
|
49
|
+
{ query: "插件 开发", expected: ["mem_user_project"], note: "multi-term CJK" },
|
|
50
|
+
{ query: "论文 空间分析", expected: ["mem_city_thesis"], note: "scattered CJK terms" },
|
|
51
|
+
{ query: "ETL 脚本", expected: ["mem_python_etl"], note: "mixed" },
|
|
52
|
+
{ query: "深色主题", expected: ["mem_user_pref"], note: "substring match" },
|
|
53
|
+
{ query: "channel 通信 任务", expected: ["mem_async_pattern"], note: "scattered terms" },
|
|
54
|
+
{ query: "内存安全 语言", expected: ["mem_rust_switch"], note: "scattered terms" },
|
|
55
|
+
{ query: "配色 审美", expected: ["mem_ui_style"], note: "scattered CJK" },
|
|
56
|
+
{ query: "HBA 固件", expected: ["mem_zfs_bug"], note: "scattered terms" }
|
|
57
|
+
];
|
|
58
|
+
|
|
59
|
+
function seedService(overrides = {}) {
|
|
60
|
+
const store = createStore(":memory:");
|
|
61
|
+
const config = {
|
|
62
|
+
bm25SearchEnabled: true,
|
|
63
|
+
adaptiveThresholdEnabled: true,
|
|
64
|
+
searchSemanticDedup: true,
|
|
65
|
+
searchSemanticDedupThreshold: 0.95,
|
|
66
|
+
selectiveInjectEnabled: true,
|
|
67
|
+
entitySearchEnabled: false,
|
|
68
|
+
...overrides
|
|
69
|
+
};
|
|
70
|
+
const service = createService({ store, mirror: null, config, logger: null });
|
|
71
|
+
const vectorIndex = createVectorIndex({ store, logger: null });
|
|
72
|
+
service.setVectorIndex(vectorIndex);
|
|
73
|
+
service.setEmbedder({
|
|
74
|
+
embedSingle: async (text) => hashVec(text)
|
|
75
|
+
});
|
|
76
|
+
for (const m of SEED) {
|
|
77
|
+
const row = store.save({ type: m.type, title: m.title, content: m.content, tags: m.tags, importance: m.importance, source: "seed" });
|
|
78
|
+
store.setEmbedding(row.id, hashVec(`${m.title} ${m.content}`));
|
|
79
|
+
}
|
|
80
|
+
return service;
|
|
81
|
+
}
|
|
82
|
+
|
|
83
|
+
export async function runBenchmark({ topK = 5, mode = "auto" } = {}) {
|
|
84
|
+
const configs = [
|
|
85
|
+
{ name: "legacy", overrides: { bm25SearchEnabled: false, adaptiveThresholdEnabled: false, searchSemanticDedup: false } },
|
|
86
|
+
{ name: "fused", overrides: {} }
|
|
87
|
+
];
|
|
88
|
+
const runs = [];
|
|
89
|
+
for (const cfg of configs) {
|
|
90
|
+
const service = seedService(cfg.overrides);
|
|
91
|
+
const rows = [];
|
|
92
|
+
let hits = 0;
|
|
93
|
+
let mrrSum = 0;
|
|
94
|
+
for (const tc of TEST_CASES) {
|
|
95
|
+
const results = await service.searchMemories(tc.query, { mode, topK, useRerank: false });
|
|
96
|
+
const ids = results.map((r) => r.id);
|
|
97
|
+
const metrics = service.computeRetrievalMetrics(ids, tc.expected);
|
|
98
|
+
if (metrics.recall === 1) hits++;
|
|
99
|
+
mrrSum += metrics.mrr;
|
|
100
|
+
rows.push({ query: tc.query, note: tc.note, expected: tc.expected, got: ids, ...metrics });
|
|
101
|
+
}
|
|
102
|
+
runs.push({
|
|
103
|
+
config: cfg.name,
|
|
104
|
+
recallAtK: +(hits / TEST_CASES.length).toFixed(3),
|
|
105
|
+
avgMrr: +(mrrSum / TEST_CASES.length).toFixed(3),
|
|
106
|
+
rows
|
|
107
|
+
});
|
|
108
|
+
}
|
|
109
|
+
return { topK, mode, runs };
|
|
110
|
+
}
|
|
111
|
+
|
|
112
|
+
function printReport(report) {
|
|
113
|
+
for (const run of report.runs) {
|
|
114
|
+
console.log(`\n=== ${run.config} (topK=${report.topK}, mode=${report.mode}) ===`);
|
|
115
|
+
for (const r of run.rows) {
|
|
116
|
+
const ok = r.recall === 1 ? "PASS" : "MISS";
|
|
117
|
+
console.log(` [${ok}] "${r.query}" (${r.note}) recall=${r.recall} mrr=${r.mrr}`);
|
|
118
|
+
if (r.recall < 1) console.log(` expected ⊇ ${r.expected.join(", ")} got: ${r.got.join(", ") || "—"}`);
|
|
119
|
+
}
|
|
120
|
+
console.log(` → Recall@${report.topK}: ${(run.recallAtK * 100).toFixed(1)}% avg MRR: ${run.avgMrr}`);
|
|
121
|
+
}
|
|
122
|
+
const [legacy, fused] = report.runs;
|
|
123
|
+
const lift = ((fused.recallAtK - legacy.recallAtK) * 100).toFixed(1);
|
|
124
|
+
console.log(`\n三路融合 vs 旧两路: Recall@${report.topK} ${legacy.recallAtK * 100}% → ${fused.recallAtK * 100}% (${lift >= 0 ? "+" : ""}${lift}pp)`);
|
|
125
|
+
}
|
|
126
|
+
|
|
127
|
+
const invokedDirectly = process.argv[1] && import.meta.url.endsWith(process.argv[1].replace(/\\/g, "/").split("/").pop() ?? "");
|
|
128
|
+
if (invokedDirectly) {
|
|
129
|
+
const asJson = process.argv.includes("--json");
|
|
130
|
+
const report = await runBenchmark({});
|
|
131
|
+
if (asJson) console.log(JSON.stringify(report, null, 2));
|
|
132
|
+
else printReport(report);
|
|
133
|
+
}
|
|
@@ -1,166 +1,166 @@
|
|
|
1
|
-
#!/usr/bin/env node
|
|
2
|
-
// scripts/benchmark-rerank.js
|
|
3
|
-
// Rerank 延迟基准:测量 LocalReranker(Xenova/bge-reranker-base,交叉编码)
|
|
4
|
-
// 在不同候选集规模下的精排延迟。src/reranker.js 尚在开发(Phase 2),这里用
|
|
5
|
-
// await import() 动态加载,失败时打印友好错误而非崩溃。
|
|
6
|
-
//
|
|
7
|
-
// 用法:
|
|
8
|
-
// node scripts/benchmark-rerank.js # 默认候选 [10,50,100,500]
|
|
9
|
-
// node scripts/benchmark-rerank.js --candidates 10,100,1000
|
|
10
|
-
// node scripts/benchmark-rerank.js --candidates 10 --top-k 3 --model Xenova/bge-reranker-base
|
|
11
|
-
// node scripts/benchmark-rerank.js --device cpu --batch-size 4
|
|
12
|
-
// node scripts/benchmark-rerank.js --help
|
|
13
|
-
//
|
|
14
|
-
// 环境变量:RERANK_MODEL / RERANK_DEVICE / RERANK_BATCH_SIZE / RERANK_CACHE_DIR。
|
|
15
|
-
|
|
16
|
-
function pad(s, n) {
|
|
17
|
-
const str = String(s);
|
|
18
|
-
return str.length >= n ? str : str + " ".repeat(n - str.length);
|
|
19
|
-
}
|
|
20
|
-
|
|
21
|
-
const QUERY = "如何为记忆插件配置本地语义搜索模型?";
|
|
22
|
-
|
|
23
|
-
// 与 benchmark-embed.js 同源的样本文本库,模拟记忆库候选。
|
|
24
|
-
const CANDIDATE_TEXTS = [
|
|
25
|
-
"用户偏好使用中文交流,偶尔夹杂英文术语。",
|
|
26
|
-
"项目使用 SQLite 作为主存储,Markdown 作为人工可读镜像。",
|
|
27
|
-
"考研科目:公共管理学(631)与公共政策学(864)。",
|
|
28
|
-
"autoDream 在后台自动去重、合并、归档记忆。",
|
|
29
|
-
"本地模型支持 ONNX、Ollama 与 OpenAI 兼容三种后端。",
|
|
30
|
-
"Rerank 精排可以提升语义检索的 Top-K 准确率。",
|
|
31
|
-
"记忆库越大,向量检索的优势越明显。",
|
|
32
|
-
"今天完成了语义引擎的架构设计文档。",
|
|
33
|
-
"Web 记忆面板支持按类型浏览与全文搜索。",
|
|
34
|
-
"用户每天 9-18 点在线上班,上午做深度工作。",
|
|
35
|
-
];
|
|
36
|
-
|
|
37
|
-
function parseArgs(argv) {
|
|
38
|
-
const args = {
|
|
39
|
-
candidates: [10, 50, 100, 500], topK: 5, model: null, device: null,
|
|
40
|
-
batchSize: null, cacheDir: null, query: QUERY, help: false
|
|
41
|
-
};
|
|
42
|
-
for (let i = 0; i < argv.length; i++) {
|
|
43
|
-
const a = argv[i];
|
|
44
|
-
const take = (n) => (argv[i + 1] !== undefined ? argv[i + 1] : null);
|
|
45
|
-
if (a === "--help" || a === "-h") { args.help = true; break; }
|
|
46
|
-
if (a === "--candidates") {
|
|
47
|
-
args.candidates = String(take("candidates", i++)).split(",").map(Number).filter((n) => n > 0);
|
|
48
|
-
if (!args.candidates.length) args.candidates = [10];
|
|
49
|
-
} else if (a === "--top-k") args.topK = Number(take("top-k", i++)) || args.topK;
|
|
50
|
-
else if (a === "--model") args.model = take("model", i++);
|
|
51
|
-
else if (a === "--device") args.device = take("device", i++);
|
|
52
|
-
else if (a === "--batch-size") args.batchSize = Number(take("batch-size", i++)) || null;
|
|
53
|
-
else if (a === "--cache-dir") args.cacheDir = take("cache-dir", i++);
|
|
54
|
-
else if (a === "--query") args.query = take("query", i++);
|
|
55
|
-
else { console.error(`未知参数:${a}(用 --help 查看用法)`); process.exit(2); }
|
|
56
|
-
}
|
|
57
|
-
const env = process.env;
|
|
58
|
-
args.model = args.model ?? env.RERANK_MODEL ?? null;
|
|
59
|
-
args.device = args.device ?? env.RERANK_DEVICE ?? "cpu";
|
|
60
|
-
args.batchSize = args.batchSize ?? (env.RERANK_BATCH_SIZE ? Number(env.RERANK_BATCH_SIZE) : 8);
|
|
61
|
-
args.cacheDir = args.cacheDir ?? env.RERANK_CACHE_DIR ?? "";
|
|
62
|
-
return args;
|
|
63
|
-
}
|
|
64
|
-
|
|
65
|
-
function usage() {
|
|
66
|
-
console.log(`Rerank 延迟基准(dsh-mneme)
|
|
67
|
-
|
|
68
|
-
用法:
|
|
69
|
-
node scripts/benchmark-rerank.js [选项]
|
|
70
|
-
|
|
71
|
-
选项:
|
|
72
|
-
--candidates <n1,n2,...> 候选集规模列表,逗号分隔(默认 10,50,100,500)
|
|
73
|
-
--top-k <n> 精排返回条数(默认 5)
|
|
74
|
-
--model <name> Rerank 模型(默认 Xenova/bge-reranker-base)
|
|
75
|
-
--device <cpu|wasm|gpu> ONNX 设备(默认 cpu)
|
|
76
|
-
--batch-size <n> 批大小(默认 8)
|
|
77
|
-
--cache-dir <dir> 模型缓存目录
|
|
78
|
-
--query <text> 检索 query(默认内置示例)
|
|
79
|
-
-h, --help 显示帮助并退出
|
|
80
|
-
|
|
81
|
-
环境变量:RERANK_MODEL / RERANK_DEVICE / RERANK_BATCH_SIZE / RERANK_CACHE_DIR
|
|
82
|
-
(命令行参数优先)
|
|
83
|
-
`);
|
|
84
|
-
}
|
|
85
|
-
|
|
86
|
-
function buildCandidates(n) {
|
|
87
|
-
const out = [];
|
|
88
|
-
for (let i = 0; i < n; i++) {
|
|
89
|
-
const t = CANDIDATE_TEXTS[i % CANDIDATE_TEXTS.length];
|
|
90
|
-
out.push(i < CANDIDATE_TEXTS.length ? t : `${t} —— 变体 #${i + 1}`);
|
|
91
|
-
}
|
|
92
|
-
return out;
|
|
93
|
-
}
|
|
94
|
-
|
|
95
|
-
async function main() {
|
|
96
|
-
const args = parseArgs(process.argv.slice(2));
|
|
97
|
-
if (args.help) { usage(); process.exit(0); }
|
|
98
|
-
|
|
99
|
-
let mod;
|
|
100
|
-
try {
|
|
101
|
-
mod = await import("../src/reranker.js");
|
|
102
|
-
} catch (err) {
|
|
103
|
-
console.error("无法加载 src/reranker.js:");
|
|
104
|
-
console.error(` ${err.message}`);
|
|
105
|
-
console.error("该模块属 Phase 2,可能尚未创建。基准脚本依赖导出 LocalReranker。");
|
|
106
|
-
process.exit(1);
|
|
107
|
-
}
|
|
108
|
-
const { LocalReranker } = mod;
|
|
109
|
-
if (typeof LocalReranker !== "function") {
|
|
110
|
-
console.error("src/reranker.js 未导出 LocalReranker,请先实现该模块。");
|
|
111
|
-
process.exit(1);
|
|
112
|
-
}
|
|
113
|
-
|
|
114
|
-
let reranker;
|
|
115
|
-
try {
|
|
116
|
-
reranker = new LocalReranker({
|
|
117
|
-
model: args.model ?? undefined,
|
|
118
|
-
device: args.device,
|
|
119
|
-
batchSize: args.batchSize,
|
|
120
|
-
cacheDir: args.cacheDir || undefined,
|
|
121
|
-
logger: null
|
|
122
|
-
});
|
|
123
|
-
await reranker.init();
|
|
124
|
-
} catch (err) {
|
|
125
|
-
console.error(`初始化 Reranker 失败:${err.message}`);
|
|
126
|
-
console.error("请检查模型是否已下载、设备配置是否正确。");
|
|
127
|
-
process.exit(1);
|
|
128
|
-
}
|
|
129
|
-
|
|
130
|
-
console.log("══════ dsh-mneme Rerank 延迟基准 ══════");
|
|
131
|
-
console.log(`模型:${reranker.model ?? "(默认)"} 设备:${args.device} 候选规模:${args.candidates.join(", ")} Top-K:${args.topK}`);
|
|
132
|
-
console.log(`query:${args.query}\n`);
|
|
133
|
-
|
|
134
|
-
// 小规模预热(含首次加载推理)
|
|
135
|
-
try {
|
|
136
|
-
await reranker.rerank(args.query, buildCandidates(5), 3);
|
|
137
|
-
} catch (err) {
|
|
138
|
-
console.error(`预热失败:${err.message}`);
|
|
139
|
-
process.exit(1);
|
|
140
|
-
}
|
|
141
|
-
|
|
142
|
-
console.log(`${pad("候选数", 10)}${pad("Top-K", 8)}${pad("耗时(ms)", 12)}${pad("ms/候选", 10)}`);
|
|
143
|
-
for (const n of args.candidates) {
|
|
144
|
-
const candidates = buildCandidates(n);
|
|
145
|
-
const t0 = process.hrtime.bigint();
|
|
146
|
-
try {
|
|
147
|
-
const result = await reranker.rerank(args.query, candidates, args.topK);
|
|
148
|
-
if (!Array.isArray(result)) {
|
|
149
|
-
console.error(`候选 ${n} 时 rerank 返回非数组,请检查 LocalReranker.rerank 的返回约定。`);
|
|
150
|
-
process.exit(1);
|
|
151
|
-
}
|
|
152
|
-
} catch (err) {
|
|
153
|
-
console.error(`候选 ${n} 时 rerank 失败:${err.message}`);
|
|
154
|
-
process.exit(1);
|
|
155
|
-
}
|
|
156
|
-
const ms = Number(process.hrtime.bigint() - t0) / 1e6;
|
|
157
|
-
console.log(`${pad(n, 10)}${pad(args.topK, 8)}${pad(ms.toFixed(1), 12)}${pad((ms / n).toFixed(3), 10)}`);
|
|
158
|
-
}
|
|
159
|
-
console.log("══════ 结束 ══════");
|
|
160
|
-
reranker.dispose?.();
|
|
161
|
-
}
|
|
162
|
-
|
|
163
|
-
main().catch((err) => {
|
|
164
|
-
console.error(`未预期错误:${err?.stack ?? err}`);
|
|
165
|
-
process.exit(1);
|
|
166
|
-
});
|
|
1
|
+
#!/usr/bin/env node
|
|
2
|
+
// scripts/benchmark-rerank.js
|
|
3
|
+
// Rerank 延迟基准:测量 LocalReranker(Xenova/bge-reranker-base,交叉编码)
|
|
4
|
+
// 在不同候选集规模下的精排延迟。src/reranker.js 尚在开发(Phase 2),这里用
|
|
5
|
+
// await import() 动态加载,失败时打印友好错误而非崩溃。
|
|
6
|
+
//
|
|
7
|
+
// 用法:
|
|
8
|
+
// node scripts/benchmark-rerank.js # 默认候选 [10,50,100,500]
|
|
9
|
+
// node scripts/benchmark-rerank.js --candidates 10,100,1000
|
|
10
|
+
// node scripts/benchmark-rerank.js --candidates 10 --top-k 3 --model Xenova/bge-reranker-base
|
|
11
|
+
// node scripts/benchmark-rerank.js --device cpu --batch-size 4
|
|
12
|
+
// node scripts/benchmark-rerank.js --help
|
|
13
|
+
//
|
|
14
|
+
// 环境变量:RERANK_MODEL / RERANK_DEVICE / RERANK_BATCH_SIZE / RERANK_CACHE_DIR。
|
|
15
|
+
|
|
16
|
+
function pad(s, n) {
|
|
17
|
+
const str = String(s);
|
|
18
|
+
return str.length >= n ? str : str + " ".repeat(n - str.length);
|
|
19
|
+
}
|
|
20
|
+
|
|
21
|
+
const QUERY = "如何为记忆插件配置本地语义搜索模型?";
|
|
22
|
+
|
|
23
|
+
// 与 benchmark-embed.js 同源的样本文本库,模拟记忆库候选。
|
|
24
|
+
const CANDIDATE_TEXTS = [
|
|
25
|
+
"用户偏好使用中文交流,偶尔夹杂英文术语。",
|
|
26
|
+
"项目使用 SQLite 作为主存储,Markdown 作为人工可读镜像。",
|
|
27
|
+
"考研科目:公共管理学(631)与公共政策学(864)。",
|
|
28
|
+
"autoDream 在后台自动去重、合并、归档记忆。",
|
|
29
|
+
"本地模型支持 ONNX、Ollama 与 OpenAI 兼容三种后端。",
|
|
30
|
+
"Rerank 精排可以提升语义检索的 Top-K 准确率。",
|
|
31
|
+
"记忆库越大,向量检索的优势越明显。",
|
|
32
|
+
"今天完成了语义引擎的架构设计文档。",
|
|
33
|
+
"Web 记忆面板支持按类型浏览与全文搜索。",
|
|
34
|
+
"用户每天 9-18 点在线上班,上午做深度工作。",
|
|
35
|
+
];
|
|
36
|
+
|
|
37
|
+
function parseArgs(argv) {
|
|
38
|
+
const args = {
|
|
39
|
+
candidates: [10, 50, 100, 500], topK: 5, model: null, device: null,
|
|
40
|
+
batchSize: null, cacheDir: null, query: QUERY, help: false
|
|
41
|
+
};
|
|
42
|
+
for (let i = 0; i < argv.length; i++) {
|
|
43
|
+
const a = argv[i];
|
|
44
|
+
const take = (n) => (argv[i + 1] !== undefined ? argv[i + 1] : null);
|
|
45
|
+
if (a === "--help" || a === "-h") { args.help = true; break; }
|
|
46
|
+
if (a === "--candidates") {
|
|
47
|
+
args.candidates = String(take("candidates", i++)).split(",").map(Number).filter((n) => n > 0);
|
|
48
|
+
if (!args.candidates.length) args.candidates = [10];
|
|
49
|
+
} else if (a === "--top-k") args.topK = Number(take("top-k", i++)) || args.topK;
|
|
50
|
+
else if (a === "--model") args.model = take("model", i++);
|
|
51
|
+
else if (a === "--device") args.device = take("device", i++);
|
|
52
|
+
else if (a === "--batch-size") args.batchSize = Number(take("batch-size", i++)) || null;
|
|
53
|
+
else if (a === "--cache-dir") args.cacheDir = take("cache-dir", i++);
|
|
54
|
+
else if (a === "--query") args.query = take("query", i++);
|
|
55
|
+
else { console.error(`未知参数:${a}(用 --help 查看用法)`); process.exit(2); }
|
|
56
|
+
}
|
|
57
|
+
const env = process.env;
|
|
58
|
+
args.model = args.model ?? env.RERANK_MODEL ?? null;
|
|
59
|
+
args.device = args.device ?? env.RERANK_DEVICE ?? "cpu";
|
|
60
|
+
args.batchSize = args.batchSize ?? (env.RERANK_BATCH_SIZE ? Number(env.RERANK_BATCH_SIZE) : 8);
|
|
61
|
+
args.cacheDir = args.cacheDir ?? env.RERANK_CACHE_DIR ?? "";
|
|
62
|
+
return args;
|
|
63
|
+
}
|
|
64
|
+
|
|
65
|
+
function usage() {
|
|
66
|
+
console.log(`Rerank 延迟基准(dsh-mneme)
|
|
67
|
+
|
|
68
|
+
用法:
|
|
69
|
+
node scripts/benchmark-rerank.js [选项]
|
|
70
|
+
|
|
71
|
+
选项:
|
|
72
|
+
--candidates <n1,n2,...> 候选集规模列表,逗号分隔(默认 10,50,100,500)
|
|
73
|
+
--top-k <n> 精排返回条数(默认 5)
|
|
74
|
+
--model <name> Rerank 模型(默认 Xenova/bge-reranker-base)
|
|
75
|
+
--device <cpu|wasm|gpu> ONNX 设备(默认 cpu)
|
|
76
|
+
--batch-size <n> 批大小(默认 8)
|
|
77
|
+
--cache-dir <dir> 模型缓存目录
|
|
78
|
+
--query <text> 检索 query(默认内置示例)
|
|
79
|
+
-h, --help 显示帮助并退出
|
|
80
|
+
|
|
81
|
+
环境变量:RERANK_MODEL / RERANK_DEVICE / RERANK_BATCH_SIZE / RERANK_CACHE_DIR
|
|
82
|
+
(命令行参数优先)
|
|
83
|
+
`);
|
|
84
|
+
}
|
|
85
|
+
|
|
86
|
+
function buildCandidates(n) {
|
|
87
|
+
const out = [];
|
|
88
|
+
for (let i = 0; i < n; i++) {
|
|
89
|
+
const t = CANDIDATE_TEXTS[i % CANDIDATE_TEXTS.length];
|
|
90
|
+
out.push(i < CANDIDATE_TEXTS.length ? t : `${t} —— 变体 #${i + 1}`);
|
|
91
|
+
}
|
|
92
|
+
return out;
|
|
93
|
+
}
|
|
94
|
+
|
|
95
|
+
async function main() {
|
|
96
|
+
const args = parseArgs(process.argv.slice(2));
|
|
97
|
+
if (args.help) { usage(); process.exit(0); }
|
|
98
|
+
|
|
99
|
+
let mod;
|
|
100
|
+
try {
|
|
101
|
+
mod = await import("../src/reranker.js");
|
|
102
|
+
} catch (err) {
|
|
103
|
+
console.error("无法加载 src/reranker.js:");
|
|
104
|
+
console.error(` ${err.message}`);
|
|
105
|
+
console.error("该模块属 Phase 2,可能尚未创建。基准脚本依赖导出 LocalReranker。");
|
|
106
|
+
process.exit(1);
|
|
107
|
+
}
|
|
108
|
+
const { LocalReranker } = mod;
|
|
109
|
+
if (typeof LocalReranker !== "function") {
|
|
110
|
+
console.error("src/reranker.js 未导出 LocalReranker,请先实现该模块。");
|
|
111
|
+
process.exit(1);
|
|
112
|
+
}
|
|
113
|
+
|
|
114
|
+
let reranker;
|
|
115
|
+
try {
|
|
116
|
+
reranker = new LocalReranker({
|
|
117
|
+
model: args.model ?? undefined,
|
|
118
|
+
device: args.device,
|
|
119
|
+
batchSize: args.batchSize,
|
|
120
|
+
cacheDir: args.cacheDir || undefined,
|
|
121
|
+
logger: null
|
|
122
|
+
});
|
|
123
|
+
await reranker.init();
|
|
124
|
+
} catch (err) {
|
|
125
|
+
console.error(`初始化 Reranker 失败:${err.message}`);
|
|
126
|
+
console.error("请检查模型是否已下载、设备配置是否正确。");
|
|
127
|
+
process.exit(1);
|
|
128
|
+
}
|
|
129
|
+
|
|
130
|
+
console.log("══════ dsh-mneme Rerank 延迟基准 ══════");
|
|
131
|
+
console.log(`模型:${reranker.model ?? "(默认)"} 设备:${args.device} 候选规模:${args.candidates.join(", ")} Top-K:${args.topK}`);
|
|
132
|
+
console.log(`query:${args.query}\n`);
|
|
133
|
+
|
|
134
|
+
// 小规模预热(含首次加载推理)
|
|
135
|
+
try {
|
|
136
|
+
await reranker.rerank(args.query, buildCandidates(5), 3);
|
|
137
|
+
} catch (err) {
|
|
138
|
+
console.error(`预热失败:${err.message}`);
|
|
139
|
+
process.exit(1);
|
|
140
|
+
}
|
|
141
|
+
|
|
142
|
+
console.log(`${pad("候选数", 10)}${pad("Top-K", 8)}${pad("耗时(ms)", 12)}${pad("ms/候选", 10)}`);
|
|
143
|
+
for (const n of args.candidates) {
|
|
144
|
+
const candidates = buildCandidates(n);
|
|
145
|
+
const t0 = process.hrtime.bigint();
|
|
146
|
+
try {
|
|
147
|
+
const result = await reranker.rerank(args.query, candidates, args.topK);
|
|
148
|
+
if (!Array.isArray(result)) {
|
|
149
|
+
console.error(`候选 ${n} 时 rerank 返回非数组,请检查 LocalReranker.rerank 的返回约定。`);
|
|
150
|
+
process.exit(1);
|
|
151
|
+
}
|
|
152
|
+
} catch (err) {
|
|
153
|
+
console.error(`候选 ${n} 时 rerank 失败:${err.message}`);
|
|
154
|
+
process.exit(1);
|
|
155
|
+
}
|
|
156
|
+
const ms = Number(process.hrtime.bigint() - t0) / 1e6;
|
|
157
|
+
console.log(`${pad(n, 10)}${pad(args.topK, 8)}${pad(ms.toFixed(1), 12)}${pad((ms / n).toFixed(3), 10)}`);
|
|
158
|
+
}
|
|
159
|
+
console.log("══════ 结束 ══════");
|
|
160
|
+
reranker.dispose?.();
|
|
161
|
+
}
|
|
162
|
+
|
|
163
|
+
main().catch((err) => {
|
|
164
|
+
console.error(`未预期错误:${err?.stack ?? err}`);
|
|
165
|
+
process.exit(1);
|
|
166
|
+
});
|