@modusensus/dsh-mneme 0.6.7 → 0.6.9

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (139) hide show
  1. package/.github/workflows/test.yml +32 -0
  2. package/.release-notes-v0.6.9.md +13 -0
  3. package/CHANGELOG.md +89 -0
  4. package/LICENSE +21 -21
  5. package/README.md +219 -463
  6. package/SECURITY.md +544 -0
  7. package/docs/devlog/2026-08-14-dsh-mneme-dev-log.md +247 -0
  8. package/docs/devlog/2026-08-15-dsh-mneme-audit-stress-dev-log.md +145 -0
  9. package/docs/devlog/2026-08-15-dsh-mneme-pipeline-dev-log.md +56 -0
  10. package/docs/devlog/2026-08-15-dsh-mneme-reflection-dev-log.md +77 -0
  11. package/docs/devlog/2026-08-15-dsh-mneme-review-fixes-dev-log.md +64 -0
  12. package/docs/devlog/2026-08-15-dsh-mneme-semantic-dev-log.md +90 -0
  13. package/dsh-mneme/CHANGELOG.md +248 -0
  14. package/dsh-mneme/LICENSE +21 -0
  15. package/dsh-mneme/README.md +465 -0
  16. package/{cordis.patch.yml → dsh-mneme/cordis.patch.yml} +15 -15
  17. package/dsh-mneme/docs/AGENT_MEMORY_RESEARCH.md +183 -0
  18. package/dsh-mneme/docs/ENTITIES.md +245 -0
  19. package/dsh-mneme/docs/LOCAL_MODEL.md +141 -0
  20. package/dsh-mneme/docs/MIGRATION.md +127 -0
  21. package/dsh-mneme/docs/SEMANTIC.md +256 -0
  22. package/dsh-mneme/docs/SLEEP.md +163 -0
  23. package/{lib → dsh-mneme/lib}/api.js +783 -783
  24. package/{lib → dsh-mneme/lib}/client.js +1757 -1757
  25. package/{src → dsh-mneme/lib}/commands.js +64 -64
  26. package/{lib → dsh-mneme/lib}/config.js +298 -288
  27. package/{lib → dsh-mneme/lib}/dream/clustering.js +118 -118
  28. package/{src → dsh-mneme/lib}/dream/decisions.js +488 -439
  29. package/{lib → dsh-mneme/lib}/dream/sleep.js +561 -554
  30. package/{src → dsh-mneme/lib}/dream/tag-extractor.js +156 -156
  31. package/{lib → dsh-mneme/lib}/dream.js +958 -929
  32. package/{src → dsh-mneme/lib}/embedding.js +154 -154
  33. package/{src → dsh-mneme/lib}/entities/extractor.js +242 -242
  34. package/{src → dsh-mneme/lib}/hot-memory.js +53 -53
  35. package/{lib → dsh-mneme/lib}/index.js +361 -361
  36. package/{src → dsh-mneme/lib}/inject.js +208 -208
  37. package/{lib → dsh-mneme/lib}/local-embedder.js +282 -282
  38. package/{lib → dsh-mneme/lib}/mirror.js +170 -170
  39. package/{lib → dsh-mneme/lib}/parser/tag.js +59 -59
  40. package/{lib → dsh-mneme/lib}/parser/wiki-link.js +38 -38
  41. package/{src → dsh-mneme/lib}/quality-filter.js +123 -123
  42. package/{lib → dsh-mneme/lib}/reranker.js +218 -218
  43. package/{lib → dsh-mneme/lib}/search/adaptive.js +22 -22
  44. package/{lib → dsh-mneme/lib}/search/bm25.js +96 -96
  45. package/{src → dsh-mneme/lib}/search/tag-boost.js +61 -61
  46. package/{src → dsh-mneme/lib}/service.js +1726 -1726
  47. package/{lib → dsh-mneme/lib}/settings.js +172 -172
  48. package/{lib → dsh-mneme/lib}/store.js +2238 -2238
  49. package/{lib → dsh-mneme/lib}/summarize.js +236 -236
  50. package/{lib → dsh-mneme/lib}/tools.js +290 -290
  51. package/{lib → dsh-mneme/lib}/vector-index.js +116 -116
  52. package/dsh-mneme/package-lock.json +1936 -0
  53. package/dsh-mneme/package.json +80 -0
  54. package/{scripts → dsh-mneme/scripts}/benchmark-embed.js +201 -201
  55. package/{scripts → dsh-mneme/scripts}/benchmark-recall.js +133 -133
  56. package/{scripts → dsh-mneme/scripts}/benchmark-rerank.js +166 -166
  57. package/{scripts → dsh-mneme/scripts}/e2e-dsh.js +218 -218
  58. package/{scripts → dsh-mneme/scripts}/stress-dsh.js +255 -255
  59. package/{scripts → dsh-mneme/scripts}/sync-lib.js +52 -52
  60. package/{src → dsh-mneme/src}/api.js +783 -783
  61. package/{lib → dsh-mneme/src}/commands.js +64 -64
  62. package/{src → dsh-mneme/src}/config.js +298 -288
  63. package/{src → dsh-mneme/src}/dream/clustering.js +118 -118
  64. package/{lib → dsh-mneme/src}/dream/decisions.js +488 -439
  65. package/{src → dsh-mneme/src}/dream/sleep.js +561 -554
  66. package/{lib → dsh-mneme/src}/dream/tag-extractor.js +156 -156
  67. package/{src → dsh-mneme/src}/dream.js +958 -929
  68. package/{lib → dsh-mneme/src}/embedding.js +154 -154
  69. package/{lib → dsh-mneme/src}/entities/extractor.js +242 -242
  70. package/{lib → dsh-mneme/src}/hot-memory.js +53 -53
  71. package/{src → dsh-mneme/src}/index.js +361 -361
  72. package/{lib → dsh-mneme/src}/inject.js +208 -208
  73. package/{src → dsh-mneme/src}/local-embedder.js +282 -282
  74. package/{src → dsh-mneme/src}/mirror.js +170 -170
  75. package/{src → dsh-mneme/src}/parser/tag.js +59 -59
  76. package/{src → dsh-mneme/src}/parser/wiki-link.js +38 -38
  77. package/{lib → dsh-mneme/src}/quality-filter.js +123 -123
  78. package/{src → dsh-mneme/src}/reranker.js +218 -218
  79. package/{src → dsh-mneme/src}/search/adaptive.js +22 -22
  80. package/{src → dsh-mneme/src}/search/bm25.js +96 -96
  81. package/{lib → dsh-mneme/src}/search/tag-boost.js +61 -61
  82. package/{lib → dsh-mneme/src}/service.js +1726 -1726
  83. package/{src → dsh-mneme/src}/settings.js +172 -172
  84. package/{src → dsh-mneme/src}/store.js +2238 -2238
  85. package/{src → dsh-mneme/src}/summarize.js +236 -236
  86. package/{src → dsh-mneme/src}/tools.js +290 -290
  87. package/{src → dsh-mneme/src}/vector-index.js +116 -116
  88. package/{test → dsh-mneme/test}/api.test.js +594 -594
  89. package/{test → dsh-mneme/test}/audit.test.js +448 -448
  90. package/{test → dsh-mneme/test}/benchmark.test.js +35 -35
  91. package/{test → dsh-mneme/test}/boundary-v0625.test.js +82 -82
  92. package/{test → dsh-mneme/test}/client.test.js +368 -368
  93. package/{test → dsh-mneme/test}/clustering.test.js +100 -100
  94. package/{test → dsh-mneme/test}/commands.test.js +69 -69
  95. package/{test → dsh-mneme/test}/config.test.js +50 -50
  96. package/{test → dsh-mneme/test}/conflict-freeze.test.js +290 -290
  97. package/{test → dsh-mneme/test}/directory.test.js +134 -134
  98. package/{test → dsh-mneme/test}/dream.test.js +1060 -901
  99. package/{test → dsh-mneme/test}/entities.test.js +522 -522
  100. package/{test → dsh-mneme/test}/epistemic.test.js +298 -298
  101. package/{test → dsh-mneme/test}/fnew-0112.test.js +311 -311
  102. package/{test → dsh-mneme/test}/fnew-03.test.js +422 -422
  103. package/{test → dsh-mneme/test}/graph-api.test.js +175 -175
  104. package/{test → dsh-mneme/test}/helpers/dream-mock.js +82 -82
  105. package/{test → dsh-mneme/test}/hot-memory.test.js +174 -174
  106. package/{test → dsh-mneme/test}/inject.test.js +103 -103
  107. package/{test → dsh-mneme/test}/llm-audit.test.js +279 -279
  108. package/{test → dsh-mneme/test}/local-embedder.test.js +227 -227
  109. package/{test → dsh-mneme/test}/mirror-dirty.test.js +424 -424
  110. package/{test → dsh-mneme/test}/mirror-edit-digest.test.js +187 -187
  111. package/{test → dsh-mneme/test}/mirror-generation.test.js +499 -499
  112. package/{test → dsh-mneme/test}/mirror.test.js +249 -249
  113. package/{test → dsh-mneme/test}/normalize-decisions.test.js +120 -120
  114. package/{test → dsh-mneme/test}/peer-blockers.test.js +190 -190
  115. package/{test → dsh-mneme/test}/policy-epoch.test.js +259 -259
  116. package/{test → dsh-mneme/test}/provenance.test.js +103 -103
  117. package/{test → dsh-mneme/test}/quality-filter.test.js +118 -118
  118. package/{test → dsh-mneme/test}/reasoning-effort.test.js +199 -199
  119. package/{test → dsh-mneme/test}/recall-evals.test.js +235 -235
  120. package/{test → dsh-mneme/test}/recall-layer.test.js +315 -315
  121. package/{test → dsh-mneme/test}/receipt-chain.test.js +451 -451
  122. package/{test → dsh-mneme/test}/reflection.test.js +226 -226
  123. package/{test → dsh-mneme/test}/reranker.test.js +240 -240
  124. package/{test → dsh-mneme/test}/search-fusion.test.js +90 -90
  125. package/{test → dsh-mneme/test}/semantic.test.js +124 -124
  126. package/{test → dsh-mneme/test}/service-search.test.js +199 -199
  127. package/{test → dsh-mneme/test}/service.test.js +435 -435
  128. package/{test → dsh-mneme/test}/settings.test.js +118 -118
  129. package/{test → dsh-mneme/test}/sleep.test.js +365 -365
  130. package/{test → dsh-mneme/test}/store.test.js +436 -436
  131. package/{test → dsh-mneme/test}/stress.test.js +209 -209
  132. package/{test → dsh-mneme/test}/summarize.test.js +191 -191
  133. package/{test → dsh-mneme/test}/tag-boost.test.js +125 -125
  134. package/{test → dsh-mneme/test}/tag.test.js +312 -312
  135. package/{test → dsh-mneme/test}/tools.test.js +285 -285
  136. package/{test → dsh-mneme/test}/vector-index.test.js +221 -221
  137. package/{test → dsh-mneme/test}/wiki-link.test.js +332 -332
  138. package/package.json +18 -40
  139. package//346/250/252/345/271/205.png +0 -0
@@ -1,133 +1,133 @@
1
- // Recall benchmark (v0.5.0 评测体系): a self-contained harness that seeds an
2
- // in-memory store with labelled memories, runs a standard query set through
3
- // the real searchMemories pipeline, and reports Recall@K / MRR per case and
4
- // in aggregate. Runs in two configurations so the BM25/third-path lift is
5
- // visible: `legacy` (bm25 + adaptive + dedup off) vs `fused` (defaults on).
6
- //
7
- // Usage:
8
- // node scripts/benchmark-recall.js # run both configurations
9
- // node scripts/benchmark-recall.js --json # machine-readable output
10
- // The harness exports runBenchmark()/TEST_CASES for the test suite; the CLI
11
- // path below only executes when invoked directly.
12
- import { createStore } from "../src/store.js";
13
- import { createService } from "../src/service.js";
14
- import { createVectorIndex } from "../src/vector-index.js";
15
-
16
- // Deterministic toy embedder: bag-of-words hashed into a fixed-dimension
17
- // vector, so cosine similarity ≈ lexical overlap. Good enough to exercise
18
- // the vector path mechanically — semantic quality is not under test here.
19
- const DIM = 256;
20
- function hashVec(text) {
21
- const v = new Array(DIM).fill(0);
22
- const tokens = String(text ?? "").toLowerCase().split(/[^\p{L}\p{N}]+/u).filter(Boolean);
23
- for (const t of tokens) {
24
- let h = 0;
25
- for (const ch of t) h = (h * 31 + ch.codePointAt(0)) >>> 0;
26
- v[h % DIM] += 1;
27
- }
28
- const norm = Math.sqrt(v.reduce((s, x) => s + x * x, 0)) || 1;
29
- return v.map((x) => x / norm);
30
- }
31
-
32
- const SEED = [
33
- { id: "mem_user_pref", type: "preference", title: "编辑器偏好", content: "用户偏好 VS Code,深色主题,等宽字体 JetBrains Mono", importance: 4, tags: ["editor"] },
34
- { id: "mem_user_project", type: "project", title: "dsh-mneme 插件项目", content: "用户在开发 dsh-mneme 记忆插件,TypeScript 与 cordis 框架", importance: 5, tags: ["plugin"] },
35
- { id: "mem_rust_switch", type: "decision", title: "语言迁移决策", content: "项目编译模块从 Go 迁移到 Rust,理由是内存安全", importance: 4, tags: ["rust"] },
36
- { id: "mem_zfs_bug", type: "project", title: "ZFS-4421 数据损坏", content: "线上池 ZFS-4421 出现 checksum 错误,根因是 HBA 固件 bug", importance: 5, tags: ["ops"] },
37
- { id: "mem_city_thesis", type: "project", title: "湿地论文", content: "毕业论文研究城市湿地公园周边开发案例,ArcGIS 空间分析", importance: 4, tags: ["thesis"] },
38
- { id: "mem_async_pattern", type: "decision", title: "异步并发模式", content: "async runtime 选用 tokio,任务用 spawn 管理,channel 通信", importance: 3, tags: ["rust"] },
39
- { id: "mem_python_etl", type: "project", title: "ETL 脚本", content: "夜间 ETL 用 Python 编写,pandas 清洗,SQLite 落地", importance: 3, tags: ["etl"] },
40
- { id: "mem_ui_style", type: "preference", title: "界面审美", content: "喜欢编辑风 brutalism 排版,低饱和度配色,衬线标题", importance: 3, tags: ["design"] }
41
- ];
42
-
43
- // Standard query set: each case is a query plus the ids that MUST appear in
44
- // the top-K for the case to count as a hit. Covers the three recall paths —
45
- // multi-term lexical (BM25's home turf), identifier lookup, and semantic.
46
- export const TEST_CASES = [
47
- { query: "rust 异步", expected: ["mem_async_pattern", "mem_rust_switch"], note: "scattered terms — BM25 territory" },
48
- { query: "ZFS-4421 checksum", expected: ["mem_zfs_bug"], note: "identifier + keyword" },
49
- { query: "插件 开发", expected: ["mem_user_project"], note: "multi-term CJK" },
50
- { query: "论文 空间分析", expected: ["mem_city_thesis"], note: "scattered CJK terms" },
51
- { query: "ETL 脚本", expected: ["mem_python_etl"], note: "mixed" },
52
- { query: "深色主题", expected: ["mem_user_pref"], note: "substring match" },
53
- { query: "channel 通信 任务", expected: ["mem_async_pattern"], note: "scattered terms" },
54
- { query: "内存安全 语言", expected: ["mem_rust_switch"], note: "scattered terms" },
55
- { query: "配色 审美", expected: ["mem_ui_style"], note: "scattered CJK" },
56
- { query: "HBA 固件", expected: ["mem_zfs_bug"], note: "scattered terms" }
57
- ];
58
-
59
- function seedService(overrides = {}) {
60
- const store = createStore(":memory:");
61
- const config = {
62
- bm25SearchEnabled: true,
63
- adaptiveThresholdEnabled: true,
64
- searchSemanticDedup: true,
65
- searchSemanticDedupThreshold: 0.95,
66
- selectiveInjectEnabled: true,
67
- entitySearchEnabled: false,
68
- ...overrides
69
- };
70
- const service = createService({ store, mirror: null, config, logger: null });
71
- const vectorIndex = createVectorIndex({ store, logger: null });
72
- service.setVectorIndex(vectorIndex);
73
- service.setEmbedder({
74
- embedSingle: async (text) => hashVec(text)
75
- });
76
- for (const m of SEED) {
77
- const row = store.save({ type: m.type, title: m.title, content: m.content, tags: m.tags, importance: m.importance, source: "seed" });
78
- store.setEmbedding(row.id, hashVec(`${m.title} ${m.content}`));
79
- }
80
- return service;
81
- }
82
-
83
- export async function runBenchmark({ topK = 5, mode = "auto" } = {}) {
84
- const configs = [
85
- { name: "legacy", overrides: { bm25SearchEnabled: false, adaptiveThresholdEnabled: false, searchSemanticDedup: false } },
86
- { name: "fused", overrides: {} }
87
- ];
88
- const runs = [];
89
- for (const cfg of configs) {
90
- const service = seedService(cfg.overrides);
91
- const rows = [];
92
- let hits = 0;
93
- let mrrSum = 0;
94
- for (const tc of TEST_CASES) {
95
- const results = await service.searchMemories(tc.query, { mode, topK, useRerank: false });
96
- const ids = results.map((r) => r.id);
97
- const metrics = service.computeRetrievalMetrics(ids, tc.expected);
98
- if (metrics.recall === 1) hits++;
99
- mrrSum += metrics.mrr;
100
- rows.push({ query: tc.query, note: tc.note, expected: tc.expected, got: ids, ...metrics });
101
- }
102
- runs.push({
103
- config: cfg.name,
104
- recallAtK: +(hits / TEST_CASES.length).toFixed(3),
105
- avgMrr: +(mrrSum / TEST_CASES.length).toFixed(3),
106
- rows
107
- });
108
- }
109
- return { topK, mode, runs };
110
- }
111
-
112
- function printReport(report) {
113
- for (const run of report.runs) {
114
- console.log(`\n=== ${run.config} (topK=${report.topK}, mode=${report.mode}) ===`);
115
- for (const r of run.rows) {
116
- const ok = r.recall === 1 ? "PASS" : "MISS";
117
- console.log(` [${ok}] "${r.query}" (${r.note}) recall=${r.recall} mrr=${r.mrr}`);
118
- if (r.recall < 1) console.log(` expected ⊇ ${r.expected.join(", ")} got: ${r.got.join(", ") || "—"}`);
119
- }
120
- console.log(` → Recall@${report.topK}: ${(run.recallAtK * 100).toFixed(1)}% avg MRR: ${run.avgMrr}`);
121
- }
122
- const [legacy, fused] = report.runs;
123
- const lift = ((fused.recallAtK - legacy.recallAtK) * 100).toFixed(1);
124
- console.log(`\n三路融合 vs 旧两路: Recall@${report.topK} ${legacy.recallAtK * 100}% → ${fused.recallAtK * 100}% (${lift >= 0 ? "+" : ""}${lift}pp)`);
125
- }
126
-
127
- const invokedDirectly = process.argv[1] && import.meta.url.endsWith(process.argv[1].replace(/\\/g, "/").split("/").pop() ?? "");
128
- if (invokedDirectly) {
129
- const asJson = process.argv.includes("--json");
130
- const report = await runBenchmark({});
131
- if (asJson) console.log(JSON.stringify(report, null, 2));
132
- else printReport(report);
133
- }
1
+ // Recall benchmark (v0.5.0 评测体系): a self-contained harness that seeds an
2
+ // in-memory store with labelled memories, runs a standard query set through
3
+ // the real searchMemories pipeline, and reports Recall@K / MRR per case and
4
+ // in aggregate. Runs in two configurations so the BM25/third-path lift is
5
+ // visible: `legacy` (bm25 + adaptive + dedup off) vs `fused` (defaults on).
6
+ //
7
+ // Usage:
8
+ // node scripts/benchmark-recall.js # run both configurations
9
+ // node scripts/benchmark-recall.js --json # machine-readable output
10
+ // The harness exports runBenchmark()/TEST_CASES for the test suite; the CLI
11
+ // path below only executes when invoked directly.
12
+ import { createStore } from "../src/store.js";
13
+ import { createService } from "../src/service.js";
14
+ import { createVectorIndex } from "../src/vector-index.js";
15
+
16
+ // Deterministic toy embedder: bag-of-words hashed into a fixed-dimension
17
+ // vector, so cosine similarity ≈ lexical overlap. Good enough to exercise
18
+ // the vector path mechanically — semantic quality is not under test here.
19
+ const DIM = 256;
20
+ function hashVec(text) {
21
+ const v = new Array(DIM).fill(0);
22
+ const tokens = String(text ?? "").toLowerCase().split(/[^\p{L}\p{N}]+/u).filter(Boolean);
23
+ for (const t of tokens) {
24
+ let h = 0;
25
+ for (const ch of t) h = (h * 31 + ch.codePointAt(0)) >>> 0;
26
+ v[h % DIM] += 1;
27
+ }
28
+ const norm = Math.sqrt(v.reduce((s, x) => s + x * x, 0)) || 1;
29
+ return v.map((x) => x / norm);
30
+ }
31
+
32
+ const SEED = [
33
+ { id: "mem_user_pref", type: "preference", title: "编辑器偏好", content: "用户偏好 VS Code,深色主题,等宽字体 JetBrains Mono", importance: 4, tags: ["editor"] },
34
+ { id: "mem_user_project", type: "project", title: "dsh-mneme 插件项目", content: "用户在开发 dsh-mneme 记忆插件,TypeScript 与 cordis 框架", importance: 5, tags: ["plugin"] },
35
+ { id: "mem_rust_switch", type: "decision", title: "语言迁移决策", content: "项目编译模块从 Go 迁移到 Rust,理由是内存安全", importance: 4, tags: ["rust"] },
36
+ { id: "mem_zfs_bug", type: "project", title: "ZFS-4421 数据损坏", content: "线上池 ZFS-4421 出现 checksum 错误,根因是 HBA 固件 bug", importance: 5, tags: ["ops"] },
37
+ { id: "mem_city_thesis", type: "project", title: "湿地论文", content: "毕业论文研究城市湿地公园周边开发案例,ArcGIS 空间分析", importance: 4, tags: ["thesis"] },
38
+ { id: "mem_async_pattern", type: "decision", title: "异步并发模式", content: "async runtime 选用 tokio,任务用 spawn 管理,channel 通信", importance: 3, tags: ["rust"] },
39
+ { id: "mem_python_etl", type: "project", title: "ETL 脚本", content: "夜间 ETL 用 Python 编写,pandas 清洗,SQLite 落地", importance: 3, tags: ["etl"] },
40
+ { id: "mem_ui_style", type: "preference", title: "界面审美", content: "喜欢编辑风 brutalism 排版,低饱和度配色,衬线标题", importance: 3, tags: ["design"] }
41
+ ];
42
+
43
+ // Standard query set: each case is a query plus the ids that MUST appear in
44
+ // the top-K for the case to count as a hit. Covers the three recall paths —
45
+ // multi-term lexical (BM25's home turf), identifier lookup, and semantic.
46
+ export const TEST_CASES = [
47
+ { query: "rust 异步", expected: ["mem_async_pattern", "mem_rust_switch"], note: "scattered terms — BM25 territory" },
48
+ { query: "ZFS-4421 checksum", expected: ["mem_zfs_bug"], note: "identifier + keyword" },
49
+ { query: "插件 开发", expected: ["mem_user_project"], note: "multi-term CJK" },
50
+ { query: "论文 空间分析", expected: ["mem_city_thesis"], note: "scattered CJK terms" },
51
+ { query: "ETL 脚本", expected: ["mem_python_etl"], note: "mixed" },
52
+ { query: "深色主题", expected: ["mem_user_pref"], note: "substring match" },
53
+ { query: "channel 通信 任务", expected: ["mem_async_pattern"], note: "scattered terms" },
54
+ { query: "内存安全 语言", expected: ["mem_rust_switch"], note: "scattered terms" },
55
+ { query: "配色 审美", expected: ["mem_ui_style"], note: "scattered CJK" },
56
+ { query: "HBA 固件", expected: ["mem_zfs_bug"], note: "scattered terms" }
57
+ ];
58
+
59
+ function seedService(overrides = {}) {
60
+ const store = createStore(":memory:");
61
+ const config = {
62
+ bm25SearchEnabled: true,
63
+ adaptiveThresholdEnabled: true,
64
+ searchSemanticDedup: true,
65
+ searchSemanticDedupThreshold: 0.95,
66
+ selectiveInjectEnabled: true,
67
+ entitySearchEnabled: false,
68
+ ...overrides
69
+ };
70
+ const service = createService({ store, mirror: null, config, logger: null });
71
+ const vectorIndex = createVectorIndex({ store, logger: null });
72
+ service.setVectorIndex(vectorIndex);
73
+ service.setEmbedder({
74
+ embedSingle: async (text) => hashVec(text)
75
+ });
76
+ for (const m of SEED) {
77
+ const row = store.save({ type: m.type, title: m.title, content: m.content, tags: m.tags, importance: m.importance, source: "seed" });
78
+ store.setEmbedding(row.id, hashVec(`${m.title} ${m.content}`));
79
+ }
80
+ return service;
81
+ }
82
+
83
+ export async function runBenchmark({ topK = 5, mode = "auto" } = {}) {
84
+ const configs = [
85
+ { name: "legacy", overrides: { bm25SearchEnabled: false, adaptiveThresholdEnabled: false, searchSemanticDedup: false } },
86
+ { name: "fused", overrides: {} }
87
+ ];
88
+ const runs = [];
89
+ for (const cfg of configs) {
90
+ const service = seedService(cfg.overrides);
91
+ const rows = [];
92
+ let hits = 0;
93
+ let mrrSum = 0;
94
+ for (const tc of TEST_CASES) {
95
+ const results = await service.searchMemories(tc.query, { mode, topK, useRerank: false });
96
+ const ids = results.map((r) => r.id);
97
+ const metrics = service.computeRetrievalMetrics(ids, tc.expected);
98
+ if (metrics.recall === 1) hits++;
99
+ mrrSum += metrics.mrr;
100
+ rows.push({ query: tc.query, note: tc.note, expected: tc.expected, got: ids, ...metrics });
101
+ }
102
+ runs.push({
103
+ config: cfg.name,
104
+ recallAtK: +(hits / TEST_CASES.length).toFixed(3),
105
+ avgMrr: +(mrrSum / TEST_CASES.length).toFixed(3),
106
+ rows
107
+ });
108
+ }
109
+ return { topK, mode, runs };
110
+ }
111
+
112
+ function printReport(report) {
113
+ for (const run of report.runs) {
114
+ console.log(`\n=== ${run.config} (topK=${report.topK}, mode=${report.mode}) ===`);
115
+ for (const r of run.rows) {
116
+ const ok = r.recall === 1 ? "PASS" : "MISS";
117
+ console.log(` [${ok}] "${r.query}" (${r.note}) recall=${r.recall} mrr=${r.mrr}`);
118
+ if (r.recall < 1) console.log(` expected ⊇ ${r.expected.join(", ")} got: ${r.got.join(", ") || "—"}`);
119
+ }
120
+ console.log(` → Recall@${report.topK}: ${(run.recallAtK * 100).toFixed(1)}% avg MRR: ${run.avgMrr}`);
121
+ }
122
+ const [legacy, fused] = report.runs;
123
+ const lift = ((fused.recallAtK - legacy.recallAtK) * 100).toFixed(1);
124
+ console.log(`\n三路融合 vs 旧两路: Recall@${report.topK} ${legacy.recallAtK * 100}% → ${fused.recallAtK * 100}% (${lift >= 0 ? "+" : ""}${lift}pp)`);
125
+ }
126
+
127
+ const invokedDirectly = process.argv[1] && import.meta.url.endsWith(process.argv[1].replace(/\\/g, "/").split("/").pop() ?? "");
128
+ if (invokedDirectly) {
129
+ const asJson = process.argv.includes("--json");
130
+ const report = await runBenchmark({});
131
+ if (asJson) console.log(JSON.stringify(report, null, 2));
132
+ else printReport(report);
133
+ }
@@ -1,166 +1,166 @@
1
- #!/usr/bin/env node
2
- // scripts/benchmark-rerank.js
3
- // Rerank 延迟基准:测量 LocalReranker(Xenova/bge-reranker-base,交叉编码)
4
- // 在不同候选集规模下的精排延迟。src/reranker.js 尚在开发(Phase 2),这里用
5
- // await import() 动态加载,失败时打印友好错误而非崩溃。
6
- //
7
- // 用法:
8
- // node scripts/benchmark-rerank.js # 默认候选 [10,50,100,500]
9
- // node scripts/benchmark-rerank.js --candidates 10,100,1000
10
- // node scripts/benchmark-rerank.js --candidates 10 --top-k 3 --model Xenova/bge-reranker-base
11
- // node scripts/benchmark-rerank.js --device cpu --batch-size 4
12
- // node scripts/benchmark-rerank.js --help
13
- //
14
- // 环境变量:RERANK_MODEL / RERANK_DEVICE / RERANK_BATCH_SIZE / RERANK_CACHE_DIR。
15
-
16
- function pad(s, n) {
17
- const str = String(s);
18
- return str.length >= n ? str : str + " ".repeat(n - str.length);
19
- }
20
-
21
- const QUERY = "如何为记忆插件配置本地语义搜索模型?";
22
-
23
- // 与 benchmark-embed.js 同源的样本文本库,模拟记忆库候选。
24
- const CANDIDATE_TEXTS = [
25
- "用户偏好使用中文交流,偶尔夹杂英文术语。",
26
- "项目使用 SQLite 作为主存储,Markdown 作为人工可读镜像。",
27
- "考研科目:公共管理学(631)与公共政策学(864)。",
28
- "autoDream 在后台自动去重、合并、归档记忆。",
29
- "本地模型支持 ONNX、Ollama 与 OpenAI 兼容三种后端。",
30
- "Rerank 精排可以提升语义检索的 Top-K 准确率。",
31
- "记忆库越大,向量检索的优势越明显。",
32
- "今天完成了语义引擎的架构设计文档。",
33
- "Web 记忆面板支持按类型浏览与全文搜索。",
34
- "用户每天 9-18 点在线上班,上午做深度工作。",
35
- ];
36
-
37
- function parseArgs(argv) {
38
- const args = {
39
- candidates: [10, 50, 100, 500], topK: 5, model: null, device: null,
40
- batchSize: null, cacheDir: null, query: QUERY, help: false
41
- };
42
- for (let i = 0; i < argv.length; i++) {
43
- const a = argv[i];
44
- const take = (n) => (argv[i + 1] !== undefined ? argv[i + 1] : null);
45
- if (a === "--help" || a === "-h") { args.help = true; break; }
46
- if (a === "--candidates") {
47
- args.candidates = String(take("candidates", i++)).split(",").map(Number).filter((n) => n > 0);
48
- if (!args.candidates.length) args.candidates = [10];
49
- } else if (a === "--top-k") args.topK = Number(take("top-k", i++)) || args.topK;
50
- else if (a === "--model") args.model = take("model", i++);
51
- else if (a === "--device") args.device = take("device", i++);
52
- else if (a === "--batch-size") args.batchSize = Number(take("batch-size", i++)) || null;
53
- else if (a === "--cache-dir") args.cacheDir = take("cache-dir", i++);
54
- else if (a === "--query") args.query = take("query", i++);
55
- else { console.error(`未知参数:${a}(用 --help 查看用法)`); process.exit(2); }
56
- }
57
- const env = process.env;
58
- args.model = args.model ?? env.RERANK_MODEL ?? null;
59
- args.device = args.device ?? env.RERANK_DEVICE ?? "cpu";
60
- args.batchSize = args.batchSize ?? (env.RERANK_BATCH_SIZE ? Number(env.RERANK_BATCH_SIZE) : 8);
61
- args.cacheDir = args.cacheDir ?? env.RERANK_CACHE_DIR ?? "";
62
- return args;
63
- }
64
-
65
- function usage() {
66
- console.log(`Rerank 延迟基准(dsh-mneme)
67
-
68
- 用法:
69
- node scripts/benchmark-rerank.js [选项]
70
-
71
- 选项:
72
- --candidates <n1,n2,...> 候选集规模列表,逗号分隔(默认 10,50,100,500)
73
- --top-k <n> 精排返回条数(默认 5)
74
- --model <name> Rerank 模型(默认 Xenova/bge-reranker-base)
75
- --device <cpu|wasm|gpu> ONNX 设备(默认 cpu)
76
- --batch-size <n> 批大小(默认 8)
77
- --cache-dir <dir> 模型缓存目录
78
- --query <text> 检索 query(默认内置示例)
79
- -h, --help 显示帮助并退出
80
-
81
- 环境变量:RERANK_MODEL / RERANK_DEVICE / RERANK_BATCH_SIZE / RERANK_CACHE_DIR
82
- (命令行参数优先)
83
- `);
84
- }
85
-
86
- function buildCandidates(n) {
87
- const out = [];
88
- for (let i = 0; i < n; i++) {
89
- const t = CANDIDATE_TEXTS[i % CANDIDATE_TEXTS.length];
90
- out.push(i < CANDIDATE_TEXTS.length ? t : `${t} —— 变体 #${i + 1}`);
91
- }
92
- return out;
93
- }
94
-
95
- async function main() {
96
- const args = parseArgs(process.argv.slice(2));
97
- if (args.help) { usage(); process.exit(0); }
98
-
99
- let mod;
100
- try {
101
- mod = await import("../src/reranker.js");
102
- } catch (err) {
103
- console.error("无法加载 src/reranker.js:");
104
- console.error(` ${err.message}`);
105
- console.error("该模块属 Phase 2,可能尚未创建。基准脚本依赖导出 LocalReranker。");
106
- process.exit(1);
107
- }
108
- const { LocalReranker } = mod;
109
- if (typeof LocalReranker !== "function") {
110
- console.error("src/reranker.js 未导出 LocalReranker,请先实现该模块。");
111
- process.exit(1);
112
- }
113
-
114
- let reranker;
115
- try {
116
- reranker = new LocalReranker({
117
- model: args.model ?? undefined,
118
- device: args.device,
119
- batchSize: args.batchSize,
120
- cacheDir: args.cacheDir || undefined,
121
- logger: null
122
- });
123
- await reranker.init();
124
- } catch (err) {
125
- console.error(`初始化 Reranker 失败:${err.message}`);
126
- console.error("请检查模型是否已下载、设备配置是否正确。");
127
- process.exit(1);
128
- }
129
-
130
- console.log("══════ dsh-mneme Rerank 延迟基准 ══════");
131
- console.log(`模型:${reranker.model ?? "(默认)"} 设备:${args.device} 候选规模:${args.candidates.join(", ")} Top-K:${args.topK}`);
132
- console.log(`query:${args.query}\n`);
133
-
134
- // 小规模预热(含首次加载推理)
135
- try {
136
- await reranker.rerank(args.query, buildCandidates(5), 3);
137
- } catch (err) {
138
- console.error(`预热失败:${err.message}`);
139
- process.exit(1);
140
- }
141
-
142
- console.log(`${pad("候选数", 10)}${pad("Top-K", 8)}${pad("耗时(ms)", 12)}${pad("ms/候选", 10)}`);
143
- for (const n of args.candidates) {
144
- const candidates = buildCandidates(n);
145
- const t0 = process.hrtime.bigint();
146
- try {
147
- const result = await reranker.rerank(args.query, candidates, args.topK);
148
- if (!Array.isArray(result)) {
149
- console.error(`候选 ${n} 时 rerank 返回非数组,请检查 LocalReranker.rerank 的返回约定。`);
150
- process.exit(1);
151
- }
152
- } catch (err) {
153
- console.error(`候选 ${n} 时 rerank 失败:${err.message}`);
154
- process.exit(1);
155
- }
156
- const ms = Number(process.hrtime.bigint() - t0) / 1e6;
157
- console.log(`${pad(n, 10)}${pad(args.topK, 8)}${pad(ms.toFixed(1), 12)}${pad((ms / n).toFixed(3), 10)}`);
158
- }
159
- console.log("══════ 结束 ══════");
160
- reranker.dispose?.();
161
- }
162
-
163
- main().catch((err) => {
164
- console.error(`未预期错误:${err?.stack ?? err}`);
165
- process.exit(1);
166
- });
1
+ #!/usr/bin/env node
2
+ // scripts/benchmark-rerank.js
3
+ // Rerank 延迟基准:测量 LocalReranker(Xenova/bge-reranker-base,交叉编码)
4
+ // 在不同候选集规模下的精排延迟。src/reranker.js 尚在开发(Phase 2),这里用
5
+ // await import() 动态加载,失败时打印友好错误而非崩溃。
6
+ //
7
+ // 用法:
8
+ // node scripts/benchmark-rerank.js # 默认候选 [10,50,100,500]
9
+ // node scripts/benchmark-rerank.js --candidates 10,100,1000
10
+ // node scripts/benchmark-rerank.js --candidates 10 --top-k 3 --model Xenova/bge-reranker-base
11
+ // node scripts/benchmark-rerank.js --device cpu --batch-size 4
12
+ // node scripts/benchmark-rerank.js --help
13
+ //
14
+ // 环境变量:RERANK_MODEL / RERANK_DEVICE / RERANK_BATCH_SIZE / RERANK_CACHE_DIR。
15
+
16
+ function pad(s, n) {
17
+ const str = String(s);
18
+ return str.length >= n ? str : str + " ".repeat(n - str.length);
19
+ }
20
+
21
+ const QUERY = "如何为记忆插件配置本地语义搜索模型?";
22
+
23
+ // 与 benchmark-embed.js 同源的样本文本库,模拟记忆库候选。
24
+ const CANDIDATE_TEXTS = [
25
+ "用户偏好使用中文交流,偶尔夹杂英文术语。",
26
+ "项目使用 SQLite 作为主存储,Markdown 作为人工可读镜像。",
27
+ "考研科目:公共管理学(631)与公共政策学(864)。",
28
+ "autoDream 在后台自动去重、合并、归档记忆。",
29
+ "本地模型支持 ONNX、Ollama 与 OpenAI 兼容三种后端。",
30
+ "Rerank 精排可以提升语义检索的 Top-K 准确率。",
31
+ "记忆库越大,向量检索的优势越明显。",
32
+ "今天完成了语义引擎的架构设计文档。",
33
+ "Web 记忆面板支持按类型浏览与全文搜索。",
34
+ "用户每天 9-18 点在线上班,上午做深度工作。",
35
+ ];
36
+
37
+ function parseArgs(argv) {
38
+ const args = {
39
+ candidates: [10, 50, 100, 500], topK: 5, model: null, device: null,
40
+ batchSize: null, cacheDir: null, query: QUERY, help: false
41
+ };
42
+ for (let i = 0; i < argv.length; i++) {
43
+ const a = argv[i];
44
+ const take = (n) => (argv[i + 1] !== undefined ? argv[i + 1] : null);
45
+ if (a === "--help" || a === "-h") { args.help = true; break; }
46
+ if (a === "--candidates") {
47
+ args.candidates = String(take("candidates", i++)).split(",").map(Number).filter((n) => n > 0);
48
+ if (!args.candidates.length) args.candidates = [10];
49
+ } else if (a === "--top-k") args.topK = Number(take("top-k", i++)) || args.topK;
50
+ else if (a === "--model") args.model = take("model", i++);
51
+ else if (a === "--device") args.device = take("device", i++);
52
+ else if (a === "--batch-size") args.batchSize = Number(take("batch-size", i++)) || null;
53
+ else if (a === "--cache-dir") args.cacheDir = take("cache-dir", i++);
54
+ else if (a === "--query") args.query = take("query", i++);
55
+ else { console.error(`未知参数:${a}(用 --help 查看用法)`); process.exit(2); }
56
+ }
57
+ const env = process.env;
58
+ args.model = args.model ?? env.RERANK_MODEL ?? null;
59
+ args.device = args.device ?? env.RERANK_DEVICE ?? "cpu";
60
+ args.batchSize = args.batchSize ?? (env.RERANK_BATCH_SIZE ? Number(env.RERANK_BATCH_SIZE) : 8);
61
+ args.cacheDir = args.cacheDir ?? env.RERANK_CACHE_DIR ?? "";
62
+ return args;
63
+ }
64
+
65
+ function usage() {
66
+ console.log(`Rerank 延迟基准(dsh-mneme)
67
+
68
+ 用法:
69
+ node scripts/benchmark-rerank.js [选项]
70
+
71
+ 选项:
72
+ --candidates <n1,n2,...> 候选集规模列表,逗号分隔(默认 10,50,100,500)
73
+ --top-k <n> 精排返回条数(默认 5)
74
+ --model <name> Rerank 模型(默认 Xenova/bge-reranker-base)
75
+ --device <cpu|wasm|gpu> ONNX 设备(默认 cpu)
76
+ --batch-size <n> 批大小(默认 8)
77
+ --cache-dir <dir> 模型缓存目录
78
+ --query <text> 检索 query(默认内置示例)
79
+ -h, --help 显示帮助并退出
80
+
81
+ 环境变量:RERANK_MODEL / RERANK_DEVICE / RERANK_BATCH_SIZE / RERANK_CACHE_DIR
82
+ (命令行参数优先)
83
+ `);
84
+ }
85
+
86
+ function buildCandidates(n) {
87
+ const out = [];
88
+ for (let i = 0; i < n; i++) {
89
+ const t = CANDIDATE_TEXTS[i % CANDIDATE_TEXTS.length];
90
+ out.push(i < CANDIDATE_TEXTS.length ? t : `${t} —— 变体 #${i + 1}`);
91
+ }
92
+ return out;
93
+ }
94
+
95
+ async function main() {
96
+ const args = parseArgs(process.argv.slice(2));
97
+ if (args.help) { usage(); process.exit(0); }
98
+
99
+ let mod;
100
+ try {
101
+ mod = await import("../src/reranker.js");
102
+ } catch (err) {
103
+ console.error("无法加载 src/reranker.js:");
104
+ console.error(` ${err.message}`);
105
+ console.error("该模块属 Phase 2,可能尚未创建。基准脚本依赖导出 LocalReranker。");
106
+ process.exit(1);
107
+ }
108
+ const { LocalReranker } = mod;
109
+ if (typeof LocalReranker !== "function") {
110
+ console.error("src/reranker.js 未导出 LocalReranker,请先实现该模块。");
111
+ process.exit(1);
112
+ }
113
+
114
+ let reranker;
115
+ try {
116
+ reranker = new LocalReranker({
117
+ model: args.model ?? undefined,
118
+ device: args.device,
119
+ batchSize: args.batchSize,
120
+ cacheDir: args.cacheDir || undefined,
121
+ logger: null
122
+ });
123
+ await reranker.init();
124
+ } catch (err) {
125
+ console.error(`初始化 Reranker 失败:${err.message}`);
126
+ console.error("请检查模型是否已下载、设备配置是否正确。");
127
+ process.exit(1);
128
+ }
129
+
130
+ console.log("══════ dsh-mneme Rerank 延迟基准 ══════");
131
+ console.log(`模型:${reranker.model ?? "(默认)"} 设备:${args.device} 候选规模:${args.candidates.join(", ")} Top-K:${args.topK}`);
132
+ console.log(`query:${args.query}\n`);
133
+
134
+ // 小规模预热(含首次加载推理)
135
+ try {
136
+ await reranker.rerank(args.query, buildCandidates(5), 3);
137
+ } catch (err) {
138
+ console.error(`预热失败:${err.message}`);
139
+ process.exit(1);
140
+ }
141
+
142
+ console.log(`${pad("候选数", 10)}${pad("Top-K", 8)}${pad("耗时(ms)", 12)}${pad("ms/候选", 10)}`);
143
+ for (const n of args.candidates) {
144
+ const candidates = buildCandidates(n);
145
+ const t0 = process.hrtime.bigint();
146
+ try {
147
+ const result = await reranker.rerank(args.query, candidates, args.topK);
148
+ if (!Array.isArray(result)) {
149
+ console.error(`候选 ${n} 时 rerank 返回非数组,请检查 LocalReranker.rerank 的返回约定。`);
150
+ process.exit(1);
151
+ }
152
+ } catch (err) {
153
+ console.error(`候选 ${n} 时 rerank 失败:${err.message}`);
154
+ process.exit(1);
155
+ }
156
+ const ms = Number(process.hrtime.bigint() - t0) / 1e6;
157
+ console.log(`${pad(n, 10)}${pad(args.topK, 8)}${pad(ms.toFixed(1), 12)}${pad((ms / n).toFixed(3), 10)}`);
158
+ }
159
+ console.log("══════ 结束 ══════");
160
+ reranker.dispose?.();
161
+ }
162
+
163
+ main().catch((err) => {
164
+ console.error(`未预期错误:${err?.stack ?? err}`);
165
+ process.exit(1);
166
+ });