@modusensus/dsh-mneme 0.6.7 → 0.6.8
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/LICENSE +21 -21
- package/README.md +463 -463
- package/cordis.patch.yml +15 -15
- package/lib/api.js +783 -783
- package/lib/client.js +1757 -1757
- package/lib/commands.js +64 -64
- package/lib/config.js +288 -288
- package/lib/dream/clustering.js +118 -118
- package/lib/dream/decisions.js +439 -439
- package/lib/dream/sleep.js +561 -554
- package/lib/dream/tag-extractor.js +156 -156
- package/lib/dream.js +935 -929
- package/lib/embedding.js +154 -154
- package/lib/entities/extractor.js +242 -242
- package/lib/hot-memory.js +53 -53
- package/lib/index.js +361 -361
- package/lib/inject.js +208 -208
- package/lib/local-embedder.js +282 -282
- package/lib/mirror.js +170 -170
- package/lib/parser/tag.js +59 -59
- package/lib/parser/wiki-link.js +38 -38
- package/lib/quality-filter.js +123 -123
- package/lib/reranker.js +218 -218
- package/lib/search/adaptive.js +22 -22
- package/lib/search/bm25.js +96 -96
- package/lib/search/tag-boost.js +61 -61
- package/lib/service.js +1726 -1726
- package/lib/settings.js +172 -172
- package/lib/store.js +2238 -2238
- package/lib/summarize.js +236 -236
- package/lib/tools.js +290 -290
- package/lib/vector-index.js +116 -116
- package/package.json +80 -80
- package/scripts/benchmark-embed.js +201 -201
- package/scripts/benchmark-recall.js +133 -133
- package/scripts/benchmark-rerank.js +166 -166
- package/scripts/e2e-dsh.js +218 -218
- package/scripts/stress-dsh.js +255 -255
- package/scripts/sync-lib.js +52 -52
- package/src/api.js +783 -783
- package/src/commands.js +64 -64
- package/src/config.js +288 -288
- package/src/dream/clustering.js +118 -118
- package/src/dream/decisions.js +439 -439
- package/src/dream/sleep.js +561 -554
- package/src/dream/tag-extractor.js +156 -156
- package/src/dream.js +935 -929
- package/src/embedding.js +154 -154
- package/src/entities/extractor.js +242 -242
- package/src/hot-memory.js +53 -53
- package/src/index.js +361 -361
- package/src/inject.js +208 -208
- package/src/local-embedder.js +282 -282
- package/src/mirror.js +170 -170
- package/src/parser/tag.js +59 -59
- package/src/parser/wiki-link.js +38 -38
- package/src/quality-filter.js +123 -123
- package/src/reranker.js +218 -218
- package/src/search/adaptive.js +22 -22
- package/src/search/bm25.js +96 -96
- package/src/search/tag-boost.js +61 -61
- package/src/service.js +1726 -1726
- package/src/settings.js +172 -172
- package/src/store.js +2238 -2238
- package/src/summarize.js +236 -236
- package/src/tools.js +290 -290
- package/src/vector-index.js +116 -116
- package/test/api.test.js +594 -594
- package/test/audit.test.js +448 -448
- package/test/benchmark.test.js +35 -35
- package/test/boundary-v0625.test.js +82 -82
- package/test/client.test.js +368 -368
- package/test/clustering.test.js +100 -100
- package/test/commands.test.js +69 -69
- package/test/config.test.js +50 -50
- package/test/conflict-freeze.test.js +290 -290
- package/test/directory.test.js +134 -134
- package/test/dream.test.js +903 -901
- package/test/entities.test.js +522 -522
- package/test/epistemic.test.js +298 -298
- package/test/fnew-0112.test.js +311 -311
- package/test/fnew-03.test.js +422 -422
- package/test/graph-api.test.js +175 -175
- package/test/helpers/dream-mock.js +82 -82
- package/test/hot-memory.test.js +174 -174
- package/test/inject.test.js +103 -103
- package/test/llm-audit.test.js +279 -279
- package/test/local-embedder.test.js +227 -227
- package/test/mirror-dirty.test.js +424 -424
- package/test/mirror-edit-digest.test.js +187 -187
- package/test/mirror-generation.test.js +499 -499
- package/test/mirror.test.js +249 -249
- package/test/normalize-decisions.test.js +120 -120
- package/test/peer-blockers.test.js +190 -190
- package/test/policy-epoch.test.js +259 -259
- package/test/provenance.test.js +103 -103
- package/test/quality-filter.test.js +118 -118
- package/test/reasoning-effort.test.js +199 -199
- package/test/recall-evals.test.js +235 -235
- package/test/recall-layer.test.js +315 -315
- package/test/receipt-chain.test.js +451 -451
- package/test/reflection.test.js +226 -226
- package/test/reranker.test.js +240 -240
- package/test/search-fusion.test.js +90 -90
- package/test/semantic.test.js +124 -124
- package/test/service-search.test.js +199 -199
- package/test/service.test.js +435 -435
- package/test/settings.test.js +118 -118
- package/test/sleep.test.js +365 -365
- package/test/store.test.js +436 -436
- package/test/stress.test.js +209 -209
- package/test/summarize.test.js +191 -191
- package/test/tag-boost.test.js +125 -125
- package/test/tag.test.js +312 -312
- package/test/tools.test.js +285 -285
- package/test/vector-index.test.js +221 -221
- package/test/wiki-link.test.js +332 -332
|
@@ -1,90 +1,90 @@
|
|
|
1
|
-
import test from "node:test";
|
|
2
|
-
import assert from "node:assert/strict";
|
|
3
|
-
import { tokenize, createBM25Index } from "../src/search/bm25.js";
|
|
4
|
-
import { adaptiveThreshold } from "../src/search/adaptive.js";
|
|
5
|
-
|
|
6
|
-
// --- tokenizer ---
|
|
7
|
-
|
|
8
|
-
test("tokenize keeps ASCII identifiers whole", () => {
|
|
9
|
-
assert.deepEqual(
|
|
10
|
-
tokenize("ZFS-4421 dsh_mneme v2"),
|
|
11
|
-
["zfs", "4421", "dsh_mneme", "v2"]
|
|
12
|
-
);
|
|
13
|
-
});
|
|
14
|
-
|
|
15
|
-
test("tokenize splits CJK runs into bigrams", () => {
|
|
16
|
-
assert.deepEqual(tokenize("异步编程"), ["异步", "步编", "编程"]);
|
|
17
|
-
assert.deepEqual(tokenize("图"), ["图"]);
|
|
18
|
-
});
|
|
19
|
-
|
|
20
|
-
// --- BM25 index ---
|
|
21
|
-
|
|
22
|
-
const DOCS = [
|
|
23
|
-
{ id: "a", title: "异步并发模式", content: "async runtime 选用 tokio,任务 spawn 管理" },
|
|
24
|
-
{ id: "b", title: "语言迁移", content: "编译模块从 Go 迁移到 Rust,内存安全" },
|
|
25
|
-
{ id: "c", title: "无关条目", content: "夜间 ETL 用 Python 编写" }
|
|
26
|
-
];
|
|
27
|
-
|
|
28
|
-
test("BM25 recalls rows whose query terms are scattered", () => {
|
|
29
|
-
// The LIKE path cannot match "rust 异步" as a substring of either doc;
|
|
30
|
-
// BM25 must surface both term-bearing rows above the unrelated one.
|
|
31
|
-
const idx = createBM25Index(DOCS);
|
|
32
|
-
const hits = idx.search("rust 异步", { limit: 3 });
|
|
33
|
-
const ids = hits.map((h) => h.id);
|
|
34
|
-
assert.ok(ids.includes("a"), "the async doc must be recalled");
|
|
35
|
-
assert.ok(ids.includes("b"), "the rust doc must be recalled");
|
|
36
|
-
assert.ok(!ids.includes("c"), "the unrelated doc must not lead");
|
|
37
|
-
assert.ok(ids.indexOf("c") === -1 || hits.find((h) => h.id === "c").score < hits[0].score);
|
|
38
|
-
});
|
|
39
|
-
|
|
40
|
-
test("BM25 search scores are normalized to [0,1] with the max on top", () => {
|
|
41
|
-
const idx = createBM25Index(DOCS);
|
|
42
|
-
const hits = idx.search("tokio spawn", { limit: 3 });
|
|
43
|
-
assert.ok(hits.length >= 1);
|
|
44
|
-
assert.equal(hits[0].id, "a");
|
|
45
|
-
for (const h of hits) {
|
|
46
|
-
assert.ok(h.score >= 0 && h.score <= 1, `score ${h.score} out of [0,1]`);
|
|
47
|
-
}
|
|
48
|
-
assert.equal(hits[0].score, 1);
|
|
49
|
-
});
|
|
50
|
-
|
|
51
|
-
test("BM25 score(query, doc) matches search on single-doc corpora", () => {
|
|
52
|
-
const idx = createBM25Index(DOCS);
|
|
53
|
-
const doc = DOCS[0];
|
|
54
|
-
assert.ok(idx.score("tokio", doc) > 0);
|
|
55
|
-
assert.equal(idx.score("完全不相关词汇xyzzy", doc), 0);
|
|
56
|
-
});
|
|
57
|
-
|
|
58
|
-
test("BM25 drops untouched rows entirely", () => {
|
|
59
|
-
const idx = createBM25Index(DOCS);
|
|
60
|
-
const hits = idx.search("ETL Python", { limit: 3 });
|
|
61
|
-
assert.deepEqual(hits.map((h) => h.id), ["c"]);
|
|
62
|
-
});
|
|
63
|
-
|
|
64
|
-
// --- adaptive threshold ---
|
|
65
|
-
|
|
66
|
-
test("adaptive threshold: entity/attr prefixes loosen to 0.5", () => {
|
|
67
|
-
assert.equal(adaptiveThreshold("entity:某个实体"), 0.5);
|
|
68
|
-
assert.equal(adaptiveThreshold("attr:lang=Rust"), 0.5);
|
|
69
|
-
});
|
|
70
|
-
|
|
71
|
-
test("adaptive threshold: short queries tighten, long queries loosen", () => {
|
|
72
|
-
assert.equal(adaptiveThreshold("go"), 0.7);
|
|
73
|
-
const long = "这是一个非常长的查询".repeat(8);
|
|
74
|
-
assert.equal(adaptiveThreshold(long), 0.6);
|
|
75
|
-
});
|
|
76
|
-
|
|
77
|
-
test("adaptive threshold: decisive head gap loosens to 0.5", () => {
|
|
78
|
-
const candidates = [
|
|
79
|
-
{ _score: 0.9 }, { _score: 0.55 }, { _score: 0.54 }, { _score: 0.53 }, { _score: 0.52 }
|
|
80
|
-
];
|
|
81
|
-
assert.equal(adaptiveThreshold("普通长度的查询词组", candidates), 0.5);
|
|
82
|
-
});
|
|
83
|
-
|
|
84
|
-
test("adaptive threshold: flat distribution keeps the 0.65 default", () => {
|
|
85
|
-
const candidates = [
|
|
86
|
-
{ _score: 0.7 }, { _score: 0.68 }, { _score: 0.66 }, { _score: 0.64 }, { _score: 0.62 }
|
|
87
|
-
];
|
|
88
|
-
assert.equal(adaptiveThreshold("普通长度的查询词组", candidates), 0.65);
|
|
89
|
-
assert.equal(adaptiveThreshold("普通长度的查询词组"), 0.65);
|
|
90
|
-
});
|
|
1
|
+
import test from "node:test";
|
|
2
|
+
import assert from "node:assert/strict";
|
|
3
|
+
import { tokenize, createBM25Index } from "../src/search/bm25.js";
|
|
4
|
+
import { adaptiveThreshold } from "../src/search/adaptive.js";
|
|
5
|
+
|
|
6
|
+
// --- tokenizer ---
|
|
7
|
+
|
|
8
|
+
test("tokenize keeps ASCII identifiers whole", () => {
|
|
9
|
+
assert.deepEqual(
|
|
10
|
+
tokenize("ZFS-4421 dsh_mneme v2"),
|
|
11
|
+
["zfs", "4421", "dsh_mneme", "v2"]
|
|
12
|
+
);
|
|
13
|
+
});
|
|
14
|
+
|
|
15
|
+
test("tokenize splits CJK runs into bigrams", () => {
|
|
16
|
+
assert.deepEqual(tokenize("异步编程"), ["异步", "步编", "编程"]);
|
|
17
|
+
assert.deepEqual(tokenize("图"), ["图"]);
|
|
18
|
+
});
|
|
19
|
+
|
|
20
|
+
// --- BM25 index ---
|
|
21
|
+
|
|
22
|
+
const DOCS = [
|
|
23
|
+
{ id: "a", title: "异步并发模式", content: "async runtime 选用 tokio,任务 spawn 管理" },
|
|
24
|
+
{ id: "b", title: "语言迁移", content: "编译模块从 Go 迁移到 Rust,内存安全" },
|
|
25
|
+
{ id: "c", title: "无关条目", content: "夜间 ETL 用 Python 编写" }
|
|
26
|
+
];
|
|
27
|
+
|
|
28
|
+
test("BM25 recalls rows whose query terms are scattered", () => {
|
|
29
|
+
// The LIKE path cannot match "rust 异步" as a substring of either doc;
|
|
30
|
+
// BM25 must surface both term-bearing rows above the unrelated one.
|
|
31
|
+
const idx = createBM25Index(DOCS);
|
|
32
|
+
const hits = idx.search("rust 异步", { limit: 3 });
|
|
33
|
+
const ids = hits.map((h) => h.id);
|
|
34
|
+
assert.ok(ids.includes("a"), "the async doc must be recalled");
|
|
35
|
+
assert.ok(ids.includes("b"), "the rust doc must be recalled");
|
|
36
|
+
assert.ok(!ids.includes("c"), "the unrelated doc must not lead");
|
|
37
|
+
assert.ok(ids.indexOf("c") === -1 || hits.find((h) => h.id === "c").score < hits[0].score);
|
|
38
|
+
});
|
|
39
|
+
|
|
40
|
+
test("BM25 search scores are normalized to [0,1] with the max on top", () => {
|
|
41
|
+
const idx = createBM25Index(DOCS);
|
|
42
|
+
const hits = idx.search("tokio spawn", { limit: 3 });
|
|
43
|
+
assert.ok(hits.length >= 1);
|
|
44
|
+
assert.equal(hits[0].id, "a");
|
|
45
|
+
for (const h of hits) {
|
|
46
|
+
assert.ok(h.score >= 0 && h.score <= 1, `score ${h.score} out of [0,1]`);
|
|
47
|
+
}
|
|
48
|
+
assert.equal(hits[0].score, 1);
|
|
49
|
+
});
|
|
50
|
+
|
|
51
|
+
test("BM25 score(query, doc) matches search on single-doc corpora", () => {
|
|
52
|
+
const idx = createBM25Index(DOCS);
|
|
53
|
+
const doc = DOCS[0];
|
|
54
|
+
assert.ok(idx.score("tokio", doc) > 0);
|
|
55
|
+
assert.equal(idx.score("完全不相关词汇xyzzy", doc), 0);
|
|
56
|
+
});
|
|
57
|
+
|
|
58
|
+
test("BM25 drops untouched rows entirely", () => {
|
|
59
|
+
const idx = createBM25Index(DOCS);
|
|
60
|
+
const hits = idx.search("ETL Python", { limit: 3 });
|
|
61
|
+
assert.deepEqual(hits.map((h) => h.id), ["c"]);
|
|
62
|
+
});
|
|
63
|
+
|
|
64
|
+
// --- adaptive threshold ---
|
|
65
|
+
|
|
66
|
+
test("adaptive threshold: entity/attr prefixes loosen to 0.5", () => {
|
|
67
|
+
assert.equal(adaptiveThreshold("entity:某个实体"), 0.5);
|
|
68
|
+
assert.equal(adaptiveThreshold("attr:lang=Rust"), 0.5);
|
|
69
|
+
});
|
|
70
|
+
|
|
71
|
+
test("adaptive threshold: short queries tighten, long queries loosen", () => {
|
|
72
|
+
assert.equal(adaptiveThreshold("go"), 0.7);
|
|
73
|
+
const long = "这是一个非常长的查询".repeat(8);
|
|
74
|
+
assert.equal(adaptiveThreshold(long), 0.6);
|
|
75
|
+
});
|
|
76
|
+
|
|
77
|
+
test("adaptive threshold: decisive head gap loosens to 0.5", () => {
|
|
78
|
+
const candidates = [
|
|
79
|
+
{ _score: 0.9 }, { _score: 0.55 }, { _score: 0.54 }, { _score: 0.53 }, { _score: 0.52 }
|
|
80
|
+
];
|
|
81
|
+
assert.equal(adaptiveThreshold("普通长度的查询词组", candidates), 0.5);
|
|
82
|
+
});
|
|
83
|
+
|
|
84
|
+
test("adaptive threshold: flat distribution keeps the 0.65 default", () => {
|
|
85
|
+
const candidates = [
|
|
86
|
+
{ _score: 0.7 }, { _score: 0.68 }, { _score: 0.66 }, { _score: 0.64 }, { _score: 0.62 }
|
|
87
|
+
];
|
|
88
|
+
assert.equal(adaptiveThreshold("普通长度的查询词组", candidates), 0.65);
|
|
89
|
+
assert.equal(adaptiveThreshold("普通长度的查询词组"), 0.65);
|
|
90
|
+
});
|
package/test/semantic.test.js
CHANGED
|
@@ -1,124 +1,124 @@
|
|
|
1
|
-
import test from "node:test";
|
|
2
|
-
import assert from "node:assert/strict";
|
|
3
|
-
import { createStore } from "../src/store.js";
|
|
4
|
-
import { createService } from "../src/service.js";
|
|
5
|
-
import { createVectorIndex } from "../src/vector-index.js";
|
|
6
|
-
|
|
7
|
-
const DIM = 4;
|
|
8
|
-
|
|
9
|
-
// Mock embedder: maps a query to a fixed vector so tests exercise the wiring
|
|
10
|
-
// without downloading any model. Prefer embedSingle (local embedders); a
|
|
11
|
-
// legacy embed() fallback is also exercised in one test.
|
|
12
|
-
function mockEmbedder(overrides = {}) {
|
|
13
|
-
return {
|
|
14
|
-
embedSingle: async (text) => [1, 0, 0, 0],
|
|
15
|
-
embed: async (texts) => texts.map(() => [1, 0, 0, 0]),
|
|
16
|
-
schedule: () => {}, // legacy path: scheduleEmbed uses schedule when present, so saveWithDedupe never calls embedSingle here
|
|
17
|
-
modelHash: "mock#abc",
|
|
18
|
-
dimension: DIM,
|
|
19
|
-
...overrides
|
|
20
|
-
};
|
|
21
|
-
}
|
|
22
|
-
|
|
23
|
-
function setup(embedder = mockEmbedder()) {
|
|
24
|
-
const store = createStore(":memory:");
|
|
25
|
-
const service = createService({ store, mirror: null, config: {} });
|
|
26
|
-
const vectorIndex = createVectorIndex({ store });
|
|
27
|
-
service.setEmbedder(embedder);
|
|
28
|
-
service.setVectorIndex(vectorIndex);
|
|
29
|
-
return { store, service, vectorIndex };
|
|
30
|
-
}
|
|
31
|
-
|
|
32
|
-
test("vector-index stores and searches embeddings with model metadata", async () => {
|
|
33
|
-
const { store, service, vectorIndex } = setup();
|
|
34
|
-
const m1 = service.saveWithDedupe({ type: "preference", title: "猫", content: "喜欢猫" });
|
|
35
|
-
vectorIndex.saveEmbedding(m1.memory.id, [1, 0, 0, 0]);
|
|
36
|
-
const m2 = service.saveWithDedupe({ type: "preference", title: "狗", content: "喜欢狗" });
|
|
37
|
-
vectorIndex.saveEmbedding(m2.memory.id, [0, 1, 0, 0]);
|
|
38
|
-
|
|
39
|
-
const hits = vectorIndex.search([1, 0, 0, 0], { threshold: 0.5 });
|
|
40
|
-
assert.ok(hits.length >= 1);
|
|
41
|
-
assert.equal(hits[0].id, m1.memory.id, "best vector match ranks first");
|
|
42
|
-
|
|
43
|
-
vectorIndex.markModel("mock#abc", DIM);
|
|
44
|
-
const stats = vectorIndex.getStats();
|
|
45
|
-
assert.equal(stats.modelHash, "mock#abc");
|
|
46
|
-
assert.equal(stats.dimension, DIM);
|
|
47
|
-
assert.equal(stats.embeddedCount, 2);
|
|
48
|
-
|
|
49
|
-
vectorIndex.deleteEmbedding(m2.memory.id);
|
|
50
|
-
assert.equal(vectorIndex.getEmbedding(m2.memory.id), undefined);
|
|
51
|
-
});
|
|
52
|
-
|
|
53
|
-
test("searchMemories auto = keyword first + vector fill", async () => {
|
|
54
|
-
const { service } = setup();
|
|
55
|
-
const m1 = service.saveWithDedupe({ type: "preference", title: "猫", content: "喜欢猫" });
|
|
56
|
-
const m2 = service.saveWithDedupe({ type: "preference", title: "狗狗", content: "喜欢狗和猫" });
|
|
57
|
-
|
|
58
|
-
const rows = await service.searchMemories("猫", { mode: "auto", topK: 10 });
|
|
59
|
-
assert.ok(rows.some((m) => m.id === m1.memory.id), "keyword hit present");
|
|
60
|
-
assert.ok(rows.some((m) => m.id === m2.memory.id), "vector fill present");
|
|
61
|
-
});
|
|
62
|
-
|
|
63
|
-
test("searchMemories hybrid = vector leads, keyword fills", async () => {
|
|
64
|
-
const { service, vectorIndex } = setup();
|
|
65
|
-
// "狗" is semantically stored under the vector; literal query misses it.
|
|
66
|
-
const mDog = service.saveWithDedupe({ type: "preference", title: "金毛", content: "金毛是狗" });
|
|
67
|
-
vectorIndex.saveEmbedding(mDog.memory.id, [1, 0, 0, 0]);
|
|
68
|
-
const mCat = service.saveWithDedupe({ type: "preference", title: "猫", content: "喜欢猫" });
|
|
69
|
-
vectorIndex.saveEmbedding(mCat.memory.id, [0, 0, 1, 0]);
|
|
70
|
-
|
|
71
|
-
const rows = await service.searchMemories("狗", { mode: "hybrid", topK: 10 });
|
|
72
|
-
// mock vector always returns the fixed [1,0,0,0] vector, which matches the
|
|
73
|
-
// dog embedding above → dog should surface even though keyword matches "金毛".
|
|
74
|
-
assert.ok(rows.some((m) => m.id === mDog.memory.id), "vector lead surfaces dog");
|
|
75
|
-
});
|
|
76
|
-
|
|
77
|
-
test("searchMemories keyword mode never touches the embedder", async () => {
|
|
78
|
-
let called = 0;
|
|
79
|
-
const { service } = setup(mockEmbedder({
|
|
80
|
-
embedSingle: async () => { called++; return [1, 0, 0, 0]; }
|
|
81
|
-
}));
|
|
82
|
-
service.saveWithDedupe({ type: "preference", title: "语言", content: "中文交流" });
|
|
83
|
-
const rows = await service.searchMemories("中文", { mode: "keyword", topK: 10 });
|
|
84
|
-
assert.equal(rows.length, 1);
|
|
85
|
-
assert.equal(called, 0, "embedder must not be called in keyword mode");
|
|
86
|
-
});
|
|
87
|
-
|
|
88
|
-
test("searchMemories reranks merged candidates when a reranker is installed", async () => {
|
|
89
|
-
const { service } = setup();
|
|
90
|
-
const a = service.saveWithDedupe({ type: "preference", title: "猫", content: "喜欢猫" });
|
|
91
|
-
const b = service.saveWithDedupe({ type: "preference", title: "猫猫", content: "猫粮" });
|
|
92
|
-
// b is newer, so keyword order is [b, a]. The reranker reverses scores so
|
|
93
|
-
// the last candidate (a) wins — asserting the rerank actually reordered.
|
|
94
|
-
const reranker = {
|
|
95
|
-
rerank: async (query, candidates) =>
|
|
96
|
-
candidates.map((c, i) => ({ id: c.id, score: i })).sort((x, y) => y.score - x.score)
|
|
97
|
-
};
|
|
98
|
-
service.setReranker(reranker);
|
|
99
|
-
|
|
100
|
-
const rows = await service.searchMemories("猫", { mode: "keyword", topK: 10 });
|
|
101
|
-
assert.equal(rows[0].title, "猫", "rerank reorders to the higher score");
|
|
102
|
-
assert.equal(typeof rows[0].score, "number", "reranked rows carry a score");
|
|
103
|
-
});
|
|
104
|
-
|
|
105
|
-
test("searchMemories survives a throwing embedder (degrades to keyword)", async () => {
|
|
106
|
-
const { service } = setup(mockEmbedder({
|
|
107
|
-
embedSingle: async () => { throw new Error("model unavailable"); }
|
|
108
|
-
}));
|
|
109
|
-
service.saveWithDedupe({ type: "preference", title: "语言", content: "中文交流" });
|
|
110
|
-
const rows = await service.searchMemories("中文", { mode: "auto", topK: 10 });
|
|
111
|
-
assert.equal(rows.length, 1, "keyword fallback still works");
|
|
112
|
-
});
|
|
113
|
-
|
|
114
|
-
test("legacy embedder (embed-only) is adapted by searchMemories", async () => {
|
|
115
|
-
const store = createStore(":memory:");
|
|
116
|
-
const service = createService({ store, mirror: null, config: {} });
|
|
117
|
-
const legacy = { embed: async (q) => [1, 0, 0, 0] };
|
|
118
|
-
service.setEmbedder(legacy); // no embedSingle, no vectorIndex
|
|
119
|
-
service.saveWithDedupe({ type: "preference", title: "猫", content: "喜欢猫" });
|
|
120
|
-
store.setEmbedding(service.all()[0].id, [1, 0, 0, 0]);
|
|
121
|
-
|
|
122
|
-
const rows = await service.searchMemories("猫", { mode: "vector", topK: 10 });
|
|
123
|
-
assert.ok(rows.some((m) => m.title === "猫"), "legacy embed() path works");
|
|
124
|
-
});
|
|
1
|
+
import test from "node:test";
|
|
2
|
+
import assert from "node:assert/strict";
|
|
3
|
+
import { createStore } from "../src/store.js";
|
|
4
|
+
import { createService } from "../src/service.js";
|
|
5
|
+
import { createVectorIndex } from "../src/vector-index.js";
|
|
6
|
+
|
|
7
|
+
const DIM = 4;
|
|
8
|
+
|
|
9
|
+
// Mock embedder: maps a query to a fixed vector so tests exercise the wiring
|
|
10
|
+
// without downloading any model. Prefer embedSingle (local embedders); a
|
|
11
|
+
// legacy embed() fallback is also exercised in one test.
|
|
12
|
+
function mockEmbedder(overrides = {}) {
|
|
13
|
+
return {
|
|
14
|
+
embedSingle: async (text) => [1, 0, 0, 0],
|
|
15
|
+
embed: async (texts) => texts.map(() => [1, 0, 0, 0]),
|
|
16
|
+
schedule: () => {}, // legacy path: scheduleEmbed uses schedule when present, so saveWithDedupe never calls embedSingle here
|
|
17
|
+
modelHash: "mock#abc",
|
|
18
|
+
dimension: DIM,
|
|
19
|
+
...overrides
|
|
20
|
+
};
|
|
21
|
+
}
|
|
22
|
+
|
|
23
|
+
function setup(embedder = mockEmbedder()) {
|
|
24
|
+
const store = createStore(":memory:");
|
|
25
|
+
const service = createService({ store, mirror: null, config: {} });
|
|
26
|
+
const vectorIndex = createVectorIndex({ store });
|
|
27
|
+
service.setEmbedder(embedder);
|
|
28
|
+
service.setVectorIndex(vectorIndex);
|
|
29
|
+
return { store, service, vectorIndex };
|
|
30
|
+
}
|
|
31
|
+
|
|
32
|
+
test("vector-index stores and searches embeddings with model metadata", async () => {
|
|
33
|
+
const { store, service, vectorIndex } = setup();
|
|
34
|
+
const m1 = service.saveWithDedupe({ type: "preference", title: "猫", content: "喜欢猫" });
|
|
35
|
+
vectorIndex.saveEmbedding(m1.memory.id, [1, 0, 0, 0]);
|
|
36
|
+
const m2 = service.saveWithDedupe({ type: "preference", title: "狗", content: "喜欢狗" });
|
|
37
|
+
vectorIndex.saveEmbedding(m2.memory.id, [0, 1, 0, 0]);
|
|
38
|
+
|
|
39
|
+
const hits = vectorIndex.search([1, 0, 0, 0], { threshold: 0.5 });
|
|
40
|
+
assert.ok(hits.length >= 1);
|
|
41
|
+
assert.equal(hits[0].id, m1.memory.id, "best vector match ranks first");
|
|
42
|
+
|
|
43
|
+
vectorIndex.markModel("mock#abc", DIM);
|
|
44
|
+
const stats = vectorIndex.getStats();
|
|
45
|
+
assert.equal(stats.modelHash, "mock#abc");
|
|
46
|
+
assert.equal(stats.dimension, DIM);
|
|
47
|
+
assert.equal(stats.embeddedCount, 2);
|
|
48
|
+
|
|
49
|
+
vectorIndex.deleteEmbedding(m2.memory.id);
|
|
50
|
+
assert.equal(vectorIndex.getEmbedding(m2.memory.id), undefined);
|
|
51
|
+
});
|
|
52
|
+
|
|
53
|
+
test("searchMemories auto = keyword first + vector fill", async () => {
|
|
54
|
+
const { service } = setup();
|
|
55
|
+
const m1 = service.saveWithDedupe({ type: "preference", title: "猫", content: "喜欢猫" });
|
|
56
|
+
const m2 = service.saveWithDedupe({ type: "preference", title: "狗狗", content: "喜欢狗和猫" });
|
|
57
|
+
|
|
58
|
+
const rows = await service.searchMemories("猫", { mode: "auto", topK: 10 });
|
|
59
|
+
assert.ok(rows.some((m) => m.id === m1.memory.id), "keyword hit present");
|
|
60
|
+
assert.ok(rows.some((m) => m.id === m2.memory.id), "vector fill present");
|
|
61
|
+
});
|
|
62
|
+
|
|
63
|
+
test("searchMemories hybrid = vector leads, keyword fills", async () => {
|
|
64
|
+
const { service, vectorIndex } = setup();
|
|
65
|
+
// "狗" is semantically stored under the vector; literal query misses it.
|
|
66
|
+
const mDog = service.saveWithDedupe({ type: "preference", title: "金毛", content: "金毛是狗" });
|
|
67
|
+
vectorIndex.saveEmbedding(mDog.memory.id, [1, 0, 0, 0]);
|
|
68
|
+
const mCat = service.saveWithDedupe({ type: "preference", title: "猫", content: "喜欢猫" });
|
|
69
|
+
vectorIndex.saveEmbedding(mCat.memory.id, [0, 0, 1, 0]);
|
|
70
|
+
|
|
71
|
+
const rows = await service.searchMemories("狗", { mode: "hybrid", topK: 10 });
|
|
72
|
+
// mock vector always returns the fixed [1,0,0,0] vector, which matches the
|
|
73
|
+
// dog embedding above → dog should surface even though keyword matches "金毛".
|
|
74
|
+
assert.ok(rows.some((m) => m.id === mDog.memory.id), "vector lead surfaces dog");
|
|
75
|
+
});
|
|
76
|
+
|
|
77
|
+
test("searchMemories keyword mode never touches the embedder", async () => {
|
|
78
|
+
let called = 0;
|
|
79
|
+
const { service } = setup(mockEmbedder({
|
|
80
|
+
embedSingle: async () => { called++; return [1, 0, 0, 0]; }
|
|
81
|
+
}));
|
|
82
|
+
service.saveWithDedupe({ type: "preference", title: "语言", content: "中文交流" });
|
|
83
|
+
const rows = await service.searchMemories("中文", { mode: "keyword", topK: 10 });
|
|
84
|
+
assert.equal(rows.length, 1);
|
|
85
|
+
assert.equal(called, 0, "embedder must not be called in keyword mode");
|
|
86
|
+
});
|
|
87
|
+
|
|
88
|
+
test("searchMemories reranks merged candidates when a reranker is installed", async () => {
|
|
89
|
+
const { service } = setup();
|
|
90
|
+
const a = service.saveWithDedupe({ type: "preference", title: "猫", content: "喜欢猫" });
|
|
91
|
+
const b = service.saveWithDedupe({ type: "preference", title: "猫猫", content: "猫粮" });
|
|
92
|
+
// b is newer, so keyword order is [b, a]. The reranker reverses scores so
|
|
93
|
+
// the last candidate (a) wins — asserting the rerank actually reordered.
|
|
94
|
+
const reranker = {
|
|
95
|
+
rerank: async (query, candidates) =>
|
|
96
|
+
candidates.map((c, i) => ({ id: c.id, score: i })).sort((x, y) => y.score - x.score)
|
|
97
|
+
};
|
|
98
|
+
service.setReranker(reranker);
|
|
99
|
+
|
|
100
|
+
const rows = await service.searchMemories("猫", { mode: "keyword", topK: 10 });
|
|
101
|
+
assert.equal(rows[0].title, "猫", "rerank reorders to the higher score");
|
|
102
|
+
assert.equal(typeof rows[0].score, "number", "reranked rows carry a score");
|
|
103
|
+
});
|
|
104
|
+
|
|
105
|
+
test("searchMemories survives a throwing embedder (degrades to keyword)", async () => {
|
|
106
|
+
const { service } = setup(mockEmbedder({
|
|
107
|
+
embedSingle: async () => { throw new Error("model unavailable"); }
|
|
108
|
+
}));
|
|
109
|
+
service.saveWithDedupe({ type: "preference", title: "语言", content: "中文交流" });
|
|
110
|
+
const rows = await service.searchMemories("中文", { mode: "auto", topK: 10 });
|
|
111
|
+
assert.equal(rows.length, 1, "keyword fallback still works");
|
|
112
|
+
});
|
|
113
|
+
|
|
114
|
+
test("legacy embedder (embed-only) is adapted by searchMemories", async () => {
|
|
115
|
+
const store = createStore(":memory:");
|
|
116
|
+
const service = createService({ store, mirror: null, config: {} });
|
|
117
|
+
const legacy = { embed: async (q) => [1, 0, 0, 0] };
|
|
118
|
+
service.setEmbedder(legacy); // no embedSingle, no vectorIndex
|
|
119
|
+
service.saveWithDedupe({ type: "preference", title: "猫", content: "喜欢猫" });
|
|
120
|
+
store.setEmbedding(service.all()[0].id, [1, 0, 0, 0]);
|
|
121
|
+
|
|
122
|
+
const rows = await service.searchMemories("猫", { mode: "vector", topK: 10 });
|
|
123
|
+
assert.ok(rows.some((m) => m.title === "猫"), "legacy embed() path works");
|
|
124
|
+
});
|