@modusensus/dsh-mneme 0.6.7 → 0.6.9
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/.github/workflows/test.yml +32 -0
- package/.release-notes-v0.6.9.md +13 -0
- package/CHANGELOG.md +89 -0
- package/LICENSE +21 -21
- package/README.md +219 -463
- package/SECURITY.md +544 -0
- package/docs/devlog/2026-08-14-dsh-mneme-dev-log.md +247 -0
- package/docs/devlog/2026-08-15-dsh-mneme-audit-stress-dev-log.md +145 -0
- package/docs/devlog/2026-08-15-dsh-mneme-pipeline-dev-log.md +56 -0
- package/docs/devlog/2026-08-15-dsh-mneme-reflection-dev-log.md +77 -0
- package/docs/devlog/2026-08-15-dsh-mneme-review-fixes-dev-log.md +64 -0
- package/docs/devlog/2026-08-15-dsh-mneme-semantic-dev-log.md +90 -0
- package/dsh-mneme/CHANGELOG.md +248 -0
- package/dsh-mneme/LICENSE +21 -0
- package/dsh-mneme/README.md +465 -0
- package/{cordis.patch.yml → dsh-mneme/cordis.patch.yml} +15 -15
- package/dsh-mneme/docs/AGENT_MEMORY_RESEARCH.md +183 -0
- package/dsh-mneme/docs/ENTITIES.md +245 -0
- package/dsh-mneme/docs/LOCAL_MODEL.md +141 -0
- package/dsh-mneme/docs/MIGRATION.md +127 -0
- package/dsh-mneme/docs/SEMANTIC.md +256 -0
- package/dsh-mneme/docs/SLEEP.md +163 -0
- package/{lib → dsh-mneme/lib}/api.js +783 -783
- package/{lib → dsh-mneme/lib}/client.js +1757 -1757
- package/{src → dsh-mneme/lib}/commands.js +64 -64
- package/{lib → dsh-mneme/lib}/config.js +298 -288
- package/{lib → dsh-mneme/lib}/dream/clustering.js +118 -118
- package/{src → dsh-mneme/lib}/dream/decisions.js +488 -439
- package/{lib → dsh-mneme/lib}/dream/sleep.js +561 -554
- package/{src → dsh-mneme/lib}/dream/tag-extractor.js +156 -156
- package/{lib → dsh-mneme/lib}/dream.js +958 -929
- package/{src → dsh-mneme/lib}/embedding.js +154 -154
- package/{src → dsh-mneme/lib}/entities/extractor.js +242 -242
- package/{src → dsh-mneme/lib}/hot-memory.js +53 -53
- package/{lib → dsh-mneme/lib}/index.js +361 -361
- package/{src → dsh-mneme/lib}/inject.js +208 -208
- package/{lib → dsh-mneme/lib}/local-embedder.js +282 -282
- package/{lib → dsh-mneme/lib}/mirror.js +170 -170
- package/{lib → dsh-mneme/lib}/parser/tag.js +59 -59
- package/{lib → dsh-mneme/lib}/parser/wiki-link.js +38 -38
- package/{src → dsh-mneme/lib}/quality-filter.js +123 -123
- package/{lib → dsh-mneme/lib}/reranker.js +218 -218
- package/{lib → dsh-mneme/lib}/search/adaptive.js +22 -22
- package/{lib → dsh-mneme/lib}/search/bm25.js +96 -96
- package/{src → dsh-mneme/lib}/search/tag-boost.js +61 -61
- package/{src → dsh-mneme/lib}/service.js +1726 -1726
- package/{lib → dsh-mneme/lib}/settings.js +172 -172
- package/{lib → dsh-mneme/lib}/store.js +2238 -2238
- package/{lib → dsh-mneme/lib}/summarize.js +236 -236
- package/{lib → dsh-mneme/lib}/tools.js +290 -290
- package/{lib → dsh-mneme/lib}/vector-index.js +116 -116
- package/dsh-mneme/package-lock.json +1936 -0
- package/dsh-mneme/package.json +80 -0
- package/{scripts → dsh-mneme/scripts}/benchmark-embed.js +201 -201
- package/{scripts → dsh-mneme/scripts}/benchmark-recall.js +133 -133
- package/{scripts → dsh-mneme/scripts}/benchmark-rerank.js +166 -166
- package/{scripts → dsh-mneme/scripts}/e2e-dsh.js +218 -218
- package/{scripts → dsh-mneme/scripts}/stress-dsh.js +255 -255
- package/{scripts → dsh-mneme/scripts}/sync-lib.js +52 -52
- package/{src → dsh-mneme/src}/api.js +783 -783
- package/{lib → dsh-mneme/src}/commands.js +64 -64
- package/{src → dsh-mneme/src}/config.js +298 -288
- package/{src → dsh-mneme/src}/dream/clustering.js +118 -118
- package/{lib → dsh-mneme/src}/dream/decisions.js +488 -439
- package/{src → dsh-mneme/src}/dream/sleep.js +561 -554
- package/{lib → dsh-mneme/src}/dream/tag-extractor.js +156 -156
- package/{src → dsh-mneme/src}/dream.js +958 -929
- package/{lib → dsh-mneme/src}/embedding.js +154 -154
- package/{lib → dsh-mneme/src}/entities/extractor.js +242 -242
- package/{lib → dsh-mneme/src}/hot-memory.js +53 -53
- package/{src → dsh-mneme/src}/index.js +361 -361
- package/{lib → dsh-mneme/src}/inject.js +208 -208
- package/{src → dsh-mneme/src}/local-embedder.js +282 -282
- package/{src → dsh-mneme/src}/mirror.js +170 -170
- package/{src → dsh-mneme/src}/parser/tag.js +59 -59
- package/{src → dsh-mneme/src}/parser/wiki-link.js +38 -38
- package/{lib → dsh-mneme/src}/quality-filter.js +123 -123
- package/{src → dsh-mneme/src}/reranker.js +218 -218
- package/{src → dsh-mneme/src}/search/adaptive.js +22 -22
- package/{src → dsh-mneme/src}/search/bm25.js +96 -96
- package/{lib → dsh-mneme/src}/search/tag-boost.js +61 -61
- package/{lib → dsh-mneme/src}/service.js +1726 -1726
- package/{src → dsh-mneme/src}/settings.js +172 -172
- package/{src → dsh-mneme/src}/store.js +2238 -2238
- package/{src → dsh-mneme/src}/summarize.js +236 -236
- package/{src → dsh-mneme/src}/tools.js +290 -290
- package/{src → dsh-mneme/src}/vector-index.js +116 -116
- package/{test → dsh-mneme/test}/api.test.js +594 -594
- package/{test → dsh-mneme/test}/audit.test.js +448 -448
- package/{test → dsh-mneme/test}/benchmark.test.js +35 -35
- package/{test → dsh-mneme/test}/boundary-v0625.test.js +82 -82
- package/{test → dsh-mneme/test}/client.test.js +368 -368
- package/{test → dsh-mneme/test}/clustering.test.js +100 -100
- package/{test → dsh-mneme/test}/commands.test.js +69 -69
- package/{test → dsh-mneme/test}/config.test.js +50 -50
- package/{test → dsh-mneme/test}/conflict-freeze.test.js +290 -290
- package/{test → dsh-mneme/test}/directory.test.js +134 -134
- package/{test → dsh-mneme/test}/dream.test.js +1060 -901
- package/{test → dsh-mneme/test}/entities.test.js +522 -522
- package/{test → dsh-mneme/test}/epistemic.test.js +298 -298
- package/{test → dsh-mneme/test}/fnew-0112.test.js +311 -311
- package/{test → dsh-mneme/test}/fnew-03.test.js +422 -422
- package/{test → dsh-mneme/test}/graph-api.test.js +175 -175
- package/{test → dsh-mneme/test}/helpers/dream-mock.js +82 -82
- package/{test → dsh-mneme/test}/hot-memory.test.js +174 -174
- package/{test → dsh-mneme/test}/inject.test.js +103 -103
- package/{test → dsh-mneme/test}/llm-audit.test.js +279 -279
- package/{test → dsh-mneme/test}/local-embedder.test.js +227 -227
- package/{test → dsh-mneme/test}/mirror-dirty.test.js +424 -424
- package/{test → dsh-mneme/test}/mirror-edit-digest.test.js +187 -187
- package/{test → dsh-mneme/test}/mirror-generation.test.js +499 -499
- package/{test → dsh-mneme/test}/mirror.test.js +249 -249
- package/{test → dsh-mneme/test}/normalize-decisions.test.js +120 -120
- package/{test → dsh-mneme/test}/peer-blockers.test.js +190 -190
- package/{test → dsh-mneme/test}/policy-epoch.test.js +259 -259
- package/{test → dsh-mneme/test}/provenance.test.js +103 -103
- package/{test → dsh-mneme/test}/quality-filter.test.js +118 -118
- package/{test → dsh-mneme/test}/reasoning-effort.test.js +199 -199
- package/{test → dsh-mneme/test}/recall-evals.test.js +235 -235
- package/{test → dsh-mneme/test}/recall-layer.test.js +315 -315
- package/{test → dsh-mneme/test}/receipt-chain.test.js +451 -451
- package/{test → dsh-mneme/test}/reflection.test.js +226 -226
- package/{test → dsh-mneme/test}/reranker.test.js +240 -240
- package/{test → dsh-mneme/test}/search-fusion.test.js +90 -90
- package/{test → dsh-mneme/test}/semantic.test.js +124 -124
- package/{test → dsh-mneme/test}/service-search.test.js +199 -199
- package/{test → dsh-mneme/test}/service.test.js +435 -435
- package/{test → dsh-mneme/test}/settings.test.js +118 -118
- package/{test → dsh-mneme/test}/sleep.test.js +365 -365
- package/{test → dsh-mneme/test}/store.test.js +436 -436
- package/{test → dsh-mneme/test}/stress.test.js +209 -209
- package/{test → dsh-mneme/test}/summarize.test.js +191 -191
- package/{test → dsh-mneme/test}/tag-boost.test.js +125 -125
- package/{test → dsh-mneme/test}/tag.test.js +312 -312
- package/{test → dsh-mneme/test}/tools.test.js +285 -285
- package/{test → dsh-mneme/test}/vector-index.test.js +221 -221
- package/{test → dsh-mneme/test}/wiki-link.test.js +332 -332
- package/package.json +18 -40
- package//346/250/252/345/271/205.png +0 -0
|
@@ -1,227 +1,227 @@
|
|
|
1
|
-
import test from "node:test";
|
|
2
|
-
import assert from "node:assert/strict";
|
|
3
|
-
import {
|
|
4
|
-
LocalEmbedder,
|
|
5
|
-
OllamaEmbedder,
|
|
6
|
-
OpenAIEmbedder,
|
|
7
|
-
createEmbedderByProvider
|
|
8
|
-
} from "../src/local-embedder.js";
|
|
9
|
-
|
|
10
|
-
/** Build a transformers.js-like Tensor: [rows x dim] flat data + dims. */
|
|
11
|
-
function fakeTensor(rows) {
|
|
12
|
-
const flat = Float32Array.from(rows.flat());
|
|
13
|
-
return { data: flat, dims: rows.length ? [rows.length, rows[0].length] : [0] };
|
|
14
|
-
}
|
|
15
|
-
|
|
16
|
-
/** Fake extractor: deterministic [batch, dim], records option passthrough. */
|
|
17
|
-
function makeFakeExtractor(dim, calls = []) {
|
|
18
|
-
const fn = async (texts, opts) => {
|
|
19
|
-
calls.push({ count: texts.length, opts });
|
|
20
|
-
return fakeTensor(
|
|
21
|
-
texts.map((_, i) => Array.from({ length: dim }, (__, j) => (i + 1) * 0.1 + j * 0.01))
|
|
22
|
-
);
|
|
23
|
-
};
|
|
24
|
-
fn.dispose = () => {
|
|
25
|
-
fn.disposed = true;
|
|
26
|
-
};
|
|
27
|
-
return fn;
|
|
28
|
-
}
|
|
29
|
-
|
|
30
|
-
/** Stub globalThis.fetch, returning the original on restore. */
|
|
31
|
-
function stubFetch(handler) {
|
|
32
|
-
const real = globalThis.fetch;
|
|
33
|
-
globalThis.fetch = async (url, init) => handler(url, init);
|
|
34
|
-
return () => {
|
|
35
|
-
globalThis.fetch = real;
|
|
36
|
-
};
|
|
37
|
-
}
|
|
38
|
-
|
|
39
|
-
function okJson(status, body) {
|
|
40
|
-
return {
|
|
41
|
-
ok: status >= 200 && status < 300,
|
|
42
|
-
status,
|
|
43
|
-
json: async () => body
|
|
44
|
-
};
|
|
45
|
-
}
|
|
46
|
-
|
|
47
|
-
test("LocalEmbedder init loads via injected engineFactory with cache_dir", async () => {
|
|
48
|
-
let seen = null;
|
|
49
|
-
const loader = async (task, model, options) => {
|
|
50
|
-
seen = { task, model, options };
|
|
51
|
-
return makeFakeExtractor(512);
|
|
52
|
-
};
|
|
53
|
-
const e = new LocalEmbedder({ cacheDir: "/tmp/model-cache", engineFactory: loader });
|
|
54
|
-
await e.init();
|
|
55
|
-
assert.equal(seen.task, "feature-extraction");
|
|
56
|
-
assert.equal(seen.model, "Xenova/bge-small-zh-v1.5");
|
|
57
|
-
assert.equal(seen.options.cache_dir, "/tmp/model-cache");
|
|
58
|
-
assert.equal(seen.options.dtype, "q8");
|
|
59
|
-
assert.equal(seen.options.device, "cpu");
|
|
60
|
-
});
|
|
61
|
-
|
|
62
|
-
test("LocalEmbedder embed returns [n, dim] with mean pooling and chunking", async () => {
|
|
63
|
-
const calls = [];
|
|
64
|
-
const e = new LocalEmbedder({
|
|
65
|
-
model: "Xenova/bge-small-zh-v1.5",
|
|
66
|
-
batchSize: 2,
|
|
67
|
-
engineFactory: async () => makeFakeExtractor(512, calls)
|
|
68
|
-
});
|
|
69
|
-
await e.init();
|
|
70
|
-
const vecs = await e.embed(["你好", "hello world", "测试文本"]);
|
|
71
|
-
assert.equal(vecs.length, 3);
|
|
72
|
-
for (const v of vecs) {
|
|
73
|
-
assert.equal(v.length, 512);
|
|
74
|
-
assert.ok(v.every(Number.isFinite));
|
|
75
|
-
}
|
|
76
|
-
// 3 texts at batchSize 2 -> two extractor calls.
|
|
77
|
-
assert.deepEqual(calls.map((c) => c.count), [2, 1]);
|
|
78
|
-
assert.deepEqual(calls[0].opts, { pooling: "mean", normalize: true });
|
|
79
|
-
});
|
|
80
|
-
|
|
81
|
-
test("LocalEmbedder embedSingle returns a single vector", async () => {
|
|
82
|
-
const e = new LocalEmbedder({ engineFactory: async () => makeFakeExtractor(384) });
|
|
83
|
-
await e.init();
|
|
84
|
-
const v = await e.embedSingle("single");
|
|
85
|
-
assert.equal(v.length, 384);
|
|
86
|
-
});
|
|
87
|
-
|
|
88
|
-
test("LocalEmbedder dimension and modelHash are stable", () => {
|
|
89
|
-
const a = new LocalEmbedder({ model: "Xenova/bge-small-zh-v1.5" });
|
|
90
|
-
const b = new LocalEmbedder({ model: "Xenova/bge-small-zh-v1.5" });
|
|
91
|
-
assert.equal(a.dimension, 512);
|
|
92
|
-
assert.equal(a.modelHash, b.modelHash);
|
|
93
|
-
assert.match(a.modelHash, /^Xenova\/bge-small-zh-v1\.5#[0-9a-f]+$/);
|
|
94
|
-
// Different model -> different hash.
|
|
95
|
-
assert.notEqual(a.modelHash, new LocalEmbedder({ model: "other/model" }).modelHash);
|
|
96
|
-
});
|
|
97
|
-
|
|
98
|
-
test("LocalEmbedder throws before init and after dispose", async () => {
|
|
99
|
-
const e = new LocalEmbedder({ engineFactory: async () => makeFakeExtractor(512) });
|
|
100
|
-
await assert.rejects(() => e.embed(["x"]), /not initialized/);
|
|
101
|
-
await e.init();
|
|
102
|
-
const disposed = makeFakeExtractor(512);
|
|
103
|
-
e.dispose();
|
|
104
|
-
assert.ok(disposed.disposed || e.extractor === null);
|
|
105
|
-
await assert.rejects(() => e.embed(["x"]), /not initialized/);
|
|
106
|
-
});
|
|
107
|
-
|
|
108
|
-
test("OllamaEmbedder init probes server and infers dimension", async () => {
|
|
109
|
-
const restore = stubFetch(async (url, init) => {
|
|
110
|
-
assert.equal(url, "http://localhost:11434/api/embeddings");
|
|
111
|
-
assert.equal(init.method, "POST");
|
|
112
|
-
const body = JSON.parse(init.body);
|
|
113
|
-
assert.equal(body.model, "nomic-embed-text");
|
|
114
|
-
assert.equal(body.prompt, "ping");
|
|
115
|
-
return okJson(200, { embedding: Array.from({ length: 768 }, (_, i) => i / 768) });
|
|
116
|
-
});
|
|
117
|
-
try {
|
|
118
|
-
const e = new OllamaEmbedder({ baseUrl: "http://localhost:11434", model: "nomic-embed-text" });
|
|
119
|
-
await e.init();
|
|
120
|
-
assert.equal(e.dimension, 768);
|
|
121
|
-
} finally {
|
|
122
|
-
restore();
|
|
123
|
-
}
|
|
124
|
-
});
|
|
125
|
-
|
|
126
|
-
test("OllamaEmbedder embed loops single requests", async () => {
|
|
127
|
-
const prompts = [];
|
|
128
|
-
const restore = stubFetch(async (url, init) => {
|
|
129
|
-
const body = JSON.parse(init.body);
|
|
130
|
-
prompts.push(body.prompt);
|
|
131
|
-
return okJson(200, { embedding: [0.5, 0.25, 0.125] });
|
|
132
|
-
});
|
|
133
|
-
try {
|
|
134
|
-
const e = new OllamaEmbedder({});
|
|
135
|
-
await e.init();
|
|
136
|
-
const vecs = await e.embed(["one", "two"]);
|
|
137
|
-
assert.deepEqual(prompts, ["ping", "one", "two"]);
|
|
138
|
-
assert.equal(vecs.length, 2);
|
|
139
|
-
assert.deepEqual(vecs[0], [0.5, 0.25, 0.125]);
|
|
140
|
-
assert.equal(e.dimension, 3);
|
|
141
|
-
} finally {
|
|
142
|
-
restore();
|
|
143
|
-
}
|
|
144
|
-
});
|
|
145
|
-
|
|
146
|
-
test("OllamaEmbedder init throws when unreachable", async () => {
|
|
147
|
-
const restore = stubFetch(async () => {
|
|
148
|
-
throw new Error("ECONNREFUSED");
|
|
149
|
-
});
|
|
150
|
-
try {
|
|
151
|
-
const e = new OllamaEmbedder({});
|
|
152
|
-
await assert.rejects(() => e.init(), /ECONNREFUSED/);
|
|
153
|
-
} finally {
|
|
154
|
-
restore();
|
|
155
|
-
}
|
|
156
|
-
});
|
|
157
|
-
|
|
158
|
-
test("OllamaEmbedder embed throws on HTTP error", async () => {
|
|
159
|
-
const restore = stubFetch(async () => okJson(404, { error: "model not found" }));
|
|
160
|
-
try {
|
|
161
|
-
const e = new OllamaEmbedder({});
|
|
162
|
-
await assert.rejects(() => e.embedSingle("x"), /HTTP 404/);
|
|
163
|
-
} finally {
|
|
164
|
-
restore();
|
|
165
|
-
}
|
|
166
|
-
});
|
|
167
|
-
|
|
168
|
-
test("OllamaEmbedder modelHash is stable", () => {
|
|
169
|
-
const a = new OllamaEmbedder({ model: "nomic-embed-text" });
|
|
170
|
-
const b = new OllamaEmbedder({ model: "nomic-embed-text" });
|
|
171
|
-
assert.equal(a.modelHash, b.modelHash);
|
|
172
|
-
assert.notEqual(a.modelHash, new OllamaEmbedder({ model: "bge-m3" }).modelHash);
|
|
173
|
-
});
|
|
174
|
-
|
|
175
|
-
test("OpenAIEmbedder init requires config and calls /embeddings", async () => {
|
|
176
|
-
const e = new OpenAIEmbedder({ baseUrl: "http://localhost:8000/v1", apiKey: "k", model: "m" });
|
|
177
|
-
assert.equal(e._url, "http://localhost:8000/v1/embeddings");
|
|
178
|
-
await e.init();
|
|
179
|
-
|
|
180
|
-
const bad = new OpenAIEmbedder({ baseUrl: "", apiKey: "", model: "" });
|
|
181
|
-
await assert.rejects(() => bad.init(), /requires baseUrl, apiKey and model/);
|
|
182
|
-
});
|
|
183
|
-
|
|
184
|
-
test("OpenAIEmbedder embed batch posts array and parses data", async () => {
|
|
185
|
-
let captured = null;
|
|
186
|
-
const restore = stubFetch(async (url, init) => {
|
|
187
|
-
captured = { url, init };
|
|
188
|
-
return okJson(200, {
|
|
189
|
-
data: [
|
|
190
|
-
{ embedding: [0.1, 0.2, 0.3] },
|
|
191
|
-
{ embedding: [0.4, 0.5, 0.6] }
|
|
192
|
-
]
|
|
193
|
-
});
|
|
194
|
-
});
|
|
195
|
-
try {
|
|
196
|
-
const e = new OpenAIEmbedder({ baseUrl: "https://x/v1", apiKey: "sk-abc", model: "text-embed" });
|
|
197
|
-
await e.init();
|
|
198
|
-
const vecs = await e.embed(["a", "b"]);
|
|
199
|
-
assert.equal(captured.url, "https://x/v1/embeddings");
|
|
200
|
-
assert.equal(captured.init.headers.Authorization, "Bearer sk-abc");
|
|
201
|
-
const body = JSON.parse(captured.init.body);
|
|
202
|
-
assert.equal(body.model, "text-embed");
|
|
203
|
-
assert.deepEqual(body.input, ["a", "b"]);
|
|
204
|
-
assert.equal(vecs.length, 2);
|
|
205
|
-
assert.equal(e.dimension, 3);
|
|
206
|
-
} finally {
|
|
207
|
-
restore();
|
|
208
|
-
}
|
|
209
|
-
});
|
|
210
|
-
|
|
211
|
-
test("OpenAIEmbedder throws on non-ok response", async () => {
|
|
212
|
-
const restore = stubFetch(async () => okJson(500, {}));
|
|
213
|
-
try {
|
|
214
|
-
const e = new OpenAIEmbedder({ baseUrl: "https://x/v1", apiKey: "k", model: "m" });
|
|
215
|
-
await assert.rejects(() => e.embed(["x"]), /HTTP 500/);
|
|
216
|
-
} finally {
|
|
217
|
-
restore();
|
|
218
|
-
}
|
|
219
|
-
});
|
|
220
|
-
|
|
221
|
-
test("createEmbedderByProvider returns the right class per provider", () => {
|
|
222
|
-
assert.ok(createEmbedderByProvider("local") instanceof LocalEmbedder);
|
|
223
|
-
assert.ok(createEmbedderByProvider("ollama") instanceof OllamaEmbedder);
|
|
224
|
-
assert.ok(createEmbedderByProvider("openai") instanceof OpenAIEmbedder);
|
|
225
|
-
assert.ok(createEmbedderByProvider("LOCAL") instanceof LocalEmbedder);
|
|
226
|
-
assert.throws(() => createEmbedderByProvider("watson"), /Unknown embedding provider/);
|
|
227
|
-
});
|
|
1
|
+
import test from "node:test";
|
|
2
|
+
import assert from "node:assert/strict";
|
|
3
|
+
import {
|
|
4
|
+
LocalEmbedder,
|
|
5
|
+
OllamaEmbedder,
|
|
6
|
+
OpenAIEmbedder,
|
|
7
|
+
createEmbedderByProvider
|
|
8
|
+
} from "../src/local-embedder.js";
|
|
9
|
+
|
|
10
|
+
/** Build a transformers.js-like Tensor: [rows x dim] flat data + dims. */
|
|
11
|
+
function fakeTensor(rows) {
|
|
12
|
+
const flat = Float32Array.from(rows.flat());
|
|
13
|
+
return { data: flat, dims: rows.length ? [rows.length, rows[0].length] : [0] };
|
|
14
|
+
}
|
|
15
|
+
|
|
16
|
+
/** Fake extractor: deterministic [batch, dim], records option passthrough. */
|
|
17
|
+
function makeFakeExtractor(dim, calls = []) {
|
|
18
|
+
const fn = async (texts, opts) => {
|
|
19
|
+
calls.push({ count: texts.length, opts });
|
|
20
|
+
return fakeTensor(
|
|
21
|
+
texts.map((_, i) => Array.from({ length: dim }, (__, j) => (i + 1) * 0.1 + j * 0.01))
|
|
22
|
+
);
|
|
23
|
+
};
|
|
24
|
+
fn.dispose = () => {
|
|
25
|
+
fn.disposed = true;
|
|
26
|
+
};
|
|
27
|
+
return fn;
|
|
28
|
+
}
|
|
29
|
+
|
|
30
|
+
/** Stub globalThis.fetch, returning the original on restore. */
|
|
31
|
+
function stubFetch(handler) {
|
|
32
|
+
const real = globalThis.fetch;
|
|
33
|
+
globalThis.fetch = async (url, init) => handler(url, init);
|
|
34
|
+
return () => {
|
|
35
|
+
globalThis.fetch = real;
|
|
36
|
+
};
|
|
37
|
+
}
|
|
38
|
+
|
|
39
|
+
function okJson(status, body) {
|
|
40
|
+
return {
|
|
41
|
+
ok: status >= 200 && status < 300,
|
|
42
|
+
status,
|
|
43
|
+
json: async () => body
|
|
44
|
+
};
|
|
45
|
+
}
|
|
46
|
+
|
|
47
|
+
test("LocalEmbedder init loads via injected engineFactory with cache_dir", async () => {
|
|
48
|
+
let seen = null;
|
|
49
|
+
const loader = async (task, model, options) => {
|
|
50
|
+
seen = { task, model, options };
|
|
51
|
+
return makeFakeExtractor(512);
|
|
52
|
+
};
|
|
53
|
+
const e = new LocalEmbedder({ cacheDir: "/tmp/model-cache", engineFactory: loader });
|
|
54
|
+
await e.init();
|
|
55
|
+
assert.equal(seen.task, "feature-extraction");
|
|
56
|
+
assert.equal(seen.model, "Xenova/bge-small-zh-v1.5");
|
|
57
|
+
assert.equal(seen.options.cache_dir, "/tmp/model-cache");
|
|
58
|
+
assert.equal(seen.options.dtype, "q8");
|
|
59
|
+
assert.equal(seen.options.device, "cpu");
|
|
60
|
+
});
|
|
61
|
+
|
|
62
|
+
test("LocalEmbedder embed returns [n, dim] with mean pooling and chunking", async () => {
|
|
63
|
+
const calls = [];
|
|
64
|
+
const e = new LocalEmbedder({
|
|
65
|
+
model: "Xenova/bge-small-zh-v1.5",
|
|
66
|
+
batchSize: 2,
|
|
67
|
+
engineFactory: async () => makeFakeExtractor(512, calls)
|
|
68
|
+
});
|
|
69
|
+
await e.init();
|
|
70
|
+
const vecs = await e.embed(["你好", "hello world", "测试文本"]);
|
|
71
|
+
assert.equal(vecs.length, 3);
|
|
72
|
+
for (const v of vecs) {
|
|
73
|
+
assert.equal(v.length, 512);
|
|
74
|
+
assert.ok(v.every(Number.isFinite));
|
|
75
|
+
}
|
|
76
|
+
// 3 texts at batchSize 2 -> two extractor calls.
|
|
77
|
+
assert.deepEqual(calls.map((c) => c.count), [2, 1]);
|
|
78
|
+
assert.deepEqual(calls[0].opts, { pooling: "mean", normalize: true });
|
|
79
|
+
});
|
|
80
|
+
|
|
81
|
+
test("LocalEmbedder embedSingle returns a single vector", async () => {
|
|
82
|
+
const e = new LocalEmbedder({ engineFactory: async () => makeFakeExtractor(384) });
|
|
83
|
+
await e.init();
|
|
84
|
+
const v = await e.embedSingle("single");
|
|
85
|
+
assert.equal(v.length, 384);
|
|
86
|
+
});
|
|
87
|
+
|
|
88
|
+
test("LocalEmbedder dimension and modelHash are stable", () => {
|
|
89
|
+
const a = new LocalEmbedder({ model: "Xenova/bge-small-zh-v1.5" });
|
|
90
|
+
const b = new LocalEmbedder({ model: "Xenova/bge-small-zh-v1.5" });
|
|
91
|
+
assert.equal(a.dimension, 512);
|
|
92
|
+
assert.equal(a.modelHash, b.modelHash);
|
|
93
|
+
assert.match(a.modelHash, /^Xenova\/bge-small-zh-v1\.5#[0-9a-f]+$/);
|
|
94
|
+
// Different model -> different hash.
|
|
95
|
+
assert.notEqual(a.modelHash, new LocalEmbedder({ model: "other/model" }).modelHash);
|
|
96
|
+
});
|
|
97
|
+
|
|
98
|
+
test("LocalEmbedder throws before init and after dispose", async () => {
|
|
99
|
+
const e = new LocalEmbedder({ engineFactory: async () => makeFakeExtractor(512) });
|
|
100
|
+
await assert.rejects(() => e.embed(["x"]), /not initialized/);
|
|
101
|
+
await e.init();
|
|
102
|
+
const disposed = makeFakeExtractor(512);
|
|
103
|
+
e.dispose();
|
|
104
|
+
assert.ok(disposed.disposed || e.extractor === null);
|
|
105
|
+
await assert.rejects(() => e.embed(["x"]), /not initialized/);
|
|
106
|
+
});
|
|
107
|
+
|
|
108
|
+
test("OllamaEmbedder init probes server and infers dimension", async () => {
|
|
109
|
+
const restore = stubFetch(async (url, init) => {
|
|
110
|
+
assert.equal(url, "http://localhost:11434/api/embeddings");
|
|
111
|
+
assert.equal(init.method, "POST");
|
|
112
|
+
const body = JSON.parse(init.body);
|
|
113
|
+
assert.equal(body.model, "nomic-embed-text");
|
|
114
|
+
assert.equal(body.prompt, "ping");
|
|
115
|
+
return okJson(200, { embedding: Array.from({ length: 768 }, (_, i) => i / 768) });
|
|
116
|
+
});
|
|
117
|
+
try {
|
|
118
|
+
const e = new OllamaEmbedder({ baseUrl: "http://localhost:11434", model: "nomic-embed-text" });
|
|
119
|
+
await e.init();
|
|
120
|
+
assert.equal(e.dimension, 768);
|
|
121
|
+
} finally {
|
|
122
|
+
restore();
|
|
123
|
+
}
|
|
124
|
+
});
|
|
125
|
+
|
|
126
|
+
test("OllamaEmbedder embed loops single requests", async () => {
|
|
127
|
+
const prompts = [];
|
|
128
|
+
const restore = stubFetch(async (url, init) => {
|
|
129
|
+
const body = JSON.parse(init.body);
|
|
130
|
+
prompts.push(body.prompt);
|
|
131
|
+
return okJson(200, { embedding: [0.5, 0.25, 0.125] });
|
|
132
|
+
});
|
|
133
|
+
try {
|
|
134
|
+
const e = new OllamaEmbedder({});
|
|
135
|
+
await e.init();
|
|
136
|
+
const vecs = await e.embed(["one", "two"]);
|
|
137
|
+
assert.deepEqual(prompts, ["ping", "one", "two"]);
|
|
138
|
+
assert.equal(vecs.length, 2);
|
|
139
|
+
assert.deepEqual(vecs[0], [0.5, 0.25, 0.125]);
|
|
140
|
+
assert.equal(e.dimension, 3);
|
|
141
|
+
} finally {
|
|
142
|
+
restore();
|
|
143
|
+
}
|
|
144
|
+
});
|
|
145
|
+
|
|
146
|
+
test("OllamaEmbedder init throws when unreachable", async () => {
|
|
147
|
+
const restore = stubFetch(async () => {
|
|
148
|
+
throw new Error("ECONNREFUSED");
|
|
149
|
+
});
|
|
150
|
+
try {
|
|
151
|
+
const e = new OllamaEmbedder({});
|
|
152
|
+
await assert.rejects(() => e.init(), /ECONNREFUSED/);
|
|
153
|
+
} finally {
|
|
154
|
+
restore();
|
|
155
|
+
}
|
|
156
|
+
});
|
|
157
|
+
|
|
158
|
+
test("OllamaEmbedder embed throws on HTTP error", async () => {
|
|
159
|
+
const restore = stubFetch(async () => okJson(404, { error: "model not found" }));
|
|
160
|
+
try {
|
|
161
|
+
const e = new OllamaEmbedder({});
|
|
162
|
+
await assert.rejects(() => e.embedSingle("x"), /HTTP 404/);
|
|
163
|
+
} finally {
|
|
164
|
+
restore();
|
|
165
|
+
}
|
|
166
|
+
});
|
|
167
|
+
|
|
168
|
+
test("OllamaEmbedder modelHash is stable", () => {
|
|
169
|
+
const a = new OllamaEmbedder({ model: "nomic-embed-text" });
|
|
170
|
+
const b = new OllamaEmbedder({ model: "nomic-embed-text" });
|
|
171
|
+
assert.equal(a.modelHash, b.modelHash);
|
|
172
|
+
assert.notEqual(a.modelHash, new OllamaEmbedder({ model: "bge-m3" }).modelHash);
|
|
173
|
+
});
|
|
174
|
+
|
|
175
|
+
test("OpenAIEmbedder init requires config and calls /embeddings", async () => {
|
|
176
|
+
const e = new OpenAIEmbedder({ baseUrl: "http://localhost:8000/v1", apiKey: "k", model: "m" });
|
|
177
|
+
assert.equal(e._url, "http://localhost:8000/v1/embeddings");
|
|
178
|
+
await e.init();
|
|
179
|
+
|
|
180
|
+
const bad = new OpenAIEmbedder({ baseUrl: "", apiKey: "", model: "" });
|
|
181
|
+
await assert.rejects(() => bad.init(), /requires baseUrl, apiKey and model/);
|
|
182
|
+
});
|
|
183
|
+
|
|
184
|
+
test("OpenAIEmbedder embed batch posts array and parses data", async () => {
|
|
185
|
+
let captured = null;
|
|
186
|
+
const restore = stubFetch(async (url, init) => {
|
|
187
|
+
captured = { url, init };
|
|
188
|
+
return okJson(200, {
|
|
189
|
+
data: [
|
|
190
|
+
{ embedding: [0.1, 0.2, 0.3] },
|
|
191
|
+
{ embedding: [0.4, 0.5, 0.6] }
|
|
192
|
+
]
|
|
193
|
+
});
|
|
194
|
+
});
|
|
195
|
+
try {
|
|
196
|
+
const e = new OpenAIEmbedder({ baseUrl: "https://x/v1", apiKey: "sk-abc", model: "text-embed" });
|
|
197
|
+
await e.init();
|
|
198
|
+
const vecs = await e.embed(["a", "b"]);
|
|
199
|
+
assert.equal(captured.url, "https://x/v1/embeddings");
|
|
200
|
+
assert.equal(captured.init.headers.Authorization, "Bearer sk-abc");
|
|
201
|
+
const body = JSON.parse(captured.init.body);
|
|
202
|
+
assert.equal(body.model, "text-embed");
|
|
203
|
+
assert.deepEqual(body.input, ["a", "b"]);
|
|
204
|
+
assert.equal(vecs.length, 2);
|
|
205
|
+
assert.equal(e.dimension, 3);
|
|
206
|
+
} finally {
|
|
207
|
+
restore();
|
|
208
|
+
}
|
|
209
|
+
});
|
|
210
|
+
|
|
211
|
+
test("OpenAIEmbedder throws on non-ok response", async () => {
|
|
212
|
+
const restore = stubFetch(async () => okJson(500, {}));
|
|
213
|
+
try {
|
|
214
|
+
const e = new OpenAIEmbedder({ baseUrl: "https://x/v1", apiKey: "k", model: "m" });
|
|
215
|
+
await assert.rejects(() => e.embed(["x"]), /HTTP 500/);
|
|
216
|
+
} finally {
|
|
217
|
+
restore();
|
|
218
|
+
}
|
|
219
|
+
});
|
|
220
|
+
|
|
221
|
+
test("createEmbedderByProvider returns the right class per provider", () => {
|
|
222
|
+
assert.ok(createEmbedderByProvider("local") instanceof LocalEmbedder);
|
|
223
|
+
assert.ok(createEmbedderByProvider("ollama") instanceof OllamaEmbedder);
|
|
224
|
+
assert.ok(createEmbedderByProvider("openai") instanceof OpenAIEmbedder);
|
|
225
|
+
assert.ok(createEmbedderByProvider("LOCAL") instanceof LocalEmbedder);
|
|
226
|
+
assert.throws(() => createEmbedderByProvider("watson"), /Unknown embedding provider/);
|
|
227
|
+
});
|