@modusensus/dsh-mneme 0.7.6 → 0.7.7

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
@@ -2,6 +2,11 @@ name: Publish to npm
2
2
 
3
3
  # 发布路径:registry.npmjs.org 在本机云服务器被出口 SNI 过滤 + 17897 隧道不稳定,
4
4
  # 改由 GitHub runner 发布(不依赖本机出网)。打 v* tag 自动触发,或 workflow_dispatch 手动。
5
+ #
6
+ # ⚠️ 版本号机制(血的教训):
7
+ # root package.json 在 git 里永远停在 0.7.2,真实版本号在 dsh-mneme/package.json。
8
+ # npm 在跑 prepublishOnly 之前就已加载 manifest,脚本里改 root 版本不生效,
9
+ # 会把 root 的旧版本(0.7.2)发出去。必须在 npm publish 之前显式同步 root 版本。
5
10
 
6
11
  on:
7
12
  push:
@@ -23,15 +28,30 @@ jobs:
23
28
  node-version: 24
24
29
  registry-url: https://registry.npmjs.org/
25
30
 
26
- # npm publish 必须从仓库根跑(根 package.json main → ./dsh-mneme/lib/index.js)。
27
- # prepublishOnly 会把 dsh-mneme/package.json 的版本写回根 package.json,
28
- # 所以发出的版本永远跟随 dsh-mneme/ 子目录版本号。
29
- - name: Publish @modusensus/dsh-mneme
30
- run: npm publish
31
+ - name: Registry current state (diagnostic)
32
+ run: |
33
+ npm view @modusensus/dsh-mneme versions --json || true
34
+ npm view @modusensus/dsh-mneme time --json || true
35
+
36
+ # 关键:先同步 root 版本 → 再 publish(prepublishOnly 改版本不可靠)
37
+ - name: Sync root version from dsh-mneme
38
+ run: |
39
+ V="$(node -p "require('./dsh-mneme/package.json').version")"
40
+ echo "Syncing root package.json to v${V}"
41
+ node -e "const fs=require('fs');const v=process.argv[1];const p=JSON.parse(fs.readFileSync('./package.json','utf8'));p.version=v;fs.writeFileSync('./package.json',JSON.stringify(p,null,2)+'\n')" "$V"
42
+ node -p "console.log('root now:', require('./package.json').version)"
43
+
44
+ - name: Publish @modusensus/dsh-mneme (skip if exists)
45
+ run: |
46
+ V="$(node -p "require('./dsh-mneme/package.json').version")"
47
+ if npm view "@modusensus/dsh-mneme@${V}" version >/dev/null 2>&1; then
48
+ echo "v${V} already published on registry — skipping"
49
+ else
50
+ npm publish
51
+ fi
31
52
  env:
32
53
  NODE_AUTH_TOKEN: ${{ secrets.NPM_TOKEN }}
33
54
 
34
- # 发布后自检:查 registry 上刚发的版本是否可读
35
55
  - name: Verify published version
36
56
  run: |
37
57
  V="$(node -p "require('./dsh-mneme/package.json').version")"
package/CHANGELOG.md CHANGED
@@ -1,6 +1,6 @@
1
1
  # Changelog
2
2
 
3
- > **完整版本历史见 [dsh-mneme/CHANGELOG.md](dsh-mneme/CHANGELOG.md)**(正式版本正源,0.3.8 → 0.7.6)。以下为仓库早期开发记录(0.1.0–0.2.x,2026-08-13~14,已归档)。
3
+ > **完整版本历史见 [dsh-mneme/CHANGELOG.md](dsh-mneme/CHANGELOG.md)**(正式版本正源,0.3.8 → 0.7.7)。以下为仓库早期开发记录(0.1.0–0.2.x,2026-08-13~14,已归档)。
4
4
 
5
5
  All notable changes to dsh-mneme are documented here.
6
6
 
package/README.md CHANGED
@@ -5,14 +5,14 @@
5
5
  <h1 align="center">dsh-mneme</h1>
6
6
 
7
7
  <p align="center">
8
- <a href="https://www.npmjs.com/package/@modusensus/dsh-mneme"><img src="https://img.shields.io/npm/v/@modusensus/dsh-mneme?color=blue&label=npm" alt="npm version"></a>
9
- <a href="LICENSE"><img src="https://img.shields.io/badge/license-MIT-green" alt="license"></a>
8
+ <a href="https://www.npmjs.com/package/@modusensus/dsh-mneme"><img src="https://img.shields.io/npm/v/@modusensus/dsh-mneme?style=flat-square&color=3E63DD&label=npm" alt="npm version"></a>
9
+ <a href="https://www.npmjs.com/package/@modusensus/dsh-mneme"><img src="https://img.shields.io/npm/dm/@modusensus/dsh-mneme?style=flat-square&color=3E63DD&label=downloads" alt="npm downloads"></a>
10
+ <a href="LICENSE"><img src="https://img.shields.io/badge/license-MIT-3E63DD?style=flat-square" alt="license"></a>
11
+ <a href="https://github.com/modusensus/dsh-mneme/actions"><img src="https://img.shields.io/github/actions/workflow/status/modusensus/dsh-mneme/test.yml?style=flat-square&label=CI" alt="CI"></a>
12
+ <a href="https://nodejs.org"><img src="https://img.shields.io/badge/node-24%2B-3E63DD?style=flat-square&logo=nodedotjs&logoColor=white" alt="node"></a>
13
+ <a href="https://github.com/modusensus/dsh-mneme"><img src="https://img.shields.io/badge/tests-810%20passed-3E63DD?style=flat-square" alt="tests"></a>
14
+ <a href="https://codecov.io/gh/modusensus/dsh-mneme"><img src="https://img.shields.io/codecov/c/github/modusensus/dsh-mneme/main?style=flat-square" alt="coverage"></a>
10
15
  <a href="https://github.com/awesome-dsh-plugin/awesome-dsh-plugin"><img src="https://awesome-dsh-plugin.com/badge.svg" alt="Awesome"></a>
11
- <a href="https://github.com/modusensus/dsh-mneme/actions"><img src="https://img.shields.io/github/actions/workflow/status/modusensus/dsh-mneme/test.yml" alt="CI"></a>
12
- <a href="https://nodejs.org"><img src="https://img.shields.io/badge/node-24%2B-blue" alt="node"></a>
13
- <a href="https://github.com/modusensus/dsh-mneme"><img src="https://img.shields.io/badge/tests-801%20passed-success" alt="tests"></a>
14
- <a href="https://www.npmjs.com/package/@modusensus/dsh-mneme"><img src="https://img.shields.io/npm/dm/@modusensus/dsh-mneme?color=blue&label=downloads" alt="npm downloads"></a>
15
- <a href="https://codecov.io/gh/modusensus/dsh-mneme"><img src="https://img.shields.io/codecov/c/github/modusensus/dsh-mneme/main" alt="coverage"></a>
16
16
  </p>
17
17
 
18
18
  <p align="center"><strong><a href="#中文">中文</a> | <a href="#english">English</a></strong></p>
@@ -109,6 +109,7 @@ dsh web
109
109
  | **v0.7.4** | issue #40 记忆花括号转义 + issue #41 记忆窗口关闭按钮重叠修复 | ✅ |
110
110
  | **v0.7.5** | 分层记忆类型 user/fact + Web 总览视图 + stats 端点 | ✅ |
111
111
  | **v0.7.6** | issue #48 修复:截断/前缀 id 也能精确操作(统一 resolveMemoryId)+ client.js 改 src 正源 | ✅ |
112
+ | **v0.7.7** | issue #23 图谱回填:sleep 批量实体抽取 phase + node:sqlite 兼容修复 | ✅ |
112
113
  | **v0.8.0** | 图谱增强:兴趣漂移可视化 + scope 隔离(issue #17)+ 跨 workspace 共享 | 🚧 计划中(9 月末) |
113
114
 
114
115
  ## 🧪 本地开发
@@ -116,7 +117,7 @@ dsh web
116
117
  ```bash
117
118
  cd dsh-mneme
118
119
  npm install
119
- npm test # 801 个测试
120
+ npm test # 810 个测试
120
121
  npm run stress # 三轴线压测
121
122
  npm run sync # src → lib 同步
122
123
  ```
@@ -223,7 +224,7 @@ Works out of the box. Enable these as needed:
223
224
  ```bash
224
225
  cd dsh-mneme
225
226
  npm install
226
- npm test # 801 tests
227
+ npm test # 810 tests
227
228
  npm run stress # three-axis stress test
228
229
  npm run sync # src → lib sync
229
230
  ```
package/SECURITY.md CHANGED
@@ -56,7 +56,7 @@ The following security features are implemented and maintained in the project:
56
56
 
57
57
  ### Please DO
58
58
 
59
- 1. **Email** `guanqishi26@gmail.com` (or open a **private security advisory** via [GitHub Security Advisories](https://github.com/modusensus/dsh-mneme/security/advisories))
59
+ 1. **Email** `work@modusensus.space` (or open a **private security advisory** via [GitHub Security Advisories](https://github.com/modusensus/dsh-mneme/security/advisories))
60
60
  2. Include:
61
61
  - A clear description of the vulnerability
62
62
  - Steps to reproduce (minimal test case preferred)
@@ -392,7 +392,7 @@ This project is licensed under the **MIT License**. See [LICENSE](https://github
392
392
 
393
393
  ### 请这样做
394
394
 
395
- 1. **发送邮件**至 `guanqishi26@gmail.com`(或通过 [GitHub 私有安全公告](https://github.com/modusensus/dsh-mneme/security/advisories) 提交)
395
+ 1. **发送邮件**至 `work@modusensus.space`(或通过 [GitHub 私有安全公告](https://github.com/modusensus/dsh-mneme/security/advisories) 提交)
396
396
  2. 邮件内容请包含:
397
397
  - 漏洞的清晰描述
398
398
  - 复现步骤(优先提供最小测试用例)
@@ -671,4 +671,4 @@ dsh-mneme:
671
671
  ---
672
672
 
673
673
  *Last updated: 2026-08-28*
674
- *Policy version: 2.2*
674
+ *Policy version: 2.2*
@@ -1,5 +1,18 @@
1
1
  # Changelog
2
2
 
3
+ ## [0.7.7] - 2026-09-05
4
+
5
+ ### 🆕 issue #23:sleep 批量实体抽取回填实体图谱
6
+
7
+ - **背景**:写路径抽取(index.js)只有 `entityExtractionEnabled` 开启才触发——每次写入一次 LLM 调用,是刻意的成本取舍——所以默认安装下记忆从不累积实体,这正是 issue #23 报的"实体图谱面板一片空白"(用户明明有很多记忆)。
8
+ - **新增 sleep 批量抽取 phase**:默认关 `sleepEntityExtractionEnabled`,开睡循环时按**最老优先**把没有实体属性的记忆逐条过 `extractEntities`(每轮上限 `sleepEntityExtractionMaxPerRun` 默认 20)。
9
+ - **下沉为有界 SQL 查询**(kimi 复验意见 #2):新增 `store.listForEntityExtraction({limit, offset})`,`WHERE` 只留行级条件(未归档/未遗忘/非 summary/内容非空/`metadata.entity_extracted_at` 为空),`ORDER BY created_at LIMIT ? OFFSET ?` 分页取最老候选;实体是否已存在是跨表检查(`getAttrsByMemory`),由 JS 在每页上过滤。不再 `service.all()` 全表加载。
10
+ - **幂等防重**(kimi 意见 #3):抽取前先 stamp `metadata.pending_extracted_at`,成功后替换为 `entity_extracted_at`,失败清除 pending——一条记忆不会被并发/崩溃重复抽取,失败的下轮重试。
11
+ - **metadata 合并不覆盖**(kimi 意见 #4):`store.setMemoryMetadata` 改为 merge 语义,打实体时间戳不会抹掉其他路径刚写入的 metadata 字段。
12
+ - **失败不阻断**(kimi 意见 #5):单条抽取失败只跳过该条、记入 `failed` 计数,整轮状态由 `deriveStatus` 正确折叠 `failed`——一次 LLM 抖动不会 abort 整个 sleep 周期。
13
+ - **node:sqlite 兼容修复**(复验时抓到的实现 bug):wxbot 初版用 better-sqlite3 的 `.pluck()`(node:sqlite 不存在),改为 `.all().map(row => getById(row.id))`;`listForEntityExtraction` 的 `forgotten IS NULL` 条件与 `save` 硬编码写入的 `forgotten=0` 永不匹配导致查询恒空,修正为 `(forgotten = 0 OR forgotten IS NULL)`(与 archived 同构)。
14
+ - 新增 9 个用例(禁用/跳过、stamp 不重复、无实体也 stamp、backfill、失败重试、metadata merge #4、pending 清除 #3、failed 状态折叠 #5、分页最老优先 #2),全套 **810 通过**。
15
+
3
16
  ## [0.7.6] - 2026-09-02
4
17
 
5
18
  ### 🐛 issue #48:截断的短 id 也能精确操作
@@ -5,7 +5,7 @@
5
5
  [![npm version](https://img.shields.io/npm/v/@modusensus/dsh-mneme?color=blue&label=npm)](https://www.npmjs.com/package/@modusensus/dsh-mneme)
6
6
  [![license](https://img.shields.io/badge/license-MIT-green)](LICENSE)
7
7
  [![Awesome](https://awesome-dsh-plugin.com/badge.svg)](https://github.com/awesome-dsh-plugin/awesome-dsh-plugin)
8
- [![tests](https://img.shields.io/badge/tests-801%20passed-success)](https://github.com/modusensus/dsh-mneme)
8
+ [![tests](https://img.shields.io/badge/tests-810%20passed-success)](https://github.com/modusensus/dsh-mneme)
9
9
  [![CI](https://img.shields.io/github/actions/workflow/status/modusensus/dsh-mneme/test.yml)](https://github.com/modusensus/dsh-mneme/actions)
10
10
  [![node](https://img.shields.io/badge/node-24%2B-blue)](https://nodejs.org)
11
11
  [![npm downloads](https://img.shields.io/npm/dm/@modusensus/dsh-mneme?color=blue&label=downloads)](https://www.npmjs.com/package/@modusensus/dsh-mneme)
@@ -241,6 +241,7 @@ v0.3.0 起新增**记忆基因**层:从记忆里抽取**命名实体**、**带
241
241
 
242
242
  | 版本 | 亮点 |
243
243
  |------|------|
244
+ | **v0.7.7** | issue #23 实体图谱回填:sleep 批量实体抽取 phase(`sleepEntityExtractionEnabled` 默认关;最老优先、SQL LIMIT/OFFSET 分页下沉为有界查询不整表扫描;`pending_extracted_at` 幂等防重、成功/失败清除;metadata 合并不覆盖其他路径写入);kimi-k2.7-code 复验 + node:sqlite 兼容修复(pluck→all+map、`forgotten=0` 查询条件);810 测试全绿 |
244
245
  | **v0.7.6** | issue #48 修复:`memory_update`/`memory_delete`/`memory_forget`/`memory_archive` 支持截断/前缀短 id(新增 `service.resolveMemoryId`:精确命中优先 + 唯一前缀解析 + 多命中拒绝列出候选 + `memory_delete` 未命中幂等补 `logger.warn`;纯通配符/空白兜底);Web bundle `client.js` 改 src 正源;801 测试全绿 |
245
246
  | **v0.7.5** | 分层记忆类型:新增 `user`(用户画像)/`fact`(原子事实)轻量记忆类型(单表 `type` 扩展,不动 schema)+ Web 面板「总览」视图(记忆分层卡片 + 用户画像卡 + 类型分布 + 近 7 天趋势)+ `/api/dsh-mneme/stats` 统计端点;kimi-k2.7-code 复验(days 整数化等);790 测试全绿 |
246
247
  | **v0.7.4** | issue #40 修复:记忆内容含 `{{...}}` 模板语法时整轮崩溃(注入边界 run-based 花括号转义 `{{a}}`→`{\{a\}\}`,奇数连续如 `{{{a}}}` 也不残留字面 `{{`;新增 `escapePromptVariables` 配置默认开);issue #41 修复:记忆窗口关闭按钮与宿主窗口控制按钮重叠无法点击(顶栏左对齐,关闭按钮离开右上角宿主控制区);782 测试全绿 |
@@ -296,6 +297,7 @@ v0.3.0 起新增**记忆基因**层:从记忆里抽取**命名实体**、**带
296
297
  | **v0.7.3** | ✅ 完成 | issue #38 新功能 | 左下角入口按钮可选开关 `showSidebarTrigger`(默认开,settings-over-config);Web 面板设置一键关闭,与 dsh-cost-meter 等 footer 插件冲突可隐藏按钮、记忆库标签不受影响;776 测试全绿 |
297
298
  | **v0.7.4** | ✅ 完成 | issue #40 + #41 修复 | 注入边界 run-based 花括号转义(`{{a}}`→`{\{a\}\}`、奇数连续如 `{{{a}}}` 不残留字面,`escapePromptVariables` 默认开)+ 记忆窗口顶栏左对齐、关闭按钮避开宿主窗口控制按钮区;782 测试全绿 |
298
299
  | **v0.7.5** | ✅ 完成 | 分层记忆类型 + 总览视图 | 借鉴 meow-memory 分层概念、贴合单表架构:新增 `user`(用户画像)/`fact`(原子事实)类型,注入/镜像/梦境/质量过滤全链路打通;Web 面板「总览」视图(分层卡片 + 用户画像卡 + 类型分布 + 近 7 天趋势);`/api/dsh-mneme/stats` 端点;kimi-k2.7-code 复验;790 测试全绿 |
300
+ | **v0.7.7** | ✅ 完成 | issue #23 图谱回填 | sleep 批量实体抽取 phase:默认关 `sleepEntityExtractionEnabled`,按最老优先、SQL LIMIT/OFFSET 分页(下沉为有界查询,不再整表扫描)批量抽取未打标记忆的实体(修复 issue #23 实体图谱空白);`pending_extracted_at` 幂等防重、成功/失败清除,metadata 合并不覆盖;kimi-k2.7-code 复验 + node:sqlite 兼容修复(pluck→all+map、`forgotten=0` 查询条件);810 测试全绿 |
299
301
  | **v0.7.6** | ✅ 完成 | issue #48 修复 | 四工具统一 `service.resolveMemoryId`:截断/前缀短 id 也能精确操作(精确命中优先、唯一前缀解析、多命中拒绝并列出候选、`memory_delete` 未命中幂等返回 + `logger.warn` 留痕);Web bundle `client.js` 改 src 正源;801 测试全绿 |
300
302
  | **v0.8.0** | 🚧 计划中(9 月末) | 图谱增强 | 兴趣漂移可视化 + scope 隔离(issue #17)+ 跨 workspace 记忆共享 + 更多 heat 信号 |
301
303
 
@@ -462,7 +464,7 @@ src/
462
464
  ├── client.js # Web 面板 bundle(ModuleLoader 自注册;v0.7.6 起 src 正源)
463
465
  └── index.js # 插件接线
464
466
  lib/ # src 的同步分发产物(npm run sync,prepack 自动执行;无手写例外)
465
- test/ # 801 个 node:test 测试(含审计与三轴线压测不变量)
467
+ test/ # 810 个 node:test 测试(含审计与三轴线压测不变量)
466
468
  scripts/ # e2e-dsh.js 端到端演示 · stress-dsh.js 三轴线压测 · sync-lib.js 同步 · benchmark-recall.js 召回基准
467
469
  ```
468
470
 
@@ -471,7 +473,7 @@ scripts/ # e2e-dsh.js 端到端演示 · stress-dsh.js 三轴线压
471
473
  ```bash
472
474
  cd dsh-mneme
473
475
  npm install # 安装 peer 依赖(以 devDependencies 形式,用于本地测试)
474
- npm test # 运行 801 个测试
476
+ npm test # 运行 810 个测试
475
477
  npm run stress # 三轴线压测:长会话检索 / 冲突仲裁 / 多 Agent 并发(离线 mock LLM)
476
478
  npm run sync # 把 src/ 同步到 lib/(发布时由 prepack 钩子自动执行)
477
479
  ```
@@ -274,6 +274,15 @@ export const Config = z.object({
274
274
  z.const("high"),
275
275
  z.const("none")
276
276
  ]).default("none"),
277
+ // Batch entity extraction during sleep (issue #23). The write-path extractor
278
+ // only fires when entityExtractionEnabled is on (an LLM call per write);
279
+ // this additive phase backfills entities/attrs/relations for memories that
280
+ // never went through it, so stores that leave the write-path extractor off
281
+ // still accumulate an ego graph as long as sleep runs. On by default (it is
282
+ // a no-op until a sleep cycle fires), capped per run to bound token spend.
283
+ sleepEntityExtractionEnabled: z.boolean().default(true),
284
+ // Max memories entity-extracted per sleep run (oldest un-extracted first).
285
+ sleepEntityExtractionMaxPerRun: z.natural().min(1).max(100).default(20),
277
286
 
278
287
  // --- epistemic trust: memory source credibility (v0.4.5) -----------------
279
288
  // Distinguish memories by source: observation (measured / witnessed),
@@ -19,6 +19,7 @@ import { validateDecisions, applyDecisions } from "./decisions.js";
19
19
  import { findPotentialConflicts } from "./clustering.js";
20
20
  import { buildReceipt } from "../dream.js";
21
21
  import { computeHeat } from "../heat.js";
22
+ import { extractEntities } from "../entities/extractor.js";
22
23
 
23
24
  const SUMMARY_MAX = 120;
24
25
  // Conflict similarity threshold per strictness level (v0.4.0):
@@ -396,6 +397,123 @@ function phaseRelations(service, config, logger, runId, signal = null) {
396
397
  };
397
398
  }
398
399
 
400
+ /**
401
+ * Phase 4.5 — batch entity extraction. The write-path extractor (index.js)
402
+ * only fires when entityExtractionEnabled is on — one LLM call per write, a
403
+ * deliberate cost decision — so default installs never accumulate entities,
404
+ * which is exactly why the ego-graph panel (issue #23) renders blank for users
405
+ * with plenty of memories. This phase backfills the entity graph in bulk:
406
+ * memories that carry no entity attrs yet are passed through extractEntities
407
+ * one at a time (oldest first, capped per run). Write-path stays untouched —
408
+ * this is an additive channel for sleep users. Fail-safe per memory: one bad
409
+ * extract never aborts the phase or the cycle.
410
+ */
411
+ async function phaseEntityExtraction(ctx, service, config, logger, runId, signal = null) {
412
+ if (config.sleepEntityExtractionEnabled !== true) {
413
+ return { status: "skipped", reason: "disabled" };
414
+ }
415
+ const route = resolveSleepRoute(ctx, config, logger);
416
+ if (!route) return { status: "skipped", reason: "no llm route" };
417
+ const maxPerRun = config.sleepEntityExtractionMaxPerRun ?? 20;
418
+
419
+ // Oldest un-extracted first. The store returns bounded pages via SQL (no
420
+ // O(N) full-table scan); JS pages through offsets and only pays the
421
+ // getAttrsByMemory cross-table check on each page, stopping once it has
422
+ // maxPerRun un-extracted memories or the store is exhausted. Every memory
423
+ // this phase touches gets stamped entity_extracted_at (successful or
424
+ // entity-less extracts alike) so a text with no extractable entities is not
425
+ // re-queued forever; failures are NOT stamped, so a transient LLM hiccup
426
+ // retries next cycle.
427
+ const candidates = [];
428
+ for (let offset = 0; candidates.length < maxPerRun; offset += 100) {
429
+ const page = service.listForEntityExtraction({ limit: 100, offset });
430
+ if (page.length === 0) break;
431
+ candidates.push(...page.filter((m) => (service.getAttrsByMemory?.(m.id) ?? []).length === 0));
432
+ }
433
+ candidates.length = Math.min(candidates.length, maxPerRun);
434
+ if (candidates.length === 0) return { status: "skipped", reason: "no memories to extract" };
435
+ if (signal?.aborted) return { status: "aborted", reason: "user activity" };
436
+
437
+ // extractEntities expects callLLM(messages, options) → text; adapt sleep's
438
+ // streamText + route resolution (same precedence as the other phases).
439
+ const callLLM = async (messages) => {
440
+ const r = resolveSleepRoute(ctx, config, logger);
441
+ if (!r) return undefined;
442
+ return streamText(ctx, {
443
+ ...r,
444
+ purpose: "sleep-entity-extract",
445
+ maxTokens: 4096,
446
+ ...(config.sleepReasoningEffort && config.sleepReasoningEffort !== "none"
447
+ ? { reasoningEffort: config.sleepReasoningEffort }
448
+ : {}),
449
+ messages
450
+ });
451
+ };
452
+
453
+ let extracted = 0;
454
+ let failed = 0;
455
+ let aborted = false;
456
+ const extractedIds = [];
457
+ for (const m of candidates) {
458
+ if (signal?.aborted) {
459
+ aborted = true;
460
+ break;
461
+ }
462
+ const now = new Date().toISOString();
463
+ try {
464
+ // Stamp a pending marker BEFORE the LLM call so a crash mid-extract (the
465
+ // stamp and the entity writes are not one transaction) cannot re-queue
466
+ // this memory while we are already working it. Cleared on outcome.
467
+ service.setMemoryMetadata?.(m.id, { pending_extracted_at: now });
468
+ } catch (error) {
469
+ logger?.warn?.(`dsh-mneme sleep: failed to stamp pending_extracted_at for ${m.id}: ${String(error)}`);
470
+ failed++;
471
+ continue;
472
+ }
473
+ try {
474
+ const result = await extractEntities(m, { store: service, config, callLLM, logger });
475
+ if (result?.ok) {
476
+ extracted++;
477
+ extractedIds.push(m.id);
478
+ // Stamp done regardless of whether the LLM found entities — an empty
479
+ // extract is still a definitive answer for this memory.
480
+ try {
481
+ service.setMemoryMetadata?.(m.id, { entity_extracted_at: now, pending_extracted_at: null });
482
+ } catch (error) {
483
+ logger?.warn?.(`dsh-mneme sleep: failed to stamp entity_extracted_at for ${m.id}: ${String(error)}`);
484
+ }
485
+ } else {
486
+ failed++;
487
+ logger?.warn?.(`dsh-mneme sleep: entity extraction failed for ${m.id}: ${result?.error ?? "unknown"}`);
488
+ try {
489
+ service.setMemoryMetadata?.(m.id, { pending_extracted_at: null });
490
+ } catch (error) {
491
+ logger?.warn?.(`dsh-mneme sleep: failed to clear pending_extracted_at for ${m.id}: ${String(error)}`);
492
+ }
493
+ }
494
+ } catch (error) {
495
+ failed++;
496
+ logger?.warn?.(`dsh-mneme sleep: entity extraction threw for ${m.id}: ${String(error)}`);
497
+ try {
498
+ service.setMemoryMetadata?.(m.id, { pending_extracted_at: null });
499
+ } catch (err) {
500
+ logger?.warn?.(`dsh-mneme sleep: failed to clear pending_extracted_at for ${m.id}: ${String(err)}`);
501
+ }
502
+ }
503
+ }
504
+ return {
505
+ // Any success counts as ok (failures are surfaced via detail.failed + warn,
506
+ // matching phaseConflicts); all-failed reports failed so deriveStatus can
507
+ // reflect a broken route without aborting the other phases.
508
+ status: aborted ? "aborted" : extracted > 0 ? "ok" : failed > 0 ? "failed" : "noop",
509
+ scanned: candidates.length,
510
+ extracted,
511
+ failed,
512
+ aborted,
513
+ extractedIds
514
+ };
515
+ }
516
+
399
517
  // ---------------------------------------------------------------- run
400
518
 
401
519
  function deriveStatus(phases) {
@@ -429,6 +547,9 @@ export async function runSleep(ctx, service, config, logger, semantic = null, si
429
547
  await attempt("conflicts", () => phaseConflicts(ctx, service, config, logger, runId, semantic, signal));
430
548
  await attempt("demotion", () => phaseDemotion(service, config, logger, runId, signal));
431
549
  await attempt("patterns", () => phasePatterns(ctx, service, config, logger, runId, signal));
550
+ // entity-extraction runs before relation completion so freshly minted
551
+ // entities get their orphan relations completed in the same cycle.
552
+ await attempt("entity-extraction", () => phaseEntityExtraction(ctx, service, config, logger, runId, signal));
432
553
  await attempt("relations", () => phaseRelations(service, config, logger, runId, signal));
433
554
 
434
555
  const status = deriveStatus(phases);
@@ -1608,6 +1608,7 @@ export function createService({ store, mirror, config, onWrite, logger, settings
1608
1608
  embeddedCount: () => store.embeddedCount(),
1609
1609
  list: (o) => store.list(o),
1610
1610
  all: () => store.all(),
1611
+ listForEntityExtraction: (opts) => store.listForEntityExtraction(opts),
1611
1612
  count: (type, opts) => store.count(type, opts),
1612
1613
  stats: (opts) => store.stats(opts),
1613
1614
  getById: (id) => store.getById(id),
@@ -1862,9 +1863,11 @@ export function createService({ store, mirror, config, onWrite, logger, settings
1862
1863
  applyMemoryTags: (memoryId, tags) => store.setMemoryTags(memoryId, tags),
1863
1864
  saveAttr: (r) => store.saveAttr(r),
1864
1865
  createEntity: (r) => store.createEntity(r),
1866
+ updateEntity: (id, patch) => store.updateEntity(id, patch),
1865
1867
  findEntityByName: (n) => store.findEntityByName(n),
1866
1868
  findEntityById: (id) => store.findEntityById(id),
1867
1869
  getAttrsByMemory: (id) => store.getAttrsByMemory(id),
1870
+ setMemoryMetadata: (id, metadata) => store.setMemoryMetadata(id, metadata),
1868
1871
  getCurrentAttrs: (id) => store.getCurrentAttrs(id),
1869
1872
  migrateAttrsToMemory: (fromId, toId, now) => store.migrateAttrsToMemory(fromId, toId, now)
1870
1873
  };
@@ -20,6 +20,7 @@ CREATE TABLE IF NOT EXISTS memories (
20
20
  epistemic_status TEXT NOT NULL DEFAULT 'subjective',
21
21
  last_accessed_at TEXT,
22
22
  _full_content TEXT,
23
+ metadata TEXT, -- JSON: free-form extras (e.g. sleep entity_extracted_at)
23
24
  created_at TEXT NOT NULL,
24
25
  updated_at TEXT NOT NULL
25
26
  );
@@ -314,6 +315,14 @@ function parseTags(raw) {
314
315
 
315
316
  function toRow(row) {
316
317
  if (!row) return undefined;
318
+ let metadata;
319
+ if (row.metadata != null) {
320
+ try {
321
+ metadata = JSON.parse(row.metadata);
322
+ } catch {
323
+ metadata = row.metadata;
324
+ }
325
+ }
317
326
  return {
318
327
  id: row.id,
319
328
  type: row.type,
@@ -329,6 +338,7 @@ function toRow(row) {
329
338
  content_history: parseJsonArray(row.content_history),
330
339
  quality_score: row.quality_score !== null && row.quality_score !== undefined ? Number(row.quality_score) : undefined,
331
340
  epistemic_status: row.epistemic_status ?? "subjective",
341
+ metadata,
332
342
  created_at: row.created_at,
333
343
  updated_at: row.updated_at,
334
344
  last_accessed_at: row.last_accessed_at ?? undefined,
@@ -589,6 +599,7 @@ export function createStore(path) {
589
599
  addColumn("memories", "content_history", "ALTER TABLE memories ADD COLUMN content_history TEXT");
590
600
  addColumn("memories", "quality_score", "ALTER TABLE memories ADD COLUMN quality_score REAL");
591
601
  addColumn("memories", "session_id", "ALTER TABLE memories ADD COLUMN session_id TEXT");
602
+ addColumn("memories", "metadata", "ALTER TABLE memories ADD COLUMN metadata TEXT");
592
603
 
593
604
  // Composite index for session-lifecycle queries (dispose/restore/listBySession).
594
605
  // Created post-migration, NOT in SCHEMA: on legacy DBs both columns arrive via
@@ -834,6 +845,50 @@ export function createStore(path) {
834
845
  });
835
846
  }
836
847
 
848
+ /**
849
+ * Bounded scan for sleep's entity-extraction phase: oldest memories without
850
+ * an entity_extracted_at stamp (row-level filters only — attr presence is a
851
+ * cross-table check, so the caller filters the returned page via
852
+ * getAttrsByMemory). Caller pages with {limit, offset}; a full-table scan +
853
+ * JS filter would be O(N) per sleep cycle.
854
+ */
855
+ function listForEntityExtraction({ limit = 50, offset = 0 } = {}) {
856
+ // node:sqlite has no StatementSync#pluck; all() returns row objects.
857
+ return db
858
+ .prepare(`
859
+ SELECT id FROM memories
860
+ WHERE (archived = 0 OR archived IS NULL)
861
+ AND session_disposed_at IS NULL
862
+ AND (forgotten = 0 OR forgotten IS NULL)
863
+ AND type != 'summary'
864
+ AND content IS NOT NULL AND content != ''
865
+ AND (metadata IS NULL OR json_extract(metadata, '$.entity_extracted_at') IS NULL)
866
+ ORDER BY created_at ASC
867
+ LIMIT ? OFFSET ?
868
+ `)
869
+ .all(limit, offset)
870
+ .map((row) => getById(row.id));
871
+ }
872
+
873
+ /**
874
+ * Lightweight metadata-only update (used by sleep's batch entity extraction
875
+ * to stamp `entity_extracted_at` without disturbing title/content/embedding
876
+ * or the normal update semantics). Does not bump updated_at — metadata
877
+ * stamps are bookkeeping, not content, so they must not fake freshness.
878
+ * Incoming fields are MERGED into the existing metadata object so a stamp
879
+ * never clobbers metadata another path just wrote.
880
+ */
881
+ function setMemoryMetadata(id, metadata) {
882
+ const existing = getById(id);
883
+ if (!existing) throw new Error(`memory not found: ${id}`);
884
+ const patch = typeof metadata === "string"
885
+ ? JSON.parse(metadata)
886
+ : (metadata ?? {});
887
+ const merged = { ...(existing.metadata ?? {}), ...patch };
888
+ db.prepare("UPDATE memories SET metadata = ? WHERE id = ?").run(JSON.stringify(merged), id);
889
+ return getById(id);
890
+ }
891
+
837
892
  /**
838
893
  * Atomic compare-and-set update: applies `patch` only when the row still
839
894
  * carries `expectedUpdatedAt` (the version token read by the caller). Returns
@@ -2234,6 +2289,8 @@ export function createStore(path) {
2234
2289
  listByIdPrefix,
2235
2290
  save,
2236
2291
  update,
2292
+ listForEntityExtraction,
2293
+ setMemoryMetadata,
2237
2294
  compareAndUpdate,
2238
2295
  remove,
2239
2296
  setForget,
@@ -1,12 +1,12 @@
1
1
  {
2
2
  "name": "@modusensus/dsh-mneme",
3
- "version": "0.7.6",
3
+ "version": "0.7.7",
4
4
  "lockfileVersion": 3,
5
5
  "requires": true,
6
6
  "packages": {
7
7
  "": {
8
8
  "name": "@modusensus/dsh-mneme",
9
- "version": "0.7.6",
9
+ "version": "0.7.7",
10
10
  "license": "MIT",
11
11
  "dependencies": {
12
12
  "@huggingface/transformers": "^4.2.0"
@@ -1,7 +1,7 @@
1
1
  {
2
2
  "name": "@modusensus/dsh-mneme",
3
3
  "description": "Cross-session memory plugin for DeepSeek Harness with autoDream consolidation: SQLite store, Markdown mirrors, 7 model tools, automatic injection, session summarization, user profile/rules, custom slash commands, vector (semantic) search, and a Web GUI panel",
4
- "version": "0.7.6",
4
+ "version": "0.7.7",
5
5
  "license": "MIT",
6
6
  "repository": {
7
7
  "type": "git",
@@ -274,6 +274,15 @@ export const Config = z.object({
274
274
  z.const("high"),
275
275
  z.const("none")
276
276
  ]).default("none"),
277
+ // Batch entity extraction during sleep (issue #23). The write-path extractor
278
+ // only fires when entityExtractionEnabled is on (an LLM call per write);
279
+ // this additive phase backfills entities/attrs/relations for memories that
280
+ // never went through it, so stores that leave the write-path extractor off
281
+ // still accumulate an ego graph as long as sleep runs. On by default (it is
282
+ // a no-op until a sleep cycle fires), capped per run to bound token spend.
283
+ sleepEntityExtractionEnabled: z.boolean().default(true),
284
+ // Max memories entity-extracted per sleep run (oldest un-extracted first).
285
+ sleepEntityExtractionMaxPerRun: z.natural().min(1).max(100).default(20),
277
286
 
278
287
  // --- epistemic trust: memory source credibility (v0.4.5) -----------------
279
288
  // Distinguish memories by source: observation (measured / witnessed),
@@ -19,6 +19,7 @@ import { validateDecisions, applyDecisions } from "./decisions.js";
19
19
  import { findPotentialConflicts } from "./clustering.js";
20
20
  import { buildReceipt } from "../dream.js";
21
21
  import { computeHeat } from "../heat.js";
22
+ import { extractEntities } from "../entities/extractor.js";
22
23
 
23
24
  const SUMMARY_MAX = 120;
24
25
  // Conflict similarity threshold per strictness level (v0.4.0):
@@ -396,6 +397,123 @@ function phaseRelations(service, config, logger, runId, signal = null) {
396
397
  };
397
398
  }
398
399
 
400
+ /**
401
+ * Phase 4.5 — batch entity extraction. The write-path extractor (index.js)
402
+ * only fires when entityExtractionEnabled is on — one LLM call per write, a
403
+ * deliberate cost decision — so default installs never accumulate entities,
404
+ * which is exactly why the ego-graph panel (issue #23) renders blank for users
405
+ * with plenty of memories. This phase backfills the entity graph in bulk:
406
+ * memories that carry no entity attrs yet are passed through extractEntities
407
+ * one at a time (oldest first, capped per run). Write-path stays untouched —
408
+ * this is an additive channel for sleep users. Fail-safe per memory: one bad
409
+ * extract never aborts the phase or the cycle.
410
+ */
411
+ async function phaseEntityExtraction(ctx, service, config, logger, runId, signal = null) {
412
+ if (config.sleepEntityExtractionEnabled !== true) {
413
+ return { status: "skipped", reason: "disabled" };
414
+ }
415
+ const route = resolveSleepRoute(ctx, config, logger);
416
+ if (!route) return { status: "skipped", reason: "no llm route" };
417
+ const maxPerRun = config.sleepEntityExtractionMaxPerRun ?? 20;
418
+
419
+ // Oldest un-extracted first. The store returns bounded pages via SQL (no
420
+ // O(N) full-table scan); JS pages through offsets and only pays the
421
+ // getAttrsByMemory cross-table check on each page, stopping once it has
422
+ // maxPerRun un-extracted memories or the store is exhausted. Every memory
423
+ // this phase touches gets stamped entity_extracted_at (successful or
424
+ // entity-less extracts alike) so a text with no extractable entities is not
425
+ // re-queued forever; failures are NOT stamped, so a transient LLM hiccup
426
+ // retries next cycle.
427
+ const candidates = [];
428
+ for (let offset = 0; candidates.length < maxPerRun; offset += 100) {
429
+ const page = service.listForEntityExtraction({ limit: 100, offset });
430
+ if (page.length === 0) break;
431
+ candidates.push(...page.filter((m) => (service.getAttrsByMemory?.(m.id) ?? []).length === 0));
432
+ }
433
+ candidates.length = Math.min(candidates.length, maxPerRun);
434
+ if (candidates.length === 0) return { status: "skipped", reason: "no memories to extract" };
435
+ if (signal?.aborted) return { status: "aborted", reason: "user activity" };
436
+
437
+ // extractEntities expects callLLM(messages, options) → text; adapt sleep's
438
+ // streamText + route resolution (same precedence as the other phases).
439
+ const callLLM = async (messages) => {
440
+ const r = resolveSleepRoute(ctx, config, logger);
441
+ if (!r) return undefined;
442
+ return streamText(ctx, {
443
+ ...r,
444
+ purpose: "sleep-entity-extract",
445
+ maxTokens: 4096,
446
+ ...(config.sleepReasoningEffort && config.sleepReasoningEffort !== "none"
447
+ ? { reasoningEffort: config.sleepReasoningEffort }
448
+ : {}),
449
+ messages
450
+ });
451
+ };
452
+
453
+ let extracted = 0;
454
+ let failed = 0;
455
+ let aborted = false;
456
+ const extractedIds = [];
457
+ for (const m of candidates) {
458
+ if (signal?.aborted) {
459
+ aborted = true;
460
+ break;
461
+ }
462
+ const now = new Date().toISOString();
463
+ try {
464
+ // Stamp a pending marker BEFORE the LLM call so a crash mid-extract (the
465
+ // stamp and the entity writes are not one transaction) cannot re-queue
466
+ // this memory while we are already working it. Cleared on outcome.
467
+ service.setMemoryMetadata?.(m.id, { pending_extracted_at: now });
468
+ } catch (error) {
469
+ logger?.warn?.(`dsh-mneme sleep: failed to stamp pending_extracted_at for ${m.id}: ${String(error)}`);
470
+ failed++;
471
+ continue;
472
+ }
473
+ try {
474
+ const result = await extractEntities(m, { store: service, config, callLLM, logger });
475
+ if (result?.ok) {
476
+ extracted++;
477
+ extractedIds.push(m.id);
478
+ // Stamp done regardless of whether the LLM found entities — an empty
479
+ // extract is still a definitive answer for this memory.
480
+ try {
481
+ service.setMemoryMetadata?.(m.id, { entity_extracted_at: now, pending_extracted_at: null });
482
+ } catch (error) {
483
+ logger?.warn?.(`dsh-mneme sleep: failed to stamp entity_extracted_at for ${m.id}: ${String(error)}`);
484
+ }
485
+ } else {
486
+ failed++;
487
+ logger?.warn?.(`dsh-mneme sleep: entity extraction failed for ${m.id}: ${result?.error ?? "unknown"}`);
488
+ try {
489
+ service.setMemoryMetadata?.(m.id, { pending_extracted_at: null });
490
+ } catch (error) {
491
+ logger?.warn?.(`dsh-mneme sleep: failed to clear pending_extracted_at for ${m.id}: ${String(error)}`);
492
+ }
493
+ }
494
+ } catch (error) {
495
+ failed++;
496
+ logger?.warn?.(`dsh-mneme sleep: entity extraction threw for ${m.id}: ${String(error)}`);
497
+ try {
498
+ service.setMemoryMetadata?.(m.id, { pending_extracted_at: null });
499
+ } catch (err) {
500
+ logger?.warn?.(`dsh-mneme sleep: failed to clear pending_extracted_at for ${m.id}: ${String(err)}`);
501
+ }
502
+ }
503
+ }
504
+ return {
505
+ // Any success counts as ok (failures are surfaced via detail.failed + warn,
506
+ // matching phaseConflicts); all-failed reports failed so deriveStatus can
507
+ // reflect a broken route without aborting the other phases.
508
+ status: aborted ? "aborted" : extracted > 0 ? "ok" : failed > 0 ? "failed" : "noop",
509
+ scanned: candidates.length,
510
+ extracted,
511
+ failed,
512
+ aborted,
513
+ extractedIds
514
+ };
515
+ }
516
+
399
517
  // ---------------------------------------------------------------- run
400
518
 
401
519
  function deriveStatus(phases) {
@@ -429,6 +547,9 @@ export async function runSleep(ctx, service, config, logger, semantic = null, si
429
547
  await attempt("conflicts", () => phaseConflicts(ctx, service, config, logger, runId, semantic, signal));
430
548
  await attempt("demotion", () => phaseDemotion(service, config, logger, runId, signal));
431
549
  await attempt("patterns", () => phasePatterns(ctx, service, config, logger, runId, signal));
550
+ // entity-extraction runs before relation completion so freshly minted
551
+ // entities get their orphan relations completed in the same cycle.
552
+ await attempt("entity-extraction", () => phaseEntityExtraction(ctx, service, config, logger, runId, signal));
432
553
  await attempt("relations", () => phaseRelations(service, config, logger, runId, signal));
433
554
 
434
555
  const status = deriveStatus(phases);
@@ -1608,6 +1608,7 @@ export function createService({ store, mirror, config, onWrite, logger, settings
1608
1608
  embeddedCount: () => store.embeddedCount(),
1609
1609
  list: (o) => store.list(o),
1610
1610
  all: () => store.all(),
1611
+ listForEntityExtraction: (opts) => store.listForEntityExtraction(opts),
1611
1612
  count: (type, opts) => store.count(type, opts),
1612
1613
  stats: (opts) => store.stats(opts),
1613
1614
  getById: (id) => store.getById(id),
@@ -1862,9 +1863,11 @@ export function createService({ store, mirror, config, onWrite, logger, settings
1862
1863
  applyMemoryTags: (memoryId, tags) => store.setMemoryTags(memoryId, tags),
1863
1864
  saveAttr: (r) => store.saveAttr(r),
1864
1865
  createEntity: (r) => store.createEntity(r),
1866
+ updateEntity: (id, patch) => store.updateEntity(id, patch),
1865
1867
  findEntityByName: (n) => store.findEntityByName(n),
1866
1868
  findEntityById: (id) => store.findEntityById(id),
1867
1869
  getAttrsByMemory: (id) => store.getAttrsByMemory(id),
1870
+ setMemoryMetadata: (id, metadata) => store.setMemoryMetadata(id, metadata),
1868
1871
  getCurrentAttrs: (id) => store.getCurrentAttrs(id),
1869
1872
  migrateAttrsToMemory: (fromId, toId, now) => store.migrateAttrsToMemory(fromId, toId, now)
1870
1873
  };
@@ -20,6 +20,7 @@ CREATE TABLE IF NOT EXISTS memories (
20
20
  epistemic_status TEXT NOT NULL DEFAULT 'subjective',
21
21
  last_accessed_at TEXT,
22
22
  _full_content TEXT,
23
+ metadata TEXT, -- JSON: free-form extras (e.g. sleep entity_extracted_at)
23
24
  created_at TEXT NOT NULL,
24
25
  updated_at TEXT NOT NULL
25
26
  );
@@ -314,6 +315,14 @@ function parseTags(raw) {
314
315
 
315
316
  function toRow(row) {
316
317
  if (!row) return undefined;
318
+ let metadata;
319
+ if (row.metadata != null) {
320
+ try {
321
+ metadata = JSON.parse(row.metadata);
322
+ } catch {
323
+ metadata = row.metadata;
324
+ }
325
+ }
317
326
  return {
318
327
  id: row.id,
319
328
  type: row.type,
@@ -329,6 +338,7 @@ function toRow(row) {
329
338
  content_history: parseJsonArray(row.content_history),
330
339
  quality_score: row.quality_score !== null && row.quality_score !== undefined ? Number(row.quality_score) : undefined,
331
340
  epistemic_status: row.epistemic_status ?? "subjective",
341
+ metadata,
332
342
  created_at: row.created_at,
333
343
  updated_at: row.updated_at,
334
344
  last_accessed_at: row.last_accessed_at ?? undefined,
@@ -589,6 +599,7 @@ export function createStore(path) {
589
599
  addColumn("memories", "content_history", "ALTER TABLE memories ADD COLUMN content_history TEXT");
590
600
  addColumn("memories", "quality_score", "ALTER TABLE memories ADD COLUMN quality_score REAL");
591
601
  addColumn("memories", "session_id", "ALTER TABLE memories ADD COLUMN session_id TEXT");
602
+ addColumn("memories", "metadata", "ALTER TABLE memories ADD COLUMN metadata TEXT");
592
603
 
593
604
  // Composite index for session-lifecycle queries (dispose/restore/listBySession).
594
605
  // Created post-migration, NOT in SCHEMA: on legacy DBs both columns arrive via
@@ -834,6 +845,50 @@ export function createStore(path) {
834
845
  });
835
846
  }
836
847
 
848
+ /**
849
+ * Bounded scan for sleep's entity-extraction phase: oldest memories without
850
+ * an entity_extracted_at stamp (row-level filters only — attr presence is a
851
+ * cross-table check, so the caller filters the returned page via
852
+ * getAttrsByMemory). Caller pages with {limit, offset}; a full-table scan +
853
+ * JS filter would be O(N) per sleep cycle.
854
+ */
855
+ function listForEntityExtraction({ limit = 50, offset = 0 } = {}) {
856
+ // node:sqlite has no StatementSync#pluck; all() returns row objects.
857
+ return db
858
+ .prepare(`
859
+ SELECT id FROM memories
860
+ WHERE (archived = 0 OR archived IS NULL)
861
+ AND session_disposed_at IS NULL
862
+ AND (forgotten = 0 OR forgotten IS NULL)
863
+ AND type != 'summary'
864
+ AND content IS NOT NULL AND content != ''
865
+ AND (metadata IS NULL OR json_extract(metadata, '$.entity_extracted_at') IS NULL)
866
+ ORDER BY created_at ASC
867
+ LIMIT ? OFFSET ?
868
+ `)
869
+ .all(limit, offset)
870
+ .map((row) => getById(row.id));
871
+ }
872
+
873
+ /**
874
+ * Lightweight metadata-only update (used by sleep's batch entity extraction
875
+ * to stamp `entity_extracted_at` without disturbing title/content/embedding
876
+ * or the normal update semantics). Does not bump updated_at — metadata
877
+ * stamps are bookkeeping, not content, so they must not fake freshness.
878
+ * Incoming fields are MERGED into the existing metadata object so a stamp
879
+ * never clobbers metadata another path just wrote.
880
+ */
881
+ function setMemoryMetadata(id, metadata) {
882
+ const existing = getById(id);
883
+ if (!existing) throw new Error(`memory not found: ${id}`);
884
+ const patch = typeof metadata === "string"
885
+ ? JSON.parse(metadata)
886
+ : (metadata ?? {});
887
+ const merged = { ...(existing.metadata ?? {}), ...patch };
888
+ db.prepare("UPDATE memories SET metadata = ? WHERE id = ?").run(JSON.stringify(merged), id);
889
+ return getById(id);
890
+ }
891
+
837
892
  /**
838
893
  * Atomic compare-and-set update: applies `patch` only when the row still
839
894
  * carries `expectedUpdatedAt` (the version token read by the caller). Returns
@@ -2234,6 +2289,8 @@ export function createStore(path) {
2234
2289
  listByIdPrefix,
2235
2290
  save,
2236
2291
  update,
2292
+ listForEntityExtraction,
2293
+ setMemoryMetadata,
2237
2294
  compareAndUpdate,
2238
2295
  remove,
2239
2296
  setForget,
@@ -371,3 +371,162 @@ test("sleep: runSleep is abortable via signal between phases", async () => {
371
371
  assert.equal(result.phases.conflicts, undefined, "aborted before any phase ran");
372
372
  store.close();
373
373
  });
374
+
375
+ // ------------------------------------------------ entity extraction (issue #23)
376
+
377
+ // Write-path extractor is gated on entityExtractionEnabled (default off), so
378
+ // default installs never accumulate entities → ego-graph panel blank. This
379
+ // sleep phase backfills it; these tests cover gating, idempotence and
380
+ // fail-safe batching.
381
+ const ENTITY_LLM_JSON = JSON.stringify({
382
+ entities: [{ name: "X", type: "concept", attrs: [{ key: "k", value: "v" }] }],
383
+ relations: []
384
+ });
385
+
386
+ test("sleep: entity extraction skips when disabled", async () => {
387
+ const { service, store } = setup();
388
+ makeMemory(service, "记忆A", "内容A", "history");
389
+ const ctx = mockCtx(() => ENTITY_LLM_JSON, { provider: "p", model: "m" });
390
+ const result = await runSleep(
391
+ ctx, service,
392
+ baseConfig({ sleepEntityExtractionEnabled: false }),
393
+ ctx.logger, null, null
394
+ );
395
+ assert.equal(result.phases["entity-extraction"].status, "skipped", "disabled → skipped");
396
+ store.close();
397
+ });
398
+
399
+ test("sleep: extracted memories are stamped and not re-extracted", async () => {
400
+ const { service, store } = setup();
401
+ const mem = makeMemory(service, "记忆B", "内容B", "history");
402
+ const ctx = mockCtx(() => ENTITY_LLM_JSON, { provider: "p", model: "m" });
403
+ const config = baseConfig({ sleepEntityExtractionEnabled: true });
404
+ // First cycle backfills → memory gets entity_extracted_at stamped.
405
+ const first = await runSleep(ctx, service, config, ctx.logger, null, null);
406
+ assert.equal(first.phases["entity-extraction"].status, "ok", "first cycle extracts");
407
+ assert.ok(service.getById(mem.id).metadata?.entity_extracted_at, "stamp written");
408
+ // Second cycle has nothing un-stamped left → skipped.
409
+ const second = await runSleep(ctx, service, config, ctx.logger, null, null);
410
+ assert.equal(second.phases["entity-extraction"].status, "skipped", "nothing left to extract");
411
+ store.close();
412
+ });
413
+
414
+ test("sleep: entity-less extracts are stamped so they are not re-queued forever", async () => {
415
+ const { service, store } = setup();
416
+ const mem = makeMemory(service, "无实体记忆", "这里没有任何实体", "history");
417
+ // LLM legitimately returns no entities — must still be stamped, else every
418
+ // sleep cycle re-extracts the same text forever (issue #23 regression).
419
+ const ctx = mockCtx(() => JSON.stringify({ entities: [], relations: [] }), { provider: "p", model: "m" });
420
+ const config = baseConfig({ sleepEntityExtractionEnabled: true });
421
+ const first = await runSleep(ctx, service, config, ctx.logger, null, null);
422
+ assert.equal(first.phases["entity-extraction"].status, "ok", "empty extract counts as handled");
423
+ assert.equal(first.phases["entity-extraction"].extracted, 1);
424
+ assert.ok(service.getById(mem.id).metadata?.entity_extracted_at, "stamp written even with no entities");
425
+ const second = await runSleep(ctx, service, config, ctx.logger, null, null);
426
+ assert.equal(second.phases["entity-extraction"].status, "skipped", "stamped → not re-queued");
427
+ store.close();
428
+ });
429
+
430
+ test("sleep: entity extraction backfills entities for un-extracted memories", async () => {
431
+ const { service, store } = setup();
432
+ const mem = makeMemory(service, "记忆C", "内容C", "history");
433
+ const ctx = mockCtx(() => ENTITY_LLM_JSON, { provider: "p", model: "m" });
434
+ const result = await runSleep(
435
+ ctx, service,
436
+ baseConfig({ sleepEntityExtractionEnabled: true }),
437
+ ctx.logger, null, null
438
+ );
439
+ const phase = result.phases["entity-extraction"];
440
+ assert.equal(phase.status, "ok");
441
+ assert.equal(phase.extracted, 1);
442
+ assert.ok(store.listEntities().length > 0, "entity minted");
443
+ assert.ok(service.getAttrsByMemory(mem.id).length > 0, "memory now carries entity attrs");
444
+ store.close();
445
+ });
446
+
447
+ test("sleep: a failing extraction does not abort the batch and retries next cycle", async () => {
448
+ const { service, store } = setup();
449
+ const bad = makeMemory(service, "坏记忆", "bad 内容", "history");
450
+ const good = makeMemory(service, "好记忆", "good 内容", "history");
451
+ const ctx = mockCtx(
452
+ (user) => (String(user).includes("bad") ? "这不是合法JSON{{{" : ENTITY_LLM_JSON),
453
+ { provider: "p", model: "m" }
454
+ );
455
+ const config = baseConfig({ sleepEntityExtractionEnabled: true });
456
+ const first = await runSleep(ctx, service, config, ctx.logger, null, null);
457
+ const phase = first.phases["entity-extraction"];
458
+ assert.equal(phase.extracted, 1, "good memory extracted");
459
+ assert.equal(phase.failed, 1, "bad memory counted as failed");
460
+ assert.equal(phase.status, "ok", "partial success is ok");
461
+ assert.ok(store.listEntities().length > 0, "at least one entity minted");
462
+ // Good memory stamped; bad one not → second cycle retries only the bad one.
463
+ assert.ok(service.getById(good.id).metadata?.entity_extracted_at, "good memory stamped");
464
+ assert.equal(service.getById(bad.id).metadata?.entity_extracted_at, undefined, "failed memory not stamped");
465
+ const second = await runSleep(ctx, service, config, ctx.logger, null, null);
466
+ assert.equal(second.phases["entity-extraction"].extracted, 0, "bad memory still fails");
467
+ assert.equal(second.phases["entity-extraction"].failed, 1, "failed memory retried");
468
+ store.close();
469
+ });
470
+
471
+ test("sleep: metadata merge keeps unrelated fields when stamping (review #4)", async () => {
472
+ const { service, store } = setup();
473
+ const mem = makeMemory(service, "记忆M", "内容M", "history");
474
+ service.setMemoryMetadata(mem.id, { custom_flag: "keep-me" });
475
+ const ctx = mockCtx(() => ENTITY_LLM_JSON, { provider: "p", model: "m" });
476
+ await runSleep(ctx, service, baseConfig({ sleepEntityExtractionEnabled: true }), ctx.logger, null, null);
477
+ const meta = service.getById(mem.id).metadata;
478
+ assert.equal(meta.custom_flag, "keep-me", "pre-existing metadata not clobbered");
479
+ assert.ok(meta.entity_extracted_at, "stamp added alongside");
480
+ store.close();
481
+ });
482
+
483
+ test("sleep: pending_extracted_at is cleared on success and on failure (review #3)", async () => {
484
+ const { service, store } = setup();
485
+ const good = makeMemory(service, "好记忆", "内容G", "history");
486
+ const bad = makeMemory(service, "坏记忆", "bad 内容", "history");
487
+ const ctx = mockCtx(
488
+ (user) => (String(user).includes("bad") ? "不是JSON{{{" : ENTITY_LLM_JSON),
489
+ { provider: "p", model: "m" }
490
+ );
491
+ const config = baseConfig({ sleepEntityExtractionEnabled: true });
492
+ const first = await runSleep(ctx, service, config, ctx.logger, null, null);
493
+ const phase = first.phases["entity-extraction"];
494
+ assert.equal(phase.extracted, 1);
495
+ assert.equal(phase.failed, 1);
496
+ assert.equal(service.getById(good.id).metadata?.pending_extracted_at, null, "success clears pending");
497
+ assert.equal(service.getById(bad.id).metadata?.pending_extracted_at, null, "failure clears pending");
498
+ store.close();
499
+ });
500
+
501
+ test("sleep: all-failed extraction surfaces failed status through deriveStatus (review #5)", async () => {
502
+ const { service, store } = setup();
503
+ makeMemory(service, "坏记忆1", "bad 一", "history");
504
+ makeMemory(service, "坏记忆2", "bad 二", "history");
505
+ const ctx = mockCtx(() => "不是JSON{{{", { provider: "p", model: "m" });
506
+ const result = await runSleep(ctx, service, baseConfig({ sleepEntityExtractionEnabled: true }), ctx.logger, null, null);
507
+ const phase = result.phases["entity-extraction"];
508
+ assert.equal(phase.status, "failed", "all-failed extraction reports failed");
509
+ assert.equal(phase.failed, 2);
510
+ assert.ok(["failed", "degraded"].includes(result.status), "deriveStatus folds failed into run status");
511
+ store.close();
512
+ });
513
+
514
+ test("store: listForEntityExtraction pages oldest un-stamped candidates (review #2)", async () => {
515
+ const { service, store } = setup();
516
+ const a = makeMemory(service, "甲", "内容甲", "history");
517
+ makeMemory(service, "乙", "内容乙", "history");
518
+ const archived = makeMemory(service, "归档", "内容归档", "history");
519
+ store.setArchived(archived.id, true);
520
+ makeMemory(service, "摘要", "内容摘要", "summary");
521
+ makeMemory(service, "丙", "内容丙", "history"); // second un-stamped candidate so oldest-first has two to compare
522
+ service.setMemoryMetadata(a.id, { entity_extracted_at: new Date().toISOString() });
523
+ const list = store.listForEntityExtraction({ limit: 10, offset: 0 });
524
+ const titles = list.map((m) => m.title);
525
+ assert.ok(!titles.includes("归档"), "archived excluded");
526
+ assert.ok(!titles.includes("摘要"), "summary excluded");
527
+ assert.ok(!titles.includes("甲"), "already-stamped excluded");
528
+ assert.ok(titles.includes("乙"), "un-stamped included");
529
+ assert.ok(titles.includes("丙"), "un-stamped included");
530
+ assert.equal(list[0].created_at <= list[1].created_at, true, "oldest first");
531
+ store.close();
532
+ });
package/package.json CHANGED
@@ -1,6 +1,6 @@
1
1
  {
2
2
  "name": "@modusensus/dsh-mneme",
3
- "version": "0.7.6",
3
+ "version": "0.7.7",
4
4
  "description": "Structured memory engine for DeepSeek Harness. Offline semantic search, entity-attribute-timeline, autoDream self-consolidation, and human-editable Markdown storage.",
5
5
  "license": "MIT",
6
6
  "repository": {