@furongjun1999/dsh-memory 0.4.8 → 0.4.10
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/README.md +54 -26
- package/codebuddy/CODEBUDDY.md +196 -195
- package/codebuddy/README.md +13 -1
- package/codebuddy/mcp.json +9 -0
- package/docs/GBrain/345/217/257/345/200/237/351/211/264/347/202/271_/347/201/265/346/236/242/350/220/275/347/202/271/344/272/244/346/216/245_20260919.md +169 -0
- package/docs/README.md +1 -1
- package/docs/discipline/harnesses.yaml +18 -7
- package/docs/discipline/templates/full.md.tmpl +4 -3
- package/docs/experiments/linkref_backfill/candidates_20260917.json +726 -0
- package/docs/experiments/linkref_backfill/candidates_internal_20260917.json +602 -0
- package/docs/experiments/linkref_backfill/candidates_internal_v2.json +603 -0
- package/docs/experiments/linkref_backfill/candidates_secret_20260917.json +884 -0
- package/docs/experiments/linkref_backfill/candidates_secret_v2.json +789 -0
- package/docs/hive//345/244/232/347/253/257harness/351/200/232/344/277/241/345/245/221/347/272/246_v0.1.md +42 -0
- package/docs/hive//346/243/200/347/264/242/346/224/266/346/225/233/345/256/236/346/265/213/344/270/216S1b/350/256/276/350/256/241_v0.1.md +43 -0
- package/docs/hive//346/243/200/347/264/242/350/267/257/345/276/204/344/270/216/350/256/244/347/237/245/347/273/223/346/236/204/345/245/221/347/272/246_v0.1.md +102 -0
- package/docs/hive//347/234/237/345/256/236/345/272/223/347/253/257/345/210/260/347/253/257/345/256/236/346/265/213_S1b/344/270/216/345/217/254/345/233/236/346/235/203/350/241/241_v0.1.md +57 -0
- package/docs/hive//347/234/237/345/256/236/345/272/223/347/253/257/345/210/260/347/253/257/345/256/236/346/265/213_S7/345/200/222/346/216/222/345/200/231/351/200/211/345/261/202_v0.1.md +126 -0
- package/docs/hive//350/234/202/345/267/242/345/217/214/345/256/236/344/276/213/344/272/222/351/252/214_/350/256/276/350/256/241/345/256/232/347/250/277.md +503 -0
- package/docs/mdcg/D_meta_/345/267/245/347/250/213/345/214/226/346/226/271/346/241/210_v0.2.md +216 -0
- package/docs/mdcg/README/350/257/246/347/273/206/347/211/210_v0.4.5.md +631 -625
- package/docs/mdcg//344/273/243/347/240/201/350/257/204/345/256/241/344/270/216/346/235/241/344/273/266/345/214/226/346/263/250/351/207/212_/345/245/221/347/272/246_v0.1.md +82 -0
- package/docs/mdcg//345/205/250/345/272/223/344/273/243/347/240/201/350/257/204/345/256/241/344/270/216/346/235/241/344/273/266/345/214/226/346/263/250/351/207/212_/350/256/241/345/210/222_v0.1.md +600 -0
- package/docs/mdcg//345/212/237/350/203/275/350/260/203/347/224/250/346/230/240/345/260/204/350/241/250_v0.1.md +47 -45
- package/docs/mdcg//345/255/220/344/273/243/347/220/206/351/205/215/347/275/256/346/240/207/345/207/{206_v0.4.md → 206_v0.5.md} +92 -4
- package/docs/mdcg//347/201/265/346/236/242/350/256/260/345/277/206/345/212/250/350/257/215/345/215/217/350/256/256_v1.0-draft.md +172 -0
- package/docs/mdcg//347/216/257/344/272/214_/347/231/275/347/256/261/345/241/253/345/205/205/346/265/201/346/260/264/347/272/277_v0.1.md +31 -0
- package/docs/mdcg//350/267/250/347/253/257/351/252/214/350/257/201/344/270/216/345/220/214/346/255/245/345/215/217/350/256/256_v0.1.md +93 -0
- package/docs/theory//345/271/266/345/217/221/345/277/205/347/204/266/346/200/247/347/220/206/350/256/272_v0.2.md +2 -2
- package/docs/theory//347/220/206/350/256/272_/346/234/272/345/210/266_/344/273/243/347/240/201_/345/256/236/351/252/214_/347/274/272/345/217/243/347/237/251/351/230/265_v0.1.md +3 -3
- package/docs/theory//350/256/244/347/237/245/344/273/243/347/220/206/344/270/216/346/224/266/346/225/233/347/273/223/346/236/204_/346/235/241/344/273/266/350/256/272/351/207/215/346/236/204_v0.1.md +2 -2
- package/docs//345/267/245/344/275/234/347/272/252/345/276/213_/350/256/244/347/237/245/345/233/276/346/235/241/347/233/256_v1.1.json +434 -433
- package/docs//347/201/265/346/236/242/350/207/252/346/210/221/346/224/271/350/277/233/345/267/245/344/275/234/350/256/241/345/210/222_/345/244/226/351/203/250/347/240/224/347/251/266/347/263/273/345/210/227/345/220/270/346/224/266_v1_20260919.md +286 -0
- package/dsh/README.md +33 -0
- package/dsh/cordis.yml.example +13 -7
- package/dsh/hive-mcp-probe.mjs +94 -0
- package/dsh/hive-mcp.example.yml +62 -0
- package/dsh/update-lingshu.bat +11 -0
- package/dsh/update-lingshu.ps1 +337 -0
- package/lib/hooks.d.ts +3 -0
- package/lib/hooks.js +17 -23
- package/lib/index.d.ts +4 -2
- package/lib/index.js +29 -6
- package/lib/lib/datapath.d.ts +76 -1
- package/lib/lib/datapath.js +199 -13
- package/lib/lib/mdcg_client.d.ts +40 -3
- package/lib/lib/mdcg_client.js +46 -22
- package/lib/lib/mutual.js +4 -4
- package/lib/lib/token_store.js +4 -5
- package/md_cg/audit.py +17 -2
- package/md_cg/autonomy.py +86 -15
- package/md_cg/backfill.py +36 -1
- package/md_cg/backfill_bigdomain.py +34 -0
- package/md_cg/bench6_arms.py +28 -1
- package/md_cg/bench6_common.py +10 -1
- package/md_cg/bench6_competitors.py +6 -1
- package/md_cg/bench_axis_domain.py +9 -1
- package/md_cg/bench_blind_comp.py +7 -1
- package/md_cg/bench_en_atoms_public.py +9 -0
- package/md_cg/bench_governance.py +348 -0
- package/md_cg/bench_lme_zh.py +16 -1
- package/md_cg/bench_locomo.py +2 -1
- package/md_cg/bench_locomo_zh.py +16 -1
- package/md_cg/bench_locomo_zh_public.py +4 -1
- package/md_cg/bench_longmem.py +2 -1
- package/md_cg/bench_membench.py +27 -1
- package/md_cg/bench_p0.py +4 -1
- package/md_cg/bench_progressive.py +13 -1
- package/md_cg/bench_role_views.py +238 -0
- package/md_cg/bench_task_ab.py +8 -1
- package/md_cg/bench_task_ab_llm.py +13 -1
- package/md_cg/bench_unified_en.py +6 -1
- package/md_cg/bench_zh_mad.py +20 -1
- package/md_cg/blindspot_tickets.py +123 -0
- package/md_cg/branches.py +12 -1
- package/md_cg/build_postings.py +73 -0
- package/md_cg/ccgc.py +67 -2
- package/md_cg/census.py +5 -1
- package/md_cg/chain.py +24 -3
- package/md_cg/codeindex.py +134 -17
- package/md_cg/coldverify.py +265 -0
- package/md_cg/comment_gate.py +338 -0
- package/md_cg/cond_compose.py +190 -0
- package/md_cg/cond_facts.py +155 -0
- package/md_cg/cond_template.json +107 -0
- package/md_cg/condition_anchor.py +143 -0
- package/md_cg/conformance.py +69 -4
- package/md_cg/consistency.py +24 -1
- package/md_cg/consolidate.py +53 -2
- package/md_cg/corpus.py +4 -0
- package/md_cg/crosscheck.py +42 -2
- package/md_cg/crypto.py +35 -1
- package/md_cg/d_meta.py +310 -0
- package/md_cg/datapath.py +201 -26
- package/md_cg/docindex.py +122 -1
- package/md_cg/eval_common.py +29 -1
- package/md_cg/evidence.py +27 -1
- package/md_cg/evolution.py +21 -1
- package/md_cg/export.py +11 -1
- package/md_cg/forgetting.py +23 -1
- package/md_cg/fsutil.py +18 -1
- package/md_cg/hotcache.py +214 -0
- package/md_cg/hyperedge.py +251 -0
- package/md_cg/identity.py +18 -1
- package/md_cg/insight.py +17 -1
- package/md_cg/lexicon/build_cedict_en_zh.py +9 -0
- package/md_cg/lexicon/build_standard_en.py +171 -168
- package/md_cg/lexicon/expand_en_zh.py +6 -0
- package/md_cg/lifecycle.py +12 -1
- package/md_cg/linkref.py +281 -0
- package/md_cg/links.py +29 -1
- package/md_cg/mcp_server.py +362 -43
- package/md_cg/md_whitebox.py +53 -1
- package/md_cg/mdcg.py +1003 -27
- package/md_cg/mdcos.py +558 -36
- package/md_cg/metacognition.py +37 -2
- package/md_cg/migrate.py +4 -0
- package/md_cg/migrate_aeis.py +221 -213
- package/md_cg/migrate_roleplay.py +8 -0
- package/md_cg/migrate_wisdom_graph.py +14 -1
- package/md_cg/mreview/__main__.py +3 -0
- package/md_cg/mreview/bundle.py +8 -0
- package/md_cg/mreview/candidates.py +9 -0
- package/md_cg/mreview/govern.py +21 -1
- package/md_cg/mreview/locate.py +34 -0
- package/md_cg/mreview/pipeline.py +29 -1
- package/md_cg/mreview/ruleset.py +16 -1
- package/md_cg/nodefile.py +233 -3
- package/md_cg/pooling.py +23 -1
- package/md_cg/postings.py +298 -0
- package/md_cg/predict.py +89 -9
- package/md_cg/progressive.py +3 -0
- package/md_cg/protect.py +14 -1
- package/md_cg/protocol.py +372 -0
- package/md_cg/provenance.py +262 -0
- package/md_cg/reach.py +453 -0
- package/md_cg/refindex.py +47 -2
- package/md_cg/refine.py +20 -1
- package/md_cg/roleviews.py +89 -0
- package/md_cg/routing.py +76 -0
- package/md_cg/scrub.py +63 -2
- package/md_cg/security.py +26 -1
- package/md_cg/self_state.py +64 -1
- package/md_cg/selfreport.py +151 -0
- package/md_cg/semantic/canonical.py +5 -0
- package/md_cg/semantic/en_normalizer.py +364 -355
- package/md_cg/semantic/zh_en_atoms.py +139 -136
- package/md_cg/signer.py +41 -1
- package/md_cg/sources.py +583 -547
- package/md_cg/statushdr.py +179 -0
- package/md_cg/stg.py +59 -18
- package/md_cg/subgraph.py +23 -0
- package/md_cg/sustain.py +56 -1
- package/md_cg/tasks.py +26 -2
- package/md_cg/test_autonomy.py +26 -0
- package/md_cg/test_bench_governance.py +102 -0
- package/md_cg/test_blindspot_tickets.py +166 -0
- package/md_cg/test_ccgc.py +10 -0
- package/md_cg/test_codeindex.py +338 -0
- package/md_cg/test_comment_gate.py +187 -0
- package/md_cg/test_cond_compose_anchors.py +76 -0
- package/md_cg/test_condition_anchor.py +82 -0
- package/md_cg/test_d_meta.py +412 -0
- package/md_cg/test_datapath_root.py +188 -0
- package/md_cg/test_gain_gate.py +47 -1
- package/md_cg/test_hot_cold.py +187 -0
- package/md_cg/test_hyperedge.py +245 -0
- package/md_cg/test_linkref.py +306 -0
- package/md_cg/test_md_access_parity.py +15 -3
- package/md_cg/test_mr_m1.py +108 -18
- package/md_cg/test_mr_m3.py +8 -1
- package/md_cg/test_p26_refindex.py +49 -20
- package/md_cg/test_p27_docindex.py +236 -2
- package/md_cg/test_p2_mcp.py +1 -1
- package/md_cg/test_p31_insight.py +24 -0
- package/md_cg/test_p44_md_whitebox.py +14 -1
- package/md_cg/test_protocol.py +243 -0
- package/md_cg/test_reach.py +378 -0
- package/md_cg/test_reach_keys.py +201 -0
- package/md_cg/test_reach_meta_exits.py +145 -0
- package/md_cg/test_read_clip.py +8 -4
- package/md_cg/test_retr_s1.py +340 -0
- package/md_cg/test_retr_s1b.py +209 -0
- package/md_cg/test_retr_s3.py +194 -0
- package/md_cg/test_retr_s4.py +163 -0
- package/md_cg/test_retr_s5.py +200 -0
- package/md_cg/test_retr_s6.py +157 -0
- package/md_cg/test_retr_s7.py +385 -0
- package/md_cg/test_retr_s8_time.py +316 -0
- package/md_cg/test_retr_s9_edges.py +286 -0
- package/md_cg/test_retr_s9_entity_ctx.py +175 -0
- package/md_cg/test_review_conformance.py +59 -2
- package/md_cg/test_role_views.py +354 -0
- package/md_cg/test_subproc_encoding.py +188 -0
- package/md_cg/test_trust.py +361 -0
- package/md_cg/test_units_poll.py +71 -0
- package/md_cg/test_v14_fixes.py +397 -0
- package/md_cg/test_validity_filter.py +280 -0
- package/md_cg/test_wisdom_md_store.py +7 -3
- package/md_cg/test_writepipe.py +5 -1
- package/md_cg/theory.py +16 -1
- package/md_cg/tokens.py +40 -8
- package/md_cg/tool_face.py +13 -2
- package/md_cg/trust.py +943 -0
- package/md_cg/twophase.py +12 -1
- package/md_cg/units.py +132 -10
- package/md_cg/vision_evidence.py +24 -1
- package/md_cg/weights.py +24 -1
- package/md_cg/whitebox.py +32 -1
- package/md_cg/whitebox_kb/data/verify_cache.json +21210 -365
- package/md_cg/whitebox_kb/data/verify_savings.jsonl +5078 -0
- package/md_cg/whitebox_kb/wisdom/audit_log/chain_heat.json +10 -10
- package/md_cg/whitebox_kb/wisdom/code_compose.py +113 -6
- package/md_cg/whitebox_kb/wisdom/code_solidified.json +1 -1
- package/md_cg/whitebox_kb/wisdom/verifier.py +340 -55
- package/md_cg/whitebox_kb/wisdom/wisdom-book-cloud.db +0 -0
- package/md_cg/writelimit.py +18 -4
- package/md_cg/writepipe.py +178 -7
- package/package.json +2 -2
- package/skills/skills/designer-perspective/scripts/__pycache__/designer.cpython-310.pyc +0 -0
- package/skills/skills/designer-perspective/scripts/designer.py +17 -1
- package/skills/skills/designer-perspective/tests/selftest.py +3 -1
- package/src/hooks.ts +17 -21
- package/src/index.ts +33 -6
- package/src/lib/datapath.ts +211 -13
- package/src/lib/mdcg_client.ts +64 -25
- package/src/lib/mutual.ts +411 -411
- package/src/lib/token_store.ts +4 -5
- package/zcode/AGENTS.md +196 -195
- package/zcode/README.md +4 -0
- package/md_cg/whitebox_kb/wisdom/wisdom-book-cloud.db-shm +0 -0
- package/md_cg/whitebox_kb/wisdom/wisdom-book-cloud.db-wal +0 -0
|
@@ -0,0 +1,298 @@
|
|
|
1
|
+
# -*- coding: utf-8 -*-
|
|
2
|
+
"""倒排(发布表)候选层:不读遍全库即可取「词法候选」。
|
|
3
|
+
|
|
4
|
+
为何需要(实测依据:docs/hive/真实库端到端实测_S1b与召回权衡_v0.1.md):
|
|
5
|
+
S1b 桶收敛能少扫 5.5~10.4 倍,但**召回集合会变**(真实库一致率仅 1/4)。要两全,
|
|
6
|
+
必须有「廉价高精度候选生成器」——即本模块:把「字符 bigram → 节点」做成发布表,
|
|
7
|
+
查询时按 bigram 交集取候选,再用既有 `_like` 精确过滤,从而**召回与全表扫描一致**。
|
|
8
|
+
|
|
9
|
+
设计要点:
|
|
10
|
+
1. 索引对象 = 节点 **content + tags** 的字符 bigram(与打分口径同源:mdcg.bigrams/normalize_en)。
|
|
11
|
+
2. 查询侧:对每个查询词 t(len ≥ 2)取 t 的 bigram 集合在发布表中的**交集**;
|
|
12
|
+
这些节点必然包含 t 的全部 bigram(是「包含 t」的超集,可能跨词假阳性);
|
|
13
|
+
各词取并集 → 候选 ⊇ 真命中集 → 再用 `_like` 精确过滤 → 结果与全表扫描一致。
|
|
14
|
+
3. 单字查询词无法用 bigram 表达 → 该查询**回退全量**(安全,记 reason)。
|
|
15
|
+
4. 发布表是**快照**:节点被改写后即过期。故 build 记录**快照指纹**(节点数 + 节点目录
|
|
16
|
+
mtime + 索引文件 mtime),查询前先验指纹;过期即**回退全量**(宁可慢,不可丢召回)。
|
|
17
|
+
指纹只用 stat(约等于「目录数」次,本库 1,074 个目录 ≈ 0.03s),不重读节点。
|
|
18
|
+
5. 存储:`<root>/_postings.json`({bigram: [id,...]})+ `<root>/_postings_meta.json`(版本/规模/指纹)。
|
|
19
|
+
6. 位置:只作**候选生成器**(契约 §7 允许的「候选内加速」),不替代认知路径。
|
|
20
|
+
7. v1 不接写入路径的增量维护(每次写都 load+save 75MB 不可接受):**改写后请重建**;
|
|
21
|
+
重建是幂等且无副作用的(不改任何节点内容)。增量(dirty 集)为下一里程碑。
|
|
22
|
+
"""
|
|
23
|
+
import io
|
|
24
|
+
import json
|
|
25
|
+
import os
|
|
26
|
+
import time
|
|
27
|
+
|
|
28
|
+
SCHEMA = "mdcg-postings-2"
|
|
29
|
+
|
|
30
|
+
|
|
31
|
+
# 生效条件:root 为真值时返回 root 下 postings 数据文件路径,否则返回 "_postings.json"(相对路径)。
|
|
32
|
+
def postings_path(root: str) -> str:
|
|
33
|
+
return os.path.join(root or "", "_postings.json")
|
|
34
|
+
|
|
35
|
+
|
|
36
|
+
# 生效条件:root 为真值时返回 root 下 postings 元数据文件路径,否则返回 "_postings_meta.json"。
|
|
37
|
+
def meta_path(root: str) -> str:
|
|
38
|
+
return os.path.join(root or "", "_postings_meta.json")
|
|
39
|
+
|
|
40
|
+
|
|
41
|
+
# 生效条件:无条件以 utf-8 惰性引入 mdcg 的 bigrams/normalize_en 并返回;导入失败返回 (None, None)。
|
|
42
|
+
def _bigrams_fn():
|
|
43
|
+
try:
|
|
44
|
+
from .mdcg import bigrams, normalize_en
|
|
45
|
+
return bigrams, normalize_en
|
|
46
|
+
except Exception:
|
|
47
|
+
return None, None
|
|
48
|
+
|
|
49
|
+
|
|
50
|
+
# 生效条件:path 可 stat 时返回 st_mtime_ns(int),否则返回 None。
|
|
51
|
+
def _mtime_ns(path: str):
|
|
52
|
+
try:
|
|
53
|
+
return os.stat(path).st_mtime_ns
|
|
54
|
+
except OSError:
|
|
55
|
+
return None
|
|
56
|
+
|
|
57
|
+
|
|
58
|
+
# 生效条件:text 与 tags 均为假值时返回空集合;否则返回二者(tags 以空格拼接)经 normalize_en 后的 bigram 并集;
|
|
59
|
+
# bigrams/normalize_en 不可用时返回空集合。
|
|
60
|
+
def ngrams(text, tags=None) -> set:
|
|
61
|
+
"""节点侧取词:content + tags 的字符 bigram 集合(与打分同源)。"""
|
|
62
|
+
bigrams, normalize_en = _bigrams_fn()
|
|
63
|
+
if bigrams is None:
|
|
64
|
+
return set()
|
|
65
|
+
buf = str(text or "")
|
|
66
|
+
if tags:
|
|
67
|
+
buf += " " + " ".join(str(t) for t in tags)
|
|
68
|
+
if not buf.strip():
|
|
69
|
+
return set()
|
|
70
|
+
return set(bigrams(normalize_en(buf)))
|
|
71
|
+
|
|
72
|
+
|
|
73
|
+
# 生效条件:terms 为假值时返回([],'empty_terms');任一词的 normalize_en 结果长度 < 2 时返回([],'single_char_term');
|
|
74
|
+
# 否则返回([每词 bigram 集合],''),供 candidates 逐词取交集。
|
|
75
|
+
def term_ngram_sets(terms):
|
|
76
|
+
"""查询侧取词:把每个查询词转成 bigram 集合;含单字词则整体不可用(安全回退)。"""
|
|
77
|
+
bigrams, normalize_en = _bigrams_fn()
|
|
78
|
+
if not terms:
|
|
79
|
+
return [], "empty_terms"
|
|
80
|
+
if bigrams is None or normalize_en is None:
|
|
81
|
+
return [], "no_bigram_fn"
|
|
82
|
+
sets = []
|
|
83
|
+
for t in terms:
|
|
84
|
+
nt = normalize_en(str(t))
|
|
85
|
+
if len(nt) < 2:
|
|
86
|
+
return [], "single_char_term"
|
|
87
|
+
sets.append(set(bigrams(nt)))
|
|
88
|
+
return sets, ""
|
|
89
|
+
|
|
90
|
+
|
|
91
|
+
# 生效条件:index_nodes 为 dict 时返回 {"nodes": 节点数, "dir_mtimes": {相对目录: mtime_ns}, "index_mtime": 索引文件 mtime_ns};
|
|
92
|
+
# 假值时返回 {"nodes": 0, "dir_mtimes": {}, "index_mtime": None}。
|
|
93
|
+
def snapshot(root: str, index_nodes) -> dict:
|
|
94
|
+
"""快照指纹:节点数 + 各节点目录 mtime + 索引文件 mtime。
|
|
95
|
+
|
|
96
|
+
为何用目录 mtime:节点写入走 fsutil.atomic_write(temp + os.replace),
|
|
97
|
+
目录 mtime 必然变化,故「目录 mtime + 节点数」能以 O(目录数) 次 stat
|
|
98
|
+
发现「发布表已过期」,无需重读/重哈希任何节点文件。
|
|
99
|
+
"""
|
|
100
|
+
dirs, files = set(), {}
|
|
101
|
+
for e in (index_nodes or {}).values():
|
|
102
|
+
p = (e or {}).get("path") or ""
|
|
103
|
+
d = os.path.dirname(p)
|
|
104
|
+
if d:
|
|
105
|
+
dirs.add(d)
|
|
106
|
+
elif p:
|
|
107
|
+
# 根级节点(path 无目录)不能靠「根目录 mtime」判定:我们自己写的
|
|
108
|
+
# _postings.json / _postings_meta.json 就在根目录,会把根目录 mtime 改掉
|
|
109
|
+
# → 快照刚建就自判过期(独立复核 2026-09-19 指出)。改为逐文件记 mtime。
|
|
110
|
+
files[p] = _mtime_ns(os.path.join(root or "", p))
|
|
111
|
+
return {"nodes": len(index_nodes or {}),
|
|
112
|
+
"dir_mtimes": {d: _mtime_ns(os.path.join(root or "", d)) for d in dirs},
|
|
113
|
+
"file_mtimes": files,
|
|
114
|
+
"index_mtime": _mtime_ns(os.path.join(root or "", "_index.json"))}
|
|
115
|
+
|
|
116
|
+
|
|
117
|
+
# 生效条件:meta 非 dict 或 schema 不符 → 'no_meta'(无数据文件时 'no_index');无 snapshot → 'no_snapshot';
|
|
118
|
+
# 节点数 / 目录集合 / 目录 mtime / 根级文件集合 / 根级文件 mtime / 索引 mtime 任一不一致 → 对应 reason;
|
|
119
|
+
# 全部一致 → ''(空串,代表新鲜可用)。index_nodes 为假值时返回 'no_index'。
|
|
120
|
+
def stale_reason(root: str, index_nodes, meta=None) -> str:
|
|
121
|
+
"""返回 '' 表示快照仍与当前索引一致;否则返回过期原因(调用方必须回退全量)。"""
|
|
122
|
+
if not index_nodes:
|
|
123
|
+
return "no_index"
|
|
124
|
+
if meta is None:
|
|
125
|
+
meta = load_meta(root)
|
|
126
|
+
if not isinstance(meta, dict) or meta.get("schema") != SCHEMA:
|
|
127
|
+
return "no_meta" if os.path.exists(postings_path(root)) else "no_index"
|
|
128
|
+
snap = meta.get("snapshot")
|
|
129
|
+
if not isinstance(snap, dict):
|
|
130
|
+
return "no_snapshot"
|
|
131
|
+
if snap.get("nodes") != len(index_nodes):
|
|
132
|
+
return "node_count_changed"
|
|
133
|
+
want = snap.get("dir_mtimes") or {}
|
|
134
|
+
dirs_now = set()
|
|
135
|
+
for e in index_nodes.values():
|
|
136
|
+
d = os.path.dirname((e or {}).get("path") or "")
|
|
137
|
+
if d:
|
|
138
|
+
dirs_now.add(d) # 根级路径(无目录)由 file_mtimes 记账,见下
|
|
139
|
+
if set(want.keys()) != dirs_now:
|
|
140
|
+
return "dirs_changed"
|
|
141
|
+
for d, mt in want.items():
|
|
142
|
+
if _mtime_ns(os.path.join(root or "", d)) != mt:
|
|
143
|
+
return "dir_touched"
|
|
144
|
+
want_files = snap.get("file_mtimes") or {}
|
|
145
|
+
files_now = set()
|
|
146
|
+
for e in index_nodes.values():
|
|
147
|
+
p = (e or {}).get("path") or ""
|
|
148
|
+
if p and not os.path.dirname(p):
|
|
149
|
+
files_now.add(p)
|
|
150
|
+
if set(want_files.keys()) != files_now:
|
|
151
|
+
return "root_files_changed"
|
|
152
|
+
for p, mt in want_files.items():
|
|
153
|
+
if _mtime_ns(os.path.join(root or "", p)) != mt:
|
|
154
|
+
return "root_file_touched"
|
|
155
|
+
if snap.get("index_mtime") != _mtime_ns(os.path.join(root or "", "_index.json")):
|
|
156
|
+
return "index_touched"
|
|
157
|
+
return ""
|
|
158
|
+
|
|
159
|
+
|
|
160
|
+
# 生效条件:无条件读 root/_postings_meta.json 并返回 dict(缺文件/解析失败/非 dict 一律返回 {})。
|
|
161
|
+
def load_meta(root: str) -> dict:
|
|
162
|
+
try:
|
|
163
|
+
with io.open(meta_path(root), encoding="utf-8") as f:
|
|
164
|
+
m = json.load(f)
|
|
165
|
+
return m if isinstance(m, dict) else {}
|
|
166
|
+
except Exception:
|
|
167
|
+
return {}
|
|
168
|
+
|
|
169
|
+
|
|
170
|
+
# 生效条件:无条件以 utf-8 原子写 path(tmp + os.replace),写入的字符串为 obj 的 JSON 序列化。
|
|
171
|
+
def _atomic_json(path: str, obj, indent=None) -> None:
|
|
172
|
+
tmp = path + ".tmp"
|
|
173
|
+
with io.open(tmp, "w", encoding="utf-8", newline=chr(10)) as f:
|
|
174
|
+
json.dump(obj, f, ensure_ascii=False, indent=indent, separators=None if indent else (",", ":"))
|
|
175
|
+
os.replace(tmp, path)
|
|
176
|
+
|
|
177
|
+
|
|
178
|
+
# 生效条件:无条件读 root/_postings.json 并返回 dict(缺文件/解析失败返回 {};内容非 dict 亦返回 {})。
|
|
179
|
+
def load(root: str) -> dict:
|
|
180
|
+
p = postings_path(root)
|
|
181
|
+
try:
|
|
182
|
+
with io.open(p, encoding="utf-8") as f:
|
|
183
|
+
t = json.load(f)
|
|
184
|
+
return t if isinstance(t, dict) else {}
|
|
185
|
+
except Exception:
|
|
186
|
+
return {}
|
|
187
|
+
|
|
188
|
+
|
|
189
|
+
_CACHE = {}
|
|
190
|
+
|
|
191
|
+
|
|
192
|
+
# 生效条件:root/postings 为假值返回 {};否则按 (路径, mtime, size) 缓存命中则返回缓存表,未命中则 load 后写入缓存并返回。
|
|
193
|
+
def load_cached(root: str) -> dict:
|
|
194
|
+
p = postings_path(root)
|
|
195
|
+
try:
|
|
196
|
+
st = os.stat(p)
|
|
197
|
+
except OSError:
|
|
198
|
+
return {}
|
|
199
|
+
key = (p, st.st_mtime_ns, st.st_size)
|
|
200
|
+
hit = _CACHE.get(p)
|
|
201
|
+
if hit and hit[0] == key:
|
|
202
|
+
return hit[1]
|
|
203
|
+
t = load(root)
|
|
204
|
+
_CACHE[p] = (key, t)
|
|
205
|
+
return t
|
|
206
|
+
|
|
207
|
+
|
|
208
|
+
# 生效条件:cg 为假值或取不到 index["nodes"] 时返回 {"nodes":0,"terms":0,"postings":0,"rebuilt":False};
|
|
209
|
+
# 否则遍历 index 逐节点取 content+tags 的 bigram、按 id 去重累积,先写数据表、再取快照指纹并写元数据,
|
|
210
|
+
# 返回含 nodes/terms/postings/rebuild=True/snapshot 的 stats。limit 为真值时最多处理 limit 个节点。
|
|
211
|
+
def build(cg, limit: int = None) -> dict:
|
|
212
|
+
"""全量重建发布表(幂等、不改节点内容)。"""
|
|
213
|
+
nodes = (getattr(cg, "index", {}) or {}).get("nodes") or {}
|
|
214
|
+
if not nodes:
|
|
215
|
+
return {"nodes": 0, "terms": 0, "postings": 0, "rebuilt": False}
|
|
216
|
+
table = {}
|
|
217
|
+
n = 0
|
|
218
|
+
for nid, e in list(nodes.items()):
|
|
219
|
+
if limit and n >= limit:
|
|
220
|
+
break
|
|
221
|
+
got = cg.get(nid)
|
|
222
|
+
if not got:
|
|
223
|
+
continue
|
|
224
|
+
gs = ngrams(got.get("content"), got.get("frontmatter", {}).get("tags"))
|
|
225
|
+
if not gs:
|
|
226
|
+
continue
|
|
227
|
+
for g in gs:
|
|
228
|
+
table.setdefault(g, []).append(nid)
|
|
229
|
+
n += 1
|
|
230
|
+
stats = {"schema": SCHEMA, "built_at": int(time.time()), "nodes": n,
|
|
231
|
+
"terms": len(table), "postings": sum(len(v) for v in table.values())}
|
|
232
|
+
_atomic_json(postings_path(cg.root), table)
|
|
233
|
+
if limit:
|
|
234
|
+
# 抽样构建(冒烟用)只索引了部分节点 —— **绝不能**留下看似新鲜的快照,
|
|
235
|
+
# 否则未索引的节点会被静默漏召回。无 snapshot → stale_reason 判 'no_snapshot'。
|
|
236
|
+
stats["partial"] = True
|
|
237
|
+
else:
|
|
238
|
+
# 快照指纹必须在写完数据文件之后取:否则 root 目录自身的 mtime 会被本次写入改掉。
|
|
239
|
+
stats["snapshot"] = snapshot(cg.root, nodes)
|
|
240
|
+
_atomic_json(meta_path(cg.root), stats, indent=1)
|
|
241
|
+
return dict(stats, rebuilt=True)
|
|
242
|
+
|
|
243
|
+
|
|
244
|
+
# 生效条件:无条件把 node_id 追加进 table 中每个 bigram 的列表(bigram 不存在则新建列表),返回追加的 bigram 个数。
|
|
245
|
+
def add_to_table(table: dict, node_id, text, tags=None) -> int:
|
|
246
|
+
"""增量维护:把某节点的 bigram 追加进表(调用方负责持久化)。v1 未接入写入路径。"""
|
|
247
|
+
gs = ngrams(text, tags)
|
|
248
|
+
for g in gs:
|
|
249
|
+
table.setdefault(g, []).append(node_id)
|
|
250
|
+
return len(gs)
|
|
251
|
+
|
|
252
|
+
|
|
253
|
+
# 生效条件:无条件把 node_id 从 table 各列表中移除(不存在则无操作并原样返回 table),返回剩余 bigram 数。
|
|
254
|
+
def remove_from_table(table: dict, node_id) -> int:
|
|
255
|
+
for g in list(table.keys()):
|
|
256
|
+
lst = table.get(g)
|
|
257
|
+
if not lst:
|
|
258
|
+
continue
|
|
259
|
+
try:
|
|
260
|
+
table[g] = [x for x in lst if x != node_id]
|
|
261
|
+
except Exception:
|
|
262
|
+
continue
|
|
263
|
+
if not table[g]:
|
|
264
|
+
table.pop(g, None)
|
|
265
|
+
return len(table)
|
|
266
|
+
|
|
267
|
+
|
|
268
|
+
# 生效条件:terms 为假值或任一词为单字(或 bigram 函数不可用)时返回 (None, reason);发布表为空时返回 (None,'no_index');
|
|
269
|
+
# 否则逐词以「该词的全部 bigram 发布列表交集」取候选、各词取并集,返回 (候选 id 集合, '')。
|
|
270
|
+
def candidates(root: str, terms):
|
|
271
|
+
"""返回 (candidate_ids | None, reason)。None 表示「不可用,调用方应回退全量」。"""
|
|
272
|
+
sets, reason = term_ngram_sets(terms)
|
|
273
|
+
if not sets:
|
|
274
|
+
return None, reason or "unusable_terms"
|
|
275
|
+
table = load_cached(root)
|
|
276
|
+
if not table:
|
|
277
|
+
return None, "no_index"
|
|
278
|
+
out = set()
|
|
279
|
+
for gs in sets:
|
|
280
|
+
lists = [table.get(g) for g in gs]
|
|
281
|
+
if any(x is None for x in lists):
|
|
282
|
+
continue # 该词有 bigram 不在表里 → 该词无候选(并集里不贡献)
|
|
283
|
+
inter = set(lists[0])
|
|
284
|
+
for x in lists[1:]:
|
|
285
|
+
inter &= set(x)
|
|
286
|
+
if not inter:
|
|
287
|
+
break
|
|
288
|
+
out |= inter
|
|
289
|
+
return out, ""
|
|
290
|
+
|
|
291
|
+
|
|
292
|
+
# 生效条件:无条件统计 root 下发布表规模并返回 {"terms": 词项数, "postings": 倒排条目数, "meta": 元数据 dict 或 None};
|
|
293
|
+
# index_nodes 为真值时附带 "stale_reason"('' 表示新鲜),否则该项为 None。
|
|
294
|
+
def stats(root: str, index_nodes=None) -> dict:
|
|
295
|
+
t = load_cached(root)
|
|
296
|
+
meta = load_meta(root) or None
|
|
297
|
+
return {"terms": len(t), "postings": sum(len(v) for v in t.values()), "meta": meta,
|
|
298
|
+
"stale_reason": (stale_reason(root, index_nodes, meta) if index_nodes is not None else None)}
|