@furongjun1999/dsh-memory 0.5.0 → 0.5.1
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/README.md +552 -465
- package/docs/README.md +1 -0
- package/docs/eval/bench_lingshu_self/bench_self.py +140 -0
- package/docs/eval/bench_lingshu_self/self_bench_result.json +404 -0
- package/docs/eval/bench_lingshu_self//347/201/265/346/236/242/350/207/252/345/272/223/347/253/257/345/210/260/347/253/257/346/243/200/347/264/242/345/256/236/346/265/213_v1.0.md +38 -0
- package/docs/eval//344/270/215/345/217/257/351/235/240/346/200/247/350/220/275/345/234/260_P0_v1.0.md +185 -0
- package/docs/eval//346/225/205/351/232/234/346/263/250/345/205/245/345/256/236/346/265/213_v1.0.md +422 -0
- package/docs/eval//347/253/257/345/210/260/347/253/257LoCoMoQA/345/220/214/345/217/243/345/276/204/345/257/271/347/205/247_v1.0.md +100 -0
- package/docs/eval//347/253/257/345/210/260/347/253/257/345/271/262/346/211/260/346/261/240/350/257/204/346/265/213_/347/241/256/345/256/232/346/200/247/350/243/201/345/206/263vsLLM_judge_v1.1.md +197 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v1.md +156 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v10.md +210 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v11.md +227 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v12.md +203 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v13.md +233 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v14.md +191 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v15.md +213 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v16.md +214 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v17.md +199 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v2.md +156 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v3.md +152 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v4.md +128 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v5.md +114 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v6.md +192 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v7.md +187 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v8.md +207 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v9.md +203 -0
- package/docs/hive//345/256/211/345/205/250/345/256/241/350/256/241/345/256/236/351/224/232_v0.1.md +202 -0
- package/docs/hive//350/234/202/345/267/242/345/217/214/345/256/236/344/276/213/344/272/222/351/252/214_/350/256/276/350/256/241/345/256/232/347/250/277.md +19 -3
- package/docs/images/lingshu-moonlight-covenant-poster-preview.jpg +0 -0
- package/docs/images/lingshu-moonlight-covenant-poster.png +0 -0
- package/docs/mdcg//345/212/237/350/203/275/350/260/203/347/224/250/346/230/240/345/260/204/350/241/250_v0.1.md +40 -40
- package/docs/theory//344/270/215/345/217/257/351/235/240/345/256/232/347/220/206/344/270/216/345/244/261/346/225/210/344/274/230/345/205/210/346/241/206/346/236/266_v0.3.md +365 -0
- package/docs//344/270/215/345/217/257/351/235/240/346/200/247/347/220/206/350/256/272_v0.1.md +343 -0
- package/lib/bridge.d.ts +9 -0
- package/lib/bridge.js +35 -0
- package/lib/index.js +7 -1
- package/lib/lib/roleplay_web.js +530 -443
- package/lib/lib/token_store.d.ts +7 -1
- package/lib/lib/token_store.js +12 -3
- package/md_cg/audit.py +12 -1
- package/md_cg/backfill.py +16 -15
- package/md_cg/backfill_bucket_zh.py +35 -0
- package/md_cg/bench_e2e_judge.py +532 -0
- package/md_cg/bench_e2e_locomo_qa.py +368 -0
- package/md_cg/bench_e2e_qa.py +256 -0
- package/md_cg/branches.py +18 -2
- package/md_cg/ccgc.py +3 -2
- package/md_cg/chain.py +19 -4
- package/md_cg/consolidate.py +7 -6
- package/md_cg/crosscheck.py +4 -3
- package/md_cg/crypto.py +439 -437
- package/md_cg/datapath.py +395 -335
- package/md_cg/evidence.py +582 -580
- package/md_cg/export.py +3 -1
- package/md_cg/forgetting.py +2 -2
- package/md_cg/fsutil.py +48 -0
- package/md_cg/hotcache.py +255 -238
- package/md_cg/interop.py +161 -22
- package/md_cg/judgment_manifest.py +177 -0
- package/md_cg/links.py +655 -622
- package/md_cg/mcp_server.py +280 -29
- package/md_cg/mdcg.py +616 -125
- package/md_cg/mdcos.py +430 -66
- package/md_cg/mreview/govern.py +5 -4
- package/md_cg/postings.py +4 -2
- package/md_cg/readcache.py +76 -18
- package/md_cg/reconcile.py +228 -0
- package/md_cg/review_cli.py +170 -0
- package/md_cg/routing.py +28 -0
- package/md_cg/run_tests.py +211 -0
- package/md_cg/scrub.py +862 -852
- package/md_cg/security.py +385 -275
- package/md_cg/selfreport.py +3 -2
- package/md_cg/signer.py +565 -562
- package/md_cg/sources.py +3 -2
- package/md_cg/stg.py +6 -0
- package/md_cg/sustain.py +1168 -1138
- package/md_cg/test_access_hints.py +147 -0
- package/md_cg/test_branch_discard_tombstone.py +136 -0
- package/md_cg/test_branches.py +259 -249
- package/md_cg/test_chain_read_isolate.py +168 -0
- package/md_cg/test_datapath_device_name.py +203 -0
- package/md_cg/test_emit_negtail_cache.py +156 -0
- package/md_cg/test_en_pipeline.py +186 -166
- package/md_cg/test_govern_directread.py +421 -0
- package/md_cg/test_i32_hotcache_env_key.py +218 -0
- package/md_cg/test_identity_attribution.py +228 -147
- package/md_cg/test_index_durability.py +238 -224
- package/md_cg/test_interop.py +4 -2
- package/md_cg/test_interop_judgment.py +228 -0
- package/md_cg/test_issue39_utf8_stdio.py +273 -0
- package/md_cg/test_links_concurrent_write.py +188 -0
- package/md_cg/test_merge_upsert.py +168 -0
- package/md_cg/test_n123_derive_expiry_chain.py +205 -0
- package/md_cg/test_n130_verify_falsified_protect.py +185 -0
- package/md_cg/test_n131_merge_gate.py +205 -0
- package/md_cg/test_p1x_ref_root.py +160 -0
- package/md_cg/test_p27_docindex.py +774 -765
- package/md_cg/test_p2_mcp.py +3 -0
- package/md_cg/test_p32_backfill.py +304 -298
- package/md_cg/test_p39_verify_flow.py +90 -50
- package/md_cg/test_p47_session_view.py +60 -25
- package/md_cg/test_propose_tail_index.py +157 -0
- package/md_cg/test_read_scope_b27.py +277 -0
- package/md_cg/test_readcache_default_on.py +168 -0
- package/md_cg/test_readcache_precise_inval.py +270 -0
- package/md_cg/test_readcache_prodpath.py +55 -7
- package/md_cg/test_reconcile_v0.py +294 -0
- package/md_cg/test_retr_s1.py +6 -2
- package/md_cg/test_retr_s1b.py +67 -0
- package/md_cg/test_retr_s7.py +8 -0
- package/md_cg/test_retr_s9_entity_ctx.py +181 -175
- package/md_cg/test_retr_score_once.py +208 -0
- package/md_cg/test_review_onepass.py +170 -0
- package/md_cg/test_rrf_graph_seed_cache.py +154 -0
- package/md_cg/test_security_audit.py +155 -0
- package/md_cg/test_security_audit_b26.py +161 -0
- package/md_cg/test_security_audit_v21.py +250 -0
- package/md_cg/test_semantic_canonical.py +255 -241
- package/md_cg/test_session_isolation.py +168 -0
- package/md_cg/test_snapshot_autoclose.py +187 -0
- package/md_cg/test_tail_watermark_race.py +208 -0
- package/md_cg/test_tenant_env_override_warn.py +139 -0
- package/md_cg/test_tenant_registry_corrupt_warn.py +151 -0
- package/md_cg/test_v14_fixes.py +415 -397
- package/md_cg/test_verify_dirty_reconcile.py +157 -0
- package/md_cg/theory.py +276 -273
- package/md_cg/tokens.py +734 -677
- package/md_cg/units.py +3 -2
- package/md_cg/vision_evidence.py +4 -3
- package/md_cg/whitebox_kb/wisdom/code_solidified.json +6195 -6195
- package/md_cg/whitebox_kb/wisdom/multilang_ir.py +128 -124
- package/md_cg/writepipe.py +554 -550
- package/package.json +6 -2
- package/src/bridge.ts +434 -401
- package/src/index.ts +526 -518
- package/src/lib/roleplay_web.ts +1019 -932
- package/src/lib/token_store.ts +202 -192
|
@@ -1,166 +1,186 @@
|
|
|
1
|
-
# -*- coding: utf-8 -*-
|
|
2
|
-
"""原子级中英归一管线(lexicon + semantic + mdcg 集成)· 设计态验收。
|
|
3
|
-
|
|
4
|
-
管线四件套:
|
|
5
|
-
lexicon/build_standard_en.py 英文标准库构建器(牛肉→cow_meat,构建即验证)
|
|
6
|
-
lexicon/standard_en.json 词条真源(语素拼接自洽 + snake_case)
|
|
7
|
-
semantic/en_normalizer.py 英文 query → 中文语素序列(时态归零→停用词→映射→专有词保留)
|
|
8
|
-
semantic/zh_en_atoms.py 中文文本 → 标准英文原子序列(反方向序列化)
|
|
9
|
-
|
|
10
|
-
集成面(mdcg.en_zh_terms → expand_query_terms):
|
|
11
|
-
英→中语素追加为召回词+打分 bigram(en_zh_bigrams);默认关闭
|
|
12
|
-
(双语双路裁定:md_cg 主链路英文走独立 Jaccard 路,见 semantic/REPRODUCE.md),
|
|
13
|
-
MDCG_EN_ATOMS=1 显式开启;纯中文 query 零触发;
|
|
14
|
-
mdcos 四路 RRF 的 lexical 路同源复用 expand_query_terms,自动受益。
|
|
15
|
-
|
|
16
|
-
|
|
17
|
-
|
|
18
|
-
|
|
19
|
-
|
|
20
|
-
|
|
21
|
-
|
|
22
|
-
|
|
23
|
-
|
|
24
|
-
|
|
25
|
-
|
|
26
|
-
from
|
|
27
|
-
|
|
28
|
-
|
|
29
|
-
|
|
30
|
-
|
|
31
|
-
|
|
32
|
-
|
|
33
|
-
|
|
34
|
-
|
|
35
|
-
|
|
36
|
-
|
|
37
|
-
|
|
38
|
-
|
|
39
|
-
|
|
40
|
-
|
|
41
|
-
|
|
42
|
-
|
|
43
|
-
|
|
44
|
-
|
|
45
|
-
|
|
46
|
-
|
|
47
|
-
|
|
48
|
-
|
|
49
|
-
|
|
50
|
-
|
|
51
|
-
ok(en_normalizer.strip_tense("
|
|
52
|
-
ok(en_normalizer.strip_tense("
|
|
53
|
-
|
|
54
|
-
|
|
55
|
-
|
|
56
|
-
ok(
|
|
57
|
-
|
|
58
|
-
ok("
|
|
59
|
-
ok(en_normalizer.
|
|
60
|
-
ok(en_normalizer.
|
|
61
|
-
|
|
62
|
-
|
|
63
|
-
|
|
64
|
-
|
|
65
|
-
|
|
66
|
-
|
|
67
|
-
|
|
68
|
-
|
|
69
|
-
|
|
70
|
-
|
|
71
|
-
ok(
|
|
72
|
-
|
|
73
|
-
|
|
74
|
-
|
|
75
|
-
|
|
76
|
-
|
|
77
|
-
|
|
78
|
-
ok(
|
|
79
|
-
|
|
80
|
-
|
|
81
|
-
|
|
82
|
-
|
|
83
|
-
|
|
84
|
-
|
|
85
|
-
|
|
86
|
-
|
|
87
|
-
|
|
88
|
-
|
|
89
|
-
|
|
90
|
-
|
|
91
|
-
|
|
92
|
-
|
|
93
|
-
ok(
|
|
94
|
-
|
|
95
|
-
|
|
96
|
-
|
|
97
|
-
|
|
98
|
-
|
|
99
|
-
|
|
100
|
-
|
|
101
|
-
|
|
102
|
-
ok(
|
|
103
|
-
|
|
104
|
-
|
|
105
|
-
|
|
106
|
-
|
|
107
|
-
|
|
108
|
-
|
|
109
|
-
|
|
110
|
-
|
|
111
|
-
|
|
112
|
-
|
|
113
|
-
|
|
114
|
-
|
|
115
|
-
|
|
116
|
-
|
|
117
|
-
|
|
118
|
-
os.environ["MDCG_EN_ATOMS"] = "1"
|
|
119
|
-
|
|
120
|
-
|
|
121
|
-
|
|
122
|
-
|
|
123
|
-
|
|
124
|
-
|
|
125
|
-
|
|
126
|
-
|
|
127
|
-
|
|
128
|
-
|
|
129
|
-
|
|
130
|
-
|
|
131
|
-
|
|
132
|
-
|
|
133
|
-
|
|
134
|
-
|
|
135
|
-
|
|
136
|
-
|
|
137
|
-
|
|
138
|
-
|
|
139
|
-
|
|
140
|
-
|
|
141
|
-
|
|
142
|
-
|
|
143
|
-
|
|
144
|
-
|
|
145
|
-
|
|
146
|
-
|
|
147
|
-
|
|
148
|
-
|
|
149
|
-
|
|
150
|
-
|
|
151
|
-
|
|
152
|
-
ok(
|
|
153
|
-
|
|
154
|
-
|
|
155
|
-
|
|
156
|
-
|
|
157
|
-
|
|
158
|
-
|
|
159
|
-
|
|
160
|
-
|
|
161
|
-
|
|
162
|
-
|
|
163
|
-
|
|
164
|
-
|
|
165
|
-
|
|
166
|
-
|
|
1
|
+
# -*- coding: utf-8 -*-
|
|
2
|
+
"""原子级中英归一管线(lexicon + semantic + mdcg 集成)· 设计态验收。
|
|
3
|
+
|
|
4
|
+
管线四件套:
|
|
5
|
+
lexicon/build_standard_en.py 英文标准库构建器(牛肉→cow_meat,构建即验证)
|
|
6
|
+
lexicon/standard_en.json 词条真源(语素拼接自洽 + snake_case)
|
|
7
|
+
semantic/en_normalizer.py 英文 query → 中文语素序列(时态归零→停用词→映射→专有词保留)
|
|
8
|
+
semantic/zh_en_atoms.py 中文文本 → 标准英文原子序列(反方向序列化)
|
|
9
|
+
|
|
10
|
+
集成面(mdcg.en_zh_terms → expand_query_terms):
|
|
11
|
+
英→中语素追加为召回词+打分 bigram(en_zh_bigrams);默认关闭
|
|
12
|
+
(双语双路裁定:md_cg 主链路英文走独立 Jaccard 路,见 semantic/REPRODUCE.md),
|
|
13
|
+
MDCG_EN_ATOMS=1 显式开启;纯中文 query 零触发;
|
|
14
|
+
mdcos 四路 RRF 的 lexical 路同源复用 expand_query_terms,自动受益。
|
|
15
|
+
|
|
16
|
+
⚠ 与**统一归一层**的关系(2026-09-24 澄清,曾造成本件红灯):
|
|
17
|
+
`semantic/unify.py::unify_query` 是**另一个、且默认开启**的开关
|
|
18
|
+
(MDCG_UNIFY_QUERY,默认 "1",2026-09-23 口径转正):检索入口把任意语言的
|
|
19
|
+
query 先归一成标准中文原子序列——英文 query 因此在**词法路**上就能命中中文
|
|
20
|
+
节点(与 en_zh_terms 默认关并不矛盾:一个在 query 侧归一,一个在召回词扩展侧)。
|
|
21
|
+
故本件的「跨语词面零交集 ⇒ 召回必须归零」只在**两个开关都关**时成立;
|
|
22
|
+
默认态断言相应改为「命中」,两个态都钉住(改口径必红)。
|
|
23
|
+
|
|
24
|
+
运行:python -m md_cg.test_en_pipeline
|
|
25
|
+
"""
|
|
26
|
+
from __future__ import annotations
|
|
27
|
+
|
|
28
|
+
import io
|
|
29
|
+
import json
|
|
30
|
+
import os
|
|
31
|
+
import shutil
|
|
32
|
+
import tempfile
|
|
33
|
+
|
|
34
|
+
from . import mdcg
|
|
35
|
+
from .semantic import en_normalizer, zh_en_atoms
|
|
36
|
+
|
|
37
|
+
PASS = FAIL = 0
|
|
38
|
+
FAILS = []
|
|
39
|
+
|
|
40
|
+
|
|
41
|
+
def ok(cond, name=""):
|
|
42
|
+
global PASS, FAIL
|
|
43
|
+
if cond:
|
|
44
|
+
PASS += 1
|
|
45
|
+
else:
|
|
46
|
+
FAIL += 1
|
|
47
|
+
FAILS.append(name)
|
|
48
|
+
|
|
49
|
+
|
|
50
|
+
# ---- 1 · en_normalizer:屈折归零 ----
|
|
51
|
+
ok(en_normalizer.strip_tense("Ate") == "eat", "irregular ate→eat")
|
|
52
|
+
ok(en_normalizer.strip_tense("went") == "go", "irregular went→go")
|
|
53
|
+
ok(en_normalizer.strip_tense("regretted") == "regret", "-ed 剥离+双辅音还原")
|
|
54
|
+
ok(en_normalizer.strip_tense("running") == "run", "-ing 剥离+双辅音还原")
|
|
55
|
+
ok(en_normalizer.strip_tense("stopped") == "stop", "stopped→stop")
|
|
56
|
+
ok(en_normalizer.strip_tense("crossed") == "cross", "ss 保留(正字法例外)")
|
|
57
|
+
ok(en_normalizer.strip_tense("called") == "call", "ll 保留(正字法例外)")
|
|
58
|
+
ok(en_normalizer.strip_tense("dogs") == "dog", "-s 复数剥离")
|
|
59
|
+
ok(en_normalizer.strip_tense("class") == "class", "-ss 例外不剥")
|
|
60
|
+
ok(en_normalizer.strip_tense("be") == "be", "短词不动")
|
|
61
|
+
|
|
62
|
+
# ---- 2 · en_normalizer:停用词 / 专有词 / 复合词 ----
|
|
63
|
+
t, d = en_normalizer.normalize_en_query("I eat beef yesterday")
|
|
64
|
+
ok(t == ["我", "吃", "牛肉", "昨天"], "端到端映射 beef→牛肉: %s" % t)
|
|
65
|
+
t2, _ = en_normalizer.normalize_en_query("Caroline went to Paris")
|
|
66
|
+
ok("Caroline" in t2 and "Paris" in t2, "专有词保留原名: %s" % t2)
|
|
67
|
+
ok(en_normalizer.normalize_en_query("soul hub")[0] == ["灵枢"], "短语级复合 soul hub→灵枢")
|
|
68
|
+
ok(en_normalizer.normalize_en_query("beef")[0] == ["牛肉"], "单词级复合 beef→牛肉")
|
|
69
|
+
ok(en_normalizer.normalize_en_query("xyzzy")[0] == ["xyzzy"], "未知词 unknown_keep")
|
|
70
|
+
t3, _ = en_normalizer.normalize_en_query("The dogs were running")
|
|
71
|
+
ok("the" not in [x.lower() for x in t3] and "were" not in [x.lower() for x in t3],
|
|
72
|
+
"停用词剔除: %s" % t3)
|
|
73
|
+
|
|
74
|
+
# ---- 2b · 置信分层与第三方暴露面修正(2026-09-15,第三方 LoCoMo 报告发现 5)----
|
|
75
|
+
# 置信信号:mapped 词带 source(manual=人工校对层 / cedict=机械反查层)与
|
|
76
|
+
# low_confidence(cedict 层=True——第一义项直译语境失配风险,警告不拒绝)
|
|
77
|
+
t4, d4 = en_normalizer.normalize_en_query("The scavenger hunt was fun")
|
|
78
|
+
ok("寻宝游戏" in t4, "内嵌短语扫描 scavenger hunt→寻宝游戏(长文本内生效): %s" % t4)
|
|
79
|
+
ok(d4 and d4[0].get("action") == "phrase_inline", "phrase_inline 留痕: %s" % d4[:1])
|
|
80
|
+
ok(en_normalizer.normalize_en_query("scared")[0] == ["害怕"],
|
|
81
|
+
"手工层修正 scared→害怕(错切链路 scar×CEDICT 创痕)")
|
|
82
|
+
ok(en_normalizer.normalize_en_query("shelter")[0] == ["收容所"], "手工层修正 shelter→收容所")
|
|
83
|
+
ok(en_normalizer.normalize_en_query("tough")[0] == ["坚强"], "手工层修正 tough→坚强")
|
|
84
|
+
ok(en_normalizer.normalize_en_query("three times a week")[0] == ["每周三次"],
|
|
85
|
+
"短语 three times a week→每周三次")
|
|
86
|
+
ok(en_normalizer.normalize_en_query("times")[0] == ["次"], "手工层修正 times→次")
|
|
87
|
+
t6, d6 = en_normalizer.normalize_en_query("great and thanks")
|
|
88
|
+
lowc = [dd for dd in d6 if dd.get("action") == "mapped"]
|
|
89
|
+
ok(lowc and all(dd.get("source") == "cedict" and dd.get("low_confidence") is True
|
|
90
|
+
for dd in lowc), "CEDICT 机械层命中=低置信: %s" % d6)
|
|
91
|
+
t7, d7 = en_normalizer.normalize_en_query("pottery was great")
|
|
92
|
+
mfd = [dd for dd in d7 if dd.get("orig", "").lower() == "pottery"]
|
|
93
|
+
ok(mfd and mfd[0].get("source") == "manual" and mfd[0].get("low_confidence") is False,
|
|
94
|
+
"人工校对层=高置信+来源透出: %s" % mfd)
|
|
95
|
+
ok(en_normalizer.low_confidence_terms(d6) == ["great", "thanks"],
|
|
96
|
+
"low_confidence_terms 审计提取(去重保序): %s" % en_normalizer.low_confidence_terms(d6))
|
|
97
|
+
|
|
98
|
+
# ---- 3 · zh_en_atoms:中文→标准英文原子序列 ----
|
|
99
|
+
ok(zh_en_atoms.serialize("我昨天吃牛肉") == "i yester day eat cow meat",
|
|
100
|
+
"serialize 复合词拆原子")
|
|
101
|
+
ok(zh_en_atoms.serialize("灵枢记忆库") == "soul hub memory store", "serialize 灵枢记忆库")
|
|
102
|
+
ok(zh_en_atoms.segment("吃牛肉") == ["吃", "牛肉"], "贪心最长匹配")
|
|
103
|
+
|
|
104
|
+
# ---- 4 · mdcg.en_zh_terms:集成单元(双态:默认关 / MDCG_EN_ATOMS=1 开) ----
|
|
105
|
+
ok(mdcg.en_zh_terms("I eat beef yesterday") == [],
|
|
106
|
+
"默认关闭:en_zh_terms 不触发(双语双路裁定)")
|
|
107
|
+
os.environ["MDCG_EN_ATOMS"] = "1"
|
|
108
|
+
ok(mdcg.en_zh_terms("I eat beef yesterday") == ["吃", "牛肉", "昨天"],
|
|
109
|
+
"开启:en_zh_terms 三语素(代词剔除): %s" % mdcg.en_zh_terms("I eat beef yesterday"))
|
|
110
|
+
ok(mdcg.en_zh_terms("我昨天吃了牛肉面") == [], "纯中文零触发")
|
|
111
|
+
ok(all(t not in mdcg._EN_ZH_PRONOUNS for t in mdcg.en_zh_terms("She saw my dog")),
|
|
112
|
+
"代词全剔除、实词保留")
|
|
113
|
+
os.environ["MDCG_EN_ATOMS"] = "0"
|
|
114
|
+
ok(mdcg.en_zh_terms("I eat beef") == [], "显式关闭回退 legacy")
|
|
115
|
+
del os.environ["MDCG_EN_ATOMS"]
|
|
116
|
+
|
|
117
|
+
# ---- 5 · expand_query_terms:召回词融合 + 纯中文回归守卫 ----
|
|
118
|
+
os.environ["MDCG_EN_ATOMS"] = "1"
|
|
119
|
+
et = mdcg.expand_query_terms("I ate beef yesterday")
|
|
120
|
+
ok("牛肉" in et and "昨天" in et, "开启:英文 query 产出中文召回词: %s" % et)
|
|
121
|
+
ok("eat" in et, "形态归一仍在(ate→eat)")
|
|
122
|
+
del os.environ["MDCG_EN_ATOMS"]
|
|
123
|
+
ok("牛肉" not in mdcg.expand_query_terms("I ate beef yesterday"),
|
|
124
|
+
"默认关闭:expand_query_terms 回 legacy(无中文语素)")
|
|
125
|
+
_zc = "抑制剂怎么选择效果好"
|
|
126
|
+
os.environ["MDCG_EN_ATOMS"] = "1"
|
|
127
|
+
zc_on = mdcg.expand_query_terms(_zc)
|
|
128
|
+
del os.environ["MDCG_EN_ATOMS"]
|
|
129
|
+
zc_off = mdcg.expand_query_terms(_zc)
|
|
130
|
+
ok(zc_on == zc_off, "纯中文 query 开关前后零差异(回归守卫)")
|
|
131
|
+
|
|
132
|
+
# ---- 6 · 端到端:英文 query 召回中文记忆 ----
|
|
133
|
+
tmp = tempfile.mkdtemp(prefix="mdcg_en_pipe_")
|
|
134
|
+
try:
|
|
135
|
+
cg = mdcg.MdCG(root=tmp)
|
|
136
|
+
cg.add("n_beef", "昨天中午我在家里吃了牛肉面,配了可乐。",
|
|
137
|
+
layer="contextual", verification_basis="data")
|
|
138
|
+
cg.add("n_unrel", "我喜欢在雨天听爵士乐。",
|
|
139
|
+
layer="contextual", verification_basis="data")
|
|
140
|
+
cg.flush()
|
|
141
|
+
os.environ["MDCG_EN_ATOMS"] = "1"
|
|
142
|
+
res, _meta = cg.search("I ate beef yesterday", judge=False)
|
|
143
|
+
ids = [r[0].get("id") for r in res]
|
|
144
|
+
del os.environ["MDCG_EN_ATOMS"]
|
|
145
|
+
ok(len(res) >= 1 and ids[0] == "n_beef", "开启:英文 query top1 召回中文牛肉节点 %s" % ids)
|
|
146
|
+
# 默认(两个开关都不设):**统一归一层**(MDCG_UNIFY_QUERY 默认 "1")把英文
|
|
147
|
+
# query 归一成中文原子序列 → 词法路直达中文节点。这是 2026-09-23 使用者拍板的
|
|
148
|
+
# 口径转正(semantic/unify.py),与旧的「跨语词面零交集」契约相反:
|
|
149
|
+
# 旧断言已按新口径改写——默认态断言「命中」,unify=0 才断言「归零」。
|
|
150
|
+
res_u, _mu = cg.search("I ate beef yesterday", judge=False)
|
|
151
|
+
ids_u = [r[0].get("id") for r in res_u]
|
|
152
|
+
ok(len(res_u) >= 1 and ids_u[0] == "n_beef",
|
|
153
|
+
"默认(unify 开):英文 query 经统一归一后 top1 命中中文节点 %s" % ids_u)
|
|
154
|
+
os.environ["MDCG_UNIFY_QUERY"] = "0"
|
|
155
|
+
try:
|
|
156
|
+
res0, _m0 = cg.search("I ate beef yesterday", judge=False) # 关归一+EN_ATOMS 关
|
|
157
|
+
finally:
|
|
158
|
+
os.environ.pop("MDCG_UNIFY_QUERY", None)
|
|
159
|
+
ok(not res0 or all(r[1] <= 0 for r in res0),
|
|
160
|
+
"unify=0 且 EN_ATOMS 关:词面零重叠召回归零(跨语断点复现)")
|
|
161
|
+
finally:
|
|
162
|
+
shutil.rmtree(tmp, ignore_errors=True)
|
|
163
|
+
|
|
164
|
+
# ---- 7 · 构建自洽:standard_en.json / search_index.json ----
|
|
165
|
+
_here = os.path.dirname(os.path.abspath(__file__))
|
|
166
|
+
std = json.load(io.open(os.path.join(_here, "lexicon", "standard_en.json"), encoding="utf-8"))
|
|
167
|
+
entries = {e["zh"]: e for e in std["entries"]}
|
|
168
|
+
ok(len(entries) == 62, "词条数 62(真源守卫)")
|
|
169
|
+
ok(entries["牛肉"]["standard_en"] == "cow_meat" and "beef" in entries["牛肉"]["legacy_en"],
|
|
170
|
+
"牛肉=cow_meat(legacy 别名 beef)")
|
|
171
|
+
ok(entries["火山"]["standard_en"] == "fire_mountain", "语素序直拼 火山=fire_mountain")
|
|
172
|
+
ok(sum(1 for e in std["entries"] if e["class"] == "opaque") == 5, "opaque 化石词 5 条")
|
|
173
|
+
si = json.load(io.open(os.path.join(_here, "semantic", "search_index.json"), encoding="utf-8"))
|
|
174
|
+
ok(si["meta"]["atom_count"] == 815 and si["meta"]["zh_terms"] == 815,
|
|
175
|
+
"search_index 与 atoms 数一致")
|
|
176
|
+
ok(si["en_index"].get("meat") and "牛肉" in si["en_index"]["meat"],
|
|
177
|
+
"en_index 倒排 meat→牛肉")
|
|
178
|
+
|
|
179
|
+
# ---- 8 · mdcos lexical 路同源受益 ----
|
|
180
|
+
from .mdcos import MdCGOS
|
|
181
|
+
from .mdcg import expand_query_terms as _eqt
|
|
182
|
+
ok(_eqt is mdcg.expand_query_terms, "mdcos 复用同一 expand_query_terms(同源单实现)")
|
|
183
|
+
|
|
184
|
+
print("en_pipeline: %d assertions all green" % PASS if not FAIL
|
|
185
|
+
else "en_pipeline: %d passed, %d FAILED: %s" % (PASS, FAIL, FAILS))
|
|
186
|
+
raise SystemExit(1 if FAIL else 0)
|