@furongjun1999/dsh-memory 0.4.8 → 0.4.9

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (231) hide show
  1. package/README.md +54 -26
  2. package/codebuddy/CODEBUDDY.md +196 -195
  3. package/codebuddy/README.md +13 -1
  4. package/codebuddy/mcp.json +9 -0
  5. package/docs/GBrain/345/217/257/345/200/237/351/211/264/347/202/271_/347/201/265/346/236/242/350/220/275/347/202/271/344/272/244/346/216/245_20260919.md +169 -0
  6. package/docs/README.md +1 -1
  7. package/docs/discipline/harnesses.yaml +18 -7
  8. package/docs/discipline/templates/full.md.tmpl +4 -3
  9. package/docs/experiments/linkref_backfill/candidates_20260917.json +726 -0
  10. package/docs/experiments/linkref_backfill/candidates_internal_20260917.json +602 -0
  11. package/docs/experiments/linkref_backfill/candidates_internal_v2.json +603 -0
  12. package/docs/experiments/linkref_backfill/candidates_secret_20260917.json +884 -0
  13. package/docs/experiments/linkref_backfill/candidates_secret_v2.json +789 -0
  14. package/docs/hive//345/244/232/347/253/257harness/351/200/232/344/277/241/345/245/221/347/272/246_v0.1.md +42 -0
  15. package/docs/hive//346/243/200/347/264/242/346/224/266/346/225/233/345/256/236/346/265/213/344/270/216S1b/350/256/276/350/256/241_v0.1.md +43 -0
  16. package/docs/hive//346/243/200/347/264/242/350/267/257/345/276/204/344/270/216/350/256/244/347/237/245/347/273/223/346/236/204/345/245/221/347/272/246_v0.1.md +102 -0
  17. package/docs/hive//347/234/237/345/256/236/345/272/223/347/253/257/345/210/260/347/253/257/345/256/236/346/265/213_S1b/344/270/216/345/217/254/345/233/236/346/235/203/350/241/241_v0.1.md +57 -0
  18. package/docs/hive//347/234/237/345/256/236/345/272/223/347/253/257/345/210/260/347/253/257/345/256/236/346/265/213_S7/345/200/222/346/216/222/345/200/231/351/200/211/345/261/202_v0.1.md +126 -0
  19. package/docs/hive//350/234/202/345/267/242/345/217/214/345/256/236/344/276/213/344/272/222/351/252/214_/350/256/276/350/256/241/345/256/232/347/250/277.md +503 -0
  20. package/docs/mdcg/D_meta_/345/267/245/347/250/213/345/214/226/346/226/271/346/241/210_v0.2.md +216 -0
  21. package/docs/mdcg/README/350/257/246/347/273/206/347/211/210_v0.4.5.md +631 -625
  22. package/docs/mdcg//344/273/243/347/240/201/350/257/204/345/256/241/344/270/216/346/235/241/344/273/266/345/214/226/346/263/250/351/207/212_/345/245/221/347/272/246_v0.1.md +82 -0
  23. package/docs/mdcg//345/205/250/345/272/223/344/273/243/347/240/201/350/257/204/345/256/241/344/270/216/346/235/241/344/273/266/345/214/226/346/263/250/351/207/212_/350/256/241/345/210/222_v0.1.md +600 -0
  24. package/docs/mdcg//345/212/237/350/203/275/350/260/203/347/224/250/346/230/240/345/260/204/350/241/250_v0.1.md +47 -45
  25. package/docs/mdcg//345/255/220/344/273/243/347/220/206/351/205/215/347/275/256/346/240/207/345/207/{206_v0.4.md → 206_v0.5.md} +92 -4
  26. package/docs/mdcg//347/201/265/346/236/242/350/256/260/345/277/206/345/212/250/350/257/215/345/215/217/350/256/256_v1.0-draft.md +172 -0
  27. package/docs/mdcg//347/216/257/344/272/214_/347/231/275/347/256/261/345/241/253/345/205/205/346/265/201/346/260/264/347/272/277_v0.1.md +31 -0
  28. package/docs/mdcg//350/267/250/347/253/257/351/252/214/350/257/201/344/270/216/345/220/214/346/255/245/345/215/217/350/256/256_v0.1.md +93 -0
  29. package/docs/theory//345/271/266/345/217/221/345/277/205/347/204/266/346/200/247/347/220/206/350/256/272_v0.2.md +2 -2
  30. package/docs/theory//347/220/206/350/256/272_/346/234/272/345/210/266_/344/273/243/347/240/201_/345/256/236/351/252/214_/347/274/272/345/217/243/347/237/251/351/230/265_v0.1.md +3 -3
  31. package/docs/theory//350/256/244/347/237/245/344/273/243/347/220/206/344/270/216/346/224/266/346/225/233/347/273/223/346/236/204_/346/235/241/344/273/266/350/256/272/351/207/215/346/236/204_v0.1.md +2 -2
  32. package/docs//345/267/245/344/275/234/347/272/252/345/276/213_/350/256/244/347/237/245/345/233/276/346/235/241/347/233/256_v1.1.json +434 -433
  33. package/docs//347/201/265/346/236/242/350/207/252/346/210/221/346/224/271/350/277/233/345/267/245/344/275/234/350/256/241/345/210/222_/345/244/226/351/203/250/347/240/224/347/251/266/347/263/273/345/210/227/345/220/270/346/224/266_v1_20260919.md +286 -0
  34. package/dsh/README.md +33 -0
  35. package/dsh/cordis.yml.example +13 -7
  36. package/dsh/hive-mcp-probe.mjs +94 -0
  37. package/dsh/hive-mcp.example.yml +62 -0
  38. package/dsh/update-lingshu.bat +11 -0
  39. package/dsh/update-lingshu.ps1 +337 -0
  40. package/lib/hooks.d.ts +3 -0
  41. package/lib/hooks.js +17 -23
  42. package/lib/index.d.ts +4 -2
  43. package/lib/index.js +29 -6
  44. package/lib/lib/datapath.d.ts +76 -1
  45. package/lib/lib/datapath.js +199 -13
  46. package/lib/lib/mdcg_client.d.ts +6 -3
  47. package/lib/lib/mdcg_client.js +6 -5
  48. package/lib/lib/mutual.js +4 -4
  49. package/lib/lib/token_store.js +4 -5
  50. package/md_cg/audit.py +17 -2
  51. package/md_cg/autonomy.py +86 -15
  52. package/md_cg/backfill.py +36 -1
  53. package/md_cg/backfill_bigdomain.py +34 -0
  54. package/md_cg/bench6_arms.py +28 -1
  55. package/md_cg/bench6_common.py +10 -1
  56. package/md_cg/bench6_competitors.py +6 -1
  57. package/md_cg/bench_axis_domain.py +9 -1
  58. package/md_cg/bench_blind_comp.py +7 -1
  59. package/md_cg/bench_en_atoms_public.py +9 -0
  60. package/md_cg/bench_governance.py +348 -0
  61. package/md_cg/bench_lme_zh.py +16 -1
  62. package/md_cg/bench_locomo.py +2 -1
  63. package/md_cg/bench_locomo_zh.py +16 -1
  64. package/md_cg/bench_locomo_zh_public.py +4 -1
  65. package/md_cg/bench_longmem.py +2 -1
  66. package/md_cg/bench_membench.py +27 -1
  67. package/md_cg/bench_p0.py +4 -1
  68. package/md_cg/bench_progressive.py +13 -1
  69. package/md_cg/bench_role_views.py +238 -0
  70. package/md_cg/bench_task_ab.py +8 -1
  71. package/md_cg/bench_task_ab_llm.py +13 -1
  72. package/md_cg/bench_unified_en.py +6 -1
  73. package/md_cg/bench_zh_mad.py +20 -1
  74. package/md_cg/blindspot_tickets.py +123 -0
  75. package/md_cg/branches.py +12 -1
  76. package/md_cg/build_postings.py +73 -0
  77. package/md_cg/ccgc.py +67 -2
  78. package/md_cg/census.py +5 -1
  79. package/md_cg/chain.py +24 -3
  80. package/md_cg/codeindex.py +134 -17
  81. package/md_cg/coldverify.py +265 -0
  82. package/md_cg/comment_gate.py +338 -0
  83. package/md_cg/cond_compose.py +190 -0
  84. package/md_cg/cond_facts.py +155 -0
  85. package/md_cg/cond_template.json +107 -0
  86. package/md_cg/condition_anchor.py +143 -0
  87. package/md_cg/conformance.py +69 -4
  88. package/md_cg/consistency.py +24 -1
  89. package/md_cg/consolidate.py +53 -2
  90. package/md_cg/corpus.py +4 -0
  91. package/md_cg/crosscheck.py +42 -2
  92. package/md_cg/crypto.py +35 -1
  93. package/md_cg/d_meta.py +310 -0
  94. package/md_cg/datapath.py +201 -26
  95. package/md_cg/docindex.py +122 -1
  96. package/md_cg/eval_common.py +29 -1
  97. package/md_cg/evidence.py +27 -1
  98. package/md_cg/evolution.py +21 -1
  99. package/md_cg/export.py +11 -1
  100. package/md_cg/forgetting.py +23 -1
  101. package/md_cg/fsutil.py +18 -1
  102. package/md_cg/hotcache.py +214 -0
  103. package/md_cg/hyperedge.py +251 -0
  104. package/md_cg/identity.py +18 -1
  105. package/md_cg/insight.py +17 -1
  106. package/md_cg/lexicon/build_cedict_en_zh.py +9 -0
  107. package/md_cg/lexicon/build_standard_en.py +171 -168
  108. package/md_cg/lexicon/expand_en_zh.py +6 -0
  109. package/md_cg/lifecycle.py +12 -1
  110. package/md_cg/linkref.py +281 -0
  111. package/md_cg/links.py +29 -1
  112. package/md_cg/mcp_server.py +362 -43
  113. package/md_cg/md_whitebox.py +53 -1
  114. package/md_cg/mdcg.py +1003 -27
  115. package/md_cg/mdcos.py +558 -36
  116. package/md_cg/metacognition.py +37 -2
  117. package/md_cg/migrate.py +4 -0
  118. package/md_cg/migrate_aeis.py +221 -213
  119. package/md_cg/migrate_roleplay.py +8 -0
  120. package/md_cg/migrate_wisdom_graph.py +14 -1
  121. package/md_cg/mreview/__main__.py +3 -0
  122. package/md_cg/mreview/bundle.py +8 -0
  123. package/md_cg/mreview/candidates.py +9 -0
  124. package/md_cg/mreview/govern.py +21 -1
  125. package/md_cg/mreview/locate.py +34 -0
  126. package/md_cg/mreview/pipeline.py +29 -1
  127. package/md_cg/mreview/ruleset.py +16 -1
  128. package/md_cg/nodefile.py +233 -3
  129. package/md_cg/pooling.py +23 -1
  130. package/md_cg/postings.py +298 -0
  131. package/md_cg/predict.py +89 -9
  132. package/md_cg/progressive.py +3 -0
  133. package/md_cg/protect.py +14 -1
  134. package/md_cg/protocol.py +372 -0
  135. package/md_cg/provenance.py +262 -0
  136. package/md_cg/reach.py +453 -0
  137. package/md_cg/refindex.py +47 -2
  138. package/md_cg/refine.py +20 -1
  139. package/md_cg/roleviews.py +89 -0
  140. package/md_cg/routing.py +76 -0
  141. package/md_cg/scrub.py +63 -2
  142. package/md_cg/security.py +26 -1
  143. package/md_cg/self_state.py +64 -1
  144. package/md_cg/selfreport.py +151 -0
  145. package/md_cg/semantic/canonical.py +5 -0
  146. package/md_cg/semantic/en_normalizer.py +364 -355
  147. package/md_cg/semantic/zh_en_atoms.py +139 -136
  148. package/md_cg/signer.py +41 -1
  149. package/md_cg/sources.py +583 -547
  150. package/md_cg/statushdr.py +179 -0
  151. package/md_cg/stg.py +59 -18
  152. package/md_cg/subgraph.py +23 -0
  153. package/md_cg/sustain.py +56 -1
  154. package/md_cg/tasks.py +26 -2
  155. package/md_cg/test_autonomy.py +26 -0
  156. package/md_cg/test_bench_governance.py +102 -0
  157. package/md_cg/test_blindspot_tickets.py +166 -0
  158. package/md_cg/test_ccgc.py +10 -0
  159. package/md_cg/test_codeindex.py +338 -0
  160. package/md_cg/test_comment_gate.py +187 -0
  161. package/md_cg/test_cond_compose_anchors.py +76 -0
  162. package/md_cg/test_condition_anchor.py +82 -0
  163. package/md_cg/test_d_meta.py +412 -0
  164. package/md_cg/test_datapath_root.py +188 -0
  165. package/md_cg/test_gain_gate.py +47 -1
  166. package/md_cg/test_hot_cold.py +187 -0
  167. package/md_cg/test_hyperedge.py +245 -0
  168. package/md_cg/test_linkref.py +306 -0
  169. package/md_cg/test_md_access_parity.py +15 -3
  170. package/md_cg/test_mr_m1.py +108 -18
  171. package/md_cg/test_mr_m3.py +8 -1
  172. package/md_cg/test_p26_refindex.py +49 -20
  173. package/md_cg/test_p27_docindex.py +236 -2
  174. package/md_cg/test_p2_mcp.py +1 -1
  175. package/md_cg/test_p31_insight.py +24 -0
  176. package/md_cg/test_p44_md_whitebox.py +14 -1
  177. package/md_cg/test_protocol.py +243 -0
  178. package/md_cg/test_reach.py +378 -0
  179. package/md_cg/test_reach_keys.py +201 -0
  180. package/md_cg/test_reach_meta_exits.py +145 -0
  181. package/md_cg/test_read_clip.py +8 -4
  182. package/md_cg/test_retr_s1.py +340 -0
  183. package/md_cg/test_retr_s1b.py +209 -0
  184. package/md_cg/test_retr_s3.py +194 -0
  185. package/md_cg/test_retr_s4.py +163 -0
  186. package/md_cg/test_retr_s5.py +200 -0
  187. package/md_cg/test_retr_s6.py +157 -0
  188. package/md_cg/test_retr_s7.py +385 -0
  189. package/md_cg/test_retr_s8_time.py +316 -0
  190. package/md_cg/test_retr_s9_edges.py +286 -0
  191. package/md_cg/test_retr_s9_entity_ctx.py +175 -0
  192. package/md_cg/test_review_conformance.py +59 -2
  193. package/md_cg/test_role_views.py +354 -0
  194. package/md_cg/test_trust.py +361 -0
  195. package/md_cg/test_units_poll.py +71 -0
  196. package/md_cg/test_v14_fixes.py +397 -0
  197. package/md_cg/test_validity_filter.py +280 -0
  198. package/md_cg/test_wisdom_md_store.py +7 -3
  199. package/md_cg/test_writepipe.py +5 -1
  200. package/md_cg/theory.py +16 -1
  201. package/md_cg/tokens.py +40 -8
  202. package/md_cg/tool_face.py +13 -2
  203. package/md_cg/trust.py +943 -0
  204. package/md_cg/twophase.py +12 -1
  205. package/md_cg/units.py +129 -10
  206. package/md_cg/vision_evidence.py +24 -1
  207. package/md_cg/weights.py +24 -1
  208. package/md_cg/whitebox.py +32 -1
  209. package/md_cg/whitebox_kb/data/verify_cache.json +21210 -365
  210. package/md_cg/whitebox_kb/data/verify_savings.jsonl +5078 -0
  211. package/md_cg/whitebox_kb/wisdom/audit_log/chain_heat.json +10 -10
  212. package/md_cg/whitebox_kb/wisdom/code_compose.py +113 -6
  213. package/md_cg/whitebox_kb/wisdom/code_solidified.json +1 -1
  214. package/md_cg/whitebox_kb/wisdom/verifier.py +340 -55
  215. package/md_cg/whitebox_kb/wisdom/wisdom-book-cloud.db +0 -0
  216. package/md_cg/writelimit.py +18 -4
  217. package/md_cg/writepipe.py +178 -7
  218. package/package.json +2 -2
  219. package/skills/skills/designer-perspective/scripts/__pycache__/designer.cpython-310.pyc +0 -0
  220. package/skills/skills/designer-perspective/scripts/designer.py +17 -1
  221. package/skills/skills/designer-perspective/tests/selftest.py +3 -1
  222. package/src/hooks.ts +17 -21
  223. package/src/index.ts +33 -6
  224. package/src/lib/datapath.ts +211 -13
  225. package/src/lib/mdcg_client.ts +12 -8
  226. package/src/lib/mutual.ts +411 -411
  227. package/src/lib/token_store.ts +4 -5
  228. package/zcode/AGENTS.md +196 -195
  229. package/zcode/README.md +4 -0
  230. package/md_cg/whitebox_kb/wisdom/wisdom-book-cloud.db-shm +0 -0
  231. package/md_cg/whitebox_kb/wisdom/wisdom-book-cloud.db-wal +0 -0
@@ -52,11 +52,13 @@ SEG_SPLIT = re.compile(r"([,。;:、,;.!?!?\s]+)")
52
52
 
53
53
  # --------------------------------------------------------------------------- 数据
54
54
 
55
+ # 生效条件:按 path(默认模块常量 DATA)以 utf-8 打开文件逐行 json.loads,仅保留 l.strip() 为真的行,返回解析出的记录列表。
55
56
  def load_rows(path=DATA):
56
57
  with open(path, encoding="utf-8") as f:
57
58
  return [json.loads(l) for l in f if l.strip()]
58
59
 
59
60
 
61
+ # 生效条件:以 root(默认模块常量 ROOT)建 MdCGOS,rows 为假值(None/空容器)时回落 load_rows() 取数据,逐行用 r["id"] 与 r["text"] 调 add,仅当 r["id"] 已在构建开始时取的 cg.index["nodes"] 快照 have 中才 continue(该快照不随新增 id 更新),verbose 假值则不打印,最后 cg.flush() 并返回 cg。
60
62
  def build(root=ROOT, rows=None, verbose=True):
61
63
  """把数据集写进 md 认知图(幂等:同 id 覆盖)。"""
62
64
  rows = rows or load_rows()
@@ -81,6 +83,7 @@ def build(root=ROOT, rows=None, verbose=True):
81
83
 
82
84
  # --------------------------------------------------------------------- 查询构造
83
85
 
86
+ # 生效条件:遍历 SYNONYM_GROUPS_WEIGHTED 每组,按权重降序找第一个出现在当前 out(初值 text,可能已被前组改写)里的词 w,若组内除 w 外还有词则用其中权重最大者 alt 执行一次 out.replace(w, alt, 1) 且 hits+1,随后 break 该组;返回 (out, hits)。
84
87
  def paraphrase(text):
85
88
  """按加权同义词组做一次同义/泛化改写,返回 (改写后, 替换次数)。
86
89
 
@@ -99,6 +102,7 @@ def paraphrase(text):
99
102
  return out, hits
100
103
 
101
104
 
105
+ # 生效条件:text 经 SEG_SPLIT.split 后剔除空白项与分隔符本身得 parts,len(parts)<=1 时原样返回 text,否则按 rng.random() < keep_p(默认 0.5;keep_p 为 0 时全被丢弃)保留片段,若一条未留则回退 [parts[0]],返回拼接串。
102
106
  def drop_segments(text, rng, keep_p=0.5):
103
107
  """随机丢弃约一半语义片段(模拟「记得不全」)。"""
104
108
  parts = [p for p in SEG_SPLIT.split(text)
@@ -111,6 +115,7 @@ def drop_segments(text, rng, keep_p=0.5):
111
115
  return "".join(kept)
112
116
 
113
117
 
118
+ # 生效条件:rows 中 r.get("label")=="signal" 且 r.get("text") 为真的行入选,n 为真值且 n < len(sig) 时才用 random.Random(seed) 抽 n 条(n=0 等假值不抽样),每条产生 orig/head/drop 三条查询,仅在 paraphrase(t[:60]) 的 hits 非零时追加 para 查询,返回 qs。
114
119
  def make_queries(rows, n=250, seed=7):
115
120
  """从 signal 条目构造查询集(多模式)。"""
116
121
  sig = [r for r in rows if r.get("label") == "signal" and r.get("text")]
@@ -131,11 +136,13 @@ def make_queries(rows, n=250, seed=7):
131
136
 
132
137
  # ----------------------------------------------------------------------- 评测
133
138
 
139
+ # 生效条件:传入 cg 后把 cg._read 换成按 entry["path"] 缓存的闭包(该 path 未命中才调用原 _read),返回该 cache 字典。
134
140
  def install_read_cache(cg):
135
141
  """评测是只读的:把节点文件读进内存,避免每次检索重复 1000 次磁盘 I/O。"""
136
142
  cache = {}
137
143
  orig = cg._read
138
144
 
145
+ # 生效条件:entry["path"] 不在闭包 cache 中时调用 orig(entry) 存入该键,随后返回 cache[p](同一 path 后续命中直接取缓存)。
139
146
  def _cached(entry):
140
147
  p = entry["path"]
141
148
  if p not in cache:
@@ -146,6 +153,7 @@ def install_read_cache(cg):
146
153
  return cache
147
154
 
148
155
 
156
+ # 生效条件:对 queries 每条 item 以 cg.search_rrf(item["q"], k=k, paths=arm, judge=False, record=False, path_weights=path_weights, recall_only=recall_only, fusion=fusion) 取结果,rank 记 item["target"] 在返回 ids 中的 1 基位次(不在 ids 中记 0),逐条追加明细后返回 out。
149
157
  def run_arm(cg, queries, arm, k=10, path_weights=None, recall_only=None,
150
158
  fusion="sum"):
151
159
  """跑一臂,返回 per-query 明细。"""
@@ -167,6 +175,7 @@ def run_arm(cg, queries, arm, k=10, path_weights=None, recall_only=None,
167
175
  return out
168
176
 
169
177
 
178
+ # 生效条件:对 queries 每条以 cg.search_rrf(item["q"], k=k, paths=(path,)) 单路取结果,rank 记 item["target"] 的 1 基位次(未命中记 0),fuzzy_hit 恒为 False、expand_source 恒为 None,返回 out。
170
179
  def run_single(cg, queries, path, k=10):
171
180
  """单路独立排序(用于诊断每路的自身质量)。"""
172
181
  out = []
@@ -181,6 +190,7 @@ def run_single(cg, queries, path, k=10):
181
190
  return out
182
191
 
183
192
 
193
+ # 生效条件:rows 为空时返回 None;否则按 n=len(rows) 算 self@1、self@k(0<rank<=k,k 由形参给定)、mrr(仅 rank 非 0 行取 1/rank 再除 n)与标签占比(分母 sum(lab.values()) or 1,无标签时用 1),fuzzy_prov 在 hit_rows 为空时记 0.0。
184
194
  def summarize(rows, k=10):
185
195
  """汇总一个查询模式的指标。"""
186
196
  n = len(rows)
@@ -203,10 +213,12 @@ def summarize(rows, k=10):
203
213
  }
204
214
 
205
215
 
216
+ # 生效条件:把 x 乘 100 后按 5 位宽保留一位小数加百分号返回,源码未对 x 做类型或范围校验。
206
217
  def _pct(x):
207
218
  return f"{x * 100:5.1f}%"
208
219
 
209
220
 
221
+ # 生效条件:r4 长度为 0 时返回 {};否则以 seed 建 rng,对 (1,"self@1") 与 (k,f"self@{k}") 由 r4/r5 的 0<rank<=kk 命中向量算 b01/b10,m=b01+b10 为 0 时 p=1.0 否则取 McNemar 精确单侧和除以 2**m,并用 n_boot 次有放回重采样取 deltas[int(0.025*n_boot)] 与 deltas[int(0.975*n_boot)-1] 为 ci,另加 MRR 键(b01/b10/p 与 ci 均为 None)后返回。
210
222
  def paired_test(r4, r5, k=10, seed=0, n_boot=5000):
211
223
  """配对显著性:bootstrap 95% CI + McNemar 精确单侧 p(H1: 五路更好)。"""
212
224
  from math import comb
@@ -237,6 +249,7 @@ def paired_test(r4, r5, k=10, seed=0, n_boot=5000):
237
249
  return out
238
250
 
239
251
 
252
+ # 生效条件:scopes 以 ("全合并", r4, r5) 起头,仅当某模式在 r4 中有条目时才追加该模式(orig/head/para/drop)的 (模式名, 筛选后 a, 筛选后 b);对每个 scope 用 k、seed 调 paired_test 并逐项打印 self@1、self@k、MRR 的 delta/ci/b01-b10/p,函数本身不返回值。
240
253
  def print_sig(r4, r5, qs, k=10, seed=0):
241
254
  """按查询模式 + 全模式合并,打印配对显著性。"""
242
255
  print(f"\n配对显著性(五路 − 四路,配对 bootstrap 5000 次 + McNemar 精确单侧)")
@@ -260,6 +273,7 @@ def print_sig(r4, r5, qs, k=10, seed=0):
260
273
  print("-" * 66)
261
274
 
262
275
 
276
+ # 生效条件:把 cg._path_fuzzy 换成闭包,原结果按分数降序取前 50 后用 random.Random(seed) 打乱并改写为递减伪分;本函数自身无 return。
263
277
  def patch_shuffled_fuzzy(cg, seed=0):
264
278
  """把 fuzzy 路**候选集保留、内部顺序打乱**(对照:区分「候选集贡献」与「排序质量贡献」)。
265
279
 
@@ -269,6 +283,7 @@ def patch_shuffled_fuzzy(cg, seed=0):
269
283
  rng = random.Random(seed)
270
284
  orig = cg._path_fuzzy
271
285
 
286
+ # 生效条件:以 (query, entries, context, expand=expand) 调用原 _path_fuzzy,结果按分数降序取前 50 条,用闭包 rng 打乱后改写为递减伪分 (node, float(n-i)),返回 (out, str(src)+"+shuffled")。
272
287
  def _shuf(query, entries, context=None, expand=None):
273
288
  out, src = orig(query, entries, context, expand=expand)
274
289
  out = sorted(out, key=lambda x: -x[1])[:50] # fuzzy 真实候选集
@@ -280,10 +295,12 @@ def patch_shuffled_fuzzy(cg, seed=0):
280
295
  cg._path_fuzzy = _shuf
281
296
 
282
297
 
298
+ # 生效条件:把 cg._path_fuzzy 换成忽略 context/expand、对 cg._read_many 全量条目按 random.Random(seed) 随机分降序排序的闭包;本函数自身无 return。
283
299
  def patch_random_path(cg, seed=0):
284
300
  """把第 5 路替换为**全库随机排序**(对照:max 融合机制本身能带来多少增益)。"""
285
301
  rng = random.Random(seed)
286
302
 
303
+ # 生效条件:忽略 context 与 expand,对 cg._read_many(entries, stat) 的每条记录用 rng.random() 打分并降序排序,节点 id 取 fm.get("id") or e["path"],返回 (out, "random")。
287
304
  def _rand(query, entries, context=None, expand=None):
288
305
  stat = {"scanned": 0}
289
306
  out = []
@@ -296,6 +313,7 @@ def patch_random_path(cg, seed=0):
296
313
  cg._path_fuzzy = _rand
297
314
 
298
315
 
316
+ # 生效条件:不使用 cg,直接把 md_cg.mdcos.GLOBAL_CAP 置为 10**9 并返回该值。
299
317
  def patch_symmetric_pool(cg):
300
318
  """【2026-09-16 起已冗余】抬高 GLOBAL_CAP,让 lexical 与 fuzzy 候选池对称。
301
319
 
@@ -311,6 +329,7 @@ def patch_symmetric_pool(cg):
311
329
  return _m.GLOBAL_CAP
312
330
 
313
331
 
332
+ # 生效条件:把 cg._lexical 换成先 cg._read_many(entries, stat) 全量读入、再 cg._score(docs, query, bigrams(query)) 打分的闭包;本函数自身无 return。
314
333
  def patch_lexical_full(cg):
315
334
  """让 lexical 也对**全量候选池**打分(消除「扫描范围」差异,只留排序算法差异)。
316
335
 
@@ -320,6 +339,7 @@ def patch_lexical_full(cg):
320
339
  """
321
340
  from md_cg.mdcg import bigrams
322
341
 
342
+ # 生效条件:entries 经 cg._read_many(entries, stat) 全量读入后交给 cg._score(docs, query, bigrams(query)) 打分并返回其结果。
323
343
  def _lex(query, entries, stat):
324
344
  docs = cg._read_many(entries, stat)
325
345
  return cg._score(docs, query, bigrams(query))
@@ -327,12 +347,14 @@ def patch_lexical_full(cg):
327
347
  cg._lexical = _lex
328
348
 
329
349
 
350
+ # 生效条件:把 cg._read 包装为仅当原 _read 返回的 fm 是 dict 时覆写 fm["importance"]=0.5(非 dict 不修改),返回 (fm, c);本函数自身无 return。
330
351
  def patch_zero_importance(cg):
331
352
  """抹掉 importance:数据集里 signal 的 importance 系统性偏高(≈0.6),
332
353
  而 search_rrf 用 (-score, -importance) 做同分 tie-break → 会泄漏 label。
333
354
  """
334
355
  orig = cg._read
335
356
 
357
+ # 生效条件:orig(entry) 返回的 fm 是 dict 时把 fm["importance"] 设为 0.5(非 dict 不修改),返回 (fm, c)。
336
358
  def _z(entry):
337
359
  fm, c = orig(entry)
338
360
  if isinstance(fm, dict):
@@ -342,6 +364,7 @@ def patch_zero_importance(cg):
342
364
  cg._read = _z
343
365
 
344
366
 
367
+ # 生效条件:cg 与 qs 均须可用;内部先经 cg._candidates() 取候选池、cg._read_many 读正文,再按每题 query terms 统计 _like 命中数;只打印诊断(含 GLOBAL_CAP 与截断计数)并返回 None,不改库;
345
368
  def pool_diag(cg, qs):
346
369
  """候选池对称性诊断:lexical 的 LIKE 命中数是否真的被 GLOBAL_CAP 截断。"""
347
370
  from md_cg import mdcos as _m
@@ -364,6 +387,7 @@ def pool_diag(cg, qs):
364
387
  return 0
365
388
 
366
389
 
390
+ # 生效条件:cg.search_rrf 可用、queries 每项含 q/target/mode 时,对目标未列首的题打印顶替者与目标在 ARM5 各单路的排名,最多打印 limit 例。
367
391
  def diag_failures(cg, queries, k=10, arm=ARM5, limit=6, path_weights=None):
368
392
  """打印失败案例:谁把目标挤掉了、目标在单路里排第几。"""
369
393
  print(f"\n失败案例诊断({'+'.join(arm)},Top-{k} 未把目标排第一)")
@@ -395,6 +419,7 @@ def diag_failures(cg, queries, k=10, arm=ARM5, limit=6, path_weights=None):
395
419
  print(" (无失败案例)")
396
420
 
397
421
 
422
+ # 生效条件:args.ablate=="pool" 时直接返回 pool_diag(cg, qs);=="idcheck" 时对四路 sum 与四路 max 逐条比较 rank/labels 并打印差异数后返回 0;其余取值时先算四路基线与五路 fuzzy max 基线,再按 =="shuffle" 调 patch_shuffled_fuzzy、否则调 patch_random_path 做扰动臂,打印三臂指标后返回 0(k 取 args.k)。
398
423
  def ablate(cg, qs, args):
399
424
  """对照实验:分离「候选集贡献」「排序质量贡献」「融合机制红利」。"""
400
425
  k = args.k
@@ -438,6 +463,7 @@ def ablate(cg, qs, args):
438
463
  return 0
439
464
 
440
465
 
466
+ # 生效条件:argv 经 argparse 解析(--n/--k/--seed/--rebuild/--per-path/--sweep/--diag/--ablate/--sympool/--fusion/--lexfull/--zero-importance 等);外部数据集缺失即抛异常、不静默降级;返回进程退出码;
441
467
  def main():
442
468
  ap = argparse.ArgumentParser()
443
469
  ap.add_argument("--n", type=int, default=250, help="抽样 signal 条数(0=全量)")
@@ -604,4 +630,4 @@ def main():
604
630
 
605
631
  if __name__ == "__main__":
606
632
  sys.stdout = io.TextIOWrapper(sys.stdout.buffer, encoding="utf-8")
607
- sys.exit(main())
633
+ sys.exit(main())
package/md_cg/bench_p0.py CHANGED
@@ -40,6 +40,7 @@ QUERIES = [("能量守恒", "物理学"), ("二分查找", "计算机科学"), (
40
40
  ("事务隔离", "计算机科学")]
41
41
 
42
42
 
43
+ # 生效条件:fn 为可不带参调用的可调用对象时,重复执行 repeat 次并返回耗时(毫秒)的中位数、最小值、最大值三元组。
43
44
  def timeit(fn, repeat=5):
44
45
  ts = []
45
46
  for _ in range(repeat):
@@ -49,6 +50,7 @@ def timeit(fn, repeat=5):
49
50
  return statistics.median(ts), min(ts), max(ts)
50
51
 
51
52
 
53
+ # 生效条件:模块级常量 ROOT 不是目录(not os.path.isdir(ROOT))时打印未找到提示并返回 1;否则在 ROOT 上建 MdCG 依次跑检索延迟、情境对比与写入/维护基准,打印各项统计与耗时,并返回 0。
52
54
  def main():
53
55
  if not os.path.isdir(ROOT):
54
56
  print(f"未找到 md 库 {ROOT},请先跑 python -m md_cg.test_p0")
@@ -81,6 +83,7 @@ def main():
81
83
 
82
84
  # ---- 2. 条件路由(情境正确)vs 全量 vs 朴素全库读盘扫描 ----
83
85
  # 朴素参照:每个查询都把全部节点文件读出来做一次子串匹配(无索引的代价上限)
86
+ # 生效条件:给定 q 时遍历 cg.index["nodes"] 逐个读取 ROOT/e["path"],内容含 q 子串(q 为空串时任何可读内容都命中)即收集其 path,读取抛 OSError 的条目被跳过,返回 hits 列表。
84
87
  def brute_force(q):
85
88
  hits = []
86
89
  for e in cg.index["nodes"].values():
@@ -144,4 +147,4 @@ if __name__ == "__main__":
144
147
  # 会在解释器退出阶段丢缓冲(实测只落盘 444 字节),CI 里会看不到结果。
145
148
  if hasattr(sys.stdout, "reconfigure"):
146
149
  sys.stdout.reconfigure(encoding="utf-8")
147
- sys.exit(main())
150
+ sys.exit(main())
@@ -48,11 +48,13 @@ from md_cg.test_sem_noise import ( # noqa: E402
48
48
  GOLD, GOLD_COND, NEG_TEXTS, NEIGHBORS, QUERY, UNREL_DOCS, _doc)
49
49
 
50
50
 
51
+ # 生效条件:ev、ids 给定时按 ids 顺序找首个满足 nid in ev 的 1-based 位次返回,找不到(或 ids 为空、ev 为空)时返回 0。
51
52
  def rank_of(ev, ids):
52
53
  """gold 在 id 排名中的位次(不在则 0)。"""
53
54
  return next((r for r, nid in enumerate(ids, 1) if nid in ev), 0)
54
55
 
55
56
 
57
+ # 生效条件:rank 为 1 时 st["h1"] 加 1,rank 落在 0<rank<=5 时 st["h5"] 加 1,落在 0<rank<=10 时 st["h10"] 加 1,rank 为真值时 st["rr"] 加 1.0/rank(负 rank 亦进入该分支得负增量),无返回值。
56
58
  def _agg(rank, st):
57
59
  if rank == 1:
58
60
  st["h1"] += 1
@@ -64,6 +66,7 @@ def _agg(rank, st):
64
66
  st["rr"] += 1.0 / rank
65
67
 
66
68
 
69
+ # 生效条件:label、st、n 与可选 extra 给定时打印 label、st["h1"/"h5"/"h10"]*100.0/n、st["rr"]/n 及 extra 组成的行,n 为 0 时因源码直接相除抛 ZeroDivisionError(源码未校验 n)。
67
70
  def _show(label, st, n, extra=""):
68
71
  print(" %-22s hit@1=%5.1f%% hit@5=%5.1f%% hit@10=%5.1f%% "
69
72
  "MRR=%.4f%s" % (label, st["h1"] * 100.0 / n,
@@ -71,6 +74,7 @@ def _show(label, st, n, extra=""):
71
74
  st["rr"] / n, extra))
72
75
 
73
76
 
77
+ # 生效条件:qa、docs 给定时对 docs 每项按 jaccard(qa, na) 降序、id 升序排序并返回其 id 序列,docs 为空返回空列表,qa 为空时全部分数相同故只按 id 升序。
74
78
  def full_rank(qa, docs):
75
79
  """全池 Jaccard 排序 → id 序列(与 run_arm 同判据)。"""
76
80
  scored = sorted(((jaccard(qa, na), nid) for nid, na in docs),
@@ -78,6 +82,7 @@ def full_rank(qa, docs):
78
82
  return [nid for _s, nid in scored]
79
83
 
80
84
 
85
+ # 生效条件:无 required 形参;以模块级常量 CORPUS、QUESTIONS 逐行 json.loads 建语料与题目,每题取 evidence_turns 与 question 分词结果,qa 为空则跳过且不计入 n,最终返回含 g0/g2/g1i/g1f/n/fa10_conservative/avg_pool 的统计字典(分母均以 max(·,1) 兜零)。
81
86
  def exp_locomo():
82
87
  """实验一:原子面渐进三形态。"""
83
88
  t0 = time.time()
@@ -93,6 +98,7 @@ def exp_locomo():
93
98
 
94
99
  pool_sizes = [] # G1 各阶段候选池大小(统计面)
95
100
 
101
+ # 生效条件:used 给定时对其 frozenset 调 full_rank 取前 20 条,把该池大小追加进 pool_sizes,返回由这些 id 与 0.0 组成的二元组列表。
96
102
  def rank_fn(used):
97
103
  ranked = full_rank(frozenset(used), docs)[:20]
98
104
  pool_sizes.append(len(ranked))
@@ -148,6 +154,7 @@ def exp_locomo():
148
154
  "avg_pool": sum(pool_sizes) / max(len(pool_sizes), 1)}
149
155
 
150
156
 
157
+ # 生效条件:无必需形参;自建临时库(tempfile.mkdtemp + MdCGOS)注入 GOLD/NEIGHBORS 语料后跑渐进消歧,finally 清理临时目录;返回指标 dict,不依赖外部数据;
151
158
  def exp_controlled():
152
159
  """实验二:受控干扰池——条件冒充形态下渐进消歧(引擎侧真检索)。"""
153
160
  print("\n[progressive] 实验二 受控干扰池(42+2 节点真实 MdCGOS)")
@@ -177,12 +184,14 @@ def exp_controlled():
177
184
  KW = dict(paths=("lexical", "bucket", "entity", "graph", "fuzzy"),
178
185
  fusion="sum", judge_ranking=True)
179
186
 
187
+ # 生效条件:used 给定时,used 为假值(空列表等)则查询串仅为 QUERY,否则为 QUERY 加空格再加空格连接的 used,再经 cg.search_rrf(k=10, judge=True, **KW) 返回 (id, 分值) 列表。
180
188
  def engine_rank(used):
181
189
  res, _m = cg.search_rrf(QUERY + (" " + " ".join(used)
182
190
  if used else ""),
183
191
  k=10, judge=True, **KW)
184
192
  return [(r[0]["id"], r[1]) for r in res]
185
193
 
194
+ # 生效条件:res 给定时遍历其前 10 项,跳过 r[0]["id"] 属于外层 gold_ids 的项,对余项取 r[2](len(r)<=2 时取空 dict)并仅在 (ji or {}).get("state")=="ACCEPT" 时把该 id 收入,返回收集到的 out 列表。
186
195
  def false_accepts(res):
187
196
  out = []
188
197
  for r in res[:10]:
@@ -194,6 +203,7 @@ def exp_controlled():
194
203
  out.append(nid)
195
204
  return out
196
205
 
206
+ # 生效条件:res 给定时遍历其前 10 项,len(r)>2 时取 (r[2] or {}).get("state")、否则取 None,该值属于 ACCEPT/DEFER/REJECT/BLINDSPOT 四键之一则对应计数、否则计入「无judge」,返回只保留计数非零项的字典(全零则返回空 dict)。
197
207
  def state_dist(res):
198
208
  """渐进循环四态分布(top10 内 judge state 计数,只列非零项)。
199
209
 
@@ -207,6 +217,7 @@ def exp_controlled():
207
217
  d[st if st in d else "无judge"] += 1
208
218
  return {k: v for k, v in d.items() if v}
209
219
 
220
+ # 生效条件:res、fa 给定时返回 100.0*len(fa)/max(1, min(10, len(res))),即 len(res)>=10 时除以 10、不足时除以 len(res),len(res) 为 0 时被 max(1,·) 兜为除数 1。
210
221
  def fa_rate(res, fa):
211
222
  return 100.0 * len(fa) / max(1, min(10, len(res)))
212
223
 
@@ -264,6 +275,7 @@ def exp_controlled():
264
275
  shutil.rmtree(tmp, ignore_errors=True)
265
276
 
266
277
 
278
+ # 生效条件:无 required 形参;先执行 exp_locomo(),再按 exp_controlled() 返回值 ok 的真假返回 0(真)或 1(假)。
267
279
  def main():
268
280
  exp_locomo()
269
281
  ok = exp_controlled()
@@ -273,4 +285,4 @@ def main():
273
285
 
274
286
 
275
287
  if __name__ == "__main__":
276
- raise SystemExit(main())
288
+ raise SystemExit(main())
@@ -0,0 +1,238 @@
1
+ # -*- coding: utf-8 -*-
2
+ """角色化读取视图四臂对照 bench(第四阶段计划批次 D,H5 验收)。
3
+
4
+ 臂:
5
+ A0 基线 view=None + include_work=True(无差别全量读取:
6
+ 不看角色、含工作回执——真无差别口径)
7
+ A1 main 主代理(结论与修正历史)
8
+ A2 verifier 验证端(判据面与环境陷阱)
9
+ A3 receipt 回执审计(命令与预期输出)
10
+
11
+ 指标(复用 budget_tokens 装包口径):
12
+ tokens = recall(budget_tokens=BIG) 的 tokens_used——同等读取意图下
13
+ 实际装入内容的消耗;budget 给足以免截断干扰四臂横比;
14
+ hit@k = gold 在 pack 内位置(k=1/5/10)+ MRR。
15
+
16
+ 跑法:
17
+ 对齐跑 Q_role × view=role 对比 Q_role × 基线——H5 主判据
18
+ (各对齐臂 token 下降 且 命中率不降);
19
+ 隔离跑 错配组合(如 Q_receipt × main 臂)gold 期望不可见——
20
+ view 过滤真实生效的硬边界实证。
21
+
22
+ 语料:确定性构造(固定词面、无随机、无外部数据依赖),临时库自建自清理。
23
+ 退出码:0 = H5 通过;1 = 权衡(如实报告,禁止为凑指标调规则表后不复跑)。
24
+
25
+ 运行:python -m md_cg.bench_role_views
26
+ """
27
+
28
+ import shutil
29
+ import sys
30
+ import tempfile
31
+
32
+ from .mdcos import MdCGSecure
33
+ from .security import Principal
34
+
35
+ BIG_BUDGET = 100000 # 给足预算:四臂横比看内容消耗差异,不受截断干扰
36
+ # 候选集由词面命中决定(检索器语义,非全池排序——探针实证),k 只是宽松
37
+ # 上限:给足以免截断干扰四臂横比;命中率报 hit@1/5/10 + MRR(窗口内位置)。
38
+ TOP_K = 32
39
+
40
+ # ---------------- 语料(确定性;(nid, layer, content_kind, role, content)) ----------------
41
+ _CORPUS = [
42
+ # main 域:结论与修正历史(knowledge + text/work_done,无 role)
43
+ ("bm1", "knowledge", "text", None,
44
+ "发布回滚结论:主支合并验证完成,回滚脚本已归档备查"),
45
+ ("bm2", "knowledge", "work_done", None,
46
+ "编译链修复工作完成:名实校验五处缺陷全部清零"),
47
+ ("bm3", "knowledge", "text", None,
48
+ "缓存刷新结论:快照增量重放语义已锁定不变"),
49
+ ("bm4", "knowledge", "work_done", None,
50
+ "索引迁移完成:三处白名单补齐内容类型字段"),
51
+ ("bm5", "knowledge", "text", None,
52
+ "检索对齐结论:四路融合排序与基线逐位一致"),
53
+ # verifier 域:判据面与环境陷阱(ccg_marks 或 contextual 层 text)
54
+ ("bv1", "knowledge", "ccg_marks", None,
55
+ "环境陷阱判据:GBK 解码异常须显式声明 UTF-8 标志"),
56
+ ("bv2", "knowledge", "ccg_marks", None,
57
+ "静默失败判据:多行内联命令退出码不可信,须脚本文件驱动"),
58
+ ("bv3", "contextual", "text", None,
59
+ "情境上下文实录:命令链尾部被引号换行吞没"),
60
+ ("bv4", "contextual", "ccg_marks", None,
61
+ "情境判据:提交显示成功但推送静默未执行的取证要点"),
62
+ ("bv5", "contextual", "text", None,
63
+ "上下文补充:重建成果曾被陈旧常驻进程覆盖回滚"),
64
+ # receipt 域:命令与预期输出(code + WORK_ROLES)
65
+ ("br1", "knowledge", "code", "command",
66
+ "推送命令:git push origin main,预期输出复核通过"),
67
+ ("br2", "knowledge", "code", "tool-output",
68
+ "状态命令输出:ahead 2 尚未推送,工作区存在改动"),
69
+ ("br3", "knowledge", "code", "edit",
70
+ "补丁片段:--root 参数移动到子命令之后生效"),
71
+ ("br4", "knowledge", "code", "command",
72
+ "导入命令:python migrate_receipts 脚本文件驱动执行"),
73
+ ("br5", "knowledge", "code", "tool-output",
74
+ "测试命令输出:53 ok 0 fail 全绿通过"),
75
+ # 干扰:无差读取臂的背景噪声(视图臂应剔除或降位)
76
+ ("bd1", "knowledge", "text", None, "会议纪要:季度规划讨论了若干方向性议题"),
77
+ ("bd2", "knowledge", "text", None, "读书笔记:系统一致性与反馈回路的一般性介绍"),
78
+ ("bd3", "contextual", "text", None, "闲聊上下文:天气与周末安排的对话残留"),
79
+ ("bd4", "knowledge", "code", None, "示例代码片段:打印问候语的演示脚本"),
80
+ ("bd5", "knowledge", "work_done", None, "例行工作完成记录:周报已按时提交"),
81
+ ("bd6", "knowledge", "ccg_marks", None, "通用判据示例:正常路径与边界条件各自成立"),
82
+ # 跨域诱饵:词面横跨多域——基线(无差别)会命中,视图臂应剔除,
83
+ # 打破「各域词面天然隔离」的失真(首跑实证:verifier 臂 -0.0% 的根因)。
84
+ ("dk1", "knowledge", "work_done", None,
85
+ "判据复盘工作完成:陷阱用例与命令输出的归档记录"),
86
+ ("dk2", "contextual", "text", None,
87
+ "结论情境补充:命令归档上下文中的判据留痕"),
88
+ ("dk3", "knowledge", "code", "command",
89
+ "对照命令:结论与判据的输出对照脚本"),
90
+ ]
91
+
92
+ # ---------------- 三角色查询集(每题唯一 gold;词面与 gold 共享中文 2-gram) ----------------
93
+ _QUERY_SETS = {
94
+ "main": [
95
+ ("回滚 结论 归档", "bm1"),
96
+ ("编译链 修复 完成", "bm2"),
97
+ ("缓存 刷新 结论", "bm3"),
98
+ ("索引 迁移 完成", "bm4"),
99
+ ("检索 对齐 一致", "bm5"),
100
+ ],
101
+ "verifier": [
102
+ ("陷阱 判据 编码", "bv1"),
103
+ ("判据 静默 失败", "bv2"),
104
+ ("上下文 吞没 陷阱", "bv3"),
105
+ ("情境 判据 取证", "bv4"),
106
+ ("上下文 覆盖 成果", "bv5"),
107
+ ],
108
+ "receipt": [
109
+ ("推送 命令 输出", "br1"),
110
+ ("状态 输出 推送", "br2"),
111
+ ("补丁 参数 子命令", "br3"),
112
+ ("导入 命令 脚本", "br4"),
113
+ ("测试 输出 全绿", "br5"),
114
+ ],
115
+ }
116
+
117
+ # 对齐跑:查询集 → 自己的视图臂
118
+ _ALIGNED = {"main": "main", "verifier": "verifier", "receipt": "receipt"}
119
+ # 隔离跑(硬边界):这些组合 gold 期望不可见
120
+ # receipt 域 gold 带 WORK_ROLES → main/verifier 臂 include_work=False 一票否决;
121
+ # main/verifier 域 gold 无 role → receipt 白名单不收。
122
+ _ISOLATED = [("receipt", "main"), ("receipt", "verifier"),
123
+ ("main", "receipt"), ("verifier", "receipt")]
124
+
125
+
126
+ def _mk_cg():
127
+ tmp = tempfile.mkdtemp(prefix="mdcg_bench_rv_")
128
+ p = Principal(tenant="default", actor="bench_role_views", role="designer",
129
+ can_write=True, can_admin=True)
130
+ cg = MdCGSecure(tmp, principal=p)
131
+ for nid, layer, ck, role, content in _CORPUS:
132
+ kw = {"layer": layer, "content_kind": ck}
133
+ if role is not None:
134
+ kw["role"] = role
135
+ cg.add(nid, content, **kw)
136
+ return cg, tmp
137
+
138
+
139
+ def _run_arm(cg, query, view, include_work=False):
140
+ """单题单臂:返回 (pack 内 id 序列, tokens_used)。
141
+
142
+ 基线臂传 include_work=True——「无差别全量读取」的忠实口径:
143
+ 若基线沿用默认 include_work=False,receipt 域(WORK_ROLES)在基线
144
+ 完全不可见(首跑实证 hit 0%),对照便不公平;视图臂保持默认
145
+ include_work=False——view 非空时 role 维度由视图规则接管(receipt
146
+ 是默认剔除的补集,这正是视图存在的理由之一)。
147
+ """
148
+ rec = cg.recall(query, budget_tokens=BIG_BUDGET, k=TOP_K,
149
+ view=view, include_work=include_work)
150
+ return ([p["id"] for p in rec.get("pack") or []],
151
+ int(rec.get("tokens_used") or 0))
152
+
153
+
154
+ def _metrics(hits_by_k, token_list):
155
+ """hits_by_k: 每题 gold 在 pack 的 1-based 位置(不可见=0)。"""
156
+ n = len(token_list)
157
+ mrr = sum(1.0 / h for h in hits_by_k if h > 0) / max(n, 1)
158
+ return {"hit@1": sum(1 for h in hits_by_k if 1 <= h <= 1) / n,
159
+ "hit@5": sum(1 for h in hits_by_k if 1 <= h <= 5) / n,
160
+ "hit@10": sum(1 for h in hits_by_k if 1 <= h <= 10) / n,
161
+ "mrr": mrr,
162
+ "tokens": sum(token_list) / n}
163
+
164
+
165
+ def _fmt(m):
166
+ return ("hit@1 %.0f%% hit@5 %.0f%% hit@10 %.0f%% MRR %.3f tokens %.0f"
167
+ % (m["hit@1"] * 100, m["hit@5"] * 100, m["hit@10"] * 100,
168
+ m["mrr"], m["tokens"]))
169
+
170
+
171
+ def main():
172
+ cg, tmp = _mk_cg()
173
+ ok = True
174
+ try:
175
+ print("==== bench_role_views:角色化读取视图四臂对照(H5) ====")
176
+ print("语料 %d 节点(main 域 5 / verifier 域 5 / receipt 域 5 / "
177
+ "干扰 6 / 跨域诱饵 3),查询 3 类 × 5 题,k=%d,budget=%d"
178
+ % (len(_CORPUS), TOP_K, BIG_BUDGET))
179
+
180
+ # ---------- 对齐跑(H5 主判据) ----------
181
+ print("\n---- 对齐跑:Q_role × view=role vs 基线(含诱饵词面跨域命中) ----")
182
+ token_pass, hit_pass = True, True
183
+ for role, view in _ALIGNED.items():
184
+ qs = _QUERY_SETS[role]
185
+ pos0, tok0 = [], []
186
+ posv, tokv = [], []
187
+ for q, gold in qs:
188
+ ids0, t0 = _run_arm(cg, q, None, include_work=True)
189
+ idsv, tv = _run_arm(cg, q, view)
190
+ pos0.append(ids0.index(gold) + 1 if gold in ids0 else 0)
191
+ posv.append(idsv.index(gold) + 1 if gold in idsv else 0)
192
+ tok0.append(t0)
193
+ tokv.append(tv)
194
+ m0, mv = _metrics(pos0, tok0), _metrics(posv, tokv)
195
+ drop = (m0["tokens"] - mv["tokens"]) / m0["tokens"] * 100.0
196
+ t_ok = mv["tokens"] < m0["tokens"]
197
+ h_ok = (mv["hit@1"] >= m0["hit@1"] and mv["hit@5"] >= m0["hit@5"]
198
+ and mv["hit@10"] >= m0["hit@10"] and mv["mrr"] >= m0["mrr"])
199
+ token_pass &= t_ok
200
+ hit_pass &= h_ok
201
+ print("\n[%s] view=%s(token %s)" %
202
+ (role, view, "下降" if t_ok else "未下降"))
203
+ print(" 基线 %s" % _fmt(m0))
204
+ print(" %s %s (%+.1f%% tokens)" %
205
+ (view.ljust(9), _fmt(mv), -drop))
206
+
207
+ # ---------- 隔离跑(硬边界实证) ----------
208
+ print("\n---- 隔离跑:错配组合 gold 期望不可见 ----")
209
+ iso_pass = True
210
+ for role, view in _ISOLATED:
211
+ missed = 0
212
+ for q, gold in _QUERY_SETS[role]:
213
+ ids, _t = _run_arm(cg, q, view)
214
+ if gold not in ids:
215
+ missed += 1
216
+ this_ok = missed == len(_QUERY_SETS[role])
217
+ iso_pass &= this_ok
218
+ print(" Q_%s × view=%-8s gold 不可见 %d/%d %s"
219
+ % (role, view, missed, len(_QUERY_SETS[role]),
220
+ "" if this_ok else " <-- 泄漏"))
221
+
222
+ # ---------- H5 判定 ----------
223
+ print("\n==== H5 判定 ====")
224
+ print(" 各对齐臂 token 下降 : %s" % ("PASS" if token_pass else "FAIL"))
225
+ print(" 各对齐臂 命中率不降 : %s" % ("PASS" if hit_pass else "FAIL"))
226
+ print(" 隔离跑 无泄漏(辅助证据): %s" % ("PASS" if iso_pass else "FAIL"))
227
+ if not (token_pass and hit_pass):
228
+ print("\n权衡(如实报告,不作单向通过声明):")
229
+ print(" 存在「token 未下降或命中率下降」的对齐臂——")
230
+ print(" 上表数字为准;禁止为凑指标调规则表后不复跑。")
231
+ ok = token_pass and hit_pass
232
+ finally:
233
+ shutil.rmtree(tmp, ignore_errors=True)
234
+ return 0 if ok else 1
235
+
236
+
237
+ if __name__ == "__main__":
238
+ sys.exit(main())
@@ -93,6 +93,7 @@ CASES = [
93
93
  ]
94
94
 
95
95
 
96
+ # 生效条件:给定 text,当 expand_query_terms_weighted(text) 为真值字典时返回其中键不以 `__` 开头的项(键转 str、值转 float),并先弹出 `__source__`;当该调用返回假值(None/空/其他假值)时返回空字典 {};
96
97
  def _terms(text):
97
98
  tw = expand_query_terms_weighted(text) or {}
98
99
  tw.pop("__source__", None)
@@ -100,6 +101,7 @@ def _terms(text):
100
101
  if not str(k).startswith("__")}
101
102
 
102
103
 
104
+ # 生效条件:candidates 非空且 error 可被 _terms 处理时,按 _weighted_coverage 返回覆盖得分最高的候选,字面平局时取候选顺序最前者。
103
105
  def _pick_lexical(error, candidates):
104
106
  """无记忆臂的确定性策略:按字面覆盖选 top-1(字面平局时按候选顺序)。"""
105
107
  tw = _terms(error)
@@ -111,6 +113,7 @@ def _pick_lexical(error, candidates):
111
113
  return best
112
114
 
113
115
 
116
+ # 生效条件:给定 error、candidates、fix、max_turns,在 pool 非空且 turns<max_turns 时每轮把 _pick_lexical(error, pool) 选中的 last 记入 touched:若 last==fix 立即返回 {'success': True, 'turns': turns, 'pick': last, 'touched': touched},否则从 pool 移除 last 继续;候选耗尽或 max_turns 为 0/负值时退出,返回 {'success': False, 'turns': turns, 'pick': last, 'touched': touched}(未进入循环时 success=False、turns=0、pick=None、touched=[]);
114
117
  def _trial(error, candidates, fix, max_turns):
115
118
  """无记忆臂:选错就排除该动作、下一轮重选(模拟试错)。"""
116
119
  pool = list(candidates)
@@ -128,6 +131,7 @@ def _trial(error, candidates, fix, max_turns):
128
131
  "touched": touched}
129
132
 
130
133
 
134
+ # 生效条件:case["fix"] 为真且其字符串出现在 cg.recall(query, budget_tokens=budget, k=20) 返回 pack 各项 content 拼接成的 text 中时返回 hit=True、turns=1、touched=[];否则以 case["error"]、candidates、case["fix"]、max_turns 调 _trial 并回填 hit=False、turns=1+fb["turns"]、tokens=int(tokens_used or 0)。
131
135
  def _decide_mem(cg, query, case, candidates, max_turns, budget):
132
136
  """有记忆臂:先召回,命中修复知识则一次到位;否则回退到试错。"""
133
137
  res = cg.recall(query, budget_tokens=budget, k=20)
@@ -141,10 +145,12 @@ def _decide_mem(cg, query, case, candidates, max_turns, budget):
141
145
  return fb
142
146
 
143
147
 
148
+ # 生效条件:传入 x 时,返回 f"{100.0 * x:.1f}%" 的字符串(即 x 乘以 100 后保留一位小数的百分比表示);
144
149
  def _pct(x):
145
150
  return f"{100.0 * x:.1f}%"
146
151
 
147
152
 
153
+ # 生效条件:rows 为非空序列(n>0)且每项可解包为 (c, rn, rm)、c 含 trap/id/error、rn/rm 含 success/turns/touched(tokens 经 .get('tokens') or 0 把缺键或假值计 0,hit 经 .get 缺键或假值不计数),mined 含 pairs/knowledge_ids/rejected_ids 键,max_turns 为数值时,打印两臂指标与逐例清单,并按首次正确率与重复犯错率的大小关系(提升/相等/其余)输出三分支结论;
148
154
  def _report(rows, mined, max_turns):
149
155
  n = len(rows)
150
156
  print("\n" + "=" * 74)
@@ -204,6 +210,7 @@ def _report(rows, mined, max_turns):
204
210
  print()
205
211
 
206
212
 
213
+ # 生效条件:调用 main(argv) 时由 argparse 解析 argv(argv 为 None 则取 sys.argv[1:]),--cases 为 0 用全部 CASES、非 0(含负值)用 CASES[:a.cases],--max-turns 默认 2,--budget 默认 2000;随后在临时目录创建 none_arm/mem_arm,先用 mem_arm.mine_fix_pairs 从 cases 的 error/fix 写入修复对作为记忆臂命中前置,再逐例以 _trial 与 _decide_mem 生成 rows 并 _report,最终返回 0;
207
214
  def main(argv=None):
208
215
  ap = argparse.ArgumentParser(description="任务级 A/B:无记忆 vs 有记忆")
209
216
  ap.add_argument("--cases", type=int, default=0, help="只用前 N 个用例(0=全部)")
@@ -234,4 +241,4 @@ def main(argv=None):
234
241
 
235
242
 
236
243
  if __name__ == "__main__":
237
- sys.exit(main())
244
+ sys.exit(main())