@furongjun1999/dsh-memory 0.4.11 → 0.5.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (504) hide show
  1. package/README.md +16 -16
  2. package/codebuddy/CODEBUDDY.md +11 -3
  3. package/codebuddy/README.md +92 -90
  4. package/codebuddy/mcp.json +27 -27
  5. package/docs/GBrain/345/217/257/345/200/237/351/211/264/347/202/271_/347/201/265/346/236/242/350/220/275/347/202/271/344/272/244/346/216/245_20260919.md +169 -169
  6. package/docs/Pi/345/217/257/345/255/246/344/271/240/344/274/230/347/202/271_/347/201/265/346/236/242/345/244/247/350/204/221/346/224/271/350/277/233/344/272/244/346/216/245_20260915.md +144 -144
  7. package/docs/README.md +142 -111
  8. package/docs/discipline/harnesses.yaml +244 -226
  9. package/docs/discipline/templates/full.md.tmpl +61 -61
  10. package/docs/discipline/templates/rules.mdc.tmpl +68 -0
  11. package/docs/discipline/templates/skill.md.tmpl +23 -23
  12. package/docs/eval/AGI/344/270/203/347/273/264/350/257/204/345/210/206/346/212/245/345/221/212_md_cg_v1.0.md +299 -299
  13. package/docs/eval/AGI/344/270/203/347/273/264/350/257/204/345/210/206/346/212/245/345/221/212_md_cg_v2.0.md +239 -239
  14. package/docs/eval//345/256/236/351/252/214/346/226/271/346/241/210_/345/255/246/344/271/240/351/227/255/347/216/257AB/344/270/216/346/250/252/350/257/204_v1.0.md +174 -174
  15. package/docs/eval//346/250/252/350/257/204_/345/205/255/345/256/266100/351/242/230/344/270/255/350/213/261/345/217/214/346/237/245_v1.0.md +223 -223
  16. package/docs/{mdcg → hive}//344/273/244/347/211/214/344/270/216/350/247/222/350/211/262/346/235/203/350/201/214/345/210/206/347/246/273_v0.1.md +165 -160
  17. package/docs/hive//344/273/244/347/211/214/350/257/255/344/271/211/344/277/256/346/255/243_/344/273/262/350/243/201/344/275/215_v0.1.md +76 -0
  18. package/docs/{mdcg → hive}//345/255/220/344/273/243/347/220/206/351/205/215/347/275/256/346/240/207/345/207/206_v0.5.md +236 -236
  19. package/docs/hive//346/243/200/347/264/242/346/224/266/346/225/233/345/256/236/346/265/213/344/270/216S1b/350/256/276/350/256/241_v0.1.md +43 -43
  20. package/docs/hive//346/243/200/347/264/242/347/256/227/346/263/225/345/217/243/345/276/204/345/257/271/347/205/247_v0.1.md +85 -0
  21. package/docs/hive//346/243/200/347/264/242/350/267/257/345/276/204/344/270/216/350/256/244/347/237/245/347/273/223/346/236/204/345/245/221/347/272/246_v0.1.md +102 -102
  22. package/docs/hive//350/234/202/345/267/242M6_ingest/345/256/236/346/226/275/350/256/241/345/210/222_v0.1.md +47 -0
  23. package/docs/hive//350/234/202/345/267/242/345/217/214/345/256/236/344/276/213/344/272/222/351/252/214_/350/256/276/350/256/241/345/256/232/347/250/277.md +503 -503
  24. package/docs/hive//350/234/202/345/267/242/345/267/245/344/275/234/350/256/260/345/277/206_/351/241/271/347/233/256/350/256/241/345/210/222.md +85 -85
  25. package/docs/hive//350/234/202/345/267/242/350/256/276/350/256/241_/347/220/206/350/256/272/345/257/271/351/275/220_v0.1.md +191 -0
  26. package/docs/hive//350/234/202/345/267/242/350/277/255/344/273/243_/345/256/217/350/247/202/344/270/216/347/276/244/344/275/223/350/260/203/345/272/246_v0.1.md +90 -0
  27. package/docs/mdcg/D_meta_/345/267/245/347/250/213/345/214/226/346/226/271/346/241/210_v0.2.md +216 -216
  28. package/docs/mdcg/README/350/257/246/347/273/206/347/211/210_v0.4.10.md +646 -646
  29. package/docs/mdcg/lingshu_tutorial.html +14449 -14449
  30. package/docs/mdcg/release_v0.4.11.md +49 -0
  31. package/docs/mdcg/release_v0.4.5.md +55 -55
  32. package/docs/mdcg/tool_table_v0.3.0.md +117 -117
  33. package/docs/mdcg//345/205/250/345/272/223/344/273/243/347/240/201/350/257/204/345/256/241/344/270/216/346/235/241/344/273/266/345/214/226/346/263/250/351/207/212_/350/256/241/345/210/222_v0.1.md +600 -600
  34. package/docs/mdcg//345/212/237/350/203/275/350/260/203/347/224/250/346/230/240/345/260/204/350/241/250_v0.1.md +40 -40
  35. package/docs/mdcg//345/215/225/345/205/203/350/207/252/346/210/221/351/224/232/347/202/271_/347/263/273/347/273/237/346/217/220/347/244/272/350/257/215/346/240/207/345/207/206_v0.3.md +275 -275
  36. package/docs/mdcg//345/217/221/345/270/203/351/227/250/347/246/201/351/223/276_v0.1.md +54 -0
  37. package/docs/mdcg//346/272/220/347/240/201/347/272/247/346/236/266/346/236/204/345/256/241/350/256/241_GPT/346/211/271/350/257/204/345/257/271/347/205/247_v1.0.md +130 -130
  38. package/docs/mdcg//347/201/265/346/236/24282/345/267/245/345/205/267_/345/212/237/350/203/275/346/225/264/347/220/206/344/270/216/350/277/201/347/247/273/346/230/240/345/260/204_v0.1.md +278 -278
  39. package/docs/mdcg//347/201/265/346/236/242/350/256/260/345/277/206/345/212/250/350/257/215/345/215/217/350/256/256_v1.0-draft.md +172 -172
  40. package/docs/mdcg//347/274/272/345/217/243/345/215/225_P0/346/224/266/345/217/243_v0.1.md +270 -270
  41. package/docs/mdcg//350/256/244/347/237/245/345/233/276_G4-G8/347/274/272/345/217/243/350/243/201/345/256/232/345/215/225_v0.1.md +491 -491
  42. package/docs/mdcg//350/256/244/347/237/245/345/233/276_/346/235/241/344/273/266/347/251/272/351/227/264/345/220/210/346/210/220/344/270/216/347/224/237/346/225/210/346/235/241/344/273/266/345/217/243/345/276/204_v0.1.md +340 -340
  43. package/docs/mdcg//350/256/244/347/237/245/345/233/276_/347/264/242/345/274/225/344/270/216/345/267/245/347/250/213/350/247/204/350/214/203/345/214/226_/350/256/241/345/210/222_v0.1.md +588 -588
  44. package/docs/plans/GridWorld/346/234/200/345/260/217/351/227/255/347/216/257/350/247/204/346/240/274_v0.1.md +176 -176
  45. package/docs/plans//345/221/275/345/220/215/346/262/273/347/220/206_/351/241/271/347/233/256/350/256/241/345/210/222.md +81 -81
  46. package/docs/swarm//350/234/202/347/276/244/344/272/222/350/201/224_v0.1.md +704 -704
  47. package/docs/swarm//350/234/202/347/276/244/345/220/214/351/224/231/346/243/200/346/265/213/345/256/236/351/252/214/345/215/217/350/256/256_v0.1.md +242 -242
  48. package/docs/theory//345/215/225/347/272/277/347/250/213/344/270/216/346/263/250/346/204/217/345/212/233/351/233/206/344/270/255_/346/227/240/344/272/211/350/256/256/347/220/206/350/256/272/346/226/207/346/241/243_v1.0.md +129 -129
  49. package/docs/theory//345/271/266/345/217/221/345/277/205/347/204/266/346/200/247/347/220/206/350/256/272_v0.2.md +134 -134
  50. package/docs/theory//346/231/272/350/203/275/350/256/2723.4.md +5260 -5260
  51. package/docs/theory//346/246/202/345/277/265/345/210/206/345/261/202/345/257/271/351/275/220/350/241/250_v0.1.md +145 -145
  52. package/docs/theory//347/220/206/350/256/272_/346/234/272/345/210/266_/344/273/243/347/240/201_/345/256/236/351/252/214_/347/274/272/345/217/243/347/237/251/351/230/265_v0.1.md +144 -144
  53. package/docs/theory//347/220/206/350/256/272/344/273/223/346/213/206/345/210/206/344/270/216/347/231/275/347/256/261/347/237/245/350/257/206/345/272/223/345/206/205/350/277/201_v0.1.md +198 -198
  54. package/docs/theory//350/256/244/347/237/245/344/273/243/347/220/206/344/270/216/346/224/266/346/225/233/347/273/223/346/236/204_/346/235/241/344/273/266/350/256/272/351/207/215/346/236/204_v0.1.md +221 -221
  55. package/docs/world_model//344/270/226/347/225/214/346/250/241/345/236/213_/347/245/236/347/273/217/347/275/221/347/273/234/345/272/225/345/261/202/346/236/266/346/236/204_v1.0.md +237 -237
  56. package/docs//345/217/221/345/270/203/344/273/266/345/233/236/346/272/257/350/257/264/346/230/216_v0.1.md +82 -82
  57. package/docs//345/267/245/344/275/234/347/272/252/345/276/213_/350/256/244/347/237/245/345/233/276/346/235/241/347/233/256_v1.1.json +28 -2
  58. package/dsh/README.md +82 -82
  59. package/dsh/cordis.yml.example +139 -139
  60. package/dsh/update-lingshu.bat +11 -11
  61. package/lib/hooks.js +36 -2
  62. package/lib/lib/roleplay_web.js +427 -427
  63. package/md_cg/__init__.py +7 -7
  64. package/md_cg/audit.py +368 -368
  65. package/md_cg/autonomy.py +287 -287
  66. package/md_cg/backfill.py +1327 -1327
  67. package/md_cg/backfill_bigdomain.py +34 -34
  68. package/md_cg/bench6_arms.py +410 -410
  69. package/md_cg/bench6_common.py +230 -230
  70. package/md_cg/bench6_competitors.py +212 -212
  71. package/md_cg/bench_axis_domain.py +257 -257
  72. package/md_cg/bench_blind_comp.py +308 -308
  73. package/md_cg/bench_en_atoms_public.py +230 -230
  74. package/md_cg/bench_governance.py +348 -348
  75. package/md_cg/bench_lme_zh.py +410 -410
  76. package/md_cg/bench_locomo.py +121 -121
  77. package/md_cg/bench_locomo_zh.py +450 -450
  78. package/md_cg/bench_locomo_zh_public.py +147 -147
  79. package/md_cg/bench_longmem.py +112 -112
  80. package/md_cg/bench_membench.py +632 -632
  81. package/md_cg/bench_p0.py +149 -149
  82. package/md_cg/bench_progressive.py +287 -287
  83. package/md_cg/bench_role_views.py +238 -238
  84. package/md_cg/bench_task_ab.py +243 -243
  85. package/md_cg/bench_task_ab_llm.py +408 -408
  86. package/md_cg/bench_unified_en.py +204 -204
  87. package/md_cg/bench_zh_mad.py +601 -601
  88. package/md_cg/blindspot_tickets.py +123 -123
  89. package/md_cg/branches.py +285 -285
  90. package/md_cg/build_postings.py +73 -73
  91. package/md_cg/ccgc.py +1005 -948
  92. package/md_cg/census.py +132 -132
  93. package/md_cg/chain.py +300 -300
  94. package/md_cg/codeindex.py +531 -531
  95. package/md_cg/coldverify.py +292 -292
  96. package/md_cg/comment_gate.py +337 -337
  97. package/md_cg/cond_compose.py +190 -190
  98. package/md_cg/cond_facts.py +154 -154
  99. package/md_cg/cond_template.json +106 -106
  100. package/md_cg/condition_anchor.py +142 -142
  101. package/md_cg/conformance.py +726 -726
  102. package/md_cg/consistency.py +717 -717
  103. package/md_cg/consolidate.py +1536 -1439
  104. package/md_cg/corpus.py +110 -110
  105. package/md_cg/crosscheck.py +1097 -1097
  106. package/md_cg/crypto.py +437 -437
  107. package/md_cg/d_meta.py +310 -310
  108. package/md_cg/datapath.py +334 -334
  109. package/md_cg/docindex.py +473 -473
  110. package/md_cg/eval_common.py +575 -575
  111. package/md_cg/evidence.py +580 -580
  112. package/md_cg/evolution.py +477 -477
  113. package/md_cg/export.py +220 -220
  114. package/md_cg/forgetting.py +581 -581
  115. package/md_cg/fsutil.py +329 -329
  116. package/md_cg/hotcache.py +238 -214
  117. package/md_cg/hyperedge.py +251 -251
  118. package/md_cg/identity.py +390 -390
  119. package/md_cg/insight.py +500 -500
  120. package/md_cg/interop.py +199 -0
  121. package/md_cg/lexicon/build_cedict_en_zh.py +329 -329
  122. package/md_cg/lexicon/build_standard_en.py +171 -171
  123. package/md_cg/lexicon/expand_en_zh.py +211 -211
  124. package/md_cg/lifecycle.py +272 -272
  125. package/md_cg/linkref.py +280 -280
  126. package/md_cg/links.py +622 -622
  127. package/md_cg/mcp_server.py +129 -32
  128. package/md_cg/md_whitebox.py +345 -345
  129. package/md_cg/mdcg.py +176 -117
  130. package/md_cg/mdcos.py +79 -13
  131. package/md_cg/metacognition.py +591 -591
  132. package/md_cg/migrate.py +119 -119
  133. package/md_cg/migrate_aeis.py +221 -221
  134. package/md_cg/migrate_roleplay.py +293 -293
  135. package/md_cg/migrate_wisdom_graph.py +360 -360
  136. package/md_cg/mreview/__init__.py +25 -25
  137. package/md_cg/mreview/__main__.py +110 -110
  138. package/md_cg/mreview/bundle.py +178 -178
  139. package/md_cg/mreview/candidates.py +262 -262
  140. package/md_cg/mreview/govern.py +693 -693
  141. package/md_cg/mreview/locate.py +939 -939
  142. package/md_cg/mreview/pipeline.py +728 -728
  143. package/md_cg/mreview/rules/duplication.json +21 -21
  144. package/md_cg/mreview/rules/field_coverage.json +54 -54
  145. package/md_cg/mreview/rules/source_license.json +21 -21
  146. package/md_cg/mreview/rules/template_flow.json +21 -21
  147. package/md_cg/mreview/ruleset.py +252 -252
  148. package/md_cg/nodefile.py +575 -575
  149. package/md_cg/pooling.py +484 -472
  150. package/md_cg/postings.py +298 -298
  151. package/md_cg/predict.py +1100 -1100
  152. package/md_cg/progressive.py +123 -123
  153. package/md_cg/protect.py +272 -272
  154. package/md_cg/protocol/md_cg_gate.proto +33 -33
  155. package/md_cg/protocol.py +372 -372
  156. package/md_cg/provenance.py +582 -582
  157. package/md_cg/reach.py +453 -453
  158. package/md_cg/readcache.py +85 -0
  159. package/md_cg/refindex.py +833 -833
  160. package/md_cg/refine.py +604 -604
  161. package/md_cg/roleviews.py +89 -89
  162. package/md_cg/routing.py +365 -365
  163. package/md_cg/scrub.py +852 -852
  164. package/md_cg/security.py +274 -274
  165. package/md_cg/self_state.py +1029 -1029
  166. package/md_cg/selfreport.py +151 -151
  167. package/md_cg/semantic/__init__.py +10 -10
  168. package/md_cg/semantic/canonical.py +122 -122
  169. package/md_cg/semantic/en_normalizer.py +364 -364
  170. package/md_cg/semantic/en_zh_map.json +28694 -0
  171. package/md_cg/semantic/export_en_zh_map.py +64 -0
  172. package/md_cg/semantic/unify.py +45 -0
  173. package/md_cg/semantic/zh_en_atoms.py +139 -139
  174. package/md_cg/signer.py +562 -562
  175. package/md_cg/sources.py +815 -582
  176. package/md_cg/statushdr.py +179 -179
  177. package/md_cg/stg.py +48 -37
  178. package/md_cg/subgraph.py +729 -729
  179. package/md_cg/sustain.py +1138 -1138
  180. package/md_cg/tasks.py +470 -470
  181. package/md_cg/test_action_derive.py +203 -203
  182. package/md_cg/test_audit_rotate.py +270 -270
  183. package/md_cg/test_autonomy.py +143 -143
  184. package/md_cg/test_bench_governance.py +102 -102
  185. package/md_cg/test_blindspot_tickets.py +166 -166
  186. package/md_cg/test_branches.py +249 -249
  187. package/md_cg/test_ccg_perturb.py +184 -184
  188. package/md_cg/test_ccgc.py +433 -433
  189. package/md_cg/test_census_prune.py +81 -81
  190. package/md_cg/test_cond_compose_anchors.py +76 -76
  191. package/md_cg/test_cond_match.py +165 -165
  192. package/md_cg/test_condition_anchor.py +81 -81
  193. package/md_cg/test_d_meta.py +412 -412
  194. package/md_cg/test_datapath_root.py +199 -199
  195. package/md_cg/test_en_pipeline.py +166 -166
  196. package/md_cg/test_gain_gate.py +212 -212
  197. package/md_cg/test_health_scale.py +173 -173
  198. package/md_cg/test_hive_ingest.py +285 -0
  199. package/md_cg/test_hot_cold.py +215 -215
  200. package/md_cg/test_hyperedge.py +245 -245
  201. package/md_cg/test_i26_empty_first_write.py +116 -0
  202. package/md_cg/test_i27_e041_identity.py +128 -0
  203. package/md_cg/test_i28_hotcache_prodpath.py +122 -0
  204. package/md_cg/test_identity_attribution.py +147 -147
  205. package/md_cg/test_index_durability.py +224 -224
  206. package/md_cg/test_interop.py +93 -0
  207. package/md_cg/test_lifecycle.py +309 -309
  208. package/md_cg/test_linkref.py +306 -306
  209. package/md_cg/test_lock.py +43 -43
  210. package/md_cg/test_md_access_parity.py +255 -255
  211. package/md_cg/test_md_writepath.py +345 -345
  212. package/md_cg/test_mdstore_search_parity.py +160 -0
  213. package/md_cg/test_mr_m2.py +587 -587
  214. package/md_cg/test_mr_m3.py +710 -710
  215. package/md_cg/test_mr_m4.py +485 -485
  216. package/md_cg/test_p0.py +250 -250
  217. package/md_cg/test_p1.py +316 -316
  218. package/md_cg/test_p10_identity.py +173 -173
  219. package/md_cg/test_p11_consistency.py +233 -233
  220. package/md_cg/test_p12_metacognition.py +212 -212
  221. package/md_cg/test_p13_encryption.py +241 -241
  222. package/md_cg/test_p14_sustain.py +249 -249
  223. package/md_cg/test_p15_scrub.py +280 -280
  224. package/md_cg/test_p16_self_state.py +301 -301
  225. package/md_cg/test_p17_predict.py +354 -354
  226. package/md_cg/test_p18_whitebox.py +171 -171
  227. package/md_cg/test_p19_migrate_roleplay.py +149 -149
  228. package/md_cg/test_p20_evolution.py +315 -315
  229. package/md_cg/test_p21_tokens.py +293 -270
  230. package/md_cg/test_p22_theory.py +175 -175
  231. package/md_cg/test_p23_links.py +311 -311
  232. package/md_cg/test_p24_evidence.py +227 -227
  233. package/md_cg/test_p25_weights.py +156 -156
  234. package/md_cg/test_p26_refindex.py +416 -416
  235. package/md_cg/test_p27_docindex.py +765 -765
  236. package/md_cg/test_p28_refcheck.py +305 -305
  237. package/md_cg/test_p29_session_ingest_export.py +354 -333
  238. package/md_cg/test_p3.py +11 -2
  239. package/md_cg/test_p30_maintain.py +330 -330
  240. package/md_cg/test_p31_insight.py +534 -534
  241. package/md_cg/test_p32_backfill.py +298 -298
  242. package/md_cg/test_p33_ccg_wiring.py +293 -293
  243. package/md_cg/test_p34_crosscheck.py +331 -331
  244. package/md_cg/test_p35_conditioned_claim.py +252 -252
  245. package/md_cg/test_p36_kp_align.py +230 -230
  246. package/md_cg/test_p37_condition_space.py +248 -248
  247. package/md_cg/test_p38_concurrent_flush.py +102 -0
  248. package/md_cg/test_p38_contextualize.py +273 -273
  249. package/md_cg/test_p39_verify_flow.py +113 -0
  250. package/md_cg/test_p39_vision_evidence.py +369 -369
  251. package/md_cg/test_p40_refine_worklist.py +241 -241
  252. package/md_cg/test_p41_evolve_patrol.py +224 -224
  253. package/md_cg/test_p42_provenance.py +269 -269
  254. package/md_cg/test_p43_pooling.py +412 -398
  255. package/md_cg/test_p44_md_whitebox.py +231 -231
  256. package/md_cg/test_p45_session_identity.py +219 -219
  257. package/md_cg/test_p46_unit_scope.py +272 -272
  258. package/md_cg/test_p47_session_view.py +281 -0
  259. package/md_cg/test_p4_fuzzy.py +223 -223
  260. package/md_cg/test_p5_semantic.py +226 -226
  261. package/md_cg/test_p6_consolidate.py +440 -387
  262. package/md_cg/test_p7_goals_recent.py +202 -202
  263. package/md_cg/test_p8_subgraph_chain.py +200 -200
  264. package/md_cg/test_p9_forget_protect.py +231 -231
  265. package/md_cg/test_predict_beta.py +135 -135
  266. package/md_cg/test_preflight_failclosed.py +100 -100
  267. package/md_cg/test_progressive.py +146 -146
  268. package/md_cg/test_protocol.py +243 -243
  269. package/md_cg/test_reach.py +378 -378
  270. package/md_cg/test_reach_keys.py +201 -201
  271. package/md_cg/test_read_clip.py +141 -141
  272. package/md_cg/test_readcache_prodpath.py +155 -0
  273. package/md_cg/test_retr_gates_prodpath.py +140 -0
  274. package/md_cg/test_retr_s1.py +340 -340
  275. package/md_cg/test_retr_s1b.py +209 -209
  276. package/md_cg/test_retr_s3.py +194 -194
  277. package/md_cg/test_retr_s4.py +163 -163
  278. package/md_cg/test_retr_s5.py +200 -200
  279. package/md_cg/test_retr_s6.py +157 -157
  280. package/md_cg/test_retr_s7.py +384 -384
  281. package/md_cg/test_retr_s8_time.py +369 -316
  282. package/md_cg/test_retr_s9_edges.py +286 -286
  283. package/md_cg/test_retr_s9_entity_ctx.py +175 -175
  284. package/md_cg/test_review_conformance.py +367 -367
  285. package/md_cg/test_role_views.py +354 -354
  286. package/md_cg/test_sem_noise.py +242 -242
  287. package/md_cg/test_semantic_canonical.py +241 -241
  288. package/md_cg/test_subproc_encoding.py +192 -192
  289. package/md_cg/test_sustain_mutual.py +153 -153
  290. package/md_cg/test_tasks.py +409 -409
  291. package/md_cg/test_tool_face.py +189 -189
  292. package/md_cg/test_transfer.py +180 -180
  293. package/md_cg/test_trust.py +361 -361
  294. package/md_cg/test_twophase.py +286 -286
  295. package/md_cg/test_v14_fixes.py +397 -397
  296. package/md_cg/test_validity_filter.py +280 -280
  297. package/md_cg/test_verify_answer.py +138 -138
  298. package/md_cg/test_wisdom_md_store.py +292 -292
  299. package/md_cg/test_writelimit.py +197 -197
  300. package/md_cg/test_writepipe.py +214 -214
  301. package/md_cg/theory.py +273 -273
  302. package/md_cg/tokens.py +677 -663
  303. package/md_cg/tool_face.py +260 -260
  304. package/md_cg/trust.py +986 -950
  305. package/md_cg/twophase.py +231 -231
  306. package/md_cg/units.py +667 -667
  307. package/md_cg/vision_evidence.py +666 -666
  308. package/md_cg/weights.py +624 -624
  309. package/md_cg/whitebox.py +527 -527
  310. package/md_cg/whitebox_kb/__init__.py +37 -37
  311. package/md_cg/whitebox_kb/aeis_core/__init__.py +42 -42
  312. package/md_cg/whitebox_kb/aeis_core/semantic.py +280 -280
  313. package/md_cg/whitebox_kb/aeis_core/textutil.py +13 -13
  314. package/md_cg/whitebox_kb/engine.py +310 -310
  315. package/md_cg/whitebox_kb/seed_knowledge//346/231/272/350/203/275/350/256/2723.4.md +5260 -5260
  316. package/md_cg/whitebox_kb/wisdom/browser_units.py +2631 -2631
  317. package/md_cg/whitebox_kb/wisdom/causal_discover.py +432 -432
  318. package/md_cg/whitebox_kb/wisdom/chat_engine.py +1506 -1506
  319. package/md_cg/whitebox_kb/wisdom/code_solidified.json +6195 -6195
  320. package/md_cg/whitebox_kb/wisdom/compiler_code_units.py +3033 -3033
  321. package/md_cg/whitebox_kb/wisdom/condition_algebra.py +112 -112
  322. package/md_cg/whitebox_kb/wisdom/condition_frame.py +315 -315
  323. package/md_cg/whitebox_kb/wisdom/condition_kb.py +108 -108
  324. package/md_cg/whitebox_kb/wisdom/conflict_map.json +4445 -4445
  325. package/md_cg/whitebox_kb/wisdom/core/lexer.py +512 -512
  326. package/md_cg/whitebox_kb/wisdom/core/name_checker.py +1023 -1023
  327. package/md_cg/whitebox_kb/wisdom/cspmn.py +258 -258
  328. package/md_cg/whitebox_kb/wisdom/csre.py +264 -264
  329. package/md_cg/whitebox_kb/wisdom/danmaku_audit.py +252 -252
  330. package/md_cg/whitebox_kb/wisdom/distilled_condition_units.json +6417 -6417
  331. package/md_cg/whitebox_kb/wisdom/docs/WB-EVAL-20260902b.json +1950 -1950
  332. package/md_cg/whitebox_kb/wisdom/docs/WB-EVAL-20260902c.json +1296 -1296
  333. package/md_cg/whitebox_kb/wisdom/docs/whitebox_capability_graph_demo.json +59 -59
  334. package/md_cg/whitebox_kb/wisdom/graph_db_units.py +3089 -3089
  335. package/md_cg/whitebox_kb/wisdom/knowledge_points.py +318 -318
  336. package/md_cg/whitebox_kb/wisdom/md_access.py +470 -470
  337. package/md_cg/whitebox_kb/wisdom/md_store.py +276 -251
  338. package/md_cg/whitebox_kb/wisdom/migrate_wisdom.py +476 -476
  339. package/md_cg/whitebox_kb/wisdom/navigate.py +248 -248
  340. package/md_cg/whitebox_kb/wisdom/neural_retrieve.py +224 -224
  341. package/md_cg/whitebox_kb/wisdom/os_units.py +2735 -2735
  342. package/md_cg/whitebox_kb/wisdom/pattern_separation.py +376 -376
  343. package/md_cg/whitebox_kb/wisdom/prereq_map.json +364 -364
  344. package/md_cg/whitebox_kb/wisdom/python_code_units.py +2766 -2766
  345. package/md_cg/whitebox_kb/wisdom/role_solidified.json +7 -7
  346. package/md_cg/whitebox_kb/wisdom/route_memory.py +244 -244
  347. package/md_cg/whitebox_kb/wisdom/scene_reconstruction.py +148 -148
  348. package/md_cg/whitebox_kb/wisdom/snr_report.json +40 -40
  349. package/md_cg/whitebox_kb/wisdom/test_code_compose_domains.py +7541 -7541
  350. package/md_cg/whitebox_kb/wisdom/test_compiler_self_bootstrap.py +354 -354
  351. package/md_cg/whitebox_kb/wisdom/test_ecosystem_assembly.py +158 -158
  352. package/md_cg/whitebox_kb/wisdom/test_ecosystem_demos.py +193 -193
  353. package/md_cg/whitebox_kb/wisdom/test_graph_db.py +292 -292
  354. package/md_cg/whitebox_kb/wisdom/test_python_self_bootstrap.py +160 -160
  355. package/md_cg/whitebox_kb/wisdom/trigger_words_index.json +4366 -4366
  356. package/md_cg/whitebox_kb/wisdom/verifier.py +1297 -1297
  357. package/md_cg/writelimit.py +356 -356
  358. package/md_cg/writepipe.py +550 -542
  359. package/package.json +97 -96
  360. package/skills/plugin.json +54 -54
  361. package/skills/skills/designer-perspective/SKILL.md +158 -158
  362. package/skills/skills/designer-perspective/references/01-observation-position.md +66 -66
  363. package/skills/skills/designer-perspective/references/02-structure-recognition.md +62 -62
  364. package/skills/skills/designer-perspective/references/03-direction-judgment.md +55 -55
  365. package/skills/skills/designer-perspective/references/04-qualification-verdict.md +72 -72
  366. package/skills/skills/designer-perspective/references/05-condition-attribution.md +74 -74
  367. package/skills/skills/designer-perspective/scripts/designer.py +545 -545
  368. package/skills/skills/designer-perspective/tests/cases.jsonl +17 -17
  369. package/skills/skills/designer-perspective/tests/selftest.py +61 -61
  370. package/skills/skills/lingshu-browser/SKILL.md +60 -60
  371. package/skills/skills/lingshu-compiler/SKILL.md +56 -56
  372. package/skills/skills/lingshu-compiler/units/analyze-type-infer/SKILL.md +45 -45
  373. package/skills/skills/lingshu-compiler/units/check-name-real/SKILL.md +45 -45
  374. package/skills/skills/lingshu-compiler/units/compile-assign/SKILL.md +45 -45
  375. package/skills/skills/lingshu-compiler/units/compile-expr-tree/SKILL.md +45 -45
  376. package/skills/skills/lingshu-compiler/units/compile-full-pipeline/SKILL.md +45 -45
  377. package/skills/skills/lingshu-compiler/units/compile-func-def/SKILL.md +45 -45
  378. package/skills/skills/lingshu-compiler/units/compile-if-then/SKILL.md +45 -45
  379. package/skills/skills/lingshu-compiler/units/compile-logic-expr/SKILL.md +45 -45
  380. package/skills/skills/lingshu-compiler/units/compile-recursive/SKILL.md +45 -45
  381. package/skills/skills/lingshu-compiler/units/compile-scope/SKILL.md +45 -45
  382. package/skills/skills/lingshu-compiler/units/compile-type-check/SKILL.md +45 -45
  383. package/skills/skills/lingshu-compiler/units/compile-while/SKILL.md +45 -45
  384. package/skills/skills/lingshu-compiler/units/compiler-0010c4bf/SKILL.md +45 -45
  385. package/skills/skills/lingshu-compiler/units/compiler-0355bffb/SKILL.md +45 -45
  386. package/skills/skills/lingshu-compiler/units/compiler-0361708a/SKILL.md +45 -45
  387. package/skills/skills/lingshu-compiler/units/compiler-054a0414/SKILL.md +45 -45
  388. package/skills/skills/lingshu-compiler/units/compiler-05a1691a/SKILL.md +45 -45
  389. package/skills/skills/lingshu-compiler/units/compiler-05eeed1e/SKILL.md +45 -45
  390. package/skills/skills/lingshu-compiler/units/compiler-0622a1f6/SKILL.md +45 -45
  391. package/skills/skills/lingshu-compiler/units/compiler-08b54217/SKILL.md +45 -45
  392. package/skills/skills/lingshu-compiler/units/compiler-0a62b70c/SKILL.md +45 -45
  393. package/skills/skills/lingshu-compiler/units/compiler-0ab24d00/SKILL.md +45 -45
  394. package/skills/skills/lingshu-compiler/units/compiler-0e093688/SKILL.md +45 -45
  395. package/skills/skills/lingshu-compiler/units/compiler-0e82b966/SKILL.md +45 -45
  396. package/skills/skills/lingshu-compiler/units/compiler-0ee9b9b9/SKILL.md +45 -45
  397. package/skills/skills/lingshu-compiler/units/compiler-0f3787e6/SKILL.md +45 -45
  398. package/skills/skills/lingshu-compiler/units/compiler-1028685f/SKILL.md +45 -45
  399. package/skills/skills/lingshu-compiler/units/compiler-11897630/SKILL.md +45 -45
  400. package/skills/skills/lingshu-compiler/units/compiler-16661b9b/SKILL.md +45 -45
  401. package/skills/skills/lingshu-compiler/units/compiler-1f722303/SKILL.md +45 -45
  402. package/skills/skills/lingshu-compiler/units/compiler-25be1262/SKILL.md +45 -45
  403. package/skills/skills/lingshu-compiler/units/compiler-2a76ba07/SKILL.md +45 -45
  404. package/skills/skills/lingshu-compiler/units/compiler-2dbea54a/SKILL.md +45 -45
  405. package/skills/skills/lingshu-compiler/units/compiler-2df52f16/SKILL.md +45 -45
  406. package/skills/skills/lingshu-compiler/units/compiler-2ec2c9d2/SKILL.md +45 -45
  407. package/skills/skills/lingshu-compiler/units/compiler-2f8c8f39/SKILL.md +45 -45
  408. package/skills/skills/lingshu-compiler/units/compiler-38378ac7/SKILL.md +45 -45
  409. package/skills/skills/lingshu-compiler/units/compiler-39457d2e/SKILL.md +45 -45
  410. package/skills/skills/lingshu-compiler/units/compiler-39fb5926/SKILL.md +45 -45
  411. package/skills/skills/lingshu-compiler/units/compiler-47f4fbfa/SKILL.md +45 -45
  412. package/skills/skills/lingshu-compiler/units/compiler-4a8cd1f1/SKILL.md +45 -45
  413. package/skills/skills/lingshu-compiler/units/compiler-4b230b6b/SKILL.md +45 -45
  414. package/skills/skills/lingshu-compiler/units/compiler-4cbbda95/SKILL.md +45 -45
  415. package/skills/skills/lingshu-compiler/units/compiler-4d5a68ff/SKILL.md +45 -45
  416. package/skills/skills/lingshu-compiler/units/compiler-56dc9bdd/SKILL.md +45 -45
  417. package/skills/skills/lingshu-compiler/units/compiler-57e76ebe/SKILL.md +45 -45
  418. package/skills/skills/lingshu-compiler/units/compiler-61ff016b/SKILL.md +45 -45
  419. package/skills/skills/lingshu-compiler/units/compiler-63eae588/SKILL.md +45 -45
  420. package/skills/skills/lingshu-compiler/units/compiler-64c4224b/SKILL.md +45 -45
  421. package/skills/skills/lingshu-compiler/units/compiler-66377955/SKILL.md +45 -45
  422. package/skills/skills/lingshu-compiler/units/compiler-674ab4f6/SKILL.md +45 -45
  423. package/skills/skills/lingshu-compiler/units/compiler-6af76fd6/SKILL.md +45 -45
  424. package/skills/skills/lingshu-compiler/units/compiler-6d979db2/SKILL.md +45 -45
  425. package/skills/skills/lingshu-compiler/units/compiler-6de326c0/SKILL.md +45 -45
  426. package/skills/skills/lingshu-compiler/units/compiler-6f1c0eea/SKILL.md +45 -45
  427. package/skills/skills/lingshu-compiler/units/compiler-724d6c9b/SKILL.md +45 -45
  428. package/skills/skills/lingshu-compiler/units/compiler-7690177f/SKILL.md +45 -45
  429. package/skills/skills/lingshu-compiler/units/compiler-7b229a7d/SKILL.md +45 -45
  430. package/skills/skills/lingshu-compiler/units/compiler-7f471b3a/SKILL.md +45 -45
  431. package/skills/skills/lingshu-compiler/units/compiler-815cad08/SKILL.md +45 -45
  432. package/skills/skills/lingshu-compiler/units/compiler-83c61634/SKILL.md +45 -45
  433. package/skills/skills/lingshu-compiler/units/compiler-8c798c81/SKILL.md +45 -45
  434. package/skills/skills/lingshu-compiler/units/compiler-8dd747ac/SKILL.md +45 -45
  435. package/skills/skills/lingshu-compiler/units/compiler-90324d0a/SKILL.md +45 -45
  436. package/skills/skills/lingshu-compiler/units/compiler-94b8d72d/SKILL.md +45 -45
  437. package/skills/skills/lingshu-compiler/units/compiler-94f12231/SKILL.md +45 -45
  438. package/skills/skills/lingshu-compiler/units/compiler-95937c16/SKILL.md +45 -45
  439. package/skills/skills/lingshu-compiler/units/compiler-98a5625b/SKILL.md +45 -45
  440. package/skills/skills/lingshu-compiler/units/compiler-98b4c42f/SKILL.md +45 -45
  441. package/skills/skills/lingshu-compiler/units/compiler-98e3894a/SKILL.md +45 -45
  442. package/skills/skills/lingshu-compiler/units/compiler-9bdfe4b8/SKILL.md +45 -45
  443. package/skills/skills/lingshu-compiler/units/compiler-9d9b4e83/SKILL.md +45 -45
  444. package/skills/skills/lingshu-compiler/units/compiler-9f7be5ad/SKILL.md +45 -45
  445. package/skills/skills/lingshu-compiler/units/compiler-a6daf076/SKILL.md +45 -45
  446. package/skills/skills/lingshu-compiler/units/compiler-a7995a0c/SKILL.md +45 -45
  447. package/skills/skills/lingshu-compiler/units/compiler-a8399248/SKILL.md +45 -45
  448. package/skills/skills/lingshu-compiler/units/compiler-aabbd099/SKILL.md +45 -45
  449. package/skills/skills/lingshu-compiler/units/compiler-afe169d8/SKILL.md +45 -45
  450. package/skills/skills/lingshu-compiler/units/compiler-b0678bda/SKILL.md +45 -45
  451. package/skills/skills/lingshu-compiler/units/compiler-b09bd196/SKILL.md +45 -45
  452. package/skills/skills/lingshu-compiler/units/compiler-b1396e23/SKILL.md +45 -45
  453. package/skills/skills/lingshu-compiler/units/compiler-b9b31ce0/SKILL.md +45 -45
  454. package/skills/skills/lingshu-compiler/units/compiler-c10264a7/SKILL.md +45 -45
  455. package/skills/skills/lingshu-compiler/units/compiler-cb1e8e4b/SKILL.md +45 -45
  456. package/skills/skills/lingshu-compiler/units/compiler-ccafd438/SKILL.md +45 -45
  457. package/skills/skills/lingshu-compiler/units/compiler-cda9c262/SKILL.md +45 -45
  458. package/skills/skills/lingshu-compiler/units/compiler-ce648068/SKILL.md +45 -45
  459. package/skills/skills/lingshu-compiler/units/compiler-cf5776a4/SKILL.md +45 -45
  460. package/skills/skills/lingshu-compiler/units/compiler-d974e5d3/SKILL.md +45 -45
  461. package/skills/skills/lingshu-compiler/units/compiler-e3979fd3/SKILL.md +45 -45
  462. package/skills/skills/lingshu-compiler/units/compiler-eb1cf2b5/SKILL.md +45 -45
  463. package/skills/skills/lingshu-compiler/units/compiler-ecb30d5b/SKILL.md +45 -45
  464. package/skills/skills/lingshu-compiler/units/compiler-f8c8b24b/SKILL.md +45 -45
  465. package/skills/skills/lingshu-compiler/units/compiler-f99fedbe/SKILL.md +45 -45
  466. package/skills/skills/lingshu-compiler/units/compiler-fa8ff5f7/SKILL.md +45 -45
  467. package/skills/skills/lingshu-compiler/units/compiler-fe1b058d/SKILL.md +45 -45
  468. package/skills/skills/lingshu-compiler/units/lex-chinese-program/SKILL.md +45 -45
  469. package/skills/skills/lingshu-compiler/units/lex-dao-de-jing/SKILL.md +45 -45
  470. package/skills/skills/lingshu-compiler/units/lex-nine-chapters/SKILL.md +45 -45
  471. package/skills/skills/lingshu-compiler/units/vm-arithmetic/SKILL.md +45 -45
  472. package/skills/skills/lingshu-compiler/units/vm-array-ops/SKILL.md +45 -45
  473. package/skills/skills/lingshu-compiler/units/vm-closure-call/SKILL.md +45 -45
  474. package/skills/skills/lingshu-compiler/units/vm-closure-create/SKILL.md +45 -45
  475. package/skills/skills/lingshu-compiler/units/vm-compare/SKILL.md +45 -45
  476. package/skills/skills/lingshu-compiler/units/vm-cond-jump/SKILL.md +45 -45
  477. package/skills/skills/lingshu-compiler/units/vm-cond-space/SKILL.md +45 -45
  478. package/skills/skills/lingshu-compiler/units/vm-exception/SKILL.md +45 -45
  479. package/skills/skills/lingshu-compiler/units/vm-func-call/SKILL.md +45 -45
  480. package/skills/skills/lingshu-compiler/units/vm-loop-run/SKILL.md +45 -45
  481. package/skills/skills/lingshu-compiler/units/vm-profiling/SKILL.md +45 -45
  482. package/skills/skills/lingshu-compiler/units/vm-refcount/SKILL.md +45 -45
  483. package/skills/skills/lingshu-compiler/units/vm-run-loop/SKILL.md +45 -45
  484. package/skills/skills/lingshu-compiler/units/vm-short-circuit/SKILL.md +45 -45
  485. package/skills/skills/lingshu-compiler/units/vm-stack-guard/SKILL.md +45 -45
  486. package/skills/skills/lingshu-compiler/units/vm-stack-ops/SKILL.md +45 -45
  487. package/skills/skills/lingshu-compiler/units/vm-trust-accum/SKILL.md +45 -45
  488. package/skills/skills/lingshu-graph/SKILL.md +63 -63
  489. package/skills/skills/lingshu-net/SKILL.md +48 -48
  490. package/skills/skills/lingshu-os/SKILL.md +64 -64
  491. package/skills/skills/lingshu-pylang/SKILL.md +71 -71
  492. package/src/bridge.ts +401 -401
  493. package/src/hooks.ts +38 -2
  494. package/src/lib/datapath.ts +326 -326
  495. package/src/lib/mdcg_client.ts +413 -413
  496. package/src/lib/mutual.ts +428 -428
  497. package/src/lib/prompt_safety.ts +62 -62
  498. package/src/lib/python_path.ts +71 -71
  499. package/src/lib/roleplay_web.ts +932 -932
  500. package/src/lib/token_store.ts +192 -192
  501. package/src/tools.ts +212 -212
  502. package/zcode/AGENTS.md +11 -3
  503. package/zcode/README.md +41 -41
  504. /package/docs/{mdcg → hive}//344/270/273/344/273/243/347/220/206/345/255/220/344/273/243/347/220/206/350/256/260/345/277/206/346/236/266/346/236/204/350/256/276/350/256/241.md" +0 -0
@@ -1,329 +1,329 @@
1
- #!/usr/bin/env python3
2
- # -*- coding: utf-8 -*-
3
- """build_cedict_en_zh.py · 词级 en→zh 反查表构建器(CC-CEDICT 词级,补字级反查缺口)
4
-
5
- 背景(2026-09-14 裁定路径):u2c 归因臂实证「语义路机制+doc 侧上界 hit@10=99.2%」,
6
- 瓶颈 100% 在 query 侧 en→zh 归一覆盖(u2=23.8 vs u2c=99.2)。字级 char_atoms_clean
7
- 反查对剩余 OOV 词次覆盖仅 ~15%(expand_en_zh analyze 实证),且字级产物与 doc 侧
8
- 整词原子形态不齐(music→单字 vs 摘要「音乐」整词原子)。本脚本从 CC-CEDICT 词级
9
- 词典反查英文词→中文词,产出 md_cg/lexicon/cedict_en_zh.json(独立数据文件)——
10
- 许可 CC-BY-SA 4.0,故**不内联**进 MIT 的 en_normalizer.EN_ZH,独立文件+署名。
11
-
12
- 清理规则(与 expand_en_zh.py 同纪律,机械可审计,不做语义发明):
13
- · 释义列剥括号注((Taiwan pr. ...) 等)→ 剥 "to /a /an " 前缀 → 按非字母拆词
14
- · 纯字母 fullmatch [a-z]+;min_len>=3(2 字母缩写域碰撞)
15
- · STOPWORDS 排除;与手工 EN_ZH 重复 → 手工优先(build 时写入 excluded)
16
- · 同一英文词反查到多个中文词 → 冲突跳过并计数(宁缺勿滥)
17
-
18
- 用法:
19
- python md_cg/lexicon/build_cedict_en_zh.py download # 拉 CEDICT 原始 gz(gitignored)
20
- python md_cg/lexicon/build_cedict_en_zh.py build # 反查 → cedict_en_zh.json
21
- python md_cg/lexicon/build_cedict_en_zh.py analyze # 500 题 OOV 覆盖上界取证
22
-
23
- 产物许可:本仓 cedict_en_zh.json 为 CC-CEDICT 派生数据,依 CC-BY-SA 4.0 署名:
24
- CC-CEDICT (https://www.mdbg.net/chinese/dictionary, CC BY-SA 4.0)
25
- """
26
- import collections
27
- import gzip
28
- import io
29
- import json
30
- import os
31
- import re
32
- import sys
33
- import time
34
- import urllib.request
35
-
36
- HERE = os.path.dirname(os.path.dirname(os.path.dirname(os.path.abspath(__file__))))
37
- for _p in (HERE, os.path.join(HERE, "md_cg")):
38
- if _p not in sys.path:
39
- sys.path.insert(0, _p)
40
-
41
- from md_cg.semantic.en_normalizer import EN_ZH, STOPWORDS # noqa: E402
42
-
43
- RAW_DIR = os.path.join(HERE, "data", "external", "cedict")
44
- RAW_GZ = os.path.join(RAW_DIR, "cedict_1_0_ts_utf-8_mdbg.txt.gz")
45
- RAW_TXT = os.path.join(RAW_DIR, "cedict.txt")
46
- OUT_JSON = os.path.join(HERE, "md_cg", "lexicon", "cedict_en_zh.json")
47
- QUESTIONS = os.path.join(HERE, "data", "external", "locomo_zh",
48
- "raw_questions.jsonl")
49
- CEDICT_URL = "https://www.mdbg.net/chinese/export/cedict/cedict_1_0_ts_utf-8_mdbg.txt.gz"
50
- LINE_RE = re.compile(r"^(\S+)\s+(\S+)\s+\[[^\]]+\]\s+/(.+)/\s*$")
51
-
52
-
53
- # 生效条件:无必需形参,被调用即创建模块常量 RAW_DIR、按 CEDICT_URL 发请求(UA 头 + timeout=120),把响应体写入 RAW_GZ,再以 gzip 解压并按 errors="replace" 解码写入 RAW_TXT,最后打印字节数与行数并返回 0;
54
- def download():
55
- os.makedirs(RAW_DIR, exist_ok=True)
56
- req = urllib.request.Request(
57
- CEDICT_URL, headers={"User-Agent": "Mozilla/5.0 (dsh-memory lexicon builder)"})
58
- with urllib.request.urlopen(req, timeout=120) as resp:
59
- blob = resp.read()
60
- with io.open(RAW_GZ, "wb") as f:
61
- f.write(blob)
62
- with gzip.open(RAW_GZ, "rb") as f:
63
- raw = f.read()
64
- with io.open(RAW_TXT, "w", encoding="utf-8", newline="\n") as f:
65
- f.write(raw.decode("utf-8", errors="replace"))
66
- print("[download] %d bytes → %s(%d 行)"
67
- % (len(blob), RAW_TXT, raw.count(b"\n")))
68
- return 0
69
-
70
-
71
- # 生效条件:无必需形参,迭代时逐行读模块常量 RAW_TXT,仅当 strip 后非空、不以 "#" 开头且 LINE_RE.match 命中时产出 (第 2 组, 第 3 组),其余行跳过(生成器,无产出即为空);
72
- def iter_entries():
73
- """CEDICT 行 → (简体, [英文释义段])。注释/空行跳过。"""
74
- with io.open(RAW_TXT, encoding="utf-8") as f:
75
- for line in f:
76
- line = line.strip()
77
- if not line or line.startswith("#"):
78
- continue
79
- m = LINE_RE.match(line)
80
- if not m:
81
- continue
82
- yield m.group(2), m.group(3)
83
-
84
-
85
- # 生效条件:min_len 取默认 3(调用方可传入覆盖,传入 0 则 len(sub)<min_len 恒不成立、不再做长度过滤),遍历 iter_entries() 的释义按 / 分段、剥 (…) 注、按 ;, 切子段并 strip+lower+去 to/a/an 前缀,子段须 fullmatch [a-z]+、不在 STOPWORDS、长度 ≥ min_len 才计入 rev[en];末尾按 zh 集大小 1 写入 cand[en]、>1 写入 conflicts[en],返回 (cand, conflicts, stat);
86
- def reverse_map(min_len=3):
87
- """词级反查 → (候选 {en: zh}, 冲突 {en: [zh...]}, 统计 dict)。
88
-
89
- 条目级子段反查:释义按 / 段 → 括号注剥离 → 按 ;, 切子段 → 子段清洗后
90
- **恰为单个英文词**才收("music album" 等复合短语被纯字母 fullmatch 滤除,
91
- 不再以复合词条身份污染反查——首轮实证 4.4% 覆盖的根因)。
92
- """
93
- rev = collections.defaultdict(set)
94
- stat = {"entries": 0, "glosses": 0, "bracket_stripped": 0,
95
- "prefix_stripped": 0, "stopword": 0, "too_short": 0,
96
- "phrase_skipped": 0}
97
- for zh, gloss in iter_entries():
98
- stat["entries"] += 1
99
- for seg in gloss.split("/"):
100
- seg = re.sub(r"\([^)]*\)", "", seg) # 剥括号注
101
- if seg != gloss:
102
- stat["bracket_stripped"] += 1
103
- for sub in re.split(r"[;,]", seg): # 子段
104
- sub = sub.strip().lower()
105
- sub = re.sub(r"^(to|a|an) ", "", sub)
106
- if sub != sub.strip().lower():
107
- stat["prefix_stripped"] += 1
108
- if not re.fullmatch(r"[a-z]+", sub):
109
- stat["phrase_skipped"] += 1
110
- continue
111
- if sub in STOPWORDS:
112
- stat["stopword"] += 1
113
- continue
114
- if len(sub) < min_len:
115
- stat["too_short"] += 1
116
- continue
117
- stat["glosses"] += 1
118
- rev[sub].add(zh)
119
- cand, conflicts = {}, {}
120
- for en, zhs in rev.items():
121
- if len(zhs) == 1:
122
- cand[en] = next(iter(zhs))
123
- else:
124
- conflicts[en] = sorted(zhs)
125
- return cand, conflicts, stat
126
-
127
-
128
- # 生效条件:无必需形参,逐行读模块引用 b6.CORPUS567 并跳过空白行,每行 json.loads 后取 (c.get("zh") or "") 与 (c.get("zh_fields") or {}) 中所有 str 值拼接成一条,最终以换行连成整串返回(无有效行时返回空串);
129
- def _corpus_text():
130
- """领域语料全文(zh 正文+五槽摘要)——冲突集频次消歧用。
131
-
132
- 消歧本质=doc 侧自监督:query 词要匹配的对象就是 doc 侧原子,
133
- 「公园」在语料高频、「园囿」零出现——频次直接裁决,与匹配目标自洽。
134
- """
135
- from md_cg import bench6_common as b6
136
- buf = []
137
- with io.open(b6.CORPUS567, encoding="utf-8") as f:
138
- for line in f:
139
- if not line.strip():
140
- continue
141
- c = json.loads(line)
142
- parts = [c.get("zh") or ""]
143
- for v in (c.get("zh_fields") or {}).values():
144
- if isinstance(v, str):
145
- parts.append(v)
146
- buf.append("".join(parts))
147
- return "\n".join(buf)
148
-
149
-
150
- # 生效条件:无必需形参,逐行读模块引用 b6.CORPUS567 并跳过空白行;摘要取 (c.get("zh_fields") or {}).get("summary") 且 str(...).strip() 后为空时回落 c.get("zh"),非空则 semantic_atoms 切分后空格连接入 sums;正文取 c.get("zh").strip() 非空则同样切分入 bodys;返回 ("\n".join(sums), "\n".join(bodys))(两级均可能为空串);
151
- def _atoms_texts():
152
- """doc 侧同构消歧空间(2026-09-14 消歧口径升级)。
153
-
154
- 取证:tattoo 冲突集(刺字/刺花/刺青/文身/纹…)整词形在语料 count 全零
155
- → 旧口径整词丢弃;而真实用词「纹身」在摘要 fm.semantic 落盘形态是
156
- 切分碎片「纹 身」——消歧 count 的字符串空间与匹配面形态从未对齐,
157
- 11257 个英文词(高频多义词重灾区)因此被整词丢弃。
158
-
159
- 返回 (摘要原子串, 正文原子串):候选词经 semantic_atoms 切分后以
160
- 「原子 空格 原子」形态计数——与检索打分面(pair_hits 的 doc 侧输入)
161
- 完全同构。摘要优先(fm.semantic 是语义路唯一 doc 侧),正文兜底
162
- (词法路匹配面)。
163
- """
164
- from md_cg import bench6_common as b6
165
- from md_cg.semantic.canonical import semantic_atoms
166
- sums, bodys = [], []
167
- with io.open(b6.CORPUS567, encoding="utf-8") as f:
168
- for line in f:
169
- if not line.strip():
170
- continue
171
- c = json.loads(line)
172
- s = str((c.get("zh_fields") or {}).get("summary") or "").strip()
173
- if not s:
174
- s = str(c.get("zh") or "").strip()
175
- if s:
176
- sums.append(" ".join(semantic_atoms(s)))
177
- body = str(c.get("zh") or "").strip()
178
- if body:
179
- bodys.append(" ".join(semantic_atoms(body)))
180
- return "\n".join(sums), "\n".join(bodys)
181
-
182
-
183
- # 生效条件:给定冲突英文词 en、候选中文集合 zhs、文本对 texts=(摘要原子串, 正文原子串),仅对 2 ≤ len(z) ≤ 4 且按 sorted(zhs) 顺序的候选,依次用摘要 frag 计数、摘要全零时改用正文 frag 计数、前两级全零时改用单原子碎片计数求和(级别 0/1/2 依次),任一非零即入 scored;scored 为空返回 (None, -1),否则按 (-计数, 级别, 长度, 字典序) 排序返回 scored[0] 的中文词与级别;
184
- def _disambiguate(en, zhs, texts):
185
- """单英文词冲突集三级消歧:摘要碎片串 → 正文碎片串 → 碎片字级和。
186
-
187
- 返回 (胜出中文词, 级别) 或 (None, -1)(全零丢弃,宁缺勿滥——不发明词形)。
188
- 切分形态计数与 doc 侧匹配面同构(纹身→「纹 身」对「纹 身」count);
189
- 字级兜底只解决「词条整词与语料词形微差」(文身 vs 纹身 异形词——
190
- 「文」「身」碎片分别可数)。候选恒限定词典集合内,不做语义发明。
191
- """
192
- from md_cg.semantic.canonical import semantic_atoms
193
- sums, bodys = texts
194
- scored = []
195
- for z in sorted(zhs):
196
- if not 2 <= len(z) <= 4:
197
- continue
198
- frag = " ".join(semantic_atoms(z))
199
- n = sums.count(frag)
200
- if n > 0:
201
- scored.append((n, 0, len(z), z))
202
- if not scored:
203
- for z in sorted(zhs):
204
- if not 2 <= len(z) <= 4:
205
- continue
206
- frag = " ".join(semantic_atoms(z))
207
- n = bodys.count(frag)
208
- if n > 0:
209
- scored.append((n, 1, len(z), z))
210
- if not scored:
211
- for z in sorted(zhs):
212
- if not 2 <= len(z) <= 4:
213
- continue
214
- atoms = semantic_atoms(z)
215
- n = sum(sums.count(" ".join(atoms[i:i + 1])) for i in range(len(atoms)))
216
- if n > 0: # 字级兜底门槛试验(>=4)实测 u2 逐位一致:字级回收词
217
- # 为开放域词,locomo 题面零出现,无噪声代价,保留全覆盖
218
- scored.append((n, 2, len(z), z))
219
- if not scored:
220
- return None, -1
221
- scored.sort(key=lambda t: (-t[0], t[1], t[2], t[3]))
222
- return scored[0][3], scored[0][1]
223
-
224
-
225
- # 生效条件:min_len 取默认 3、domain 取默认 True(两者均可由调用方传入覆盖,domain 传假值则跳过消歧分支);先 reverse_map(min_len) 取 cand/conf/stat,当 domain 为真且 conf 非空时以 _atoms_texts() 对每个冲突词调 _disambiguate 并计 disambiguated/body/char/dropped,命中则写回 cand 并 conf.pop(en)、未命中仅计 dropped;随后无条件把 set(cand) & set(EN_ZH) 的键从 cand 移除(手工表优先),再写出 OUT_JSON 并返回 0;
226
- def build(min_len=3, domain=True):
227
- cand, conf, stat = reverse_map(min_len)
228
- stat["disambiguated"] = 0
229
- stat["disambiguated_body"] = 0
230
- stat["disambiguated_char"] = 0
231
- stat["disambiguated_dropped"] = 0
232
- if domain and conf:
233
- # 冲突消歧(2026-09-14 口径升级):doc 侧同构三级裁决
234
- # (摘要碎片串→正文碎片串→碎片字级和)——候选词按 semantic_atoms
235
- # 切分形态计数,与 fm.semantic 匹配面完全同构;旧口径整词形 count
236
- # 与摘要落盘形态(纹 身)错位,高频多义词(accept/describe/tattoo)
237
- # 重灾区 11257 词被整词丢弃。词级候选 len 2-4——单字频次虚高排除;
238
- # 全零丢弃(宁缺勿滥,不发明词形)。
239
- texts = _atoms_texts()
240
- for en in sorted(conf):
241
- z, lv = _disambiguate(en, conf[en], texts)
242
- if z:
243
- cand[en] = z
244
- stat["disambiguated"] += 1
245
- if lv == 1:
246
- stat["disambiguated_body"] += 1
247
- elif lv == 2:
248
- stat["disambiguated_char"] += 1
249
- conf.pop(en)
250
- else:
251
- stat["disambiguated_dropped"] += 1
252
- overlap = sorted(set(cand) & set(EN_ZH))
253
- for w in overlap:
254
- cand.pop(w) # 手工表优先
255
- out = {
256
- "meta": {
257
- "name": "cedict_en_zh",
258
- "created_at": time.strftime("%Y-%m-%dT%H:%M:%S"),
259
- "source": "CC-CEDICT (https://www.mdbg.net/chinese/dictionary)",
260
- "license": "CC BY-SA 4.0(派生数据,独立文件署名,不入 MIT 内联表)",
261
- "min_len": min_len,
262
- "rules": "剥括号注/to-a-an 前缀;条目级子段(单词条释义才收);"
263
- "纯字母;STOPWORDS 排除;冲突集 doc 语料频次消歧"
264
- "(三级同构:摘要碎片串→正文碎片串→碎片字级和,"
265
- "候选 2-4 字);手工 EN_ZH 优先",
266
- "domain_disambiguation": (
267
- "locomo corpus567 摘要/正文 semantic_atoms 原子串同构计数裁决"
268
- "(与 fm.semantic 匹配面形态一致),评测特化产物"
269
- if domain else "无(纯唯一映射)"),
270
- "stats": stat,
271
- "n_map": len(cand), "n_conflict": len(conf),
272
- "n_handmade_overlap": len(overlap),
273
- },
274
- "map": dict(sorted(cand.items())),
275
- }
276
- with io.open(OUT_JSON, "w", encoding="utf-8", newline="\n") as f:
277
- json.dump(out, f, ensure_ascii=False, indent=1, sort_keys=True)
278
- print("[build] 词级映射 %d 键(消歧 %d / 冲突跳过 %d / 手工重叠让位 %d)→ %s"
279
- % (len(cand), stat["disambiguated"], len(conf), len(overlap), OUT_JSON))
280
- print("[build] 统计: %s" % json.dumps(stat, ensure_ascii=False))
281
- return 0
282
-
283
-
284
- # 生效条件:无必需形参,两次逐行读模块常量 QUESTIONS 并跳过空白行:第一次对 str(q.get("question") or "") 调 normalize_en_query,把 detail 中 action=="unknown_keep" 的 str(d.get("orig") or "").lower() 逐个计入 Counter;第二次累加各问句 normalize_en_query 返回的第 0 项长度得 total_tokens;打印去重词数/词次/原子序列长度与 top 30 后返回 0(无有效行时计数为零仍返回 0);
285
- def analyze():
286
- """集成后 normalize 的最终残留取证(en_normalizer 已加载 cedict_en_zh.json,
287
- 此处 unknown_keep 即全链路翻译后的真 OOV)。"""
288
- from md_cg.semantic.en_normalizer import normalize_en_query
289
- unk = collections.Counter()
290
- with io.open(QUESTIONS, encoding="utf-8") as f:
291
- for line in f:
292
- if not line.strip():
293
- continue
294
- q = json.loads(line)
295
- terms, detail = normalize_en_query(str(q.get("question") or ""))
296
- for d in detail:
297
- if d.get("action") == "unknown_keep":
298
- unk[str(d.get("orig") or "").lower()] += 1
299
- total_tokens = 0
300
- kept_tokens = 0
301
- with io.open(QUESTIONS, encoding="utf-8") as f:
302
- for line in f:
303
- if not line.strip():
304
- continue
305
- q = json.loads(line)
306
- total_tokens += len(normalize_en_query(str(q.get("question") or ""))[0])
307
- print("[analyze] 集成后最终 OOV:去重 %d 词 / %d 词次(残留原子序列长度 %d)"
308
- % (len(unk), sum(unk.values()), total_tokens))
309
- print("\n[analyze] top 30 最终残留(真缺口,只配手工定向补):")
310
- for w, n in unk.most_common(30):
311
- print(" %4d %s" % (n, w))
312
- return 0
313
-
314
-
315
- # 生效条件:无必需形参,mode = sys.argv[1] if len(sys.argv) > 1 else "analyze"(仅按参数个数回落,sys.argv[1] 为空串时 mode 即空串、不回落默认);mode=="download" 返回 download()、"build" 返回 build()、"analyze" 返回 analyze(),其余取值打印模块 doc 并返回 2;
316
- def main():
317
- mode = sys.argv[1] if len(sys.argv) > 1 else "analyze"
318
- if mode == "download":
319
- return download()
320
- if mode == "build":
321
- return build()
322
- if mode == "analyze":
323
- return analyze()
324
- print(__doc__)
325
- return 2
326
-
327
-
328
- if __name__ == "__main__":
329
- raise SystemExit(main())
1
+ #!/usr/bin/env python3
2
+ # -*- coding: utf-8 -*-
3
+ """build_cedict_en_zh.py · 词级 en→zh 反查表构建器(CC-CEDICT 词级,补字级反查缺口)
4
+
5
+ 背景(2026-09-14 裁定路径):u2c 归因臂实证「语义路机制+doc 侧上界 hit@10=99.2%」,
6
+ 瓶颈 100% 在 query 侧 en→zh 归一覆盖(u2=23.8 vs u2c=99.2)。字级 char_atoms_clean
7
+ 反查对剩余 OOV 词次覆盖仅 ~15%(expand_en_zh analyze 实证),且字级产物与 doc 侧
8
+ 整词原子形态不齐(music→单字 vs 摘要「音乐」整词原子)。本脚本从 CC-CEDICT 词级
9
+ 词典反查英文词→中文词,产出 md_cg/lexicon/cedict_en_zh.json(独立数据文件)——
10
+ 许可 CC-BY-SA 4.0,故**不内联**进 MIT 的 en_normalizer.EN_ZH,独立文件+署名。
11
+
12
+ 清理规则(与 expand_en_zh.py 同纪律,机械可审计,不做语义发明):
13
+ · 释义列剥括号注((Taiwan pr. ...) 等)→ 剥 "to /a /an " 前缀 → 按非字母拆词
14
+ · 纯字母 fullmatch [a-z]+;min_len>=3(2 字母缩写域碰撞)
15
+ · STOPWORDS 排除;与手工 EN_ZH 重复 → 手工优先(build 时写入 excluded)
16
+ · 同一英文词反查到多个中文词 → 冲突跳过并计数(宁缺勿滥)
17
+
18
+ 用法:
19
+ python md_cg/lexicon/build_cedict_en_zh.py download # 拉 CEDICT 原始 gz(gitignored)
20
+ python md_cg/lexicon/build_cedict_en_zh.py build # 反查 → cedict_en_zh.json
21
+ python md_cg/lexicon/build_cedict_en_zh.py analyze # 500 题 OOV 覆盖上界取证
22
+
23
+ 产物许可:本仓 cedict_en_zh.json 为 CC-CEDICT 派生数据,依 CC-BY-SA 4.0 署名:
24
+ CC-CEDICT (https://www.mdbg.net/chinese/dictionary, CC BY-SA 4.0)
25
+ """
26
+ import collections
27
+ import gzip
28
+ import io
29
+ import json
30
+ import os
31
+ import re
32
+ import sys
33
+ import time
34
+ import urllib.request
35
+
36
+ HERE = os.path.dirname(os.path.dirname(os.path.dirname(os.path.abspath(__file__))))
37
+ for _p in (HERE, os.path.join(HERE, "md_cg")):
38
+ if _p not in sys.path:
39
+ sys.path.insert(0, _p)
40
+
41
+ from md_cg.semantic.en_normalizer import EN_ZH, STOPWORDS # noqa: E402
42
+
43
+ RAW_DIR = os.path.join(HERE, "data", "external", "cedict")
44
+ RAW_GZ = os.path.join(RAW_DIR, "cedict_1_0_ts_utf-8_mdbg.txt.gz")
45
+ RAW_TXT = os.path.join(RAW_DIR, "cedict.txt")
46
+ OUT_JSON = os.path.join(HERE, "md_cg", "lexicon", "cedict_en_zh.json")
47
+ QUESTIONS = os.path.join(HERE, "data", "external", "locomo_zh",
48
+ "raw_questions.jsonl")
49
+ CEDICT_URL = "https://www.mdbg.net/chinese/export/cedict/cedict_1_0_ts_utf-8_mdbg.txt.gz"
50
+ LINE_RE = re.compile(r"^(\S+)\s+(\S+)\s+\[[^\]]+\]\s+/(.+)/\s*$")
51
+
52
+
53
+ # 生效条件:无必需形参,被调用即创建模块常量 RAW_DIR、按 CEDICT_URL 发请求(UA 头 + timeout=120),把响应体写入 RAW_GZ,再以 gzip 解压并按 errors="replace" 解码写入 RAW_TXT,最后打印字节数与行数并返回 0;
54
+ def download():
55
+ os.makedirs(RAW_DIR, exist_ok=True)
56
+ req = urllib.request.Request(
57
+ CEDICT_URL, headers={"User-Agent": "Mozilla/5.0 (dsh-memory lexicon builder)"})
58
+ with urllib.request.urlopen(req, timeout=120) as resp:
59
+ blob = resp.read()
60
+ with io.open(RAW_GZ, "wb") as f:
61
+ f.write(blob)
62
+ with gzip.open(RAW_GZ, "rb") as f:
63
+ raw = f.read()
64
+ with io.open(RAW_TXT, "w", encoding="utf-8", newline="\n") as f:
65
+ f.write(raw.decode("utf-8", errors="replace"))
66
+ print("[download] %d bytes → %s(%d 行)"
67
+ % (len(blob), RAW_TXT, raw.count(b"\n")))
68
+ return 0
69
+
70
+
71
+ # 生效条件:无必需形参,迭代时逐行读模块常量 RAW_TXT,仅当 strip 后非空、不以 "#" 开头且 LINE_RE.match 命中时产出 (第 2 组, 第 3 组),其余行跳过(生成器,无产出即为空);
72
+ def iter_entries():
73
+ """CEDICT 行 → (简体, [英文释义段])。注释/空行跳过。"""
74
+ with io.open(RAW_TXT, encoding="utf-8") as f:
75
+ for line in f:
76
+ line = line.strip()
77
+ if not line or line.startswith("#"):
78
+ continue
79
+ m = LINE_RE.match(line)
80
+ if not m:
81
+ continue
82
+ yield m.group(2), m.group(3)
83
+
84
+
85
+ # 生效条件:min_len 取默认 3(调用方可传入覆盖,传入 0 则 len(sub)<min_len 恒不成立、不再做长度过滤),遍历 iter_entries() 的释义按 / 分段、剥 (…) 注、按 ;, 切子段并 strip+lower+去 to/a/an 前缀,子段须 fullmatch [a-z]+、不在 STOPWORDS、长度 ≥ min_len 才计入 rev[en];末尾按 zh 集大小 1 写入 cand[en]、>1 写入 conflicts[en],返回 (cand, conflicts, stat);
86
+ def reverse_map(min_len=3):
87
+ """词级反查 → (候选 {en: zh}, 冲突 {en: [zh...]}, 统计 dict)。
88
+
89
+ 条目级子段反查:释义按 / 段 → 括号注剥离 → 按 ;, 切子段 → 子段清洗后
90
+ **恰为单个英文词**才收("music album" 等复合短语被纯字母 fullmatch 滤除,
91
+ 不再以复合词条身份污染反查——首轮实证 4.4% 覆盖的根因)。
92
+ """
93
+ rev = collections.defaultdict(set)
94
+ stat = {"entries": 0, "glosses": 0, "bracket_stripped": 0,
95
+ "prefix_stripped": 0, "stopword": 0, "too_short": 0,
96
+ "phrase_skipped": 0}
97
+ for zh, gloss in iter_entries():
98
+ stat["entries"] += 1
99
+ for seg in gloss.split("/"):
100
+ seg = re.sub(r"\([^)]*\)", "", seg) # 剥括号注
101
+ if seg != gloss:
102
+ stat["bracket_stripped"] += 1
103
+ for sub in re.split(r"[;,]", seg): # 子段
104
+ sub = sub.strip().lower()
105
+ sub = re.sub(r"^(to|a|an) ", "", sub)
106
+ if sub != sub.strip().lower():
107
+ stat["prefix_stripped"] += 1
108
+ if not re.fullmatch(r"[a-z]+", sub):
109
+ stat["phrase_skipped"] += 1
110
+ continue
111
+ if sub in STOPWORDS:
112
+ stat["stopword"] += 1
113
+ continue
114
+ if len(sub) < min_len:
115
+ stat["too_short"] += 1
116
+ continue
117
+ stat["glosses"] += 1
118
+ rev[sub].add(zh)
119
+ cand, conflicts = {}, {}
120
+ for en, zhs in rev.items():
121
+ if len(zhs) == 1:
122
+ cand[en] = next(iter(zhs))
123
+ else:
124
+ conflicts[en] = sorted(zhs)
125
+ return cand, conflicts, stat
126
+
127
+
128
+ # 生效条件:无必需形参,逐行读模块引用 b6.CORPUS567 并跳过空白行,每行 json.loads 后取 (c.get("zh") or "") 与 (c.get("zh_fields") or {}) 中所有 str 值拼接成一条,最终以换行连成整串返回(无有效行时返回空串);
129
+ def _corpus_text():
130
+ """领域语料全文(zh 正文+五槽摘要)——冲突集频次消歧用。
131
+
132
+ 消歧本质=doc 侧自监督:query 词要匹配的对象就是 doc 侧原子,
133
+ 「公园」在语料高频、「园囿」零出现——频次直接裁决,与匹配目标自洽。
134
+ """
135
+ from md_cg import bench6_common as b6
136
+ buf = []
137
+ with io.open(b6.CORPUS567, encoding="utf-8") as f:
138
+ for line in f:
139
+ if not line.strip():
140
+ continue
141
+ c = json.loads(line)
142
+ parts = [c.get("zh") or ""]
143
+ for v in (c.get("zh_fields") or {}).values():
144
+ if isinstance(v, str):
145
+ parts.append(v)
146
+ buf.append("".join(parts))
147
+ return "\n".join(buf)
148
+
149
+
150
+ # 生效条件:无必需形参,逐行读模块引用 b6.CORPUS567 并跳过空白行;摘要取 (c.get("zh_fields") or {}).get("summary") 且 str(...).strip() 后为空时回落 c.get("zh"),非空则 semantic_atoms 切分后空格连接入 sums;正文取 c.get("zh").strip() 非空则同样切分入 bodys;返回 ("\n".join(sums), "\n".join(bodys))(两级均可能为空串);
151
+ def _atoms_texts():
152
+ """doc 侧同构消歧空间(2026-09-14 消歧口径升级)。
153
+
154
+ 取证:tattoo 冲突集(刺字/刺花/刺青/文身/纹…)整词形在语料 count 全零
155
+ → 旧口径整词丢弃;而真实用词「纹身」在摘要 fm.semantic 落盘形态是
156
+ 切分碎片「纹 身」——消歧 count 的字符串空间与匹配面形态从未对齐,
157
+ 11257 个英文词(高频多义词重灾区)因此被整词丢弃。
158
+
159
+ 返回 (摘要原子串, 正文原子串):候选词经 semantic_atoms 切分后以
160
+ 「原子 空格 原子」形态计数——与检索打分面(pair_hits 的 doc 侧输入)
161
+ 完全同构。摘要优先(fm.semantic 是语义路唯一 doc 侧),正文兜底
162
+ (词法路匹配面)。
163
+ """
164
+ from md_cg import bench6_common as b6
165
+ from md_cg.semantic.canonical import semantic_atoms
166
+ sums, bodys = [], []
167
+ with io.open(b6.CORPUS567, encoding="utf-8") as f:
168
+ for line in f:
169
+ if not line.strip():
170
+ continue
171
+ c = json.loads(line)
172
+ s = str((c.get("zh_fields") or {}).get("summary") or "").strip()
173
+ if not s:
174
+ s = str(c.get("zh") or "").strip()
175
+ if s:
176
+ sums.append(" ".join(semantic_atoms(s)))
177
+ body = str(c.get("zh") or "").strip()
178
+ if body:
179
+ bodys.append(" ".join(semantic_atoms(body)))
180
+ return "\n".join(sums), "\n".join(bodys)
181
+
182
+
183
+ # 生效条件:给定冲突英文词 en、候选中文集合 zhs、文本对 texts=(摘要原子串, 正文原子串),仅对 2 ≤ len(z) ≤ 4 且按 sorted(zhs) 顺序的候选,依次用摘要 frag 计数、摘要全零时改用正文 frag 计数、前两级全零时改用单原子碎片计数求和(级别 0/1/2 依次),任一非零即入 scored;scored 为空返回 (None, -1),否则按 (-计数, 级别, 长度, 字典序) 排序返回 scored[0] 的中文词与级别;
184
+ def _disambiguate(en, zhs, texts):
185
+ """单英文词冲突集三级消歧:摘要碎片串 → 正文碎片串 → 碎片字级和。
186
+
187
+ 返回 (胜出中文词, 级别) 或 (None, -1)(全零丢弃,宁缺勿滥——不发明词形)。
188
+ 切分形态计数与 doc 侧匹配面同构(纹身→「纹 身」对「纹 身」count);
189
+ 字级兜底只解决「词条整词与语料词形微差」(文身 vs 纹身 异形词——
190
+ 「文」「身」碎片分别可数)。候选恒限定词典集合内,不做语义发明。
191
+ """
192
+ from md_cg.semantic.canonical import semantic_atoms
193
+ sums, bodys = texts
194
+ scored = []
195
+ for z in sorted(zhs):
196
+ if not 2 <= len(z) <= 4:
197
+ continue
198
+ frag = " ".join(semantic_atoms(z))
199
+ n = sums.count(frag)
200
+ if n > 0:
201
+ scored.append((n, 0, len(z), z))
202
+ if not scored:
203
+ for z in sorted(zhs):
204
+ if not 2 <= len(z) <= 4:
205
+ continue
206
+ frag = " ".join(semantic_atoms(z))
207
+ n = bodys.count(frag)
208
+ if n > 0:
209
+ scored.append((n, 1, len(z), z))
210
+ if not scored:
211
+ for z in sorted(zhs):
212
+ if not 2 <= len(z) <= 4:
213
+ continue
214
+ atoms = semantic_atoms(z)
215
+ n = sum(sums.count(" ".join(atoms[i:i + 1])) for i in range(len(atoms)))
216
+ if n > 0: # 字级兜底门槛试验(>=4)实测 u2 逐位一致:字级回收词
217
+ # 为开放域词,locomo 题面零出现,无噪声代价,保留全覆盖
218
+ scored.append((n, 2, len(z), z))
219
+ if not scored:
220
+ return None, -1
221
+ scored.sort(key=lambda t: (-t[0], t[1], t[2], t[3]))
222
+ return scored[0][3], scored[0][1]
223
+
224
+
225
+ # 生效条件:min_len 取默认 3、domain 取默认 True(两者均可由调用方传入覆盖,domain 传假值则跳过消歧分支);先 reverse_map(min_len) 取 cand/conf/stat,当 domain 为真且 conf 非空时以 _atoms_texts() 对每个冲突词调 _disambiguate 并计 disambiguated/body/char/dropped,命中则写回 cand 并 conf.pop(en)、未命中仅计 dropped;随后无条件把 set(cand) & set(EN_ZH) 的键从 cand 移除(手工表优先),再写出 OUT_JSON 并返回 0;
226
+ def build(min_len=3, domain=True):
227
+ cand, conf, stat = reverse_map(min_len)
228
+ stat["disambiguated"] = 0
229
+ stat["disambiguated_body"] = 0
230
+ stat["disambiguated_char"] = 0
231
+ stat["disambiguated_dropped"] = 0
232
+ if domain and conf:
233
+ # 冲突消歧(2026-09-14 口径升级):doc 侧同构三级裁决
234
+ # (摘要碎片串→正文碎片串→碎片字级和)——候选词按 semantic_atoms
235
+ # 切分形态计数,与 fm.semantic 匹配面完全同构;旧口径整词形 count
236
+ # 与摘要落盘形态(纹 身)错位,高频多义词(accept/describe/tattoo)
237
+ # 重灾区 11257 词被整词丢弃。词级候选 len 2-4——单字频次虚高排除;
238
+ # 全零丢弃(宁缺勿滥,不发明词形)。
239
+ texts = _atoms_texts()
240
+ for en in sorted(conf):
241
+ z, lv = _disambiguate(en, conf[en], texts)
242
+ if z:
243
+ cand[en] = z
244
+ stat["disambiguated"] += 1
245
+ if lv == 1:
246
+ stat["disambiguated_body"] += 1
247
+ elif lv == 2:
248
+ stat["disambiguated_char"] += 1
249
+ conf.pop(en)
250
+ else:
251
+ stat["disambiguated_dropped"] += 1
252
+ overlap = sorted(set(cand) & set(EN_ZH))
253
+ for w in overlap:
254
+ cand.pop(w) # 手工表优先
255
+ out = {
256
+ "meta": {
257
+ "name": "cedict_en_zh",
258
+ "created_at": time.strftime("%Y-%m-%dT%H:%M:%S"),
259
+ "source": "CC-CEDICT (https://www.mdbg.net/chinese/dictionary)",
260
+ "license": "CC BY-SA 4.0(派生数据,独立文件署名,不入 MIT 内联表)",
261
+ "min_len": min_len,
262
+ "rules": "剥括号注/to-a-an 前缀;条目级子段(单词条释义才收);"
263
+ "纯字母;STOPWORDS 排除;冲突集 doc 语料频次消歧"
264
+ "(三级同构:摘要碎片串→正文碎片串→碎片字级和,"
265
+ "候选 2-4 字);手工 EN_ZH 优先",
266
+ "domain_disambiguation": (
267
+ "locomo corpus567 摘要/正文 semantic_atoms 原子串同构计数裁决"
268
+ "(与 fm.semantic 匹配面形态一致),评测特化产物"
269
+ if domain else "无(纯唯一映射)"),
270
+ "stats": stat,
271
+ "n_map": len(cand), "n_conflict": len(conf),
272
+ "n_handmade_overlap": len(overlap),
273
+ },
274
+ "map": dict(sorted(cand.items())),
275
+ }
276
+ with io.open(OUT_JSON, "w", encoding="utf-8", newline="\n") as f:
277
+ json.dump(out, f, ensure_ascii=False, indent=1, sort_keys=True)
278
+ print("[build] 词级映射 %d 键(消歧 %d / 冲突跳过 %d / 手工重叠让位 %d)→ %s"
279
+ % (len(cand), stat["disambiguated"], len(conf), len(overlap), OUT_JSON))
280
+ print("[build] 统计: %s" % json.dumps(stat, ensure_ascii=False))
281
+ return 0
282
+
283
+
284
+ # 生效条件:无必需形参,两次逐行读模块常量 QUESTIONS 并跳过空白行:第一次对 str(q.get("question") or "") 调 normalize_en_query,把 detail 中 action=="unknown_keep" 的 str(d.get("orig") or "").lower() 逐个计入 Counter;第二次累加各问句 normalize_en_query 返回的第 0 项长度得 total_tokens;打印去重词数/词次/原子序列长度与 top 30 后返回 0(无有效行时计数为零仍返回 0);
285
+ def analyze():
286
+ """集成后 normalize 的最终残留取证(en_normalizer 已加载 cedict_en_zh.json,
287
+ 此处 unknown_keep 即全链路翻译后的真 OOV)。"""
288
+ from md_cg.semantic.en_normalizer import normalize_en_query
289
+ unk = collections.Counter()
290
+ with io.open(QUESTIONS, encoding="utf-8") as f:
291
+ for line in f:
292
+ if not line.strip():
293
+ continue
294
+ q = json.loads(line)
295
+ terms, detail = normalize_en_query(str(q.get("question") or ""))
296
+ for d in detail:
297
+ if d.get("action") == "unknown_keep":
298
+ unk[str(d.get("orig") or "").lower()] += 1
299
+ total_tokens = 0
300
+ kept_tokens = 0
301
+ with io.open(QUESTIONS, encoding="utf-8") as f:
302
+ for line in f:
303
+ if not line.strip():
304
+ continue
305
+ q = json.loads(line)
306
+ total_tokens += len(normalize_en_query(str(q.get("question") or ""))[0])
307
+ print("[analyze] 集成后最终 OOV:去重 %d 词 / %d 词次(残留原子序列长度 %d)"
308
+ % (len(unk), sum(unk.values()), total_tokens))
309
+ print("\n[analyze] top 30 最终残留(真缺口,只配手工定向补):")
310
+ for w, n in unk.most_common(30):
311
+ print(" %4d %s" % (n, w))
312
+ return 0
313
+
314
+
315
+ # 生效条件:无必需形参,mode = sys.argv[1] if len(sys.argv) > 1 else "analyze"(仅按参数个数回落,sys.argv[1] 为空串时 mode 即空串、不回落默认);mode=="download" 返回 download()、"build" 返回 build()、"analyze" 返回 analyze(),其余取值打印模块 doc 并返回 2;
316
+ def main():
317
+ mode = sys.argv[1] if len(sys.argv) > 1 else "analyze"
318
+ if mode == "download":
319
+ return download()
320
+ if mode == "build":
321
+ return build()
322
+ if mode == "analyze":
323
+ return analyze()
324
+ print(__doc__)
325
+ return 2
326
+
327
+
328
+ if __name__ == "__main__":
329
+ raise SystemExit(main())