@furongjun1999/dsh-memory 0.4.11 → 0.5.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (504) hide show
  1. package/README.md +16 -16
  2. package/codebuddy/CODEBUDDY.md +11 -3
  3. package/codebuddy/README.md +92 -90
  4. package/codebuddy/mcp.json +27 -27
  5. package/docs/GBrain/345/217/257/345/200/237/351/211/264/347/202/271_/347/201/265/346/236/242/350/220/275/347/202/271/344/272/244/346/216/245_20260919.md +169 -169
  6. package/docs/Pi/345/217/257/345/255/246/344/271/240/344/274/230/347/202/271_/347/201/265/346/236/242/345/244/247/350/204/221/346/224/271/350/277/233/344/272/244/346/216/245_20260915.md +144 -144
  7. package/docs/README.md +142 -111
  8. package/docs/discipline/harnesses.yaml +244 -226
  9. package/docs/discipline/templates/full.md.tmpl +61 -61
  10. package/docs/discipline/templates/rules.mdc.tmpl +68 -0
  11. package/docs/discipline/templates/skill.md.tmpl +23 -23
  12. package/docs/eval/AGI/344/270/203/347/273/264/350/257/204/345/210/206/346/212/245/345/221/212_md_cg_v1.0.md +299 -299
  13. package/docs/eval/AGI/344/270/203/347/273/264/350/257/204/345/210/206/346/212/245/345/221/212_md_cg_v2.0.md +239 -239
  14. package/docs/eval//345/256/236/351/252/214/346/226/271/346/241/210_/345/255/246/344/271/240/351/227/255/347/216/257AB/344/270/216/346/250/252/350/257/204_v1.0.md +174 -174
  15. package/docs/eval//346/250/252/350/257/204_/345/205/255/345/256/266100/351/242/230/344/270/255/350/213/261/345/217/214/346/237/245_v1.0.md +223 -223
  16. package/docs/{mdcg → hive}//344/273/244/347/211/214/344/270/216/350/247/222/350/211/262/346/235/203/350/201/214/345/210/206/347/246/273_v0.1.md +165 -160
  17. package/docs/hive//344/273/244/347/211/214/350/257/255/344/271/211/344/277/256/346/255/243_/344/273/262/350/243/201/344/275/215_v0.1.md +76 -0
  18. package/docs/{mdcg → hive}//345/255/220/344/273/243/347/220/206/351/205/215/347/275/256/346/240/207/345/207/206_v0.5.md +236 -236
  19. package/docs/hive//346/243/200/347/264/242/346/224/266/346/225/233/345/256/236/346/265/213/344/270/216S1b/350/256/276/350/256/241_v0.1.md +43 -43
  20. package/docs/hive//346/243/200/347/264/242/347/256/227/346/263/225/345/217/243/345/276/204/345/257/271/347/205/247_v0.1.md +85 -0
  21. package/docs/hive//346/243/200/347/264/242/350/267/257/345/276/204/344/270/216/350/256/244/347/237/245/347/273/223/346/236/204/345/245/221/347/272/246_v0.1.md +102 -102
  22. package/docs/hive//350/234/202/345/267/242M6_ingest/345/256/236/346/226/275/350/256/241/345/210/222_v0.1.md +47 -0
  23. package/docs/hive//350/234/202/345/267/242/345/217/214/345/256/236/344/276/213/344/272/222/351/252/214_/350/256/276/350/256/241/345/256/232/347/250/277.md +503 -503
  24. package/docs/hive//350/234/202/345/267/242/345/267/245/344/275/234/350/256/260/345/277/206_/351/241/271/347/233/256/350/256/241/345/210/222.md +85 -85
  25. package/docs/hive//350/234/202/345/267/242/350/256/276/350/256/241_/347/220/206/350/256/272/345/257/271/351/275/220_v0.1.md +191 -0
  26. package/docs/hive//350/234/202/345/267/242/350/277/255/344/273/243_/345/256/217/350/247/202/344/270/216/347/276/244/344/275/223/350/260/203/345/272/246_v0.1.md +90 -0
  27. package/docs/mdcg/D_meta_/345/267/245/347/250/213/345/214/226/346/226/271/346/241/210_v0.2.md +216 -216
  28. package/docs/mdcg/README/350/257/246/347/273/206/347/211/210_v0.4.10.md +646 -646
  29. package/docs/mdcg/lingshu_tutorial.html +14449 -14449
  30. package/docs/mdcg/release_v0.4.11.md +49 -0
  31. package/docs/mdcg/release_v0.4.5.md +55 -55
  32. package/docs/mdcg/tool_table_v0.3.0.md +117 -117
  33. package/docs/mdcg//345/205/250/345/272/223/344/273/243/347/240/201/350/257/204/345/256/241/344/270/216/346/235/241/344/273/266/345/214/226/346/263/250/351/207/212_/350/256/241/345/210/222_v0.1.md +600 -600
  34. package/docs/mdcg//345/212/237/350/203/275/350/260/203/347/224/250/346/230/240/345/260/204/350/241/250_v0.1.md +40 -40
  35. package/docs/mdcg//345/215/225/345/205/203/350/207/252/346/210/221/351/224/232/347/202/271_/347/263/273/347/273/237/346/217/220/347/244/272/350/257/215/346/240/207/345/207/206_v0.3.md +275 -275
  36. package/docs/mdcg//345/217/221/345/270/203/351/227/250/347/246/201/351/223/276_v0.1.md +54 -0
  37. package/docs/mdcg//346/272/220/347/240/201/347/272/247/346/236/266/346/236/204/345/256/241/350/256/241_GPT/346/211/271/350/257/204/345/257/271/347/205/247_v1.0.md +130 -130
  38. package/docs/mdcg//347/201/265/346/236/24282/345/267/245/345/205/267_/345/212/237/350/203/275/346/225/264/347/220/206/344/270/216/350/277/201/347/247/273/346/230/240/345/260/204_v0.1.md +278 -278
  39. package/docs/mdcg//347/201/265/346/236/242/350/256/260/345/277/206/345/212/250/350/257/215/345/215/217/350/256/256_v1.0-draft.md +172 -172
  40. package/docs/mdcg//347/274/272/345/217/243/345/215/225_P0/346/224/266/345/217/243_v0.1.md +270 -270
  41. package/docs/mdcg//350/256/244/347/237/245/345/233/276_G4-G8/347/274/272/345/217/243/350/243/201/345/256/232/345/215/225_v0.1.md +491 -491
  42. package/docs/mdcg//350/256/244/347/237/245/345/233/276_/346/235/241/344/273/266/347/251/272/351/227/264/345/220/210/346/210/220/344/270/216/347/224/237/346/225/210/346/235/241/344/273/266/345/217/243/345/276/204_v0.1.md +340 -340
  43. package/docs/mdcg//350/256/244/347/237/245/345/233/276_/347/264/242/345/274/225/344/270/216/345/267/245/347/250/213/350/247/204/350/214/203/345/214/226_/350/256/241/345/210/222_v0.1.md +588 -588
  44. package/docs/plans/GridWorld/346/234/200/345/260/217/351/227/255/347/216/257/350/247/204/346/240/274_v0.1.md +176 -176
  45. package/docs/plans//345/221/275/345/220/215/346/262/273/347/220/206_/351/241/271/347/233/256/350/256/241/345/210/222.md +81 -81
  46. package/docs/swarm//350/234/202/347/276/244/344/272/222/350/201/224_v0.1.md +704 -704
  47. package/docs/swarm//350/234/202/347/276/244/345/220/214/351/224/231/346/243/200/346/265/213/345/256/236/351/252/214/345/215/217/350/256/256_v0.1.md +242 -242
  48. package/docs/theory//345/215/225/347/272/277/347/250/213/344/270/216/346/263/250/346/204/217/345/212/233/351/233/206/344/270/255_/346/227/240/344/272/211/350/256/256/347/220/206/350/256/272/346/226/207/346/241/243_v1.0.md +129 -129
  49. package/docs/theory//345/271/266/345/217/221/345/277/205/347/204/266/346/200/247/347/220/206/350/256/272_v0.2.md +134 -134
  50. package/docs/theory//346/231/272/350/203/275/350/256/2723.4.md +5260 -5260
  51. package/docs/theory//346/246/202/345/277/265/345/210/206/345/261/202/345/257/271/351/275/220/350/241/250_v0.1.md +145 -145
  52. package/docs/theory//347/220/206/350/256/272_/346/234/272/345/210/266_/344/273/243/347/240/201_/345/256/236/351/252/214_/347/274/272/345/217/243/347/237/251/351/230/265_v0.1.md +144 -144
  53. package/docs/theory//347/220/206/350/256/272/344/273/223/346/213/206/345/210/206/344/270/216/347/231/275/347/256/261/347/237/245/350/257/206/345/272/223/345/206/205/350/277/201_v0.1.md +198 -198
  54. package/docs/theory//350/256/244/347/237/245/344/273/243/347/220/206/344/270/216/346/224/266/346/225/233/347/273/223/346/236/204_/346/235/241/344/273/266/350/256/272/351/207/215/346/236/204_v0.1.md +221 -221
  55. package/docs/world_model//344/270/226/347/225/214/346/250/241/345/236/213_/347/245/236/347/273/217/347/275/221/347/273/234/345/272/225/345/261/202/346/236/266/346/236/204_v1.0.md +237 -237
  56. package/docs//345/217/221/345/270/203/344/273/266/345/233/236/346/272/257/350/257/264/346/230/216_v0.1.md +82 -82
  57. package/docs//345/267/245/344/275/234/347/272/252/345/276/213_/350/256/244/347/237/245/345/233/276/346/235/241/347/233/256_v1.1.json +28 -2
  58. package/dsh/README.md +82 -82
  59. package/dsh/cordis.yml.example +139 -139
  60. package/dsh/update-lingshu.bat +11 -11
  61. package/lib/hooks.js +36 -2
  62. package/lib/lib/roleplay_web.js +427 -427
  63. package/md_cg/__init__.py +7 -7
  64. package/md_cg/audit.py +368 -368
  65. package/md_cg/autonomy.py +287 -287
  66. package/md_cg/backfill.py +1327 -1327
  67. package/md_cg/backfill_bigdomain.py +34 -34
  68. package/md_cg/bench6_arms.py +410 -410
  69. package/md_cg/bench6_common.py +230 -230
  70. package/md_cg/bench6_competitors.py +212 -212
  71. package/md_cg/bench_axis_domain.py +257 -257
  72. package/md_cg/bench_blind_comp.py +308 -308
  73. package/md_cg/bench_en_atoms_public.py +230 -230
  74. package/md_cg/bench_governance.py +348 -348
  75. package/md_cg/bench_lme_zh.py +410 -410
  76. package/md_cg/bench_locomo.py +121 -121
  77. package/md_cg/bench_locomo_zh.py +450 -450
  78. package/md_cg/bench_locomo_zh_public.py +147 -147
  79. package/md_cg/bench_longmem.py +112 -112
  80. package/md_cg/bench_membench.py +632 -632
  81. package/md_cg/bench_p0.py +149 -149
  82. package/md_cg/bench_progressive.py +287 -287
  83. package/md_cg/bench_role_views.py +238 -238
  84. package/md_cg/bench_task_ab.py +243 -243
  85. package/md_cg/bench_task_ab_llm.py +408 -408
  86. package/md_cg/bench_unified_en.py +204 -204
  87. package/md_cg/bench_zh_mad.py +601 -601
  88. package/md_cg/blindspot_tickets.py +123 -123
  89. package/md_cg/branches.py +285 -285
  90. package/md_cg/build_postings.py +73 -73
  91. package/md_cg/ccgc.py +1005 -948
  92. package/md_cg/census.py +132 -132
  93. package/md_cg/chain.py +300 -300
  94. package/md_cg/codeindex.py +531 -531
  95. package/md_cg/coldverify.py +292 -292
  96. package/md_cg/comment_gate.py +337 -337
  97. package/md_cg/cond_compose.py +190 -190
  98. package/md_cg/cond_facts.py +154 -154
  99. package/md_cg/cond_template.json +106 -106
  100. package/md_cg/condition_anchor.py +142 -142
  101. package/md_cg/conformance.py +726 -726
  102. package/md_cg/consistency.py +717 -717
  103. package/md_cg/consolidate.py +1536 -1439
  104. package/md_cg/corpus.py +110 -110
  105. package/md_cg/crosscheck.py +1097 -1097
  106. package/md_cg/crypto.py +437 -437
  107. package/md_cg/d_meta.py +310 -310
  108. package/md_cg/datapath.py +334 -334
  109. package/md_cg/docindex.py +473 -473
  110. package/md_cg/eval_common.py +575 -575
  111. package/md_cg/evidence.py +580 -580
  112. package/md_cg/evolution.py +477 -477
  113. package/md_cg/export.py +220 -220
  114. package/md_cg/forgetting.py +581 -581
  115. package/md_cg/fsutil.py +329 -329
  116. package/md_cg/hotcache.py +238 -214
  117. package/md_cg/hyperedge.py +251 -251
  118. package/md_cg/identity.py +390 -390
  119. package/md_cg/insight.py +500 -500
  120. package/md_cg/interop.py +199 -0
  121. package/md_cg/lexicon/build_cedict_en_zh.py +329 -329
  122. package/md_cg/lexicon/build_standard_en.py +171 -171
  123. package/md_cg/lexicon/expand_en_zh.py +211 -211
  124. package/md_cg/lifecycle.py +272 -272
  125. package/md_cg/linkref.py +280 -280
  126. package/md_cg/links.py +622 -622
  127. package/md_cg/mcp_server.py +129 -32
  128. package/md_cg/md_whitebox.py +345 -345
  129. package/md_cg/mdcg.py +176 -117
  130. package/md_cg/mdcos.py +79 -13
  131. package/md_cg/metacognition.py +591 -591
  132. package/md_cg/migrate.py +119 -119
  133. package/md_cg/migrate_aeis.py +221 -221
  134. package/md_cg/migrate_roleplay.py +293 -293
  135. package/md_cg/migrate_wisdom_graph.py +360 -360
  136. package/md_cg/mreview/__init__.py +25 -25
  137. package/md_cg/mreview/__main__.py +110 -110
  138. package/md_cg/mreview/bundle.py +178 -178
  139. package/md_cg/mreview/candidates.py +262 -262
  140. package/md_cg/mreview/govern.py +693 -693
  141. package/md_cg/mreview/locate.py +939 -939
  142. package/md_cg/mreview/pipeline.py +728 -728
  143. package/md_cg/mreview/rules/duplication.json +21 -21
  144. package/md_cg/mreview/rules/field_coverage.json +54 -54
  145. package/md_cg/mreview/rules/source_license.json +21 -21
  146. package/md_cg/mreview/rules/template_flow.json +21 -21
  147. package/md_cg/mreview/ruleset.py +252 -252
  148. package/md_cg/nodefile.py +575 -575
  149. package/md_cg/pooling.py +484 -472
  150. package/md_cg/postings.py +298 -298
  151. package/md_cg/predict.py +1100 -1100
  152. package/md_cg/progressive.py +123 -123
  153. package/md_cg/protect.py +272 -272
  154. package/md_cg/protocol/md_cg_gate.proto +33 -33
  155. package/md_cg/protocol.py +372 -372
  156. package/md_cg/provenance.py +582 -582
  157. package/md_cg/reach.py +453 -453
  158. package/md_cg/readcache.py +85 -0
  159. package/md_cg/refindex.py +833 -833
  160. package/md_cg/refine.py +604 -604
  161. package/md_cg/roleviews.py +89 -89
  162. package/md_cg/routing.py +365 -365
  163. package/md_cg/scrub.py +852 -852
  164. package/md_cg/security.py +274 -274
  165. package/md_cg/self_state.py +1029 -1029
  166. package/md_cg/selfreport.py +151 -151
  167. package/md_cg/semantic/__init__.py +10 -10
  168. package/md_cg/semantic/canonical.py +122 -122
  169. package/md_cg/semantic/en_normalizer.py +364 -364
  170. package/md_cg/semantic/en_zh_map.json +28694 -0
  171. package/md_cg/semantic/export_en_zh_map.py +64 -0
  172. package/md_cg/semantic/unify.py +45 -0
  173. package/md_cg/semantic/zh_en_atoms.py +139 -139
  174. package/md_cg/signer.py +562 -562
  175. package/md_cg/sources.py +815 -582
  176. package/md_cg/statushdr.py +179 -179
  177. package/md_cg/stg.py +48 -37
  178. package/md_cg/subgraph.py +729 -729
  179. package/md_cg/sustain.py +1138 -1138
  180. package/md_cg/tasks.py +470 -470
  181. package/md_cg/test_action_derive.py +203 -203
  182. package/md_cg/test_audit_rotate.py +270 -270
  183. package/md_cg/test_autonomy.py +143 -143
  184. package/md_cg/test_bench_governance.py +102 -102
  185. package/md_cg/test_blindspot_tickets.py +166 -166
  186. package/md_cg/test_branches.py +249 -249
  187. package/md_cg/test_ccg_perturb.py +184 -184
  188. package/md_cg/test_ccgc.py +433 -433
  189. package/md_cg/test_census_prune.py +81 -81
  190. package/md_cg/test_cond_compose_anchors.py +76 -76
  191. package/md_cg/test_cond_match.py +165 -165
  192. package/md_cg/test_condition_anchor.py +81 -81
  193. package/md_cg/test_d_meta.py +412 -412
  194. package/md_cg/test_datapath_root.py +199 -199
  195. package/md_cg/test_en_pipeline.py +166 -166
  196. package/md_cg/test_gain_gate.py +212 -212
  197. package/md_cg/test_health_scale.py +173 -173
  198. package/md_cg/test_hive_ingest.py +285 -0
  199. package/md_cg/test_hot_cold.py +215 -215
  200. package/md_cg/test_hyperedge.py +245 -245
  201. package/md_cg/test_i26_empty_first_write.py +116 -0
  202. package/md_cg/test_i27_e041_identity.py +128 -0
  203. package/md_cg/test_i28_hotcache_prodpath.py +122 -0
  204. package/md_cg/test_identity_attribution.py +147 -147
  205. package/md_cg/test_index_durability.py +224 -224
  206. package/md_cg/test_interop.py +93 -0
  207. package/md_cg/test_lifecycle.py +309 -309
  208. package/md_cg/test_linkref.py +306 -306
  209. package/md_cg/test_lock.py +43 -43
  210. package/md_cg/test_md_access_parity.py +255 -255
  211. package/md_cg/test_md_writepath.py +345 -345
  212. package/md_cg/test_mdstore_search_parity.py +160 -0
  213. package/md_cg/test_mr_m2.py +587 -587
  214. package/md_cg/test_mr_m3.py +710 -710
  215. package/md_cg/test_mr_m4.py +485 -485
  216. package/md_cg/test_p0.py +250 -250
  217. package/md_cg/test_p1.py +316 -316
  218. package/md_cg/test_p10_identity.py +173 -173
  219. package/md_cg/test_p11_consistency.py +233 -233
  220. package/md_cg/test_p12_metacognition.py +212 -212
  221. package/md_cg/test_p13_encryption.py +241 -241
  222. package/md_cg/test_p14_sustain.py +249 -249
  223. package/md_cg/test_p15_scrub.py +280 -280
  224. package/md_cg/test_p16_self_state.py +301 -301
  225. package/md_cg/test_p17_predict.py +354 -354
  226. package/md_cg/test_p18_whitebox.py +171 -171
  227. package/md_cg/test_p19_migrate_roleplay.py +149 -149
  228. package/md_cg/test_p20_evolution.py +315 -315
  229. package/md_cg/test_p21_tokens.py +293 -270
  230. package/md_cg/test_p22_theory.py +175 -175
  231. package/md_cg/test_p23_links.py +311 -311
  232. package/md_cg/test_p24_evidence.py +227 -227
  233. package/md_cg/test_p25_weights.py +156 -156
  234. package/md_cg/test_p26_refindex.py +416 -416
  235. package/md_cg/test_p27_docindex.py +765 -765
  236. package/md_cg/test_p28_refcheck.py +305 -305
  237. package/md_cg/test_p29_session_ingest_export.py +354 -333
  238. package/md_cg/test_p3.py +11 -2
  239. package/md_cg/test_p30_maintain.py +330 -330
  240. package/md_cg/test_p31_insight.py +534 -534
  241. package/md_cg/test_p32_backfill.py +298 -298
  242. package/md_cg/test_p33_ccg_wiring.py +293 -293
  243. package/md_cg/test_p34_crosscheck.py +331 -331
  244. package/md_cg/test_p35_conditioned_claim.py +252 -252
  245. package/md_cg/test_p36_kp_align.py +230 -230
  246. package/md_cg/test_p37_condition_space.py +248 -248
  247. package/md_cg/test_p38_concurrent_flush.py +102 -0
  248. package/md_cg/test_p38_contextualize.py +273 -273
  249. package/md_cg/test_p39_verify_flow.py +113 -0
  250. package/md_cg/test_p39_vision_evidence.py +369 -369
  251. package/md_cg/test_p40_refine_worklist.py +241 -241
  252. package/md_cg/test_p41_evolve_patrol.py +224 -224
  253. package/md_cg/test_p42_provenance.py +269 -269
  254. package/md_cg/test_p43_pooling.py +412 -398
  255. package/md_cg/test_p44_md_whitebox.py +231 -231
  256. package/md_cg/test_p45_session_identity.py +219 -219
  257. package/md_cg/test_p46_unit_scope.py +272 -272
  258. package/md_cg/test_p47_session_view.py +281 -0
  259. package/md_cg/test_p4_fuzzy.py +223 -223
  260. package/md_cg/test_p5_semantic.py +226 -226
  261. package/md_cg/test_p6_consolidate.py +440 -387
  262. package/md_cg/test_p7_goals_recent.py +202 -202
  263. package/md_cg/test_p8_subgraph_chain.py +200 -200
  264. package/md_cg/test_p9_forget_protect.py +231 -231
  265. package/md_cg/test_predict_beta.py +135 -135
  266. package/md_cg/test_preflight_failclosed.py +100 -100
  267. package/md_cg/test_progressive.py +146 -146
  268. package/md_cg/test_protocol.py +243 -243
  269. package/md_cg/test_reach.py +378 -378
  270. package/md_cg/test_reach_keys.py +201 -201
  271. package/md_cg/test_read_clip.py +141 -141
  272. package/md_cg/test_readcache_prodpath.py +155 -0
  273. package/md_cg/test_retr_gates_prodpath.py +140 -0
  274. package/md_cg/test_retr_s1.py +340 -340
  275. package/md_cg/test_retr_s1b.py +209 -209
  276. package/md_cg/test_retr_s3.py +194 -194
  277. package/md_cg/test_retr_s4.py +163 -163
  278. package/md_cg/test_retr_s5.py +200 -200
  279. package/md_cg/test_retr_s6.py +157 -157
  280. package/md_cg/test_retr_s7.py +384 -384
  281. package/md_cg/test_retr_s8_time.py +369 -316
  282. package/md_cg/test_retr_s9_edges.py +286 -286
  283. package/md_cg/test_retr_s9_entity_ctx.py +175 -175
  284. package/md_cg/test_review_conformance.py +367 -367
  285. package/md_cg/test_role_views.py +354 -354
  286. package/md_cg/test_sem_noise.py +242 -242
  287. package/md_cg/test_semantic_canonical.py +241 -241
  288. package/md_cg/test_subproc_encoding.py +192 -192
  289. package/md_cg/test_sustain_mutual.py +153 -153
  290. package/md_cg/test_tasks.py +409 -409
  291. package/md_cg/test_tool_face.py +189 -189
  292. package/md_cg/test_transfer.py +180 -180
  293. package/md_cg/test_trust.py +361 -361
  294. package/md_cg/test_twophase.py +286 -286
  295. package/md_cg/test_v14_fixes.py +397 -397
  296. package/md_cg/test_validity_filter.py +280 -280
  297. package/md_cg/test_verify_answer.py +138 -138
  298. package/md_cg/test_wisdom_md_store.py +292 -292
  299. package/md_cg/test_writelimit.py +197 -197
  300. package/md_cg/test_writepipe.py +214 -214
  301. package/md_cg/theory.py +273 -273
  302. package/md_cg/tokens.py +677 -663
  303. package/md_cg/tool_face.py +260 -260
  304. package/md_cg/trust.py +986 -950
  305. package/md_cg/twophase.py +231 -231
  306. package/md_cg/units.py +667 -667
  307. package/md_cg/vision_evidence.py +666 -666
  308. package/md_cg/weights.py +624 -624
  309. package/md_cg/whitebox.py +527 -527
  310. package/md_cg/whitebox_kb/__init__.py +37 -37
  311. package/md_cg/whitebox_kb/aeis_core/__init__.py +42 -42
  312. package/md_cg/whitebox_kb/aeis_core/semantic.py +280 -280
  313. package/md_cg/whitebox_kb/aeis_core/textutil.py +13 -13
  314. package/md_cg/whitebox_kb/engine.py +310 -310
  315. package/md_cg/whitebox_kb/seed_knowledge//346/231/272/350/203/275/350/256/2723.4.md +5260 -5260
  316. package/md_cg/whitebox_kb/wisdom/browser_units.py +2631 -2631
  317. package/md_cg/whitebox_kb/wisdom/causal_discover.py +432 -432
  318. package/md_cg/whitebox_kb/wisdom/chat_engine.py +1506 -1506
  319. package/md_cg/whitebox_kb/wisdom/code_solidified.json +6195 -6195
  320. package/md_cg/whitebox_kb/wisdom/compiler_code_units.py +3033 -3033
  321. package/md_cg/whitebox_kb/wisdom/condition_algebra.py +112 -112
  322. package/md_cg/whitebox_kb/wisdom/condition_frame.py +315 -315
  323. package/md_cg/whitebox_kb/wisdom/condition_kb.py +108 -108
  324. package/md_cg/whitebox_kb/wisdom/conflict_map.json +4445 -4445
  325. package/md_cg/whitebox_kb/wisdom/core/lexer.py +512 -512
  326. package/md_cg/whitebox_kb/wisdom/core/name_checker.py +1023 -1023
  327. package/md_cg/whitebox_kb/wisdom/cspmn.py +258 -258
  328. package/md_cg/whitebox_kb/wisdom/csre.py +264 -264
  329. package/md_cg/whitebox_kb/wisdom/danmaku_audit.py +252 -252
  330. package/md_cg/whitebox_kb/wisdom/distilled_condition_units.json +6417 -6417
  331. package/md_cg/whitebox_kb/wisdom/docs/WB-EVAL-20260902b.json +1950 -1950
  332. package/md_cg/whitebox_kb/wisdom/docs/WB-EVAL-20260902c.json +1296 -1296
  333. package/md_cg/whitebox_kb/wisdom/docs/whitebox_capability_graph_demo.json +59 -59
  334. package/md_cg/whitebox_kb/wisdom/graph_db_units.py +3089 -3089
  335. package/md_cg/whitebox_kb/wisdom/knowledge_points.py +318 -318
  336. package/md_cg/whitebox_kb/wisdom/md_access.py +470 -470
  337. package/md_cg/whitebox_kb/wisdom/md_store.py +276 -251
  338. package/md_cg/whitebox_kb/wisdom/migrate_wisdom.py +476 -476
  339. package/md_cg/whitebox_kb/wisdom/navigate.py +248 -248
  340. package/md_cg/whitebox_kb/wisdom/neural_retrieve.py +224 -224
  341. package/md_cg/whitebox_kb/wisdom/os_units.py +2735 -2735
  342. package/md_cg/whitebox_kb/wisdom/pattern_separation.py +376 -376
  343. package/md_cg/whitebox_kb/wisdom/prereq_map.json +364 -364
  344. package/md_cg/whitebox_kb/wisdom/python_code_units.py +2766 -2766
  345. package/md_cg/whitebox_kb/wisdom/role_solidified.json +7 -7
  346. package/md_cg/whitebox_kb/wisdom/route_memory.py +244 -244
  347. package/md_cg/whitebox_kb/wisdom/scene_reconstruction.py +148 -148
  348. package/md_cg/whitebox_kb/wisdom/snr_report.json +40 -40
  349. package/md_cg/whitebox_kb/wisdom/test_code_compose_domains.py +7541 -7541
  350. package/md_cg/whitebox_kb/wisdom/test_compiler_self_bootstrap.py +354 -354
  351. package/md_cg/whitebox_kb/wisdom/test_ecosystem_assembly.py +158 -158
  352. package/md_cg/whitebox_kb/wisdom/test_ecosystem_demos.py +193 -193
  353. package/md_cg/whitebox_kb/wisdom/test_graph_db.py +292 -292
  354. package/md_cg/whitebox_kb/wisdom/test_python_self_bootstrap.py +160 -160
  355. package/md_cg/whitebox_kb/wisdom/trigger_words_index.json +4366 -4366
  356. package/md_cg/whitebox_kb/wisdom/verifier.py +1297 -1297
  357. package/md_cg/writelimit.py +356 -356
  358. package/md_cg/writepipe.py +550 -542
  359. package/package.json +97 -96
  360. package/skills/plugin.json +54 -54
  361. package/skills/skills/designer-perspective/SKILL.md +158 -158
  362. package/skills/skills/designer-perspective/references/01-observation-position.md +66 -66
  363. package/skills/skills/designer-perspective/references/02-structure-recognition.md +62 -62
  364. package/skills/skills/designer-perspective/references/03-direction-judgment.md +55 -55
  365. package/skills/skills/designer-perspective/references/04-qualification-verdict.md +72 -72
  366. package/skills/skills/designer-perspective/references/05-condition-attribution.md +74 -74
  367. package/skills/skills/designer-perspective/scripts/designer.py +545 -545
  368. package/skills/skills/designer-perspective/tests/cases.jsonl +17 -17
  369. package/skills/skills/designer-perspective/tests/selftest.py +61 -61
  370. package/skills/skills/lingshu-browser/SKILL.md +60 -60
  371. package/skills/skills/lingshu-compiler/SKILL.md +56 -56
  372. package/skills/skills/lingshu-compiler/units/analyze-type-infer/SKILL.md +45 -45
  373. package/skills/skills/lingshu-compiler/units/check-name-real/SKILL.md +45 -45
  374. package/skills/skills/lingshu-compiler/units/compile-assign/SKILL.md +45 -45
  375. package/skills/skills/lingshu-compiler/units/compile-expr-tree/SKILL.md +45 -45
  376. package/skills/skills/lingshu-compiler/units/compile-full-pipeline/SKILL.md +45 -45
  377. package/skills/skills/lingshu-compiler/units/compile-func-def/SKILL.md +45 -45
  378. package/skills/skills/lingshu-compiler/units/compile-if-then/SKILL.md +45 -45
  379. package/skills/skills/lingshu-compiler/units/compile-logic-expr/SKILL.md +45 -45
  380. package/skills/skills/lingshu-compiler/units/compile-recursive/SKILL.md +45 -45
  381. package/skills/skills/lingshu-compiler/units/compile-scope/SKILL.md +45 -45
  382. package/skills/skills/lingshu-compiler/units/compile-type-check/SKILL.md +45 -45
  383. package/skills/skills/lingshu-compiler/units/compile-while/SKILL.md +45 -45
  384. package/skills/skills/lingshu-compiler/units/compiler-0010c4bf/SKILL.md +45 -45
  385. package/skills/skills/lingshu-compiler/units/compiler-0355bffb/SKILL.md +45 -45
  386. package/skills/skills/lingshu-compiler/units/compiler-0361708a/SKILL.md +45 -45
  387. package/skills/skills/lingshu-compiler/units/compiler-054a0414/SKILL.md +45 -45
  388. package/skills/skills/lingshu-compiler/units/compiler-05a1691a/SKILL.md +45 -45
  389. package/skills/skills/lingshu-compiler/units/compiler-05eeed1e/SKILL.md +45 -45
  390. package/skills/skills/lingshu-compiler/units/compiler-0622a1f6/SKILL.md +45 -45
  391. package/skills/skills/lingshu-compiler/units/compiler-08b54217/SKILL.md +45 -45
  392. package/skills/skills/lingshu-compiler/units/compiler-0a62b70c/SKILL.md +45 -45
  393. package/skills/skills/lingshu-compiler/units/compiler-0ab24d00/SKILL.md +45 -45
  394. package/skills/skills/lingshu-compiler/units/compiler-0e093688/SKILL.md +45 -45
  395. package/skills/skills/lingshu-compiler/units/compiler-0e82b966/SKILL.md +45 -45
  396. package/skills/skills/lingshu-compiler/units/compiler-0ee9b9b9/SKILL.md +45 -45
  397. package/skills/skills/lingshu-compiler/units/compiler-0f3787e6/SKILL.md +45 -45
  398. package/skills/skills/lingshu-compiler/units/compiler-1028685f/SKILL.md +45 -45
  399. package/skills/skills/lingshu-compiler/units/compiler-11897630/SKILL.md +45 -45
  400. package/skills/skills/lingshu-compiler/units/compiler-16661b9b/SKILL.md +45 -45
  401. package/skills/skills/lingshu-compiler/units/compiler-1f722303/SKILL.md +45 -45
  402. package/skills/skills/lingshu-compiler/units/compiler-25be1262/SKILL.md +45 -45
  403. package/skills/skills/lingshu-compiler/units/compiler-2a76ba07/SKILL.md +45 -45
  404. package/skills/skills/lingshu-compiler/units/compiler-2dbea54a/SKILL.md +45 -45
  405. package/skills/skills/lingshu-compiler/units/compiler-2df52f16/SKILL.md +45 -45
  406. package/skills/skills/lingshu-compiler/units/compiler-2ec2c9d2/SKILL.md +45 -45
  407. package/skills/skills/lingshu-compiler/units/compiler-2f8c8f39/SKILL.md +45 -45
  408. package/skills/skills/lingshu-compiler/units/compiler-38378ac7/SKILL.md +45 -45
  409. package/skills/skills/lingshu-compiler/units/compiler-39457d2e/SKILL.md +45 -45
  410. package/skills/skills/lingshu-compiler/units/compiler-39fb5926/SKILL.md +45 -45
  411. package/skills/skills/lingshu-compiler/units/compiler-47f4fbfa/SKILL.md +45 -45
  412. package/skills/skills/lingshu-compiler/units/compiler-4a8cd1f1/SKILL.md +45 -45
  413. package/skills/skills/lingshu-compiler/units/compiler-4b230b6b/SKILL.md +45 -45
  414. package/skills/skills/lingshu-compiler/units/compiler-4cbbda95/SKILL.md +45 -45
  415. package/skills/skills/lingshu-compiler/units/compiler-4d5a68ff/SKILL.md +45 -45
  416. package/skills/skills/lingshu-compiler/units/compiler-56dc9bdd/SKILL.md +45 -45
  417. package/skills/skills/lingshu-compiler/units/compiler-57e76ebe/SKILL.md +45 -45
  418. package/skills/skills/lingshu-compiler/units/compiler-61ff016b/SKILL.md +45 -45
  419. package/skills/skills/lingshu-compiler/units/compiler-63eae588/SKILL.md +45 -45
  420. package/skills/skills/lingshu-compiler/units/compiler-64c4224b/SKILL.md +45 -45
  421. package/skills/skills/lingshu-compiler/units/compiler-66377955/SKILL.md +45 -45
  422. package/skills/skills/lingshu-compiler/units/compiler-674ab4f6/SKILL.md +45 -45
  423. package/skills/skills/lingshu-compiler/units/compiler-6af76fd6/SKILL.md +45 -45
  424. package/skills/skills/lingshu-compiler/units/compiler-6d979db2/SKILL.md +45 -45
  425. package/skills/skills/lingshu-compiler/units/compiler-6de326c0/SKILL.md +45 -45
  426. package/skills/skills/lingshu-compiler/units/compiler-6f1c0eea/SKILL.md +45 -45
  427. package/skills/skills/lingshu-compiler/units/compiler-724d6c9b/SKILL.md +45 -45
  428. package/skills/skills/lingshu-compiler/units/compiler-7690177f/SKILL.md +45 -45
  429. package/skills/skills/lingshu-compiler/units/compiler-7b229a7d/SKILL.md +45 -45
  430. package/skills/skills/lingshu-compiler/units/compiler-7f471b3a/SKILL.md +45 -45
  431. package/skills/skills/lingshu-compiler/units/compiler-815cad08/SKILL.md +45 -45
  432. package/skills/skills/lingshu-compiler/units/compiler-83c61634/SKILL.md +45 -45
  433. package/skills/skills/lingshu-compiler/units/compiler-8c798c81/SKILL.md +45 -45
  434. package/skills/skills/lingshu-compiler/units/compiler-8dd747ac/SKILL.md +45 -45
  435. package/skills/skills/lingshu-compiler/units/compiler-90324d0a/SKILL.md +45 -45
  436. package/skills/skills/lingshu-compiler/units/compiler-94b8d72d/SKILL.md +45 -45
  437. package/skills/skills/lingshu-compiler/units/compiler-94f12231/SKILL.md +45 -45
  438. package/skills/skills/lingshu-compiler/units/compiler-95937c16/SKILL.md +45 -45
  439. package/skills/skills/lingshu-compiler/units/compiler-98a5625b/SKILL.md +45 -45
  440. package/skills/skills/lingshu-compiler/units/compiler-98b4c42f/SKILL.md +45 -45
  441. package/skills/skills/lingshu-compiler/units/compiler-98e3894a/SKILL.md +45 -45
  442. package/skills/skills/lingshu-compiler/units/compiler-9bdfe4b8/SKILL.md +45 -45
  443. package/skills/skills/lingshu-compiler/units/compiler-9d9b4e83/SKILL.md +45 -45
  444. package/skills/skills/lingshu-compiler/units/compiler-9f7be5ad/SKILL.md +45 -45
  445. package/skills/skills/lingshu-compiler/units/compiler-a6daf076/SKILL.md +45 -45
  446. package/skills/skills/lingshu-compiler/units/compiler-a7995a0c/SKILL.md +45 -45
  447. package/skills/skills/lingshu-compiler/units/compiler-a8399248/SKILL.md +45 -45
  448. package/skills/skills/lingshu-compiler/units/compiler-aabbd099/SKILL.md +45 -45
  449. package/skills/skills/lingshu-compiler/units/compiler-afe169d8/SKILL.md +45 -45
  450. package/skills/skills/lingshu-compiler/units/compiler-b0678bda/SKILL.md +45 -45
  451. package/skills/skills/lingshu-compiler/units/compiler-b09bd196/SKILL.md +45 -45
  452. package/skills/skills/lingshu-compiler/units/compiler-b1396e23/SKILL.md +45 -45
  453. package/skills/skills/lingshu-compiler/units/compiler-b9b31ce0/SKILL.md +45 -45
  454. package/skills/skills/lingshu-compiler/units/compiler-c10264a7/SKILL.md +45 -45
  455. package/skills/skills/lingshu-compiler/units/compiler-cb1e8e4b/SKILL.md +45 -45
  456. package/skills/skills/lingshu-compiler/units/compiler-ccafd438/SKILL.md +45 -45
  457. package/skills/skills/lingshu-compiler/units/compiler-cda9c262/SKILL.md +45 -45
  458. package/skills/skills/lingshu-compiler/units/compiler-ce648068/SKILL.md +45 -45
  459. package/skills/skills/lingshu-compiler/units/compiler-cf5776a4/SKILL.md +45 -45
  460. package/skills/skills/lingshu-compiler/units/compiler-d974e5d3/SKILL.md +45 -45
  461. package/skills/skills/lingshu-compiler/units/compiler-e3979fd3/SKILL.md +45 -45
  462. package/skills/skills/lingshu-compiler/units/compiler-eb1cf2b5/SKILL.md +45 -45
  463. package/skills/skills/lingshu-compiler/units/compiler-ecb30d5b/SKILL.md +45 -45
  464. package/skills/skills/lingshu-compiler/units/compiler-f8c8b24b/SKILL.md +45 -45
  465. package/skills/skills/lingshu-compiler/units/compiler-f99fedbe/SKILL.md +45 -45
  466. package/skills/skills/lingshu-compiler/units/compiler-fa8ff5f7/SKILL.md +45 -45
  467. package/skills/skills/lingshu-compiler/units/compiler-fe1b058d/SKILL.md +45 -45
  468. package/skills/skills/lingshu-compiler/units/lex-chinese-program/SKILL.md +45 -45
  469. package/skills/skills/lingshu-compiler/units/lex-dao-de-jing/SKILL.md +45 -45
  470. package/skills/skills/lingshu-compiler/units/lex-nine-chapters/SKILL.md +45 -45
  471. package/skills/skills/lingshu-compiler/units/vm-arithmetic/SKILL.md +45 -45
  472. package/skills/skills/lingshu-compiler/units/vm-array-ops/SKILL.md +45 -45
  473. package/skills/skills/lingshu-compiler/units/vm-closure-call/SKILL.md +45 -45
  474. package/skills/skills/lingshu-compiler/units/vm-closure-create/SKILL.md +45 -45
  475. package/skills/skills/lingshu-compiler/units/vm-compare/SKILL.md +45 -45
  476. package/skills/skills/lingshu-compiler/units/vm-cond-jump/SKILL.md +45 -45
  477. package/skills/skills/lingshu-compiler/units/vm-cond-space/SKILL.md +45 -45
  478. package/skills/skills/lingshu-compiler/units/vm-exception/SKILL.md +45 -45
  479. package/skills/skills/lingshu-compiler/units/vm-func-call/SKILL.md +45 -45
  480. package/skills/skills/lingshu-compiler/units/vm-loop-run/SKILL.md +45 -45
  481. package/skills/skills/lingshu-compiler/units/vm-profiling/SKILL.md +45 -45
  482. package/skills/skills/lingshu-compiler/units/vm-refcount/SKILL.md +45 -45
  483. package/skills/skills/lingshu-compiler/units/vm-run-loop/SKILL.md +45 -45
  484. package/skills/skills/lingshu-compiler/units/vm-short-circuit/SKILL.md +45 -45
  485. package/skills/skills/lingshu-compiler/units/vm-stack-guard/SKILL.md +45 -45
  486. package/skills/skills/lingshu-compiler/units/vm-stack-ops/SKILL.md +45 -45
  487. package/skills/skills/lingshu-compiler/units/vm-trust-accum/SKILL.md +45 -45
  488. package/skills/skills/lingshu-graph/SKILL.md +63 -63
  489. package/skills/skills/lingshu-net/SKILL.md +48 -48
  490. package/skills/skills/lingshu-os/SKILL.md +64 -64
  491. package/skills/skills/lingshu-pylang/SKILL.md +71 -71
  492. package/src/bridge.ts +401 -401
  493. package/src/hooks.ts +38 -2
  494. package/src/lib/datapath.ts +326 -326
  495. package/src/lib/mdcg_client.ts +413 -413
  496. package/src/lib/mutual.ts +428 -428
  497. package/src/lib/prompt_safety.ts +62 -62
  498. package/src/lib/python_path.ts +71 -71
  499. package/src/lib/roleplay_web.ts +932 -932
  500. package/src/lib/token_store.ts +192 -192
  501. package/src/tools.ts +212 -212
  502. package/zcode/AGENTS.md +11 -3
  503. package/zcode/README.md +41 -41
  504. /package/docs/{mdcg → hive}//344/270/273/344/273/243/347/220/206/345/255/220/344/273/243/347/220/206/350/256/260/345/277/206/346/236/266/346/236/204/350/256/276/350/256/241.md" +0 -0
package/md_cg/routing.py CHANGED
@@ -1,366 +1,366 @@
1
- # -*- coding: utf-8 -*-
2
- """md 认知图 · 路由键归一化(风险1)
3
-
4
- 普查结论(wisdom-book-cloud-new.db, 3048 节点):
5
- - 原始 condition_space 四元组作分桶键 → 3037 桶 / 3048 节点,99.9% 单例桶。
6
- 根因:observation_position 实际格式是「<域> 知识点(<实例名>)」,把节点特有的
7
- 实例名嵌进了条件字段,3033 种取值 ≈ 唯一。按它分桶 = 一节点一桶,查询侧
8
- 构造不出精确匹配的情境 → 命中率≈0,召回归零(比退化成全量更糟)。
9
- - observation_tool(93% 集中) / existence_constraint(95% 集中) 去掉 position 后
10
- 塌缩成单个巨桶。
11
- - time_window 实测仅 3 种取值,进哈希键是纯噪声。
12
- - tags 的 domain: 标签 → 95 桶 / 最大桶 5.4% / 期望扫描 1.8%,是唯一健康的键。
13
-
14
- 因此路由键 = 归一化提取的「域」,而非四元组哈希。写入侧与查询侧共用本模块,
15
- 保证两侧同构(风险2 的前提:查询构造的键必须与写入键落在同一空间)。
16
- """
17
- import math
18
- import re
19
- import hashlib
20
- import unicodedata
21
-
22
- # observation_position 的实例名尾巴:「知识点(xxx)」「概念(xxx)」等
23
- _INSTANCE_TAIL = re.compile(
24
- r"\s*(知识点|概念|条目|卡片|节点|规律|定理|公式)\s*[((].*?[))]\s*$"
25
- )
26
- # 骨架填充类后缀:「高中物理知识点内容(按骨架填充)」→「高中物理」
27
- _SKELETON_TAIL = re.compile(r"(知识点)?内容\s*[((]按骨架填充[))]\s*$")
28
-
29
- ORPHAN = "orphan"
30
-
31
-
32
- # 生效条件:raw 为真值时按 NFKC 归一化并 strip,最多 3 轮剥离 _INSTANCE_TAIL(无变化即停)、再剥 _SKELETON_TAIL、空白转下划线后返回;raw 为假值(None/空串)或处理后为空串时返回 ORPHAN。
33
- def normalize_domain(raw: str) -> str:
34
- """把自由文本的域描述归一化成稳定的短键。
35
-
36
- 「工程学 知识点(内力与截面法)」 → 工程学
37
- 「高中物理知识点内容(按骨架填充)」 → 高中物理
38
- 「数学分析知识点内容(按骨架填充) 知识点(贝塞尔不等式)」 → 数学分析
39
- """
40
- if not raw:
41
- return ORPHAN
42
- s = unicodedata.normalize("NFKC", str(raw)).strip()
43
- # 反复剥离实例名尾巴(可能叠加两层,见上面第三个例子)
44
- for _ in range(3):
45
- new = _INSTANCE_TAIL.sub("", s)
46
- if new == s:
47
- break
48
- s = new.strip()
49
- s = _SKELETON_TAIL.sub("", s).strip()
50
- s = re.sub(r"\s+", "_", s)
51
- return s or ORPHAN
52
-
53
-
54
- # 生效条件:tags 为真值时取其中首个 str(t) 以 "domain:" 开头的项,返回其前缀后内容的 normalize_domain 结果;无此标签且 condition_space 为真值时返回 normalize_domain(condition_space.get("observation_position"))(缺键即 None 归一为 ORPHAN);tags 为假值且 condition_space 为假值时返回 ORPHAN。
55
- def route_key(condition_space: dict = None, tags=None) -> str:
56
- """导出条件路由键。优先级:tags 的 domain: > observation_position 归一化 > orphan。
57
-
58
- domain: 标签是显式声明的域,普查证明它分布最健康(95 桶/最大桶 5.4%),
59
- 所以优先。没有标签时才回退到从 observation_position 提取。
60
- """
61
- for t in tags or []:
62
- t = str(t)
63
- if t.startswith("domain:"):
64
- return normalize_domain(t[len("domain:"):])
65
- if condition_space:
66
- return normalize_domain(condition_space.get("observation_position"))
67
- return ORPHAN
68
-
69
-
70
- # 生效条件:key 等于 ORPHAN 时原样返回 ORPHAN;否则返回 "cond_" + 把 key 中非[\w中文-]字符替换为下划线并截前 24 字符的串 + "_" + key 的 sha256(utf-8)前 8 位十六进制。
71
- def bucket_dir(key: str) -> str:
72
- """路由键 → 目录名。中文键保留可读前缀 + 短哈希,避免文件系统非法字符/超长。"""
73
- if key == ORPHAN:
74
- return ORPHAN
75
- safe = re.sub(r"[^\w\u4e00-\u9fff-]", "_", key)[:24]
76
- h = hashlib.sha256(key.encode("utf-8")).hexdigest()[:8]
77
- return f"cond_{safe}_{h}"
78
-
79
-
80
- # 14 大域代表词表(白箱第 2 篇第 5 章 + 第 3 篇第 4 章:「56 学科卡 → 14 大域
81
- # → 域内 KCCS」两阶段并行收敛。本表用作阶段 1 的大域并行打分依据——
82
- # 当 query 没有显式 context 但 query 词能落进某个大域时,先收敛到大域再查。
83
- #
84
- # 词的选取原则:覆盖白箱工程文档里出现的高频学科关键词,且不互相吞并。
85
- # 同一个词可以出现在多个大域(如「公式」在数学与物理都常见),这是合理的:
86
- # 大域并行打分阶段就是让多域同分,再由阶段 2 的 KCCS 进一步区分。
87
- BIG_DOMAINS = {
88
- "数学": {"数学", "算术", "几何", "代数", "微积分", "概率", "统计", "集合", "矩阵",
89
- "线性", "拓扑", "数论", "公式", "定理", "证明", "函数", "导数", "积分",
90
- "极限", "方程", "不等式", "贝塞尔", "二分", "素数", "微元"},
91
- "物理": {"物理", "力学", "电磁", "光学", "热学", "量子", "相对论", "能量", "动量",
92
- "质量", "速度", "加速度", "电荷", "电压", "电流", "沸点", "海拔",
93
- "大气压", "压强", "温度", "牛顿", "惯性", "引力"},
94
- "化学": {"化学", "元素", "分子", "原子", "化合物", "反应", "酸", "碱", "盐",
95
- "氧化", "还原", "有机", "无机", "离子", "键", "浓度", "溶液"},
96
- "生物": {"生物", "细胞", "基因", "蛋白质", "酶", "光合", "呼吸", "植物", "动物",
97
- "进化", "免疫", "神经", "细菌", "病毒", "代谢", "染色", "分裂"},
98
- "计算机": {"计算机", "算法", "数据结构", "编程", "代码", "软件", "网络", "数据库",
99
- "系统", "排序", "递归", "图论", "哈希", "索引", "查询", "排序", "锁",
100
- "事务", "内存", "进程", "线程"},
101
- "语言": {"语言", "中文", "英文", "语法", "词汇", "语义", "修辞", "文学", "写作",
102
- "阅读", "拼音", "字", "词", "句"},
103
- "历史": {"历史", "朝代", "战争", "文明", "政治", "经济史", "文化史", "古代",
104
- "近代", "现代", "王朝", "革命", "改革"},
105
- "地理": {"地理", "地形", "气候", "人口", "城市", "国家", "地图", "板块",
106
- "洋流", "经度", "纬度", "海拔带", "流域"},
107
- "艺术": {"艺术", "绘画", "音乐", "雕塑", "电影", "设计", "色彩", "构图",
108
- "旋律", "节奏", "摄影"},
109
- "经济": {"经济", "市场", "金融", "货币", "投资", "股票", "债券", "GDP",
110
- "通胀", "财政", "税收", "供需"},
111
- "心理": {"心理", "认知", "情感", "记忆", "学习", "性格", "行为", "意识",
112
- "动机", "人格", "焦虑"},
113
- "医学": {"医学", "疾病", "治疗", "药物", "诊断", "外科", "内科", "儿科",
114
- "中医", "症状", "病理", "处方"},
115
- "工程": {"工程", "建筑", "结构", "材料", "机械", "电子", "土木", "桥梁",
116
- "内力", "截面", "梁", "柱", "应力"},
117
- "通用": {"常识", "生活", "日常", "通用", "礼仪", "礼貌", "文明", "规则"},
118
- }
119
-
120
-
121
- # 生效条件:terms 为真值时对 BIG_DOMAINS 每个大域统计命中词数,最高分为 0 或 terms 为假值(None/空)时返回 None,否则返回最高分大域名(并列取 BIG_DOMAINS 迭代序首个最高分)。
122
- def big_domain_classify(terms) -> str | None:
123
- """阶段 1:14 大域并行打分 → 收敛到 top-1。
124
-
125
- terms 是 expand_query_terms 返回的扩展词集合。
126
- 大域打分 = query 词命中大域代表词的次数(多词同域累加)。
127
- 并行在认知结构意义上:即使底层串行计算,14 个大域同时独立评估。
128
-
129
- 返回最匹配的大域名(多个 0 分 → 返回 None,走原 bucket_dir 路由)。
130
- """
131
- if not terms:
132
- return None
133
- scores = {}
134
- for d, vocab in BIG_DOMAINS.items():
135
- scores[d] = sum(1 for t in terms
136
- if any(w in t or t in w for w in vocab))
137
- best = max(scores.items(), key=lambda x: x[1])
138
- if best[1] == 0:
139
- return None
140
- # 多大域并列最高分时,按字典序取第一个稳定结果(避免浮点不确定)
141
- return best[0]
142
-
143
-
144
- # 生效条件:terms 为假值(None/空)时返回 {每个 BIG_DOMAINS 域: 0};terms 为真值时返回 {大域: 该域词表命中 terms 中词的个数}。
145
- def big_domain_score_breakdown(terms) -> dict:
146
- """暴露打分明细,便于审计与回归测试。"""
147
- if not terms:
148
- return {d: 0 for d in BIG_DOMAINS}
149
- return {d: sum(1 for t in terms if any(w in t or t in w for w in vocab))
150
- for d, vocab in BIG_DOMAINS.items()}
151
-
152
-
153
- # ---------------------------------------------------------------------------
154
- # 分级隶属度(模糊控制「隶属函数」的手写版)
155
- #
156
- # 上面的 big_domain_classify 是二值控制:`w in t or t in w` 命中即计 1。
157
- # 下面是同一套规则库的**分级**版本——命中程度是 0~1 的连续值,并乘 IDF:
158
- # · 隶属度 membership(t, w):完全相同 1.0;包含关系取长度比(覆盖越全越高)
159
- # · IDF:一个代表词覆盖的大域越少,区分度越高(「贝塞尔」只在数学出现,
160
- # 权重高于「公式」这种跨域通用词)
161
- # 老函数保持不动 → P0/P1 基线可比性不受影响;新函数只供新路径(fuzzy)使用。
162
- # ---------------------------------------------------------------------------
163
-
164
- # 生效条件:term 或 word 为假值(None/空串)返回 0.0;相等返回 1.0;word 是 term 子串返回 len(word)/len(term);term 是 word 子串返回 len(term)/len(word);二者无包含关系返回 0.0。
165
- def membership(term: str, word: str) -> float:
166
- """词 term 对代表词 word 的隶属度(0.0~1.0,越接近 1 越隶属)。
167
-
168
- 完全相同 → 1.0
169
- term 包含 word → len(word)/len(term)(覆盖越全越隶属)
170
- word 包含 term → len(term)/len(word)
171
- 无包含关系 → 0.0
172
- """
173
- if not term or not word:
174
- return 0.0
175
- if term == word:
176
- return 1.0
177
- if word in term:
178
- return len(word) / len(term)
179
- if term in word:
180
- return len(term) / len(word)
181
- return 0.0
182
-
183
-
184
- # 生效条件:无入参,恒遍历模块级常量 BIG_DOMAINS 的各域代表词表,返回 {代表词: 包含该词的域个数}。
185
- def _build_domain_df() -> dict:
186
- """代表词 → 覆盖它的大域数(IDF 的分母)。"""
187
- df = {}
188
- for vocab in BIG_DOMAINS.values():
189
- for w in vocab:
190
- df[w] = df.get(w, 0) + 1
191
- return df
192
-
193
-
194
- _DOMAIN_DF = _build_domain_df()
195
-
196
-
197
- # 生效条件:恒返回 math.log(1.0 + len(BIG_DOMAINS) / _DOMAIN_DF.get(word, 1)),即 word 在 _DOMAIN_DF 中取其覆盖域数,缺键(含任何未登记值)时按 _DOMAIN_DF.get 的默认 1 代入。
198
- def domain_idf(word: str) -> float:
199
- """代表词的区分度权重:log(1 + 大域总数 / 覆盖它的大域数)。
200
-
201
- 只在一个大域出现的词(如「贝塞尔」)≈ log(15)=2.71;
202
- 14 个大域都出现的词(如「公式」)≈ log(2)=0.69。
203
- """
204
- return math.log(1.0 + len(BIG_DOMAINS) / _DOMAIN_DF.get(word, 1))
205
-
206
-
207
- # 生效条件:terms 是 dict 时以其条目(键 str(t) 以 "__" 开头者剔除、值为 float)为词权重并忽略 weights,否则以 wmap.get(t, 1.0) 为权重(weights 为假值即 None/空 dict 时 wmap 为空、全部权重取 1.0,terms 为假值则词集为空);逐域累加「词权重 × 该词在域词表内最大(membership × domain_idf)」,权重 <=0 的词跳过,返回 {大域: round(得分, 6)}。
208
- def big_domain_score_weighted(terms, weights=None) -> dict:
209
- """阶段 1(分级版):14 大域并行打分,按「隶属度 × IDF」加权。
210
-
211
- terms: 可迭代的词集合,或 {词: 权重}(expand_query_terms_weighted 的输出,
212
- 调用方需先剔除 "__source__" 等元数据键)。
213
- weights: terms 为可迭代时的可选权重表;terms 已是 dict 时忽略。
214
- 返回 {大域: 得分},得分不再是整数计数,而是连续值。
215
- """
216
- if isinstance(terms, dict):
217
- tw = {str(t): float(w) for t, w in terms.items()
218
- if not str(t).startswith("__")}
219
- else:
220
- wmap = weights or {}
221
- tw = {str(t): float(wmap.get(t, 1.0)) for t in (terms or [])}
222
- out = {}
223
- for d, vocab in BIG_DOMAINS.items():
224
- s = 0.0
225
- for t, tw_ in tw.items():
226
- if tw_ <= 0:
227
- continue
228
- best = 0.0
229
- for w in vocab:
230
- m = membership(t, w)
231
- if m > 0.0:
232
- best = max(best, m * domain_idf(w))
233
- s += tw_ * best
234
- out[d] = round(s, 6)
235
- return out
236
-
237
-
238
- # 生效条件:以 terms、weights 计算各域加权得分(terms 为假值时各域均为 0.0),得分为空或最高分 <= min_score(默认 0.0)时返回 None,否则返回最高分大域名。
239
- def big_domain_classify_weighted(terms, weights=None, min_score: float = 0.0):
240
- """阶段 1(分级版)收敛到 top-1;全部低于 min_score → None。"""
241
- scores = big_domain_score_weighted(terms, weights)
242
- if not scores:
243
- return None
244
- best = max(scores.items(), key=lambda kv: kv[1])
245
- if best[1] <= min_score:
246
- return None
247
- return best[0]
248
-
249
-
250
- # 生效条件:a 或 b 为假值(None/空串)返回 0.0;相等返回 1.0;a 是 b 子串返回 len(a)/len(b);b 是 a 子串返回 len(b)/len(a);否则按二者二元组字符集合的 Jaccard 返回 len(ga & gb)/len(ga | gb),任一集合为空(如单字符键)时返回 0.0。
251
- def domain_similarity(a: str, b: str) -> float:
252
- """两个归一化域键的相似度(0~1):相同 1.0;包含取长度比;否则二元组 Jaccard。
253
-
254
- 「计算机科学」vs「计算机」→ 0.6(包含);「高中物理」vs「物理」→ 0.5;
255
- 完全无关 → 0.0。用于 fuzzy 路径的「大域亲和」打分。
256
- """
257
- if not a or not b:
258
- return 0.0
259
- if a == b:
260
- return 1.0
261
- if a in b:
262
- return len(a) / len(b)
263
- if b in a:
264
- return len(b) / len(a)
265
- ga = {a[i:i + 2] for i in range(len(a) - 1)}
266
- gb = {b[i:i + 2] for i in range(len(b) - 1)}
267
- if not ga or not gb:
268
- return 0.0
269
- return len(ga & gb) / len(ga | gb)
270
-
271
-
272
- # 生效条件:counts 各值之和为 0(含空 dict 与全 0 计数)时返回 {'ok': True, 'reason': 'empty', 'buckets': 0};否则在最大桶占比 >30%、桶数 >1 且单例桶占比 >50%、期望扫描 >30% 中命中的项写入 problems,返回含 ok(=problems 为空)、buckets、nodes、max_bucket_share、singleton_ratio、expected_scan、problems 的 dict。
273
- def bucket_health(counts: dict) -> dict:
274
- """分区健康度自检。分桶键一旦退化(巨桶或碎片化),条件路由就是纸面收益,
275
- 必须在写入侧就能发现,而不是等召回变差才回头查。
276
-
277
- counts: {bucket_dir: node_count}
278
- """
279
- n = sum(counts.values())
280
- if not n:
281
- return {"ok": True, "reason": "empty", "buckets": 0}
282
- nb = len(counts)
283
- top = max(counts.values())
284
- singles = sum(1 for v in counts.values() if v == 1)
285
- # 期望扫描占比:随机取一节点的情境去路由,命中桶的期望大小占全库比例
286
- expected_scan = sum(v * v for v in counts.values()) / n / n
287
- problems = []
288
- if top / n > 0.30:
289
- problems.append(f"巨桶:最大桶占 {top / n:.1%}(>30% 视为分区失效)")
290
- if nb > 1 and singles / nb > 0.50:
291
- problems.append(f"碎片化:单例桶占 {singles / nb:.1%}(>50% 说明键含实例级字段)")
292
- if expected_scan > 0.30:
293
- problems.append(f"路由无效:期望扫描 {expected_scan:.1%}(接近全量)")
294
- return {
295
- "ok": not problems,
296
- "buckets": nb,
297
- "nodes": n,
298
- "max_bucket_share": top / n,
299
- "singleton_ratio": singles / nb if nb else 0.0,
300
- "expected_scan": expected_scan,
301
- "problems": problems,
302
- }
303
-
304
-
305
- # ---------------------------------------------------------------------------
306
- # 节点侧大域标签(S1 大域先验收敛的前置元数据)
307
- #
308
- # 为何需要:`big_domain_classify` 一直只作用于 **query 侧**(terms),节点侧没有域字段,
309
- # 于是「14 大域并行打分」算完只能写进 meta(审计偏差 4:先验算出来却当成报告)。
310
- # 要让大域先验真正参与候选收敛,节点必须在写入时固化自己的域。
311
- # 口径:与查询侧同一个分类器(BIG_DOMAINS + big_domain_classify),保证两侧同构。
312
- # ---------------------------------------------------------------------------
313
-
314
- # 域词取词:中文(≥2 字)与拉丁词(≥2 字)。词表命中用「包含关系」判定,
315
- # 故 2 字以上的切口足以覆盖 1~4 字代表词(如「工程」命中「工程师」)。
316
- DOMAIN_TERM_RE = re.compile(r"[\u4e00-\u9fff]{2,}|[A-Za-z][A-Za-z0-9_]{1,}")
317
-
318
-
319
- # 生效条件:text 为假值(None/空串)时返回 [];否则以 DOMAIN_TERM_RE 取词、按出现顺序去重后返回,
320
- # 最多 limit 个(limit 为假值/负数时按空处理,返回 [])。
321
- def domain_terms(text, limit: int = 400) -> list:
322
- """从节点正文/标题抽「域词」(供 big_domain_classify 使用)。
323
-
324
- 只做最小分词:中文按 ≥2 字连续片段、拉丁按 [A-Za-z][A-Za-z0-9_]+ 取词;
325
- 去重保序,最多 limit 个(默认 400,避免长文把分类器拖慢)。
326
- """
327
- if not text or not limit or limit < 1:
328
- return []
329
- out, seen = [], set()
330
- for m in DOMAIN_TERM_RE.finditer(str(text)):
331
- w = m.group(0)
332
- if w in seen:
333
- continue
334
- seen.add(w)
335
- out.append(w)
336
- if len(out) >= limit:
337
- break
338
- return out
339
-
340
-
341
- # 生效条件:bucket 为假值或等于 ORPHAN 时返回空串;否则去掉 "cond_" 前缀、并当末段为 8 位十六进制哈希时剥掉该段,返回剩余的可读键。
342
- def bucket_key_readable(bucket: str) -> str:
343
- """桶目录名 → 可读键(S1b query 侧桶推断用):'cond_感知系统_d94e90d2' → '感知系统'。
344
-
345
- 与 `bucket_dir` 互逆(丢哈希段);`orphan`/空值返回空串(S1b 不把 orphan 当键,orphan 恒作兜底)。
346
- """
347
- if not bucket or bucket == ORPHAN:
348
- return ""
349
- s = str(bucket)
350
- if s.startswith("cond_"):
351
- s = s[len("cond_"):]
352
- head, sep, tail = s.rpartition("_")
353
- if sep and len(tail) == 8 and all(c in "0123456789abcdef" for c in tail):
354
- s = head
355
- return s
356
-
357
-
358
- # 生效条件:text 为假值或取不到任何域词时返回 None;否则返回 big_domain_classify(domain_terms(text))
359
- # 的结果(无有效域信号时亦为 None,调用方据此决定是否落域字段)。
360
- def classify_text(text, limit: int = 400):
361
- """正文 → 大域名(节点侧域标签真源)。与查询侧共用 big_domain_classify。
362
-
363
- 返回 None 表示「无有效域信号」——此时**不写** big_domain 字段,
364
- 该节点留在 ORPHAN/兜底池(S1 收敛时必须能被兜底召回,见契约 §3 S1 不变量)。
365
- """
1
+ # -*- coding: utf-8 -*-
2
+ """md 认知图 · 路由键归一化(风险1)
3
+
4
+ 普查结论(wisdom-book-cloud-new.db, 3048 节点):
5
+ - 原始 condition_space 四元组作分桶键 → 3037 桶 / 3048 节点,99.9% 单例桶。
6
+ 根因:observation_position 实际格式是「<域> 知识点(<实例名>)」,把节点特有的
7
+ 实例名嵌进了条件字段,3033 种取值 ≈ 唯一。按它分桶 = 一节点一桶,查询侧
8
+ 构造不出精确匹配的情境 → 命中率≈0,召回归零(比退化成全量更糟)。
9
+ - observation_tool(93% 集中) / existence_constraint(95% 集中) 去掉 position 后
10
+ 塌缩成单个巨桶。
11
+ - time_window 实测仅 3 种取值,进哈希键是纯噪声。
12
+ - tags 的 domain: 标签 → 95 桶 / 最大桶 5.4% / 期望扫描 1.8%,是唯一健康的键。
13
+
14
+ 因此路由键 = 归一化提取的「域」,而非四元组哈希。写入侧与查询侧共用本模块,
15
+ 保证两侧同构(风险2 的前提:查询构造的键必须与写入键落在同一空间)。
16
+ """
17
+ import math
18
+ import re
19
+ import hashlib
20
+ import unicodedata
21
+
22
+ # observation_position 的实例名尾巴:「知识点(xxx)」「概念(xxx)」等
23
+ _INSTANCE_TAIL = re.compile(
24
+ r"\s*(知识点|概念|条目|卡片|节点|规律|定理|公式)\s*[((].*?[))]\s*$"
25
+ )
26
+ # 骨架填充类后缀:「高中物理知识点内容(按骨架填充)」→「高中物理」
27
+ _SKELETON_TAIL = re.compile(r"(知识点)?内容\s*[((]按骨架填充[))]\s*$")
28
+
29
+ ORPHAN = "orphan"
30
+
31
+
32
+ # 生效条件:raw 为真值时按 NFKC 归一化并 strip,最多 3 轮剥离 _INSTANCE_TAIL(无变化即停)、再剥 _SKELETON_TAIL、空白转下划线后返回;raw 为假值(None/空串)或处理后为空串时返回 ORPHAN。
33
+ def normalize_domain(raw: str) -> str:
34
+ """把自由文本的域描述归一化成稳定的短键。
35
+
36
+ 「工程学 知识点(内力与截面法)」 → 工程学
37
+ 「高中物理知识点内容(按骨架填充)」 → 高中物理
38
+ 「数学分析知识点内容(按骨架填充) 知识点(贝塞尔不等式)」 → 数学分析
39
+ """
40
+ if not raw:
41
+ return ORPHAN
42
+ s = unicodedata.normalize("NFKC", str(raw)).strip()
43
+ # 反复剥离实例名尾巴(可能叠加两层,见上面第三个例子)
44
+ for _ in range(3):
45
+ new = _INSTANCE_TAIL.sub("", s)
46
+ if new == s:
47
+ break
48
+ s = new.strip()
49
+ s = _SKELETON_TAIL.sub("", s).strip()
50
+ s = re.sub(r"\s+", "_", s)
51
+ return s or ORPHAN
52
+
53
+
54
+ # 生效条件:tags 为真值时取其中首个 str(t) 以 "domain:" 开头的项,返回其前缀后内容的 normalize_domain 结果;无此标签且 condition_space 为真值时返回 normalize_domain(condition_space.get("observation_position"))(缺键即 None 归一为 ORPHAN);tags 为假值且 condition_space 为假值时返回 ORPHAN。
55
+ def route_key(condition_space: dict = None, tags=None) -> str:
56
+ """导出条件路由键。优先级:tags 的 domain: > observation_position 归一化 > orphan。
57
+
58
+ domain: 标签是显式声明的域,普查证明它分布最健康(95 桶/最大桶 5.4%),
59
+ 所以优先。没有标签时才回退到从 observation_position 提取。
60
+ """
61
+ for t in tags or []:
62
+ t = str(t)
63
+ if t.startswith("domain:"):
64
+ return normalize_domain(t[len("domain:"):])
65
+ if condition_space:
66
+ return normalize_domain(condition_space.get("observation_position"))
67
+ return ORPHAN
68
+
69
+
70
+ # 生效条件:key 等于 ORPHAN 时原样返回 ORPHAN;否则返回 "cond_" + 把 key 中非[\w中文-]字符替换为下划线并截前 24 字符的串 + "_" + key 的 sha256(utf-8)前 8 位十六进制。
71
+ def bucket_dir(key: str) -> str:
72
+ """路由键 → 目录名。中文键保留可读前缀 + 短哈希,避免文件系统非法字符/超长。"""
73
+ if key == ORPHAN:
74
+ return ORPHAN
75
+ safe = re.sub(r"[^\w\u4e00-\u9fff-]", "_", key)[:24]
76
+ h = hashlib.sha256(key.encode("utf-8")).hexdigest()[:8]
77
+ return f"cond_{safe}_{h}"
78
+
79
+
80
+ # 14 大域代表词表(白箱第 2 篇第 5 章 + 第 3 篇第 4 章:「56 学科卡 → 14 大域
81
+ # → 域内 KCCS」两阶段并行收敛。本表用作阶段 1 的大域并行打分依据——
82
+ # 当 query 没有显式 context 但 query 词能落进某个大域时,先收敛到大域再查。
83
+ #
84
+ # 词的选取原则:覆盖白箱工程文档里出现的高频学科关键词,且不互相吞并。
85
+ # 同一个词可以出现在多个大域(如「公式」在数学与物理都常见),这是合理的:
86
+ # 大域并行打分阶段就是让多域同分,再由阶段 2 的 KCCS 进一步区分。
87
+ BIG_DOMAINS = {
88
+ "数学": {"数学", "算术", "几何", "代数", "微积分", "概率", "统计", "集合", "矩阵",
89
+ "线性", "拓扑", "数论", "公式", "定理", "证明", "函数", "导数", "积分",
90
+ "极限", "方程", "不等式", "贝塞尔", "二分", "素数", "微元"},
91
+ "物理": {"物理", "力学", "电磁", "光学", "热学", "量子", "相对论", "能量", "动量",
92
+ "质量", "速度", "加速度", "电荷", "电压", "电流", "沸点", "海拔",
93
+ "大气压", "压强", "温度", "牛顿", "惯性", "引力"},
94
+ "化学": {"化学", "元素", "分子", "原子", "化合物", "反应", "酸", "碱", "盐",
95
+ "氧化", "还原", "有机", "无机", "离子", "键", "浓度", "溶液"},
96
+ "生物": {"生物", "细胞", "基因", "蛋白质", "酶", "光合", "呼吸", "植物", "动物",
97
+ "进化", "免疫", "神经", "细菌", "病毒", "代谢", "染色", "分裂"},
98
+ "计算机": {"计算机", "算法", "数据结构", "编程", "代码", "软件", "网络", "数据库",
99
+ "系统", "排序", "递归", "图论", "哈希", "索引", "查询", "排序", "锁",
100
+ "事务", "内存", "进程", "线程"},
101
+ "语言": {"语言", "中文", "英文", "语法", "词汇", "语义", "修辞", "文学", "写作",
102
+ "阅读", "拼音", "字", "词", "句"},
103
+ "历史": {"历史", "朝代", "战争", "文明", "政治", "经济史", "文化史", "古代",
104
+ "近代", "现代", "王朝", "革命", "改革"},
105
+ "地理": {"地理", "地形", "气候", "人口", "城市", "国家", "地图", "板块",
106
+ "洋流", "经度", "纬度", "海拔带", "流域"},
107
+ "艺术": {"艺术", "绘画", "音乐", "雕塑", "电影", "设计", "色彩", "构图",
108
+ "旋律", "节奏", "摄影"},
109
+ "经济": {"经济", "市场", "金融", "货币", "投资", "股票", "债券", "GDP",
110
+ "通胀", "财政", "税收", "供需"},
111
+ "心理": {"心理", "认知", "情感", "记忆", "学习", "性格", "行为", "意识",
112
+ "动机", "人格", "焦虑"},
113
+ "医学": {"医学", "疾病", "治疗", "药物", "诊断", "外科", "内科", "儿科",
114
+ "中医", "症状", "病理", "处方"},
115
+ "工程": {"工程", "建筑", "结构", "材料", "机械", "电子", "土木", "桥梁",
116
+ "内力", "截面", "梁", "柱", "应力"},
117
+ "通用": {"常识", "生活", "日常", "通用", "礼仪", "礼貌", "文明", "规则"},
118
+ }
119
+
120
+
121
+ # 生效条件:terms 为真值时对 BIG_DOMAINS 每个大域统计命中词数,最高分为 0 或 terms 为假值(None/空)时返回 None,否则返回最高分大域名(并列取 BIG_DOMAINS 迭代序首个最高分)。
122
+ def big_domain_classify(terms) -> str | None:
123
+ """阶段 1:14 大域并行打分 → 收敛到 top-1。
124
+
125
+ terms 是 expand_query_terms 返回的扩展词集合。
126
+ 大域打分 = query 词命中大域代表词的次数(多词同域累加)。
127
+ 并行在认知结构意义上:即使底层串行计算,14 个大域同时独立评估。
128
+
129
+ 返回最匹配的大域名(多个 0 分 → 返回 None,走原 bucket_dir 路由)。
130
+ """
131
+ if not terms:
132
+ return None
133
+ scores = {}
134
+ for d, vocab in BIG_DOMAINS.items():
135
+ scores[d] = sum(1 for t in terms
136
+ if any(w in t or t in w for w in vocab))
137
+ best = max(scores.items(), key=lambda x: x[1])
138
+ if best[1] == 0:
139
+ return None
140
+ # 多大域并列最高分时,按字典序取第一个稳定结果(避免浮点不确定)
141
+ return best[0]
142
+
143
+
144
+ # 生效条件:terms 为假值(None/空)时返回 {每个 BIG_DOMAINS 域: 0};terms 为真值时返回 {大域: 该域词表命中 terms 中词的个数}。
145
+ def big_domain_score_breakdown(terms) -> dict:
146
+ """暴露打分明细,便于审计与回归测试。"""
147
+ if not terms:
148
+ return {d: 0 for d in BIG_DOMAINS}
149
+ return {d: sum(1 for t in terms if any(w in t or t in w for w in vocab))
150
+ for d, vocab in BIG_DOMAINS.items()}
151
+
152
+
153
+ # ---------------------------------------------------------------------------
154
+ # 分级隶属度(模糊控制「隶属函数」的手写版)
155
+ #
156
+ # 上面的 big_domain_classify 是二值控制:`w in t or t in w` 命中即计 1。
157
+ # 下面是同一套规则库的**分级**版本——命中程度是 0~1 的连续值,并乘 IDF:
158
+ # · 隶属度 membership(t, w):完全相同 1.0;包含关系取长度比(覆盖越全越高)
159
+ # · IDF:一个代表词覆盖的大域越少,区分度越高(「贝塞尔」只在数学出现,
160
+ # 权重高于「公式」这种跨域通用词)
161
+ # 老函数保持不动 → P0/P1 基线可比性不受影响;新函数只供新路径(fuzzy)使用。
162
+ # ---------------------------------------------------------------------------
163
+
164
+ # 生效条件:term 或 word 为假值(None/空串)返回 0.0;相等返回 1.0;word 是 term 子串返回 len(word)/len(term);term 是 word 子串返回 len(term)/len(word);二者无包含关系返回 0.0。
165
+ def membership(term: str, word: str) -> float:
166
+ """词 term 对代表词 word 的隶属度(0.0~1.0,越接近 1 越隶属)。
167
+
168
+ 完全相同 → 1.0
169
+ term 包含 word → len(word)/len(term)(覆盖越全越隶属)
170
+ word 包含 term → len(term)/len(word)
171
+ 无包含关系 → 0.0
172
+ """
173
+ if not term or not word:
174
+ return 0.0
175
+ if term == word:
176
+ return 1.0
177
+ if word in term:
178
+ return len(word) / len(term)
179
+ if term in word:
180
+ return len(term) / len(word)
181
+ return 0.0
182
+
183
+
184
+ # 生效条件:无入参,恒遍历模块级常量 BIG_DOMAINS 的各域代表词表,返回 {代表词: 包含该词的域个数}。
185
+ def _build_domain_df() -> dict:
186
+ """代表词 → 覆盖它的大域数(IDF 的分母)。"""
187
+ df = {}
188
+ for vocab in BIG_DOMAINS.values():
189
+ for w in vocab:
190
+ df[w] = df.get(w, 0) + 1
191
+ return df
192
+
193
+
194
+ _DOMAIN_DF = _build_domain_df()
195
+
196
+
197
+ # 生效条件:恒返回 math.log(1.0 + len(BIG_DOMAINS) / _DOMAIN_DF.get(word, 1)),即 word 在 _DOMAIN_DF 中取其覆盖域数,缺键(含任何未登记值)时按 _DOMAIN_DF.get 的默认 1 代入。
198
+ def domain_idf(word: str) -> float:
199
+ """代表词的区分度权重:log(1 + 大域总数 / 覆盖它的大域数)。
200
+
201
+ 只在一个大域出现的词(如「贝塞尔」)≈ log(15)=2.71;
202
+ 14 个大域都出现的词(如「公式」)≈ log(2)=0.69。
203
+ """
204
+ return math.log(1.0 + len(BIG_DOMAINS) / _DOMAIN_DF.get(word, 1))
205
+
206
+
207
+ # 生效条件:terms 是 dict 时以其条目(键 str(t) 以 "__" 开头者剔除、值为 float)为词权重并忽略 weights,否则以 wmap.get(t, 1.0) 为权重(weights 为假值即 None/空 dict 时 wmap 为空、全部权重取 1.0,terms 为假值则词集为空);逐域累加「词权重 × 该词在域词表内最大(membership × domain_idf)」,权重 <=0 的词跳过,返回 {大域: round(得分, 6)}。
208
+ def big_domain_score_weighted(terms, weights=None) -> dict:
209
+ """阶段 1(分级版):14 大域并行打分,按「隶属度 × IDF」加权。
210
+
211
+ terms: 可迭代的词集合,或 {词: 权重}(expand_query_terms_weighted 的输出,
212
+ 调用方需先剔除 "__source__" 等元数据键)。
213
+ weights: terms 为可迭代时的可选权重表;terms 已是 dict 时忽略。
214
+ 返回 {大域: 得分},得分不再是整数计数,而是连续值。
215
+ """
216
+ if isinstance(terms, dict):
217
+ tw = {str(t): float(w) for t, w in terms.items()
218
+ if not str(t).startswith("__")}
219
+ else:
220
+ wmap = weights or {}
221
+ tw = {str(t): float(wmap.get(t, 1.0)) for t in (terms or [])}
222
+ out = {}
223
+ for d, vocab in BIG_DOMAINS.items():
224
+ s = 0.0
225
+ for t, tw_ in tw.items():
226
+ if tw_ <= 0:
227
+ continue
228
+ best = 0.0
229
+ for w in vocab:
230
+ m = membership(t, w)
231
+ if m > 0.0:
232
+ best = max(best, m * domain_idf(w))
233
+ s += tw_ * best
234
+ out[d] = round(s, 6)
235
+ return out
236
+
237
+
238
+ # 生效条件:以 terms、weights 计算各域加权得分(terms 为假值时各域均为 0.0),得分为空或最高分 <= min_score(默认 0.0)时返回 None,否则返回最高分大域名。
239
+ def big_domain_classify_weighted(terms, weights=None, min_score: float = 0.0):
240
+ """阶段 1(分级版)收敛到 top-1;全部低于 min_score → None。"""
241
+ scores = big_domain_score_weighted(terms, weights)
242
+ if not scores:
243
+ return None
244
+ best = max(scores.items(), key=lambda kv: kv[1])
245
+ if best[1] <= min_score:
246
+ return None
247
+ return best[0]
248
+
249
+
250
+ # 生效条件:a 或 b 为假值(None/空串)返回 0.0;相等返回 1.0;a 是 b 子串返回 len(a)/len(b);b 是 a 子串返回 len(b)/len(a);否则按二者二元组字符集合的 Jaccard 返回 len(ga & gb)/len(ga | gb),任一集合为空(如单字符键)时返回 0.0。
251
+ def domain_similarity(a: str, b: str) -> float:
252
+ """两个归一化域键的相似度(0~1):相同 1.0;包含取长度比;否则二元组 Jaccard。
253
+
254
+ 「计算机科学」vs「计算机」→ 0.6(包含);「高中物理」vs「物理」→ 0.5;
255
+ 完全无关 → 0.0。用于 fuzzy 路径的「大域亲和」打分。
256
+ """
257
+ if not a or not b:
258
+ return 0.0
259
+ if a == b:
260
+ return 1.0
261
+ if a in b:
262
+ return len(a) / len(b)
263
+ if b in a:
264
+ return len(b) / len(a)
265
+ ga = {a[i:i + 2] for i in range(len(a) - 1)}
266
+ gb = {b[i:i + 2] for i in range(len(b) - 1)}
267
+ if not ga or not gb:
268
+ return 0.0
269
+ return len(ga & gb) / len(ga | gb)
270
+
271
+
272
+ # 生效条件:counts 各值之和为 0(含空 dict 与全 0 计数)时返回 {'ok': True, 'reason': 'empty', 'buckets': 0};否则在最大桶占比 >30%、桶数 >1 且单例桶占比 >50%、期望扫描 >30% 中命中的项写入 problems,返回含 ok(=problems 为空)、buckets、nodes、max_bucket_share、singleton_ratio、expected_scan、problems 的 dict。
273
+ def bucket_health(counts: dict) -> dict:
274
+ """分区健康度自检。分桶键一旦退化(巨桶或碎片化),条件路由就是纸面收益,
275
+ 必须在写入侧就能发现,而不是等召回变差才回头查。
276
+
277
+ counts: {bucket_dir: node_count}
278
+ """
279
+ n = sum(counts.values())
280
+ if not n:
281
+ return {"ok": True, "reason": "empty", "buckets": 0}
282
+ nb = len(counts)
283
+ top = max(counts.values())
284
+ singles = sum(1 for v in counts.values() if v == 1)
285
+ # 期望扫描占比:随机取一节点的情境去路由,命中桶的期望大小占全库比例
286
+ expected_scan = sum(v * v for v in counts.values()) / n / n
287
+ problems = []
288
+ if top / n > 0.30:
289
+ problems.append(f"巨桶:最大桶占 {top / n:.1%}(>30% 视为分区失效)")
290
+ if nb > 1 and singles / nb > 0.50:
291
+ problems.append(f"碎片化:单例桶占 {singles / nb:.1%}(>50% 说明键含实例级字段)")
292
+ if expected_scan > 0.30:
293
+ problems.append(f"路由无效:期望扫描 {expected_scan:.1%}(接近全量)")
294
+ return {
295
+ "ok": not problems,
296
+ "buckets": nb,
297
+ "nodes": n,
298
+ "max_bucket_share": top / n,
299
+ "singleton_ratio": singles / nb if nb else 0.0,
300
+ "expected_scan": expected_scan,
301
+ "problems": problems,
302
+ }
303
+
304
+
305
+ # ---------------------------------------------------------------------------
306
+ # 节点侧大域标签(S1 大域先验收敛的前置元数据)
307
+ #
308
+ # 为何需要:`big_domain_classify` 一直只作用于 **query 侧**(terms),节点侧没有域字段,
309
+ # 于是「14 大域并行打分」算完只能写进 meta(审计偏差 4:先验算出来却当成报告)。
310
+ # 要让大域先验真正参与候选收敛,节点必须在写入时固化自己的域。
311
+ # 口径:与查询侧同一个分类器(BIG_DOMAINS + big_domain_classify),保证两侧同构。
312
+ # ---------------------------------------------------------------------------
313
+
314
+ # 域词取词:中文(≥2 字)与拉丁词(≥2 字)。词表命中用「包含关系」判定,
315
+ # 故 2 字以上的切口足以覆盖 1~4 字代表词(如「工程」命中「工程师」)。
316
+ DOMAIN_TERM_RE = re.compile(r"[\u4e00-\u9fff]{2,}|[A-Za-z][A-Za-z0-9_]{1,}")
317
+
318
+
319
+ # 生效条件:text 为假值(None/空串)时返回 [];否则以 DOMAIN_TERM_RE 取词、按出现顺序去重后返回,
320
+ # 最多 limit 个(limit 为假值/负数时按空处理,返回 [])。
321
+ def domain_terms(text, limit: int = 400) -> list:
322
+ """从节点正文/标题抽「域词」(供 big_domain_classify 使用)。
323
+
324
+ 只做最小分词:中文按 ≥2 字连续片段、拉丁按 [A-Za-z][A-Za-z0-9_]+ 取词;
325
+ 去重保序,最多 limit 个(默认 400,避免长文把分类器拖慢)。
326
+ """
327
+ if not text or not limit or limit < 1:
328
+ return []
329
+ out, seen = [], set()
330
+ for m in DOMAIN_TERM_RE.finditer(str(text)):
331
+ w = m.group(0)
332
+ if w in seen:
333
+ continue
334
+ seen.add(w)
335
+ out.append(w)
336
+ if len(out) >= limit:
337
+ break
338
+ return out
339
+
340
+
341
+ # 生效条件:bucket 为假值或等于 ORPHAN 时返回空串;否则去掉 "cond_" 前缀、并当末段为 8 位十六进制哈希时剥掉该段,返回剩余的可读键。
342
+ def bucket_key_readable(bucket: str) -> str:
343
+ """桶目录名 → 可读键(S1b query 侧桶推断用):'cond_感知系统_d94e90d2' → '感知系统'。
344
+
345
+ 与 `bucket_dir` 互逆(丢哈希段);`orphan`/空值返回空串(S1b 不把 orphan 当键,orphan 恒作兜底)。
346
+ """
347
+ if not bucket or bucket == ORPHAN:
348
+ return ""
349
+ s = str(bucket)
350
+ if s.startswith("cond_"):
351
+ s = s[len("cond_"):]
352
+ head, sep, tail = s.rpartition("_")
353
+ if sep and len(tail) == 8 and all(c in "0123456789abcdef" for c in tail):
354
+ s = head
355
+ return s
356
+
357
+
358
+ # 生效条件:text 为假值或取不到任何域词时返回 None;否则返回 big_domain_classify(domain_terms(text))
359
+ # 的结果(无有效域信号时亦为 None,调用方据此决定是否落域字段)。
360
+ def classify_text(text, limit: int = 400):
361
+ """正文 → 大域名(节点侧域标签真源)。与查询侧共用 big_domain_classify。
362
+
363
+ 返回 None 表示「无有效域信号」——此时**不写** big_domain 字段,
364
+ 该节点留在 ORPHAN/兜底池(S1 收敛时必须能被兜底召回,见契约 §3 S1 不变量)。
365
+ """
366
366
  return big_domain_classify(domain_terms(text, limit))