@furongjun1999/dsh-memory 0.4.11 → 0.5.1
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/README.md +552 -465
- package/codebuddy/CODEBUDDY.md +11 -3
- package/codebuddy/README.md +92 -90
- package/codebuddy/mcp.json +27 -27
- package/docs/GBrain/345/217/257/345/200/237/351/211/264/347/202/271_/347/201/265/346/236/242/350/220/275/347/202/271/344/272/244/346/216/245_20260919.md +169 -169
- package/docs/Pi/345/217/257/345/255/246/344/271/240/344/274/230/347/202/271_/347/201/265/346/236/242/345/244/247/350/204/221/346/224/271/350/277/233/344/272/244/346/216/245_20260915.md +144 -144
- package/docs/README.md +143 -111
- package/docs/discipline/harnesses.yaml +244 -226
- package/docs/discipline/templates/full.md.tmpl +61 -61
- package/docs/discipline/templates/rules.mdc.tmpl +68 -0
- package/docs/discipline/templates/skill.md.tmpl +23 -23
- package/docs/eval/AGI/344/270/203/347/273/264/350/257/204/345/210/206/346/212/245/345/221/212_md_cg_v1.0.md +299 -299
- package/docs/eval/AGI/344/270/203/347/273/264/350/257/204/345/210/206/346/212/245/345/221/212_md_cg_v2.0.md +239 -239
- package/docs/eval/bench_lingshu_self/bench_self.py +140 -0
- package/docs/eval/bench_lingshu_self/self_bench_result.json +404 -0
- package/docs/eval/bench_lingshu_self//347/201/265/346/236/242/350/207/252/345/272/223/347/253/257/345/210/260/347/253/257/346/243/200/347/264/242/345/256/236/346/265/213_v1.0.md +38 -0
- package/docs/eval//344/270/215/345/217/257/351/235/240/346/200/247/350/220/275/345/234/260_P0_v1.0.md +185 -0
- package/docs/eval//345/256/236/351/252/214/346/226/271/346/241/210_/345/255/246/344/271/240/351/227/255/347/216/257AB/344/270/216/346/250/252/350/257/204_v1.0.md +174 -174
- package/docs/eval//346/225/205/351/232/234/346/263/250/345/205/245/345/256/236/346/265/213_v1.0.md +422 -0
- package/docs/eval//346/250/252/350/257/204_/345/205/255/345/256/266100/351/242/230/344/270/255/350/213/261/345/217/214/346/237/245_v1.0.md +223 -223
- package/docs/eval//347/253/257/345/210/260/347/253/257LoCoMoQA/345/220/214/345/217/243/345/276/204/345/257/271/347/205/247_v1.0.md +100 -0
- package/docs/eval//347/253/257/345/210/260/347/253/257/345/271/262/346/211/260/346/261/240/350/257/204/346/265/213_/347/241/256/345/256/232/346/200/247/350/243/201/345/206/263vsLLM_judge_v1.1.md +197 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v1.md +156 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v10.md +210 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v11.md +227 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v12.md +203 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v13.md +233 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v14.md +191 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v15.md +213 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v16.md +214 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v17.md +199 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v2.md +156 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v3.md +152 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v4.md +128 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v5.md +114 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v6.md +192 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v7.md +187 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v8.md +207 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v9.md +203 -0
- package/docs/{mdcg → hive}//344/273/244/347/211/214/344/270/216/350/247/222/350/211/262/346/235/203/350/201/214/345/210/206/347/246/273_v0.1.md +165 -160
- package/docs/hive//344/273/244/347/211/214/350/257/255/344/271/211/344/277/256/346/255/243_/344/273/262/350/243/201/344/275/215_v0.1.md +76 -0
- package/docs/{mdcg → hive}//345/255/220/344/273/243/347/220/206/351/205/215/347/275/256/346/240/207/345/207/206_v0.5.md +236 -236
- package/docs/hive//345/256/211/345/205/250/345/256/241/350/256/241/345/256/236/351/224/232_v0.1.md +202 -0
- package/docs/hive//346/243/200/347/264/242/346/224/266/346/225/233/345/256/236/346/265/213/344/270/216S1b/350/256/276/350/256/241_v0.1.md +43 -43
- package/docs/hive//346/243/200/347/264/242/347/256/227/346/263/225/345/217/243/345/276/204/345/257/271/347/205/247_v0.1.md +85 -0
- package/docs/hive//346/243/200/347/264/242/350/267/257/345/276/204/344/270/216/350/256/244/347/237/245/347/273/223/346/236/204/345/245/221/347/272/246_v0.1.md +102 -102
- package/docs/hive//350/234/202/345/267/242M6_ingest/345/256/236/346/226/275/350/256/241/345/210/222_v0.1.md +47 -0
- package/docs/hive//350/234/202/345/267/242/345/217/214/345/256/236/344/276/213/344/272/222/351/252/214_/350/256/276/350/256/241/345/256/232/347/250/277.md +519 -503
- package/docs/hive//350/234/202/345/267/242/345/267/245/344/275/234/350/256/260/345/277/206_/351/241/271/347/233/256/350/256/241/345/210/222.md +85 -85
- package/docs/hive//350/234/202/345/267/242/350/256/276/350/256/241_/347/220/206/350/256/272/345/257/271/351/275/220_v0.1.md +191 -0
- package/docs/hive//350/234/202/345/267/242/350/277/255/344/273/243_/345/256/217/350/247/202/344/270/216/347/276/244/344/275/223/350/260/203/345/272/246_v0.1.md +90 -0
- package/docs/images/lingshu-moonlight-covenant-poster-preview.jpg +0 -0
- package/docs/images/lingshu-moonlight-covenant-poster.png +0 -0
- package/docs/mdcg/D_meta_/345/267/245/347/250/213/345/214/226/346/226/271/346/241/210_v0.2.md +216 -216
- package/docs/mdcg/README/350/257/246/347/273/206/347/211/210_v0.4.10.md +646 -646
- package/docs/mdcg/lingshu_tutorial.html +14449 -14449
- package/docs/mdcg/release_v0.4.11.md +49 -0
- package/docs/mdcg/release_v0.4.5.md +55 -55
- package/docs/mdcg/tool_table_v0.3.0.md +117 -117
- package/docs/mdcg//345/205/250/345/272/223/344/273/243/347/240/201/350/257/204/345/256/241/344/270/216/346/235/241/344/273/266/345/214/226/346/263/250/351/207/212_/350/256/241/345/210/222_v0.1.md +600 -600
- package/docs/mdcg//345/212/237/350/203/275/350/260/203/347/224/250/346/230/240/345/260/204/350/241/250_v0.1.md +40 -40
- package/docs/mdcg//345/215/225/345/205/203/350/207/252/346/210/221/351/224/232/347/202/271_/347/263/273/347/273/237/346/217/220/347/244/272/350/257/215/346/240/207/345/207/206_v0.3.md +275 -275
- package/docs/mdcg//345/217/221/345/270/203/351/227/250/347/246/201/351/223/276_v0.1.md +54 -0
- package/docs/mdcg//346/272/220/347/240/201/347/272/247/346/236/266/346/236/204/345/256/241/350/256/241_GPT/346/211/271/350/257/204/345/257/271/347/205/247_v1.0.md +130 -130
- package/docs/mdcg//347/201/265/346/236/24282/345/267/245/345/205/267_/345/212/237/350/203/275/346/225/264/347/220/206/344/270/216/350/277/201/347/247/273/346/230/240/345/260/204_v0.1.md +278 -278
- package/docs/mdcg//347/201/265/346/236/242/350/256/260/345/277/206/345/212/250/350/257/215/345/215/217/350/256/256_v1.0-draft.md +172 -172
- package/docs/mdcg//347/274/272/345/217/243/345/215/225_P0/346/224/266/345/217/243_v0.1.md +270 -270
- package/docs/mdcg//350/256/244/347/237/245/345/233/276_G4-G8/347/274/272/345/217/243/350/243/201/345/256/232/345/215/225_v0.1.md +491 -491
- package/docs/mdcg//350/256/244/347/237/245/345/233/276_/346/235/241/344/273/266/347/251/272/351/227/264/345/220/210/346/210/220/344/270/216/347/224/237/346/225/210/346/235/241/344/273/266/345/217/243/345/276/204_v0.1.md +340 -340
- package/docs/mdcg//350/256/244/347/237/245/345/233/276_/347/264/242/345/274/225/344/270/216/345/267/245/347/250/213/350/247/204/350/214/203/345/214/226_/350/256/241/345/210/222_v0.1.md +588 -588
- package/docs/plans/GridWorld/346/234/200/345/260/217/351/227/255/347/216/257/350/247/204/346/240/274_v0.1.md +176 -176
- package/docs/plans//345/221/275/345/220/215/346/262/273/347/220/206_/351/241/271/347/233/256/350/256/241/345/210/222.md +81 -81
- package/docs/swarm//350/234/202/347/276/244/344/272/222/350/201/224_v0.1.md +704 -704
- package/docs/swarm//350/234/202/347/276/244/345/220/214/351/224/231/346/243/200/346/265/213/345/256/236/351/252/214/345/215/217/350/256/256_v0.1.md +242 -242
- package/docs/theory//344/270/215/345/217/257/351/235/240/345/256/232/347/220/206/344/270/216/345/244/261/346/225/210/344/274/230/345/205/210/346/241/206/346/236/266_v0.3.md +365 -0
- package/docs/theory//345/215/225/347/272/277/347/250/213/344/270/216/346/263/250/346/204/217/345/212/233/351/233/206/344/270/255_/346/227/240/344/272/211/350/256/256/347/220/206/350/256/272/346/226/207/346/241/243_v1.0.md +129 -129
- package/docs/theory//345/271/266/345/217/221/345/277/205/347/204/266/346/200/247/347/220/206/350/256/272_v0.2.md +134 -134
- package/docs/theory//346/231/272/350/203/275/350/256/2723.4.md +5260 -5260
- package/docs/theory//346/246/202/345/277/265/345/210/206/345/261/202/345/257/271/351/275/220/350/241/250_v0.1.md +145 -145
- package/docs/theory//347/220/206/350/256/272_/346/234/272/345/210/266_/344/273/243/347/240/201_/345/256/236/351/252/214_/347/274/272/345/217/243/347/237/251/351/230/265_v0.1.md +144 -144
- package/docs/theory//347/220/206/350/256/272/344/273/223/346/213/206/345/210/206/344/270/216/347/231/275/347/256/261/347/237/245/350/257/206/345/272/223/345/206/205/350/277/201_v0.1.md +198 -198
- package/docs/theory//350/256/244/347/237/245/344/273/243/347/220/206/344/270/216/346/224/266/346/225/233/347/273/223/346/236/204_/346/235/241/344/273/266/350/256/272/351/207/215/346/236/204_v0.1.md +221 -221
- package/docs/world_model//344/270/226/347/225/214/346/250/241/345/236/213_/347/245/236/347/273/217/347/275/221/347/273/234/345/272/225/345/261/202/346/236/266/346/236/204_v1.0.md +237 -237
- package/docs//344/270/215/345/217/257/351/235/240/346/200/247/347/220/206/350/256/272_v0.1.md +343 -0
- package/docs//345/217/221/345/270/203/344/273/266/345/233/236/346/272/257/350/257/264/346/230/216_v0.1.md +82 -82
- package/docs//345/267/245/344/275/234/347/272/252/345/276/213_/350/256/244/347/237/245/345/233/276/346/235/241/347/233/256_v1.1.json +28 -2
- package/dsh/README.md +82 -82
- package/dsh/cordis.yml.example +139 -139
- package/dsh/update-lingshu.bat +11 -11
- package/lib/bridge.d.ts +9 -0
- package/lib/bridge.js +35 -0
- package/lib/hooks.js +36 -2
- package/lib/index.js +7 -1
- package/lib/lib/roleplay_web.js +116 -29
- package/lib/lib/token_store.d.ts +7 -1
- package/lib/lib/token_store.js +12 -3
- package/md_cg/__init__.py +7 -7
- package/md_cg/audit.py +379 -368
- package/md_cg/autonomy.py +287 -287
- package/md_cg/backfill.py +1328 -1327
- package/md_cg/backfill_bigdomain.py +34 -34
- package/md_cg/backfill_bucket_zh.py +35 -0
- package/md_cg/bench6_arms.py +410 -410
- package/md_cg/bench6_common.py +230 -230
- package/md_cg/bench6_competitors.py +212 -212
- package/md_cg/bench_axis_domain.py +257 -257
- package/md_cg/bench_blind_comp.py +308 -308
- package/md_cg/bench_e2e_judge.py +532 -0
- package/md_cg/bench_e2e_locomo_qa.py +368 -0
- package/md_cg/bench_e2e_qa.py +256 -0
- package/md_cg/bench_en_atoms_public.py +230 -230
- package/md_cg/bench_governance.py +348 -348
- package/md_cg/bench_lme_zh.py +410 -410
- package/md_cg/bench_locomo.py +121 -121
- package/md_cg/bench_locomo_zh.py +450 -450
- package/md_cg/bench_locomo_zh_public.py +147 -147
- package/md_cg/bench_longmem.py +112 -112
- package/md_cg/bench_membench.py +632 -632
- package/md_cg/bench_p0.py +149 -149
- package/md_cg/bench_progressive.py +287 -287
- package/md_cg/bench_role_views.py +238 -238
- package/md_cg/bench_task_ab.py +243 -243
- package/md_cg/bench_task_ab_llm.py +408 -408
- package/md_cg/bench_unified_en.py +204 -204
- package/md_cg/bench_zh_mad.py +601 -601
- package/md_cg/blindspot_tickets.py +123 -123
- package/md_cg/branches.py +301 -285
- package/md_cg/build_postings.py +73 -73
- package/md_cg/ccgc.py +1006 -948
- package/md_cg/census.py +132 -132
- package/md_cg/chain.py +315 -300
- package/md_cg/codeindex.py +531 -531
- package/md_cg/coldverify.py +292 -292
- package/md_cg/comment_gate.py +337 -337
- package/md_cg/cond_compose.py +190 -190
- package/md_cg/cond_facts.py +154 -154
- package/md_cg/cond_template.json +106 -106
- package/md_cg/condition_anchor.py +142 -142
- package/md_cg/conformance.py +726 -726
- package/md_cg/consistency.py +717 -717
- package/md_cg/consolidate.py +1537 -1439
- package/md_cg/corpus.py +110 -110
- package/md_cg/crosscheck.py +1098 -1097
- package/md_cg/crypto.py +3 -1
- package/md_cg/d_meta.py +310 -310
- package/md_cg/datapath.py +78 -18
- package/md_cg/docindex.py +473 -473
- package/md_cg/eval_common.py +575 -575
- package/md_cg/evidence.py +4 -2
- package/md_cg/evolution.py +477 -477
- package/md_cg/export.py +222 -220
- package/md_cg/forgetting.py +581 -581
- package/md_cg/fsutil.py +377 -329
- package/md_cg/hotcache.py +48 -7
- package/md_cg/hyperedge.py +251 -251
- package/md_cg/identity.py +390 -390
- package/md_cg/insight.py +500 -500
- package/md_cg/interop.py +338 -0
- package/md_cg/judgment_manifest.py +177 -0
- package/md_cg/lexicon/build_cedict_en_zh.py +329 -329
- package/md_cg/lexicon/build_standard_en.py +171 -171
- package/md_cg/lexicon/expand_en_zh.py +211 -211
- package/md_cg/lifecycle.py +272 -272
- package/md_cg/linkref.py +280 -280
- package/md_cg/links.py +140 -107
- package/md_cg/mcp_server.py +403 -55
- package/md_cg/md_whitebox.py +345 -345
- package/md_cg/mdcg.py +783 -233
- package/md_cg/mdcos.py +500 -70
- package/md_cg/metacognition.py +591 -591
- package/md_cg/migrate.py +119 -119
- package/md_cg/migrate_aeis.py +221 -221
- package/md_cg/migrate_roleplay.py +293 -293
- package/md_cg/migrate_wisdom_graph.py +360 -360
- package/md_cg/mreview/__init__.py +25 -25
- package/md_cg/mreview/__main__.py +110 -110
- package/md_cg/mreview/bundle.py +178 -178
- package/md_cg/mreview/candidates.py +262 -262
- package/md_cg/mreview/govern.py +694 -693
- package/md_cg/mreview/locate.py +939 -939
- package/md_cg/mreview/pipeline.py +728 -728
- package/md_cg/mreview/rules/duplication.json +21 -21
- package/md_cg/mreview/rules/field_coverage.json +54 -54
- package/md_cg/mreview/rules/source_license.json +21 -21
- package/md_cg/mreview/rules/template_flow.json +21 -21
- package/md_cg/mreview/ruleset.py +252 -252
- package/md_cg/nodefile.py +575 -575
- package/md_cg/pooling.py +484 -472
- package/md_cg/postings.py +300 -298
- package/md_cg/predict.py +1100 -1100
- package/md_cg/progressive.py +123 -123
- package/md_cg/protect.py +272 -272
- package/md_cg/protocol/md_cg_gate.proto +33 -33
- package/md_cg/protocol.py +372 -372
- package/md_cg/provenance.py +582 -582
- package/md_cg/reach.py +453 -453
- package/md_cg/readcache.py +143 -0
- package/md_cg/reconcile.py +228 -0
- package/md_cg/refindex.py +833 -833
- package/md_cg/refine.py +604 -604
- package/md_cg/review_cli.py +170 -0
- package/md_cg/roleviews.py +89 -89
- package/md_cg/routing.py +393 -365
- package/md_cg/run_tests.py +211 -0
- package/md_cg/scrub.py +13 -3
- package/md_cg/security.py +128 -18
- package/md_cg/self_state.py +1029 -1029
- package/md_cg/selfreport.py +152 -151
- package/md_cg/semantic/__init__.py +10 -10
- package/md_cg/semantic/canonical.py +122 -122
- package/md_cg/semantic/en_normalizer.py +364 -364
- package/md_cg/semantic/en_zh_map.json +28694 -0
- package/md_cg/semantic/export_en_zh_map.py +64 -0
- package/md_cg/semantic/unify.py +45 -0
- package/md_cg/semantic/zh_en_atoms.py +139 -139
- package/md_cg/signer.py +7 -4
- package/md_cg/sources.py +816 -582
- package/md_cg/statushdr.py +179 -179
- package/md_cg/stg.py +54 -37
- package/md_cg/subgraph.py +729 -729
- package/md_cg/sustain.py +35 -5
- package/md_cg/tasks.py +470 -470
- package/md_cg/test_access_hints.py +147 -0
- package/md_cg/test_action_derive.py +203 -203
- package/md_cg/test_audit_rotate.py +270 -270
- package/md_cg/test_autonomy.py +143 -143
- package/md_cg/test_bench_governance.py +102 -102
- package/md_cg/test_blindspot_tickets.py +166 -166
- package/md_cg/test_branch_discard_tombstone.py +136 -0
- package/md_cg/test_branches.py +13 -3
- package/md_cg/test_ccg_perturb.py +184 -184
- package/md_cg/test_ccgc.py +433 -433
- package/md_cg/test_census_prune.py +81 -81
- package/md_cg/test_chain_read_isolate.py +168 -0
- package/md_cg/test_cond_compose_anchors.py +76 -76
- package/md_cg/test_cond_match.py +165 -165
- package/md_cg/test_condition_anchor.py +81 -81
- package/md_cg/test_d_meta.py +412 -412
- package/md_cg/test_datapath_device_name.py +203 -0
- package/md_cg/test_datapath_root.py +199 -199
- package/md_cg/test_emit_negtail_cache.py +156 -0
- package/md_cg/test_en_pipeline.py +22 -2
- package/md_cg/test_gain_gate.py +212 -212
- package/md_cg/test_govern_directread.py +421 -0
- package/md_cg/test_health_scale.py +173 -173
- package/md_cg/test_hive_ingest.py +285 -0
- package/md_cg/test_hot_cold.py +215 -215
- package/md_cg/test_hyperedge.py +245 -245
- package/md_cg/test_i26_empty_first_write.py +116 -0
- package/md_cg/test_i27_e041_identity.py +128 -0
- package/md_cg/test_i28_hotcache_prodpath.py +122 -0
- package/md_cg/test_i32_hotcache_env_key.py +218 -0
- package/md_cg/test_identity_attribution.py +96 -15
- package/md_cg/test_index_durability.py +17 -3
- package/md_cg/test_interop.py +95 -0
- package/md_cg/test_interop_judgment.py +228 -0
- package/md_cg/test_issue39_utf8_stdio.py +273 -0
- package/md_cg/test_lifecycle.py +309 -309
- package/md_cg/test_linkref.py +306 -306
- package/md_cg/test_links_concurrent_write.py +188 -0
- package/md_cg/test_lock.py +43 -43
- package/md_cg/test_md_access_parity.py +255 -255
- package/md_cg/test_md_writepath.py +345 -345
- package/md_cg/test_mdstore_search_parity.py +160 -0
- package/md_cg/test_merge_upsert.py +168 -0
- package/md_cg/test_mr_m2.py +587 -587
- package/md_cg/test_mr_m3.py +710 -710
- package/md_cg/test_mr_m4.py +485 -485
- package/md_cg/test_n123_derive_expiry_chain.py +205 -0
- package/md_cg/test_n130_verify_falsified_protect.py +185 -0
- package/md_cg/test_n131_merge_gate.py +205 -0
- package/md_cg/test_p0.py +250 -250
- package/md_cg/test_p1.py +316 -316
- package/md_cg/test_p10_identity.py +173 -173
- package/md_cg/test_p11_consistency.py +233 -233
- package/md_cg/test_p12_metacognition.py +212 -212
- package/md_cg/test_p13_encryption.py +241 -241
- package/md_cg/test_p14_sustain.py +249 -249
- package/md_cg/test_p15_scrub.py +280 -280
- package/md_cg/test_p16_self_state.py +301 -301
- package/md_cg/test_p17_predict.py +354 -354
- package/md_cg/test_p18_whitebox.py +171 -171
- package/md_cg/test_p19_migrate_roleplay.py +149 -149
- package/md_cg/test_p1x_ref_root.py +160 -0
- package/md_cg/test_p20_evolution.py +315 -315
- package/md_cg/test_p21_tokens.py +293 -270
- package/md_cg/test_p22_theory.py +175 -175
- package/md_cg/test_p23_links.py +311 -311
- package/md_cg/test_p24_evidence.py +227 -227
- package/md_cg/test_p25_weights.py +156 -156
- package/md_cg/test_p26_refindex.py +416 -416
- package/md_cg/test_p27_docindex.py +16 -7
- package/md_cg/test_p28_refcheck.py +305 -305
- package/md_cg/test_p29_session_ingest_export.py +354 -333
- package/md_cg/test_p2_mcp.py +3 -0
- package/md_cg/test_p3.py +11 -2
- package/md_cg/test_p30_maintain.py +330 -330
- package/md_cg/test_p31_insight.py +534 -534
- package/md_cg/test_p32_backfill.py +7 -1
- package/md_cg/test_p33_ccg_wiring.py +293 -293
- package/md_cg/test_p34_crosscheck.py +331 -331
- package/md_cg/test_p35_conditioned_claim.py +252 -252
- package/md_cg/test_p36_kp_align.py +230 -230
- package/md_cg/test_p37_condition_space.py +248 -248
- package/md_cg/test_p38_concurrent_flush.py +102 -0
- package/md_cg/test_p38_contextualize.py +273 -273
- package/md_cg/test_p39_verify_flow.py +153 -0
- package/md_cg/test_p39_vision_evidence.py +369 -369
- package/md_cg/test_p40_refine_worklist.py +241 -241
- package/md_cg/test_p41_evolve_patrol.py +224 -224
- package/md_cg/test_p42_provenance.py +269 -269
- package/md_cg/test_p43_pooling.py +412 -398
- package/md_cg/test_p44_md_whitebox.py +231 -231
- package/md_cg/test_p45_session_identity.py +219 -219
- package/md_cg/test_p46_unit_scope.py +272 -272
- package/md_cg/test_p47_session_view.py +316 -0
- package/md_cg/test_p4_fuzzy.py +223 -223
- package/md_cg/test_p5_semantic.py +226 -226
- package/md_cg/test_p6_consolidate.py +440 -387
- package/md_cg/test_p7_goals_recent.py +202 -202
- package/md_cg/test_p8_subgraph_chain.py +200 -200
- package/md_cg/test_p9_forget_protect.py +231 -231
- package/md_cg/test_predict_beta.py +135 -135
- package/md_cg/test_preflight_failclosed.py +100 -100
- package/md_cg/test_progressive.py +146 -146
- package/md_cg/test_propose_tail_index.py +157 -0
- package/md_cg/test_protocol.py +243 -243
- package/md_cg/test_reach.py +378 -378
- package/md_cg/test_reach_keys.py +201 -201
- package/md_cg/test_read_clip.py +141 -141
- package/md_cg/test_read_scope_b27.py +277 -0
- package/md_cg/test_readcache_default_on.py +168 -0
- package/md_cg/test_readcache_precise_inval.py +270 -0
- package/md_cg/test_readcache_prodpath.py +203 -0
- package/md_cg/test_reconcile_v0.py +294 -0
- package/md_cg/test_retr_gates_prodpath.py +140 -0
- package/md_cg/test_retr_s1.py +344 -340
- package/md_cg/test_retr_s1b.py +276 -209
- package/md_cg/test_retr_s3.py +194 -194
- package/md_cg/test_retr_s4.py +163 -163
- package/md_cg/test_retr_s5.py +200 -200
- package/md_cg/test_retr_s6.py +157 -157
- package/md_cg/test_retr_s7.py +392 -384
- package/md_cg/test_retr_s8_time.py +369 -316
- package/md_cg/test_retr_s9_edges.py +286 -286
- package/md_cg/test_retr_s9_entity_ctx.py +9 -3
- package/md_cg/test_retr_score_once.py +208 -0
- package/md_cg/test_review_conformance.py +367 -367
- package/md_cg/test_review_onepass.py +170 -0
- package/md_cg/test_role_views.py +354 -354
- package/md_cg/test_rrf_graph_seed_cache.py +154 -0
- package/md_cg/test_security_audit.py +155 -0
- package/md_cg/test_security_audit_b26.py +161 -0
- package/md_cg/test_security_audit_v21.py +250 -0
- package/md_cg/test_sem_noise.py +242 -242
- package/md_cg/test_semantic_canonical.py +16 -2
- package/md_cg/test_session_isolation.py +168 -0
- package/md_cg/test_snapshot_autoclose.py +187 -0
- package/md_cg/test_subproc_encoding.py +192 -192
- package/md_cg/test_sustain_mutual.py +153 -153
- package/md_cg/test_tail_watermark_race.py +208 -0
- package/md_cg/test_tasks.py +409 -409
- package/md_cg/test_tenant_env_override_warn.py +139 -0
- package/md_cg/test_tenant_registry_corrupt_warn.py +151 -0
- package/md_cg/test_tool_face.py +189 -189
- package/md_cg/test_transfer.py +180 -180
- package/md_cg/test_trust.py +361 -361
- package/md_cg/test_twophase.py +286 -286
- package/md_cg/test_v14_fixes.py +38 -20
- package/md_cg/test_validity_filter.py +280 -280
- package/md_cg/test_verify_answer.py +138 -138
- package/md_cg/test_verify_dirty_reconcile.py +157 -0
- package/md_cg/test_wisdom_md_store.py +292 -292
- package/md_cg/test_writelimit.py +197 -197
- package/md_cg/test_writepipe.py +214 -214
- package/md_cg/theory.py +6 -3
- package/md_cg/tokens.py +85 -14
- package/md_cg/tool_face.py +260 -260
- package/md_cg/trust.py +986 -950
- package/md_cg/twophase.py +231 -231
- package/md_cg/units.py +668 -667
- package/md_cg/vision_evidence.py +667 -666
- package/md_cg/weights.py +624 -624
- package/md_cg/whitebox.py +527 -527
- package/md_cg/whitebox_kb/__init__.py +37 -37
- package/md_cg/whitebox_kb/aeis_core/__init__.py +42 -42
- package/md_cg/whitebox_kb/aeis_core/semantic.py +280 -280
- package/md_cg/whitebox_kb/aeis_core/textutil.py +13 -13
- package/md_cg/whitebox_kb/engine.py +310 -310
- package/md_cg/whitebox_kb/seed_knowledge//346/231/272/350/203/275/350/256/2723.4.md +5260 -5260
- package/md_cg/whitebox_kb/wisdom/browser_units.py +2631 -2631
- package/md_cg/whitebox_kb/wisdom/causal_discover.py +432 -432
- package/md_cg/whitebox_kb/wisdom/chat_engine.py +1506 -1506
- package/md_cg/whitebox_kb/wisdom/compiler_code_units.py +3033 -3033
- package/md_cg/whitebox_kb/wisdom/condition_algebra.py +112 -112
- package/md_cg/whitebox_kb/wisdom/condition_frame.py +315 -315
- package/md_cg/whitebox_kb/wisdom/condition_kb.py +108 -108
- package/md_cg/whitebox_kb/wisdom/conflict_map.json +4445 -4445
- package/md_cg/whitebox_kb/wisdom/core/lexer.py +512 -512
- package/md_cg/whitebox_kb/wisdom/core/name_checker.py +1023 -1023
- package/md_cg/whitebox_kb/wisdom/cspmn.py +258 -258
- package/md_cg/whitebox_kb/wisdom/csre.py +264 -264
- package/md_cg/whitebox_kb/wisdom/danmaku_audit.py +252 -252
- package/md_cg/whitebox_kb/wisdom/distilled_condition_units.json +6417 -6417
- package/md_cg/whitebox_kb/wisdom/docs/WB-EVAL-20260902b.json +1950 -1950
- package/md_cg/whitebox_kb/wisdom/docs/WB-EVAL-20260902c.json +1296 -1296
- package/md_cg/whitebox_kb/wisdom/docs/whitebox_capability_graph_demo.json +59 -59
- package/md_cg/whitebox_kb/wisdom/graph_db_units.py +3089 -3089
- package/md_cg/whitebox_kb/wisdom/knowledge_points.py +318 -318
- package/md_cg/whitebox_kb/wisdom/md_access.py +470 -470
- package/md_cg/whitebox_kb/wisdom/md_store.py +276 -251
- package/md_cg/whitebox_kb/wisdom/migrate_wisdom.py +476 -476
- package/md_cg/whitebox_kb/wisdom/multilang_ir.py +128 -124
- package/md_cg/whitebox_kb/wisdom/navigate.py +248 -248
- package/md_cg/whitebox_kb/wisdom/neural_retrieve.py +224 -224
- package/md_cg/whitebox_kb/wisdom/os_units.py +2735 -2735
- package/md_cg/whitebox_kb/wisdom/pattern_separation.py +376 -376
- package/md_cg/whitebox_kb/wisdom/prereq_map.json +364 -364
- package/md_cg/whitebox_kb/wisdom/python_code_units.py +2766 -2766
- package/md_cg/whitebox_kb/wisdom/role_solidified.json +7 -7
- package/md_cg/whitebox_kb/wisdom/route_memory.py +244 -244
- package/md_cg/whitebox_kb/wisdom/scene_reconstruction.py +148 -148
- package/md_cg/whitebox_kb/wisdom/snr_report.json +40 -40
- package/md_cg/whitebox_kb/wisdom/test_code_compose_domains.py +7541 -7541
- package/md_cg/whitebox_kb/wisdom/test_compiler_self_bootstrap.py +354 -354
- package/md_cg/whitebox_kb/wisdom/test_ecosystem_assembly.py +158 -158
- package/md_cg/whitebox_kb/wisdom/test_ecosystem_demos.py +193 -193
- package/md_cg/whitebox_kb/wisdom/test_graph_db.py +292 -292
- package/md_cg/whitebox_kb/wisdom/test_python_self_bootstrap.py +160 -160
- package/md_cg/whitebox_kb/wisdom/trigger_words_index.json +4366 -4366
- package/md_cg/whitebox_kb/wisdom/verifier.py +1297 -1297
- package/md_cg/writelimit.py +356 -356
- package/md_cg/writepipe.py +20 -8
- package/package.json +101 -96
- package/skills/plugin.json +54 -54
- package/skills/skills/designer-perspective/SKILL.md +158 -158
- package/skills/skills/designer-perspective/references/01-observation-position.md +66 -66
- package/skills/skills/designer-perspective/references/02-structure-recognition.md +62 -62
- package/skills/skills/designer-perspective/references/03-direction-judgment.md +55 -55
- package/skills/skills/designer-perspective/references/04-qualification-verdict.md +72 -72
- package/skills/skills/designer-perspective/references/05-condition-attribution.md +74 -74
- package/skills/skills/designer-perspective/scripts/designer.py +545 -545
- package/skills/skills/designer-perspective/tests/cases.jsonl +17 -17
- package/skills/skills/designer-perspective/tests/selftest.py +61 -61
- package/skills/skills/lingshu-browser/SKILL.md +60 -60
- package/skills/skills/lingshu-compiler/SKILL.md +56 -56
- package/skills/skills/lingshu-compiler/units/analyze-type-infer/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/check-name-real/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-assign/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-expr-tree/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-full-pipeline/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-func-def/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-if-then/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-logic-expr/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-recursive/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-scope/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-type-check/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-while/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0010c4bf/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0355bffb/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0361708a/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-054a0414/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-05a1691a/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-05eeed1e/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0622a1f6/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-08b54217/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0a62b70c/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0ab24d00/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0e093688/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0e82b966/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0ee9b9b9/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0f3787e6/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-1028685f/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-11897630/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-16661b9b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-1f722303/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-25be1262/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-2a76ba07/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-2dbea54a/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-2df52f16/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-2ec2c9d2/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-2f8c8f39/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-38378ac7/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-39457d2e/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-39fb5926/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-47f4fbfa/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-4a8cd1f1/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-4b230b6b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-4cbbda95/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-4d5a68ff/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-56dc9bdd/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-57e76ebe/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-61ff016b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-63eae588/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-64c4224b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-66377955/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-674ab4f6/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-6af76fd6/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-6d979db2/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-6de326c0/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-6f1c0eea/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-724d6c9b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-7690177f/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-7b229a7d/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-7f471b3a/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-815cad08/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-83c61634/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-8c798c81/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-8dd747ac/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-90324d0a/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-94b8d72d/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-94f12231/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-95937c16/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-98a5625b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-98b4c42f/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-98e3894a/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-9bdfe4b8/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-9d9b4e83/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-9f7be5ad/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-a6daf076/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-a7995a0c/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-a8399248/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-aabbd099/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-afe169d8/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-b0678bda/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-b09bd196/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-b1396e23/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-b9b31ce0/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-c10264a7/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-cb1e8e4b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-ccafd438/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-cda9c262/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-ce648068/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-cf5776a4/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-d974e5d3/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-e3979fd3/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-eb1cf2b5/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-ecb30d5b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-f8c8b24b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-f99fedbe/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-fa8ff5f7/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-fe1b058d/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/lex-chinese-program/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/lex-dao-de-jing/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/lex-nine-chapters/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-arithmetic/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-array-ops/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-closure-call/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-closure-create/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-compare/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-cond-jump/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-cond-space/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-exception/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-func-call/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-loop-run/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-profiling/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-refcount/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-run-loop/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-short-circuit/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-stack-guard/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-stack-ops/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-trust-accum/SKILL.md +45 -45
- package/skills/skills/lingshu-graph/SKILL.md +63 -63
- package/skills/skills/lingshu-net/SKILL.md +48 -48
- package/skills/skills/lingshu-os/SKILL.md +64 -64
- package/skills/skills/lingshu-pylang/SKILL.md +71 -71
- package/src/bridge.ts +33 -0
- package/src/hooks.ts +38 -2
- package/src/index.ts +526 -518
- package/src/lib/datapath.ts +326 -326
- package/src/lib/mdcg_client.ts +413 -413
- package/src/lib/mutual.ts +428 -428
- package/src/lib/prompt_safety.ts +62 -62
- package/src/lib/python_path.ts +71 -71
- package/src/lib/roleplay_web.ts +116 -29
- package/src/lib/token_store.ts +13 -3
- package/src/tools.ts +212 -212
- package/zcode/AGENTS.md +11 -3
- package/zcode/README.md +41 -41
- /package/docs/{mdcg → hive}//344/270/273/344/273/243/347/220/206/345/255/220/344/273/243/347/220/206/350/256/260/345/277/206/346/236/266/346/236/204/350/256/276/350/256/241.md" +0 -0
package/md_cg/routing.py
CHANGED
|
@@ -1,366 +1,394 @@
|
|
|
1
|
-
# -*- coding: utf-8 -*-
|
|
2
|
-
"""md 认知图 · 路由键归一化(风险1)
|
|
3
|
-
|
|
4
|
-
普查结论(wisdom-book-cloud-new.db, 3048 节点):
|
|
5
|
-
- 原始 condition_space 四元组作分桶键 → 3037 桶 / 3048 节点,99.9% 单例桶。
|
|
6
|
-
根因:observation_position 实际格式是「<域> 知识点(<实例名>)」,把节点特有的
|
|
7
|
-
实例名嵌进了条件字段,3033 种取值 ≈ 唯一。按它分桶 = 一节点一桶,查询侧
|
|
8
|
-
构造不出精确匹配的情境 → 命中率≈0,召回归零(比退化成全量更糟)。
|
|
9
|
-
- observation_tool(93% 集中) / existence_constraint(95% 集中) 去掉 position 后
|
|
10
|
-
塌缩成单个巨桶。
|
|
11
|
-
- time_window 实测仅 3 种取值,进哈希键是纯噪声。
|
|
12
|
-
- tags 的 domain: 标签 → 95 桶 / 最大桶 5.4% / 期望扫描 1.8%,是唯一健康的键。
|
|
13
|
-
|
|
14
|
-
因此路由键 = 归一化提取的「域」,而非四元组哈希。写入侧与查询侧共用本模块,
|
|
15
|
-
保证两侧同构(风险2 的前提:查询构造的键必须与写入键落在同一空间)。
|
|
16
|
-
"""
|
|
17
|
-
import math
|
|
18
|
-
import re
|
|
19
|
-
import hashlib
|
|
20
|
-
import unicodedata
|
|
21
|
-
|
|
22
|
-
# observation_position 的实例名尾巴:「知识点(xxx)」「概念(xxx)」等
|
|
23
|
-
_INSTANCE_TAIL = re.compile(
|
|
24
|
-
r"\s*(知识点|概念|条目|卡片|节点|规律|定理|公式)\s*[((].*?[))]\s*$"
|
|
25
|
-
)
|
|
26
|
-
# 骨架填充类后缀:「高中物理知识点内容(按骨架填充)」→「高中物理」
|
|
27
|
-
_SKELETON_TAIL = re.compile(r"(知识点)?内容\s*[((]按骨架填充[))]\s*$")
|
|
28
|
-
|
|
29
|
-
ORPHAN = "orphan"
|
|
30
|
-
|
|
31
|
-
|
|
32
|
-
# 生效条件:raw 为真值时按 NFKC 归一化并 strip,最多 3 轮剥离 _INSTANCE_TAIL(无变化即停)、再剥 _SKELETON_TAIL、空白转下划线后返回;raw 为假值(None/空串)或处理后为空串时返回 ORPHAN。
|
|
33
|
-
def normalize_domain(raw: str) -> str:
|
|
34
|
-
"""把自由文本的域描述归一化成稳定的短键。
|
|
35
|
-
|
|
36
|
-
「工程学 知识点(内力与截面法)」 → 工程学
|
|
37
|
-
「高中物理知识点内容(按骨架填充)」 → 高中物理
|
|
38
|
-
「数学分析知识点内容(按骨架填充) 知识点(贝塞尔不等式)」 → 数学分析
|
|
39
|
-
"""
|
|
40
|
-
if not raw:
|
|
41
|
-
return ORPHAN
|
|
42
|
-
s = unicodedata.normalize("NFKC", str(raw)).strip()
|
|
43
|
-
# 反复剥离实例名尾巴(可能叠加两层,见上面第三个例子)
|
|
44
|
-
for _ in range(3):
|
|
45
|
-
new = _INSTANCE_TAIL.sub("", s)
|
|
46
|
-
if new == s:
|
|
47
|
-
break
|
|
48
|
-
s = new.strip()
|
|
49
|
-
s = _SKELETON_TAIL.sub("", s).strip()
|
|
50
|
-
s = re.sub(r"\s+", "_", s)
|
|
51
|
-
return s or ORPHAN
|
|
52
|
-
|
|
53
|
-
|
|
54
|
-
# 生效条件:tags 为真值时取其中首个 str(t) 以 "domain:" 开头的项,返回其前缀后内容的 normalize_domain 结果;无此标签且 condition_space 为真值时返回 normalize_domain(condition_space.get("observation_position"))(缺键即 None 归一为 ORPHAN);tags 为假值且 condition_space 为假值时返回 ORPHAN。
|
|
55
|
-
def route_key(condition_space: dict = None, tags=None) -> str:
|
|
56
|
-
"""导出条件路由键。优先级:tags 的 domain: > observation_position 归一化 > orphan。
|
|
57
|
-
|
|
58
|
-
domain: 标签是显式声明的域,普查证明它分布最健康(95 桶/最大桶 5.4%),
|
|
59
|
-
所以优先。没有标签时才回退到从 observation_position 提取。
|
|
60
|
-
"""
|
|
61
|
-
for t in tags or []:
|
|
62
|
-
t = str(t)
|
|
63
|
-
if t.startswith("domain:"):
|
|
64
|
-
return normalize_domain(t[len("domain:"):])
|
|
65
|
-
if condition_space:
|
|
66
|
-
return normalize_domain(condition_space.get("observation_position"))
|
|
67
|
-
return ORPHAN
|
|
68
|
-
|
|
69
|
-
|
|
70
|
-
# 生效条件:key 等于 ORPHAN 时原样返回 ORPHAN;否则返回 "cond_" + 把 key 中非[\w中文-]字符替换为下划线并截前 24 字符的串 + "_" + key 的 sha256(utf-8)前 8 位十六进制。
|
|
71
|
-
def bucket_dir(key: str) -> str:
|
|
72
|
-
"""路由键 → 目录名。中文键保留可读前缀 + 短哈希,避免文件系统非法字符/超长。"""
|
|
73
|
-
if key == ORPHAN:
|
|
74
|
-
return ORPHAN
|
|
75
|
-
safe = re.sub(r"[^\w\u4e00-\u9fff-]", "_", key)[:24]
|
|
76
|
-
h = hashlib.sha256(key.encode("utf-8")).hexdigest()[:8]
|
|
77
|
-
return f"cond_{safe}_{h}"
|
|
78
|
-
|
|
79
|
-
|
|
80
|
-
# 14 大域代表词表(白箱第 2 篇第 5 章 + 第 3 篇第 4 章:「56 学科卡 → 14 大域
|
|
81
|
-
# → 域内 KCCS」两阶段并行收敛。本表用作阶段 1 的大域并行打分依据——
|
|
82
|
-
# 当 query 没有显式 context 但 query 词能落进某个大域时,先收敛到大域再查。
|
|
83
|
-
#
|
|
84
|
-
# 词的选取原则:覆盖白箱工程文档里出现的高频学科关键词,且不互相吞并。
|
|
85
|
-
# 同一个词可以出现在多个大域(如「公式」在数学与物理都常见),这是合理的:
|
|
86
|
-
# 大域并行打分阶段就是让多域同分,再由阶段 2 的 KCCS 进一步区分。
|
|
87
|
-
BIG_DOMAINS = {
|
|
88
|
-
"数学": {"数学", "算术", "几何", "代数", "微积分", "概率", "统计", "集合", "矩阵",
|
|
89
|
-
"线性", "拓扑", "数论", "公式", "定理", "证明", "函数", "导数", "积分",
|
|
90
|
-
"极限", "方程", "不等式", "贝塞尔", "二分", "素数", "微元"},
|
|
91
|
-
"物理": {"物理", "力学", "电磁", "光学", "热学", "量子", "相对论", "能量", "动量",
|
|
92
|
-
"质量", "速度", "加速度", "电荷", "电压", "电流", "沸点", "海拔",
|
|
93
|
-
"大气压", "压强", "温度", "牛顿", "惯性", "引力"},
|
|
94
|
-
"化学": {"化学", "元素", "分子", "原子", "化合物", "反应", "酸", "碱", "盐",
|
|
95
|
-
"氧化", "还原", "有机", "无机", "离子", "键", "浓度", "溶液"},
|
|
96
|
-
"生物": {"生物", "细胞", "基因", "蛋白质", "酶", "光合", "呼吸", "植物", "动物",
|
|
97
|
-
"进化", "免疫", "神经", "细菌", "病毒", "代谢", "染色", "分裂"},
|
|
98
|
-
"计算机": {"计算机", "算法", "数据结构", "编程", "代码", "软件", "网络", "数据库",
|
|
99
|
-
"系统", "排序", "递归", "图论", "哈希", "索引", "查询", "排序", "锁",
|
|
100
|
-
"事务", "内存", "进程", "线程"},
|
|
101
|
-
"语言": {"语言", "中文", "英文", "语法", "词汇", "语义", "修辞", "文学", "写作",
|
|
102
|
-
"阅读", "拼音", "字", "词", "句"},
|
|
103
|
-
"历史": {"历史", "朝代", "战争", "文明", "政治", "经济史", "文化史", "古代",
|
|
104
|
-
"近代", "现代", "王朝", "革命", "改革"},
|
|
105
|
-
"地理": {"地理", "地形", "气候", "人口", "城市", "国家", "地图", "板块",
|
|
106
|
-
"洋流", "经度", "纬度", "海拔带", "流域"},
|
|
107
|
-
"艺术": {"艺术", "绘画", "音乐", "雕塑", "电影", "设计", "色彩", "构图",
|
|
108
|
-
"旋律", "节奏", "摄影"},
|
|
109
|
-
"经济": {"经济", "市场", "金融", "货币", "投资", "股票", "债券", "GDP",
|
|
110
|
-
"通胀", "财政", "税收", "供需"},
|
|
111
|
-
"心理": {"心理", "认知", "情感", "记忆", "学习", "性格", "行为", "意识",
|
|
112
|
-
"动机", "人格", "焦虑"},
|
|
113
|
-
"医学": {"医学", "疾病", "治疗", "药物", "诊断", "外科", "内科", "儿科",
|
|
114
|
-
"中医", "症状", "病理", "处方"},
|
|
115
|
-
"工程": {"工程", "建筑", "结构", "材料", "机械", "电子", "土木", "桥梁",
|
|
116
|
-
"内力", "截面", "梁", "柱", "应力"},
|
|
117
|
-
"通用": {"常识", "生活", "日常", "通用", "礼仪", "礼貌", "文明", "规则"},
|
|
118
|
-
}
|
|
119
|
-
|
|
120
|
-
|
|
121
|
-
# 生效条件:terms 为真值时对 BIG_DOMAINS 每个大域统计命中词数,最高分为 0 或 terms 为假值(None/空)时返回 None,否则返回最高分大域名(并列取 BIG_DOMAINS 迭代序首个最高分)。
|
|
122
|
-
def big_domain_classify(terms) -> str | None:
|
|
123
|
-
"""阶段 1:14 大域并行打分 → 收敛到 top-1。
|
|
124
|
-
|
|
125
|
-
terms 是 expand_query_terms 返回的扩展词集合。
|
|
126
|
-
大域打分 = query 词命中大域代表词的次数(多词同域累加)。
|
|
127
|
-
并行在认知结构意义上:即使底层串行计算,14 个大域同时独立评估。
|
|
128
|
-
|
|
129
|
-
返回最匹配的大域名(多个 0 分 → 返回 None,走原 bucket_dir 路由)。
|
|
130
|
-
"""
|
|
131
|
-
if not terms:
|
|
132
|
-
return None
|
|
133
|
-
scores = {}
|
|
134
|
-
for d, vocab in BIG_DOMAINS.items():
|
|
135
|
-
scores[d] = sum(1 for t in terms
|
|
136
|
-
if any(w in t or t in w for w in vocab))
|
|
137
|
-
best = max(scores.items(), key=lambda x: x[1])
|
|
138
|
-
if best[1] == 0:
|
|
139
|
-
return None
|
|
140
|
-
# 多大域并列最高分时,按字典序取第一个稳定结果(避免浮点不确定)
|
|
141
|
-
return best[0]
|
|
142
|
-
|
|
143
|
-
|
|
144
|
-
# 生效条件:terms 为假值(None/空)时返回 {每个 BIG_DOMAINS 域: 0};terms 为真值时返回 {大域: 该域词表命中 terms 中词的个数}。
|
|
145
|
-
def big_domain_score_breakdown(terms) -> dict:
|
|
146
|
-
"""暴露打分明细,便于审计与回归测试。"""
|
|
147
|
-
if not terms:
|
|
148
|
-
return {d: 0 for d in BIG_DOMAINS}
|
|
149
|
-
return {d: sum(1 for t in terms if any(w in t or t in w for w in vocab))
|
|
150
|
-
for d, vocab in BIG_DOMAINS.items()}
|
|
151
|
-
|
|
152
|
-
|
|
153
|
-
# ---------------------------------------------------------------------------
|
|
154
|
-
# 分级隶属度(模糊控制「隶属函数」的手写版)
|
|
155
|
-
#
|
|
156
|
-
# 上面的 big_domain_classify 是二值控制:`w in t or t in w` 命中即计 1。
|
|
157
|
-
# 下面是同一套规则库的**分级**版本——命中程度是 0~1 的连续值,并乘 IDF:
|
|
158
|
-
# · 隶属度 membership(t, w):完全相同 1.0;包含关系取长度比(覆盖越全越高)
|
|
159
|
-
# · IDF:一个代表词覆盖的大域越少,区分度越高(「贝塞尔」只在数学出现,
|
|
160
|
-
# 权重高于「公式」这种跨域通用词)
|
|
161
|
-
# 老函数保持不动 → P0/P1 基线可比性不受影响;新函数只供新路径(fuzzy)使用。
|
|
162
|
-
# ---------------------------------------------------------------------------
|
|
163
|
-
|
|
164
|
-
# 生效条件:term 或 word 为假值(None/空串)返回 0.0;相等返回 1.0;word 是 term 子串返回 len(word)/len(term);term 是 word 子串返回 len(term)/len(word);二者无包含关系返回 0.0。
|
|
165
|
-
def membership(term: str, word: str) -> float:
|
|
166
|
-
"""词 term 对代表词 word 的隶属度(0.0~1.0,越接近 1 越隶属)。
|
|
167
|
-
|
|
168
|
-
完全相同 → 1.0
|
|
169
|
-
term 包含 word → len(word)/len(term)(覆盖越全越隶属)
|
|
170
|
-
word 包含 term → len(term)/len(word)
|
|
171
|
-
无包含关系 → 0.0
|
|
172
|
-
"""
|
|
173
|
-
if not term or not word:
|
|
174
|
-
return 0.0
|
|
175
|
-
if term == word:
|
|
176
|
-
return 1.0
|
|
177
|
-
if word in term:
|
|
178
|
-
return len(word) / len(term)
|
|
179
|
-
if term in word:
|
|
180
|
-
return len(term) / len(word)
|
|
181
|
-
return 0.0
|
|
182
|
-
|
|
183
|
-
|
|
184
|
-
# 生效条件:无入参,恒遍历模块级常量 BIG_DOMAINS 的各域代表词表,返回 {代表词: 包含该词的域个数}。
|
|
185
|
-
def _build_domain_df() -> dict:
|
|
186
|
-
"""代表词 → 覆盖它的大域数(IDF 的分母)。"""
|
|
187
|
-
df = {}
|
|
188
|
-
for vocab in BIG_DOMAINS.values():
|
|
189
|
-
for w in vocab:
|
|
190
|
-
df[w] = df.get(w, 0) + 1
|
|
191
|
-
return df
|
|
192
|
-
|
|
193
|
-
|
|
194
|
-
_DOMAIN_DF = _build_domain_df()
|
|
195
|
-
|
|
196
|
-
|
|
197
|
-
# 生效条件:恒返回 math.log(1.0 + len(BIG_DOMAINS) / _DOMAIN_DF.get(word, 1)),即 word 在 _DOMAIN_DF 中取其覆盖域数,缺键(含任何未登记值)时按 _DOMAIN_DF.get 的默认 1 代入。
|
|
198
|
-
def domain_idf(word: str) -> float:
|
|
199
|
-
"""代表词的区分度权重:log(1 + 大域总数 / 覆盖它的大域数)。
|
|
200
|
-
|
|
201
|
-
只在一个大域出现的词(如「贝塞尔」)≈ log(15)=2.71;
|
|
202
|
-
14 个大域都出现的词(如「公式」)≈ log(2)=0.69。
|
|
203
|
-
"""
|
|
204
|
-
return math.log(1.0 + len(BIG_DOMAINS) / _DOMAIN_DF.get(word, 1))
|
|
205
|
-
|
|
206
|
-
|
|
207
|
-
# 生效条件:terms 是 dict 时以其条目(键 str(t) 以 "__" 开头者剔除、值为 float)为词权重并忽略 weights,否则以 wmap.get(t, 1.0) 为权重(weights 为假值即 None/空 dict 时 wmap 为空、全部权重取 1.0,terms 为假值则词集为空);逐域累加「词权重 × 该词在域词表内最大(membership × domain_idf)」,权重 <=0 的词跳过,返回 {大域: round(得分, 6)}。
|
|
208
|
-
def big_domain_score_weighted(terms, weights=None) -> dict:
|
|
209
|
-
"""阶段 1(分级版):14 大域并行打分,按「隶属度 × IDF」加权。
|
|
210
|
-
|
|
211
|
-
terms: 可迭代的词集合,或 {词: 权重}(expand_query_terms_weighted 的输出,
|
|
212
|
-
调用方需先剔除 "__source__" 等元数据键)。
|
|
213
|
-
weights: terms 为可迭代时的可选权重表;terms 已是 dict 时忽略。
|
|
214
|
-
返回 {大域: 得分},得分不再是整数计数,而是连续值。
|
|
215
|
-
"""
|
|
216
|
-
if isinstance(terms, dict):
|
|
217
|
-
tw = {str(t): float(w) for t, w in terms.items()
|
|
218
|
-
if not str(t).startswith("__")}
|
|
219
|
-
else:
|
|
220
|
-
wmap = weights or {}
|
|
221
|
-
tw = {str(t): float(wmap.get(t, 1.0)) for t in (terms or [])}
|
|
222
|
-
out = {}
|
|
223
|
-
for d, vocab in BIG_DOMAINS.items():
|
|
224
|
-
s = 0.0
|
|
225
|
-
for t, tw_ in tw.items():
|
|
226
|
-
if tw_ <= 0:
|
|
227
|
-
continue
|
|
228
|
-
best = 0.0
|
|
229
|
-
for w in vocab:
|
|
230
|
-
m = membership(t, w)
|
|
231
|
-
if m > 0.0:
|
|
232
|
-
best = max(best, m * domain_idf(w))
|
|
233
|
-
s += tw_ * best
|
|
234
|
-
out[d] = round(s, 6)
|
|
235
|
-
return out
|
|
236
|
-
|
|
237
|
-
|
|
238
|
-
# 生效条件:以 terms、weights 计算各域加权得分(terms 为假值时各域均为 0.0),得分为空或最高分 <= min_score(默认 0.0)时返回 None,否则返回最高分大域名。
|
|
239
|
-
def big_domain_classify_weighted(terms, weights=None, min_score: float = 0.0):
|
|
240
|
-
"""阶段 1(分级版)收敛到 top-1;全部低于 min_score → None。"""
|
|
241
|
-
scores = big_domain_score_weighted(terms, weights)
|
|
242
|
-
if not scores:
|
|
243
|
-
return None
|
|
244
|
-
best = max(scores.items(), key=lambda kv: kv[1])
|
|
245
|
-
if best[1] <= min_score:
|
|
246
|
-
return None
|
|
247
|
-
return best[0]
|
|
248
|
-
|
|
249
|
-
|
|
250
|
-
# 生效条件:a 或 b 为假值(None/空串)返回 0.0;相等返回 1.0;a 是 b 子串返回 len(a)/len(b);b 是 a 子串返回 len(b)/len(a);否则按二者二元组字符集合的 Jaccard 返回 len(ga & gb)/len(ga | gb),任一集合为空(如单字符键)时返回 0.0。
|
|
251
|
-
def domain_similarity(a: str, b: str) -> float:
|
|
252
|
-
"""两个归一化域键的相似度(0~1):相同 1.0;包含取长度比;否则二元组 Jaccard。
|
|
253
|
-
|
|
254
|
-
「计算机科学」vs「计算机」→ 0.6(包含);「高中物理」vs「物理」→ 0.5;
|
|
255
|
-
完全无关 → 0.0。用于 fuzzy 路径的「大域亲和」打分。
|
|
256
|
-
"""
|
|
257
|
-
if not a or not b:
|
|
258
|
-
return 0.0
|
|
259
|
-
if a == b:
|
|
260
|
-
return 1.0
|
|
261
|
-
if a in b:
|
|
262
|
-
return len(a) / len(b)
|
|
263
|
-
if b in a:
|
|
264
|
-
return len(b) / len(a)
|
|
265
|
-
ga = {a[i:i + 2] for i in range(len(a) - 1)}
|
|
266
|
-
gb = {b[i:i + 2] for i in range(len(b) - 1)}
|
|
267
|
-
if not ga or not gb:
|
|
268
|
-
return 0.0
|
|
269
|
-
return len(ga & gb) / len(ga | gb)
|
|
270
|
-
|
|
271
|
-
|
|
272
|
-
# 生效条件:counts 各值之和为 0(含空 dict 与全 0 计数)时返回 {'ok': True, 'reason': 'empty', 'buckets': 0};否则在最大桶占比 >30%、桶数 >1 且单例桶占比 >50%、期望扫描 >30% 中命中的项写入 problems,返回含 ok(=problems 为空)、buckets、nodes、max_bucket_share、singleton_ratio、expected_scan、problems 的 dict。
|
|
273
|
-
def bucket_health(counts: dict) -> dict:
|
|
274
|
-
"""分区健康度自检。分桶键一旦退化(巨桶或碎片化),条件路由就是纸面收益,
|
|
275
|
-
必须在写入侧就能发现,而不是等召回变差才回头查。
|
|
276
|
-
|
|
277
|
-
counts: {bucket_dir: node_count}
|
|
278
|
-
"""
|
|
279
|
-
n = sum(counts.values())
|
|
280
|
-
if not n:
|
|
281
|
-
return {"ok": True, "reason": "empty", "buckets": 0}
|
|
282
|
-
nb = len(counts)
|
|
283
|
-
top = max(counts.values())
|
|
284
|
-
singles = sum(1 for v in counts.values() if v == 1)
|
|
285
|
-
# 期望扫描占比:随机取一节点的情境去路由,命中桶的期望大小占全库比例
|
|
286
|
-
expected_scan = sum(v * v for v in counts.values()) / n / n
|
|
287
|
-
problems = []
|
|
288
|
-
if top / n > 0.30:
|
|
289
|
-
problems.append(f"巨桶:最大桶占 {top / n:.1%}(>30% 视为分区失效)")
|
|
290
|
-
if nb > 1 and singles / nb > 0.50:
|
|
291
|
-
problems.append(f"碎片化:单例桶占 {singles / nb:.1%}(>50% 说明键含实例级字段)")
|
|
292
|
-
if expected_scan > 0.30:
|
|
293
|
-
problems.append(f"路由无效:期望扫描 {expected_scan:.1%}(接近全量)")
|
|
294
|
-
return {
|
|
295
|
-
"ok": not problems,
|
|
296
|
-
"buckets": nb,
|
|
297
|
-
"nodes": n,
|
|
298
|
-
"max_bucket_share": top / n,
|
|
299
|
-
"singleton_ratio": singles / nb if nb else 0.0,
|
|
300
|
-
"expected_scan": expected_scan,
|
|
301
|
-
"problems": problems,
|
|
302
|
-
}
|
|
303
|
-
|
|
304
|
-
|
|
305
|
-
# ---------------------------------------------------------------------------
|
|
306
|
-
# 节点侧大域标签(S1 大域先验收敛的前置元数据)
|
|
307
|
-
#
|
|
308
|
-
# 为何需要:`big_domain_classify` 一直只作用于 **query 侧**(terms),节点侧没有域字段,
|
|
309
|
-
# 于是「14 大域并行打分」算完只能写进 meta(审计偏差 4:先验算出来却当成报告)。
|
|
310
|
-
# 要让大域先验真正参与候选收敛,节点必须在写入时固化自己的域。
|
|
311
|
-
# 口径:与查询侧同一个分类器(BIG_DOMAINS + big_domain_classify),保证两侧同构。
|
|
312
|
-
# ---------------------------------------------------------------------------
|
|
313
|
-
|
|
314
|
-
# 域词取词:中文(≥2 字)与拉丁词(≥2 字)。词表命中用「包含关系」判定,
|
|
315
|
-
# 故 2 字以上的切口足以覆盖 1~4 字代表词(如「工程」命中「工程师」)。
|
|
316
|
-
DOMAIN_TERM_RE = re.compile(r"[\u4e00-\u9fff]{2,}|[A-Za-z][A-Za-z0-9_]{1,}")
|
|
317
|
-
|
|
318
|
-
|
|
319
|
-
# 生效条件:text 为假值(None/空串)时返回 [];否则以 DOMAIN_TERM_RE 取词、按出现顺序去重后返回,
|
|
320
|
-
# 最多 limit 个(limit 为假值/负数时按空处理,返回 [])。
|
|
321
|
-
def domain_terms(text, limit: int = 400) -> list:
|
|
322
|
-
"""从节点正文/标题抽「域词」(供 big_domain_classify 使用)。
|
|
323
|
-
|
|
324
|
-
只做最小分词:中文按 ≥2 字连续片段、拉丁按 [A-Za-z][A-Za-z0-9_]+ 取词;
|
|
325
|
-
去重保序,最多 limit 个(默认 400,避免长文把分类器拖慢)。
|
|
326
|
-
"""
|
|
327
|
-
if not text or not limit or limit < 1:
|
|
328
|
-
return []
|
|
329
|
-
out, seen = [], set()
|
|
330
|
-
for m in DOMAIN_TERM_RE.finditer(str(text)):
|
|
331
|
-
w = m.group(0)
|
|
332
|
-
if w in seen:
|
|
333
|
-
continue
|
|
334
|
-
seen.add(w)
|
|
335
|
-
out.append(w)
|
|
336
|
-
if len(out) >= limit:
|
|
337
|
-
break
|
|
338
|
-
return out
|
|
339
|
-
|
|
340
|
-
|
|
341
|
-
# 生效条件:bucket 为假值或等于 ORPHAN 时返回空串;否则去掉 "cond_" 前缀、并当末段为 8 位十六进制哈希时剥掉该段,返回剩余的可读键。
|
|
342
|
-
def bucket_key_readable(bucket: str) -> str:
|
|
343
|
-
"""桶目录名 → 可读键(S1b query 侧桶推断用):'cond_感知系统_d94e90d2' → '感知系统'。
|
|
344
|
-
|
|
345
|
-
与 `bucket_dir` 互逆(丢哈希段);`orphan`/空值返回空串(S1b 不把 orphan 当键,orphan 恒作兜底)。
|
|
346
|
-
"""
|
|
347
|
-
if not bucket or bucket == ORPHAN:
|
|
348
|
-
return ""
|
|
349
|
-
s = str(bucket)
|
|
350
|
-
if s.startswith("cond_"):
|
|
351
|
-
s = s[len("cond_"):]
|
|
352
|
-
head, sep, tail = s.rpartition("_")
|
|
353
|
-
if sep and len(tail) == 8 and all(c in "0123456789abcdef" for c in tail):
|
|
354
|
-
s = head
|
|
355
|
-
return s
|
|
356
|
-
|
|
357
|
-
|
|
358
|
-
#
|
|
359
|
-
|
|
360
|
-
|
|
361
|
-
|
|
362
|
-
|
|
363
|
-
|
|
364
|
-
|
|
365
|
-
|
|
1
|
+
# -*- coding: utf-8 -*-
|
|
2
|
+
"""md 认知图 · 路由键归一化(风险1)
|
|
3
|
+
|
|
4
|
+
普查结论(wisdom-book-cloud-new.db, 3048 节点):
|
|
5
|
+
- 原始 condition_space 四元组作分桶键 → 3037 桶 / 3048 节点,99.9% 单例桶。
|
|
6
|
+
根因:observation_position 实际格式是「<域> 知识点(<实例名>)」,把节点特有的
|
|
7
|
+
实例名嵌进了条件字段,3033 种取值 ≈ 唯一。按它分桶 = 一节点一桶,查询侧
|
|
8
|
+
构造不出精确匹配的情境 → 命中率≈0,召回归零(比退化成全量更糟)。
|
|
9
|
+
- observation_tool(93% 集中) / existence_constraint(95% 集中) 去掉 position 后
|
|
10
|
+
塌缩成单个巨桶。
|
|
11
|
+
- time_window 实测仅 3 种取值,进哈希键是纯噪声。
|
|
12
|
+
- tags 的 domain: 标签 → 95 桶 / 最大桶 5.4% / 期望扫描 1.8%,是唯一健康的键。
|
|
13
|
+
|
|
14
|
+
因此路由键 = 归一化提取的「域」,而非四元组哈希。写入侧与查询侧共用本模块,
|
|
15
|
+
保证两侧同构(风险2 的前提:查询构造的键必须与写入键落在同一空间)。
|
|
16
|
+
"""
|
|
17
|
+
import math
|
|
18
|
+
import re
|
|
19
|
+
import hashlib
|
|
20
|
+
import unicodedata
|
|
21
|
+
|
|
22
|
+
# observation_position 的实例名尾巴:「知识点(xxx)」「概念(xxx)」等
|
|
23
|
+
_INSTANCE_TAIL = re.compile(
|
|
24
|
+
r"\s*(知识点|概念|条目|卡片|节点|规律|定理|公式)\s*[((].*?[))]\s*$"
|
|
25
|
+
)
|
|
26
|
+
# 骨架填充类后缀:「高中物理知识点内容(按骨架填充)」→「高中物理」
|
|
27
|
+
_SKELETON_TAIL = re.compile(r"(知识点)?内容\s*[((]按骨架填充[))]\s*$")
|
|
28
|
+
|
|
29
|
+
ORPHAN = "orphan"
|
|
30
|
+
|
|
31
|
+
|
|
32
|
+
# 生效条件:raw 为真值时按 NFKC 归一化并 strip,最多 3 轮剥离 _INSTANCE_TAIL(无变化即停)、再剥 _SKELETON_TAIL、空白转下划线后返回;raw 为假值(None/空串)或处理后为空串时返回 ORPHAN。
|
|
33
|
+
def normalize_domain(raw: str) -> str:
|
|
34
|
+
"""把自由文本的域描述归一化成稳定的短键。
|
|
35
|
+
|
|
36
|
+
「工程学 知识点(内力与截面法)」 → 工程学
|
|
37
|
+
「高中物理知识点内容(按骨架填充)」 → 高中物理
|
|
38
|
+
「数学分析知识点内容(按骨架填充) 知识点(贝塞尔不等式)」 → 数学分析
|
|
39
|
+
"""
|
|
40
|
+
if not raw:
|
|
41
|
+
return ORPHAN
|
|
42
|
+
s = unicodedata.normalize("NFKC", str(raw)).strip()
|
|
43
|
+
# 反复剥离实例名尾巴(可能叠加两层,见上面第三个例子)
|
|
44
|
+
for _ in range(3):
|
|
45
|
+
new = _INSTANCE_TAIL.sub("", s)
|
|
46
|
+
if new == s:
|
|
47
|
+
break
|
|
48
|
+
s = new.strip()
|
|
49
|
+
s = _SKELETON_TAIL.sub("", s).strip()
|
|
50
|
+
s = re.sub(r"\s+", "_", s)
|
|
51
|
+
return s or ORPHAN
|
|
52
|
+
|
|
53
|
+
|
|
54
|
+
# 生效条件:tags 为真值时取其中首个 str(t) 以 "domain:" 开头的项,返回其前缀后内容的 normalize_domain 结果;无此标签且 condition_space 为真值时返回 normalize_domain(condition_space.get("observation_position"))(缺键即 None 归一为 ORPHAN);tags 为假值且 condition_space 为假值时返回 ORPHAN。
|
|
55
|
+
def route_key(condition_space: dict = None, tags=None) -> str:
|
|
56
|
+
"""导出条件路由键。优先级:tags 的 domain: > observation_position 归一化 > orphan。
|
|
57
|
+
|
|
58
|
+
domain: 标签是显式声明的域,普查证明它分布最健康(95 桶/最大桶 5.4%),
|
|
59
|
+
所以优先。没有标签时才回退到从 observation_position 提取。
|
|
60
|
+
"""
|
|
61
|
+
for t in tags or []:
|
|
62
|
+
t = str(t)
|
|
63
|
+
if t.startswith("domain:"):
|
|
64
|
+
return normalize_domain(t[len("domain:"):])
|
|
65
|
+
if condition_space:
|
|
66
|
+
return normalize_domain(condition_space.get("observation_position"))
|
|
67
|
+
return ORPHAN
|
|
68
|
+
|
|
69
|
+
|
|
70
|
+
# 生效条件:key 等于 ORPHAN 时原样返回 ORPHAN;否则返回 "cond_" + 把 key 中非[\w中文-]字符替换为下划线并截前 24 字符的串 + "_" + key 的 sha256(utf-8)前 8 位十六进制。
|
|
71
|
+
def bucket_dir(key: str) -> str:
|
|
72
|
+
"""路由键 → 目录名。中文键保留可读前缀 + 短哈希,避免文件系统非法字符/超长。"""
|
|
73
|
+
if key == ORPHAN:
|
|
74
|
+
return ORPHAN
|
|
75
|
+
safe = re.sub(r"[^\w\u4e00-\u9fff-]", "_", key)[:24]
|
|
76
|
+
h = hashlib.sha256(key.encode("utf-8")).hexdigest()[:8]
|
|
77
|
+
return f"cond_{safe}_{h}"
|
|
78
|
+
|
|
79
|
+
|
|
80
|
+
# 14 大域代表词表(白箱第 2 篇第 5 章 + 第 3 篇第 4 章:「56 学科卡 → 14 大域
|
|
81
|
+
# → 域内 KCCS」两阶段并行收敛。本表用作阶段 1 的大域并行打分依据——
|
|
82
|
+
# 当 query 没有显式 context 但 query 词能落进某个大域时,先收敛到大域再查。
|
|
83
|
+
#
|
|
84
|
+
# 词的选取原则:覆盖白箱工程文档里出现的高频学科关键词,且不互相吞并。
|
|
85
|
+
# 同一个词可以出现在多个大域(如「公式」在数学与物理都常见),这是合理的:
|
|
86
|
+
# 大域并行打分阶段就是让多域同分,再由阶段 2 的 KCCS 进一步区分。
|
|
87
|
+
BIG_DOMAINS = {
|
|
88
|
+
"数学": {"数学", "算术", "几何", "代数", "微积分", "概率", "统计", "集合", "矩阵",
|
|
89
|
+
"线性", "拓扑", "数论", "公式", "定理", "证明", "函数", "导数", "积分",
|
|
90
|
+
"极限", "方程", "不等式", "贝塞尔", "二分", "素数", "微元"},
|
|
91
|
+
"物理": {"物理", "力学", "电磁", "光学", "热学", "量子", "相对论", "能量", "动量",
|
|
92
|
+
"质量", "速度", "加速度", "电荷", "电压", "电流", "沸点", "海拔",
|
|
93
|
+
"大气压", "压强", "温度", "牛顿", "惯性", "引力"},
|
|
94
|
+
"化学": {"化学", "元素", "分子", "原子", "化合物", "反应", "酸", "碱", "盐",
|
|
95
|
+
"氧化", "还原", "有机", "无机", "离子", "键", "浓度", "溶液"},
|
|
96
|
+
"生物": {"生物", "细胞", "基因", "蛋白质", "酶", "光合", "呼吸", "植物", "动物",
|
|
97
|
+
"进化", "免疫", "神经", "细菌", "病毒", "代谢", "染色", "分裂"},
|
|
98
|
+
"计算机": {"计算机", "算法", "数据结构", "编程", "代码", "软件", "网络", "数据库",
|
|
99
|
+
"系统", "排序", "递归", "图论", "哈希", "索引", "查询", "排序", "锁",
|
|
100
|
+
"事务", "内存", "进程", "线程"},
|
|
101
|
+
"语言": {"语言", "中文", "英文", "语法", "词汇", "语义", "修辞", "文学", "写作",
|
|
102
|
+
"阅读", "拼音", "字", "词", "句"},
|
|
103
|
+
"历史": {"历史", "朝代", "战争", "文明", "政治", "经济史", "文化史", "古代",
|
|
104
|
+
"近代", "现代", "王朝", "革命", "改革"},
|
|
105
|
+
"地理": {"地理", "地形", "气候", "人口", "城市", "国家", "地图", "板块",
|
|
106
|
+
"洋流", "经度", "纬度", "海拔带", "流域"},
|
|
107
|
+
"艺术": {"艺术", "绘画", "音乐", "雕塑", "电影", "设计", "色彩", "构图",
|
|
108
|
+
"旋律", "节奏", "摄影"},
|
|
109
|
+
"经济": {"经济", "市场", "金融", "货币", "投资", "股票", "债券", "GDP",
|
|
110
|
+
"通胀", "财政", "税收", "供需"},
|
|
111
|
+
"心理": {"心理", "认知", "情感", "记忆", "学习", "性格", "行为", "意识",
|
|
112
|
+
"动机", "人格", "焦虑"},
|
|
113
|
+
"医学": {"医学", "疾病", "治疗", "药物", "诊断", "外科", "内科", "儿科",
|
|
114
|
+
"中医", "症状", "病理", "处方"},
|
|
115
|
+
"工程": {"工程", "建筑", "结构", "材料", "机械", "电子", "土木", "桥梁",
|
|
116
|
+
"内力", "截面", "梁", "柱", "应力"},
|
|
117
|
+
"通用": {"常识", "生活", "日常", "通用", "礼仪", "礼貌", "文明", "规则"},
|
|
118
|
+
}
|
|
119
|
+
|
|
120
|
+
|
|
121
|
+
# 生效条件:terms 为真值时对 BIG_DOMAINS 每个大域统计命中词数,最高分为 0 或 terms 为假值(None/空)时返回 None,否则返回最高分大域名(并列取 BIG_DOMAINS 迭代序首个最高分)。
|
|
122
|
+
def big_domain_classify(terms) -> str | None:
|
|
123
|
+
"""阶段 1:14 大域并行打分 → 收敛到 top-1。
|
|
124
|
+
|
|
125
|
+
terms 是 expand_query_terms 返回的扩展词集合。
|
|
126
|
+
大域打分 = query 词命中大域代表词的次数(多词同域累加)。
|
|
127
|
+
并行在认知结构意义上:即使底层串行计算,14 个大域同时独立评估。
|
|
128
|
+
|
|
129
|
+
返回最匹配的大域名(多个 0 分 → 返回 None,走原 bucket_dir 路由)。
|
|
130
|
+
"""
|
|
131
|
+
if not terms:
|
|
132
|
+
return None
|
|
133
|
+
scores = {}
|
|
134
|
+
for d, vocab in BIG_DOMAINS.items():
|
|
135
|
+
scores[d] = sum(1 for t in terms
|
|
136
|
+
if any(w in t or t in w for w in vocab))
|
|
137
|
+
best = max(scores.items(), key=lambda x: x[1])
|
|
138
|
+
if best[1] == 0:
|
|
139
|
+
return None
|
|
140
|
+
# 多大域并列最高分时,按字典序取第一个稳定结果(避免浮点不确定)
|
|
141
|
+
return best[0]
|
|
142
|
+
|
|
143
|
+
|
|
144
|
+
# 生效条件:terms 为假值(None/空)时返回 {每个 BIG_DOMAINS 域: 0};terms 为真值时返回 {大域: 该域词表命中 terms 中词的个数}。
|
|
145
|
+
def big_domain_score_breakdown(terms) -> dict:
|
|
146
|
+
"""暴露打分明细,便于审计与回归测试。"""
|
|
147
|
+
if not terms:
|
|
148
|
+
return {d: 0 for d in BIG_DOMAINS}
|
|
149
|
+
return {d: sum(1 for t in terms if any(w in t or t in w for w in vocab))
|
|
150
|
+
for d, vocab in BIG_DOMAINS.items()}
|
|
151
|
+
|
|
152
|
+
|
|
153
|
+
# ---------------------------------------------------------------------------
|
|
154
|
+
# 分级隶属度(模糊控制「隶属函数」的手写版)
|
|
155
|
+
#
|
|
156
|
+
# 上面的 big_domain_classify 是二值控制:`w in t or t in w` 命中即计 1。
|
|
157
|
+
# 下面是同一套规则库的**分级**版本——命中程度是 0~1 的连续值,并乘 IDF:
|
|
158
|
+
# · 隶属度 membership(t, w):完全相同 1.0;包含关系取长度比(覆盖越全越高)
|
|
159
|
+
# · IDF:一个代表词覆盖的大域越少,区分度越高(「贝塞尔」只在数学出现,
|
|
160
|
+
# 权重高于「公式」这种跨域通用词)
|
|
161
|
+
# 老函数保持不动 → P0/P1 基线可比性不受影响;新函数只供新路径(fuzzy)使用。
|
|
162
|
+
# ---------------------------------------------------------------------------
|
|
163
|
+
|
|
164
|
+
# 生效条件:term 或 word 为假值(None/空串)返回 0.0;相等返回 1.0;word 是 term 子串返回 len(word)/len(term);term 是 word 子串返回 len(term)/len(word);二者无包含关系返回 0.0。
|
|
165
|
+
def membership(term: str, word: str) -> float:
|
|
166
|
+
"""词 term 对代表词 word 的隶属度(0.0~1.0,越接近 1 越隶属)。
|
|
167
|
+
|
|
168
|
+
完全相同 → 1.0
|
|
169
|
+
term 包含 word → len(word)/len(term)(覆盖越全越隶属)
|
|
170
|
+
word 包含 term → len(term)/len(word)
|
|
171
|
+
无包含关系 → 0.0
|
|
172
|
+
"""
|
|
173
|
+
if not term or not word:
|
|
174
|
+
return 0.0
|
|
175
|
+
if term == word:
|
|
176
|
+
return 1.0
|
|
177
|
+
if word in term:
|
|
178
|
+
return len(word) / len(term)
|
|
179
|
+
if term in word:
|
|
180
|
+
return len(term) / len(word)
|
|
181
|
+
return 0.0
|
|
182
|
+
|
|
183
|
+
|
|
184
|
+
# 生效条件:无入参,恒遍历模块级常量 BIG_DOMAINS 的各域代表词表,返回 {代表词: 包含该词的域个数}。
|
|
185
|
+
def _build_domain_df() -> dict:
|
|
186
|
+
"""代表词 → 覆盖它的大域数(IDF 的分母)。"""
|
|
187
|
+
df = {}
|
|
188
|
+
for vocab in BIG_DOMAINS.values():
|
|
189
|
+
for w in vocab:
|
|
190
|
+
df[w] = df.get(w, 0) + 1
|
|
191
|
+
return df
|
|
192
|
+
|
|
193
|
+
|
|
194
|
+
_DOMAIN_DF = _build_domain_df()
|
|
195
|
+
|
|
196
|
+
|
|
197
|
+
# 生效条件:恒返回 math.log(1.0 + len(BIG_DOMAINS) / _DOMAIN_DF.get(word, 1)),即 word 在 _DOMAIN_DF 中取其覆盖域数,缺键(含任何未登记值)时按 _DOMAIN_DF.get 的默认 1 代入。
|
|
198
|
+
def domain_idf(word: str) -> float:
|
|
199
|
+
"""代表词的区分度权重:log(1 + 大域总数 / 覆盖它的大域数)。
|
|
200
|
+
|
|
201
|
+
只在一个大域出现的词(如「贝塞尔」)≈ log(15)=2.71;
|
|
202
|
+
14 个大域都出现的词(如「公式」)≈ log(2)=0.69。
|
|
203
|
+
"""
|
|
204
|
+
return math.log(1.0 + len(BIG_DOMAINS) / _DOMAIN_DF.get(word, 1))
|
|
205
|
+
|
|
206
|
+
|
|
207
|
+
# 生效条件:terms 是 dict 时以其条目(键 str(t) 以 "__" 开头者剔除、值为 float)为词权重并忽略 weights,否则以 wmap.get(t, 1.0) 为权重(weights 为假值即 None/空 dict 时 wmap 为空、全部权重取 1.0,terms 为假值则词集为空);逐域累加「词权重 × 该词在域词表内最大(membership × domain_idf)」,权重 <=0 的词跳过,返回 {大域: round(得分, 6)}。
|
|
208
|
+
def big_domain_score_weighted(terms, weights=None) -> dict:
|
|
209
|
+
"""阶段 1(分级版):14 大域并行打分,按「隶属度 × IDF」加权。
|
|
210
|
+
|
|
211
|
+
terms: 可迭代的词集合,或 {词: 权重}(expand_query_terms_weighted 的输出,
|
|
212
|
+
调用方需先剔除 "__source__" 等元数据键)。
|
|
213
|
+
weights: terms 为可迭代时的可选权重表;terms 已是 dict 时忽略。
|
|
214
|
+
返回 {大域: 得分},得分不再是整数计数,而是连续值。
|
|
215
|
+
"""
|
|
216
|
+
if isinstance(terms, dict):
|
|
217
|
+
tw = {str(t): float(w) for t, w in terms.items()
|
|
218
|
+
if not str(t).startswith("__")}
|
|
219
|
+
else:
|
|
220
|
+
wmap = weights or {}
|
|
221
|
+
tw = {str(t): float(wmap.get(t, 1.0)) for t in (terms or [])}
|
|
222
|
+
out = {}
|
|
223
|
+
for d, vocab in BIG_DOMAINS.items():
|
|
224
|
+
s = 0.0
|
|
225
|
+
for t, tw_ in tw.items():
|
|
226
|
+
if tw_ <= 0:
|
|
227
|
+
continue
|
|
228
|
+
best = 0.0
|
|
229
|
+
for w in vocab:
|
|
230
|
+
m = membership(t, w)
|
|
231
|
+
if m > 0.0:
|
|
232
|
+
best = max(best, m * domain_idf(w))
|
|
233
|
+
s += tw_ * best
|
|
234
|
+
out[d] = round(s, 6)
|
|
235
|
+
return out
|
|
236
|
+
|
|
237
|
+
|
|
238
|
+
# 生效条件:以 terms、weights 计算各域加权得分(terms 为假值时各域均为 0.0),得分为空或最高分 <= min_score(默认 0.0)时返回 None,否则返回最高分大域名。
|
|
239
|
+
def big_domain_classify_weighted(terms, weights=None, min_score: float = 0.0):
|
|
240
|
+
"""阶段 1(分级版)收敛到 top-1;全部低于 min_score → None。"""
|
|
241
|
+
scores = big_domain_score_weighted(terms, weights)
|
|
242
|
+
if not scores:
|
|
243
|
+
return None
|
|
244
|
+
best = max(scores.items(), key=lambda kv: kv[1])
|
|
245
|
+
if best[1] <= min_score:
|
|
246
|
+
return None
|
|
247
|
+
return best[0]
|
|
248
|
+
|
|
249
|
+
|
|
250
|
+
# 生效条件:a 或 b 为假值(None/空串)返回 0.0;相等返回 1.0;a 是 b 子串返回 len(a)/len(b);b 是 a 子串返回 len(b)/len(a);否则按二者二元组字符集合的 Jaccard 返回 len(ga & gb)/len(ga | gb),任一集合为空(如单字符键)时返回 0.0。
|
|
251
|
+
def domain_similarity(a: str, b: str) -> float:
|
|
252
|
+
"""两个归一化域键的相似度(0~1):相同 1.0;包含取长度比;否则二元组 Jaccard。
|
|
253
|
+
|
|
254
|
+
「计算机科学」vs「计算机」→ 0.6(包含);「高中物理」vs「物理」→ 0.5;
|
|
255
|
+
完全无关 → 0.0。用于 fuzzy 路径的「大域亲和」打分。
|
|
256
|
+
"""
|
|
257
|
+
if not a or not b:
|
|
258
|
+
return 0.0
|
|
259
|
+
if a == b:
|
|
260
|
+
return 1.0
|
|
261
|
+
if a in b:
|
|
262
|
+
return len(a) / len(b)
|
|
263
|
+
if b in a:
|
|
264
|
+
return len(b) / len(a)
|
|
265
|
+
ga = {a[i:i + 2] for i in range(len(a) - 1)}
|
|
266
|
+
gb = {b[i:i + 2] for i in range(len(b) - 1)}
|
|
267
|
+
if not ga or not gb:
|
|
268
|
+
return 0.0
|
|
269
|
+
return len(ga & gb) / len(ga | gb)
|
|
270
|
+
|
|
271
|
+
|
|
272
|
+
# 生效条件:counts 各值之和为 0(含空 dict 与全 0 计数)时返回 {'ok': True, 'reason': 'empty', 'buckets': 0};否则在最大桶占比 >30%、桶数 >1 且单例桶占比 >50%、期望扫描 >30% 中命中的项写入 problems,返回含 ok(=problems 为空)、buckets、nodes、max_bucket_share、singleton_ratio、expected_scan、problems 的 dict。
|
|
273
|
+
def bucket_health(counts: dict) -> dict:
|
|
274
|
+
"""分区健康度自检。分桶键一旦退化(巨桶或碎片化),条件路由就是纸面收益,
|
|
275
|
+
必须在写入侧就能发现,而不是等召回变差才回头查。
|
|
276
|
+
|
|
277
|
+
counts: {bucket_dir: node_count}
|
|
278
|
+
"""
|
|
279
|
+
n = sum(counts.values())
|
|
280
|
+
if not n:
|
|
281
|
+
return {"ok": True, "reason": "empty", "buckets": 0}
|
|
282
|
+
nb = len(counts)
|
|
283
|
+
top = max(counts.values())
|
|
284
|
+
singles = sum(1 for v in counts.values() if v == 1)
|
|
285
|
+
# 期望扫描占比:随机取一节点的情境去路由,命中桶的期望大小占全库比例
|
|
286
|
+
expected_scan = sum(v * v for v in counts.values()) / n / n
|
|
287
|
+
problems = []
|
|
288
|
+
if top / n > 0.30:
|
|
289
|
+
problems.append(f"巨桶:最大桶占 {top / n:.1%}(>30% 视为分区失效)")
|
|
290
|
+
if nb > 1 and singles / nb > 0.50:
|
|
291
|
+
problems.append(f"碎片化:单例桶占 {singles / nb:.1%}(>50% 说明键含实例级字段)")
|
|
292
|
+
if expected_scan > 0.30:
|
|
293
|
+
problems.append(f"路由无效:期望扫描 {expected_scan:.1%}(接近全量)")
|
|
294
|
+
return {
|
|
295
|
+
"ok": not problems,
|
|
296
|
+
"buckets": nb,
|
|
297
|
+
"nodes": n,
|
|
298
|
+
"max_bucket_share": top / n,
|
|
299
|
+
"singleton_ratio": singles / nb if nb else 0.0,
|
|
300
|
+
"expected_scan": expected_scan,
|
|
301
|
+
"problems": problems,
|
|
302
|
+
}
|
|
303
|
+
|
|
304
|
+
|
|
305
|
+
# ---------------------------------------------------------------------------
|
|
306
|
+
# 节点侧大域标签(S1 大域先验收敛的前置元数据)
|
|
307
|
+
#
|
|
308
|
+
# 为何需要:`big_domain_classify` 一直只作用于 **query 侧**(terms),节点侧没有域字段,
|
|
309
|
+
# 于是「14 大域并行打分」算完只能写进 meta(审计偏差 4:先验算出来却当成报告)。
|
|
310
|
+
# 要让大域先验真正参与候选收敛,节点必须在写入时固化自己的域。
|
|
311
|
+
# 口径:与查询侧同一个分类器(BIG_DOMAINS + big_domain_classify),保证两侧同构。
|
|
312
|
+
# ---------------------------------------------------------------------------
|
|
313
|
+
|
|
314
|
+
# 域词取词:中文(≥2 字)与拉丁词(≥2 字)。词表命中用「包含关系」判定,
|
|
315
|
+
# 故 2 字以上的切口足以覆盖 1~4 字代表词(如「工程」命中「工程师」)。
|
|
316
|
+
DOMAIN_TERM_RE = re.compile(r"[\u4e00-\u9fff]{2,}|[A-Za-z][A-Za-z0-9_]{1,}")
|
|
317
|
+
|
|
318
|
+
|
|
319
|
+
# 生效条件:text 为假值(None/空串)时返回 [];否则以 DOMAIN_TERM_RE 取词、按出现顺序去重后返回,
|
|
320
|
+
# 最多 limit 个(limit 为假值/负数时按空处理,返回 [])。
|
|
321
|
+
def domain_terms(text, limit: int = 400) -> list:
|
|
322
|
+
"""从节点正文/标题抽「域词」(供 big_domain_classify 使用)。
|
|
323
|
+
|
|
324
|
+
只做最小分词:中文按 ≥2 字连续片段、拉丁按 [A-Za-z][A-Za-z0-9_]+ 取词;
|
|
325
|
+
去重保序,最多 limit 个(默认 400,避免长文把分类器拖慢)。
|
|
326
|
+
"""
|
|
327
|
+
if not text or not limit or limit < 1:
|
|
328
|
+
return []
|
|
329
|
+
out, seen = [], set()
|
|
330
|
+
for m in DOMAIN_TERM_RE.finditer(str(text)):
|
|
331
|
+
w = m.group(0)
|
|
332
|
+
if w in seen:
|
|
333
|
+
continue
|
|
334
|
+
seen.add(w)
|
|
335
|
+
out.append(w)
|
|
336
|
+
if len(out) >= limit:
|
|
337
|
+
break
|
|
338
|
+
return out
|
|
339
|
+
|
|
340
|
+
|
|
341
|
+
# 生效条件:bucket 为假值或等于 ORPHAN 时返回空串;否则去掉 "cond_" 前缀、并当末段为 8 位十六进制哈希时剥掉该段,返回剩余的可读键。
|
|
342
|
+
def bucket_key_readable(bucket: str) -> str:
|
|
343
|
+
"""桶目录名 → 可读键(S1b query 侧桶推断用):'cond_感知系统_d94e90d2' → '感知系统'。
|
|
344
|
+
|
|
345
|
+
与 `bucket_dir` 互逆(丢哈希段);`orphan`/空值返回空串(S1b 不把 orphan 当键,orphan 恒作兜底)。
|
|
346
|
+
"""
|
|
347
|
+
if not bucket or bucket == ORPHAN:
|
|
348
|
+
return ""
|
|
349
|
+
s = str(bucket)
|
|
350
|
+
if s.startswith("cond_"):
|
|
351
|
+
s = s[len("cond_"):]
|
|
352
|
+
head, sep, tail = s.rpartition("_")
|
|
353
|
+
if sep and len(tail) == 8 and all(c in "0123456789abcdef" for c in tail):
|
|
354
|
+
s = head
|
|
355
|
+
return s
|
|
356
|
+
|
|
357
|
+
|
|
358
|
+
# 中文词判定:至少含一个汉字
|
|
359
|
+
_ZH_RE = re.compile(r"[\u4e00-\u9fff]")
|
|
360
|
+
|
|
361
|
+
|
|
362
|
+
# 生效条件:key 缺失或含汉字时返回 [];否则从 tags(保序在前)与 text 域词(domain_terms)中收集含汉字、长度≥2 的词,去重取前 limit 个返回。
|
|
363
|
+
def bucket_zh_aliases(key: str, tags, text, limit: int = 6) -> list:
|
|
364
|
+
"""英文桶键的中文别名(issue #33:S1b 跨语言收敛盲区的修复面)。
|
|
365
|
+
|
|
366
|
+
机理:domain_similarity 的 bigram 兜底跨语言交集恒空——英文桶键 × 中文
|
|
367
|
+
query 恒 0.0 → S1b 恒 no_key_match(真实库 91.1% 中文节点恰是设计目标场景)。
|
|
368
|
+
别名**只取节点自身内容**(tags 中文词 ∪ 正文中文域词,tags 优先),零翻译
|
|
369
|
+
依赖——unify_query/en_zh_terms 桥接已被 #33 实测排除(字级直译语义毁)。
|
|
370
|
+
键本身含中文时无跨语言问题,返回 []。
|
|
371
|
+
"""
|
|
372
|
+
if not key or _ZH_RE.search(str(key)):
|
|
373
|
+
return []
|
|
374
|
+
out, seen = [], set()
|
|
375
|
+
src = [str(t) for t in (tags or [])]
|
|
376
|
+
src += domain_terms(text or "", limit=200)
|
|
377
|
+
for w in src:
|
|
378
|
+
if len(w) >= 2 and _ZH_RE.search(w) and w not in seen:
|
|
379
|
+
seen.add(w)
|
|
380
|
+
out.append(w)
|
|
381
|
+
if len(out) >= limit:
|
|
382
|
+
break
|
|
383
|
+
return out
|
|
384
|
+
|
|
385
|
+
|
|
386
|
+
# 生效条件:text 为假值或取不到任何域词时返回 None;否则返回 big_domain_classify(domain_terms(text))
|
|
387
|
+
# 的结果(无有效域信号时亦为 None,调用方据此决定是否落域字段)。
|
|
388
|
+
def classify_text(text, limit: int = 400):
|
|
389
|
+
"""正文 → 大域名(节点侧域标签真源)。与查询侧共用 big_domain_classify。
|
|
390
|
+
|
|
391
|
+
返回 None 表示「无有效域信号」——此时**不写** big_domain 字段,
|
|
392
|
+
该节点留在 ORPHAN/兜底池(S1 收敛时必须能被兜底召回,见契约 §3 S1 不变量)。
|
|
393
|
+
"""
|
|
366
394
|
return big_domain_classify(domain_terms(text, limit))
|