@furongjun1999/dsh-memory 0.4.11 → 0.5.1
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/README.md +552 -465
- package/codebuddy/CODEBUDDY.md +11 -3
- package/codebuddy/README.md +92 -90
- package/codebuddy/mcp.json +27 -27
- package/docs/GBrain/345/217/257/345/200/237/351/211/264/347/202/271_/347/201/265/346/236/242/350/220/275/347/202/271/344/272/244/346/216/245_20260919.md +169 -169
- package/docs/Pi/345/217/257/345/255/246/344/271/240/344/274/230/347/202/271_/347/201/265/346/236/242/345/244/247/350/204/221/346/224/271/350/277/233/344/272/244/346/216/245_20260915.md +144 -144
- package/docs/README.md +143 -111
- package/docs/discipline/harnesses.yaml +244 -226
- package/docs/discipline/templates/full.md.tmpl +61 -61
- package/docs/discipline/templates/rules.mdc.tmpl +68 -0
- package/docs/discipline/templates/skill.md.tmpl +23 -23
- package/docs/eval/AGI/344/270/203/347/273/264/350/257/204/345/210/206/346/212/245/345/221/212_md_cg_v1.0.md +299 -299
- package/docs/eval/AGI/344/270/203/347/273/264/350/257/204/345/210/206/346/212/245/345/221/212_md_cg_v2.0.md +239 -239
- package/docs/eval/bench_lingshu_self/bench_self.py +140 -0
- package/docs/eval/bench_lingshu_self/self_bench_result.json +404 -0
- package/docs/eval/bench_lingshu_self//347/201/265/346/236/242/350/207/252/345/272/223/347/253/257/345/210/260/347/253/257/346/243/200/347/264/242/345/256/236/346/265/213_v1.0.md +38 -0
- package/docs/eval//344/270/215/345/217/257/351/235/240/346/200/247/350/220/275/345/234/260_P0_v1.0.md +185 -0
- package/docs/eval//345/256/236/351/252/214/346/226/271/346/241/210_/345/255/246/344/271/240/351/227/255/347/216/257AB/344/270/216/346/250/252/350/257/204_v1.0.md +174 -174
- package/docs/eval//346/225/205/351/232/234/346/263/250/345/205/245/345/256/236/346/265/213_v1.0.md +422 -0
- package/docs/eval//346/250/252/350/257/204_/345/205/255/345/256/266100/351/242/230/344/270/255/350/213/261/345/217/214/346/237/245_v1.0.md +223 -223
- package/docs/eval//347/253/257/345/210/260/347/253/257LoCoMoQA/345/220/214/345/217/243/345/276/204/345/257/271/347/205/247_v1.0.md +100 -0
- package/docs/eval//347/253/257/345/210/260/347/253/257/345/271/262/346/211/260/346/261/240/350/257/204/346/265/213_/347/241/256/345/256/232/346/200/247/350/243/201/345/206/263vsLLM_judge_v1.1.md +197 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v1.md +156 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v10.md +210 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v11.md +227 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v12.md +203 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v13.md +233 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v14.md +191 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v15.md +213 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v16.md +214 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v17.md +199 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v2.md +156 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v3.md +152 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v4.md +128 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v5.md +114 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v6.md +192 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v7.md +187 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v8.md +207 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v9.md +203 -0
- package/docs/{mdcg → hive}//344/273/244/347/211/214/344/270/216/350/247/222/350/211/262/346/235/203/350/201/214/345/210/206/347/246/273_v0.1.md +165 -160
- package/docs/hive//344/273/244/347/211/214/350/257/255/344/271/211/344/277/256/346/255/243_/344/273/262/350/243/201/344/275/215_v0.1.md +76 -0
- package/docs/{mdcg → hive}//345/255/220/344/273/243/347/220/206/351/205/215/347/275/256/346/240/207/345/207/206_v0.5.md +236 -236
- package/docs/hive//345/256/211/345/205/250/345/256/241/350/256/241/345/256/236/351/224/232_v0.1.md +202 -0
- package/docs/hive//346/243/200/347/264/242/346/224/266/346/225/233/345/256/236/346/265/213/344/270/216S1b/350/256/276/350/256/241_v0.1.md +43 -43
- package/docs/hive//346/243/200/347/264/242/347/256/227/346/263/225/345/217/243/345/276/204/345/257/271/347/205/247_v0.1.md +85 -0
- package/docs/hive//346/243/200/347/264/242/350/267/257/345/276/204/344/270/216/350/256/244/347/237/245/347/273/223/346/236/204/345/245/221/347/272/246_v0.1.md +102 -102
- package/docs/hive//350/234/202/345/267/242M6_ingest/345/256/236/346/226/275/350/256/241/345/210/222_v0.1.md +47 -0
- package/docs/hive//350/234/202/345/267/242/345/217/214/345/256/236/344/276/213/344/272/222/351/252/214_/350/256/276/350/256/241/345/256/232/347/250/277.md +519 -503
- package/docs/hive//350/234/202/345/267/242/345/267/245/344/275/234/350/256/260/345/277/206_/351/241/271/347/233/256/350/256/241/345/210/222.md +85 -85
- package/docs/hive//350/234/202/345/267/242/350/256/276/350/256/241_/347/220/206/350/256/272/345/257/271/351/275/220_v0.1.md +191 -0
- package/docs/hive//350/234/202/345/267/242/350/277/255/344/273/243_/345/256/217/350/247/202/344/270/216/347/276/244/344/275/223/350/260/203/345/272/246_v0.1.md +90 -0
- package/docs/images/lingshu-moonlight-covenant-poster-preview.jpg +0 -0
- package/docs/images/lingshu-moonlight-covenant-poster.png +0 -0
- package/docs/mdcg/D_meta_/345/267/245/347/250/213/345/214/226/346/226/271/346/241/210_v0.2.md +216 -216
- package/docs/mdcg/README/350/257/246/347/273/206/347/211/210_v0.4.10.md +646 -646
- package/docs/mdcg/lingshu_tutorial.html +14449 -14449
- package/docs/mdcg/release_v0.4.11.md +49 -0
- package/docs/mdcg/release_v0.4.5.md +55 -55
- package/docs/mdcg/tool_table_v0.3.0.md +117 -117
- package/docs/mdcg//345/205/250/345/272/223/344/273/243/347/240/201/350/257/204/345/256/241/344/270/216/346/235/241/344/273/266/345/214/226/346/263/250/351/207/212_/350/256/241/345/210/222_v0.1.md +600 -600
- package/docs/mdcg//345/212/237/350/203/275/350/260/203/347/224/250/346/230/240/345/260/204/350/241/250_v0.1.md +40 -40
- package/docs/mdcg//345/215/225/345/205/203/350/207/252/346/210/221/351/224/232/347/202/271_/347/263/273/347/273/237/346/217/220/347/244/272/350/257/215/346/240/207/345/207/206_v0.3.md +275 -275
- package/docs/mdcg//345/217/221/345/270/203/351/227/250/347/246/201/351/223/276_v0.1.md +54 -0
- package/docs/mdcg//346/272/220/347/240/201/347/272/247/346/236/266/346/236/204/345/256/241/350/256/241_GPT/346/211/271/350/257/204/345/257/271/347/205/247_v1.0.md +130 -130
- package/docs/mdcg//347/201/265/346/236/24282/345/267/245/345/205/267_/345/212/237/350/203/275/346/225/264/347/220/206/344/270/216/350/277/201/347/247/273/346/230/240/345/260/204_v0.1.md +278 -278
- package/docs/mdcg//347/201/265/346/236/242/350/256/260/345/277/206/345/212/250/350/257/215/345/215/217/350/256/256_v1.0-draft.md +172 -172
- package/docs/mdcg//347/274/272/345/217/243/345/215/225_P0/346/224/266/345/217/243_v0.1.md +270 -270
- package/docs/mdcg//350/256/244/347/237/245/345/233/276_G4-G8/347/274/272/345/217/243/350/243/201/345/256/232/345/215/225_v0.1.md +491 -491
- package/docs/mdcg//350/256/244/347/237/245/345/233/276_/346/235/241/344/273/266/347/251/272/351/227/264/345/220/210/346/210/220/344/270/216/347/224/237/346/225/210/346/235/241/344/273/266/345/217/243/345/276/204_v0.1.md +340 -340
- package/docs/mdcg//350/256/244/347/237/245/345/233/276_/347/264/242/345/274/225/344/270/216/345/267/245/347/250/213/350/247/204/350/214/203/345/214/226_/350/256/241/345/210/222_v0.1.md +588 -588
- package/docs/plans/GridWorld/346/234/200/345/260/217/351/227/255/347/216/257/350/247/204/346/240/274_v0.1.md +176 -176
- package/docs/plans//345/221/275/345/220/215/346/262/273/347/220/206_/351/241/271/347/233/256/350/256/241/345/210/222.md +81 -81
- package/docs/swarm//350/234/202/347/276/244/344/272/222/350/201/224_v0.1.md +704 -704
- package/docs/swarm//350/234/202/347/276/244/345/220/214/351/224/231/346/243/200/346/265/213/345/256/236/351/252/214/345/215/217/350/256/256_v0.1.md +242 -242
- package/docs/theory//344/270/215/345/217/257/351/235/240/345/256/232/347/220/206/344/270/216/345/244/261/346/225/210/344/274/230/345/205/210/346/241/206/346/236/266_v0.3.md +365 -0
- package/docs/theory//345/215/225/347/272/277/347/250/213/344/270/216/346/263/250/346/204/217/345/212/233/351/233/206/344/270/255_/346/227/240/344/272/211/350/256/256/347/220/206/350/256/272/346/226/207/346/241/243_v1.0.md +129 -129
- package/docs/theory//345/271/266/345/217/221/345/277/205/347/204/266/346/200/247/347/220/206/350/256/272_v0.2.md +134 -134
- package/docs/theory//346/231/272/350/203/275/350/256/2723.4.md +5260 -5260
- package/docs/theory//346/246/202/345/277/265/345/210/206/345/261/202/345/257/271/351/275/220/350/241/250_v0.1.md +145 -145
- package/docs/theory//347/220/206/350/256/272_/346/234/272/345/210/266_/344/273/243/347/240/201_/345/256/236/351/252/214_/347/274/272/345/217/243/347/237/251/351/230/265_v0.1.md +144 -144
- package/docs/theory//347/220/206/350/256/272/344/273/223/346/213/206/345/210/206/344/270/216/347/231/275/347/256/261/347/237/245/350/257/206/345/272/223/345/206/205/350/277/201_v0.1.md +198 -198
- package/docs/theory//350/256/244/347/237/245/344/273/243/347/220/206/344/270/216/346/224/266/346/225/233/347/273/223/346/236/204_/346/235/241/344/273/266/350/256/272/351/207/215/346/236/204_v0.1.md +221 -221
- package/docs/world_model//344/270/226/347/225/214/346/250/241/345/236/213_/347/245/236/347/273/217/347/275/221/347/273/234/345/272/225/345/261/202/346/236/266/346/236/204_v1.0.md +237 -237
- package/docs//344/270/215/345/217/257/351/235/240/346/200/247/347/220/206/350/256/272_v0.1.md +343 -0
- package/docs//345/217/221/345/270/203/344/273/266/345/233/236/346/272/257/350/257/264/346/230/216_v0.1.md +82 -82
- package/docs//345/267/245/344/275/234/347/272/252/345/276/213_/350/256/244/347/237/245/345/233/276/346/235/241/347/233/256_v1.1.json +28 -2
- package/dsh/README.md +82 -82
- package/dsh/cordis.yml.example +139 -139
- package/dsh/update-lingshu.bat +11 -11
- package/lib/bridge.d.ts +9 -0
- package/lib/bridge.js +35 -0
- package/lib/hooks.js +36 -2
- package/lib/index.js +7 -1
- package/lib/lib/roleplay_web.js +116 -29
- package/lib/lib/token_store.d.ts +7 -1
- package/lib/lib/token_store.js +12 -3
- package/md_cg/__init__.py +7 -7
- package/md_cg/audit.py +379 -368
- package/md_cg/autonomy.py +287 -287
- package/md_cg/backfill.py +1328 -1327
- package/md_cg/backfill_bigdomain.py +34 -34
- package/md_cg/backfill_bucket_zh.py +35 -0
- package/md_cg/bench6_arms.py +410 -410
- package/md_cg/bench6_common.py +230 -230
- package/md_cg/bench6_competitors.py +212 -212
- package/md_cg/bench_axis_domain.py +257 -257
- package/md_cg/bench_blind_comp.py +308 -308
- package/md_cg/bench_e2e_judge.py +532 -0
- package/md_cg/bench_e2e_locomo_qa.py +368 -0
- package/md_cg/bench_e2e_qa.py +256 -0
- package/md_cg/bench_en_atoms_public.py +230 -230
- package/md_cg/bench_governance.py +348 -348
- package/md_cg/bench_lme_zh.py +410 -410
- package/md_cg/bench_locomo.py +121 -121
- package/md_cg/bench_locomo_zh.py +450 -450
- package/md_cg/bench_locomo_zh_public.py +147 -147
- package/md_cg/bench_longmem.py +112 -112
- package/md_cg/bench_membench.py +632 -632
- package/md_cg/bench_p0.py +149 -149
- package/md_cg/bench_progressive.py +287 -287
- package/md_cg/bench_role_views.py +238 -238
- package/md_cg/bench_task_ab.py +243 -243
- package/md_cg/bench_task_ab_llm.py +408 -408
- package/md_cg/bench_unified_en.py +204 -204
- package/md_cg/bench_zh_mad.py +601 -601
- package/md_cg/blindspot_tickets.py +123 -123
- package/md_cg/branches.py +301 -285
- package/md_cg/build_postings.py +73 -73
- package/md_cg/ccgc.py +1006 -948
- package/md_cg/census.py +132 -132
- package/md_cg/chain.py +315 -300
- package/md_cg/codeindex.py +531 -531
- package/md_cg/coldverify.py +292 -292
- package/md_cg/comment_gate.py +337 -337
- package/md_cg/cond_compose.py +190 -190
- package/md_cg/cond_facts.py +154 -154
- package/md_cg/cond_template.json +106 -106
- package/md_cg/condition_anchor.py +142 -142
- package/md_cg/conformance.py +726 -726
- package/md_cg/consistency.py +717 -717
- package/md_cg/consolidate.py +1537 -1439
- package/md_cg/corpus.py +110 -110
- package/md_cg/crosscheck.py +1098 -1097
- package/md_cg/crypto.py +3 -1
- package/md_cg/d_meta.py +310 -310
- package/md_cg/datapath.py +78 -18
- package/md_cg/docindex.py +473 -473
- package/md_cg/eval_common.py +575 -575
- package/md_cg/evidence.py +4 -2
- package/md_cg/evolution.py +477 -477
- package/md_cg/export.py +222 -220
- package/md_cg/forgetting.py +581 -581
- package/md_cg/fsutil.py +377 -329
- package/md_cg/hotcache.py +48 -7
- package/md_cg/hyperedge.py +251 -251
- package/md_cg/identity.py +390 -390
- package/md_cg/insight.py +500 -500
- package/md_cg/interop.py +338 -0
- package/md_cg/judgment_manifest.py +177 -0
- package/md_cg/lexicon/build_cedict_en_zh.py +329 -329
- package/md_cg/lexicon/build_standard_en.py +171 -171
- package/md_cg/lexicon/expand_en_zh.py +211 -211
- package/md_cg/lifecycle.py +272 -272
- package/md_cg/linkref.py +280 -280
- package/md_cg/links.py +140 -107
- package/md_cg/mcp_server.py +403 -55
- package/md_cg/md_whitebox.py +345 -345
- package/md_cg/mdcg.py +783 -233
- package/md_cg/mdcos.py +500 -70
- package/md_cg/metacognition.py +591 -591
- package/md_cg/migrate.py +119 -119
- package/md_cg/migrate_aeis.py +221 -221
- package/md_cg/migrate_roleplay.py +293 -293
- package/md_cg/migrate_wisdom_graph.py +360 -360
- package/md_cg/mreview/__init__.py +25 -25
- package/md_cg/mreview/__main__.py +110 -110
- package/md_cg/mreview/bundle.py +178 -178
- package/md_cg/mreview/candidates.py +262 -262
- package/md_cg/mreview/govern.py +694 -693
- package/md_cg/mreview/locate.py +939 -939
- package/md_cg/mreview/pipeline.py +728 -728
- package/md_cg/mreview/rules/duplication.json +21 -21
- package/md_cg/mreview/rules/field_coverage.json +54 -54
- package/md_cg/mreview/rules/source_license.json +21 -21
- package/md_cg/mreview/rules/template_flow.json +21 -21
- package/md_cg/mreview/ruleset.py +252 -252
- package/md_cg/nodefile.py +575 -575
- package/md_cg/pooling.py +484 -472
- package/md_cg/postings.py +300 -298
- package/md_cg/predict.py +1100 -1100
- package/md_cg/progressive.py +123 -123
- package/md_cg/protect.py +272 -272
- package/md_cg/protocol/md_cg_gate.proto +33 -33
- package/md_cg/protocol.py +372 -372
- package/md_cg/provenance.py +582 -582
- package/md_cg/reach.py +453 -453
- package/md_cg/readcache.py +143 -0
- package/md_cg/reconcile.py +228 -0
- package/md_cg/refindex.py +833 -833
- package/md_cg/refine.py +604 -604
- package/md_cg/review_cli.py +170 -0
- package/md_cg/roleviews.py +89 -89
- package/md_cg/routing.py +393 -365
- package/md_cg/run_tests.py +211 -0
- package/md_cg/scrub.py +13 -3
- package/md_cg/security.py +128 -18
- package/md_cg/self_state.py +1029 -1029
- package/md_cg/selfreport.py +152 -151
- package/md_cg/semantic/__init__.py +10 -10
- package/md_cg/semantic/canonical.py +122 -122
- package/md_cg/semantic/en_normalizer.py +364 -364
- package/md_cg/semantic/en_zh_map.json +28694 -0
- package/md_cg/semantic/export_en_zh_map.py +64 -0
- package/md_cg/semantic/unify.py +45 -0
- package/md_cg/semantic/zh_en_atoms.py +139 -139
- package/md_cg/signer.py +7 -4
- package/md_cg/sources.py +816 -582
- package/md_cg/statushdr.py +179 -179
- package/md_cg/stg.py +54 -37
- package/md_cg/subgraph.py +729 -729
- package/md_cg/sustain.py +35 -5
- package/md_cg/tasks.py +470 -470
- package/md_cg/test_access_hints.py +147 -0
- package/md_cg/test_action_derive.py +203 -203
- package/md_cg/test_audit_rotate.py +270 -270
- package/md_cg/test_autonomy.py +143 -143
- package/md_cg/test_bench_governance.py +102 -102
- package/md_cg/test_blindspot_tickets.py +166 -166
- package/md_cg/test_branch_discard_tombstone.py +136 -0
- package/md_cg/test_branches.py +13 -3
- package/md_cg/test_ccg_perturb.py +184 -184
- package/md_cg/test_ccgc.py +433 -433
- package/md_cg/test_census_prune.py +81 -81
- package/md_cg/test_chain_read_isolate.py +168 -0
- package/md_cg/test_cond_compose_anchors.py +76 -76
- package/md_cg/test_cond_match.py +165 -165
- package/md_cg/test_condition_anchor.py +81 -81
- package/md_cg/test_d_meta.py +412 -412
- package/md_cg/test_datapath_device_name.py +203 -0
- package/md_cg/test_datapath_root.py +199 -199
- package/md_cg/test_emit_negtail_cache.py +156 -0
- package/md_cg/test_en_pipeline.py +22 -2
- package/md_cg/test_gain_gate.py +212 -212
- package/md_cg/test_govern_directread.py +421 -0
- package/md_cg/test_health_scale.py +173 -173
- package/md_cg/test_hive_ingest.py +285 -0
- package/md_cg/test_hot_cold.py +215 -215
- package/md_cg/test_hyperedge.py +245 -245
- package/md_cg/test_i26_empty_first_write.py +116 -0
- package/md_cg/test_i27_e041_identity.py +128 -0
- package/md_cg/test_i28_hotcache_prodpath.py +122 -0
- package/md_cg/test_i32_hotcache_env_key.py +218 -0
- package/md_cg/test_identity_attribution.py +96 -15
- package/md_cg/test_index_durability.py +17 -3
- package/md_cg/test_interop.py +95 -0
- package/md_cg/test_interop_judgment.py +228 -0
- package/md_cg/test_issue39_utf8_stdio.py +273 -0
- package/md_cg/test_lifecycle.py +309 -309
- package/md_cg/test_linkref.py +306 -306
- package/md_cg/test_links_concurrent_write.py +188 -0
- package/md_cg/test_lock.py +43 -43
- package/md_cg/test_md_access_parity.py +255 -255
- package/md_cg/test_md_writepath.py +345 -345
- package/md_cg/test_mdstore_search_parity.py +160 -0
- package/md_cg/test_merge_upsert.py +168 -0
- package/md_cg/test_mr_m2.py +587 -587
- package/md_cg/test_mr_m3.py +710 -710
- package/md_cg/test_mr_m4.py +485 -485
- package/md_cg/test_n123_derive_expiry_chain.py +205 -0
- package/md_cg/test_n130_verify_falsified_protect.py +185 -0
- package/md_cg/test_n131_merge_gate.py +205 -0
- package/md_cg/test_p0.py +250 -250
- package/md_cg/test_p1.py +316 -316
- package/md_cg/test_p10_identity.py +173 -173
- package/md_cg/test_p11_consistency.py +233 -233
- package/md_cg/test_p12_metacognition.py +212 -212
- package/md_cg/test_p13_encryption.py +241 -241
- package/md_cg/test_p14_sustain.py +249 -249
- package/md_cg/test_p15_scrub.py +280 -280
- package/md_cg/test_p16_self_state.py +301 -301
- package/md_cg/test_p17_predict.py +354 -354
- package/md_cg/test_p18_whitebox.py +171 -171
- package/md_cg/test_p19_migrate_roleplay.py +149 -149
- package/md_cg/test_p1x_ref_root.py +160 -0
- package/md_cg/test_p20_evolution.py +315 -315
- package/md_cg/test_p21_tokens.py +293 -270
- package/md_cg/test_p22_theory.py +175 -175
- package/md_cg/test_p23_links.py +311 -311
- package/md_cg/test_p24_evidence.py +227 -227
- package/md_cg/test_p25_weights.py +156 -156
- package/md_cg/test_p26_refindex.py +416 -416
- package/md_cg/test_p27_docindex.py +16 -7
- package/md_cg/test_p28_refcheck.py +305 -305
- package/md_cg/test_p29_session_ingest_export.py +354 -333
- package/md_cg/test_p2_mcp.py +3 -0
- package/md_cg/test_p3.py +11 -2
- package/md_cg/test_p30_maintain.py +330 -330
- package/md_cg/test_p31_insight.py +534 -534
- package/md_cg/test_p32_backfill.py +7 -1
- package/md_cg/test_p33_ccg_wiring.py +293 -293
- package/md_cg/test_p34_crosscheck.py +331 -331
- package/md_cg/test_p35_conditioned_claim.py +252 -252
- package/md_cg/test_p36_kp_align.py +230 -230
- package/md_cg/test_p37_condition_space.py +248 -248
- package/md_cg/test_p38_concurrent_flush.py +102 -0
- package/md_cg/test_p38_contextualize.py +273 -273
- package/md_cg/test_p39_verify_flow.py +153 -0
- package/md_cg/test_p39_vision_evidence.py +369 -369
- package/md_cg/test_p40_refine_worklist.py +241 -241
- package/md_cg/test_p41_evolve_patrol.py +224 -224
- package/md_cg/test_p42_provenance.py +269 -269
- package/md_cg/test_p43_pooling.py +412 -398
- package/md_cg/test_p44_md_whitebox.py +231 -231
- package/md_cg/test_p45_session_identity.py +219 -219
- package/md_cg/test_p46_unit_scope.py +272 -272
- package/md_cg/test_p47_session_view.py +316 -0
- package/md_cg/test_p4_fuzzy.py +223 -223
- package/md_cg/test_p5_semantic.py +226 -226
- package/md_cg/test_p6_consolidate.py +440 -387
- package/md_cg/test_p7_goals_recent.py +202 -202
- package/md_cg/test_p8_subgraph_chain.py +200 -200
- package/md_cg/test_p9_forget_protect.py +231 -231
- package/md_cg/test_predict_beta.py +135 -135
- package/md_cg/test_preflight_failclosed.py +100 -100
- package/md_cg/test_progressive.py +146 -146
- package/md_cg/test_propose_tail_index.py +157 -0
- package/md_cg/test_protocol.py +243 -243
- package/md_cg/test_reach.py +378 -378
- package/md_cg/test_reach_keys.py +201 -201
- package/md_cg/test_read_clip.py +141 -141
- package/md_cg/test_read_scope_b27.py +277 -0
- package/md_cg/test_readcache_default_on.py +168 -0
- package/md_cg/test_readcache_precise_inval.py +270 -0
- package/md_cg/test_readcache_prodpath.py +203 -0
- package/md_cg/test_reconcile_v0.py +294 -0
- package/md_cg/test_retr_gates_prodpath.py +140 -0
- package/md_cg/test_retr_s1.py +344 -340
- package/md_cg/test_retr_s1b.py +276 -209
- package/md_cg/test_retr_s3.py +194 -194
- package/md_cg/test_retr_s4.py +163 -163
- package/md_cg/test_retr_s5.py +200 -200
- package/md_cg/test_retr_s6.py +157 -157
- package/md_cg/test_retr_s7.py +392 -384
- package/md_cg/test_retr_s8_time.py +369 -316
- package/md_cg/test_retr_s9_edges.py +286 -286
- package/md_cg/test_retr_s9_entity_ctx.py +9 -3
- package/md_cg/test_retr_score_once.py +208 -0
- package/md_cg/test_review_conformance.py +367 -367
- package/md_cg/test_review_onepass.py +170 -0
- package/md_cg/test_role_views.py +354 -354
- package/md_cg/test_rrf_graph_seed_cache.py +154 -0
- package/md_cg/test_security_audit.py +155 -0
- package/md_cg/test_security_audit_b26.py +161 -0
- package/md_cg/test_security_audit_v21.py +250 -0
- package/md_cg/test_sem_noise.py +242 -242
- package/md_cg/test_semantic_canonical.py +16 -2
- package/md_cg/test_session_isolation.py +168 -0
- package/md_cg/test_snapshot_autoclose.py +187 -0
- package/md_cg/test_subproc_encoding.py +192 -192
- package/md_cg/test_sustain_mutual.py +153 -153
- package/md_cg/test_tail_watermark_race.py +208 -0
- package/md_cg/test_tasks.py +409 -409
- package/md_cg/test_tenant_env_override_warn.py +139 -0
- package/md_cg/test_tenant_registry_corrupt_warn.py +151 -0
- package/md_cg/test_tool_face.py +189 -189
- package/md_cg/test_transfer.py +180 -180
- package/md_cg/test_trust.py +361 -361
- package/md_cg/test_twophase.py +286 -286
- package/md_cg/test_v14_fixes.py +38 -20
- package/md_cg/test_validity_filter.py +280 -280
- package/md_cg/test_verify_answer.py +138 -138
- package/md_cg/test_verify_dirty_reconcile.py +157 -0
- package/md_cg/test_wisdom_md_store.py +292 -292
- package/md_cg/test_writelimit.py +197 -197
- package/md_cg/test_writepipe.py +214 -214
- package/md_cg/theory.py +6 -3
- package/md_cg/tokens.py +85 -14
- package/md_cg/tool_face.py +260 -260
- package/md_cg/trust.py +986 -950
- package/md_cg/twophase.py +231 -231
- package/md_cg/units.py +668 -667
- package/md_cg/vision_evidence.py +667 -666
- package/md_cg/weights.py +624 -624
- package/md_cg/whitebox.py +527 -527
- package/md_cg/whitebox_kb/__init__.py +37 -37
- package/md_cg/whitebox_kb/aeis_core/__init__.py +42 -42
- package/md_cg/whitebox_kb/aeis_core/semantic.py +280 -280
- package/md_cg/whitebox_kb/aeis_core/textutil.py +13 -13
- package/md_cg/whitebox_kb/engine.py +310 -310
- package/md_cg/whitebox_kb/seed_knowledge//346/231/272/350/203/275/350/256/2723.4.md +5260 -5260
- package/md_cg/whitebox_kb/wisdom/browser_units.py +2631 -2631
- package/md_cg/whitebox_kb/wisdom/causal_discover.py +432 -432
- package/md_cg/whitebox_kb/wisdom/chat_engine.py +1506 -1506
- package/md_cg/whitebox_kb/wisdom/compiler_code_units.py +3033 -3033
- package/md_cg/whitebox_kb/wisdom/condition_algebra.py +112 -112
- package/md_cg/whitebox_kb/wisdom/condition_frame.py +315 -315
- package/md_cg/whitebox_kb/wisdom/condition_kb.py +108 -108
- package/md_cg/whitebox_kb/wisdom/conflict_map.json +4445 -4445
- package/md_cg/whitebox_kb/wisdom/core/lexer.py +512 -512
- package/md_cg/whitebox_kb/wisdom/core/name_checker.py +1023 -1023
- package/md_cg/whitebox_kb/wisdom/cspmn.py +258 -258
- package/md_cg/whitebox_kb/wisdom/csre.py +264 -264
- package/md_cg/whitebox_kb/wisdom/danmaku_audit.py +252 -252
- package/md_cg/whitebox_kb/wisdom/distilled_condition_units.json +6417 -6417
- package/md_cg/whitebox_kb/wisdom/docs/WB-EVAL-20260902b.json +1950 -1950
- package/md_cg/whitebox_kb/wisdom/docs/WB-EVAL-20260902c.json +1296 -1296
- package/md_cg/whitebox_kb/wisdom/docs/whitebox_capability_graph_demo.json +59 -59
- package/md_cg/whitebox_kb/wisdom/graph_db_units.py +3089 -3089
- package/md_cg/whitebox_kb/wisdom/knowledge_points.py +318 -318
- package/md_cg/whitebox_kb/wisdom/md_access.py +470 -470
- package/md_cg/whitebox_kb/wisdom/md_store.py +276 -251
- package/md_cg/whitebox_kb/wisdom/migrate_wisdom.py +476 -476
- package/md_cg/whitebox_kb/wisdom/multilang_ir.py +128 -124
- package/md_cg/whitebox_kb/wisdom/navigate.py +248 -248
- package/md_cg/whitebox_kb/wisdom/neural_retrieve.py +224 -224
- package/md_cg/whitebox_kb/wisdom/os_units.py +2735 -2735
- package/md_cg/whitebox_kb/wisdom/pattern_separation.py +376 -376
- package/md_cg/whitebox_kb/wisdom/prereq_map.json +364 -364
- package/md_cg/whitebox_kb/wisdom/python_code_units.py +2766 -2766
- package/md_cg/whitebox_kb/wisdom/role_solidified.json +7 -7
- package/md_cg/whitebox_kb/wisdom/route_memory.py +244 -244
- package/md_cg/whitebox_kb/wisdom/scene_reconstruction.py +148 -148
- package/md_cg/whitebox_kb/wisdom/snr_report.json +40 -40
- package/md_cg/whitebox_kb/wisdom/test_code_compose_domains.py +7541 -7541
- package/md_cg/whitebox_kb/wisdom/test_compiler_self_bootstrap.py +354 -354
- package/md_cg/whitebox_kb/wisdom/test_ecosystem_assembly.py +158 -158
- package/md_cg/whitebox_kb/wisdom/test_ecosystem_demos.py +193 -193
- package/md_cg/whitebox_kb/wisdom/test_graph_db.py +292 -292
- package/md_cg/whitebox_kb/wisdom/test_python_self_bootstrap.py +160 -160
- package/md_cg/whitebox_kb/wisdom/trigger_words_index.json +4366 -4366
- package/md_cg/whitebox_kb/wisdom/verifier.py +1297 -1297
- package/md_cg/writelimit.py +356 -356
- package/md_cg/writepipe.py +20 -8
- package/package.json +101 -96
- package/skills/plugin.json +54 -54
- package/skills/skills/designer-perspective/SKILL.md +158 -158
- package/skills/skills/designer-perspective/references/01-observation-position.md +66 -66
- package/skills/skills/designer-perspective/references/02-structure-recognition.md +62 -62
- package/skills/skills/designer-perspective/references/03-direction-judgment.md +55 -55
- package/skills/skills/designer-perspective/references/04-qualification-verdict.md +72 -72
- package/skills/skills/designer-perspective/references/05-condition-attribution.md +74 -74
- package/skills/skills/designer-perspective/scripts/designer.py +545 -545
- package/skills/skills/designer-perspective/tests/cases.jsonl +17 -17
- package/skills/skills/designer-perspective/tests/selftest.py +61 -61
- package/skills/skills/lingshu-browser/SKILL.md +60 -60
- package/skills/skills/lingshu-compiler/SKILL.md +56 -56
- package/skills/skills/lingshu-compiler/units/analyze-type-infer/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/check-name-real/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-assign/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-expr-tree/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-full-pipeline/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-func-def/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-if-then/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-logic-expr/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-recursive/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-scope/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-type-check/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-while/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0010c4bf/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0355bffb/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0361708a/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-054a0414/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-05a1691a/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-05eeed1e/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0622a1f6/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-08b54217/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0a62b70c/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0ab24d00/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0e093688/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0e82b966/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0ee9b9b9/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0f3787e6/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-1028685f/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-11897630/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-16661b9b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-1f722303/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-25be1262/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-2a76ba07/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-2dbea54a/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-2df52f16/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-2ec2c9d2/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-2f8c8f39/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-38378ac7/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-39457d2e/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-39fb5926/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-47f4fbfa/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-4a8cd1f1/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-4b230b6b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-4cbbda95/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-4d5a68ff/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-56dc9bdd/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-57e76ebe/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-61ff016b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-63eae588/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-64c4224b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-66377955/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-674ab4f6/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-6af76fd6/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-6d979db2/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-6de326c0/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-6f1c0eea/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-724d6c9b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-7690177f/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-7b229a7d/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-7f471b3a/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-815cad08/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-83c61634/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-8c798c81/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-8dd747ac/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-90324d0a/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-94b8d72d/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-94f12231/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-95937c16/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-98a5625b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-98b4c42f/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-98e3894a/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-9bdfe4b8/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-9d9b4e83/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-9f7be5ad/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-a6daf076/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-a7995a0c/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-a8399248/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-aabbd099/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-afe169d8/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-b0678bda/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-b09bd196/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-b1396e23/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-b9b31ce0/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-c10264a7/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-cb1e8e4b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-ccafd438/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-cda9c262/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-ce648068/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-cf5776a4/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-d974e5d3/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-e3979fd3/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-eb1cf2b5/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-ecb30d5b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-f8c8b24b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-f99fedbe/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-fa8ff5f7/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-fe1b058d/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/lex-chinese-program/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/lex-dao-de-jing/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/lex-nine-chapters/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-arithmetic/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-array-ops/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-closure-call/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-closure-create/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-compare/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-cond-jump/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-cond-space/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-exception/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-func-call/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-loop-run/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-profiling/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-refcount/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-run-loop/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-short-circuit/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-stack-guard/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-stack-ops/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-trust-accum/SKILL.md +45 -45
- package/skills/skills/lingshu-graph/SKILL.md +63 -63
- package/skills/skills/lingshu-net/SKILL.md +48 -48
- package/skills/skills/lingshu-os/SKILL.md +64 -64
- package/skills/skills/lingshu-pylang/SKILL.md +71 -71
- package/src/bridge.ts +33 -0
- package/src/hooks.ts +38 -2
- package/src/index.ts +526 -518
- package/src/lib/datapath.ts +326 -326
- package/src/lib/mdcg_client.ts +413 -413
- package/src/lib/mutual.ts +428 -428
- package/src/lib/prompt_safety.ts +62 -62
- package/src/lib/python_path.ts +71 -71
- package/src/lib/roleplay_web.ts +116 -29
- package/src/lib/token_store.ts +13 -3
- package/src/tools.ts +212 -212
- package/zcode/AGENTS.md +11 -3
- package/zcode/README.md +41 -41
- /package/docs/{mdcg → hive}//344/270/273/344/273/243/347/220/206/345/255/220/344/273/243/347/220/206/350/256/260/345/277/206/346/236/266/346/236/204/350/256/276/350/256/241.md" +0 -0
package/md_cg/pooling.py
CHANGED
|
@@ -1,473 +1,485 @@
|
|
|
1
|
-
# -*- coding: utf-8 -*-
|
|
2
|
-
"""召回分池与降权(G8-§七):让「索引/产物类节点」不再吃全局截断额度。
|
|
3
|
-
|
|
4
|
-
**缺口**:`search()` 的 T2/T3 用单条全局额度 `GLOBAL_CAP` 截断候选。库里有大量
|
|
5
|
-
**索引/产物类节点**(`code_` 代码索引、`doc_` 文档索引;真实库实测 1813 条,占知识层
|
|
6
|
-
约 30%)。它们词面上更容易命中查询词,于是在截断点**先把真正的知识节点挤掉**——
|
|
7
|
-
表现为「召回看起来有 20 条,但全是索引条目」。
|
|
8
|
-
|
|
9
|
-
**做法**:把截断额度**显式分池**(不是提高额度):
|
|
10
|
-
· 每个池有 `cap_ratio`(额度占比,**各池之和必须 == 1.0**)与 `weight`(打分乘数);
|
|
11
|
-
· 截断时按池各取其额度,池内保持原有排序;打分时按池乘 `weight`(降权是可复算的显式系数)。
|
|
12
|
-
|
|
13
|
-
**四条纪律(对齐 §七 硬约束)**
|
|
14
|
-
1. **不隐性提高上限**:`cap_ratio` 之和必须恰为 1.0(`validate()` 校验,误差 1e-9),
|
|
15
|
-
任一分池的额度都不来自「额外预算」;分池只重分配,不创造。空池的**未用额度**按
|
|
16
|
-
池序回流给前序池(`backflow=True`)——搬的仍是这 `total` 之内的额度,总账不增。
|
|
17
|
-
2. **降权必须显式可复算**:权重只写在 `WEIGHTS`(或调用方传入的表)里,不藏在打分公式;
|
|
18
|
-
`plan()` 输出完整系数供 A/B 复算。
|
|
19
|
-
3. **默认关闭**:`pools=None` 即**原行为**(`GLOBAL_CAP` 平截),不动默认参数——
|
|
20
|
-
是否启用属载体侧决策;启用需显式传表。
|
|
21
|
-
4. **口径先冻结再复测**:`measure()` / `compare()` 用同一口径(P95 `scanned` +
|
|
22
|
-
截断率 + 截断损失率)在**同一查询集**上跑前/后,差值即副作用;
|
|
23
|
-
`bench_queries()` 从索引确定性取样(自问自答 → 结果标 `proxy=true`,不当判定结论)。
|
|
24
|
-
|
|
25
|
-
零第三方依赖。
|
|
26
|
-
"""
|
|
27
|
-
from __future__ import annotations
|
|
28
|
-
|
|
29
|
-
import math
|
|
30
|
-
import os
|
|
31
|
-
|
|
32
|
-
POOL_KNOWLEDGE = "knowledge"
|
|
33
|
-
POOL_INDEX = "index"
|
|
34
|
-
POOL_NEGATIVE = "negative"
|
|
35
|
-
#: 池序固定 → 截断结果可复现(不依赖 dict 迭代顺序)
|
|
36
|
-
POOL_ORDER = (POOL_KNOWLEDGE, POOL_INDEX, POOL_NEGATIVE)
|
|
37
|
-
|
|
38
|
-
#: 索引/产物类节点的 id 前缀(§七 实测口径:code_ 代码索引 / doc_ 文档索引)
|
|
39
|
-
INDEX_PREFIXES = ("code_", "doc_")
|
|
40
|
-
#: 负记忆层(rejected/unresolved):参与召回但应让位于事实/规则
|
|
41
|
-
NEG_LAYERS = ("rejected", "unresolved")
|
|
42
|
-
|
|
43
|
-
#: 显式权重表:cap_ratio 各池之和必须 == 1.0(不隐性提高上限);weight 为打分乘数
|
|
44
|
-
WEIGHTS = {
|
|
45
|
-
POOL_KNOWLEDGE: {"cap_ratio": 0.70, "weight": 1.00, "desc": "事实/规则,主召回池"},
|
|
46
|
-
POOL_INDEX: {"cap_ratio": 0.20, "weight": 0.60, "desc": "索引/产物(code_/doc_),降权"},
|
|
47
|
-
POOL_NEGATIVE: {"cap_ratio": 0.10, "weight": 0.90, "desc": "负记忆,参与但不压制正记忆"},
|
|
48
|
-
}
|
|
49
|
-
|
|
50
|
-
#: 载体侧总开关(默认关;`pools` 显式给出时优先于本变量)
|
|
51
|
-
ENV_SWITCH = "MDCG_POOLING"
|
|
52
|
-
|
|
53
|
-
_RATIO_EPS = 1e-9
|
|
54
|
-
|
|
55
|
-
|
|
56
|
-
class PoolError(ValueError):
|
|
57
|
-
"""分池配置非法(额度之和不为一 / 池名缺失 / 系数非正)。"""
|
|
58
|
-
|
|
59
|
-
|
|
60
|
-
# --------------------------------------------------------------------------
|
|
61
|
-
# 分类 / 校验 / 计划
|
|
62
|
-
# --------------------------------------------------------------------------
|
|
63
|
-
|
|
64
|
-
# 生效条件:pools 为 None 或 False 时返回 None;pools is True 时先替换为模块常量 WEIGHTS 再交 validate;pools 为其他值(含 dict)时直接交 validate(pools)。
|
|
65
|
-
def resolve(pools):
|
|
66
|
-
"""把 `pools` 参数解成生效配置:None→关闭;True→内置表;dict→校验后副本。"""
|
|
67
|
-
if pools is None or pools is False:
|
|
68
|
-
return None
|
|
69
|
-
if pools is True:
|
|
70
|
-
pools = WEIGHTS
|
|
71
|
-
return validate(pools)
|
|
72
|
-
|
|
73
|
-
|
|
74
|
-
# 生效条件:entry 为假值(含 None)时按 entry or {} 处理,其 "layer" 去假值后经 str() 属模块常量 NEG_LAYERS → 返回 POOL_NEGATIVE;否则 node_id 去假值转 str 后以模块常量 INDEX_PREFIXES 起始,或 entry 的 "tags"(假值按 [])小写后任一元素恰为 index/artifact/code_index/doc_index → 返回 POOL_INDEX;其余 → POOL_KNOWLEDGE。
|
|
75
|
-
def pool_of(node_id, entry=None) -> str:
|
|
76
|
-
"""节点归池(确定性、只看 id 前缀 / 层 / 标签,不读文件)。"""
|
|
77
|
-
e = entry or {}
|
|
78
|
-
if str(e.get("layer") or "") in NEG_LAYERS:
|
|
79
|
-
return POOL_NEGATIVE
|
|
80
|
-
nid = str(node_id or "")
|
|
81
|
-
if nid.startswith(INDEX_PREFIXES):
|
|
82
|
-
return POOL_INDEX
|
|
83
|
-
tags = [str(t).lower() for t in (e.get("tags") or [])]
|
|
84
|
-
if any(t in ("index", "artifact", "code_index", "doc_index") for t in tags):
|
|
85
|
-
return POOL_INDEX
|
|
86
|
-
return POOL_KNOWLEDGE
|
|
87
|
-
|
|
88
|
-
|
|
89
|
-
# 生效条件:pools 非 dict、缺 POOL_ORDER 中任一池、pools[p] or {} 不是 dict、float(spec.get("cap_ratio")) 或 float(spec.get("weight", 1.0)) 抛 TypeError/ValueError、ratio<=0、weight<=0、或各池 cap_ratio 之和与 1.0 之差超过 _RATIO_EPS 时抛 PoolError,全部通过才返回各项为 float 的 out(desc 经 spec.get("desc") or WEIGHTS[p]["desc"] 补齐)。
|
|
90
|
-
def validate(pools) -> dict:
|
|
91
|
-
"""校验并归一化权重表(**硬约束:额度之和必须恰为 1.0**)。"""
|
|
92
|
-
if not isinstance(pools, dict):
|
|
93
|
-
raise PoolError(f"分池表必须是 dict,得到 {type(pools).__name__}")
|
|
94
|
-
missing = [p for p in POOL_ORDER if p not in pools]
|
|
95
|
-
if missing:
|
|
96
|
-
raise PoolError(f"分池表缺池:{missing}(必须齐备 {list(POOL_ORDER)})")
|
|
97
|
-
out, total = {}, 0.0
|
|
98
|
-
for p in POOL_ORDER:
|
|
99
|
-
spec = pools[p] or {}
|
|
100
|
-
if not isinstance(spec, dict):
|
|
101
|
-
raise PoolError(f"池 {p} 的配置必须是 dict")
|
|
102
|
-
try:
|
|
103
|
-
ratio = float(spec.get("cap_ratio"))
|
|
104
|
-
weight = float(spec.get("weight", 1.0))
|
|
105
|
-
except (TypeError, ValueError):
|
|
106
|
-
raise PoolError(f"池 {p} 的 cap_ratio/weight 必须是数字")
|
|
107
|
-
if ratio <= 0:
|
|
108
|
-
raise PoolError(f"池 {p} 的 cap_ratio 必须 > 0(得到 {ratio})")
|
|
109
|
-
if weight <= 0:
|
|
110
|
-
raise PoolError(f"池 {p} 的 weight 必须 > 0(得到 {weight})")
|
|
111
|
-
out[p] = {"cap_ratio": ratio, "weight": weight,
|
|
112
|
-
"desc": spec.get("desc") or WEIGHTS[p]["desc"]}
|
|
113
|
-
total += ratio
|
|
114
|
-
if abs(total - 1.0) > _RATIO_EPS:
|
|
115
|
-
raise PoolError(f"cap_ratio 之和必须恰为 1.0(得到 {total:.9f})"
|
|
116
|
-
f"——分池只重分配额度,不得隐性提高上限")
|
|
117
|
-
return out
|
|
118
|
-
|
|
119
|
-
|
|
120
|
-
# 生效条件:total 先 int(total),total<=0 时各池返回 0;total < len(POOL_ORDER) 时把 total 全给 POOL_KNOWLEDGE、其余池为 0;否则每池保底 1、余量按 left*float(pools[p]["cap_ratio"]) 取 floor 后,余数按小数部分降序(并列按 POOL_ORDER 序)补 1,返回额度之和恰为 total 的 out。
|
|
121
|
-
def caps(total: int, pools) -> dict:
|
|
122
|
-
"""按比例分配额度;**各池额度之和恰等于 total**。
|
|
123
|
-
|
|
124
|
-
先每池保底 1(否则小额度下某一池会被完全饿死),余下按比例用
|
|
125
|
-
**最大余数法**分配、同余数按池序 → 结果确定可复现;总账恒等于 total。
|
|
126
|
-
额度太小(< 池数)时无法每池保底,全部给主池。
|
|
127
|
-
"""
|
|
128
|
-
total = int(total)
|
|
129
|
-
if total <= 0:
|
|
130
|
-
return {p: 0 for p in POOL_ORDER}
|
|
131
|
-
if total < len(POOL_ORDER):
|
|
132
|
-
return {p: (total if p == POOL_KNOWLEDGE else 0) for p in POOL_ORDER}
|
|
133
|
-
out = {p: 1 for p in POOL_ORDER}
|
|
134
|
-
left = total - len(POOL_ORDER)
|
|
135
|
-
raw = {p: left * float(pools[p]["cap_ratio"]) for p in POOL_ORDER}
|
|
136
|
-
for p in POOL_ORDER:
|
|
137
|
-
out[p] += int(math.floor(raw[p]))
|
|
138
|
-
rem = total - sum(out.values())
|
|
139
|
-
if rem > 0: # 余数优先给「小数部分最大」的池
|
|
140
|
-
order = sorted(POOL_ORDER,
|
|
141
|
-
key=lambda p: (-(raw[p] - math.floor(raw[p])),
|
|
142
|
-
POOL_ORDER.index(p)))
|
|
143
|
-
for p in order[:min(rem, len(order))]:
|
|
144
|
-
out[p] += 1
|
|
145
|
-
return out
|
|
146
|
-
|
|
147
|
-
|
|
148
|
-
# 生效条件:total 给出后,pools 为 None/False 等使 resolve(pools) 返回假值时返回 {'enabled': False, 'total': int(total), 'note': ...};cfg 为真时用 caps(total, cfg) 并逐池取 cfg[p]["weight"]/cfg[p]["cap_ratio"],返回启用态计划。
|
|
149
|
-
def plan(total: int, pools=None) -> dict:
|
|
150
|
-
"""分池计划(供审计 / A/B 复算):额度 + 系数 + 是否启用。"""
|
|
151
|
-
cfg = resolve(pools)
|
|
152
|
-
if not cfg:
|
|
153
|
-
return {"enabled": False, "total": int(total),
|
|
154
|
-
"note": "分池关闭 → 原行为(GLOBAL_CAP 平截)"}
|
|
155
|
-
c = caps(total, cfg)
|
|
156
|
-
return {"enabled": True, "total": int(total), "caps": c,
|
|
157
|
-
"weights": {p: cfg[p]["weight"] for p in POOL_ORDER},
|
|
158
|
-
"cap_ratio": {p: cfg[p]["cap_ratio"] for p in POOL_ORDER},
|
|
159
|
-
"cap_sum": sum(c.values()),
|
|
160
|
-
"index_prefixes": list(INDEX_PREFIXES)}
|
|
161
|
-
|
|
162
|
-
|
|
163
|
-
# 生效条件:pools 为 None/False 使 resolve(pools) 返回假值时返回 1.0;cfg 为真时返回 float(cfg[pool_of(node_id, entry)]["weight"]),其中 entry 缺省为 None。
|
|
164
|
-
def weight_of(node_id, entry=None, pools=None) -> float:
|
|
165
|
-
"""节点的打分乘数(未启用分池 → 1.0,保证原行为)。"""
|
|
166
|
-
cfg = resolve(pools)
|
|
167
|
-
if not cfg:
|
|
168
|
-
return 1.0
|
|
169
|
-
return float(cfg[pool_of(node_id, entry)]["weight"])
|
|
170
|
-
|
|
171
|
-
|
|
172
|
-
# 生效条件:docs 与 total 给出后无条件调用 take(docs, total, pools=pools, key_of=key_of) 并只返回其第 0 项,pools 与 key_of 缺省为 None 原样透传。
|
|
173
|
-
def allocate(docs, total: int, *, pools=None, key_of=None) -> list:
|
|
174
|
-
"""分池截断(只要结果;需要各池实取数用 `take()`)。未启用 → 平截(原行为)。
|
|
175
|
-
|
|
176
|
-
`key_of(doc)` 需返回 `(node_id, entry)`;缺省则视 doc 为 `(id, entry)` 元组。
|
|
177
|
-
输出顺序恒为「池序 + 池内原序」(与 `POOL_ORDER` 绑定,可复现)。
|
|
178
|
-
"""
|
|
179
|
-
return take(docs, total, pools=pools, key_of=key_of)[0]
|
|
180
|
-
|
|
181
|
-
|
|
182
|
-
# 生效条件:cfg 为真时先 quota=caps(total, cfg),遍历 docs 时 key_of 为真则用 key_of(d) 解出 (nid, entry)、否则把 d 解包为 (nid, entry),按 pool_of(nid, entry) 入 buckets;backflow 为真时以 total 减去各池 min(len(buckets[p]), quota[p]) 得 left,按 POOL_ORDER 只对尚有 room 的池补 quota 到 left 用尽为止,返回 (buckets, quota)。
|
|
183
|
-
def _bucketize(docs, total: int, cfg, key_of, backflow: bool):
|
|
184
|
-
"""归池 + 分额 + 回流 → `(buckets, quota)`(`take` 与 `cut_report` 共用)。"""
|
|
185
|
-
quota = caps(total, cfg)
|
|
186
|
-
buckets = {p: [] for p in POOL_ORDER}
|
|
187
|
-
for d in docs:
|
|
188
|
-
nid, entry = key_of(d) if key_of else d
|
|
189
|
-
buckets[pool_of(nid, entry)].append(d)
|
|
190
|
-
if backflow:
|
|
191
|
-
|
|
192
|
-
|
|
193
|
-
|
|
194
|
-
|
|
195
|
-
|
|
196
|
-
|
|
197
|
-
|
|
198
|
-
|
|
199
|
-
|
|
200
|
-
|
|
201
|
-
|
|
202
|
-
|
|
203
|
-
|
|
204
|
-
|
|
205
|
-
|
|
206
|
-
|
|
207
|
-
|
|
208
|
-
|
|
209
|
-
|
|
210
|
-
|
|
211
|
-
|
|
212
|
-
|
|
213
|
-
|
|
214
|
-
|
|
215
|
-
|
|
216
|
-
|
|
217
|
-
|
|
218
|
-
|
|
219
|
-
|
|
220
|
-
|
|
221
|
-
|
|
222
|
-
|
|
223
|
-
|
|
224
|
-
|
|
225
|
-
|
|
226
|
-
|
|
227
|
-
|
|
228
|
-
|
|
229
|
-
|
|
230
|
-
|
|
231
|
-
|
|
232
|
-
|
|
233
|
-
|
|
234
|
-
|
|
235
|
-
|
|
236
|
-
|
|
237
|
-
|
|
238
|
-
|
|
239
|
-
|
|
240
|
-
|
|
241
|
-
|
|
242
|
-
|
|
243
|
-
|
|
244
|
-
|
|
245
|
-
|
|
246
|
-
|
|
247
|
-
|
|
248
|
-
|
|
249
|
-
|
|
250
|
-
|
|
251
|
-
|
|
252
|
-
|
|
253
|
-
|
|
254
|
-
|
|
255
|
-
|
|
256
|
-
""
|
|
257
|
-
|
|
258
|
-
|
|
259
|
-
|
|
260
|
-
|
|
261
|
-
|
|
262
|
-
|
|
263
|
-
|
|
264
|
-
|
|
265
|
-
|
|
266
|
-
|
|
267
|
-
|
|
268
|
-
|
|
269
|
-
|
|
270
|
-
|
|
271
|
-
|
|
272
|
-
|
|
273
|
-
|
|
274
|
-
|
|
275
|
-
|
|
276
|
-
|
|
277
|
-
|
|
278
|
-
|
|
279
|
-
|
|
280
|
-
|
|
281
|
-
|
|
282
|
-
|
|
283
|
-
|
|
284
|
-
|
|
285
|
-
|
|
286
|
-
|
|
287
|
-
#
|
|
288
|
-
|
|
289
|
-
|
|
290
|
-
|
|
291
|
-
|
|
292
|
-
|
|
293
|
-
|
|
294
|
-
|
|
295
|
-
|
|
296
|
-
|
|
297
|
-
|
|
298
|
-
|
|
299
|
-
|
|
300
|
-
|
|
301
|
-
|
|
302
|
-
|
|
303
|
-
|
|
304
|
-
|
|
305
|
-
|
|
306
|
-
|
|
307
|
-
|
|
308
|
-
|
|
309
|
-
|
|
310
|
-
|
|
311
|
-
|
|
312
|
-
|
|
313
|
-
|
|
314
|
-
|
|
315
|
-
|
|
316
|
-
|
|
317
|
-
|
|
318
|
-
|
|
319
|
-
|
|
320
|
-
|
|
321
|
-
|
|
322
|
-
|
|
323
|
-
|
|
324
|
-
|
|
325
|
-
|
|
326
|
-
|
|
327
|
-
|
|
328
|
-
|
|
329
|
-
|
|
330
|
-
|
|
331
|
-
|
|
332
|
-
|
|
333
|
-
|
|
334
|
-
|
|
335
|
-
|
|
336
|
-
|
|
337
|
-
|
|
338
|
-
|
|
339
|
-
|
|
340
|
-
|
|
341
|
-
|
|
342
|
-
|
|
343
|
-
|
|
344
|
-
|
|
345
|
-
"""
|
|
346
|
-
|
|
347
|
-
|
|
348
|
-
|
|
349
|
-
|
|
350
|
-
|
|
351
|
-
|
|
352
|
-
|
|
353
|
-
|
|
354
|
-
|
|
355
|
-
|
|
356
|
-
|
|
357
|
-
|
|
358
|
-
|
|
359
|
-
|
|
360
|
-
|
|
361
|
-
|
|
362
|
-
|
|
363
|
-
|
|
364
|
-
|
|
365
|
-
|
|
366
|
-
|
|
367
|
-
|
|
368
|
-
|
|
369
|
-
|
|
370
|
-
|
|
371
|
-
|
|
372
|
-
|
|
373
|
-
|
|
374
|
-
|
|
375
|
-
|
|
376
|
-
|
|
377
|
-
|
|
378
|
-
|
|
379
|
-
|
|
380
|
-
|
|
381
|
-
|
|
382
|
-
|
|
383
|
-
|
|
384
|
-
|
|
385
|
-
|
|
386
|
-
|
|
387
|
-
|
|
388
|
-
|
|
389
|
-
|
|
390
|
-
|
|
391
|
-
|
|
392
|
-
|
|
393
|
-
|
|
394
|
-
|
|
395
|
-
|
|
396
|
-
|
|
397
|
-
"
|
|
398
|
-
|
|
399
|
-
|
|
400
|
-
|
|
401
|
-
|
|
402
|
-
"
|
|
403
|
-
|
|
404
|
-
|
|
405
|
-
|
|
406
|
-
|
|
407
|
-
|
|
408
|
-
|
|
409
|
-
|
|
410
|
-
|
|
411
|
-
|
|
412
|
-
|
|
413
|
-
|
|
414
|
-
|
|
415
|
-
|
|
416
|
-
|
|
417
|
-
|
|
418
|
-
|
|
419
|
-
|
|
420
|
-
|
|
421
|
-
|
|
422
|
-
|
|
423
|
-
|
|
424
|
-
|
|
425
|
-
|
|
426
|
-
|
|
427
|
-
|
|
428
|
-
|
|
429
|
-
|
|
430
|
-
|
|
431
|
-
|
|
432
|
-
|
|
433
|
-
|
|
434
|
-
|
|
435
|
-
|
|
436
|
-
|
|
437
|
-
|
|
438
|
-
|
|
439
|
-
|
|
440
|
-
|
|
441
|
-
|
|
442
|
-
|
|
443
|
-
|
|
444
|
-
|
|
445
|
-
"
|
|
446
|
-
"
|
|
447
|
-
|
|
448
|
-
|
|
449
|
-
|
|
450
|
-
|
|
451
|
-
|
|
452
|
-
|
|
453
|
-
|
|
454
|
-
|
|
455
|
-
|
|
456
|
-
|
|
457
|
-
|
|
458
|
-
|
|
459
|
-
|
|
460
|
-
|
|
461
|
-
"
|
|
462
|
-
|
|
463
|
-
|
|
464
|
-
|
|
465
|
-
|
|
466
|
-
|
|
467
|
-
|
|
468
|
-
|
|
469
|
-
|
|
470
|
-
|
|
471
|
-
|
|
472
|
-
|
|
1
|
+
# -*- coding: utf-8 -*-
|
|
2
|
+
"""召回分池与降权(G8-§七):让「索引/产物类节点」不再吃全局截断额度。
|
|
3
|
+
|
|
4
|
+
**缺口**:`search()` 的 T2/T3 用单条全局额度 `GLOBAL_CAP` 截断候选。库里有大量
|
|
5
|
+
**索引/产物类节点**(`code_` 代码索引、`doc_` 文档索引;真实库实测 1813 条,占知识层
|
|
6
|
+
约 30%)。它们词面上更容易命中查询词,于是在截断点**先把真正的知识节点挤掉**——
|
|
7
|
+
表现为「召回看起来有 20 条,但全是索引条目」。
|
|
8
|
+
|
|
9
|
+
**做法**:把截断额度**显式分池**(不是提高额度):
|
|
10
|
+
· 每个池有 `cap_ratio`(额度占比,**各池之和必须 == 1.0**)与 `weight`(打分乘数);
|
|
11
|
+
· 截断时按池各取其额度,池内保持原有排序;打分时按池乘 `weight`(降权是可复算的显式系数)。
|
|
12
|
+
|
|
13
|
+
**四条纪律(对齐 §七 硬约束)**
|
|
14
|
+
1. **不隐性提高上限**:`cap_ratio` 之和必须恰为 1.0(`validate()` 校验,误差 1e-9),
|
|
15
|
+
任一分池的额度都不来自「额外预算」;分池只重分配,不创造。空池的**未用额度**按
|
|
16
|
+
池序回流给前序池(`backflow=True`)——搬的仍是这 `total` 之内的额度,总账不增。
|
|
17
|
+
2. **降权必须显式可复算**:权重只写在 `WEIGHTS`(或调用方传入的表)里,不藏在打分公式;
|
|
18
|
+
`plan()` 输出完整系数供 A/B 复算。
|
|
19
|
+
3. **默认关闭**:`pools=None` 即**原行为**(`GLOBAL_CAP` 平截),不动默认参数——
|
|
20
|
+
是否启用属载体侧决策;启用需显式传表。
|
|
21
|
+
4. **口径先冻结再复测**:`measure()` / `compare()` 用同一口径(P95 `scanned` +
|
|
22
|
+
截断率 + 截断损失率)在**同一查询集**上跑前/后,差值即副作用;
|
|
23
|
+
`bench_queries()` 从索引确定性取样(自问自答 → 结果标 `proxy=true`,不当判定结论)。
|
|
24
|
+
|
|
25
|
+
零第三方依赖。
|
|
26
|
+
"""
|
|
27
|
+
from __future__ import annotations
|
|
28
|
+
|
|
29
|
+
import math
|
|
30
|
+
import os
|
|
31
|
+
|
|
32
|
+
POOL_KNOWLEDGE = "knowledge"
|
|
33
|
+
POOL_INDEX = "index"
|
|
34
|
+
POOL_NEGATIVE = "negative"
|
|
35
|
+
#: 池序固定 → 截断结果可复现(不依赖 dict 迭代顺序)
|
|
36
|
+
POOL_ORDER = (POOL_KNOWLEDGE, POOL_INDEX, POOL_NEGATIVE)
|
|
37
|
+
|
|
38
|
+
#: 索引/产物类节点的 id 前缀(§七 实测口径:code_ 代码索引 / doc_ 文档索引)
|
|
39
|
+
INDEX_PREFIXES = ("code_", "doc_")
|
|
40
|
+
#: 负记忆层(rejected/unresolved):参与召回但应让位于事实/规则
|
|
41
|
+
NEG_LAYERS = ("rejected", "unresolved")
|
|
42
|
+
|
|
43
|
+
#: 显式权重表:cap_ratio 各池之和必须 == 1.0(不隐性提高上限);weight 为打分乘数
|
|
44
|
+
WEIGHTS = {
|
|
45
|
+
POOL_KNOWLEDGE: {"cap_ratio": 0.70, "weight": 1.00, "desc": "事实/规则,主召回池"},
|
|
46
|
+
POOL_INDEX: {"cap_ratio": 0.20, "weight": 0.60, "desc": "索引/产物(code_/doc_),降权"},
|
|
47
|
+
POOL_NEGATIVE: {"cap_ratio": 0.10, "weight": 0.90, "desc": "负记忆,参与但不压制正记忆"},
|
|
48
|
+
}
|
|
49
|
+
|
|
50
|
+
#: 载体侧总开关(默认关;`pools` 显式给出时优先于本变量)
|
|
51
|
+
ENV_SWITCH = "MDCG_POOLING"
|
|
52
|
+
|
|
53
|
+
_RATIO_EPS = 1e-9
|
|
54
|
+
|
|
55
|
+
|
|
56
|
+
class PoolError(ValueError):
|
|
57
|
+
"""分池配置非法(额度之和不为一 / 池名缺失 / 系数非正)。"""
|
|
58
|
+
|
|
59
|
+
|
|
60
|
+
# --------------------------------------------------------------------------
|
|
61
|
+
# 分类 / 校验 / 计划
|
|
62
|
+
# --------------------------------------------------------------------------
|
|
63
|
+
|
|
64
|
+
# 生效条件:pools 为 None 或 False 时返回 None;pools is True 时先替换为模块常量 WEIGHTS 再交 validate;pools 为其他值(含 dict)时直接交 validate(pools)。
|
|
65
|
+
def resolve(pools):
|
|
66
|
+
"""把 `pools` 参数解成生效配置:None→关闭;True→内置表;dict→校验后副本。"""
|
|
67
|
+
if pools is None or pools is False:
|
|
68
|
+
return None
|
|
69
|
+
if pools is True:
|
|
70
|
+
pools = WEIGHTS
|
|
71
|
+
return validate(pools)
|
|
72
|
+
|
|
73
|
+
|
|
74
|
+
# 生效条件:entry 为假值(含 None)时按 entry or {} 处理,其 "layer" 去假值后经 str() 属模块常量 NEG_LAYERS → 返回 POOL_NEGATIVE;否则 node_id 去假值转 str 后以模块常量 INDEX_PREFIXES 起始,或 entry 的 "tags"(假值按 [])小写后任一元素恰为 index/artifact/code_index/doc_index → 返回 POOL_INDEX;其余 → POOL_KNOWLEDGE。
|
|
75
|
+
def pool_of(node_id, entry=None) -> str:
|
|
76
|
+
"""节点归池(确定性、只看 id 前缀 / 层 / 标签,不读文件)。"""
|
|
77
|
+
e = entry or {}
|
|
78
|
+
if str(e.get("layer") or "") in NEG_LAYERS:
|
|
79
|
+
return POOL_NEGATIVE
|
|
80
|
+
nid = str(node_id or "")
|
|
81
|
+
if nid.startswith(INDEX_PREFIXES):
|
|
82
|
+
return POOL_INDEX
|
|
83
|
+
tags = [str(t).lower() for t in (e.get("tags") or [])]
|
|
84
|
+
if any(t in ("index", "artifact", "code_index", "doc_index") for t in tags):
|
|
85
|
+
return POOL_INDEX
|
|
86
|
+
return POOL_KNOWLEDGE
|
|
87
|
+
|
|
88
|
+
|
|
89
|
+
# 生效条件:pools 非 dict、缺 POOL_ORDER 中任一池、pools[p] or {} 不是 dict、float(spec.get("cap_ratio")) 或 float(spec.get("weight", 1.0)) 抛 TypeError/ValueError、ratio<=0、weight<=0、或各池 cap_ratio 之和与 1.0 之差超过 _RATIO_EPS 时抛 PoolError,全部通过才返回各项为 float 的 out(desc 经 spec.get("desc") or WEIGHTS[p]["desc"] 补齐)。
|
|
90
|
+
def validate(pools) -> dict:
|
|
91
|
+
"""校验并归一化权重表(**硬约束:额度之和必须恰为 1.0**)。"""
|
|
92
|
+
if not isinstance(pools, dict):
|
|
93
|
+
raise PoolError(f"分池表必须是 dict,得到 {type(pools).__name__}")
|
|
94
|
+
missing = [p for p in POOL_ORDER if p not in pools]
|
|
95
|
+
if missing:
|
|
96
|
+
raise PoolError(f"分池表缺池:{missing}(必须齐备 {list(POOL_ORDER)})")
|
|
97
|
+
out, total = {}, 0.0
|
|
98
|
+
for p in POOL_ORDER:
|
|
99
|
+
spec = pools[p] or {}
|
|
100
|
+
if not isinstance(spec, dict):
|
|
101
|
+
raise PoolError(f"池 {p} 的配置必须是 dict")
|
|
102
|
+
try:
|
|
103
|
+
ratio = float(spec.get("cap_ratio"))
|
|
104
|
+
weight = float(spec.get("weight", 1.0))
|
|
105
|
+
except (TypeError, ValueError):
|
|
106
|
+
raise PoolError(f"池 {p} 的 cap_ratio/weight 必须是数字")
|
|
107
|
+
if ratio <= 0:
|
|
108
|
+
raise PoolError(f"池 {p} 的 cap_ratio 必须 > 0(得到 {ratio})")
|
|
109
|
+
if weight <= 0:
|
|
110
|
+
raise PoolError(f"池 {p} 的 weight 必须 > 0(得到 {weight})")
|
|
111
|
+
out[p] = {"cap_ratio": ratio, "weight": weight,
|
|
112
|
+
"desc": spec.get("desc") or WEIGHTS[p]["desc"]}
|
|
113
|
+
total += ratio
|
|
114
|
+
if abs(total - 1.0) > _RATIO_EPS:
|
|
115
|
+
raise PoolError(f"cap_ratio 之和必须恰为 1.0(得到 {total:.9f})"
|
|
116
|
+
f"——分池只重分配额度,不得隐性提高上限")
|
|
117
|
+
return out
|
|
118
|
+
|
|
119
|
+
|
|
120
|
+
# 生效条件:total 先 int(total),total<=0 时各池返回 0;total < len(POOL_ORDER) 时把 total 全给 POOL_KNOWLEDGE、其余池为 0;否则每池保底 1、余量按 left*float(pools[p]["cap_ratio"]) 取 floor 后,余数按小数部分降序(并列按 POOL_ORDER 序)补 1,返回额度之和恰为 total 的 out。
|
|
121
|
+
def caps(total: int, pools) -> dict:
|
|
122
|
+
"""按比例分配额度;**各池额度之和恰等于 total**。
|
|
123
|
+
|
|
124
|
+
先每池保底 1(否则小额度下某一池会被完全饿死),余下按比例用
|
|
125
|
+
**最大余数法**分配、同余数按池序 → 结果确定可复现;总账恒等于 total。
|
|
126
|
+
额度太小(< 池数)时无法每池保底,全部给主池。
|
|
127
|
+
"""
|
|
128
|
+
total = int(total)
|
|
129
|
+
if total <= 0:
|
|
130
|
+
return {p: 0 for p in POOL_ORDER}
|
|
131
|
+
if total < len(POOL_ORDER):
|
|
132
|
+
return {p: (total if p == POOL_KNOWLEDGE else 0) for p in POOL_ORDER}
|
|
133
|
+
out = {p: 1 for p in POOL_ORDER}
|
|
134
|
+
left = total - len(POOL_ORDER)
|
|
135
|
+
raw = {p: left * float(pools[p]["cap_ratio"]) for p in POOL_ORDER}
|
|
136
|
+
for p in POOL_ORDER:
|
|
137
|
+
out[p] += int(math.floor(raw[p]))
|
|
138
|
+
rem = total - sum(out.values())
|
|
139
|
+
if rem > 0: # 余数优先给「小数部分最大」的池
|
|
140
|
+
order = sorted(POOL_ORDER,
|
|
141
|
+
key=lambda p: (-(raw[p] - math.floor(raw[p])),
|
|
142
|
+
POOL_ORDER.index(p)))
|
|
143
|
+
for p in order[:min(rem, len(order))]:
|
|
144
|
+
out[p] += 1
|
|
145
|
+
return out
|
|
146
|
+
|
|
147
|
+
|
|
148
|
+
# 生效条件:total 给出后,pools 为 None/False 等使 resolve(pools) 返回假值时返回 {'enabled': False, 'total': int(total), 'note': ...};cfg 为真时用 caps(total, cfg) 并逐池取 cfg[p]["weight"]/cfg[p]["cap_ratio"],返回启用态计划。
|
|
149
|
+
def plan(total: int, pools=None) -> dict:
|
|
150
|
+
"""分池计划(供审计 / A/B 复算):额度 + 系数 + 是否启用。"""
|
|
151
|
+
cfg = resolve(pools)
|
|
152
|
+
if not cfg:
|
|
153
|
+
return {"enabled": False, "total": int(total),
|
|
154
|
+
"note": "分池关闭 → 原行为(GLOBAL_CAP 平截)"}
|
|
155
|
+
c = caps(total, cfg)
|
|
156
|
+
return {"enabled": True, "total": int(total), "caps": c,
|
|
157
|
+
"weights": {p: cfg[p]["weight"] for p in POOL_ORDER},
|
|
158
|
+
"cap_ratio": {p: cfg[p]["cap_ratio"] for p in POOL_ORDER},
|
|
159
|
+
"cap_sum": sum(c.values()),
|
|
160
|
+
"index_prefixes": list(INDEX_PREFIXES)}
|
|
161
|
+
|
|
162
|
+
|
|
163
|
+
# 生效条件:pools 为 None/False 使 resolve(pools) 返回假值时返回 1.0;cfg 为真时返回 float(cfg[pool_of(node_id, entry)]["weight"]),其中 entry 缺省为 None。
|
|
164
|
+
def weight_of(node_id, entry=None, pools=None) -> float:
|
|
165
|
+
"""节点的打分乘数(未启用分池 → 1.0,保证原行为)。"""
|
|
166
|
+
cfg = resolve(pools)
|
|
167
|
+
if not cfg:
|
|
168
|
+
return 1.0
|
|
169
|
+
return float(cfg[pool_of(node_id, entry)]["weight"])
|
|
170
|
+
|
|
171
|
+
|
|
172
|
+
# 生效条件:docs 与 total 给出后无条件调用 take(docs, total, pools=pools, key_of=key_of) 并只返回其第 0 项,pools 与 key_of 缺省为 None 原样透传。
|
|
173
|
+
def allocate(docs, total: int, *, pools=None, key_of=None) -> list:
|
|
174
|
+
"""分池截断(只要结果;需要各池实取数用 `take()`)。未启用 → 平截(原行为)。
|
|
175
|
+
|
|
176
|
+
`key_of(doc)` 需返回 `(node_id, entry)`;缺省则视 doc 为 `(id, entry)` 元组。
|
|
177
|
+
输出顺序恒为「池序 + 池内原序」(与 `POOL_ORDER` 绑定,可复现)。
|
|
178
|
+
"""
|
|
179
|
+
return take(docs, total, pools=pools, key_of=key_of)[0]
|
|
180
|
+
|
|
181
|
+
|
|
182
|
+
# 生效条件:cfg 为真时先 quota=caps(total, cfg),遍历 docs 时 key_of 为真则用 key_of(d) 解出 (nid, entry)、否则把 d 解包为 (nid, entry),按 pool_of(nid, entry) 入 buckets;backflow 为真时以 total 减去各池 min(len(buckets[p]), quota[p]) 得 left,按 POOL_ORDER 只对尚有 room 的池补 quota 到 left 用尽为止,返回 (buckets, quota)。
|
|
183
|
+
def _bucketize(docs, total: int, cfg, key_of, backflow: bool):
|
|
184
|
+
"""归池 + 分额 + 回流 → `(buckets, quota)`(`take` 与 `cut_report` 共用)。"""
|
|
185
|
+
quota = caps(total, cfg)
|
|
186
|
+
buckets = {p: [] for p in POOL_ORDER}
|
|
187
|
+
for d in docs:
|
|
188
|
+
nid, entry = key_of(d) if key_of else d
|
|
189
|
+
buckets[pool_of(nid, entry)].append(d)
|
|
190
|
+
if backflow:
|
|
191
|
+
# 回流 = 额度**转移**(批次 20,issue #30②):先把各池额度削到实际
|
|
192
|
+
# 占用(min(len, quota)——用不满的部分交回总池),再按池序转给有
|
|
193
|
+
# 余量(len > quota)的池。守恒式:回流后 Σquota = min(total, 候选
|
|
194
|
+
# 总量)——候选充足时恰等于 total;候选不足(total>Σlen)时,超出
|
|
195
|
+
# 候选的额度无池可回流(转移必须有接受方),如实缩到候选总量。
|
|
196
|
+
# 旧实现只加不扣——left_init 全额追加而无对应扣减,Σquota 可超
|
|
197
|
+
# total(quota 是对外审计数字,失真;taken/picked 数学上与转移
|
|
198
|
+
# 语义一致,一直正确——纯数字修复,零取数行为变化)。
|
|
199
|
+
for p in POOL_ORDER:
|
|
200
|
+
quota[p] = min(len(buckets[p]), quota[p])
|
|
201
|
+
left = total - sum(quota.values())
|
|
202
|
+
for p in POOL_ORDER:
|
|
203
|
+
if left <= 0:
|
|
204
|
+
break
|
|
205
|
+
room = len(buckets[p]) - quota[p]
|
|
206
|
+
if room <= 0:
|
|
207
|
+
continue
|
|
208
|
+
add = min(room, left)
|
|
209
|
+
quota[p] += add
|
|
210
|
+
left -= add
|
|
211
|
+
return buckets, quota
|
|
212
|
+
|
|
213
|
+
|
|
214
|
+
# 生效条件:docs 经 list(docs or [])(None/空容器→[]),pools 为 None/False 使 resolve(pools) 返回假值时返回 (docs[:int(total)], {});cfg 为真时转为 cut_report(docs, total, pools=pools, key_of=key_of, backflow=backflow) 并返回 (picked, report["taken"])。
|
|
215
|
+
def take(docs, total: int, *, pools=None, key_of=None, backflow: bool = True):
|
|
216
|
+
"""分池截断并**回报各池实取数** → `(picked, taken)`。
|
|
217
|
+
|
|
218
|
+
`backflow=True`:空池/候选不足的**未用额度按池序回流给更靠前的池**
|
|
219
|
+
(knowledge ← index ← negative)。回流只搬「本来就没用掉的」额度,
|
|
220
|
+
各池实取之和 **恒 ≤ total**,总账不增——不是隐性加预算,且规则显式、
|
|
221
|
+
结果确定(同一输入必然同一输出)。
|
|
222
|
+
"""
|
|
223
|
+
docs = list(docs or [])
|
|
224
|
+
cfg = resolve(pools)
|
|
225
|
+
if not cfg:
|
|
226
|
+
return docs[:int(total)], {} # 未启用 → 不报池账(别把平截伪装成分池)
|
|
227
|
+
picked, report = cut_report(docs, total, pools=pools, key_of=key_of,
|
|
228
|
+
backflow=backflow)
|
|
229
|
+
return picked, report["taken"]
|
|
230
|
+
|
|
231
|
+
|
|
232
|
+
# 生效条件:docs 经 list(docs or [])、total 经 int(total),pools 为 None/False 使 resolve(pools) 返回假值时返回 (docs[:total], {"enabled": False});cfg 为真时用 _bucketize(docs, total, cfg, key_of, backflow),按 POOL_ORDER 逐池取 buckets[p][:quota[p]] 拼接 picked 并记录 taken/cands/lost,返回启用态完整 report。
|
|
233
|
+
def cut_report(docs, total: int, *, pools=None, key_of=None,
|
|
234
|
+
backflow: bool = True):
|
|
235
|
+
"""同 `take`,但回报**完整池账** → `(picked, report)`。
|
|
236
|
+
|
|
237
|
+
`report = {enabled, total, quota, cands, taken, lost}`:`cands` 为各池
|
|
238
|
+
截断前候选数、`quota` 为计划额度(含回流;回流后 **Σquota =
|
|
239
|
+
min(total, 候选总量)**——候选充足恰等于 total,不足时如实缩到候选总量,
|
|
240
|
+
issue #30②)、`taken` 实取、`lost` 被挤掉(`max(0, cands - taken)`)。
|
|
241
|
+
关闭态返回 `{enabled: False}`——不伪造池账。
|
|
242
|
+
"""
|
|
243
|
+
docs = list(docs or [])
|
|
244
|
+
total = int(total)
|
|
245
|
+
cfg = resolve(pools)
|
|
246
|
+
if not cfg:
|
|
247
|
+
return docs[:total], {"enabled": False}
|
|
248
|
+
buckets, quota = _bucketize(docs, total, cfg, key_of, backflow)
|
|
249
|
+
picked, taken, cands, lost = [], {}, {}, {}
|
|
250
|
+
for p in POOL_ORDER:
|
|
251
|
+
got = buckets[p][:quota[p]]
|
|
252
|
+
picked.extend(got)
|
|
253
|
+
taken[p] = len(got)
|
|
254
|
+
cands[p] = len(buckets[p])
|
|
255
|
+
lost[p] = max(0, len(buckets[p]) - len(got))
|
|
256
|
+
return picked, {"enabled": True, "total": total, "quota": dict(quota),
|
|
257
|
+
"cands": cands, "taken": taken, "lost": lost}
|
|
258
|
+
|
|
259
|
+
|
|
260
|
+
# 生效条件:docs 与 total 给出后无条件调用 take(docs, total, pools=pools, key_of=doc_key) 并只返回其第 0 项,pools 缺省为 None 原样透传。
|
|
261
|
+
def cut(docs, total: int, *, pools=None) -> list:
|
|
262
|
+
"""检索 T2/T3 截断点专用:`docs = [(entry, fm, content)]`(只取结果)。"""
|
|
263
|
+
return take(docs, total, pools=pools, key_of=doc_key)[0]
|
|
264
|
+
|
|
265
|
+
|
|
266
|
+
# 生效条件:report 为真值且 report.get("enabled") 为真时,把 dict(report["taken"])/dict(report["cands"])/dict(report["lost"]) 写入 stat 的 pool_taken/pool_cands/pool_lost;否则一个键都不写,始终返回 stat。
|
|
267
|
+
def record_audit(stat: dict, report) -> dict:
|
|
268
|
+
"""把 `cut_report` 的池账落进检索 `stat`(**关闭态不写** → 不伪造池账)。
|
|
269
|
+
|
|
270
|
+
落 `pool_taken` / `pool_cands` / `pool_lost` 三个键,供 `_emit` 组装审计面。
|
|
271
|
+
"""
|
|
272
|
+
if report and report.get("enabled"):
|
|
273
|
+
stat["pool_taken"] = dict(report["taken"])
|
|
274
|
+
stat["pool_cands"] = dict(report["cands"])
|
|
275
|
+
stat["pool_lost"] = dict(report["lost"])
|
|
276
|
+
return stat
|
|
277
|
+
|
|
278
|
+
|
|
279
|
+
# 生效条件:d[1].get("id") 取到真值(非 None/空串等假值)时以其为 node_id,否则回落 d[0]["path"],并总是把 d[0] 作为 entry 返回;d[0] 无 "path" 键时在回落分支抛 KeyError。
|
|
280
|
+
def doc_key(d):
|
|
281
|
+
"""检索文档三元组 `(entry, fm, content)` → `(node_id, entry)`。"""
|
|
282
|
+
return (d[1].get("id") or d[0]["path"]), d[0]
|
|
283
|
+
|
|
284
|
+
|
|
285
|
+
# --------------------------------------------------------------------------
|
|
286
|
+
# 口径冻结与复测(只读)
|
|
287
|
+
# --------------------------------------------------------------------------
|
|
288
|
+
|
|
289
|
+
# 生效条件:xs 先按 float 排序,xs 为空时返回 0.0;否则取 idx=max(0, min(len(xs)-1, ceil(q*len(xs))-1)) 并返回 xs[idx],q 本身未做取值范围校验。
|
|
290
|
+
def _pct(xs, q):
|
|
291
|
+
"""分位数(最近秩法,确定性;零依赖)。"""
|
|
292
|
+
xs = sorted(float(x) for x in xs)
|
|
293
|
+
if not xs:
|
|
294
|
+
return 0.0
|
|
295
|
+
idx = max(0, min(len(xs) - 1, int(math.ceil(q * len(xs))) - 1))
|
|
296
|
+
return xs[idx]
|
|
297
|
+
|
|
298
|
+
|
|
299
|
+
# 生效条件:ids=sorted((cg.index.get("nodes") or {}).keys()) 为空时返回 [];否则 n 经 max(1, int(n))(n=0 会变成 1)、step=max(1, len(ids)//max(1,int(n))),对 ids[::step][:max(1,int(n))] 逐个 cg._read(entry),读失败或无 content 则 continue,首个以 # 开头的行按「含全角冒号取其后、否则去 # 与空格」生成 q,q 非空才追加,返回 out。
|
|
300
|
+
def bench_queries(cg, n: int = 50) -> list:
|
|
301
|
+
"""从索引**确定性**取样查询词(按 id 排序等距抽,取节点标题行)。
|
|
302
|
+
|
|
303
|
+
自问自答 → 结果只作**代理指标**(`proxy=true`),不得当判定结论。
|
|
304
|
+
"""
|
|
305
|
+
ids = sorted((cg.index.get("nodes") or {}).keys())
|
|
306
|
+
if not ids:
|
|
307
|
+
return []
|
|
308
|
+
step = max(1, len(ids) // max(1, int(n)))
|
|
309
|
+
out = []
|
|
310
|
+
for nid in ids[::step][:max(1, int(n))]:
|
|
311
|
+
entry = cg.index["nodes"][nid]
|
|
312
|
+
try:
|
|
313
|
+
_fm, content = cg._read(entry)
|
|
314
|
+
except Exception: # noqa: BLE001
|
|
315
|
+
continue
|
|
316
|
+
if not content:
|
|
317
|
+
continue
|
|
318
|
+
line = ""
|
|
319
|
+
for raw in content.splitlines():
|
|
320
|
+
if raw.strip().startswith("#"):
|
|
321
|
+
line = raw.strip()
|
|
322
|
+
break
|
|
323
|
+
q = line.split(":", 1)[-1].strip() if ":" in line else line.lstrip("# ").strip()
|
|
324
|
+
if q:
|
|
325
|
+
out.append(q)
|
|
326
|
+
return out
|
|
327
|
+
|
|
328
|
+
|
|
329
|
+
#: 复测差值覆盖的口径字段(前两组=系统成本口径;后两组=结果构成口径)。
|
|
330
|
+
#: 注意:P95/截断率是**分池不敏感**口径(分池在 GLOBAL_CAP 之内重分配,
|
|
331
|
+
#: 「候选数 > cap」事件不变 → 差值恒 0);必须同时看 `index_share`/`pool_lost_rate`
|
|
332
|
+
#: 这类**敏感**口径,否则复测会「跑完却归因不到副作用」(见 §七·执行证据)。
|
|
333
|
+
DELTA_KEYS = ("p95_scanned", "p50_scanned", "mean_candidates",
|
|
334
|
+
"truncation_rate", "truncation_loss",
|
|
335
|
+
"index_share", "knowledge_share", "pool_lost_rate")
|
|
336
|
+
|
|
337
|
+
|
|
338
|
+
# 生效条件:xs 为真值(非空容器)时返回 sum(xs)/len(xs),xs 为假值(空容器或 None)时返回 0.0。
|
|
339
|
+
def _mean(xs):
|
|
340
|
+
return (sum(xs) / len(xs)) if xs else 0.0
|
|
341
|
+
|
|
342
|
+
|
|
343
|
+
# 生效条件:res 为假值(None/空列表)时返回空 dict;否则对每个 r 取 node=r[0] or {},以 pool_of(node.get("id"), node.get("frontmatter")) 归池并累加计数,返回 out。
|
|
344
|
+
def _pool_counts(res) -> dict:
|
|
345
|
+
"""结果集的归池构成(对分池**敏感**的口径:索引类是否吃满召回)。"""
|
|
346
|
+
out = {}
|
|
347
|
+
for r in res or []:
|
|
348
|
+
node = r[0] or {}
|
|
349
|
+
p = pool_of(node.get("id"), node.get("frontmatter"))
|
|
350
|
+
out[p] = out.get(p, 0) + 1
|
|
351
|
+
return out
|
|
352
|
+
|
|
353
|
+
|
|
354
|
+
# 生效条件:queries 为真值时用 list(queries)、为假值(None/空列表)时改用 bench_queries(cg, n=n_queries);逐 q 调 cg.search(q, k=int(k), record=False, judge=judge, pools=pools) 且该调用抛异常则跳过该 q;meta.get("pre_cap") 为 None 时回落 meta.get("candidates")/cap,仅 cap 为真且 pre>cap 才计入截断与损失,且 pl.get("lost") 与 pl.get("cands") 均非空才计入 pool_lost_rate。
|
|
355
|
+
def measure(cg, queries=None, *, k: int = 20, pools=None, judge: bool = False,
|
|
356
|
+
n_queries: int = 50) -> dict:
|
|
357
|
+
"""同口径跑一遍(**只读**):系统成本口径 + 结果构成口径 + 池级截断损失。
|
|
358
|
+
|
|
359
|
+
系统成本口径:P95/中位 `scanned`、**全局**截断率与截断损失率
|
|
360
|
+
(截断率 = 候选数 > 全局额度 的查询占比;损失率 = 被截掉候选/候选总数均值)。
|
|
361
|
+
结果构成口径:返回结果里索引/知识/负记忆池占比均值
|
|
362
|
+
(**对分池敏感**——分池的意义就是改变入榜构成,成本口径看不出来)。
|
|
363
|
+
池级截断损失 `pool_lost_rate`:各池 `被挤掉 / 候选` 的均值,**仅在启用态可得**,
|
|
364
|
+
关闭态诚实为 `None`(关闭时不存在「池」这一层,不编造 0)。
|
|
365
|
+
`record=False`:不污染访问计数(复测不产生副作用)。
|
|
366
|
+
"""
|
|
367
|
+
qs = list(queries) if queries else bench_queries(cg, n=n_queries)
|
|
368
|
+
scanned, trunc, loss, cands, tiers = [], [], [], [], {}
|
|
369
|
+
idx, kn, neg, pooled_lost = [], [], [], []
|
|
370
|
+
for q in qs:
|
|
371
|
+
try:
|
|
372
|
+
res, meta = cg.search(q, k=int(k), record=False, judge=judge,
|
|
373
|
+
pools=pools)
|
|
374
|
+
except Exception: # noqa: BLE001
|
|
375
|
+
continue
|
|
376
|
+
pre = meta.get("pre_cap")
|
|
377
|
+
cap = meta.get("cap")
|
|
378
|
+
if pre is None:
|
|
379
|
+
pre, cap = (meta.get("candidates") or 0), (meta.get("cap") or 0)
|
|
380
|
+
scanned.append(meta.get("scanned") or 0)
|
|
381
|
+
cands.append(pre or 0)
|
|
382
|
+
tiers[meta.get("tier")] = tiers.get(meta.get("tier"), 0) + 1
|
|
383
|
+
if cap and pre > cap:
|
|
384
|
+
trunc.append(1)
|
|
385
|
+
loss.append(float(pre - cap) / float(pre))
|
|
386
|
+
else:
|
|
387
|
+
trunc.append(0)
|
|
388
|
+
loss.append(0.0)
|
|
389
|
+
pc = _pool_counts(res)
|
|
390
|
+
tot = sum(pc.values())
|
|
391
|
+
if tot:
|
|
392
|
+
idx.append(pc.get(POOL_INDEX, 0) / tot)
|
|
393
|
+
kn.append(pc.get(POOL_KNOWLEDGE, 0) / tot)
|
|
394
|
+
neg.append(pc.get(POOL_NEGATIVE, 0) / tot)
|
|
395
|
+
pl = meta.get("pools") or {}
|
|
396
|
+
if pl.get("lost") and pl.get("cands"):
|
|
397
|
+
d = sum(pl["cands"].values())
|
|
398
|
+
if d:
|
|
399
|
+
pooled_lost.append(sum(pl["lost"].values()) / d)
|
|
400
|
+
n = len(scanned)
|
|
401
|
+
return {"ok": True, "readonly": True, "proxy": True,
|
|
402
|
+
"n_queries": n, "k": int(k),
|
|
403
|
+
"pools": plan(meta_cap(cg), pools),
|
|
404
|
+
"p95_scanned": _pct(scanned, 0.95),
|
|
405
|
+
"p50_scanned": _pct(scanned, 0.50),
|
|
406
|
+
"mean_candidates": _mean(cands),
|
|
407
|
+
"truncation_rate": _mean(trunc),
|
|
408
|
+
"truncation_loss": _mean(loss),
|
|
409
|
+
"index_share": _mean(idx),
|
|
410
|
+
"knowledge_share": _mean(kn),
|
|
411
|
+
"negative_share": _mean(neg),
|
|
412
|
+
"pool_lost_rate": _mean(pooled_lost) if pooled_lost else None,
|
|
413
|
+
"tiers": tiers,
|
|
414
|
+
"note": ("查询集自索引确定性取样(自问自答)→ proxy 指标;"
|
|
415
|
+
"P95/truncation_* 为分池不敏感口径(差值恒 0 属正常),"
|
|
416
|
+
"分池生效看 index_share / pool_lost_rate;"
|
|
417
|
+
"同口径前后对比只看方向与幅度,不当绝对结论")}
|
|
418
|
+
|
|
419
|
+
|
|
420
|
+
# 生效条件:调用即从 md_cg.mdcg 取 GLOBAL_CAP(getattr 缺省 0),取到假值(0/None/空串)时经 or 0 回落 0,返回 int(...)。
|
|
421
|
+
def meta_cap(cg) -> int:
|
|
422
|
+
"""读当前全局额度(避免硬编码漂移)。"""
|
|
423
|
+
from . import mdcg
|
|
424
|
+
return int(getattr(mdcg, "GLOBAL_CAP", 0) or 0)
|
|
425
|
+
|
|
426
|
+
|
|
427
|
+
# 生效条件:queries 为真值时用 list(queries)、为假值(None/空列表)时用 bench_queries(cg, n=n_queries);before 恒以 pools=None 调用 measure,after 在 pools 为 None 时用模块常量 WEIGHTS、pools 显式(含 False)时原样传入;delta 只统计 DELTA_KEYS 中 before/after 两侧均为 int/float 的键,其余不参与 Δ 计算。
|
|
428
|
+
def compare(cg, queries=None, *, k: int = 20, pools=None, n_queries: int = 50) -> dict:
|
|
429
|
+
"""§七 要求的「同口径复测」:关闭态 vs 启用态 一并给出 + 差值 + 副作用归因。"""
|
|
430
|
+
qs = list(queries) if queries else bench_queries(cg, n=n_queries)
|
|
431
|
+
before = measure(cg, qs, k=k, pools=None, n_queries=n_queries)
|
|
432
|
+
after = measure(cg, qs, k=k, pools=(WEIGHTS if pools is None else pools),
|
|
433
|
+
n_queries=n_queries)
|
|
434
|
+
delta = {key: round(after[key] - before[key], 6)
|
|
435
|
+
for key in DELTA_KEYS
|
|
436
|
+
if isinstance(before.get(key), (int, float))
|
|
437
|
+
and isinstance(after.get(key), (int, float))}
|
|
438
|
+
zero_keys = [k2 for k2, v in delta.items() if v == 0]
|
|
439
|
+
return {"ok": True, "readonly": True, "n_queries": len(qs), "k": int(k),
|
|
440
|
+
"before": before, "after": after, "delta": delta,
|
|
441
|
+
"pool_plan": after["pools"],
|
|
442
|
+
# 口径敏感性自检:分池不敏感的口径(系统成本)差值恒 0 是**正常**的,
|
|
443
|
+
# 不报出来的话,复测看起来「毫无变化」会被误读为「改造无效」。
|
|
444
|
+
"insensitive_keys": zero_keys,
|
|
445
|
+
"sensitive_keys": [k2 for k2 in delta if k2 not in zero_keys],
|
|
446
|
+
"attribution": ("index_share 下降=索引/产物类不再吃满召回(收益);"
|
|
447
|
+
"pool_lost_rate 下降=各池被挤掉的候选变少(收益,仅启用态);"
|
|
448
|
+
"p95/p50_scanned 上升=分池让更多候选进入打分(代价);"
|
|
449
|
+
"全局 truncation_* 对分池不敏感、差值恒 0,不代表改造无效,"
|
|
450
|
+
"只说明该口径测不到池内重分配")}
|
|
451
|
+
|
|
452
|
+
|
|
453
|
+
# 生效条件:无入参,调用即返回由模块常量 POOL_ORDER/WEIGHTS/INDEX_PREFIXES/NEG_LAYERS/ENV_SWITCH 组装的自描述 dict,cap_ratio_sum 为 round(sum(WEIGHTS[p]["cap_ratio"] for p in POOL_ORDER), 12)。
|
|
454
|
+
def catalog() -> dict:
|
|
455
|
+
"""自描述(供 MCP / 人工核对)。"""
|
|
456
|
+
return {"layer": "召回分池与降权(§七)",
|
|
457
|
+
"pools": list(POOL_ORDER),
|
|
458
|
+
"weights": {p: dict(WEIGHTS[p]) for p in POOL_ORDER},
|
|
459
|
+
# 用 round 收掉二进制浮点噪声(0.7+0.2+0.1 == 0.9999999999999999)
|
|
460
|
+
"cap_ratio_sum": round(sum(WEIGHTS[p]["cap_ratio"] for p in POOL_ORDER), 12),
|
|
461
|
+
"index_prefixes": list(INDEX_PREFIXES),
|
|
462
|
+
"neg_layers": list(NEG_LAYERS),
|
|
463
|
+
"default": "off(pools=None → 原 GLOBAL_CAP 平截,不改默认参数)",
|
|
464
|
+
"discipline": {"no_hidden_budget": "cap_ratio 之和必须 == 1.0",
|
|
465
|
+
"explicit_weights": "降权系数只来自显式表,可 A/B 复算",
|
|
466
|
+
"opt_in": "默认关闭,启用需显式传表",
|
|
467
|
+
"measured_first": "先冻结 P95/截断率,再同口径复测",
|
|
468
|
+
"caliber_sensitivity": ("复测口径须自检对改造敏感:"
|
|
469
|
+
"P95/全局截断率对分池不敏感(差值恒 0),"
|
|
470
|
+
"须并看 index_share / pool_lost_rate")},
|
|
471
|
+
"backflow": ("空池未用额度按池序回流前序池;总账恒 ≤ total,"
|
|
472
|
+
"taken 字段回报各池实取数"),
|
|
473
|
+
"env": {ENV_SWITCH: "设为 1 时 search/mdcg_search 默认启用内置分池表"},
|
|
474
|
+
}
|
|
475
|
+
|
|
476
|
+
|
|
477
|
+
# 生效条件:pools 非 None 且非 False 时原样返回 pools;pools 为 None 或 False 时读 os.environ.get(ENV_SWITCH),缺失/空串经 or "" 归空串并 strip().lower(),属于 ("1","on","true","yes","y") 则返回 True,否则返回 None。
|
|
478
|
+
def from_env(pools=None):
|
|
479
|
+
"""载体侧开关:`pools` 显式给出时优先;否则读 `MDCG_POOLING`(默认关)。"""
|
|
480
|
+
if pools is not None and pools is not False:
|
|
481
|
+
return pools
|
|
482
|
+
v = (os.environ.get(ENV_SWITCH) or "").strip().lower()
|
|
483
|
+
if v in ("1", "on", "true", "yes", "y"):
|
|
484
|
+
return True
|
|
473
485
|
return None
|