@furongjun1999/dsh-memory 0.4.11 → 0.5.0
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/README.md +16 -16
- package/codebuddy/CODEBUDDY.md +11 -3
- package/codebuddy/README.md +92 -90
- package/codebuddy/mcp.json +27 -27
- package/docs/GBrain/345/217/257/345/200/237/351/211/264/347/202/271_/347/201/265/346/236/242/350/220/275/347/202/271/344/272/244/346/216/245_20260919.md +169 -169
- package/docs/Pi/345/217/257/345/255/246/344/271/240/344/274/230/347/202/271_/347/201/265/346/236/242/345/244/247/350/204/221/346/224/271/350/277/233/344/272/244/346/216/245_20260915.md +144 -144
- package/docs/README.md +142 -111
- package/docs/discipline/harnesses.yaml +244 -226
- package/docs/discipline/templates/full.md.tmpl +61 -61
- package/docs/discipline/templates/rules.mdc.tmpl +68 -0
- package/docs/discipline/templates/skill.md.tmpl +23 -23
- package/docs/eval/AGI/344/270/203/347/273/264/350/257/204/345/210/206/346/212/245/345/221/212_md_cg_v1.0.md +299 -299
- package/docs/eval/AGI/344/270/203/347/273/264/350/257/204/345/210/206/346/212/245/345/221/212_md_cg_v2.0.md +239 -239
- package/docs/eval//345/256/236/351/252/214/346/226/271/346/241/210_/345/255/246/344/271/240/351/227/255/347/216/257AB/344/270/216/346/250/252/350/257/204_v1.0.md +174 -174
- package/docs/eval//346/250/252/350/257/204_/345/205/255/345/256/266100/351/242/230/344/270/255/350/213/261/345/217/214/346/237/245_v1.0.md +223 -223
- package/docs/{mdcg → hive}//344/273/244/347/211/214/344/270/216/350/247/222/350/211/262/346/235/203/350/201/214/345/210/206/347/246/273_v0.1.md +165 -160
- package/docs/hive//344/273/244/347/211/214/350/257/255/344/271/211/344/277/256/346/255/243_/344/273/262/350/243/201/344/275/215_v0.1.md +76 -0
- package/docs/{mdcg → hive}//345/255/220/344/273/243/347/220/206/351/205/215/347/275/256/346/240/207/345/207/206_v0.5.md +236 -236
- package/docs/hive//346/243/200/347/264/242/346/224/266/346/225/233/345/256/236/346/265/213/344/270/216S1b/350/256/276/350/256/241_v0.1.md +43 -43
- package/docs/hive//346/243/200/347/264/242/347/256/227/346/263/225/345/217/243/345/276/204/345/257/271/347/205/247_v0.1.md +85 -0
- package/docs/hive//346/243/200/347/264/242/350/267/257/345/276/204/344/270/216/350/256/244/347/237/245/347/273/223/346/236/204/345/245/221/347/272/246_v0.1.md +102 -102
- package/docs/hive//350/234/202/345/267/242M6_ingest/345/256/236/346/226/275/350/256/241/345/210/222_v0.1.md +47 -0
- package/docs/hive//350/234/202/345/267/242/345/217/214/345/256/236/344/276/213/344/272/222/351/252/214_/350/256/276/350/256/241/345/256/232/347/250/277.md +503 -503
- package/docs/hive//350/234/202/345/267/242/345/267/245/344/275/234/350/256/260/345/277/206_/351/241/271/347/233/256/350/256/241/345/210/222.md +85 -85
- package/docs/hive//350/234/202/345/267/242/350/256/276/350/256/241_/347/220/206/350/256/272/345/257/271/351/275/220_v0.1.md +191 -0
- package/docs/hive//350/234/202/345/267/242/350/277/255/344/273/243_/345/256/217/350/247/202/344/270/216/347/276/244/344/275/223/350/260/203/345/272/246_v0.1.md +90 -0
- package/docs/mdcg/D_meta_/345/267/245/347/250/213/345/214/226/346/226/271/346/241/210_v0.2.md +216 -216
- package/docs/mdcg/README/350/257/246/347/273/206/347/211/210_v0.4.10.md +646 -646
- package/docs/mdcg/lingshu_tutorial.html +14449 -14449
- package/docs/mdcg/release_v0.4.11.md +49 -0
- package/docs/mdcg/release_v0.4.5.md +55 -55
- package/docs/mdcg/tool_table_v0.3.0.md +117 -117
- package/docs/mdcg//345/205/250/345/272/223/344/273/243/347/240/201/350/257/204/345/256/241/344/270/216/346/235/241/344/273/266/345/214/226/346/263/250/351/207/212_/350/256/241/345/210/222_v0.1.md +600 -600
- package/docs/mdcg//345/212/237/350/203/275/350/260/203/347/224/250/346/230/240/345/260/204/350/241/250_v0.1.md +40 -40
- package/docs/mdcg//345/215/225/345/205/203/350/207/252/346/210/221/351/224/232/347/202/271_/347/263/273/347/273/237/346/217/220/347/244/272/350/257/215/346/240/207/345/207/206_v0.3.md +275 -275
- package/docs/mdcg//345/217/221/345/270/203/351/227/250/347/246/201/351/223/276_v0.1.md +54 -0
- package/docs/mdcg//346/272/220/347/240/201/347/272/247/346/236/266/346/236/204/345/256/241/350/256/241_GPT/346/211/271/350/257/204/345/257/271/347/205/247_v1.0.md +130 -130
- package/docs/mdcg//347/201/265/346/236/24282/345/267/245/345/205/267_/345/212/237/350/203/275/346/225/264/347/220/206/344/270/216/350/277/201/347/247/273/346/230/240/345/260/204_v0.1.md +278 -278
- package/docs/mdcg//347/201/265/346/236/242/350/256/260/345/277/206/345/212/250/350/257/215/345/215/217/350/256/256_v1.0-draft.md +172 -172
- package/docs/mdcg//347/274/272/345/217/243/345/215/225_P0/346/224/266/345/217/243_v0.1.md +270 -270
- package/docs/mdcg//350/256/244/347/237/245/345/233/276_G4-G8/347/274/272/345/217/243/350/243/201/345/256/232/345/215/225_v0.1.md +491 -491
- package/docs/mdcg//350/256/244/347/237/245/345/233/276_/346/235/241/344/273/266/347/251/272/351/227/264/345/220/210/346/210/220/344/270/216/347/224/237/346/225/210/346/235/241/344/273/266/345/217/243/345/276/204_v0.1.md +340 -340
- package/docs/mdcg//350/256/244/347/237/245/345/233/276_/347/264/242/345/274/225/344/270/216/345/267/245/347/250/213/350/247/204/350/214/203/345/214/226_/350/256/241/345/210/222_v0.1.md +588 -588
- package/docs/plans/GridWorld/346/234/200/345/260/217/351/227/255/347/216/257/350/247/204/346/240/274_v0.1.md +176 -176
- package/docs/plans//345/221/275/345/220/215/346/262/273/347/220/206_/351/241/271/347/233/256/350/256/241/345/210/222.md +81 -81
- package/docs/swarm//350/234/202/347/276/244/344/272/222/350/201/224_v0.1.md +704 -704
- package/docs/swarm//350/234/202/347/276/244/345/220/214/351/224/231/346/243/200/346/265/213/345/256/236/351/252/214/345/215/217/350/256/256_v0.1.md +242 -242
- package/docs/theory//345/215/225/347/272/277/347/250/213/344/270/216/346/263/250/346/204/217/345/212/233/351/233/206/344/270/255_/346/227/240/344/272/211/350/256/256/347/220/206/350/256/272/346/226/207/346/241/243_v1.0.md +129 -129
- package/docs/theory//345/271/266/345/217/221/345/277/205/347/204/266/346/200/247/347/220/206/350/256/272_v0.2.md +134 -134
- package/docs/theory//346/231/272/350/203/275/350/256/2723.4.md +5260 -5260
- package/docs/theory//346/246/202/345/277/265/345/210/206/345/261/202/345/257/271/351/275/220/350/241/250_v0.1.md +145 -145
- package/docs/theory//347/220/206/350/256/272_/346/234/272/345/210/266_/344/273/243/347/240/201_/345/256/236/351/252/214_/347/274/272/345/217/243/347/237/251/351/230/265_v0.1.md +144 -144
- package/docs/theory//347/220/206/350/256/272/344/273/223/346/213/206/345/210/206/344/270/216/347/231/275/347/256/261/347/237/245/350/257/206/345/272/223/345/206/205/350/277/201_v0.1.md +198 -198
- package/docs/theory//350/256/244/347/237/245/344/273/243/347/220/206/344/270/216/346/224/266/346/225/233/347/273/223/346/236/204_/346/235/241/344/273/266/350/256/272/351/207/215/346/236/204_v0.1.md +221 -221
- package/docs/world_model//344/270/226/347/225/214/346/250/241/345/236/213_/347/245/236/347/273/217/347/275/221/347/273/234/345/272/225/345/261/202/346/236/266/346/236/204_v1.0.md +237 -237
- package/docs//345/217/221/345/270/203/344/273/266/345/233/236/346/272/257/350/257/264/346/230/216_v0.1.md +82 -82
- package/docs//345/267/245/344/275/234/347/272/252/345/276/213_/350/256/244/347/237/245/345/233/276/346/235/241/347/233/256_v1.1.json +28 -2
- package/dsh/README.md +82 -82
- package/dsh/cordis.yml.example +139 -139
- package/dsh/update-lingshu.bat +11 -11
- package/lib/hooks.js +36 -2
- package/lib/lib/roleplay_web.js +427 -427
- package/md_cg/__init__.py +7 -7
- package/md_cg/audit.py +368 -368
- package/md_cg/autonomy.py +287 -287
- package/md_cg/backfill.py +1327 -1327
- package/md_cg/backfill_bigdomain.py +34 -34
- package/md_cg/bench6_arms.py +410 -410
- package/md_cg/bench6_common.py +230 -230
- package/md_cg/bench6_competitors.py +212 -212
- package/md_cg/bench_axis_domain.py +257 -257
- package/md_cg/bench_blind_comp.py +308 -308
- package/md_cg/bench_en_atoms_public.py +230 -230
- package/md_cg/bench_governance.py +348 -348
- package/md_cg/bench_lme_zh.py +410 -410
- package/md_cg/bench_locomo.py +121 -121
- package/md_cg/bench_locomo_zh.py +450 -450
- package/md_cg/bench_locomo_zh_public.py +147 -147
- package/md_cg/bench_longmem.py +112 -112
- package/md_cg/bench_membench.py +632 -632
- package/md_cg/bench_p0.py +149 -149
- package/md_cg/bench_progressive.py +287 -287
- package/md_cg/bench_role_views.py +238 -238
- package/md_cg/bench_task_ab.py +243 -243
- package/md_cg/bench_task_ab_llm.py +408 -408
- package/md_cg/bench_unified_en.py +204 -204
- package/md_cg/bench_zh_mad.py +601 -601
- package/md_cg/blindspot_tickets.py +123 -123
- package/md_cg/branches.py +285 -285
- package/md_cg/build_postings.py +73 -73
- package/md_cg/ccgc.py +1005 -948
- package/md_cg/census.py +132 -132
- package/md_cg/chain.py +300 -300
- package/md_cg/codeindex.py +531 -531
- package/md_cg/coldverify.py +292 -292
- package/md_cg/comment_gate.py +337 -337
- package/md_cg/cond_compose.py +190 -190
- package/md_cg/cond_facts.py +154 -154
- package/md_cg/cond_template.json +106 -106
- package/md_cg/condition_anchor.py +142 -142
- package/md_cg/conformance.py +726 -726
- package/md_cg/consistency.py +717 -717
- package/md_cg/consolidate.py +1536 -1439
- package/md_cg/corpus.py +110 -110
- package/md_cg/crosscheck.py +1097 -1097
- package/md_cg/crypto.py +437 -437
- package/md_cg/d_meta.py +310 -310
- package/md_cg/datapath.py +334 -334
- package/md_cg/docindex.py +473 -473
- package/md_cg/eval_common.py +575 -575
- package/md_cg/evidence.py +580 -580
- package/md_cg/evolution.py +477 -477
- package/md_cg/export.py +220 -220
- package/md_cg/forgetting.py +581 -581
- package/md_cg/fsutil.py +329 -329
- package/md_cg/hotcache.py +238 -214
- package/md_cg/hyperedge.py +251 -251
- package/md_cg/identity.py +390 -390
- package/md_cg/insight.py +500 -500
- package/md_cg/interop.py +199 -0
- package/md_cg/lexicon/build_cedict_en_zh.py +329 -329
- package/md_cg/lexicon/build_standard_en.py +171 -171
- package/md_cg/lexicon/expand_en_zh.py +211 -211
- package/md_cg/lifecycle.py +272 -272
- package/md_cg/linkref.py +280 -280
- package/md_cg/links.py +622 -622
- package/md_cg/mcp_server.py +129 -32
- package/md_cg/md_whitebox.py +345 -345
- package/md_cg/mdcg.py +176 -117
- package/md_cg/mdcos.py +79 -13
- package/md_cg/metacognition.py +591 -591
- package/md_cg/migrate.py +119 -119
- package/md_cg/migrate_aeis.py +221 -221
- package/md_cg/migrate_roleplay.py +293 -293
- package/md_cg/migrate_wisdom_graph.py +360 -360
- package/md_cg/mreview/__init__.py +25 -25
- package/md_cg/mreview/__main__.py +110 -110
- package/md_cg/mreview/bundle.py +178 -178
- package/md_cg/mreview/candidates.py +262 -262
- package/md_cg/mreview/govern.py +693 -693
- package/md_cg/mreview/locate.py +939 -939
- package/md_cg/mreview/pipeline.py +728 -728
- package/md_cg/mreview/rules/duplication.json +21 -21
- package/md_cg/mreview/rules/field_coverage.json +54 -54
- package/md_cg/mreview/rules/source_license.json +21 -21
- package/md_cg/mreview/rules/template_flow.json +21 -21
- package/md_cg/mreview/ruleset.py +252 -252
- package/md_cg/nodefile.py +575 -575
- package/md_cg/pooling.py +484 -472
- package/md_cg/postings.py +298 -298
- package/md_cg/predict.py +1100 -1100
- package/md_cg/progressive.py +123 -123
- package/md_cg/protect.py +272 -272
- package/md_cg/protocol/md_cg_gate.proto +33 -33
- package/md_cg/protocol.py +372 -372
- package/md_cg/provenance.py +582 -582
- package/md_cg/reach.py +453 -453
- package/md_cg/readcache.py +85 -0
- package/md_cg/refindex.py +833 -833
- package/md_cg/refine.py +604 -604
- package/md_cg/roleviews.py +89 -89
- package/md_cg/routing.py +365 -365
- package/md_cg/scrub.py +852 -852
- package/md_cg/security.py +274 -274
- package/md_cg/self_state.py +1029 -1029
- package/md_cg/selfreport.py +151 -151
- package/md_cg/semantic/__init__.py +10 -10
- package/md_cg/semantic/canonical.py +122 -122
- package/md_cg/semantic/en_normalizer.py +364 -364
- package/md_cg/semantic/en_zh_map.json +28694 -0
- package/md_cg/semantic/export_en_zh_map.py +64 -0
- package/md_cg/semantic/unify.py +45 -0
- package/md_cg/semantic/zh_en_atoms.py +139 -139
- package/md_cg/signer.py +562 -562
- package/md_cg/sources.py +815 -582
- package/md_cg/statushdr.py +179 -179
- package/md_cg/stg.py +48 -37
- package/md_cg/subgraph.py +729 -729
- package/md_cg/sustain.py +1138 -1138
- package/md_cg/tasks.py +470 -470
- package/md_cg/test_action_derive.py +203 -203
- package/md_cg/test_audit_rotate.py +270 -270
- package/md_cg/test_autonomy.py +143 -143
- package/md_cg/test_bench_governance.py +102 -102
- package/md_cg/test_blindspot_tickets.py +166 -166
- package/md_cg/test_branches.py +249 -249
- package/md_cg/test_ccg_perturb.py +184 -184
- package/md_cg/test_ccgc.py +433 -433
- package/md_cg/test_census_prune.py +81 -81
- package/md_cg/test_cond_compose_anchors.py +76 -76
- package/md_cg/test_cond_match.py +165 -165
- package/md_cg/test_condition_anchor.py +81 -81
- package/md_cg/test_d_meta.py +412 -412
- package/md_cg/test_datapath_root.py +199 -199
- package/md_cg/test_en_pipeline.py +166 -166
- package/md_cg/test_gain_gate.py +212 -212
- package/md_cg/test_health_scale.py +173 -173
- package/md_cg/test_hive_ingest.py +285 -0
- package/md_cg/test_hot_cold.py +215 -215
- package/md_cg/test_hyperedge.py +245 -245
- package/md_cg/test_i26_empty_first_write.py +116 -0
- package/md_cg/test_i27_e041_identity.py +128 -0
- package/md_cg/test_i28_hotcache_prodpath.py +122 -0
- package/md_cg/test_identity_attribution.py +147 -147
- package/md_cg/test_index_durability.py +224 -224
- package/md_cg/test_interop.py +93 -0
- package/md_cg/test_lifecycle.py +309 -309
- package/md_cg/test_linkref.py +306 -306
- package/md_cg/test_lock.py +43 -43
- package/md_cg/test_md_access_parity.py +255 -255
- package/md_cg/test_md_writepath.py +345 -345
- package/md_cg/test_mdstore_search_parity.py +160 -0
- package/md_cg/test_mr_m2.py +587 -587
- package/md_cg/test_mr_m3.py +710 -710
- package/md_cg/test_mr_m4.py +485 -485
- package/md_cg/test_p0.py +250 -250
- package/md_cg/test_p1.py +316 -316
- package/md_cg/test_p10_identity.py +173 -173
- package/md_cg/test_p11_consistency.py +233 -233
- package/md_cg/test_p12_metacognition.py +212 -212
- package/md_cg/test_p13_encryption.py +241 -241
- package/md_cg/test_p14_sustain.py +249 -249
- package/md_cg/test_p15_scrub.py +280 -280
- package/md_cg/test_p16_self_state.py +301 -301
- package/md_cg/test_p17_predict.py +354 -354
- package/md_cg/test_p18_whitebox.py +171 -171
- package/md_cg/test_p19_migrate_roleplay.py +149 -149
- package/md_cg/test_p20_evolution.py +315 -315
- package/md_cg/test_p21_tokens.py +293 -270
- package/md_cg/test_p22_theory.py +175 -175
- package/md_cg/test_p23_links.py +311 -311
- package/md_cg/test_p24_evidence.py +227 -227
- package/md_cg/test_p25_weights.py +156 -156
- package/md_cg/test_p26_refindex.py +416 -416
- package/md_cg/test_p27_docindex.py +765 -765
- package/md_cg/test_p28_refcheck.py +305 -305
- package/md_cg/test_p29_session_ingest_export.py +354 -333
- package/md_cg/test_p3.py +11 -2
- package/md_cg/test_p30_maintain.py +330 -330
- package/md_cg/test_p31_insight.py +534 -534
- package/md_cg/test_p32_backfill.py +298 -298
- package/md_cg/test_p33_ccg_wiring.py +293 -293
- package/md_cg/test_p34_crosscheck.py +331 -331
- package/md_cg/test_p35_conditioned_claim.py +252 -252
- package/md_cg/test_p36_kp_align.py +230 -230
- package/md_cg/test_p37_condition_space.py +248 -248
- package/md_cg/test_p38_concurrent_flush.py +102 -0
- package/md_cg/test_p38_contextualize.py +273 -273
- package/md_cg/test_p39_verify_flow.py +113 -0
- package/md_cg/test_p39_vision_evidence.py +369 -369
- package/md_cg/test_p40_refine_worklist.py +241 -241
- package/md_cg/test_p41_evolve_patrol.py +224 -224
- package/md_cg/test_p42_provenance.py +269 -269
- package/md_cg/test_p43_pooling.py +412 -398
- package/md_cg/test_p44_md_whitebox.py +231 -231
- package/md_cg/test_p45_session_identity.py +219 -219
- package/md_cg/test_p46_unit_scope.py +272 -272
- package/md_cg/test_p47_session_view.py +281 -0
- package/md_cg/test_p4_fuzzy.py +223 -223
- package/md_cg/test_p5_semantic.py +226 -226
- package/md_cg/test_p6_consolidate.py +440 -387
- package/md_cg/test_p7_goals_recent.py +202 -202
- package/md_cg/test_p8_subgraph_chain.py +200 -200
- package/md_cg/test_p9_forget_protect.py +231 -231
- package/md_cg/test_predict_beta.py +135 -135
- package/md_cg/test_preflight_failclosed.py +100 -100
- package/md_cg/test_progressive.py +146 -146
- package/md_cg/test_protocol.py +243 -243
- package/md_cg/test_reach.py +378 -378
- package/md_cg/test_reach_keys.py +201 -201
- package/md_cg/test_read_clip.py +141 -141
- package/md_cg/test_readcache_prodpath.py +155 -0
- package/md_cg/test_retr_gates_prodpath.py +140 -0
- package/md_cg/test_retr_s1.py +340 -340
- package/md_cg/test_retr_s1b.py +209 -209
- package/md_cg/test_retr_s3.py +194 -194
- package/md_cg/test_retr_s4.py +163 -163
- package/md_cg/test_retr_s5.py +200 -200
- package/md_cg/test_retr_s6.py +157 -157
- package/md_cg/test_retr_s7.py +384 -384
- package/md_cg/test_retr_s8_time.py +369 -316
- package/md_cg/test_retr_s9_edges.py +286 -286
- package/md_cg/test_retr_s9_entity_ctx.py +175 -175
- package/md_cg/test_review_conformance.py +367 -367
- package/md_cg/test_role_views.py +354 -354
- package/md_cg/test_sem_noise.py +242 -242
- package/md_cg/test_semantic_canonical.py +241 -241
- package/md_cg/test_subproc_encoding.py +192 -192
- package/md_cg/test_sustain_mutual.py +153 -153
- package/md_cg/test_tasks.py +409 -409
- package/md_cg/test_tool_face.py +189 -189
- package/md_cg/test_transfer.py +180 -180
- package/md_cg/test_trust.py +361 -361
- package/md_cg/test_twophase.py +286 -286
- package/md_cg/test_v14_fixes.py +397 -397
- package/md_cg/test_validity_filter.py +280 -280
- package/md_cg/test_verify_answer.py +138 -138
- package/md_cg/test_wisdom_md_store.py +292 -292
- package/md_cg/test_writelimit.py +197 -197
- package/md_cg/test_writepipe.py +214 -214
- package/md_cg/theory.py +273 -273
- package/md_cg/tokens.py +677 -663
- package/md_cg/tool_face.py +260 -260
- package/md_cg/trust.py +986 -950
- package/md_cg/twophase.py +231 -231
- package/md_cg/units.py +667 -667
- package/md_cg/vision_evidence.py +666 -666
- package/md_cg/weights.py +624 -624
- package/md_cg/whitebox.py +527 -527
- package/md_cg/whitebox_kb/__init__.py +37 -37
- package/md_cg/whitebox_kb/aeis_core/__init__.py +42 -42
- package/md_cg/whitebox_kb/aeis_core/semantic.py +280 -280
- package/md_cg/whitebox_kb/aeis_core/textutil.py +13 -13
- package/md_cg/whitebox_kb/engine.py +310 -310
- package/md_cg/whitebox_kb/seed_knowledge//346/231/272/350/203/275/350/256/2723.4.md +5260 -5260
- package/md_cg/whitebox_kb/wisdom/browser_units.py +2631 -2631
- package/md_cg/whitebox_kb/wisdom/causal_discover.py +432 -432
- package/md_cg/whitebox_kb/wisdom/chat_engine.py +1506 -1506
- package/md_cg/whitebox_kb/wisdom/code_solidified.json +6195 -6195
- package/md_cg/whitebox_kb/wisdom/compiler_code_units.py +3033 -3033
- package/md_cg/whitebox_kb/wisdom/condition_algebra.py +112 -112
- package/md_cg/whitebox_kb/wisdom/condition_frame.py +315 -315
- package/md_cg/whitebox_kb/wisdom/condition_kb.py +108 -108
- package/md_cg/whitebox_kb/wisdom/conflict_map.json +4445 -4445
- package/md_cg/whitebox_kb/wisdom/core/lexer.py +512 -512
- package/md_cg/whitebox_kb/wisdom/core/name_checker.py +1023 -1023
- package/md_cg/whitebox_kb/wisdom/cspmn.py +258 -258
- package/md_cg/whitebox_kb/wisdom/csre.py +264 -264
- package/md_cg/whitebox_kb/wisdom/danmaku_audit.py +252 -252
- package/md_cg/whitebox_kb/wisdom/distilled_condition_units.json +6417 -6417
- package/md_cg/whitebox_kb/wisdom/docs/WB-EVAL-20260902b.json +1950 -1950
- package/md_cg/whitebox_kb/wisdom/docs/WB-EVAL-20260902c.json +1296 -1296
- package/md_cg/whitebox_kb/wisdom/docs/whitebox_capability_graph_demo.json +59 -59
- package/md_cg/whitebox_kb/wisdom/graph_db_units.py +3089 -3089
- package/md_cg/whitebox_kb/wisdom/knowledge_points.py +318 -318
- package/md_cg/whitebox_kb/wisdom/md_access.py +470 -470
- package/md_cg/whitebox_kb/wisdom/md_store.py +276 -251
- package/md_cg/whitebox_kb/wisdom/migrate_wisdom.py +476 -476
- package/md_cg/whitebox_kb/wisdom/navigate.py +248 -248
- package/md_cg/whitebox_kb/wisdom/neural_retrieve.py +224 -224
- package/md_cg/whitebox_kb/wisdom/os_units.py +2735 -2735
- package/md_cg/whitebox_kb/wisdom/pattern_separation.py +376 -376
- package/md_cg/whitebox_kb/wisdom/prereq_map.json +364 -364
- package/md_cg/whitebox_kb/wisdom/python_code_units.py +2766 -2766
- package/md_cg/whitebox_kb/wisdom/role_solidified.json +7 -7
- package/md_cg/whitebox_kb/wisdom/route_memory.py +244 -244
- package/md_cg/whitebox_kb/wisdom/scene_reconstruction.py +148 -148
- package/md_cg/whitebox_kb/wisdom/snr_report.json +40 -40
- package/md_cg/whitebox_kb/wisdom/test_code_compose_domains.py +7541 -7541
- package/md_cg/whitebox_kb/wisdom/test_compiler_self_bootstrap.py +354 -354
- package/md_cg/whitebox_kb/wisdom/test_ecosystem_assembly.py +158 -158
- package/md_cg/whitebox_kb/wisdom/test_ecosystem_demos.py +193 -193
- package/md_cg/whitebox_kb/wisdom/test_graph_db.py +292 -292
- package/md_cg/whitebox_kb/wisdom/test_python_self_bootstrap.py +160 -160
- package/md_cg/whitebox_kb/wisdom/trigger_words_index.json +4366 -4366
- package/md_cg/whitebox_kb/wisdom/verifier.py +1297 -1297
- package/md_cg/writelimit.py +356 -356
- package/md_cg/writepipe.py +550 -542
- package/package.json +97 -96
- package/skills/plugin.json +54 -54
- package/skills/skills/designer-perspective/SKILL.md +158 -158
- package/skills/skills/designer-perspective/references/01-observation-position.md +66 -66
- package/skills/skills/designer-perspective/references/02-structure-recognition.md +62 -62
- package/skills/skills/designer-perspective/references/03-direction-judgment.md +55 -55
- package/skills/skills/designer-perspective/references/04-qualification-verdict.md +72 -72
- package/skills/skills/designer-perspective/references/05-condition-attribution.md +74 -74
- package/skills/skills/designer-perspective/scripts/designer.py +545 -545
- package/skills/skills/designer-perspective/tests/cases.jsonl +17 -17
- package/skills/skills/designer-perspective/tests/selftest.py +61 -61
- package/skills/skills/lingshu-browser/SKILL.md +60 -60
- package/skills/skills/lingshu-compiler/SKILL.md +56 -56
- package/skills/skills/lingshu-compiler/units/analyze-type-infer/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/check-name-real/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-assign/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-expr-tree/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-full-pipeline/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-func-def/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-if-then/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-logic-expr/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-recursive/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-scope/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-type-check/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-while/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0010c4bf/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0355bffb/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0361708a/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-054a0414/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-05a1691a/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-05eeed1e/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0622a1f6/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-08b54217/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0a62b70c/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0ab24d00/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0e093688/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0e82b966/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0ee9b9b9/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0f3787e6/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-1028685f/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-11897630/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-16661b9b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-1f722303/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-25be1262/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-2a76ba07/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-2dbea54a/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-2df52f16/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-2ec2c9d2/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-2f8c8f39/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-38378ac7/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-39457d2e/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-39fb5926/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-47f4fbfa/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-4a8cd1f1/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-4b230b6b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-4cbbda95/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-4d5a68ff/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-56dc9bdd/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-57e76ebe/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-61ff016b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-63eae588/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-64c4224b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-66377955/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-674ab4f6/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-6af76fd6/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-6d979db2/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-6de326c0/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-6f1c0eea/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-724d6c9b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-7690177f/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-7b229a7d/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-7f471b3a/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-815cad08/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-83c61634/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-8c798c81/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-8dd747ac/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-90324d0a/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-94b8d72d/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-94f12231/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-95937c16/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-98a5625b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-98b4c42f/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-98e3894a/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-9bdfe4b8/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-9d9b4e83/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-9f7be5ad/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-a6daf076/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-a7995a0c/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-a8399248/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-aabbd099/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-afe169d8/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-b0678bda/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-b09bd196/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-b1396e23/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-b9b31ce0/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-c10264a7/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-cb1e8e4b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-ccafd438/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-cda9c262/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-ce648068/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-cf5776a4/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-d974e5d3/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-e3979fd3/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-eb1cf2b5/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-ecb30d5b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-f8c8b24b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-f99fedbe/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-fa8ff5f7/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-fe1b058d/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/lex-chinese-program/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/lex-dao-de-jing/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/lex-nine-chapters/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-arithmetic/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-array-ops/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-closure-call/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-closure-create/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-compare/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-cond-jump/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-cond-space/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-exception/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-func-call/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-loop-run/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-profiling/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-refcount/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-run-loop/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-short-circuit/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-stack-guard/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-stack-ops/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-trust-accum/SKILL.md +45 -45
- package/skills/skills/lingshu-graph/SKILL.md +63 -63
- package/skills/skills/lingshu-net/SKILL.md +48 -48
- package/skills/skills/lingshu-os/SKILL.md +64 -64
- package/skills/skills/lingshu-pylang/SKILL.md +71 -71
- package/src/bridge.ts +401 -401
- package/src/hooks.ts +38 -2
- package/src/lib/datapath.ts +326 -326
- package/src/lib/mdcg_client.ts +413 -413
- package/src/lib/mutual.ts +428 -428
- package/src/lib/prompt_safety.ts +62 -62
- package/src/lib/python_path.ts +71 -71
- package/src/lib/roleplay_web.ts +932 -932
- package/src/lib/token_store.ts +192 -192
- package/src/tools.ts +212 -212
- package/zcode/AGENTS.md +11 -3
- package/zcode/README.md +41 -41
- /package/docs/{mdcg → hive}//344/270/273/344/273/243/347/220/206/345/255/220/344/273/243/347/220/206/350/256/260/345/277/206/346/236/266/346/236/204/350/256/276/350/256/241.md" +0 -0
|
@@ -1,148 +1,148 @@
|
|
|
1
|
-
# -*- coding: utf-8 -*-
|
|
2
|
-
"""locomo-zh-500 公开复现入口(外部第三方可独立运行,零上游依赖)。
|
|
3
|
-
|
|
4
|
-
数据集:`data/benchmarks/locomo-zh-500/`(随仓库公开,CC BY-NC 4.0)
|
|
5
|
-
用途:外部在同一份中文题面上,用**灵枢自身的默认检索口径**复现本仓库公布的
|
|
6
|
-
参考量级(词法单路 hit@1 ≈ 93.6% / 词法+同义 ≈ 97.6%)。
|
|
7
|
-
|
|
8
|
-
## 与既有脚本的分工(不要混用)
|
|
9
|
-
|
|
10
|
-
* `md_cg/bench_axis_domain.py`:**消融实验**入口(4 臂 × 6 路组合),依赖
|
|
11
|
-
`data/external/locomo_zh/`——该目录被 `.gitignore` 覆盖、**不随仓库公开**,
|
|
12
|
-
因此外部拿到仓库后跑不了。
|
|
13
|
-
* 本脚本:**公开数据集的最小消费者**。只读 `data/benchmarks/locomo-zh-500/`,
|
|
14
|
-
不读任何未入库路径、不依赖 Rust 评测器、不依赖上游 LoCoMo 原始下载。
|
|
15
|
-
|
|
16
|
-
两者评测口径一致(同 `eval_common` 的 GLOBAL_CAP 解除 + jaccard 词法),
|
|
17
|
-
差异只在「跑哪些路」:本脚本只跑参考量级对应的两路。
|
|
18
|
-
|
|
19
|
-
## 跑法
|
|
20
|
-
|
|
21
|
-
python -m md_cg.bench_locomo_zh_public
|
|
22
|
-
|
|
23
|
-
## 诚实条款(报告须原样保留)
|
|
24
|
-
|
|
25
|
-
* 被测池 567 条**全部**是 500 题的 gold 证据 → 池内零干扰,指标为**上界**,
|
|
26
|
-
不可外推为端到端记忆能力(详见数据集 README「诚实边界」)。
|
|
27
|
-
* `question` 是**中文关键词串**而非自然语言问句 → 本集评的是检索命中,
|
|
28
|
-
不是 QA、不是意图理解。
|
|
29
|
-
* 本脚本产出的是**灵枢系统自身口径**的数字;第三方用自己的系统 + 自己的
|
|
30
|
-
口径跑出的数字才是可比对的结论。
|
|
31
|
-
"""
|
|
32
|
-
import os
|
|
33
|
-
import sys
|
|
34
|
-
import time
|
|
35
|
-
|
|
36
|
-
HERE = os.path.dirname(os.path.dirname(os.path.abspath(__file__)))
|
|
37
|
-
for _p in (HERE, os.path.join(HERE, "md_cg")):
|
|
38
|
-
if _p not in sys.path:
|
|
39
|
-
sys.path.insert(0, _p)
|
|
40
|
-
|
|
41
|
-
from md_cg import eval_common as ec # noqa: E402
|
|
42
|
-
|
|
43
|
-
DATA = os.path.join(HERE, "data", "benchmarks", "locomo-zh-500")
|
|
44
|
-
CORPUS567 = os.path.join(DATA, "corpus567.jsonl")
|
|
45
|
-
QUESTIONS500 = os.path.join(DATA, "questions500.jsonl")
|
|
46
|
-
ROOT = os.path.join(HERE, "_md_cg_eval_public") # .gitignore 的 /_md_cg_eval_*/ 已覆盖
|
|
47
|
-
|
|
48
|
-
# 参考量级对应的两个检索配置(顺序即报告顺序)
|
|
49
|
-
CONFIGS = (
|
|
50
|
-
("lexical", ("lexical",)),
|
|
51
|
-
("lexical,fuzzy", ("lexical", "fuzzy")),
|
|
52
|
-
)
|
|
53
|
-
|
|
54
|
-
# VERSION.json 公布的参考值(仅作对照,不作断言——第三方环境差异允许浮动)
|
|
55
|
-
REFERENCE = {"lexical": 0.936, "lexical,fuzzy": 0.976}
|
|
56
|
-
|
|
57
|
-
|
|
58
|
-
# 生效条件:c 含 zh_fields(identity、time、summary、terms、condition)与 text 时,返回按身份/时间/摘要/词/条件/原始陈述拼接的正文。
|
|
59
|
-
def body_of(c):
|
|
60
|
-
"""正文:与 bench_axis_domain.body_of / bench_zh_mad 的 a0 臂**逐字一致**。
|
|
61
|
-
|
|
62
|
-
正文 = 中文层四槽(身份/时间/摘要/词/条件)+ 原始陈述。保持逐字一致是为了
|
|
63
|
-
让本脚本复现的参考数字与消融表 d0_base 臂**同源可比**(第2条:在既有成果上开发,
|
|
64
|
-
不另起一套口径)。
|
|
65
|
-
"""
|
|
66
|
-
f = c["zh_fields"]
|
|
67
|
-
return "\n".join([
|
|
68
|
-
f"身份:{f['identity']}",
|
|
69
|
-
f"时间:{f['time']}",
|
|
70
|
-
f"摘要:{f['summary']}",
|
|
71
|
-
f"词:{','.join(f['terms'])}",
|
|
72
|
-
"条件:" + "|".join(f"{k}:{v}" for k, v in f["condition"].items()),
|
|
73
|
-
"",
|
|
74
|
-
c["text"],
|
|
75
|
-
])
|
|
76
|
-
|
|
77
|
-
|
|
78
|
-
# 生效条件:传入 corpus 时,若 rebuild 为真且 ROOT 是目录则先删除 ROOT;随后以 MdCGOS(ROOT, autoflush=500) 打开,若已有节点数 >= len(corpus)(corpus 为空列表时该式恒真)则直接返回 cg,否则逐条 cg.add(c["id"], body_of(c), layer="knowledge", eval_src="public:locomo-zh-500", verification_basis="data") 并 cg.flush() 后返回 cg;
|
|
79
|
-
def build_pool(corpus, rebuild=False):
|
|
80
|
-
"""把 567 条灌成灵枢记忆库(layer=knowledge,无 tags)。
|
|
81
|
-
|
|
82
|
-
layer=knowledge:与消融 a0/d0_base 臂同层,使条件约束路(bucket)有桶可路由;
|
|
83
|
-
无 tags:不给 entity 路喂裸词(裸词 tags 在实测中是净污染,见 bench_axis_domain
|
|
84
|
-
模块头的四轴取证)——本脚本只测**词法/同义**两路,故不引入其它路的干扰。
|
|
85
|
-
"""
|
|
86
|
-
import shutil
|
|
87
|
-
from md_cg.mdcos import MdCGOS
|
|
88
|
-
|
|
89
|
-
if rebuild and os.path.isdir(ROOT):
|
|
90
|
-
shutil.rmtree(ROOT, ignore_errors=True)
|
|
91
|
-
cg = MdCGOS(ROOT, autoflush=500)
|
|
92
|
-
if len(cg.index["nodes"]) >= len(corpus):
|
|
93
|
-
print(f" 建库复用 {ROOT}:{len(cg.index['nodes'])} 节点")
|
|
94
|
-
return cg
|
|
95
|
-
t0 = time.time()
|
|
96
|
-
for c in corpus:
|
|
97
|
-
cg.add(c["id"], body_of(c), layer="knowledge",
|
|
98
|
-
eval_src="public:locomo-zh-500", verification_basis="data")
|
|
99
|
-
cg.flush()
|
|
100
|
-
print(f" 建库完成:{len(cg.index['nodes'])} 节点,{time.time() - t0:.0f}s")
|
|
101
|
-
return cg
|
|
102
|
-
|
|
103
|
-
|
|
104
|
-
# 生效条件:无参数;仅当 CORPUS567 与 QUESTIONS500 的 os.path.exists 均为真时才继续执行,否则立即 raise SystemExit;
|
|
105
|
-
def main():
|
|
106
|
-
if not os.path.exists(CORPUS567) or not os.path.exists(QUESTIONS500):
|
|
107
|
-
raise SystemExit(
|
|
108
|
-
f"[失败] 未找到公开数据集:{DATA}\n"
|
|
109
|
-
" 本脚本只读 data/benchmarks/locomo-zh-500/,请确认仓库完整。")
|
|
110
|
-
|
|
111
|
-
corpus = list(ec.iter_jsonl(CORPUS567))
|
|
112
|
-
questions = list(ec.iter_jsonl(QUESTIONS500))
|
|
113
|
-
print(f"公开数据集 locomo-zh-500:池 {len(corpus)} 条,题 {len(questions)} 道")
|
|
114
|
-
|
|
115
|
-
# 评测口径(与既有公开基准一致,否则与参考量级不可比)
|
|
116
|
-
ec.unlock_global_cap()
|
|
117
|
-
ec.use_jaccard()
|
|
118
|
-
|
|
119
|
-
cg = build_pool(corpus)
|
|
120
|
-
ec.install_read_cache(cg)
|
|
121
|
-
|
|
122
|
-
table = {}
|
|
123
|
-
for label, paths in CONFIGS:
|
|
124
|
-
t0 = time.time()
|
|
125
|
-
rows = ec.evaluate_group(cg, questions, k=5, paths=paths, verbose=False)
|
|
126
|
-
s = ec.summarize(rows, k=5)
|
|
127
|
-
table[label] = s
|
|
128
|
-
ref = REFERENCE.get(label)
|
|
129
|
-
note = f"(VERSION.json 参考 {ref:.1%})" if ref is not None else ""
|
|
130
|
-
print(f" {label:<16} hit@1={s['hit@1']:>6.1%} hit@5={s['hit@5']:>6.1%} "
|
|
131
|
-
f"MRR={s['mrr']:.4f} 用时 {time.time() - t0:.0f}s {note}")
|
|
132
|
-
|
|
133
|
-
ec.print_table(f"locomo-zh-500 公开复现(池 {len(corpus)} / 题 {len(questions)},"
|
|
134
|
-
f"jaccard + GLOBAL_CAP 解除)", table, k=5)
|
|
135
|
-
ec.save_result("public_locomo_zh_replay.json",
|
|
136
|
-
{"n_pool": len(corpus), "n_q": len(questions),
|
|
137
|
-
"configs": {k: v for k, v in table.items()}})
|
|
138
|
-
|
|
139
|
-
print("\n== 诚实边界(务必与数字一并引用)==")
|
|
140
|
-
print(" 1) 池 567 条全为 gold → 零干扰,指标是**上界**,非端到端能力。")
|
|
141
|
-
print(" 2) question 是中文关键词串,非自然语言问句 → 评的是检索命中,不是 QA。")
|
|
142
|
-
print(" 3) 上表是**灵枢自身口径**;请以自己系统 + 自己口径的数字为准。")
|
|
143
|
-
print(" 4) 数据集许可 CC BY-NC 4.0(署名 + 非商业),见 data/benchmarks/"
|
|
144
|
-
"locomo-zh-500/README.md。")
|
|
145
|
-
|
|
146
|
-
|
|
147
|
-
if __name__ == "__main__":
|
|
1
|
+
# -*- coding: utf-8 -*-
|
|
2
|
+
"""locomo-zh-500 公开复现入口(外部第三方可独立运行,零上游依赖)。
|
|
3
|
+
|
|
4
|
+
数据集:`data/benchmarks/locomo-zh-500/`(随仓库公开,CC BY-NC 4.0)
|
|
5
|
+
用途:外部在同一份中文题面上,用**灵枢自身的默认检索口径**复现本仓库公布的
|
|
6
|
+
参考量级(词法单路 hit@1 ≈ 93.6% / 词法+同义 ≈ 97.6%)。
|
|
7
|
+
|
|
8
|
+
## 与既有脚本的分工(不要混用)
|
|
9
|
+
|
|
10
|
+
* `md_cg/bench_axis_domain.py`:**消融实验**入口(4 臂 × 6 路组合),依赖
|
|
11
|
+
`data/external/locomo_zh/`——该目录被 `.gitignore` 覆盖、**不随仓库公开**,
|
|
12
|
+
因此外部拿到仓库后跑不了。
|
|
13
|
+
* 本脚本:**公开数据集的最小消费者**。只读 `data/benchmarks/locomo-zh-500/`,
|
|
14
|
+
不读任何未入库路径、不依赖 Rust 评测器、不依赖上游 LoCoMo 原始下载。
|
|
15
|
+
|
|
16
|
+
两者评测口径一致(同 `eval_common` 的 GLOBAL_CAP 解除 + jaccard 词法),
|
|
17
|
+
差异只在「跑哪些路」:本脚本只跑参考量级对应的两路。
|
|
18
|
+
|
|
19
|
+
## 跑法
|
|
20
|
+
|
|
21
|
+
python -m md_cg.bench_locomo_zh_public
|
|
22
|
+
|
|
23
|
+
## 诚实条款(报告须原样保留)
|
|
24
|
+
|
|
25
|
+
* 被测池 567 条**全部**是 500 题的 gold 证据 → 池内零干扰,指标为**上界**,
|
|
26
|
+
不可外推为端到端记忆能力(详见数据集 README「诚实边界」)。
|
|
27
|
+
* `question` 是**中文关键词串**而非自然语言问句 → 本集评的是检索命中,
|
|
28
|
+
不是 QA、不是意图理解。
|
|
29
|
+
* 本脚本产出的是**灵枢系统自身口径**的数字;第三方用自己的系统 + 自己的
|
|
30
|
+
口径跑出的数字才是可比对的结论。
|
|
31
|
+
"""
|
|
32
|
+
import os
|
|
33
|
+
import sys
|
|
34
|
+
import time
|
|
35
|
+
|
|
36
|
+
HERE = os.path.dirname(os.path.dirname(os.path.abspath(__file__)))
|
|
37
|
+
for _p in (HERE, os.path.join(HERE, "md_cg")):
|
|
38
|
+
if _p not in sys.path:
|
|
39
|
+
sys.path.insert(0, _p)
|
|
40
|
+
|
|
41
|
+
from md_cg import eval_common as ec # noqa: E402
|
|
42
|
+
|
|
43
|
+
DATA = os.path.join(HERE, "data", "benchmarks", "locomo-zh-500")
|
|
44
|
+
CORPUS567 = os.path.join(DATA, "corpus567.jsonl")
|
|
45
|
+
QUESTIONS500 = os.path.join(DATA, "questions500.jsonl")
|
|
46
|
+
ROOT = os.path.join(HERE, "_md_cg_eval_public") # .gitignore 的 /_md_cg_eval_*/ 已覆盖
|
|
47
|
+
|
|
48
|
+
# 参考量级对应的两个检索配置(顺序即报告顺序)
|
|
49
|
+
CONFIGS = (
|
|
50
|
+
("lexical", ("lexical",)),
|
|
51
|
+
("lexical,fuzzy", ("lexical", "fuzzy")),
|
|
52
|
+
)
|
|
53
|
+
|
|
54
|
+
# VERSION.json 公布的参考值(仅作对照,不作断言——第三方环境差异允许浮动)
|
|
55
|
+
REFERENCE = {"lexical": 0.936, "lexical,fuzzy": 0.976}
|
|
56
|
+
|
|
57
|
+
|
|
58
|
+
# 生效条件:c 含 zh_fields(identity、time、summary、terms、condition)与 text 时,返回按身份/时间/摘要/词/条件/原始陈述拼接的正文。
|
|
59
|
+
def body_of(c):
|
|
60
|
+
"""正文:与 bench_axis_domain.body_of / bench_zh_mad 的 a0 臂**逐字一致**。
|
|
61
|
+
|
|
62
|
+
正文 = 中文层四槽(身份/时间/摘要/词/条件)+ 原始陈述。保持逐字一致是为了
|
|
63
|
+
让本脚本复现的参考数字与消融表 d0_base 臂**同源可比**(第2条:在既有成果上开发,
|
|
64
|
+
不另起一套口径)。
|
|
65
|
+
"""
|
|
66
|
+
f = c["zh_fields"]
|
|
67
|
+
return "\n".join([
|
|
68
|
+
f"身份:{f['identity']}",
|
|
69
|
+
f"时间:{f['time']}",
|
|
70
|
+
f"摘要:{f['summary']}",
|
|
71
|
+
f"词:{','.join(f['terms'])}",
|
|
72
|
+
"条件:" + "|".join(f"{k}:{v}" for k, v in f["condition"].items()),
|
|
73
|
+
"",
|
|
74
|
+
c["text"],
|
|
75
|
+
])
|
|
76
|
+
|
|
77
|
+
|
|
78
|
+
# 生效条件:传入 corpus 时,若 rebuild 为真且 ROOT 是目录则先删除 ROOT;随后以 MdCGOS(ROOT, autoflush=500) 打开,若已有节点数 >= len(corpus)(corpus 为空列表时该式恒真)则直接返回 cg,否则逐条 cg.add(c["id"], body_of(c), layer="knowledge", eval_src="public:locomo-zh-500", verification_basis="data") 并 cg.flush() 后返回 cg;
|
|
79
|
+
def build_pool(corpus, rebuild=False):
|
|
80
|
+
"""把 567 条灌成灵枢记忆库(layer=knowledge,无 tags)。
|
|
81
|
+
|
|
82
|
+
layer=knowledge:与消融 a0/d0_base 臂同层,使条件约束路(bucket)有桶可路由;
|
|
83
|
+
无 tags:不给 entity 路喂裸词(裸词 tags 在实测中是净污染,见 bench_axis_domain
|
|
84
|
+
模块头的四轴取证)——本脚本只测**词法/同义**两路,故不引入其它路的干扰。
|
|
85
|
+
"""
|
|
86
|
+
import shutil
|
|
87
|
+
from md_cg.mdcos import MdCGOS
|
|
88
|
+
|
|
89
|
+
if rebuild and os.path.isdir(ROOT):
|
|
90
|
+
shutil.rmtree(ROOT, ignore_errors=True)
|
|
91
|
+
cg = MdCGOS(ROOT, autoflush=500)
|
|
92
|
+
if len(cg.index["nodes"]) >= len(corpus):
|
|
93
|
+
print(f" 建库复用 {ROOT}:{len(cg.index['nodes'])} 节点")
|
|
94
|
+
return cg
|
|
95
|
+
t0 = time.time()
|
|
96
|
+
for c in corpus:
|
|
97
|
+
cg.add(c["id"], body_of(c), layer="knowledge",
|
|
98
|
+
eval_src="public:locomo-zh-500", verification_basis="data")
|
|
99
|
+
cg.flush()
|
|
100
|
+
print(f" 建库完成:{len(cg.index['nodes'])} 节点,{time.time() - t0:.0f}s")
|
|
101
|
+
return cg
|
|
102
|
+
|
|
103
|
+
|
|
104
|
+
# 生效条件:无参数;仅当 CORPUS567 与 QUESTIONS500 的 os.path.exists 均为真时才继续执行,否则立即 raise SystemExit;
|
|
105
|
+
def main():
|
|
106
|
+
if not os.path.exists(CORPUS567) or not os.path.exists(QUESTIONS500):
|
|
107
|
+
raise SystemExit(
|
|
108
|
+
f"[失败] 未找到公开数据集:{DATA}\n"
|
|
109
|
+
" 本脚本只读 data/benchmarks/locomo-zh-500/,请确认仓库完整。")
|
|
110
|
+
|
|
111
|
+
corpus = list(ec.iter_jsonl(CORPUS567))
|
|
112
|
+
questions = list(ec.iter_jsonl(QUESTIONS500))
|
|
113
|
+
print(f"公开数据集 locomo-zh-500:池 {len(corpus)} 条,题 {len(questions)} 道")
|
|
114
|
+
|
|
115
|
+
# 评测口径(与既有公开基准一致,否则与参考量级不可比)
|
|
116
|
+
ec.unlock_global_cap()
|
|
117
|
+
ec.use_jaccard()
|
|
118
|
+
|
|
119
|
+
cg = build_pool(corpus)
|
|
120
|
+
ec.install_read_cache(cg)
|
|
121
|
+
|
|
122
|
+
table = {}
|
|
123
|
+
for label, paths in CONFIGS:
|
|
124
|
+
t0 = time.time()
|
|
125
|
+
rows = ec.evaluate_group(cg, questions, k=5, paths=paths, verbose=False)
|
|
126
|
+
s = ec.summarize(rows, k=5)
|
|
127
|
+
table[label] = s
|
|
128
|
+
ref = REFERENCE.get(label)
|
|
129
|
+
note = f"(VERSION.json 参考 {ref:.1%})" if ref is not None else ""
|
|
130
|
+
print(f" {label:<16} hit@1={s['hit@1']:>6.1%} hit@5={s['hit@5']:>6.1%} "
|
|
131
|
+
f"MRR={s['mrr']:.4f} 用时 {time.time() - t0:.0f}s {note}")
|
|
132
|
+
|
|
133
|
+
ec.print_table(f"locomo-zh-500 公开复现(池 {len(corpus)} / 题 {len(questions)},"
|
|
134
|
+
f"jaccard + GLOBAL_CAP 解除)", table, k=5)
|
|
135
|
+
ec.save_result("public_locomo_zh_replay.json",
|
|
136
|
+
{"n_pool": len(corpus), "n_q": len(questions),
|
|
137
|
+
"configs": {k: v for k, v in table.items()}})
|
|
138
|
+
|
|
139
|
+
print("\n== 诚实边界(务必与数字一并引用)==")
|
|
140
|
+
print(" 1) 池 567 条全为 gold → 零干扰,指标是**上界**,非端到端能力。")
|
|
141
|
+
print(" 2) question 是中文关键词串,非自然语言问句 → 评的是检索命中,不是 QA。")
|
|
142
|
+
print(" 3) 上表是**灵枢自身口径**;请以自己系统 + 自己口径的数字为准。")
|
|
143
|
+
print(" 4) 数据集许可 CC BY-NC 4.0(署名 + 非商业),见 data/benchmarks/"
|
|
144
|
+
"locomo-zh-500/README.md。")
|
|
145
|
+
|
|
146
|
+
|
|
147
|
+
if __name__ == "__main__":
|
|
148
148
|
main()
|
package/md_cg/bench_longmem.py
CHANGED
|
@@ -1,113 +1,113 @@
|
|
|
1
|
-
# -*- coding: utf-8 -*-
|
|
2
|
-
"""LongMemEval-S(xiaowu0162/LongMemEval)T-REC 复跑:三组分报 hit@1。
|
|
3
|
-
|
|
4
|
-
v2.0 三组映射(报告须声明;LongMemEval-S 实测 500 题,无 abstention 类):
|
|
5
|
-
精确回溯 → single-session-user/assistant/preference(156 题)
|
|
6
|
-
时序推理 → temporal-reasoning(133 题)
|
|
7
|
-
干扰抑制 → knowledge-update(78 题;旧信息被更新后应召回新信息抑制旧信息)
|
|
8
|
-
参考组 → multi-session(133 题;跨会话组合)
|
|
9
|
-
负例组 → S 版无 abstention,负例由 LoCoMo adversarial + 自建噪声层承担
|
|
10
|
-
干扰组通过线 ≥80%(hit@1,v2.0 标尺)。
|
|
11
|
-
|
|
12
|
-
口径为「证据命中」机判:answer_session_ids 映射到 haystack turn 集合,
|
|
13
|
-
Top-K 含任一证据 turn 记命中;非 LLM-judge,与论文口径不可直接比较。
|
|
14
|
-
|
|
15
|
-
双口径(同 bench_locomo,eval_common 模块头有完整说明):
|
|
16
|
-
口径 A legacy -- 默认。裸 turn 入库 + 四路基线:底座下界。
|
|
17
|
-
口径 B calibrated -- --calibrated。五要素标定入库 + semantic 路:系统形态。
|
|
18
|
-
|
|
19
|
-
跑法:
|
|
20
|
-
python -m md_cg.bench_longmem # 口径 A 全量 500 题
|
|
21
|
-
python -m md_cg.bench_longmem --calibrated # 口径 B 全量
|
|
22
|
-
python -m md_cg.bench_longmem --n 50 # 每组抽样 50 题
|
|
23
|
-
"""
|
|
24
|
-
import argparse
|
|
25
|
-
|
|
26
|
-
from md_cg import eval_common as ec
|
|
27
|
-
|
|
28
|
-
GROUPS = {
|
|
29
|
-
"precise": ("single-session-user", "single-session-assistant",
|
|
30
|
-
"single-session-preference"),
|
|
31
|
-
"temporal": ("temporal-reasoning",),
|
|
32
|
-
"interference": ("knowledge-update",),
|
|
33
|
-
"reference": ("multi-session",),
|
|
34
|
-
}
|
|
35
|
-
POS_GROUPS = ("precise", "temporal", "interference")
|
|
36
|
-
|
|
37
|
-
|
|
38
|
-
# 生效条件:命令行参数可被解析、GROUPS 中每组题型可按 --n 抽样时,按 --calibrated 选择 ROOT_LM_CAL 或 legacy 库评估并打印,无返回值。
|
|
39
|
-
def main():
|
|
40
|
-
ap = argparse.ArgumentParser()
|
|
41
|
-
ap.add_argument("--n", type=int, default=0, help="每组抽样上限(0=全量)")
|
|
42
|
-
ap.add_argument("--k", type=int, default=5)
|
|
43
|
-
ap.add_argument("--calibrated", action="store_true",
|
|
44
|
-
help="口径 B:五要素标定入库 + semantic 路启用")
|
|
45
|
-
ap.add_argument("--rebuild", action="store_true",
|
|
46
|
-
help="删库重建(标定器改版后必须)")
|
|
47
|
-
ap.add_argument("--paths", default=None,
|
|
48
|
-
help="覆盖召回路(逗号分隔),用于按路拆解归因,如 lexical")
|
|
49
|
-
ap.add_argument("--fusion", default=None, choices=["sum", "max"],
|
|
50
|
-
help="覆盖 RRF 融合方式(sum=等权共识,max=单路独出不稀释)")
|
|
51
|
-
ap.add_argument("--weights", default=None,
|
|
52
|
-
help="覆盖路权重(如 lexical:1,entity:0.2,semantic:0.2),压低噪声路")
|
|
53
|
-
args = ap.parse_args()
|
|
54
|
-
cal = args.calibrated
|
|
55
|
-
if args.paths:
|
|
56
|
-
ec.PATHS_CAL = ec.PATHS = tuple(args.paths.split(","))
|
|
57
|
-
print(f" [拆解] 召回路覆盖为 {ec.PATHS_CAL}")
|
|
58
|
-
wmap = None
|
|
59
|
-
if args.weights:
|
|
60
|
-
wmap = {p.split(":")[0]: float(p.split(":")[1])
|
|
61
|
-
for p in args.weights.split(",")}
|
|
62
|
-
print(f" [拆解] 路权重覆盖为 {wmap}")
|
|
63
|
-
|
|
64
|
-
print(f"== LongMemEval-S T-REC 复跑(k={args.k},口径 {'B 标定' if cal else 'A legacy'},"
|
|
65
|
-
f"{'全量' if not args.n else f'每组≤{args.n}'})==")
|
|
66
|
-
ec.unlock_global_cap() # 口径:解除 LIKE 预筛的插入序截断
|
|
67
|
-
ec.use_jaccard() # 口径:词法打分切 jaccard(长度自惩罚,长 turn 语料)
|
|
68
|
-
cg = ec.build_eval_cg(None, ec.ROOT_LM_CAL if cal else ec.ROOT_LM,
|
|
69
|
-
ec.LM_H, ec.lm_turn_text, "lme",
|
|
70
|
-
calib_of=ec.calibrate_lm_turn if cal else None,
|
|
71
|
-
rebuild=args.rebuild)
|
|
72
|
-
ec.install_read_cache(cg)
|
|
73
|
-
|
|
74
|
-
paths = ec.PATHS_CAL if cal else ec.PATHS
|
|
75
|
-
rows_by = {}
|
|
76
|
-
for gname, qtypes in GROUPS.items():
|
|
77
|
-
qs = ec.sample_questions(ec.load_questions("lm", qtypes=qtypes), args.n)
|
|
78
|
-
print(f" [{gname}] {len(qs)} 题 …")
|
|
79
|
-
rows_by[gname] = ec.evaluate_group(cg, qs, k=args.k, paths=paths,
|
|
80
|
-
fusion=args.fusion,
|
|
81
|
-
path_weights=wmap)
|
|
82
|
-
|
|
83
|
-
pos_rows = [r for g in POS_GROUPS for r in rows_by[g]]
|
|
84
|
-
line = ec.calibrate_line(pos_rows)
|
|
85
|
-
pos_false_refusal = ec.false_refusal_rate(pos_rows, line)
|
|
86
|
-
|
|
87
|
-
groups = {g: ec.summarize(rows_by[g], k=args.k) for g in GROUPS}
|
|
88
|
-
ec.print_table(f"LongMemEval-S T-REC 三组(口径 {'B 标定' if cal else 'A legacy'})",
|
|
89
|
-
groups, k=args.k)
|
|
90
|
-
print(f"\n拒答线(正例 hit@1 题 Top-1 分 p10):{line:.6f}")
|
|
91
|
-
print(f"正例误拒率(Top-1 分 < 线):{ec.pct(pos_false_refusal)}")
|
|
92
|
-
gate = {"interference_hit1": groups["interference"].get("hit@1", 0.0),
|
|
93
|
-
"interference_pass": groups["interference"].get("hit@1", 0.0) >= 0.80,
|
|
94
|
-
"calibrated_line": line}
|
|
95
|
-
print(f"干扰组 gate(≥80%):{'PASS' if gate['interference_pass'] else 'FAIL'}")
|
|
96
|
-
|
|
97
|
-
ec.save_result("trec_longmem_cal.json" if cal else "trec_longmem.json", {
|
|
98
|
-
"dataset": "LongMemEval-S (xiaowu0162/LongMemEval)",
|
|
99
|
-
"caliber": "B-calibrated(五要素标定 + semantic 路)" if cal
|
|
100
|
-
else "A-legacy(裸 turn,四路基线)",
|
|
101
|
-
"metric_caliber": "evidence-hit(answer_session_ids→turn 集合命中),"
|
|
102
|
-
"非 LLM-judge",
|
|
103
|
-
"paths": list(paths),
|
|
104
|
-
"k": args.k, "sampling": args.n or "full",
|
|
105
|
-
"groups": groups,
|
|
106
|
-
"false_refusal_pos": pos_false_refusal,
|
|
107
|
-
"gate": gate,
|
|
108
|
-
"group_mapping": {g: list(q) for g, q in GROUPS.items()},
|
|
109
|
-
})
|
|
110
|
-
|
|
111
|
-
|
|
112
|
-
if __name__ == "__main__":
|
|
1
|
+
# -*- coding: utf-8 -*-
|
|
2
|
+
"""LongMemEval-S(xiaowu0162/LongMemEval)T-REC 复跑:三组分报 hit@1。
|
|
3
|
+
|
|
4
|
+
v2.0 三组映射(报告须声明;LongMemEval-S 实测 500 题,无 abstention 类):
|
|
5
|
+
精确回溯 → single-session-user/assistant/preference(156 题)
|
|
6
|
+
时序推理 → temporal-reasoning(133 题)
|
|
7
|
+
干扰抑制 → knowledge-update(78 题;旧信息被更新后应召回新信息抑制旧信息)
|
|
8
|
+
参考组 → multi-session(133 题;跨会话组合)
|
|
9
|
+
负例组 → S 版无 abstention,负例由 LoCoMo adversarial + 自建噪声层承担
|
|
10
|
+
干扰组通过线 ≥80%(hit@1,v2.0 标尺)。
|
|
11
|
+
|
|
12
|
+
口径为「证据命中」机判:answer_session_ids 映射到 haystack turn 集合,
|
|
13
|
+
Top-K 含任一证据 turn 记命中;非 LLM-judge,与论文口径不可直接比较。
|
|
14
|
+
|
|
15
|
+
双口径(同 bench_locomo,eval_common 模块头有完整说明):
|
|
16
|
+
口径 A legacy -- 默认。裸 turn 入库 + 四路基线:底座下界。
|
|
17
|
+
口径 B calibrated -- --calibrated。五要素标定入库 + semantic 路:系统形态。
|
|
18
|
+
|
|
19
|
+
跑法:
|
|
20
|
+
python -m md_cg.bench_longmem # 口径 A 全量 500 题
|
|
21
|
+
python -m md_cg.bench_longmem --calibrated # 口径 B 全量
|
|
22
|
+
python -m md_cg.bench_longmem --n 50 # 每组抽样 50 题
|
|
23
|
+
"""
|
|
24
|
+
import argparse
|
|
25
|
+
|
|
26
|
+
from md_cg import eval_common as ec
|
|
27
|
+
|
|
28
|
+
GROUPS = {
|
|
29
|
+
"precise": ("single-session-user", "single-session-assistant",
|
|
30
|
+
"single-session-preference"),
|
|
31
|
+
"temporal": ("temporal-reasoning",),
|
|
32
|
+
"interference": ("knowledge-update",),
|
|
33
|
+
"reference": ("multi-session",),
|
|
34
|
+
}
|
|
35
|
+
POS_GROUPS = ("precise", "temporal", "interference")
|
|
36
|
+
|
|
37
|
+
|
|
38
|
+
# 生效条件:命令行参数可被解析、GROUPS 中每组题型可按 --n 抽样时,按 --calibrated 选择 ROOT_LM_CAL 或 legacy 库评估并打印,无返回值。
|
|
39
|
+
def main():
|
|
40
|
+
ap = argparse.ArgumentParser()
|
|
41
|
+
ap.add_argument("--n", type=int, default=0, help="每组抽样上限(0=全量)")
|
|
42
|
+
ap.add_argument("--k", type=int, default=5)
|
|
43
|
+
ap.add_argument("--calibrated", action="store_true",
|
|
44
|
+
help="口径 B:五要素标定入库 + semantic 路启用")
|
|
45
|
+
ap.add_argument("--rebuild", action="store_true",
|
|
46
|
+
help="删库重建(标定器改版后必须)")
|
|
47
|
+
ap.add_argument("--paths", default=None,
|
|
48
|
+
help="覆盖召回路(逗号分隔),用于按路拆解归因,如 lexical")
|
|
49
|
+
ap.add_argument("--fusion", default=None, choices=["sum", "max"],
|
|
50
|
+
help="覆盖 RRF 融合方式(sum=等权共识,max=单路独出不稀释)")
|
|
51
|
+
ap.add_argument("--weights", default=None,
|
|
52
|
+
help="覆盖路权重(如 lexical:1,entity:0.2,semantic:0.2),压低噪声路")
|
|
53
|
+
args = ap.parse_args()
|
|
54
|
+
cal = args.calibrated
|
|
55
|
+
if args.paths:
|
|
56
|
+
ec.PATHS_CAL = ec.PATHS = tuple(args.paths.split(","))
|
|
57
|
+
print(f" [拆解] 召回路覆盖为 {ec.PATHS_CAL}")
|
|
58
|
+
wmap = None
|
|
59
|
+
if args.weights:
|
|
60
|
+
wmap = {p.split(":")[0]: float(p.split(":")[1])
|
|
61
|
+
for p in args.weights.split(",")}
|
|
62
|
+
print(f" [拆解] 路权重覆盖为 {wmap}")
|
|
63
|
+
|
|
64
|
+
print(f"== LongMemEval-S T-REC 复跑(k={args.k},口径 {'B 标定' if cal else 'A legacy'},"
|
|
65
|
+
f"{'全量' if not args.n else f'每组≤{args.n}'})==")
|
|
66
|
+
ec.unlock_global_cap() # 口径:解除 LIKE 预筛的插入序截断
|
|
67
|
+
ec.use_jaccard() # 口径:词法打分切 jaccard(长度自惩罚,长 turn 语料)
|
|
68
|
+
cg = ec.build_eval_cg(None, ec.ROOT_LM_CAL if cal else ec.ROOT_LM,
|
|
69
|
+
ec.LM_H, ec.lm_turn_text, "lme",
|
|
70
|
+
calib_of=ec.calibrate_lm_turn if cal else None,
|
|
71
|
+
rebuild=args.rebuild)
|
|
72
|
+
ec.install_read_cache(cg)
|
|
73
|
+
|
|
74
|
+
paths = ec.PATHS_CAL if cal else ec.PATHS
|
|
75
|
+
rows_by = {}
|
|
76
|
+
for gname, qtypes in GROUPS.items():
|
|
77
|
+
qs = ec.sample_questions(ec.load_questions("lm", qtypes=qtypes), args.n)
|
|
78
|
+
print(f" [{gname}] {len(qs)} 题 …")
|
|
79
|
+
rows_by[gname] = ec.evaluate_group(cg, qs, k=args.k, paths=paths,
|
|
80
|
+
fusion=args.fusion,
|
|
81
|
+
path_weights=wmap)
|
|
82
|
+
|
|
83
|
+
pos_rows = [r for g in POS_GROUPS for r in rows_by[g]]
|
|
84
|
+
line = ec.calibrate_line(pos_rows)
|
|
85
|
+
pos_false_refusal = ec.false_refusal_rate(pos_rows, line)
|
|
86
|
+
|
|
87
|
+
groups = {g: ec.summarize(rows_by[g], k=args.k) for g in GROUPS}
|
|
88
|
+
ec.print_table(f"LongMemEval-S T-REC 三组(口径 {'B 标定' if cal else 'A legacy'})",
|
|
89
|
+
groups, k=args.k)
|
|
90
|
+
print(f"\n拒答线(正例 hit@1 题 Top-1 分 p10):{line:.6f}")
|
|
91
|
+
print(f"正例误拒率(Top-1 分 < 线):{ec.pct(pos_false_refusal)}")
|
|
92
|
+
gate = {"interference_hit1": groups["interference"].get("hit@1", 0.0),
|
|
93
|
+
"interference_pass": groups["interference"].get("hit@1", 0.0) >= 0.80,
|
|
94
|
+
"calibrated_line": line}
|
|
95
|
+
print(f"干扰组 gate(≥80%):{'PASS' if gate['interference_pass'] else 'FAIL'}")
|
|
96
|
+
|
|
97
|
+
ec.save_result("trec_longmem_cal.json" if cal else "trec_longmem.json", {
|
|
98
|
+
"dataset": "LongMemEval-S (xiaowu0162/LongMemEval)",
|
|
99
|
+
"caliber": "B-calibrated(五要素标定 + semantic 路)" if cal
|
|
100
|
+
else "A-legacy(裸 turn,四路基线)",
|
|
101
|
+
"metric_caliber": "evidence-hit(answer_session_ids→turn 集合命中),"
|
|
102
|
+
"非 LLM-judge",
|
|
103
|
+
"paths": list(paths),
|
|
104
|
+
"k": args.k, "sampling": args.n or "full",
|
|
105
|
+
"groups": groups,
|
|
106
|
+
"false_refusal_pos": pos_false_refusal,
|
|
107
|
+
"gate": gate,
|
|
108
|
+
"group_mapping": {g: list(q) for g, q in GROUPS.items()},
|
|
109
|
+
})
|
|
110
|
+
|
|
111
|
+
|
|
112
|
+
if __name__ == "__main__":
|
|
113
113
|
main()
|