@furongjun1999/dsh-memory 0.4.11 → 0.5.0
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/README.md +16 -16
- package/codebuddy/CODEBUDDY.md +11 -3
- package/codebuddy/README.md +92 -90
- package/codebuddy/mcp.json +27 -27
- package/docs/GBrain/345/217/257/345/200/237/351/211/264/347/202/271_/347/201/265/346/236/242/350/220/275/347/202/271/344/272/244/346/216/245_20260919.md +169 -169
- package/docs/Pi/345/217/257/345/255/246/344/271/240/344/274/230/347/202/271_/347/201/265/346/236/242/345/244/247/350/204/221/346/224/271/350/277/233/344/272/244/346/216/245_20260915.md +144 -144
- package/docs/README.md +142 -111
- package/docs/discipline/harnesses.yaml +244 -226
- package/docs/discipline/templates/full.md.tmpl +61 -61
- package/docs/discipline/templates/rules.mdc.tmpl +68 -0
- package/docs/discipline/templates/skill.md.tmpl +23 -23
- package/docs/eval/AGI/344/270/203/347/273/264/350/257/204/345/210/206/346/212/245/345/221/212_md_cg_v1.0.md +299 -299
- package/docs/eval/AGI/344/270/203/347/273/264/350/257/204/345/210/206/346/212/245/345/221/212_md_cg_v2.0.md +239 -239
- package/docs/eval//345/256/236/351/252/214/346/226/271/346/241/210_/345/255/246/344/271/240/351/227/255/347/216/257AB/344/270/216/346/250/252/350/257/204_v1.0.md +174 -174
- package/docs/eval//346/250/252/350/257/204_/345/205/255/345/256/266100/351/242/230/344/270/255/350/213/261/345/217/214/346/237/245_v1.0.md +223 -223
- package/docs/{mdcg → hive}//344/273/244/347/211/214/344/270/216/350/247/222/350/211/262/346/235/203/350/201/214/345/210/206/347/246/273_v0.1.md +165 -160
- package/docs/hive//344/273/244/347/211/214/350/257/255/344/271/211/344/277/256/346/255/243_/344/273/262/350/243/201/344/275/215_v0.1.md +76 -0
- package/docs/{mdcg → hive}//345/255/220/344/273/243/347/220/206/351/205/215/347/275/256/346/240/207/345/207/206_v0.5.md +236 -236
- package/docs/hive//346/243/200/347/264/242/346/224/266/346/225/233/345/256/236/346/265/213/344/270/216S1b/350/256/276/350/256/241_v0.1.md +43 -43
- package/docs/hive//346/243/200/347/264/242/347/256/227/346/263/225/345/217/243/345/276/204/345/257/271/347/205/247_v0.1.md +85 -0
- package/docs/hive//346/243/200/347/264/242/350/267/257/345/276/204/344/270/216/350/256/244/347/237/245/347/273/223/346/236/204/345/245/221/347/272/246_v0.1.md +102 -102
- package/docs/hive//350/234/202/345/267/242M6_ingest/345/256/236/346/226/275/350/256/241/345/210/222_v0.1.md +47 -0
- package/docs/hive//350/234/202/345/267/242/345/217/214/345/256/236/344/276/213/344/272/222/351/252/214_/350/256/276/350/256/241/345/256/232/347/250/277.md +503 -503
- package/docs/hive//350/234/202/345/267/242/345/267/245/344/275/234/350/256/260/345/277/206_/351/241/271/347/233/256/350/256/241/345/210/222.md +85 -85
- package/docs/hive//350/234/202/345/267/242/350/256/276/350/256/241_/347/220/206/350/256/272/345/257/271/351/275/220_v0.1.md +191 -0
- package/docs/hive//350/234/202/345/267/242/350/277/255/344/273/243_/345/256/217/350/247/202/344/270/216/347/276/244/344/275/223/350/260/203/345/272/246_v0.1.md +90 -0
- package/docs/mdcg/D_meta_/345/267/245/347/250/213/345/214/226/346/226/271/346/241/210_v0.2.md +216 -216
- package/docs/mdcg/README/350/257/246/347/273/206/347/211/210_v0.4.10.md +646 -646
- package/docs/mdcg/lingshu_tutorial.html +14449 -14449
- package/docs/mdcg/release_v0.4.11.md +49 -0
- package/docs/mdcg/release_v0.4.5.md +55 -55
- package/docs/mdcg/tool_table_v0.3.0.md +117 -117
- package/docs/mdcg//345/205/250/345/272/223/344/273/243/347/240/201/350/257/204/345/256/241/344/270/216/346/235/241/344/273/266/345/214/226/346/263/250/351/207/212_/350/256/241/345/210/222_v0.1.md +600 -600
- package/docs/mdcg//345/212/237/350/203/275/350/260/203/347/224/250/346/230/240/345/260/204/350/241/250_v0.1.md +40 -40
- package/docs/mdcg//345/215/225/345/205/203/350/207/252/346/210/221/351/224/232/347/202/271_/347/263/273/347/273/237/346/217/220/347/244/272/350/257/215/346/240/207/345/207/206_v0.3.md +275 -275
- package/docs/mdcg//345/217/221/345/270/203/351/227/250/347/246/201/351/223/276_v0.1.md +54 -0
- package/docs/mdcg//346/272/220/347/240/201/347/272/247/346/236/266/346/236/204/345/256/241/350/256/241_GPT/346/211/271/350/257/204/345/257/271/347/205/247_v1.0.md +130 -130
- package/docs/mdcg//347/201/265/346/236/24282/345/267/245/345/205/267_/345/212/237/350/203/275/346/225/264/347/220/206/344/270/216/350/277/201/347/247/273/346/230/240/345/260/204_v0.1.md +278 -278
- package/docs/mdcg//347/201/265/346/236/242/350/256/260/345/277/206/345/212/250/350/257/215/345/215/217/350/256/256_v1.0-draft.md +172 -172
- package/docs/mdcg//347/274/272/345/217/243/345/215/225_P0/346/224/266/345/217/243_v0.1.md +270 -270
- package/docs/mdcg//350/256/244/347/237/245/345/233/276_G4-G8/347/274/272/345/217/243/350/243/201/345/256/232/345/215/225_v0.1.md +491 -491
- package/docs/mdcg//350/256/244/347/237/245/345/233/276_/346/235/241/344/273/266/347/251/272/351/227/264/345/220/210/346/210/220/344/270/216/347/224/237/346/225/210/346/235/241/344/273/266/345/217/243/345/276/204_v0.1.md +340 -340
- package/docs/mdcg//350/256/244/347/237/245/345/233/276_/347/264/242/345/274/225/344/270/216/345/267/245/347/250/213/350/247/204/350/214/203/345/214/226_/350/256/241/345/210/222_v0.1.md +588 -588
- package/docs/plans/GridWorld/346/234/200/345/260/217/351/227/255/347/216/257/350/247/204/346/240/274_v0.1.md +176 -176
- package/docs/plans//345/221/275/345/220/215/346/262/273/347/220/206_/351/241/271/347/233/256/350/256/241/345/210/222.md +81 -81
- package/docs/swarm//350/234/202/347/276/244/344/272/222/350/201/224_v0.1.md +704 -704
- package/docs/swarm//350/234/202/347/276/244/345/220/214/351/224/231/346/243/200/346/265/213/345/256/236/351/252/214/345/215/217/350/256/256_v0.1.md +242 -242
- package/docs/theory//345/215/225/347/272/277/347/250/213/344/270/216/346/263/250/346/204/217/345/212/233/351/233/206/344/270/255_/346/227/240/344/272/211/350/256/256/347/220/206/350/256/272/346/226/207/346/241/243_v1.0.md +129 -129
- package/docs/theory//345/271/266/345/217/221/345/277/205/347/204/266/346/200/247/347/220/206/350/256/272_v0.2.md +134 -134
- package/docs/theory//346/231/272/350/203/275/350/256/2723.4.md +5260 -5260
- package/docs/theory//346/246/202/345/277/265/345/210/206/345/261/202/345/257/271/351/275/220/350/241/250_v0.1.md +145 -145
- package/docs/theory//347/220/206/350/256/272_/346/234/272/345/210/266_/344/273/243/347/240/201_/345/256/236/351/252/214_/347/274/272/345/217/243/347/237/251/351/230/265_v0.1.md +144 -144
- package/docs/theory//347/220/206/350/256/272/344/273/223/346/213/206/345/210/206/344/270/216/347/231/275/347/256/261/347/237/245/350/257/206/345/272/223/345/206/205/350/277/201_v0.1.md +198 -198
- package/docs/theory//350/256/244/347/237/245/344/273/243/347/220/206/344/270/216/346/224/266/346/225/233/347/273/223/346/236/204_/346/235/241/344/273/266/350/256/272/351/207/215/346/236/204_v0.1.md +221 -221
- package/docs/world_model//344/270/226/347/225/214/346/250/241/345/236/213_/347/245/236/347/273/217/347/275/221/347/273/234/345/272/225/345/261/202/346/236/266/346/236/204_v1.0.md +237 -237
- package/docs//345/217/221/345/270/203/344/273/266/345/233/236/346/272/257/350/257/264/346/230/216_v0.1.md +82 -82
- package/docs//345/267/245/344/275/234/347/272/252/345/276/213_/350/256/244/347/237/245/345/233/276/346/235/241/347/233/256_v1.1.json +28 -2
- package/dsh/README.md +82 -82
- package/dsh/cordis.yml.example +139 -139
- package/dsh/update-lingshu.bat +11 -11
- package/lib/hooks.js +36 -2
- package/lib/lib/roleplay_web.js +427 -427
- package/md_cg/__init__.py +7 -7
- package/md_cg/audit.py +368 -368
- package/md_cg/autonomy.py +287 -287
- package/md_cg/backfill.py +1327 -1327
- package/md_cg/backfill_bigdomain.py +34 -34
- package/md_cg/bench6_arms.py +410 -410
- package/md_cg/bench6_common.py +230 -230
- package/md_cg/bench6_competitors.py +212 -212
- package/md_cg/bench_axis_domain.py +257 -257
- package/md_cg/bench_blind_comp.py +308 -308
- package/md_cg/bench_en_atoms_public.py +230 -230
- package/md_cg/bench_governance.py +348 -348
- package/md_cg/bench_lme_zh.py +410 -410
- package/md_cg/bench_locomo.py +121 -121
- package/md_cg/bench_locomo_zh.py +450 -450
- package/md_cg/bench_locomo_zh_public.py +147 -147
- package/md_cg/bench_longmem.py +112 -112
- package/md_cg/bench_membench.py +632 -632
- package/md_cg/bench_p0.py +149 -149
- package/md_cg/bench_progressive.py +287 -287
- package/md_cg/bench_role_views.py +238 -238
- package/md_cg/bench_task_ab.py +243 -243
- package/md_cg/bench_task_ab_llm.py +408 -408
- package/md_cg/bench_unified_en.py +204 -204
- package/md_cg/bench_zh_mad.py +601 -601
- package/md_cg/blindspot_tickets.py +123 -123
- package/md_cg/branches.py +285 -285
- package/md_cg/build_postings.py +73 -73
- package/md_cg/ccgc.py +1005 -948
- package/md_cg/census.py +132 -132
- package/md_cg/chain.py +300 -300
- package/md_cg/codeindex.py +531 -531
- package/md_cg/coldverify.py +292 -292
- package/md_cg/comment_gate.py +337 -337
- package/md_cg/cond_compose.py +190 -190
- package/md_cg/cond_facts.py +154 -154
- package/md_cg/cond_template.json +106 -106
- package/md_cg/condition_anchor.py +142 -142
- package/md_cg/conformance.py +726 -726
- package/md_cg/consistency.py +717 -717
- package/md_cg/consolidate.py +1536 -1439
- package/md_cg/corpus.py +110 -110
- package/md_cg/crosscheck.py +1097 -1097
- package/md_cg/crypto.py +437 -437
- package/md_cg/d_meta.py +310 -310
- package/md_cg/datapath.py +334 -334
- package/md_cg/docindex.py +473 -473
- package/md_cg/eval_common.py +575 -575
- package/md_cg/evidence.py +580 -580
- package/md_cg/evolution.py +477 -477
- package/md_cg/export.py +220 -220
- package/md_cg/forgetting.py +581 -581
- package/md_cg/fsutil.py +329 -329
- package/md_cg/hotcache.py +238 -214
- package/md_cg/hyperedge.py +251 -251
- package/md_cg/identity.py +390 -390
- package/md_cg/insight.py +500 -500
- package/md_cg/interop.py +199 -0
- package/md_cg/lexicon/build_cedict_en_zh.py +329 -329
- package/md_cg/lexicon/build_standard_en.py +171 -171
- package/md_cg/lexicon/expand_en_zh.py +211 -211
- package/md_cg/lifecycle.py +272 -272
- package/md_cg/linkref.py +280 -280
- package/md_cg/links.py +622 -622
- package/md_cg/mcp_server.py +129 -32
- package/md_cg/md_whitebox.py +345 -345
- package/md_cg/mdcg.py +176 -117
- package/md_cg/mdcos.py +79 -13
- package/md_cg/metacognition.py +591 -591
- package/md_cg/migrate.py +119 -119
- package/md_cg/migrate_aeis.py +221 -221
- package/md_cg/migrate_roleplay.py +293 -293
- package/md_cg/migrate_wisdom_graph.py +360 -360
- package/md_cg/mreview/__init__.py +25 -25
- package/md_cg/mreview/__main__.py +110 -110
- package/md_cg/mreview/bundle.py +178 -178
- package/md_cg/mreview/candidates.py +262 -262
- package/md_cg/mreview/govern.py +693 -693
- package/md_cg/mreview/locate.py +939 -939
- package/md_cg/mreview/pipeline.py +728 -728
- package/md_cg/mreview/rules/duplication.json +21 -21
- package/md_cg/mreview/rules/field_coverage.json +54 -54
- package/md_cg/mreview/rules/source_license.json +21 -21
- package/md_cg/mreview/rules/template_flow.json +21 -21
- package/md_cg/mreview/ruleset.py +252 -252
- package/md_cg/nodefile.py +575 -575
- package/md_cg/pooling.py +484 -472
- package/md_cg/postings.py +298 -298
- package/md_cg/predict.py +1100 -1100
- package/md_cg/progressive.py +123 -123
- package/md_cg/protect.py +272 -272
- package/md_cg/protocol/md_cg_gate.proto +33 -33
- package/md_cg/protocol.py +372 -372
- package/md_cg/provenance.py +582 -582
- package/md_cg/reach.py +453 -453
- package/md_cg/readcache.py +85 -0
- package/md_cg/refindex.py +833 -833
- package/md_cg/refine.py +604 -604
- package/md_cg/roleviews.py +89 -89
- package/md_cg/routing.py +365 -365
- package/md_cg/scrub.py +852 -852
- package/md_cg/security.py +274 -274
- package/md_cg/self_state.py +1029 -1029
- package/md_cg/selfreport.py +151 -151
- package/md_cg/semantic/__init__.py +10 -10
- package/md_cg/semantic/canonical.py +122 -122
- package/md_cg/semantic/en_normalizer.py +364 -364
- package/md_cg/semantic/en_zh_map.json +28694 -0
- package/md_cg/semantic/export_en_zh_map.py +64 -0
- package/md_cg/semantic/unify.py +45 -0
- package/md_cg/semantic/zh_en_atoms.py +139 -139
- package/md_cg/signer.py +562 -562
- package/md_cg/sources.py +815 -582
- package/md_cg/statushdr.py +179 -179
- package/md_cg/stg.py +48 -37
- package/md_cg/subgraph.py +729 -729
- package/md_cg/sustain.py +1138 -1138
- package/md_cg/tasks.py +470 -470
- package/md_cg/test_action_derive.py +203 -203
- package/md_cg/test_audit_rotate.py +270 -270
- package/md_cg/test_autonomy.py +143 -143
- package/md_cg/test_bench_governance.py +102 -102
- package/md_cg/test_blindspot_tickets.py +166 -166
- package/md_cg/test_branches.py +249 -249
- package/md_cg/test_ccg_perturb.py +184 -184
- package/md_cg/test_ccgc.py +433 -433
- package/md_cg/test_census_prune.py +81 -81
- package/md_cg/test_cond_compose_anchors.py +76 -76
- package/md_cg/test_cond_match.py +165 -165
- package/md_cg/test_condition_anchor.py +81 -81
- package/md_cg/test_d_meta.py +412 -412
- package/md_cg/test_datapath_root.py +199 -199
- package/md_cg/test_en_pipeline.py +166 -166
- package/md_cg/test_gain_gate.py +212 -212
- package/md_cg/test_health_scale.py +173 -173
- package/md_cg/test_hive_ingest.py +285 -0
- package/md_cg/test_hot_cold.py +215 -215
- package/md_cg/test_hyperedge.py +245 -245
- package/md_cg/test_i26_empty_first_write.py +116 -0
- package/md_cg/test_i27_e041_identity.py +128 -0
- package/md_cg/test_i28_hotcache_prodpath.py +122 -0
- package/md_cg/test_identity_attribution.py +147 -147
- package/md_cg/test_index_durability.py +224 -224
- package/md_cg/test_interop.py +93 -0
- package/md_cg/test_lifecycle.py +309 -309
- package/md_cg/test_linkref.py +306 -306
- package/md_cg/test_lock.py +43 -43
- package/md_cg/test_md_access_parity.py +255 -255
- package/md_cg/test_md_writepath.py +345 -345
- package/md_cg/test_mdstore_search_parity.py +160 -0
- package/md_cg/test_mr_m2.py +587 -587
- package/md_cg/test_mr_m3.py +710 -710
- package/md_cg/test_mr_m4.py +485 -485
- package/md_cg/test_p0.py +250 -250
- package/md_cg/test_p1.py +316 -316
- package/md_cg/test_p10_identity.py +173 -173
- package/md_cg/test_p11_consistency.py +233 -233
- package/md_cg/test_p12_metacognition.py +212 -212
- package/md_cg/test_p13_encryption.py +241 -241
- package/md_cg/test_p14_sustain.py +249 -249
- package/md_cg/test_p15_scrub.py +280 -280
- package/md_cg/test_p16_self_state.py +301 -301
- package/md_cg/test_p17_predict.py +354 -354
- package/md_cg/test_p18_whitebox.py +171 -171
- package/md_cg/test_p19_migrate_roleplay.py +149 -149
- package/md_cg/test_p20_evolution.py +315 -315
- package/md_cg/test_p21_tokens.py +293 -270
- package/md_cg/test_p22_theory.py +175 -175
- package/md_cg/test_p23_links.py +311 -311
- package/md_cg/test_p24_evidence.py +227 -227
- package/md_cg/test_p25_weights.py +156 -156
- package/md_cg/test_p26_refindex.py +416 -416
- package/md_cg/test_p27_docindex.py +765 -765
- package/md_cg/test_p28_refcheck.py +305 -305
- package/md_cg/test_p29_session_ingest_export.py +354 -333
- package/md_cg/test_p3.py +11 -2
- package/md_cg/test_p30_maintain.py +330 -330
- package/md_cg/test_p31_insight.py +534 -534
- package/md_cg/test_p32_backfill.py +298 -298
- package/md_cg/test_p33_ccg_wiring.py +293 -293
- package/md_cg/test_p34_crosscheck.py +331 -331
- package/md_cg/test_p35_conditioned_claim.py +252 -252
- package/md_cg/test_p36_kp_align.py +230 -230
- package/md_cg/test_p37_condition_space.py +248 -248
- package/md_cg/test_p38_concurrent_flush.py +102 -0
- package/md_cg/test_p38_contextualize.py +273 -273
- package/md_cg/test_p39_verify_flow.py +113 -0
- package/md_cg/test_p39_vision_evidence.py +369 -369
- package/md_cg/test_p40_refine_worklist.py +241 -241
- package/md_cg/test_p41_evolve_patrol.py +224 -224
- package/md_cg/test_p42_provenance.py +269 -269
- package/md_cg/test_p43_pooling.py +412 -398
- package/md_cg/test_p44_md_whitebox.py +231 -231
- package/md_cg/test_p45_session_identity.py +219 -219
- package/md_cg/test_p46_unit_scope.py +272 -272
- package/md_cg/test_p47_session_view.py +281 -0
- package/md_cg/test_p4_fuzzy.py +223 -223
- package/md_cg/test_p5_semantic.py +226 -226
- package/md_cg/test_p6_consolidate.py +440 -387
- package/md_cg/test_p7_goals_recent.py +202 -202
- package/md_cg/test_p8_subgraph_chain.py +200 -200
- package/md_cg/test_p9_forget_protect.py +231 -231
- package/md_cg/test_predict_beta.py +135 -135
- package/md_cg/test_preflight_failclosed.py +100 -100
- package/md_cg/test_progressive.py +146 -146
- package/md_cg/test_protocol.py +243 -243
- package/md_cg/test_reach.py +378 -378
- package/md_cg/test_reach_keys.py +201 -201
- package/md_cg/test_read_clip.py +141 -141
- package/md_cg/test_readcache_prodpath.py +155 -0
- package/md_cg/test_retr_gates_prodpath.py +140 -0
- package/md_cg/test_retr_s1.py +340 -340
- package/md_cg/test_retr_s1b.py +209 -209
- package/md_cg/test_retr_s3.py +194 -194
- package/md_cg/test_retr_s4.py +163 -163
- package/md_cg/test_retr_s5.py +200 -200
- package/md_cg/test_retr_s6.py +157 -157
- package/md_cg/test_retr_s7.py +384 -384
- package/md_cg/test_retr_s8_time.py +369 -316
- package/md_cg/test_retr_s9_edges.py +286 -286
- package/md_cg/test_retr_s9_entity_ctx.py +175 -175
- package/md_cg/test_review_conformance.py +367 -367
- package/md_cg/test_role_views.py +354 -354
- package/md_cg/test_sem_noise.py +242 -242
- package/md_cg/test_semantic_canonical.py +241 -241
- package/md_cg/test_subproc_encoding.py +192 -192
- package/md_cg/test_sustain_mutual.py +153 -153
- package/md_cg/test_tasks.py +409 -409
- package/md_cg/test_tool_face.py +189 -189
- package/md_cg/test_transfer.py +180 -180
- package/md_cg/test_trust.py +361 -361
- package/md_cg/test_twophase.py +286 -286
- package/md_cg/test_v14_fixes.py +397 -397
- package/md_cg/test_validity_filter.py +280 -280
- package/md_cg/test_verify_answer.py +138 -138
- package/md_cg/test_wisdom_md_store.py +292 -292
- package/md_cg/test_writelimit.py +197 -197
- package/md_cg/test_writepipe.py +214 -214
- package/md_cg/theory.py +273 -273
- package/md_cg/tokens.py +677 -663
- package/md_cg/tool_face.py +260 -260
- package/md_cg/trust.py +986 -950
- package/md_cg/twophase.py +231 -231
- package/md_cg/units.py +667 -667
- package/md_cg/vision_evidence.py +666 -666
- package/md_cg/weights.py +624 -624
- package/md_cg/whitebox.py +527 -527
- package/md_cg/whitebox_kb/__init__.py +37 -37
- package/md_cg/whitebox_kb/aeis_core/__init__.py +42 -42
- package/md_cg/whitebox_kb/aeis_core/semantic.py +280 -280
- package/md_cg/whitebox_kb/aeis_core/textutil.py +13 -13
- package/md_cg/whitebox_kb/engine.py +310 -310
- package/md_cg/whitebox_kb/seed_knowledge//346/231/272/350/203/275/350/256/2723.4.md +5260 -5260
- package/md_cg/whitebox_kb/wisdom/browser_units.py +2631 -2631
- package/md_cg/whitebox_kb/wisdom/causal_discover.py +432 -432
- package/md_cg/whitebox_kb/wisdom/chat_engine.py +1506 -1506
- package/md_cg/whitebox_kb/wisdom/code_solidified.json +6195 -6195
- package/md_cg/whitebox_kb/wisdom/compiler_code_units.py +3033 -3033
- package/md_cg/whitebox_kb/wisdom/condition_algebra.py +112 -112
- package/md_cg/whitebox_kb/wisdom/condition_frame.py +315 -315
- package/md_cg/whitebox_kb/wisdom/condition_kb.py +108 -108
- package/md_cg/whitebox_kb/wisdom/conflict_map.json +4445 -4445
- package/md_cg/whitebox_kb/wisdom/core/lexer.py +512 -512
- package/md_cg/whitebox_kb/wisdom/core/name_checker.py +1023 -1023
- package/md_cg/whitebox_kb/wisdom/cspmn.py +258 -258
- package/md_cg/whitebox_kb/wisdom/csre.py +264 -264
- package/md_cg/whitebox_kb/wisdom/danmaku_audit.py +252 -252
- package/md_cg/whitebox_kb/wisdom/distilled_condition_units.json +6417 -6417
- package/md_cg/whitebox_kb/wisdom/docs/WB-EVAL-20260902b.json +1950 -1950
- package/md_cg/whitebox_kb/wisdom/docs/WB-EVAL-20260902c.json +1296 -1296
- package/md_cg/whitebox_kb/wisdom/docs/whitebox_capability_graph_demo.json +59 -59
- package/md_cg/whitebox_kb/wisdom/graph_db_units.py +3089 -3089
- package/md_cg/whitebox_kb/wisdom/knowledge_points.py +318 -318
- package/md_cg/whitebox_kb/wisdom/md_access.py +470 -470
- package/md_cg/whitebox_kb/wisdom/md_store.py +276 -251
- package/md_cg/whitebox_kb/wisdom/migrate_wisdom.py +476 -476
- package/md_cg/whitebox_kb/wisdom/navigate.py +248 -248
- package/md_cg/whitebox_kb/wisdom/neural_retrieve.py +224 -224
- package/md_cg/whitebox_kb/wisdom/os_units.py +2735 -2735
- package/md_cg/whitebox_kb/wisdom/pattern_separation.py +376 -376
- package/md_cg/whitebox_kb/wisdom/prereq_map.json +364 -364
- package/md_cg/whitebox_kb/wisdom/python_code_units.py +2766 -2766
- package/md_cg/whitebox_kb/wisdom/role_solidified.json +7 -7
- package/md_cg/whitebox_kb/wisdom/route_memory.py +244 -244
- package/md_cg/whitebox_kb/wisdom/scene_reconstruction.py +148 -148
- package/md_cg/whitebox_kb/wisdom/snr_report.json +40 -40
- package/md_cg/whitebox_kb/wisdom/test_code_compose_domains.py +7541 -7541
- package/md_cg/whitebox_kb/wisdom/test_compiler_self_bootstrap.py +354 -354
- package/md_cg/whitebox_kb/wisdom/test_ecosystem_assembly.py +158 -158
- package/md_cg/whitebox_kb/wisdom/test_ecosystem_demos.py +193 -193
- package/md_cg/whitebox_kb/wisdom/test_graph_db.py +292 -292
- package/md_cg/whitebox_kb/wisdom/test_python_self_bootstrap.py +160 -160
- package/md_cg/whitebox_kb/wisdom/trigger_words_index.json +4366 -4366
- package/md_cg/whitebox_kb/wisdom/verifier.py +1297 -1297
- package/md_cg/writelimit.py +356 -356
- package/md_cg/writepipe.py +550 -542
- package/package.json +97 -96
- package/skills/plugin.json +54 -54
- package/skills/skills/designer-perspective/SKILL.md +158 -158
- package/skills/skills/designer-perspective/references/01-observation-position.md +66 -66
- package/skills/skills/designer-perspective/references/02-structure-recognition.md +62 -62
- package/skills/skills/designer-perspective/references/03-direction-judgment.md +55 -55
- package/skills/skills/designer-perspective/references/04-qualification-verdict.md +72 -72
- package/skills/skills/designer-perspective/references/05-condition-attribution.md +74 -74
- package/skills/skills/designer-perspective/scripts/designer.py +545 -545
- package/skills/skills/designer-perspective/tests/cases.jsonl +17 -17
- package/skills/skills/designer-perspective/tests/selftest.py +61 -61
- package/skills/skills/lingshu-browser/SKILL.md +60 -60
- package/skills/skills/lingshu-compiler/SKILL.md +56 -56
- package/skills/skills/lingshu-compiler/units/analyze-type-infer/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/check-name-real/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-assign/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-expr-tree/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-full-pipeline/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-func-def/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-if-then/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-logic-expr/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-recursive/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-scope/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-type-check/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-while/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0010c4bf/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0355bffb/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0361708a/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-054a0414/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-05a1691a/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-05eeed1e/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0622a1f6/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-08b54217/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0a62b70c/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0ab24d00/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0e093688/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0e82b966/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0ee9b9b9/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0f3787e6/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-1028685f/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-11897630/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-16661b9b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-1f722303/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-25be1262/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-2a76ba07/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-2dbea54a/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-2df52f16/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-2ec2c9d2/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-2f8c8f39/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-38378ac7/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-39457d2e/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-39fb5926/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-47f4fbfa/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-4a8cd1f1/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-4b230b6b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-4cbbda95/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-4d5a68ff/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-56dc9bdd/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-57e76ebe/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-61ff016b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-63eae588/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-64c4224b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-66377955/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-674ab4f6/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-6af76fd6/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-6d979db2/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-6de326c0/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-6f1c0eea/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-724d6c9b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-7690177f/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-7b229a7d/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-7f471b3a/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-815cad08/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-83c61634/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-8c798c81/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-8dd747ac/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-90324d0a/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-94b8d72d/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-94f12231/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-95937c16/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-98a5625b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-98b4c42f/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-98e3894a/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-9bdfe4b8/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-9d9b4e83/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-9f7be5ad/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-a6daf076/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-a7995a0c/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-a8399248/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-aabbd099/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-afe169d8/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-b0678bda/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-b09bd196/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-b1396e23/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-b9b31ce0/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-c10264a7/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-cb1e8e4b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-ccafd438/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-cda9c262/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-ce648068/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-cf5776a4/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-d974e5d3/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-e3979fd3/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-eb1cf2b5/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-ecb30d5b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-f8c8b24b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-f99fedbe/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-fa8ff5f7/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-fe1b058d/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/lex-chinese-program/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/lex-dao-de-jing/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/lex-nine-chapters/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-arithmetic/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-array-ops/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-closure-call/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-closure-create/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-compare/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-cond-jump/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-cond-space/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-exception/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-func-call/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-loop-run/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-profiling/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-refcount/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-run-loop/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-short-circuit/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-stack-guard/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-stack-ops/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-trust-accum/SKILL.md +45 -45
- package/skills/skills/lingshu-graph/SKILL.md +63 -63
- package/skills/skills/lingshu-net/SKILL.md +48 -48
- package/skills/skills/lingshu-os/SKILL.md +64 -64
- package/skills/skills/lingshu-pylang/SKILL.md +71 -71
- package/src/bridge.ts +401 -401
- package/src/hooks.ts +38 -2
- package/src/lib/datapath.ts +326 -326
- package/src/lib/mdcg_client.ts +413 -413
- package/src/lib/mutual.ts +428 -428
- package/src/lib/prompt_safety.ts +62 -62
- package/src/lib/python_path.ts +71 -71
- package/src/lib/roleplay_web.ts +932 -932
- package/src/lib/token_store.ts +192 -192
- package/src/tools.ts +212 -212
- package/zcode/AGENTS.md +11 -3
- package/zcode/README.md +41 -41
- /package/docs/{mdcg → hive}//344/270/273/344/273/243/347/220/206/345/255/220/344/273/243/347/220/206/350/256/260/345/277/206/346/236/266/346/236/204/350/256/276/350/256/241.md" +0 -0
package/md_cg/bench_task_ab.py
CHANGED
|
@@ -1,244 +1,244 @@
|
|
|
1
|
-
# -*- coding: utf-8 -*-
|
|
2
|
-
"""任务级 A/B 对照实验:无记忆 vs 有记忆(白箱第 5 篇第 9 章「验证方法」)
|
|
3
|
-
|
|
4
|
-
评测问题:**把「已写入的失败教训」装进记忆后,AI 在同类任务上是否少犯错?**
|
|
5
|
-
|
|
6
|
-
两臂唯一差异 = 记忆库:
|
|
7
|
-
arm_none 空库:面对错误只能靠字面猜测下一步动作,选错就试错重来
|
|
8
|
-
arm_mem 有库:Phase A 用 mine_fix_pairs 把「错误 → 修复」写进知识 + 负记忆;
|
|
9
|
-
Phase B 先 recall(错误) 再决策,命中修复知识则一次到位
|
|
10
|
-
|
|
11
|
-
指标(确定性模拟,不调用 LLM):
|
|
12
|
-
first_try_rate 首次决策就选对的比例(最不受试错上限影响的指标)
|
|
13
|
-
success_rate 在 max_turns 内选中正确修复的比例(越高越好)
|
|
14
|
-
repeat_error_rate 至少踩过一次已知陷阱的比例(越高越糟 = 重复犯错)
|
|
15
|
-
avg_turns 达成正确决策所需轮数(无记忆臂靠试错,越多越差)
|
|
16
|
-
avg_tokens 每次决策的召回上下文 token(记忆的代价,诚实计入)
|
|
17
|
-
hit_rate Phase B 中 recall 直接命中修复知识的比例
|
|
18
|
-
|
|
19
|
-
诚实边界(不夸大结论):
|
|
20
|
-
1) 这是确定性模拟器,不是 LLM 端到端评测。它测的是「记忆机制能否把已写入的
|
|
21
|
-
教训在下次同类任务里用起来」,不测「LLM 会不会变聪明」。
|
|
22
|
-
2) 陷阱与修复都是 Phase A 写入的,实验验证的是复用能力,不是凭空学习能力。
|
|
23
|
-
3) 两臂的候选动作池完全相同,差别只有记忆库——这是 A/B 的唯一变量。
|
|
24
|
-
4) 无记忆臂的策略是「按字面覆盖选 top-1,选错则排除重试」,这是对无历史
|
|
25
|
-
agent 的合理建模,但它仍是一个建模选择,不是真实 agent 的行为分布。
|
|
26
|
-
|
|
27
|
-
跑法:
|
|
28
|
-
python -m md_cg.bench_task_ab
|
|
29
|
-
python -m md_cg.bench_task_ab --cases 6 --max-turns 3
|
|
30
|
-
"""
|
|
31
|
-
from __future__ import annotations
|
|
32
|
-
|
|
33
|
-
import argparse
|
|
34
|
-
import os
|
|
35
|
-
import shutil
|
|
36
|
-
import sys
|
|
37
|
-
import tempfile
|
|
38
|
-
|
|
39
|
-
from md_cg.mdcg import expand_query_terms_weighted
|
|
40
|
-
from md_cg.mdcos import MdCGOS, _weighted_coverage
|
|
41
|
-
|
|
42
|
-
# 12 个工程常见坑:trap 与 error 的字面重叠刻意高于 fix,用来模拟
|
|
43
|
-
# 「没有记忆时,最像对症的动作往往正是坑」。
|
|
44
|
-
CASES = [
|
|
45
|
-
{"id": "c01", "error": "ModuleNotFoundError: No module named 'requests'",
|
|
46
|
-
"fix": "pip install requests",
|
|
47
|
-
"trap": "ModuleNotFoundError 时跳过 requests 相关功能",
|
|
48
|
-
"decoy": "重启开发机"},
|
|
49
|
-
{"id": "c02", "error": "PermissionError: [Errno 13] Permission denied: '/var/log/app.log'",
|
|
50
|
-
"fix": "chmod 640 /var/log/app.log 并以具备写权限的用户运行",
|
|
51
|
-
"trap": "PermissionError 时忽略日志写入失败",
|
|
52
|
-
"decoy": "格式化磁盘"},
|
|
53
|
-
{"id": "c03", "error": "SyntaxError: invalid syntax 在 f-string 里的引号冲突",
|
|
54
|
-
"fix": "把外层引号换成双引号并转义内层引号",
|
|
55
|
-
"trap": "SyntaxError 时删除整段代码",
|
|
56
|
-
"decoy": "重装 Python"},
|
|
57
|
-
{"id": "c04", "error": "ConnectionRefusedError: 端口 5432 连接被拒绝",
|
|
58
|
-
"fix": "启动 postgres 服务并确认监听 5432",
|
|
59
|
-
"trap": "ConnectionRefusedError 时改用本地 sqlite",
|
|
60
|
-
"decoy": "更换网线"},
|
|
61
|
-
{"id": "c05", "error": "KeyError: 'user_id' 在请求体里缺失",
|
|
62
|
-
"fix": "用 payload.get('user_id') 并返回 400",
|
|
63
|
-
"trap": "KeyError 时给 user_id 赋默认空字符串",
|
|
64
|
-
"decoy": "重启 API 服务"},
|
|
65
|
-
{"id": "c06", "error": "TypeError: unsupported operand type(s) for +: 'int' and 'str'",
|
|
66
|
-
"fix": "显式 int(x) 转换后再相加",
|
|
67
|
-
"trap": "TypeError 时把整个表达式改成字符串拼接",
|
|
68
|
-
"decoy": "升级 numpy"},
|
|
69
|
-
{"id": "c07", "error": "TimeoutError: 请求 30s 未响应",
|
|
70
|
-
"fix": "给请求加 5s 超时并重试 2 次",
|
|
71
|
-
"trap": "TimeoutError 时无限重试",
|
|
72
|
-
"decoy": "更换 DNS"},
|
|
73
|
-
{"id": "c08", "error": "FileNotFoundError: 'config.yaml' 不存在",
|
|
74
|
-
"fix": "检查工作目录并用绝对路径读取 config.yaml",
|
|
75
|
-
"trap": "FileNotFoundError 时跳过配置加载",
|
|
76
|
-
"decoy": "重装操作系统"},
|
|
77
|
-
{"id": "c09", "error": "UnicodeDecodeError: 'gbk' codec can't decode byte 0xa3",
|
|
78
|
-
"fix": "以 encoding='utf-8' 打开文件",
|
|
79
|
-
"trap": "UnicodeDecodeError 时用 errors='ignore' 丢掉数据",
|
|
80
|
-
"decoy": "换一台电脑"},
|
|
81
|
-
{"id": "c10", "error": "IndexError: list index out of range 在分页第 2 页",
|
|
82
|
-
"fix": "先判断 len(items) 再取下标",
|
|
83
|
-
"trap": "IndexError 时直接把分页关掉",
|
|
84
|
-
"decoy": "增加内存"},
|
|
85
|
-
{"id": "c11", "error": "MemoryError: 一次加载 10GB csv 到内存",
|
|
86
|
-
"fix": "改用 pandas chunksize 分块读取",
|
|
87
|
-
"trap": "MemoryError 时无限增大 swap",
|
|
88
|
-
"decoy": "换 CPU"},
|
|
89
|
-
{"id": "c12", "error": "AssertionError: 断言 user.name == 'admin' 失败",
|
|
90
|
-
"fix": "检查测试夹具里的用户角色并修正期望值",
|
|
91
|
-
"trap": "AssertionError 时直接删掉这条断言",
|
|
92
|
-
"decoy": "重跑 CI"},
|
|
93
|
-
]
|
|
94
|
-
|
|
95
|
-
|
|
96
|
-
# 生效条件:给定 text,当 expand_query_terms_weighted(text) 为真值字典时返回其中键不以 `__` 开头的项(键转 str、值转 float),并先弹出 `__source__`;当该调用返回假值(None/空/其他假值)时返回空字典 {};
|
|
97
|
-
def _terms(text):
|
|
98
|
-
tw = expand_query_terms_weighted(text) or {}
|
|
99
|
-
tw.pop("__source__", None)
|
|
100
|
-
return {str(k): float(v) for k, v in tw.items()
|
|
101
|
-
if not str(k).startswith("__")}
|
|
102
|
-
|
|
103
|
-
|
|
104
|
-
# 生效条件:candidates 非空且 error 可被 _terms 处理时,按 _weighted_coverage 返回覆盖得分最高的候选,字面平局时取候选顺序最前者。
|
|
105
|
-
def _pick_lexical(error, candidates):
|
|
106
|
-
"""无记忆臂的确定性策略:按字面覆盖选 top-1(字面平局时按候选顺序)。"""
|
|
107
|
-
tw = _terms(error)
|
|
108
|
-
best, best_s = candidates[0], -1.0
|
|
109
|
-
for c in candidates:
|
|
110
|
-
s = _weighted_coverage(tw, c)
|
|
111
|
-
if s > best_s:
|
|
112
|
-
best, best_s = c, s
|
|
113
|
-
return best
|
|
114
|
-
|
|
115
|
-
|
|
116
|
-
# 生效条件:给定 error、candidates、fix、max_turns,在 pool 非空且 turns<max_turns 时每轮把 _pick_lexical(error, pool) 选中的 last 记入 touched:若 last==fix 立即返回 {'success': True, 'turns': turns, 'pick': last, 'touched': touched},否则从 pool 移除 last 继续;候选耗尽或 max_turns 为 0/负值时退出,返回 {'success': False, 'turns': turns, 'pick': last, 'touched': touched}(未进入循环时 success=False、turns=0、pick=None、touched=[]);
|
|
117
|
-
def _trial(error, candidates, fix, max_turns):
|
|
118
|
-
"""无记忆臂:选错就排除该动作、下一轮重选(模拟试错)。"""
|
|
119
|
-
pool = list(candidates)
|
|
120
|
-
touched, turns = [], 0
|
|
121
|
-
last = None
|
|
122
|
-
while pool and turns < max_turns:
|
|
123
|
-
turns += 1
|
|
124
|
-
last = _pick_lexical(error, pool)
|
|
125
|
-
touched.append(last)
|
|
126
|
-
if last == fix:
|
|
127
|
-
return {"success": True, "turns": turns, "pick": last,
|
|
128
|
-
"touched": touched}
|
|
129
|
-
pool.remove(last)
|
|
130
|
-
return {"success": False, "turns": turns, "pick": last,
|
|
131
|
-
"touched": touched}
|
|
132
|
-
|
|
133
|
-
|
|
134
|
-
# 生效条件:case["fix"] 为真且其字符串出现在 cg.recall(query, budget_tokens=budget, k=20) 返回 pack 各项 content 拼接成的 text 中时返回 hit=True、turns=1、touched=[];否则以 case["error"]、candidates、case["fix"]、max_turns 调 _trial 并回填 hit=False、turns=1+fb["turns"]、tokens=int(tokens_used or 0)。
|
|
135
|
-
def _decide_mem(cg, query, case, candidates, max_turns, budget):
|
|
136
|
-
"""有记忆臂:先召回,命中修复知识则一次到位;否则回退到试错。"""
|
|
137
|
-
res = cg.recall(query, budget_tokens=budget, k=20)
|
|
138
|
-
tokens = int(res.get("tokens_used") or 0)
|
|
139
|
-
text = " ".join((p.get("content") or "") for p in res.get("pack") or [])
|
|
140
|
-
if case["fix"] and case["fix"] in text:
|
|
141
|
-
return {"success": True, "turns": 1, "pick": case["fix"],
|
|
142
|
-
"touched": [], "tokens": tokens, "hit": True}
|
|
143
|
-
fb = _trial(case["error"], candidates, case["fix"], max_turns)
|
|
144
|
-
fb.update({"tokens": tokens, "hit": False, "turns": 1 + fb["turns"]})
|
|
145
|
-
return fb
|
|
146
|
-
|
|
147
|
-
|
|
148
|
-
# 生效条件:传入 x 时,返回 f"{100.0 * x:.1f}%" 的字符串(即 x 乘以 100 后保留一位小数的百分比表示);
|
|
149
|
-
def _pct(x):
|
|
150
|
-
return f"{100.0 * x:.1f}%"
|
|
151
|
-
|
|
152
|
-
|
|
153
|
-
# 生效条件:rows 为非空序列(n>0)且每项可解包为 (c, rn, rm)、c 含 trap/id/error、rn/rm 含 success/turns/touched(tokens 经 .get('tokens') or 0 把缺键或假值计 0,hit 经 .get 缺键或假值不计数),mined 含 pairs/knowledge_ids/rejected_ids 键,max_turns 为数值时,打印两臂指标与逐例清单,并按首次正确率与重复犯错率的大小关系(提升/相等/其余)输出三分支结论;
|
|
154
|
-
def _report(rows, mined, max_turns):
|
|
155
|
-
n = len(rows)
|
|
156
|
-
print("\n" + "=" * 74)
|
|
157
|
-
print("任务级 A/B 对照(白箱智能系列·第五篇 第 9 章「验证方法」)")
|
|
158
|
-
print("=" * 74)
|
|
159
|
-
print(f"样本 {n} 条 · 两臂候选动作池完全相同,唯一差异是记忆库 · "
|
|
160
|
-
f"试错上限 {max_turns} 轮(已对无记忆臂放宽:允许排除刚试过的动作)")
|
|
161
|
-
print(f"Phase A 写入:{len(mined['pairs'])} 组修复对"
|
|
162
|
-
f"(知识 {len(mined['knowledge_ids'])} + 负记忆 {len(mined['rejected_ids'])})\n")
|
|
163
|
-
|
|
164
|
-
ns = sum(1 for _c, rn, _rm in rows if rn["success"]) / n
|
|
165
|
-
ms = sum(1 for _c, _rn, rm in rows if rm["success"]) / n
|
|
166
|
-
nf = sum(1 for _c, rn, _rm in rows if rn["success"] and rn["turns"] == 1) / n
|
|
167
|
-
mf = sum(1 for _c, _rn, rm in rows if rm["success"] and rm["turns"] == 1) / n
|
|
168
|
-
nr = sum(1 for c, _rn, _rm in rows if c["trap"] in _rn["touched"]) / n
|
|
169
|
-
mr = sum(1 for c, _rn, rm in rows if c["trap"] in rm["touched"]) / n
|
|
170
|
-
nt = sum(rn["turns"] for _c, rn, _rm in rows) / n
|
|
171
|
-
mt = sum(rm["turns"] for _c, _rn, rm in rows) / n
|
|
172
|
-
nk = sum(rn.get("tokens") or 0 for _c, rn, _rm in rows) / n
|
|
173
|
-
mk = sum(rm.get("tokens") or 0 for _c, _rn, rm in rows) / n
|
|
174
|
-
hit = sum(1 for _c, _rn, rm in rows if rm.get("hit")) / n
|
|
175
|
-
|
|
176
|
-
print(f"{'指标':<20}{'arm_none':>14}{'arm_mem':>14}{'差值':>16}")
|
|
177
|
-
print("-" * 74)
|
|
178
|
-
print(f"{'first_try_rate':<20}{_pct(nf):>14}{_pct(mf):>14}"
|
|
179
|
-
f"{f'+{100 * (mf - nf):.1f}pp':>16}")
|
|
180
|
-
print(f"{'success_rate':<20}{_pct(ns):>14}{_pct(ms):>14}"
|
|
181
|
-
f"{f'+{100 * (ms - ns):.1f}pp':>16}")
|
|
182
|
-
print(f"{'repeat_error_rate':<20}{_pct(nr):>14}{_pct(mr):>14}"
|
|
183
|
-
f"{f'{100 * (mr - nr):.1f}pp':>16}")
|
|
184
|
-
print(f"{'avg_turns':<20}{nt:>14.2f}{mt:>14.2f}{f'{mt - nt:+.2f}':>16}")
|
|
185
|
-
print(f"{'avg_tokens':<20}{nk:>14.1f}{mk:>14.1f}{f'{mk - nk:+.1f}':>16}")
|
|
186
|
-
print(f"{'recall_hit_rate':<20}{'-':>14}{_pct(hit):>14}{'-':>16}")
|
|
187
|
-
|
|
188
|
-
print("\n逐例(pick = 最终决策动作;hit = 召回直接命中修复知识):")
|
|
189
|
-
for c, rn, rm in rows:
|
|
190
|
-
mark_n = "OK " if rn["success"] else "X "
|
|
191
|
-
mark_m = "OK " if rm["success"] else "X "
|
|
192
|
-
print(f" {c['id']} none[{mark_n}t={rn['turns']}] "
|
|
193
|
-
f"mem[{mark_m}t={rm['turns']} hit={int(bool(rm.get('hit')))}] {c['error'][:44]}")
|
|
194
|
-
|
|
195
|
-
print("\n结论口径:")
|
|
196
|
-
print(f" · 无记忆臂的 success_rate={_pct(ns)} 是「排除法试错」的产物"
|
|
197
|
-
f"({max_turns} 轮内排除错项后总能收敛),因此看首次决策正确率:"
|
|
198
|
-
f"{_pct(nf)} → {_pct(mf)}。")
|
|
199
|
-
if mf > nf and mr < nr:
|
|
200
|
-
print(f" · 有记忆臂首次决策正确率 +{100 * (mf - nf):.1f}pp,"
|
|
201
|
-
f"重复犯错率 {100 * (mr - nr):.1f}pp({_pct(nr)} → {_pct(mr)}),"
|
|
202
|
-
f"平均轮数 {mt - nt:+.2f},代价是每次多 {mk - nk:.0f} token。")
|
|
203
|
-
print(" · 即:把「错误→修复」写进记忆后,同类任务不再重复踩坑——"
|
|
204
|
-
"但这是确定性模拟器结论,真实 LLM 端到端仍需实测。")
|
|
205
|
-
elif mf == nf:
|
|
206
|
-
print(" · 两臂首次决策正确率相同:记忆未带来增益"
|
|
207
|
-
"(可能是召回未命中或数据不敏感),如实报告,不粉饰。")
|
|
208
|
-
else:
|
|
209
|
-
print(f" · 记忆臂首次正确率 {_pct(mf)} vs 无记忆 {_pct(nf)},未达预期,如实报告。")
|
|
210
|
-
print()
|
|
211
|
-
|
|
212
|
-
|
|
213
|
-
# 生效条件:调用 main(argv) 时由 argparse 解析 argv(argv 为 None 则取 sys.argv[1:]),--cases 为 0 用全部 CASES、非 0(含负值)用 CASES[:a.cases],--max-turns 默认 2,--budget 默认 2000;随后在临时目录创建 none_arm/mem_arm,先用 mem_arm.mine_fix_pairs 从 cases 的 error/fix 写入修复对作为记忆臂命中前置,再逐例以 _trial 与 _decide_mem 生成 rows 并 _report,最终返回 0;
|
|
214
|
-
def main(argv=None):
|
|
215
|
-
ap = argparse.ArgumentParser(description="任务级 A/B:无记忆 vs 有记忆")
|
|
216
|
-
ap.add_argument("--cases", type=int, default=0, help="只用前 N 个用例(0=全部)")
|
|
217
|
-
ap.add_argument("--max-turns", type=int, default=2,
|
|
218
|
-
help="试错上限(默认 2 = 一次尝试 + 一次重试)")
|
|
219
|
-
ap.add_argument("--budget", type=int, default=2000, help="召回 token 预算")
|
|
220
|
-
a = ap.parse_args(argv)
|
|
221
|
-
cases = CASES[:a.cases] if a.cases else CASES
|
|
222
|
-
|
|
223
|
-
root = tempfile.mkdtemp(prefix="mdcg_ab_")
|
|
224
|
-
try:
|
|
225
|
-
none_arm = MdCGOS(os.path.join(root, "none"))
|
|
226
|
-
mem_arm = MdCGOS(os.path.join(root, "mem"))
|
|
227
|
-
mined = mem_arm.mine_fix_pairs(
|
|
228
|
-
[{"error": c["error"], "fix": c["fix"]} for c in cases])
|
|
229
|
-
rows = []
|
|
230
|
-
for c in cases:
|
|
231
|
-
q = "再次遇到: " + c["error"]
|
|
232
|
-
cands = [c["fix"], c["trap"], c["decoy"]]
|
|
233
|
-
rn = _trial(c["error"], cands, c["fix"], a.max_turns)
|
|
234
|
-
rm = _decide_mem(mem_arm, q, c, cands, a.max_turns, a.budget)
|
|
235
|
-
rows.append((c, rn, rm))
|
|
236
|
-
_report(rows, mined, a.max_turns)
|
|
237
|
-
_ = none_arm # 空库臂不召回,故不产生 token;保留以便对照可扩展
|
|
238
|
-
finally:
|
|
239
|
-
shutil.rmtree(root, ignore_errors=True)
|
|
240
|
-
return 0
|
|
241
|
-
|
|
242
|
-
|
|
243
|
-
if __name__ == "__main__":
|
|
1
|
+
# -*- coding: utf-8 -*-
|
|
2
|
+
"""任务级 A/B 对照实验:无记忆 vs 有记忆(白箱第 5 篇第 9 章「验证方法」)
|
|
3
|
+
|
|
4
|
+
评测问题:**把「已写入的失败教训」装进记忆后,AI 在同类任务上是否少犯错?**
|
|
5
|
+
|
|
6
|
+
两臂唯一差异 = 记忆库:
|
|
7
|
+
arm_none 空库:面对错误只能靠字面猜测下一步动作,选错就试错重来
|
|
8
|
+
arm_mem 有库:Phase A 用 mine_fix_pairs 把「错误 → 修复」写进知识 + 负记忆;
|
|
9
|
+
Phase B 先 recall(错误) 再决策,命中修复知识则一次到位
|
|
10
|
+
|
|
11
|
+
指标(确定性模拟,不调用 LLM):
|
|
12
|
+
first_try_rate 首次决策就选对的比例(最不受试错上限影响的指标)
|
|
13
|
+
success_rate 在 max_turns 内选中正确修复的比例(越高越好)
|
|
14
|
+
repeat_error_rate 至少踩过一次已知陷阱的比例(越高越糟 = 重复犯错)
|
|
15
|
+
avg_turns 达成正确决策所需轮数(无记忆臂靠试错,越多越差)
|
|
16
|
+
avg_tokens 每次决策的召回上下文 token(记忆的代价,诚实计入)
|
|
17
|
+
hit_rate Phase B 中 recall 直接命中修复知识的比例
|
|
18
|
+
|
|
19
|
+
诚实边界(不夸大结论):
|
|
20
|
+
1) 这是确定性模拟器,不是 LLM 端到端评测。它测的是「记忆机制能否把已写入的
|
|
21
|
+
教训在下次同类任务里用起来」,不测「LLM 会不会变聪明」。
|
|
22
|
+
2) 陷阱与修复都是 Phase A 写入的,实验验证的是复用能力,不是凭空学习能力。
|
|
23
|
+
3) 两臂的候选动作池完全相同,差别只有记忆库——这是 A/B 的唯一变量。
|
|
24
|
+
4) 无记忆臂的策略是「按字面覆盖选 top-1,选错则排除重试」,这是对无历史
|
|
25
|
+
agent 的合理建模,但它仍是一个建模选择,不是真实 agent 的行为分布。
|
|
26
|
+
|
|
27
|
+
跑法:
|
|
28
|
+
python -m md_cg.bench_task_ab
|
|
29
|
+
python -m md_cg.bench_task_ab --cases 6 --max-turns 3
|
|
30
|
+
"""
|
|
31
|
+
from __future__ import annotations
|
|
32
|
+
|
|
33
|
+
import argparse
|
|
34
|
+
import os
|
|
35
|
+
import shutil
|
|
36
|
+
import sys
|
|
37
|
+
import tempfile
|
|
38
|
+
|
|
39
|
+
from md_cg.mdcg import expand_query_terms_weighted
|
|
40
|
+
from md_cg.mdcos import MdCGOS, _weighted_coverage
|
|
41
|
+
|
|
42
|
+
# 12 个工程常见坑:trap 与 error 的字面重叠刻意高于 fix,用来模拟
|
|
43
|
+
# 「没有记忆时,最像对症的动作往往正是坑」。
|
|
44
|
+
CASES = [
|
|
45
|
+
{"id": "c01", "error": "ModuleNotFoundError: No module named 'requests'",
|
|
46
|
+
"fix": "pip install requests",
|
|
47
|
+
"trap": "ModuleNotFoundError 时跳过 requests 相关功能",
|
|
48
|
+
"decoy": "重启开发机"},
|
|
49
|
+
{"id": "c02", "error": "PermissionError: [Errno 13] Permission denied: '/var/log/app.log'",
|
|
50
|
+
"fix": "chmod 640 /var/log/app.log 并以具备写权限的用户运行",
|
|
51
|
+
"trap": "PermissionError 时忽略日志写入失败",
|
|
52
|
+
"decoy": "格式化磁盘"},
|
|
53
|
+
{"id": "c03", "error": "SyntaxError: invalid syntax 在 f-string 里的引号冲突",
|
|
54
|
+
"fix": "把外层引号换成双引号并转义内层引号",
|
|
55
|
+
"trap": "SyntaxError 时删除整段代码",
|
|
56
|
+
"decoy": "重装 Python"},
|
|
57
|
+
{"id": "c04", "error": "ConnectionRefusedError: 端口 5432 连接被拒绝",
|
|
58
|
+
"fix": "启动 postgres 服务并确认监听 5432",
|
|
59
|
+
"trap": "ConnectionRefusedError 时改用本地 sqlite",
|
|
60
|
+
"decoy": "更换网线"},
|
|
61
|
+
{"id": "c05", "error": "KeyError: 'user_id' 在请求体里缺失",
|
|
62
|
+
"fix": "用 payload.get('user_id') 并返回 400",
|
|
63
|
+
"trap": "KeyError 时给 user_id 赋默认空字符串",
|
|
64
|
+
"decoy": "重启 API 服务"},
|
|
65
|
+
{"id": "c06", "error": "TypeError: unsupported operand type(s) for +: 'int' and 'str'",
|
|
66
|
+
"fix": "显式 int(x) 转换后再相加",
|
|
67
|
+
"trap": "TypeError 时把整个表达式改成字符串拼接",
|
|
68
|
+
"decoy": "升级 numpy"},
|
|
69
|
+
{"id": "c07", "error": "TimeoutError: 请求 30s 未响应",
|
|
70
|
+
"fix": "给请求加 5s 超时并重试 2 次",
|
|
71
|
+
"trap": "TimeoutError 时无限重试",
|
|
72
|
+
"decoy": "更换 DNS"},
|
|
73
|
+
{"id": "c08", "error": "FileNotFoundError: 'config.yaml' 不存在",
|
|
74
|
+
"fix": "检查工作目录并用绝对路径读取 config.yaml",
|
|
75
|
+
"trap": "FileNotFoundError 时跳过配置加载",
|
|
76
|
+
"decoy": "重装操作系统"},
|
|
77
|
+
{"id": "c09", "error": "UnicodeDecodeError: 'gbk' codec can't decode byte 0xa3",
|
|
78
|
+
"fix": "以 encoding='utf-8' 打开文件",
|
|
79
|
+
"trap": "UnicodeDecodeError 时用 errors='ignore' 丢掉数据",
|
|
80
|
+
"decoy": "换一台电脑"},
|
|
81
|
+
{"id": "c10", "error": "IndexError: list index out of range 在分页第 2 页",
|
|
82
|
+
"fix": "先判断 len(items) 再取下标",
|
|
83
|
+
"trap": "IndexError 时直接把分页关掉",
|
|
84
|
+
"decoy": "增加内存"},
|
|
85
|
+
{"id": "c11", "error": "MemoryError: 一次加载 10GB csv 到内存",
|
|
86
|
+
"fix": "改用 pandas chunksize 分块读取",
|
|
87
|
+
"trap": "MemoryError 时无限增大 swap",
|
|
88
|
+
"decoy": "换 CPU"},
|
|
89
|
+
{"id": "c12", "error": "AssertionError: 断言 user.name == 'admin' 失败",
|
|
90
|
+
"fix": "检查测试夹具里的用户角色并修正期望值",
|
|
91
|
+
"trap": "AssertionError 时直接删掉这条断言",
|
|
92
|
+
"decoy": "重跑 CI"},
|
|
93
|
+
]
|
|
94
|
+
|
|
95
|
+
|
|
96
|
+
# 生效条件:给定 text,当 expand_query_terms_weighted(text) 为真值字典时返回其中键不以 `__` 开头的项(键转 str、值转 float),并先弹出 `__source__`;当该调用返回假值(None/空/其他假值)时返回空字典 {};
|
|
97
|
+
def _terms(text):
|
|
98
|
+
tw = expand_query_terms_weighted(text) or {}
|
|
99
|
+
tw.pop("__source__", None)
|
|
100
|
+
return {str(k): float(v) for k, v in tw.items()
|
|
101
|
+
if not str(k).startswith("__")}
|
|
102
|
+
|
|
103
|
+
|
|
104
|
+
# 生效条件:candidates 非空且 error 可被 _terms 处理时,按 _weighted_coverage 返回覆盖得分最高的候选,字面平局时取候选顺序最前者。
|
|
105
|
+
def _pick_lexical(error, candidates):
|
|
106
|
+
"""无记忆臂的确定性策略:按字面覆盖选 top-1(字面平局时按候选顺序)。"""
|
|
107
|
+
tw = _terms(error)
|
|
108
|
+
best, best_s = candidates[0], -1.0
|
|
109
|
+
for c in candidates:
|
|
110
|
+
s = _weighted_coverage(tw, c)
|
|
111
|
+
if s > best_s:
|
|
112
|
+
best, best_s = c, s
|
|
113
|
+
return best
|
|
114
|
+
|
|
115
|
+
|
|
116
|
+
# 生效条件:给定 error、candidates、fix、max_turns,在 pool 非空且 turns<max_turns 时每轮把 _pick_lexical(error, pool) 选中的 last 记入 touched:若 last==fix 立即返回 {'success': True, 'turns': turns, 'pick': last, 'touched': touched},否则从 pool 移除 last 继续;候选耗尽或 max_turns 为 0/负值时退出,返回 {'success': False, 'turns': turns, 'pick': last, 'touched': touched}(未进入循环时 success=False、turns=0、pick=None、touched=[]);
|
|
117
|
+
def _trial(error, candidates, fix, max_turns):
|
|
118
|
+
"""无记忆臂:选错就排除该动作、下一轮重选(模拟试错)。"""
|
|
119
|
+
pool = list(candidates)
|
|
120
|
+
touched, turns = [], 0
|
|
121
|
+
last = None
|
|
122
|
+
while pool and turns < max_turns:
|
|
123
|
+
turns += 1
|
|
124
|
+
last = _pick_lexical(error, pool)
|
|
125
|
+
touched.append(last)
|
|
126
|
+
if last == fix:
|
|
127
|
+
return {"success": True, "turns": turns, "pick": last,
|
|
128
|
+
"touched": touched}
|
|
129
|
+
pool.remove(last)
|
|
130
|
+
return {"success": False, "turns": turns, "pick": last,
|
|
131
|
+
"touched": touched}
|
|
132
|
+
|
|
133
|
+
|
|
134
|
+
# 生效条件:case["fix"] 为真且其字符串出现在 cg.recall(query, budget_tokens=budget, k=20) 返回 pack 各项 content 拼接成的 text 中时返回 hit=True、turns=1、touched=[];否则以 case["error"]、candidates、case["fix"]、max_turns 调 _trial 并回填 hit=False、turns=1+fb["turns"]、tokens=int(tokens_used or 0)。
|
|
135
|
+
def _decide_mem(cg, query, case, candidates, max_turns, budget):
|
|
136
|
+
"""有记忆臂:先召回,命中修复知识则一次到位;否则回退到试错。"""
|
|
137
|
+
res = cg.recall(query, budget_tokens=budget, k=20)
|
|
138
|
+
tokens = int(res.get("tokens_used") or 0)
|
|
139
|
+
text = " ".join((p.get("content") or "") for p in res.get("pack") or [])
|
|
140
|
+
if case["fix"] and case["fix"] in text:
|
|
141
|
+
return {"success": True, "turns": 1, "pick": case["fix"],
|
|
142
|
+
"touched": [], "tokens": tokens, "hit": True}
|
|
143
|
+
fb = _trial(case["error"], candidates, case["fix"], max_turns)
|
|
144
|
+
fb.update({"tokens": tokens, "hit": False, "turns": 1 + fb["turns"]})
|
|
145
|
+
return fb
|
|
146
|
+
|
|
147
|
+
|
|
148
|
+
# 生效条件:传入 x 时,返回 f"{100.0 * x:.1f}%" 的字符串(即 x 乘以 100 后保留一位小数的百分比表示);
|
|
149
|
+
def _pct(x):
|
|
150
|
+
return f"{100.0 * x:.1f}%"
|
|
151
|
+
|
|
152
|
+
|
|
153
|
+
# 生效条件:rows 为非空序列(n>0)且每项可解包为 (c, rn, rm)、c 含 trap/id/error、rn/rm 含 success/turns/touched(tokens 经 .get('tokens') or 0 把缺键或假值计 0,hit 经 .get 缺键或假值不计数),mined 含 pairs/knowledge_ids/rejected_ids 键,max_turns 为数值时,打印两臂指标与逐例清单,并按首次正确率与重复犯错率的大小关系(提升/相等/其余)输出三分支结论;
|
|
154
|
+
def _report(rows, mined, max_turns):
|
|
155
|
+
n = len(rows)
|
|
156
|
+
print("\n" + "=" * 74)
|
|
157
|
+
print("任务级 A/B 对照(白箱智能系列·第五篇 第 9 章「验证方法」)")
|
|
158
|
+
print("=" * 74)
|
|
159
|
+
print(f"样本 {n} 条 · 两臂候选动作池完全相同,唯一差异是记忆库 · "
|
|
160
|
+
f"试错上限 {max_turns} 轮(已对无记忆臂放宽:允许排除刚试过的动作)")
|
|
161
|
+
print(f"Phase A 写入:{len(mined['pairs'])} 组修复对"
|
|
162
|
+
f"(知识 {len(mined['knowledge_ids'])} + 负记忆 {len(mined['rejected_ids'])})\n")
|
|
163
|
+
|
|
164
|
+
ns = sum(1 for _c, rn, _rm in rows if rn["success"]) / n
|
|
165
|
+
ms = sum(1 for _c, _rn, rm in rows if rm["success"]) / n
|
|
166
|
+
nf = sum(1 for _c, rn, _rm in rows if rn["success"] and rn["turns"] == 1) / n
|
|
167
|
+
mf = sum(1 for _c, _rn, rm in rows if rm["success"] and rm["turns"] == 1) / n
|
|
168
|
+
nr = sum(1 for c, _rn, _rm in rows if c["trap"] in _rn["touched"]) / n
|
|
169
|
+
mr = sum(1 for c, _rn, rm in rows if c["trap"] in rm["touched"]) / n
|
|
170
|
+
nt = sum(rn["turns"] for _c, rn, _rm in rows) / n
|
|
171
|
+
mt = sum(rm["turns"] for _c, _rn, rm in rows) / n
|
|
172
|
+
nk = sum(rn.get("tokens") or 0 for _c, rn, _rm in rows) / n
|
|
173
|
+
mk = sum(rm.get("tokens") or 0 for _c, _rn, rm in rows) / n
|
|
174
|
+
hit = sum(1 for _c, _rn, rm in rows if rm.get("hit")) / n
|
|
175
|
+
|
|
176
|
+
print(f"{'指标':<20}{'arm_none':>14}{'arm_mem':>14}{'差值':>16}")
|
|
177
|
+
print("-" * 74)
|
|
178
|
+
print(f"{'first_try_rate':<20}{_pct(nf):>14}{_pct(mf):>14}"
|
|
179
|
+
f"{f'+{100 * (mf - nf):.1f}pp':>16}")
|
|
180
|
+
print(f"{'success_rate':<20}{_pct(ns):>14}{_pct(ms):>14}"
|
|
181
|
+
f"{f'+{100 * (ms - ns):.1f}pp':>16}")
|
|
182
|
+
print(f"{'repeat_error_rate':<20}{_pct(nr):>14}{_pct(mr):>14}"
|
|
183
|
+
f"{f'{100 * (mr - nr):.1f}pp':>16}")
|
|
184
|
+
print(f"{'avg_turns':<20}{nt:>14.2f}{mt:>14.2f}{f'{mt - nt:+.2f}':>16}")
|
|
185
|
+
print(f"{'avg_tokens':<20}{nk:>14.1f}{mk:>14.1f}{f'{mk - nk:+.1f}':>16}")
|
|
186
|
+
print(f"{'recall_hit_rate':<20}{'-':>14}{_pct(hit):>14}{'-':>16}")
|
|
187
|
+
|
|
188
|
+
print("\n逐例(pick = 最终决策动作;hit = 召回直接命中修复知识):")
|
|
189
|
+
for c, rn, rm in rows:
|
|
190
|
+
mark_n = "OK " if rn["success"] else "X "
|
|
191
|
+
mark_m = "OK " if rm["success"] else "X "
|
|
192
|
+
print(f" {c['id']} none[{mark_n}t={rn['turns']}] "
|
|
193
|
+
f"mem[{mark_m}t={rm['turns']} hit={int(bool(rm.get('hit')))}] {c['error'][:44]}")
|
|
194
|
+
|
|
195
|
+
print("\n结论口径:")
|
|
196
|
+
print(f" · 无记忆臂的 success_rate={_pct(ns)} 是「排除法试错」的产物"
|
|
197
|
+
f"({max_turns} 轮内排除错项后总能收敛),因此看首次决策正确率:"
|
|
198
|
+
f"{_pct(nf)} → {_pct(mf)}。")
|
|
199
|
+
if mf > nf and mr < nr:
|
|
200
|
+
print(f" · 有记忆臂首次决策正确率 +{100 * (mf - nf):.1f}pp,"
|
|
201
|
+
f"重复犯错率 {100 * (mr - nr):.1f}pp({_pct(nr)} → {_pct(mr)}),"
|
|
202
|
+
f"平均轮数 {mt - nt:+.2f},代价是每次多 {mk - nk:.0f} token。")
|
|
203
|
+
print(" · 即:把「错误→修复」写进记忆后,同类任务不再重复踩坑——"
|
|
204
|
+
"但这是确定性模拟器结论,真实 LLM 端到端仍需实测。")
|
|
205
|
+
elif mf == nf:
|
|
206
|
+
print(" · 两臂首次决策正确率相同:记忆未带来增益"
|
|
207
|
+
"(可能是召回未命中或数据不敏感),如实报告,不粉饰。")
|
|
208
|
+
else:
|
|
209
|
+
print(f" · 记忆臂首次正确率 {_pct(mf)} vs 无记忆 {_pct(nf)},未达预期,如实报告。")
|
|
210
|
+
print()
|
|
211
|
+
|
|
212
|
+
|
|
213
|
+
# 生效条件:调用 main(argv) 时由 argparse 解析 argv(argv 为 None 则取 sys.argv[1:]),--cases 为 0 用全部 CASES、非 0(含负值)用 CASES[:a.cases],--max-turns 默认 2,--budget 默认 2000;随后在临时目录创建 none_arm/mem_arm,先用 mem_arm.mine_fix_pairs 从 cases 的 error/fix 写入修复对作为记忆臂命中前置,再逐例以 _trial 与 _decide_mem 生成 rows 并 _report,最终返回 0;
|
|
214
|
+
def main(argv=None):
|
|
215
|
+
ap = argparse.ArgumentParser(description="任务级 A/B:无记忆 vs 有记忆")
|
|
216
|
+
ap.add_argument("--cases", type=int, default=0, help="只用前 N 个用例(0=全部)")
|
|
217
|
+
ap.add_argument("--max-turns", type=int, default=2,
|
|
218
|
+
help="试错上限(默认 2 = 一次尝试 + 一次重试)")
|
|
219
|
+
ap.add_argument("--budget", type=int, default=2000, help="召回 token 预算")
|
|
220
|
+
a = ap.parse_args(argv)
|
|
221
|
+
cases = CASES[:a.cases] if a.cases else CASES
|
|
222
|
+
|
|
223
|
+
root = tempfile.mkdtemp(prefix="mdcg_ab_")
|
|
224
|
+
try:
|
|
225
|
+
none_arm = MdCGOS(os.path.join(root, "none"))
|
|
226
|
+
mem_arm = MdCGOS(os.path.join(root, "mem"))
|
|
227
|
+
mined = mem_arm.mine_fix_pairs(
|
|
228
|
+
[{"error": c["error"], "fix": c["fix"]} for c in cases])
|
|
229
|
+
rows = []
|
|
230
|
+
for c in cases:
|
|
231
|
+
q = "再次遇到: " + c["error"]
|
|
232
|
+
cands = [c["fix"], c["trap"], c["decoy"]]
|
|
233
|
+
rn = _trial(c["error"], cands, c["fix"], a.max_turns)
|
|
234
|
+
rm = _decide_mem(mem_arm, q, c, cands, a.max_turns, a.budget)
|
|
235
|
+
rows.append((c, rn, rm))
|
|
236
|
+
_report(rows, mined, a.max_turns)
|
|
237
|
+
_ = none_arm # 空库臂不召回,故不产生 token;保留以便对照可扩展
|
|
238
|
+
finally:
|
|
239
|
+
shutil.rmtree(root, ignore_errors=True)
|
|
240
|
+
return 0
|
|
241
|
+
|
|
242
|
+
|
|
243
|
+
if __name__ == "__main__":
|
|
244
244
|
sys.exit(main())
|