@furongjun1999/dsh-memory 0.4.11 → 0.5.1
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/README.md +552 -465
- package/codebuddy/CODEBUDDY.md +11 -3
- package/codebuddy/README.md +92 -90
- package/codebuddy/mcp.json +27 -27
- package/docs/GBrain/345/217/257/345/200/237/351/211/264/347/202/271_/347/201/265/346/236/242/350/220/275/347/202/271/344/272/244/346/216/245_20260919.md +169 -169
- package/docs/Pi/345/217/257/345/255/246/344/271/240/344/274/230/347/202/271_/347/201/265/346/236/242/345/244/247/350/204/221/346/224/271/350/277/233/344/272/244/346/216/245_20260915.md +144 -144
- package/docs/README.md +143 -111
- package/docs/discipline/harnesses.yaml +244 -226
- package/docs/discipline/templates/full.md.tmpl +61 -61
- package/docs/discipline/templates/rules.mdc.tmpl +68 -0
- package/docs/discipline/templates/skill.md.tmpl +23 -23
- package/docs/eval/AGI/344/270/203/347/273/264/350/257/204/345/210/206/346/212/245/345/221/212_md_cg_v1.0.md +299 -299
- package/docs/eval/AGI/344/270/203/347/273/264/350/257/204/345/210/206/346/212/245/345/221/212_md_cg_v2.0.md +239 -239
- package/docs/eval/bench_lingshu_self/bench_self.py +140 -0
- package/docs/eval/bench_lingshu_self/self_bench_result.json +404 -0
- package/docs/eval/bench_lingshu_self//347/201/265/346/236/242/350/207/252/345/272/223/347/253/257/345/210/260/347/253/257/346/243/200/347/264/242/345/256/236/346/265/213_v1.0.md +38 -0
- package/docs/eval//344/270/215/345/217/257/351/235/240/346/200/247/350/220/275/345/234/260_P0_v1.0.md +185 -0
- package/docs/eval//345/256/236/351/252/214/346/226/271/346/241/210_/345/255/246/344/271/240/351/227/255/347/216/257AB/344/270/216/346/250/252/350/257/204_v1.0.md +174 -174
- package/docs/eval//346/225/205/351/232/234/346/263/250/345/205/245/345/256/236/346/265/213_v1.0.md +422 -0
- package/docs/eval//346/250/252/350/257/204_/345/205/255/345/256/266100/351/242/230/344/270/255/350/213/261/345/217/214/346/237/245_v1.0.md +223 -223
- package/docs/eval//347/253/257/345/210/260/347/253/257LoCoMoQA/345/220/214/345/217/243/345/276/204/345/257/271/347/205/247_v1.0.md +100 -0
- package/docs/eval//347/253/257/345/210/260/347/253/257/345/271/262/346/211/260/346/261/240/350/257/204/346/265/213_/347/241/256/345/256/232/346/200/247/350/243/201/345/206/263vsLLM_judge_v1.1.md +197 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v1.md +156 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v10.md +210 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v11.md +227 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v12.md +203 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v13.md +233 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v14.md +191 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v15.md +213 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v16.md +214 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v17.md +199 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v2.md +156 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v3.md +152 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v4.md +128 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v5.md +114 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v6.md +192 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v7.md +187 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v8.md +207 -0
- package/docs/eval//347/274/272/351/231/267/346/214/226/346/216/230_/350/207/252/344/270/273/350/277/255/344/273/243_v9.md +203 -0
- package/docs/{mdcg → hive}//344/273/244/347/211/214/344/270/216/350/247/222/350/211/262/346/235/203/350/201/214/345/210/206/347/246/273_v0.1.md +165 -160
- package/docs/hive//344/273/244/347/211/214/350/257/255/344/271/211/344/277/256/346/255/243_/344/273/262/350/243/201/344/275/215_v0.1.md +76 -0
- package/docs/{mdcg → hive}//345/255/220/344/273/243/347/220/206/351/205/215/347/275/256/346/240/207/345/207/206_v0.5.md +236 -236
- package/docs/hive//345/256/211/345/205/250/345/256/241/350/256/241/345/256/236/351/224/232_v0.1.md +202 -0
- package/docs/hive//346/243/200/347/264/242/346/224/266/346/225/233/345/256/236/346/265/213/344/270/216S1b/350/256/276/350/256/241_v0.1.md +43 -43
- package/docs/hive//346/243/200/347/264/242/347/256/227/346/263/225/345/217/243/345/276/204/345/257/271/347/205/247_v0.1.md +85 -0
- package/docs/hive//346/243/200/347/264/242/350/267/257/345/276/204/344/270/216/350/256/244/347/237/245/347/273/223/346/236/204/345/245/221/347/272/246_v0.1.md +102 -102
- package/docs/hive//350/234/202/345/267/242M6_ingest/345/256/236/346/226/275/350/256/241/345/210/222_v0.1.md +47 -0
- package/docs/hive//350/234/202/345/267/242/345/217/214/345/256/236/344/276/213/344/272/222/351/252/214_/350/256/276/350/256/241/345/256/232/347/250/277.md +519 -503
- package/docs/hive//350/234/202/345/267/242/345/267/245/344/275/234/350/256/260/345/277/206_/351/241/271/347/233/256/350/256/241/345/210/222.md +85 -85
- package/docs/hive//350/234/202/345/267/242/350/256/276/350/256/241_/347/220/206/350/256/272/345/257/271/351/275/220_v0.1.md +191 -0
- package/docs/hive//350/234/202/345/267/242/350/277/255/344/273/243_/345/256/217/350/247/202/344/270/216/347/276/244/344/275/223/350/260/203/345/272/246_v0.1.md +90 -0
- package/docs/images/lingshu-moonlight-covenant-poster-preview.jpg +0 -0
- package/docs/images/lingshu-moonlight-covenant-poster.png +0 -0
- package/docs/mdcg/D_meta_/345/267/245/347/250/213/345/214/226/346/226/271/346/241/210_v0.2.md +216 -216
- package/docs/mdcg/README/350/257/246/347/273/206/347/211/210_v0.4.10.md +646 -646
- package/docs/mdcg/lingshu_tutorial.html +14449 -14449
- package/docs/mdcg/release_v0.4.11.md +49 -0
- package/docs/mdcg/release_v0.4.5.md +55 -55
- package/docs/mdcg/tool_table_v0.3.0.md +117 -117
- package/docs/mdcg//345/205/250/345/272/223/344/273/243/347/240/201/350/257/204/345/256/241/344/270/216/346/235/241/344/273/266/345/214/226/346/263/250/351/207/212_/350/256/241/345/210/222_v0.1.md +600 -600
- package/docs/mdcg//345/212/237/350/203/275/350/260/203/347/224/250/346/230/240/345/260/204/350/241/250_v0.1.md +40 -40
- package/docs/mdcg//345/215/225/345/205/203/350/207/252/346/210/221/351/224/232/347/202/271_/347/263/273/347/273/237/346/217/220/347/244/272/350/257/215/346/240/207/345/207/206_v0.3.md +275 -275
- package/docs/mdcg//345/217/221/345/270/203/351/227/250/347/246/201/351/223/276_v0.1.md +54 -0
- package/docs/mdcg//346/272/220/347/240/201/347/272/247/346/236/266/346/236/204/345/256/241/350/256/241_GPT/346/211/271/350/257/204/345/257/271/347/205/247_v1.0.md +130 -130
- package/docs/mdcg//347/201/265/346/236/24282/345/267/245/345/205/267_/345/212/237/350/203/275/346/225/264/347/220/206/344/270/216/350/277/201/347/247/273/346/230/240/345/260/204_v0.1.md +278 -278
- package/docs/mdcg//347/201/265/346/236/242/350/256/260/345/277/206/345/212/250/350/257/215/345/215/217/350/256/256_v1.0-draft.md +172 -172
- package/docs/mdcg//347/274/272/345/217/243/345/215/225_P0/346/224/266/345/217/243_v0.1.md +270 -270
- package/docs/mdcg//350/256/244/347/237/245/345/233/276_G4-G8/347/274/272/345/217/243/350/243/201/345/256/232/345/215/225_v0.1.md +491 -491
- package/docs/mdcg//350/256/244/347/237/245/345/233/276_/346/235/241/344/273/266/347/251/272/351/227/264/345/220/210/346/210/220/344/270/216/347/224/237/346/225/210/346/235/241/344/273/266/345/217/243/345/276/204_v0.1.md +340 -340
- package/docs/mdcg//350/256/244/347/237/245/345/233/276_/347/264/242/345/274/225/344/270/216/345/267/245/347/250/213/350/247/204/350/214/203/345/214/226_/350/256/241/345/210/222_v0.1.md +588 -588
- package/docs/plans/GridWorld/346/234/200/345/260/217/351/227/255/347/216/257/350/247/204/346/240/274_v0.1.md +176 -176
- package/docs/plans//345/221/275/345/220/215/346/262/273/347/220/206_/351/241/271/347/233/256/350/256/241/345/210/222.md +81 -81
- package/docs/swarm//350/234/202/347/276/244/344/272/222/350/201/224_v0.1.md +704 -704
- package/docs/swarm//350/234/202/347/276/244/345/220/214/351/224/231/346/243/200/346/265/213/345/256/236/351/252/214/345/215/217/350/256/256_v0.1.md +242 -242
- package/docs/theory//344/270/215/345/217/257/351/235/240/345/256/232/347/220/206/344/270/216/345/244/261/346/225/210/344/274/230/345/205/210/346/241/206/346/236/266_v0.3.md +365 -0
- package/docs/theory//345/215/225/347/272/277/347/250/213/344/270/216/346/263/250/346/204/217/345/212/233/351/233/206/344/270/255_/346/227/240/344/272/211/350/256/256/347/220/206/350/256/272/346/226/207/346/241/243_v1.0.md +129 -129
- package/docs/theory//345/271/266/345/217/221/345/277/205/347/204/266/346/200/247/347/220/206/350/256/272_v0.2.md +134 -134
- package/docs/theory//346/231/272/350/203/275/350/256/2723.4.md +5260 -5260
- package/docs/theory//346/246/202/345/277/265/345/210/206/345/261/202/345/257/271/351/275/220/350/241/250_v0.1.md +145 -145
- package/docs/theory//347/220/206/350/256/272_/346/234/272/345/210/266_/344/273/243/347/240/201_/345/256/236/351/252/214_/347/274/272/345/217/243/347/237/251/351/230/265_v0.1.md +144 -144
- package/docs/theory//347/220/206/350/256/272/344/273/223/346/213/206/345/210/206/344/270/216/347/231/275/347/256/261/347/237/245/350/257/206/345/272/223/345/206/205/350/277/201_v0.1.md +198 -198
- package/docs/theory//350/256/244/347/237/245/344/273/243/347/220/206/344/270/216/346/224/266/346/225/233/347/273/223/346/236/204_/346/235/241/344/273/266/350/256/272/351/207/215/346/236/204_v0.1.md +221 -221
- package/docs/world_model//344/270/226/347/225/214/346/250/241/345/236/213_/347/245/236/347/273/217/347/275/221/347/273/234/345/272/225/345/261/202/346/236/266/346/236/204_v1.0.md +237 -237
- package/docs//344/270/215/345/217/257/351/235/240/346/200/247/347/220/206/350/256/272_v0.1.md +343 -0
- package/docs//345/217/221/345/270/203/344/273/266/345/233/236/346/272/257/350/257/264/346/230/216_v0.1.md +82 -82
- package/docs//345/267/245/344/275/234/347/272/252/345/276/213_/350/256/244/347/237/245/345/233/276/346/235/241/347/233/256_v1.1.json +28 -2
- package/dsh/README.md +82 -82
- package/dsh/cordis.yml.example +139 -139
- package/dsh/update-lingshu.bat +11 -11
- package/lib/bridge.d.ts +9 -0
- package/lib/bridge.js +35 -0
- package/lib/hooks.js +36 -2
- package/lib/index.js +7 -1
- package/lib/lib/roleplay_web.js +116 -29
- package/lib/lib/token_store.d.ts +7 -1
- package/lib/lib/token_store.js +12 -3
- package/md_cg/__init__.py +7 -7
- package/md_cg/audit.py +379 -368
- package/md_cg/autonomy.py +287 -287
- package/md_cg/backfill.py +1328 -1327
- package/md_cg/backfill_bigdomain.py +34 -34
- package/md_cg/backfill_bucket_zh.py +35 -0
- package/md_cg/bench6_arms.py +410 -410
- package/md_cg/bench6_common.py +230 -230
- package/md_cg/bench6_competitors.py +212 -212
- package/md_cg/bench_axis_domain.py +257 -257
- package/md_cg/bench_blind_comp.py +308 -308
- package/md_cg/bench_e2e_judge.py +532 -0
- package/md_cg/bench_e2e_locomo_qa.py +368 -0
- package/md_cg/bench_e2e_qa.py +256 -0
- package/md_cg/bench_en_atoms_public.py +230 -230
- package/md_cg/bench_governance.py +348 -348
- package/md_cg/bench_lme_zh.py +410 -410
- package/md_cg/bench_locomo.py +121 -121
- package/md_cg/bench_locomo_zh.py +450 -450
- package/md_cg/bench_locomo_zh_public.py +147 -147
- package/md_cg/bench_longmem.py +112 -112
- package/md_cg/bench_membench.py +632 -632
- package/md_cg/bench_p0.py +149 -149
- package/md_cg/bench_progressive.py +287 -287
- package/md_cg/bench_role_views.py +238 -238
- package/md_cg/bench_task_ab.py +243 -243
- package/md_cg/bench_task_ab_llm.py +408 -408
- package/md_cg/bench_unified_en.py +204 -204
- package/md_cg/bench_zh_mad.py +601 -601
- package/md_cg/blindspot_tickets.py +123 -123
- package/md_cg/branches.py +301 -285
- package/md_cg/build_postings.py +73 -73
- package/md_cg/ccgc.py +1006 -948
- package/md_cg/census.py +132 -132
- package/md_cg/chain.py +315 -300
- package/md_cg/codeindex.py +531 -531
- package/md_cg/coldverify.py +292 -292
- package/md_cg/comment_gate.py +337 -337
- package/md_cg/cond_compose.py +190 -190
- package/md_cg/cond_facts.py +154 -154
- package/md_cg/cond_template.json +106 -106
- package/md_cg/condition_anchor.py +142 -142
- package/md_cg/conformance.py +726 -726
- package/md_cg/consistency.py +717 -717
- package/md_cg/consolidate.py +1537 -1439
- package/md_cg/corpus.py +110 -110
- package/md_cg/crosscheck.py +1098 -1097
- package/md_cg/crypto.py +3 -1
- package/md_cg/d_meta.py +310 -310
- package/md_cg/datapath.py +78 -18
- package/md_cg/docindex.py +473 -473
- package/md_cg/eval_common.py +575 -575
- package/md_cg/evidence.py +4 -2
- package/md_cg/evolution.py +477 -477
- package/md_cg/export.py +222 -220
- package/md_cg/forgetting.py +581 -581
- package/md_cg/fsutil.py +377 -329
- package/md_cg/hotcache.py +48 -7
- package/md_cg/hyperedge.py +251 -251
- package/md_cg/identity.py +390 -390
- package/md_cg/insight.py +500 -500
- package/md_cg/interop.py +338 -0
- package/md_cg/judgment_manifest.py +177 -0
- package/md_cg/lexicon/build_cedict_en_zh.py +329 -329
- package/md_cg/lexicon/build_standard_en.py +171 -171
- package/md_cg/lexicon/expand_en_zh.py +211 -211
- package/md_cg/lifecycle.py +272 -272
- package/md_cg/linkref.py +280 -280
- package/md_cg/links.py +140 -107
- package/md_cg/mcp_server.py +403 -55
- package/md_cg/md_whitebox.py +345 -345
- package/md_cg/mdcg.py +783 -233
- package/md_cg/mdcos.py +500 -70
- package/md_cg/metacognition.py +591 -591
- package/md_cg/migrate.py +119 -119
- package/md_cg/migrate_aeis.py +221 -221
- package/md_cg/migrate_roleplay.py +293 -293
- package/md_cg/migrate_wisdom_graph.py +360 -360
- package/md_cg/mreview/__init__.py +25 -25
- package/md_cg/mreview/__main__.py +110 -110
- package/md_cg/mreview/bundle.py +178 -178
- package/md_cg/mreview/candidates.py +262 -262
- package/md_cg/mreview/govern.py +694 -693
- package/md_cg/mreview/locate.py +939 -939
- package/md_cg/mreview/pipeline.py +728 -728
- package/md_cg/mreview/rules/duplication.json +21 -21
- package/md_cg/mreview/rules/field_coverage.json +54 -54
- package/md_cg/mreview/rules/source_license.json +21 -21
- package/md_cg/mreview/rules/template_flow.json +21 -21
- package/md_cg/mreview/ruleset.py +252 -252
- package/md_cg/nodefile.py +575 -575
- package/md_cg/pooling.py +484 -472
- package/md_cg/postings.py +300 -298
- package/md_cg/predict.py +1100 -1100
- package/md_cg/progressive.py +123 -123
- package/md_cg/protect.py +272 -272
- package/md_cg/protocol/md_cg_gate.proto +33 -33
- package/md_cg/protocol.py +372 -372
- package/md_cg/provenance.py +582 -582
- package/md_cg/reach.py +453 -453
- package/md_cg/readcache.py +143 -0
- package/md_cg/reconcile.py +228 -0
- package/md_cg/refindex.py +833 -833
- package/md_cg/refine.py +604 -604
- package/md_cg/review_cli.py +170 -0
- package/md_cg/roleviews.py +89 -89
- package/md_cg/routing.py +393 -365
- package/md_cg/run_tests.py +211 -0
- package/md_cg/scrub.py +13 -3
- package/md_cg/security.py +128 -18
- package/md_cg/self_state.py +1029 -1029
- package/md_cg/selfreport.py +152 -151
- package/md_cg/semantic/__init__.py +10 -10
- package/md_cg/semantic/canonical.py +122 -122
- package/md_cg/semantic/en_normalizer.py +364 -364
- package/md_cg/semantic/en_zh_map.json +28694 -0
- package/md_cg/semantic/export_en_zh_map.py +64 -0
- package/md_cg/semantic/unify.py +45 -0
- package/md_cg/semantic/zh_en_atoms.py +139 -139
- package/md_cg/signer.py +7 -4
- package/md_cg/sources.py +816 -582
- package/md_cg/statushdr.py +179 -179
- package/md_cg/stg.py +54 -37
- package/md_cg/subgraph.py +729 -729
- package/md_cg/sustain.py +35 -5
- package/md_cg/tasks.py +470 -470
- package/md_cg/test_access_hints.py +147 -0
- package/md_cg/test_action_derive.py +203 -203
- package/md_cg/test_audit_rotate.py +270 -270
- package/md_cg/test_autonomy.py +143 -143
- package/md_cg/test_bench_governance.py +102 -102
- package/md_cg/test_blindspot_tickets.py +166 -166
- package/md_cg/test_branch_discard_tombstone.py +136 -0
- package/md_cg/test_branches.py +13 -3
- package/md_cg/test_ccg_perturb.py +184 -184
- package/md_cg/test_ccgc.py +433 -433
- package/md_cg/test_census_prune.py +81 -81
- package/md_cg/test_chain_read_isolate.py +168 -0
- package/md_cg/test_cond_compose_anchors.py +76 -76
- package/md_cg/test_cond_match.py +165 -165
- package/md_cg/test_condition_anchor.py +81 -81
- package/md_cg/test_d_meta.py +412 -412
- package/md_cg/test_datapath_device_name.py +203 -0
- package/md_cg/test_datapath_root.py +199 -199
- package/md_cg/test_emit_negtail_cache.py +156 -0
- package/md_cg/test_en_pipeline.py +22 -2
- package/md_cg/test_gain_gate.py +212 -212
- package/md_cg/test_govern_directread.py +421 -0
- package/md_cg/test_health_scale.py +173 -173
- package/md_cg/test_hive_ingest.py +285 -0
- package/md_cg/test_hot_cold.py +215 -215
- package/md_cg/test_hyperedge.py +245 -245
- package/md_cg/test_i26_empty_first_write.py +116 -0
- package/md_cg/test_i27_e041_identity.py +128 -0
- package/md_cg/test_i28_hotcache_prodpath.py +122 -0
- package/md_cg/test_i32_hotcache_env_key.py +218 -0
- package/md_cg/test_identity_attribution.py +96 -15
- package/md_cg/test_index_durability.py +17 -3
- package/md_cg/test_interop.py +95 -0
- package/md_cg/test_interop_judgment.py +228 -0
- package/md_cg/test_issue39_utf8_stdio.py +273 -0
- package/md_cg/test_lifecycle.py +309 -309
- package/md_cg/test_linkref.py +306 -306
- package/md_cg/test_links_concurrent_write.py +188 -0
- package/md_cg/test_lock.py +43 -43
- package/md_cg/test_md_access_parity.py +255 -255
- package/md_cg/test_md_writepath.py +345 -345
- package/md_cg/test_mdstore_search_parity.py +160 -0
- package/md_cg/test_merge_upsert.py +168 -0
- package/md_cg/test_mr_m2.py +587 -587
- package/md_cg/test_mr_m3.py +710 -710
- package/md_cg/test_mr_m4.py +485 -485
- package/md_cg/test_n123_derive_expiry_chain.py +205 -0
- package/md_cg/test_n130_verify_falsified_protect.py +185 -0
- package/md_cg/test_n131_merge_gate.py +205 -0
- package/md_cg/test_p0.py +250 -250
- package/md_cg/test_p1.py +316 -316
- package/md_cg/test_p10_identity.py +173 -173
- package/md_cg/test_p11_consistency.py +233 -233
- package/md_cg/test_p12_metacognition.py +212 -212
- package/md_cg/test_p13_encryption.py +241 -241
- package/md_cg/test_p14_sustain.py +249 -249
- package/md_cg/test_p15_scrub.py +280 -280
- package/md_cg/test_p16_self_state.py +301 -301
- package/md_cg/test_p17_predict.py +354 -354
- package/md_cg/test_p18_whitebox.py +171 -171
- package/md_cg/test_p19_migrate_roleplay.py +149 -149
- package/md_cg/test_p1x_ref_root.py +160 -0
- package/md_cg/test_p20_evolution.py +315 -315
- package/md_cg/test_p21_tokens.py +293 -270
- package/md_cg/test_p22_theory.py +175 -175
- package/md_cg/test_p23_links.py +311 -311
- package/md_cg/test_p24_evidence.py +227 -227
- package/md_cg/test_p25_weights.py +156 -156
- package/md_cg/test_p26_refindex.py +416 -416
- package/md_cg/test_p27_docindex.py +16 -7
- package/md_cg/test_p28_refcheck.py +305 -305
- package/md_cg/test_p29_session_ingest_export.py +354 -333
- package/md_cg/test_p2_mcp.py +3 -0
- package/md_cg/test_p3.py +11 -2
- package/md_cg/test_p30_maintain.py +330 -330
- package/md_cg/test_p31_insight.py +534 -534
- package/md_cg/test_p32_backfill.py +7 -1
- package/md_cg/test_p33_ccg_wiring.py +293 -293
- package/md_cg/test_p34_crosscheck.py +331 -331
- package/md_cg/test_p35_conditioned_claim.py +252 -252
- package/md_cg/test_p36_kp_align.py +230 -230
- package/md_cg/test_p37_condition_space.py +248 -248
- package/md_cg/test_p38_concurrent_flush.py +102 -0
- package/md_cg/test_p38_contextualize.py +273 -273
- package/md_cg/test_p39_verify_flow.py +153 -0
- package/md_cg/test_p39_vision_evidence.py +369 -369
- package/md_cg/test_p40_refine_worklist.py +241 -241
- package/md_cg/test_p41_evolve_patrol.py +224 -224
- package/md_cg/test_p42_provenance.py +269 -269
- package/md_cg/test_p43_pooling.py +412 -398
- package/md_cg/test_p44_md_whitebox.py +231 -231
- package/md_cg/test_p45_session_identity.py +219 -219
- package/md_cg/test_p46_unit_scope.py +272 -272
- package/md_cg/test_p47_session_view.py +316 -0
- package/md_cg/test_p4_fuzzy.py +223 -223
- package/md_cg/test_p5_semantic.py +226 -226
- package/md_cg/test_p6_consolidate.py +440 -387
- package/md_cg/test_p7_goals_recent.py +202 -202
- package/md_cg/test_p8_subgraph_chain.py +200 -200
- package/md_cg/test_p9_forget_protect.py +231 -231
- package/md_cg/test_predict_beta.py +135 -135
- package/md_cg/test_preflight_failclosed.py +100 -100
- package/md_cg/test_progressive.py +146 -146
- package/md_cg/test_propose_tail_index.py +157 -0
- package/md_cg/test_protocol.py +243 -243
- package/md_cg/test_reach.py +378 -378
- package/md_cg/test_reach_keys.py +201 -201
- package/md_cg/test_read_clip.py +141 -141
- package/md_cg/test_read_scope_b27.py +277 -0
- package/md_cg/test_readcache_default_on.py +168 -0
- package/md_cg/test_readcache_precise_inval.py +270 -0
- package/md_cg/test_readcache_prodpath.py +203 -0
- package/md_cg/test_reconcile_v0.py +294 -0
- package/md_cg/test_retr_gates_prodpath.py +140 -0
- package/md_cg/test_retr_s1.py +344 -340
- package/md_cg/test_retr_s1b.py +276 -209
- package/md_cg/test_retr_s3.py +194 -194
- package/md_cg/test_retr_s4.py +163 -163
- package/md_cg/test_retr_s5.py +200 -200
- package/md_cg/test_retr_s6.py +157 -157
- package/md_cg/test_retr_s7.py +392 -384
- package/md_cg/test_retr_s8_time.py +369 -316
- package/md_cg/test_retr_s9_edges.py +286 -286
- package/md_cg/test_retr_s9_entity_ctx.py +9 -3
- package/md_cg/test_retr_score_once.py +208 -0
- package/md_cg/test_review_conformance.py +367 -367
- package/md_cg/test_review_onepass.py +170 -0
- package/md_cg/test_role_views.py +354 -354
- package/md_cg/test_rrf_graph_seed_cache.py +154 -0
- package/md_cg/test_security_audit.py +155 -0
- package/md_cg/test_security_audit_b26.py +161 -0
- package/md_cg/test_security_audit_v21.py +250 -0
- package/md_cg/test_sem_noise.py +242 -242
- package/md_cg/test_semantic_canonical.py +16 -2
- package/md_cg/test_session_isolation.py +168 -0
- package/md_cg/test_snapshot_autoclose.py +187 -0
- package/md_cg/test_subproc_encoding.py +192 -192
- package/md_cg/test_sustain_mutual.py +153 -153
- package/md_cg/test_tail_watermark_race.py +208 -0
- package/md_cg/test_tasks.py +409 -409
- package/md_cg/test_tenant_env_override_warn.py +139 -0
- package/md_cg/test_tenant_registry_corrupt_warn.py +151 -0
- package/md_cg/test_tool_face.py +189 -189
- package/md_cg/test_transfer.py +180 -180
- package/md_cg/test_trust.py +361 -361
- package/md_cg/test_twophase.py +286 -286
- package/md_cg/test_v14_fixes.py +38 -20
- package/md_cg/test_validity_filter.py +280 -280
- package/md_cg/test_verify_answer.py +138 -138
- package/md_cg/test_verify_dirty_reconcile.py +157 -0
- package/md_cg/test_wisdom_md_store.py +292 -292
- package/md_cg/test_writelimit.py +197 -197
- package/md_cg/test_writepipe.py +214 -214
- package/md_cg/theory.py +6 -3
- package/md_cg/tokens.py +85 -14
- package/md_cg/tool_face.py +260 -260
- package/md_cg/trust.py +986 -950
- package/md_cg/twophase.py +231 -231
- package/md_cg/units.py +668 -667
- package/md_cg/vision_evidence.py +667 -666
- package/md_cg/weights.py +624 -624
- package/md_cg/whitebox.py +527 -527
- package/md_cg/whitebox_kb/__init__.py +37 -37
- package/md_cg/whitebox_kb/aeis_core/__init__.py +42 -42
- package/md_cg/whitebox_kb/aeis_core/semantic.py +280 -280
- package/md_cg/whitebox_kb/aeis_core/textutil.py +13 -13
- package/md_cg/whitebox_kb/engine.py +310 -310
- package/md_cg/whitebox_kb/seed_knowledge//346/231/272/350/203/275/350/256/2723.4.md +5260 -5260
- package/md_cg/whitebox_kb/wisdom/browser_units.py +2631 -2631
- package/md_cg/whitebox_kb/wisdom/causal_discover.py +432 -432
- package/md_cg/whitebox_kb/wisdom/chat_engine.py +1506 -1506
- package/md_cg/whitebox_kb/wisdom/compiler_code_units.py +3033 -3033
- package/md_cg/whitebox_kb/wisdom/condition_algebra.py +112 -112
- package/md_cg/whitebox_kb/wisdom/condition_frame.py +315 -315
- package/md_cg/whitebox_kb/wisdom/condition_kb.py +108 -108
- package/md_cg/whitebox_kb/wisdom/conflict_map.json +4445 -4445
- package/md_cg/whitebox_kb/wisdom/core/lexer.py +512 -512
- package/md_cg/whitebox_kb/wisdom/core/name_checker.py +1023 -1023
- package/md_cg/whitebox_kb/wisdom/cspmn.py +258 -258
- package/md_cg/whitebox_kb/wisdom/csre.py +264 -264
- package/md_cg/whitebox_kb/wisdom/danmaku_audit.py +252 -252
- package/md_cg/whitebox_kb/wisdom/distilled_condition_units.json +6417 -6417
- package/md_cg/whitebox_kb/wisdom/docs/WB-EVAL-20260902b.json +1950 -1950
- package/md_cg/whitebox_kb/wisdom/docs/WB-EVAL-20260902c.json +1296 -1296
- package/md_cg/whitebox_kb/wisdom/docs/whitebox_capability_graph_demo.json +59 -59
- package/md_cg/whitebox_kb/wisdom/graph_db_units.py +3089 -3089
- package/md_cg/whitebox_kb/wisdom/knowledge_points.py +318 -318
- package/md_cg/whitebox_kb/wisdom/md_access.py +470 -470
- package/md_cg/whitebox_kb/wisdom/md_store.py +276 -251
- package/md_cg/whitebox_kb/wisdom/migrate_wisdom.py +476 -476
- package/md_cg/whitebox_kb/wisdom/multilang_ir.py +128 -124
- package/md_cg/whitebox_kb/wisdom/navigate.py +248 -248
- package/md_cg/whitebox_kb/wisdom/neural_retrieve.py +224 -224
- package/md_cg/whitebox_kb/wisdom/os_units.py +2735 -2735
- package/md_cg/whitebox_kb/wisdom/pattern_separation.py +376 -376
- package/md_cg/whitebox_kb/wisdom/prereq_map.json +364 -364
- package/md_cg/whitebox_kb/wisdom/python_code_units.py +2766 -2766
- package/md_cg/whitebox_kb/wisdom/role_solidified.json +7 -7
- package/md_cg/whitebox_kb/wisdom/route_memory.py +244 -244
- package/md_cg/whitebox_kb/wisdom/scene_reconstruction.py +148 -148
- package/md_cg/whitebox_kb/wisdom/snr_report.json +40 -40
- package/md_cg/whitebox_kb/wisdom/test_code_compose_domains.py +7541 -7541
- package/md_cg/whitebox_kb/wisdom/test_compiler_self_bootstrap.py +354 -354
- package/md_cg/whitebox_kb/wisdom/test_ecosystem_assembly.py +158 -158
- package/md_cg/whitebox_kb/wisdom/test_ecosystem_demos.py +193 -193
- package/md_cg/whitebox_kb/wisdom/test_graph_db.py +292 -292
- package/md_cg/whitebox_kb/wisdom/test_python_self_bootstrap.py +160 -160
- package/md_cg/whitebox_kb/wisdom/trigger_words_index.json +4366 -4366
- package/md_cg/whitebox_kb/wisdom/verifier.py +1297 -1297
- package/md_cg/writelimit.py +356 -356
- package/md_cg/writepipe.py +20 -8
- package/package.json +101 -96
- package/skills/plugin.json +54 -54
- package/skills/skills/designer-perspective/SKILL.md +158 -158
- package/skills/skills/designer-perspective/references/01-observation-position.md +66 -66
- package/skills/skills/designer-perspective/references/02-structure-recognition.md +62 -62
- package/skills/skills/designer-perspective/references/03-direction-judgment.md +55 -55
- package/skills/skills/designer-perspective/references/04-qualification-verdict.md +72 -72
- package/skills/skills/designer-perspective/references/05-condition-attribution.md +74 -74
- package/skills/skills/designer-perspective/scripts/designer.py +545 -545
- package/skills/skills/designer-perspective/tests/cases.jsonl +17 -17
- package/skills/skills/designer-perspective/tests/selftest.py +61 -61
- package/skills/skills/lingshu-browser/SKILL.md +60 -60
- package/skills/skills/lingshu-compiler/SKILL.md +56 -56
- package/skills/skills/lingshu-compiler/units/analyze-type-infer/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/check-name-real/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-assign/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-expr-tree/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-full-pipeline/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-func-def/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-if-then/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-logic-expr/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-recursive/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-scope/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-type-check/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compile-while/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0010c4bf/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0355bffb/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0361708a/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-054a0414/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-05a1691a/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-05eeed1e/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0622a1f6/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-08b54217/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0a62b70c/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0ab24d00/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0e093688/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0e82b966/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0ee9b9b9/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-0f3787e6/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-1028685f/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-11897630/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-16661b9b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-1f722303/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-25be1262/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-2a76ba07/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-2dbea54a/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-2df52f16/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-2ec2c9d2/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-2f8c8f39/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-38378ac7/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-39457d2e/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-39fb5926/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-47f4fbfa/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-4a8cd1f1/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-4b230b6b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-4cbbda95/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-4d5a68ff/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-56dc9bdd/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-57e76ebe/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-61ff016b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-63eae588/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-64c4224b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-66377955/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-674ab4f6/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-6af76fd6/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-6d979db2/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-6de326c0/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-6f1c0eea/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-724d6c9b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-7690177f/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-7b229a7d/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-7f471b3a/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-815cad08/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-83c61634/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-8c798c81/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-8dd747ac/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-90324d0a/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-94b8d72d/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-94f12231/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-95937c16/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-98a5625b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-98b4c42f/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-98e3894a/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-9bdfe4b8/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-9d9b4e83/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-9f7be5ad/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-a6daf076/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-a7995a0c/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-a8399248/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-aabbd099/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-afe169d8/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-b0678bda/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-b09bd196/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-b1396e23/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-b9b31ce0/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-c10264a7/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-cb1e8e4b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-ccafd438/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-cda9c262/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-ce648068/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-cf5776a4/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-d974e5d3/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-e3979fd3/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-eb1cf2b5/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-ecb30d5b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-f8c8b24b/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-f99fedbe/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-fa8ff5f7/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/compiler-fe1b058d/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/lex-chinese-program/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/lex-dao-de-jing/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/lex-nine-chapters/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-arithmetic/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-array-ops/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-closure-call/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-closure-create/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-compare/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-cond-jump/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-cond-space/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-exception/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-func-call/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-loop-run/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-profiling/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-refcount/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-run-loop/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-short-circuit/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-stack-guard/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-stack-ops/SKILL.md +45 -45
- package/skills/skills/lingshu-compiler/units/vm-trust-accum/SKILL.md +45 -45
- package/skills/skills/lingshu-graph/SKILL.md +63 -63
- package/skills/skills/lingshu-net/SKILL.md +48 -48
- package/skills/skills/lingshu-os/SKILL.md +64 -64
- package/skills/skills/lingshu-pylang/SKILL.md +71 -71
- package/src/bridge.ts +33 -0
- package/src/hooks.ts +38 -2
- package/src/index.ts +526 -518
- package/src/lib/datapath.ts +326 -326
- package/src/lib/mdcg_client.ts +413 -413
- package/src/lib/mutual.ts +428 -428
- package/src/lib/prompt_safety.ts +62 -62
- package/src/lib/python_path.ts +71 -71
- package/src/lib/roleplay_web.ts +116 -29
- package/src/lib/token_store.ts +13 -3
- package/src/tools.ts +212 -212
- package/zcode/AGENTS.md +11 -3
- package/zcode/README.md +41 -41
- /package/docs/{mdcg → hive}//344/270/273/344/273/243/347/220/206/345/255/220/344/273/243/347/220/206/350/256/260/345/277/206/346/236/266/346/236/204/350/256/276/350/256/241.md" +0 -0
|
@@ -1,329 +1,329 @@
|
|
|
1
|
-
#!/usr/bin/env python3
|
|
2
|
-
# -*- coding: utf-8 -*-
|
|
3
|
-
"""build_cedict_en_zh.py · 词级 en→zh 反查表构建器(CC-CEDICT 词级,补字级反查缺口)
|
|
4
|
-
|
|
5
|
-
背景(2026-09-14 裁定路径):u2c 归因臂实证「语义路机制+doc 侧上界 hit@10=99.2%」,
|
|
6
|
-
瓶颈 100% 在 query 侧 en→zh 归一覆盖(u2=23.8 vs u2c=99.2)。字级 char_atoms_clean
|
|
7
|
-
反查对剩余 OOV 词次覆盖仅 ~15%(expand_en_zh analyze 实证),且字级产物与 doc 侧
|
|
8
|
-
整词原子形态不齐(music→单字 vs 摘要「音乐」整词原子)。本脚本从 CC-CEDICT 词级
|
|
9
|
-
词典反查英文词→中文词,产出 md_cg/lexicon/cedict_en_zh.json(独立数据文件)——
|
|
10
|
-
许可 CC-BY-SA 4.0,故**不内联**进 MIT 的 en_normalizer.EN_ZH,独立文件+署名。
|
|
11
|
-
|
|
12
|
-
清理规则(与 expand_en_zh.py 同纪律,机械可审计,不做语义发明):
|
|
13
|
-
· 释义列剥括号注((Taiwan pr. ...) 等)→ 剥 "to /a /an " 前缀 → 按非字母拆词
|
|
14
|
-
· 纯字母 fullmatch [a-z]+;min_len>=3(2 字母缩写域碰撞)
|
|
15
|
-
· STOPWORDS 排除;与手工 EN_ZH 重复 → 手工优先(build 时写入 excluded)
|
|
16
|
-
· 同一英文词反查到多个中文词 → 冲突跳过并计数(宁缺勿滥)
|
|
17
|
-
|
|
18
|
-
用法:
|
|
19
|
-
python md_cg/lexicon/build_cedict_en_zh.py download # 拉 CEDICT 原始 gz(gitignored)
|
|
20
|
-
python md_cg/lexicon/build_cedict_en_zh.py build # 反查 → cedict_en_zh.json
|
|
21
|
-
python md_cg/lexicon/build_cedict_en_zh.py analyze # 500 题 OOV 覆盖上界取证
|
|
22
|
-
|
|
23
|
-
产物许可:本仓 cedict_en_zh.json 为 CC-CEDICT 派生数据,依 CC-BY-SA 4.0 署名:
|
|
24
|
-
CC-CEDICT (https://www.mdbg.net/chinese/dictionary, CC BY-SA 4.0)
|
|
25
|
-
"""
|
|
26
|
-
import collections
|
|
27
|
-
import gzip
|
|
28
|
-
import io
|
|
29
|
-
import json
|
|
30
|
-
import os
|
|
31
|
-
import re
|
|
32
|
-
import sys
|
|
33
|
-
import time
|
|
34
|
-
import urllib.request
|
|
35
|
-
|
|
36
|
-
HERE = os.path.dirname(os.path.dirname(os.path.dirname(os.path.abspath(__file__))))
|
|
37
|
-
for _p in (HERE, os.path.join(HERE, "md_cg")):
|
|
38
|
-
if _p not in sys.path:
|
|
39
|
-
sys.path.insert(0, _p)
|
|
40
|
-
|
|
41
|
-
from md_cg.semantic.en_normalizer import EN_ZH, STOPWORDS # noqa: E402
|
|
42
|
-
|
|
43
|
-
RAW_DIR = os.path.join(HERE, "data", "external", "cedict")
|
|
44
|
-
RAW_GZ = os.path.join(RAW_DIR, "cedict_1_0_ts_utf-8_mdbg.txt.gz")
|
|
45
|
-
RAW_TXT = os.path.join(RAW_DIR, "cedict.txt")
|
|
46
|
-
OUT_JSON = os.path.join(HERE, "md_cg", "lexicon", "cedict_en_zh.json")
|
|
47
|
-
QUESTIONS = os.path.join(HERE, "data", "external", "locomo_zh",
|
|
48
|
-
"raw_questions.jsonl")
|
|
49
|
-
CEDICT_URL = "https://www.mdbg.net/chinese/export/cedict/cedict_1_0_ts_utf-8_mdbg.txt.gz"
|
|
50
|
-
LINE_RE = re.compile(r"^(\S+)\s+(\S+)\s+\[[^\]]+\]\s+/(.+)/\s*$")
|
|
51
|
-
|
|
52
|
-
|
|
53
|
-
# 生效条件:无必需形参,被调用即创建模块常量 RAW_DIR、按 CEDICT_URL 发请求(UA 头 + timeout=120),把响应体写入 RAW_GZ,再以 gzip 解压并按 errors="replace" 解码写入 RAW_TXT,最后打印字节数与行数并返回 0;
|
|
54
|
-
def download():
|
|
55
|
-
os.makedirs(RAW_DIR, exist_ok=True)
|
|
56
|
-
req = urllib.request.Request(
|
|
57
|
-
CEDICT_URL, headers={"User-Agent": "Mozilla/5.0 (dsh-memory lexicon builder)"})
|
|
58
|
-
with urllib.request.urlopen(req, timeout=120) as resp:
|
|
59
|
-
blob = resp.read()
|
|
60
|
-
with io.open(RAW_GZ, "wb") as f:
|
|
61
|
-
f.write(blob)
|
|
62
|
-
with gzip.open(RAW_GZ, "rb") as f:
|
|
63
|
-
raw = f.read()
|
|
64
|
-
with io.open(RAW_TXT, "w", encoding="utf-8", newline="\n") as f:
|
|
65
|
-
f.write(raw.decode("utf-8", errors="replace"))
|
|
66
|
-
print("[download] %d bytes → %s(%d 行)"
|
|
67
|
-
% (len(blob), RAW_TXT, raw.count(b"\n")))
|
|
68
|
-
return 0
|
|
69
|
-
|
|
70
|
-
|
|
71
|
-
# 生效条件:无必需形参,迭代时逐行读模块常量 RAW_TXT,仅当 strip 后非空、不以 "#" 开头且 LINE_RE.match 命中时产出 (第 2 组, 第 3 组),其余行跳过(生成器,无产出即为空);
|
|
72
|
-
def iter_entries():
|
|
73
|
-
"""CEDICT 行 → (简体, [英文释义段])。注释/空行跳过。"""
|
|
74
|
-
with io.open(RAW_TXT, encoding="utf-8") as f:
|
|
75
|
-
for line in f:
|
|
76
|
-
line = line.strip()
|
|
77
|
-
if not line or line.startswith("#"):
|
|
78
|
-
continue
|
|
79
|
-
m = LINE_RE.match(line)
|
|
80
|
-
if not m:
|
|
81
|
-
continue
|
|
82
|
-
yield m.group(2), m.group(3)
|
|
83
|
-
|
|
84
|
-
|
|
85
|
-
# 生效条件:min_len 取默认 3(调用方可传入覆盖,传入 0 则 len(sub)<min_len 恒不成立、不再做长度过滤),遍历 iter_entries() 的释义按 / 分段、剥 (…) 注、按 ;, 切子段并 strip+lower+去 to/a/an 前缀,子段须 fullmatch [a-z]+、不在 STOPWORDS、长度 ≥ min_len 才计入 rev[en];末尾按 zh 集大小 1 写入 cand[en]、>1 写入 conflicts[en],返回 (cand, conflicts, stat);
|
|
86
|
-
def reverse_map(min_len=3):
|
|
87
|
-
"""词级反查 → (候选 {en: zh}, 冲突 {en: [zh...]}, 统计 dict)。
|
|
88
|
-
|
|
89
|
-
条目级子段反查:释义按 / 段 → 括号注剥离 → 按 ;, 切子段 → 子段清洗后
|
|
90
|
-
**恰为单个英文词**才收("music album" 等复合短语被纯字母 fullmatch 滤除,
|
|
91
|
-
不再以复合词条身份污染反查——首轮实证 4.4% 覆盖的根因)。
|
|
92
|
-
"""
|
|
93
|
-
rev = collections.defaultdict(set)
|
|
94
|
-
stat = {"entries": 0, "glosses": 0, "bracket_stripped": 0,
|
|
95
|
-
"prefix_stripped": 0, "stopword": 0, "too_short": 0,
|
|
96
|
-
"phrase_skipped": 0}
|
|
97
|
-
for zh, gloss in iter_entries():
|
|
98
|
-
stat["entries"] += 1
|
|
99
|
-
for seg in gloss.split("/"):
|
|
100
|
-
seg = re.sub(r"\([^)]*\)", "", seg) # 剥括号注
|
|
101
|
-
if seg != gloss:
|
|
102
|
-
stat["bracket_stripped"] += 1
|
|
103
|
-
for sub in re.split(r"[;,]", seg): # 子段
|
|
104
|
-
sub = sub.strip().lower()
|
|
105
|
-
sub = re.sub(r"^(to|a|an) ", "", sub)
|
|
106
|
-
if sub != sub.strip().lower():
|
|
107
|
-
stat["prefix_stripped"] += 1
|
|
108
|
-
if not re.fullmatch(r"[a-z]+", sub):
|
|
109
|
-
stat["phrase_skipped"] += 1
|
|
110
|
-
continue
|
|
111
|
-
if sub in STOPWORDS:
|
|
112
|
-
stat["stopword"] += 1
|
|
113
|
-
continue
|
|
114
|
-
if len(sub) < min_len:
|
|
115
|
-
stat["too_short"] += 1
|
|
116
|
-
continue
|
|
117
|
-
stat["glosses"] += 1
|
|
118
|
-
rev[sub].add(zh)
|
|
119
|
-
cand, conflicts = {}, {}
|
|
120
|
-
for en, zhs in rev.items():
|
|
121
|
-
if len(zhs) == 1:
|
|
122
|
-
cand[en] = next(iter(zhs))
|
|
123
|
-
else:
|
|
124
|
-
conflicts[en] = sorted(zhs)
|
|
125
|
-
return cand, conflicts, stat
|
|
126
|
-
|
|
127
|
-
|
|
128
|
-
# 生效条件:无必需形参,逐行读模块引用 b6.CORPUS567 并跳过空白行,每行 json.loads 后取 (c.get("zh") or "") 与 (c.get("zh_fields") or {}) 中所有 str 值拼接成一条,最终以换行连成整串返回(无有效行时返回空串);
|
|
129
|
-
def _corpus_text():
|
|
130
|
-
"""领域语料全文(zh 正文+五槽摘要)——冲突集频次消歧用。
|
|
131
|
-
|
|
132
|
-
消歧本质=doc 侧自监督:query 词要匹配的对象就是 doc 侧原子,
|
|
133
|
-
「公园」在语料高频、「园囿」零出现——频次直接裁决,与匹配目标自洽。
|
|
134
|
-
"""
|
|
135
|
-
from md_cg import bench6_common as b6
|
|
136
|
-
buf = []
|
|
137
|
-
with io.open(b6.CORPUS567, encoding="utf-8") as f:
|
|
138
|
-
for line in f:
|
|
139
|
-
if not line.strip():
|
|
140
|
-
continue
|
|
141
|
-
c = json.loads(line)
|
|
142
|
-
parts = [c.get("zh") or ""]
|
|
143
|
-
for v in (c.get("zh_fields") or {}).values():
|
|
144
|
-
if isinstance(v, str):
|
|
145
|
-
parts.append(v)
|
|
146
|
-
buf.append("".join(parts))
|
|
147
|
-
return "\n".join(buf)
|
|
148
|
-
|
|
149
|
-
|
|
150
|
-
# 生效条件:无必需形参,逐行读模块引用 b6.CORPUS567 并跳过空白行;摘要取 (c.get("zh_fields") or {}).get("summary") 且 str(...).strip() 后为空时回落 c.get("zh"),非空则 semantic_atoms 切分后空格连接入 sums;正文取 c.get("zh").strip() 非空则同样切分入 bodys;返回 ("\n".join(sums), "\n".join(bodys))(两级均可能为空串);
|
|
151
|
-
def _atoms_texts():
|
|
152
|
-
"""doc 侧同构消歧空间(2026-09-14 消歧口径升级)。
|
|
153
|
-
|
|
154
|
-
取证:tattoo 冲突集(刺字/刺花/刺青/文身/纹…)整词形在语料 count 全零
|
|
155
|
-
→ 旧口径整词丢弃;而真实用词「纹身」在摘要 fm.semantic 落盘形态是
|
|
156
|
-
切分碎片「纹 身」——消歧 count 的字符串空间与匹配面形态从未对齐,
|
|
157
|
-
11257 个英文词(高频多义词重灾区)因此被整词丢弃。
|
|
158
|
-
|
|
159
|
-
返回 (摘要原子串, 正文原子串):候选词经 semantic_atoms 切分后以
|
|
160
|
-
「原子 空格 原子」形态计数——与检索打分面(pair_hits 的 doc 侧输入)
|
|
161
|
-
完全同构。摘要优先(fm.semantic 是语义路唯一 doc 侧),正文兜底
|
|
162
|
-
(词法路匹配面)。
|
|
163
|
-
"""
|
|
164
|
-
from md_cg import bench6_common as b6
|
|
165
|
-
from md_cg.semantic.canonical import semantic_atoms
|
|
166
|
-
sums, bodys = [], []
|
|
167
|
-
with io.open(b6.CORPUS567, encoding="utf-8") as f:
|
|
168
|
-
for line in f:
|
|
169
|
-
if not line.strip():
|
|
170
|
-
continue
|
|
171
|
-
c = json.loads(line)
|
|
172
|
-
s = str((c.get("zh_fields") or {}).get("summary") or "").strip()
|
|
173
|
-
if not s:
|
|
174
|
-
s = str(c.get("zh") or "").strip()
|
|
175
|
-
if s:
|
|
176
|
-
sums.append(" ".join(semantic_atoms(s)))
|
|
177
|
-
body = str(c.get("zh") or "").strip()
|
|
178
|
-
if body:
|
|
179
|
-
bodys.append(" ".join(semantic_atoms(body)))
|
|
180
|
-
return "\n".join(sums), "\n".join(bodys)
|
|
181
|
-
|
|
182
|
-
|
|
183
|
-
# 生效条件:给定冲突英文词 en、候选中文集合 zhs、文本对 texts=(摘要原子串, 正文原子串),仅对 2 ≤ len(z) ≤ 4 且按 sorted(zhs) 顺序的候选,依次用摘要 frag 计数、摘要全零时改用正文 frag 计数、前两级全零时改用单原子碎片计数求和(级别 0/1/2 依次),任一非零即入 scored;scored 为空返回 (None, -1),否则按 (-计数, 级别, 长度, 字典序) 排序返回 scored[0] 的中文词与级别;
|
|
184
|
-
def _disambiguate(en, zhs, texts):
|
|
185
|
-
"""单英文词冲突集三级消歧:摘要碎片串 → 正文碎片串 → 碎片字级和。
|
|
186
|
-
|
|
187
|
-
返回 (胜出中文词, 级别) 或 (None, -1)(全零丢弃,宁缺勿滥——不发明词形)。
|
|
188
|
-
切分形态计数与 doc 侧匹配面同构(纹身→「纹 身」对「纹 身」count);
|
|
189
|
-
字级兜底只解决「词条整词与语料词形微差」(文身 vs 纹身 异形词——
|
|
190
|
-
「文」「身」碎片分别可数)。候选恒限定词典集合内,不做语义发明。
|
|
191
|
-
"""
|
|
192
|
-
from md_cg.semantic.canonical import semantic_atoms
|
|
193
|
-
sums, bodys = texts
|
|
194
|
-
scored = []
|
|
195
|
-
for z in sorted(zhs):
|
|
196
|
-
if not 2 <= len(z) <= 4:
|
|
197
|
-
continue
|
|
198
|
-
frag = " ".join(semantic_atoms(z))
|
|
199
|
-
n = sums.count(frag)
|
|
200
|
-
if n > 0:
|
|
201
|
-
scored.append((n, 0, len(z), z))
|
|
202
|
-
if not scored:
|
|
203
|
-
for z in sorted(zhs):
|
|
204
|
-
if not 2 <= len(z) <= 4:
|
|
205
|
-
continue
|
|
206
|
-
frag = " ".join(semantic_atoms(z))
|
|
207
|
-
n = bodys.count(frag)
|
|
208
|
-
if n > 0:
|
|
209
|
-
scored.append((n, 1, len(z), z))
|
|
210
|
-
if not scored:
|
|
211
|
-
for z in sorted(zhs):
|
|
212
|
-
if not 2 <= len(z) <= 4:
|
|
213
|
-
continue
|
|
214
|
-
atoms = semantic_atoms(z)
|
|
215
|
-
n = sum(sums.count(" ".join(atoms[i:i + 1])) for i in range(len(atoms)))
|
|
216
|
-
if n > 0: # 字级兜底门槛试验(>=4)实测 u2 逐位一致:字级回收词
|
|
217
|
-
# 为开放域词,locomo 题面零出现,无噪声代价,保留全覆盖
|
|
218
|
-
scored.append((n, 2, len(z), z))
|
|
219
|
-
if not scored:
|
|
220
|
-
return None, -1
|
|
221
|
-
scored.sort(key=lambda t: (-t[0], t[1], t[2], t[3]))
|
|
222
|
-
return scored[0][3], scored[0][1]
|
|
223
|
-
|
|
224
|
-
|
|
225
|
-
# 生效条件:min_len 取默认 3、domain 取默认 True(两者均可由调用方传入覆盖,domain 传假值则跳过消歧分支);先 reverse_map(min_len) 取 cand/conf/stat,当 domain 为真且 conf 非空时以 _atoms_texts() 对每个冲突词调 _disambiguate 并计 disambiguated/body/char/dropped,命中则写回 cand 并 conf.pop(en)、未命中仅计 dropped;随后无条件把 set(cand) & set(EN_ZH) 的键从 cand 移除(手工表优先),再写出 OUT_JSON 并返回 0;
|
|
226
|
-
def build(min_len=3, domain=True):
|
|
227
|
-
cand, conf, stat = reverse_map(min_len)
|
|
228
|
-
stat["disambiguated"] = 0
|
|
229
|
-
stat["disambiguated_body"] = 0
|
|
230
|
-
stat["disambiguated_char"] = 0
|
|
231
|
-
stat["disambiguated_dropped"] = 0
|
|
232
|
-
if domain and conf:
|
|
233
|
-
# 冲突消歧(2026-09-14 口径升级):doc 侧同构三级裁决
|
|
234
|
-
# (摘要碎片串→正文碎片串→碎片字级和)——候选词按 semantic_atoms
|
|
235
|
-
# 切分形态计数,与 fm.semantic 匹配面完全同构;旧口径整词形 count
|
|
236
|
-
# 与摘要落盘形态(纹 身)错位,高频多义词(accept/describe/tattoo)
|
|
237
|
-
# 重灾区 11257 词被整词丢弃。词级候选 len 2-4——单字频次虚高排除;
|
|
238
|
-
# 全零丢弃(宁缺勿滥,不发明词形)。
|
|
239
|
-
texts = _atoms_texts()
|
|
240
|
-
for en in sorted(conf):
|
|
241
|
-
z, lv = _disambiguate(en, conf[en], texts)
|
|
242
|
-
if z:
|
|
243
|
-
cand[en] = z
|
|
244
|
-
stat["disambiguated"] += 1
|
|
245
|
-
if lv == 1:
|
|
246
|
-
stat["disambiguated_body"] += 1
|
|
247
|
-
elif lv == 2:
|
|
248
|
-
stat["disambiguated_char"] += 1
|
|
249
|
-
conf.pop(en)
|
|
250
|
-
else:
|
|
251
|
-
stat["disambiguated_dropped"] += 1
|
|
252
|
-
overlap = sorted(set(cand) & set(EN_ZH))
|
|
253
|
-
for w in overlap:
|
|
254
|
-
cand.pop(w) # 手工表优先
|
|
255
|
-
out = {
|
|
256
|
-
"meta": {
|
|
257
|
-
"name": "cedict_en_zh",
|
|
258
|
-
"created_at": time.strftime("%Y-%m-%dT%H:%M:%S"),
|
|
259
|
-
"source": "CC-CEDICT (https://www.mdbg.net/chinese/dictionary)",
|
|
260
|
-
"license": "CC BY-SA 4.0(派生数据,独立文件署名,不入 MIT 内联表)",
|
|
261
|
-
"min_len": min_len,
|
|
262
|
-
"rules": "剥括号注/to-a-an 前缀;条目级子段(单词条释义才收);"
|
|
263
|
-
"纯字母;STOPWORDS 排除;冲突集 doc 语料频次消歧"
|
|
264
|
-
"(三级同构:摘要碎片串→正文碎片串→碎片字级和,"
|
|
265
|
-
"候选 2-4 字);手工 EN_ZH 优先",
|
|
266
|
-
"domain_disambiguation": (
|
|
267
|
-
"locomo corpus567 摘要/正文 semantic_atoms 原子串同构计数裁决"
|
|
268
|
-
"(与 fm.semantic 匹配面形态一致),评测特化产物"
|
|
269
|
-
if domain else "无(纯唯一映射)"),
|
|
270
|
-
"stats": stat,
|
|
271
|
-
"n_map": len(cand), "n_conflict": len(conf),
|
|
272
|
-
"n_handmade_overlap": len(overlap),
|
|
273
|
-
},
|
|
274
|
-
"map": dict(sorted(cand.items())),
|
|
275
|
-
}
|
|
276
|
-
with io.open(OUT_JSON, "w", encoding="utf-8", newline="\n") as f:
|
|
277
|
-
json.dump(out, f, ensure_ascii=False, indent=1, sort_keys=True)
|
|
278
|
-
print("[build] 词级映射 %d 键(消歧 %d / 冲突跳过 %d / 手工重叠让位 %d)→ %s"
|
|
279
|
-
% (len(cand), stat["disambiguated"], len(conf), len(overlap), OUT_JSON))
|
|
280
|
-
print("[build] 统计: %s" % json.dumps(stat, ensure_ascii=False))
|
|
281
|
-
return 0
|
|
282
|
-
|
|
283
|
-
|
|
284
|
-
# 生效条件:无必需形参,两次逐行读模块常量 QUESTIONS 并跳过空白行:第一次对 str(q.get("question") or "") 调 normalize_en_query,把 detail 中 action=="unknown_keep" 的 str(d.get("orig") or "").lower() 逐个计入 Counter;第二次累加各问句 normalize_en_query 返回的第 0 项长度得 total_tokens;打印去重词数/词次/原子序列长度与 top 30 后返回 0(无有效行时计数为零仍返回 0);
|
|
285
|
-
def analyze():
|
|
286
|
-
"""集成后 normalize 的最终残留取证(en_normalizer 已加载 cedict_en_zh.json,
|
|
287
|
-
此处 unknown_keep 即全链路翻译后的真 OOV)。"""
|
|
288
|
-
from md_cg.semantic.en_normalizer import normalize_en_query
|
|
289
|
-
unk = collections.Counter()
|
|
290
|
-
with io.open(QUESTIONS, encoding="utf-8") as f:
|
|
291
|
-
for line in f:
|
|
292
|
-
if not line.strip():
|
|
293
|
-
continue
|
|
294
|
-
q = json.loads(line)
|
|
295
|
-
terms, detail = normalize_en_query(str(q.get("question") or ""))
|
|
296
|
-
for d in detail:
|
|
297
|
-
if d.get("action") == "unknown_keep":
|
|
298
|
-
unk[str(d.get("orig") or "").lower()] += 1
|
|
299
|
-
total_tokens = 0
|
|
300
|
-
kept_tokens = 0
|
|
301
|
-
with io.open(QUESTIONS, encoding="utf-8") as f:
|
|
302
|
-
for line in f:
|
|
303
|
-
if not line.strip():
|
|
304
|
-
continue
|
|
305
|
-
q = json.loads(line)
|
|
306
|
-
total_tokens += len(normalize_en_query(str(q.get("question") or ""))[0])
|
|
307
|
-
print("[analyze] 集成后最终 OOV:去重 %d 词 / %d 词次(残留原子序列长度 %d)"
|
|
308
|
-
% (len(unk), sum(unk.values()), total_tokens))
|
|
309
|
-
print("\n[analyze] top 30 最终残留(真缺口,只配手工定向补):")
|
|
310
|
-
for w, n in unk.most_common(30):
|
|
311
|
-
print(" %4d %s" % (n, w))
|
|
312
|
-
return 0
|
|
313
|
-
|
|
314
|
-
|
|
315
|
-
# 生效条件:无必需形参,mode = sys.argv[1] if len(sys.argv) > 1 else "analyze"(仅按参数个数回落,sys.argv[1] 为空串时 mode 即空串、不回落默认);mode=="download" 返回 download()、"build" 返回 build()、"analyze" 返回 analyze(),其余取值打印模块 doc 并返回 2;
|
|
316
|
-
def main():
|
|
317
|
-
mode = sys.argv[1] if len(sys.argv) > 1 else "analyze"
|
|
318
|
-
if mode == "download":
|
|
319
|
-
return download()
|
|
320
|
-
if mode == "build":
|
|
321
|
-
return build()
|
|
322
|
-
if mode == "analyze":
|
|
323
|
-
return analyze()
|
|
324
|
-
print(__doc__)
|
|
325
|
-
return 2
|
|
326
|
-
|
|
327
|
-
|
|
328
|
-
if __name__ == "__main__":
|
|
329
|
-
raise SystemExit(main())
|
|
1
|
+
#!/usr/bin/env python3
|
|
2
|
+
# -*- coding: utf-8 -*-
|
|
3
|
+
"""build_cedict_en_zh.py · 词级 en→zh 反查表构建器(CC-CEDICT 词级,补字级反查缺口)
|
|
4
|
+
|
|
5
|
+
背景(2026-09-14 裁定路径):u2c 归因臂实证「语义路机制+doc 侧上界 hit@10=99.2%」,
|
|
6
|
+
瓶颈 100% 在 query 侧 en→zh 归一覆盖(u2=23.8 vs u2c=99.2)。字级 char_atoms_clean
|
|
7
|
+
反查对剩余 OOV 词次覆盖仅 ~15%(expand_en_zh analyze 实证),且字级产物与 doc 侧
|
|
8
|
+
整词原子形态不齐(music→单字 vs 摘要「音乐」整词原子)。本脚本从 CC-CEDICT 词级
|
|
9
|
+
词典反查英文词→中文词,产出 md_cg/lexicon/cedict_en_zh.json(独立数据文件)——
|
|
10
|
+
许可 CC-BY-SA 4.0,故**不内联**进 MIT 的 en_normalizer.EN_ZH,独立文件+署名。
|
|
11
|
+
|
|
12
|
+
清理规则(与 expand_en_zh.py 同纪律,机械可审计,不做语义发明):
|
|
13
|
+
· 释义列剥括号注((Taiwan pr. ...) 等)→ 剥 "to /a /an " 前缀 → 按非字母拆词
|
|
14
|
+
· 纯字母 fullmatch [a-z]+;min_len>=3(2 字母缩写域碰撞)
|
|
15
|
+
· STOPWORDS 排除;与手工 EN_ZH 重复 → 手工优先(build 时写入 excluded)
|
|
16
|
+
· 同一英文词反查到多个中文词 → 冲突跳过并计数(宁缺勿滥)
|
|
17
|
+
|
|
18
|
+
用法:
|
|
19
|
+
python md_cg/lexicon/build_cedict_en_zh.py download # 拉 CEDICT 原始 gz(gitignored)
|
|
20
|
+
python md_cg/lexicon/build_cedict_en_zh.py build # 反查 → cedict_en_zh.json
|
|
21
|
+
python md_cg/lexicon/build_cedict_en_zh.py analyze # 500 题 OOV 覆盖上界取证
|
|
22
|
+
|
|
23
|
+
产物许可:本仓 cedict_en_zh.json 为 CC-CEDICT 派生数据,依 CC-BY-SA 4.0 署名:
|
|
24
|
+
CC-CEDICT (https://www.mdbg.net/chinese/dictionary, CC BY-SA 4.0)
|
|
25
|
+
"""
|
|
26
|
+
import collections
|
|
27
|
+
import gzip
|
|
28
|
+
import io
|
|
29
|
+
import json
|
|
30
|
+
import os
|
|
31
|
+
import re
|
|
32
|
+
import sys
|
|
33
|
+
import time
|
|
34
|
+
import urllib.request
|
|
35
|
+
|
|
36
|
+
HERE = os.path.dirname(os.path.dirname(os.path.dirname(os.path.abspath(__file__))))
|
|
37
|
+
for _p in (HERE, os.path.join(HERE, "md_cg")):
|
|
38
|
+
if _p not in sys.path:
|
|
39
|
+
sys.path.insert(0, _p)
|
|
40
|
+
|
|
41
|
+
from md_cg.semantic.en_normalizer import EN_ZH, STOPWORDS # noqa: E402
|
|
42
|
+
|
|
43
|
+
RAW_DIR = os.path.join(HERE, "data", "external", "cedict")
|
|
44
|
+
RAW_GZ = os.path.join(RAW_DIR, "cedict_1_0_ts_utf-8_mdbg.txt.gz")
|
|
45
|
+
RAW_TXT = os.path.join(RAW_DIR, "cedict.txt")
|
|
46
|
+
OUT_JSON = os.path.join(HERE, "md_cg", "lexicon", "cedict_en_zh.json")
|
|
47
|
+
QUESTIONS = os.path.join(HERE, "data", "external", "locomo_zh",
|
|
48
|
+
"raw_questions.jsonl")
|
|
49
|
+
CEDICT_URL = "https://www.mdbg.net/chinese/export/cedict/cedict_1_0_ts_utf-8_mdbg.txt.gz"
|
|
50
|
+
LINE_RE = re.compile(r"^(\S+)\s+(\S+)\s+\[[^\]]+\]\s+/(.+)/\s*$")
|
|
51
|
+
|
|
52
|
+
|
|
53
|
+
# 生效条件:无必需形参,被调用即创建模块常量 RAW_DIR、按 CEDICT_URL 发请求(UA 头 + timeout=120),把响应体写入 RAW_GZ,再以 gzip 解压并按 errors="replace" 解码写入 RAW_TXT,最后打印字节数与行数并返回 0;
|
|
54
|
+
def download():
|
|
55
|
+
os.makedirs(RAW_DIR, exist_ok=True)
|
|
56
|
+
req = urllib.request.Request(
|
|
57
|
+
CEDICT_URL, headers={"User-Agent": "Mozilla/5.0 (dsh-memory lexicon builder)"})
|
|
58
|
+
with urllib.request.urlopen(req, timeout=120) as resp:
|
|
59
|
+
blob = resp.read()
|
|
60
|
+
with io.open(RAW_GZ, "wb") as f:
|
|
61
|
+
f.write(blob)
|
|
62
|
+
with gzip.open(RAW_GZ, "rb") as f:
|
|
63
|
+
raw = f.read()
|
|
64
|
+
with io.open(RAW_TXT, "w", encoding="utf-8", newline="\n") as f:
|
|
65
|
+
f.write(raw.decode("utf-8", errors="replace"))
|
|
66
|
+
print("[download] %d bytes → %s(%d 行)"
|
|
67
|
+
% (len(blob), RAW_TXT, raw.count(b"\n")))
|
|
68
|
+
return 0
|
|
69
|
+
|
|
70
|
+
|
|
71
|
+
# 生效条件:无必需形参,迭代时逐行读模块常量 RAW_TXT,仅当 strip 后非空、不以 "#" 开头且 LINE_RE.match 命中时产出 (第 2 组, 第 3 组),其余行跳过(生成器,无产出即为空);
|
|
72
|
+
def iter_entries():
|
|
73
|
+
"""CEDICT 行 → (简体, [英文释义段])。注释/空行跳过。"""
|
|
74
|
+
with io.open(RAW_TXT, encoding="utf-8") as f:
|
|
75
|
+
for line in f:
|
|
76
|
+
line = line.strip()
|
|
77
|
+
if not line or line.startswith("#"):
|
|
78
|
+
continue
|
|
79
|
+
m = LINE_RE.match(line)
|
|
80
|
+
if not m:
|
|
81
|
+
continue
|
|
82
|
+
yield m.group(2), m.group(3)
|
|
83
|
+
|
|
84
|
+
|
|
85
|
+
# 生效条件:min_len 取默认 3(调用方可传入覆盖,传入 0 则 len(sub)<min_len 恒不成立、不再做长度过滤),遍历 iter_entries() 的释义按 / 分段、剥 (…) 注、按 ;, 切子段并 strip+lower+去 to/a/an 前缀,子段须 fullmatch [a-z]+、不在 STOPWORDS、长度 ≥ min_len 才计入 rev[en];末尾按 zh 集大小 1 写入 cand[en]、>1 写入 conflicts[en],返回 (cand, conflicts, stat);
|
|
86
|
+
def reverse_map(min_len=3):
|
|
87
|
+
"""词级反查 → (候选 {en: zh}, 冲突 {en: [zh...]}, 统计 dict)。
|
|
88
|
+
|
|
89
|
+
条目级子段反查:释义按 / 段 → 括号注剥离 → 按 ;, 切子段 → 子段清洗后
|
|
90
|
+
**恰为单个英文词**才收("music album" 等复合短语被纯字母 fullmatch 滤除,
|
|
91
|
+
不再以复合词条身份污染反查——首轮实证 4.4% 覆盖的根因)。
|
|
92
|
+
"""
|
|
93
|
+
rev = collections.defaultdict(set)
|
|
94
|
+
stat = {"entries": 0, "glosses": 0, "bracket_stripped": 0,
|
|
95
|
+
"prefix_stripped": 0, "stopword": 0, "too_short": 0,
|
|
96
|
+
"phrase_skipped": 0}
|
|
97
|
+
for zh, gloss in iter_entries():
|
|
98
|
+
stat["entries"] += 1
|
|
99
|
+
for seg in gloss.split("/"):
|
|
100
|
+
seg = re.sub(r"\([^)]*\)", "", seg) # 剥括号注
|
|
101
|
+
if seg != gloss:
|
|
102
|
+
stat["bracket_stripped"] += 1
|
|
103
|
+
for sub in re.split(r"[;,]", seg): # 子段
|
|
104
|
+
sub = sub.strip().lower()
|
|
105
|
+
sub = re.sub(r"^(to|a|an) ", "", sub)
|
|
106
|
+
if sub != sub.strip().lower():
|
|
107
|
+
stat["prefix_stripped"] += 1
|
|
108
|
+
if not re.fullmatch(r"[a-z]+", sub):
|
|
109
|
+
stat["phrase_skipped"] += 1
|
|
110
|
+
continue
|
|
111
|
+
if sub in STOPWORDS:
|
|
112
|
+
stat["stopword"] += 1
|
|
113
|
+
continue
|
|
114
|
+
if len(sub) < min_len:
|
|
115
|
+
stat["too_short"] += 1
|
|
116
|
+
continue
|
|
117
|
+
stat["glosses"] += 1
|
|
118
|
+
rev[sub].add(zh)
|
|
119
|
+
cand, conflicts = {}, {}
|
|
120
|
+
for en, zhs in rev.items():
|
|
121
|
+
if len(zhs) == 1:
|
|
122
|
+
cand[en] = next(iter(zhs))
|
|
123
|
+
else:
|
|
124
|
+
conflicts[en] = sorted(zhs)
|
|
125
|
+
return cand, conflicts, stat
|
|
126
|
+
|
|
127
|
+
|
|
128
|
+
# 生效条件:无必需形参,逐行读模块引用 b6.CORPUS567 并跳过空白行,每行 json.loads 后取 (c.get("zh") or "") 与 (c.get("zh_fields") or {}) 中所有 str 值拼接成一条,最终以换行连成整串返回(无有效行时返回空串);
|
|
129
|
+
def _corpus_text():
|
|
130
|
+
"""领域语料全文(zh 正文+五槽摘要)——冲突集频次消歧用。
|
|
131
|
+
|
|
132
|
+
消歧本质=doc 侧自监督:query 词要匹配的对象就是 doc 侧原子,
|
|
133
|
+
「公园」在语料高频、「园囿」零出现——频次直接裁决,与匹配目标自洽。
|
|
134
|
+
"""
|
|
135
|
+
from md_cg import bench6_common as b6
|
|
136
|
+
buf = []
|
|
137
|
+
with io.open(b6.CORPUS567, encoding="utf-8") as f:
|
|
138
|
+
for line in f:
|
|
139
|
+
if not line.strip():
|
|
140
|
+
continue
|
|
141
|
+
c = json.loads(line)
|
|
142
|
+
parts = [c.get("zh") or ""]
|
|
143
|
+
for v in (c.get("zh_fields") or {}).values():
|
|
144
|
+
if isinstance(v, str):
|
|
145
|
+
parts.append(v)
|
|
146
|
+
buf.append("".join(parts))
|
|
147
|
+
return "\n".join(buf)
|
|
148
|
+
|
|
149
|
+
|
|
150
|
+
# 生效条件:无必需形参,逐行读模块引用 b6.CORPUS567 并跳过空白行;摘要取 (c.get("zh_fields") or {}).get("summary") 且 str(...).strip() 后为空时回落 c.get("zh"),非空则 semantic_atoms 切分后空格连接入 sums;正文取 c.get("zh").strip() 非空则同样切分入 bodys;返回 ("\n".join(sums), "\n".join(bodys))(两级均可能为空串);
|
|
151
|
+
def _atoms_texts():
|
|
152
|
+
"""doc 侧同构消歧空间(2026-09-14 消歧口径升级)。
|
|
153
|
+
|
|
154
|
+
取证:tattoo 冲突集(刺字/刺花/刺青/文身/纹…)整词形在语料 count 全零
|
|
155
|
+
→ 旧口径整词丢弃;而真实用词「纹身」在摘要 fm.semantic 落盘形态是
|
|
156
|
+
切分碎片「纹 身」——消歧 count 的字符串空间与匹配面形态从未对齐,
|
|
157
|
+
11257 个英文词(高频多义词重灾区)因此被整词丢弃。
|
|
158
|
+
|
|
159
|
+
返回 (摘要原子串, 正文原子串):候选词经 semantic_atoms 切分后以
|
|
160
|
+
「原子 空格 原子」形态计数——与检索打分面(pair_hits 的 doc 侧输入)
|
|
161
|
+
完全同构。摘要优先(fm.semantic 是语义路唯一 doc 侧),正文兜底
|
|
162
|
+
(词法路匹配面)。
|
|
163
|
+
"""
|
|
164
|
+
from md_cg import bench6_common as b6
|
|
165
|
+
from md_cg.semantic.canonical import semantic_atoms
|
|
166
|
+
sums, bodys = [], []
|
|
167
|
+
with io.open(b6.CORPUS567, encoding="utf-8") as f:
|
|
168
|
+
for line in f:
|
|
169
|
+
if not line.strip():
|
|
170
|
+
continue
|
|
171
|
+
c = json.loads(line)
|
|
172
|
+
s = str((c.get("zh_fields") or {}).get("summary") or "").strip()
|
|
173
|
+
if not s:
|
|
174
|
+
s = str(c.get("zh") or "").strip()
|
|
175
|
+
if s:
|
|
176
|
+
sums.append(" ".join(semantic_atoms(s)))
|
|
177
|
+
body = str(c.get("zh") or "").strip()
|
|
178
|
+
if body:
|
|
179
|
+
bodys.append(" ".join(semantic_atoms(body)))
|
|
180
|
+
return "\n".join(sums), "\n".join(bodys)
|
|
181
|
+
|
|
182
|
+
|
|
183
|
+
# 生效条件:给定冲突英文词 en、候选中文集合 zhs、文本对 texts=(摘要原子串, 正文原子串),仅对 2 ≤ len(z) ≤ 4 且按 sorted(zhs) 顺序的候选,依次用摘要 frag 计数、摘要全零时改用正文 frag 计数、前两级全零时改用单原子碎片计数求和(级别 0/1/2 依次),任一非零即入 scored;scored 为空返回 (None, -1),否则按 (-计数, 级别, 长度, 字典序) 排序返回 scored[0] 的中文词与级别;
|
|
184
|
+
def _disambiguate(en, zhs, texts):
|
|
185
|
+
"""单英文词冲突集三级消歧:摘要碎片串 → 正文碎片串 → 碎片字级和。
|
|
186
|
+
|
|
187
|
+
返回 (胜出中文词, 级别) 或 (None, -1)(全零丢弃,宁缺勿滥——不发明词形)。
|
|
188
|
+
切分形态计数与 doc 侧匹配面同构(纹身→「纹 身」对「纹 身」count);
|
|
189
|
+
字级兜底只解决「词条整词与语料词形微差」(文身 vs 纹身 异形词——
|
|
190
|
+
「文」「身」碎片分别可数)。候选恒限定词典集合内,不做语义发明。
|
|
191
|
+
"""
|
|
192
|
+
from md_cg.semantic.canonical import semantic_atoms
|
|
193
|
+
sums, bodys = texts
|
|
194
|
+
scored = []
|
|
195
|
+
for z in sorted(zhs):
|
|
196
|
+
if not 2 <= len(z) <= 4:
|
|
197
|
+
continue
|
|
198
|
+
frag = " ".join(semantic_atoms(z))
|
|
199
|
+
n = sums.count(frag)
|
|
200
|
+
if n > 0:
|
|
201
|
+
scored.append((n, 0, len(z), z))
|
|
202
|
+
if not scored:
|
|
203
|
+
for z in sorted(zhs):
|
|
204
|
+
if not 2 <= len(z) <= 4:
|
|
205
|
+
continue
|
|
206
|
+
frag = " ".join(semantic_atoms(z))
|
|
207
|
+
n = bodys.count(frag)
|
|
208
|
+
if n > 0:
|
|
209
|
+
scored.append((n, 1, len(z), z))
|
|
210
|
+
if not scored:
|
|
211
|
+
for z in sorted(zhs):
|
|
212
|
+
if not 2 <= len(z) <= 4:
|
|
213
|
+
continue
|
|
214
|
+
atoms = semantic_atoms(z)
|
|
215
|
+
n = sum(sums.count(" ".join(atoms[i:i + 1])) for i in range(len(atoms)))
|
|
216
|
+
if n > 0: # 字级兜底门槛试验(>=4)实测 u2 逐位一致:字级回收词
|
|
217
|
+
# 为开放域词,locomo 题面零出现,无噪声代价,保留全覆盖
|
|
218
|
+
scored.append((n, 2, len(z), z))
|
|
219
|
+
if not scored:
|
|
220
|
+
return None, -1
|
|
221
|
+
scored.sort(key=lambda t: (-t[0], t[1], t[2], t[3]))
|
|
222
|
+
return scored[0][3], scored[0][1]
|
|
223
|
+
|
|
224
|
+
|
|
225
|
+
# 生效条件:min_len 取默认 3、domain 取默认 True(两者均可由调用方传入覆盖,domain 传假值则跳过消歧分支);先 reverse_map(min_len) 取 cand/conf/stat,当 domain 为真且 conf 非空时以 _atoms_texts() 对每个冲突词调 _disambiguate 并计 disambiguated/body/char/dropped,命中则写回 cand 并 conf.pop(en)、未命中仅计 dropped;随后无条件把 set(cand) & set(EN_ZH) 的键从 cand 移除(手工表优先),再写出 OUT_JSON 并返回 0;
|
|
226
|
+
def build(min_len=3, domain=True):
|
|
227
|
+
cand, conf, stat = reverse_map(min_len)
|
|
228
|
+
stat["disambiguated"] = 0
|
|
229
|
+
stat["disambiguated_body"] = 0
|
|
230
|
+
stat["disambiguated_char"] = 0
|
|
231
|
+
stat["disambiguated_dropped"] = 0
|
|
232
|
+
if domain and conf:
|
|
233
|
+
# 冲突消歧(2026-09-14 口径升级):doc 侧同构三级裁决
|
|
234
|
+
# (摘要碎片串→正文碎片串→碎片字级和)——候选词按 semantic_atoms
|
|
235
|
+
# 切分形态计数,与 fm.semantic 匹配面完全同构;旧口径整词形 count
|
|
236
|
+
# 与摘要落盘形态(纹 身)错位,高频多义词(accept/describe/tattoo)
|
|
237
|
+
# 重灾区 11257 词被整词丢弃。词级候选 len 2-4——单字频次虚高排除;
|
|
238
|
+
# 全零丢弃(宁缺勿滥,不发明词形)。
|
|
239
|
+
texts = _atoms_texts()
|
|
240
|
+
for en in sorted(conf):
|
|
241
|
+
z, lv = _disambiguate(en, conf[en], texts)
|
|
242
|
+
if z:
|
|
243
|
+
cand[en] = z
|
|
244
|
+
stat["disambiguated"] += 1
|
|
245
|
+
if lv == 1:
|
|
246
|
+
stat["disambiguated_body"] += 1
|
|
247
|
+
elif lv == 2:
|
|
248
|
+
stat["disambiguated_char"] += 1
|
|
249
|
+
conf.pop(en)
|
|
250
|
+
else:
|
|
251
|
+
stat["disambiguated_dropped"] += 1
|
|
252
|
+
overlap = sorted(set(cand) & set(EN_ZH))
|
|
253
|
+
for w in overlap:
|
|
254
|
+
cand.pop(w) # 手工表优先
|
|
255
|
+
out = {
|
|
256
|
+
"meta": {
|
|
257
|
+
"name": "cedict_en_zh",
|
|
258
|
+
"created_at": time.strftime("%Y-%m-%dT%H:%M:%S"),
|
|
259
|
+
"source": "CC-CEDICT (https://www.mdbg.net/chinese/dictionary)",
|
|
260
|
+
"license": "CC BY-SA 4.0(派生数据,独立文件署名,不入 MIT 内联表)",
|
|
261
|
+
"min_len": min_len,
|
|
262
|
+
"rules": "剥括号注/to-a-an 前缀;条目级子段(单词条释义才收);"
|
|
263
|
+
"纯字母;STOPWORDS 排除;冲突集 doc 语料频次消歧"
|
|
264
|
+
"(三级同构:摘要碎片串→正文碎片串→碎片字级和,"
|
|
265
|
+
"候选 2-4 字);手工 EN_ZH 优先",
|
|
266
|
+
"domain_disambiguation": (
|
|
267
|
+
"locomo corpus567 摘要/正文 semantic_atoms 原子串同构计数裁决"
|
|
268
|
+
"(与 fm.semantic 匹配面形态一致),评测特化产物"
|
|
269
|
+
if domain else "无(纯唯一映射)"),
|
|
270
|
+
"stats": stat,
|
|
271
|
+
"n_map": len(cand), "n_conflict": len(conf),
|
|
272
|
+
"n_handmade_overlap": len(overlap),
|
|
273
|
+
},
|
|
274
|
+
"map": dict(sorted(cand.items())),
|
|
275
|
+
}
|
|
276
|
+
with io.open(OUT_JSON, "w", encoding="utf-8", newline="\n") as f:
|
|
277
|
+
json.dump(out, f, ensure_ascii=False, indent=1, sort_keys=True)
|
|
278
|
+
print("[build] 词级映射 %d 键(消歧 %d / 冲突跳过 %d / 手工重叠让位 %d)→ %s"
|
|
279
|
+
% (len(cand), stat["disambiguated"], len(conf), len(overlap), OUT_JSON))
|
|
280
|
+
print("[build] 统计: %s" % json.dumps(stat, ensure_ascii=False))
|
|
281
|
+
return 0
|
|
282
|
+
|
|
283
|
+
|
|
284
|
+
# 生效条件:无必需形参,两次逐行读模块常量 QUESTIONS 并跳过空白行:第一次对 str(q.get("question") or "") 调 normalize_en_query,把 detail 中 action=="unknown_keep" 的 str(d.get("orig") or "").lower() 逐个计入 Counter;第二次累加各问句 normalize_en_query 返回的第 0 项长度得 total_tokens;打印去重词数/词次/原子序列长度与 top 30 后返回 0(无有效行时计数为零仍返回 0);
|
|
285
|
+
def analyze():
|
|
286
|
+
"""集成后 normalize 的最终残留取证(en_normalizer 已加载 cedict_en_zh.json,
|
|
287
|
+
此处 unknown_keep 即全链路翻译后的真 OOV)。"""
|
|
288
|
+
from md_cg.semantic.en_normalizer import normalize_en_query
|
|
289
|
+
unk = collections.Counter()
|
|
290
|
+
with io.open(QUESTIONS, encoding="utf-8") as f:
|
|
291
|
+
for line in f:
|
|
292
|
+
if not line.strip():
|
|
293
|
+
continue
|
|
294
|
+
q = json.loads(line)
|
|
295
|
+
terms, detail = normalize_en_query(str(q.get("question") or ""))
|
|
296
|
+
for d in detail:
|
|
297
|
+
if d.get("action") == "unknown_keep":
|
|
298
|
+
unk[str(d.get("orig") or "").lower()] += 1
|
|
299
|
+
total_tokens = 0
|
|
300
|
+
kept_tokens = 0
|
|
301
|
+
with io.open(QUESTIONS, encoding="utf-8") as f:
|
|
302
|
+
for line in f:
|
|
303
|
+
if not line.strip():
|
|
304
|
+
continue
|
|
305
|
+
q = json.loads(line)
|
|
306
|
+
total_tokens += len(normalize_en_query(str(q.get("question") or ""))[0])
|
|
307
|
+
print("[analyze] 集成后最终 OOV:去重 %d 词 / %d 词次(残留原子序列长度 %d)"
|
|
308
|
+
% (len(unk), sum(unk.values()), total_tokens))
|
|
309
|
+
print("\n[analyze] top 30 最终残留(真缺口,只配手工定向补):")
|
|
310
|
+
for w, n in unk.most_common(30):
|
|
311
|
+
print(" %4d %s" % (n, w))
|
|
312
|
+
return 0
|
|
313
|
+
|
|
314
|
+
|
|
315
|
+
# 生效条件:无必需形参,mode = sys.argv[1] if len(sys.argv) > 1 else "analyze"(仅按参数个数回落,sys.argv[1] 为空串时 mode 即空串、不回落默认);mode=="download" 返回 download()、"build" 返回 build()、"analyze" 返回 analyze(),其余取值打印模块 doc 并返回 2;
|
|
316
|
+
def main():
|
|
317
|
+
mode = sys.argv[1] if len(sys.argv) > 1 else "analyze"
|
|
318
|
+
if mode == "download":
|
|
319
|
+
return download()
|
|
320
|
+
if mode == "build":
|
|
321
|
+
return build()
|
|
322
|
+
if mode == "analyze":
|
|
323
|
+
return analyze()
|
|
324
|
+
print(__doc__)
|
|
325
|
+
return 2
|
|
326
|
+
|
|
327
|
+
|
|
328
|
+
if __name__ == "__main__":
|
|
329
|
+
raise SystemExit(main())
|