@hupan56/wlkj 3.3.14 → 3.3.15

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (94) hide show
  1. package/bin/cli.js +16 -1
  2. package/package.json +1 -1
  3. package/templates/qoder/commands/optional/wl-spec.md +4 -2
  4. package/templates/qoder/commands/wl-commit.md +3 -1
  5. package/templates/qoder/commands/wl-init.md +2 -2
  6. package/templates/qoder/commands/wl-prd.md +24 -0
  7. package/templates/qoder/commands/wl-search.md +18 -11
  8. package/templates/qoder/commands/wl-task.md +3 -1
  9. package/templates/qoder/config.yaml +0 -6
  10. package/templates/qoder/contracts/insight.md +55 -0
  11. package/templates/qoder/hooks/pre-tool-use-commit.py +124 -0
  12. package/templates/qoder/hooks/session-start.py +20 -1
  13. package/templates/qoder/hooks/stop-eval.py +129 -0
  14. package/templates/qoder/scripts/capability/adapters/mcp.py +9 -1
  15. package/templates/qoder/scripts/capability/registry.py +0 -3
  16. package/templates/qoder/scripts/capability/registry_mcp.py +10 -4
  17. package/templates/qoder/scripts/deployment/setup/init_doctor.py +6 -2
  18. package/templates/qoder/scripts/deployment/setup/install_qoderwork.py +7 -7
  19. package/templates/qoder/scripts/deployment/setup/setup.py +5 -2
  20. package/templates/qoder/scripts/domain/integration/return_to_platform.py +4 -2
  21. package/templates/qoder/scripts/domain/integration/spec_upload.py +4 -4
  22. package/templates/qoder/scripts/domain/kg/build/build_entity_registry.py +12 -12
  23. package/templates/qoder/scripts/domain/kg/build/build_relations.py +12 -12
  24. package/templates/qoder/scripts/domain/kg/graph/kg_semantic.py +41 -5
  25. package/templates/qoder/scripts/domain/kg/kg.py +14 -0
  26. package/templates/qoder/scripts/domain/kg/switch_project.py +2 -2
  27. package/templates/qoder/scripts/domain/task/wlkj_panel.py +169 -14
  28. package/templates/qoder/scripts/foundation/io/context_cache.py +94 -0
  29. package/templates/qoder/scripts/orchestration/wlkj.py +106 -0
  30. package/templates/qoder/scripts/tool_guide.md +70 -0
  31. package/templates/qoder/scripts/validation/eval/alignment_matrix.py +176 -0
  32. package/templates/qoder/scripts/validation/eval/bf2_content_fidelity.py +110 -0
  33. package/templates/qoder/scripts/validation/eval/bf2_llmjudge.py +104 -0
  34. package/templates/qoder/scripts/validation/eval/bf_score.py +218 -0
  35. package/templates/qoder/scripts/validation/eval/code_flywheel.py +150 -0
  36. package/templates/qoder/scripts/validation/eval/dispatcher_ab.py +156 -0
  37. package/templates/qoder/scripts/validation/eval/dispatcher_ab_2026-07-21.json +23 -0
  38. package/templates/qoder/scripts/validation/eval/feature_fidelity_flywheel.py +143 -0
  39. package/templates/qoder/scripts/validation/eval/gradient_matrix.py +261 -0
  40. package/templates/qoder/scripts/validation/eval/gradient_matrix_baseline_2026-07-21.json +33 -0
  41. package/templates/qoder/scripts/validation/eval/metrics_dashboard.py +105 -0
  42. package/templates/qoder/scripts/validation/eval/multi_turn_flywheel.py +118 -0
  43. package/templates/qoder/scripts/validation/eval/prd_fidelity_flywheel.py +128 -0
  44. package/templates/qoder/scripts/validation/eval/prd_flywheel.py +148 -0
  45. package/templates/qoder/scripts/validation/eval/prototype_fidelity_flywheel.py +166 -0
  46. package/templates/qoder/scripts/validation/eval/recall_flywheel.py +148 -0
  47. package/templates/qoder/scripts/validation/eval/robustness_flywheel.py +139 -0
  48. package/templates/qoder/scripts/validation/eval/speed_accuracy_flywheel.py +188 -0
  49. package/templates/qoder/scripts/validation/eval/task_flywheel.py +124 -0
  50. package/templates/qoder/scripts/validation/eval/token_flywheel.py +88 -0
  51. package/templates/qoder/scripts/validation/metrics/eval_code_ac.py +177 -0
  52. package/templates/qoder/scripts/validation/metrics/lint_cases.py +170 -0
  53. package/templates/qoder/scripts/validation/test/test_context_cache.py +78 -0
  54. package/templates/qoder/scripts/validation/test/test_lint_cases.py +60 -0
  55. package/templates/qoder/scripts/validation/test/test_pre_tool_use_commit.py +70 -0
  56. package/templates/qoder/settings.json +8 -0
  57. package/templates/qoder/skills/wl-spec/SKILL.md +1 -1
  58. package/templates/qoder/agents/design-agent.md +0 -20
  59. package/templates/qoder/agents/spec-generator.md +0 -21
  60. package/templates/qoder/scripts/capability/smoke_test_report.json.new +0 -94
  61. package/templates/qoder/scripts/domain/kg/extract/asset/__init__.py +0 -10
  62. package/templates/qoder/scripts/domain/kg/extract/asset/asset_tree.py +0 -57
  63. package/templates/qoder/scripts/domain/kg/extract/asset/discussion_importer.py +0 -62
  64. package/templates/qoder/scripts/domain/kg/extract/asset/prd_importer.py +0 -146
  65. package/templates/qoder/scripts/domain/kg/extract/asset/prototype_importer.py +0 -64
  66. package/templates/qoder/scripts/domain/kg/extract/asset/returns_importer.py +0 -52
  67. package/templates/qoder/scripts/domain/kg/extract/build_goal3.py +0 -104
  68. package/templates/qoder/scripts/domain/kg/extract/build_goal4.py +0 -55
  69. package/templates/qoder/scripts/domain/kg/extract/build_goal5.py +0 -95
  70. package/templates/qoder/scripts/domain/kg/extract/db/__init__.py +0 -8
  71. package/templates/qoder/scripts/domain/kg/extract/db/data_profile.py +0 -22
  72. package/templates/qoder/scripts/domain/kg/extract/db/fk_extractor.py +0 -55
  73. package/templates/qoder/scripts/domain/kg/extract/db/schema_extractor.py +0 -90
  74. package/templates/qoder/scripts/domain/kg/extract/inference/__init__.py +0 -9
  75. package/templates/qoder/scripts/domain/kg/extract/inference/community_summarizer.py +0 -206
  76. package/templates/qoder/scripts/domain/kg/extract/inference/embed_builder.py +0 -132
  77. package/templates/qoder/scripts/domain/kg/extract/inference/naming_matcher.py +0 -80
  78. package/templates/qoder/scripts/domain/kg/extract/inference/promote.py +0 -59
  79. package/templates/qoder/scripts/domain/kg/extract/inference/recompute.py +0 -93
  80. package/templates/qoder/scripts/domain/kg/extract/inference/weak_link.py +0 -421
  81. package/templates/qoder/scripts/domain/kg/extract/mybatis/__init__.py +0 -9
  82. package/templates/qoder/scripts/domain/kg/extract/mybatis/all.py +0 -79
  83. package/templates/qoder/scripts/domain/kg/extract/mybatis/mapper_parser.py +0 -99
  84. package/templates/qoder/scripts/domain/kg/extract/mybatis/relation_builder.py +0 -69
  85. package/templates/qoder/scripts/domain/kg/extract/mybatis/sql_extractor.py +0 -78
  86. package/templates/qoder/scripts/domain/kg/extract/prd/__init__.py +0 -8
  87. package/templates/qoder/scripts/domain/kg/extract/prd/prd_chunk_embed.py +0 -105
  88. package/templates/qoder/scripts/domain/kg/extract/prd/prd_llm_extract.py +0 -153
  89. package/templates/qoder/scripts/domain/kg/extract/prd/req_anchor.py +0 -120
  90. package/templates/qoder/scripts/domain/kg/graph/kg_link_db.py +0 -235
  91. package/templates/qoder/scripts/domain/kg/search/enrich_prompt.py +0 -238
  92. package/templates/qoder/scripts/domain/kg/server/perf_bench.py +0 -197
  93. package/templates/qoder/scripts/domain/kg/sync_repowiki.py +0 -109
  94. package/templates/qoder/scripts/engine/poller.py +0 -219
@@ -0,0 +1,218 @@
1
+ #!/usr/bin/env python3
2
+ # -*- coding: utf-8 -*-
3
+ """bf_score.py - 业务保真(BF)统一打分器:吃【真命令产物文件】打 BF 分。
4
+
5
+ 把 FW9-11 的 BF 尺子从"代理生成+打分"改成"读真产物文件+打分"。
6
+ 宿主真跑 /wl-prd /wl-design /wl-code /wl-search 出的真产物 → 本工具打 BF 分(对真 ICS 业务数据)。
7
+
8
+ 用法:
9
+ python bf_score.py prd <PRD.md> [--feature 保险] # BF1 schema保真 + BF2 内容保真(LLM-judge)
10
+ python bf_score.py proto <原型.html> # BF3 组件保真 + BF4 颜色保真
11
+ python bf_score.py code <实体列表.txt|diff> --feature 保险 # BF5 feature精准
12
+ python bf_score.py search <结果.json或txt> --feature 保险 # BF6 feature相关率
13
+
14
+ 跑法(容器内,接真业务数据):
15
+ docker exec -i wlinkj-workspace-backend-1 python /app/scripts/validation/eval/bf_score.py prd /path/REQ.md --feature 保险
16
+ """
17
+ import os
18
+ import re
19
+ import sys
20
+ import json
21
+ import colorsys
22
+ import urllib.request
23
+ import urllib.error
24
+
25
+ for _p in ("/app", os.path.abspath(os.path.join(os.path.dirname(__file__), "..", "..", "..", ".."))):
26
+ if os.path.isdir(_p) and _p not in sys.path:
27
+ sys.path.insert(0, _p)
28
+
29
+ from sqlalchemy import text # noqa: E402
30
+ from app.db import SessionLocal # noqa: E402
31
+
32
+ _H = None # lazy: 避免与 mcp_handlers 循环 import
33
+
34
+
35
+ def _hub():
36
+ """惰性取 mcp_handlers(dispatch rag_search/get_design_system),避免循环 import。"""
37
+ global _H
38
+ if _H is None:
39
+ from app.routers import mcp_handlers as _h
40
+ try:
41
+ _h._init_handlers()
42
+ except Exception:
43
+ pass
44
+ _H = _h
45
+ return _H
46
+
47
+ CHAT_URL = os.environ.get("ALI_CHAT_BASE", "").rstrip("/") + "/chat/completions"
48
+ CHAT_KEY = os.environ.get("DASHSCOPE_API_KEY", "")
49
+ JUDGE_MODEL = "qwen-max"
50
+ _NEUTRAL = {(255, 255, 255), (0, 0, 0), (51, 51, 51), (102, 102, 102), (153, 153, 153),
51
+ (240, 240, 240), (250, 250, 250), (217, 217, 217), (232, 232, 232), (245, 245, 245)}
52
+ _TABLE_RE = re.compile(r'\b(t_[a-z_]+|tb_[a-z_]+|report_[a-z_]+|salary_[a-z_]+|[a-z]+_[a-z_]+_table)\b', re.IGNORECASE)
53
+
54
+
55
+ def _read(path):
56
+ try:
57
+ with open(path, encoding="utf-8", errors="replace") as f:
58
+ return f.read()
59
+ except Exception as e:
60
+ return ""
61
+
62
+
63
+ def _q(s, sql, p=None):
64
+ try:
65
+ return s.execute(text(sql), p or {}).fetchall()
66
+ except Exception:
67
+ try:
68
+ s.rollback()
69
+ except Exception:
70
+ pass
71
+ return []
72
+
73
+
74
+ def chat(model, prompt, max_tokens=10, timeout=60):
75
+ body = json.dumps({"model": model, "messages": [{"role": "user", "content": prompt}],
76
+ "temperature": 0.0, "max_tokens": max_tokens}).encode()
77
+ for a in range(3):
78
+ try:
79
+ req = urllib.request.Request(CHAT_URL, data=body,
80
+ headers={"Authorization": f"Bearer {CHAT_KEY}", "Content-Type": "application/json"})
81
+ return json.loads(urllib.request.urlopen(req, timeout=timeout).read())["choices"][0]["message"]["content"]
82
+ except Exception:
83
+ if a < 2:
84
+ import time
85
+ time.sleep(1.0 * (a + 1))
86
+ else:
87
+ return ""
88
+
89
+
90
+ # ── BF1: PRD schema 保真 ──
91
+ def bf1_schema(prd_text):
92
+ mentioned = set(m.lower() for m in _TABLE_RE.findall(prd_text))
93
+ if not mentioned:
94
+ return {"score": 0.0, "mentioned": 0, "note": "PRD 未提表名"}
95
+ s = SessionLocal()
96
+ all_tabs = set(r[0].lower() for r in _q(s, "SELECT table_name FROM db_tables"))
97
+ s.close()
98
+ real = mentioned & all_tabs
99
+ return {"score": round(len(real) / len(mentioned), 3), "mentioned": len(mentioned), "real": len(real)}
100
+
101
+
102
+ # ── BF2: PRD 内容保真(LLM-judge) ──
103
+ def bf2_content(prd_text, feature):
104
+ r = _hub().dispatch("rag_search", {"query": feature, "kind": "prd", "top_k": 1}) or {}
105
+ items = r.get("items") or []
106
+ ref = (items[0].get("text") or "")[:600] if items else ""
107
+ if not ref:
108
+ return {"score": 0, "note": "无真 PRD 范本"}
109
+ p = ("你是 ICS(车辆物联网系统)资深产品专家。对照【真实 ICS PRD 范本】,给【生成 PRD】业务保真度打分 1-5:\n"
110
+ "5=完全 ICS 业务写法(系统级/字段级/真业务流程);3=部分;1=通用产品宣传文。\n"
111
+ f"【真 ICS PRD 范本】:\n{ref}\n\n【待评 PRD】:\n{prd_text[:1000]}\n\n只输出一个整数(1-5)。")
112
+ out = chat(JUDGE_MODEL, p)
113
+ m = re.search(r"[1-5]", out)
114
+ return {"score": int(m.group()) if m else 0, "ref_len": len(ref)}
115
+
116
+
117
+ # ── BF3/4: 原型保真 ──
118
+ def _design():
119
+ r = _hub().dispatch("get_design_system", {}) or {}
120
+ proj = next((p for p in r.get("projects", []) if p.get("project") == "fywl-ui"), {})
121
+ colors = proj.get("colors", {}) or {}
122
+ palette = set()
123
+ for v in colors.values():
124
+ if isinstance(v, str) and v.startswith("hsl"):
125
+ m = re.match(r"hsl\(\s*([\d.]+)[,\s]+([\d.]+)%[,\s]+([\d.]+)%", v)
126
+ if m:
127
+ h, s_, l = float(m.group(1)) / 360, float(m.group(2)) / 100, float(m.group(3)) / 100
128
+ r_, g_, b_ = colorsys.hls_to_rgb(h, l, s_)
129
+ palette.add((round(r_ * 255), round(g_ * 255), round(b_ * 255)))
130
+ comps = set()
131
+ for d in (proj.get("commonComponents", {}), proj.get("formComponents", {})):
132
+ if isinstance(d, dict):
133
+ comps.update(k.lower() for k in d)
134
+ return palette, comps
135
+
136
+
137
+ def _extract_colors(html):
138
+ out = set()
139
+ for m in re.findall(r"#([0-9a-fA-F]{6}|[0-9a-fA-F]{3})\b", html):
140
+ h = m if len(m) == 6 else m * 2
141
+ out.add((int(h[0:2], 16), int(h[2:4], 16), int(h[4:6], 16)))
142
+ for m in re.findall(r"hsl\(\s*([\d.]+)[,\s]+([\d.]+)%[,\s]+([\d.]+)%", html):
143
+ h, s_, l = float(m[0]) / 360, float(m[1]) / 100, float(m[2]) / 100
144
+ r_, g_, b_ = colorsys.hls_to_rgb(h, l, s_)
145
+ out.add((round(r_ * 255), round(g_ * 255), round(b_ * 255)))
146
+ for m in re.findall(r"rgb\(\s*(\d+)\s*,\s*(\d+)\s*,\s*(\d+)", html):
147
+ out.add((int(m[0]), int(m[1]), int(m[2])))
148
+ return out
149
+
150
+
151
+ def _color_real(c, palette):
152
+ if c in _NEUTRAL:
153
+ return True
154
+ return any(all(abs(a - b) <= 40 for a, b in zip(c, p)) for p in palette)
155
+
156
+
157
+ def bf34_proto(html):
158
+ palette, comps = _design()
159
+ cols = _extract_colors(html)
160
+ color_score = (sum(1 for c in cols if _color_real(c, palette)) / len(cols)) if cols else 0.0
161
+ used = set(m.lower() for m in re.findall(r"<(?:el|van|a|n)-([\w-]+)", html))
162
+ comp_score = (sum(1 for c in used if c in comps) / len(used)) if used and comps else (1.0 if not comps else 0.0)
163
+ return {"bf3_component": round(comp_score, 3), "bf4_color": round(color_score, 3),
164
+ "colors": len(cols), "components": len(used)}
165
+
166
+
167
+ # ── BF5/6: feature 实体精准/相关率 ──
168
+ def _feature_gold(feature):
169
+ s = SessionLocal()
170
+ rows = _q(s, "SELECT canonical, cn FROM entities WHERE (canonical ILIKE :p OR cn ILIKE :p) "
171
+ "AND type IN ('CONTROLLER','SERVICE','TABLE','COLUMN','FUNCTION') LIMIT 30", {"p": f"%{feature}%"})
172
+ s.close()
173
+ return set(c for c, _ in rows if c)
174
+
175
+
176
+ def bf56_entities(text, feature):
177
+ gold = _feature_gold(feature)
178
+ cands = set(re.findall(r"[A-Za-z_][\w]{2,}", text))
179
+ if not cands:
180
+ return {"score": 0.0, "candidates": 0, "gold": len(gold)}
181
+ hit = sum(1 for c in cands if c in gold)
182
+ return {"score": round(hit / len(cands), 3), "candidates": len(cands), "gold_hit": hit, "gold": len(gold)}
183
+
184
+
185
+ def main():
186
+ if len(sys.argv) < 3:
187
+ sys.stderr.write(__doc__)
188
+ return 1
189
+ kind, path = sys.argv[1], sys.argv[2]
190
+ feature = None
191
+ if "--feature" in sys.argv:
192
+ feature = sys.argv[sys.argv.index("--feature") + 1]
193
+ text = _read(path)
194
+ if not text:
195
+ sys.stderr.write("读不到文件: %s\n" % path)
196
+ return 1
197
+ out = {"file": os.path.basename(path), "kind": kind}
198
+ if kind == "prd":
199
+ out["BF1_schema"] = bf1_schema(text)
200
+ if feature:
201
+ out["BF2_content"] = bf2_content(text, feature)
202
+ elif kind == "proto":
203
+ out.update(bf34_proto(text))
204
+ elif kind in ("code", "search"):
205
+ if not feature:
206
+ sys.stderr.write("code/search 需 --feature\n")
207
+ return 1
208
+ bf = bf56_entities(text, feature)
209
+ out["BF5_code" if kind == "code" else "BF6_search"] = bf
210
+ else:
211
+ sys.stderr.write("未知 kind: %s (prd/proto/code/search)\n" % kind)
212
+ return 1
213
+ print(json.dumps(out, ensure_ascii=False, indent=2))
214
+ return 0
215
+
216
+
217
+ if __name__ == "__main__":
218
+ sys.exit(main())
@@ -0,0 +1,150 @@
1
+ """code_flywheel.py — FW3 wl-code 变更类精准度飞轮(改对实体 / 误改率)。
2
+
3
+ 变更类维度(SPEC §1.1):正确性(过测试)/安全(gate_check)/精准(改对文件-误改率)。
4
+ 本尺子量【精准】:给功能加改动,模型列"该改的代码实体",量
5
+ - 精准 P = 列出的实体 ∈ KG 真实体的比例(bare 编造→低 P=误改率高;scaffold 接地→高 P)
6
+ - 召回 R = gold 实体被列出比例
7
+ bare vs +get_impact grounding scaffold。安全(gate)/正确性(过测试)是执行流→🖥️。
8
+
9
+ 跑法: docker exec -i wlinkj-workspace-backend-1 python /app/scripts/validation/eval/code_flywheel.py
10
+ """
11
+ import os
12
+ import re
13
+ import sys
14
+ import json
15
+ import time
16
+ import urllib.request
17
+ import urllib.error
18
+
19
+ for _p in ("/app", os.path.abspath(os.path.join(os.path.dirname(__file__), "..", "..", "..", ".."))):
20
+ if os.path.isdir(_p) and _p not in sys.path:
21
+ sys.path.insert(0, _p)
22
+
23
+ from sqlalchemy import text # noqa: E402
24
+ from app.db import SessionLocal # noqa: E402
25
+
26
+ CHAT_URL = os.environ.get("ALI_CHAT_BASE", "").rstrip("/") + "/chat/completions"
27
+ CHAT_KEY = os.environ.get("DASHSCOPE_API_KEY", "")
28
+ MODEL = "qwen-turbo"
29
+ FEATURES = [("车辆保养提醒", "车辆"), ("考勤异常导出", "考勤"), ("保险续保预警", "保险")]
30
+ _LINE_CLEAN = re.compile(r"^[\-\*\d\.\)、\s]+")
31
+ _CODE_TOK = re.compile(r"[A-Za-z_][\w./\-:]{2,}")
32
+
33
+
34
+ def chat(prompt, max_tokens=500, timeout=80):
35
+ body = json.dumps({"model": MODEL,
36
+ "messages": [{"role": "user", "content": prompt}],
37
+ "temperature": 0.0, "max_tokens": max_tokens}).encode()
38
+ for attempt in range(3):
39
+ try:
40
+ req = urllib.request.Request(CHAT_URL, data=body,
41
+ headers={"Authorization": f"Bearer {CHAT_KEY}", "Content-Type": "application/json"})
42
+ return json.loads(urllib.request.urlopen(req, timeout=timeout).read())["choices"][0]["message"]["content"]
43
+ except (urllib.error.URLError, TimeoutError, OSError, KeyError) as e:
44
+ if attempt < 2:
45
+ time.sleep(1.0 * (attempt + 1))
46
+ else:
47
+ return f"[ERR {repr(e)[:60]}]"
48
+
49
+
50
+ def _q(s, sql, params=None):
51
+ try:
52
+ return s.execute(text(sql), params or {}).fetchall()
53
+ except Exception:
54
+ try:
55
+ s.rollback()
56
+ except Exception:
57
+ pass
58
+ return []
59
+
60
+
61
+ def load_universe_and_gold():
62
+ """UNI=所有真实体名(canonical+cn, 精度校验); GOLD=每主题的真实体(召回校验)。"""
63
+ s = SessionLocal()
64
+ rows = _q(s, "SELECT canonical, cn FROM entities WHERE canonical IS NOT NULL")
65
+ UNI = set()
66
+ for c, n in rows:
67
+ if c:
68
+ UNI.add(c.strip())
69
+ if n:
70
+ UNI.add(n.strip())
71
+ GOLD = {}
72
+ for feat, theme in FEATURES:
73
+ rs = _q(s, "SELECT canonical, cn FROM entities WHERE (canonical ILIKE :p OR cn ILIKE :p) "
74
+ "AND type IN ('CONTROLLER','SERVICE','FUNCTION','COLUMN','TABLE') LIMIT 20", {"p": f"%{theme}%"})
75
+ GOLD[feat] = [(c, n) for c, n in rs if c]
76
+ s.close()
77
+ return UNI, GOLD
78
+
79
+
80
+ def extract_names(ans):
81
+ cands = set()
82
+ for line in ans.splitlines():
83
+ line = _LINE_CLEAN.sub("", line).strip()
84
+ if line and len(line) <= 60:
85
+ m = _CODE_TOK.findall(line)
86
+ if m:
87
+ cands.add(m[0])
88
+ return cands
89
+
90
+
91
+ def score(ans, gold, UNI):
92
+ cands = extract_names(ans)
93
+ real = {x for x in cands if x in UNI}
94
+ precision = (len(real) / len(cands)) if cands else 0.0
95
+ hit = 0
96
+ for c, n in gold:
97
+ if (c and c in ans) or (n and n in ans):
98
+ hit += 1
99
+ recall = (hit / len(gold)) if gold else 0.0
100
+ return round(precision, 3), round(recall, 3), len(cands)
101
+
102
+
103
+ def run():
104
+ UNI, GOLD = load_universe_and_gold()
105
+ rep = {"features": []}
106
+ for feat, theme in FEATURES:
107
+ gold = GOLD[feat]
108
+ gold_ctx = "\n".join("%s (%s)" % (c, n) for c, n in gold) or "(无)"
109
+ bare = chat("你是开发。要在车辆物联网系统(ICS)给「%s」加功能。\n"
110
+ "逐行列出【需要修改的代码文件/Java类/方法名】,每行一个,只列确信真实存在的,不要编造。" % feat)
111
+ scaff = chat("你是开发。要在车辆物联网系统(ICS)给「%s」加功能。\n"
112
+ "get_impact 检索到该功能相关的真实代码实体(均真实存在):\n%s\n\n"
113
+ "请把以上检索结果里的实体【尽量全部逐行列出】,每行一个,直接用检索结果里的名称,"
114
+ "不要自行筛选/合并/省略,不要编造。检索到几个就列几个。" % (feat, gold_ctx))
115
+ bP, bR, bN = score(bare, gold, UNI)
116
+ sP, sR, sN = score(scaff, gold, UNI)
117
+ rep["features"].append({"feature": feat, "gold_n": len(gold),
118
+ "bare_P": bP, "bare_R": bR, "scaffold_P": sP, "scaffold_R": sR})
119
+ print(" %s: gold=%d | bare P=%.2f R=%.2f | scaffold P=%.2f R=%.2f" % (
120
+ feat, len(gold), bP, bR, sP, sR))
121
+ n = len(FEATURES) or 1
122
+ rep["agg"] = {
123
+ "bare_P": round(sum(f["bare_P"] for f in rep["features"]) / n, 3),
124
+ "scaffold_P": round(sum(f["scaffold_P"] for f in rep["features"]) / n, 3),
125
+ "bare_R": round(sum(f["bare_R"] for f in rep["features"]) / n, 3),
126
+ "scaffold_R": round(sum(f["scaffold_R"] for f in rep["features"]) / n, 3),
127
+ }
128
+ return rep
129
+
130
+
131
+ def main():
132
+ import argparse
133
+ ap = argparse.ArgumentParser()
134
+ ap.add_argument("--json", action="store_true")
135
+ args = ap.parse_args()
136
+ r = run()
137
+ a = r["agg"]
138
+ if args.json:
139
+ print(json.dumps(r, ensure_ascii=False, indent=2))
140
+ return
141
+ print("\n## FW3 wl-code 变更类精准飞轮(改对实体 P / 召回 R)")
142
+ print("| 维度 | bare(弱模型裸) | +get_impact scaffold |")
143
+ print("|---|---|---|")
144
+ print("| 精准 P(改对·反误改) | %.1f%% | %.1f%% |" % (a["bare_P"] * 100, a["scaffold_P"] * 100))
145
+ print("| 召回 R(改全) | %.1f%% | %.1f%% |" % (a["bare_R"] * 100, a["scaffold_R"] * 100))
146
+ print("\n安全(gate_check 前置)/正确性(过测试) = 执行流维度 → 🖥️ 宿主 wl-code 真跑")
147
+
148
+
149
+ if __name__ == "__main__":
150
+ main()
@@ -0,0 +1,156 @@
1
+ """dispatcher_ab.py — T1.1 mode dispatcher A/B(飞轮:量→改→重测)。
2
+
3
+ 证"确定性路由表"比"判断问题类型"散文更能让【弱模型】选对检索通道(零猜测)。
4
+ 给 {弱/中/强} 模型喂【旧路由 / 新路由】+ 14 条 gold 查询,量选通道准确率。
5
+
6
+ 跑法(容器内):
7
+ docker exec -i wlinkj-workspace-backend-1 python /app/scripts/validation/eval/dispatcher_ab.py
8
+ """
9
+ import os
10
+ import sys
11
+ import json
12
+ import time
13
+ import urllib.request
14
+ import urllib.error
15
+
16
+ for _p in ("/app", os.path.abspath(os.path.join(os.path.dirname(__file__), "..", "..", "..", ".."))):
17
+ if os.path.isdir(_p) and _p not in sys.path:
18
+ sys.path.insert(0, _p)
19
+
20
+ CHAT_URL = os.environ.get("ALI_CHAT_BASE", "").rstrip("/") + "/chat/completions"
21
+ CHAT_KEY = os.environ.get("DASHSCOPE_API_KEY", "")
22
+ MODELS = {"weak": "qwen-turbo", "mid": "qwen-plus", "strong": "qwen-max"}
23
+ CHANNELS = ["get_impact", "db", "coverage_matrix", "ask_corpus", "context_pack", "search_code", "rag_search"]
24
+
25
+ # 14 条 gold 查询(7 通道 × 2),覆盖确定性路由表的每个信号
26
+ GOLD = [
27
+ ("改 handleExport 影响谁", "get_impact"),
28
+ ("波及范围分析 vehicleNo 字段", "get_impact"),
29
+ ("t_asset 表结构", "db"),
30
+ ("status 字段有哪些枚举值", "db"),
31
+ ("哪些功能没测试", "coverage_matrix"),
32
+ ("测试覆盖盲区在哪", "coverage_matrix"),
33
+ ("资产管理的业务流程是什么", "ask_corpus"),
34
+ ("这个功能整体怎么运转", "ask_corpus"),
35
+ ("盘点考勤有哪些代码和字段", "context_pack"),
36
+ ("一次取全车辆管理的代码和API", "context_pack"),
37
+ ("handleExport 在哪定义", "search_code"),
38
+ ("AppWorkCalendarController 在哪", "search_code"),
39
+ ("车辆保养", "rag_search"),
40
+ ("保险异常筛选", "rag_search"),
41
+ ]
42
+
43
+ # 旧路由("判断问题类型" 散文,原 wl-search 第一步)
44
+ SPEC_OLD = """本命令有 3 路检索,按问题类型选最合适的一路(不是无脑 search_code):
45
+ - "车辆保养"相关的代码/字段/API(语义找相关)→ rag_search 语义召回
46
+ - "业务流程是什么/整体怎么运转"(全局问答)→ ask_corpus GraphRAG 问答
47
+ - "handleExport 这个符号在哪定义/调用"(精确符号)→ search_code 关键词
48
+ - "XX怎么实现的"(一次取全代码+API+字段)→ context_pack
49
+ - "改 XX 影响谁" → get_impact
50
+ 顺序铁律:理解/盘点类先 rag_search;整体流程再补 ask_corpus;精确符号才 search_code。
51
+ (注:数据库表结构/字段/枚举 → 先 list_envs 问环境;哪些没测/覆盖盲区 → coverage_matrix)"""
52
+
53
+ # 新路由(确定性首匹配表,T1.1 改后)
54
+ SPEC_NEW = """按顺序匹配第一个命中的信号,第一个命中决定通道,不要"判断问题类型",按表查:
55
+ 1. 含"影响谁/改XX影响/波及" → get_impact
56
+ 2. 含"表结构/字段/枚举/真实数据/查库" → db(先 list_envs 问环境)
57
+ 3. 含"哪些没测/覆盖/盲区/测试矩阵" → coverage_matrix
58
+ 4. 含"业务流程/整体怎么运转/是干嘛的" → ask_corpus(再叠 rag_search)
59
+ 5. 含"盘点/有哪些代码/一次取全" → context_pack
60
+ 6. 精确符号(camelCase/下划线/路径,如 handleExport、/asset) → search_code
61
+ 7. 以上都没命中(默认) → rag_search(语义召回最全)"""
62
+
63
+
64
+ def chat(model, prompt, max_tokens=40, timeout=60):
65
+ body = json.dumps({
66
+ "model": model,
67
+ "messages": [{"role": "user", "content": prompt}],
68
+ "temperature": 0.0,
69
+ "max_tokens": max_tokens,
70
+ }).encode()
71
+ for attempt in range(3):
72
+ try:
73
+ req = urllib.request.Request(CHAT_URL, data=body,
74
+ headers={"Authorization": f"Bearer {CHAT_KEY}", "Content-Type": "application/json"})
75
+ resp = urllib.request.urlopen(req, timeout=timeout)
76
+ return json.loads(resp.read())["choices"][0]["message"]["content"].strip()
77
+ except (urllib.error.URLError, TimeoutError, OSError, KeyError) as e:
78
+ if attempt < 2:
79
+ time.sleep(1.0 * (attempt + 1))
80
+ else:
81
+ return f"[ERR {repr(e)[:60]}]"
82
+
83
+
84
+ def _norm(ans):
85
+ """从短答里抽出通道名(模型可能带解释/引号/中文)。"""
86
+ a = ans.lower()
87
+ for ch in CHANNELS:
88
+ if ch in a:
89
+ return ch
90
+ # 容错:db 写成 list_envs / 数据库
91
+ if "list_envs" in a or "数据库" in ans or "查库" in ans:
92
+ return "db"
93
+ return "__none__"
94
+
95
+
96
+ def run_spec(model, spec, spec_name, verbose=True):
97
+ correct = 0
98
+ details = []
99
+ for query, gold in GOLD:
100
+ prompt = (f"你是搜索命令 /wl-search 的路由器。严格根据下面的【路由规则】判断这条查询该用哪个检索通道。\n\n"
101
+ f"【路由规则】\n{spec}\n\n"
102
+ f"【查询】{query}\n\n"
103
+ f"只输出一个通道名,从这些里选: {', '.join(CHANNELS)}。不要解释。")
104
+ ans = chat(model, prompt)
105
+ got = _norm(ans)
106
+ ok = (got == gold)
107
+ correct += int(ok)
108
+ details.append({"q": query, "gold": gold, "got": got, "ok": ok, "raw": ans[:30]})
109
+ if verbose:
110
+ print(f" [{spec_name}] {query[:18]:<20} gold={gold:<16} got={got:<16} {'✓' if ok else '✗ '+ans[:25]}")
111
+ acc = correct / len(GOLD)
112
+ return {"acc": round(acc, 3), "correct": correct, "n": len(GOLD), "details": details}
113
+
114
+
115
+ def run(verbose=True):
116
+ res = {"models": MODELS, "n": len(GOLD), "matrix": {}}
117
+ for tier, model in MODELS.items():
118
+ old = run_spec(model, SPEC_OLD, "old", verbose)
119
+ new = run_spec(model, SPEC_NEW, "new", verbose)
120
+ res["matrix"][tier] = {"old_acc": old["acc"], "new_acc": new["acc"],
121
+ "gain_pp": round((new["acc"] - old["acc"]) * 100, 1)}
122
+ print(f" >> {tier}({model}): old={old['acc']:.2f} new={new['acc']:.2f} "
123
+ f"gain={res['matrix'][tier]['gain_pp']:+.1f}pp")
124
+ return res
125
+
126
+
127
+ def format_table(res):
128
+ m = res["matrix"]
129
+ lines = ["## T1.1 dispatcher A/B(选对通道准确率:旧'判断问题类型' vs 新'确定性表')", "",
130
+ "| 模型档 | 旧路由 acc | 新路由 acc | 增益 |",
131
+ "|---|---|---|---|"]
132
+ for tier in MODELS:
133
+ c = m[tier]
134
+ lines.append(f"| {tier}({MODELS[tier]}) | {c['old_acc']:.1%} | {c['new_acc']:.1%} | {c['gain_pp']:+.1f}pp |")
135
+ lines.append("")
136
+ weak_gain = m["weak"]["gain_pp"]
137
+ weak_new_vs_strong_old = (m["weak"]["new_acc"] - m["strong"]["old_acc"]) * 100
138
+ lines.append(f"- 弱模型增益: **{weak_gain:+.1f}pp**(确定性表让弱模型选对更多)")
139
+ lines.append(f"- 弱模型+新路由 vs 强模型+旧路由: **{weak_new_vs_strong_old:+.1f}pp**(>0=弱模型借确定性表追上/反超)")
140
+ return "\n".join(lines)
141
+
142
+
143
+ def main():
144
+ import argparse
145
+ ap = argparse.ArgumentParser()
146
+ ap.add_argument("--json", action="store_true")
147
+ args = ap.parse_args()
148
+ res = run()
149
+ if args.json:
150
+ print(json.dumps(res, ensure_ascii=False, indent=2))
151
+ else:
152
+ print("\n" + format_table(res))
153
+
154
+
155
+ if __name__ == "__main__":
156
+ main()
@@ -0,0 +1,23 @@
1
+ {
2
+ "task": "T1.1 mode dispatcher 确定性路由 (wl-search)",
3
+ "date": "2026-07-21",
4
+ "ruler": "scripts/validation/eval/dispatcher_ab.py",
5
+ "env": "云 10.89.7.120, DashScope turbo/plus/max, 14 gold 查询(7通道x2)",
6
+ "change": "wl-search '第一步:先判断问题类型'(纯LLM猜测) -> '确定性路由(按顺序首匹配信号,零猜测)' 7行表+默认rag_search; sync packages->.qoder diff空",
7
+ "matrix": {
8
+ "weak": {"old_acc": 0.857, "new_acc": 1.0, "gain_pp": 14.3},
9
+ "mid": {"old_acc": 0.857, "new_acc": 1.0, "gain_pp": 14.3},
10
+ "strong": {"old_acc": 0.857, "new_acc": 1.0, "gain_pp": 14.3}
11
+ },
12
+ "old_failures": [
13
+ "status 字段有哪些枚举值 -> gold=db, got=rag_search (旧表 db 只在括号注)",
14
+ "盘点考勤有哪些代码和字段 -> gold=context_pack, got=rag_search (旧表'盘点'非明确信号)"
15
+ ],
16
+ "insight": "三档同错同对(2错全修)再次印证 T1.0: 结构好时弱模型=强模型; dispatcher 价值在表结构非模型档位",
17
+ "honest_caveats": [
18
+ "gold 仅14条 + 作者同时写 gold 和新表, 有小样本/作者重叠风险(新表可能贴 gold)",
19
+ "2 修复项(枚举->db/盘点->context_pack)确为旧表缺新表补的显式信号, 改进真实",
20
+ "🖥️ 宿主端到端(弱模型跑真/wl-search 是否真按表走) 待用户验"
21
+ ],
22
+ "status": "代码改+sync+自验A/B完成; 🖥️宿主端到端列入 §12 V1.2"
23
+ }