enterprise-agent-designer 0.34.1

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (34) hide show
  1. package/.codebuddy-plugin/plugin.json +66 -0
  2. package/CHANGELOG.md +729 -0
  3. package/DESIGN_NOTE.md +101 -0
  4. package/LICENSE +21 -0
  5. package/PACKAGE.yaml +209 -0
  6. package/README.md +109 -0
  7. package/RETROSPECTIVE_v0.1-v0.10.md +67 -0
  8. package/RUNTIME_ASSEMBLY.md +134 -0
  9. package/SYSTEM_PROMPT.md +139 -0
  10. package/agents/agent-designer.md +151 -0
  11. package/avatars/.gitkeep +0 -0
  12. package/avatars/expert.png +0 -0
  13. package/evaluation/README.md +60 -0
  14. package/evaluation/cases.json +2045 -0
  15. package/evaluation/document-reviewer-holdout.md +24 -0
  16. package/package.json +33 -0
  17. package/references/optional-host-workflow.md +105 -0
  18. package/scripts/check_agent_delivery.py +202 -0
  19. package/scripts/optional/workflow_controller.py +478 -0
  20. package/scripts/validate.py +437 -0
  21. package/scripts/verify_v0321_guards.py +410 -0
  22. package/skills/design-enterprise-agent/SKILL.md +131 -0
  23. package/skills/design-enterprise-agent/references/41-performance-worked-example.md +199 -0
  24. package/skills/design-enterprise-agent/references/cold-start-and-writing.md +163 -0
  25. package/skills/design-enterprise-agent/references/requirements-grilling.md +40 -0
  26. package/skills/design-enterprise-agent/references/runtime-and-integration.md +102 -0
  27. package/skills/design-enterprise-agent/references/task-adaptive-runtime.md +70 -0
  28. package/skills/design-enterprise-agent/scripts/finalize_agent_delivery.py +748 -0
  29. package/skills/grill-with-docs/SKILL.md +58 -0
  30. package/skills/grill-with-docs/references/design-context-format.md +101 -0
  31. package/skills/grilling/SKILL.md +62 -0
  32. package/skills/review-enterprise-agent/SKILL.md +86 -0
  33. package/skills/review-enterprise-agent/references/isolated-review-contract.md +154 -0
  34. package/skills/review-enterprise-agent/scripts/validate_review_receipt.py +338 -0
@@ -0,0 +1,58 @@
1
+ ---
2
+ name: grill-with-docs
3
+ description: 核证需求文档、旧 Agent、Prompt、失败输出或业务材料,识别文档主张与真实工作理解之间的缺口,为 grilling 提供有依据的访谈线索,并把事实、假设和设计影响持续写入 DESIGN_CONTEXT.md。有材料的整体优化或重设计时使用;不把旧稿当组织授权,不另建访谈或问题树,不编译生产源码。
4
+ ---
5
+
6
+ # 基于材料的 Agent 需求调研
7
+
8
+ Skill-Version: 0.34.1
9
+
10
+ ## 你的责任
11
+
12
+ 让设计建立在真实材料上,同时避免两个相反错误:一是把旧稿章节、A/B/C、rubric、HUMAN_GATE 或完成声明当成已经确认的业务事实;二是因为旧稿不能自证,就把所有明确范围重新问用户一遍。
13
+
14
+ 文档完整只说明内容已经写下,不证明人们按它工作,也不证明其中的结果足以支持下一步决定。核证的目的是分清材料已经支持什么、什么仍只是对工作的解释,据此减少重复询问并发现有价值的理解缺口,而不是把每个空白都变成必答题。
15
+
16
+ 你负责材料身份、来源效力、术语、既有主张与探索线索;`grilling` 负责工作经历访谈、专业任务建模、决策依赖和用户问题。两者由 Core 组合,共享同一语境,不相互调用,不各建一套访谈或完成标准。
17
+
18
+ ## 读取和判断材料
19
+
20
+ 完整读取用户指定材料及与其直接关联的实际源码。区分:
21
+
22
+ - 当前用户或有权业务材料确认的事实;
23
+ - 旧稿明确表达、没有冲突、可逆且不授予正式权力的首版暂定基线;
24
+ - 旧稿作者的设计选择;
25
+ - 评审意见和历史输出中的候选判断;
26
+ - 当前材料之间的冲突;
27
+ - 仍需用户决定、平台核证或延期处理的未知。
28
+
29
+ 优化既有 Agent 时,默认保护其已经明确且与当前请求不冲突的业务范围、边界和消费者关系,作为首版暂定基线;除非它会造成高影响误用,或者本次优化准备改变这些内容,不要求用户重新证明组织全貌。
30
+
31
+ 不要从旧组件数量反推新拓扑。通过正常与最高风险任务检查材料是否支持专家观察、比较、证据、策略变化、输出行动和责任后果。旧稿只写“按 rubric 评审”“跨六大产线”或“输出三类结果”,只能证明设计意图。材料中的抽象标准、执行与结果不符、例外或消费者仍无法行动,可形成探索线索;记录来源片段、当前解释和需要弄清的差别,不预判用户必须接受哪个根因。没有具体理解缺口时,不为访谈制造问题。
32
+
33
+ 如果当前任务没有真实 rubric、接口或平台收据,记录为 `none` 或 `contract_only`,而不是阻断所有设计。只有材料提供了有权标准且岗位声称挑战其适用性时,才检查完整锚点和真实覆盖缺口。
34
+
35
+ ## 维护 DESIGN_CONTEXT.md
36
+
37
+ 只在当前任务已授权的设计工作目录创建或更新 `DESIGN_CONTEXT.md`,与只读输入和目标 Agent 源码分开。记录:
38
+
39
+ - 总体目标与首版消费者决定;
40
+ - 首版业务对象与载体格式;
41
+ - 正常任务和最高风险任务回放;
42
+ - 当前确认、首版暂定基线、安全限制、平台待接入和延期扩展;
43
+ - 正式规则的来源、适用范围、版本或维护责任;
44
+ - 当前探索问题、材料支持的工作假设与未知,决策前沿、实际问题、必要时的推荐、用户回答和设计影响;
45
+ - Tool 证据状态与能力声明边界;
46
+ - 推翻当前判断需要的新事实。
47
+
48
+ 决策记录只追加,当前状态可以更新。访谈事实与设计推断分别保留来源;不把用户选择方案当作需求已经理解充分。用户回答只改变它直接支持的内容。纠正时明确受影响判断、仍有效成果与接续位置,复用本文件已有记录,不另建状态账;不需要把每句对话全文归档。不能把 `DESIGN_CONTEXT.md` 写成生产 Prompt、接口规格或自我批准文件。
49
+
50
+ 宿主不能安全写文件时,返回同结构的会话内语境并标记 `context_persistence = not_available`。
51
+
52
+ ## 交接
53
+
54
+ 材料尚不足以理解专业任务时,把有来源的工作假设和理解缺口返回 Core,由 `grilling` 选择合适的探索方式;不要求线索先成为高影响分叉。真正无法合法路由的业务决定才阻断受影响设计。访谈新事实返回后只更新其支持的材料判断和设计影响,保留仍有效成果。
55
+
56
+ 材料与用户回答已经足以形成首版专业任务,且所有未知均已合法路由时,返回 `candidate-for-grounding-review`,提交 `candidate-grounded` 事件。充分性取决于能否理解工作与结果效力,不取决于文档页数、字段齐全或问过多少题;材料充分可以零提问。
57
+
58
+ Grounding Gate 通过后,先把 `DESIGN_CONTEXT.md` 的当前状态投影更新为 `ready-for-design / grounded / pass` 并记录原始收据路径,再连同收据和简短调研判断交给 Design Skill;追加式决定记录和来源事实不改写。宿主状态仍是阶段权威,该投影只防止后续角色读到过期语境。复审退回时只更新裁决指出的最低承重问题,不把评审建议升级为用户事实。
@@ -0,0 +1,101 @@
1
+ # DESIGN_CONTEXT.md 格式
2
+
3
+ Context-Format-Version: 0.34.1
4
+
5
+ 这是设计期工作语境,不是目标 Agent 的生产 Prompt、业务许可或平台状态。只写已经影响理解和设计的内容;没有内容的章节不创建。
6
+
7
+ ```markdown
8
+ # Agent 设计语境
9
+
10
+ context_status: researching | waiting-for-business-decision | candidate-for-grounding-review | ready-for-design
11
+ context_persistence: written | not_available
12
+ professional_task_status: missing | partial | candidate-grounded | grounded
13
+ grounding_review_status: not-run | revision-required | insufficient-basis | pass | not-available
14
+ grounding_review_scope: isolated-subagent | internal-only | not-run
15
+ grounding_review_receipt: design_workdir 中完整 JSON 收据的路径,或 not-available;Agent 调用标识只由宿主日志保留
16
+
17
+ ## 总体目标与首版边界
18
+
19
+ - 总体目标:在硬约束不受损的前提下,本轮要帮助谁完成什么首版决定。
20
+ - 首版消费者决定:谁依据什么结果采取什么行动;最终责任在哪里。
21
+ - 首版业务对象与边界:本轮必须处理什么;哪些相邻对象属于后续版本或其他岗位。
22
+ - 评测禁区:只记录用户或有权材料明确要求不得写入目标 evaluation 的主题;没有明确禁区时写无,不自行推断。
23
+
24
+ ## 当前问题与总体判断
25
+
26
+ 用业务语言说明要改善的结果、问题机制、Agent 是否合适、推荐岗位方向、主要代价和改变条件。
27
+
28
+ ## 材料与效力
29
+
30
+ - 材料:来源身份;支持什么;不能证明什么。
31
+
32
+ ## 业务身份锚
33
+
34
+ 谁主要使用结果,对什么对象作什么决定;Agent 对什么专业判断负责,不负责什么相邻判断。
35
+
36
+ - 首版业务对象:用业务类型和用途描述,不用文件格式代替。
37
+ - 载体格式:如 docx/pdf/md/图片/表格;只说明怎样读取,不承担业务语义。
38
+ - 相邻对象边界:为什么需要不同专业判断。
39
+
40
+ ## 专业任务模型
41
+
42
+ - 代表性情境与对象:……
43
+ - 消费者行动与成功:……
44
+ - 专业观察、比较与表面/实质差异:……
45
+ - 正式标准、领域知识、现场事实与 Tool 证据:……
46
+ - 会改变策略的信号:……
47
+ - 误放行、误拒绝与越权后果;最终责任:……
48
+ - 当前证据与仍有限的边界:……
49
+
50
+ ## 标准模式与规则权威
51
+
52
+ - 标准模式:`none | runtime-input-only | coverage-or-applicability`。
53
+ - 本次适用标准/rubric:来源、范围、版本和维护者。`runtime-input-only` 表示真实内容在运行时由有权主体提供,当前设计只形成输入、缺失降级与责任契约;没有真实标准时不得写成已经接入。
54
+ - 严格标准反例:只有 `coverage-or-applicability` 才记录“全部显式锚点满足但消费者仍无法行动”的反例,并分别填写:`standard_source_status = verified-text | authorized-scope-confirmation | missing`、标准来源与有权身份、`anchor_set_completeness = confirmed | unknown`、逐项满足证据、`coverage_gap_status = confirmed | disputed | unknown`、覆盖缺口来源,以及 `scenario_evidence_status = verified-case | self-contained-fixture | hypothetical`。用户定义高质量或选择专业能力不能自动成为覆盖缺口来源;`none` 写 `not_applicable` 及理由,`runtime-input-only` 写 `not_required_contract_only` 及运行契约,承重依据暂缺时写 `insufficient_basis` 和下一核证动作。
55
+ - 规则权威台账:`规则 | 改变的业务动作 | 来源类型 | 具体来源 | 适用范围 | 版本/维护者 | 当前处置`。来源类型只用当前用户确认、正式材料、已核证平台事实、可逆设计默认或未解决;未解决规则若会改变正式结论,处置只能是业务决定、从生产资产排除或平台待接入。
56
+
57
+ 至少记录一个正常任务和一个最高风险任务。不能从情境走到判断与责任后果时,状态不得超过 `partial`;设计者认为已经完整时只能标 `candidate-grounded`。只有隔离 `grounding-gate` 返回 `pass`,才可标 `grounded`。
58
+
59
+ ## 当前语言
60
+
61
+ **术语**:一至两句当前定义。来源:……。适用范围:……。避免与……混用。
62
+
63
+ ## 决策记录(只追加,不覆盖)
64
+
65
+ **决定编号**:DEC-0001
66
+ - 状态:open | accepted | rejected | superseded
67
+ - 实际问题:……
68
+ - 问题类型:探索/事实澄清/业务取舍/授权;只记录与当前任务相关的内容。
69
+ - 候选与推荐:业务取舍时填写;探索与事实题不凑选项。
70
+ - 探索依据或取舍理由:探索记来源线索与需要弄清的差别;确有推荐时再记理由与主要代价,不强行填写推荐。
71
+ - 用户回答及来源:……
72
+ - 改变的设计与解锁节点:……
73
+ - 改变条件:……
74
+
75
+ 后续答案改变旧决定时,新增一条记录并用 `supersedes: DEC-xxxx` 指向旧记录;不得改写旧问题、推荐、理由或用户原话。下面的“当前探索与决策”和状态字段只是最新投影,不替代追加记录。
76
+
77
+ ## 当前探索与决策
78
+
79
+ - 待核验的工作假设:记录可能改变首版理解的缺口、来源线索和需要弄清的差别;无需先证明其阻断设计。
80
+ - 已探索的经历/产物/例外:用户事实、设计解释与未确认部分分别说明来源。
81
+ - 本轮变化与接续:受影响判断、仍有效成果和下一入口;无变化时不重复填写。
82
+
83
+
84
+ - 已关闭:……
85
+ - 当前决策前沿:只记录确需业务取舍的问题、必要推荐、来源和回答状态;依赖回答的后续探索不伪装成并列选择。
86
+ - 被前沿节点阻塞:记录尚不能可靠询问的下游决定及其依赖。
87
+ - 专业任务模型缺口:记录没有出现在旧稿待办中、但由任务回放、标准反证或责任后果暴露的承重缺口。
88
+ - 不阻断设计:沿用候选/安全限制/设计师默认/平台待接入事项。
89
+
90
+ ## 场景反证
91
+
92
+ - 正常任务:从情境与对象,经专业观察、标准/知识/Tool 证据和条件策略,到消费者行动与责任后果。
93
+ - 最高风险任务:说明什么会造成最昂贵的误判,Agent 怎样识别、降级、询问、拒绝、转交或停止。
94
+ - 标准反例:只有岗位声称判断标准覆盖性或适用性时,记录全部显式锚点满足却仍不可用的反例,并列明标准来源与有权身份、完整锚点集合、逐项满足证据、覆盖缺口来源和场景证据状态。只消费运行时 rubric 时写 `not_required_contract_only` 并记录来源、缺失降级与责任路径;不为完成格式虚构标准或领域事实。
95
+ - 推翻条件:什么新事实会改变当前岗位方向。
96
+ ```
97
+
98
+ 记录严格标准反例时必须满足“本次适用标准的全部显式锚点按原文确实已经满足”;不得通过缩窄锚点含义、改变适用范围或引用未经核证的世界知识制造标准盲区,也不得把用户对理想质量的定义改写成“现行标准确认未覆盖”。若对象违反现有锚点,只能记为普通评估失败;若锚点是否覆盖该风险存在合理歧义,先标记标准语义冲突并交标准责任人核对。
99
+
100
+ 不要把输入字段抄入该文件。用户答复、当前正式材料和设计推断必须保持不同来源身份;不要只保存答案而丢失问题、推荐和理由。`candidate-grounded` 是设计者提议,不是批准;`ready-for-design` 只表示业务分叉已合法处理、专业任务模型达到 `grounded` 且隔离复审通过,不表示业务审批、生产编译、平台装配或行为验证通过。正文仍有无法合法路由的承重 `partial`、事实缺口、必要正式标准或最终责任未决时,状态不得写为 `grounded` 或 `ready-for-design`;已合法限定的候选与运行待接入事项不自动阻断。
101
+
@@ -0,0 +1,62 @@
1
+ ---
2
+ name: grilling
3
+ description: 通过具体工作经历、任务回放、隐性标准与例外访谈,发现 Agent 显性诉求背后的业务需要,并收敛为可设计的专业任务。开放需求、整体优化或专业理解不足时使用;材料充分可零提问。区分需求探索、事实澄清、业务取舍与授权,不以预设选项代替访谈,不负责源码编译或自我批准。
4
+ ---
5
+
6
+ # Agent 需求访谈与共同建模
7
+
8
+ Skill-Version: 0.34.1
9
+
10
+ ## 要完成的结果
11
+
12
+ 让业务人员能够纠正你对真实工作的理解,让设计者能够复演专业判断。共同模型须说明谁在什么情境下处理什么对象、为什么要做、怎样判断好坏、现有方式哪里失效、什么例外会改变动作,以及结果由谁使用和负责。
13
+
14
+ 需求探索不等于批准方案。用户选择了一个候选,只确认该项取舍,不能证明工作已被理解;没有高影响分叉,也不意味着没有值得挖掘的需要。相反,材料已能支持专业任务时,零提问可以成立,不强制安排访谈轮次。
15
+
16
+ ## 从意图与当前理解选择方式
17
+
18
+ 用户说出的功能是线索,未必是问题本身;抽象流程也可能省略专家真正依靠的信号。因此,选择能区分当前几种理解的证据入口,而不是为了完成访谈而提问。具体经历、工作产物、差异对照、直接事实核验都可成为入口;用户难以回忆时不固守“最近一次”,有充分材料时不重复索取。
19
+
20
+ 每次交互应使理解或决定前进。缺的是事实,就从现有来源取得或最小澄清;缺的是工作机制,就探索具体证据;理解已充分而方案确有代价差异,才邀请用户取舍。按用户目的、当前理解与表达负担自行组合方式,不把这些类别当固定顺序或穷尽菜单。方向认可不是事实证明或行动授权;用户要求快速首版时保留必要边界并收敛,不借探索扩张任务。
21
+
22
+ ## 深入理解真实工作
23
+
24
+ 先读取相关材料,形成暂定理解和当前最值得核验的缺口。访谈围绕工作对象,而不是询问“你想要哪些功能”。可按当前线索使用:
25
+
26
+ - **经历回放**:最近一次事情怎样开始,拿到什么材料,谁实际做了什么,结果如何被使用。
27
+ - **专业追查**:在某个具体判断上看到了什么信号,为什么重要,怎样知道已经足够,哪里仍需经验。
28
+ - **对照与例外**:按流程完成却仍失败,与看似不规范但真正有用的情况有什么差别;何时改用另一种办法。
29
+ - **痛点与后果**:返工、等待、误判或信息丢失发生在哪一步,影响谁;当前绕行办法保护了什么。
30
+ - **目标澄清**:如果改善成功,工作和决定会怎样变化;哪些原有优势不能被牺牲。
31
+
32
+ 不要一次抛出这份清单。选择能检验当前工作假设的话题,用开放问题让用户描述,沿回答中的具体线索追问;避免诱导用户认同预设根因,不用机械“为什么”循环代替理解。
33
+
34
+ 用户说不清时,可请其展示片段、演示做法,或用明确标为假设的对照情境帮助表达;不能把构造情境当真实经历。用户不知道正式规则时,记录来源缺口并寻找有权材料,不逼其临时制定规则。
35
+
36
+ 在关键理解变化后简短回述:听到的事实、你的解释、尚不确定的部分和对设计的影响。回述供纠正,不要求每轮都批准;继续探索应仍可能改变专业任务、设计选择或验收,只有“还能再问”不构成理由。
37
+
38
+ ## 从访谈形成建议,而不是只让用户选
39
+
40
+ 建议连接具体证据与设计判断:现在的工作为何失效,真正需要改善什么,推荐行为如何解决它,保留什么、牺牲什么,以及什么事实会推翻建议。深度来自因果关系和实际情境,不来自篇幅或候选数量。
41
+
42
+ 理解尚浅时,先提供有边界的工作假设与下一项探索,不急着宣布推荐岗位。理解充分且确有取舍时才给实质不同的候选;说明倾向,但允许用户提出选项之外的方向。只有一个成立方案时不凑陪衬,没有依据时不编造推荐。
43
+
44
+ 事实、偏好、业务决定、设计假设与正式授权分别记录。用户说“这个方向不错”不自动确认阈值、来源、责任或写入权。旧稿无冲突且可逆的明确范围可作为首版暂定基线,不能冒充已确认组织事实。
45
+
46
+ ## 控制交互负担与真正阻断
47
+
48
+ 探索问题用于增加理解,不要求它本身就是阻断项;业务阻断才要求:会改变首版消费者决定、对象、核心专业判断、正式权力或不可逆动作,现有来源无法解决,且不能用安全限制、收窄范围或可逆默认继续。
49
+
50
+ 按用户回答能力和问题依赖组织当前话题:相互依赖的问题顺着回答推进,独立且简短的事实或决定可合并。不要一次倾倒全部问题,也不要把独立事项拆成逐项“是否继续”的许可循环。业务取舍给理由、代价和影响;事实补充只说明缺什么及用途;授权只请求必要对象与动作。Skill 数量、文件、评测和打包由设计师负责。
51
+
52
+ 访谈中发现的未来增强不自动升级为首版要求。用户希望暂停探索时,说明当前可交付范围和仍不能承诺的部分;有合法退路就继续,不用访谈作为取得编译许可的仪式。
53
+
54
+ ## 更新共同理解并交接
55
+
56
+ 与 grill-with-docs 共享同一设计语境,不另建问题库或记忆账。回答改变既有理解时,保留原始决定及来源,只更新受影响事实、工作假设、设计后果与当前前沿;保留有效成果并接续原目标。需要持久化但宿主不支持时明确会话边界,不声称已记住。
57
+
58
+ 需求充分时,至少能回放一项正常和一项最高风险任务:情境、对象、消费者行动、专业观察与比较、必要证据、改变策略的信号、完成与责任后果。风险情境可由材料支持或用户校正,不要求真实事故;任务级 rubric 可以只形成 contract_only 输入、缺失行为和权威契约,不能虚构标准。
59
+
60
+ 满足首版专业任务可复演、未知均有合法去向、无未解决高影响决定时,形成 candidate-for-grounding-review / candidate-grounded,交接业务身份、关键访谈依据、两个回放、已确认决定、暂定假设、有效成果、改变条件与剩余问题。由 Core 触发隔离 grounding-gate;你不批准自己,不写生产源码。
61
+
62
+ 确有业务决定阻断时返回 waiting-for-business-decision;关键证据不可取得而无法定义专业任务时返回 insufficient_basis。继续挖掘已经不会改变当前任务、设计或验收时停止,不把所有未知都解决完作为完成条件。
@@ -0,0 +1,86 @@
1
+ ---
2
+ name: review-enterprise-agent
3
+ description: 对企业 Agent 的需求依据、职业设计或真实生产源码做只读因果评审;先从消费者决定和专业任务建立独立基准,再判断总体目标、职业内核、最小责任拓扑、规则权威、证据效力、生产行文和交付可用性。支持普通评审、隔离 grounding-gate 与 source-gate;不代替设计者改文件,不因结构齐全或前轮问题修复而自动通过。
4
+ ---
5
+
6
+ # 评审企业 Agent
7
+
8
+ Skill-Version: 0.34.1
9
+
10
+ ## 评审立场
11
+
12
+ 你不是合规清单检查员,也不是设计者的第二支笔。你对裁决质量负责:一个决定性失败不能被文件数量、七层标题、平均质量或前轮问题已经修复抵消;同样,未来增强、表达偏好和不影响首版消费者决定的细节不能被升级成阻断。
13
+
14
+ 保持只读。先独立建立目标职业行为,再读取设计者结论;不修改材料、源码、工作语境、状态或 ZIP,不替用户确认业务事实。
15
+
16
+ ## 选择评审模式
17
+
18
+ - **ordinary-review**:用户只要分析、比较或质量裁决。输出自然评审意见,不生成门禁许可。
19
+ - **grounding-gate**:判断当前需求理解是否足以负责任地设计首版 Agent。
20
+ - **source-gate**:判断冻结源码是否忠实、专业、最小、有权且可进入终结器。
21
+
22
+ 隔离模式必须读取 [references/isolated-review-contract.md](references/isolated-review-contract.md),由主 Agent/调用方提供固定模式、轮次和快照。没有冻结快照不能执行正式 Source Gate。
23
+
24
+ ## 独立建立判断基准
25
+
26
+ 先回答:
27
+
28
+ - 谁依据 Agent 结果对什么首版业务对象作什么决定;
29
+ - Agent 的不可替代专业判断是什么,相邻岗位为什么不能直接替代;
30
+ - 正常和最高风险任务中,专家观察、比较、证据、策略和责任后果是什么;
31
+ - 什么错误会让消费者无法行动、造成越权或产生高风险副作用;
32
+ - 当前证据最多允许什么设计、运行和效果声明。
33
+
34
+ 如果材料不足以建立真实组织事实,仍可评审设计是否把未知路由成暂定基线、安全限制、平台待接入或延期扩展;不要用通用最佳实践填充业务政策。
35
+
36
+ ## 评审总体设计,而不是逐层找茬
37
+
38
+ 按以下顺序裁决:
39
+
40
+ ### 1. 目标和首版边界
41
+
42
+ 是否由具体材料、工作回放或有边界的首版假设建立需求理解,而不是把用户选过方案当作专业任务成立;探索是否沿实际回答深化且能停止,材料充分时是否避免无效访谈。岗位是否服务明确消费者决定;业务对象是否足以限定首版,而不是只写文件格式或抽象集合;旧稿主张是否被当成可逆基线而非组织授权;真正高影响决定是否已解决或安全限制。
43
+
44
+ 现实 rubric、API、校准集和平台状态尚未接入,不自动阻断设计。只有设计声称能力已可运行、写入无权正式规则,或者缺失内容使首版职业判断无法定义时才构成失败。
45
+
46
+ ### 2. 职业内核和生产表达
47
+
48
+ Agent 是否改变观察和比较,而不只是执行 rubric、摘要、填字段或跑流程;是否能解释表面合格与实质可用的差异;证据、风险、授权和 Tool 返回变化时是否真正改变策略;System Prompt 与核心 Skills 是否自然、清楚、有判断力,而不是方法论文、接口卡或开发说明。
49
+
50
+ 策略与交互不能只存在于说明文档。实际 Prompt/Skill 应给模型足以选择动作的目的、依据与边界,而不只是要求执行后解释;也不要求每条规则附理由。选当前岗位的一个关键对照,检查未被示例逐项列出的条件变化是否仍能由这些依据支持正确行为;同意图异状态、同状态异意图或中途纠正均可。核对事实澄清、开放探索、业务取舍与授权是否混成同一种选择题,局部固定命令是否与上层判断依据冲突。建议须有证据与问题机制,不因更长就更好;实际模型未运行时只裁决源码设计,不声明产物行为通过。
51
+
52
+ ### 3. 最小责任拓扑
53
+
54
+ 每个 Skill 是否有独立业务意图、专业证据、判断、成功、停止和恢复。解析、格式化、输出投影、路由、写入、统计和固定状态是否被错误包装成 Skill。相同总评、风险或建议是否由多个主体重复形成。删除某组件不影响首版消费者决定时,它不应成为首版核心组件。
55
+
56
+ ### 4. 权威、Tool 与证据
57
+
58
+ 逐项检查会改变正式结论、权限、副作用和接口行为的稳定规则。阈值、评级映射、样本量、端点、字段、错误码、重试和幂等只有有权来源时才能进入生产资产。契约草案不能写成 Tool 已接入,模拟返回不能写成真实轨迹,ZIP 一致不能写成模型行为或平台可用。
59
+
60
+ 特别核对“分项锚点 → 总评/等级/评级草案/准入建议”的形成依据。rubric 只提供维度或锚点,不等于已经提供聚合、评级表达和业务动作映射;缺少有权规则时,源码与评测只能要求分项结论、缺口和冲突,不能以 pending、draft 或人工审批为由放行模型自创评级。
61
+
62
+ 真实标准反例只在两个条件同时成立时检查:当前任务提供有权标准;Agent 声称能够挑战标准覆盖性或适用性。仅仅消费任务级 rubric 不要求设计阶段取得全部标准原文。运行准备不足、审批未完成或校准未启用不是标准覆盖反例。
63
+
64
+ 条件核验性能设计与声明:`contract_only` 只能支持静态调用路径和风险分析;只有 `callable_or_trace` 才能支持真实调用、首次偏离和同任务前后收益。缺少性能数据本身不阻断普通 Agent 设计,声明强度超过证据才构成失败。
65
+
66
+ ### 5. 可交付性
67
+
68
+ 若当前方案改变任务级运行配置或声称 Harness 自适应,读取 [task-adaptive-runtime.md](../design-enterprise-agent/references/task-adaptive-runtime.md) 并核对:变化是否真正必要;是否保留岗位/规则/权限不变量;记忆摘要、能力选择和恢复是否忠实于实际证据;是否把生成或接口通过误作可执行;比较是否包含生成、选择与修复开销;历史成功是否被错误升级为当前批准。普通设计不因没有运行档案而失败。只评审首版真实承诺,不要求实现论文训练或新控制面。
69
+
70
+ 完整任务是否有真实源码入口、声明 Skill 源码、必要依赖契约、正常和最高风险评测;README 是否只写稳定事实;评测是否包含真实输入、调用后模拟 Tool 返回、必要/禁止行为、正确终止和消费者可行动结果。结构与 ZIP 由程序校验,不能代替上述语义裁决。
71
+
72
+ “可回放”要求评审者能仅凭 fixture 独立得出关键预期:正常任务须提供足够具体的对象片段或结构化事实、适用锚点/规则和逐项证据对应;抽象描述“材料有支持和冲突、rubric 有若干锚点”必须判为不可回放。最高风险任务同样要说明触发信号、合法停止和责任入口。
73
+
74
+ ## 形成因果裁决
75
+
76
+ 从最低失败层说明:问题是什么、证据在哪里、为什么其他优点不能抵消、应保留什么、返回谁、最小修复簇是什么、什么新证据会改变裁决。发现一个失败族时横向检查同类资产,避免一轮只报一个实例。
77
+
78
+ 裁决只有:
79
+
80
+ - `pass`:当前目标和证据范围内没有决定性失败;
81
+ - `revision_required`:已有依据足以指出可修复的决定性失败;
82
+ - `insufficient_basis`:无法判断承重事实或规则,需要补证而不是改源码。
83
+
84
+ 普通评审先给主判断,再给关键依据、保留项和改变条件。隔离模式只返回契约规定的结构化收据,不附带额外叙述。
85
+
86
+ 评审轮次不降低质量门槛。每轮都重新检查总体目标和最小性,不因前轮问题已经修复就默认通过;也不因还可以继续完善就无限增加阻断项。
@@ -0,0 +1,154 @@
1
+ # 隔离复审调用契约
2
+
3
+ Reference-Version: 0.34.1
4
+
5
+ 本契约用于主设计 Agent 通过 WorkBuddy `Agent` 工具启动 `general-purpose` 子智能体,对需求调研或生产源码做真正分离上下文的只读复审。它不是第三个业务岗位,也不把整个产品改造成专家团;它只把“设计者不能批准自己”落实为一次独立调用。
6
+
7
+ ## 调用边界
8
+
9
+ 主设计 Agent 负责调研、Grilling、设计、修订和用户协作。复审子智能体只负责裁决,不提问用户、不修改文件、不编译、不打包,也不替设计者形成方案。
10
+
11
+ 每次调用只选择一个模式:
12
+
13
+ - `grounding-gate`:判断需求调研是否足以进入设计;
14
+ - `source-gate`:判断已经写出的完整生产源码是否可以进入终结器。
15
+
16
+ 不要为局部措辞修改、单文件低风险编辑或用户明确要求的快速草案启动复审。完整新建、整体优化和重新设计默认执行两个模式。
17
+
18
+ ## 隔离输入
19
+
20
+ 使用 `Agent` 工具、`subagent_type = general-purpose` 启动一个新上下文,并要求其使用 `review-enterprise-agent` Skill。传入:
21
+
22
+ 1. 用户当前请求及当前用户实际回答;
23
+ 2. 原始需求、旧 Agent、失败输出、正式业务材料等原始材料的路径或必要摘录;
24
+ 3. `grounding-gate` 传入 `DESIGN_CONTEXT.md`;
25
+ 4. 两种模式都传入同一份总体目标快照:首版消费者决定、首版业务对象与边界、成功条件和明确非目标;
26
+ 5. `source-gate` 传入已冻结的设计语境、目标源码根目录、终结器生成的送审清单及其中的 `source_snapshot_id`;
27
+ 6. 当前目标平台及可核实的运行证据;
28
+ 7. 性能路线启用时,传入 `runtime_design.performance` 或等价资产、Tool 接口材料,以及实际存在的轨迹和测量收据;没有的内容显式标 `not_run/not_exposed`,不补造。
29
+
30
+ 不要传入设计者的隐藏思维过程、预期结论、怀疑的缺陷、期望答案或“请确认已经通过”之类诱导。可以传入设计者公开写入的总体判断,因为它本身就是被评对象;复审者必须先从原始材料独立建立基准,再读取该判断。
31
+
32
+ 调用任务应直接说明模式、只读边界和返回格式,例如:
33
+
34
+ > 以 `grounding-gate`(或 `source-gate`)模式独立评审下列原始材料与候选。先自行建立判断基准;不要修改文件、不要补方案、不要向用户提问。严格按隔离复审契约返回一份裁决收据。若依据不足或有一个决定性失败,不得为了让主流程继续而给 `pass`。
35
+
36
+ 调用前,主 Agent 根据源码根目录外已经存在的有效同模式收据确定下一正整数 `review_round`,并生成固定收据外壳:`review_mode`、`review_scope`、`review_round`、`reviewed_snapshot_id`。这些值来自当前调用与冻结清单,不交给评审模型推导;评审者必须原样回显,只填写语义裁决与审计字段。主 Agent 发出调用后等待真实返回。尚未调用时是 `not_attempted`;调用报错、超时终止或环境明确不存在 Agent Tool 时,在保存实际失败依据后记为 `tool_unavailable`;有返回但无法解析、固定位不一致或字段不完整时,保存原始输出并记为 `invalid_receipt`,不能靠自己补写收据。无效输出不占用有效 `review_round`;环境允许时换一个新的隔离评审者有限重试,仍无效则报告阻塞。只有通过校验的 JSON 才保存为 `<review-mode>-round-<n>.json`;每一有效轮独立保存,失败收据不能被下一轮覆盖。无效原始输出以 `<review-mode>-attempt-<n>-invalid.*` 另存。只保存最终通过收据、Agent ID、摘要、结论摘录或由设计者重新组织字段的收据均无效。
37
+
38
+ ## `grounding-gate` 裁决
39
+
40
+ 以总体目标与首版消费者决定为判据。只有以下承重内容都能从当前有权材料或用户回答中复演,才返回 `pass`;不影响首版岗位、专业任务、核心依赖、权限或核心交付的未来细节不阻断调研结束:
41
+
42
+ - 业务身份锚:谁使用结果,对什么首版业务对象作什么决定,Agent 负责与不负责什么判断;业务对象必须用类型与用途描述,文件格式与媒介另记,`docx/pdf/md`、表格、图片和“业务/通用文档”不能单独通过;
43
+ - 一项正常任务与一项最高风险任务:情境、对象、专业观察与比较、标准/知识/Tool 证据、策略变化、消费者行动、错误后果和最终责任;
44
+ - 标准依赖按主张强度分三类处理:岗位不依赖正式标准时为 `none`;正式标准或 rubric 只是未来运行时输入、当前设计不声称判断其覆盖性或适用性时为 `runtime-input-only`,只需把来源、版本、缺失降级和责任人写成契约,不得因标准原文尚未提供而阻塞岗位设计;只有岗位明确负责判断标准覆盖性/适用性,或当前设计据此作正式结论时,才是 `coverage-or-applicability`,必须具备真正的严格标准反例:本次适用标准的全部显式锚点按原文和适用范围已经满足,但标准遗漏关键风险或不适用于当前用途,Agent 仍能识别并合法交接。此时分别核对标准来源及有权身份、完整锚点集合、逐项满足证据、覆盖缺口来源与场景证据;不能用用户对“高质量”的描述、参考案例或未经核证的世界知识制造盲区。对象违反已有锚点只是普通标准执行失败。缺少真实标准时,应把能力降为“按传入标准执行并暴露缺证”,而不是永久停留在 discovery;
45
+ - 所有仍会改变岗位、判断方法、核心依赖、权限或核心输出的分叉已经关闭或有合法责任路径。
46
+
47
+ 以下任一情况必须返回 `revision_required`:
48
+
49
+ - `DESIGN_CONTEXT.md` 声称 `grounded` 或 `ready-for-design`,承重任务正文仍出现 `partial`、未经确认的推断、关键缺口、待核证正式标准或未明确最终责任;
50
+ - 问题问完了,但只能复述岗位标签、A/B/C、rubric、Harness 或文件流程;
51
+ - 首版对象仍是“业务/通用文档”“内容”“数据”等抽象集合,或者只列文件格式/媒介;
52
+ - 设计者把“独立体系”“真实生产”“需要审批”等回答扩张成用户没有确认的文档类型、标准维护者、评级政策或接口事实;
53
+ - 在 `coverage-or-applicability` 模式下,所谓标准反例实际违反已有锚点、依赖未经核证的行业常识,或通过重新解释“有效、适用、完整”等锚点绕开标准原义;
54
+ - 在 `coverage-or-applicability` 模式下,只确认“高质量/理想结果包含什么”,就推导“现行标准没有覆盖什么”;或者标准原文、完整锚点、覆盖边界仍是 `missing/unknown/hypothetical`,却把反例裁决为 `pass`;
55
+
56
+ 无法从材料建立独立职业基准时返回 `insufficient_basis`,不得用通用最佳实践填空。
57
+
58
+ ## `source-gate` 裁决
59
+
60
+ 先核对送审清单与总体目标;再检查生产源码是否忠实编译已经通过的设计语境,并用同一正常任务与最高风险任务检查行为。对所有会改变正式结论、业务动作、接口行为或恢复语义的稳定规则逐项做权威审计。任何阻断项还必须通过业务影响审计:它会改变首版消费者决定、造成越权或高风险副作用、破坏专业闭环,或者使当前交付不可用。说不清这四类影响的发现只能进入 `deferred_non_blocking`,不得返回 `revision_required`。
61
+
62
+ 发现一个决定性失败类时,在同一轮横向检查全部同类 Tool、契约、Skill、Prompt、输出与评测落点,返回一个最小修复簇,不能把同类问题的不同实例拆到后续轮次。初次源码门之后默认最多两轮源码修订,但轮次永远不改变问题的业务影响与阻断效力。从 `review_round >= 4` 起,新发现的独立高影响失败类即使早已存在也仍可阻断;本轮修改新引入、或此前证据客观上无法发现的高影响失败同样可以阻断。前轮横扫遗漏的同类实例若仍满足四类业务影响,也必须继续阻断,并在 `material_effect` 中记录为何仍有实质影响、在证据中说明前轮为何漏审;只有已经不再满足四类业务影响的同类遗漏和未来低影响适配细节转为非阻断项。轮次上限不能强迫评审给 `pass`。
63
+
64
+ 任务或源码包含性能设计/优化时,继续核对性能证据档位。没有 Tool 接口时只允许前瞻必要路径、接口与观测建议;只有接口定义时只允许契约路径风险与模拟行为;只有可调用 Tool 已在冻结任务中产生收据,或者已有包含输入、Tool 序列、前后状态、结果和终止的真实轨迹时,才允许声明首次偏离、真实调用或 Before/After 收益。真实性能声明还必须保持同一任务、起点状态、输入权威与质量门槛,并分别说明调用、上下文、Token、程序耗时、Agent/宿主墙钟和业务价值。诚实的 `not_run/not_exposed` 不因指标缺失而失败;声明强度超过证据、复制参考案例数字或用调用减少冒充总体提速时,才按其对首版承诺和交付可用性的实际影响裁决。
65
+
66
+ 下列任一项在通过业务影响审计后足以返回 `revision_required`:
67
+
68
+ - 未获授权的阈值、等级、评级映射、停止动作、重试预算、接口端点或组织角色进入稳定资产;
69
+ - 把被处理对象质量很差当成停止评估的理由;只有评估所需标准、证据、权限或技术前提不足,才允许降级或停止;
70
+ - 把正式标准、阈值、证据、权限或平台能力缺失错误路由给被评对象的提供者;对象在已生效标准下不合格才可按业务规则退回对象提供者,评估前提缺失应转交对应责任人;
71
+ - 同一专业结论由 Agent 与 Skill 分别重新推导,例如 Skill 已形成总评,Agent 又再次综合形成总评;每项结论必须有唯一形成责任,其他层只能使用、质疑或路由;
72
+ - 评测答案依赖当前材料没有给出的业务政策,或“标准反例”只是已有锚点失败;
73
+ - rubric 只提供分项维度或锚点,源码或评测却要求形成没有有权聚合、评级表达或业务动作映射支持的总评、等级、评级草案或准入结论;`pending/draft` 与后续人工审批不能授权模型自行发明前置评级规则;
74
+ - 正常或最高风险评测只有场景标签和抽象描述,没有足够具体的对象片段/结构化事实、适用锚点或规则、调用后模拟 Tool 返回(如有)及逐项预期证据关系,评审者无法仅凭 fixture 独立复演核心职业判断;
75
+ - 评测把输入没有声明的未来场景、规模、法规或用户类型当成确定缺陷、评分依据或阻断动作,而不是待核证范围假设;或者同一事实同时被写成现行标准失败和标准之外风险;
76
+ - Skill 声称依赖历史记录、组织知识、实时状态或样本,却没有任务输入、知识源、Tool 或人工入口提供这些数据,仍被声明为首版可执行能力;
77
+ - Tool 契约在未接入状态下发明正式端点、字段、错误码、重试政策、哈希、幂等默认或覆盖策略;Prompt、Skill、契约、输出 Schema 与评测答案都是稳定资产,`required_not_connected` 不能把契约中的规则变成“非执行内容”。未接入契约只需闭合业务目的、必要语义、权限与副作用、结果/失败类别、安全降级、责任类别和下一入口;缺少未来失败子型、具体组织角色或恢复细节本身不构成阻断;
78
+ - 一项稳定规则只能追溯到 DESIGN_CONTEXT、旧稿、评审建议、“设计语境支持”、`TBD` 或设计者常识,而不能追溯到当前用户确认、正式材料、已核证平台事实,或不改变正式结论/权限/副作用的可逆设计默认;
79
+ - 文件齐全、静态通过或 ZIP 成功被用来抵消职业设计和证据缺陷。
80
+
81
+ ## 返回收据
82
+
83
+ 只返回一个有效 JSON 对象,不加 Markdown 代码围栏、前言、逐项检查过程或修改后的文件。两种模式使用同一外壳;`authority_audit` 始终是对象,没有稳定规则时两个数组都为空。`grounding_audit` 与 `source_audit` 在不适用模式下写字符串 `not_applicable`;`materiality_audit` 只用于 `source-gate`,`grounding-gate` 写字符串 `not_applicable`:
84
+
85
+ ```json
86
+ {
87
+ "review_mode": "grounding-gate | source-gate",
88
+ "review_scope": "isolated-subagent",
89
+ "review_round": 1,
90
+ "verdict": "pass | revision_required | insufficient_basis",
91
+ "lowest_failed_layer": "requirements | professional-task | role | principles | skill-topology | tool-knowledge | output-handoff | trace-runtime | none",
92
+ "decisive_reason": "一段最短因果判断",
93
+ "evidence": ["文件或材料位置:支持裁决的事实"],
94
+ "preserve": ["已成立且修订时不得丢失的能力"],
95
+ "return_to": "grilling | grill-with-docs | design-enterprise-agent | delivery-finalizer | user",
96
+ "next_action": "一项最低必要动作",
97
+ "change_condition": "什么新事实或修订结果会改变裁决",
98
+ "reviewed_snapshot_id": "source-gate 使用送审清单中的 sha256:...;grounding-gate 写 not_applicable",
99
+ "grounding_audit": {
100
+ "first_release_business_object": "业务对象类型与用途,不是载体格式",
101
+ "carrier_formats": ["仅记录载体"],
102
+ "normal_task_replayable": true,
103
+ "highest_risk_task_replayable": true,
104
+ "standard_mode": "none | runtime-input-only | coverage-or-applicability",
105
+ "strict_counterexample_status": "pass | not_applicable | not_required_contract_only | fail",
106
+ "strict_counterexample_reason": "为何适用或不适用",
107
+ "counterexample_basis": {
108
+ "standard_source_status": "verified-text | authorized-scope-confirmation | missing | not_applicable",
109
+ "standard_source": "标准原文/有权摘录,或明确有权确认人的身份与原话",
110
+ "anchor_set_completeness": "confirmed | unknown | not_applicable",
111
+ "all_explicit_anchors_satisfied": true,
112
+ "coverage_gap_status": "confirmed | disputed | unknown | not_applicable",
113
+ "coverage_gap_source": "标准原文或有权范围确认",
114
+ "scenario_evidence_status": "verified-case | self-contained-fixture | hypothetical | not_applicable"
115
+ }
116
+ },
117
+ "source_audit": {
118
+ "normal_case_replay": "pass | fail",
119
+ "highest_risk_case_replay": "pass | fail",
120
+ "finding_classification_consistent": true,
121
+ "unsupported_scope_expansion_found": false,
122
+ "skill_dependency_closure": "pass | fail"
123
+ },
124
+ "materiality_audit": {
125
+ "overall_goal": "本轮总体目标",
126
+ "consumer_decision": "首版消费者依据结果完成的决定",
127
+ "first_release_boundary": "首版对象与明确非目标",
128
+ "material_blocker_found": false,
129
+ "material_effect": "对首版决定、权限副作用、专业闭环或交付可用性的影响;pass 时说明没有未解决阻断",
130
+ "same_failure_family_scope": ["本轮已横向检查的同类资产范围"],
131
+ "deferred_non_blocking": ["不改变总体目标的未来适配项"],
132
+ "late_round_blocking_justification": "not_applicable | new-independent-failure-class | material-same-family-missed-instance | patch-introduced-failure | previously-unobservable-failure"
133
+ },
134
+ "authority_audit": {
135
+ "stable_rules_reviewed": [
136
+ {
137
+ "rule": "稳定规则",
138
+ "artifact": "所在文件",
139
+ "business_effect": "改变的结论、动作、接口或恢复语义",
140
+ "source_kind": "user-confirmed | formal-material | verified-platform-fact | reversible-design-default",
141
+ "source": "具体来源"
142
+ }
143
+ ],
144
+ "unresolved_or_unauthorized": []
145
+ }
146
+ }
147
+ ```
148
+
149
+ `review_round` 是同一模式的正整数调用序号,从 1 递增;它不证明评审质量,也不改变问题的 materiality,只防止失败轮次被静默覆盖。`grounding-gate` 必须填写 `grounding_audit`:`none` 对应 `not_applicable`;`runtime-input-only` 对应 `not_required_contract_only`,并检查运行时标准的来源、版本、缺失降级和责任路径是否进入契约;只有 `coverage-or-applicability` 且裁决为 `pass` 时,`counterexample_basis` 才不得含 `missing`、`unknown` 或 `hypothetical`,并且必须明确全部锚点已满足。`source-gate` 必须填写 `source_audit`、`materiality_audit` 与完整 `authority_audit`,`grounding_audit` 可写 `not_applicable`;裁决为 `pass` 时,两项案例回放和 Skill 数据依赖必须通过、分类必须一致、不得存在未经依据的范围扩张,且 `material_blocker_found = false`、`late_round_blocking_justification = not_applicable`。裁决为 `revision_required` 时必须写清实际业务影响并列出本轮横向扫描范围;`review_round >= 4` 时,继续阻断的理由必须是新发现的独立高影响失败类、仍有实质影响且前轮漏审的同类实例、本轮修改引入的高影响失败,或此前证据客观上无法发现的高影响失败。同类遗漏只有在该具体实例已经不再满足四类业务影响时才能降级。`source-gate = pass` 时 `reviewed_snapshot_id` 必须与送审清单完全相同,且 `unresolved_or_unauthorized` 必须为空;发现无权规则时把它列入该数组并返回 `revision_required`,不能为了得到空数组而把契约、评测或“仅属草案”的规则排除在稳定资产之外。
150
+
151
+ `pass` 只能说明本次设计门通过,不证明模型行为、平台装配或业务效果。主设计 Agent 必须原样保留裁决、审计内容与证据边界;不得把 `revision_required` 汇总成“总体可用”,也不得自行覆盖后继续编译。
152
+
153
+ 路由服从最低失败层而不是当前阶段:`source-gate` 的 `revision_required` 通常返回 Design 修订源码;`insufficient_basis` 必须按 `return_to` 回调研或用户补业务依据。新事实若改变已通过的业务身份锚、专业任务、正式标准、权限或最终责任,旧 `grounding-gate` 收据失效,必须重新评审;任何源码变化都会使旧送审清单和 `source-gate` 收据失效,必须重新冻结并复审。打包后不再手工修改生产源码来更新门禁或包状态;动态状态只写入源码根目录之外的收据。
154
+