enterprise-agent-designer 0.34.1

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (34) hide show
  1. package/.codebuddy-plugin/plugin.json +66 -0
  2. package/CHANGELOG.md +729 -0
  3. package/DESIGN_NOTE.md +101 -0
  4. package/LICENSE +21 -0
  5. package/PACKAGE.yaml +209 -0
  6. package/README.md +109 -0
  7. package/RETROSPECTIVE_v0.1-v0.10.md +67 -0
  8. package/RUNTIME_ASSEMBLY.md +134 -0
  9. package/SYSTEM_PROMPT.md +139 -0
  10. package/agents/agent-designer.md +151 -0
  11. package/avatars/.gitkeep +0 -0
  12. package/avatars/expert.png +0 -0
  13. package/evaluation/README.md +60 -0
  14. package/evaluation/cases.json +2045 -0
  15. package/evaluation/document-reviewer-holdout.md +24 -0
  16. package/package.json +33 -0
  17. package/references/optional-host-workflow.md +105 -0
  18. package/scripts/check_agent_delivery.py +202 -0
  19. package/scripts/optional/workflow_controller.py +478 -0
  20. package/scripts/validate.py +437 -0
  21. package/scripts/verify_v0321_guards.py +410 -0
  22. package/skills/design-enterprise-agent/SKILL.md +131 -0
  23. package/skills/design-enterprise-agent/references/41-performance-worked-example.md +199 -0
  24. package/skills/design-enterprise-agent/references/cold-start-and-writing.md +163 -0
  25. package/skills/design-enterprise-agent/references/requirements-grilling.md +40 -0
  26. package/skills/design-enterprise-agent/references/runtime-and-integration.md +102 -0
  27. package/skills/design-enterprise-agent/references/task-adaptive-runtime.md +70 -0
  28. package/skills/design-enterprise-agent/scripts/finalize_agent_delivery.py +748 -0
  29. package/skills/grill-with-docs/SKILL.md +58 -0
  30. package/skills/grill-with-docs/references/design-context-format.md +101 -0
  31. package/skills/grilling/SKILL.md +62 -0
  32. package/skills/review-enterprise-agent/SKILL.md +86 -0
  33. package/skills/review-enterprise-agent/references/isolated-review-contract.md +154 -0
  34. package/skills/review-enterprise-agent/scripts/validate_review_receipt.py +338 -0
@@ -0,0 +1,199 @@
1
+ # 运行路径性能设计贯穿案例
2
+
3
+ 本参考只在性能设计或诊断任务中加载。它展示怎样从一条真实轨迹形成 `runtime_design.performance`、定位首次偏离、修改最低必要责任层并验证 Before/After。不要复制其中的 Excel 字段、命令或收益比例;目标 Agent 必须使用自己的用户任务、状态、接口和运行证据重新填写。
4
+
5
+ ## 0. 加载条件、交付对象与执行程序
6
+
7
+ ### 0.1 加载条件
8
+
9
+ 仅在任务要求设计或优化 Agent 执行路径、交互前沿、上下文交接、恢复复用或端到端性能,或者真实轨迹出现重复理解、重复发现、重复构造、重复执行时加载本参考。一般概念解释、与性能无关的局部文案修改或尚未冻结代表任务的讨论不加载。
10
+
11
+ 进入性能路线时,按 `SKILL.md` 同时读取运行与资产参考、评测与交付参考以及相关夹具;先形成性能设计对象,再修改 Prompt、Skill、Tool 或 Harness。案例字段和数字只帮助理解方法,不得作为目标 Agent 的默认输入。
12
+
13
+ ### 0.2 `performance_design` 对象
14
+
15
+ 该对象在完整设计交付中位于 `runtime_design.performance`;下列 `performance_design` 是便于独立阅读和填写的同义展开。
16
+
17
+ ```yaml
18
+ performance_design:
19
+ representative_task:
20
+ user_request: ""
21
+ terminal_business_action: ""
22
+ starting_state: ""
23
+ inputs_and_authority: []
24
+ quality_gates: []
25
+ deterministic_baseline: []
26
+ agent_runtime_baseline: []
27
+ necessary_path_events:
28
+ - event: ""
29
+ class: J | F | H
30
+ owner: Agent | Skill | Tool | Harness | Human
31
+ reason: ""
32
+ current_path_events:
33
+ - event: ""
34
+ class: J | F | H | R
35
+ owner: Agent | Skill | Tool | Harness | Human
36
+ evidence: ""
37
+ first_divergence: ""
38
+ interaction_frontier: []
39
+ executable_handoff: []
40
+ invalidation_rules: []
41
+ recovery_reuse: []
42
+ proposed_changes: []
43
+ measurements: []
44
+ claim_boundary: ""
45
+ ```
46
+
47
+ 先写 `necessary_path_events`,再记录 `current_path_events`。`first_divergence` 是实际路径第一次缺失、错误或错位的 `J/F/H`,或者第一个没有新增证据、状态或业务决定的 `R`;不能把“最耗时的一步”直接当作首次偏离。
48
+
49
+ ### 0.3 执行程序
50
+
51
+ 1. 检查现有 Agent、Skills、Tool 返回、状态、交接、真实轨迹和评测,先判断是机制缺失、未触发、错误调度、接口不足、陈旧交接还是执行偏移。
52
+ 2. 冻结代表任务、终局业务行动、起点状态、输入与权威、质量门槛和正确终止。
53
+ 3. 先画不可删除的 `J/F/H` 必要路径,不以当前文件、命令或模块边界代替业务路径。
54
+ 4. 建立直接确定性能力与真实 Agent 的双基线;无法取得的指标保持 `not_run` 或 `not_exposed`。
55
+ 5. 标记真实路径,定位第一次缺损或错位的 `J/F/H`,或者第一个无新增价值的 `R`。
56
+ 6. 只修最低必要责任层:意图交接、Skill 路由、Tool 投影、Harness 状态与交接,或真正需要人的业务决定。
57
+ 7. 用同一任务验证质量、必要与禁止事件、路径、调用、Token、墙钟和恢复;满足第 8 节停止条件后停止。
58
+
59
+ ## 1. 代表任务与质量门槛
60
+
61
+ 用户请求:
62
+
63
+ > 查询当前工作区中“同名指标”的值,并告诉我是否可以正式使用。
64
+
65
+ ```yaml
66
+ representative_task:
67
+ user_request: 查询“同名指标”的值,并判断能否正式使用
68
+ terminal_business_action: 用户选择正确指标,并知道当前数值是否可用于正式工作
69
+ starting_state: 工作区已有候选本体和 Query;用户只提供自然语言名称
70
+ inputs_and_authority:
71
+ - Query Tool 提供候选身份、定义、位置和数值状态
72
+ - Agent 解释差异,用户确认目标身份
73
+ quality_gates:
74
+ - 不合并两个同名候选
75
+ - 身份未确定时不提供单一正式值
76
+ - 交付定义、位置、主要差异和数值可用边界
77
+ - 不把候选或可查询状态升级为业务确认
78
+ ```
79
+
80
+ 性能约束不能先于这些门槛。只返回“有两个候选,请选择”虽然更短,却不能支持用户行动。
81
+
82
+ ## 2. 必要路径
83
+
84
+ ```yaml
85
+ necessary_path_events:
86
+ - event: 理解用户同时需要对象消歧、数值和正式可用性判断
87
+ class: J
88
+ owner: Agent
89
+ reason: 决定本轮查询必须支持什么业务行动
90
+ - event: 把终局意图和对象状态交给 Query Skill
91
+ class: H
92
+ owner: Agent
93
+ reason: Skill 据此选择唯一最小 operation
94
+ - event: 取得完整候选人口
95
+ class: F
96
+ owner: Tool
97
+ reason: 身份与人口可以确定性查询
98
+ - event: 返回定义、位置、差异和数值可用边界
99
+ class: F
100
+ owner: Tool
101
+ reason: Agent 需要这些事实完成解释
102
+ - event: 解释差异并向用户提出可区分候选的问题
103
+ class: H
104
+ owner: Agent
105
+ reason: 把真正的业务判断交给有权用户
106
+ ```
107
+
108
+ 必要路径定义不可删除的判断、事实和交接,不预设调用数量。Tool 一次不能闭合人口时可以继续取得证据;一次已经充分时,追加调用才可能是 `R`。
109
+
110
+ ## 3. Before 与首次偏离
111
+
112
+ Before Skill 已经列出 `search`、`get`、`value` 和 `trust`,但没有按意图和状态给出排他路线。
113
+
114
+ |顺序|真实事件|分类|裁决|
115
+ |---|---|---|---|
116
+ |1|Agent 识别“同名指标”,没有把“值能否正式使用”完整交给 Skill|缺损的 `H`|`first_divergence`;终局意图在 Agent→Skill 交接时丢失|
117
+ |2|预检、盘点环境、扫描目录或源码确认入口|`R`|没有新增业务证据或状态|
118
+ |3|`search` 得到两个候选身份|`F`|必要,但 Tool 返回不足以完成解释|
119
+ |4|逐候选追加 `get`、`value`、`trust` 并加载 Reference|部分 `F`+连锁 `R`|在补结果投影不足|
120
+ |5|Agent 重新拼装候选定义、位置和值状态|`J/H`|解释必要,事实拼装不应由 Agent 重做|
121
+
122
+ 三次 Agent 轨迹平均墙钟为 177.78 秒、平均输入约 359,942 Token;直接产品命令通常约 0.6—1.4 秒。两者不是完全相同的工作量,但足以否定“先优化 SQLite”或“先拆 Query Skill”的初始方向。
123
+
124
+ ## 4. 最低必要修改
125
+
126
+ ```yaml
127
+ first_divergence: Agent→Query Skill 的交接丢失正式可用性这一终局意图
128
+ proposed_changes:
129
+ - owner: Agent
130
+ change: 同时传递用户问题、预期业务行动和所需结论
131
+ - owner: Skill
132
+ change: 按稳定 ID、规范名称、自然语言、多候选和正式可用性形成排他路线
133
+ - owner: Tool
134
+ change: 一次返回定义、位置、区分字段、数值状态和权威边界
135
+ unchanged:
136
+ - 不新增 Skill
137
+ - 不新增 Harness 状态
138
+ - 不降低候选身份、正式值和业务确认门禁
139
+ ```
140
+
141
+ 不拆 Skill,因为 Query 已经被正确选择,且没有出现独立业务意图、权限或状态边界。不新增 Harness,因为当前任务没有跨阶段持久状态缺口。
142
+
143
+ ## 5. After 与效果
144
+
145
+ ```text
146
+ Agent 保留“数值+正式可用性”的终局意图
147
+ → Query Skill 识别自然语言尚未解析,只选择一次 search
148
+ → Tool 返回两个候选的定义、位置、差异和数值可用边界
149
+ → Agent 解释为什么当前不能直接给正式值
150
+ → 用户只回答真正能够区分候选的业务问题
151
+ ```
152
+
153
+ 三次 After 均只完整读取一次 Query Skill、调用一次 `search`、不加载 Reference、不追加 operation,同时给出候选定义、来源位置和数值可用边界。
154
+
155
+ |验收项|Before|After|声明边界|
156
+ |---|---|---|---|
157
+ |平均墙钟|177.78 秒|41.88 秒|冻结任务下降 76.4%|
158
+ |平均输入 Token|约 359,942|88,863|冻结任务下降 75.3%|
159
+ |路径|环境/源码探查,逐候选追加操作|一次 Skill 读取、一次 `search`|重复探索被消除|
160
+ |业务交付|依赖多次调用拼装|一次闭合定义、位置、差异和数值边界|没有用少信息换速度|
161
+
162
+ 这是 Agent 意图交接、Skill 路由和 Tool 返回共同变化的捆绑 A/B。不得把收益单独归因于某一层,不得外推为所有 Query operation 的固定比例。
163
+
164
+ ## 6. 交接案例:Standardize → Query
165
+
166
+ 复合任务要求先形成可用标准数据,再查询示例指标。Before 的候选准备已经返回 `dataSetState=checking`、`ruleEvaluationState=not_run`,Agent 却提前进入 Query;被非法契约拒绝后,又读 Schema、手工建契约并重复取值。
167
+
168
+ 第一次偏离是终局状态没有进入 TaskContract,且 Standardize 没有形成合法下游交接。After:
169
+
170
+ ```text
171
+ Agent 保留 requestedStandardDataState=available
172
+ → Standardize Skill 选择 candidate→audit→available 路径
173
+ → 程序在候选形成后返回 nextTask
174
+ → 达到 available 后返回绑定同一数据集的 queryHandoff
175
+ → Query 只执行一次 trust
176
+ ```
177
+
178
+ 同一案例从 349.829 秒、39 次命令、1,042,998 输入 Token,变为 129.996 秒、14 次命令、303,015 输入 Token;必要和禁止事件、身份与正式可用性通过。迁移原则:Agent 保留终局,Skill 完成本专业状态,Harness 交付下游合法开工所需的身份、状态与入口。
179
+
180
+ ## 7. 验收反例:命令减少但墙钟没有下降
181
+
182
+ Build 第一轮只收敛入口:命令 29→15,工具输出约下降 55%,输入 Token 637,028→356,051;墙钟却从 210.90 秒变为 211.71 秒。只能声明冗余入口消失,不能声明总体提速。
183
+
184
+ 第二轮由程序生成完整人口闭合的 Decision Brief,替代 Agent 读取完整候选、四份 Reference 和多份 Sheet 证据后重新压缩。输入 Token 356,051→279,113,推理 Token 5,484→2,104,墙钟 211.71→123.01;工具输出字符反而增加 76.5%。
185
+
186
+ 迁移原则:调用、输出字符、Token、墙钟和业务价值分别验收。某项资源增加不自动代表退化;必须判断它是否替代了更昂贵的重复理解,同时保持质量门槛。
187
+
188
+ ## 8. 使用本案例时的停止条件
189
+
190
+ 完成性能设计后检查:
191
+
192
+ - 是否先定义必要 `J/F/H`,而不是先删当前步骤;
193
+ - 是否找到第一个缺损或错位的 `J/F/H`,或者第一个无新增价值的 `R`;
194
+ - 是否只修改最低必要责任层;
195
+ - After 是否保持原质量、权限、状态和终止;
196
+ - 是否分别声明调用、上下文、Token、墙钟和业务价值;
197
+ - 是否保留 `not_run`、`not_exposed` 和不能外推的边界。
198
+
199
+ 这些条件满足后停止。新的性能修改必须指出新的可观察浪费及其影响,不得因为“还可能更快”继续扩展机制和测试。
@@ -0,0 +1,163 @@
1
+ # 冷启动重设计与高质量 Prompt/Skill Few-shots
2
+
3
+ Reference-Version: 0.34.1
4
+
5
+ 创建或改写生产 System Prompt、核心 Skill 前完整读取本 Reference。它帮助设计者从一句需求、弱旧稿或失败样本建立职业行为,并把设计写成自然、有判断力的生产资产。示例中的中文标题用于承载七层责任,但标题下的句式、篇幅、领域事实和 Tool 不可复制。与当前目标同领域的完整案例不进入运行 Reference,只能作为隔离评测材料;生成时使用跨领域示例理解机制,并从当前业务证据独立推导职业内容。
6
+
7
+ 内容导航:1–2 建立冷启动基线;3–4 编译中文七层标题、联合控制和可解释协作;5–7 提供跨领域 Prompt/Skill 对照;8 核对独立源码;9 完成三遍行文复审。
8
+
9
+ ## 1. 可迁移经验及其边界
10
+
11
+ 本 Reference 同时吸收外部优秀写法和本产品历次实证经验,但不把其平台规则、业务事实、专有 Tool、旧目录或整段文案迁入目标 Agent。
12
+
13
+ | 证据源 | 可迁移机制 | 防止的失败 |
14
+ | --- | --- | --- |
15
+ | Claude Design | 用职业差异建立身份;解释选择理由;先读材料,只问改变设计的问题;回读真实产物 | 通用角色、需求问卷、只有命令没有理由 |
16
+ | Fabel5 | 在易误判处给“何时用/不用、正例/反例、为什么”;区分对话回答与文件交付 | 原则看懂但临场选错、只交叙述稿 |
17
+ | 知识管家 | 区分有权证据、候选和推断;按意图与证据状态变换策略;局部缺口局部降级 | 检索即事实、一个缺口让全任务停摆 |
18
+ | 大表哥 | 目标链驱动;一次选择一个主 Skill;Tool 推进到判断点,结果回到 Agent 重判 | Skill 互调、机械跑步骤、Tool 成功冒充业务完成 |
19
+
20
+ 本产品历史版本按“解决过什么失败”使用,不按新旧排序:
21
+
22
+ | 历史来源 | 应保留的能力 | 不继承的副作用 |
23
+ | --- | --- | --- |
24
+ | v0.7.5 | “不是 Prompt 记录员”的职业张力;设计质量高于最小改动;先给价值再问一个问题 | 累积的版本反例和过长常驻规则 |
25
+ | v0.8.0 | 从消费者决定建立行为蓝图;先证明职业行为再选载体;设计、资产、行为证据分轴 | 把八段判断顺序机械输出成 SOP |
26
+ | v0.10.0 | 承认对话、Skill、独立评审和 Harness 的真实运行差异;显式提出知识/Tool 依赖 | 将宿主特定装配细节写进所有岗位 Core |
27
+ | v0.11.3 | 简洁不删除理由、业务后果、条件变化与合法继续;Skill 不是接口卡 | 过度压缩职业策略和七层关系 |
28
+ | v0.13.0 | 业务问题到证据的因果链;可组合 MetaGoals;澄清、设计、重设计与评审的条件判断 | 把全部方法解释常驻目标 Agent Prompt |
29
+ | v0.15.0 | 七层决定到真实资产、可观察行为和责任主体的编译收据 | 把确定性文件核对变成模型长篇自述 |
30
+ | v0.16.0 | 职业内核、条件运行、管理可信三遍编译 | 因强调表达开放而让七层标题和资产身份消失 |
31
+ | v0.17.0 | 中文七层、联合控制、交付形态冻结和独立源码门 | 用控制结构压缩掉职业论述与可解释策略 |
32
+ | v0.18.0 | 历史经验重新分层后形成较完整的 Core、双 Skill 与资产体系 | Design 压缩任务策略的依据链;Review 覆盖完整但因果裁决偏检查表 |
33
+ | v0.19.0 | 恢复任务策略依据链、职业因果裁决和较强 Prompt/Skill 行文 | 同领域完整 Few-shot 进入生成上下文;终结脚本未随 Skill 分发,写入与打包仍可能断链 |
34
+
35
+ 历史版本用于设定行为质量下限和相邻错误,不是复制来源。目标是组合有效机制并重新写成当前岗位自己的语言,而不是拼接八个版本的段落。
36
+
37
+ 吸收参考时记录“原资产解决了什么失败 → 哪个机制可迁移 → 当前设计由什么承载 → 如何证伪”。只写“参考某产品”没有价值。参考只证明一种写法曾有效,不赋予其通用规则效力。若参考与目标岗位同领域,只保留抽象机制到运行 Reference;完整文本移入隔离评测,避免生成答案复述测试答案。
38
+
39
+ ## 2. 冷启动先重建职业行为
40
+
41
+ 先区分业务事实、旧设计和行为证据。服务对象、正式规则、真实权限和最终责任可在有权确认后保留;角色措辞、流程、Skill 数量、字段、阈值和接口假设必须重新证明;实际输出、Tool 轨迹和用户反馈决定哪些能力值得守恒。
42
+
43
+ 暂时放下旧组件名称,用一个正常任务和一个联合压力事件回答:消费者要作什么决定;Agent 应看到什么;怎样比较;什么时候改变策略;什么不能替消费者决定;局部失败后怎样安全继续。如果相邻岗位也会给出几乎相同的判断,说明职业设计仍是空心功能清单。
44
+
45
+ 一句话需求不应触发技术问卷或预设方案投票。先形成可修订理解;工作机制尚不清楚时,通过经历回放与具体追问发现需要,不要求每个探索问题先成为高影响分叉。已充分理解后的业务取舍,才用推荐与候选收敛。
46
+
47
+ 弱做法:
48
+
49
+ > 请提供行业、平台、目标模型、输入格式、知识库、工具和验收标准。
50
+
51
+ 较好的做法:
52
+
53
+ > 我先了解它要接住哪一段真实工作。请回想最近一次让你觉得合同审核需要改进的经历:当时材料到了谁手里,在哪个判断上卡住,后来是怎么解决的?
54
+ >
55
+ > 如果用户随后提到“所有条款都核对过,但签署仍被退回”,再追查退回依据、已有标准是否覆盖,以及谁发现了问题;不要直接断言标准存在盲区。形成建议时,把该经历连接到需要增加的专业观察、知识依赖与仍由人承担的放行责任,而不是只让用户选择核条款还是查风险。
56
+
57
+ 后者先探索工作,再以证据承担设计责任;探索问题不必附带候选答案。事实补充简洁询问,业务取舍才给推荐、理由、代价和后续影响。模型或平台能力只有在会改变责任、权限或业务承诺时才转译成业务取舍询问;格式、Skill 数量、交付形态和目录由设计师自主裁决。
58
+
59
+ ## 3. 用中文标题承载七层,不把标题写成空模板
60
+
61
+ 生产 System Prompt 默认使用七个业务化中文标题:
62
+
63
+ 1. **不可突破的底线**:什么在目标和压力下仍不能牺牲,否决后怎样合法继续;
64
+ 2. **岗位身份、责任与范围**:谁用结果作什么决定,Agent 对哪种判断质量负责,何时处理或转交;
65
+ 3. **判断原则与任务目标**:怎样比较合法候选,什么方向可以按目的、证据、风险和授权组合;
66
+ 4. **专业能力与工作方法**:哪些稳定专业闭环可调用,Agent 怎样选择而不把步骤当判断;
67
+ 5. **工具、知识与行动权限**:事实效力、指令权和行动授权怎样分离,什么变化必须返回 Agent;
68
+ 6. **交付结果与责任交接**:当前消费者怎样行动,同一结论怎样投影,下一责任人是谁;
69
+ 7. **评估记录、复审与恢复**:记录什么足以证明、终止和恢复,声明不超过真实载体。
70
+
71
+ 标题可以改成目标岗位更自然的中文,但要保持一一映射。只有目标平台格式明确受限或合并后仍能直接识别各层责任时才合并。标题本身不产生行为:每层仍要使用该领域的对象、比较、理由、后果和停止条件。
72
+
73
+ Prompt 还要用一个短段落显式说明联合控制:底线全程可否决;岗位决定处理、拒绝或转交;原则与任务目标形成策略;Agent 选择 Skill;Skill 在 Tool Policy 下使用知识与 Tool;新证据、冲突、权限变化或失败返回 Agent 重判;Output 与 Trace 分别服务行动与证明。不要把这段关系扩写成所有任务必须执行的固定 SOP。
74
+
75
+ 七层标题之外,行文还应实现专业贡献、质量优先级、条件化推进、主动协作和边界后继续。鲜明身份可以用“你不是 X”,也可以直接写出独特责任;前者是修辞,不是唯一合格句式。高能力模型可以创造更准确的结构和更精炼的表达,但不能让七层身份与联合控制消失。
76
+
77
+ 简洁意味着删除重复、套话、设计术语和不改变行为的实现细节,不是删除原因、后果、条件和安全继续。关键规则先交代它保护的业务结果、成立依据和边界,给模型据此选择动作的空间;局部正反例用于澄清容易误判的差别,不是待枚举的全部合法路径。不要给每条命令机械添加“因为”,也不要用要求模型向用户解释来代替给模型判断依据。若用“标准全部满足但仍不可用”证明岗位不只是规则执行器,反例必须真实满足当前标准的每项显式锚点;漏字段、低分或违反已有锚点只是普通规则失败,不能拿来证明标准有盲区。
78
+
79
+ ## 4. 可解释性服务于管理,不展示思维链
80
+
81
+ 可解释性不是把内部推理全部输出,而是让业务管理者能够理解和纠正关键选择。对会改变岗位行为、实施代价或返工成本的决定,自然说明:推荐什么;为什么符合消费者决定和职业责任;改善什么、牺牲什么;出现什么新事实时改变。低风险、可逆且显而易见的选择无需逐项辩护。
82
+
83
+ 高返工分叉尚未稳定时,先交付能观察身份、专业判断、条件策略和边界恢复的行为骨架或关键片段;方向确认后编译完整源码。不要把所有未知变成问题,也不要等写完全部文件后才让用户发现岗位理解错了。
84
+
85
+ 业务用户负责业务事实、授权和最终选择;设计师负责专业建议、候选比较、挑战错误前提并把技术分叉翻译成业务责任问题。不能用“请提供更多信息”把设计责任退还给用户。
86
+
87
+ ## 5. Few-shot:采购合规助手
88
+
89
+ 弱稿:
90
+
91
+ > 检查采购材料是否合规,查询制度库和供应商系统,发现风险后提交审批。工具失败时重试,超过阈值转人工。
92
+
93
+ 较好的生产片段:
94
+
95
+ > 你帮助采购专员判断材料是否已经具备进入审批的事实依据,而不是替审批人放行。先区分组织正式制度、本次交易材料和你基于两者形成的判断;历史案例可以辅助理解,不能覆盖当前有效制度。
96
+ >
97
+ > 制度与交易事实都可核验时,说明是否满足要求和依据。供应商状态、额度或授权范围无法从有权系统取得时,不声称“已合规”,但继续完成不受影响的材料完整性检查,并说明缺少什么、由谁补齐、从哪里继续。
98
+ >
99
+ > 读取制度和核验供应商只提供事实,不产生提交审批的授权。只有任务明确授权且系统返回成功收据,才能说“已提交”;否则交付可供专员提交的建议。拒绝越权提交时,保留已完成的核验结果。
100
+
101
+ 这里把正式规则、现场事实、Agent 判断和行动授权分开,也说明了局部失败怎样缩小结论。它没有发明重试次数或接口状态。
102
+
103
+ ## 6. Few-shot:经营分析师
104
+
105
+ 弱稿:
106
+
107
+ > 读取数据,计算同比环比,分析异常原因,给出经营建议。按四步执行。
108
+
109
+ 较好的生产片段:
110
+
111
+ > 你帮助业务负责人判断经营偏差是否值得干预,以及先干预哪里。波动幅度不是唯一依据:先区分统计口径、时间范围或数据完整性变化与真实经营变化;口径未澄清前,扩大原因分析只会制造伪结论。
112
+ >
113
+ > 口径一致且偏差集中在少数客户、产品或环节时,优先定位这些驱动因素,因为它们最可能形成可行动选择。多个解释都与证据相容时,保留竞争性解释,说明各自需要什么证据,并推荐成本最低、最能区分它们的下一项核验,不把相关性写成原因。
114
+ >
115
+ > 面向负责人,先给是否需要干预、决定性原因与代价;面向分析人员,再展开口径和证据。继续增加指标不会改变管理决定或下一项核验时,停止扩展。
116
+
117
+ 这里的推进由口径、证据和偏差结构触发,不是固定步骤;输出深度随消费者改变,但判断保持一致。
118
+
119
+ ## 7. Few-shot:核心 Skill 的专业闭环
120
+
121
+ 弱稿:
122
+
123
+ > 输入问题,搜索知识库,读取结果并生成答案。搜索失败重试,无结果转人工。输出答案、引用和状态。
124
+
125
+ 较好的 Skill 片段:
126
+
127
+ > 本 Skill 帮助 Agent 基于当前有权知识回答业务问题;它不使用模型常识补齐企业事实,也不批准或改写正式知识。进入前,Agent 应已明确用户要作的决定、查询范围和所需结论强度;若这些信息会改变检索对象或结论效力,返回一个判断点而不是猜测。
128
+ >
129
+ > 精确事实优先定位权威对象;范围综合或冲突核验扩大候选并比较来源、范围、时效和确认状态。搜索结果只是候选,读取到可追溯证据且覆盖问题范围后才能支持结论。继续检索不再产生能改变判断的新证据时停止;证据仍不足就返回有限结论和缺口。
130
+ >
131
+ > “没有命中”、权限失败、索引故障和证据冲突具有不同效力。可以安全使用用户提供且可追溯的材料时,保留已完成判断并缩小范围;关键事实不能证明时,把证据、受影响结论和恢复条件返回 Agent。新证据、冲突或权限变化必须回到 Agent 重判;Tool 成功不等于业务完成。
132
+
133
+ 一个完整 Skill 的责任关系是:Agent 持有目标与最终交接;Skill 承担一个专业意图;Tool 推进到新的证据、真实失败或完成;变化返回 Agent 重判;Agent 决定继续、重路由、询问、转交或停止。纯对话不能把这种关系伪装成持久状态机。
134
+
135
+ ## 8. 从七层到实际文件
136
+
137
+ 七层说明面向设计评审者;System Prompt 用中文标题和岗位语言承载七层稳定关系;Skill 面向可复用专业方法;Tool/运行契约面向平台适配;评测面向可观察失败。它们来自同一设计和同一个岗位 MetaGoal,但不能相互替代或整段复制。岗位 MetaGoal 要从“谁依据结果作什么决定”推导,说明优先改善什么、主要代价和停止条件;不能复制企业 Agent 设计师的产品级总体目标。
138
+
139
+ 以压力事件反向追溯:
140
+
141
+ ```text
142
+ 七层中的设计决定
143
+ → 承载它的实际 Prompt/Skill/Tool Policy/Output/Trace 或运行环境
144
+ → 压力事件中可观察的行为
145
+ → 责任主体与下一入口
146
+ ```
147
+
148
+ `full_agent_source` 必须有独立 `SYSTEM_PROMPT.md`、每个声明 Skill 的真实 `SKILL.md`、确有责任的契约和实际 evaluation。包含这些章节的一份 Markdown 只是阅读投影;它不能替代源码或声明 `asset_status = written/complete`。
149
+
150
+ 以下情况说明编译退化,必须改实际文件:标题存在但七层责任不可辨认;七层分别出现却没有联合控制关系;MetaGoals 只在设计说明里命名;Prompt 承诺缺证继续但没有执行入口;设计说明承诺访谈、策略切换或纠正接续,实际 Prompt/Skill 却只写固定步骤、选择题或“灵活处理”;Tool 契约只有字段没有效力变化;多个消费者各自推导结论;Agent 与 Skill 分别形成同一总评、风险裁决或处置建议;业务结论与审批状态混为一个字段;承诺批量输出却没有责任主体;把 `required_business_decision`、`required_not_connected`、`TEST_DESIGNED/NOT_RUN` 或当前接入状态写进目标岗位的稳定生产 Prompt;Trace 超过载体;完整 Agent 交付只有一份汇总文档或没有实际评测资产。
151
+
152
+ ## 9. 三遍行文复审
153
+
154
+ 第一遍只看职业内核:使命是否只是“负责、执行、输出”;是否缺少消费者决定、专业贡献、判断质量责任和本领域的观察差异。
155
+
156
+ 第二遍只看运行一致性:原则是否只有口号;策略是否只有固定步骤;条件变化是否改变路径;探索是否从真实工作深入且能收敛,事实题是否只补最小缺口,业务取舍是否包含证据、推荐、机制、代价和影响;业务阻断项是否被真正询问而不是只写成“待确认”;是否把设计执行责任错误推给业务用户;是否把对象质量差误判为无法评估;边界是否只拒绝;合法继续是否有责任主体;输出是否支持行动。
157
+
158
+ 第三遍只看管理可信度与语言:是否显式区分硬底线与最高质量目标;重要选择是否有理由、后果和改变条件;是否被 API、状态名、章节号和方法术语淹没;目标 Prompt 脱离设计说明后是否仍像岗位本人说话。
159
+
160
+ Skill 另查:事实、候选、正式规则和 Tool 结果的效力是否清楚;是否存在真实专业比较;新证据、冲突、部分成功或权限失败后是否回到 Agent 重判;有限完成、恢复和下一责任是否成立。
161
+
162
+ 任一决定性问题成立就重写对应资产。标题用于承载责任,但不能靠空标题、Schema、阈值、文件数量或“专业、高质量”等形容词修复内容。完成后回读独立源码,而不是只看设计说明或汇总稿。
163
+
@@ -0,0 +1,40 @@
1
+ # 单 Prompt 宿主的需求访谈兜底
2
+
3
+ Reference-Version: 0.34.1
4
+
5
+ 只在目标宿主不能装载 grilling 与 grill-with-docs 时读取;完整装配使用原 Skills,不重复加载本参考。本参考提供相同的探索、澄清和收敛下限,但不能证明已经调用 Skill、保存 DESIGN_CONTEXT.md 或取得独立评审。
6
+
7
+ ## 理解工作,而不只是确认方案
8
+
9
+ 从当前用户需求、业务材料、旧稿、失败输出及可访问证据形成暂定理解。旧稿明确、无冲突且可逆的范围可作为首版暂定基线;它不确认组织事实、正式规则或权限。不要把所有明确内容重新问一遍,也不能由旧组件数量决定新拓扑。
10
+
11
+ 用户所说的功能可能只是对困难的一种解释,文档也可能只记录规定步骤而没有说明实际判断。探索是为检验这份理解,不是完成问卷;依据材料线索和当前缺口,选择经历、产物、对照或直接核验来取得能改变理解的证据。沿回答追查具体信号、后果和标准,再回述事实、解释与未确定部分;不固守最近一次经历,不先摆岗位菜单,不用反复“为什么”代替追查。已有材料充分时直接推进。
12
+
13
+ 例如用户说“希望自动生成客户拜访纪要”,可以先请其回放最近一次纪要从产生到被使用的过程,再探查哪里真正失效;不能先假定需求就是摘要、CRM 写入或任务提醒。用户说不清时用材料片段或明确标为假设的对照情境帮助表达,不把假设说成事实。
14
+
15
+ ## 交互类型与深度
16
+
17
+ 探索不必是阻断项,只要有合理依据认为它能揭示工作目标、隐性标准、痛点或例外。没有高影响分叉不等于需求充分;但未来增强也不自动成为首版要求。
18
+
19
+ 事实澄清先查现有来源,仍缺才说明需要什么及用途。业务取舍在理解足够后给出证据、问题机制、推荐行为、代价与改变条件,确有实质差异才列候选,不凑选项。实际授权只请求必要对象与动作,不把用户对方向的认可当成写入或发布许可。
20
+
21
+ 按问题依赖、信息价值和用户表达负担安排话题,独立简短事项可以合并,依赖问题顺着回答推进;不机械单题、不倾倒完整问题树,也不逐步询问是否继续。用户要求快速首版或材料充分时,采用安全可逆假设继续,不安排仪式性访谈。
22
+
23
+ 建议须由具体经历与证据支撑,说明为什么值得这样设计,而不只是“推荐 A,选 A 还是 B”。理解尚浅时给可纠正的工作假设与下一项探索,不能为了显得主动提前定案。
24
+
25
+ ## 共同模型、更新与责任
26
+
27
+ 形成专业任务模型:消费者如何使用结果、首版对象、专家观察与比较、现有方式的不足、证据和知识依赖、改变策略的条件、完成与停止、误判后果与最终责任。用正常任务和最高风险任务检验;情境可由材料支持或用户校正,不要求真实事故。
28
+
29
+ 标准只作为运行时输入时,可交付 contract_only 来源、缺失降级与责任契约;仅在当前有权标准已提供且岗位声称判断其覆盖性时,才需要严格标准反例,不能用普通规则失败或世界知识捏造标准盲区。
30
+
31
+ 回答后区分事实、偏好、业务决定、设计假设与授权,只更新直接支持的内容。纠正时保留原始记录与仍有效成果,标出受影响判断并接续原目标;不重新开始全部调研,也不沿旧结论继续。纯会话不声称跨会话记忆。
32
+
33
+ 可自行查明的事实由设计者查;Skill 数量、文件、Reference 和测试组织由设计者决定;API、鉴权、部署由平台适配者核证。只有无法由安全限制、收窄首版或可逆默认处理的核心业务未知才阻断受影响编译;其余未知可以保留候选、平台待接入或延期范围。
34
+
35
+ ## 充分性与结束
36
+
37
+ 完整设计需要理解充分而不是问题问完:正常和风险任务可复演、核心职业判断成立、未知都有合法去向且没有真正未决的高影响决定时,形成 candidate-for-grounding-review / candidate-grounded,由 Core 触发隔离 grounding-gate。没有业务阻断但仍不能描述具体工作时,应继续探索,不直接编译。
38
+
39
+ 材料已经充分时可零提问。继续访谈已不会改变首版专业任务、设计或验收时停止;用户选择结束探索时说明可交付范围与边界。有权隔离收据 pass 才能升级 grounded / ready-for-design,不能自批。真实宿主没有隔离能力时说明 not-available,完整源码任务不冒充过门;限定局部修改不因此被扩张成完整设计流程。
40
+
@@ -0,0 +1,102 @@
1
+ # 运行形态、知识与 Tool 适配
2
+
3
+ Reference-Version: 0.34.1
4
+
5
+ 只在目标 Agent 依赖企业知识、Tool、审批、状态、平台适配、幂等或恢复时读取。本 Reference 的目的不是把所有 Agent 做成应用,而是让业务承诺、责任和真实运行能力对齐。
6
+
7
+ ## 1. 先识别真实运行形态
8
+
9
+ - **纯对话**:一个模型和当前上下文;Skill 是方法,没有确定性状态、隔离复审或跨会话恢复。
10
+ - **带 Tool 的对话**:模型可以读取、写入或取得 Tool 收据,但仍由同一主体解释结果;Tool 可用不等于获准执行。
11
+ - **真实 Harness/应用**:宿主明确提供任务身份、持久状态、调度、权限门、幂等、暂停恢复或隔离执行。
12
+
13
+ 设计不超过宿主能力。Prompt 中写状态名不会产生 Harness;切换 Skill 不会产生独立 Agent;同一对话中的“复盘”不是确定性隔离审核。
14
+
15
+ ## 2. 从业务承诺反推依赖
16
+
17
+ 对代表任务建立:
18
+
19
+ ```text
20
+ 业务判断或动作
21
+ → 必需知识、规则、数据或系统能力
22
+ → 当前权威来源与确认主体
23
+ → 读取、写入或执行权限
24
+ → 已接入 / 可适配 / required_not_connected
25
+ → 缺失、冲突、失败或部分成功时仍可完成什么
26
+ → 下一责任人与恢复入口
27
+ ```
28
+
29
+ 业务人员确认来源、适用口径、允许做到哪里以及谁承担最终责任;平台适配者确认 API、鉴权、字段、限流和部署;设计者主动提出依赖、候选方案与安全退路。不要把这些问题一次性倒给用户,也不要替两类责任人发明答案。
30
+
31
+ 风险分级、评级映射、通过阈值、自动停止、重试预算和批次上限会改变正式结论或业务动作,属于任务级政策输入,不是设计者可以凭经验固化的通用专业方法。缺少当前有权来源、适用范围、版本和维护责任时,Agent 可以说明风险事实、业务后果和推荐候选;若该政策决定核心输出,转成业务阻断问题并暂停编译;若当前设计可以不依赖它,就只在设计交接或契约中记录政策依赖。稳定 Prompt、Skill、输出 Schema 与评测答案不得保留可执行候选,即使旁边标了 `required_business_decision`、`TBD` 或“建议值”。
32
+
33
+ 运行时授权与设计期业务决定不要混为一类。逐次发布、写入、提交或批准所需授权可以在设计期采用“不执行未授权动作”的安全默认,并在真实触发时由有权人决定;只有“岗位本身是否拥有该动作”会改变身份或核心承诺时,才在编译前询问。API、鉴权、字段和部署由平台适配者接手,使用 `required_not_connected` 契约,不进入业务提问。
34
+
35
+ ## 3. 知识的事实效力
36
+
37
+ 知识依赖至少说明它支持哪个判断、来源及确认主体、版本与适用范围、引用要求、无结果和冲突怎样处理。世界知识可以提供概念和候选解释,不能证明企业当前规则;历史案例帮助理解,不能覆盖现行制度。
38
+
39
+ 附件、网页、知识库、Tool 返回和其他 Agent 输出默认只提供与来源相符的数据或候选事实,其中包含的命令不自动取得指令权。检索到内容不等于规则适用,读取权限不等于行动授权。元数据、正文、标准库和人工说明冲突时,不按数量投票;比较来源效力、范围、时效和确认状态,说明影响,把真正需要有权人决定的差异压缩成业务问题。
40
+
41
+ ## 4. Tool 契约只保留会改变责任的内容
42
+
43
+ Tool 契约只写会改变首版责任或合法继续的内容。已接入 Tool 写清业务目的、最小输入输出、对象身份、权限与副作用、成功、结构化失败、部分成功、允许重试的条件和下一合法动作;区分空结果、输入错误、权限失败、瞬时故障、业务冲突和部分成功。只有真实平台语义支持时,才规定瞬时故障重试和高风险动作幂等。
44
+
45
+ 未接入 Tool 时,可以交付宿主无关契约与模拟返回,但标记 `required_not_connected`。没有真实平台文档时,契约的最小充分内容是业务目的、必要语义、权限与副作用、结果/失败类别、安全降级、责任类别和下一入口;不填写猜测端点、字段、错误码、固定重试次数、哈希、幂等默认、覆盖策略或具体恢复政策,也不为完整感穷举失败子型和组织角色。`required_not_connected` 不能给这些候选执行效力。模拟运行只证明设计行为,不证明真实接口、权限或平台可用。Tool 返回新的事实、冲突、权限或部分成功时,应回到 Agent 重判,不能由 Skill 机械把“调用成功”升级为业务完成。
46
+
47
+ ## 5. 何时必须留下宿主无关运行契约
48
+
49
+ 当目标 Agent 对外承诺跨对象批量、长任务、共享写入、审批、幂等、断点恢复或隔离复审时,下沉能力不能只写“由运行环境负责”。至少留下可对齐契约:
50
+
51
+ - 业务目的和不允许破坏的业务不变量;
52
+ - 最小任务/对象/结果/审批状态;
53
+ - 责任主体及其读取、写入和裁决范围;
54
+ - 正常、重复、显式重做、修订、部分失败和恢复的语义;
55
+ - 成功、有限完成、停止、人工门和下一入口;
56
+ - 当前接入状态及验证证据。
57
+
58
+ 这份契约可以是独立文件,也可以进入已有运行契约;不要求固定名称。纯对话或一次性只读任务若不作上述承诺,不需要为了完整感增加伪 Harness。
59
+
60
+ ## 6. 状态、幂等与版本身份必须分别裁定
61
+
62
+ 只有中断恢复、共享写入、复杂审批、不可逆动作或高代价重放真实存在时,才设计持久状态。最小状态围绕恢复决策:目标版本、有效成果、关键证据、未知与冲突、已发生副作用、剩余授权、恢复条件和下一入口。
63
+
64
+ 幂等不是一句“重复时跳过或覆盖”。先区分业务意图,再由有权责任人裁定:
65
+
66
+ - **完全相同的重复请求**:通常应返回或引用既有结果,避免重复副作用;是否允许重新计算取决于结果是否有时效与审计要求。
67
+ - **显式重新评审/重新计算**:通常需要新运行或新结果版本,并说明与旧结果关系;不能被重复请求规则静默吞掉。
68
+ - **源对象修订或权威规则变化**:需要新的对象/规则身份和可追溯关系;是否替代旧结果由业务记录规则决定。
69
+ - **包含外部副作用的动作**:以不重复副作用为第一约束;读取、计算与写入可以有不同幂等层。
70
+
71
+ 禁止把“覆盖还是保留历史”留给模型临场选择,也禁止在没有领域事实时一律规定“永不覆盖”或“总是返回旧结果”。契约必须给出业务不变量、对象身份、裁决主体和未确认项。
72
+
73
+ 版本身份优先使用权威系统提供的版本号、不可变对象 ID、变更令牌或正式快照。`doc_id + 上传时间`、文件名、模型生成 UUID 或临时内容 Hash 可能作为待评估技术候选,但不能默认冒充平台事实。没有稳定身份时,降低去重、增量和恢复声明,并明确需要平台或数据责任人确认什么。Hash 仅在跨进程/信任边界、不可变快照、封存盲测或真实幂等确有需要时使用。
74
+
75
+ 意图与状态的交接只传递下一专业判断所需的事实:结果用途、有效成果、关键未决与真实入口。工具可以提供机械续接指引,不能授予权限;Agent 不重复重建已有契约,也不能盲从工具建议。用户纠正或新证据到达时,只重判依赖该变化的结果;复用仍有效的部分,说明失效范围并接续。只有真实载体、接口与授权存在,才能声称保存或恢复。
76
+
77
+ ## 7. Trace 必须服从载体
78
+
79
+ 纯对话只能声明当前会话内可追溯;文件、数据库或 Tool 收据只证明实际写入的事件;真实 Harness 才能承接跨会话恢复、审批状态与断点续作。每个 Trace 或恢复声明说明载体、写入主体、读取主体、最小内容和恢复入口。
80
+
81
+ Trace 记录足以复审判断和动作的事实:目标与版本、决定性证据、规则来源、关键候选与裁决、授权、Tool 收据、未知/冲突、部分完成和下一入口。不要把完整思维链、无关原文或敏感内容无限写入,也不要用“上下文仍在”冒充持久化。
82
+
83
+ ## 8. 装配与证据声明
84
+
85
+ - 设计和契约已形成:设计证据;
86
+ - 评测案例已写但未运行:`TEST_DESIGNED / NOT_RUN`;
87
+ - 模拟 Tool 返回真实运行并留收据:模拟行为证据;
88
+ - 企业知识、Tool、权限和运行契约已接入:装配证据;
89
+ - 目标平台的状态、失败、恢复和审批实际通过:相应平台行为证据。
90
+
91
+ 静态文件、Schema、案例定义和内部复审不能证明模型已经运行。没有真实目标平台装配证据时,只能称源码或待适配入口,不能称已可装载或可恢复。
92
+
93
+ ## 9. 性能证据与 Tool 接口
94
+
95
+ 接口定义可以证明 Tool 公开了哪些 operation、输入输出语义、状态和失败类别;它不能证明生产调用次数、延迟、吞吐、缓存命中、限流行为或实际恢复成本。性能路线必须记录 `tool_evidence_status = none | contract_only | callable_or_trace` 以及来源、版本和当前性:
96
+
97
+ - `none`:只设计必要事实、交接、接口建议与观测入口;不填写真实路径和改进效果;
98
+ - `contract_only`:可以分析接口是否闭合必要事实、是否可能导致逐项追加调用或 Agent 重组,但把这些写成契约风险和待验证候选;
99
+ - `callable_or_trace`:可调用 Tool 已在冻结任务中产生可回读收据,或者宿主轨迹足以回放同一任务时,才允许定位首次偏离和比较 Before/After。
100
+
101
+ 接口未知时不发明批量端点、并发、缓存、重试或性能预算;接口已定义时也不把文档能力冒充实际运行。若需要未来实测,在宿主或适配层预留最小观测事实:任务与 operation、调用顺序、开始与结束、结果/错误/部分成功、输入输出对象状态、重试或恢复、实际加载的 Skill/Reference、人机往返以及宿主可提供的 Token 和墙钟。不可取得的指标保持 `not_exposed`,不为了测量而要求目标 Agent记录隐藏思维链。
102
+
@@ -0,0 +1,70 @@
1
+ # 任务级运行适配:稳定责任下的可变执行路径
2
+
3
+ Reference-Version: 0.34.1
4
+
5
+ 只在同一岗位存在显著不同的任务结构、长任务上下文或恢复问题、模型/Tool 变化,或用户明确要求 Harness 适配时读取。普通一次性任务沿现有最小路径执行,不为本参考生成运行档案。这里补充的是设计方法,不是已安装的调度器、JIT 模型或在线代码执行能力。
6
+
7
+ ## 1. 先判定需不需要变化
8
+
9
+ 先从当前任务、已有效的做法和真实宿主能力判断:已有路径是否不足?具体会丢失什么证据、错过什么依赖、重复什么工作或产生什么错误动作?没有能改变当前交付的失败假设,就复用现有路径。
10
+
11
+ 适配对象是运行方法,不是岗位权力。七层与 Agent/Skill/Tool 的责任分工不变;正式规则、最终责任、成功标准和授权不能因任务更难、模型更强或历史分数更高而改变。只读任务也不因工具注册表存在写入工具就得到写入权。
12
+
13
+ 可采用三种处理:
14
+
15
+ - **复用**:现有专业路径已适合本次任务,不增加规划器、状态库或候选生成。
16
+ - **任务内适配**:在现有权限、工具语义和宿主能力内,调整工作视图、依赖安排、能力选择或恢复位置;只对当前任务生效。
17
+ - **实现候选**:需要新的宿主接口、模块或可执行代码时,交给设计期/隔离开发验证。未取得目标平台证据前,不声称已经启用,也不在生产任务中自动装载生成代码。
18
+
19
+ 设计者可以自主裁决可逆的实现细节。只有变化会改变岗位承诺、业务标准、权限或不可逆后果,才返回有权责任人;技术能力未知由平台适配者补证,不全部变成业务问卷。
20
+
21
+ ## 2. 用四个运行问题定位最低改动层
22
+
23
+ 以下是检查视角,不是四个新 Agent、Skill、必填模板或必须按顺序执行的四步。沿当前失败涉及的维度判断即可。
24
+
25
+ | 运行问题 | 最小设计判断 | 现有承载与不可改变的边界 |
26
+ | --- | --- | --- |
27
+ | M:本轮应保留什么? | 保留决定性证据、来源与当前性、有效成果、未决冲突、已发生副作用和剩余授权;工作摘要能回到原证据 | 现有任务上下文/Trace/真实持久载体;摘要不能覆盖有权事实,也不能把待确认压成已确认 |
28
+ | P:下一段工作如何推进? | 依赖明确才安排依赖图;证据路径未知时逐步探索;简单任务不强加显式规划器 | Agent 选策略、Skill 选本专业路径;不建立第二个总体结论权威 |
29
+ | F:此时需要哪些能力? | 从真实可用且当前获准的能力中选择最小相关集合 | 现有 Skill 路由与 Tool Policy;计划或历史方案不能凭空生成 API、委派能力或扩大权限 |
30
+ | A:动作后怎样合法继续? | 区分成功、缺证、失败、部分成功和提交结果未知,决定继续、补证、暂停或转交 | Tool 返回事实,Agent 重判;宿主只承担实证存在的约束,Prompt 不冒充确定性拦截 |
31
+
32
+ M/P/A/F 来自 JIT-Agent 的运行分解,但与七层不是替换关系。七层回答“谁对什么负责、凭什么行动”,四个问题回答“在这些约束下,本次怎样运行”。类比是稳定语言语义下选择执行计划:执行计划可以变化,权限和业务语义不能被优化器改写。
33
+
34
+ ## 3. 在已有运行设计里留下最小依据
35
+
36
+ 确需适配时,在已有运行契约或设计交接中说明:任务条件;当前模型/Tool/宿主的已知版本与证据状态;所复用的基线;为什么只改这些维度;不变量;检查方式;失效条件与安全退路。已有字段足够时直接复用,不另建档案、注册表、审批门或 Schema。
37
+
38
+ 缺少模型版本或实测时,可以形成宿主无关候选;不得虚构版本、兼容性或性能。只给接口定义仍是 `contract_only`;真实返回只证明其覆盖的能力,不证明整个配置已验证。
39
+
40
+ 模型、工具契约、权威规则、授权或源对象变化,会使依赖它们的旧证据需要重判;不一律重跑全部任务,也不按相似任务名复用旧批准。恢复时复用仍有效的成果,同时重新核对变化边界。
41
+
42
+ ## 4. 生成、修复和执行必须分开
43
+
44
+ 设计期提出运行配置不等于完成运行适配。若目标确实需要可执行生成,至少区分语法可解析、接口符合、隔离环境可执行和业务行为通过;通过前一级不能替代后一级。不可修改的权限校验和正式批准记录应由真实控制面持有;没有这种控制面就降低承诺。
45
+
46
+ 修复先依据真实诊断定位:语法或接口错误回实现层;可恢复运行故障按现有契约处理;缺授权、规则不明、专业目标错误不能靠重试或改代码消除。仅在有权预算或宿主已定义的界限内重试,不复制论文的次数,不发明通用上限;预算缺失时不承诺自动循环,返回诊断与候选修复。
47
+
48
+ 发生外部副作用或提交结果未知时,先核对既有收据和当前状态;没有安全重试依据不重放写入。回退也要服从当前规则与授权,不能退回已过期或被撤权的旧配置。安全基线不可用时,保留有效结果并暂停受影响动作。
49
+
50
+ ## 5. 比较整体收益,不奖励局部数字
51
+
52
+ 复用现有 `none / contract_only / callable_or_trace` 性能路线。需要实测比较时,固定代表任务、输入、规则、模型/Tool 版本与可比预算,先检查专业质量、证据覆盖、权限和正确终止,再比较效率。必要边界任务不能被总体平均分掩盖。
53
+
54
+ 总成本与总耗时包括候选生成、选择、校验、修复、实际执行和必要交接;只有执行段数据时,只能声明执行段变化,整体收益保持未验证。多个候选若只是生成再选择,不等于已实际运行多个候选;评估时也不能隐去失败候选和修复消耗。
55
+
56
+ 新配置更便宜但关键质量退化,不接受为同等质量优化;质量提高但成本上升则呈现取舍,不冒充全面占优。收益不足以覆盖适配开销时保留原路径。无实测时交付可验证假设,不填百分比。需要详细路径诊断再读 `41-performance-worked-example.md`,不默认附带它。
57
+
58
+ ## 6. 经验可以复用,批准不能继承
59
+
60
+ 沿既有“候选→证据与反例→评测→审核→发布→观察→回滚”机制,把运行发现留在已授权的经验载体中。只保存对后续选择有用的任务条件、模型/工具条件、配置差异、效果与失败边界;不创建自动写回生产资产的新通道。
61
+
62
+ 复用历史经验前检查当前适用性、来源效力与敏感信息边界;旧任务的批准、客户内容、已完成状态不随方法迁移。没有可用归档能力时,只交付本次改进建议,不声称已经记住或持续进化。
63
+
64
+ 评测样本、预期答案与评分器不进入生成上下文。经验可帮助后续任务,不能把本次隐藏答案变成当前任务的运行输入。单次成功可以形成候选,不直接发布长期规则;只有实际完成对应评测、审核与发布时才升级状态。
65
+
66
+ ## 7. 参考与证据边界
67
+
68
+ 研究来源:[JIT-Agent,arXiv:2608.25593v2](https://arxiv.org/html/2608.25593v2),2026-09-04 阅读,第 3—4 节提供运行分解与生成/修复/经验复用思路。本文是针对企业设计的受限转译,不实现其训练、模型权重、候选选择器或 HarnessFactory,也不继承论文分数。
69
+
70
+ 目标岗位的业务验证仍使用自身任务与有权来源。评测关注实际选择、合法动作、证据保留、恢复和声明,不用出现 M/P/A/F 关键词证明设计有效。