enterprise-agent-designer 0.34.1
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/.codebuddy-plugin/plugin.json +66 -0
- package/CHANGELOG.md +729 -0
- package/DESIGN_NOTE.md +101 -0
- package/LICENSE +21 -0
- package/PACKAGE.yaml +209 -0
- package/README.md +109 -0
- package/RETROSPECTIVE_v0.1-v0.10.md +67 -0
- package/RUNTIME_ASSEMBLY.md +134 -0
- package/SYSTEM_PROMPT.md +139 -0
- package/agents/agent-designer.md +151 -0
- package/avatars/.gitkeep +0 -0
- package/avatars/expert.png +0 -0
- package/evaluation/README.md +60 -0
- package/evaluation/cases.json +2045 -0
- package/evaluation/document-reviewer-holdout.md +24 -0
- package/package.json +33 -0
- package/references/optional-host-workflow.md +105 -0
- package/scripts/check_agent_delivery.py +202 -0
- package/scripts/optional/workflow_controller.py +478 -0
- package/scripts/validate.py +437 -0
- package/scripts/verify_v0321_guards.py +410 -0
- package/skills/design-enterprise-agent/SKILL.md +131 -0
- package/skills/design-enterprise-agent/references/41-performance-worked-example.md +199 -0
- package/skills/design-enterprise-agent/references/cold-start-and-writing.md +163 -0
- package/skills/design-enterprise-agent/references/requirements-grilling.md +40 -0
- package/skills/design-enterprise-agent/references/runtime-and-integration.md +102 -0
- package/skills/design-enterprise-agent/references/task-adaptive-runtime.md +70 -0
- package/skills/design-enterprise-agent/scripts/finalize_agent_delivery.py +748 -0
- package/skills/grill-with-docs/SKILL.md +58 -0
- package/skills/grill-with-docs/references/design-context-format.md +101 -0
- package/skills/grilling/SKILL.md +62 -0
- package/skills/review-enterprise-agent/SKILL.md +86 -0
- package/skills/review-enterprise-agent/references/isolated-review-contract.md +154 -0
- package/skills/review-enterprise-agent/scripts/validate_review_receipt.py +338 -0
package/CHANGELOG.md
ADDED
|
@@ -0,0 +1,729 @@
|
|
|
1
|
+
# 版本变化
|
|
2
|
+
|
|
3
|
+
## v0.34.1(2026-09-04)
|
|
4
|
+
|
|
5
|
+
补齐 v0.34.0 的有材料访谈路线,并把给模型判断依据与向用户解释结论分开。
|
|
6
|
+
|
|
7
|
+
- 材料核证返回有来源的理解缺口,不再只在高影响业务分叉处交接访谈;同步 Core、装配与 DESIGN_CONTEXT,仍由 grilling 负责访谈,不增加角色。
|
|
8
|
+
- 设计师及目标 Prompt/Skill 优先说明业务目的、因果依据和边界,让模型根据当前事实推导路径;减少固定交互菜单,保留权限、证据和真实操作依赖。
|
|
9
|
+
- Review 检查依据是否进入实际资产及是否被局部命令抵消;继承 47 项案例,新增材料线索与依据迁移两项反例。
|
|
10
|
+
- v0.32.1 与本版的 Terra 对照单独保存于维护验证记录;不把案例定义、静态通过或有限模型样本称为全面质量提升、平台接入或业务有效。
|
|
11
|
+
|
|
12
|
+
## v0.34.0(2026-09-04)
|
|
13
|
+
|
|
14
|
+
主判断:设计师自身与生成的 Agent 共享意图状态、需求探索、恰当交互和纠正接续能力;访谈不能退化为在高影响分叉处让用户选择预设方案。
|
|
15
|
+
|
|
16
|
+
- 重构现有 grilling 的专业方法:具体经历、工作回放、隐性标准、痛点、例外和目标发现;先形成共同理解,再给有依据的建议,不用候选数量代替专业深度;
|
|
17
|
+
- Core、单 Prompt 兜底、装配与说明同步区分探索、事实澄清、业务取舍和授权;修正“必须全部前沿一起问”“旧稿明确范围不能作暂定基线”等冲突表述,保留正式授权边界;
|
|
18
|
+
- 既有 DESIGN_CONTEXT 记录受影响理解、有效成果与接续位置,不另建记忆或状态机制;
|
|
19
|
+
- Design 将条件协作写进目标 Prompt/Skill,Review 检查实际资产和关键对照;局部资产修改不强制完整调研门;
|
|
20
|
+
- 新增7项构造案例,修订8项旧交互预期,不把无依据的推荐岗位选择、全部问题同轮呈现或每题推荐包作为必需答案;其余32项定义不变;
|
|
21
|
+
- 不改终结器、评审收据、可选控制器和原性能工作包。保留四 Skills、双隔离门、agent_driven 与 JIT 条件参考;不声明实际平台安装、全套行为通过或普遍质量提升。
|
|
22
|
+
|
|
23
|
+
## v0.33.0(2026-09-04)
|
|
24
|
+
|
|
25
|
+
主判断:在稳定责任和权限内做任务级运行适配;不把研究系统的在线代码生成机制直接移植到企业岗位。
|
|
26
|
+
|
|
27
|
+
- 新增一份 Design/Review 共用的条件参考,覆盖复用优先、四个运行视角、诊断驱动修复、依赖变化、总开销比较及经验晋级;
|
|
28
|
+
- Core 只补一段稳定边界,Design/Review、装配清单与包声明建立实际路由;
|
|
29
|
+
- 保留四 Skills、双隔离门、`agent_driven`、终结器及原性能工作包;不改评审收据 Schema、宿主控制器和交付算法;
|
|
30
|
+
- 原 33 项行为案例不删除,新增 7 项可复演 fixture;修正案例说明中历史遗留的 31 项计数;
|
|
31
|
+
- 不宣称实现 JIT-Agent、完成模型训练、接入目标平台或取得论文所报告收益。方法基线仍为 1.8.5,1.8.6 仅用于现有机制对照;领域正文、协议与便携 Skill 未改版。
|
|
32
|
+
|
|
33
|
+
## v0.32.1(2026-08-20)
|
|
34
|
+
|
|
35
|
+
主判断:目标平台没有已核证的生命周期 Hook,默认控制面无法提供确定性拦截。本版不继续强化伪运行机制,而把完整交付改为 Agent 自驱,并把状态机降为可选平台参考。
|
|
36
|
+
|
|
37
|
+
- Core、Design Skill 与运行装配统一采用 `runtime_mode = agent_driven`:源码写入不是终态,Agent 主动完成冻结、Source Gate、终结器和 ZIP 回读;
|
|
38
|
+
- `WORKFLOW_CONTROL.md` 与控制器移到 `references/optional-host-workflow.md`、`scripts/optional/workflow_controller.py`,默认不加载;
|
|
39
|
+
- 删除“宿主自动继续、唯一合法动作、最终响应 Hook”等当前平台无证据支持的默认声明;
|
|
40
|
+
- 双隔离门、收据校验、冻结快照、终结器、四个 Skills、评级权威与可复演 fixture 下限保持不变;
|
|
41
|
+
- 明确一次 Agent 主动走完流程只证明该次执行,不证明平台拥有 Hook 或能阻止其他模型提前结束。
|
|
42
|
+
|
|
43
|
+
## v0.32.0(2026-08-20)
|
|
44
|
+
|
|
45
|
+
主判断:v0.31.0 的组件已经充分;本版做全局再平衡,让职业设计重新成为主链,让双门只做质量否决,并区分参考控制器与宿主强制。
|
|
46
|
+
|
|
47
|
+
- 重写 Core 与四个 Skills 的责任表达,保留七层、主动调研和自然解释;
|
|
48
|
+
- 标准依赖分为 `none / runtime-input-only / coverage-or-applicability`,只有最后一种要求严格标准反例;
|
|
49
|
+
- Terra 低/中推理同任务验证后,补强评级输出权威与自包含行为 fixture;
|
|
50
|
+
- 新增参考工作流控制器,区分 `not_attempted`、`invalid_receipt` 与 `tool_unavailable`;
|
|
51
|
+
- 保留四个 Skills、双隔离语义门、v1.8.5 性能路线、冻结快照和终结器。
|
|
52
|
+
|
|
53
|
+
## v0.30.0(2026-08-19)
|
|
54
|
+
|
|
55
|
+
主判断:v0.29.0 已经稳定完成需求调研、职业设计、双隔离复审与冻结交付;v1.8.5 新增的运行路径性能方法属于条件化新能力,不应进入 Core 或扩大角色体系。本版只让 Design 与现有 Source Gate 按 Tool 证据状态形成可复核的性能设计和声明。
|
|
56
|
+
|
|
57
|
+
- `design-enterprise-agent` 增加性能条件路线,只在用户明确要求路径、交互、上下文、恢复或性能优化,或者真实轨迹已经暴露重复工作时加载;
|
|
58
|
+
- 将 Tool 证据分为 `none`、`contract_only`、`callable_or_trace`:分别对应前瞻性能设计、契约路径分析,以及有实际调用收据或真实轨迹支持的实测性能优化;
|
|
59
|
+
- 新增 v1.8.5 唯一权威性能案例 Reference 的包内同步副本,明确禁止复制 Excel 字段、命令和收益比例;
|
|
60
|
+
- `runtime-and-integration` 增加接口定义与真实运行证据的效力边界,不发明批量端点、并发、缓存、重试或性能预算;
|
|
61
|
+
- 既有 `source-gate` 条件审查性能证据档位、同任务质量门槛、真实轨迹和声明边界,不新增性能 Agent、第五个 Skill 或第三个状态门;
|
|
62
|
+
- 新增无接口、仅接口契约、真实轨迹但墙钟未改善三项高信号案例;调用、上下文、Token、墙钟和业务价值分开声明;
|
|
63
|
+
- Core、grilling、grill-with-docs、双隔离门、终结器、收据 Schema 与已有 28 个行为基线保持不变;行为证据仍为 `designed_not_run`。
|
|
64
|
+
|
|
65
|
+
## v0.29.0(2026-08-17)
|
|
66
|
+
|
|
67
|
+
主判断:六组模型与推理档模拟证明 v0.28.0 的主体骨架已经稳定;最后的系统性差异来自源码门局部最优、模型重抄确定性字段和明确评测禁区缺少机器门禁。本版不增加角色、不重写优秀 Core,只让所有阶段服从同一个首版总体目标。
|
|
68
|
+
|
|
69
|
+
- Core、调研、Design 与两个隔离门共享“硬约束下支持首版消费者决定的最小充分 Agent”这一总体目标,同时保持调研、设计、复审和终结器分权;
|
|
70
|
+
- source-gate 新增业务影响审计:只有影响首版决定、权限/高风险副作用、专业闭环或当前交付的问题才能阻断;
|
|
71
|
+
- 发现一个失败类后必须同轮横向扫描全部同类资产并返回最小修复簇;初次源码门后默认最多两轮修订,但轮次不改变问题的阻断效力,第 4 轮及以后新发现的独立高影响失败类、仍具实质影响的同类漏审、本轮修改引入或此前无法发现的高影响失败仍可阻断;
|
|
72
|
+
- 宿主固定 `review_mode`、`review_scope`、`review_round` 与 `reviewed_snapshot_id`,模型只填写语义裁决;`authority_audit` 在两种模式下始终保持对象;
|
|
73
|
+
- 评测禁区经规范化后同时用于扫描与冻结快照身份,禁止更换禁区清单后复用旧 source-gate 收据;所有 source-gate 裁决都必须绑定当前快照,grounding-gate 固定使用 `not_applicable`;
|
|
74
|
+
- 新增轻量回归脚本,直接覆盖模拟收据、晚轮独立阻断、宿主固定位、路由枚举、禁区规范化和禁区快照身份;
|
|
75
|
+
- `DESIGN_CONTEXT.md` 增加总体目标、首版边界、明确评测禁区与只追加决定记录,当前状态投影不覆盖问题、推荐、理由和用户回答;
|
|
76
|
+
- 终结器新增可重复的 `--forbid-evaluation-term`,只对用户或有权材料明确禁止进入 evaluation 的原词执行字面门禁;
|
|
77
|
+
- 保留四个 Skills、中文七层、严格标准反例、双隔离门、冻结快照和行为证据边界;不新增专家团、通用 ADR、固定 Tool Schema 或模型能力分级。
|
|
78
|
+
|
|
79
|
+
## v0.28.0(2026-08-17)
|
|
80
|
+
|
|
81
|
+
主判断:v0.27.0 的主体骨架已经收敛;最后一轮只修正质量定义与标准覆盖混淆、评测无依据扩域、Skill 数据依赖悬空三个真实失败,不扩大产品架构。
|
|
82
|
+
|
|
83
|
+
主要变化:
|
|
84
|
+
|
|
85
|
+
- 严格标准反例新增结构化证据基础;用户对“高质量”的定义不能单独证明正式标准没有覆盖该要求;
|
|
86
|
+
- 无适用正式标准时允许 `not_applicable`,有适用标准但缺原文、授权范围或完整锚点时必须 `insufficient_basis`;
|
|
87
|
+
- `source-gate` 强制复演正常与最高风险案例,把发现分类为正式标准失败、证据缺口、范围假设或标准外风险;
|
|
88
|
+
- 未经当前需求、有权材料或已确认平台事实支持的移动端、离线、弱网等条件不得成为确定缺陷、政策或阻断项;
|
|
89
|
+
- 每个 Skill 必须闭合知识、历史数据、Tool 与人工输入依赖;缺口进入 `required_not_connected`、部分完成或转交;
|
|
90
|
+
- 新增 Review Skill 随附的轻量收据校验脚本,并让终结器检查源码审计字段;脚本只拦截结构缺失与显式矛盾,不裁决业务语义;
|
|
91
|
+
- 新增三个高信号回归案例;保持一个 Core、四个 Skills、双隔离门和冻结交付不变,行为证据仍为 `designed_not_run`。
|
|
92
|
+
|
|
93
|
+
## v0.27.0(2026-08-16)
|
|
94
|
+
|
|
95
|
+
主判断:v0.26.0 的单前台、双隔离门和冻结交付骨架已经成立;下一步不是扩大架构,而是让反例证据、失败原因与责任路由、逐轮收据和交接声明真正一致。
|
|
96
|
+
|
|
97
|
+
主要变化:
|
|
98
|
+
|
|
99
|
+
- 严格标准反例必须引用锚点原文与适用范围,逐项提供满足证据,并为额外风险提供当前用户、正式材料或已核证事实;禁止缩窄锚点语义或用未经核证的世界知识制造盲区;
|
|
100
|
+
- 锚点语义或风险事实不足时,`grounding-gate` 返回 `insufficient_basis` 并继续核证真实案例,不为完成反例格式勉强通过;
|
|
101
|
+
- 明确区分对象在已生效标准下不合格与 rubric/阈值/证据/权限/平台能力缺失:前者才按业务规则退回对象提供者,后者转交相应责任人并保留可确认部分;
|
|
102
|
+
- 隔离复审收据新增正整数 `review_round`;同一门每轮原始 JSON 独立保存,后轮通过不得覆盖前轮失败;
|
|
103
|
+
- 终结器交付收据改为 `handoff_status = ready_for_handoff`;最终回答提供 ZIP 路径但不把生成于回答之前的外部收据改写为 `complete`;
|
|
104
|
+
- 新增“未经核证世界知识制造严格反例”和“阈值缺失错误退回作者”两个高信号回归案例;更新既有源码门案例验证失败轮次留存;
|
|
105
|
+
- 不新增 Agent、Skill、Harness、通用 ADR、业务评分器或新的哈希链。行为案例仍为 `designed_not_run`。
|
|
106
|
+
|
|
107
|
+
## v0.26.0(2026-08-16)
|
|
108
|
+
|
|
109
|
+
主判断:v0.25.0 的单前台、双隔离门已经真实运行,骨架成立;新失败来自评审者仍可把载体当对象、用设计语境自我授权规则,并在复审后修改源码造成 ZIP 与声明漂移。本版只收紧这三个门,不新增角色或主 Skill。
|
|
110
|
+
|
|
111
|
+
主要变化:
|
|
112
|
+
|
|
113
|
+
- 专业任务必须明确首版业务对象并与 docx/pdf/md 等载体格式分离;
|
|
114
|
+
- 任一任务使用 rubric 都视为正式标准适用,不能因没有组织统一标准而把严格标准反例标为 `not_applicable`;
|
|
115
|
+
- `DESIGN_CONTEXT.md` 新增标准模式与规则权威台账;稳定规则必须追溯到当前用户、正式材料、已核证平台事实或低影响可逆默认;
|
|
116
|
+
- Review 强制把 Prompt、Skill、契约、输出 Schema 与评测答案都视为稳定资产;`required_not_connected` 不再中和猜测端点、字段、重试、哈希或幂等规则;
|
|
117
|
+
- `source-gate` 改为返回带专业任务审计、权威审计和 `reviewed_snapshot_id` 的原始 JSON 收据;
|
|
118
|
+
- 终结器新增送审快照、复审收据绑定、复审后源码变更检测、README 动态状态禁入、ZIP 内容一致性和外部交付收据;
|
|
119
|
+
- 新增针对本次真实失败的回归案例。当前模型行为与平台装配仍为 `designed_not_run`。
|
|
120
|
+
|
|
121
|
+
## v0.25.0(2026-08-16)
|
|
122
|
+
|
|
123
|
+
主判断:v0.24.0 的调研、七层、行文和交付骨架成立;反复失败已经收敛到“同一 Agent 同时形成候选和批准状态,导致调研结束与源码保真裁决不可靠”。本版不改成专家团,也不新增主 Skill,只为两个高返工转换加入真实隔离否决权。
|
|
124
|
+
|
|
125
|
+
主要变化:
|
|
126
|
+
|
|
127
|
+
- 调研 Skills 的最高状态改为 `candidate-grounded / candidate-for-grounding-review`,不能自批 `grounded / ready-for-design`;
|
|
128
|
+
- WorkBuddy `Agent` Tool 以 `general-purpose` 子智能体运行 `grounding-gate`,核对业务身份、正常与最高风险任务、严格标准反例、承重分叉及状态—正文一致性;
|
|
129
|
+
- 真实源码写入并内部回读后,由新的隔离子智能体运行 `source-gate`,检查跨资产权威、无权政策、停止语义、依赖真实性、评测真实性和专业结论责任重复;
|
|
130
|
+
- Review Skill 新增隔离复审契约,评审者只有通过/否决/退回权,不能修改、编译、打包或替业务人员决定;主 Agent 不能覆盖失败收据;
|
|
131
|
+
- 产品保持一个前台 Agent,不使用 TeamCreate,不维护常驻专家团;两个子智能体按需、顺序、一次性运行;
|
|
132
|
+
- 明确严格标准反例:只有对象真实满足全部显式锚点却仍不能支持消费者决定才成立,漏字段、低分和违反已有锚点不算;
|
|
133
|
+
- 明确同一总评、风险或建议只能有一个形成责任主体;隔离门通过后才允许状态升级或确定性终结器;
|
|
134
|
+
- 新增三项高信号回归案例。子智能体运行与目标模型行为仍保持 `designed_not_run`,静态文件不能冒充真实调用收据。
|
|
135
|
+
|
|
136
|
+
## v0.24.0(2026-08-16)
|
|
137
|
+
|
|
138
|
+
主判断:v0.23.0 的完整决策前沿解决了“少问、快进”,但没有解决“设计者未发现的问题不进入决策树”。测试中六项架构与流程决定问完后,模型仍不理解真实文档评审任务,却把前沿判空并开始编译。本版保留原骨架,只升级需求调研的完成语义。
|
|
139
|
+
|
|
140
|
+
主要变化:
|
|
141
|
+
|
|
142
|
+
- `grilling` 新增专业任务建模责任,以代表任务回放、正反例、标准反证、证据追踪和责任后果发现隐藏分叉;
|
|
143
|
+
- `ready-for-design` 改为双门:业务分叉已关闭或合法路由,且 `professional_task_status = grounded`;
|
|
144
|
+
- `grill-with-docs` 不只摘录显式待办,必须从材料建立正常与最高风险专业任务;每项决定保留问题、候选、推荐、理由、用户回答和设计影响;
|
|
145
|
+
- `DESIGN_CONTEXT.md` 新增专业任务模型、标准反例和专业任务缺口,不引入通用 ADR;
|
|
146
|
+
- Design Skill 必须回读并反证专业任务模型;Review Skill 检查是否以架构决策收集替代专业需求调研,并追溯稳定规则来源;
|
|
147
|
+
- 新增“六项表面决定已关闭但专业任务仍未成立”和“rubric 完整却遗漏真实使用风险”两项高信号案例;当前模型行为仍为 `designed_not_run`。
|
|
148
|
+
|
|
149
|
+
## v0.23.0(2026-08-15)
|
|
150
|
+
|
|
151
|
+
主判断:v0.22.0 的 Core、七层、Design/Review 主 Skills、两个调研支持 Skills 和交付体系均成立;真实问题是“一次只问一个”把交互节奏升级成调研目标,隐藏了已经独立可答的承重决定,也没有充分约束回答后的递归深挖。本版不改骨架,只调整调研 MetaGoal、决策前沿语义和直接受影响的交接与评测。
|
|
152
|
+
|
|
153
|
+
主要变化:
|
|
154
|
+
|
|
155
|
+
- `grilling` 改为每轮呈现完整当前决策前沿,不设置问题数量上限;同轮节点必须已经具备上游前提且彼此不依赖;
|
|
156
|
+
- 每个前沿问题继续要求当前判断、候选、推荐、理由、代价和设计影响,避免整轮提问退化成问卷;
|
|
157
|
+
- 用户回答后沿新术语、来源冲突、边界情境及责任后果重新计算,只有会改变设计主干的连锁反应进入下一轮;
|
|
158
|
+
- `grill-with-docs` 与 `DESIGN_CONTEXT.md` 同步记录完整前沿、回答状态和被阻塞的下游节点;继续保持轻量语境,不引入通用 ADR 体系;
|
|
159
|
+
- Design/Review/system-only fallback 统一采用决策前沿语义,删除与单问题规则冲突的现行条款;
|
|
160
|
+
- 新增完整前沿回归案例,并用静态检查阻止现行生产资产重新出现机械单问题限制;目标模型行为仍为 `designed_not_run`。
|
|
161
|
+
|
|
162
|
+
## v0.22.0(2026-08-15)
|
|
163
|
+
|
|
164
|
+
主判断:v0.21.6 已把需求调研前置,但实际测试仍由 Design Skill 一边澄清一边准备编译,导致问题选择偏向架构复用,并在一次回答后提前关闭剩余业务分叉。本版保留 Core、Design/Review 主 Skills、七层、行文、四路未决处理与交付体系,新增两个按需支持 Skills,让调研成为真实可调度闭环。
|
|
165
|
+
|
|
166
|
+
主要变化:
|
|
167
|
+
|
|
168
|
+
- 新增 `grilling`,承担依赖决策树、事实自查、单问题推荐包和逐轮重算;
|
|
169
|
+
- 新增 `grill-with-docs`,在有旧 Agent、Prompt、失败输出或业务材料时由 Core 与 `grilling` 同时装配,即时维护 `DESIGN_CONTEXT.md`;
|
|
170
|
+
- MetaGoals 新增“决策树收敛”和“设计语境沉淀”,Design Skill 改为消费 `ready-for-design` 交接;
|
|
171
|
+
- Review Skill 检查是否实际调度适用支持 Skill、是否用旧稿标签伪造设计语境、是否一次回答后提前编译;
|
|
172
|
+
- `requirements-grilling.md` 保留为单 Prompt 宿主兜底,不再把读取 Reference 声称为实际 Skill 调用;
|
|
173
|
+
- 新增有材料术语冲突、设计语境写入和编译暂停案例;目标模型行为仍为 `designed_not_run`。
|
|
174
|
+
|
|
175
|
+
## v0.21.6(2026-08-15)
|
|
176
|
+
|
|
177
|
+
主判断:v0.21.5 正确删除了伪确定性许可门,但仍把需求调研压缩成“是否存在阻断分叉”的内部判断;真实测试中模型发现了会改变岗位的解释,却用“材料可以推断”关闭,并把旧稿标签升级为当前确认。本版保持 Core、双 Skill、七层、行文、四路未决处理与交付体系不动,只重构调研—总体判断—用户对齐—生产编译主链。
|
|
178
|
+
|
|
179
|
+
主要变化:
|
|
180
|
+
|
|
181
|
+
- 完整新建、整体优化和重设计必须先研究需求、背景、原始材料、现有流程与失败证据,形成问题定义、Agent 必要性和总体设计判断;
|
|
182
|
+
- 新增最小业务身份锚:主要消费者、对象与决定、Agent 负责及不负责的相邻判断;旧稿不能独自关闭该锚;
|
|
183
|
+
- 要求生产编译前向用户交付自然的“调研与总体判断”;一句话新需求和无当前业务简报的旧稿重设计至少完成一次业务对齐;
|
|
184
|
+
- 明确 A/B/C、六大产线、rubric、HUMAN_GATE 等标签不等于语义清楚,“材料暗示”只能生成推荐候选;
|
|
185
|
+
- Design Skill 保留一次一题、推荐、代价、回答后重算决策树和四路未决分流;不新增问卷、许可脚本或来源登记表;
|
|
186
|
+
- Review Skill 先评设计依据、问题定义与业务身份锚,成品自洽不能抵消需求基础错误;
|
|
187
|
+
- 运行装配增加可选 `discovery → compilation` 宿主门,只控制写入阶段,不解析业务语义;
|
|
188
|
+
- 新增一个旧稿初始重设计回归案例,与一句话新建、部分回答后继续澄清、材料充分直接交付形成对照。
|
|
189
|
+
|
|
190
|
+
## v0.21.5(2026-08-15)
|
|
191
|
+
|
|
192
|
+
主判断:v0.21.4 把同一模型可写的来源登记表和许可文件当成可信业务门禁,结构上无法防止模型重写来源后为自己放行,也让澄清退化为填满六项事实。本版保留 Core、双 Skill、七层、Prompt 行文、评审交接和完整源码交付骨架,只对澄清与确定性交付边界做减法重构。
|
|
193
|
+
|
|
194
|
+
主要变化:
|
|
195
|
+
|
|
196
|
+
- 删除 `check_compile_readiness.py` 及四个来源/许可夹具,终结器移除 `--readiness` 与 `--source-registry`;
|
|
197
|
+
- 旧稿内容改按当前确认、沿用候选、安全限制和业务决定四条路径处理;
|
|
198
|
+
- 用户每次回答后只更新直接解决的分叉并重算决策树,既不一次问完,也不一问即编译;
|
|
199
|
+
- 最小充分共同理解不再要求六项字段全部确认,正式政策可退出生产资产,平台依赖交给适配者,可逆事项由设计师裁决;
|
|
200
|
+
- Review 交接同步四种证据状态,不再生成或要求编译许可;
|
|
201
|
+
- 确定性脚本只验证文件、Skill 身份、evaluation、ZIP 与 UTF-8 路径,不评价业务共识、设计质量或模型行为;
|
|
202
|
+
- 更新运行装配、评测案例、README、设计说明和版本校验。
|
|
203
|
+
|
|
204
|
+
## v0.21.4(2026-08-15)
|
|
205
|
+
|
|
206
|
+
主判断:v0.21.3 的提问协议与整体骨架成立;新失败来自许可主题合并过粗、来源标签由模型自填,导致一条用户回答被错误扩张为标准权威、最终责任和验收均已确认。本版只重构来源绑定与编译许可,不改 Core、双 Skill、三 Reference 和七层主干。
|
|
207
|
+
|
|
208
|
+
主要变化:
|
|
209
|
+
|
|
210
|
+
- 将五个合并承重主题拆为六项原子业务事实:消费者决定、对象范围、专业判断、标准权威、Agent 行动边界、最终责任;
|
|
211
|
+
- 核心交付与设计级验收改由设计师作可逆裁决,不再让业务用户确认文件结构和测试组织;
|
|
212
|
+
- 新增目标源码目录外的 `source-registry.json` 契约,`confirmed` 必须逐字引用当前用户或当前有权来源的真实片段;
|
|
213
|
+
- 用户回答后只更新原话直接支持的事实,不从消费者或岗位目的推导 rubric 维护者、发布/返工规则、最终责任与验收指标;
|
|
214
|
+
- 平台依赖与正式政策分别进入独立列表,不能补齐业务事实;无权评级、流转和业务验收政策继续从生产资产排除;
|
|
215
|
+
- 更新许可脚本、终结器、装配契约、Design/Review 交接和正反夹具;终结器必须同时接收 `--readiness` 与 `--source-registry`;
|
|
216
|
+
- 保持不新增第三个 Skill、固定问卷、哈希、业务评分器或模型上限测试。
|
|
217
|
+
|
|
218
|
+
## v0.21.3(2026-08-15)
|
|
219
|
+
|
|
220
|
+
主判断:v0.21.2 已经定义了何时澄清和怎样提问,真实失败来自同一模型可以把旧稿主张自行升级为当前确认并宣布共同理解门通过;本版不重构骨架,只增加带来源的编译许可和确定性状态门。
|
|
221
|
+
|
|
222
|
+
主要变化:
|
|
223
|
+
|
|
224
|
+
- 基于旧 Agent、旧 Prompt、编译稿或历史输出做整体优化/重设计时,固定读取业务语义澄清 Reference 并先核对来源;
|
|
225
|
+
- 新增五项承重事实的 `compile-readiness.json` 语义,只有当前用户明确陈述或当前有权来源可以确认;旧稿、历史输出和设计推断不能自证;
|
|
226
|
+
- 未决业务决定只激活一个完整 `active_decision`,`COMPILE_BLOCKED` 时不写生产源码,用户回答后更新许可并重跑;
|
|
227
|
+
- 新增随 Design Skill 分发的 `check_compile_readiness.py`,不使用哈希、不评价 Prompt 质量、不形成第三个 Skill;
|
|
228
|
+
- 终结器强制接收 `--readiness`,共同理解门未就绪时拒绝生成已验证 ZIP;
|
|
229
|
+
- Review 交接显式分开当前确认事实与旧稿作者主张,后续 Design 必须回到原始来源重建许可;
|
|
230
|
+
- 在既有 10 个高信号案例中增强许可门行为,并增加两份确定性正反夹具,不增加模型上限测试。
|
|
231
|
+
|
|
232
|
+
当前边界:许可脚本只能校验声明的来源类别、单问题和状态一致性;引用是否真正支持业务结论仍由 Agent 和评审负责。真实目标模型行为与目标平台写权限门控保持 `designed_not_run`。
|
|
233
|
+
|
|
234
|
+
## v0.21.2(2026-08-15)
|
|
235
|
+
|
|
236
|
+
主判断:v0.21.1 的 Core、七层、双 Skill、生产行文与共同理解门保持不动;本版只修复真实测试暴露的四个责任接缝,不做架构重构。
|
|
237
|
+
|
|
238
|
+
主要变化:
|
|
239
|
+
|
|
240
|
+
- 将“待确认”改为带动作语义的四路分流:业务阻断项现在询问并暂停,运行时授权采用不行动默认,平台依赖进入待接入契约,可逆设计未知由设计师默认推进;
|
|
241
|
+
- 明确业务阻断项不能只写入 overview/README 后继续编译,Review 将“记录但未询问”判为主动协作失败;
|
|
242
|
+
- 未确认的风险等级、阈值、评级映射、停止和重试规则不得借 `required_business_decision`、`TBD` 或“建议值”标签进入目标 Prompt、Skill、输出 Schema 或评测答案;
|
|
243
|
+
- 增加对象质量与评估可靠性的区分,避免评审 Agent 因对象很差而停止本应完成的判断;
|
|
244
|
+
- 增加多消费者同源投影、业务结论与审批状态分离、跨对象输出必须有责任主体的复审点;
|
|
245
|
+
- 终结器将确定性结果改为 `package_status = packaged_verified` 与 `handoff_status = pending`;只有最终可访问 ZIP 被回读并在回答中给出准确路径后,才声明用户交接完成;
|
|
246
|
+
- 直接增强既有 10 个高信号案例,不新增第三个 Skill、案例数量、评分器或重型状态机。
|
|
247
|
+
|
|
248
|
+
当前边界:本版执行结构、版本、Skill、语义、打包和最终 ZIP 回读验证;真实目标模型行为仍为 `designed_not_run`,平台装配仍为 `designed_not_run`。
|
|
249
|
+
|
|
250
|
+
## v0.21.1(2026-08-15)
|
|
251
|
+
|
|
252
|
+
主判断:v0.21.0 的共同理解门和整体骨架成立;真实验证失败来自提问契约可被拆开执行,以及业务决定与设计执行决定没有显式分流。
|
|
253
|
+
|
|
254
|
+
主要变化:
|
|
255
|
+
|
|
256
|
+
- Core 与 Design Skill 将阻断式提问定义为完整决策提问包,强制包含当前判断、推荐、理由/代价和后续设计影响;
|
|
257
|
+
- 证据不足时推荐安全默认或下一核证动作,不编造具体业务答案,也不只抛问题;
|
|
258
|
+
- 明确 Skill 切分、`full_agent_source`、文件结构、Reference、契约、评测与打包由设计师自主裁决;技术选择只有在改变业务承诺时才翻译为业务问题;
|
|
259
|
+
- Design Skill 增加发问前检查,Review Skill 把裸问题与实施责任上推判为主动协作失败;
|
|
260
|
+
- `requirements-grilling.md` 增加跨领域正反例,既约束弱模型,又不把表达固化成唯一模板;
|
|
261
|
+
- 在既有 10 个高信号案例中增加提问包和自主交付裁决的可观察要求,不增加案例数量或重型校验器。
|
|
262
|
+
|
|
263
|
+
当前边界:本版只执行受影响资产的静态、打包和回读验证;真实目标模型行为仍为 `designed_not_run`,平台装配仍为 `designed_not_run`。
|
|
264
|
+
|
|
265
|
+
## v0.21.0(2026-08-15)
|
|
266
|
+
|
|
267
|
+
主判断:保留 v0.20.0 的七层、双 Skill、生产行文、政策边界和交付终结器,只补设计前的业务语义共同理解与评审后的可消费交接。
|
|
268
|
+
|
|
269
|
+
主要变化:
|
|
270
|
+
|
|
271
|
+
- Core 增加“语义落地”任务目标和最小充分共同理解门;负载决定未解决前只交付候选与影响分析,不写生产源码;
|
|
272
|
+
- Design Skill 增加业务语义与设计共识:先查事实,再把待决定事项组织成依赖树,每轮只问一个问题并附候选、推荐、代价和连锁影响;
|
|
273
|
+
- 新增按需 `requirements-grilling.md`,吸收 grilling 的决策依赖和 domain-modeling 的术语挑战,但不新增第三个 Skill,不采用完整问卷或多问题一轮;
|
|
274
|
+
- Review Skill 增加负载术语质疑和评审交接单,明确事实、因果判断、争议术语、保留/重建/删除建议、待决问题与证据边界;
|
|
275
|
+
- Design 消费评审时必须回读原始材料并接受、质疑或待决,不能把评审建议直接升级为业务事实;
|
|
276
|
+
- 更新原有弱稿重设计案例:面对“六大产线、业务/通用文档、rubric、A/B/C、HUMAN_GATE”先问清评审目的,不得直接写文件;材料充分的直接交付案例保持不变。
|
|
277
|
+
|
|
278
|
+
## v0.20.0(2026-08-15)
|
|
279
|
+
|
|
280
|
+
主判断:保留 v0.19.0 的 Core、双 Skill 语义主干和行文质量;本版只补职业设计之外的责任边界,不以重写 Prompt 解决打包与规范问题。
|
|
281
|
+
|
|
282
|
+
主要变化:
|
|
283
|
+
|
|
284
|
+
- 将完整文档评审 Few-shot 从运行 Reference 移入隔离 holdout,运行时仅保留跨领域示例与抽象机制,降低同领域复述和旧事实泄漏;
|
|
285
|
+
- 风险等级、评级封顶、阈值、停止动作、重试预算等统一归为任务级政策,缺少当前权威来源、范围、版本和维护责任时只能作为 `required_business_decision` 候选;
|
|
286
|
+
- 生成 Skill 强制使用 hyphen-case,frontmatter 的 `name` 与目录一致并提供触发 `description`,平台专有 ID 由适配层映射;
|
|
287
|
+
- 新增随 Design Skill 分发的 `finalize_agent_delivery.py`,确定性校验源码和 Skill 可装载性,使用 Python 生成 UTF-8 ZIP 并回读内容一致性;
|
|
288
|
+
- 资产状态改为收据驱动:成功 ZIP 收据为 `complete`,仅源码通过为 `source_verified`,脚本缺失、失败或未打包为 `written_unverified`;
|
|
289
|
+
- README 不再以手工文件数量作为资产事实;根目录检查脚本降为产品发布期兼容检查,不再成为安装后运行依赖。
|
|
290
|
+
|
|
291
|
+
## v0.19.0(2026-08-14)
|
|
292
|
+
|
|
293
|
+
主判断:v0.18.0 的 Core 与资产体系已经成立,下一步不应继续增加规则;真正需要恢复的是两个 Skill 的专业推理中心。Design 必须说明本次策略为什么这样组成,并在设计质量成立后才冻结资产;Review 必须从最低失败层形成因果裁决,解释不可抵消性、保留项和改变裁决的证据。
|
|
294
|
+
|
|
295
|
+
主要变化:
|
|
296
|
+
|
|
297
|
+
- 全面重写 Design Skill,恢复 v0.13.0 的任务策略依据链:当前行为缺口、直接证据、所选 MetaGoals、所需 Reference/知识/Tool、工作依赖、主要代价、改变条件和停止条件;
|
|
298
|
+
- 明确后续设计工作是依赖关系而非固定流水线,已有证据允许跳过、独立核对允许并行、新事实触发策略重组;
|
|
299
|
+
- 将“交付形态冻结”与“资产计划冻结”分开,开局只决定是否交付完整源码,职业行为和责任拓扑通过内部反证后才确定 Skill、契约和具体文件;
|
|
300
|
+
- 恢复“设计质量先于资产编译”,禁止用标题、Schema、文件或设计说明弥补职业内核和条件策略缺口;
|
|
301
|
+
- 全面重写 Review Skill,用正常任务与联合压力事件定位最低失败层,形成“责任失败→行为变化→消费者后果→修改深度”的最短因果链;
|
|
302
|
+
- 裁决增加不可抵消原因、有效能力保留、最低修复责任和裁决改变条件;新增发现不再改变裁决、修改深度或证据等级时停止;
|
|
303
|
+
- Core 只补 system-only 评审兜底,不复制 Skill 方法;在既有弱稿重设计和只读评审案例中增加可观察要求,不增加案例数量;
|
|
304
|
+
- 保持一个 Core、两个 Skills、两份 References、10 个案例和轻量确定性检查,不增加第三个 Skill、SHA、评分器、重型 Schema 或目标模型上限测试。
|
|
305
|
+
|
|
306
|
+
当前边界:本版执行结构、版本、引用、Skill 和案例校验,并复核交付脚本;`behavior_evidence = designed_not_run`,`platform_assembly = designed_not_run`,`maturity_claim = not_claimed`。
|
|
307
|
+
|
|
308
|
+
## v0.18.0(2026-08-14)
|
|
309
|
+
|
|
310
|
+
主判断:v0.17.0 是历代最可靠的七层与资产控制外壳,却不是最有思想、最自然的 System Prompt。v0.18.0 不再补门禁,而是以 v0.13.0 的因果链、Principles、MetaGoals 和条件策略重建设计师大脑,再把 v0.8.0 的行为蓝图、v0.10.0 的运行现实、v0.11.3 的行文标准、v0.15.0 的编译保真、v0.16.0 的三遍编译和 v0.17.0 的中文七层/独立源码门重新分配到正确资产。
|
|
311
|
+
|
|
312
|
+
主要变化:
|
|
313
|
+
|
|
314
|
+
- 全面重写 Core,恢复“业务问题/消费者决定→岗位责任→专业贡献→目标行为→最小运行资产→证据”的主因果链;
|
|
315
|
+
- 恢复带触发、代价与停止条件的可组合任务目标,明确一句话需求、澄清、优化、重设计与只读评审的条件判断;
|
|
316
|
+
- 保留业务化中文七层和联合控制,同时加强每层中的职业观察、专业比较、主动候选、解释理由与拒绝后的合法继续;
|
|
317
|
+
- 重写 Design Skill:先建立行为基线和历史最佳行为守恒,再设计七层与最小责任拓扑,最后完成职业内核、条件运行、管理可信三遍编译和真实资产回读;
|
|
318
|
+
- 重写 Review Skill:先独立建立目标职业行为,再裁决生产行文、七层联合关系、专业 Skills、运行现实、历史能力守恒、真实资产和证据;
|
|
319
|
+
- Writing Reference 新增本产品八组历史经验的“有效能力/不继承副作用”矩阵,保留原有外部参考与三个领域 Few-shots;
|
|
320
|
+
- 承认 Skills 默认只是同一 Agent 的方法;没有隔离上下文、持久状态和真实调度时,不声称独立评审或 Harness;
|
|
321
|
+
- PACKAGE capabilities 去重,只保留实际产品能力;继续保持一个 Core、两个 Skills、两份 References、10 个案例和一个轻量交付检查器;
|
|
322
|
+
- 不增加第三个 Skill、固定目录数、SHA 链、Prompt 评分器、全量 Schema 或目标模型上限测试。
|
|
323
|
+
|
|
324
|
+
当前边界:本版执行结构、版本、引用、Skill、语义、交付脚本正反例和 ZIP 校验;`behavior_evidence = designed_not_run`,`platform_assembly = designed_not_run`,`maturity_claim = not_claimed`。
|
|
325
|
+
|
|
326
|
+
## v0.17.0(2026-08-14)
|
|
327
|
+
|
|
328
|
+
主判断:v0.16.0 的职业设计与行文主线有效,但“标题与文件结构保持开放”被弱模型解释成可以取消七层责任导航,并用一份内容齐全的设计文档代替独立源码。v0.17.0 恢复历史优质 Prompt 的中文结构、v1.8.4 的七层联合关系和 v0.15.0 的独立资产身份,同时保留 v0.16.0 的职业深度与条件策略。
|
|
329
|
+
|
|
330
|
+
主要变化:
|
|
331
|
+
|
|
332
|
+
- 产品 Core 自身改用七个中文设计标题,并在开篇显式说明底线否决、岗位分流、Principles/MetaGoals 选策略、Skill/Tool 执行反馈、Output/Trace 分工的联合控制关系;
|
|
333
|
+
- 目标 System Prompt 默认使用可一一映射七层的业务化中文标题;允许领域化改名和有依据的合并,但不能因“表达自然”让层级身份或联合关系消失;
|
|
334
|
+
- 写作 Reference 的文档评审 few-shot 改为带中文七层标题的完整生产片段,同时保留身份张力、质量优先级、表面/实质判断、条件策略、拒绝后继续与统一结论投影;
|
|
335
|
+
- Design Skill 在写入前冻结 `full_agent_source`、`local_asset_edit` 或 `design_only`;完整 Agent 默认不得降级为单文档方案;
|
|
336
|
+
- 恢复 v0.15.0 的明确资产不变量:独立 `SYSTEM_PROMPT.md`、每个声明 Skill 的真实 `SKILL.md`、确有责任的契约与实际 evaluation;汇总编译稿只能作为阅读投影;
|
|
337
|
+
- Review Skill 对“单一 Markdown 包含全部章节并自称源码已写入”直接判资产声明失败,并同时检查中文标题与联合关系;
|
|
338
|
+
- 交付检查器新增重复 `--require-path`,将任务冻结清单中的 Skill、契约和其他必需源码逐项变成确定性检查对象;ZIP 也必须包含全部必需路径;
|
|
339
|
+
- 在原有10个案例中加入最新单文件失败、无标题、七层孤立和 `--require-path` 观察,不新增第三个 Skill、评分器、固定 Skill 数量、SHA 或重型语义校验器。
|
|
340
|
+
|
|
341
|
+
当前边界:本版执行结构、版本、引用、Skill、语义、交付脚本正反例和 ZIP 校验;不执行新的模型上限测试,`behavior_evidence = designed_not_run`,`maturity_claim = not_claimed`。
|
|
342
|
+
|
|
343
|
+
## v0.16.0(2026-08-14)
|
|
344
|
+
|
|
345
|
+
主判断:此前问题不是继续缺少若干写作要求,而是关键能力分散在 Core、Design Skill、References 和末尾门禁中,导致模型选择性执行。v0.16.0 不做局部补丁,重新分配四类资产的责任,并把产品收敛为“目标职业行为到真实运行资产”的统一编译器。
|
|
346
|
+
|
|
347
|
+
主要变化:
|
|
348
|
+
|
|
349
|
+
- 全面重写 Core 与 Design Skill 的责任关系:Core 保留身份、质量优先级、七层、MetaGoals、路由和证据底线;Design Skill 统一承担事实合同、职业行为、七层联合设计、最小拓扑、三遍编译、实际文件反证和评测交付;
|
|
350
|
+
- 生产 Prompt 从固定栏目检查改为八项行为功能,并以职业内核、运行一致性、管理可信度三遍编译;吸收历史优质版本的身份张力、质量优先级和推进感,以及后续版本的表面/实质判断、条件策略与拒绝后继续;
|
|
351
|
+
- 明确“你不是 X”是可选修辞,推进关系不是固定 SOP,通用风险类型学不是跨岗位规则;强模型可重组表达和推导策略,弱模型仍有显性责任下限;
|
|
352
|
+
- Review Skill 收敛为只读裁决,按职业设计、生产表达、责任拓扑、资产编译、运行装配和证据声明定位最低失败层,不复刻设计流程;
|
|
353
|
+
- 运行 Reference 改为按业务承诺触发的宿主无关契约;幂等、重评、修订和副作用按业务不变量与责任主体裁定,不把“跳过或覆盖”留给模型,也不套统一的永不覆盖规则;
|
|
354
|
+
- 权威系统缺少稳定版本身份时降低声明并提交待确认项,不把 `doc_id + 上传时间` 或临时 Hash 冒充平台事实;
|
|
355
|
+
- 完整 Agent 设计默认交付正常与最高风险两个实际评测案例;局部 Prompt/Skill 修改只处理受影响范围,不因完整感扩张目录;
|
|
356
|
+
- 保持一个 Core、两个 Skills、两份 References、10 个案例与轻量确定性检查,不增加第三个 Skill、模型分级、SHA 链、评分器或重型语义校验器。
|
|
357
|
+
|
|
358
|
+
当前边界:本版执行结构、版本、引用、Skill、语义、交付脚本正反例和 ZIP 校验;不执行新一轮模型上限测试,`behavior_evidence = designed_not_run`,`maturity_claim = not_claimed`。
|
|
359
|
+
|
|
360
|
+
## v0.15.0(2026-08-14)
|
|
361
|
+
|
|
362
|
+
主判断:v0.14.0 已能生成独立源码和较自然的职业 Prompt,但新冷启动结果暴露了编译保真缺口——七层在设计说明中成立,不等于已经进入生产 Prompt、Skills、Tool Policy、Output 和 Trace;交付脚本若只是建议执行,也阻止不了乱码 ZIP 和缺失评测资产。
|
|
363
|
+
|
|
364
|
+
主要变化:
|
|
365
|
+
|
|
366
|
+
- 新增任务级七层编译收据:每层设计决定必须映射到真实运行资产、压力事件行为与责任主体;不要求目标 Prompt 使用七个标题或固定文件;
|
|
367
|
+
- 明确每条缺证降级、拒绝后继续、Tool 失败和人工转交都要有唯一责任主体与下一入口,拦截“仍可完成通用检查”却无人承担的路径;
|
|
368
|
+
- 目标 Agent 的主动协作增加“先读材料形成建议—必要时给候选、推荐、影响和一个问题—非交互则结构化转交”;
|
|
369
|
+
- Tool Policy 补足事实效力、指令权与行动授权的区分,以及来源冲突与规则不适配后的重判;多消费者从统一业务结论投影;Trace 声明服从真实载体;
|
|
370
|
+
- 用户要求测试,或目标存在外部依赖、人工转交、越权与缺证降级等决定性行为时,必须形成实际评测资产,设计说明中的压力事件不能替代;
|
|
371
|
+
- `check_agent_delivery.py` 增加 `--require-evaluation` 与可选 `--evaluation-path`;生成 ZIP 或脚本可运行时必须检查,失败后修复并重跑;
|
|
372
|
+
- 保持两个 Skills 和10个案例,不增加固定七层模板、模型分级、SHA、评分器或重型语义校验器。
|
|
373
|
+
|
|
374
|
+
当前边界:本版只执行结构、版本、引用、Skill、脚本正反例、语义与压缩包验证;`behavior_evidence = designed_not_run`,`maturity_claim = not_claimed`。
|
|
375
|
+
|
|
376
|
+
## v0.14.0(2026-08-14)
|
|
377
|
+
|
|
378
|
+
主判断:v0.13.0 的认知内核在正确装配后已经能够生成职业内核清楚、Skill 收敛、边界后可继续且包含真实文件的 Agent 包;剩余失败不需要新的方法层,而是旧稿事实被继承、目标 Prompt/Skill 仍可进一步职业化,以及源码存在却没有确定性交付收据。
|
|
379
|
+
|
|
380
|
+
主要变化:
|
|
381
|
+
|
|
382
|
+
- Design Skill 增加五类事实效力账本:当前确认、旧稿主张、设计假设、未知冲突与运行证据;旧 HUMAN_GATE、审批、样本量、阈值、接口和成熟度不再自动进入生产事实;
|
|
383
|
+
- 目标 System Prompt 增加判断质量责任、主动候选与必要询问;API、幂等、调度、重试、统计和恢复下移,不让实现细节挤占职业纲领;
|
|
384
|
+
- 目标 Skill 改用“业务意图 × 当前状态”组织专业路径;候选匹配要求支持与反证,不用模型自报置信度;跨文档 Skill 下移去重、版本判断和中断恢复;
|
|
385
|
+
- 写作 Reference 增加第二遍专业编译,吸收文档评审 v1.0 的有效写法与剩余问题,不复制其岗位事实和文件结构;
|
|
386
|
+
- 新增 `scripts/check_agent_delivery.py`,机械核对独立入口、相对引用、声明 Skill 和 ZIP 非 ASCII 路径编码;不评分设计、不固定文件数、不构成可装载或行为证据;
|
|
387
|
+
- Core 与 Review Skill 区分源码完整和平台可装载;没有目标平台装配回读时不得使用“已可装载”;
|
|
388
|
+
- 保持10个案例,只在原案例中加入旧稿事实继承、Prompt/Skill 二次编译与交付收据;不增加模型能力分级、第三个 Skill、SHA、评分器或前向模型测试。
|
|
389
|
+
|
|
390
|
+
当前边界:本版只执行结构、版本、引用、Skill、脚本正反例、语义与压缩包验证;`behavior_evidence = designed_not_run`,`maturity_claim = not_claimed`。
|
|
391
|
+
|
|
392
|
+
## v0.13.0(2026-08-14)
|
|
393
|
+
|
|
394
|
+
主判断:v0.12.0 修正了运行装配,却仍把产品写成质量门与交付控制器。设计/评审其他 Agent 的“工业母机”必须先把七层、价值判断、MetaGoals、状态判别和可解释协作编译进自身;弱模型护栏只能规定最低行为,不能成为强模型的固定推理路径。
|
|
395
|
+
|
|
396
|
+
主要变化:
|
|
397
|
+
|
|
398
|
+
- 全面重写 `SYSTEM_PROMPT.md`,用身份对比、业务目标链、Constitution、Role、带因果解释的 Principles、八类可组合 MetaGoals、Skill/Tool 责任、Output 与 Trace 构成设计师自己的七层内核;
|
|
399
|
+
- 将澄清、直接设计、重设计、两次内部评审与只读评审改为“用户意图 × 当前状态 × 证据与授权”的判别,不再依赖关键词或固定阶段;
|
|
400
|
+
- 明确一句话需求先形成推荐岗位假设,只有高返工责任分叉才给候选、推荐、代价并每轮询问一个业务问题;
|
|
401
|
+
- Design Skill 改为依赖式专业方法:允许跳过已成立环节、并行核对独立证据、组合或推导临时策略;保留候选与真实资产两次内部反证,但不调用 Review Skill 自我审批;
|
|
402
|
+
- Review Skill 收敛为真正的只读质量裁决,按职业设计、生产文案、专业 Skill/责任拓扑、资产和运行证据定位最低问题层,不用清单平均决定裁决;
|
|
403
|
+
- 写作 Reference 增加 Claude Design 式协作解释:重要选择说明推荐、原因、影响/代价与改变条件,高返工方向先展示行为骨架;Few-shots 是最低质量对照而不是模板;
|
|
404
|
+
- 保留 v0.12.0 精确路径装配、输入材料身份隔离与 system-only fallback;增加同一 Core 下的强弱模型装配原则,不维护弱模型简化岗位;
|
|
405
|
+
- 原有 10 个高信号案例内更新七层自我治理、MetaGoal 组装、评审语义和强模型自由,不增加测试数量,不执行模型上限测试;
|
|
406
|
+
- 不增加第三个 Skill、评分器、固定 Prompt 长度/标题/步骤、固定目录、SHA 或伪 Harness。
|
|
407
|
+
|
|
408
|
+
当前边界:本版只执行结构、版本、引用、Skill、语义与压缩包校验;目标模型行为和目标平台装配均未运行,`behavior_evidence = designed_not_run`,`maturity_claim = not_claimed`。
|
|
409
|
+
|
|
410
|
+
## v0.12.0(2026-08-14)
|
|
411
|
+
|
|
412
|
+
主判断:v0.11.3 的内容没有导致最新回退;真正失败是运行装配。关键质量被放在 Design Skill 和写作 Reference,但对话宿主未可靠加载它们,又允许模型搜索旧 `design-domain-agent`,使旧编译稿重新成为实际方法。提示词不能单独创造确定路由,因此本版同时修正 Core 兜底、Skill 身份和平台装配。
|
|
413
|
+
|
|
414
|
+
主要变化:
|
|
415
|
+
|
|
416
|
+
- Core 明确旧 Prompt、编译稿、协议、Skill 名称、批准和成熟度声明均为任务材料,不具有当前指令权;
|
|
417
|
+
- Design/Review Skills 改名为 `design-enterprise-agent` 与 `review-enterprise-agent`,Core 与包配置只允许精确路径装配,不再让模型全局搜索同类 Skill;
|
|
418
|
+
- Core 增加 system-only 对话宿主的设计与只读评审最小闭环,Skill 未装配时继续执行本产品下限,不寻找旧方法替代;
|
|
419
|
+
- Core 完成门直接拦截本次真实失败:单编译稿、章节号式生产 Prompt、伪 Skill、无权参数与接口、无运行证据却提升成熟度;
|
|
420
|
+
- 新增 `RUNTIME_ASSEMBLY.md`,规定 Core、选中 Skill、按需 Reference 与用户材料的身份和装配顺序;
|
|
421
|
+
- `PACKAGE.yaml` 增加 design、review 和 system-only 三种激活配置,平台适配者可以直接映射;
|
|
422
|
+
- 更新两个既有高信号案例,覆盖旧稿内嵌方法接管与宿主没有 Skill 自动装配时的 Core 兜底;不增加案例数量或前向模型测试。
|
|
423
|
+
|
|
424
|
+
当前边界:装配契约只能指导或约束宿主配置,不能靠 Prompt 证明平台实际遵循。静态验证通过不等于行为通过,`behavior_evidence = designed_not_run`。
|
|
425
|
+
|
|
426
|
+
## v0.11.3(2026-08-14)
|
|
427
|
+
|
|
428
|
+
主判断:v0.11.2 已有对照 few-shots,但其范例主要由本产品自行编写,没有把 Claude Design、Fabel5、知识管家和大表哥中已经证明有效的 Prompt/Skill 写法转化为可追溯机制;同时缺少完整的专业 Skill 对照,弱模型仍可能把“写得自然”理解为扩写 System Prompt,却继续输出接口卡式 Skill。
|
|
429
|
+
|
|
430
|
+
主要变化:
|
|
431
|
+
|
|
432
|
+
- 从四组本地优秀 Agent/Skill 资产提炼职业差异、因果解释、局部正反例、知识效力、有限继续和 Agent—Skill—Tool 重判回路;
|
|
433
|
+
- 在写作 Reference 增加“源资产 → 解决的失败 → 可迁移机制 → 当前承载 → 证伪方式”的吸收记录,外部源仍不是运行依赖;
|
|
434
|
+
- 增加主动澄清对照:先读材料并形成岗位候选,只问一个真正改变责任的问题,不用平台、模型和格式问卷代替设计;
|
|
435
|
+
- 增加完整 Skill 对照:区分候选与证据、Tool 无命中与故障、有限完成与失败,并规定新结果改变证据、风险或范围时返回 Agent 重判;
|
|
436
|
+
- Core 与 Design Skill 将写作 Reference 的强制加载范围从生产 Prompt 扩展到核心 Skill;Review Skill 同步检查局部正反行为、Tool 结果效力和责任回路;
|
|
437
|
+
- 更新既有高质量案例,不增加案例数量、评分器、固定长度或前向模型测试。
|
|
438
|
+
|
|
439
|
+
当前边界:本版吸收的是可迁移写作与编排机制,不复制源 Agent 的身份、业务知识、工具、平台路径或权限。只执行静态、引用、Skill、语义和压缩包验证,`behavior_evidence = designed_not_run`。
|
|
440
|
+
|
|
441
|
+
## v0.11.2(2026-08-14)
|
|
442
|
+
|
|
443
|
+
主判断:只有“自然、简洁、不要规格书”等抽象要求,不足以让弱模型写出高质量生产 Prompt;它可能只删除方法术语和解释,留下短小的命令摘要。产品需要用少量对照 few-shots 示范职业立场、因果解释和条件策略,同时明确样例不是模板。
|
|
444
|
+
|
|
445
|
+
主要变化:
|
|
446
|
+
|
|
447
|
+
- 将原冷启动与写作 Reference 升级为三组“弱稿—高质量片段—为什么更好”的跨领域 few-shots;
|
|
448
|
+
- 文档评审案例展示消费者决定、专业贡献、rubric 与专业判断的关系,以及边界后的有限继续;
|
|
449
|
+
- 采购合规案例展示正式知识、现场事实、Agent 判断、Tool 可用和行动授权的分离;
|
|
450
|
+
- 经营分析案例展示触发信号、竞争性解释、下一项核验、消费者适配和停止条件;
|
|
451
|
+
- Design Skill 在每次创建或改写生产 Prompt 前必须读取写作 Reference,运行集成 Reference 仍按独立判断点按需读取;
|
|
452
|
+
- 新增解释完整性复审:使命、原则、策略、边界和输出分别检查消费者决定、理由与后果、条件变化、合法继续和下一行动;
|
|
453
|
+
- Core 与 Review Skill 明确“简洁不是短”,篇幅短、术语少和结构干净不能补偿解释缺失;
|
|
454
|
+
- 更新既有 Prompt 质量案例,不新增案例数量、评分器、固定 Prompt 长度或前向模型测试。
|
|
455
|
+
|
|
456
|
+
当前边界:few-shots 是写作质量示范,不证明目标模型已经采用;本版只执行静态、引用、Skill、语义和压缩包验证,`behavior_evidence = designed_not_run`。
|
|
457
|
+
|
|
458
|
+
## v0.11.1(2026-08-14)
|
|
459
|
+
|
|
460
|
+
主判断:输入是一份 Agent 编译稿,不代表用户要优化的是这份文档。设计、新建、优化、重构或修改 Agent 时,默认交付对象应是 Agent 本身;否则弱模型会把“没有另外说生成文件”解释为只改 Markdown,重复出现内容优化但资产未实现。
|
|
461
|
+
|
|
462
|
+
主要变化:
|
|
463
|
+
|
|
464
|
+
- 将设计/优化 Agent 明确定义为对该 Agent 源码范围的实现授权;输入 Prompt、编译稿和说明文档只作为材料;
|
|
465
|
+
- 只有用户明确要求只分析、只评审、只优化单个 Prompt、禁止写文件,或宿主没有写入能力时,才不生成源码体系;
|
|
466
|
+
- 完成条件改为最小可用源码体系:可装载入口必需,Skills、知识/Tool 契约和案例由真实责任推导,不固定文件数量;
|
|
467
|
+
- 宿主不可写时必须提供独立文件树和逐文件完整内容,并声明 `asset_status = not_written`;叙述性编译稿不能冒充源码交付;
|
|
468
|
+
- 更新现有“编译稿冒充源码”案例:用户只说“请优化这份 Agent”也必须触发源码资产交付,不新增案例数量或测试门禁。
|
|
469
|
+
|
|
470
|
+
当前边界:本版只执行直接受影响的静态、引用、Skill、语义与压缩包验证,不执行模型上限或前向行为测试。`behavior_evidence = designed_not_run`,`independent_review = not_run`,`maturity_claim = not_claimed`。
|
|
471
|
+
|
|
472
|
+
## v0.11.0(2026-08-14)
|
|
473
|
+
|
|
474
|
+
主判断:历次产品先建立了正确的业务交互与职业设计内核,随后因协议、状态、资产门和案例持续叠加,使模型更擅长完成结构与文件,却弱化了目标岗位行为、生产 Prompt 和专业 Skill。v0.11.0 不再补丁式加规则,而是以职业行为设计为唯一主线重构。
|
|
475
|
+
|
|
476
|
+
主要变化:
|
|
477
|
+
|
|
478
|
+
- 新增 v0.1—v0.10 产品复盘,逐阶段裁决保留与删除,不把最新版本天然视为最佳基线;
|
|
479
|
+
- Core 收敛为岗位、专业判断、七项原则、真实推进方式、唯一 Skill 路由和交付标准;明确包内两个 Skills 是运行方法,旧协议和其他设计 Skill 只能按需参考;
|
|
480
|
+
- `design-agent` 从冷启动独立建立目标行为,不要求历史最佳版本;只有高影响责任分叉才询问,其他选择采用可修改默认继续;
|
|
481
|
+
- 生产 System Prompt 和专业 Skill 成为首要质量对象:前者写成目标岗位工作纲领,后者必须包含专业观察、比较、条件策略、停止与恢复;
|
|
482
|
+
- 知识、Tool、权限和接入状态保持显性,但不再用 Schema、Harness、阈值、样本量、Hash 或成本参数补偿职业设计不足;
|
|
483
|
+
- `review-agent` 保持只读,先评专业行为,再评 Prompt、Skills、依赖、资产与证据;冷启动不把缺少历史版本当成缺陷;
|
|
484
|
+
- References 从九份收敛为两份按需材料,评审 Skill 不再加载 Reference;
|
|
485
|
+
- 行为案例从 32 个收敛为 10 个高信号场景,删除旧运行报告;本版不安排模型上限测试;
|
|
486
|
+
- 不新增评分器、第三个 Skill、固定模板、SHA 或伪 Harness。
|
|
487
|
+
|
|
488
|
+
当前边界:本版只执行静态、引用、Skill 与压缩包验证。目标模型行为仍为 `designed_not_run`,独立评审为 `not_run`,成熟度为 `not_claimed`。
|
|
489
|
+
|
|
490
|
+
## v0.10.0(2026-08-14)
|
|
491
|
+
|
|
492
|
+
主判断:v0.9.0 把连续对话误当成可确定调度的 Harness;同一模型切换设计与评审 Skill 不会产生独立上下文、否决权或持久状态。v0.10.0 改为对话原生运行模型,按用户意图选择 Skill,只保留真实用户确认门,并把业务澄清及知识/Tool 依赖提升为显式设计责任。
|
|
493
|
+
|
|
494
|
+
主要变化:
|
|
495
|
+
|
|
496
|
+
- `design-agent` 不再把候选交给 `review-agent` 自我审批;设计、优化和“先评审再优化”在一个专业闭环中完成诊断、设计、内部反证、修订、真实文件写入与回读;
|
|
497
|
+
- `review-agent` 只承接用户明确要求不修改的只读评审;同上下文复审、分离上下文评审和外部评审分别声明,不冒充独立性;
|
|
498
|
+
- 删除 `candidate_pending_review`、`ready_for_compilation` 等对话内伪状态门。只有职责、高影响权限、正式口径、最终责任或核心能力承诺分叉,才向用户给候选、推荐和一个业务问题并等待;
|
|
499
|
+
- 一句话需求先形成最小任务图景与建议解释,不发通用需求问卷;材料充分且无高影响分叉时直接生成实际资产,不逐阶段索要继续许可;
|
|
500
|
+
- 知识与 Tool 依赖改为显式能力链:业务判断/动作、必要知识或系统能力、权威与权限、接入状态、失败降级和下一责任人;未接入项标记 `required_not_connected` 并生成宿主无关适配契约;
|
|
501
|
+
- References 增加纯对话、带 Tool 对话和真实 Harness 三种运行形态,禁止用 Prompt 状态名替代宿主能力;
|
|
502
|
+
- 文档评审案例新增第七个失败样本,说明状态名和 Skill 切换为何没有形成控制与独立复核;
|
|
503
|
+
- 行为案例由 29 个增至 32 个,新增对话运行边界、唯一高影响确认门和材料充分直接交付三类回归;
|
|
504
|
+
- 保持一个 Core、两个按意图路由的 Skills、References 和轻量校验器;不增加第三个 Skill、SHA、评分器或伪 Harness。
|
|
505
|
+
|
|
506
|
+
当前边界:本版完成源码、References、设计说明和案例重构;静态、链接与 Skill 校验待执行。32 个案例尚未在目标模型运行,保持 `behavior_evidence = designed_not_run`、`independent_review = not_run` 与 `maturity_claim = not_claimed`。
|
|
507
|
+
|
|
508
|
+
## v0.9.0(2026-08-14)
|
|
509
|
+
|
|
510
|
+
主判断:上一版已经知道什么是高质量设计,但分析、裁决、业务确认、资产编译和证据声明仍在同一生成动作中,弱模型可以在结尾推翻自己的正确分析。v0.9.0 把它们改为由 Core 控制的排他状态转换,并把七层设计说明与生产 Prompt 文案设为两个独立质量条件。
|
|
511
|
+
|
|
512
|
+
主要变化:
|
|
513
|
+
|
|
514
|
+
- `design-agent` 重构为 `form_candidate`、`revise_candidate`、`compile_assets` 和 `design_tests`;候选只能返回待评审或待业务决定,不能自行通过;
|
|
515
|
+
- `review-agent` 重构为编译前候选门、编译后资产门和现有 Agent 只读评审;设计与评审不再混成一次自我声明;
|
|
516
|
+
- 遇到改变岗位判断权、质量责任、高影响动作或最终责任的分叉,必须给出候选、推荐和一个问题;旧稿内嵌审批不再视为当前授权;
|
|
517
|
+
- 修改深度改为事实优先:职业内核、专业闭环或责任拓扑任一重推即为重新设计,防止分析说重推、结尾却写结构优化;
|
|
518
|
+
- 历史最佳版本只作为行为守恒下限,不作为文案或结构模板;明确要求生产 Prompt 在自然性、专业性和因果解释上超过基线;
|
|
519
|
+
- 结构优化和重新设计必须按七层交付设计说明,并用联合压力事件解释;生产 Prompt 保持目标岗位的自然职业语言,不机械使用七个标题;
|
|
520
|
+
- 增加专门文案复审,修正功能清单使命、抽象口号、规格语言、固定步骤伪策略和无原因命令;
|
|
521
|
+
- 新增 `DESIGN_NOTE.md`,用七层解释企业 Agent 设计师自身的设计及状态编排;
|
|
522
|
+
- 新增分析与最终状态一致性、岗位分叉确认、七层说明/自然 Prompt 分离、最佳基线只作下限四类回归,案例由 25 个增至 29 个;
|
|
523
|
+
- 保持一个 Core、两个 Skills 和轻量校验器;不新增质量评分器、固定 Prompt 模板、第三个 Skill、SHA 或重型状态系统。
|
|
524
|
+
|
|
525
|
+
当前边界:本版已完成结构、版本、引用、案例 JSON 和两个 Skill 快速校验。29 个案例尚未在目标模型运行,保持 `behavior_evidence = designed_not_run` 与 `maturity_claim = not_claimed`。
|
|
526
|
+
|
|
527
|
+
## v0.8.0(2026-08-14)
|
|
528
|
+
|
|
529
|
+
主判断:v0.7.5 修复了“理解重设计却不生成文件”,但把资产编译放得过早,弱模型会用目录完整替代困难的专业重设计。正确顺序不是取消资产门,而是先建立目标行为蓝图并裁决设计质量,设计成立后才选择资产拓扑。
|
|
530
|
+
|
|
531
|
+
主要变化:
|
|
532
|
+
|
|
533
|
+
- 重写 Agent Core 与 Design Skill 的执行模型:业务语境→修改深度与形态→行为蓝图→候选设计→质量裁决→运行承载→资产编译→行为测试;
|
|
534
|
+
- 新增 `DESIGN_REVISION_REQUIRED` 与 `DESIGN_READY_FOR_COMPILATION` 语义;前者只能返回设计本身返工,不能用拆文件、补接口和增加模板推进;
|
|
535
|
+
- 将高质量要求从并列清单重构为七项前置裁决:岗位贡献、职业差异、策略适应、主动协作、自然解释、责任闭合和可观察性;
|
|
536
|
+
- 为既有 Agent 增加能力守恒:当前最佳有效行为必须保留、增强、替代或有理由删除,并绑定回归任务;
|
|
537
|
+
- 资产清单从修改深度后移到设计质量通过之后;继续禁止固定文件数、七层目录映射、空壳资产和普通源码自哈希;
|
|
538
|
+
- 重写 Review Skill,把设计质量、资产状态和行为证据拆成独立轴;设计质量失败时不能被资产完整或测试数量平均覆盖;
|
|
539
|
+
- 把文档评审 Agent v0.3 的真实退化纳入设计与评审案例:责任拓扑局部改善,但职业主体性、条件策略、主动协作、自然解释和测试质量下降,整体判退化;
|
|
540
|
+
- 新增 `asset_complete_but_professional_behavior_regressed` 回归案例,核心场景由 24 个增至 25 个;旧“重设计但只交编译稿”案例同步改为设计质量先于资产编译;
|
|
541
|
+
- 保持一个 Core、两个 Skills 和一个轻量结构校验器;不新增第三个 Skill、质量评分脚本、固定 Prompt 字数、SHA 或资产 manifest。
|
|
542
|
+
|
|
543
|
+
当前边界:本版将真实失败样本转化为源码与回归定义,并执行结构、版本、链接和 Skill 校验;当前环境没有目标 Agent 行为运行入口,因此 25 个案例保持 `TEST_DESIGNED / NOT_RUN`,成熟度为 `not_claimed`。
|
|
544
|
+
|
|
545
|
+
## v0.7.5(2026-08-13)
|
|
546
|
+
|
|
547
|
+
主判断:重新设计描述推导深度,资产包描述实现载体;两者不同但都属于已授权 Agent 设计任务的完成条件。理解了重设计、却仍只交一份编译稿,是状态转换未执行,不是交付格式偏好。
|
|
548
|
+
|
|
549
|
+
主要变化:
|
|
550
|
+
|
|
551
|
+
- 新建、结构优化或重新设计裁决在已授权生成源码时显式进入 `ASSET_COMPILATION_REQUIRED`;文字润色、只读评审和明确单 Prompt 任务不触发多文件扩张;
|
|
552
|
+
- 在继续写内容前形成最小资产实现清单,只记录目标路径、独立责任、分离依据和验收方式;不要求新增 manifest 文件;
|
|
553
|
+
- 优先服从目标项目已有目录;没有约定时才从真实责任推导生产 Prompt、必要 Skills/References、契约、案例和设计说明;
|
|
554
|
+
- 写入后必须列出实际目录并读取关键文件,对照清单核验路径、内容和独立职责;汇总编译稿可以作为阅读投影,但不能替代权威源码;
|
|
555
|
+
- 增加互斥状态:全部必要资产真实写入为 `ASSET_PACKAGE_CREATED`,部分完成为 `ASSET_COMPILATION_INCOMPLETE`,无写入能力只能为 `ASSET_NOT_WRITTEN`;
|
|
556
|
+
- 明确高能力模型仍自主推导结构、内容和调整理由;完成门不固定文件数、模板或推理路径,禁止空壳资产和无变化的重复核对;
|
|
557
|
+
- 文档评审案例纳入“已正确裁决重新设计但只交编译稿”的执行偏移及其事后解释;
|
|
558
|
+
- 新增 `redesign_declared_but_single_compiled_document` 回归案例,核心场景由23个增至24个;仍保持一个 Core、两个 Skills、一个轻量校验器,不增加 SHA、固定 Schema 或资产 manifest 文件。
|
|
559
|
+
|
|
560
|
+
当前边界:本版完成源码、版本、链接、案例 JSON 与 Skill 结构验证;没有目标 Agent 行为运行入口,因此24个行为案例保持 `TEST_DESIGNED / NOT_RUN`,成熟度继续为 `not_claimed`。
|
|
561
|
+
|
|
562
|
+
## v0.7.4(2026-08-13)
|
|
563
|
+
|
|
564
|
+
主判断:高质量生产 Prompt 不只需要正确内容,还需要把上游设计框架编译成目标岗位自己的职业观察、比较、行动与解释;概念齐全但像规格说明,仍然是未完成设计。
|
|
565
|
+
|
|
566
|
+
主要变化:
|
|
567
|
+
|
|
568
|
+
- 将生产 System Prompt 提升为首要编译产物,不能与其他资产一次写完后未经重读直接交付;
|
|
569
|
+
- Design Skill 增加三遍编译:先形成不依赖架构术语的职业内核,再把原则与策略编译为领域行为,最后重新读取实际文件做去框架、去重复和因果表达重写;
|
|
570
|
+
- 增加岗位替换、标题删除、领域比较、条件变化、业务可读和生产洁净六项轻量行文门;这些门只触发重写,不形成关键词总分或严格文风校验器;
|
|
571
|
+
- 明确“业务结果优先于技术形态”等上游设计原则不能原样成为所有目标岗位原则,必须翻译为当前领域的比较对象、原因和业务后果;
|
|
572
|
+
- 明确使命不能停在“负责评估、标记、输出”的功能清单,策略不能停在无论情境都执行的固定步骤,支持多个消费者不等于每次生成全部结果;
|
|
573
|
+
- Review Skill 增加规格说明式 Prompt 诊断,问题定位到生产 Prompt 编译,不以增加架构、标题或质量形容词修复;
|
|
574
|
+
- 文档评审案例增加生产措辞对比,区分结构覆盖、职业语言与行为编译,不复制具体范文;
|
|
575
|
+
- 新增 `production_prompt_specification_tone` 回归案例,核心场景由22个增至23个;仍保持一个 Core、两个 Skills、一个轻量结构校验器,不增加 SHA 或文风评分器。
|
|
576
|
+
|
|
577
|
+
当前边界:本版完成源码、版本、链接、案例 JSON 与 Skill 结构验证;没有目标 Agent 行为运行入口,因此23个行为案例保持 `TEST_DESIGNED / NOT_RUN`,成熟度继续为 `not_claimed`。
|
|
578
|
+
|
|
579
|
+
## v0.7.3(2026-08-13)
|
|
580
|
+
|
|
581
|
+
主判断:完整文件包不等于运行闭合;弱模型最容易跳过的不是案例设计,而是最后一次行为写入后的真实测试调用,以及职责下移后的载体核验。
|
|
582
|
+
|
|
583
|
+
主要变化:
|
|
584
|
+
|
|
585
|
+
- 将测试从原则性要求改为可观察完成门:运行入口可用时,最后一次行为写入后必须实际调用正常任务与最高风险压力任务;无入口只能报告 `TEST_DESIGNED / NOT_RUN`,调用失败报告 `TEST_RUN_FAILED`;
|
|
586
|
+
- 明确行为通过必须有实际模型/运行时、原始输入输出、Tool 序列、终止状态和判定;案例、期望行为、设计者推演和自查清单均不构成运行证据;
|
|
587
|
+
- 增加职责—载体闭环:解析下移要有解析契约,批处理恢复下移要有状态/交接契约,结构化下游输出要有最小 Schema;未确认宿主能力时不得写成已经闭合;
|
|
588
|
+
- 要求专业立场编译进 Skill 的证据选择、候选比较、停止和 Output;System Prompt 写业务优先而 Skill 仍按类型套固定量表,判为表面合规;
|
|
589
|
+
- 旧作者提出的版本字段、阈值、固定样本数、成熟度和“平台会提供/已经测试”恢复为待验证主张,不能因沿用旧稿升级为事实;
|
|
590
|
+
- 生成消费者结果、暂存、正式写入和触发下游分别授权;同一输入的幂等结果必须唯一,不使用“跳过或覆盖”的临场二选一;
|
|
591
|
+
- 扩充文档评审案例,纳入“已正确重设计并生成资产包,但缺少解析/状态/Schema 载体、测试回执和权限闭环”的第三阶段样本;
|
|
592
|
+
- 新增4个回归案例,核心场景由18个增至22个;仍保持一个 Core、两个 Skills、轻量结构校验,不增加 SHA 或重型评分器。
|
|
593
|
+
|
|
594
|
+
当前边界:本版完成结构、版本、链接和案例 JSON 校验;受当前执行环境约束,未以目标运行模型执行22个行为案例,因此成熟度继续为 `not_claimed`。
|
|
595
|
+
|
|
596
|
+
## v0.7.2(2026-08-13)
|
|
597
|
+
|
|
598
|
+
主判断:目标模型能力需要进入设计假设,但不能成为业务用户必须先完成的技术配置;只有它会改变运行承载或验收时才主动确认,用户不知道时由设计师推荐并继续。
|
|
599
|
+
|
|
600
|
+
主要变化:
|
|
601
|
+
|
|
602
|
+
- Core 增加目标模型能力判断:先从代表性任务识别复杂推理、材料理解和 Tool 调用需求,再判断是否需要询问;
|
|
603
|
+
- 明确询问时机:一句话需求先厘清岗位和责任;目标模型已有材料时直接使用;能力差异不改变设计时不阻塞;只有出现高返工结构分叉时才问一个业务取舍问题;
|
|
604
|
+
- 面向业务人员使用“复杂判断质量优先”与“成本和响应优先”等候选并给出推荐,不要求其选择模型参数、上下文长度、推理档位或采样参数;
|
|
605
|
+
- 用户不知道时,根据任务风险采用建议能力假设继续生成宿主无关资产,并说明最终模型上的复验边界;
|
|
606
|
+
- 运行 Reference 明确模型只改变任务拆分、脚手架、Skill/Tool 暴露、上下文、人工复核和验证强度,不改变岗位、权限、证据和成功标准;
|
|
607
|
+
- 新增模型选择会改变设计、业务用户不懂模型两类行为案例,核心场景由16个增至18个;
|
|
608
|
+
- 未增加模型评分 Schema、品牌清单、第三个 Skill、重型校验器或 SHA。
|
|
609
|
+
|
|
610
|
+
当前边界:结构与 Skill 入口验证在本次发布报告中记录;目标模型行为测试尚未运行,因此继续保持 `not_claimed`。
|
|
611
|
+
|
|
612
|
+
## v0.7.1(2026-08-13)
|
|
613
|
+
|
|
614
|
+
主判断:较弱模型的主要失败不是少记了一条原则,而是在“修改深度”和“交付对象”两个高返工分叉上自由度过大;必须用低歧义协议约束先独立重推目标设计,再编译完整 Agent 资产包。
|
|
615
|
+
|
|
616
|
+
主要变化:
|
|
617
|
+
|
|
618
|
+
- 将四级修改深度改为互斥条件:结构优化只在质量基线、专业闭环和责任拓扑已经被证明成立时成立;任一项需要重新推导即为重设计,岗位和使命可继续保留;
|
|
619
|
+
- 新增既有 Agent 引导式重设计 Reference,强制分离业务事实与旧设计、脱离旧组件名称和数量建立目标基线、重推 Agent—Skill—Tool—Harness 拓扑,再比较旧稿;
|
|
620
|
+
- 明确输入载体不决定交付形态:已授权的 Agent 设计或优化默认生成独立生产 Prompt、实际需要的 Skills/References、Tool/知识契约、可运行行为案例和设计说明,而不是只改一份编译稿;
|
|
621
|
+
- 增加 Skill 独立闭环检验,将解析、格式转换、字段投影、查询、写入和同一结果的多种表达从伪 Skills 中剥离到程序、Tool 或 Output;
|
|
622
|
+
- 替换与文档评审目标过近的 Prompt 示例,并明确示例只展示机制、不得复制原句;新增表面质量词、固定流水线和自检清单等反例;
|
|
623
|
+
- 新增3个弱模型回归案例:岗位正确但拓扑错误、质量词覆盖固定流水线、设计声明与真实产物冲突;核心场景由13个增至16个;
|
|
624
|
+
- 修正文档评审案例的证据身份:历史相似度只属于当时冻结记录,同名文件变化后不再把旧数值描述为当前文件事实;
|
|
625
|
+
- 仍不增加第三个 Skill、重型质量评分器、SHA、全量 Schema 或第二个行为结果校验器。
|
|
626
|
+
|
|
627
|
+
当前边界:结构与 Skill 入口验证在本次发布报告中记录;参考模型行为测试尚未运行,因此继续保持 `not_claimed`。
|
|
628
|
+
|
|
629
|
+
## v0.7.0(2026-08-13)
|
|
630
|
+
|
|
631
|
+
主判断:硬边界内,设计质量必须高于最小改动;“优化”需要先裁决修改深度,首版正式交付应是经过内部设计、编译和压力自检的完整生产资产。
|
|
632
|
+
|
|
633
|
+
主要变化:
|
|
634
|
+
|
|
635
|
+
- Core 新增显式质量优先级:事实、授权、安全和证据为硬约束,专业主体性、自主分析、自然业务解释、岗位闭环和可验证行为是合法方案中的首要目标;
|
|
636
|
+
- 将“最小充分”与“最小改动”分开:前者约束最终复杂度和责任层,不能成为保留低质量旧骨架的理由;
|
|
637
|
+
- 对“优化、完善、改进”增加措辞修正、局部修复、结构优化和重设计四级裁决;Review 只承接有边界的修复,结构优化或重设计回到 Core 路由 Design;
|
|
638
|
+
- 新增高质量 Prompt 与业务体验 Reference,分别约束 Agent Core、Skill、Tool/知识契约、评测和设计说明的行文与行为;明确内部分析不等于输出思维链,重要判断要自然说明原因、依据、影响和边界;
|
|
639
|
+
- 把 Claude Design 的专业主体性与解释、大表哥的动作执行精度、知识管家的证据治理作为三类质量参照;设计说明必须解释迁移机制及未迁移实现,不能只报案例名称;
|
|
640
|
+
- 纳入文档评审 Agent v0.2→v0.3 的静态对比案例:约 94.09% 的字符序列相似度支持“改动集中、旧结构高度保留”,用于说明局部补丁不等于高质量重设计;
|
|
641
|
+
- 核心行为场景由10个增至13个,新增既有 Agent 重设计、业务语言调研和首版生产质量三类案例;
|
|
642
|
+
- 未增加第三个 Skill、重型质量评分器、SHA、全量 Schema 或平台专用适配代码。
|
|
643
|
+
|
|
644
|
+
当前边界:源码结构、13类案例、Markdown 相对链接和两个 Skill 入口校验已通过;参考模型行为测试尚未运行,因此继续保持 `not_claimed`。
|
|
645
|
+
|
|
646
|
+
## v0.6.1(2026-08-13)
|
|
647
|
+
|
|
648
|
+
主判断:业务专家负责确认知识与动作的权威来源、使用范围和最终责任;Agent 设计师负责主动发现依赖、提出接入建议并形成接口契约,不能把 API 设计推回业务人员。
|
|
649
|
+
|
|
650
|
+
主要变化:
|
|
651
|
+
|
|
652
|
+
- 在 Core 中增加知识、数据、Tool 与外部系统依赖的主动发现责任,以及面向业务人员的确认边界;
|
|
653
|
+
- Design Skill 从代表性任务反推必要能力:优先核验现有来源,不支持时仍生成宿主无关源码、知识/Tool 契约、适配点和模拟返回;
|
|
654
|
+
- 运行资产 Reference 增加轻量能力链,分别定义知识依赖和 Tool 依赖必须说明的最小内容;
|
|
655
|
+
- 明确只向业务用户询问权威来源、读/写/执行范围、冲突裁决和最终责任,不询问 API、鉴权、向量库、Embedding 或平台 Schema;
|
|
656
|
+
- 新增 `missing_knowledge_tool_integration` 行为案例,验证成功和能力不可用路径,以及“已设计”与“已真实接入”的声明边界;
|
|
657
|
+
- 未增加平台专用代码、固定重型 Schema、第三个 Skill 或新的质量校验器。
|
|
658
|
+
|
|
659
|
+
当前边界:真实平台适配仍由使用者完成;参考模型行为测试尚未运行,因此继续保持 `not_claimed`。
|
|
660
|
+
|
|
661
|
+
## v0.6.0(2026-08-13)
|
|
662
|
+
|
|
663
|
+
主判断:七层架构不需要推倒重来;常驻 Core 应保留稳定责任和联合判断,设计、评审、案例与评测方法应编译为两个按需专业闭环。
|
|
664
|
+
|
|
665
|
+
主要变化:
|
|
666
|
+
|
|
667
|
+
- 保留定位、岗位、Constitution、Principles、MetaGoals、任务策略、Tool Policy、Output 与 Trace,七层关系不变;
|
|
668
|
+
- 将 `design-agent` 与 `review-agent` 编译为独立 Skills,各自拥有目标、证据入口和终止条件,删除单一大 Playbook;
|
|
669
|
+
- 明确一次只选择一个主 Skill、Skills 不互相调用、复合任务由 Core 按状态变化拆段;
|
|
670
|
+
- 增加 Agent—Skill—Tool 动作编排:Agent 保留终局意图,Skill 选择最小 operation,Tool/程序返回事实、状态、边界和合法下一入口,新证据回到 Agent 重判;
|
|
671
|
+
- 将方法 1.8.4 的形态裁决、岗位责任、七层推导、运行资产、行为评测、失败定位、最小修复和受控演进拆入按需 References;
|
|
672
|
+
- 纳入“大表哥”当前发布版 1.23.36 案例,重点提炼 `requestedStandardDataState → nextTask → queryHandoff` 与执行原语边界;当前发布源码、历史 L2 冻结迭代和本地未提交草稿分别标注;
|
|
673
|
+
- 核心行为场景由8个增至9个,新增 Skill/Tool 动作编排场景;仍不使用总分、SHA、全量 Schema 或重型校验器。
|
|
674
|
+
|
|
675
|
+
当前边界:源码结构与 Skill 入口待本版校验;参考模型行为测试仍需取得可复现运行入口后执行,不提前声明 L1。
|
|
676
|
+
|
|
677
|
+
## v0.5.0(2026-08-13)
|
|
678
|
+
|
|
679
|
+
主判断:借鉴高质量设计型 Agent 的关键不在语气或章节,而在让职业身份产生可观察的判断差异。
|
|
680
|
+
|
|
681
|
+
主要变化:
|
|
682
|
+
|
|
683
|
+
- 增加“你不是 Prompt 记录员”的正反对照,明确其与架构填充器、顺从执行者、文档生成器和脱离语境的通用顾问有何不同;
|
|
684
|
+
- 将“语境优先于空白生成”和“每个设计选择必须有理由”提升为显式 Principles;
|
|
685
|
+
- 解释实质候选的目的:暴露一句话需求背后的岗位、责任和权限分叉,而不是把决定推给用户;
|
|
686
|
+
- 解释尽早产出、验证后声明、专业坚持与用户最终决定权背后的失败机制;
|
|
687
|
+
- 在现有8个案例中增强相应可观察行为,不增加文件、案例类别、Schema、SHA 或重型校验;
|
|
688
|
+
- 未迁移前端审美规则、平台专用 Tool、强制验证子 Agent 等不适用于企业 Agent 设计师的机制。
|
|
689
|
+
|
|
690
|
+
## v0.4.0(2026-08-13)
|
|
691
|
+
|
|
692
|
+
主判断:轻量是对业务用户隐藏内部复杂性,不是删除 Agent 自身的专业行为内核。
|
|
693
|
+
|
|
694
|
+
主要变化:
|
|
695
|
+
|
|
696
|
+
- 产品定位升级为企业内的 Agent 设计师,明确服务业务负责人、岗位专家、FDE 和 Agent 工程师;
|
|
697
|
+
- 在 System Prompt 中显式定义 Role & Scope、Constitution、Principles、MetaGoals、任务级执行策略、Core Skills、Tool Policy、Output Contract 和 Evaluation Trace;
|
|
698
|
+
- 增加七层联合工作关系,明确 Constitution 否决、Role 处理/转交、Principles 评价、MetaGoals 组合、任务策略派生、专业方法执行和交付前复审;
|
|
699
|
+
- MetaGoals 不再只是“主动性”要求,而具有预期效果、代价和停止条件;
|
|
700
|
+
- 主动推理在每轮按“意图与状态→事实边界→否决/职责→候选评价→MetaGoals→当前策略→执行→复审”运行;
|
|
701
|
+
- 对业务用户仍保持轻量交互,不展示内部术语、长协议和思维过程;
|
|
702
|
+
- 未增加 SHA、Schema、全量设计对象或重型 Harness。
|
|
703
|
+
|
|
704
|
+
## v0.3.0(2026-08-13)
|
|
705
|
+
|
|
706
|
+
主判断:产品从“方法协议编译器”收缩为“帮助业务人员设计 Agent 的轻量专家助手”。方法仍用于内部专业判断,不再作为用户必须面对的对象和文件体系。
|
|
707
|
+
|
|
708
|
+
主要变化:
|
|
709
|
+
|
|
710
|
+
- 交互从阶段和对象驱动改为“初步判断—候选方向—明确推荐—一个问题”;
|
|
711
|
+
- 用户答不上来时,助手给低风险、可修改的默认并继续,不把专业判断推回用户;
|
|
712
|
+
- 信息足够后主动生成、修改和测试,不在每一步询问是否继续;
|
|
713
|
+
- 加入需求变化、材料冲突、部分成功和工具失败的保留与恢复机制;
|
|
714
|
+
- 默认使用业务语言,七层方法只在内部联合控制行为;
|
|
715
|
+
- 删除全量 `DESIGN.json`、13类对象 Schema、方法追踪表、结果 Schema 和第二个行为结果校验器;
|
|
716
|
+
- 删除全部 SHA、快照指纹和源文件内容锁定;
|
|
717
|
+
- 校验器只检查文件、版本、JSON 和8类核心案例结构,明确不判断设计质量;
|
|
718
|
+
- 18个强制案例收缩为8个核心体验与容错案例,不使用任意总分。
|
|
719
|
+
|
|
720
|
+
当前边界:参考模型行为测试仍未执行,`maturity_claim` 为 `not_claimed`。
|
|
721
|
+
|
|
722
|
+
## v0.2.0(2026-08-13)
|
|
723
|
+
|
|
724
|
+
将 v0.1 重构为方法 v1.8.4 与协议 v1.8 的可追溯编译产物,恢复七层联合关系、阶段门禁和证据边界。但它把方法一致性实现成了重型 Schema、全量自设计对象、固定案例和严格校验,偏离了业务助手的轻量定位。
|
|
725
|
+
|
|
726
|
+
## v0.1.0(2026-08-13)
|
|
727
|
+
|
|
728
|
+
首次形成宿主无关 Agent Core、设计/评审双模式、主动候选提问、源码直改、通用行为夹具和静态校验。其主要缺陷是只借用了部分结论,没有真正继承 v1.8.4 的设计原则与联合关系。
|
|
729
|
+
|