@agent_forge/forge-darwin-x64 1.69.0 → 1.71.0
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/bin/README.md +3 -1
- package/bin/forge +0 -0
- package/package.json +1 -1
package/bin/README.md
CHANGED
|
@@ -292,6 +292,8 @@ Agent 无法通过 `node -e "fs.writeFileSync()"`、`cat > file`、直接编辑
|
|
|
292
292
|
| `forge task start --invariant "run :: expected"` | 析出不变量(instrument 段):声明期校验必须是可执行命令(叙述性约束被拒并指引降级到 checklist/intent),映射进验收标准——机器对账/freshness/complete 前置全覆盖 |
|
|
293
293
|
| `forge task start --accept "..." --assert "type:arg :: expected"` | v2 结构化断言(spec-as-gate):五型机械可判 `exit`(期望退出码)\|`contains`\|`not-contains`(输出子串/反作弊)\|`file-changed`\|`file-untouched`(glob 对任务 diff——freeze 语义的任务级版,保护对象含 .md/.yml 等非源码);`--assert` 附属于同命令中 preceding `--accept`,file-\* 型可独立出现(无 Run);regex 刻意排除(ReDoS + 不可判——意见不走 hard);声明期拒绝叙述性与越形断言 |
|
|
294
294
|
| `forge task start --accept-file <yml>` | 批量考卷声明:顶层 `criteria:`,每条 `run/expected/assertions[type/arg/expected]`(键与任务状态 JSON 一致);与 `--accept` 同层级、按 (Run, Expected, Assertions) 三元组去重合并 |
|
|
295
|
+
| `forge eval golden harvest [--since <ref>]` | golden 候选收割(L3):只读扫描本地已完结任务的验收考卷,机械投影成候选骨架落 `evals/forge/golden/candidates/`(gitignore,永不进 VCS)——候选经实跑探测→翻转 kind→人工策展转正 canonical;canonical 目录零写入(guard 钉死,golden 只进人工策展红线) |
|
|
296
|
+
| `forge review llm [--scores <file>]` | LLM 判官臂(L3「可命题」类约束的执法通道):无 flag 打印独立只读子代理评审派遣说明(design/mock-hallucination 两类 findings,0-100 判分);`--scores` 校验 JudgeAuditEntry 判分文件落 judge-samples 留档并指向 `forge eval judge-audit` 算 κ(地板 0.6,不达标降级 ADVISORY——判官永不进 hard) |
|
|
295
297
|
| `forge task wild "<说明>"` | 野外动作申报:任务管道外的显式留痕出口(比静默绕过诚实、比强制建任务轻)。记会话/分支/HEAD/是否已有任务到 `wild/declarations.jsonl`,累计计数供审计回溯(vNext INV-1 的合法出口之一) |
|
|
296
298
|
| `forge task status` | 查看当前任务门禁状态(含已登记产物链产物与漂移/审批态) |
|
|
297
299
|
| `forge task list --plan-conversion` | plan-first advisory 转化率报告(先测量再翻转):已发/发后已补方案/发后仍无方案/未发自带方案四计数 + 转化率——叙事 stage 是否升档由数据决定而非直觉 |
|
|
@@ -327,7 +329,7 @@ Agent 无法通过 `node -e "fs.writeFileSync()"`、`cat > file`、直接编辑
|
|
|
327
329
|
| `forge eval harness-audit [--json]` | A–G harness 修复的事前/事后度量(docs/design/harness-fixes-a-g-2026-09.md M):checklog × toollog(2s 双记去重)× 任务 × hazard 一次算出 skill-trigger 日均触发/按通道转化/inline 跟随/verification-driver 精度、next-hint 采纳、门禁命令形态 C1–C3、refs-critical 下钻(按 host)、封印后归因泄漏、hazard 双投递、coverage 拦后转 pass;`--json` 带口径字段,两机回测只比同口径基线(`evals/harness-audit-*-baseline-*.json`) |
|
|
328
330
|
| `forge eval golden run [--dir <dir>] [--repeats N] [--rewrite-manifest] [--json]` | 门禁 golden 标注集重放:precision/fpr(Wilson 区间)+ 确定性重放一致率;用例集指纹钉在 `evals/forge/golden/MANIFEST.sha256`,不符拒绝运行(`--rewrite-manifest` 仅限显式轮换) |
|
|
329
331
|
| `forge eval golden private-init` / `rotate [--max-cases N]` | 私有 golden 子集(0700,永不进 VCS)与季度轮换(oracle 复验 + 最老优先淘汰 + 审计行) |
|
|
330
|
-
| `forge eval traps run [--dir <dir>]` |
|
|
332
|
+
| `forge eval traps run [--dir <dir>]` | 对抗陷阱重放(14 用例:测试削弱/伪造审计证据/虚假完成 + cheat-scan 七模式族 11 例——type-suppression/error-swallow/dead-branch/comment-only-fix/comment-as-debt/phantom-import/path-assumption,经 gate push --dry-run 推送边界探测;ImpossibleBench 思想);capture 率与行动清单 |
|
|
331
333
|
| `forge eval redteam` | seeded-bug 红队演练(oracle-pipeline L6):对验证链自身注入五类雷(零验收交付/internal 零引用导出/吞错/类型抑制/heldout gap),逐颗用既有检查函数判定拦截——escaped 或设施故障即如实披露(exit 非 0 供 CI 门禁);与 traps 互补:traps 回放过去,redteam 注入现在 |
|
|
332
334
|
| `forge eval judge-audit --scores <file>` | 判分器受审:重放极差 + 与人工标注 Cohen's κ;κ<0.6 该判分器 BLOCKED 决策降级 ADVISORY |
|
|
333
335
|
| `forge eval resume-drill [--dir <dir>]` | 接续演练(C3):脚本化断点续做断言(仅回归对比,绝对值不外宣) |
|
package/bin/forge
CHANGED
|
Binary file
|
package/package.json
CHANGED