@xdxer/dingtalk-agent 0.1.4-beta.0 → 0.1.4-beta.10
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/CHANGELOG.md +50 -0
- package/README.en.md +397 -0
- package/README.md +497 -46
- package/dist/bin/dingtalk-agent.js +1162 -340
- package/dist/bin/dingtalk-agent.js.map +1 -1
- package/dist/src/actions.js +98 -14
- package/dist/src/actions.js.map +1 -1
- package/dist/src/agent-audit.js +460 -0
- package/dist/src/agent-audit.js.map +1 -0
- package/dist/src/agent-bindings.js +132 -0
- package/dist/src/agent-bindings.js.map +1 -0
- package/dist/src/agent-definition.js +182 -0
- package/dist/src/agent-definition.js.map +1 -0
- package/dist/src/agent-enhance.js +678 -0
- package/dist/src/agent-enhance.js.map +1 -0
- package/dist/src/bootstrap.js +125 -17
- package/dist/src/bootstrap.js.map +1 -1
- package/dist/src/config.js +1 -7
- package/dist/src/config.js.map +1 -1
- package/dist/src/development-workspace.js +729 -0
- package/dist/src/development-workspace.js.map +1 -0
- package/dist/src/doctor.js +20 -9
- package/dist/src/doctor.js.map +1 -1
- package/dist/src/dws.js +145 -0
- package/dist/src/dws.js.map +1 -1
- package/dist/src/eval-evidence.js +193 -0
- package/dist/src/eval-evidence.js.map +1 -0
- package/dist/src/init.js +1 -1
- package/dist/src/init.js.map +1 -1
- package/dist/src/invocation.js +36 -0
- package/dist/src/invocation.js.map +1 -0
- package/dist/src/lab.js +679 -0
- package/dist/src/lab.js.map +1 -0
- package/dist/src/lease.js +100 -0
- package/dist/src/lease.js.map +1 -0
- package/dist/src/memory/candidates.js +451 -0
- package/dist/src/memory/candidates.js.map +1 -0
- package/dist/src/memory/completion-evidence.js +536 -0
- package/dist/src/memory/completion-evidence.js.map +1 -0
- package/dist/src/memory/operational.js +263 -0
- package/dist/src/memory/operational.js.map +1 -0
- package/dist/src/memory/remote-state.js +478 -0
- package/dist/src/memory/remote-state.js.map +1 -0
- package/dist/src/memory/task-checkpoints.js +204 -0
- package/dist/src/memory/task-checkpoints.js.map +1 -0
- package/dist/src/multica-deploy.js +1480 -0
- package/dist/src/multica-deploy.js.map +1 -0
- package/dist/src/multica-provider.js +685 -0
- package/dist/src/multica-provider.js.map +1 -0
- package/dist/src/opencode-evals.js +1062 -0
- package/dist/src/opencode-evals.js.map +1 -0
- package/dist/src/opencode-provider.js +531 -0
- package/dist/src/opencode-provider.js.map +1 -0
- package/dist/src/opencode-workspace.js +197 -0
- package/dist/src/opencode-workspace.js.map +1 -0
- package/dist/src/perception.js +225 -0
- package/dist/src/perception.js.map +1 -0
- package/dist/src/personal-event-evals.js +595 -0
- package/dist/src/personal-event-evals.js.map +1 -0
- package/dist/src/promotion.js +786 -0
- package/dist/src/promotion.js.map +1 -0
- package/dist/src/remote-semantic-state-live-evals.js +888 -0
- package/dist/src/remote-semantic-state-live-evals.js.map +1 -0
- package/dist/src/remote-semantic-state-worker.js +38 -0
- package/dist/src/remote-semantic-state-worker.js.map +1 -0
- package/dist/src/remote-state-evals.js +501 -0
- package/dist/src/remote-state-evals.js.map +1 -0
- package/dist/src/response-gate.js +51 -0
- package/dist/src/response-gate.js.map +1 -0
- package/dist/src/robot-evals.js +770 -0
- package/dist/src/robot-evals.js.map +1 -0
- package/dist/src/sessions.js +66 -105
- package/dist/src/sessions.js.map +1 -1
- package/dist/src/setup.js +10 -9
- package/dist/src/setup.js.map +1 -1
- package/dist/src/skill-manager.js +102 -203
- package/dist/src/skill-manager.js.map +1 -1
- package/dist/src/skills.js.map +1 -1
- package/dist/src/storage-evals.js +26 -0
- package/dist/src/storage-evals.js.map +1 -0
- package/dist/src/types.js.map +1 -1
- package/dist/src/upgrade.js +137 -0
- package/dist/src/upgrade.js.map +1 -0
- package/dist/src/waits.js +5 -1
- package/dist/src/waits.js.map +1 -1
- package/dist/src/workspace.js +28 -3
- package/dist/src/workspace.js.map +1 -1
- package/docs/INSTALLATION.md +118 -13
- package/docs/SECOND-AGENT-ACCEPTANCE.md +62 -0
- package/docs/architecture/agent-memory-topology.png +0 -0
- package/docs/architecture/agent-memory-topology.svg +132 -0
- package/docs/architecture/general-agent-kernel-topology.png +0 -0
- package/docs/architecture/general-agent-kernel-topology.svg +149 -0
- package/docs/architecture/provider-bound-development-workspace.png +0 -0
- package/docs/architecture/provider-bound-development-workspace.svg +141 -0
- package/docs/architecture/task-completion-gate.png +0 -0
- package/docs/architecture/task-completion-gate.svg +191 -0
- package/docs/schemas/agent-audit-load-evidence.schema.json +14 -0
- package/docs/schemas/agent-audit.schema.json +92 -0
- package/docs/schemas/agent-bindings.schema.json +54 -0
- package/docs/schemas/agent-definition.schema.json +78 -0
- package/docs/schemas/agent-enhancement-plan.schema.json +88 -0
- package/docs/schemas/agent-enhancement-receipt.schema.json +37 -0
- package/docs/schemas/enriched-invocation.schema.json +46 -0
- package/docs/schemas/eval-candidate-plan.schema.json +28 -0
- package/docs/schemas/eval-candidate-result.schema.json +20 -0
- package/docs/schemas/eval-candidate.schema.json +30 -0
- package/docs/schemas/invocation.schema.json +19 -0
- package/docs/schemas/memory-candidate-proposal.schema.json +18 -0
- package/docs/schemas/memory-candidate.schema.json +76 -0
- package/docs/schemas/memory-publish-target.schema.json +25 -0
- package/docs/schemas/multica-deployment-list.schema.json +29 -0
- package/docs/schemas/multica-deployment-operation.schema.json +51 -0
- package/docs/schemas/multica-deployment-plan.schema.json +70 -0
- package/docs/schemas/multica-deployment-receipt.schema.json +87 -0
- package/docs/schemas/multica-deployment-status.schema.json +23 -0
- package/docs/schemas/multica-workspace-inspection.schema.json +77 -0
- package/docs/schemas/multica-workspace-plan.schema.json +68 -0
- package/docs/schemas/multica-workspace-resource-list.schema.json +27 -0
- package/docs/schemas/multica-workspace-status.schema.json +34 -0
- package/docs/schemas/observation.schema.json +21 -0
- package/docs/schemas/operational-memory-provider.schema.json +36 -0
- package/docs/schemas/operational-memory-record.schema.json +24 -0
- package/docs/schemas/perception-input.schema.json +56 -0
- package/docs/schemas/project.schema.json +112 -0
- package/docs/schemas/promotion-list.schema.json +36 -0
- package/docs/schemas/promotion-plan.schema.json +60 -0
- package/docs/schemas/promotion-policy.schema.json +29 -0
- package/docs/schemas/promotion-receipt.schema.json +43 -0
- package/docs/schemas/promotion-status.schema.json +23 -0
- package/docs/schemas/release-readiness.schema.json +65 -0
- package/docs/schemas/remote-semantic-state-live-eval.schema.json +60 -0
- package/docs/schemas/remote-semantic-state-manifest.schema.json +79 -0
- package/docs/schemas/remote-semantic-state-provider.schema.json +98 -0
- package/docs/schemas/response-gate.schema.json +20 -0
- package/docs/schemas/task-checkpoint.schema.json +71 -0
- package/docs/schemas/task-completion-evidence.schema.json +154 -0
- package/docs/schemas/workspace-doctor.schema.json +56 -0
- package/docs/schemas/workspace-state.schema.json +39 -0
- package/evals/baselines/2026-07-16/opencode-basic-010-completion-summary.json +123 -0
- package/evals/baselines/2026-07-16/opencode-basic-skill-required-summary.json +69 -0
- package/evals/baselines/2026-07-16/opencode-multi-surface-summary.json +63 -0
- package/evals/baselines/2026-07-16/remote-state-live-summary.json +70 -0
- package/evals/baselines/2026-07-17/agent-enhance-opencode-dogfood-summary.json +98 -0
- package/evals/baselines/2026-07-17/personal-event-live-readiness-summary.json +68 -0
- package/examples/agents/fde-coach/AGENTS.md +26 -0
- package/examples/agents/fde-coach/MEMORY.md +3 -0
- package/examples/agents/fde-coach/fields/default/field.json +24 -0
- package/examples/agents/fde-coach/knowledge/INDEX.md +4 -0
- package/examples/agents/fde-coach/skills/fde-coach/SKILL.md +13 -0
- package/examples/agents/release-manager/AGENTS.md +26 -0
- package/examples/agents/release-manager/MEMORY.md +3 -0
- package/examples/agents/release-manager/fields/default/field.json +24 -0
- package/examples/agents/release-manager/knowledge/INDEX.md +4 -0
- package/examples/agents/release-manager/skills/release-manager/SKILL.md +13 -0
- package/lab/README.md +109 -0
- package/lab/agent-eval/catalog.json +91 -0
- package/lab/agent-eval/classic-failures.json +177 -0
- package/lab/agent-eval/completion-gate-regression.json +99 -0
- package/lab/agent-eval/personal-event-live.example.json +94 -0
- package/lab/agent-eval/remote-semantic-state-live.example.json +70 -0
- package/lab/agent-eval/remote-semantic-state-provider.fixture.json +47 -0
- package/lab/agent-eval/remote-state-workspace/AGENTS.md +8 -0
- package/lab/agent-eval/remote-state-workspace/opencode.json +7 -0
- package/lab/agent-eval/remote-state-workspace/skills/remote-state-operator/SKILL.md +13 -0
- package/lab/agent-eval/remote-state.example.json +31 -0
- package/lab/agent-eval/workspace/AGENTS.md +7 -0
- package/lab/agent-eval/workspace/MEMORY.md +4 -0
- package/lab/agent-eval/workspace/artifacts/pending-review.md +3 -0
- package/lab/agent-eval/workspace/knowledge/INDEX.md +4 -0
- package/lab/agent-eval/workspace/opencode.json +20 -0
- package/lab/manifest.example.json +27 -0
- package/lab/manifest.personal-event.example.json +27 -0
- package/lab/project-workspace/README.md +11 -0
- package/lab/project-workspace/fake-multica-provider.mjs +266 -0
- package/lab/project-workspace/multica-deploy.fixture.json +29 -0
- package/lab/project-workspace/multica-readonly.fixture.json +69 -0
- package/lab/project-workspace/observation.fixture.json +14 -0
- package/lab/project-workspace/opencode-provider-suite.json +65 -0
- package/lab/project-workspace/project.fixture.json +44 -0
- package/lab/project-workspace/promotion-policy.fixture.json +15 -0
- package/lab/robot-eval/pool.example.json +30 -0
- package/lab/robot-eval/suite.json +123 -0
- package/lab/robot-eval/workspace/AGENTS.md +21 -0
- package/lab/robot-eval/workspace/MEMORY.md +3 -0
- package/lab/robot-eval/workspace/knowledge/INDEX.md +5 -0
- package/lab/robot-eval/workspace/opencode.json +22 -0
- package/lab/schemas/agent-eval-catalog.schema.json +47 -0
- package/lab/schemas/lab-manifest.schema.json +70 -0
- package/lab/schemas/personal-event-eval.schema.json +91 -0
- package/lab/schemas/remote-state-eval.schema.json +66 -0
- package/lab/schemas/robot-eval-suite.schema.json +184 -0
- package/lab/schemas/robot-pool.schema.json +56 -0
- package/package.json +26 -14
- package/skills/dingtalk-agent-boot-multica/SKILL.md +40 -0
- package/skills/dingtalk-agent-compose/SKILL.md +110 -0
- package/skills/dingtalk-agent-compose/assets/AGENTS.template.md +26 -0
- package/skills/dingtalk-agent-compose/assets/agent.bindings.dingtalk-doc.template.json +13 -0
- package/skills/dingtalk-agent-compose/assets/agent.bindings.local.template.json +13 -0
- package/skills/dingtalk-agent-compose/assets/opencode.template.json +12 -0
- package/skills/dingtalk-agent-compose/assets/role-skill.template.md +24 -0
- package/skills/dingtalk-agent-compose/evals/evals.json +94 -0
- package/skills/dingtalk-agent-compose/references/agent-definition-contract.md +55 -0
- package/skills/dingtalk-agent-compose/references/opencode-host-contract.md +65 -0
- package/skills/dingtalk-agent-compose/references/storage-routing.md +20 -0
- package/skills/dingtalk-agent-deploy/SKILL.md +60 -0
- package/skills/dingtalk-agent-deploy/references/multica-deployment-contract.md +49 -0
- package/skills/dingtalk-agent-deploy/references/promotion-observation-contract.md +49 -0
- package/skills/dingtalk-agent-eval/SKILL.md +116 -0
- package/skills/dingtalk-agent-eval/assets/eval-catalog.template.json +18 -0
- package/skills/dingtalk-agent-eval/evals/evals.json +61 -0
- package/skills/dingtalk-agent-eval/references/eval-topology.md +34 -0
- package/skills/dingtalk-agent-eval/references/evidence-contract.md +31 -0
- package/skills/dingtalk-agent-eval/references/scenario-taxonomy.md +25 -0
- package/skills/dingtalk-agent-eval/references/storage-modes.md +75 -0
- package/skills/dingtalk-basic-behavior/SKILL.md +63 -3
- package/skills/dingtalk-basic-behavior/assets/memory-candidate-proposal.json +10 -0
- package/skills/dingtalk-basic-behavior/assets/{task-checkpoint.md → task-checkpoint.json} +2 -21
- package/skills/dingtalk-basic-behavior/references/action-contract.md +2 -0
- package/skills/dingtalk-basic-behavior/references/memory-and-evolution.md +15 -1
- package/skills/dingtalk-basic-behavior/references/perception-and-gates.md +28 -0
- package/skills/dingtalk-basic-behavior/references/task-lifecycle.md +32 -7
- package/dist/src/boot.js +0 -70
- package/dist/src/boot.js.map +0 -1
- package/dist/src/duty.js +0 -74
- package/dist/src/duty.js.map +0 -1
- package/dist/src/kb.js +0 -240
- package/dist/src/kb.js.map +0 -1
- package/dist/src/runs.js +0 -79
- package/dist/src/runs.js.map +0 -1
- package/docs/ARCHITECTURE.md +0 -217
- package/docs/MINIMAL-WORKSPACE-V1.md +0 -172
- package/docs/OPEN-SOURCE-REFERENCES.md +0 -107
- package/docs/SELF-TEST.md +0 -252
- package/docs//345/206/205/347/275/221/345/256/236/347/233/270.md +0 -77
- package/evals/baselines/2026-07-14/behavior-summary.json +0 -28
- package/evals/baselines/2026-07-14/contract-summary.json +0 -18
- package/evals/baselines/2026-07-14/live-canary-summary.json +0 -25
- package/evals/baselines/2026-07-15/dingtalk-basic-behavior-0.3.0/SKILL.md +0 -72
- package/evals/baselines/2026-07-15/dingtalk-basic-behavior-0.3.0/references/action-contract.md +0 -31
- package/evals/baselines/2026-07-15/dingtalk-basic-behavior-0.3.0/references/event-to-behavior.md +0 -22
- package/evals/baselines/2026-07-15/dingtalk-basic-behavior-0.3.0/references/memory-and-evolution.md +0 -25
- package/evals/baselines/2026-07-15/dingtalk-basic-behavior-0.3.0/references/runtime-modes.md +0 -34
- package/evals/baselines/2026-07-15/task-lifecycle-summary.json +0 -50
- package/evals/evals.json +0 -316
- package/evals/fixtures/dm-ambiguous-send.json +0 -4
- package/evals/fixtures/dm-blocked.json +0 -4
- package/evals/fixtures/dm-clear.json +0 -4
- package/evals/fixtures/dm-discussion.json +0 -4
- package/evals/fixtures/dm-doc-write-no-tool.json +0 -4
- package/evals/fixtures/dm-long-task-ack.json +0 -4
- package/evals/fixtures/dm-nonblocking-gap.json +0 -4
- package/evals/fixtures/dm-structured-task.json +0 -4
- package/evals/fixtures/group.json +0 -10
- package/evals/fixtures/mentioned.json +0 -3
- package/evals/run-contract-evals.mjs +0 -1106
- package/evals/run-shadow-evals.mjs +0 -267
- package/evals/runners/README.md +0 -66
- package/evals/runners/claude-shadow.mjs +0 -533
- package/evals/schemas/action-request.schema.json +0 -77
- package/evals/shadow-evals.json +0 -133
- package/skills/AGENTS.md +0 -104
- package/skills//344/273/273/345/212/241.md +0 -48
- package/skills//345/237/272/347/241/200/350/241/214/344/270/272.md +0 -44
- package/skills//345/277/203/350/267/263.md +0 -79
- package/skills//346/266/210/346/201/257.md +0 -50
- package/skills//347/237/245/350/257/206.md +0 -55
- package/skills//350/257/204/346/265/213.md +0 -62
- package/skills//351/222/211/351/222/211.md +0 -64
- package/templates/ontology/index.md +0 -24
- package/templates/ontology/self/access.md +0 -38
- package/templates/ontology/self/role-spec.md +0 -34
- package/templates/ontology/self/workspace.md +0 -41
|
@@ -1,267 +0,0 @@
|
|
|
1
|
-
#!/usr/bin/env node
|
|
2
|
-
|
|
3
|
-
// 从同一 fixture/Field 物化等价 Prepared Run,做当前 Skill 与无 Skill/上一快照对照。
|
|
4
|
-
// 全部为 shadow:模型没有 Bash/DWS/网络,runner 也不会执行 ActionRequest。
|
|
5
|
-
|
|
6
|
-
import {
|
|
7
|
-
cpSync, existsSync, mkdirSync, mkdtempSync, readFileSync, realpathSync, rmSync,
|
|
8
|
-
statSync, writeFileSync,
|
|
9
|
-
} from 'node:fs'
|
|
10
|
-
import { tmpdir } from 'node:os'
|
|
11
|
-
import { dirname, join, resolve } from 'node:path'
|
|
12
|
-
import { fileURLToPath } from 'node:url'
|
|
13
|
-
import { parseArgs } from 'node:util'
|
|
14
|
-
import { spawnSync } from 'node:child_process'
|
|
15
|
-
import { init } from '../dist/src/init.js'
|
|
16
|
-
import * as config from '../dist/src/config.js'
|
|
17
|
-
import { prepareSession } from '../dist/src/sessions.js'
|
|
18
|
-
|
|
19
|
-
const HERE = dirname(fileURLToPath(import.meta.url))
|
|
20
|
-
const ROOT = dirname(HERE)
|
|
21
|
-
const RUNNER = join(HERE, 'runners', 'claude-shadow.mjs')
|
|
22
|
-
const SUITE = readJson(join(HERE, 'shadow-evals.json'))
|
|
23
|
-
|
|
24
|
-
const { values } = parseArgs({
|
|
25
|
-
options: {
|
|
26
|
-
eval: { type: 'string' },
|
|
27
|
-
runs: { type: 'string' },
|
|
28
|
-
out: { type: 'string' },
|
|
29
|
-
model: { type: 'string' },
|
|
30
|
-
effort: { type: 'string' },
|
|
31
|
-
'max-budget-usd': { type: 'string' },
|
|
32
|
-
'timeout-ms': { type: 'string' },
|
|
33
|
-
'baseline-skill': { type: 'string' },
|
|
34
|
-
help: { type: 'boolean', short: 'h' },
|
|
35
|
-
},
|
|
36
|
-
strict: true,
|
|
37
|
-
})
|
|
38
|
-
if (values.help) {
|
|
39
|
-
process.stdout.write(`dingtalk-agent eval behavior [options]\n\n` +
|
|
40
|
-
` --eval 101,102 只跑指定场景(默认全部)\n` +
|
|
41
|
-
` --runs 3 每种配置重复次数(默认 1)\n` +
|
|
42
|
-
` --model <full-id> 固定完整模型 ID\n` +
|
|
43
|
-
` --baseline-skill DIR 与上一版 Skill 目录对照;不传则与无 Skill 对照\n` +
|
|
44
|
-
` --out <dir> 结果工作区\n` +
|
|
45
|
-
` --max-budget-usd N 每次 Claude 上限(默认 0.15)\n`)
|
|
46
|
-
process.exit(0)
|
|
47
|
-
}
|
|
48
|
-
|
|
49
|
-
const runsPerConfig = positiveInt(values.runs || '1', '--runs')
|
|
50
|
-
const selectedIds = values.eval
|
|
51
|
-
? new Set(values.eval.split(',').map((x) => Number(x.trim())))
|
|
52
|
-
: null
|
|
53
|
-
const scenarios = SUITE.evals.filter((item) => !selectedIds || selectedIds.has(item.id))
|
|
54
|
-
if (!scenarios.length) throw new Error('没有选中任何 shadow eval')
|
|
55
|
-
const baselineSkill = values['baseline-skill'] ? validateSkillDir(values['baseline-skill']) : ''
|
|
56
|
-
const comparison = baselineSkill
|
|
57
|
-
? { name: 'previous_skill', skillMode: 'with', skillSource: baselineSkill }
|
|
58
|
-
: { name: 'without_skill', skillMode: 'without', skillSource: '' }
|
|
59
|
-
const configurations = [
|
|
60
|
-
{ name: 'with_skill', skillMode: 'with', skillSource: '' },
|
|
61
|
-
comparison,
|
|
62
|
-
]
|
|
63
|
-
const stamp = new Date().toISOString().replace(/[:.]/g, '-')
|
|
64
|
-
const workspaceRoot = resolve(values.out || join(HERE, 'results', `shadow-${stamp}`))
|
|
65
|
-
mkdirSync(workspaceRoot, { recursive: true })
|
|
66
|
-
|
|
67
|
-
const benchmarkRuns = []
|
|
68
|
-
for (const [scenarioIndex, scenario] of scenarios.entries()) {
|
|
69
|
-
const raw = readJson(join(HERE, scenario.fixture))
|
|
70
|
-
const evalDir = join(workspaceRoot, `eval-${scenario.id}`)
|
|
71
|
-
mkdirSync(evalDir, { recursive: true })
|
|
72
|
-
writeJson(join(evalDir, 'eval_metadata.json'), {
|
|
73
|
-
eval_id: scenario.id,
|
|
74
|
-
prompt: scenario.prompt,
|
|
75
|
-
expected_output: scenario.expected_output,
|
|
76
|
-
})
|
|
77
|
-
|
|
78
|
-
for (let runNumber = 1; runNumber <= runsPerConfig; runNumber++) {
|
|
79
|
-
// 交替先后,减少固定 with→baseline 带来的缓存、负载和顺序偏差。
|
|
80
|
-
const order = (scenarioIndex + runNumber) % 2 === 0
|
|
81
|
-
? [...configurations].reverse()
|
|
82
|
-
: configurations
|
|
83
|
-
for (const configuration of order) {
|
|
84
|
-
const sandbox = mkdtempSync(join(tmpdir(), `dta-shadow-${scenario.id}-${configuration.name}-`))
|
|
85
|
-
try {
|
|
86
|
-
silence(() => init(sandbox))
|
|
87
|
-
if (configuration.skillSource) installSkillSnapshot(sandbox, configuration.skillSource)
|
|
88
|
-
const cfg = config.must(sandbox)
|
|
89
|
-
const dispatch = prepareSession(sandbox, cfg, raw)
|
|
90
|
-
const runDir = join(evalDir, configuration.name, `run-${runNumber}`)
|
|
91
|
-
const outputs = join(runDir, 'outputs')
|
|
92
|
-
mkdirSync(outputs, { recursive: true })
|
|
93
|
-
writeJson(join(runDir, 'eval_metadata.json'), {
|
|
94
|
-
eval_id: scenario.id,
|
|
95
|
-
prompt: scenario.prompt,
|
|
96
|
-
expected_output: scenario.expected_output,
|
|
97
|
-
})
|
|
98
|
-
const args = [RUNNER, '--run', dispatch.cwd, '--out', outputs,
|
|
99
|
-
'--skill-mode', configuration.skillMode, '--json']
|
|
100
|
-
if (values.model) args.push('--model', values.model)
|
|
101
|
-
if (values.effort) args.push('--effort', values.effort)
|
|
102
|
-
if (values['max-budget-usd']) args.push('--max-budget-usd', values['max-budget-usd'])
|
|
103
|
-
if (values['timeout-ms']) args.push('--timeout-ms', values['timeout-ms'])
|
|
104
|
-
const started = Date.now()
|
|
105
|
-
const child = spawnSync(process.execPath, args, {
|
|
106
|
-
cwd: ROOT, encoding: 'utf8', env: withoutDtaRoot(process.env),
|
|
107
|
-
})
|
|
108
|
-
const elapsed = (Date.now() - started) / 1000
|
|
109
|
-
writeFileSync(join(runDir, 'transcript.md'), transcript(scenario, configuration.name, child))
|
|
110
|
-
const final = maybeJson(join(outputs, 'final-action-request.json'))
|
|
111
|
-
const metrics = maybeJson(join(outputs, 'metrics.json'))
|
|
112
|
-
const grading = grade(scenario, final, metrics, elapsed, child)
|
|
113
|
-
writeJson(join(runDir, 'grading.json'), grading)
|
|
114
|
-
writeJson(join(runDir, 'timing.json'), grading.timing)
|
|
115
|
-
benchmarkRuns.push({
|
|
116
|
-
eval_id: scenario.id,
|
|
117
|
-
eval_name: scenario.name,
|
|
118
|
-
configuration: configuration.name,
|
|
119
|
-
run_number: runNumber,
|
|
120
|
-
result: {
|
|
121
|
-
pass_rate: grading.summary.pass_rate,
|
|
122
|
-
passed: grading.summary.passed,
|
|
123
|
-
failed: grading.summary.failed,
|
|
124
|
-
total: grading.summary.total,
|
|
125
|
-
time_seconds: elapsed,
|
|
126
|
-
tokens: tokenCount(metrics),
|
|
127
|
-
tool_calls: metrics?.trace?.toolCalls || 0,
|
|
128
|
-
errors: grading.summary.failed,
|
|
129
|
-
},
|
|
130
|
-
expectations: grading.expectations,
|
|
131
|
-
notes: child.status === 0 ? [] : [`runner exit=${child.status}: ${String(child.stderr || '').slice(0, 300)}`],
|
|
132
|
-
})
|
|
133
|
-
} finally {
|
|
134
|
-
rmSync(sandbox, { recursive: true, force: true })
|
|
135
|
-
}
|
|
136
|
-
}
|
|
137
|
-
}
|
|
138
|
-
}
|
|
139
|
-
|
|
140
|
-
const benchmark = buildBenchmark(
|
|
141
|
-
benchmarkRuns, scenarios, runsPerConfig, values.model, comparison.name, baselineSkill)
|
|
142
|
-
writeJson(join(workspaceRoot, 'benchmark.json'), benchmark)
|
|
143
|
-
process.stdout.write(JSON.stringify({
|
|
144
|
-
ok: benchmarkRuns.every((run) => run.result.pass_rate === 1),
|
|
145
|
-
workspace: workspaceRoot,
|
|
146
|
-
benchmark: join(workspaceRoot, 'benchmark.json'),
|
|
147
|
-
runs: benchmarkRuns.length,
|
|
148
|
-
summary: benchmark.run_summary,
|
|
149
|
-
}, null, 2) + '\n')
|
|
150
|
-
if (benchmarkRuns.some((run) => run.result.pass_rate < 1)) process.exitCode = 1
|
|
151
|
-
|
|
152
|
-
function grade(scenario, final, metrics, elapsed, child) {
|
|
153
|
-
const request = final?.request
|
|
154
|
-
const safe = child.status === 0 && final?.accepted === true &&
|
|
155
|
-
final?.externalSideEffect === false && metrics?.shadow?.sideEffectsExecuted === 0
|
|
156
|
-
const action = safe && request?.action === scenario.expected_action
|
|
157
|
-
const value = request?.payload?.text || request?.payload?.reason || ''
|
|
158
|
-
const pattern = scenario.text_pattern || scenario.reason_pattern
|
|
159
|
-
const patternPass = !pattern || new RegExp(pattern, 'i').test(value)
|
|
160
|
-
const forbiddenPattern = scenario.forbidden_text_pattern
|
|
161
|
-
const forbiddenPass = !forbiddenPattern || !new RegExp(forbiddenPattern, 'i').test(value)
|
|
162
|
-
const questions = (String(value).match(/[??]/g) || []).length
|
|
163
|
-
const content = safe && patternPass && forbiddenPass &&
|
|
164
|
-
(scenario.max_questions === undefined || questions <= scenario.max_questions)
|
|
165
|
-
const checks = [
|
|
166
|
-
[safe, `accepted=${final?.accepted}; exit=${child.status}; sideEffects=${metrics?.shadow?.sideEffectsExecuted}`],
|
|
167
|
-
[action, `expected=${scenario.expected_action}; actual=${request?.action || 'none'}`],
|
|
168
|
-
[content, `payload=${JSON.stringify(request?.payload || null)}; questions=${questions}; forbidden=${forbiddenPattern || 'none'}`],
|
|
169
|
-
]
|
|
170
|
-
const expectations = scenario.expectations.map((text, index) => ({
|
|
171
|
-
text, passed: Boolean(checks[index]?.[0]), evidence: checks[index]?.[1] || '没有证据',
|
|
172
|
-
}))
|
|
173
|
-
const passed = expectations.filter((item) => item.passed).length
|
|
174
|
-
return {
|
|
175
|
-
expectations,
|
|
176
|
-
summary: { passed, failed: expectations.length - passed, total: expectations.length,
|
|
177
|
-
pass_rate: expectations.length ? passed / expectations.length : 0 },
|
|
178
|
-
execution_metrics: {
|
|
179
|
-
tool_calls: { Read: metrics?.trace?.toolCalls || 0 },
|
|
180
|
-
total_tool_calls: metrics?.trace?.toolCalls || 0,
|
|
181
|
-
total_steps: metrics?.claude?.numTurns || 0,
|
|
182
|
-
errors_encountered: expectations.length - passed,
|
|
183
|
-
output_chars: JSON.stringify(final || {}).length,
|
|
184
|
-
transcript_chars: String(child.stdout || '').length + String(child.stderr || '').length,
|
|
185
|
-
},
|
|
186
|
-
timing: { executor_duration_seconds: elapsed, grader_duration_seconds: 0,
|
|
187
|
-
total_duration_seconds: elapsed },
|
|
188
|
-
claims: [],
|
|
189
|
-
user_notes_summary: { uncertainties: [], needs_review: [], workarounds: [] },
|
|
190
|
-
eval_feedback: { suggestions: [], overall: '硬断言检查动作、安全边界和最小内容;自然度仍需人工盲评。' },
|
|
191
|
-
}
|
|
192
|
-
}
|
|
193
|
-
|
|
194
|
-
function buildBenchmark(runs, scenarios, count, model, baselineName, baselinePath) {
|
|
195
|
-
const summarize = (configuration, field) => {
|
|
196
|
-
const values = runs.filter((run) => run.configuration === configuration)
|
|
197
|
-
.map((run) => Number(run.result[field] || 0))
|
|
198
|
-
const mean = values.reduce((a, b) => a + b, 0) / (values.length || 1)
|
|
199
|
-
const variance = values.reduce((sum, value) => sum + ((value - mean) ** 2), 0) / (values.length || 1)
|
|
200
|
-
return { mean, stddev: Math.sqrt(variance), min: Math.min(...values), max: Math.max(...values) }
|
|
201
|
-
}
|
|
202
|
-
const withPass = summarize('with_skill', 'pass_rate')
|
|
203
|
-
const baselinePass = summarize(baselineName, 'pass_rate')
|
|
204
|
-
const withTime = summarize('with_skill', 'time_seconds')
|
|
205
|
-
const baselineTime = summarize(baselineName, 'time_seconds')
|
|
206
|
-
const withTokens = summarize('with_skill', 'tokens')
|
|
207
|
-
const baselineTokens = summarize(baselineName, 'tokens')
|
|
208
|
-
const notes = []
|
|
209
|
-
for (const scenario of scenarios) {
|
|
210
|
-
const a = runs.filter((run) => run.eval_id === scenario.id && run.configuration === 'with_skill')
|
|
211
|
-
const b = runs.filter((run) => run.eval_id === scenario.id && run.configuration === baselineName)
|
|
212
|
-
if (a.every((run) => run.result.pass_rate === 1) && b.every((run) => run.result.pass_rate === 1)) {
|
|
213
|
-
notes.push(`Eval ${scenario.id} 在 with_skill 与 ${baselineName} 均通过;当前场景不区分 Skill 增益。`)
|
|
214
|
-
}
|
|
215
|
-
}
|
|
216
|
-
return {
|
|
217
|
-
metadata: { skill_name: SUITE.skill_name, skill_path: join(ROOT, 'skills', SUITE.skill_name),
|
|
218
|
-
executor_model: model || 'claude-default', analyzer_model: 'deterministic-assertions',
|
|
219
|
-
timestamp: new Date().toISOString(), evals_run: scenarios.map((x) => x.id),
|
|
220
|
-
runs_per_configuration: count, comparison_configuration: baselineName,
|
|
221
|
-
baseline_skill_path: baselinePath || null, execution_order: 'alternating' },
|
|
222
|
-
runs,
|
|
223
|
-
run_summary: {
|
|
224
|
-
with_skill: { pass_rate: withPass, time_seconds: withTime, tokens: withTokens },
|
|
225
|
-
[baselineName]: { pass_rate: baselinePass, time_seconds: baselineTime, tokens: baselineTokens },
|
|
226
|
-
delta: { pass_rate: signed(withPass.mean - baselinePass.mean),
|
|
227
|
-
time_seconds: signed(withTime.mean - baselineTime.mean),
|
|
228
|
-
tokens: signed(withTokens.mean - baselineTokens.mean) },
|
|
229
|
-
},
|
|
230
|
-
notes,
|
|
231
|
-
}
|
|
232
|
-
}
|
|
233
|
-
|
|
234
|
-
function transcript(scenario, configuration, child) {
|
|
235
|
-
return `# Shadow Eval ${scenario.id}\n\n## Eval Prompt\n\n${scenario.prompt}\n\n` +
|
|
236
|
-
`## Configuration\n\n${configuration}\n\n## Runner stdout\n\n\`\`\`json\n${child.stdout || ''}\n\`\`\`\n\n` +
|
|
237
|
-
`## Runner stderr\n\n\`\`\`text\n${child.stderr || ''}\n\`\`\`\n`
|
|
238
|
-
}
|
|
239
|
-
|
|
240
|
-
function tokenCount(metrics) {
|
|
241
|
-
const usage = metrics?.claude?.usage || {}
|
|
242
|
-
return Number(usage.input_tokens || 0) + Number(usage.output_tokens || 0) +
|
|
243
|
-
Number(usage.cache_creation_input_tokens || 0) + Number(usage.cache_read_input_tokens || 0)
|
|
244
|
-
}
|
|
245
|
-
|
|
246
|
-
function maybeJson(path) { try { return readJson(path) } catch { return null } }
|
|
247
|
-
function readJson(path) { return JSON.parse(readFileSync(path, 'utf8')) }
|
|
248
|
-
function writeJson(path, value) { mkdirSync(dirname(path), { recursive: true });
|
|
249
|
-
writeFileSync(path, JSON.stringify(value, null, 2) + '\n') }
|
|
250
|
-
function silence(fn) { const log = console.log; console.log = () => {}; try { return fn() } finally { console.log = log } }
|
|
251
|
-
function positiveInt(value, flag) { const n = Number(value); if (!Number.isInteger(n) || n < 1) throw new Error(`${flag} 必须是正整数`); return n }
|
|
252
|
-
function withoutDtaRoot(env) { const out = { ...env }; delete out.DTA_ROOT; return out }
|
|
253
|
-
function signed(value) { return `${value >= 0 ? '+' : ''}${Number(value.toFixed(4))}` }
|
|
254
|
-
|
|
255
|
-
function validateSkillDir(path) {
|
|
256
|
-
const full = realpathSync(resolve(path))
|
|
257
|
-
if (!statSync(full).isDirectory() || !existsSync(join(full, 'SKILL.md'))) {
|
|
258
|
-
throw new Error(`--baseline-skill 必须指向含 SKILL.md 的目录: ${path}`)
|
|
259
|
-
}
|
|
260
|
-
return full
|
|
261
|
-
}
|
|
262
|
-
|
|
263
|
-
function installSkillSnapshot(root, source) {
|
|
264
|
-
const destination = join(root, 'skills', SUITE.skill_name)
|
|
265
|
-
rmSync(destination, { recursive: true, force: true })
|
|
266
|
-
cpSync(source, destination, { recursive: true })
|
|
267
|
-
}
|
package/evals/runners/README.md
DELETED
|
@@ -1,66 +0,0 @@
|
|
|
1
|
-
# Claude Code shadow runner
|
|
2
|
-
|
|
3
|
-
`claude-shadow.mjs` 消费一个已经 `prepare` 的 Run,让 Claude Code 只做行为判断,输出结构化 `ActionRequest`。它不会调用 `dingtalk-agent act`、DWS 或任何外发接口。
|
|
4
|
-
|
|
5
|
-
```bash
|
|
6
|
-
node evals/runners/claude-shadow.mjs \
|
|
7
|
-
--run /absolute/path/to/.dingtalk-agent/sessions/.../runs/run_... \
|
|
8
|
-
--model '<固定的完整模型 ID>' \
|
|
9
|
-
--max-budget-usd 0.15 \
|
|
10
|
-
--json
|
|
11
|
-
```
|
|
12
|
-
|
|
13
|
-
首次建立基线时使用同一个 Run、模型和预算,只切换 Skill:
|
|
14
|
-
|
|
15
|
-
```bash
|
|
16
|
-
dingtalk-agent eval shadow --run <run-cwd> --skill-mode with
|
|
17
|
-
dingtalk-agent eval shadow --run <run-cwd> --skill-mode without
|
|
18
|
-
```
|
|
19
|
-
|
|
20
|
-
`without` 不读取 Skill 快照;若轨迹里出现该读取,runner 会直接判失败,避免基线偷看答案。
|
|
21
|
-
|
|
22
|
-
后续迭代不再与“空白 Agent”比较,而是把当前工作树与上一版 Skill 快照比较:
|
|
23
|
-
|
|
24
|
-
```bash
|
|
25
|
-
dingtalk-agent eval behavior \
|
|
26
|
-
--baseline-skill /path/to/previous/dingtalk-basic-behavior \
|
|
27
|
-
--model '<固定的完整模型 ID>' --runs 3
|
|
28
|
-
```
|
|
29
|
-
|
|
30
|
-
输出配置名为 `with_skill` 与 `previous_skill`,执行先后按场景/run 交替,减少固定顺序偏差。
|
|
31
|
-
|
|
32
|
-
prepared Run 必须包含:
|
|
33
|
-
|
|
34
|
-
- `CONTEXT.md`
|
|
35
|
-
- `run.json`
|
|
36
|
-
- `context/message.md`
|
|
37
|
-
- `context/reply-target.json`(只供 runner 校验模型没有复制权威 ID,不要求模型读取)
|
|
38
|
-
- `policy/allowed-actions.json`
|
|
39
|
-
- `context/skills/dingtalk-basic-behavior/SKILL.md`
|
|
40
|
-
|
|
41
|
-
runner 默认以 Run 为 `cwd`,使用:
|
|
42
|
-
|
|
43
|
-
```text
|
|
44
|
-
claude --bare --disable-slash-commands --tools Read
|
|
45
|
-
--permission-mode dontAsk --no-session-persistence
|
|
46
|
-
```
|
|
47
|
-
|
|
48
|
-
并额外开启 `stream-json`、JSON Schema、低预算和超时。`--bare` 用于关闭项目/用户扩展、Hooks、MCP 和 Skills,不是身份或文件系统沙箱;Claude 仍需自己的有效登录态。
|
|
49
|
-
|
|
50
|
-
输出目录包含:
|
|
51
|
-
|
|
52
|
-
```text
|
|
53
|
-
runner-config.json
|
|
54
|
-
prompt.txt
|
|
55
|
-
claude.stdout.ndjson
|
|
56
|
-
claude.stderr.log
|
|
57
|
-
tool-calls.json
|
|
58
|
-
final-action-request.json
|
|
59
|
-
metrics.json
|
|
60
|
-
```
|
|
61
|
-
|
|
62
|
-
评测通过不仅要求结构化输出合法,还要求轨迹中确实观察到 Claude 用 `Read` 读取 `CONTEXT.md` 和 Basic Behavior Skill 快照。JSON Schema 会自动注入一个无副作用的内建 `StructuredOutput` 终态通道;除此之外,任何非 `Read` 工具、越出 `allowedActions`、把本 Run 的权威目标 ID 复制进 ActionRequest、Run 外读取尝试或 Claude 终态错误都会判失败。
|
|
63
|
-
|
|
64
|
-
注意:runner 能从轨迹中发现 Run 外 `Read` 并判失败,但 `--tools Read` 不能在操作系统层阻止尝试发生。敏感评测仍需把整个 Claude 进程放进文件系统隔离的容器/沙箱。
|
|
65
|
-
|
|
66
|
-
`final-action-request.json` 只是 shadow 证据。若要进入 mock 或 live-canary,必须由独立 Host Broker 重新校验并显式晋级;不要把 runner 输出直接 pipe 给 `dingtalk-agent act`。
|