@rpamis/comet 0.4.0-beta.3 → 0.4.0-beta.4
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/README.md +10 -0
- package/assets/manifest.json +2 -1
- package/assets/skills/comet/SKILL.md +25 -1
- package/assets/skills/comet/reference/comet-yaml-fields.md +5 -2
- package/assets/skills/comet/reference/context-recovery.md +10 -0
- package/assets/skills/comet/reference/scripts.md +47 -15
- package/assets/skills/comet/rules/comet-phase-guard.en.md +8 -0
- package/assets/skills/comet/rules/comet-phase-guard.md +9 -1
- package/assets/skills/comet/scripts/comet-resume-probe.mjs +3 -0
- package/assets/skills/comet/scripts/comet-runtime.mjs +1387 -424
- package/assets/skills/comet-archive/SKILL.md +24 -11
- package/assets/skills/comet-build/SKILL.md +42 -25
- package/assets/skills/comet-design/SKILL.md +1 -0
- package/assets/skills/comet-hotfix/SKILL.md +3 -1
- package/assets/skills/comet-open/SKILL.md +11 -1
- package/assets/skills/comet-tweak/SKILL.md +3 -1
- package/assets/skills/comet-verify/SKILL.md +29 -20
- package/assets/skills-zh/comet/SKILL.md +25 -1
- package/assets/skills-zh/comet/reference/comet-yaml-fields.md +5 -2
- package/assets/skills-zh/comet/reference/context-recovery.md +10 -0
- package/assets/skills-zh/comet/reference/scripts.md +47 -15
- package/assets/skills-zh/comet-archive/SKILL.md +24 -11
- package/assets/skills-zh/comet-build/SKILL.md +42 -25
- package/assets/skills-zh/comet-design/SKILL.md +1 -0
- package/assets/skills-zh/comet-hotfix/SKILL.md +3 -1
- package/assets/skills-zh/comet-open/SKILL.md +11 -1
- package/assets/skills-zh/comet-tweak/SKILL.md +3 -1
- package/assets/skills-zh/comet-verify/SKILL.md +30 -21
- package/dist/app/cli/comet-banner.d.ts +25 -0
- package/dist/app/cli/comet-banner.d.ts.map +1 -0
- package/dist/app/cli/comet-banner.js +265 -0
- package/dist/app/cli/comet-banner.js.map +1 -0
- package/dist/app/cli/index.js +36 -2
- package/dist/app/cli/index.js.map +1 -1
- package/dist/app/commands/classic.d.ts +4 -0
- package/dist/app/commands/classic.d.ts.map +1 -0
- package/dist/app/commands/classic.js +11 -0
- package/dist/app/commands/classic.js.map +1 -0
- package/dist/app/commands/doctor.d.ts.map +1 -1
- package/dist/app/commands/doctor.js +39 -24
- package/dist/app/commands/doctor.js.map +1 -1
- package/dist/app/commands/eval.d.ts.map +1 -1
- package/dist/app/commands/eval.js +57 -20
- package/dist/app/commands/eval.js.map +1 -1
- package/dist/app/commands/i18n.d.ts +1 -1
- package/dist/app/commands/i18n.d.ts.map +1 -1
- package/dist/app/commands/i18n.js +12 -4
- package/dist/app/commands/i18n.js.map +1 -1
- package/dist/app/commands/init.d.ts.map +1 -1
- package/dist/app/commands/init.js +16 -13
- package/dist/app/commands/init.js.map +1 -1
- package/dist/app/commands/project-scope-selection.d.ts +13 -0
- package/dist/app/commands/project-scope-selection.d.ts.map +1 -0
- package/dist/app/commands/project-scope-selection.js +33 -0
- package/dist/app/commands/project-scope-selection.js.map +1 -0
- package/dist/app/commands/resume-probe.d.ts +11 -0
- package/dist/app/commands/resume-probe.d.ts.map +1 -0
- package/dist/app/commands/resume-probe.js +63 -0
- package/dist/app/commands/resume-probe.js.map +1 -0
- package/dist/app/commands/status.d.ts +31 -0
- package/dist/app/commands/status.d.ts.map +1 -1
- package/dist/app/commands/status.js +109 -20
- package/dist/app/commands/status.js.map +1 -1
- package/dist/app/commands/uninstall.d.ts +2 -0
- package/dist/app/commands/uninstall.d.ts.map +1 -1
- package/dist/app/commands/uninstall.js +217 -40
- package/dist/app/commands/uninstall.js.map +1 -1
- package/dist/app/commands/update.d.ts +6 -0
- package/dist/app/commands/update.d.ts.map +1 -1
- package/dist/app/commands/update.js +361 -68
- package/dist/app/commands/update.js.map +1 -1
- package/dist/config/repository-layout.json +4 -2
- package/dist/domains/bundle/bundle-platform.d.ts.map +1 -1
- package/dist/domains/bundle/bundle-platform.js +3 -1
- package/dist/domains/bundle/bundle-platform.js.map +1 -1
- package/dist/domains/bundle/eval-manifest-runtime.d.ts +6 -0
- package/dist/domains/bundle/eval-manifest-runtime.d.ts.map +1 -0
- package/dist/domains/bundle/eval-manifest-runtime.js +58 -0
- package/dist/domains/bundle/eval-manifest-runtime.js.map +1 -0
- package/dist/domains/bundle/types.d.ts +1 -1
- package/dist/domains/bundle/types.d.ts.map +1 -1
- package/dist/domains/comet-classic/classic-archive.d.ts +1 -0
- package/dist/domains/comet-classic/classic-archive.d.ts.map +1 -1
- package/dist/domains/comet-classic/classic-archive.js +35 -38
- package/dist/domains/comet-classic/classic-archive.js.map +1 -1
- package/dist/domains/comet-classic/classic-cli.d.ts +1 -1
- package/dist/domains/comet-classic/classic-cli.d.ts.map +1 -1
- package/dist/domains/comet-classic/classic-cli.js +3 -0
- package/dist/domains/comet-classic/classic-cli.js.map +1 -1
- package/dist/domains/comet-classic/classic-command-checks.d.ts +20 -0
- package/dist/domains/comet-classic/classic-command-checks.d.ts.map +1 -0
- package/dist/domains/comet-classic/classic-command-checks.js +97 -0
- package/dist/domains/comet-classic/classic-command-checks.js.map +1 -0
- package/dist/domains/comet-classic/classic-current-change.d.ts +19 -0
- package/dist/domains/comet-classic/classic-current-change.d.ts.map +1 -0
- package/dist/domains/comet-classic/classic-current-change.js +132 -0
- package/dist/domains/comet-classic/classic-current-change.js.map +1 -0
- package/dist/domains/comet-classic/classic-diagnostics.d.ts +2 -1
- package/dist/domains/comet-classic/classic-diagnostics.d.ts.map +1 -1
- package/dist/domains/comet-classic/classic-diagnostics.js +54 -1
- package/dist/domains/comet-classic/classic-diagnostics.js.map +1 -1
- package/dist/domains/comet-classic/classic-evidence.d.ts.map +1 -1
- package/dist/domains/comet-classic/classic-evidence.js +4 -0
- package/dist/domains/comet-classic/classic-evidence.js.map +1 -1
- package/dist/domains/comet-classic/classic-guard.d.ts.map +1 -1
- package/dist/domains/comet-classic/classic-guard.js +68 -69
- package/dist/domains/comet-classic/classic-guard.js.map +1 -1
- package/dist/domains/comet-classic/classic-hook-guard.d.ts.map +1 -1
- package/dist/domains/comet-classic/classic-hook-guard.js +66 -23
- package/dist/domains/comet-classic/classic-hook-guard.js.map +1 -1
- package/dist/domains/comet-classic/classic-project-config.d.ts +16 -0
- package/dist/domains/comet-classic/classic-project-config.d.ts.map +1 -0
- package/dist/domains/comet-classic/classic-project-config.js +40 -0
- package/dist/domains/comet-classic/classic-project-config.js.map +1 -0
- package/dist/domains/comet-classic/classic-resolver.d.ts.map +1 -1
- package/dist/domains/comet-classic/classic-resolver.js +3 -3
- package/dist/domains/comet-classic/classic-resolver.js.map +1 -1
- package/dist/domains/comet-classic/classic-resume-probe-command.d.ts +3 -0
- package/dist/domains/comet-classic/classic-resume-probe-command.d.ts.map +1 -0
- package/dist/domains/comet-classic/classic-resume-probe-command.js +58 -0
- package/dist/domains/comet-classic/classic-resume-probe-command.js.map +1 -0
- package/dist/domains/comet-classic/classic-resume-probe-entry.d.ts +2 -0
- package/dist/domains/comet-classic/classic-resume-probe-entry.d.ts.map +1 -0
- package/dist/domains/comet-classic/classic-resume-probe-entry.js +4 -0
- package/dist/domains/comet-classic/classic-resume-probe-entry.js.map +1 -0
- package/dist/domains/comet-classic/classic-resume-probe.d.ts +29 -0
- package/dist/domains/comet-classic/classic-resume-probe.d.ts.map +1 -0
- package/dist/domains/comet-classic/classic-resume-probe.js +386 -0
- package/dist/domains/comet-classic/classic-resume-probe.js.map +1 -0
- package/dist/domains/comet-classic/classic-runtime-run.d.ts +2 -1
- package/dist/domains/comet-classic/classic-runtime-run.d.ts.map +1 -1
- package/dist/domains/comet-classic/classic-runtime-run.js +38 -0
- package/dist/domains/comet-classic/classic-runtime-run.js.map +1 -1
- package/dist/domains/comet-classic/classic-state-command.d.ts.map +1 -1
- package/dist/domains/comet-classic/classic-state-command.js +128 -12
- package/dist/domains/comet-classic/classic-state-command.js.map +1 -1
- package/dist/domains/comet-classic/classic-state.d.ts +3 -1
- package/dist/domains/comet-classic/classic-state.d.ts.map +1 -1
- package/dist/domains/comet-classic/classic-state.js +4 -0
- package/dist/domains/comet-classic/classic-state.js.map +1 -1
- package/dist/domains/comet-classic/classic-store.d.ts +4 -1
- package/dist/domains/comet-classic/classic-store.d.ts.map +1 -1
- package/dist/domains/comet-classic/classic-store.js +4 -3
- package/dist/domains/comet-classic/classic-store.js.map +1 -1
- package/dist/domains/comet-classic/classic-transitions.d.ts +1 -1
- package/dist/domains/comet-classic/classic-transitions.d.ts.map +1 -1
- package/dist/domains/comet-classic/classic-transitions.js +20 -1
- package/dist/domains/comet-classic/classic-transitions.js.map +1 -1
- package/dist/domains/comet-classic/classic-validate-command.d.ts.map +1 -1
- package/dist/domains/comet-classic/classic-validate-command.js +1 -0
- package/dist/domains/comet-classic/classic-validate-command.js.map +1 -1
- package/dist/domains/comet-classic/index.d.ts +3 -0
- package/dist/domains/comet-classic/index.d.ts.map +1 -1
- package/dist/domains/comet-classic/index.js +3 -0
- package/dist/domains/comet-classic/index.js.map +1 -1
- package/dist/domains/dashboard/collector.js +10 -2
- package/dist/domains/dashboard/collector.js.map +1 -1
- package/dist/domains/dashboard/web/assets/{index-CjU3VXVu.js → index-CIvN-PL8.js} +11 -11
- package/dist/domains/dashboard/web/assets/{index-BcO3_QlT.css → index-DcyRPBnT.css} +1 -1
- package/dist/domains/dashboard/web/index.html +2 -2
- package/dist/domains/engine/types.d.ts +1 -1
- package/dist/domains/engine/types.d.ts.map +1 -1
- package/dist/domains/integrations/openspec.d.ts.map +1 -1
- package/dist/domains/integrations/openspec.js +6 -6
- package/dist/domains/integrations/openspec.js.map +1 -1
- package/dist/domains/skill/find.d.ts.map +1 -1
- package/dist/domains/skill/find.js +1 -6
- package/dist/domains/skill/find.js.map +1 -1
- package/dist/domains/skill/managed-markdown.d.ts +14 -0
- package/dist/domains/skill/managed-markdown.d.ts.map +1 -0
- package/dist/domains/skill/managed-markdown.js +126 -0
- package/dist/domains/skill/managed-markdown.js.map +1 -0
- package/dist/domains/skill/platform-install.d.ts +4 -3
- package/dist/domains/skill/platform-install.d.ts.map +1 -1
- package/dist/domains/skill/platform-install.js +96 -26
- package/dist/domains/skill/platform-install.js.map +1 -1
- package/dist/domains/skill/project-instructions.d.ts +22 -0
- package/dist/domains/skill/project-instructions.d.ts.map +1 -0
- package/dist/domains/skill/project-instructions.js +61 -0
- package/dist/domains/skill/project-instructions.js.map +1 -0
- package/dist/domains/skill/uninstall.d.ts +3 -1
- package/dist/domains/skill/uninstall.d.ts.map +1 -1
- package/dist/domains/skill/uninstall.js +86 -39
- package/dist/domains/skill/uninstall.js.map +1 -1
- package/dist/platform/install/detect.d.ts +2 -1
- package/dist/platform/install/detect.d.ts.map +1 -1
- package/dist/platform/install/detect.js +10 -1
- package/dist/platform/install/detect.js.map +1 -1
- package/dist/platform/install/platforms.d.ts +5 -1
- package/dist/platform/install/platforms.d.ts.map +1 -1
- package/dist/platform/install/platforms.js +21 -4
- package/dist/platform/install/platforms.js.map +1 -1
- package/dist/platform/install/project-registry.d.ts +37 -0
- package/dist/platform/install/project-registry.d.ts.map +1 -0
- package/dist/platform/install/project-registry.js +205 -0
- package/dist/platform/install/project-registry.js.map +1 -0
- package/eval/.env +28 -0
- package/eval/.env.example +52 -0
- package/eval/CLAUDE.md +43 -0
- package/eval/README.md +538 -0
- package/eval/langsmith/.env.example +16 -0
- package/eval/langsmith/README.md +93 -0
- package/eval/langsmith/skills/README.md +5 -0
- package/eval/langsmith/tasks/README.md +5 -0
- package/eval/langsmith/tests/conftest.py +187 -0
- package/eval/langsmith/tests/tasks/test_tasks.py +287 -0
- package/eval/langsmith/treatments/README.md +5 -0
- package/eval/local/README.md +80 -0
- package/eval/local/regression_baseline.json +13 -0
- package/eval/local/report-style-demo-assets/quality_cost.en.svg +41 -0
- package/eval/local/report-style-demo-assets/quality_cost.zh.svg +41 -0
- package/eval/local/report-style-demo-assets/rubric_delta.en.svg +56 -0
- package/eval/local/report-style-demo-assets/rubric_delta.zh.svg +56 -0
- package/eval/local/report-style-demo-assets/task_outcomes.en.svg +46 -0
- package/eval/local/report-style-demo-assets/task_outcomes.zh.svg +46 -0
- package/eval/local/report-style-demo.html +867 -0
- package/eval/local/scripts/compare_baselines.py +1018 -0
- package/eval/local/scripts/generate_report_style_demo_charts.py +322 -0
- package/eval/local/scripts/regression_check.py +171 -0
- package/eval/local/scripts/render_readme_benchmark_figures.py +416 -0
- package/eval/local/scripts/rescore_rubric.py +120 -0
- package/eval/local/skills/benchmarks/039-release/comet-classic-039/SKILL.md +282 -0
- package/eval/local/skills/benchmarks/039-release/comet-classic-039/reference/auto-transition.md +27 -0
- package/eval/local/skills/benchmarks/039-release/comet-classic-039/reference/comet-yaml-fields.md +68 -0
- package/eval/local/skills/benchmarks/039-release/comet-classic-039/reference/context-recovery.md +35 -0
- package/eval/local/skills/benchmarks/039-release/comet-classic-039/reference/debug-gate.md +17 -0
- package/eval/local/skills/benchmarks/039-release/comet-classic-039/reference/decision-point.md +20 -0
- package/eval/local/skills/benchmarks/039-release/comet-classic-039/reference/dirty-worktree.md +59 -0
- package/eval/local/skills/benchmarks/039-release/comet-classic-039/reference/file-structure.md +28 -0
- package/eval/local/skills/benchmarks/039-release/comet-classic-039/reference/subagent-dispatch.md +113 -0
- package/eval/local/skills/benchmarks/039-release/comet-classic-039/rules/comet-phase-guard.md +125 -0
- package/eval/local/skills/benchmarks/039-release/comet-classic-039/scripts/comet-archive.sh +311 -0
- package/eval/local/skills/benchmarks/039-release/comet-classic-039/scripts/comet-env.sh +110 -0
- package/eval/local/skills/benchmarks/039-release/comet-classic-039/scripts/comet-guard.sh +778 -0
- package/eval/local/skills/benchmarks/039-release/comet-classic-039/scripts/comet-handoff.sh +390 -0
- package/eval/local/skills/benchmarks/039-release/comet-classic-039/scripts/comet-hook-guard.sh +336 -0
- package/eval/local/skills/benchmarks/039-release/comet-classic-039/scripts/comet-state.sh +1338 -0
- package/eval/local/skills/benchmarks/039-release/comet-classic-039/scripts/comet-yaml-validate.sh +225 -0
- package/eval/local/skills/benchmarks/039-release/comet-classic-039-archive/SKILL.md +100 -0
- package/eval/local/skills/benchmarks/039-release/comet-classic-039-build/SKILL.md +304 -0
- package/eval/local/skills/benchmarks/039-release/comet-classic-039-design/SKILL.md +263 -0
- package/eval/local/skills/benchmarks/039-release/comet-classic-039-hotfix/SKILL.md +204 -0
- package/eval/local/skills/benchmarks/039-release/comet-classic-039-open/SKILL.md +220 -0
- package/eval/local/skills/benchmarks/039-release/comet-classic-039-tweak/SKILL.md +180 -0
- package/eval/local/skills/benchmarks/039-release/comet-classic-039-verify/SKILL.md +234 -0
- package/eval/local/skills/benchmarks/040-beta/comet/SKILL.md +261 -0
- package/eval/local/skills/benchmarks/040-beta/comet/reference/auto-transition.md +27 -0
- package/eval/local/skills/benchmarks/040-beta/comet/reference/comet-yaml-fields.md +73 -0
- package/eval/local/skills/benchmarks/040-beta/comet/reference/context-recovery.md +45 -0
- package/eval/local/skills/benchmarks/040-beta/comet/reference/debug-gate.md +33 -0
- package/eval/local/skills/benchmarks/040-beta/comet/reference/decision-point.md +31 -0
- package/eval/local/skills/benchmarks/040-beta/comet/reference/dirty-worktree.md +59 -0
- package/eval/local/skills/benchmarks/040-beta/comet/reference/file-structure.md +28 -0
- package/eval/local/skills/benchmarks/040-beta/comet/reference/intent-frame.md +74 -0
- package/eval/local/skills/benchmarks/040-beta/comet/reference/scripts.md +69 -0
- package/eval/local/skills/benchmarks/040-beta/comet/reference/subagent-dispatch.md +169 -0
- package/eval/local/skills/benchmarks/040-beta/comet/rules/comet-phase-guard.md +130 -0
- package/eval/local/skills/benchmarks/040-beta/comet/runtime/classic/checks.yaml +6 -0
- package/eval/local/skills/benchmarks/040-beta/comet/runtime/classic/guardrails.yaml +13 -0
- package/eval/local/skills/benchmarks/040-beta/comet/runtime/classic/skill.yaml +122 -0
- package/eval/local/skills/benchmarks/040-beta/comet/scripts/comet-archive.mjs +9515 -0
- package/eval/local/skills/benchmarks/040-beta/comet/scripts/comet-env.mjs +15 -0
- package/eval/local/skills/benchmarks/040-beta/comet/scripts/comet-guard.mjs +10173 -0
- package/eval/local/skills/benchmarks/040-beta/comet/scripts/comet-handoff.mjs +9491 -0
- package/eval/local/skills/benchmarks/040-beta/comet/scripts/comet-hook-guard.mjs +9175 -0
- package/eval/local/skills/benchmarks/040-beta/comet/scripts/comet-intent.mjs +404 -0
- package/eval/local/skills/benchmarks/040-beta/comet/scripts/comet-state.mjs +9273 -0
- package/eval/local/skills/benchmarks/040-beta/comet/scripts/comet-yaml-validate.mjs +7627 -0
- package/eval/local/skills/benchmarks/040-beta/comet-archive/SKILL.md +110 -0
- package/eval/local/skills/benchmarks/040-beta/comet-build/SKILL.md +315 -0
- package/eval/local/skills/benchmarks/040-beta/comet-design/SKILL.md +260 -0
- package/eval/local/skills/benchmarks/040-beta/comet-hotfix/SKILL.md +190 -0
- package/eval/local/skills/benchmarks/040-beta/comet-open/SKILL.md +210 -0
- package/eval/local/skills/benchmarks/040-beta/comet-tweak/SKILL.md +183 -0
- package/eval/local/skills/benchmarks/040-beta/comet-verify/SKILL.md +230 -0
- package/eval/local/skills/benchmarks/dependency/claude-md/comet-workflow/CLAUDE.md +12 -0
- package/eval/local/skills/benchmarks/dependency/openspec/openspec-apply-change/SKILL.md +156 -0
- package/eval/local/skills/benchmarks/dependency/openspec/openspec-archive-change/SKILL.md +114 -0
- package/eval/local/skills/benchmarks/dependency/openspec/openspec-bulk-archive-change/SKILL.md +246 -0
- package/eval/local/skills/benchmarks/dependency/openspec/openspec-continue-change/SKILL.md +118 -0
- package/eval/local/skills/benchmarks/dependency/openspec/openspec-explore/SKILL.md +288 -0
- package/eval/local/skills/benchmarks/dependency/openspec/openspec-ff-change/SKILL.md +101 -0
- package/eval/local/skills/benchmarks/dependency/openspec/openspec-new-change/SKILL.md +74 -0
- package/eval/local/skills/benchmarks/dependency/openspec/openspec-onboard/SKILL.md +554 -0
- package/eval/local/skills/benchmarks/dependency/openspec/openspec-propose/SKILL.md +110 -0
- package/eval/local/skills/benchmarks/dependency/openspec/openspec-sync-specs/SKILL.md +138 -0
- package/eval/local/skills/benchmarks/dependency/openspec/openspec-verify-change/SKILL.md +168 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/brainstorming/SKILL.md +159 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/brainstorming/scripts/frame-template.html +213 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/brainstorming/scripts/helper.js +167 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/brainstorming/scripts/server.cjs +723 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/brainstorming/scripts/start-server.sh +209 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/brainstorming/scripts/stop-server.sh +120 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/brainstorming/spec-document-reviewer-prompt.md +49 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/brainstorming/visual-companion.md +291 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/dispatching-parallel-agents/SKILL.md +185 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/executing-plans/SKILL.md +70 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/finishing-a-development-branch/SKILL.md +241 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/receiving-code-review/SKILL.md +213 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/requesting-code-review/SKILL.md +103 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/requesting-code-review/code-reviewer.md +172 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/subagent-driven-development/SKILL.md +418 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/subagent-driven-development/implementer-prompt.md +139 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/subagent-driven-development/scripts/review-package +44 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/subagent-driven-development/scripts/sdd-workspace +22 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/subagent-driven-development/scripts/task-brief +40 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/subagent-driven-development/task-reviewer-prompt.md +188 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/systematic-debugging/CREATION-LOG.md +119 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/systematic-debugging/SKILL.md +296 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/systematic-debugging/condition-based-waiting-example.ts +158 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/systematic-debugging/condition-based-waiting.md +115 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/systematic-debugging/defense-in-depth.md +122 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/systematic-debugging/find-polluter.sh +63 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/systematic-debugging/root-cause-tracing.md +169 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/systematic-debugging/test-academic.md +14 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/systematic-debugging/test-pressure-1.md +58 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/systematic-debugging/test-pressure-2.md +68 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/systematic-debugging/test-pressure-3.md +69 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/test-driven-development/SKILL.md +371 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/test-driven-development/testing-anti-patterns.md +299 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/using-git-worktrees/SKILL.md +202 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/verification-before-completion/SKILL.md +139 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/writing-plans/SKILL.md +174 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/writing-plans/plan-document-reviewer-prompt.md +49 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/writing-skills/SKILL.md +689 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/writing-skills/anthropic-best-practices.md +1150 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/writing-skills/examples/CLAUDE_MD_TESTING.md +189 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/writing-skills/graphviz-conventions.dot +172 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/writing-skills/persuasion-principles.md +187 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/writing-skills/render-graphs.js +168 -0
- package/eval/local/skills/benchmarks/dependency/superpowers/writing-skills/testing-skills-with-subagents.md +384 -0
- package/eval/local/tasks/authoring-skill-smoke/environment/Dockerfile +2 -0
- package/eval/local/tasks/authoring-skill-smoke/instruction.md +4 -0
- package/eval/local/tasks/authoring-skill-smoke/task.toml +21 -0
- package/eval/local/tasks/authoring-skill-smoke/validation/test_authoring_skill_smoke.py +54 -0
- package/eval/local/tasks/comet-agent-memory-routing/environment/Dockerfile +28 -0
- package/eval/local/tasks/comet-agent-memory-routing/environment/agent_system.py +40 -0
- package/eval/local/tasks/comet-agent-memory-routing/environment/test_agent_system.py +29 -0
- package/eval/local/tasks/comet-agent-memory-routing/instruction.md +20 -0
- package/eval/local/tasks/comet-agent-memory-routing/task.toml +24 -0
- package/eval/local/tasks/comet-agent-memory-routing/validation/test_agent_memory_routing.py +24 -0
- package/eval/local/tasks/comet-api-cache-ttl/environment/Dockerfile +39 -0
- package/eval/local/tasks/comet-api-cache-ttl/environment/cache.py +39 -0
- package/eval/local/tasks/comet-api-cache-ttl/environment/test_cache.py +81 -0
- package/eval/local/tasks/comet-api-cache-ttl/instruction.md +33 -0
- package/eval/local/tasks/comet-api-cache-ttl/task.toml +24 -0
- package/eval/local/tasks/comet-api-cache-ttl/validation/test_api_cache_ttl.py +58 -0
- package/eval/local/tasks/comet-cross-file-refactor/environment/Dockerfile +15 -0
- package/eval/local/tasks/comet-cross-file-refactor/environment/cli.py +13 -0
- package/eval/local/tasks/comet-cross-file-refactor/environment/counting.py +13 -0
- package/eval/local/tasks/comet-cross-file-refactor/environment/test_textkit.py +21 -0
- package/eval/local/tasks/comet-cross-file-refactor/instruction.md +16 -0
- package/eval/local/tasks/comet-cross-file-refactor/task.toml +20 -0
- package/eval/local/tasks/comet-cross-file-refactor/validation/test_cross_file_refactor.py +20 -0
- package/eval/local/tasks/comet-dependency-confusion/environment/Dockerfile +28 -0
- package/eval/local/tasks/comet-dependency-confusion/environment/app.py +8 -0
- package/eval/local/tasks/comet-dependency-confusion/environment/settings_loader.py +14 -0
- package/eval/local/tasks/comet-dependency-confusion/environment/test_settings_service.py +19 -0
- package/eval/local/tasks/comet-dependency-confusion/instruction.md +18 -0
- package/eval/local/tasks/comet-dependency-confusion/task.toml +24 -0
- package/eval/local/tasks/comet-dependency-confusion/validation/test_dependency_confusion.py +24 -0
- package/eval/local/tasks/comet-fix-median/environment/Dockerfile +50 -0
- package/eval/local/tasks/comet-fix-median/environment/stats.py +54 -0
- package/eval/local/tasks/comet-fix-median/environment/test_stats.py +68 -0
- package/eval/local/tasks/comet-fix-median/instruction.md +25 -0
- package/eval/local/tasks/comet-fix-median/task.toml +24 -0
- package/eval/local/tasks/comet-fix-median/validation/test_fix_median.py +60 -0
- package/eval/local/tasks/comet-framework-selection/environment/Dockerfile +28 -0
- package/eval/local/tasks/comet-framework-selection/environment/architecture.py +12 -0
- package/eval/local/tasks/comet-framework-selection/environment/test_architecture.py +30 -0
- package/eval/local/tasks/comet-framework-selection/instruction.md +22 -0
- package/eval/local/tasks/comet-framework-selection/task.toml +24 -0
- package/eval/local/tasks/comet-framework-selection/validation/test_framework_selection.py +24 -0
- package/eval/local/tasks/comet-full-workflow/environment/Dockerfile +53 -0
- package/eval/local/tasks/comet-full-workflow/environment/test_wordcount.py +29 -0
- package/eval/local/tasks/comet-full-workflow/environment/wordcount.py +40 -0
- package/eval/local/tasks/comet-full-workflow/instruction.md +18 -0
- package/eval/local/tasks/comet-full-workflow/task.toml +24 -0
- package/eval/local/tasks/comet-full-workflow/validation/test_full_workflow.py +171 -0
- package/eval/local/tasks/comet-graph-execution-review/environment/Dockerfile +28 -0
- package/eval/local/tasks/comet-graph-execution-review/environment/pipeline.py +19 -0
- package/eval/local/tasks/comet-graph-execution-review/environment/test_pipeline.py +53 -0
- package/eval/local/tasks/comet-graph-execution-review/instruction.md +21 -0
- package/eval/local/tasks/comet-graph-execution-review/task.toml +24 -0
- package/eval/local/tasks/comet-graph-execution-review/validation/test_graph_execution_review.py +24 -0
- package/eval/local/tasks/comet-human-approval-flow/environment/Dockerfile +15 -0
- package/eval/local/tasks/comet-human-approval-flow/environment/approvals.py +17 -0
- package/eval/local/tasks/comet-human-approval-flow/environment/test_approvals.py +30 -0
- package/eval/local/tasks/comet-human-approval-flow/instruction.md +15 -0
- package/eval/local/tasks/comet-human-approval-flow/task.toml +20 -0
- package/eval/local/tasks/comet-human-approval-flow/validation/test_human_approval_flow.py +20 -0
- package/eval/local/tasks/comet-layered-streaming-fix/environment/Dockerfile +20 -0
- package/eval/local/tasks/comet-layered-streaming-fix/environment/chat_app.py +19 -0
- package/eval/local/tasks/comet-layered-streaming-fix/environment/test_chat_app.py +15 -0
- package/eval/local/tasks/comet-layered-streaming-fix/instruction.md +14 -0
- package/eval/local/tasks/comet-layered-streaming-fix/task.toml +20 -0
- package/eval/local/tasks/comet-layered-streaming-fix/validation/test_layered_streaming_fix.py +20 -0
- package/eval/local/tasks/comet-noise-distractor/environment/Dockerfile +15 -0
- package/eval/local/tasks/comet-noise-distractor/environment/distractor.md +4 -0
- package/eval/local/tasks/comet-noise-distractor/environment/invoice.py +5 -0
- package/eval/local/tasks/comet-noise-distractor/environment/test_invoice.py +18 -0
- package/eval/local/tasks/comet-noise-distractor/instruction.md +17 -0
- package/eval/local/tasks/comet-noise-distractor/task.toml +20 -0
- package/eval/local/tasks/comet-noise-distractor/validation/test_noise_distractor.py +20 -0
- package/eval/local/tasks/comet-observability-env-template/environment/Dockerfile +15 -0
- package/eval/local/tasks/comet-observability-env-template/environment/env_writer.py +17 -0
- package/eval/local/tasks/comet-observability-env-template/environment/test_env_writer.py +17 -0
- package/eval/local/tasks/comet-observability-env-template/instruction.md +20 -0
- package/eval/local/tasks/comet-observability-env-template/task.toml +20 -0
- package/eval/local/tasks/comet-observability-env-template/validation/test_observability_env_template.py +46 -0
- package/eval/local/tasks/comet-perf-dedupe/environment/Dockerfile +39 -0
- package/eval/local/tasks/comet-perf-dedupe/environment/dedupe.py +22 -0
- package/eval/local/tasks/comet-perf-dedupe/environment/test_dedupe.py +43 -0
- package/eval/local/tasks/comet-perf-dedupe/instruction.md +25 -0
- package/eval/local/tasks/comet-perf-dedupe/task.toml +24 -0
- package/eval/local/tasks/comet-perf-dedupe/validation/test_perf_dedupe.py +40 -0
- package/eval/local/tasks/comet-persistence-threading/environment/Dockerfile +15 -0
- package/eval/local/tasks/comet-persistence-threading/environment/session_store.py +15 -0
- package/eval/local/tasks/comet-persistence-threading/environment/test_session_store.py +21 -0
- package/eval/local/tasks/comet-persistence-threading/instruction.md +14 -0
- package/eval/local/tasks/comet-persistence-threading/task.toml +20 -0
- package/eval/local/tasks/comet-persistence-threading/validation/test_persistence_threading.py +20 -0
- package/eval/local/tasks/comet-refactor-counter/environment/Dockerfile +39 -0
- package/eval/local/tasks/comet-refactor-counter/environment/test_text_processor.py +57 -0
- package/eval/local/tasks/comet-refactor-counter/environment/text_processor.py +49 -0
- package/eval/local/tasks/comet-refactor-counter/instruction.md +31 -0
- package/eval/local/tasks/comet-refactor-counter/task.toml +24 -0
- package/eval/local/tasks/comet-refactor-counter/validation/test_refactor_counter.py +75 -0
- package/eval/local/tasks/comet-robust-config/environment/Dockerfile +39 -0
- package/eval/local/tasks/comet-robust-config/environment/config_loader.py +56 -0
- package/eval/local/tasks/comet-robust-config/environment/test_config_loader.py +72 -0
- package/eval/local/tasks/comet-robust-config/instruction.md +30 -0
- package/eval/local/tasks/comet-robust-config/task.toml +24 -0
- package/eval/local/tasks/comet-robust-config/validation/test_robust_config.py +37 -0
- package/eval/local/tasks/generic-skill-smoke/environment/Dockerfile +2 -0
- package/eval/local/tasks/generic-skill-smoke/instruction.md +7 -0
- package/eval/local/tasks/generic-skill-smoke/task.toml +21 -0
- package/eval/local/tasks/generic-skill-smoke/validation/test_generic_skill_smoke.py +36 -0
- package/eval/local/tasks/index.yaml +155 -0
- package/eval/local/tasks/workflow-overlay-contract/environment/Dockerfile +5 -0
- package/eval/local/tasks/workflow-overlay-contract/instruction.md +5 -0
- package/eval/local/tasks/workflow-overlay-contract/task.toml +21 -0
- package/eval/local/tasks/workflow-overlay-contract/validation/test_workflow_overlay_contract.py +235 -0
- package/eval/local/tasks/workflow-route-conformance/environment/Dockerfile +2 -0
- package/eval/local/tasks/workflow-route-conformance/instruction.md +5 -0
- package/eval/local/tasks/workflow-route-conformance/task.toml +21 -0
- package/eval/local/tasks/workflow-route-conformance/validation/test_workflow_route_conformance.py +84 -0
- package/eval/local/tests/conftest.py +1148 -0
- package/eval/local/tests/scaffold/test_attribution.py +48 -0
- package/eval/local/tests/scaffold/test_compare_baselines.py +999 -0
- package/eval/local/tests/scaffold/test_conftest_helpers.py +534 -0
- package/eval/local/tests/scaffold/test_evidence.py +15 -0
- package/eval/local/tests/scaffold/test_langsmith_conftest.py +244 -0
- package/eval/local/tests/scaffold/test_logging.py +243 -0
- package/eval/local/tests/scaffold/test_manifests.py +132 -0
- package/eval/local/tests/scaffold/test_profiles.py +866 -0
- package/eval/local/tests/scaffold/test_regression_check.py +19 -0
- package/eval/local/tests/scaffold/test_report_style_demo_charts.py +45 -0
- package/eval/local/tests/scaffold/test_sample_quality.py +211 -0
- package/eval/local/tests/scaffold/test_tasks.py +168 -0
- package/eval/local/tests/scaffold/test_treatments.py +244 -0
- package/eval/local/tests/scaffold/test_utils.py +139 -0
- package/eval/local/tests/tasks/test_tasks.py +445 -0
- package/eval/local/tests/tasks/test_validation_scripts.py +143 -0
- package/eval/local/treatments/comet/comet_full_039.yaml +141 -0
- package/eval/local/treatments/comet/comet_full_040_beta.yaml +140 -0
- package/eval/local/treatments/common/control.yaml +4 -0
- package/eval/pyproject.toml +41 -0
- package/eval/report-html-config.json +6 -0
- package/eval/scaffold/__init__.py +67 -0
- package/eval/scaffold/python/__init__.py +95 -0
- package/eval/scaffold/python/attribution.py +43 -0
- package/eval/scaffold/python/evidence.py +38 -0
- package/eval/scaffold/python/external_data_handler.py +18 -0
- package/eval/scaffold/python/generic_llm_judge.py +235 -0
- package/eval/scaffold/python/judge_config.py +168 -0
- package/eval/scaffold/python/llm_judge.py +191 -0
- package/eval/scaffold/python/logging.py +705 -0
- package/eval/scaffold/python/manifests.py +129 -0
- package/eval/scaffold/python/paper_charts.py +25 -0
- package/eval/scaffold/python/pass_at_k.py +107 -0
- package/eval/scaffold/python/paths.py +56 -0
- package/eval/scaffold/python/profiles.py +127 -0
- package/eval/scaffold/python/report_outputs.py +1391 -0
- package/eval/scaffold/python/sample_quality.py +339 -0
- package/eval/scaffold/python/schema.py +39 -0
- package/eval/scaffold/python/skill_parser.py +469 -0
- package/eval/scaffold/python/tasks.py +330 -0
- package/eval/scaffold/python/treatments.py +271 -0
- package/eval/scaffold/python/utils.py +366 -0
- package/eval/scaffold/python/validation/__init__.py +21 -0
- package/eval/scaffold/python/validation/authoring_rubric.py +326 -0
- package/eval/scaffold/python/validation/comet_workflow.py +187 -0
- package/eval/scaffold/python/validation/core.py +264 -0
- package/eval/scaffold/python/validation/dataset.py +337 -0
- package/eval/scaffold/python/validation/docker.py +106 -0
- package/eval/scaffold/python/validation/evaluator.py +549 -0
- package/eval/scaffold/python/validation/generic_rubric.py +169 -0
- package/eval/scaffold/python/validation/rubric.py +740 -0
- package/eval/scaffold/python/validation/runner.py +237 -0
- package/eval/scaffold/python/validation/scripts.py +58 -0
- package/eval/scaffold/python/validation/tracing.py +313 -0
- package/eval/scaffold/shell/common.sh +126 -0
- package/eval/scaffold/shell/docker.sh +482 -0
- package/eval/scaffold/shell/run-claude-loop.sh +181 -0
- package/eval/scaffold/shell/setup.sh +259 -0
- package/eval/simulator-instruction.md +9 -0
- package/package.json +24 -2
|
@@ -0,0 +1,129 @@
|
|
|
1
|
+
"""Eval manifest parser for generated Skill packages."""
|
|
2
|
+
|
|
3
|
+
from __future__ import annotations
|
|
4
|
+
|
|
5
|
+
import re
|
|
6
|
+
from dataclasses import dataclass, field
|
|
7
|
+
from pathlib import Path
|
|
8
|
+
|
|
9
|
+
import yaml
|
|
10
|
+
|
|
11
|
+
from scaffold.python.tasks import InteractionConfig
|
|
12
|
+
|
|
13
|
+
|
|
14
|
+
SHA256_HEX_RE = re.compile(r"^[a-f0-9]{64}$")
|
|
15
|
+
|
|
16
|
+
|
|
17
|
+
@dataclass(frozen=True)
|
|
18
|
+
class SkillEvalManifest:
|
|
19
|
+
path: Path
|
|
20
|
+
name: str
|
|
21
|
+
description: str
|
|
22
|
+
skill_name: str
|
|
23
|
+
skill_path: Path
|
|
24
|
+
profile: str | None = None
|
|
25
|
+
draft_hash: str | None = None
|
|
26
|
+
recommended_tasks: list[str] = field(default_factory=list)
|
|
27
|
+
baseline_treatments: list[str] = field(default_factory=list)
|
|
28
|
+
quality_gates: dict = field(default_factory=dict)
|
|
29
|
+
required_output_schemas: list[str] = field(default_factory=list)
|
|
30
|
+
expected_evidence: list[dict] = field(default_factory=list)
|
|
31
|
+
required_skills: list[str] = field(default_factory=list)
|
|
32
|
+
expected_artifacts: list[str] = field(default_factory=list)
|
|
33
|
+
generated_node_skills: list[str] = field(default_factory=list)
|
|
34
|
+
route_conformance_task: str | None = None
|
|
35
|
+
route_conformance_expected_node_order: list[str] = field(default_factory=list)
|
|
36
|
+
interaction: InteractionConfig = field(default_factory=InteractionConfig)
|
|
37
|
+
|
|
38
|
+
|
|
39
|
+
def _require_mapping(data: dict, field_name: str) -> dict:
|
|
40
|
+
value = data.get(field_name)
|
|
41
|
+
if not isinstance(value, dict):
|
|
42
|
+
raise ValueError(f"Missing mapping field: {field_name}")
|
|
43
|
+
return value
|
|
44
|
+
|
|
45
|
+
|
|
46
|
+
def _optional_string_list(data: dict, camel_name: str, snake_name: str) -> list[str]:
|
|
47
|
+
value = data.get(camel_name, data.get(snake_name))
|
|
48
|
+
if value is None:
|
|
49
|
+
return []
|
|
50
|
+
if not isinstance(value, list) or not all(isinstance(item, str) for item in value):
|
|
51
|
+
raise ValueError(f"Expected evaluation.{camel_name} to be a list of strings")
|
|
52
|
+
return list(value)
|
|
53
|
+
|
|
54
|
+
|
|
55
|
+
def _optional_mapping(data: dict, camel_name: str, snake_name: str) -> dict:
|
|
56
|
+
value = data.get(camel_name, data.get(snake_name))
|
|
57
|
+
if value is None:
|
|
58
|
+
return {}
|
|
59
|
+
if not isinstance(value, dict):
|
|
60
|
+
raise ValueError(f"Expected evaluation.{camel_name} to be a mapping")
|
|
61
|
+
return dict(value)
|
|
62
|
+
|
|
63
|
+
|
|
64
|
+
def _optional_dict_list(data: dict, camel_name: str, snake_name: str) -> list[dict]:
|
|
65
|
+
value = data.get(camel_name, data.get(snake_name))
|
|
66
|
+
if value is None:
|
|
67
|
+
return []
|
|
68
|
+
if not isinstance(value, list) or not all(isinstance(item, dict) for item in value):
|
|
69
|
+
raise ValueError(f"Expected evaluation.{camel_name} to be a list of mappings")
|
|
70
|
+
return list(value)
|
|
71
|
+
|
|
72
|
+
|
|
73
|
+
def _optional_draft_hash(metadata: dict) -> str | None:
|
|
74
|
+
value = metadata.get("draftHash") or metadata.get("draft_hash")
|
|
75
|
+
if value is None:
|
|
76
|
+
return None
|
|
77
|
+
if not isinstance(value, str) or not SHA256_HEX_RE.match(value):
|
|
78
|
+
raise ValueError("Expected metadata.draftHash to be 64 lowercase hex characters")
|
|
79
|
+
return value
|
|
80
|
+
|
|
81
|
+
|
|
82
|
+
def load_eval_manifest(path: Path | str) -> SkillEvalManifest:
|
|
83
|
+
manifest_path = Path(path).expanduser().resolve()
|
|
84
|
+
data = yaml.safe_load(manifest_path.read_text(encoding="utf-8")) or {}
|
|
85
|
+
if data.get("apiVersion") != "comet.eval/v1alpha1":
|
|
86
|
+
raise ValueError("Expected apiVersion comet.eval/v1alpha1")
|
|
87
|
+
if data.get("kind") != "SkillEvalManifest":
|
|
88
|
+
raise ValueError("Expected kind SkillEvalManifest")
|
|
89
|
+
|
|
90
|
+
metadata = _require_mapping(data, "metadata")
|
|
91
|
+
skill = _require_mapping(data, "skill")
|
|
92
|
+
evaluation = data.get("evaluation") or {}
|
|
93
|
+
interaction_data = data.get("interaction") or {}
|
|
94
|
+
skill_source = skill.get("source", "..")
|
|
95
|
+
route_conformance = evaluation.get("routeConformance") or {}
|
|
96
|
+
|
|
97
|
+
return SkillEvalManifest(
|
|
98
|
+
path=manifest_path,
|
|
99
|
+
name=str(metadata.get("name") or skill.get("name")),
|
|
100
|
+
description=str(metadata.get("description") or ""),
|
|
101
|
+
skill_name=str(skill.get("name") or metadata.get("name")),
|
|
102
|
+
skill_path=(manifest_path.parent / skill_source).resolve(),
|
|
103
|
+
profile=skill.get("profile"),
|
|
104
|
+
draft_hash=_optional_draft_hash(metadata),
|
|
105
|
+
recommended_tasks=list(evaluation.get("recommendedTasks") or []),
|
|
106
|
+
baseline_treatments=_optional_string_list(
|
|
107
|
+
evaluation, "baselineTreatments", "baseline_treatments"
|
|
108
|
+
),
|
|
109
|
+
quality_gates=_optional_mapping(evaluation, "qualityGates", "quality_gates"),
|
|
110
|
+
required_output_schemas=_optional_string_list(
|
|
111
|
+
evaluation, "requiredOutputSchemas", "required_output_schemas"
|
|
112
|
+
),
|
|
113
|
+
expected_evidence=_optional_dict_list(
|
|
114
|
+
evaluation, "expectedEvidence", "expected_evidence"
|
|
115
|
+
),
|
|
116
|
+
required_skills=list(evaluation.get("requiredSkills") or []),
|
|
117
|
+
expected_artifacts=list(evaluation.get("expectedArtifacts") or []),
|
|
118
|
+
generated_node_skills=list(evaluation.get("generatedNodeSkills") or []),
|
|
119
|
+
route_conformance_task=route_conformance.get("task"),
|
|
120
|
+
route_conformance_expected_node_order=list(
|
|
121
|
+
route_conformance.get("expectedNodeOrder") or []
|
|
122
|
+
),
|
|
123
|
+
interaction=InteractionConfig(
|
|
124
|
+
mode=interaction_data.get("mode", "none"),
|
|
125
|
+
max_turns=int(interaction_data.get("maxTurns", interaction_data.get("max_turns", 12))),
|
|
126
|
+
simulator_prompt=interaction_data.get("simulatorPrompt")
|
|
127
|
+
or interaction_data.get("simulator_prompt"),
|
|
128
|
+
),
|
|
129
|
+
)
|
|
@@ -0,0 +1,25 @@
|
|
|
1
|
+
"""Python chart backend for paper-style eval report figures."""
|
|
2
|
+
|
|
3
|
+
from __future__ import annotations
|
|
4
|
+
|
|
5
|
+
import json
|
|
6
|
+
import sys
|
|
7
|
+
from typing import Any
|
|
8
|
+
|
|
9
|
+
from scaffold.python.report_outputs import _render_paper_figures_inline
|
|
10
|
+
|
|
11
|
+
|
|
12
|
+
def render_from_payload(payload: dict[str, Any]) -> str:
|
|
13
|
+
return _render_paper_figures_inline(payload, backend="python")
|
|
14
|
+
|
|
15
|
+
|
|
16
|
+
def main() -> int:
|
|
17
|
+
payload = json.loads(sys.stdin.read() or "{}")
|
|
18
|
+
if not isinstance(payload, dict):
|
|
19
|
+
raise ValueError("chart payload must be an object")
|
|
20
|
+
sys.stdout.write(render_from_payload(payload))
|
|
21
|
+
return 0
|
|
22
|
+
|
|
23
|
+
|
|
24
|
+
if __name__ == "__main__":
|
|
25
|
+
raise SystemExit(main())
|
|
@@ -0,0 +1,107 @@
|
|
|
1
|
+
"""pass@k / pass^k metrics for the comet eval.
|
|
2
|
+
|
|
3
|
+
These two metrics capture complementary aspects of skill quality:
|
|
4
|
+
|
|
5
|
+
- **pass@k** (HumanEval): the probability that at least one of k independent
|
|
6
|
+
attempts succeeds. Measures the *capability ceiling* — "can the agent do it
|
|
7
|
+
at all, given k tries?". Uses the unbiased estimator
|
|
8
|
+
``1 - C(n-c, k) / C(n, k)`` where n = total runs, c = successful runs.
|
|
9
|
+
|
|
10
|
+
- **pass^k** (Cons@k / reliability): the probability that *all* k attempts
|
|
11
|
+
succeed. Measures the *reliability floor* — "does the agent do it
|
|
12
|
+
consistently, every time?". Equals 1 iff c == n, else 0 (for the observed
|
|
13
|
+
sample).
|
|
14
|
+
|
|
15
|
+
The gap ``pass@k − pass^k`` quantifies instability: a skill with high pass@k
|
|
16
|
+
but low pass^k "can do it but can't be trusted to do it every time" — a
|
|
17
|
+
critical distinction for a workflow skill users run repeatedly.
|
|
18
|
+
|
|
19
|
+
"Pass" is defined at the task level: a run passes when its task-specific
|
|
20
|
+
validator reports zero failures (``checks_failed == []``), i.e. the feature was
|
|
21
|
+
actually implemented correctly.
|
|
22
|
+
"""
|
|
23
|
+
|
|
24
|
+
from __future__ import annotations
|
|
25
|
+
|
|
26
|
+
import math
|
|
27
|
+
from collections import defaultdict
|
|
28
|
+
from typing import Sequence
|
|
29
|
+
|
|
30
|
+
|
|
31
|
+
def _comb(n: int, k: int) -> int:
|
|
32
|
+
"""Integer binomial coefficient C(n, k), with C(n,k)=0 for k<0 or k>n."""
|
|
33
|
+
if k < 0 or k > n:
|
|
34
|
+
return 0
|
|
35
|
+
return math.comb(n, k)
|
|
36
|
+
|
|
37
|
+
|
|
38
|
+
def pass_at_k(n: int, c: int, k: int) -> float:
|
|
39
|
+
"""Unbiased pass@k estimator (HumanEval definition).
|
|
40
|
+
|
|
41
|
+
Parameters
|
|
42
|
+
----------
|
|
43
|
+
n : total number of runs sampled.
|
|
44
|
+
c : number of successful runs (0 <= c <= n).
|
|
45
|
+
k : the "k" in pass@k — number of attempts given.
|
|
46
|
+
|
|
47
|
+
Returns the probability that at least one of k attempts (drawn without
|
|
48
|
+
replacement from the n observed runs) is a success. When ``n - c < k`` it
|
|
49
|
+
is impossible to draw k all-failures, so pass@k = 1.0.
|
|
50
|
+
"""
|
|
51
|
+
if n - c < k:
|
|
52
|
+
return 1.0
|
|
53
|
+
# 1 - C(n-c, k) / C(n, k)
|
|
54
|
+
return 1.0 - _comb(n - c, k) / _comb(n, k)
|
|
55
|
+
|
|
56
|
+
|
|
57
|
+
def pass_pow_k(n: int, c: int, k: int) -> float:
|
|
58
|
+
"""pass^k (reliability): 1.0 iff all n runs passed (so any k-subset is
|
|
59
|
+
all-pass), else 0.0.
|
|
60
|
+
|
|
61
|
+
For the observed sample this is a lower bound on the true "all k succeed"
|
|
62
|
+
probability. With n >= k runs all passing, pass^k = 1.0.
|
|
63
|
+
"""
|
|
64
|
+
if c >= n and n >= 1:
|
|
65
|
+
return 1.0
|
|
66
|
+
return 0.0
|
|
67
|
+
|
|
68
|
+
|
|
69
|
+
def compute_pass_metrics(results: Sequence[bool], k: int = 1) -> dict[str, float | int]:
|
|
70
|
+
"""Compute pass@k and pass^k for a sequence of per-run pass/fail booleans.
|
|
71
|
+
|
|
72
|
+
Parameters
|
|
73
|
+
----------
|
|
74
|
+
results : list of bool, one per run (True = passed).
|
|
75
|
+
k : the k for pass@k / pass^k (default 1, i.e. single-attempt pass rate).
|
|
76
|
+
|
|
77
|
+
Returns ``{"pass_at_k": float, "pass_pow_k": float, "n": int, "c": int}``.
|
|
78
|
+
"""
|
|
79
|
+
n = len(results)
|
|
80
|
+
c = sum(1 for r in results if r)
|
|
81
|
+
if n == 0:
|
|
82
|
+
return {"pass_at_k": 0.0, "pass_pow_k": 0.0, "n": 0, "c": 0}
|
|
83
|
+
# pass@k is meaningful for k <= n; clamp k to n.
|
|
84
|
+
k_eff = min(k, n)
|
|
85
|
+
return {
|
|
86
|
+
"pass_at_k": pass_at_k(n, c, k_eff),
|
|
87
|
+
"pass_pow_k": pass_pow_k(n, c, k_eff),
|
|
88
|
+
"n": n,
|
|
89
|
+
"c": c,
|
|
90
|
+
"k": k_eff,
|
|
91
|
+
}
|
|
92
|
+
|
|
93
|
+
|
|
94
|
+
def pass_metrics_table(
|
|
95
|
+
runs_by_treatment: dict[str, Sequence[bool]],
|
|
96
|
+
ks: Sequence[int] = (1, 2, 5),
|
|
97
|
+
) -> dict[str, dict[int, dict[str, float]]]:
|
|
98
|
+
"""Compute pass@k / pass^k for multiple treatments and k values.
|
|
99
|
+
|
|
100
|
+
Returns ``{treatment: {k: {"pass_at_k", "pass_pow_k", "n", "c"}}}``.
|
|
101
|
+
"""
|
|
102
|
+
out: dict[str, dict[int, dict[str, float]]] = {}
|
|
103
|
+
for treatment, results in runs_by_treatment.items():
|
|
104
|
+
out[treatment] = {}
|
|
105
|
+
for k in ks:
|
|
106
|
+
out[treatment][k] = compute_pass_metrics(results, k)
|
|
107
|
+
return out
|
|
@@ -0,0 +1,56 @@
|
|
|
1
|
+
"""Path helpers for eval suites."""
|
|
2
|
+
|
|
3
|
+
import os
|
|
4
|
+
from pathlib import Path
|
|
5
|
+
|
|
6
|
+
|
|
7
|
+
EVAL_ROOT = Path(__file__).resolve().parents[2]
|
|
8
|
+
SUITE_NAMES = {"local", "langsmith"}
|
|
9
|
+
|
|
10
|
+
|
|
11
|
+
def get_suite_root() -> Path:
|
|
12
|
+
"""Return the active eval suite root.
|
|
13
|
+
|
|
14
|
+
Resolution order:
|
|
15
|
+
1. BENCH_SUITE_ROOT, for explicit automation
|
|
16
|
+
2. Current working directory when it looks like a suite root
|
|
17
|
+
3. Any parent of the current working directory named local/langsmith
|
|
18
|
+
4. eval/local as the default local suite
|
|
19
|
+
"""
|
|
20
|
+
configured = os.environ.get("BENCH_SUITE_ROOT")
|
|
21
|
+
if configured:
|
|
22
|
+
return Path(configured).resolve()
|
|
23
|
+
|
|
24
|
+
cwd = Path.cwd().resolve()
|
|
25
|
+
if (cwd / "tasks").exists() and (cwd / "treatments").exists():
|
|
26
|
+
return cwd
|
|
27
|
+
|
|
28
|
+
for parent in (cwd, *cwd.parents):
|
|
29
|
+
if parent.name in SUITE_NAMES:
|
|
30
|
+
return parent
|
|
31
|
+
|
|
32
|
+
return EVAL_ROOT / "local"
|
|
33
|
+
|
|
34
|
+
|
|
35
|
+
def get_suite_name() -> str:
|
|
36
|
+
return get_suite_root().name
|
|
37
|
+
|
|
38
|
+
|
|
39
|
+
def get_tasks_dir() -> Path:
|
|
40
|
+
configured = os.environ.get("BENCH_TASKS_DIR")
|
|
41
|
+
return Path(configured).resolve() if configured else get_suite_root() / "tasks"
|
|
42
|
+
|
|
43
|
+
|
|
44
|
+
def get_treatments_dir() -> Path:
|
|
45
|
+
configured = os.environ.get("BENCH_TREATMENTS_DIR")
|
|
46
|
+
return Path(configured).resolve() if configured else get_suite_root() / "treatments"
|
|
47
|
+
|
|
48
|
+
|
|
49
|
+
def get_skills_dir() -> Path:
|
|
50
|
+
configured = os.environ.get("BENCH_SKILLS_DIR")
|
|
51
|
+
return Path(configured).resolve() if configured else get_suite_root() / "skills"
|
|
52
|
+
|
|
53
|
+
|
|
54
|
+
def get_logs_dir() -> Path:
|
|
55
|
+
configured = os.environ.get("BENCH_LOGS_DIR")
|
|
56
|
+
return Path(configured).resolve() if configured else get_suite_root() / "logs"
|
|
@@ -0,0 +1,127 @@
|
|
|
1
|
+
"""Evaluation profile registry for local and LangSmith suites."""
|
|
2
|
+
|
|
3
|
+
from __future__ import annotations
|
|
4
|
+
|
|
5
|
+
from dataclasses import dataclass
|
|
6
|
+
from pathlib import Path
|
|
7
|
+
from typing import Any
|
|
8
|
+
|
|
9
|
+
from scaffold.python.tasks import InteractionConfig, Task
|
|
10
|
+
from scaffold.python.validation.core import ValidatorFn
|
|
11
|
+
from scaffold.python.validation.generic_rubric import (
|
|
12
|
+
GENERIC_RUBRIC_DIMENSIONS,
|
|
13
|
+
generic_rubric_validator,
|
|
14
|
+
)
|
|
15
|
+
from scaffold.python.validation.authoring_rubric import (
|
|
16
|
+
AUTHORING_RUBRIC_DIMENSIONS,
|
|
17
|
+
authoring_skill_rubric_validator,
|
|
18
|
+
)
|
|
19
|
+
|
|
20
|
+
GENERIC_PROFILE = "generic"
|
|
21
|
+
COMET_WORKFLOW_PROFILE = "comet-workflow"
|
|
22
|
+
AUTHORING_SKILL_PROFILE = "authoring-skill"
|
|
23
|
+
|
|
24
|
+
COMET_SIMULATOR_PROMPT = (
|
|
25
|
+
"You are simulating a developer user in an automated eval. The AI assistant "
|
|
26
|
+
"below is running the Comet development workflow and has paused to ask you "
|
|
27
|
+
"something. Read its message and reply with a SHORT (1-3 sentences) response "
|
|
28
|
+
"that approves reasonable plans, picks sensible defaults, and only asks for "
|
|
29
|
+
"clarification when the requested outcome is unclear."
|
|
30
|
+
)
|
|
31
|
+
|
|
32
|
+
GENERIC_SIMULATOR_PROMPT = (
|
|
33
|
+
"You are simulating a concise developer user in an automated eval. Answer "
|
|
34
|
+
"the assistant's question in 1-3 sentences, choose reasonable defaults, and "
|
|
35
|
+
"keep the task moving."
|
|
36
|
+
)
|
|
37
|
+
|
|
38
|
+
|
|
39
|
+
@dataclass(frozen=True)
|
|
40
|
+
class ProfileSpec:
|
|
41
|
+
name: str
|
|
42
|
+
rubric_dimensions: tuple[str, ...]
|
|
43
|
+
default_interaction: InteractionConfig
|
|
44
|
+
rubric: ValidatorFn
|
|
45
|
+
|
|
46
|
+
|
|
47
|
+
def _build_profiles() -> dict[str, ProfileSpec]:
|
|
48
|
+
from scaffold.python.validation.rubric import RUBRIC_DIMENSIONS, comet_rubric_validator
|
|
49
|
+
|
|
50
|
+
return {
|
|
51
|
+
GENERIC_PROFILE: ProfileSpec(
|
|
52
|
+
name=GENERIC_PROFILE,
|
|
53
|
+
rubric_dimensions=GENERIC_RUBRIC_DIMENSIONS,
|
|
54
|
+
default_interaction=InteractionConfig(
|
|
55
|
+
mode="none",
|
|
56
|
+
max_turns=12,
|
|
57
|
+
simulator_prompt=GENERIC_SIMULATOR_PROMPT,
|
|
58
|
+
),
|
|
59
|
+
rubric=generic_rubric_validator,
|
|
60
|
+
),
|
|
61
|
+
COMET_WORKFLOW_PROFILE: ProfileSpec(
|
|
62
|
+
name=COMET_WORKFLOW_PROFILE,
|
|
63
|
+
rubric_dimensions=tuple(RUBRIC_DIMENSIONS),
|
|
64
|
+
default_interaction=InteractionConfig(
|
|
65
|
+
mode="auto_user",
|
|
66
|
+
max_turns=12,
|
|
67
|
+
simulator_prompt=COMET_SIMULATOR_PROMPT,
|
|
68
|
+
),
|
|
69
|
+
rubric=comet_rubric_validator,
|
|
70
|
+
),
|
|
71
|
+
AUTHORING_SKILL_PROFILE: ProfileSpec(
|
|
72
|
+
name=AUTHORING_SKILL_PROFILE,
|
|
73
|
+
rubric_dimensions=AUTHORING_RUBRIC_DIMENSIONS,
|
|
74
|
+
default_interaction=InteractionConfig(
|
|
75
|
+
mode="auto_user",
|
|
76
|
+
max_turns=8,
|
|
77
|
+
simulator_prompt=GENERIC_SIMULATOR_PROMPT,
|
|
78
|
+
),
|
|
79
|
+
rubric=authoring_skill_rubric_validator,
|
|
80
|
+
),
|
|
81
|
+
}
|
|
82
|
+
|
|
83
|
+
|
|
84
|
+
def list_profiles() -> list[str]:
|
|
85
|
+
return sorted(_build_profiles())
|
|
86
|
+
|
|
87
|
+
|
|
88
|
+
def get_profile(name: str) -> ProfileSpec:
|
|
89
|
+
profiles = _build_profiles()
|
|
90
|
+
if name not in profiles:
|
|
91
|
+
raise KeyError(f"Profile not found: {name}. Available: {list_profiles()}")
|
|
92
|
+
return profiles[name]
|
|
93
|
+
|
|
94
|
+
|
|
95
|
+
def resolve_profile_name(
|
|
96
|
+
task: Task,
|
|
97
|
+
override: str | None = None,
|
|
98
|
+
target_profile: str | None = None,
|
|
99
|
+
) -> str:
|
|
100
|
+
if override:
|
|
101
|
+
get_profile(override)
|
|
102
|
+
return override
|
|
103
|
+
if target_profile:
|
|
104
|
+
get_profile(target_profile)
|
|
105
|
+
return target_profile
|
|
106
|
+
if task.config.evaluation.profile:
|
|
107
|
+
get_profile(task.config.evaluation.profile)
|
|
108
|
+
return task.config.evaluation.profile
|
|
109
|
+
return GENERIC_PROFILE
|
|
110
|
+
|
|
111
|
+
|
|
112
|
+
def run_profile_rubric(
|
|
113
|
+
profile_name: str,
|
|
114
|
+
test_dir: Path,
|
|
115
|
+
outputs: dict[str, Any],
|
|
116
|
+
) -> tuple[list[str], list[str]]:
|
|
117
|
+
profile = get_profile(profile_name)
|
|
118
|
+
return profile.rubric(test_dir, outputs)
|
|
119
|
+
|
|
120
|
+
|
|
121
|
+
def all_rubric_dimensions() -> tuple[str, ...]:
|
|
122
|
+
seen: list[str] = []
|
|
123
|
+
for profile in _build_profiles().values():
|
|
124
|
+
for dim in profile.rubric_dimensions:
|
|
125
|
+
if dim not in seen:
|
|
126
|
+
seen.append(dim)
|
|
127
|
+
return tuple(seen)
|