@claude-flow/cli 3.32.9 → 3.32.10

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (444) hide show
  1. package/.claude/agents/analysis/analyze-code-quality.md +178 -178
  2. package/.claude/agents/analysis/code-analyzer.md +209 -209
  3. package/.claude/agents/analysis/code-review/analyze-code-quality.md +178 -178
  4. package/.claude/agents/architecture/arch-system-design.md +156 -156
  5. package/.claude/agents/architecture/system-design/arch-system-design.md +154 -154
  6. package/.claude/agents/browser/browser-agent.yaml +182 -182
  7. package/.claude/agents/consensus/byzantine-coordinator.md +62 -62
  8. package/.claude/agents/consensus/crdt-synchronizer.md +996 -996
  9. package/.claude/agents/consensus/gossip-coordinator.md +62 -62
  10. package/.claude/agents/consensus/performance-benchmarker.md +850 -850
  11. package/.claude/agents/consensus/quorum-manager.md +822 -822
  12. package/.claude/agents/consensus/raft-manager.md +62 -62
  13. package/.claude/agents/consensus/security-manager.md +621 -621
  14. package/.claude/agents/core/planner.md +374 -374
  15. package/.claude/agents/custom/test-long-runner.md +44 -44
  16. package/.claude/agents/data/data-ml-model.md +444 -444
  17. package/.claude/agents/data/ml/data-ml-model.md +192 -192
  18. package/.claude/agents/development/backend/dev-backend-api.md +141 -141
  19. package/.claude/agents/development/dev-backend-api.md +344 -344
  20. package/.claude/agents/devops/ci-cd/ops-cicd-github.md +163 -163
  21. package/.claude/agents/devops/ops-cicd-github.md +164 -164
  22. package/.claude/agents/documentation/api-docs/docs-api-openapi.md +173 -173
  23. package/.claude/agents/documentation/docs-api-openapi.md +354 -354
  24. package/.claude/agents/flow-nexus/app-store.md +87 -87
  25. package/.claude/agents/flow-nexus/authentication.md +68 -68
  26. package/.claude/agents/flow-nexus/challenges.md +80 -80
  27. package/.claude/agents/flow-nexus/neural-network.md +87 -87
  28. package/.claude/agents/flow-nexus/payments.md +82 -82
  29. package/.claude/agents/flow-nexus/sandbox.md +75 -75
  30. package/.claude/agents/flow-nexus/swarm.md +75 -75
  31. package/.claude/agents/flow-nexus/user-tools.md +95 -95
  32. package/.claude/agents/flow-nexus/workflow.md +83 -83
  33. package/.claude/agents/github/code-review-swarm.md +377 -377
  34. package/.claude/agents/github/github-modes.md +172 -172
  35. package/.claude/agents/github/issue-tracker.md +575 -575
  36. package/.claude/agents/github/multi-repo-swarm.md +552 -552
  37. package/.claude/agents/github/pr-manager.md +437 -437
  38. package/.claude/agents/github/project-board-sync.md +508 -508
  39. package/.claude/agents/github/release-manager.md +604 -604
  40. package/.claude/agents/github/release-swarm.md +582 -582
  41. package/.claude/agents/github/repo-architect.md +397 -397
  42. package/.claude/agents/github/swarm-issue.md +572 -572
  43. package/.claude/agents/github/swarm-pr.md +427 -427
  44. package/.claude/agents/github/sync-coordinator.md +451 -451
  45. package/.claude/agents/github/workflow-automation.md +902 -902
  46. package/.claude/agents/goal/agent.md +815 -815
  47. package/.claude/agents/optimization/benchmark-suite.md +664 -664
  48. package/.claude/agents/optimization/load-balancer.md +430 -430
  49. package/.claude/agents/optimization/performance-monitor.md +671 -671
  50. package/.claude/agents/optimization/resource-allocator.md +673 -673
  51. package/.claude/agents/optimization/topology-optimizer.md +807 -807
  52. package/.claude/agents/payments/agentic-payments.md +126 -126
  53. package/.claude/agents/sona/sona-learning-optimizer.md +74 -74
  54. package/.claude/agents/sparc/architecture.md +698 -698
  55. package/.claude/agents/sparc/pseudocode.md +519 -519
  56. package/.claude/agents/sparc/refinement.md +801 -801
  57. package/.claude/agents/sparc/specification.md +477 -477
  58. package/.claude/agents/specialized/mobile/spec-mobile-react-native.md +224 -224
  59. package/.claude/agents/specialized/spec-mobile-react-native.md +226 -226
  60. package/.claude/agents/sublinear/consensus-coordinator.md +337 -337
  61. package/.claude/agents/sublinear/matrix-optimizer.md +184 -184
  62. package/.claude/agents/sublinear/pagerank-analyzer.md +298 -298
  63. package/.claude/agents/sublinear/performance-optimizer.md +367 -367
  64. package/.claude/agents/sublinear/trading-predictor.md +245 -245
  65. package/.claude/agents/swarm/adaptive-coordinator.md +1126 -1126
  66. package/.claude/agents/swarm/hierarchical-coordinator.md +709 -709
  67. package/.claude/agents/swarm/mesh-coordinator.md +962 -962
  68. package/.claude/agents/templates/automation-smart-agent.md +204 -204
  69. package/.claude/agents/templates/base-template-generator.md +289 -289
  70. package/.claude/agents/templates/coordinator-swarm-init.md +89 -89
  71. package/.claude/agents/templates/github-pr-manager.md +176 -176
  72. package/.claude/agents/templates/implementer-sparc-coder.md +258 -258
  73. package/.claude/agents/templates/memory-coordinator.md +186 -186
  74. package/.claude/agents/templates/orchestrator-task.md +138 -138
  75. package/.claude/agents/templates/performance-analyzer.md +198 -198
  76. package/.claude/agents/templates/sparc-coordinator.md +513 -513
  77. package/.claude/agents/testing/production-validator.md +394 -394
  78. package/.claude/agents/testing/tdd-london-swarm.md +243 -243
  79. package/.claude/agents/v3/aidefence-guardian.md +282 -282
  80. package/.claude/agents/v3/claims-authorizer.md +208 -208
  81. package/.claude/agents/v3/collective-intelligence-coordinator.md +993 -993
  82. package/.claude/agents/v3/ddd-domain-expert.md +220 -220
  83. package/.claude/agents/v3/injection-analyst.md +236 -236
  84. package/.claude/agents/v3/performance-engineer.md +1233 -1233
  85. package/.claude/agents/v3/pii-detector.md +151 -151
  86. package/.claude/agents/v3/reasoningbank-learner.md +213 -213
  87. package/.claude/agents/v3/security-architect-aidefence.md +410 -410
  88. package/.claude/agents/v3/security-architect.md +867 -867
  89. package/.claude/agents/v3/swarm-memory-manager.md +157 -157
  90. package/.claude/agents/v3/v3-integration-architect.md +205 -205
  91. package/.claude/commands/agents/README.md +50 -50
  92. package/.claude/commands/agents/agent-capabilities.md +140 -140
  93. package/.claude/commands/agents/agent-coordination.md +28 -28
  94. package/.claude/commands/agents/agent-spawning.md +28 -28
  95. package/.claude/commands/agents/agent-types.md +216 -216
  96. package/.claude/commands/agents/health.md +139 -139
  97. package/.claude/commands/agents/list.md +100 -100
  98. package/.claude/commands/agents/logs.md +130 -130
  99. package/.claude/commands/agents/metrics.md +122 -122
  100. package/.claude/commands/agents/pool.md +127 -127
  101. package/.claude/commands/agents/spawn.md +140 -140
  102. package/.claude/commands/agents/status.md +115 -115
  103. package/.claude/commands/agents/stop.md +102 -102
  104. package/.claude/commands/analysis/COMMAND_COMPLIANCE_REPORT.md +53 -53
  105. package/.claude/commands/analysis/README.md +9 -9
  106. package/.claude/commands/analysis/bottleneck-detect.md +162 -162
  107. package/.claude/commands/analysis/performance-bottlenecks.md +58 -58
  108. package/.claude/commands/analysis/performance-report.md +25 -25
  109. package/.claude/commands/analysis/token-efficiency.md +44 -44
  110. package/.claude/commands/analysis/token-usage.md +25 -25
  111. package/.claude/commands/automation/README.md +9 -9
  112. package/.claude/commands/automation/auto-agent.md +122 -122
  113. package/.claude/commands/automation/self-healing.md +105 -105
  114. package/.claude/commands/automation/session-memory.md +89 -89
  115. package/.claude/commands/automation/smart-agents.md +72 -72
  116. package/.claude/commands/automation/smart-spawn.md +25 -25
  117. package/.claude/commands/automation/workflow-select.md +25 -25
  118. package/.claude/commands/claude-flow-help.md +103 -103
  119. package/.claude/commands/claude-flow-memory.md +107 -107
  120. package/.claude/commands/claude-flow-swarm.md +205 -205
  121. package/.claude/commands/coordination/README.md +9 -9
  122. package/.claude/commands/coordination/agent-spawn.md +25 -25
  123. package/.claude/commands/coordination/init.md +44 -44
  124. package/.claude/commands/coordination/orchestrate.md +43 -43
  125. package/.claude/commands/coordination/spawn.md +45 -45
  126. package/.claude/commands/coordination/swarm-init.md +85 -85
  127. package/.claude/commands/coordination/task-orchestrate.md +25 -25
  128. package/.claude/commands/github/README.md +11 -11
  129. package/.claude/commands/github/code-review-swarm.md +513 -513
  130. package/.claude/commands/github/code-review.md +25 -25
  131. package/.claude/commands/github/github-modes.md +146 -146
  132. package/.claude/commands/github/github-swarm.md +121 -121
  133. package/.claude/commands/github/issue-tracker.md +291 -291
  134. package/.claude/commands/github/issue-triage.md +25 -25
  135. package/.claude/commands/github/multi-repo-swarm.md +518 -518
  136. package/.claude/commands/github/pr-enhance.md +26 -26
  137. package/.claude/commands/github/pr-manager.md +169 -169
  138. package/.claude/commands/github/project-board-sync.md +470 -470
  139. package/.claude/commands/github/release-manager.md +339 -339
  140. package/.claude/commands/github/release-swarm.md +543 -543
  141. package/.claude/commands/github/repo-analyze.md +25 -25
  142. package/.claude/commands/github/repo-architect.md +366 -366
  143. package/.claude/commands/github/swarm-issue.md +484 -484
  144. package/.claude/commands/github/swarm-pr.md +287 -287
  145. package/.claude/commands/github/sync-coordinator.md +302 -302
  146. package/.claude/commands/github/workflow-automation.md +441 -441
  147. package/.claude/commands/hive-mind/README.md +17 -17
  148. package/.claude/commands/hive-mind/hive-mind-consensus.md +8 -8
  149. package/.claude/commands/hive-mind/hive-mind-init.md +18 -18
  150. package/.claude/commands/hive-mind/hive-mind-memory.md +8 -8
  151. package/.claude/commands/hive-mind/hive-mind-metrics.md +8 -8
  152. package/.claude/commands/hive-mind/hive-mind-resume.md +8 -8
  153. package/.claude/commands/hive-mind/hive-mind-sessions.md +8 -8
  154. package/.claude/commands/hive-mind/hive-mind-spawn.md +21 -21
  155. package/.claude/commands/hive-mind/hive-mind-status.md +8 -8
  156. package/.claude/commands/hive-mind/hive-mind-stop.md +8 -8
  157. package/.claude/commands/hive-mind/hive-mind-wizard.md +8 -8
  158. package/.claude/commands/hive-mind/hive-mind.md +27 -27
  159. package/.claude/commands/hooks/README.md +11 -11
  160. package/.claude/commands/hooks/overview.md +57 -57
  161. package/.claude/commands/hooks/post-edit.md +117 -117
  162. package/.claude/commands/hooks/post-task.md +112 -112
  163. package/.claude/commands/hooks/pre-edit.md +113 -113
  164. package/.claude/commands/hooks/pre-task.md +111 -111
  165. package/.claude/commands/hooks/session-end.md +118 -118
  166. package/.claude/commands/hooks/setup.md +102 -102
  167. package/.claude/commands/memory/README.md +9 -9
  168. package/.claude/commands/memory/memory-persist.md +25 -25
  169. package/.claude/commands/memory/memory-search.md +25 -25
  170. package/.claude/commands/memory/memory-usage.md +25 -25
  171. package/.claude/commands/memory/neural.md +47 -47
  172. package/.claude/commands/monitoring/README.md +9 -9
  173. package/.claude/commands/monitoring/agent-metrics.md +25 -25
  174. package/.claude/commands/monitoring/agents.md +44 -44
  175. package/.claude/commands/monitoring/real-time-view.md +25 -25
  176. package/.claude/commands/monitoring/status.md +46 -46
  177. package/.claude/commands/monitoring/swarm-monitor.md +25 -25
  178. package/.claude/commands/optimization/README.md +9 -9
  179. package/.claude/commands/optimization/auto-topology.md +61 -61
  180. package/.claude/commands/optimization/cache-manage.md +25 -25
  181. package/.claude/commands/optimization/parallel-execute.md +25 -25
  182. package/.claude/commands/optimization/parallel-execution.md +49 -49
  183. package/.claude/commands/optimization/topology-optimize.md +25 -25
  184. package/.claude/commands/pair/README.md +260 -260
  185. package/.claude/commands/pair/commands.md +545 -545
  186. package/.claude/commands/pair/config.md +509 -509
  187. package/.claude/commands/pair/examples.md +511 -511
  188. package/.claude/commands/pair/modes.md +347 -347
  189. package/.claude/commands/pair/session.md +406 -406
  190. package/.claude/commands/pair/start.md +208 -208
  191. package/.claude/commands/sparc/analyzer.md +51 -51
  192. package/.claude/commands/sparc/architect.md +53 -53
  193. package/.claude/commands/sparc/ask.md +97 -97
  194. package/.claude/commands/sparc/batch-executor.md +54 -54
  195. package/.claude/commands/sparc/code.md +89 -89
  196. package/.claude/commands/sparc/coder.md +54 -54
  197. package/.claude/commands/sparc/debug.md +83 -83
  198. package/.claude/commands/sparc/debugger.md +54 -54
  199. package/.claude/commands/sparc/designer.md +53 -53
  200. package/.claude/commands/sparc/devops.md +109 -109
  201. package/.claude/commands/sparc/docs-writer.md +80 -80
  202. package/.claude/commands/sparc/documenter.md +54 -54
  203. package/.claude/commands/sparc/innovator.md +54 -54
  204. package/.claude/commands/sparc/integration.md +83 -83
  205. package/.claude/commands/sparc/mcp.md +117 -117
  206. package/.claude/commands/sparc/memory-manager.md +54 -54
  207. package/.claude/commands/sparc/optimizer.md +54 -54
  208. package/.claude/commands/sparc/orchestrator.md +131 -131
  209. package/.claude/commands/sparc/post-deployment-monitoring-mode.md +83 -83
  210. package/.claude/commands/sparc/refinement-optimization-mode.md +83 -83
  211. package/.claude/commands/sparc/researcher.md +54 -54
  212. package/.claude/commands/sparc/reviewer.md +54 -54
  213. package/.claude/commands/sparc/security-review.md +80 -80
  214. package/.claude/commands/sparc/sparc-modes.md +174 -174
  215. package/.claude/commands/sparc/sparc.md +111 -111
  216. package/.claude/commands/sparc/spec-pseudocode.md +80 -80
  217. package/.claude/commands/sparc/supabase-admin.md +348 -348
  218. package/.claude/commands/sparc/swarm-coordinator.md +54 -54
  219. package/.claude/commands/sparc/tdd.md +54 -54
  220. package/.claude/commands/sparc/tester.md +54 -54
  221. package/.claude/commands/sparc/tutorial.md +79 -79
  222. package/.claude/commands/sparc/workflow-manager.md +54 -54
  223. package/.claude/commands/sparc.md +166 -166
  224. package/.claude/commands/stream-chain/pipeline.md +120 -120
  225. package/.claude/commands/stream-chain/run.md +69 -69
  226. package/.claude/commands/swarm/README.md +15 -15
  227. package/.claude/commands/swarm/analysis.md +95 -95
  228. package/.claude/commands/swarm/development.md +96 -96
  229. package/.claude/commands/swarm/examples.md +168 -168
  230. package/.claude/commands/swarm/maintenance.md +102 -102
  231. package/.claude/commands/swarm/optimization.md +117 -117
  232. package/.claude/commands/swarm/research.md +136 -136
  233. package/.claude/commands/swarm/swarm-analysis.md +8 -8
  234. package/.claude/commands/swarm/swarm-background.md +8 -8
  235. package/.claude/commands/swarm/swarm-init.md +19 -19
  236. package/.claude/commands/swarm/swarm-modes.md +8 -8
  237. package/.claude/commands/swarm/swarm-monitor.md +8 -8
  238. package/.claude/commands/swarm/swarm-spawn.md +19 -19
  239. package/.claude/commands/swarm/swarm-status.md +8 -8
  240. package/.claude/commands/swarm/swarm-strategies.md +8 -8
  241. package/.claude/commands/swarm/swarm.md +87 -87
  242. package/.claude/commands/swarm/testing.md +131 -131
  243. package/.claude/commands/training/README.md +9 -9
  244. package/.claude/commands/training/model-update.md +25 -25
  245. package/.claude/commands/training/neural-patterns.md +107 -107
  246. package/.claude/commands/training/neural-train.md +75 -75
  247. package/.claude/commands/training/pattern-learn.md +25 -25
  248. package/.claude/commands/training/specialization.md +62 -62
  249. package/.claude/commands/truth/start.md +142 -142
  250. package/.claude/commands/verify/check.md +49 -49
  251. package/.claude/commands/verify/start.md +127 -127
  252. package/.claude/commands/workflows/README.md +9 -9
  253. package/.claude/commands/workflows/development.md +77 -77
  254. package/.claude/commands/workflows/research.md +62 -62
  255. package/.claude/commands/workflows/workflow-create.md +25 -25
  256. package/.claude/commands/workflows/workflow-execute.md +25 -25
  257. package/.claude/commands/workflows/workflow-export.md +25 -25
  258. package/.claude/eval/human-relevance-frozen-v1.json +17 -17
  259. package/.claude/evolve-proof/generation-0.json +211 -211
  260. package/.claude/evolve-proof/real-generation-0.json +406 -406
  261. package/.claude/evolve-proof/real-generation-1.json +406 -406
  262. package/.claude/helpers/README.md +96 -96
  263. package/.claude/helpers/adr-compliance.sh +186 -186
  264. package/.claude/helpers/auto-commit.sh +178 -178
  265. package/.claude/helpers/auto-memory-hook.mjs +430 -430
  266. package/.claude/helpers/checkpoint-manager.sh +251 -251
  267. package/.claude/helpers/daemon-manager.sh +252 -252
  268. package/.claude/helpers/ddd-tracker.sh +144 -144
  269. package/.claude/helpers/github-safe.js +156 -156
  270. package/.claude/helpers/github-setup.sh +45 -45
  271. package/.claude/helpers/guidance-hook.sh +13 -13
  272. package/.claude/helpers/guidance-hooks.sh +102 -102
  273. package/.claude/helpers/health-monitor.sh +108 -108
  274. package/.claude/helpers/helpers.manifest.json +6 -6
  275. package/.claude/helpers/hook-handler.cjs +565 -565
  276. package/.claude/helpers/intelligence.cjs +1058 -1058
  277. package/.claude/helpers/learning-hooks.sh +329 -329
  278. package/.claude/helpers/learning-optimizer.sh +127 -127
  279. package/.claude/helpers/learning-service.mjs +1144 -1144
  280. package/.claude/helpers/memory.js +83 -83
  281. package/.claude/helpers/metrics-db.mjs +503 -503
  282. package/.claude/helpers/pattern-consolidator.sh +86 -86
  283. package/.claude/helpers/perf-worker.sh +160 -160
  284. package/.claude/helpers/post-commit +16 -16
  285. package/.claude/helpers/pre-commit +26 -26
  286. package/.claude/helpers/quick-start.sh +19 -19
  287. package/.claude/helpers/router.js +105 -105
  288. package/.claude/helpers/security-scanner.sh +127 -127
  289. package/.claude/helpers/session.js +157 -157
  290. package/.claude/helpers/setup-mcp.sh +18 -18
  291. package/.claude/helpers/standard-checkpoint-hooks.sh +189 -189
  292. package/.claude/helpers/statusline-hook.sh +21 -21
  293. package/.claude/helpers/statusline.cjs +1060 -1060
  294. package/.claude/helpers/statusline.js +340 -340
  295. package/.claude/helpers/swarm-comms.sh +353 -353
  296. package/.claude/helpers/swarm-hooks.sh +761 -761
  297. package/.claude/helpers/swarm-monitor.sh +210 -210
  298. package/.claude/helpers/sync-v3-metrics.sh +245 -245
  299. package/.claude/helpers/update-v3-progress.sh +165 -165
  300. package/.claude/helpers/v3-quick-status.sh +57 -57
  301. package/.claude/helpers/v3.sh +110 -110
  302. package/.claude/helpers/validate-v3-config.sh +215 -215
  303. package/.claude/helpers/worker-manager.sh +170 -170
  304. package/.claude/proven-config.manifest.json +37 -37
  305. package/.claude/proven-config.signed.json +41 -41
  306. package/.claude/settings.json +182 -182
  307. package/.claude/skills/agentdb-advanced/SKILL.md +550 -550
  308. package/.claude/skills/agentdb-learning/SKILL.md +545 -545
  309. package/.claude/skills/agentdb-memory-patterns/SKILL.md +339 -339
  310. package/.claude/skills/agentdb-optimization/SKILL.md +509 -509
  311. package/.claude/skills/agentdb-vector-search/SKILL.md +339 -339
  312. package/.claude/skills/browser/SKILL.md +204 -204
  313. package/.claude/skills/dual-mode/README.md +71 -71
  314. package/.claude/skills/dual-mode/dual-collect.md +103 -103
  315. package/.claude/skills/dual-mode/dual-coordinate.md +85 -85
  316. package/.claude/skills/dual-mode/dual-spawn.md +81 -81
  317. package/.claude/skills/flow-nexus-neural/SKILL.md +727 -727
  318. package/.claude/skills/flow-nexus-platform/SKILL.md +1154 -1154
  319. package/.claude/skills/flow-nexus-swarm/SKILL.md +604 -604
  320. package/.claude/skills/github-code-review/SKILL.md +1125 -1125
  321. package/.claude/skills/github-multi-repo/SKILL.md +862 -862
  322. package/.claude/skills/github-project-management/SKILL.md +1262 -1262
  323. package/.claude/skills/github-release-management/SKILL.md +1064 -1064
  324. package/.claude/skills/github-workflow-automation/SKILL.md +1047 -1047
  325. package/.claude/skills/hooks-automation/SKILL.md +1201 -1201
  326. package/.claude/skills/pair-programming/SKILL.md +1202 -1202
  327. package/.claude/skills/reasoningbank-agentdb/SKILL.md +446 -446
  328. package/.claude/skills/reasoningbank-intelligence/SKILL.md +201 -201
  329. package/.claude/skills/skill-builder/SKILL.md +910 -910
  330. package/.claude/skills/sparc-methodology/SKILL.md +1106 -1106
  331. package/.claude/skills/stream-chain/SKILL.md +560 -560
  332. package/.claude/skills/swarm-advanced/SKILL.md +970 -970
  333. package/.claude/skills/swarm-orchestration/SKILL.md +179 -179
  334. package/.claude/skills/v3-cli-modernization/SKILL.md +871 -871
  335. package/.claude/skills/v3-core-implementation/SKILL.md +796 -796
  336. package/.claude/skills/v3-ddd-architecture/SKILL.md +441 -441
  337. package/.claude/skills/v3-integration-deep/SKILL.md +240 -240
  338. package/.claude/skills/v3-mcp-optimization/SKILL.md +776 -776
  339. package/.claude/skills/v3-memory-unification/SKILL.md +173 -173
  340. package/.claude/skills/v3-performance-optimization/SKILL.md +389 -389
  341. package/.claude/skills/v3-security-overhaul/SKILL.md +81 -81
  342. package/.claude/skills/v3-swarm-coordination/SKILL.md +339 -339
  343. package/.claude/skills/verification-quality/SKILL.md +691 -691
  344. package/README.md +419 -419
  345. package/bin/cli.js +314 -314
  346. package/bin/mcp-server.js +224 -224
  347. package/bin/preinstall.cjs +2 -2
  348. package/catalog-manifest.json +2 -2
  349. package/dist/src/autopilot-state.js +24 -7
  350. package/dist/src/benchmarks/gaia-critic.js +24 -24
  351. package/dist/src/business-pods/bbs-budget-tracker.js +53 -53
  352. package/dist/src/commands/completions.js +409 -409
  353. package/dist/src/commands/daemon.js +44 -44
  354. package/dist/src/commands/embeddings.js +26 -26
  355. package/dist/src/commands/hive-mind.js +97 -97
  356. package/dist/src/commands/hooks.js +31 -10
  357. package/dist/src/commands/init.js +202 -34
  358. package/dist/src/commands/memory.js +12 -1
  359. package/dist/src/commands/ruvector/backup.js +23 -23
  360. package/dist/src/commands/ruvector/benchmark.js +31 -31
  361. package/dist/src/commands/ruvector/import.js +14 -14
  362. package/dist/src/commands/ruvector/init.js +115 -115
  363. package/dist/src/commands/ruvector/migrate.js +99 -99
  364. package/dist/src/commands/ruvector/optimize.js +51 -51
  365. package/dist/src/commands/ruvector/setup.js +624 -624
  366. package/dist/src/commands/ruvector/status.js +38 -38
  367. package/dist/src/config/proven-config.js +2 -2
  368. package/dist/src/funnel/disclosure.js +13 -2
  369. package/dist/src/funnel/messages.d.ts +12 -10
  370. package/dist/src/funnel/messages.js +83 -11
  371. package/dist/src/init/claudemd-generator.js +231 -231
  372. package/dist/src/init/executor.js +453 -453
  373. package/dist/src/init/helper-signing.js +2 -2
  374. package/dist/src/init/helpers-generator.js +751 -751
  375. package/dist/src/init/statusline-generator.js +24 -24
  376. package/dist/src/mcp-tools/agentdb-tools.js +15 -15
  377. package/dist/src/mcp-tools/browser-intent-tools.js +19 -19
  378. package/dist/src/mcp-tools/browser-tools.js +8 -0
  379. package/dist/src/mcp-tools/hooks-tools.js +21 -0
  380. package/dist/src/mcp-tools/memory-tools.js +4 -3
  381. package/dist/src/memory/graph-edge-writer.js +22 -22
  382. package/dist/src/memory/memory-bridge.js +192 -123
  383. package/dist/src/memory/memory-initializer.js +407 -407
  384. package/dist/src/memory/rabitq-index.js +5 -5
  385. package/dist/src/parser.js +25 -9
  386. package/dist/src/proxy/verify.js +2 -2
  387. package/dist/src/runtime/headless.js +28 -28
  388. package/dist/src/services/distill-tuning.js +7 -7
  389. package/dist/src/services/headless-worker-executor.js +84 -84
  390. package/dist/src/services/memory-distillation.js +4 -4
  391. package/dist/src/services/worker-daemon.js +7 -4
  392. package/dist/src/transfer/deploy-seraphine.js +23 -23
  393. package/package.json +137 -137
  394. package/plugins/ruflo-metaharness/.claude-plugin/plugin.json +32 -32
  395. package/plugins/ruflo-metaharness/README.md +72 -72
  396. package/plugins/ruflo-metaharness/agents/metaharness-architect.md +58 -58
  397. package/plugins/ruflo-metaharness/commands/ruflo-metaharness.md +48 -48
  398. package/plugins/ruflo-metaharness/scripts/_darwin.mjs +210 -210
  399. package/plugins/ruflo-metaharness/scripts/_harness.mjs +330 -330
  400. package/plugins/ruflo-metaharness/scripts/_invoke.mjs +231 -231
  401. package/plugins/ruflo-metaharness/scripts/_redblue.mjs +143 -143
  402. package/plugins/ruflo-metaharness/scripts/_similarity.mjs +161 -161
  403. package/plugins/ruflo-metaharness/scripts/_spike-similarity.mjs +223 -223
  404. package/plugins/ruflo-metaharness/scripts/audit-list.mjs +158 -158
  405. package/plugins/ruflo-metaharness/scripts/audit-trend.mjs +272 -272
  406. package/plugins/ruflo-metaharness/scripts/bench-parse-mcp-scan.mjs +146 -146
  407. package/plugins/ruflo-metaharness/scripts/bench-recordpair-overhead.mjs +186 -186
  408. package/plugins/ruflo-metaharness/scripts/bench-similarity.mjs +177 -177
  409. package/plugins/ruflo-metaharness/scripts/bench.mjs +95 -95
  410. package/plugins/ruflo-metaharness/scripts/drift-from-history.mjs +363 -363
  411. package/plugins/ruflo-metaharness/scripts/evolve.mjs +404 -404
  412. package/plugins/ruflo-metaharness/scripts/genome.mjs +80 -80
  413. package/plugins/ruflo-metaharness/scripts/gepa.mjs +153 -153
  414. package/plugins/ruflo-metaharness/scripts/learn.mjs +127 -127
  415. package/plugins/ruflo-metaharness/scripts/mcp-scan.mjs +111 -111
  416. package/plugins/ruflo-metaharness/scripts/mint.mjs +126 -126
  417. package/plugins/ruflo-metaharness/scripts/oia-audit.mjs +228 -228
  418. package/plugins/ruflo-metaharness/scripts/redblue.mjs +286 -286
  419. package/plugins/ruflo-metaharness/scripts/router-parallel-analyze.mjs +250 -250
  420. package/plugins/ruflo-metaharness/scripts/score.mjs +92 -92
  421. package/plugins/ruflo-metaharness/scripts/security-bench.mjs +174 -174
  422. package/plugins/ruflo-metaharness/scripts/similarity.mjs +158 -158
  423. package/plugins/ruflo-metaharness/scripts/smoke.sh +2356 -2356
  424. package/plugins/ruflo-metaharness/scripts/test-graceful-degradation.mjs +165 -165
  425. package/plugins/ruflo-metaharness/scripts/test-mcp-tools.mjs +472 -472
  426. package/plugins/ruflo-metaharness/scripts/test-parallel-pipeline.mjs +204 -204
  427. package/plugins/ruflo-metaharness/scripts/test-pipeline-roundtrip.mjs +586 -586
  428. package/plugins/ruflo-metaharness/scripts/test-similarity.mjs +334 -334
  429. package/plugins/ruflo-metaharness/scripts/test-with-openrouter.mjs +229 -229
  430. package/plugins/ruflo-metaharness/scripts/threat-model.mjs +59 -59
  431. package/plugins/ruflo-metaharness/skills/harness-bench/SKILL.md +64 -64
  432. package/plugins/ruflo-metaharness/skills/harness-drift-from-history/SKILL.md +65 -65
  433. package/plugins/ruflo-metaharness/skills/harness-evolve/SKILL.md +131 -131
  434. package/plugins/ruflo-metaharness/skills/harness-genome/SKILL.md +54 -54
  435. package/plugins/ruflo-metaharness/skills/harness-gepa/SKILL.md +65 -65
  436. package/plugins/ruflo-metaharness/skills/harness-learn/SKILL.md +65 -65
  437. package/plugins/ruflo-metaharness/skills/harness-mcp-scan/SKILL.md +49 -49
  438. package/plugins/ruflo-metaharness/skills/harness-mint/SKILL.md +72 -72
  439. package/plugins/ruflo-metaharness/skills/harness-oia-audit/SKILL.md +79 -79
  440. package/plugins/ruflo-metaharness/skills/harness-score/SKILL.md +66 -66
  441. package/plugins/ruflo-metaharness/skills/harness-security-bench/SKILL.md +101 -101
  442. package/plugins/ruflo-metaharness/skills/harness-similarity/SKILL.md +67 -67
  443. package/plugins/ruflo-metaharness/skills/harness-threat-model/SKILL.md +41 -41
  444. package/scripts/postinstall.cjs +153 -153
@@ -1,404 +1,404 @@
1
- #!/usr/bin/env node
2
- // evolve.mjs — wrapper around `metaharness-darwin evolve <repo>`.
3
- //
4
- // ADR-153: Darwin Mode is the WRITE layer that closes the loop ADR-150's
5
- // READ layer (score / genome / mcp-scan / threat-model / oia-audit) opens.
6
- // score+genome tell you where the harness IS; darwin evolve tells you which
7
- // mutation makes it provably better, without retraining the foundation model.
8
- //
9
- // SAFETY (ADR-153 §"Safety model"):
10
- // - Variant generation + sandbox happen under <repo>/.metaharness/variants/,
11
- // never in the repo root. Upstream `inspectVariant()` rejects nested dirs,
12
- // symlinks, secret-shaped strings, shell-out / network / dynamic-eval
13
- // before any variant runs. Exit code 99 is reserved for "safety-disqualified".
14
- // - --confirm is REQUIRED. Without it the script prints a plan and exits 0
15
- // (mirrors mint.mjs convention). This is in addition to upstream's safety
16
- // layer — defense in depth at the ruflo boundary.
17
- // - Default --generations 3 --children 3 (small) — anything larger is opt-in.
18
- // Real evolutions are minutes-to-hours; ruflo's default sandbox config
19
- // errs toward "show me the mechanism works" over "find a winner today".
20
- //
21
- // USAGE
22
- // node scripts/evolve.mjs --repo . # dry-run plan
23
- // node scripts/evolve.mjs --repo . --confirm # actually evolve
24
- // node scripts/evolve.mjs --repo . --confirm --generations 5 --children 3
25
- // node scripts/evolve.mjs --repo . --confirm --sandbox mock # no real tests
26
- // node scripts/evolve.mjs --repo . --confirm --selection pareto
27
- // node scripts/evolve.mjs --repo . --confirm --diagnose # + GEPA failure diagnosis
28
- //
29
- // --diagnose (GEPA failure diagnosis — the natural-language-diagnosis trick
30
- // from GEPA, scoped modestly): after the evolve run completes, the losing /
31
- // failed variants' transcripts are run through darwin's gepa
32
- // `analyzeTranscript` + `classifyFailure` ops and a `diagnosis` section
33
- // (failure classes + counts + dominant class per variant) is appended to the
34
- // emitted JSON report. UPSTREAM SHAPE NOTE (verified against darwin 0.8.0):
35
- // `metaharness-darwin evolve --json` emits a TEXT leaderboard on stdout — no
36
- // JSON, no transcripts. The per-variant run records live at
37
- // `<repo>/.metaharness/runs/<id>.json` as sandbox exec traces
38
- // ({taskId, exitCode, stdout, stderr}), which are NOT gepa {actionRaw, obs}
39
- // transcripts. So the diagnosis layer (a) uses gepa-shaped transcripts when
40
- // a run record embeds them (agent-sandbox / future upstream), (b) falls back
41
- // to the champion's transcript, and (c) otherwise emits
42
- // `diagnosis: {available: false, reason, traceSummary}` with a mechanical
43
- // per-variant trace summary — it NEVER fails the run.
44
- //
45
- // EXIT CODES
46
- // 0 evolved OK (or dry-run, or degraded — MetaHarness Darwin not available)
47
- // 1 --alert-on-no-improvement and champion did not beat parent
48
- // 2 config error or evolution failure
49
- // 99 reserved — upstream "safety-disqualified" (propagated)
50
-
51
- import { runDarwinAsync, emitDarwinDegradedJsonAndExit, importGepa } from './_darwin.mjs';
52
- import { existsSync, readdirSync, readFileSync } from 'node:fs';
53
- import { join, resolve } from 'node:path';
54
-
55
- const ARGS = (() => {
56
- const a = {
57
- repo: '.',
58
- generations: 3,
59
- children: 3,
60
- concurrency: 2,
61
- seed: null,
62
- sandbox: 'real',
63
- selection: null,
64
- crossover: false,
65
- epistasis: false,
66
- curriculum: false,
67
- riskBudget: null,
68
- fdr: null,
69
- tie: null,
70
- bench: null,
71
- mutator: 'deterministic',
72
- ruvllmUrl: null,
73
- ruvllmModel: null,
74
- confirm: false,
75
- alertOnNoImprovement: false,
76
- diagnose: false,
77
- format: 'json',
78
- timeoutMs: null, // computed below if unset
79
- };
80
- for (let i = 2; i < process.argv.length; i++) {
81
- const v = process.argv[i];
82
- if (v === '--repo') a.repo = process.argv[++i];
83
- else if (v === '--generations') a.generations = parseInt(process.argv[++i], 10);
84
- else if (v === '--children') a.children = parseInt(process.argv[++i], 10);
85
- else if (v === '--concurrency') a.concurrency = parseInt(process.argv[++i], 10);
86
- else if (v === '--seed') a.seed = parseInt(process.argv[++i], 10);
87
- else if (v === '--sandbox') a.sandbox = process.argv[++i];
88
- else if (v === '--selection') a.selection = process.argv[++i];
89
- else if (v === '--crossover') a.crossover = true;
90
- else if (v === '--epistasis') a.epistasis = true;
91
- else if (v === '--curriculum') a.curriculum = true;
92
- else if (v === '--risk-budget') a.riskBudget = parseInt(process.argv[++i], 10);
93
- else if (v === '--fdr') a.fdr = parseFloat(process.argv[++i]);
94
- else if (v === '--tie') a.tie = process.argv[++i];
95
- else if (v === '--bench') a.bench = process.argv[++i];
96
- else if (v === '--mutator') a.mutator = process.argv[++i];
97
- else if (v === '--ruvllm-url') a.ruvllmUrl = process.argv[++i];
98
- else if (v === '--ruvllm-model') a.ruvllmModel = process.argv[++i];
99
- else if (v === '--confirm') a.confirm = true;
100
- else if (v === '--alert-on-no-improvement') a.alertOnNoImprovement = true;
101
- else if (v === '--diagnose') a.diagnose = true;
102
- else if (v === '--format') a.format = process.argv[++i];
103
- else if (v === '--timeout-ms') a.timeoutMs = parseInt(process.argv[++i], 10);
104
- }
105
- return a;
106
- })();
107
-
108
- function safetyChecks() {
109
- const repoPath = resolve(ARGS.repo);
110
- if (!existsSync(repoPath)) {
111
- console.error(`evolve: repo path does not exist: ${repoPath}`);
112
- process.exit(2);
113
- }
114
- if (ARGS.generations < 1 || ARGS.generations > 50) {
115
- console.error('evolve: --generations must be 1..50 (ruflo cap; upstream supports more)');
116
- process.exit(2);
117
- }
118
- if (ARGS.children < 1 || ARGS.children > 20) {
119
- console.error('evolve: --children must be 1..20 (ruflo cap)');
120
- process.exit(2);
121
- }
122
- if (ARGS.concurrency < 1 || ARGS.concurrency > 8) {
123
- console.error('evolve: --concurrency must be 1..8 (ruflo cap)');
124
- process.exit(2);
125
- }
126
- if (!['real', 'mock', 'agent'].includes(ARGS.sandbox)) {
127
- console.error(`evolve: --sandbox must be real|mock|agent (got: ${ARGS.sandbox})`);
128
- process.exit(2);
129
- }
130
- if (ARGS.selection && !['quality-diversity', 'behavioral-diversity', 'niche-steering', 'clade', 'pareto'].includes(ARGS.selection)) {
131
- console.error(`evolve: --selection must be one of quality-diversity|behavioral-diversity|niche-steering|clade|pareto`);
132
- process.exit(2);
133
- }
134
- if (!['deterministic', 'ruvllm'].includes(ARGS.mutator)) {
135
- console.error(`evolve: --mutator must be deterministic|ruvllm`);
136
- process.exit(2);
137
- }
138
- return repoPath;
139
- }
140
-
141
- // ---------------------------------------------------------------------------
142
- // --diagnose support (GEPA failure diagnosis)
143
- // ---------------------------------------------------------------------------
144
-
145
- /** True when `arr` looks like a gepa transcript: [{actionRaw?, obs?}, ...]. */
146
- function looksLikeGepaTranscript(arr) {
147
- return Array.isArray(arr) && arr.length > 0 &&
148
- arr.every((e) => e && typeof e === 'object' && ('actionRaw' in e || 'obs' in e));
149
- }
150
-
151
- /**
152
- * Pull every gepa-shaped transcript out of one run record. Upstream darwin
153
- * 0.8.0 run records carry sandbox exec traces (NOT gepa transcripts), but a
154
- * record MAY embed `transcript` arrays (agent sandbox / future upstream) —
155
- * accept `record.transcript`, `record.traces[i].transcript`, or `traces`
156
- * itself when its entries are {actionRaw, obs}-shaped.
157
- */
158
- function extractGepaTranscripts(record) {
159
- const out = [];
160
- if (looksLikeGepaTranscript(record?.transcript)) {
161
- out.push({ taskId: null, exitCode: null, entries: record.transcript });
162
- }
163
- const traces = Array.isArray(record?.traces) ? record.traces : [];
164
- if (looksLikeGepaTranscript(traces)) {
165
- out.push({ taskId: null, exitCode: null, entries: traces });
166
- } else {
167
- for (const t of traces) {
168
- if (looksLikeGepaTranscript(t?.transcript)) {
169
- out.push({ taskId: t.taskId ?? null, exitCode: t.exitCode ?? null, entries: t.transcript });
170
- }
171
- }
172
- }
173
- return out;
174
- }
175
-
176
- /** Mechanical per-variant summary of sandbox exec traces (the always-available fallback signal). */
177
- function summarizeTraces(record) {
178
- const traces = Array.isArray(record?.traces) ? record.traces : [];
179
- return {
180
- tasks: traces.length,
181
- failed: traces.filter((t) => t?.exitCode !== 0).length,
182
- timedOut: traces.filter((t) => t?.timedOut === true).length,
183
- blockedActions: traces.reduce((n, t) => n + (Array.isArray(t?.blockedActions) ? t.blockedActions.length : 0), 0),
184
- };
185
- }
186
-
187
- /**
188
- * Build the `diagnosis` section for the emitted report. Never throws and
189
- * never affects the run's exit code — any internal failure degrades to
190
- * `{available: false, reason}`.
191
- */
192
- async function buildDiagnosis(repoPath) {
193
- try {
194
- const metaDir = join(repoPath, '.metaharness');
195
- const runsDir = join(metaDir, 'runs');
196
- if (!existsSync(runsDir)) {
197
- return { available: false, reason: 'no-run-records: <repo>/.metaharness/runs does not exist' };
198
- }
199
- let winnerId = null;
200
- try {
201
- winnerId = JSON.parse(readFileSync(join(metaDir, 'reports', 'winner.json'), 'utf-8'))?.variant?.id ?? null;
202
- } catch { /* winner unknown — treat all variants as candidates */ }
203
-
204
- const records = [];
205
- for (const f of readdirSync(runsDir).filter((f) => f.endsWith('.json')).slice(0, 100)) {
206
- try {
207
- records.push({ id: f.replace(/\.json$/, ''), rec: JSON.parse(readFileSync(join(runsDir, f), 'utf-8')) });
208
- } catch { /* skip unreadable record */ }
209
- }
210
- if (records.length === 0) {
211
- return { available: false, reason: 'no-run-records: <repo>/.metaharness/runs contains no parseable records' };
212
- }
213
-
214
- // Losing/failed variants are the primary diagnosis targets; the champion
215
- // is the fallback when no loser exposes a transcript.
216
- const losers = records.filter((r) =>
217
- r.id !== winnerId &&
218
- (r.rec?.score?.promoted === false ||
219
- (Array.isArray(r.rec?.traces) && r.rec.traces.some((t) => t?.exitCode !== 0 || t?.timedOut))));
220
- const champion = records.filter((r) => r.id === winnerId);
221
-
222
- let scope = 'losing-variants';
223
- let pool = losers.map((r) => ({ ...r, transcripts: extractGepaTranscripts(r.rec) }))
224
- .filter((r) => r.transcripts.length > 0);
225
- if (pool.length === 0) {
226
- scope = 'champion-fallback';
227
- pool = champion.map((r) => ({ ...r, transcripts: extractGepaTranscripts(r.rec) }))
228
- .filter((r) => r.transcripts.length > 0);
229
- }
230
-
231
- if (pool.length === 0) {
232
- // Verified upstream shape (darwin 0.8.0): run records are sandbox exec
233
- // traces, not gepa transcripts. Emit the mechanical trace summary so
234
- // --diagnose still yields signal.
235
- const target = losers.length ? losers : records;
236
- return {
237
- available: false,
238
- reason: 'no-gepa-transcripts: run records contain sandbox exec traces ({taskId, exitCode, stdout, stderr}), not gepa {actionRaw, obs} transcripts',
239
- traceSummary: Object.fromEntries(target.map((r) => [r.id, summarizeTraces(r.rec)])),
240
- };
241
- }
242
-
243
- const gepa = await importGepa();
244
- if (!gepa || typeof gepa.analyzeTranscript !== 'function') {
245
- return { available: false, reason: 'metaharness-darwin-gepa-not-available' };
246
- }
247
-
248
- const classLabel = (n) => {
249
- const raw = gepa.FAILURE_CLASSES?.[n];
250
- return raw ? String(raw).split(' (')[0] : `class-${n}`;
251
- };
252
-
253
- const totals = {};
254
- const variants = [];
255
- for (const r of pool) {
256
- const classes = {};
257
- for (const t of r.transcripts) {
258
- const analysis = gepa.analyzeTranscript(t.entries);
259
- const cls = typeof gepa.classifyFailure === 'function'
260
- ? gepa.classifyFailure({ goldResolved: t.exitCode === 0, analysis })
261
- : -1;
262
- const label = classLabel(cls);
263
- classes[label] = (classes[label] || 0) + 1;
264
- totals[label] = (totals[label] || 0) + 1;
265
- }
266
- const dominantClass = Object.entries(classes).sort((a, b) => b[1] - a[1])[0]?.[0] ?? null;
267
- variants.push({ id: r.id, transcripts: r.transcripts.length, failureClasses: classes, dominantClass });
268
- }
269
-
270
- return { available: true, scope, variants, totals };
271
- } catch (e) {
272
- return { available: false, reason: `diagnosis-failed: ${e?.message ?? e}` };
273
- }
274
- }
275
-
276
- // Compute a sensible timeout from the search shape if caller didn't specify.
277
- // Rough budget: each variant ~= 30s (sandbox test command + safety inspect),
278
- // total ~= generations × children × per-variant / concurrency.
279
- function defaultTimeoutMs() {
280
- const perVariantMs = ARGS.sandbox === 'mock' ? 2_000 : 60_000;
281
- const variants = ARGS.generations * ARGS.children;
282
- const parallelism = Math.min(ARGS.concurrency, variants);
283
- const wall = Math.ceil(variants / parallelism) * perVariantMs;
284
- // Add 30s overhead for npm install + initial profile + final report.
285
- return Math.max(60_000, wall + 30_000);
286
- }
287
-
288
- async function main() {
289
- const repoPath = safetyChecks();
290
-
291
- const plan = {
292
- binary: 'metaharness-darwin evolve',
293
- repo: repoPath,
294
- generations: ARGS.generations,
295
- children: ARGS.children,
296
- concurrency: ARGS.concurrency,
297
- sandbox: ARGS.sandbox,
298
- selection: ARGS.selection,
299
- crossover: ARGS.crossover,
300
- epistasis: ARGS.epistasis,
301
- curriculum: ARGS.curriculum,
302
- mutator: ARGS.mutator,
303
- diagnose: ARGS.diagnose,
304
- estVariants: ARGS.generations * ARGS.children,
305
- timeoutMs: ARGS.timeoutMs ?? defaultTimeoutMs(),
306
- output: `${repoPath}/.metaharness/{archive.json, lineage.json, variants/, runs/, reports/winner.json}`,
307
- };
308
-
309
- if (!ARGS.confirm) {
310
- const payload = {
311
- success: true,
312
- data: { plan, dryRun: true, message: 'Pass --confirm to run the evolution.' },
313
- generatedAt: new Date().toISOString(),
314
- };
315
- console.log(JSON.stringify(payload, null, 2));
316
- process.exit(0);
317
- }
318
-
319
- const cliArgs = ['evolve', repoPath,
320
- '--generations', String(ARGS.generations),
321
- '--children', String(ARGS.children),
322
- '--concurrency', String(ARGS.concurrency),
323
- '--sandbox', ARGS.sandbox,
324
- '--mutator', ARGS.mutator,
325
- ];
326
- if (ARGS.seed != null) cliArgs.push('--seed', String(ARGS.seed));
327
- if (ARGS.selection) cliArgs.push('--selection', ARGS.selection);
328
- if (ARGS.crossover) cliArgs.push('--crossover');
329
- if (ARGS.epistasis) cliArgs.push('--epistasis');
330
- if (ARGS.curriculum) cliArgs.push('--curriculum');
331
- if (ARGS.riskBudget != null) cliArgs.push('--risk-budget', String(ARGS.riskBudget));
332
- if (ARGS.fdr != null) cliArgs.push('--fdr', String(ARGS.fdr));
333
- if (ARGS.tie) cliArgs.push('--tie', ARGS.tie);
334
- if (ARGS.bench) cliArgs.push('--bench', ARGS.bench);
335
- if (ARGS.ruvllmUrl) cliArgs.push('--ruvllm-url', ARGS.ruvllmUrl);
336
- if (ARGS.ruvllmModel) cliArgs.push('--ruvllm-model', ARGS.ruvllmModel);
337
-
338
- // Forward progress lines to stderr so the user sees per-generation activity
339
- // (subprocess-of-an-MCP-tool case: this still surfaces in the agent log).
340
- const r = await runDarwinAsync(cliArgs, {
341
- timeoutMs: plan.timeoutMs,
342
- onProgress: (line) => { if (line.trim()) process.stderr.write(`[evolve] ${line}\n`); },
343
- });
344
-
345
- if (r.degraded) {
346
- emitDarwinDegradedJsonAndExit(r.reason);
347
- return;
348
- }
349
-
350
- // Upstream exit code 99 = safety-disqualified — propagate verbatim so
351
- // CI gates can distinguish "evolution failed" from "evolution surfaced
352
- // a safety-tripping mutation". This is a designed-in tripwire, not an
353
- // error the ruflo layer should remap.
354
- if (r.exitCode === 99) {
355
- const payload = {
356
- success: false,
357
- data: { safetyDisqualified: true, hint: 'A variant tripped the safety inspection layer. See <repo>/.metaharness/runs/ for which surface and pattern.' },
358
- stderrTail: r.stderr.slice(-400),
359
- durationMs: r.durationMs,
360
- generatedAt: new Date().toISOString(),
361
- };
362
- console.log(JSON.stringify(payload, null, 2));
363
- process.exit(99);
364
- }
365
-
366
- if (r.exitCode !== 0) {
367
- const payload = {
368
- success: false,
369
- data: { exitCode: r.exitCode, stderrTail: r.stderr.slice(-400) },
370
- generatedAt: new Date().toISOString(),
371
- };
372
- console.log(JSON.stringify(payload, null, 2));
373
- process.exit(2);
374
- }
375
-
376
- const champion = r.json || {};
377
- const noImprovement = champion.parentScore != null && champion.championScore != null &&
378
- champion.championScore <= champion.parentScore;
379
-
380
- const payload = {
381
- success: true,
382
- data: {
383
- ...champion,
384
- plan,
385
- durationMs: r.durationMs,
386
- improved: !noImprovement,
387
- },
388
- generatedAt: new Date().toISOString(),
389
- };
390
-
391
- // GEPA failure diagnosis — opt-in, additive, never fails the run.
392
- if (ARGS.diagnose) {
393
- payload.data.diagnosis = await buildDiagnosis(repoPath);
394
- }
395
-
396
- console.log(JSON.stringify(payload, null, 2));
397
- if (ARGS.alertOnNoImprovement && noImprovement) process.exit(1);
398
- process.exit(0);
399
- }
400
-
401
- main().catch((e) => {
402
- console.error(`evolve: unexpected failure: ${e?.message ?? e}`);
403
- process.exit(2);
404
- });
1
+ #!/usr/bin/env node
2
+ // evolve.mjs — wrapper around `metaharness-darwin evolve <repo>`.
3
+ //
4
+ // ADR-153: Darwin Mode is the WRITE layer that closes the loop ADR-150's
5
+ // READ layer (score / genome / mcp-scan / threat-model / oia-audit) opens.
6
+ // score+genome tell you where the harness IS; darwin evolve tells you which
7
+ // mutation makes it provably better, without retraining the foundation model.
8
+ //
9
+ // SAFETY (ADR-153 §"Safety model"):
10
+ // - Variant generation + sandbox happen under <repo>/.metaharness/variants/,
11
+ // never in the repo root. Upstream `inspectVariant()` rejects nested dirs,
12
+ // symlinks, secret-shaped strings, shell-out / network / dynamic-eval
13
+ // before any variant runs. Exit code 99 is reserved for "safety-disqualified".
14
+ // - --confirm is REQUIRED. Without it the script prints a plan and exits 0
15
+ // (mirrors mint.mjs convention). This is in addition to upstream's safety
16
+ // layer — defense in depth at the ruflo boundary.
17
+ // - Default --generations 3 --children 3 (small) — anything larger is opt-in.
18
+ // Real evolutions are minutes-to-hours; ruflo's default sandbox config
19
+ // errs toward "show me the mechanism works" over "find a winner today".
20
+ //
21
+ // USAGE
22
+ // node scripts/evolve.mjs --repo . # dry-run plan
23
+ // node scripts/evolve.mjs --repo . --confirm # actually evolve
24
+ // node scripts/evolve.mjs --repo . --confirm --generations 5 --children 3
25
+ // node scripts/evolve.mjs --repo . --confirm --sandbox mock # no real tests
26
+ // node scripts/evolve.mjs --repo . --confirm --selection pareto
27
+ // node scripts/evolve.mjs --repo . --confirm --diagnose # + GEPA failure diagnosis
28
+ //
29
+ // --diagnose (GEPA failure diagnosis — the natural-language-diagnosis trick
30
+ // from GEPA, scoped modestly): after the evolve run completes, the losing /
31
+ // failed variants' transcripts are run through darwin's gepa
32
+ // `analyzeTranscript` + `classifyFailure` ops and a `diagnosis` section
33
+ // (failure classes + counts + dominant class per variant) is appended to the
34
+ // emitted JSON report. UPSTREAM SHAPE NOTE (verified against darwin 0.8.0):
35
+ // `metaharness-darwin evolve --json` emits a TEXT leaderboard on stdout — no
36
+ // JSON, no transcripts. The per-variant run records live at
37
+ // `<repo>/.metaharness/runs/<id>.json` as sandbox exec traces
38
+ // ({taskId, exitCode, stdout, stderr}), which are NOT gepa {actionRaw, obs}
39
+ // transcripts. So the diagnosis layer (a) uses gepa-shaped transcripts when
40
+ // a run record embeds them (agent-sandbox / future upstream), (b) falls back
41
+ // to the champion's transcript, and (c) otherwise emits
42
+ // `diagnosis: {available: false, reason, traceSummary}` with a mechanical
43
+ // per-variant trace summary — it NEVER fails the run.
44
+ //
45
+ // EXIT CODES
46
+ // 0 evolved OK (or dry-run, or degraded — MetaHarness Darwin not available)
47
+ // 1 --alert-on-no-improvement and champion did not beat parent
48
+ // 2 config error or evolution failure
49
+ // 99 reserved — upstream "safety-disqualified" (propagated)
50
+
51
+ import { runDarwinAsync, emitDarwinDegradedJsonAndExit, importGepa } from './_darwin.mjs';
52
+ import { existsSync, readdirSync, readFileSync } from 'node:fs';
53
+ import { join, resolve } from 'node:path';
54
+
55
+ const ARGS = (() => {
56
+ const a = {
57
+ repo: '.',
58
+ generations: 3,
59
+ children: 3,
60
+ concurrency: 2,
61
+ seed: null,
62
+ sandbox: 'real',
63
+ selection: null,
64
+ crossover: false,
65
+ epistasis: false,
66
+ curriculum: false,
67
+ riskBudget: null,
68
+ fdr: null,
69
+ tie: null,
70
+ bench: null,
71
+ mutator: 'deterministic',
72
+ ruvllmUrl: null,
73
+ ruvllmModel: null,
74
+ confirm: false,
75
+ alertOnNoImprovement: false,
76
+ diagnose: false,
77
+ format: 'json',
78
+ timeoutMs: null, // computed below if unset
79
+ };
80
+ for (let i = 2; i < process.argv.length; i++) {
81
+ const v = process.argv[i];
82
+ if (v === '--repo') a.repo = process.argv[++i];
83
+ else if (v === '--generations') a.generations = parseInt(process.argv[++i], 10);
84
+ else if (v === '--children') a.children = parseInt(process.argv[++i], 10);
85
+ else if (v === '--concurrency') a.concurrency = parseInt(process.argv[++i], 10);
86
+ else if (v === '--seed') a.seed = parseInt(process.argv[++i], 10);
87
+ else if (v === '--sandbox') a.sandbox = process.argv[++i];
88
+ else if (v === '--selection') a.selection = process.argv[++i];
89
+ else if (v === '--crossover') a.crossover = true;
90
+ else if (v === '--epistasis') a.epistasis = true;
91
+ else if (v === '--curriculum') a.curriculum = true;
92
+ else if (v === '--risk-budget') a.riskBudget = parseInt(process.argv[++i], 10);
93
+ else if (v === '--fdr') a.fdr = parseFloat(process.argv[++i]);
94
+ else if (v === '--tie') a.tie = process.argv[++i];
95
+ else if (v === '--bench') a.bench = process.argv[++i];
96
+ else if (v === '--mutator') a.mutator = process.argv[++i];
97
+ else if (v === '--ruvllm-url') a.ruvllmUrl = process.argv[++i];
98
+ else if (v === '--ruvllm-model') a.ruvllmModel = process.argv[++i];
99
+ else if (v === '--confirm') a.confirm = true;
100
+ else if (v === '--alert-on-no-improvement') a.alertOnNoImprovement = true;
101
+ else if (v === '--diagnose') a.diagnose = true;
102
+ else if (v === '--format') a.format = process.argv[++i];
103
+ else if (v === '--timeout-ms') a.timeoutMs = parseInt(process.argv[++i], 10);
104
+ }
105
+ return a;
106
+ })();
107
+
108
+ function safetyChecks() {
109
+ const repoPath = resolve(ARGS.repo);
110
+ if (!existsSync(repoPath)) {
111
+ console.error(`evolve: repo path does not exist: ${repoPath}`);
112
+ process.exit(2);
113
+ }
114
+ if (ARGS.generations < 1 || ARGS.generations > 50) {
115
+ console.error('evolve: --generations must be 1..50 (ruflo cap; upstream supports more)');
116
+ process.exit(2);
117
+ }
118
+ if (ARGS.children < 1 || ARGS.children > 20) {
119
+ console.error('evolve: --children must be 1..20 (ruflo cap)');
120
+ process.exit(2);
121
+ }
122
+ if (ARGS.concurrency < 1 || ARGS.concurrency > 8) {
123
+ console.error('evolve: --concurrency must be 1..8 (ruflo cap)');
124
+ process.exit(2);
125
+ }
126
+ if (!['real', 'mock', 'agent'].includes(ARGS.sandbox)) {
127
+ console.error(`evolve: --sandbox must be real|mock|agent (got: ${ARGS.sandbox})`);
128
+ process.exit(2);
129
+ }
130
+ if (ARGS.selection && !['quality-diversity', 'behavioral-diversity', 'niche-steering', 'clade', 'pareto'].includes(ARGS.selection)) {
131
+ console.error(`evolve: --selection must be one of quality-diversity|behavioral-diversity|niche-steering|clade|pareto`);
132
+ process.exit(2);
133
+ }
134
+ if (!['deterministic', 'ruvllm'].includes(ARGS.mutator)) {
135
+ console.error(`evolve: --mutator must be deterministic|ruvllm`);
136
+ process.exit(2);
137
+ }
138
+ return repoPath;
139
+ }
140
+
141
+ // ---------------------------------------------------------------------------
142
+ // --diagnose support (GEPA failure diagnosis)
143
+ // ---------------------------------------------------------------------------
144
+
145
+ /** True when `arr` looks like a gepa transcript: [{actionRaw?, obs?}, ...]. */
146
+ function looksLikeGepaTranscript(arr) {
147
+ return Array.isArray(arr) && arr.length > 0 &&
148
+ arr.every((e) => e && typeof e === 'object' && ('actionRaw' in e || 'obs' in e));
149
+ }
150
+
151
+ /**
152
+ * Pull every gepa-shaped transcript out of one run record. Upstream darwin
153
+ * 0.8.0 run records carry sandbox exec traces (NOT gepa transcripts), but a
154
+ * record MAY embed `transcript` arrays (agent sandbox / future upstream) —
155
+ * accept `record.transcript`, `record.traces[i].transcript`, or `traces`
156
+ * itself when its entries are {actionRaw, obs}-shaped.
157
+ */
158
+ function extractGepaTranscripts(record) {
159
+ const out = [];
160
+ if (looksLikeGepaTranscript(record?.transcript)) {
161
+ out.push({ taskId: null, exitCode: null, entries: record.transcript });
162
+ }
163
+ const traces = Array.isArray(record?.traces) ? record.traces : [];
164
+ if (looksLikeGepaTranscript(traces)) {
165
+ out.push({ taskId: null, exitCode: null, entries: traces });
166
+ } else {
167
+ for (const t of traces) {
168
+ if (looksLikeGepaTranscript(t?.transcript)) {
169
+ out.push({ taskId: t.taskId ?? null, exitCode: t.exitCode ?? null, entries: t.transcript });
170
+ }
171
+ }
172
+ }
173
+ return out;
174
+ }
175
+
176
+ /** Mechanical per-variant summary of sandbox exec traces (the always-available fallback signal). */
177
+ function summarizeTraces(record) {
178
+ const traces = Array.isArray(record?.traces) ? record.traces : [];
179
+ return {
180
+ tasks: traces.length,
181
+ failed: traces.filter((t) => t?.exitCode !== 0).length,
182
+ timedOut: traces.filter((t) => t?.timedOut === true).length,
183
+ blockedActions: traces.reduce((n, t) => n + (Array.isArray(t?.blockedActions) ? t.blockedActions.length : 0), 0),
184
+ };
185
+ }
186
+
187
+ /**
188
+ * Build the `diagnosis` section for the emitted report. Never throws and
189
+ * never affects the run's exit code — any internal failure degrades to
190
+ * `{available: false, reason}`.
191
+ */
192
+ async function buildDiagnosis(repoPath) {
193
+ try {
194
+ const metaDir = join(repoPath, '.metaharness');
195
+ const runsDir = join(metaDir, 'runs');
196
+ if (!existsSync(runsDir)) {
197
+ return { available: false, reason: 'no-run-records: <repo>/.metaharness/runs does not exist' };
198
+ }
199
+ let winnerId = null;
200
+ try {
201
+ winnerId = JSON.parse(readFileSync(join(metaDir, 'reports', 'winner.json'), 'utf-8'))?.variant?.id ?? null;
202
+ } catch { /* winner unknown — treat all variants as candidates */ }
203
+
204
+ const records = [];
205
+ for (const f of readdirSync(runsDir).filter((f) => f.endsWith('.json')).slice(0, 100)) {
206
+ try {
207
+ records.push({ id: f.replace(/\.json$/, ''), rec: JSON.parse(readFileSync(join(runsDir, f), 'utf-8')) });
208
+ } catch { /* skip unreadable record */ }
209
+ }
210
+ if (records.length === 0) {
211
+ return { available: false, reason: 'no-run-records: <repo>/.metaharness/runs contains no parseable records' };
212
+ }
213
+
214
+ // Losing/failed variants are the primary diagnosis targets; the champion
215
+ // is the fallback when no loser exposes a transcript.
216
+ const losers = records.filter((r) =>
217
+ r.id !== winnerId &&
218
+ (r.rec?.score?.promoted === false ||
219
+ (Array.isArray(r.rec?.traces) && r.rec.traces.some((t) => t?.exitCode !== 0 || t?.timedOut))));
220
+ const champion = records.filter((r) => r.id === winnerId);
221
+
222
+ let scope = 'losing-variants';
223
+ let pool = losers.map((r) => ({ ...r, transcripts: extractGepaTranscripts(r.rec) }))
224
+ .filter((r) => r.transcripts.length > 0);
225
+ if (pool.length === 0) {
226
+ scope = 'champion-fallback';
227
+ pool = champion.map((r) => ({ ...r, transcripts: extractGepaTranscripts(r.rec) }))
228
+ .filter((r) => r.transcripts.length > 0);
229
+ }
230
+
231
+ if (pool.length === 0) {
232
+ // Verified upstream shape (darwin 0.8.0): run records are sandbox exec
233
+ // traces, not gepa transcripts. Emit the mechanical trace summary so
234
+ // --diagnose still yields signal.
235
+ const target = losers.length ? losers : records;
236
+ return {
237
+ available: false,
238
+ reason: 'no-gepa-transcripts: run records contain sandbox exec traces ({taskId, exitCode, stdout, stderr}), not gepa {actionRaw, obs} transcripts',
239
+ traceSummary: Object.fromEntries(target.map((r) => [r.id, summarizeTraces(r.rec)])),
240
+ };
241
+ }
242
+
243
+ const gepa = await importGepa();
244
+ if (!gepa || typeof gepa.analyzeTranscript !== 'function') {
245
+ return { available: false, reason: 'metaharness-darwin-gepa-not-available' };
246
+ }
247
+
248
+ const classLabel = (n) => {
249
+ const raw = gepa.FAILURE_CLASSES?.[n];
250
+ return raw ? String(raw).split(' (')[0] : `class-${n}`;
251
+ };
252
+
253
+ const totals = {};
254
+ const variants = [];
255
+ for (const r of pool) {
256
+ const classes = {};
257
+ for (const t of r.transcripts) {
258
+ const analysis = gepa.analyzeTranscript(t.entries);
259
+ const cls = typeof gepa.classifyFailure === 'function'
260
+ ? gepa.classifyFailure({ goldResolved: t.exitCode === 0, analysis })
261
+ : -1;
262
+ const label = classLabel(cls);
263
+ classes[label] = (classes[label] || 0) + 1;
264
+ totals[label] = (totals[label] || 0) + 1;
265
+ }
266
+ const dominantClass = Object.entries(classes).sort((a, b) => b[1] - a[1])[0]?.[0] ?? null;
267
+ variants.push({ id: r.id, transcripts: r.transcripts.length, failureClasses: classes, dominantClass });
268
+ }
269
+
270
+ return { available: true, scope, variants, totals };
271
+ } catch (e) {
272
+ return { available: false, reason: `diagnosis-failed: ${e?.message ?? e}` };
273
+ }
274
+ }
275
+
276
+ // Compute a sensible timeout from the search shape if caller didn't specify.
277
+ // Rough budget: each variant ~= 30s (sandbox test command + safety inspect),
278
+ // total ~= generations × children × per-variant / concurrency.
279
+ function defaultTimeoutMs() {
280
+ const perVariantMs = ARGS.sandbox === 'mock' ? 2_000 : 60_000;
281
+ const variants = ARGS.generations * ARGS.children;
282
+ const parallelism = Math.min(ARGS.concurrency, variants);
283
+ const wall = Math.ceil(variants / parallelism) * perVariantMs;
284
+ // Add 30s overhead for npm install + initial profile + final report.
285
+ return Math.max(60_000, wall + 30_000);
286
+ }
287
+
288
+ async function main() {
289
+ const repoPath = safetyChecks();
290
+
291
+ const plan = {
292
+ binary: 'metaharness-darwin evolve',
293
+ repo: repoPath,
294
+ generations: ARGS.generations,
295
+ children: ARGS.children,
296
+ concurrency: ARGS.concurrency,
297
+ sandbox: ARGS.sandbox,
298
+ selection: ARGS.selection,
299
+ crossover: ARGS.crossover,
300
+ epistasis: ARGS.epistasis,
301
+ curriculum: ARGS.curriculum,
302
+ mutator: ARGS.mutator,
303
+ diagnose: ARGS.diagnose,
304
+ estVariants: ARGS.generations * ARGS.children,
305
+ timeoutMs: ARGS.timeoutMs ?? defaultTimeoutMs(),
306
+ output: `${repoPath}/.metaharness/{archive.json, lineage.json, variants/, runs/, reports/winner.json}`,
307
+ };
308
+
309
+ if (!ARGS.confirm) {
310
+ const payload = {
311
+ success: true,
312
+ data: { plan, dryRun: true, message: 'Pass --confirm to run the evolution.' },
313
+ generatedAt: new Date().toISOString(),
314
+ };
315
+ console.log(JSON.stringify(payload, null, 2));
316
+ process.exit(0);
317
+ }
318
+
319
+ const cliArgs = ['evolve', repoPath,
320
+ '--generations', String(ARGS.generations),
321
+ '--children', String(ARGS.children),
322
+ '--concurrency', String(ARGS.concurrency),
323
+ '--sandbox', ARGS.sandbox,
324
+ '--mutator', ARGS.mutator,
325
+ ];
326
+ if (ARGS.seed != null) cliArgs.push('--seed', String(ARGS.seed));
327
+ if (ARGS.selection) cliArgs.push('--selection', ARGS.selection);
328
+ if (ARGS.crossover) cliArgs.push('--crossover');
329
+ if (ARGS.epistasis) cliArgs.push('--epistasis');
330
+ if (ARGS.curriculum) cliArgs.push('--curriculum');
331
+ if (ARGS.riskBudget != null) cliArgs.push('--risk-budget', String(ARGS.riskBudget));
332
+ if (ARGS.fdr != null) cliArgs.push('--fdr', String(ARGS.fdr));
333
+ if (ARGS.tie) cliArgs.push('--tie', ARGS.tie);
334
+ if (ARGS.bench) cliArgs.push('--bench', ARGS.bench);
335
+ if (ARGS.ruvllmUrl) cliArgs.push('--ruvllm-url', ARGS.ruvllmUrl);
336
+ if (ARGS.ruvllmModel) cliArgs.push('--ruvllm-model', ARGS.ruvllmModel);
337
+
338
+ // Forward progress lines to stderr so the user sees per-generation activity
339
+ // (subprocess-of-an-MCP-tool case: this still surfaces in the agent log).
340
+ const r = await runDarwinAsync(cliArgs, {
341
+ timeoutMs: plan.timeoutMs,
342
+ onProgress: (line) => { if (line.trim()) process.stderr.write(`[evolve] ${line}\n`); },
343
+ });
344
+
345
+ if (r.degraded) {
346
+ emitDarwinDegradedJsonAndExit(r.reason);
347
+ return;
348
+ }
349
+
350
+ // Upstream exit code 99 = safety-disqualified — propagate verbatim so
351
+ // CI gates can distinguish "evolution failed" from "evolution surfaced
352
+ // a safety-tripping mutation". This is a designed-in tripwire, not an
353
+ // error the ruflo layer should remap.
354
+ if (r.exitCode === 99) {
355
+ const payload = {
356
+ success: false,
357
+ data: { safetyDisqualified: true, hint: 'A variant tripped the safety inspection layer. See <repo>/.metaharness/runs/ for which surface and pattern.' },
358
+ stderrTail: r.stderr.slice(-400),
359
+ durationMs: r.durationMs,
360
+ generatedAt: new Date().toISOString(),
361
+ };
362
+ console.log(JSON.stringify(payload, null, 2));
363
+ process.exit(99);
364
+ }
365
+
366
+ if (r.exitCode !== 0) {
367
+ const payload = {
368
+ success: false,
369
+ data: { exitCode: r.exitCode, stderrTail: r.stderr.slice(-400) },
370
+ generatedAt: new Date().toISOString(),
371
+ };
372
+ console.log(JSON.stringify(payload, null, 2));
373
+ process.exit(2);
374
+ }
375
+
376
+ const champion = r.json || {};
377
+ const noImprovement = champion.parentScore != null && champion.championScore != null &&
378
+ champion.championScore <= champion.parentScore;
379
+
380
+ const payload = {
381
+ success: true,
382
+ data: {
383
+ ...champion,
384
+ plan,
385
+ durationMs: r.durationMs,
386
+ improved: !noImprovement,
387
+ },
388
+ generatedAt: new Date().toISOString(),
389
+ };
390
+
391
+ // GEPA failure diagnosis — opt-in, additive, never fails the run.
392
+ if (ARGS.diagnose) {
393
+ payload.data.diagnosis = await buildDiagnosis(repoPath);
394
+ }
395
+
396
+ console.log(JSON.stringify(payload, null, 2));
397
+ if (ARGS.alertOnNoImprovement && noImprovement) process.exit(1);
398
+ process.exit(0);
399
+ }
400
+
401
+ main().catch((e) => {
402
+ console.error(`evolve: unexpected failure: ${e?.message ?? e}`);
403
+ process.exit(2);
404
+ });