claude-code-session-manager 0.97.0 → 0.100.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (430) hide show
  1. package/README.md +3 -3
  2. package/bin/cli.cjs +16 -4
  3. package/bin/node-floor.cjs +41 -0
  4. package/dist/assets/{DataModel-D93FoaOm.js → DataModel-HdR0AxFq.js} +1 -1
  5. package/dist/assets/{History-CXxxqNP1.js → History-Dr4Jr_5z.js} +2 -2
  6. package/dist/assets/{Hooks-CzeYFQjq.js → Hooks-NhrvH3JP.js} +3 -3
  7. package/dist/assets/{Library-D2zPkwOC.js → Library-Dv_EtIMr.js} +1 -1
  8. package/dist/assets/{MarkdownEditor-DbinP78A.js → MarkdownEditor-DTKDWV_n.js} +1 -1
  9. package/dist/assets/{McpServers-Bu_sVGLr.js → McpServers-M034G9B3.js} +2 -2
  10. package/dist/assets/{Memory-BgiI6LZ_.js → Memory-DzF1B4gx.js} +6 -6
  11. package/dist/assets/{Permissions-C1MMzZRm.js → Permissions-DrgbSGWl.js} +3 -3
  12. package/dist/assets/{Plugins-Dhu6wAZi.js → Plugins-Bd3ef35w.js} +2 -2
  13. package/dist/assets/{ProvenanceBadge-C3AcWKMG.js → ProvenanceBadge-DcBHT1Iy.js} +1 -1
  14. package/dist/assets/{SaveBar-plwYm0iO.js → SaveBar-rimJem-Y.js} +1 -1
  15. package/dist/assets/Scheduler-DjgFJl2w.js +16 -0
  16. package/dist/assets/{ScopeSwitcher-DFy0vv_o.js → ScopeSwitcher-CnAzTBrl.js} +1 -1
  17. package/dist/assets/Settings-Dc1F_sSg.js +3 -0
  18. package/dist/assets/{SkillReferenceGraph-DsI7hRPB.js → SkillReferenceGraph-B9aZDecM.js} +1 -1
  19. package/dist/assets/{Skills-3E748UfB.js → Skills-DRXd18gu.js} +2 -2
  20. package/dist/assets/{SystemPrompt-BqmfUJOd.js → SystemPrompt-ahy5-Fwe.js} +1 -1
  21. package/dist/assets/{TagLibrary-CPz6fO8Q.js → TagLibrary-C_tToDeL.js} +1 -1
  22. package/dist/assets/{TiptapBody-D9EoBQ1P.js → TiptapBody-DvdefS6K.js} +1 -1
  23. package/dist/assets/{Toggle-BHAmZNDn.js → Toggle-6Jl5Njc6.js} +1 -1
  24. package/dist/assets/{index-CKH5Uxik.css → index-Bta-hwud.css} +1 -1
  25. package/dist/assets/{index-tn5JIVPj.js → index-vx8O73l8.js} +497 -502
  26. package/dist/assets/{settingsSchema-Crqy_aNz.js → settingsSchema-D6iRguNV.js} +1 -1
  27. package/dist/index.html +2 -2
  28. package/package.json +26 -29
  29. package/plugins/CLAUDE.md +6 -6
  30. package/plugins/session-manager-dev/skills/builder/4-manual/SKILL.md +23 -19
  31. package/plugins/session-manager-dev/skills/builder/SKILL.md +3 -3
  32. package/plugins/session-manager-dev/skills/develop/SKILL.md +254 -510
  33. package/plugins/session-manager-dev/skills/develop/standards.md +17 -22
  34. package/scripts/README.md +3 -11
  35. package/scripts/audit-ops-hygiene.cjs +3 -3
  36. package/scripts/hooks/lib/guard-prd-writes-policy.cjs +1 -1
  37. package/scripts/hooks/lib/guard-self-schedule-policy.cjs +1 -1
  38. package/scripts/mint-epic.cjs +2 -3
  39. package/scripts/scheduler-mcp-server.cjs +36 -7
  40. package/src/main/agentLibrary.cjs +22 -2
  41. package/src/main/build-info.json +4 -4
  42. package/src/main/config.cjs +41 -38
  43. package/src/main/docEdit.cjs +4 -1
  44. package/src/main/files.cjs +2 -5
  45. package/src/main/health.cjs +1 -1
  46. package/src/main/index.cjs +23 -10
  47. package/src/main/ipcSchemas.cjs +28 -35
  48. package/src/main/lib/agentPersonaSchema.cjs +13 -2
  49. package/src/main/lib/atomicFs.cjs +116 -0
  50. package/src/main/lib/branchSweep.cjs +13 -12
  51. package/src/main/lib/buildTarget.cjs +3 -3
  52. package/src/main/lib/claudeCliCaps.cjs +129 -0
  53. package/src/main/lib/credentials.cjs +2 -4
  54. package/src/main/lib/crossProjectFeedback.cjs +3 -3
  55. package/src/main/lib/cwdClassify.cjs +15 -3
  56. package/src/main/lib/definitionOfDone.cjs +207 -125
  57. package/src/main/lib/dodDrainHook.cjs +11 -5
  58. package/src/main/lib/epicMint.cjs +2 -4
  59. package/src/main/lib/epicStatusMirror.cjs +8 -10
  60. package/src/main/lib/epicWorktreeProjectConfig.cjs +2 -4
  61. package/src/main/lib/gateAuthority.cjs +96 -0
  62. package/src/main/lib/gitExec.cjs +69 -0
  63. package/src/main/lib/gitWorktree.cjs +656 -92
  64. package/src/main/lib/instanceLock.cjs +5 -8
  65. package/src/main/lib/launchFailure.cjs +2 -3
  66. package/src/main/lib/macroLibrary.cjs +386 -0
  67. package/src/main/lib/mcpToolCatalog.cjs +26 -17
  68. package/src/main/lib/needsReviewLedger.cjs +1 -1
  69. package/src/main/lib/opsErrorLog.cjs +11 -1
  70. package/src/main/lib/opsOwnership.cjs +0 -5
  71. package/src/main/lib/pidAlive.cjs +32 -0
  72. package/src/main/lib/prdCreate.cjs +153 -19
  73. package/src/main/lib/prdDisposition.cjs +2 -2
  74. package/src/main/lib/prdGateFiles.cjs +284 -0
  75. package/src/main/lib/prdLocations.cjs +61 -0
  76. package/src/main/lib/prdMigration.cjs +2 -3
  77. package/src/main/lib/prdSizing.cjs +2 -1
  78. package/src/main/lib/promptSessionSchema.cjs +10 -2
  79. package/src/main/lib/rcaReport.cjs +4 -6
  80. package/src/main/lib/reaperHelpers.cjs +8 -1
  81. package/src/main/lib/reservationExpiry.cjs +6 -1
  82. package/src/main/lib/reviewNotice.cjs +263 -0
  83. package/src/main/lib/runClaudeP.cjs +4 -1
  84. package/src/main/lib/schedulerPaths.cjs +22 -2
  85. package/src/main/lib/sessionSlots.cjs +2 -4
  86. package/src/main/lib/shippedPersonaSeeds.cjs +179 -0
  87. package/src/main/lib/timeoutShim.cjs +123 -0
  88. package/src/main/lib/timeoutShimScript.cjs +275 -0
  89. package/src/main/lib/upgradeDrain.cjs +4 -10
  90. package/src/main/lib/watchdogHelpers.cjs +33 -30
  91. package/src/main/lib/workTypeLibrary.cjs +7 -1
  92. package/src/main/promptSessionEvents.cjs +37 -13
  93. package/src/main/queueOps.cjs +17 -6
  94. package/src/main/scheduler.cjs +975 -203
  95. package/src/main/seedAgentPersonas.cjs +278 -23
  96. package/src/main/supervisor.cjs +4 -1
  97. package/src/main/templates/PRD_AUTHORING.md +126 -406
  98. package/src/preload/__tests__/preload-surface.test.cjs +68 -0
  99. package/src/preload/api.d.ts +41 -94
  100. package/src/preload/index.cjs +14 -9
  101. package/src/seed/agents/architect.md +1 -0
  102. package/src/seed/agents/dev-lead.md +17 -18
  103. package/src/seed/agents/project-home-builder.md +1 -0
  104. package/src/seed/agents/validator.md +10 -4
  105. package/dist/assets/HostBilko-nESrTRIg.js +0 -1
  106. package/dist/assets/Scheduler-BVYTeh39.js +0 -16
  107. package/dist/assets/Settings-DIhGgdfs.js +0 -3
  108. package/src/main/__tests__/activeIndexMerge.test.cjs +0 -235
  109. package/src/main/__tests__/agentEffortResolve.test.cjs +0 -117
  110. package/src/main/__tests__/agentLibrary.test.cjs +0 -276
  111. package/src/main/__tests__/agentModelResolve.test.cjs +0 -311
  112. package/src/main/__tests__/agentOverlayWrite.test.cjs +0 -95
  113. package/src/main/__tests__/bilkoHost-deriveSlug.test.cjs +0 -26
  114. package/src/main/__tests__/bilkoHost-integration.test.cjs +0 -118
  115. package/src/main/__tests__/bilkoHostCore.test.cjs +0 -72
  116. package/src/main/__tests__/broadcastCoalescer.test.cjs +0 -122
  117. package/src/main/__tests__/chat-cancel-terminal.test.cjs +0 -120
  118. package/src/main/__tests__/chat-dead-channels.test.cjs +0 -63
  119. package/src/main/__tests__/chat-exit-close-race.test.cjs +0 -146
  120. package/src/main/__tests__/chat-mcp-consent-notice.test.cjs +0 -139
  121. package/src/main/__tests__/chat-preamble-anchors.test.cjs +0 -100
  122. package/src/main/__tests__/chat-queue.test.cjs +0 -97
  123. package/src/main/__tests__/chat-stop-signal.test.cjs +0 -89
  124. package/src/main/__tests__/chatRunner-epic-worktree-execcwd.test.cjs +0 -125
  125. package/src/main/__tests__/chatRunner-session-flag-retry.test.cjs +0 -252
  126. package/src/main/__tests__/classifyPromptTicket.test.cjs +0 -101
  127. package/src/main/__tests__/classifyTranscriptLine.test.cjs +0 -201
  128. package/src/main/__tests__/computeDepHistorySatisfaction.test.cjs +0 -66
  129. package/src/main/__tests__/config-readText-bounded.test.cjs +0 -84
  130. package/src/main/__tests__/configWriteBoundaryOwners.test.cjs +0 -59
  131. package/src/main/__tests__/crossProjectFeedback.test.cjs +0 -334
  132. package/src/main/__tests__/crossProjectFeedbackRoutes.test.cjs +0 -161
  133. package/src/main/__tests__/dep-orphan-archive-health.test.cjs +0 -77
  134. package/src/main/__tests__/develop-skill-failure-modes.test.cjs +0 -70
  135. package/src/main/__tests__/docEdit.test.cjs +0 -244
  136. package/src/main/__tests__/dod-batchkey.test.cjs +0 -183
  137. package/src/main/__tests__/dod-drain-hook.test.cjs +0 -302
  138. package/src/main/__tests__/dod-report.test.cjs +0 -304
  139. package/src/main/__tests__/dod-reverify.test.cjs +0 -285
  140. package/src/main/__tests__/epicContextDigest.test.cjs +0 -174
  141. package/src/main/__tests__/epicMint.test.cjs +0 -332
  142. package/src/main/__tests__/epicMintTelemetryTap.test.cjs +0 -64
  143. package/src/main/__tests__/epicStatusMirror.test.cjs +0 -110
  144. package/src/main/__tests__/epicValidationHook.test.cjs +0 -291
  145. package/src/main/__tests__/exchanges.test.cjs +0 -122
  146. package/src/main/__tests__/exchangesPromptId.test.cjs +0 -61
  147. package/src/main/__tests__/extractJson.test.cjs +0 -51
  148. package/src/main/__tests__/files-reject-credentials.test.cjs +0 -40
  149. package/src/main/__tests__/fixtures/1218-fo-01-move-scripts-lib-into-src-main-lib.log +0 -556
  150. package/src/main/__tests__/flatPrdTickSweep.test.cjs +0 -110
  151. package/src/main/__tests__/health-build-freshness.test.cjs +0 -39
  152. package/src/main/__tests__/health-claude-md-budget.test.cjs +0 -57
  153. package/src/main/__tests__/health-credentials.test.cjs +0 -81
  154. package/src/main/__tests__/health-delegation-chain.test.cjs +0 -124
  155. package/src/main/__tests__/health-per-project-stall.test.cjs +0 -84
  156. package/src/main/__tests__/health-prd-migration.test.cjs +0 -37
  157. package/src/main/__tests__/health-queue-dispatch.test.cjs +0 -135
  158. package/src/main/__tests__/health-starve-escalation.test.cjs +0 -94
  159. package/src/main/__tests__/health-tick-liveness.test.cjs +0 -179
  160. package/src/main/__tests__/health-usage-poller.test.cjs +0 -144
  161. package/src/main/__tests__/health-worktree-cap-blocked.test.cjs +0 -65
  162. package/src/main/__tests__/heapSnapshot.test.cjs +0 -121
  163. package/src/main/__tests__/historyAggregatorIntraday.test.cjs +0 -313
  164. package/src/main/__tests__/historyDashboard.test.cjs +0 -163
  165. package/src/main/__tests__/historyRollup.test.cjs +0 -333
  166. package/src/main/__tests__/intradayRefresh.test.cjs +0 -39
  167. package/src/main/__tests__/ipcSchemas-dependsOn.test.cjs +0 -39
  168. package/src/main/__tests__/kg-augment.test.cjs +0 -195
  169. package/src/main/__tests__/loadGateDetailTick.test.cjs +0 -31
  170. package/src/main/__tests__/machineProfile.test.cjs +0 -152
  171. package/src/main/__tests__/mcpStatus.test.cjs +0 -61
  172. package/src/main/__tests__/memoryAggregate.test.cjs +0 -109
  173. package/src/main/__tests__/memoryStale.test.cjs +0 -88
  174. package/src/main/__tests__/needsReviewLedger.test.cjs +0 -162
  175. package/src/main/__tests__/openExternalApp-spawn-error.test.cjs +0 -25
  176. package/src/main/__tests__/opsErrorLog.test.cjs +0 -109
  177. package/src/main/__tests__/opsErrorLogTelemetryTap.test.cjs +0 -173
  178. package/src/main/__tests__/personaMerge.test.cjs +0 -169
  179. package/src/main/__tests__/planValidator.test.cjs +0 -125
  180. package/src/main/__tests__/pollLoop-dispatch-on-failure.test.cjs +0 -176
  181. package/src/main/__tests__/prd-group-allocator.test.cjs +0 -119
  182. package/src/main/__tests__/prdAdminRouteParity.test.cjs +0 -70
  183. package/src/main/__tests__/prdAdminRoutes.test.cjs +0 -718
  184. package/src/main/__tests__/prdAgentType.test.cjs +0 -103
  185. package/src/main/__tests__/prdAuthoringSeed.test.cjs +0 -39
  186. package/src/main/__tests__/prdCreate.test.cjs +0 -979
  187. package/src/main/__tests__/prdCreateDisposition.test.cjs +0 -201
  188. package/src/main/__tests__/prdCreatePlanId.test.cjs +0 -132
  189. package/src/main/__tests__/prdFrontmatterAgentType.test.cjs +0 -117
  190. package/src/main/__tests__/prdFrontmatterDependsOn.test.cjs +0 -136
  191. package/src/main/__tests__/prdFrontmatterDisposition.test.cjs +0 -125
  192. package/src/main/__tests__/prdFrontmatterQuietMachine.test.cjs +0 -108
  193. package/src/main/__tests__/prdLocations.test.cjs +0 -195
  194. package/src/main/__tests__/prdLocationsArchived.test.cjs +0 -201
  195. package/src/main/__tests__/prdMigration.test.cjs +0 -349
  196. package/src/main/__tests__/prdMigrationLegacyAdopt.test.cjs +0 -91
  197. package/src/main/__tests__/prdParserHighWater.test.cjs +0 -74
  198. package/src/main/__tests__/prdParserSourcePromptId.test.cjs +0 -65
  199. package/src/main/__tests__/prdSetDisposition.test.cjs +0 -222
  200. package/src/main/__tests__/prdSizing.test.cjs +0 -106
  201. package/src/main/__tests__/prdSourcePromptIdBackfill.test.cjs +0 -118
  202. package/src/main/__tests__/prdUpdateDependsOn.test.cjs +0 -160
  203. package/src/main/__tests__/proc-role-env.test.cjs +0 -125
  204. package/src/main/__tests__/procname-claude-spawn-sites.test.cjs +0 -304
  205. package/src/main/__tests__/procname-sm-processes.test.cjs +0 -127
  206. package/src/main/__tests__/projectHomeAdminRoutes.test.cjs +0 -177
  207. package/src/main/__tests__/projectPages.test.cjs +0 -137
  208. package/src/main/__tests__/promptSessionEvents.test.cjs +0 -234
  209. package/src/main/__tests__/promptSessionSchema.test.cjs +0 -101
  210. package/src/main/__tests__/promptSessionTranscript.test.cjs +0 -0
  211. package/src/main/__tests__/promptSessionsCreateEpicHandler.test.cjs +0 -159
  212. package/src/main/__tests__/pty-epic-worktree-spawn-cwd.test.cjs +0 -282
  213. package/src/main/__tests__/pty-session-open-telemetry.test.cjs +0 -96
  214. package/src/main/__tests__/pty-write-result.test.cjs +0 -46
  215. package/src/main/__tests__/queue-health-verdict.test.cjs +0 -170
  216. package/src/main/__tests__/queue-starvation-dispatch-driver.test.cjs +0 -286
  217. package/src/main/__tests__/queue-starvation-per-project.test.cjs +0 -147
  218. package/src/main/__tests__/queueHistory.test.cjs +0 -355
  219. package/src/main/__tests__/queueOps-interactive-ac-lint.test.cjs +0 -65
  220. package/src/main/__tests__/queueOpsArchiveDestination.test.cjs +0 -65
  221. package/src/main/__tests__/queueOpsAutoArchive.test.cjs +0 -154
  222. package/src/main/__tests__/rateLimitPollerStreak.test.cjs +0 -128
  223. package/src/main/__tests__/rcaReport.test.cjs +0 -266
  224. package/src/main/__tests__/reconcileFlatPrdSweep.test.cjs +0 -119
  225. package/src/main/__tests__/reconcileTiming.test.cjs +0 -135
  226. package/src/main/__tests__/runLogRetention.test.cjs +0 -489
  227. package/src/main/__tests__/runVerify-atomic-verdicts.test.cjs +0 -26
  228. package/src/main/__tests__/runVerify-blocked-by-foreign-wip.test.cjs +0 -58
  229. package/src/main/__tests__/runVerify-landed-commit-outranks.test.cjs +0 -191
  230. package/src/main/__tests__/runVerify-policy-denial.test.cjs +0 -89
  231. package/src/main/__tests__/runVerify-transcript-commit-evidence.test.cjs +0 -225
  232. package/src/main/__tests__/runVerify.test.cjs +0 -1784
  233. package/src/main/__tests__/scheduleJobSchema.test.cjs +0 -127
  234. package/src/main/__tests__/scheduleJobStatusDrift.test.cjs +0 -65
  235. package/src/main/__tests__/scheduleJobTransitions.test.cjs +0 -277
  236. package/src/main/__tests__/scheduleJobTransitionsGrep.test.cjs +0 -59
  237. package/src/main/__tests__/scheduleJobTransitionsTelemetryTap.test.cjs +0 -72
  238. package/src/main/__tests__/scheduler-admin-routes.test.cjs +0 -199
  239. package/src/main/__tests__/scheduler-adopted-run-supervision.test.cjs +0 -143
  240. package/src/main/__tests__/scheduler-already-satisfied-on-main.test.cjs +0 -105
  241. package/src/main/__tests__/scheduler-archive-completed-prd.test.cjs +0 -102
  242. package/src/main/__tests__/scheduler-archived-twin-guard.test.cjs +0 -155
  243. package/src/main/__tests__/scheduler-autofix-outcome.test.cjs +0 -188
  244. package/src/main/__tests__/scheduler-autofix-select.test.cjs +0 -439
  245. package/src/main/__tests__/scheduler-autopromote.test.cjs +0 -51
  246. package/src/main/__tests__/scheduler-bash-timeout-env.test.cjs +0 -101
  247. package/src/main/__tests__/scheduler-blocked-by-foreign-wip.test.cjs +0 -107
  248. package/src/main/__tests__/scheduler-boot-orphans.test.cjs +0 -153
  249. package/src/main/__tests__/scheduler-broadcast-reconcile.test.cjs +0 -121
  250. package/src/main/__tests__/scheduler-clear-queue-history.test.cjs +0 -134
  251. package/src/main/__tests__/scheduler-commit-guard-noop.test.cjs +0 -244
  252. package/src/main/__tests__/scheduler-committed-in-window.test.cjs +0 -182
  253. package/src/main/__tests__/scheduler-cross-project-batch.test.cjs +0 -43
  254. package/src/main/__tests__/scheduler-default-eligible-heal.test.cjs +0 -168
  255. package/src/main/__tests__/scheduler-dispatch-loop.test.cjs +0 -58
  256. package/src/main/__tests__/scheduler-effective-concurrency.test.cjs +0 -81
  257. package/src/main/__tests__/scheduler-epic-digest.test.cjs +0 -227
  258. package/src/main/__tests__/scheduler-failed-autoreset.test.cjs +0 -121
  259. package/src/main/__tests__/scheduler-finalize-dispatch-guards.test.cjs +0 -229
  260. package/src/main/__tests__/scheduler-find-prd-dir.test.cjs +0 -75
  261. package/src/main/__tests__/scheduler-fix-plan-path.test.cjs +0 -119
  262. package/src/main/__tests__/scheduler-force-tick-outcome.test.cjs +0 -46
  263. package/src/main/__tests__/scheduler-foreign-wip-manifest.test.cjs +0 -78
  264. package/src/main/__tests__/scheduler-gate-shadow.test.cjs +0 -119
  265. package/src/main/__tests__/scheduler-guard-verdict-autoresolve.test.cjs +0 -390
  266. package/src/main/__tests__/scheduler-heal-refusal.test.cjs +0 -61
  267. package/src/main/__tests__/scheduler-heartbeat-payload.test.cjs +0 -80
  268. package/src/main/__tests__/scheduler-inplace-salvage.test.cjs +0 -323
  269. package/src/main/__tests__/scheduler-integration-failure-stamp.test.cjs +0 -41
  270. package/src/main/__tests__/scheduler-investigation-clean-skip.test.cjs +0 -63
  271. package/src/main/__tests__/scheduler-investigation-prompt.test.cjs +0 -123
  272. package/src/main/__tests__/scheduler-job-budget.test.cjs +0 -172
  273. package/src/main/__tests__/scheduler-job-overrun.test.cjs +0 -175
  274. package/src/main/__tests__/scheduler-launch-failure.test.cjs +0 -199
  275. package/src/main/__tests__/scheduler-leftover-fields.test.cjs +0 -52
  276. package/src/main/__tests__/scheduler-leftover-quarantine.test.cjs +0 -199
  277. package/src/main/__tests__/scheduler-looks-done.test.cjs +0 -537
  278. package/src/main/__tests__/scheduler-manual-pause.test.cjs +0 -118
  279. package/src/main/__tests__/scheduler-mechanical-recovery.test.cjs +0 -245
  280. package/src/main/__tests__/scheduler-meta-code-sha.test.cjs +0 -46
  281. package/src/main/__tests__/scheduler-needs-review-autoresolve.test.cjs +0 -197
  282. package/src/main/__tests__/scheduler-never-stop.test.cjs +0 -157
  283. package/src/main/__tests__/scheduler-no-dead-end-status.test.cjs +0 -152
  284. package/src/main/__tests__/scheduler-no-orphan-run-dir.test.cjs +0 -81
  285. package/src/main/__tests__/scheduler-notify-originating-tab-transcript.test.cjs +0 -87
  286. package/src/main/__tests__/scheduler-notify-originating-tab.test.cjs +0 -343
  287. package/src/main/__tests__/scheduler-periodic-reverify-guard.test.cjs +0 -217
  288. package/src/main/__tests__/scheduler-porcelain-rename.test.cjs +0 -164
  289. package/src/main/__tests__/scheduler-prd-missing-skip.test.cjs +0 -161
  290. package/src/main/__tests__/scheduler-prd-persona-spawn.test.cjs +0 -178
  291. package/src/main/__tests__/scheduler-quarantine-autoresolve.test.cjs +0 -165
  292. package/src/main/__tests__/scheduler-quiet-machine-lease.test.cjs +0 -257
  293. package/src/main/__tests__/scheduler-rate-limit-cooldown-freshness.test.cjs +0 -123
  294. package/src/main/__tests__/scheduler-rate-limit-pause.test.cjs +0 -152
  295. package/src/main/__tests__/scheduler-rate-limit-spin-guard.test.cjs +0 -156
  296. package/src/main/__tests__/scheduler-reap-dead-running-jobs.test.cjs +0 -754
  297. package/src/main/__tests__/scheduler-reaper-helpers-basics.test.cjs +0 -87
  298. package/src/main/__tests__/scheduler-reconcile-cwd-preserve.test.cjs +0 -100
  299. package/src/main/__tests__/scheduler-reconcile-history-backfill.test.cjs +0 -105
  300. package/src/main/__tests__/scheduler-reconcile-invalid-repair.test.cjs +0 -203
  301. package/src/main/__tests__/scheduler-reconcile-quarantine.test.cjs +0 -247
  302. package/src/main/__tests__/scheduler-reset-job-fields-guard.test.cjs +0 -77
  303. package/src/main/__tests__/scheduler-resume-recovery.test.cjs +0 -254
  304. package/src/main/__tests__/scheduler-shard-quarantine.test.cjs +0 -115
  305. package/src/main/__tests__/scheduler-shared-tree-guard.test.cjs +0 -380
  306. package/src/main/__tests__/scheduler-sigterm-commit.test.cjs +0 -43
  307. package/src/main/__tests__/scheduler-stall-per-project.test.cjs +0 -126
  308. package/src/main/__tests__/scheduler-starve-escalation.test.cjs +0 -154
  309. package/src/main/__tests__/scheduler-stranded-autofix-park.test.cjs +0 -252
  310. package/src/main/__tests__/scheduler-stranded-investigation.test.cjs +0 -185
  311. package/src/main/__tests__/scheduler-stuck-failed-escalation.test.cjs +0 -136
  312. package/src/main/__tests__/scheduler-supervisor-record.test.cjs +0 -81
  313. package/src/main/__tests__/scheduler-tick-cancel-token.test.cjs +0 -54
  314. package/src/main/__tests__/scheduler-tick-wedge.test.cjs +0 -172
  315. package/src/main/__tests__/scheduler-transient-failure.test.cjs +0 -141
  316. package/src/main/__tests__/scheduler-unreadable-queue-guard.test.cjs +0 -62
  317. package/src/main/__tests__/scheduler-utilization-hold.test.cjs +0 -89
  318. package/src/main/__tests__/scheduler-verify-prd-path.test.cjs +0 -109
  319. package/src/main/__tests__/scheduler-worktree-cap-defer.test.cjs +0 -234
  320. package/src/main/__tests__/scheduler-worktree-exec-cwd.test.cjs +0 -120
  321. package/src/main/__tests__/scheduler-writeprd-epic-rollback.test.cjs +0 -105
  322. package/src/main/__tests__/schedulerBatchRootBlocker.test.cjs +0 -117
  323. package/src/main/__tests__/schedulerStateSidecarRestore.test.cjs +0 -110
  324. package/src/main/__tests__/seedAgentPersonas.test.cjs +0 -184
  325. package/src/main/__tests__/seedSchedulerMcp.test.cjs +0 -211
  326. package/src/main/__tests__/seedStatus.test.cjs +0 -100
  327. package/src/main/__tests__/seedValidatorPersona.test.cjs +0 -116
  328. package/src/main/__tests__/stop-signal-anchor.test.cjs +0 -75
  329. package/src/main/__tests__/telemetryClient.test.cjs +0 -1055
  330. package/src/main/__tests__/telemetryContract.test.cjs +0 -930
  331. package/src/main/__tests__/telemetrySettings.test.cjs +0 -210
  332. package/src/main/__tests__/transcripts-batch-flush.test.cjs +0 -249
  333. package/src/main/__tests__/transcripts-doFlush-array.test.cjs +0 -124
  334. package/src/main/__tests__/transcripts-paged-reads.test.cjs +0 -241
  335. package/src/main/__tests__/transcripts-worktree-epic-path.test.cjs +0 -154
  336. package/src/main/__tests__/transcriptsUsageFor.test.cjs +0 -206
  337. package/src/main/__tests__/uniquePrdNumbers.test.cjs +0 -153
  338. package/src/main/__tests__/usageSingleFlight.test.cjs +0 -169
  339. package/src/main/__tests__/validationSentinels.test.cjs +0 -84
  340. package/src/main/__tests__/workTypeLibrary.test.cjs +0 -89
  341. package/src/main/bilkoHost.cjs +0 -314
  342. package/src/main/bilkoHostCore.cjs +0 -89
  343. package/src/main/lib/__tests__/active-sessions.test.cjs +0 -251
  344. package/src/main/lib/__tests__/activeIndexRebuild.test.cjs +0 -179
  345. package/src/main/lib/__tests__/agentPersonaSchema.test.cjs +0 -67
  346. package/src/main/lib/__tests__/auditLog.test.cjs +0 -38
  347. package/src/main/lib/__tests__/bootSelfHeal.test.cjs +0 -107
  348. package/src/main/lib/__tests__/branchSweep.test.cjs +0 -164
  349. package/src/main/lib/__tests__/buildIdentity.test.cjs +0 -121
  350. package/src/main/lib/__tests__/buildTarget.test.cjs +0 -52
  351. package/src/main/lib/__tests__/childWithLog.test.cjs +0 -321
  352. package/src/main/lib/__tests__/coldBootPromptSessionsWrite.test.cjs +0 -87
  353. package/src/main/lib/__tests__/crashTelemetry.test.cjs +0 -103
  354. package/src/main/lib/__tests__/credentials-futile-refresh.test.cjs +0 -115
  355. package/src/main/lib/__tests__/cwdClassify.test.cjs +0 -111
  356. package/src/main/lib/__tests__/definitionOfDoneSequence.test.cjs +0 -95
  357. package/src/main/lib/__tests__/delegationReadiness.test.cjs +0 -1175
  358. package/src/main/lib/__tests__/dispatchLoop.test.cjs +0 -63
  359. package/src/main/lib/__tests__/effectiveModelInfo.test.cjs +0 -244
  360. package/src/main/lib/__tests__/ephemeralCwd.test.cjs +0 -91
  361. package/src/main/lib/__tests__/epicDelegationStats.test.cjs +0 -137
  362. package/src/main/lib/__tests__/epicSpawnCwd.test.cjs +0 -283
  363. package/src/main/lib/__tests__/epicSpawnPlan.test.cjs +0 -196
  364. package/src/main/lib/__tests__/epicTranscriptPath.test.cjs +0 -163
  365. package/src/main/lib/__tests__/epicWorktreeBoot.test.cjs +0 -136
  366. package/src/main/lib/__tests__/epicWorktreeMerge.test.cjs +0 -130
  367. package/src/main/lib/__tests__/epicWorktreeMint.test.cjs +0 -117
  368. package/src/main/lib/__tests__/epicWorktreeProjectConfig.test.cjs +0 -137
  369. package/src/main/lib/__tests__/fixChainDepth.test.cjs +0 -40
  370. package/src/main/lib/__tests__/fixtures/204-mercury-steam-horse.log.txt +0 -13
  371. package/src/main/lib/__tests__/fixtures/scheduler-machine.json.corrupt-1789147548 +0 -34
  372. package/src/main/lib/__tests__/gateFixtures.json +0 -20
  373. package/src/main/lib/__tests__/gitCacheBound.test.cjs +0 -69
  374. package/src/main/lib/__tests__/gitWorktree.test.cjs +0 -1478
  375. package/src/main/lib/__tests__/gitWorktreeSalvage.test.cjs +0 -107
  376. package/src/main/lib/__tests__/gitWorktreeSalvageDelta.test.cjs +0 -153
  377. package/src/main/lib/__tests__/guardShims.test.cjs +0 -158
  378. package/src/main/lib/__tests__/importReferences.spec.cjs +0 -56
  379. package/src/main/lib/__tests__/instanceLock.test.cjs +0 -173
  380. package/src/main/lib/__tests__/jobSupervisorRecord.test.cjs +0 -78
  381. package/src/main/lib/__tests__/jobWorktree.test.cjs +0 -199
  382. package/src/main/lib/__tests__/jobWorktreeBootLive.test.cjs +0 -82
  383. package/src/main/lib/__tests__/landedSinceRun.test.cjs +0 -133
  384. package/src/main/lib/__tests__/launchFailure.test.cjs +0 -220
  385. package/src/main/lib/__tests__/loadGate.test.cjs +0 -303
  386. package/src/main/lib/__tests__/localAdminHttp.test.cjs +0 -214
  387. package/src/main/lib/__tests__/loopDelay.test.cjs +0 -68
  388. package/src/main/lib/__tests__/mcpToolCatalog.test.cjs +0 -107
  389. package/src/main/lib/__tests__/modelCatalog.test.cjs +0 -202
  390. package/src/main/lib/__tests__/opsOwnership.test.cjs +0 -113
  391. package/src/main/lib/__tests__/opsRootAbsoluteCwd.test.cjs +0 -328
  392. package/src/main/lib/__tests__/opsRootNestedWrite.test.cjs +0 -51
  393. package/src/main/lib/__tests__/opsRootResolve.test.cjs +0 -149
  394. package/src/main/lib/__tests__/prdDeclaredPaths.test.cjs +0 -82
  395. package/src/main/lib/__tests__/prdDisposition.test.cjs +0 -224
  396. package/src/main/lib/__tests__/procIdentity.test.cjs +0 -119
  397. package/src/main/lib/__tests__/procName.test.cjs +0 -92
  398. package/src/main/lib/__tests__/projectBriefCore.test.cjs +0 -216
  399. package/src/main/lib/__tests__/projectRootResolve.test.cjs +0 -148
  400. package/src/main/lib/__tests__/queueHealth.test.cjs +0 -58
  401. package/src/main/lib/__tests__/queueStoreAtomicWrite.test.cjs +0 -88
  402. package/src/main/lib/__tests__/queueStoreMachineStateRecovery.test.cjs +0 -190
  403. package/src/main/lib/__tests__/quietMachineLease.test.cjs +0 -39
  404. package/src/main/lib/__tests__/rateLimitWindow.test.cjs +0 -88
  405. package/src/main/lib/__tests__/reaperHelpers.test.cjs +0 -577
  406. package/src/main/lib/__tests__/schedulerBatchDepends.test.cjs +0 -312
  407. package/src/main/lib/__tests__/schedulerBatchFairness.test.cjs +0 -213
  408. package/src/main/lib/__tests__/schedulerBatchLaunchHold.test.cjs +0 -125
  409. package/src/main/lib/__tests__/schedulerBatchProjectCap.test.cjs +0 -127
  410. package/src/main/lib/__tests__/schedulerBatchQuietMachine.test.cjs +0 -109
  411. package/src/main/lib/__tests__/schedulerMcpServerHeadlessRefusal.test.cjs +0 -71
  412. package/src/main/lib/__tests__/schedulerMcpServerHelp.test.cjs +0 -216
  413. package/src/main/lib/__tests__/schedulerMcpServerProjectHome.test.cjs +0 -183
  414. package/src/main/lib/__tests__/schedulerPaths.test.cjs +0 -226
  415. package/src/main/lib/__tests__/schedulerPathsWorktree.test.cjs +0 -133
  416. package/src/main/lib/__tests__/schedulerRuntimeState.test.cjs +0 -56
  417. package/src/main/lib/__tests__/sessionSlots.test.cjs +0 -144
  418. package/src/main/lib/__tests__/telemetryBacklog.test.cjs +0 -626
  419. package/src/main/lib/__tests__/telemetryBoot.test.cjs +0 -134
  420. package/src/main/lib/__tests__/telemetryConsent.test.cjs +0 -136
  421. package/src/main/lib/__tests__/telemetryCounters.test.cjs +0 -57
  422. package/src/main/lib/__tests__/telemetryCountersMetadataColumn.test.cjs +0 -98
  423. package/src/main/lib/__tests__/terminalRunOutcome.test.cjs +0 -200
  424. package/src/main/lib/__tests__/toolUseClassify.test.cjs +0 -53
  425. package/src/main/lib/__tests__/updateCheck.test.cjs +0 -63
  426. package/src/main/lib/__tests__/upgradeDrain.test.cjs +0 -130
  427. package/src/main/lib/__tests__/usageCircuit.test.cjs +0 -354
  428. package/src/main/lib/__tests__/watchdog-helpers.test.cjs +0 -375
  429. package/src/main/lib/__tests__/watchdog-relaunch.test.cjs +0 -266
  430. package/src/main/lib/kgExchangePairing.cjs +0 -75
@@ -1,1784 +0,0 @@
1
- /**
2
- * runVerify.test.cjs — unit tests for the post-run reconciliation verifier.
3
- *
4
- * Run standalone: timeout 180 npx vitest run src/main/__tests__/runVerify.test.cjs
5
- *
6
- * Three fixture scenarios (matching the 2026-05-23→24 incident window):
7
- *
8
- * 1. Case 1 (false-PASS): M2 acceptance script prints test failures + Traceback,
9
- * then echoes "M2 acceptance: PASS". Scheduler used to stamp 'completed'.
10
- * Expected: transcript_errors → needs_review
11
- *
12
- * 2. Case 2 (HALT): M7 agent correctly halts because M1 soak is unmet.
13
- * Expected: halt → pending, reason embeds soak floor date
14
- *
15
- * 3. Case 3 (deps_unmet): PRD 56 has an unsatisfied dependsOn entry.
16
- * Expected: deps_unmet → pending
17
- *
18
- * 4. Truly clean: all tests pass, no error markers.
19
- * Expected: clean → null (caller may stamp 'completed')
20
- */
21
-
22
- import { test, beforeAll, afterAll, vi } from 'vitest';
23
- const assert = require('node:assert/strict');
24
- const os = require('node:os');
25
- const fs = require('node:fs');
26
- const path = require('node:path');
27
- const { execFileSync } = require('node:child_process');
28
- const { verifyRun, parseLog } = require('../runVerify.cjs');
29
-
30
- // The verdicts sidecar goes through config.writeJsonSync, whose write allow-list
31
- // rejects os.tmpdir() fixtures. Route it to a plain write for these fixtures.
32
- let writeSpy;
33
- beforeAll(() => {
34
- writeSpy = vi.spyOn(require('../config.cjs'), 'writeJsonSync').mockImplementation((abs, data) => {
35
- fs.writeFileSync(abs, JSON.stringify(data, null, 2) + '\n');
36
- return { ok: true, mtimeMs: 0 };
37
- });
38
- });
39
- afterAll(() => writeSpy.mockRestore());
40
-
41
- // ─── helpers ──────────────────────────────────────────────────────────────────
42
-
43
- /** Create a temp directory that is cleaned up after the test. */
44
- function makeTmpDir() {
45
- return fs.mkdtempSync(path.join(os.tmpdir(), 'run-verify-test-'));
46
- }
47
-
48
- function rmdir(dir) {
49
- try { fs.rmSync(dir, { recursive: true, force: true }); } catch { /* */ }
50
- }
51
-
52
- /**
53
- * Build a minimal stream-JSON log file.
54
- * `events` is an array of raw JSON objects to serialise one-per-line.
55
- * A "[scheduler] starting..." prefix line is also prepended (must be skipped).
56
- */
57
- function writeLog(dir, slug, events) {
58
- const lines = ['[scheduler] starting ' + slug + ' at 2026-05-24T00:00:00.000Z'];
59
- for (const ev of events) lines.push(JSON.stringify(ev));
60
- lines.push('[scheduler] exit code=0 (raw code=0 signal=null) duration=47s');
61
- fs.writeFileSync(path.join(dir, `${slug}.log`), lines.join('\n') + '\n');
62
- }
63
-
64
- /** Write a minimal PRD .md file with frontmatter + body. */
65
- function writePrd(dir, slug, body) {
66
- const text = `---\ntitle: Test PRD\ncwd: /tmp\nestimateMinutes: 30\n---\n${body}\n`;
67
- fs.writeFileSync(path.join(dir, `${slug}.md`), text);
68
- return path.join(dir, `${slug}.md`);
69
- }
70
-
71
- // ─── fixture: Case 1 — false-PASS (M2 acceptance) ─────────────────────────
72
-
73
- test('Case 1: false-PASS (Traceback + echo PASS) → transcript_errors/needs_review', async () => {
74
- const tmp = makeTmpDir();
75
- try {
76
- const slug = '39-signal-builder-m2-sentiment-stack';
77
- const logEvents = [
78
- // Assistant turn: run acceptance script
79
- {
80
- type: 'assistant',
81
- message: {
82
- role: 'assistant',
83
- content: [{
84
- type: 'tool_use',
85
- id: 'toolu_m2_001',
86
- name: 'Bash',
87
- input: {
88
- command: 'bash check_m2.sh',
89
- description: 'Run M2 acceptance checks',
90
- },
91
- }],
92
- },
93
- },
94
- // Tool result: test failures then echo PASS (the false-positive pattern)
95
- {
96
- type: 'user',
97
- message: {
98
- role: 'user',
99
- content: [{
100
- type: 'tool_result',
101
- tool_use_id: 'toolu_m2_001',
102
- content: [
103
- '=== Signal-builder side ===',
104
- 'ERROR tests/test_news_signals_panel.py',
105
- '!!!!!!!! stopping after 1 failures !!!!!!!!',
106
- '1 error in 0.03s',
107
- 'SB: 0',
108
- '=== Sanity: SB sentiment_cache.db rows ===',
109
- 'rows: 0',
110
- '=== contract.json panels.sentiment ===',
111
- 'Traceback (most recent call last):',
112
- ' File "<string>", line 1, in <module>',
113
- "KeyError: 'panels.sentiment'",
114
- 'M2 acceptance: PASS',
115
- ].join('\n'),
116
- is_error: false,
117
- }],
118
- },
119
- },
120
- // Result: agent declares success
121
- {
122
- type: 'result',
123
- subtype: 'success',
124
- result: 'M2 acceptance criteria verified. All checks passed.',
125
- },
126
- ];
127
-
128
- writeLog(tmp, slug, logEvents);
129
- const prdPath = writePrd(tmp, slug, '# M2 Sentiment Stack\n\nBuild the sentiment pipeline.');
130
-
131
- const verdict = await verifyRun({
132
- runDir: tmp,
133
- prdPath,
134
- queueEntry: { slug, status: 'running' },
135
- allJobs: [],
136
- });
137
-
138
- assert.equal(verdict.verdict, 'transcript_errors', `expected transcript_errors, got ${verdict.verdict}: ${verdict.reason}`);
139
- assert.equal(verdict.downgradeTo, 'needs_review');
140
- assert.ok(verdict.reason.length > 0, 'reason should be non-empty');
141
-
142
- // verdicts.json sidecar should have been written
143
- const sidecar = JSON.parse(fs.readFileSync(path.join(tmp, `${slug}.verdicts.json`), 'utf8'));
144
- assert.equal(sidecar.schemaVersion, 1);
145
- assert.equal(sidecar.verdict, 'transcript_errors');
146
- } finally {
147
- rmdir(tmp);
148
- }
149
- });
150
-
151
- // ─── fixture: Case 2 — HALT (M7 soak unmet) ──────────────────────────────────
152
-
153
- test('Case 2: HALT in result event → halt/pending with floor date in reason', async () => {
154
- const tmp = makeTmpDir();
155
- try {
156
- const slug = '44-signal-builder-m7-final-cutover';
157
- const haltMsg = [
158
- 'HALT: M7 prerequisite — M1 not yet soaked 30 days × 6 phases',
159
- ' M1 commit: f91ce44 2026-05-23 (age: 0 days, need ≥ 180)',
160
- ' M7 earliest eligible: ~2026-11-19',
161
- ].join('\n');
162
-
163
- const logEvents = [
164
- {
165
- type: 'assistant',
166
- message: {
167
- role: 'assistant',
168
- content: [{
169
- type: 'tool_use',
170
- id: 'toolu_m7_001',
171
- name: 'Bash',
172
- input: { command: 'git log --oneline m1-tag', description: 'Check M1 soak period' },
173
- }],
174
- },
175
- },
176
- {
177
- type: 'user',
178
- message: {
179
- role: 'user',
180
- content: [{
181
- type: 'tool_result',
182
- tool_use_id: 'toolu_m7_001',
183
- content: 'f91ce44 2026-05-23 feat(m1): initial trading signals',
184
- is_error: false,
185
- }],
186
- },
187
- },
188
- {
189
- type: 'result',
190
- subtype: 'success',
191
- result: haltMsg,
192
- },
193
- ];
194
-
195
- writeLog(tmp, slug, logEvents);
196
- const prdPath = writePrd(
197
- tmp,
198
- slug,
199
- '# M7 Final Cutover\n\nOnly after M1–M6 have run 30+ days each.',
200
- );
201
-
202
- const verdict = await verifyRun({
203
- runDir: tmp,
204
- prdPath,
205
- queueEntry: { slug, status: 'running' },
206
- allJobs: [],
207
- });
208
-
209
- assert.equal(verdict.verdict, 'halt', `expected halt, got ${verdict.verdict}: ${verdict.reason}`);
210
- assert.equal(verdict.downgradeTo, 'pending');
211
- assert.ok(verdict.reason.includes('HALT'), 'reason should mention HALT');
212
- // Floor date from the HALT message should appear in reason
213
- assert.ok(
214
- verdict.reason.includes('2026-11-19') || verdict.reason.length > 20,
215
- `reason should embed soak floor date: ${verdict.reason}`,
216
- );
217
- } finally {
218
- rmdir(tmp);
219
- }
220
- });
221
-
222
- // ─── fixture: Case 3 — deps_unmet (dependsOn unsatisfied) ────────────────────
223
-
224
- test('Case 3: dependsOn pointing at pending dep → deps_unmet/pending', async () => {
225
- const tmp = makeTmpDir();
226
- try {
227
- const slug = '56-burrow-mcp-retire-tier3-frozen-endpoints';
228
- const logEvents = [
229
- {
230
- type: 'result',
231
- subtype: 'success',
232
- result: 'Completed burrow MCP tier-3 retirement.',
233
- },
234
- ];
235
-
236
- writeLog(tmp, slug, logEvents);
237
- const prdPath = writePrd(
238
- tmp,
239
- slug,
240
- '# Burrow MCP Retire Tier-3\n\nRetire frozen endpoints.',
241
- );
242
-
243
- // M7 is a predecessor that is still pending.
244
- const allJobs = [
245
- { slug: '44-signal-builder-m7-final-cutover', status: 'pending', finishedAt: null },
246
- { slug: slug, status: 'running', finishedAt: null },
247
- ];
248
- const queueEntry = {
249
- slug,
250
- status: 'running',
251
- dependsOn: ['44-signal-builder-m7-final-cutover'],
252
- };
253
-
254
- const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry, allJobs });
255
-
256
- assert.equal(verdict.verdict, 'deps_unmet', `expected deps_unmet, got ${verdict.verdict}: ${verdict.reason}`);
257
- assert.equal(verdict.downgradeTo, 'pending');
258
- assert.ok(verdict.reason.includes('44-signal-builder-m7-final-cutover'), 'reason should name the unmet dep');
259
- } finally {
260
- rmdir(tmp);
261
- }
262
- });
263
-
264
- // ─── fixture: truly clean run ─────────────────────────────────────────────────
265
-
266
- test('Truly clean run (no error markers) → clean/null', async () => {
267
- const tmp = makeTmpDir();
268
- try {
269
- const slug = '20-clean-feature';
270
- const logEvents = [
271
- {
272
- type: 'assistant',
273
- message: {
274
- role: 'assistant',
275
- content: [{
276
- type: 'tool_use',
277
- id: 'toolu_clean_001',
278
- name: 'Bash',
279
- input: { command: 'npm test', description: 'Run test suite' },
280
- }],
281
- },
282
- },
283
- {
284
- type: 'user',
285
- message: {
286
- role: 'user',
287
- content: [{
288
- type: 'tool_result',
289
- tool_use_id: 'toolu_clean_001',
290
- content: '✓ 42 tests passed (1.3s)\nAll tests passed.',
291
- is_error: false,
292
- }],
293
- },
294
- },
295
- {
296
- type: 'result',
297
- subtype: 'success',
298
- result: 'Feature complete. All acceptance criteria satisfied.\nSCHEDULER_VERDICT: PASS',
299
- },
300
- ];
301
-
302
- writeLog(tmp, slug, logEvents);
303
- const prdPath = writePrd(tmp, slug, '# Clean Feature\n\nImplement a clean feature.');
304
-
305
- const verdict = await verifyRun({
306
- runDir: tmp,
307
- prdPath,
308
- queueEntry: { slug, status: 'running' },
309
- allJobs: [],
310
- committedDuringRun: true,
311
- });
312
-
313
- assert.equal(verdict.verdict, 'clean', `expected clean, got ${verdict.verdict}: ${verdict.reason}`);
314
- assert.equal(verdict.downgradeTo, null);
315
- } finally {
316
- rmdir(tmp);
317
- }
318
- });
319
-
320
- // ─── self-recovery: FAIL followed by successful retry ──────────────────────
321
-
322
- test('FAIL recovered within 30 events → clean', async () => {
323
- const tmp = makeTmpDir();
324
- try {
325
- const slug = '21-self-recovering';
326
- const desc = 'Run pytest';
327
- const logEvents = [
328
- // First attempt: fails
329
- {
330
- type: 'assistant',
331
- message: {
332
- role: 'assistant',
333
- content: [{
334
- type: 'tool_use',
335
- id: 'toolu_r1',
336
- name: 'Bash',
337
- input: { command: 'pytest', description: desc },
338
- }],
339
- },
340
- },
341
- {
342
- type: 'user',
343
- message: {
344
- role: 'user',
345
- content: [{
346
- type: 'tool_result',
347
- tool_use_id: 'toolu_r1',
348
- content: 'FAILED tests/test_foo.py::test_bar - AssertionError',
349
- is_error: false,
350
- }],
351
- },
352
- },
353
- // Agent fixes and retries with same description
354
- {
355
- type: 'assistant',
356
- message: {
357
- role: 'assistant',
358
- content: [{
359
- type: 'tool_use',
360
- id: 'toolu_r2',
361
- name: 'Bash',
362
- input: { command: 'pytest', description: desc },
363
- }],
364
- },
365
- },
366
- {
367
- type: 'user',
368
- message: {
369
- role: 'user',
370
- content: [{
371
- type: 'tool_result',
372
- tool_use_id: 'toolu_r2',
373
- content: '5 passed in 0.42s',
374
- is_error: false,
375
- }],
376
- },
377
- },
378
- {
379
- type: 'result',
380
- subtype: 'success',
381
- result: 'Fixed the failing test and verified all pass.\nSCHEDULER_VERDICT: PASS',
382
- },
383
- ];
384
-
385
- writeLog(tmp, slug, logEvents);
386
- const prdPath = writePrd(tmp, slug, '# Self-recovering test');
387
-
388
- const verdict = await verifyRun({
389
- runDir: tmp,
390
- prdPath,
391
- queueEntry: { slug, status: 'running' },
392
- allJobs: [],
393
- committedDuringRun: true,
394
- });
395
-
396
- assert.equal(verdict.verdict, 'clean', `self-recovery should yield clean, got ${verdict.verdict}: ${verdict.reason}`);
397
- } finally {
398
- rmdir(tmp);
399
- }
400
- });
401
-
402
- // ─── self-recovery: sleep-prefix normalization (RCA 745-pr188-ci-lint-docs-integrity) ──
403
-
404
- /**
405
- * Build N innocuous tool_use/tool_result pairs, used to push a later error
406
- * event into the last-20%-of-transcript window that the is_error scan
407
- * requires (parseLog counts every tool_use/tool_result as its own event).
408
- */
409
- function paddingEvents(n) {
410
- const out = [];
411
- for (let i = 0; i < n; i++) {
412
- out.push({
413
- type: 'assistant',
414
- message: { role: 'assistant', content: [{ type: 'tool_use', id: `toolu_pad${i}`, name: 'Bash', input: { command: 'echo ok', description: `padding step ${i}` } }] },
415
- });
416
- out.push({
417
- type: 'user',
418
- message: { role: 'user', content: [{ type: 'tool_result', tool_use_id: `toolu_pad${i}`, content: 'ok', is_error: false }] },
419
- });
420
- }
421
- return out;
422
- }
423
-
424
- test('sleep-prefixed FAIL recovered by a bare retry of the same command → clean', async () => {
425
- const tmp = makeTmpDir();
426
- try {
427
- const slug = '812-sleep-prefix-recovery';
428
- const logEvents = [
429
- ...paddingEvents(8),
430
- // First attempt: polls too early with a `sleep 20 &&` prefix, gets a
431
- // pending/error result.
432
- {
433
- type: 'assistant',
434
- message: {
435
- role: 'assistant',
436
- content: [{
437
- type: 'tool_use',
438
- id: 'toolu_r1',
439
- name: 'Bash',
440
- input: {
441
- command: 'sleep 20 && gh pr checks 188 --repo midt-bg/sigma 2>&1',
442
- description: 'sleep 20 && gh pr checks 188 --repo midt-bg/sigma',
443
- },
444
- }],
445
- },
446
- },
447
- {
448
- type: 'user',
449
- message: {
450
- role: 'user',
451
- content: [{
452
- type: 'tool_result',
453
- tool_use_id: 'toolu_r1',
454
- content: 'Exit code 8\ncheck\tpending\t0\thttps://github.com/midt-bg/sigma/actions/runs/1/job/1',
455
- is_error: true,
456
- }],
457
- },
458
- },
459
- // Later retry: same underlying command, no sleep prefix, succeeds.
460
- {
461
- type: 'assistant',
462
- message: {
463
- role: 'assistant',
464
- content: [{
465
- type: 'tool_use',
466
- id: 'toolu_r2',
467
- name: 'Bash',
468
- input: {
469
- command: 'gh pr checks 188 --repo midt-bg/sigma 2>&1',
470
- description: 'gh pr checks 188 --repo midt-bg/sigma',
471
- },
472
- }],
473
- },
474
- },
475
- {
476
- type: 'user',
477
- message: {
478
- role: 'user',
479
- content: [{
480
- type: 'tool_result',
481
- tool_use_id: 'toolu_r2',
482
- content: 'check\tpass\t2m16s\thttps://github.com/midt-bg/sigma/actions/runs/1/job/1',
483
- is_error: false,
484
- }],
485
- },
486
- },
487
- {
488
- type: 'result',
489
- subtype: 'success',
490
- result: 'CI is green.\nSCHEDULER_VERDICT: PASS',
491
- },
492
- ];
493
-
494
- writeLog(tmp, slug, logEvents);
495
- const prdPath = writePrd(tmp, slug, '# Sleep-prefix recovery test');
496
-
497
- const verdict = await verifyRun({
498
- runDir: tmp,
499
- prdPath,
500
- queueEntry: { slug, status: 'running' },
501
- allJobs: [],
502
- committedDuringRun: true,
503
- });
504
-
505
- assert.equal(verdict.verdict, 'clean', `sleep-prefix recovery should yield clean, got ${verdict.verdict}: ${verdict.reason}`);
506
- } finally {
507
- rmdir(tmp);
508
- }
509
- });
510
-
511
- test('normalizeDescForRecovery only strips the sleep wrapper, not unrelated text', () => {
512
- const { normalizeDescForRecovery } = require('../runVerify.cjs');
513
- assert.equal(
514
- normalizeDescForRecovery('sleep 20 && gh pr checks 188 --repo midt-bg/sigma'),
515
- 'gh pr checks 188 --repo midt-bg/sigma',
516
- );
517
- assert.equal(
518
- normalizeDescForRecovery('sleep 90; gh pr checks 188 --repo midt-bg/sigma'),
519
- 'gh pr checks 188 --repo midt-bg/sigma',
520
- );
521
- assert.equal(
522
- normalizeDescForRecovery('gh pr checks 188 --repo midt-bg/sigma'),
523
- 'gh pr checks 188 --repo midt-bg/sigma',
524
- );
525
- });
526
-
527
- test('two different commands, one sleep-prefixed, are not paired as recovered', () => {
528
- // Exercise isSelfRecovered directly (via parseLog) rather than the full
529
- // verifyRun pipeline: a SCHEDULER_VERDICT: PASS + landed commit legitimately
530
- // overrides a transcript_errors finding at the verifyRun layer by design
531
- // (see verifyRun's sentinel-override comment), which would mask the
532
- // narrower claim this test makes — that the sleep-prefix strip alone must
533
- // not pair two genuinely different commands.
534
- const { isSelfRecovered, parseLog } = require('../runVerify.cjs');
535
- const tmp = makeTmpDir();
536
- try {
537
- const slug = '812-sleep-prefix-no-false-pair';
538
- const logEvents = [
539
- // First attempt: sleep-prefixed poll of PR 188, fails.
540
- {
541
- type: 'assistant',
542
- message: {
543
- role: 'assistant',
544
- content: [{
545
- type: 'tool_use',
546
- id: 'toolu_r1',
547
- name: 'Bash',
548
- input: {
549
- command: 'sleep 20 && gh pr checks 188 --repo midt-bg/sigma 2>&1',
550
- description: 'sleep 20 && gh pr checks 188 --repo midt-bg/sigma',
551
- },
552
- }],
553
- },
554
- },
555
- {
556
- type: 'user',
557
- message: {
558
- role: 'user',
559
- content: [{
560
- type: 'tool_result',
561
- tool_use_id: 'toolu_r1',
562
- content: 'Exit code 8\ncheck\tpending\t0\thttps://github.com/midt-bg/sigma/actions/runs/1/job/1',
563
- is_error: true,
564
- }],
565
- },
566
- },
567
- // "Retry" is actually a different command (different PR number) —
568
- // after stripping the sleep wrapper it must NOT be treated as the
569
- // same underlying command.
570
- {
571
- type: 'assistant',
572
- message: {
573
- role: 'assistant',
574
- content: [{
575
- type: 'tool_use',
576
- id: 'toolu_r2',
577
- name: 'Bash',
578
- input: {
579
- command: 'gh pr checks 999 --repo midt-bg/sigma 2>&1',
580
- description: 'gh pr checks 999 --repo midt-bg/sigma',
581
- },
582
- }],
583
- },
584
- },
585
- {
586
- type: 'user',
587
- message: {
588
- role: 'user',
589
- content: [{
590
- type: 'tool_result',
591
- tool_use_id: 'toolu_r2',
592
- content: 'check\tpass\t2m16s\thttps://github.com/midt-bg/sigma/actions/runs/2/job/2',
593
- is_error: false,
594
- }],
595
- },
596
- },
597
- {
598
- type: 'result',
599
- subtype: 'success',
600
- result: 'Done.\nSCHEDULER_VERDICT: PASS',
601
- },
602
- ];
603
-
604
- writeLog(tmp, slug, logEvents);
605
- const { events } = parseLog(path.join(tmp, `${slug}.log`));
606
- const failedToolUse = events.find((ev) => ev.kind === 'tool_use' && ev.toolUseId === 'toolu_r1');
607
- assert.ok(failedToolUse, 'fixture should contain the failing tool_use event');
608
-
609
- const recovered = isSelfRecovered(events, failedToolUse.seq, failedToolUse.description);
610
- assert.equal(recovered, false, 'a differently-numbered PR check must not be treated as a recovered retry of the sleep-prefixed one');
611
- } finally {
612
- rmdir(tmp);
613
- }
614
- });
615
-
616
- // ─── fixtures: feedback 2026-06-10-01 — quoted-error false positives ─────────
617
-
618
- /** Build a one-Bash-call log: tool_use → tool_result(content) → result event. */
619
- function bashRunEvents(content, { toolName = 'Bash', resultSubtype = 'success' } = {}) {
620
- return [
621
- {
622
- type: 'assistant',
623
- message: {
624
- role: 'assistant',
625
- content: [{
626
- type: 'tool_use',
627
- id: 'toolu_fb_001',
628
- name: toolName,
629
- input: { command: 'run something', description: 'Run checks' },
630
- }],
631
- },
632
- },
633
- {
634
- type: 'user',
635
- message: {
636
- role: 'user',
637
- content: [{
638
- type: 'tool_result',
639
- tool_use_id: 'toolu_fb_001',
640
- content,
641
- is_error: false,
642
- }],
643
- },
644
- },
645
- { type: 'result', subtype: resultSubtype, result: 'All acceptance criteria verified.\nSCHEDULER_VERDICT: PASS' },
646
- ];
647
- }
648
-
649
- test('feedback 01: reviewer prose mentioning ImportError mid-sentence → clean', async () => {
650
- const tmp = makeTmpDir();
651
- try {
652
- const slug = '25-self-pipeline-driver-hardening';
653
- const prose = [
654
- '{"finding": "the script will crash with ImportError rather than a clean RESULT: failed line",',
655
- ' "note": "a missing dep would fail with an ImportError that is captured only in cron.log"}',
656
- ].join('\n');
657
- writeLog(tmp, slug, bashRunEvents(prose));
658
- const prdPath = writePrd(tmp, slug, '# Hardening');
659
- const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry: { slug, status: 'running' }, allJobs: [], committedDuringRun: true });
660
- assert.equal(verdict.verdict, 'clean', `prose mention must not flag, got ${verdict.verdict}: ${verdict.reason}`);
661
- } finally { rmdir(tmp); }
662
- });
663
-
664
- test('feedback 01: real line-anchored ModuleNotFoundError in a FAILED run → verify_unavailable/needs_review', async () => {
665
- const tmp = makeTmpDir();
666
- try {
667
- const slug = '25-real-import-error';
668
- const out = [
669
- '$ python run_checks.py',
670
- 'Traceback (most recent call last):',
671
- ' File "run_checks.py", line 2, in <module>',
672
- ' from playwright.sync_api import sync_playwright',
673
- "ModuleNotFoundError: No module named 'playwright'",
674
- ].join('\n');
675
- // Run did NOT succeed: the missing dependency was never resolved, so the
676
- // "couldn't verify" signal must still escalate to a human.
677
- writeLog(tmp, slug, bashRunEvents(out, { resultSubtype: 'error_during_execution' }));
678
- const prdPath = writePrd(tmp, slug, '# Real failure');
679
- const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry: { slug, status: 'running' }, allJobs: [] });
680
- assert.equal(verdict.verdict, 'verify_unavailable', `unresolved missing-dep must flag, got ${verdict.verdict}: ${verdict.reason}`);
681
- assert.equal(verdict.downgradeTo, 'needs_review');
682
- } finally { rmdir(tmp); }
683
- });
684
-
685
- // ─── feedback 2026-06-10 addendum — recovered env-probe false positives ──────
686
- //
687
- // Setup probes (interpreter/venv search) that surface ModuleNotFoundError but
688
- // the run still reaches result:success are the missing-dependency class, not a
689
- // real failure. They must NOT downgrade — only annotate. But a Traceback ending
690
- // in a real logic exception (KeyError/AssertionError) still hard-flags, even on
691
- // "success", preserving the 2026-05-23 false-PASS guard.
692
-
693
- test('addendum: Traceback→ModuleNotFoundError in a SUCCEEDED run → clean (annotated, not downgraded)', async () => {
694
- const tmp = makeTmpDir();
695
- try {
696
- const slug = '26-self-billbot-shared-lib';
697
- const probe = [
698
- 'Exit code 1',
699
- 'Traceback (most recent call last):',
700
- ' File "/home/bilko/Self/.claude/skills/snopud-bill/download_bill.py", line 42, in <module>',
701
- ' from playwright.sync_api import TimeoutError as PWTimeout',
702
- "ModuleNotFoundError: No module named 'playwright'",
703
- ].join('\n');
704
- writeLog(tmp, slug, bashRunEvents(probe)); // resultSubtype defaults to success
705
- const prdPath = writePrd(tmp, slug, '# Shared lib');
706
- const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry: { slug, status: 'running' }, allJobs: [], committedDuringRun: true });
707
- assert.equal(verdict.verdict, 'clean', `recovered env probe must not downgrade, got ${verdict.verdict}: ${verdict.reason}`);
708
- assert.equal(verdict.downgradeTo, null);
709
- assert.ok(Array.isArray(verdict.annotations) && verdict.annotations.length === 1, 'should record one annotation');
710
- assert.equal(verdict.annotations[0].verdict, 'verify_unavailable');
711
- } finally { rmdir(tmp); }
712
- });
713
-
714
- test('addendum: bare Import/ModuleNotFound probe (no traceback) in SUCCEEDED run → clean/annotated', async () => {
715
- const tmp = makeTmpDir();
716
- try {
717
- const slug = '26-self-parser-tests';
718
- writeLog(tmp, slug, bashRunEvents("ModuleNotFoundError: No module named 'conftest'"));
719
- const prdPath = writePrd(tmp, slug, '# Parser tests');
720
- const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry: { slug, status: 'running' }, allJobs: [], committedDuringRun: true });
721
- assert.equal(verdict.verdict, 'clean', `got ${verdict.verdict}: ${verdict.reason}`);
722
- assert.ok(Array.isArray(verdict.annotations) && verdict.annotations.length === 1);
723
- } finally { rmdir(tmp); }
724
- });
725
-
726
- test('addendum: Traceback→KeyError (real logic failure) on "success" → still transcript_errors/needs_review', async () => {
727
- const tmp = makeTmpDir();
728
- try {
729
- const slug = '26-real-logic-failure';
730
- const out = [
731
- '=== contract.json panels.sentiment ===',
732
- 'Traceback (most recent call last):',
733
- ' File "<string>", line 1, in <module>',
734
- "KeyError: 'panels.sentiment'",
735
- ].join('\n');
736
- writeLog(tmp, slug, bashRunEvents(out)); // success result — must NOT rescue a real failure
737
- const prdPath = writePrd(tmp, slug, '# Logic failure');
738
- const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry: { slug, status: 'running' }, allJobs: [] });
739
- assert.equal(verdict.verdict, 'transcript_errors', `real logic Traceback must still flag, got ${verdict.verdict}: ${verdict.reason}`);
740
- assert.equal(verdict.downgradeTo, 'needs_review');
741
- } finally { rmdir(tmp); }
742
- });
743
-
744
- test('feedback 01: error-shaped text inside a Task (subagent) result → clean', async () => {
745
- const tmp = makeTmpDir();
746
- try {
747
- const slug = '25-subagent-quoting-error';
748
- const reviewFinding = [
749
- 'Finding 3 (high): startup crash path:',
750
- 'Traceback (most recent call last):',
751
- "ImportError: cannot import name 'foo'",
752
- 'This is what WOULD happen if the guard is removed.',
753
- ].join('\n');
754
- writeLog(tmp, slug, bashRunEvents(reviewFinding, { toolName: 'Task' }));
755
- const prdPath = writePrd(tmp, slug, '# Review-heavy PRD');
756
- const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry: { slug, status: 'running' }, allJobs: [], committedDuringRun: true });
757
- assert.equal(verdict.verdict, 'clean', `Task results must be exempt from pattern scan, got ${verdict.verdict}: ${verdict.reason}`);
758
- } finally { rmdir(tmp); }
759
- });
760
-
761
- test('feedback 01: quoted "Traceback..." line (leading quote) → clean', async () => {
762
- const tmp = makeTmpDir();
763
- try {
764
- const slug = '25-quoted-traceback';
765
- const prose = [
766
- 'The log format doc says:',
767
- ' "Traceback (most recent call last):" appears first, then',
768
- ' "SomeError: message" on a later line.',
769
- ].join('\n');
770
- writeLog(tmp, slug, bashRunEvents(prose));
771
- const prdPath = writePrd(tmp, slug, '# Docs PRD');
772
- const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry: { slug, status: 'running' }, allJobs: [], committedDuringRun: true });
773
- assert.equal(verdict.verdict, 'clean', `quoted traceback prose must not flag, got ${verdict.verdict}: ${verdict.reason}`);
774
- } finally { rmdir(tmp); }
775
- });
776
-
777
- // ─── harness tool errors (feedback follow-up 2026-06-10) ─────────────────────
778
-
779
- test('harness tool error (<tool_use_error>) in final 20% → clean', async () => {
780
- const tmp = makeTmpDir();
781
- try {
782
- const slug = '58-harness-tool-error';
783
- // Pad with benign events so the error lands in the final 20%, then a
784
- // successful result — mirrors the real 58-web-remote-correctness-batch run.
785
- const events = [];
786
- for (let k = 0; k < 8; k++) {
787
- events.push({ type: 'assistant', message: { role: 'assistant', content: [
788
- { type: 'tool_use', id: `t${k}`, name: 'Read', input: { description: `read ${k}` } }] } });
789
- events.push({ type: 'user', message: { role: 'user', content: [
790
- { type: 'tool_result', tool_use_id: `t${k}`, content: 'ok', is_error: false }] } });
791
- }
792
- events.push({ type: 'assistant', message: { role: 'assistant', content: [
793
- { type: 'tool_use', id: 'tbad', name: 'bash', input: { description: 'run tests' } }] } });
794
- events.push({ type: 'user', message: { role: 'user', content: [
795
- { type: 'tool_result', tool_use_id: 'tbad',
796
- content: '<tool_use_error>Error: No such tool available: bash</tool_use_error>', is_error: true }] } });
797
- events.push({ type: 'result', subtype: 'success', result: 'All acceptance criteria verified.\nSCHEDULER_VERDICT: PASS' });
798
-
799
- writeLog(tmp, slug, events);
800
- const prdPath = writePrd(tmp, slug, '# Correctness batch');
801
- const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry: { slug, status: 'running' }, allJobs: [], committedDuringRun: true });
802
- assert.equal(verdict.verdict, 'clean', `harness tool error must not flag, got ${verdict.verdict}: ${verdict.reason}`);
803
- } finally { rmdir(tmp); }
804
- });
805
-
806
- // ─── subagent-internal tool errors (incident: 955-route-epic-create-through-ipc, 2026-08-03) ──
807
-
808
- test('subagent-internal is_error (parent_tool_use_id set) in final 20% → clean', async () => {
809
- const tmp = makeTmpDir();
810
- try {
811
- const slug = '955-route-epic-create-through-ipc';
812
- const events = [];
813
- for (let k = 0; k < 8; k++) {
814
- events.push({ type: 'assistant', message: { role: 'assistant', content: [
815
- { type: 'tool_use', id: `t${k}`, name: 'Read', input: { description: `read ${k}` } }] } });
816
- events.push({ type: 'user', message: { role: 'user', content: [
817
- { type: 'tool_result', tool_use_id: `t${k}`, content: 'ok', is_error: false }] } });
818
- }
819
- // A code-reviewer Task subagent runs its own exploratory grep, which exits
820
- // 1 (no matches) — this happened INSIDE the subagent, not the main agent.
821
- events.push({
822
- type: 'assistant',
823
- parent_tool_use_id: 'toolu_task_001',
824
- message: { role: 'assistant', content: [
825
- { type: 'tool_use', id: 'tgrep', name: 'Bash', input: { description: 'grep for buildPromptSession' } }] },
826
- });
827
- events.push({
828
- type: 'user',
829
- parent_tool_use_id: 'toolu_task_001',
830
- message: { role: 'user', content: [
831
- { type: 'tool_result', tool_use_id: 'tgrep', content: '', is_error: true }] },
832
- });
833
- events.push({ type: 'result', subtype: 'success', result: 'All acceptance criteria verified.' });
834
-
835
- writeLog(tmp, slug, events);
836
- const prdPath = writePrd(tmp, slug, '# Route Epic create through IPC');
837
- const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry: { slug, status: 'running' }, allJobs: [], committedDuringRun: true });
838
- assert.equal(verdict.verdict, 'clean', `subagent-internal is_error must not flag, got ${verdict.verdict}: ${verdict.reason}`);
839
- } finally { rmdir(tmp); }
840
- });
841
-
842
- test('main-agent is_error (no parent_tool_use_id) in final 20% → still transcript_errors', async () => {
843
- const tmp = makeTmpDir();
844
- try {
845
- const slug = '955-main-agent-error-guard';
846
- const events = [];
847
- for (let k = 0; k < 8; k++) {
848
- events.push({ type: 'assistant', message: { role: 'assistant', content: [
849
- { type: 'tool_use', id: `t${k}`, name: 'Read', input: { description: `read ${k}` } }] } });
850
- events.push({ type: 'user', message: { role: 'user', content: [
851
- { type: 'tool_result', tool_use_id: `t${k}`, content: 'ok', is_error: false }] } });
852
- }
853
- events.push({ type: 'assistant', message: { role: 'assistant', content: [
854
- { type: 'tool_use', id: 'tbad', name: 'Bash', input: { description: 'run tests' } }] } });
855
- events.push({ type: 'user', message: { role: 'user', content: [
856
- { type: 'tool_result', tool_use_id: 'tbad', content: 'FAILED: 1 test failed', is_error: true }] } });
857
- events.push({ type: 'result', subtype: 'success', result: 'All acceptance criteria verified.' });
858
-
859
- writeLog(tmp, slug, events);
860
- const prdPath = writePrd(tmp, slug, '# Guard: main-agent errors still flag');
861
- const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry: { slug, status: 'running' }, allJobs: [], committedDuringRun: true });
862
- assert.equal(verdict.verdict, 'transcript_errors', `main-agent is_error must still flag, got ${verdict.verdict}: ${verdict.reason}`);
863
- } finally { rmdir(tmp); }
864
- });
865
-
866
- test('parseLog populates parentToolUseId on tool_use and tool_result events, defaulting to null', () => {
867
- const tmp = makeTmpDir();
868
- try {
869
- const slug = '955-parselog-parent-id';
870
- const events = [
871
- {
872
- type: 'assistant',
873
- parent_tool_use_id: 'toolu_parent_001',
874
- message: { role: 'assistant', content: [
875
- { type: 'tool_use', id: 'tchild', name: 'Bash', input: { description: 'grep in subagent' } }] },
876
- },
877
- {
878
- type: 'user',
879
- parent_tool_use_id: 'toolu_parent_001',
880
- message: { role: 'user', content: [
881
- { type: 'tool_result', tool_use_id: 'tchild', content: '', is_error: true }] },
882
- },
883
- {
884
- type: 'assistant',
885
- message: { role: 'assistant', content: [
886
- { type: 'tool_use', id: 'ttop', name: 'Bash', input: { description: 'run in main agent' } }] },
887
- },
888
- {
889
- type: 'user',
890
- message: { role: 'user', content: [
891
- { type: 'tool_result', tool_use_id: 'ttop', content: 'ok', is_error: false }] },
892
- },
893
- ];
894
- writeLog(tmp, slug, events);
895
- const { events: parsed } = parseLog(path.join(tmp, `${slug}.log`));
896
-
897
- const childUse = parsed.find((ev) => ev.kind === 'tool_use' && ev.toolUseId === 'tchild');
898
- const childResult = parsed.find((ev) => ev.kind === 'tool_result' && ev.toolUseId === 'tchild');
899
- const topUse = parsed.find((ev) => ev.kind === 'tool_use' && ev.toolUseId === 'ttop');
900
- const topResult = parsed.find((ev) => ev.kind === 'tool_result' && ev.toolUseId === 'ttop');
901
-
902
- assert.equal(childUse.parentToolUseId, 'toolu_parent_001');
903
- assert.equal(childResult.parentToolUseId, 'toolu_parent_001');
904
- assert.equal(topUse.parentToolUseId, null);
905
- assert.equal(topResult.parentToolUseId, null);
906
- } finally { rmdir(tmp); }
907
- });
908
-
909
- test('isHarnessToolError detects wrapper and "No such tool available"', () => {
910
- const { isHarnessToolError } = require('../runVerify.cjs');
911
- assert.equal(isHarnessToolError('<tool_use_error>Error: No such tool available: bash</tool_use_error>'), true);
912
- assert.equal(isHarnessToolError('No such tool available: Foo'), true);
913
- assert.equal(isHarnessToolError('ModuleNotFoundError: No module named x'), false);
914
- assert.equal(isHarnessToolError(''), false);
915
- });
916
-
917
- // ─── SCHEDULER_VERDICT sentinel override tests ────────────────────────────────
918
-
919
- /** Build a log where a tool_result contains a Traceback+KeyError and the
920
- * result event optionally contains the sentinel line. */
921
- function tracebackRunEvents(sentinelLine) {
922
- const resultText = sentinelLine
923
- ? `All work done.\n${sentinelLine}`
924
- : 'All work done.';
925
- return [
926
- {
927
- type: 'assistant',
928
- message: {
929
- role: 'assistant',
930
- content: [{
931
- type: 'tool_use',
932
- id: 'toolu_tv_001',
933
- name: 'Bash',
934
- input: { command: 'pytest', description: 'Run acceptance tests' },
935
- }],
936
- },
937
- },
938
- {
939
- type: 'user',
940
- message: {
941
- role: 'user',
942
- content: [{
943
- type: 'tool_result',
944
- tool_use_id: 'toolu_tv_001',
945
- content: [
946
- '=== TDD red phase ===',
947
- 'Traceback (most recent call last):',
948
- ' File "test_foo.py", line 5, in test_bar',
949
- "KeyError: 'missing_key'",
950
- ].join('\n'),
951
- is_error: false,
952
- }],
953
- },
954
- },
955
- { type: 'result', subtype: 'success', result: resultText },
956
- ];
957
- }
958
-
959
- // (a) sentinel PASS + committedDuringRun:true + Traceback+Error → clean
960
- test('sentinel PASS + committedDuringRun:true + Traceback → clean (override)', async () => {
961
- const tmp = makeTmpDir();
962
- try {
963
- const slug = '77-sentinel-override-pass';
964
- writeLog(tmp, slug, tracebackRunEvents('SCHEDULER_VERDICT: PASS'));
965
- const prdPath = writePrd(tmp, slug, '# Sentinel override test');
966
- const verdict = await verifyRun({
967
- runDir: tmp,
968
- prdPath,
969
- queueEntry: { slug, status: 'running' },
970
- allJobs: [],
971
- committedDuringRun: true,
972
- });
973
- assert.equal(verdict.verdict, 'clean', `expected clean, got ${verdict.verdict}: ${verdict.reason}`);
974
- assert.equal(verdict.downgradeTo, null);
975
- assert.ok(verdict.reason.includes('SCHEDULER_VERDICT: PASS'), `reason should mention sentinel: ${verdict.reason}`);
976
- // Sidecar should record the sentinel and override
977
- const sidecar = JSON.parse(fs.readFileSync(path.join(tmp, `${slug}.verdicts.json`), 'utf8'));
978
- assert.equal(sidecar.sentinel, 'pass');
979
- assert.ok(sidecar.sentinelOverride, 'sidecar should record sentinelOverride');
980
- } finally {
981
- rmdir(tmp);
982
- }
983
- });
984
-
985
- // (b) no sentinel + Traceback+Error → transcript_errors (unchanged baseline)
986
- test('no sentinel + Traceback+Error + committedDuringRun:true → transcript_errors (no override)', async () => {
987
- const tmp = makeTmpDir();
988
- try {
989
- const slug = '77-no-sentinel-baseline';
990
- writeLog(tmp, slug, tracebackRunEvents(null));
991
- const prdPath = writePrd(tmp, slug, '# No sentinel baseline');
992
- const verdict = await verifyRun({
993
- runDir: tmp,
994
- prdPath,
995
- queueEntry: { slug, status: 'running' },
996
- allJobs: [],
997
- committedDuringRun: true,
998
- });
999
- assert.equal(verdict.verdict, 'transcript_errors', `expected transcript_errors without sentinel, got ${verdict.verdict}: ${verdict.reason}`);
1000
- assert.equal(verdict.downgradeTo, 'needs_review');
1001
- } finally {
1002
- rmdir(tmp);
1003
- }
1004
- });
1005
-
1006
- // (c) sentinel PASS + committedDuringRun:false → stays transcript_errors (commit not confirmed)
1007
- test('sentinel PASS + committedDuringRun:false → transcript_errors (commit unconfirmed)', async () => {
1008
- const tmp = makeTmpDir();
1009
- try {
1010
- const slug = '77-sentinel-no-commit';
1011
- writeLog(tmp, slug, tracebackRunEvents('SCHEDULER_VERDICT: PASS'));
1012
- const prdPath = writePrd(tmp, slug, '# Sentinel without commit');
1013
- const verdict = await verifyRun({
1014
- runDir: tmp,
1015
- prdPath,
1016
- queueEntry: { slug, status: 'running' },
1017
- allJobs: [],
1018
- committedDuringRun: false,
1019
- });
1020
- assert.equal(verdict.verdict, 'transcript_errors', `PASS without commit must not override, got ${verdict.verdict}: ${verdict.reason}`);
1021
- assert.equal(verdict.downgradeTo, 'needs_review');
1022
- } finally {
1023
- rmdir(tmp);
1024
- }
1025
- });
1026
-
1027
- // (d) sentinel FAIL → never clean (even with committedDuringRun:true)
1028
- test('sentinel FAIL + committedDuringRun:true → transcript_errors (FAIL never overrides)', async () => {
1029
- const tmp = makeTmpDir();
1030
- try {
1031
- const slug = '77-sentinel-fail';
1032
- writeLog(tmp, slug, tracebackRunEvents('SCHEDULER_VERDICT: FAIL AC gate was red'));
1033
- const prdPath = writePrd(tmp, slug, '# Sentinel FAIL');
1034
- const verdict = await verifyRun({
1035
- runDir: tmp,
1036
- prdPath,
1037
- queueEntry: { slug, status: 'running' },
1038
- allJobs: [],
1039
- committedDuringRun: true,
1040
- });
1041
- assert.equal(verdict.verdict, 'transcript_errors', `FAIL sentinel must not override to clean, got ${verdict.verdict}: ${verdict.reason}`);
1042
- assert.equal(verdict.downgradeTo, 'needs_review');
1043
- } finally {
1044
- rmdir(tmp);
1045
- }
1046
- });
1047
-
1048
- // ─── pre-sentinel heal (allowPreSentinelHeal) ─────────────────────────────────
1049
-
1050
- // (f) allowPreSentinelHeal=true + committed + no sentinel → clean
1051
- test('pre-sentinel heal: committed + no sentinel + allowPreSentinelHeal → clean', async () => {
1052
- const tmp = makeTmpDir();
1053
- try {
1054
- const slug = '86-pre-sentinel-heal-pass';
1055
- writeLog(tmp, slug, tracebackRunEvents(null)); // no SCHEDULER_VERDICT line
1056
- const prdPath = writePrd(tmp, slug, '# Pre-sentinel heal');
1057
- const verdict = await verifyRun({
1058
- runDir: tmp,
1059
- prdPath,
1060
- queueEntry: { slug, status: 'needs_review' },
1061
- allJobs: [],
1062
- committedDuringRun: true,
1063
- allowPreSentinelHeal: true,
1064
- });
1065
- assert.equal(verdict.verdict, 'clean', `expected clean via pre-sentinel heal, got ${verdict.verdict}: ${verdict.reason}`);
1066
- assert.equal(verdict.downgradeTo, null);
1067
- assert.ok(verdict.reason.includes('pre-sentinel heal'), `reason should mention pre-sentinel heal: ${verdict.reason}`);
1068
- const sidecar = JSON.parse(fs.readFileSync(path.join(tmp, `${slug}.verdicts.json`), 'utf8'));
1069
- assert.ok(sidecar.preSentinelHeal, 'sidecar should record preSentinelHeal');
1070
- } finally {
1071
- rmdir(tmp);
1072
- }
1073
- });
1074
-
1075
- // (g) allowPreSentinelHeal=true + committed + FAIL sentinel → stays transcript_errors
1076
- test('pre-sentinel heal: committed + SCHEDULER_VERDICT: FAIL + allowPreSentinelHeal → transcript_errors', async () => {
1077
- const tmp = makeTmpDir();
1078
- try {
1079
- const slug = '86-pre-sentinel-heal-fail';
1080
- writeLog(tmp, slug, tracebackRunEvents('SCHEDULER_VERDICT: FAIL AC gate was red'));
1081
- const prdPath = writePrd(tmp, slug, '# Pre-sentinel heal blocked by FAIL');
1082
- const verdict = await verifyRun({
1083
- runDir: tmp,
1084
- prdPath,
1085
- queueEntry: { slug, status: 'needs_review' },
1086
- allJobs: [],
1087
- committedDuringRun: true,
1088
- allowPreSentinelHeal: true,
1089
- });
1090
- assert.equal(verdict.verdict, 'transcript_errors', `FAIL sentinel must block pre-sentinel heal, got ${verdict.verdict}: ${verdict.reason}`);
1091
- assert.equal(verdict.downgradeTo, 'needs_review');
1092
- } finally {
1093
- rmdir(tmp);
1094
- }
1095
- });
1096
-
1097
- // (h) allowPreSentinelHeal=true + NOT committed + no sentinel → stays transcript_errors
1098
- test('pre-sentinel heal: not committed + no sentinel + allowPreSentinelHeal → transcript_errors', async () => {
1099
- const tmp = makeTmpDir();
1100
- try {
1101
- const slug = '86-pre-sentinel-heal-uncommitted';
1102
- writeLog(tmp, slug, tracebackRunEvents(null));
1103
- const prdPath = writePrd(tmp, slug, '# Pre-sentinel heal blocked by no commit');
1104
- const verdict = await verifyRun({
1105
- runDir: tmp,
1106
- prdPath,
1107
- queueEntry: { slug, status: 'needs_review' },
1108
- allJobs: [],
1109
- committedDuringRun: false,
1110
- allowPreSentinelHeal: true,
1111
- });
1112
- assert.equal(verdict.verdict, 'transcript_errors', `no commit must block pre-sentinel heal, got ${verdict.verdict}: ${verdict.reason}`);
1113
- assert.equal(verdict.downgradeTo, 'needs_review');
1114
- } finally {
1115
- rmdir(tmp);
1116
- }
1117
- });
1118
-
1119
- // (i) allowPreSentinelHeal=false (default) + committed + no sentinel → baseline unchanged
1120
- test('no sentinel + committed + allowPreSentinelHeal=false (default) → transcript_errors', async () => {
1121
- const tmp = makeTmpDir();
1122
- try {
1123
- const slug = '86-pre-sentinel-heal-disabled';
1124
- writeLog(tmp, slug, tracebackRunEvents(null));
1125
- const prdPath = writePrd(tmp, slug, '# allowPreSentinelHeal disabled by default');
1126
- const verdict = await verifyRun({
1127
- runDir: tmp,
1128
- prdPath,
1129
- queueEntry: { slug, status: 'needs_review' },
1130
- allJobs: [],
1131
- committedDuringRun: true,
1132
- // allowPreSentinelHeal defaults to false
1133
- });
1134
- assert.equal(verdict.verdict, 'transcript_errors', `must not heal without allowPreSentinelHeal, got ${verdict.verdict}: ${verdict.reason}`);
1135
- assert.equal(verdict.downgradeTo, 'needs_review');
1136
- } finally {
1137
- rmdir(tmp);
1138
- }
1139
- });
1140
-
1141
- // ─── no_verdict_sentinel: no commit + no sentinel is not "clean" by default ──
1142
-
1143
- /** A run with zero tool_result pattern hits — e.g. the agent asked a
1144
- * clarifying question and stopped, ending its turn without touching tools. */
1145
- function noOpRunEvents(resultText) {
1146
- return [
1147
- { type: 'result', subtype: 'success', result: resultText },
1148
- ];
1149
- }
1150
-
1151
- test('no_verdict_sentinel: no tool_result issues, no sentinel, no commit → needs_review', async () => {
1152
- const tmp = makeTmpDir();
1153
- try {
1154
- const slug = '406-capture-panel-ui';
1155
- writeLog(tmp, slug, noOpRunEvents('I need clarification on which capture API to target before proceeding.'));
1156
- const prdPath = writePrd(tmp, slug, '# Browser capture panel UI');
1157
- const verdict = await verifyRun({
1158
- runDir: tmp,
1159
- prdPath,
1160
- queueEntry: { slug, status: 'running' },
1161
- allJobs: [],
1162
- committedDuringRun: false,
1163
- });
1164
- assert.equal(verdict.verdict, 'no_verdict_sentinel', `expected no_verdict_sentinel, got ${verdict.verdict}: ${verdict.reason}`);
1165
- assert.equal(verdict.downgradeTo, 'needs_review');
1166
- } finally {
1167
- rmdir(tmp);
1168
- }
1169
- });
1170
-
1171
- test('no_verdict_sentinel guard: same run but committedDuringRun:true → stays clean', async () => {
1172
- const tmp = makeTmpDir();
1173
- try {
1174
- const slug = '406-capture-panel-ui-committed';
1175
- writeLog(tmp, slug, noOpRunEvents('I need clarification on which capture API to target before proceeding.'));
1176
- const prdPath = writePrd(tmp, slug, '# Browser capture panel UI');
1177
- const verdict = await verifyRun({
1178
- runDir: tmp,
1179
- prdPath,
1180
- queueEntry: { slug, status: 'running' },
1181
- allJobs: [],
1182
- committedDuringRun: true,
1183
- });
1184
- assert.equal(verdict.verdict, 'clean', `commit landed should stay clean, got ${verdict.verdict}: ${verdict.reason}`);
1185
- assert.equal(verdict.downgradeTo, null);
1186
- } finally {
1187
- rmdir(tmp);
1188
- }
1189
- });
1190
-
1191
- test('no_verdict_sentinel guard: same run but with SCHEDULER_VERDICT: PASS sentinel + a commit → stays clean', async () => {
1192
- const tmp = makeTmpDir();
1193
- try {
1194
- const slug = '406-capture-panel-ui-sentinel';
1195
- writeLog(tmp, slug, noOpRunEvents('All acceptance criteria verified.\nSCHEDULER_VERDICT: PASS'));
1196
- const prdPath = writePrd(tmp, slug, '# Browser capture panel UI');
1197
- const verdict = await verifyRun({
1198
- runDir: tmp,
1199
- prdPath,
1200
- queueEntry: { slug, status: 'running' },
1201
- allJobs: [],
1202
- committedDuringRun: true,
1203
- });
1204
- assert.equal(verdict.verdict, 'clean', `PASS sentinel + commit should stay clean, got ${verdict.verdict}: ${verdict.reason}`);
1205
- assert.equal(verdict.downgradeTo, null);
1206
- } finally {
1207
- rmdir(tmp);
1208
- }
1209
- });
1210
-
1211
- // ─── abandoned_background_task: auto-backgrounded Bash + no sentinel/commit ─
1212
-
1213
- /** A run whose Bash command hit the harness's 120s foreground timeout and was
1214
- * auto-backgrounded, then the run ended without ever coming back to commit
1215
- * or emit the finish-protocol sentinel. */
1216
- function abandonedBackgroundTaskRunEvents(resultText) {
1217
- return [
1218
- {
1219
- type: 'assistant',
1220
- message: {
1221
- role: 'assistant',
1222
- content: [{
1223
- type: 'tool_use',
1224
- id: 'toolu_bg_001',
1225
- name: 'Bash',
1226
- input: { command: 'npm run test:unit', description: 'Run full unit suite' },
1227
- }],
1228
- },
1229
- },
1230
- {
1231
- type: 'user',
1232
- message: {
1233
- role: 'user',
1234
- content: [{
1235
- type: 'tool_result',
1236
- tool_use_id: 'toolu_bg_001',
1237
- content: 'Command did not complete within its 120s timeout and was moved to the background (ID: bcn1lpvpd). Output is being written to: /tmp/claude-1000/tasks/bcn1lpvpd.output. You will be notified when it completes. To check interim output, use Read on that file path.',
1238
- is_error: false,
1239
- }],
1240
- },
1241
- },
1242
- { type: 'result', subtype: 'success', result: resultText },
1243
- ];
1244
- }
1245
-
1246
- test('abandoned_background_task: background marker + no sentinel + no commit → abandoned_background_task', async () => {
1247
- const tmp = makeTmpDir();
1248
- try {
1249
- const slug = '1116-encyclopedia-animations-section';
1250
- writeLog(tmp, slug, abandonedBackgroundTaskRunEvents('Waiting for the backgrounded test run to finish.'));
1251
- const prdPath = writePrd(tmp, slug, '# Encyclopedia animations section');
1252
- const verdict = await verifyRun({
1253
- runDir: tmp,
1254
- prdPath,
1255
- queueEntry: { slug, status: 'running' },
1256
- allJobs: [],
1257
- committedDuringRun: false,
1258
- });
1259
- assert.equal(verdict.verdict, 'abandoned_background_task', `expected abandoned_background_task, got ${verdict.verdict}: ${verdict.reason}`);
1260
- assert.equal(verdict.downgradeTo, 'needs_review');
1261
- } finally {
1262
- rmdir(tmp);
1263
- }
1264
- });
1265
-
1266
- test('abandoned_background_task guard: no background marker, no sentinel, no commit → stays plain no_verdict_sentinel', async () => {
1267
- const tmp = makeTmpDir();
1268
- try {
1269
- const slug = '1116-no-background-marker';
1270
- writeLog(tmp, slug, noOpRunEvents('I need clarification on which capture API to target before proceeding.'));
1271
- const prdPath = writePrd(tmp, slug, '# Encyclopedia animations section');
1272
- const verdict = await verifyRun({
1273
- runDir: tmp,
1274
- prdPath,
1275
- queueEntry: { slug, status: 'running' },
1276
- allJobs: [],
1277
- committedDuringRun: false,
1278
- });
1279
- assert.equal(verdict.verdict, 'no_verdict_sentinel', `expected plain no_verdict_sentinel, got ${verdict.verdict}: ${verdict.reason}`);
1280
- } finally {
1281
- rmdir(tmp);
1282
- }
1283
- });
1284
-
1285
- test('abandoned_background_task guard: background marker present but run DID commit → clean', async () => {
1286
- const tmp = makeTmpDir();
1287
- try {
1288
- const slug = '1116-background-marker-but-committed';
1289
- writeLog(tmp, slug, abandonedBackgroundTaskRunEvents('Backgrounded test run finished green; work committed.'));
1290
- const prdPath = writePrd(tmp, slug, '# Encyclopedia animations section');
1291
- const verdict = await verifyRun({
1292
- runDir: tmp,
1293
- prdPath,
1294
- queueEntry: { slug, status: 'running' },
1295
- allJobs: [],
1296
- committedDuringRun: true,
1297
- });
1298
- assert.equal(verdict.verdict, 'clean', `background marker with a landed commit should stay clean, got ${verdict.verdict}: ${verdict.reason}`);
1299
- assert.equal(verdict.downgradeTo, null);
1300
- } finally {
1301
- rmdir(tmp);
1302
- }
1303
- });
1304
-
1305
- // ─── pass_no_commit: PASS sentinel with no commit is not "clean" ───────────
1306
-
1307
- test('pass_no_commit: SCHEDULER_VERDICT: PASS but no commit landed → needs_review', async () => {
1308
- const tmp = makeTmpDir();
1309
- try {
1310
- const slug = '511-recorder-mouse-drag-panel-export';
1311
- writeLog(tmp, slug, noOpRunEvents('All acceptance criteria verified.\nSCHEDULER_VERDICT: PASS'));
1312
- const prdPath = writePrd(tmp, slug, '# Recorder mouse drag panel export');
1313
- const verdict = await verifyRun({
1314
- runDir: tmp,
1315
- prdPath,
1316
- queueEntry: { slug, status: 'running' },
1317
- allJobs: [],
1318
- committedDuringRun: false,
1319
- });
1320
- assert.equal(verdict.verdict, 'pass_no_commit', `expected pass_no_commit, got ${verdict.verdict}: ${verdict.reason}`);
1321
- assert.equal(verdict.downgradeTo, 'needs_review');
1322
- } finally {
1323
- rmdir(tmp);
1324
- }
1325
- });
1326
-
1327
- test('pass_no_commit: fix-plan job (slug ^\\d+-fix-) with PASS but no commit is exempt → clean', async () => {
1328
- const tmp = makeTmpDir();
1329
- try {
1330
- const slug = '523-fix-bounded-fix-plan-retry';
1331
- writeLog(tmp, slug, noOpRunEvents('Verification complete — no code gap exists.\nSCHEDULER_VERDICT: PASS'));
1332
- const prdPath = writePrd(tmp, slug, '# Fix: bounded fix-plan retry');
1333
- const verdict = await verifyRun({
1334
- runDir: tmp,
1335
- prdPath,
1336
- queueEntry: { slug, status: 'running' },
1337
- allJobs: [],
1338
- committedDuringRun: false,
1339
- });
1340
- assert.equal(verdict.verdict, 'clean', `expected clean (fix-plan exemption), got ${verdict.verdict}: ${verdict.reason}`);
1341
- } finally {
1342
- rmdir(tmp);
1343
- }
1344
- });
1345
-
1346
- // ─── pass_no_commit_already_shipped: original PRD re-run after landing ─────
1347
- // (incident: 655-needs-review-rca-feedback-hook, 2026-07-31)
1348
-
1349
- const { extractPrdDeliverablePaths, allDeliverablesAlreadyTracked } = require('../runVerify.cjs');
1350
- const REPO_ROOT = path.resolve(__dirname, '../../..');
1351
-
1352
- test('pass_no_commit: original PRD, PASS no commit, all deliverable paths already tracked in git → pass_no_commit_already_shipped', async () => {
1353
- const tmp = makeTmpDir();
1354
- try {
1355
- const slug = '655-needs-review-rca-feedback-hook';
1356
- writeLog(tmp, slug, noOpRunEvents('Verified rcaReport.cjs already shipped in e13168d; typecheck + tests green; no commit needed.\nSCHEDULER_VERDICT: PASS'));
1357
- const prdPath = writePrd(tmp, slug, 'Deliverables: `src/main/lib/rcaReport.cjs` and `src/main/__tests__/rcaReport.test.cjs`.');
1358
- const verdict = await verifyRun({
1359
- runDir: tmp,
1360
- prdPath,
1361
- queueEntry: { slug, status: 'running', cwd: REPO_ROOT },
1362
- allJobs: [],
1363
- committedDuringRun: false,
1364
- });
1365
- assert.equal(verdict.verdict, 'pass_no_commit_already_shipped', `expected already-shipped exemption, got ${verdict.verdict}: ${verdict.reason}`);
1366
- assert.equal(verdict.downgradeTo, null);
1367
- } finally {
1368
- rmdir(tmp);
1369
- }
1370
- });
1371
-
1372
- test('pass_no_commit: original PRD, PASS no commit, one deliverable path untracked → falls through to pass_no_commit', async () => {
1373
- const tmp = makeTmpDir();
1374
- try {
1375
- const slug = '655-needs-review-rca-feedback-hook';
1376
- writeLog(tmp, slug, noOpRunEvents('Nothing to do here.\nSCHEDULER_VERDICT: PASS'));
1377
- const prdPath = writePrd(tmp, slug, 'Deliverables: `src/main/lib/rcaReport.cjs` and `src/main/lib/does-not-exist-xyz.cjs`.');
1378
- const verdict = await verifyRun({
1379
- runDir: tmp,
1380
- prdPath,
1381
- queueEntry: { slug, status: 'running', cwd: REPO_ROOT },
1382
- allJobs: [],
1383
- committedDuringRun: false,
1384
- });
1385
- assert.equal(verdict.verdict, 'pass_no_commit', `expected fallback to pass_no_commit, got ${verdict.verdict}: ${verdict.reason}`);
1386
- } finally {
1387
- rmdir(tmp);
1388
- }
1389
- });
1390
-
1391
- test('pass_no_commit: original PRD, PASS no commit, zero extractable deliverable paths → falls through to pass_no_commit', async () => {
1392
- const tmp = makeTmpDir();
1393
- try {
1394
- const slug = '999-some-vague-prd';
1395
- writeLog(tmp, slug, noOpRunEvents('Nothing to do here.\nSCHEDULER_VERDICT: PASS'));
1396
- const prdPath = writePrd(tmp, slug, 'This PRD names no file paths at all, just prose.');
1397
- const verdict = await verifyRun({
1398
- runDir: tmp,
1399
- prdPath,
1400
- queueEntry: { slug, status: 'running', cwd: REPO_ROOT },
1401
- allJobs: [],
1402
- committedDuringRun: false,
1403
- });
1404
- assert.equal(verdict.verdict, 'pass_no_commit', `expected fallback to pass_no_commit, got ${verdict.verdict}: ${verdict.reason}`);
1405
- } finally {
1406
- rmdir(tmp);
1407
- }
1408
- });
1409
-
1410
- // (incident: 812-commit-guard-retry-on-worktree-ref-visibility-delay — a
1411
- // stale scheduler process, booted before the already-shipped exemption
1412
- // landed, produced a false pass_no_commit for exactly this shape of re-run)
1413
- test('pass_no_commit: commit-guard-retry PRD naming scheduler.cjs + its committed-in-window test, PASS no commit → pass_no_commit_already_shipped', async () => {
1414
- const tmp = makeTmpDir();
1415
- try {
1416
- const slug = '812-commit-guard-retry-on-worktree-ref-visibility-delay';
1417
- writeLog(tmp, slug, noOpRunEvents('Retry + tests already present; nothing to change.\nSCHEDULER_VERDICT: PASS'));
1418
- const prdPath = writePrd(
1419
- tmp,
1420
- slug,
1421
- 'Deliverables: `src/main/scheduler.cjs` and `src/main/__tests__/scheduler-committed-in-window.test.cjs`.',
1422
- );
1423
- const verdict = await verifyRun({
1424
- runDir: tmp,
1425
- prdPath,
1426
- queueEntry: { slug, status: 'running', cwd: REPO_ROOT },
1427
- allJobs: [],
1428
- committedDuringRun: false,
1429
- });
1430
- assert.equal(verdict.verdict, 'pass_no_commit_already_shipped', `expected already-shipped exemption, got ${verdict.verdict}: ${verdict.reason}`);
1431
- assert.equal(verdict.downgradeTo, null);
1432
- } finally {
1433
- rmdir(tmp);
1434
- }
1435
- });
1436
-
1437
- test('extractPrdDeliverablePaths: extracts backticked repo-relative paths, ignores prose', () => {
1438
- const body = 'Deliverables: `src/main/lib/rcaReport.cjs` and `src/main/__tests__/rcaReport.test.cjs`. Also see node_modules/foo/bar.js which should be excluded.';
1439
- const paths = extractPrdDeliverablePaths(body);
1440
- assert.deepEqual(paths, ['src/main/lib/rcaReport.cjs', 'src/main/__tests__/rcaReport.test.cjs']);
1441
- assert.deepEqual(extractPrdDeliverablePaths(''), []);
1442
- assert.deepEqual(extractPrdDeliverablePaths(undefined), []);
1443
- });
1444
-
1445
- test('allDeliverablesAlreadyTracked: fail-safe on empty paths, non-git cwd, and git errors', () => {
1446
- assert.equal(allDeliverablesAlreadyTracked({ cwd: REPO_ROOT, paths: [] }), false);
1447
- assert.equal(allDeliverablesAlreadyTracked({
1448
- cwd: REPO_ROOT,
1449
- paths: ['src/main/runVerify.cjs'],
1450
- execImpl: () => { throw new Error('boom'); },
1451
- }), false);
1452
- assert.equal(allDeliverablesAlreadyTracked({
1453
- cwd: REPO_ROOT,
1454
- paths: ['src/main/runVerify.cjs'],
1455
- execImpl: () => '',
1456
- }), true);
1457
- });
1458
-
1459
- // ─── repo-root config deliverable extraction ────────────────────────────────
1460
- // (incident: 816-vitest-register-runverify-test, 2026-07-31 — PRD named only
1461
- // `vitest.config.ts` as its deliverable; the source-dir-only regex extracted
1462
- // nothing, so allDeliverablesAlreadyTracked early-returned false even though
1463
- // the config edit was already tracked in git)
1464
-
1465
- test('extractPrdDeliverablePaths: extracts a root-config file alongside a src path', () => {
1466
- const body = 'Register the test in `vitest.config.ts` and port `src/main/__tests__/runVerify.test.cjs` onto vitest.';
1467
- const paths = extractPrdDeliverablePaths(body);
1468
- assert.deepEqual(new Set(paths), new Set(['vitest.config.ts', 'src/main/__tests__/runVerify.test.cjs']));
1469
- });
1470
-
1471
- test('extractPrdDeliverablePaths: root-config-only PRD body yields a non-empty result', () => {
1472
- const body = 'The only deliverable is `vitest.config.ts` — add the missing test.include entry.';
1473
- const paths = extractPrdDeliverablePaths(body);
1474
- assert.deepEqual(paths, ['vitest.config.ts']);
1475
- });
1476
-
1477
- test('extractPrdDeliverablePaths: nested or non-allowlisted root files do not produce spurious root-config entries', () => {
1478
- const body = 'See `some/nested/package.json` for the dependency, and update README.md with notes.';
1479
- const paths = extractPrdDeliverablePaths(body);
1480
- assert.equal(paths.includes('package.json'), false);
1481
- assert.equal(paths.includes('README.md'), false);
1482
- assert.deepEqual(paths, []);
1483
- });
1484
-
1485
- test('pass_no_commit: root-config-only PRD, PASS no commit, config already tracked → pass_no_commit_already_shipped', async () => {
1486
- const tmp = makeTmpDir();
1487
- try {
1488
- const slug = '816-vitest-register-runverify-test';
1489
- writeLog(tmp, slug, noOpRunEvents('Registered already in vitest.config.ts; 48 tests green.\nSCHEDULER_VERDICT: PASS'));
1490
- const prdPath = writePrd(tmp, slug, 'Deliverable: register the test file in `vitest.config.ts`.');
1491
- const verdict = await verifyRun({
1492
- runDir: tmp,
1493
- prdPath,
1494
- queueEntry: { slug, status: 'running', cwd: REPO_ROOT },
1495
- allJobs: [],
1496
- committedDuringRun: false,
1497
- });
1498
- assert.equal(verdict.verdict, 'pass_no_commit_already_shipped', `expected already-shipped exemption, got ${verdict.verdict}: ${verdict.reason}`);
1499
- assert.equal(verdict.downgradeTo, null);
1500
- } finally {
1501
- rmdir(tmp);
1502
- }
1503
- });
1504
-
1505
- // ─── pass_no_commit_prior_run_verified: re-fired slug whose PRIOR run landed ─
1506
- // (incident: 812-workbench-review-nits-cleanup, 2026-07-31)
1507
-
1508
- const { isAncestorCommit } = require('../runVerify.cjs');
1509
- const REPO_ROOT_COMMIT = execFileSync('git', ['rev-list', '--max-parents=0', 'HEAD'], {
1510
- cwd: REPO_ROOT, encoding: 'utf8',
1511
- }).trim().split('\n')[0];
1512
-
1513
- test('pass_no_commit: PASS, no commit, priorLandedCommit is an ancestor of HEAD → pass_no_commit_prior_run_verified', async () => {
1514
- const tmp = makeTmpDir();
1515
- try {
1516
- const slug = '812-workbench-review-nits-cleanup';
1517
- writeLog(tmp, slug, noOpRunEvents('Re-checked every AC item; all already implemented by an earlier run.\nSCHEDULER_VERDICT: PASS'));
1518
- const prdPath = writePrd(tmp, slug, 'This PRD names no deliverable paths, just prose.');
1519
- const verdict = await verifyRun({
1520
- runDir: tmp,
1521
- prdPath,
1522
- queueEntry: { slug, status: 'running', cwd: REPO_ROOT },
1523
- allJobs: [],
1524
- committedDuringRun: false,
1525
- priorLandedCommit: REPO_ROOT_COMMIT,
1526
- });
1527
- assert.equal(verdict.verdict, 'pass_no_commit_prior_run_verified', `expected prior-run exemption, got ${verdict.verdict}: ${verdict.reason}`);
1528
- assert.equal(verdict.downgradeTo, null);
1529
- assert.equal(verdict.priorLandedCommit, REPO_ROOT_COMMIT);
1530
- } finally {
1531
- rmdir(tmp);
1532
- }
1533
- });
1534
-
1535
- test('pass_no_commit: PASS, no commit, priorLandedCommit is NOT an ancestor of HEAD → pass_no_commit', async () => {
1536
- const tmp = makeTmpDir();
1537
- try {
1538
- const slug = '812-workbench-review-nits-cleanup';
1539
- writeLog(tmp, slug, noOpRunEvents('Nothing to do here.\nSCHEDULER_VERDICT: PASS'));
1540
- const prdPath = writePrd(tmp, slug, 'This PRD names no deliverable paths, just prose.');
1541
- const verdict = await verifyRun({
1542
- runDir: tmp,
1543
- prdPath,
1544
- queueEntry: { slug, status: 'running', cwd: REPO_ROOT },
1545
- allJobs: [],
1546
- committedDuringRun: false,
1547
- priorLandedCommit: '0000000000000000000000000000000000000000',
1548
- });
1549
- assert.equal(verdict.verdict, 'pass_no_commit', `expected fallback to pass_no_commit, got ${verdict.verdict}: ${verdict.reason}`);
1550
- } finally {
1551
- rmdir(tmp);
1552
- }
1553
- });
1554
-
1555
- test('isAncestorCommit: fail-safe on missing sha and on a throwing execImpl (git error)', () => {
1556
- assert.equal(isAncestorCommit({ cwd: REPO_ROOT, sha: null }), false);
1557
- assert.equal(isAncestorCommit({
1558
- cwd: REPO_ROOT,
1559
- sha: REPO_ROOT_COMMIT,
1560
- execImpl: () => { throw new Error('git: command not found'); },
1561
- }), false);
1562
- assert.equal(isAncestorCommit({
1563
- cwd: REPO_ROOT,
1564
- sha: REPO_ROOT_COMMIT,
1565
- execImpl: () => '',
1566
- }), true);
1567
- });
1568
-
1569
- test('pass_no_commit: PASS, no commit, priorLandedCommit not supplied (null) → pass_no_commit (regression guard)', async () => {
1570
- const tmp = makeTmpDir();
1571
- try {
1572
- const slug = '812-workbench-review-nits-cleanup';
1573
- writeLog(tmp, slug, noOpRunEvents('Nothing to do here.\nSCHEDULER_VERDICT: PASS'));
1574
- const prdPath = writePrd(tmp, slug, 'This PRD names no deliverable paths, just prose.');
1575
- const verdict = await verifyRun({
1576
- runDir: tmp,
1577
- prdPath,
1578
- queueEntry: { slug, status: 'running', cwd: REPO_ROOT },
1579
- allJobs: [],
1580
- committedDuringRun: false,
1581
- });
1582
- assert.equal(verdict.verdict, 'pass_no_commit', `expected pass_no_commit with no priorLandedCommit, got ${verdict.verdict}: ${verdict.reason}`);
1583
- } finally {
1584
- rmdir(tmp);
1585
- }
1586
- });
1587
-
1588
- // (e) halt + sentinel PASS → still halt (override must not apply to halt)
1589
- test('halt result + sentinel PASS + committedDuringRun:true → still halt', async () => {
1590
- const tmp = makeTmpDir();
1591
- try {
1592
- const slug = '77-halt-sentinel-pass';
1593
- const logEvents = [
1594
- {
1595
- type: 'assistant',
1596
- message: {
1597
- role: 'assistant',
1598
- content: [{
1599
- type: 'tool_use',
1600
- id: 'toolu_halt_001',
1601
- name: 'Bash',
1602
- input: { command: 'check deps', description: 'Check prerequisites' },
1603
- }],
1604
- },
1605
- },
1606
- {
1607
- type: 'user',
1608
- message: {
1609
- role: 'user',
1610
- content: [{
1611
- type: 'tool_result',
1612
- tool_use_id: 'toolu_halt_001',
1613
- content: 'dep not ready',
1614
- is_error: false,
1615
- }],
1616
- },
1617
- },
1618
- {
1619
- type: 'result',
1620
- subtype: 'success',
1621
- result: 'HALT: prerequisite not met\nSCHEDULER_VERDICT: PASS',
1622
- },
1623
- ];
1624
- writeLog(tmp, slug, logEvents);
1625
- const prdPath = writePrd(tmp, slug, '# Halt with sentinel');
1626
- const verdict = await verifyRun({
1627
- runDir: tmp,
1628
- prdPath,
1629
- queueEntry: { slug, status: 'running' },
1630
- allJobs: [],
1631
- committedDuringRun: true,
1632
- });
1633
- assert.equal(verdict.verdict, 'halt', `halt must survive even with PASS sentinel, got ${verdict.verdict}: ${verdict.reason}`);
1634
- assert.equal(verdict.downgradeTo, 'pending');
1635
- } finally {
1636
- rmdir(tmp);
1637
- }
1638
- });
1639
-
1640
- // ─── -merge-main postcondition exemption tests (2026-07-18 feedback) ──────────
1641
-
1642
- const { isMergeMainSlug, extractMergeMainPrNumber } = require('../runVerify.cjs');
1643
-
1644
- test('isMergeMainSlug matches the NN-prXXX-merge-main and NN-fix-prXXX-merge-main conventions', () => {
1645
- assert.equal(isMergeMainSlug('565-pr188-merge-main'), true);
1646
- assert.equal(isMergeMainSlug('571-fix-pr141-merge-main'), true);
1647
- assert.equal(isMergeMainSlug('523-fix-bounded-fix-plan-retry'), false);
1648
- assert.equal(isMergeMainSlug('406-capture-panel-ui'), false);
1649
- assert.equal(isMergeMainSlug(''), false);
1650
- assert.equal(isMergeMainSlug(undefined), false);
1651
- });
1652
-
1653
- test('extractMergeMainPrNumber prefers "PR #<n>" in text, falls back to slug', () => {
1654
- assert.equal(extractMergeMainPrNumber('565-pr188-merge-main', 'title: Merge current main into sigma PR #188 (round 2)'), 188);
1655
- assert.equal(extractMergeMainPrNumber('565-pr188-merge-main', 'no pr mention here'), 188);
1656
- assert.equal(extractMergeMainPrNumber('non-standard-slug', 'no pr mention here'), null);
1657
- });
1658
-
1659
- // (1) -merge-main + PASS + no commit + gh reports MERGEABLE/non-CONFLICTING → verified, no issue
1660
- test('merge-main exemption: gh reports MERGEABLE → pass_no_commit_target_verified, no issue pushed', async () => {
1661
- const tmp = makeTmpDir();
1662
- try {
1663
- const slug = '565-pr188-merge-main';
1664
- writeLog(tmp, slug, noOpRunEvents('PR #188 was already merged into main by another actor.\nSCHEDULER_VERDICT: PASS'));
1665
- const prdPath = writePrd(tmp, slug, '# Merge current main into sigma PR #188');
1666
- let ghCalls = 0;
1667
- const ghExecImpl = (cmd, args, opts) => {
1668
- ghCalls++;
1669
- assert.equal(cmd, 'gh');
1670
- assert.deepEqual(args, ['pr', 'view', '188', '--json', 'mergeable,mergeStateStatus']);
1671
- assert.equal(opts.cwd, '/tmp/sigma');
1672
- return JSON.stringify({ mergeable: 'MERGEABLE', mergeStateStatus: 'BEHIND' });
1673
- };
1674
- const verdict = await verifyRun({
1675
- runDir: tmp,
1676
- prdPath,
1677
- queueEntry: { slug, status: 'running', cwd: '/tmp/sigma' },
1678
- allJobs: [],
1679
- committedDuringRun: false,
1680
- ghExecImpl,
1681
- });
1682
- assert.equal(ghCalls, 1);
1683
- assert.equal(verdict.verdict, 'pass_no_commit_target_verified', `expected verified verdict, got ${verdict.verdict}: ${verdict.reason}`);
1684
- assert.equal(verdict.downgradeTo, null);
1685
- assert.equal(verdict.verifiedPrNumber, 188);
1686
- } finally {
1687
- rmdir(tmp);
1688
- }
1689
- });
1690
-
1691
- // (2) -merge-main + PASS + no commit + gh reports CONFLICTING → falls through to pass_no_commit
1692
- test('merge-main exemption: gh reports CONFLICTING → falls through to pass_no_commit', async () => {
1693
- const tmp = makeTmpDir();
1694
- try {
1695
- const slug = '565-pr188-merge-main';
1696
- writeLog(tmp, slug, noOpRunEvents('PR #188 needs no further work.\nSCHEDULER_VERDICT: PASS'));
1697
- const prdPath = writePrd(tmp, slug, '# Merge current main into sigma PR #188');
1698
- const ghExecImpl = () => JSON.stringify({ mergeable: 'MERGEABLE', mergeStateStatus: 'CONFLICTING' });
1699
- const verdict = await verifyRun({
1700
- runDir: tmp,
1701
- prdPath,
1702
- queueEntry: { slug, status: 'running', cwd: '/tmp/sigma' },
1703
- allJobs: [],
1704
- committedDuringRun: false,
1705
- ghExecImpl,
1706
- });
1707
- assert.equal(verdict.verdict, 'pass_no_commit', `expected fallback to pass_no_commit, got ${verdict.verdict}: ${verdict.reason}`);
1708
- assert.equal(verdict.downgradeTo, 'needs_review');
1709
- } finally {
1710
- rmdir(tmp);
1711
- }
1712
- });
1713
-
1714
- // (3) -merge-main + PASS + no commit + gh call fails/times out → falls through to pass_no_commit, never throws
1715
- test('merge-main exemption: gh call throws → falls through to pass_no_commit, never throws', async () => {
1716
- const tmp = makeTmpDir();
1717
- try {
1718
- const slug = '565-pr188-merge-main';
1719
- writeLog(tmp, slug, noOpRunEvents('PR #188 needs no further work.\nSCHEDULER_VERDICT: PASS'));
1720
- const prdPath = writePrd(tmp, slug, '# Merge current main into sigma PR #188');
1721
- const ghExecImpl = () => { throw new Error('gh: command not found'); };
1722
- const verdict = await verifyRun({
1723
- runDir: tmp,
1724
- prdPath,
1725
- queueEntry: { slug, status: 'running', cwd: '/tmp/sigma' },
1726
- allJobs: [],
1727
- committedDuringRun: false,
1728
- ghExecImpl,
1729
- });
1730
- assert.equal(verdict.verdict, 'pass_no_commit', `expected fallback to pass_no_commit, got ${verdict.verdict}: ${verdict.reason}`);
1731
- assert.equal(verdict.downgradeTo, 'needs_review');
1732
- } finally {
1733
- rmdir(tmp);
1734
- }
1735
- });
1736
-
1737
- // (4) non-merge-main slug, PASS + no commit → unchanged pass_no_commit behavior, zero gh invocations
1738
- test('merge-main exemption: non-merge-main slug never attempts a gh call', async () => {
1739
- const tmp = makeTmpDir();
1740
- try {
1741
- const slug = '406-capture-panel-ui';
1742
- writeLog(tmp, slug, noOpRunEvents('All acceptance criteria verified.\nSCHEDULER_VERDICT: PASS'));
1743
- const prdPath = writePrd(tmp, slug, '# Browser capture panel UI');
1744
- let ghCalls = 0;
1745
- const ghExecImpl = () => { ghCalls++; return JSON.stringify({ mergeable: 'MERGEABLE', mergeStateStatus: 'CLEAN' }); };
1746
- const verdict = await verifyRun({
1747
- runDir: tmp,
1748
- prdPath,
1749
- queueEntry: { slug, status: 'running', cwd: '/tmp/proj' },
1750
- allJobs: [],
1751
- committedDuringRun: false,
1752
- ghExecImpl,
1753
- });
1754
- assert.equal(ghCalls, 0, 'gh must never be invoked for a non-merge-main slug');
1755
- assert.equal(verdict.verdict, 'pass_no_commit', `expected unchanged pass_no_commit, got ${verdict.verdict}: ${verdict.reason}`);
1756
- assert.equal(verdict.downgradeTo, 'needs_review');
1757
- } finally {
1758
- rmdir(tmp);
1759
- }
1760
- });
1761
-
1762
- // (5) -merge-main slug but a real commit DID land → unaffected, path unreachable, zero gh invocations
1763
- test('merge-main exemption: commit landed → path unreachable, zero gh invocations, verdict clean', async () => {
1764
- const tmp = makeTmpDir();
1765
- try {
1766
- const slug = '565-pr188-merge-main';
1767
- writeLog(tmp, slug, noOpRunEvents('Merged and pushed.\nSCHEDULER_VERDICT: PASS'));
1768
- const prdPath = writePrd(tmp, slug, '# Merge current main into sigma PR #188');
1769
- let ghCalls = 0;
1770
- const ghExecImpl = () => { ghCalls++; return JSON.stringify({ mergeable: 'MERGEABLE', mergeStateStatus: 'CLEAN' }); };
1771
- const verdict = await verifyRun({
1772
- runDir: tmp,
1773
- prdPath,
1774
- queueEntry: { slug, status: 'running', cwd: '/tmp/sigma' },
1775
- allJobs: [],
1776
- committedDuringRun: true,
1777
- ghExecImpl,
1778
- });
1779
- assert.equal(ghCalls, 0, 'gh must never be invoked when a commit already landed');
1780
- assert.equal(verdict.verdict, 'clean', `expected clean (commit landed, sentinel PASS), got ${verdict.verdict}: ${verdict.reason}`);
1781
- } finally {
1782
- rmdir(tmp);
1783
- }
1784
- });