claude-code-session-manager 0.98.0 → 0.100.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (431) hide show
  1. package/README.md +3 -3
  2. package/bin/cli.cjs +16 -4
  3. package/bin/node-floor.cjs +41 -0
  4. package/dist/assets/{DataModel-DCEgMTjH.js → DataModel-HdR0AxFq.js} +1 -1
  5. package/dist/assets/{History-Bfdoywlh.js → History-Dr4Jr_5z.js} +2 -2
  6. package/dist/assets/{Hooks-CKDJjTJV.js → Hooks-NhrvH3JP.js} +3 -3
  7. package/dist/assets/{Library-7akfgy67.js → Library-Dv_EtIMr.js} +1 -1
  8. package/dist/assets/{MarkdownEditor-DDesiqet.js → MarkdownEditor-DTKDWV_n.js} +1 -1
  9. package/dist/assets/{McpServers-D4lZtXof.js → McpServers-M034G9B3.js} +2 -2
  10. package/dist/assets/{Memory-CeI8G1w5.js → Memory-DzF1B4gx.js} +6 -6
  11. package/dist/assets/{Permissions-BGleLja4.js → Permissions-DrgbSGWl.js} +3 -3
  12. package/dist/assets/{Plugins-P4eCXy_S.js → Plugins-Bd3ef35w.js} +2 -2
  13. package/dist/assets/{ProvenanceBadge-BFczzI1B.js → ProvenanceBadge-DcBHT1Iy.js} +1 -1
  14. package/dist/assets/{SaveBar-l9jnEMES.js → SaveBar-rimJem-Y.js} +1 -1
  15. package/dist/assets/Scheduler-DjgFJl2w.js +16 -0
  16. package/dist/assets/{ScopeSwitcher-CjJi8ST5.js → ScopeSwitcher-CnAzTBrl.js} +1 -1
  17. package/dist/assets/Settings-Dc1F_sSg.js +3 -0
  18. package/dist/assets/{SkillReferenceGraph-CjbO01Sg.js → SkillReferenceGraph-B9aZDecM.js} +1 -1
  19. package/dist/assets/{Skills-BxZ9_fCR.js → Skills-DRXd18gu.js} +2 -2
  20. package/dist/assets/{SystemPrompt-D8vfFb8b.js → SystemPrompt-ahy5-Fwe.js} +1 -1
  21. package/dist/assets/{TagLibrary-2vzUo7YL.js → TagLibrary-C_tToDeL.js} +1 -1
  22. package/dist/assets/{TiptapBody-B8ZfbK90.js → TiptapBody-DvdefS6K.js} +1 -1
  23. package/dist/assets/{Toggle-BbW4nGGf.js → Toggle-6Jl5Njc6.js} +1 -1
  24. package/dist/assets/{index-CKH5Uxik.css → index-Bta-hwud.css} +1 -1
  25. package/dist/assets/{index-Cd98Q1lD.js → index-vx8O73l8.js} +497 -502
  26. package/dist/assets/{settingsSchema-IhUfucCF.js → settingsSchema-D6iRguNV.js} +1 -1
  27. package/dist/index.html +2 -2
  28. package/package.json +25 -29
  29. package/plugins/CLAUDE.md +6 -6
  30. package/plugins/session-manager-dev/skills/builder/4-manual/SKILL.md +21 -19
  31. package/plugins/session-manager-dev/skills/builder/SKILL.md +3 -3
  32. package/plugins/session-manager-dev/skills/develop/SKILL.md +254 -510
  33. package/plugins/session-manager-dev/skills/develop/standards.md +17 -22
  34. package/scripts/README.md +3 -11
  35. package/scripts/audit-ops-hygiene.cjs +3 -3
  36. package/scripts/hooks/lib/guard-prd-writes-policy.cjs +1 -1
  37. package/scripts/hooks/lib/guard-self-schedule-policy.cjs +1 -1
  38. package/scripts/mint-epic.cjs +2 -3
  39. package/scripts/scheduler-mcp-server.cjs +36 -7
  40. package/src/main/agentLibrary.cjs +22 -2
  41. package/src/main/build-info.json +4 -4
  42. package/src/main/config.cjs +41 -38
  43. package/src/main/docEdit.cjs +4 -1
  44. package/src/main/files.cjs +2 -5
  45. package/src/main/health.cjs +1 -1
  46. package/src/main/index.cjs +23 -10
  47. package/src/main/ipcSchemas.cjs +28 -35
  48. package/src/main/lib/agentPersonaSchema.cjs +13 -2
  49. package/src/main/lib/atomicFs.cjs +116 -0
  50. package/src/main/lib/branchSweep.cjs +13 -12
  51. package/src/main/lib/buildTarget.cjs +3 -3
  52. package/src/main/lib/claudeCliCaps.cjs +129 -0
  53. package/src/main/lib/credentials.cjs +2 -4
  54. package/src/main/lib/crossProjectFeedback.cjs +3 -3
  55. package/src/main/lib/cwdClassify.cjs +15 -3
  56. package/src/main/lib/definitionOfDone.cjs +207 -125
  57. package/src/main/lib/dodDrainHook.cjs +11 -5
  58. package/src/main/lib/epicMint.cjs +2 -4
  59. package/src/main/lib/epicStatusMirror.cjs +8 -10
  60. package/src/main/lib/epicWorktreeProjectConfig.cjs +2 -4
  61. package/src/main/lib/gateAuthority.cjs +96 -0
  62. package/src/main/lib/gitExec.cjs +69 -0
  63. package/src/main/lib/gitWorktree.cjs +656 -92
  64. package/src/main/lib/instanceLock.cjs +5 -8
  65. package/src/main/lib/launchFailure.cjs +2 -3
  66. package/src/main/lib/macroLibrary.cjs +386 -0
  67. package/src/main/lib/mcpToolCatalog.cjs +26 -17
  68. package/src/main/lib/needsReviewLedger.cjs +1 -1
  69. package/src/main/lib/opsErrorLog.cjs +11 -1
  70. package/src/main/lib/opsOwnership.cjs +0 -5
  71. package/src/main/lib/pidAlive.cjs +32 -0
  72. package/src/main/lib/prdCreate.cjs +121 -12
  73. package/src/main/lib/prdDisposition.cjs +2 -2
  74. package/src/main/lib/prdGateFiles.cjs +284 -0
  75. package/src/main/lib/prdLocations.cjs +61 -0
  76. package/src/main/lib/prdMigration.cjs +2 -3
  77. package/src/main/lib/prdSizing.cjs +2 -1
  78. package/src/main/lib/promptSessionSchema.cjs +10 -2
  79. package/src/main/lib/rcaReport.cjs +4 -6
  80. package/src/main/lib/reaperHelpers.cjs +8 -1
  81. package/src/main/lib/reservationExpiry.cjs +6 -1
  82. package/src/main/lib/reviewNotice.cjs +263 -0
  83. package/src/main/lib/runClaudeP.cjs +4 -1
  84. package/src/main/lib/schedulerPaths.cjs +22 -2
  85. package/src/main/lib/sessionSlots.cjs +2 -4
  86. package/src/main/lib/shippedPersonaSeeds.cjs +179 -0
  87. package/src/main/lib/timeoutShim.cjs +123 -0
  88. package/src/main/lib/timeoutShimScript.cjs +275 -0
  89. package/src/main/lib/upgradeDrain.cjs +4 -10
  90. package/src/main/lib/watchdogHelpers.cjs +12 -25
  91. package/src/main/lib/workTypeLibrary.cjs +7 -1
  92. package/src/main/promptSessionEvents.cjs +37 -13
  93. package/src/main/scheduler.cjs +910 -198
  94. package/src/main/seedAgentPersonas.cjs +278 -23
  95. package/src/main/supervisor.cjs +4 -1
  96. package/src/main/templates/PRD_AUTHORING.md +126 -406
  97. package/src/preload/__tests__/preload-surface.test.cjs +68 -0
  98. package/src/preload/api.d.ts +41 -94
  99. package/src/preload/index.cjs +14 -9
  100. package/src/seed/agents/architect.md +1 -0
  101. package/src/seed/agents/dev-lead.md +17 -18
  102. package/src/seed/agents/project-home-builder.md +1 -0
  103. package/src/seed/agents/validator.md +10 -4
  104. package/dist/assets/HostBilko-CDVHE0hT.js +0 -1
  105. package/dist/assets/Scheduler-C_phpeUS.js +0 -16
  106. package/dist/assets/Settings-BIwZ3FGQ.js +0 -3
  107. package/src/main/__tests__/activeIndexMerge.test.cjs +0 -235
  108. package/src/main/__tests__/agentEffortResolve.test.cjs +0 -117
  109. package/src/main/__tests__/agentLibrary.test.cjs +0 -276
  110. package/src/main/__tests__/agentModelResolve.test.cjs +0 -311
  111. package/src/main/__tests__/agentOverlayWrite.test.cjs +0 -95
  112. package/src/main/__tests__/bilkoHost-deriveSlug.test.cjs +0 -26
  113. package/src/main/__tests__/bilkoHost-integration.test.cjs +0 -118
  114. package/src/main/__tests__/bilkoHostCore.test.cjs +0 -72
  115. package/src/main/__tests__/broadcastCoalescer.test.cjs +0 -122
  116. package/src/main/__tests__/chat-cancel-terminal.test.cjs +0 -120
  117. package/src/main/__tests__/chat-dead-channels.test.cjs +0 -63
  118. package/src/main/__tests__/chat-exit-close-race.test.cjs +0 -146
  119. package/src/main/__tests__/chat-mcp-consent-notice.test.cjs +0 -139
  120. package/src/main/__tests__/chat-preamble-anchors.test.cjs +0 -100
  121. package/src/main/__tests__/chat-queue.test.cjs +0 -97
  122. package/src/main/__tests__/chat-stop-signal.test.cjs +0 -89
  123. package/src/main/__tests__/chatRunner-epic-worktree-execcwd.test.cjs +0 -125
  124. package/src/main/__tests__/chatRunner-session-flag-retry.test.cjs +0 -252
  125. package/src/main/__tests__/classifyPromptTicket.test.cjs +0 -101
  126. package/src/main/__tests__/classifyTranscriptLine.test.cjs +0 -201
  127. package/src/main/__tests__/computeDepHistorySatisfaction.test.cjs +0 -66
  128. package/src/main/__tests__/config-readText-bounded.test.cjs +0 -84
  129. package/src/main/__tests__/configWriteBoundaryOwners.test.cjs +0 -59
  130. package/src/main/__tests__/crossProjectFeedback.test.cjs +0 -334
  131. package/src/main/__tests__/crossProjectFeedbackRoutes.test.cjs +0 -161
  132. package/src/main/__tests__/dep-orphan-archive-health.test.cjs +0 -77
  133. package/src/main/__tests__/develop-skill-failure-modes.test.cjs +0 -70
  134. package/src/main/__tests__/docEdit.test.cjs +0 -244
  135. package/src/main/__tests__/dod-batchkey.test.cjs +0 -183
  136. package/src/main/__tests__/dod-drain-hook.test.cjs +0 -302
  137. package/src/main/__tests__/dod-report.test.cjs +0 -304
  138. package/src/main/__tests__/dod-reverify.test.cjs +0 -285
  139. package/src/main/__tests__/epicContextDigest.test.cjs +0 -174
  140. package/src/main/__tests__/epicMint.test.cjs +0 -332
  141. package/src/main/__tests__/epicMintTelemetryTap.test.cjs +0 -64
  142. package/src/main/__tests__/epicStatusMirror.test.cjs +0 -110
  143. package/src/main/__tests__/epicValidationHook.test.cjs +0 -291
  144. package/src/main/__tests__/exchanges.test.cjs +0 -122
  145. package/src/main/__tests__/exchangesPromptId.test.cjs +0 -61
  146. package/src/main/__tests__/extractJson.test.cjs +0 -51
  147. package/src/main/__tests__/files-reject-credentials.test.cjs +0 -40
  148. package/src/main/__tests__/fixtures/1218-fo-01-move-scripts-lib-into-src-main-lib.log +0 -556
  149. package/src/main/__tests__/flatPrdTickSweep.test.cjs +0 -110
  150. package/src/main/__tests__/health-build-freshness.test.cjs +0 -39
  151. package/src/main/__tests__/health-claude-md-budget.test.cjs +0 -57
  152. package/src/main/__tests__/health-credentials.test.cjs +0 -81
  153. package/src/main/__tests__/health-delegation-chain.test.cjs +0 -124
  154. package/src/main/__tests__/health-per-project-stall.test.cjs +0 -84
  155. package/src/main/__tests__/health-prd-migration.test.cjs +0 -37
  156. package/src/main/__tests__/health-queue-dispatch.test.cjs +0 -135
  157. package/src/main/__tests__/health-starve-escalation.test.cjs +0 -94
  158. package/src/main/__tests__/health-tick-liveness.test.cjs +0 -179
  159. package/src/main/__tests__/health-usage-poller.test.cjs +0 -144
  160. package/src/main/__tests__/health-worktree-cap-blocked.test.cjs +0 -65
  161. package/src/main/__tests__/heapSnapshot.test.cjs +0 -121
  162. package/src/main/__tests__/historyAggregatorIntraday.test.cjs +0 -313
  163. package/src/main/__tests__/historyDashboard.test.cjs +0 -163
  164. package/src/main/__tests__/historyRollup.test.cjs +0 -333
  165. package/src/main/__tests__/intradayRefresh.test.cjs +0 -39
  166. package/src/main/__tests__/ipcSchemas-dependsOn.test.cjs +0 -39
  167. package/src/main/__tests__/kg-augment.test.cjs +0 -195
  168. package/src/main/__tests__/loadGateDetailTick.test.cjs +0 -31
  169. package/src/main/__tests__/machineProfile.test.cjs +0 -152
  170. package/src/main/__tests__/mcpStatus.test.cjs +0 -61
  171. package/src/main/__tests__/memoryAggregate.test.cjs +0 -109
  172. package/src/main/__tests__/memoryStale.test.cjs +0 -88
  173. package/src/main/__tests__/needsReviewLedger.test.cjs +0 -162
  174. package/src/main/__tests__/openExternalApp-spawn-error.test.cjs +0 -25
  175. package/src/main/__tests__/opsErrorLog.test.cjs +0 -109
  176. package/src/main/__tests__/opsErrorLogTelemetryTap.test.cjs +0 -173
  177. package/src/main/__tests__/personaMerge.test.cjs +0 -169
  178. package/src/main/__tests__/planValidator.test.cjs +0 -125
  179. package/src/main/__tests__/pollLoop-dispatch-on-failure.test.cjs +0 -176
  180. package/src/main/__tests__/prd-group-allocator.test.cjs +0 -119
  181. package/src/main/__tests__/prdAdminRouteParity.test.cjs +0 -70
  182. package/src/main/__tests__/prdAdminRoutes.test.cjs +0 -718
  183. package/src/main/__tests__/prdAgentType.test.cjs +0 -103
  184. package/src/main/__tests__/prdAuthoringSeed.test.cjs +0 -39
  185. package/src/main/__tests__/prdCreate.test.cjs +0 -979
  186. package/src/main/__tests__/prdCreateAdoption.test.cjs +0 -205
  187. package/src/main/__tests__/prdCreateDisposition.test.cjs +0 -201
  188. package/src/main/__tests__/prdCreatePlanId.test.cjs +0 -132
  189. package/src/main/__tests__/prdFrontmatterAgentType.test.cjs +0 -117
  190. package/src/main/__tests__/prdFrontmatterDependsOn.test.cjs +0 -136
  191. package/src/main/__tests__/prdFrontmatterDisposition.test.cjs +0 -125
  192. package/src/main/__tests__/prdFrontmatterQuietMachine.test.cjs +0 -108
  193. package/src/main/__tests__/prdLocations.test.cjs +0 -195
  194. package/src/main/__tests__/prdLocationsArchived.test.cjs +0 -201
  195. package/src/main/__tests__/prdMigration.test.cjs +0 -349
  196. package/src/main/__tests__/prdMigrationLegacyAdopt.test.cjs +0 -91
  197. package/src/main/__tests__/prdParserHighWater.test.cjs +0 -74
  198. package/src/main/__tests__/prdParserSourcePromptId.test.cjs +0 -65
  199. package/src/main/__tests__/prdSetDisposition.test.cjs +0 -222
  200. package/src/main/__tests__/prdSizing.test.cjs +0 -106
  201. package/src/main/__tests__/prdSourcePromptIdBackfill.test.cjs +0 -118
  202. package/src/main/__tests__/prdUpdateDependsOn.test.cjs +0 -160
  203. package/src/main/__tests__/proc-role-env.test.cjs +0 -125
  204. package/src/main/__tests__/procname-claude-spawn-sites.test.cjs +0 -304
  205. package/src/main/__tests__/procname-sm-processes.test.cjs +0 -127
  206. package/src/main/__tests__/projectHomeAdminRoutes.test.cjs +0 -177
  207. package/src/main/__tests__/projectPages.test.cjs +0 -137
  208. package/src/main/__tests__/promptSessionEvents.test.cjs +0 -234
  209. package/src/main/__tests__/promptSessionSchema.test.cjs +0 -101
  210. package/src/main/__tests__/promptSessionTranscript.test.cjs +0 -0
  211. package/src/main/__tests__/promptSessionsCreateEpicHandler.test.cjs +0 -159
  212. package/src/main/__tests__/pty-epic-worktree-spawn-cwd.test.cjs +0 -282
  213. package/src/main/__tests__/pty-session-open-telemetry.test.cjs +0 -96
  214. package/src/main/__tests__/pty-write-result.test.cjs +0 -46
  215. package/src/main/__tests__/queue-health-verdict.test.cjs +0 -170
  216. package/src/main/__tests__/queue-starvation-dispatch-driver.test.cjs +0 -286
  217. package/src/main/__tests__/queue-starvation-per-project.test.cjs +0 -147
  218. package/src/main/__tests__/queueHistory.test.cjs +0 -355
  219. package/src/main/__tests__/queueOps-interactive-ac-lint.test.cjs +0 -65
  220. package/src/main/__tests__/queueOpsArchiveDestination.test.cjs +0 -65
  221. package/src/main/__tests__/queueOpsAutoArchive.test.cjs +0 -211
  222. package/src/main/__tests__/rateLimitPollerStreak.test.cjs +0 -128
  223. package/src/main/__tests__/rcaReport.test.cjs +0 -266
  224. package/src/main/__tests__/reconcileFlatPrdSweep.test.cjs +0 -119
  225. package/src/main/__tests__/reconcileTiming.test.cjs +0 -135
  226. package/src/main/__tests__/runLogRetention.test.cjs +0 -489
  227. package/src/main/__tests__/runVerify-atomic-verdicts.test.cjs +0 -26
  228. package/src/main/__tests__/runVerify-blocked-by-foreign-wip.test.cjs +0 -58
  229. package/src/main/__tests__/runVerify-landed-commit-outranks.test.cjs +0 -191
  230. package/src/main/__tests__/runVerify-policy-denial.test.cjs +0 -89
  231. package/src/main/__tests__/runVerify-transcript-commit-evidence.test.cjs +0 -225
  232. package/src/main/__tests__/runVerify.test.cjs +0 -1784
  233. package/src/main/__tests__/scheduleJobSchema.test.cjs +0 -127
  234. package/src/main/__tests__/scheduleJobStatusDrift.test.cjs +0 -65
  235. package/src/main/__tests__/scheduleJobTransitions.test.cjs +0 -277
  236. package/src/main/__tests__/scheduleJobTransitionsGrep.test.cjs +0 -59
  237. package/src/main/__tests__/scheduleJobTransitionsTelemetryTap.test.cjs +0 -72
  238. package/src/main/__tests__/scheduler-admin-routes.test.cjs +0 -199
  239. package/src/main/__tests__/scheduler-adopted-run-supervision.test.cjs +0 -143
  240. package/src/main/__tests__/scheduler-already-satisfied-on-main.test.cjs +0 -105
  241. package/src/main/__tests__/scheduler-archive-completed-prd.test.cjs +0 -102
  242. package/src/main/__tests__/scheduler-archived-twin-guard.test.cjs +0 -155
  243. package/src/main/__tests__/scheduler-autofix-outcome.test.cjs +0 -188
  244. package/src/main/__tests__/scheduler-autofix-select.test.cjs +0 -439
  245. package/src/main/__tests__/scheduler-autopromote.test.cjs +0 -51
  246. package/src/main/__tests__/scheduler-bash-timeout-env.test.cjs +0 -101
  247. package/src/main/__tests__/scheduler-blocked-by-foreign-wip.test.cjs +0 -107
  248. package/src/main/__tests__/scheduler-boot-orphans.test.cjs +0 -153
  249. package/src/main/__tests__/scheduler-broadcast-reconcile.test.cjs +0 -121
  250. package/src/main/__tests__/scheduler-clear-queue-history.test.cjs +0 -134
  251. package/src/main/__tests__/scheduler-commit-guard-noop.test.cjs +0 -244
  252. package/src/main/__tests__/scheduler-committed-in-window.test.cjs +0 -182
  253. package/src/main/__tests__/scheduler-cross-project-batch.test.cjs +0 -43
  254. package/src/main/__tests__/scheduler-default-eligible-heal.test.cjs +0 -168
  255. package/src/main/__tests__/scheduler-dispatch-loop.test.cjs +0 -58
  256. package/src/main/__tests__/scheduler-effective-concurrency.test.cjs +0 -81
  257. package/src/main/__tests__/scheduler-epic-digest.test.cjs +0 -227
  258. package/src/main/__tests__/scheduler-failed-autoreset.test.cjs +0 -121
  259. package/src/main/__tests__/scheduler-finalize-dispatch-guards.test.cjs +0 -229
  260. package/src/main/__tests__/scheduler-find-prd-dir.test.cjs +0 -75
  261. package/src/main/__tests__/scheduler-fix-plan-path.test.cjs +0 -119
  262. package/src/main/__tests__/scheduler-force-tick-outcome.test.cjs +0 -46
  263. package/src/main/__tests__/scheduler-foreign-wip-manifest.test.cjs +0 -78
  264. package/src/main/__tests__/scheduler-gate-shadow.test.cjs +0 -119
  265. package/src/main/__tests__/scheduler-guard-verdict-autoresolve.test.cjs +0 -390
  266. package/src/main/__tests__/scheduler-heal-refusal.test.cjs +0 -61
  267. package/src/main/__tests__/scheduler-heartbeat-payload.test.cjs +0 -80
  268. package/src/main/__tests__/scheduler-inplace-salvage.test.cjs +0 -323
  269. package/src/main/__tests__/scheduler-integration-failure-stamp.test.cjs +0 -41
  270. package/src/main/__tests__/scheduler-investigation-clean-skip.test.cjs +0 -63
  271. package/src/main/__tests__/scheduler-investigation-prompt.test.cjs +0 -123
  272. package/src/main/__tests__/scheduler-job-budget.test.cjs +0 -172
  273. package/src/main/__tests__/scheduler-job-overrun.test.cjs +0 -175
  274. package/src/main/__tests__/scheduler-launch-failure.test.cjs +0 -199
  275. package/src/main/__tests__/scheduler-leftover-fields.test.cjs +0 -52
  276. package/src/main/__tests__/scheduler-leftover-quarantine.test.cjs +0 -199
  277. package/src/main/__tests__/scheduler-looks-done.test.cjs +0 -537
  278. package/src/main/__tests__/scheduler-manual-pause.test.cjs +0 -118
  279. package/src/main/__tests__/scheduler-mechanical-recovery.test.cjs +0 -245
  280. package/src/main/__tests__/scheduler-meta-code-sha.test.cjs +0 -46
  281. package/src/main/__tests__/scheduler-mutate-reentrancy.test.cjs +0 -117
  282. package/src/main/__tests__/scheduler-needs-review-autoresolve.test.cjs +0 -197
  283. package/src/main/__tests__/scheduler-never-stop.test.cjs +0 -157
  284. package/src/main/__tests__/scheduler-no-dead-end-status.test.cjs +0 -152
  285. package/src/main/__tests__/scheduler-no-orphan-run-dir.test.cjs +0 -81
  286. package/src/main/__tests__/scheduler-notify-originating-tab-transcript.test.cjs +0 -87
  287. package/src/main/__tests__/scheduler-notify-originating-tab.test.cjs +0 -343
  288. package/src/main/__tests__/scheduler-periodic-reverify-guard.test.cjs +0 -217
  289. package/src/main/__tests__/scheduler-porcelain-rename.test.cjs +0 -164
  290. package/src/main/__tests__/scheduler-prd-missing-skip.test.cjs +0 -161
  291. package/src/main/__tests__/scheduler-prd-persona-spawn.test.cjs +0 -178
  292. package/src/main/__tests__/scheduler-quarantine-autoresolve.test.cjs +0 -165
  293. package/src/main/__tests__/scheduler-quiet-machine-lease.test.cjs +0 -257
  294. package/src/main/__tests__/scheduler-rate-limit-cooldown-freshness.test.cjs +0 -123
  295. package/src/main/__tests__/scheduler-rate-limit-pause.test.cjs +0 -152
  296. package/src/main/__tests__/scheduler-rate-limit-spin-guard.test.cjs +0 -156
  297. package/src/main/__tests__/scheduler-reap-dead-running-jobs.test.cjs +0 -754
  298. package/src/main/__tests__/scheduler-reaper-helpers-basics.test.cjs +0 -87
  299. package/src/main/__tests__/scheduler-reconcile-cwd-preserve.test.cjs +0 -100
  300. package/src/main/__tests__/scheduler-reconcile-history-backfill.test.cjs +0 -105
  301. package/src/main/__tests__/scheduler-reconcile-invalid-repair.test.cjs +0 -203
  302. package/src/main/__tests__/scheduler-reconcile-quarantine.test.cjs +0 -247
  303. package/src/main/__tests__/scheduler-reset-job-fields-guard.test.cjs +0 -77
  304. package/src/main/__tests__/scheduler-resume-recovery.test.cjs +0 -254
  305. package/src/main/__tests__/scheduler-shard-quarantine.test.cjs +0 -115
  306. package/src/main/__tests__/scheduler-shared-tree-guard.test.cjs +0 -380
  307. package/src/main/__tests__/scheduler-sigterm-commit.test.cjs +0 -43
  308. package/src/main/__tests__/scheduler-stall-per-project.test.cjs +0 -126
  309. package/src/main/__tests__/scheduler-starve-escalation.test.cjs +0 -154
  310. package/src/main/__tests__/scheduler-stranded-autofix-park.test.cjs +0 -252
  311. package/src/main/__tests__/scheduler-stranded-investigation.test.cjs +0 -185
  312. package/src/main/__tests__/scheduler-stuck-failed-escalation.test.cjs +0 -136
  313. package/src/main/__tests__/scheduler-supervisor-record.test.cjs +0 -81
  314. package/src/main/__tests__/scheduler-tick-cancel-token.test.cjs +0 -54
  315. package/src/main/__tests__/scheduler-tick-wedge.test.cjs +0 -172
  316. package/src/main/__tests__/scheduler-transient-failure.test.cjs +0 -141
  317. package/src/main/__tests__/scheduler-unreadable-queue-guard.test.cjs +0 -62
  318. package/src/main/__tests__/scheduler-utilization-hold.test.cjs +0 -89
  319. package/src/main/__tests__/scheduler-verify-prd-path.test.cjs +0 -109
  320. package/src/main/__tests__/scheduler-worktree-cap-defer.test.cjs +0 -234
  321. package/src/main/__tests__/scheduler-worktree-exec-cwd.test.cjs +0 -120
  322. package/src/main/__tests__/scheduler-writeprd-epic-rollback.test.cjs +0 -105
  323. package/src/main/__tests__/schedulerBatchRootBlocker.test.cjs +0 -117
  324. package/src/main/__tests__/schedulerStateSidecarRestore.test.cjs +0 -110
  325. package/src/main/__tests__/seedAgentPersonas.test.cjs +0 -184
  326. package/src/main/__tests__/seedSchedulerMcp.test.cjs +0 -211
  327. package/src/main/__tests__/seedStatus.test.cjs +0 -100
  328. package/src/main/__tests__/seedValidatorPersona.test.cjs +0 -116
  329. package/src/main/__tests__/stop-signal-anchor.test.cjs +0 -75
  330. package/src/main/__tests__/telemetryClient.test.cjs +0 -1055
  331. package/src/main/__tests__/telemetryContract.test.cjs +0 -930
  332. package/src/main/__tests__/telemetrySettings.test.cjs +0 -210
  333. package/src/main/__tests__/transcripts-batch-flush.test.cjs +0 -249
  334. package/src/main/__tests__/transcripts-doFlush-array.test.cjs +0 -124
  335. package/src/main/__tests__/transcripts-paged-reads.test.cjs +0 -241
  336. package/src/main/__tests__/transcripts-worktree-epic-path.test.cjs +0 -154
  337. package/src/main/__tests__/transcriptsUsageFor.test.cjs +0 -206
  338. package/src/main/__tests__/uniquePrdNumbers.test.cjs +0 -153
  339. package/src/main/__tests__/usageSingleFlight.test.cjs +0 -169
  340. package/src/main/__tests__/validationSentinels.test.cjs +0 -84
  341. package/src/main/__tests__/workTypeLibrary.test.cjs +0 -89
  342. package/src/main/bilkoHost.cjs +0 -314
  343. package/src/main/bilkoHostCore.cjs +0 -89
  344. package/src/main/lib/__tests__/active-sessions.test.cjs +0 -251
  345. package/src/main/lib/__tests__/activeIndexRebuild.test.cjs +0 -179
  346. package/src/main/lib/__tests__/agentPersonaSchema.test.cjs +0 -67
  347. package/src/main/lib/__tests__/auditLog.test.cjs +0 -38
  348. package/src/main/lib/__tests__/bootSelfHeal.test.cjs +0 -107
  349. package/src/main/lib/__tests__/branchSweep.test.cjs +0 -164
  350. package/src/main/lib/__tests__/buildIdentity.test.cjs +0 -121
  351. package/src/main/lib/__tests__/buildTarget.test.cjs +0 -52
  352. package/src/main/lib/__tests__/childWithLog.test.cjs +0 -321
  353. package/src/main/lib/__tests__/coldBootPromptSessionsWrite.test.cjs +0 -87
  354. package/src/main/lib/__tests__/crashTelemetry.test.cjs +0 -103
  355. package/src/main/lib/__tests__/credentials-futile-refresh.test.cjs +0 -115
  356. package/src/main/lib/__tests__/cwdClassify.test.cjs +0 -111
  357. package/src/main/lib/__tests__/definitionOfDoneSequence.test.cjs +0 -95
  358. package/src/main/lib/__tests__/delegationReadiness.test.cjs +0 -1175
  359. package/src/main/lib/__tests__/dispatchLoop.test.cjs +0 -63
  360. package/src/main/lib/__tests__/effectiveModelInfo.test.cjs +0 -244
  361. package/src/main/lib/__tests__/ephemeralCwd.test.cjs +0 -91
  362. package/src/main/lib/__tests__/epicDelegationStats.test.cjs +0 -137
  363. package/src/main/lib/__tests__/epicSpawnCwd.test.cjs +0 -283
  364. package/src/main/lib/__tests__/epicSpawnPlan.test.cjs +0 -196
  365. package/src/main/lib/__tests__/epicTranscriptPath.test.cjs +0 -163
  366. package/src/main/lib/__tests__/epicWorktreeBoot.test.cjs +0 -136
  367. package/src/main/lib/__tests__/epicWorktreeMerge.test.cjs +0 -130
  368. package/src/main/lib/__tests__/epicWorktreeMint.test.cjs +0 -117
  369. package/src/main/lib/__tests__/epicWorktreeProjectConfig.test.cjs +0 -137
  370. package/src/main/lib/__tests__/fixChainDepth.test.cjs +0 -40
  371. package/src/main/lib/__tests__/fixtures/204-mercury-steam-horse.log.txt +0 -13
  372. package/src/main/lib/__tests__/fixtures/scheduler-machine.json.corrupt-1789147548 +0 -34
  373. package/src/main/lib/__tests__/gateFixtures.json +0 -20
  374. package/src/main/lib/__tests__/gitCacheBound.test.cjs +0 -69
  375. package/src/main/lib/__tests__/gitWorktree.test.cjs +0 -1478
  376. package/src/main/lib/__tests__/gitWorktreeSalvage.test.cjs +0 -107
  377. package/src/main/lib/__tests__/gitWorktreeSalvageDelta.test.cjs +0 -153
  378. package/src/main/lib/__tests__/guardShims.test.cjs +0 -158
  379. package/src/main/lib/__tests__/importReferences.spec.cjs +0 -56
  380. package/src/main/lib/__tests__/instanceLock.test.cjs +0 -173
  381. package/src/main/lib/__tests__/jobSupervisorRecord.test.cjs +0 -78
  382. package/src/main/lib/__tests__/jobWorktree.test.cjs +0 -199
  383. package/src/main/lib/__tests__/jobWorktreeBootLive.test.cjs +0 -82
  384. package/src/main/lib/__tests__/landedSinceRun.test.cjs +0 -133
  385. package/src/main/lib/__tests__/launchFailure.test.cjs +0 -220
  386. package/src/main/lib/__tests__/loadGate.test.cjs +0 -303
  387. package/src/main/lib/__tests__/localAdminHttp.test.cjs +0 -214
  388. package/src/main/lib/__tests__/loopDelay.test.cjs +0 -68
  389. package/src/main/lib/__tests__/mcpToolCatalog.test.cjs +0 -107
  390. package/src/main/lib/__tests__/modelCatalog.test.cjs +0 -202
  391. package/src/main/lib/__tests__/opsOwnership.test.cjs +0 -113
  392. package/src/main/lib/__tests__/opsRootAbsoluteCwd.test.cjs +0 -328
  393. package/src/main/lib/__tests__/opsRootNestedWrite.test.cjs +0 -51
  394. package/src/main/lib/__tests__/opsRootResolve.test.cjs +0 -149
  395. package/src/main/lib/__tests__/prdDeclaredPaths.test.cjs +0 -82
  396. package/src/main/lib/__tests__/prdDisposition.test.cjs +0 -224
  397. package/src/main/lib/__tests__/procIdentity.test.cjs +0 -119
  398. package/src/main/lib/__tests__/procName.test.cjs +0 -92
  399. package/src/main/lib/__tests__/projectBriefCore.test.cjs +0 -216
  400. package/src/main/lib/__tests__/projectRootResolve.test.cjs +0 -148
  401. package/src/main/lib/__tests__/queueHealth.test.cjs +0 -58
  402. package/src/main/lib/__tests__/queueStoreAtomicWrite.test.cjs +0 -88
  403. package/src/main/lib/__tests__/queueStoreMachineStateRecovery.test.cjs +0 -190
  404. package/src/main/lib/__tests__/quietMachineLease.test.cjs +0 -39
  405. package/src/main/lib/__tests__/rateLimitWindow.test.cjs +0 -88
  406. package/src/main/lib/__tests__/reaperHelpers.test.cjs +0 -577
  407. package/src/main/lib/__tests__/schedulerBatchDepends.test.cjs +0 -312
  408. package/src/main/lib/__tests__/schedulerBatchFairness.test.cjs +0 -213
  409. package/src/main/lib/__tests__/schedulerBatchLaunchHold.test.cjs +0 -125
  410. package/src/main/lib/__tests__/schedulerBatchProjectCap.test.cjs +0 -127
  411. package/src/main/lib/__tests__/schedulerBatchQuietMachine.test.cjs +0 -109
  412. package/src/main/lib/__tests__/schedulerMcpServerHeadlessRefusal.test.cjs +0 -71
  413. package/src/main/lib/__tests__/schedulerMcpServerHelp.test.cjs +0 -216
  414. package/src/main/lib/__tests__/schedulerMcpServerProjectHome.test.cjs +0 -183
  415. package/src/main/lib/__tests__/schedulerPaths.test.cjs +0 -226
  416. package/src/main/lib/__tests__/schedulerPathsWorktree.test.cjs +0 -133
  417. package/src/main/lib/__tests__/schedulerRuntimeState.test.cjs +0 -56
  418. package/src/main/lib/__tests__/sessionSlots.test.cjs +0 -144
  419. package/src/main/lib/__tests__/telemetryBacklog.test.cjs +0 -626
  420. package/src/main/lib/__tests__/telemetryBoot.test.cjs +0 -134
  421. package/src/main/lib/__tests__/telemetryConsent.test.cjs +0 -136
  422. package/src/main/lib/__tests__/telemetryCounters.test.cjs +0 -57
  423. package/src/main/lib/__tests__/telemetryCountersMetadataColumn.test.cjs +0 -98
  424. package/src/main/lib/__tests__/terminalRunOutcome.test.cjs +0 -200
  425. package/src/main/lib/__tests__/toolUseClassify.test.cjs +0 -53
  426. package/src/main/lib/__tests__/updateCheck.test.cjs +0 -63
  427. package/src/main/lib/__tests__/upgradeDrain.test.cjs +0 -130
  428. package/src/main/lib/__tests__/usageCircuit.test.cjs +0 -354
  429. package/src/main/lib/__tests__/watchdog-helpers.test.cjs +0 -441
  430. package/src/main/lib/__tests__/watchdog-relaunch.test.cjs +0 -266
  431. package/src/main/lib/kgExchangePairing.cjs +0 -75
@@ -1,1784 +0,0 @@
1
- /**
2
- * runVerify.test.cjs — unit tests for the post-run reconciliation verifier.
3
- *
4
- * Run standalone: timeout 180 npx vitest run src/main/__tests__/runVerify.test.cjs
5
- *
6
- * Three fixture scenarios (matching the 2026-05-23→24 incident window):
7
- *
8
- * 1. Case 1 (false-PASS): M2 acceptance script prints test failures + Traceback,
9
- * then echoes "M2 acceptance: PASS". Scheduler used to stamp 'completed'.
10
- * Expected: transcript_errors → needs_review
11
- *
12
- * 2. Case 2 (HALT): M7 agent correctly halts because M1 soak is unmet.
13
- * Expected: halt → pending, reason embeds soak floor date
14
- *
15
- * 3. Case 3 (deps_unmet): PRD 56 has an unsatisfied dependsOn entry.
16
- * Expected: deps_unmet → pending
17
- *
18
- * 4. Truly clean: all tests pass, no error markers.
19
- * Expected: clean → null (caller may stamp 'completed')
20
- */
21
-
22
- import { test, beforeAll, afterAll, vi } from 'vitest';
23
- const assert = require('node:assert/strict');
24
- const os = require('node:os');
25
- const fs = require('node:fs');
26
- const path = require('node:path');
27
- const { execFileSync } = require('node:child_process');
28
- const { verifyRun, parseLog } = require('../runVerify.cjs');
29
-
30
- // The verdicts sidecar goes through config.writeJsonSync, whose write allow-list
31
- // rejects os.tmpdir() fixtures. Route it to a plain write for these fixtures.
32
- let writeSpy;
33
- beforeAll(() => {
34
- writeSpy = vi.spyOn(require('../config.cjs'), 'writeJsonSync').mockImplementation((abs, data) => {
35
- fs.writeFileSync(abs, JSON.stringify(data, null, 2) + '\n');
36
- return { ok: true, mtimeMs: 0 };
37
- });
38
- });
39
- afterAll(() => writeSpy.mockRestore());
40
-
41
- // ─── helpers ──────────────────────────────────────────────────────────────────
42
-
43
- /** Create a temp directory that is cleaned up after the test. */
44
- function makeTmpDir() {
45
- return fs.mkdtempSync(path.join(os.tmpdir(), 'run-verify-test-'));
46
- }
47
-
48
- function rmdir(dir) {
49
- try { fs.rmSync(dir, { recursive: true, force: true }); } catch { /* */ }
50
- }
51
-
52
- /**
53
- * Build a minimal stream-JSON log file.
54
- * `events` is an array of raw JSON objects to serialise one-per-line.
55
- * A "[scheduler] starting..." prefix line is also prepended (must be skipped).
56
- */
57
- function writeLog(dir, slug, events) {
58
- const lines = ['[scheduler] starting ' + slug + ' at 2026-05-24T00:00:00.000Z'];
59
- for (const ev of events) lines.push(JSON.stringify(ev));
60
- lines.push('[scheduler] exit code=0 (raw code=0 signal=null) duration=47s');
61
- fs.writeFileSync(path.join(dir, `${slug}.log`), lines.join('\n') + '\n');
62
- }
63
-
64
- /** Write a minimal PRD .md file with frontmatter + body. */
65
- function writePrd(dir, slug, body) {
66
- const text = `---\ntitle: Test PRD\ncwd: /tmp\nestimateMinutes: 30\n---\n${body}\n`;
67
- fs.writeFileSync(path.join(dir, `${slug}.md`), text);
68
- return path.join(dir, `${slug}.md`);
69
- }
70
-
71
- // ─── fixture: Case 1 — false-PASS (M2 acceptance) ─────────────────────────
72
-
73
- test('Case 1: false-PASS (Traceback + echo PASS) → transcript_errors/needs_review', async () => {
74
- const tmp = makeTmpDir();
75
- try {
76
- const slug = '39-signal-builder-m2-sentiment-stack';
77
- const logEvents = [
78
- // Assistant turn: run acceptance script
79
- {
80
- type: 'assistant',
81
- message: {
82
- role: 'assistant',
83
- content: [{
84
- type: 'tool_use',
85
- id: 'toolu_m2_001',
86
- name: 'Bash',
87
- input: {
88
- command: 'bash check_m2.sh',
89
- description: 'Run M2 acceptance checks',
90
- },
91
- }],
92
- },
93
- },
94
- // Tool result: test failures then echo PASS (the false-positive pattern)
95
- {
96
- type: 'user',
97
- message: {
98
- role: 'user',
99
- content: [{
100
- type: 'tool_result',
101
- tool_use_id: 'toolu_m2_001',
102
- content: [
103
- '=== Signal-builder side ===',
104
- 'ERROR tests/test_news_signals_panel.py',
105
- '!!!!!!!! stopping after 1 failures !!!!!!!!',
106
- '1 error in 0.03s',
107
- 'SB: 0',
108
- '=== Sanity: SB sentiment_cache.db rows ===',
109
- 'rows: 0',
110
- '=== contract.json panels.sentiment ===',
111
- 'Traceback (most recent call last):',
112
- ' File "<string>", line 1, in <module>',
113
- "KeyError: 'panels.sentiment'",
114
- 'M2 acceptance: PASS',
115
- ].join('\n'),
116
- is_error: false,
117
- }],
118
- },
119
- },
120
- // Result: agent declares success
121
- {
122
- type: 'result',
123
- subtype: 'success',
124
- result: 'M2 acceptance criteria verified. All checks passed.',
125
- },
126
- ];
127
-
128
- writeLog(tmp, slug, logEvents);
129
- const prdPath = writePrd(tmp, slug, '# M2 Sentiment Stack\n\nBuild the sentiment pipeline.');
130
-
131
- const verdict = await verifyRun({
132
- runDir: tmp,
133
- prdPath,
134
- queueEntry: { slug, status: 'running' },
135
- allJobs: [],
136
- });
137
-
138
- assert.equal(verdict.verdict, 'transcript_errors', `expected transcript_errors, got ${verdict.verdict}: ${verdict.reason}`);
139
- assert.equal(verdict.downgradeTo, 'needs_review');
140
- assert.ok(verdict.reason.length > 0, 'reason should be non-empty');
141
-
142
- // verdicts.json sidecar should have been written
143
- const sidecar = JSON.parse(fs.readFileSync(path.join(tmp, `${slug}.verdicts.json`), 'utf8'));
144
- assert.equal(sidecar.schemaVersion, 1);
145
- assert.equal(sidecar.verdict, 'transcript_errors');
146
- } finally {
147
- rmdir(tmp);
148
- }
149
- });
150
-
151
- // ─── fixture: Case 2 — HALT (M7 soak unmet) ──────────────────────────────────
152
-
153
- test('Case 2: HALT in result event → halt/pending with floor date in reason', async () => {
154
- const tmp = makeTmpDir();
155
- try {
156
- const slug = '44-signal-builder-m7-final-cutover';
157
- const haltMsg = [
158
- 'HALT: M7 prerequisite — M1 not yet soaked 30 days × 6 phases',
159
- ' M1 commit: f91ce44 2026-05-23 (age: 0 days, need ≥ 180)',
160
- ' M7 earliest eligible: ~2026-11-19',
161
- ].join('\n');
162
-
163
- const logEvents = [
164
- {
165
- type: 'assistant',
166
- message: {
167
- role: 'assistant',
168
- content: [{
169
- type: 'tool_use',
170
- id: 'toolu_m7_001',
171
- name: 'Bash',
172
- input: { command: 'git log --oneline m1-tag', description: 'Check M1 soak period' },
173
- }],
174
- },
175
- },
176
- {
177
- type: 'user',
178
- message: {
179
- role: 'user',
180
- content: [{
181
- type: 'tool_result',
182
- tool_use_id: 'toolu_m7_001',
183
- content: 'f91ce44 2026-05-23 feat(m1): initial trading signals',
184
- is_error: false,
185
- }],
186
- },
187
- },
188
- {
189
- type: 'result',
190
- subtype: 'success',
191
- result: haltMsg,
192
- },
193
- ];
194
-
195
- writeLog(tmp, slug, logEvents);
196
- const prdPath = writePrd(
197
- tmp,
198
- slug,
199
- '# M7 Final Cutover\n\nOnly after M1–M6 have run 30+ days each.',
200
- );
201
-
202
- const verdict = await verifyRun({
203
- runDir: tmp,
204
- prdPath,
205
- queueEntry: { slug, status: 'running' },
206
- allJobs: [],
207
- });
208
-
209
- assert.equal(verdict.verdict, 'halt', `expected halt, got ${verdict.verdict}: ${verdict.reason}`);
210
- assert.equal(verdict.downgradeTo, 'pending');
211
- assert.ok(verdict.reason.includes('HALT'), 'reason should mention HALT');
212
- // Floor date from the HALT message should appear in reason
213
- assert.ok(
214
- verdict.reason.includes('2026-11-19') || verdict.reason.length > 20,
215
- `reason should embed soak floor date: ${verdict.reason}`,
216
- );
217
- } finally {
218
- rmdir(tmp);
219
- }
220
- });
221
-
222
- // ─── fixture: Case 3 — deps_unmet (dependsOn unsatisfied) ────────────────────
223
-
224
- test('Case 3: dependsOn pointing at pending dep → deps_unmet/pending', async () => {
225
- const tmp = makeTmpDir();
226
- try {
227
- const slug = '56-burrow-mcp-retire-tier3-frozen-endpoints';
228
- const logEvents = [
229
- {
230
- type: 'result',
231
- subtype: 'success',
232
- result: 'Completed burrow MCP tier-3 retirement.',
233
- },
234
- ];
235
-
236
- writeLog(tmp, slug, logEvents);
237
- const prdPath = writePrd(
238
- tmp,
239
- slug,
240
- '# Burrow MCP Retire Tier-3\n\nRetire frozen endpoints.',
241
- );
242
-
243
- // M7 is a predecessor that is still pending.
244
- const allJobs = [
245
- { slug: '44-signal-builder-m7-final-cutover', status: 'pending', finishedAt: null },
246
- { slug: slug, status: 'running', finishedAt: null },
247
- ];
248
- const queueEntry = {
249
- slug,
250
- status: 'running',
251
- dependsOn: ['44-signal-builder-m7-final-cutover'],
252
- };
253
-
254
- const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry, allJobs });
255
-
256
- assert.equal(verdict.verdict, 'deps_unmet', `expected deps_unmet, got ${verdict.verdict}: ${verdict.reason}`);
257
- assert.equal(verdict.downgradeTo, 'pending');
258
- assert.ok(verdict.reason.includes('44-signal-builder-m7-final-cutover'), 'reason should name the unmet dep');
259
- } finally {
260
- rmdir(tmp);
261
- }
262
- });
263
-
264
- // ─── fixture: truly clean run ─────────────────────────────────────────────────
265
-
266
- test('Truly clean run (no error markers) → clean/null', async () => {
267
- const tmp = makeTmpDir();
268
- try {
269
- const slug = '20-clean-feature';
270
- const logEvents = [
271
- {
272
- type: 'assistant',
273
- message: {
274
- role: 'assistant',
275
- content: [{
276
- type: 'tool_use',
277
- id: 'toolu_clean_001',
278
- name: 'Bash',
279
- input: { command: 'npm test', description: 'Run test suite' },
280
- }],
281
- },
282
- },
283
- {
284
- type: 'user',
285
- message: {
286
- role: 'user',
287
- content: [{
288
- type: 'tool_result',
289
- tool_use_id: 'toolu_clean_001',
290
- content: '✓ 42 tests passed (1.3s)\nAll tests passed.',
291
- is_error: false,
292
- }],
293
- },
294
- },
295
- {
296
- type: 'result',
297
- subtype: 'success',
298
- result: 'Feature complete. All acceptance criteria satisfied.\nSCHEDULER_VERDICT: PASS',
299
- },
300
- ];
301
-
302
- writeLog(tmp, slug, logEvents);
303
- const prdPath = writePrd(tmp, slug, '# Clean Feature\n\nImplement a clean feature.');
304
-
305
- const verdict = await verifyRun({
306
- runDir: tmp,
307
- prdPath,
308
- queueEntry: { slug, status: 'running' },
309
- allJobs: [],
310
- committedDuringRun: true,
311
- });
312
-
313
- assert.equal(verdict.verdict, 'clean', `expected clean, got ${verdict.verdict}: ${verdict.reason}`);
314
- assert.equal(verdict.downgradeTo, null);
315
- } finally {
316
- rmdir(tmp);
317
- }
318
- });
319
-
320
- // ─── self-recovery: FAIL followed by successful retry ──────────────────────
321
-
322
- test('FAIL recovered within 30 events → clean', async () => {
323
- const tmp = makeTmpDir();
324
- try {
325
- const slug = '21-self-recovering';
326
- const desc = 'Run pytest';
327
- const logEvents = [
328
- // First attempt: fails
329
- {
330
- type: 'assistant',
331
- message: {
332
- role: 'assistant',
333
- content: [{
334
- type: 'tool_use',
335
- id: 'toolu_r1',
336
- name: 'Bash',
337
- input: { command: 'pytest', description: desc },
338
- }],
339
- },
340
- },
341
- {
342
- type: 'user',
343
- message: {
344
- role: 'user',
345
- content: [{
346
- type: 'tool_result',
347
- tool_use_id: 'toolu_r1',
348
- content: 'FAILED tests/test_foo.py::test_bar - AssertionError',
349
- is_error: false,
350
- }],
351
- },
352
- },
353
- // Agent fixes and retries with same description
354
- {
355
- type: 'assistant',
356
- message: {
357
- role: 'assistant',
358
- content: [{
359
- type: 'tool_use',
360
- id: 'toolu_r2',
361
- name: 'Bash',
362
- input: { command: 'pytest', description: desc },
363
- }],
364
- },
365
- },
366
- {
367
- type: 'user',
368
- message: {
369
- role: 'user',
370
- content: [{
371
- type: 'tool_result',
372
- tool_use_id: 'toolu_r2',
373
- content: '5 passed in 0.42s',
374
- is_error: false,
375
- }],
376
- },
377
- },
378
- {
379
- type: 'result',
380
- subtype: 'success',
381
- result: 'Fixed the failing test and verified all pass.\nSCHEDULER_VERDICT: PASS',
382
- },
383
- ];
384
-
385
- writeLog(tmp, slug, logEvents);
386
- const prdPath = writePrd(tmp, slug, '# Self-recovering test');
387
-
388
- const verdict = await verifyRun({
389
- runDir: tmp,
390
- prdPath,
391
- queueEntry: { slug, status: 'running' },
392
- allJobs: [],
393
- committedDuringRun: true,
394
- });
395
-
396
- assert.equal(verdict.verdict, 'clean', `self-recovery should yield clean, got ${verdict.verdict}: ${verdict.reason}`);
397
- } finally {
398
- rmdir(tmp);
399
- }
400
- });
401
-
402
- // ─── self-recovery: sleep-prefix normalization (RCA 745-pr188-ci-lint-docs-integrity) ──
403
-
404
- /**
405
- * Build N innocuous tool_use/tool_result pairs, used to push a later error
406
- * event into the last-20%-of-transcript window that the is_error scan
407
- * requires (parseLog counts every tool_use/tool_result as its own event).
408
- */
409
- function paddingEvents(n) {
410
- const out = [];
411
- for (let i = 0; i < n; i++) {
412
- out.push({
413
- type: 'assistant',
414
- message: { role: 'assistant', content: [{ type: 'tool_use', id: `toolu_pad${i}`, name: 'Bash', input: { command: 'echo ok', description: `padding step ${i}` } }] },
415
- });
416
- out.push({
417
- type: 'user',
418
- message: { role: 'user', content: [{ type: 'tool_result', tool_use_id: `toolu_pad${i}`, content: 'ok', is_error: false }] },
419
- });
420
- }
421
- return out;
422
- }
423
-
424
- test('sleep-prefixed FAIL recovered by a bare retry of the same command → clean', async () => {
425
- const tmp = makeTmpDir();
426
- try {
427
- const slug = '812-sleep-prefix-recovery';
428
- const logEvents = [
429
- ...paddingEvents(8),
430
- // First attempt: polls too early with a `sleep 20 &&` prefix, gets a
431
- // pending/error result.
432
- {
433
- type: 'assistant',
434
- message: {
435
- role: 'assistant',
436
- content: [{
437
- type: 'tool_use',
438
- id: 'toolu_r1',
439
- name: 'Bash',
440
- input: {
441
- command: 'sleep 20 && gh pr checks 188 --repo midt-bg/sigma 2>&1',
442
- description: 'sleep 20 && gh pr checks 188 --repo midt-bg/sigma',
443
- },
444
- }],
445
- },
446
- },
447
- {
448
- type: 'user',
449
- message: {
450
- role: 'user',
451
- content: [{
452
- type: 'tool_result',
453
- tool_use_id: 'toolu_r1',
454
- content: 'Exit code 8\ncheck\tpending\t0\thttps://github.com/midt-bg/sigma/actions/runs/1/job/1',
455
- is_error: true,
456
- }],
457
- },
458
- },
459
- // Later retry: same underlying command, no sleep prefix, succeeds.
460
- {
461
- type: 'assistant',
462
- message: {
463
- role: 'assistant',
464
- content: [{
465
- type: 'tool_use',
466
- id: 'toolu_r2',
467
- name: 'Bash',
468
- input: {
469
- command: 'gh pr checks 188 --repo midt-bg/sigma 2>&1',
470
- description: 'gh pr checks 188 --repo midt-bg/sigma',
471
- },
472
- }],
473
- },
474
- },
475
- {
476
- type: 'user',
477
- message: {
478
- role: 'user',
479
- content: [{
480
- type: 'tool_result',
481
- tool_use_id: 'toolu_r2',
482
- content: 'check\tpass\t2m16s\thttps://github.com/midt-bg/sigma/actions/runs/1/job/1',
483
- is_error: false,
484
- }],
485
- },
486
- },
487
- {
488
- type: 'result',
489
- subtype: 'success',
490
- result: 'CI is green.\nSCHEDULER_VERDICT: PASS',
491
- },
492
- ];
493
-
494
- writeLog(tmp, slug, logEvents);
495
- const prdPath = writePrd(tmp, slug, '# Sleep-prefix recovery test');
496
-
497
- const verdict = await verifyRun({
498
- runDir: tmp,
499
- prdPath,
500
- queueEntry: { slug, status: 'running' },
501
- allJobs: [],
502
- committedDuringRun: true,
503
- });
504
-
505
- assert.equal(verdict.verdict, 'clean', `sleep-prefix recovery should yield clean, got ${verdict.verdict}: ${verdict.reason}`);
506
- } finally {
507
- rmdir(tmp);
508
- }
509
- });
510
-
511
- test('normalizeDescForRecovery only strips the sleep wrapper, not unrelated text', () => {
512
- const { normalizeDescForRecovery } = require('../runVerify.cjs');
513
- assert.equal(
514
- normalizeDescForRecovery('sleep 20 && gh pr checks 188 --repo midt-bg/sigma'),
515
- 'gh pr checks 188 --repo midt-bg/sigma',
516
- );
517
- assert.equal(
518
- normalizeDescForRecovery('sleep 90; gh pr checks 188 --repo midt-bg/sigma'),
519
- 'gh pr checks 188 --repo midt-bg/sigma',
520
- );
521
- assert.equal(
522
- normalizeDescForRecovery('gh pr checks 188 --repo midt-bg/sigma'),
523
- 'gh pr checks 188 --repo midt-bg/sigma',
524
- );
525
- });
526
-
527
- test('two different commands, one sleep-prefixed, are not paired as recovered', () => {
528
- // Exercise isSelfRecovered directly (via parseLog) rather than the full
529
- // verifyRun pipeline: a SCHEDULER_VERDICT: PASS + landed commit legitimately
530
- // overrides a transcript_errors finding at the verifyRun layer by design
531
- // (see verifyRun's sentinel-override comment), which would mask the
532
- // narrower claim this test makes — that the sleep-prefix strip alone must
533
- // not pair two genuinely different commands.
534
- const { isSelfRecovered, parseLog } = require('../runVerify.cjs');
535
- const tmp = makeTmpDir();
536
- try {
537
- const slug = '812-sleep-prefix-no-false-pair';
538
- const logEvents = [
539
- // First attempt: sleep-prefixed poll of PR 188, fails.
540
- {
541
- type: 'assistant',
542
- message: {
543
- role: 'assistant',
544
- content: [{
545
- type: 'tool_use',
546
- id: 'toolu_r1',
547
- name: 'Bash',
548
- input: {
549
- command: 'sleep 20 && gh pr checks 188 --repo midt-bg/sigma 2>&1',
550
- description: 'sleep 20 && gh pr checks 188 --repo midt-bg/sigma',
551
- },
552
- }],
553
- },
554
- },
555
- {
556
- type: 'user',
557
- message: {
558
- role: 'user',
559
- content: [{
560
- type: 'tool_result',
561
- tool_use_id: 'toolu_r1',
562
- content: 'Exit code 8\ncheck\tpending\t0\thttps://github.com/midt-bg/sigma/actions/runs/1/job/1',
563
- is_error: true,
564
- }],
565
- },
566
- },
567
- // "Retry" is actually a different command (different PR number) —
568
- // after stripping the sleep wrapper it must NOT be treated as the
569
- // same underlying command.
570
- {
571
- type: 'assistant',
572
- message: {
573
- role: 'assistant',
574
- content: [{
575
- type: 'tool_use',
576
- id: 'toolu_r2',
577
- name: 'Bash',
578
- input: {
579
- command: 'gh pr checks 999 --repo midt-bg/sigma 2>&1',
580
- description: 'gh pr checks 999 --repo midt-bg/sigma',
581
- },
582
- }],
583
- },
584
- },
585
- {
586
- type: 'user',
587
- message: {
588
- role: 'user',
589
- content: [{
590
- type: 'tool_result',
591
- tool_use_id: 'toolu_r2',
592
- content: 'check\tpass\t2m16s\thttps://github.com/midt-bg/sigma/actions/runs/2/job/2',
593
- is_error: false,
594
- }],
595
- },
596
- },
597
- {
598
- type: 'result',
599
- subtype: 'success',
600
- result: 'Done.\nSCHEDULER_VERDICT: PASS',
601
- },
602
- ];
603
-
604
- writeLog(tmp, slug, logEvents);
605
- const { events } = parseLog(path.join(tmp, `${slug}.log`));
606
- const failedToolUse = events.find((ev) => ev.kind === 'tool_use' && ev.toolUseId === 'toolu_r1');
607
- assert.ok(failedToolUse, 'fixture should contain the failing tool_use event');
608
-
609
- const recovered = isSelfRecovered(events, failedToolUse.seq, failedToolUse.description);
610
- assert.equal(recovered, false, 'a differently-numbered PR check must not be treated as a recovered retry of the sleep-prefixed one');
611
- } finally {
612
- rmdir(tmp);
613
- }
614
- });
615
-
616
- // ─── fixtures: feedback 2026-06-10-01 — quoted-error false positives ─────────
617
-
618
- /** Build a one-Bash-call log: tool_use → tool_result(content) → result event. */
619
- function bashRunEvents(content, { toolName = 'Bash', resultSubtype = 'success' } = {}) {
620
- return [
621
- {
622
- type: 'assistant',
623
- message: {
624
- role: 'assistant',
625
- content: [{
626
- type: 'tool_use',
627
- id: 'toolu_fb_001',
628
- name: toolName,
629
- input: { command: 'run something', description: 'Run checks' },
630
- }],
631
- },
632
- },
633
- {
634
- type: 'user',
635
- message: {
636
- role: 'user',
637
- content: [{
638
- type: 'tool_result',
639
- tool_use_id: 'toolu_fb_001',
640
- content,
641
- is_error: false,
642
- }],
643
- },
644
- },
645
- { type: 'result', subtype: resultSubtype, result: 'All acceptance criteria verified.\nSCHEDULER_VERDICT: PASS' },
646
- ];
647
- }
648
-
649
- test('feedback 01: reviewer prose mentioning ImportError mid-sentence → clean', async () => {
650
- const tmp = makeTmpDir();
651
- try {
652
- const slug = '25-self-pipeline-driver-hardening';
653
- const prose = [
654
- '{"finding": "the script will crash with ImportError rather than a clean RESULT: failed line",',
655
- ' "note": "a missing dep would fail with an ImportError that is captured only in cron.log"}',
656
- ].join('\n');
657
- writeLog(tmp, slug, bashRunEvents(prose));
658
- const prdPath = writePrd(tmp, slug, '# Hardening');
659
- const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry: { slug, status: 'running' }, allJobs: [], committedDuringRun: true });
660
- assert.equal(verdict.verdict, 'clean', `prose mention must not flag, got ${verdict.verdict}: ${verdict.reason}`);
661
- } finally { rmdir(tmp); }
662
- });
663
-
664
- test('feedback 01: real line-anchored ModuleNotFoundError in a FAILED run → verify_unavailable/needs_review', async () => {
665
- const tmp = makeTmpDir();
666
- try {
667
- const slug = '25-real-import-error';
668
- const out = [
669
- '$ python run_checks.py',
670
- 'Traceback (most recent call last):',
671
- ' File "run_checks.py", line 2, in <module>',
672
- ' from playwright.sync_api import sync_playwright',
673
- "ModuleNotFoundError: No module named 'playwright'",
674
- ].join('\n');
675
- // Run did NOT succeed: the missing dependency was never resolved, so the
676
- // "couldn't verify" signal must still escalate to a human.
677
- writeLog(tmp, slug, bashRunEvents(out, { resultSubtype: 'error_during_execution' }));
678
- const prdPath = writePrd(tmp, slug, '# Real failure');
679
- const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry: { slug, status: 'running' }, allJobs: [] });
680
- assert.equal(verdict.verdict, 'verify_unavailable', `unresolved missing-dep must flag, got ${verdict.verdict}: ${verdict.reason}`);
681
- assert.equal(verdict.downgradeTo, 'needs_review');
682
- } finally { rmdir(tmp); }
683
- });
684
-
685
- // ─── feedback 2026-06-10 addendum — recovered env-probe false positives ──────
686
- //
687
- // Setup probes (interpreter/venv search) that surface ModuleNotFoundError but
688
- // the run still reaches result:success are the missing-dependency class, not a
689
- // real failure. They must NOT downgrade — only annotate. But a Traceback ending
690
- // in a real logic exception (KeyError/AssertionError) still hard-flags, even on
691
- // "success", preserving the 2026-05-23 false-PASS guard.
692
-
693
- test('addendum: Traceback→ModuleNotFoundError in a SUCCEEDED run → clean (annotated, not downgraded)', async () => {
694
- const tmp = makeTmpDir();
695
- try {
696
- const slug = '26-self-billbot-shared-lib';
697
- const probe = [
698
- 'Exit code 1',
699
- 'Traceback (most recent call last):',
700
- ' File "/home/bilko/Self/.claude/skills/snopud-bill/download_bill.py", line 42, in <module>',
701
- ' from playwright.sync_api import TimeoutError as PWTimeout',
702
- "ModuleNotFoundError: No module named 'playwright'",
703
- ].join('\n');
704
- writeLog(tmp, slug, bashRunEvents(probe)); // resultSubtype defaults to success
705
- const prdPath = writePrd(tmp, slug, '# Shared lib');
706
- const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry: { slug, status: 'running' }, allJobs: [], committedDuringRun: true });
707
- assert.equal(verdict.verdict, 'clean', `recovered env probe must not downgrade, got ${verdict.verdict}: ${verdict.reason}`);
708
- assert.equal(verdict.downgradeTo, null);
709
- assert.ok(Array.isArray(verdict.annotations) && verdict.annotations.length === 1, 'should record one annotation');
710
- assert.equal(verdict.annotations[0].verdict, 'verify_unavailable');
711
- } finally { rmdir(tmp); }
712
- });
713
-
714
- test('addendum: bare Import/ModuleNotFound probe (no traceback) in SUCCEEDED run → clean/annotated', async () => {
715
- const tmp = makeTmpDir();
716
- try {
717
- const slug = '26-self-parser-tests';
718
- writeLog(tmp, slug, bashRunEvents("ModuleNotFoundError: No module named 'conftest'"));
719
- const prdPath = writePrd(tmp, slug, '# Parser tests');
720
- const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry: { slug, status: 'running' }, allJobs: [], committedDuringRun: true });
721
- assert.equal(verdict.verdict, 'clean', `got ${verdict.verdict}: ${verdict.reason}`);
722
- assert.ok(Array.isArray(verdict.annotations) && verdict.annotations.length === 1);
723
- } finally { rmdir(tmp); }
724
- });
725
-
726
- test('addendum: Traceback→KeyError (real logic failure) on "success" → still transcript_errors/needs_review', async () => {
727
- const tmp = makeTmpDir();
728
- try {
729
- const slug = '26-real-logic-failure';
730
- const out = [
731
- '=== contract.json panels.sentiment ===',
732
- 'Traceback (most recent call last):',
733
- ' File "<string>", line 1, in <module>',
734
- "KeyError: 'panels.sentiment'",
735
- ].join('\n');
736
- writeLog(tmp, slug, bashRunEvents(out)); // success result — must NOT rescue a real failure
737
- const prdPath = writePrd(tmp, slug, '# Logic failure');
738
- const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry: { slug, status: 'running' }, allJobs: [] });
739
- assert.equal(verdict.verdict, 'transcript_errors', `real logic Traceback must still flag, got ${verdict.verdict}: ${verdict.reason}`);
740
- assert.equal(verdict.downgradeTo, 'needs_review');
741
- } finally { rmdir(tmp); }
742
- });
743
-
744
- test('feedback 01: error-shaped text inside a Task (subagent) result → clean', async () => {
745
- const tmp = makeTmpDir();
746
- try {
747
- const slug = '25-subagent-quoting-error';
748
- const reviewFinding = [
749
- 'Finding 3 (high): startup crash path:',
750
- 'Traceback (most recent call last):',
751
- "ImportError: cannot import name 'foo'",
752
- 'This is what WOULD happen if the guard is removed.',
753
- ].join('\n');
754
- writeLog(tmp, slug, bashRunEvents(reviewFinding, { toolName: 'Task' }));
755
- const prdPath = writePrd(tmp, slug, '# Review-heavy PRD');
756
- const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry: { slug, status: 'running' }, allJobs: [], committedDuringRun: true });
757
- assert.equal(verdict.verdict, 'clean', `Task results must be exempt from pattern scan, got ${verdict.verdict}: ${verdict.reason}`);
758
- } finally { rmdir(tmp); }
759
- });
760
-
761
- test('feedback 01: quoted "Traceback..." line (leading quote) → clean', async () => {
762
- const tmp = makeTmpDir();
763
- try {
764
- const slug = '25-quoted-traceback';
765
- const prose = [
766
- 'The log format doc says:',
767
- ' "Traceback (most recent call last):" appears first, then',
768
- ' "SomeError: message" on a later line.',
769
- ].join('\n');
770
- writeLog(tmp, slug, bashRunEvents(prose));
771
- const prdPath = writePrd(tmp, slug, '# Docs PRD');
772
- const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry: { slug, status: 'running' }, allJobs: [], committedDuringRun: true });
773
- assert.equal(verdict.verdict, 'clean', `quoted traceback prose must not flag, got ${verdict.verdict}: ${verdict.reason}`);
774
- } finally { rmdir(tmp); }
775
- });
776
-
777
- // ─── harness tool errors (feedback follow-up 2026-06-10) ─────────────────────
778
-
779
- test('harness tool error (<tool_use_error>) in final 20% → clean', async () => {
780
- const tmp = makeTmpDir();
781
- try {
782
- const slug = '58-harness-tool-error';
783
- // Pad with benign events so the error lands in the final 20%, then a
784
- // successful result — mirrors the real 58-web-remote-correctness-batch run.
785
- const events = [];
786
- for (let k = 0; k < 8; k++) {
787
- events.push({ type: 'assistant', message: { role: 'assistant', content: [
788
- { type: 'tool_use', id: `t${k}`, name: 'Read', input: { description: `read ${k}` } }] } });
789
- events.push({ type: 'user', message: { role: 'user', content: [
790
- { type: 'tool_result', tool_use_id: `t${k}`, content: 'ok', is_error: false }] } });
791
- }
792
- events.push({ type: 'assistant', message: { role: 'assistant', content: [
793
- { type: 'tool_use', id: 'tbad', name: 'bash', input: { description: 'run tests' } }] } });
794
- events.push({ type: 'user', message: { role: 'user', content: [
795
- { type: 'tool_result', tool_use_id: 'tbad',
796
- content: '<tool_use_error>Error: No such tool available: bash</tool_use_error>', is_error: true }] } });
797
- events.push({ type: 'result', subtype: 'success', result: 'All acceptance criteria verified.\nSCHEDULER_VERDICT: PASS' });
798
-
799
- writeLog(tmp, slug, events);
800
- const prdPath = writePrd(tmp, slug, '# Correctness batch');
801
- const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry: { slug, status: 'running' }, allJobs: [], committedDuringRun: true });
802
- assert.equal(verdict.verdict, 'clean', `harness tool error must not flag, got ${verdict.verdict}: ${verdict.reason}`);
803
- } finally { rmdir(tmp); }
804
- });
805
-
806
- // ─── subagent-internal tool errors (incident: 955-route-epic-create-through-ipc, 2026-08-03) ──
807
-
808
- test('subagent-internal is_error (parent_tool_use_id set) in final 20% → clean', async () => {
809
- const tmp = makeTmpDir();
810
- try {
811
- const slug = '955-route-epic-create-through-ipc';
812
- const events = [];
813
- for (let k = 0; k < 8; k++) {
814
- events.push({ type: 'assistant', message: { role: 'assistant', content: [
815
- { type: 'tool_use', id: `t${k}`, name: 'Read', input: { description: `read ${k}` } }] } });
816
- events.push({ type: 'user', message: { role: 'user', content: [
817
- { type: 'tool_result', tool_use_id: `t${k}`, content: 'ok', is_error: false }] } });
818
- }
819
- // A code-reviewer Task subagent runs its own exploratory grep, which exits
820
- // 1 (no matches) — this happened INSIDE the subagent, not the main agent.
821
- events.push({
822
- type: 'assistant',
823
- parent_tool_use_id: 'toolu_task_001',
824
- message: { role: 'assistant', content: [
825
- { type: 'tool_use', id: 'tgrep', name: 'Bash', input: { description: 'grep for buildPromptSession' } }] },
826
- });
827
- events.push({
828
- type: 'user',
829
- parent_tool_use_id: 'toolu_task_001',
830
- message: { role: 'user', content: [
831
- { type: 'tool_result', tool_use_id: 'tgrep', content: '', is_error: true }] },
832
- });
833
- events.push({ type: 'result', subtype: 'success', result: 'All acceptance criteria verified.' });
834
-
835
- writeLog(tmp, slug, events);
836
- const prdPath = writePrd(tmp, slug, '# Route Epic create through IPC');
837
- const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry: { slug, status: 'running' }, allJobs: [], committedDuringRun: true });
838
- assert.equal(verdict.verdict, 'clean', `subagent-internal is_error must not flag, got ${verdict.verdict}: ${verdict.reason}`);
839
- } finally { rmdir(tmp); }
840
- });
841
-
842
- test('main-agent is_error (no parent_tool_use_id) in final 20% → still transcript_errors', async () => {
843
- const tmp = makeTmpDir();
844
- try {
845
- const slug = '955-main-agent-error-guard';
846
- const events = [];
847
- for (let k = 0; k < 8; k++) {
848
- events.push({ type: 'assistant', message: { role: 'assistant', content: [
849
- { type: 'tool_use', id: `t${k}`, name: 'Read', input: { description: `read ${k}` } }] } });
850
- events.push({ type: 'user', message: { role: 'user', content: [
851
- { type: 'tool_result', tool_use_id: `t${k}`, content: 'ok', is_error: false }] } });
852
- }
853
- events.push({ type: 'assistant', message: { role: 'assistant', content: [
854
- { type: 'tool_use', id: 'tbad', name: 'Bash', input: { description: 'run tests' } }] } });
855
- events.push({ type: 'user', message: { role: 'user', content: [
856
- { type: 'tool_result', tool_use_id: 'tbad', content: 'FAILED: 1 test failed', is_error: true }] } });
857
- events.push({ type: 'result', subtype: 'success', result: 'All acceptance criteria verified.' });
858
-
859
- writeLog(tmp, slug, events);
860
- const prdPath = writePrd(tmp, slug, '# Guard: main-agent errors still flag');
861
- const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry: { slug, status: 'running' }, allJobs: [], committedDuringRun: true });
862
- assert.equal(verdict.verdict, 'transcript_errors', `main-agent is_error must still flag, got ${verdict.verdict}: ${verdict.reason}`);
863
- } finally { rmdir(tmp); }
864
- });
865
-
866
- test('parseLog populates parentToolUseId on tool_use and tool_result events, defaulting to null', () => {
867
- const tmp = makeTmpDir();
868
- try {
869
- const slug = '955-parselog-parent-id';
870
- const events = [
871
- {
872
- type: 'assistant',
873
- parent_tool_use_id: 'toolu_parent_001',
874
- message: { role: 'assistant', content: [
875
- { type: 'tool_use', id: 'tchild', name: 'Bash', input: { description: 'grep in subagent' } }] },
876
- },
877
- {
878
- type: 'user',
879
- parent_tool_use_id: 'toolu_parent_001',
880
- message: { role: 'user', content: [
881
- { type: 'tool_result', tool_use_id: 'tchild', content: '', is_error: true }] },
882
- },
883
- {
884
- type: 'assistant',
885
- message: { role: 'assistant', content: [
886
- { type: 'tool_use', id: 'ttop', name: 'Bash', input: { description: 'run in main agent' } }] },
887
- },
888
- {
889
- type: 'user',
890
- message: { role: 'user', content: [
891
- { type: 'tool_result', tool_use_id: 'ttop', content: 'ok', is_error: false }] },
892
- },
893
- ];
894
- writeLog(tmp, slug, events);
895
- const { events: parsed } = parseLog(path.join(tmp, `${slug}.log`));
896
-
897
- const childUse = parsed.find((ev) => ev.kind === 'tool_use' && ev.toolUseId === 'tchild');
898
- const childResult = parsed.find((ev) => ev.kind === 'tool_result' && ev.toolUseId === 'tchild');
899
- const topUse = parsed.find((ev) => ev.kind === 'tool_use' && ev.toolUseId === 'ttop');
900
- const topResult = parsed.find((ev) => ev.kind === 'tool_result' && ev.toolUseId === 'ttop');
901
-
902
- assert.equal(childUse.parentToolUseId, 'toolu_parent_001');
903
- assert.equal(childResult.parentToolUseId, 'toolu_parent_001');
904
- assert.equal(topUse.parentToolUseId, null);
905
- assert.equal(topResult.parentToolUseId, null);
906
- } finally { rmdir(tmp); }
907
- });
908
-
909
- test('isHarnessToolError detects wrapper and "No such tool available"', () => {
910
- const { isHarnessToolError } = require('../runVerify.cjs');
911
- assert.equal(isHarnessToolError('<tool_use_error>Error: No such tool available: bash</tool_use_error>'), true);
912
- assert.equal(isHarnessToolError('No such tool available: Foo'), true);
913
- assert.equal(isHarnessToolError('ModuleNotFoundError: No module named x'), false);
914
- assert.equal(isHarnessToolError(''), false);
915
- });
916
-
917
- // ─── SCHEDULER_VERDICT sentinel override tests ────────────────────────────────
918
-
919
- /** Build a log where a tool_result contains a Traceback+KeyError and the
920
- * result event optionally contains the sentinel line. */
921
- function tracebackRunEvents(sentinelLine) {
922
- const resultText = sentinelLine
923
- ? `All work done.\n${sentinelLine}`
924
- : 'All work done.';
925
- return [
926
- {
927
- type: 'assistant',
928
- message: {
929
- role: 'assistant',
930
- content: [{
931
- type: 'tool_use',
932
- id: 'toolu_tv_001',
933
- name: 'Bash',
934
- input: { command: 'pytest', description: 'Run acceptance tests' },
935
- }],
936
- },
937
- },
938
- {
939
- type: 'user',
940
- message: {
941
- role: 'user',
942
- content: [{
943
- type: 'tool_result',
944
- tool_use_id: 'toolu_tv_001',
945
- content: [
946
- '=== TDD red phase ===',
947
- 'Traceback (most recent call last):',
948
- ' File "test_foo.py", line 5, in test_bar',
949
- "KeyError: 'missing_key'",
950
- ].join('\n'),
951
- is_error: false,
952
- }],
953
- },
954
- },
955
- { type: 'result', subtype: 'success', result: resultText },
956
- ];
957
- }
958
-
959
- // (a) sentinel PASS + committedDuringRun:true + Traceback+Error → clean
960
- test('sentinel PASS + committedDuringRun:true + Traceback → clean (override)', async () => {
961
- const tmp = makeTmpDir();
962
- try {
963
- const slug = '77-sentinel-override-pass';
964
- writeLog(tmp, slug, tracebackRunEvents('SCHEDULER_VERDICT: PASS'));
965
- const prdPath = writePrd(tmp, slug, '# Sentinel override test');
966
- const verdict = await verifyRun({
967
- runDir: tmp,
968
- prdPath,
969
- queueEntry: { slug, status: 'running' },
970
- allJobs: [],
971
- committedDuringRun: true,
972
- });
973
- assert.equal(verdict.verdict, 'clean', `expected clean, got ${verdict.verdict}: ${verdict.reason}`);
974
- assert.equal(verdict.downgradeTo, null);
975
- assert.ok(verdict.reason.includes('SCHEDULER_VERDICT: PASS'), `reason should mention sentinel: ${verdict.reason}`);
976
- // Sidecar should record the sentinel and override
977
- const sidecar = JSON.parse(fs.readFileSync(path.join(tmp, `${slug}.verdicts.json`), 'utf8'));
978
- assert.equal(sidecar.sentinel, 'pass');
979
- assert.ok(sidecar.sentinelOverride, 'sidecar should record sentinelOverride');
980
- } finally {
981
- rmdir(tmp);
982
- }
983
- });
984
-
985
- // (b) no sentinel + Traceback+Error → transcript_errors (unchanged baseline)
986
- test('no sentinel + Traceback+Error + committedDuringRun:true → transcript_errors (no override)', async () => {
987
- const tmp = makeTmpDir();
988
- try {
989
- const slug = '77-no-sentinel-baseline';
990
- writeLog(tmp, slug, tracebackRunEvents(null));
991
- const prdPath = writePrd(tmp, slug, '# No sentinel baseline');
992
- const verdict = await verifyRun({
993
- runDir: tmp,
994
- prdPath,
995
- queueEntry: { slug, status: 'running' },
996
- allJobs: [],
997
- committedDuringRun: true,
998
- });
999
- assert.equal(verdict.verdict, 'transcript_errors', `expected transcript_errors without sentinel, got ${verdict.verdict}: ${verdict.reason}`);
1000
- assert.equal(verdict.downgradeTo, 'needs_review');
1001
- } finally {
1002
- rmdir(tmp);
1003
- }
1004
- });
1005
-
1006
- // (c) sentinel PASS + committedDuringRun:false → stays transcript_errors (commit not confirmed)
1007
- test('sentinel PASS + committedDuringRun:false → transcript_errors (commit unconfirmed)', async () => {
1008
- const tmp = makeTmpDir();
1009
- try {
1010
- const slug = '77-sentinel-no-commit';
1011
- writeLog(tmp, slug, tracebackRunEvents('SCHEDULER_VERDICT: PASS'));
1012
- const prdPath = writePrd(tmp, slug, '# Sentinel without commit');
1013
- const verdict = await verifyRun({
1014
- runDir: tmp,
1015
- prdPath,
1016
- queueEntry: { slug, status: 'running' },
1017
- allJobs: [],
1018
- committedDuringRun: false,
1019
- });
1020
- assert.equal(verdict.verdict, 'transcript_errors', `PASS without commit must not override, got ${verdict.verdict}: ${verdict.reason}`);
1021
- assert.equal(verdict.downgradeTo, 'needs_review');
1022
- } finally {
1023
- rmdir(tmp);
1024
- }
1025
- });
1026
-
1027
- // (d) sentinel FAIL → never clean (even with committedDuringRun:true)
1028
- test('sentinel FAIL + committedDuringRun:true → transcript_errors (FAIL never overrides)', async () => {
1029
- const tmp = makeTmpDir();
1030
- try {
1031
- const slug = '77-sentinel-fail';
1032
- writeLog(tmp, slug, tracebackRunEvents('SCHEDULER_VERDICT: FAIL AC gate was red'));
1033
- const prdPath = writePrd(tmp, slug, '# Sentinel FAIL');
1034
- const verdict = await verifyRun({
1035
- runDir: tmp,
1036
- prdPath,
1037
- queueEntry: { slug, status: 'running' },
1038
- allJobs: [],
1039
- committedDuringRun: true,
1040
- });
1041
- assert.equal(verdict.verdict, 'transcript_errors', `FAIL sentinel must not override to clean, got ${verdict.verdict}: ${verdict.reason}`);
1042
- assert.equal(verdict.downgradeTo, 'needs_review');
1043
- } finally {
1044
- rmdir(tmp);
1045
- }
1046
- });
1047
-
1048
- // ─── pre-sentinel heal (allowPreSentinelHeal) ─────────────────────────────────
1049
-
1050
- // (f) allowPreSentinelHeal=true + committed + no sentinel → clean
1051
- test('pre-sentinel heal: committed + no sentinel + allowPreSentinelHeal → clean', async () => {
1052
- const tmp = makeTmpDir();
1053
- try {
1054
- const slug = '86-pre-sentinel-heal-pass';
1055
- writeLog(tmp, slug, tracebackRunEvents(null)); // no SCHEDULER_VERDICT line
1056
- const prdPath = writePrd(tmp, slug, '# Pre-sentinel heal');
1057
- const verdict = await verifyRun({
1058
- runDir: tmp,
1059
- prdPath,
1060
- queueEntry: { slug, status: 'needs_review' },
1061
- allJobs: [],
1062
- committedDuringRun: true,
1063
- allowPreSentinelHeal: true,
1064
- });
1065
- assert.equal(verdict.verdict, 'clean', `expected clean via pre-sentinel heal, got ${verdict.verdict}: ${verdict.reason}`);
1066
- assert.equal(verdict.downgradeTo, null);
1067
- assert.ok(verdict.reason.includes('pre-sentinel heal'), `reason should mention pre-sentinel heal: ${verdict.reason}`);
1068
- const sidecar = JSON.parse(fs.readFileSync(path.join(tmp, `${slug}.verdicts.json`), 'utf8'));
1069
- assert.ok(sidecar.preSentinelHeal, 'sidecar should record preSentinelHeal');
1070
- } finally {
1071
- rmdir(tmp);
1072
- }
1073
- });
1074
-
1075
- // (g) allowPreSentinelHeal=true + committed + FAIL sentinel → stays transcript_errors
1076
- test('pre-sentinel heal: committed + SCHEDULER_VERDICT: FAIL + allowPreSentinelHeal → transcript_errors', async () => {
1077
- const tmp = makeTmpDir();
1078
- try {
1079
- const slug = '86-pre-sentinel-heal-fail';
1080
- writeLog(tmp, slug, tracebackRunEvents('SCHEDULER_VERDICT: FAIL AC gate was red'));
1081
- const prdPath = writePrd(tmp, slug, '# Pre-sentinel heal blocked by FAIL');
1082
- const verdict = await verifyRun({
1083
- runDir: tmp,
1084
- prdPath,
1085
- queueEntry: { slug, status: 'needs_review' },
1086
- allJobs: [],
1087
- committedDuringRun: true,
1088
- allowPreSentinelHeal: true,
1089
- });
1090
- assert.equal(verdict.verdict, 'transcript_errors', `FAIL sentinel must block pre-sentinel heal, got ${verdict.verdict}: ${verdict.reason}`);
1091
- assert.equal(verdict.downgradeTo, 'needs_review');
1092
- } finally {
1093
- rmdir(tmp);
1094
- }
1095
- });
1096
-
1097
- // (h) allowPreSentinelHeal=true + NOT committed + no sentinel → stays transcript_errors
1098
- test('pre-sentinel heal: not committed + no sentinel + allowPreSentinelHeal → transcript_errors', async () => {
1099
- const tmp = makeTmpDir();
1100
- try {
1101
- const slug = '86-pre-sentinel-heal-uncommitted';
1102
- writeLog(tmp, slug, tracebackRunEvents(null));
1103
- const prdPath = writePrd(tmp, slug, '# Pre-sentinel heal blocked by no commit');
1104
- const verdict = await verifyRun({
1105
- runDir: tmp,
1106
- prdPath,
1107
- queueEntry: { slug, status: 'needs_review' },
1108
- allJobs: [],
1109
- committedDuringRun: false,
1110
- allowPreSentinelHeal: true,
1111
- });
1112
- assert.equal(verdict.verdict, 'transcript_errors', `no commit must block pre-sentinel heal, got ${verdict.verdict}: ${verdict.reason}`);
1113
- assert.equal(verdict.downgradeTo, 'needs_review');
1114
- } finally {
1115
- rmdir(tmp);
1116
- }
1117
- });
1118
-
1119
- // (i) allowPreSentinelHeal=false (default) + committed + no sentinel → baseline unchanged
1120
- test('no sentinel + committed + allowPreSentinelHeal=false (default) → transcript_errors', async () => {
1121
- const tmp = makeTmpDir();
1122
- try {
1123
- const slug = '86-pre-sentinel-heal-disabled';
1124
- writeLog(tmp, slug, tracebackRunEvents(null));
1125
- const prdPath = writePrd(tmp, slug, '# allowPreSentinelHeal disabled by default');
1126
- const verdict = await verifyRun({
1127
- runDir: tmp,
1128
- prdPath,
1129
- queueEntry: { slug, status: 'needs_review' },
1130
- allJobs: [],
1131
- committedDuringRun: true,
1132
- // allowPreSentinelHeal defaults to false
1133
- });
1134
- assert.equal(verdict.verdict, 'transcript_errors', `must not heal without allowPreSentinelHeal, got ${verdict.verdict}: ${verdict.reason}`);
1135
- assert.equal(verdict.downgradeTo, 'needs_review');
1136
- } finally {
1137
- rmdir(tmp);
1138
- }
1139
- });
1140
-
1141
- // ─── no_verdict_sentinel: no commit + no sentinel is not "clean" by default ──
1142
-
1143
- /** A run with zero tool_result pattern hits — e.g. the agent asked a
1144
- * clarifying question and stopped, ending its turn without touching tools. */
1145
- function noOpRunEvents(resultText) {
1146
- return [
1147
- { type: 'result', subtype: 'success', result: resultText },
1148
- ];
1149
- }
1150
-
1151
- test('no_verdict_sentinel: no tool_result issues, no sentinel, no commit → needs_review', async () => {
1152
- const tmp = makeTmpDir();
1153
- try {
1154
- const slug = '406-capture-panel-ui';
1155
- writeLog(tmp, slug, noOpRunEvents('I need clarification on which capture API to target before proceeding.'));
1156
- const prdPath = writePrd(tmp, slug, '# Browser capture panel UI');
1157
- const verdict = await verifyRun({
1158
- runDir: tmp,
1159
- prdPath,
1160
- queueEntry: { slug, status: 'running' },
1161
- allJobs: [],
1162
- committedDuringRun: false,
1163
- });
1164
- assert.equal(verdict.verdict, 'no_verdict_sentinel', `expected no_verdict_sentinel, got ${verdict.verdict}: ${verdict.reason}`);
1165
- assert.equal(verdict.downgradeTo, 'needs_review');
1166
- } finally {
1167
- rmdir(tmp);
1168
- }
1169
- });
1170
-
1171
- test('no_verdict_sentinel guard: same run but committedDuringRun:true → stays clean', async () => {
1172
- const tmp = makeTmpDir();
1173
- try {
1174
- const slug = '406-capture-panel-ui-committed';
1175
- writeLog(tmp, slug, noOpRunEvents('I need clarification on which capture API to target before proceeding.'));
1176
- const prdPath = writePrd(tmp, slug, '# Browser capture panel UI');
1177
- const verdict = await verifyRun({
1178
- runDir: tmp,
1179
- prdPath,
1180
- queueEntry: { slug, status: 'running' },
1181
- allJobs: [],
1182
- committedDuringRun: true,
1183
- });
1184
- assert.equal(verdict.verdict, 'clean', `commit landed should stay clean, got ${verdict.verdict}: ${verdict.reason}`);
1185
- assert.equal(verdict.downgradeTo, null);
1186
- } finally {
1187
- rmdir(tmp);
1188
- }
1189
- });
1190
-
1191
- test('no_verdict_sentinel guard: same run but with SCHEDULER_VERDICT: PASS sentinel + a commit → stays clean', async () => {
1192
- const tmp = makeTmpDir();
1193
- try {
1194
- const slug = '406-capture-panel-ui-sentinel';
1195
- writeLog(tmp, slug, noOpRunEvents('All acceptance criteria verified.\nSCHEDULER_VERDICT: PASS'));
1196
- const prdPath = writePrd(tmp, slug, '# Browser capture panel UI');
1197
- const verdict = await verifyRun({
1198
- runDir: tmp,
1199
- prdPath,
1200
- queueEntry: { slug, status: 'running' },
1201
- allJobs: [],
1202
- committedDuringRun: true,
1203
- });
1204
- assert.equal(verdict.verdict, 'clean', `PASS sentinel + commit should stay clean, got ${verdict.verdict}: ${verdict.reason}`);
1205
- assert.equal(verdict.downgradeTo, null);
1206
- } finally {
1207
- rmdir(tmp);
1208
- }
1209
- });
1210
-
1211
- // ─── abandoned_background_task: auto-backgrounded Bash + no sentinel/commit ─
1212
-
1213
- /** A run whose Bash command hit the harness's 120s foreground timeout and was
1214
- * auto-backgrounded, then the run ended without ever coming back to commit
1215
- * or emit the finish-protocol sentinel. */
1216
- function abandonedBackgroundTaskRunEvents(resultText) {
1217
- return [
1218
- {
1219
- type: 'assistant',
1220
- message: {
1221
- role: 'assistant',
1222
- content: [{
1223
- type: 'tool_use',
1224
- id: 'toolu_bg_001',
1225
- name: 'Bash',
1226
- input: { command: 'npm run test:unit', description: 'Run full unit suite' },
1227
- }],
1228
- },
1229
- },
1230
- {
1231
- type: 'user',
1232
- message: {
1233
- role: 'user',
1234
- content: [{
1235
- type: 'tool_result',
1236
- tool_use_id: 'toolu_bg_001',
1237
- content: 'Command did not complete within its 120s timeout and was moved to the background (ID: bcn1lpvpd). Output is being written to: /tmp/claude-1000/tasks/bcn1lpvpd.output. You will be notified when it completes. To check interim output, use Read on that file path.',
1238
- is_error: false,
1239
- }],
1240
- },
1241
- },
1242
- { type: 'result', subtype: 'success', result: resultText },
1243
- ];
1244
- }
1245
-
1246
- test('abandoned_background_task: background marker + no sentinel + no commit → abandoned_background_task', async () => {
1247
- const tmp = makeTmpDir();
1248
- try {
1249
- const slug = '1116-encyclopedia-animations-section';
1250
- writeLog(tmp, slug, abandonedBackgroundTaskRunEvents('Waiting for the backgrounded test run to finish.'));
1251
- const prdPath = writePrd(tmp, slug, '# Encyclopedia animations section');
1252
- const verdict = await verifyRun({
1253
- runDir: tmp,
1254
- prdPath,
1255
- queueEntry: { slug, status: 'running' },
1256
- allJobs: [],
1257
- committedDuringRun: false,
1258
- });
1259
- assert.equal(verdict.verdict, 'abandoned_background_task', `expected abandoned_background_task, got ${verdict.verdict}: ${verdict.reason}`);
1260
- assert.equal(verdict.downgradeTo, 'needs_review');
1261
- } finally {
1262
- rmdir(tmp);
1263
- }
1264
- });
1265
-
1266
- test('abandoned_background_task guard: no background marker, no sentinel, no commit → stays plain no_verdict_sentinel', async () => {
1267
- const tmp = makeTmpDir();
1268
- try {
1269
- const slug = '1116-no-background-marker';
1270
- writeLog(tmp, slug, noOpRunEvents('I need clarification on which capture API to target before proceeding.'));
1271
- const prdPath = writePrd(tmp, slug, '# Encyclopedia animations section');
1272
- const verdict = await verifyRun({
1273
- runDir: tmp,
1274
- prdPath,
1275
- queueEntry: { slug, status: 'running' },
1276
- allJobs: [],
1277
- committedDuringRun: false,
1278
- });
1279
- assert.equal(verdict.verdict, 'no_verdict_sentinel', `expected plain no_verdict_sentinel, got ${verdict.verdict}: ${verdict.reason}`);
1280
- } finally {
1281
- rmdir(tmp);
1282
- }
1283
- });
1284
-
1285
- test('abandoned_background_task guard: background marker present but run DID commit → clean', async () => {
1286
- const tmp = makeTmpDir();
1287
- try {
1288
- const slug = '1116-background-marker-but-committed';
1289
- writeLog(tmp, slug, abandonedBackgroundTaskRunEvents('Backgrounded test run finished green; work committed.'));
1290
- const prdPath = writePrd(tmp, slug, '# Encyclopedia animations section');
1291
- const verdict = await verifyRun({
1292
- runDir: tmp,
1293
- prdPath,
1294
- queueEntry: { slug, status: 'running' },
1295
- allJobs: [],
1296
- committedDuringRun: true,
1297
- });
1298
- assert.equal(verdict.verdict, 'clean', `background marker with a landed commit should stay clean, got ${verdict.verdict}: ${verdict.reason}`);
1299
- assert.equal(verdict.downgradeTo, null);
1300
- } finally {
1301
- rmdir(tmp);
1302
- }
1303
- });
1304
-
1305
- // ─── pass_no_commit: PASS sentinel with no commit is not "clean" ───────────
1306
-
1307
- test('pass_no_commit: SCHEDULER_VERDICT: PASS but no commit landed → needs_review', async () => {
1308
- const tmp = makeTmpDir();
1309
- try {
1310
- const slug = '511-recorder-mouse-drag-panel-export';
1311
- writeLog(tmp, slug, noOpRunEvents('All acceptance criteria verified.\nSCHEDULER_VERDICT: PASS'));
1312
- const prdPath = writePrd(tmp, slug, '# Recorder mouse drag panel export');
1313
- const verdict = await verifyRun({
1314
- runDir: tmp,
1315
- prdPath,
1316
- queueEntry: { slug, status: 'running' },
1317
- allJobs: [],
1318
- committedDuringRun: false,
1319
- });
1320
- assert.equal(verdict.verdict, 'pass_no_commit', `expected pass_no_commit, got ${verdict.verdict}: ${verdict.reason}`);
1321
- assert.equal(verdict.downgradeTo, 'needs_review');
1322
- } finally {
1323
- rmdir(tmp);
1324
- }
1325
- });
1326
-
1327
- test('pass_no_commit: fix-plan job (slug ^\\d+-fix-) with PASS but no commit is exempt → clean', async () => {
1328
- const tmp = makeTmpDir();
1329
- try {
1330
- const slug = '523-fix-bounded-fix-plan-retry';
1331
- writeLog(tmp, slug, noOpRunEvents('Verification complete — no code gap exists.\nSCHEDULER_VERDICT: PASS'));
1332
- const prdPath = writePrd(tmp, slug, '# Fix: bounded fix-plan retry');
1333
- const verdict = await verifyRun({
1334
- runDir: tmp,
1335
- prdPath,
1336
- queueEntry: { slug, status: 'running' },
1337
- allJobs: [],
1338
- committedDuringRun: false,
1339
- });
1340
- assert.equal(verdict.verdict, 'clean', `expected clean (fix-plan exemption), got ${verdict.verdict}: ${verdict.reason}`);
1341
- } finally {
1342
- rmdir(tmp);
1343
- }
1344
- });
1345
-
1346
- // ─── pass_no_commit_already_shipped: original PRD re-run after landing ─────
1347
- // (incident: 655-needs-review-rca-feedback-hook, 2026-07-31)
1348
-
1349
- const { extractPrdDeliverablePaths, allDeliverablesAlreadyTracked } = require('../runVerify.cjs');
1350
- const REPO_ROOT = path.resolve(__dirname, '../../..');
1351
-
1352
- test('pass_no_commit: original PRD, PASS no commit, all deliverable paths already tracked in git → pass_no_commit_already_shipped', async () => {
1353
- const tmp = makeTmpDir();
1354
- try {
1355
- const slug = '655-needs-review-rca-feedback-hook';
1356
- writeLog(tmp, slug, noOpRunEvents('Verified rcaReport.cjs already shipped in e13168d; typecheck + tests green; no commit needed.\nSCHEDULER_VERDICT: PASS'));
1357
- const prdPath = writePrd(tmp, slug, 'Deliverables: `src/main/lib/rcaReport.cjs` and `src/main/__tests__/rcaReport.test.cjs`.');
1358
- const verdict = await verifyRun({
1359
- runDir: tmp,
1360
- prdPath,
1361
- queueEntry: { slug, status: 'running', cwd: REPO_ROOT },
1362
- allJobs: [],
1363
- committedDuringRun: false,
1364
- });
1365
- assert.equal(verdict.verdict, 'pass_no_commit_already_shipped', `expected already-shipped exemption, got ${verdict.verdict}: ${verdict.reason}`);
1366
- assert.equal(verdict.downgradeTo, null);
1367
- } finally {
1368
- rmdir(tmp);
1369
- }
1370
- });
1371
-
1372
- test('pass_no_commit: original PRD, PASS no commit, one deliverable path untracked → falls through to pass_no_commit', async () => {
1373
- const tmp = makeTmpDir();
1374
- try {
1375
- const slug = '655-needs-review-rca-feedback-hook';
1376
- writeLog(tmp, slug, noOpRunEvents('Nothing to do here.\nSCHEDULER_VERDICT: PASS'));
1377
- const prdPath = writePrd(tmp, slug, 'Deliverables: `src/main/lib/rcaReport.cjs` and `src/main/lib/does-not-exist-xyz.cjs`.');
1378
- const verdict = await verifyRun({
1379
- runDir: tmp,
1380
- prdPath,
1381
- queueEntry: { slug, status: 'running', cwd: REPO_ROOT },
1382
- allJobs: [],
1383
- committedDuringRun: false,
1384
- });
1385
- assert.equal(verdict.verdict, 'pass_no_commit', `expected fallback to pass_no_commit, got ${verdict.verdict}: ${verdict.reason}`);
1386
- } finally {
1387
- rmdir(tmp);
1388
- }
1389
- });
1390
-
1391
- test('pass_no_commit: original PRD, PASS no commit, zero extractable deliverable paths → falls through to pass_no_commit', async () => {
1392
- const tmp = makeTmpDir();
1393
- try {
1394
- const slug = '999-some-vague-prd';
1395
- writeLog(tmp, slug, noOpRunEvents('Nothing to do here.\nSCHEDULER_VERDICT: PASS'));
1396
- const prdPath = writePrd(tmp, slug, 'This PRD names no file paths at all, just prose.');
1397
- const verdict = await verifyRun({
1398
- runDir: tmp,
1399
- prdPath,
1400
- queueEntry: { slug, status: 'running', cwd: REPO_ROOT },
1401
- allJobs: [],
1402
- committedDuringRun: false,
1403
- });
1404
- assert.equal(verdict.verdict, 'pass_no_commit', `expected fallback to pass_no_commit, got ${verdict.verdict}: ${verdict.reason}`);
1405
- } finally {
1406
- rmdir(tmp);
1407
- }
1408
- });
1409
-
1410
- // (incident: 812-commit-guard-retry-on-worktree-ref-visibility-delay — a
1411
- // stale scheduler process, booted before the already-shipped exemption
1412
- // landed, produced a false pass_no_commit for exactly this shape of re-run)
1413
- test('pass_no_commit: commit-guard-retry PRD naming scheduler.cjs + its committed-in-window test, PASS no commit → pass_no_commit_already_shipped', async () => {
1414
- const tmp = makeTmpDir();
1415
- try {
1416
- const slug = '812-commit-guard-retry-on-worktree-ref-visibility-delay';
1417
- writeLog(tmp, slug, noOpRunEvents('Retry + tests already present; nothing to change.\nSCHEDULER_VERDICT: PASS'));
1418
- const prdPath = writePrd(
1419
- tmp,
1420
- slug,
1421
- 'Deliverables: `src/main/scheduler.cjs` and `src/main/__tests__/scheduler-committed-in-window.test.cjs`.',
1422
- );
1423
- const verdict = await verifyRun({
1424
- runDir: tmp,
1425
- prdPath,
1426
- queueEntry: { slug, status: 'running', cwd: REPO_ROOT },
1427
- allJobs: [],
1428
- committedDuringRun: false,
1429
- });
1430
- assert.equal(verdict.verdict, 'pass_no_commit_already_shipped', `expected already-shipped exemption, got ${verdict.verdict}: ${verdict.reason}`);
1431
- assert.equal(verdict.downgradeTo, null);
1432
- } finally {
1433
- rmdir(tmp);
1434
- }
1435
- });
1436
-
1437
- test('extractPrdDeliverablePaths: extracts backticked repo-relative paths, ignores prose', () => {
1438
- const body = 'Deliverables: `src/main/lib/rcaReport.cjs` and `src/main/__tests__/rcaReport.test.cjs`. Also see node_modules/foo/bar.js which should be excluded.';
1439
- const paths = extractPrdDeliverablePaths(body);
1440
- assert.deepEqual(paths, ['src/main/lib/rcaReport.cjs', 'src/main/__tests__/rcaReport.test.cjs']);
1441
- assert.deepEqual(extractPrdDeliverablePaths(''), []);
1442
- assert.deepEqual(extractPrdDeliverablePaths(undefined), []);
1443
- });
1444
-
1445
- test('allDeliverablesAlreadyTracked: fail-safe on empty paths, non-git cwd, and git errors', () => {
1446
- assert.equal(allDeliverablesAlreadyTracked({ cwd: REPO_ROOT, paths: [] }), false);
1447
- assert.equal(allDeliverablesAlreadyTracked({
1448
- cwd: REPO_ROOT,
1449
- paths: ['src/main/runVerify.cjs'],
1450
- execImpl: () => { throw new Error('boom'); },
1451
- }), false);
1452
- assert.equal(allDeliverablesAlreadyTracked({
1453
- cwd: REPO_ROOT,
1454
- paths: ['src/main/runVerify.cjs'],
1455
- execImpl: () => '',
1456
- }), true);
1457
- });
1458
-
1459
- // ─── repo-root config deliverable extraction ────────────────────────────────
1460
- // (incident: 816-vitest-register-runverify-test, 2026-07-31 — PRD named only
1461
- // `vitest.config.ts` as its deliverable; the source-dir-only regex extracted
1462
- // nothing, so allDeliverablesAlreadyTracked early-returned false even though
1463
- // the config edit was already tracked in git)
1464
-
1465
- test('extractPrdDeliverablePaths: extracts a root-config file alongside a src path', () => {
1466
- const body = 'Register the test in `vitest.config.ts` and port `src/main/__tests__/runVerify.test.cjs` onto vitest.';
1467
- const paths = extractPrdDeliverablePaths(body);
1468
- assert.deepEqual(new Set(paths), new Set(['vitest.config.ts', 'src/main/__tests__/runVerify.test.cjs']));
1469
- });
1470
-
1471
- test('extractPrdDeliverablePaths: root-config-only PRD body yields a non-empty result', () => {
1472
- const body = 'The only deliverable is `vitest.config.ts` — add the missing test.include entry.';
1473
- const paths = extractPrdDeliverablePaths(body);
1474
- assert.deepEqual(paths, ['vitest.config.ts']);
1475
- });
1476
-
1477
- test('extractPrdDeliverablePaths: nested or non-allowlisted root files do not produce spurious root-config entries', () => {
1478
- const body = 'See `some/nested/package.json` for the dependency, and update README.md with notes.';
1479
- const paths = extractPrdDeliverablePaths(body);
1480
- assert.equal(paths.includes('package.json'), false);
1481
- assert.equal(paths.includes('README.md'), false);
1482
- assert.deepEqual(paths, []);
1483
- });
1484
-
1485
- test('pass_no_commit: root-config-only PRD, PASS no commit, config already tracked → pass_no_commit_already_shipped', async () => {
1486
- const tmp = makeTmpDir();
1487
- try {
1488
- const slug = '816-vitest-register-runverify-test';
1489
- writeLog(tmp, slug, noOpRunEvents('Registered already in vitest.config.ts; 48 tests green.\nSCHEDULER_VERDICT: PASS'));
1490
- const prdPath = writePrd(tmp, slug, 'Deliverable: register the test file in `vitest.config.ts`.');
1491
- const verdict = await verifyRun({
1492
- runDir: tmp,
1493
- prdPath,
1494
- queueEntry: { slug, status: 'running', cwd: REPO_ROOT },
1495
- allJobs: [],
1496
- committedDuringRun: false,
1497
- });
1498
- assert.equal(verdict.verdict, 'pass_no_commit_already_shipped', `expected already-shipped exemption, got ${verdict.verdict}: ${verdict.reason}`);
1499
- assert.equal(verdict.downgradeTo, null);
1500
- } finally {
1501
- rmdir(tmp);
1502
- }
1503
- });
1504
-
1505
- // ─── pass_no_commit_prior_run_verified: re-fired slug whose PRIOR run landed ─
1506
- // (incident: 812-workbench-review-nits-cleanup, 2026-07-31)
1507
-
1508
- const { isAncestorCommit } = require('../runVerify.cjs');
1509
- const REPO_ROOT_COMMIT = execFileSync('git', ['rev-list', '--max-parents=0', 'HEAD'], {
1510
- cwd: REPO_ROOT, encoding: 'utf8',
1511
- }).trim().split('\n')[0];
1512
-
1513
- test('pass_no_commit: PASS, no commit, priorLandedCommit is an ancestor of HEAD → pass_no_commit_prior_run_verified', async () => {
1514
- const tmp = makeTmpDir();
1515
- try {
1516
- const slug = '812-workbench-review-nits-cleanup';
1517
- writeLog(tmp, slug, noOpRunEvents('Re-checked every AC item; all already implemented by an earlier run.\nSCHEDULER_VERDICT: PASS'));
1518
- const prdPath = writePrd(tmp, slug, 'This PRD names no deliverable paths, just prose.');
1519
- const verdict = await verifyRun({
1520
- runDir: tmp,
1521
- prdPath,
1522
- queueEntry: { slug, status: 'running', cwd: REPO_ROOT },
1523
- allJobs: [],
1524
- committedDuringRun: false,
1525
- priorLandedCommit: REPO_ROOT_COMMIT,
1526
- });
1527
- assert.equal(verdict.verdict, 'pass_no_commit_prior_run_verified', `expected prior-run exemption, got ${verdict.verdict}: ${verdict.reason}`);
1528
- assert.equal(verdict.downgradeTo, null);
1529
- assert.equal(verdict.priorLandedCommit, REPO_ROOT_COMMIT);
1530
- } finally {
1531
- rmdir(tmp);
1532
- }
1533
- });
1534
-
1535
- test('pass_no_commit: PASS, no commit, priorLandedCommit is NOT an ancestor of HEAD → pass_no_commit', async () => {
1536
- const tmp = makeTmpDir();
1537
- try {
1538
- const slug = '812-workbench-review-nits-cleanup';
1539
- writeLog(tmp, slug, noOpRunEvents('Nothing to do here.\nSCHEDULER_VERDICT: PASS'));
1540
- const prdPath = writePrd(tmp, slug, 'This PRD names no deliverable paths, just prose.');
1541
- const verdict = await verifyRun({
1542
- runDir: tmp,
1543
- prdPath,
1544
- queueEntry: { slug, status: 'running', cwd: REPO_ROOT },
1545
- allJobs: [],
1546
- committedDuringRun: false,
1547
- priorLandedCommit: '0000000000000000000000000000000000000000',
1548
- });
1549
- assert.equal(verdict.verdict, 'pass_no_commit', `expected fallback to pass_no_commit, got ${verdict.verdict}: ${verdict.reason}`);
1550
- } finally {
1551
- rmdir(tmp);
1552
- }
1553
- });
1554
-
1555
- test('isAncestorCommit: fail-safe on missing sha and on a throwing execImpl (git error)', () => {
1556
- assert.equal(isAncestorCommit({ cwd: REPO_ROOT, sha: null }), false);
1557
- assert.equal(isAncestorCommit({
1558
- cwd: REPO_ROOT,
1559
- sha: REPO_ROOT_COMMIT,
1560
- execImpl: () => { throw new Error('git: command not found'); },
1561
- }), false);
1562
- assert.equal(isAncestorCommit({
1563
- cwd: REPO_ROOT,
1564
- sha: REPO_ROOT_COMMIT,
1565
- execImpl: () => '',
1566
- }), true);
1567
- });
1568
-
1569
- test('pass_no_commit: PASS, no commit, priorLandedCommit not supplied (null) → pass_no_commit (regression guard)', async () => {
1570
- const tmp = makeTmpDir();
1571
- try {
1572
- const slug = '812-workbench-review-nits-cleanup';
1573
- writeLog(tmp, slug, noOpRunEvents('Nothing to do here.\nSCHEDULER_VERDICT: PASS'));
1574
- const prdPath = writePrd(tmp, slug, 'This PRD names no deliverable paths, just prose.');
1575
- const verdict = await verifyRun({
1576
- runDir: tmp,
1577
- prdPath,
1578
- queueEntry: { slug, status: 'running', cwd: REPO_ROOT },
1579
- allJobs: [],
1580
- committedDuringRun: false,
1581
- });
1582
- assert.equal(verdict.verdict, 'pass_no_commit', `expected pass_no_commit with no priorLandedCommit, got ${verdict.verdict}: ${verdict.reason}`);
1583
- } finally {
1584
- rmdir(tmp);
1585
- }
1586
- });
1587
-
1588
- // (e) halt + sentinel PASS → still halt (override must not apply to halt)
1589
- test('halt result + sentinel PASS + committedDuringRun:true → still halt', async () => {
1590
- const tmp = makeTmpDir();
1591
- try {
1592
- const slug = '77-halt-sentinel-pass';
1593
- const logEvents = [
1594
- {
1595
- type: 'assistant',
1596
- message: {
1597
- role: 'assistant',
1598
- content: [{
1599
- type: 'tool_use',
1600
- id: 'toolu_halt_001',
1601
- name: 'Bash',
1602
- input: { command: 'check deps', description: 'Check prerequisites' },
1603
- }],
1604
- },
1605
- },
1606
- {
1607
- type: 'user',
1608
- message: {
1609
- role: 'user',
1610
- content: [{
1611
- type: 'tool_result',
1612
- tool_use_id: 'toolu_halt_001',
1613
- content: 'dep not ready',
1614
- is_error: false,
1615
- }],
1616
- },
1617
- },
1618
- {
1619
- type: 'result',
1620
- subtype: 'success',
1621
- result: 'HALT: prerequisite not met\nSCHEDULER_VERDICT: PASS',
1622
- },
1623
- ];
1624
- writeLog(tmp, slug, logEvents);
1625
- const prdPath = writePrd(tmp, slug, '# Halt with sentinel');
1626
- const verdict = await verifyRun({
1627
- runDir: tmp,
1628
- prdPath,
1629
- queueEntry: { slug, status: 'running' },
1630
- allJobs: [],
1631
- committedDuringRun: true,
1632
- });
1633
- assert.equal(verdict.verdict, 'halt', `halt must survive even with PASS sentinel, got ${verdict.verdict}: ${verdict.reason}`);
1634
- assert.equal(verdict.downgradeTo, 'pending');
1635
- } finally {
1636
- rmdir(tmp);
1637
- }
1638
- });
1639
-
1640
- // ─── -merge-main postcondition exemption tests (2026-07-18 feedback) ──────────
1641
-
1642
- const { isMergeMainSlug, extractMergeMainPrNumber } = require('../runVerify.cjs');
1643
-
1644
- test('isMergeMainSlug matches the NN-prXXX-merge-main and NN-fix-prXXX-merge-main conventions', () => {
1645
- assert.equal(isMergeMainSlug('565-pr188-merge-main'), true);
1646
- assert.equal(isMergeMainSlug('571-fix-pr141-merge-main'), true);
1647
- assert.equal(isMergeMainSlug('523-fix-bounded-fix-plan-retry'), false);
1648
- assert.equal(isMergeMainSlug('406-capture-panel-ui'), false);
1649
- assert.equal(isMergeMainSlug(''), false);
1650
- assert.equal(isMergeMainSlug(undefined), false);
1651
- });
1652
-
1653
- test('extractMergeMainPrNumber prefers "PR #<n>" in text, falls back to slug', () => {
1654
- assert.equal(extractMergeMainPrNumber('565-pr188-merge-main', 'title: Merge current main into sigma PR #188 (round 2)'), 188);
1655
- assert.equal(extractMergeMainPrNumber('565-pr188-merge-main', 'no pr mention here'), 188);
1656
- assert.equal(extractMergeMainPrNumber('non-standard-slug', 'no pr mention here'), null);
1657
- });
1658
-
1659
- // (1) -merge-main + PASS + no commit + gh reports MERGEABLE/non-CONFLICTING → verified, no issue
1660
- test('merge-main exemption: gh reports MERGEABLE → pass_no_commit_target_verified, no issue pushed', async () => {
1661
- const tmp = makeTmpDir();
1662
- try {
1663
- const slug = '565-pr188-merge-main';
1664
- writeLog(tmp, slug, noOpRunEvents('PR #188 was already merged into main by another actor.\nSCHEDULER_VERDICT: PASS'));
1665
- const prdPath = writePrd(tmp, slug, '# Merge current main into sigma PR #188');
1666
- let ghCalls = 0;
1667
- const ghExecImpl = (cmd, args, opts) => {
1668
- ghCalls++;
1669
- assert.equal(cmd, 'gh');
1670
- assert.deepEqual(args, ['pr', 'view', '188', '--json', 'mergeable,mergeStateStatus']);
1671
- assert.equal(opts.cwd, '/tmp/sigma');
1672
- return JSON.stringify({ mergeable: 'MERGEABLE', mergeStateStatus: 'BEHIND' });
1673
- };
1674
- const verdict = await verifyRun({
1675
- runDir: tmp,
1676
- prdPath,
1677
- queueEntry: { slug, status: 'running', cwd: '/tmp/sigma' },
1678
- allJobs: [],
1679
- committedDuringRun: false,
1680
- ghExecImpl,
1681
- });
1682
- assert.equal(ghCalls, 1);
1683
- assert.equal(verdict.verdict, 'pass_no_commit_target_verified', `expected verified verdict, got ${verdict.verdict}: ${verdict.reason}`);
1684
- assert.equal(verdict.downgradeTo, null);
1685
- assert.equal(verdict.verifiedPrNumber, 188);
1686
- } finally {
1687
- rmdir(tmp);
1688
- }
1689
- });
1690
-
1691
- // (2) -merge-main + PASS + no commit + gh reports CONFLICTING → falls through to pass_no_commit
1692
- test('merge-main exemption: gh reports CONFLICTING → falls through to pass_no_commit', async () => {
1693
- const tmp = makeTmpDir();
1694
- try {
1695
- const slug = '565-pr188-merge-main';
1696
- writeLog(tmp, slug, noOpRunEvents('PR #188 needs no further work.\nSCHEDULER_VERDICT: PASS'));
1697
- const prdPath = writePrd(tmp, slug, '# Merge current main into sigma PR #188');
1698
- const ghExecImpl = () => JSON.stringify({ mergeable: 'MERGEABLE', mergeStateStatus: 'CONFLICTING' });
1699
- const verdict = await verifyRun({
1700
- runDir: tmp,
1701
- prdPath,
1702
- queueEntry: { slug, status: 'running', cwd: '/tmp/sigma' },
1703
- allJobs: [],
1704
- committedDuringRun: false,
1705
- ghExecImpl,
1706
- });
1707
- assert.equal(verdict.verdict, 'pass_no_commit', `expected fallback to pass_no_commit, got ${verdict.verdict}: ${verdict.reason}`);
1708
- assert.equal(verdict.downgradeTo, 'needs_review');
1709
- } finally {
1710
- rmdir(tmp);
1711
- }
1712
- });
1713
-
1714
- // (3) -merge-main + PASS + no commit + gh call fails/times out → falls through to pass_no_commit, never throws
1715
- test('merge-main exemption: gh call throws → falls through to pass_no_commit, never throws', async () => {
1716
- const tmp = makeTmpDir();
1717
- try {
1718
- const slug = '565-pr188-merge-main';
1719
- writeLog(tmp, slug, noOpRunEvents('PR #188 needs no further work.\nSCHEDULER_VERDICT: PASS'));
1720
- const prdPath = writePrd(tmp, slug, '# Merge current main into sigma PR #188');
1721
- const ghExecImpl = () => { throw new Error('gh: command not found'); };
1722
- const verdict = await verifyRun({
1723
- runDir: tmp,
1724
- prdPath,
1725
- queueEntry: { slug, status: 'running', cwd: '/tmp/sigma' },
1726
- allJobs: [],
1727
- committedDuringRun: false,
1728
- ghExecImpl,
1729
- });
1730
- assert.equal(verdict.verdict, 'pass_no_commit', `expected fallback to pass_no_commit, got ${verdict.verdict}: ${verdict.reason}`);
1731
- assert.equal(verdict.downgradeTo, 'needs_review');
1732
- } finally {
1733
- rmdir(tmp);
1734
- }
1735
- });
1736
-
1737
- // (4) non-merge-main slug, PASS + no commit → unchanged pass_no_commit behavior, zero gh invocations
1738
- test('merge-main exemption: non-merge-main slug never attempts a gh call', async () => {
1739
- const tmp = makeTmpDir();
1740
- try {
1741
- const slug = '406-capture-panel-ui';
1742
- writeLog(tmp, slug, noOpRunEvents('All acceptance criteria verified.\nSCHEDULER_VERDICT: PASS'));
1743
- const prdPath = writePrd(tmp, slug, '# Browser capture panel UI');
1744
- let ghCalls = 0;
1745
- const ghExecImpl = () => { ghCalls++; return JSON.stringify({ mergeable: 'MERGEABLE', mergeStateStatus: 'CLEAN' }); };
1746
- const verdict = await verifyRun({
1747
- runDir: tmp,
1748
- prdPath,
1749
- queueEntry: { slug, status: 'running', cwd: '/tmp/proj' },
1750
- allJobs: [],
1751
- committedDuringRun: false,
1752
- ghExecImpl,
1753
- });
1754
- assert.equal(ghCalls, 0, 'gh must never be invoked for a non-merge-main slug');
1755
- assert.equal(verdict.verdict, 'pass_no_commit', `expected unchanged pass_no_commit, got ${verdict.verdict}: ${verdict.reason}`);
1756
- assert.equal(verdict.downgradeTo, 'needs_review');
1757
- } finally {
1758
- rmdir(tmp);
1759
- }
1760
- });
1761
-
1762
- // (5) -merge-main slug but a real commit DID land → unaffected, path unreachable, zero gh invocations
1763
- test('merge-main exemption: commit landed → path unreachable, zero gh invocations, verdict clean', async () => {
1764
- const tmp = makeTmpDir();
1765
- try {
1766
- const slug = '565-pr188-merge-main';
1767
- writeLog(tmp, slug, noOpRunEvents('Merged and pushed.\nSCHEDULER_VERDICT: PASS'));
1768
- const prdPath = writePrd(tmp, slug, '# Merge current main into sigma PR #188');
1769
- let ghCalls = 0;
1770
- const ghExecImpl = () => { ghCalls++; return JSON.stringify({ mergeable: 'MERGEABLE', mergeStateStatus: 'CLEAN' }); };
1771
- const verdict = await verifyRun({
1772
- runDir: tmp,
1773
- prdPath,
1774
- queueEntry: { slug, status: 'running', cwd: '/tmp/sigma' },
1775
- allJobs: [],
1776
- committedDuringRun: true,
1777
- ghExecImpl,
1778
- });
1779
- assert.equal(ghCalls, 0, 'gh must never be invoked when a commit already landed');
1780
- assert.equal(verdict.verdict, 'clean', `expected clean (commit landed, sentinel PASS), got ${verdict.verdict}: ${verdict.reason}`);
1781
- } finally {
1782
- rmdir(tmp);
1783
- }
1784
- });