claude-code-session-manager 0.97.0 → 0.100.0
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/README.md +3 -3
- package/bin/cli.cjs +16 -4
- package/bin/node-floor.cjs +41 -0
- package/dist/assets/{DataModel-D93FoaOm.js → DataModel-HdR0AxFq.js} +1 -1
- package/dist/assets/{History-CXxxqNP1.js → History-Dr4Jr_5z.js} +2 -2
- package/dist/assets/{Hooks-CzeYFQjq.js → Hooks-NhrvH3JP.js} +3 -3
- package/dist/assets/{Library-D2zPkwOC.js → Library-Dv_EtIMr.js} +1 -1
- package/dist/assets/{MarkdownEditor-DbinP78A.js → MarkdownEditor-DTKDWV_n.js} +1 -1
- package/dist/assets/{McpServers-Bu_sVGLr.js → McpServers-M034G9B3.js} +2 -2
- package/dist/assets/{Memory-BgiI6LZ_.js → Memory-DzF1B4gx.js} +6 -6
- package/dist/assets/{Permissions-C1MMzZRm.js → Permissions-DrgbSGWl.js} +3 -3
- package/dist/assets/{Plugins-Dhu6wAZi.js → Plugins-Bd3ef35w.js} +2 -2
- package/dist/assets/{ProvenanceBadge-C3AcWKMG.js → ProvenanceBadge-DcBHT1Iy.js} +1 -1
- package/dist/assets/{SaveBar-plwYm0iO.js → SaveBar-rimJem-Y.js} +1 -1
- package/dist/assets/Scheduler-DjgFJl2w.js +16 -0
- package/dist/assets/{ScopeSwitcher-DFy0vv_o.js → ScopeSwitcher-CnAzTBrl.js} +1 -1
- package/dist/assets/Settings-Dc1F_sSg.js +3 -0
- package/dist/assets/{SkillReferenceGraph-DsI7hRPB.js → SkillReferenceGraph-B9aZDecM.js} +1 -1
- package/dist/assets/{Skills-3E748UfB.js → Skills-DRXd18gu.js} +2 -2
- package/dist/assets/{SystemPrompt-BqmfUJOd.js → SystemPrompt-ahy5-Fwe.js} +1 -1
- package/dist/assets/{TagLibrary-CPz6fO8Q.js → TagLibrary-C_tToDeL.js} +1 -1
- package/dist/assets/{TiptapBody-D9EoBQ1P.js → TiptapBody-DvdefS6K.js} +1 -1
- package/dist/assets/{Toggle-BHAmZNDn.js → Toggle-6Jl5Njc6.js} +1 -1
- package/dist/assets/{index-CKH5Uxik.css → index-Bta-hwud.css} +1 -1
- package/dist/assets/{index-tn5JIVPj.js → index-vx8O73l8.js} +497 -502
- package/dist/assets/{settingsSchema-Crqy_aNz.js → settingsSchema-D6iRguNV.js} +1 -1
- package/dist/index.html +2 -2
- package/package.json +26 -29
- package/plugins/CLAUDE.md +6 -6
- package/plugins/session-manager-dev/skills/builder/4-manual/SKILL.md +23 -19
- package/plugins/session-manager-dev/skills/builder/SKILL.md +3 -3
- package/plugins/session-manager-dev/skills/develop/SKILL.md +254 -510
- package/plugins/session-manager-dev/skills/develop/standards.md +17 -22
- package/scripts/README.md +3 -11
- package/scripts/audit-ops-hygiene.cjs +3 -3
- package/scripts/hooks/lib/guard-prd-writes-policy.cjs +1 -1
- package/scripts/hooks/lib/guard-self-schedule-policy.cjs +1 -1
- package/scripts/mint-epic.cjs +2 -3
- package/scripts/scheduler-mcp-server.cjs +36 -7
- package/src/main/agentLibrary.cjs +22 -2
- package/src/main/build-info.json +4 -4
- package/src/main/config.cjs +41 -38
- package/src/main/docEdit.cjs +4 -1
- package/src/main/files.cjs +2 -5
- package/src/main/health.cjs +1 -1
- package/src/main/index.cjs +23 -10
- package/src/main/ipcSchemas.cjs +28 -35
- package/src/main/lib/agentPersonaSchema.cjs +13 -2
- package/src/main/lib/atomicFs.cjs +116 -0
- package/src/main/lib/branchSweep.cjs +13 -12
- package/src/main/lib/buildTarget.cjs +3 -3
- package/src/main/lib/claudeCliCaps.cjs +129 -0
- package/src/main/lib/credentials.cjs +2 -4
- package/src/main/lib/crossProjectFeedback.cjs +3 -3
- package/src/main/lib/cwdClassify.cjs +15 -3
- package/src/main/lib/definitionOfDone.cjs +207 -125
- package/src/main/lib/dodDrainHook.cjs +11 -5
- package/src/main/lib/epicMint.cjs +2 -4
- package/src/main/lib/epicStatusMirror.cjs +8 -10
- package/src/main/lib/epicWorktreeProjectConfig.cjs +2 -4
- package/src/main/lib/gateAuthority.cjs +96 -0
- package/src/main/lib/gitExec.cjs +69 -0
- package/src/main/lib/gitWorktree.cjs +656 -92
- package/src/main/lib/instanceLock.cjs +5 -8
- package/src/main/lib/launchFailure.cjs +2 -3
- package/src/main/lib/macroLibrary.cjs +386 -0
- package/src/main/lib/mcpToolCatalog.cjs +26 -17
- package/src/main/lib/needsReviewLedger.cjs +1 -1
- package/src/main/lib/opsErrorLog.cjs +11 -1
- package/src/main/lib/opsOwnership.cjs +0 -5
- package/src/main/lib/pidAlive.cjs +32 -0
- package/src/main/lib/prdCreate.cjs +153 -19
- package/src/main/lib/prdDisposition.cjs +2 -2
- package/src/main/lib/prdGateFiles.cjs +284 -0
- package/src/main/lib/prdLocations.cjs +61 -0
- package/src/main/lib/prdMigration.cjs +2 -3
- package/src/main/lib/prdSizing.cjs +2 -1
- package/src/main/lib/promptSessionSchema.cjs +10 -2
- package/src/main/lib/rcaReport.cjs +4 -6
- package/src/main/lib/reaperHelpers.cjs +8 -1
- package/src/main/lib/reservationExpiry.cjs +6 -1
- package/src/main/lib/reviewNotice.cjs +263 -0
- package/src/main/lib/runClaudeP.cjs +4 -1
- package/src/main/lib/schedulerPaths.cjs +22 -2
- package/src/main/lib/sessionSlots.cjs +2 -4
- package/src/main/lib/shippedPersonaSeeds.cjs +179 -0
- package/src/main/lib/timeoutShim.cjs +123 -0
- package/src/main/lib/timeoutShimScript.cjs +275 -0
- package/src/main/lib/upgradeDrain.cjs +4 -10
- package/src/main/lib/watchdogHelpers.cjs +33 -30
- package/src/main/lib/workTypeLibrary.cjs +7 -1
- package/src/main/promptSessionEvents.cjs +37 -13
- package/src/main/queueOps.cjs +17 -6
- package/src/main/scheduler.cjs +975 -203
- package/src/main/seedAgentPersonas.cjs +278 -23
- package/src/main/supervisor.cjs +4 -1
- package/src/main/templates/PRD_AUTHORING.md +126 -406
- package/src/preload/__tests__/preload-surface.test.cjs +68 -0
- package/src/preload/api.d.ts +41 -94
- package/src/preload/index.cjs +14 -9
- package/src/seed/agents/architect.md +1 -0
- package/src/seed/agents/dev-lead.md +17 -18
- package/src/seed/agents/project-home-builder.md +1 -0
- package/src/seed/agents/validator.md +10 -4
- package/dist/assets/HostBilko-nESrTRIg.js +0 -1
- package/dist/assets/Scheduler-BVYTeh39.js +0 -16
- package/dist/assets/Settings-DIhGgdfs.js +0 -3
- package/src/main/__tests__/activeIndexMerge.test.cjs +0 -235
- package/src/main/__tests__/agentEffortResolve.test.cjs +0 -117
- package/src/main/__tests__/agentLibrary.test.cjs +0 -276
- package/src/main/__tests__/agentModelResolve.test.cjs +0 -311
- package/src/main/__tests__/agentOverlayWrite.test.cjs +0 -95
- package/src/main/__tests__/bilkoHost-deriveSlug.test.cjs +0 -26
- package/src/main/__tests__/bilkoHost-integration.test.cjs +0 -118
- package/src/main/__tests__/bilkoHostCore.test.cjs +0 -72
- package/src/main/__tests__/broadcastCoalescer.test.cjs +0 -122
- package/src/main/__tests__/chat-cancel-terminal.test.cjs +0 -120
- package/src/main/__tests__/chat-dead-channels.test.cjs +0 -63
- package/src/main/__tests__/chat-exit-close-race.test.cjs +0 -146
- package/src/main/__tests__/chat-mcp-consent-notice.test.cjs +0 -139
- package/src/main/__tests__/chat-preamble-anchors.test.cjs +0 -100
- package/src/main/__tests__/chat-queue.test.cjs +0 -97
- package/src/main/__tests__/chat-stop-signal.test.cjs +0 -89
- package/src/main/__tests__/chatRunner-epic-worktree-execcwd.test.cjs +0 -125
- package/src/main/__tests__/chatRunner-session-flag-retry.test.cjs +0 -252
- package/src/main/__tests__/classifyPromptTicket.test.cjs +0 -101
- package/src/main/__tests__/classifyTranscriptLine.test.cjs +0 -201
- package/src/main/__tests__/computeDepHistorySatisfaction.test.cjs +0 -66
- package/src/main/__tests__/config-readText-bounded.test.cjs +0 -84
- package/src/main/__tests__/configWriteBoundaryOwners.test.cjs +0 -59
- package/src/main/__tests__/crossProjectFeedback.test.cjs +0 -334
- package/src/main/__tests__/crossProjectFeedbackRoutes.test.cjs +0 -161
- package/src/main/__tests__/dep-orphan-archive-health.test.cjs +0 -77
- package/src/main/__tests__/develop-skill-failure-modes.test.cjs +0 -70
- package/src/main/__tests__/docEdit.test.cjs +0 -244
- package/src/main/__tests__/dod-batchkey.test.cjs +0 -183
- package/src/main/__tests__/dod-drain-hook.test.cjs +0 -302
- package/src/main/__tests__/dod-report.test.cjs +0 -304
- package/src/main/__tests__/dod-reverify.test.cjs +0 -285
- package/src/main/__tests__/epicContextDigest.test.cjs +0 -174
- package/src/main/__tests__/epicMint.test.cjs +0 -332
- package/src/main/__tests__/epicMintTelemetryTap.test.cjs +0 -64
- package/src/main/__tests__/epicStatusMirror.test.cjs +0 -110
- package/src/main/__tests__/epicValidationHook.test.cjs +0 -291
- package/src/main/__tests__/exchanges.test.cjs +0 -122
- package/src/main/__tests__/exchangesPromptId.test.cjs +0 -61
- package/src/main/__tests__/extractJson.test.cjs +0 -51
- package/src/main/__tests__/files-reject-credentials.test.cjs +0 -40
- package/src/main/__tests__/fixtures/1218-fo-01-move-scripts-lib-into-src-main-lib.log +0 -556
- package/src/main/__tests__/flatPrdTickSweep.test.cjs +0 -110
- package/src/main/__tests__/health-build-freshness.test.cjs +0 -39
- package/src/main/__tests__/health-claude-md-budget.test.cjs +0 -57
- package/src/main/__tests__/health-credentials.test.cjs +0 -81
- package/src/main/__tests__/health-delegation-chain.test.cjs +0 -124
- package/src/main/__tests__/health-per-project-stall.test.cjs +0 -84
- package/src/main/__tests__/health-prd-migration.test.cjs +0 -37
- package/src/main/__tests__/health-queue-dispatch.test.cjs +0 -135
- package/src/main/__tests__/health-starve-escalation.test.cjs +0 -94
- package/src/main/__tests__/health-tick-liveness.test.cjs +0 -179
- package/src/main/__tests__/health-usage-poller.test.cjs +0 -144
- package/src/main/__tests__/health-worktree-cap-blocked.test.cjs +0 -65
- package/src/main/__tests__/heapSnapshot.test.cjs +0 -121
- package/src/main/__tests__/historyAggregatorIntraday.test.cjs +0 -313
- package/src/main/__tests__/historyDashboard.test.cjs +0 -163
- package/src/main/__tests__/historyRollup.test.cjs +0 -333
- package/src/main/__tests__/intradayRefresh.test.cjs +0 -39
- package/src/main/__tests__/ipcSchemas-dependsOn.test.cjs +0 -39
- package/src/main/__tests__/kg-augment.test.cjs +0 -195
- package/src/main/__tests__/loadGateDetailTick.test.cjs +0 -31
- package/src/main/__tests__/machineProfile.test.cjs +0 -152
- package/src/main/__tests__/mcpStatus.test.cjs +0 -61
- package/src/main/__tests__/memoryAggregate.test.cjs +0 -109
- package/src/main/__tests__/memoryStale.test.cjs +0 -88
- package/src/main/__tests__/needsReviewLedger.test.cjs +0 -162
- package/src/main/__tests__/openExternalApp-spawn-error.test.cjs +0 -25
- package/src/main/__tests__/opsErrorLog.test.cjs +0 -109
- package/src/main/__tests__/opsErrorLogTelemetryTap.test.cjs +0 -173
- package/src/main/__tests__/personaMerge.test.cjs +0 -169
- package/src/main/__tests__/planValidator.test.cjs +0 -125
- package/src/main/__tests__/pollLoop-dispatch-on-failure.test.cjs +0 -176
- package/src/main/__tests__/prd-group-allocator.test.cjs +0 -119
- package/src/main/__tests__/prdAdminRouteParity.test.cjs +0 -70
- package/src/main/__tests__/prdAdminRoutes.test.cjs +0 -718
- package/src/main/__tests__/prdAgentType.test.cjs +0 -103
- package/src/main/__tests__/prdAuthoringSeed.test.cjs +0 -39
- package/src/main/__tests__/prdCreate.test.cjs +0 -979
- package/src/main/__tests__/prdCreateDisposition.test.cjs +0 -201
- package/src/main/__tests__/prdCreatePlanId.test.cjs +0 -132
- package/src/main/__tests__/prdFrontmatterAgentType.test.cjs +0 -117
- package/src/main/__tests__/prdFrontmatterDependsOn.test.cjs +0 -136
- package/src/main/__tests__/prdFrontmatterDisposition.test.cjs +0 -125
- package/src/main/__tests__/prdFrontmatterQuietMachine.test.cjs +0 -108
- package/src/main/__tests__/prdLocations.test.cjs +0 -195
- package/src/main/__tests__/prdLocationsArchived.test.cjs +0 -201
- package/src/main/__tests__/prdMigration.test.cjs +0 -349
- package/src/main/__tests__/prdMigrationLegacyAdopt.test.cjs +0 -91
- package/src/main/__tests__/prdParserHighWater.test.cjs +0 -74
- package/src/main/__tests__/prdParserSourcePromptId.test.cjs +0 -65
- package/src/main/__tests__/prdSetDisposition.test.cjs +0 -222
- package/src/main/__tests__/prdSizing.test.cjs +0 -106
- package/src/main/__tests__/prdSourcePromptIdBackfill.test.cjs +0 -118
- package/src/main/__tests__/prdUpdateDependsOn.test.cjs +0 -160
- package/src/main/__tests__/proc-role-env.test.cjs +0 -125
- package/src/main/__tests__/procname-claude-spawn-sites.test.cjs +0 -304
- package/src/main/__tests__/procname-sm-processes.test.cjs +0 -127
- package/src/main/__tests__/projectHomeAdminRoutes.test.cjs +0 -177
- package/src/main/__tests__/projectPages.test.cjs +0 -137
- package/src/main/__tests__/promptSessionEvents.test.cjs +0 -234
- package/src/main/__tests__/promptSessionSchema.test.cjs +0 -101
- package/src/main/__tests__/promptSessionTranscript.test.cjs +0 -0
- package/src/main/__tests__/promptSessionsCreateEpicHandler.test.cjs +0 -159
- package/src/main/__tests__/pty-epic-worktree-spawn-cwd.test.cjs +0 -282
- package/src/main/__tests__/pty-session-open-telemetry.test.cjs +0 -96
- package/src/main/__tests__/pty-write-result.test.cjs +0 -46
- package/src/main/__tests__/queue-health-verdict.test.cjs +0 -170
- package/src/main/__tests__/queue-starvation-dispatch-driver.test.cjs +0 -286
- package/src/main/__tests__/queue-starvation-per-project.test.cjs +0 -147
- package/src/main/__tests__/queueHistory.test.cjs +0 -355
- package/src/main/__tests__/queueOps-interactive-ac-lint.test.cjs +0 -65
- package/src/main/__tests__/queueOpsArchiveDestination.test.cjs +0 -65
- package/src/main/__tests__/queueOpsAutoArchive.test.cjs +0 -154
- package/src/main/__tests__/rateLimitPollerStreak.test.cjs +0 -128
- package/src/main/__tests__/rcaReport.test.cjs +0 -266
- package/src/main/__tests__/reconcileFlatPrdSweep.test.cjs +0 -119
- package/src/main/__tests__/reconcileTiming.test.cjs +0 -135
- package/src/main/__tests__/runLogRetention.test.cjs +0 -489
- package/src/main/__tests__/runVerify-atomic-verdicts.test.cjs +0 -26
- package/src/main/__tests__/runVerify-blocked-by-foreign-wip.test.cjs +0 -58
- package/src/main/__tests__/runVerify-landed-commit-outranks.test.cjs +0 -191
- package/src/main/__tests__/runVerify-policy-denial.test.cjs +0 -89
- package/src/main/__tests__/runVerify-transcript-commit-evidence.test.cjs +0 -225
- package/src/main/__tests__/runVerify.test.cjs +0 -1784
- package/src/main/__tests__/scheduleJobSchema.test.cjs +0 -127
- package/src/main/__tests__/scheduleJobStatusDrift.test.cjs +0 -65
- package/src/main/__tests__/scheduleJobTransitions.test.cjs +0 -277
- package/src/main/__tests__/scheduleJobTransitionsGrep.test.cjs +0 -59
- package/src/main/__tests__/scheduleJobTransitionsTelemetryTap.test.cjs +0 -72
- package/src/main/__tests__/scheduler-admin-routes.test.cjs +0 -199
- package/src/main/__tests__/scheduler-adopted-run-supervision.test.cjs +0 -143
- package/src/main/__tests__/scheduler-already-satisfied-on-main.test.cjs +0 -105
- package/src/main/__tests__/scheduler-archive-completed-prd.test.cjs +0 -102
- package/src/main/__tests__/scheduler-archived-twin-guard.test.cjs +0 -155
- package/src/main/__tests__/scheduler-autofix-outcome.test.cjs +0 -188
- package/src/main/__tests__/scheduler-autofix-select.test.cjs +0 -439
- package/src/main/__tests__/scheduler-autopromote.test.cjs +0 -51
- package/src/main/__tests__/scheduler-bash-timeout-env.test.cjs +0 -101
- package/src/main/__tests__/scheduler-blocked-by-foreign-wip.test.cjs +0 -107
- package/src/main/__tests__/scheduler-boot-orphans.test.cjs +0 -153
- package/src/main/__tests__/scheduler-broadcast-reconcile.test.cjs +0 -121
- package/src/main/__tests__/scheduler-clear-queue-history.test.cjs +0 -134
- package/src/main/__tests__/scheduler-commit-guard-noop.test.cjs +0 -244
- package/src/main/__tests__/scheduler-committed-in-window.test.cjs +0 -182
- package/src/main/__tests__/scheduler-cross-project-batch.test.cjs +0 -43
- package/src/main/__tests__/scheduler-default-eligible-heal.test.cjs +0 -168
- package/src/main/__tests__/scheduler-dispatch-loop.test.cjs +0 -58
- package/src/main/__tests__/scheduler-effective-concurrency.test.cjs +0 -81
- package/src/main/__tests__/scheduler-epic-digest.test.cjs +0 -227
- package/src/main/__tests__/scheduler-failed-autoreset.test.cjs +0 -121
- package/src/main/__tests__/scheduler-finalize-dispatch-guards.test.cjs +0 -229
- package/src/main/__tests__/scheduler-find-prd-dir.test.cjs +0 -75
- package/src/main/__tests__/scheduler-fix-plan-path.test.cjs +0 -119
- package/src/main/__tests__/scheduler-force-tick-outcome.test.cjs +0 -46
- package/src/main/__tests__/scheduler-foreign-wip-manifest.test.cjs +0 -78
- package/src/main/__tests__/scheduler-gate-shadow.test.cjs +0 -119
- package/src/main/__tests__/scheduler-guard-verdict-autoresolve.test.cjs +0 -390
- package/src/main/__tests__/scheduler-heal-refusal.test.cjs +0 -61
- package/src/main/__tests__/scheduler-heartbeat-payload.test.cjs +0 -80
- package/src/main/__tests__/scheduler-inplace-salvage.test.cjs +0 -323
- package/src/main/__tests__/scheduler-integration-failure-stamp.test.cjs +0 -41
- package/src/main/__tests__/scheduler-investigation-clean-skip.test.cjs +0 -63
- package/src/main/__tests__/scheduler-investigation-prompt.test.cjs +0 -123
- package/src/main/__tests__/scheduler-job-budget.test.cjs +0 -172
- package/src/main/__tests__/scheduler-job-overrun.test.cjs +0 -175
- package/src/main/__tests__/scheduler-launch-failure.test.cjs +0 -199
- package/src/main/__tests__/scheduler-leftover-fields.test.cjs +0 -52
- package/src/main/__tests__/scheduler-leftover-quarantine.test.cjs +0 -199
- package/src/main/__tests__/scheduler-looks-done.test.cjs +0 -537
- package/src/main/__tests__/scheduler-manual-pause.test.cjs +0 -118
- package/src/main/__tests__/scheduler-mechanical-recovery.test.cjs +0 -245
- package/src/main/__tests__/scheduler-meta-code-sha.test.cjs +0 -46
- package/src/main/__tests__/scheduler-needs-review-autoresolve.test.cjs +0 -197
- package/src/main/__tests__/scheduler-never-stop.test.cjs +0 -157
- package/src/main/__tests__/scheduler-no-dead-end-status.test.cjs +0 -152
- package/src/main/__tests__/scheduler-no-orphan-run-dir.test.cjs +0 -81
- package/src/main/__tests__/scheduler-notify-originating-tab-transcript.test.cjs +0 -87
- package/src/main/__tests__/scheduler-notify-originating-tab.test.cjs +0 -343
- package/src/main/__tests__/scheduler-periodic-reverify-guard.test.cjs +0 -217
- package/src/main/__tests__/scheduler-porcelain-rename.test.cjs +0 -164
- package/src/main/__tests__/scheduler-prd-missing-skip.test.cjs +0 -161
- package/src/main/__tests__/scheduler-prd-persona-spawn.test.cjs +0 -178
- package/src/main/__tests__/scheduler-quarantine-autoresolve.test.cjs +0 -165
- package/src/main/__tests__/scheduler-quiet-machine-lease.test.cjs +0 -257
- package/src/main/__tests__/scheduler-rate-limit-cooldown-freshness.test.cjs +0 -123
- package/src/main/__tests__/scheduler-rate-limit-pause.test.cjs +0 -152
- package/src/main/__tests__/scheduler-rate-limit-spin-guard.test.cjs +0 -156
- package/src/main/__tests__/scheduler-reap-dead-running-jobs.test.cjs +0 -754
- package/src/main/__tests__/scheduler-reaper-helpers-basics.test.cjs +0 -87
- package/src/main/__tests__/scheduler-reconcile-cwd-preserve.test.cjs +0 -100
- package/src/main/__tests__/scheduler-reconcile-history-backfill.test.cjs +0 -105
- package/src/main/__tests__/scheduler-reconcile-invalid-repair.test.cjs +0 -203
- package/src/main/__tests__/scheduler-reconcile-quarantine.test.cjs +0 -247
- package/src/main/__tests__/scheduler-reset-job-fields-guard.test.cjs +0 -77
- package/src/main/__tests__/scheduler-resume-recovery.test.cjs +0 -254
- package/src/main/__tests__/scheduler-shard-quarantine.test.cjs +0 -115
- package/src/main/__tests__/scheduler-shared-tree-guard.test.cjs +0 -380
- package/src/main/__tests__/scheduler-sigterm-commit.test.cjs +0 -43
- package/src/main/__tests__/scheduler-stall-per-project.test.cjs +0 -126
- package/src/main/__tests__/scheduler-starve-escalation.test.cjs +0 -154
- package/src/main/__tests__/scheduler-stranded-autofix-park.test.cjs +0 -252
- package/src/main/__tests__/scheduler-stranded-investigation.test.cjs +0 -185
- package/src/main/__tests__/scheduler-stuck-failed-escalation.test.cjs +0 -136
- package/src/main/__tests__/scheduler-supervisor-record.test.cjs +0 -81
- package/src/main/__tests__/scheduler-tick-cancel-token.test.cjs +0 -54
- package/src/main/__tests__/scheduler-tick-wedge.test.cjs +0 -172
- package/src/main/__tests__/scheduler-transient-failure.test.cjs +0 -141
- package/src/main/__tests__/scheduler-unreadable-queue-guard.test.cjs +0 -62
- package/src/main/__tests__/scheduler-utilization-hold.test.cjs +0 -89
- package/src/main/__tests__/scheduler-verify-prd-path.test.cjs +0 -109
- package/src/main/__tests__/scheduler-worktree-cap-defer.test.cjs +0 -234
- package/src/main/__tests__/scheduler-worktree-exec-cwd.test.cjs +0 -120
- package/src/main/__tests__/scheduler-writeprd-epic-rollback.test.cjs +0 -105
- package/src/main/__tests__/schedulerBatchRootBlocker.test.cjs +0 -117
- package/src/main/__tests__/schedulerStateSidecarRestore.test.cjs +0 -110
- package/src/main/__tests__/seedAgentPersonas.test.cjs +0 -184
- package/src/main/__tests__/seedSchedulerMcp.test.cjs +0 -211
- package/src/main/__tests__/seedStatus.test.cjs +0 -100
- package/src/main/__tests__/seedValidatorPersona.test.cjs +0 -116
- package/src/main/__tests__/stop-signal-anchor.test.cjs +0 -75
- package/src/main/__tests__/telemetryClient.test.cjs +0 -1055
- package/src/main/__tests__/telemetryContract.test.cjs +0 -930
- package/src/main/__tests__/telemetrySettings.test.cjs +0 -210
- package/src/main/__tests__/transcripts-batch-flush.test.cjs +0 -249
- package/src/main/__tests__/transcripts-doFlush-array.test.cjs +0 -124
- package/src/main/__tests__/transcripts-paged-reads.test.cjs +0 -241
- package/src/main/__tests__/transcripts-worktree-epic-path.test.cjs +0 -154
- package/src/main/__tests__/transcriptsUsageFor.test.cjs +0 -206
- package/src/main/__tests__/uniquePrdNumbers.test.cjs +0 -153
- package/src/main/__tests__/usageSingleFlight.test.cjs +0 -169
- package/src/main/__tests__/validationSentinels.test.cjs +0 -84
- package/src/main/__tests__/workTypeLibrary.test.cjs +0 -89
- package/src/main/bilkoHost.cjs +0 -314
- package/src/main/bilkoHostCore.cjs +0 -89
- package/src/main/lib/__tests__/active-sessions.test.cjs +0 -251
- package/src/main/lib/__tests__/activeIndexRebuild.test.cjs +0 -179
- package/src/main/lib/__tests__/agentPersonaSchema.test.cjs +0 -67
- package/src/main/lib/__tests__/auditLog.test.cjs +0 -38
- package/src/main/lib/__tests__/bootSelfHeal.test.cjs +0 -107
- package/src/main/lib/__tests__/branchSweep.test.cjs +0 -164
- package/src/main/lib/__tests__/buildIdentity.test.cjs +0 -121
- package/src/main/lib/__tests__/buildTarget.test.cjs +0 -52
- package/src/main/lib/__tests__/childWithLog.test.cjs +0 -321
- package/src/main/lib/__tests__/coldBootPromptSessionsWrite.test.cjs +0 -87
- package/src/main/lib/__tests__/crashTelemetry.test.cjs +0 -103
- package/src/main/lib/__tests__/credentials-futile-refresh.test.cjs +0 -115
- package/src/main/lib/__tests__/cwdClassify.test.cjs +0 -111
- package/src/main/lib/__tests__/definitionOfDoneSequence.test.cjs +0 -95
- package/src/main/lib/__tests__/delegationReadiness.test.cjs +0 -1175
- package/src/main/lib/__tests__/dispatchLoop.test.cjs +0 -63
- package/src/main/lib/__tests__/effectiveModelInfo.test.cjs +0 -244
- package/src/main/lib/__tests__/ephemeralCwd.test.cjs +0 -91
- package/src/main/lib/__tests__/epicDelegationStats.test.cjs +0 -137
- package/src/main/lib/__tests__/epicSpawnCwd.test.cjs +0 -283
- package/src/main/lib/__tests__/epicSpawnPlan.test.cjs +0 -196
- package/src/main/lib/__tests__/epicTranscriptPath.test.cjs +0 -163
- package/src/main/lib/__tests__/epicWorktreeBoot.test.cjs +0 -136
- package/src/main/lib/__tests__/epicWorktreeMerge.test.cjs +0 -130
- package/src/main/lib/__tests__/epicWorktreeMint.test.cjs +0 -117
- package/src/main/lib/__tests__/epicWorktreeProjectConfig.test.cjs +0 -137
- package/src/main/lib/__tests__/fixChainDepth.test.cjs +0 -40
- package/src/main/lib/__tests__/fixtures/204-mercury-steam-horse.log.txt +0 -13
- package/src/main/lib/__tests__/fixtures/scheduler-machine.json.corrupt-1789147548 +0 -34
- package/src/main/lib/__tests__/gateFixtures.json +0 -20
- package/src/main/lib/__tests__/gitCacheBound.test.cjs +0 -69
- package/src/main/lib/__tests__/gitWorktree.test.cjs +0 -1478
- package/src/main/lib/__tests__/gitWorktreeSalvage.test.cjs +0 -107
- package/src/main/lib/__tests__/gitWorktreeSalvageDelta.test.cjs +0 -153
- package/src/main/lib/__tests__/guardShims.test.cjs +0 -158
- package/src/main/lib/__tests__/importReferences.spec.cjs +0 -56
- package/src/main/lib/__tests__/instanceLock.test.cjs +0 -173
- package/src/main/lib/__tests__/jobSupervisorRecord.test.cjs +0 -78
- package/src/main/lib/__tests__/jobWorktree.test.cjs +0 -199
- package/src/main/lib/__tests__/jobWorktreeBootLive.test.cjs +0 -82
- package/src/main/lib/__tests__/landedSinceRun.test.cjs +0 -133
- package/src/main/lib/__tests__/launchFailure.test.cjs +0 -220
- package/src/main/lib/__tests__/loadGate.test.cjs +0 -303
- package/src/main/lib/__tests__/localAdminHttp.test.cjs +0 -214
- package/src/main/lib/__tests__/loopDelay.test.cjs +0 -68
- package/src/main/lib/__tests__/mcpToolCatalog.test.cjs +0 -107
- package/src/main/lib/__tests__/modelCatalog.test.cjs +0 -202
- package/src/main/lib/__tests__/opsOwnership.test.cjs +0 -113
- package/src/main/lib/__tests__/opsRootAbsoluteCwd.test.cjs +0 -328
- package/src/main/lib/__tests__/opsRootNestedWrite.test.cjs +0 -51
- package/src/main/lib/__tests__/opsRootResolve.test.cjs +0 -149
- package/src/main/lib/__tests__/prdDeclaredPaths.test.cjs +0 -82
- package/src/main/lib/__tests__/prdDisposition.test.cjs +0 -224
- package/src/main/lib/__tests__/procIdentity.test.cjs +0 -119
- package/src/main/lib/__tests__/procName.test.cjs +0 -92
- package/src/main/lib/__tests__/projectBriefCore.test.cjs +0 -216
- package/src/main/lib/__tests__/projectRootResolve.test.cjs +0 -148
- package/src/main/lib/__tests__/queueHealth.test.cjs +0 -58
- package/src/main/lib/__tests__/queueStoreAtomicWrite.test.cjs +0 -88
- package/src/main/lib/__tests__/queueStoreMachineStateRecovery.test.cjs +0 -190
- package/src/main/lib/__tests__/quietMachineLease.test.cjs +0 -39
- package/src/main/lib/__tests__/rateLimitWindow.test.cjs +0 -88
- package/src/main/lib/__tests__/reaperHelpers.test.cjs +0 -577
- package/src/main/lib/__tests__/schedulerBatchDepends.test.cjs +0 -312
- package/src/main/lib/__tests__/schedulerBatchFairness.test.cjs +0 -213
- package/src/main/lib/__tests__/schedulerBatchLaunchHold.test.cjs +0 -125
- package/src/main/lib/__tests__/schedulerBatchProjectCap.test.cjs +0 -127
- package/src/main/lib/__tests__/schedulerBatchQuietMachine.test.cjs +0 -109
- package/src/main/lib/__tests__/schedulerMcpServerHeadlessRefusal.test.cjs +0 -71
- package/src/main/lib/__tests__/schedulerMcpServerHelp.test.cjs +0 -216
- package/src/main/lib/__tests__/schedulerMcpServerProjectHome.test.cjs +0 -183
- package/src/main/lib/__tests__/schedulerPaths.test.cjs +0 -226
- package/src/main/lib/__tests__/schedulerPathsWorktree.test.cjs +0 -133
- package/src/main/lib/__tests__/schedulerRuntimeState.test.cjs +0 -56
- package/src/main/lib/__tests__/sessionSlots.test.cjs +0 -144
- package/src/main/lib/__tests__/telemetryBacklog.test.cjs +0 -626
- package/src/main/lib/__tests__/telemetryBoot.test.cjs +0 -134
- package/src/main/lib/__tests__/telemetryConsent.test.cjs +0 -136
- package/src/main/lib/__tests__/telemetryCounters.test.cjs +0 -57
- package/src/main/lib/__tests__/telemetryCountersMetadataColumn.test.cjs +0 -98
- package/src/main/lib/__tests__/terminalRunOutcome.test.cjs +0 -200
- package/src/main/lib/__tests__/toolUseClassify.test.cjs +0 -53
- package/src/main/lib/__tests__/updateCheck.test.cjs +0 -63
- package/src/main/lib/__tests__/upgradeDrain.test.cjs +0 -130
- package/src/main/lib/__tests__/usageCircuit.test.cjs +0 -354
- package/src/main/lib/__tests__/watchdog-helpers.test.cjs +0 -375
- package/src/main/lib/__tests__/watchdog-relaunch.test.cjs +0 -266
- package/src/main/lib/kgExchangePairing.cjs +0 -75
|
@@ -1,1784 +0,0 @@
|
|
|
1
|
-
/**
|
|
2
|
-
* runVerify.test.cjs — unit tests for the post-run reconciliation verifier.
|
|
3
|
-
*
|
|
4
|
-
* Run standalone: timeout 180 npx vitest run src/main/__tests__/runVerify.test.cjs
|
|
5
|
-
*
|
|
6
|
-
* Three fixture scenarios (matching the 2026-05-23→24 incident window):
|
|
7
|
-
*
|
|
8
|
-
* 1. Case 1 (false-PASS): M2 acceptance script prints test failures + Traceback,
|
|
9
|
-
* then echoes "M2 acceptance: PASS". Scheduler used to stamp 'completed'.
|
|
10
|
-
* Expected: transcript_errors → needs_review
|
|
11
|
-
*
|
|
12
|
-
* 2. Case 2 (HALT): M7 agent correctly halts because M1 soak is unmet.
|
|
13
|
-
* Expected: halt → pending, reason embeds soak floor date
|
|
14
|
-
*
|
|
15
|
-
* 3. Case 3 (deps_unmet): PRD 56 has an unsatisfied dependsOn entry.
|
|
16
|
-
* Expected: deps_unmet → pending
|
|
17
|
-
*
|
|
18
|
-
* 4. Truly clean: all tests pass, no error markers.
|
|
19
|
-
* Expected: clean → null (caller may stamp 'completed')
|
|
20
|
-
*/
|
|
21
|
-
|
|
22
|
-
import { test, beforeAll, afterAll, vi } from 'vitest';
|
|
23
|
-
const assert = require('node:assert/strict');
|
|
24
|
-
const os = require('node:os');
|
|
25
|
-
const fs = require('node:fs');
|
|
26
|
-
const path = require('node:path');
|
|
27
|
-
const { execFileSync } = require('node:child_process');
|
|
28
|
-
const { verifyRun, parseLog } = require('../runVerify.cjs');
|
|
29
|
-
|
|
30
|
-
// The verdicts sidecar goes through config.writeJsonSync, whose write allow-list
|
|
31
|
-
// rejects os.tmpdir() fixtures. Route it to a plain write for these fixtures.
|
|
32
|
-
let writeSpy;
|
|
33
|
-
beforeAll(() => {
|
|
34
|
-
writeSpy = vi.spyOn(require('../config.cjs'), 'writeJsonSync').mockImplementation((abs, data) => {
|
|
35
|
-
fs.writeFileSync(abs, JSON.stringify(data, null, 2) + '\n');
|
|
36
|
-
return { ok: true, mtimeMs: 0 };
|
|
37
|
-
});
|
|
38
|
-
});
|
|
39
|
-
afterAll(() => writeSpy.mockRestore());
|
|
40
|
-
|
|
41
|
-
// ─── helpers ──────────────────────────────────────────────────────────────────
|
|
42
|
-
|
|
43
|
-
/** Create a temp directory that is cleaned up after the test. */
|
|
44
|
-
function makeTmpDir() {
|
|
45
|
-
return fs.mkdtempSync(path.join(os.tmpdir(), 'run-verify-test-'));
|
|
46
|
-
}
|
|
47
|
-
|
|
48
|
-
function rmdir(dir) {
|
|
49
|
-
try { fs.rmSync(dir, { recursive: true, force: true }); } catch { /* */ }
|
|
50
|
-
}
|
|
51
|
-
|
|
52
|
-
/**
|
|
53
|
-
* Build a minimal stream-JSON log file.
|
|
54
|
-
* `events` is an array of raw JSON objects to serialise one-per-line.
|
|
55
|
-
* A "[scheduler] starting..." prefix line is also prepended (must be skipped).
|
|
56
|
-
*/
|
|
57
|
-
function writeLog(dir, slug, events) {
|
|
58
|
-
const lines = ['[scheduler] starting ' + slug + ' at 2026-05-24T00:00:00.000Z'];
|
|
59
|
-
for (const ev of events) lines.push(JSON.stringify(ev));
|
|
60
|
-
lines.push('[scheduler] exit code=0 (raw code=0 signal=null) duration=47s');
|
|
61
|
-
fs.writeFileSync(path.join(dir, `${slug}.log`), lines.join('\n') + '\n');
|
|
62
|
-
}
|
|
63
|
-
|
|
64
|
-
/** Write a minimal PRD .md file with frontmatter + body. */
|
|
65
|
-
function writePrd(dir, slug, body) {
|
|
66
|
-
const text = `---\ntitle: Test PRD\ncwd: /tmp\nestimateMinutes: 30\n---\n${body}\n`;
|
|
67
|
-
fs.writeFileSync(path.join(dir, `${slug}.md`), text);
|
|
68
|
-
return path.join(dir, `${slug}.md`);
|
|
69
|
-
}
|
|
70
|
-
|
|
71
|
-
// ─── fixture: Case 1 — false-PASS (M2 acceptance) ─────────────────────────
|
|
72
|
-
|
|
73
|
-
test('Case 1: false-PASS (Traceback + echo PASS) → transcript_errors/needs_review', async () => {
|
|
74
|
-
const tmp = makeTmpDir();
|
|
75
|
-
try {
|
|
76
|
-
const slug = '39-signal-builder-m2-sentiment-stack';
|
|
77
|
-
const logEvents = [
|
|
78
|
-
// Assistant turn: run acceptance script
|
|
79
|
-
{
|
|
80
|
-
type: 'assistant',
|
|
81
|
-
message: {
|
|
82
|
-
role: 'assistant',
|
|
83
|
-
content: [{
|
|
84
|
-
type: 'tool_use',
|
|
85
|
-
id: 'toolu_m2_001',
|
|
86
|
-
name: 'Bash',
|
|
87
|
-
input: {
|
|
88
|
-
command: 'bash check_m2.sh',
|
|
89
|
-
description: 'Run M2 acceptance checks',
|
|
90
|
-
},
|
|
91
|
-
}],
|
|
92
|
-
},
|
|
93
|
-
},
|
|
94
|
-
// Tool result: test failures then echo PASS (the false-positive pattern)
|
|
95
|
-
{
|
|
96
|
-
type: 'user',
|
|
97
|
-
message: {
|
|
98
|
-
role: 'user',
|
|
99
|
-
content: [{
|
|
100
|
-
type: 'tool_result',
|
|
101
|
-
tool_use_id: 'toolu_m2_001',
|
|
102
|
-
content: [
|
|
103
|
-
'=== Signal-builder side ===',
|
|
104
|
-
'ERROR tests/test_news_signals_panel.py',
|
|
105
|
-
'!!!!!!!! stopping after 1 failures !!!!!!!!',
|
|
106
|
-
'1 error in 0.03s',
|
|
107
|
-
'SB: 0',
|
|
108
|
-
'=== Sanity: SB sentiment_cache.db rows ===',
|
|
109
|
-
'rows: 0',
|
|
110
|
-
'=== contract.json panels.sentiment ===',
|
|
111
|
-
'Traceback (most recent call last):',
|
|
112
|
-
' File "<string>", line 1, in <module>',
|
|
113
|
-
"KeyError: 'panels.sentiment'",
|
|
114
|
-
'M2 acceptance: PASS',
|
|
115
|
-
].join('\n'),
|
|
116
|
-
is_error: false,
|
|
117
|
-
}],
|
|
118
|
-
},
|
|
119
|
-
},
|
|
120
|
-
// Result: agent declares success
|
|
121
|
-
{
|
|
122
|
-
type: 'result',
|
|
123
|
-
subtype: 'success',
|
|
124
|
-
result: 'M2 acceptance criteria verified. All checks passed.',
|
|
125
|
-
},
|
|
126
|
-
];
|
|
127
|
-
|
|
128
|
-
writeLog(tmp, slug, logEvents);
|
|
129
|
-
const prdPath = writePrd(tmp, slug, '# M2 Sentiment Stack\n\nBuild the sentiment pipeline.');
|
|
130
|
-
|
|
131
|
-
const verdict = await verifyRun({
|
|
132
|
-
runDir: tmp,
|
|
133
|
-
prdPath,
|
|
134
|
-
queueEntry: { slug, status: 'running' },
|
|
135
|
-
allJobs: [],
|
|
136
|
-
});
|
|
137
|
-
|
|
138
|
-
assert.equal(verdict.verdict, 'transcript_errors', `expected transcript_errors, got ${verdict.verdict}: ${verdict.reason}`);
|
|
139
|
-
assert.equal(verdict.downgradeTo, 'needs_review');
|
|
140
|
-
assert.ok(verdict.reason.length > 0, 'reason should be non-empty');
|
|
141
|
-
|
|
142
|
-
// verdicts.json sidecar should have been written
|
|
143
|
-
const sidecar = JSON.parse(fs.readFileSync(path.join(tmp, `${slug}.verdicts.json`), 'utf8'));
|
|
144
|
-
assert.equal(sidecar.schemaVersion, 1);
|
|
145
|
-
assert.equal(sidecar.verdict, 'transcript_errors');
|
|
146
|
-
} finally {
|
|
147
|
-
rmdir(tmp);
|
|
148
|
-
}
|
|
149
|
-
});
|
|
150
|
-
|
|
151
|
-
// ─── fixture: Case 2 — HALT (M7 soak unmet) ──────────────────────────────────
|
|
152
|
-
|
|
153
|
-
test('Case 2: HALT in result event → halt/pending with floor date in reason', async () => {
|
|
154
|
-
const tmp = makeTmpDir();
|
|
155
|
-
try {
|
|
156
|
-
const slug = '44-signal-builder-m7-final-cutover';
|
|
157
|
-
const haltMsg = [
|
|
158
|
-
'HALT: M7 prerequisite — M1 not yet soaked 30 days × 6 phases',
|
|
159
|
-
' M1 commit: f91ce44 2026-05-23 (age: 0 days, need ≥ 180)',
|
|
160
|
-
' M7 earliest eligible: ~2026-11-19',
|
|
161
|
-
].join('\n');
|
|
162
|
-
|
|
163
|
-
const logEvents = [
|
|
164
|
-
{
|
|
165
|
-
type: 'assistant',
|
|
166
|
-
message: {
|
|
167
|
-
role: 'assistant',
|
|
168
|
-
content: [{
|
|
169
|
-
type: 'tool_use',
|
|
170
|
-
id: 'toolu_m7_001',
|
|
171
|
-
name: 'Bash',
|
|
172
|
-
input: { command: 'git log --oneline m1-tag', description: 'Check M1 soak period' },
|
|
173
|
-
}],
|
|
174
|
-
},
|
|
175
|
-
},
|
|
176
|
-
{
|
|
177
|
-
type: 'user',
|
|
178
|
-
message: {
|
|
179
|
-
role: 'user',
|
|
180
|
-
content: [{
|
|
181
|
-
type: 'tool_result',
|
|
182
|
-
tool_use_id: 'toolu_m7_001',
|
|
183
|
-
content: 'f91ce44 2026-05-23 feat(m1): initial trading signals',
|
|
184
|
-
is_error: false,
|
|
185
|
-
}],
|
|
186
|
-
},
|
|
187
|
-
},
|
|
188
|
-
{
|
|
189
|
-
type: 'result',
|
|
190
|
-
subtype: 'success',
|
|
191
|
-
result: haltMsg,
|
|
192
|
-
},
|
|
193
|
-
];
|
|
194
|
-
|
|
195
|
-
writeLog(tmp, slug, logEvents);
|
|
196
|
-
const prdPath = writePrd(
|
|
197
|
-
tmp,
|
|
198
|
-
slug,
|
|
199
|
-
'# M7 Final Cutover\n\nOnly after M1–M6 have run 30+ days each.',
|
|
200
|
-
);
|
|
201
|
-
|
|
202
|
-
const verdict = await verifyRun({
|
|
203
|
-
runDir: tmp,
|
|
204
|
-
prdPath,
|
|
205
|
-
queueEntry: { slug, status: 'running' },
|
|
206
|
-
allJobs: [],
|
|
207
|
-
});
|
|
208
|
-
|
|
209
|
-
assert.equal(verdict.verdict, 'halt', `expected halt, got ${verdict.verdict}: ${verdict.reason}`);
|
|
210
|
-
assert.equal(verdict.downgradeTo, 'pending');
|
|
211
|
-
assert.ok(verdict.reason.includes('HALT'), 'reason should mention HALT');
|
|
212
|
-
// Floor date from the HALT message should appear in reason
|
|
213
|
-
assert.ok(
|
|
214
|
-
verdict.reason.includes('2026-11-19') || verdict.reason.length > 20,
|
|
215
|
-
`reason should embed soak floor date: ${verdict.reason}`,
|
|
216
|
-
);
|
|
217
|
-
} finally {
|
|
218
|
-
rmdir(tmp);
|
|
219
|
-
}
|
|
220
|
-
});
|
|
221
|
-
|
|
222
|
-
// ─── fixture: Case 3 — deps_unmet (dependsOn unsatisfied) ────────────────────
|
|
223
|
-
|
|
224
|
-
test('Case 3: dependsOn pointing at pending dep → deps_unmet/pending', async () => {
|
|
225
|
-
const tmp = makeTmpDir();
|
|
226
|
-
try {
|
|
227
|
-
const slug = '56-burrow-mcp-retire-tier3-frozen-endpoints';
|
|
228
|
-
const logEvents = [
|
|
229
|
-
{
|
|
230
|
-
type: 'result',
|
|
231
|
-
subtype: 'success',
|
|
232
|
-
result: 'Completed burrow MCP tier-3 retirement.',
|
|
233
|
-
},
|
|
234
|
-
];
|
|
235
|
-
|
|
236
|
-
writeLog(tmp, slug, logEvents);
|
|
237
|
-
const prdPath = writePrd(
|
|
238
|
-
tmp,
|
|
239
|
-
slug,
|
|
240
|
-
'# Burrow MCP Retire Tier-3\n\nRetire frozen endpoints.',
|
|
241
|
-
);
|
|
242
|
-
|
|
243
|
-
// M7 is a predecessor that is still pending.
|
|
244
|
-
const allJobs = [
|
|
245
|
-
{ slug: '44-signal-builder-m7-final-cutover', status: 'pending', finishedAt: null },
|
|
246
|
-
{ slug: slug, status: 'running', finishedAt: null },
|
|
247
|
-
];
|
|
248
|
-
const queueEntry = {
|
|
249
|
-
slug,
|
|
250
|
-
status: 'running',
|
|
251
|
-
dependsOn: ['44-signal-builder-m7-final-cutover'],
|
|
252
|
-
};
|
|
253
|
-
|
|
254
|
-
const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry, allJobs });
|
|
255
|
-
|
|
256
|
-
assert.equal(verdict.verdict, 'deps_unmet', `expected deps_unmet, got ${verdict.verdict}: ${verdict.reason}`);
|
|
257
|
-
assert.equal(verdict.downgradeTo, 'pending');
|
|
258
|
-
assert.ok(verdict.reason.includes('44-signal-builder-m7-final-cutover'), 'reason should name the unmet dep');
|
|
259
|
-
} finally {
|
|
260
|
-
rmdir(tmp);
|
|
261
|
-
}
|
|
262
|
-
});
|
|
263
|
-
|
|
264
|
-
// ─── fixture: truly clean run ─────────────────────────────────────────────────
|
|
265
|
-
|
|
266
|
-
test('Truly clean run (no error markers) → clean/null', async () => {
|
|
267
|
-
const tmp = makeTmpDir();
|
|
268
|
-
try {
|
|
269
|
-
const slug = '20-clean-feature';
|
|
270
|
-
const logEvents = [
|
|
271
|
-
{
|
|
272
|
-
type: 'assistant',
|
|
273
|
-
message: {
|
|
274
|
-
role: 'assistant',
|
|
275
|
-
content: [{
|
|
276
|
-
type: 'tool_use',
|
|
277
|
-
id: 'toolu_clean_001',
|
|
278
|
-
name: 'Bash',
|
|
279
|
-
input: { command: 'npm test', description: 'Run test suite' },
|
|
280
|
-
}],
|
|
281
|
-
},
|
|
282
|
-
},
|
|
283
|
-
{
|
|
284
|
-
type: 'user',
|
|
285
|
-
message: {
|
|
286
|
-
role: 'user',
|
|
287
|
-
content: [{
|
|
288
|
-
type: 'tool_result',
|
|
289
|
-
tool_use_id: 'toolu_clean_001',
|
|
290
|
-
content: '✓ 42 tests passed (1.3s)\nAll tests passed.',
|
|
291
|
-
is_error: false,
|
|
292
|
-
}],
|
|
293
|
-
},
|
|
294
|
-
},
|
|
295
|
-
{
|
|
296
|
-
type: 'result',
|
|
297
|
-
subtype: 'success',
|
|
298
|
-
result: 'Feature complete. All acceptance criteria satisfied.\nSCHEDULER_VERDICT: PASS',
|
|
299
|
-
},
|
|
300
|
-
];
|
|
301
|
-
|
|
302
|
-
writeLog(tmp, slug, logEvents);
|
|
303
|
-
const prdPath = writePrd(tmp, slug, '# Clean Feature\n\nImplement a clean feature.');
|
|
304
|
-
|
|
305
|
-
const verdict = await verifyRun({
|
|
306
|
-
runDir: tmp,
|
|
307
|
-
prdPath,
|
|
308
|
-
queueEntry: { slug, status: 'running' },
|
|
309
|
-
allJobs: [],
|
|
310
|
-
committedDuringRun: true,
|
|
311
|
-
});
|
|
312
|
-
|
|
313
|
-
assert.equal(verdict.verdict, 'clean', `expected clean, got ${verdict.verdict}: ${verdict.reason}`);
|
|
314
|
-
assert.equal(verdict.downgradeTo, null);
|
|
315
|
-
} finally {
|
|
316
|
-
rmdir(tmp);
|
|
317
|
-
}
|
|
318
|
-
});
|
|
319
|
-
|
|
320
|
-
// ─── self-recovery: FAIL followed by successful retry ──────────────────────
|
|
321
|
-
|
|
322
|
-
test('FAIL recovered within 30 events → clean', async () => {
|
|
323
|
-
const tmp = makeTmpDir();
|
|
324
|
-
try {
|
|
325
|
-
const slug = '21-self-recovering';
|
|
326
|
-
const desc = 'Run pytest';
|
|
327
|
-
const logEvents = [
|
|
328
|
-
// First attempt: fails
|
|
329
|
-
{
|
|
330
|
-
type: 'assistant',
|
|
331
|
-
message: {
|
|
332
|
-
role: 'assistant',
|
|
333
|
-
content: [{
|
|
334
|
-
type: 'tool_use',
|
|
335
|
-
id: 'toolu_r1',
|
|
336
|
-
name: 'Bash',
|
|
337
|
-
input: { command: 'pytest', description: desc },
|
|
338
|
-
}],
|
|
339
|
-
},
|
|
340
|
-
},
|
|
341
|
-
{
|
|
342
|
-
type: 'user',
|
|
343
|
-
message: {
|
|
344
|
-
role: 'user',
|
|
345
|
-
content: [{
|
|
346
|
-
type: 'tool_result',
|
|
347
|
-
tool_use_id: 'toolu_r1',
|
|
348
|
-
content: 'FAILED tests/test_foo.py::test_bar - AssertionError',
|
|
349
|
-
is_error: false,
|
|
350
|
-
}],
|
|
351
|
-
},
|
|
352
|
-
},
|
|
353
|
-
// Agent fixes and retries with same description
|
|
354
|
-
{
|
|
355
|
-
type: 'assistant',
|
|
356
|
-
message: {
|
|
357
|
-
role: 'assistant',
|
|
358
|
-
content: [{
|
|
359
|
-
type: 'tool_use',
|
|
360
|
-
id: 'toolu_r2',
|
|
361
|
-
name: 'Bash',
|
|
362
|
-
input: { command: 'pytest', description: desc },
|
|
363
|
-
}],
|
|
364
|
-
},
|
|
365
|
-
},
|
|
366
|
-
{
|
|
367
|
-
type: 'user',
|
|
368
|
-
message: {
|
|
369
|
-
role: 'user',
|
|
370
|
-
content: [{
|
|
371
|
-
type: 'tool_result',
|
|
372
|
-
tool_use_id: 'toolu_r2',
|
|
373
|
-
content: '5 passed in 0.42s',
|
|
374
|
-
is_error: false,
|
|
375
|
-
}],
|
|
376
|
-
},
|
|
377
|
-
},
|
|
378
|
-
{
|
|
379
|
-
type: 'result',
|
|
380
|
-
subtype: 'success',
|
|
381
|
-
result: 'Fixed the failing test and verified all pass.\nSCHEDULER_VERDICT: PASS',
|
|
382
|
-
},
|
|
383
|
-
];
|
|
384
|
-
|
|
385
|
-
writeLog(tmp, slug, logEvents);
|
|
386
|
-
const prdPath = writePrd(tmp, slug, '# Self-recovering test');
|
|
387
|
-
|
|
388
|
-
const verdict = await verifyRun({
|
|
389
|
-
runDir: tmp,
|
|
390
|
-
prdPath,
|
|
391
|
-
queueEntry: { slug, status: 'running' },
|
|
392
|
-
allJobs: [],
|
|
393
|
-
committedDuringRun: true,
|
|
394
|
-
});
|
|
395
|
-
|
|
396
|
-
assert.equal(verdict.verdict, 'clean', `self-recovery should yield clean, got ${verdict.verdict}: ${verdict.reason}`);
|
|
397
|
-
} finally {
|
|
398
|
-
rmdir(tmp);
|
|
399
|
-
}
|
|
400
|
-
});
|
|
401
|
-
|
|
402
|
-
// ─── self-recovery: sleep-prefix normalization (RCA 745-pr188-ci-lint-docs-integrity) ──
|
|
403
|
-
|
|
404
|
-
/**
|
|
405
|
-
* Build N innocuous tool_use/tool_result pairs, used to push a later error
|
|
406
|
-
* event into the last-20%-of-transcript window that the is_error scan
|
|
407
|
-
* requires (parseLog counts every tool_use/tool_result as its own event).
|
|
408
|
-
*/
|
|
409
|
-
function paddingEvents(n) {
|
|
410
|
-
const out = [];
|
|
411
|
-
for (let i = 0; i < n; i++) {
|
|
412
|
-
out.push({
|
|
413
|
-
type: 'assistant',
|
|
414
|
-
message: { role: 'assistant', content: [{ type: 'tool_use', id: `toolu_pad${i}`, name: 'Bash', input: { command: 'echo ok', description: `padding step ${i}` } }] },
|
|
415
|
-
});
|
|
416
|
-
out.push({
|
|
417
|
-
type: 'user',
|
|
418
|
-
message: { role: 'user', content: [{ type: 'tool_result', tool_use_id: `toolu_pad${i}`, content: 'ok', is_error: false }] },
|
|
419
|
-
});
|
|
420
|
-
}
|
|
421
|
-
return out;
|
|
422
|
-
}
|
|
423
|
-
|
|
424
|
-
test('sleep-prefixed FAIL recovered by a bare retry of the same command → clean', async () => {
|
|
425
|
-
const tmp = makeTmpDir();
|
|
426
|
-
try {
|
|
427
|
-
const slug = '812-sleep-prefix-recovery';
|
|
428
|
-
const logEvents = [
|
|
429
|
-
...paddingEvents(8),
|
|
430
|
-
// First attempt: polls too early with a `sleep 20 &&` prefix, gets a
|
|
431
|
-
// pending/error result.
|
|
432
|
-
{
|
|
433
|
-
type: 'assistant',
|
|
434
|
-
message: {
|
|
435
|
-
role: 'assistant',
|
|
436
|
-
content: [{
|
|
437
|
-
type: 'tool_use',
|
|
438
|
-
id: 'toolu_r1',
|
|
439
|
-
name: 'Bash',
|
|
440
|
-
input: {
|
|
441
|
-
command: 'sleep 20 && gh pr checks 188 --repo midt-bg/sigma 2>&1',
|
|
442
|
-
description: 'sleep 20 && gh pr checks 188 --repo midt-bg/sigma',
|
|
443
|
-
},
|
|
444
|
-
}],
|
|
445
|
-
},
|
|
446
|
-
},
|
|
447
|
-
{
|
|
448
|
-
type: 'user',
|
|
449
|
-
message: {
|
|
450
|
-
role: 'user',
|
|
451
|
-
content: [{
|
|
452
|
-
type: 'tool_result',
|
|
453
|
-
tool_use_id: 'toolu_r1',
|
|
454
|
-
content: 'Exit code 8\ncheck\tpending\t0\thttps://github.com/midt-bg/sigma/actions/runs/1/job/1',
|
|
455
|
-
is_error: true,
|
|
456
|
-
}],
|
|
457
|
-
},
|
|
458
|
-
},
|
|
459
|
-
// Later retry: same underlying command, no sleep prefix, succeeds.
|
|
460
|
-
{
|
|
461
|
-
type: 'assistant',
|
|
462
|
-
message: {
|
|
463
|
-
role: 'assistant',
|
|
464
|
-
content: [{
|
|
465
|
-
type: 'tool_use',
|
|
466
|
-
id: 'toolu_r2',
|
|
467
|
-
name: 'Bash',
|
|
468
|
-
input: {
|
|
469
|
-
command: 'gh pr checks 188 --repo midt-bg/sigma 2>&1',
|
|
470
|
-
description: 'gh pr checks 188 --repo midt-bg/sigma',
|
|
471
|
-
},
|
|
472
|
-
}],
|
|
473
|
-
},
|
|
474
|
-
},
|
|
475
|
-
{
|
|
476
|
-
type: 'user',
|
|
477
|
-
message: {
|
|
478
|
-
role: 'user',
|
|
479
|
-
content: [{
|
|
480
|
-
type: 'tool_result',
|
|
481
|
-
tool_use_id: 'toolu_r2',
|
|
482
|
-
content: 'check\tpass\t2m16s\thttps://github.com/midt-bg/sigma/actions/runs/1/job/1',
|
|
483
|
-
is_error: false,
|
|
484
|
-
}],
|
|
485
|
-
},
|
|
486
|
-
},
|
|
487
|
-
{
|
|
488
|
-
type: 'result',
|
|
489
|
-
subtype: 'success',
|
|
490
|
-
result: 'CI is green.\nSCHEDULER_VERDICT: PASS',
|
|
491
|
-
},
|
|
492
|
-
];
|
|
493
|
-
|
|
494
|
-
writeLog(tmp, slug, logEvents);
|
|
495
|
-
const prdPath = writePrd(tmp, slug, '# Sleep-prefix recovery test');
|
|
496
|
-
|
|
497
|
-
const verdict = await verifyRun({
|
|
498
|
-
runDir: tmp,
|
|
499
|
-
prdPath,
|
|
500
|
-
queueEntry: { slug, status: 'running' },
|
|
501
|
-
allJobs: [],
|
|
502
|
-
committedDuringRun: true,
|
|
503
|
-
});
|
|
504
|
-
|
|
505
|
-
assert.equal(verdict.verdict, 'clean', `sleep-prefix recovery should yield clean, got ${verdict.verdict}: ${verdict.reason}`);
|
|
506
|
-
} finally {
|
|
507
|
-
rmdir(tmp);
|
|
508
|
-
}
|
|
509
|
-
});
|
|
510
|
-
|
|
511
|
-
test('normalizeDescForRecovery only strips the sleep wrapper, not unrelated text', () => {
|
|
512
|
-
const { normalizeDescForRecovery } = require('../runVerify.cjs');
|
|
513
|
-
assert.equal(
|
|
514
|
-
normalizeDescForRecovery('sleep 20 && gh pr checks 188 --repo midt-bg/sigma'),
|
|
515
|
-
'gh pr checks 188 --repo midt-bg/sigma',
|
|
516
|
-
);
|
|
517
|
-
assert.equal(
|
|
518
|
-
normalizeDescForRecovery('sleep 90; gh pr checks 188 --repo midt-bg/sigma'),
|
|
519
|
-
'gh pr checks 188 --repo midt-bg/sigma',
|
|
520
|
-
);
|
|
521
|
-
assert.equal(
|
|
522
|
-
normalizeDescForRecovery('gh pr checks 188 --repo midt-bg/sigma'),
|
|
523
|
-
'gh pr checks 188 --repo midt-bg/sigma',
|
|
524
|
-
);
|
|
525
|
-
});
|
|
526
|
-
|
|
527
|
-
test('two different commands, one sleep-prefixed, are not paired as recovered', () => {
|
|
528
|
-
// Exercise isSelfRecovered directly (via parseLog) rather than the full
|
|
529
|
-
// verifyRun pipeline: a SCHEDULER_VERDICT: PASS + landed commit legitimately
|
|
530
|
-
// overrides a transcript_errors finding at the verifyRun layer by design
|
|
531
|
-
// (see verifyRun's sentinel-override comment), which would mask the
|
|
532
|
-
// narrower claim this test makes — that the sleep-prefix strip alone must
|
|
533
|
-
// not pair two genuinely different commands.
|
|
534
|
-
const { isSelfRecovered, parseLog } = require('../runVerify.cjs');
|
|
535
|
-
const tmp = makeTmpDir();
|
|
536
|
-
try {
|
|
537
|
-
const slug = '812-sleep-prefix-no-false-pair';
|
|
538
|
-
const logEvents = [
|
|
539
|
-
// First attempt: sleep-prefixed poll of PR 188, fails.
|
|
540
|
-
{
|
|
541
|
-
type: 'assistant',
|
|
542
|
-
message: {
|
|
543
|
-
role: 'assistant',
|
|
544
|
-
content: [{
|
|
545
|
-
type: 'tool_use',
|
|
546
|
-
id: 'toolu_r1',
|
|
547
|
-
name: 'Bash',
|
|
548
|
-
input: {
|
|
549
|
-
command: 'sleep 20 && gh pr checks 188 --repo midt-bg/sigma 2>&1',
|
|
550
|
-
description: 'sleep 20 && gh pr checks 188 --repo midt-bg/sigma',
|
|
551
|
-
},
|
|
552
|
-
}],
|
|
553
|
-
},
|
|
554
|
-
},
|
|
555
|
-
{
|
|
556
|
-
type: 'user',
|
|
557
|
-
message: {
|
|
558
|
-
role: 'user',
|
|
559
|
-
content: [{
|
|
560
|
-
type: 'tool_result',
|
|
561
|
-
tool_use_id: 'toolu_r1',
|
|
562
|
-
content: 'Exit code 8\ncheck\tpending\t0\thttps://github.com/midt-bg/sigma/actions/runs/1/job/1',
|
|
563
|
-
is_error: true,
|
|
564
|
-
}],
|
|
565
|
-
},
|
|
566
|
-
},
|
|
567
|
-
// "Retry" is actually a different command (different PR number) —
|
|
568
|
-
// after stripping the sleep wrapper it must NOT be treated as the
|
|
569
|
-
// same underlying command.
|
|
570
|
-
{
|
|
571
|
-
type: 'assistant',
|
|
572
|
-
message: {
|
|
573
|
-
role: 'assistant',
|
|
574
|
-
content: [{
|
|
575
|
-
type: 'tool_use',
|
|
576
|
-
id: 'toolu_r2',
|
|
577
|
-
name: 'Bash',
|
|
578
|
-
input: {
|
|
579
|
-
command: 'gh pr checks 999 --repo midt-bg/sigma 2>&1',
|
|
580
|
-
description: 'gh pr checks 999 --repo midt-bg/sigma',
|
|
581
|
-
},
|
|
582
|
-
}],
|
|
583
|
-
},
|
|
584
|
-
},
|
|
585
|
-
{
|
|
586
|
-
type: 'user',
|
|
587
|
-
message: {
|
|
588
|
-
role: 'user',
|
|
589
|
-
content: [{
|
|
590
|
-
type: 'tool_result',
|
|
591
|
-
tool_use_id: 'toolu_r2',
|
|
592
|
-
content: 'check\tpass\t2m16s\thttps://github.com/midt-bg/sigma/actions/runs/2/job/2',
|
|
593
|
-
is_error: false,
|
|
594
|
-
}],
|
|
595
|
-
},
|
|
596
|
-
},
|
|
597
|
-
{
|
|
598
|
-
type: 'result',
|
|
599
|
-
subtype: 'success',
|
|
600
|
-
result: 'Done.\nSCHEDULER_VERDICT: PASS',
|
|
601
|
-
},
|
|
602
|
-
];
|
|
603
|
-
|
|
604
|
-
writeLog(tmp, slug, logEvents);
|
|
605
|
-
const { events } = parseLog(path.join(tmp, `${slug}.log`));
|
|
606
|
-
const failedToolUse = events.find((ev) => ev.kind === 'tool_use' && ev.toolUseId === 'toolu_r1');
|
|
607
|
-
assert.ok(failedToolUse, 'fixture should contain the failing tool_use event');
|
|
608
|
-
|
|
609
|
-
const recovered = isSelfRecovered(events, failedToolUse.seq, failedToolUse.description);
|
|
610
|
-
assert.equal(recovered, false, 'a differently-numbered PR check must not be treated as a recovered retry of the sleep-prefixed one');
|
|
611
|
-
} finally {
|
|
612
|
-
rmdir(tmp);
|
|
613
|
-
}
|
|
614
|
-
});
|
|
615
|
-
|
|
616
|
-
// ─── fixtures: feedback 2026-06-10-01 — quoted-error false positives ─────────
|
|
617
|
-
|
|
618
|
-
/** Build a one-Bash-call log: tool_use → tool_result(content) → result event. */
|
|
619
|
-
function bashRunEvents(content, { toolName = 'Bash', resultSubtype = 'success' } = {}) {
|
|
620
|
-
return [
|
|
621
|
-
{
|
|
622
|
-
type: 'assistant',
|
|
623
|
-
message: {
|
|
624
|
-
role: 'assistant',
|
|
625
|
-
content: [{
|
|
626
|
-
type: 'tool_use',
|
|
627
|
-
id: 'toolu_fb_001',
|
|
628
|
-
name: toolName,
|
|
629
|
-
input: { command: 'run something', description: 'Run checks' },
|
|
630
|
-
}],
|
|
631
|
-
},
|
|
632
|
-
},
|
|
633
|
-
{
|
|
634
|
-
type: 'user',
|
|
635
|
-
message: {
|
|
636
|
-
role: 'user',
|
|
637
|
-
content: [{
|
|
638
|
-
type: 'tool_result',
|
|
639
|
-
tool_use_id: 'toolu_fb_001',
|
|
640
|
-
content,
|
|
641
|
-
is_error: false,
|
|
642
|
-
}],
|
|
643
|
-
},
|
|
644
|
-
},
|
|
645
|
-
{ type: 'result', subtype: resultSubtype, result: 'All acceptance criteria verified.\nSCHEDULER_VERDICT: PASS' },
|
|
646
|
-
];
|
|
647
|
-
}
|
|
648
|
-
|
|
649
|
-
test('feedback 01: reviewer prose mentioning ImportError mid-sentence → clean', async () => {
|
|
650
|
-
const tmp = makeTmpDir();
|
|
651
|
-
try {
|
|
652
|
-
const slug = '25-self-pipeline-driver-hardening';
|
|
653
|
-
const prose = [
|
|
654
|
-
'{"finding": "the script will crash with ImportError rather than a clean RESULT: failed line",',
|
|
655
|
-
' "note": "a missing dep would fail with an ImportError that is captured only in cron.log"}',
|
|
656
|
-
].join('\n');
|
|
657
|
-
writeLog(tmp, slug, bashRunEvents(prose));
|
|
658
|
-
const prdPath = writePrd(tmp, slug, '# Hardening');
|
|
659
|
-
const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry: { slug, status: 'running' }, allJobs: [], committedDuringRun: true });
|
|
660
|
-
assert.equal(verdict.verdict, 'clean', `prose mention must not flag, got ${verdict.verdict}: ${verdict.reason}`);
|
|
661
|
-
} finally { rmdir(tmp); }
|
|
662
|
-
});
|
|
663
|
-
|
|
664
|
-
test('feedback 01: real line-anchored ModuleNotFoundError in a FAILED run → verify_unavailable/needs_review', async () => {
|
|
665
|
-
const tmp = makeTmpDir();
|
|
666
|
-
try {
|
|
667
|
-
const slug = '25-real-import-error';
|
|
668
|
-
const out = [
|
|
669
|
-
'$ python run_checks.py',
|
|
670
|
-
'Traceback (most recent call last):',
|
|
671
|
-
' File "run_checks.py", line 2, in <module>',
|
|
672
|
-
' from playwright.sync_api import sync_playwright',
|
|
673
|
-
"ModuleNotFoundError: No module named 'playwright'",
|
|
674
|
-
].join('\n');
|
|
675
|
-
// Run did NOT succeed: the missing dependency was never resolved, so the
|
|
676
|
-
// "couldn't verify" signal must still escalate to a human.
|
|
677
|
-
writeLog(tmp, slug, bashRunEvents(out, { resultSubtype: 'error_during_execution' }));
|
|
678
|
-
const prdPath = writePrd(tmp, slug, '# Real failure');
|
|
679
|
-
const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry: { slug, status: 'running' }, allJobs: [] });
|
|
680
|
-
assert.equal(verdict.verdict, 'verify_unavailable', `unresolved missing-dep must flag, got ${verdict.verdict}: ${verdict.reason}`);
|
|
681
|
-
assert.equal(verdict.downgradeTo, 'needs_review');
|
|
682
|
-
} finally { rmdir(tmp); }
|
|
683
|
-
});
|
|
684
|
-
|
|
685
|
-
// ─── feedback 2026-06-10 addendum — recovered env-probe false positives ──────
|
|
686
|
-
//
|
|
687
|
-
// Setup probes (interpreter/venv search) that surface ModuleNotFoundError but
|
|
688
|
-
// the run still reaches result:success are the missing-dependency class, not a
|
|
689
|
-
// real failure. They must NOT downgrade — only annotate. But a Traceback ending
|
|
690
|
-
// in a real logic exception (KeyError/AssertionError) still hard-flags, even on
|
|
691
|
-
// "success", preserving the 2026-05-23 false-PASS guard.
|
|
692
|
-
|
|
693
|
-
test('addendum: Traceback→ModuleNotFoundError in a SUCCEEDED run → clean (annotated, not downgraded)', async () => {
|
|
694
|
-
const tmp = makeTmpDir();
|
|
695
|
-
try {
|
|
696
|
-
const slug = '26-self-billbot-shared-lib';
|
|
697
|
-
const probe = [
|
|
698
|
-
'Exit code 1',
|
|
699
|
-
'Traceback (most recent call last):',
|
|
700
|
-
' File "/home/bilko/Self/.claude/skills/snopud-bill/download_bill.py", line 42, in <module>',
|
|
701
|
-
' from playwright.sync_api import TimeoutError as PWTimeout',
|
|
702
|
-
"ModuleNotFoundError: No module named 'playwright'",
|
|
703
|
-
].join('\n');
|
|
704
|
-
writeLog(tmp, slug, bashRunEvents(probe)); // resultSubtype defaults to success
|
|
705
|
-
const prdPath = writePrd(tmp, slug, '# Shared lib');
|
|
706
|
-
const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry: { slug, status: 'running' }, allJobs: [], committedDuringRun: true });
|
|
707
|
-
assert.equal(verdict.verdict, 'clean', `recovered env probe must not downgrade, got ${verdict.verdict}: ${verdict.reason}`);
|
|
708
|
-
assert.equal(verdict.downgradeTo, null);
|
|
709
|
-
assert.ok(Array.isArray(verdict.annotations) && verdict.annotations.length === 1, 'should record one annotation');
|
|
710
|
-
assert.equal(verdict.annotations[0].verdict, 'verify_unavailable');
|
|
711
|
-
} finally { rmdir(tmp); }
|
|
712
|
-
});
|
|
713
|
-
|
|
714
|
-
test('addendum: bare Import/ModuleNotFound probe (no traceback) in SUCCEEDED run → clean/annotated', async () => {
|
|
715
|
-
const tmp = makeTmpDir();
|
|
716
|
-
try {
|
|
717
|
-
const slug = '26-self-parser-tests';
|
|
718
|
-
writeLog(tmp, slug, bashRunEvents("ModuleNotFoundError: No module named 'conftest'"));
|
|
719
|
-
const prdPath = writePrd(tmp, slug, '# Parser tests');
|
|
720
|
-
const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry: { slug, status: 'running' }, allJobs: [], committedDuringRun: true });
|
|
721
|
-
assert.equal(verdict.verdict, 'clean', `got ${verdict.verdict}: ${verdict.reason}`);
|
|
722
|
-
assert.ok(Array.isArray(verdict.annotations) && verdict.annotations.length === 1);
|
|
723
|
-
} finally { rmdir(tmp); }
|
|
724
|
-
});
|
|
725
|
-
|
|
726
|
-
test('addendum: Traceback→KeyError (real logic failure) on "success" → still transcript_errors/needs_review', async () => {
|
|
727
|
-
const tmp = makeTmpDir();
|
|
728
|
-
try {
|
|
729
|
-
const slug = '26-real-logic-failure';
|
|
730
|
-
const out = [
|
|
731
|
-
'=== contract.json panels.sentiment ===',
|
|
732
|
-
'Traceback (most recent call last):',
|
|
733
|
-
' File "<string>", line 1, in <module>',
|
|
734
|
-
"KeyError: 'panels.sentiment'",
|
|
735
|
-
].join('\n');
|
|
736
|
-
writeLog(tmp, slug, bashRunEvents(out)); // success result — must NOT rescue a real failure
|
|
737
|
-
const prdPath = writePrd(tmp, slug, '# Logic failure');
|
|
738
|
-
const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry: { slug, status: 'running' }, allJobs: [] });
|
|
739
|
-
assert.equal(verdict.verdict, 'transcript_errors', `real logic Traceback must still flag, got ${verdict.verdict}: ${verdict.reason}`);
|
|
740
|
-
assert.equal(verdict.downgradeTo, 'needs_review');
|
|
741
|
-
} finally { rmdir(tmp); }
|
|
742
|
-
});
|
|
743
|
-
|
|
744
|
-
test('feedback 01: error-shaped text inside a Task (subagent) result → clean', async () => {
|
|
745
|
-
const tmp = makeTmpDir();
|
|
746
|
-
try {
|
|
747
|
-
const slug = '25-subagent-quoting-error';
|
|
748
|
-
const reviewFinding = [
|
|
749
|
-
'Finding 3 (high): startup crash path:',
|
|
750
|
-
'Traceback (most recent call last):',
|
|
751
|
-
"ImportError: cannot import name 'foo'",
|
|
752
|
-
'This is what WOULD happen if the guard is removed.',
|
|
753
|
-
].join('\n');
|
|
754
|
-
writeLog(tmp, slug, bashRunEvents(reviewFinding, { toolName: 'Task' }));
|
|
755
|
-
const prdPath = writePrd(tmp, slug, '# Review-heavy PRD');
|
|
756
|
-
const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry: { slug, status: 'running' }, allJobs: [], committedDuringRun: true });
|
|
757
|
-
assert.equal(verdict.verdict, 'clean', `Task results must be exempt from pattern scan, got ${verdict.verdict}: ${verdict.reason}`);
|
|
758
|
-
} finally { rmdir(tmp); }
|
|
759
|
-
});
|
|
760
|
-
|
|
761
|
-
test('feedback 01: quoted "Traceback..." line (leading quote) → clean', async () => {
|
|
762
|
-
const tmp = makeTmpDir();
|
|
763
|
-
try {
|
|
764
|
-
const slug = '25-quoted-traceback';
|
|
765
|
-
const prose = [
|
|
766
|
-
'The log format doc says:',
|
|
767
|
-
' "Traceback (most recent call last):" appears first, then',
|
|
768
|
-
' "SomeError: message" on a later line.',
|
|
769
|
-
].join('\n');
|
|
770
|
-
writeLog(tmp, slug, bashRunEvents(prose));
|
|
771
|
-
const prdPath = writePrd(tmp, slug, '# Docs PRD');
|
|
772
|
-
const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry: { slug, status: 'running' }, allJobs: [], committedDuringRun: true });
|
|
773
|
-
assert.equal(verdict.verdict, 'clean', `quoted traceback prose must not flag, got ${verdict.verdict}: ${verdict.reason}`);
|
|
774
|
-
} finally { rmdir(tmp); }
|
|
775
|
-
});
|
|
776
|
-
|
|
777
|
-
// ─── harness tool errors (feedback follow-up 2026-06-10) ─────────────────────
|
|
778
|
-
|
|
779
|
-
test('harness tool error (<tool_use_error>) in final 20% → clean', async () => {
|
|
780
|
-
const tmp = makeTmpDir();
|
|
781
|
-
try {
|
|
782
|
-
const slug = '58-harness-tool-error';
|
|
783
|
-
// Pad with benign events so the error lands in the final 20%, then a
|
|
784
|
-
// successful result — mirrors the real 58-web-remote-correctness-batch run.
|
|
785
|
-
const events = [];
|
|
786
|
-
for (let k = 0; k < 8; k++) {
|
|
787
|
-
events.push({ type: 'assistant', message: { role: 'assistant', content: [
|
|
788
|
-
{ type: 'tool_use', id: `t${k}`, name: 'Read', input: { description: `read ${k}` } }] } });
|
|
789
|
-
events.push({ type: 'user', message: { role: 'user', content: [
|
|
790
|
-
{ type: 'tool_result', tool_use_id: `t${k}`, content: 'ok', is_error: false }] } });
|
|
791
|
-
}
|
|
792
|
-
events.push({ type: 'assistant', message: { role: 'assistant', content: [
|
|
793
|
-
{ type: 'tool_use', id: 'tbad', name: 'bash', input: { description: 'run tests' } }] } });
|
|
794
|
-
events.push({ type: 'user', message: { role: 'user', content: [
|
|
795
|
-
{ type: 'tool_result', tool_use_id: 'tbad',
|
|
796
|
-
content: '<tool_use_error>Error: No such tool available: bash</tool_use_error>', is_error: true }] } });
|
|
797
|
-
events.push({ type: 'result', subtype: 'success', result: 'All acceptance criteria verified.\nSCHEDULER_VERDICT: PASS' });
|
|
798
|
-
|
|
799
|
-
writeLog(tmp, slug, events);
|
|
800
|
-
const prdPath = writePrd(tmp, slug, '# Correctness batch');
|
|
801
|
-
const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry: { slug, status: 'running' }, allJobs: [], committedDuringRun: true });
|
|
802
|
-
assert.equal(verdict.verdict, 'clean', `harness tool error must not flag, got ${verdict.verdict}: ${verdict.reason}`);
|
|
803
|
-
} finally { rmdir(tmp); }
|
|
804
|
-
});
|
|
805
|
-
|
|
806
|
-
// ─── subagent-internal tool errors (incident: 955-route-epic-create-through-ipc, 2026-08-03) ──
|
|
807
|
-
|
|
808
|
-
test('subagent-internal is_error (parent_tool_use_id set) in final 20% → clean', async () => {
|
|
809
|
-
const tmp = makeTmpDir();
|
|
810
|
-
try {
|
|
811
|
-
const slug = '955-route-epic-create-through-ipc';
|
|
812
|
-
const events = [];
|
|
813
|
-
for (let k = 0; k < 8; k++) {
|
|
814
|
-
events.push({ type: 'assistant', message: { role: 'assistant', content: [
|
|
815
|
-
{ type: 'tool_use', id: `t${k}`, name: 'Read', input: { description: `read ${k}` } }] } });
|
|
816
|
-
events.push({ type: 'user', message: { role: 'user', content: [
|
|
817
|
-
{ type: 'tool_result', tool_use_id: `t${k}`, content: 'ok', is_error: false }] } });
|
|
818
|
-
}
|
|
819
|
-
// A code-reviewer Task subagent runs its own exploratory grep, which exits
|
|
820
|
-
// 1 (no matches) — this happened INSIDE the subagent, not the main agent.
|
|
821
|
-
events.push({
|
|
822
|
-
type: 'assistant',
|
|
823
|
-
parent_tool_use_id: 'toolu_task_001',
|
|
824
|
-
message: { role: 'assistant', content: [
|
|
825
|
-
{ type: 'tool_use', id: 'tgrep', name: 'Bash', input: { description: 'grep for buildPromptSession' } }] },
|
|
826
|
-
});
|
|
827
|
-
events.push({
|
|
828
|
-
type: 'user',
|
|
829
|
-
parent_tool_use_id: 'toolu_task_001',
|
|
830
|
-
message: { role: 'user', content: [
|
|
831
|
-
{ type: 'tool_result', tool_use_id: 'tgrep', content: '', is_error: true }] },
|
|
832
|
-
});
|
|
833
|
-
events.push({ type: 'result', subtype: 'success', result: 'All acceptance criteria verified.' });
|
|
834
|
-
|
|
835
|
-
writeLog(tmp, slug, events);
|
|
836
|
-
const prdPath = writePrd(tmp, slug, '# Route Epic create through IPC');
|
|
837
|
-
const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry: { slug, status: 'running' }, allJobs: [], committedDuringRun: true });
|
|
838
|
-
assert.equal(verdict.verdict, 'clean', `subagent-internal is_error must not flag, got ${verdict.verdict}: ${verdict.reason}`);
|
|
839
|
-
} finally { rmdir(tmp); }
|
|
840
|
-
});
|
|
841
|
-
|
|
842
|
-
test('main-agent is_error (no parent_tool_use_id) in final 20% → still transcript_errors', async () => {
|
|
843
|
-
const tmp = makeTmpDir();
|
|
844
|
-
try {
|
|
845
|
-
const slug = '955-main-agent-error-guard';
|
|
846
|
-
const events = [];
|
|
847
|
-
for (let k = 0; k < 8; k++) {
|
|
848
|
-
events.push({ type: 'assistant', message: { role: 'assistant', content: [
|
|
849
|
-
{ type: 'tool_use', id: `t${k}`, name: 'Read', input: { description: `read ${k}` } }] } });
|
|
850
|
-
events.push({ type: 'user', message: { role: 'user', content: [
|
|
851
|
-
{ type: 'tool_result', tool_use_id: `t${k}`, content: 'ok', is_error: false }] } });
|
|
852
|
-
}
|
|
853
|
-
events.push({ type: 'assistant', message: { role: 'assistant', content: [
|
|
854
|
-
{ type: 'tool_use', id: 'tbad', name: 'Bash', input: { description: 'run tests' } }] } });
|
|
855
|
-
events.push({ type: 'user', message: { role: 'user', content: [
|
|
856
|
-
{ type: 'tool_result', tool_use_id: 'tbad', content: 'FAILED: 1 test failed', is_error: true }] } });
|
|
857
|
-
events.push({ type: 'result', subtype: 'success', result: 'All acceptance criteria verified.' });
|
|
858
|
-
|
|
859
|
-
writeLog(tmp, slug, events);
|
|
860
|
-
const prdPath = writePrd(tmp, slug, '# Guard: main-agent errors still flag');
|
|
861
|
-
const verdict = await verifyRun({ runDir: tmp, prdPath, queueEntry: { slug, status: 'running' }, allJobs: [], committedDuringRun: true });
|
|
862
|
-
assert.equal(verdict.verdict, 'transcript_errors', `main-agent is_error must still flag, got ${verdict.verdict}: ${verdict.reason}`);
|
|
863
|
-
} finally { rmdir(tmp); }
|
|
864
|
-
});
|
|
865
|
-
|
|
866
|
-
test('parseLog populates parentToolUseId on tool_use and tool_result events, defaulting to null', () => {
|
|
867
|
-
const tmp = makeTmpDir();
|
|
868
|
-
try {
|
|
869
|
-
const slug = '955-parselog-parent-id';
|
|
870
|
-
const events = [
|
|
871
|
-
{
|
|
872
|
-
type: 'assistant',
|
|
873
|
-
parent_tool_use_id: 'toolu_parent_001',
|
|
874
|
-
message: { role: 'assistant', content: [
|
|
875
|
-
{ type: 'tool_use', id: 'tchild', name: 'Bash', input: { description: 'grep in subagent' } }] },
|
|
876
|
-
},
|
|
877
|
-
{
|
|
878
|
-
type: 'user',
|
|
879
|
-
parent_tool_use_id: 'toolu_parent_001',
|
|
880
|
-
message: { role: 'user', content: [
|
|
881
|
-
{ type: 'tool_result', tool_use_id: 'tchild', content: '', is_error: true }] },
|
|
882
|
-
},
|
|
883
|
-
{
|
|
884
|
-
type: 'assistant',
|
|
885
|
-
message: { role: 'assistant', content: [
|
|
886
|
-
{ type: 'tool_use', id: 'ttop', name: 'Bash', input: { description: 'run in main agent' } }] },
|
|
887
|
-
},
|
|
888
|
-
{
|
|
889
|
-
type: 'user',
|
|
890
|
-
message: { role: 'user', content: [
|
|
891
|
-
{ type: 'tool_result', tool_use_id: 'ttop', content: 'ok', is_error: false }] },
|
|
892
|
-
},
|
|
893
|
-
];
|
|
894
|
-
writeLog(tmp, slug, events);
|
|
895
|
-
const { events: parsed } = parseLog(path.join(tmp, `${slug}.log`));
|
|
896
|
-
|
|
897
|
-
const childUse = parsed.find((ev) => ev.kind === 'tool_use' && ev.toolUseId === 'tchild');
|
|
898
|
-
const childResult = parsed.find((ev) => ev.kind === 'tool_result' && ev.toolUseId === 'tchild');
|
|
899
|
-
const topUse = parsed.find((ev) => ev.kind === 'tool_use' && ev.toolUseId === 'ttop');
|
|
900
|
-
const topResult = parsed.find((ev) => ev.kind === 'tool_result' && ev.toolUseId === 'ttop');
|
|
901
|
-
|
|
902
|
-
assert.equal(childUse.parentToolUseId, 'toolu_parent_001');
|
|
903
|
-
assert.equal(childResult.parentToolUseId, 'toolu_parent_001');
|
|
904
|
-
assert.equal(topUse.parentToolUseId, null);
|
|
905
|
-
assert.equal(topResult.parentToolUseId, null);
|
|
906
|
-
} finally { rmdir(tmp); }
|
|
907
|
-
});
|
|
908
|
-
|
|
909
|
-
test('isHarnessToolError detects wrapper and "No such tool available"', () => {
|
|
910
|
-
const { isHarnessToolError } = require('../runVerify.cjs');
|
|
911
|
-
assert.equal(isHarnessToolError('<tool_use_error>Error: No such tool available: bash</tool_use_error>'), true);
|
|
912
|
-
assert.equal(isHarnessToolError('No such tool available: Foo'), true);
|
|
913
|
-
assert.equal(isHarnessToolError('ModuleNotFoundError: No module named x'), false);
|
|
914
|
-
assert.equal(isHarnessToolError(''), false);
|
|
915
|
-
});
|
|
916
|
-
|
|
917
|
-
// ─── SCHEDULER_VERDICT sentinel override tests ────────────────────────────────
|
|
918
|
-
|
|
919
|
-
/** Build a log where a tool_result contains a Traceback+KeyError and the
|
|
920
|
-
* result event optionally contains the sentinel line. */
|
|
921
|
-
function tracebackRunEvents(sentinelLine) {
|
|
922
|
-
const resultText = sentinelLine
|
|
923
|
-
? `All work done.\n${sentinelLine}`
|
|
924
|
-
: 'All work done.';
|
|
925
|
-
return [
|
|
926
|
-
{
|
|
927
|
-
type: 'assistant',
|
|
928
|
-
message: {
|
|
929
|
-
role: 'assistant',
|
|
930
|
-
content: [{
|
|
931
|
-
type: 'tool_use',
|
|
932
|
-
id: 'toolu_tv_001',
|
|
933
|
-
name: 'Bash',
|
|
934
|
-
input: { command: 'pytest', description: 'Run acceptance tests' },
|
|
935
|
-
}],
|
|
936
|
-
},
|
|
937
|
-
},
|
|
938
|
-
{
|
|
939
|
-
type: 'user',
|
|
940
|
-
message: {
|
|
941
|
-
role: 'user',
|
|
942
|
-
content: [{
|
|
943
|
-
type: 'tool_result',
|
|
944
|
-
tool_use_id: 'toolu_tv_001',
|
|
945
|
-
content: [
|
|
946
|
-
'=== TDD red phase ===',
|
|
947
|
-
'Traceback (most recent call last):',
|
|
948
|
-
' File "test_foo.py", line 5, in test_bar',
|
|
949
|
-
"KeyError: 'missing_key'",
|
|
950
|
-
].join('\n'),
|
|
951
|
-
is_error: false,
|
|
952
|
-
}],
|
|
953
|
-
},
|
|
954
|
-
},
|
|
955
|
-
{ type: 'result', subtype: 'success', result: resultText },
|
|
956
|
-
];
|
|
957
|
-
}
|
|
958
|
-
|
|
959
|
-
// (a) sentinel PASS + committedDuringRun:true + Traceback+Error → clean
|
|
960
|
-
test('sentinel PASS + committedDuringRun:true + Traceback → clean (override)', async () => {
|
|
961
|
-
const tmp = makeTmpDir();
|
|
962
|
-
try {
|
|
963
|
-
const slug = '77-sentinel-override-pass';
|
|
964
|
-
writeLog(tmp, slug, tracebackRunEvents('SCHEDULER_VERDICT: PASS'));
|
|
965
|
-
const prdPath = writePrd(tmp, slug, '# Sentinel override test');
|
|
966
|
-
const verdict = await verifyRun({
|
|
967
|
-
runDir: tmp,
|
|
968
|
-
prdPath,
|
|
969
|
-
queueEntry: { slug, status: 'running' },
|
|
970
|
-
allJobs: [],
|
|
971
|
-
committedDuringRun: true,
|
|
972
|
-
});
|
|
973
|
-
assert.equal(verdict.verdict, 'clean', `expected clean, got ${verdict.verdict}: ${verdict.reason}`);
|
|
974
|
-
assert.equal(verdict.downgradeTo, null);
|
|
975
|
-
assert.ok(verdict.reason.includes('SCHEDULER_VERDICT: PASS'), `reason should mention sentinel: ${verdict.reason}`);
|
|
976
|
-
// Sidecar should record the sentinel and override
|
|
977
|
-
const sidecar = JSON.parse(fs.readFileSync(path.join(tmp, `${slug}.verdicts.json`), 'utf8'));
|
|
978
|
-
assert.equal(sidecar.sentinel, 'pass');
|
|
979
|
-
assert.ok(sidecar.sentinelOverride, 'sidecar should record sentinelOverride');
|
|
980
|
-
} finally {
|
|
981
|
-
rmdir(tmp);
|
|
982
|
-
}
|
|
983
|
-
});
|
|
984
|
-
|
|
985
|
-
// (b) no sentinel + Traceback+Error → transcript_errors (unchanged baseline)
|
|
986
|
-
test('no sentinel + Traceback+Error + committedDuringRun:true → transcript_errors (no override)', async () => {
|
|
987
|
-
const tmp = makeTmpDir();
|
|
988
|
-
try {
|
|
989
|
-
const slug = '77-no-sentinel-baseline';
|
|
990
|
-
writeLog(tmp, slug, tracebackRunEvents(null));
|
|
991
|
-
const prdPath = writePrd(tmp, slug, '# No sentinel baseline');
|
|
992
|
-
const verdict = await verifyRun({
|
|
993
|
-
runDir: tmp,
|
|
994
|
-
prdPath,
|
|
995
|
-
queueEntry: { slug, status: 'running' },
|
|
996
|
-
allJobs: [],
|
|
997
|
-
committedDuringRun: true,
|
|
998
|
-
});
|
|
999
|
-
assert.equal(verdict.verdict, 'transcript_errors', `expected transcript_errors without sentinel, got ${verdict.verdict}: ${verdict.reason}`);
|
|
1000
|
-
assert.equal(verdict.downgradeTo, 'needs_review');
|
|
1001
|
-
} finally {
|
|
1002
|
-
rmdir(tmp);
|
|
1003
|
-
}
|
|
1004
|
-
});
|
|
1005
|
-
|
|
1006
|
-
// (c) sentinel PASS + committedDuringRun:false → stays transcript_errors (commit not confirmed)
|
|
1007
|
-
test('sentinel PASS + committedDuringRun:false → transcript_errors (commit unconfirmed)', async () => {
|
|
1008
|
-
const tmp = makeTmpDir();
|
|
1009
|
-
try {
|
|
1010
|
-
const slug = '77-sentinel-no-commit';
|
|
1011
|
-
writeLog(tmp, slug, tracebackRunEvents('SCHEDULER_VERDICT: PASS'));
|
|
1012
|
-
const prdPath = writePrd(tmp, slug, '# Sentinel without commit');
|
|
1013
|
-
const verdict = await verifyRun({
|
|
1014
|
-
runDir: tmp,
|
|
1015
|
-
prdPath,
|
|
1016
|
-
queueEntry: { slug, status: 'running' },
|
|
1017
|
-
allJobs: [],
|
|
1018
|
-
committedDuringRun: false,
|
|
1019
|
-
});
|
|
1020
|
-
assert.equal(verdict.verdict, 'transcript_errors', `PASS without commit must not override, got ${verdict.verdict}: ${verdict.reason}`);
|
|
1021
|
-
assert.equal(verdict.downgradeTo, 'needs_review');
|
|
1022
|
-
} finally {
|
|
1023
|
-
rmdir(tmp);
|
|
1024
|
-
}
|
|
1025
|
-
});
|
|
1026
|
-
|
|
1027
|
-
// (d) sentinel FAIL → never clean (even with committedDuringRun:true)
|
|
1028
|
-
test('sentinel FAIL + committedDuringRun:true → transcript_errors (FAIL never overrides)', async () => {
|
|
1029
|
-
const tmp = makeTmpDir();
|
|
1030
|
-
try {
|
|
1031
|
-
const slug = '77-sentinel-fail';
|
|
1032
|
-
writeLog(tmp, slug, tracebackRunEvents('SCHEDULER_VERDICT: FAIL AC gate was red'));
|
|
1033
|
-
const prdPath = writePrd(tmp, slug, '# Sentinel FAIL');
|
|
1034
|
-
const verdict = await verifyRun({
|
|
1035
|
-
runDir: tmp,
|
|
1036
|
-
prdPath,
|
|
1037
|
-
queueEntry: { slug, status: 'running' },
|
|
1038
|
-
allJobs: [],
|
|
1039
|
-
committedDuringRun: true,
|
|
1040
|
-
});
|
|
1041
|
-
assert.equal(verdict.verdict, 'transcript_errors', `FAIL sentinel must not override to clean, got ${verdict.verdict}: ${verdict.reason}`);
|
|
1042
|
-
assert.equal(verdict.downgradeTo, 'needs_review');
|
|
1043
|
-
} finally {
|
|
1044
|
-
rmdir(tmp);
|
|
1045
|
-
}
|
|
1046
|
-
});
|
|
1047
|
-
|
|
1048
|
-
// ─── pre-sentinel heal (allowPreSentinelHeal) ─────────────────────────────────
|
|
1049
|
-
|
|
1050
|
-
// (f) allowPreSentinelHeal=true + committed + no sentinel → clean
|
|
1051
|
-
test('pre-sentinel heal: committed + no sentinel + allowPreSentinelHeal → clean', async () => {
|
|
1052
|
-
const tmp = makeTmpDir();
|
|
1053
|
-
try {
|
|
1054
|
-
const slug = '86-pre-sentinel-heal-pass';
|
|
1055
|
-
writeLog(tmp, slug, tracebackRunEvents(null)); // no SCHEDULER_VERDICT line
|
|
1056
|
-
const prdPath = writePrd(tmp, slug, '# Pre-sentinel heal');
|
|
1057
|
-
const verdict = await verifyRun({
|
|
1058
|
-
runDir: tmp,
|
|
1059
|
-
prdPath,
|
|
1060
|
-
queueEntry: { slug, status: 'needs_review' },
|
|
1061
|
-
allJobs: [],
|
|
1062
|
-
committedDuringRun: true,
|
|
1063
|
-
allowPreSentinelHeal: true,
|
|
1064
|
-
});
|
|
1065
|
-
assert.equal(verdict.verdict, 'clean', `expected clean via pre-sentinel heal, got ${verdict.verdict}: ${verdict.reason}`);
|
|
1066
|
-
assert.equal(verdict.downgradeTo, null);
|
|
1067
|
-
assert.ok(verdict.reason.includes('pre-sentinel heal'), `reason should mention pre-sentinel heal: ${verdict.reason}`);
|
|
1068
|
-
const sidecar = JSON.parse(fs.readFileSync(path.join(tmp, `${slug}.verdicts.json`), 'utf8'));
|
|
1069
|
-
assert.ok(sidecar.preSentinelHeal, 'sidecar should record preSentinelHeal');
|
|
1070
|
-
} finally {
|
|
1071
|
-
rmdir(tmp);
|
|
1072
|
-
}
|
|
1073
|
-
});
|
|
1074
|
-
|
|
1075
|
-
// (g) allowPreSentinelHeal=true + committed + FAIL sentinel → stays transcript_errors
|
|
1076
|
-
test('pre-sentinel heal: committed + SCHEDULER_VERDICT: FAIL + allowPreSentinelHeal → transcript_errors', async () => {
|
|
1077
|
-
const tmp = makeTmpDir();
|
|
1078
|
-
try {
|
|
1079
|
-
const slug = '86-pre-sentinel-heal-fail';
|
|
1080
|
-
writeLog(tmp, slug, tracebackRunEvents('SCHEDULER_VERDICT: FAIL AC gate was red'));
|
|
1081
|
-
const prdPath = writePrd(tmp, slug, '# Pre-sentinel heal blocked by FAIL');
|
|
1082
|
-
const verdict = await verifyRun({
|
|
1083
|
-
runDir: tmp,
|
|
1084
|
-
prdPath,
|
|
1085
|
-
queueEntry: { slug, status: 'needs_review' },
|
|
1086
|
-
allJobs: [],
|
|
1087
|
-
committedDuringRun: true,
|
|
1088
|
-
allowPreSentinelHeal: true,
|
|
1089
|
-
});
|
|
1090
|
-
assert.equal(verdict.verdict, 'transcript_errors', `FAIL sentinel must block pre-sentinel heal, got ${verdict.verdict}: ${verdict.reason}`);
|
|
1091
|
-
assert.equal(verdict.downgradeTo, 'needs_review');
|
|
1092
|
-
} finally {
|
|
1093
|
-
rmdir(tmp);
|
|
1094
|
-
}
|
|
1095
|
-
});
|
|
1096
|
-
|
|
1097
|
-
// (h) allowPreSentinelHeal=true + NOT committed + no sentinel → stays transcript_errors
|
|
1098
|
-
test('pre-sentinel heal: not committed + no sentinel + allowPreSentinelHeal → transcript_errors', async () => {
|
|
1099
|
-
const tmp = makeTmpDir();
|
|
1100
|
-
try {
|
|
1101
|
-
const slug = '86-pre-sentinel-heal-uncommitted';
|
|
1102
|
-
writeLog(tmp, slug, tracebackRunEvents(null));
|
|
1103
|
-
const prdPath = writePrd(tmp, slug, '# Pre-sentinel heal blocked by no commit');
|
|
1104
|
-
const verdict = await verifyRun({
|
|
1105
|
-
runDir: tmp,
|
|
1106
|
-
prdPath,
|
|
1107
|
-
queueEntry: { slug, status: 'needs_review' },
|
|
1108
|
-
allJobs: [],
|
|
1109
|
-
committedDuringRun: false,
|
|
1110
|
-
allowPreSentinelHeal: true,
|
|
1111
|
-
});
|
|
1112
|
-
assert.equal(verdict.verdict, 'transcript_errors', `no commit must block pre-sentinel heal, got ${verdict.verdict}: ${verdict.reason}`);
|
|
1113
|
-
assert.equal(verdict.downgradeTo, 'needs_review');
|
|
1114
|
-
} finally {
|
|
1115
|
-
rmdir(tmp);
|
|
1116
|
-
}
|
|
1117
|
-
});
|
|
1118
|
-
|
|
1119
|
-
// (i) allowPreSentinelHeal=false (default) + committed + no sentinel → baseline unchanged
|
|
1120
|
-
test('no sentinel + committed + allowPreSentinelHeal=false (default) → transcript_errors', async () => {
|
|
1121
|
-
const tmp = makeTmpDir();
|
|
1122
|
-
try {
|
|
1123
|
-
const slug = '86-pre-sentinel-heal-disabled';
|
|
1124
|
-
writeLog(tmp, slug, tracebackRunEvents(null));
|
|
1125
|
-
const prdPath = writePrd(tmp, slug, '# allowPreSentinelHeal disabled by default');
|
|
1126
|
-
const verdict = await verifyRun({
|
|
1127
|
-
runDir: tmp,
|
|
1128
|
-
prdPath,
|
|
1129
|
-
queueEntry: { slug, status: 'needs_review' },
|
|
1130
|
-
allJobs: [],
|
|
1131
|
-
committedDuringRun: true,
|
|
1132
|
-
// allowPreSentinelHeal defaults to false
|
|
1133
|
-
});
|
|
1134
|
-
assert.equal(verdict.verdict, 'transcript_errors', `must not heal without allowPreSentinelHeal, got ${verdict.verdict}: ${verdict.reason}`);
|
|
1135
|
-
assert.equal(verdict.downgradeTo, 'needs_review');
|
|
1136
|
-
} finally {
|
|
1137
|
-
rmdir(tmp);
|
|
1138
|
-
}
|
|
1139
|
-
});
|
|
1140
|
-
|
|
1141
|
-
// ─── no_verdict_sentinel: no commit + no sentinel is not "clean" by default ──
|
|
1142
|
-
|
|
1143
|
-
/** A run with zero tool_result pattern hits — e.g. the agent asked a
|
|
1144
|
-
* clarifying question and stopped, ending its turn without touching tools. */
|
|
1145
|
-
function noOpRunEvents(resultText) {
|
|
1146
|
-
return [
|
|
1147
|
-
{ type: 'result', subtype: 'success', result: resultText },
|
|
1148
|
-
];
|
|
1149
|
-
}
|
|
1150
|
-
|
|
1151
|
-
test('no_verdict_sentinel: no tool_result issues, no sentinel, no commit → needs_review', async () => {
|
|
1152
|
-
const tmp = makeTmpDir();
|
|
1153
|
-
try {
|
|
1154
|
-
const slug = '406-capture-panel-ui';
|
|
1155
|
-
writeLog(tmp, slug, noOpRunEvents('I need clarification on which capture API to target before proceeding.'));
|
|
1156
|
-
const prdPath = writePrd(tmp, slug, '# Browser capture panel UI');
|
|
1157
|
-
const verdict = await verifyRun({
|
|
1158
|
-
runDir: tmp,
|
|
1159
|
-
prdPath,
|
|
1160
|
-
queueEntry: { slug, status: 'running' },
|
|
1161
|
-
allJobs: [],
|
|
1162
|
-
committedDuringRun: false,
|
|
1163
|
-
});
|
|
1164
|
-
assert.equal(verdict.verdict, 'no_verdict_sentinel', `expected no_verdict_sentinel, got ${verdict.verdict}: ${verdict.reason}`);
|
|
1165
|
-
assert.equal(verdict.downgradeTo, 'needs_review');
|
|
1166
|
-
} finally {
|
|
1167
|
-
rmdir(tmp);
|
|
1168
|
-
}
|
|
1169
|
-
});
|
|
1170
|
-
|
|
1171
|
-
test('no_verdict_sentinel guard: same run but committedDuringRun:true → stays clean', async () => {
|
|
1172
|
-
const tmp = makeTmpDir();
|
|
1173
|
-
try {
|
|
1174
|
-
const slug = '406-capture-panel-ui-committed';
|
|
1175
|
-
writeLog(tmp, slug, noOpRunEvents('I need clarification on which capture API to target before proceeding.'));
|
|
1176
|
-
const prdPath = writePrd(tmp, slug, '# Browser capture panel UI');
|
|
1177
|
-
const verdict = await verifyRun({
|
|
1178
|
-
runDir: tmp,
|
|
1179
|
-
prdPath,
|
|
1180
|
-
queueEntry: { slug, status: 'running' },
|
|
1181
|
-
allJobs: [],
|
|
1182
|
-
committedDuringRun: true,
|
|
1183
|
-
});
|
|
1184
|
-
assert.equal(verdict.verdict, 'clean', `commit landed should stay clean, got ${verdict.verdict}: ${verdict.reason}`);
|
|
1185
|
-
assert.equal(verdict.downgradeTo, null);
|
|
1186
|
-
} finally {
|
|
1187
|
-
rmdir(tmp);
|
|
1188
|
-
}
|
|
1189
|
-
});
|
|
1190
|
-
|
|
1191
|
-
test('no_verdict_sentinel guard: same run but with SCHEDULER_VERDICT: PASS sentinel + a commit → stays clean', async () => {
|
|
1192
|
-
const tmp = makeTmpDir();
|
|
1193
|
-
try {
|
|
1194
|
-
const slug = '406-capture-panel-ui-sentinel';
|
|
1195
|
-
writeLog(tmp, slug, noOpRunEvents('All acceptance criteria verified.\nSCHEDULER_VERDICT: PASS'));
|
|
1196
|
-
const prdPath = writePrd(tmp, slug, '# Browser capture panel UI');
|
|
1197
|
-
const verdict = await verifyRun({
|
|
1198
|
-
runDir: tmp,
|
|
1199
|
-
prdPath,
|
|
1200
|
-
queueEntry: { slug, status: 'running' },
|
|
1201
|
-
allJobs: [],
|
|
1202
|
-
committedDuringRun: true,
|
|
1203
|
-
});
|
|
1204
|
-
assert.equal(verdict.verdict, 'clean', `PASS sentinel + commit should stay clean, got ${verdict.verdict}: ${verdict.reason}`);
|
|
1205
|
-
assert.equal(verdict.downgradeTo, null);
|
|
1206
|
-
} finally {
|
|
1207
|
-
rmdir(tmp);
|
|
1208
|
-
}
|
|
1209
|
-
});
|
|
1210
|
-
|
|
1211
|
-
// ─── abandoned_background_task: auto-backgrounded Bash + no sentinel/commit ─
|
|
1212
|
-
|
|
1213
|
-
/** A run whose Bash command hit the harness's 120s foreground timeout and was
|
|
1214
|
-
* auto-backgrounded, then the run ended without ever coming back to commit
|
|
1215
|
-
* or emit the finish-protocol sentinel. */
|
|
1216
|
-
function abandonedBackgroundTaskRunEvents(resultText) {
|
|
1217
|
-
return [
|
|
1218
|
-
{
|
|
1219
|
-
type: 'assistant',
|
|
1220
|
-
message: {
|
|
1221
|
-
role: 'assistant',
|
|
1222
|
-
content: [{
|
|
1223
|
-
type: 'tool_use',
|
|
1224
|
-
id: 'toolu_bg_001',
|
|
1225
|
-
name: 'Bash',
|
|
1226
|
-
input: { command: 'npm run test:unit', description: 'Run full unit suite' },
|
|
1227
|
-
}],
|
|
1228
|
-
},
|
|
1229
|
-
},
|
|
1230
|
-
{
|
|
1231
|
-
type: 'user',
|
|
1232
|
-
message: {
|
|
1233
|
-
role: 'user',
|
|
1234
|
-
content: [{
|
|
1235
|
-
type: 'tool_result',
|
|
1236
|
-
tool_use_id: 'toolu_bg_001',
|
|
1237
|
-
content: 'Command did not complete within its 120s timeout and was moved to the background (ID: bcn1lpvpd). Output is being written to: /tmp/claude-1000/tasks/bcn1lpvpd.output. You will be notified when it completes. To check interim output, use Read on that file path.',
|
|
1238
|
-
is_error: false,
|
|
1239
|
-
}],
|
|
1240
|
-
},
|
|
1241
|
-
},
|
|
1242
|
-
{ type: 'result', subtype: 'success', result: resultText },
|
|
1243
|
-
];
|
|
1244
|
-
}
|
|
1245
|
-
|
|
1246
|
-
test('abandoned_background_task: background marker + no sentinel + no commit → abandoned_background_task', async () => {
|
|
1247
|
-
const tmp = makeTmpDir();
|
|
1248
|
-
try {
|
|
1249
|
-
const slug = '1116-encyclopedia-animations-section';
|
|
1250
|
-
writeLog(tmp, slug, abandonedBackgroundTaskRunEvents('Waiting for the backgrounded test run to finish.'));
|
|
1251
|
-
const prdPath = writePrd(tmp, slug, '# Encyclopedia animations section');
|
|
1252
|
-
const verdict = await verifyRun({
|
|
1253
|
-
runDir: tmp,
|
|
1254
|
-
prdPath,
|
|
1255
|
-
queueEntry: { slug, status: 'running' },
|
|
1256
|
-
allJobs: [],
|
|
1257
|
-
committedDuringRun: false,
|
|
1258
|
-
});
|
|
1259
|
-
assert.equal(verdict.verdict, 'abandoned_background_task', `expected abandoned_background_task, got ${verdict.verdict}: ${verdict.reason}`);
|
|
1260
|
-
assert.equal(verdict.downgradeTo, 'needs_review');
|
|
1261
|
-
} finally {
|
|
1262
|
-
rmdir(tmp);
|
|
1263
|
-
}
|
|
1264
|
-
});
|
|
1265
|
-
|
|
1266
|
-
test('abandoned_background_task guard: no background marker, no sentinel, no commit → stays plain no_verdict_sentinel', async () => {
|
|
1267
|
-
const tmp = makeTmpDir();
|
|
1268
|
-
try {
|
|
1269
|
-
const slug = '1116-no-background-marker';
|
|
1270
|
-
writeLog(tmp, slug, noOpRunEvents('I need clarification on which capture API to target before proceeding.'));
|
|
1271
|
-
const prdPath = writePrd(tmp, slug, '# Encyclopedia animations section');
|
|
1272
|
-
const verdict = await verifyRun({
|
|
1273
|
-
runDir: tmp,
|
|
1274
|
-
prdPath,
|
|
1275
|
-
queueEntry: { slug, status: 'running' },
|
|
1276
|
-
allJobs: [],
|
|
1277
|
-
committedDuringRun: false,
|
|
1278
|
-
});
|
|
1279
|
-
assert.equal(verdict.verdict, 'no_verdict_sentinel', `expected plain no_verdict_sentinel, got ${verdict.verdict}: ${verdict.reason}`);
|
|
1280
|
-
} finally {
|
|
1281
|
-
rmdir(tmp);
|
|
1282
|
-
}
|
|
1283
|
-
});
|
|
1284
|
-
|
|
1285
|
-
test('abandoned_background_task guard: background marker present but run DID commit → clean', async () => {
|
|
1286
|
-
const tmp = makeTmpDir();
|
|
1287
|
-
try {
|
|
1288
|
-
const slug = '1116-background-marker-but-committed';
|
|
1289
|
-
writeLog(tmp, slug, abandonedBackgroundTaskRunEvents('Backgrounded test run finished green; work committed.'));
|
|
1290
|
-
const prdPath = writePrd(tmp, slug, '# Encyclopedia animations section');
|
|
1291
|
-
const verdict = await verifyRun({
|
|
1292
|
-
runDir: tmp,
|
|
1293
|
-
prdPath,
|
|
1294
|
-
queueEntry: { slug, status: 'running' },
|
|
1295
|
-
allJobs: [],
|
|
1296
|
-
committedDuringRun: true,
|
|
1297
|
-
});
|
|
1298
|
-
assert.equal(verdict.verdict, 'clean', `background marker with a landed commit should stay clean, got ${verdict.verdict}: ${verdict.reason}`);
|
|
1299
|
-
assert.equal(verdict.downgradeTo, null);
|
|
1300
|
-
} finally {
|
|
1301
|
-
rmdir(tmp);
|
|
1302
|
-
}
|
|
1303
|
-
});
|
|
1304
|
-
|
|
1305
|
-
// ─── pass_no_commit: PASS sentinel with no commit is not "clean" ───────────
|
|
1306
|
-
|
|
1307
|
-
test('pass_no_commit: SCHEDULER_VERDICT: PASS but no commit landed → needs_review', async () => {
|
|
1308
|
-
const tmp = makeTmpDir();
|
|
1309
|
-
try {
|
|
1310
|
-
const slug = '511-recorder-mouse-drag-panel-export';
|
|
1311
|
-
writeLog(tmp, slug, noOpRunEvents('All acceptance criteria verified.\nSCHEDULER_VERDICT: PASS'));
|
|
1312
|
-
const prdPath = writePrd(tmp, slug, '# Recorder mouse drag panel export');
|
|
1313
|
-
const verdict = await verifyRun({
|
|
1314
|
-
runDir: tmp,
|
|
1315
|
-
prdPath,
|
|
1316
|
-
queueEntry: { slug, status: 'running' },
|
|
1317
|
-
allJobs: [],
|
|
1318
|
-
committedDuringRun: false,
|
|
1319
|
-
});
|
|
1320
|
-
assert.equal(verdict.verdict, 'pass_no_commit', `expected pass_no_commit, got ${verdict.verdict}: ${verdict.reason}`);
|
|
1321
|
-
assert.equal(verdict.downgradeTo, 'needs_review');
|
|
1322
|
-
} finally {
|
|
1323
|
-
rmdir(tmp);
|
|
1324
|
-
}
|
|
1325
|
-
});
|
|
1326
|
-
|
|
1327
|
-
test('pass_no_commit: fix-plan job (slug ^\\d+-fix-) with PASS but no commit is exempt → clean', async () => {
|
|
1328
|
-
const tmp = makeTmpDir();
|
|
1329
|
-
try {
|
|
1330
|
-
const slug = '523-fix-bounded-fix-plan-retry';
|
|
1331
|
-
writeLog(tmp, slug, noOpRunEvents('Verification complete — no code gap exists.\nSCHEDULER_VERDICT: PASS'));
|
|
1332
|
-
const prdPath = writePrd(tmp, slug, '# Fix: bounded fix-plan retry');
|
|
1333
|
-
const verdict = await verifyRun({
|
|
1334
|
-
runDir: tmp,
|
|
1335
|
-
prdPath,
|
|
1336
|
-
queueEntry: { slug, status: 'running' },
|
|
1337
|
-
allJobs: [],
|
|
1338
|
-
committedDuringRun: false,
|
|
1339
|
-
});
|
|
1340
|
-
assert.equal(verdict.verdict, 'clean', `expected clean (fix-plan exemption), got ${verdict.verdict}: ${verdict.reason}`);
|
|
1341
|
-
} finally {
|
|
1342
|
-
rmdir(tmp);
|
|
1343
|
-
}
|
|
1344
|
-
});
|
|
1345
|
-
|
|
1346
|
-
// ─── pass_no_commit_already_shipped: original PRD re-run after landing ─────
|
|
1347
|
-
// (incident: 655-needs-review-rca-feedback-hook, 2026-07-31)
|
|
1348
|
-
|
|
1349
|
-
const { extractPrdDeliverablePaths, allDeliverablesAlreadyTracked } = require('../runVerify.cjs');
|
|
1350
|
-
const REPO_ROOT = path.resolve(__dirname, '../../..');
|
|
1351
|
-
|
|
1352
|
-
test('pass_no_commit: original PRD, PASS no commit, all deliverable paths already tracked in git → pass_no_commit_already_shipped', async () => {
|
|
1353
|
-
const tmp = makeTmpDir();
|
|
1354
|
-
try {
|
|
1355
|
-
const slug = '655-needs-review-rca-feedback-hook';
|
|
1356
|
-
writeLog(tmp, slug, noOpRunEvents('Verified rcaReport.cjs already shipped in e13168d; typecheck + tests green; no commit needed.\nSCHEDULER_VERDICT: PASS'));
|
|
1357
|
-
const prdPath = writePrd(tmp, slug, 'Deliverables: `src/main/lib/rcaReport.cjs` and `src/main/__tests__/rcaReport.test.cjs`.');
|
|
1358
|
-
const verdict = await verifyRun({
|
|
1359
|
-
runDir: tmp,
|
|
1360
|
-
prdPath,
|
|
1361
|
-
queueEntry: { slug, status: 'running', cwd: REPO_ROOT },
|
|
1362
|
-
allJobs: [],
|
|
1363
|
-
committedDuringRun: false,
|
|
1364
|
-
});
|
|
1365
|
-
assert.equal(verdict.verdict, 'pass_no_commit_already_shipped', `expected already-shipped exemption, got ${verdict.verdict}: ${verdict.reason}`);
|
|
1366
|
-
assert.equal(verdict.downgradeTo, null);
|
|
1367
|
-
} finally {
|
|
1368
|
-
rmdir(tmp);
|
|
1369
|
-
}
|
|
1370
|
-
});
|
|
1371
|
-
|
|
1372
|
-
test('pass_no_commit: original PRD, PASS no commit, one deliverable path untracked → falls through to pass_no_commit', async () => {
|
|
1373
|
-
const tmp = makeTmpDir();
|
|
1374
|
-
try {
|
|
1375
|
-
const slug = '655-needs-review-rca-feedback-hook';
|
|
1376
|
-
writeLog(tmp, slug, noOpRunEvents('Nothing to do here.\nSCHEDULER_VERDICT: PASS'));
|
|
1377
|
-
const prdPath = writePrd(tmp, slug, 'Deliverables: `src/main/lib/rcaReport.cjs` and `src/main/lib/does-not-exist-xyz.cjs`.');
|
|
1378
|
-
const verdict = await verifyRun({
|
|
1379
|
-
runDir: tmp,
|
|
1380
|
-
prdPath,
|
|
1381
|
-
queueEntry: { slug, status: 'running', cwd: REPO_ROOT },
|
|
1382
|
-
allJobs: [],
|
|
1383
|
-
committedDuringRun: false,
|
|
1384
|
-
});
|
|
1385
|
-
assert.equal(verdict.verdict, 'pass_no_commit', `expected fallback to pass_no_commit, got ${verdict.verdict}: ${verdict.reason}`);
|
|
1386
|
-
} finally {
|
|
1387
|
-
rmdir(tmp);
|
|
1388
|
-
}
|
|
1389
|
-
});
|
|
1390
|
-
|
|
1391
|
-
test('pass_no_commit: original PRD, PASS no commit, zero extractable deliverable paths → falls through to pass_no_commit', async () => {
|
|
1392
|
-
const tmp = makeTmpDir();
|
|
1393
|
-
try {
|
|
1394
|
-
const slug = '999-some-vague-prd';
|
|
1395
|
-
writeLog(tmp, slug, noOpRunEvents('Nothing to do here.\nSCHEDULER_VERDICT: PASS'));
|
|
1396
|
-
const prdPath = writePrd(tmp, slug, 'This PRD names no file paths at all, just prose.');
|
|
1397
|
-
const verdict = await verifyRun({
|
|
1398
|
-
runDir: tmp,
|
|
1399
|
-
prdPath,
|
|
1400
|
-
queueEntry: { slug, status: 'running', cwd: REPO_ROOT },
|
|
1401
|
-
allJobs: [],
|
|
1402
|
-
committedDuringRun: false,
|
|
1403
|
-
});
|
|
1404
|
-
assert.equal(verdict.verdict, 'pass_no_commit', `expected fallback to pass_no_commit, got ${verdict.verdict}: ${verdict.reason}`);
|
|
1405
|
-
} finally {
|
|
1406
|
-
rmdir(tmp);
|
|
1407
|
-
}
|
|
1408
|
-
});
|
|
1409
|
-
|
|
1410
|
-
// (incident: 812-commit-guard-retry-on-worktree-ref-visibility-delay — a
|
|
1411
|
-
// stale scheduler process, booted before the already-shipped exemption
|
|
1412
|
-
// landed, produced a false pass_no_commit for exactly this shape of re-run)
|
|
1413
|
-
test('pass_no_commit: commit-guard-retry PRD naming scheduler.cjs + its committed-in-window test, PASS no commit → pass_no_commit_already_shipped', async () => {
|
|
1414
|
-
const tmp = makeTmpDir();
|
|
1415
|
-
try {
|
|
1416
|
-
const slug = '812-commit-guard-retry-on-worktree-ref-visibility-delay';
|
|
1417
|
-
writeLog(tmp, slug, noOpRunEvents('Retry + tests already present; nothing to change.\nSCHEDULER_VERDICT: PASS'));
|
|
1418
|
-
const prdPath = writePrd(
|
|
1419
|
-
tmp,
|
|
1420
|
-
slug,
|
|
1421
|
-
'Deliverables: `src/main/scheduler.cjs` and `src/main/__tests__/scheduler-committed-in-window.test.cjs`.',
|
|
1422
|
-
);
|
|
1423
|
-
const verdict = await verifyRun({
|
|
1424
|
-
runDir: tmp,
|
|
1425
|
-
prdPath,
|
|
1426
|
-
queueEntry: { slug, status: 'running', cwd: REPO_ROOT },
|
|
1427
|
-
allJobs: [],
|
|
1428
|
-
committedDuringRun: false,
|
|
1429
|
-
});
|
|
1430
|
-
assert.equal(verdict.verdict, 'pass_no_commit_already_shipped', `expected already-shipped exemption, got ${verdict.verdict}: ${verdict.reason}`);
|
|
1431
|
-
assert.equal(verdict.downgradeTo, null);
|
|
1432
|
-
} finally {
|
|
1433
|
-
rmdir(tmp);
|
|
1434
|
-
}
|
|
1435
|
-
});
|
|
1436
|
-
|
|
1437
|
-
test('extractPrdDeliverablePaths: extracts backticked repo-relative paths, ignores prose', () => {
|
|
1438
|
-
const body = 'Deliverables: `src/main/lib/rcaReport.cjs` and `src/main/__tests__/rcaReport.test.cjs`. Also see node_modules/foo/bar.js which should be excluded.';
|
|
1439
|
-
const paths = extractPrdDeliverablePaths(body);
|
|
1440
|
-
assert.deepEqual(paths, ['src/main/lib/rcaReport.cjs', 'src/main/__tests__/rcaReport.test.cjs']);
|
|
1441
|
-
assert.deepEqual(extractPrdDeliverablePaths(''), []);
|
|
1442
|
-
assert.deepEqual(extractPrdDeliverablePaths(undefined), []);
|
|
1443
|
-
});
|
|
1444
|
-
|
|
1445
|
-
test('allDeliverablesAlreadyTracked: fail-safe on empty paths, non-git cwd, and git errors', () => {
|
|
1446
|
-
assert.equal(allDeliverablesAlreadyTracked({ cwd: REPO_ROOT, paths: [] }), false);
|
|
1447
|
-
assert.equal(allDeliverablesAlreadyTracked({
|
|
1448
|
-
cwd: REPO_ROOT,
|
|
1449
|
-
paths: ['src/main/runVerify.cjs'],
|
|
1450
|
-
execImpl: () => { throw new Error('boom'); },
|
|
1451
|
-
}), false);
|
|
1452
|
-
assert.equal(allDeliverablesAlreadyTracked({
|
|
1453
|
-
cwd: REPO_ROOT,
|
|
1454
|
-
paths: ['src/main/runVerify.cjs'],
|
|
1455
|
-
execImpl: () => '',
|
|
1456
|
-
}), true);
|
|
1457
|
-
});
|
|
1458
|
-
|
|
1459
|
-
// ─── repo-root config deliverable extraction ────────────────────────────────
|
|
1460
|
-
// (incident: 816-vitest-register-runverify-test, 2026-07-31 — PRD named only
|
|
1461
|
-
// `vitest.config.ts` as its deliverable; the source-dir-only regex extracted
|
|
1462
|
-
// nothing, so allDeliverablesAlreadyTracked early-returned false even though
|
|
1463
|
-
// the config edit was already tracked in git)
|
|
1464
|
-
|
|
1465
|
-
test('extractPrdDeliverablePaths: extracts a root-config file alongside a src path', () => {
|
|
1466
|
-
const body = 'Register the test in `vitest.config.ts` and port `src/main/__tests__/runVerify.test.cjs` onto vitest.';
|
|
1467
|
-
const paths = extractPrdDeliverablePaths(body);
|
|
1468
|
-
assert.deepEqual(new Set(paths), new Set(['vitest.config.ts', 'src/main/__tests__/runVerify.test.cjs']));
|
|
1469
|
-
});
|
|
1470
|
-
|
|
1471
|
-
test('extractPrdDeliverablePaths: root-config-only PRD body yields a non-empty result', () => {
|
|
1472
|
-
const body = 'The only deliverable is `vitest.config.ts` — add the missing test.include entry.';
|
|
1473
|
-
const paths = extractPrdDeliverablePaths(body);
|
|
1474
|
-
assert.deepEqual(paths, ['vitest.config.ts']);
|
|
1475
|
-
});
|
|
1476
|
-
|
|
1477
|
-
test('extractPrdDeliverablePaths: nested or non-allowlisted root files do not produce spurious root-config entries', () => {
|
|
1478
|
-
const body = 'See `some/nested/package.json` for the dependency, and update README.md with notes.';
|
|
1479
|
-
const paths = extractPrdDeliverablePaths(body);
|
|
1480
|
-
assert.equal(paths.includes('package.json'), false);
|
|
1481
|
-
assert.equal(paths.includes('README.md'), false);
|
|
1482
|
-
assert.deepEqual(paths, []);
|
|
1483
|
-
});
|
|
1484
|
-
|
|
1485
|
-
test('pass_no_commit: root-config-only PRD, PASS no commit, config already tracked → pass_no_commit_already_shipped', async () => {
|
|
1486
|
-
const tmp = makeTmpDir();
|
|
1487
|
-
try {
|
|
1488
|
-
const slug = '816-vitest-register-runverify-test';
|
|
1489
|
-
writeLog(tmp, slug, noOpRunEvents('Registered already in vitest.config.ts; 48 tests green.\nSCHEDULER_VERDICT: PASS'));
|
|
1490
|
-
const prdPath = writePrd(tmp, slug, 'Deliverable: register the test file in `vitest.config.ts`.');
|
|
1491
|
-
const verdict = await verifyRun({
|
|
1492
|
-
runDir: tmp,
|
|
1493
|
-
prdPath,
|
|
1494
|
-
queueEntry: { slug, status: 'running', cwd: REPO_ROOT },
|
|
1495
|
-
allJobs: [],
|
|
1496
|
-
committedDuringRun: false,
|
|
1497
|
-
});
|
|
1498
|
-
assert.equal(verdict.verdict, 'pass_no_commit_already_shipped', `expected already-shipped exemption, got ${verdict.verdict}: ${verdict.reason}`);
|
|
1499
|
-
assert.equal(verdict.downgradeTo, null);
|
|
1500
|
-
} finally {
|
|
1501
|
-
rmdir(tmp);
|
|
1502
|
-
}
|
|
1503
|
-
});
|
|
1504
|
-
|
|
1505
|
-
// ─── pass_no_commit_prior_run_verified: re-fired slug whose PRIOR run landed ─
|
|
1506
|
-
// (incident: 812-workbench-review-nits-cleanup, 2026-07-31)
|
|
1507
|
-
|
|
1508
|
-
const { isAncestorCommit } = require('../runVerify.cjs');
|
|
1509
|
-
const REPO_ROOT_COMMIT = execFileSync('git', ['rev-list', '--max-parents=0', 'HEAD'], {
|
|
1510
|
-
cwd: REPO_ROOT, encoding: 'utf8',
|
|
1511
|
-
}).trim().split('\n')[0];
|
|
1512
|
-
|
|
1513
|
-
test('pass_no_commit: PASS, no commit, priorLandedCommit is an ancestor of HEAD → pass_no_commit_prior_run_verified', async () => {
|
|
1514
|
-
const tmp = makeTmpDir();
|
|
1515
|
-
try {
|
|
1516
|
-
const slug = '812-workbench-review-nits-cleanup';
|
|
1517
|
-
writeLog(tmp, slug, noOpRunEvents('Re-checked every AC item; all already implemented by an earlier run.\nSCHEDULER_VERDICT: PASS'));
|
|
1518
|
-
const prdPath = writePrd(tmp, slug, 'This PRD names no deliverable paths, just prose.');
|
|
1519
|
-
const verdict = await verifyRun({
|
|
1520
|
-
runDir: tmp,
|
|
1521
|
-
prdPath,
|
|
1522
|
-
queueEntry: { slug, status: 'running', cwd: REPO_ROOT },
|
|
1523
|
-
allJobs: [],
|
|
1524
|
-
committedDuringRun: false,
|
|
1525
|
-
priorLandedCommit: REPO_ROOT_COMMIT,
|
|
1526
|
-
});
|
|
1527
|
-
assert.equal(verdict.verdict, 'pass_no_commit_prior_run_verified', `expected prior-run exemption, got ${verdict.verdict}: ${verdict.reason}`);
|
|
1528
|
-
assert.equal(verdict.downgradeTo, null);
|
|
1529
|
-
assert.equal(verdict.priorLandedCommit, REPO_ROOT_COMMIT);
|
|
1530
|
-
} finally {
|
|
1531
|
-
rmdir(tmp);
|
|
1532
|
-
}
|
|
1533
|
-
});
|
|
1534
|
-
|
|
1535
|
-
test('pass_no_commit: PASS, no commit, priorLandedCommit is NOT an ancestor of HEAD → pass_no_commit', async () => {
|
|
1536
|
-
const tmp = makeTmpDir();
|
|
1537
|
-
try {
|
|
1538
|
-
const slug = '812-workbench-review-nits-cleanup';
|
|
1539
|
-
writeLog(tmp, slug, noOpRunEvents('Nothing to do here.\nSCHEDULER_VERDICT: PASS'));
|
|
1540
|
-
const prdPath = writePrd(tmp, slug, 'This PRD names no deliverable paths, just prose.');
|
|
1541
|
-
const verdict = await verifyRun({
|
|
1542
|
-
runDir: tmp,
|
|
1543
|
-
prdPath,
|
|
1544
|
-
queueEntry: { slug, status: 'running', cwd: REPO_ROOT },
|
|
1545
|
-
allJobs: [],
|
|
1546
|
-
committedDuringRun: false,
|
|
1547
|
-
priorLandedCommit: '0000000000000000000000000000000000000000',
|
|
1548
|
-
});
|
|
1549
|
-
assert.equal(verdict.verdict, 'pass_no_commit', `expected fallback to pass_no_commit, got ${verdict.verdict}: ${verdict.reason}`);
|
|
1550
|
-
} finally {
|
|
1551
|
-
rmdir(tmp);
|
|
1552
|
-
}
|
|
1553
|
-
});
|
|
1554
|
-
|
|
1555
|
-
test('isAncestorCommit: fail-safe on missing sha and on a throwing execImpl (git error)', () => {
|
|
1556
|
-
assert.equal(isAncestorCommit({ cwd: REPO_ROOT, sha: null }), false);
|
|
1557
|
-
assert.equal(isAncestorCommit({
|
|
1558
|
-
cwd: REPO_ROOT,
|
|
1559
|
-
sha: REPO_ROOT_COMMIT,
|
|
1560
|
-
execImpl: () => { throw new Error('git: command not found'); },
|
|
1561
|
-
}), false);
|
|
1562
|
-
assert.equal(isAncestorCommit({
|
|
1563
|
-
cwd: REPO_ROOT,
|
|
1564
|
-
sha: REPO_ROOT_COMMIT,
|
|
1565
|
-
execImpl: () => '',
|
|
1566
|
-
}), true);
|
|
1567
|
-
});
|
|
1568
|
-
|
|
1569
|
-
test('pass_no_commit: PASS, no commit, priorLandedCommit not supplied (null) → pass_no_commit (regression guard)', async () => {
|
|
1570
|
-
const tmp = makeTmpDir();
|
|
1571
|
-
try {
|
|
1572
|
-
const slug = '812-workbench-review-nits-cleanup';
|
|
1573
|
-
writeLog(tmp, slug, noOpRunEvents('Nothing to do here.\nSCHEDULER_VERDICT: PASS'));
|
|
1574
|
-
const prdPath = writePrd(tmp, slug, 'This PRD names no deliverable paths, just prose.');
|
|
1575
|
-
const verdict = await verifyRun({
|
|
1576
|
-
runDir: tmp,
|
|
1577
|
-
prdPath,
|
|
1578
|
-
queueEntry: { slug, status: 'running', cwd: REPO_ROOT },
|
|
1579
|
-
allJobs: [],
|
|
1580
|
-
committedDuringRun: false,
|
|
1581
|
-
});
|
|
1582
|
-
assert.equal(verdict.verdict, 'pass_no_commit', `expected pass_no_commit with no priorLandedCommit, got ${verdict.verdict}: ${verdict.reason}`);
|
|
1583
|
-
} finally {
|
|
1584
|
-
rmdir(tmp);
|
|
1585
|
-
}
|
|
1586
|
-
});
|
|
1587
|
-
|
|
1588
|
-
// (e) halt + sentinel PASS → still halt (override must not apply to halt)
|
|
1589
|
-
test('halt result + sentinel PASS + committedDuringRun:true → still halt', async () => {
|
|
1590
|
-
const tmp = makeTmpDir();
|
|
1591
|
-
try {
|
|
1592
|
-
const slug = '77-halt-sentinel-pass';
|
|
1593
|
-
const logEvents = [
|
|
1594
|
-
{
|
|
1595
|
-
type: 'assistant',
|
|
1596
|
-
message: {
|
|
1597
|
-
role: 'assistant',
|
|
1598
|
-
content: [{
|
|
1599
|
-
type: 'tool_use',
|
|
1600
|
-
id: 'toolu_halt_001',
|
|
1601
|
-
name: 'Bash',
|
|
1602
|
-
input: { command: 'check deps', description: 'Check prerequisites' },
|
|
1603
|
-
}],
|
|
1604
|
-
},
|
|
1605
|
-
},
|
|
1606
|
-
{
|
|
1607
|
-
type: 'user',
|
|
1608
|
-
message: {
|
|
1609
|
-
role: 'user',
|
|
1610
|
-
content: [{
|
|
1611
|
-
type: 'tool_result',
|
|
1612
|
-
tool_use_id: 'toolu_halt_001',
|
|
1613
|
-
content: 'dep not ready',
|
|
1614
|
-
is_error: false,
|
|
1615
|
-
}],
|
|
1616
|
-
},
|
|
1617
|
-
},
|
|
1618
|
-
{
|
|
1619
|
-
type: 'result',
|
|
1620
|
-
subtype: 'success',
|
|
1621
|
-
result: 'HALT: prerequisite not met\nSCHEDULER_VERDICT: PASS',
|
|
1622
|
-
},
|
|
1623
|
-
];
|
|
1624
|
-
writeLog(tmp, slug, logEvents);
|
|
1625
|
-
const prdPath = writePrd(tmp, slug, '# Halt with sentinel');
|
|
1626
|
-
const verdict = await verifyRun({
|
|
1627
|
-
runDir: tmp,
|
|
1628
|
-
prdPath,
|
|
1629
|
-
queueEntry: { slug, status: 'running' },
|
|
1630
|
-
allJobs: [],
|
|
1631
|
-
committedDuringRun: true,
|
|
1632
|
-
});
|
|
1633
|
-
assert.equal(verdict.verdict, 'halt', `halt must survive even with PASS sentinel, got ${verdict.verdict}: ${verdict.reason}`);
|
|
1634
|
-
assert.equal(verdict.downgradeTo, 'pending');
|
|
1635
|
-
} finally {
|
|
1636
|
-
rmdir(tmp);
|
|
1637
|
-
}
|
|
1638
|
-
});
|
|
1639
|
-
|
|
1640
|
-
// ─── -merge-main postcondition exemption tests (2026-07-18 feedback) ──────────
|
|
1641
|
-
|
|
1642
|
-
const { isMergeMainSlug, extractMergeMainPrNumber } = require('../runVerify.cjs');
|
|
1643
|
-
|
|
1644
|
-
test('isMergeMainSlug matches the NN-prXXX-merge-main and NN-fix-prXXX-merge-main conventions', () => {
|
|
1645
|
-
assert.equal(isMergeMainSlug('565-pr188-merge-main'), true);
|
|
1646
|
-
assert.equal(isMergeMainSlug('571-fix-pr141-merge-main'), true);
|
|
1647
|
-
assert.equal(isMergeMainSlug('523-fix-bounded-fix-plan-retry'), false);
|
|
1648
|
-
assert.equal(isMergeMainSlug('406-capture-panel-ui'), false);
|
|
1649
|
-
assert.equal(isMergeMainSlug(''), false);
|
|
1650
|
-
assert.equal(isMergeMainSlug(undefined), false);
|
|
1651
|
-
});
|
|
1652
|
-
|
|
1653
|
-
test('extractMergeMainPrNumber prefers "PR #<n>" in text, falls back to slug', () => {
|
|
1654
|
-
assert.equal(extractMergeMainPrNumber('565-pr188-merge-main', 'title: Merge current main into sigma PR #188 (round 2)'), 188);
|
|
1655
|
-
assert.equal(extractMergeMainPrNumber('565-pr188-merge-main', 'no pr mention here'), 188);
|
|
1656
|
-
assert.equal(extractMergeMainPrNumber('non-standard-slug', 'no pr mention here'), null);
|
|
1657
|
-
});
|
|
1658
|
-
|
|
1659
|
-
// (1) -merge-main + PASS + no commit + gh reports MERGEABLE/non-CONFLICTING → verified, no issue
|
|
1660
|
-
test('merge-main exemption: gh reports MERGEABLE → pass_no_commit_target_verified, no issue pushed', async () => {
|
|
1661
|
-
const tmp = makeTmpDir();
|
|
1662
|
-
try {
|
|
1663
|
-
const slug = '565-pr188-merge-main';
|
|
1664
|
-
writeLog(tmp, slug, noOpRunEvents('PR #188 was already merged into main by another actor.\nSCHEDULER_VERDICT: PASS'));
|
|
1665
|
-
const prdPath = writePrd(tmp, slug, '# Merge current main into sigma PR #188');
|
|
1666
|
-
let ghCalls = 0;
|
|
1667
|
-
const ghExecImpl = (cmd, args, opts) => {
|
|
1668
|
-
ghCalls++;
|
|
1669
|
-
assert.equal(cmd, 'gh');
|
|
1670
|
-
assert.deepEqual(args, ['pr', 'view', '188', '--json', 'mergeable,mergeStateStatus']);
|
|
1671
|
-
assert.equal(opts.cwd, '/tmp/sigma');
|
|
1672
|
-
return JSON.stringify({ mergeable: 'MERGEABLE', mergeStateStatus: 'BEHIND' });
|
|
1673
|
-
};
|
|
1674
|
-
const verdict = await verifyRun({
|
|
1675
|
-
runDir: tmp,
|
|
1676
|
-
prdPath,
|
|
1677
|
-
queueEntry: { slug, status: 'running', cwd: '/tmp/sigma' },
|
|
1678
|
-
allJobs: [],
|
|
1679
|
-
committedDuringRun: false,
|
|
1680
|
-
ghExecImpl,
|
|
1681
|
-
});
|
|
1682
|
-
assert.equal(ghCalls, 1);
|
|
1683
|
-
assert.equal(verdict.verdict, 'pass_no_commit_target_verified', `expected verified verdict, got ${verdict.verdict}: ${verdict.reason}`);
|
|
1684
|
-
assert.equal(verdict.downgradeTo, null);
|
|
1685
|
-
assert.equal(verdict.verifiedPrNumber, 188);
|
|
1686
|
-
} finally {
|
|
1687
|
-
rmdir(tmp);
|
|
1688
|
-
}
|
|
1689
|
-
});
|
|
1690
|
-
|
|
1691
|
-
// (2) -merge-main + PASS + no commit + gh reports CONFLICTING → falls through to pass_no_commit
|
|
1692
|
-
test('merge-main exemption: gh reports CONFLICTING → falls through to pass_no_commit', async () => {
|
|
1693
|
-
const tmp = makeTmpDir();
|
|
1694
|
-
try {
|
|
1695
|
-
const slug = '565-pr188-merge-main';
|
|
1696
|
-
writeLog(tmp, slug, noOpRunEvents('PR #188 needs no further work.\nSCHEDULER_VERDICT: PASS'));
|
|
1697
|
-
const prdPath = writePrd(tmp, slug, '# Merge current main into sigma PR #188');
|
|
1698
|
-
const ghExecImpl = () => JSON.stringify({ mergeable: 'MERGEABLE', mergeStateStatus: 'CONFLICTING' });
|
|
1699
|
-
const verdict = await verifyRun({
|
|
1700
|
-
runDir: tmp,
|
|
1701
|
-
prdPath,
|
|
1702
|
-
queueEntry: { slug, status: 'running', cwd: '/tmp/sigma' },
|
|
1703
|
-
allJobs: [],
|
|
1704
|
-
committedDuringRun: false,
|
|
1705
|
-
ghExecImpl,
|
|
1706
|
-
});
|
|
1707
|
-
assert.equal(verdict.verdict, 'pass_no_commit', `expected fallback to pass_no_commit, got ${verdict.verdict}: ${verdict.reason}`);
|
|
1708
|
-
assert.equal(verdict.downgradeTo, 'needs_review');
|
|
1709
|
-
} finally {
|
|
1710
|
-
rmdir(tmp);
|
|
1711
|
-
}
|
|
1712
|
-
});
|
|
1713
|
-
|
|
1714
|
-
// (3) -merge-main + PASS + no commit + gh call fails/times out → falls through to pass_no_commit, never throws
|
|
1715
|
-
test('merge-main exemption: gh call throws → falls through to pass_no_commit, never throws', async () => {
|
|
1716
|
-
const tmp = makeTmpDir();
|
|
1717
|
-
try {
|
|
1718
|
-
const slug = '565-pr188-merge-main';
|
|
1719
|
-
writeLog(tmp, slug, noOpRunEvents('PR #188 needs no further work.\nSCHEDULER_VERDICT: PASS'));
|
|
1720
|
-
const prdPath = writePrd(tmp, slug, '# Merge current main into sigma PR #188');
|
|
1721
|
-
const ghExecImpl = () => { throw new Error('gh: command not found'); };
|
|
1722
|
-
const verdict = await verifyRun({
|
|
1723
|
-
runDir: tmp,
|
|
1724
|
-
prdPath,
|
|
1725
|
-
queueEntry: { slug, status: 'running', cwd: '/tmp/sigma' },
|
|
1726
|
-
allJobs: [],
|
|
1727
|
-
committedDuringRun: false,
|
|
1728
|
-
ghExecImpl,
|
|
1729
|
-
});
|
|
1730
|
-
assert.equal(verdict.verdict, 'pass_no_commit', `expected fallback to pass_no_commit, got ${verdict.verdict}: ${verdict.reason}`);
|
|
1731
|
-
assert.equal(verdict.downgradeTo, 'needs_review');
|
|
1732
|
-
} finally {
|
|
1733
|
-
rmdir(tmp);
|
|
1734
|
-
}
|
|
1735
|
-
});
|
|
1736
|
-
|
|
1737
|
-
// (4) non-merge-main slug, PASS + no commit → unchanged pass_no_commit behavior, zero gh invocations
|
|
1738
|
-
test('merge-main exemption: non-merge-main slug never attempts a gh call', async () => {
|
|
1739
|
-
const tmp = makeTmpDir();
|
|
1740
|
-
try {
|
|
1741
|
-
const slug = '406-capture-panel-ui';
|
|
1742
|
-
writeLog(tmp, slug, noOpRunEvents('All acceptance criteria verified.\nSCHEDULER_VERDICT: PASS'));
|
|
1743
|
-
const prdPath = writePrd(tmp, slug, '# Browser capture panel UI');
|
|
1744
|
-
let ghCalls = 0;
|
|
1745
|
-
const ghExecImpl = () => { ghCalls++; return JSON.stringify({ mergeable: 'MERGEABLE', mergeStateStatus: 'CLEAN' }); };
|
|
1746
|
-
const verdict = await verifyRun({
|
|
1747
|
-
runDir: tmp,
|
|
1748
|
-
prdPath,
|
|
1749
|
-
queueEntry: { slug, status: 'running', cwd: '/tmp/proj' },
|
|
1750
|
-
allJobs: [],
|
|
1751
|
-
committedDuringRun: false,
|
|
1752
|
-
ghExecImpl,
|
|
1753
|
-
});
|
|
1754
|
-
assert.equal(ghCalls, 0, 'gh must never be invoked for a non-merge-main slug');
|
|
1755
|
-
assert.equal(verdict.verdict, 'pass_no_commit', `expected unchanged pass_no_commit, got ${verdict.verdict}: ${verdict.reason}`);
|
|
1756
|
-
assert.equal(verdict.downgradeTo, 'needs_review');
|
|
1757
|
-
} finally {
|
|
1758
|
-
rmdir(tmp);
|
|
1759
|
-
}
|
|
1760
|
-
});
|
|
1761
|
-
|
|
1762
|
-
// (5) -merge-main slug but a real commit DID land → unaffected, path unreachable, zero gh invocations
|
|
1763
|
-
test('merge-main exemption: commit landed → path unreachable, zero gh invocations, verdict clean', async () => {
|
|
1764
|
-
const tmp = makeTmpDir();
|
|
1765
|
-
try {
|
|
1766
|
-
const slug = '565-pr188-merge-main';
|
|
1767
|
-
writeLog(tmp, slug, noOpRunEvents('Merged and pushed.\nSCHEDULER_VERDICT: PASS'));
|
|
1768
|
-
const prdPath = writePrd(tmp, slug, '# Merge current main into sigma PR #188');
|
|
1769
|
-
let ghCalls = 0;
|
|
1770
|
-
const ghExecImpl = () => { ghCalls++; return JSON.stringify({ mergeable: 'MERGEABLE', mergeStateStatus: 'CLEAN' }); };
|
|
1771
|
-
const verdict = await verifyRun({
|
|
1772
|
-
runDir: tmp,
|
|
1773
|
-
prdPath,
|
|
1774
|
-
queueEntry: { slug, status: 'running', cwd: '/tmp/sigma' },
|
|
1775
|
-
allJobs: [],
|
|
1776
|
-
committedDuringRun: true,
|
|
1777
|
-
ghExecImpl,
|
|
1778
|
-
});
|
|
1779
|
-
assert.equal(ghCalls, 0, 'gh must never be invoked when a commit already landed');
|
|
1780
|
-
assert.equal(verdict.verdict, 'clean', `expected clean (commit landed, sentinel PASS), got ${verdict.verdict}: ${verdict.reason}`);
|
|
1781
|
-
} finally {
|
|
1782
|
-
rmdir(tmp);
|
|
1783
|
-
}
|
|
1784
|
-
});
|