@tea-agent/loop-agent 0.25.5 → 0.26.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (173) hide show
  1. package/AGENTS.md +2 -1
  2. package/CHANGELOG.md +1020 -986
  3. package/bin/loop-agent.js +21 -21
  4. package/dist/commands/cursor-prompt.js +6 -6
  5. package/dist/commands/init.js +68 -129
  6. package/dist/commands/loop-benchmark.js +11 -11
  7. package/dist/commands/pi-reuse-benchmark.js +16 -16
  8. package/dist/executors/dag-pi-executor.js +26 -20
  9. package/dist/executors/model-routing.js +34 -18
  10. package/dist/executors/shell-executor.js +1 -1
  11. package/dist/governance/manifest-types.js +33 -5
  12. package/dist/sidecars/cursor-prompt/executor.js +1 -1
  13. package/dist/task/task-demand-routing.js +3 -1
  14. package/dist/worker/console/chat/model-resolver.js +15 -3
  15. package/dist/worker/observe/static/constants.js +3 -2
  16. package/dist/worker/observe/static/copy.js +67 -67
  17. package/dist/worker/observe/static/dag-layout.d.ts +31 -31
  18. package/dist/worker/observe/static/dag-layout.js +83 -83
  19. package/dist/worker/observe/static/dag-model.js +1 -0
  20. package/dist/worker/observe/static/dom.js +220 -220
  21. package/dist/worker/observe/static/relations.js +133 -133
  22. package/dist/worker/observe/static/router.js +93 -93
  23. package/dist/worker/observe/static/run-processing.js +148 -148
  24. package/dist/worker/observe/static/styles.css +182 -42
  25. package/dist/worker/observe/static/views/batch.js +227 -227
  26. package/dist/worker/observe/static/views/dag-graph.js +172 -172
  27. package/dist/worker/observe/static/views/failures.js +143 -143
  28. package/dist/worker/observe/static/views/feature.js +492 -492
  29. package/dist/worker/observe/static/views/run.js +453 -453
  30. package/dist/worker/observe/static/views/shell.js +7 -7
  31. package/dist/worker/observe/static/views/timeline.js +163 -163
  32. package/dist/workflows/dag/backend-test-case-coverage-analysis.js +362 -45
  33. package/dist/workflows/dag/backend-test-case-manifest.js +20 -0
  34. package/dist/workflows/dag/backend-test-markdown-workflow.js +17 -0
  35. package/dist/workflows/dag/canvas-observer.js +275 -275
  36. package/dist/workflows/dag/init-hybrid.js +18 -15
  37. package/dist/workflows/dag/lifecycle.js +40 -30
  38. package/dist/workflows/dag/node-execution.js +13 -0
  39. package/dist/workflows/dag/types.js +59 -19
  40. package/docs/init-surface.manifest.json +3 -1
  41. package/docs/skills/README.md +7 -7
  42. package/docs/templates/README.md +1 -0
  43. package/docs/templates/adr.md +60 -60
  44. package/docs/templates/agent-dag-authority-surface-audit.prompt.md +94 -94
  45. package/docs/templates/agent-dag-decision-envelope.schema.json +213 -213
  46. package/docs/templates/agent-dag-decision-gate.prompt.md +246 -246
  47. package/docs/templates/agent-dag-process-supervisor.prompt.md +98 -98
  48. package/docs/templates/agent-dag-report.schema.json +473 -473
  49. package/docs/templates/agent-dag-review-verdict.prompt.md +68 -68
  50. package/docs/templates/backend-test-dag.json +9 -9
  51. package/docs/templates/backend-test-result.schema.json +99 -99
  52. package/docs/templates/feature-spec.md +53 -53
  53. package/docs/templates/frontend-design-contract.md +42 -42
  54. package/docs/templates/frontend-eval/fixtures/failures/01-type-build-error.md +17 -17
  55. package/docs/templates/frontend-eval/fixtures/failures/02-unit-component-test-fail.md +16 -16
  56. package/docs/templates/frontend-eval/fixtures/failures/03-fixture-schema-drift.md +16 -16
  57. package/docs/templates/frontend-eval/fixtures/failures/04-missing-loading-empty-error-state.md +16 -16
  58. package/docs/templates/frontend-eval/fixtures/failures/05-forbidden-write-writeset-expansion.md +16 -16
  59. package/docs/templates/frontend-eval/fixtures/failures/06-unapproved-dependency-add.md +16 -16
  60. package/docs/templates/frontend-eval/fixtures/failures/07-mock-production-on.md +21 -21
  61. package/docs/templates/frontend-eval/fixtures/functional/01-simple-component-style.md +29 -29
  62. package/docs/templates/frontend-eval/fixtures/functional/02-form-validation.md +28 -28
  63. package/docs/templates/frontend-eval/fixtures/functional/03-list-detail-page.md +28 -28
  64. package/docs/templates/frontend-eval/fixtures/functional/04-api-mock.md +29 -29
  65. package/docs/templates/frontend-eval/fixtures/functional/05-permission-auth-gated-ui.md +27 -27
  66. package/docs/templates/frontend-eval/fixtures/functional/06-ssr-server-client-boundary.md +28 -28
  67. package/docs/templates/frontend-eval/fixtures/functional/07-shared-public-component-api.md +28 -28
  68. package/docs/templates/frontend-eval/fixtures/functional/08-pure-local-no-remote.md +27 -27
  69. package/docs/templates/frontend-eval/metrics.md +138 -138
  70. package/docs/templates/frontend-eval/smoke-targets.md +53 -53
  71. package/docs/templates/frontend-task-constraints.md +35 -35
  72. package/docs/templates/frontend-task-requirement.md +70 -70
  73. package/docs/templates/harness.schema.json +29 -7
  74. package/docs/templates/init-evolution-review.md +35 -35
  75. package/docs/templates/init-managed-agents.md +137 -0
  76. package/docs/templates/interactive-ui-round2-experiment.md +66 -66
  77. package/docs/templates/knowledge-graph-bootstrap-dag.json +118 -118
  78. package/docs/templates/knowledge-sync-dag.json +178 -178
  79. package/docs/templates/knowledge-sync-draft.schema.json +71 -71
  80. package/docs/templates/product-line/closeout.yaml +9 -9
  81. package/docs/templates/product-line/design.md +13 -13
  82. package/docs/templates/product-line/links.md +10 -10
  83. package/docs/templates/product-line/requirement.md +17 -17
  84. package/docs/templates/product-line/test-plan.md +7 -7
  85. package/docs/templates/production-readiness-checklist.md +57 -57
  86. package/docs/templates/project-start-checklist.md +9 -9
  87. package/docs/templates/qa-report.md +48 -48
  88. package/docs/templates/sprint-contract.md +29 -29
  89. package/docs/templates/worker-dogfood-evidence.md +80 -80
  90. package/docs/templates/worker-dogfood-setup.md +68 -68
  91. package/harness.json +1 -2
  92. package/package.json +1 -1
  93. package/scripts/kb-bootstrap-init-skeleton.sh +0 -0
  94. package/scripts/kb-graph-incremental-prepare.mjs +386 -386
  95. package/scripts/kb-graph-materialize.mjs +105 -105
  96. package/scripts/kb-graph-promote.mjs +164 -164
  97. package/scripts/kb-query.mjs +554 -554
  98. package/skills/ai-engineering-context/SKILL.md +48 -48
  99. package/skills/analyze-product-dependencies/SKILL.md +67 -67
  100. package/skills/analyze-product-dependencies/agents/openai.yaml +4 -4
  101. package/skills/analyze-product-dependencies/references/api-documentation-schema.md +30 -30
  102. package/skills/analyze-product-dependencies/references/dependency-analysis-schema.md +28 -28
  103. package/skills/analyze-product-dependencies/references/example.md +76 -76
  104. package/skills/analyze-product-dependencies/references/forward-test-cases.md +35 -35
  105. package/skills/analyze-product-dependencies/references/input-contract.md +11 -11
  106. package/skills/analyze-product-dependencies/references/scouting-rules.md +61 -61
  107. package/skills/analyze-product-dependencies/scripts/test-validators.mjs +267 -267
  108. package/skills/analyze-product-dependencies/scripts/validate-api-documentation.mjs +101 -101
  109. package/skills/analyze-product-dependencies/scripts/validate-dependency-analysis.mjs +142 -142
  110. package/skills/analyze-product-dependencies/scripts/validate-product-requirement-input.mjs +76 -76
  111. package/skills/analyze-product-dependencies/scripts/validation-helpers.mjs +146 -146
  112. package/skills/analyze-product-requirements/SKILL.md +90 -90
  113. package/skills/analyze-product-requirements/agents/openai.yaml +4 -4
  114. package/skills/analyze-product-requirements/references/acceptance-criteria.md +91 -91
  115. package/skills/analyze-product-requirements/references/clarification-and-knowledge.md +56 -56
  116. package/skills/analyze-product-requirements/references/example.md +86 -86
  117. package/skills/analyze-product-requirements/references/forward-test-cases.md +66 -66
  118. package/skills/analyze-product-requirements/references/product-analysis-schema.md +32 -32
  119. package/skills/analyze-product-requirements/references/product-requirement-schema.md +33 -33
  120. package/skills/analyze-product-requirements/references/requirement-clarification-schema.md +35 -35
  121. package/skills/analyze-product-requirements/scripts/test-validators.mjs +193 -193
  122. package/skills/analyze-product-requirements/scripts/validate-product-analysis.mjs +69 -69
  123. package/skills/analyze-product-requirements/scripts/validate-product-requirement.mjs +97 -97
  124. package/skills/analyze-product-requirements/scripts/validate-requirement-clarification.mjs +98 -98
  125. package/skills/analyze-product-requirements/scripts/validation-helpers.mjs +156 -156
  126. package/skills/browser-tools/browser-content.js +103 -103
  127. package/skills/browser-tools/browser-cookies.js +35 -35
  128. package/skills/browser-tools/browser-eval.js +53 -53
  129. package/skills/browser-tools/browser-hn-scraper.js +108 -108
  130. package/skills/browser-tools/browser-nav.js +44 -44
  131. package/skills/browser-tools/browser-pick.js +162 -162
  132. package/skills/browser-tools/browser-screenshot.js +34 -34
  133. package/skills/browser-tools/browser-start.js +86 -86
  134. package/skills/browser-tools/package-lock.json +2556 -2556
  135. package/skills/browser-tools/package.json +19 -19
  136. package/skills/code-review-core/SKILL.md +20 -20
  137. package/skills/codebase-scout/SKILL.md +19 -19
  138. package/skills/grill-me/SKILL.md +10 -10
  139. package/skills/loop-agent/references/README.md +67 -67
  140. package/skills/loop-agent/references/command-reference.md +5 -4
  141. package/skills/loop-agent/references/docs-converge.md +126 -126
  142. package/skills/loop-agent/references/hybrid-dag.md +2 -2
  143. package/skills/loop-agent/references/learned/README.md +21 -21
  144. package/skills/loop-agent/references/long-running-loop.md +57 -57
  145. package/skills/loop-agent/references/model-routing.md +2 -0
  146. package/skills/loop-agent/references/one-shot-runs.md +85 -85
  147. package/skills/loop-agent/references/pi-prompt.md +23 -23
  148. package/skills/loop-agent/references/pi-subagent-assisted-mode.md +84 -84
  149. package/skills/playwright-cli/SKILL.md +420 -420
  150. package/skills/playwright-cli/references/element-attributes.md +23 -23
  151. package/skills/playwright-cli/references/playwright-tests.md +39 -39
  152. package/skills/playwright-cli/references/request-mocking.md +87 -87
  153. package/skills/playwright-cli/references/running-code.md +241 -241
  154. package/skills/playwright-cli/references/session-management.md +225 -225
  155. package/skills/playwright-cli/references/storage-state.md +275 -275
  156. package/skills/playwright-cli/references/test-generation.md +433 -433
  157. package/skills/playwright-cli/references/tracing.md +139 -139
  158. package/skills/playwright-cli/references/video-recording.md +143 -143
  159. package/skills/requesting-code-review/SKILL.md +101 -101
  160. package/skills/requesting-code-review/code-reviewer.md +168 -168
  161. package/skills/systematic-debugging/CREATION-LOG.md +119 -119
  162. package/skills/systematic-debugging/condition-based-waiting-example.ts +158 -158
  163. package/skills/systematic-debugging/condition-based-waiting.md +115 -115
  164. package/skills/systematic-debugging/defense-in-depth.md +122 -122
  165. package/skills/systematic-debugging/find-polluter.sh +63 -63
  166. package/skills/systematic-debugging/root-cause-tracing.md +169 -169
  167. package/skills/systematic-debugging/test-academic.md +14 -14
  168. package/skills/systematic-debugging/test-pressure-1.md +58 -58
  169. package/skills/systematic-debugging/test-pressure-2.md +68 -68
  170. package/skills/systematic-debugging/test-pressure-3.md +69 -69
  171. package/skills/using-git-worktrees/SKILL.md +215 -215
  172. package/skills/verification-before-completion/SKILL.md +154 -154
  173. package/skills/webapp-testing/SKILL.md +19 -19
@@ -1,80 +1,80 @@
1
- # Worker Dogfood Evidence
2
-
3
- ## Sample identity
4
-
5
- | Field | Value |
6
- |---|---|
7
- | Date | |
8
- | Feature / Task | |
9
- | Target repo | disposable path or sanitized reference |
10
- | Controller package/version | |
11
- | Agent-worker package/version (same npm install) | |
12
- | Controller requested entry / real entry | sanitized reference; keep machine-local absolute value in runtime evidence |
13
- | Controller launch command / args prefix | sanitized reference |
14
- | Controller binary SHA-256 | |
15
- | Controller package fingerprint | `sha256:<hex>` |
16
- | Expected controller version / fingerprint | n/a / exact values |
17
- | Provider/model / override | |
18
- | Batch ID | |
19
- | Worker run ID | |
20
- | Retry of worker run ID | n/a / |
21
- | Candidate commit / tarball SHA-256 | n/a / |
22
-
23
- ## Baseline
24
-
25
- - Baseline commit and `git status`:
26
- - Existing failing behavior or missing capability:
27
- - Preflight (`loop-agent --version`, `inspect`, `docs audit`, `check-repo`):
28
-
29
- ## Run evidence
30
-
31
- | Artifact | Path / link | Result |
32
- |---|---|---|
33
- | TaskSpec / source-doc copies | | |
34
- | DAG spec | | |
35
- | DAG report JSON / Markdown | | |
36
- | DAG skill snapshot ref / SHA-256 / mode | | |
37
- | shell verification | | |
38
- | diff | | |
39
- | closeout or Failure Handoff | | |
40
- | morning report | | |
41
- | Observe snapshot / events | | |
42
- | Controller identity in Worker / Task Pool / batch / Feature evidence | | |
43
-
44
- ## Candidate takeover evidence (if applicable)
45
-
46
- | Field | Value / result |
47
- |---|---|
48
- | Candidate isolated slot containment | |
49
- | `loop-agent` entry / binary SHA-256 / reported version | |
50
- | `agent-worker` entry / binary SHA-256 / reported version | |
51
- | Shared package fingerprint | |
52
- | Full init / doctor / inspect / docs audit / target check-repo | |
53
- | `agent-worker` skill and `.agents/skills` mirror hashes | |
54
- | Feature validation / `feature run --dry-run` | |
55
- | DAG executors | expected: `static`, `shell` only |
56
- | PATH trap invocations | expected: none |
57
- | Pi/model executor observed | expected: false; derive from actual DAG nodes |
58
- | Feature dry-run executed tasks | expected: empty |
59
- | Canary verdict / evidence path | |
60
-
61
- Do not use a deterministic canary result as proof that live Pi/model/provider execution succeeded. Record run-owned skill snapshot evidence and any explicitly authorized live run separately.
62
-
63
- ## Acceptance and QA coverage
64
-
65
- | Acceptance | Test case(s) | Test file / verification | Result |
66
- |---|---|---|---|
67
- | | | | |
68
-
69
- ## Failure / retry (if applicable)
70
-
71
- | Raw failure | Product-line category | Recommended follow-up | Root cause evidence | Retry result |
72
- |---|---|---|---|---|
73
- | | | | | |
74
-
75
- ## Conclusion
76
-
77
- - Verdict: pass / fail / blocked
78
- - Review notes:
79
- - Follow-up task(s):
80
- - Evidence limitations (for example deterministic-only, no Pi executor/live takeover):
1
+ # Worker Dogfood Evidence
2
+
3
+ ## Sample identity
4
+
5
+ | Field | Value |
6
+ |---|---|
7
+ | Date | |
8
+ | Feature / Task | |
9
+ | Target repo | disposable path or sanitized reference |
10
+ | Controller package/version | |
11
+ | Agent-worker package/version (same npm install) | |
12
+ | Controller requested entry / real entry | sanitized reference; keep machine-local absolute value in runtime evidence |
13
+ | Controller launch command / args prefix | sanitized reference |
14
+ | Controller binary SHA-256 | |
15
+ | Controller package fingerprint | `sha256:<hex>` |
16
+ | Expected controller version / fingerprint | n/a / exact values |
17
+ | Provider/model / override | |
18
+ | Batch ID | |
19
+ | Worker run ID | |
20
+ | Retry of worker run ID | n/a / |
21
+ | Candidate commit / tarball SHA-256 | n/a / |
22
+
23
+ ## Baseline
24
+
25
+ - Baseline commit and `git status`:
26
+ - Existing failing behavior or missing capability:
27
+ - Preflight (`loop-agent --version`, `inspect`, `docs audit`, `check-repo`):
28
+
29
+ ## Run evidence
30
+
31
+ | Artifact | Path / link | Result |
32
+ |---|---|---|
33
+ | TaskSpec / source-doc copies | | |
34
+ | DAG spec | | |
35
+ | DAG report JSON / Markdown | | |
36
+ | DAG skill snapshot ref / SHA-256 / mode | | |
37
+ | shell verification | | |
38
+ | diff | | |
39
+ | closeout or Failure Handoff | | |
40
+ | morning report | | |
41
+ | Observe snapshot / events | | |
42
+ | Controller identity in Worker / Task Pool / batch / Feature evidence | | |
43
+
44
+ ## Candidate takeover evidence (if applicable)
45
+
46
+ | Field | Value / result |
47
+ |---|---|
48
+ | Candidate isolated slot containment | |
49
+ | `loop-agent` entry / binary SHA-256 / reported version | |
50
+ | `agent-worker` entry / binary SHA-256 / reported version | |
51
+ | Shared package fingerprint | |
52
+ | Full init / doctor / inspect / docs audit / target check-repo | |
53
+ | `agent-worker` skill and `.agents/skills` mirror hashes | |
54
+ | Feature validation / `feature run --dry-run` | |
55
+ | DAG executors | expected: `static`, `shell` only |
56
+ | PATH trap invocations | expected: none |
57
+ | Pi/model executor observed | expected: false; derive from actual DAG nodes |
58
+ | Feature dry-run executed tasks | expected: empty |
59
+ | Canary verdict / evidence path | |
60
+
61
+ Do not use a deterministic canary result as proof that live Pi/model/provider execution succeeded. Record run-owned skill snapshot evidence and any explicitly authorized live run separately.
62
+
63
+ ## Acceptance and QA coverage
64
+
65
+ | Acceptance | Test case(s) | Test file / verification | Result |
66
+ |---|---|---|---|
67
+ | | | | |
68
+
69
+ ## Failure / retry (if applicable)
70
+
71
+ | Raw failure | Product-line category | Recommended follow-up | Root cause evidence | Retry result |
72
+ |---|---|---|---|---|
73
+ | | | | | |
74
+
75
+ ## Conclusion
76
+
77
+ - Verdict: pass / fail / blocked
78
+ - Review notes:
79
+ - Follow-up task(s):
80
+ - Evidence limitations (for example deterministic-only, no Pi executor/live takeover):
@@ -1,68 +1,68 @@
1
- # Worker Dogfood Setup Template
2
-
3
- Use this template to create a disposable target repository for a real `agent-worker` sample. It is deliberately a target-repo recipe, not a substitute for product requirements.
4
-
5
- ## Preconditions
6
-
7
- - Install one published controller version and record it:
8
-
9
- ```bash
10
- npm install -g @tea-agent/loop-agent@<version>
11
- npm list -g @tea-agent/loop-agent --depth=0
12
- loop-agent --version
13
- agent-worker --version
14
- agent-worker --help
15
- ```
16
-
17
- - Before any write-capable Worker command, resolve one controller identity for the batch. Record its package version, absolute launch entry, binary SHA-256, and portable package fingerprint. If the run is part of a release or self-hosting train, carry the expected version/fingerprint as explicit CLI gates.
18
- - Create a clean, disposable target repository. Do not use `npm link`, `npm run dev`, or a workspace controller for a real-evidence run.
19
- - Put requirement, acceptance, design, test plan, and QA case matrix next to the TaskSpec. `agent-worker` materializes immutable copies into the harness task source before DAG generation.
20
-
21
- ## Setup checklist
22
-
23
- - [ ] Target has a committed baseline and a passing `loop-agent init --profile full --merge` preflight.
24
- - [ ] Existing test demonstrates the desired behavior is missing or unimplemented.
25
- - [ ] TaskSpec has narrow `allowed_paths` and explicit `forbidden_paths`.
26
- - [ ] Task Pool dependencies are either backed by real prior runs or intentionally recorded as pre-existing evidence.
27
- - [ ] The chosen model/provider and `--pi-model` smoke override, if any, are recorded.
28
- - [ ] `--loop-agent-bin` resolves to the intended published package, and expected controller version/fingerprint are recorded before target writes.
29
- - [ ] If this is a self-hosting run, published N remains fixed for the whole batch; candidate N+1 is installed and verified in a separate slot.
30
-
31
- ## Execute
32
-
33
- ```bash
34
- agent-worker batch run-ready \
35
- --feature-dir <feature-dir> \
36
- --repo <target-repo> \
37
- --loop-agent-bin <published-loop-agent-entry> \
38
- --expected-controller-version <version> \
39
- --expected-controller-fingerprint <sha256:value> \
40
- --limit 1 \
41
- --check-repo \
42
- [--pi-model <model>]
43
-
44
- agent-worker observe snapshot --repo <target-repo> > <evidence-dir>/observe-snapshot.json
45
- agent-worker report morning --repo <target-repo> --output <evidence-dir>/morning-report.md
46
- ```
47
-
48
- For a failed task, do not delete state or alter JSONL evidence. Fix the external/root cause, then make the retry explicit:
49
-
50
- ```bash
51
- agent-worker task retry <task-id> --repo <target-repo> --reason "<root cause corrected>"
52
- agent-worker batch run-ready --feature-dir <feature-dir> --repo <target-repo> --limit 1 --check-repo
53
- ```
54
-
55
- The retry run must have a distinct `workerRunId` and retain `retryOfWorkerRunId` in its Task Pool evidence.
56
-
57
- ## Versioned self-hosting takeover
58
-
59
- From a source checkout, use the repo-maintainer deterministic canary after building or packing candidate N+1:
60
-
61
- ```bash
62
- npm run self-host:canary -- \
63
- --deterministic \
64
- --tarball <candidate.tgz> \
65
- --output <candidate-canary-evidence.json>
66
- ```
67
-
68
- The deterministic canary must prove isolated-slot containment, both candidate bin identities, package fingerprint, full init/governance checks, a zero-execution Feature dry-run, static/shell-only observed DAG executors, and no PATH controller fallback. It does not claim to trap every possible Pi SDK/absolute path and does not replace a separately authorized live Pi run or the DAG skill-snapshot tests.
1
+ # Worker Dogfood Setup Template
2
+
3
+ Use this template to create a disposable target repository for a real `agent-worker` sample. It is deliberately a target-repo recipe, not a substitute for product requirements.
4
+
5
+ ## Preconditions
6
+
7
+ - Install one published controller version and record it:
8
+
9
+ ```bash
10
+ npm install -g @tea-agent/loop-agent@<version>
11
+ npm list -g @tea-agent/loop-agent --depth=0
12
+ loop-agent --version
13
+ agent-worker --version
14
+ agent-worker --help
15
+ ```
16
+
17
+ - Before any write-capable Worker command, resolve one controller identity for the batch. Record its package version, absolute launch entry, binary SHA-256, and portable package fingerprint. If the run is part of a release or self-hosting train, carry the expected version/fingerprint as explicit CLI gates.
18
+ - Create a clean, disposable target repository. Do not use `npm link`, `npm run dev`, or a workspace controller for a real-evidence run.
19
+ - Put requirement, acceptance, design, test plan, and QA case matrix next to the TaskSpec. `agent-worker` materializes immutable copies into the harness task source before DAG generation.
20
+
21
+ ## Setup checklist
22
+
23
+ - [ ] Target has a committed baseline and a passing `loop-agent init --profile full --merge` preflight.
24
+ - [ ] Existing test demonstrates the desired behavior is missing or unimplemented.
25
+ - [ ] TaskSpec has narrow `allowed_paths` and explicit `forbidden_paths`.
26
+ - [ ] Task Pool dependencies are either backed by real prior runs or intentionally recorded as pre-existing evidence.
27
+ - [ ] The chosen model/provider and `--pi-model` smoke override, if any, are recorded.
28
+ - [ ] `--loop-agent-bin` resolves to the intended published package, and expected controller version/fingerprint are recorded before target writes.
29
+ - [ ] If this is a self-hosting run, published N remains fixed for the whole batch; candidate N+1 is installed and verified in a separate slot.
30
+
31
+ ## Execute
32
+
33
+ ```bash
34
+ agent-worker batch run-ready \
35
+ --feature-dir <feature-dir> \
36
+ --repo <target-repo> \
37
+ --loop-agent-bin <published-loop-agent-entry> \
38
+ --expected-controller-version <version> \
39
+ --expected-controller-fingerprint <sha256:value> \
40
+ --limit 1 \
41
+ --check-repo \
42
+ [--pi-model <model>]
43
+
44
+ agent-worker observe snapshot --repo <target-repo> > <evidence-dir>/observe-snapshot.json
45
+ agent-worker report morning --repo <target-repo> --output <evidence-dir>/morning-report.md
46
+ ```
47
+
48
+ For a failed task, do not delete state or alter JSONL evidence. Fix the external/root cause, then make the retry explicit:
49
+
50
+ ```bash
51
+ agent-worker task retry <task-id> --repo <target-repo> --reason "<root cause corrected>"
52
+ agent-worker batch run-ready --feature-dir <feature-dir> --repo <target-repo> --limit 1 --check-repo
53
+ ```
54
+
55
+ The retry run must have a distinct `workerRunId` and retain `retryOfWorkerRunId` in its Task Pool evidence.
56
+
57
+ ## Versioned self-hosting takeover
58
+
59
+ From a source checkout, use the repo-maintainer deterministic canary after building or packing candidate N+1:
60
+
61
+ ```bash
62
+ npm run self-host:canary -- \
63
+ --deterministic \
64
+ --tarball <candidate.tgz> \
65
+ --output <candidate-canary-evidence.json>
66
+ ```
67
+
68
+ The deterministic canary must prove isolated-slot containment, both candidate bin identities, package fingerprint, full init/governance checks, a zero-execution Feature dry-run, static/shell-only observed DAG executors, and no PATH controller fallback. It does not claim to trap every possible Pi SDK/absolute path and does not replace a separately authorized live Pi run or the DAG skill-snapshot tests.
package/harness.json CHANGED
@@ -58,9 +58,8 @@
58
58
  "executors": {
59
59
  "pi": {
60
60
  "description": "Pi planning, review, diagnosis, and bounded writing when DAG toolProfile=write",
61
- "defaultModel": "minimax-m3",
62
61
  "LOW": "minimax-m3",
63
- "MED": "gpt-5.5",
62
+ "MED": {"model": "deepseek/deepseek-v4-flash","thinking": "max"},
64
63
  "HIGH": "gpt-5.6-sol"
65
64
  }
66
65
  }
package/package.json CHANGED
@@ -1,6 +1,6 @@
1
1
  {
2
2
  "name": "@tea-agent/loop-agent",
3
- "version": "0.25.5",
3
+ "version": "0.26.0",
4
4
  "type": "module",
5
5
  "bin": {
6
6
  "loop-agent": "bin/loop-agent.js",
File without changes