@walwal-harness/cli 5.3.1 → 5.4.0
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
|
@@ -1,3 +1,17 @@
|
|
|
1
|
+
---
|
|
2
|
+
docmeta:
|
|
3
|
+
id: memory
|
|
4
|
+
title: Harness Memory — 공유 학습 기록
|
|
5
|
+
type: input
|
|
6
|
+
createdAt: 2026-04-20T00:00:00Z
|
|
7
|
+
updatedAt: 2026-04-20T00:00:00Z
|
|
8
|
+
source:
|
|
9
|
+
producer: user
|
|
10
|
+
skillId: harness
|
|
11
|
+
inputs: []
|
|
12
|
+
tags: [harness, memory, template]
|
|
13
|
+
---
|
|
14
|
+
|
|
1
15
|
# Harness Memory — 공유 학습 기록
|
|
2
16
|
|
|
3
17
|
> Dispatcher가 관리. **모든 에이전트**는 세션 시작 시 이 파일을 읽고 학습된 규칙을 따릅니다.
|
|
@@ -24,3 +38,28 @@
|
|
|
24
38
|
- 항목이 15개 초과 시 가장 오래된 unverified 항목부터 정리
|
|
25
39
|
|
|
26
40
|
<!-- 항목이 추가되면 아래에 기록됩니다 -->
|
|
41
|
+
|
|
42
|
+
### [M-001] progress.log 가독성 — 상세 로그 필수
|
|
43
|
+
- **Date**: 2026-04-20
|
|
44
|
+
- **Status**: verified
|
|
45
|
+
- **TTL**: 영구
|
|
46
|
+
- **Lesson**: Team Worker와 Evaluator가 progress.log에 남기는 로그는 대시보드만 보고도 "무슨 일을 시작했는가 / 무엇을 만들었는가 / 무엇을 어떻게 검증하는가"를 알 수 있어야 한다. 다음 원칙을 반드시 따른다:
|
|
47
|
+
1. `gen-start`에 Feature **제목과 목표**를 함께 기록 ("F-001 \"사용자 회원가입 API\" start — goal=POST /users, 6 AC"). ID만 기록 금지.
|
|
48
|
+
2. `gen-write`는 **변경 파일마다 1건씩** 기록 (경로 + LOC + create/edit/delete). "2 files" 같은 개수 요약 금지.
|
|
49
|
+
3. `gen-done`은 **변경 파일 전체 목록**을 나열. "7 files"처럼 개수만 기록 금지.
|
|
50
|
+
4. `eval-ac`로 **AC 원문**을 먼저 선언 ("AC-3: \"POST /users returns 201 with created user id\""), 그 후 `eval-check`로 증거·판정 기록. "AC-1 count=0" 같은 수치 단독 금지.
|
|
51
|
+
5. `result PASS`는 **SCORE ≥ 2.80**인 경우에만 기록. score=1.00을 PASS로 기록 금지.
|
|
52
|
+
6. 각 단계마다 **어떤 도구/방법으로 검증했는지**(tsc/eslint/curl/playwright 등) 명시.
|
|
53
|
+
- **Context**: 사용자가 대시보드 로그만 보고 진행 상황을 파악해야 하는데, 기존 축약 로그로는 4대 질문에 답이 안 보인다는 피드백.
|
|
54
|
+
- **Applies to**: Team Worker(Generator + Evaluator), Solo Mode Generator/Evaluator, 모든 `logev` 호출 지점.
|
|
55
|
+
|
|
56
|
+
### [M-002] FE Evaluation은 Playwright 필수
|
|
57
|
+
- **Date**: 2026-04-20
|
|
58
|
+
- **Status**: verified
|
|
59
|
+
- **TTL**: 영구
|
|
60
|
+
- **Lesson**: 웹 렌더링 가능한 FE Feature(React, Next, Flutter Web, RN Web 등)는 **Evaluator-Functional과 Evaluator-Visual이 반드시 Playwright MCP 도구(`mcp__playwright__browser_*`)를 호출하여 실제 브라우저 조작으로 검증**한다. 코드 열람/grep/정적 분석만으로 PASS 판정 금지. 각 AC에 대해 사용한 playwright 도구 이름과 결과를 `evaluation-*.md`에 증거로 남겨야 하며, 증거 없는 AC는 0점 강제.
|
|
61
|
+
- **Context**: FE 피처가 실제 UX를 검증하지 않고 코드 존재 여부만으로 PASS되는 문제.
|
|
62
|
+
- **Applies to**:
|
|
63
|
+
- Planner: FE Feature AC에 `type: visual|e2e|a11y` + `verify.tool: "playwright"` + `verify.steps` 명시 필수.
|
|
64
|
+
- Evaluator-Functional / Evaluator-Visual: FE Feature 평가 시 Playwright 도구 호출 없이 진행 금지.
|
|
65
|
+
- 네이티브 모바일/데스크톱 스택은 `validation.visual.enabled == false`일 때만 MANUAL_REQUIRED로 우회 허용.
|
package/package.json
CHANGED
|
@@ -1,6 +1,6 @@
|
|
|
1
1
|
{
|
|
2
2
|
"name": "@walwal-harness/cli",
|
|
3
|
-
"version": "5.
|
|
3
|
+
"version": "5.4.0",
|
|
4
4
|
"description": "Production harness for AI agent engineering — Solo/Team mode, Planner, Generator(BE/FE), Evaluator(Func/Visual), optional Brainstormer. Supports React, Next.js, and Flutter FE stacks.",
|
|
5
5
|
"bin": {
|
|
6
6
|
"walwal-harness": "bin/init.js"
|
|
@@ -50,6 +50,16 @@ disable-model-invocation: true
|
|
|
50
50
|
- 코드 읽기는 평가가 아님 — **반드시 앱을 조작**.
|
|
51
51
|
- 기준 미달 = FAIL. 예외 없음.
|
|
52
52
|
|
|
53
|
+
## FE Playwright Mandatory Rule (v5.4)
|
|
54
|
+
|
|
55
|
+
**프론트엔드 Feature(FE-ONLY 또는 FULLSTACK의 FE 부분)는 반드시 Playwright MCP 도구 호출로 검증**한다. 예외 없음.
|
|
56
|
+
|
|
57
|
+
- 필수 호출 도구 (최소 1회 이상): `mcp__playwright__browser_navigate`, `mcp__playwright__browser_snapshot` 또는 `mcp__playwright__browser_take_screenshot`, 그리고 AC 검증을 위한 interaction (`browser_click`, `browser_type`, `browser_fill_form`, `browser_evaluate` 등).
|
|
58
|
+
- **금지**: 소스 코드 열람, grep, 정적 분석만으로 FE Feature를 PASS 처리하는 것.
|
|
59
|
+
- **금지**: "dev 서버 기동 실패"로 Playwright 단계를 스킵하는 것. 서버 기동까지 Evaluator의 책임.
|
|
60
|
+
- `evaluation-functional.md`에 호출한 **playwright 도구 이름 + 결과 요약**을 AC별로 기술. 도구 호출 증거 없으면 해당 AC는 자동 0점(Evidence 없는 Score = 0점 강제 규칙).
|
|
61
|
+
- BE-ONLY Feature는 이 규칙 대상 아님 (CLI 기반 API 테스트 유지).
|
|
62
|
+
|
|
53
63
|
## Startup
|
|
54
64
|
|
|
55
65
|
1. `AGENTS.md` 읽기 — IA-MAP
|
|
@@ -43,6 +43,16 @@ disable-model-invocation: true
|
|
|
43
43
|
5. **STOP.**
|
|
44
44
|
6. 출력: `"✖ Evaluator-Visual FAIL. bash scripts/harness-next.sh 실행하여 재작업 대상 확인."`
|
|
45
45
|
|
|
46
|
+
## FE Playwright Mandatory Rule (v5.4)
|
|
47
|
+
|
|
48
|
+
**웹 렌더링 가능한 FE Feature에 대해서는 Playwright MCP 사용이 강제**된다 (`validation.visual.enabled == true` 또는 전통 웹 스택).
|
|
49
|
+
|
|
50
|
+
- 필수 호출: `mcp__playwright__browser_navigate` + `mcp__playwright__browser_take_screenshot` (AC당 최소 1장) + 레이아웃/반응형 검증을 위한 `browser_resize`.
|
|
51
|
+
- 접근성: `browser_snapshot`으로 accessibility tree 확보 후 axe-core 평가 연결.
|
|
52
|
+
- **금지**: 스크린샷/스냅샷 없이 "코드만 봐서 OK" 처리.
|
|
53
|
+
- `evaluation-visual.md`에 사용한 playwright 도구 이름과 뷰포트/URL을 명시. 도구 호출 증거 없으면 해당 기준 자동 0점.
|
|
54
|
+
- `validation.visual.enabled == false`인 네이티브 스택은 Visual Skip Flow 적용 (예외).
|
|
55
|
+
|
|
46
56
|
## Startup
|
|
47
57
|
|
|
48
58
|
1. `AGENTS.md` 읽기
|
package/skills/planner/SKILL.md
CHANGED
|
@@ -78,6 +78,35 @@ disable-model-invocation: true
|
|
|
78
78
|
- 각 기능에 `layer`, `service`, `depends_on` 명시
|
|
79
79
|
- API 계약의 스키마는 Pydantic/class-validator로 직접 변환 가능한 수준
|
|
80
80
|
|
|
81
|
+
## FE Feature AC 작성 규칙 (v5.4) — Playwright 강제
|
|
82
|
+
|
|
83
|
+
`layer`가 `"fe"` 또는 `"frontend"`인 Feature(또는 FULLSTACK의 FE 부분)에 대해서는 `acceptance_criteria`의 Executable AC가 **반드시 Playwright MCP로 검증 가능한 형태**로 작성되어야 한다.
|
|
84
|
+
|
|
85
|
+
각 AC 항목에 다음 필드를 명시:
|
|
86
|
+
|
|
87
|
+
```json
|
|
88
|
+
{
|
|
89
|
+
"id": "AC-3",
|
|
90
|
+
"description": "로그인 성공 시 /dashboard로 리다이렉트",
|
|
91
|
+
"type": "e2e",
|
|
92
|
+
"verify": {
|
|
93
|
+
"tool": "playwright",
|
|
94
|
+
"steps": [
|
|
95
|
+
"browser_navigate: http://localhost:3000/login",
|
|
96
|
+
"browser_fill_form: email/password",
|
|
97
|
+
"browser_click: submit",
|
|
98
|
+
"browser_snapshot: 현재 URL=/dashboard 확인"
|
|
99
|
+
]
|
|
100
|
+
}
|
|
101
|
+
}
|
|
102
|
+
```
|
|
103
|
+
|
|
104
|
+
- `type`: `"visual" | "e2e" | "a11y"` (웹 렌더링 없는 네이티브는 `"manual"` 가능, 다만 pipeline.json의 visual.enabled=false일 때만).
|
|
105
|
+
- `verify.tool`: 웹/Flutter Web/React Native Web은 반드시 `"playwright"`. 네이티브 모바일/데스크톱은 예외 허용.
|
|
106
|
+
- `verify.steps`: Evaluator가 호출할 playwright MCP 도구(`browser_navigate`, `browser_click`, `browser_type`, `browser_snapshot`, `browser_take_screenshot` 등) 이름 + 인자 요약을 순서대로 기술.
|
|
107
|
+
|
|
108
|
+
**금지**: FE AC를 "컴포넌트가 존재한다", "코드가 작성되어 있다" 같이 코드 검증만으로 충족되는 표현으로 쓰는 것. AC는 **사용자 경험을 실제 브라우저에서 조작**해야 검증 가능해야 한다.
|
|
109
|
+
|
|
81
110
|
## Team 병렬 스케줄링 규칙 (필수)
|
|
82
111
|
|
|
83
112
|
Team Mode는 **최대 3팀이 동시 작업**한다. Planner는 feature-list.json 설계 시 다음 규칙을 반드시 준수한다.
|