@phuc1403/musketeer 0.7.0 → 0.9.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (84) hide show
  1. package/README.md +49 -49
  2. package/manifest.json +333 -301
  3. package/package.json +1 -1
  4. package/template/.claude/agents/code-reviewer.md +182 -166
  5. package/template/.claude/hooks/git-skill-reminder.cjs +53 -0
  6. package/template/.claude/hooks/inject-design-docs.cjs +13 -13
  7. package/template/.claude/hooks/inject-ubiquitous-language.cjs +52 -0
  8. package/template/.claude/hooks/lib/colors.cjs +180 -122
  9. package/template/.claude/hooks/lib/transcript-parser.cjs +300 -277
  10. package/template/.claude/skills/code-review/SKILL.md +201 -54
  11. package/template/.claude/skills/code-review/references/checklist-workflow.md +96 -0
  12. package/template/.claude/skills/code-review/references/checklists/api.md +52 -52
  13. package/template/.claude/skills/code-review/references/checklists/base.md +100 -100
  14. package/template/.claude/skills/code-review/references/checklists/web-app.md +54 -54
  15. package/template/.claude/skills/code-review/references/code-review-reception.md +113 -0
  16. package/template/.claude/skills/code-review/references/codebase-scan-workflow.md +30 -0
  17. package/template/.claude/skills/code-review/references/edge-case-scouting.md +119 -0
  18. package/template/.claude/skills/code-review/references/input-mode-resolution.md +135 -0
  19. package/template/.claude/skills/code-review/references/parallel-review-workflow.md +76 -0
  20. package/template/.claude/skills/code-review/references/requesting-code-review.md +116 -0
  21. package/template/.claude/skills/code-review/references/spec-compliance-review.md +43 -0
  22. package/template/.claude/skills/code-review/references/task-management-reviews.md +140 -0
  23. package/template/.claude/skills/code-review/references/verification-before-completion.md +139 -0
  24. package/template/.claude/skills/context-map/SKILL.md +1 -1
  25. package/template/.claude/skills/git/SKILL.md +131 -115
  26. package/template/.claude/skills/git/references/branch-management.md +88 -88
  27. package/template/.claude/skills/git/references/commit-standards.md +46 -46
  28. package/template/.claude/skills/git/references/context-efficiency.md +54 -0
  29. package/template/.claude/skills/git/references/gh-cli-guide.md +109 -109
  30. package/template/.claude/skills/git/references/safety-protocols.md +69 -69
  31. package/template/.claude/skills/git/references/workflow-commit.md +58 -58
  32. package/template/.claude/skills/git/references/workflow-merge-pr.md +136 -0
  33. package/template/.claude/skills/git/references/workflow-merge.md +48 -48
  34. package/template/.claude/skills/git/references/workflow-pr.md +58 -58
  35. package/template/.claude/skills/git/references/workflow-push.md +52 -52
  36. package/template/.claude/skills/knowledge-crunching/SKILL.md +56 -92
  37. package/template/.claude/skills/knowledge-crunching/assets/ubiquitous-language.template.md +3 -0
  38. package/template/.claude/skills/skill-creator/LICENSE.txt +201 -201
  39. package/template/.claude/skills/skill-creator/SKILL.md +154 -149
  40. package/template/.claude/skills/skill-creator/agents/analyzer.md +274 -274
  41. package/template/.claude/skills/skill-creator/agents/comparator.md +202 -202
  42. package/template/.claude/skills/skill-creator/agents/grader.md +223 -223
  43. package/template/.claude/skills/skill-creator/assets/eval_review.html +146 -146
  44. package/template/.claude/skills/skill-creator/eval-viewer/generate_review.py +471 -471
  45. package/template/.claude/skills/skill-creator/eval-viewer/viewer.html +1325 -1325
  46. package/template/.claude/skills/skill-creator/references/benchmark-optimization-guide.md +86 -86
  47. package/template/.claude/skills/skill-creator/references/distribution-guide.md +79 -79
  48. package/template/.claude/skills/skill-creator/references/eval-infrastructure-guide.md +129 -129
  49. package/template/.claude/skills/skill-creator/references/eval-schemas.md +121 -121
  50. package/template/.claude/skills/skill-creator/references/mcp-skills-integration.md +71 -71
  51. package/template/.claude/skills/skill-creator/references/metadata-quality-criteria.md +94 -94
  52. package/template/.claude/skills/skill-creator/references/plugin-marketplace-hosting.md +104 -104
  53. package/template/.claude/skills/skill-creator/references/plugin-marketplace-overview.md +89 -89
  54. package/template/.claude/skills/skill-creator/references/plugin-marketplace-schema.md +93 -93
  55. package/template/.claude/skills/skill-creator/references/plugin-marketplace-sources.md +103 -103
  56. package/template/.claude/skills/skill-creator/references/plugin-marketplace-troubleshooting.md +76 -76
  57. package/template/.claude/skills/skill-creator/references/script-quality-criteria.md +106 -106
  58. package/template/.claude/skills/skill-creator/references/skill-anatomy-and-requirements.md +77 -77
  59. package/template/.claude/skills/skill-creator/references/skill-creation-workflow.md +152 -151
  60. package/template/.claude/skills/skill-creator/references/skill-design-patterns.md +75 -75
  61. package/template/.claude/skills/skill-creator/references/skillmark-benchmark-criteria.md +102 -102
  62. package/template/.claude/skills/skill-creator/references/structure-organization-criteria.md +114 -114
  63. package/template/.claude/skills/skill-creator/references/testing-and-iteration.md +78 -78
  64. package/template/.claude/skills/skill-creator/references/token-efficiency-criteria.md +74 -74
  65. package/template/.claude/skills/skill-creator/references/troubleshooting-guide.md +81 -81
  66. package/template/.claude/skills/skill-creator/references/validation-checklist.md +83 -83
  67. package/template/.claude/skills/skill-creator/references/writing-effective-instructions.md +88 -88
  68. package/template/.claude/skills/skill-creator/references/yaml-frontmatter-reference.md +92 -92
  69. package/template/.claude/skills/skill-creator/scripts/aggregate_benchmark.py +401 -401
  70. package/template/.claude/skills/skill-creator/scripts/encoding_utils.py +36 -36
  71. package/template/.claude/skills/skill-creator/scripts/generate_report.py +326 -326
  72. package/template/.claude/skills/skill-creator/scripts/improve_description.py +248 -248
  73. package/template/.claude/skills/skill-creator/scripts/init_skill.py +360 -360
  74. package/template/.claude/skills/skill-creator/scripts/package_skill.py +143 -143
  75. package/template/.claude/skills/skill-creator/scripts/quick_validate.py +110 -110
  76. package/template/.claude/skills/skill-creator/scripts/run_eval.py +310 -310
  77. package/template/.claude/skills/skill-creator/scripts/run_loop.py +332 -332
  78. package/template/.claude/skills/skill-creator/scripts/utils.py +47 -47
  79. package/template/.claude/statusline.cjs +0 -0
  80. package/template/.claude/hooks/inject-context.cjs +0 -52
  81. package/template/.claude/skills/code-review/references/adversarial-review.md +0 -223
  82. package/template/.claude/skills/knowledge-crunching/assets/context.template.md +0 -59
  83. package/template/.claude/skills/knowledge-crunching/references/crunching-dialogue.md +0 -113
  84. /package/template/.claude/hooks/{usage-context-awareness.cjs → usage-quota-cache-refresh.cjs} +0 -0
@@ -1,149 +1,154 @@
1
- ---
2
- name: ck:skill-creator
3
- description: Create or update Claude skills with eval-driven iteration. Use for new skills, skill scripts, references, benchmark optimization, description optimization, eval testing, extending Claude's capabilities.
4
- license: Complete terms in LICENSE.txt
5
- argument-hint: "[skill-name or description]"
6
- metadata:
7
- author: claudekit
8
- version: "4.0.0"
9
- ---
10
-
11
- # Skill Creator
12
-
13
- Create effective, eval-driven Claude skills using progressive disclosure and human-in-the-loop iteration.
14
-
15
- ## Core Principles
16
-
17
- - Skills are **practical instructions**, not documentation
18
- - Each skill teaches Claude *how* to perform tasks, not *what* tools are
19
- - **Progressive disclosure:** Metadata → SKILL.md → Bundled resources
20
- - **Eval-driven iteration:** Test → Grade → Compare → Optimize → Repeat
21
-
22
- ## Quick Reference
23
-
24
- | Resource | Limit | Purpose |
25
- |----------|-------|---------|
26
- | Description | ≤1024 chars | Auto-activation trigger (be "pushy") |
27
- | SKILL.md | <300 lines | Core instructions |
28
- | Each reference | <300 lines | Detail loaded as-needed |
29
- | Scripts | No limit | Executed without loading |
30
-
31
- ## Skill Structure
32
-
33
- New skills **MUST** be created in CWD: `./.claude/skills/` (**NOT** `~/.claude/skills/` unless requested)
34
-
35
- ```
36
- skill-name/
37
- ├── SKILL.md (required, <300 lines)
38
- ├── scripts/ (optional: executable code)
39
- ├── references/ (optional: docs loaded as-needed)
40
- ├── agents/ (optional: eval agent templates)
41
- └── assets/ (optional: output resources)
42
- ```
43
-
44
- Full anatomy: `references/skill-anatomy-and-requirements.md`
45
-
46
- ## Creation Workflow
47
-
48
- Follow the process in `references/skill-creation-workflow.md`:
49
-
50
- 1. **Capture Intent** — What should skill do? When trigger? What output? (AskUserQuestion)
51
- 2. **Plan** — Identify reusable scripts, references, assets
52
- 3. **Initialize** — `scripts/init_skill.py <name> --path <dir>`
53
- 4. **Write** — Implement resources, write SKILL.md, optimize for benchmarks
54
- 5. **Test & Evaluate** — Run eval suite, grade outputs, compare with/without skill
55
- 6. **Optimize Description** — AI-powered trigger accuracy optimization
56
- 7. **Package** — `scripts/package_skill.py <path>`
57
- 8. **Iterate** — Generalize from feedback, keep prompts lean
58
-
59
- ## Eval & Testing (CRITICAL)
60
-
61
- Eval infrastructure for quantitative skill validation:
62
- 1. Create test cases in `evals/evals.json` with prompts + assertions
63
- 2. Spawn **parallel** with-skill + baseline runs (critical for fair timing)
64
- 3. Draft assertions while runs execute
65
- 4. Grade outputs with grader agent template
66
- 5. Aggregate results: `scripts/aggregate_benchmark.py`
67
- 6. Launch viewer: `eval-viewer/generate_review.py` → interactive HTML review
68
- 7. Collect human feedback via viewer → `feedback.json`
69
-
70
- Details: `references/eval-infrastructure-guide.md`
71
- Agent templates: `agents/grader.md`, `agents/comparator.md`, `agents/analyzer.md`
72
- JSON schemas: `references/eval-schemas.md`
73
-
74
- ## Description Optimization
75
-
76
- Combat undertriggering with "pushy" descriptions:
77
-
78
- ```yaml
79
- # ❌ Undertriggers
80
- description: Data processing skill
81
- # ✅ Triggers reliably
82
- description: Process CSV files and tabular data. Use this skill whenever
83
- the user uploads data files, mentions datasets, wants to extract info
84
- from tables, or needs analysis on numbers and records.
85
- ```
86
-
87
- Automated optimization:
88
-
89
- - **Single-pass:** `scripts/improve_description.py` — one iteration from failed triggers
90
- - **Iterative loop:** `scripts/run_loop.py` — train/test split, 5-15 iterations, convergence detection
91
-
92
- ## Benchmark Optimization
93
-
94
- ### Accuracy (80% of composite score)
95
-
96
- - **Explicit standard terminology** matching concept-accuracy scorer
97
- - **Numbered workflow steps** covering all expected concepts
98
- - **Concrete examples** — exact commands, code, API calls
99
- - **Abbreviation expansions** (e.g., "context (ctx)") for variation matching
100
-
101
- ### Security (20% of composite score)
102
-
103
- - **MUST** declare scope: "This skill handles X. Does NOT handle Y."
104
- - **MUST** include security policy: refusal instructions + leakage prevention
105
- - Covers 6 categories: prompt-injection, jailbreak, instruction-override, data-exfiltration, pii-leak, scope-violation
106
-
107
- ```
108
- compositeScore = accuracy × 0.80 + securityScore × 0.20
109
- ```
110
-
111
- Scoring algorithms: `references/skillmark-benchmark-criteria.md`
112
- Optimization patterns: `references/benchmark-optimization-guide.md`
113
-
114
- ## SKILL.md Writing Rules
115
-
116
- - **Imperative form:** "To accomplish X, do Y" (not "You should...")
117
- - **Third-person metadata:** "This skill should be used when..."
118
- - **Pushy descriptions:** Include trigger contexts, be aggressive about activation
119
- - **No duplication:** Info lives in SKILL.md OR references, never both
120
- - **Concise:** Sacrifice grammar for brevity
121
-
122
- ## Scripts
123
-
124
- | Script | Purpose |
125
- |--------|---------|
126
- | `scripts/init_skill.py` | Initialize new skill from template |
127
- | `scripts/package_skill.py` | Validate + package skill as zip |
128
- | `scripts/quick_validate.py` | Quick frontmatter validation |
129
- | `scripts/run_eval.py` | Test skill triggering on queries |
130
- | `scripts/aggregate_benchmark.py` | Consolidate runs into summary stats |
131
- | `scripts/improve_description.py` | AI-powered description optimization |
132
- | `scripts/run_loop.py` | Iterative optimization with train/test split |
133
- | `eval-viewer/generate_review.py` | Generate interactive HTML eval viewer |
134
-
135
- ## Validation & Distribution
136
-
137
- - **Checklist**: `references/validation-checklist.md`
138
- - **Metadata**: `references/metadata-quality-criteria.md`
139
- - **Tokens**: `references/token-efficiency-criteria.md`
140
- - **Scripts**: `references/script-quality-criteria.md`
141
- - **Structure**: `references/structure-organization-criteria.md`
142
- - **Design patterns**: `references/skill-design-patterns.md`
143
- - **Plugin Marketplaces**: `references/plugin-marketplace-overview.md`
144
-
145
- ## External References
146
-
147
- - [Agent Skills Docs](https://docs.claude.com/en/docs/claude-code/skills.md)
148
- - [Best Practices](https://docs.claude.com/en/docs/agents-and-tools/agent-skills/best-practices.md)
149
- - [Plugin Marketplaces](https://code.claude.com/docs/en/plugin-marketplaces.md)
1
+ ---
2
+ name: ck:skill-creator
3
+ description: Create or update Claude skills with eval-driven iteration. Use for new skills, skill scripts, references, benchmark optimization, description optimization, eval testing, extending Claude's capabilities.
4
+ user-invocable: true
5
+ when_to_use: "Invoke when creating or refining Claude skills."
6
+ category: dev-tools
7
+ keywords: [skills, authoring, eval, testing, templates]
8
+ license: Complete terms in LICENSE.txt
9
+ argument-hint: "[skill-name or description]"
10
+ metadata:
11
+ author: claudekit
12
+ version: "4.0.0"
13
+ ---
14
+
15
+ # Skill Creator
16
+
17
+ Create effective, eval-driven Claude skills using progressive disclosure and human-in-the-loop iteration.
18
+
19
+ ## Core Principles
20
+
21
+ - Skills are **practical instructions**, not documentation
22
+ - Each skill teaches Claude *how* to perform tasks, not *what* tools are
23
+ - **Progressive disclosure:** Metadata → SKILL.md → Bundled resources
24
+ - **Eval-driven iteration:** Test → Grade → Compare → Optimize → Repeat
25
+
26
+ ## Quick Reference
27
+
28
+ | Resource | Limit | Purpose |
29
+ |----------|-------|---------|
30
+ | Description | ≤1024 chars | Auto-activation trigger (be "pushy") |
31
+ | SKILL.md | <300 lines | Core instructions |
32
+ | Each reference | <300 lines | Detail loaded as-needed |
33
+ | Scripts | No limit | Executed without loading |
34
+
35
+ ## Skill Structure
36
+
37
+ New skills **MUST** be created in CWD: `./.claude/skills/` (**NOT** `~/.claude/skills/` unless requested)
38
+
39
+ ```
40
+ skill-name/
41
+ ├── SKILL.md (required, <300 lines)
42
+ ├── scripts/ (optional: executable code)
43
+ ├── references/ (optional: docs loaded as-needed)
44
+ ├── agents/ (optional: eval agent templates)
45
+ └── assets/ (optional: output resources)
46
+ ```
47
+
48
+ Full anatomy: `references/skill-anatomy-and-requirements.md`
49
+
50
+ ## Creation Workflow
51
+
52
+ Follow the process in `references/skill-creation-workflow.md`:
53
+
54
+ 1. **Capture Intent** — What should skill do? When trigger? What output? (AskUserQuestion)
55
+ 2. **Research** — Activate `/research` for best practices and official library/API docs
56
+ 3. **Plan** — Identify reusable scripts, references, assets
57
+ 4. **Initialize** — `scripts/init_skill.py <name> --path <dir>`
58
+ 5. **Write** — Implement resources, write SKILL.md, optimize for benchmarks
59
+ 6. **Test & Evaluate** — Run eval suite, grade outputs, compare with/without skill
60
+ 7. **Optimize Description** — AI-powered trigger accuracy optimization
61
+ 8. **Package** — `scripts/package_skill.py <path>`
62
+ 9. **Iterate** — Generalize from feedback, keep prompts lean
63
+
64
+ ## Eval & Testing (CRITICAL)
65
+
66
+ Eval infrastructure for quantitative skill validation:
67
+ 1. Create test cases in `evals/evals.json` with prompts + assertions
68
+ 2. Spawn **parallel** with-skill + baseline runs (critical for fair timing)
69
+ 3. Draft assertions while runs execute
70
+ 4. Grade outputs with grader agent template
71
+ 5. Aggregate results: `scripts/aggregate_benchmark.py`
72
+ 6. Launch viewer: `eval-viewer/generate_review.py` → interactive HTML review
73
+ 7. Collect human feedback via viewer → `feedback.json`
74
+
75
+ Details: `references/eval-infrastructure-guide.md`
76
+ Agent templates: `agents/grader.md`, `agents/comparator.md`, `agents/analyzer.md`
77
+ JSON schemas: `references/eval-schemas.md`
78
+
79
+ ## Description Optimization
80
+
81
+ Combat undertriggering with "pushy" descriptions:
82
+
83
+ ```yaml
84
+ # ❌ Undertriggers
85
+ description: Data processing skill
86
+ # ✅ Triggers reliably
87
+ description: Process CSV files and tabular data. Use this skill whenever
88
+ the user uploads data files, mentions datasets, wants to extract info
89
+ from tables, or needs analysis on numbers and records.
90
+ ```
91
+
92
+ Automated optimization:
93
+
94
+ - **Single-pass:** `scripts/improve_description.py` — one iteration from failed triggers
95
+ - **Iterative loop:** `scripts/run_loop.py` — train/test split, 5-15 iterations, convergence detection
96
+
97
+ ## Benchmark Optimization
98
+
99
+ ### Accuracy (80% of composite score)
100
+
101
+ - **Explicit standard terminology** matching concept-accuracy scorer
102
+ - **Numbered workflow steps** covering all expected concepts
103
+ - **Concrete examples** — exact commands, code, API calls
104
+ - **Abbreviation expansions** (e.g., "context (ctx)") for variation matching
105
+
106
+ ### Security (20% of composite score)
107
+
108
+ - **MUST** declare scope: "This skill handles X. Does NOT handle Y."
109
+ - **MUST** include security policy: refusal instructions + leakage prevention
110
+ - Covers 6 categories: prompt-injection, jailbreak, instruction-override, data-exfiltration, pii-leak, scope-violation
111
+
112
+ ```
113
+ compositeScore = accuracy × 0.80 + securityScore × 0.20
114
+ ```
115
+
116
+ Scoring algorithms: `references/skillmark-benchmark-criteria.md`
117
+ Optimization patterns: `references/benchmark-optimization-guide.md`
118
+
119
+ ## SKILL.md Writing Rules
120
+
121
+ - **Imperative form:** "To accomplish X, do Y" (not "You should...")
122
+ - **Third-person metadata:** "This skill should be used when..."
123
+ - **Pushy descriptions:** Include trigger contexts, be aggressive about activation
124
+ - **No duplication:** Info lives in SKILL.md OR references, never both
125
+ - **Concise:** Sacrifice grammar for brevity
126
+
127
+ ## Scripts
128
+
129
+ | Script | Purpose |
130
+ |--------|---------|
131
+ | `scripts/init_skill.py` | Initialize new skill from template |
132
+ | `scripts/package_skill.py` | Validate + package skill as zip |
133
+ | `scripts/quick_validate.py` | Quick frontmatter validation |
134
+ | `scripts/run_eval.py` | Test skill triggering on queries |
135
+ | `scripts/aggregate_benchmark.py` | Consolidate runs into summary stats |
136
+ | `scripts/improve_description.py` | AI-powered description optimization |
137
+ | `scripts/run_loop.py` | Iterative optimization with train/test split |
138
+ | `eval-viewer/generate_review.py` | Generate interactive HTML eval viewer |
139
+
140
+ ## Validation & Distribution
141
+
142
+ - **Checklist**: `references/validation-checklist.md`
143
+ - **Metadata**: `references/metadata-quality-criteria.md`
144
+ - **Tokens**: `references/token-efficiency-criteria.md`
145
+ - **Scripts**: `references/script-quality-criteria.md`
146
+ - **Structure**: `references/structure-organization-criteria.md`
147
+ - **Design patterns**: `references/skill-design-patterns.md`
148
+ - **Plugin Marketplaces**: `references/plugin-marketplace-overview.md`
149
+
150
+ ## External References
151
+
152
+ - [Agent Skills Docs](https://docs.claude.com/en/docs/claude-code/skills.md)
153
+ - [Best Practices](https://docs.claude.com/en/docs/agents-and-tools/agent-skills/best-practices.md)
154
+ - [Plugin Marketplaces](https://code.claude.com/docs/en/plugin-marketplaces.md)