@rune-kit/rune 2.8.0 → 2.11.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (287) hide show
  1. package/LICENSE +21 -21
  2. package/README.md +68 -34
  3. package/agents/adversary.md +27 -0
  4. package/agents/architect.md +19 -29
  5. package/agents/asset-creator.md +18 -4
  6. package/agents/audit.md +25 -4
  7. package/agents/autopsy.md +19 -4
  8. package/agents/ba.md +35 -0
  9. package/agents/brainstorm.md +31 -4
  10. package/agents/browser-pilot.md +21 -4
  11. package/agents/coder.md +21 -29
  12. package/agents/completion-gate.md +20 -4
  13. package/agents/constraint-check.md +18 -4
  14. package/agents/context-engine.md +22 -4
  15. package/agents/context-pack.md +32 -0
  16. package/agents/cook.md +41 -4
  17. package/agents/db.md +19 -4
  18. package/agents/debug.md +33 -4
  19. package/agents/dependency-doctor.md +20 -4
  20. package/agents/deploy.md +27 -4
  21. package/agents/design.md +22 -4
  22. package/agents/doc-processor.md +27 -0
  23. package/agents/docs-seeker.md +19 -4
  24. package/agents/docs.md +31 -0
  25. package/agents/fix.md +37 -4
  26. package/agents/git.md +29 -0
  27. package/agents/hallucination-guard.md +20 -4
  28. package/agents/incident.md +21 -4
  29. package/agents/integrity-check.md +18 -4
  30. package/agents/journal.md +19 -4
  31. package/agents/launch.md +32 -4
  32. package/agents/logic-guardian.md +26 -11
  33. package/agents/marketing.md +23 -4
  34. package/agents/mcp-builder.md +26 -0
  35. package/agents/neural-memory.md +30 -0
  36. package/agents/onboard.md +22 -4
  37. package/agents/perf.md +21 -4
  38. package/agents/plan.md +29 -4
  39. package/agents/preflight.md +22 -4
  40. package/agents/problem-solver.md +20 -4
  41. package/agents/rescue.md +23 -4
  42. package/agents/research.md +19 -4
  43. package/agents/researcher.md +19 -29
  44. package/agents/retro.md +32 -0
  45. package/agents/review-intake.md +20 -4
  46. package/agents/review.md +32 -4
  47. package/agents/reviewer.md +20 -28
  48. package/agents/safeguard.md +19 -4
  49. package/agents/sast.md +18 -4
  50. package/agents/scaffold.md +41 -0
  51. package/agents/scanner.md +19 -28
  52. package/agents/scope-guard.md +18 -4
  53. package/agents/scout.md +23 -4
  54. package/agents/sentinel-env.md +26 -0
  55. package/agents/sentinel.md +33 -4
  56. package/agents/sequential-thinking.md +20 -4
  57. package/agents/session-bridge.md +24 -4
  58. package/agents/skill-forge.md +22 -4
  59. package/agents/skill-router.md +26 -4
  60. package/agents/slides.md +24 -0
  61. package/agents/surgeon.md +19 -4
  62. package/agents/team.md +30 -4
  63. package/agents/test.md +36 -4
  64. package/agents/trend-scout.md +17 -4
  65. package/agents/verification.md +20 -4
  66. package/agents/video-creator.md +20 -4
  67. package/agents/watchdog.md +19 -4
  68. package/agents/worktree.md +17 -4
  69. package/commands/rune.md +168 -168
  70. package/compiler/__tests__/analytics.test.js +370 -0
  71. package/compiler/adapters/openclaw.js +2 -2
  72. package/compiler/analytics.js +385 -0
  73. package/compiler/bin/rune.js +68 -2
  74. package/compiler/dashboard.js +883 -0
  75. package/compiler/transforms/branding.js +1 -1
  76. package/contexts/dev.md +34 -34
  77. package/contexts/research.md +43 -43
  78. package/contexts/review.md +55 -55
  79. package/extensions/ai-ml/PACK.md +88 -88
  80. package/extensions/ai-ml/skills/ai-agents.md +172 -172
  81. package/extensions/ai-ml/skills/code-sandbox.md +187 -187
  82. package/extensions/ai-ml/skills/deep-research.md +146 -146
  83. package/extensions/ai-ml/skills/embedding-search.md +66 -66
  84. package/extensions/ai-ml/skills/fine-tuning-guide.md +74 -74
  85. package/extensions/ai-ml/skills/llm-architect.md +125 -125
  86. package/extensions/ai-ml/skills/llm-integration.md +64 -64
  87. package/extensions/ai-ml/skills/prompt-patterns.md +72 -72
  88. package/extensions/ai-ml/skills/rag-patterns.md +66 -66
  89. package/extensions/ai-ml/skills/web-extraction.md +114 -114
  90. package/extensions/analytics/PACK.md +92 -92
  91. package/extensions/analytics/skills/ab-testing.md +72 -72
  92. package/extensions/analytics/skills/dashboard-patterns.md +83 -83
  93. package/extensions/analytics/skills/data-validation.md +68 -68
  94. package/extensions/analytics/skills/funnel-analysis.md +81 -81
  95. package/extensions/analytics/skills/sql-patterns.md +57 -57
  96. package/extensions/analytics/skills/statistical-analysis.md +79 -79
  97. package/extensions/analytics/skills/tracking-setup.md +71 -71
  98. package/extensions/backend/PACK.md +104 -104
  99. package/extensions/backend/skills/api-patterns.md +84 -84
  100. package/extensions/backend/skills/async-pipeline.md +193 -193
  101. package/extensions/backend/skills/auth-patterns.md +97 -97
  102. package/extensions/backend/skills/background-jobs.md +133 -133
  103. package/extensions/backend/skills/caching-patterns.md +108 -108
  104. package/extensions/backend/skills/cli-generation.md +133 -133
  105. package/extensions/backend/skills/database-patterns.md +87 -87
  106. package/extensions/backend/skills/middleware-patterns.md +104 -104
  107. package/extensions/chrome-ext/PACK.md +93 -93
  108. package/extensions/chrome-ext/skills/cws-preflight.md +143 -143
  109. package/extensions/chrome-ext/skills/cws-publish.md +104 -104
  110. package/extensions/chrome-ext/skills/ext-ai-integration.md +251 -251
  111. package/extensions/chrome-ext/skills/ext-messaging.md +139 -139
  112. package/extensions/chrome-ext/skills/ext-storage.md +133 -133
  113. package/extensions/chrome-ext/skills/mv3-scaffold.md +164 -164
  114. package/extensions/content/PACK.md +96 -96
  115. package/extensions/content/skills/blog-patterns.md +88 -88
  116. package/extensions/content/skills/cms-integration.md +131 -131
  117. package/extensions/content/skills/content-scoring.md +107 -107
  118. package/extensions/content/skills/i18n.md +83 -83
  119. package/extensions/content/skills/mdx-authoring.md +137 -137
  120. package/extensions/content/skills/reference.md +1014 -1014
  121. package/extensions/content/skills/seo-patterns.md +67 -67
  122. package/extensions/content/skills/video-repurpose.md +153 -153
  123. package/extensions/devops/PACK.md +101 -101
  124. package/extensions/devops/skills/chaos-testing.md +67 -67
  125. package/extensions/devops/skills/ci-cd.md +75 -75
  126. package/extensions/devops/skills/docker.md +58 -58
  127. package/extensions/devops/skills/edge-serverless.md +163 -163
  128. package/extensions/devops/skills/infra-as-code.md +158 -158
  129. package/extensions/devops/skills/kubernetes.md +110 -110
  130. package/extensions/devops/skills/monitoring.md +57 -57
  131. package/extensions/devops/skills/server-setup.md +64 -64
  132. package/extensions/devops/skills/ssl-domain.md +42 -42
  133. package/extensions/ecommerce/PACK.md +116 -116
  134. package/extensions/ecommerce/skills/cart-system.md +79 -79
  135. package/extensions/ecommerce/skills/inventory-mgmt.md +102 -102
  136. package/extensions/ecommerce/skills/order-management.md +126 -126
  137. package/extensions/ecommerce/skills/payment-integration.md +472 -472
  138. package/extensions/ecommerce/skills/shopify-dev.md +69 -69
  139. package/extensions/ecommerce/skills/subscription-billing.md +93 -93
  140. package/extensions/ecommerce/skills/tax-compliance.md +117 -117
  141. package/extensions/gamedev/PACK.md +142 -142
  142. package/extensions/gamedev/skills/asset-pipeline.md +74 -74
  143. package/extensions/gamedev/skills/audio-system.md +129 -129
  144. package/extensions/gamedev/skills/camera-system.md +87 -87
  145. package/extensions/gamedev/skills/ecs.md +98 -98
  146. package/extensions/gamedev/skills/game-loops.md +72 -72
  147. package/extensions/gamedev/skills/input-system.md +199 -199
  148. package/extensions/gamedev/skills/multiplayer.md +180 -180
  149. package/extensions/gamedev/skills/particles.md +105 -105
  150. package/extensions/gamedev/skills/physics-engine.md +89 -89
  151. package/extensions/gamedev/skills/scene-management.md +146 -146
  152. package/extensions/gamedev/skills/threejs-patterns.md +90 -90
  153. package/extensions/gamedev/skills/webgl.md +71 -71
  154. package/extensions/mobile/PACK.md +106 -106
  155. package/extensions/mobile/skills/app-store-connect.md +152 -152
  156. package/extensions/mobile/skills/app-store-prep.md +66 -66
  157. package/extensions/mobile/skills/deep-linking.md +109 -109
  158. package/extensions/mobile/skills/flutter.md +60 -60
  159. package/extensions/mobile/skills/ios-build-pipeline.md +142 -142
  160. package/extensions/mobile/skills/native-bridge.md +66 -66
  161. package/extensions/mobile/skills/ota-updates.md +97 -97
  162. package/extensions/mobile/skills/push-notifications.md +111 -111
  163. package/extensions/mobile/skills/react-native.md +82 -82
  164. package/extensions/saas/PACK.md +116 -116
  165. package/extensions/saas/skills/billing-integration.md +200 -200
  166. package/extensions/saas/skills/feature-flags.md +130 -130
  167. package/extensions/saas/skills/multi-tenant.md +103 -103
  168. package/extensions/saas/skills/onboarding-flow.md +139 -139
  169. package/extensions/saas/skills/subscription-flow.md +95 -95
  170. package/extensions/saas/skills/team-management.md +144 -144
  171. package/extensions/security/PACK.md +99 -99
  172. package/extensions/security/skills/api-security.md +140 -140
  173. package/extensions/security/skills/compliance.md +68 -68
  174. package/extensions/security/skills/owasp-audit.md +64 -64
  175. package/extensions/security/skills/pentest-patterns.md +77 -77
  176. package/extensions/security/skills/secret-mgmt.md +65 -65
  177. package/extensions/security/skills/supply-chain.md +65 -65
  178. package/extensions/trading/PACK.md +80 -80
  179. package/extensions/trading/skills/chart-components.md +55 -55
  180. package/extensions/trading/skills/experiment-loop.md +125 -125
  181. package/extensions/trading/skills/fintech-patterns.md +47 -47
  182. package/extensions/trading/skills/indicator-library.md +58 -58
  183. package/extensions/trading/skills/quant-analysis.md +111 -111
  184. package/extensions/trading/skills/realtime-data.md +58 -58
  185. package/extensions/trading/skills/trade-logic.md +104 -104
  186. package/extensions/ui/PACK.md +130 -130
  187. package/extensions/ui/skills/a11y-audit.md +91 -91
  188. package/extensions/ui/skills/animation-patterns.md +127 -106
  189. package/extensions/ui/skills/component-patterns.md +100 -75
  190. package/extensions/ui/skills/design-decision.md +108 -108
  191. package/extensions/ui/skills/design-system.md +68 -68
  192. package/extensions/ui/skills/landing-patterns.md +155 -155
  193. package/extensions/ui/skills/palette-picker.md +173 -173
  194. package/extensions/ui/skills/react-health.md +90 -90
  195. package/extensions/ui/skills/type-system.md +125 -125
  196. package/extensions/ui/skills/web-vitals.md +153 -153
  197. package/extensions/zalo/PACK.md +145 -145
  198. package/extensions/zalo/skills/zalo-oa-mcp.md +317 -317
  199. package/extensions/zalo/skills/zalo-oa-messaging.md +429 -429
  200. package/extensions/zalo/skills/zalo-oa-setup.md +236 -236
  201. package/extensions/zalo/skills/zalo-oa-webhook.md +189 -189
  202. package/extensions/zalo/skills/zalo-personal-messaging.md +194 -194
  203. package/extensions/zalo/skills/zalo-personal-setup.md +153 -153
  204. package/extensions/zalo/skills/zalo-rate-guard.md +219 -219
  205. package/hooks/auto-format/index.cjs +48 -48
  206. package/hooks/context-watch/index.cjs +95 -68
  207. package/hooks/hooks.json +111 -111
  208. package/hooks/metrics-collector/index.cjs +86 -42
  209. package/hooks/post-session-reflect/index.cjs +189 -153
  210. package/hooks/pre-compact/index.cjs +95 -95
  211. package/hooks/run-hook.cmd +1 -1
  212. package/hooks/secrets-scan/index.cjs +100 -100
  213. package/hooks/session-start/index.cjs +71 -65
  214. package/hooks/typecheck/index.cjs +65 -65
  215. package/package.json +63 -63
  216. package/references/ui-pro-max-data/LICENSE-UI-PRO-MAX +21 -21
  217. package/references/ui-pro-max-data/charts.csv +26 -26
  218. package/references/ui-pro-max-data/colors.csv +161 -161
  219. package/references/ui-pro-max-data/styles.csv +68 -68
  220. package/references/ui-pro-max-data/typography.csv +74 -74
  221. package/references/ui-pro-max-data/ui-reasoning.csv +162 -162
  222. package/references/ui-pro-max-data/ux-guidelines.csv +99 -99
  223. package/skills/adversary/SKILL.md +283 -283
  224. package/skills/asset-creator/SKILL.md +157 -157
  225. package/skills/audit/SKILL.md +148 -2
  226. package/skills/autopsy/SKILL.md +335 -259
  227. package/skills/autopsy/references/repo-analysis-patterns.md +113 -0
  228. package/skills/ba/SKILL.md +72 -2
  229. package/skills/brainstorm/SKILL.md +342 -341
  230. package/skills/browser-pilot/SKILL.md +168 -168
  231. package/skills/constraint-check/SKILL.md +165 -165
  232. package/skills/context-engine/SKILL.md +404 -404
  233. package/skills/cook/SKILL.md +917 -834
  234. package/skills/cook/references/output-format.md +33 -0
  235. package/skills/db/SKILL.md +273 -272
  236. package/skills/debug/SKILL.md +465 -443
  237. package/skills/dependency-doctor/SKILL.md +265 -235
  238. package/skills/deploy/SKILL.md +274 -231
  239. package/skills/design/DESIGN-REFERENCE.md +365 -365
  240. package/skills/design/SKILL.md +589 -482
  241. package/skills/doc-processor/SKILL.md +254 -254
  242. package/skills/docs/SKILL.md +374 -373
  243. package/skills/docs-seeker/SKILL.md +177 -177
  244. package/skills/fix/SKILL.md +330 -308
  245. package/skills/git/SKILL.md +339 -339
  246. package/skills/graft/SKILL.md +352 -0
  247. package/skills/graft/references/challenge-framework.md +98 -0
  248. package/skills/graft/references/mode-decision.md +44 -0
  249. package/skills/hallucination-guard/SKILL.md +219 -219
  250. package/skills/incident/SKILL.md +254 -251
  251. package/skills/integrity-check/SKILL.md +169 -169
  252. package/skills/journal/SKILL.md +240 -238
  253. package/skills/launch/SKILL.md +344 -342
  254. package/skills/logic-guardian/SKILL.md +251 -251
  255. package/skills/marketing/SKILL.md +290 -245
  256. package/skills/mcp-builder/SKILL.md +425 -423
  257. package/skills/mcp-builder/references/auto-discovery-pattern.md +169 -0
  258. package/skills/neural-memory/SKILL.md +362 -362
  259. package/skills/onboard/SKILL.md +404 -403
  260. package/skills/perf/SKILL.md +346 -346
  261. package/skills/plan/SKILL.md +433 -370
  262. package/skills/plan/references/feature-map.md +84 -0
  263. package/skills/preflight/SKILL.md +415 -396
  264. package/skills/problem-solver/SKILL.md +380 -284
  265. package/skills/rescue/SKILL.md +474 -450
  266. package/skills/retro/SKILL.md +5 -1
  267. package/skills/review/SKILL.md +612 -535
  268. package/skills/review-intake/SKILL.md +249 -249
  269. package/skills/safeguard/SKILL.md +200 -200
  270. package/skills/sast/SKILL.md +190 -190
  271. package/skills/scaffold/SKILL.md +328 -286
  272. package/skills/scope-guard/SKILL.md +180 -162
  273. package/skills/scout/SKILL.md +263 -263
  274. package/skills/sentinel/SKILL.md +382 -353
  275. package/skills/sentinel-env/SKILL.md +254 -254
  276. package/skills/sequential-thinking/SKILL.md +234 -234
  277. package/skills/session-bridge/SKILL.md +543 -397
  278. package/skills/skill-forge/SKILL.md +581 -539
  279. package/skills/skill-router/{skill.md → SKILL.md} +30 -2
  280. package/skills/surgeon/SKILL.md +215 -215
  281. package/skills/team/SKILL.md +556 -514
  282. package/skills/test/SKILL.md +614 -587
  283. package/skills/trend-scout/SKILL.md +145 -145
  284. package/skills/verification/SKILL.md +326 -325
  285. package/skills/video-creator/SKILL.md +201 -201
  286. package/skills/watchdog/SKILL.md +168 -168
  287. package/skills/worktree/SKILL.md +140 -140
@@ -1,66 +1,66 @@
1
- ---
2
- name: "embedding-search"
3
- pack: "@rune/ai-ml"
4
- description: "Embedding-based search — semantic search, hybrid search (BM25 + vector), similarity thresholds, index optimization."
5
- model: sonnet
6
- tools: [Read, Edit, Write, Grep, Glob, Bash]
7
- ---
8
-
9
- # embedding-search
10
-
11
- Embedding-based search — semantic search, hybrid search (BM25 + vector), similarity thresholds, index optimization.
12
-
13
- #### Workflow
14
-
15
- **Step 1 — Detect search implementation**
16
- Use Grep to find search code: `similarity_search`, `vector_search`, `fts`, `tsvector`, `BM25`. Read search handlers to understand: query flow, ranking strategy, and result formatting.
17
-
18
- **Step 2 — Audit search quality**
19
- Check for: pure vector search without keyword fallback (misses exact matches), no similarity threshold (returns irrelevant results at low scores), missing query embedding cache (repeated queries re-embed), no hybrid scoring (BM25 for exact + vector for semantic), and unoptimized vector index (HNSW parameters not tuned).
20
-
21
- **Step 3 — Emit hybrid search**
22
- Emit: combined BM25 + vector search with reciprocal rank fusion, similarity threshold filtering, query embedding cache, and HNSW index tuning.
23
-
24
- #### Example
25
-
26
- ```typescript
27
- // Hybrid search — BM25 + vector with reciprocal rank fusion
28
- async function hybridSearch(query: string, limit = 10) {
29
- // Parallel: keyword (BM25) + semantic (vector)
30
- const [keywordResults, vectorResults] = await Promise.all([
31
- db.execute(sql`
32
- SELECT id, content, ts_rank(search_vector, plainto_tsquery(${query})) AS bm25_score
33
- FROM documents
34
- WHERE search_vector @@ plainto_tsquery(${query})
35
- ORDER BY bm25_score DESC LIMIT ${limit * 2}
36
- `),
37
- db.execute(sql`
38
- SELECT id, content, 1 - (embedding <=> ${await getEmbedding(query)}) AS vector_score
39
- FROM documents
40
- ORDER BY embedding <=> ${await getEmbedding(query)}
41
- LIMIT ${limit * 2}
42
- `),
43
- ]);
44
-
45
- // Reciprocal rank fusion (k=60)
46
- const scores = new Map<string, number>();
47
- const K = 60;
48
- keywordResults.forEach((r, i) => scores.set(r.id, (scores.get(r.id) || 0) + 1 / (K + i + 1)));
49
- vectorResults.forEach((r, i) => scores.set(r.id, (scores.get(r.id) || 0) + 1 / (K + i + 1)));
50
-
51
- return [...scores.entries()]
52
- .sort((a, b) => b[1] - a[1])
53
- .slice(0, limit)
54
- .filter(([_, score]) => score > 0.01); // threshold
55
- }
56
-
57
- // Embedding cache (avoid re-embedding repeated queries)
58
- const embeddingCache = new Map<string, number[]>();
59
- async function getEmbedding(text: string): Promise<number[]> {
60
- const cached = embeddingCache.get(text);
61
- if (cached) return cached;
62
- const { data } = await openai.embeddings.create({ model: 'text-embedding-3-small', input: text });
63
- embeddingCache.set(text, data[0].embedding);
64
- return data[0].embedding;
65
- }
66
- ```
1
+ ---
2
+ name: "embedding-search"
3
+ pack: "@rune/ai-ml"
4
+ description: "Embedding-based search — semantic search, hybrid search (BM25 + vector), similarity thresholds, index optimization."
5
+ model: sonnet
6
+ tools: [Read, Edit, Write, Grep, Glob, Bash]
7
+ ---
8
+
9
+ # embedding-search
10
+
11
+ Embedding-based search — semantic search, hybrid search (BM25 + vector), similarity thresholds, index optimization.
12
+
13
+ #### Workflow
14
+
15
+ **Step 1 — Detect search implementation**
16
+ Use Grep to find search code: `similarity_search`, `vector_search`, `fts`, `tsvector`, `BM25`. Read search handlers to understand: query flow, ranking strategy, and result formatting.
17
+
18
+ **Step 2 — Audit search quality**
19
+ Check for: pure vector search without keyword fallback (misses exact matches), no similarity threshold (returns irrelevant results at low scores), missing query embedding cache (repeated queries re-embed), no hybrid scoring (BM25 for exact + vector for semantic), and unoptimized vector index (HNSW parameters not tuned).
20
+
21
+ **Step 3 — Emit hybrid search**
22
+ Emit: combined BM25 + vector search with reciprocal rank fusion, similarity threshold filtering, query embedding cache, and HNSW index tuning.
23
+
24
+ #### Example
25
+
26
+ ```typescript
27
+ // Hybrid search — BM25 + vector with reciprocal rank fusion
28
+ async function hybridSearch(query: string, limit = 10) {
29
+ // Parallel: keyword (BM25) + semantic (vector)
30
+ const [keywordResults, vectorResults] = await Promise.all([
31
+ db.execute(sql`
32
+ SELECT id, content, ts_rank(search_vector, plainto_tsquery(${query})) AS bm25_score
33
+ FROM documents
34
+ WHERE search_vector @@ plainto_tsquery(${query})
35
+ ORDER BY bm25_score DESC LIMIT ${limit * 2}
36
+ `),
37
+ db.execute(sql`
38
+ SELECT id, content, 1 - (embedding <=> ${await getEmbedding(query)}) AS vector_score
39
+ FROM documents
40
+ ORDER BY embedding <=> ${await getEmbedding(query)}
41
+ LIMIT ${limit * 2}
42
+ `),
43
+ ]);
44
+
45
+ // Reciprocal rank fusion (k=60)
46
+ const scores = new Map<string, number>();
47
+ const K = 60;
48
+ keywordResults.forEach((r, i) => scores.set(r.id, (scores.get(r.id) || 0) + 1 / (K + i + 1)));
49
+ vectorResults.forEach((r, i) => scores.set(r.id, (scores.get(r.id) || 0) + 1 / (K + i + 1)));
50
+
51
+ return [...scores.entries()]
52
+ .sort((a, b) => b[1] - a[1])
53
+ .slice(0, limit)
54
+ .filter(([_, score]) => score > 0.01); // threshold
55
+ }
56
+
57
+ // Embedding cache (avoid re-embedding repeated queries)
58
+ const embeddingCache = new Map<string, number[]>();
59
+ async function getEmbedding(text: string): Promise<number[]> {
60
+ const cached = embeddingCache.get(text);
61
+ if (cached) return cached;
62
+ const { data } = await openai.embeddings.create({ model: 'text-embedding-3-small', input: text });
63
+ embeddingCache.set(text, data[0].embedding);
64
+ return data[0].embedding;
65
+ }
66
+ ```
@@ -1,74 +1,74 @@
1
- ---
2
- name: "fine-tuning-guide"
3
- pack: "@rune/ai-ml"
4
- description: "Fine-tuning workflows — dataset preparation, training configuration, evaluation metrics, deployment, A/B testing."
5
- model: sonnet
6
- tools: [Read, Edit, Write, Grep, Glob, Bash]
7
- ---
8
-
9
- # fine-tuning-guide
10
-
11
- Fine-tuning workflows — dataset preparation, training configuration, evaluation metrics, deployment, A/B testing.
12
-
13
- #### Workflow
14
-
15
- **Step 1 — Audit training data**
16
- Use Read to examine the dataset files. Check for: data format (JSONL with `messages` array), train/eval split (eval must not overlap with train), sufficient examples (minimum 50, recommended 200+), balanced class distribution, and PII in training data.
17
-
18
- **Step 2 — Prepare and validate dataset**
19
- Emit: JSONL formatter that validates each example, train/eval splitter with stratification, token count estimator (cost preview), and data quality checks (duplicate detection, format validation).
20
-
21
- **Step 3 — Execute fine-tuning and evaluate**
22
- Emit: fine-tune API call with hyperparameters, evaluation script that compares base vs fine-tuned on held-out set, and A/B deployment configuration.
23
-
24
- #### Example
25
-
26
- ```python
27
- # Fine-tuning workflow — prepare, train, evaluate
28
- import json
29
- import openai
30
- from sklearn.model_selection import train_test_split
31
-
32
- # Step 1: Prepare JSONL dataset
33
- def prepare_dataset(examples: list[dict], output_prefix: str):
34
- train, eval_set = train_test_split(examples, test_size=0.2, random_state=42)
35
-
36
- for split_name, split_data in [("train", train), ("eval", eval_set)]:
37
- path = f"{output_prefix}_{split_name}.jsonl"
38
- with open(path, "w") as f:
39
- for ex in split_data:
40
- f.write(json.dumps({"messages": [
41
- {"role": "system", "content": ex["system"]},
42
- {"role": "user", "content": ex["input"]},
43
- {"role": "assistant", "content": ex["output"]},
44
- ]}) + "\n")
45
- print(f"Wrote {len(split_data)} examples to {path}")
46
-
47
- # Step 2: Launch fine-tuning
48
- def start_fine_tune(train_file: str, eval_file: str):
49
- train_id = openai.files.create(file=open(train_file, "rb"), purpose="fine-tune").id
50
- eval_id = openai.files.create(file=open(eval_file, "rb"), purpose="fine-tune").id
51
-
52
- job = openai.fine_tuning.jobs.create(
53
- training_file=train_id,
54
- validation_file=eval_id,
55
- model="gpt-4o-mini-2024-07-18",
56
- hyperparameters={"n_epochs": 3, "batch_size": "auto", "learning_rate_multiplier": "auto"},
57
- )
58
- print(f"Fine-tuning job: {job.id} — status: {job.status}")
59
- return job
60
-
61
- # Step 3: Evaluate base vs fine-tuned
62
- def evaluate(base_model: str, ft_model: str, eval_set: list[dict]) -> dict:
63
- results = {"base": {"correct": 0}, "finetuned": {"correct": 0}}
64
- for ex in eval_set:
65
- for label, model in [("base", base_model), ("finetuned", ft_model)]:
66
- response = openai.chat.completions.create(
67
- model=model, messages=ex["messages"][:2], max_tokens=500,
68
- )
69
- if response.choices[0].message.content.strip() == ex["messages"][2]["content"].strip():
70
- results[label]["correct"] += 1
71
- for label in results:
72
- results[label]["accuracy"] = results[label]["correct"] / len(eval_set)
73
- return results
74
- ```
1
+ ---
2
+ name: "fine-tuning-guide"
3
+ pack: "@rune/ai-ml"
4
+ description: "Fine-tuning workflows — dataset preparation, training configuration, evaluation metrics, deployment, A/B testing."
5
+ model: sonnet
6
+ tools: [Read, Edit, Write, Grep, Glob, Bash]
7
+ ---
8
+
9
+ # fine-tuning-guide
10
+
11
+ Fine-tuning workflows — dataset preparation, training configuration, evaluation metrics, deployment, A/B testing.
12
+
13
+ #### Workflow
14
+
15
+ **Step 1 — Audit training data**
16
+ Use Read to examine the dataset files. Check for: data format (JSONL with `messages` array), train/eval split (eval must not overlap with train), sufficient examples (minimum 50, recommended 200+), balanced class distribution, and PII in training data.
17
+
18
+ **Step 2 — Prepare and validate dataset**
19
+ Emit: JSONL formatter that validates each example, train/eval splitter with stratification, token count estimator (cost preview), and data quality checks (duplicate detection, format validation).
20
+
21
+ **Step 3 — Execute fine-tuning and evaluate**
22
+ Emit: fine-tune API call with hyperparameters, evaluation script that compares base vs fine-tuned on held-out set, and A/B deployment configuration.
23
+
24
+ #### Example
25
+
26
+ ```python
27
+ # Fine-tuning workflow — prepare, train, evaluate
28
+ import json
29
+ import openai
30
+ from sklearn.model_selection import train_test_split
31
+
32
+ # Step 1: Prepare JSONL dataset
33
+ def prepare_dataset(examples: list[dict], output_prefix: str):
34
+ train, eval_set = train_test_split(examples, test_size=0.2, random_state=42)
35
+
36
+ for split_name, split_data in [("train", train), ("eval", eval_set)]:
37
+ path = f"{output_prefix}_{split_name}.jsonl"
38
+ with open(path, "w") as f:
39
+ for ex in split_data:
40
+ f.write(json.dumps({"messages": [
41
+ {"role": "system", "content": ex["system"]},
42
+ {"role": "user", "content": ex["input"]},
43
+ {"role": "assistant", "content": ex["output"]},
44
+ ]}) + "\n")
45
+ print(f"Wrote {len(split_data)} examples to {path}")
46
+
47
+ # Step 2: Launch fine-tuning
48
+ def start_fine_tune(train_file: str, eval_file: str):
49
+ train_id = openai.files.create(file=open(train_file, "rb"), purpose="fine-tune").id
50
+ eval_id = openai.files.create(file=open(eval_file, "rb"), purpose="fine-tune").id
51
+
52
+ job = openai.fine_tuning.jobs.create(
53
+ training_file=train_id,
54
+ validation_file=eval_id,
55
+ model="gpt-4o-mini-2024-07-18",
56
+ hyperparameters={"n_epochs": 3, "batch_size": "auto", "learning_rate_multiplier": "auto"},
57
+ )
58
+ print(f"Fine-tuning job: {job.id} — status: {job.status}")
59
+ return job
60
+
61
+ # Step 3: Evaluate base vs fine-tuned
62
+ def evaluate(base_model: str, ft_model: str, eval_set: list[dict]) -> dict:
63
+ results = {"base": {"correct": 0}, "finetuned": {"correct": 0}}
64
+ for ex in eval_set:
65
+ for label, model in [("base", base_model), ("finetuned", ft_model)]:
66
+ response = openai.chat.completions.create(
67
+ model=model, messages=ex["messages"][:2], max_tokens=500,
68
+ )
69
+ if response.choices[0].message.content.strip() == ex["messages"][2]["content"].strip():
70
+ results[label]["correct"] += 1
71
+ for label in results:
72
+ results[label]["accuracy"] = results[label]["correct"] / len(eval_set)
73
+ return results
74
+ ```
@@ -1,125 +1,125 @@
1
- ---
2
- name: "llm-architect"
3
- pack: "@rune/ai-ml"
4
- description: "LLM system architecture — model selection, prompt engineering patterns, evaluation frameworks, cost optimization, multi-model routing, and guardrail design."
5
- model: opus
6
- tools: [Read, Edit, Write, Grep, Glob, Bash]
7
- ---
8
-
9
- # llm-architect
10
-
11
- LLM system architecture — model selection, prompt engineering patterns, evaluation frameworks, cost optimization, multi-model routing, and guardrail design.
12
-
13
- #### Workflow
14
-
15
- **Step 1 — Assess LLM requirements**
16
- Understand the use case: what does the LLM need to do? Classify into:
17
- - **Generation**: open-ended text (blog, email, creative writing)
18
- - **Extraction**: structured data from unstructured input (JSON from text, entities, classification)
19
- - **Reasoning**: multi-step logic (math, code generation, planning)
20
- - **Conversation**: multi-turn dialogue with memory
21
- - **Agentic**: tool use, function calling, autonomous task execution
22
-
23
- For each class, identify: latency requirements (real-time < 2s, async < 30s, batch), accuracy requirements (critical = needs eval suite, casual = spot check), cost sensitivity (per-call budget), and data sensitivity (PII, HIPAA, can data leave the network?).
24
-
25
- **Step 2 — Model selection matrix**
26
- Based on requirements, recommend model tier:
27
-
28
- | Requirement | Recommended | Fallback |
29
- |------------|-------------|----------|
30
- | Fast + cheap (classification, routing) | Haiku / GPT-4o-mini | Local (Llama 3) |
31
- | Balanced (code, summaries, RAG) | Sonnet / GPT-4o | Haiku with retry |
32
- | Deep reasoning (architecture, math) | Opus / o1 | Sonnet with chain-of-thought |
33
- | On-premise required | Llama 3 / Mistral | Ollama local deployment |
34
- | Multimodal (vision + text) | Sonnet / GPT-4o | Local LLaVA |
35
-
36
- Emit: primary model, fallback model, estimated cost per 1K calls, and latency p50/p99.
37
-
38
- **Step 3 — Prompt architecture**
39
- Design the prompt structure:
40
- - **System prompt**: Role definition, constraints, output format. Keep under 500 tokens for cost efficiency.
41
- - **Few-shot examples**: 2-3 examples for extraction/classification tasks. Format matches expected output exactly.
42
- - **Chain-of-thought**: For reasoning tasks, explicitly request step-by-step thinking before final answer.
43
- - **Structured output**: JSON mode or tool use for extraction. Define schema with Zod/Pydantic for validation.
44
-
45
- **Step 4 — Guardrails and evaluation**
46
- Design safety and quality layers:
47
- - **Input guardrails**: PII detection, prompt injection detection, topic filtering
48
- - **Output guardrails**: Schema validation, hallucination checks, toxicity filtering
49
- - **Evaluation framework**: Define eval dataset (50+ examples), metrics (accuracy, latency, cost), and regression threshold (new prompt must not drop > 2% on any metric)
50
-
51
- Save architecture doc to `.rune/ai/llm-architecture.md`.
52
-
53
- #### Example
54
-
55
- ```typescript
56
- // Multi-model router with fallback
57
- interface ModelConfig {
58
- id: string;
59
- provider: 'anthropic' | 'openai' | 'local';
60
- costPer1kTokens: number;
61
- maxTokens: number;
62
- latencyP50Ms: number;
63
- }
64
-
65
- const MODELS: Record<string, ModelConfig> = {
66
- fast: {
67
- id: 'claude-haiku-4-5-20251001',
68
- provider: 'anthropic',
69
- costPer1kTokens: 0.001,
70
- maxTokens: 4096,
71
- latencyP50Ms: 200,
72
- },
73
- balanced: {
74
- id: 'claude-sonnet-4-6',
75
- provider: 'anthropic',
76
- costPer1kTokens: 0.01,
77
- maxTokens: 8192,
78
- latencyP50Ms: 800,
79
- },
80
- deep: {
81
- id: 'claude-opus-4-6',
82
- provider: 'anthropic',
83
- costPer1kTokens: 0.05,
84
- maxTokens: 16384,
85
- latencyP50Ms: 2000,
86
- },
87
- };
88
-
89
- type TaskComplexity = 'trivial' | 'standard' | 'complex';
90
-
91
- function selectModel(complexity: TaskComplexity): ModelConfig {
92
- const map: Record<TaskComplexity, string> = {
93
- trivial: 'fast',
94
- standard: 'balanced',
95
- complex: 'deep',
96
- };
97
- return MODELS[map[complexity]];
98
- }
99
-
100
- // Prompt architecture template
101
- const systemPrompt = `You are a ${role} assistant.
102
-
103
- CONSTRAINTS:
104
- - ${constraints.join('\n- ')}
105
-
106
- OUTPUT FORMAT:
107
- Return valid JSON matching this schema:
108
- ${JSON.stringify(outputSchema, null, 2)}
109
-
110
- Do not include explanations outside the JSON.`;
111
-
112
- // Guardrail: validate structured output
113
- import { z } from 'zod';
114
-
115
- const OutputSchema = z.object({
116
- classification: z.enum(['positive', 'negative', 'neutral']),
117
- confidence: z.number().min(0).max(1),
118
- reasoning: z.string().max(200),
119
- });
120
-
121
- function validateOutput(raw: string): z.infer<typeof OutputSchema> {
122
- const parsed = JSON.parse(raw);
123
- return OutputSchema.parse(parsed); // throws if invalid
124
- }
125
- ```
1
+ ---
2
+ name: "llm-architect"
3
+ pack: "@rune/ai-ml"
4
+ description: "LLM system architecture — model selection, prompt engineering patterns, evaluation frameworks, cost optimization, multi-model routing, and guardrail design."
5
+ model: opus
6
+ tools: [Read, Edit, Write, Grep, Glob, Bash]
7
+ ---
8
+
9
+ # llm-architect
10
+
11
+ LLM system architecture — model selection, prompt engineering patterns, evaluation frameworks, cost optimization, multi-model routing, and guardrail design.
12
+
13
+ #### Workflow
14
+
15
+ **Step 1 — Assess LLM requirements**
16
+ Understand the use case: what does the LLM need to do? Classify into:
17
+ - **Generation**: open-ended text (blog, email, creative writing)
18
+ - **Extraction**: structured data from unstructured input (JSON from text, entities, classification)
19
+ - **Reasoning**: multi-step logic (math, code generation, planning)
20
+ - **Conversation**: multi-turn dialogue with memory
21
+ - **Agentic**: tool use, function calling, autonomous task execution
22
+
23
+ For each class, identify: latency requirements (real-time < 2s, async < 30s, batch), accuracy requirements (critical = needs eval suite, casual = spot check), cost sensitivity (per-call budget), and data sensitivity (PII, HIPAA, can data leave the network?).
24
+
25
+ **Step 2 — Model selection matrix**
26
+ Based on requirements, recommend model tier:
27
+
28
+ | Requirement | Recommended | Fallback |
29
+ |------------|-------------|----------|
30
+ | Fast + cheap (classification, routing) | Haiku / GPT-4o-mini | Local (Llama 3) |
31
+ | Balanced (code, summaries, RAG) | Sonnet / GPT-4o | Haiku with retry |
32
+ | Deep reasoning (architecture, math) | Opus / o1 | Sonnet with chain-of-thought |
33
+ | On-premise required | Llama 3 / Mistral | Ollama local deployment |
34
+ | Multimodal (vision + text) | Sonnet / GPT-4o | Local LLaVA |
35
+
36
+ Emit: primary model, fallback model, estimated cost per 1K calls, and latency p50/p99.
37
+
38
+ **Step 3 — Prompt architecture**
39
+ Design the prompt structure:
40
+ - **System prompt**: Role definition, constraints, output format. Keep under 500 tokens for cost efficiency.
41
+ - **Few-shot examples**: 2-3 examples for extraction/classification tasks. Format matches expected output exactly.
42
+ - **Chain-of-thought**: For reasoning tasks, explicitly request step-by-step thinking before final answer.
43
+ - **Structured output**: JSON mode or tool use for extraction. Define schema with Zod/Pydantic for validation.
44
+
45
+ **Step 4 — Guardrails and evaluation**
46
+ Design safety and quality layers:
47
+ - **Input guardrails**: PII detection, prompt injection detection, topic filtering
48
+ - **Output guardrails**: Schema validation, hallucination checks, toxicity filtering
49
+ - **Evaluation framework**: Define eval dataset (50+ examples), metrics (accuracy, latency, cost), and regression threshold (new prompt must not drop > 2% on any metric)
50
+
51
+ Save architecture doc to `.rune/ai/llm-architecture.md`.
52
+
53
+ #### Example
54
+
55
+ ```typescript
56
+ // Multi-model router with fallback
57
+ interface ModelConfig {
58
+ id: string;
59
+ provider: 'anthropic' | 'openai' | 'local';
60
+ costPer1kTokens: number;
61
+ maxTokens: number;
62
+ latencyP50Ms: number;
63
+ }
64
+
65
+ const MODELS: Record<string, ModelConfig> = {
66
+ fast: {
67
+ id: 'claude-haiku-4-5-20251001',
68
+ provider: 'anthropic',
69
+ costPer1kTokens: 0.001,
70
+ maxTokens: 4096,
71
+ latencyP50Ms: 200,
72
+ },
73
+ balanced: {
74
+ id: 'claude-sonnet-4-6',
75
+ provider: 'anthropic',
76
+ costPer1kTokens: 0.01,
77
+ maxTokens: 8192,
78
+ latencyP50Ms: 800,
79
+ },
80
+ deep: {
81
+ id: 'claude-opus-4-6',
82
+ provider: 'anthropic',
83
+ costPer1kTokens: 0.05,
84
+ maxTokens: 16384,
85
+ latencyP50Ms: 2000,
86
+ },
87
+ };
88
+
89
+ type TaskComplexity = 'trivial' | 'standard' | 'complex';
90
+
91
+ function selectModel(complexity: TaskComplexity): ModelConfig {
92
+ const map: Record<TaskComplexity, string> = {
93
+ trivial: 'fast',
94
+ standard: 'balanced',
95
+ complex: 'deep',
96
+ };
97
+ return MODELS[map[complexity]];
98
+ }
99
+
100
+ // Prompt architecture template
101
+ const systemPrompt = `You are a ${role} assistant.
102
+
103
+ CONSTRAINTS:
104
+ - ${constraints.join('\n- ')}
105
+
106
+ OUTPUT FORMAT:
107
+ Return valid JSON matching this schema:
108
+ ${JSON.stringify(outputSchema, null, 2)}
109
+
110
+ Do not include explanations outside the JSON.`;
111
+
112
+ // Guardrail: validate structured output
113
+ import { z } from 'zod';
114
+
115
+ const OutputSchema = z.object({
116
+ classification: z.enum(['positive', 'negative', 'neutral']),
117
+ confidence: z.number().min(0).max(1),
118
+ reasoning: z.string().max(200),
119
+ });
120
+
121
+ function validateOutput(raw: string): z.infer<typeof OutputSchema> {
122
+ const parsed = JSON.parse(raw);
123
+ return OutputSchema.parse(parsed); // throws if invalid
124
+ }
125
+ ```