ll-skills 1.0.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (27) hide show
  1. package/CHANGELOG.md +18 -0
  2. package/README.md +105 -0
  3. package/agents/ll-implementador.md +23 -0
  4. package/bin/install.js +475 -0
  5. package/hooks/ll-skills-check-update.js +157 -0
  6. package/package.json +38 -0
  7. package/skills/ll-atualizar/SKILL.md +68 -0
  8. package/skills/ll-decidir-antes/SKILL.md +81 -0
  9. package/skills/ll-decidir-antes/referencias/protocolo-entrevista.md +112 -0
  10. package/skills/ll-decidir-antes/referencias/template-spec.md +238 -0
  11. package/skills/ll-desarmar/SKILL.md +254 -0
  12. package/skills/ll-desarmar/referencias/execucao-adversarial.md +217 -0
  13. package/skills/ll-desarmar/referencias/humanos-e-substitutos.md +116 -0
  14. package/skills/ll-desarmar/referencias/placar-e-realimentacao.md +140 -0
  15. package/skills/ll-orquestrar/SKILL.md +100 -0
  16. package/skills/ll-pesquisar/SKILL.md +159 -0
  17. package/skills/ll-pesquisar/referencias/frente-de-pesquisa.md +147 -0
  18. package/skills/ll-pesquisar/referencias/sintese-e-fontes.md +148 -0
  19. package/skills/ll-pesquisar-mercado/SKILL.md +112 -0
  20. package/skills/ll-pesquisar-mercado/referencias/dossie.md +375 -0
  21. package/skills/ll-pesquisar-mercado/referencias/indice-e-fechamento.md +122 -0
  22. package/skills/ll-pesquisar-mercado/referencias/padroes-de-pesquisa.md +149 -0
  23. package/skills/ll-verificar-entrega/SKILL.md +73 -0
  24. package/skills/ll-verificar-entrega/referencias/briefs-auditoria.md +291 -0
  25. package/skills/ll-voltar-do-futuro/SKILL.md +239 -0
  26. package/skills/ll-voltar-do-futuro/referencias/anti-padroes-e-fundamentos.md +201 -0
  27. package/skills/ll-voltar-do-futuro/referencias/vetores-e-testes.md +228 -0
@@ -0,0 +1,228 @@
1
+ # Vetores de ataque, testes desarmadores e letalidade
2
+
3
+ Material de geração do premortem `ll-voltar-do-futuro`. Lido pelos narradores da F1 e pelo
4
+ orquestrador nas fases F2 e F3.
5
+
6
+ ---
7
+
8
+ ## Os 12 vetores de ataque
9
+
10
+ Checklist para cobrir o espaço de falha, **não texto a copiar**. Cada vetor é um gerador:
11
+ aplique-o à zona de ataque do dossiê da F0 e veja o que aparece. Um narrador que cobre 3
12
+ vetores distintos produz mais que um que aprofunda um só.
13
+
14
+ 1. **Transferência de confiança entre camadas.** Validou A com rigor, assumiu B por
15
+ contiguidade. *"Transferimos a confiança da POC de ingestão para um domínio declarado
16
+ explicitamente fora de escopo."* É o vetor dominante quando existe uma camada bem
17
+ auditada — procure primeiro o que faz fronteira com ela.
18
+
19
+ 2. **Métrica proxy que passa vs. métrica que importa.** Mediu *cobertura*, precisava de
20
+ *utilidade*. Mediu *latência*, precisava de *conversão*. Mediu *acurácia média*,
21
+ precisava de *pior caso na classe que paga*. Pergunta geradora: se essa métrica ficasse
22
+ perfeita, o produto passaria a funcionar? Se não, ela é proxy.
23
+
24
+ 3. **Condição de contorno da evidência importada.** O estudo, benchmark ou blog post citado
25
+ vale sob condições que não são as suas — outro n, outro regime de tráfego, outro tipo de
26
+ usuário. *"Lemos a citação, não a condição de contorno."* Procure toda frase do tipo "a
27
+ literatura mostra que" e vá atrás da amostra do estudo.
28
+
29
+ 4. **Identidade e chave entre contextos.** O que parece a mesma entidade em dois lugares não
30
+ é: nada se reaproveita, todo caso novo é cold start, e o dado acumulado não compõe.
31
+ Pergunta geradora: qual é a chave primária real que liga os contextos? Existe? Quem a
32
+ garante?
33
+
34
+ 5. **Mudança de regime.** Provado em lote, máquina única, 2 dias; a operação real é contínua,
35
+ concorrente, por meses. Idempotência de replay sequencial vira race condition; o cron que
36
+ nunca falhou em 48h acumula deriva em 6 semanas.
37
+
38
+ 6. **Economia unitária medida no ambiente errado.** Custo apurado sob assinatura, crédito
39
+ promocional, ambiente subsidiado ou custo fixo amortizado — quando o que decide o negócio
40
+ é **custo variável por unidade ativa a preço real**, no tier de qualidade que passou nos
41
+ testes, não no mais barato.
42
+
43
+ 7. **Subdeterminação estatística.** Prometer resolução que a matemática não dá: n respostas
44
+ para m tópicos com m ≫ n; modelo que "converge com poucos dados" mas por *item*, não por
45
+ *usuário*; segmentação com célula de 3 pessoas. Faça a conta antes de escrever a falha —
46
+ o número é a falha.
47
+
48
+ 8. **Viés de disponibilidade na amostra.** Mediu as fontes fáceis e chamou de "as fontes".
49
+ A cauda ignorada costuma ser a maioria do mercado. Pergunta geradora: qual fração do
50
+ universo real a amostra medida representa, em porcentagem?
51
+
52
+ 9. **Dependência tratada como checkbox, não como arquitetura.** Parecer jurídico,
53
+ compliance, contrato de dados, proveniência, LGPD, licença de terceiro: coisas cuja
54
+ resposta **muda o desenho** e que são impraticáveis de retrofitar. Um item de dependência
55
+ agendado para "antes do lançamento" que deveria estar em "antes do modelo de dados" é
56
+ quase sempre uma falha do TOP 3.
57
+
58
+ 10. **Plano B nunca avaliado.** A rota de fuga existe no papel e nunca teve eval; quando foi
59
+ preciso, era pior que o plano A e ninguém sabia. Pergunta geradora: o que acontece se a
60
+ aposta principal cair? Alguém já mediu a alternativa?
61
+
62
+ 11. **Falha silenciosa.** O sistema não quebra: apodrece. Fila cresce, qualidade decai, custo
63
+ sangra, e ninguém tem o dashboard que mostraria. É o vetor mais letal por consumir runway
64
+ antes de aparecer.
65
+
66
+ 12. **Presságio ignorado.** Um defeito já observado num contexto de baixo risco (alucinação
67
+ num campo secundário, flake num teste periférico) reaparece no dado mais sensível do
68
+ produto. Vasculhe as seções de "correções aplicadas" e "problemas encontrados" dos
69
+ artefatos: cada uma é um presságio catalogado.
70
+
71
+ ---
72
+
73
+ ## Anatomia de um teste desarmador — 8 componentes
74
+
75
+ Faltando qualquer um, o teste não desarma nada.
76
+
77
+ 1. **A afirmação falsificável.** A premissa que morre se o teste reprovar, em uma frase, no
78
+ presente do indicativo: *"o pipeline extrai gabarito com fidelidade suficiente para um
79
+ produto de precisão"*. Se você não consegue escrever a frase, não entendeu a falha.
80
+
81
+ 2. **A amostra mínima adversarial.** Não a representativa: a **desenhada para quebrar** —
82
+ os formatos raros, a banca esquisita, o caso com retificação, o usuário fora do perfil.
83
+ Amostra fácil produz aprovação falsa, e aprovação falsa é **pior** que não testar, porque
84
+ compra confiança.
85
+
86
+ 3. **Ground truth independente do sistema testado.** Gabarito oficial digitado à mão; dois
87
+ revisores humanos com adjudicação do desacordo; ou um **critério externo** que mede
88
+ validade preditiva (desempenho posterior nos tópicos classificados "ok" vs "lacuna"). Sem
89
+ verdade independente, você está medindo o sistema contra si mesmo.
90
+
91
+ 4. **O critério de aceite numérico, pré-registrado.** Número, unidade e direção, escritos
92
+ **antes** de rodar. Modelos que funcionam: *"erro de gabarito < 0,1%, erro de enunciado
93
+ < 1%, e detecção de 100% das retificações da amostra"*; *"≥ 95% de concordância
94
+ questão→nó e mapa de equivalência cobrindo ≥ 80% dos nós comuns"*; *"delta ≥ 20 p.p. e
95
+ ≥ 7/10 participantes reconhecem o resultado"*; *"COGS/unidade ≤ 30% do menor preço da
96
+ tese"*; *"zero intervenção manual não planejada e fila humana < 15 min/dia"*.
97
+ Note o padrão: **critérios conjuntos** — um de qualidade, um de cobertura, um de operação
98
+ — porque um único número quase sempre tem um jeito trivial de passar.
99
+
100
+ 5. **O teste do teste: escreva o resultado que reprova.** Antes de rodar, redija "este teste
101
+ reprova se ___". Se nenhum resultado plausível reprova, o critério está frouxo e o teste
102
+ é cerimônia. **O valor do teste é proporcional à sua probabilidade a priori de falhar.**
103
+
104
+ 6. **Prazo e custo declarados.** *"5 dias, centavos de API + 2 dias de conferência."* Teste
105
+ sem orçamento explícito vira projeto. Teste que custa mais de 1–2 semanas ou que exige
106
+ construir o produto **não é teste, é o produto com outro nome** — e quase sempre existe
107
+ uma versão de mesa (simulação, planilha, amostra de 30, script) que ataca a mesma
108
+ premissa.
109
+
110
+ 7. **A decisão pré-comprometida nos dois ramos.** O "se… então…" escrito **antes** de ver o
111
+ número: *"se o delta for < 10 p.p., o diagnóstico curto não discrimina e o produto precisa
112
+ ser redesenhado — diagnóstico contínuo, não teste inicial"*; *"se equivalência < 80%, o
113
+ modelo de domínio precisa de ontologia canônica antes do MVP"*. Sem pré-compromisso, o
114
+ número ruim é racionalizado no dia seguinte.
115
+
116
+ 8. **A precedência.** O que este teste bloqueia: *"rodar antes de decidir preço, não
117
+ depois"*, *"antes de sistematizar"*, *"antes de uma linha de código"*. Um teste que roda
118
+ depois da decisão que deveria informar não é teste, é autópsia.
119
+
120
+ ---
121
+
122
+ ## Padrões de teste barato por tipo de incógnita
123
+
124
+ - **Fidelidade de extração/transformação** → amostra adversarial + ground truth manual +
125
+ taxa de erro **por classe de entrada** (revela a fronteira de validade, não só a média).
126
+ - **Concordância semântica / classificação** → duplo caminho independente + adjudicação
127
+ humana dos desacordos; mede concordância **e** acurácia adjudicada. Bônus frequente: o
128
+ padrão de teste vira o padrão de produção ("duplo caminho + juiz nos ~9% de desacordo").
129
+ - **Poder estatístico / convergência** → simulação com verdade conhecida (agentes sintéticos
130
+ de proficiência conhecida contra itens de dificuldade conhecida) sob o tráfego realmente
131
+ projetado. Custa 2 dias e responde o que 6 meses de produção responderiam.
132
+ - **Economia unitária** → bottom-up com preços reais, simulando um mês de **uma** unidade
133
+ ativa, usando o tier de qualidade que passou nos testes.
134
+ - **Regime contínuo** → rodar o pipeline em cron por N dias corridos sem intervenção, com
135
+ dashboard de 3–5 métricas, e o aceite formulado como **ausência de trabalho humano não
136
+ planejado**.
137
+ - **Dependência externa/legal** → memorando de perguntas objetivas + segunda opinião
138
+ adversarial; aceite = "risco classificado e mitigação escrita"; a saída esperada é um
139
+ **requisito de arquitetura**, não um parecer arquivado.
140
+ - **Percepção humana / desejabilidade** → 5 a 10 pessoas reais fora do time; aceite com
141
+ componente objetivo (desempenho, taxa de detecção) **e** subjetivo (n/10 concordam).
142
+
143
+ ---
144
+
145
+ ## Quando o teste exige terceiros indisponíveis
146
+
147
+ Substituir humanos por **simulação de personas** é legítimo como ponte, com três salvaguardas
148
+ obrigatórias:
149
+
150
+ - O perfil simulado fica **oculto do instrumento** testado — a persona responde em caráter;
151
+ quem avalia não vê o gabarito do perfil.
152
+ - O que a simulação **prova** e o que ela **não prova** vai escrito no resultado. Ela prova
153
+ propriedades aritméticas e estruturais do instrumento (num caso real, revelou que um acerto
154
+ por chute em item verdadeiro/falso certificava domínio — falha aritmética, válida também
155
+ para humanos, cuja correção derrubou o falso-positivo de 34% para 12%). Ela **não** prova
156
+ percepção subjetiva nem a estrutura real do conhecimento humano.
157
+ - O item permanece no placar como **PENDENTE, COM SUBSTITUTO DECLARADO** — rebaixado de
158
+ *bloqueio* para *validação pré-lançamento*, com o instrumento já corrigido e pronto para
159
+ disparar.
160
+
161
+ ---
162
+
163
+ ## Os 5 fatores de letalidade
164
+
165
+ Multiplicativos na prática. Use-os para justificar a ordem, por escrito, na F3.
166
+
167
+ 1. **Mata ou machuca?** Letal = invalida a tese central de valor, torna o produto ilegal,
168
+ destrói reputação de forma irrecuperável, ou inverte a economia unitária. Não-letal =
169
+ atrasa, encarece, irrita. **Atraso não é letalidade.**
170
+
171
+ 2. **Custo de retrofit / irreversibilidade.** Falha cuja correção exige refazer modelo de
172
+ dados, ontologia, proveniência ou contrato com terceiros é mais letal que outra de mesma
173
+ probabilidade corrigível com patch. "Impraticável de retrofitar" promove a falha ao TOP 3
174
+ quase sozinho.
175
+
176
+ 3. **Centralidade de dependência.** Quantas decisões futuras dependem dessa premissa? A que
177
+ sustenta o esquema de indexação de tudo é mais letal que a que sustenta uma tela.
178
+
179
+ 4. **Probabilidade dado o não medido.** Não é a probabilidade a priori: é a probabilidade
180
+ **condicionada ao fato de que ninguém olhou**. Camadas nunca observadas herdam a taxa-base
181
+ pessimista da referência externa — a *outside view*: qual a taxa histórica de fracasso
182
+ desse tipo de coisa em outros projetos? (Referência dura: ~92% dos megaprojetos estouram
183
+ prazo, orçamento ou ambos; sobrecustos médios de 20% a 45% por classe, estáveis há 70
184
+ anos.)
185
+
186
+ 5. **Tempo até a detecção.** Falha silenciosa — apodrecimento, deriva de qualidade, custo que
187
+ sangra — é mais letal que falha barulhenta, porque consome runway antes de aparecer.
188
+
189
+ ---
190
+
191
+ ## Exemplo trabalhado de uma falha completa
192
+
193
+ Extraído de um premortem real (produto de estudo para concursos públicos, cuja POC auditara
194
+ com rigor apenas a camada de ingestão de editais). Use-o para calibrar densidade, cena e tom
195
+ de veredicto — não para copiar conteúdo.
196
+
197
+ <exemplo>
198
+ ## ☠️ 1. O banco de questões nunca existiu — e um gabarito trocado nos matou em público *(TOP 3)*
199
+
200
+ **(a)** Lançamos com extração LLM de provas em PDF sem nunca ter medido acurácia de
201
+ gabarito. No 3º mês, um thread viral no r/concursos mostrou 4 questões Cebraspe com gabarito
202
+ invertido no app — o aluno estudou a resposta errada. Para um produto cujo slogan é "décimo
203
+ por décimo", foi morte reputacional instantânea.
204
+ **(b)** `fontes-de-questoes-e-editais.md` já avisava: "risco de erro de extração (gabarito
205
+ trocado é falha grave de produto — exige validação)" — mas a POC validou *editais* e
206
+ comemoramos como se fosse o pipeline inteiro. A correção nº 7 da POC (modelo barato
207
+ alucinando uma sigla com confiança 0,9) era o presságio: alucinação em dado derivado, agora
208
+ no dado mais sensível do produto. Viés: transferimos a confiança da POC de ingestão para um
209
+ domínio declarado explicitamente "fora de escopo / arquivamento incidental".
210
+ **(c)** POC de 5 dias: extrair 500 questões reais (3 bancas distintas, 2 formatos de questão,
211
+ 1 prova com gabarito retificado pós-recurso), cruzar contra gabarito oficial definitivo
212
+ digitado à mão. **Aceite: erro de gabarito < 0,1% (idealmente zero), erro de
213
+ enunciado/alternativa < 1%, e detecção de 100% das retificações da amostra.** Reprova se
214
+ qualquer gabarito da amostra sair invertido. Custo: centavos de API + 2 dias de conferência.
215
+ Se reprovar, o banco de questões não entra no MVP por extração automática — vira curadoria
216
+ manual ou licenciamento. Bloqueia qualquer lançamento com questões.
217
+ </exemplo>
218
+
219
+ Repare no que faz a falha funcionar: a cena tem canal (thread no Reddit), data (3º mês),
220
+ número (4 questões) e dano de negócio (morte reputacional), não só o defeito técnico; a
221
+ citação é literal e traz o arquivo; o viés tem nome; o aceite tem três critérios conjuntos; e
222
+ a decisão de reprovação é uma mudança de produto, não um "vamos investigar".
223
+
224
+ E na síntese que fechou esse mesmo documento — o modelo do que a F4 deve produzir: *"morreu
225
+ de uma assimetria — rigor adversarial na camada de ingestão e fé bibliográfica em todo o
226
+ resto. Os três testes que teriam nos salvado custavam juntos menos de duas semanas e teriam
227
+ sido feitos antes de uma linha de código. A regra que faltou: nenhuma camada entra no roadmap
228
+ sem a sua própria auditoria que reprova primeiro."*