ll-skills 1.0.0
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/CHANGELOG.md +18 -0
- package/README.md +105 -0
- package/agents/ll-implementador.md +23 -0
- package/bin/install.js +475 -0
- package/hooks/ll-skills-check-update.js +157 -0
- package/package.json +38 -0
- package/skills/ll-atualizar/SKILL.md +68 -0
- package/skills/ll-decidir-antes/SKILL.md +81 -0
- package/skills/ll-decidir-antes/referencias/protocolo-entrevista.md +112 -0
- package/skills/ll-decidir-antes/referencias/template-spec.md +238 -0
- package/skills/ll-desarmar/SKILL.md +254 -0
- package/skills/ll-desarmar/referencias/execucao-adversarial.md +217 -0
- package/skills/ll-desarmar/referencias/humanos-e-substitutos.md +116 -0
- package/skills/ll-desarmar/referencias/placar-e-realimentacao.md +140 -0
- package/skills/ll-orquestrar/SKILL.md +100 -0
- package/skills/ll-pesquisar/SKILL.md +159 -0
- package/skills/ll-pesquisar/referencias/frente-de-pesquisa.md +147 -0
- package/skills/ll-pesquisar/referencias/sintese-e-fontes.md +148 -0
- package/skills/ll-pesquisar-mercado/SKILL.md +112 -0
- package/skills/ll-pesquisar-mercado/referencias/dossie.md +375 -0
- package/skills/ll-pesquisar-mercado/referencias/indice-e-fechamento.md +122 -0
- package/skills/ll-pesquisar-mercado/referencias/padroes-de-pesquisa.md +149 -0
- package/skills/ll-verificar-entrega/SKILL.md +73 -0
- package/skills/ll-verificar-entrega/referencias/briefs-auditoria.md +291 -0
- package/skills/ll-voltar-do-futuro/SKILL.md +239 -0
- package/skills/ll-voltar-do-futuro/referencias/anti-padroes-e-fundamentos.md +201 -0
- package/skills/ll-voltar-do-futuro/referencias/vetores-e-testes.md +228 -0
|
@@ -0,0 +1,228 @@
|
|
|
1
|
+
# Vetores de ataque, testes desarmadores e letalidade
|
|
2
|
+
|
|
3
|
+
Material de geração do premortem `ll-voltar-do-futuro`. Lido pelos narradores da F1 e pelo
|
|
4
|
+
orquestrador nas fases F2 e F3.
|
|
5
|
+
|
|
6
|
+
---
|
|
7
|
+
|
|
8
|
+
## Os 12 vetores de ataque
|
|
9
|
+
|
|
10
|
+
Checklist para cobrir o espaço de falha, **não texto a copiar**. Cada vetor é um gerador:
|
|
11
|
+
aplique-o à zona de ataque do dossiê da F0 e veja o que aparece. Um narrador que cobre 3
|
|
12
|
+
vetores distintos produz mais que um que aprofunda um só.
|
|
13
|
+
|
|
14
|
+
1. **Transferência de confiança entre camadas.** Validou A com rigor, assumiu B por
|
|
15
|
+
contiguidade. *"Transferimos a confiança da POC de ingestão para um domínio declarado
|
|
16
|
+
explicitamente fora de escopo."* É o vetor dominante quando existe uma camada bem
|
|
17
|
+
auditada — procure primeiro o que faz fronteira com ela.
|
|
18
|
+
|
|
19
|
+
2. **Métrica proxy que passa vs. métrica que importa.** Mediu *cobertura*, precisava de
|
|
20
|
+
*utilidade*. Mediu *latência*, precisava de *conversão*. Mediu *acurácia média*,
|
|
21
|
+
precisava de *pior caso na classe que paga*. Pergunta geradora: se essa métrica ficasse
|
|
22
|
+
perfeita, o produto passaria a funcionar? Se não, ela é proxy.
|
|
23
|
+
|
|
24
|
+
3. **Condição de contorno da evidência importada.** O estudo, benchmark ou blog post citado
|
|
25
|
+
vale sob condições que não são as suas — outro n, outro regime de tráfego, outro tipo de
|
|
26
|
+
usuário. *"Lemos a citação, não a condição de contorno."* Procure toda frase do tipo "a
|
|
27
|
+
literatura mostra que" e vá atrás da amostra do estudo.
|
|
28
|
+
|
|
29
|
+
4. **Identidade e chave entre contextos.** O que parece a mesma entidade em dois lugares não
|
|
30
|
+
é: nada se reaproveita, todo caso novo é cold start, e o dado acumulado não compõe.
|
|
31
|
+
Pergunta geradora: qual é a chave primária real que liga os contextos? Existe? Quem a
|
|
32
|
+
garante?
|
|
33
|
+
|
|
34
|
+
5. **Mudança de regime.** Provado em lote, máquina única, 2 dias; a operação real é contínua,
|
|
35
|
+
concorrente, por meses. Idempotência de replay sequencial vira race condition; o cron que
|
|
36
|
+
nunca falhou em 48h acumula deriva em 6 semanas.
|
|
37
|
+
|
|
38
|
+
6. **Economia unitária medida no ambiente errado.** Custo apurado sob assinatura, crédito
|
|
39
|
+
promocional, ambiente subsidiado ou custo fixo amortizado — quando o que decide o negócio
|
|
40
|
+
é **custo variável por unidade ativa a preço real**, no tier de qualidade que passou nos
|
|
41
|
+
testes, não no mais barato.
|
|
42
|
+
|
|
43
|
+
7. **Subdeterminação estatística.** Prometer resolução que a matemática não dá: n respostas
|
|
44
|
+
para m tópicos com m ≫ n; modelo que "converge com poucos dados" mas por *item*, não por
|
|
45
|
+
*usuário*; segmentação com célula de 3 pessoas. Faça a conta antes de escrever a falha —
|
|
46
|
+
o número é a falha.
|
|
47
|
+
|
|
48
|
+
8. **Viés de disponibilidade na amostra.** Mediu as fontes fáceis e chamou de "as fontes".
|
|
49
|
+
A cauda ignorada costuma ser a maioria do mercado. Pergunta geradora: qual fração do
|
|
50
|
+
universo real a amostra medida representa, em porcentagem?
|
|
51
|
+
|
|
52
|
+
9. **Dependência tratada como checkbox, não como arquitetura.** Parecer jurídico,
|
|
53
|
+
compliance, contrato de dados, proveniência, LGPD, licença de terceiro: coisas cuja
|
|
54
|
+
resposta **muda o desenho** e que são impraticáveis de retrofitar. Um item de dependência
|
|
55
|
+
agendado para "antes do lançamento" que deveria estar em "antes do modelo de dados" é
|
|
56
|
+
quase sempre uma falha do TOP 3.
|
|
57
|
+
|
|
58
|
+
10. **Plano B nunca avaliado.** A rota de fuga existe no papel e nunca teve eval; quando foi
|
|
59
|
+
preciso, era pior que o plano A e ninguém sabia. Pergunta geradora: o que acontece se a
|
|
60
|
+
aposta principal cair? Alguém já mediu a alternativa?
|
|
61
|
+
|
|
62
|
+
11. **Falha silenciosa.** O sistema não quebra: apodrece. Fila cresce, qualidade decai, custo
|
|
63
|
+
sangra, e ninguém tem o dashboard que mostraria. É o vetor mais letal por consumir runway
|
|
64
|
+
antes de aparecer.
|
|
65
|
+
|
|
66
|
+
12. **Presságio ignorado.** Um defeito já observado num contexto de baixo risco (alucinação
|
|
67
|
+
num campo secundário, flake num teste periférico) reaparece no dado mais sensível do
|
|
68
|
+
produto. Vasculhe as seções de "correções aplicadas" e "problemas encontrados" dos
|
|
69
|
+
artefatos: cada uma é um presságio catalogado.
|
|
70
|
+
|
|
71
|
+
---
|
|
72
|
+
|
|
73
|
+
## Anatomia de um teste desarmador — 8 componentes
|
|
74
|
+
|
|
75
|
+
Faltando qualquer um, o teste não desarma nada.
|
|
76
|
+
|
|
77
|
+
1. **A afirmação falsificável.** A premissa que morre se o teste reprovar, em uma frase, no
|
|
78
|
+
presente do indicativo: *"o pipeline extrai gabarito com fidelidade suficiente para um
|
|
79
|
+
produto de precisão"*. Se você não consegue escrever a frase, não entendeu a falha.
|
|
80
|
+
|
|
81
|
+
2. **A amostra mínima adversarial.** Não a representativa: a **desenhada para quebrar** —
|
|
82
|
+
os formatos raros, a banca esquisita, o caso com retificação, o usuário fora do perfil.
|
|
83
|
+
Amostra fácil produz aprovação falsa, e aprovação falsa é **pior** que não testar, porque
|
|
84
|
+
compra confiança.
|
|
85
|
+
|
|
86
|
+
3. **Ground truth independente do sistema testado.** Gabarito oficial digitado à mão; dois
|
|
87
|
+
revisores humanos com adjudicação do desacordo; ou um **critério externo** que mede
|
|
88
|
+
validade preditiva (desempenho posterior nos tópicos classificados "ok" vs "lacuna"). Sem
|
|
89
|
+
verdade independente, você está medindo o sistema contra si mesmo.
|
|
90
|
+
|
|
91
|
+
4. **O critério de aceite numérico, pré-registrado.** Número, unidade e direção, escritos
|
|
92
|
+
**antes** de rodar. Modelos que funcionam: *"erro de gabarito < 0,1%, erro de enunciado
|
|
93
|
+
< 1%, e detecção de 100% das retificações da amostra"*; *"≥ 95% de concordância
|
|
94
|
+
questão→nó e mapa de equivalência cobrindo ≥ 80% dos nós comuns"*; *"delta ≥ 20 p.p. e
|
|
95
|
+
≥ 7/10 participantes reconhecem o resultado"*; *"COGS/unidade ≤ 30% do menor preço da
|
|
96
|
+
tese"*; *"zero intervenção manual não planejada e fila humana < 15 min/dia"*.
|
|
97
|
+
Note o padrão: **critérios conjuntos** — um de qualidade, um de cobertura, um de operação
|
|
98
|
+
— porque um único número quase sempre tem um jeito trivial de passar.
|
|
99
|
+
|
|
100
|
+
5. **O teste do teste: escreva o resultado que reprova.** Antes de rodar, redija "este teste
|
|
101
|
+
reprova se ___". Se nenhum resultado plausível reprova, o critério está frouxo e o teste
|
|
102
|
+
é cerimônia. **O valor do teste é proporcional à sua probabilidade a priori de falhar.**
|
|
103
|
+
|
|
104
|
+
6. **Prazo e custo declarados.** *"5 dias, centavos de API + 2 dias de conferência."* Teste
|
|
105
|
+
sem orçamento explícito vira projeto. Teste que custa mais de 1–2 semanas ou que exige
|
|
106
|
+
construir o produto **não é teste, é o produto com outro nome** — e quase sempre existe
|
|
107
|
+
uma versão de mesa (simulação, planilha, amostra de 30, script) que ataca a mesma
|
|
108
|
+
premissa.
|
|
109
|
+
|
|
110
|
+
7. **A decisão pré-comprometida nos dois ramos.** O "se… então…" escrito **antes** de ver o
|
|
111
|
+
número: *"se o delta for < 10 p.p., o diagnóstico curto não discrimina e o produto precisa
|
|
112
|
+
ser redesenhado — diagnóstico contínuo, não teste inicial"*; *"se equivalência < 80%, o
|
|
113
|
+
modelo de domínio precisa de ontologia canônica antes do MVP"*. Sem pré-compromisso, o
|
|
114
|
+
número ruim é racionalizado no dia seguinte.
|
|
115
|
+
|
|
116
|
+
8. **A precedência.** O que este teste bloqueia: *"rodar antes de decidir preço, não
|
|
117
|
+
depois"*, *"antes de sistematizar"*, *"antes de uma linha de código"*. Um teste que roda
|
|
118
|
+
depois da decisão que deveria informar não é teste, é autópsia.
|
|
119
|
+
|
|
120
|
+
---
|
|
121
|
+
|
|
122
|
+
## Padrões de teste barato por tipo de incógnita
|
|
123
|
+
|
|
124
|
+
- **Fidelidade de extração/transformação** → amostra adversarial + ground truth manual +
|
|
125
|
+
taxa de erro **por classe de entrada** (revela a fronteira de validade, não só a média).
|
|
126
|
+
- **Concordância semântica / classificação** → duplo caminho independente + adjudicação
|
|
127
|
+
humana dos desacordos; mede concordância **e** acurácia adjudicada. Bônus frequente: o
|
|
128
|
+
padrão de teste vira o padrão de produção ("duplo caminho + juiz nos ~9% de desacordo").
|
|
129
|
+
- **Poder estatístico / convergência** → simulação com verdade conhecida (agentes sintéticos
|
|
130
|
+
de proficiência conhecida contra itens de dificuldade conhecida) sob o tráfego realmente
|
|
131
|
+
projetado. Custa 2 dias e responde o que 6 meses de produção responderiam.
|
|
132
|
+
- **Economia unitária** → bottom-up com preços reais, simulando um mês de **uma** unidade
|
|
133
|
+
ativa, usando o tier de qualidade que passou nos testes.
|
|
134
|
+
- **Regime contínuo** → rodar o pipeline em cron por N dias corridos sem intervenção, com
|
|
135
|
+
dashboard de 3–5 métricas, e o aceite formulado como **ausência de trabalho humano não
|
|
136
|
+
planejado**.
|
|
137
|
+
- **Dependência externa/legal** → memorando de perguntas objetivas + segunda opinião
|
|
138
|
+
adversarial; aceite = "risco classificado e mitigação escrita"; a saída esperada é um
|
|
139
|
+
**requisito de arquitetura**, não um parecer arquivado.
|
|
140
|
+
- **Percepção humana / desejabilidade** → 5 a 10 pessoas reais fora do time; aceite com
|
|
141
|
+
componente objetivo (desempenho, taxa de detecção) **e** subjetivo (n/10 concordam).
|
|
142
|
+
|
|
143
|
+
---
|
|
144
|
+
|
|
145
|
+
## Quando o teste exige terceiros indisponíveis
|
|
146
|
+
|
|
147
|
+
Substituir humanos por **simulação de personas** é legítimo como ponte, com três salvaguardas
|
|
148
|
+
obrigatórias:
|
|
149
|
+
|
|
150
|
+
- O perfil simulado fica **oculto do instrumento** testado — a persona responde em caráter;
|
|
151
|
+
quem avalia não vê o gabarito do perfil.
|
|
152
|
+
- O que a simulação **prova** e o que ela **não prova** vai escrito no resultado. Ela prova
|
|
153
|
+
propriedades aritméticas e estruturais do instrumento (num caso real, revelou que um acerto
|
|
154
|
+
por chute em item verdadeiro/falso certificava domínio — falha aritmética, válida também
|
|
155
|
+
para humanos, cuja correção derrubou o falso-positivo de 34% para 12%). Ela **não** prova
|
|
156
|
+
percepção subjetiva nem a estrutura real do conhecimento humano.
|
|
157
|
+
- O item permanece no placar como **PENDENTE, COM SUBSTITUTO DECLARADO** — rebaixado de
|
|
158
|
+
*bloqueio* para *validação pré-lançamento*, com o instrumento já corrigido e pronto para
|
|
159
|
+
disparar.
|
|
160
|
+
|
|
161
|
+
---
|
|
162
|
+
|
|
163
|
+
## Os 5 fatores de letalidade
|
|
164
|
+
|
|
165
|
+
Multiplicativos na prática. Use-os para justificar a ordem, por escrito, na F3.
|
|
166
|
+
|
|
167
|
+
1. **Mata ou machuca?** Letal = invalida a tese central de valor, torna o produto ilegal,
|
|
168
|
+
destrói reputação de forma irrecuperável, ou inverte a economia unitária. Não-letal =
|
|
169
|
+
atrasa, encarece, irrita. **Atraso não é letalidade.**
|
|
170
|
+
|
|
171
|
+
2. **Custo de retrofit / irreversibilidade.** Falha cuja correção exige refazer modelo de
|
|
172
|
+
dados, ontologia, proveniência ou contrato com terceiros é mais letal que outra de mesma
|
|
173
|
+
probabilidade corrigível com patch. "Impraticável de retrofitar" promove a falha ao TOP 3
|
|
174
|
+
quase sozinho.
|
|
175
|
+
|
|
176
|
+
3. **Centralidade de dependência.** Quantas decisões futuras dependem dessa premissa? A que
|
|
177
|
+
sustenta o esquema de indexação de tudo é mais letal que a que sustenta uma tela.
|
|
178
|
+
|
|
179
|
+
4. **Probabilidade dado o não medido.** Não é a probabilidade a priori: é a probabilidade
|
|
180
|
+
**condicionada ao fato de que ninguém olhou**. Camadas nunca observadas herdam a taxa-base
|
|
181
|
+
pessimista da referência externa — a *outside view*: qual a taxa histórica de fracasso
|
|
182
|
+
desse tipo de coisa em outros projetos? (Referência dura: ~92% dos megaprojetos estouram
|
|
183
|
+
prazo, orçamento ou ambos; sobrecustos médios de 20% a 45% por classe, estáveis há 70
|
|
184
|
+
anos.)
|
|
185
|
+
|
|
186
|
+
5. **Tempo até a detecção.** Falha silenciosa — apodrecimento, deriva de qualidade, custo que
|
|
187
|
+
sangra — é mais letal que falha barulhenta, porque consome runway antes de aparecer.
|
|
188
|
+
|
|
189
|
+
---
|
|
190
|
+
|
|
191
|
+
## Exemplo trabalhado de uma falha completa
|
|
192
|
+
|
|
193
|
+
Extraído de um premortem real (produto de estudo para concursos públicos, cuja POC auditara
|
|
194
|
+
com rigor apenas a camada de ingestão de editais). Use-o para calibrar densidade, cena e tom
|
|
195
|
+
de veredicto — não para copiar conteúdo.
|
|
196
|
+
|
|
197
|
+
<exemplo>
|
|
198
|
+
## ☠️ 1. O banco de questões nunca existiu — e um gabarito trocado nos matou em público *(TOP 3)*
|
|
199
|
+
|
|
200
|
+
**(a)** Lançamos com extração LLM de provas em PDF sem nunca ter medido acurácia de
|
|
201
|
+
gabarito. No 3º mês, um thread viral no r/concursos mostrou 4 questões Cebraspe com gabarito
|
|
202
|
+
invertido no app — o aluno estudou a resposta errada. Para um produto cujo slogan é "décimo
|
|
203
|
+
por décimo", foi morte reputacional instantânea.
|
|
204
|
+
**(b)** `fontes-de-questoes-e-editais.md` já avisava: "risco de erro de extração (gabarito
|
|
205
|
+
trocado é falha grave de produto — exige validação)" — mas a POC validou *editais* e
|
|
206
|
+
comemoramos como se fosse o pipeline inteiro. A correção nº 7 da POC (modelo barato
|
|
207
|
+
alucinando uma sigla com confiança 0,9) era o presságio: alucinação em dado derivado, agora
|
|
208
|
+
no dado mais sensível do produto. Viés: transferimos a confiança da POC de ingestão para um
|
|
209
|
+
domínio declarado explicitamente "fora de escopo / arquivamento incidental".
|
|
210
|
+
**(c)** POC de 5 dias: extrair 500 questões reais (3 bancas distintas, 2 formatos de questão,
|
|
211
|
+
1 prova com gabarito retificado pós-recurso), cruzar contra gabarito oficial definitivo
|
|
212
|
+
digitado à mão. **Aceite: erro de gabarito < 0,1% (idealmente zero), erro de
|
|
213
|
+
enunciado/alternativa < 1%, e detecção de 100% das retificações da amostra.** Reprova se
|
|
214
|
+
qualquer gabarito da amostra sair invertido. Custo: centavos de API + 2 dias de conferência.
|
|
215
|
+
Se reprovar, o banco de questões não entra no MVP por extração automática — vira curadoria
|
|
216
|
+
manual ou licenciamento. Bloqueia qualquer lançamento com questões.
|
|
217
|
+
</exemplo>
|
|
218
|
+
|
|
219
|
+
Repare no que faz a falha funcionar: a cena tem canal (thread no Reddit), data (3º mês),
|
|
220
|
+
número (4 questões) e dano de negócio (morte reputacional), não só o defeito técnico; a
|
|
221
|
+
citação é literal e traz o arquivo; o viés tem nome; o aceite tem três critérios conjuntos; e
|
|
222
|
+
a decisão de reprovação é uma mudança de produto, não um "vamos investigar".
|
|
223
|
+
|
|
224
|
+
E na síntese que fechou esse mesmo documento — o modelo do que a F4 deve produzir: *"morreu
|
|
225
|
+
de uma assimetria — rigor adversarial na camada de ingestão e fé bibliográfica em todo o
|
|
226
|
+
resto. Os três testes que teriam nos salvado custavam juntos menos de duas semanas e teriam
|
|
227
|
+
sido feitos antes de uma linha de código. A regra que faltou: nenhuma camada entra no roadmap
|
|
228
|
+
sem a sua própria auditoria que reprova primeiro."*
|