santismm-knowledge-mcp 0.2.1

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (182) hide show
  1. package/LICENSE +21 -0
  2. package/README.md +62 -0
  3. package/content/CONVENTIONS.md +77 -0
  4. package/content/LICENSE +55 -0
  5. package/content/architectures/ai-workforce.json +280 -0
  6. package/content/architectures/customer-service-agent.json +292 -0
  7. package/content/architectures/enterprise-knowledge-assistant.json +292 -0
  8. package/content/architectures/operations-center.json +280 -0
  9. package/content/architectures/sales-copilot.json +280 -0
  10. package/content/governance/agentic-ai-governance-checklist.json +323 -0
  11. package/content/governance/audit-framework-for-agentic-systems.json +280 -0
  12. package/content/governance/enterprise-ai-governance-framework.json +277 -0
  13. package/content/governance/eu-ai-act.json +162 -0
  14. package/content/governance/human-oversight-and-accountability-policy.json +275 -0
  15. package/content/governance/iso-42001.json +161 -0
  16. package/content/governance/mitre-atlas.json +280 -0
  17. package/content/governance/nist-ai-rmf.json +161 -0
  18. package/content/governance/owasp-llm-top10.json +301 -0
  19. package/content/harness/HRN-001-definition-and-overview.es.md +76 -0
  20. package/content/harness/HRN-001-definition-and-overview.md +125 -0
  21. package/content/harness/HRN-001-definition-and-overview.pt.md +76 -0
  22. package/content/harness/HRN-002-a-brief-history-of-harness-engineering.es.md +83 -0
  23. package/content/harness/HRN-002-a-brief-history-of-harness-engineering.md +113 -0
  24. package/content/harness/HRN-002-a-brief-history-of-harness-engineering.pt.md +83 -0
  25. package/content/harness/HRN-003-the-harness-taxonomy.es.md +105 -0
  26. package/content/harness/HRN-003-the-harness-taxonomy.md +158 -0
  27. package/content/harness/HRN-003-the-harness-taxonomy.pt.md +105 -0
  28. package/content/harness/HRN-004-harness-engineering-principles.es.md +91 -0
  29. package/content/harness/HRN-004-harness-engineering-principles.md +135 -0
  30. package/content/harness/HRN-004-harness-engineering-principles.pt.md +91 -0
  31. package/content/harness/HRN-005-memory-in-agentic-systems.es.md +98 -0
  32. package/content/harness/HRN-005-memory-in-agentic-systems.md +145 -0
  33. package/content/harness/HRN-005-memory-in-agentic-systems.pt.md +98 -0
  34. package/content/harness/HRN-006-observability-for-agentic-systems.es.md +97 -0
  35. package/content/harness/HRN-006-observability-for-agentic-systems.md +139 -0
  36. package/content/harness/HRN-006-observability-for-agentic-systems.pt.md +97 -0
  37. package/content/harness/HRN-007-evaluation-of-agentic-systems.es.md +96 -0
  38. package/content/harness/HRN-007-evaluation-of-agentic-systems.md +145 -0
  39. package/content/harness/HRN-007-evaluation-of-agentic-systems.pt.md +96 -0
  40. package/content/harness/HRN-008-governance-within-the-harness.es.md +105 -0
  41. package/content/harness/HRN-008-governance-within-the-harness.md +146 -0
  42. package/content/harness/HRN-008-governance-within-the-harness.pt.md +105 -0
  43. package/content/harness/HRN-009-planning-and-goal-management.es.md +102 -0
  44. package/content/harness/HRN-009-planning-and-goal-management.md +142 -0
  45. package/content/harness/HRN-009-planning-and-goal-management.pt.md +102 -0
  46. package/content/harness/HRN-010-orchestration.es.md +107 -0
  47. package/content/harness/HRN-010-orchestration.md +149 -0
  48. package/content/harness/HRN-010-orchestration.pt.md +107 -0
  49. package/content/harness/HRN-011-security-for-agentic-systems.es.md +107 -0
  50. package/content/harness/HRN-011-security-for-agentic-systems.md +147 -0
  51. package/content/harness/HRN-011-security-for-agentic-systems.pt.md +107 -0
  52. package/content/harness/HRN-012-case-studies-in-harness-engineering.es.md +120 -0
  53. package/content/harness/HRN-012-case-studies-in-harness-engineering.md +157 -0
  54. package/content/harness/HRN-012-case-studies-in-harness-engineering.pt.md +120 -0
  55. package/content/harness/HRN-013-glossary.es.md +109 -0
  56. package/content/harness/HRN-013-glossary.md +124 -0
  57. package/content/harness/HRN-013-glossary.pt.md +109 -0
  58. package/content/harness/HRN-014-bibliography.es.md +89 -0
  59. package/content/harness/HRN-014-bibliography.md +109 -0
  60. package/content/harness/HRN-014-bibliography.pt.md +89 -0
  61. package/content/homeric/episodes/achilles-and-hector.json +139 -0
  62. package/content/homeric/episodes/aeolus-and-the-winds.json +131 -0
  63. package/content/homeric/episodes/agamemnons-murder.json +162 -0
  64. package/content/homeric/episodes/calypso-ogygia.json +157 -0
  65. package/content/homeric/episodes/catalogue-of-ships.json +177 -0
  66. package/content/homeric/episodes/cattle-of-the-sun.json +131 -0
  67. package/content/homeric/episodes/chryse-and-the-plague.json +131 -0
  68. package/content/homeric/episodes/cicones-at-ismarus.json +131 -0
  69. package/content/homeric/episodes/circe-on-aeaea.json +131 -0
  70. package/content/homeric/episodes/cyclops-polyphemus.json +162 -0
  71. package/content/homeric/episodes/laestrygonians.json +153 -0
  72. package/content/homeric/episodes/lotus-eaters.json +138 -0
  73. package/content/homeric/episodes/menelaus-and-proteus.json +130 -0
  74. package/content/homeric/episodes/nekyia.json +160 -0
  75. package/content/homeric/episodes/phaeacians-on-scheria.json +129 -0
  76. package/content/homeric/episodes/priams-ransom.json +131 -0
  77. package/content/homeric/episodes/return-to-ithaca.json +167 -0
  78. package/content/homeric/episodes/scylla-and-charybdis.json +131 -0
  79. package/content/homeric/episodes/suitors-ambush-at-asteris.json +131 -0
  80. package/content/homeric/episodes/telemachus-at-pylos.json +130 -0
  81. package/content/homeric/episodes/telemachus-in-sparta.json +130 -0
  82. package/content/homeric/episodes/the-achaean-camp.json +138 -0
  83. package/content/homeric/episodes/the-sirens.json +129 -0
  84. package/content/homeric/episodes/wooden-horse.json +168 -0
  85. package/content/homeric/places/aeaea.json +129 -0
  86. package/content/homeric/places/aeolia.json +161 -0
  87. package/content/homeric/places/asteris.json +120 -0
  88. package/content/homeric/places/aulis.json +122 -0
  89. package/content/homeric/places/cape-malea.json +126 -0
  90. package/content/homeric/places/chryse.json +120 -0
  91. package/content/homeric/places/dodona.json +129 -0
  92. package/content/homeric/places/dulichium.json +177 -0
  93. package/content/homeric/places/egypt.json +125 -0
  94. package/content/homeric/places/ephyra-acheron.json +127 -0
  95. package/content/homeric/places/hellespont.json +125 -0
  96. package/content/homeric/places/house-of-hades.json +91 -0
  97. package/content/homeric/places/ismarus.json +120 -0
  98. package/content/homeric/places/ithaca.json +240 -0
  99. package/content/homeric/places/knossos.json +132 -0
  100. package/content/homeric/places/laestrygonia.json +168 -0
  101. package/content/homeric/places/land-of-the-cyclopes.json +169 -0
  102. package/content/homeric/places/land-of-the-lotus-eaters.json +122 -0
  103. package/content/homeric/places/mount-ida.json +126 -0
  104. package/content/homeric/places/mycenae.json +152 -0
  105. package/content/homeric/places/ogygia.json +125 -0
  106. package/content/homeric/places/pharos.json +120 -0
  107. package/content/homeric/places/planctae.json +77 -0
  108. package/content/homeric/places/pylos.json +188 -0
  109. package/content/homeric/places/same.json +177 -0
  110. package/content/homeric/places/scheria.json +129 -0
  111. package/content/homeric/places/scylla-and-charybdis.json +135 -0
  112. package/content/homeric/places/sirens.json +127 -0
  113. package/content/homeric/places/sparta.json +179 -0
  114. package/content/homeric/places/tenedos.json +129 -0
  115. package/content/homeric/places/thrinacia.json +116 -0
  116. package/content/homeric/places/tiryns.json +123 -0
  117. package/content/homeric/places/troy.json +224 -0
  118. package/content/homeric/places/zacynthus.json +126 -0
  119. package/content/homeric/routes/achaean-expedition.json +132 -0
  120. package/content/homeric/routes/nostoi-of-the-others.json +205 -0
  121. package/content/homeric/routes/odysseus-nostos.json +307 -0
  122. package/content/homeric/routes/telemachy.json +134 -0
  123. package/content/knowledge/agent-memory.json +153 -0
  124. package/content/knowledge/agentic-ai.json +158 -0
  125. package/content/knowledge/agentic-evaluation.json +156 -0
  126. package/content/knowledge/agentic-threat-model.json +287 -0
  127. package/content/knowledge/ai-agent.json +153 -0
  128. package/content/knowledge/ai-cyberdefense.json +274 -0
  129. package/content/knowledge/ai-governance.json +155 -0
  130. package/content/knowledge/ai-observability.json +156 -0
  131. package/content/knowledge/context-engineering.json +153 -0
  132. package/content/knowledge/embeddings.json +153 -0
  133. package/content/knowledge/enterprise-rag.json +154 -0
  134. package/content/knowledge/fine-tuning.json +153 -0
  135. package/content/knowledge/foundation-models.json +154 -0
  136. package/content/knowledge/guardrails.json +153 -0
  137. package/content/knowledge/harness-engineering.json +158 -0
  138. package/content/knowledge/human-in-the-loop.json +153 -0
  139. package/content/knowledge/mcp-security.json +284 -0
  140. package/content/knowledge/model-context-protocol.json +154 -0
  141. package/content/knowledge/multi-agent-architecture.json +153 -0
  142. package/content/knowledge/prompt-engineering.json +153 -0
  143. package/content/knowledge/prompt-injection.json +138 -0
  144. package/content/knowledge/reasoning-models.json +153 -0
  145. package/content/knowledge/tool-use.json +156 -0
  146. package/content/library/cognitive-architecture-emergent-ai.md +15 -0
  147. package/content/library/devready-ep108-ai-customer-experiences.md +14 -0
  148. package/content/library/how-genai-impact-business.md +12 -0
  149. package/content/library/lmm-reshaping-industries-2024.md +12 -0
  150. package/content/library/rethinking-ai-pause.md +12 -0
  151. package/content/library/rise-of-agentic-ai.md +16 -0
  152. package/content/library/self-improving-autonomous-ai.md +16 -0
  153. package/content/library/the-stopwatch-and-the-exam.md +12 -0
  154. package/content/library/unlock-gpt4-secrets.md +12 -0
  155. package/content/library/vibe-coding-enterprise.md +15 -0
  156. package/content/library/video-transformando-negocios-genai.md +14 -0
  157. package/content/library/video-volando-alto-sky-airlines.md +13 -0
  158. package/content/matrix/agentic-control-matrix.json +967 -0
  159. package/content/patterns/attributed-memory.json +237 -0
  160. package/content/patterns/context-compression.json +304 -0
  161. package/content/patterns/egress-allowlist.json +310 -0
  162. package/content/patterns/evaluator-optimizer.json +180 -0
  163. package/content/patterns/goal-decomposition.json +290 -0
  164. package/content/patterns/human-approval-gate.json +311 -0
  165. package/content/patterns/human-escalation.json +288 -0
  166. package/content/patterns/least-privilege-tooling.json +333 -0
  167. package/content/patterns/long-term-memory.json +305 -0
  168. package/content/patterns/orchestrator-workers.json +202 -0
  169. package/content/patterns/parallelization.json +180 -0
  170. package/content/patterns/prompt-chaining.json +181 -0
  171. package/content/patterns/recovery-strategy.json +305 -0
  172. package/content/patterns/reflection.json +298 -0
  173. package/content/patterns/routing.json +294 -0
  174. package/content/patterns/sandboxed-execution.json +311 -0
  175. package/content/patterns/semantic-caching.json +201 -0
  176. package/content/patterns/supervisor-agent.json +290 -0
  177. package/content/patterns/task-prioritization.json +307 -0
  178. package/dist/content.js +181 -0
  179. package/dist/index.js +27 -0
  180. package/dist/shape.js +649 -0
  181. package/dist/tools.js +652 -0
  182. package/package.json +47 -0
@@ -0,0 +1,153 @@
1
+ {
2
+ "slug": "context-engineering",
3
+ "category": "harness",
4
+ "updated": "2026-06-21",
5
+ "version": "1.0",
6
+ "related": ["harness-engineering", "prompt-engineering", "agent-memory", "enterprise-rag"],
7
+ "references": [
8
+ { "title": "Anthropic — Effective context engineering for AI agents (2025)", "url": "https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents" },
9
+ { "title": "Anthropic — Building Effective Agents (2024)", "url": "https://www.anthropic.com/research/building-effective-agents" }
10
+ ],
11
+ "evidence": {
12
+ "evidenceLevel": "industry_observation",
13
+ "confidenceLevel": "high",
14
+ "sourceType": ["industry_observation", "paper"]
15
+ },
16
+ "locales": {
17
+ "en": {
18
+ "title": "What is Context Engineering?",
19
+ "summary": "Context engineering is the discipline of deciding what information enters a model's limited context window at each step — and what stays out. As agents run over many steps, naively stuffing everything into context degrades quality and cost. Context engineering curates the right instructions, retrieved knowledge, tool results and memory so the model has exactly what it needs, when it needs it. It is a core part of harness engineering.",
20
+ "definition": "Context engineering is the practice of curating, compressing and sequencing the information placed in a model's context window so it has the most relevant signal — and the least noise — at each step.",
21
+ "takeaways": [
22
+ "Context is a scarce resource; what you leave out matters as much as what you include.",
23
+ "More context is not better — irrelevant tokens degrade quality and raise cost.",
24
+ "Techniques: retrieval, summarization, compaction, and structured memory.",
25
+ "It generalizes prompt engineering from one prompt to a whole agent run.",
26
+ "It is a core layer of the harness around a model."
27
+ ],
28
+ "context": [
29
+ "Every model has a finite context window, and quality degrades when it is filled with low-signal content. In single-turn use this is manageable, but agents accumulate history, tool outputs and retrieved documents across many steps, quickly overwhelming the window.",
30
+ "Context engineering treats the window as a budget to be managed deliberately: keep the durable instructions, retrieve only what is relevant now, summarize or compact the rest, and store long-term state outside the window in memory."
31
+ ],
32
+ "architecture": [
33
+ "Core moves: select (retrieve only relevant passages), compress (summarize prior steps), compact (drop or fold stale turns), and externalize (push long-term state to a memory store, pulling it back on demand).",
34
+ "In an agent loop, context is reassembled each step from layered sources: stable system instructions, task state, relevant retrieved knowledge, recent tool results and selected long-term memories — ordered so the most important signal is most salient."
35
+ ],
36
+ "components": ["System instructions", "Task state", "Retrieved knowledge", "Tool results", "Long-term memory", "Summaries / compaction"],
37
+ "pros": [
38
+ "Keeps quality high as tasks grow long.",
39
+ "Controls token cost and latency.",
40
+ "Reduces distraction and hallucination from noise.",
41
+ "Enables long-horizon agents within finite context."
42
+ ],
43
+ "risks": [
44
+ "Over-aggressive compression can drop needed information.",
45
+ "Poor retrieval injects irrelevant or wrong context.",
46
+ "Complexity in deciding what to keep each step.",
47
+ "Bugs here surface as subtle quality regressions."
48
+ ],
49
+ "tools": ["Retrieval / RAG pipelines", "Summarization models", "Memory stores", "Context-management frameworks (e.g. LangGraph)"],
50
+ "examples": [
51
+ "Summarizing earlier agent steps so the window stays focused on the current subtask.",
52
+ "Retrieving only the policy section relevant to a question instead of the whole manual.",
53
+ "Storing a user's preferences in memory and recalling them only when relevant."
54
+ ],
55
+ "faqs": [
56
+ { "q": "How is context engineering different from prompt engineering?", "a": "Prompt engineering crafts a single instruction. Context engineering manages the full set of information in the window across an entire agent run — retrieval, memory, tool results and compression included." },
57
+ { "q": "Why not just use a bigger context window?", "a": "Larger windows help but do not eliminate the problem: quality and cost degrade as windows fill with low-signal tokens. Curation still wins." },
58
+ { "q": "How does it relate to RAG and memory?", "a": "RAG and memory are sources of context; context engineering decides what from them actually enters the window, when, and in what form." },
59
+ { "q": "Is it part of harness engineering?", "a": "Yes. Context management is one of the core layers of the harness that turns model capability into reliable agent behavior." }
60
+ ]
61
+ },
62
+ "es": {
63
+ "title": "¿Qué es la Ingeniería de Contexto (Context Engineering)?",
64
+ "summary": "La ingeniería de contexto es la disciplina de decidir qué información entra en la ventana de contexto limitada de un modelo en cada paso, y qué se queda fuera. Como los agentes se ejecutan en muchos pasos, meter todo ingenuamente en el contexto degrada calidad y coste. La ingeniería de contexto cura las instrucciones, el conocimiento recuperado, los resultados de herramientas y la memoria adecuados para que el modelo tenga justo lo que necesita cuando lo necesita. Es una parte central de la ingeniería de harness.",
65
+ "definition": "La ingeniería de contexto es la práctica de curar, comprimir y secuenciar la información que se coloca en la ventana de contexto de un modelo para que tenga la señal más relevante —y el menor ruido— en cada paso.",
66
+ "takeaways": [
67
+ "El contexto es un recurso escaso; lo que dejas fuera importa tanto como lo que incluyes.",
68
+ "Más contexto no es mejor: los tokens irrelevantes degradan calidad y suben el coste.",
69
+ "Técnicas: recuperación, resumen, compactación y memoria estructurada.",
70
+ "Generaliza la ingeniería de prompts de un prompt a toda una ejecución de agente.",
71
+ "Es una capa central del harness alrededor del modelo."
72
+ ],
73
+ "context": [
74
+ "Todo modelo tiene una ventana de contexto finita, y la calidad se degrada cuando se llena de contenido de baja señal. En uso de un solo turno es manejable, pero los agentes acumulan historial, salidas de herramientas y documentos recuperados a lo largo de muchos pasos, saturando rápido la ventana.",
75
+ "La ingeniería de contexto trata la ventana como un presupuesto a gestionar de forma deliberada: conservar las instrucciones duraderas, recuperar solo lo relevante ahora, resumir o compactar el resto y guardar el estado a largo plazo fuera de la ventana en memoria."
76
+ ],
77
+ "architecture": [
78
+ "Movimientos clave: seleccionar (recuperar solo pasajes relevantes), comprimir (resumir pasos previos), compactar (descartar o plegar turnos obsoletos) y externalizar (llevar el estado a largo plazo a un almacén de memoria y traerlo bajo demanda).",
79
+ "En un bucle de agente, el contexto se reensambla en cada paso desde fuentes en capas: instrucciones de sistema estables, estado de la tarea, conocimiento recuperado relevante, resultados recientes de herramientas y memorias a largo plazo seleccionadas, ordenadas para que la señal más importante sea la más saliente."
80
+ ],
81
+ "components": ["Instrucciones de sistema", "Estado de la tarea", "Conocimiento recuperado", "Resultados de herramientas", "Memoria a largo plazo", "Resúmenes / compactación"],
82
+ "pros": [
83
+ "Mantiene alta la calidad cuando las tareas se alargan.",
84
+ "Controla el coste de tokens y la latencia.",
85
+ "Reduce la distracción y la alucinación por ruido.",
86
+ "Habilita agentes de horizonte largo dentro de un contexto finito."
87
+ ],
88
+ "risks": [
89
+ "Una compresión demasiado agresiva puede descartar información necesaria.",
90
+ "Una recuperación pobre inyecta contexto irrelevante o erróneo.",
91
+ "Complejidad al decidir qué conservar en cada paso.",
92
+ "Los errores aquí aparecen como regresiones sutiles de calidad."
93
+ ],
94
+ "tools": ["Pipelines de recuperación / RAG", "Modelos de resumen", "Almacenes de memoria", "Frameworks de gestión de contexto (p. ej. LangGraph)"],
95
+ "examples": [
96
+ "Resumir pasos anteriores del agente para que la ventana siga enfocada en la subtarea actual.",
97
+ "Recuperar solo la sección de la política relevante a una pregunta en vez de todo el manual.",
98
+ "Guardar las preferencias de un usuario en memoria y recordarlas solo cuando son relevantes."
99
+ ],
100
+ "faqs": [
101
+ { "q": "¿En qué se diferencia de la ingeniería de prompts?", "a": "La ingeniería de prompts crea una sola instrucción. La ingeniería de contexto gestiona todo el conjunto de información en la ventana a lo largo de una ejecución de agente, incluyendo recuperación, memoria, resultados de herramientas y compresión." },
102
+ { "q": "¿Por qué no usar simplemente una ventana de contexto más grande?", "a": "Las ventanas más grandes ayudan pero no eliminan el problema: la calidad y el coste se degradan al llenarse de tokens de baja señal. La curación sigue ganando." },
103
+ { "q": "¿Cómo se relaciona con RAG y la memoria?", "a": "RAG y la memoria son fuentes de contexto; la ingeniería de contexto decide qué de ellas entra realmente en la ventana, cuándo y en qué forma." },
104
+ { "q": "¿Es parte de la ingeniería de harness?", "a": "Sí. La gestión de contexto es una de las capas centrales del harness que convierte la capacidad del modelo en comportamiento fiable del agente." }
105
+ ]
106
+ },
107
+ "pt": {
108
+ "title": "O que é Engenharia de Contexto (Context Engineering)?",
109
+ "summary": "A engenharia de contexto é a disciplina de decidir qual informação entra na janela de contexto limitada de um modelo a cada passo, e o que fica de fora. Como os agentes rodam em muitos passos, enfiar tudo ingenuamente no contexto degrada qualidade e custo. A engenharia de contexto cura as instruções, o conhecimento recuperado, os resultados de ferramentas e a memória adequados para que o modelo tenha exatamente o que precisa quando precisa. É uma parte central da engenharia de harness.",
110
+ "definition": "A engenharia de contexto é a prática de curar, comprimir e sequenciar a informação colocada na janela de contexto de um modelo para que ele tenha o sinal mais relevante — e o menor ruído — a cada passo.",
111
+ "takeaways": [
112
+ "O contexto é um recurso escasso; o que você deixa de fora importa tanto quanto o que inclui.",
113
+ "Mais contexto não é melhor: tokens irrelevantes degradam a qualidade e elevam o custo.",
114
+ "Técnicas: recuperação, resumo, compactação e memória estruturada.",
115
+ "Generaliza a engenharia de prompts de um prompt para toda uma execução de agente.",
116
+ "É uma camada central do harness em torno do modelo."
117
+ ],
118
+ "context": [
119
+ "Todo modelo tem uma janela de contexto finita, e a qualidade se degrada quando ela é preenchida com conteúdo de baixo sinal. No uso de um único turno é gerenciável, mas os agentes acumulam histórico, saídas de ferramentas e documentos recuperados ao longo de muitos passos, saturando rápido a janela.",
120
+ "A engenharia de contexto trata a janela como um orçamento a gerir de forma deliberada: manter as instruções duráveis, recuperar só o relevante agora, resumir ou compactar o resto e guardar o estado de longo prazo fora da janela na memória."
121
+ ],
122
+ "architecture": [
123
+ "Movimentos centrais: selecionar (recuperar só trechos relevantes), comprimir (resumir passos anteriores), compactar (descartar ou dobrar turnos obsoletos) e externalizar (levar o estado de longo prazo a um armazenamento de memória e trazê-lo sob demanda).",
124
+ "Num laço de agente, o contexto é remontado a cada passo a partir de fontes em camadas: instruções de sistema estáveis, estado da tarefa, conhecimento recuperado relevante, resultados recentes de ferramentas e memórias de longo prazo selecionadas, ordenados para que o sinal mais importante seja o mais saliente."
125
+ ],
126
+ "components": ["Instruções de sistema", "Estado da tarefa", "Conhecimento recuperado", "Resultados de ferramentas", "Memória de longo prazo", "Resumos / compactação"],
127
+ "pros": [
128
+ "Mantém a qualidade alta quando as tarefas se alongam.",
129
+ "Controla o custo de tokens e a latência.",
130
+ "Reduz a distração e a alucinação por ruído.",
131
+ "Habilita agentes de horizonte longo dentro de um contexto finito."
132
+ ],
133
+ "risks": [
134
+ "Uma compressão agressiva demais pode descartar informação necessária.",
135
+ "Uma recuperação ruim injeta contexto irrelevante ou errado.",
136
+ "Complexidade ao decidir o que manter a cada passo.",
137
+ "Bugs aqui aparecem como regressões sutis de qualidade."
138
+ ],
139
+ "tools": ["Pipelines de recuperação / RAG", "Modelos de resumo", "Armazenamentos de memória", "Frameworks de gestão de contexto (ex.: LangGraph)"],
140
+ "examples": [
141
+ "Resumir passos anteriores do agente para a janela seguir focada na subtarefa atual.",
142
+ "Recuperar só a seção da política relevante a uma pergunta em vez de todo o manual.",
143
+ "Guardar as preferências de um usuário na memória e lembrá-las só quando relevantes."
144
+ ],
145
+ "faqs": [
146
+ { "q": "Qual a diferença para a engenharia de prompts?", "a": "A engenharia de prompts cria uma única instrução. A engenharia de contexto gere todo o conjunto de informação na janela ao longo de uma execução de agente, incluindo recuperação, memória, resultados de ferramentas e compressão." },
147
+ { "q": "Por que não usar simplesmente uma janela de contexto maior?", "a": "Janelas maiores ajudam mas não eliminam o problema: qualidade e custo se degradam ao se encherem de tokens de baixo sinal. A curadoria ainda vence." },
148
+ { "q": "Como se relaciona com RAG e memória?", "a": "RAG e memória são fontes de contexto; a engenharia de contexto decide o que delas realmente entra na janela, quando e em que forma." },
149
+ { "q": "É parte da engenharia de harness?", "a": "Sim. A gestão de contexto é uma das camadas centrais do harness que converte a capacidade do modelo em comportamento confiável do agente." }
150
+ ]
151
+ }
152
+ }
153
+ }
@@ -0,0 +1,153 @@
1
+ {
2
+ "slug": "embeddings",
3
+ "category": "concept",
4
+ "updated": "2026-06-21",
5
+ "version": "1.0",
6
+ "related": ["enterprise-rag", "foundation-models", "fine-tuning", "agentic-ai"],
7
+ "references": [
8
+ { "title": "Reimers & Gurevych — Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks (2019)", "url": "https://arxiv.org/abs/1908.10084" },
9
+ { "title": "Mikolov et al. — Efficient Estimation of Word Representations (word2vec, 2013)", "url": "https://arxiv.org/abs/1301.3781" }
10
+ ],
11
+ "evidence": {
12
+ "evidenceLevel": "benchmark",
13
+ "confidenceLevel": "high",
14
+ "sourceType": ["benchmark", "paper"]
15
+ },
16
+ "locales": {
17
+ "en": {
18
+ "title": "What are Embeddings & Vector Search?",
19
+ "summary": "An embedding is a numeric vector that represents the meaning of text (or images, audio, code) so that semantically similar items sit close together in vector space. Vector search finds the nearest embeddings to a query, enabling search by meaning rather than keywords. Embeddings are the backbone of retrieval-augmented generation, semantic search, clustering and recommendation.",
20
+ "definition": "An embedding is a dense numeric vector that encodes the meaning of a piece of data, positioned so that similar items are close in vector space; vector search retrieves the nearest embeddings to a query.",
21
+ "takeaways": [
22
+ "Embeddings turn meaning into vectors; similar things sit close together.",
23
+ "Vector search retrieves by semantic similarity, not exact keywords.",
24
+ "They power RAG, semantic search, clustering and recommendation.",
25
+ "Hybrid search (vector + keyword) usually beats either alone.",
26
+ "Chunking and the embedding model choice drive retrieval quality."
27
+ ],
28
+ "context": [
29
+ "Computers compare numbers, not meaning. Embeddings bridge that gap: an embedding model maps text to a vector such that 'cancel my subscription' and 'how do I unsubscribe' land near each other, even with no shared words.",
30
+ "This is what makes semantic retrieval possible. Instead of matching keywords, a system embeds the query and finds the closest stored vectors — the foundation of how RAG and modern search retrieve relevant content."
31
+ ],
32
+ "architecture": [
33
+ "Indexing: content is split into chunks, each passed through an embedding model to produce a vector, then stored in a vector index. Querying: the query is embedded and the index returns the nearest vectors by a similarity metric (e.g. cosine).",
34
+ "Production systems add a re-ranker to refine the top results, combine vector search with keyword search (hybrid), and filter by metadata and permissions. Quality depends heavily on chunking and the embedding model."
35
+ ],
36
+ "components": ["Embedding model", "Chunking", "Vector index / database", "Similarity metric (cosine)", "Re-ranker", "Hybrid (keyword) search"],
37
+ "pros": [
38
+ "Search by meaning, robust to wording.",
39
+ "Cross-lingual and multimodal matching.",
40
+ "The backbone of RAG and semantic search.",
41
+ "Cheap to query at scale once indexed."
42
+ ],
43
+ "risks": [
44
+ "Poor chunking degrades every downstream result.",
45
+ "Embedding model mismatch hurts relevance.",
46
+ "Vectors can leak sensitive info; secure the store.",
47
+ "Pure vector search can miss exact-match needs (use hybrid)."
48
+ ],
49
+ "tools": ["Embedding models (OpenAI, Cohere, open-source)", "Vector databases (pgvector, Pinecone, Vertex AI Vector Search)", "Re-rankers", "Hybrid search engines"],
50
+ "examples": [
51
+ "Semantic search over a help center that matches intent, not keywords.",
52
+ "Retrieving relevant passages to ground a RAG answer.",
53
+ "Clustering support tickets by topic using their embeddings."
54
+ ],
55
+ "faqs": [
56
+ { "q": "How are embeddings different from keywords?", "a": "Keyword search matches exact words; embeddings match meaning, so paraphrases and synonyms still retrieve the right content." },
57
+ { "q": "What is vector search?", "a": "Finding the stored embeddings nearest to a query embedding by a similarity metric like cosine distance — search by semantic closeness." },
58
+ { "q": "Why combine vector and keyword search?", "a": "Vectors excel at meaning but can miss exact terms (codes, names). Hybrid search blends both for the best recall and precision." },
59
+ { "q": "Do embeddings power RAG?", "a": "Yes. RAG embeds documents and queries, retrieves the nearest chunks by vector search, and grounds the model's answer in them." }
60
+ ]
61
+ },
62
+ "es": {
63
+ "title": "¿Qué son los Embeddings y la Búsqueda Vectorial?",
64
+ "summary": "Un embedding es un vector numérico que representa el significado de un texto (o imágenes, audio, código) de modo que los elementos semánticamente similares quedan cerca en el espacio vectorial. La búsqueda vectorial encuentra los embeddings más cercanos a una consulta, permitiendo buscar por significado en vez de por palabras clave. Los embeddings son la columna vertebral de la generación aumentada por recuperación, la búsqueda semántica, el clustering y la recomendación.",
65
+ "definition": "Un embedding es un vector numérico denso que codifica el significado de un dato, situado de forma que los elementos similares quedan cerca en el espacio vectorial; la búsqueda vectorial recupera los embeddings más cercanos a una consulta.",
66
+ "takeaways": [
67
+ "Los embeddings convierten el significado en vectores; lo similar queda cerca.",
68
+ "La búsqueda vectorial recupera por similitud semántica, no por palabras exactas.",
69
+ "Sustentan el RAG, la búsqueda semántica, el clustering y la recomendación.",
70
+ "La búsqueda híbrida (vector + palabras clave) suele superar a cada una sola.",
71
+ "El chunking y la elección del modelo de embeddings determinan la calidad."
72
+ ],
73
+ "context": [
74
+ "Los ordenadores comparan números, no significado. Los embeddings salvan esa brecha: un modelo de embeddings mapea texto a un vector de modo que 'cancela mi suscripción' y 'cómo me doy de baja' caen cerca, aun sin palabras compartidas.",
75
+ "Esto es lo que hace posible la recuperación semántica. En vez de casar palabras clave, el sistema embebe la consulta y encuentra los vectores almacenados más cercanos: la base de cómo el RAG y la búsqueda moderna recuperan contenido relevante."
76
+ ],
77
+ "architecture": [
78
+ "Indexación: el contenido se divide en chunks, cada uno pasa por un modelo de embeddings para producir un vector y se guarda en un índice vectorial. Consulta: la consulta se embebe y el índice devuelve los vectores más cercanos por una métrica de similitud (p. ej. coseno).",
79
+ "Los sistemas en producción añaden un re-ranker para refinar los mejores resultados, combinan búsqueda vectorial con búsqueda por palabras clave (híbrida) y filtran por metadatos y permisos. La calidad depende mucho del chunking y del modelo de embeddings."
80
+ ],
81
+ "components": ["Modelo de embeddings", "Chunking", "Índice / base de datos vectorial", "Métrica de similitud (coseno)", "Re-ranker", "Búsqueda híbrida (palabras clave)"],
82
+ "pros": [
83
+ "Búsqueda por significado, robusta a la redacción.",
84
+ "Coincidencia translingüe y multimodal.",
85
+ "La columna vertebral del RAG y la búsqueda semántica.",
86
+ "Barata de consultar a escala una vez indexada."
87
+ ],
88
+ "risks": [
89
+ "Un chunking pobre degrada todo resultado posterior.",
90
+ "Un modelo de embeddings inadecuado daña la relevancia.",
91
+ "Los vectores pueden filtrar info sensible; asegura el almacén.",
92
+ "La búsqueda vectorial pura puede fallar en coincidencias exactas (usa híbrida)."
93
+ ],
94
+ "tools": ["Modelos de embeddings (OpenAI, Cohere, open source)", "Bases de datos vectoriales (pgvector, Pinecone, Vertex AI Vector Search)", "Re-rankers", "Motores de búsqueda híbrida"],
95
+ "examples": [
96
+ "Búsqueda semántica en un centro de ayuda que casa la intención, no las palabras.",
97
+ "Recuperar pasajes relevantes para fundamentar una respuesta RAG.",
98
+ "Agrupar tickets de soporte por tema usando sus embeddings."
99
+ ],
100
+ "faqs": [
101
+ { "q": "¿En qué se diferencian los embeddings de las palabras clave?", "a": "La búsqueda por palabras clave casa palabras exactas; los embeddings casan significado, así que paráfrasis y sinónimos siguen recuperando el contenido correcto." },
102
+ { "q": "¿Qué es la búsqueda vectorial?", "a": "Encontrar los embeddings almacenados más cercanos al embedding de una consulta por una métrica como la distancia coseno: búsqueda por cercanía semántica." },
103
+ { "q": "¿Por qué combinar búsqueda vectorial y por palabras clave?", "a": "Los vectores destacan en significado pero pueden fallar en términos exactos (códigos, nombres). La búsqueda híbrida combina ambas para mejor recall y precisión." },
104
+ { "q": "¿Los embeddings sustentan el RAG?", "a": "Sí. El RAG embebe documentos y consultas, recupera los chunks más cercanos por búsqueda vectorial y fundamenta en ellos la respuesta del modelo." }
105
+ ]
106
+ },
107
+ "pt": {
108
+ "title": "O que são Embeddings e Busca Vetorial?",
109
+ "summary": "Um embedding é um vetor numérico que representa o significado de um texto (ou imagens, áudio, código) de modo que itens semanticamente similares ficam próximos no espaço vetorial. A busca vetorial encontra os embeddings mais próximos de uma consulta, permitindo buscar por significado em vez de palavras-chave. Os embeddings são a espinha dorsal da geração aumentada por recuperação, da busca semântica, do clustering e da recomendação.",
110
+ "definition": "Um embedding é um vetor numérico denso que codifica o significado de um dado, posicionado de forma que itens similares ficam próximos no espaço vetorial; a busca vetorial recupera os embeddings mais próximos de uma consulta.",
111
+ "takeaways": [
112
+ "Embeddings transformam significado em vetores; o similar fica próximo.",
113
+ "A busca vetorial recupera por similaridade semântica, não por palavras exatas.",
114
+ "Sustentam o RAG, a busca semântica, o clustering e a recomendação.",
115
+ "A busca híbrida (vetor + palavras-chave) costuma superar cada uma sozinha.",
116
+ "O chunking e a escolha do modelo de embeddings determinam a qualidade."
117
+ ],
118
+ "context": [
119
+ "Os computadores comparam números, não significado. Os embeddings preenchem essa lacuna: um modelo de embeddings mapeia texto a um vetor de modo que 'cancele minha assinatura' e 'como eu me descadastro' caem próximos, mesmo sem palavras em comum.",
120
+ "Isso é o que torna possível a recuperação semântica. Em vez de casar palavras-chave, o sistema embeda a consulta e encontra os vetores armazenados mais próximos: a base de como o RAG e a busca moderna recuperam conteúdo relevante."
121
+ ],
122
+ "architecture": [
123
+ "Indexação: o conteúdo é dividido em chunks, cada um passa por um modelo de embeddings para produzir um vetor e é guardado num índice vetorial. Consulta: a consulta é embedada e o índice devolve os vetores mais próximos por uma métrica de similaridade (ex.: cosseno).",
124
+ "Os sistemas em produção adicionam um re-ranker para refinar os melhores resultados, combinam busca vetorial com busca por palavras-chave (híbrida) e filtram por metadados e permissões. A qualidade depende muito do chunking e do modelo de embeddings."
125
+ ],
126
+ "components": ["Modelo de embeddings", "Chunking", "Índice / banco de dados vetorial", "Métrica de similaridade (cosseno)", "Re-ranker", "Busca híbrida (palavras-chave)"],
127
+ "pros": [
128
+ "Busca por significado, robusta à redação.",
129
+ "Correspondência translíngue e multimodal.",
130
+ "A espinha dorsal do RAG e da busca semântica.",
131
+ "Barata de consultar em escala uma vez indexada."
132
+ ],
133
+ "risks": [
134
+ "Um chunking ruim degrada todo resultado posterior.",
135
+ "Um modelo de embeddings inadequado prejudica a relevância.",
136
+ "Os vetores podem vazar info sensível; proteja o armazenamento.",
137
+ "A busca vetorial pura pode falhar em correspondências exatas (use híbrida)."
138
+ ],
139
+ "tools": ["Modelos de embeddings (OpenAI, Cohere, open source)", "Bancos de dados vetoriais (pgvector, Pinecone, Vertex AI Vector Search)", "Re-rankers", "Motores de busca híbrida"],
140
+ "examples": [
141
+ "Busca semântica numa central de ajuda que casa a intenção, não as palavras.",
142
+ "Recuperar trechos relevantes para fundamentar uma resposta RAG.",
143
+ "Agrupar chamados de suporte por tema usando seus embeddings."
144
+ ],
145
+ "faqs": [
146
+ { "q": "Como os embeddings diferem das palavras-chave?", "a": "A busca por palavras-chave casa palavras exatas; os embeddings casam significado, então paráfrases e sinônimos ainda recuperam o conteúdo correto." },
147
+ { "q": "O que é busca vetorial?", "a": "Encontrar os embeddings armazenados mais próximos do embedding de uma consulta por uma métrica como a distância cosseno: busca por proximidade semântica." },
148
+ { "q": "Por que combinar busca vetorial e por palavras-chave?", "a": "Os vetores se destacam em significado mas podem falhar em termos exatos (códigos, nomes). A busca híbrida combina ambas para melhor recall e precisão." },
149
+ { "q": "Os embeddings sustentam o RAG?", "a": "Sim. O RAG embeda documentos e consultas, recupera os chunks mais próximos por busca vetorial e fundamenta neles a resposta do modelo." }
150
+ ]
151
+ }
152
+ }
153
+ }
@@ -0,0 +1,154 @@
1
+ {
2
+ "slug": "enterprise-rag",
3
+ "category": "pattern",
4
+ "updated": "2026-06-21",
5
+ "version": "1.0",
6
+ "featured": true,
7
+ "related": ["agentic-ai", "model-context-protocol", "ai-governance", "ai-agent"],
8
+ "references": [
9
+ { "title": "Lewis et al. — Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (2020)", "url": "https://arxiv.org/abs/2005.11401" },
10
+ { "title": "Model Context Protocol — Resources", "url": "https://modelcontextprotocol.io" }
11
+ ],
12
+ "evidence": {
13
+ "evidenceLevel": "benchmark",
14
+ "confidenceLevel": "high",
15
+ "sourceType": ["benchmark", "paper", "industry_observation"]
16
+ },
17
+ "locales": {
18
+ "en": {
19
+ "title": "What is Enterprise RAG?",
20
+ "summary": "Enterprise RAG (retrieval-augmented generation) is the pattern of grounding a model's answers in an organization's own documents, retrieved at query time, instead of relying on the model's parametric memory. It lets a company use private, current and governed knowledge — policies, manuals, tickets, contracts — without retraining a model, while keeping access control, citations and auditability that enterprises require.",
21
+ "definition": "Enterprise RAG is a pattern that retrieves relevant passages from an organization's governed knowledge sources and supplies them to a model as context, so answers are grounded, current and citable.",
22
+ "takeaways": [
23
+ "RAG grounds answers in retrieved documents, reducing hallucination.",
24
+ "It uses private and fresh knowledge without retraining.",
25
+ "Retrieval quality (chunking + embeddings) drives answer quality.",
26
+ "Enterprise-grade RAG adds access control, citations and audit.",
27
+ "Becomes agentic when the system decides when and what to retrieve."
28
+ ],
29
+ "context": [
30
+ "A base model only knows what it learned during training. Enterprise knowledge is private, changing and access-controlled. RAG bridges that gap by fetching the right passages at query time and grounding the answer in them.",
31
+ "The enterprise difference is governance: who is allowed to see which documents, where the answer's sources came from, and whether the whole interaction can be audited. RAG that ignores these is a prototype, not a production system."
32
+ ],
33
+ "architecture": [
34
+ "Ingestion: documents are parsed, split into self-contained chunks, embedded and stored in a vector index (often alongside keyword search). Retrieval: a query is embedded, the nearest chunks are fetched, optionally re-ranked and filtered by permissions. Generation: the model answers using those chunks and cites them.",
35
+ "Quality hinges on the unglamorous parts: clean parsing, sensible chunking, hybrid (vector + keyword) retrieval, re-ranking, and permission filtering. Well-structured source content makes every one of these steps easier."
36
+ ],
37
+ "components": ["Ingestion & chunking", "Embeddings", "Vector / hybrid index", "Retriever & re-ranker", "Permission filter", "Generator (LLM)", "Citation layer"],
38
+ "pros": [
39
+ "Grounded, citable, up-to-date answers.",
40
+ "Uses private knowledge without retraining.",
41
+ "Respects access control and auditability.",
42
+ "Cheaper and faster to update than fine-tuning."
43
+ ],
44
+ "risks": [
45
+ "Poor chunking or retrieval yields wrong or irrelevant context.",
46
+ "Stale or unpermissioned data leaks into answers.",
47
+ "Citations can be plausible but unsupported if not verified.",
48
+ "Retrieval latency and cost at scale."
49
+ ],
50
+ "tools": ["Vector databases (e.g. pgvector, Pinecone, Vertex AI Vector Search)", "Embedding models", "Re-rankers", "Hybrid search engines", "MCP resource servers"],
51
+ "examples": [
52
+ "An internal assistant answering HR policy questions with cited passages.",
53
+ "A support agent retrieving product docs to resolve tickets.",
54
+ "A legal assistant surfacing relevant clauses with source links."
55
+ ],
56
+ "faqs": [
57
+ { "q": "Is RAG better than fine-tuning?", "a": "They solve different problems. RAG injects fresh, governed knowledge at query time; fine-tuning adapts behavior or style. They are often combined." },
58
+ { "q": "Why does chunking matter so much?", "a": "Retrieval works on chunks. Self-contained, well-structured chunks retrieve cleanly; fragmented ones return noise. Chunk quality largely sets RAG quality." },
59
+ { "q": "What makes RAG enterprise-grade?", "a": "Access control on retrieval, source citations, auditability, freshness, and evaluation — not just a vector store plus a model." },
60
+ { "q": "When does RAG become agentic?", "a": "When retrieval is one step in a multi-step loop where the system decides whether, when and what to retrieve, rather than always retrieving once." }
61
+ ]
62
+ },
63
+ "es": {
64
+ "title": "¿Qué es el RAG empresarial (Enterprise RAG)?",
65
+ "summary": "El RAG empresarial (generación aumentada por recuperación) es el patrón de fundamentar las respuestas de un modelo en los propios documentos de la organización, recuperados en el momento de la consulta, en lugar de depender de la memoria paramétrica del modelo. Permite usar conocimiento privado, actual y gobernado —políticas, manuales, tickets, contratos— sin reentrenar un modelo, manteniendo el control de acceso, las citas y la auditabilidad que exigen las empresas.",
66
+ "definition": "El RAG empresarial es un patrón que recupera pasajes relevantes de las fuentes de conocimiento gobernadas de una organización y los entrega a un modelo como contexto, para que las respuestas estén fundamentadas, actualizadas y sean citables.",
67
+ "takeaways": [
68
+ "El RAG fundamenta las respuestas en documentos recuperados, reduciendo la alucinación.",
69
+ "Usa conocimiento privado y fresco sin reentrenar.",
70
+ "La calidad de recuperación (chunking + embeddings) determina la calidad de la respuesta.",
71
+ "El RAG de grado empresarial añade control de acceso, citas y auditoría.",
72
+ "Se vuelve agéntico cuando el sistema decide cuándo y qué recuperar."
73
+ ],
74
+ "context": [
75
+ "Un modelo base solo sabe lo que aprendió durante el entrenamiento. El conocimiento empresarial es privado, cambiante y con control de acceso. El RAG salva esa brecha recuperando los pasajes adecuados en el momento de la consulta y fundamentando la respuesta en ellos.",
76
+ "La diferencia empresarial es la gobernanza: quién puede ver qué documentos, de dónde vienen las fuentes de la respuesta y si toda la interacción puede auditarse. Un RAG que ignora esto es un prototipo, no un sistema en producción."
77
+ ],
78
+ "architecture": [
79
+ "Ingesta: los documentos se parsean, se dividen en chunks autocontenidos, se embeben y se guardan en un índice vectorial (a menudo junto a búsqueda por palabras clave). Recuperación: la consulta se embebe, se traen los chunks más cercanos, se re-rankean y se filtran por permisos. Generación: el modelo responde usando esos chunks y los cita.",
80
+ "La calidad depende de las partes poco glamurosas: parseo limpio, chunking sensato, recuperación híbrida (vector + palabras clave), re-ranking y filtrado por permisos. Un contenido fuente bien estructurado facilita cada uno de esos pasos."
81
+ ],
82
+ "components": ["Ingesta y chunking", "Embeddings", "Índice vectorial / híbrido", "Recuperador y re-ranker", "Filtro de permisos", "Generador (LLM)", "Capa de citas"],
83
+ "pros": [
84
+ "Respuestas fundamentadas, citables y actualizadas.",
85
+ "Usa conocimiento privado sin reentrenar.",
86
+ "Respeta el control de acceso y la auditabilidad.",
87
+ "Más barato y rápido de actualizar que el fine-tuning."
88
+ ],
89
+ "risks": [
90
+ "Un chunking o recuperación pobres dan contexto erróneo o irrelevante.",
91
+ "Datos desactualizados o sin permisos se filtran en las respuestas.",
92
+ "Las citas pueden ser plausibles pero no respaldadas si no se verifican.",
93
+ "Latencia y coste de recuperación a escala."
94
+ ],
95
+ "tools": ["Bases de datos vectoriales (p. ej. pgvector, Pinecone, Vertex AI Vector Search)", "Modelos de embeddings", "Re-rankers", "Motores de búsqueda híbrida", "Servidores de recursos MCP"],
96
+ "examples": [
97
+ "Un asistente interno que responde preguntas de políticas de RRHH con pasajes citados.",
98
+ "Un agente de soporte que recupera documentación de producto para resolver tickets.",
99
+ "Un asistente legal que muestra cláusulas relevantes con enlaces a la fuente."
100
+ ],
101
+ "faqs": [
102
+ { "q": "¿El RAG es mejor que el fine-tuning?", "a": "Resuelven problemas distintos. El RAG inyecta conocimiento fresco y gobernado en el momento de la consulta; el fine-tuning adapta comportamiento o estilo. A menudo se combinan." },
103
+ { "q": "¿Por qué importa tanto el chunking?", "a": "La recuperación opera sobre chunks. Los chunks autocontenidos y bien estructurados se recuperan limpiamente; los fragmentados devuelven ruido. La calidad del chunk fija en gran medida la del RAG." },
104
+ { "q": "¿Qué hace a un RAG de grado empresarial?", "a": "Control de acceso en la recuperación, citas de fuentes, auditabilidad, frescura y evaluación, no solo un almacén vectorial más un modelo." },
105
+ { "q": "¿Cuándo se vuelve agéntico el RAG?", "a": "Cuando la recuperación es un paso de un bucle de varios pasos en el que el sistema decide si, cuándo y qué recuperar, en vez de recuperar siempre una vez." }
106
+ ]
107
+ },
108
+ "pt": {
109
+ "title": "O que é RAG empresarial (Enterprise RAG)?",
110
+ "summary": "O RAG empresarial (geração aumentada por recuperação) é o padrão de fundamentar as respostas de um modelo nos próprios documentos da organização, recuperados no momento da consulta, em vez de depender da memória paramétrica do modelo. Permite usar conhecimento privado, atual e governado — políticas, manuais, chamados, contratos — sem retreinar um modelo, mantendo o controle de acesso, as citações e a auditabilidade que as empresas exigem.",
111
+ "definition": "O RAG empresarial é um padrão que recupera trechos relevantes das fontes de conhecimento governadas de uma organização e os fornece a um modelo como contexto, para que as respostas sejam fundamentadas, atuais e citáveis.",
112
+ "takeaways": [
113
+ "O RAG fundamenta as respostas em documentos recuperados, reduzindo a alucinação.",
114
+ "Usa conhecimento privado e fresco sem retreinar.",
115
+ "A qualidade da recuperação (chunking + embeddings) determina a qualidade da resposta.",
116
+ "O RAG de nível empresarial adiciona controle de acesso, citações e auditoria.",
117
+ "Torna-se agêntico quando o sistema decide quando e o que recuperar."
118
+ ],
119
+ "context": [
120
+ "Um modelo base só sabe o que aprendeu durante o treinamento. O conhecimento empresarial é privado, mutável e com controle de acesso. O RAG preenche essa lacuna recuperando os trechos adequados no momento da consulta e fundamentando a resposta neles.",
121
+ "A diferença empresarial é a governança: quem pode ver quais documentos, de onde vieram as fontes da resposta e se toda a interação pode ser auditada. Um RAG que ignora isso é um protótipo, não um sistema em produção."
122
+ ],
123
+ "architecture": [
124
+ "Ingestão: os documentos são parseados, divididos em chunks autocontidos, embedados e guardados num índice vetorial (muitas vezes junto à busca por palavras-chave). Recuperação: a consulta é embedada, os chunks mais próximos são trazidos, re-ranqueados e filtrados por permissões. Geração: o modelo responde usando esses chunks e os cita.",
125
+ "A qualidade depende das partes pouco glamourosas: parsing limpo, chunking sensato, recuperação híbrida (vetor + palavras-chave), re-ranking e filtragem por permissões. Um conteúdo-fonte bem estruturado facilita cada um desses passos."
126
+ ],
127
+ "components": ["Ingestão e chunking", "Embeddings", "Índice vetorial / híbrido", "Recuperador e re-ranker", "Filtro de permissões", "Gerador (LLM)", "Camada de citações"],
128
+ "pros": [
129
+ "Respostas fundamentadas, citáveis e atualizadas.",
130
+ "Usa conhecimento privado sem retreinar.",
131
+ "Respeita o controle de acesso e a auditabilidade.",
132
+ "Mais barato e rápido de atualizar que o fine-tuning."
133
+ ],
134
+ "risks": [
135
+ "Um chunking ou recuperação ruins dão contexto errado ou irrelevante.",
136
+ "Dados desatualizados ou sem permissões vazam nas respostas.",
137
+ "As citações podem ser plausíveis mas não comprovadas se não forem verificadas.",
138
+ "Latência e custo de recuperação em escala."
139
+ ],
140
+ "tools": ["Bancos de dados vetoriais (ex.: pgvector, Pinecone, Vertex AI Vector Search)", "Modelos de embeddings", "Re-rankers", "Motores de busca híbrida", "Servidores de recursos MCP"],
141
+ "examples": [
142
+ "Um assistente interno que responde perguntas de políticas de RH com trechos citados.",
143
+ "Um agente de suporte que recupera documentação de produto para resolver chamados.",
144
+ "Um assistente jurídico que mostra cláusulas relevantes com links para a fonte."
145
+ ],
146
+ "faqs": [
147
+ { "q": "O RAG é melhor que o fine-tuning?", "a": "Resolvem problemas distintos. O RAG injeta conhecimento fresco e governado no momento da consulta; o fine-tuning adapta comportamento ou estilo. Muitas vezes são combinados." },
148
+ { "q": "Por que o chunking importa tanto?", "a": "A recuperação opera sobre chunks. Chunks autocontidos e bem estruturados são recuperados de forma limpa; os fragmentados retornam ruído. A qualidade do chunk define em grande parte a do RAG." },
149
+ { "q": "O que torna um RAG de nível empresarial?", "a": "Controle de acesso na recuperação, citações de fontes, auditabilidade, frescor e avaliação, não só um armazenamento vetorial mais um modelo." },
150
+ { "q": "Quando o RAG se torna agêntico?", "a": "Quando a recuperação é um passo de um laço de vários passos em que o sistema decide se, quando e o que recuperar, em vez de recuperar sempre uma vez." }
151
+ ]
152
+ }
153
+ }
154
+ }