santismm-knowledge-mcp 0.2.1
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/LICENSE +21 -0
- package/README.md +62 -0
- package/content/CONVENTIONS.md +77 -0
- package/content/LICENSE +55 -0
- package/content/architectures/ai-workforce.json +280 -0
- package/content/architectures/customer-service-agent.json +292 -0
- package/content/architectures/enterprise-knowledge-assistant.json +292 -0
- package/content/architectures/operations-center.json +280 -0
- package/content/architectures/sales-copilot.json +280 -0
- package/content/governance/agentic-ai-governance-checklist.json +323 -0
- package/content/governance/audit-framework-for-agentic-systems.json +280 -0
- package/content/governance/enterprise-ai-governance-framework.json +277 -0
- package/content/governance/eu-ai-act.json +162 -0
- package/content/governance/human-oversight-and-accountability-policy.json +275 -0
- package/content/governance/iso-42001.json +161 -0
- package/content/governance/mitre-atlas.json +280 -0
- package/content/governance/nist-ai-rmf.json +161 -0
- package/content/governance/owasp-llm-top10.json +301 -0
- package/content/harness/HRN-001-definition-and-overview.es.md +76 -0
- package/content/harness/HRN-001-definition-and-overview.md +125 -0
- package/content/harness/HRN-001-definition-and-overview.pt.md +76 -0
- package/content/harness/HRN-002-a-brief-history-of-harness-engineering.es.md +83 -0
- package/content/harness/HRN-002-a-brief-history-of-harness-engineering.md +113 -0
- package/content/harness/HRN-002-a-brief-history-of-harness-engineering.pt.md +83 -0
- package/content/harness/HRN-003-the-harness-taxonomy.es.md +105 -0
- package/content/harness/HRN-003-the-harness-taxonomy.md +158 -0
- package/content/harness/HRN-003-the-harness-taxonomy.pt.md +105 -0
- package/content/harness/HRN-004-harness-engineering-principles.es.md +91 -0
- package/content/harness/HRN-004-harness-engineering-principles.md +135 -0
- package/content/harness/HRN-004-harness-engineering-principles.pt.md +91 -0
- package/content/harness/HRN-005-memory-in-agentic-systems.es.md +98 -0
- package/content/harness/HRN-005-memory-in-agentic-systems.md +145 -0
- package/content/harness/HRN-005-memory-in-agentic-systems.pt.md +98 -0
- package/content/harness/HRN-006-observability-for-agentic-systems.es.md +97 -0
- package/content/harness/HRN-006-observability-for-agentic-systems.md +139 -0
- package/content/harness/HRN-006-observability-for-agentic-systems.pt.md +97 -0
- package/content/harness/HRN-007-evaluation-of-agentic-systems.es.md +96 -0
- package/content/harness/HRN-007-evaluation-of-agentic-systems.md +145 -0
- package/content/harness/HRN-007-evaluation-of-agentic-systems.pt.md +96 -0
- package/content/harness/HRN-008-governance-within-the-harness.es.md +105 -0
- package/content/harness/HRN-008-governance-within-the-harness.md +146 -0
- package/content/harness/HRN-008-governance-within-the-harness.pt.md +105 -0
- package/content/harness/HRN-009-planning-and-goal-management.es.md +102 -0
- package/content/harness/HRN-009-planning-and-goal-management.md +142 -0
- package/content/harness/HRN-009-planning-and-goal-management.pt.md +102 -0
- package/content/harness/HRN-010-orchestration.es.md +107 -0
- package/content/harness/HRN-010-orchestration.md +149 -0
- package/content/harness/HRN-010-orchestration.pt.md +107 -0
- package/content/harness/HRN-011-security-for-agentic-systems.es.md +107 -0
- package/content/harness/HRN-011-security-for-agentic-systems.md +147 -0
- package/content/harness/HRN-011-security-for-agentic-systems.pt.md +107 -0
- package/content/harness/HRN-012-case-studies-in-harness-engineering.es.md +120 -0
- package/content/harness/HRN-012-case-studies-in-harness-engineering.md +157 -0
- package/content/harness/HRN-012-case-studies-in-harness-engineering.pt.md +120 -0
- package/content/harness/HRN-013-glossary.es.md +109 -0
- package/content/harness/HRN-013-glossary.md +124 -0
- package/content/harness/HRN-013-glossary.pt.md +109 -0
- package/content/harness/HRN-014-bibliography.es.md +89 -0
- package/content/harness/HRN-014-bibliography.md +109 -0
- package/content/harness/HRN-014-bibliography.pt.md +89 -0
- package/content/homeric/episodes/achilles-and-hector.json +139 -0
- package/content/homeric/episodes/aeolus-and-the-winds.json +131 -0
- package/content/homeric/episodes/agamemnons-murder.json +162 -0
- package/content/homeric/episodes/calypso-ogygia.json +157 -0
- package/content/homeric/episodes/catalogue-of-ships.json +177 -0
- package/content/homeric/episodes/cattle-of-the-sun.json +131 -0
- package/content/homeric/episodes/chryse-and-the-plague.json +131 -0
- package/content/homeric/episodes/cicones-at-ismarus.json +131 -0
- package/content/homeric/episodes/circe-on-aeaea.json +131 -0
- package/content/homeric/episodes/cyclops-polyphemus.json +162 -0
- package/content/homeric/episodes/laestrygonians.json +153 -0
- package/content/homeric/episodes/lotus-eaters.json +138 -0
- package/content/homeric/episodes/menelaus-and-proteus.json +130 -0
- package/content/homeric/episodes/nekyia.json +160 -0
- package/content/homeric/episodes/phaeacians-on-scheria.json +129 -0
- package/content/homeric/episodes/priams-ransom.json +131 -0
- package/content/homeric/episodes/return-to-ithaca.json +167 -0
- package/content/homeric/episodes/scylla-and-charybdis.json +131 -0
- package/content/homeric/episodes/suitors-ambush-at-asteris.json +131 -0
- package/content/homeric/episodes/telemachus-at-pylos.json +130 -0
- package/content/homeric/episodes/telemachus-in-sparta.json +130 -0
- package/content/homeric/episodes/the-achaean-camp.json +138 -0
- package/content/homeric/episodes/the-sirens.json +129 -0
- package/content/homeric/episodes/wooden-horse.json +168 -0
- package/content/homeric/places/aeaea.json +129 -0
- package/content/homeric/places/aeolia.json +161 -0
- package/content/homeric/places/asteris.json +120 -0
- package/content/homeric/places/aulis.json +122 -0
- package/content/homeric/places/cape-malea.json +126 -0
- package/content/homeric/places/chryse.json +120 -0
- package/content/homeric/places/dodona.json +129 -0
- package/content/homeric/places/dulichium.json +177 -0
- package/content/homeric/places/egypt.json +125 -0
- package/content/homeric/places/ephyra-acheron.json +127 -0
- package/content/homeric/places/hellespont.json +125 -0
- package/content/homeric/places/house-of-hades.json +91 -0
- package/content/homeric/places/ismarus.json +120 -0
- package/content/homeric/places/ithaca.json +240 -0
- package/content/homeric/places/knossos.json +132 -0
- package/content/homeric/places/laestrygonia.json +168 -0
- package/content/homeric/places/land-of-the-cyclopes.json +169 -0
- package/content/homeric/places/land-of-the-lotus-eaters.json +122 -0
- package/content/homeric/places/mount-ida.json +126 -0
- package/content/homeric/places/mycenae.json +152 -0
- package/content/homeric/places/ogygia.json +125 -0
- package/content/homeric/places/pharos.json +120 -0
- package/content/homeric/places/planctae.json +77 -0
- package/content/homeric/places/pylos.json +188 -0
- package/content/homeric/places/same.json +177 -0
- package/content/homeric/places/scheria.json +129 -0
- package/content/homeric/places/scylla-and-charybdis.json +135 -0
- package/content/homeric/places/sirens.json +127 -0
- package/content/homeric/places/sparta.json +179 -0
- package/content/homeric/places/tenedos.json +129 -0
- package/content/homeric/places/thrinacia.json +116 -0
- package/content/homeric/places/tiryns.json +123 -0
- package/content/homeric/places/troy.json +224 -0
- package/content/homeric/places/zacynthus.json +126 -0
- package/content/homeric/routes/achaean-expedition.json +132 -0
- package/content/homeric/routes/nostoi-of-the-others.json +205 -0
- package/content/homeric/routes/odysseus-nostos.json +307 -0
- package/content/homeric/routes/telemachy.json +134 -0
- package/content/knowledge/agent-memory.json +153 -0
- package/content/knowledge/agentic-ai.json +158 -0
- package/content/knowledge/agentic-evaluation.json +156 -0
- package/content/knowledge/agentic-threat-model.json +287 -0
- package/content/knowledge/ai-agent.json +153 -0
- package/content/knowledge/ai-cyberdefense.json +274 -0
- package/content/knowledge/ai-governance.json +155 -0
- package/content/knowledge/ai-observability.json +156 -0
- package/content/knowledge/context-engineering.json +153 -0
- package/content/knowledge/embeddings.json +153 -0
- package/content/knowledge/enterprise-rag.json +154 -0
- package/content/knowledge/fine-tuning.json +153 -0
- package/content/knowledge/foundation-models.json +154 -0
- package/content/knowledge/guardrails.json +153 -0
- package/content/knowledge/harness-engineering.json +158 -0
- package/content/knowledge/human-in-the-loop.json +153 -0
- package/content/knowledge/mcp-security.json +284 -0
- package/content/knowledge/model-context-protocol.json +154 -0
- package/content/knowledge/multi-agent-architecture.json +153 -0
- package/content/knowledge/prompt-engineering.json +153 -0
- package/content/knowledge/prompt-injection.json +138 -0
- package/content/knowledge/reasoning-models.json +153 -0
- package/content/knowledge/tool-use.json +156 -0
- package/content/library/cognitive-architecture-emergent-ai.md +15 -0
- package/content/library/devready-ep108-ai-customer-experiences.md +14 -0
- package/content/library/how-genai-impact-business.md +12 -0
- package/content/library/lmm-reshaping-industries-2024.md +12 -0
- package/content/library/rethinking-ai-pause.md +12 -0
- package/content/library/rise-of-agentic-ai.md +16 -0
- package/content/library/self-improving-autonomous-ai.md +16 -0
- package/content/library/the-stopwatch-and-the-exam.md +12 -0
- package/content/library/unlock-gpt4-secrets.md +12 -0
- package/content/library/vibe-coding-enterprise.md +15 -0
- package/content/library/video-transformando-negocios-genai.md +14 -0
- package/content/library/video-volando-alto-sky-airlines.md +13 -0
- package/content/matrix/agentic-control-matrix.json +967 -0
- package/content/patterns/attributed-memory.json +237 -0
- package/content/patterns/context-compression.json +304 -0
- package/content/patterns/egress-allowlist.json +310 -0
- package/content/patterns/evaluator-optimizer.json +180 -0
- package/content/patterns/goal-decomposition.json +290 -0
- package/content/patterns/human-approval-gate.json +311 -0
- package/content/patterns/human-escalation.json +288 -0
- package/content/patterns/least-privilege-tooling.json +333 -0
- package/content/patterns/long-term-memory.json +305 -0
- package/content/patterns/orchestrator-workers.json +202 -0
- package/content/patterns/parallelization.json +180 -0
- package/content/patterns/prompt-chaining.json +181 -0
- package/content/patterns/recovery-strategy.json +305 -0
- package/content/patterns/reflection.json +298 -0
- package/content/patterns/routing.json +294 -0
- package/content/patterns/sandboxed-execution.json +311 -0
- package/content/patterns/semantic-caching.json +201 -0
- package/content/patterns/supervisor-agent.json +290 -0
- package/content/patterns/task-prioritization.json +307 -0
- package/dist/content.js +181 -0
- package/dist/index.js +27 -0
- package/dist/shape.js +649 -0
- package/dist/tools.js +652 -0
- package/package.json +47 -0
|
@@ -0,0 +1,153 @@
|
|
|
1
|
+
{
|
|
2
|
+
"slug": "agent-memory",
|
|
3
|
+
"category": "harness",
|
|
4
|
+
"updated": "2026-06-21",
|
|
5
|
+
"version": "1.0",
|
|
6
|
+
"related": ["harness-engineering", "context-engineering", "ai-agent", "enterprise-rag"],
|
|
7
|
+
"references": [
|
|
8
|
+
{ "title": "Packer et al. — MemGPT: Towards LLMs as Operating Systems (2023)", "url": "https://arxiv.org/abs/2310.08560" },
|
|
9
|
+
{ "title": "Anthropic — Building Effective Agents (2024)", "url": "https://www.anthropic.com/research/building-effective-agents" }
|
|
10
|
+
],
|
|
11
|
+
"evidence": {
|
|
12
|
+
"evidenceLevel": "industry_observation",
|
|
13
|
+
"confidenceLevel": "high",
|
|
14
|
+
"sourceType": ["industry_observation", "paper"]
|
|
15
|
+
},
|
|
16
|
+
"locales": {
|
|
17
|
+
"en": {
|
|
18
|
+
"title": "What are Agent Memory Systems?",
|
|
19
|
+
"summary": "Agent memory is how an AI agent retains and recalls information beyond a single context window — across steps, sessions and tasks. It typically separates short-term working memory (the current context) from long-term memory (durable stores the agent reads from and writes to). Memory is what lets an agent carry state through a long task, remember a user over time, and avoid repeating work. It is a core layer of harness engineering.",
|
|
20
|
+
"definition": "Agent memory is the set of mechanisms an AI agent uses to store, organize and retrieve information beyond its immediate context window, spanning short-term working memory and long-term persistent memory.",
|
|
21
|
+
"takeaways": [
|
|
22
|
+
"Memory extends an agent beyond a single finite context window.",
|
|
23
|
+
"Short-term (working) vs long-term (persistent) memory serve different roles.",
|
|
24
|
+
"Long-term memory is often retrieved on demand, like RAG over the agent's own history.",
|
|
25
|
+
"Good memory prevents repeated work and lost state on long tasks.",
|
|
26
|
+
"What to write, keep and forget is a design decision, not automatic."
|
|
27
|
+
],
|
|
28
|
+
"context": [
|
|
29
|
+
"A model's context window is finite, so anything an agent must remember beyond it needs an external store. Without memory, an agent forgets earlier steps, repeats actions and cannot personalize across sessions.",
|
|
30
|
+
"Memory turns a stateless model into a system with continuity. The hard part is curation: deciding what is worth writing down, how to organize it, and how to retrieve only what is relevant now — closely tied to context engineering."
|
|
31
|
+
],
|
|
32
|
+
"architecture": [
|
|
33
|
+
"Two layers: working memory (the current context window, holding the active task) and long-term memory (external stores — vector, key-value, document or graph — written during a task and retrieved later). Some designs add episodic (events), semantic (facts) and procedural (skills) memory.",
|
|
34
|
+
"The agent reads relevant memories into context at each step and writes new ones as it learns. Retrieval, summarization and forgetting policies keep memory useful rather than overwhelming."
|
|
35
|
+
],
|
|
36
|
+
"components": ["Working memory", "Long-term store (vector/KV/graph)", "Write policy", "Retrieval policy", "Summarization / consolidation", "Forgetting / expiry"],
|
|
37
|
+
"pros": [
|
|
38
|
+
"Continuity across steps, sessions and tasks.",
|
|
39
|
+
"Personalization that persists over time.",
|
|
40
|
+
"Avoids repeated work and lost context.",
|
|
41
|
+
"Enables long-horizon, stateful agents."
|
|
42
|
+
],
|
|
43
|
+
"risks": [
|
|
44
|
+
"Stale or wrong memories poison future answers.",
|
|
45
|
+
"Privacy and governance obligations on stored data.",
|
|
46
|
+
"Retrieval of irrelevant memories adds noise.",
|
|
47
|
+
"Unbounded growth without consolidation or expiry."
|
|
48
|
+
],
|
|
49
|
+
"tools": ["Vector databases", "Key-value / document stores", "MemGPT-style memory managers", "Agent frameworks (LangGraph, Agents SDKs)"],
|
|
50
|
+
"examples": [
|
|
51
|
+
"An assistant remembering a user's preferences across sessions.",
|
|
52
|
+
"A long-running agent summarizing progress so it never repeats a step.",
|
|
53
|
+
"A support agent recalling a customer's prior tickets when relevant."
|
|
54
|
+
],
|
|
55
|
+
"faqs": [
|
|
56
|
+
{ "q": "How is agent memory different from RAG?", "a": "RAG retrieves from an external knowledge base; agent memory retrieves from the agent's own accumulated state. The retrieval machinery is similar, but the source and write path differ." },
|
|
57
|
+
{ "q": "What is the difference between short- and long-term memory?", "a": "Short-term (working) memory is the live context window for the current task; long-term memory is a persistent store the agent reads from and writes to across tasks and sessions." },
|
|
58
|
+
{ "q": "Why not keep everything in the context window?", "a": "Windows are finite and quality drops as they fill. Externalizing state to memory and retrieving only what is relevant keeps the agent focused and affordable." },
|
|
59
|
+
{ "q": "What are the governance concerns?", "a": "Stored memory may contain personal or sensitive data, so it needs access control, retention limits and the ability to correct or delete entries." }
|
|
60
|
+
]
|
|
61
|
+
},
|
|
62
|
+
"es": {
|
|
63
|
+
"title": "¿Qué son los Sistemas de Memoria de Agentes?",
|
|
64
|
+
"summary": "La memoria de un agente es cómo un agente de IA retiene y recuerda información más allá de una sola ventana de contexto: entre pasos, sesiones y tareas. Suele separar la memoria de trabajo a corto plazo (el contexto actual) de la memoria a largo plazo (almacenes duraderos que el agente lee y escribe). La memoria es lo que permite a un agente arrastrar estado en una tarea larga, recordar a un usuario en el tiempo y evitar repetir trabajo. Es una capa central de la ingeniería de harness.",
|
|
65
|
+
"definition": "La memoria de agente es el conjunto de mecanismos que un agente de IA usa para almacenar, organizar y recuperar información más allá de su ventana de contexto inmediata, abarcando memoria de trabajo a corto plazo y memoria persistente a largo plazo.",
|
|
66
|
+
"takeaways": [
|
|
67
|
+
"La memoria extiende a un agente más allá de una sola ventana de contexto finita.",
|
|
68
|
+
"La memoria a corto plazo (de trabajo) y a largo plazo (persistente) cumplen roles distintos.",
|
|
69
|
+
"La memoria a largo plazo suele recuperarse bajo demanda, como RAG sobre el historial del agente.",
|
|
70
|
+
"Una buena memoria evita repetir trabajo y perder estado en tareas largas.",
|
|
71
|
+
"Qué escribir, conservar y olvidar es una decisión de diseño, no automática."
|
|
72
|
+
],
|
|
73
|
+
"context": [
|
|
74
|
+
"La ventana de contexto de un modelo es finita, así que todo lo que un agente deba recordar más allá de ella necesita un almacén externo. Sin memoria, un agente olvida pasos previos, repite acciones y no puede personalizar entre sesiones.",
|
|
75
|
+
"La memoria convierte un modelo sin estado en un sistema con continuidad. Lo difícil es la curación: decidir qué merece anotarse, cómo organizarlo y cómo recuperar solo lo relevante ahora, muy ligado a la ingeniería de contexto."
|
|
76
|
+
],
|
|
77
|
+
"architecture": [
|
|
78
|
+
"Dos capas: memoria de trabajo (la ventana de contexto actual, con la tarea activa) y memoria a largo plazo (almacenes externos —vectorial, clave-valor, documental o de grafo— escritos durante una tarea y recuperados después). Algunos diseños añaden memoria episódica (eventos), semántica (hechos) y procedimental (habilidades).",
|
|
79
|
+
"El agente lee memorias relevantes al contexto en cada paso y escribe nuevas a medida que aprende. Las políticas de recuperación, resumen y olvido mantienen la memoria útil en vez de abrumadora."
|
|
80
|
+
],
|
|
81
|
+
"components": ["Memoria de trabajo", "Almacén a largo plazo (vectorial/KV/grafo)", "Política de escritura", "Política de recuperación", "Resumen / consolidación", "Olvido / expiración"],
|
|
82
|
+
"pros": [
|
|
83
|
+
"Continuidad entre pasos, sesiones y tareas.",
|
|
84
|
+
"Personalización que persiste en el tiempo.",
|
|
85
|
+
"Evita repetir trabajo y perder contexto.",
|
|
86
|
+
"Habilita agentes con estado y de horizonte largo."
|
|
87
|
+
],
|
|
88
|
+
"risks": [
|
|
89
|
+
"Memorias obsoletas o erróneas contaminan respuestas futuras.",
|
|
90
|
+
"Obligaciones de privacidad y gobernanza sobre los datos guardados.",
|
|
91
|
+
"Recuperar memorias irrelevantes añade ruido.",
|
|
92
|
+
"Crecimiento sin límite sin consolidación ni expiración."
|
|
93
|
+
],
|
|
94
|
+
"tools": ["Bases de datos vectoriales", "Almacenes clave-valor / documentales", "Gestores de memoria estilo MemGPT", "Frameworks de agentes (LangGraph, SDKs de agentes)"],
|
|
95
|
+
"examples": [
|
|
96
|
+
"Un asistente que recuerda las preferencias de un usuario entre sesiones.",
|
|
97
|
+
"Un agente de larga duración que resume su progreso para no repetir un paso.",
|
|
98
|
+
"Un agente de soporte que recuerda los tickets previos de un cliente cuando es relevante."
|
|
99
|
+
],
|
|
100
|
+
"faqs": [
|
|
101
|
+
{ "q": "¿En qué se diferencia la memoria de agente de RAG?", "a": "RAG recupera de una base de conocimiento externa; la memoria de agente recupera del propio estado acumulado del agente. La maquinaria de recuperación es similar, pero la fuente y la ruta de escritura difieren." },
|
|
102
|
+
{ "q": "¿Cuál es la diferencia entre memoria a corto y largo plazo?", "a": "La memoria a corto plazo (de trabajo) es la ventana de contexto viva para la tarea actual; la de largo plazo es un almacén persistente que el agente lee y escribe entre tareas y sesiones." },
|
|
103
|
+
{ "q": "¿Por qué no guardar todo en la ventana de contexto?", "a": "Las ventanas son finitas y la calidad cae al llenarse. Externalizar el estado a memoria y recuperar solo lo relevante mantiene al agente enfocado y asequible." },
|
|
104
|
+
{ "q": "¿Cuáles son las preocupaciones de gobernanza?", "a": "La memoria guardada puede contener datos personales o sensibles, así que necesita control de acceso, límites de retención y capacidad de corregir o borrar entradas." }
|
|
105
|
+
]
|
|
106
|
+
},
|
|
107
|
+
"pt": {
|
|
108
|
+
"title": "O que são Sistemas de Memória de Agentes?",
|
|
109
|
+
"summary": "A memória de um agente é como um agente de IA retém e recupera informação além de uma única janela de contexto: entre passos, sessões e tarefas. Costuma separar a memória de trabalho de curto prazo (o contexto atual) da memória de longo prazo (armazenamentos duráveis que o agente lê e escreve). A memória é o que permite a um agente carregar estado numa tarefa longa, lembrar de um usuário ao longo do tempo e evitar repetir trabalho. É uma camada central da engenharia de harness.",
|
|
110
|
+
"definition": "A memória de agente é o conjunto de mecanismos que um agente de IA usa para armazenar, organizar e recuperar informação além de sua janela de contexto imediata, abrangendo memória de trabalho de curto prazo e memória persistente de longo prazo.",
|
|
111
|
+
"takeaways": [
|
|
112
|
+
"A memória estende um agente além de uma única janela de contexto finita.",
|
|
113
|
+
"Memória de curto prazo (de trabalho) e de longo prazo (persistente) cumprem papéis distintos.",
|
|
114
|
+
"A memória de longo prazo costuma ser recuperada sob demanda, como RAG sobre o histórico do agente.",
|
|
115
|
+
"Uma boa memória evita repetir trabalho e perder estado em tarefas longas.",
|
|
116
|
+
"O que escrever, manter e esquecer é uma decisão de design, não automática."
|
|
117
|
+
],
|
|
118
|
+
"context": [
|
|
119
|
+
"A janela de contexto de um modelo é finita, então tudo o que um agente precise lembrar além dela precisa de um armazenamento externo. Sem memória, um agente esquece passos anteriores, repete ações e não consegue personalizar entre sessões.",
|
|
120
|
+
"A memória transforma um modelo sem estado num sistema com continuidade. O difícil é a curadoria: decidir o que vale anotar, como organizá-lo e como recuperar só o relevante agora, muito ligado à engenharia de contexto."
|
|
121
|
+
],
|
|
122
|
+
"architecture": [
|
|
123
|
+
"Duas camadas: memória de trabalho (a janela de contexto atual, com a tarefa ativa) e memória de longo prazo (armazenamentos externos — vetorial, chave-valor, documental ou de grafo — escritos durante uma tarefa e recuperados depois). Alguns designs adicionam memória episódica (eventos), semântica (fatos) e procedural (habilidades).",
|
|
124
|
+
"O agente lê memórias relevantes ao contexto a cada passo e escreve novas conforme aprende. Políticas de recuperação, resumo e esquecimento mantêm a memória útil em vez de avassaladora."
|
|
125
|
+
],
|
|
126
|
+
"components": ["Memória de trabalho", "Armazenamento de longo prazo (vetorial/KV/grafo)", "Política de escrita", "Política de recuperação", "Resumo / consolidação", "Esquecimento / expiração"],
|
|
127
|
+
"pros": [
|
|
128
|
+
"Continuidade entre passos, sessões e tarefas.",
|
|
129
|
+
"Personalização que persiste ao longo do tempo.",
|
|
130
|
+
"Evita repetir trabalho e perder contexto.",
|
|
131
|
+
"Habilita agentes com estado e de horizonte longo."
|
|
132
|
+
],
|
|
133
|
+
"risks": [
|
|
134
|
+
"Memórias obsoletas ou erradas contaminam respostas futuras.",
|
|
135
|
+
"Obrigações de privacidade e governança sobre os dados guardados.",
|
|
136
|
+
"Recuperar memórias irrelevantes adiciona ruído.",
|
|
137
|
+
"Crescimento sem limite sem consolidação nem expiração."
|
|
138
|
+
],
|
|
139
|
+
"tools": ["Bancos de dados vetoriais", "Armazenamentos chave-valor / documentais", "Gerenciadores de memória estilo MemGPT", "Frameworks de agentes (LangGraph, SDKs de agentes)"],
|
|
140
|
+
"examples": [
|
|
141
|
+
"Um assistente que lembra as preferências de um usuário entre sessões.",
|
|
142
|
+
"Um agente de longa duração que resume seu progresso para não repetir um passo.",
|
|
143
|
+
"Um agente de suporte que lembra os chamados anteriores de um cliente quando relevante."
|
|
144
|
+
],
|
|
145
|
+
"faqs": [
|
|
146
|
+
{ "q": "Como a memória de agente difere do RAG?", "a": "O RAG recupera de uma base de conhecimento externa; a memória de agente recupera do próprio estado acumulado do agente. A maquinaria de recuperação é similar, mas a fonte e o caminho de escrita diferem." },
|
|
147
|
+
{ "q": "Qual a diferença entre memória de curto e longo prazo?", "a": "A memória de curto prazo (de trabalho) é a janela de contexto viva para a tarefa atual; a de longo prazo é um armazenamento persistente que o agente lê e escreve entre tarefas e sessões." },
|
|
148
|
+
{ "q": "Por que não guardar tudo na janela de contexto?", "a": "Janelas são finitas e a qualidade cai ao se encherem. Externalizar o estado para a memória e recuperar só o relevante mantém o agente focado e acessível." },
|
|
149
|
+
{ "q": "Quais são as preocupações de governança?", "a": "A memória guardada pode conter dados pessoais ou sensíveis, então precisa de controle de acesso, limites de retenção e capacidade de corrigir ou apagar entradas." }
|
|
150
|
+
]
|
|
151
|
+
}
|
|
152
|
+
}
|
|
153
|
+
}
|
|
@@ -0,0 +1,158 @@
|
|
|
1
|
+
{
|
|
2
|
+
"slug": "agentic-ai",
|
|
3
|
+
"category": "concept",
|
|
4
|
+
"updated": "2026-06-21",
|
|
5
|
+
"version": "1.0",
|
|
6
|
+
"featured": true,
|
|
7
|
+
"related": ["ai-agent", "harness-engineering", "multi-agent-architecture", "agentic-evaluation"],
|
|
8
|
+
"references": [
|
|
9
|
+
{ "title": "Yao et al. — ReAct: Synergizing Reasoning and Acting in Language Models (2022)", "url": "https://arxiv.org/abs/2210.03629" },
|
|
10
|
+
{ "title": "Anthropic — Building Effective Agents (2024)", "url": "https://www.anthropic.com/research/building-effective-agents" },
|
|
11
|
+
{ "title": "Model Context Protocol — Introduction", "url": "https://modelcontextprotocol.io" }
|
|
12
|
+
],
|
|
13
|
+
"evidence": {
|
|
14
|
+
"evidenceLevel": "industry_observation",
|
|
15
|
+
"confidenceLevel": "high",
|
|
16
|
+
"sourceType": ["industry_observation", "paper"]
|
|
17
|
+
},
|
|
18
|
+
"locales": {
|
|
19
|
+
"en": {
|
|
20
|
+
"title": "What is Agentic AI?",
|
|
21
|
+
"summary": "Agentic AI refers to systems that pursue goals over multiple steps — planning, calling tools, acting on an environment and reacting to feedback — instead of producing a single response. It turns a language model from a text generator into an actor that can complete tasks. The shift it represents is from do-it-yourself software, where the human drives every step, to do-it-for-me software, where the system carries out the work and reports back.",
|
|
22
|
+
"definition": "Agentic AI is the class of AI systems that autonomously plan and execute multi-step tasks by combining a model with memory, tools and a control loop.",
|
|
23
|
+
"takeaways": [
|
|
24
|
+
"An agent = model + tools + memory + a control loop that decides what to do next.",
|
|
25
|
+
"Autonomy is a spectrum, from a single tool call to long-horizon task execution.",
|
|
26
|
+
"Reliability comes mostly from the harness around the model, not raw model IQ.",
|
|
27
|
+
"Tool use (function calling) is what connects the model to real systems and data.",
|
|
28
|
+
"Evaluation must measure task completion (agency), not just answer quality (capability)."
|
|
29
|
+
],
|
|
30
|
+
"context": [
|
|
31
|
+
"For most of the LLM era, models were used as one-shot responders: a prompt in, an answer out. Agentic AI breaks that pattern by giving the model a loop — it can decide to call a tool, read the result, revise its plan and continue until the goal is met or a budget is exhausted.",
|
|
32
|
+
"This is the dominant frontier of applied AI in the enterprise because it moves the value from answering questions to completing work: resolving a support ticket end to end, refactoring a codebase, running a research task, operating a workflow."
|
|
33
|
+
],
|
|
34
|
+
"architecture": [
|
|
35
|
+
"A minimal agent has four parts: a reasoning model, a set of tools it can invoke, some form of memory or state, and an orchestration loop that turns model outputs into actions and feeds observations back in.",
|
|
36
|
+
"Patterns range from simple (a model with tools and a stop condition) to complex (planner-executor splits, reflection, and multi-agent teams). Anthropic's guidance is to prefer the simplest pattern that works and add structure only when measurably needed."
|
|
37
|
+
],
|
|
38
|
+
"components": ["Reasoning model", "Tools / function calling", "Memory & state", "Orchestration loop", "Guardrails", "Observability"],
|
|
39
|
+
"pros": [
|
|
40
|
+
"Completes multi-step work, not just single answers.",
|
|
41
|
+
"Adapts to feedback and recovers from intermediate errors.",
|
|
42
|
+
"Integrates with real systems through tools and APIs.",
|
|
43
|
+
"Scales repetitive knowledge work that was previously human-only."
|
|
44
|
+
],
|
|
45
|
+
"risks": [
|
|
46
|
+
"Compounding errors over long task horizons.",
|
|
47
|
+
"Unbounded cost and latency without budgets and stop conditions.",
|
|
48
|
+
"Security exposure from tool access and prompt injection.",
|
|
49
|
+
"Hard to evaluate and debug compared with single-shot prompts."
|
|
50
|
+
],
|
|
51
|
+
"tools": ["LangGraph", "OpenAI Agents SDK", "Claude Agent SDK", "Model Context Protocol (MCP)", "Vertex AI Agent Engine"],
|
|
52
|
+
"examples": [
|
|
53
|
+
"A customer-service agent that reads a ticket, looks up the order, applies a refund and replies — all through tools.",
|
|
54
|
+
"A coding agent that edits files, runs tests and iterates until the suite passes.",
|
|
55
|
+
"A research agent that searches, reads sources, verifies claims and writes a cited summary."
|
|
56
|
+
],
|
|
57
|
+
"faqs": [
|
|
58
|
+
{ "q": "What is the difference between an AI agent and agentic AI?", "a": "An AI agent is a concrete system; agentic AI is the broader paradigm of building software around such goal-directed, multi-step systems." },
|
|
59
|
+
{ "q": "Do you need a more powerful model to be agentic?", "a": "Not necessarily. The same model can succeed or fail at a task depending almost entirely on the harness — the tools, memory, prompts and control loop around it." },
|
|
60
|
+
{ "q": "Is RAG agentic?", "a": "Plain retrieval-augmented generation is a single step. It becomes agentic when the system decides when and what to retrieve as part of a multi-step loop." },
|
|
61
|
+
{ "q": "What makes agents unreliable?", "a": "Long horizons compound small errors, tools fail, and context gets lost. Reliability comes from harness engineering: good tools, memory, guardrails and evaluation." },
|
|
62
|
+
{ "q": "How do you measure an agent?", "a": "With agentic benchmarks and task-based evals that score end-to-end task completion in an environment, not just the quality of a single answer." }
|
|
63
|
+
]
|
|
64
|
+
},
|
|
65
|
+
"es": {
|
|
66
|
+
"title": "¿Qué es la IA Agéntica (Agentic AI)?",
|
|
67
|
+
"summary": "La IA agéntica designa sistemas que persiguen objetivos en varios pasos —planifican, llaman a herramientas, actúan sobre un entorno y reaccionan al feedback— en lugar de producir una única respuesta. Convierte a un modelo de lenguaje de generador de texto en un actor capaz de completar tareas. El cambio que representa es pasar del software 'hazlo tú', donde la persona conduce cada paso, al software 'hazlo por mí', donde el sistema ejecuta el trabajo y reporta el resultado.",
|
|
68
|
+
"definition": "La IA agéntica es la clase de sistemas de IA que planifican y ejecutan de forma autónoma tareas de varios pasos combinando un modelo con memoria, herramientas y un bucle de control.",
|
|
69
|
+
"takeaways": [
|
|
70
|
+
"Un agente = modelo + herramientas + memoria + un bucle de control que decide el siguiente paso.",
|
|
71
|
+
"La autonomía es un espectro, desde una sola llamada a herramienta hasta tareas de horizonte largo.",
|
|
72
|
+
"La fiabilidad viene sobre todo del 'harness' alrededor del modelo, no del coeficiente del modelo.",
|
|
73
|
+
"El uso de herramientas (function calling) es lo que conecta el modelo con sistemas y datos reales.",
|
|
74
|
+
"La evaluación debe medir la finalización de la tarea (agencia), no solo la calidad de la respuesta (capacidad)."
|
|
75
|
+
],
|
|
76
|
+
"context": [
|
|
77
|
+
"Durante buena parte de la era LLM los modelos se usaron como respondedores de un solo turno: entra un prompt, sale una respuesta. La IA agéntica rompe ese patrón dándole al modelo un bucle: puede decidir llamar a una herramienta, leer el resultado, revisar su plan y continuar hasta cumplir el objetivo o agotar un presupuesto.",
|
|
78
|
+
"Es la frontera dominante de la IA aplicada en la empresa porque mueve el valor de responder preguntas a completar trabajo: resolver un ticket de soporte de principio a fin, refactorizar un código, ejecutar una investigación, operar un flujo de trabajo."
|
|
79
|
+
],
|
|
80
|
+
"architecture": [
|
|
81
|
+
"Un agente mínimo tiene cuatro partes: un modelo de razonamiento, un conjunto de herramientas que puede invocar, alguna forma de memoria o estado, y un bucle de orquestación que convierte las salidas del modelo en acciones y reintroduce las observaciones.",
|
|
82
|
+
"Los patrones van de lo simple (un modelo con herramientas y una condición de parada) a lo complejo (separación planificador-ejecutor, reflexión y equipos multiagente). La recomendación de Anthropic es preferir el patrón más simple que funcione y añadir estructura solo cuando aporte de forma medible."
|
|
83
|
+
],
|
|
84
|
+
"components": ["Modelo de razonamiento", "Herramientas / function calling", "Memoria y estado", "Bucle de orquestación", "Guardarraíles", "Observabilidad"],
|
|
85
|
+
"pros": [
|
|
86
|
+
"Completa trabajo de varios pasos, no solo respuestas sueltas.",
|
|
87
|
+
"Se adapta al feedback y se recupera de errores intermedios.",
|
|
88
|
+
"Se integra con sistemas reales mediante herramientas y APIs.",
|
|
89
|
+
"Escala trabajo de conocimiento repetitivo antes exclusivamente humano."
|
|
90
|
+
],
|
|
91
|
+
"risks": [
|
|
92
|
+
"Acumulación de errores en horizontes de tarea largos.",
|
|
93
|
+
"Coste y latencia sin límite si faltan presupuestos y condiciones de parada.",
|
|
94
|
+
"Exposición de seguridad por el acceso a herramientas y la inyección de prompts.",
|
|
95
|
+
"Difícil de evaluar y depurar frente a los prompts de un solo turno."
|
|
96
|
+
],
|
|
97
|
+
"tools": ["LangGraph", "OpenAI Agents SDK", "Claude Agent SDK", "Model Context Protocol (MCP)", "Vertex AI Agent Engine"],
|
|
98
|
+
"examples": [
|
|
99
|
+
"Un agente de atención al cliente que lee un ticket, consulta el pedido, aplica un reembolso y responde, todo a través de herramientas.",
|
|
100
|
+
"Un agente de programación que edita ficheros, ejecuta tests e itera hasta que la suite pasa.",
|
|
101
|
+
"Un agente de investigación que busca, lee fuentes, verifica afirmaciones y escribe un resumen con citas."
|
|
102
|
+
],
|
|
103
|
+
"faqs": [
|
|
104
|
+
{ "q": "¿Cuál es la diferencia entre un agente de IA y la IA agéntica?", "a": "Un agente de IA es un sistema concreto; la IA agéntica es el paradigma más amplio de construir software en torno a esos sistemas dirigidos a objetivos y de varios pasos." },
|
|
105
|
+
{ "q": "¿Hace falta un modelo más potente para ser agéntico?", "a": "No necesariamente. El mismo modelo puede triunfar o fracasar en una tarea casi por completo según su harness: las herramientas, la memoria, los prompts y el bucle de control que lo rodean." },
|
|
106
|
+
{ "q": "¿RAG es agéntico?", "a": "El RAG simple es un único paso. Se vuelve agéntico cuando el sistema decide cuándo y qué recuperar como parte de un bucle de varios pasos." },
|
|
107
|
+
{ "q": "¿Qué hace poco fiables a los agentes?", "a": "Los horizontes largos acumulan errores pequeños, las herramientas fallan y se pierde contexto. La fiabilidad viene de la ingeniería de harness: buenas herramientas, memoria, guardarraíles y evaluación." },
|
|
108
|
+
{ "q": "¿Cómo se mide un agente?", "a": "Con benchmarks agénticos y evaluaciones basadas en tareas que puntúan la finalización de extremo a extremo en un entorno, no solo la calidad de una respuesta." }
|
|
109
|
+
]
|
|
110
|
+
},
|
|
111
|
+
"pt": {
|
|
112
|
+
"title": "O que é IA Agêntica (Agentic AI)?",
|
|
113
|
+
"summary": "A IA agêntica designa sistemas que perseguem objetivos em vários passos — planejam, chamam ferramentas, agem sobre um ambiente e reagem ao feedback — em vez de produzir uma única resposta. Transforma um modelo de linguagem de gerador de texto em um ator capaz de concluir tarefas. A mudança que representa é passar do software 'faça você mesmo', em que a pessoa conduz cada passo, ao software 'faça por mim', em que o sistema executa o trabalho e reporta o resultado.",
|
|
114
|
+
"definition": "A IA agêntica é a classe de sistemas de IA que planejam e executam de forma autônoma tarefas de vários passos combinando um modelo com memória, ferramentas e um laço de controle.",
|
|
115
|
+
"takeaways": [
|
|
116
|
+
"Um agente = modelo + ferramentas + memória + um laço de controle que decide o próximo passo.",
|
|
117
|
+
"A autonomia é um espectro, de uma única chamada de ferramenta a tarefas de horizonte longo.",
|
|
118
|
+
"A confiabilidade vem sobretudo do 'harness' em torno do modelo, não do QI do modelo.",
|
|
119
|
+
"O uso de ferramentas (function calling) é o que conecta o modelo a sistemas e dados reais.",
|
|
120
|
+
"A avaliação deve medir a conclusão da tarefa (agência), não só a qualidade da resposta (capacidade)."
|
|
121
|
+
],
|
|
122
|
+
"context": [
|
|
123
|
+
"Durante boa parte da era LLM os modelos foram usados como respondedores de um único turno: entra um prompt, sai uma resposta. A IA agêntica quebra esse padrão dando ao modelo um laço: ele pode decidir chamar uma ferramenta, ler o resultado, revisar seu plano e continuar até cumprir o objetivo ou esgotar um orçamento.",
|
|
124
|
+
"É a fronteira dominante da IA aplicada na empresa porque move o valor de responder perguntas para concluir trabalho: resolver um chamado de suporte de ponta a ponta, refatorar um código, executar uma pesquisa, operar um fluxo de trabalho."
|
|
125
|
+
],
|
|
126
|
+
"architecture": [
|
|
127
|
+
"Um agente mínimo tem quatro partes: um modelo de raciocínio, um conjunto de ferramentas que pode invocar, alguma forma de memória ou estado, e um laço de orquestração que converte as saídas do modelo em ações e realimenta as observações.",
|
|
128
|
+
"Os padrões vão do simples (um modelo com ferramentas e uma condição de parada) ao complexo (separação planejador-executor, reflexão e equipes multiagente). A recomendação da Anthropic é preferir o padrão mais simples que funcione e adicionar estrutura só quando agregar de forma mensurável."
|
|
129
|
+
],
|
|
130
|
+
"components": ["Modelo de raciocínio", "Ferramentas / function calling", "Memória e estado", "Laço de orquestração", "Guard-rails", "Observabilidade"],
|
|
131
|
+
"pros": [
|
|
132
|
+
"Conclui trabalho de vários passos, não só respostas isoladas.",
|
|
133
|
+
"Adapta-se ao feedback e se recupera de erros intermediários.",
|
|
134
|
+
"Integra-se a sistemas reais por meio de ferramentas e APIs.",
|
|
135
|
+
"Escala trabalho de conhecimento repetitivo antes exclusivamente humano."
|
|
136
|
+
],
|
|
137
|
+
"risks": [
|
|
138
|
+
"Acúmulo de erros em horizontes de tarefa longos.",
|
|
139
|
+
"Custo e latência sem limite sem orçamentos e condições de parada.",
|
|
140
|
+
"Exposição de segurança pelo acesso a ferramentas e pela injeção de prompts.",
|
|
141
|
+
"Difícil de avaliar e depurar frente aos prompts de um único turno."
|
|
142
|
+
],
|
|
143
|
+
"tools": ["LangGraph", "OpenAI Agents SDK", "Claude Agent SDK", "Model Context Protocol (MCP)", "Vertex AI Agent Engine"],
|
|
144
|
+
"examples": [
|
|
145
|
+
"Um agente de atendimento que lê um chamado, consulta o pedido, aplica um reembolso e responde, tudo via ferramentas.",
|
|
146
|
+
"Um agente de programação que edita arquivos, executa testes e itera até a suíte passar.",
|
|
147
|
+
"Um agente de pesquisa que busca, lê fontes, verifica afirmações e escreve um resumo com citações."
|
|
148
|
+
],
|
|
149
|
+
"faqs": [
|
|
150
|
+
{ "q": "Qual é a diferença entre um agente de IA e IA agêntica?", "a": "Um agente de IA é um sistema concreto; a IA agêntica é o paradigma mais amplo de construir software em torno desses sistemas orientados a objetivos e de vários passos." },
|
|
151
|
+
{ "q": "É preciso um modelo mais potente para ser agêntico?", "a": "Não necessariamente. O mesmo modelo pode ter sucesso ou falhar numa tarefa quase inteiramente conforme seu harness: as ferramentas, a memória, os prompts e o laço de controle ao seu redor." },
|
|
152
|
+
{ "q": "RAG é agêntico?", "a": "O RAG simples é um único passo. Torna-se agêntico quando o sistema decide quando e o que recuperar como parte de um laço de vários passos." },
|
|
153
|
+
{ "q": "O que torna os agentes pouco confiáveis?", "a": "Horizontes longos acumulam pequenos erros, ferramentas falham e contexto se perde. A confiabilidade vem da engenharia de harness: boas ferramentas, memória, guard-rails e avaliação." },
|
|
154
|
+
{ "q": "Como se mede um agente?", "a": "Com benchmarks agênticos e avaliações baseadas em tarefas que pontuam a conclusão de ponta a ponta num ambiente, não só a qualidade de uma resposta." }
|
|
155
|
+
]
|
|
156
|
+
}
|
|
157
|
+
}
|
|
158
|
+
}
|
|
@@ -0,0 +1,156 @@
|
|
|
1
|
+
{
|
|
2
|
+
"slug": "agentic-evaluation",
|
|
3
|
+
"category": "concept",
|
|
4
|
+
"updated": "2026-06-24",
|
|
5
|
+
"version": "1.1",
|
|
6
|
+
"related": ["agentic-ai", "harness-engineering", "ai-agent", "ai-governance"],
|
|
7
|
+
"references": [
|
|
8
|
+
{ "title": "Jimenez et al. — SWE-bench: Can Language Models Resolve Real-World GitHub Issues? (2023)", "url": "https://arxiv.org/abs/2310.06770" },
|
|
9
|
+
{ "title": "Santiago Santa María — The Stopwatch and the Exam", "url": "https://articles.santismm.com/the-stopwatch-and-the-exam/" }
|
|
10
|
+
],
|
|
11
|
+
"evidence": {
|
|
12
|
+
"evidenceLevel": "production",
|
|
13
|
+
"confidenceLevel": "medium",
|
|
14
|
+
"sourceType": ["production_system", "personal_experience", "industry_observation", "paper"]
|
|
15
|
+
},
|
|
16
|
+
"locales": {
|
|
17
|
+
"en": {
|
|
18
|
+
"title": "What is Agentic AI Evaluation?",
|
|
19
|
+
"summary": "Agentic AI evaluation is the practice of measuring how well an agent completes multi-step, tool-using tasks in an environment — not just the quality of a single answer. As models saturate static knowledge benchmarks, evaluation is shifting from measuring capability (what a model knows) to measuring agency (what a system can actually get done). Good evals are the feedback loop that makes harness engineering possible.",
|
|
20
|
+
"definition": "Agentic evaluation is the measurement of an AI agent's end-to-end task performance — success rate, reliability, cost and safety — on realistic, multi-step tasks in an environment.",
|
|
21
|
+
"takeaways": [
|
|
22
|
+
"Evaluate task completion (agency), not just answer quality (capability).",
|
|
23
|
+
"Agentic benchmarks test tools, environments and long horizons.",
|
|
24
|
+
"Static benchmarks saturate; agentic ones are the new frontier.",
|
|
25
|
+
"Evals are the feedback loop for improving the harness.",
|
|
26
|
+
"Measure success, reliability, cost, latency and safety together."
|
|
27
|
+
],
|
|
28
|
+
"context": [
|
|
29
|
+
"Traditional benchmarks ask a model questions and score the answers. That measures capability, but it tells you little about whether a system can complete real work. Agentic evaluation instead places an agent in an environment with tools and a goal, and scores whether it actually achieves it.",
|
|
30
|
+
"This shift matters because production value comes from task completion. An agent that answers well but fails to finish tasks is not useful. Evaluation is also what lets teams improve harnesses systematically rather than by anecdote."
|
|
31
|
+
],
|
|
32
|
+
"architecture": [
|
|
33
|
+
"An agentic eval defines tasks, an environment (real or simulated) with tools, a success criterion, and metrics. The agent runs; its trajectory and outcome are scored automatically where possible, with human review for nuanced cases.",
|
|
34
|
+
"Beyond a single success rate, mature evaluation tracks reliability across runs, cost and latency budgets, and safety (did the agent stay within authorization and avoid harmful actions). Traces from observability feed directly into eval design."
|
|
35
|
+
],
|
|
36
|
+
"components": ["Task suite", "Environment & tools", "Success criteria", "Metrics (success, cost, latency, safety)", "Automated graders", "Human review", "Trajectory traces"],
|
|
37
|
+
"pros": [
|
|
38
|
+
"Measures what actually matters: task completion.",
|
|
39
|
+
"Catches regressions before they reach users.",
|
|
40
|
+
"Turns harness improvement into a measurable loop.",
|
|
41
|
+
"Surfaces reliability, cost and safety, not just accuracy."
|
|
42
|
+
],
|
|
43
|
+
"risks": [
|
|
44
|
+
"Hard to build realistic environments and graders.",
|
|
45
|
+
"Overfitting to a benchmark instead of real performance.",
|
|
46
|
+
"Saturation: benchmarks lose discriminative power over time.",
|
|
47
|
+
"Automated grading can miss nuance; human review is costly."
|
|
48
|
+
],
|
|
49
|
+
"tools": ["SWE-bench and other agentic benchmarks", "LangSmith / Langfuse", "OpenAI Evals", "Custom task harnesses", "LLM-as-judge graders"],
|
|
50
|
+
"examples": [
|
|
51
|
+
"Scoring a coding agent on whether its patch makes a real test suite pass.",
|
|
52
|
+
"Measuring a support agent's end-to-end ticket resolution rate.",
|
|
53
|
+
"Tracking reliability of a workflow agent across repeated runs.",
|
|
54
|
+
"In practice: evaluating an autonomous agent (OpenClaw) over 57 days straight from production traces — 161 sessions at 98.8% success (2 errors), with per-model reliability of 100% vs 95.7% across two model versions — a reliability baseline computed directly from operational traces rather than a curated benchmark set."
|
|
55
|
+
],
|
|
56
|
+
"faqs": [
|
|
57
|
+
{ "q": "What is the difference between capability and agency?", "a": "Capability is what a model knows or can do in isolation; agency is what a full system can actually accomplish in an environment. Agentic evaluation measures the latter." },
|
|
58
|
+
{ "q": "Why are static benchmarks no longer enough?", "a": "Top models saturate them, so they stop discriminating. They also do not test tool use, environments or long-horizon tasks, which is where real agent performance lives." },
|
|
59
|
+
{ "q": "What is an agentic benchmark?", "a": "A test that scores an agent's ability to complete multi-step, tool-using tasks in an environment — for example resolving real software issues." },
|
|
60
|
+
{ "q": "How do evals relate to harness engineering?", "a": "Evals are the measurement loop that makes harness engineering possible: you change the harness, measure the effect, and keep what demonstrably improves task performance." }
|
|
61
|
+
]
|
|
62
|
+
},
|
|
63
|
+
"es": {
|
|
64
|
+
"title": "¿Qué es la Evaluación de IA Agéntica?",
|
|
65
|
+
"summary": "La evaluación de IA agéntica es la práctica de medir cómo de bien un agente completa tareas de varios pasos con uso de herramientas en un entorno, no solo la calidad de una única respuesta. A medida que los modelos saturan los benchmarks estáticos de conocimiento, la evaluación se desplaza de medir capacidad (lo que un modelo sabe) a medir agencia (lo que un sistema realmente logra hacer). Unas buenas evaluaciones son el bucle de feedback que hace posible la ingeniería de harness.",
|
|
66
|
+
"definition": "La evaluación agéntica es la medición del rendimiento de extremo a extremo de un agente de IA —tasa de éxito, fiabilidad, coste y seguridad— en tareas realistas de varios pasos dentro de un entorno.",
|
|
67
|
+
"takeaways": [
|
|
68
|
+
"Evaluar la finalización de la tarea (agencia), no solo la calidad de la respuesta (capacidad).",
|
|
69
|
+
"Los benchmarks agénticos prueban herramientas, entornos y horizontes largos.",
|
|
70
|
+
"Los benchmarks estáticos se saturan; los agénticos son la nueva frontera.",
|
|
71
|
+
"Las evaluaciones son el bucle de feedback para mejorar el harness.",
|
|
72
|
+
"Medir juntos éxito, fiabilidad, coste, latencia y seguridad."
|
|
73
|
+
],
|
|
74
|
+
"context": [
|
|
75
|
+
"Los benchmarks tradicionales hacen preguntas a un modelo y puntúan las respuestas. Eso mide capacidad, pero dice poco sobre si un sistema puede completar trabajo real. La evaluación agéntica, en cambio, coloca a un agente en un entorno con herramientas y un objetivo, y puntúa si realmente lo alcanza.",
|
|
76
|
+
"Este cambio importa porque el valor en producción viene de completar tareas. Un agente que responde bien pero no termina las tareas no es útil. La evaluación es también lo que permite mejorar los harness de forma sistemática y no por anécdota."
|
|
77
|
+
],
|
|
78
|
+
"architecture": [
|
|
79
|
+
"Una evaluación agéntica define tareas, un entorno (real o simulado) con herramientas, un criterio de éxito y métricas. El agente se ejecuta; su trayectoria y su resultado se puntúan automáticamente cuando es posible, con revisión humana para casos con matiz.",
|
|
80
|
+
"Más allá de una sola tasa de éxito, la evaluación madura sigue la fiabilidad entre ejecuciones, los presupuestos de coste y latencia, y la seguridad (¿se mantuvo el agente dentro de su autorización y evitó acciones dañinas?). Las trazas de observabilidad alimentan directamente el diseño de las evaluaciones."
|
|
81
|
+
],
|
|
82
|
+
"components": ["Suite de tareas", "Entorno y herramientas", "Criterios de éxito", "Métricas (éxito, coste, latencia, seguridad)", "Evaluadores automáticos", "Revisión humana", "Trazas de trayectoria"],
|
|
83
|
+
"pros": [
|
|
84
|
+
"Mide lo que de verdad importa: la finalización de la tarea.",
|
|
85
|
+
"Detecta regresiones antes de que lleguen a los usuarios.",
|
|
86
|
+
"Convierte la mejora del harness en un bucle medible.",
|
|
87
|
+
"Saca a la luz fiabilidad, coste y seguridad, no solo precisión."
|
|
88
|
+
],
|
|
89
|
+
"risks": [
|
|
90
|
+
"Difícil construir entornos y evaluadores realistas.",
|
|
91
|
+
"Sobreajuste a un benchmark en vez del rendimiento real.",
|
|
92
|
+
"Saturación: los benchmarks pierden poder discriminativo con el tiempo.",
|
|
93
|
+
"La evaluación automática puede perder matices; la revisión humana es cara."
|
|
94
|
+
],
|
|
95
|
+
"tools": ["SWE-bench y otros benchmarks agénticos", "LangSmith / Langfuse", "OpenAI Evals", "Harness de tareas a medida", "Evaluadores LLM-as-judge"],
|
|
96
|
+
"examples": [
|
|
97
|
+
"Puntuar a un agente de programación según si su parche hace pasar una suite de tests real.",
|
|
98
|
+
"Medir la tasa de resolución de tickets de extremo a extremo de un agente de soporte.",
|
|
99
|
+
"Seguir la fiabilidad de un agente de flujo de trabajo en ejecuciones repetidas.",
|
|
100
|
+
"En la práctica: evaluar un agente autónomo (OpenClaw) durante 57 días directamente desde trazas de producción — 161 sesiones con 98,8% de éxito (2 errores), con fiabilidad por modelo de 100% frente a 95,7% en dos versiones — una línea base de fiabilidad calculada directamente desde trazas operativas, no desde un set de benchmark curado."
|
|
101
|
+
],
|
|
102
|
+
"faqs": [
|
|
103
|
+
{ "q": "¿Cuál es la diferencia entre capacidad y agencia?", "a": "La capacidad es lo que un modelo sabe o puede hacer de forma aislada; la agencia es lo que un sistema completo logra realmente en un entorno. La evaluación agéntica mide esto último." },
|
|
104
|
+
{ "q": "¿Por qué ya no bastan los benchmarks estáticos?", "a": "Los mejores modelos los saturan y dejan de discriminar. Además no prueban uso de herramientas, entornos ni tareas de horizonte largo, que es donde está el rendimiento real de un agente." },
|
|
105
|
+
{ "q": "¿Qué es un benchmark agéntico?", "a": "Una prueba que puntúa la capacidad de un agente para completar tareas de varios pasos con uso de herramientas en un entorno; por ejemplo, resolver incidencias reales de software." },
|
|
106
|
+
{ "q": "¿Cómo se relacionan las evaluaciones con la ingeniería de harness?", "a": "Las evaluaciones son el bucle de medición que hace posible la ingeniería de harness: cambias el harness, mides el efecto y conservas lo que demuestra mejorar el rendimiento en la tarea." }
|
|
107
|
+
]
|
|
108
|
+
},
|
|
109
|
+
"pt": {
|
|
110
|
+
"title": "O que é Avaliação de IA Agêntica?",
|
|
111
|
+
"summary": "A avaliação de IA agêntica é a prática de medir quão bem um agente conclui tarefas de vários passos com uso de ferramentas num ambiente, não só a qualidade de uma única resposta. À medida que os modelos saturam os benchmarks estáticos de conhecimento, a avaliação se desloca de medir capacidade (o que um modelo sabe) para medir agência (o que um sistema realmente consegue concluir). Boas avaliações são o laço de feedback que torna possível a engenharia de harness.",
|
|
112
|
+
"definition": "A avaliação agêntica é a medição do desempenho de ponta a ponta de um agente de IA — taxa de sucesso, confiabilidade, custo e segurança — em tarefas realistas de vários passos dentro de um ambiente.",
|
|
113
|
+
"takeaways": [
|
|
114
|
+
"Avaliar a conclusão da tarefa (agência), não só a qualidade da resposta (capacidade).",
|
|
115
|
+
"Os benchmarks agênticos testam ferramentas, ambientes e horizontes longos.",
|
|
116
|
+
"Os benchmarks estáticos saturam; os agênticos são a nova fronteira.",
|
|
117
|
+
"As avaliações são o laço de feedback para melhorar o harness.",
|
|
118
|
+
"Medir juntos sucesso, confiabilidade, custo, latência e segurança."
|
|
119
|
+
],
|
|
120
|
+
"context": [
|
|
121
|
+
"Os benchmarks tradicionais fazem perguntas a um modelo e pontuam as respostas. Isso mede capacidade, mas diz pouco sobre se um sistema consegue concluir trabalho real. A avaliação agêntica, em vez disso, coloca um agente num ambiente com ferramentas e um objetivo, e pontua se ele realmente o alcança.",
|
|
122
|
+
"Essa mudança importa porque o valor em produção vem de concluir tarefas. Um agente que responde bem mas não termina as tarefas não é útil. A avaliação é também o que permite melhorar os harnesses de forma sistemática e não por anedota."
|
|
123
|
+
],
|
|
124
|
+
"architecture": [
|
|
125
|
+
"Uma avaliação agêntica define tarefas, um ambiente (real ou simulado) com ferramentas, um critério de sucesso e métricas. O agente é executado; sua trajetória e seu resultado são pontuados automaticamente quando possível, com revisão humana para casos com nuance.",
|
|
126
|
+
"Além de uma única taxa de sucesso, a avaliação madura acompanha a confiabilidade entre execuções, os orçamentos de custo e latência, e a segurança (o agente se manteve dentro de sua autorização e evitou ações nocivas?). Os rastros de observabilidade alimentam diretamente o design das avaliações."
|
|
127
|
+
],
|
|
128
|
+
"components": ["Suíte de tarefas", "Ambiente e ferramentas", "Critérios de sucesso", "Métricas (sucesso, custo, latência, segurança)", "Avaliadores automáticos", "Revisão humana", "Rastros de trajetória"],
|
|
129
|
+
"pros": [
|
|
130
|
+
"Mede o que de fato importa: a conclusão da tarefa.",
|
|
131
|
+
"Detecta regressões antes de chegarem aos usuários.",
|
|
132
|
+
"Transforma a melhoria do harness num laço mensurável.",
|
|
133
|
+
"Revela confiabilidade, custo e segurança, não só precisão."
|
|
134
|
+
],
|
|
135
|
+
"risks": [
|
|
136
|
+
"Difícil construir ambientes e avaliadores realistas.",
|
|
137
|
+
"Sobreajuste a um benchmark em vez do desempenho real.",
|
|
138
|
+
"Saturação: os benchmarks perdem poder discriminativo com o tempo.",
|
|
139
|
+
"A avaliação automática pode perder nuances; a revisão humana é cara."
|
|
140
|
+
],
|
|
141
|
+
"tools": ["SWE-bench e outros benchmarks agênticos", "LangSmith / Langfuse", "OpenAI Evals", "Harness de tarefas sob medida", "Avaliadores LLM-as-judge"],
|
|
142
|
+
"examples": [
|
|
143
|
+
"Pontuar um agente de programação conforme seu patch faça passar uma suíte de testes real.",
|
|
144
|
+
"Medir a taxa de resolução de chamados de ponta a ponta de um agente de suporte.",
|
|
145
|
+
"Acompanhar a confiabilidade de um agente de fluxo de trabalho em execuções repetidas.",
|
|
146
|
+
"Na prática: avaliar um agente autônomo (OpenClaw) por 57 dias diretamente a partir de rastros de produção — 161 sessões com 98,8% de sucesso (2 erros), com confiabilidade por modelo de 100% ante 95,7% em duas versões — uma linha de base de confiabilidade calculada diretamente de rastros operacionais, não de um conjunto de benchmark curado."
|
|
147
|
+
],
|
|
148
|
+
"faqs": [
|
|
149
|
+
{ "q": "Qual é a diferença entre capacidade e agência?", "a": "Capacidade é o que um modelo sabe ou pode fazer isoladamente; agência é o que um sistema completo realmente realiza num ambiente. A avaliação agêntica mede o segundo." },
|
|
150
|
+
{ "q": "Por que os benchmarks estáticos já não bastam?", "a": "Os melhores modelos os saturam e deixam de discriminar. Além disso não testam uso de ferramentas, ambientes nem tarefas de horizonte longo, que é onde está o desempenho real de um agente." },
|
|
151
|
+
{ "q": "O que é um benchmark agêntico?", "a": "Um teste que pontua a capacidade de um agente de concluir tarefas de vários passos com uso de ferramentas num ambiente; por exemplo, resolver issues reais de software." },
|
|
152
|
+
{ "q": "Como as avaliações se relacionam com a engenharia de harness?", "a": "As avaliações são o laço de medição que torna possível a engenharia de harness: você muda o harness, mede o efeito e mantém o que comprovadamente melhora o desempenho na tarefa." }
|
|
153
|
+
]
|
|
154
|
+
}
|
|
155
|
+
}
|
|
156
|
+
}
|