santismm-knowledge-mcp 0.2.1
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/LICENSE +21 -0
- package/README.md +62 -0
- package/content/CONVENTIONS.md +77 -0
- package/content/LICENSE +55 -0
- package/content/architectures/ai-workforce.json +280 -0
- package/content/architectures/customer-service-agent.json +292 -0
- package/content/architectures/enterprise-knowledge-assistant.json +292 -0
- package/content/architectures/operations-center.json +280 -0
- package/content/architectures/sales-copilot.json +280 -0
- package/content/governance/agentic-ai-governance-checklist.json +323 -0
- package/content/governance/audit-framework-for-agentic-systems.json +280 -0
- package/content/governance/enterprise-ai-governance-framework.json +277 -0
- package/content/governance/eu-ai-act.json +162 -0
- package/content/governance/human-oversight-and-accountability-policy.json +275 -0
- package/content/governance/iso-42001.json +161 -0
- package/content/governance/mitre-atlas.json +280 -0
- package/content/governance/nist-ai-rmf.json +161 -0
- package/content/governance/owasp-llm-top10.json +301 -0
- package/content/harness/HRN-001-definition-and-overview.es.md +76 -0
- package/content/harness/HRN-001-definition-and-overview.md +125 -0
- package/content/harness/HRN-001-definition-and-overview.pt.md +76 -0
- package/content/harness/HRN-002-a-brief-history-of-harness-engineering.es.md +83 -0
- package/content/harness/HRN-002-a-brief-history-of-harness-engineering.md +113 -0
- package/content/harness/HRN-002-a-brief-history-of-harness-engineering.pt.md +83 -0
- package/content/harness/HRN-003-the-harness-taxonomy.es.md +105 -0
- package/content/harness/HRN-003-the-harness-taxonomy.md +158 -0
- package/content/harness/HRN-003-the-harness-taxonomy.pt.md +105 -0
- package/content/harness/HRN-004-harness-engineering-principles.es.md +91 -0
- package/content/harness/HRN-004-harness-engineering-principles.md +135 -0
- package/content/harness/HRN-004-harness-engineering-principles.pt.md +91 -0
- package/content/harness/HRN-005-memory-in-agentic-systems.es.md +98 -0
- package/content/harness/HRN-005-memory-in-agentic-systems.md +145 -0
- package/content/harness/HRN-005-memory-in-agentic-systems.pt.md +98 -0
- package/content/harness/HRN-006-observability-for-agentic-systems.es.md +97 -0
- package/content/harness/HRN-006-observability-for-agentic-systems.md +139 -0
- package/content/harness/HRN-006-observability-for-agentic-systems.pt.md +97 -0
- package/content/harness/HRN-007-evaluation-of-agentic-systems.es.md +96 -0
- package/content/harness/HRN-007-evaluation-of-agentic-systems.md +145 -0
- package/content/harness/HRN-007-evaluation-of-agentic-systems.pt.md +96 -0
- package/content/harness/HRN-008-governance-within-the-harness.es.md +105 -0
- package/content/harness/HRN-008-governance-within-the-harness.md +146 -0
- package/content/harness/HRN-008-governance-within-the-harness.pt.md +105 -0
- package/content/harness/HRN-009-planning-and-goal-management.es.md +102 -0
- package/content/harness/HRN-009-planning-and-goal-management.md +142 -0
- package/content/harness/HRN-009-planning-and-goal-management.pt.md +102 -0
- package/content/harness/HRN-010-orchestration.es.md +107 -0
- package/content/harness/HRN-010-orchestration.md +149 -0
- package/content/harness/HRN-010-orchestration.pt.md +107 -0
- package/content/harness/HRN-011-security-for-agentic-systems.es.md +107 -0
- package/content/harness/HRN-011-security-for-agentic-systems.md +147 -0
- package/content/harness/HRN-011-security-for-agentic-systems.pt.md +107 -0
- package/content/harness/HRN-012-case-studies-in-harness-engineering.es.md +120 -0
- package/content/harness/HRN-012-case-studies-in-harness-engineering.md +157 -0
- package/content/harness/HRN-012-case-studies-in-harness-engineering.pt.md +120 -0
- package/content/harness/HRN-013-glossary.es.md +109 -0
- package/content/harness/HRN-013-glossary.md +124 -0
- package/content/harness/HRN-013-glossary.pt.md +109 -0
- package/content/harness/HRN-014-bibliography.es.md +89 -0
- package/content/harness/HRN-014-bibliography.md +109 -0
- package/content/harness/HRN-014-bibliography.pt.md +89 -0
- package/content/homeric/episodes/achilles-and-hector.json +139 -0
- package/content/homeric/episodes/aeolus-and-the-winds.json +131 -0
- package/content/homeric/episodes/agamemnons-murder.json +162 -0
- package/content/homeric/episodes/calypso-ogygia.json +157 -0
- package/content/homeric/episodes/catalogue-of-ships.json +177 -0
- package/content/homeric/episodes/cattle-of-the-sun.json +131 -0
- package/content/homeric/episodes/chryse-and-the-plague.json +131 -0
- package/content/homeric/episodes/cicones-at-ismarus.json +131 -0
- package/content/homeric/episodes/circe-on-aeaea.json +131 -0
- package/content/homeric/episodes/cyclops-polyphemus.json +162 -0
- package/content/homeric/episodes/laestrygonians.json +153 -0
- package/content/homeric/episodes/lotus-eaters.json +138 -0
- package/content/homeric/episodes/menelaus-and-proteus.json +130 -0
- package/content/homeric/episodes/nekyia.json +160 -0
- package/content/homeric/episodes/phaeacians-on-scheria.json +129 -0
- package/content/homeric/episodes/priams-ransom.json +131 -0
- package/content/homeric/episodes/return-to-ithaca.json +167 -0
- package/content/homeric/episodes/scylla-and-charybdis.json +131 -0
- package/content/homeric/episodes/suitors-ambush-at-asteris.json +131 -0
- package/content/homeric/episodes/telemachus-at-pylos.json +130 -0
- package/content/homeric/episodes/telemachus-in-sparta.json +130 -0
- package/content/homeric/episodes/the-achaean-camp.json +138 -0
- package/content/homeric/episodes/the-sirens.json +129 -0
- package/content/homeric/episodes/wooden-horse.json +168 -0
- package/content/homeric/places/aeaea.json +129 -0
- package/content/homeric/places/aeolia.json +161 -0
- package/content/homeric/places/asteris.json +120 -0
- package/content/homeric/places/aulis.json +122 -0
- package/content/homeric/places/cape-malea.json +126 -0
- package/content/homeric/places/chryse.json +120 -0
- package/content/homeric/places/dodona.json +129 -0
- package/content/homeric/places/dulichium.json +177 -0
- package/content/homeric/places/egypt.json +125 -0
- package/content/homeric/places/ephyra-acheron.json +127 -0
- package/content/homeric/places/hellespont.json +125 -0
- package/content/homeric/places/house-of-hades.json +91 -0
- package/content/homeric/places/ismarus.json +120 -0
- package/content/homeric/places/ithaca.json +240 -0
- package/content/homeric/places/knossos.json +132 -0
- package/content/homeric/places/laestrygonia.json +168 -0
- package/content/homeric/places/land-of-the-cyclopes.json +169 -0
- package/content/homeric/places/land-of-the-lotus-eaters.json +122 -0
- package/content/homeric/places/mount-ida.json +126 -0
- package/content/homeric/places/mycenae.json +152 -0
- package/content/homeric/places/ogygia.json +125 -0
- package/content/homeric/places/pharos.json +120 -0
- package/content/homeric/places/planctae.json +77 -0
- package/content/homeric/places/pylos.json +188 -0
- package/content/homeric/places/same.json +177 -0
- package/content/homeric/places/scheria.json +129 -0
- package/content/homeric/places/scylla-and-charybdis.json +135 -0
- package/content/homeric/places/sirens.json +127 -0
- package/content/homeric/places/sparta.json +179 -0
- package/content/homeric/places/tenedos.json +129 -0
- package/content/homeric/places/thrinacia.json +116 -0
- package/content/homeric/places/tiryns.json +123 -0
- package/content/homeric/places/troy.json +224 -0
- package/content/homeric/places/zacynthus.json +126 -0
- package/content/homeric/routes/achaean-expedition.json +132 -0
- package/content/homeric/routes/nostoi-of-the-others.json +205 -0
- package/content/homeric/routes/odysseus-nostos.json +307 -0
- package/content/homeric/routes/telemachy.json +134 -0
- package/content/knowledge/agent-memory.json +153 -0
- package/content/knowledge/agentic-ai.json +158 -0
- package/content/knowledge/agentic-evaluation.json +156 -0
- package/content/knowledge/agentic-threat-model.json +287 -0
- package/content/knowledge/ai-agent.json +153 -0
- package/content/knowledge/ai-cyberdefense.json +274 -0
- package/content/knowledge/ai-governance.json +155 -0
- package/content/knowledge/ai-observability.json +156 -0
- package/content/knowledge/context-engineering.json +153 -0
- package/content/knowledge/embeddings.json +153 -0
- package/content/knowledge/enterprise-rag.json +154 -0
- package/content/knowledge/fine-tuning.json +153 -0
- package/content/knowledge/foundation-models.json +154 -0
- package/content/knowledge/guardrails.json +153 -0
- package/content/knowledge/harness-engineering.json +158 -0
- package/content/knowledge/human-in-the-loop.json +153 -0
- package/content/knowledge/mcp-security.json +284 -0
- package/content/knowledge/model-context-protocol.json +154 -0
- package/content/knowledge/multi-agent-architecture.json +153 -0
- package/content/knowledge/prompt-engineering.json +153 -0
- package/content/knowledge/prompt-injection.json +138 -0
- package/content/knowledge/reasoning-models.json +153 -0
- package/content/knowledge/tool-use.json +156 -0
- package/content/library/cognitive-architecture-emergent-ai.md +15 -0
- package/content/library/devready-ep108-ai-customer-experiences.md +14 -0
- package/content/library/how-genai-impact-business.md +12 -0
- package/content/library/lmm-reshaping-industries-2024.md +12 -0
- package/content/library/rethinking-ai-pause.md +12 -0
- package/content/library/rise-of-agentic-ai.md +16 -0
- package/content/library/self-improving-autonomous-ai.md +16 -0
- package/content/library/the-stopwatch-and-the-exam.md +12 -0
- package/content/library/unlock-gpt4-secrets.md +12 -0
- package/content/library/vibe-coding-enterprise.md +15 -0
- package/content/library/video-transformando-negocios-genai.md +14 -0
- package/content/library/video-volando-alto-sky-airlines.md +13 -0
- package/content/matrix/agentic-control-matrix.json +967 -0
- package/content/patterns/attributed-memory.json +237 -0
- package/content/patterns/context-compression.json +304 -0
- package/content/patterns/egress-allowlist.json +310 -0
- package/content/patterns/evaluator-optimizer.json +180 -0
- package/content/patterns/goal-decomposition.json +290 -0
- package/content/patterns/human-approval-gate.json +311 -0
- package/content/patterns/human-escalation.json +288 -0
- package/content/patterns/least-privilege-tooling.json +333 -0
- package/content/patterns/long-term-memory.json +305 -0
- package/content/patterns/orchestrator-workers.json +202 -0
- package/content/patterns/parallelization.json +180 -0
- package/content/patterns/prompt-chaining.json +181 -0
- package/content/patterns/recovery-strategy.json +305 -0
- package/content/patterns/reflection.json +298 -0
- package/content/patterns/routing.json +294 -0
- package/content/patterns/sandboxed-execution.json +311 -0
- package/content/patterns/semantic-caching.json +201 -0
- package/content/patterns/supervisor-agent.json +290 -0
- package/content/patterns/task-prioritization.json +307 -0
- package/dist/content.js +181 -0
- package/dist/index.js +27 -0
- package/dist/shape.js +649 -0
- package/dist/tools.js +652 -0
- package/package.json +47 -0
|
@@ -0,0 +1,109 @@
|
|
|
1
|
+
---
|
|
2
|
+
title: "Glosario"
|
|
3
|
+
summary: "Definiciones canónicas de los términos de Ingeniería de Harness usados en todo el manual, para que el vocabulario no derive entre capítulos."
|
|
4
|
+
---
|
|
5
|
+
|
|
6
|
+
# Glosario
|
|
7
|
+
|
|
8
|
+
## Resumen ejecutivo
|
|
9
|
+
|
|
10
|
+
Este glosario es la referencia canónica de los términos usados en todo el manual de Ingeniería de Harness y en el resto de la Santismm Knowledge Platform. Las definiciones son concisas, extraíbles por máquina y están pensadas para citarse directamente. Cuando un término tiene capítulo propio, la entrada remite a él.
|
|
11
|
+
|
|
12
|
+
## Definición
|
|
13
|
+
|
|
14
|
+
Lo que sigue son las definiciones canónicas de los términos usados a lo largo de este corpus. Los términos se agrupan por legibilidad; dentro de cada grupo van aproximadamente de lo fundacional a lo especializado.
|
|
15
|
+
|
|
16
|
+
Los nombres ingleses de uso establecido en la industria (*harness*, *tool*, *span*, *prompt*, *guardrail*…) se conservan y se acompañan de su equivalente en castellano donde existe uno asentado. No se traduce **harness**: es el término propio de la disciplina.
|
|
17
|
+
|
|
18
|
+
### Conceptos fundamentales
|
|
19
|
+
|
|
20
|
+
- **Agente:** un sistema que usa un modelo de lenguaje dentro de un bucle para perseguir un objetivo, decidiendo qué acciones (llamadas a herramientas) tomar a partir de las observaciones hasta que se cumple una condición de parada.
|
|
21
|
+
- **Sistema agéntico:** un sistema de software cuyo comportamiento lo dirigen uno o varios agentes, incluyendo todo el andamiaje circundante necesario para hacerlos fiables.
|
|
22
|
+
- **Harness:** el andamiaje de ingeniería alrededor de un modelo —memoria, herramientas, planificación, orquestación, observabilidad, evaluación, gobernanza y seguridad— que convierte un modelo en bruto en un sistema agéntico fiable.
|
|
23
|
+
- **Ingeniería de Harness:** la disciplina responsable de construir sistemas agénticos fiables para entornos empresariales, diseñando y operando el harness.
|
|
24
|
+
- **Modelo / LLM:** el gran modelo de lenguaje subyacente que razona y genera; dentro del harness se trata como un componente potente pero no determinista y manipulable.
|
|
25
|
+
- **Gradiente de autonomía:** el espectro de modos de control, de totalmente autónomo a humano en el bucle, asignado por política a cada clase de acción.
|
|
26
|
+
- **Radio de impacto (*blast radius*):** el daño máximo que puede causar una acción, o un agente comprometido; una magnitud clave que hay que acotar.
|
|
27
|
+
|
|
28
|
+
### Herramientas y acciones
|
|
29
|
+
|
|
30
|
+
- **Herramienta (*tool*):** una función o capacidad que el agente puede invocar para observar o afectar al mundo (búsqueda, ejecución de código, llamada a una API, consulta a una base de datos).
|
|
31
|
+
- **Llamada a herramienta (*function calling*):** una petición estructurada del modelo para invocar una herramienta con argumentos.
|
|
32
|
+
- **Efector:** una herramienta que produce un efecto secundario en un sistema externo (envía, escribe, transfiere).
|
|
33
|
+
- **Idempotencia:** la propiedad por la que ejecutar una operación varias veces tiene el mismo efecto que ejecutarla una vez; imprescindible para reintentos y reanudaciones seguras.
|
|
34
|
+
- **Efecto secundario:** un cambio visible desde fuera producido por una llamada a herramienta.
|
|
35
|
+
- **Lista de permitidos (*allowlist*):** un conjunto explícito de elementos autorizados (herramientas, destinos de salida); el valor por defecto seguro en las decisiones sensibles a la seguridad.
|
|
36
|
+
|
|
37
|
+
### Memoria y contexto
|
|
38
|
+
|
|
39
|
+
- **Ventana de contexto:** el tramo acotado de tokens al que el modelo puede atender en una única inferencia.
|
|
40
|
+
- **Memoria:** la capa del harness que persiste y recupera información entre pasos y sesiones (de corto plazo, de largo plazo, episódica, semántica).
|
|
41
|
+
- **RAG (generación aumentada por recuperación):** proporcionar al modelo contenido relevante recuperado en tiempo de inferencia, de modo que su salida se ancle en un corpus y no solo en la memoria paramétrica.
|
|
42
|
+
- **Embedding (representación vectorial):** una representación en vector de un texto, usada para la búsqueda por similitud semántica en la recuperación.
|
|
43
|
+
- **Almacén vectorial:** una base de datos optimizada para la búsqueda de vecinos más próximos sobre embeddings.
|
|
44
|
+
- **Anclaje (*grounding*):** sostener las afirmaciones generadas en evidencia recuperada y citable.
|
|
45
|
+
- **Ingeniería de contexto:** la práctica de decidir con precisión qué información entra en la ventana de contexto en cada paso.
|
|
46
|
+
|
|
47
|
+
### Planificación
|
|
48
|
+
|
|
49
|
+
- **Objetivo:** el estado final deseado, con criterios de éxito explícitos.
|
|
50
|
+
- **Plan:** un conjunto ordenado o parcialmente ordenado de tareas que se espera que alcancen un objetivo.
|
|
51
|
+
- **Descomposición:** partir un objetivo en subtareas (véanse PAT-010 y HRN-009).
|
|
52
|
+
- **DAG (grafo acíclico dirigido):** una representación de plan que captura las dependencias entre tareas y expone el paralelismo.
|
|
53
|
+
- **Replanificación:** revisar un plan en respuesta a un fallo, a información nueva o a un cambio de restricciones.
|
|
54
|
+
- **Criterios de terminación:** los presupuestos y condiciones (pasos, tiempo, coste) que detienen a un agente de forma segura.
|
|
55
|
+
|
|
56
|
+
### Orquestación
|
|
57
|
+
|
|
58
|
+
- **Orquestación:** la capa del harness que conduce la ejecución a través de agentes y herramientas (véase HRN-010).
|
|
59
|
+
- **Topología:** la disposición de los agentes: único, tubería, supervisor/trabajador o red.
|
|
60
|
+
- **Agente supervisor (orquestador):** un agente que planifica y delega en agentes trabajadores (véase PAT-002).
|
|
61
|
+
- **Agente trabajador:** un agente especializado que ejecuta una subtarea delegada (véase PAT-005).
|
|
62
|
+
- **Enrutado:** seleccionar el siguiente agente, herramienta o rama en función del estado.
|
|
63
|
+
- **Traspaso (*handoff*):** transferencia de control y contexto de un agente a otro.
|
|
64
|
+
- **Máquina de estados:** un grafo explícito de estados y transiciones gobernadas que controla la ejecución.
|
|
65
|
+
- **Ejecución duradera:** semántica de flujo en la que el progreso se persiste en puntos de control y es reanudable ante los fallos.
|
|
66
|
+
- **Saga:** una secuencia de operaciones con acciones compensatorias que deshacen el trabajo parcial ante un fallo.
|
|
67
|
+
|
|
68
|
+
### Gobernanza y seguridad
|
|
69
|
+
|
|
70
|
+
- **Gobernanza:** la capa de ejecución del harness que aplica política, aprobaciones y guardarraíles (véase HRN-008).
|
|
71
|
+
- **Política como código:** reglas de gobernanza expresadas en un formato declarativo, versionado y comprobable.
|
|
72
|
+
- **PEP / PDP:** punto de aplicación de política (intercepta las acciones) y punto de decisión de política (evalúa la política).
|
|
73
|
+
- **Guardarraíl (*guardrail*):** una comprobación en ejecución sobre entradas o salidas que restringe el comportamiento del agente.
|
|
74
|
+
- **Puerta de aprobación:** un control que suspende la ejecución a la espera de una decisión humana o de una autoridad superior (véase PAT-001).
|
|
75
|
+
- **Mínimo privilegio:** conceder a cada agente los permisos mínimos que su tarea requiere.
|
|
76
|
+
- **Identidad del agente:** un principal distinto, atribuible, con alcance limitado y revocable para cada agente.
|
|
77
|
+
- **Inyección de prompt:** contenido no confiable que secuestra las instrucciones u objetivos de un agente.
|
|
78
|
+
- **Inyección indirecta de prompt:** inyección entregada a través de datos que el agente recupera.
|
|
79
|
+
- **Exfiltración de datos:** salida no autorizada de datos sensibles a través de las salidas del agente o de los argumentos de las herramientas.
|
|
80
|
+
- **Trifecta letal:** la combinación peligrosa de acceso a datos privados, exposición a contenido no confiable y capacidad de comunicación externa.
|
|
81
|
+
- **Caja de arena (*sandbox*):** un entorno aislado, con recursos y red restringidos, para ejecutar herramientas o código no confiables.
|
|
82
|
+
- **DLP (prevención de fuga de datos):** controles que detectan y bloquean datos sensibles en las cargas salientes.
|
|
83
|
+
|
|
84
|
+
### Observabilidad y evaluación
|
|
85
|
+
|
|
86
|
+
- **Observabilidad:** la capa del harness que hace inspeccionable el comportamiento del agente mediante trazas, registros y métricas (véase HRN-006).
|
|
87
|
+
- **Traza:** el registro de extremo a extremo de una única ejecución del agente.
|
|
88
|
+
- **Span:** una unidad de trabajo temporizada dentro de una traza (una llamada a herramienta, una llamada al modelo); el ladrillo básico del trazado distribuido.
|
|
89
|
+
- **Evaluación (*eval*):** la medición sistemática de la calidad, la seguridad y la fiabilidad del agente (véase HRN-007).
|
|
90
|
+
- **LLM como juez:** usar un modelo para puntuar las salidas de otro modelo contra una rúbrica.
|
|
91
|
+
- **Anclaje (*groundedness*):** el grado en que las afirmaciones generadas están sostenidas por la evidencia aportada.
|
|
92
|
+
- **Suite de regresión:** un conjunto fijo de casos de evaluación que se ejecuta en cada cambio para cazar caídas de calidad.
|
|
93
|
+
- **Desarrollo guiado por evaluación:** construir y modificar agentes contra un harness de evaluación medible.
|
|
94
|
+
|
|
95
|
+
### Protocolos y estándares
|
|
96
|
+
|
|
97
|
+
- **MCP (Model Context Protocol):** un protocolo abierto para conectar modelos y agentes con herramientas y fuentes de datos a través de una interfaz estandarizada.
|
|
98
|
+
- **Esquema de herramienta:** la declaración tipada del nombre, los argumentos y la descripción de una herramienta, que el modelo usa para invocarla.
|
|
99
|
+
- **llms.txt:** una convención propuesta para un fichero Markdown a nivel de sitio que expone un índice de contenido curado y apto para agentes.
|
|
100
|
+
- **JSON-LD:** formato de datos estructurados usado para hacer los documentos legibles por máquina en la capa de descubrimiento.
|
|
101
|
+
- **NIST AI RMF / ISO 42001 / Reglamento Europeo de IA:** los principales marcos de riesgo, de sistema de gestión y regulatorio que un harness empresarial debe satisfacer (véanse HRN-014 y GOV-001).
|
|
102
|
+
|
|
103
|
+
## Preguntas frecuentes
|
|
104
|
+
|
|
105
|
+
**P: ¿De dónde cito una definición?**
|
|
106
|
+
R: Cita el término por su nombre junto a `HRN-013`. Cuando el término tenga capítulo propio, es preferible citar ese capítulo para más profundidad.
|
|
107
|
+
|
|
108
|
+
**P: Falta un término que necesito, ¿qué hago?**
|
|
109
|
+
R: Añádelo aquí, en el grupo que corresponda, con una definición nítida de una frase, y enlaza el capítulo dedicado si existe.
|
|
@@ -0,0 +1,124 @@
|
|
|
1
|
+
---
|
|
2
|
+
id: HRN-013
|
|
3
|
+
title: Glossary
|
|
4
|
+
domain: Harness
|
|
5
|
+
category: Reference
|
|
6
|
+
status: Draft
|
|
7
|
+
author: Santiago Santa María
|
|
8
|
+
created: 2026-06-21
|
|
9
|
+
updated: 2026-06-21
|
|
10
|
+
summary: A canonical glossary of Harness Engineering and agentic-systems terminology—harness, agent, tool, orchestration, evaluation, span, RAG, MCP, guardrail, and more—with crisp, citable definitions.
|
|
11
|
+
evidence_level: theoretical
|
|
12
|
+
confidence_level: high
|
|
13
|
+
source_type:
|
|
14
|
+
- industry_observation
|
|
15
|
+
related:
|
|
16
|
+
- HRN-001
|
|
17
|
+
tags:
|
|
18
|
+
- glossary
|
|
19
|
+
- reference
|
|
20
|
+
- terminology
|
|
21
|
+
---
|
|
22
|
+
|
|
23
|
+
# Glossary
|
|
24
|
+
|
|
25
|
+
## Executive Summary
|
|
26
|
+
|
|
27
|
+
This glossary is the canonical reference for terms used across the Harness Engineering handbook and the wider Santismm Knowledge Platform. Definitions are crisp, machine-extractable, and intended to be cited directly. Where a term has a dedicated chapter, the entry points to it.
|
|
28
|
+
|
|
29
|
+
## Definition
|
|
30
|
+
|
|
31
|
+
The following are the canonical definitions of terms used throughout this corpus. Terms are grouped for readability; within groups they are roughly ordered from foundational to specialized.
|
|
32
|
+
|
|
33
|
+
### Core concepts
|
|
34
|
+
|
|
35
|
+
- **Agent:** a system that uses a language model in a loop to pursue a goal, deciding which actions (tool calls) to take based on observations until a stopping condition is met.
|
|
36
|
+
- **Agentic system:** a software system whose behavior is driven by one or more agents, including all the surrounding scaffolding required to make them reliable.
|
|
37
|
+
- **Harness:** the engineered scaffolding around a model — memory, tools, planning, orchestration, observability, evaluation, governance, and security — that turns a raw model into a reliable agentic system.
|
|
38
|
+
- **Harness Engineering:** the discipline responsible for building reliable agentic systems for enterprise environments by designing and operating the harness.
|
|
39
|
+
- **Model / LLM:** the underlying large language model that performs reasoning and generation; in the harness it is treated as a powerful but non-deterministic, manipulable component.
|
|
40
|
+
- **Autonomy gradient:** the spectrum of control modes from fully autonomous to human-in-the-loop, assigned per action class by policy.
|
|
41
|
+
- **Blast radius:** the maximum harm an action (or a compromised agent) can cause; a core quantity to bound.
|
|
42
|
+
|
|
43
|
+
### Tools and actions
|
|
44
|
+
|
|
45
|
+
- **Tool:** a function or capability the agent can invoke to observe or affect the world (search, code execution, API call, database query).
|
|
46
|
+
- **Tool call / function call:** a structured request from the model to invoke a tool with arguments.
|
|
47
|
+
- **Effector:** a tool that produces a side effect in an external system (sends, writes, transfers).
|
|
48
|
+
- **Idempotency:** the property that performing an operation multiple times has the same effect as performing it once; essential for safe retries and resumes.
|
|
49
|
+
- **Side effect:** an externally visible change produced by a tool call.
|
|
50
|
+
- **Allowlist:** an explicit set of permitted items (tools, egress destinations); the safe default for security-sensitive choices.
|
|
51
|
+
|
|
52
|
+
### Memory and context
|
|
53
|
+
|
|
54
|
+
- **Context window:** the bounded span of tokens the model can attend to in a single inference.
|
|
55
|
+
- **Memory:** the harness layer that persists and retrieves information across steps and sessions (short-term, long-term, episodic, semantic).
|
|
56
|
+
- **RAG (Retrieval-Augmented Generation):** supplying the model with relevant retrieved content at inference time so its output is grounded in a corpus rather than parametric memory alone.
|
|
57
|
+
- **Embedding:** a vector representation of text used for semantic similarity search in retrieval.
|
|
58
|
+
- **Vector store:** a database optimized for nearest-neighbor search over embeddings.
|
|
59
|
+
- **Grounding:** anchoring generated claims in retrieved, citable evidence.
|
|
60
|
+
- **Context engineering:** the practice of deciding precisely what information enters the context window for each step.
|
|
61
|
+
|
|
62
|
+
### Planning
|
|
63
|
+
|
|
64
|
+
- **Goal:** the desired end-state with explicit success criteria.
|
|
65
|
+
- **Plan:** an ordered or partially-ordered set of tasks expected to achieve a goal.
|
|
66
|
+
- **Decomposition:** breaking a goal into sub-tasks (see PAT-010, HRN-009).
|
|
67
|
+
- **DAG (Directed Acyclic Graph):** a plan representation that captures task dependencies and exposes parallelism.
|
|
68
|
+
- **Replanning:** revising a plan in response to failure, new information, or changed constraints.
|
|
69
|
+
- **Termination criteria:** the budgets and conditions (steps, time, cost) that stop an agent safely.
|
|
70
|
+
|
|
71
|
+
### Orchestration
|
|
72
|
+
|
|
73
|
+
- **Orchestration:** the harness layer that drives execution across agents and tools (see HRN-010).
|
|
74
|
+
- **Topology:** the arrangement of agents — single, pipeline, supervisor/worker, or network.
|
|
75
|
+
- **Supervisor (orchestrator) agent:** an agent that plans and delegates to worker agents (see PAT-002).
|
|
76
|
+
- **Worker agent:** a specialized agent that executes a delegated sub-task (see PAT-005).
|
|
77
|
+
- **Routing:** selecting the next agent, tool, or branch based on state.
|
|
78
|
+
- **Handoff:** transfer of control and context from one agent to another.
|
|
79
|
+
- **State machine:** an explicit graph of states and governed transitions controlling execution.
|
|
80
|
+
- **Durable execution:** workflow semantics where progress is checkpointed and resumable across failures.
|
|
81
|
+
- **Saga:** a sequence of operations with compensating actions to undo partial work on failure.
|
|
82
|
+
|
|
83
|
+
### Governance and security
|
|
84
|
+
|
|
85
|
+
- **Governance:** the runtime harness layer enforcing policy, approvals, and guardrails (see HRN-008).
|
|
86
|
+
- **Policy-as-code:** governance rules expressed in a declarative, versioned, testable format.
|
|
87
|
+
- **PEP / PDP:** Policy Enforcement Point (intercepts actions) and Policy Decision Point (evaluates policy).
|
|
88
|
+
- **Guardrail:** a runtime check on inputs or outputs that constrains agent behavior.
|
|
89
|
+
- **Approval gate:** a control that suspends execution pending a human or higher-authority decision (see PAT-001).
|
|
90
|
+
- **Least privilege:** granting each agent the minimum permissions required for its task.
|
|
91
|
+
- **Agent identity:** a distinct, attributable, scoped, revocable principal for each agent.
|
|
92
|
+
- **Prompt injection:** untrusted content that hijacks an agent's instructions or goals.
|
|
93
|
+
- **Indirect prompt injection:** injection delivered via data the agent retrieves.
|
|
94
|
+
- **Data exfiltration:** unauthorized egress of sensitive data through agent outputs or tool arguments.
|
|
95
|
+
- **Lethal trifecta:** the dangerous combination of private-data access, untrusted-content exposure, and external communication ability.
|
|
96
|
+
- **Sandbox:** an isolated, resource- and network-constrained environment for executing untrusted tools/code.
|
|
97
|
+
- **DLP (Data Loss Prevention):** controls that detect and block sensitive data in outbound payloads.
|
|
98
|
+
|
|
99
|
+
### Observability and evaluation
|
|
100
|
+
|
|
101
|
+
- **Observability:** the harness layer that makes agent behavior inspectable via traces, logs, and metrics (see HRN-006).
|
|
102
|
+
- **Trace:** the end-to-end record of a single agent run.
|
|
103
|
+
- **Span:** a single timed unit of work within a trace (one tool call, one model call), the building block of distributed tracing.
|
|
104
|
+
- **Evaluation (eval):** the systematic measurement of agent quality, safety, and reliability (see HRN-007).
|
|
105
|
+
- **LLM-as-judge:** using a model to score another model's outputs against a rubric.
|
|
106
|
+
- **Groundedness:** the degree to which generated claims are supported by provided evidence.
|
|
107
|
+
- **Regression suite:** a fixed set of evaluation cases run on every change to catch quality regressions.
|
|
108
|
+
- **Eval-driven development:** building and changing agents against a measurable evaluation harness.
|
|
109
|
+
|
|
110
|
+
### Protocols and standards
|
|
111
|
+
|
|
112
|
+
- **MCP (Model Context Protocol):** an open protocol for connecting models/agents to tools and data sources through a standardized interface.
|
|
113
|
+
- **Tool schema:** the typed declaration of a tool's name, arguments, and description that the model uses to call it.
|
|
114
|
+
- **llms.txt:** a proposed convention for a site-level Markdown file that surfaces a curated, agent-friendly index of content.
|
|
115
|
+
- **JSON-LD:** structured data format used to make documents machine-readable in the discovery layer.
|
|
116
|
+
- **NIST AI RMF / ISO 42001 / EU AI Act:** the principal AI risk, management-system, and regulatory frameworks an enterprise harness must satisfy (see HRN-014, GOV-001).
|
|
117
|
+
|
|
118
|
+
## FAQs
|
|
119
|
+
|
|
120
|
+
**Q: Where do I cite a definition from?**
|
|
121
|
+
A: Cite the term by name plus `HRN-013`. Where a term has a dedicated chapter, prefer citing that chapter for depth.
|
|
122
|
+
|
|
123
|
+
**Q: A term I need is missing — what do I do?**
|
|
124
|
+
A: Add it here in the appropriate group with a crisp one-sentence definition, and link the dedicated chapter if one exists.
|
|
@@ -0,0 +1,109 @@
|
|
|
1
|
+
---
|
|
2
|
+
title: "Glossário"
|
|
3
|
+
summary: "Definições canônicas dos termos de Engenharia de Harness usados em todo o manual, para que o vocabulário não derive entre capítulos."
|
|
4
|
+
---
|
|
5
|
+
|
|
6
|
+
# Glossário
|
|
7
|
+
|
|
8
|
+
## Resumo executivo
|
|
9
|
+
|
|
10
|
+
Este glossário é a referência canônica dos termos usados em todo o manual de Engenharia de Harness e no resto da Santismm Knowledge Platform. As definições são concisas, extraíveis por máquina e pensadas para serem citadas diretamente. Quando um termo tem capítulo próprio, a entrada remete para ele.
|
|
11
|
+
|
|
12
|
+
## Definição
|
|
13
|
+
|
|
14
|
+
O que se segue são as definições canônicas dos termos usados ao longo deste corpus. Os termos estão agrupados por legibilidade; dentro de cada grupo vão aproximadamente do fundacional ao especializado.
|
|
15
|
+
|
|
16
|
+
Os nomes ingleses de uso estabelecido na indústria (*harness*, *tool*, *span*, *prompt*, *guardrail*…) são preservados e acompanhados do equivalente em português onde existe um assente. **Harness** não se traduz: é o termo próprio da disciplina.
|
|
17
|
+
|
|
18
|
+
### Conceitos fundamentais
|
|
19
|
+
|
|
20
|
+
- **Agente:** um sistema que usa um modelo de linguagem dentro de um ciclo para perseguir um objetivo, decidindo que ações (chamadas a ferramentas) tomar a partir das observações até se cumprir uma condição de paragem.
|
|
21
|
+
- **Sistema agêntico:** um sistema de software cujo comportamento é conduzido por um ou vários agentes, incluindo todo o andaime circundante necessário para os tornar confiáveis.
|
|
22
|
+
- **Harness:** o andaime de engenharia em torno de um modelo — memória, ferramentas, planejamento, orquestração, observabilidade, avaliação, governança e segurança — que converte um modelo em bruto num sistema agêntico confiável.
|
|
23
|
+
- **Engenharia de Harness:** a disciplina responsável por construir sistemas agênticos confiáveis para ambientes empresariais, desenhando e operando o harness.
|
|
24
|
+
- **Modelo / LLM:** o grande modelo de linguagem subjacente que raciocina e gera; dentro do harness é tratado como um componente poderoso mas não determinista e manipulável.
|
|
25
|
+
- **Gradiente de autonomia:** o espectro de modos de controle, de totalmente autônomo a humano no ciclo, atribuído por política a cada classe de ação.
|
|
26
|
+
- **Raio de impacto (*blast radius*):** o dano máximo que uma ação, ou um agente comprometido, pode causar; uma grandeza central a limitar.
|
|
27
|
+
|
|
28
|
+
### Ferramentas e ações
|
|
29
|
+
|
|
30
|
+
- **Ferramenta (*tool*):** uma função ou capacidade que o agente pode invocar para observar ou afetar o mundo (pesquisa, execução de código, chamada a uma API, consulta a uma base de dados).
|
|
31
|
+
- **Chamada a ferramenta (*function calling*):** um pedido estruturado do modelo para invocar uma ferramenta com argumentos.
|
|
32
|
+
- **Efetor:** uma ferramenta que produz um efeito secundário num sistema externo (envia, escreve, transfere).
|
|
33
|
+
- **Idempotência:** a propriedade pela qual executar uma operação várias vezes tem o mesmo efeito que executá-la uma vez; indispensável para repetições e retomas seguras.
|
|
34
|
+
- **Efeito secundário:** uma alteração visível do exterior produzida por uma chamada a ferramenta.
|
|
35
|
+
- **Lista de permitidos (*allowlist*):** um conjunto explícito de elementos autorizados (ferramentas, destinos de saída); o padrão seguro nas decisões sensíveis à segurança.
|
|
36
|
+
|
|
37
|
+
### Memória e contexto
|
|
38
|
+
|
|
39
|
+
- **Janela de contexto:** o troço limitado de tokens a que o modelo pode atender numa única inferência.
|
|
40
|
+
- **Memória:** a camada do harness que persiste e recupera informação entre passos e sessões (de curto prazo, de longo prazo, episódica, semântica).
|
|
41
|
+
- **RAG (geração aumentada por recuperação):** fornecer ao modelo conteúdo relevante recuperado em tempo de inferência, de modo que sua saída fique ancorada num corpus e não apenas na memória paramétrica.
|
|
42
|
+
- **Embedding (representação vetorial):** uma representação em vetor de um texto, usada para a pesquisa por similaridade semântica na recuperação.
|
|
43
|
+
- **Armazém vetorial:** uma base de dados otimizada para a pesquisa de vizinhos mais próximos sobre embeddings.
|
|
44
|
+
- **Ancoragem (*grounding*):** sustentar as afirmações geradas em evidência recuperada e citável.
|
|
45
|
+
- **Engenharia de contexto:** a prática de decidir com precisão que informação entra na janela de contexto em cada passo.
|
|
46
|
+
|
|
47
|
+
### Planejamento
|
|
48
|
+
|
|
49
|
+
- **Objetivo:** o estado final desejado, com critérios de sucesso explícitos.
|
|
50
|
+
- **Plano:** um conjunto ordenado ou parcialmente ordenado de tarefas que se espera que alcancem um objetivo.
|
|
51
|
+
- **Decomposição:** partir um objetivo em subtarefas (ver PAT-010 e HRN-009).
|
|
52
|
+
- **DAG (grafo acíclico dirigido):** uma representação de plano que captura as dependências entre tarefas e expõe o paralelismo.
|
|
53
|
+
- **Replanejamento:** rever um plano em resposta a uma falha, a informação nova ou a uma mudança de restrições.
|
|
54
|
+
- **Critérios de terminação:** os orçamentos e condições (passos, tempo, custo) que param um agente em segurança.
|
|
55
|
+
|
|
56
|
+
### Orquestração
|
|
57
|
+
|
|
58
|
+
- **Orquestração:** a camada do harness que conduz a execução através de agentes e ferramentas (ver HRN-010).
|
|
59
|
+
- **Topologia:** a disposição dos agentes: único, pipeline, supervisor/trabalhador ou rede.
|
|
60
|
+
- **Agente supervisor (orquestrador):** um agente que planeja e delega em agentes trabalhadores (ver PAT-002).
|
|
61
|
+
- **Agente trabalhador:** um agente especializado que executa uma subtarefa delegada (ver PAT-005).
|
|
62
|
+
- **Encaminhamento:** selecionar o próximo agente, ferramenta ou ramo em função do estado.
|
|
63
|
+
- **Passagem (*handoff*):** transferência de controle e contexto de um agente para outro.
|
|
64
|
+
- **Máquina de estados:** um grafo explícito de estados e transições governadas que controla a execução.
|
|
65
|
+
- **Execução duradoura:** semântica de fluxo em que o progresso é persistido em pontos de controle e é retomável perante as falhas.
|
|
66
|
+
- **Saga:** uma sequência de operações com ações compensatórias que desfazem o trabalho parcial perante uma falha.
|
|
67
|
+
|
|
68
|
+
### Governança e segurança
|
|
69
|
+
|
|
70
|
+
- **Governança:** a camada de execução do harness que aplica política, aprovações e guarda-corpos (ver HRN-008).
|
|
71
|
+
- **Política como código:** regras de governança expressas num formato declarativo, versionado e testável.
|
|
72
|
+
- **PEP / PDP:** ponto de aplicação de política (intercepta as ações) e ponto de decisão de política (avalia a política).
|
|
73
|
+
- **Guarda-corpo (*guardrail*):** uma verificação em execução sobre entradas ou saídas que restringe o comportamento do agente.
|
|
74
|
+
- **Porta de aprovação:** um controle que suspende a execução à espera de uma decisão humana ou de uma autoridade superior (ver PAT-001).
|
|
75
|
+
- **Privilégio mínimo:** conceder a cada agente as permissões mínimas de que sua tarefa precisa.
|
|
76
|
+
- **Identidade do agente:** um principal distinto, atribuível, com âmbito limitado e revogável para cada agente.
|
|
77
|
+
- **Injeção de prompt:** conteúdo não confiável que sequestra as instruções ou objetivos de um agente.
|
|
78
|
+
- **Injeção indireta de prompt:** injeção entregue através de dados que o agente recupera.
|
|
79
|
+
- **Exfiltração de dados:** saída não autorizada de dados sensíveis através das saídas do agente ou dos argumentos das ferramentas.
|
|
80
|
+
- **Trifeta letal:** a combinação perigosa de acesso a dados privados, exposição a conteúdo não confiável e capacidade de comunicação externa.
|
|
81
|
+
- **Caixa de areia (*sandbox*):** um ambiente isolado, com recursos e rede restringidos, para executar ferramentas ou código não confiáveis.
|
|
82
|
+
- **DLP (prevenção de fuga de dados):** controles que detectam e bloqueiam dados sensíveis nas cargas de saída.
|
|
83
|
+
|
|
84
|
+
### Observabilidade e avaliação
|
|
85
|
+
|
|
86
|
+
- **Observabilidade:** a camada do harness que torna inspecionável o comportamento do agente através de traços, registros e métricas (ver HRN-006).
|
|
87
|
+
- **Traço:** o registro de ponta a ponta de uma única execução do agente.
|
|
88
|
+
- **Span:** uma unidade de trabalho temporizada dentro de um traço (uma chamada a ferramenta, uma chamada ao modelo); o tijolo básico do tracing distribuído.
|
|
89
|
+
- **Avaliação (*eval*):** a medição sistemática da qualidade, da segurança e da confiabilidade do agente (ver HRN-007).
|
|
90
|
+
- **LLM como juiz:** usar um modelo para pontuar as saídas de outro modelo contra uma rubrica.
|
|
91
|
+
- **Ancoragem (*groundedness*):** o grau em que as afirmações geradas são sustentadas pela evidência fornecida.
|
|
92
|
+
- **Suite de regressão:** um conjunto fixo de casos de avaliação executado em cada alteração para caçar quedas de qualidade.
|
|
93
|
+
- **Desenvolvimento guiado por avaliação:** construir e alterar agentes contra um harness de avaliação mensurável.
|
|
94
|
+
|
|
95
|
+
### Protocolos e normas
|
|
96
|
+
|
|
97
|
+
- **MCP (Model Context Protocol):** um protocolo aberto para ligar modelos e agentes a ferramentas e fontes de dados através de uma interface normalizada.
|
|
98
|
+
- **Esquema de ferramenta:** a declaração tipada do nome, dos argumentos e da descrição de uma ferramenta, que o modelo usa para invocá-la.
|
|
99
|
+
- **llms.txt:** uma convenção proposta para um arquivo Markdown no nível do site que expõe um índice de conteúdo curado e apto para agentes.
|
|
100
|
+
- **JSON-LD:** formato de dados estruturados usado para tornar os documentos legíveis por máquina na camada de descoberta.
|
|
101
|
+
- **NIST AI RMF / ISO 42001 / Regulamento Europeu de IA:** os principais quadros de risco, de sistema de gestão e regulatório que um harness empresarial deve satisfazer (ver HRN-014 e GOV-001).
|
|
102
|
+
|
|
103
|
+
## Perguntas frequentes
|
|
104
|
+
|
|
105
|
+
**P: De onde cito uma definição?**
|
|
106
|
+
R: Cite o termo pelo nome junto de `HRN-013`. Quando o termo tiver capítulo próprio, é preferível citar esse capítulo para mais profundidade.
|
|
107
|
+
|
|
108
|
+
**P: Falta um termo de que preciso, o que faço?**
|
|
109
|
+
R: Acrescente-o aqui, no grupo que corresponder, com uma definição nítida de uma frase, e ligue o capítulo dedicado se existir.
|
|
@@ -0,0 +1,89 @@
|
|
|
1
|
+
---
|
|
2
|
+
title: "Bibliografía"
|
|
3
|
+
summary: "Fuentes, literatura de referencia y observaciones de industria en las que se apoya el manual de Ingeniería de Harness."
|
|
4
|
+
---
|
|
5
|
+
|
|
6
|
+
# Bibliografía
|
|
7
|
+
|
|
8
|
+
## Resumen ejecutivo
|
|
9
|
+
|
|
10
|
+
Esta bibliografía es la lista de referencias curada que sostiene el manual de Ingeniería de Harness. Está organizada por temas para que quien lee pueda profundizar en cualquier capa concreta. Las entradas son obras y estándares reales y conocidos. Cuando aquí no se afirman los datos exactos de cita (DOI, números de página), se da el título y el lugar o la fuente sin inventar identificadores; conviene confirmar la versión vigente de los estándares que aún evolucionan. Los títulos de las obras se dejan en su idioma original, para que sean localizables tal cual.
|
|
11
|
+
|
|
12
|
+
## Definición
|
|
13
|
+
|
|
14
|
+
Las referencias siguientes están agrupadas por tema. Son las fuentes primarias de las que bebe el manual y los puntos de partida recomendados para seguir estudiando.
|
|
15
|
+
|
|
16
|
+
### 1. Fundamentos de agentes y razonamiento
|
|
17
|
+
|
|
18
|
+
- Yao, S. et al. **«ReAct: Synergizing Reasoning and Acting in Language Models».** ICLR. El entrelazado de razonar y actuar que sostiene a los agentes con herramientas.
|
|
19
|
+
- Wei, J. et al. **«Chain-of-Thought Prompting Elicits Reasoning in Large Language Models».** NeurIPS. Fundacional para el razonamiento paso a paso.
|
|
20
|
+
- Schick, T. et al. **«Toolformer: Language Models Can Teach Themselves to Use Tools».** NeurIPS.
|
|
21
|
+
- Shinn, N. et al. **«Reflexion: Language Agents with Verbal Reinforcement Learning».** NeurIPS. El bucle de reflexión y autocrítica (cf. PAT-003).
|
|
22
|
+
- Wang, L. et al. **«A Survey on Large Language Model based Autonomous Agents».** Un repaso amplio del espacio de diseño de agentes.
|
|
23
|
+
- Wang, X. et al. **«Plan-and-Solve Prompting».** ACL. Descomposición de planificar y luego ejecutar.
|
|
24
|
+
|
|
25
|
+
### 2. Orquestación, multiagente y ejecución duradera
|
|
26
|
+
|
|
27
|
+
- Anthropic. **«Building Effective Agents».** Guía de ingeniería sobre flujos frente a agentes y sobre el diseño con agente único primero.
|
|
28
|
+
- Anthropic. **«How we built our multi-agent research system».** Escrito práctico sobre orquestación supervisor/trabajador.
|
|
29
|
+
- LangChain. **Documentación de LangGraph** — orquestación por máquina de estados para agentes.
|
|
30
|
+
- Temporal y otros motores de ejecución duradera. **Documentación sobre durabilidad de flujos y el patrón saga.**
|
|
31
|
+
- Microsoft / AutoGen. **«AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation».** Marco de conversación multiagente.
|
|
32
|
+
- Hong, S. et al. **«MetaGPT: Meta Programming for Multi-Agent Collaborative Framework».**
|
|
33
|
+
|
|
34
|
+
### 3. Memoria y recuperación (RAG)
|
|
35
|
+
|
|
36
|
+
- Lewis, P. et al. **«Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks».** NeurIPS. El artículo canónico de RAG.
|
|
37
|
+
- Gao, Y. et al. **«Retrieval-Augmented Generation for Large Language Models: A Survey».**
|
|
38
|
+
- Packer, C. et al. **«MemGPT: Towards LLMs as Operating Systems».** Jerarquía de memoria y paginación para agentes.
|
|
39
|
+
- Asai, A. et al. **«Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection».**
|
|
40
|
+
|
|
41
|
+
### 4. Evaluación
|
|
42
|
+
|
|
43
|
+
- Liang, P. et al. **«Holistic Evaluation of Language Models (HELM)».** Stanford CRFM.
|
|
44
|
+
- Zheng, L. et al. **«Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena».** La metodología del LLM como juez y sus sesgos.
|
|
45
|
+
- Es, S. et al. **«RAGAS: Automated Evaluation of Retrieval Augmented Generation».** Métricas de anclaje y fidelidad.
|
|
46
|
+
- Liu, Y. et al. **«G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment».**
|
|
47
|
+
- **SWE-bench** y **GAIA** — bancos de pruebas de capacidad agéntica para tareas de software y de asistencia general.
|
|
48
|
+
|
|
49
|
+
### 5. Seguridad para sistemas agénticos
|
|
50
|
+
|
|
51
|
+
- OWASP. **«OWASP Top 10 for Large Language Model Applications».** Incluye LLM01 inyección de prompt y LLM06 divulgación de información sensible.
|
|
52
|
+
- Willison, S. **«Prompt injection»** y **«The lethal trifecta for AI agents»** (ensayos de blog). La formulación más clara del problema arquitectónico de inyección y exfiltración.
|
|
53
|
+
- Greshake, K. et al. **«Not what you've signed up for: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection».**
|
|
54
|
+
- MITRE. **ATLAS (Adversarial Threat Landscape for Artificial-Intelligence Systems).**
|
|
55
|
+
- NIST. **SP 800-53** (controles de seguridad y privacidad; mínimo privilegio, identidad), adaptado a sistemas de IA.
|
|
56
|
+
|
|
57
|
+
### 6. Gobernanza, riesgo y estándares regulatorios
|
|
58
|
+
|
|
59
|
+
- NIST. **AI Risk Management Framework (AI RMF 1.0)** y el **Generative AI Profile.**
|
|
60
|
+
- ISO/IEC. **42001:2023 — Inteligencia artificial — Sistema de gestión.**
|
|
61
|
+
- ISO/IEC. **23894:2023 — IA — Guía para la gestión del riesgo.**
|
|
62
|
+
- Unión Europea. **Reglamento (UE) 2024/1689, el Reglamento Europeo de IA** — obligaciones escalonadas por nivel de riesgo para los sistemas de IA.
|
|
63
|
+
- OCDE. **Principios de IA de la OCDE.**
|
|
64
|
+
- Casa Blanca y OMB de EE. UU. **Guías ejecutivas y de gestión sobre IA digna de confianza** (como contexto de las expectativas del sector público).
|
|
65
|
+
- Véanse también GOV-001 (marco de gobernanza de IA empresarial) y GOV-005 (lista de verificación de controles de gobernanza de agentes) en este corpus.
|
|
66
|
+
|
|
67
|
+
### 7. Protocolos, interoperabilidad y la capa de descubrimiento
|
|
68
|
+
|
|
69
|
+
- Anthropic. **Especificación del Model Context Protocol (MCP)** — interfaz estandarizada de modelo a herramientas y datos.
|
|
70
|
+
- Propuesta **llms.txt** — una convención a nivel de sitio para indexar contenido de forma apta para agentes.
|
|
71
|
+
- **JSON-LD / schema.org** — datos estructurados para el descubrimiento por máquina.
|
|
72
|
+
- **Especificación OpenAPI** — contratos tipados para herramientas expuestas como API.
|
|
73
|
+
|
|
74
|
+
### 8. Autorización y aplicación de políticas (adaptado de la ingeniería de sistemas)
|
|
75
|
+
|
|
76
|
+
- OASIS. **eXtensible Access Control Markup Language (XACML)** — el modelo de autorización PEP/PDP.
|
|
77
|
+
- **Open Policy Agent (OPA) / Rego** — motor de política como código.
|
|
78
|
+
- Saltzer, J. y Schroeder, M. **«The Protection of Information in Computer Systems».** Origen del principio de mínimo privilegio.
|
|
79
|
+
|
|
80
|
+
## Preguntas frecuentes
|
|
81
|
+
|
|
82
|
+
**P: ¿Por qué a algunas entradas les faltan el DOI o la fecha exacta?**
|
|
83
|
+
R: Para no inventar identificadores. Se dan el título y el lugar o la fuente, de modo que la obra sea localizable sin ambigüedad; conviene confirmar la versión vigente, sobre todo en los estándares que evolucionan (Reglamento Europeo de IA, NIST AI RMF, MCP, OWASP).
|
|
84
|
+
|
|
85
|
+
**P: ¿Qué relación tiene esto con GOV-001?**
|
|
86
|
+
R: GOV-001 lleva a la práctica las fuentes de gobernanza y regulación de las secciones 5 y 6 dentro de un marco empresarial; esta bibliografía es la lista de lecturas que hay debajo.
|
|
87
|
+
|
|
88
|
+
**P: ¿Por dónde debería empezar quien llega nuevo?**
|
|
89
|
+
R: Por la sección 1 (ReAct, Reflexion) para entender cómo funcionan los agentes, la sección 2 («Building Effective Agents») para saber cómo construirlos de forma fiable, y las secciones 5 y 6 para seguridad y gobernanza.
|
|
@@ -0,0 +1,109 @@
|
|
|
1
|
+
---
|
|
2
|
+
id: HRN-014
|
|
3
|
+
title: Bibliography
|
|
4
|
+
domain: Harness
|
|
5
|
+
category: Reference
|
|
6
|
+
status: Draft
|
|
7
|
+
author: Santiago Santa María
|
|
8
|
+
created: 2026-06-21
|
|
9
|
+
updated: 2026-06-21
|
|
10
|
+
summary: A curated, themed reading list for Harness Engineering—agents and orchestration, evaluation, security, governance and standards, and protocols—covering foundational papers, industry writeups, and regulatory frameworks.
|
|
11
|
+
evidence_level: theoretical
|
|
12
|
+
confidence_level: high
|
|
13
|
+
source_type:
|
|
14
|
+
- industry_observation
|
|
15
|
+
- paper
|
|
16
|
+
related:
|
|
17
|
+
- HRN-001
|
|
18
|
+
- GOV-001
|
|
19
|
+
tags:
|
|
20
|
+
- bibliography
|
|
21
|
+
- reference
|
|
22
|
+
- reading-list
|
|
23
|
+
- standards
|
|
24
|
+
---
|
|
25
|
+
|
|
26
|
+
# Bibliography
|
|
27
|
+
|
|
28
|
+
## Executive Summary
|
|
29
|
+
|
|
30
|
+
This bibliography is the curated reference list underpinning the Harness Engineering handbook. It is organized by theme so a reader can go deep on any single layer. Entries are real, well-known works and standards. Where exact citation details (DOIs, page numbers) are not asserted here, the title and venue/source are given without fabricating identifiers; readers should confirm current versions of evolving standards.
|
|
31
|
+
|
|
32
|
+
## Definition
|
|
33
|
+
|
|
34
|
+
The following references are grouped by theme. They are the primary sources the handbook draws on and the recommended starting points for further study.
|
|
35
|
+
|
|
36
|
+
### 1. Foundations of agents and reasoning
|
|
37
|
+
|
|
38
|
+
- Yao, S. et al. **"ReAct: Synergizing Reasoning and Acting in Language Models."** ICLR. The reasoning-and-acting interleaving that underpins tool-using agents.
|
|
39
|
+
- Wei, J. et al. **"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models."** NeurIPS. Foundational to step-by-step reasoning.
|
|
40
|
+
- Schick, T. et al. **"Toolformer: Language Models Can Teach Themselves to Use Tools."** NeurIPS.
|
|
41
|
+
- Shinn, N. et al. **"Reflexion: Language Agents with Verbal Reinforcement Learning."** NeurIPS. The reflection/self-critique loop (cf. PAT-003).
|
|
42
|
+
- Wang, L. et al. **"A Survey on Large Language Model based Autonomous Agents."** A broad survey of the agent design space.
|
|
43
|
+
- Wang, X. et al. **"Plan-and-Solve Prompting."** ACL. Plan-then-execute decomposition.
|
|
44
|
+
|
|
45
|
+
### 2. Orchestration, multi-agent, and durable execution
|
|
46
|
+
|
|
47
|
+
- Anthropic. **"Building Effective Agents."** Engineering guidance on workflows vs. agents and single-agent-first design.
|
|
48
|
+
- Anthropic. **"How we built our multi-agent research system."** Practical supervisor/worker orchestration writeup.
|
|
49
|
+
- LangChain. **LangGraph documentation** — state-machine orchestration for agents.
|
|
50
|
+
- Temporal / durable-execution engines. **Documentation on workflow durability and the Saga pattern.**
|
|
51
|
+
- Microsoft / AutoGen. **"AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation."** Multi-agent conversation framework.
|
|
52
|
+
- Hong, S. et al. **"MetaGPT: Meta Programming for Multi-Agent Collaborative Framework."**
|
|
53
|
+
|
|
54
|
+
### 3. Memory and retrieval (RAG)
|
|
55
|
+
|
|
56
|
+
- Lewis, P. et al. **"Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks."** NeurIPS. The canonical RAG paper.
|
|
57
|
+
- Gao, Y. et al. **"Retrieval-Augmented Generation for Large Language Models: A Survey."**
|
|
58
|
+
- Packer, C. et al. **"MemGPT: Towards LLMs as Operating Systems."** Memory hierarchy and paging for agents.
|
|
59
|
+
- Asai, A. et al. **"Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection."**
|
|
60
|
+
|
|
61
|
+
### 4. Evaluation
|
|
62
|
+
|
|
63
|
+
- Liang, P. et al. **"Holistic Evaluation of Language Models (HELM)."** Stanford CRFM.
|
|
64
|
+
- Zheng, L. et al. **"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena."** The LLM-as-judge methodology and its biases.
|
|
65
|
+
- Es, S. et al. **"RAGAS: Automated Evaluation of Retrieval Augmented Generation."** Groundedness and faithfulness metrics.
|
|
66
|
+
- Liu, Y. et al. **"G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment."**
|
|
67
|
+
- **SWE-bench** and **GAIA** — agentic capability benchmarks for software and general assistance tasks.
|
|
68
|
+
|
|
69
|
+
### 5. Security for agentic systems
|
|
70
|
+
|
|
71
|
+
- OWASP. **"OWASP Top 10 for Large Language Model Applications."** Including LLM01 Prompt Injection and LLM06 Sensitive Information Disclosure.
|
|
72
|
+
- Willison, S. **"Prompt injection"** and **"The lethal trifecta for AI agents"** (blog essays). The clearest articulation of the architectural injection/exfiltration problem.
|
|
73
|
+
- Greshake, K. et al. **"Not what you've signed up for: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection."**
|
|
74
|
+
- MITRE. **ATLAS (Adversarial Threat Landscape for Artificial-Intelligence Systems).**
|
|
75
|
+
- NIST. **SP 800-53** (security and privacy controls; least privilege, identity) as adapted for AI systems.
|
|
76
|
+
|
|
77
|
+
### 6. Governance, risk, and regulatory standards
|
|
78
|
+
|
|
79
|
+
- NIST. **AI Risk Management Framework (AI RMF 1.0)** and the **Generative AI Profile.**
|
|
80
|
+
- ISO/IEC. **42001:2023 — Artificial intelligence — Management system.**
|
|
81
|
+
- ISO/IEC. **23894:2023 — AI — Guidance on risk management.**
|
|
82
|
+
- European Union. **Regulation (EU) 2024/1689, the EU AI Act** — risk-tiered obligations for AI systems.
|
|
83
|
+
- OECD. **OECD AI Principles.**
|
|
84
|
+
- US White House / OMB. **Executive and management guidance on trustworthy AI** (for context on public-sector expectations).
|
|
85
|
+
- See also GOV-001 (Enterprise AI Governance Framework) and GOV-005 (Agent Governance Controls Checklist) in this corpus.
|
|
86
|
+
|
|
87
|
+
### 7. Protocols, interoperability, and the discovery layer
|
|
88
|
+
|
|
89
|
+
- Anthropic. **Model Context Protocol (MCP) specification** — standardized model-to-tool/data interface.
|
|
90
|
+
- **llms.txt** proposal — a site-level convention for agent-friendly content indexing.
|
|
91
|
+
- **JSON-LD / schema.org** — structured data for machine discovery.
|
|
92
|
+
- **OpenAPI Specification** — typed contracts for tools exposed as APIs.
|
|
93
|
+
|
|
94
|
+
### 8. Authorization and policy enforcement (adapted from systems engineering)
|
|
95
|
+
|
|
96
|
+
- OASIS. **eXtensible Access Control Markup Language (XACML)** — the PEP/PDP authorization model.
|
|
97
|
+
- **Open Policy Agent (OPA) / Rego** — policy-as-code engine.
|
|
98
|
+
- Saltzer, J. & Schroeder, M. **"The Protection of Information in Computer Systems."** Origin of the least-privilege principle.
|
|
99
|
+
|
|
100
|
+
## FAQs
|
|
101
|
+
|
|
102
|
+
**Q: Why are some entries missing DOIs or exact dates?**
|
|
103
|
+
A: To avoid fabricating identifiers. Titles and venues/sources are given so the work is unambiguously locatable; confirm the current version, especially for evolving standards (EU AI Act, NIST AI RMF, MCP, OWASP).
|
|
104
|
+
|
|
105
|
+
**Q: How does this relate to GOV-001?**
|
|
106
|
+
A: GOV-001 operationalizes the governance and regulatory sources in sections 5–6 into an enterprise framework; this bibliography is the underlying reading list.
|
|
107
|
+
|
|
108
|
+
**Q: Where should a newcomer start?**
|
|
109
|
+
A: Section 1 (ReAct, Reflexion) for how agents work, section 2 (Building Effective Agents) for how to engineer them reliably, and sections 5–6 for security and governance.
|
|
@@ -0,0 +1,89 @@
|
|
|
1
|
+
---
|
|
2
|
+
title: "Bibliografia"
|
|
3
|
+
summary: "Fontes, literatura de referência e observações da indústria em que se apoia o manual de Engenharia de Harness."
|
|
4
|
+
---
|
|
5
|
+
|
|
6
|
+
# Bibliografia
|
|
7
|
+
|
|
8
|
+
## Resumo executivo
|
|
9
|
+
|
|
10
|
+
Esta bibliografia é a lista de referências curada que sustenta o manual de Engenharia de Harness. Está organizada por temas para que quem lê possa aprofundar qualquer camada em concreto. As entradas são obras e normas reais e conhecidas. Quando aqui não se afirmam os dados exatos de citação (DOI, números de página), dá-se o título e o local ou a fonte sem inventar identificadores; convém confirmar a versão em vigor das normas que ainda evoluem. Os títulos das obras ficam na língua original, para que sejam localizáveis tal como estão.
|
|
11
|
+
|
|
12
|
+
## Definição
|
|
13
|
+
|
|
14
|
+
As referências seguintes estão agrupadas por tema. São as fontes primárias de que o manual bebe e os pontos de partida recomendados para continuar a estudar.
|
|
15
|
+
|
|
16
|
+
### 1. Fundamentos de agentes e raciocínio
|
|
17
|
+
|
|
18
|
+
- Yao, S. et al. **“ReAct: Synergizing Reasoning and Acting in Language Models”.** ICLR. O entrelaçamento de raciocinar e agir que sustenta os agentes com ferramentas.
|
|
19
|
+
- Wei, J. et al. **“Chain-of-Thought Prompting Elicits Reasoning in Large Language Models”.** NeurIPS. Fundacional para o raciocínio passo a passo.
|
|
20
|
+
- Schick, T. et al. **“Toolformer: Language Models Can Teach Themselves to Use Tools”.** NeurIPS.
|
|
21
|
+
- Shinn, N. et al. **“Reflexion: Language Agents with Verbal Reinforcement Learning”.** NeurIPS. O ciclo de reflexão e autocrítica (cf. PAT-003).
|
|
22
|
+
- Wang, L. et al. **“A Survey on Large Language Model based Autonomous Agents”.** Um levantamento amplo do espaço de desenho de agentes.
|
|
23
|
+
- Wang, X. et al. **“Plan-and-Solve Prompting”.** ACL. Decomposição de planejar e depois executar.
|
|
24
|
+
|
|
25
|
+
### 2. Orquestração, multiagente e execução duradoura
|
|
26
|
+
|
|
27
|
+
- Anthropic. **“Building Effective Agents”.** Orientação de engenharia sobre fluxos diante de agentes e sobre o desenho com agente único primeiro.
|
|
28
|
+
- Anthropic. **“How we built our multi-agent research system”.** Escrito prático sobre orquestração supervisor/trabalhador.
|
|
29
|
+
- LangChain. **Documentação do LangGraph** — orquestração por máquina de estados para agentes.
|
|
30
|
+
- Temporal e outros motores de execução duradoura. **Documentação sobre durabilidade de fluxos e o padrão saga.**
|
|
31
|
+
- Microsoft / AutoGen. **“AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation”.** Quadro de conversação multiagente.
|
|
32
|
+
- Hong, S. et al. **“MetaGPT: Meta Programming for Multi-Agent Collaborative Framework”.**
|
|
33
|
+
|
|
34
|
+
### 3. Memória e recuperação (RAG)
|
|
35
|
+
|
|
36
|
+
- Lewis, P. et al. **“Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks”.** NeurIPS. O artigo canônico de RAG.
|
|
37
|
+
- Gao, Y. et al. **“Retrieval-Augmented Generation for Large Language Models: A Survey”.**
|
|
38
|
+
- Packer, C. et al. **“MemGPT: Towards LLMs as Operating Systems”.** Hierarquia de memória e paginação para agentes.
|
|
39
|
+
- Asai, A. et al. **“Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection”.**
|
|
40
|
+
|
|
41
|
+
### 4. Avaliação
|
|
42
|
+
|
|
43
|
+
- Liang, P. et al. **“Holistic Evaluation of Language Models (HELM)”.** Stanford CRFM.
|
|
44
|
+
- Zheng, L. et al. **“Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena”.** A metodologia do LLM como juiz e seus enviesamentos.
|
|
45
|
+
- Es, S. et al. **“RAGAS: Automated Evaluation of Retrieval Augmented Generation”.** Métricas de ancoragem e fidelidade.
|
|
46
|
+
- Liu, Y. et al. **“G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment”.**
|
|
47
|
+
- **SWE-bench** e **GAIA** — bancos de ensaio de capacidade agêntica para tarefas de software e de assistência geral.
|
|
48
|
+
|
|
49
|
+
### 5. Segurança para sistemas agênticos
|
|
50
|
+
|
|
51
|
+
- OWASP. **“OWASP Top 10 for Large Language Model Applications”.** Inclui LLM01 injeção de prompt e LLM06 divulgação de informação sensível.
|
|
52
|
+
- Willison, S. **“Prompt injection”** e **“The lethal trifecta for AI agents”** (ensaios de blogue). A formulação mais clara do problema arquitetônico de injeção e exfiltração.
|
|
53
|
+
- Greshake, K. et al. **“Not what you've signed up for: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection”.**
|
|
54
|
+
- MITRE. **ATLAS (Adversarial Threat Landscape for Artificial-Intelligence Systems).**
|
|
55
|
+
- NIST. **SP 800-53** (controles de segurança e privacidade; privilégio mínimo, identidade), adaptado a sistemas de IA.
|
|
56
|
+
|
|
57
|
+
### 6. Governança, risco e normas regulatórias
|
|
58
|
+
|
|
59
|
+
- NIST. **AI Risk Management Framework (AI RMF 1.0)** e o **Generative AI Profile.**
|
|
60
|
+
- ISO/IEC. **42001:2023 — Inteligência artificial — Sistema de gestão.**
|
|
61
|
+
- ISO/IEC. **23894:2023 — IA — Orientação para a gestão do risco.**
|
|
62
|
+
- União Europeia. **Regulamento (UE) 2024/1689, o Regulamento Europeu de IA** — obrigações escalonadas por nível de risco para os sistemas de IA.
|
|
63
|
+
- OCDE. **Princípios de IA da OCDE.**
|
|
64
|
+
- Casa Branca e OMB dos EUA. **Orientações executivas e de gestão sobre IA digna de confiança** (como contexto das expectativas do setor público).
|
|
65
|
+
- Ver também GOV-001 (quadro de governança de IA empresarial) e GOV-005 (lista de verificação de controles de governança de agentes) neste corpus.
|
|
66
|
+
|
|
67
|
+
### 7. Protocolos, interoperabilidade e a camada de descoberta
|
|
68
|
+
|
|
69
|
+
- Anthropic. **Especificação do Model Context Protocol (MCP)** — interface normalizada de modelo para ferramentas e dados.
|
|
70
|
+
- Proposta **llms.txt** — uma convenção no nível do site para indexar conteúdo de forma apta para agentes.
|
|
71
|
+
- **JSON-LD / schema.org** — dados estruturados para a descoberta por máquina.
|
|
72
|
+
- **Especificação OpenAPI** — contratos tipados para ferramentas expostas como API.
|
|
73
|
+
|
|
74
|
+
### 8. Autorização e aplicação de políticas (adaptado da engenharia de sistemas)
|
|
75
|
+
|
|
76
|
+
- OASIS. **eXtensible Access Control Markup Language (XACML)** — o modelo de autorização PEP/PDP.
|
|
77
|
+
- **Open Policy Agent (OPA) / Rego** — motor de política como código.
|
|
78
|
+
- Saltzer, J. e Schroeder, M. **“The Protection of Information in Computer Systems”.** Origem do princípio de privilégio mínimo.
|
|
79
|
+
|
|
80
|
+
## Perguntas frequentes
|
|
81
|
+
|
|
82
|
+
**P: Porque é que faltam o DOI ou a data exata em algumas entradas?**
|
|
83
|
+
R: Para não inventar identificadores. São dados o título e o local ou a fonte, de modo que a obra seja localizável sem ambiguidade; convém confirmar a versão em vigor, sobretudo nas normas que evoluem (Regulamento Europeu de IA, NIST AI RMF, MCP, OWASP).
|
|
84
|
+
|
|
85
|
+
**P: Que relação tem isto com GOV-001?**
|
|
86
|
+
R: GOV-001 leva à prática as fontes de governança e regulação das secções 5 e 6 dentro de um quadro empresarial; esta bibliografia é a lista de leituras que está por baixo.
|
|
87
|
+
|
|
88
|
+
**P: Por onde deve começar quem chega de novo?**
|
|
89
|
+
R: Pela secção 1 (ReAct, Reflexion) para perceber como funcionam os agentes, pela secção 2 (“Building Effective Agents”) para saber como os construir de forma confiável, e pelas secções 5 e 6 para segurança e governança.
|