Microsoft propone un plano de control para gobernar la ejecución de herramientas MCP
Microsoft presenta el Agent Governance Toolkit, una capa de gobernanza de código abierto que evalúa las llamadas de herramientas MCP antes de ejecutarlas y añade políticas, auditoría, identidades y controles de privilegios.
Microsoft presentó el 22 de abril de 2026 un enfoque de gobernanza para el Model Context Protocol (MCP), el estándar que permite a los agentes de inteligencia artificial descubrir y utilizar herramientas conectadas a bases de datos, API, sistemas de archivos y servicios de terceros. La propuesta se articula en torno al Agent Governance Toolkit (AGT), un proyecto de código abierto que introduce una capa de control entre el cliente MCP y los servidores de herramientas.
Según Microsoft, MCP establece una interfaz común para descubrir herramientas, invocarlas y recibir sus respuestas, pero no define un punto de control que determine si una llamada está autorizada antes de ejecutarse. El cliente recibe las definiciones de las herramientas —incluidos sus nombres, descripciones y esquemas de parámetros— y el modelo las utiliza para seleccionar una opción y construir los argumentos. Después, la solicitud se envía al servidor, que ejecuta la acción.
La compañía considera que este flujo puede ser insuficiente cuando los servidores MCP tienen acceso a datos sensibles o a sistemas sujetos a controles de acceso y requisitos de cumplimiento. La brecha se sitúa entre la decisión del modelo de invocar una herramienta y la validación de que la llamada está permitida, correctamente limitada y registrada. Microsoft sostiene que las instrucciones dirigidas al modelo no deben considerarse por sí solas una frontera de seguridad.
El texto también recoge riesgos asociados al ecosistema MCP, entre ellos el envenenamiento de herramientas, la inyección de instrucciones mediante las respuestas, los ataques a la cadena de suministro y los fallos en cascada. Microsoft cita categorías del OWASP MCP Top 10 y del OWASP Agentic Top 10. Como parte de una evaluación interna de red team con 60 prompts, 45 adversariales y 15 válidos, el uso exclusivo de instrucciones de seguridad en el prompt produjo una tasa de incumplimiento de políticas del 26,67%. La compañía indica que la metodología y las instrucciones de reproducción están disponibles en el archivo BENCHMARKS.md.
AGT busca situar una evaluación determinista entre la intención del agente y la ejecución del servidor. Las políticas pueden permitir, denegar o exigir aprobación para cada llamada. El kit admite reglas declarativas en YAML, OPA/Rego o Cedar. Microsoft afirma que, en sus microevaluaciones internas y con conjuntos de reglas habituales, la evaluación añadió una latencia inferior a un milisegundo por llamada, aunque advierte de que AGT se encuentra actualmente en Public Preview y que sus funciones y API pueden cambiar antes de la disponibilidad general.
La herramienta incorpora varios controles. Antes de que el agente vea una descripción, analiza las definiciones para detectar instrucciones ocultas, typosquatting y patrones adversariales. También inspecciona las respuestas de los servidores para identificar instrucciones maliciosas o cargas destinadas a extraer datos. De este modo, el control se aplica tanto a la entrada que llega al modelo como a la salida que vuelve desde una herramienta.
En materia de identidad, AGT asigna a los agentes identidades criptográficas basadas en Ed25519 y ML-DSA-65, descrito por Microsoft como un algoritmo poscuántico, junto con identidades compatibles con SPIFFE. El sistema utiliza puntuaciones de confianza de 0 a 1000: estas pueden disminuir tras una infracción y recuperarse mediante un comportamiento conforme. Además, cada llamada a una herramienta queda asociada a la identidad del agente.
El modelo de ejecución incluye cuatro niveles de privilegio para aplicar el principio de mínimo privilegio y mecanismos de apagado inmediato para agentes que incumplan las políticas. AGT también genera registros de auditoría append-only encadenados mediante hashes, con los intentos de llamada, las decisiones de las políticas y los resultados de ejecución. La función de replay debugging está orientada a investigar incidentes.
Microsoft afirma que AGT cubre total o parcialmente siete de los diez riesgos del OWASP MCP Top 10. La cobertura completa se atribuye a la escalada de privilegios, el envenenamiento de herramientas, los ataques a la cadena de suministro, la inyección y ejecución de comandos, la autenticación y autorización insuficientes, la falta de auditoría y telemetría, y la inyección de contexto y sobreexposición. La gestión de tokens y secretos, la subversión del flujo de intención y los servidores MCP no registrados aparecen como coberturas parciales. Fuente: Microsoft.