El envenenamiento de herramientas MCP (tool poisoning) consiste en manipular las definiciones de herramientas que lee un agente IA para inyectar instrucciones no autorizadas. El agente las ejecuta como si fueran legítimas: envía correos con datos adjuntos, sube archivos a repositorios externos o llama a APIs de terceros. Todo sin malware en el dispositivo, sin alertas en el antivirus y con todas las acciones firmadas por una aplicación autorizada por el propio usuario.
Cómo funciona el ataque de tool poisoning en MCP: el mecanismo real
El Model Context Protocol fue publicado por Anthropic en noviembre de 2024 como estándar abierto para que los agentes IA se conecten con herramientas externas: sistemas de archivos, bases de datos, calendarios o clientes de correo. Cuando un agente como Claude Desktop o Cursor carga un servidor MCP, lee automáticamente un manifiesto que describe cada herramienta disponible: su nombre, descripción en lenguaje natural y parámetros aceptados. El problema crítico es que estas descripciones no están firmadas criptográficamente ni verificadas por ningún tercero de confianza. Un atacante que controle o comprometa ese servidor puede insertar instrucciones adicionales en el campo de descripción de cualquier herramienta, y el agente las procesará como parte de su contexto operativo sin distinguirlas de las instrucciones legítimas del usuario. La vulnerabilidad es análoga al prompt injection clásico, pero con una superficie de ataque mucho mayor: el vector de entrada no es un campo de formulario web sino todo el ecosistema de herramientas que el agente tiene autorizado.
El ataque rug pull: confianza ganada, instrucciones cambiadas después
Existe una variante especialmente peligrosa que los investigadores llaman rug pull, o tirón de alfombra. El atacante publica un servidor MCP aparentemente legítimo con herramientas útiles: un conector para Notion, un buscador de documentación técnica, un asistente de base de datos. El usuario lo instala, lo prueba durante días o semanas y funciona sin comportamientos sospechosos, acumulando el estatus de herramienta autorizada tanto en la percepción del usuario como en los registros del agente. Transcurrido ese periodo, el servidor actualiza de forma silenciosa sus definiciones, añadiendo instrucciones maliciosas en los campos de descripción. En la siguiente sesión, el agente ejecuta esas instrucciones sin pedir confirmación adicional porque la herramienta ya estaba previamente autorizada. Esta táctica es idéntica a los ataques de supply chain en paquetes npm o PyPI: primero ganarse la confianza, luego activar la carga maliciosa.
El Prompt Injection (LLM01) es el riesgo número 1 del OWASP LLM Top 10 (2025) — y el envenenamiento de herramientas MCP es su variante más difícil de detectar: el payload no llega del usuario sino de los metadatos de herramientas que el agente ya tiene autorizadas
Qué datos corporativos están realmente en riesgo
- Credenciales y tokens de sesión almacenados en el contexto activo del agente durante la conversación
- Correos electrónicos e historial de comunicaciones internas si el agente tiene integración con el cliente de email
- Documentos confidenciales: propuestas comerciales, contratos y presupuestos accesibles vía sistema de archivos
- Código fuente propietario si el agente opera en entornos de desarrollo como Cursor o GitHub Copilot con MCP habilitado
- Datos de clientes en CRMs o ERPs integrados mediante conectores MCP
- Claves de API internas inyectadas en el contexto para que el agente acceda a servicios corporativos
La diferencia fundamental entre este vector y el malware convencional es la ausencia total de código malicioso en el dispositivo de la víctima. El agente IA usa sus propias herramientas autorizadas para exfiltrar: si tiene acceso al cliente de correo, envía un email con los datos a una dirección externa sin que el usuario lo visualice en tiempo real. Si tiene acceso a GitHub, crea un repositorio aparentemente privado y sube los ficheros comprometidos. Si puede realizar peticiones HTTP salientes, llama a un servidor de comando y control disfrazado de API de métricas o telemetría. Los sistemas EDR no generan alerta porque es una aplicación autorizada ejecutando operaciones dentro de su perfil normal de comportamiento. El RGPD obliga a notificar brechas en un máximo de 72 horas, pero si no existe ningún mecanismo de detección específico, la fuga puede mantenerse activa durante meses antes de ser descubierta.
de las empresas auditadas por Blurtek en entornos con agentes IA no disponía de ningún registro de las herramientas MCP ejecutadas durante las sesiones de trabajo, haciendo imposible la detección retroactiva de exfiltraciones (datos internos Blurtek, 12 proyectos de auditoría IA, 2025-2026)
La paradoja que nadie publica: los modelos más capaces son los más vulnerables
La observación contraintuitiva que los fabricantes de herramientas IA no publicitan es la siguiente: cuanto más avanzado es el modelo de lenguaje, más eficaz resulta el ataque de tool poisoning. Los modelos de última generación son superiores siguiendo instrucciones complejas y matizadas, incluso cuando esas instrucciones llegan empaquetadas en los metadatos de herramientas que el usuario jamás revisa directamente. Un modelo menos sofisticado puede ignorar una instrucción larga incrustada en una descripción de herramienta porque carece de capacidad para procesarla en profundidad. Un modelo avanzado, en cambio, la ejecuta con precisión quirúrgica. Esto significa que la empresa que invierte en las capacidades IA más potentes puede estar, paradójicamente, más expuesta a este vector específico que una empresa con herramientas más básicas. No es un argumento contra la IA avanzada: es un argumento para no desplegarla sin controles de seguridad diseñados específicamente para entornos de agentes autónomos con acceso a herramientas externas.
El contexto español: adopción acelerada sin protocolos de seguridad específicos
de las empresas españolas de más de 10 empleados ya usa alguna forma de IA generativa según el INE (Encuesta sobre uso de TIC y comercio electrónico en las empresas, 2025), pero menos del 8% ha actualizado sus políticas de seguridad para contemplar riesgos específicos de agentes autónomos con acceso a herramientas externas
Cómo proteger tu empresa: cinco controles que funcionan hoy
- Inventariar todos los servidores MCP instalados en equipos de desarrollo y trabajo — sin este paso, el resto no sirve
- Establecer una lista blanca de servidores MCP autorizados por el equipo de seguridad, bloqueando por política cualquier instalación no revisada
- Revisar manualmente las definiciones de herramientas (tool descriptions) de cada servidor MCP antes de autorizar su uso en entornos con datos sensibles
- Implementar logging completo de todas las llamadas a herramientas MCP durante las sesiones de trabajo, con retención mínima de 90 días para análisis forense
- Aplicar principio de mínimo privilegio: cada agente IA solo debe tener acceso a las herramientas estrictamente necesarias para su tarea concreta, sin accesos globales
- Agente IA con acceso a email, sistema de archivos, GitHub y base de datos de clientes. Sin logs de llamadas a herramientas MCP. Sin lista blanca. El equipo instala servidores MCP libremente desde registros públicos sin ninguna revisión de seguridad previa.
- Agente IA con acceso limitado exclusivamente a las herramientas necesarias para cada tarea. Log completo de cada llamada con retención de 90 días. Servidores MCP auditados y en lista blanca corporativa. Revisión trimestral de definiciones de herramientas.
En Blurtek hemos visto casos donde la recomendación honesta no es contratar más servicios de seguridad, sino frenar el despliegue de agentes IA hasta tener visibilidad básica sobre qué herramientas ejecutan y con qué datos operan. Un agente IA sin logs auditables no es una herramienta de productividad: es un punto ciego en tu postura de seguridad que ningún EDR va a cubrir por ti.
¿Tu empresa ya usa agentes IA con integración MCP y no tienes visibilidad sobre qué herramientas ejecutan ni un inventario de servidores autorizados? Auditamos tu entorno IA antes de que lo haga alguien con malas intenciones.
Solicitar diagnóstico