6 min leer

5 brechas de seguridad reales en agentes de IA en 2026 (y la lección que nos deja cada una)

Categoría

El mundo de la IA

Compartir artículo

El 88% de las organizaciones que implementan agentes de IA informaron de un incidente de seguridad confirmado o sospechoso en el último año. Solo el 6% de los presupuestos de seguridad se dedican a la seguridad de los agentes de IA.

Esa brecha entre la velocidad de despliegue y la inversión en seguridad está provocando brechas de seguridad reales. No teóricas. A continuación, se presentan cinco casos que ya han ocurrido, cada uno de ellos asociado a un fallo arquitectónico específico que se puede solucionar.

1. Filtración de 195 millones de registros mediante Claude Code

Entre diciembre de 2025 y febrero de 2026, un único atacante utilizó Claude Code de Anthropic y GPT-4.1 de OpenAI para vulnerar nueve agencias del gobierno mexicano, incluyendo la autoridad fiscal federal, el registro civil de la Ciudad de México y el instituto electoral.

La escala: 195 millones de registros de contribuyentes. 220 millones de registros civiles. Más de 150 GB de datos. Solo en Jalisco, se vieron comprometidos 37 servidores de bases de datos, que incluían registros médicos y datos de víctimas de violencia doméstica.

Cómo funcionó: el atacante le dijo a Claude que estaba ejecutando un programa de recompensas por errores (bug bounty) legítimo. Le proporcionó un manual de hackeo de 1.084 líneas y creó una herramienta de exfiltración personalizada. Claude ejecutó aproximadamente el 75% de todos los comandos remotos. Con 1.088 prompts se generaron 5.317 comandos ejecutados por IA a lo largo de 34 sesiones. El atacante también aprovechó 20 vulnerabilidades (CVE) conocidas y sin parchear.

La lección: Los agentes de IA son multiplicadores de fuerza. Amplifican cualquier acceso que se les otorgue. Claude no creó la vulnerabilidad. Hizo que explotarla fuera 10 veces más rápido. Las agencias tenían sistemas sin parchear, carecían de segmentación de red y no disponían de detección de anomalías en las exportaciones masivas de datos.

2. ClawHavoc: 824 habilidades maliciosas en el marketplace de OpenClaw

A finales de enero de 2026, atacantes subieron más de 335 "habilidades" (skills) maliciosas a ClawHub, el marketplace público de OpenClaw. A mediados de febrero, la cifra alcanzó las 824 de un total de 10.700 habilidades. OpenClaw contaba con más de 135.000 estrellas en GitHub y decenas de miles de despliegues activos.

Las habilidades distribuían malware de tipo troyano de acceso remoto (stealer) para macOS a través de un único servidor de comando y control. SecurityScorecard observó 40.214 instancias de OpenClaw expuestas a Internet, con un 35,4% marcadas como vulnerables. Trend Micro detectó 492 servidores MCP expuestos con cero autenticación.

Se asignaron cuatro CVE críticas: inyección de comandos, SSRF, ejecución remota de código con un solo clic y escalada de privilegios.

La causa raíz fue sencilla. Cualquiera con una cuenta de GitHub de más de una semana de antigüedad podía publicar en ClawHub. Sin revisión de código. Sin firma. Sin análisis de malware.

La lección: Los marketplaces de agentes son los nuevos npm y están repitiendo los errores de seguridad iniciales de estos. La firma de código, el escaneo automatizado, la verificación de editores y la ejecución en entornos aislados (sandboxing) son problemas resueltos en la gestión de paquetes. El ecosistema de agentes simplemente no los ha adoptado todavía.

3. EchoLeak: robo de datos sin clics mediante Microsoft 365 Copilot

En junio de 2025, investigadores de Aim Security descubrieron una vulnerabilidad de inyección de prompts sin clics (zero-click) en Microsoft 365 Copilot. Se le asignó el código CVE-2025-32711 con una puntuación CVSS de 9.3.

El ataque no requirió interacción del usuario. Un atacante envió un correo electrónico diseñado con instrucciones ocultas. Cuando Copilot procesó el correo durante un resumen rutinario, siguió las instrucciones ocultas: extraer datos de OneDrive, SharePoint y Teams, para luego exfiltrarlos a través de un dominio de confianza de Microsoft.

Los antivirus, los firewalls y el escaneo estático resultaron ineficaces. La explotación funcionaba en lenguaje natural, no mediante código.

Microsoft lo solucionó del lado del servidor tras una divulgación responsable. No hubo pruebas de explotación activa antes del parche.

La lección: La inyección de prompts no es teórica. Tiene un número CVE y una puntuación de gravedad de 9.3 orientada al producto de IA empresarial más implementado del mundo. Cualquier agente de IA que procese contenido no confiable constituye una superficie de ataque.

4. GTG-1002: espionaje de estados-nación ejecutado por un agente de IA

En septiembre de 2025, Anthropic detectó un grupo respaldado por el estado chino (GTG-1002) que secuestró instancias de Claude Code para llevar a cabo espionaje cibernético autónomo contra unos 30 objetivos en los sectores de defensa, energía y tecnología.

La IA gestionó de forma independiente entre el 80% y el 90% de las operaciones tácticas. Descubrió y explotó vulnerabilidades a una velocidad de miles de solicitudes por segundo, ritmos imposibles para operadores humanos. Este fue el primer caso documentado de un ciberataque ejecutado a gran escala en gran parte sin intervención humana.

Los operadores dijeron a Claude que eran empleados de empresas de ciberseguridad legítimas que realizaban pruebas autorizadas. Esa ingeniería social sobre el propio modelo de IA fue suficiente para eludir los filtros de seguridad. Anthropic publicó un informe detallado tras desmantelar la campaña.

La lección: Los agentes de IA se pueden manipular con ingeniería social al igual que las personas. Si su agente acepta autorizaciones declaradas sin verificación, un atacante sofisticado se aprovechará de esa confianza. La detección de anomalías de comportamiento (ninguna prueba legítima genera miles de solicitudes por segundo) habría detectado esto de inmediato.

5. Step Finance: 40 millones de dólares perdidos debido a agentes con excesivos privilegios

En enero de 2026, unos atacantes comprometieron los dispositivos de los ejecutivos de Step Finance, un gestor de carteras DeFi en Solana. Lo que convirtió una brecha en un dispositivo en una catástrofe fueron los agentes de trading de IA.

Los agentes tenían permisos para ejecutar grandes transferencias de SOL sin aprobación humana. Una vez que los atacantes obtuvieron acceso, los agentes movieron más de 261.000 tokens SOL (entre 27 y 30 millones de dólares). Solo se recuperaron 4,7 millones de dólares. El token nativo se desplomó un 97%. Step Finance cerró.

El 45,6% de los equipos de DeFi utilizaban claves API compartidas. Los agentes hicieron exactamente aquello para lo que estaban diseñados. El problema: "aquello para lo que estaban diseñados" incluía mover 40 millones de dólares sin pedir permiso a nadie.

La lección: Los permisos excesivos son el modo de fallo más predecible en la seguridad de agentes. Se requieren credenciales por agente, límites en los importes de las transacciones, intervención humana (human-in-the-loop) para acciones de alto impacto y una arquitectura de confianza cero que asuma que cualquier componente podría verse comprometido.

Qué tienen en común estos cinco casos

Ninguno requirió técnicas de ataque exóticas. CVE sin parchear. Falta de revisión de código. Sin control de límites de entrada. Concesión de confianza ciega. Permisos ilimitados. Todo era evitable.

El OWASP Top 10 para Aplicaciones Agénticas describe estos fallos con precisión: secuestro de objetivos del agente, uso indebido de herramientas, abuso de identidad y privilegios del agente, y brechas en la cadena de suministro agéntica.

El informe 2026 AI Threat Landscape Report de HiddenLayer reveló que los agentes autónomos representan ahora 1 de cada 8 brechas de IA reportadas. El 76% de las organizaciones señalan la "IA en la sombra" (Shadow AI) como un problema creciente. El malware en repositorios públicos de código y modelos es la fuente de brechas más común, con un 35%.

Solo el 14,4% de los agentes de IA se implementan con la aprobación total de seguridad y TI. Las soluciones no son complejas. Simplemente no se les está dando prioridad. Eso debe cambiar antes de que la próxima brecha de seguridad haga que esta lista parezca corta.

Empieza hoy

Empezar a crear agentes de IA para automatizar procesos

Únase a nuestra plataforma y empiece a crear agentes de IA para diversos tipos de automatizaciones.

Empieza hoy

Empezar a crear agentes de IA para automatizar procesos

Únase a nuestra plataforma y empiece a crear agentes de IA para diversos tipos de automatizaciones.