7 min leer

Qué nos revela la filtración de Claude Code sobre la seguridad de los agentes de IA en las empresas

By submitting, you consent to our use of your data. Privacy Policy.

Categoría

Agentes de IA

Compartir artículo

El 31 de marzo de 2026, Anthropic publicó accidentalmente el código fuente completo de Claude Code, su agente de programación con IA insignia, en el registro público de npm. Un paquete mal configurado incluyó un archivo debug de mapa de fuente de 59,8 MB en una actualización rutinaria. En cuestión de horas, los investigadores de seguridad extrajeron 512.000 líneas de TypeScript repartidas en 1.906 archivos. Las réplicas en GitHub acumularon más de 41.500 bifurcaciones antes de que comenzaran las retiradas por infracción de derechos de autor (DMCA).

Esta fue la segunda exposición de datos de Anthropic en menos de una semana, tras una filtración independiente de archivos internos no publicados que revelaron un modelo secreto con el nombre en clave "Mythos".

Para los equipos de nivel empresarial que están desarrollando o evaluando agentes de IA, esto no es solo una historia de Anthropic. Es un caso de estudio real sobre lo que puede salir mal cuando la infraestructura de IA se cruza con las cadenas de suministro de software del mundo real.

Lo que reveló el código fuente

El código fuente filtrado expuso lo que Anthropic denomina el "entorno del agente" (agentic harness), la capa de software completa que envuelve al modelo de lenguaje subyacente y le indica cómo utilizar herramientas, aplicar medidas de seguridad y orquestar el trabajo.

Entre los hallazgos más significativos se encuentran los siguientes:

Un modo autónomo no publicado llamado KAIROS. Con más de 150 referencias en el código base, KAIROS desvela planes para un demonio de fondo que permitiría a Claude Code operar de forma continua sin necesidad de instrucciones del usuario. Incluye un proceso nocturno de "destilación de memoria", suscripciones a webhooks de GitHub y ciclos de actualización programados mediante cron. Totalmente desarrollado, pero oculto tras una bandera de funcionalidad (feature flag).

Mecanismos antidestilación. Dos sistemas independientes diseñados para evitar que los competidores extraigan conocimiento mediante interacciones con la API. Uno inyecta definiciones de herramientas falsas en las instrucciones del sistema (prompts). El otro resume las cadenas de razonamiento con firmas criptográficas, limitando a los observadores externos a resúmenes en lugar de respuestas completas. Ambos son eludibles con técnicas relativamente sencillas.

Un "modo encubierto". Un archivo llamado undercover.ts elimina la marca Anthropic cuando el agente opera en repositorios externos. Las instrucciones indican al modelo que evite mencionar nombres en clave internos, canales de Slack o incluso la propia frase "Claude Code". No tiene un interruptor de desactivación forzada, solo de activación. El resultado son aportaciones de código generadas por IA que parecen escritas por humanos.

44 funciones totalmente desarrolladas pero no lanzadas. El modo de comando por voz, la automatización de navegadores mediante Playwright, la memoria persistente entre sesiones y un sistema de memoria de tres capas se encontraron desactivados tras banderas de funcionalidad.

Coordinación multiagente mediante prompts, no código. El sistema gestiona los agentes secundarios a través de instrucciones en lenguaje natural en los prompts del sistema, incluyendo directivas como "No apruebes automáticamente trabajos deficientes". Esto coincide con la tendencia hacia la que converge la industria: los agentes se orquestan mediante ingeniería de prompts, no mediante lógica de software tradicional.

Por qué esto es crucial para la IA empresarial

Hay tres conclusiones clave que los equipos técnicos deben tener en cuenta.

El entorno del agente es el producto real

La filtración confirma lo que muchos en la industria sospechábamos: el LLM básico se está convirtiendo rápidamente en un producto genérico o commodity. La verdadera ventaja competitiva reside en la capa de orquestación: las definiciones de herramientas, las salvaguardas de seguridad, los sistemas de memoria, los motores de permisos y la lógica de flujos de trabajo que hacen que un modelo sea productivo y operativo.

Para los equipos corporativos, esto significa evaluar a los proveedores de agentes de IA por la arquitectura de su plataforma y no solo por el modelo fundacional que utilizan. El entorno del agente es donde residen la fiabilidad, la auditabilidad y la seguridad.

La seguridad de la cadena de suministro ahora es un problema de IA

Esta filtración no ocurrió mediante un ciberataque sofisticado. Se debió a que un archivo .npmignore se configuró incorrectamente durante una publicación rutinaria en npm. Un desarrollador, una actualización de paquete, una sola línea omitida en un archivo de configuración.

Los agentes de IA son software. Dependen de gestores de paquetes, flujos de trabajo de CI/CD, árboles de dependencias y de toda la infraestructura que lleva años produciendo fallos de seguridad en la cadena de suministro. La diferencia es que los agentes de IA suelen contar con permisos elevados, acceso a datos confidenciales y capacidad para tomar decisiones autónomas. Un código base de agente comprometido o filtrado es una superficie de ataque directa.

La aparición simultánea de un paquete malicioso axios en npm el mismo día de la filtración de Claude Code subraya este punto. Si sus herramientas de agentes de IA consumen recursos de registros públicos, el perfil de riesgo de su cadena de suministro se acaba de ampliar drásticamente.

La transparencia y la auditabilidad no son negociables

El hallazgo que más debate ha suscitado ha sido el "modo encubierto": una función que enmascara deliberadamente la autoría de la IA. Para los sectores regulados que requieren pistas de auditoría sobre quién escribió qué código o quién tomó determinada decisión, esto representa una señal de alarma grave.

Los agentes de IA de nivel empresarial necesitan justo el enfoque opuesto. Cada acción debe ser trazable. Cada decisión debe ser auditable. Si un agente de IA escribe código, revisa documentación o procesa datos de clientes, debe existir un registro inequívoco de que fue una IA, y no un humano, quien realizó la tarea.

Esto no es solo cuestión de buenas prácticas de gobernanza. Cada vez es más un requisito legal. El reglamento NYC LL144 exige auditorías de sesgo para las herramientas de decisiones automatizadas, la Ley de IA de la UE impone transparencia para los sistemas de IA de alto riesgo, y las auditorías SOC 2 e ISO 27001 exigen una documentación clara de todos los procesos automatizados.

Qué deben hacer las empresas ahora mismo

Si está utilizando agentes de IA en producción o planea hacerlo, este es su plan de acción:

Audite su cadena de suministro de IA. Identifique con precisión de qué paquetes dependen sus herramientas de IA, sus orígenes y qué nivel de permisos tienen concedidos. Fije las versiones del software, verifique las sumas de comprobación (checksums) y trate las dependencias de los agentes de IA con el mismo rigor que aplicaría a cualquier software crítico para la seguridad de su negocio.

Exija transparencia a sus proveedores. Pregunte a sus proveedores de plataformas de IA: ¿Es visible el razonamiento del agente? ¿Se registran todas sus acciones? ¿Pueden demostrar qué ha hecho la IA y qué no? Si la respuesta es "confíe en nosotros", no es suficiente.

Diseñe pensando en la auditabilidad desde el primer día. No intente añadir el registro de auditoría a posteriori. Diseñe sus flujos de trabajo con agentes con trazabilidad, puntos de control supervisados por humanos y atribución clara integrados nativamente en su arquitectura de software.

Aísle la infraestructura de sus agentes. Los agentes de IA de nivel empresarial no deben tener acceso absoluto a todo su ecosistema tecnológico. Aplique principios de mínimo privilegio, delimite los permisos según el flujo de trabajo específico y monitorice de forma continua a qué acceden sus agentes y en qué momento.

La perspectiva general

Anthropic lo calificó como "un problema de empaquetado del lanzamiento provocado por un error humano, no una brecha de seguridad". Técnicamente es correcto: no se expusieron datos de clientes ni se comprometieron credenciales.

Sin embargo, la distinción técnica es menos importante que la lección: la infraestructura de los agentes de IA es infraestructura de software y conlleva sus mismos riesgos operativos. A medida que los agentes se vuelven más potentes y autónomos, las consecuencias de un error de configuración son cada vez mayores.

Las compañías que opten por construir sistemas de IA transparentes, auditables y resilientes no solo evitarán incidentes como este, sino que se consolidarán como los socios de confianza necesarios para liderar la adopción empresarial para las próximas décadas.

Empieza hoy

Empezar a crear agentes de IA para automatizar procesos

Únase a nuestra plataforma y empiece a crear agentes de IA para diversos tipos de automatizaciones.

Empieza hoy

Empezar a crear agentes de IA para automatizar procesos

Únase a nuestra plataforma y empiece a crear agentes de IA para diversos tipos de automatizaciones.