5 min leer
EVMBench de OpenAI y Paradigm: la primera prueba rigurosa para agentes de seguridad de IA

By submitting, you consent to our use of your data. Privacy Policy.
Categoría
El mundo de la IA
Compartir artículo
OpenAI y Paradigm acaban de lanzar de código abierto EVMBench, un benchmark que evalúa el rendimiento de los agentes de IA a la hora de detectar, parchear y explotar vulnerabilidades en contratos inteligentes. Estos contratos aseguran más de 100.000 millones de dólares en criptoactivos y, hasta el momento, no existía una forma estandarizada de medir si los agentes de IA podían protegerlos de forma eficaz.
Eso acaba de cambiar.
¿Qué evalúa exactamente EVMBench?
EVMBench evalúa a los agentes de IA en tres tareas críticas, cada una de ellas representativa de un nivel distinto de la labor de seguridad:
Detección: los agentes auditan repositorios de contratos inteligentes e intentan identificar vulnerabilidades conocidas. La puntuación se basa en la sensibilidad (recall), midiendo si el agente es capaz de detectar lo que los auditores profesionales ya documentaron.
Parcheo: los agentes intentan corregir el código vulnerable sin alterar el funcionamiento del contrato. Esto resulta más complejo de lo que parece. La corrección debe eliminar la vulnerabilidad conservando el resto de las funcionalidades intactas, incluidos los casos límite que el agente podría no comprender en detalle.
Explotación: los agentes tratan de retirar fondos de contratos vulnerables en entornos aislados (sandbox) de blockchain. La evaluación es determinista, basándose en si el agente logra activar el cambio de estado en la cadena que permitiría el desvío de fondos en un entorno de producción real.
El conjunto de datos que sustenta esta prueba consta de 120 vulnerabilidades seleccionadas a partir de 40 auditorías reales, provenientes en su mayoría de las competiciones de auditoría abierta de Code4rena, junto con escenarios adicionales del proyecto de blockchain Tempo de Stripe. Cada tarea está contenerizada, garantizando que los agentes se ejecuten en entornos aislados y replicables.
Cada tarea incluye también una clave de verificación contrastada. El benchmark en sí ha sido validado para garantizar que cada vulnerabilidad sea explotable, parcheable y detectable en la práctica.
El impacto medido en cifras
Cuando OpenAI y Paradigm comenzaron el desarrollo de EVMBench, los modelos más avanzados lograban explotar menos del 20 % de los fallos críticos de seguridad con pérdida de fondos en Code4rena.
Hoy en día, GPT-5.3-Codex (utilizado a través de la interfaz de comandos Codex de OpenAI) alcanza una tasa de éxito del 72,2 % en el modo de explotación. A modo de contexto, GPT-5, lanzado solo seis meses antes, obtuvo una puntuación del 31,9 % en esas mismas tareas.
Se trata de un incremento exponencial, pasando de aproximadamente uno de cada cinco a casi tres de cada cuatro en menos de un año.
La detección y el parcheo aún presentan un margen de mejora amplio. Los agentes todavía encuentran dificultades para realizar auditorías exhaustivas en bases de código completas, y el parcheo exige comprender lógicas de diseño profundas que van más allá de la vulnerabilidad inmediata. En cualquier caso, la trayectoria en el área de explotación resulta incuestionable.
Tal y como indicó Paradigm: "El ritmo de mejora es extraordinario".
Por qué esto trasciende al sector cripto
Aunque EVMBench se presenta como una herramienta de seguridad blockchain, sus implicaciones van mucho más allá de este ecosistema.
La mayoría de los benchmarks actuales para agentes de IA se basan en tareas sintéticas, conjuntos de datos de prueba o desafíos de programación simplificados. EVMBench destaca porque evalúa a los agentes frente a código de producción real, donde los errores conllevan consecuencias financieras directas. No hablamos de fallos hipotéticos, sino de vulnerabilidades que, de ser explotadas abiertamente, sustraerían capital real de protocolos reales.
Este es precisamente el estándar de evaluación que requería el ecosistema de los agentes de IA. Al implementar agentes de IA en entornos corporativos para optimizar procesos de back-office, auditorías de cumplimiento o transacciones financieras, es necesario conocer su rendimiento ante la complejidad del mundo real, no ante casos de prueba diseñados a medida.
La estructura de tres fases (detectar, parchear y explotar) también merece especial consideración. No se limita a evaluar si un agente localiza un problema, sino que mide si es capaz de solucionarlo de forma inocua y si comprende la incidencia en profundidad para replicarla. Este modelo de evaluación por capas es la referencia idónea para validar cualquier agente orientado a producción, independientemente de su sector.
Qué significa esto para la IA en el ámbito empresarial
Principales conclusiones para empresas que desarrollan o implementan agentes de IA:
Las evaluaciones con flujos de trabajo reales aportan más valor que las pruebas sintéticas. El valor diferencial de EVMBench reside en el uso de datos de auditoría reales de contratos en producción. La misma máxima aplica a nivel corporativo: si evalúa un agente de IA para la gestión de facturación o recursos humanos, pruébelo con sus datos operativos reales y casos complejos, no con una demostración guiada.
La capacidad de los agentes evoluciona a un ritmo sin precedentes. Lograr un incremento del 20 % al 72 % en precisión de explotación en cuestión de meses no es un avance lineal o incremental. Es un salto tecnológico que redefine lo que es viable. Agentes que hace un año se consideraban prototipos hoy ejecutan tareas que requerirían horas de trabajo por parte de un auditor cualificado.
El parcheo continúa siendo el desafío técnico principal. Detectar incidencias es un primer paso; corregirlas sin generar nuevos fallos imprevistos es la verdadera dificultad de los agentes actuales. Esto se traduce directamente en los despliegues empresariales: los agentes que generan mayor retorno de inversión no son los que simplemente alertan de los problemas, sino los que ofrecen resolución de extremo a extremo garantizando la continuidad operativa.
Los benchmarks abiertos dinamizan la innovación en el sector. Al publicar EVMBench en código abierto, OpenAI y Paradigm proporcionan a la comunidad investigadora y a los desarrolladores un estándar unificado de rendimiento. De hecho, Paradigm ya ha adaptado este benchmark en un agente de auditoría operativa. Es de esperar que más organizaciones sigan esta tendencia.
La perspectiva global
Conviene destacar la conclusión de Paradigm: "En el futuro, una parte sustancial de las auditorías será realizada por agentes especializados".
Sustituya "auditorías" por prácticamente cualquier función empresarial basada en reglas y alta densidad de conocimiento, y la premisa seguirá siendo válida. La cuestión estratégica ya no es si los agentes de IA realizarán estas operaciones, sino con qué rapidez alcanzarán el nivel óptimo y cómo definiremos ese estándar en áreas donde el margen de error tiene un alto impacto financiero.
EVMBench aporta una respuesta sólida a dicha necesidad. El sector empresarial requiere más iniciativas de este nivel.





