5 min leer
GPT-5.4 Mini y Nano: OpenAI acaba de validar la arquitectura de agentes de modelos múltiples

By submitting, you consent to our use of your data. Privacy Policy.
Categoría
Agentes de IA
Compartir artículo
OpenAI ha lanzado GPT-5.4 mini y nano esta semana, las últimas incorporaciones a una gama de modelos que se está estructurando de forma cada vez más deliberada por niveles. Las cifras principales son sólidas: GPT-5.4 mini alcanza un 54,4 % en SWE-Bench Pro en comparación con el 45,7 % de GPT-5 mini, funciona más de dos veces más rápido y se aproxima al rendimiento del modelo completo GPT-5.4 en diversas evaluaciones. GPT-5.4 nano se sitúa por debajo, optimizado para tareas de clasificación, extracción de datos, clasificación por relevancia y codificación sencilla a un coste de 0,20 $ por millón de tokens de entrada.
Las especificaciones son importantes, pero la señal más significativa es el enfoque de los casos de uso elegido por OpenAI. El anuncio describe explícitamente estos modelos como diseñados para roles de subagentes en sistemas de IA jerárquicos, donde un modelo de mayor tamaño planifica y coordina, mientras que los modelos más pequeños ejecutan tareas rápidamente y en paralelo. Este patrón arquitectónico tiene implicaciones reales sobre cómo los equipos empresariales deben plantearse la creación y el funcionamiento de sistemas multiagente.
El nivel de subagentes es ahora explícito
Los lanzamientos de modelos anteriores trataban a las versiones más pequeñas como variables de menor coste de los modelos mayores: mismos casos de uso, pero con menor capacidad y precio. GPT-5.4 mini y nano se plantean de forma diferente. OpenAI los describe específicamente optimizados para el rol de ejecutor en sistemas multimodelo: rápidos, fiables con herramientas y lo suficientemente solventes para subtareas bien definidas, pero sin ser el núcleo de razonamiento del sistema.
La integración con Codex tangibiliza esta premisa. GPT-5.4 se encarga de la planificación y de la decisión final, mientras que delega en subagentes GPT-5.4 mini que procesan de forma paralela tareas más acotadas: realizar búsquedas en una base de código, revisar un archivo de gran tamaño o procesar documentación de apoyo. GPT-5.4 mini consume el 30 % de la cuota de GPT-5.4, lo que hace que la ejecución de múltiples subagentes en paralelo sea viable a nivel de costes.
La visión de OpenAI: «En lugar de utilizar un único modelo para todo, los desarrolladores pueden diseñar sistemas donde los modelos de mayor tamaño decidan qué hacer y los modelos más pequeños ejecuten rápidamente a escala». Esto concuerda con el funcionamiento que requieren los sistemas multiagente de nivel empresarial en entornos de producción.
Qué significan los resultados de las pruebas de rendimiento en la práctica
Las diferencias en el rendimiento no son uniformes, algo que conviene analizar con detalle.
En SWE-Bench Pro, GPT-5.4 mini (54,4 %) se sitúa cerca de GPT-5.4 (57,7 %) y muy por delante de GPT-5 mini (45,7 %). En OSWorld-Verified para la ejecución de acciones en interfaces de ordenador, mini (72,1 %) prácticamente iguala al modelo completo (75,0 %). Estas son las cifras clave para las tareas agénticas: codificación, uso de herramientas y razonamiento multimodal.
Las brechas son mayores en tareas que requieren contextos de gran tamaño. En el benchmark MRCR v2 con contextos de entre 128K y 256K, el rendimiento de mini desciende al 33,6 % frente al 79,3 % de GPT-5.4. Esto señala dónde el modelo mini no es la opción adecuada: tareas que exigen un razonamiento analítico y profundo a lo largo de documentos extremadamente extensos. Para subtareas más acotadas y con un alcance bien definido (el rol propio del subagente), el perfil de rendimiento se mantiene sólido.
GPT-5.4 nano prioriza la velocidad y la eficiencia de costes frente a una mayor capacidad. Con una tarifa de 0,20 $ por millón de tokens de entrada, su precio está pensado para flujos de trabajo de clasificación y enrutamiento de gran volumen. Su puntuación del 52,4 % en SWE-Bench Pro supera los resultados de GPT-5 mini, lo que lo convierte en una actualización muy valiosa para subtareas de codificación sencillas, incluso con sus competitivas tarifas de categoría nano.
El uso de herramientas es la capacidad más infravalorada
Un dato que merece especial atención: las llamadas a herramientas. GPT-5.4 mini obtiene un 93,4 % en τ2-bench frente al 74,1 % de GPT-5 mini, y un 57,7 % en MCP Atlas en comparación con el 47,6 %. Para los agentes de IA empresariales, la fiabilidad en el uso de herramientas suele ser el factor determinante. Un agente que razona con solidez pero ejecuta incorrectamente las llamadas a herramientas genera fallos difíciles de detectar y aún más complejos de depurar. La mejora en la precisión de las llamadas a herramientas con latencias mini es, probablemente, más relevante a nivel práctico que los resultados estrella de los benchmarks de codificación para la mayoría de los flujos de trabajo en producción.
Precios y disponibilidad
GPT-5.4 mini: 0,75 $ por millón de tokens de entrada / 4,50 $ por millón de tokens de salida. Ventana de contexto de 400k. Disponible desde hoy en la API, Codex y ChatGPT. Admite entradas de texto e imagen, uso de herramientas, llamada a funciones, búsqueda web, búsqueda de archivos, uso de ordenador y habilidades.
GPT-5.4 nano: 0,20 $ por millón de tokens de entrada / 1,25 $ por millón de tokens de salida. Disponible únicamente mediante API.
En perspectiva, GPT-5.4 mini representa una reducción sustancial de costes frente a ejecutar todos los procesos en GPT-5.4, manteniendo al mismo tiempo un nivel de rendimiento casi idéntico en las tareas agénticas más relevantes para la automatización corporativa.
Qué significa esto para la arquitectura de IA corporativa
La conclusión práctica es que la viabilidad técnica de las arquitecturas multiagente jerárquicas se consolida notablemente. La ejecución de un orquestador altamente capacitado junto con ejecutores más rápidos y económicos cuenta ahora con un mejor respaldo por parte de las capacidades de los modelos subyacentes, y queda validada explícitamente como un patrón de diseño por parte de OpenAI. Para los equipos que tienen agentes de IA en entornos de producción, esto refuerza varios principios de diseño: acotar las subtareas lo suficiente como para que los modelos más pequeños puedan ejecutarlas con fiabilidad, delegar el razonamiento complejo y la decisión final en el orquestador, y diseñar interfaces de herramientas compatibles con cualquier modelo para poder canalizar las tareas al nivel óptimo a medida que evolucionan las tecnologías.
El panorama de los modelos de IA avanza de forma vertiginosa. Lo que GPT-5.4 mini resuelve hoy con sus tarifas optimizadas habría requerido un modelo de máxima capacidad hace tan solo doce meses. Aquellas organizaciones que diseñen sus arquitecturas de agentes basándose en niveles de capacidad, en lugar de ligarlas a modelos específicos, estarán en una posición óptima para rentabilizar esta evolución.





