8 min leer

El futuro de la IA no reside en modelos más grandes. Está en una mejor orquestación.

By submitting, you consent to our use of your data. Privacy Policy.

Categoría

El mundo de la IA

Compartir artículo

Hace doce meses, la respuesta de la industria de la IA a cualquier límite de rendimiento era siempre la misma: hacer el modelo más grande. Más parámetros, más datos de entrenamiento, más cómputo. El entrenamiento de cada generación costaba más, su ejecución era más cara y ofrecía menores avances en las pruebas de rendimiento que realmente importan para el trabajo empresarial.

Esa trayectoria se está topando con un muro. Un estudio de la PNAS revisado por pares y publicado en 2025 reveló que los modelos de frontera son "apenas más persuasivos que los modelos de tamaño inferior por un orden de magnitud o más", y que un mayor escalado "puede no aumentar significativamente el rendimiento en más de 1 punto porcentual". GPT-4.5 de OpenAI, el modelo escalado de forma más agresiva de la compañía, ofreció mejoras cualitativas en áreas subjetivas, pero nada sustancial en dominios verificables como las matemáticas y la ciencia. La gran mayoría de los datos de texto públicos de alta calidad ya se han consumido en las fases de entrenamiento, y los datos adicionales están ofreciendo rendimientos decrecientes.

La era del escalado no ha terminado, pero sus ganancias marginales se están reduciendo. Y está surgiendo una alternativa que cambia por completo la ecuación.

Un modelo de 7B que superó a GPT-5

Un equipo de Sakana AI publicó recientemente un artículo en el ICLR 2026 en el que presentaban lo que denominan un "Conductor": un modelo de 7.000 millones de parámetros entrenado con aprendizaje por refuerzo para coordinar GPT-5, Claude Sonnet 4, Gemini 2.5 Pro y varios modelos de código abierto. El Conductor nunca resuelve los problemas por sí mismo. Los divide en subtareas, asigna cada una al modelo más adecuado, diseña el patrón de comunicación entre ellos y genera instrucciones de ingeniería de prompts enfocadas para cada trabajador.

Los resultados fueron sorprendentes. El Conductor obtuvo una puntuación del 87,5% en GPQA Diamond, donde GPT-5 obtuvo un 82,3%. Alcanzó el 83,93% en LiveCodeBench, frente al 82,90% de GPT-5. En AIME 2025, la prueba de rendimiento de competiciones matemáticas, logró un 93,3% frente al 90,8% de GPT-5. En todas las pruebas de rendimiento analizadas, tanto dentro como fuera del dominio, el orquestador superó a cada uno de los modelos individuales que gestionaba.

Un modelo aproximadamente 200 veces más pequeño que los que coordinaba produjo mejores respuestas al combinar sus fortalezas complementarias en lugar de intentar saberlo todo por sí mismo. Esto no es una mera curiosidad académica. Es un desafío directo a la premisa de que lo más grande siempre es mejor.

Este patrón no es un caso aislado. El artículo Mixture-of-Agents, aceptado en NeurIPS 2024, demostró que la superposición de múltiples LLM en rondas colaborativas lograba una tasa de éxito del 65,8% en AlpacaEval 2.0, en comparación con el 57,5% de GPT-4o, lo que supone una mejora de 8 puntos únicamente gracias a la coordinación. Investigaciones independientes sobre la orquestación eficiente de sistemas multimodelo demostraron una mejora de la precisión del 21,7%, una reducción de la latencia del 33% y una disminución de los costes del 25% en comparación con la asignación aleatoria de modelos. La evidencia es clara: coordinar los modelos existentes supera el escalado de cualquier modelo individual.

Por qué la orquestación crea valor donde el escalado no puede

Los diferentes modelos son buenos en diferentes tareas. Claude destaca en el razonamiento con matices y el análisis minucioso. Gemini sobresale en tareas multimodales y en la recuperación de conocimientos generales. GPT-5 lidera en ciertas pruebas de codificación. Ningún modelo individual domina en todas las categorías, y la brecha existente entre ellos es precisamente donde la orquestación genera valor.

El artículo sobre el Conductor reveló algo aún más interesante sobre cómo se genera ese valor. Mediante el aprendizaje por refuerzo puro, el modelo descubrió de forma independiente estrategias de coordinación que los ingenieros humanos suelen diseñar manualmente: descomposición de tareas, asignación de especialistas, contexto de razonamiento compartido, rondas de verificación y refinamiento iterativo. Aprendió a asignar más agentes y más pasos a los problemas más difíciles, manteniendo simplificados los más sencillos. Incluso aprendió ingeniería de prompts, redactando mejores instrucciones para GPT-5 de las que GPT-5 podría redactar para sí mismo.

Este último punto merece especial atención. El modelo que mejor resuelve un problema no es necesariamente el mejor para definirlo. Se trata de dos capacidades distintas, y su separación produce mejores resultados. Este es el mismo principio que rige el funcionamiento de los equipos eficaces: un buen gestor que sepa delegar y plantear bien los problemas puede obtener mejores resultados de un equipo que cualquier colaborador individual que trabaje solo, por muy talentoso que sea.

El propio análisis de Beam sobre el problema de los 19 modelos en la IA empresarial demostró que las organizaciones que dependen de un único LLM para todas las tareas pagan entre un 40% y un 85% de más en comparación con aquellas que utilizan un enrutamiento inteligente. Enviar una consulta de búsqueda sencilla a un modelo de frontera cuesta aproximadamente 30 veces más que dirigirla a un modelo más pequeño que la resuelva igual de bien. Multiplique esto por miles de tareas diarias y la diferencia de costes se convertirá en una partida que los equipos financieros no pasarán por alto.

Las empresas ya avanzan en esta dirección

Este no es un cambio teórico. Las empresas están votando con sus presupuestos.

Gartner predice que el 40% de las aplicaciones empresariales incorporarán agentes de IA específicos para tareas a finales de 2026, frente a menos del 5% en 2025. Se trata de un incremento de 8 veces en un solo año. Gartner también registró un aumento de un 1.445% en las consultas sobre sistemas multiagente desde el primer trimestre de 2024 hasta el segundo trimestre de 2025. Una encuesta de LangChain realizada a 1.300 profesionales reveló que el 57,3% ya tiene agentes en producción, y las arquitecturas multiagente crecieron un 327% en menos de cuatro meses.

Esos agentes no se ejecutarán todos en el mismo modelo. Necesitarán patrones de orquestación que decidan qué modelo se encarga de cada paso, gestionen el contexto entre los agentes y adapten el flujo de trabajo a la tarea en cuestión. JPMorgan Chase tiene operativos más de 450 casos de uso de IA en producción, y su sistema COiN procesa 12.000 contratos de crédito en segundos dirigiendo diferentes tipos de documentos a diferentes modelos. La conferencia Build 2025 de Microsoft introdujo la orquestación multiagente como una capacidad de plataforma de primer nivel, y la implementación de la misma por parte de HCLTech resolvió los casos un 40% más rápido.

McKinsey estima que la IA agéntica podría aportar entre 2,6 y 4,4 billones de dólares en valor anual. La mayor parte de ese valor no provendrá de que un solo modelo sea más inteligente. Provendrá de sistemas que coordinen múltiples modelos, herramientas y fuentes de datos para completar flujos de trabajo de extremo a extremo que ningún modelo individual puede gestionar por sí solo.

La posibilidad recursiva

La contribución más vanguardista del artículo sobre el Conductor es la orquestación recursiva. Al permitir que el Conductor se invoque a sí mismo como uno de los agentes trabajadores, se crea un bucle en el que el orquestador puede revisar su propia estrategia de coordinación tras observar los resultados iniciales. Cuando GPT-5 obtuvo un rendimiento inesperadamente bajo en BigCodeBench, el Conductor recursivo modificó automáticamente su flujo de trabajo para priorizar a Claude y Gemini en los intentos posteriores, mejorando del 37,8% al 40,0% sin intervención humana alguna.

Este tipo de coordinación adaptativa y autocorrectiva es lo que distingue a un sistema de IA en producción de una demostración. Los entornos de producción son complejos. Los modelos se comportan de forma diferente según las distintas entradas de datos. Un flujo de orquestación fijo se quiebra cuando sus premisas fallan. Una capa de orquestación adquirida y recursiva se ajusta sobre la marcha.

Para los equipos que desarrollan flujos de trabajo agénticos hoy en día, esto indica hacia dónde debe dirigirse la inversión en infraestructura. Los modelos seguirán mejorando por sí mismos. Todos los laboratorios de frontera están invirtiendo miles de millones para que así sea. Sin embargo, la forma de combinar, dirigir y coordinar esos modelos es donde realmente se consolida la ventaja competitiva, especialmente a medida que las capacidades de los modelos individuales continúan convergiendo entre sí.

El verdadero cuello de botella nunca fue el tamaño del modelo

La industria de la IA ha pasado los últimos tres años en una carrera de parámetros. Modelos más grandes, clústeres más grandes, presupuestos más grandes. La evidencia actual sugiere que esa carrera tiene un límite, y que la próxima ola de mejoras de rendimiento provendrá del desarrollo de mejores sistemas en torno a los modelos existentes, en lugar de crear modelos más grandes desde cero.

Un orquestador de 7B que supera a GPT-5. Sistemas multiagente que superan a los modelos de frontera por 8 puntos en pruebas de rendimiento estándares. Empresas que ahorran entre un 40% y un 85% al dirigir las tareas al modelo adecuado en lugar de al más grande. El patrón es consistente en todos los laboratorios de investigación, despliegues empresariales y rentabilidad en producción.

Los modelos se están convirtiendo en bienes de consumo generalistas. La capa de orquestación, no. Y es ahí donde se está construyendo ahora mismo el futuro del rendimiento de la IA, la eficiencia de costes y el valor empresarial.

Empieza hoy

Empezar a crear agentes de IA para automatizar procesos

Únase a nuestra plataforma y empiece a crear agentes de IA para diversos tipos de automatizaciones.

Empieza hoy

Empezar a crear agentes de IA para automatizar procesos

Únase a nuestra plataforma y empiece a crear agentes de IA para diversos tipos de automatizaciones.