6 min leer

GPT-5.6 Sol alcanza los 750 tokens por segundo. La latencia del agente ya es un factor clave de compra

Categoría

El mundo de la IA

Compartir artículo

El nuevo GPT-5.6 Sol de OpenAI funciona a una velocidad de hasta 750 tokens por segundo en hardware Cerebras, aproximadamente 5 veces más que los ~150 tokens por segundo que ofrecen la mayoría de los modelos de producción actuales. Para un chatbot, esto se traduce en una respuesta "instantánea en cualquier caso". Para un agente empresarial que encadena 30 o 40 llamadas al modelo para completar una sola tarea de back-office, ese factor de 5x se multiplica, marcando la diferencia entre un flujo de trabajo que finaliza en segundos y uno que tarda minutos. La velocidad ha dejado de ser una característica deseable para convertirse en un requisito indispensable en la lista de compras corporativa.

La mayor parte de la cobertura del lanzamiento del 9 de julio se centra en las tarifas de precios y en las puntuaciones de referencia. Sin embargo, el aspecto más relevante para cualquiera que gestione agentes en entornos de producción es el rendimiento de procesamiento (throughput), ya que este rendimiento es el peaje que se paga por cada paso individual, y los agentes ejecutan muchos pasos.

Por qué un único dato de velocidad importa más para los agentes que para el chat

Una persona que escribe en un chatbot lee a una velocidad de unos 5 a 10 tokens por segundo. Cualquier modelo que supere esa velocidad se percibe como instantáneo, por lo que las mejoras de velocidad de los últimos años han sido prácticamente imperceptibles para los usuarios finales. Los agentes han cambiado esa dinámica.

Un agente que realiza una operación real —filtrar un candidato, cotejar una factura con una orden de compra o conciliar un pago— no realiza una sola llamada al modelo. Realiza decenas de ellas: lee el documento, extrae los campos, los contrasta con un sistema, decide la siguiente acción, redacta la respuesta y la verifica. Cada paso depende del anterior. Por tanto, la latencia no es un coste fijo que se paga una sola vez, sino que se multiplica por el número de pasos del flujo de trabajo.

Por eso, que GPT-5.6 Sol alcance 750 tokens por segundo es un hito mucho más importante de lo que parece. (OpenAI compartió la gama completa en su anuncio de lanzamiento de GPT-5.6). Un flujo de trabajo de 40 pasos que antes requería 8 segundos por paso ahora tarda cerca de 2 segundos. En miles de ejecuciones diarias, esto transforma por completo los casos de uso en los que se puede implementar un agente. Las conversaciones de atención al cliente en tiempo real, la recepción de reclamaciones en el mismo día o cualquier proceso que requiera la interacción con un humano en espera pasan a ser viables cuando el tiempo de procesamiento total se reduce por debajo de un umbral tolerable para los usuarios.

La estructura de precios demuestra que OpenAI se enfoca en el volumen

GPT-5.6 se ha lanzado en tres modelos distintos, y la configuración de esta gama es el aspecto más revelador:

Modelo

Rol

Precio por 1M de tokens (entrada / salida)

Sol

Buque insignia, el más rápido en Cerebras (~750 tok/s)

5 $ / 30 $

Terra

Equilibrado, iguala a GPT-5.5 siendo unas 2 veces más económico

2,50 $ / 15 $

Luna

Alto volumen, coste mínimo

1 $ / 6 $

Una gama escalonada con precios que van desde 1 $ hasta 30 $ por millón de tokens de salida está pensada para una arquitectura empresarial diseñada para agentes que ejecutan millones de llamadas, no para un usuario individual en una ventana de chat. Luna, con un coste de 1 $ de entrada y 6 $ de salida, permite ejecutar los pasos de alta frecuencia y bajo coste de forma muy económica. Sol se reserva para las fases del flujo en las que la velocidad de procesamiento o la capacidad de razonamiento avanzado son críticas para el resultado final.

Esto nos lleva a la verdadera lección: y no se trata de "migrar absolutamente todo a Sol".

Ningún modelo único es el óptimo para cada paso de un flujo de trabajo

La tentación ante cualquier nuevo modelo de referencia es canalizar todo el tráfico hacia él. Ese es un enfoque erróneo. Un flujo de trabajo de filtrado de candidatos podría utilizar un modelo rápido y económico para analizar 500 currículums, un modelo más potente para clasificar a los finalistas y uno de máxima precisión para redactar los mensajes de contacto. Pagar tarifas de salida de un modelo insignia para cambiar el formato de un número de teléfono es, simplemente, un desperdicio de recursos.

Ya hemos argumentado anteriormente que un solo modelo no puede adaptarse a todas las necesidades empresariales, y la propia gama de tres niveles de GPT-5.6 demuestra que OpenAI coincide con este enfoque en un único lanzamiento. El reto no consiste en elegir el mejor modelo, sino en dirigir cada paso al modelo que cumpla con los requisitos mínimos para esa tarea al menor coste y latencia posibles, manteniendo la flexibilidad de intercambiar modelos en el momento en que se lance una opción más rápida sin tener que reestructurar todo el flujo de trabajo.

Esa orquestación inteligente es precisamente la función de una plataforma de agentes neutral respecto al modelo (model-agnostic). Cuando Sol sea el más rápido este trimestre y otra opción lidere el siguiente, querrá cambiar una sola configuración, no rediseñar toda su arquitectura operativa.

Acciones clave para implementar hoy

  • Evalúe sus flujos de trabajo por el tiempo global del proceso (end-to-end), no por las puntuaciones de referencia del modelo. Un modelo que obtiene 3 puntos más en una evaluación comparativa pero funciona a la mitad de velocidad puede ser la elección incorrecta para un flujo de trabajo en tiempo real.

  • Identifique los puntos críticos donde hay un usuario en espera. Ahí es donde el rendimiento de procesamiento de modelos como Sol ofrece un retorno de inversión inmediato. Los procesos por lotes (batch) que se ejecutan en horario nocturno no requieren esta velocidad.

  • Evite estandarizar en un solo modelo. Dirija las peticiones según cada paso del proceso. Reserve el uso del modelo de alto rendimiento y mayor coste únicamente para los momentos críticos que lo requieran.

  • Verifique la disponibilidad antes de planificar su infraestructura. La configuración más rápida de Sol se está desplegando inicialmente para socios limitados y se ampliará a medida que aumente la capacidad, por lo que debe considerar la cifra de 750 tokens por segundo como un límite máximo alcanzable y no como una realidad inmediata para todos los usuarios desde el primer día.

El titular destaca un modelo de OpenAI más rápido. Sin embargo, la lectura de fondo es que los agentes de IA han redefinido el concepto de "suficientemente rápido", y la velocidad es ahora una variable estratégica que debe adquirirse de forma planificada y no darse por sentada.

¿Quiere recibir análisis específicos para agentes de IA empresariales sobre lanzamientos como este? Enviamos un breve boletín semanal con información crucial para equipos que gestionan agentes en entornos de producción. Suscríbase aquí.

Empieza hoy

Empezar a crear agentes de IA para automatizar procesos

Únase a nuestra plataforma y empiece a crear agentes de IA para diversos tipos de automatizaciones.

Empieza hoy

Empezar a crear agentes de IA para automatizar procesos

Únase a nuestra plataforma y empiece a crear agentes de IA para diversos tipos de automatizaciones.