8 min leer

El nuevo desglose de facturación de Anthropic revela el coste real de los agentes de IA

By submitting, you consent to our use of your data. Privacy Policy.

Categoría

El mundo de la IA

Compartir artículo

Durante el último año, algo inusual ha estado ocurriendo con los presupuestos de IA en las empresas. Las compañías están gastando drásticamente más en IA, incluso cuando el coste unitario no deja de bajar. El gasto medio de las empresas en IA se disparó de 1,2 millones de dólares en 2024 a 7 millones de dólares en 2026, un incremento del 483%, mientras que los precios de las API por token disminuyeron aproximadamente 280 veces durante el mismo período. Estas dos tendencias deberían anularse mutuamente. No lo hacen, y la razón tiene todo que ver con cómo los agentes de IA consumen computación en comparación con los chatbots tradicionales.

Anthropic acaba de hacer visible esta realidad financiera de una manera difícil de ignorar. El 13 de mayo, la compañía anunció que dividiría la facturación de sus suscripciones en dos grupos a partir del 15 de junio. Un grupo cubre el chat interactivo, la típica conversación de ida y vuelta que la mayoría de los usuarios asocia con Claude. El otro, un límite de crédito nuevo e independiente, cubre el uso del SDK de agentes, que incluye flujos de trabajo automatizados, herramientas de programación de terceros y cualquier proceso que ejecute Claude sin que un humano redacte prompts en tiempo real.

El plan Max 20x, con un precio de 200 dólares al mes, ahora incluye 200 dólares en créditos para el SDK de agentes. Esto parece razonable hasta que se analiza lo que esos mismos usuarios consumían antes de la división. Un análisis de la comunidad sobre las matemáticas de esta subvención reveló que los usuarios más intensivos de Sonnet estaban extrayendo hasta 35.000 dólares al mes en valor equivalente a la API con una suscripción de 200 dólares. La proporción entre lo que pagaban y lo que utilizaban era de 175 a 1.

Boris Cherny, responsable de Claude Code en Anthropic, fue sincero al respecto: "Nuestras suscripciones no fueron diseñadas para los patrones de uso de estas herramientas de terceros". Una forma educada de decir que el modelo de tarifa plana nunca se pensó para subsidiar cargas de trabajo de agentes a escala de producción, y que no podía seguir haciéndolo.

Cómo ha llegado Anthropic hasta aquí

La cronología muestra la historia de una empresa que se dio cuenta por etapas de lo insostenibles que eran sus finanzas. En abril, Anthropic eliminó brevemente Claude Code por completo del plan Pro de 20 dólares. La reacción de los desarrolladores fue inmediata y rotunda. Theo Browne, creador de T3 Code, calculó que el coste efectivo de su comunidad se multiplicó por 25 de la noche a la mañana y calificó la medida como un ataque al ecosistema de herramientas de código abierto. Anthropic dio marcha atrás en su decisión en menos de 24 horas.

La división del saldo de créditos anunciada en mayo fue una corrección más equilibrada. En lugar de cortar el acceso a los agentes, Anthropic lo limitó a un importe en dólares que refleja los precios reales de la API. Se trata de un compromiso razonable, pero también pone de manifiesto una verdad que el sector ha estado esquivando: el acceso de tarifa plana a IA con nivel de agente era una condición temporal del mercado, no un modelo de precios sostenible.

Se documentó el caso de un usuario que consumió 10.000 millones de tokens en ocho meses con un plan de 100 dólares al mes. Con las tarifas de la API, eso habría costado unos 15.000 dólares. Pagó 800 dólares. Esa brecha no sobrevive mucho tiempo al análisis de una cuenta de pérdidas y ganancias.

¿Por qué los agentes consumen tokens de esta manera?

El desfase de precios no se debe realmente al modelo de negocio de Anthropic. Responde a una diferencia fundamental en la forma en que los agentes utilizan la computación en comparación con los chatbots, y la mayoría de las organizaciones aún no han asimilado esa diferencia.

Una conversación típica de chatbot implica un prompt, una respuesta y tal vez un par de interacciones de seguimiento. Unos pocos miles de tokens, de entrada y de salida. Un agente que ejecuta una tarea de varios pasos opera de forma diferente. Llama a una herramienta, lee el resultado, decide qué hacer a continuación y llama a otra herramienta. Cada uno de esos pasos requiere que el modelo vuelva a procesar todo el historial de la conversación antes de generar su siguiente acción. Según una investigación del Stanford Digital Economy Lab, el contexto reenviado representa el 62% del coste total de inferencia de los agentes. La mayor parte de lo que se paga es por el hecho de que el modelo vuelve a leer lo que ya sabe.

El análisis de Gartner para 2026 sitúa el multiplicador entre 5 y 30 veces: las cargas de trabajo de agentes consumen esa enorme cantidad de recursos de computación adicionales en comparación con las interacciones estándar de los chatbots para obtener resultados empresariales equivalentes. En la práctica, un chatbot que gestiona mil consultas de clientes podría utilizar X tokens. Un agente que resuelva de forma autónoma esos mismos mil casos, con llamadas a herramientas, pasos de recuperación y cadenas de razonamiento de varios turnos, podría consumir de 15X a 30X.

Esta es la razón por la que los presupuestos se están disparando incluso cuando los costes por token disminuyen. Los costes unitarios se abarataron, pero el número de unidades necesarias por tarea se volvió drásticamente más costoso. Y la mayoría de los equipos no lo vieron venir porque seguían pensando en modelos de costes de la era de los chatbots tradicional.

Cómo son las facturas reales

Una auditoría de LeanOps realizada a 30 equipos de ingeniería que utilizan agentes de desarrollo de código dibuja una imagen muy clara. La factura media mensual del agente de un desarrollador era de 480 dólares. El percentil 90 alcanzó los 1.650 dólares. Un desarrollador consiguió gastar 4.200 dólares en un solo fin de semana ejecutando una sesión de refactorización autónoma que entró en bucle durante más tiempo de lo esperado.

La misma auditoría analizó una empresa SaaS en fase de crecimiento con 35 ingenieros. Su factura conjunta de inferencia de agentes era de 87.000 dólares al mes. Tras auditar sus patrones de consumo de tokens e implementar un enrutamiento de modelos más inteligente (dirigiendo subtareas sencillas a modelos más económicos en lugar de enviarlo todo al modelo más caro), consiguieron reducirla a 24.000 dólares de media mensual. Una reducción del 72% sin pérdida de capacidad en sus agentes de IA.

La mayor parte del desperdicio correspondía a tres categorías que le resultarán familiares a cualquiera que haya auditado una factura de infraestructura cloud:

El modelo de costes acaba de cambiar por completo

Detrás de esta situación de Anthropic se está produciendo un cambio estructural mucho mayor que afecta a todas las organizaciones que despliegan agentes de IA, no solo a los usuarios de Claude. En 2023, aproximadamente el 40% de los presupuestos empresariales de IA se destinaban a inferencia. Hoy, esa cifra es del 85%. Los costes de entrenamiento, la partida que solía capitalizar el debate, han quedado eclipsados por el coste recurrente de ejecutar los modelos en producción.

Esto invierte el modelo tradicional de costes de desarrollo de software. Históricamente, el software era caro de programar y barato de ejecutar. Los agentes de IA son cada vez más baratos de desarrollar y caros de ejecutar. Un desarrollador puede prototipar un agente en una tarde, pero ejecutar ese mismo agente a escala corporativa durante un año cuesta más de lo que jamás costó crearlo.

La corrección de Anthropic es la señal más visible de este cambio hasta la fecha, pero no será la última. Si la firma más asociada al acceso a la IA enfocado en desarrolladores no puede sostener un precio de tarifa plana para agentes, la hipótesis de que la infraestructura de agentes es económica debe ser revisada urgentemente por todo el sector corporativo.

Tres medidas a tomar antes (y después) del 15 de junio

Independientemente de si utiliza Claude o no, los factores financieros que Anthropic acaba de exponer se aplican a todos los proveedores de modelos. El subsidio era específico de Anthropic; la estructura de costes subyacente es universal.

En primer lugar, mida lo que gasta realmente por tarea. La mayoría de los equipos carecen por completo de visibilidad sobre este aspecto. Los datos de LeanOps mostraron una diferencia de costes de 3,4 veces entre desarrolladores del percentil medio y del percentil 90 en el mismo equipo realizando un trabajo similar. No se puede optimizar aquello que no se mide.

En segundo lugar, dirija las tareas al modelo adecuado. No todas las acciones de un agente requieren razonamiento de última generación. Los procesos de clasificación, extracción, formateo y plantillas pueden ejecutarse en modelos más pequeños y económicos. Reserve los modelos de gama alta para tareas de planificación, toma de decisiones estratégicas y razonamientos complejos multietapa. Solo esta medida suele reducir los costes de inferencia entre un 40% y un 60%.

En tercer lugar, establezca presupuestos de tokens para las sesiones autónomas. El incidente del fin de semana de 4.200 dólares ocurrió porque no había un límite definido. Un presupuesto máximo de 500.000 tokens por ejecución autónoma, que requiera de autorización humana para prorrogarse, detecta los bucles infinitos antes de que se conviertan en facturas desorbitadas.

La era de la inferencia subvencionada para agentes está llegando a su fin. Anthropic lo ha dicho abiertamente, y los números lo corroboran. Los presupuestos corporativos de IA seguirán creciendo, pero la brecha entre las organizaciones que gestionan los costes de los agentes como una disciplina técnica formal y aquellas que los tratan como un simple software de suscripción se ampliará rápidamente. El primer grupo gastará entre un 60% y un 70% menos para obtener resultados idénticos. El segundo seguirá llevándose sorpresas con sus facturas hasta que el próximo ajuste de tarifas obligue a afrontar este debate.

La cuestión no es si merece la pena invertir en agentes de IA, sino si su infraestructura los ejecuta a un coste operativo que permita que su caso de negocio sea realmente viable.

Empieza hoy

Empezar a crear agentes de IA para automatizar procesos

Únase a nuestra plataforma y empiece a crear agentes de IA para diversos tipos de automatizaciones.

Empieza hoy

Empezar a crear agentes de IA para automatizar procesos

Únase a nuestra plataforma y empiece a crear agentes de IA para diversos tipos de automatizaciones.