
Por Thomas Cohen, fundador de Maestro
El token baja, la factura sube: el costo de los agentes de IA y cómo contarlo
Gartner anuncia que el costo de inferencia por cadena de agentes se multiplicará por más de cinco de aquí a 2028, mientras el precio del token se desploma. Las dos curvas van juntas: un agente que planifica consume entre 5 y 30 veces más tokens que un simple asistente conversacional. Lo que debes mirar en tu propia factura.
El costo de los agentes de IA en tu factura sube mientras baja el precio unitario. Gartner prevé que el costo de inferencia por cadena de agentes se multiplicará por más de cinco de aquí a 2028, mientras el precio del token debería caer un 95 % de aquí a 2030 (Gartner, 17 de agosto de 2026, recogido por Computerworld ese mismo día).
Por qué ambas curvas van en el mismo sentido
Un asistente conversacional recibe una pregunta y responde. Un agente lee un documento, elige una acción, la ejecuta, relee el resultado, se corrige y vuelve a empezar. Cada ciclo vuelve a pasar el contexto completo. Los analistas Will Sommer y Sabine Zimmerhansl, citados por Computerworld, cuantifican la diferencia: un agente capaz de razonar cuesta hasta 150 veces más que un asistente básico en una sola tarea, consume entre 5 y 30 veces más tokens y su proveedor cobra el token de planificación entre 8 y 10 veces la tarifa de una tarea sencilla. La caída del precio unitario es real; el número de unidades por trabajo entregado crece más rápido.
Lo que ve el usuario, al otro extremo
Un usuario de una plataforma de generación de aplicaciones hizo cuentas y las publicó en Reddit (r/lovable, septiembre de 2026): 1 364 créditos consumidos en treinta días, 2 389 en tres meses, es decir, el 57 % de su trimestre en el último mes. Midió veinte intercambios, 281,4 créditos en total, de 8,9 a 21,1 créditos cada uno, con una media de 14,07. Veinte interacciones se habían comido, por tanto, el 70 % de su asignación mensual de 400 créditos. Su pregunta se refiere menos al importe que a la falta de visibilidad: nada en la interfaz le decía qué consumía.
La industria empieza a abordar el problema mediante límites en lugar de explicaciones. Vercel lanzó el 31 de agosto de 2026 presupuestos de gasto por usuario en su pasarela de IA, que rechazan nuevas solicitudes una vez alcanzado el límite, con alertas al 50 %, 75 % y 100 % del presupuesto y un rol específico para administrarlo. El límite se ha convertido en una función vendible, lo que dice mucho sobre la frecuencia de las sorpresas desagradables.
Contar bien, incluido lo que se reutiliza
Nuestro propio contador de tokens estuvo equivocado hasta agosto de 2026. Ignoraba la caché, esa parte del contexto que el proveedor conserva entre intercambios y factura a una tarifa distinta. El usuario veía, por tanto, una cifra inferior a su factura, que es el peor error de un contador: tranquilizaba. Lo rehímos en agosto de 2026 para contar la caché y, desde entonces, lo que muestra la pantalla corresponde a lo que cobra el proveedor. Un contador que subestima vale menos que uno ausente, porque impide hacerse la pregunta. La lección va más allá de nuestro caso: antes de confiar en una cifra mostrada en una interfaz, pregunta al proveedor qué cuenta y qué ignora. La caché, los intentos fallidos y las revisiones automáticas son las tres partidas que más suelen olvidar los contadores.
Los tres límites que debes exigir antes de lanzar una cadena de agentes
El primero es una estimación antes del lanzamiento, con un multiplicador que limite el gasto: en nuestro caso, un trabajo se detiene al alcanzar tres veces su estimación. El segundo es un presupuesto mensual para el conjunto de proyectos, independiente de lo que ocurra en cada uno. El tercero es un límite al número de intentos: cuando una etapa falla su verificación, se intentan dos reparaciones y después la decisión vuelve a ti, en lugar de dejar que el ciclo continúe. Publicamos nuestros costos reales, línea por línea, incluido el presupuesto de reparación antes de que tuviera un límite.
Leer tu factura esta noche
Abre la consola de tu proveedor y busca tres cosas: el costo de los últimos siete días, la proporción de tokens de entrada frente a los de salida y la existencia de un límite con la dirección que recibe la alerta. Si el costo de los últimos siete días supera el del mes anterior dividido entre cuatro, algo ha cambiado en tu uso y nadie te lo ha dicho. Busca qué ha cambiado en tus hábitos antes de acusar al proveedor: una conversación más larga, un documento más grande adjunto a cada intercambio o una tarea ejecutada tres veces bastan para explicar una duplicación. Nuestra lectura de la bajada de precio escondida en la caché explica por qué la línea de entrada merece tu atención primero, y el mantenimiento anual sigue siendo el gasto que esas consolas nunca mostrarán.