
Par Thomas Cohen, fondateur de Maestro
Le token baisse, la facture monte : le coût d'agents IA, et comment le compter
Gartner annonce un coût d'inférence par chaîne d'agents multiplié par plus de cinq d'ici 2028, pendant que le prix du token s'effondre. Les deux courbes vont ensemble : un agent qui planifie consomme entre 5 et 30 fois plus de jetons qu'un simple assistant de conversation. Ce qu'il faut regarder sur votre propre facture.
Le coût des agents IA sur votre facture monte pendant que le prix unitaire baisse. Gartner prévoit que le coût d'inférence par chaîne d'agents sera multiplié par plus de cinq d'ici 2028, alors que le prix du token doit chuter de 95 % d'ici 2030 (Gartner, 17 août 2026, repris par Computerworld le même jour).
Pourquoi les deux courbes vont dans le même sens
Un assistant de conversation reçoit une question et répond. Un agent lit un document, choisit une action, l'exécute, relit le résultat, se corrige, recommence. Chaque boucle repasse le contexte entier. Les analystes Will Sommer et Sabine Zimmerhansl, cités par Computerworld, chiffrent l'écart : un agent capable de raisonner coûte jusqu'à 150 fois plus qu'un assistant basique sur une seule tâche, consomme 5 à 30 fois plus de tokens, et son fournisseur facture le token de planification 8 à 10 fois le tarif d'une tâche simple. La baisse du prix unitaire est réelle ; le nombre d'unités par travail rendu croît plus vite qu'elle.
Ce que voit l'utilisateur, à l'autre bout
Un utilisateur d'une plateforme de génération d'applications a fait ses comptes et les a publiés sur Reddit (r/lovable, septembre 2026) : 1 364 crédits consommés en trente jours, 2 389 sur trois mois, soit 57 % de son trimestre sur le dernier mois. Il a mesuré vingt échanges, 281,4 crédits au total, de 8,9 à 21,1 crédits l'unité, une moyenne de 14,07. Vingt interactions avaient donc mangé 70 % de son allocation mensuelle de 400 crédits. Sa question porte moins sur le montant que sur l'aveuglement : rien dans l'interface ne lui disait ce qui consommait.
L'industrie commence à outiller le problème par le plafond plutôt que par l'explication. Vercel a lancé le 31 août 2026 des budgets de dépense par utilisateur sur sa passerelle IA, qui refusent les nouvelles requêtes une fois la limite atteinte, avec des alertes à 50 %, 75 % et 100 % du budget et un rôle dédié pour l'administrer. Le plafond est devenu une fonctionnalité vendable, ce qui en dit long sur la fréquence des mauvaises surprises.
Compter juste, y compris ce qui est réutilisé
Notre propre compteur de jetons a été faux jusqu'en août 2026. Il ignorait le cache, cette partie du contexte que le fournisseur conserve d'un échange à l'autre et facture à un tarif différent. Un utilisateur voyait donc un chiffre plus bas que sa facture, ce qui est la pire des erreurs pour un compteur : il rassurait. Nous l'avons refait en août 2026 pour compter le cache, et depuis, ce que l'écran affiche correspond à ce que le fournisseur prélève. Un compteur qui sous-estime vaut moins qu'un compteur absent, parce qu'il empêche de poser la question. La leçon vaut au-delà de notre cas : avant de faire confiance à un chiffre affiché dans une interface, demandez à l'éditeur ce qu'il compte et ce qu'il ignore. Le cache, les tentatives ratées et les relectures automatiques sont les trois postes que les compteurs oublient le plus souvent.
Les trois plafonds à exiger avant de lancer une chaîne d'agents
Le premier est une estimation avant le lancement, avec un multiplicateur qui borne la dépense : chez nous, un chantier s'arrête à trois fois son estimation. Le deuxième est un budget mensuel sur l'ensemble des projets, indépendant de ce qui se passe dans chacun. Le troisième est une limite au nombre de tentatives : quand une étape échoue à sa vérification, deux réparations sont tentées, puis la décision revient à vous plutôt que de laisser la boucle tourner. Nous publions nos coûts réels, ligne par ligne, y compris le budget de réparation avant qu'il ne soit plafonné.
Lire votre facture ce soir
Ouvrez la console de votre fournisseur et cherchez trois choses : le coût de vos sept derniers jours, la part des tokens d'entrée par rapport à la sortie, et l'existence d'un plafond avec l'adresse qui reçoit l'alerte. Si le coût des sept derniers jours dépasse celui du mois précédent divisé par quatre, quelque chose a changé dans votre usage et personne ne vous l'a dit. Cherchez ce qui a changé du côté de vos habitudes avant d'accuser le fournisseur : une conversation plus longue, un document plus gros joint à chaque échange, une tâche relancée trois fois suffisent à expliquer un doublement. Notre lecture de la baisse de prix cachée dans le cache explique pourquoi la ligne d'entrée mérite votre attention en premier, et la maintenance annuelle reste la dépense que ces consoles ne montreront jamais.