
Par Thomas Cohen, fondateur de Maestro
Abonnement, crédits, tokens : comprendre sa consommation IA
Pourquoi l’assistant et le fournisseur affichent-ils des chiffres différents ? Un guide pour lire les unités, vérifier les calculs et relier les chiffres à une séance de travail.
Votre assistant affiche des milliers de tokens, un pourcentage d’usage ou quelques centimes. Le fournisseur montre un autre montant. Avant de conclure que le compteur se trompe, vérifiez ce que chaque chiffre mesure : une réponse, une session, un compte, une période ou une facture. Ce guide vous aide à rapprocher ces informations sans mélanger leurs unités.
Nous suivrons un cas fictif : Nadia construit un outil de suivi des commandes pour son activité. Elle utilise un assistant IA depuis Maestro et veut comprendre une séance de travail. Les quantités, montants et situations de calcul ci-dessous sont inventés pour expliquer la méthode. Ce ne sont ni des factures clients ni des tarifs de Maestro ou d’un fournisseur.
Abonnement, API, crédits et tokens : quatre choses à séparer
L’abonnement est l’offre que vous avez souscrite. Il peut donner accès à des outils, des modèles et une quantité d’usage selon ses conditions. L’API est un moyen pour un logiciel de communiquer avec un service. Ce n’est pas un synonyme d’abonnement, ni la garantie que votre abonnement habituel paie cet usage.
Le crédit est une unité définie par une offre commerciale. Sa valeur et ses règles dépendent du service. Un crédit d’un outil ne se compare pas directement à celui d’un autre. Le token, ou jeton, est une unité de traitement du modèle : il ne correspond pas à une action terminée dans votre application.
Chez OpenAI, la facturation de ChatGPT et celle de l’API sont séparées. Les crédits d’usage ChatGPT ne sont pas des crédits API. Vérifiez l’offre et la connexion concernées avant d’interpréter un solde.
Identifier le compte et le relevé qui font référence
Commencez par retrouver le service qui porte la consommation. Pour Nadia, « j’ai payé de l’IA » n’est pas une information assez précise. Elle note le nom de l’assistant, le compte connecté, l’organisation éventuelle et le mode de connexion. Elle peut ensuite ouvrir le relevé correspondant, au lieu de chercher dans tous ses abonnements.
La documentation de Claude Code précise que le coût de session est une estimation et que la facturation de référence se consulte côté fournisseur. Pour un abonnement, le chiffre de coût de session ne représente pas nécessairement une somme supplémentaire à payer.
Chez Cursor, le suivi d’usage distingue usage inclus et dépenses à la demande. Chez Mistral, le rapport d’usage permet notamment de regarder la période, le modèle et l’espace de travail concernés.
- Relever le compte et l’organisation qui ont réellement exécuté la tâche.
- Identifier le service et l’offre auxquels la consommation est rattachée.
- Ouvrir l’historique d’usage correspondant, puis la facture lorsque vous cherchez un montant facturé.
- Noter la période, la devise et le caractère estimé ou définitif du chiffre.
Les pages des fournisseurs évoluent. Conservez avec votre relevé la date de consultation et le libellé de l’offre, sans recopier de clé API ni de mot de passe. Vous disposerez ainsi d’une explication vérifiable si l’affichage ou les conditions changent le mois suivant.
Comprendre ce qui entre, ce qui sort et ce qui est réutilisé
Un token n’est pas toujours un mot. Le découpage dépend notamment du texte, de la langue et du modèle. Certaines unités de raisonnement ne sont pas visibles dans la réponse, comme le précise la documentation d’OpenAI sur les tokens.
Pour vous orienter dans un relevé, distinguez ce que le modèle reçoit et ce qu’il produit. Dans notre exemple, Nadia écrit une demande courte, mais l’assistant peut aussi devoir traiter la règle des commandes, les fichiers concernés et les résultats de ses vérifications. La longueur du message de Nadia ne décrit donc pas toute la séance.
- Entrée : les éléments envoyés au modèle pour qu’il puisse travailler.
- Sortie : les éléments produits par le modèle, selon les catégories comptées par le fournisseur.
- Cache : certains éléments réutilisés, avec un traitement et un prix qui dépendent du service.
La documentation du cache d’Anthropic distingue notamment écriture et lecture du cache, avec leurs conditions propres. Un volume réutilisé ne doit donc pas être assimilé automatiquement à une entrée gratuite, ni ajouté sans vérifier le total auquel il appartient.
Lire un calcul complet avec des prix fictifs
Prenons une grille pédagogique inventée : 2 € pour un million de tokens d’entrée ordinaire, 0,20 € pour un million de tokens lus en cache et 8 € pour un million de tokens de sortie. Ces nombres servent uniquement à comprendre le calcul. Ils ne correspondent à aucune offre recommandée et n’intègrent aucune taxe ni autre service.
Une demande fictive utilise trois catégories distinctes : 50 000 tokens d’entrée ordinaire, 100 000 tokens lus en cache et 5 000 tokens de sortie. Pour chaque catégorie, on divise la quantité par un million, puis on multiplie par le tarif correspondant. On additionne ensuite les trois montants.
- Entrée ordinaire : 50 000 ÷ 1 000 000 × 2 € = 0,10 €.
- Lecture du cache : 100 000 ÷ 1 000 000 × 0,20 € = 0,02 €.
- Sortie : 5 000 ÷ 1 000 000 × 8 € = 0,04 €.
- Total de cette demande fictive : 0,16 €.
Une demande utilisateur peut déclencher plusieurs échanges
Si notre séance inventée contient six échanges strictement identiques à celui-ci, le total atteint 6 × 0,16 €, soit 0,96 €. Dans un travail réel, les quantités peuvent changer à chaque échange. Multiplier le prix du premier par le nombre de messages visibles ne permet donc pas de reconstituer automatiquement le montant final.
Le calcul devient différent si une ligne concerne l’écriture du cache, un autre modèle, un outil payant ou une autre unité. Vérifiez également si les prix sont donnés pour mille ou un million de tokens. Une erreur d’unité rend un calcul faux même lorsque les multiplications sont parfaitement réalisées.
Conservez la devise du relevé pendant le rapprochement. Si vous souhaitez ensuite convertir le résultat, indiquez séparément le taux et la date retenus. Mélanger un prix affiché en dollars et un paiement bancaire en euros dès la première comparaison rend l’écart plus difficile à expliquer.
Pourquoi l’outil et le fournisseur peuvent afficher autre chose
Deux chiffres peuvent être corrects tout en parlant de périmètres différents. L’un concerne la session ouverte ; l’autre additionne toutes les activités du compte. Un écran suit les dernières minutes, un autre le mois de facturation. Avant de chercher une erreur, alignez ces périmètres.
Dans Maestro, le suivi distingue le mode abonnement du mode API et utilise les informations remontées par l’assistant. Les détails disponibles dépendent donc de ce dernier. Une mesure encore absente ou ancienne ne prouve pas que le travail en cours ne consomme rien. Consultez également le relevé du fournisseur concerné.
- Période : la même heure de début, la même heure de fin et le même fuseau.
- Périmètre : la session, le projet, l’utilisateur ou toute l’organisation.
- Nature : estimation d’usage, coût enregistré, crédits consommés ou facture.
- Unité : monnaie, tokens, pourcentage ou crédits de la même offre.
Imaginons que Nadia lise 2,40 € pour une session et 3,10 € sur le compte dans une même période. L’écart fictif de 0,70 € peut venir d’un autre travail, mais ce n’est qu’une hypothèse. Elle cherche les lignes correspondantes avant de conclure. Une explication plausible n’est pas encore une réconciliation du relevé.
Regardez enfin la fraîcheur de la donnée : un total peut être mis à jour après la fin d’une opération. Notez l’heure de chaque capture et refaites la comparaison lorsque les données annoncées comme provisoires sont stabilisées. Ne relancez pas une tâche uniquement pour voir si le compteur bouge.
Avec un abonnement, ne pas convertir un pourcentage au hasard
Un pourcentage d’usage n’est pas automatiquement un pourcentage du prix de l’abonnement. Si une jauge indique 30 %, cela ne permet pas de calculer une dépense supplémentaire de 30 % du montant mensuel. Il faut savoir quelle allocation elle mesure et sur quelle période elle se renouvelle.
Dans le cas fictif de Nadia, une séance peut rester entièrement dans l’usage inclus. Elle consomme une partie d’un droit d’usage, sans créer nécessairement une nouvelle ligne à payer. Si l’offre autorise un dépassement payant, il faut regarder les réglages et le relevé correspondants, au lieu de déduire ce dépassement de la seule activité affichée.
Ne traitez pas non plus un équivalent calculé avec des tarifs API comme une facture d’abonnement. Cet équivalent peut servir à comparer des ordres de grandeur dans un protocole précis. Il ne remplace pas les conditions de l’offre et ne prouve pas la somme qui sera débitée.
Rapprocher une séance en six étapes
Pour le premier rapprochement, choisissez une séance courte dont vous connaissez l’objectif. Nadia retient la correction du calcul des commandes annulées. Elle évite d’additionner d’emblée plusieurs semaines, plusieurs assistants et plusieurs appareils. Un petit périmètre permet d’identifier les lignes sans inventer de correspondances.
- Écrire l’objectif de la séance et noter son début ainsi que sa fin.
- Relever l’assistant, le modèle connu, le compte et le mode de facturation.
- Conserver le compteur de l’outil avec sa date de dernière mesure si elle est indiquée.
- Ouvrir le relevé fournisseur avec les mêmes dates et le bon compte.
- Identifier les autres activités du compte, les catégories de coût et les arrondis possibles.
- Classer l’écart restant comme expliqué, partiellement expliqué ou à investiguer.
Supposons que les 0,70 € de l’exemple précédent correspondent finalement à une seconde séance, ouverte dans un autre outil. Nadia peut expliquer la différence sans modifier le premier compteur. Si aucune ligne ne correspond, elle conserve l’écart comme non résolu. Elle n’invente pas une « marge technique » pour faire tomber les totaux juste.
Pour demander de l’aide, préparez le nom de l’offre, la période, les montants, le modèle connu et des captures expurgées des informations sensibles. Un identifiant de requête peut aider lorsqu’il est disponible. Ne transmettez pas de clé, de données clients ou de contenu confidentiel simplement pour illustrer une différence de compteur.
Compter aussi les reprises et les essais sans résultat
Une tâche qui échoue peut tout de même avoir consommé du travail du modèle. La consommation ne mesure pas la qualité du résultat. Pour analyser une séance, gardez donc les essais abandonnés dans votre relevé, tout en les distinguant des résultats validés.
Dans un autre exemple fictif, Nadia lance six tentatives pour obtenir trois corrections vérifiées. Chaque tentative coûte ici 0,16 €, soit 0,96 € au total. Le coût moyen par correction vérifiée est donc de 0,32 €. Ne retenir que les trois tentatives réussies ferait disparaître la moitié du travail réellement consommé.
Ce chiffre seul reste incomplet. Une correction de libellé et une réparation d’un calcul important ne représentent pas le même résultat. Notez aussi le type de tâche, les vérifications réussies et le temps humain nécessaire. Vous pourrez alors comparer plusieurs séances semblables, sans transformer les moyennes en promesses.
Tenir un relevé utile sans devenir comptable de chaque token
Une ligne par séance suffit souvent pour commencer : date, objectif, assistant, compte, mesure disponible, résultat et explication d’un éventuel écart. Gardez le détail des tokens seulement lorsqu’il vous aide à comprendre une anomalie ou à comparer deux options dans les mêmes conditions.
Pour Nadia, la ligne utile pourrait être : « Commandes annulées ; règle corrigée ; trois vérifications réussies ; coût API rapproché ; vingt minutes de relecture. » Si le montant n’est pas disponible par tâche, elle le dit. Le relevé conserve ainsi le lien entre la consommation et ce qui a effectivement avancé.
Séparez ce suivi de la prévision du budget total d’une application. Hébergement, maintenance, services extérieurs et temps de l’équipe répondent à d’autres questions. Notre guide sur le budget de développement d’une application aide à examiner ces postes sans les confondre avec une séance d’IA.
Réduire les reprises sans appauvrir la demande
Pour améliorer votre consommation, cherchez d’abord le travail inutile : une règle jamais décidée, des corrections qui se contredisent ou une consigne relancée sans comprendre l’échec. Une demande plus courte n’est pas automatiquement meilleure. Retirer une contrainte essentielle peut provoquer davantage de reprises que la précision initiale n’aurait demandé de travail.
Préparez un résultat attendu, fournissez les éléments utiles et vérifiez une étape avant de demander la suivante. Pour choisir un moteur selon la tâche, consultez notre guide assistant et modèle IA dans Maestro. Une comparaison n’a de sens que si vous mesurez aussi la qualité et le travail restant pour vous.
Pour voir comment nous présentons des mesures avec leur périmètre, vous pouvez lire le relevé de nos essais d’agents. Il décrit une campagne précise. Ses montants ne fixent pas le prix de votre projet et ne remplacent pas vos propres relevés.
Commencez par une seule séance que vous pouvez expliquer de bout en bout. Maestro est gratuit pendant sa beta sur invitation pour Mac ; l’usage IA reste séparé. Vous pouvez découvrir Maestro et demander une invitation, puis garder ce réflexe : identifier l’unité, le compte et la période avant de juger un chiffre.