Tokens IA : comprendre le contexte et calculer le coût
Neaptide · 6 septembre 2026 · 6 min de lecture
Comprendre les tokens, la fenêtre de contexte et le coût d’une requête API. Un exemple chiffré inclut l’historique et les tentatives supplémentaires.
Dans cet article

Vous demandez simplement de corriger le dernier paragraphe, mais la consommation augmente. L’application a peut-être transmis aussi l’historique, un document et ses propres consignes. Votre dernière phrase ne représente donc qu’une partie de la requête.
Un token n’est pas un mot
Le token est une unité utilisée par le modèle pour traiter les données et produire sa réponse. Dans un texte, il peut correspondre à un caractère, un fragment de mot ou un mot entier. Il n’existe pas de conversion fixe : comptez votre texte avec un outil adapté au modèle choisi.
Ce qui doit tenir dans la fenêtre de contexte
La fenêtre de contexte limite le volume utilisable en une requête. OpenAI y inclut les tokens d’entrée, de sortie et de raisonnement. Vérifiez séparément la limite de contexte et celle de la réponse. Une grande fenêtre ne garantit pas une lecture sans erreur de chaque détail.

Dans cet exemple, nous réservons 600 tokens à la réponse. Si elle en utilise 300, cela ne signifie pas que les 600 ont été générés. Dans une API réelle, il faut aussi appliquer les règles des autres catégories, dont le raisonnement.
Ce que contient réellement l’entrée
- Les consignes de l’application et l’historique transmis.
- Le texte des documents, les extraits retrouvés et les résultats des outils.
- Les images et autres données, selon les règles du fournisseur.
Tout dépend de ce que l’application envoie. OpenAI précise que previous_response_id ne rend pas gratuits les tokens d’entrée des échanges précédents. Une courte relance peut donc mobiliser davantage de tokens qu’un premier message plus long.
Calculer un coût : l’exemple à 0,0048 dollar
Prenons des tarifs fictifs : 2 dollars par million de tokens d’entrée et 8 dollars par million de sortie. Ce ne sont pas des prix en vigueur. Le calcul exclut les outils, le cache et les autres frais.
| Catégorie | Tokens | Calcul | Coût, USD |
|---|---|---|---|
| Entrée | 1 200 | 1 200 × 2 / 1 000 000 | 0,0024 |
| Sortie | 300 | 300 × 8 / 1 000 000 | 0,0024 |
| Total | 1 500 | 0,0024 + 0,0024 | 0,0048 |
Mille requêtes identiques coûteraient 4,80 dollars. Trois tentatives consommant exactement les mêmes volumes reviendraient à 0,0144 dollar par tâche. En pratique, l’historique et les réponses changent : additionnez les consommations réelles, même pour les tentatives ratées.
Mesurer avant et après l’appel
- Avant l’envoi, comptez l’entrée complète avec l’outil du fournisseur.
- Après la réponse, consultez les informations de consommation renvoyées par l’API, notamment les champs usage. Ne demandez pas au modèle de deviner combien de tokens il a utilisés.
- Rapprochez les catégories des tarifs et des montants facturés. La réponse visible ne représente pas forcément toute la consommation.
- Regroupez les appels par tâche pour connaître le coût du résultat.
OpenAI propose une fonction de son API pour compter les tokens d’entrée avant l’envoi d’une requête. La documentation Gemini explique aussi ce comptage préalable et les données de consommation renvoyées avec la réponse. Vérifiez les champs disponibles dans votre version d’API et ce qu’ils incluent.
Réduire le superflu, préserver les exigences
Supprimez d’abord les doublons, les anciennes versions et les passages hors sujet. Demandez une sortie utile : cinq erreurs accompagnées de citations, plutôt qu’un résumé intégral. Conservez les contraintes, les exceptions et les sources.
Pour poursuivre une longue conversation dans un nouveau chat, préparez une synthèse des décisions, des contraintes, des questions en suspens et des liens vers les sources. Vérifiez-la à partir de la conversation d’origine. L’oubli d’une condition importante peut entraîner davantage de travail que la réduction du contexte n’en fait économiser.
Comparez le coût nécessaire pour obtenir un résultat validé, en incluant le temps de vérification et de correction. Un appel d’API peu coûteux peut laisser beaucoup de travail à la personne chargée de reprendre la réponse.