Aller au contenu
Neaptidestudio
blog

Tokens IA : comprendre le contexte et calculer le coût

Neaptide · 6 septembre 2026 · 6 min de lecture

Comprendre les tokens, la fenêtre de contexte et le coût d’une requête API. Un exemple chiffré inclut l’historique et les tentatives supplémentaires.

Dans cet article
De petits fragments de papier traversent une fenêtre transparente à côté de quelques pièces.

Vous demandez simplement de corriger le dernier paragraphe, mais la consommation augmente. L’application a peut-être transmis aussi l’historique, un document et ses propres consignes. Votre dernière phrase ne représente donc qu’une partie de la requête.

Un token n’est pas un mot

Le token est une unité utilisée par le modèle pour traiter les données et produire sa réponse. Dans un texte, il peut correspondre à un caractère, un fragment de mot ou un mot entier. Il n’existe pas de conversion fixe : comptez votre texte avec un outil adapté au modèle choisi.

Ce qui doit tenir dans la fenêtre de contexte

La fenêtre de contexte limite le volume utilisable en une requête. OpenAI y inclut les tokens d’entrée, de sortie et de raisonnement. Vérifiez séparément la limite de contexte et celle de la réponse. Une grande fenêtre ne garantit pas une lecture sans erreur de chaque détail.

Fenêtre fictive de 2000 tokens : entrée 1200, réserve de sortie 600, marge 200
Schéma pédagogique, sans rapport avec les limites d’un modèle précis.

Dans cet exemple, nous réservons 600 tokens à la réponse. Si elle en utilise 300, cela ne signifie pas que les 600 ont été générés. Dans une API réelle, il faut aussi appliquer les règles des autres catégories, dont le raisonnement.

Ce que contient réellement l’entrée

  • Les consignes de l’application et l’historique transmis.
  • Le texte des documents, les extraits retrouvés et les résultats des outils.
  • Les images et autres données, selon les règles du fournisseur.

Tout dépend de ce que l’application envoie. OpenAI précise que previous_response_id ne rend pas gratuits les tokens d’entrée des échanges précédents. Une courte relance peut donc mobiliser davantage de tokens qu’un premier message plus long.

Calculer un coût : l’exemple à 0,0048 dollar

Prenons des tarifs fictifs : 2 dollars par million de tokens d’entrée et 8 dollars par million de sortie. Ce ne sont pas des prix en vigueur. Le calcul exclut les outils, le cache et les autres frais.

Une requête fictive
CatégorieTokensCalculCoût, USD
Entrée1 2001 200 × 2 / 1 000 0000,0024
Sortie300300 × 8 / 1 000 0000,0024
Total1 5000,0024 + 0,00240,0048

Mille requêtes identiques coûteraient 4,80 dollars. Trois tentatives consommant exactement les mêmes volumes reviendraient à 0,0144 dollar par tâche. En pratique, l’historique et les réponses changent : additionnez les consommations réelles, même pour les tentatives ratées.

Mesurer avant et après l’appel

  1. Avant l’envoi, comptez l’entrée complète avec l’outil du fournisseur.
  2. Après la réponse, consultez les informations de consommation renvoyées par l’API, notamment les champs usage. Ne demandez pas au modèle de deviner combien de tokens il a utilisés.
  3. Rapprochez les catégories des tarifs et des montants facturés. La réponse visible ne représente pas forcément toute la consommation.
  4. Regroupez les appels par tâche pour connaître le coût du résultat.

OpenAI propose une fonction de son API pour compter les tokens d’entrée avant l’envoi d’une requête. La documentation Gemini explique aussi ce comptage préalable et les données de consommation renvoyées avec la réponse. Vérifiez les champs disponibles dans votre version d’API et ce qu’ils incluent.

Réduire le superflu, préserver les exigences

Supprimez d’abord les doublons, les anciennes versions et les passages hors sujet. Demandez une sortie utile : cinq erreurs accompagnées de citations, plutôt qu’un résumé intégral. Conservez les contraintes, les exceptions et les sources.

Pour poursuivre une longue conversation dans un nouveau chat, préparez une synthèse des décisions, des contraintes, des questions en suspens et des liens vers les sources. Vérifiez-la à partir de la conversation d’origine. L’oubli d’une condition importante peut entraîner davantage de travail que la réduction du contexte n’en fait économiser.

Comparez le coût nécessaire pour obtenir un résultat validé, en incluant le temps de vérification et de correction. Un appel d’API peu coûteux peut laisser beaucoup de travail à la personne chargée de reprendre la réponse.

faq

L'essentiel en bref

Combien de tokens compte un mot ?

Il n’y a pas de rapport fixe. Utilisez le tokenizer du modèle sur votre texte réel.

Le contexte correspond-il au quota mensuel ?

Non. Il concerne une requête ; les quotas d’abonnement et de fréquence sont distincts.

Une nouvelle conversation coûte-t-elle moins cher ?

Le coût peut diminuer si l’application envoie moins de données. Il faut toutefois fournir de nouveau les informations indispensables : un contexte incomplet peut provoquer des erreurs et de nouvelles tentatives.

Le nombre de pages suffit-il pour un PDF ?

Non. Le contenu, le traitement du fichier et les règles applicables aux images influencent le comptage.