Facturation des tokens OpenAI : comment ça marche et comment l’estimer
- Chaque appel API OpenAI facture séparément les tokens d’entrée (prompt) et les tokens de sortie (réponse générée), à des tarifs différents selon le modèle.
- Les tokens de sortie coûtent 4 à 8 fois plus cher que les tokens d’entrée, car la génération est un processus séquentiel plus lourd en calcul.
- Le cache automatique des tokens répétés (system prompt, few-shot) peut réduire jusqu’à 90% le coût des tokens d’entrée déjà envoyés.
- La Batch API applique une remise de 50% sur l’entrée et la sortie pour les traitements qui n’ont pas besoin d’être instantanés.
- Selon le modèle choisi, le prix va de $0,10 à $30 par million de tokens en entrée, un écart qui peut multiplier une facture par 30 sur le même volume de requêtes.
La facturation des tokens OpenAI repose sur un principe simple : chaque requête API compte le nombre de tokens envoyés dans le prompt (tokens d’entrée) et le nombre de tokens générés dans la réponse (tokens de sortie), puis applique un tarif par million de tokens qui varie selon le modèle utilisé. Un token correspond en moyenne à 4 caractères ou aux trois quarts d’un mot. Concrètement, une requête sur GPT-5.4 mini avec 500 tokens en entrée et 300 en sortie coûte une fraction de centime, mais ce coût unitaire se multiplie vite à l’échelle : 10 000 requêtes quotidiennes du même profil reviennent à environ 518 dollars par mois. Comprendre les mécanismes de tarification (entrée/sortie, cache, batch) est donc essentiel pour dimensionner un produit SaaS avant de le mettre en production.
Qu’est-ce qu’un token et comment OpenAI le compte
Avant de parler prix, il faut comprendre l’unité de facturation elle-même. Un token n’est ni un mot ni un caractère : c’est un fragment de texte produit par le tokenizer d’OpenAI, qui découpe le texte en unités reconnues par le modèle. Un mot court et courant comme « chat » forme souvent un seul token, tandis qu’un mot long ou rare peut en occuper deux ou trois. Les espaces, la ponctuation et même les fragments de mots comptent dans le total. En anglais, la règle de base est qu’un token équivaut à peu près à 4 caractères, soit environ 3/4 de mot. En français, la présence d’accents, de conjugaisons et de mots composés fait généralement grimper ce ratio, si bien qu’un texte français consomme en moyenne 15 à 20% de tokens en plus que son équivalent anglais pour un même sens.
Ce détail a une conséquence directe sur la facturation : traduire un prompt système en anglais avant de l’envoyer à l’API peut réduire le nombre de tokens d’entrée facturés, sans changer le contenu fonctionnel. Le total facturé pour une requête correspond toujours à la somme des tokens du prompt (system, user, historique de conversation, définitions d’outils) et des tokens générés dans la réponse. C’est cette somme, appelée « total tokens » dans les objets usage retournés par l’API, qui sert de base à tous les calculs de coût. Chaque modèle possède aussi une fenêtre de contexte maximale (le nombre total de tokens qu’il peut traiter en une seule fois, entrée + sortie), qui va de 128 000 tokens pour les modèles les plus anciens jusqu’à plus d’un million pour les familles GPT-4.1 et GPT-5.4.
Tokens d’entrée vs tokens de sortie : pourquoi le prix diffère
La différence de prix entre entrée et sortie n’est pas une décision commerciale arbitraire, elle reflète directement la manière dont l’inférence fonctionne sur les serveurs d’OpenAI. Quand une requête arrive, le modèle traite tous les tokens du prompt en une seule passe parallèle appelée « prefill » : le GPU reste occupé à pleine capacité, ce qui rend le traitement de chaque token d’entrée relativement bon marché. La génération de la réponse, en revanche, se fait token par token, de façon séquentielle (chaque nouveau token dépend de tous les précédents), ce qui sollicite le matériel de manière beaucoup moins efficace et justifie un tarif nettement plus élevé.
L’écart se voit concrètement dans les grilles tarifaires : sur GPT-5.4, l’entrée coûte $2,50 par million de tokens contre $15,00 pour la sortie, soit un rapport de 1 à 6. Un exemple chiffré illustre bien l’impact sur la facture globale : un agent de code qui traite 20 000 tâches, chacune consommant 3 000 tokens d’entrée et générant 4 000 tokens de sortie, dépense 150 dollars sur l’entrée (60 millions de tokens) et 1 200 dollars sur la sortie (80 millions de tokens). Le poste sortie représente ainsi 89% de la facture totale de 1 350 dollars, alors qu’il ne représente qu’un peu plus de la moitié du volume de tokens traités. Pour un produit SaaS qui génère de longues réponses (rapports, résumés, code), c’est le levier de coût le plus déterminant, bien avant le volume brut de requêtes.
Grille tarifaire des modèles OpenAI en 2026
Les tarifs varient fortement selon le modèle choisi, avec un écart qui peut dépasser un facteur 50 entre le modèle le plus économique et le modèle le plus performant. Voici les ordres de grandeur observés en 2026, par million de tokens :
| Modèle | Entrée | Entrée en cache | Sortie |
|---|---|---|---|
| GPT-5.5 | $5,00 | $0,50 | $30,00 |
| GPT-5.4 | $2,50 | $0,25 | $15,00 |
| GPT-5.4 mini | $0,75 | $0,075 | $4,50 |
| GPT-4.1 | $2,00 | $0,50 | $8,00 |
| GPT-4.1 mini | ~$0,40 | ~$0,10 | ~$1,60 |
| GPT-4.1 nano | $0,10 | $0,025 | $0,40 |
| o3 (raisonnement) | $2,00 | $0,50 | $8,00 |
| o3-Pro | $20,00 | $5,00 | $80,00 |
Cette dispersion illustre un principe clé pour un produit SaaS : le choix du modèle a souvent plus d’impact sur la facture que l’optimisation du prompt. Passer d’un modèle « standard » à sa variante « nano » ou « mini » peut diviser le coût par 10 ou 12 sur l’entrée, à condition que la tâche (classification, extraction, résumé court) ne nécessite pas les capacités de raisonnement des modèles les plus avancés. Les modèles de raisonnement de la famille o3, conçus pour les tâches complexes (mathématiques, code, planification), utilisent en interne des tokens supplémentaires pour « réfléchir » avant de répondre, ce qui gonfle le nombre de tokens de sortie facturés même si la réponse visible reste courte.
Le cache de tokens : réduire la facture sans changer de code
Le cache de tokens est le levier d’optimisation le plus simple à activer, car il fonctionne automatiquement dès que certaines conditions sont réunies. Lorsqu’une requête réutilise un préfixe identique à une requête précédente récente (typiquement le system prompt, des exemples few-shot ou le début d’une longue conversation), OpenAI détecte cette portion commune et applique un tarif réduit sur les tokens correspondants, appelés « cached tokens ». Le rabais est substantiel : environ 90% de réduction par rapport au tarif d’entrée standard, comme le montre l’écart entre $5,00 et $0,50 par million de tokens sur GPT-5.5.
Ce mécanisme profite particulièrement aux applications qui envoient un system prompt volumineux à chaque appel (agents avec de longues instructions, définitions d’outils, contexte métier fixe), puisque cette partie fixe du prompt n’est facturée au tarif plein qu’une seule fois puis bénéficie du tarif réduit sur les appels suivants, tant que le préfixe reste identique. Sur Azure OpenAI, la logique diffère légèrement dans son affichage : la Realtime API expose des métriques détaillées d’usage (cached_tokens, input_token_details), mais seules les métriques du portail Azure (processed_prompt_tokens, generated_completion_tokens) reflètent les tokens réellement facturés, en excluant ceux servis depuis le cache. Un bon réflexe pour une équipe technique est de structurer ses prompts avec la partie stable (instructions, contexte système) en premier et la partie variable (question de l’utilisateur) en dernier, afin de maximiser le taux de correspondance du cache d’un appel à l’autre.
Tokens et images : le cas particulier de la vision
Les modèles multimodaux facturent aussi les images en tokens, selon une logique différente du texte. Une image envoyée à l’API est découpée en tuiles de 512×512 pixels, chaque tuile consommant un nombre fixe de tokens (environ 258 tokens par tuile). Une image en haute résolution peut ainsi générer jusqu’à 9 tuiles, pour un coût maximal proche de 2 322 tokens, tandis qu’une image standard au format 2:3 consomme en moyenne autour de 1 300 tokens. Ce mode de calcul explique pourquoi certains développeurs sont surpris par des factures d’usage vision : une analyse d’image en détail « high » peut représenter plusieurs dizaines de milliers de tokens facturés pour une seule requête, bien au-delà de ce que suggère l’intuition d’un simple fichier image.
Pour un produit SaaS qui traite des images en masse (OCR, modération de contenu, extraction de données visuelles), le choix du niveau de détail (« low » vs « high ») a un impact direct et significatif sur la facture, car le mode « low » applique un coût fixe réduit indépendant de la résolution, tandis que le mode « high » facture proportionnellement au nombre de tuiles. Traiter 1 000 images en détail réduit peut coûter de l’ordre de 20 centimes de dollar sur un modèle économique, contre plusieurs dollars en détail maximal sur un modèle premium. Il vaut donc mieux réserver le détail « high » aux cas où la précision fine est réellement nécessaire (lecture de petits caractères, détails visuels critiques) plutôt que de l’appliquer par défaut à tous les flux.
Batch API : une remise de 50% pour les traitements différés
Pour les charges de travail qui n’exigent pas de réponse instantanée, OpenAI propose une Batch API qui applique une remise de 50% sur les tokens d’entrée comme de sortie, en échange d’un délai de traitement pouvant aller jusqu’à 24 heures. Le principe est simple : au lieu d’envoyer les requêtes une par une en temps réel, l’application regroupe un lot de requêtes dans un fichier, le soumet à l’API, puis récupère les résultats une fois le traitement terminé.
Ce mode convient particulièrement bien à des cas d’usage fréquents dans un contexte SaaS : régénération d’embeddings sur une base de contenus existante, classification en masse de tickets support, génération de résumés pour un catalogue de documents, ou réentraînement périodique de modèles de recommandation. Pour une équipe qui traite déjà de gros volumes de tokens de façon asynchrone (par exemple un job nocturne de traitement de données), basculer vers la Batch API revient à diviser la facture correspondante par deux sans changer la logique métier, seulement l’orchestration technique de l’appel. La contrepartie est l’absence de garantie de latence : ce choix n’est pertinent que pour les flux qui tolèrent un délai, jamais pour les fonctionnalités orientées utilisateur final en temps réel comme un chatbot ou un assistant interactif.
Calculer sa facture : méthode et exemple concret
Le calcul du coût d’une requête suit une formule directe : (tokens d’entrée / 1 000 000 × prix d’entrée) + (tokens de sortie / 1 000 000 × prix de sortie), en ajoutant éventuellement la part de tokens mis en cache au tarif réduit. Pour anticiper une facture mensuelle, il faut multiplier ce coût unitaire par le volume de requêtes attendu.
Prenons un cas représentatif d’un produit SaaS B2B : une équipe route 10 000 requêtes de support quotidiennes vers GPT-5.4 mini, avec en moyenne 500 tokens d’entrée et 300 tokens de sortie par requête. Sur un mois de 30 jours, cela représente 150 millions de tokens d’entrée et 90 millions de tokens de sortie. Au tarif de $0,75 par million en entrée, le coût d’entrée atteint 112,50 dollars ; au tarif de $4,50 par million en sortie, le coût de sortie atteint 405 dollars. Le total mensuel avoisine ainsi 518 dollars, un ordre de grandeur cohérent avec les données observées sur ce type de workload en 2026. Ce même volume traité avec le modèle phare GPT-5.5 (à $5,00/$30,00 par million) multiplierait la facture par un facteur proche de 6, sans amélioration perceptible pour une tâche de support standard. Cet exercice de calcul, réalisé avant la mise en production, permet d’éviter les mauvaises surprises et de choisir le modèle le plus adapté au rapport qualité/prix réellement nécessaire pour chaque fonctionnalité.
Réduire sa facture de tokens : les leviers concrets
Plusieurs actions permettent de réduire le coût de tokens sans dégrader l’expérience produit. Le premier levier, et souvent le plus rentable, consiste à choisir la taille de modèle strictement nécessaire à la tâche : une fonctionnalité de classification ou de tagging n’a généralement pas besoin d’un modèle flagship, un modèle « mini » ou « nano » suffit et coûte 10 à 50 fois moins cher. Le deuxième levier est la structuration des prompts pour maximiser le taux de cache, en plaçant les instructions fixes avant le contenu variable et en évitant de reformuler inutilement le system prompt à chaque appel.
Le troisième levier consiste à limiter explicitement la longueur de la réponse générée via le paramètre de tokens maximum, puisque c’est le poste de sortie qui pèse le plus lourd dans la facture. Le quatrième levier, pour les traitements asynchrones, est de basculer vers la Batch API dès que la latence n’est pas critique. Enfin, le suivi actif de la consommation via le tableau de bord d’usage d’OpenAI permet de repérer rapidement les dérives : un prompt système qui grossit avec le temps, une boucle de relance mal gérée, ou un modèle mal choisi pour une fonctionnalité à fort volume. Pour une startup, mettre en place des alertes de budget dès le lancement d’une fonctionnalité IA reste la protection la plus simple contre une facture qui grimpe plus vite que prévu.
Combien coûte 1 million de tokens avec GPT-5.5 ?
En 2026, GPT-5.5 facture environ $5,00 par million de tokens en entrée standard, $0,50 en entrée mise en cache, et $30,00 par million de tokens en sortie.
Pourquoi les tokens de sortie coûtent-ils plus cher que les tokens d’entrée ?
Les tokens d’entrée sont traités en une seule passe parallèle (prefill), rapide et efficace sur GPU, tandis que les tokens de sortie sont générés un par un de façon séquentielle, ce qui coûte plus cher en calcul et se répercute sur le tarif.
Qu’est-ce qu’un token en pratique ?
Un token est un fragment de texte, pas un mot entier : en anglais, on compte en moyenne 4 caractères ou 3/4 de mot par token ; en français, ce ratio est légèrement plus élevé à cause des accents et des conjugaisons.
Comment fonctionne le cache de tokens d’OpenAI ?
Le cache s’active automatiquement quand une requête réutilise un préfixe identique à un appel précédent récent (system prompt, contexte fixe), et applique un tarif réduit d’environ 90% sur les tokens correspondants.
La Batch API convient-elle à toutes les applications ?
Non, elle ne convient qu’aux traitements qui tolèrent un délai pouvant aller jusqu’à 24 heures, comme les tâches de fond, en échange d’une remise de 50% sur l’entrée et la sortie.
Comment suivre sa consommation de tokens en temps réel ?
Le tableau de bord d’usage d’OpenAI et les champs usage retournés par chaque appel API permettent de suivre le détail des tokens d’entrée, de sortie et mis en cache, et de configurer des alertes de budget.
Les images consomment-elles des tokens comme du texte ?
Oui, chaque image est découpée en tuiles qui consomment environ 258 tokens chacune, pour un total pouvant atteindre plus de 2 000 tokens en détail maximal, ou un coût fixe réduit en détail minimal.
Sources
- OpenAI API Pricing In 2026: Every Model Compared (CloudZero)
- OpenAI API Pricing (Updated 2026) – All Models & Token Costs (PricePerToken)
- OpenAI Pricing 2026: Plans, Spend Data, and How to Pay Less (SpendHound)
- Input vs Output Token Pricing: Why Output Costs More (Amnic)
- What are tokens and how to count them? (OpenAI Help Center)
8 erreurs qui explosent votre facture IA : comment les corriger
Cache de prompts : économiser jusqu’à 90% des tokens | Guide complet
Réduire coût API IA : Guide complet sans perdre en qualité
Créer une chaîne de production de contenu IA – Guide complet
Automatiser la gestion de ses emails avec l’IA | Guide 2026