OpenAI annonce pour GPT-5.6 Sol un tarif API de 4 dollars par million de tokens d’entrée et 20 dollars par million de tokens de sortie en contexte court standard. Cette grille concerne l’usage développeur : elle ne doit pas être confondue avec le prix d’un abonnement ChatGPT. Le cache et les requêtes en contexte long sont facturés séparément.
Le prix de l’API GPT-5.6 Sol
Un token est une unité de texte traitée par le modèle : selon le contexte, il peut correspondre à un morceau de mot, à un mot ou à un signe de ponctuation. La facturation distingue les tokens envoyés au modèle — l’entrée — et ceux générés par le modèle — la sortie.
Pour le contexte court standard, GPT-5.6 Sol est donc affiché à 4 $ par million de tokens d’entrée et 20 $ par million de tokens de sortie. Les anciens tarifs indiqués étaient de 5 $ en entrée et 30 $ en sortie par million de tokens.
Le résultat n’est pas une remise uniforme appliquée à chaque facture. Une application qui génère beaucoup de texte ne verra pas la même économie qu’une autre qui envoie surtout de longs prompts et produit peu de sorties.
Contexte court, cache et contexte long : la grille complète
Le cache mérite une attention particulière. Une lecture d’entrée mise en cache correspond à des tokens déjà conservés pour être réutilisés ; une écriture du cache désigne l’opération qui les y place. Ces deux opérations ont leurs propres tarifs.
| Catégorie de requête | Entrée | Entrée en cache | Écriture du cache | Sortie |
| Contexte court standard | 4 $ / 1 million de tokens | 0,40 $ / 1 million de tokens | 5 $ / 1 million de tokens | 20 $ / 1 million de tokens |
| Contexte long | 8 $ / 1 million de tokens | 0,80 $ / 1 million de tokens | 10 $ / 1 million de tokens | 30 $ / 1 million de tokens |
La règle à retenir est simple : les tarifs de 4 $ et 20 $ ne s’appliquent pas au contexte long. Utiliser ces deux montants pour estimer une requête qui relève de cette seconde catégorie sous-évaluerait le coût.
Une baisse différente selon le trafic de l’application
En passant de 5 à 4 dollars, le tarif d’entrée baisse de 20 %. En passant de 30 à 20 dollars, le tarif de sortie baisse d’environ 33,3 %. Ces deux pourcentages sont exacts pour leurs catégories respectives, mais ils ne décrivent pas une économie globale identique pour toutes les applications.
Pour estimer une facture, il faut donc séparer au minimum :
- le nombre de tokens envoyés en entrée ;
- le nombre de tokens produits en sortie ;
- la part d’entrée réutilisée depuis le cache ;
- le type de contexte utilisé, court ou long.
Un service qui génère beaucoup de réponses longues profitera davantage de la baisse du tarif de sortie. À l’inverse, un outil qui transmet d’importants volumes de contexte devra surveiller le type de requête et la part effectivement mise en cache. Le prix par million de tokens est un repère utile, pas une facture préremplie.
API et abonnements ChatGPT ne jouent pas dans la même cour
La baisse annoncée concerne la facturation de l’API et l’usage développeur. Elle ne transforme pas les tarifs affichés pour les abonnements ChatGPT en une formule facturée au token, et un prix API plus bas ne permet pas à lui seul de déduire une évolution des limites d’un abonnement.
Autrement dit, un développeur qui intègre GPT-5.6 Sol dans une application doit regarder la consommation de tokens et les catégories de facturation ci-dessus. Un utilisateur de ChatGPT, lui, relève d’un autre système de produit et de limites. Mélanger les deux revient à comparer une facture de cloud avec un forfait grand public : même famille d’outils, logique comptable différente.
Jusqu’à quand le tarif promotionnel est-il indiqué ?
Le tarif de GPT-5.6 Sol est présenté comme promotionnel, avec une disponibilité indiquée au moins jusqu’au 21 novembre 2026. Cette date doit être lue comme une borne annoncée pour la promotion, pas comme une garantie permanente du prix de 4 $ et 20 $.
Pour un budget de production, le plus prudent est donc de modéliser séparément l’entrée, la sortie, le cache et le contexte long. La baisse rend GPT-5.6 Sol moins coûteux sur les catégories concernées, mais le montant réellement économisé dépendra toujours de la façon dont votre application consomme le modèle.