OpenAI casse les prix de GPT-5.6 : Luna baisse de 80 %, Terra de 20 % et Sol jusqu’à 33 %
OpenAI vient de réduire le prix de toute la famille GPT-5.6. Luna tombe à 0,20 dollar par million de tokens en entrée et 1,20 dollar en sortie. Terra passe à 2 et 12 dollars. Sol coûte désormais 4 et 20 dollars. Pour les applications qui traitent des milliers de requêtes, la décision importante n’est toutefois pas de remplacer tous les modèles par le moins cher : elle consiste à envoyer chaque tâche au niveau d’intelligence réellement nécessaire.
La baisse la plus spectaculaire concerne GPT-5.6 Luna : 80 % sur l’entrée comme sur la sortie. OpenAI présente ce modèle comme son option destinée aux volumes importants et aux budgets contraints. Terra baisse de 20 % et reste positionné comme le compromis entre intelligence et coût. Sol conserve le rôle de modèle principal pour le raisonnement complexe et le code, avec une réduction de 20 % sur l’entrée et de 33 % sur la sortie.
Les nouveaux prix de GPT-5.6 Luna, Terra et Sol
| Modèle | Ancien tarif entrée / sortie | Nouveau tarif entrée / sortie | Baisse |
|---|---|---|---|
| GPT-5.6 Luna | 1 $ / 6 $ | 0,20 $ / 1,20 $ | 80 % |
| GPT-5.6 Terra | 2,50 $ / 15 $ | 2 $ / 12 $ | 20 % |
| GPT-5.6 Sol | 5 $ / 30 $ | 4 $ / 20 $ | 20 % en entrée, 33 % en sortie |
Les tarifs actuels figurent dans la documentation officielle des modèles OpenAI. La page développeurs annonce explicitement une baisse de 80 % pour Luna et de 20 % pour Terra. Pour Sol, la fiche du modèle donne le détail des deux composantes.
Attention au caractère promotionnel de Sol : la fiche officielle de GPT-5.6 Sol indique que son prix de 4 dollars en entrée et 20 dollars en sortie est disponible au moins jusqu’au 21 novembre 2026. Une application dont le budget dépend de ce tarif doit donc prévoir un scénario de réévaluation avant cette date.
Ce que la baisse change réellement sur une facture mensuelle
Les pourcentages sont parlants, mais une simulation permet de mesurer l’effet sur un produit. Prenons une application qui consomme chaque mois 100 millions de tokens entrants et 20 millions de tokens sortants. Pour isoler l’effet du nouveau tarif, le calcul suivant n’intègre ni cache, ni appel d’outil, ni contexte supérieur à 272 000 tokens.
| Modèle | Avant | Maintenant | Économie mensuelle |
|---|---|---|---|
| GPT-5.6 Luna | 220 $ | 44 $ | 176 $ |
| GPT-5.6 Terra | 550 $ | 440 $ | 110 $ |
| GPT-5.6 Sol | 1 100 $ | 800 $ | 300 $ |
Luna devient ici vingt fois moins cher que Sol. Cette comparaison ne signifie pas qu’il produit la même qualité sur toutes les tâches. Elle montre plutôt le prix d’un mauvais routage : employer le modèle le plus puissant pour catégoriser un ticket, extraire trois champs ou reformuler une phrase peut coûter beaucoup plus cher sans créer de valeur mesurable.
Nous avions déjà comparé GPT-5.6 Sol, Terra et Luna et le risque de multiplier sa facture en choisissant le mauvais modèle. La baisse renforce cette logique : le modèle économique d’une application dépend désormais autant de son routeur que du tarif affiché sur la fiche produit.
Luna en premier, Terra en renfort : une bonne stratégie ?
Oui, à condition de transformer cette intuition en règle testée. GPT-5.6 Luna est conçu pour les charges sensibles au coût et à fort volume. Il peut devenir le candidat par défaut pour les résumés courts, les classifications, l’extraction structurée, la traduction simple, les réponses standardisées ou les reformulations. Terra convient davantage aux documents structurés, aux analyses comportant plusieurs contraintes et aux tâches qui demandent plus de jugement.
Sol doit rester disponible pour les cas où une erreur coûte réellement plus cher que les tokens : résolution d’un problème complexe, débogage difficile, architecture, analyse à fort enjeu ou tâche que les modèles inférieurs échouent régulièrement à terminer. OpenAI recommande d’ailleurs Sol pour le raisonnement complexe et le code, Terra pour l’équilibre entre intelligence et coût, et Luna pour les volumes économiques.

Un routeur à trois niveaux plus utile qu’un modèle unique
Une première version peut rester très simple. Chaque requête reçoit une catégorie, un niveau de risque et un seuil de complexité. Le système tente Luna pour les opérations répétitives. Il utilise Terra lorsqu’une réponse doit respecter plusieurs contraintes ou synthétiser davantage de contexte. Il réserve Sol aux tâches difficiles ou à une seconde tentative lorsque les contrôles automatiques échouent.
- Classer la requête sans analyser son contenu sensible : extraction, rédaction, décision, code, support ou recherche.
- Définir un niveau de risque : une suggestion interne n’a pas les mêmes conséquences qu’un calcul financier transmis à un client.
- Fixer un test de réussite : schéma JSON valide, champs obligatoires présents, tests exécutables, score d’évaluation ou validation humaine.
- Escalader uniquement en cas d’échec : Luna vers Terra, puis Terra vers Sol lorsque la valeur de la tâche le justifie.
- Mesurer le coût complet : tokens entrants, tokens sortants, nouvelles tentatives, outils et temps de validation.
Il ne faut pas demander au modèle de décider seul s’il mérite un modèle plus cher. Les règles de routage, les seuils et les cas nécessitant une validation humaine doivent rester observables. Le guide sur AGENTS.md et les instructions communes aux agents de programmation montre justement l’intérêt de placer les règles permanentes dans une source contrôlée plutôt que de les réinventer dans chaque prompt.
Les quatre lignes de prix que le tableau principal ne montre pas
1. L’entrée mise en cache coûte dix fois moins cher
La documentation affiche également le tarif des tokens d’entrée déjà en cache : 0,02 dollar par million pour Luna, 0,20 pour Terra et 0,40 pour Sol. Une longue instruction stable, une base documentaire répétée ou un contexte système réutilisé peut donc coûter bien moins cher que la même entrée renvoyée sans cache.
2. Les très grands prompts changent le calcul
Pour les trois modèles, OpenAI indique que les prompts dépassant 272 000 tokens sont facturés au double du tarif d’entrée et à 1,5 fois le tarif de sortie pour toute la requête. Envoyer systématiquement l’intégralité d’un dépôt, d’une documentation ou d’un historique peut annuler une partie des économies. La fenêtre de contexte de 1,05 million de tokens est une capacité, pas une invitation à la remplir à chaque appel.
3. L’écriture dans le cache a son propre tarif
Les écritures de cache sont facturées 1,25 fois le prix d’une entrée non mise en cache. Il faut donc mesurer le taux réel de réutilisation. Mettre en cache un contexte éphémère utilisé une seule fois augmente le coût au lieu de le réduire.
4. Certains outils ajoutent des frais
Recherche web, utilisation d’un ordinateur et autres outils spécialisés peuvent être facturés séparément. Comparer uniquement le prix du token entre deux architectures serait trompeur si l’une déclenche plusieurs appels d’outils par requête.
Comment vérifier en une journée si Luna peut remplacer Terra ou Sol
Le test le plus utile ne consiste pas à poser dix questions choisies pour une démonstration. Il faut prélever un échantillon représentatif de requêtes réelles, retirer les données personnelles, puis rejouer exactement les mêmes entrées sur les trois modèles avec les mêmes outils et le même format de sortie.
- Commencer par 100 à 300 requêtes couvrant les cas fréquents, difficiles et rares.
- Masquer le nom du modèle pendant la notation afin de limiter le biais.
- Mesurer la réussite métier, pas seulement la préférence stylistique : exactitude des champs, tests passés, résolution au premier tour et corrections humaines.
- Enregistrer la latence et tous les tokens, y compris les nouvelles tentatives et les réponses rejetées.
- Construire une matrice de routage à partir des échecs observés plutôt que d’une impression générale.
Une différence de qualité minime sur une tâche exécutée un million de fois peut coûter davantage en corrections que l’économie de tokens. À l’inverse, conserver Sol pour une classification déterministe et facilement vérifiable gaspille probablement du budget. Le bon indicateur est le coût par résultat accepté, pas le coût par requête.
Faut-il migrer immédiatement toutes les applications vers Luna ?
Non. La baisse rend le test urgent, pas la migration aveugle. Une application peut commencer par envoyer à Luna les tâches faciles, conserver Terra comme recours et maintenir Sol sur les cas à fort enjeu. Pendant quelques jours, un échantillon peut être exécuté en parallèle sur deux modèles afin de comparer la qualité sans modifier la réponse envoyée à l’utilisateur.
Si votre code contient encore des identifiants de modèles anciens, profitez de l’audit tarifaire pour rechercher les modèles OpenAI obsolètes dans le dépôt, les variables d’environnement et les automatisations. Le changement doit passer par une configuration centrale et un environnement de test, jamais par des remplacements dispersés dans chaque worker.
La chute du prix de Luna est bien l’information spectaculaire. Mais le changement durable est architectural : une entreprise peut désormais traiter la majorité de ses tâches avec un modèle à 0,20/1,20 dollar, solliciter Terra lorsque le jugement compte davantage et ne payer Sol que lorsque sa capacité supérieure produit un résultat mesurable. Il faudra simplement recontrôler le tarif promotionnel de Sol avant le 21 novembre 2026.









