GPT-5.6 Luna baisse de 80 %, Terra de 20 % — Sol s'est auto-optimisé
- Ce qui s’est passé
- OpenAI cut GPT-5.6 Luna by 80% (now $0.20/$1.20) and Terra by 20% ($2/$12), three weeks after GA, funded by Sol autonomously rewriting its own GPU kernels.
- Pourquoi c’est important
- This is the first public case of a frontier model self-optimizing its production inference stack and having that work translate to customer pricing — not a hardware refresh.
- Que faire
- Re-benchmark your model-routing tier: at $0.20/$1.20 Luna is now cheaper than Haiku 4.5 with near-GPT-5.5 capability. Terra at $2/$12 undercuts your GPT-5.4 spend.
Le plancher de coût de l'IA de pointe vient de s'effondrer. OpenAI a réduit les prix d'entrée de GPT-5.6 Luna de 80 % à 0,20 $/1M tokens et ceux de Terra de 20 % à 2,00 $/1M tokens le 30 juillet — deux jours après avoir publié une mise à jour de Sol qui avait optimisé de manière autonome la pile d'inférence du modèle. Pour la première fois, un modèle a construit sa propre baisse de prix.
La nouvelle grille tarifaire en vigueur au 30 juillet :
| Modèle | Entrée (par 1M tokens) | Sortie (par 1M tokens) | Variation |
|---|---|---|---|
| GPT-5.6 Luna | 0,20 $ | 1,20 $ | Entrée −80 % |
| GPT-5.6 Terra | 2,00 $ | 12,00 $ | Entrée −20 % |
| GPT-5.6 Sol | 5,00 $ | 30,00 $ | Inchangé |
Les tarifs par lots font chuter l'entrée de Luna à 0,10 $ (la moitié du prix déjà divisé par deux) et Terra à 1,00 $ pour des fenêtres de complétion de 24 h. L'inférence en cache pour Luna tombe à 0,05 $ en entrée. Luna bénéficie également d'un « Mode rapide » à 0,20 $/1,20 $ — le même produit à faible latence qu'Anthropic propose pour Claude Opus 5.
Luna a été lancé à 1,00 $/6,00 $ en mai. Avec cette sixième baisse de prix depuis la disponibilité générale, il est désormais 80 % moins cher du côté entrée — il est passé d'un token de la série de pointe au modèle à faible latence le moins cher de la famille GPT-5.6 (VentureBeat(s’ouvre dans un nouvel onglet), 2026 ; Unite.AI(s’ouvre dans un nouvel onglet), 2026).
Comment GPT-5.6 Sol a réécrit sa propre infrastructure
L'équipe d'ingénierie d'OpenAI a annoncé que GPT-5.6 Sol avait réécrit de manière autonome ses propres kernels GPU de production dans Codex — le modèle a identifié et remplacé du code CUDA inefficace dans son chemin d'inférence. Résultat : une réduction de 20 % du coût par token servi, un gain d'efficacité de 15 %+ grâce à des améliorations de décodage spéculatif, et des réponses globalement plus rapides (OpenAI Engineering Post(s’ouvre dans un nouvel onglet), 2026).
C'est le premier cas documenté publiquement d'un modèle de pointe auto-optimisant sa propre pile d'inférence, avec un impact direct sur les prix clients (Unite.AI(s’ouvre dans un nouvel onglet), 2026). Sol a également reçu une variante « Mode rapide » à 1,00 $/5,00 $, qu'OpenAI décrit comme 80 % plus rapide et 40 % moins chère que l'inférence Sol standard, remplaçant l'option obsolète de Traitement Prioritaire. Anthropic vend le même produit sous le même nom et les mêmes conditions pour Claude Opus 5 — les deux grilles tarifaires convergent désormais sur la tarification de l'inférence à faible latence (Unite.AI(s’ouvre dans un nouvel onglet), 2026).
La directrice financière d'OpenAI, Sarah Friar, a déclaré aux employés lors d'une réunion interne que le revenu annuel récurrent de juillet à lui seul dépassait l'ensemble du T2, selon CNBC. Par ailleurs, le pipeline interne d'auto-révision de l'entreprise est passé de GPT-5.4 à GPT-5.6 Luna — une économie de 10× pour ses propres opérations IA (TechTimes(s’ouvre dans un nouvel onglet), 2026).
Pourquoi la tarification de GPT-5.6 redéfinit le marché
La famille de modèles Claude détient une part significative des dépenses IA des entreprises — ces baisses ciblent directement cette répartition.
À 0,20 $ en entrée, Luna est désormais 4× moins cher que Claude Haiku 4.5 d'Anthropic (0,80 $/4,00 $) du côté entrée. À 2 $/12 $, Terra s'aligne sur le tarif préliminaire de Gemini 3.1 Pro (contexte ≤200K) et se situe en dessous du tarif post-introductif de Claude Sonnet 5 (3 $/15 $ après le 31 août). Le mode rapide de Sol à 1 $/5 $ concurrence directement Claude Opus 5 Fast (1 $/5 $) à parité.
La fatigue des coûts en entreprise trouve une réponse. Uber a brûlé la totalité de son budget IA 2026 en quatre mois (Quartz / Yahoo Finance(s’ouvre dans un nouvel onglet), 2026) ; Amazon a plafonné ses dépenses IA le jour même de cette baisse (Unite.AI(s’ouvre dans un nouvel onglet), 2026). OpenAI a livré des limites strictes de dépenses API pour les organisations le 22 juillet (Unite.AI(s’ouvre dans un nouvel onglet), 2026). Les modèles deviennent aussi plus malins pour économiser de l'argent.
Cette étape d'auto-optimisation change également le narratif : la réduction des coûts de l'IA ne dépend plus seulement de puces moins chères. Les modèles sont désormais en train d'ingénier activement leurs propres courbes de coûts — une boucle de rétroaction qui pourrait comprimer les délais de baisse des prix plus rapidement que la loi de Moore ne l'a jamais fait.
Ce qui change pour vous
- Si vous utilisez GPT-5.6 Terra : vos coûts d'entrée viennent de baisser de 20 %, sans aucun travail de migration.
- Si vous utilisez des modèles Claude et que Terra satisfait votre barre de qualité : changer vous fait économiser 1 $/M rien qu'à l'entrée.
- Si vous êtes sur GPT-5.6 Luna pour de l'inférence par lots à haut volume : les tarifs cache + lots ramènent désormais l'entrée sous 0,10 $ par 1M tokens — viable pour le traitement de texte à échelle de production là où c'était marginal auparavant.
- Si vous avez besoin de la qualité Sol à moindre coût : le mode rapide à 1 $/5 $ est un nouveau niveau qui n'existait pas avant le 30 juillet.
- Si vous construisez sur l'API OpenAI avec des budgets serrés : verrouillez des limites de dépenses strictes — OpenAI a ajouté cette capacité le 22 juillet, et les modèles dépenseront désormais plus intelligemment dans votre plafond.
OpenAI annonce que d'autres baisses de prix liées à l'efficacité sont prévues tout au long du mois de juillet.
FAQ
Est-ce que Luna est réellement utilisable pour du vrai travail à ce prix ?
Oui. Luna offre des capacités proches de GPT-5.5. Pour les tâches API simples — classification, extraction, modération, traduction — Luna à 0,20 $ est désormais le chemin le moins cher vers l'intelligence textuelle de niveau de pointe et est presque certainement suffisant.
Qu'est-ce que le mode rapide Sol vs Sol standard ?
Le mode rapide sacrifie une petite marge de précision pour des réponses environ 2× plus rapides à un coût inférieur de 80 %. OpenAI le fournit comme point d'accès dédié pour les cas d'usage sensibles à la latence (interfaces de chat, complétions de copilote, appels d'outils d'agents). Il remplace l'ancienne option de Traitement Prioritaire.
Sol a-t-il vraiment réécrit son propre code ?
Oui. L'article d'ingénierie d'OpenAI rédigé par Ferrari, Tillet, Ibrahim, Gershenson et Coffey décrit Sol identifiant des kernels GPU inefficaces dans Codex et les remplaçant par des alternatives optimisées — une réduction de 20 % du coût par token servi, vérifiée dans la télémétrie de production. Sol a également amélioré le pipeline de décodage spéculatif pour l'efficacité des tokens (OpenAI Engineering Post(s’ouvre dans un nouvel onglet), 2026).
TL;DR
- Ce qui s'est passé : OpenAI a baissé GPT-5.6 Luna de 80 % (désormais 0,20 $/1,20 $) et Terra de 20 % (2 $/12 $), trois semaines après la disponibilité générale, financé par Sol qui a réécrit de manière autonome ses propres kernels GPU.
- Pourquoi c'est important : C'est le premier cas public d'un modèle de pointe auto-optimisant sa pile d'inférence de production avec un impact direct sur les prix clients — pas une mise à jour matérielle.
- Que faire : Réévaluez votre niveau de routage de modèles : à 0,20 $/1,20 $, Luna est désormais moins cher que Haiku 4.5 avec des capacités proches de GPT-5.5. Terra à 2 $/12 $ est moins cher que vos dépenses GPT-5.4.
Outils et modèles concernés
Ne ratez plus jamais une mise à jour
Le récap hebdomadaire — uniquement les changements de verdict et les actions urgentes. Sans remplissage.