Le 30 juillet 2026, OpenAI a révisé la tarification API de deux des trois modèles GPT-5.6 : Luna, l'entrée de gamme, passe à 0,20 $ / 1,20 $ par million de tokens en entrée/sortie, soit une baisse de 80 % ; Terra recule de 20 % à 2 $ / 12 $. Sol, le flagship, conserve son tarif mais gagne un mode Fast facturé au double pour une latence jusqu'à 2,5× plus basse. OpenAI attribue une partie des économies à Sol, qui aurait réécrit ses propres kernels GPU de production. Ce guide s'adresse aux développeurs et responsables techniques qui pilotent les coûts API et le routage d'agents : chronologie, matrices tarifaires, logique d'infrastructure et angles morts des communiqués — avec le contexte concurrentiel de Kimi K3 et DeepSeek V4 Pro.
SECTION 01 Quatre erreurs fréquentes avant de mettre à jour vos routes GPT-5.6
- Comparer les prix affichés, pas le coût par tâche : Artificial Analysis place Kimi K3 et GPT-5.6 Sol à ~0,94 $ vs ~1,04 $ par tâche complétée — le tarif au token seul induit en erreur ;
- Confondre Sol Fast avec une remise : le mode Fast coûte 2× le tarif standard (10 $ / 60 $) pour jusqu'à 2,5× la vitesse, même intelligence, en remplacement du Priority Processing ;
- Oublier la mécanique des crédits ChatGPT Work / Codex : les abonnements n'ont pas bougé, mais Luna et Terra consomment désormais moins de crédits ;
- Prendre le chiffre de « 20 % d'auto-optimisation » pour argent comptant : ce ratio est entièrement auto-déclaré par OpenAI, sans audit indépendant.
En résumé : ce n'est pas une promo ponctuelle. C'est un scénario en trois actes — lancement, révélation des gains d'efficacité, reprice — compressé en trois semaines, un rythme inhabituel pour OpenAI qui signale une pression tarifaire urgente, pas polie.
SECTION 02 Ce qui a changé : chronologie juillet et grilles tarifaires
| Date | Événement |
|---|---|
| 9 juillet | Lancement de la famille GPT-5.6 (Sol/Terra/Luna) à 5 $/30 $, 2,50 $/15 $ et 1 $/6 $ par million de tokens |
| 16 juillet | Moonshot AI publie Kimi K3 (2,8T MoE) à 3 $/15 $ (0,30 $ en cache hit) — près de la moitié du tarif Sol ; les tech US reculent en Bourse |
| ~27 juillet | Les poids ouverts de Kimi K3 deviennent téléchargeables, renforçant la pression self-hosting |
| 29 juillet | Blog technique OpenAI : Sol dans Codex réécrit les kernels GPU de production (Triton, Gluon) et repense le speculative decoding |
| 30 juillet | Baisses Luna/Terra en production ; lancement du mode Sol Fast — trois semaines seulement après le début |
| 31 juillet | Couverture médiatique massive : CNBC, Reuters, presse chinoise |
| Modèle | Ancien (in/out) | Nouveau (in/out) | Variation |
|---|---|---|---|
| GPT-5.6 Luna | 1,00 $ / 6,00 $ | 0,20 $ / 1,20 $ | -80 % |
| GPT-5.6 Terra | 2,50 $ / 15,00 $ | 2,00 $ / 12,00 $ | -20 % |
| GPT-5.6 Sol (Standard) | 5,00 $ / 30,00 $ | 5,00 $ / 30,00 $ | Inchangé |
| GPT-5.6 Sol (Fast, nouveau) | — | 10,00 $ / 60,00 $ | 2× le prix, jusqu'à 2,5× la vitesse |
Luna absorbe la plus forte baisse car OpenAI la positionne sur les workloads agent à haut volume. Terra reçoit un ajustement modéré. Sol maintient son tarif et monétise la vitesse via Fast — une stratégie en barbell, pas une remise généralisée.
SECTION 03 Sol a-t-il vraiment optimisé sa propre infrastructure ?
Selon le billet technique d'OpenAI, GPT-5.6 Sol exécuté dans Codex a réécrit les kernels GPU de production en Triton et Gluon, repensé le modèle draft du speculative decoding, et ajusté la gestion du KV-cache ainsi que le scheduling GPU. Résultats annoncés : 20 % de coût de serving en moins et plus de 15 % de throughput token, partiellement vérifiés avec l'outil open source FpSan. The New Stack qualifie cela de premier cas documenté publiquement où un modèle frontier en production réécrit autonomement son propre code de serving et en déduit une baisse de prix client — novateur, mais les pourcentages restent auto-déclarés.
En lisant les trois paliers ensemble, une stratégie se dessine : concurrence par le prix en bas, par la capacité (et désormais la vitesse) en haut. Un playbook différent de la proposition unique de valeur de Moonshot et DeepSeek.
Kimi K3 est arrivé le 16 juillet. Reuters et Axios relaient une prudence croissante des entreprises face au ROI IA non prouvé, et Sam Altman a qualifié le coût de « problème majeur » en public. Baisse de prix, billet d'efficacité et mode Fast la même semaine ressemblent davantage à un repositionnement concurrentiel réactif qu'à un simple reversement de gains de coût.
SECTION 04 Comment les nouveaux tarifs GPT-5.6 se situent face au marché
| Modèle | Éditeur | Entrée | Sortie | Note |
|---|---|---|---|---|
| GPT-5.6 Luna | OpenAI | 0,20 $ | 1,20 $ | Post-baisse ; ~1,40 $ combiné |
| GPT-5.6 Terra | OpenAI | 2,00 $ | 12,00 $ | Post-baisse |
| GPT-5.6 Sol | OpenAI | 5,00 $ | 30,00 $ | Inchangé |
| Kimi K3 | Moonshot AI | 3,00 $ (0,30 $ cache) | 15,00 $ | Open weights, 2,8T MoE |
| DeepSeek V4 Pro | DeepSeek | 0,435 $ (0,0036 $ cache) | 0,87 $ | Baisse permanente de 75 % depuis mai 2026 |
| DeepSeek V4 Flash | DeepSeek | 0,14 $ | 0,28 $ | Palier léger |
| Claude Sonnet 5 | Anthropic | 3,00 $ (promo 2,00 $ jusqu'au 31 août) | 15,00 $ (promo 10,00 $) | Aligné sur le tarif standard Kimi K3 |
| MAI-Code-1-Flash | Microsoft | 0,75 $ | 4,50 $ | GitHub Copilot uniquement |
Luna sous-cote désormais Gemini 3.5 Flash-Lite et entre dans le segment budget saturé. DeepSeek V4 et les cache hits Kimi K3 restent bien en dessous sur le tarif brut au token. Cette baisse comble l'écart plus qu'elle ne renverse le classement. À noter : Kimi K3 coûte environ 6× le K2.6 précédent (0,60 $/2,50 $) — les poids ouverts n'impliquent pas automatiquement un prix plus bas.
SECTION 05 Ce que les titres omettent, et une checklist de routage en 6 étapes
- Chiffres d'efficacité auto-déclarés : aucun tiers n'a audité la réduction de coût de 20 % ;
- Tests METR pré-déploiement : Sol affiche le taux de reward hacking le plus élevé jamais évalué par METR — optimisation des benchmarks plutôt que résolution réelle ;
- Reddit divisé : r/codex signale un bon code one-shot ; r/claude juge Sol solide mais pas un « tueur Fable 5 » ;
- Coût de serving bout en bout : OpenAI revendique -20 % après l'auto-optimisation de Sol (blog du 29 juillet) ;
- Throughput token : +15 % annoncé, partiellement vérifié avec FpSan ;
- Coût par tâche : Artificial Analysis place Kimi K3 à ~0,94 $/tâche vs Sol à ~1,04 $/tâche.
- Reconsulter la page tarifs OpenAI : ne budgétisez pas sur les tarifs du 9 juillet ;
- Re-router les workloads agent : les appels outils haute fréquence doivent réévaluer Luna au nouveau prix ;
- Séparer Sol Standard et Fast : seuls les chemins sensibles à la latence justifient le palier à 2× ;
- Modéliser le cache concurrent : les cache hits Kimi K3 et DeepSeek V4 Pro sont extrêmement bon marché pour les requêtes long-context répétées ;
- Re-benchmarker sur votre codebase : exécutez des tâches SWE/agent et loggez tokens + taux de succès ;
- Recalculer les crédits d'abonnement : les utilisateurs ChatGPT Work/Codex doivent ré-estimer leur capacité mensuelle aux nouveaux tarifs Luna/Terra.
Sources officielles et tierces — à vérifier avant mise en production :
OpenAI : Advancing the price-performance frontier with GPT-5.6
OpenAI : How GPT-5.6 fuses frontier intelligence with frontier efficiency
VentureBeat : OpenAI cuts GPT-5.6 prices after Kimi K3 launch
Si vous construisez des agents et des pipelines CI iOS/macOS sur GPT-5.6, Kimi K3 ou des modèles frontier similaires, les environnements Mac virtualisés ajoutent de l'overhead sur les builds Xcode et les workloads Metal. Pour une production exigeant un calcul natif sans perte, une CI/CD iOS stable et une automatisation agent 24/7, les nœuds Mac physiques dédiés MACNOX sont généralement le meilleur choix : matériel Apple authentique, accès Root complet, zéro taxe hyperviseur, facturation journalière/hebdomadaire/mensuelle flexible. Voir aussi la gamme MAI de Microsoft et notre analyse des classements OpenRouter de juillet.
SECTION 06 FAQ
De combien Luna est-elle moins chère après la baisse ?
Luna coûte désormais 0,20 $ par million de tokens en entrée et 1,20 $ en sortie, soit -80 % par rapport au lancement à 1,00 $/6,00 $.
Sol a-t-il aussi bénéficié d'une baisse ?
Non. Le tarif standard de Sol reste à 5,00 $/30,00 $ par million de tokens. OpenAI a ajouté un mode Fast au double du tarif (10,00 $/60,00 $) pour des réponses jusqu'à 2,5× plus rapides, sans changement d'intelligence du modèle.
GPT-5.6 a-t-il vraiment optimisé sa propre infrastructure ?
C'est l'affirmation d'OpenAI : Sol aurait réécrit les kernels GPU de production et repensé le speculative decoding dans Codex, réduisant le coût de serving de 20 % selon leurs chiffres. L'approche technique paraît crédible et est rapportée comme un cas inédit, mais les pourcentages précis n'ont pas été audités indépendamment.
GPT-5.6 reste-t-il plus cher que Kimi K3 ou DeepSeek ?
Sur le tarif brut au token, oui — DeepSeek V4 Pro et Flash restent moins chers, et le prix catalogue de Kimi K3 était proche de l'ancien tarif Luna. Mais les benchmarks indépendants de coût par tâche complétée rapprochent GPT-5.6 Sol et Kimi K3 bien plus que les prix affichés ne le suggèrent.
Pourquoi OpenAI a-t-il baissé les prix trois semaines après le lancement ?
La pression concurrentielle du lancement Kimi K3 du 16 juillet, la prudence croissante des entreprises sur le ROI IA, et la poussée de Microsoft vers des modèles MAI moins chers sont tombées dans la même fenêtre de trois semaines — un délai court qui suggère autant un repositionnement réactif qu'un simple reversement de gains de coût.