En cinq jours, les équipes qui achètent des API frontier chinoises ou téléchargent des poids ouverts ont encaissé trois mouvements qui, en surface, se contredisent. DeepSeek a relevé ses tarifs API jusqu'à 1 100 % sur certains paliers. La même semaine, Alibaba a ouvert les poids d'un flagship à 2,4 T de paramètres, jamais publié auparavant. Zhipu AI a livré GLM-5.3, qui fait progresser les benchmarks de code d'environ 6× sur la même base — sans réentraînement. Ce texte s'adresse aux ingénieurs qui doivent recalculer une facture, lire une licence et choisir une stack. Le signal commun : les laboratoires chinois ne se battent plus seulement sur le prix, mais sur le pouvoir de tarifer.
SECTION 01 Cinq lectures fausses de la hausse DeepSeek
Le problème n'est pas le manque de titres. C'est le manque de dimensions de facturation propres.
- Prendre « 1 100 % » pour toute la facture : ce chiffre concerne l'entrée cache-hit en heures de pointe sur V4-Pro. La sortie a augmenté de 350 %. L'entrée cache-miss a augmenté de 200 %.
- Supposer que l'API officielle est toujours la moins chère : aux heures de pointe, le tarif liste DeepSeek dépasse désormais plusieurs revendeurs (GMI Cloud, Novita et d'autres cotent encore V4 Pro sous le nouveau pic officiel).
- Lire le dépôt Alibaba comme une aumône Apache 2.0 : les poids sont téléchargeables, mais une activité Model-as-a-Service ou AI Work Assistant dépassant 50 millions de dollars sur n'importe quelle période de 12 mois doit négocier une licence commerciale séparée.
- Répéter la rumeur d'interdiction géographique : les affirmations selon lesquelles les États-Unis, l'UE, le Royaume-Uni et la Corée du Sud ne pourraient pas télécharger le checkpoint sont fausses. La licence publiée n'a aucune clause territoriale.
- Qualifier GLM-5.3 de nouveau modèle de fondation : il réutilise la base 743B de GLM-5.2. Les gains viennent du RL de post-entraînement mis à l'échelle. Les scores sont déclarés par l'éditeur ; aucune re-exécution indépendante n'est publique à ce jour.
Trois laboratoires, trois jeux, un signal : les labs d'IA chinois se disputent le pouvoir de tarifer, pas seulement le prix.
SECTION 02 Chronologie : ce qui a été livré, et quand les labs US ont baissé leurs prix
Reculons. Le 30 juillet, OpenAI a baissé de 80 % son palier le moins cher, GPT-5.6 Luna. Les 6 et 7 août, Luna est devenu le défaut gratuit, avec des chats texte illimités. Pendant que les labs chinois relevaient leurs tarifs et ouvraient des poids flagship, les labs américains baissaient les prix et passaient en gratuité côté grand public. Ce sont les deux faces du même affrontement. Notes produit antérieures : lancement de Qwen3.8-Max et tarifs DeepSeek V4 GA.
| Date | Événement |
|---|---|
| 16 juillet 2026 | Moonshot AI ouvre les poids de Kimi K3 (2,8 T de paramètres), ce qui attire l'attention des autorités de sécurité américaines |
| 2–3 août 2026 | Alibaba prévisualise, puis lance, Qwen3.8-Max en API hébergée |
| 10 août 2026 | Meta publie Muse Glimmer (30B, Apache 2.0) et évoque des poids ouverts pour le flagship Muse Spark 1.2 |
| 12 août 2026 | Alibaba publie Qwen3.8-2.4T-A95B sur Hugging Face / ModelScope ; xAI livre Grok 4.6 |
| 13 août 2026 | DeepSeek-V4-Pro passe en GA et annonce une hausse effective le 17 août ; Google livre Gemini 3.7 Flash à tarif réduit |
| 14 août 2026 | Zhipu livre GLM-5.3, en réutilisant la base 743B de GLM-5.2 |
| 17 août 2026, 00:00 heure de Pékin | La nouvelle grille DeepSeek entre en vigueur |
SECTION 03 Les chiffres : grilles DeepSeek, specs Qwen, benches GLM-5.3
Les nouveaux tarifs DeepSeek s'appliquent le 17 août à 00:00, heure de Pékin. Les heures de pointe sont 9 h–12 h et 14 h–18 h, heure de Pékin. Le titre « 1 100 % » vise l'entrée cache-hit en pointe — le palier qui partait le plus près de zéro. La sortie, qui domine la plupart des factures réelles, a augmenté de 350 %. Une modélisation de coût indépendante trouve qu'une charge lourde réaliste (environ 84 M de tokens/mois, surtout hors pointe, moitié cache-hit) voit une hausse de facture plus proche de 1,8×.
| Poste | Ancien | Nouveau hors pointe | Nouveau pointe | Hausse en pointe |
|---|---|---|---|---|
| V4-Flash cache-hit (entrée) | ¥0,02 | ¥0,05 | ¥0,10 | ~400 % |
| V4-Flash cache-miss (entrée) | ¥1,0 | ¥1,5 | ¥3,0 | 200 % |
| V4-Flash sortie | ¥2,0 | ¥4,5 | ¥9,0 | 350 % |
| V4-Pro cache-hit (entrée) | ¥0,025 | ¥0,15 | ¥0,30 | ~1 100 % |
| V4-Pro cache-miss (entrée) | ¥3,0 | ¥4,5 | ¥9,0 | 200 % |
| V4-Pro sortie | ¥6,0 | ¥13,5 | ¥27,0 | 350 % |
| Spécification | Détail |
|---|---|
| Paramètres | 2,4 T au total, 95B actifs par token (MoE, 512 experts, 10 routés + 1 partagé) |
| Fenêtre de contexte | 262 144 tokens natifs (checkpoint ouvert), extensible à ~1,01 M ; le Max hébergé vaut 1 M par défaut |
| Cadence de sortie | Preview 2 août → API en ligne 3 août → poids ouverts 12 août |
| Tarif API (international) | 2 $/M en entrée, 6 $/M en sortie |
| Licence | Pas Apache 2.0 — une licence Qwen3.8-Max sur mesure |
| Pourquoi c'est important | Première fois qu'Alibaba ouvre les poids d'un flagship de palier Max ; Qwen3.5/3.6/3.7 Max sont restés API uniquement |
| Benchmark | GLM-5.2 | GLM-5.3 | Écart |
|---|---|---|---|
| Terminal-Bench 3.0 | 4,6 % | 28,3 % | +23,7 pts |
| DeepSWE v1.1 | 46,2 % | 66,9 % | +20,7 pts |
| Agents' Last Exam (CLI) | 23,8 % | 28,5 % | +4,7 pts |
| CyberGym | 77,2 % | 84,5 % | +7,3 pts |
| AutomationBench | 26,2 % | 48,2 % | +22,0 pts |
Ce sont les chiffres de Zhipu. GLM-5.3 reste derrière GPT-5.6 Sol (34,6 %) et Claude Fable 5 (33,7 %) sur Terminal-Bench 3.0. C'est un résultat open-weight de premier plan, pas une victoire frontier nette.
SECTION 04 Trois stratégies : tarification horaire, poids sous licence, post-entraînement
DeepSeek : du forfait toujours bas à une grille selon l'heure — un problème de capacité, pas un revirement de marque. La lecture facile est « le modèle chinois le moins cher a fini par céder ». La structure ressemble davantage à une contrainte de calcul rendue visible. Un tarif plat et toujours bas fonctionnait comme levier d'acquisition tant que l'offre GPU suivait. Une fois l'usage devenu exponentiel et la capacité non, quelque chose devait devenir explicite. « Encourager une planification plus souple des charges » est le langage d'entreprise pour un compute de pointe rare. En heures de pointe, l'API officielle n'est plus le moyen le moins cher d'exécuter DeepSeek. Cette hypothèse vient de casser.
Alibaba : les poids ouverts achètent l'attention ; une licence sur mesure protège le plafond de revenus. Publier le checkpoint 2,4 T et y attacher une licence personnalisée forme un seul geste. Toute activité Model-as-a-Service ou AI Work Assistant qui gagne plus de 50 millions de dollars sur n'importe quelle période de 12 mois doit négocier une licence commerciale séparée. Les produits à 100 M+ d'utilisateurs actifs mensuels ou 20 M$+ de revenus mensuels doivent afficher le nom du modèle. Le pari : gagner les développeurs internationaux, garder un levier sur quiconque vend de l'inférence par-dessus. C'est un pari différent de Muse Glimmer de Meta, sous Apache 2.0 sans restriction. La rumeur d'interdiction géographique est fausse — lisez le fichier LICENSE, pas le fil d'annonce.
GLM-5.3 : pas de nouvelle base, un pari plus large sur le post-entraînement. Même base 743B que GLM-5.2, pas de réentraînement, et un saut d'environ 6× sur Terminal-Bench 3.0 (4,6 % → 28,3 %) en mettant à l'échelle les environnements RL. À mesure que les lois d'échelle du préentraînement s'aplatissent, le RL de post-entraînement devient un levier autonome, avec un plancher de coût plus bas qu'un nouveau modèle de fondation. Les labs de milieu de tableau peuvent encore refermer l'écart sur les benches agentiques et de code sans budgets de préentraînement à l'échelle d'OpenAI.
SECTION 05 DeepSeek reste-t-il le frontier le moins cher ? Un audit en six étapes
Conversion RMB–USD à environ ¥7,15 / 1 $, ordre de grandeur. Le V4-Pro hors pointe reste bien sous Claude Opus 5, mais ce n'est plus l'option la moins chère tout court. Le tarif international de Qwen3.8-Max et Luna d'OpenAI sous-cotent tous deux le hors-pointe DeepSeek. « Modèle chinois = modèle le moins cher » a tenu pendant l'essentiel de 2025 et du début 2026. Ce n'est plus une hypothèse sûre. Contexte de la baisse américaine : GPT-5.6 Luna en baisse de 80 %.
| Modèle | Entrée | Sortie | Poids ouverts ? |
|---|---|---|---|
| DeepSeek V4-Pro (pointe) | ¥9,0 (~1,26 $) | ¥27,0 (~3,78 $) | Non |
| DeepSeek V4-Pro (hors pointe) | ¥4,5 (~0,63 $) | ¥13,5 (~1,89 $) | Non |
| Qwen3.8-Max (API internationale) | 2,00 $ | 6,00 $ | Oui (licence sur mesure) |
| OpenAI GPT-5.6 Luna | 0,20 $ | 1,20 $ | Non |
| Claude Opus 5 (implicite, selon le ratio de comparaison d'Alibaba) | ~5,00 $ | ~25,00 $ | Non |
S'il faut livrer contre cette semaine, auditez la stack en six étapes plutôt que de multiplier le titre :
- Découpez la facture : séparez les 30 derniers jours en entrée cache-hit, entrée cache-miss et sortie. Appliquez la nouvelle carte à chaque ligne. Ne multipliez pas toute la facture par 1 100 %.
- Marquez les heures de pointe de Pékin : 9 h–12 h et 14 h–18 h, heure de Pékin. L'annonce demandait une planification plus souple pour une raison.
- Comparez officiel et revendeur : en pointe, vérifiez si GMI Cloud, Novita ou un autre revendeur sous-cote encore le tarif de pointe officiel DeepSeek.
- Lisez le fichier LICENSE : avant de télécharger Qwen3.8-2.4T-A95B, confirmez les seuils 50 M$ / 100 M MAU / 20 M$ de revenus mensuels. Ignorez les fils d'interdiction géographique.
- Traitez GLM-5.3 comme un delta de post-entraînement : même base que 5.2, benches éditeur uniquement. Relancez vos propres tâches terminal et SWE avant de basculer.
- Routez par couche : texte grand public bon marché vers Luna ; poids ouverts et écosystème vers Qwen ; inférence frontier décalable hors pointe vers DeepSeek ; agents longue horizon et CI iOS vers un vrai Mac, pas un hyperviseur.
peak = {"in_miss": 9.0, "in_hit": 0.30, "out": 27.0}
off = {"in_miss": 4.5, "in_hit": 0.15, "out": 13.5}
tokens_m = {"in_miss": 40, "in_hit": 40, "out": 4}
def bill(rate, t):
return t["in_miss"]*rate["in_miss"] + t["in_hit"]*rate["in_hit"] + t["out"]*rate["out"]
print("hors pointe CNY", round(bill(off, tokens_m), 2))
print("pointe CNY", round(bill(peak, tokens_m), 2))
SECTION 06 Ce qui n'est pas vérifié, pourquoi deux guerres de prix, et quelles sources rouvrir
- Le titre 1 100 % est exact et incomplet : il ne concerne que l'entrée cache-hit en pointe. La sortie — la ligne qui domine la plupart des factures — a augmenté de 350 %.
- Affirmations Zhenwu M890 / Pangu AL128 : plusieurs médias financiers chinois indiquent qu'une partie de l'inférence Qwen3.8-Max tournerait sur des puces internes d'Alibaba. Alibaba n'a pas publié de documentation technique indépendante ni de benches tiers. À traiter comme non vérifié.
- GLM-5.3 et une « grave vulnérabilité Cursor » : VentureBeat plus la divulgation de Zhipu. Les détails techniques ne sont pas publics. À lire comme source éditeur, non audité de façon indépendante.
- Contrôles à l'exportation en représailles : les reportages selon lesquels le ministère chinois du Commerce préparerait des contre-mesures IA / semi-conducteurs sont de la presse spéculative, pas une annonce officielle.
Le mois écoulé, les principaux labs chinois ont livré à un rythme que la presse financière intérieure appelle « trois mises à jour de modèle par semaine » (一周三更) — DeepSeek, Alibaba, Zhipu, plus le Kimi K3 de Moonshot (poids ouverts le 16 juillet, 2,8 T) et MiniMax H3. La couverture chinoise présente cela comme des sorties open-weight qui forcent une revalorisation mondiale. Les labs US ont joué l'inverse côté grand public : baisse de 80 % de Luna chez OpenAI, puis texte gratuit illimité ; Gemini 3.7 Flash à moitié prix chez Google le 13 août. Poids flagship ouverts plus tarifs étagés et plus élevés au sommet contraint en compute ; gratuit et bon marché à l'extrémité grand public. Les deux sont réels. Ils optimisent des parties différentes de l'entonnoir.
Il y a aussi une couche géopolitique. Kimi K3 a déjà attiré l'attention des autorités de sécurité américaines. Certains analystes lisent le dépôt 2,4 T d'Alibaba dans cette fenêtre comme un moyen de verrouiller l'attention internationale et un récit de « parité technologique » avant un durcissement réglementaire. C'est une interprétation informée, pas un fait confirmé — et facile à manquer si l'on ne lit que les notes produit en anglais.
Sources officielles et recoupées. Rouvrez ces pages avant de republier des tarifs ou des termes de licence :
Tarifs API officiels DeepSeek (carte pointe / hors pointe)
Alibaba Cloud Community : note de lancement Qwen3.8-Max
Hugging Face : checkpoint Qwen3.8-2.4T-A95B
Reuters / MarketScreener : DeepSeek relève les tarifs API V4
MarkTechPost : GLM-5.3, même base, post-entraînement
Héberger soi-même un MoE à 2,4 T ou brancher un agent dans Xcode et la CI iOS empile une taxe hyperviseur sur une facture de tokens qui vient de monter. Pour un calcul natif sans perte, une CI/CD iOS stable et une automatisation d'agents 24 h/24, un nœud physique cloud MACNOX est généralement le meilleur chemin de production : matériel Apple authentique, Root complet, pas d'hyperviseur, facturation jour / semaine / mois. Contexte partagé : classements OpenRouter de juillet.
SECTION 07 FAQ
DeepSeek reste-t-il moins cher que GPT-5.6 ou Claude après la hausse ?
Son tarif hors pointe reste moins cher que Claude Opus 5, mais ce n'est plus l'option unique la moins chère. GPT-5.6 Luna d'OpenAI (0,20 $ / 1,20 $ par million de tokens) et le tarif international Qwen3.8-Max d'Alibaba (2 $ / 6 $) sous-cotent désormais le hors-pointe DeepSeek sur au moins une dimension. DeepSeek reste relativement bon marché pour un modèle de classe frontier, simplement plus le moins cher tout court.
Puis-je utiliser gratuitement les poids ouverts Qwen3.8-Max d'Alibaba dans un produit commercial ?
Oui, pour la plupart des usages — les projets personnels et l'usage interne en entreprise ne sont pas concernés. La restriction ne s'applique que si vous exploitez une activité Model-as-a-Service ou AI Work Assistant qui a gagné plus de 50 millions de dollars sur n'importe quelle période de 12 mois consécutifs ; ce palier exige une licence commerciale séparée auprès d'Alibaba. Les produits à 100 M+ MAU ou 20 M$+ de revenus mensuels doivent afficher le nom du modèle.
Qwen3.8-Max est-il interdit ou restreint pour les utilisateurs des États-Unis, de l'UE ou du Royaume-Uni ?
Non. Cette affirmation a circulé en ligne mais elle est fausse — la licence publiée ne contient aucune restriction géographique. Les restrictions sont fondées sur le chiffre d'affaires, pas sur le lieu où vous ou vos utilisateurs vous trouvez.
Qu'est-ce qui change vraiment entre GLM-5.3 et GLM-5.2 ?
Rien au niveau du modèle de base — les deux utilisent la même fondation à 743 milliards de paramètres. Les gains de performance (environ 6× sur Terminal-Bench 3.0) viennent entièrement de la mise à l'échelle de l'apprentissage par renforcement pendant le post-entraînement, sans réentraînement de la base.
Meta va-t-elle vraiment ouvrir les poids de son flagship, et pas seulement Muse Glimmer ?
Pas encore. Muse Glimmer est un modèle distillé 30B, pas le vrai flagship de Meta. Mark Zuckerberg a dit que les poids ouverts du Muse Spark 1.2, plus large et encore fermé, arriveraient « bientôt ». Si cela se produit, ce serait le premier modèle américain de palier flagship publié ouvertement. À la date de cet article, traitez cela comme une intention déclarée, pas comme un fait confirmé.