Réponse courte : pas encore. Le 3 août 2026, Alibaba a rendu Qwen3.8-Max généralement disponible via son API cloud et l'a étiqueté « Open-Source » sur qwen.ai. À la date de publication, aucun dépôt de modèle sur Hugging Face ou ModelScope, aucune licence et aucune date confirmée — seulement la promesse que les poids de Qwen3.8-Max et d'un Qwen3.8-27B plus compact arriveront « la semaine prochaine ». Ce décryptage s'adresse aux développeurs qui évaluent des API flagship et des migrations Agent : ce qui est livré, ce qui manque, comment le modèle se compare à Kimi K3 et DeepSeek V4, et pourquoi l'étiquette open source est apparue avant les poids.
SECTION 01 Pourquoi le lancement de Qwen3.8-Max soulève des questions de transparence
Après l'annonce GA du 3 août, les erreurs d'interprétation les plus fréquentes dans les communautés techniques sont :
- Considérer le badge « Open-Source » de qwen.ai comme des poids livrés : Aucun dépôt Hugging Face ou ModelScope n'existe à la date de publication ; seule une promesse vague « la semaine prochaine » pour Qwen3.8-Max et Qwen3.8-27B ;
- Accepter les benchmarks éditeur comme vérification indépendante : PaperBench, OSWorld-Verified et SWE-bench Pro proviennent tous du harness d'Alibaba ; Artificial Analysis n'a pas reproduit les chiffres GA ;
- Ignorer les lacunes de transparence de la preview : La preview du 19 juillet interdisait l'usage automatisé en production, ne divulguait pas le nombre de paramètres actifs et était livrée sans fiche modèle ;
- Sur-interpréter le rang préliminaire d'Arena : La 5e place à 1 496 points est marquée Preliminary ; les rangs 1 à 4 et 6 à 8 sont tous des modèles Anthropic ;
- Sous-estimer l'infrastructure pour les Agents longue durée : Du codage non supervisé sur 16 jours et des tâches de conception de puces à 500+ étapes exigent une CI stable et des pipelines macOS — les environnements Mac virtualisés ajoutent un overhead caché.
Les actions Alibaba à Hong Kong ont progressé d'environ 7 % et les titres cotés aux États-Unis d'environ 4,5 % le jour du lancement — le marché a interprété cela comme le retour d'Alibaba dans la conversation sur les modèles frontier, et non comme une itération de routine.
SECTION 02 Chronologie et spécifications clés de Qwen3.8-Max
- 16 juillet : Moonshot AI publie Kimi K3 (2,8 billions de paramètres, 16 experts actifs sur 896), avec benchmarks indépendants et rapport technique ;
- 19 juillet : Preview Qwen3.8-Max via Token Plan / Qoder / QoderWork à 10 % du tarif final — pas de paramètres actifs, pas de tableau de benchmarks, automatisation de production interdite dans les CGU ;
- 27 juillet : Kimi K3 open weight livré sur Hugging Face comme prévu, plus MoonEP et FlashKDA ;
- 31 juillet : DeepSeek livre V4-Flash, dépassant sa propre preview V4-Pro sur neuf benchmarks agentiques/coding sans ajouter de paramètres ;
- 3 août : Qwen3.8-Max passe en GA avec un tableau de benchmarks complet ; le produit Agent « Qwen Office » est lancé en parallèle ;
- Attendu vers le 10 août : Open weights pour Qwen3.8-Max et Qwen3.8-27B promis sur Hugging Face et ModelScope — aucun dépôt, licence ou date ferme pour l'instant.
| Élément | Valeur |
|---|---|
| Date GA | 3 août 2026 |
| Paramètres totaux / actifs | 2,4T / 95B |
| Architecture | MoE sparse + attention hybride sur base Qwen3.5 |
| Fenêtre de contexte | 1M tokens (≈983K avec thinking ; 131K max en sortie) |
| Modalités d'entrée | Texte, image, vidéo |
| Tarif API (par 1M tokens) | Entrée 2 $, sortie 6 $ ; cache implicite hit 0,25 $ ; cache explicite écriture 2,50 $, lecture 0,17 $ |
| Arena Text Arena (snapshot 1er août) | #5, 1 496 points (Preliminary) — seul modèle non Anthropic dans le top 8 |
| Arena Vision Arena | #2, derrière Claude Fable 5 |
| Open weights | Promis « la semaine prochaine » ; non disponibles à la publication |
SECTION 03 Architecture MoE et comparaison des modèles flagship
Qwen3.8-Max porte les paramètres totaux à 2,4 billions tout en n'activant que 95 milliards par token — le coût d'inférence suit le nombre actif, pas le total. À 2 $/6 $ par million de tokens, la tarification se situe nettement sous Claude Opus 5 (5 $/25 $) et Claude Fable 5 (10 $/50 $). Il s'agit d'un pari sur l'efficacité architecturale comme levier de prix, et non sur l'échelle brute comme levier de capacité.
Trois niveaux reasoning_effort (low / medium / xhigh, xhigh par défaut) échangent latence et profondeur via enable_thinking ou reasoning.effort compatible Anthropic. L'API prend en charge les protocoles compatibles OpenAI et Anthropic, s'intégrant à Claude Code, Codex, Qoder CLI, Qwen Code et OpenClaw par simple changement de base URL.
| Modèle | Total / actif | Prix (in/out) | Open weights | Benchmark indépendant |
|---|---|---|---|---|
| Qwen3.8-Max | 2,4T / 95B | 2 $ / 6 $ | Promis, non livrés | Aucun pour l'instant |
| Kimi K3 | 2,8T / ~50B | 3 $ / 15 $ | Livrés le 27 juillet | Artificial Analysis ≈ 57,11 |
| DeepSeek V4-Flash | Identique à V4-Pro | Non entièrement publié | Livrés | Dépasse V4-Pro sur 9 benchmarks agentiques/coding |
| Claude Fable 5 | Non divulgué | 10 $ / 50 $ | Fermé | #1 Arena Text Arena |
| Test aveugle indépendant (tâche d'architecture 269 fichiers) | Kimi K3 83 vs Qwen3.8-Max preview 80 | — | — | Même tier, résultats équilibrés |
Scores Alibaba (source : documentation éditeur) : PaperBench 93,0 (+28,2), OSWorld-Verified 86,1, SWE-bench Pro 67,7 (derrière les 80,0 de Fable 5), HLE 43,6 (le plus bas parmi les flagships comparés ; Fable 5 affiche 53,3). Une note de bas de tableau suggère que « les résultats Fable 5 pourraient impliquer des fallbacks », sans divulgation méthodologique équivalente pour les exécutions d'Alibaba.
SECTION 04 Le problème de l'étiquette open source et checklist d'intégration API en 6 étapes
Le détail le plus prudent n'est pas les scores de pointe mais le calendrier d'information : l'étiquette Open-Source est apparue le jour du GA alors que poids, licence et date de livraison restaient non publiés ; chaque benchmark provient du harness d'Alibaba (y compris QwenSWEBench et RecreationBench) ; la preview de juillet manquait de fiche modèle et interdisait l'automatisation de production.
- Vérifier le statut open weight : Rechercher
Qwen3.8-Maxsur Hugging Face / ModelScope — confirmer dépôt, licence et poids avant de migrer sur la seule base du badge du site ; - Choisir le protocole : Sélectionner un endpoint compatible OpenAI ou Anthropic selon votre toolchain ; évaluer Qwen Office vs appels API bruts ;
- Configurer le niveau de reasoning : Utiliser
lowoumediumpour les tâches sensibles à la latence ;xhighpar défaut pour les Agents complexes et surveiller la consommation de tokens ; - Activer le cache : Exploiter les tarifs de cache implicite/explicite (hit 0,25 $, lecture 0,17 $) pour réduire la facture sur les workloads Agent long contexte ;
- A/B sur votre charge réelle : Comparer en aveugle contre Kimi K3 et DeepSeek V4 sur vos tâches — ne pas se fier uniquement aux benchmarks éditeur ;
- Planifier l'infrastructure Agent : Les tâches longue durée exigent une CI stable et des environnements de build macOS ; comparer nœuds Mac physiques vs TCO de virtualisation.
from anthropic import Anthropic
client = Anthropic(
api_key="YOUR_DASHSCOPE_API_KEY",
base_url="https://dashscope.aliyuncs.com/api/v2/apps/anthropic/v1"
)
response = client.messages.create(
model="qwen3.8-max",
max_tokens=4096,
thinking={"type": "enabled", "budget_tokens": 8000},
messages=[{"role": "user", "content": "Summarize MoE active params for Qwen3.8-Max."}]
)
print(response.content[0].text)
SECTION 05 Données citables, contexte sectoriel et conclusion de sélection
- 2,4T total / 95B actifs : Nombre actif divulgué pour la première fois au GA — la preview n'avait rien communiqué, point central des critiques de transparence en juillet ;
- API 2 $/6 $ par 1M tokens : Sous les tarifs Claude Opus 5 et Fable 5 ;
- Arena Text #5 (1 496, Preliminary) : Seul modèle non Anthropic dans le top 8 ; Vision Arena #2 ;
- Démonstrations longue durée : Alibaba cite 16 jours de codage non supervisé et une optimisation de puces en 500+ étapes ; trace partielle sur GitHub
qwen-code-dev-bot/oh-my-cli, pas d'audit indépendant complet ; - Portée grand public : Qwen alimente déjà l'IA générative dans Apple Intelligence pour la Chine — voir Apple Intelligence Chine et partenariat Qwen.
2026 est l'année où les modèles au billion de paramètres se sont multipliés, mais DeepSeek V4-Flash a prouvé des gains agentiques sans augmenter les paramètres. L'engagement rare d'Alibaba à open-sourcer un modèle de classe Max rejoint Kimi K3 et DeepSeek dans un virage des laboratoires chinois vers les open weights. La même semaine, OpenAI et Anthropic ont révélé des incidents de jailbreak d'agents suffisamment graves pour convoquer une réunion à la Maison Blanche le 4 août sur les tests de cybersécurité volontaires — un contraste saisissant dans les récits mondiaux sur l'IA.
Sources officielles et tierces ci-dessous — vérifier les pages actuelles avant toute décision de migration :
Arena.ai : classements publics Text et Vision Arena
GitHub : qwen-code-dev-bot/oh-my-cli (trace partielle de codage longue durée)
TechCrunch : Apple Intelligence approuvé pour la Chine avec le Qwen AI d'Alibaba
Les équipes qui construisent des pipelines Agent sur Qwen3.8-Max font face à un overhead de virtualisation sur les builds Xcode, l'accélération Metal et la CI iOS. Pour les environnements de production nécessitant un calcul natif sans perte, une CI/CD iOS stable et une automatisation Agent 24/7, les nœuds Mac physiques dédiés MACNOX sont généralement le meilleur choix : matériel Apple à 100 %, accès Root complet, pas de pénalité hyperviseur, facturation flexible au jour/semaine/mois. Plus de contexte sur les modèles chinois : analyse des classements OpenRouter de juillet.
SECTION 07 FAQ
Qwen3.8-Max est-il open source maintenant ?
Non. L'API est disponible via Alibaba Cloud Model Studio, mais les poids ne sont pas sur Hugging Face ou ModelScope à la date de publication. L'étiquette Open-Source de qwen.ai décrit une intention, pas un artefact livré — les poids plus Qwen3.8-27B sont promis « la semaine prochaine » sans date confirmée.
Comment Qwen3.8-Max se compare-t-il à Kimi K3 ?
Aucun face-à-face autoritaire unique n'existe. La seule comparaison indépendante — une tâche d'architecture à 269 fichiers évaluée en aveugle — a donné Kimi K3 83/100 contre Qwen3.8-Max 80/100, essentiellement une égalité. L'avantage de Kimi K3 aujourd'hui : poids publics et score Artificial Analysis. L'avantage de Qwen3.8-Max : tarif API plus bas et support multimodal natif plus large.
2,4 billions de paramètres signifient-ils un data center ?
Pour le checkpoint complet, oui — un artefact MoE de 2,4T (même avec 95B actifs) relève de l'échelle multi-nœuds data center. L'API contourne entièrement cette contrainte. Pour un déploiement local, la cible plus réaliste est le Qwen3.8-27B plus compact, promis en open weight en parallèle du flagship.
Peut-on faire confiance aux benchmarks d'Alibaba ?
Les traiter comme des affirmations éditeur, pas comme des résultats vérifiés. Chaque score publié provient du harness d'Alibaba, y compris plusieurs benchmarks internes. Aucune plateforme indépendante n'avait reproduit les chiffres GA à la publication ; l'entrée Arena reste Preliminary. Attendre des reproductions tierces ou tester sur votre propre charge.
Pourquoi cela m'intéresse-t-il si je n'utilise pas les modèles d'Alibaba ?
Qwen alimente déjà l'IA générative dans Apple Intelligence pour les utilisateurs en Chine, exécutée on-device sur les iPhone récents. C'est un exemple concret d'une famille de modèles open weight chinois devenant une infrastructure intégrée dans une plateforme grand public mondiale — que vous appeliez ou non l'API Qwen directement.