Le 31 juillet 2026, DeepSeek a promu deepseek-v4-flash en build API public officiel (V4-Flash-0731) : même architecture 284B que la preview d'avril, seul le post-entraînement a changé. Sur les benchmarks Agent, le modèle dépasse désormais la preview V4-Pro plus lourde de DeepSeek pour environ 1/36 à 1/179 du tarif catalogue Claude Opus 4.8. Ce décryptage s'adresse aux équipes qui évaluent une migration API DeepSeek et l'économie des LLM open weight chinois. Chronologie avril–août, grilles tarifaires, notes d'architecture, comparaison avec Kimi K3 et Qwen3.8-Max, caveats Harness et le framing communautaire chinois de la « kill line ». Le flagship V4-Pro GA et le framework Agent maison Harness restent non livrés au 5 août.
SECTION 01 Pourquoi les titres V4-Flash embrouillent les équipes production
- « Officiel » n'est pas un nouveau modèle : 0731 est identique en taille et structure à la preview d'avril ; les gains viennent d'un nouveau passage de post-entraînement, pas d'un scale-up ;
- V4-Pro GA toujours absent : seule l'API preview d'avril existe ; le changelog dit « as soon as possible » sans date ; les rumeurs de fenêtre 10–20 août ne sont pas confirmées par DeepSeek ;
- Les scores Agent dépendent du harness : les chiffres Terminal Bench 2.0 utilisent le « minimal mode » de Harness, encore non publié ; le changelog DeepSeek avertit que les scores sont extrêmement sensibles au choix de harness ;
- Les alias legacy sont morts :
deepseek-chatetdeepseek-reasonerretirés le 24 juillet ; les appels production non migrés cassent ; - Déploiement API uniquement : la mise à jour du 31 juillet touche l'API seule ; l'app grand public et le chat web sont restés inchangés à la publication ;
- Pas #1 sur les indices indépendants : Artificial Analysis Intelligence Index place V4-Flash à ~50, sous Kimi K3 (~57) et GLM-5.2 — DeepSeek optimise pour « assez bon + prix plancher », pas pour la couronne des leaderboards.
En bref : un modèle 284B/13B actifs bat désormais une preview 1,6T/49B de la même famille sur plusieurs tâches Agent — la qualité de post-entraînement fin 2026 rivalise avec le nombre brut de paramètres.
SECTION 02 Chronologie et snapshot tarifaire éditeur (5 août 2026)
- 24 avril 2026 : preview V4 — V4-Pro (1,6T/49B actifs) et V4-Flash (284B/13B actifs), contexte 1M, poids MIT open ;
- 24 juillet 2026 : alias legacy retirés ; le trafic route vers la nomenclature V4 ;
- 27 juillet 2026 : Moonshot AI open weights Kimi K3 (2,8T), renforce la pression concurrentielle ;
- 31 juillet 2026 : beta API publique V4-Flash-0731 ; poids MIT sur Hugging Face ; changelog nomme le framework Agent Harness « to be released soon » ;
- 5 août 2026 : V4-Pro GA toujours non confirmé ; certains médias chinois citent des sources anonymes sur des tests internes et une fenêtre 10–20 août — traiter comme rumeur jusqu'à confirmation DeepSeek.
| Modèle | Statut | Total / actif | Entrée ($/M, miss / hit) | Sortie ($/M) |
|---|---|---|---|---|
| V4-Flash-0731 | Officiel | 284B / 13B | 0,14 $ / 0,0028 $ | 0,28 $ |
| V4-Pro | Preview uniquement | 1,6T / 49B | 0,435 $ / 0,003625 $ | 0,87 $ |
| Kimi K3 | Open weights (27 juil.) | 2,8T / ~104B (est. communauté) | 3,00 $ / 0,30 $ | 15,00 $ |
| GLM-5.2 | Open (juin 2026) | ~744B / ~40B | Non vérifié ici | Non vérifié ici |
| Qwen3.8-Max | API GA (2 août) ; poids en attente | 2,4T / 95B | 2,00 $ / ~0,17–0,25 $ | 6,00 $ |
| Note | Tous tarifs catalogue éditeur ; DeepSeek a annoncé une future surcharge 2× aux heures de pointe (Pékin 9h–12h, 14h–18h) sans date d'effet | |||
SECTION 03 Même architecture, nouvel entraînement : CSA+HCA, mHC, Muon et Harness
V4-Flash-0731 est identique en nombre de paramètres et en structure à la preview d'avril. DeepSeek attribue le bond des benchmarks Agent entièrement au re-post-entraînement. Le rapport technique « DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence » décrit trois changements architecturaux hérités de la preview :
- Attention hybride (CSA + HCA) : commercialisée comme attention sparse DSA pour réduire compute et mémoire en long contexte ;
- Manifold-Constrained Hyper-Connections (mHC) : amélioration des connexions résiduelles ;
- Optimiseur Muon : convergence plus rapide et stabilité d'entraînement.
Efficacité rapportée par l'éditeur (aucune reproduction indépendante vue) : à 1M tokens, V4-Pro nécessite 27 % des FLOPs par token de V3.2 et 10 % d'empreinte KV cache.
Le 31 juillet marque aussi la première mention officielle de DeepSeek Harness — framework Agent maison positionné face à Claude Code. Les travaux Agent antérieurs s'appuyaient sur Claude Code et OpenCode. Les scores Agent publiés (Terminal Bench 2.0, Toolathlon) utilisaient le Harness minimal mode (max effort, top_p 0.95, temperature 1.0) avant la sortie publique. Changelog DeepSeek : les scores Agent sont « extremely sensitive to harness choice ».
| Modèle | Intelligence Index | Coût moy. / tâche | Coût vs V4-Flash |
|---|---|---|---|
| V4-Flash-0731 | 50 | 0,03 $ | 1× |
| Kimi K3 | 57 | 0,86 $ | ~29× |
| GPT-5.6 Sol | 9+ pts de plus | 1,86 $ | ~62× |
| Claude Fable 5 | 9+ pts de plus | 3,15 $ | ~105× |
| Conclusion | Pas le score le plus élevé, mais le moins cher par tâche — conçu pour les workloads Agent et batch à fort volume | ||
SECTION 04 Caveats de benchmarks et checklist de migration API en 6 étapes
À séparer du récit marketing :
- Lock-in Harness : V4-Flash-0731 Terminal Bench 2.0 à 82,7 (vs preview V4-Pro 67,9) a utilisé le Harness minimal mode non publié — ne pas porter aveuglément vers Claude Code ou Cursor ;
- Plaintes d'usabilité : 21st Century Business Herald, citant des retours de développeurs à l'étranger, signale de faibles taux de cache-hit en entrée et des timeouts occasionnels du classificateur de sécurité sur le build officiel ;
- Rumeurs de financement / IPO : les médias citent une levée d'environ 7,4 Md$ à une valorisation d'environ 48,7 Md$ selon des sources anonymes — non confirmé par DeepSeek ni par des dépôts réglementaires.
- Vérifier le nom de modèle : la production doit appeler
deepseek-v4-flash(route vers 0731) ; retirerdeepseek-chat/deepseek-reasoner; - Tester la compatibilité SDK : les endpoints OpenAI ChatCompletions et format Anthropic fonctionnent sans changement structurel de code ;
- Optimiser le cache : l'entrée cache-hit coûte 0,0028 $/M — surveiller les taux de hit (retours communautaires parfois bas) ;
- Anticiper le tarif de pointe : surcharge 2× annoncée en heures ouvrées heure de Pékin — batch jobs hors 9h–12h et 14h–18h ;
- A/B sur votre charge : tester en aveugle contre Kimi K3 et Qwen3.8-Max ; ne pas se fier aux seuls scores Harness éditeur ;
- Séparer API et grand public : le 31 juillet n'a touché que l'API — valider l'expérience app utilisateur final séparément.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Résumer V4-Flash-0731 vs preview."}]
)
print(response.choices[0].message.content)
SECTION 05 La kill line chinoise, faits citables et sources
- 284B / 13B actifs, poids MIT : poids officiels 0731 sur Hugging Face, fine-tuning commercial et redistribution autorisés ;
- vs tarif catalogue Claude Opus 4.8 : 21st Century Business Herald cite ~36× moins cher en entrée cache-miss, ~179× en cache-hit, ~89× en sortie (prix éditeur, non audités) ;
- Sept semaines en tête d'OpenRouter : la preview V4-Flash aurait mené les classements d'usage sept semaines d'affilée — preuve marché de la stratégie « assez bon + le moins cher » ;
- « Kill line » (斩杀线) : argot dev chinois pour la barre prix-performance de DeepSeek — les concurrents doivent clairement battre en capacité ou sous-coter ; aide à expliquer la baisse de 80 % du prix de GPT-5.6 Luna dans la même fenêtre ;
- Réaction chip modérée : Nvidia, Broadcom, AMD ont à peine bougé le 31 juillet — les marchés traitent désormais « l'efficacité DeepSeek » comme de l'ingénierie normale, contrairement au sell-off R1 de 2025.
Avant la sortie de 0731, les forums moquaient le fondateur Liang Wenfeng sous le surnom « Liang Baikai » (promesse vide) pour les retards V4-Pro ; après que le build Flash a dépassé les attentes, les surnoms sont repassés à « Liang Sheng » (le sage) — baromètre rapide du sentiment.
Sources officielles et tierces — vérifier après toute mise à jour upstream :
Documentation API officielle DeepSeek et changelog
Hugging Face : fiche modèle deepseek-ai/DeepSeek-V4-Flash
Artificial Analysis : Intelligence Index indépendant
Les pipelines Agent construits sur DeepSeek V4 ont toujours besoin d'une CI macOS stable pour les builds Xcode, Metal et l'automatisation iOS. Les environnements Mac virtualisés ajoutent un overhead hyperviseur et un risque de compatibilité. Pour les équipes production qui exigent un calcul natif Apple silicon sans perte, une CI/CD iOS stable et une automatisation Agent 24/7, les nœuds Mac physiques dédiés MACNOX sont généralement le meilleur choix : matériel Apple authentique, Root complet, pas de pénalité hyperviseur, facturation flexible au jour/semaine/mois. Voir aussi tarifs et architecture DeepSeek V4 GA et analyse des classements OpenRouter de juillet.
SECTION 07 FAQ
Qu'a changé entre V3.2 et V4 ?
Contexte natif 1M tokens avec compute et mémoire long contexte bien plus bas (données éditeur : V4-Pro à 1M tokens utilise 27 % des FLOPs de V3.2 et 10 % de KV cache). V4 ajoute un entraînement orienté Agent et fonctionne avec Claude Code, OpenCode et outils similaires.
V4 Flash ou V4 Pro au quotidien ?
Pour le chat, les batch jobs ou les Agents à fort volume et faible coût, V4-Flash-0731 officiel offre le meilleur rapport qualité-prix et bat déjà la preview V4-Pro sur les scores Agent. Pour la connaissance du monde la plus profonde et le raisonnement complexe avec budget, la preview V4-Pro reste une option jusqu'au GA officiel.
Le V4-Pro GA est-il disponible ?
Non au 5 août 2026. Seul V4-Flash-0731 est officiel, API uniquement. V4-Pro GA et Harness sont « as soon as possible » sans date confirmée ; les rumeurs 10–20 août ne sont pas vérifiées.
Peut-on faire confiance aux benchmarks DeepSeek ?
Partiellement. Les benchmarks tiers largement adoptés comme SWE-bench Verified ont plus de poids. Les scores Agent (Terminal Bench 2.0, etc.) ont utilisé Harness non publié — attendre une reproduction indépendante avec Claude Code, Cursor ou d'autres harnesses.
Qu'implique cela pour mon intégration API ?
Les clients format OpenAI et Anthropic ne nécessitent aucun changement de code — deepseek-v4-flash se met à jour automatiquement vers 0731. Si vous appelez encore deepseek-chat ou deepseek-reasoner retirés, migrez immédiatement (retirés le 24 juillet).