Accueil / Blog / DeepSeek V4
ENGINEERING_BLOG · 2026.07.20

DeepSeek V4 GA :
tarifs, architecture et écart face à GPT-5.6

Trois mois après la preview d'avril, DeepSeek V4 GA est disponible depuis le 20 juillet 2026. La version générale apporte des gains mesurables sur l'orchestration d'agents, le raisonnement mathématique et la génération de code, avec une première tarification peak/off-peak. Développeurs indépendants, ingénieurs IA et équipes encore sur deepseek-chat trouveront ici une base de décision complète : chronologie preview→GA, architecture V4-Pro/Flash (CSA+HCA, mHC, Muon), benchmarks, comparaison GPT-5.6 / Claude Fable 5, stratégie peak/off-peak, guide de migration API en 6 étapes avant le 24 juillet, données citables et FAQ.

SECTION 01 Quels problèmes DeepSeek V4 GA résout-il — et lesquels crée-t-il ?

  • Fin des anciennes API : deepseek-chat et deepseek-reasoner seront coupés le 24 juillet 2026 à 23:59 (heure de Pékin) — toute production non migrée s'arrêtera ;
  • Complexité peak/off-peak : les heures de pointe en semaine (09:00–12:00 et 14:00–18:00, Pékin) doublent les tarifs ; l'inférence batch mal planifiée peut exploser le budget ;
  • Écart preview vs GA : la preview était déjà forte, mais la GA améliore visiblement les agents et les chaînes de code longues — une doc d'avril sous-estime la version finale ;
  • Pression des coûts closed source : Claude Fable 5 ~$50/M en sortie, GPT-5.6 Sol ~$15/M — les équipes à fort volume cherchent une alternative MIT auto-hébergeable ;
  • Seuil du contexte 1M : la mémoire KV Cache, pas le chiffre marketing, est le goulot — l'architecture CSA+HCA la ramène à 10 % de V3.2.

En une phrase : DeepSeek V4 GA marque 2026 comme l'un des jalons open source majeurs — à 1/10 à 1/100 du coût des flagship propriétaires, il offre la meilleure performance globale en open source (SWE-bench Verified 80,6 %, record) et instaure un modèle peak/off-peak structuré.

SECTION 02 Chronologie DeepSeek V4 : de la preview à la GA

Jalons DeepSeek V4 (2026)
Date Événement
24 avril Preview V4 en open source (MIT) : V4-Pro (1,6T) et V4-Flash (284B)
Mai Versions production V4-Flash et V4-Pro, API généralisée
Juin Baisse permanente −75 % sur la sortie V4-Pro ($0,87/M tokens)
29 juin E-mail API : GA mi-juillet, première annonce peak/off-peak
19 juillet Accès grayscale GA pour certains développeurs ; presse : « version complète demain »
20 juillet GA officielle (date de publication de cet article)
24 juillet Arrêt définitif de deepseek-chat et deepseek-reasoner

SECTION 03 V4-Pro et V4-Flash : architecture CSA+HCA pour 1M de contexte

Spécifications de la famille DeepSeek V4
Spécification V4-Pro V4-Flash
Paramètres totaux 1,6 billion (1,6T) 284 milliards (284B)
Paramètres actifs/token 49 milliards (49B) 13 milliards (13B)
Couches Transformer 61 43
Fenêtre de contexte 1 000 000 tokens 1 000 000 tokens
Sortie max. 384K tokens 384K tokens
Précision FP4 (experts) + FP8 (reste) FP4 + FP8 mixte
Données de pré-entraînement 33T+ tokens 32T+ tokens
Licence MIT MIT

Un Transformer classique fait croître le KV Cache linéairement — 1M tokens était quasi impossible. DeepSeek V4 y répond avec trois innovations :

  • Attention hybride (CSA + HCA) : la Compressed Sparse Attention (CSA) compresse la séquence KV par gating Softmax (×4), sélection top-k via indexeur FP4 (Pro : 1024, Flash : 512) et conserve une fenêtre glissante de 128 tokens ; la Heavy Compressed Attention (HCA) compresse ×128 pour une attention dense globale, en alternance avec la CSA. À 1M : FLOPs d'inférence 27 % de V3.2, mémoire KV 10 % (Flash : 7 %).
  • Hyper-connexions contraintes (mHC) : flux résiduel à quatre canaux + matrice doublement stochastique (polytope de Birkhoff) pour stabiliser 61 couches.
  • Optimiseur Muon : entraînement Muon (non AdamW), orthogonalisation Newton-Schulz des gradients — convergence plus rapide et stable.
Trois modes d'inférence
Mode Caractéristiques Usage
Non-think Sans chaîne de pensée, réponse rapide Q&R simples, routage
Think High Raisonnement explicite (tags CoT) Tâches moyennes, debug code
Think Max Raisonnement maximal, contexte 384K+ recommandé Maths, agents longue chaîne

Paramètres d'échantillonnage officiels : temperature=1.0, top_p=1.0 (tous modes).

SECTION 04 Benchmarks : V4-Pro en tête de l'open source

Résultats clés V4-Pro
Benchmark DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified 80,6 % (record open source) 96,0 % non publié séparément ~69 %
SWE-bench Pro 55,4 % 80,3 % 78,1 % 69,2 %
LiveCodeBench (Pass@1) 93,5 % 88,1 % 87,4 % 83,2 %
Codeforces Elo 3 206
Terminal-Bench 2.1 83,9 % 88,0 % 85,1 % 82,7 %

Selon Artificial Analysis : Claude Fable 5 coûte 3,48 $ par tâche Strategy & Ops (score 50), DeepSeek V4-Pro 0,03 $ (score 38) — écart de coût ×116 pour ~12 points de score (31 %). V4-Flash reste sous 0,04 $ sur les six catégories d'index.

SECTION 05 DeepSeek V4 vs GPT-5.6 et Claude Fable 5 : qui choisir ?

Trois flagship comparés
Dimension DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
Open source / auto-hébergement MIT, oui Propriétaire Propriétaire
Fenêtre de contexte 1M tokens non communiquée 1M tokens
Sortie API (off-peak) 0,87 $/M ~15 $/M 50 $/M
Sortie API (peak) 1,74 $/M
Capacité code Très forte (proche Fable 5) Très forte La plus forte (SWE-bench Pro)
Confidentialité des données Déploiement privé possible Cloud uniquement Cloud uniquement
  • Budget serré / fort volume / auto-hébergement : V4-Pro ou V4-Flash ;
  • Code maximal, coût secondaire : Claude Fable 5 (SWE-bench Pro 80,3 %) ;
  • Algorithmes et maths : GPT-5.6 Sol / Ultra ;
  • Traitement massif de logs/docs : V4-Flash cache hit à 0,0028 $/M en entrée.

SECTION 06 Tarification peak/off-peak : calcul et quatre leviers d'économie

Nouveauté GA : comme l'électricité horaire — heures de pointe en semaine à tarif double (Pékin 09:00–12:00, 14:00–18:00).

Grille complète V4-Pro / V4-Flash (par million de tokens)
Modèle Poste Off-peak Peak
V4-Pro Entrée (cache hit) ¥0,025 / 0,0035 $ ×2
V4-Pro Entrée (cache miss) ¥3,00 / 0,435 $ ¥6,00 / 0,87 $
V4-Pro Sortie ¥6,00 / 0,87 $ ¥12,00 / 1,74 $
V4-Flash Entrée (cache hit) ¥0,02 / 0,0028 $ ×2
V4-Flash Entrée (cache miss) ¥1,00 / 0,14 $ ¥2,00 / 0,28 $
V4-Flash Sortie ¥2,00 / 0,28 $ ¥4,00 / 0,56 $
  • Batch en off-peak : documents, annotation, revue de code après 18:00 ou avant 09:00 ;
  • Exploiter le Prompt Cache : V4-Flash cache hit 0,0028 $/M — system prompts structurés en tête ;
  • Flash en routeur : intents simples → V4-Flash, raisonnement complexe → V4-Pro ;
  • Alertes e-mail : DeepSeek prévient 24 h avant tout changement tarifaire.

Même en peak, la sortie V4-Pro à 1,74 $/M reste 8,6× moins chère que Claude Opus 4.8 (15 $/M) et GPT-5.6 Sol (~15 $/M).

SECTION 07 Migration API avant l'arrêt de deepseek-chat : 6 étapes

Alerte : deepseek-chat et deepseek-reasoner cessent le 24 juillet 2026 à 15:59 UTC (23:59 Pékin).

Correspondance de migration
Ancien modèle Nouveau modèle Note
deepseek-chat deepseek-v4-flash (mode non-think) Rapide, tâches légères
deepseek-reasoner deepseek-v4-flash (mode think) Ou upgrade deepseek-v4-pro
  1. Rechercher les anciens noms : deepseek-chat et deepseek-reasoner dans code, CI et variables d'environnement.
  2. Choisir le modèle cible : dialogue léger → deepseek-v4-flash ; raisonnement complexe → deepseek-v4-pro + think.
  3. Mettre à jour le SDK OpenAI : modifier uniquement model, base_url reste https://api.deepseek.com.
  4. Configurer le mode think : via extra_body, budget recommandé à partir de 8000 tokens.
  5. Valider en staging : régression E2E avant le 24 juillet, focus agents longue chaîne et cache.
  6. Bascule production : déploiement canary, surveillance coûts peak/off-peak et latence.
migrate_api.py
LEGACY — invalide apres le 24 juillet
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

NOUVEAU — V4-Pro avec mode think
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

V4 accepte OpenAI ChatCompletions et Anthropic Messages — SDK Anthropic : mettre à jour model et base_url=https://api.deepseek.com.

SECTION 08 Données citables et sources

  • Record open source : SWE-bench Verified 80,6 %, ex aequo Gemini 3.1 Pro en open source.
  • Efficacité contexte : KV Cache à 1M tokens = 10 % de V3.2 (Flash : 7 %).
  • Rapport qualité-prix : sortie V4-Pro off-peak 0,87 $/M, peak 1,74 $/M.
  • Deadline migration : 2026-07-24 23:59 heure de Pékin.
  • Licence : V4-Pro et V4-Flash MIT, usage commercial autorisé.
  • Échantillonnage : temperature=1.0, top_p=1.0 recommandé officiellement.

Vérifier après publication les détails techniques et benchmarks auprès des sources officielles :

Documentation API DeepSeek

arXiv:2606.19348 — article technique DeepSeek V4

Hugging Face — dépôt de modèles DeepSeek

Artificial Analysis — Intelligence Index et coûts

DeepSeek V4 GA ne bat pas encore Claude Fable 5 ou GPT-5.6 sur tous les benchmarks — sa valeur est une performance open source de premier plan à coût minimal. Pour les équipes créatives sur écosystème Apple qui ont besoin de CI/CD iOS sur Mac, inférence accélérée Metal ou pipelines d'agents 7×24, l'API seule montre ses limites : résidence des données, Mac local éteint, VMs sans Metal natif. Pour une puissance Apple native sans surcharge, CI iOS stable et automatisation d'agents, les Mac physiques cloud MACNOX restent l'option production la plus cohérente : matériel Apple 100 %, Root complet, zéro overhead hyperviseur, location flexible au jour/semaine/mois. Voir aussi test Kimi K3 open source, silicium custom DeepSeek et inférence, GPT-5.6 Sol Ultra et raisonnement mathématique.

SECTION 09 FAQ

Quelle différence entre DeepSeek V4 GA et la preview ?

Même architecture MoE + CSA/HCA ; la GA optimise agents, maths et code et introduit peak/off-peak. La preview était déjà forte — la GA apporte stabilité production et commercialisation.

Quelles sont les heures peak ?

En semaine, heure de Pékin 09:00–12:00 et 14:00–18:00, tarif double. Week-ends et jours fériés : off-peak.

V4-Pro ou V4-Flash ?

Flash : moins cher, plus rapide — routage et tâches légères. Pro : raisonnement plus fort — code complexe et agents longs. Recommandation : Flash en filtre, Pro en escalade.

Combien de temps reste deepseek-chat ?

Jusqu'au 24 juillet 2026, 23:59 heure de Pékin. Migrer vers deepseek-v4-flash ou deepseek-v4-pro avant cette date.

DeepSeek V4 bat-il GPT-5.6 ?

Les flagship propriétaires restent en tête globalement — V4-Pro mène LiveCodeBench et Codeforces à ~1/17 du coût GPT-5.6. Choisir selon scénario et budget, pas un seul score.

Peut-on auto-héberger DeepSeek V4 ?

Oui — licence MIT, poids sur Hugging Face. Un MoE 1,6T production exige un large cluster GPU ; voir stack d'inférence DeepSeek.