Nach drei Monaten Wartezeit ist DeepSeek V4 GA (General Availability) am 20. Juli 2026 live. Gegenüber der April-Vorschau liefert die Vollversion messbare Verbesserungen bei Agent-Orchestrierung, mathematischer Reasoning und Code-Generierung — plus erstmals Peak-Off-Peak-Tarife. Einzelentwickler, AI-Ingenieure und Teams, die noch deepseek-chat nutzen, finden hier die Entscheidungsgrundlage: Zeitlinie Preview→GA, V4-Pro/Flash-Architektur (CSA+HCA, mHC, Muon), Benchmark-Matrix, Vergleich GPT-5.6 / Claude Fable 5, Peak-Off-Peak-Kostenstrategie, 6-Schritte-API-Migration bis 24. Juli, zitierfähige Kennzahlen und FAQ.
SECTION 01 Welche Probleme löst DeepSeek V4 GA — und welche entstehen neu?
- Legacy-API-Ende:
deepseek-chatunddeepseek-reasonerwerden am 24. Juli 2026, 23:59 Uhr (Peking-Zeit) dauerhaft abgeschaltet — ungemigrierte Produktions-Calls brechen ab; - Peak-Off-Peak-Komplexität: Werktags-Hochlast (09:00–12:00 und 14:00–18:00 Peking-Zeit) verdoppelt die Tarife; Batch-Inferenz ohne Zeitplanung kann Budgets sprengen;
- Preview vs. GA-Leistungslücke: Die Vorschau war stark, GA bringt jedoch sichtbare Zugewinne bei Agent-Ketten und langen Code-Pfaden — Dokumentation aus April unterschätzt die Vollversion;
- Closed-Source-Kosten: Claude Fable 5 Output ~$50/M, GPT-5.6 Sol ~$15/M — Teams mit hoher API-Frequenz brauchen MIT-lizenzierbare Self-Hosting-Alternativen;
- 1M-Kontext-Realität: KV-Cache-Speicher, nicht Token-Zahlen auf dem Papier, ist der Engpass — die CSA+HCA-Architektur reduziert Speicherbedarf auf 10 % von V3.2.
Kernpositionierung: DeepSeek V4 GA ist 2026 einer der wichtigsten Open-Source-Meilensteine — bei 1/10 bis 1/100 der Closed-Source-Kosten liefert es die stärkste Gesamtleistung unter Open-Source-Modellen (SWE-bench Verified 80,6 %, Open-Source-Rekord) und etabliert erstmals ein diszipliniertes Peak-Off-Peak-Preismodell.
SECTION 02 DeepSeek V4 Zeitlinie: Von der Preview zur GA-Vollversion
| Datum | Ereignis |
|---|---|
| 24. April | V4-Preview live und Open Source (MIT): V4-Pro (1,6T) und V4-Flash (284B) |
| Mai | Produktions-tuned V4-Flash und V4-Pro, API allgemein verfügbar |
| Juni | V4-Pro Output dauerhaft −75 % ($0,87/M Tokens) — historisch günstigste Phase |
| 29. Juni | E-Mail an alle API-Nutzer: GA Mitte Juli, erstmals Peak-Off-Peak angekündigt |
| 19. Juli | GA-Grayscale für ausgewählte Entwickler; Medien: «Vollversion morgen» |
| 20. Juli | GA-Vollversion live (Veröffentlichungsdatum dieses Artikels) |
| 24. Juli | Legacy deepseek-chat und deepseek-reasoner endgültig offline |
SECTION 03 V4-Pro vs. V4-Flash: CSA+HCA-Architektur für 1M Kontext
| Spezifikation | V4-Pro | V4-Flash |
|---|---|---|
| Gesamtparameter | 1,6 Billionen (1,6T) | 284 Milliarden (284B) |
| Aktive Parameter/Token | 49 Milliarden (49B) | 13 Milliarden (13B) |
| Transformer-Layers | 61 | 43 |
| Kontextfenster | 1.000.000 Tokens | 1.000.000 Tokens |
| Max. Output | 384K Tokens | 384K Tokens |
| Präzision | FP4 (Experten) + FP8 (Rest) | FP4 + FP8 gemischt |
| Pretraining-Daten | 33T+ Tokens | 32T+ Tokens |
| Lizenz | MIT | MIT |
Klassische Transformer skalieren KV-Cache linear — 1M Tokens war praktisch undurchführbar. DeepSeek V4 adressiert das mit drei Architektur-Innovationen:
- Hybrid Attention (CSA + HCA): Compressed Sparse Attention (CSA) komprimiert KV-Sequenzen per Softmax-Gating 4×, wählt per FP4-«Lightning Indexer» top-k (Pro: 1024, Flash: 512) und behält ein 128-Token-Sliding-Window; Heavy Compressed Attention (HCA) komprimiert 128× für globale Dense Attention — abwechselnd mit CSA. Bei 1M Kontext: Inferenz-FLOPs 27 % von V3.2, KV-Cache-Speicher 10 % (Flash: 7 %).
- Manifold-Constrained Hyper-Connections (mHC): Vier Kanäle im Residual-Stream + doppelt-stochastische Matrix (Birkhoff-Polytop) stabilisieren Signalfluss über 61 Layer.
- Muon-Optimierer: Training mit Muon statt AdamW; Newton-Schulz-Orthogonalisierung der Gradienten — schnellere, stabilere Konvergenz.
| Modus | Merkmale | Einsatz |
|---|---|---|
| Non-think | Keine Chain-of-Thought, maximale Geschwindigkeit | Einfache Q&A, Routing |
| Think High | Explizites Reasoning (CoT-Tags) | Mittlere Komplexität, Code-Debug |
| Think Max | Maximale Reasoning-Tiefe, 384K+ Kontext empfohlen | Mathematik, lange Agent-Ketten |
Offizielle Sampling-Parameter: temperature=1.0, top_p=1.0 (alle Modi).
SECTION 04 Benchmark-Matrix: V4-Pro als Open-Source-Spitze
| Benchmark | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % (Open-Source-Rekord) | 96,0 % | nicht separat veröffentlicht | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench (Pass@1) | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3.206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
Laut Artificial Analysis: Claude Fable 5 kostet bei Strategy & Ops Index-Tasks $3,48 pro Lauf (Score 50), DeepSeek V4-Pro $0,03 (Score 38) — 116× Kostenunterschied bei ~12 Punkten Score-Gap (31 %). V4-Flash bleibt bei allen sechs Index-Kategorien unter $0,04 pro Lauf.
SECTION 05 DeepSeek V4 vs. GPT-5.6 und Claude Fable 5: Entscheidungsmatrix
| Dimension | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open Source / Self-Hosting | MIT, ja | Closed Source | Closed Source |
| Kontextfenster | 1M Tokens | nicht veröffentlicht | 1M Tokens |
| API-Output (Off-Peak) | $0,87/M | ~$15/M | $50/M |
| API-Output (Peak) | $1,74/M | — | — |
| Code-Fähigkeit | Sehr stark (nahe Fable 5) | Sehr stark | Stärkste (SWE-bench Pro führend) |
| Datenschutz / DSGVO | Private Deployment möglich — personenbezogene Daten bleiben in EU-kontrollierter Infrastruktur | Nur Cloud | Nur Cloud |
- Budget / hohe Frequenz / Self-Hosting: V4-Pro oder V4-Flash;
- Maximale Code-Qualität, Kosten egal: Claude Fable 5 (SWE-bench Pro 80,3 %);
- Algorithmen + Mathematik: GPT-5.6 Sol / Ultra;
- Massen-Log/Dokument-Verarbeitung: V4-Flash Cache-Hit Input nur $0,0028/M.
SECTION 06 Peak-Off-Peak-Tarife: Berechnung und vier Einsparmechanismen
GA-Neuheit: wie Stromtarife — Werktags-Hochlast verdoppelt Raten (Peking-Zeit 09:00–12:00, 14:00–18:00).
| Modell | Position | Off-Peak | Peak |
|---|---|---|---|
| V4-Pro | Input (Cache-Hit) | ¥0,025 / $0,0035 | 2× |
| V4-Pro | Input (Cache-Miss) | ¥3,00 / $0,435 | ¥6,00 / $0,87 |
| V4-Pro | Output | ¥6,00 / $0,87 | ¥12,00 / $1,74 |
| V4-Flash | Input (Cache-Hit) | ¥0,02 / $0,0028 | 2× |
| V4-Flash | Input (Cache-Miss) | ¥1,00 / $0,14 | ¥2,00 / $0,28 |
| V4-Flash | Output | ¥2,00 / $0,28 | ¥4,00 / $0,56 |
- Batch-Jobs in Off-Peak: Dokumentenverarbeitung, Annotation, Code-Review nach 18:00 oder vor 09:00 planen;
- Prompt Cache nutzen: V4-Flash Cache-Hit $0,0028/M — wiederholte System-Prompts strukturiert voranstellen;
- Flash als Router: einfache Intents an V4-Flash, komplexes Reasoning an V4-Pro;
- E-Mail-Benachrichtigungen: DeepSeek kündigt Tarifänderungen 24 Stunden vorher per Mail an.
Selbst in Peak-Zeiten: V4-Pro Output $1,74/M bleibt 8,6× günstiger als Claude Opus 4.8 ($15/M) und GPT-5.6 Sol (~$15/M).
SECTION 07 API-Migration vor deepseek-chat-Abschaltung: 6 Schritte
Warnung: deepseek-chat und deepseek-reasoner enden am 24. Juli 2026, 15:59 UTC (23:59 Peking-Zeit) dauerhaft.
| Legacy-Modell | Neues Modell | Hinweis |
|---|---|---|
deepseek-chat |
deepseek-v4-flash (Non-think) |
Schnell, leichte Tasks |
deepseek-reasoner |
deepseek-v4-flash (Think-Modus) |
Oder Upgrade auf deepseek-v4-pro |
- Codebase durchsuchen:
deepseek-chatunddeepseek-reasonerin Code, CI und Env-Vars finden. - Zielmodell wählen: leichte Dialoge →
deepseek-v4-flash; komplexes Reasoning →deepseek-v4-pro+ Think-Modus. - OpenAI SDK anpassen: nur
modeländern,base_urlbleibthttps://api.deepseek.com. - Think-Modus konfigurieren: via
extra_body, Budget ab 8000 Tokens empfohlen. - Staging validieren: E2E-Regression vor 24. Juli, Fokus Agent-Ketten und Cache-Hits.
- Produktion schalten: Canary-Rollout, Peak-Off-Peak-Kosten und Latenz überwachen.
LEGACY — ab 24. Juli ungültig
client.chat.completions.create(
model="deepseek-chat",
messages=[...]
)
NEU — V4-Pro mit Think-Modus
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
V4 unterstützt OpenAI ChatCompletions und Anthropic Messages — Anthropic SDK: nur model und base_url=https://api.deepseek.com anpassen.
SECTION 08 Zitierfähige Kennzahlen und Quellen
- Open-Source-Rekord: SWE-bench Verified 80,6 %, gleichauf mit Gemini 3.1 Pro unter Open Source.
- Kontext-Effizienz: KV-Cache bei 1M Tokens 10 % von V3.2 (Flash: 7 %).
- Preis-Leistung: V4-Pro Output Off-Peak $0,87/M, Peak $1,74/M.
- Migrations-Deadline: 2026-07-24 23:59 Peking-Zeit.
- Lizenz: V4-Pro und V4-Flash MIT, kommerzielle Nutzung erlaubt.
- Sampling:
temperature=1.0, top_p=1.0offiziell empfohlen.
Technische Details und Benchmarks nach Release erneut an den offiziellen Quellen prüfen:
DeepSeek API — offizielle Dokumentation
arXiv:2606.19348 — DeepSeek V4 Technisches Paper
Hugging Face — DeepSeek Modell-Repository
Artificial Analysis — Intelligence Index und Kostenvergleich
DeepSeek V4 GA schlägt Claude Fable 5 oder GPT-5.6 (noch) nicht in allen Benchmarks — sein Wert liegt in Open-Source-Spitzenleistung zu Bruchteil-Kosten. Wer jedoch iOS CI/CD auf Mac, Metal-beschleunigte Inferenz oder 7×24-Agent-Pipelines braucht, stößt bei reiner API-Nutzung an Grenzen: Datenresidenz und DSGVO-Compliance, lokale Mac-Ausfälle, VM-Hypervisor-Overhead ohne native Metal-Kompatibilität. Für native Apple-Compute ohne Overhead, stabiles iOS CI/CD und Agent-Automatisierung sind MACNOX Cloud-Physik-Macs die robustere Produktionsoption: 100 % Apple-Hardware, voller Root, null Hypervisor-Verlust, flexible Tages-/Wochen-/Monatsmiete. Vertiefung: Kimi K3 Open-Source-LLM-Test, DeepSeek Custom Silicon und Inferenz-Stack, GPT-5.6 Sol Ultra Mathematik-Benchmark.
SECTION 09 FAQ
Was unterscheidet DeepSeek V4 GA von der Preview?
Gleiche MoE+CSA/HCA-Architektur; GA optimiert Agent-Tasks, Mathematik und Code-Generierung und führt Peak-Off-Peak-Tarife ein. Preview war stark — GA ist produktionsreife Stabilität plus Kommerzialisierung.
Wann gilt Peak-Tarif?
Werktags Peking-Zeit 09:00–12:00 und 14:00–18:00, Raten verdoppelt. Wochenenden und Feiertage zählen als Off-Peak.
V4-Pro oder V4-Flash?
Flash: günstiger, schneller — Routing und leichte Tasks. Pro: stärkeres Reasoning — komplexer Code und lange Agent-Ketten. Empfehlung: Flash filtern, Pro eskalieren.
Wie lange läuft deepseek-chat noch?
Bis 24. Juli 2026, 23:59 Peking-Zeit. Migration auf deepseek-v4-flash oder deepseek-v4-pro vorher abschließen.
Schlägt DeepSeek V4 GPT-5.6?
Closed-Source-Flaggschiffe führen gesamt — V4-Pro führt aber LiveCodeBench und Codeforces und kostet ~1/17 von GPT-5.6. Entscheidung nach Szenario und Budget, nicht einem Score.
Kann ich DeepSeek V4 self-hosten?
Ja — MIT-Lizenz, Gewichte auf Hugging Face. Produktions-1,6T-MoE braucht große GPU-Cluster; Details in DeepSeek Inferenz-Stack.