Startseite / Blog / DeepSeek V4
ENGINEERING_BLOG · 2026.07.20

DeepSeek V4 GA:
Preise, Architektur und Performance vs. GPT-5.6

Nach drei Monaten Wartezeit ist DeepSeek V4 GA (General Availability) am 20. Juli 2026 live. Gegenüber der April-Vorschau liefert die Vollversion messbare Verbesserungen bei Agent-Orchestrierung, mathematischer Reasoning und Code-Generierung — plus erstmals Peak-Off-Peak-Tarife. Einzelentwickler, AI-Ingenieure und Teams, die noch deepseek-chat nutzen, finden hier die Entscheidungsgrundlage: Zeitlinie Preview→GA, V4-Pro/Flash-Architektur (CSA+HCA, mHC, Muon), Benchmark-Matrix, Vergleich GPT-5.6 / Claude Fable 5, Peak-Off-Peak-Kostenstrategie, 6-Schritte-API-Migration bis 24. Juli, zitierfähige Kennzahlen und FAQ.

SECTION 01 Welche Probleme löst DeepSeek V4 GA — und welche entstehen neu?

  • Legacy-API-Ende: deepseek-chat und deepseek-reasoner werden am 24. Juli 2026, 23:59 Uhr (Peking-Zeit) dauerhaft abgeschaltet — ungemigrierte Produktions-Calls brechen ab;
  • Peak-Off-Peak-Komplexität: Werktags-Hochlast (09:00–12:00 und 14:00–18:00 Peking-Zeit) verdoppelt die Tarife; Batch-Inferenz ohne Zeitplanung kann Budgets sprengen;
  • Preview vs. GA-Leistungslücke: Die Vorschau war stark, GA bringt jedoch sichtbare Zugewinne bei Agent-Ketten und langen Code-Pfaden — Dokumentation aus April unterschätzt die Vollversion;
  • Closed-Source-Kosten: Claude Fable 5 Output ~$50/M, GPT-5.6 Sol ~$15/M — Teams mit hoher API-Frequenz brauchen MIT-lizenzierbare Self-Hosting-Alternativen;
  • 1M-Kontext-Realität: KV-Cache-Speicher, nicht Token-Zahlen auf dem Papier, ist der Engpass — die CSA+HCA-Architektur reduziert Speicherbedarf auf 10 % von V3.2.

Kernpositionierung: DeepSeek V4 GA ist 2026 einer der wichtigsten Open-Source-Meilensteine — bei 1/10 bis 1/100 der Closed-Source-Kosten liefert es die stärkste Gesamtleistung unter Open-Source-Modellen (SWE-bench Verified 80,6 %, Open-Source-Rekord) und etabliert erstmals ein diszipliniertes Peak-Off-Peak-Preismodell.

SECTION 02 DeepSeek V4 Zeitlinie: Von der Preview zur GA-Vollversion

DeepSeek V4 Meilensteine (2026)
Datum Ereignis
24. April V4-Preview live und Open Source (MIT): V4-Pro (1,6T) und V4-Flash (284B)
Mai Produktions-tuned V4-Flash und V4-Pro, API allgemein verfügbar
Juni V4-Pro Output dauerhaft −75 % ($0,87/M Tokens) — historisch günstigste Phase
29. Juni E-Mail an alle API-Nutzer: GA Mitte Juli, erstmals Peak-Off-Peak angekündigt
19. Juli GA-Grayscale für ausgewählte Entwickler; Medien: «Vollversion morgen»
20. Juli GA-Vollversion live (Veröffentlichungsdatum dieses Artikels)
24. Juli Legacy deepseek-chat und deepseek-reasoner endgültig offline

SECTION 03 V4-Pro vs. V4-Flash: CSA+HCA-Architektur für 1M Kontext

DeepSeek V4 Modellfamilie — Spezifikationen
Spezifikation V4-Pro V4-Flash
Gesamtparameter 1,6 Billionen (1,6T) 284 Milliarden (284B)
Aktive Parameter/Token 49 Milliarden (49B) 13 Milliarden (13B)
Transformer-Layers 61 43
Kontextfenster 1.000.000 Tokens 1.000.000 Tokens
Max. Output 384K Tokens 384K Tokens
Präzision FP4 (Experten) + FP8 (Rest) FP4 + FP8 gemischt
Pretraining-Daten 33T+ Tokens 32T+ Tokens
Lizenz MIT MIT

Klassische Transformer skalieren KV-Cache linear — 1M Tokens war praktisch undurchführbar. DeepSeek V4 adressiert das mit drei Architektur-Innovationen:

  • Hybrid Attention (CSA + HCA): Compressed Sparse Attention (CSA) komprimiert KV-Sequenzen per Softmax-Gating 4×, wählt per FP4-«Lightning Indexer» top-k (Pro: 1024, Flash: 512) und behält ein 128-Token-Sliding-Window; Heavy Compressed Attention (HCA) komprimiert 128× für globale Dense Attention — abwechselnd mit CSA. Bei 1M Kontext: Inferenz-FLOPs 27 % von V3.2, KV-Cache-Speicher 10 % (Flash: 7 %).
  • Manifold-Constrained Hyper-Connections (mHC): Vier Kanäle im Residual-Stream + doppelt-stochastische Matrix (Birkhoff-Polytop) stabilisieren Signalfluss über 61 Layer.
  • Muon-Optimierer: Training mit Muon statt AdamW; Newton-Schulz-Orthogonalisierung der Gradienten — schnellere, stabilere Konvergenz.
Drei Inferenzmodi
Modus Merkmale Einsatz
Non-think Keine Chain-of-Thought, maximale Geschwindigkeit Einfache Q&A, Routing
Think High Explizites Reasoning (CoT-Tags) Mittlere Komplexität, Code-Debug
Think Max Maximale Reasoning-Tiefe, 384K+ Kontext empfohlen Mathematik, lange Agent-Ketten

Offizielle Sampling-Parameter: temperature=1.0, top_p=1.0 (alle Modi).

SECTION 04 Benchmark-Matrix: V4-Pro als Open-Source-Spitze

V4-Pro Kernergebnisse
Benchmark DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified 80,6 % (Open-Source-Rekord) 96,0 % nicht separat veröffentlicht ~69 %
SWE-bench Pro 55,4 % 80,3 % 78,1 % 69,2 %
LiveCodeBench (Pass@1) 93,5 % 88,1 % 87,4 % 83,2 %
Codeforces Elo 3.206
Terminal-Bench 2.1 83,9 % 88,0 % 85,1 % 82,7 %

Laut Artificial Analysis: Claude Fable 5 kostet bei Strategy & Ops Index-Tasks $3,48 pro Lauf (Score 50), DeepSeek V4-Pro $0,03 (Score 38) — 116× Kostenunterschied bei ~12 Punkten Score-Gap (31 %). V4-Flash bleibt bei allen sechs Index-Kategorien unter $0,04 pro Lauf.

SECTION 05 DeepSeek V4 vs. GPT-5.6 und Claude Fable 5: Entscheidungsmatrix

Drei Flaggschiffe im Vergleich
Dimension DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
Open Source / Self-Hosting MIT, ja Closed Source Closed Source
Kontextfenster 1M Tokens nicht veröffentlicht 1M Tokens
API-Output (Off-Peak) $0,87/M ~$15/M $50/M
API-Output (Peak) $1,74/M
Code-Fähigkeit Sehr stark (nahe Fable 5) Sehr stark Stärkste (SWE-bench Pro führend)
Datenschutz / DSGVO Private Deployment möglich — personenbezogene Daten bleiben in EU-kontrollierter Infrastruktur Nur Cloud Nur Cloud
  • Budget / hohe Frequenz / Self-Hosting: V4-Pro oder V4-Flash;
  • Maximale Code-Qualität, Kosten egal: Claude Fable 5 (SWE-bench Pro 80,3 %);
  • Algorithmen + Mathematik: GPT-5.6 Sol / Ultra;
  • Massen-Log/Dokument-Verarbeitung: V4-Flash Cache-Hit Input nur $0,0028/M.

SECTION 06 Peak-Off-Peak-Tarife: Berechnung und vier Einsparmechanismen

GA-Neuheit: wie Stromtarife — Werktags-Hochlast verdoppelt Raten (Peking-Zeit 09:00–12:00, 14:00–18:00).

V4-Pro / V4-Flash vollständige Preistabelle (pro Million Tokens)
Modell Position Off-Peak Peak
V4-Pro Input (Cache-Hit) ¥0,025 / $0,0035
V4-Pro Input (Cache-Miss) ¥3,00 / $0,435 ¥6,00 / $0,87
V4-Pro Output ¥6,00 / $0,87 ¥12,00 / $1,74
V4-Flash Input (Cache-Hit) ¥0,02 / $0,0028
V4-Flash Input (Cache-Miss) ¥1,00 / $0,14 ¥2,00 / $0,28
V4-Flash Output ¥2,00 / $0,28 ¥4,00 / $0,56
  • Batch-Jobs in Off-Peak: Dokumentenverarbeitung, Annotation, Code-Review nach 18:00 oder vor 09:00 planen;
  • Prompt Cache nutzen: V4-Flash Cache-Hit $0,0028/M — wiederholte System-Prompts strukturiert voranstellen;
  • Flash als Router: einfache Intents an V4-Flash, komplexes Reasoning an V4-Pro;
  • E-Mail-Benachrichtigungen: DeepSeek kündigt Tarifänderungen 24 Stunden vorher per Mail an.

Selbst in Peak-Zeiten: V4-Pro Output $1,74/M bleibt 8,6× günstiger als Claude Opus 4.8 ($15/M) und GPT-5.6 Sol (~$15/M).

SECTION 07 API-Migration vor deepseek-chat-Abschaltung: 6 Schritte

Warnung: deepseek-chat und deepseek-reasoner enden am 24. Juli 2026, 15:59 UTC (23:59 Peking-Zeit) dauerhaft.

Migrations-Mapping
Legacy-Modell Neues Modell Hinweis
deepseek-chat deepseek-v4-flash (Non-think) Schnell, leichte Tasks
deepseek-reasoner deepseek-v4-flash (Think-Modus) Oder Upgrade auf deepseek-v4-pro
  1. Codebase durchsuchen: deepseek-chat und deepseek-reasoner in Code, CI und Env-Vars finden.
  2. Zielmodell wählen: leichte Dialoge → deepseek-v4-flash; komplexes Reasoning → deepseek-v4-pro + Think-Modus.
  3. OpenAI SDK anpassen: nur model ändern, base_url bleibt https://api.deepseek.com.
  4. Think-Modus konfigurieren: via extra_body, Budget ab 8000 Tokens empfohlen.
  5. Staging validieren: E2E-Regression vor 24. Juli, Fokus Agent-Ketten und Cache-Hits.
  6. Produktion schalten: Canary-Rollout, Peak-Off-Peak-Kosten und Latenz überwachen.
migrate_api.py
LEGACY — ab 24. Juli ungültig
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

NEU — V4-Pro mit Think-Modus
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

V4 unterstützt OpenAI ChatCompletions und Anthropic Messages — Anthropic SDK: nur model und base_url=https://api.deepseek.com anpassen.

SECTION 08 Zitierfähige Kennzahlen und Quellen

  • Open-Source-Rekord: SWE-bench Verified 80,6 %, gleichauf mit Gemini 3.1 Pro unter Open Source.
  • Kontext-Effizienz: KV-Cache bei 1M Tokens 10 % von V3.2 (Flash: 7 %).
  • Preis-Leistung: V4-Pro Output Off-Peak $0,87/M, Peak $1,74/M.
  • Migrations-Deadline: 2026-07-24 23:59 Peking-Zeit.
  • Lizenz: V4-Pro und V4-Flash MIT, kommerzielle Nutzung erlaubt.
  • Sampling: temperature=1.0, top_p=1.0 offiziell empfohlen.

Technische Details und Benchmarks nach Release erneut an den offiziellen Quellen prüfen:

DeepSeek API — offizielle Dokumentation

arXiv:2606.19348 — DeepSeek V4 Technisches Paper

Hugging Face — DeepSeek Modell-Repository

Artificial Analysis — Intelligence Index und Kostenvergleich

DeepSeek V4 GA schlägt Claude Fable 5 oder GPT-5.6 (noch) nicht in allen Benchmarks — sein Wert liegt in Open-Source-Spitzenleistung zu Bruchteil-Kosten. Wer jedoch iOS CI/CD auf Mac, Metal-beschleunigte Inferenz oder 7×24-Agent-Pipelines braucht, stößt bei reiner API-Nutzung an Grenzen: Datenresidenz und DSGVO-Compliance, lokale Mac-Ausfälle, VM-Hypervisor-Overhead ohne native Metal-Kompatibilität. Für native Apple-Compute ohne Overhead, stabiles iOS CI/CD und Agent-Automatisierung sind MACNOX Cloud-Physik-Macs die robustere Produktionsoption: 100 % Apple-Hardware, voller Root, null Hypervisor-Verlust, flexible Tages-/Wochen-/Monatsmiete. Vertiefung: Kimi K3 Open-Source-LLM-Test, DeepSeek Custom Silicon und Inferenz-Stack, GPT-5.6 Sol Ultra Mathematik-Benchmark.

SECTION 09 FAQ

Was unterscheidet DeepSeek V4 GA von der Preview?

Gleiche MoE+CSA/HCA-Architektur; GA optimiert Agent-Tasks, Mathematik und Code-Generierung und führt Peak-Off-Peak-Tarife ein. Preview war stark — GA ist produktionsreife Stabilität plus Kommerzialisierung.

Wann gilt Peak-Tarif?

Werktags Peking-Zeit 09:00–12:00 und 14:00–18:00, Raten verdoppelt. Wochenenden und Feiertage zählen als Off-Peak.

V4-Pro oder V4-Flash?

Flash: günstiger, schneller — Routing und leichte Tasks. Pro: stärkeres Reasoning — komplexer Code und lange Agent-Ketten. Empfehlung: Flash filtern, Pro eskalieren.

Wie lange läuft deepseek-chat noch?

Bis 24. Juli 2026, 23:59 Peking-Zeit. Migration auf deepseek-v4-flash oder deepseek-v4-pro vorher abschließen.

Schlägt DeepSeek V4 GPT-5.6?

Closed-Source-Flaggschiffe führen gesamt — V4-Pro führt aber LiveCodeBench und Codeforces und kostet ~1/17 von GPT-5.6. Entscheidung nach Szenario und Budget, nicht einem Score.

Kann ich DeepSeek V4 self-hosten?

Ja — MIT-Lizenz, Gewichte auf Hugging Face. Produktions-1,6T-MoE braucht große GPU-Cluster; Details in DeepSeek Inferenz-Stack.