Am 31. Juli 2026 hat DeepSeek deepseek-v4-flash als offiziellen öffentlichen API-Build (V4-Flash-0731) freigegeben: dieselbe 284B-Architektur wie die April-Preview, nur das Post-Training wurde erneuert. Auf Agent-Benchmarks schlägt das Modell jetzt DeepSeeks eigenes größeres V4-Pro-Preview bei etwa 1/36 bis 1/179 des Claude-Opus-4.8-Listenpreises. Dieser Leitfaden richtet sich an Teams, die DeepSeek-API-Migration und die Ökonomie chinesischer Open-Weight-LLMs bewerten. Enthalten: Timeline April–August, Preistabellen, Architekturhinweise, Vergleich mit Kimi K3 und Qwen3.8-Max, Harness-Caveats und das chinesische „Kill-Line“-Framing. Das Flagship V4-Pro GA und das hauseigene Harness-Agent-Framework sind zum 5. August weiterhin nicht ausgeliefert.
SECTION 01 Warum V4-Flash-Schlagzeilen Produktionsteams verwirren
- „Offiziell“ ist kein neues Modell: 0731 ist in Größe und Struktur identisch mit der April-Preview; die Gewinne stammen aus einem frischen Post-Training-Pass, nicht aus Skalierung;
- V4-Pro GA fehlt weiter: nur die April-Preview-API existiert; Changelog sagt „as soon as possible“ ohne Datum; Gerüchte über ein Fenster 10.–20. August sind von DeepSeek nicht bestätigt;
- Agent-Scores sind harness-abhängig: Terminal Bench 2.0-Werte nutzen das noch nicht veröffentlichte Harness „minimal mode“; DeepSeeks Changelog warnt, Scores seien extrem sensitiv auf Harness-Wahl;
- Legacy-Aliase sind tot:
deepseek-chatunddeepseek-reasonerwurden am 24. Juli eingestellt; nicht migrierte Produktionsaufrufe brechen; - Nur API-Rollout: Das Update vom 31. Juli betrifft ausschließlich die API; Consumer-App und Web-Chat blieben zum Redaktionsschluss unberührt;
- Kein #1 auf unabhängigen Indizes: Artificial Analysis Intelligence Index setzt V4-Flash auf ~50, unter Kimi K3 (~57) und GLM-5.2 — DeepSeek optimiert für „gut genug + Tiefstpreis“, nicht für Leaderboard-Krone.
Kernpunkt: Ein 284B/13B-aktives Modell schlägt jetzt eine 1,6T/49B-Preview derselben Familie auf mehreren Agent-Tasks — Post-Training-Qualität konkurriert Ende 2026 mit roher Parameterzahl.
SECTION 02 Timeline und Hersteller-Preissnapshot (5. August 2026)
- 24. April 2026: V4-Preview — V4-Pro (1,6T/49B aktiv) und V4-Flash (284B/13B aktiv), 1M Kontext, MIT Open Weights;
- 24. Juli 2026: Legacy-Aliase eingestellt; Traffic routet auf V4-Namensgebung;
- 27. Juli 2026: Moonshot AI open-weights Kimi K3 (2,8T), verschärft Wettbewerbsdruck;
- 31. Juli 2026: V4-Flash-0731 öffentliche API-Beta; MIT-Gewichte auf Hugging Face; Changelog nennt Harness-Agent-Framework „to be released soon“;
- 5. August 2026: V4-Pro GA weiter unbestätigt; chinesische Medien zitieren anonyme Quellen zu internen Tests und einem Fenster 10.–20. August — als Gerücht behandeln, bis DeepSeek bestätigt.
| Modell | Status | Gesamt / aktiv | Input ($/M, miss / hit) | Output ($/M) |
|---|---|---|---|---|
| V4-Flash-0731 | Offiziell | 284B / 13B | $0,14 / $0,0028 | $0,28 |
| V4-Pro | Nur Preview | 1,6T / 49B | $0,435 / $0,003625 | $0,87 |
| Kimi K3 | Open Weights (27. Juli) | 2,8T / ~104B (Community-Schätzung) | $3,00 / $0,30 | $15,00 |
| GLM-5.2 | Open (Juni 2026) | ~744B / ~40B | Hier nicht verifiziert | Hier nicht verifiziert |
| Qwen3.8-Max | API GA (2. Aug.); Gewichte ausstehend | 2,4T / 95B | $2,00 / ~$0,17–0,25 | $6,00 |
| Hinweis | Alle Hersteller-Listenpreise; DeepSeek kündigte künftigen 2×-Peak-Hour-Zuschlag an (Peking 9–12 Uhr, 14–18 Uhr) ohne Wirksamkeitsdatum | |||
SECTION 03 Gleiche Architektur, neues Training: CSA+HCA, mHC, Muon und Harness
V4-Flash-0731 ist identisch in Parameterzahl und Struktur zur April-Preview. DeepSeek erklärt den Agent-Benchmark-Sprung ausschließlich mit erneutem Post-Training. Der Technical Report „DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence“ beschreibt drei architektonische Änderungen aus der Preview:
- Hybrid Attention (CSA + HCA): als DSA Sparse Attention vermarktet, um Compute und Speicher bei langem Kontext zu senken;
- Manifold-Constrained Hyper-Connections (mHC): Verbesserung der Residual-Verbindungen;
- Muon-Optimizer: schnellere Konvergenz und Trainingsstabilität.
Herstellerangaben zur Effizienz (keine unabhängige Reproduktion gesehen): Bei 1M Token benötigt V4-Pro 27 % der V3.2-per-Token-FLOPs und 10 % KV-Cache-Footprint.
Am 31. Juli erstmals offizielle Erwähnung von DeepSeek Harness — ein hauseigenes Agent-Framework gegen Claude Code. Frühere Agent-Arbeit nutzte Claude Code und OpenCode. Veröffentlichte Agent-Scores (Terminal Bench 2.0, Toolathlon) liefen im Harness minimal mode (max effort, top_p 0.95, temperature 1.0) vor der Veröffentlichung. DeepSeek-Changelog: Agent-Scores sind „extremely sensitive to harness choice“.
| Modell | Intelligence Index | Ø Kosten / Task | Kosten vs. V4-Flash |
|---|---|---|---|
| V4-Flash-0731 | 50 | $0,03 | 1× |
| Kimi K3 | 57 | $0,86 | ~29× |
| GPT-5.6 Sol | 9+ Punkte höher | $1,86 | ~62× |
| Claude Fable 5 | 9+ Punkte höher | $3,15 | ~105× |
| Fazit | Nicht der höchste Score, aber der günstigste pro Task — gebaut für High-Volume-Agent- und Batch-Workloads | ||
SECTION 04 Benchmark-Caveats und 6-Schritte-API-Migrations-Checkliste
Vom Marketing-Narrativ trennen:
- Harness-Lock-in: V4-Flash-0731 Terminal Bench 2.0 bei 82,7 (vs. V4-Pro-Preview 67,9) nutzte unreleased Harness minimal mode — nicht blind auf Claude Code oder Cursor portieren;
- Usability-Beschwerden: 21st Century Business Herald berichtete unter Verweis auf Entwickler-Feedback über niedrige Input-Cache-Hit-Raten und gelegentliche Safety-Classifier-Timeouts im offiziellen Build;
- Finanzierungs-/IPO-Gerüchte: Medien zitieren ~7,4 Mrd. $ Runde bei ~48,7 Mrd. $ Bewertung aus anonymen Quellen — von DeepSeek oder regulatorischen Filings nicht bestätigt.
- Modellname prüfen: Produktion sollte
deepseek-v4-flashaufrufen (routet zu 0731);deepseek-chat/deepseek-reasonerabschaffen; - SDK-Kompatibilität testen: OpenAI ChatCompletions und Anthropic-Format-Endpunkte funktionieren ohne strukturelle Codeänderungen;
- Caching optimieren: Cache-Hit-Input kostet $0,0028/M — Hit-Raten überwachen (Community-Berichte teils niedrig);
- Peak-Pricing einplanen: angekündigter 2×-Wochentags-Surge in Pekinger Zeit — Batch-Jobs außerhalb 9–12 Uhr und 14–18 Uhr;
- A/B auf Ihrer Workload: Blind gegen Kimi K3 und Qwen3.8-Max testen; nicht allein auf Hersteller-Harness-Scores vertrauen;
- API vs. Consumer trennen: 31. Juli betraf nur die API — Endnutzer-App-Erlebnis separat validieren.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "V4-Flash-0731 vs Preview zusammenfassen."}]
)
print(response.choices[0].message.content)
SECTION 05 Chinesische Kill-Line, zitierbare Fakten und Quellen
- 284B / 13B aktiv, MIT-Gewichte: 0731 offizielle Gewichte auf Hugging Face, kommerzielles Fine-Tuning und Redistribution erlaubt;
- vs. Claude Opus 4.8 Listenpreis: 21st Century Business Herald nennt ~36× günstiger bei Cache-Miss-Input, ~179× bei Cache-Hit, ~89× bei Output (Herstellerpreise, nicht geprüft);
- Sieben Wochen an der Spitze von OpenRouter: Preview V4-Flash führte Berichten zufolge sieben Wochen in Folge die Nutzungs-Rankings — Marktbeleg für „gut genug + am günstigsten“;
- „Kill Line“ (斩杀线): chinesischer Dev-Slang für DeepSeeks Preis-Leistungs-Bar — Wettbewerber müssen klar überlegen sein oder unterbieten; erklärt u. a. den 80%-Preisschnitt von GPT-5.6 Luna im selben Fenster;
- Verhaltene Chip-Reaktion: Nvidia, Broadcom, AMD bewegten sich am 31. Juli kaum — Märkte behandeln „DeepSeek-Effizienz“ als normales Engineering, anders als den R1-Selloff 2025;
- DSGVO bei Cloud-API: Prompts und Code-Snippets an DeepSeek-Endpunkte können Drittlandübermittlungen nach Art. 44 ff. DSGVO auslösen — AVV, SCCs und Verarbeitungsverzeichnis vor Produktions-Routing dokumentieren.
Vor dem 0731-Release verspotteten Foren Gründer Liang Wenfeng als „Liang Baikai“ (leeres Versprechen) wegen verpasster V4-Pro-Ziele; nachdem der Flash-Build die Erwartungen übertraf, kippten Spitznamen zurück zu „Liang Sheng“ (der Weise) — ein schneller Sentiment-Barometer.
Offizielle und Drittquellen — nach jedem Upstream-Update verifizieren:
DeepSeek offizielle API-Dokumentation und Changelog
Hugging Face: deepseek-ai/DeepSeek-V4-Flash Model Card
Artificial Analysis: unabhängiger Intelligence Index
Agent-Pipelines auf DeepSeek V4 brauchen weiterhin stabile macOS-CI für Xcode-Builds, Metal und iOS-Automatisierung. Virtualisierte Mac-Umgebungen verursachen Hypervisor-Overhead und Kompatibilitätsrisiko. Für Produktionsteams mit verlustfreier nativer Apple-Silicon-Leistung, stabilem iOS-CI/CD und 7×24-Agent-Automatisierung sind MACNOX dedizierte physische Mac-Knoten meist die bessere Wahl: echte Apple-Hardware, voller Root, kein Hypervisor-Steuer, flexible Tages-/Wochen-/Monatsmiete. Siehe auch DeepSeek V4 GA Preise und Architektur und OpenRouter-Juli-Rankings-Analyse.
SECTION 07 FAQ
Was hat sich von V3.2 zu V4 geändert?
Nativer 1M-Token-Kontext mit deutlich geringerem Long-Context-Compute und Speicher (Herstellerdaten: V4-Pro bei 1M Token nutzt 27 % der V3.2-FLOPs und 10 % KV-Cache). V4 ergänzt agent-fokussiertes Training und arbeitet mit Claude Code, OpenCode und ähnlichen Tools.
V4 Flash oder V4 Pro für den Alltag?
Für Chat, Batch-Jobs oder High-Volume-Low-Cost-Agenten ist V4-Flash-0731 offiziell das bessere Preis-Leistungs-Verhältnis und schlägt V4-Pro-Preview bereits auf Agent-Scores. Für tiefstes Weltwissen und komplexes Reasoning mit Budget ist V4-Pro-Preview bis zum offiziellen GA eine Option.
Ist V4-Pro GA schon verfügbar?
Nicht zum 5. August 2026. Nur V4-Flash-0731 ist offiziell, API-only. V4-Pro GA und Harness stehen „as soon as possible“ ohne bestätigtes Datum; Gerüchte 10.–20. August sind unverifiziert.
Kann ich DeepSeeks Benchmark-Zahlen vertrauen?
Teilweise. Weit verbreitete Dritt-Benchmarks wie SWE-bench Verified haben mehr Gewicht. Agent-Scores (Terminal Bench 2.0 usw.) nutzten unreleased Harness — auf unabhängige Reproduktion mit Claude Code, Cursor oder anderen Harnesses warten.
Was bedeutet das für meine API-Integration?
OpenAI- und Anthropic-Format-Clients brauchen keine Codeänderungen — deepseek-v4-flash aktualisiert automatisch auf 0731. Wer noch eingestellte deepseek-chat oder deepseek-reasoner aufruft, sollte sofort migrieren (eingestellt 24. Juli).