Startseite / Blog / V4 Flash
ENGINEERING_BLOG · 2026.08.05

DeepSeek 100× günstiger
als Claude? V4-Flash-Benchmarks im Check

Am 31. Juli 2026 hat DeepSeek deepseek-v4-flash als offiziellen öffentlichen API-Build (V4-Flash-0731) freigegeben: dieselbe 284B-Architektur wie die April-Preview, nur das Post-Training wurde erneuert. Auf Agent-Benchmarks schlägt das Modell jetzt DeepSeeks eigenes größeres V4-Pro-Preview bei etwa 1/36 bis 1/179 des Claude-Opus-4.8-Listenpreises. Dieser Leitfaden richtet sich an Teams, die DeepSeek-API-Migration und die Ökonomie chinesischer Open-Weight-LLMs bewerten. Enthalten: Timeline April–August, Preistabellen, Architekturhinweise, Vergleich mit Kimi K3 und Qwen3.8-Max, Harness-Caveats und das chinesische „Kill-Line“-Framing. Das Flagship V4-Pro GA und das hauseigene Harness-Agent-Framework sind zum 5. August weiterhin nicht ausgeliefert.

SECTION 01 Warum V4-Flash-Schlagzeilen Produktionsteams verwirren

  • „Offiziell“ ist kein neues Modell: 0731 ist in Größe und Struktur identisch mit der April-Preview; die Gewinne stammen aus einem frischen Post-Training-Pass, nicht aus Skalierung;
  • V4-Pro GA fehlt weiter: nur die April-Preview-API existiert; Changelog sagt „as soon as possible“ ohne Datum; Gerüchte über ein Fenster 10.–20. August sind von DeepSeek nicht bestätigt;
  • Agent-Scores sind harness-abhängig: Terminal Bench 2.0-Werte nutzen das noch nicht veröffentlichte Harness „minimal mode“; DeepSeeks Changelog warnt, Scores seien extrem sensitiv auf Harness-Wahl;
  • Legacy-Aliase sind tot: deepseek-chat und deepseek-reasoner wurden am 24. Juli eingestellt; nicht migrierte Produktionsaufrufe brechen;
  • Nur API-Rollout: Das Update vom 31. Juli betrifft ausschließlich die API; Consumer-App und Web-Chat blieben zum Redaktionsschluss unberührt;
  • Kein #1 auf unabhängigen Indizes: Artificial Analysis Intelligence Index setzt V4-Flash auf ~50, unter Kimi K3 (~57) und GLM-5.2 — DeepSeek optimiert für „gut genug + Tiefstpreis“, nicht für Leaderboard-Krone.

Kernpunkt: Ein 284B/13B-aktives Modell schlägt jetzt eine 1,6T/49B-Preview derselben Familie auf mehreren Agent-Tasks — Post-Training-Qualität konkurriert Ende 2026 mit roher Parameterzahl.

SECTION 02 Timeline und Hersteller-Preissnapshot (5. August 2026)

  • 24. April 2026: V4-Preview — V4-Pro (1,6T/49B aktiv) und V4-Flash (284B/13B aktiv), 1M Kontext, MIT Open Weights;
  • 24. Juli 2026: Legacy-Aliase eingestellt; Traffic routet auf V4-Namensgebung;
  • 27. Juli 2026: Moonshot AI open-weights Kimi K3 (2,8T), verschärft Wettbewerbsdruck;
  • 31. Juli 2026: V4-Flash-0731 öffentliche API-Beta; MIT-Gewichte auf Hugging Face; Changelog nennt Harness-Agent-Framework „to be released soon“;
  • 5. August 2026: V4-Pro GA weiter unbestätigt; chinesische Medien zitieren anonyme Quellen zu internen Tests und einem Fenster 10.–20. August — als Gerücht behandeln, bis DeepSeek bestätigt.
Modellpreise und Parameter (herstellerseitig veröffentlicht, Stand 5. August 2026)
Modell Status Gesamt / aktiv Input ($/M, miss / hit) Output ($/M)
V4-Flash-0731 Offiziell 284B / 13B $0,14 / $0,0028 $0,28
V4-Pro Nur Preview 1,6T / 49B $0,435 / $0,003625 $0,87
Kimi K3 Open Weights (27. Juli) 2,8T / ~104B (Community-Schätzung) $3,00 / $0,30 $15,00
GLM-5.2 Open (Juni 2026) ~744B / ~40B Hier nicht verifiziert Hier nicht verifiziert
Qwen3.8-Max API GA (2. Aug.); Gewichte ausstehend 2,4T / 95B $2,00 / ~$0,17–0,25 $6,00
Hinweis Alle Hersteller-Listenpreise; DeepSeek kündigte künftigen 2×-Peak-Hour-Zuschlag an (Peking 9–12 Uhr, 14–18 Uhr) ohne Wirksamkeitsdatum

SECTION 03 Gleiche Architektur, neues Training: CSA+HCA, mHC, Muon und Harness

V4-Flash-0731 ist identisch in Parameterzahl und Struktur zur April-Preview. DeepSeek erklärt den Agent-Benchmark-Sprung ausschließlich mit erneutem Post-Training. Der Technical Report „DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence“ beschreibt drei architektonische Änderungen aus der Preview:

  • Hybrid Attention (CSA + HCA): als DSA Sparse Attention vermarktet, um Compute und Speicher bei langem Kontext zu senken;
  • Manifold-Constrained Hyper-Connections (mHC): Verbesserung der Residual-Verbindungen;
  • Muon-Optimizer: schnellere Konvergenz und Trainingsstabilität.

Herstellerangaben zur Effizienz (keine unabhängige Reproduktion gesehen): Bei 1M Token benötigt V4-Pro 27 % der V3.2-per-Token-FLOPs und 10 % KV-Cache-Footprint.

Am 31. Juli erstmals offizielle Erwähnung von DeepSeek Harness — ein hauseigenes Agent-Framework gegen Claude Code. Frühere Agent-Arbeit nutzte Claude Code und OpenCode. Veröffentlichte Agent-Scores (Terminal Bench 2.0, Toolathlon) liefen im Harness minimal mode (max effort, top_p 0.95, temperature 1.0) vor der Veröffentlichung. DeepSeek-Changelog: Agent-Scores sind „extremely sensitive to harness choice“.

Artificial-Analysis-Index vs. Kosten pro Task (unabhängige Firma, via Finanzmedien)
Modell Intelligence Index Ø Kosten / Task Kosten vs. V4-Flash
V4-Flash-0731 50 $0,03
Kimi K3 57 $0,86 ~29×
GPT-5.6 Sol 9+ Punkte höher $1,86 ~62×
Claude Fable 5 9+ Punkte höher $3,15 ~105×
Fazit Nicht der höchste Score, aber der günstigste pro Task — gebaut für High-Volume-Agent- und Batch-Workloads

SECTION 04 Benchmark-Caveats und 6-Schritte-API-Migrations-Checkliste

Vom Marketing-Narrativ trennen:

  • Harness-Lock-in: V4-Flash-0731 Terminal Bench 2.0 bei 82,7 (vs. V4-Pro-Preview 67,9) nutzte unreleased Harness minimal mode — nicht blind auf Claude Code oder Cursor portieren;
  • Usability-Beschwerden: 21st Century Business Herald berichtete unter Verweis auf Entwickler-Feedback über niedrige Input-Cache-Hit-Raten und gelegentliche Safety-Classifier-Timeouts im offiziellen Build;
  • Finanzierungs-/IPO-Gerüchte: Medien zitieren ~7,4 Mrd. $ Runde bei ~48,7 Mrd. $ Bewertung aus anonymen Quellen — von DeepSeek oder regulatorischen Filings nicht bestätigt.
  1. Modellname prüfen: Produktion sollte deepseek-v4-flash aufrufen (routet zu 0731); deepseek-chat / deepseek-reasoner abschaffen;
  2. SDK-Kompatibilität testen: OpenAI ChatCompletions und Anthropic-Format-Endpunkte funktionieren ohne strukturelle Codeänderungen;
  3. Caching optimieren: Cache-Hit-Input kostet $0,0028/M — Hit-Raten überwachen (Community-Berichte teils niedrig);
  4. Peak-Pricing einplanen: angekündigter 2×-Wochentags-Surge in Pekinger Zeit — Batch-Jobs außerhalb 9–12 Uhr und 14–18 Uhr;
  5. A/B auf Ihrer Workload: Blind gegen Kimi K3 und Qwen3.8-Max testen; nicht allein auf Hersteller-Harness-Scores vertrauen;
  6. API vs. Consumer trennen: 31. Juli betraf nur die API — Endnutzer-App-Erlebnis separat validieren.
deepseek-v4-flash-api.py
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_API_KEY",
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "V4-Flash-0731 vs Preview zusammenfassen."}]
)
print(response.choices[0].message.content)

SECTION 05 Chinesische Kill-Line, zitierbare Fakten und Quellen

  • 284B / 13B aktiv, MIT-Gewichte: 0731 offizielle Gewichte auf Hugging Face, kommerzielles Fine-Tuning und Redistribution erlaubt;
  • vs. Claude Opus 4.8 Listenpreis: 21st Century Business Herald nennt ~36× günstiger bei Cache-Miss-Input, ~179× bei Cache-Hit, ~89× bei Output (Herstellerpreise, nicht geprüft);
  • Sieben Wochen an der Spitze von OpenRouter: Preview V4-Flash führte Berichten zufolge sieben Wochen in Folge die Nutzungs-Rankings — Marktbeleg für „gut genug + am günstigsten“;
  • „Kill Line“ (斩杀线): chinesischer Dev-Slang für DeepSeeks Preis-Leistungs-Bar — Wettbewerber müssen klar überlegen sein oder unterbieten; erklärt u. a. den 80%-Preisschnitt von GPT-5.6 Luna im selben Fenster;
  • Verhaltene Chip-Reaktion: Nvidia, Broadcom, AMD bewegten sich am 31. Juli kaum — Märkte behandeln „DeepSeek-Effizienz“ als normales Engineering, anders als den R1-Selloff 2025;
  • DSGVO bei Cloud-API: Prompts und Code-Snippets an DeepSeek-Endpunkte können Drittlandübermittlungen nach Art. 44 ff. DSGVO auslösen — AVV, SCCs und Verarbeitungsverzeichnis vor Produktions-Routing dokumentieren.

Vor dem 0731-Release verspotteten Foren Gründer Liang Wenfeng als „Liang Baikai“ (leeres Versprechen) wegen verpasster V4-Pro-Ziele; nachdem der Flash-Build die Erwartungen übertraf, kippten Spitznamen zurück zu „Liang Sheng“ (der Weise) — ein schneller Sentiment-Barometer.

Offizielle und Drittquellen — nach jedem Upstream-Update verifizieren:

DeepSeek offizielle API-Dokumentation und Changelog

Hugging Face: deepseek-ai/DeepSeek-V4-Flash Model Card

Artificial Analysis: unabhängiger Intelligence Index

Agent-Pipelines auf DeepSeek V4 brauchen weiterhin stabile macOS-CI für Xcode-Builds, Metal und iOS-Automatisierung. Virtualisierte Mac-Umgebungen verursachen Hypervisor-Overhead und Kompatibilitätsrisiko. Für Produktionsteams mit verlustfreier nativer Apple-Silicon-Leistung, stabilem iOS-CI/CD und 7×24-Agent-Automatisierung sind MACNOX dedizierte physische Mac-Knoten meist die bessere Wahl: echte Apple-Hardware, voller Root, kein Hypervisor-Steuer, flexible Tages-/Wochen-/Monatsmiete. Siehe auch DeepSeek V4 GA Preise und Architektur und OpenRouter-Juli-Rankings-Analyse.

SECTION 07 FAQ

Was hat sich von V3.2 zu V4 geändert?

Nativer 1M-Token-Kontext mit deutlich geringerem Long-Context-Compute und Speicher (Herstellerdaten: V4-Pro bei 1M Token nutzt 27 % der V3.2-FLOPs und 10 % KV-Cache). V4 ergänzt agent-fokussiertes Training und arbeitet mit Claude Code, OpenCode und ähnlichen Tools.

V4 Flash oder V4 Pro für den Alltag?

Für Chat, Batch-Jobs oder High-Volume-Low-Cost-Agenten ist V4-Flash-0731 offiziell das bessere Preis-Leistungs-Verhältnis und schlägt V4-Pro-Preview bereits auf Agent-Scores. Für tiefstes Weltwissen und komplexes Reasoning mit Budget ist V4-Pro-Preview bis zum offiziellen GA eine Option.

Ist V4-Pro GA schon verfügbar?

Nicht zum 5. August 2026. Nur V4-Flash-0731 ist offiziell, API-only. V4-Pro GA und Harness stehen „as soon as possible“ ohne bestätigtes Datum; Gerüchte 10.–20. August sind unverifiziert.

Kann ich DeepSeeks Benchmark-Zahlen vertrauen?

Teilweise. Weit verbreitete Dritt-Benchmarks wie SWE-bench Verified haben mehr Gewicht. Agent-Scores (Terminal Bench 2.0 usw.) nutzten unreleased Harness — auf unabhängige Reproduktion mit Claude Code, Cursor oder anderen Harnesses warten.

Was bedeutet das für meine API-Integration?

OpenAI- und Anthropic-Format-Clients brauchen keine Codeänderungen — deepseek-v4-flash aktualisiert automatisch auf 0731. Wer noch eingestellte deepseek-chat oder deepseek-reasoner aufruft, sollte sofort migrieren (eingestellt 24. Juli).