Startseite / Blog / Preiskrieg
ENGINEERING_BLOG · 2026.08.17

Warum hat DeepSeek die API-Preise um bis zu 1.100 % erhöht
— direkt nach Chinas Open-Weight-Offensive?

In fünf Tagen trafen Teams, die chinesische Frontier-APIs kaufen oder Open Weights laden, auf drei Bewegungen, die sich oberflächlich widersprechen. DeepSeek hat API-Preise auf einzelnen Stufen um bis zu 1.100 % angehoben. Alibaba hat in derselben Woche ein 2,4-Billionen-Parameter-Flagship als Open Weight veröffentlicht — eines, das zuvor nie öffentlich lag. Zhipu AI hat GLM-5.3 ausgeliefert und Coding-Benchmarks um rund das Sechsfache verbessert — auf derselben Basis, ohne Retraining. Dieser Text richtet sich an Ingenieure, die eine Rechnung neu kalkulieren, eine Lizenz lesen und einen Stack wählen müssen. Das gemeinsame Signal: Chinas Labs konkurrieren nicht mehr nur über den Preis, sondern über Preismacht.

SECTION 01 Fünf Fehlinterpretationen der DeepSeek-Preiserhöhung

Es fehlt nicht an Schlagzeilen. Es fehlt an sauberen Abrechnungsdimensionen.

  • „1.100 %“ als ganze Rechnung behandeln: die Zahl gilt nur für Peak-Cache-Hit-Input auf V4-Pro. Output stieg um 350 %. Cache-Miss-Input stieg um 200 %.
  • Die offizielle API automatisch als günstigste Route annehmen: zu Spitzenzeiten liegt DeepSeeks Listenpreis jetzt über mehreren Resellern (GMI Cloud, Novita und andere notieren V4 Pro weiter unter dem neuen offiziellen Peak).
  • Alibabas Drop als Apache-2.0-Wohltätigkeit lesen: die Gewichte sind ladbar, aber ein Model-as-a-Service- oder AI-Work-Assistant-Geschäft über 50 Millionen US-Dollar in einem beliebigen 12-Monats-Zeitraum braucht eine separate kommerzielle Lizenz.
  • Das Geo-Ban-Gerücht wiederholen: Behauptungen, die USA, die EU, das Vereinigte Königreich und Südkorea dürften den Checkpoint nicht laden, sind falsch. Die veröffentlichte Lizenz enthält keine Territorialklausel.
  • GLM-5.3 als neues Foundation-Modell bezeichnen: es nutzt die 743-Milliarden-Basis von GLM-5.2. Die Gewinne kommen aus skaliertem Post-Training-RL. Die Scores sind Herstellerangaben; ein unabhängiger Re-Run ist noch nicht öffentlich.

Drei Labs, drei Züge, ein Signal: Chinas KI-Labs konkurrieren um Preismacht, nicht nur um den Preis.

SECTION 02 Zeitplan: Was ausgeliefert wurde — und wann US-Labs die Preise senkten

Der Blick von oben: Am 30. Juli senkte OpenAI die günstigste Stufe, GPT-5.6 Luna, um 80 %. Am 6.–7. August machte es Luna zum kostenlosen Default mit unbegrenzten Textchats. Während chinesische Labs Preise anhoben und Flagship-Gewichte öffneten, senkten US-Labs Preise und gingen auf der Consumer-Schicht kostenlos. Das sind zwei Seiten desselben Kampfes. Frühere Produktnotizen: Qwen3.8-Max-Launch und DeepSeek-V4-GA-Preise.

Wichtige Daten, Juli–August 2026
Datum Ereignis
16. Juli 2026 Moonshot AI veröffentlicht Kimi K3 als Open Weight (2,8 Billionen Parameter) und zieht US-Sicherheitsprüfung auf sich
2.–3. August 2026 Alibaba previewt, dann startet Qwen3.8-Max als gehostete API
10. August 2026 Meta veröffentlicht Muse Glimmer (30B, Apache 2.0) und kündigt Open Weights für das Flagship Muse Spark 1.2 an
12. August 2026 Alibaba veröffentlicht Qwen3.8-2.4T-A95B auf Hugging Face / ModelScope; xAI liefert Grok 4.6
13. August 2026 DeepSeek-V4-Pro geht GA und kündigt eine Preiserhöhung zum 17. August an; Google liefert rabattiertes Gemini 3.7 Flash
14. August 2026 Zhipu liefert GLM-5.3 und nutzt die 743B-Basis von GLM-5.2
17. August 2026, 00:00 Uhr Peking-Zeit DeepSeeks neue Preise treten in Kraft

SECTION 03 Die Zahlen: DeepSeek-Tarife, Qwen-Specs, GLM-5.3-Benchmarks

Die neuen DeepSeek-Tarife gelten ab 17. August, 00:00 Uhr Peking-Zeit. Spitzenzeiten sind 9–12 Uhr und 14–18 Uhr Peking-Zeit. Die 1.100-%-Schlagzeile gilt für Peak-Cache-Hit-Input — die Stufe, die am nächsten an kostenlos lag. Output, der die meisten realen Rechnungen dominiert, stieg um 350 %. Eine unabhängige Kostenmodellierung fand: ein realistischer Lastfall mit hohem Verbrauch (rund 84 Mio. Token/Monat, überwiegend Off-Peak, zur Hälfte Cache-Hits) sieht eher einen Anstieg um den Faktor 1,8.

DeepSeek-Erhöhung, je 1 Mio. Token (CNY)
Abrechnungsposition Alt Neu Off-Peak Neu Peak Peak-Anstieg
V4-Flash Cache-Hit (Input) ¥0.02 ¥0.05 ¥0.10 ~400 %
V4-Flash Cache-Miss (Input) ¥1.0 ¥1.5 ¥3.0 200 %
V4-Flash Output ¥2.0 ¥4.5 ¥9.0 350 %
V4-Pro Cache-Hit (Input) ¥0.025 ¥0.15 ¥0.30 ~1.100 %
V4-Pro Cache-Miss (Input) ¥3.0 ¥4.5 ¥9.0 200 %
V4-Pro Output ¥6.0 ¥13.5 ¥27.0 350 %
Qwen3.8-2.4T-A95B (Qwen3.8-Max Open Weights)
Spezifikation Detail
Parameter 2,4 Billionen gesamt, 95 Milliarden aktiv pro Token (MoE, 512 Experten, 10 geroutet + 1 shared)
Kontextfenster 262.144 Token nativ (Open Checkpoint), erweiterbar auf ca. 1,01 Mio.; gehostetes Max standardmäßig 1 Mio.
Release-Takt Preview 2. Aug. → API live 3. Aug. → Open Weights 12. Aug.
API-Preise (international) $2/M Input, $6/M Output
Lizenz Nicht Apache 2.0 — eine eigene Qwen3.8-Max-Lizenz
Warum es zählt Erstes Mal, dass Alibaba ein Max-Tier-Flagship als Open Weight veröffentlicht; Qwen3.5/3.6/3.7 Max blieben API-only
GLM-5.3 vs. GLM-5.2: gleiche Basis, nur Post-Training (Zhipu-Angaben)
Benchmark GLM-5.2 GLM-5.3 Änderung
Terminal-Bench 3.0 4,6 % 28,3 % +23,7 Punkte
DeepSWE v1.1 46,2 % 66,9 % +20,7 Punkte
Agents' Last Exam (CLI) 23,8 % 28,5 % +4,7 Punkte
CyberGym 77,2 % 84,5 % +7,3 Punkte
AutomationBench 26,2 % 48,2 % +22,0 Punkte

Das sind Zhipus eigene Zahlen. GLM-5.3 liegt auf Terminal-Bench 3.0 weiter hinter GPT-5.6 Sol (34,6 %) und Claude Fable 5 (33,7 %). Es ist ein starkes Open-Weight-Ergebnis, kein uneingeschränkter Frontier-Sieg.

SECTION 04 Drei Strategien: Tageszeit-Tarife, lizenzierte Gewichte, Post-Training

DeepSeek: von pauschal günstig zu Tageszeit-Tarifen — ein Kapazitätsproblem, keine Markenwende. Die bequeme Fehllektüre lautet: „Chinas günstigstes Modell ist eingeknickt.“ Die Struktur liest sich eher wie sichtbar gemachte Compute-Knappheit. Flache, immer günstige Preise funktionierten als Akquise, solange das GPU-Angebot mithielt. Als die Nutzung exponentiell wuchs und die Kapazität nicht, musste etwas explizit werden. „Flexiblere Workload-Planung anregen“ ist Konzernsprache für knappe Peak-Compute. Zu Spitzenzeiten ist die offizielle API nicht mehr der günstigste Weg, DeepSeek zu fahren. Diese Annahme ist gerade gebrochen.

Alibaba: Open Weights kaufen Entwickleraufmerksamkeit; eine eigene Lizenz schützt die Umsatzdecke. Den 2,4-Billionen-Checkpoint zu veröffentlichen und eine Custom-Lizenz anzuhängen, ist ein Zug. Jedes Model-as-a-Service- oder AI-Work-Assistant-Geschäft mit mehr als 50 Millionen US-Dollar in einem beliebigen 12-Monats-Zeitraum muss eine separate kommerzielle Lizenz verhandeln. Produkte mit 100 Mio.+ monatlich aktiven Nutzern oder 20 Mio.+ US-Dollar Monatsumsatz müssen den Modellnamen anzeigen. Die Wette: internationale Entwickler gewinnen, Hebel behalten gegenüber jedem, der Inference oben drauf verkaufen kann. Das ist eine andere Wette als Metas Muse Glimmer unter uneingeschränktem Apache 2.0. Das Geo-Ban-Gerücht ist falsch — prüfen Sie die LICENSE-Datei, nicht den Ankündigungsthread.

GLM-5.3: keine neue Basis, eine größere Post-Training-Wette. Dieselbe 743B-Basis wie GLM-5.2, kein Retraining, und ein Sprung um rund das Sechsfache auf Terminal-Bench 3.0 (4,6 % → 28,3 %) durch Skalierung der RL-Umgebungen. Wenn Pretraining-Skalierungsgesetze abflachen, wird Post-Training-RL zu einem eigenen Hebel mit niedrigerer Kostenschwelle als ein neues Foundation-Modell. Mid-Tier-Labs können die Lücke auf agentischen und Coding-Benches schließen, ohne Pretrain-Budgets in OpenAI-Größe.

SECTION 05 Ist DeepSeek noch das günstigste Frontier-Modell? Sechs-Schritte-Audit

CNY zu USD etwa ¥7,15/$1, Näherungswerte. Off-Peak-V4-Pro liegt weiter klar unter Claude Opus 5, ist aber nicht mehr die eindeutig günstigste Option. Die internationalen Qwen3.8-Max-Preise und OpenAIs Luna unterbieten DeepSeeks Off-Peak-Tarif. „Chinesisches Modell = günstigstes Modell“ hielt den Großteil von 2025 und Anfang 2026. Das ist jetzt keine sichere Annahme mehr. Kontext zur US-Senkung: GPT-5.6 Luna um 80 % gesenkt.

Input / Output je 1 Mio. Token
Modell Input Output Open Weights?
DeepSeek V4-Pro (Peak) ¥9.0 (~$1.26) ¥27.0 (~$3.78) Nein
DeepSeek V4-Pro (Off-Peak) ¥4.5 (~$0.63) ¥13.5 (~$1.89) Nein
Qwen3.8-Max (internationale API) $2.00 $6.00 Ja (Custom-Lizenz)
OpenAI GPT-5.6 Luna $0.20 $1.20 Nein
Claude Opus 5 (impliziert, nach Alibabas Vergleichsverhältnis) ~$5.00 ~$25.00 Nein

Wer diese Woche liefern muss, auditiert den Stack in sechs Schritten statt die Schlagzeile zu multiplizieren. Wer Nutzungs- und Abrechnungsdaten über die offizielle API oder Reseller-Clouds verarbeitet, sollte die Datenflüsse einmal DSGVO-konform dokumentieren — unabhängig davon, welcher Tarif am Ende gewinnt.

  1. Rechnung zerlegen: die letzten 30 Tage in Cache-Hit-Input, Cache-Miss-Input und Output aufteilen. Die neue Karte auf jede Zeile anwenden. Nicht die ganze Rechnung mit 1.100 % multiplizieren.
  2. Peking-Spitzenzeiten markieren: 9–12 Uhr und 14–18 Uhr Peking-Zeit. Die Ankündigung bat aus einem Grund um flexiblere Planung.
  3. Offiziell gegen Reseller halten: im Peak prüfen, ob GMI Cloud, Novita oder ein anderer Reseller DeepSeeks offiziellen Peak-Tarif noch unterbietet.
  4. LICENSE-Datei lesen: bevor Sie Qwen3.8-2.4T-A95B laden, die Schwellen 50 Mio. USD / 100 Mio. MAU / 20 Mio. USD Monatsumsatz bestätigen. Geo-Ban-Threads ignorieren.
  5. GLM-5.3 als Post-Training-Delta behandeln: dieselbe Basis wie 5.2, nur Hersteller-Benches. Eigene Terminal- und SWE-Tasks neu fahren, bevor Sie tauschen.
  6. Nach Schicht routen: günstigen Consumer-Text zu Luna; Open Weights und Ökosystem zu Qwen; peak-verschiebbare Frontier-Inference zu DeepSeek Off-Peak; langhorizontige Agents und iOS-CI auf einen echten Mac, nicht auf einen Hypervisor.
deepseek-bill-estimate.py
peak = {"in_miss": 9.0, "in_hit": 0.30, "out": 27.0}
off  = {"in_miss": 4.5, "in_hit": 0.15, "out": 13.5}

tokens_m = {"in_miss": 40, "in_hit": 40, "out": 4}
def bill(rate, t):
    return t["in_miss"]*rate["in_miss"] + t["in_hit"]*rate["in_hit"] + t["out"]*rate["out"]

print("off-peak CNY", round(bill(off, tokens_m), 2))
print("peak CNY", round(bill(peak, tokens_m), 2))

SECTION 06 Was unbestätigt bleibt, warum zwei Preiskriege, welche Quellen neu öffnen

  • Die 1.100-%-Schlagzeile ist korrekt und unvollständig: sie gilt nur für Peak-Cache-Hit-Input. Output — die Zeile, die die meisten Rechnungen dominiert — stieg um 350 %.
  • Zhenwu-M890- / Pangu-AL128-Behauptungen: mehrere chinesische Finanzmedien schreiben, ein Teil der Qwen3.8-Max-Inference laufe auf Alibabas eigenen Chips. Alibaba hat keine unabhängigen technischen Docs und keine Dritt-Benches veröffentlicht. Als unbestätigt behandeln.
  • GLM-5.3 und eine „ernsthafte Cursor-Schwachstelle“: VentureBeat plus Zhipus eigene Offenlegung. Technische Details sind nicht öffentlich. Lesen als herstellerseitig, nicht unabhängig auditiert.
  • Vergeltungs-Exportkontrollen: Berichte, Chinas Handelsministerium bereite KI-/Halbleiter-Gegenmaßnahmen vor, sind spekulative Medien, keine offizielle Ankündigung.

Im vergangenen Monat haben Chinas Top-Labs in einem Tempo ausgeliefert, das inländische Finanzmedien „drei Modell-Updates pro Woche“ (一周三更) nennen — DeepSeek, Alibaba, Zhipu, plus Moonshots Kimi K3 (Open Weight am 16. Juli, 2,8 Billionen) und MiniMax H3. Chinesische Berichterstattung rahmt das so: Open-Weight-Releases erzwingen eine globale Neubepreisung. US-Labs fuhren auf der Consumer-Schicht den Gegenzug: OpenAIs 80-%-Luna-Schnitt, dann unbegrenzter kostenloser Text; Googles halbpreisiges Gemini 3.7 Flash am 13. August. Offene Flagship-Gewichte plus gestufte, höhere Preise an der compute-knappen Spitze; frei und günstig am Consumer-Ende. Beides ist real. Sie optimieren verschiedene Teile des Trichters.

Es gibt auch eine geopolitische Schicht. Kimi K3 hat bereits US-Sicherheitsprüfung auf sich gezogen. Manche Analysten lesen Alibabas 2,4-Billionen-Drop in diesem Fenster als Festschreiben internationaler Entwickleraufmerksamkeit und einer Erzählung von „technologischer Parität“, bevor regulatorische Enge kommt. Das ist eine informierte Interpretation, kein bestätigter Fakt — und leicht zu übersehen, wenn Sie nur englische Produktposts lesen.

Offizielle und gegencheckte Quellen. Öffnen Sie diese Seiten erneut, bevor Sie Preise oder Lizenzbedingungen weitergeben:

DeepSeek offizielle API-Preise (Peak- / Off-Peak-Karte)

Alibaba Cloud Community: Qwen3.8-Max-Launch-Notiz

Hugging Face: Qwen3.8-2.4T-A95B-Checkpoint

Reuters / MarketScreener: DeepSeek hebt V4-API-Preise an

MarkTechPost: GLM-5.3, gleiche Basis, nur Post-Training

Ein 2,4-Billionen-MoE selbst zu hosten oder einen Agenten in Xcode und iOS-CI zu verdrahten, legt Hypervisor-Steuer auf eine Token-Rechnung, die gerade gestiegen ist. Für verlustfreie native Rechenleistung, stabile iOS-CI/CD und 24/7-Agent-Automatisierung ist ein MACNOX Cloud-Physikknoten in der Regel der bessere Produktionsweg: echte Apple-Hardware, voller Root, kein Hypervisor, Abrechnung nach Tag / Woche / Monat. Kontext teilen: OpenRouter-Juli-Rankings.

SECTION 07 FAQ

Ist DeepSeek nach der Erhöhung noch günstiger als GPT-5.6 oder Claude?

Der Off-Peak-Tarif ist weiter günstiger als Claude Opus 5, aber nicht mehr die eindeutig günstigste Option insgesamt. OpenAIs GPT-5.6 Luna ($0.20/$1.20 je Million Token) und Alibabas internationale Qwen3.8-Max-Preise ($2/$6) unterbieten DeepSeeks neue Off-Peak-Tarife in mindestens einer Dimension. DeepSeek bleibt für ein Frontier-Modell relativ günstig, nur nicht mehr das eindeutig günstigste.

Kann ich Alibabas Qwen3.8-Max-Open-Weights kostenlos in einem kommerziellen Produkt nutzen?

Ja, für die meisten Fälle — persönliche Projekte und interne Unternehmensnutzung bleiben unberührt. Die Einschränkung gilt nur, wenn Sie ein Model-as-a-Service- oder AI-Work-Assistant-Geschäft betreiben, das in einem beliebigen zusammenhängenden 12-Monats-Zeitraum mehr als 50 Millionen US-Dollar verdient hat; diese Stufe braucht eine separate kommerzielle Lizenz von Alibaba. Produkte mit 100 Mio.+ MAU oder 20 Mio.+ US-Dollar Monatsumsatz müssen den Modellnamen anzeigen.

Ist Qwen3.8-Max für Nutzer in den USA, der EU oder dem Vereinigten Königreich gesperrt?

Nein. Diese Behauptung kursierte online, ist aber falsch — die veröffentlichte Lizenz enthält keinerlei geografische Einschränkung. Die Einschränkungen sind umsatzbasiert, nicht an Ihren Standort oder den Ihrer Nutzer gebunden.

Was unterscheidet GLM-5.3 tatsächlich von GLM-5.2?

Auf Basismodell-Ebene nichts — beide nutzen dasselbe Foundation-Modell mit 743 Milliarden Parametern. Die Performance-Gewinne (rund das Sechsfache auf Terminal-Bench 3.0) kommen vollständig aus der Skalierung von Reinforcement Learning im Post-Training, ohne Retraining der Basis.

Wird Meta wirklich sein Flagship öffnen, nicht nur Muse Glimmer?

Noch nicht. Muse Glimmer ist ein destilliertes 30B-Modell, nicht Metas echtes Flagship. Mark Zuckerberg hat gesagt, Open Weights für das größere, geschlossene Muse Spark 1.2 kämen „bald“. Wenn das passiert, wäre es das erste US-Flagship-Modell, das offen erscheint. Zum Redaktionsschluss als erklärte Absicht behandeln, nicht als bestätigten Fakt.