In fünf Tagen trafen Teams, die chinesische Frontier-APIs kaufen oder Open Weights laden, auf drei Bewegungen, die sich oberflächlich widersprechen. DeepSeek hat API-Preise auf einzelnen Stufen um bis zu 1.100 % angehoben. Alibaba hat in derselben Woche ein 2,4-Billionen-Parameter-Flagship als Open Weight veröffentlicht — eines, das zuvor nie öffentlich lag. Zhipu AI hat GLM-5.3 ausgeliefert und Coding-Benchmarks um rund das Sechsfache verbessert — auf derselben Basis, ohne Retraining. Dieser Text richtet sich an Ingenieure, die eine Rechnung neu kalkulieren, eine Lizenz lesen und einen Stack wählen müssen. Das gemeinsame Signal: Chinas Labs konkurrieren nicht mehr nur über den Preis, sondern über Preismacht.
SECTION 01 Fünf Fehlinterpretationen der DeepSeek-Preiserhöhung
Es fehlt nicht an Schlagzeilen. Es fehlt an sauberen Abrechnungsdimensionen.
- „1.100 %“ als ganze Rechnung behandeln: die Zahl gilt nur für Peak-Cache-Hit-Input auf V4-Pro. Output stieg um 350 %. Cache-Miss-Input stieg um 200 %.
- Die offizielle API automatisch als günstigste Route annehmen: zu Spitzenzeiten liegt DeepSeeks Listenpreis jetzt über mehreren Resellern (GMI Cloud, Novita und andere notieren V4 Pro weiter unter dem neuen offiziellen Peak).
- Alibabas Drop als Apache-2.0-Wohltätigkeit lesen: die Gewichte sind ladbar, aber ein Model-as-a-Service- oder AI-Work-Assistant-Geschäft über 50 Millionen US-Dollar in einem beliebigen 12-Monats-Zeitraum braucht eine separate kommerzielle Lizenz.
- Das Geo-Ban-Gerücht wiederholen: Behauptungen, die USA, die EU, das Vereinigte Königreich und Südkorea dürften den Checkpoint nicht laden, sind falsch. Die veröffentlichte Lizenz enthält keine Territorialklausel.
- GLM-5.3 als neues Foundation-Modell bezeichnen: es nutzt die 743-Milliarden-Basis von GLM-5.2. Die Gewinne kommen aus skaliertem Post-Training-RL. Die Scores sind Herstellerangaben; ein unabhängiger Re-Run ist noch nicht öffentlich.
Drei Labs, drei Züge, ein Signal: Chinas KI-Labs konkurrieren um Preismacht, nicht nur um den Preis.
SECTION 02 Zeitplan: Was ausgeliefert wurde — und wann US-Labs die Preise senkten
Der Blick von oben: Am 30. Juli senkte OpenAI die günstigste Stufe, GPT-5.6 Luna, um 80 %. Am 6.–7. August machte es Luna zum kostenlosen Default mit unbegrenzten Textchats. Während chinesische Labs Preise anhoben und Flagship-Gewichte öffneten, senkten US-Labs Preise und gingen auf der Consumer-Schicht kostenlos. Das sind zwei Seiten desselben Kampfes. Frühere Produktnotizen: Qwen3.8-Max-Launch und DeepSeek-V4-GA-Preise.
| Datum | Ereignis |
|---|---|
| 16. Juli 2026 | Moonshot AI veröffentlicht Kimi K3 als Open Weight (2,8 Billionen Parameter) und zieht US-Sicherheitsprüfung auf sich |
| 2.–3. August 2026 | Alibaba previewt, dann startet Qwen3.8-Max als gehostete API |
| 10. August 2026 | Meta veröffentlicht Muse Glimmer (30B, Apache 2.0) und kündigt Open Weights für das Flagship Muse Spark 1.2 an |
| 12. August 2026 | Alibaba veröffentlicht Qwen3.8-2.4T-A95B auf Hugging Face / ModelScope; xAI liefert Grok 4.6 |
| 13. August 2026 | DeepSeek-V4-Pro geht GA und kündigt eine Preiserhöhung zum 17. August an; Google liefert rabattiertes Gemini 3.7 Flash |
| 14. August 2026 | Zhipu liefert GLM-5.3 und nutzt die 743B-Basis von GLM-5.2 |
| 17. August 2026, 00:00 Uhr Peking-Zeit | DeepSeeks neue Preise treten in Kraft |
SECTION 03 Die Zahlen: DeepSeek-Tarife, Qwen-Specs, GLM-5.3-Benchmarks
Die neuen DeepSeek-Tarife gelten ab 17. August, 00:00 Uhr Peking-Zeit. Spitzenzeiten sind 9–12 Uhr und 14–18 Uhr Peking-Zeit. Die 1.100-%-Schlagzeile gilt für Peak-Cache-Hit-Input — die Stufe, die am nächsten an kostenlos lag. Output, der die meisten realen Rechnungen dominiert, stieg um 350 %. Eine unabhängige Kostenmodellierung fand: ein realistischer Lastfall mit hohem Verbrauch (rund 84 Mio. Token/Monat, überwiegend Off-Peak, zur Hälfte Cache-Hits) sieht eher einen Anstieg um den Faktor 1,8.
| Abrechnungsposition | Alt | Neu Off-Peak | Neu Peak | Peak-Anstieg |
|---|---|---|---|---|
| V4-Flash Cache-Hit (Input) | ¥0.02 | ¥0.05 | ¥0.10 | ~400 % |
| V4-Flash Cache-Miss (Input) | ¥1.0 | ¥1.5 | ¥3.0 | 200 % |
| V4-Flash Output | ¥2.0 | ¥4.5 | ¥9.0 | 350 % |
| V4-Pro Cache-Hit (Input) | ¥0.025 | ¥0.15 | ¥0.30 | ~1.100 % |
| V4-Pro Cache-Miss (Input) | ¥3.0 | ¥4.5 | ¥9.0 | 200 % |
| V4-Pro Output | ¥6.0 | ¥13.5 | ¥27.0 | 350 % |
| Spezifikation | Detail |
|---|---|
| Parameter | 2,4 Billionen gesamt, 95 Milliarden aktiv pro Token (MoE, 512 Experten, 10 geroutet + 1 shared) |
| Kontextfenster | 262.144 Token nativ (Open Checkpoint), erweiterbar auf ca. 1,01 Mio.; gehostetes Max standardmäßig 1 Mio. |
| Release-Takt | Preview 2. Aug. → API live 3. Aug. → Open Weights 12. Aug. |
| API-Preise (international) | $2/M Input, $6/M Output |
| Lizenz | Nicht Apache 2.0 — eine eigene Qwen3.8-Max-Lizenz |
| Warum es zählt | Erstes Mal, dass Alibaba ein Max-Tier-Flagship als Open Weight veröffentlicht; Qwen3.5/3.6/3.7 Max blieben API-only |
| Benchmark | GLM-5.2 | GLM-5.3 | Änderung |
|---|---|---|---|
| Terminal-Bench 3.0 | 4,6 % | 28,3 % | +23,7 Punkte |
| DeepSWE v1.1 | 46,2 % | 66,9 % | +20,7 Punkte |
| Agents' Last Exam (CLI) | 23,8 % | 28,5 % | +4,7 Punkte |
| CyberGym | 77,2 % | 84,5 % | +7,3 Punkte |
| AutomationBench | 26,2 % | 48,2 % | +22,0 Punkte |
Das sind Zhipus eigene Zahlen. GLM-5.3 liegt auf Terminal-Bench 3.0 weiter hinter GPT-5.6 Sol (34,6 %) und Claude Fable 5 (33,7 %). Es ist ein starkes Open-Weight-Ergebnis, kein uneingeschränkter Frontier-Sieg.
SECTION 04 Drei Strategien: Tageszeit-Tarife, lizenzierte Gewichte, Post-Training
DeepSeek: von pauschal günstig zu Tageszeit-Tarifen — ein Kapazitätsproblem, keine Markenwende. Die bequeme Fehllektüre lautet: „Chinas günstigstes Modell ist eingeknickt.“ Die Struktur liest sich eher wie sichtbar gemachte Compute-Knappheit. Flache, immer günstige Preise funktionierten als Akquise, solange das GPU-Angebot mithielt. Als die Nutzung exponentiell wuchs und die Kapazität nicht, musste etwas explizit werden. „Flexiblere Workload-Planung anregen“ ist Konzernsprache für knappe Peak-Compute. Zu Spitzenzeiten ist die offizielle API nicht mehr der günstigste Weg, DeepSeek zu fahren. Diese Annahme ist gerade gebrochen.
Alibaba: Open Weights kaufen Entwickleraufmerksamkeit; eine eigene Lizenz schützt die Umsatzdecke. Den 2,4-Billionen-Checkpoint zu veröffentlichen und eine Custom-Lizenz anzuhängen, ist ein Zug. Jedes Model-as-a-Service- oder AI-Work-Assistant-Geschäft mit mehr als 50 Millionen US-Dollar in einem beliebigen 12-Monats-Zeitraum muss eine separate kommerzielle Lizenz verhandeln. Produkte mit 100 Mio.+ monatlich aktiven Nutzern oder 20 Mio.+ US-Dollar Monatsumsatz müssen den Modellnamen anzeigen. Die Wette: internationale Entwickler gewinnen, Hebel behalten gegenüber jedem, der Inference oben drauf verkaufen kann. Das ist eine andere Wette als Metas Muse Glimmer unter uneingeschränktem Apache 2.0. Das Geo-Ban-Gerücht ist falsch — prüfen Sie die LICENSE-Datei, nicht den Ankündigungsthread.
GLM-5.3: keine neue Basis, eine größere Post-Training-Wette. Dieselbe 743B-Basis wie GLM-5.2, kein Retraining, und ein Sprung um rund das Sechsfache auf Terminal-Bench 3.0 (4,6 % → 28,3 %) durch Skalierung der RL-Umgebungen. Wenn Pretraining-Skalierungsgesetze abflachen, wird Post-Training-RL zu einem eigenen Hebel mit niedrigerer Kostenschwelle als ein neues Foundation-Modell. Mid-Tier-Labs können die Lücke auf agentischen und Coding-Benches schließen, ohne Pretrain-Budgets in OpenAI-Größe.
SECTION 05 Ist DeepSeek noch das günstigste Frontier-Modell? Sechs-Schritte-Audit
CNY zu USD etwa ¥7,15/$1, Näherungswerte. Off-Peak-V4-Pro liegt weiter klar unter Claude Opus 5, ist aber nicht mehr die eindeutig günstigste Option. Die internationalen Qwen3.8-Max-Preise und OpenAIs Luna unterbieten DeepSeeks Off-Peak-Tarif. „Chinesisches Modell = günstigstes Modell“ hielt den Großteil von 2025 und Anfang 2026. Das ist jetzt keine sichere Annahme mehr. Kontext zur US-Senkung: GPT-5.6 Luna um 80 % gesenkt.
| Modell | Input | Output | Open Weights? |
|---|---|---|---|
| DeepSeek V4-Pro (Peak) | ¥9.0 (~$1.26) | ¥27.0 (~$3.78) | Nein |
| DeepSeek V4-Pro (Off-Peak) | ¥4.5 (~$0.63) | ¥13.5 (~$1.89) | Nein |
| Qwen3.8-Max (internationale API) | $2.00 | $6.00 | Ja (Custom-Lizenz) |
| OpenAI GPT-5.6 Luna | $0.20 | $1.20 | Nein |
| Claude Opus 5 (impliziert, nach Alibabas Vergleichsverhältnis) | ~$5.00 | ~$25.00 | Nein |
Wer diese Woche liefern muss, auditiert den Stack in sechs Schritten statt die Schlagzeile zu multiplizieren. Wer Nutzungs- und Abrechnungsdaten über die offizielle API oder Reseller-Clouds verarbeitet, sollte die Datenflüsse einmal DSGVO-konform dokumentieren — unabhängig davon, welcher Tarif am Ende gewinnt.
- Rechnung zerlegen: die letzten 30 Tage in Cache-Hit-Input, Cache-Miss-Input und Output aufteilen. Die neue Karte auf jede Zeile anwenden. Nicht die ganze Rechnung mit 1.100 % multiplizieren.
- Peking-Spitzenzeiten markieren: 9–12 Uhr und 14–18 Uhr Peking-Zeit. Die Ankündigung bat aus einem Grund um flexiblere Planung.
- Offiziell gegen Reseller halten: im Peak prüfen, ob GMI Cloud, Novita oder ein anderer Reseller DeepSeeks offiziellen Peak-Tarif noch unterbietet.
- LICENSE-Datei lesen: bevor Sie Qwen3.8-2.4T-A95B laden, die Schwellen 50 Mio. USD / 100 Mio. MAU / 20 Mio. USD Monatsumsatz bestätigen. Geo-Ban-Threads ignorieren.
- GLM-5.3 als Post-Training-Delta behandeln: dieselbe Basis wie 5.2, nur Hersteller-Benches. Eigene Terminal- und SWE-Tasks neu fahren, bevor Sie tauschen.
- Nach Schicht routen: günstigen Consumer-Text zu Luna; Open Weights und Ökosystem zu Qwen; peak-verschiebbare Frontier-Inference zu DeepSeek Off-Peak; langhorizontige Agents und iOS-CI auf einen echten Mac, nicht auf einen Hypervisor.
peak = {"in_miss": 9.0, "in_hit": 0.30, "out": 27.0}
off = {"in_miss": 4.5, "in_hit": 0.15, "out": 13.5}
tokens_m = {"in_miss": 40, "in_hit": 40, "out": 4}
def bill(rate, t):
return t["in_miss"]*rate["in_miss"] + t["in_hit"]*rate["in_hit"] + t["out"]*rate["out"]
print("off-peak CNY", round(bill(off, tokens_m), 2))
print("peak CNY", round(bill(peak, tokens_m), 2))
SECTION 06 Was unbestätigt bleibt, warum zwei Preiskriege, welche Quellen neu öffnen
- Die 1.100-%-Schlagzeile ist korrekt und unvollständig: sie gilt nur für Peak-Cache-Hit-Input. Output — die Zeile, die die meisten Rechnungen dominiert — stieg um 350 %.
- Zhenwu-M890- / Pangu-AL128-Behauptungen: mehrere chinesische Finanzmedien schreiben, ein Teil der Qwen3.8-Max-Inference laufe auf Alibabas eigenen Chips. Alibaba hat keine unabhängigen technischen Docs und keine Dritt-Benches veröffentlicht. Als unbestätigt behandeln.
- GLM-5.3 und eine „ernsthafte Cursor-Schwachstelle“: VentureBeat plus Zhipus eigene Offenlegung. Technische Details sind nicht öffentlich. Lesen als herstellerseitig, nicht unabhängig auditiert.
- Vergeltungs-Exportkontrollen: Berichte, Chinas Handelsministerium bereite KI-/Halbleiter-Gegenmaßnahmen vor, sind spekulative Medien, keine offizielle Ankündigung.
Im vergangenen Monat haben Chinas Top-Labs in einem Tempo ausgeliefert, das inländische Finanzmedien „drei Modell-Updates pro Woche“ (一周三更) nennen — DeepSeek, Alibaba, Zhipu, plus Moonshots Kimi K3 (Open Weight am 16. Juli, 2,8 Billionen) und MiniMax H3. Chinesische Berichterstattung rahmt das so: Open-Weight-Releases erzwingen eine globale Neubepreisung. US-Labs fuhren auf der Consumer-Schicht den Gegenzug: OpenAIs 80-%-Luna-Schnitt, dann unbegrenzter kostenloser Text; Googles halbpreisiges Gemini 3.7 Flash am 13. August. Offene Flagship-Gewichte plus gestufte, höhere Preise an der compute-knappen Spitze; frei und günstig am Consumer-Ende. Beides ist real. Sie optimieren verschiedene Teile des Trichters.
Es gibt auch eine geopolitische Schicht. Kimi K3 hat bereits US-Sicherheitsprüfung auf sich gezogen. Manche Analysten lesen Alibabas 2,4-Billionen-Drop in diesem Fenster als Festschreiben internationaler Entwickleraufmerksamkeit und einer Erzählung von „technologischer Parität“, bevor regulatorische Enge kommt. Das ist eine informierte Interpretation, kein bestätigter Fakt — und leicht zu übersehen, wenn Sie nur englische Produktposts lesen.
Offizielle und gegencheckte Quellen. Öffnen Sie diese Seiten erneut, bevor Sie Preise oder Lizenzbedingungen weitergeben:
DeepSeek offizielle API-Preise (Peak- / Off-Peak-Karte)
Alibaba Cloud Community: Qwen3.8-Max-Launch-Notiz
Hugging Face: Qwen3.8-2.4T-A95B-Checkpoint
Reuters / MarketScreener: DeepSeek hebt V4-API-Preise an
MarkTechPost: GLM-5.3, gleiche Basis, nur Post-Training
Ein 2,4-Billionen-MoE selbst zu hosten oder einen Agenten in Xcode und iOS-CI zu verdrahten, legt Hypervisor-Steuer auf eine Token-Rechnung, die gerade gestiegen ist. Für verlustfreie native Rechenleistung, stabile iOS-CI/CD und 24/7-Agent-Automatisierung ist ein MACNOX Cloud-Physikknoten in der Regel der bessere Produktionsweg: echte Apple-Hardware, voller Root, kein Hypervisor, Abrechnung nach Tag / Woche / Monat. Kontext teilen: OpenRouter-Juli-Rankings.
SECTION 07 FAQ
Ist DeepSeek nach der Erhöhung noch günstiger als GPT-5.6 oder Claude?
Der Off-Peak-Tarif ist weiter günstiger als Claude Opus 5, aber nicht mehr die eindeutig günstigste Option insgesamt. OpenAIs GPT-5.6 Luna ($0.20/$1.20 je Million Token) und Alibabas internationale Qwen3.8-Max-Preise ($2/$6) unterbieten DeepSeeks neue Off-Peak-Tarife in mindestens einer Dimension. DeepSeek bleibt für ein Frontier-Modell relativ günstig, nur nicht mehr das eindeutig günstigste.
Kann ich Alibabas Qwen3.8-Max-Open-Weights kostenlos in einem kommerziellen Produkt nutzen?
Ja, für die meisten Fälle — persönliche Projekte und interne Unternehmensnutzung bleiben unberührt. Die Einschränkung gilt nur, wenn Sie ein Model-as-a-Service- oder AI-Work-Assistant-Geschäft betreiben, das in einem beliebigen zusammenhängenden 12-Monats-Zeitraum mehr als 50 Millionen US-Dollar verdient hat; diese Stufe braucht eine separate kommerzielle Lizenz von Alibaba. Produkte mit 100 Mio.+ MAU oder 20 Mio.+ US-Dollar Monatsumsatz müssen den Modellnamen anzeigen.
Ist Qwen3.8-Max für Nutzer in den USA, der EU oder dem Vereinigten Königreich gesperrt?
Nein. Diese Behauptung kursierte online, ist aber falsch — die veröffentlichte Lizenz enthält keinerlei geografische Einschränkung. Die Einschränkungen sind umsatzbasiert, nicht an Ihren Standort oder den Ihrer Nutzer gebunden.
Was unterscheidet GLM-5.3 tatsächlich von GLM-5.2?
Auf Basismodell-Ebene nichts — beide nutzen dasselbe Foundation-Modell mit 743 Milliarden Parametern. Die Performance-Gewinne (rund das Sechsfache auf Terminal-Bench 3.0) kommen vollständig aus der Skalierung von Reinforcement Learning im Post-Training, ohne Retraining der Basis.
Wird Meta wirklich sein Flagship öffnen, nicht nur Muse Glimmer?
Noch nicht. Muse Glimmer ist ein destilliertes 30B-Modell, nicht Metas echtes Flagship. Mark Zuckerberg hat gesagt, Open Weights für das größere, geschlossene Muse Spark 1.2 kämen „bald“. Wenn das passiert, wäre es das erste US-Flagship-Modell, das offen erscheint. Zum Redaktionsschluss als erklärte Absicht behandeln, nicht als bestätigten Fakt.