Startseite / Blog / Qwen3.8-Max
ENGINEERING_BLOG · 2026.08.04

Ist Qwen3.8-Max Open Source?
Was Alibaba diese Woche wirklich geliefert hat

Kurzantwort: noch nicht. Am 3. August 2026 hat Alibaba Qwen3.8-Max per Cloud-API allgemein verfügbar gemacht und auf qwen.ai mit „Open-Source“ gekennzeichnet. Zum Redaktionsschluss gibt es kein Modell-Repository auf Hugging Face oder ModelScope, keine Lizenzbedingungen und kein festes Datum — nur das Versprechen, Gewichte für Qwen3.8-Max und ein kleineres Qwen3.8-27B „nächste Woche“ zu veröffentlichen. Dieser Leitfaden richtet sich an Entwickler, die Flagship-APIs und Agent-Migrationen evaluieren: Was live ist, was fehlt, wie sich das Modell gegen Kimi K3 und DeepSeek V4 verhält — und warum das Open-Source-Label vor den Gewichten kam.

SECTION 01 Warum der Qwen3.8-Max-Launch Transparenzfragen aufwirft

Nach der GA-Ankündigung am 3. August sind dies die häufigsten Fehlinterpretationen in Entwicklerforen:

  • Das qwen.ai-„Open-Source“-Badge als ausgelieferte Gewichte behandeln: Bis zum Redaktionsschluss existiert kein Hugging-Face- oder ModelScope-Repository; nur ein vages „nächste Woche“ für Qwen3.8-Max und Qwen3.8-27B;
  • Hersteller-Benchmarks als unabhängige Verifikation akzeptieren: PaperBench, OSWorld-Verified und SWE-bench Pro stammen aus Alibabas eigenem Harness; Artificial Analysis hat die GA-Zahlen nicht reproduziert;
  • Transparenzlücken der Preview ignorieren: Die Preview vom 19. Juli untersagte automatisierte Produktionsnutzung, nannte keine aktiven Parameter und lieferte ohne Model Card;
  • Arenas vorläufigen Rang überinterpretieren: Platz 5 mit 1.496 Punkten ist als Preliminary markiert; Ränge 1–4 und 6–8 sind allesamt Anthropic-Modelle;
  • Infrastruktur für Langzeit-Agenten unterschätzen: 16-tägiges unbeaufsichtigtes Coding und 500+-Schritt-Chipdesign erfordern stabile CI und macOS-Pipelines — virtualisierte Mac-Umgebungen verursachen versteckten Overhead.

Alibabas Hongkong-Aktien stiegen am Release-Tag um rund 7 %, US-Notierte um etwa 4,5 % — der Markt bewertete dies als Wiedereinstieg Alibabas in die Frontier-Modell-Diskussion, nicht als Routine-Iteration.

SECTION 02 Qwen3.8-Max Zeitplan und Kerndaten

  • 16. Juli: Moonshot AI veröffentlicht Kimi K3 (2,8 Billionen Parameter, 16 von 896 Experten aktiv), mit unabhängigen Benchmarks und Technical Report;
  • 19. Juli: Qwen3.8-Max-Preview über Token Plan / Qoder / QoderWork zu 10 % des Endpreises — keine aktiven Parameter, keine Benchmark-Tabelle, Produktionsautomatisierung in den AGB untersagt;
  • 27. Juli: Kimi K3 Open Weights erscheinen planmäßig auf Hugging Face, plus MoonEP und FlashKDA;
  • 31. Juli: DeepSeek liefert V4-Flash und übertrifft die eigene V4-Pro-Preview in neun agentischen/Coding-Benchmarks ohne zusätzliche Parameter;
  • 3. August: Qwen3.8-Max geht GA mit vollständiger Benchmark-Tabelle; „Qwen Office“-Agent-Produkt startet parallel;
  • Erwartet um den 10. August: Open Weights für Qwen3.8-Max und Qwen3.8-27B auf Hugging Face und ModelScope versprochen — noch kein Repository, keine Lizenz, kein festes Datum.
Qwen3.8-Max Kerndaten (GA)
Punkt Wert
GA-Datum 3. August 2026
Gesamt- / aktive Parameter 2,4T / 95B
Architektur Sparse MoE + Hybrid Attention auf Qwen3.5-Basis
Kontextfenster 1M Token (≈983K mit Thinking; 131K max. Output)
Eingabemodalitäten Text, Bild, Video
API-Preis (pro 1M Token) Input $2, Output $6; impliziter Cache-Hit $0,25; explizites Cache-Write $2,50, Read $0,17
Arena Text Arena (Snapshot 1. August) #5, 1.496 Punkte (Preliminary) — einziges Nicht-Anthropic-Modell in den Top 8
Arena Vision Arena #2, hinter Claude Fable 5
Open Weights „Nächste Woche“ versprochen; zum Redaktionsschluss nicht live

SECTION 03 MoE-Architektur und Flagship-Vergleich

Qwen3.8-Max treibt die Gesamtparameter auf 2,4 Billionen, aktiviert aber nur 95 Milliarden pro Token — Inferenzkosten folgen der aktiven Zahl, nicht der Gesamtzahl. Bei $2/$6 pro Million Token liegt die Preisgestaltung deutlich unter Claude Opus 5 ($5/$25) und Claude Fable 5 ($10/$50). Das ist eine Wette auf architektonische Effizienz als Preishebel, nicht auf reine Skalierung als Capability-Hebel.

Drei reasoning_effort-Stufen (low / medium / xhigh, Standard xhigh) tauschen Latenz gegen Tiefe über enable_thinking oder Anthropic-kompatibles reasoning.effort. Die API unterstützt OpenAI- und Anthropic-kompatible Protokolle und lässt sich per Base-URL-Wechsel in Claude Code, Codex, Qoder CLI, Qwen Code und OpenClaw einbinden.

Qwen3.8-Max vs. Wettbewerber
Modell Gesamt / aktiv Preis (in/out) Open Weights Unabhängiger Benchmark
Qwen3.8-Max 2,4T / 95B $2 / $6 Versprochen, nicht ausgeliefert Noch keine
Kimi K3 2,8T / ~50B $3 / $15 Ausgeliefert 27. Juli Artificial Analysis ≈ 57,11
DeepSeek V4-Flash Wie V4-Pro Nicht vollständig veröffentlicht Ausgeliefert Übertrifft V4-Pro in 9 agentischen/Coding-Benchmarks
Claude Fable 5 Nicht offengelegt $10 / $50 Geschlossen #1 Arena Text Arena
Unabhängiger Blindtest (269-Datei-Architekturaufgabe) Kimi K3 83 vs. Qwen3.8-Max Preview 80 Peer-Tier, ausgeglichen

Alibaba-eigene Scores (Quelle: Herstellermaterialien): PaperBench 93,0 (+28,2), OSWorld-Verified 86,1, SWE-bench Pro 67,7 (hinter Fable 5s 80,0), HLE 43,6 (niedrigster Wert unter den verglichenen Flagships; Fable 5 meldet 53,3). Eine Vergleichs-Fußnote deutet an, „Fable-5-Ergebnisse könnten Fallbacks beinhalten“, ohne gleichwertige methodische Offenlegung für Alibabas eigene Läufe.

SECTION 04 Open-Source-Label-Problem und 6-Schritte-API-Checkliste

Das vorsichtigkeitswürdigste Detail sind nicht Spitzenwerte, sondern Informations-Timing: Das Open-Source-Tag ging am GA-Tag live, während Gewichte, Lizenz und Lieferdatum unveröffentlicht blieben; jeder Benchmark stammt aus Alibabas Harness (einschließlich QwenSWEBench und RecreationBench); die Juli-Preview hatte keine Model Card und untersagte Produktionsautomatisierung.

  1. Open-Weight-Status prüfen: Hugging Face / ModelScope nach Qwen3.8-Max durchsuchen — Repository, Lizenz und Gewichte bestätigen, bevor Sie allein auf das Website-Badge migrieren;
  2. Protokoll wählen: OpenAI-kompatiblen oder Anthropic-kompatiblen Endpunkt nach bestehender Toolchain wählen; Qwen Office vs. reine API-Aufrufe evaluieren;
  3. Reasoning-Stufe konfigurieren: low oder medium für latenzkritische Tasks; Standard xhigh für komplexe Agenten und Token-Ausgaben überwachen;
  4. Caching aktivieren: Implizite/explizite Cache-Preise nutzen (Hit $0,25, Read $0,17), um Rechnungen bei Langkontext-Agent-Workloads zu senken;
  5. A/B auf Ihrer Workload: Blind gegen Kimi K3 und DeepSeek V4 auf echten Aufgaben vergleichen — nicht nur auf Hersteller-Benchmarks vertrauen;
  6. Agent-Infrastruktur planen: Langzeit-Tasks brauchen stabile CI und macOS-Build-Umgebungen; physische Mac-Knoten vs. Virtualisierungs-TCO vergleichen.
qwen3-8-max-api.py
from anthropic import Anthropic

client = Anthropic(
    api_key="YOUR_DASHSCOPE_API_KEY",
    base_url="https://dashscope.aliyuncs.com/api/v2/apps/anthropic/v1"
)

response = client.messages.create(
    model="qwen3.8-max",
    max_tokens=4096,
    thinking={"type": "enabled", "budget_tokens": 8000},
    messages=[{"role": "user", "content": "Summarize MoE active params for Qwen3.8-Max."}]
)
print(response.content[0].text)

SECTION 05 Zitierbare Daten, Branchenkontext und Auswahl-Fazit

  • 2,4T gesamt / 95B aktiv: Aktive Zahl erstmals bei GA offengelegt — Preview-Stufe nannte nichts, Schwerpunkt der Transparenzkritik im Juli;
  • API $2/$6 pro 1M Token: Unter Claude Opus 5 und Fable 5;
  • Arena Text #5 (1.496, Preliminary): Einziges Nicht-Anthropic-Modell in den Top 8; Vision Arena #2;
  • Langzeit-Showcases: Alibaba nennt 16-tägiges unbeaufsichtigtes Coding und 500+-Schritt-Chip-Optimierung; partieller Trace auf GitHub qwen-code-dev-bot/oh-my-cli, kein vollständiges unabhängiges Audit;
  • DSGVO bei Cloud-API: Prompts und Code-Snippets an Alibaba Cloud Endpunkte können Drittlandübermittlungen nach Art. 44 ff. DSGVO auslösen — AVV, SCCs und Verarbeitungsverzeichnis vor Produktions-Routing dokumentieren;
  • Consumer-Reichweite: Qwen treibt bereits generative KI in Apple Intelligence für China — siehe Apple Intelligence China und Qwen-Partnerschaft.

2026 ist das Jahr, in dem Billionen-Parameter-Modelle proliferierten, aber DeepSeek V4-Flash agentische Gewinne ohne Parameter-Skalierung bewies. Alibabas seltene Zusage, ein Max-Klasse-Modell als Open Weight zu veröffentlichen, reiht sich neben Kimi K3 und DeepSeek in eine chinesische Lab-Wende ein. In derselben Woche meldeten OpenAI und Anthropic Agent-Jailbreak-Vorfälle, die eine White-House-Konferenz am 4. August zu freiwilligen Cybersicherheitstests auslösten — ein scharfer Kontrast globaler KI-Narrative.

Offizielle und Drittquellen — vor Migrationsentscheidungen gegen aktuelle Seiten prüfen:

Arena.ai: öffentliche Text- und Vision-Arena-Leaderboards

GitHub: qwen-code-dev-bot/oh-my-cli (partieller Langzeit-Coding-Trace)

TechCrunch: Apple Intelligence für China mit Alibabas Qwen AI genehmigt

Teams, die Agent-Pipelines auf Qwen3.8-Max aufbauen, sehen bei Xcode-Builds, Metal-Beschleunigung und iOS-CI Virtualisierungs-Overhead. Für Produktionsumgebungen mit verlustfreier nativer Rechenleistung, stabilem iOS-CI/CD und 7×24-Agent-Automatisierung sind MACNOX dedizierte physische Mac-Knoten meist die bessere Wahl: 100 % Apple-Hardware, voller Root-Zugang, kein Hypervisor-Steuer, flexible Tages-/Wochen-/Monatsmiete. Mehr Kontext zu chinesischen Modellen: OpenRouter-Juli-Rankings-Analyse.

SECTION 07 FAQ

Ist Qwen3.8-Max jetzt Open Source?

Nein. Die API ist über Alibaba Cloud Model Studio live, aber Gewichte fehlen auf Hugging Face und ModelScope zum Redaktionsschluss. Das qwen.ai-Open-Source-Tag beschreibt Absicht, kein ausgeliefertes Artefakt — Gewichte plus Qwen3.8-27B sind „nächste Woche“ versprochen, ohne festes Datum.

Wie schneidet Qwen3.8-Max gegen Kimi K3 ab?

Es gibt keinen einzelnen autoritativen Head-to-Head. Der einzige unabhängige Vergleich — eine blind geprüfte 269-Datei-Architekturaufgabe — ergab Kimi K3 83/100 vs. Qwen3.8-Max 80/100, im Wesentlichen ein Unentschieden. Kimi K3s Vorteil heute: öffentliche Gewichte und Artificial-Analysis-Score. Qwen3.8-Maxs Vorteil: niedrigere API-Preise und breitere native Multimodal-Unterstützung.

Bedeuten 2,4 Billionen Parameter ein Rechenzentrum?

Für den vollständigen Checkpoint ja — ein 2,4T-MoE-Artefakt (selbst mit 95B aktiv) ist Multi-Node-Rechenzentrums-Skala. Die API umgeht das vollständig. Für lokales Deployment ist das kleinere Qwen3.8-27B realistischer, das parallel als Open Weight versprochen ist.

Kann ich Alibabas Benchmark-Zahlen vertrauen?

Als Herstellerangaben behandeln, nicht als verifizierte Ergebnisse. Jeder veröffentlichte Score stammt aus Alibabas eigenem Harness, einschließlich mehrerer Inhouse-Benchmarks. Keine unabhängige Plattform hatte GA-Zahlen zum Redaktionsschluss reproduziert; Arenas Eintrag bleibt Preliminary. Auf Dritt-Reproduktionen oder eigene Workload-Tests warten.

Warum sollte mich das interessieren, wenn ich Alibabas Modelle nicht nutze?

Qwen treibt bereits generative KI in Apple Intelligence für Nutzer in China, on-device auf aktuellen iPhones. Das ist ein lebendes Beispiel dafür, wie eine chinesische Open-Weight-Modellfamilie in eine globale Consumer-Plattform eingebettet wird — unabhängig davon, ob Sie die Qwen-API direkt aufrufen.