Moonshot AI hat Kimi K3 am 16. Juli 2026 per API freigeschaltet und für den 27. Juli 2026 vollständige Open Weights auf Hugging Face angekündigt — das erste öffentlich downloadbare Modell über der 2-Billionen-Parameter-Schwelle. Für DevOps-Leads, ML-Engineers und Compliance-Verantwortliche in der EU bedeutet das: API sofort nutzbar, Self-Host erst in wenigen Tagen, aber nur mit 64+ Beschleunigern und ~1,4 TB Gewichtsdaten realistisch. Dieser datenbasierte Leitfaden liefert Timeline 16./17./27. Juli, 2,8T-Specs, Benchmark 57,1, API-Preise, Open Weights vs. Open Source, Self-Host-Hardware, Branchenbedeutung, 7-Schritte-Vorbereitungscheckliste, DSGVO-Kontext, FAQ und MACNOX-Integrationsbrücke — ergänzend zum ausführlichen Kimi-K3-Architektur-Review.
- TL;DR: API live seit 16. Juli; WAIC-Ankündigung 17.–20. Juli; Open Weights 27. Juli 2026 auf Hugging Face.
- Leistung: Intelligence Index v4.1 = 57,1 (Rang 4); SWE Marathon 42,0 (Platz 1).
- Self-Host: ~1,4 TB Gewichte (MXFP4), Produktions-Inferenz braucht 64+ GPU — kein Edge-Deployment.
SECTION 01 Open Weights vs. Open Source: Warum der Unterschied für Enterprise-Teams zählt
„Open Source“ und „Open Weights“ werden oft synonym verwendet — technisch und rechtlich unterscheiden sie sich:
- Open Weights: Modellgewichte zum Download; Training-Code, Datensätze und vollständige Reproduzierbarkeit fehlen oft. Kimi K3 fällt in diese Kategorie — Moonshot veröffentlicht Gewichte, nicht das komplette Trainings-Stack.
- Open Source (OSI-Definition): Quellcode, Lizenz und Reproduzierbarkeit unter freier Lizenz — Kimi K3 erfüllt das nicht vollständig, auch nach dem 27. Juli.
- API-first-Lag: 11 Tage zwischen API-Go-Live (16. Juli) und Weight-Release (27. Juli) zwingen Teams zur Cloud-Abhängigkeit oder teuren GPU-Reservierungen.
- DSGVO-Relevanz: API-Traffic zu chinesischen Servern erfordert AVV, Datenfluss-Dokumentation und ggf. EU-Rechenzentrum-Alternativen. Self-Host nach dem 27. Juli ermöglicht Datenresidenz in der EU — wenn Hardware und Betrieb unter eigener Kontrolle stehen.
- Fine-Tuning vs. Inferenz: Open Weights erlauben Domain-Fine-Tuning und On-Premise-Inferenz; ohne Gewichte bleibt nur API mit Vendor-Lock-in — siehe DeepSeek-V4-GA-Preisvergleich für alternative Open-Weight-Pfade.
Einordnung: Kimi K3 Open Weights sind der größte jemals veröffentlichte Weight-Drop (2,8T total, 896-Experten-MoE) — kein vollständig reproduzierbares Open-Source-Projekt, aber ein neuer Fine-Tuning-Baseline für die Community.
SECTION 02 Timeline 16./17./27. Juli 2026 und Kernspecs des 2,8T-Modells
| Datum | Meilenstein | Relevanz für Teams |
|---|---|---|
| 16. Juli 2026 | Stiller API-Go-Live (kimi-k3) |
Sofort testbar via kimi.com, platform.kimi.ai, OpenRouter |
| 17.–20. Juli 2026 | WAIC Shanghai — offizielle Vorstellung | Benchmarks, Architektur-Details, Commercial Metrics bestätigt |
| 27. Juli 2026 | Vollständige Open Weights auf Hugging Face | Download, Self-Host, Fine-Tuning; vLLM/SGLang Day-0 erwartet |
| Parameter | Wert |
|---|---|
| Gesamtparameter | 2,8 Billionen (2,8T) |
| Architektur | KDA + AttnRes + Stable LatentMoE |
| MoE-Konfiguration | 896 Experten, 16 aktiv pro Token (1,8 % Sparsity) |
| Kontextfenster | 1.048.576 Token (1M) |
| Vision | Nativ multimodal (Text, Bild, Video) |
| Quantisierung | MXFP4-Gewichte, MXFP8-Aktivierungen |
| Download-Größe (geschätzt) | ~1,4 TB (MXFP4-Variante) |
| Self-Host Minimum | 64+ Beschleuniger (Super-Node) |
Im Branchenvergleich: K3 liegt ~75 % über DeepSeek V4 Pro (1,6T) und 2,7× über Xiaomis Open Model (1,02T). Moonshot hielt 9 von 12 Monaten den Titel „größtes Open-Source-Modell“ — K3 setzt diesen Rekord erneut, sobald die Gewichte am 27. Juli verfügbar sind.
SECTION 03 Benchmark 57,1 und Branchenbedeutung: Was der Weight-Drop verändert
Bevor Teams GPU-Cluster reservieren, lohnt die Leistungs-Einordnung — alle Werte Moonshot Self-Report (17. Juli 2026):
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| Intelligence Index v4.1 | 57,1 (Rang 4) | 59,9 | 58,9 |
| SWE Marathon | 42,0 | 35,0 | 39,0 |
| OmniDocBench | 91,1 | 89,8 | 85,8 |
| Program Bench | 77,8 | 76,8 | 77,6 |
| Terminal Bench 2.1 | 88,3 | 84,6 | 88,8 |
Branchenbedeutung des 27.-Juli-Drops:
- Erster >2T-Weight-Download: Schwellenwert, den bisher nur Closed-API-Modelle überschritten haben.
- Neue Fine-Tuning-Baseline: Enterprise-Teams können Domain-Adapter trainieren, ohne Closed-API-Abhängigkeit — relevant für regulierte Branchen mit DSGVO-Anforderungen an Datenresidenz.
- MoE-Inferenz als Infrastruktur-Disziplin: 896 Experten erfordern spezialisierte Routing-Stacks (vLLM, SGLang) — kein Plug-and-Play wie bei 7B-Modellen.
- Wettbewerbsdruck: Moonshot ARR >$300M, Valuation $31,5B, API-Anteil >70 % — Open Weights als strategisches Signal an DeepSeek, Alibaba und globale Frontier-Labs. Details im vollständigen Kimi-K3-Review.
SECTION 04 API-Preise heute vs. Self-Host-Kosten ab 27. Juli
| Modell | Input | Output | Cache-Input | Kontext |
|---|---|---|---|---|
| Kimi K3 (API) | $3,00 | $15,00 | $0,30 | 1M |
| Claude Sonnet 5 | $3,00 | $15,00 | — | 200K |
| DeepSeek V4 Pro | $1,74 | $3,48 | $0,145 | 128K |
| Kimi K3 (Self-Host ab 27.7.) | CapEx + OpEx GPU-Cluster | — | — | 1M (lokal) |
| Szenario | Empfehlung | Begründung |
|---|---|---|
| Schneller PoC vor 27. Juli | Kimi K3 API | Sofort verfügbar, $3/$15, Cache $0,30/M |
| DSGVO-konforme Datenresidenz (EU) | Self-Host ab 27.7. | Keine Prompt-Übertragung an Drittstaaten-Server |
| Kostenoptimiert, kein Compliance-Zwang | DeepSeek V4 Pro API | Output $3,48/M — deutlich unter K3 |
| Domain-Fine-Tuning | Kimi K3 Open Weights | Größte verfügbare Open Weights, 2,8T |
| Edge / Laptop-Inferenz | Weder API noch K3 Self-Host | 64+ GPU erforderlich — kein Edge-Modell |
Cache-Hit-Rate >90 % in Kimi-Code-Workflows senkt effektiven Input auf ~$0,55/M — bis zum 27. Juli ist API der pragmatische Weg; danach entscheidet TCO zwischen GPU-Miete und Token-Abrechnung.
SECTION 05 Self-Host-Realität: 1,4 TB Gewichte und 64+ GPU — keine Laptop-Workload
Der Weight-Drop am 27. Juli ist kein Consumer-Release. Realistische Produktions-Inferenz erfordert:
- ~1,4 TB Download: MXFP4-quantisierte Gewichte auf Hugging Face — Storage-Planung und Bandbreite vor Release klären.
- 64+ Beschleuniger: Moonshot nennt ein Super-Node-Minimum (z. B. NVIDIA H100/H200) für Full-Throughput-Inferenz bei 2,8T MoE.
- Framework-Adapter: vLLM, SGLang und transformers mit MXFP4/NVFP4-Unterstützung — Day-0-Release erwartet, aber Production-Hardening braucht Wochen.
- KV-Cache bei 1M Kontext: KDA reduziert Speicher um 75 %, bleibt aber datacenter-scale — nicht vergleichbar mit 7B/70B Self-Host.
- EU-Betrieb: Self-Host in EU-Rechenzentren erfüllt Datenresidenz-Anforderungen der DSGVO Art. 44 ff., sofern keine Weiterleitung an Drittstaaten erfolgt — dokumentieren Sie Verarbeitungsverzeichnis und TOMs vor Go-Live.
SECTION 06 7-Schritte-Checkliste: Vorbereitung auf den 27.-Juli-Weight-Release
- API-Baseline messen (sofort): Kimi K3 via
kimi-k3auf platform.kimi.ai testen; Latenz, Qualität und Kosten gegen interne Workloads benchmarken — siehe Architektur- und Setup-Guide. - GPU-Kapazität reservieren: 64+ Beschleuniger für PoC-Inferenz frühzeitig bei Cloud-Anbietern oder On-Premise anfragen — Engpass nach Release wahrscheinlich.
- Storage planen: ~1,4 TB für MXFP4-Gewichte plus Checkpoint-Overhead; Bandbreite für Erst-Download kalkulieren.
- Framework-Stack vorbereiten: vLLM/SGLang-Branch mit Kimi-K3-Support tracken; Test-Cluster mit kleineren MoE-Modellen vorab validieren.
- Compliance dokumentieren: Für EU-Teams AVV, Verarbeitungsverzeichnis und Datenfluss-Diagramm — Self-Host vs. API-Route festlegen; DSGVO Art. 32 TOMs aktualisieren.
- Fine-Tuning-Pipeline skizzieren: Domain-Datensätze, LoRA/Full-Fine-Tune-Entscheidung und Eval-Harness vor Weight-Download definieren.
- Hybrid-Fallback definieren: API für Burst-Last, Self-Host für sensitive Workloads — Failover und Kosten-Obergrenzen festlegen.
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Baseline-Test vor Self-Host..."}]
)
print(response.usage)
SECTION 07 Zitierbare Kennzahlen, Quellen und Entwickler-Fazit
- Timeline: API 16. Juli → WAIC 17.–20. Juli → Open Weights 27. Juli 2026.
- Parameter: 2,8T total; MoE 896/16; Kontext 1.048.576 Token; Download ~1,4 TB (MXFP4).
- Intelligence Index v4.1: 57,1 (Rang 4); SWE Marathon 42,0 (Platz 1).
- API: $3/$15 pro M; Cache-Hit $0,30/M; Modell-ID
kimi-k3. - Self-Host: 64+ Beschleuniger Minimum; vLLM/SGLang Day-0 erwartet.
- Commercial: ARR >$300M; Valuation $31,5B (Juni 2026).
Verifizierbare Quellen — nach dem 27. Juli erneut prüfen:
Moonshot AI: Kimi K3 Official Blog
Kimi API Platform — Dokumentation
Artificial Analysis — Intelligence Index v4.1 Rankings
VentureBeat — Moonshot AI Kimi K3 Open-Source-Bericht
South China Morning Post — Kimi K3 Moonshot AI
Teams, die Kimi K3 in Agent-Pipelines mit macOS-CI, Xcode-Builds und 7×24-Automatisierung integrieren, stehen vor drei Engpässen bis zum Weight-Release: ① API-Abhängigkeit ohne EU-Datenresidenz; ② macOS-CI auf VMs mit Metal-Overhead und instabiler Tool-Chain; ③ lokale Macs ohne Dauerbetrieb für Langhorizont-Agenten. Cloud-VMs verschärfen Latenz; reine GPU-Cluster decken keinen nativen Apple-Build-Stack ab. Für null Hypervisor-Overhead, stabile iOS/macOS-CI und AI-Agent-Automatisierung sind MACNOX-Cloud-Physik-Macs meist die bessere Ergänzung zum K3-Stack: 100 % Apple-Hardware, voller Root, flexible Tages-/Wochen-/Monatsmiete. Siehe Mac Mini M4 Miete vs. Kauf, Agent-Kostenanalyse Grok 4.5 und die Preisseite.
SECTION 08 FAQ
Sind Kimi K3 Open Weights dasselbe wie Open Source?
Nein. Open Weights bedeutet downloadbare Modellgewichte ohne vollständigen Trainings-Code und Datensätze. OSI-konformes Open Source ist K3 nicht — auch nach dem 27. Juli.
Wann genau erscheinen die Gewichte?
Moonshot bestätigt den 27. Juli 2026 auf Hugging Face. API ist seit dem 16. Juli live; WAIC-Ankündigung folgte am 17. Juli.
Kann ich K3 auf einem MacBook lokal ausführen?
Nein. ~1,4 TB Gewichte und 64+ GPU für Produktions-Inferenz — kein Laptop- oder Mac-Mini-Workload. Für Apple-Build-CI nutzen Sie dedizierte Physik-Macs.
Ist Self-Host DSGVO-konform?
Self-Host in EU-Rechenzentren unter eigener Kontrolle erfüllt Datenresidenz-Anforderungen, sofern keine Weiterleitung an Drittstaaten erfolgt. API-Nutzung erfordert separate AVV und Datenfluss-Dokumentation zu chinesischen Servern.
Lohnt sich API vor dem 27. Juli?
Ja für PoC und Baseline-Messung. $3/$15 mit Cache $0,30/M und 1M Kontext — danach TCO gegen GPU-Cluster vergleichen.
Wo finde ich Architektur-Details zu KDA und MoE?
Im ausführlichen Kimi-K3-Review — KDA, AttnRes, Stable LatentMoE und vollständige Benchmark-Matrix.