Startseite / Blog / K3 Open Weights
ENGINEERING_BLOG · 2026.07.22

Kimi K3 Open Weights:
Release am 27. Juli 2026 – Benchmarks, Preise und Hardware-Anforderungen

Moonshot AI hat Kimi K3 am 16. Juli 2026 per API freigeschaltet und für den 27. Juli 2026 vollständige Open Weights auf Hugging Face angekündigt — das erste öffentlich downloadbare Modell über der 2-Billionen-Parameter-Schwelle. Für DevOps-Leads, ML-Engineers und Compliance-Verantwortliche in der EU bedeutet das: API sofort nutzbar, Self-Host erst in wenigen Tagen, aber nur mit 64+ Beschleunigern und ~1,4 TB Gewichtsdaten realistisch. Dieser datenbasierte Leitfaden liefert Timeline 16./17./27. Juli, 2,8T-Specs, Benchmark 57,1, API-Preise, Open Weights vs. Open Source, Self-Host-Hardware, Branchenbedeutung, 7-Schritte-Vorbereitungscheckliste, DSGVO-Kontext, FAQ und MACNOX-Integrationsbrücke — ergänzend zum ausführlichen Kimi-K3-Architektur-Review.

  • TL;DR: API live seit 16. Juli; WAIC-Ankündigung 17.–20. Juli; Open Weights 27. Juli 2026 auf Hugging Face.
  • Leistung: Intelligence Index v4.1 = 57,1 (Rang 4); SWE Marathon 42,0 (Platz 1).
  • Self-Host: ~1,4 TB Gewichte (MXFP4), Produktions-Inferenz braucht 64+ GPU — kein Edge-Deployment.

SECTION 01 Open Weights vs. Open Source: Warum der Unterschied für Enterprise-Teams zählt

„Open Source“ und „Open Weights“ werden oft synonym verwendet — technisch und rechtlich unterscheiden sie sich:

  • Open Weights: Modellgewichte zum Download; Training-Code, Datensätze und vollständige Reproduzierbarkeit fehlen oft. Kimi K3 fällt in diese Kategorie — Moonshot veröffentlicht Gewichte, nicht das komplette Trainings-Stack.
  • Open Source (OSI-Definition): Quellcode, Lizenz und Reproduzierbarkeit unter freier Lizenz — Kimi K3 erfüllt das nicht vollständig, auch nach dem 27. Juli.
  • API-first-Lag: 11 Tage zwischen API-Go-Live (16. Juli) und Weight-Release (27. Juli) zwingen Teams zur Cloud-Abhängigkeit oder teuren GPU-Reservierungen.
  • DSGVO-Relevanz: API-Traffic zu chinesischen Servern erfordert AVV, Datenfluss-Dokumentation und ggf. EU-Rechenzentrum-Alternativen. Self-Host nach dem 27. Juli ermöglicht Datenresidenz in der EU — wenn Hardware und Betrieb unter eigener Kontrolle stehen.
  • Fine-Tuning vs. Inferenz: Open Weights erlauben Domain-Fine-Tuning und On-Premise-Inferenz; ohne Gewichte bleibt nur API mit Vendor-Lock-in — siehe DeepSeek-V4-GA-Preisvergleich für alternative Open-Weight-Pfade.

Einordnung: Kimi K3 Open Weights sind der größte jemals veröffentlichte Weight-Drop (2,8T total, 896-Experten-MoE) — kein vollständig reproduzierbares Open-Source-Projekt, aber ein neuer Fine-Tuning-Baseline für die Community.

SECTION 02 Timeline 16./17./27. Juli 2026 und Kernspecs des 2,8T-Modells

Kimi K3 Release-Timeline
Datum Meilenstein Relevanz für Teams
16. Juli 2026 Stiller API-Go-Live (kimi-k3) Sofort testbar via kimi.com, platform.kimi.ai, OpenRouter
17.–20. Juli 2026 WAIC Shanghai — offizielle Vorstellung Benchmarks, Architektur-Details, Commercial Metrics bestätigt
27. Juli 2026 Vollständige Open Weights auf Hugging Face Download, Self-Host, Fine-Tuning; vLLM/SGLang Day-0 erwartet
Kimi K3 Kerndaten — Stand Juli 2026
Parameter Wert
Gesamtparameter 2,8 Billionen (2,8T)
Architektur KDA + AttnRes + Stable LatentMoE
MoE-Konfiguration 896 Experten, 16 aktiv pro Token (1,8 % Sparsity)
Kontextfenster 1.048.576 Token (1M)
Vision Nativ multimodal (Text, Bild, Video)
Quantisierung MXFP4-Gewichte, MXFP8-Aktivierungen
Download-Größe (geschätzt) ~1,4 TB (MXFP4-Variante)
Self-Host Minimum 64+ Beschleuniger (Super-Node)

Im Branchenvergleich: K3 liegt ~75 % über DeepSeek V4 Pro (1,6T) und 2,7× über Xiaomis Open Model (1,02T). Moonshot hielt 9 von 12 Monaten den Titel „größtes Open-Source-Modell“ — K3 setzt diesen Rekord erneut, sobald die Gewichte am 27. Juli verfügbar sind.

SECTION 03 Benchmark 57,1 und Branchenbedeutung: Was der Weight-Drop verändert

Bevor Teams GPU-Cluster reservieren, lohnt die Leistungs-Einordnung — alle Werte Moonshot Self-Report (17. Juli 2026):

Kimi K3 — ausgewählte Benchmarks vs. Frontier
Benchmark Kimi K3 Claude Fable 5 GPT-5.6 Sol
Intelligence Index v4.1 57,1 (Rang 4) 59,9 58,9
SWE Marathon 42,0 35,0 39,0
OmniDocBench 91,1 89,8 85,8
Program Bench 77,8 76,8 77,6
Terminal Bench 2.1 88,3 84,6 88,8

Branchenbedeutung des 27.-Juli-Drops:

  • Erster >2T-Weight-Download: Schwellenwert, den bisher nur Closed-API-Modelle überschritten haben.
  • Neue Fine-Tuning-Baseline: Enterprise-Teams können Domain-Adapter trainieren, ohne Closed-API-Abhängigkeit — relevant für regulierte Branchen mit DSGVO-Anforderungen an Datenresidenz.
  • MoE-Inferenz als Infrastruktur-Disziplin: 896 Experten erfordern spezialisierte Routing-Stacks (vLLM, SGLang) — kein Plug-and-Play wie bei 7B-Modellen.
  • Wettbewerbsdruck: Moonshot ARR >$300M, Valuation $31,5B, API-Anteil >70 % — Open Weights als strategisches Signal an DeepSeek, Alibaba und globale Frontier-Labs. Details im vollständigen Kimi-K3-Review.

SECTION 04 API-Preise heute vs. Self-Host-Kosten ab 27. Juli

API-Preisvergleich pro 1M Token
Modell Input Output Cache-Input Kontext
Kimi K3 (API) $3,00 $15,00 $0,30 1M
Claude Sonnet 5 $3,00 $15,00 200K
DeepSeek V4 Pro $1,74 $3,48 $0,145 128K
Kimi K3 (Self-Host ab 27.7.) CapEx + OpEx GPU-Cluster 1M (lokal)
Entscheidungsmatrix: API vs. Self-Host vs. Hybrid
Szenario Empfehlung Begründung
Schneller PoC vor 27. Juli Kimi K3 API Sofort verfügbar, $3/$15, Cache $0,30/M
DSGVO-konforme Datenresidenz (EU) Self-Host ab 27.7. Keine Prompt-Übertragung an Drittstaaten-Server
Kostenoptimiert, kein Compliance-Zwang DeepSeek V4 Pro API Output $3,48/M — deutlich unter K3
Domain-Fine-Tuning Kimi K3 Open Weights Größte verfügbare Open Weights, 2,8T
Edge / Laptop-Inferenz Weder API noch K3 Self-Host 64+ GPU erforderlich — kein Edge-Modell

Cache-Hit-Rate >90 % in Kimi-Code-Workflows senkt effektiven Input auf ~$0,55/M — bis zum 27. Juli ist API der pragmatische Weg; danach entscheidet TCO zwischen GPU-Miete und Token-Abrechnung.

SECTION 05 Self-Host-Realität: 1,4 TB Gewichte und 64+ GPU — keine Laptop-Workload

Der Weight-Drop am 27. Juli ist kein Consumer-Release. Realistische Produktions-Inferenz erfordert:

  • ~1,4 TB Download: MXFP4-quantisierte Gewichte auf Hugging Face — Storage-Planung und Bandbreite vor Release klären.
  • 64+ Beschleuniger: Moonshot nennt ein Super-Node-Minimum (z. B. NVIDIA H100/H200) für Full-Throughput-Inferenz bei 2,8T MoE.
  • Framework-Adapter: vLLM, SGLang und transformers mit MXFP4/NVFP4-Unterstützung — Day-0-Release erwartet, aber Production-Hardening braucht Wochen.
  • KV-Cache bei 1M Kontext: KDA reduziert Speicher um 75 %, bleibt aber datacenter-scale — nicht vergleichbar mit 7B/70B Self-Host.
  • EU-Betrieb: Self-Host in EU-Rechenzentren erfüllt Datenresidenz-Anforderungen der DSGVO Art. 44 ff., sofern keine Weiterleitung an Drittstaaten erfolgt — dokumentieren Sie Verarbeitungsverzeichnis und TOMs vor Go-Live.

SECTION 06 7-Schritte-Checkliste: Vorbereitung auf den 27.-Juli-Weight-Release

  1. API-Baseline messen (sofort): Kimi K3 via kimi-k3 auf platform.kimi.ai testen; Latenz, Qualität und Kosten gegen interne Workloads benchmarken — siehe Architektur- und Setup-Guide.
  2. GPU-Kapazität reservieren: 64+ Beschleuniger für PoC-Inferenz frühzeitig bei Cloud-Anbietern oder On-Premise anfragen — Engpass nach Release wahrscheinlich.
  3. Storage planen: ~1,4 TB für MXFP4-Gewichte plus Checkpoint-Overhead; Bandbreite für Erst-Download kalkulieren.
  4. Framework-Stack vorbereiten: vLLM/SGLang-Branch mit Kimi-K3-Support tracken; Test-Cluster mit kleineren MoE-Modellen vorab validieren.
  5. Compliance dokumentieren: Für EU-Teams AVV, Verarbeitungsverzeichnis und Datenfluss-Diagramm — Self-Host vs. API-Route festlegen; DSGVO Art. 32 TOMs aktualisieren.
  6. Fine-Tuning-Pipeline skizzieren: Domain-Datensätze, LoRA/Full-Fine-Tune-Entscheidung und Eval-Harness vor Weight-Download definieren.
  7. Hybrid-Fallback definieren: API für Burst-Last, Self-Host für sensitive Workloads — Failover und Kosten-Obergrenzen festlegen.
kimi_k3_api_baseline.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Baseline-Test vor Self-Host..."}]
)
print(response.usage)

SECTION 07 Zitierbare Kennzahlen, Quellen und Entwickler-Fazit

  • Timeline: API 16. Juli → WAIC 17.–20. Juli → Open Weights 27. Juli 2026.
  • Parameter: 2,8T total; MoE 896/16; Kontext 1.048.576 Token; Download ~1,4 TB (MXFP4).
  • Intelligence Index v4.1: 57,1 (Rang 4); SWE Marathon 42,0 (Platz 1).
  • API: $3/$15 pro M; Cache-Hit $0,30/M; Modell-ID kimi-k3.
  • Self-Host: 64+ Beschleuniger Minimum; vLLM/SGLang Day-0 erwartet.
  • Commercial: ARR >$300M; Valuation $31,5B (Juni 2026).

Verifizierbare Quellen — nach dem 27. Juli erneut prüfen:

Moonshot AI: Kimi K3 Official Blog

Kimi API Platform — Dokumentation

Artificial Analysis — Intelligence Index v4.1 Rankings

VentureBeat — Moonshot AI Kimi K3 Open-Source-Bericht

South China Morning Post — Kimi K3 Moonshot AI

Teams, die Kimi K3 in Agent-Pipelines mit macOS-CI, Xcode-Builds und 7×24-Automatisierung integrieren, stehen vor drei Engpässen bis zum Weight-Release: ① API-Abhängigkeit ohne EU-Datenresidenz; ② macOS-CI auf VMs mit Metal-Overhead und instabiler Tool-Chain; ③ lokale Macs ohne Dauerbetrieb für Langhorizont-Agenten. Cloud-VMs verschärfen Latenz; reine GPU-Cluster decken keinen nativen Apple-Build-Stack ab. Für null Hypervisor-Overhead, stabile iOS/macOS-CI und AI-Agent-Automatisierung sind MACNOX-Cloud-Physik-Macs meist die bessere Ergänzung zum K3-Stack: 100 % Apple-Hardware, voller Root, flexible Tages-/Wochen-/Monatsmiete. Siehe Mac Mini M4 Miete vs. Kauf, Agent-Kostenanalyse Grok 4.5 und die Preisseite.

SECTION 08 FAQ

Sind Kimi K3 Open Weights dasselbe wie Open Source?

Nein. Open Weights bedeutet downloadbare Modellgewichte ohne vollständigen Trainings-Code und Datensätze. OSI-konformes Open Source ist K3 nicht — auch nach dem 27. Juli.

Wann genau erscheinen die Gewichte?

Moonshot bestätigt den 27. Juli 2026 auf Hugging Face. API ist seit dem 16. Juli live; WAIC-Ankündigung folgte am 17. Juli.

Kann ich K3 auf einem MacBook lokal ausführen?

Nein. ~1,4 TB Gewichte und 64+ GPU für Produktions-Inferenz — kein Laptop- oder Mac-Mini-Workload. Für Apple-Build-CI nutzen Sie dedizierte Physik-Macs.

Ist Self-Host DSGVO-konform?

Self-Host in EU-Rechenzentren unter eigener Kontrolle erfüllt Datenresidenz-Anforderungen, sofern keine Weiterleitung an Drittstaaten erfolgt. API-Nutzung erfordert separate AVV und Datenfluss-Dokumentation zu chinesischen Servern.

Lohnt sich API vor dem 27. Juli?

Ja für PoC und Baseline-Messung. $3/$15 mit Cache $0,30/M und 1M Kontext — danach TCO gegen GPU-Cluster vergleichen.

Wo finde ich Architektur-Details zu KDA und MoE?

Im ausführlichen Kimi-K3-Review — KDA, AttnRes, Stable LatentMoE und vollständige Benchmark-Matrix.