Startseite / Blog / Kimi K3
ENGINEERING_BLOG · 2026.07.28

Kimi K3 Open Weights:
2,8 Billionen Parameter vollständig veröffentlicht

Am Abend des 27. Juli 2026 veröffentlichte Moonshot AI die vollständigen Modellgewichte und den Technical Report für Kimi K3 sowie die drei zentralen Infrastrukturkomponenten MoonEP, FlashKDA und AgentEnv. Mit 2,8 Billionen Gesamtparametern, ~104 Milliarden aktiven Parametern, 1-Million-Token-Kontext und nativer Vision ist K3 das erste vollständig freigegebene Modell im 3T-Bereich — ~1,56 TB Download auf Hugging Face, innerhalb von 30 Minuten Trending #1. Dieser datenbasierte Leitfaden richtet sich an Entwickler und Enterprise-Teams, die K3-Integration oder Self-Hosting evaluieren: Architektur, Benchmarks, Lizenzschwellen und realistische API- vs. Hardware-Pfade.

SECTION 01 Kimi K3 Auswahlfehler: Open-Source-Verwechslung, Lizenzfallen, Self-Hosting-Hürden

Nach dem Weight-Drop am 27. Juli sind dies die häufigsten Fehleinschätzungen:

  • „Open Weight“ als „Open Source“ behandeln: Moonshot verwendet in offiziellen Materialien nie „open source“, nur „open weight“. Trainingsdaten und vollständiger Trainingscode fehlen — kein OSI-Standard;
  • Modified-MIT-Eindruck aus der K2-Ära übernehmen: K3 nutzt eine vollständig eigene Lizenz mit MaaS-Umsatzschwellen und Attribution — abweichend vom Preview vom 22. Juli;
  • Self-Hosting-Kosten unterschätzen: 896 geroutete Experten und 1,56 TB machen Consumer-Hardware unpraktikabel. Moonshot empfiehlt Supernode-Konfigurationen mit 64+ Beschleunigern;
  • Nur Hersteller-Benchmarks vertrauen: Evaluations-Frameworks variieren stark. Priorisieren Sie unabhängige Retests von Vals AI und Artificial Analysis;
  • Geopolitischen Kontext ignorieren: Die Freigabe fällt in die eskalierende US-China-„Model-Distillation“-Debatte. Siehe Kimi-K3-Distillation-Berichterstattung.

Nur 11 Tage zwischen K3-API-Debut auf kimi.com und der vollständigen Weight-Freigabe am 27. Juli — ein klares Signal: Der Open-Weight-Wettlauf ist im „3T-Club“ angekommen.

SECTION 02 Kimi K3 Release-Timeline und Kerndaten

  • 16. Juli (Vorabend WAIC 2026): K3 auf kimi.com, Kimi Work, Kimi Code und API — Gewichte noch nicht öffentlich;
  • 17. Juli: Branchenanalyse der Architektur. Xinhua nennt es das weltweit größte Open Model nach Parameterzahl;
  • 22.–23. Juli: US-China-„Model-Distillation“-Streit eskaliert. Weißes Haus wirft Moonshot industrial-scale Distillation gegen Anthropic Fable vor;
  • 27. Juli (~23 Uhr): Vollständige Gewichte, Technical Report, MoonEP und AgentEnv (FlashKDA bereits offen);
  • 28. Juli: Chinas Handelsministerium weist US-„AI-Hegemonie“-Vorwürfe zurück. Alibaba stellt Qwen3.8-Max-Preview mit 24 Billionen Parametern vor — direkte Antwort auf K3.
Kimi K3 Kerndaten
Spezifikation Wert
Gesamtparameter 2,8 Billionen (2,8T)
Aktive Parameter ~104 Milliarden
Architektur MoE — 896 geroutete Experten, 16 pro Token aktiv
Attention Kimi Delta Attention (KDA) + Gated MLA
Kontextfenster 1.000.000 Token
Multimodalität Native Vision (ViT-V2, 27 Layer)
Gewichtsformat MXFP4-Gewichte, MXFP8-Aktivierungen (quantization-aware ab SFT)
Download-Größe ~1,56 TB (Hugging Face)
Lizenz Eigene Lizenz — Moonshot nennt es „open weight“, nicht „open source“

SECTION 03 KDA, Attention Residuals, Per-Head Muon: drei Architektur-Innovationen

Kimi K3 skaliert nicht nur Parameter — Moonshot hat drei etablierte Deep-Learning-Bausteine neu gebaut: Attention, Residualverbindungen und Optimizer.

Kimi Delta Attention (KDA): Gated DeltaNet nutzt ein skalares Vergessens-Gate. KDA ersetzt es durch kanalweises Gating — jede Feature-Dimension erhält eigene Decay-Rate. Als chunkwise DPLR-Formulierung implementiert, wechselt KDA mit wenigen globalen Gated-MLA-Layern und hält den KV-Cache bei 1M Token klein.

Attention Residuals (AttnRes): Standard-Residuals akkumulieren gleichmäßig. AttnRes aggregiert selektiv und input-abhängig über alle vorherigen Layer — ein RMSNorm und ein Pseudo-Query-Vektor pro Layer, ~25 % höhere Trainingseffizienz bei unter 2 % Mehrkosten.

Per-Head Muon: Der Muon-Optimizer operiert pro Attention-Head statt modellweit einheitlich. Mit Stable LatentMoE (896 Experten, 16 aktiv — ~1,8 % Sparsity) und Quantile Balancing beweist Moonshot eine obere Schranke redundanter Experten pro Compute-Rank.

SECTION 04 MoonEP, FlashKDA, AgentEnv und Benchmark-Vergleich

Drei offene Infrastruktur-Releases
Technologie Rolle Kernfähigkeit
MoonEP Großskalige feinkörnige MoE-Kommunikation Dupliziert überlastete Experten temporär; gleiche Token-Anzahl pro Rank; obere Schranke redundanter Experten
FlashKDA CUTLASS-basierter KDA-Kernel 1,72×–2,22× schnelleres Prefill auf NVIDIA H20 vs. flash-linear-attention; Drop-in via chunk_kda
AgentEnv Agent-Sandbox (mit KVCache.ai) Firecracker-microVM; Checkpoint-Latenz ab 133 ms, Resume 49 ms, bis 6,5× Memory-Overcommit

SWE-bench Verified (unabhängige Evaluation, Vals AI, Stand Juli 2026):

SWE-bench Verified unabhängiger Retest
Modell Score Release-Datum
Claude Opus 5 97 % 2026-07-24
GPT-5.6 Sol 96,2 % 2026-07-09
Claude Fable 5 95 % 2026-06-09
Kimi K3 93,4 % 2026-07-16
Qwen3.7-Max 79,4 % 2026-05-19

Im Artificial Analysis Intelligence Index (max Reasoning Tier) erreicht Kimi K3 ~57 — Platz 3 global, #1 unter Open-Weight-Modellen, hinter Claude Fable 5 (60) und GPT-5.6 Sol (59). Bei ~0,95 US-Dollar pro Task ~60 % günstiger als Claude Fable 5 (~2,40 US-Dollar), aber teurer als GLM-5.2 (~0,47 US-Dollar). Capability-Ceiling der Open-Weight-Liga, nicht das Preis-Leistungs-Modell. K3 führt aktuell Arena.ais Frontend Code Arena an.

SECTION 05 Kimi K3 Lizenz, API-Preise und 6-Schritte-Integrationscheckliste

Die eigene Lizenz führt zwei kommerzielle Schwellen ein, die in der K2-Familie fehlten:

  • Model-as-a-Service-Umsatzschwelle: MaaS-Betrieb mit mehr als 20 Mio. US-Dollar aggregiertem Umsatz in 12 Monaten erfordert separate Vereinbarung mit Moonshot AI;
  • Attributionsschwelle: Bei über 100 Mio. monatlich aktiven Nutzern oder 20 Mio. US-Dollar Monatsumsatz muss „Kimi K3“ prominent in der UI erscheinen.
Kimi K3 API-Preise (pro Million Token)
Token-Typ Preis
Input (Cache-Hit) 0,30 US-Dollar
Input (Cache-Miss) 3,00 US-Dollar
Output (inkl. Reasoning-Trace) 15,00 US-Dollar

Moonshots disaggregierte Mooncake-Serving-Architektur erreicht bei typischen Coding-Workloads über 90 % Cache-Hit-Rate — realer Durchschnitt nahe 0,30 US-Dollar. Self-Hosting braucht 64+ Beschleuniger; für die meisten Teams ist die offizielle API oder OpenRouter der praktikable Weg.

  1. Lizenz-Compliance prüfen: Vollständige K3-Lizenz lesen; MaaS-Umsatz- und Attributionsschwellen für Ihr Geschäftsmodell bewerten;
  2. Integrationspfad wählen: API (OpenAI-SDK-kompatibel unter https://api.moonshot.ai/v1, Modell-ID kimi-k3) oder Drittanbieter-Hosting via OpenRouter;
  3. API-Credentials konfigurieren: Schlüssel in der Moonshot-Konsole erstellen; base URL und API-Key im Projekt tauschen;
  4. Cache-Hit-Rate testen: Kleiner Lasttest auf Coding-Agent-Workloads; Mooncake-Cache-Einfluss auf reale Kosten messen;
  5. Self-Hosting-Feasibility bewerten: Bei lokaler Inferenz GPU-Cluster (64+ empfohlen) und 1,56 TB Speicher für Gewichte bestätigen;
  6. Infra-Tooling evaluieren: Für MoE-Training oder KDA-Beschleunigung MoonEP, FlashKDA (chunk_kda Drop-in) und AgentEnv-Sandbox prüfen.
kimi-k3-api-test.py
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_MOONSHOT_API_KEY",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Explain Kimi Delta Attention in 3 sentences."}]
)
print(response.choices[0].message.content)

SECTION 06 Zitierbare Technikdaten und Auswahl-Fazit

  • 2,8T gesamt / ~104B aktiv: Größter vollständiger Open-Weight-Release, ~1,56 TB auf Hugging Face;
  • SWE-bench Verified 93,4 %: Vals-AI-Retest — #1 unter Open-Weight, 3,6 Punkte hinter Claude Opus 5 (97 %);
  • Artificial Analysis Intelligence Index ~57: Platz 3 global, #1 Open Weight, ~0,95 US-Dollar pro Task;
  • FlashKDA Prefill 1,72×–2,22× schneller: Auf NVIDIA H20 vs. flash-linear-attention-Baseline;
  • AgentEnv Checkpoint 133 ms / Resume 49 ms: Von Moonshot gemeldet, noch nicht unabhängig reproduziert.

Offizielle und Drittquellen — vor Produktiveinsatz gegen aktuelle Seiten prüfen:

Moonshot AI Official Blog: Kimi K3 Technical Report

Hugging Face: moonshotai Organisation (K3-Gewichte)

GitHub: moonshotai/FlashKDA

Teams, die Agent-Pipelines auf K3 aufbauen, stehen vor drei Engpässen: virtualisierte Mac-Umgebungen mit Metal-Overhead und instabiler Tool-Chain für Xcode-Builds und iOS-CI; reine GPU-Cluster ohne nativen Apple-Build-Stack; API-Traffic zu chinesischen Servern mit DSGVO-relevanten Datenflüssen (AVV, Verarbeitungsverzeichnis, Art. 44 ff.). Für null Hypervisor-Overhead, stabile iOS/macOS-CI und 24/7-AI-Agent-Automatisierung sind MACNOX-Cloud-Physik-Macs meist die bessere Ergänzung: 100 % Apple-Hardware, voller Root, flexible Tages-/Wochen-/Monatsmiete. Mehr Hintergrund: Kimi-K3-Architektur-Review und OpenRouter-Juli-Rankings.

SECTION 07 FAQ

Ist Kimi K3 Open Source?

Nein, nicht nach OSI-Definition. Es ist open weight: trainierte Gewichte, Technical Report und Infrastruktur-Tools sind öffentlich, Trainingsdaten und vollständiger Trainingscode nicht. Moonshot verwendet selbst nur „open weight“.

Kann ich Kimi K3 kommerziell kostenlos nutzen?

Ja, für die überwiegende Mehrheit der Fälle. Einschränkungen gelten bei MaaS-Umsatz über 20 Mio. US-Dollar in 12 Monaten oder bei über 100 Mio. MAU bzw. 20 Mio. US-Dollar Monatsumsatz.

Wie viel Hardware brauche ich für Self-Hosting?

Moonshot empfiehlt Supernode-Konfigurationen mit 64 oder mehr Beschleunigern. Die meisten Teams sollten die offizielle API oder OpenRouter nutzen.

Wie schlägt sich Kimi K3 gegen GPT-5.6 und Claude?

Auf SWE-bench Verified (93,4 % vs. 95–97 %) und Intelligence Index (Platz 3) hinter Frontier-Closed-Models, aber stärkstes verfügbares Open-Weight-Modell vor GLM-5.2 und DeepSeek V4 Pro.

Was unterscheidet Kimi K3 von Kimi K2?

K3 hat ~3× die Parameter von K2.5, fügt Attention Residuals und Per-Head Muon hinzu, erweitert Kontext und Multimodalität deutlich. Die Lizenz enthält eine neue MaaS-Umsatzschwelle, die K2 nicht hatte.