Startseite / Blog / Kimi K3 Test
ENGINEERING_BLOG · 2026.07.17

Kimi K3 im Test:
2,8 Billionen Parameter — das größte Open-Source-LLM 2026

Am 16. Juli 2026 schaltete Moonshot AI (月之暗面) Kimi K3 still live — ohne Pressekonferenz, aber mit 2,8 Billionen Parametern, dem bisher größten Open-Source-LLM weltweit. Wer Open-Source-Modelle für Coding-Agenten, lange Repo-Analysen oder multimodale Dokumente evaluiert, steht vor drei Fragen: Reicht die Intelligenz gegen Claude Fable 5 und GPT-5.6 Sol? Was kostet die API? Wann kommen die Gewichte? Dieser datenbasierte Leitfaden liefert Strategie-Hintergrund, KDA/AttnRes/MoE-Architektur, vollständige Benchmark-Matrix, Preisvergleich, 4 Zugangswege, 6-Schritte-Setup, Szenario-Entscheidungsmatrix, Open-Source-Timeline 27. Juli, zitierbare Kennzahlen und FAQ.

SECTION 01 Warum Kimi K3 jetzt relevant ist: Engpässe bei Kontext, Kosten und Open Weights

Kimi K3 adressiert drei typische Schmerzpunkte in produktiven LLM-Stacks:

  • Kontext-Decke: Die meisten Flaggschiff-APIs begrenzen sich auf 128K–400K Token — große Codebases erfordern Chunking, State-Verlust und teure Re-Prompts.
  • Langhorizont-Coding: Benchmarks wie SWE Marathon messen stundenlange Agent-Arbeit; viele Modelle kollabieren bei anhaltenden Tool-Loops.
  • Vendor-Lock-in: Closed-API-Abhängigkeit blockiert Fine-Tuning, On-Premise und auditierbare Pipelines — bis Open Weights verfügbar sind.
  • Kostenrealität: Claude Opus 4.8 kostet $5/$25 pro 1M Token; bei hohem Output-Volumen explodieren Agent-Budgets — siehe Grok-4.5-Preisanalyse.

Kernspecs auf einen Blick: MoE mit 896 Experten, 16 aktiv; 1.048.576 Token Kontext; native Vision (Text, Bild, Video); Modell-ID kimi-k3; Reasoning derzeit nur max-Effort; vollständige Gewichte ab 27. Juli 2026 auf Hugging Face.

Parameter-Vergleich — Open-Source-Flaggschiffe
Modell Parameter Kontext
Kimi K3 2,8T 1M
DeepSeek V4 Pro 1,6T 128K
Xiaomi Open Model 1,02T
Alibaba Qwen (Open) 397B

SECTION 02 Strategischer Hintergrund: WAIC-Timing, ARR und Moonshots Comeback

  • Größenrekord: In 9 von 12 Monaten hielt Kimi den Titel „größtes Open-Source-Modell“; K3 übertrifft DeepSeek V4 Pro um ~75 %.
  • WAIC 2026: Release am Vorabend der World AI Conference in Shanghai — starkes Signal an den chinesischen und globalen Markt.
  • Commercial Traction: ARR >$300M (Juni 2026); 6. Finanzierungsrunde bei $31,5B Pre-Money; API-Anteil >70 % am Umsatz; internationale Paid-User +400 %.
  • EU-Hinweis: API-Nutzung aus der EU erfordert Dokumentation von Datenflüssen zu chinesischen Servern — relevant für DSGVO-Compliance in Enterprise-Pipelines.

SECTION 03 Architektur: KDA, AttnRes und Stable LatentMoE im Detail

K3 ist kein reines Scale-Up — drei Engineering-Innovationen adressieren reale Skalierungsprobleme:

Kimi Delta Attention (KDA): Hybrid-Linear-Attention im Verhältnis 3:1 (drei Linear-Layer, ein Full-Attention-Layer). Effekt: KV-Cache bis −75 %, Decoding bei 1M Token bis 6,3× schneller, ohne messbaren Capability-Verlust in Short-/Long-Context und RL.

Attention Residuals (AttnRes): Selektives Retrieval über Tiefe statt gleichmäßiger Residual-Akkumulation — ~25 % höhere Trainingseffizienz bei <2 % Extra-Compute.

Stable LatentMoE: 896 Experten, 16 aktiv (Sparsity 1,8 %). Stabilisatoren:

MoE-Stabilisierungstechniken in Kimi K3
Technik Funktion
Quantile Balancing Expertenzuweisung aus Router-Quantilen — weniger fragile Heuristiken
Per-Head Muon Head-spezifische Optimierung für stabiles Large-Scale-Training
SiTU (Sigmoid Tanh Unit) Verbesserte Aktivierungskontrolle
Gated MLA Höhere Attention-Selektivität
Gesamt vs. Kimi K2 ~2,5× bessere Scaling-Effizienz

SECTION 04 Benchmark-Matrix: Coding, Reasoning und Vision

Folgende Werte stammen aus Moonshots Self-Report (16. Juli 2026). Harness unterscheidet sich: K3 via Kimi Code, GPT via Codex, Claude via Claude Code — unabhängige Reproduktionen laufen noch.

Coding-Benchmarks — Kimi K3 vs. Frontier-Modelle
Benchmark Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8
DeepSWE 67,5 70,0 73,0 59,0
Program Bench 77,8 76,8 77,6 71,9
Terminal Bench 2.1 88,3 84,6 88,8 84,6
FrontierSWE 81,2 86,6 71,3 66,7
SWE Marathon 42,0 35,0 39,0 40,0
BrowseComp 91,2 88,0 90,4 84,3
Automation Bench 30,8 29,1 29,7 27,2
GPQA-Diamond 93,5 92,6 94,1 91,0
MMMU-Pro (Vision) 81,6 81,2 83,0 78,9
OmniDocBench 91,1 89,8 85,8 87,9

SWE Marathon ist der entscheidende Coding-Indikator für Langhorizont-Agenten — K3 führt mit 42,0. Artificial Analysis Intelligence Index v4.1: K3 = 57,1 (Rang 4), Fable 5 = 59,9, GPT-5.6 Sol = 58,9 — Lücke nur 2,8 Punkte.

SECTION 05 API-Preise: $3/$15, Cache-Hit und China-Tarife

Preisvergleich pro 1M Token
Modell Input Output Cache-Input Kontext
Kimi K3 $3,00 $15,00 $0,30 1M
Claude Sonnet 5 $3,00 $15,00 200K
Claude Opus 4.8 $5,00 $25,00 200K
GPT-5.5 $5,00 $30,00 400K
DeepSeek V4 Pro $1,74 $3,48 $0,145 128K
Kimi K2.6 $0,95 $4,00 $0,16 256K

K3 matcht Sonnet-Standardpreise, liefert aber 5× Kontext. Moonshot berichtet >90 % Cache-Hit in Kimi-Code-Workflows (Mooncake Split-Inference) — effektiver Input oft ~$0,55/M. China-API: ¥20/¥100 pro M, Cache ¥2/M; Consumer ab ¥199 (bis 11. Aug.).

SECTION 06 6 Schritte: Kimi K3 sofort nutzen (4 Zugangswege)

Vier Zugangswege: (1) kimi.com Web/App — kostenlos mit Google-Login; (2) Moonshot API — OpenAI-kompatibel; (3) OpenRouter — moonshotai/kimi-k3; (4) Self-Host ab 27. Juli — 64+ Beschleuniger nötig.

  1. Account anlegen: kimi.com — K3 läuft standardmäßig mit max Reasoning.
  2. API-Key holen: Registrierung auf platform.kimi.ai, Billing aktivieren.
  3. Client konfigurieren: OpenAI-SDK mit base_url=https://api.moonshot.ai/v1 und Modell kimi-k3.
  4. Smoke-Test: Kurzer Coding-Prompt; Latenz und Output-Qualität gegen Claude/GPT baseline messen.
  5. OpenRouter-Alternative: Falls vorhandenes Routing — Modell-ID moonshotai/kimi-k3, offizielle Preise ohne Aufschlag.
  6. Produktions-Pipeline: Cache-freundliche Prompt-Struktur (wiederkehrende System-Prompts); Agent-Logs für DSGVO-Audit dokumentieren; CI-Runner auf nativem macOS statt VM für lokale Tool-Integration testen.
kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Analysiere diese Codebase..."}]
)
print(response.choices[0].message.content)

SECTION 07 Szenario-Matrix und Open Weights am 27. Juli 2026

Modellwahl nach Use Case
Szenario Empfehlung Begründung
Langhorizont-Coding (SWE Marathon) Kimi K3 Benchmark #1, 1M Kontext
Komplexe Repo-Bugfixes Claude Fable 5 FrontierSWE 86,6
Terminal-/Tool-Agenten GPT-5.6 Sol Terminal Bench 88,8
Multimodale Dokumente Kimi K3 OmniDocBench 91,1
Kostenoptimiert DeepSeek V4 Pro Output $3,48/M
Self-Host Open Weights Kimi K3 (ab 27.7.) Größte verfügbare Open Weights

Am 27. Juli 2026 veröffentlicht Moonshot vollständige Gewichte auf Hugging Face — erstes Open-Modell >2T, Training mit MXFP4/MXFP8. Erwartete Day-0-Unterstützung in vLLM, SGLang und transformers. Meilensteine: 17.–20. Juli WAIC → 27. Juli Open Weights.

SECTION 08 Zitierbare Kennzahlen, Quellen und Entwickler-Fazit

  • Parameter: 2,8T total; MoE 896/16 aktiv; Kontext 1.048.576 Token.
  • Architektur-Effizienz: KDA −75 % KV-Cache, 6,3× Decoding bei 1M; AttnRes +25 % Trainingseffizienz; 2,5× Scaling vs. K2.
  • Intelligence Index v4.1: 57,1 (Rang 4 von Frontier-Modellen).
  • API: $3/$15 pro M; Cache-Hit $0,30; >90 % Hit-Rate in Coding-Workflows.
  • Commercial: ARR >$300M; Valuation $31,5B; Open Weights 27. Juli 2026.

Verifizierbare Quellen — nach Release erneut prüfen:

Moonshot AI: Kimi K3 Official Blog

Kimi API Platform Documentation

Artificial Analysis: Intelligence Index v4.1

OpenRouter: moonshotai/kimi-k3 Pricing

Für Teams, die Kimi K3 in Cursor, Kimi Code oder eigene Agent-Pipelines integrieren, bleiben drei Infrastruktur-Engpässe: ① Self-Host vor 27. Juli unmöglich — API-Abhängigkeit; ② macOS-CI auf VMs mit Metal/Core-ML-Overhead und instabiler Tool-Chain; ③ lokale Macs ohne 7×24-Uptime für Langhorizont-Agenten. Cloud-VMs verschärfen Latenz und Kompatibilität; reine API-Nutzung ohne dedizierte Build-Umgebung erschwert reproduzierbare Agent-Tests. Für null Hypervisor-Overhead, stabile iOS/macOS-CI und AI-Agent-Automatisierung sind MACNOX-Cloud-Physik-Macs meist die bessere Wahl: 100 % Apple-Hardware, voller Root, flexible Tages-/Wochen-/Monatsmiete. Siehe Mac Mini M4 Miete vs. Kauf und AI-Agent-Produktions-Härtung.

SECTION 09 FAQ

Ist Kimi K3 kostenlos nutzbar?

Ja auf kimi.com mit Free-Account. API erfordert Pay-per-Token ($3/$15 pro 1M).

Kann ich Kimi K3 lokal ausführen?

Erst ab 27. Juli 2026 mit Open Weights. Produktions-Inferenz braucht 64+ Beschleuniger (z. B. H100) — kein Laptop-Modell.

Kimi K3 vs. DeepSeek V4 Pro?

K3: doppelte Parameter, 1M vs. 128K Kontext, stärkere Coding-Benchmarks — aber Output $15/M vs. $3,48/M bei DeepSeek.

Ist 1M Token Kontext praktisch nutzbar?

Ja für ganze Codebases, lange Forschungs-/Rechtsdokumente und Multi-Session-Agenten — Flat Pricing ohne Längenaufschlag.

Wann kommen low/high Reasoning-Modi?

Moonshot kündigt „subsequent updates“ an — derzeit nur max Effort verfügbar.