Accueil / Blog / Kimi K3
ENGINEERING_BLOG · 2026.07.17

Kimi K3 : le modèle open source
de 2,8 billions de paramètres qui défie Claude et GPT

La nuit du 16 juillet 2026, Moonshot AI (月之暗面) a activé discrètement Kimi K3 — sans keynote, mais avec 2,8 billions de paramètres, le plus grand LLM open source jamais publié. Pour les équipes créatives et techniques qui évaluent des modèles pour agents de code, analyse documentaire ou workflows Apple (Xcode, CI macOS), trois questions dominent : tient-il la comparaison avec Claude Fable 5 et GPT-5.6 Sol ? Quel est le coût API ? Quand arrivent les poids ouverts ? Cet article couvre contexte stratégique, architecture KDA/AttnRes/MoE, matrice de benchmarks complète, tarification, 4 modes d'accès, guide en 6 étapes, matrice de scénarios, open source le 27 juillet, données citables et FAQ.

SECTION 01 Pourquoi Kimi K3 compte : limites de contexte, coûts et dépendance aux API fermées

K3 répond à des freins récurrents dans les stacks LLM de production :

  • Plafond de contexte : La plupart des modèles flagship plafonnent à 128K–400K tokens — les monorepos et dossiers créatifs lourds imposent du chunking coûteux.
  • Coding longue durée : SWE Marathon mesure des sessions de code sur plusieurs heures ; beaucoup de modèles s'effondrent dans les boucles d'outils.
  • Verrouillage éditeur : Sans poids ouverts, pas de fine-tuning ni d'audit complet — critique pour les studios et équipes produit exigeantes.
  • Pression budgétaire : Claude Opus 4.8 facture $5/$25 par million de tokens — voir notre analyse tarifaire Grok 4.5 pour le contexte compétitif.

Fiche technique : MoE 896 experts, 16 actifs ; fenêtre 1 048 576 tokens ; vision native (texte, image, vidéo) ; ID modèle kimi-k3 ; reasoning en max effort uniquement ; poids complets le 27 juillet 2026 sur Hugging Face.

Comparaison de taille — modèles open source
Modèle Paramètres Contexte
Kimi K3 2,8T 1M
DeepSeek V4 Pro 1,6T 128K
Modèle open Xiaomi 1,02T
Alibaba Qwen (open) 397B

SECTION 02 Contexte stratégique : WAIC, ARR 300 M$ et retour de Moonshot

  • Record de taille : Kimi a détenu le titre de plus grand modèle open source 9 mois sur 12 ; K3 dépasse DeepSeek V4 Pro d'environ 75 %.
  • Timing WAIC 2026 : Lancement la veille de la World AI Conference à Shanghai — signal fort pour l'écosystème chinois et international.
  • Traction commerciale : ARR >300 M$ (juin 2026) ; 6e tour à 31,5 Md$ pre-money ; API >70 % du revenu ; utilisateurs payants internationaux +400 %.
  • Créateurs Apple : Pour valider des agents Kimi K3 dans des pipelines Xcode/macOS, l'environnement natif Apple reste la référence — les VM dégradent Metal et Core ML.

SECTION 03 Architecture : KDA, AttnRes et Stable LatentMoE expliqués

K3 n'est pas un simple empilement de paramètres — trois innovations ciblent des problèmes d'ingénierie à l'échelle :

Kimi Delta Attention (KDA) : Attention hybride linéaire en ratio 3:1 (trois couches linéaires, une full attention). Résultat : cache KV −75 %, décodage à 1M tokens jusqu'à 6,3× plus rapide, sans sacrifice mesurable sur contexte court, long ou RL.

Attention Residuals (AttnRes) : Récupération sélective à travers la profondeur — environ +25 % d'efficacité d'entraînement pour <2 % de compute supplémentaire.

Stable LatentMoE : 896 experts, 16 actifs (sparsité 1,8 %). Stabilisateurs :

Techniques MoE dans Kimi K3
Technique Rôle
Quantile Balancing Allocation d'experts depuis les quantiles du routeur
Per-Head Muon Optimisation par tête d'attention à grande échelle
SiTU (Sigmoid Tanh Unit) Contrôle d'activation amélioré
Gated MLA Sélectivité attention accrue
Global vs Kimi K2 ~2,5× meilleure efficacité de scaling

SECTION 04 Benchmarks : coding, raisonnement et vision

Données auto-publiées par Moonshot (16 juillet 2026). Harness distincts : Kimi Code pour K3, Codex pour GPT, Claude Code pour Claude — reproductions tierces en cours.

Benchmarks coding — Kimi K3 vs modèles frontier
Benchmark Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8
DeepSWE 67,5 70,0 73,0 59,0
Program Bench 77,8 76,8 77,6 71,9
Terminal Bench 2.1 88,3 84,6 88,8 84,6
FrontierSWE 81,2 86,6 71,3 66,7
SWE Marathon 42,0 35,0 39,0 40,0
BrowseComp 91,2 88,0 90,4 84,3
Automation Bench 30,8 29,1 29,7 27,2
GPQA-Diamond 93,5 92,6 94,1 91,0
MMMU-Pro (vision) 81,6 81,2 83,0 78,9
OmniDocBench 91,1 89,8 85,8 87,9

SWE Marathon mesure le coding longue durée — K3 mène à 42,0. Artificial Analysis Intelligence Index v4.1 : K3 = 57,1 (4e), Fable 5 = 59,9, GPT-5.6 Sol = 58,9 — écart de 2,8 points seulement.

SECTION 05 Tarification API : 3/15 $, cache et prix Chine

Comparaison tarifaire par million de tokens
Modèle Input Output Cache input Contexte
Kimi K3 3,00 $ 15,00 $ 0,30 $ 1M
Claude Sonnet 5 3,00 $ 15,00 $ 200K
Claude Opus 4.8 5,00 $ 25,00 $ 200K
GPT-5.5 5,00 $ 30,00 $ 400K
DeepSeek V4 Pro 1,74 $ 3,48 $ 0,145 $ 128K
Kimi K2.6 0,95 $ 4,00 $ 0,16 $ 256K

K3 aligne Sonnet au tarif standard mais offre 5× le contexte. Moonshot annonce >90 % de cache hit en workflows Kimi Code (architecture Mooncake) — coût input effectif ~0,55 $/M. Chine : ¥20/¥100 par M, cache ¥2/M ; offre consumer dès ¥199 (jusqu'au 11 août).

SECTION 06 Six étapes pour utiliser Kimi K3 (4 modes d'accès)

Quatre accès : (1) Web/App kimi.com — gratuit avec Google ; (2) API Moonshot compatible OpenAI ; (3) OpenRouter moonshotai/kimi-k3 ; (4) Self-host après le 27 juillet — 64+ accélérateurs requis.

  1. Créer un compte : kimi.com — K3 en effort max par défaut.
  2. Obtenir une clé API : Inscription sur platform.kimi.ai, activer la facturation.
  3. Configurer le client : SDK OpenAI avec base_url=https://api.moonshot.ai/v1 et modèle kimi-k3.
  4. Test de fumée : Prompt coding court ; comparer latence et qualité à Claude/GPT.
  5. Via OpenRouter : ID moonshotai/kimi-k3, tarifs officiels sans markup.
  6. Pipeline production : Structurer les prompts pour maximiser le cache ; documenter les flux de données ; tester l'intégration agent sur macOS natif plutôt qu'en VM pour préserver Metal/Core ML.
kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Analyse cette codebase..."}]
)
print(response.choices[0].message.content)

SECTION 07 Matrice de scénarios et open weights le 27 juillet 2026

Quel modèle selon le cas d'usage
Scénario Choix Pourquoi
Coding longue durée (SWE Marathon) Kimi K3 1er au benchmark, contexte 1M
Correctifs repo complexes Claude Fable 5 FrontierSWE 86,6
Agents terminal/outils GPT-5.6 Sol Terminal Bench 88,8
Documents multimodaux Kimi K3 OmniDocBench 91,1
Budget serré DeepSeek V4 Pro Output 3,48 $/M
Self-host open weights Kimi K3 (dès 27/7) Poids ouverts les plus capables

Le 27 juillet 2026, Moonshot publie les poids complets sur Hugging Face — premier modèle open >2T, entraîné en MXFP4/MXFP8. Support Day-0 attendu dans vLLM, SGLang et transformers. Jalons : 17–20 juillet WAIC → 27 juillet open weights.

SECTION 08 Données citables, sources et conclusion technique

  • Paramètres : 2,8T total ; MoE 896/16 actifs ; contexte 1 048 576 tokens.
  • Efficacité architecture : KDA −75 % cache KV, 6,3× décodage à 1M ; AttnRes +25 % ; 2,5× scaling vs K2.
  • Intelligence Index v4.1 : 57,1 (4e rang).
  • API : 3/15 $ par M ; cache 0,30 $ ; >90 % hit rate en coding.
  • Commercial : ARR >300 M$ ; valorisation 31,5 Md$ ; open weights 27 juillet 2026.

Sources vérifiables — à rouvrir après publication :

Moonshot AI : Kimi K3 Official Blog

Kimi API Platform Documentation

Artificial Analysis : Intelligence Index v4.1

OpenRouter : moonshotai/kimi-k3 Pricing

Pour les équipes intégrant Kimi K3 dans Cursor, Kimi Code ou des pipelines Agent multi-appareils, trois limites persistent : ① pas de self-host avant le 27 juillet ; ② CI macOS en VM avec surcoût Metal/Core ML et workflows créatifs ralentis ; ③ Mac local sans disponibilité 7×24. Les VM cloud ajoutent latence et incompatibilités ; l'API seule sans environnement de build natif complique les tests reproductibles. Pour une puissance Apple native sans perte, une CI/CD iOS stable et une automatisation Agent IA, les nœuds physiques cloud MACNOX restent souvent le meilleur choix : matériel Apple 100 %, Root complet, location flexible jour/semaine/mois. Voir location vs achat Mac Mini M4 et sécurisation des environnements Agent IA.

SECTION 09 FAQ

Kimi K3 est-il gratuit ?

Oui sur kimi.com avec compte gratuit. L'API est payante au token (3/15 $ par million).

Puis-je exécuter Kimi K3 en local ?

À partir du 27 juillet 2026 avec les poids ouverts. L'inférence production requiert 64+ accélérateurs (ex. H100) — pas un modèle pour laptop.

Kimi K3 vs DeepSeek V4 Pro ?

K3 : double paramètres, 1M vs 128K contexte, benchmarks coding supérieurs — mais output 15 $/M vs 3,48 $/M pour DeepSeek.

Le contexte 1M est-il utile en pratique ?

Oui pour codebases entières, documents juridiques/recherche et agents multi-sessions — tarif flat sans surcharge de longueur.

Quand arrivent les modes low/high reasoning ?

Moonshot annonce des mises à jour ultérieures — seul max effort est disponible aujourd'hui.