Accueil / Blog / Kimi K3
ENGINEERING_BLOG · 2026.07.28

Kimi K3 en open weight :
2,8 billions de paramètres publiés en intégralité

Le 27 juillet 2026, vers 23 h, Moonshot AI a publié l'intégralité des poids et le rapport technique de Kimi K3, tout en open-sourçant les trois briques d'infrastructure qui ont alimenté son entraînement : MoonEP, FlashKDA et AgentEnv. Avec 2,8 billions de paramètres totaux, ~104 milliards activés, un contexte d'un million de tokens et une compréhension visuelle native, K3 devient le plus grand modèle open weight jamais livré en version complète — ~1,56 To sur Hugging Face, #1 des tendances en moins de trente minutes. Ce décryptage s'adresse aux développeurs et équipes techniques qui évaluent l'intégration ou l'auto-hébergement de K3 : innovations d'architecture, benchmarks indépendants, seuils de licence et chemins réalistes API vs. matériel.

SECTION 01 Pièges de sélection Kimi K3 : confusion open source, licence et barrières d'auto-hébergement

Après la publication des poids le 27 juillet, les erreurs les plus fréquentes dans la communauté sont :

  • Confondre « open weight » et « open source » : Moonshot n'emploie jamais « open source » dans ses documents officiels — seulement « open weight ». Données d'entraînement et code complet non publics ; ne répond pas aux critères OSI ;
  • Supposer que la licence Modified MIT de l'ère K2 s'applique encore : K3 repose sur une licence entièrement custom avec seuils MaaS et attribution — différente de l'article de preview du 22 juillet ;
  • Sous-estimer le coût d'auto-hébergement : 896 experts routés et 1,56 To rendent le matériel grand public impraticable. Moonshot recommande des super-nœuds avec 64+ accélérateurs ;
  • Se fier uniquement aux benchmarks éditeur : les frameworks d'évaluation varient énormément. Prioriser les retests indépendants de Vals AI et Artificial Analysis ;
  • Ignorer le contexte géopolitique : la publication coïncide avec l'escalade du différend US-Chine sur la « distillation de modèles ». Voir notre dossier distillation Kimi K3.

Seulement 11 jours entre le lancement API de K3 sur kimi.com et la publication intégrale des poids le 27 juillet — un signal clair : la course open weight entre dans le « club 3T ».

SECTION 02 Timeline de sortie Kimi K3 et spécifications clés

  • 16 juillet (veille du WAIC 2026) : lancement sur kimi.com, Kimi Work, Kimi Code et API — poids non publics ;
  • 17 juillet : analyse sectorielle de l'architecture. Xinhua le qualifie de plus grand modèle open par nombre de paramètres ;
  • 22–23 juillet : escalade du différend « distillation de modèles » US-Chine. La Maison Blanche accuse Moonshot de distillation industrielle contre le modèle Fable d'Anthropic ;
  • 27 juillet (~23 h) : poids complets, rapport technique, MoonEP et AgentEnv (FlashKDA déjà ouvert) ;
  • 28 juillet : le ministère chinois du Commerce répond aux accusations d'« hégémonie IA » américaine. Alibaba dévoile Qwen3.8-Max-Preview à 24 billions de paramètres — réponse directe à K3.
Spécifications clés Kimi K3
Spécification Valeur
Paramètres totaux 2,8 billions (2,8T)
Paramètres actifs ~104 milliards
Architecture MoE — 896 experts routés, 16 activés par token
Attention Kimi Delta Attention (KDA) + Gated MLA
Fenêtre de contexte 1 000 000 tokens
Multimodalité Vision native (ViT-V2, 27 couches)
Format des poids Poids MXFP4, activations MXFP8 (quantization-aware dès SFT)
Taille du téléchargement ~1,56 To (Hugging Face)
Licence Licence custom — Moonshot parle d'« open weight », pas d'« open source »

SECTION 03 KDA, Attention Residuals, Per-Head Muon : trois innovations architecturales

Kimi K3 ne se contente pas d'empiler des paramètres — Moonshot a reconstruit trois composants fondamentaux du deep learning : l'attention, les connexions résiduelles et l'optimiseur.

Kimi Delta Attention (KDA) : Gated DeltaNet applique une porte d'oubli scalaire. KDA la remplace par un gating canal par canal — chaque dimension de feature possède son propre taux de décroissance. Implémenté en formulation chunkwise DPLR, KDA alterne avec quelques couches Gated MLA globales pour supporter 1M tokens tout en maintenant un KV cache compact.

Attention Residuals (AttnRes) : les résidus standard accumulent uniformément. AttnRes agrège sélectivement et de façon input-dépendante sur toutes les couches précédentes — un RMSNorm et un pseudo-query par couche, ~25 % d'efficacité d'entraînement en plus pour moins de 2 % de coût.

Per-Head Muon : l'optimiseur Muon opère par tête d'attention plutôt qu'uniformément sur le modèle. Combiné à Stable LatentMoE (896 experts, 16 activés — ~1,8 % de sparsité) et Quantile Balancing, Moonshot démontre une borne supérieure théorique d'experts redondants par rang de calcul.

SECTION 04 MoonEP, FlashKDA, AgentEnv et comparaison des benchmarks

Trois releases d'infrastructure ouvertes
Technologie Rôle Capacité clé
MoonEP Communication MoE fine à grande échelle Duplique temporairement les experts surchargés ; tokens égaux par rang ; borne supérieure d'experts redondants
FlashKDA Kernel KDA basé sur CUTLASS Prefill 1,72×–2,22× plus rapide sur NVIDIA H20 vs. baseline flash-linear-attention ; drop-in via chunk_kda
AgentEnv Sandbox Agent (co-développé avec KVCache.ai) microVM Firecracker ; checkpoint dès 133 ms, reprise 49 ms, overcommit mémoire jusqu'à 6,5×

SWE-bench Verified (évaluation indépendante, Vals AI, juillet 2026) :

Retest indépendant SWE-bench Verified
Modèle Score Date de sortie
Claude Opus 5 97 % 2026-07-24
GPT-5.6 Sol 96,2 % 2026-07-09
Claude Fable 5 95 % 2026-06-09
Kimi K3 93,4 % 2026-07-16
Qwen3.7-Max 79,4 % 2026-05-19

Sur l'Artificial Analysis Intelligence Index (tier max reasoning), Kimi K3 affiche ~57 — 3e mondial, 1er open weight, derrière Claude Fable 5 (60) et GPT-5.6 Sol (59). À ~0,95 $ par tâche, ~60 % moins cher que Claude Fable 5 (~2,40 $) mais plus coûteux que GLM-5.2 (~0,47 $). Plafond de capacité de la ligue open weight, pas le choix prix-performance. K3 mène actuellement le Frontend Code Arena d'Arena.ai.

SECTION 05 Licence Kimi K3, tarifs API et checklist d'intégration en 6 étapes

La licence custom ajoute deux seuils commerciaux absents de la famille K2 :

  • Seuil de revenus Model-as-a-Service : si vous exploitez un MaaS sur K3 dépassant 20 millions de dollars de revenus agrégés sur 12 mois glissants, accord commercial séparé avec Moonshot AI requis ;
  • Seuil d'attribution : si votre produit dépasse 100 millions d'utilisateurs actifs mensuels ou 20 millions de dollars de revenus mensuels, affichage prominent de « Kimi K3 » dans l'interface.
Tarifs API Kimi K3 (par million de tokens)
Type de token Prix
Input (cache hit) 0,30 $
Input (cache miss) 3,00 $
Output (trace de raisonnement incluse) 15,00 $

L'architecture Mooncake disaggregated de Moonshot atteint plus de 90 % de cache hit sur les workloads de code typiques — usage réel proche du palier 0,30 $. L'auto-hébergement exige 64+ accélérateurs ; pour la plupart des équipes, l'API officielle ou OpenRouter reste la voie pragmatique.

  1. Confirmer la conformité licence : lire la licence K3 intégrale ; évaluer seuils MaaS et attribution pour votre activité ;
  2. Choisir le chemin d'intégration : API (compatible OpenAI SDK, https://api.moonshot.ai/v1, modèle kimi-k3) ou hébergement tiers via OpenRouter ;
  3. Configurer les credentials API : créer une clé dans la console Moonshot ; remplacer base URL et API key dans le projet ;
  4. Tester le taux de cache hit : petit load test sur workloads agent de code ; mesurer l'impact Mooncake sur le coût réel ;
  5. Évaluer la faisabilité d'auto-hébergement : si inférence locale requise, confirmer cluster GPU (64+ recommandés) et stockage 1,56 To ;
  6. Évaluer la toolchain infra : pour entraînement MoE ou accélération KDA, examiner MoonEP, FlashKDA (drop-in chunk_kda) et sandbox AgentEnv.
kimi-k3-api-test.py
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_MOONSHOT_API_KEY",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Explain Kimi Delta Attention in 3 sentences."}]
)
print(response.choices[0].message.content)

SECTION 06 Données techniques citables et conclusion de sélection

  • 2,8T total / ~104B actifs : plus grande release open weight complète, ~1,56 To sur Hugging Face ;
  • SWE-bench Verified 93,4 % : retest Vals AI — #1 open weight, 3,6 points derrière Claude Opus 5 (97 %) ;
  • Artificial Analysis Intelligence Index ~57 : 3e mondial, #1 open weight, ~0,95 $ par tâche ;
  • FlashKDA prefill 1,72×–2,22× plus rapide : sur NVIDIA H20 vs. baseline flash-linear-attention ;
  • AgentEnv checkpoint 133 ms / reprise 49 ms : chiffres Moonshot, pas encore reproduits indépendamment.

Sources officielles et tierces — vérifier les pages à jour avant mise en production :

Blog officiel Moonshot AI : rapport technique Kimi K3

Hugging Face : organisation moonshotai (téléchargement poids K3)

GitHub : moonshotai/FlashKDA

Si votre équipe construit des pipelines Agent sur K3, les Mac virtualisés introduisent overhead et risques de compatibilité pour les builds Xcode, l'accélération Metal et la CI iOS — particulièrement sensibles dans les workflows créatifs Apple. Pour une puissance native sans perte, une CI iOS/macOS stable et une automatisation Agent 24/7, les nœuds physiques cloud MACNOX constituent généralement la meilleure option : hardware Apple 100 %, Root complet, zéro taxe hyperviseur, facturation flexible jour/semaine/mois. Pour plus de contexte : analyse approfondie Kimi K3 et classements OpenRouter de juillet.

SECTION 07 FAQ

Kimi K3 est-il open source ?

Non, au sens strict OSI. C'est un modèle open weight : poids entraînés, rapport technique et outils infra partiellement publics, mais données d'entraînement et code complet non publiés. Moonshot utilise lui-même uniquement « open weight ».

Puis-je utiliser Kimi K3 commercialement gratuitement ?

Oui, pour la grande majorité des cas. Restrictions si MaaS dépassant 20 M$ de revenus sur 12 mois, ou produit au-delà de 100 M MAU ou 20 M$ de revenus mensuels.

Quel matériel faut-il pour auto-héberger Kimi K3 ?

Moonshot recommande des super-nœuds avec 64 accélérateurs ou plus. La plupart des développeurs devraient utiliser l'API officielle ou un hébergeur comme OpenRouter.

Comment Kimi K3 se compare-t-il à GPT-5.6 et Claude ?

Derrière Claude Opus 5, GPT-5.6 Sol et Claude Fable 5 sur SWE-bench Verified (93,4 % vs. 95–97 %) et Intelligence Index (3e), mais modèle open weight le plus performant, devant GLM-5.2 et DeepSeek V4 Pro.

Quelle différence entre Kimi K3 et Kimi K2 ?

K3 a ~3× les paramètres de K2.5, ajoute Attention Residuals et Per-Head Muon, étend fortement contexte et multimodalité. La licence inclut un seuil MaaS absent de K2.