Accueil / Blog / K3 Open Weights
ENGINEERING_BLOG · 2026.07.22

Kimi K3 Open Weights :
publication le 27 juillet 2026 – benchmarks, tarifs et déploiement local

Moonshot AI a activé l'API Kimi K3 le 16 juillet 2026 et promet les poids ouverts complets le 27 juillet 2026 sur Hugging Face — le premier modèle téléchargeable au-delà du seuil des 2 billions de paramètres. Pour les responsables MLOps, les ingénieurs IA et les équipes créatives qui préparent un déploiement on-premise, la fenêtre est étroite : l'API est disponible aujourd'hui, mais l'inférence locale exige 64+ accélérateurs et environ 1,4 To de poids. Ce guide professionnel couvre la chronologie 16/17/27 juillet, les specs 2,8T, le benchmark 57,1, les tarifs API, poids ouverts vs open source, la réalité hardware, l'impact industriel, une checklist en 7 étapes, FAQ et le lien vers le revue complète Kimi K3.

  • En bref : API depuis le 16 juillet ; annonce WAIC 17–20 juillet ; poids ouverts 27 juillet 2026.
  • Performance : Intelligence Index v4.1 = 57,1 (4e rang) ; SWE Marathon 42,0 (1er).
  • Self-host : ~1,4 To (MXFP4), inférence production = 64+ GPU.

SECTION 01 Poids ouverts vs open source : pourquoi la distinction compte en entreprise

Les termes « open source » et « open weights » sont souvent confondus — techniquement et juridiquement, ils divergent :

  • Open weights : téléchargement des poids du modèle ; code d'entraînement, jeux de données et reproductibilité complète absents. Kimi K3 relève de cette catégorie.
  • Open source (définition OSI) : code source, licence libre et reproductibilité — Kimi K3 ne remplit pas ces critères, même après le 27 juillet.
  • Décalage API-first : 11 jours entre le go-live API (16 juillet) et la publication des poids (27 juillet) imposent une dépendance cloud ou une réservation GPU anticipée.
  • Conformité RGPD : l'API route les prompts vers des serveurs chinois — documentation des flux et DPA requis. Le self-host post-27 juillet permet une résidence des données en UE sous contrôle propre.
  • Fine-tuning : sans poids, seul l'API reste disponible — verrou fournisseur. Voir le comparatif DeepSeek V4 GA pour d'autres pistes open weights.

Positionnement : le drop du 27 juillet sera le plus grand téléchargement de poids jamais publié (2,8T, MoE 896 experts) — pas un projet open source reproductible, mais une nouvelle baseline de fine-tuning pour la communauté.

SECTION 02 Chronologie 16/17/27 juillet et specs du modèle 2,8T

Chronologie de publication Kimi K3
Date Jalon Impact équipes
16 juillet 2026 Go-live API silencieux (kimi-k3) Test immédiat via kimi.com, platform.kimi.ai, OpenRouter
17–20 juillet 2026 WAIC Shanghai — présentation officielle Benchmarks, architecture, métriques commerciales confirmées
27 juillet 2026 Poids ouverts complets sur Hugging Face Téléchargement, self-host, fine-tuning ; support vLLM/SGLang Day-0 attendu
Données clés Kimi K3 — juillet 2026
Paramètre Valeur
Paramètres totaux 2,8 billions (2,8T)
Architecture KDA + AttnRes + Stable LatentMoE
Config MoE 896 experts, 16 actifs par token (1,8 % sparsity)
Fenêtre de contexte 1 048 576 tokens (1M)
Vision Multimodal natif (texte, image, vidéo)
Quantification Poids MXFP4, activations MXFP8
Taille téléchargement ~1,4 To (variante MXFP4)
Minimum self-host 64+ accélérateurs (super-nœud)

Comparé au marché : K3 dépasse DeepSeek V4 Pro (~75 %) et le modèle ouvert de Xiaomi (2,7×). Moonshot a détenu le titre du plus grand modèle open source 9 mois sur 12 — K3 le renouvelle dès le 27 juillet.

SECTION 03 Benchmark 57,1 et signification industrielle du drop de poids

Avant de réserver un cluster GPU, voici l'évaluation de performance — chiffres auto-déclarés Moonshot (17 juillet 2026) :

Kimi K3 — benchmarks sélectionnés vs frontier
Benchmark Kimi K3 Claude Fable 5 GPT-5.6 Sol
Intelligence Index v4.1 57,1 (4e rang) 59,9 58,9
SWE Marathon 42,0 35,0 39,0
OmniDocBench 91,1 89,8 85,8
Program Bench 77,8 76,8 77,6
Terminal Bench 2.1 88,3 84,6 88,8

Impact industriel du 27 juillet :

  • Premier download >2T : seuil jusqu'ici réservé aux modèles API fermés.
  • Nouvelle baseline fine-tuning : les équipes enterprise peuvent entraîner des adaptateurs domaine sans dépendance API — pertinent pour les secteurs régulés.
  • Inférence MoE comme discipline infra : 896 experts exigent des stacks de routing spécialisés (vLLM, SGLang) — loin du plug-and-play des modèles 7B.
  • Pression concurrentielle : Moonshot ARR >300 M$, valorisation 31,5 Md$, API >70 % du revenu — signal stratégique envers DeepSeek et les labs frontier. Architecture détaillée dans la revue Kimi K3.

SECTION 04 Tarifs API aujourd'hui vs coût self-host après le 27 juillet

Comparaison tarifaire API par 1M tokens
Modèle Input Output Cache input Contexte
Kimi K3 (API) 3,00 $ 15,00 $ 0,30 $ 1M
Claude Sonnet 5 3,00 $ 15,00 $ 200K
DeepSeek V4 Pro 1,74 $ 3,48 $ 0,145 $ 128K
Kimi K3 (self-host dès 27.7.) CapEx + OpEx cluster GPU 1M (local)
Matrice de décision : API vs self-host vs hybride
Scénario Recommandation Raison
PoC rapide avant le 27 juillet API Kimi K3 Disponible immédiatement, 3/15 $, cache 0,30 $/M
Résidence des données UE (RGPD) Self-host dès 27.7. Aucun prompt vers serveurs tiers
Optimisation coût, sans contrainte compliance API DeepSeek V4 Pro Output 3,48 $/M — bien en dessous de K3
Fine-tuning domaine Kimi K3 open weights Plus grands poids ouverts disponibles, 2,8T
Inférence edge / laptop Ni API ni self-host K3 64+ GPU requis — pas un modèle edge

Taux de cache >90 % dans les workflows Kimi Code — input effectif ~0,55 $/M. Jusqu'au 27 juillet, l'API reste pragmatique ; ensuite, comparer TCO cluster GPU vs facturation tokens.

SECTION 05 Réalité du déploiement local : 1,4 To et 64+ GPU

Le drop du 27 juillet n'est pas un release grand public. L'inférence production exige :

  • ~1,4 To de téléchargement : poids MXFP4 sur Hugging Face — planifier stockage et bande passante avant la date.
  • 64+ accélérateurs : super-nœud minimum (NVIDIA H100/H200) pour débit complet sur MoE 2,8T.
  • Adaptateurs framework : vLLM, SGLang, transformers avec support MXFP4/NVFP4 — Day-0 attendu, hardening production = semaines.
  • KV cache à 1M tokens : KDA réduit la mémoire de 75 %, reste datacenter-scale.
  • Workflow créatif Apple : pour les pipelines Xcode, Metal et Core ML, le cluster GPU ne remplace pas un Mac physique natif — complémentarité infra, pas substitution.

SECTION 06 Checklist en 7 étapes : préparer la publication du 27 juillet

  1. Mesurer la baseline API (maintenant) : tester Kimi K3 via kimi-k3 sur platform.kimi.ai ; latence, qualité, coût — voir le guide architecture et setup.
  2. Réserver la capacité GPU : 64+ accélérateurs pour PoC — demander tôt aux cloud providers ou on-premise.
  3. Planifier le stockage : ~1,4 To poids MXFP4 plus marge checkpoints ; bande passante premier download.
  4. Préparer la stack framework : suivre les branches vLLM/SGLang avec support Kimi K3 ; valider sur MoE plus petits.
  5. Documenter la conformité : DPA, registre des traitements, schéma des flux — route self-host vs API ; mise à jour RGPD Art. 32.
  6. Esquisser le pipeline fine-tuning : jeux de données domaine, LoRA vs full fine-tune, harness d'évaluation avant download.
  7. Définir le fallback hybride : API pour burst, self-host pour workloads sensibles — plafonds de coût et failover.
kimi_k3_api_baseline.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Test baseline avant self-host..."}]
)
print(response.usage)

SECTION 07 Données citables, sources et conclusion

  • Chronologie : API 16 juillet → WAIC 17–20 juillet → poids ouverts 27 juillet 2026.
  • Paramètres : 2,8T total ; MoE 896/16 ; contexte 1 048 576 tokens ; download ~1,4 To (MXFP4).
  • Intelligence Index v4.1 : 57,1 (4e rang) ; SWE Marathon 42,0 (1er).
  • API : 3/15 $ par M ; cache 0,30 $/M ; ID modèle kimi-k3.
  • Self-host : minimum 64+ accélérateurs ; support vLLM/SGLang Day-0 attendu.
  • Commercial : ARR >300 M$ ; valorisation 31,5 Md$ (juin 2026).

Sources vérifiables — à reconsulter après le 27 juillet :

Moonshot AI — blog officiel Kimi K3

Kimi API Platform — documentation

Artificial Analysis — classement Intelligence Index v4.1

VentureBeat — couverture Kimi K3 open source

South China Morning Post — rapport Kimi K3 Moonshot AI

Les équipes qui intègrent Kimi K3 dans des pipelines Agent avec CI macOS, builds Xcode et automatisation 7×24 font face à trois goulets avant le drop : ① dépendance API sans résidence UE ; ② CI macOS sur VM avec surcharge Metal et toolchain instable ; ③ Mac local sans uptime permanent pour agents longue durée. Les VM cloud aggravent la latence ; un cluster GPU seul ne couvre pas la stack Apple native. Pour zéro surcharge hyperviseur, CI iOS/macOS stable et automatisation Agent IA, les nœuds Mac physiques cloud MACNOX complètent généralement mieux la stack K3 : hardware Apple 100 %, root complet, facturation jour/semaine/mois. Voir location vs achat Mac Mini M4, analyse coût Agent Grok 4.5 et la page tarifs.

SECTION 08 FAQ

Les poids ouverts Kimi K3 sont-ils open source ?

Non. Open weights = poids téléchargeables sans code d'entraînement ni jeux de données complets. Kimi K3 n'est pas open source OSI, même après le 27 juillet.

Quand exactement les poids seront-ils disponibles ?

Moonshot confirme le 27 juillet 2026 sur Hugging Face. API active depuis le 16 juillet ; annonce WAIC le 17 juillet.

Puis-je exécuter K3 sur un MacBook ?

Non. ~1,4 To et 64+ GPU pour inférence production — pas un workload laptop. Pour CI Apple, utilisez des Mac physiques dédiés.

Le self-host est-il conforme RGPD ?

Self-host en datacenter UE sous contrôle propre satisfait la résidence des données, sans transfert vers tiers pays. L'API exige DPA et documentation des flux vers serveurs chinois.

L'API vaut-elle le coup avant le 27 juillet ?

Oui pour PoC et baseline. 3/15 $ avec cache 0,30 $/M et contexte 1M — puis comparer TCO cluster GPU.

Où trouver les détails architecture KDA et MoE ?

Dans la revue complète Kimi K3 — KDA, AttnRes, Stable LatentMoE et matrice benchmarks intégrale.