Moonshot AI a activé l'API Kimi K3 le 16 juillet 2026 et promet les poids ouverts complets le 27 juillet 2026 sur Hugging Face — le premier modèle téléchargeable au-delà du seuil des 2 billions de paramètres. Pour les responsables MLOps, les ingénieurs IA et les équipes créatives qui préparent un déploiement on-premise, la fenêtre est étroite : l'API est disponible aujourd'hui, mais l'inférence locale exige 64+ accélérateurs et environ 1,4 To de poids. Ce guide professionnel couvre la chronologie 16/17/27 juillet, les specs 2,8T, le benchmark 57,1, les tarifs API, poids ouverts vs open source, la réalité hardware, l'impact industriel, une checklist en 7 étapes, FAQ et le lien vers le revue complète Kimi K3.
- En bref : API depuis le 16 juillet ; annonce WAIC 17–20 juillet ; poids ouverts 27 juillet 2026.
- Performance : Intelligence Index v4.1 = 57,1 (4e rang) ; SWE Marathon 42,0 (1er).
- Self-host : ~1,4 To (MXFP4), inférence production = 64+ GPU.
SECTION 01 Poids ouverts vs open source : pourquoi la distinction compte en entreprise
Les termes « open source » et « open weights » sont souvent confondus — techniquement et juridiquement, ils divergent :
- Open weights : téléchargement des poids du modèle ; code d'entraînement, jeux de données et reproductibilité complète absents. Kimi K3 relève de cette catégorie.
- Open source (définition OSI) : code source, licence libre et reproductibilité — Kimi K3 ne remplit pas ces critères, même après le 27 juillet.
- Décalage API-first : 11 jours entre le go-live API (16 juillet) et la publication des poids (27 juillet) imposent une dépendance cloud ou une réservation GPU anticipée.
- Conformité RGPD : l'API route les prompts vers des serveurs chinois — documentation des flux et DPA requis. Le self-host post-27 juillet permet une résidence des données en UE sous contrôle propre.
- Fine-tuning : sans poids, seul l'API reste disponible — verrou fournisseur. Voir le comparatif DeepSeek V4 GA pour d'autres pistes open weights.
Positionnement : le drop du 27 juillet sera le plus grand téléchargement de poids jamais publié (2,8T, MoE 896 experts) — pas un projet open source reproductible, mais une nouvelle baseline de fine-tuning pour la communauté.
SECTION 02 Chronologie 16/17/27 juillet et specs du modèle 2,8T
| Date | Jalon | Impact équipes |
|---|---|---|
| 16 juillet 2026 | Go-live API silencieux (kimi-k3) |
Test immédiat via kimi.com, platform.kimi.ai, OpenRouter |
| 17–20 juillet 2026 | WAIC Shanghai — présentation officielle | Benchmarks, architecture, métriques commerciales confirmées |
| 27 juillet 2026 | Poids ouverts complets sur Hugging Face | Téléchargement, self-host, fine-tuning ; support vLLM/SGLang Day-0 attendu |
| Paramètre | Valeur |
|---|---|
| Paramètres totaux | 2,8 billions (2,8T) |
| Architecture | KDA + AttnRes + Stable LatentMoE |
| Config MoE | 896 experts, 16 actifs par token (1,8 % sparsity) |
| Fenêtre de contexte | 1 048 576 tokens (1M) |
| Vision | Multimodal natif (texte, image, vidéo) |
| Quantification | Poids MXFP4, activations MXFP8 |
| Taille téléchargement | ~1,4 To (variante MXFP4) |
| Minimum self-host | 64+ accélérateurs (super-nœud) |
Comparé au marché : K3 dépasse DeepSeek V4 Pro (~75 %) et le modèle ouvert de Xiaomi (2,7×). Moonshot a détenu le titre du plus grand modèle open source 9 mois sur 12 — K3 le renouvelle dès le 27 juillet.
SECTION 03 Benchmark 57,1 et signification industrielle du drop de poids
Avant de réserver un cluster GPU, voici l'évaluation de performance — chiffres auto-déclarés Moonshot (17 juillet 2026) :
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| Intelligence Index v4.1 | 57,1 (4e rang) | 59,9 | 58,9 |
| SWE Marathon | 42,0 | 35,0 | 39,0 |
| OmniDocBench | 91,1 | 89,8 | 85,8 |
| Program Bench | 77,8 | 76,8 | 77,6 |
| Terminal Bench 2.1 | 88,3 | 84,6 | 88,8 |
Impact industriel du 27 juillet :
- Premier download >2T : seuil jusqu'ici réservé aux modèles API fermés.
- Nouvelle baseline fine-tuning : les équipes enterprise peuvent entraîner des adaptateurs domaine sans dépendance API — pertinent pour les secteurs régulés.
- Inférence MoE comme discipline infra : 896 experts exigent des stacks de routing spécialisés (vLLM, SGLang) — loin du plug-and-play des modèles 7B.
- Pression concurrentielle : Moonshot ARR >300 M$, valorisation 31,5 Md$, API >70 % du revenu — signal stratégique envers DeepSeek et les labs frontier. Architecture détaillée dans la revue Kimi K3.
SECTION 04 Tarifs API aujourd'hui vs coût self-host après le 27 juillet
| Modèle | Input | Output | Cache input | Contexte |
|---|---|---|---|---|
| Kimi K3 (API) | 3,00 $ | 15,00 $ | 0,30 $ | 1M |
| Claude Sonnet 5 | 3,00 $ | 15,00 $ | — | 200K |
| DeepSeek V4 Pro | 1,74 $ | 3,48 $ | 0,145 $ | 128K |
| Kimi K3 (self-host dès 27.7.) | CapEx + OpEx cluster GPU | — | — | 1M (local) |
| Scénario | Recommandation | Raison |
|---|---|---|
| PoC rapide avant le 27 juillet | API Kimi K3 | Disponible immédiatement, 3/15 $, cache 0,30 $/M |
| Résidence des données UE (RGPD) | Self-host dès 27.7. | Aucun prompt vers serveurs tiers |
| Optimisation coût, sans contrainte compliance | API DeepSeek V4 Pro | Output 3,48 $/M — bien en dessous de K3 |
| Fine-tuning domaine | Kimi K3 open weights | Plus grands poids ouverts disponibles, 2,8T |
| Inférence edge / laptop | Ni API ni self-host K3 | 64+ GPU requis — pas un modèle edge |
Taux de cache >90 % dans les workflows Kimi Code — input effectif ~0,55 $/M. Jusqu'au 27 juillet, l'API reste pragmatique ; ensuite, comparer TCO cluster GPU vs facturation tokens.
SECTION 05 Réalité du déploiement local : 1,4 To et 64+ GPU
Le drop du 27 juillet n'est pas un release grand public. L'inférence production exige :
- ~1,4 To de téléchargement : poids MXFP4 sur Hugging Face — planifier stockage et bande passante avant la date.
- 64+ accélérateurs : super-nœud minimum (NVIDIA H100/H200) pour débit complet sur MoE 2,8T.
- Adaptateurs framework : vLLM, SGLang, transformers avec support MXFP4/NVFP4 — Day-0 attendu, hardening production = semaines.
- KV cache à 1M tokens : KDA réduit la mémoire de 75 %, reste datacenter-scale.
- Workflow créatif Apple : pour les pipelines Xcode, Metal et Core ML, le cluster GPU ne remplace pas un Mac physique natif — complémentarité infra, pas substitution.
SECTION 06 Checklist en 7 étapes : préparer la publication du 27 juillet
- Mesurer la baseline API (maintenant) : tester Kimi K3 via
kimi-k3sur platform.kimi.ai ; latence, qualité, coût — voir le guide architecture et setup. - Réserver la capacité GPU : 64+ accélérateurs pour PoC — demander tôt aux cloud providers ou on-premise.
- Planifier le stockage : ~1,4 To poids MXFP4 plus marge checkpoints ; bande passante premier download.
- Préparer la stack framework : suivre les branches vLLM/SGLang avec support Kimi K3 ; valider sur MoE plus petits.
- Documenter la conformité : DPA, registre des traitements, schéma des flux — route self-host vs API ; mise à jour RGPD Art. 32.
- Esquisser le pipeline fine-tuning : jeux de données domaine, LoRA vs full fine-tune, harness d'évaluation avant download.
- Définir le fallback hybride : API pour burst, self-host pour workloads sensibles — plafonds de coût et failover.
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Test baseline avant self-host..."}]
)
print(response.usage)
SECTION 07 Données citables, sources et conclusion
- Chronologie : API 16 juillet → WAIC 17–20 juillet → poids ouverts 27 juillet 2026.
- Paramètres : 2,8T total ; MoE 896/16 ; contexte 1 048 576 tokens ; download ~1,4 To (MXFP4).
- Intelligence Index v4.1 : 57,1 (4e rang) ; SWE Marathon 42,0 (1er).
- API : 3/15 $ par M ; cache 0,30 $/M ; ID modèle
kimi-k3. - Self-host : minimum 64+ accélérateurs ; support vLLM/SGLang Day-0 attendu.
- Commercial : ARR >300 M$ ; valorisation 31,5 Md$ (juin 2026).
Sources vérifiables — à reconsulter après le 27 juillet :
Moonshot AI — blog officiel Kimi K3
Kimi API Platform — documentation
Artificial Analysis — classement Intelligence Index v4.1
VentureBeat — couverture Kimi K3 open source
South China Morning Post — rapport Kimi K3 Moonshot AI
Les équipes qui intègrent Kimi K3 dans des pipelines Agent avec CI macOS, builds Xcode et automatisation 7×24 font face à trois goulets avant le drop : ① dépendance API sans résidence UE ; ② CI macOS sur VM avec surcharge Metal et toolchain instable ; ③ Mac local sans uptime permanent pour agents longue durée. Les VM cloud aggravent la latence ; un cluster GPU seul ne couvre pas la stack Apple native. Pour zéro surcharge hyperviseur, CI iOS/macOS stable et automatisation Agent IA, les nœuds Mac physiques cloud MACNOX complètent généralement mieux la stack K3 : hardware Apple 100 %, root complet, facturation jour/semaine/mois. Voir location vs achat Mac Mini M4, analyse coût Agent Grok 4.5 et la page tarifs.
SECTION 08 FAQ
Les poids ouverts Kimi K3 sont-ils open source ?
Non. Open weights = poids téléchargeables sans code d'entraînement ni jeux de données complets. Kimi K3 n'est pas open source OSI, même après le 27 juillet.
Quand exactement les poids seront-ils disponibles ?
Moonshot confirme le 27 juillet 2026 sur Hugging Face. API active depuis le 16 juillet ; annonce WAIC le 17 juillet.
Puis-je exécuter K3 sur un MacBook ?
Non. ~1,4 To et 64+ GPU pour inférence production — pas un workload laptop. Pour CI Apple, utilisez des Mac physiques dédiés.
Le self-host est-il conforme RGPD ?
Self-host en datacenter UE sous contrôle propre satisfait la résidence des données, sans transfert vers tiers pays. L'API exige DPA et documentation des flux vers serveurs chinois.
L'API vaut-elle le coup avant le 27 juillet ?
Oui pour PoC et baseline. 3/15 $ avec cache 0,30 $/M et contexte 1M — puis comparer TCO cluster GPU.
Où trouver les détails architecture KDA et MoE ?
Dans la revue complète Kimi K3 — KDA, AttnRes, Stable LatentMoE et matrice benchmarks intégrale.