Moonshot AI включила API Kimi K3 16 июля 2026 и обещает полные open weights на Hugging Face 27 июля 2026 — первую публично скачиваемую модель за порогом 2 трлн параметров. Для MLOps, ML-инженеров и тех, кто готовит on-premise inference, окно узкое: API уже live, но production self-host требует 64+ ускорителей и ~1,4 ТБ весов. Этот техгайд покрывает таймлайн 16/17/27 июля, specs 2,8T, benchmark 57,1, цены API, open weights vs open source, реальность железа, значение для индустрии, чеклист из 7 шагов, FAQ и мост к полному обзору Kimi K3.
- TL;DR: API с 16 июля; WAIC 17–20 июля; open weights 27 июля 2026.
- Перформанс: Intelligence Index v4.1 = 57,1 (4-е место); SWE Marathon 42,0 (1-е).
- Self-host: ~1,4 ТБ (MXFP4), production inference = 64+ GPU.
SECTION 01 Open weights vs open source: почему различие критично для enterprise
«Open source» и «open weights» часто смешивают — технически и юридически это разные вещи:
- Open weights: скачиваемые веса модели; training code, датасеты и полная воспроизводимость обычно отсутствуют. Kimi K3 — именно этот класс.
- Open source (OSI): исходники, лицензия, reproducibility — Kimi K3 этому не соответствует, даже после 27 июля.
- API-first lag: 11 дней между API go-live (16 июля) и weight release (27 июля) — облачная зависимость или раннее бронирование GPU.
- Vendor lock-in: без весов остаётся только API — fine-tuning и on-premise inference недоступны. Альтернативы — в сравнении DeepSeek V4 GA.
- Data residency: self-host после 27 июля даёт контроль над данными в своём дата-центре — без прокидывания промптов на серверы Moonshot.
Суть: drop 27 июля — крупнейший weight release в истории (2,8T, MoE 896 experts). Не OSI open source, но новый fine-tuning baseline для комьюнити.
SECTION 02 Таймлайн 16/17/27 июля и specs модели 2,8T
| Дата | Событие | Для команд |
|---|---|---|
| 16 июля 2026 | Тихий API go-live (kimi-k3) |
Тест через kimi.com, platform.kimi.ai, OpenRouter |
| 17–20 июля 2026 | WAIC Shanghai — официальная презентация | Бенчмарки, архитектура, commercial metrics |
| 27 июля 2026 | Полные open weights на Hugging Face | Download, self-host, fine-tuning; vLLM/SGLang Day-0 |
| Параметр | Значение |
|---|---|
| Всего параметров | 2,8 трлн (2,8T) |
| Архитектура | KDA + AttnRes + Stable LatentMoE |
| MoE config | 896 experts, 16 active per token (1,8% sparsity) |
| Context window | 1 048 576 tokens (1M) |
| Vision | Native multimodal (text, image, video) |
| Quantization | MXFP4 weights, MXFP8 activations |
| Размер download | ~1,4 ТБ (MXFP4 variant) |
| Self-host minimum | 64+ accelerators (super-node) |
На фоне рынка: K3 на ~75% больше DeepSeek V4 Pro (1,6T) и в 2,7× больше open model Xiaomi (1,02T). Moonshot держала титул «крупнейшей open model» 9 из 12 месяцев — K3 обновляет рекорд с 27 июля.
SECTION 03 Benchmark 57,1 и индустриальное значение weight drop
Перед резервированием GPU-кластера — performance context. Все цифры Moonshot self-report (17 июля 2026):
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| Intelligence Index v4.1 | 57,1 (4-е место) | 59,9 | 58,9 |
| SWE Marathon | 42,0 | 35,0 | 39,0 |
| OmniDocBench | 91,1 | 89,8 | 85,8 |
| Program Bench | 77,8 | 76,8 | 77,6 |
| Terminal Bench 2.1 | 88,3 | 84,6 | 88,8 |
Что меняет drop 27 июля:
- Первый download >2T: порог, который раньше был только у closed API models.
- Новый fine-tuning baseline: domain adapters без vendor lock-in — для regulated industries.
- MoE inference как инфра-дисциплина: 896 experts требуют vLLM/SGLang routing — не plug-and-play как 7B.
- Competitive pressure: Moonshot ARR >$300M, valuation $31,5B, API >70% revenue — сигнал DeepSeek и frontier labs. Архитектура — в полном обзоре Kimi K3.
SECTION 04 Цены API сейчас vs self-host после 27 июля
| Model | Input | Output | Cache input | Context |
|---|---|---|---|---|
| Kimi K3 (API) | $3,00 | $15,00 | $0,30 | 1M |
| Claude Sonnet 5 | $3,00 | $15,00 | — | 200K |
| DeepSeek V4 Pro | $1,74 | $3,48 | $0,145 | 128K |
| Kimi K3 (self-host с 27.7.) | CapEx + OpEx GPU cluster | — | — | 1M (local) |
| Сценарий | Рекомендация | Почему |
|---|---|---|
| Быстрый PoC до 27 июля | Kimi K3 API | Доступно сейчас, $3/$15, cache $0,30/M |
| Data residency / on-premise | Self-host с 27.7. | Промпты не уходят на third-party серверы |
| Cost-sensitive workloads | DeepSeek V4 Pro API | Output $3,48/M — сильно ниже K3 |
| Domain fine-tuning | Kimi K3 open weights | Крупнейшие доступные open weights, 2,8T |
| Edge / laptop inference | Ни API, ни K3 self-host | 64+ GPU required — не edge model |
Cache hit rate >90% в Kimi Code workflows — effective input ~$0,55/M. До 27 июля API pragmatic; после — TCO GPU cluster vs token billing.
SECTION 05 Self-host reality: 1,4 ТБ весов и 64+ GPU — не laptop workload
Drop 27 июля — не consumer release. Production inference требует:
- ~1,4 ТБ download: MXFP4 weights на Hugging Face — storage и bandwidth plan до release.
- 64+ accelerators: super-node minimum (NVIDIA H100/H200) для full-throughput на 2,8T MoE.
- Framework adapters: vLLM, SGLang, transformers с MXFP4/NVFP4 — Day-0 expected, production hardening = недели.
- KV cache на 1M context: KDA режет memory на 75%, но остаётся datacenter-scale.
- Metal / Xcode stack: GPU cluster не заменяет native Apple build pipeline — дополняет, не substitutирует. Для CI на Metal — физический Mac.
SECTION 06 Чеклист из 7 шагов: подготовка к релизу 27 июля
- API baseline (сейчас): тест Kimi K3 через
kimi-k3на platform.kimi.ai — latency, quality, cost. См. гайд по архитектуре и setup. - Забронировать GPU capacity: 64+ accelerators для PoC — раньше release, иначе дефицит.
- Storage planning: ~1,4 ТБ MXFP4 + checkpoint overhead; bandwidth первого download.
- Framework stack: track vLLM/SGLang branches с Kimi K3 support; validate на меньших MoE.
- Compliance docs: data flow diagram, processing register — self-host vs API route.
- Fine-tuning pipeline sketch: domain datasets, LoRA vs full fine-tune, eval harness до download.
- Hybrid fallback: API для burst, self-host для sensitive workloads — cost caps и failover.
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Baseline test before self-host..."}]
)
print(response.usage)
SECTION 07 Цитируемые данные, источники и вывод
- Timeline: API 16 июля → WAIC 17–20 июля → open weights 27 июля 2026.
- Parameters: 2,8T total; MoE 896/16; context 1 048 576 tokens; download ~1,4 ТБ (MXFP4).
- Intelligence Index v4.1: 57,1 (4-е место); SWE Marathon 42,0 (1-е).
- API: $3/$15 per M; cache $0,30/M; model ID
kimi-k3. - Self-host: minimum 64+ accelerators; vLLM/SGLang Day-0 expected.
- Commercial: ARR >$300M; valuation $31,5B (июнь 2026).
Верифицируемые источники — перепроверить после 27 июля:
Moonshot AI — официальный блог Kimi K3
Kimi API Platform — документация
Artificial Analysis — Intelligence Index v4.1 rankings
VentureBeat — Moonshot AI Kimi K3 coverage
South China Morning Post — Kimi K3 Moonshot AI report
Команды, интегрирующие Kimi K3 в Agent pipelines с macOS CI, Xcode builds и 7×24 automation, упираются в три bottleneck до drop: ① API dependency без on-premise control; ② macOS CI на VM с Metal overhead и нестабильной toolchain; ③ локальный Mac без 24/7 uptime для long-horizon agents. Cloud VM ухудшают latency; GPU cluster не покрывает native Apple stack. Для zero hypervisor overhead, stable iOS/macOS CI и AI Agent automation MACNOX cloud physical Mac nodes обычно лучше дополняют K3 stack: 100% Apple hardware, full root, flexible daily/weekly/monthly billing. См. Mac Mini M4 rent vs buy, Grok 4.5 agent cost analysis и pricing.
SECTION 08 Часто задаваемые вопросы
Open weights Kimi K3 — это open source?
Нет. Open weights = скачиваемые веса без полного training code и datasets. Kimi K3 не OSI open source, даже после 27 июля.
Когда точно выйдут веса?
Moonshot подтверждает 27 июля 2026 на Hugging Face. API live с 16 июля; WAIC announcement 17 июля.
Можно ли запустить K3 на MacBook?
Нет. ~1,4 ТБ и 64+ GPU для production inference — не laptop workload. Для Apple CI — dedicated physical Mac.
Стоит ли API до 27 июля?
Да для PoC и baseline. $3/$15 с cache $0,30/M и 1M context — потом сравнить TCO с GPU cluster.
Где детали KDA и MoE архитектуры?
В полном обзоре Kimi K3 — KDA, AttnRes, Stable LatentMoE и полная benchmark matrix.
Чем K3 open weights отличается от DeepSeek V4 Pro?
K3: 2,8T vs 1,6T, 1M vs 128K context, сильнее coding benchmarks. DeepSeek output $3,48/M — дешевле для cost-sensitive workloads.