Главная / Блог / K3 Open Weights
ENGINEERING_BLOG · 2026.07.22

Kimi K3 Open Weights:
релиз 27 июля 2026 — бенчмарки, цены и требования к железу

Moonshot AI включила API Kimi K3 16 июля 2026 и обещает полные open weights на Hugging Face 27 июля 2026 — первую публично скачиваемую модель за порогом 2 трлн параметров. Для MLOps, ML-инженеров и тех, кто готовит on-premise inference, окно узкое: API уже live, но production self-host требует 64+ ускорителей и ~1,4 ТБ весов. Этот техгайд покрывает таймлайн 16/17/27 июля, specs 2,8T, benchmark 57,1, цены API, open weights vs open source, реальность железа, значение для индустрии, чеклист из 7 шагов, FAQ и мост к полному обзору Kimi K3.

  • TL;DR: API с 16 июля; WAIC 17–20 июля; open weights 27 июля 2026.
  • Перформанс: Intelligence Index v4.1 = 57,1 (4-е место); SWE Marathon 42,0 (1-е).
  • Self-host: ~1,4 ТБ (MXFP4), production inference = 64+ GPU.

SECTION 01 Open weights vs open source: почему различие критично для enterprise

«Open source» и «open weights» часто смешивают — технически и юридически это разные вещи:

  • Open weights: скачиваемые веса модели; training code, датасеты и полная воспроизводимость обычно отсутствуют. Kimi K3 — именно этот класс.
  • Open source (OSI): исходники, лицензия, reproducibility — Kimi K3 этому не соответствует, даже после 27 июля.
  • API-first lag: 11 дней между API go-live (16 июля) и weight release (27 июля) — облачная зависимость или раннее бронирование GPU.
  • Vendor lock-in: без весов остаётся только API — fine-tuning и on-premise inference недоступны. Альтернативы — в сравнении DeepSeek V4 GA.
  • Data residency: self-host после 27 июля даёт контроль над данными в своём дата-центре — без прокидывания промптов на серверы Moonshot.

Суть: drop 27 июля — крупнейший weight release в истории (2,8T, MoE 896 experts). Не OSI open source, но новый fine-tuning baseline для комьюнити.

SECTION 02 Таймлайн 16/17/27 июля и specs модели 2,8T

Таймлайн релиза Kimi K3
Дата Событие Для команд
16 июля 2026 Тихий API go-live (kimi-k3) Тест через kimi.com, platform.kimi.ai, OpenRouter
17–20 июля 2026 WAIC Shanghai — официальная презентация Бенчмарки, архитектура, commercial metrics
27 июля 2026 Полные open weights на Hugging Face Download, self-host, fine-tuning; vLLM/SGLang Day-0
Ключевые данные Kimi K3 — июль 2026
Параметр Значение
Всего параметров 2,8 трлн (2,8T)
Архитектура KDA + AttnRes + Stable LatentMoE
MoE config 896 experts, 16 active per token (1,8% sparsity)
Context window 1 048 576 tokens (1M)
Vision Native multimodal (text, image, video)
Quantization MXFP4 weights, MXFP8 activations
Размер download ~1,4 ТБ (MXFP4 variant)
Self-host minimum 64+ accelerators (super-node)

На фоне рынка: K3 на ~75% больше DeepSeek V4 Pro (1,6T) и в 2,7× больше open model Xiaomi (1,02T). Moonshot держала титул «крупнейшей open model» 9 из 12 месяцев — K3 обновляет рекорд с 27 июля.

SECTION 03 Benchmark 57,1 и индустриальное значение weight drop

Перед резервированием GPU-кластера — performance context. Все цифры Moonshot self-report (17 июля 2026):

Kimi K3 — selected benchmarks vs frontier
Benchmark Kimi K3 Claude Fable 5 GPT-5.6 Sol
Intelligence Index v4.1 57,1 (4-е место) 59,9 58,9
SWE Marathon 42,0 35,0 39,0
OmniDocBench 91,1 89,8 85,8
Program Bench 77,8 76,8 77,6
Terminal Bench 2.1 88,3 84,6 88,8

Что меняет drop 27 июля:

  • Первый download >2T: порог, который раньше был только у closed API models.
  • Новый fine-tuning baseline: domain adapters без vendor lock-in — для regulated industries.
  • MoE inference как инфра-дисциплина: 896 experts требуют vLLM/SGLang routing — не plug-and-play как 7B.
  • Competitive pressure: Moonshot ARR >$300M, valuation $31,5B, API >70% revenue — сигнал DeepSeek и frontier labs. Архитектура — в полном обзоре Kimi K3.

SECTION 04 Цены API сейчас vs self-host после 27 июля

Сравнение API-цен за 1M tokens
Model Input Output Cache input Context
Kimi K3 (API) $3,00 $15,00 $0,30 1M
Claude Sonnet 5 $3,00 $15,00 200K
DeepSeek V4 Pro $1,74 $3,48 $0,145 128K
Kimi K3 (self-host с 27.7.) CapEx + OpEx GPU cluster 1M (local)
Decision matrix: API vs self-host vs hybrid
Сценарий Рекомендация Почему
Быстрый PoC до 27 июля Kimi K3 API Доступно сейчас, $3/$15, cache $0,30/M
Data residency / on-premise Self-host с 27.7. Промпты не уходят на third-party серверы
Cost-sensitive workloads DeepSeek V4 Pro API Output $3,48/M — сильно ниже K3
Domain fine-tuning Kimi K3 open weights Крупнейшие доступные open weights, 2,8T
Edge / laptop inference Ни API, ни K3 self-host 64+ GPU required — не edge model

Cache hit rate >90% в Kimi Code workflows — effective input ~$0,55/M. До 27 июля API pragmatic; после — TCO GPU cluster vs token billing.

SECTION 05 Self-host reality: 1,4 ТБ весов и 64+ GPU — не laptop workload

Drop 27 июля — не consumer release. Production inference требует:

  • ~1,4 ТБ download: MXFP4 weights на Hugging Face — storage и bandwidth plan до release.
  • 64+ accelerators: super-node minimum (NVIDIA H100/H200) для full-throughput на 2,8T MoE.
  • Framework adapters: vLLM, SGLang, transformers с MXFP4/NVFP4 — Day-0 expected, production hardening = недели.
  • KV cache на 1M context: KDA режет memory на 75%, но остаётся datacenter-scale.
  • Metal / Xcode stack: GPU cluster не заменяет native Apple build pipeline — дополняет, не substitutирует. Для CI на Metal — физический Mac.

SECTION 06 Чеклист из 7 шагов: подготовка к релизу 27 июля

  1. API baseline (сейчас): тест Kimi K3 через kimi-k3 на platform.kimi.ai — latency, quality, cost. См. гайд по архитектуре и setup.
  2. Забронировать GPU capacity: 64+ accelerators для PoC — раньше release, иначе дефицит.
  3. Storage planning: ~1,4 ТБ MXFP4 + checkpoint overhead; bandwidth первого download.
  4. Framework stack: track vLLM/SGLang branches с Kimi K3 support; validate на меньших MoE.
  5. Compliance docs: data flow diagram, processing register — self-host vs API route.
  6. Fine-tuning pipeline sketch: domain datasets, LoRA vs full fine-tune, eval harness до download.
  7. Hybrid fallback: API для burst, self-host для sensitive workloads — cost caps и failover.
kimi_k3_api_baseline.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Baseline test before self-host..."}]
)
print(response.usage)

SECTION 07 Цитируемые данные, источники и вывод

  • Timeline: API 16 июля → WAIC 17–20 июля → open weights 27 июля 2026.
  • Parameters: 2,8T total; MoE 896/16; context 1 048 576 tokens; download ~1,4 ТБ (MXFP4).
  • Intelligence Index v4.1: 57,1 (4-е место); SWE Marathon 42,0 (1-е).
  • API: $3/$15 per M; cache $0,30/M; model ID kimi-k3.
  • Self-host: minimum 64+ accelerators; vLLM/SGLang Day-0 expected.
  • Commercial: ARR >$300M; valuation $31,5B (июнь 2026).

Верифицируемые источники — перепроверить после 27 июля:

Moonshot AI — официальный блог Kimi K3

Kimi API Platform — документация

Artificial Analysis — Intelligence Index v4.1 rankings

VentureBeat — Moonshot AI Kimi K3 coverage

South China Morning Post — Kimi K3 Moonshot AI report

Команды, интегрирующие Kimi K3 в Agent pipelines с macOS CI, Xcode builds и 7×24 automation, упираются в три bottleneck до drop: ① API dependency без on-premise control; ② macOS CI на VM с Metal overhead и нестабильной toolchain; ③ локальный Mac без 24/7 uptime для long-horizon agents. Cloud VM ухудшают latency; GPU cluster не покрывает native Apple stack. Для zero hypervisor overhead, stable iOS/macOS CI и AI Agent automation MACNOX cloud physical Mac nodes обычно лучше дополняют K3 stack: 100% Apple hardware, full root, flexible daily/weekly/monthly billing. См. Mac Mini M4 rent vs buy, Grok 4.5 agent cost analysis и pricing.

SECTION 08 Часто задаваемые вопросы

Open weights Kimi K3 — это open source?

Нет. Open weights = скачиваемые веса без полного training code и datasets. Kimi K3 не OSI open source, даже после 27 июля.

Когда точно выйдут веса?

Moonshot подтверждает 27 июля 2026 на Hugging Face. API live с 16 июля; WAIC announcement 17 июля.

Можно ли запустить K3 на MacBook?

Нет. ~1,4 ТБ и 64+ GPU для production inference — не laptop workload. Для Apple CI — dedicated physical Mac.

Стоит ли API до 27 июля?

Да для PoC и baseline. $3/$15 с cache $0,30/M и 1M context — потом сравнить TCO с GPU cluster.

Где детали KDA и MoE архитектуры?

В полном обзоре Kimi K3 — KDA, AttnRes, Stable LatentMoE и полная benchmark matrix.

Чем K3 open weights отличается от DeepSeek V4 Pro?

K3: 2,8T vs 1,6T, 1M vs 128K context, сильнее coding benchmarks. DeepSeek output $3,48/M — дешевле для cost-sensitive workloads.