Главная / Блог / Kimi K3
ENGINEERING_BLOG · 2026.07.28

Kimi K3: полный open-weight релиз
2,8 трлн параметров и 1M контекст

27 июля 2026 около 23:00 Moonshot AI выкатила полные веса и technical report Kimi K3 плюс три инфраструктурных компонента, на которых стояло обучение: MoonEP, FlashKDA, AgentEnv. 2,8 трлн total params, ~104 млрд active, контекст 1M токенов, native vision — первый полностью открытый 3T-класс. ~1,56 TB на Hugging Face, #1 в trending за 30 минут. Разбор для разработчиков и инженерных команд, которые оценивают интеграцию K3 или self-host: архитектурные изменения на уровне attention/residual/optimizer, независимые бенчмарки, пороги лицензии, реалистичный путь API vs. железо.

SECTION 01 Типичные ошибки при выборе Kimi K3: open source vs open weight, лицензия, порог self-host

После weight drop 27 июля в комьюнити чаще всего ошибаются так:

  • Путают open weight с open source: Moonshot в официальных материалах не пишет «open source» — только «open weight». Training data и полный training code не публикуются, OSI-критерии не выполняются;
  • Тянут Modified MIT из эры K2: у K3 полностью custom license с MaaS revenue gate и attribution threshold — отличается от preview от 22 июля;
  • Недооценивают стоимость self-host: 896 routed experts + 1,56 TB делают consumer hardware бесполезным. Moonshot рекомендует supernode на 64+ accelerators;
  • Верят только vendor benchmarks: harness'ы сильно расходятся. Берите независимые retest от Vals AI и Artificial Analysis;
  • Игнорируют геополитику: релиз весов совпал с эскалацией US-China «model distillation» спора. См. разбор distillation вокруг Kimi K3.

Между API-debut K3 на kimi.com и полным weight release 27 июля прошло 11 дней — open-weight гонка формально вошла в «3T club».

SECTION 02 Timeline релиза Kimi K3 и ключевые спеки

  • 16 июля (канун WAIC 2026): запуск на kimi.com, Kimi Work, Kimi Code и API — веса ещё закрыты;
  • 17 июля: индустриальный разбор архитектуры. Xinhua называет модель крупнейшим open model по числу параметров;
  • 22–23 июля: эскалация «model distillation» US-China. Белый дом обвиняет Moonshot в industrial-scale distillation против Anthropic Fable;
  • 27 июля (~23:00): полные веса, technical report, MoonEP и AgentEnv (FlashKDA уже был открыт);
  • 28 июля: Минкоммерс КНР отвечает на обвинения в «AI hegemonism». Alibaba показывает Qwen3.8-Max-Preview на 24 трлн params — прямой ответ на K3.
Ключевые спеки Kimi K3
Параметр Значение
Total parameters 2,8 трлн (2,8T)
Active parameters ~104 млрд
Architecture MoE — 896 routed experts, 16 active per token
Attention Kimi Delta Attention (KDA) + Gated MLA
Context window 1 000 000 tokens
Multimodal Native vision (ViT-V2, 27 layers)
Weight format MXFP4 weights, MXFP8 activations (quantization-aware с SFT)
Download size ~1,56 TB (Hugging Face)
License Custom license — Moonshot называет это «open weight», не «open source»

SECTION 03 KDA, Attention Residuals, Per-Head Muon: три архитектурных изменения под капотом

K3 — не просто scale-up. Moonshot пересобрал три дефолтных компонента deep learning stack: attention mechanism, residual path, optimizer.

Kimi Delta Attention (KDA): Gated DeltaNet использует scalar forgetting gate. KDA заменяет его channel-wise gating — у каждой feature dimension свой decay rate. Реализация через chunkwise DPLR (Diagonal-Plus-Low-Rank) с чередованием global Gated MLA layers: 1M-token context при минимальном KV cache footprint.

Attention Residuals (AttnRes): классические residuals накапливают выходы слоёв равномерно. AttnRes делает selective, input-dependent aggregation по всем предыдущим слоям — один RMSNorm + pseudo-query vector на layer, ~25 % training efficiency при overhead <2 %.

Per-Head Muon: Muon optimizer работает per attention head, а не на всей модели uniform. В связке со Stable LatentMoE (896 experts, 16 active — sparsity ~1,8 %) и Quantile Balancing Moonshot доказывает theoretical upper bound на redundant experts per compute rank.

SECTION 04 MoonEP, FlashKDA, AgentEnv и сравнение бенчмарков

Три открытых infra-релиза
Технология Роль Ключевая capability
MoonEP Fine-grained MoE communication at scale Временно дублирует overloaded experts; equal token count per rank; upper bound redundant experts
FlashKDA CUTLASS-based KDA kernel Prefill 1,72×–2,22× быстрее на NVIDIA H20 vs flash-linear-attention baseline; drop-in через chunk_kda
AgentEnv Agent sandbox (co-dev с KVCache.ai) Firecracker microVM; checkpoint latency от 133 ms, resume 49 ms, memory overcommit до 6,5×

SWE-bench Verified (независимая оценка, Vals AI, июль 2026):

Независимый retest SWE-bench Verified
Модель Score Дата релиза
Claude Opus 5 97 % 2026-07-24
GPT-5.6 Sol 96,2 % 2026-07-09
Claude Fable 5 95 % 2026-06-09
Kimi K3 93,4 % 2026-07-16
Qwen3.7-Max 79,4 % 2026-05-19

На Artificial Analysis Intelligence Index (max reasoning tier) Kimi K3 — ~57: #3 globally, #1 среди open-weight, позади Claude Fable 5 (60) и GPT-5.6 Sol (59). ~$0,95 per task — ~60 % дешевле Claude Fable 5 (~$2,40), но дороже GLM-5.2 (~$0,47). Capability ceiling open-weight tier, не value pick. K3 сейчас #1 на Arena.ai Frontend Code Arena.

SECTION 05 Лицензия Kimi K3, API pricing и 6-шаговый integration checklist

Custom license добавляет два commercial threshold, которых не было в K2 family:

  • Model-as-a-Service revenue gate: MaaS на K3 с aggregate revenue >$20M за trailing 12 months — отдельное соглашение с Moonshot AI;
  • Attribution gate: при >100M MAU или >$20M monthly revenue — prominent display «Kimi K3» в UI.
API pricing Kimi K3 (за миллион tokens)
Token type Price
Input (cache hit) $0,30
Input (cache miss) $3,00
Output (incl. reasoning trace) $15,00

Disaggregated Mooncake serving держит cache hit rate >90 % на типичных coding workloads — effective cost ближе к $0,30 tier. Self-host требует 64+ accelerators; для большинства команд практичный путь — official API или OpenRouter.

  1. License compliance: прочитать full K3 custom license; оценить MaaS revenue и attribution thresholds для вашего business model;
  2. Integration path: API (OpenAI SDK-compatible, https://api.moonshot.ai/v1, model ID kimi-k3) или third-party hosting через OpenRouter;
  3. API credentials: создать key в Moonshot console; заменить base URL и API key в проекте;
  4. Cache hit rate test: небольшой load test на coding-agent workloads; измерить влияние Mooncake cache на real cost;
  5. Self-host feasibility: при local inference — подтвердить GPU cluster scale (64+ recommended) и 1,56 TB weight storage;
  6. Infra tooling: для MoE training или KDA acceleration — оценить MoonEP, FlashKDA (chunk_kda drop-in) и AgentEnv sandbox.
kimi-k3-api-test.py
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_MOONSHOT_API_KEY",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Explain Kimi Delta Attention in 3 sentences."}]
)
print(response.choices[0].message.content)

SECTION 06 Цитируемые tech data и selection conclusion

  • 2,8T total / ~104B active: крупнейший full open-weight release, ~1,56 TB на Hugging Face;
  • SWE-bench Verified 93,4 %: Vals AI independent retest — #1 open-weight, −3,6 pp vs Claude Opus 5 (97 %);
  • Artificial Analysis Intelligence Index ~57: #3 globally, #1 open-weight, ~$0,95 per task;
  • FlashKDA prefill 1,72×–2,22×: на NVIDIA H20 vs flash-linear-attention baseline;
  • AgentEnv checkpoint 133 ms / resume 49 ms: Moonshot-reported, independent reproduction пока нет.

Official и third-party sources — перед prod сверьте актуальные страницы:

Moonshot AI official blog: Kimi K3 technical report

Hugging Face: организация moonshotai (download весов K3)

GitHub: moonshotai/FlashKDA

Если вы строите agent pipelines на K3, virtualized Mac даёт overhead и compatibility risk на Xcode builds, Metal acceleration и iOS CI — toolchain ломается чаще, чем на bare metal. Для zero-loss native compute, stable iOS CI/CD и 24/7 AI agent automation физические cloud-ноды MACNOX обычно лучший fit: 100 % Apple hardware, full root, no hypervisor tax, flexible daily/weekly/monthly billing. Больше контекста: deep dive Kimi K3 и OpenRouter July rankings.

SECTION 07 Часто задаваемые вопросы

Kimi K3 — open source модель?

Нет, не по строгому OSI-определению. Это open weight: trained weights, technical report и часть infra tools публичны, training data и full training code — нет. Moonshot сам пишет только «open weight», не «open source».

Можно ли использовать Kimi K3 commercially бесплатно?

Да, для подавляющего большинства use cases. Ограничения — MaaS revenue >$20M за 12 months или продукт >100M MAU / >$20M monthly revenue.

Сколько железа нужно для self-host Kimi K3?

Moonshot рекомендует supernode на 64+ accelerators. Большинству разработчиков проще official API или OpenRouter.

Kimi K3 vs GPT-5.6 и Claude — кто сильнее?

На SWE-bench Verified (93,4 % vs 95–97 %) и Intelligence Index (#3) уступает frontier closed models, но сильнейший доступный open-weight — ahead of GLM-5.2 и DeepSeek V4 Pro.

Чем Kimi K3 отличается от Kimi K2?

K3 — ~3× params vs K2.5, добавлены Attention Residuals и Per-Head Muon, сильно расширены context и multimodal. License включает новый MaaS revenue threshold, которого не было в K2.