27 июля 2026 около 23:00 Moonshot AI выкатила полные веса и technical report Kimi K3 плюс три инфраструктурных компонента, на которых стояло обучение: MoonEP, FlashKDA, AgentEnv. 2,8 трлн total params, ~104 млрд active, контекст 1M токенов, native vision — первый полностью открытый 3T-класс. ~1,56 TB на Hugging Face, #1 в trending за 30 минут. Разбор для разработчиков и инженерных команд, которые оценивают интеграцию K3 или self-host: архитектурные изменения на уровне attention/residual/optimizer, независимые бенчмарки, пороги лицензии, реалистичный путь API vs. железо.
SECTION 01 Типичные ошибки при выборе Kimi K3: open source vs open weight, лицензия, порог self-host
После weight drop 27 июля в комьюнити чаще всего ошибаются так:
- Путают open weight с open source: Moonshot в официальных материалах не пишет «open source» — только «open weight». Training data и полный training code не публикуются, OSI-критерии не выполняются;
- Тянут Modified MIT из эры K2: у K3 полностью custom license с MaaS revenue gate и attribution threshold — отличается от preview от 22 июля;
- Недооценивают стоимость self-host: 896 routed experts + 1,56 TB делают consumer hardware бесполезным. Moonshot рекомендует supernode на 64+ accelerators;
- Верят только vendor benchmarks: harness'ы сильно расходятся. Берите независимые retest от Vals AI и Artificial Analysis;
- Игнорируют геополитику: релиз весов совпал с эскалацией US-China «model distillation» спора. См. разбор distillation вокруг Kimi K3.
Между API-debut K3 на kimi.com и полным weight release 27 июля прошло 11 дней — open-weight гонка формально вошла в «3T club».
SECTION 02 Timeline релиза Kimi K3 и ключевые спеки
- 16 июля (канун WAIC 2026): запуск на kimi.com, Kimi Work, Kimi Code и API — веса ещё закрыты;
- 17 июля: индустриальный разбор архитектуры. Xinhua называет модель крупнейшим open model по числу параметров;
- 22–23 июля: эскалация «model distillation» US-China. Белый дом обвиняет Moonshot в industrial-scale distillation против Anthropic Fable;
- 27 июля (~23:00): полные веса, technical report, MoonEP и AgentEnv (FlashKDA уже был открыт);
- 28 июля: Минкоммерс КНР отвечает на обвинения в «AI hegemonism». Alibaba показывает Qwen3.8-Max-Preview на 24 трлн params — прямой ответ на K3.
| Параметр | Значение |
|---|---|
| Total parameters | 2,8 трлн (2,8T) |
| Active parameters | ~104 млрд |
| Architecture | MoE — 896 routed experts, 16 active per token |
| Attention | Kimi Delta Attention (KDA) + Gated MLA |
| Context window | 1 000 000 tokens |
| Multimodal | Native vision (ViT-V2, 27 layers) |
| Weight format | MXFP4 weights, MXFP8 activations (quantization-aware с SFT) |
| Download size | ~1,56 TB (Hugging Face) |
| License | Custom license — Moonshot называет это «open weight», не «open source» |
SECTION 03 KDA, Attention Residuals, Per-Head Muon: три архитектурных изменения под капотом
K3 — не просто scale-up. Moonshot пересобрал три дефолтных компонента deep learning stack: attention mechanism, residual path, optimizer.
Kimi Delta Attention (KDA): Gated DeltaNet использует scalar forgetting gate. KDA заменяет его channel-wise gating — у каждой feature dimension свой decay rate. Реализация через chunkwise DPLR (Diagonal-Plus-Low-Rank) с чередованием global Gated MLA layers: 1M-token context при минимальном KV cache footprint.
Attention Residuals (AttnRes): классические residuals накапливают выходы слоёв равномерно. AttnRes делает selective, input-dependent aggregation по всем предыдущим слоям — один RMSNorm + pseudo-query vector на layer, ~25 % training efficiency при overhead <2 %.
Per-Head Muon: Muon optimizer работает per attention head, а не на всей модели uniform. В связке со Stable LatentMoE (896 experts, 16 active — sparsity ~1,8 %) и Quantile Balancing Moonshot доказывает theoretical upper bound на redundant experts per compute rank.
SECTION 04 MoonEP, FlashKDA, AgentEnv и сравнение бенчмарков
| Технология | Роль | Ключевая capability |
|---|---|---|
| MoonEP | Fine-grained MoE communication at scale | Временно дублирует overloaded experts; equal token count per rank; upper bound redundant experts |
| FlashKDA | CUTLASS-based KDA kernel | Prefill 1,72×–2,22× быстрее на NVIDIA H20 vs flash-linear-attention baseline; drop-in через chunk_kda |
| AgentEnv | Agent sandbox (co-dev с KVCache.ai) | Firecracker microVM; checkpoint latency от 133 ms, resume 49 ms, memory overcommit до 6,5× |
SWE-bench Verified (независимая оценка, Vals AI, июль 2026):
| Модель | Score | Дата релиза |
|---|---|---|
| Claude Opus 5 | 97 % | 2026-07-24 |
| GPT-5.6 Sol | 96,2 % | 2026-07-09 |
| Claude Fable 5 | 95 % | 2026-06-09 |
| Kimi K3 | 93,4 % | 2026-07-16 |
| Qwen3.7-Max | 79,4 % | 2026-05-19 |
На Artificial Analysis Intelligence Index (max reasoning tier) Kimi K3 — ~57: #3 globally, #1 среди open-weight, позади Claude Fable 5 (60) и GPT-5.6 Sol (59). ~$0,95 per task — ~60 % дешевле Claude Fable 5 (~$2,40), но дороже GLM-5.2 (~$0,47). Capability ceiling open-weight tier, не value pick. K3 сейчас #1 на Arena.ai Frontend Code Arena.
SECTION 05 Лицензия Kimi K3, API pricing и 6-шаговый integration checklist
Custom license добавляет два commercial threshold, которых не было в K2 family:
- Model-as-a-Service revenue gate: MaaS на K3 с aggregate revenue >$20M за trailing 12 months — отдельное соглашение с Moonshot AI;
- Attribution gate: при >100M MAU или >$20M monthly revenue — prominent display «Kimi K3» в UI.
| Token type | Price |
|---|---|
| Input (cache hit) | $0,30 |
| Input (cache miss) | $3,00 |
| Output (incl. reasoning trace) | $15,00 |
Disaggregated Mooncake serving держит cache hit rate >90 % на типичных coding workloads — effective cost ближе к $0,30 tier. Self-host требует 64+ accelerators; для большинства команд практичный путь — official API или OpenRouter.
- License compliance: прочитать full K3 custom license; оценить MaaS revenue и attribution thresholds для вашего business model;
- Integration path: API (OpenAI SDK-compatible,
https://api.moonshot.ai/v1, model IDkimi-k3) или third-party hosting через OpenRouter; - API credentials: создать key в Moonshot console; заменить base URL и API key в проекте;
- Cache hit rate test: небольшой load test на coding-agent workloads; измерить влияние Mooncake cache на real cost;
- Self-host feasibility: при local inference — подтвердить GPU cluster scale (64+ recommended) и 1,56 TB weight storage;
- Infra tooling: для MoE training или KDA acceleration — оценить MoonEP, FlashKDA (chunk_kda drop-in) и AgentEnv sandbox.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_MOONSHOT_API_KEY",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Explain Kimi Delta Attention in 3 sentences."}]
)
print(response.choices[0].message.content)
SECTION 06 Цитируемые tech data и selection conclusion
- 2,8T total / ~104B active: крупнейший full open-weight release, ~1,56 TB на Hugging Face;
- SWE-bench Verified 93,4 %: Vals AI independent retest — #1 open-weight, −3,6 pp vs Claude Opus 5 (97 %);
- Artificial Analysis Intelligence Index ~57: #3 globally, #1 open-weight, ~$0,95 per task;
- FlashKDA prefill 1,72×–2,22×: на NVIDIA H20 vs flash-linear-attention baseline;
- AgentEnv checkpoint 133 ms / resume 49 ms: Moonshot-reported, independent reproduction пока нет.
Official и third-party sources — перед prod сверьте актуальные страницы:
Moonshot AI official blog: Kimi K3 technical report
Hugging Face: организация moonshotai (download весов K3)
Если вы строите agent pipelines на K3, virtualized Mac даёт overhead и compatibility risk на Xcode builds, Metal acceleration и iOS CI — toolchain ломается чаще, чем на bare metal. Для zero-loss native compute, stable iOS CI/CD и 24/7 AI agent automation физические cloud-ноды MACNOX обычно лучший fit: 100 % Apple hardware, full root, no hypervisor tax, flexible daily/weekly/monthly billing. Больше контекста: deep dive Kimi K3 и OpenRouter July rankings.
SECTION 07 Часто задаваемые вопросы
Kimi K3 — open source модель?
Нет, не по строгому OSI-определению. Это open weight: trained weights, technical report и часть infra tools публичны, training data и full training code — нет. Moonshot сам пишет только «open weight», не «open source».
Можно ли использовать Kimi K3 commercially бесплатно?
Да, для подавляющего большинства use cases. Ограничения — MaaS revenue >$20M за 12 months или продукт >100M MAU / >$20M monthly revenue.
Сколько железа нужно для self-host Kimi K3?
Moonshot рекомендует supernode на 64+ accelerators. Большинству разработчиков проще official API или OpenRouter.
Kimi K3 vs GPT-5.6 и Claude — кто сильнее?
На SWE-bench Verified (93,4 % vs 95–97 %) и Intelligence Index (#3) уступает frontier closed models, но сильнейший доступный open-weight — ahead of GLM-5.2 и DeepSeek V4 Pro.
Чем Kimi K3 отличается от Kimi K2?
K3 — ~3× params vs K2.5, добавлены Attention Residuals и Per-Head Muon, сильно расширены context и multimodal. License включает новый MaaS revenue threshold, которого не было в K2.