Ночью 16 июля 2026 Moonshot AI (月之暗面) тихо включила Kimi K3 — без пресс-конференции, но с 2,8 трлн параметров, крупнейшим open-source LLM на сегодня. Для инженеров, которые оценивают модели для coding-агентов, анализа monorepo или multimodal-документов, три вопроса решают выбор: догоняет ли Claude Fable 5 и GPT-5.6 Sol? Сколько стоит API? Когда выйдут веса? Этот разбор покрывает стратегический контекст, архитектуру KDA/AttnRes/MoE, полную матрицу бенчмарков, цены, 4 способа доступа, 6 шагов подключения, матрицу сценариев, open weights 27 июля, цитируемые параметры и FAQ — с акцентом на inference pipeline, KV-cache и последствия для macOS CI.
SECTION 01 Почему Kimi K3 важен сейчас: контекст, стоимость и vendor lock-in
K3 закрывает три типичных bottleneck в production LLM-стеках:
- Потолок контекста: Большинство flagship-моделей ограничены 128K–400K token — monorepo требует chunking, потери state и дорогих re-prompt.
- Long-horizon coding: SWE Marathon измеряет многочасовую agent-работу; многие модели «ломаются» в tool-loop.
- Закрытые API: Без open weights нет fine-tuning, on-prem и полного audit trail — до 27 июля только cloud inference.
- Бюджет output: Claude Opus 4.8 — $5/$25 за 1M token; см. разбор цен Grok 4.5 для контекста рынка.
Core specs: MoE 896 experts, 16 active; контекст 1 048 576 token; native vision (text/image/video); model ID kimi-k3; reasoning сейчас только max effort; полные веса 27 июля 2026 на Hugging Face.
| Модель | Параметры | Контекст |
|---|---|---|
| Kimi K3 | 2,8T | 1M |
| DeepSeek V4 Pro | 1,6T | 128K |
| Xiaomi Open Model | 1,02T | — |
| Alibaba Qwen (open) | 397B | — |
SECTION 02 Стратегический контекст: WAIC, ARR $300M и comeback Moonshot
- Size record: 9 из 12 месяцев Kimi держала рекord largest open model; K3 опережает DeepSeek V4 Pro на ~75 %.
- WAIC 2026: Релиз накануне World AI Conference в Shanghai — сильный сигнал рынку.
- Commercial traction: ARR >$300M (июнь 2026); 6-й раунд при $31,5B pre-money; API >70 % revenue; overseas paid users +400 %.
- Metal/Core ML: Для интеграции agent-pipeline с Xcode и локальными tools нативный macOS host критичен — VM дают overhead на Metal-шейдерах и Core ML compile chain.
SECTION 03 Архитектура: KDA, AttnRes и Stable LatentMoE
K3 — не просто scale-up. Три engineering-инновации решают реальные проблемы inference и training:
Kimi Delta Attention (KDA): Hybrid linear attention в ratio 3:1 (три linear layer, один full attention). Эффект: KV-cache до −75 %, decoding при 1M token до 6,3× быстрее, без trade-off на short/long context и RL.
Attention Residuals (AttnRes): Selective retrieval через depth вместо uniform residual accumulation — ~+25 % training efficiency при <2 % extra compute.
Stable LatentMoE: 896 experts, 16 active (sparsity 1,8 %). Стабилизаторы:
| Техника | Роль |
|---|---|
| Quantile Balancing | Expert allocation из router quantiles — меньше fragile heuristics |
| Per-Head Muon | Head-level optimization для stable large-scale training |
| SiTU (Sigmoid Tanh Unit) | Улучшенный activation control |
| Gated MLA | Выше attention selectivity |
| Итого vs Kimi K2 | ~2,5× лучше scaling efficiency |
SECTION 04 Бенчмарки: coding, reasoning и vision
Данные self-reported Moonshot (16 июля 2026). Разные harness: K3 — Kimi Code, GPT — Codex, Claude — Claude Code. Независимые reproductions в процессе.
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 |
|---|---|---|---|---|
| DeepSWE | 67,5 | 70,0 | 73,0 | 59,0 |
| Program Bench | 77,8 | 76,8 | 77,6 | 71,9 |
| Terminal Bench 2.1 | 88,3 | 84,6 | 88,8 | 84,6 |
| FrontierSWE | 81,2 | 86,6 | 71,3 | 66,7 |
| SWE Marathon | 42,0 | 35,0 | 39,0 | 40,0 |
| BrowseComp | 91,2 | 88,0 | 90,4 | 84,3 |
| Automation Bench | 30,8 | 29,1 | 29,7 | 27,2 |
| GPQA-Diamond | 93,5 | 92,6 | 94,1 | 91,0 |
| MMMU-Pro (vision) | 81,6 | 81,2 | 83,0 | 78,9 |
| OmniDocBench | 91,1 | 89,8 | 85,8 | 87,9 |
SWE Marathon — ключевой индикатор long-horizon coding: K3 лидирует с 42,0. Artificial Analysis Intelligence Index v4.1: K3 = 57,1 (4-е место), Fable 5 = 59,9, GPT-5.6 Sol = 58,9 — разрыв 2,8 пункта.
SECTION 05 API pricing: $3/$15, cache-hit и тарифы Китая
| Модель | Input | Output | Cache input | Контекст |
|---|---|---|---|---|
| Kimi K3 | $3,00 | $15,00 | $0,30 | 1M |
| Claude Sonnet 5 | $3,00 | $15,00 | — | 200K |
| Claude Opus 4.8 | $5,00 | $25,00 | — | 200K |
| GPT-5.5 | $5,00 | $30,00 | — | 400K |
| DeepSeek V4 Pro | $1,74 | $3,48 | $0,145 | 128K |
| Kimi K2.6 | $0,95 | $4,00 | $0,16 | 256K |
K3 совпадает с Sonnet standard, но даёт 5× контекст. Moonshot сообщает >90 % cache hit в Kimi Code workflows (Mooncake split-inference) — effective input ~$0,55/M. Китай: ¥20/¥100 за M, cache ¥2/M; consumer от ¥199 (до 11 августа).
SECTION 06 6 шагов подключения Kimi K3 (4 способа доступа)
Четыре пути: (1) kimi.com web/app — free с Google login; (2) Moonshot API — OpenAI-compatible; (3) OpenRouter moonshotai/kimi-k3; (4) self-host после 27 июля — 64+ accelerator.
- Аккаунт: kimi.com — K3 с max reasoning по умолчанию.
- API key: Регистрация на platform.kimi.ai, включить billing.
- Client config: OpenAI SDK с
base_url=https://api.moonshot.ai/v1, modelkimi-k3. - Smoke test: Короткий coding prompt; baseline latency/quality vs Claude/GPT.
- OpenRouter: Model ID
moonshotai/kimi-k3, official pricing без markup. - Production pipeline: Cache-friendly prompt structure; agent logs для audit; CI runner на native macOS вместо VM для Metal/Core ML tool integration.
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Analyze this codebase..."}]
)
print(response.choices[0].message.content)
SECTION 07 Матрица сценариев и open weights 27 июля 2026
| Сценарий | Выбор | Почему |
|---|---|---|
| Long-horizon coding (SWE Marathon) | Kimi K3 | #1 benchmark, 1M context |
| Complex repo bugfixes | Claude Fable 5 | FrontierSWE 86,6 |
| Terminal/tool agents | GPT-5.6 Sol | Terminal Bench 88,8 |
| Multimodal documents | Kimi K3 | OmniDocBench 91,1 |
| Cost-sensitive | DeepSeek V4 Pro | Output $3,48/M |
| Self-host open weights | Kimi K3 (с 27.7.) | Крупнейшие open weights |
27 июля 2026 Moonshot публикует полные веса на Hugging Face — первый open model >2T, training с MXFP4/MXFP8. Ожидается Day-0 support в vLLM, SGLang, transformers. Вехи: 17–20 июля WAIC → 27 июля open weights.
SECTION 08 Цитируемые параметры, источники и вывод для разработчиков
- Параметры: 2,8T total; MoE 896/16 active; context 1 048 576 token.
- Architecture efficiency: KDA −75 % KV-cache, 6,3× decode at 1M; AttnRes +25 %; 2,5× scaling vs K2.
- Intelligence Index v4.1: 57,1 (4-е место среди frontier).
- API: $3/$15 за M; cache $0,30; >90 % hit rate в coding.
- Commercial: ARR >$300M; valuation $31,5B; open weights 27 июля 2026.
Верифицируемые источники — перепроверьте после релиза:
Moonshot AI: Kimi K3 Official Blog
Kimi API Platform Documentation
Artificial Analysis: Intelligence Index v4.1
OpenRouter: moonshotai/kimi-k3 Pricing
Для команд, интегрирующих Kimi K3 в Cursor, Kimi Code или custom agent pipeline, остаются три bottleneck: ① self-host до 27 июля невозможен — API dependency; ② macOS CI на VM с Metal/Core ML overhead и unstable tool-chain; ③ local Mac без 7×24 uptime для long-horizon agents. Cloud VM усугубляют latency и compatibility; API-only без dedicated build host усложняет reproducible agent tests. Для нулевого hypervisor overhead, стабильного iOS/macOS CI/CD и AI Agent automation физические cloud-ноды MACNOX обычно оптимальнее: 100 % Apple hardware, полный Root, гибкая аренда день/неделя/месяц. См. аренда vs покупка Mac Mini M4 и hardening AI Agent production.
SECTION 09 Часто задаваемые вопросы
Kimi K3 бесплатен?
Да на kimi.com с free account. API — pay-per-token ($3/$15 за 1M).
Можно ли запустить Kimi K3 локально?
С 27 июля 2026 с open weights. Production inference требует 64+ accelerator (например H100) — не laptop model.
Kimi K3 vs DeepSeek V4 Pro?
K3: вдвое больше параметров, 1M vs 128K context, сильнее coding benchmarks — но output $15/M vs $3,48/M у DeepSeek.
Практичен ли контекст 1M token?
Да для целых codebase, длинных research/legal документов и multi-session agents — flat pricing без length surcharge.
Когда появятся low/high reasoning modes?
Moonshot обещает subsequent updates — сейчас доступен только max effort.