Главная / Блог / Kimi K3
ENGINEERING_BLOG · 2026.07.17

Kimi K3: обзор открытой модели
на 2,8 трлн параметров — вызов Claude и GPT

Ночью 16 июля 2026 Moonshot AI (月之暗面) тихо включила Kimi K3 — без пресс-конференции, но с 2,8 трлн параметров, крупнейшим open-source LLM на сегодня. Для инженеров, которые оценивают модели для coding-агентов, анализа monorepo или multimodal-документов, три вопроса решают выбор: догоняет ли Claude Fable 5 и GPT-5.6 Sol? Сколько стоит API? Когда выйдут веса? Этот разбор покрывает стратегический контекст, архитектуру KDA/AttnRes/MoE, полную матрицу бенчмарков, цены, 4 способа доступа, 6 шагов подключения, матрицу сценариев, open weights 27 июля, цитируемые параметры и FAQ — с акцентом на inference pipeline, KV-cache и последствия для macOS CI.

SECTION 01 Почему Kimi K3 важен сейчас: контекст, стоимость и vendor lock-in

K3 закрывает три типичных bottleneck в production LLM-стеках:

  • Потолок контекста: Большинство flagship-моделей ограничены 128K–400K token — monorepo требует chunking, потери state и дорогих re-prompt.
  • Long-horizon coding: SWE Marathon измеряет многочасовую agent-работу; многие модели «ломаются» в tool-loop.
  • Закрытые API: Без open weights нет fine-tuning, on-prem и полного audit trail — до 27 июля только cloud inference.
  • Бюджет output: Claude Opus 4.8 — $5/$25 за 1M token; см. разбор цен Grok 4.5 для контекста рынка.

Core specs: MoE 896 experts, 16 active; контекст 1 048 576 token; native vision (text/image/video); model ID kimi-k3; reasoning сейчас только max effort; полные веса 27 июля 2026 на Hugging Face.

Сравнение размера — open-source flagship
Модель Параметры Контекст
Kimi K3 2,8T 1M
DeepSeek V4 Pro 1,6T 128K
Xiaomi Open Model 1,02T
Alibaba Qwen (open) 397B

SECTION 02 Стратегический контекст: WAIC, ARR $300M и comeback Moonshot

  • Size record: 9 из 12 месяцев Kimi держала рекord largest open model; K3 опережает DeepSeek V4 Pro на ~75 %.
  • WAIC 2026: Релиз накануне World AI Conference в Shanghai — сильный сигнал рынку.
  • Commercial traction: ARR >$300M (июнь 2026); 6-й раунд при $31,5B pre-money; API >70 % revenue; overseas paid users +400 %.
  • Metal/Core ML: Для интеграции agent-pipeline с Xcode и локальными tools нативный macOS host критичен — VM дают overhead на Metal-шейдерах и Core ML compile chain.

SECTION 03 Архитектура: KDA, AttnRes и Stable LatentMoE

K3 — не просто scale-up. Три engineering-инновации решают реальные проблемы inference и training:

Kimi Delta Attention (KDA): Hybrid linear attention в ratio 3:1 (три linear layer, один full attention). Эффект: KV-cache до −75 %, decoding при 1M token до 6,3× быстрее, без trade-off на short/long context и RL.

Attention Residuals (AttnRes): Selective retrieval через depth вместо uniform residual accumulation — ~+25 % training efficiency при <2 % extra compute.

Stable LatentMoE: 896 experts, 16 active (sparsity 1,8 %). Стабилизаторы:

MoE-стабилизация в Kimi K3
Техника Роль
Quantile Balancing Expert allocation из router quantiles — меньше fragile heuristics
Per-Head Muon Head-level optimization для stable large-scale training
SiTU (Sigmoid Tanh Unit) Улучшенный activation control
Gated MLA Выше attention selectivity
Итого vs Kimi K2 ~2,5× лучше scaling efficiency

SECTION 04 Бенчмарки: coding, reasoning и vision

Данные self-reported Moonshot (16 июля 2026). Разные harness: K3 — Kimi Code, GPT — Codex, Claude — Claude Code. Независимые reproductions в процессе.

Coding benchmarks — Kimi K3 vs frontier
Benchmark Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8
DeepSWE 67,5 70,0 73,0 59,0
Program Bench 77,8 76,8 77,6 71,9
Terminal Bench 2.1 88,3 84,6 88,8 84,6
FrontierSWE 81,2 86,6 71,3 66,7
SWE Marathon 42,0 35,0 39,0 40,0
BrowseComp 91,2 88,0 90,4 84,3
Automation Bench 30,8 29,1 29,7 27,2
GPQA-Diamond 93,5 92,6 94,1 91,0
MMMU-Pro (vision) 81,6 81,2 83,0 78,9
OmniDocBench 91,1 89,8 85,8 87,9

SWE Marathon — ключевой индикатор long-horizon coding: K3 лидирует с 42,0. Artificial Analysis Intelligence Index v4.1: K3 = 57,1 (4-е место), Fable 5 = 59,9, GPT-5.6 Sol = 58,9 — разрыв 2,8 пункта.

SECTION 05 API pricing: $3/$15, cache-hit и тарифы Китая

Сравнение цен за 1M token
Модель Input Output Cache input Контекст
Kimi K3 $3,00 $15,00 $0,30 1M
Claude Sonnet 5 $3,00 $15,00 200K
Claude Opus 4.8 $5,00 $25,00 200K
GPT-5.5 $5,00 $30,00 400K
DeepSeek V4 Pro $1,74 $3,48 $0,145 128K
Kimi K2.6 $0,95 $4,00 $0,16 256K

K3 совпадает с Sonnet standard, но даёт 5× контекст. Moonshot сообщает >90 % cache hit в Kimi Code workflows (Mooncake split-inference) — effective input ~$0,55/M. Китай: ¥20/¥100 за M, cache ¥2/M; consumer от ¥199 (до 11 августа).

SECTION 06 6 шагов подключения Kimi K3 (4 способа доступа)

Четыре пути: (1) kimi.com web/app — free с Google login; (2) Moonshot API — OpenAI-compatible; (3) OpenRouter moonshotai/kimi-k3; (4) self-host после 27 июля — 64+ accelerator.

  1. Аккаунт: kimi.com — K3 с max reasoning по умолчанию.
  2. API key: Регистрация на platform.kimi.ai, включить billing.
  3. Client config: OpenAI SDK с base_url=https://api.moonshot.ai/v1, model kimi-k3.
  4. Smoke test: Короткий coding prompt; baseline latency/quality vs Claude/GPT.
  5. OpenRouter: Model ID moonshotai/kimi-k3, official pricing без markup.
  6. Production pipeline: Cache-friendly prompt structure; agent logs для audit; CI runner на native macOS вместо VM для Metal/Core ML tool integration.
kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Analyze this codebase..."}]
)
print(response.choices[0].message.content)

SECTION 07 Матрица сценариев и open weights 27 июля 2026

Выбор модели по use case
Сценарий Выбор Почему
Long-horizon coding (SWE Marathon) Kimi K3 #1 benchmark, 1M context
Complex repo bugfixes Claude Fable 5 FrontierSWE 86,6
Terminal/tool agents GPT-5.6 Sol Terminal Bench 88,8
Multimodal documents Kimi K3 OmniDocBench 91,1
Cost-sensitive DeepSeek V4 Pro Output $3,48/M
Self-host open weights Kimi K3 (с 27.7.) Крупнейшие open weights

27 июля 2026 Moonshot публикует полные веса на Hugging Face — первый open model >2T, training с MXFP4/MXFP8. Ожидается Day-0 support в vLLM, SGLang, transformers. Вехи: 17–20 июля WAIC → 27 июля open weights.

SECTION 08 Цитируемые параметры, источники и вывод для разработчиков

  • Параметры: 2,8T total; MoE 896/16 active; context 1 048 576 token.
  • Architecture efficiency: KDA −75 % KV-cache, 6,3× decode at 1M; AttnRes +25 %; 2,5× scaling vs K2.
  • Intelligence Index v4.1: 57,1 (4-е место среди frontier).
  • API: $3/$15 за M; cache $0,30; >90 % hit rate в coding.
  • Commercial: ARR >$300M; valuation $31,5B; open weights 27 июля 2026.

Верифицируемые источники — перепроверьте после релиза:

Moonshot AI: Kimi K3 Official Blog

Kimi API Platform Documentation

Artificial Analysis: Intelligence Index v4.1

OpenRouter: moonshotai/kimi-k3 Pricing

Для команд, интегрирующих Kimi K3 в Cursor, Kimi Code или custom agent pipeline, остаются три bottleneck: ① self-host до 27 июля невозможен — API dependency; ② macOS CI на VM с Metal/Core ML overhead и unstable tool-chain; ③ local Mac без 7×24 uptime для long-horizon agents. Cloud VM усугубляют latency и compatibility; API-only без dedicated build host усложняет reproducible agent tests. Для нулевого hypervisor overhead, стабильного iOS/macOS CI/CD и AI Agent automation физические cloud-ноды MACNOX обычно оптимальнее: 100 % Apple hardware, полный Root, гибкая аренда день/неделя/месяц. См. аренда vs покупка Mac Mini M4 и hardening AI Agent production.

SECTION 09 Часто задаваемые вопросы

Kimi K3 бесплатен?

Да на kimi.com с free account. API — pay-per-token ($3/$15 за 1M).

Можно ли запустить Kimi K3 локально?

С 27 июля 2026 с open weights. Production inference требует 64+ accelerator (например H100) — не laptop model.

Kimi K3 vs DeepSeek V4 Pro?

K3: вдвое больше параметров, 1M vs 128K context, сильнее coding benchmarks — но output $15/M vs $3,48/M у DeepSeek.

Практичен ли контекст 1M token?

Да для целых codebase, длинных research/legal документов и multi-session agents — flat pricing без length surcharge.

Когда появятся low/high reasoning modes?

Moonshot обещает subsequent updates — сейчас доступен только max effort.