首页 / 博客 / Kimi K3
ENGINEERING_BLOG · 2026.07.17

Kimi K3 深度评测:
2.8 万亿参数,国产开源大模型新纪录

2026 年 7 月 16 日深夜,月之暗面(Moonshot AI)悄然在 API 文档顶部挂上了「🎉 Kimi K3 已上线!」横幅——没有大型发布会,却带来 2.8 万亿参数的全球最大开源模型。AI 开发者与工程团队若正评估开源大模型选型,本文完整涵盖:模型定位与发布背景、KDA/AttnRes/Stable LatentMoE 架构、基准对照表、定价矩阵、四种接入方式与 6 步实操、场景选型、7 月 27 日权重开源承诺、可引用技术资料与 FAQ,协助你在 WAIC 窗口期做出接入判断。

SECTION 01 开源大模型选型痛点:参数规模、上下文与真实编程能力难以兼得

2026 年中,开源社群已有 DeepSeek V4 Pro、GLM-5.2 等强模型,但工程团队在实际落地时仍面临结构性矛盾:

  • 上下文天花板:多数开源模型上下文仅 128K–256K,分析整个 Repo 或长篇法律/研究文档仍需分段切块,Agent 长期记忆容易断裂;
  • 基准与实战脱节:SWE-bench 类短任务高分不等于「连续数小时写代码」的 SWE Marathon 表现,选型若只看单一 benchmark 容易踩坑;
  • 推理成本隐性放大:MoE 模型虽稀疏激活,但百万 Token 上下文下 KV 缓存内存消耗仍可能拖垮自建推理集群;
  • 开源时间差:API 先行、权重延后是常态,自部署团队需预留硬件采购与框架适配周期;
  • 商业化反击窗口:月之暗面过去 18 个月受 DeepSeek 冲击,K3 发布恰逢 2026 世界人工智慧大会(WAIC)开幕前夜,具有明确战略信号——ARR 已突破 3 亿美元,今年完成第 6 轮融资,投前估值 315 亿美元,API 收入占七成以上,海外付费用户增长 400%。

Kimi K3 一句话定位:目前全球参数规模最大的开源 AI 模型——2.8T 参数,超越 DeepSeek V4 Pro(1.6T)近 75%,是小米开源模型(1.02T)的 2.7 倍;采用 896 专家 MoE(每次激活 16 个)、100 万 Token 上下文、原生视觉理解,定价对标 Claude Sonnet 5 却提供 5 倍上下文,完整权重将于 7 月 27 日开源。

SECTION 02 Kimi K3 是什么?规格速览与发布背景

过去 12 个月里,Kimi 系列模型有 9 个月占据开源模型规模上限的位置。K3 专为复杂编程、长文档推理、知识工作设计,推理时以最大力度(max effort)运行,支持文字、图像、视频输入。

Kimi K3 核心规格
项目 数值
總参数 2.8 万亿(2.8T)
架构 KDA + AttnRes + Stable LatentMoE
MoE 配置 896 专家,每次激活 16 个(稀疏度 1.8%)
上下文 1,048,576 Token(1M)
API 模型 ID kimi-k3
定价(API) $3 / $15 每百万 Token(输入/输出)
权重开源 2026 年 7 月 27 日(Hugging Face)

SECTION 03 KDA、AttnRes、Stable LatentMoE:三大架构创新详解

Kimi Delta Attention(KDA)—— 重新设计注意力机制

传统 Transformer 全注意力在长上下文下计算量呈平方级增长,处理 100 万 Token 时 KV 缓存内存消耗极大。KDA 是混合线性注意力机制

  • 3:1 比例交替「线性注意力层」与「全注意力层」——3 个线性层处理局部序列(计算廉价),1 个全注意力层保留全局信息流;
  • KV 缓存内存減少高达 75%
  • 百万 Token 上下文下解码速度提升高达 6.3 倍
  • 在短上下文、长上下文与强化学习扩展三种场景均超越纯全注意力基线。

Attention Residuals(AttnRes)—— 解决深度信息丢失

标准残差连接沿深度均匀累积信息,早期层关键表征在深层被稀释。AttnRes 引入选择性检索——模型可跨越深度直接拉取更早层的高价值表征,带来约 25% 训练效率提升,額外计算开销不足 2%。

Stable LatentMoE —— 超高稀疏度的稳定训练

896 专家中每次仅激活 16 个,路由与优化是首要挑战。Moonshot 配套技术包括:

Stable LatentMoE 配套技术
技术 作用
Quantile Balancing 从路由器得分分位数直接推导专家分配,消除启发式超參
Per-Head Muon 针对每个注意力頭独立优化,使大规模训练更自適應
Sigmoid Tanh Unit(SiTU) 改进激活函数控制
Gated MLA 提升注意力选择性
整体效率 相较 Kimi K2 扩展效率提升约 2.5 倍

SECTION 04 Kimi K3 基准测试:编程、推理与视觉全面对照

以下为月之暗面自报基准(不同模型使用各自推理 harness:K3 用 Kimi Code,GPT 用 Codex,Claude 用 Claude Code)。独立第三方复现仍在进行,宜作方向性参考。

Kimi K3 与前沿閉源模型基准对照
基准测试 Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8 GLM-5.2
DeepSWE 67.5 70.0 73.0 59.0 46.2
Program Bench 77.8 76.8 77.6 71.9 63.7
Terminal Bench 2.1 88.3 84.6 88.8 84.6 82.7
FrontierSWE 81.2 86.6 71.3 66.7 67.3
SWE Marathon 42.0 35.0 39.0 40.0 13.0
BrowseComp 91.2 88.0 90.4 84.3
Automation Bench 30.8 29.1 29.7 27.2 12.9
GPQA-Diamond 93.5 92.6 94.1 91.0 91.2
MMMU-Pro(视觉) 81.6 81.2 83.0 78.9
OmniDocBench(文档理解) 91.1 89.8 85.8 87.9

解读重點:SWE Marathon 专测持續性长代码工作,K3 以 42.0 大幅领先;OmniDocBench 第一(91.1)体现视觉 + 长上下文协同;在 Artificial Analysis Intelligence Index v4.1 中 K3 以 57.1 分排名第四,紧随 Claude Fable 5(59.9)与 GPT-5.6 Sol(58.9)之后,差距仅 2.8 分。

SECTION 05 Kimi K3 API 定价:比 Opus 便宜,上下文是 Sonnet 的 5 倍

主流模型 API 定价对照(每百万 Token)
模型 输入 输出 缓存命中输入 上下文
Kimi K3 $3.00 $15.00 $0.30 1M
Claude Sonnet 5 $3.00(促銷 $2) $15.00(促銷 $10) 200K
Claude Opus 4.8 $5.00 $25.00 200K
GPT-5.5 $5.00 $30.00 400K
DeepSeek V4 Pro $1.74 $3.48 $0.145 128K
Kimi K2.6 $0.95 $4.00 $0.16 256K
  • 定价对位:K3 与 Claude Sonnet 5 标准价持平($3/$15),上下文为其 5 倍;
  • 缓存优势:缓存命中价低至 $0.30/M(标准价 1/10),月之暗面报告编程场景缓存命中率超 90%,实际有效输入成本极低;
  • 对比 Opus 4.8:输入成本约 60%、输出约 40%,多项 benchmark 仍具竞争力;
  • 国内 API:¥20/M(输入)、¥100/M(输出)、缓存命中 ¥2/M;Kimi.com 免费账号可用,預付费套餐 ¥199 起(优惠截至 8 月 11 日)。

SECTION 06 Kimi K3 怎么用?四种接入方式与 6 步实操指南

无论你是快速试用還是整合進 CI/CD 流水线,可按以下四种路径选择:

  • 方法一:Kimi 网页/App——访问 kimi.com,以 Google 账号注册,K3 预设以最大推理力度运行;
  • 方法二:官方 API——OpenAI 兼容接口,模型 ID 为 kimi-k3,在 platform.kimi.ai 取得 API Key;
  • 方法三:OpenRouter——模型 ID moonshotai/kimi-k3,Moonshot 官方定价、無額外加价;
  • 方法四:7 月 27 日开源权重——完整权重將在 Hugging Face 開放,生產级部署需 64 張以上加速卡的超節點配置。
kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "幫我分析這段代码..."}]
)
  1. 確認账号与額度:在 kimi.com 或 platform.kimi.ai 注册,核對 API 額度与計費方式(按 Token 後付或預付费套餐)。
  2. 取得 API Key:於 Moonshot 开发者控制台建立 Key,妥善保管,勿提交至公開 Repo。
  3. 設定 Base URL:使用 https://api.moonshot.ai/v1(OpenAI SDK 兼容),或在 OpenRouter 設定對應端點。
  4. 选择模型 ID:官方为 kimi-k3,OpenRouter 为 moonshotai/kimi-k3;目前仅 max effort 模式,low/high 模式將在後續更新推出。
  5. 啟用缓存与长上下文:编程 Agent 场景建議保留系統提示与 Repo 結構摘要以提升缓存命中率;1M 上下文無长度加价,可一次性餵入完整代码庫索引。
  6. 規劃自部署硬件(7/27 後):若計畫本地或私有雲推理,提前评估 GPU 集群规模(64+ 加速卡超節點)、vLLM/SGLang 框架适配,以及Mac Mini M4 租 vs 買費用对比中討論的邊緣節點成本。

SECTION 07 场景选型矩阵:Kimi K3 vs Claude vs GPT vs DeepSeek

依使用场景选择模型
场景 推薦模型 原因
持續性长代码任务 Kimi K3 SWE Marathon 基准第一,上下文最长
复杂 Repo 级修 Bug Claude Fable 5 FrontierSWE 大幅领先
終端機/工具鏈密集型 Agent GPT-5.6 Sol Terminal Bench 与 Coding Agent Index 领先
超长文档/多模態文档理解 Kimi K3 OmniDocBench 第一,原生视觉 + 1M 上下文
成本敏感场景 DeepSeek V4 Pro 输出仅 $3.48/M,遠低於 K3
开源自部署(7/27 後) Kimi K3 最强开源权重,2.8T 参数新纪录

SECTION 08 7 月 27 日开源承诺:开源社群最值得關注的时间節點

月之暗面在官方 WeChat 公告中明确承诺:2026 年 7 月 27 日開放完整模型权重。一旦权重開放,Kimi K3 將成为:

  • 迄今参数最大的可下載开源模型;
  • 首个超 2 万亿参数级別的开源权重;
  • 开源社群训练/微調基座新標竿——模型以 MXFP4 权重与 MXFP8 激活训练,量化感知从设计階段即納入;
  • Hugging Face 預計出現 MXFP4/NVFP4 量化版本,vLLM、SGLang、transformers 等主流推理框架預期 Day-0 支持。

關注时间軸:7 月 17–20 日 WAIC 上海(更多发布預計)→ 7 月 27 日 K3 完整权重开源。

SECTION 09 可引用技术资料与權威來源

  • 参数规模:2.8T 總参数,896 专家 MoE(激活 16),超越 DeepSeek V4 Pro(1.6T)近 75%。
  • 上下文:1,048,576 Token(约等于 5 本《紅樓夢》全文),flat 定价無长度加价。
  • 架构效率:KDA 使 KV 缓存減少 75%、百万 Token 解码加速 6.3 倍;相较 K2 扩展效率提升 2.5 倍。
  • 商業指標:ARR 突破 3 亿美元(2026 年 6 月),第 6 轮融资投前估值 315 亿美元,API 收入占 70%+。
  • 整体智慧排名:Artificial Analysis Intelligence Index v4.1 得分 57.1,排名第四。
  • 自部署門檻:生產级推理需 64+ 加速卡超節點,不適合筆電本地部署。

以下權威來源可在發版後再次開啟連結核對技术細節与基准资料:

Moonshot AI 官方技术博客:Kimi K3 发布说明

Kimi API Platform 官方文档

Artificial Analysis:Intelligence Index v4.1 模型排名

VentureBeat:Moonshot AI Kimi K3 open-source coverage

South China Morning Post:Kimi K3 Moonshot AI open-source report

Kimi K3 对 API 用户是模型选型升级,但对需要整合 Kimi Code Agent、macOS CI/CD 与 7×24 自动化测试的团队,仍有三类现实短板:① 7 月 27 日前无法自部署权重,私有云推理集群采购周期长;② 虚拟机跑 macOS CI 存在 Metal / Core ML 兼容与性能损耗;③ 本地 Mac 关机即断流,难以稳定跑 Agent 流水线。对于需要零损耗原生 Apple 算力、稳定 iOS CI/CD 与 AI Agent 自动化的生产环境,MACNOX 的云端物理 Mac 节点通常是更优解:100% 苹果原装物理机、开放完整 Root 权限、无 Hypervisor 损耗、按天/周/月弹性下单。可参考DeepSeek 自研芯片与算力布局GPT-5.6 Sol Ultra 评测,以及Mac Mini M4 租 vs 买费用对比

SECTION 10 常见问题 FAQ

Kimi K3 可以免费使用嗎?

可以——在 kimi.com 以免费账号即可试用,K3 预设以最大推理力度运行。API 使用則需付费 API Key,按 Token 計費($3/$15 每百万 Token)。

可以在本機跑 Kimi K3 嗎?

目前尚不行——完整权重将于 2026 年 7 月 27 日在 Hugging Face 釋出。釋出後生產级推理需 64 張以上加速卡(如 NVIDIA H100),2.8T 参数不適合一般筆電本地部署。

Kimi K3 与 DeepSeek V4 Pro 怎么選?

K3 参数近兩倍(2.8T vs 1.6T)、上下文大得多(1M vs 128K),编程与推理 benchmark 整体更强;但 DeepSeek V4 Pro 输出价仅 $3.48/M,成本敏感场景仍具优势。

100 万 Token 上下文真的實用嗎?

對分析完整代码庫、处理长篇研究或法律文档、以及維持多轮 Agent 长期记忆特別有用。flat 定价無长度加价,使实际使用完整上下文窗口成为可能。

low/high 推理力度模式何时推出?

Moonshot 表示 low 与 high effort 模式將在「後續更新」中推出,目前仅 max 模式可用。

基准测试资料可信嗎?

上述 benchmark 为月之暗面自报,各模型使用不同推理 harness,独立第三方复现仍在进行。建議作方向性参考,关键業務场景仍須自行 A/B 测试。