2026 年 7 月 16 日深夜,月之暗面(Moonshot AI)悄然在 API 文档顶部挂上了「🎉 Kimi K3 已上线!」横幅——没有大型发布会,却带来 2.8 万亿参数的全球最大开源模型。AI 开发者与工程团队若正评估开源大模型选型,本文完整涵盖:模型定位与发布背景、KDA/AttnRes/Stable LatentMoE 架构、基准对照表、定价矩阵、四种接入方式与 6 步实操、场景选型、7 月 27 日权重开源承诺、可引用技术资料与 FAQ,协助你在 WAIC 窗口期做出接入判断。
SECTION 01 开源大模型选型痛点:参数规模、上下文与真实编程能力难以兼得
2026 年中,开源社群已有 DeepSeek V4 Pro、GLM-5.2 等强模型,但工程团队在实际落地时仍面临结构性矛盾:
- 上下文天花板:多数开源模型上下文仅 128K–256K,分析整个 Repo 或长篇法律/研究文档仍需分段切块,Agent 长期记忆容易断裂;
- 基准与实战脱节:SWE-bench 类短任务高分不等于「连续数小时写代码」的 SWE Marathon 表现,选型若只看单一 benchmark 容易踩坑;
- 推理成本隐性放大:MoE 模型虽稀疏激活,但百万 Token 上下文下 KV 缓存内存消耗仍可能拖垮自建推理集群;
- 开源时间差:API 先行、权重延后是常态,自部署团队需预留硬件采购与框架适配周期;
- 商业化反击窗口:月之暗面过去 18 个月受 DeepSeek 冲击,K3 发布恰逢 2026 世界人工智慧大会(WAIC)开幕前夜,具有明确战略信号——ARR 已突破 3 亿美元,今年完成第 6 轮融资,投前估值 315 亿美元,API 收入占七成以上,海外付费用户增长 400%。
Kimi K3 一句话定位:目前全球参数规模最大的开源 AI 模型——2.8T 参数,超越 DeepSeek V4 Pro(1.6T)近 75%,是小米开源模型(1.02T)的 2.7 倍;采用 896 专家 MoE(每次激活 16 个)、100 万 Token 上下文、原生视觉理解,定价对标 Claude Sonnet 5 却提供 5 倍上下文,完整权重将于 7 月 27 日开源。
SECTION 02 Kimi K3 是什么?规格速览与发布背景
过去 12 个月里,Kimi 系列模型有 9 个月占据开源模型规模上限的位置。K3 专为复杂编程、长文档推理、知识工作设计,推理时以最大力度(max effort)运行,支持文字、图像、视频输入。
| 项目 | 数值 |
|---|---|
| 總参数 | 2.8 万亿(2.8T) |
| 架构 | KDA + AttnRes + Stable LatentMoE |
| MoE 配置 | 896 专家,每次激活 16 个(稀疏度 1.8%) |
| 上下文 | 1,048,576 Token(1M) |
| API 模型 ID | kimi-k3 |
| 定价(API) | $3 / $15 每百万 Token(输入/输出) |
| 权重开源 | 2026 年 7 月 27 日(Hugging Face) |
SECTION 03 KDA、AttnRes、Stable LatentMoE:三大架构创新详解
Kimi Delta Attention(KDA)—— 重新设计注意力机制
传统 Transformer 全注意力在长上下文下计算量呈平方级增长,处理 100 万 Token 时 KV 缓存内存消耗极大。KDA 是混合线性注意力机制:
- 以 3:1 比例交替「线性注意力层」与「全注意力层」——3 个线性层处理局部序列(计算廉价),1 个全注意力层保留全局信息流;
- KV 缓存内存減少高达 75%;
- 百万 Token 上下文下解码速度提升高达 6.3 倍;
- 在短上下文、长上下文与强化学习扩展三种场景均超越纯全注意力基线。
Attention Residuals(AttnRes)—— 解决深度信息丢失
标准残差连接沿深度均匀累积信息,早期层关键表征在深层被稀释。AttnRes 引入选择性检索——模型可跨越深度直接拉取更早层的高价值表征,带来约 25% 训练效率提升,額外计算开销不足 2%。
Stable LatentMoE —— 超高稀疏度的稳定训练
896 专家中每次仅激活 16 个,路由与优化是首要挑战。Moonshot 配套技术包括:
| 技术 | 作用 |
|---|---|
| Quantile Balancing | 从路由器得分分位数直接推导专家分配,消除启发式超參 |
| Per-Head Muon | 针对每个注意力頭独立优化,使大规模训练更自適應 |
| Sigmoid Tanh Unit(SiTU) | 改进激活函数控制 |
| Gated MLA | 提升注意力选择性 |
| 整体效率 | 相较 Kimi K2 扩展效率提升约 2.5 倍 |
SECTION 04 Kimi K3 基准测试:编程、推理与视觉全面对照
以下为月之暗面自报基准(不同模型使用各自推理 harness:K3 用 Kimi Code,GPT 用 Codex,Claude 用 Claude Code)。独立第三方复现仍在进行,宜作方向性参考。
| 基准测试 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GLM-5.2 |
|---|---|---|---|---|---|
| DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 | 46.2 |
| Program Bench | 77.8 | 76.8 | 77.6 | 71.9 | 63.7 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 | 82.7 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 | 67.3 |
| SWE Marathon | 42.0 | 35.0 | 39.0 | 40.0 | 13.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 | — |
| Automation Bench | 30.8 | 29.1 | 29.7 | 27.2 | 12.9 |
| GPQA-Diamond | 93.5 | 92.6 | 94.1 | 91.0 | 91.2 |
| MMMU-Pro(视觉) | 81.6 | 81.2 | 83.0 | 78.9 | — |
| OmniDocBench(文档理解) | 91.1 | 89.8 | 85.8 | 87.9 | — |
解读重點:SWE Marathon 专测持續性长代码工作,K3 以 42.0 大幅领先;OmniDocBench 第一(91.1)体现视觉 + 长上下文协同;在 Artificial Analysis Intelligence Index v4.1 中 K3 以 57.1 分排名第四,紧随 Claude Fable 5(59.9)与 GPT-5.6 Sol(58.9)之后,差距仅 2.8 分。
SECTION 05 Kimi K3 API 定价:比 Opus 便宜,上下文是 Sonnet 的 5 倍
| 模型 | 输入 | 输出 | 缓存命中输入 | 上下文 |
|---|---|---|---|---|
| Kimi K3 | $3.00 | $15.00 | $0.30 | 1M |
| Claude Sonnet 5 | $3.00(促銷 $2) | $15.00(促銷 $10) | — | 200K |
| Claude Opus 4.8 | $5.00 | $25.00 | — | 200K |
| GPT-5.5 | $5.00 | $30.00 | — | 400K |
| DeepSeek V4 Pro | $1.74 | $3.48 | $0.145 | 128K |
| Kimi K2.6 | $0.95 | $4.00 | $0.16 | 256K |
- 定价对位:K3 与 Claude Sonnet 5 标准价持平($3/$15),上下文为其 5 倍;
- 缓存优势:缓存命中价低至 $0.30/M(标准价 1/10),月之暗面报告编程场景缓存命中率超 90%,实际有效输入成本极低;
- 对比 Opus 4.8:输入成本约 60%、输出约 40%,多项 benchmark 仍具竞争力;
- 国内 API:¥20/M(输入)、¥100/M(输出)、缓存命中 ¥2/M;Kimi.com 免费账号可用,預付费套餐 ¥199 起(优惠截至 8 月 11 日)。
SECTION 06 Kimi K3 怎么用?四种接入方式与 6 步实操指南
无论你是快速试用還是整合進 CI/CD 流水线,可按以下四种路径选择:
- 方法一:Kimi 网页/App——访问 kimi.com,以 Google 账号注册,K3 预设以最大推理力度运行;
- 方法二:官方 API——OpenAI 兼容接口,模型 ID 为
kimi-k3,在 platform.kimi.ai 取得 API Key; - 方法三:OpenRouter——模型 ID
moonshotai/kimi-k3,Moonshot 官方定价、無額外加价; - 方法四:7 月 27 日开源权重——完整权重將在 Hugging Face 開放,生產级部署需 64 張以上加速卡的超節點配置。
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "幫我分析這段代码..."}]
)
- 確認账号与額度:在 kimi.com 或 platform.kimi.ai 注册,核對 API 額度与計費方式(按 Token 後付或預付费套餐)。
- 取得 API Key:於 Moonshot 开发者控制台建立 Key,妥善保管,勿提交至公開 Repo。
- 設定 Base URL:使用
https://api.moonshot.ai/v1(OpenAI SDK 兼容),或在 OpenRouter 設定對應端點。 - 选择模型 ID:官方为
kimi-k3,OpenRouter 为moonshotai/kimi-k3;目前仅 max effort 模式,low/high 模式將在後續更新推出。 - 啟用缓存与长上下文:编程 Agent 场景建議保留系統提示与 Repo 結構摘要以提升缓存命中率;1M 上下文無长度加价,可一次性餵入完整代码庫索引。
- 規劃自部署硬件(7/27 後):若計畫本地或私有雲推理,提前评估 GPU 集群规模(64+ 加速卡超節點)、vLLM/SGLang 框架适配,以及Mac Mini M4 租 vs 買費用对比中討論的邊緣節點成本。
SECTION 07 场景选型矩阵:Kimi K3 vs Claude vs GPT vs DeepSeek
| 场景 | 推薦模型 | 原因 |
|---|---|---|
| 持續性长代码任务 | Kimi K3 | SWE Marathon 基准第一,上下文最长 |
| 复杂 Repo 级修 Bug | Claude Fable 5 | FrontierSWE 大幅领先 |
| 終端機/工具鏈密集型 Agent | GPT-5.6 Sol | Terminal Bench 与 Coding Agent Index 领先 |
| 超长文档/多模態文档理解 | Kimi K3 | OmniDocBench 第一,原生视觉 + 1M 上下文 |
| 成本敏感场景 | DeepSeek V4 Pro | 输出仅 $3.48/M,遠低於 K3 |
| 开源自部署(7/27 後) | Kimi K3 | 最强开源权重,2.8T 参数新纪录 |
SECTION 08 7 月 27 日开源承诺:开源社群最值得關注的时间節點
月之暗面在官方 WeChat 公告中明确承诺:2026 年 7 月 27 日開放完整模型权重。一旦权重開放,Kimi K3 將成为:
- 迄今参数最大的可下載开源模型;
- 首个超 2 万亿参数级別的开源权重;
- 开源社群训练/微調基座新標竿——模型以 MXFP4 权重与 MXFP8 激活训练,量化感知从设计階段即納入;
- Hugging Face 預計出現 MXFP4/NVFP4 量化版本,vLLM、SGLang、transformers 等主流推理框架預期 Day-0 支持。
關注时间軸:7 月 17–20 日 WAIC 上海(更多发布預計)→ 7 月 27 日 K3 完整权重开源。
SECTION 09 可引用技术资料与權威來源
- 参数规模:2.8T 總参数,896 专家 MoE(激活 16),超越 DeepSeek V4 Pro(1.6T)近 75%。
- 上下文:1,048,576 Token(约等于 5 本《紅樓夢》全文),flat 定价無长度加价。
- 架构效率:KDA 使 KV 缓存減少 75%、百万 Token 解码加速 6.3 倍;相较 K2 扩展效率提升 2.5 倍。
- 商業指標:ARR 突破 3 亿美元(2026 年 6 月),第 6 轮融资投前估值 315 亿美元,API 收入占 70%+。
- 整体智慧排名:Artificial Analysis Intelligence Index v4.1 得分 57.1,排名第四。
- 自部署門檻:生產级推理需 64+ 加速卡超節點,不適合筆電本地部署。
以下權威來源可在發版後再次開啟連結核對技术細節与基准资料:
Moonshot AI 官方技术博客:Kimi K3 发布说明
Artificial Analysis:Intelligence Index v4.1 模型排名
VentureBeat:Moonshot AI Kimi K3 open-source coverage
South China Morning Post:Kimi K3 Moonshot AI open-source report
Kimi K3 对 API 用户是模型选型升级,但对需要整合 Kimi Code Agent、macOS CI/CD 与 7×24 自动化测试的团队,仍有三类现实短板:① 7 月 27 日前无法自部署权重,私有云推理集群采购周期长;② 虚拟机跑 macOS CI 存在 Metal / Core ML 兼容与性能损耗;③ 本地 Mac 关机即断流,难以稳定跑 Agent 流水线。对于需要零损耗原生 Apple 算力、稳定 iOS CI/CD 与 AI Agent 自动化的生产环境,MACNOX 的云端物理 Mac 节点通常是更优解:100% 苹果原装物理机、开放完整 Root 权限、无 Hypervisor 损耗、按天/周/月弹性下单。可参考DeepSeek 自研芯片与算力布局、GPT-5.6 Sol Ultra 评测,以及Mac Mini M4 租 vs 买费用对比。
SECTION 10 常见问题 FAQ
Kimi K3 可以免费使用嗎?
可以——在 kimi.com 以免费账号即可试用,K3 预设以最大推理力度运行。API 使用則需付费 API Key,按 Token 計費($3/$15 每百万 Token)。
可以在本機跑 Kimi K3 嗎?
目前尚不行——完整权重将于 2026 年 7 月 27 日在 Hugging Face 釋出。釋出後生產级推理需 64 張以上加速卡(如 NVIDIA H100),2.8T 参数不適合一般筆電本地部署。
Kimi K3 与 DeepSeek V4 Pro 怎么選?
K3 参数近兩倍(2.8T vs 1.6T)、上下文大得多(1M vs 128K),编程与推理 benchmark 整体更强;但 DeepSeek V4 Pro 输出价仅 $3.48/M,成本敏感场景仍具优势。
100 万 Token 上下文真的實用嗎?
對分析完整代码庫、处理长篇研究或法律文档、以及維持多轮 Agent 长期记忆特別有用。flat 定价無长度加价,使实际使用完整上下文窗口成为可能。
low/high 推理力度模式何时推出?
Moonshot 表示 low 与 high effort 模式將在「後續更新」中推出,目前仅 max 模式可用。
基准测试资料可信嗎?
上述 benchmark 为月之暗面自报,各模型使用不同推理 harness,独立第三方复现仍在进行。建議作方向性参考,关键業務场景仍須自行 A/B 测试。