7月27日晚23点左右,月之暗面(Moonshot AI)正式发布 Kimi K3 的完整模型权重与技术报告,并同步开源支撑其训练的三项核心基础设施:MoonEP、FlashKDA、AgentEnv。这是全球首个被完整开放的 3 万亿参数级别模型——2.8 万亿总参数、约 1040 亿激活参数、100 万 token 上下文、原生视觉理解,权重文件在 Hugging Face 上约 1.56TB,上线半小时内登顶趋势榜第一。本文面向评估 K3 接入与自部署的 AI 开发者与企业技术团队,系统解读架构创新、跑分对照、许可证两道商业门槛,以及 API 与硬件的现实路径。
SECTION 01 Kimi K3 选型痛点:「开源」误读、许可证陷阱与自部署门槛
7 月 27 日权重落地后,开发者社区最常见的误判包括:
- 把「开放权重」当「开源」:月之暗面官方材料从未使用 open source,只称 open weight;训练数据与完整训练代码并未公开,不符合 OSI 标准;
- 沿用 K2 时代的 Modified MIT 印象:K3 许可证已改为完全自定义文件,新增 Model-as-a-Service 收入门槛与规模展示门槛,与 此前 7 月 22 日预告文中的表述已有差异;
- 低估自部署硬件成本:896 个路由专家、1.56TB 权重体积决定了消费级硬件几乎不可能跑通,官方建议 64 卡及以上超节点;
- 只看厂商自报跑分:不同评测框架差异极大,须优先引用 Vals AI、Artificial Analysis 等独立第三方复测;
- 忽视地缘与合规背景:权重开源恰逢中美「模型蒸馏」争端升级,企业选型须同步评估政策风险,可参考 Kimi K3 蒸馏门专题。
距离 Kimi K3 在 kimi.com 和 API 端首发,到 7 月 27 日全面开放权重,只过去了 11 天——这是国产大模型竞争进入「3T 俱乐部」阶段的重要信号。
SECTION 02 Kimi K3 发布时间线与核心参数一览
- 7月16日夜(WAIC 2026 前夜):Kimi K3 在 kimi.com、Kimi Work、Kimi Code 及 API 首发,权重尚未公开;
- 7月17日:行业密集分析架构,新华社报道称其为「目前全球参数最大的开源模型」;
- 7月22日–23日:中美「模型蒸馏」争端升级,美方指控月之暗面对 Anthropic Fable 模型进行工业化蒸馏;
- 7月27日晚23点:正式发布完整权重、技术报告,开源 MoonEP、AgentEnv(FlashKDA 此前已开源);
- 7月28日:中国商务部公开回应美方「AI 霸权主义」指控;阿里巴巴发布 24 万亿参数 Qwen3.8-Max-Preview,被外界解读为对 K3 的直接回应。
| 项目 | 参数 |
|---|---|
| 总参数量 | 2.8 万亿(2.8T) |
| 激活参数量 | 约 1040 亿 |
| 架构类型 | 混合专家模型(MoE),896 路由专家,每 token 激活 16 个 |
| 注意力机制 | Kimi Delta Attention(KDA)+ 门控多头潜在注意力(Gated MLA) |
| 上下文窗口 | 100 万 token |
| 多模态 | 原生视觉理解(ViT-V2,27 层) |
| 权重格式 | MXFP4 权重 + MXFP8 激活(SFT 阶段起量化感知训练) |
| 权重体积 | 约 1.56TB(Hugging Face) |
| License | 自定义许可证(官方称 open weight,非 open source) |
SECTION 03 KDA、AttnRes 与 Per-Head Muon:Kimi K3 三大架构创新
Kimi K3 重构了深度学习沿用多年的三大传统组件——注意力机制、残差连接、优化器,这也是它区别于「简单堆参数」的关键。
Kimi Delta Attention(KDA):传统 Gated DeltaNet 使用标量级遗忘门,KDA 改为逐通道门控——每个特征维度拥有独立衰减率,某些特征长期保留、另一些快速遗忘。采用 chunkwise 的 Diagonal-Plus-Low-Rank(DPLR)公式实现线性时间递归,与少量全局 Gated MLA 层交替混合,支撑 100 万 token 上下文同时将 KV Cache 开销压到极低。
Attention Residuals(AttnRes):传统残差连接逐层均匀累加,深层网络早期信息易被稀释。AttnRes 改为选择性、依据输入动态聚合前面所有层的输出,每层仅新增一个 RMSNorm 和一个伪查询向量,带来约 25% 训练效率提升,代价不到 2%。
Per-Head Muon:在 Muon 优化器基础上做逐注意力头独立优化,让每个头拥有更自适应的收敛路径。配合 Stable LatentMoE(896 选 16,稀疏度约 1.8%)与 Quantile Balancing 均衡策略,从数学上证明每个计算节点冗余专家数的理论上界。
SECTION 04 MoonEP、FlashKDA、AgentEnv 与跑分对照
| 技术 | 定位 | 关键能力 |
|---|---|---|
| MoonEP | 超大规模细粒度 MoE 通信库 | 临时复制过载专家,保证每节点均等 token 数,证明冗余专家数理论上界 |
| FlashKDA | 基于 CUTLASS 的 KDA 高性能算子 | H20 上 prefill 比 flash-linear-attention 基线快 1.72–2.22 倍,可作为 chunk_kda 直接替代后端 |
| AgentEnv | 与 KVCache.ai 联合开发的 Agent 沙箱 | 基于 Firecracker microVM,checkpoint 延迟低至 133ms,恢复 49ms,内存超分最高 6.5 倍 |
SWE-bench Verified(独立复测,Vals AI,截至 2026 年 7 月):
| 模型 | 分数 | 发布日期 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| Qwen3.7-Max | 79.4% | 2026-05-19 |
Artificial Analysis 智能指数(max 推理档):Kimi K3 约 57,全球第 3、开源模型第 1,仅次于 Claude Fable 5(60)与 GPT-5.6 Sol(59)。每任务成本约 $0.95,比 Claude Fable 5(约 $2.4)便宜 60%,但比 GLM-5.2(约 $0.47)更贵——开源阵营能力天花板最高,而非性价比最优。K3 目前在 Arena.ai Frontend Code Arena 榜单排名第一。
SECTION 05 Kimi K3 许可证、API 定价与 6 步接入清单
许可证包含两道此前 K2 系列没有的商业门槛:
- Model-as-a-Service 收入门槛:若运营模型即服务业务且连续 12 个月累计收入超过 2000 万美元,须与月之暗面另行签署商业协议;
- 规模展示门槛:若产品月活超过 1 亿或月收入超过 2000 万美元,须在界面显著展示「Kimi K3」字样。
| Token 类型 | 价格 |
|---|---|
| 输入(缓存命中) | $0.30 |
| 输入(缓存未命中) | $3.00 |
| 输出(含推理过程) | $15.00 |
Mooncake 分离式推理架构在典型编程类工作负载上缓存命中率可达 90% 以上,实际成本更接近 $0.30 档。自部署需 64 卡及以上超节点,个人与中小团队更现实的路径是通过官方 API 或 OpenRouter 等第三方平台调用。
- 确认许可合规:阅读 K3 自定义许可证全文,评估 MaaS 收入门槛与规模展示条款是否适用于你的业务;
- 选择接入路径:API(OpenAI SDK 兼容,base URL
https://api.moonshot.ai/v1,模型 IDkimi-k3)或 OpenRouter 等第三方托管; - 配置 API 密钥:在 Moonshot 控制台创建密钥,替换现有项目中的 base URL 与 API key;
- 测试缓存命中率:对编程类 Agent 工作负载做小规模压测,观察 Mooncake 缓存命中对实际成本的影响;
- 评估自部署可行性:若需本地推理,确认 GPU 集群规模(官方建议 64 卡+)与 1.56TB 权重存储;
- 集成 Infra 工具链:若做 MoE 训练或 KDA 加速,分别评估 MoonEP、FlashKDA(chunk_kda 直接替代)与 AgentEnv 沙箱的适用场景。
# OpenAI SDK 兼容调用示例
from openai import OpenAI
client = OpenAI(
api_key="YOUR_MOONSHOT_API_KEY",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Explain Kimi Delta Attention in 3 sentences."}]
)
print(response.choices[0].message.content)
SECTION 06 可引用技术数据与选型结论
- 总参数量 2.8T / 激活约 104B:全球最大完整开放权重模型,Hugging Face 下载约 1.56TB;
- SWE-bench Verified 93.4%:Vals AI 独立复测,开源阵营第一,距 Claude Opus 5(97%)差 3.6 个百分点;
- Artificial Analysis 智能指数约 57:全球第三、开源第一,每任务成本 $0.95;
- FlashKDA prefill 加速 1.72–2.22×:NVIDIA H20 上相对 flash-linear-attention 基线;
- AgentEnv checkpoint 133ms / 恢复 49ms:官方披露数据,尚未经第三方独立复现。
以下链接为官方与第三方来源,发版后请以最新页面为准:
Hugging Face:moonshotai 组织页面(K3 权重下载)
若你的团队计划基于 K3 构建 Agent 流水线,虚拟化 Mac 环境在 Xcode 编译、Metal 加速与 iOS CI 场景下存在性能损耗与兼容性风险,长期稳定性也不如物理节点。对于需要零损耗原生算力、稳定 iOS CI/CD 与 AI Agent 7×24 自动化的生产环境,MACNOX 的云端物理节点通常是更优解:100% 苹果原装物理机、开放完整 Root 权限、无 Hypervisor 损耗、按天/周/月弹性下单。更多 K3 背景可参考 Kimi K3 深度评测与 OpenRouter 7 月排行榜分析。
SECTION 07 常见问题 FAQ
Kimi K3 真的是开源模型吗?
严格来说不是。它属于「开放权重(open weight)」模型:训练完成的权重文件、技术报告和部分 Infra 工具是公开的,但训练数据和完整训练代码没有公开,不符合 OSI 标准下的「开源」定义。
Kimi K3 可以免费商用吗?
可以,绝大多数商业场景不受限制。但如果你运营的是「模型即服务」业务且年收入超过 2000 万美元,或产品月活超过 1 亿/月收入超过 2000 万美元,需要额外满足许可证中的特定条款。
Kimi K3 需要多少显卡才能自己部署?
官方建议部署在 64 卡及以上的超节点集群,个人和大部分企业用户更现实的方式是通过官方 API 或 OpenRouter 等第三方平台调用。
Kimi K3 的性能到底强不强?
在开源模型阵营中综合能力最强,Artificial Analysis 智能指数全球第 3,仅次于 Claude Fable 5 和 GPT-5.6 Sol;但成本高于同为开源的 GLM-5.2,属于「开源阵营天花板最高、但非性价比最优」的选择。
Kimi K3 和 Kimi K2 有什么区别?
K3 参数规模是 K2.5 的约 3 倍,架构上新增了 Attention Residuals 和 Per-Head Muon,上下文窗口和多模态能力也大幅提升;许可证方面 K3 新增了 Model-as-a-Service 收入门槛,商业限制比 K2 系列更细化。