首頁 / 部落格 / Kimi K3
ENGINEERING_BLOG · 2026.07.28

Kimi K3 全面開源:
2.8 萬億參數與百萬上下文

7 月 27 日晚 23 點左右,月之暗面(Moonshot AI)正式發佈 Kimi K3 的完整模型權重與技術報告,並同步開源支撐其訓練的三項核心基礎設施:MoonEP、FlashKDA、AgentEnv。這是全球首個被完整開放的 3 兆參數級別模型——2.8 兆總參數、約 1040 億激活參數、100 萬 token 上下文、原生視覺理解,權重檔案在 Hugging Face 上約 1.56TB,上線半小時內登頂趨勢榜第一。本文面向評估 K3 接入與自部署的 AI 開發者與企業技術團隊,系統解讀架構創新、跑分對照、授權條款兩道商業門檻,以及 API 與硬體的現實路徑。

SECTION 01 Kimi K3 選型痛點:「開源」誤讀、授權條款陷阱與自部署門檻

7 月 27 日權重落地後,開發者社群最常見的誤判包括:

  • 把「開放權重」當「開源」:月之暗面官方材料從未使用 open source,只稱 open weight;訓練資料與完整訓練程式碼並未公開,不符合 OSI 標準;
  • 沿用 K2 時代的 Modified MIT 印象:K3 授權條款已改為完全自訂檔案,新增 Model-as-a-Service 收入門檻與規模展示門檻,與 此前 7 月 22 日預告文中的表述已有差異;
  • 低估自部署硬體成本:896 個路由專家、1.56TB 權重體積決定了消費級硬體幾乎不可能跑通,官方建議 64 卡及以上超節點;
  • 只看廠商自報跑分:不同評測框架差異極大,須優先引用 Vals AI、Artificial Analysis 等獨立第三方複測;
  • 忽視地緣與合規背景:權重開源恰逢中美「模型蒸餾」爭端升級,企業選型須同步評估政策風險,可參考 Kimi K3 蒸餾門專題

距離 Kimi K3 在 kimi.com 和 API 端首發,到 7 月 27 日全面開放權重,只過去了 11 天——這是國產大模型競爭進入「3T 俱樂部」階段的重要訊號。

SECTION 02 Kimi K3 發佈時間線與核心參數一覽

  • 7 月 16 日夜(WAIC 2026 前夜):Kimi K3 在 kimi.com、Kimi Work、Kimi Code 及 API 首發,權重尚未公開;
  • 7 月 17 日:業界密集分析架構,新華社報導稱其為「目前全球參數最大的開源模型」;
  • 7 月 22 日–23 日:中美「模型蒸餾」爭端升級,美方指控月之暗面對 Anthropic Fable 模型進行工業化蒸餾;
  • 7 月 27 日晚 23 點:正式發佈完整權重、技術報告,開源 MoonEP、AgentEnv(FlashKDA 此前已開源);
  • 7 月 28 日:中國商務部公開回應美方「AI 霸權主義」指控;阿里巴巴發佈 24 兆參數 Qwen3.8-Max-Preview,被外界解讀為對 K3 的直接回應。
Kimi K3 核心參數
項目 參數
總參數量 2.8 兆(2.8T)
激活參數量 約 1040 億
架構類型 混合專家模型(MoE),896 路由專家,每 token 激活 16 個
注意力機制 Kimi Delta Attention(KDA)+ 門控多頭潛在注意力(Gated MLA)
上下文視窗 100 萬 token
多模態 原生視覺理解(ViT-V2,27 層)
權重格式 MXFP4 權重 + MXFP8 激活(SFT 階段起量化感知訓練)
權重體積 約 1.56TB(Hugging Face)
License 自訂授權條款(官方稱 open weight,非 open source)

SECTION 03 KDA、AttnRes 與 Per-Head Muon:Kimi K3 三大架構創新

Kimi K3 重構了深度學習沿用多年的三大傳統元件——注意力機制、殘差連接、優化器,這也是它區別於「簡單堆參數」的關鍵。

Kimi Delta Attention(KDA):傳統 Gated DeltaNet 使用標量級遺忘門,KDA 改為逐通道門控——每個特徵維度擁有獨立衰減率,某些特徵長期保留、另一些快速遺忘。採用 chunkwise 的 Diagonal-Plus-Low-Rank(DPLR)公式實現線性時間遞迴,與少量全域 Gated MLA 層交替混合,支撐 100 萬 token 上下文同時將 KV Cache 開銷壓到極低。

Attention Residuals(AttnRes):傳統殘差連接逐層均勻累加,深層網路早期資訊易被稀釋。AttnRes 改為選擇性、依據輸入動態聚合前面所有層的輸出,每層僅新增一個 RMSNorm 和一個偽查詢向量,帶來約 25% 訓練效率提升,代價不到 2%。

Per-Head Muon:在 Muon 優化器基礎上做逐注意力頭獨立優化,讓每個頭擁有更自適應的收斂路徑。配合 Stable LatentMoE(896 選 16,稀疏度約 1.8%)與 Quantile Balancing 均衡策略,從數學上證明每個計算節點冗餘專家數的理論上界。

SECTION 04 MoonEP、FlashKDA、AgentEnv 與跑分對照

三大開源 Infra 技術
技術 定位 關鍵能力
MoonEP 超大規模細粒度 MoE 通訊函式庫 臨時複製過載專家,保證每節點均等 token 數,證明冗餘專家數理論上界
FlashKDA 基於 CUTLASS 的 KDA 高效能算子 H20 上 prefill 比 flash-linear-attention 基線快 1.72–2.22 倍,可作為 chunk_kda 直接替代後端
AgentEnv 與 KVCache.ai 聯合開發的 Agent 沙箱 基於 Firecracker microVM,checkpoint 延遲低至 133ms,恢復 49ms,記憶體超分最高 6.5 倍

SWE-bench Verified(獨立複測,Vals AI,截至 2026 年 7 月):

SWE-bench Verified 獨立複測排名
模型 分數 發佈日期
Claude Opus 5 97% 2026-07-24
GPT-5.6 Sol 96.2% 2026-07-09
Claude Fable 5 95% 2026-06-09
Kimi K3 93.4% 2026-07-16
Qwen3.7-Max 79.4% 2026-05-19

Artificial Analysis 智能指數(max 推理檔):Kimi K3 約 57,全球第 3、開源模型第 1,僅次於 Claude Fable 5(60)與 GPT-5.6 Sol(59)。每任務成本約 $0.95,比 Claude Fable 5(約 $2.4)便宜 60%,但比 GLM-5.2(約 $0.47)更貴——開源陣營能力天花板最高,而非性價比最優。K3 目前在 Arena.ai Frontend Code Arena 榜單排名第一。

SECTION 05 Kimi K3 授權條款、API 定價與 6 步接入清單

授權條款包含兩道此前 K2 系列沒有的商業門檻:

  • Model-as-a-Service 收入門檻:若營運模型即服務業務且連續 12 個月累計收入超過 2000 萬美元,須與月之暗面另行簽署商業協議;
  • 規模展示門檻:若產品月活超過 1 億或月收入超過 2000 萬美元,須在介面顯著展示「Kimi K3」字樣。
Kimi K3 API 定價(每百萬 token)
Token 類型 價格
輸入(快取命中) $0.30
輸入(快取未命中) $3.00
輸出(含推理過程) $15.00

Mooncake 分離式推理架構在典型程式類工作負載上快取命中率可達 90% 以上,實際成本更接近 $0.30 檔。自部署需 64 卡及以上超節點,個人與中小團隊更現實的路徑是透過官方 API 或 OpenRouter 等第三方平台呼叫。

  1. 確認授權合規:閱讀 K3 自訂授權條款全文,評估 MaaS 收入門檻與規模展示條款是否適用於您的業務;
  2. 選擇接入路徑:API(OpenAI SDK 相容,base URL https://api.moonshot.ai/v1,模型 ID kimi-k3)或 OpenRouter 等第三方託管;
  3. 設定 API 金鑰:在 Moonshot 控制台建立金鑰,替換現有專案中的 base URL 與 API key;
  4. 測試快取命中率:對程式類 Agent 工作負載做小規模壓測,觀察 Mooncake 快取命中對實際成本的影響;
  5. 評估自部署可行性:若需本地推理,確認 GPU 叢集規模(官方建議 64 卡+)與 1.56TB 權重儲存;
  6. 整合 Infra 工具鏈:若做 MoE 訓練或 KDA 加速,分別評估 MoonEP、FlashKDA(chunk_kda 直接替代)與 AgentEnv 沙箱的適用場景。
kimi-k3-api-test.py
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_MOONSHOT_API_KEY",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Explain Kimi Delta Attention in 3 sentences."}]
)
print(response.choices[0].message.content)

SECTION 06 可引用技術資料與選型結論

  • 總參數量 2.8T / 激活約 104B:全球最大完整開放權重模型,Hugging Face 下載約 1.56TB;
  • SWE-bench Verified 93.4%:Vals AI 獨立複測,開源陣營第一,距 Claude Opus 5(97%)差 3.6 個百分點;
  • Artificial Analysis 智能指數約 57:全球第三、開源第一,每任務成本 $0.95;
  • FlashKDA prefill 加速 1.72–2.22×:NVIDIA H20 上相對 flash-linear-attention 基線;
  • AgentEnv checkpoint 133ms / 恢復 49ms:官方披露資料,尚未經第三方獨立複現。

以下連結為官方與第三方來源,發版後請以最新頁面為準:

Moonshot AI 官方部落格:Kimi K3 技術報告

Hugging Face:moonshotai 組織頁面(K3 權重下載)

GitHub:moonshotai/FlashKDA

若您的團隊計劃基於 K3 建構 Agent 流水線,虛擬化 Mac 環境在 Xcode 編譯、Metal 加速與 iOS CI 場景下存在效能損耗與相容性風險,長期穩定性也不如實體節點。對於需要零損耗原生算力、穩定 iOS CI/CD 與 AI Agent 7×24 自動化的生產環境,MACNOX 的雲端實體節點通常是更優解:100% 蘋果原裝實體機、開放完整 Root 權限、無 Hypervisor 損耗、按天/週/月彈性下單。更多 K3 背景可參考 Kimi K3 深度評測OpenRouter 7 月排行榜分析

SECTION 07 常見問題 FAQ

Kimi K3 真的是開源模型嗎?

嚴格來說不是。它屬於「開放權重(open weight)」模型:訓練完成的權重檔案、技術報告和部分 Infra 工具是公開的,但訓練資料和完整訓練程式碼沒有公開,不符合 OSI 標準下的「開源」定義。

Kimi K3 可以免費商用嗎?

可以,絕大多數商業場景不受限制。但如果您營運的是「模型即服務」業務且年收入超過 2000 萬美元,或產品月活超過 1 億/月收入超過 2000 萬美元,需要額外滿足授權條款中的特定條款。

Kimi K3 需要多少 GPU 才能自己部署?

官方建議部署在 64 卡及以上的超節點叢集,個人和大部分企業使用者更現實的方式是透過官方 API 或 OpenRouter 等第三方平台呼叫。

Kimi K3 的效能到底強不強?

在開源模型陣營中綜合能力最強,Artificial Analysis 智能指數全球第 3,僅次於 Claude Fable 5 和 GPT-5.6 Sol;但成本高於同為開源的 GLM-5.2,屬於「開源陣營天花板最高、但非性價比最優」的選擇。

Kimi K3 和 Kimi K2 有什麼區別?

K3 參數規模是 K2.5 的約 3 倍,架構上新增了 Attention Residuals 和 Per-Head Muon,上下文視窗和多模態能力也大幅提升;授權條款方面 K3 新增了 Model-as-a-Service 收入門檻,商業限制比 K2 系列更細化。