首頁 / 部落格 / Kimi K3
ENGINEERING_BLOG · 2026.07.17

Kimi K3 深度評測:
2.8 萬億參數,國產開源大模型新紀錄

2026 年 7 月 16 日深夜,月之暗面(Moonshot AI)在 API 文件頂部悄然掛上「Kimi K3 已上線」橫幅——沒有大型發表會,卻帶來 2.8 萬億參數的全球最大開源模型。AI 開發者與工程團隊若正評估開源大模型選型,本文完整涵蓋:模型定位與發布背景、KDA/AttnRes/Stable LatentMoE 架構、基準對照表、定價矩陣、四種接入方式與 6 步實操、場景選型、7 月 27 日權重開源承諾、可引用技術資料與 FAQ,協助你在 WAIC 窗口期做出接入判斷。

SECTION 01 開源大模型選型痛點:參數規模、上下文與真實程式設計能力難以兼得

2026 年中,開源社群已有 DeepSeek V4 Pro、GLM-5.2 等強模型,但工程團隊在實際落地時仍面臨結構性矛盾:

  • 上下文天花板:多數開源模型上下文僅 128K–256K,分析整個 Repo 或長篇法律/研究文件仍需分段切塊,Agent 長期記憶容易斷裂;
  • 基準與實戰脫節:SWE-bench 類短任務高分不等於「連續數小時寫程式碼」的 SWE Marathon 表現,選型若只看單一 benchmark 容易踩坑;
  • 推理成本隱性放大:MoE 模型雖稀疏激活,但百萬 Token 上下文下 KV 快取記憶體消耗仍可能拖垮自建推理叢集;
  • 開源時間差:API 先行、權重延後是常態,自部署團隊需預留硬體採購與框架適配週期;
  • 商業化反擊窗口:月之暗面過去 18 個月受 DeepSeek 衝擊,K3 發布恰逢 2026 世界人工智慧大會(WAIC)開幕前夜,具有明確戰略信號——ARR 已突破 3 億美元,今年完成第 6 輪融資,投前估值 315 億美元,API 收入佔七成以上,海外付費使用者成長 400%。

Kimi K3 一句話定位:目前全球參數規模最大的開源 AI 模型——2.8T 參數,超越 DeepSeek V4 Pro(1.6T)近 75%,是小米開源模型(1.02T)的 2.7 倍;採 896 專家 MoE(每次激活 16 個)、100 萬 Token 上下文、原生視覺理解,定價對標 Claude Sonnet 5 卻提供 5 倍上下文,完整權重將於 7 月 27 日開源。

SECTION 02 Kimi K3 是什麼?規格速覽與發布背景

過去 12 個月裡,Kimi 系列模型有 9 個月佔據開源模型規模上限的位置。K3 專為複雜程式設計、長文件推理、知識工作設計,推理時以最大力度(max effort)運行,支援文字、圖像、影片輸入。

Kimi K3 核心規格
項目 數值
總參數 2.8 萬億(2.8T)
架構 KDA + AttnRes + Stable LatentMoE
MoE 配置 896 專家,每次激活 16 個(稀疏度 1.8%)
上下文 1,048,576 Token(1M)
API 模型 ID kimi-k3
定價(API) $3 / $15 每百萬 Token(輸入/輸出)
權重開源 2026 年 7 月 27 日(Hugging Face)

SECTION 03 KDA、AttnRes、Stable LatentMoE:三大架構創新詳解

Kimi Delta Attention(KDA)—— 重新設計注意力機制

傳統 Transformer 全注意力在長上下文下計算量呈平方級增長,處理 100 萬 Token 時 KV 快取記憶體消耗極大。KDA 是混合線性注意力機制

  • 3:1 比例交替「線性注意力層」與「全注意力層」——3 個線性層處理局部序列(計算廉價),1 個全注意力層保留全域資訊流;
  • KV 快取記憶體減少高達 75%
  • 百萬 Token 上下文下解碼速度提升高達 6.3 倍
  • 在短上下文、長上下文與強化學習擴展三種場景均超越純全注意力基線。

Attention Residuals(AttnRes)—— 解決深度資訊丟失

標準殘差連接沿深度均勻累積資訊,早期層關鍵表徵在深層被稀釋。AttnRes 引入選擇性檢索——模型可跨越深度直接拉取更早層的高價值表徵,帶來約 25% 訓練效率提升,額外計算開銷不足 2%。

Stable LatentMoE —— 超高稀疏度的穩定訓練

896 專家中每次僅激活 16 個,路由與最佳化是首要挑戰。Moonshot 配套技術包括:

Stable LatentMoE 配套技術
技術 作用
Quantile Balancing 從路由器得分分位數直接推導專家分配,消除啟發式超參
Per-Head Muon 針對每個注意力頭獨立最佳化,使大規模訓練更自適應
Sigmoid Tanh Unit(SiTU) 改進激活函數控制
Gated MLA 提升注意力選擇性
整體效率 相較 Kimi K2 擴展效率提升約 2.5 倍

SECTION 04 Kimi K3 基準測試:程式設計、推理與視覺全面對照

以下為月之暗面自報基準(不同模型使用各自推理 harness:K3 用 Kimi Code,GPT 用 Codex,Claude 用 Claude Code)。獨立第三方複現仍在進行,宜作方向性參考。

Kimi K3 與前沿閉源模型基準對照
基準測試 Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8 GLM-5.2
DeepSWE 67.5 70.0 73.0 59.0 46.2
Program Bench 77.8 76.8 77.6 71.9 63.7
Terminal Bench 2.1 88.3 84.6 88.8 84.6 82.7
FrontierSWE 81.2 86.6 71.3 66.7 67.3
SWE Marathon 42.0 35.0 39.0 40.0 13.0
BrowseComp 91.2 88.0 90.4 84.3
Automation Bench 30.8 29.1 29.7 27.2 12.9
GPQA-Diamond 93.5 92.6 94.1 91.0 91.2
MMMU-Pro(視覺) 81.6 81.2 83.0 78.9
OmniDocBench(文件理解) 91.1 89.8 85.8 87.9

解讀重點:SWE Marathon 專測持續性長程式碼工作,K3 以 42.0 大幅領先;OmniDocBench 第一(91.1)體現視覺 + 長上下文協同;在 Artificial Analysis Intelligence Index v4.1 中 K3 以 57.1 分排名第四,緊隨 Claude Fable 5(59.9)與 GPT-5.6 Sol(58.9)之後,差距僅 2.8 分。

SECTION 05 Kimi K3 API 定價:比 Opus 便宜,上下文是 Sonnet 的 5 倍

主流模型 API 定價對照(每百萬 Token)
模型 輸入 輸出 快取命中輸入 上下文
Kimi K3 $3.00 $15.00 $0.30 1M
Claude Sonnet 5 $3.00(促銷 $2) $15.00(促銷 $10) 200K
Claude Opus 4.8 $5.00 $25.00 200K
GPT-5.5 $5.00 $30.00 400K
DeepSeek V4 Pro $1.74 $3.48 $0.145 128K
Kimi K2.6 $0.95 $4.00 $0.16 256K
  • 定價對位:K3 與 Claude Sonnet 5 標準價持平($3/$15),上下文為其 5 倍;
  • 快取優勢:快取命中價低至 $0.30/M(標準價 1/10),月之暗面報告程式設計場景快取命中率超 90%,實際有效輸入成本極低;
  • 對比 Opus 4.8:輸入成本約 60%、輸出約 40%,多項 benchmark 仍具競爭力;
  • 國內 API:¥20/M(輸入)、¥100/M(輸出)、快取命中 ¥2/M;Kimi.com 免費帳號可用,預付費套餐 ¥199 起(優惠截至 8 月 11 日)。

SECTION 06 Kimi K3 怎麼用?四種接入方式與 6 步實操指南

無論你是快速試用還是整合進 CI/CD 流水線,可按以下四種路徑選擇:

  • 方法一:Kimi 網頁/App——造訪 kimi.com,以 Google 帳號註冊,K3 預設以最大推理力度運行;
  • 方法二:官方 API——OpenAI 相容介面,模型 ID 為 kimi-k3,在 platform.kimi.ai 取得 API Key;
  • 方法三:OpenRouter——模型 ID moonshotai/kimi-k3,Moonshot 官方定價、無額外加價;
  • 方法四:7 月 27 日開源權重——完整權重將在 Hugging Face 開放,生產級部署需 64 張以上加速卡的超節點配置。
kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "幫我分析這段程式碼..."}]
)
  1. 確認帳號與額度:在 kimi.com 或 platform.kimi.ai 註冊,核對 API 額度與計費方式(按 Token 後付或預付費套餐)。
  2. 取得 API Key:於 Moonshot 開發者控制台建立 Key,妥善保管,勿提交至公開 Repo。
  3. 設定 Base URL:使用 https://api.moonshot.ai/v1(OpenAI SDK 相容),或在 OpenRouter 設定對應端點。
  4. 選擇模型 ID:官方為 kimi-k3,OpenRouter 為 moonshotai/kimi-k3;目前僅 max effort 模式,low/high 模式將在後續更新推出。
  5. 啟用快取與長上下文:程式設計 Agent 場景建議保留系統提示與 Repo 結構摘要以提升快取命中率;1M 上下文無長度加價,可一次性餵入完整程式碼庫索引。
  6. 規劃自部署硬體(7/27 後):若計畫本地或私有雲推理,提前評估 GPU 叢集規模(64+ 加速卡超節點)、vLLM/SGLang 框架適配,以及Mac Mini M4 租 vs 買費用對比中討論的邊緣節點成本。

SECTION 07 場景選型矩陣:Kimi K3 vs Claude vs GPT vs DeepSeek

依使用場景選擇模型
場景 推薦模型 原因
持續性長程式碼任務 Kimi K3 SWE Marathon 基準第一,上下文最長
複雜 Repo 級修 Bug Claude Fable 5 FrontierSWE 大幅領先
終端機/工具鏈密集型 Agent GPT-5.6 Sol Terminal Bench 與 Coding Agent Index 領先
超長文件/多模態文件理解 Kimi K3 OmniDocBench 第一,原生視覺 + 1M 上下文
成本敏感場景 DeepSeek V4 Pro 輸出僅 $3.48/M,遠低於 K3
開源自部署(7/27 後) Kimi K3 最強開源權重,2.8T 參數新紀錄

SECTION 08 7 月 27 日開源承諾:開源社群最值得關注的時間節點

月之暗面在官方 WeChat 公告中明確承諾:2026 年 7 月 27 日開放完整模型權重。一旦權重開放,Kimi K3 將成為:

  • 迄今參數最大的可下載開源模型;
  • 首個超 2 萬億參數級別的開源權重;
  • 開源社群訓練/微調基座新標竿——模型以 MXFP4 權重與 MXFP8 激活訓練,量化感知從設計階段即納入;
  • Hugging Face 預計出現 MXFP4/NVFP4 量化版本,vLLM、SGLang、transformers 等主流推理框架預期 Day-0 支援。

關注時間軸:7 月 17–20 日 WAIC 上海(更多發布預計)→ 7 月 27 日 K3 完整權重開源。

SECTION 09 可引用技術資料與權威來源

  • 參數規模:2.8T 總參數,896 專家 MoE(激活 16),超越 DeepSeek V4 Pro(1.6T)近 75%。
  • 上下文:1,048,576 Token(約等於 5 本《紅樓夢》全文),flat 定價無長度加價。
  • 架構效率:KDA 使 KV 快取減少 75%、百萬 Token 解碼加速 6.3 倍;相較 K2 擴展效率提升 2.5 倍。
  • 商業指標:ARR 突破 3 億美元(2026 年 6 月),第 6 輪融資投前估值 315 億美元,API 收入佔 70%+。
  • 整體智慧排名:Artificial Analysis Intelligence Index v4.1 得分 57.1,排名第四。
  • 自部署門檻:生產級推理需 64+ 加速卡超節點,不適合筆電本地部署。

以下權威來源可在發版後再次開啟連結核對技術細節與基準資料:

Moonshot AI 官方技術部落格:Kimi K3 發布說明

Kimi API Platform 官方文件

Artificial Analysis:Intelligence Index v4.1 模型排名

VentureBeat:Moonshot AI Kimi K3 open-source coverage

South China Morning Post:Kimi K3 Moonshot AI open-source report

Kimi K3 對 API 使用者是模型選型升級,但對需要整合 Kimi Code Agent、macOS CI/CD 與 7×24 自動化測試的團隊,仍有三類現實短板:① 7 月 27 日前無法自部署權重,私有雲推理叢集採購週期長;② 虛擬機跑 macOS CI 存在 Metal / Core ML 相容與效能損耗;③ 本機 Mac 關機即斷流,難以穩定跑 Agent 流水線。對於需要零損耗原生 Apple 算力、穩定 iOS CI/CD 與 AI Agent 自動化的生產環境,MACNOX 的雲端實體 Mac 節點通常是更優解:100% 蘋果原裝實體機、開放完整 Root 權限、無 Hypervisor 損耗、按天/週/月彈性下單。可參考Grok 4.5 深度評測中的 Agent 成本分析,以及AI Agent 生產環境安全加固

SECTION 10 常見問題 FAQ

Kimi K3 可以免費使用嗎?

可以——在 kimi.com 以免費帳號即可試用,K3 預設以最大推理力度運行。API 使用則需付費 API Key,按 Token 計費($3/$15 每百萬 Token)。

可以在本機跑 Kimi K3 嗎?

目前尚不行——完整權重將於 2026 年 7 月 27 日在 Hugging Face 釋出。釋出後生產級推理需 64 張以上加速卡(如 NVIDIA H100),2.8T 參數不適合一般筆電本地部署。

Kimi K3 與 DeepSeek V4 Pro 怎麼選?

K3 參數近兩倍(2.8T vs 1.6T)、上下文大得多(1M vs 128K),程式設計與推理 benchmark 整體更強;但 DeepSeek V4 Pro 輸出價僅 $3.48/M,成本敏感場景仍具優勢。

100 萬 Token 上下文真的實用嗎?

對分析完整程式碼庫、處理長篇研究或法律文件、以及維持多輪 Agent 長期記憶特別有用。flat 定價無長度加價,使實際使用完整上下文窗口成為可能。

low/high 推理力度模式何時推出?

Moonshot 表示 low 與 high effort 模式將在「後續更新」中推出,目前僅 max 模式可用。

基準測試資料可信嗎?

上述 benchmark 為月之暗面自報,各模型使用不同推理 harness,獨立第三方複現仍在進行。建議作方向性參考,關鍵業務場景仍須自行 A/B 測試。