2026 年 7 月 16 日深夜,月之暗面(Moonshot AI)在 API 文件頂部悄然掛上「Kimi K3 已上線」橫幅——沒有大型發表會,卻帶來 2.8 萬億參數的全球最大開源模型。AI 開發者與工程團隊若正評估開源大模型選型,本文完整涵蓋:模型定位與發布背景、KDA/AttnRes/Stable LatentMoE 架構、基準對照表、定價矩陣、四種接入方式與 6 步實操、場景選型、7 月 27 日權重開源承諾、可引用技術資料與 FAQ,協助你在 WAIC 窗口期做出接入判斷。
SECTION 01 開源大模型選型痛點:參數規模、上下文與真實程式設計能力難以兼得
2026 年中,開源社群已有 DeepSeek V4 Pro、GLM-5.2 等強模型,但工程團隊在實際落地時仍面臨結構性矛盾:
- 上下文天花板:多數開源模型上下文僅 128K–256K,分析整個 Repo 或長篇法律/研究文件仍需分段切塊,Agent 長期記憶容易斷裂;
- 基準與實戰脫節:SWE-bench 類短任務高分不等於「連續數小時寫程式碼」的 SWE Marathon 表現,選型若只看單一 benchmark 容易踩坑;
- 推理成本隱性放大:MoE 模型雖稀疏激活,但百萬 Token 上下文下 KV 快取記憶體消耗仍可能拖垮自建推理叢集;
- 開源時間差:API 先行、權重延後是常態,自部署團隊需預留硬體採購與框架適配週期;
- 商業化反擊窗口:月之暗面過去 18 個月受 DeepSeek 衝擊,K3 發布恰逢 2026 世界人工智慧大會(WAIC)開幕前夜,具有明確戰略信號——ARR 已突破 3 億美元,今年完成第 6 輪融資,投前估值 315 億美元,API 收入佔七成以上,海外付費使用者成長 400%。
Kimi K3 一句話定位:目前全球參數規模最大的開源 AI 模型——2.8T 參數,超越 DeepSeek V4 Pro(1.6T)近 75%,是小米開源模型(1.02T)的 2.7 倍;採 896 專家 MoE(每次激活 16 個)、100 萬 Token 上下文、原生視覺理解,定價對標 Claude Sonnet 5 卻提供 5 倍上下文,完整權重將於 7 月 27 日開源。
SECTION 02 Kimi K3 是什麼?規格速覽與發布背景
過去 12 個月裡,Kimi 系列模型有 9 個月佔據開源模型規模上限的位置。K3 專為複雜程式設計、長文件推理、知識工作設計,推理時以最大力度(max effort)運行,支援文字、圖像、影片輸入。
| 項目 | 數值 |
|---|---|
| 總參數 | 2.8 萬億(2.8T) |
| 架構 | KDA + AttnRes + Stable LatentMoE |
| MoE 配置 | 896 專家,每次激活 16 個(稀疏度 1.8%) |
| 上下文 | 1,048,576 Token(1M) |
| API 模型 ID | kimi-k3 |
| 定價(API) | $3 / $15 每百萬 Token(輸入/輸出) |
| 權重開源 | 2026 年 7 月 27 日(Hugging Face) |
SECTION 03 KDA、AttnRes、Stable LatentMoE:三大架構創新詳解
Kimi Delta Attention(KDA)—— 重新設計注意力機制
傳統 Transformer 全注意力在長上下文下計算量呈平方級增長,處理 100 萬 Token 時 KV 快取記憶體消耗極大。KDA 是混合線性注意力機制:
- 以 3:1 比例交替「線性注意力層」與「全注意力層」——3 個線性層處理局部序列(計算廉價),1 個全注意力層保留全域資訊流;
- KV 快取記憶體減少高達 75%;
- 百萬 Token 上下文下解碼速度提升高達 6.3 倍;
- 在短上下文、長上下文與強化學習擴展三種場景均超越純全注意力基線。
Attention Residuals(AttnRes)—— 解決深度資訊丟失
標準殘差連接沿深度均勻累積資訊,早期層關鍵表徵在深層被稀釋。AttnRes 引入選擇性檢索——模型可跨越深度直接拉取更早層的高價值表徵,帶來約 25% 訓練效率提升,額外計算開銷不足 2%。
Stable LatentMoE —— 超高稀疏度的穩定訓練
896 專家中每次僅激活 16 個,路由與最佳化是首要挑戰。Moonshot 配套技術包括:
| 技術 | 作用 |
|---|---|
| Quantile Balancing | 從路由器得分分位數直接推導專家分配,消除啟發式超參 |
| Per-Head Muon | 針對每個注意力頭獨立最佳化,使大規模訓練更自適應 |
| Sigmoid Tanh Unit(SiTU) | 改進激活函數控制 |
| Gated MLA | 提升注意力選擇性 |
| 整體效率 | 相較 Kimi K2 擴展效率提升約 2.5 倍 |
SECTION 04 Kimi K3 基準測試:程式設計、推理與視覺全面對照
以下為月之暗面自報基準(不同模型使用各自推理 harness:K3 用 Kimi Code,GPT 用 Codex,Claude 用 Claude Code)。獨立第三方複現仍在進行,宜作方向性參考。
| 基準測試 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GLM-5.2 |
|---|---|---|---|---|---|
| DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 | 46.2 |
| Program Bench | 77.8 | 76.8 | 77.6 | 71.9 | 63.7 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 | 82.7 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 | 67.3 |
| SWE Marathon | 42.0 | 35.0 | 39.0 | 40.0 | 13.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 | — |
| Automation Bench | 30.8 | 29.1 | 29.7 | 27.2 | 12.9 |
| GPQA-Diamond | 93.5 | 92.6 | 94.1 | 91.0 | 91.2 |
| MMMU-Pro(視覺) | 81.6 | 81.2 | 83.0 | 78.9 | — |
| OmniDocBench(文件理解) | 91.1 | 89.8 | 85.8 | 87.9 | — |
解讀重點:SWE Marathon 專測持續性長程式碼工作,K3 以 42.0 大幅領先;OmniDocBench 第一(91.1)體現視覺 + 長上下文協同;在 Artificial Analysis Intelligence Index v4.1 中 K3 以 57.1 分排名第四,緊隨 Claude Fable 5(59.9)與 GPT-5.6 Sol(58.9)之後,差距僅 2.8 分。
SECTION 05 Kimi K3 API 定價:比 Opus 便宜,上下文是 Sonnet 的 5 倍
| 模型 | 輸入 | 輸出 | 快取命中輸入 | 上下文 |
|---|---|---|---|---|
| Kimi K3 | $3.00 | $15.00 | $0.30 | 1M |
| Claude Sonnet 5 | $3.00(促銷 $2) | $15.00(促銷 $10) | — | 200K |
| Claude Opus 4.8 | $5.00 | $25.00 | — | 200K |
| GPT-5.5 | $5.00 | $30.00 | — | 400K |
| DeepSeek V4 Pro | $1.74 | $3.48 | $0.145 | 128K |
| Kimi K2.6 | $0.95 | $4.00 | $0.16 | 256K |
- 定價對位:K3 與 Claude Sonnet 5 標準價持平($3/$15),上下文為其 5 倍;
- 快取優勢:快取命中價低至 $0.30/M(標準價 1/10),月之暗面報告程式設計場景快取命中率超 90%,實際有效輸入成本極低;
- 對比 Opus 4.8:輸入成本約 60%、輸出約 40%,多項 benchmark 仍具競爭力;
- 國內 API:¥20/M(輸入)、¥100/M(輸出)、快取命中 ¥2/M;Kimi.com 免費帳號可用,預付費套餐 ¥199 起(優惠截至 8 月 11 日)。
SECTION 06 Kimi K3 怎麼用?四種接入方式與 6 步實操指南
無論你是快速試用還是整合進 CI/CD 流水線,可按以下四種路徑選擇:
- 方法一:Kimi 網頁/App——造訪 kimi.com,以 Google 帳號註冊,K3 預設以最大推理力度運行;
- 方法二:官方 API——OpenAI 相容介面,模型 ID 為
kimi-k3,在 platform.kimi.ai 取得 API Key; - 方法三:OpenRouter——模型 ID
moonshotai/kimi-k3,Moonshot 官方定價、無額外加價; - 方法四:7 月 27 日開源權重——完整權重將在 Hugging Face 開放,生產級部署需 64 張以上加速卡的超節點配置。
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "幫我分析這段程式碼..."}]
)
- 確認帳號與額度:在 kimi.com 或 platform.kimi.ai 註冊,核對 API 額度與計費方式(按 Token 後付或預付費套餐)。
- 取得 API Key:於 Moonshot 開發者控制台建立 Key,妥善保管,勿提交至公開 Repo。
- 設定 Base URL:使用
https://api.moonshot.ai/v1(OpenAI SDK 相容),或在 OpenRouter 設定對應端點。 - 選擇模型 ID:官方為
kimi-k3,OpenRouter 為moonshotai/kimi-k3;目前僅 max effort 模式,low/high 模式將在後續更新推出。 - 啟用快取與長上下文:程式設計 Agent 場景建議保留系統提示與 Repo 結構摘要以提升快取命中率;1M 上下文無長度加價,可一次性餵入完整程式碼庫索引。
- 規劃自部署硬體(7/27 後):若計畫本地或私有雲推理,提前評估 GPU 叢集規模(64+ 加速卡超節點)、vLLM/SGLang 框架適配,以及Mac Mini M4 租 vs 買費用對比中討論的邊緣節點成本。
SECTION 07 場景選型矩陣:Kimi K3 vs Claude vs GPT vs DeepSeek
| 場景 | 推薦模型 | 原因 |
|---|---|---|
| 持續性長程式碼任務 | Kimi K3 | SWE Marathon 基準第一,上下文最長 |
| 複雜 Repo 級修 Bug | Claude Fable 5 | FrontierSWE 大幅領先 |
| 終端機/工具鏈密集型 Agent | GPT-5.6 Sol | Terminal Bench 與 Coding Agent Index 領先 |
| 超長文件/多模態文件理解 | Kimi K3 | OmniDocBench 第一,原生視覺 + 1M 上下文 |
| 成本敏感場景 | DeepSeek V4 Pro | 輸出僅 $3.48/M,遠低於 K3 |
| 開源自部署(7/27 後) | Kimi K3 | 最強開源權重,2.8T 參數新紀錄 |
SECTION 08 7 月 27 日開源承諾:開源社群最值得關注的時間節點
月之暗面在官方 WeChat 公告中明確承諾:2026 年 7 月 27 日開放完整模型權重。一旦權重開放,Kimi K3 將成為:
- 迄今參數最大的可下載開源模型;
- 首個超 2 萬億參數級別的開源權重;
- 開源社群訓練/微調基座新標竿——模型以 MXFP4 權重與 MXFP8 激活訓練,量化感知從設計階段即納入;
- Hugging Face 預計出現 MXFP4/NVFP4 量化版本,vLLM、SGLang、transformers 等主流推理框架預期 Day-0 支援。
關注時間軸:7 月 17–20 日 WAIC 上海(更多發布預計)→ 7 月 27 日 K3 完整權重開源。
SECTION 09 可引用技術資料與權威來源
- 參數規模:2.8T 總參數,896 專家 MoE(激活 16),超越 DeepSeek V4 Pro(1.6T)近 75%。
- 上下文:1,048,576 Token(約等於 5 本《紅樓夢》全文),flat 定價無長度加價。
- 架構效率:KDA 使 KV 快取減少 75%、百萬 Token 解碼加速 6.3 倍;相較 K2 擴展效率提升 2.5 倍。
- 商業指標:ARR 突破 3 億美元(2026 年 6 月),第 6 輪融資投前估值 315 億美元,API 收入佔 70%+。
- 整體智慧排名:Artificial Analysis Intelligence Index v4.1 得分 57.1,排名第四。
- 自部署門檻:生產級推理需 64+ 加速卡超節點,不適合筆電本地部署。
以下權威來源可在發版後再次開啟連結核對技術細節與基準資料:
Moonshot AI 官方技術部落格:Kimi K3 發布說明
Artificial Analysis:Intelligence Index v4.1 模型排名
VentureBeat:Moonshot AI Kimi K3 open-source coverage
South China Morning Post:Kimi K3 Moonshot AI open-source report
Kimi K3 對 API 使用者是模型選型升級,但對需要整合 Kimi Code Agent、macOS CI/CD 與 7×24 自動化測試的團隊,仍有三類現實短板:① 7 月 27 日前無法自部署權重,私有雲推理叢集採購週期長;② 虛擬機跑 macOS CI 存在 Metal / Core ML 相容與效能損耗;③ 本機 Mac 關機即斷流,難以穩定跑 Agent 流水線。對於需要零損耗原生 Apple 算力、穩定 iOS CI/CD 與 AI Agent 自動化的生產環境,MACNOX 的雲端實體 Mac 節點通常是更優解:100% 蘋果原裝實體機、開放完整 Root 權限、無 Hypervisor 損耗、按天/週/月彈性下單。可參考Grok 4.5 深度評測中的 Agent 成本分析,以及AI Agent 生產環境安全加固。
SECTION 10 常見問題 FAQ
Kimi K3 可以免費使用嗎?
可以——在 kimi.com 以免費帳號即可試用,K3 預設以最大推理力度運行。API 使用則需付費 API Key,按 Token 計費($3/$15 每百萬 Token)。
可以在本機跑 Kimi K3 嗎?
目前尚不行——完整權重將於 2026 年 7 月 27 日在 Hugging Face 釋出。釋出後生產級推理需 64 張以上加速卡(如 NVIDIA H100),2.8T 參數不適合一般筆電本地部署。
Kimi K3 與 DeepSeek V4 Pro 怎麼選?
K3 參數近兩倍(2.8T vs 1.6T)、上下文大得多(1M vs 128K),程式設計與推理 benchmark 整體更強;但 DeepSeek V4 Pro 輸出價僅 $3.48/M,成本敏感場景仍具優勢。
100 萬 Token 上下文真的實用嗎?
對分析完整程式碼庫、處理長篇研究或法律文件、以及維持多輪 Agent 長期記憶特別有用。flat 定價無長度加價,使實際使用完整上下文窗口成為可能。
low/high 推理力度模式何時推出?
Moonshot 表示 low 與 high effort 模式將在「後續更新」中推出,目前僅 max 模式可用。
基準測試資料可信嗎?
上述 benchmark 為月之暗面自報,各模型使用不同推理 harness,獨立第三方複現仍在進行。建議作方向性參考,關鍵業務場景仍須自行 A/B 測試。