7月27日23時頃、月之暗面(Moonshot AI)は Kimi K3 の完全モデルウェイトと技術レポートを正式公開し、学習を支える3つのコアインフラ MoonEP、FlashKDA、AgentEnv も同時にオープンソース化しました。これは世界初の3兆パラメータ級モデルの完全公開です——総パラメータ2.8兆、活性化約1040億、100万トークンコンテキスト、ネイティブ視覚理解、Hugging Face 上のウェイトファイルは約1.56TB、公開後30分でトレンド1位に登りました。本記事はK3 の導入・自前デプロイを検討する AI 開発者とエンタープライズ技術チーム向けに、アーキテクチャ革新、ベンチマーク対照、ライセンス上の2つの商用ハードル、API とハードウェアの現実的な導入パスを体系的に解説します。
SECTION 01 Kimi K3 選定の痛点:「オープンソース」誤解、ライセンストラップ、自前デプロイの壁
7月27日のウェイト公開後、開発者コミュニティで最も多い誤判断は次のとおりです。
- 「オープンウェイト」を「オープンソース」と混同する:月之暗面の公式資料は open source という表現を使っておらず、open weight のみです。学習データと完全な学習コードは非公開であり、OSI 基準のオープンソースには該当しません;
- K2 時代の Modified MIT 印象を引きずる:K3 のライセンスは完全カスタムファイルに変更され、Model-as-a-Service 収入閾値と規模表示閾値が新設されました。7月22日の予告記事の記述とはすでに差異があります;
- 自前デプロイのハードウェアコストを過小評価する:896ルーティングエキスパート、1.56TB のウェイトサイズにより、コンシューマー向けハードウェアでの実用推論はほぼ不可能です。公式推奨は64枚以上の超ノードです;
- ベンダー自報スコアだけを見る:評価フレームワークによって結果は大きく異なります。Vals AI、Artificial Analysis など独立第三者の再検証を優先すべきです;
- 地政学・コンプライアンス背景を無視する:ウェイト公開は米中「モデル蒸留」争いの激化と重なります。エンタープライズ選定では政策リスクも同時に評価してください。Kimi K3 蒸留論争特集も参照できます。
Kimi K3 が kimi.com と API で初公開されてから、7月27日の完全ウェイト公開まで、わずか11日しか経っていません——これは国産大規模モデル競争が「3T クラブ」段階に入った重要なシグナルです。
SECTION 02 Kimi K3 公開タイムラインとコアパラメータ一覧
- 7月16日夜(WAIC 2026 前夜):Kimi K3 が kimi.com、Kimi Work、Kimi Code および API で初公開。ウェイトは未公開;
- 7月17日:業界がアーキテクチャを集中分析。新華社は「現時点で世界最大パラメータのオープンモデル」と報道;
- 7月22日–23日:米中「モデル蒸留」争いが激化。米側は月之暗面が Anthropic Fable モデルを工業規模で蒸留したと非難;
- 7月27日23時:完全ウェイトと技術レポートを正式公開。MoonEP、AgentEnv をオープンソース化(FlashKDA は先行公開済み);
- 7月28日:中国商務部が米方の「AI 覇権主義」非難に公開回答。阿里巴巴が24兆パラメータ Qwen3.8-Max-Preview を発表し、K3 への直接応答と受け止められました。
| 項目 | パラメータ |
|---|---|
| 総パラメータ数 | 2.8 兆(2.8T) |
| 活性化パラメータ数 | 約 1040 億 |
| アーキテクチャ種別 | 混合エキスパート(MoE)、896 ルーティングエキスパート、トークンあたり16個を活性化 |
| アテンション機構 | Kimi Delta Attention(KDA)+ ゲート付き多頭潜在アテンション(Gated MLA) |
| コンテキストウィンドウ | 100 万トークン |
| マルチモーダル | ネイティブ視覚理解(ViT-V2、27 層) |
| ウェイト形式 | MXFP4 ウェイト + MXFP8 活性化(SFT 段階から量子化認識学習) |
| ウェイト容量 | 約 1.56TB(Hugging Face) |
| License | カスタムライセンス(公式表記は open weight、open source ではない) |
SECTION 03 KDA、AttnRes、Per-Head Muon:Kimi K3 の3大アーキテクチャ革新
Kimi K3 は深層学習で長年使われてきた3大コンポーネント——アテンション機構、残差接続、最適化器——を再設計しました。これが「単純なパラメータ積み上げ」との決定的な違いです。
Kimi Delta Attention(KDA):従来の Gated DeltaNet はスカラー級の忘却ゲートを使いますが、KDA はチャネルごとのゲート制御に変更しました——各特徴次元が独立した減衰率を持ち、一部の特徴は長期保持、別の特徴は高速忘却されます。chunkwise の Diagonal-Plus-Low-Rank(DPLR)公式で線形時間再帰を実現し、少数のグローバル Gated MLA 層と交互に混合することで、100万トークンコンテキストを支えつつ KV Cache コストを極限まで抑えます。
Attention Residuals(AttnRes):従来の残差接続は層ごとに均等累積するため、深層ネットワークでは早期情報が薄まりやすくなります。AttnRes は入力に応じて前面全層の出力を選択的・動的に集約します。各層に追加されるのは RMSNorm 1つと疑似クエリベクトル1つのみで、約25%の学習効率向上をもたらし、コストは2%未満です。
Per-Head Muon:Muon 最適化器をベースに、アテンションヘッドごとに独立最適化を行い、各ヘッドがより適応的な収束パスを持てるようにしました。Stable LatentMoE(896 から 16 を選択、スパース度約1.8%)と Quantile Balancing 均衡戦略を組み合わせ、各計算ノードの冗長エキスパート数の理論的上界を数学的に証明しています。
SECTION 04 MoonEP、FlashKDA、AgentEnv とベンチマーク対照
| 技術 | 位置づけ | 主要能力 |
|---|---|---|
| MoonEP | 超大規模細粒度 MoE 通信ライブラリ | 過負荷エキスパートを一時複製し、ノードあたりのトークン数を均等化。冗長エキスパート数の理論的上界を証明 |
| FlashKDA | CUTLASS ベースの KDA 高性能オペレータ | H20 上で prefill が flash-linear-attention 基線比 1.72–2.22 倍高速。chunk_kda の直接代替バックエンドとして利用可能 |
| AgentEnv | KVCache.ai と共同開発した Agent サンドボックス | Firecracker microVM ベース。checkpoint 遅延133ms、復元49ms、メモリオーバーコミット最大6.5倍 |
SWE-bench Verified(独立再検証、Vals AI、2026年7月時点):
| モデル | スコア | 公開日 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| Qwen3.7-Max | 79.4% | 2026-05-19 |
Artificial Analysis インテリジェンス指数(max 推論モード):Kimi K3 は約57点で世界第3、オープンソースモデル第1。Claude Fable 5(60)と GPT-5.6 Sol(59)に次ぎます。タスクあたりコストは約 $0.95 で、Claude Fable 5(約 $2.4)より60%安い一方、GLM-5.2(約 $0.47)より高価です——オープンソース陣営の能力上限は最高だが、コスパ最適解ではないという位置づけです。K3 は現在 Arena.ai Frontend Code Arena ランキングで1位です。
SECTION 05 Kimi K3 ライセンス、API 料金、6ステップ導入チェックリスト
ライセンスには K2 シリーズにはなかった2つの商用ハードルが含まれます。
- Model-as-a-Service 収入閾値:モデル即サービス事業を運営し、連続12か月の累計収入が2000万米ドルを超える場合、月之暗面と別途商用契約を締結する必要があります;
- 規模表示閾値:製品の月間アクティブユーザーが1億を超える、または月間収入が2000万米ドルを超える場合、UI 上に「Kimi K3」の表記を目立つ形で掲示する必要があります。
| トークン種別 | 価格 |
|---|---|
| 入力(キャッシュヒット) | $0.30 |
| 入力(キャッシュミス) | $3.00 |
| 出力(推論過程を含む) | $15.00 |
Mooncake 分離型推論アーキテクチャは、典型的なプログラミング系ワークロードでキャッシュヒット率90%超を達成でき、実効コストは $0.30 帯に近づきます。自前デプロイには64枚以上の超ノードが必要です。個人や中小チームにとって現実的なのは、公式 API または OpenRouter など第三者プラットフォーム経由の呼び出しです。
- ライセンスコンプライアンスの確認:K3 カスタムライセンス全文を読み、MaaS 収入閾値と規模表示条項が自社事業に適用されるか評価します;
- 導入パスの選択:API(OpenAI SDK 互換、base URL
https://api.moonshot.ai/v1、モデル IDkimi-k3)または OpenRouter など第三者ホスティング; - API キーの設定:Moonshot コンソールでキーを作成し、既存プロジェクトの base URL と API key を差し替えます;
- キャッシュヒット率のテスト:プログラミング系 Agent ワークロードで小規模負荷テストを行い、Mooncake キャッシュヒットが実効コストに与える影響を観察します;
- 自前デプロイの実現可能性評価:ローカル推論が必要な場合、GPU クラスタ規模(公式推奨64枚以上)と1.56TB ウェイトストレージを確認します;
- Infra ツールチェーンの統合:MoE 学習や KDA 加速を行う場合、MoonEP、FlashKDA(chunk_kda 直接代替)、AgentEnv サンドボックスの適用シナリオをそれぞれ評価します。
from openai import OpenAI
client = OpenAI(
api_key="YOUR_MOONSHOT_API_KEY",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Explain Kimi Delta Attention in 3 sentences."}]
)
print(response.choices[0].message.content)
SECTION 06 引用可能な技術データと選定結論
- 総パラメータ 2.8T / 活性化約 104B:世界最大の完全オープンウェイトモデル。Hugging Face ダウンロード約1.56TB;
- SWE-bench Verified 93.4%:Vals AI 独立再検証、オープンソース陣営第1。Claude Opus 5(97%)との差は3.6ポイント;
- Artificial Analysis インテリジェンス指数約57:世界第3、オープンソース第1。タスクあたりコスト $0.95;
- FlashKDA prefill 1.72–2.22倍加速:NVIDIA H20 上で flash-linear-attention 基線比;
- AgentEnv checkpoint 133ms / 復元 49ms:公式開示データ。第三者による独立再現は未確認です。
以下のリンクは公式・第三者ソースです。公開後は最新ページをご確認ください。
Moonshot AI 公式ブログ:Kimi K3 技術レポート
Hugging Face:moonshotai 組織ページ(K3 ウェイトダウンロード)
K3 をベースに Agent パイプラインを構築するチームにとって、仮想化 Mac 環境は Xcode コンパイル、Metal 加速、iOS CI シナリオで性能損失と互換性リスクがあり、長期安定性も物理ノードに及びません。ゼロオーバーヘッドのネイティブ Apple 算力、安定した iOS CI/CD、AI Agent の7×24自動化が必要な本番環境では、MACNOX のクラウド物理 Mac ノードが通常はより適した選択です。100% Apple 純正物理機、フル Root 権限、Hypervisor オーバーヘッドなし、日/週/月の柔軟なレンタルが可能です。K3 の背景情報はKimi K3 徹底解説とOpenRouter 7月ランキング分析も参照してください。
SECTION 07 よくある質問 FAQ
Kimi K3 は本当にオープンソースモデルですか?
厳密には違います。「オープンウェイト(open weight)」モデルに該当します。学習済みウェイトファイル、技術レポート、一部 Infra ツールは公開されていますが、学習データと完全な学習コードは非公開であり、OSI 基準の「オープンソース」定義には合致しません。
Kimi K3 は無料で商用利用できますか?
はい、大多数の商用シナリオでは制限はありません。ただし「モデル即サービス」事業を運営し年間収入が2000万米ドルを超える場合、または製品の月間アクティブユーザーが1億超/月間収入が2000万米ドル超の場合は、ライセンス内の特定条項を追加で満たす必要があります。
Kimi K3 を自前デプロイするには何枚の GPU が必要ですか?
公式推奨は64枚以上の超ノードクラスタです。個人や大多数のエンタープライズユーザーにとって現実的なのは、公式 API または OpenRouter など第三者プラットフォーム経由の呼び出しです。
Kimi K3 の性能はどの程度ですか?
オープンソースモデル陣営では総合能力が最も高く、Artificial Analysis インテリジェンス指数で世界第3、Claude Fable 5 と GPT-5.6 Sol に次ぎます。ただし同じオープンソースの GLM-5.2 よりコストが高く、「オープンソース陣営の上限は最高だが、コスパ最適解ではない」選択肢です。
Kimi K3 と Kimi K2 の違いは何ですか?
K3 のパラメータ規模は K2.5 の約3倍です。アーキテクチャ上 Attention Residuals と Per-Head Muon が新設され、コンテキストウィンドウとマルチモーダル能力も大幅に向上しました。ライセンス面では K3 に Model-as-a-Service 収入閾値が追加され、K2 シリーズより商用制限が細分化されています。