3か月の待機を経て、DeepSeek V4 本番版(GA)が 2026年7月20日に正式公開されました。4月のプレビュー版と比べ、Agent タスク・数学推論・コード生成が強化され、初めて峰谷差別課金が導入されています。独立開発者、AI エンジニア、deepseek-chat を使い続けているチーム向けに、本記事ではプレビューから GA までのタイムライン、V4-Pro/Flash の CSA+HCA・mHC・Muon アーキテクチャ、ベンチマーク、GPT-5.6 / Claude Fable 5 との横並び比較、峰谷課金の節約策、7月24日までの API 移行 6 ステップ、引用可能な技術データ、FAQをまとめます。
SECTION 01 DeepSeek V4 GA 前に、開発者が直面する 5 つの課題
- 旧 API の終了:
deepseek-chatとdeepseek-reasonerは 7月24日 23:59(北京時間)に永久停止します。未移行の本番コードはサービス中断のリスクがあります。 - 峰谷課金の複雑さ:GA 版では北京時間の平日ピーク(09:00–12:00、14:00–18:00)に料金が 2 倍になります。バッチ推論をスケジュールしないと想定外の請求が発生します。
- プレビューと GA の性能差:プレビュー版も強力ですが、GA は Agent オーケストレーションと長チェーンのコード生成でさらに改善されています。4月時点の選定資料では GA の能力を過小評価しがちです。
- クローズド旗舰のコスト:Claude Fable 5 の出力は約 $50/M、GPT-5.6 Sol は約 $15/M。高頻度 API 呼び出しのチームは MIT オープンソースで自ホスト可能な代替を求めています。
- 長コンテキストの実装ハードル:100万 token ウィンドウは仕様上は簡単ですが、ボトルネックは KV Cache メモリです。V4 が V3.2 の 10% に抑えられる理由を理解する必要があります。
ひと言で言えば、DeepSeek V4 GA は 2026 年オープンソース LLM の最重要マイルストーンの一つです。クローズド旗舰の 1/10〜1/100 のコストで、オープンソースモデルとして総合性能で群を抜く位置づけ(SWE-bench Verified 80.6% のオープンソース記録)に加え、初めて規律ある峰谷課金体系が整いました。
SECTION 02 プレビューから本番版へ:DeepSeek V4 リリース年表
| 時期 | 出来事 |
|---|---|
| 4月24日 | V4 プレビュー版を MIT で公開。V4-Pro(1.6T)と V4-Flash(284B)を同梱 |
| 5月 | V4-Flash / V4-Pro の本番向けチューニング版リリース、API 正式提供開始 |
| 6月 | V4-Pro 出力単価を恒久的に 75% 値下げ($0.87/M tokens)——史上最高のコスパ帯に固定 |
| 6月29日 | 全 API ユーザーへ GA を7月中旬に予告するメール。峰谷課金を初公開 |
| 7月19日 | 複数開発者が GA グレーンテスト資格を取得。メディアは「本番版は最短翌日」と報道 |
| 7月20日 | GA 正式版リリース(本記事公開日) |
| 7月24日 | 旧 API deepseek-chat / deepseek-reasoner 永久停止 |
SECTION 03 V4-Pro と V4-Flash:100万 token コンテキストを実現する技術
| 項目 | V4-Pro | V4-Flash |
|---|---|---|
| 総パラメータ数 | 1.6 兆(1.6T) | 2840 億(284B) |
| トークンあたり活性化 | 490 億(49B) | 130 億(13B) |
| Transformer 層数 | 61 層 | 43 層 |
| コンテキスト | 1,000,000 tokens | 1,000,000 tokens |
| 最大出力 | 384K tokens | 384K tokens |
| 精度 | FP4(エキスパート重み)+ FP8(その他) | FP4 + FP8 混合 |
| 事前学習データ | 33T+ tokens | 32T+ tokens |
| ライセンス | MIT | MIT |
従来の Transformer では KV Cache メモリがコンテキスト長に比例して増大し、100万 token は実質不可能でした。DeepSeek V4 は次の 3 つの革新で解決しています。
- ハイブリッドアテンション(CSA + HCA):圧縮スパースアテンション(CSA)が Softmax ゲート付きプーリングで KV 列を 4 倍圧縮し、FP4「ライトニングインデクサー」で top-k スパース選択(Pro は top-1024、Flash は top-512)。直近 128 token のスライディングウィンドウも保持。重度圧縮アテンション(HCA)は token を 128 倍圧縮してグローバル密集アテンションを実行し、CSA と交互に補完。100万 token 推論の FLOPs は V3.2 の 27%、KV Cache メモリは 10%(Flash は 7%)。
- 多様体制約ハイパーコネクション(mHC):4 チャネル残差ストリーム + 双確率行列制約(Birkhoff 多面体)により、61 層の深いネットワークでも信号が安定伝播します。
- Muon オプティマイザ:AdamW ではなく Muon を採用。ニュートン–シュルツ直交化で勾配を処理し、収束が速く安定します。
| モード | 特徴 | 向いている用途 |
|---|---|---|
| Non-think | 思考チェーンなし、最速応答 | 単純 Q&A、ルーティング |
| Think High | 明示的推論(思考タグ付き) | 中程度の複雑タスク、コードデバッグ |
| Think Max | 最大推論強度、384K+ コンテキストが必要 | 高度な数学、長チェーン Agent |
公式推奨サンプリング:temperature=1.0, top_p=1.0(全モード共通)。
SECTION 04 ベンチマーク:オープンソース陣営の成績表
| ベンチマーク | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6%(オープンソース最高) | 96.0% | 個別未公表 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
Artificial Analysis の評価によると、Claude Fable 5 は Strategy & Ops 指数タスクで 1 回あたり $3.48(スコア 50)、DeepSeek V4-Pro は同種タスクで $0.03(スコア 38)——コストは 116 倍の差、スコア差は約 12 点(31%)。V4-Flash は 6 類の指数タスクすべてで 1 回 $0.04 未満です。
SECTION 05 DeepSeek V4 vs GPT-5.6 vs Claude Fable 5:どれを選ぶか
| 観点 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| オープンソース / 自ホスト | MIT、対応 | クローズド | クローズド |
| コンテキスト | 1M tokens | 未公開 | 1M tokens |
| API 出力単価(通常) | $0.87/M | ~$15/M | $50/M |
| ピーク出力単価 | $1.74/M | — | — |
| コード能力 | 極めて高い(Fable 5 に接近) | 極めて高い | 最高(SWE-bench Pro 首位) |
| データプライバシー | プライベートデプロイ可 | クラウドのみ | クラウドのみ |
- 予算重視・高頻度呼び出し・自ホスト:V4-Pro または V4-Flash を第一候補に。
- コード性能最優先・コスト不問:Claude Fable 5(SWE-bench Pro 80.3%)。
- 複雑なアルゴリズムと数学推論:GPT-5.6 Sol / Ultra。
- 大規模ログ・文書の低コスト処理:V4-Flash のキャッシュヒット入力は $0.0028/M のみ。
SECTION 06 峰谷課金の計算方法と 4 つの節約策
GA 版で最も注目された変更は、電力の時間帯別料金に似た平日ピーク時間帯の 2 倍課金です(北京時間 09:00–12:00、14:00–18:00)。
| モデル | 課金項目 | 通常(Off-Peak) | ピーク(Peak) |
|---|---|---|---|
| V4-Pro | 入力(キャッシュヒット) | ¥0.025 / $0.0035 | 2 倍 |
| V4-Pro | 入力(キャッシュミス) | ¥3.00 / $0.435 | ¥6.00 / $0.87 |
| V4-Pro | 出力 | ¥6.00 / $0.87 | ¥12.00 / $1.74 |
| V4-Flash | 入力(キャッシュヒット) | ¥0.02 / $0.0028 | 2 倍 |
| V4-Flash | 入力(キャッシュミス) | ¥1.00 / $0.14 | ¥2.00 / $0.28 |
| V4-Flash | 出力 | ¥2.00 / $0.28 | ¥4.00 / $0.56 |
- 非リアルタイム作業はオフピークへ:バッチ文書処理、データラベリング、コードレビューは 18:00 以降または 09:00 前に実行。
- Prompt Cache を活用:V4-Flash のキャッシュヒットは $0.0028/M。繰り返す System Prompt は構造化して先頭に固定。
- Flash でルーティング:単純な意図判定は V4-Flash、複雑推論のみ V4-Pro へエスカレーション。
- メール通知を確認:DeepSeek は料金変更の 24 時間前にメールで通知すると約束しています。
ピーク時でも V4-Pro 出力 $1.74/M は、Claude Opus 4.8($15/M)や GPT-5.6 Sol(約 $15/M)より 8.6 倍安価です。
SECTION 07 deepseek-chat 停止前の API 移行:6 ステップ実践ガイド
重要:旧モデル名 deepseek-chat と deepseek-reasoner は 2026年7月24日 15:59 UTC(北京時間 23:59)に永久停止します。
| 旧モデル名 | 新モデル名 | 備考 |
|---|---|---|
deepseek-chat |
deepseek-v4-flash(非思考モード) |
高速、軽量タスク向け |
deepseek-reasoner |
deepseek-v4-flash(思考モード) |
または deepseek-v4-pro でより強い推論 |
- 旧モデル名を全リポジトリ検索:コード、CI 設定、環境変数から
deepseek-chat/deepseek-reasonerの呼び出し箇所を洗い出します。 - 移行先を決定:軽量対話 →
deepseek-v4-flash。複雑推論 →deepseek-v4-pro+ 思考モード。 - OpenAI SDK の model パラメータ更新:
base_urlはhttps://api.deepseek.comのまま、modelのみ変更します。 - 思考モードを設定(任意):
extra_bodyで thinking を有効化。budget_tokens は 8000 から開始を推奨。 - Staging で検証:7月24日までに E2E 回帰を完了。Agent 長チェーンとキャッシュヒットを重点テスト。
- 本番切替と監視:新モデル名でカナリアリリースし、ピーク時間帯の請求とレイテンシを監視します。
deprecated — 2026-07-24 以降は利用不可
client.chat.completions.create(
model="deepseek-chat",
messages=[...]
)
recommended — V4 GA
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
V4 は OpenAI ChatCompletions と Anthropic Messages の両形式に対応しています。Anthropic SDK も model の更新と base_url を https://api.deepseek.com に向けるだけで移行できます。
SECTION 08 引用可能な技術データと公式ソース
- オープンソース記録:SWE-bench Verified 80.6%。Gemini 3.1 Pro と並ぶオープンソース最高水準。
- コンテキスト効率:100万 token 時の KV Cache メモリは V3.2 の 10%(Flash は 7%)。
- コスパ:V4-Pro 出力は通常 $0.87/M、ピーク $1.74/M。いずれもクローズド旗舰より大幅に低い。
- 移行期限:2026-07-24 23:59 北京時間。旧 API は永久停止。
- ライセンス:V4-Pro / V4-Flash とも MIT。自ホストと商用利用が可能。
- サンプリング:公式推奨
temperature=1.0, top_p=1.0。
発版後に改めてリンクを開き、技術詳細とベンチマーク資料を確認してください。
arXiv:2606.19348 — DeepSeek V4 技術論文
Hugging Face:DeepSeek モデルリポジトリ
Artificial Analysis:モデルコスパと Intelligence Index
DeepSeek V4 GA の価値は、Claude Fable 5 や GPT-5.6 を今すぐ上回ることではなく、極めて低コストでオープンソース最強の総合性能を提供することにあります。一方、Mac 上で iOS CI/CD、Metal 加速推論、7×24 Agent パイプラインを回す必要があるチームにとって、API だけでは① データ越境のコンプライアンス、② ローカル Mac 停止でパイプラインが途切れる、③ 仮想化 macOS の Hypervisor オーバーヘッドと Metal 互換問題——という 3 点が残ります。ゼロロス原生 Apple 算力、安定 iOS CI/CD、AI Agent 自動化が必要な本番環境では、MACNOX のクラウド物理 Mac ノードがより適した選択です。100% 純正 Apple 物理機、フル Root、Hypervisor オーバーヘッドなし、日/週/月の柔軟な契約。関連記事:Kimi K3 オープンソース LLM レビュー、DeepSeek 自社チップと算力基盤、GPT-5.6 Sol Ultra 数学推論評価。
SECTION 09 よくある質問 FAQ
DeepSeek V4 本番版とプレビュー版の違いは?
アーキテクチャ(MoE + CSA/HCA)は同一です。GA 版は Agent タスク、数学推論、コード生成を本番向けに最適化し、峰谷課金を初導入しました。プレビューも強力ですが、GA は安定性と商用運用の完成度が一段上です。
峰谷課金のピーク時間帯は?
北京時間の平日 09:00–12:00 と 14:00–18:00 がピークで、料金は 2 倍です。週末・祝日は通常料金です。
V4-Pro と V4-Flash はどう使い分ける?
Flash は安価・高速で、ルーティングと軽量タスク向け。Pro は複雑なコードと長チェーン Agent 向け。Flash で一次フィルタし、難タスクのみ Pro へ送る構成が効率的です。
deepseek-chat はいつまで使える?
2026年7月24日 23:59(北京時間)で永久停止します。それまでに deepseek-v4-flash または deepseek-v4-pro へ移行してください。
DeepSeek V4 は GPT-5.6 に勝てる?
総合ベンチマークではクローズド旗舰が依然リードしますが、V4-Pro は LiveCodeBench や Codeforces などアルゴリズム系で優位で、コストは GPT-5.6 の約 1/17 です。単一スコアよりシナリオと予算で選ぶべきです。
DeepSeek V4 を自ホストできる?
可能です。V4-Pro / V4-Flash は MIT で、ウェイトは Hugging Face から取得できます。1.6T MoE の本番推論には大規模 GPU クラスタが必要です。詳細はDeepSeek 算力基盤を参照してください。