首頁 / 部落格 / DeepSeek V4
ENGINEERING_BLOG · 2026.07.20

DeepSeek V4 完整版正式發布:
定價、架構與對標 GPT-5.6 的性能差距

等了整整三個月,DeepSeek V4 完整版(GA 正式版)終於在 2026 年 7 月 20 日正式上線。相較 4 月預覽版,正式版帶來 Agent、數學推理與程式碼生成的專項提升,並首次引入峰谷差異化計費獨立開發者、AI 工程師與仍在使用 deepseek-chat 的團隊若需快速決策,本文完整涵蓋:預覽版→完整版時間線、V4-Pro/Flash 架構(CSA+HCA、mHC、Muon)、Benchmark 評測、與 GPT-5.6 / Claude Fable 5 橫向對照、峰谷計費省錢策略、7 月 24 日 API 遷移六步指南、可引用技術數據與 FAQ

SECTION 01 DeepSeek V4 GA 上線前,開發者面臨哪些痛點?

  • 舊介面即將下線:deepseek-chatdeepseek-reasoner 將於 7 月 24 日 23:59(北京時間)永久停用,生產環境程式碼若未遷移將面臨服務中斷;
  • 峰谷計費增加複雜度:GA 版首次依北京時間工作日高峰(09:00–12:00、14:00–18:00)翻倍計價,批次推理任務若未排程可能意外超支;
  • 預覽版與完整版性能差:預覽版已很強,但 GA 在 Agent 編排、長鏈路程式碼生成上仍有可見提升,選型文件若停留在 4 月版本會低估正式版能力;
  • 閉源旗艦成本壓力:Claude Fable 5 輸出約 $50/M、GPT-5.6 Sol 約 $15/M,高頻 API 呼叫團隊急需可自託管的 MIT 開源替代;
  • 長上下文落地門檻:1M token 視窗紙面參數易得,KV Cache 記憶體才是瓶頸——需理解 V4 架構為何能把記憶體壓到 V3.2 的 10%。

一句話定位:DeepSeek V4 GA 是 2026 年開源大模型領域最重要的里程碑之一——以閉源旗艦 1/10 乃至 1/100 的成本,提供開源模型中無可爭議的最強綜合性能(SWE-bench Verified 80.6% 開源紀錄),同時首次建立有紀律的商業化峰谷計費體系。

SECTION 02 從預覽版到完整版:DeepSeek V4 發布時間線

DeepSeek V4 關鍵里程碑(2026)
時間 事件
4 月 24 日 V4 預覽版上線並開源(MIT),含 V4-Pro(1.6T)與 V4-Flash(284B)
5 月 V4-Flash 與 V4-Pro 生產調優版本上線,API 正式可用
6 月 V4-Pro 輸出價永久降價 75%($0.87/M tokens),定格史上最具性價比區間
6 月 29 日 DeepSeek 向全體 API 使用者發郵件,預告 GA 將於 7 月中旬上線,首次披露峰谷計費
7 月 19 日 多位開發者獲 GA 灰度內測資格,媒體報導「完整版最快明日發布」
7 月 20 日 GA 正式版上線(本文發布日)
7 月 24 日 舊介面 deepseek-chatdeepseek-reasoner 永久下線

SECTION 03 V4-Pro 與 V4-Flash 技術架構:1M 上下文如何落地?

DeepSeek V4 模型家族規格對照
規格 V4-Pro V4-Flash
總參數量 1.6 萬億(1.6T) 2840 億(284B)
每 Token 激活參數 490 億(49B) 130 億(13B)
Transformer 層數 61 層 43 層
上下文視窗 1,000,000 tokens 1,000,000 tokens
最大輸出 384K tokens 384K tokens
精度 FP4(專家權重)+ FP8(其餘) FP4 + FP8 混合
預訓練資料量 33T+ tokens 32T+ tokens
開源協議 MIT MIT

傳統 Transformer 在 KV Cache 上的記憶體隨上下文線性增長,1M token 幾乎不可行。DeepSeek V4 透過三項架構革新解決:

  • 混合注意力(CSA + HCA):壓縮稀疏注意力(CSA)將 KV 序列經 Softmax 門控池化壓縮 4 倍,再以 FP4「閃電索引器」做 top-k 稀疏選擇(Pro 選 top-1024,Flash 選 top-512),並保留最近 128 token 滑動視窗;重度壓縮注意力(HCA)將 token 壓縮 128 倍做全域密集注意力,與 CSA 交替互補。1M 上下文下推理 FLOPs 僅為 V3.2 的 27%,KV Cache 記憶體僅 10%(Flash 低至 7%)。
  • 流形約束超連接(mHC):四通道殘差流 + 雙隨機矩陣約束(Birkhoff 多面體),使 61 層深網路訊號穩定傳播。
  • Muon 優化器:訓練採用 Muon(非 AdamW),經牛頓-舒爾茲正交化處理梯度,收斂更快、更穩定。
三種推理模式
模式 特點 適用場景
Non-think 無思維鏈,極速回應 簡單問答、路由分發
Think High 顯式推理(思維鏈標籤) 中等複雜任務、程式碼除錯
Think Max 最大推理力度,需 384K+ 上下文 複雜數學、長鏈路 Agent

官方推薦取樣參數:temperature=1.0, top_p=1.0(全模式通用)。

SECTION 04 Benchmark 評測:開源之王的成績單

V4-Pro 核心評測數據
基準測試 DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified 80.6%(開源最高) 96.0% 未單獨公布 ~69%
SWE-bench Pro 55.4% 80.3% 78.1% 69.2%
LiveCodeBench (Pass@1) 93.5% 88.1% 87.4% 83.2%
Codeforces Elo 3,206
Terminal-Bench 2.1 83.9% 88.0% 85.1% 82.7%

根據 Artificial Analysis 評測:Claude Fable 5 在 Strategy & Ops 指數任務每次花費 $3.48(得分 50),DeepSeek V4-Pro 同類任務僅 $0.03(得分 38)——成本相差 116 倍,得分差距約 12 分(31%)。V4-Flash 六類指數任務每次均低於 $0.04

SECTION 05 DeepSeek V4 對照 GPT-5.6 與 Claude Fable 5:該選誰?

三方旗艦定位差異
維度 DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
開源 / 可自託管 MIT,支援 閉源 閉源
上下文視窗 1M tokens 未公開 1M tokens
API 輸出價(平時) $0.87/M ~$15/M $50/M
峰值輸出價 $1.74/M
程式碼能力 極強(接近 Fable 5) 極強 最強(SWE-bench Pro 領先)
資料隱私 可私有部署 雲端 only 雲端 only
  • 預算有限 / 高頻呼叫 / 私有部署:首選 V4-Pro 或 V4-Flash;
  • 極致程式碼能力、不在乎成本:選 Claude Fable 5(SWE-bench Pro 80.3%);
  • 複雜演算法 + 數學推理:選 GPT-5.6 Sol / Ultra;
  • 超大規模日誌/文件處理(低成本):V4-Flash 快取命中輸入僅 $0.0028/M。

SECTION 06 DeepSeek 峰谷計費怎麼算?四條省錢策略

GA 版最受關注的變化:類似電網分時電價,工作日高峰時段費率翻倍(北京時間 09:00–12:00、14:00–18:00)。

V4-Pro / V4-Flash 完整價格表(每百萬 Token)
模型 計費項 平時(Off-Peak) 高峰(Peak)
V4-Pro 輸入(快取命中) ¥0.025 / $0.0035 翻倍
V4-Pro 輸入(快取未命中) ¥3.00 / $0.435 ¥6.00 / $0.87
V4-Pro 輸出 ¥6.00 / $0.87 ¥12.00 / $1.74
V4-Flash 輸入(快取命中) ¥0.02 / $0.0028 翻倍
V4-Flash 輸入(快取未命中) ¥1.00 / $0.14 ¥2.00 / $0.28
V4-Flash 輸出 ¥2.00 / $0.28 ¥4.00 / $0.56
  • 非即時任務排到非高峰:批次文件處理、資料標註、程式碼審查安排在 18:00 之後或 09:00 之前;
  • 善用 Prompt Cache:V4-Flash 快取命中僅 $0.0028/M,重複 System Prompt 務必結構化前置;
  • Flash 做分流:簡單意圖識別用 V4-Flash,複雜推理再轉 V4-Pro;
  • 關注郵件通知:DeepSeek 承諾計費變更前 24 小時發郵件提醒。

即使高峰期,V4-Pro 輸出 $1.74/M 仍比 Claude Opus 4.8($15/M)與 GPT-5.6 Sol(約 $15/M)便宜 8.6 倍

SECTION 07 deepseek-chat 停用前 API 遷移:六步實操指南

重要警告:舊模型名 deepseek-chatdeepseek-reasoner 將於 2026 年 7 月 24 日 15:59 UTC(北京時間 23:59)永久停止存取。

遷移對應關係
舊模型名 新模型名 備註
deepseek-chat deepseek-v4-flash(非思考模式) 速度快,適合輕量任務
deepseek-reasoner deepseek-v4-flash(思考模式) 或升級 deepseek-v4-pro 取得更強推理
  1. 全庫搜尋舊模型名:在程式碼庫、CI 設定、環境變數中搜尋 deepseek-chatdeepseek-reasoner,列出所有呼叫點。
  2. 確定目標模型:輕量對話 → deepseek-v4-flash;複雜推理 → deepseek-v4-pro + 思考模式。
  3. 更新 OpenAI SDK 呼叫:僅改 model 參數,base_url 保持 https://api.deepseek.com
  4. 設定思考模式(可選):透過 extra_body 啟用 thinking,預算 token 建議 8000 起。
  5. Staging 環境驗證:在 7 月 24 日前完成端到端回歸,重點測試 Agent 長鏈路與快取命中。
  6. 生產切換與監控:灰度發布新模型名,監控高峰時段帳單與延遲,確認峰谷計費符合預期。
migrate_api.py
# 舊寫法(7月24日後失效)
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

# 新寫法
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

V4 同時支援 OpenAI ChatCompletions 與 Anthropic Messages 格式,Anthropic SDK 僅需更新 model 參數,base_url 指向 https://api.deepseek.com 即可。

SECTION 08 可引用技術數據與權威來源

  • 開源紀錄:SWE-bench Verified 80.6%,與 Gemini 3.1 Pro 並列開源最高。
  • 上下文效率:1M token 場景 KV Cache 記憶體為 V3.2 的 10%(Flash 7%)。
  • 性價比:V4-Pro 輸出平時 $0.87/M,高峰 $1.74/M,仍遠低於閉源旗艦。
  • 遷移截止:2026-07-24 23:59 北京時間,舊介面永久下線。
  • 授權條款:V4-Pro 與 V4-Flash 均為 MIT,支援自託管與商業使用。
  • 取樣參數:官方推薦 temperature=1.0, top_p=1.0

以下權威來源可在發版後再次開啟連結核對技術細節與基準資料:

DeepSeek API 官方文件

arXiv:2606.19348 — DeepSeek V4 技術論文

Hugging Face:DeepSeek 模型倉庫

Artificial Analysis:模型性價比與 Intelligence Index

DeepSeek V4 GA 的價值不在於能否擊敗 Claude Fable 5 或 GPT-5.6(暫時還不能),而在於以極低成本提供開源最強性能。但若團隊需要在 Mac 上跑 iOS CI/CD、Metal 加速推理或 7×24 Agent 流水線,純 API 呼叫仍有短板:① 資料出境合規風險;② 本地 Mac 關機即斷流;③ 虛擬機跑 macOS 存在 Hypervisor 損耗與 Metal 相容問題。對於需要零損耗原生 Apple 算力、穩定 iOS CI/CD 與 AI Agent 自動化的生產環境,MACNOX 的雲端實體 Mac 節點通常是更優解:100% 蘋果原裝實體機、開放完整 Root 權限、無 Hypervisor 損耗、按天/週/月彈性下單。可參考Kimi K3 開源大模型評測DeepSeek 自研晶片與算力布局,以及GPT-5.6 Sol Ultra 數學推理評測

SECTION 09 常見問題 FAQ

DeepSeek V4 完整版和預覽版有什麼區別?

架構相同(MoE + CSA/HCA),GA 版在 Agent 任務、數學推理、程式碼生成上做了專項優化,並首次引入峰谷計費。預覽版能力已很強,完整版是生產級穩定性與商業化的升級。

峰谷計費高峰時段是幾點?

北京時間工作日 09:00–12:00 和 14:00–18:00 為高峰,費率翻倍。週末與假日按平時計價。

V4-Pro 和 V4-Flash 怎麼選?

Flash 更便宜、更快,適合路由分流與輕量任務;Pro 推理更強,適合複雜程式碼與長鏈路 Agent。建議 Flash 做第一道過濾,複雜任務升級 Pro。

deepseek-chat 還能用多久?

將於 2026 年 7 月 24 日 23:59(北京時間)永久下線。請在此之前遷移至 deepseek-v4-flashdeepseek-v4-pro

DeepSeek V4 能打敗 GPT-5.6 嗎?

綜合 benchmark 閉源旗艦仍領先,但 V4-Pro 在 LiveCodeBench、Codeforces 等演算法場景領先,且成本僅為 GPT-5.6 的約 1/17。選型應看場景與預算,而非單一分數。

可以自託管 DeepSeek V4 嗎?

可以。V4-Pro 與 V4-Flash 均以 MIT 協議開源,權重可在 Hugging Face 取得。生產級 1.6T MoE 推理需大規模 GPU 叢集,詳見DeepSeek 算力布局一文。