等了整整三個月,DeepSeek V4 完整版(GA 正式版)終於在 2026 年 7 月 20 日正式上線。相較 4 月預覽版,正式版帶來 Agent、數學推理與程式碼生成的專項提升,並首次引入峰谷差異化計費。獨立開發者、AI 工程師與仍在使用 deepseek-chat 的團隊若需快速決策,本文完整涵蓋:預覽版→完整版時間線、V4-Pro/Flash 架構(CSA+HCA、mHC、Muon)、Benchmark 評測、與 GPT-5.6 / Claude Fable 5 橫向對照、峰谷計費省錢策略、7 月 24 日 API 遷移六步指南、可引用技術數據與 FAQ。
SECTION 01 DeepSeek V4 GA 上線前,開發者面臨哪些痛點?
- 舊介面即將下線:
deepseek-chat與deepseek-reasoner將於 7 月 24 日 23:59(北京時間)永久停用,生產環境程式碼若未遷移將面臨服務中斷; - 峰谷計費增加複雜度:GA 版首次依北京時間工作日高峰(09:00–12:00、14:00–18:00)翻倍計價,批次推理任務若未排程可能意外超支;
- 預覽版與完整版性能差:預覽版已很強,但 GA 在 Agent 編排、長鏈路程式碼生成上仍有可見提升,選型文件若停留在 4 月版本會低估正式版能力;
- 閉源旗艦成本壓力:Claude Fable 5 輸出約 $50/M、GPT-5.6 Sol 約 $15/M,高頻 API 呼叫團隊急需可自託管的 MIT 開源替代;
- 長上下文落地門檻:1M token 視窗紙面參數易得,KV Cache 記憶體才是瓶頸——需理解 V4 架構為何能把記憶體壓到 V3.2 的 10%。
一句話定位:DeepSeek V4 GA 是 2026 年開源大模型領域最重要的里程碑之一——以閉源旗艦 1/10 乃至 1/100 的成本,提供開源模型中無可爭議的最強綜合性能(SWE-bench Verified 80.6% 開源紀錄),同時首次建立有紀律的商業化峰谷計費體系。
SECTION 02 從預覽版到完整版:DeepSeek V4 發布時間線
| 時間 | 事件 |
|---|---|
| 4 月 24 日 | V4 預覽版上線並開源(MIT),含 V4-Pro(1.6T)與 V4-Flash(284B) |
| 5 月 | V4-Flash 與 V4-Pro 生產調優版本上線,API 正式可用 |
| 6 月 | V4-Pro 輸出價永久降價 75%($0.87/M tokens),定格史上最具性價比區間 |
| 6 月 29 日 | DeepSeek 向全體 API 使用者發郵件,預告 GA 將於 7 月中旬上線,首次披露峰谷計費 |
| 7 月 19 日 | 多位開發者獲 GA 灰度內測資格,媒體報導「完整版最快明日發布」 |
| 7 月 20 日 | GA 正式版上線(本文發布日) |
| 7 月 24 日 | 舊介面 deepseek-chat 與 deepseek-reasoner 永久下線 |
SECTION 03 V4-Pro 與 V4-Flash 技術架構:1M 上下文如何落地?
| 規格 | V4-Pro | V4-Flash |
|---|---|---|
| 總參數量 | 1.6 萬億(1.6T) | 2840 億(284B) |
| 每 Token 激活參數 | 490 億(49B) | 130 億(13B) |
| Transformer 層數 | 61 層 | 43 層 |
| 上下文視窗 | 1,000,000 tokens | 1,000,000 tokens |
| 最大輸出 | 384K tokens | 384K tokens |
| 精度 | FP4(專家權重)+ FP8(其餘) | FP4 + FP8 混合 |
| 預訓練資料量 | 33T+ tokens | 32T+ tokens |
| 開源協議 | MIT | MIT |
傳統 Transformer 在 KV Cache 上的記憶體隨上下文線性增長,1M token 幾乎不可行。DeepSeek V4 透過三項架構革新解決:
- 混合注意力(CSA + HCA):壓縮稀疏注意力(CSA)將 KV 序列經 Softmax 門控池化壓縮 4 倍,再以 FP4「閃電索引器」做 top-k 稀疏選擇(Pro 選 top-1024,Flash 選 top-512),並保留最近 128 token 滑動視窗;重度壓縮注意力(HCA)將 token 壓縮 128 倍做全域密集注意力,與 CSA 交替互補。1M 上下文下推理 FLOPs 僅為 V3.2 的 27%,KV Cache 記憶體僅 10%(Flash 低至 7%)。
- 流形約束超連接(mHC):四通道殘差流 + 雙隨機矩陣約束(Birkhoff 多面體),使 61 層深網路訊號穩定傳播。
- Muon 優化器:訓練採用 Muon(非 AdamW),經牛頓-舒爾茲正交化處理梯度,收斂更快、更穩定。
| 模式 | 特點 | 適用場景 |
|---|---|---|
| Non-think | 無思維鏈,極速回應 | 簡單問答、路由分發 |
| Think High | 顯式推理(思維鏈標籤) | 中等複雜任務、程式碼除錯 |
| Think Max | 最大推理力度,需 384K+ 上下文 | 複雜數學、長鏈路 Agent |
官方推薦取樣參數:temperature=1.0, top_p=1.0(全模式通用)。
SECTION 04 Benchmark 評測:開源之王的成績單
| 基準測試 | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6%(開源最高) | 96.0% | 未單獨公布 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
根據 Artificial Analysis 評測:Claude Fable 5 在 Strategy & Ops 指數任務每次花費 $3.48(得分 50),DeepSeek V4-Pro 同類任務僅 $0.03(得分 38)——成本相差 116 倍,得分差距約 12 分(31%)。V4-Flash 六類指數任務每次均低於 $0.04。
SECTION 05 DeepSeek V4 對照 GPT-5.6 與 Claude Fable 5:該選誰?
| 維度 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| 開源 / 可自託管 | MIT,支援 | 閉源 | 閉源 |
| 上下文視窗 | 1M tokens | 未公開 | 1M tokens |
| API 輸出價(平時) | $0.87/M | ~$15/M | $50/M |
| 峰值輸出價 | $1.74/M | — | — |
| 程式碼能力 | 極強(接近 Fable 5) | 極強 | 最強(SWE-bench Pro 領先) |
| 資料隱私 | 可私有部署 | 雲端 only | 雲端 only |
- 預算有限 / 高頻呼叫 / 私有部署:首選 V4-Pro 或 V4-Flash;
- 極致程式碼能力、不在乎成本:選 Claude Fable 5(SWE-bench Pro 80.3%);
- 複雜演算法 + 數學推理:選 GPT-5.6 Sol / Ultra;
- 超大規模日誌/文件處理(低成本):V4-Flash 快取命中輸入僅 $0.0028/M。
SECTION 06 DeepSeek 峰谷計費怎麼算?四條省錢策略
GA 版最受關注的變化:類似電網分時電價,工作日高峰時段費率翻倍(北京時間 09:00–12:00、14:00–18:00)。
| 模型 | 計費項 | 平時(Off-Peak) | 高峰(Peak) |
|---|---|---|---|
| V4-Pro | 輸入(快取命中) | ¥0.025 / $0.0035 | 翻倍 |
| V4-Pro | 輸入(快取未命中) | ¥3.00 / $0.435 | ¥6.00 / $0.87 |
| V4-Pro | 輸出 | ¥6.00 / $0.87 | ¥12.00 / $1.74 |
| V4-Flash | 輸入(快取命中) | ¥0.02 / $0.0028 | 翻倍 |
| V4-Flash | 輸入(快取未命中) | ¥1.00 / $0.14 | ¥2.00 / $0.28 |
| V4-Flash | 輸出 | ¥2.00 / $0.28 | ¥4.00 / $0.56 |
- 非即時任務排到非高峰:批次文件處理、資料標註、程式碼審查安排在 18:00 之後或 09:00 之前;
- 善用 Prompt Cache:V4-Flash 快取命中僅 $0.0028/M,重複 System Prompt 務必結構化前置;
- Flash 做分流:簡單意圖識別用 V4-Flash,複雜推理再轉 V4-Pro;
- 關注郵件通知:DeepSeek 承諾計費變更前 24 小時發郵件提醒。
即使高峰期,V4-Pro 輸出 $1.74/M 仍比 Claude Opus 4.8($15/M)與 GPT-5.6 Sol(約 $15/M)便宜 8.6 倍。
SECTION 07 deepseek-chat 停用前 API 遷移:六步實操指南
重要警告:舊模型名 deepseek-chat 與 deepseek-reasoner 將於 2026 年 7 月 24 日 15:59 UTC(北京時間 23:59)永久停止存取。
| 舊模型名 | 新模型名 | 備註 |
|---|---|---|
deepseek-chat |
deepseek-v4-flash(非思考模式) |
速度快,適合輕量任務 |
deepseek-reasoner |
deepseek-v4-flash(思考模式) |
或升級 deepseek-v4-pro 取得更強推理 |
- 全庫搜尋舊模型名:在程式碼庫、CI 設定、環境變數中搜尋
deepseek-chat與deepseek-reasoner,列出所有呼叫點。 - 確定目標模型:輕量對話 →
deepseek-v4-flash;複雜推理 →deepseek-v4-pro+ 思考模式。 - 更新 OpenAI SDK 呼叫:僅改
model參數,base_url保持https://api.deepseek.com。 - 設定思考模式(可選):透過
extra_body啟用 thinking,預算 token 建議 8000 起。 - Staging 環境驗證:在 7 月 24 日前完成端到端回歸,重點測試 Agent 長鏈路與快取命中。
- 生產切換與監控:灰度發布新模型名,監控高峰時段帳單與延遲,確認峰谷計費符合預期。
# 舊寫法(7月24日後失效)
client.chat.completions.create(
model="deepseek-chat",
messages=[...]
)
# 新寫法
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
V4 同時支援 OpenAI ChatCompletions 與 Anthropic Messages 格式,Anthropic SDK 僅需更新 model 參數,base_url 指向 https://api.deepseek.com 即可。
SECTION 08 可引用技術數據與權威來源
- 開源紀錄:SWE-bench Verified 80.6%,與 Gemini 3.1 Pro 並列開源最高。
- 上下文效率:1M token 場景 KV Cache 記憶體為 V3.2 的 10%(Flash 7%)。
- 性價比:V4-Pro 輸出平時 $0.87/M,高峰 $1.74/M,仍遠低於閉源旗艦。
- 遷移截止:2026-07-24 23:59 北京時間,舊介面永久下線。
- 授權條款:V4-Pro 與 V4-Flash 均為 MIT,支援自託管與商業使用。
- 取樣參數:官方推薦
temperature=1.0, top_p=1.0。
以下權威來源可在發版後再次開啟連結核對技術細節與基準資料:
arXiv:2606.19348 — DeepSeek V4 技術論文
Artificial Analysis:模型性價比與 Intelligence Index
DeepSeek V4 GA 的價值不在於能否擊敗 Claude Fable 5 或 GPT-5.6(暫時還不能),而在於以極低成本提供開源最強性能。但若團隊需要在 Mac 上跑 iOS CI/CD、Metal 加速推理或 7×24 Agent 流水線,純 API 呼叫仍有短板:① 資料出境合規風險;② 本地 Mac 關機即斷流;③ 虛擬機跑 macOS 存在 Hypervisor 損耗與 Metal 相容問題。對於需要零損耗原生 Apple 算力、穩定 iOS CI/CD 與 AI Agent 自動化的生產環境,MACNOX 的雲端實體 Mac 節點通常是更優解:100% 蘋果原裝實體機、開放完整 Root 權限、無 Hypervisor 損耗、按天/週/月彈性下單。可參考Kimi K3 開源大模型評測、DeepSeek 自研晶片與算力布局,以及GPT-5.6 Sol Ultra 數學推理評測。
SECTION 09 常見問題 FAQ
DeepSeek V4 完整版和預覽版有什麼區別?
架構相同(MoE + CSA/HCA),GA 版在 Agent 任務、數學推理、程式碼生成上做了專項優化,並首次引入峰谷計費。預覽版能力已很強,完整版是生產級穩定性與商業化的升級。
峰谷計費高峰時段是幾點?
北京時間工作日 09:00–12:00 和 14:00–18:00 為高峰,費率翻倍。週末與假日按平時計價。
V4-Pro 和 V4-Flash 怎麼選?
Flash 更便宜、更快,適合路由分流與輕量任務;Pro 推理更強,適合複雜程式碼與長鏈路 Agent。建議 Flash 做第一道過濾,複雜任務升級 Pro。
deepseek-chat 還能用多久?
將於 2026 年 7 月 24 日 23:59(北京時間)永久下線。請在此之前遷移至 deepseek-v4-flash 或 deepseek-v4-pro。
DeepSeek V4 能打敗 GPT-5.6 嗎?
綜合 benchmark 閉源旗艦仍領先,但 V4-Pro 在 LiveCodeBench、Codeforces 等演算法場景領先,且成本僅為 GPT-5.6 的約 1/17。選型應看場景與預算,而非單一分數。
可以自託管 DeepSeek V4 嗎?
可以。V4-Pro 與 V4-Flash 均以 MIT 協議開源,權重可在 Hugging Face 取得。生產級 1.6T MoE 推理需大規模 GPU 叢集,詳見DeepSeek 算力布局一文。