首頁 / 部落格 / V4 Flash
ENGINEERING_BLOG · 2026.08.05

DeepSeek V4 Flash 正式版上線:
跑分緊逼 Opus 4.8,價格只要幾十分之一

7 月 31 日,DeepSeek 將 V4-Flash 升級為官方構建 DeepSeek-V4-Flash-0731:參數規模不變、僅重跑後訓練,Agent 跑分卻反超更大的 V4-Pro 預覽版,API 定價約為 Claude Opus 4.8 的幾十分之一。本文面向正在評估 DeepSeek API 遷移與國產開源大模型選型的開發者與技術決策者,嚴謹梳理 4 月預覽至 8 月 5 日發稿時的時間線、核心定價與架構數據、與 Kimi K3Qwen3.8-Max 的橫向對照,並拆解 Harness 跑分爭議與「斬殺線」產業背景。旗艦 V4-Pro 官方版與自研 Agent 框架 Harness 截至發稿仍未上線。

SECTION 01 V4-Flash 正式版選型痛點:跑分亮眼,Pro 與 Harness 卻還沒來

  • 誤讀「正式版」= 新模型:0731 構建與 4 月預覽版參數與結構完全相同,效能提升來自後訓練重跑,而非擴參;
  • V4-Pro 官方版仍未 GA:目前僅有 4 月預覽版 API,changelog 原話為「盡快發佈」,網傳 8 月 10–20 日窗口未經官方證實
  • Agent 跑分高度依賴 Harness:Terminal Bench 2.0 等數字均以尚未公開發佈的 Harness「極簡模式」測得,官方亦提示對框架選擇極為敏感;
  • 舊介面已停用:deepseek-chat / deepseek-reasoner 於 7 月 24 日退役,未遷移的生產呼叫面臨中斷;
  • 僅 API 更新:7 月 31 日正式版僅限 API,App 與網頁端截至發稿未同步,消費端體驗與 API 能力存在落差;
  • 第三方綜合指數並非第一:Artificial Analysis Intelligence Index 上 V4-Flash 約 50 分,低於 Kimi K3(57)與 GLM-5.2,DeepSeek 打的是「夠用智能 + 極致低價」而非跑分榜首。

這不是一次新模型發佈,而是同一個 284B 參數模型重新做了一遍後訓練——Flash 在多項 Agent 基準上反而超過 1.6T 的 V4-Pro 預覽版,印證 2026 年下半年後訓練品質正在逼近甚至超越單純堆參數。

SECTION 02 DeepSeek V4 時間線與核心定價數據一覽

  • 2026 年 4 月 24 日:V4 預覽版首次發佈並開源,含 V4-Pro(1.6T/49B 激活)與 V4-Flash(284B/13B 激活),均支援 100 萬 token 上下文,MIT 授權;
  • 2026 年 7 月 24 日:舊介面 deepseek-chatdeepseek-reasoner 正式停用,流量切換至 V4 系列命名;
  • 2026 年 7 月 27 日:月之暗面 Kimi K3(2.8T)開源權重上線 Hugging Face,形成直接競爭壓力;
  • 2026 年 7 月 31 日:DeepSeek-V4-Flash-0731 進入 API 公測,開源權重同步 MIT 上線,changelog 首次點名自研 Agent 框架 Harness「即將發佈」;
  • 截至 2026 年 8 月 5 日:V4-Pro 官方版仍為「盡快發佈」;部分中文媒體援引未署名消息稱內部測試於 7 月 28 日當週啟動,GA 窗口或在 8 月 10–20 日——未經 DeepSeek 官方證實
主流模型定價與參數對照(廠商自報,截至 2026-08-05)
模型 狀態 總/激活參數 輸入價($/M,未命中/命中) 輸出價($/M)
V4-Flash-0731 官方正式版 284B / 13B $0.14 / $0.0028 $0.28
V4-Pro 預覽版(官方版未發佈) 1.6T / 49B $0.435 / $0.003625 $0.87
Kimi K3 權重開源(07-27) 2.8T / 約 104B(社群估算) $3.00 / $0.30 $15.00
GLM-5.2 開源(2026 年 6 月) ~744B / ~40B 本文未獨立核實 本文未獨立核實
Qwen3.8-Max API GA(08-02),權重待放出 2.4T / 95B $2.00 / ~$0.17–0.25 $6.00
定價說明 均為廠商自報;DeepSeek 已預告高峰時段 2 倍加價(北京時間 9–12 點、14–18 點),生效日期待公布

SECTION 03 效能怎麼「變出來」:後訓練、CSA+HCA 與 Harness 框架

V4-Flash-0731 在參數規模與模型結構上與 4 月預覽版完全相同,官方明確效能提升「完全來自重新進行的後訓練」。技術報告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》描述三項架構改動(延續自預覽版):

  • 混合注意力(CSA + HCA):對外統一稱 DSA 稀疏注意力,降低長上下文運算與顯存開銷;
  • 流形約束超連接(mHC):改進傳統殘差連接;
  • Muon 優化器:替換傳統優化器,提升訓練收斂速度與穩定性。

官方數據(廠商自報,未見獨立第三方複現):在 100 萬 token 上下文下,V4-Pro 單 token 推理 FLOPs 僅為 V3.2 的 27%,KV Cache 佔用僅為 10%

7 月 31 日 changelog 首次正式出現 DeepSeek Harness——自研 Agent 執行框架,對標 Claude Code,用於檔案讀寫、工具呼叫與端到端工程任務。此前 DeepSeek 模型主要依賴 Claude Code、OpenCode 等第三方 Agent 工具。官方 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)全部用 Harness「極簡模式」測得(max 檔位、top_p=0.95、temperature=1.0),框架尚未公開發佈。changelog 原話:「跑分對 harness 的選擇非常敏感,不能簡單等同於模型本身能力的提升。」

Artificial Analysis 第三方指數與單任務成本(獨立評測,經財經媒體轉引)
模型 Intelligence Index 單任務平均成本 相對 V4-Flash 成本倍數
V4-Flash-0731 50 $0.03
Kimi K3 57 $0.86 約 29×
GPT-5.6 Sol 高 9+ 分 $1.86 約 62×
Claude Fable 5 高 9+ 分 $3.15 約 105×
解讀 智能分並非最高,但單任務成本極低——目標使用者是大規模 Agent 與批次呼叫場景

SECTION 04 跑分爭議拆解與 6 步 API 遷移實操

幾個須明確標註、避免過度解讀的爭議點:

  • Harness 依賴:V4-Flash-0731 Terminal Bench 2.0 得 82.7(V4-Pro 預覽 67.9),均基於未公開 Harness 極簡模式,不宜直接橫向套用到 Claude Code、Cursor 等框架;
  • 可用性問題:據 21 世紀經濟報導援引海外開發者回饋,正式版存在輸入快取命中率偏低、安全分類器偶發逾時等現象;
  • 融資與 IPO 傳聞:多家財經媒體報導約 74 億美元融資、487 億美元估值等數字,目前主要來自「據報導」「消息人士稱」,尚無 DeepSeek 官方或監管備案直接確認
  1. 核對 model 名:確認生產環境使用 deepseek-v4-flash(自動指向 0731 官方構建),勿再呼叫已停用的 deepseek-chat / deepseek-reasoner
  2. 檢查接入協定:OpenAI ChatCompletions 與 Anthropic 格式 API 均相容,現有 SDK 通常無需改程式結構;
  3. 評估快取策略:快取命中輸入僅 $0.0028/M,長上下文 Agent 任務應啟用並監控命中率(社群回饋命中率可能偏低);
  4. 規劃峰谷計費:DeepSeek 已預告工作日高峰 2 倍加價,批次任務盡量避開北京時間 9–12 點、14–18 點;
  5. 業務場景 A/B:在自有工作負載上與 Kimi K3、Qwen3.8-Max 盲測,勿僅依賴廠商 Harness 跑分;
  6. 區分 API 與消費端:7 月 31 日更新僅限 API,App/網頁端截至發稿未同步——面向終端使用者的產品須單獨驗證體驗。
deepseek-v4-flash-api.py
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_API_KEY",
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Summarize V4-Flash-0731 vs preview."}]
)
print(response.choices[0].message.content)

SECTION 05 「斬殺線」產業背景、可引用數據與選型結論

  • 284B / 13B 激活 + MIT 開源:0731 官方版權重已上線 Hugging Face,可商用微調與再分發;
  • 相對 Claude Opus 4.8 價格差:據 21 世紀經濟報導,快取未命中輸入約便宜 36 倍、快取命中約 179 倍、輸出約 89 倍(廠商標價,非獨立稽核);
  • 預覽版 OpenRouter 七週第一:V4-Flash 預覽版曾連續七週穩坐 OpenRouter 呼叫量榜首,印證「夠用 + 極低價」策略的市場驗證;
  • 「斬殺線」:中文開發者社群流傳的說法——DeepSeek「夠用效能 + 極端低價」給同業設下生存門檻,友商須明顯超越效能或更低價格才有存在感,亦解釋同期 GPT-5.6 Luna 降價 80% 等密集調價;
  • 算力股反應平淡:7 月 31 日輝達、博通、AMD 等未明顯波動,市場已習慣「DeepSeek 式效率突破」敘事,與 2025 年初 R1 引發晶片股大跌形成對照。

V4-Pro 遲遲未 GA 前,中文社群曾戲稱梁文鋒「梁白開」(白等);0731 超預期後暱稱又變回「梁聖」——側面反映社群情緒對正式版發佈的敏感。

以下連結為官方與第三方來源,發版後請以最新頁面為準:

DeepSeek 官方 API 文件與更新日誌

Hugging Face:deepseek-ai/DeepSeek-V4-Flash 模型卡

Artificial Analysis:獨立模型評測與 Intelligence Index

若團隊基於 DeepSeek V4 建構 Agent 流水線,虛擬化 Mac 在 Xcode 編譯、Metal 加速與 iOS CI 場景存在效能損耗與相容性風險。對於需要零損耗原生算力、穩定 iOS CI/CD 與 AI Agent 7×24 自動化的生產環境,MACNOX 的雲端實體節點通常是更優解:100% 蘋果原裝實體機、開放完整 Root 權限、無 Hypervisor 損耗、按天/週/月彈性下單。更多 API 選型背景可參考 DeepSeek V4 滿血版定價與架構專題OpenRouter 7 月排行榜分析

SECTION 07 常見問題 FAQ

DeepSeek V4 和 V3.2 最大差別是什麼?

原生支援 100 萬 token 上下文,長上下文場景運算與顯存開銷大幅降低(官方數據:V4-Pro 百萬 token 下 FLOPs 為 V3.2 的 27%,KV Cache 為 10%)。V4 系列在 Agent 能力上做了專項最佳化,適配 Claude Code、OpenCode 等主流 Agent 工具。

日常應該選 V4 Flash 還是 V4 Pro?

一般對話、批次處理或大規模低成本 Agent 呼叫,V4-Flash-0731 官方版性價比更高,且 Agent 跑分已反超 V4-Pro 預覽版。更深世界知識或複雜推理且預算不敏感,可暫用 V4-Pro 預覽版,待官方版 GA 後再評估。

現在能用上 V4 Pro 官方版嗎?

截至 2026 年 8 月 5 日還不能。官方版僅有 V4-Flash-0731,且僅限 API。V4-Pro 官方版與 Harness 官方口徑為「盡快發佈」,網傳 8 月 10–20 日為未經證實的傳言。

DeepSeek 公布的跑分能直接相信嗎?

建議區分對待。SWE-bench Verified 等廣泛採用的第三方基準可信度較高;Terminal Bench 2.0 等 Agent 跑分用未公開 Harness 測得,官方亦提示對框架高度敏感,建議等社群用 Claude Code、Cursor 等獨立複現後再下結論。

對一般開發者有什麼實際影響?

使用 OpenAI 或 Anthropic 格式 API 接入 DeepSeek 無需改程式,deepseek-v4-flash 自動指向新官方版。若仍用已停用的 deepseek-chat / deepseek-reasoner,須盡快切換到 V4 命名(7 月 24 日已正式停用)。