首页 / 博客 / V4 Flash
ENGINEERING_BLOG · 2026.08.05

DeepSeek V4 Flash正式版上线:
跑分逼近 Opus 4.8,价格只要几十分之一

7 月 31 日,DeepSeek 将 V4-Flash 升级为官方版 DeepSeek-V4-Flash-0731:参数规模不变、仅重训后训练,Agent 跑分反超更大的 V4-Pro 预览版,API 价格约为 Claude Opus 4.8 的几十分之一。本文面向正在评估 DeepSeek API 迁移与国产开源大模型选型的开发者与技术负责人,严格梳理 4 月预览至 8 月 5 日发稿时的时间线、核心定价与架构数据、与 Kimi K3Qwen3.8-Max 的横向对照,并拆解 Harness 跑分争议与「斩杀线」行业背景。旗舰 V4-Pro 官方版与自研 Agent 框架 Harness 截至发稿仍未上线。

SECTION 01 V4-Flash 正式版选型痛点:跑分好看,但 Pro 与 Harness 还没来

  • 误读「正式版」= 新模型:0731 构建与 4 月预览版参数与结构完全相同,性能提升来自后训练重跑,而非扩参;
  • V4-Pro 官方版仍未 GA:目前仅有 4 月预览版 API,changelog 原话为「尽快发布」,网传 8 月 10–20 日窗口未经官方证实
  • Agent 跑分高度依赖 Harness:Terminal Bench 2.0 等数字均用尚未公开发布的 Harness「极简模式」测得,官方亦提示对框架选择敏感;
  • 旧接口已停用:deepseek-chat / deepseek-reasoner 于 7 月 24 日退役,未迁移的生产调用面临中断;
  • API-only 更新:7 月 31 日正式版仅限 API,App 与网页端截至发稿未同步,消费端体验与 API 能力存在落差;
  • 第三方综合指数并非第一:Artificial Analysis Intelligence Index 上 V4-Flash 约 50 分,低于 Kimi K3(57)与 GLM-5.2,DeepSeek 打的是「够用智能 + 极致低价」而非跑分榜首。

这不是一次新模型发布,而是同一个 284B 参数模型重新做了一遍后训练——Flash 在多项 Agent 基准上反而超过了 1.6T 的 V4-Pro 预览版,印证 2026 年下半年后训练质量正在逼近甚至超过单纯堆参数。

SECTION 02 DeepSeek V4 时间线与核心定价数据一览

  • 2026 年 4 月 24 日:V4 预览版首次发布并开源,含 V4-Pro(1.6T/49B 激活)与 V4-Flash(284B/13B 激活),均支持 100 万 token 上下文,MIT 协议;
  • 2026 年 7 月 24 日:旧接口 deepseek-chatdeepseek-reasoner 正式停用,流量切换至 V4 系列命名;
  • 2026 年 7 月 27 日:月之暗面 Kimi K3(2.8T)开源权重上线 Hugging Face,形成直接竞争压力;
  • 2026 年 7 月 31 日:DeepSeek-V4-Flash-0731 进入 API 公测,开源权重同步 MIT 上线,changelog 首次点名自研 Agent 框架 Harness「即将发布」;
  • 截至 2026 年 8 月 5 日:V4-Pro 官方版仍为「尽快发布」;部分中文媒体援引未署名消息称内部测试于 7 月 28 日当周启动,GA 窗口或在 8 月 10–20 日——未经 DeepSeek 官方证实
主流模型定价与参数对照(厂商自报,截至 2026-08-05)
模型 状态 总/激活参数 输入价($/M,未命中/命中) 输出价($/M)
V4-Flash-0731 官方正式版 284B / 13B $0.14 / $0.0028 $0.28
V4-Pro 预览版(官方版未发布) 1.6T / 49B $0.435 / $0.003625 $0.87
Kimi K3 权重开源(07-27) 2.8T / 约 104B(社区估算) $3.00 / $0.30 $15.00
GLM-5.2 开源(2026 年 6 月) ~744B / ~40B 本文未独立核实 本文未独立核实
Qwen3.8-Max API GA(08-02),权重待放出 2.4T / 95B $2.00 / ~$0.17–0.25 $6.00
定价说明 均为厂商自报;DeepSeek 已预告高峰时段 2 倍加价(北京时间 9–12 点、14–18 点),生效日期待公布

SECTION 03 性能怎么「变出来」:后训练、CSA+HCA 与 Harness 框架

V4-Flash-0731 在参数规模与模型结构上与 4 月预览版完全相同,官方明确性能提升「完全来自重新进行的后训练」。技术报告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》描述三项架构改动(延续自预览版):

  • 混合注意力(CSA + HCA):对外统一称 DSA 稀疏注意力,降低长上下文计算与显存开销;
  • 流形约束超连接(mHC):改进传统残差连接;
  • Muon 优化器:替换传统优化器,提升训练收敛速度与稳定性。

官方数据(厂商自报,未见独立第三方复现):在 100 万 token 上下文下,V4-Pro 单 token 推理 FLOPs 仅为 V3.2 的 27%,KV Cache 占用仅为 10%

7 月 31 日 changelog 首次正式出现 DeepSeek Harness——自研 Agent 执行框架,对标 Claude Code,用于文件读写、工具调用与端到端工程任务。此前 DeepSeek 模型主要依赖 Claude Code、OpenCode 等第三方 Agent 工具。官方 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)全部用 Harness「极简模式」测得(max 档位、top_p=0.95、temperature=1.0),框架尚未公开发布。changelog 原话:「跑分对 harness 的选择非常敏感,不能简单等同于模型本身能力的提升。」

Artificial Analysis 第三方指数与单任务成本(独立评测,经财经媒体转引)
模型 Intelligence Index 单任务平均成本 相对 V4-Flash 成本倍数
V4-Flash-0731 50 $0.03
Kimi K3 57 $0.86 约 29×
GPT-5.6 Sol 高 9+ 分 $1.86 约 62×
Claude Fable 5 高 9+ 分 $3.15 约 105×
解读 智能分并非最高,但单任务成本极低——目标用户是大规模 Agent 与批量调用场景

SECTION 04 跑分争议拆解与 6 步 API 迁移实操

几个须明确标注、避免过度解读的争议点:

  • Harness 依赖:V4-Flash-0731 Terminal Bench 2.0 得 82.7(V4-Pro 预览 67.9),均基于未公开 Harness 极简模式,不宜直接横向套用到 Claude Code、Cursor 等框架;
  • 可用性问题:据 21 世纪经济报道援引海外开发者反馈,正式版存在输入缓存命中率偏低、安全分类器偶发超时等现象;
  • 融资与 IPO 传闻:多家财经媒体报道约 74 亿美元融资、487 亿美元估值等数字,目前主要来自「据报道」「消息人士称」,尚无 DeepSeek 官方或监管备案直接确认
  1. 核对 model 名:确认生产环境使用 deepseek-v4-flash(自动指向 0731 官方构建),勿再调用已停用的 deepseek-chat / deepseek-reasoner
  2. 检查接入协议:OpenAI ChatCompletions 与 Anthropic 格式 API 均兼容,现有 SDK 通常无需改代码结构;
  3. 评估缓存策略:缓存命中输入仅 $0.0028/M,长上下文 Agent 任务应启用并监控命中率(社区反馈命中率可能偏低);
  4. 规划峰谷计费:DeepSeek 已预告工作日高峰 2 倍加价,批量任务尽量避开北京时间 9–12 点、14–18 点;
  5. 业务场景 A/B:在自有工作负载上与 Kimi K3、Qwen3.8-Max 盲测,勿仅依赖厂商 Harness 跑分;
  6. 区分 API 与消费端:7 月 31 日更新仅限 API,App/网页端截至发稿未同步——面向终端用户的产品须单独验证体验。
deepseek-v4-flash-api.py
# OpenAI 兼容接口 — deepseek-v4-flash 自动指向 0731 官方版
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_API_KEY",
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Summarize V4-Flash-0731 vs preview."}]
)
print(response.choices[0].message.content)

SECTION 05 「斩杀线」行业背景、可引用数据与选型结论

  • 284B / 13B 激活 + MIT 开源:0731 官方版权重已上线 Hugging Face,可商用微调与再分发;
  • 相对 Claude Opus 4.8 价格差:据 21 世纪经济报道,缓存未命中输入约便宜 36 倍、缓存命中约 179 倍、输出约 89 倍(厂商标价,非独立审计);
  • 预览版 OpenRouter 七周第一:V4-Flash 预览版曾连续七周稳坐 OpenRouter 调用量榜首,印证「够用 + 极低价」策略的市场验证;
  • 「斩杀线」:中文开发者社区流传的说法——DeepSeek「够用性能 + 极端低价」给同行设下生存门槛,友商须明显超越性能或更低价格才有存在感,亦解释同期 GPT-5.6 Luna 降价 80% 等密集调价;
  • 算力股反应平淡:7 月 31 日英伟达、博通、AMD 等未明显波动,市场已习惯「DeepSeek 式效率突破」叙事,与 2025 年初 R1 引发芯片股大跌形成对比。

V4-Pro 迟迟未 GA 前,中文社区曾戏称梁文锋「梁白开」(白等);0731 超预期后昵称又变回「梁圣」——侧面反映社区情绪对正式版发布的敏感。

以下链接为官方与第三方来源,发版后请以最新页面为准:

DeepSeek 官方 API 文档与更新日志

Hugging Face:deepseek-ai/DeepSeek-V4-Flash 模型卡

Artificial Analysis:独立模型评测与 Intelligence Index

若团队基于 DeepSeek V4 构建 Agent 流水线,虚拟化 Mac 在 Xcode 编译、Metal 加速与 iOS CI 场景存在性能损耗与兼容性风险。对于需要零损耗原生算力、稳定 iOS CI/CD 与 AI Agent 7×24 自动化的生产环境,MACNOX 的云端物理节点通常是更优解:100% 苹果原装物理机、开放完整 Root 权限、无 Hypervisor 损耗、按天/周/月弹性下单。更多 API 选型背景可参考 DeepSeek V4 满血版定价与架构专题OpenRouter 7 月排行榜分析

SECTION 07 常见问题 FAQ

DeepSeek V4 和 V3.2 最大区别是什么?

原生支持 100 万 token 上下文,长上下文场景计算与显存开销大幅降低(官方数据:V4-Pro 百万 token 下 FLOPs 为 V3.2 的 27%,KV Cache 为 10%)。V4 系列在 Agent 能力上做了专项优化,适配 Claude Code、OpenCode 等主流 Agent 工具。

日常应该选 V4 Flash 还是 V4 Pro?

普通对话、批量处理或大规模低成本 Agent 调用,V4-Flash-0731 官方版性价比更高,且 Agent 跑分已反超 V4-Pro 预览版。更深世界知识或复杂推理且预算不敏感,可暂用 V4-Pro 预览版,待官方版 GA 后再评估。

现在能用上 V4 Pro 官方版吗?

截至 2026 年 8 月 5 日还不能。官方版仅有 V4-Flash-0731,且仅限 API。V4-Pro 官方版与 Harness 官方口径为「尽快发布」,网传 8 月 10–20 日为未经证实的传言。

DeepSeek 公布的跑分能直接相信吗?

建议区分对待。SWE-bench Verified 等广泛采用的第三方基准可信度较高;Terminal Bench 2.0 等 Agent 跑分用未公开 Harness 测得,官方亦提示对框架高度敏感,建议等社区用 Claude Code、Cursor 等独立复现后再下结论。

对普通开发者有什么实际影响?

使用 OpenAI 或 Anthropic 格式 API 接入 DeepSeek 无需改代码,deepseek-v4-flash 自动指向新官方版。若仍用已停用的 deepseek-chat / deepseek-reasoner,须尽快切换到 V4 命名(7 月 24 日已正式停用)。