DeepSeek V4-Flash 正式版上线:Agent 能力翻倍,多项指标碾压 Pro 预览版

DeepSeek 今天(7月31日)下午通过 API 文档发布日志,宣布 DeepSeek-V4-Flash 正式版 API 上线公测,Agent 能力大幅增强,基准测试数据全面碾压 V4-Pro-Preview。

DeepSeek-V4-Flash 正式版公告

提升有多大

直接看数据:

基准测试 V4-Flash 0731 V4-Flash Preview V4-Pro Preview GLM-5.2 Opus-4.8
Terminal Bench 2.1 82.7 61.8 72.1 81.0 85.0
NL2Repo 54.2 39.4 38.5 48.9 69.7
Cybergym 76.7 38.7 52.7 - 83.1
DeepSWE 54.4 7.3 12.8 46.2 58.0
Toolathlon-Verified 70.3 49.7 55.9 59.9 76.2
Agents' Last Exam 25.2 15.8 16.5 23.8 25.7
AutomationBench 25.1 10.8 12.8 12.9 27.2
DSBench-FullStack 68.7 37.0 41.8 61.8 71.6
DSBench-Hard 59.6 25.8 31.1 54.5 71.7

几个值得关注的提升:

DeepSWE 从 7.3 → 54.4。 预览版在这个 Agent 核心基准上几乎不可用,正式版直接翻了 7 倍。这个指标衡量的是 AI 在真实软件工程任务中的自主修复能力。

Cybergym 从 38.7 → 76.7。 翻了一倍。Cybergym 是 Agent 在复杂交互环境中的任务完成能力测试,76.7 已经逼近 Opus-4.8 的 83.1。

DSBench 两档全部翻倍以上。 FullStack 从 37.0 → 68.7,Hard 从 25.8 → 59.6。这是内部全栈开发和 Coding Agent 难题测试集,提升幅度说明后训练针对性很强。

Terminal Bench 2.1 从 61.8 → 82.7。 直接超过 V4-Pro Preview 的 72.1,逼近 Opus-4.8 的 85.0。作为一个轻量级(Flash)模型,这个成绩有点反常——不是 Flash 变强了,是 Pro Preview 之前太弱了。

怎么做到的

DeepSeek 在文档里说了:模型结构、尺寸和 Preview 保持一致,仅重新进行了后训练。

这意味着不是换架构,而是把后训练阶段彻底重做了一遍。Preview 阶段的后训练大概率是赶工产物,正式版用更充分的数据和方法重新训练了 Agent 能力。

对 Codex 生态的适配

正式版 V4-Flash 原生支持 Responses API 格式,并针对 Codex 进行了优化适配。这意味着 Codex 用户可以直接配置 V4-Flash 作为底层模型,不需要额外做格式转换。

响应式 API 格式是 OpenAI 在 GPT-5.6 系列引入的,支持流式工具调用、结构化输出。DeepSeek 直接兼容这个格式,说明他们在 API 层面的兼容策略没有变——继续做「OpenAI 兼容」的便宜替代。

跟 V4-Pro 的关系

注意两点:

  1. 本次只升级了 V4-Flash 的 API 接口,V4-Pro API 和 APP/WEB 端模型未做更改
  2. V4-Pro 正式版将会尽快发布

说明 V4-Pro 的正式版还没准备好。Flash 作为轻量级模型先跑通流程,Pro 版本还在打磨。从测试数据看,V4-Pro Preview 的很多指标已经被 Flash 正式版超过了,Pro 正式版如果不出点什么狠活,定位会有点尴尬。

跟 Opus-4.8 的差距

从整体来看,V4-Flash 0731 在 9 项测试中赢了 0 项,但也拉近了差距。Terminal Bench 2.1 从差 23 分缩小到差 2.3 分,AutomationBench 从差 16 分缩小到差 2 分。

但 DSBench-Hard 仍然是 59.6 vs 71.7,差 12 分——复杂 Coding Agent 任务还是 Opus-4.8 的统治区。


数据来源:DeepSeek API 文档发布日志,2026年7月31日

评论

暂无评论。

登录后可发表评论。