DeepSeek 今天(7月31日)下午通过 API 文档发布日志,宣布 DeepSeek-V4-Flash 正式版 API 上线公测,Agent 能力大幅增强,基准测试数据全面碾压 V4-Pro-Preview。
提升有多大
直接看数据:
| 基准测试 | V4-Flash 0731 | V4-Flash Preview | V4-Pro Preview | GLM-5.2 | Opus-4.8 |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 | 81.0 | 85.0 |
| NL2Repo | 54.2 | 39.4 | 38.5 | 48.9 | 69.7 |
| Cybergym | 76.7 | 38.7 | 52.7 | - | 83.1 |
| DeepSWE | 54.4 | 7.3 | 12.8 | 46.2 | 58.0 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 | 59.9 | 76.2 |
| Agents' Last Exam | 25.2 | 15.8 | 16.5 | 23.8 | 25.7 |
| AutomationBench | 25.1 | 10.8 | 12.8 | 12.9 | 27.2 |
| DSBench-FullStack | 68.7 | 37.0 | 41.8 | 61.8 | 71.6 |
| DSBench-Hard | 59.6 | 25.8 | 31.1 | 54.5 | 71.7 |
几个值得关注的提升:
DeepSWE 从 7.3 → 54.4。 预览版在这个 Agent 核心基准上几乎不可用,正式版直接翻了 7 倍。这个指标衡量的是 AI 在真实软件工程任务中的自主修复能力。
Cybergym 从 38.7 → 76.7。 翻了一倍。Cybergym 是 Agent 在复杂交互环境中的任务完成能力测试,76.7 已经逼近 Opus-4.8 的 83.1。
DSBench 两档全部翻倍以上。 FullStack 从 37.0 → 68.7,Hard 从 25.8 → 59.6。这是内部全栈开发和 Coding Agent 难题测试集,提升幅度说明后训练针对性很强。
Terminal Bench 2.1 从 61.8 → 82.7。 直接超过 V4-Pro Preview 的 72.1,逼近 Opus-4.8 的 85.0。作为一个轻量级(Flash)模型,这个成绩有点反常——不是 Flash 变强了,是 Pro Preview 之前太弱了。
怎么做到的
DeepSeek 在文档里说了:模型结构、尺寸和 Preview 保持一致,仅重新进行了后训练。
这意味着不是换架构,而是把后训练阶段彻底重做了一遍。Preview 阶段的后训练大概率是赶工产物,正式版用更充分的数据和方法重新训练了 Agent 能力。
对 Codex 生态的适配
正式版 V4-Flash 原生支持 Responses API 格式,并针对 Codex 进行了优化适配。这意味着 Codex 用户可以直接配置 V4-Flash 作为底层模型,不需要额外做格式转换。
响应式 API 格式是 OpenAI 在 GPT-5.6 系列引入的,支持流式工具调用、结构化输出。DeepSeek 直接兼容这个格式,说明他们在 API 层面的兼容策略没有变——继续做「OpenAI 兼容」的便宜替代。
跟 V4-Pro 的关系
注意两点:
- 本次只升级了 V4-Flash 的 API 接口,V4-Pro API 和 APP/WEB 端模型未做更改
- V4-Pro 正式版将会尽快发布
说明 V4-Pro 的正式版还没准备好。Flash 作为轻量级模型先跑通流程,Pro 版本还在打磨。从测试数据看,V4-Pro Preview 的很多指标已经被 Flash 正式版超过了,Pro 正式版如果不出点什么狠活,定位会有点尴尬。
跟 Opus-4.8 的差距
从整体来看,V4-Flash 0731 在 9 项测试中赢了 0 项,但也拉近了差距。Terminal Bench 2.1 从差 23 分缩小到差 2.3 分,AutomationBench 从差 16 分缩小到差 2 分。
但 DSBench-Hard 仍然是 59.6 vs 71.7,差 12 分——复杂 Coding Agent 任务还是 Opus-4.8 的统治区。
数据来源:DeepSeek API 文档发布日志,2026年7月31日
暂无评论。