凭什么敢把旗舰切给 Flash?答案藏在官方文档里
"把 V4 Pro 的请求全部路由到 V4.1 Flash,并按 Flash 单价计费"——DeepSeek 这条公告最反直觉的地方在于:一个模型发布,居然以另一个模型"退居二线"的方式官宣。
免不了有人问:凭什么?
公告本身没给理由。但我把 api-docs.deepseek.com 翻了一遍,发现答案早就写在官方文档里,一共三个数字。换防的时间线和前因后果之前写过,这篇只回答"凭什么"。
数字一:2500 对 500
官方价格页的"并发限制"一栏:deepseek-v4-flash 是 2500,deepseek-v4-pro 是 500。
一个旗舰模型的并发上限,只有自家 Flash 档的五分之一。
这不是 V4 Pro 做得不好,而是两个模型分工本就不同:Flash 为吞吐量而生,Pro 为天花板而生。所以"把 Pro 请求全部路由给 Flash"从容量角度看不是冒险,反而是把流量从单车道挪进八车道——Flash 的并发余量,吞下全部 Pro 流量绰绰有余。
顺带一提,官方定义的高峰时段是周一至周五 9 点到 12 点、14 点到 18 点(北京时间)。连午休 12 点到 14 点都算闲时——这个概念马上要用到。
数字二:一张完美的三倍价格表
把官方牌价放在一起,V4 Pro 和 V4 Flash 之间是一个整整齐齐的三倍关系(每百万 tokens):
| 项目 | V4 Flash 高峰 | V4 Pro 高峰 |
|---|---|---|
| 输入(缓存命中) | 0.10 元 | 0.30 元 |
| 输入(缓存未命中) | 3.0 元 | 9.0 元 |
| 输出 | 9.0 元 | 27.0 元 |
闲时再统统减半:输出 4.5 对 13.5,缓存命中输入低到 0.05 对 0.15 元。
而昨天的内测公告已经确认:V4.1 Flash 计费与 V4 Flash 相同。所以"按 V4.1 Flash 单价计费"翻译成钱就是——同样一批请求,高峰时段账单直接除以三,闲时批处理再除以二。
对常驻 Agent 任务,缓存命中的输入 token 是消耗大头,0.30 到 0.10 元的降幅在长对话场景里最实在。
数字三:能力配置,几乎是同一张表
价格表往上翻是"模型细节"栏。这一栏里,两个模型几乎长一个样:
- 上下文长度:都是 1M
- 最大输出:都是 384K
- JSON Output、Tool Calls、Responses API、Anthropic API、对话前缀续写:全支持
- 思考模式:都支持 low / high / max 三档
旗舰的"特权"只剩更新日志里那几分:V4 Pro 正式版 Terminal Bench 87.9 对 Flash 82.7,DeepSWE 62.7 对 54.4。在 3 倍价格、5 倍并发缺口的背景下,这点差距撑不起一个独立的旗舰档位。
更关键的是更新日志里这句话:上一代 V4-Flash(0731)发布时,官方口径就是"基准测试远超 V4-Pro-Preview"。Flash 代际跃迁、反超上一代 Pro,是 DeepSeek 上演过一次的剧本——这次的"全面超越",是第二次。
给 API 用户的四条行动清单
结合官方文档和这次路由调整,能落地的动作很具体:
- 批处理挪到闲时。闲时价格是高峰的一半,这是官方写在价格表里的明牌,不用等路由生效就能省。
- 模型名主动切 deepseek-v4.1-flash。别把生产系统押在"自动路由"上——路由期间按哪个并发档计费、V4.1 Pro 上线后路由是否撤销,公告都没说。主动权在自己手里最稳。
- 切完跑一遍回归测试。模型换代,输出风格和能力边界会变,依赖具体行为的下游要重新验。
- 顺手试试 deepseek-v4-flash-vision-exp。它与 V4 Flash 同价(高峰输入 3.0 元、输出 9.0 元),官方口径是多模态 Agent 能力接近 Opus-4.8——等于多模态能力白送。
最后一句话
当"便宜三倍、并发五倍、配置相同、能力打平"同时成立,"旗舰"两个字就只剩定价意义了。
V4.1 Flash 已经在路上,V4.1 Pro 还没有影子。如果后者拉不开肉眼可见的差距,Pro 这个名字,恐怕真的要进博物馆了。
相关链接:
- DeepSeek 官方文档·更新日志:https://api-docs.deepseek.com/zh-cn/updates
- DeepSeek 官方文档·模型与价格:https://api-docs.deepseek.com/zh-cn/quick_start/pricing
- DeepSeek 开放平台:https://platform.deepseek.com/
暂无评论。