凭什么敢把旗舰切给 Flash?答案藏在官方文档里

凭什么敢把旗舰切给 Flash?答案藏在官方文档里

"把 V4 Pro 的请求全部路由到 V4.1 Flash,并按 Flash 单价计费"——DeepSeek 这条公告最反直觉的地方在于:一个模型发布,居然以另一个模型"退居二线"的方式官宣。

免不了有人问:凭什么?

公告本身没给理由。但我把 api-docs.deepseek.com 翻了一遍,发现答案早就写在官方文档里,一共三个数字。换防的时间线和前因后果之前写过,这篇只回答"凭什么"。

数字一:2500 对 500

官方价格页的"并发限制"一栏:deepseek-v4-flash 是 2500,deepseek-v4-pro 是 500。

一个旗舰模型的并发上限,只有自家 Flash 档的五分之一

这不是 V4 Pro 做得不好,而是两个模型分工本就不同:Flash 为吞吐量而生,Pro 为天花板而生。所以"把 Pro 请求全部路由给 Flash"从容量角度看不是冒险,反而是把流量从单车道挪进八车道——Flash 的并发余量,吞下全部 Pro 流量绰绰有余。

顺带一提,官方定义的高峰时段是周一至周五 9 点到 12 点、14 点到 18 点(北京时间)。连午休 12 点到 14 点都算闲时——这个概念马上要用到。

数字二:一张完美的三倍价格表

把官方牌价放在一起,V4 Pro 和 V4 Flash 之间是一个整整齐齐的三倍关系(每百万 tokens):

项目 V4 Flash 高峰 V4 Pro 高峰
输入(缓存命中) 0.10 元 0.30 元
输入(缓存未命中) 3.0 元 9.0 元
输出 9.0 元 27.0 元

闲时再统统减半:输出 4.5 对 13.5,缓存命中输入低到 0.05 对 0.15 元。

而昨天的内测公告已经确认:V4.1 Flash 计费与 V4 Flash 相同。所以"按 V4.1 Flash 单价计费"翻译成钱就是——同样一批请求,高峰时段账单直接除以三,闲时批处理再除以二。

对常驻 Agent 任务,缓存命中的输入 token 是消耗大头,0.30 到 0.10 元的降幅在长对话场景里最实在。

数字三:能力配置,几乎是同一张表

价格表往上翻是"模型细节"栏。这一栏里,两个模型几乎长一个样:

  • 上下文长度:都是 1M
  • 最大输出:都是 384K
  • JSON Output、Tool Calls、Responses API、Anthropic API、对话前缀续写:全支持
  • 思考模式:都支持 low / high / max 三档

旗舰的"特权"只剩更新日志里那几分:V4 Pro 正式版 Terminal Bench 87.9 对 Flash 82.7,DeepSWE 62.7 对 54.4。在 3 倍价格、5 倍并发缺口的背景下,这点差距撑不起一个独立的旗舰档位。

更关键的是更新日志里这句话:上一代 V4-Flash(0731)发布时,官方口径就是"基准测试远超 V4-Pro-Preview"。Flash 代际跃迁、反超上一代 Pro,是 DeepSeek 上演过一次的剧本——这次的"全面超越",是第二次。

给 API 用户的四条行动清单

结合官方文档和这次路由调整,能落地的动作很具体:

  1. 批处理挪到闲时。闲时价格是高峰的一半,这是官方写在价格表里的明牌,不用等路由生效就能省。
  2. 模型名主动切 deepseek-v4.1-flash。别把生产系统押在"自动路由"上——路由期间按哪个并发档计费、V4.1 Pro 上线后路由是否撤销,公告都没说。主动权在自己手里最稳。
  3. 切完跑一遍回归测试。模型换代,输出风格和能力边界会变,依赖具体行为的下游要重新验。
  4. 顺手试试 deepseek-v4-flash-vision-exp。它与 V4 Flash 同价(高峰输入 3.0 元、输出 9.0 元),官方口径是多模态 Agent 能力接近 Opus-4.8——等于多模态能力白送。

最后一句话

当"便宜三倍、并发五倍、配置相同、能力打平"同时成立,"旗舰"两个字就只剩定价意义了。

V4.1 Flash 已经在路上,V4.1 Pro 还没有影子。如果后者拉不开肉眼可见的差距,Pro 这个名字,恐怕真的要进博物馆了。


相关链接:

评论

暂无评论。

登录后可发表评论。