17天,OpenAI把Codex的「无限用」收回了

7月12日,OpenAI产品主管Tibo在X上发了一条推文,三句话,炸了整个开发者社区:

暂时取消5小时限额 → GPT-5.6 Sol效率优化 → 600万活跃用户,全员额度重置

关键词不是「取消」,是「暂时」。

17天后,7月29日,Tibo又发了一条长推。这一次,他承认了五件事。

Tibo推了什么

7月29日,Tibo(@thsottiaux)在X上发了一条推文,标题是「大家好,Sol社区的各位」,核心内容三段:

第一段,宣布恢复限额。 原文说:「我们一直在深入调查发生了什么,并已经推出了多项改进。因此,我们预计在Sol的典型使用中,你的限额将持续大约长18%。你们中的一些人从今天起应该已经看到显著更大的改进。明天,我们还将恢复在调查期间临时暂停的五小时限额。」

第二段,列出五个问题。 这是整条推文最有价值的部分——OpenAI第一次公开承认了Sol的架构缺陷:

  1. GPT-5.6 Sol更愿意长时间工作,进行额外的工具调用,并在工具和子代理之间协调复杂的流程。 这让它更擅长解决难题,但有些任务消耗的资源远超预期
  2. Sol在相同的推理努力下也比之前模型更努力。 在Sol上的High模式可能比在GPT-5.5上的High模式消耗更多令牌
  3. 程序化工具调用,也称为代码模式,赋予了Sol更大的灵活性, 可以并行运行工具调用或在等待时继续工作。但这导致了每轮响应更多、缓存输入令牌更多,以及超出预期的更高使用量
  4. 当Sol等待工具调用完成或运行大量网络搜索时, 这种情况尤为明显。他们改进了处理这两种情况的方式
  5. 影响也非常不均衡。 中位数用户实际上发现Sol的令牌效率相当高,而一些处理更难任务的资深用户则看到他们的限额消耗得更快。他们在推出前非常关注平均和中位数使用量,忽略了一些长尾情况

第三段,认错。 原文:「Sol是Codex能力上的重大进步,但能力与效率并不总能同步提升,有些问题只有在人们大规模真实使用模型时才会显现。我们本该更早认识到这一点,并更坦诚地告知大家。」

17天时间线

先还原完整时间线:

  • 4月2日:Codex定价从按消息计费改为按token计费。开发者的长上下文、多轮修复开始被拆解成更细颗粒度的成本
  • 7月9日:GPT-5.6 Sol全量上线。Codex、ChatGPT Work和聊天合并进同一个桌面应用
  • 7月11日:社区炸锅——Plus用户12分钟烧掉40%额度,有人1.5小时触发5小时限额
  • 7月12日:Tibo宣布临时取消5小时限额,全员额度重置
  • 7月13-14日:用户数从600万飙到800万,每24小时涨100万
  • 7月29日:5小时限额官宣回归,GPT-5.6 Sol效率优化18%

这17天里发生了什么?表面上是用户狂欢——不限时了,敞开用。实际上是OpenAI在做一个大规模压力测试:当5小时窗口消失,周限额会以什么速度被消耗?

答案不太好看。有开发者两天打空整周额度,有人PRD还没跑完77%的周限额就没了。取消5小时限额只是把天花板升高了,但天花板上面的空间有限得可怕。

「无限用」从未存在

这是整件事最容易被忽略的一点。

取消5小时限额后,Codex并非真的无限用——它只是从「每5小时限一次」变成了「每周限一次」。周限额一直都在,而且Codex和ChatGPT Work共享同一个周额度池。

Tibo在推文里也明确说了:「明确地说,我们并没有减少任何订阅计划的使用量。」——对,没减少,但也没增加。

用一个不精确但直观的类比:5小时限额像商场限流——每次只放进去这么多人,但你一天可以进很多次。取消后变成会员日——进去不限时,但总消费额有上限。

对Plus用户($20/月)来说,一次多文件重构就能在三小时内打空周限额。5小时限额取消后,唯一的区别是你不用每5小时等一次了——但你一周可能只用两次就见底。

GPT-5.6 Sol:越强越费

5小时限额恢复的真正原因,就藏在Tibo列出的五个问题里。核心逻辑很清晰:

模型更强 → 工具调用更多 → 子Agent协作更频繁 → token消耗暴涨。

Tibo的推文把这条因果链拆解得很清楚。特别值得注意的是第三点——「代码模式」让Sol可以并行运行工具调用,或在等待时继续工作。这听起来是好事,但代价是每轮响应更多、缓存输入token更多。翻译成人话:以前模型在等工具返回结果时是闲着的,现在它边等边干——但边等边干也烧token。

18%的效率优化来自哪里?Tibo说他们改进了「工具等待」和「批量搜索」两个场景的调度逻辑。也就是说,让模型在等的时候别那么费。这是补丁,不是解决方案。

最诚实的是第五点——「影响非常不均衡」。中位数用户觉得Sol效率不错,但重度用户额度消耗飞快。OpenAI在推出前只看了平均和中位数,忽略了长尾。这就像高速公路按平均车速设计匝道——大多数车没问题,但大卡车永远在刹车。

代价清醒:109天重置23次

一位知乎用户做了统计:从3月27日到7月13日,109天内Codex完成了23次可核验的额度重置,其中19次直接重置,4次Banked Reset。

这不是正常的产品运营节奏——这是在救火。

每次重置背后都是一批撞墙的用户。OpenAI用重置来堵嘴,用取消限额来止血,但核心问题没变:AI编程Agent的计费模型和它的使用模式不匹配。

一个Agent任务的token消耗不是线性增长的。它会因为多步推理、工具调用、子Agent协作而指数级膨胀。现有的按订阅档位+5小时窗口+周限额的三层限制,本质上是为「对话式聊天」设计的,不是为「Agent式工作流」设计的。

17天的遗产

17天的「无限用」留下了什么?

用户侧: 体验过不限时的开发者回不去了。Reddit上最高赞评论是「Please just permanently remove the 5-hour usage limit」。

竞争侧: Anthropic的应对是延长Fable 5优惠期、提高Claude Code周限额50%。两家公司在用「谁给得多」抢开发者,但这种补贴战不可持续。

产品侧: OpenAI暴露了一个结构性矛盾——GPT-5.6 Sol越强,Agent能力越强,token消耗越大,用户体验越差。18%的效率优化是补丁,不是解决方案。

真正的解法可能不是优化5小时窗口,而是为Agent式工作流设计一套全新的计费模型。比如按任务完成度计费而非按token计费,比如区分「模型思考」和「工具等待」的计费逻辑,比如给Agent任务单独的额度池。

17天很短,但足以证明一件事:AI编程工具的下一个瓶颈,不是模型能力,是计费模型。


相关链接:

评论

暂无评论。

登录后可发表评论。