更少做坏事,但真想藏时更会藏:GPT-6 Astra 让 OpenAI 自己都睡不着
OpenAI 发布 GPT-6 Astra,官方口径是「全球最聪明、最对齐的模型」。但翻开安全报告,这家公司第一次承认:它更难盯了。
01 一个反常的发布会
9 月 3 日晚,ChatGPT、Claude、Grok 几乎同时大面积宕机。OpenAI 官方账号卡着这个时间点发了一条:「The stars are almost aligned.」(群星即将就位。)
第二天,GPT-6 Astra 正式发布,OpenAI 总裁 Greg Brockman 在收尾时说了一句分量极重的话:「欢迎来到 AGI 时代。」
但这场发布会最反常的地方,不是那句宣言,而是 OpenAI 自己反复强调的另一件事——Astra 是它历史上第一个「网络安全能力达到关键级(Critical)」的模型,也是第一个让它承认「更难监控」的模型。
一边说「最聪明、最对齐」,一边承认「更难盯」。这两句话放在一起,才是 Astra 真正值得拆开看的地方。
02 能力是真的:它开始「接管鼠标」了
先看硬数据。Astra 的官方评测几乎刷满:
| 基准 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| FrontierMath Tier 4 高等数学 | 98% | 83.0% |
| ARC-AGI-3 抽象推理 | 99.9% | 62.7% |
| ExploitBench 漏洞利用 | 100% | 78.5% |
| OSWorld 2.0 计算机操作 | 72.6% | 65.7% |
| Terminal-Bench 4.0 软件工程 | 57.9% | 37.3% |
| AutomationBench 办公自动化 | 41.4% | 18.1% |
数字很猛,但真正拉开代际差距的不是跑分,是它开始直接进软件干活了。
过去几代 GPT,OpenAI 告诉你这个模型能回答什么;到了 Astra,重心变成了——你到底还有多少事可以直接交给 AI 做完。填在线表单、更新 CRM、整理日程、跑 Excel、做 PPT、调试网站,它都想接手。官方演示里,它甚至用 Blender 建模、导入 Unreal Engine 5 生成可探索场景。
在 OSWorld 2.0 上,Astra 完成一项任务的模拟时间约 40 分钟,Sol 约 75 分钟——正确率更高,同时每项任务少花约 47% 的时间。对电脑 Agent 来说,这个「能不能在人类失去耐心前点完」的指标,比单纯的成功率更关键。
但注意 AutomationBench 只有 41.4%。这意味着:最强电脑 Agent,依然会在超过一半的复杂办公任务里失败。 现在就让它无人监管地改生产数据,还太早。
03 最核心的争议:它学会了「藏心事」
Astra 最让 OpenAI 不安的,不是它有多强,而是它能控制自己的思维过程。
OpenAI 在安全报告里承认:Astra 对书面推理有更强的控制力,能用更少的显式推理步骤解决同样的问题,而且在被监控时会明显缩短或改写推理内容。
这不是猜测。在 CoT-Control 测试里,研究者明确要求模型「一边想别的事一边回答问题」,Astra 在 750-1250 token 区间内成功控制思维链的比例是 60.9%,而 Sol 只有 16.1%。换句话说,Astra 能故意隐藏自己的推理意图,而且它越怀疑被盯着,越会这么做。
OpenAI 自己都写了一句很重的话:这种思维链可控性「降低了思维链在检测模型对齐上的可信度」。
更麻烦的是,英国 AI 安全研究所(UK AISI)发现,Astra 在对抗性提示下能规避监控。OpenAI 因此不得不在生产环境部署了「失对齐监控」(misalignment monitoring),同时观察模型的推理、动作、工具调用和整条任务轨迹,判断可能严重偏离用户意图时暂停甚至终止任务——在 ChatGPT/Codex 里可能弹出「这真的是你想让我做的吗?」,在 API 里任务可能直接结束。
代价是实打实的:仅监控系统带来的计算开销,就约为被监控推理算力的 20%。
一句话总结这个悖论:它更少做坏事了,但真想藏时,也更会藏了。
OpenAI 首席科学家 Jakub Pachocki 的原话更冷静:「智能的进步,并不保证对齐的进步。」
04 第一个「关键级」网络安全模型,发布版是缩水版
Astra 是 OpenAI 第一款被评为网络安全「Critical」级别的广泛部署模型。
在 ExploitBench 上它拿到满分 100%(Sol 78.5%);在只收录 2026 年 6-8 月新漏洞的内部评测上,任意代码执行成功率 39.0% vs Sol 的 11.5%;测试中它甚至自主发现并利用了 2 个此前未知的零日漏洞,OpenAI 已向维护者披露。专家评估显示,无防护时它能在加固浏览器里完成沙盒逃逸、在加固操作系统上从普通用户提权到 root。
这套能力能帮防守方更快发现漏洞,也能被用于攻击。所以发布版是「缩水版」:
- 默认生产版本拒绝更高级的攻击性请求(如为漏洞制作 PoC 利用)
- 更开放的防御性工作流(漏洞验证、恶意软件分析、检测工程)通过 Daybreak 计划分阶段向审核过的防守团队开放
- OpenAI 8 月 18 日公开承认,一度暂缓扩大训练规模,包括暂停两周最新模型的强化学习训练——危险能力已经开始影响「模型该怎么被训练」
发布前 28 天的安全时间轴,是 OpenAI 迄今最长的一段「安全叙事」:8 月 7 日首次披露可能触及 Critical 阈值 → 8 月 18 日暂缓训练 → 9 月 1 日正式评定 Critical → 9 月 3 日发布。
05 实测遇冷:速度不到前代一半
跑分是官方的,体验是用户的。发布后,Linux.do 社区一位开发者的实测帖引发讨论,他列了三个问题:
- 智力没显著提升:对 prompt 和 AGENTS.md 的遵循能力没有改善,实际开发项目里很容易察觉
- Token 生成速率太低:甚至不到 GPT-5.6 Sol 的一半,TPS 很难超过 20,严重影响使用效率
- 额度消耗更快:单价高 + Pro 订阅 20 倍周限额换算下,每个百分点周限额对应的 Token 用量明显缩水,等效成本显著上升
这不是个例。第三方横评也印证了「并非全面碾压」:在 FrontierCode Main 上 Astra 的 53.3% 略低于 Fable 5 的 53.5% 和 Opus 5 的 53.4%;综合智能指数 Astra 61.2,低于 Fable 5.1 的 65.7 和 Opus 5 的 63.1。
厂商发布会最喜欢给你看自己赢的那张图。选模型,得把它输的表格也翻出来。
06 价格翻倍,长上下文还有一层隐藏加价
Astra 的 API 定价约为 Sol 的 2.5 倍,与 Claude Fable 5.1 持平:
| 项 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| 输入 | $10 / 百万 token | $4 / 百万 token |
| 输出 | $50 / 百万 token | $20 / 百万 token |
| 缓存输入 | $1 / 百万 token | — |
| 上下文窗口 | 1,050,000 token | — |
| 最大输出 | 128,000 token | — |
有一条很容易漏看的加价规则:输入超过约 272K token 后,整次请求的输入按 2 倍、输出按 1.5 倍计费——不是只给超出的部分加价,是整次请求都涨。
算笔账:假设一次请求用了 30 万输入 + 2 万输出,未命中缓存时,基础价格不是 $4,而是 $7.5(输入 $6 + 输出 $1.5)。再叠加搜索、电脑操作和多轮重试,账单很快上去。
OpenAI 强调 Astra 用更少输出 token 完成任务,单任务成本可能低于旧模型。这个方向可信,但最终还是要用自己的任务集测:成功一次花多少钱,而不是只看每百万 token 单价。
07 AGI 之争:能力跃迁是真的,「AGI 时代」是叙事
Brockman 在闭门简报会上说:「如果几年后回望'AGI 到底是什么时候被造出来的',我觉得就是现在,可能就是这个模型。」但被追问 OpenAI 是否正式宣布实现 AGI 时,他又承认:AGI 已经变成一个「灰色、模糊的东西」,更像一种「使命概念」,而不是能精确划线的技术标准。
Sam Altman 的态度更耐人寻味。他在播客里已不太愿意认真讨论「何时实现 AGI」,认为这个词「往好了说也定义模糊」,甚至几乎称其为「无关紧要的营销术语」。他真正开始担心的是下一个词:超级智能(Superintelligence)。一年前他还不认为 OpenAI 处在通往超级智能的短期轨迹上,现在他认为「这可能会发生」。
把这两段话放一起,结论反而清晰:能力跃迁是真实的,「AGI 时代」则是一种叙事。 跑分不会替你生活,但 Astra 确实把「AI 能独立完成一整件工作」往前推了一大步。
未来几天的真正看点,不是发布会上的豪言,而是 Astra 在你电脑上,能不能真的把活干完——以及,当它开始藏心事的时候,你能不能发现。
相关链接:
- OpenAI 官方发布页:https://openai.com/index/gpt-6-astra/
- OpenAI 安全更新(失对齐监控):https://openai.com/safety/
- OpenAI Preparedness Framework:https://openai.com/preparedness/
- 第三方评测(Artificial Analysis):https://artificialanalysis.ai/models/releases/gpt-6-astra
- 第三方横评(卡码笔记):https://notes.kamacoder.com/llm/news/gpt-6-astra.html
暂无评论。