Claude Opus 5.5 发布:比肩 Fable,降价 40%【AI 早报 2026-09-23】
今日看点:Anthropic 发布 Claude Opus 5.5,Terminal-Bench 4.0 拿到 66.4% 并将输入价格压到每百万 token 4 美元;OpenAI 推出 GPT-6 Sol 与 Luna,Luna 输入价仅 0.1 美元,直接切入 DeepSeek 价格带;xAI、小米、字节跳动也同步更新模型与工具。
今日概览
- Claude Opus 5.5 发布:比肩 Fable,降价 40%
- OpenAI 发布 GPT-6 Sol 与 Luna,API 价格腰斩直逼 DeepSeek
- Grok 4.7 上线,加量不加价冲进编程第一梯队
- 小米开源 MiMo-V2.6 系列,347 万美元完成大规模 RL 训练
- 平头哥发布真武 V900:216GB 显存,千卡全带宽互联
- NVIDIA Isaac ROS 5.0 发布,引入 Agent 化机器人开发流程
- NVIDIA 推出 DSX Ready 认证,覆盖储能与液冷配电
- 字节跳动上线 Dramagic,全流程 AI 短剧生产平台
- 研究团队用 1200 亿 tokens 人类动作视频预训练机器人
大模型
1. Claude Opus 5.5 发布:比肩 Fable,降价 40%
Anthropic 正式发布 Claude Opus 5.5,这是 Claude 5.5 家族的首款模型,Sonnet 5.5 与 Haiku 5.5 将在未来几周跟进。官方将其定位为面向长时间编程 Agent 与知识工作的主力模型,称多数任务表现已达 Claude Fable 5.1 水平,典型任务成本相比 Opus 5 降低 40%,输出速度提高超过 30%。在 Terminal-Bench 4.0 中,Opus 5.5 得 66.4%,高于 GPT-6 Astra 的 57.9% 和 Opus 5 的 52.3%;CursorBench 4.0 从 46.6% 提升到 57.8%,GDPval-AA v2.1 取得 1846 Elo,超过 Fable 5.1 的 1735。OSWorld 2.0 电脑操作成绩从 74.0% 升至 81.8%,但 AutomationBench 40.0% 略低于 Astra 的 41.4%,Terminal-Bench-Science 58.7% 与 Astra 的 64.6% 仍有差距。长任务实测显示,Opus 5.5 在一天内完成了 68 万行代码迁移,20 万行代码库审计用时不到 3 小时,而 Opus 5 需超过 20 小时且 token 消耗约为其 2.5 倍;在 HAProxy 从 C 重写为 Rust 的测试中,Opus 5.5 用时 9.5 小时、成本比 Fable 5.1 低 51%。价格上,API 输入和输出分别为每百万 token 4 美元和 20 美元,比 Opus 5 低 20%,缓存读取价从 0.50 美元降至 0.20 美元;同时提供最高 2.5 倍速度的 Fast mode,价格为 8 美元/40 美元。模型支持 100 万 token 上下文与 12.8 万 token 最大输出,思考模式默认 medium,并已上线 Claude Code、Claude Platform 及 AWS、Google Cloud、Azure,API 名称为 claude-opus-5-5。Anthropic 还将 Pro、Max 和 Team 计划的五小时使用限额提高 20%,并给出一次有效期至 10 月 22 日的额度重置。 来源:https://www.ifanr.com/1681629?utm_source=rss&utm_medium=rss&utm_campaign=
2. OpenAI 发布 GPT-6 Sol 与 Luna,API 价格腰斩直逼 DeepSeek
OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,两款模型沿用与 GPT-6 Astra 相近的训练方法,把专业工作、事实准确性、编程、计算机操作和对齐能力带到更快、更便宜的层级。API 定价降至上一代约一半:Sol 从促销期的 4 美元/20 美元降至 2 美元/10 美元,Luna 从 0.2 美元/1.2 美元降至 0.1 美元/0.5 美元(每百万 token 输入/输出)。以 Luna 对照 DeepSeek V4.1 Flash,其闲时缓存未命中输入价约合人民币 1 元、输出 4 元,高峰为 2 元和 8 元,Luna 在普通新请求上已更便宜且没有峰谷波动;DeepSeek 的闲时缓存命中输入仍低至每百万 token 0.02 元。OpenAI 将降价归因于推理基础设施与缓存效率改善,Sam Altman 称完成任务的花费是核心指标,市场上没有产品能匹敌 Sol 和 Luna。在 AutomationBench 中,Sol 以 xhigh 推理强度得 33.2%,高于 Claude Opus 5 最大强度下的 26.9%,单项任务成本只有后者 9%;Agents' Last Exam 取得 56.4%,成本比 Opus 5 最高成绩低约 60%。编程方面,Sol 在 DeepSWE v1.1 得 68.8%,距离 Claude Fable 5 最高的 69.9% 只差 1.1 个百分点,单项成本约低 80%;Luna 得 66.6%,与 Opus 5 和 Fable 5 中等强度表现相近,成本分别低 93% 和 96%。OSWorld 2.0 离线测试中,Sol xhigh 得 60.5%,与 Claude Opus 5 medium 的 60.3% 基本相当,成本低约 80%。内部测试显示,Sol 的事实错误数量约为 GPT-5.6 Sol 的一半,并开始接近 Astra 的可靠性。 来源:https://www.ifanr.com/1681605?utm_source=rss&utm_medium=rss&utm_campaign=
3. Grok 4.7 上线,加量不加价冲进编程第一梯队
SpaceXAI 发布全新旗舰模型 Grok 4.7,官方定位为史上最强 Grok,专为编程和复杂知识工作设计,并强调加量不加价、速度不减。API 价格与 Grok 4.6 完全一致:输入每百万 token 2 美元、输出 6 美元,另提供速度翻倍的 Fast 版本,价格同步翻倍。编程基准上,Grok 4.7 在 Terminal-Bench 4.0 从上一代的 20.3% 跃升至 38.0%,超过 GPT-5.6 Sol Max 的 37.3%;CursorBench 4.0 超过 GPT-5.6 Sol 的 41.7%,但距离 Fable 5.1 Max 的 51.8% 仍有差距。Harvey Legal Agent Benchmark 以 19.6% 位列第一,EEBench 电气工程得到 64.0% 同样居首;GDPval 专业知识工作 Elo 分相比上一代明显提升,几乎追平 Fable 5.1。在 Artificial Analysis 综合智能指数上,Grok 4.7 得 46 分,仅比 Grok 4.6 高 2 分,低于 Fable 5.1 和 GPT-6 Astra 的 53 分,单模型排名第 16、实验室排名第四。安全层面,官方称采用了测试过的最强防护体系,HackerBench v0.3 仅放行 3.3% 的高风险双用途请求,LatchBio 基准得到 62.4%。安全公司 XBOW 实测显示,在 Grok Build 编排下 Grok 4.7 平均找出 68 个真实漏洞,高于 4.6 的 42 个,误报率从 18.2% 微降至 18.0%;在外部 harness 下 4.6 找到 72 个真实发现、4.7 为 65 个,误报率从 17.1% 升至 21.9%。Grok 4.7 当天已在 Cursor、Grok Build 可用,并开放 Grok API 及第三方 coding harness、模型路由平台和云服务商接入。 来源:https://mp.weixin.qq.com/s/kcgU_kczHpeahUbkno_j1w
4. 小米开源 MiMo-V2.6 系列,347 万美元完成大规模 RL 训练
小米于 9 月 22 日发布并开源 MiMo-V2.6 系列,包含 Pro 与 Flash 两款原生全模态模型,并推出最高 20 倍输出速度的 MiMo-V2.6-Pro-UltraSpeed。小米将此次发布明确放到 RSI 路线上:以可验证复杂任务为基础扩大强化学习算力,让模型在真实环境中探索、获得反馈并更新策略,形成自我改进闭环。MiMo 团队负责人罗福莉称,按计算量衡量这可能是开源模型团队迄今规模最大的单次 RL 训练之一,其研究创新和工程挑战已超过 DeepSeek R1。训练方法采用 MixRL 与 MOPD:代码及稳定验证信号任务放入 MixRL 共同训练,游戏、3D、主观评价和超高难度任务拆开训练后再由 MOPD 合并。公开的实时训练数据显示,两轮 RL 累计 150.5 万个样本、1564 亿 Token,总成本约 347 万美元,其中 Flash 约 85 万美元、Pro 约 262 万美元;单个 Step 训练量达 35 亿至 37 亿 Token,最高支持 100 万 Token 上下文。在 Artificial Analysis Intelligence Index v4.3 中,MiMo-V2.6-Pro 得 46.32,高于同期 Kimi K3 和 Qwen3.8 Max。API 价格上,Flash 缓存命中输入 0.0028 美元、非缓存输入 0.14 美元、输出 0.28 美元;Pro 为 0.0036 美元、0.435 美元和 0.87 美元;UltraSpeed 为 0.036 美元、4.35 美元和 8.7 美元。模型已进入 MiMo Desktop、MiMo Code、AI Studio、MiMo API 和 OpenRouter,同时新增 Vibe World 能力,可输入图片、视频或文字需求,由多个 Agent 完成 3D 场景搭建、交互逻辑和视觉验证,生成可运行的交互世界。 来源:https://mp.weixin.qq.com/s?__biz=Mzg3NDkyMTQ5Mw==&mid=2247501973&idx=1&sn=9f38a272742cc812eb095e13c9970061
算力与基础设施
5. 平头哥发布真武 V900:216GB 显存,千卡全带宽互联
平头哥在 2026 杭州云栖大会发布新一代训推一体 AI 芯片真武 V900,搭载 216GB 显存,片间互联带宽 1200GB/s,单芯片性能是上一代真武 M890 的 3 倍,是目前中国算力性能最强的 AI 芯片。该芯片原生支持 FP8 和 FP4,可覆盖高精度训练及低精度、超低精度推理,计划 2027 年第一季度量产,下一代真武 J900 将于 2028 年第三季度推出。对比上一代,M890 于 2026 年 5 月发布,拥有 144GB 显存和 800GB/s 片间互联带宽,性能为真武 810E 的 3 倍。通过自研 ICN Switch 互联芯片,真武 V900 超节点具备原生内存语义和内存统一编址能力,可实现千卡全带宽高速互联,让上千颗芯片像一颗超级芯片协同工作。客户方面,众擎机器人基于真武搭建千卡具身智能训练平台,端到端训练效率提升 34%,30 多个模型免适配直接跑通;小鹏将真武用于自动驾驶、智能座舱和企业大模型,披露整机性能比业界主流 GPU 提升 70%,集群故障数量减少 50%。截至目前,真武系列已服务超过 650 家企业客户,覆盖智驾、金融、大模型、具身智能、能源和制造等行业。平头哥同时展出磐脉智能网卡、镇岳 SSD 主控、倚天 CPU 路线图及磐久超节点服务器,把芯片、互联、网络和存储装进同一套算存网全栈系统。 来源:https://mp.weixin.qq.com/s?__biz=MTMwNDMwODQ0MQ==&mid=2653113988&idx=1&sn=18bc16d0dec8e51d78d66eebf7ab28cc
6. NVIDIA Isaac ROS 5.0 发布,引入 Agent 化机器人开发流程
NVIDIA 在加拿大多伦多 ROSCon 大会发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速软件包集合,面向近 130 万 ROS 用户。该版本引入新的 Agentic 工作流,让人类开发者与 AI Agent 协同构建机器人应用。Isaac ROS 5.0 新增对 ROS Lyrical 和 Ubuntu 24.04 的支持,NVIDIA 与 Open Source Robotics Alliance 合作向 ROS Lyrical 贡献了一个标准数据处理接口,使机器人软件能在包括 GPU 在内的不同硬件上高效运行,CUDA 提供了 GPU 加速范例。软件包还提供面向 setup 和 manipulation 的 NVIDIA Isaac skills 可复用工作流,以及 Agent-ready 文档,帮助 AI Agent 理解 Isaac ROS 工具并将开发意图快速转化为可运行应用。其中 FoundationStereo fine-tuning skill 可让 AI Agent 把立体感知模型适配到开发者自己的摄像头、环境和机器人应用上。 来源:https://blogs.nvidia.com/blog/isaac-ros-5-0-agentic-open-source-robotics/
7. NVIDIA 推出 DSX Ready 认证,覆盖储能与液冷配电
NVIDIA 推出 DSX Ready 资格认证计划,面向满足 NVIDIA DSX AI 工厂参考设计要求的合作伙伴产品和解决方案。该计划首批开放两个类别:电池储能系统(BESS)和冷却配电单元(CDU),后续将扩展到更多基础设施和软件类别。已通过 BESS 认证的厂商包括 Hitachi Energy、LG Energy Solution 和 Tesla;已通过 CDU 认证的包括 LG Electronics、LiquidStack 和 Vertiv。NVIDIA 表示,AI 工厂的电力、冷却、水、场地和电网约束正在决定实际可部署的算力,DSX Ready 为构建者提供明确资格标识,降低集成风险,并把电力与液冷基础设施纳入统一参考体系。通过认证不等于替代站点级工程设计,BESS 厂商需在限定资格边界内完成测试并提交数据供 NVIDIA 审核,CDU 则通过自认证套件判定具体型号是否符合要求。 来源:https://blogs.nvidia.com/blog/dsx-ready-ai-factories-power-cooling/
AI 应用与研究
8. 字节跳动上线 Dramagic,全流程 AI 短剧生产平台
字节跳动推出 AI 平台 Dramagic,覆盖短剧从剧本到视频预览的完整生产管线。该平台瞄准的短剧市场正在快速放量:仅 2026 年第一季度,中国就发布了 12.8 万部短剧,其中 95% 由 AI 生成。Dramagic 把剧本创作、分镜、生成和预览整合到同一流程,为内容团队提供从文字到成片的一站式工具链。 来源:https://the-decoder.com/bytedance-launches-dramagic-a-full-pipeline-ai-platform-for-producing-short-dramas-from-script-to-screen/
9. 研究团队用 1200 亿 tokens 人类动作视频预训练机器人
有研究团队提出利用互联网视频中的人类动作数据训练机器人,预训练规模达到 1200 亿 tokens。实验显示,随着预训练数据量增加,机器人操作误差按幂律下降。该方法不依赖机器人真机数据,而是从人类第一视角视频中学习动作表征,试图解决机器人技能学习中的数据瓶颈问题。 来源:https://www.qbitai.com/2026/09/496129.html
暂无评论。