Claude Opus 5.5上线:成本降40%速度快30%【AI 早报 2026-09-24】

Claude Opus 5.5上线:成本降40%速度快30%【AI 早报 2026-09-24】

Anthropic 无预热直接发布 Claude 5.5 系列首款模型 Opus 5.5,OpenAI 两小时内以 GPT-6 Sol 和 Luna 应战;DeepSeek 发表 31 页沙箱基础设施论文,Snorkel AI 完成 3.5 亿美元融资。

今日概览

  1. Claude Opus 5.5上线:成本降40%速度快30%
  2. GPT-6 Sol与Luna上线:Luna单价仅为Astra百分之一
  3. DeepSeek发表31页DSec论文:梁文锋署名,日服务300万沙箱
  4. 开发者将开源Jev搬上Apple MLX:1G内存跑421M模型
  5. Meta AI智能体Muse一周斩获50万用户,登顶App Store
  6. 灵初发布Psi-R2.5:用强Pair Data重做具身训练链路
  7. jina-ocr-v1开源:570M激活参数,2.57页/秒吞吐
  8. PixVerse R2攻克实时世界模型Scaling难题
  9. 高通发布骁龙8 Elite Gen 6:端侧可跑30B MoE模型
  10. Snorkel AI融资3.5亿美元,估值达35亿美元
  11. Legora洽谈3亿美元融资,投前估值85亿美元
  12. Claude agents发现具有CRISPR样重复序列的新酶系统
  13. Gemini 3.8文本转语音支持自定义音色
  14. ChatGPT Voice接入邮件日历Slack插件,可用GPT-6模型
  15. OpenAI发布心理健康基准MentalHealthBench

大模型与基础设施

Claude Opus 5.5上线:成本降40%速度快30%

Anthropic 在无预热情况下直接发布 Claude 5.5 系列首款模型 Opus 5.5。官方称其在智能体编程、计算机使用、知识工作上刷新 SOTA,Terminal-Bench 4.0 跑出 66.4% 成绩,GDPval-AA v2.1 拿下 1846 Elo。成本比上一代 Opus 5 低 40%,输出速度提升 30%。在 Artificial Analysis 和 Anthropic 自家 ECI 指数上,Opus 5.5 得分超过 Fable 5.1;第三方 Vals AI 的 RSI 指数测得全球第一。发布 2 小时后,OpenAI 推出 GPT-6 Sol 和 Luna 应战。

来源:https://mp.weixin.qq.com/s/YHTx6SvVKlFeW1WOGibPfg

GPT-6 Sol与Luna上线:Luna单价仅为Astra百分之一

OpenAI 推出 GPT-6 家族新成员 Sol 和 Luna,定位中杯和小杯。Sol 每百万 token 输入 2 美元、输出 10 美元;Luna 输入 0.1 美元、输出 0.5 美元,单价均为顶配 Astra 的百分之一,Sol 为 Astra 的五分之一。Codex 负责人 Tibo 宣布 Plus、Pro 和 Business 账户多一次额度重置。Sol 在 AutomationBench 上以 0.27 美元/题得分超过 Opus 5 满血版 6 个百分点,花费仅九分之一;在 Agents' Last Exam 上开满档 56.4%,每道题便宜 60%。Luna 在第三方榜单分数略有倒退。

来源:https://mp.weixin.qq.com/s/mVOL5Wsjabf-5s29jTxMOg

DeepSeek发表31页DSec论文:梁文锋署名,日服务300万沙箱

DeepSeek 发表论文《DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale》,作者超百人,梁文锋署名。单个 DSec 生产单元约由 160 台 CPU 节点、3 万个 CPU Core 和 250TB DRAM 组成,管理 PB 级镜像和环境层。典型一天服务约 300 万个 sandbox 实例,高峰同时在线超 38 万个,创建速度超 5000 个/秒。从 DeepSeek V3.2 到 V4.1,RL 训练和评测的 sandbox workload 均运行在 DSec 上。论文指出约 90% 的 Container 和 microVM 平均 CPU 使用量不到申请资源的 5%,Container 生命周期中位数 17.4 分钟,microVM 为 15.5 分钟。

来源:https://mp.weixin.qq.com/s/gaF-MogRAhv_5DPyS_aj1A

开发者将开源Jev搬上Apple MLX:1G内存跑421M模型

开发者 mizorewww 在 Apple MLX 框架上重新实现 Laya 完整神经网络架构,推出 Laya-MLX。421M 参数版本峰值 MLX 内存占用 943.6MiB,322M 多语言版本降至 687.6MiB。在 M3 Max 上,421M 版本短问题 P50 延迟 13.42ms,322M 版本 7.39ms;一次处理 50 个问题时,多语言版本吞吐达 395 questions/s。Laya-MLX 在 63 个验证问题上通过 FP32 和 FP16 两种精度验证,378/378 次匹配原版答案。Laya 本身不生成文本,只做 choice、score、noul 三类决策,GitHub 已获 10.4k Star。

来源:https://mp.weixin.qq.com/s?__biz=MzU3NjE4NjQ4MA==&mid=2247557337&idx=1&sn=b43173631cd9d5c26549e5fb4268aeef

AI产品与商业

Meta AI智能体Muse一周斩获50万用户,登顶App Store

Meta 推出的 AI 智能体 Muse 上线首周获得超 50 万用户,并登上 Apple App Store 免费榜第一。Meta 承认该产品“深度借鉴”开源项目 OpenClaw,部分文件名和内容几乎完全一致。OpenAI 已在讨论应对措施。

来源:https://the-decoder.com/metas-ai-agent-muse-draws-500000-users-in-a-week-along-with-claims-it-copied-openclaw/

灵初发布Psi-R2.5:用强Pair Data重做具身训练链路

灵初智能发布新一代具身基础模型 Psi-R2.5,重点解决数据规模扩大后的价值筛选和转换效率问题。团队区分“弱 Pair Data”和“强 Pair Data”,从真实机器人数据逆向生成对应人手数据,训练端到端转换模型。上层模型以 QwenVL3.5-4B 为骨干负责任务拆解,下层使用 Wan2.2-IT2V-5B 输出操作轨迹。人只需用手机或相机拍摄一段操作视频,即可通过 pipeline 转换成不同机器人可用的数据,从人类示范到真实任务缩短至 1—2 个工作日。

来源:https://mp.weixin.qq.com/s/IqD4HP_vmA7QDb1qJHOz0g

jina-ocr-v1开源:570M激活参数,2.57页/秒吞吐

Jina AI 开源 jina-ocr-v1 文档解析模型,总参数 3.4B,解码时每 token 仅激活 570M。在 OmniDocBench v1.6(91.14)和 olmOCR-Bench(83.4)刷新同级别最佳成绩。14 款端到端系统实测中,jina-ocr-v1 以 2.57 页/秒吞吐领跑。单张 NVIDIA L4 上通过 FastMTP 推测解码草稿头,生成速度几乎翻倍且输出与标准自回归解码严格一致。采用 DeepEncoder 将 1024×1024 画面压缩至 256 个视觉 token,平均单 token 承载 3887 像素。

来源:https://mp.weixin.qq.com/s?__biz=Mzk3NTc1NTU0Mw==&mid=2247514126&idx=1&sn=702d47a144fb8c4c2154f959e2d99001

PixVerse R2攻克实时世界模型Scaling难题

爱诗科技推出 PixVerse R2 实时世界模型,将五类增长纳入同一可扩展框架。HAR 网络记录显示,“冬日宫殿”会话全程只发生一次 session_init 和一次 generation_started,八轮 Prompt 共享同一条内容流,约 119.5 秒生成窗口。3,355 条 action_frame 发送间隔中位数约 29.944 毫秒,频率约 33.4Hz。Prompt 处理期间 Action 仍持续进入同一会话,每轮 prompt_generated 中位耗时约 4.27 秒,prompt_updated 中位耗时约 1.33 秒。

来源:https://mp.weixin.qq.com/s?__biz=MzA5ODEzMjIyMA==&mid=2247746165&idx=1&sn=aec3e61b13ee123258cb9edd9fd24613

高通发布骁龙8 Elite Gen 6:端侧可跑30B MoE模型

高通在 Snapdragon 峰会发布 Snapdragon 8 Elite Gen 6 和 Extreme Gen 6 两款旗舰处理器。新 sensing hub 支持最高 200M 参数小模型运行,可执行本地 personal scribe、说话人区分等任务。Extreme 版本能在本地运行 300 亿参数 MoE 模型,超过 Apple 六月 WWDC 发布的 200 亿参数模型。芯片还支持 8K 60fps 录制、4K240 慢动作和新 APV 编解码器。Motorola 宣布 Signature 27 手机搭载 Extreme 版本,今年内上市。

来源:https://theaiinsider.tech/2026/09/23/qualcomm-unveils-snapdragon-8-elite-gen-6-chips-built-for-on-device-ai-agents/

Snorkel AI融资3.5亿美元,估值达35亿美元

Snorkel AI 完成 3.5 亿美元 E 轮融资,估值 35 亿美元,由 Insight Partners 和 S32 领投。估值接近 17 个月前 D 轮 13 亿美元的三倍。公司年化收入 run rate 达 3.75 亿美元,一年增长 18 倍。Snorkel 从数据标注软件转向 data-as-a-service,结合自有软件、模型和领域专家生成训练数据集,并销售强化学习环境。

来源:https://theaiinsider.tech/2026/09/23/snorkel-ai-raises-350m-series-e-at-3-5b-valuation-as-demand-for-ai-training-data-surges/

Legora洽谈3亿美元融资,投前估值85亿美元

法律科技初创公司 Legora 正洽谈新一轮融资,计划筹集至少 3 亿美元,投前估值约 85 亿美元。五个月前 Legora 刚完成 6 亿美元 D 轮融资,当时估值 56 亿美元。首席财务官披露公司 ARR 已达 2 亿美元,不到六个月翻倍。Legora 2023 年创立于瑞典,近期将重点放在扩大美国客户群,按收入计算美国已成为其最大市场。

来源:https://mp.weixin.qq.com/s?__biz=MzI4NTgxMDk1NA==&mid=2247518246&idx=3&sn=ebfccc2831ea12f5431beef16109dc0e

前沿进展

Claude agents发现具有CRISPR样重复序列的新酶系统

Anthropic 生命科学研究实验室的早期结果中,Claude agents 发现了一个功能未知的酶系统,该系统带有 CRISPR 样重复序列。这是 Claude 在生命科学领域自动化研究的初步产出。

来源:https://www.anthropic.com/news/claude-discovers-novel-enzyme-system

Gemini 3.8文本转语音支持自定义音色

Google DeepMind 发布 Gemini 3.8 文本转语音功能,用户可通过自然语言提示从零设计全新音色人格,用于游戏、沉浸式有声书或双人播客,并逐句控制音高、语速和情感。

来源:https://www.youtube.com/watch?v=FL6mI_Br-mc

ChatGPT Voice接入邮件日历Slack插件,可用GPT-6模型

ChatGPT Voice 功能更新,可调用邮件、日历和 Slack 等插件,并支持切换至 GPT-6 Astra、Sol 和 Luna 模型驱动。

来源:https://www.youtube.com/watch?v=96ogPwN9ykM

OpenAI发布心理健康基准MentalHealthBench

OpenAI 推出 MentalHealthBench,这是一个由专家参与设计的基准,用于评估 AI 在真实心理健康对话中有用且安全的回应表现。

来源:https://openai.com/index/introducing-mentalhealthbench

评论

暂无评论。

登录后可发表评论。