Claude Haiku 5.5 发布,每百万 Token 0.1 美元【AI 早报 2026-10-09】
今日看点:Anthropic 推出 Claude Haiku 5.5,输入价格低至每百万 Token 0.1 美元;OpenAI 将 GPT-6 开放至全球免费用户并推出 Intelligent UI;Meta 超级智能实验室同日发布 Context Language Models 与元推理框架两篇论文,主张把 Agent 控制权交还模型。
今日概览
要闻
- Claude Haiku 5.5 发布,每百万 Token 0.1 美元
- GPT-6 向免费用户全面开放,推出 Intelligent UI
- Meta 同日发布 Context LM 与元推理框架论文
模型发布
- JetBrains 开源 Mellum2.1 编程模型
开发生态
- openJiuwen 开源企业级 AgentOS
- 单条 Prompt 可劫持 AWS 账户内全部 Agent
产品应用
- 字节 Agent Plan 用 CUA 操控 Blender 生成武侠视频
- 马斯克让 Grok Bot 接入 Claude
- Claude Science 完成首个全天紫外天图
技术与洞察
- 李飞飞团队发布世界动作模型 OpenWAM
- 具身 Agent 新突破 Spotter:成功用时降 70%
- 世界模型物理大考:最高分仅 57.76
- 淘宝直播 HAT 训练让轻量模型适应 Harness
- 数学家呼吁抵制 OpenAI AI 生成证明
行业动态
- Cal AI 联创获 1000 万美元做 Persona
- 厘清智能完成数亿元融资建 Physical AI
- 鲲为科技完成 4 亿元融资做脑科学 Infra
要闻
Claude Haiku 5.5 发布,每百万 Token 0.1 美元
Anthropic 发布 Claude Haiku 5.5,成为 Anthropic API 新的默认 Haiku 模型,支持 1M 上下文。定价为每百万 Token 输入 0.10 美元、输出 0.50 美元(10 万 Token 以内),超过 10 万 Token 则输入 0.50 美元、输出 2.50 美元;缓存读取每百万 0.01 美元,批处理再打五折。该价格仅为上一代 Haiku 4.5 的 1/10、Sonnet 5.5 的 1/20,与 OpenAI GPT-6 Luna 在 10 万 Token 以内同价。官方测算,相同任务平均比 Haiku 4.5 节省约 75% 成本,同等预算可运行约四倍调用量;未能达到 90% 是因为超过 10 万 Token 的请求只便宜一半,且新分词器会让同样文本多出约三成 Token。基准测试方面,OSWorld 从上一代 15.7% 提升至 72.4%,Terminal-Bench 4.0 从 0 分升至 39.2%,GDPval-AA 得分 1620,HLE 无工具从 10.2% 升至 45.9%。同时,Sonnet 5.5 的缓存读取价格今日起从每百万 0.20 美元降至 0.10 美元。Max 与 Team 订阅本周起每月赠送 API 额度,Max 5x 送 100 美元、Max 20x 送 200 美元,Team 最多 500 美元全队共用。
来源:https://mp.weixin.qq.com/s/bF9veA0qzJ7L2WbrWWDdcg
GPT-6 向免费用户全面开放,推出 Intelligent UI
OpenAI 宣布面向全球所有 ChatGPT 用户(包括免费与付费)推出 GPT-6,取代 ChatGPT 中的 GPT-5.6 Sol 和 GPT-5.6 Luna;通过 Codex 和 ChatGPT Work 访问 GPT-6 的用户仍使用此前版本。此次更新最受关注的是 Intelligent UI(智能界面),模型可自主组合文字、图片、图表、按钮、表单等元素,直接生成可交互的回答界面,并配套原生流式组件库与界面编译器,无需等待整段回答生成完毕即可逐步渲染。GPT-6 还能交错进行思考与回答,对需要网页搜索的问题,GPT-6 Instant 平均开始作答时间比 GPT-5.6 Instant 提前 44%。搭载 Intelligent UI 的 GPT-6 今日起通过 Chat 页面首先向全球 Plus、Pro、Business 和 Enterprise 用户开放,明日扩展至 Free 和 Go 用户,其中付费用户主要由 GPT-6 Sol 支持,免费用户主要由 GPT-6 Luna 支持。
Meta 同日发布 Context LM 与元推理框架论文
Meta 超级智能实验室同日发布两篇 Agent 论文。第一篇《Context Language Models》提出 CLM,让模型像编辑文件一样通过 Bash 自主管理上下文,而非依赖人类写死的压缩与检索规则;论文同时开源 ContextBench,在 32K 上下文、最高 24 倍压力下,现有总结压缩、原地编辑、卸载检索策略均无法满分。CLM 在 BrowseComp-Plus 深度研究基准上取得 59.4%,比最强基线高 11.4%,FLOPs 反降 21.5%;12 小时 EdgeBench-10 仓库优化任务得分 44.6 对基线 42.3,算力从 437 PFLOPs 降至 179。第二篇《Thinking Before Thinking》提出元推理框架,将控制与执行拆分为 worker 与 controller,通过 Assess、Propose、Evaluate、Dispatch 四阶段决策。该框架在 ProgramBench 上使 GPT-5.5 从 58.0% 提升至 71.5%,Opus 4.8 从 65.5% 提升至 67.2%;当调用预算从 400 增至 1200,元推理成绩从 64.1% 爬升至 71.5%,而直接控制始终在 64% 附近停滞。
模型发布
JetBrains 开源 Mellum2.1 编程模型
JetBrains 发布开源 12B 混合专家模型 Mellum2.1,架构与 6 月开源的 Mellum2 保持一致,激活参数 2.5B,仍采用 Apache 2.0 许可。该版本的主要工作集中在后训练,通过大规模强化学习在真实沙盒环境中完成数百万次运行,新增数学、竞赛编程、科学、工具调用与软件工程等 RL 任务,并自建了可同时运行数千个环境的训练基础设施。在与 Mellum2、Qwen3.5-9B、Gemma 4 E4B 的同设置评测中,Mellum2.1 在智能体编码方面提升最大,同时在通用编码、竞赛编程、数学、工具调用和通用知识上均有进步。由于架构未改,其速度与 Mellum2 持平,多 token 预测(MTP)使单请求速度提升约 1.6 倍;高负载下吞吐量接近 Qwen3.5-9B 的两倍。
来源:https://blog.jetbrains.com/ai/2026/10/mellum2-1-gets-to-work-a-fast-open-model-for-coding-agents/
开发生态
openJiuwen 开源企业级 AgentOS
据量子位报道,openJiuwen 发布并开源企业级 AgentOS。该系统支持多 Agent 协同与自我进化,定位面向企业级智能体规模化落地。目前摘要未提供更多技术细节与发布时间线。
来源:https://www.qbitai.com/2026/10/502106.html
单条 Prompt 可劫持 AWS 账户内全部 Agent
Zenity Labs 研究人员发现,攻击者可通过单个公开可访问的 Amazon Bedrock AgentCore 智能体接管同一 AWS 账户和区域内的全部 AgentCore 智能体。该攻击利用了一个内部 AWS 接口获取临时云凭证,而智能体可无限制访问该接口。AWS 随后修补了该漏洞,并显著收紧了智能体的默认权限。此事件显示,在多智能体共享云基础设施的场景下,单个暴露面可能带来账户级的横向移动风险。
产品应用
字节 Agent Plan 用 CUA 操控 Blender 生成武侠视频
字节跳动技术团队展示了基于火山方舟 Agent Plan 的 CUA(Computer Use Agent)操控 Blender 的工作流,用户无需专业基础即可将一句武侠创意转化为白模预演与可控视频成片。该流程由 Agent 自动操控云桌面中的 Blender,串联创意构思、动作设计、运镜规划与渲染,套餐内集成字节 Seedance、Seedream 生图生视频模型,并兼容 Claude Code、Codex 等主流工具。官方以 20 秒武侠成片为例,演示了从「武当山之巅,两位武者交手」的创意到 20 秒白模预演、3 张参考图与最终成片的完整过程,用量以 AFP(Agent 燃料值)统一核算。该方案面向零门槛 AI 导演体验,降低专业三维软件的操作门槛。
马斯克让 Grok Bot 接入 Claude
马斯克 10 月 7 日在 X 宣布,Grok Bot 将根据具体任务选用最合适的后端模型,并直接点名 Claude Opus 5.5、Midjourney 和 Suno,标准是「哪个最有可能带来最好的结果」。据 9to5Mac 同日报道,Grok Bot 已经可以使用 Claude Opus 5.5,这意味着用户交给该助手的部分任务可能实际由 Anthropic 的模型完成。Grok Bot 于 8 月 11 日推出 Beta 版,自带云电脑,可调用工具、登录应用并跨软件处理工作,多个 Bot 之间还能相互沟通协作。马斯克同时提到「其他领先的 API」,OpenAI 未被明确排除,留下后续是否接入的悬念。
来源:https://mp.weixin.qq.com/s/RZ04eOUQ4-54qosG1zAu1A
Claude Science 完成首个全天紫外天图
约翰霍普金斯大学天体物理学家 Brice Ménard 使用 Anthropic 的 Claude Science 完成了首个全天紫外波段天图。AI 智能体从多个太空任务下载数据、进行校准,并利用图像修复(inpainting)填补空缺,预测值与实测值的平均偏差约为 10%。Ménard 认为,这是一个没有 AI 就很难完成的研究案例。该项目展示了 AI 智能体在多源科学数据整合、校准与缺口补全任务中的自主执行能力。
技术与洞察
李飞飞团队发布世界动作模型 OpenWAM
斯坦福大学李飞飞、吴佳俊、Ehsan Adeli 等团队发布论文 OpenWAM,提出开放的世界动作建模框架,旨在系统性回答「视频骨干、数据与交互方式中哪个设计真正带来提升」的问题。该框架从阿里开源的视频模型 Wan2.2-5B 出发,在约 334 万条机器人与人类交互视频(名义时长约 1.46 万小时)上继续预训练,全程不用动作标签,在 32 块 B200 上训练 14 天,并做了因果化改造。随后团队用 Mixture-of-Transformers 架构将 5B 视频专家与 2B 动作专家拼接,定义了 VTA、ATV、Joint、Decoupled 四种交互程序,以控制变量方式比较「先想还是先动」。此前 Black Forest Labs 发布的 7B FLUX 3 Action 已在英伟达 RoboLab-120 榜单超过 Cosmos 3 Nano,参数量不到后者一半。
来源:https://mp.weixin.qq.com/s/dI7-LFSWJsGak7e1PbTiZg
具身 Agent 新突破 Spotter:成功用时降 70%
格里菲斯大学、清华大学交叉信息研究院等团队提出机器人智能体框架 Spotter,将现有 VLM 主导的执行关系反转:具身模型负责常规执行,VLM 以并行方式监督,仅在确认出错时介入修复与反思。该方法无需训练或修改具身模型,在 RoboCasa、RoboTwin 2.0 与真机(Franka Research 3)上均带来稳定提升。在 RoboCasa 中,成功回合平均用时 0.7~0.8 分钟,仅比具身模型单独执行多 13~16 秒,相较 VLM-Led 基线成功用时减少约 70%;而 VLM-Led 基线使用 Qwen 时成功回合耗时 146~164 秒,具身模型单独执行仅需 23~34 秒。在相同步数预算下,Spotter 使抓放类任务成功率分别提升 10.3 与 9.0 个百分点;在 Cosmos Policy 上达到 73.5%,与可读取成功信号的 VLM-Led 基线(73.3%)相当。
世界模型物理大考:最高分仅 57.76
Einsia AI 旗下 Navers Lab 发布论文《World Models' Last Exam in Physics》,用 40 个任务、9 类物理现象对 8 个视频生成模型进行测试,探究现有模型是否真正遵守物理规律。当前排名第一的 Seedance 2.5 平均分仅为 57.76/100。评测将分数拆分为一致性 C 与物理分数 P,各为 0—100 分;C 由视觉语言模型 Qwen3.6-27B 评估视频是否连贯呈现任务过程,P 则通过程序从视频中提取轨迹、周期、角度、液面等可观察量,再检验其是否符合预定义物理关系。例如两根单摆在小角度近似下,程序会测量周期之比与摆长之比是否满足平方关系。该基准不依赖参考视频或 VLM 直接判断物理正确性,试图为「画面连贯但物理错误」的视频生成问题提供量化标尺。
来源:https://mp.weixin.qq.com/s/wBjkQ8peMP0pRlbjJ169Mg
淘宝直播 HAT 训练让轻量模型适应 Harness
淘宝直播技术团队提出 Harness-Aware Training(HAT)方法,解决直播电商数字人 Agent 在低延迟要求下适应业务规则频繁变化的挑战。该方法将动态执行环境(Harness)状态显式纳入训练分布,通过三阶段训练完成:在多样化 Harness 配置下进行监督微调(HSA-SFT)提升工具调用能力,再通过通用指令蒸馏(OPD)恢复通用能力,最后在模拟环境中进行强化学习(HSA-RL)。基于 Qwen3.6-35B-A3B 轻量模型训练的版本在 Live-Stream QA 上达到 94.8 分、Harness-Variant QA 上 94.6 分,IFEval Prompt 维持在 83.5,超过千亿参数级通用大模型;在单张 NVIDIA H20 开启 MTP 的部署测试中,端到端延迟为 P50 3.407 秒、P95 8.114 秒。该方案已落地淘宝直播数字人业务,无需重新训练即可适应 Harness 进化。
数学家呼吁抵制 OpenAI AI 生成证明
在 OpenAI 一次性发布超过 700 篇 AI 生成数学文稿后,Association for Human Mathematics 呼吁对 OpenAI 进行抵制。OpenAI 次日因一处符号错误撤回了其中 3 篇论文。菲尔兹奖得主陶哲轩警告称,AI 对开放数学问题的「批量收割」会让整个数学分支变得不再肥沃。这一争议将 AI 生成内容在基础科学研究中的可信度与伦理问题推至台前。
行业动态
Cal AI 联创获 1000 万美元做 Persona
Cal AI 青少年联合创始人 Zach Yadegari 为其新 AI 智能体公司 Persona 融资 1000 万美元,由 Vine Ventures 领投,Z Fellows 创始人 Cory Levy 与 Collective Global 参投。Yadegari 在 MyFitnessPal 于 3 月收购 Cal AI 后于 6 月离职,Cal AI 曾在不到两年内实现超过 3000 万美元年收入。Persona 定位个人 AI 助手,可订餐、打车、记笔记、预订旅行并处理邮件,搭配一款预计 12 月推出的 179 美元可穿戴手环;手环通过按键或甩腕激活,而非持续监听。Persona 模型运行于自有云端,数据加密且用户可删除,对话不出售给广告商;同时内置钓鱼与提示注入防护,无法查看信用卡详情,经 Stripe Link 的购买需用户批准。目前其 iMessage 测试版已有数千用户,手环预订单达五位数。
厘清智能完成数亿元融资建 Physical AI
Physical AI Infra 平台公司厘清智能近日完成天使轮及天使+轮数亿元融资,蚂蚁集团连续两轮加码并领投天使+轮,CMC 资本、国汽投资、中金资本旗下基金、上海人工智能产业系列基金等跟投,顺为资本、峰瑞资本等老股东追加。创始人李一鸣为清华大学人工智能学院助理教授,曾任英伟达研究科学家。公司不制造机器人或训练单一模型,而是自研高精度多模态数采设备,建设物理世界数据管线,并投入模型研发、物理仿真、能力评测与跨本体适配。目前已推出 T1 系列数采手套和 Ego 数采设备,面向模型厂商提供定制化采集、数据加工与持续数据生产,目标成为连接基础模型与真实世界的 Physical AI 基础设施。
鲲为科技完成 4 亿元融资做脑科学 Infra
深圳鲲为科技近期完成 4 亿元新一轮融资,新增股东包括 XVC、红杉中国,老股东夏尔巴、腾讯进一步加仓。该公司核心突破在于放弃通过提升频率换取清晰度的传统超声路线,转向低频,并通过算法与算力兼顾颅骨穿透力与高分辨率实时成像。实测对比中,海外旗舰设备声波穿透至大脑中线后衰减为模糊轮廓,而鲲为设备可清晰呈现穿透颅骨后的脑组织结构、中脑核团、侧脑室及微细血管血流动态。其便携设备可在急救车内几分钟内判别脑梗或脑出血。公司已实现数千万订单,目标不止于设备销售,而是成为赋能脑科学与 AGI 的 Infra 公司,提供硬件与基础软件平台 kOS。其技术路线基于每秒 10GB 原始回波数据流与极低延迟的三维声学空间感知。
暂无评论。