Opus 5.5 15 小时攻克 Dijkstra 算法【AI 早报 2026-09-28】
今日看点:Claude Opus 5.5 多个智能体用 15 小时在沙盒中协作,给出经 Lean 机器验证的新最短路径算法;Gemini 4 Pro 新检查点被开发者实测,被认为压制 Opus 5.5;GPT-6 Astra 凭脚本能力从一张图纸生成 3295 个可编辑 3D 零件。
今日概览
- Opus 5.5 15 小时攻克 Dijkstra 算法
- Gemini 4 Pro 新检查点曝光,实测压制 Opus 5.5
- GPT-6 Astra 一张图纸生成 3295 个可编辑零件
- Anthropic 连发两份科研博客:九圈计算与 ART 战役
- Google DeepMind 发布 Dream-RSI,搜索开销降一至两个数量级
- GLM-5.2 开放权重,基准介于 Opus 4.7 与 4.8 之间
- DeepSeek mHC 残差流分析:读写集中于少数流,深层近单位矩阵
- 中科院团队提出智能体能力周期表,共 243 种构型
- 上海交大 LIFT:20~30 条带力数据让 VLA 学会感知力
- EverMind 开源 Raven V0.2.0,Harness of Harnesses 统一编排多 Agent
- Nvidia 免费开源 1 亿参数模型,实时识别八位说话人
- Google 用 AI 与差分模糊测试将 giflib 的 C 代码迁移为 Rust
- 微软重构 Copilot:Home、Code 与 Autopilot 三大能力上线
- Google Antigravity:93 个子智能体 12 小时花费不足千美元造出 OS 内核
- 万字长文拆解 Pi Agent 的 Context 管理机制
大模型前沿动态
Opus 5.5 15 小时攻克 Dijkstra 算法
Vals AI 团队把 10 个 Claude Opus 5.5 智能体放进沙盒,允许它们在虚拟留言板上交流、找茬,甚至为技术路线争论。15 小时后,留言板留下 733 次讨论记录,智能体提交了名为 C-HD 的全新算法,并附带 289 个文件的 Lean 形式化证明,直接交给 Lean Kernel 做机器验证且一次性通过。Dijkstra 算法由 Edsger W. Dijkstra 于 1959 年提出,配合斐波那契堆等优先队列可达到特定时间复杂度,2025 年与 2026 年的后续研究又将其复杂度继续推进。该突破的意义在于,新算法需要从底层数学上证明在无限大数据规模下确实更快,而非工程层面的代码优化。
来源:https://mp.weixin.qq.com/s/XD7K50diurlB9z1rcHythw
Gemini 4 Pro 新检查点曝光,实测压制 Opus 5.5
开发者最近发现了两个 Gemini 4 Pro 全新检查点,内部代号为「barium-b」或 Checkpoint 2。Google DeepMind 新任负责人 Koray Kavukcuoglu 首次公开确认,Gemini 4 已进入后训练早期,早期预训练仅耗时约两个月便基本结束。实测显示,该模型在 3D 物理模拟、代码生成和长文本推理上表现突出;知名测评博主 @AI_Screening 要求它和 Opus 5.5 分别用代码生成 3D 浮筒飞机在水面滑行起飞的物理模拟,Gemini 4 Pro 的生成结果被认为完全超越 Opus 5.5。有开发者在爆肝 400 小时使用 Opus 5.5 和 GPT-6 之后表示,Gemini 4 Pro 依然让人印象深刻。
来源:https://mp.weixin.qq.com/s/qBhS0a66kjYqRL7Gk5lGcw
GPT-6 Astra 一张图纸生成 3295 个可编辑零件
开发者 Tom Krcha 把一张旧蒸汽机车图纸交给 GPT-6 Astra,几分钟后 Blender 中生成 3295 个可编辑的独立对象,涵盖锅炉、连杆、车轮和铆钉,每个都能单独选中和修改。其底层并非操作鼠标建模,而是通过 Blender 的 Python 接口 bpy 编写脚本,逐件生成几何体、命名并放置到对应位置。在另一个 Three.js 演示中,Astra 不依赖模型文件,完全以 TypeScript 代码在浏览器运行时计算两辆火车的几何、轮子转动与拆解重组动画。OpenAI 工程师 Thomas Ricouard 仅用一句话「设计一栋极简但细节丰富的房子,带花园,光线要电影感」,Astra 即通过 Blender Python 接口建出建筑、木作、家具、植物、材质、灯光和相机,并在交付前自行查看预览渲染,调整构图、光线,修复植物穿模,重新摆放沙发上的毯子。Ricouard 还观察到,Astra 自行发现不锈钢水槽一处法线方向错误并顺手修正;当被要求把房子变大时,它先绘制 U 形单层住宅平面图,中间为客餐厨,两翼布置三间卧室与书房并围合庭院,明确避开厨房工作区的动线,经批准后才重建整栋房子。
来源:https://mp.weixin.qq.com/s/OOSqaPsC_wkKDtpYEKbarg
开源模型与研究前沿
Anthropic 连发两份科研博客:九圈计算与 ART 战役
第一篇「九圈计算」中,Agent 在仅收到「我要睡了,每 4 到 6 小时给我汇报一次」级别监督的情况下,用 Python/SymPy 从零重写全部代码,沿两条独立路线各跑通一次,完成平面 N=4 超杨-米尔斯六粒子振幅的第九圈计算,并由外部专家 Dixon 独立验证;该流程约 96 CPU 周,bootstrap 路线计算成本约 100 美元,每条路线总计 1000 到 2000 美元,大头是长时间推理费。Dixon 评价这套流程极其脆弱,任何小错都会让结果塌掉。第二篇「ART 战役」中,一个 Multi-Agent 系统处理 119 个任务、949 个 Agent 会话、消耗 2.156 亿 token,在 21.5 小时墙钟内无人介入跑完,并发现一个此前未知的生物酶系统。系统采用 worker、supervisor、curator、editor 角色配对,119 个任务中 98 个由 supervisor 审查时自我生长;19 份成果报告经锦标赛式两两评比,17 个候选里 14 个被 Agent 自行证伪或搁置,最终确认 3 个真发现;77 个 Agent 小时被压缩进 21.5 小时,并行度约 3.6 倍。论文还揭示一个工具悖论:原始数据直接进上下文时第一梯队模型识别关键模式的成功率超过 90%,改为「文件加工具」的标准 agentic 设置后成功率最低跌至 32%,39% 的尝试中模型从未读取超过 200 nt 的连续原始数据,而一旦读入,成功率高出 16 到 32 个百分点,最高达 96%。
Google DeepMind 发布 Dream-RSI,搜索开销降一至两个数量级
Google DeepMind 联合弗吉尼亚大学与马里兰大学发表论文《Dream-RSI: Recursive Self-Improvement through Evolving Worlds》,相关代码已开源。该方法把长程任务里的探索策略本身做成可自我改进的程序对象,整体由在线探索、世界演化、离线做梦三阶段循环驱动。系统把历史探索数据视为可零成本重放的物理模拟器,候选策略只需在已记录代码快照、报错日志、运行时长与客观得分的「发现树」上遍历,无需新推理请求即可完成上万次离线模拟。硬约束是底层大模型、评价函数与测试环境完全锁死,仅更新探索策略代码本身,策略在每个决策轮次负责选节点、定并发、设深度与下止损。论文实测显示,在算法工程、数学优化和 GPU 算子工程中,搜索算力开销下降一到两个数量级。
GLM-5.2 开放权重,基准介于 Opus 4.7 与 4.8 之间
Z.ai 负责人 Zixuan Li 正式对外介绍 GLM-5.2 并开放权重。根据其介绍,该模型在最困难的长时程编码与智能体基准测试中,表现落在 Claude Opus 4.7 与 Claude Opus 4.8 之间。
来源:https://www.youtube.com/watch?v=9JFGohx4E7U
DeepSeek mHC 残差流分析:读写集中于少数流,深层近单位矩阵
一篇题为《How Does mHC Use Its Residual Streams? Selective Routing and Near-Identity Mixing》的论文分析了 DeepSeek-V4-Flash 的 mHC 结构。该模型维护四条残差流,但训练后同一子层内每个 token 的读写权重通常集中在约两条流上,且第 22–42 层的残差混合矩阵已接近单位矩阵。干预实验显示,去掉每个 token 读或写权重最小的路径后,PPL 最多上升 2.7%,六个任务平均分最多下降 0.38 个百分点;将第 22–42 层残差混合矩阵替换为单位矩阵后,PPL 上升 1.9%,任务平均分从 84.22 微升至 84.26,基本不变。浅层虽不能直接用单位矩阵取代(PPL 上升 41.4%),但固定为 C4 校准集上的 token 平均矩阵后,PPL 仅上升 0.2%,平均分下降 0.25 个百分点。
来源:https://mp.weixin.qq.com/s/0zurNjezW9JPtQdZdR2_rw
中科院团队提出智能体能力周期表,共 243 种构型
中国科学院大学研究团队今年 9 月在施普林格旗下期刊《数据科学年鉴》发表论文,提出「智能体能力周期表」。团队把任何智能体建模为开放的信息处理系统,从中提炼出控制、生成、记忆、输出、输入五种基本能力,每种能力分为缺失、有限、无限三级,五种能力组合出 3 的 5 次方共 243 种构型。在这张表中,人类与狮子、河马甚至细菌同处一格,石头、真空、图灵机与拉普拉斯妖也各有坐标。论文引出两个论点:物理学经典力学、相对论和量子力学的差异可能源于各自默认了一个能力不同的观察者;所有被考察的人工系统在「自主控制」维度上仍为零,当今最先进的大模型智能体虽能编写复杂代码、检索海量资料、解答世界级数学难题,却不能自己决定何时开始、追求什么、何时停下,与人类只差一位。
上海交大 LIFT:20~30 条带力数据让 VLA 学会感知力
上海交通大学卢策吾、汶川团队联合穹彻提出 LIFT 方法,在保留预训练知识的前提下,仅通过在线后训练教视觉-语言-动作(VLA)模型感知力,并以高频反应式方式生成动作,该工作被 CoRL 2026 高分收录且代码已开源。团队在叠毛巾、插书和汉诺塔圆环放置三个任务上测试,LIFT 相比纯视觉后训练的分数分别从 73.3 提升至 84.2、从 36.7 提升至 58.3、从 26.7 提升至 56.7,且只需 20~30 条带力的在线数据。方法上,LIFT 复制预训练动作专家参数得到「反应式动作专家」,通过因果交叉注意力感知最新时间段的力并据此调整动作,视觉和语言信息提前计算并缓存,将控制闭环频率从 1Hz 提高到 10Hz。
来源:https://mp.weixin.qq.com/s/BHAcQel47t43-N-pMz5-cg
智能体与工程实践
EverMind 开源 Raven V0.2.0,Harness of Harnesses 统一编排多 Agent
EverMind 开源 Raven V0.2.0,围绕两个核心理念构建:为递归自我改进(RSI)设计的 Harness 框架,以及统一编排专业 Agent 的「The Harness of Harnesses」。在框架中,Harness 可被 AI 改写的部分分为 Modules、Code、Prompt 和 Policy 四类,V0.2.0 已将运行时的 Curator 作为实验性功能开源,跑通从反馈、生成代码到校验安装的闭环。Raven 把自身四个子 Agent(Raven-Research、Raven-Code、Raven-Design、Raven-Oncall)与 Claude Code、Codex 等专业 Agent 统一编排,负责成员选择、任务拆解、依赖调度与结果交接。在 nanochat 预训练实验中,Raven RSI 项目完成 7 轮、172 次训练,在相同单次训练预算下使 val_bpb 相对下降 5.8%。
来源:https://mp.weixin.qq.com/s/u9Pnht2mHluZH_FS5tnbAg
Nvidia 免费开源 1 亿参数模型,实时识别八位说话人
Nvidia 发布免费模型 Nemotron 3 Diarization,参数量 1 亿,用于识别对话中任意时刻正在发言的说话人,最多可实时区分八位说话人。
Google 用 AI 与差分模糊测试将 giflib 的 C 代码迁移为 Rust
Google 安全团队开发了一套自动化迁移方法,将 giflib 图像处理库中的遗留 C 代码替换为 Rust,以消除内存漏洞。该方法结合 AI 与差分模糊测试,在验证迁移后代码与原实现兼容性的同时缓解零日漏洞风险,并在保持运行时性能的前提下完成迁移。项目同时表明,AI 翻译过程仍需安全团队持续人工监督。
微软重构 Copilot:Home、Code 与 Autopilot 三大能力上线
微软重构 Copilot,推出三项新能力。Home 作为新起点把 Chat 与 Cowork 合并,并内置 Word、Excel 与 PowerPoint 完整功能,用户可在一个界面里回顾近期活动、获取建议并接着未完成的工作;Code 让所有人都能构建自己的解决方案,底层采用与 GitHub Copilot 相同的技术;Autopilot 则是一个持久、主动的个人智能体,即使用户不在线也能持续工作。Home 与 Code 将在未来几周通过微软 Frontier 项目推出,Autopilot 将于本月底扩展至私密预览。微软还引入新的 FinOps for AI 能力,帮助管理 Copilot 与智能体的花费。
Google Antigravity:93 个子智能体 12 小时花费不足千美元造出 OS 内核
Google DeepMind 的 Kevin Hou 分享了 Antigravity 的一个实测结果:动用 93 个子智能体,耗时 12 小时,消耗 20 亿 token,花费低于 1000 美元,从零构建出一个可运行的操作系统内核。
来源:https://www.youtube.com/watch?v=buHC7bQE1X4
万字长文拆解 Pi Agent 的 Context 管理机制
一篇约 14000 字的长文以 Pi Agent 为例,系统解析了 Agent 中的 Context 管理。文章区分了 Prompt 与 Context:前者偏向相对静态的指令设计,提前定义模型「应该怎么做」;后者是 Agent 运行过程中动态形成的信息环境,决定模型「此刻基于哪些信息来做」。一次 LLM 调用的 Context 通常由 System Prompt、Tool Definitions、User Messages、Assistant Messages 与 Tool Results 五部分组成,其中 System Prompt 与 Tool Definitions 构成相对静态前缀,其余随执行不断变化。为兼容 KV cache,文章提出保持前缀稳定、动态信息向后追加、使用标准消息结构三原则,并拆解了 Pi Agent 中 AgentSession 与 AgentSessionRuntime 的分工。
暂无评论。