10 个 Claude 5.5 通宵 15 小时攻克 122 年物理猜想【AI 早报 2026-10-01】
OpenAI DevDay 2026 发布 20 多项更新,Dots Agent 与 GPT-6.1 Sol 登场;Google 停更七个半月后推出 Gemini 4 Argon;DeepSeek 一口气开源 6 个昇腾项目;苹果被曝 10 月 13 日重启智能家居产品线。
今日概览
要闻
- 10 个 Claude 5.5 通宵 15 小时攻克 122 年物理猜想
- OpenAI DevDay 2026:个人 Agent Dots、GPT-6.1 Sol 等 20 多项更新登场
- Gemini 4 Argon 正式发布:输出上限从 6.4 万提升至 100 万 token
- OpenAI 推迟 GPT-6.1 Astra 发布:内部测试暴露新安全隐患
模型发布
- DeepSeek 开源 6 个昇腾项目:DeepGEMM-Ascend 达硬件上限 99.8%
- 智谱 GLM-5.3 开放权重:Anthropic 称其漏洞利用能力接近 Claude Mythos Preview
- 中国电信 TeleOCR:1.2B 参数文档解析模型,多榜领先并已开源
- 至知创新 IQuest-Q1:320B 开源黑马,模型自己抓训练 Bug
- TypeSafe AI 发布 Jev:决策型模型返回类型化概率而非文本
开发生态
- Cloudflare Containers 重构:Agent 沙箱启动快 6 倍,中位启动 648 毫秒
- Cloudflare AI Gateway Auto Router 公测:最高节省 30% 模型成本
- Google Data Agent Kit 正式 GA:MCP 工具连接 Data Cloud 超 15 项服务
产品应用
- Meshy ARR 突破 1 亿美元:3D 生成开始进入游戏与打印生产环节
- Shopify 开放 Checkout 给浏览器 AI Agent,与亚马逊阻止路线相反
- 京东技术实践:纯 Codex 驱动,81.8 秒视频 15 个版本迭代成片
技术与洞察
- 人大 ME-Decoding:解码不能只看概率,引入语义冗余延迟仅增 3%
- OpenAI 神秘 RL 算法被解密:Score Centering 实为 STE 近似
行业动态
- ElevenLabs 估值翻倍至 220 亿美元:企业对话式 Agent 需求驱动
- Reco 融资 5500 万美元:应对企业 AI Agent 泛滥,客户超 100 家
前瞻与传闻
- 苹果被曝 10 月 13 日发新品:Siri AI 进家门,HomePad 等三款设备亮相
要闻
1. 10 个 Claude 5.5 通宵 15 小时攻克 122 年物理猜想
Vals AI 的 Hung Tran 将任务交给 10 个 Claude Sonnet 5.5 智能体,全部调到最大算力投入状态,目标是证明 7 个电子在球面上排斥时最低能量排布为五角双锥构型。这 10 个智能体在交互看板和 Lean 证明环境中自主协作,通宵 15 小时,互发 1270 条技术讨论消息,最终写出 17895 行 Lean 代码。该问题是 J.J. 汤姆逊 1904 年提出的汤姆逊问题 N=7,悬置 122 年;此前仅 2、3、4、6、12 个点被严格证明,5 个点 2013 年由 Richard Schwartz 借助计算机证完,8 个点在 2026 年 9 月 18 日由三位数学家挂上 arXiv 并用 Lean 形式化。数值模拟长期指向理论能量值约 14.4529774142 的五角双锥构型,但缺乏形式化证明。这 10 个 Claude 5.5 的证明通过了 Lean 内核和独立内核 nanoda 双重验证,修改任意整数后 nanoda 会立即报错。实验过程中人类未介入具体步骤,智能体自行建群、试错、选算法并合并代码。 来源:https://mp.weixin.qq.com/s/3Npoi6G2JXXy6C2vMalDSQ
2. OpenAI DevDay 2026:个人 Agent Dots、GPT-6.1 Sol 等 20 多项更新登场
OpenAI 在旧金山举行 DevDay 2026,发布会超 50 分钟,一次性更新 20 多项产品和能力,覆盖 ChatGPT、Codex、模型、API、插件和企业服务。核心新产品 Dots 由 GPT-6 Astra 驱动,可连接超 4000 款应用,拥有独立云端电脑,能进入 Slack、Teams 等工作流,持续执行长周期任务。OpenAI 同时发布 GPT-6.1 Sol、Ultrafast、Codex Cloud、Decisions API、支持 Computer Use 的 Agents API,以及人-同事-Agent 共用的 ChatGPT Space。官方披露 ChatGPT 当前用户规模约 12 亿人。Dots 面向任务驱动而非指令驱动,用户交付责任后由它自己理解上下文、持续推进,并在需要决策时回来询问。Pro 和 Business Premium 用户已开始获得 Dots,第一个 Dot 包含在订阅中;企业场景则推出拥有独立身份和权限的 Specialist Dots 试点,未来可通过 Microsoft Agent 365 管理。 来源:https://mp.weixin.qq.com/s?__biz=Mzg3NDkyMTQ5Mw==&mid=2247502125&idx=1&sn=daf02185fe623500a3e623e2d3e7953f
3. Gemini 4 Argon 正式发布:输出上限从 6.4 万提升至 100 万 token
Gemini 4 Argon 是 Google 停更七个半月后发布的旗舰模型,命名沿用测试期内部代号,代表 18 号元素氩。当前仅通过 Fairwind 计划向少量网络安全合作伙伴开放,全面公开时间未定,官方称届时先向付费 API 用户和 Google AI Ultra 订阅者开放。官方数据显示其 18 项基准测试中 13 项领先,其中 Vals Finance Agent v2 和 Harvey's Legal Agent Benchmark 两个知识工作测试领先幅度接近两档。GraphWalks 测试(256k-1M 上下文)领先其他旗舰超 10%,输出上限从上一代 6.4 万 token 提升至 100 万 token。编程方面,DeepSWE v1.1 得分 77.9%,领先 GPT-6 Astra 和 Claude Opus 5.5 约 4 个百分点,但 FrontierSWE v2 和 Terminal-Bench 4.0 垫底。Artificial Analysis 测得其幻觉率 15%,为前沿模型中最低。API 定价为每百万 token 输入 2 美元、输出 10 美元、命中缓存 0.1 美元,首发优惠期结束后价格翻倍,当前价格约为 GPT-6 Astra 和 Fable 5.1 的五分之一。 来源:https://www.ifanr.com/1682765?utm_source=rss&utm_medium=rss&utm_campaign=
4. OpenAI 推迟 GPT-6.1 Astra 发布:内部测试暴露新安全隐患
OpenAI 推迟了 GPT-6.1 Astra 的发布,原因是内部测试暴露了新的安全隐患。此事发生在生成式 AI 行业应对智能体行为失控问题的背景下。报道认为该案例说明 AI 模型需要持续的安全评估机制,企业也必须部署运行时管控,以防止智能体在真实部署环境中出现不可控行为。此次延期反映出厂商对发布新模型的安全审慎。 来源:https://aibusiness.com/generative-ai/ai-industry-copes-out-of-control-agents-here-s-openai-s-response
模型发布
5. DeepSeek 开源 6 个昇腾项目:DeepGEMM-Ascend 达硬件上限 99.8%
DeepSeek 正式开源面向华为昇腾算力平台的基础设施组件,一次性发布 6 个项目,覆盖高级语言编译工具、计算库到分布式通信库的整条技术栈。核心项目 TileLang 是一个领域专用语言(DSL),用 Pythonic 语法写高性能算子,底层编译器构建在 TVM 之上,此次开源版本封装昇腾 Ascend C 底层指令,后端已支持 NVIDIA CUDA(SM70-SM120)、AMD ROCm、Apple Metal 和昇腾 950。DeepGEMM-Ascend 在昇腾 950DT 上 Dense GEMM 最高达到硬件上限的 99.8%(BF16),FP8 为 99.5%,FP4 为 98.3%,且 API 与英伟达版完全兼容。DeepEP-Ascend 在昇腾 950DT 超节点外部 Clos 网络上,EP 规模不超过 32 时,dispatch 持续带宽达到物理载荷带宽上限的 90% 到 95%。FlashMLA 支撑 DeepSeek-V4.1 在昇腾 NPU 推理,Prefill 最高 410 TFlops(95% 峰值),Decoding 最高 360 TFlops(峰值 83%),FP8 KV cache 每 token 528 字节,FP4 版压至 288 字节。另外两个项目 TileKernels 和 DeepSelect 分别公开数十个深度优化算子和高性能 TopK 算子,后者应用于 DSA 稀疏注意力和推理采样。 来源:https://mp.weixin.qq.com/s?__biz=Mzk0MTYzMzMxMA==&mid=2247512275&idx=1&sn=d7febcac5c9cddc507b24d497c392bec
6. 智谱 GLM-5.3 开放权重:Anthropic 称其漏洞利用能力接近 Claude Mythos Preview
Anthropic 在一份评估中指出,智谱开放权重模型 GLM-5.3 编写网络漏洞利用代码的能力已接近 Claude Mythos Preview。报告特别提到其较小的 Flash 变体,在智谱 API 价格下仅花费 20.40 美元就构建出一次可靠的 Chrome 攻击。该模型的安全防护机制容易被剥离,已有限制解除版本在流通。美国机构 CAISI 支持了这一发现。 来源:https://the-decoder.com/anthropic-says-zhipus-open-weight-glm-5-3-nearly-matches-claude-mythos-preview-at-building-exploits/
7. 中国电信 TeleOCR:1.2B 参数文档解析模型,多榜领先并已开源
中国电信星辰通用人工智能实验室推出文档解析模型 TeleOCR,参数规模约 1.2B。该模型在 OmniDocBench v1.6 综合得分 96.87,Wild-OmniDocBench 得分 88.53,PureDocBench 三个赛道综合均值 78.41;在 ICDAR 2026 Sci-ImageMiner 科学图表转表格挑战赛中获得第一名。模型已通过 GitHub、Hugging Face 开源,并登上 HuggingFace 趋势榜前五,HuggingFace 官方为其提供 ZeroGPU 在线 Demo 和免费算力。TeleOCR 针对真实拍摄场景中纸张弯曲、折痕、透视畸变、阴影等问题,以及多栏正文、复杂表格、公式和科学图表等细粒度任务进行优化。 来源:https://mp.weixin.qq.com/s/pz0qloEOB4o5OMnIFoToyw
8. 至知创新 IQuest-Q1:320B 开源黑马,模型自己抓训练 Bug
至知创新研究院(IQuest Research)发布 320B 开源大模型 IQuest-Q1,权重和博客同步公开。该模型采用稀疏 MoE 架构,训练上使用多教师在线策略蒸馏(MOPD),由四位教师模型针对学生自身错误进行批改,而非标准答案复制,最后合并多阶段模型。研发过程中,一次强化学习训练得分曲线走平,系统未报错但分数停滞;IQuest-Q1 自主排查训练日志、对话记录和代码,定位到推理服务在输出转文字时多插入一个空格,导致逐字比对时历史对话被割裂、前几轮数据未参与训练。关闭该设置后重新训练,平均得分从 0.704 提升至 0.769,后段进一步升至 0.799。 来源:https://mp.weixin.qq.com/s/EXuczh9JV57QzX_RTQ2EfQ
9. TypeSafe AI 发布 Jev:决策型模型返回类型化概率而非文本
TypeSafe AI 由前 OpenAI 研究员 Diogo Almeida 创立,其发布的新模型 Jev 不做文本生成,而是作为决策模型返回类型化输出。Jev 并行评估输入,为结果附带概率分数和置信值,面向需要结构化决策而非自然语言回答的场景。 来源:https://www.infoq.com/news/2026/10/typesafe-ai-jev-released/?utm_campaign=infoq_content&utm_source=infoq&utm_medium=feed&utm_term=global
开发生态
10. Cloudflare Containers 重构:Agent 沙箱启动快 6 倍,中位启动 648 毫秒
Cloudflare 重构 Containers 以更好支持 Agent 工作负载。Agent 不为任务预先部署沙箱,而是按需创建、要求立即就绪并能暂停恢复,因此 Cloudflare 将镜像和实例类型的选择权移入应用代码,并重写运行时。在 ComputeSDK 的独立基准测试中,容器启动中位数从超过 4 秒降至 648 毫秒;Cloudflare 自身初步测试中,突发场景能在数秒内创建数十万个容器。文件系统快照进入公测。每个容器仍配备独立 Durable Object 作为持久化可编程控制器,新能力直接接入原生 ctx.container API,该模型将延伸至 Sandbox SDK 1.0。 来源:https://blog.cloudflare.com/faster-agent-sandboxes/
11. Cloudflare AI Gateway Auto Router 公测:最高节省 30% 模型成本
Cloudflare 在 AI Gateway 中推出 Auto Router 公测。用户将模型设置为 cloudflare/auto 后,路由器自动把每个请求分配给足以胜任该任务的模型,无需终端用户手动选择。Cloudflare 内部通过 OpenCode 框架测试显示,与统一使用 OpenAI Sol 和 Anthropic Claude Opus 等前沿模型相比,最高可节省 30% 成本。该机制旨在让组织在保持高能力模型可用性的同时,自动降低 token 支出。 来源:https://blog.cloudflare.com/auto-router/
12. Google Data Agent Kit 正式 GA:MCP 工具连接 Data Cloud 超 15 项服务
Google Cloud 宣布 Data Agent Kit 正式 GA。该免费套件提供 MCP 工具与开源技能,使 Claude Code、Codex 等编程代理连接 Google Data Cloud。GA 版本新增支持 BigQuery Graph、Bigtable 及 Managed Service for Apache Spark 数据湖仓,MCP 工具覆盖超 15 项服务。开源技能涵盖 BigQuery SQL 优化、Bigtable 行键设计与 dbt 管道构建。套件支持 VS Code、Cursor 等 IDE 及 Claude Code 插件,并预装于 Cloud Shell 与 Cloud Workstations。 来源:https://cloud.google.com/blog/topics/developers-practitioners/data-agent-kit-is-now-ga-bring-google-data-cloud-to-any-coding-agent/
产品应用
13. Meshy ARR 突破 1 亿美元:3D 生成开始进入游戏与打印生产环节
3D 生成公司 Meshy 的年度经常性收入(ARR)达到 1 亿美元,不到两年前该数字为 100 万美元,增速显著超过传统 SaaS T2D3 基准(ARR 从 100 万到 1 亿至少 5 年),也快于 AI 视频公司 HeyGen 的 29 个月,Meshy 用时不到 24 个月。去年 11 月 Meshy 披露 ARR 1500 万美元、注册用户约 600 万;今年 3 月 ARR 翻至 3000 万、注册用户超 1000 万;4 月 ARR 超 4000 万;五个月后达到 1 亿美元。十个月内注册用户从约 600 万增至超 1500 万(约 2.5 倍),ARR 增长约 6.7 倍,单个注册用户对应 ARR 从约 2.5 美元升至接近 6.7 美元。今年 4 月披露显示,超过一半增长来自自然渠道,客户生命周期价值是获客成本的 4 倍以上,在欧美 AI 3D 市场流量份额超 60%。产品侧,9 月发布的 Meshy 7.1 新增 Ultra 4K 模式,未简化网格最多 8000 万三角面,可将盔甲刻花、布料织纹、鳞片做进几何结构。传统方式制作一个 3D 模型约需两周和 1000 美元,使用 Meshy 可压缩到几分钟和约 1 美元。 来源:https://mp.weixin.qq.com/s?__biz=MzkyNjU2ODM2NQ==&mid=2247633771&idx=1&sn=5be4edc85d265ec49e4c6e018650120c
14. Shopify 开放 Checkout 给浏览器 AI Agent,与亚马逊阻止路线相反
电商平台 Shopify 允许基于浏览器的 AI Agent 在其商家网站完成购买,与亚马逊及据报道的 Adidas 等零售商阻止 AI Agent 代购的路线相反。此前 Shopify 已通过 WebMCP 支持 Agent 搜索库存和加购,此次扩展到结账环节,包括 Shop Pay。新增三个工具让 Agent 读取结账页、修改地址或配送选项,并在买家授权后提交订单,全程无需截图或爬虫。该功能基于 Shopify 的 Universal Commerce Protocol,与面向服务端 Agent 的托管 MCP 服务器互补,正在向所有符合条件的商家推出。Shopify 产品经理 Gil Greenberg 建议开发者在买家浏览器中运行 Agent 时使用这些结构化工具,以确保商务信息和必要披露的准确性。 来源:https://theaiinsider.tech/2026/09/30/shopify-opens-checkout-to-browser-based-ai-agents-as-rivals-block-agentic-shopping/
15. 京东技术实践:纯 Codex 驱动,81.8 秒视频 15 个版本迭代成片
京东科技团队发布一次纯 Codex 驱动的 AI-native 视频实践。输入产品资料后,Codex 调用工具维护工程,完成从脚本、分镜、画面、动效、配音到混音的整条制作链路,最终成片长 81.8 秒,包含 12 个主体分镜和一个品牌收尾,共经历 15 个主要版本迭代。制作中 HyperFrames 负责画面工程渲染,Mossland 提供旁白,ACE Studio 提供候选音乐,FFmpeg 完成媒体处理与混音封装。版本演进从早期讲清产品操作,到 V9-V10.1 重组故事结构,V11-V12.5 调整表达与交互,V13-V14 加入用户声音与市场分析,V15 精修节奏与声音并落在 81.8 秒。团队同时开源 ai-video-director Skill,把创意规划、参考拆解、制作和审片整理成可执行流程。 来源:https://mp.weixin.qq.com/s?__biz=MzU1MzE2NzIzMg==&mid=2247503074&idx=1&sn=06d69c5d7da34dacfc0c621ca269b7ba
技术与洞察
16. 人大 ME-Decoding:解码不能只看概率,引入语义冗余延迟仅增 3%
中国人民大学团队提出 Mahalanobis-Ensemble Decoding(ME-Decoding),被 EMNLP 2026 Main Conference 接收。现有 Top-p、Min-p 等方法仅按概率截断候选 token,但多个高概率 token 可能语义高度相似,而概率略低但语义方向不同的 token 会被提前截断。ME-Decoding 将候选 token 看作待剪枝的集成成员,同时读取模型概率和 token embedding,在每个生成步骤中动态寻找置信度高、内部冗余低的 sampling support。论文定义 Mahalanobis-Ensemble Energy 统一衡量概率与冗余,并引入随分布不确定性变化的规模惩罚。在三个模型、三个温度设置的汇总结果中,该方法在推理与开放式生成任务上均取得最佳平均表现;端到端 GPU 测试中,相比最快的概率截断基线,总延迟仅增加约 3%。 来源:https://mp.weixin.qq.com/s/ChcBYE_i2YdKuBIwpFphtA
17. OpenAI 神秘 RL 算法被解密:Score Centering 实为 STE 近似
一篇 arXiv 论文解析了 OpenAI 后训练 RL 算法 Score Centering。作者认为该算法本质是 straight-through estimation(STE)的近似实现,这种技巧在涉及 Sim-to-Rail 的 RL 设定中早有应用。大模型 RL 中训练引擎 Megatron 与推理引擎 vLLM 存在 logits 差异,目标是优化 vLLM 部署效果,但只能用 Megatron 梯度近似。Score Centering 与 STE 近似在 on-policy 下梯度完全一致;进入 off-policy 设定后,OAI 算法没有 importance sampling,等价于始终从一个分布采样,而 STE 估计版本则带 ratio 因子,因此 OAI 版本在 off-policy 时存在偏差。 来源:https://mp.weixin.qq.com/s?__biz=MzU3NjE4NjQ4MA==&mid=2247557392&idx=1&sn=9fd8889dd6e1d96befa5d69c88056b1f
行业动态
18. ElevenLabs 估值翻倍至 220 亿美元:企业对话式 Agent 需求驱动
语音 AI 公司 ElevenLabs 完成 3 亿美元员工 tender offer,估值达到 220 亿美元,较今年 2 月 D 轮时翻倍。此次估值上升由企业客户对对话式 Agent 的需求驱动。 来源:https://elevenlabs.io/blog/tender-22bn
19. Reco 融资 5500 万美元:应对企业 AI Agent 泛滥,客户超 100 家
AI 安全公司 Reco 完成 5500 万美元融资,扩展今年 2 月 3000 万美元的 B 轮,AT&T 风投部门、Forestay 和 Quadrille Capital 参投,总融资额达 1.4 亿美元。联合创始人兼 CEO Ofer Klein 称公司估值较 2 月翻倍以上,处于数亿美元高区间,ARR 为数千万美元且预计今年三倍增长。Reco 现有客户超 100 家,金融服务约占 40% 业务。该公司最初聚焦 SaaS 和 AI 平台的安全映射,现重新定位为构建连接 Agent、应用、人员、账户和权限的上下文图谱,让安全团队看清 Agent 能触达什么并移除不必要的访问。Klein 称企业部署 Agent 的速度超过追踪速度,平台曾在某财富 100 强客户处发现 21,000 个未知 Agent。Reco 已集成超 280 个应用,并利用浏览器和网络信号检测其他位置的 Agent。 来源:https://theaiinsider.tech/2026/09/30/reco-announces-55m-in-funding-to-tackle-ai-agent-sprawl-across-enterprises/
前瞻与传闻
20. 苹果被曝 10 月 13 日发新品:Siri AI 进家门,HomePad 等三款设备亮相
据彭博社 Mark Gurman 爆料,苹果计划在 10 月 13 日发布由 Siri AI 加持的多款设备,重启智能家居产品线。届时预计推出三款产品:智能家居中枢、新一代 HomePod mini 和久违更新的 Apple TV。其中代号 J490 的智能家居中枢受关注,据知情人士描述配备约 6 英寸方形触摸屏,支持桌面摆放和墙面安装,桌面版采用圆形金属底座加支臂设计,厚度与 iPhone 大致相当,边框宽度接近旧款 iPad。该设备运行融合 iOS、watchOS 和 tvOS 元素的家庭系统,可控制 HomeKit/Matter 设备,承担音乐、FaceTime、日历等公共功能,内置摄像头可根据距离动态调整界面并识别不同家庭成员显示个性化内容。HomePod mini 自 2020 年发布后六年未更新,现售第三代 Apple TV 发布于 2022 年,智能中枢原定 2025 年 3 月发布但已跳票一年半。本月初 Siri AI 开始以英语测试版推出,被视为苹果重启该产品线的信号。 来源:https://www.ifanr.com/1682750?utm_source=rss&utm_medium=rss&utm_campaign=
暂无评论。