Hinton 等 22 位研究者发文:AI 一年进步或压缩至 5 周【AI 早报 2026-10-06】
今日看点:Hinton、Bengio 等作者把“AI 研发自动化触发智能爆炸”写成正式论文;Google 首颗 TPU 进入轨道测太空算力;GLM 5.3、Reka Rho-1、Kolibri 密集更新,Token 商战和 AI 广告也在落地。
今日概览
要闻
- Hinton 等 22 位研究者发文:AI 一年进步或压缩至 5 周
- Google 首颗 TPU 送入轨道,测试千瓦级太空 AI 算力
模型发布
- GLM 5.3 上线 Amazon Bedrock:753B MoE 主打编码、智能体与网络安全
- Reka Rho-1 用 190 亿参数单模型打通文本、图像、视频和机器人控制
- Aleph Alpha 开源 Kolibri:78B MoE、每 token 约 30 亿激活参数
开发生态
- Databricks Runtime 提供 NEAREST BY 原生批量向量检索
- Akka 用 65 个开源项目测试规范驱动 AI 交付,模型和投入差异显著
- Photon 获 450 万美元种子轮,开发者用统一 API 构建 iMessage/WhatsApp 智能体
产品应用
- Shopify Canvas 让商家用对话方式生成和修改真实网店代码
- ChatGPT 在图像生成等待界面投放产品轮播广告
- OpenAI Codex 负责人 Tibo:未来 28 天每天推出可感知改进,否则重置额度
技术与洞察
- VA-Bench 测出多模态模型“看懂空间”与“完成任务”的执行断层
- 哥伦比亚大学 FlexiTac:3 分钟组装的开源压阻触觉传感器
- Graphite 研究:AI 模型仍留下 1.3 万种写作特征
- Google Research 负责人 Yossi Matias:GenUI、Earth AI 与 AI Co-Scientist 提速科研
- Simon Willison 测试 Qwen3.8 27B 禁用推理后的英文单词加法
行业动态
- Token“白菜价”:9.9 元 1000 万 Token 套餐与地方国资涌入
- Harvey 联创:应用公司靠开源与外部研究团队建立研究能力,估值 155 亿美元
- Armadin 完成 2.555 亿美元 B 轮,估值超 25 亿美元主攻 AI 黑客智能体集群
前瞻与传闻
- 据报亚马逊考虑 80 亿美元英伟达芯片售后回租为 AI 基建融资
要闻
Hinton 等 22 位研究者发文:AI 一年进步或压缩至 5 周
这篇题为《What if automating AI R&D triggers an intelligence explosion?》的论文由 Geoffrey Hinton、Yoshua Bengio、Andrew Barto、Jakub Pachocki 等 22 位研究者撰写。论文核心判断是:一旦 AI 能较完整地进入下一代 AI 的研发流程,递归自我改进可能真正闭环,智能爆炸未必需要 AI 先成为超级智能。作者引用的内部数据显示,Anthropic 获批的 AI 生成代码比例从 2025 年 1 月的低个位数,升至 2026 年 5 月的超过 80%;Claude 在仅接受高层次人类监督下可自主承担的内部 AI 研发工作比例,也从 2026 年 3 月约 1% 升至同年 8 月的 26%。截至 2026 年 9 月,OpenAI 内部系统已能经常完成人类原本需要数天的研发任务。论文进一步推演,未来 AI 实验室规模可能从几千名研究员扩张到数百万名,今天一年完成的 AI 进步在极端情况下可能只需约 5 周。论文把AI R&D 自动化视为由软件改进驱动的智能爆炸路径,强调关键在于提出假设、设计实验、执行、分析、纠错、调整路线等环节被串成长链。
Google 首颗 TPU 送入轨道,测试千瓦级太空 AI 算力
Google 首次把自家先进芯片送入太空,载荷是一颗由 Planet Labs 建造的轨道计算卫星原型,搭乘 SpaceX 火箭从加州发射。任务将在轨测试 Google TPU 能否持续获得千瓦级供电、完成散热并运行一系列 AI 模型。Project Suncatcher 负责人 Travis Beals 表示,地面测试无法完全复现轨道条件,卫星将以每次 15 分钟的短突发方式运行 TPU,以保护供电与热控系统。Google 计划在明年用两颗专用卫星通过激光链路演示更大负载。更长期的目标是 81 颗卫星近距离编队组成在轨数据中心,但 Beals 称目前尚不存在能支撑其成本目标的火箭。Google 还发布了发表于《Joule》的白皮书,预测 SpaceX 到 2035 年发射价格可接近每公斤 200 美元,对应约 1800 次 Starship 发射;更新的辐射测试则显示其芯片适合在 5 年寿命内承担大型推理任务,但不适合大规模训练。
模型发布
GLM 5.3 上线 Amazon Bedrock:753B MoE 主打编码、智能体与网络安全
Z.ai 的 GLM 5.3 现已在 Amazon Bedrock 上线,面向符合条件的企业客户开放。这是一个 753B 参数的 MoE 模型,公开版本面向编码和长周期智能体任务优化,Z.ai 也特别报告了它在网络安全方向的能力。Bedrock 侧提供完全托管 API、跨区域推理、提示缓存、服务分层,无需用户自建推理基础设施;接入方式覆盖 OpenAI 兼容的 Responses 与 Chat Completions API,以及 Invoke 和 Converse。Z.ai 称 GLM 5.3 在 DeepSWE、Terminal Bench 3.0、FrontierSWE 等编码基准上具备竞争力,并在其内部编码基准上比 GLM 5.2 提升 50%;由于基准在 GLM 5.1 后更新,官方未给出与 GLM 5 的直接对比。安全方面,GLM 5.3 发布时在 CyberGym 基准上测得 84.5 分,AWS 博客演示了将其用于 Strix 开源 AI 渗透测试智能体执行授权安全测试的流程。
来源:https://aws.amazon.com/blogs/machine-learning/introducing-glm-5-3-on-amazon-bedrock/
Reka Rho-1 用 190 亿参数单模型打通文本、图像、视频和机器人控制
Reka AI 发布 Rho-1,这是一个 190 亿参数的全模态模型,可在单一神经网络中处理并生成文本、图像、视频以及机器人控制动作。Rho-1 使用 320 张 H100 GPU 训练约三个月,算力消耗远低于当前头部模型的训练规模。该模型不把任务路由给专用系统,而是把不同模态统一表示为同一共享上下文窗口中的 token,从而用一个模型覆盖语言、视觉与具身控制任务。
Aleph Alpha 开源 Kolibri:78B MoE、每 token 约 30 亿激活参数
Aleph Alpha 发布 Kolibri,这是一个德语—英语混合 MoE 模型,总参数 78B,每个 token 激活参数约 3B。训练数据中超过 21% 为德语,模型在德国和芬兰使用 768 张 B200 GPU 训练,权重以 Apache 2.0 许可证自由开放。该发布把欧洲团队的开源模型选项从 API 服务扩展到了可下载权重。
开发生态
Databricks Runtime 提供 NEAREST BY 原生批量向量检索
Databricks 把批量向量搜索做成了 Databricks Runtime 中原生的 SQL join 能力,核心语法为 NEAREST BY。实现侧使用 Photon GEMM 内核,并基于 Liquid Clustered Delta 表构建 IVF Vector Index。开发者因此可以在同一套 SQL 工作流中直接执行大规模向量相似检索,而无需先把向量数据导出到独立检索系统。
来源:https://www.databricks.com/blog/nearest-join-scaling-vector-search-databricks-runtime
Akka 用 65 个开源项目测试规范驱动 AI 交付,模型和投入差异显著
Akka 用 65 个开源项目测试 AI 辅助软件移植,重点考察规范结构、上下文、模型选择、自动化验证和交付护栏的影响。实验测量了耗时、token 用量、代码规模、测试一致性和性能,结果显示不同模型、不同投入强度以及不同项目类型之间的结果差异明显。该测试说明规范驱动的 AI 交付并非一个统一效果的方法,实际产出高度依赖工作流与工程约束。
Photon 获 450 万美元种子轮,开发者用统一 API 构建 iMessage/WhatsApp 智能体
Photon 完成 450 万美元种子轮融资,由 Gradient 和 A* 共同领投,Vercel、HSG、Z Fellows、Llama Ventures、Karman 及天使投资人跟投。该公司提供统一 API、渠道框架、CLI 和可观测套件,帮助开发者为 iMessage、WhatsApp、Telegram、SMS、邮件和语音等渠道构建智能体。Photon 称已有超过 4 万名开发者注册,四个月内收入增长 10 倍,过去一个月消息量增长 5 倍,流失率低于 3%。其开源 iMessage 机器人仍占 98% 使用量;4 月推出的托管平台达到 99.95% 可用性,并具备 SOC 2 Type II 与 HIPAA 合规。公司客户包括 Corgi Insurance、Boardy、Ditto、Rho,同时也是 Nous Research Hermes 智能体的底层能力提供方。
产品应用
Shopify Canvas 让商家用对话方式生成和修改真实网店代码
Shopify 推出 Canvas,商家可以通过与 AI 智能体 Sidekick 对话来搭建在线商店。此前无代码搭建主要靠调整主题区块,较深度的定制还需要改代码或找开发者。Canvas 下,商家描述需求后可实时查看变化,既能查看整店,也能放大到局部细节。Shopify 强调这不是静态预览,而是店内真实代码渲染,因此商家可直接测试交互、动画和不同屏幕尺寸下的布局;Sidekick 还会对自己的操作截图,以便与商家看到一致的页面。为实现这一点,Shopify 让 Sidekick 直接访问主题文件,并简化了主题架构。Canvas 仍处早期:目前仅支持桌面端,还不支持第三方主题、应用区块和扩展、多市场、翻译、灰度发布和主题更新,Shopify 表示会逐步补齐。
ChatGPT 在图像生成等待界面投放产品轮播广告
美国 ChatGPT 用户很快会在等待图像生成的过程中看到展示广告。新广告形式以产品轮播方式填充图像生成加载界面,把原本的等待时间转化为广告曝光位。
OpenAI Codex 负责人 Tibo:未来 28 天每天推出可感知改进,否则重置额度
OpenAI 的 ChatGPT 与 Codex 负责人 Tibo Sottiaux 公开承诺,未来 28 天里,每天要么推出一项对多数 Codex 和 Work 用户明显有用的改进,要么进行一次完整的额度重置。Tibo 表示自己有权在必要且合适时直接按下重置按钮,并称出问题会重置、值得庆祝也会重置;他还承认自己加入 OpenAI 第三天时曾把生产环境弄宕机。工作方式上,他所需的趋势分析、功能研究和发布复盘代码很多已由 Codex 编写,自己手写代码更多只剩周末刷 LeetCode。Tibo 同时批评当前用户需要“模型选择器博士”才能理解模型、推理强度、多智能体和 Ultra 模式差异,希望产品把选择复杂度降到背后。他判断未来互联网上大多数操作将由智能体完成,模型会更快更便宜,不同模态交互更顺畅。
技术与洞察
VA-Bench 测出多模态模型“看懂空间”与“完成任务”的执行断层
VA-Bench 以“观察—推理—行动—修正”闭环测试 12 个主要多模态模型,共包含 14 类机器人操作任务、3 类单臂之外的 3 类双臂任务各 20 个经过物理验证的场景,合计 280 个基础场景,并增加了几何迁移与长时序组合测试。结果显示,表现最好的 Qwen3.8-max、Opus-5 和 GPT-5.6-sol 完整任务成功率分别为 53.93%、52.86%、51.55%,子任务完成率为 65.9%—68.6%;换句话说,模型能完成很多步骤,却难以稳定做完整任务。目标识别与定位前三名均为 100%,操作语义理解达 99.6%—100%,但进入接触前细粒度分析和空间关系判断后成绩明显下降。错误发现得分为 73.6%、70.8%、69.9%,但在线修正分别只有 46.7%、27.3%、32.4%。双臂协同仍是断层:Qwen3.8-max 单臂成功率 65.61%,双臂降到 11.11%;Opus-5 从 64.09% 降到 11.67%。对照实验还显示,失去主动观察能力、改为固定 5 个视角后,4 个被测试模型成功率全部下降。
哥伦比亚大学 FlexiTac:3 分钟组装的开源压阻触觉传感器
哥伦比亚大学李昀烛团队在 IROS 2026 触觉研讨会上介绍了开源柔性触觉传感器平台 FlexiTac。该平台为低成本、开源、可扩展的压阻式传感器,团队公开了完整 BOM、组装说明和读取传感数据的软件。FlexiTac 采用 FPC 与力敏薄膜层叠结构,备料后约 3 分钟即可完成装配,能弯曲、裁剪并包裹到手套、指尖或机器人皮肤等几何表面。作者称其优势在于成本低、制样简单、可扩展、柔性好,并具备时间稳定性和批次一致性;其实例显示 2024 年夏天制作的传感器,一年半后仍可用旧数据训练的模型正常工作。该技术栈已接入 LeRobot,学生用 3D 打印机打出 SO-100 机械臂即可集成触觉研究。开源一年半后,FlexiTac 已衍生出多模态策略、可变形世界模型、四足移动-操作、VLA 触觉反馈等工作;与普渡大学合作的 VTAP Gripper 入围 IROS 最佳论文奖。ADI 正推进其半导体制造工艺量产版本,称触觉分辨率达到人类手指的五倍。
Graphite 研究:AI 模型仍留下 1.3 万种写作特征
Graphite 对前沿 AI 模型做了写作习惯分析,找出 1.3 万个在 AI 写作中出现频率至少是人类文本两倍的短语。研究用 1 万篇 ChatGPT 发布前的文章作为人类对照组,再让不同模型基于摘要重写这些文章,比较用词和句式。结果显示,Claude Opus 5.5 偏好“dependable”并频繁解释事情为何重要,此类表达出现频率最高可达人类作者的 116 倍;OpenAI Astra 则更多使用“某行为可能提供什么”的模糊限定,以及通过否定来定义话题,出现频率是人类文本的 100 倍以上。各实验室已大幅减少破折号使用,Gemini 3.1 Pro 几乎完全不用。Graphite 首席 AI 官 Greg Druck 表示,可识别特征总数并未减少,因为旧习惯被移除后,新模型又会出现新的写作特征;他认为 Claude 正逐渐接近人类用词模式,而 GPT 正在偏离,实验室对这些特性的控制力低于预期。
Google Research 负责人 Yossi Matias:GenUI、Earth AI 与 AI Co-Scientist 提速科研
在 Google 官方播客首期中,统管 Google Research 全球研发的副总裁 Yossi Matias 谈到了生成式界面、地球级 AI 与 AI 科研系统。他介绍,生成式 UI 会自主判断呈现形态,例如问题涉及算法时直接运行仿真,小孩问二次方程时展示投篮抛物线。Earth AI 方向则把卫星遥感、人群流动和气象模型打通,使提问对象从飓风登陆时间扩展到“哪些生命线最脆弱、最佳疏散方案是什么”。Matias 还展示了多智能体系统 AI Co-Scientist:帝国理工团队多年形成的细菌耐药性假说,这套系统仅用三天就独立推导出来。他认为 AI 提速科研、科研突破又反哺 AI,这种递归自我提升飞轮已经真实转动。他也回应了历史类比:当年搜索和维基百科省去泡图书馆的时间,社会同样担忧人类认知退化,但结果是认知基线被抬高。
Simon Willison 测试 Qwen3.8 27B 禁用推理后的英文单词加法
Simon Willison 用一个基准测试本地模型 Qwen3.8-27B-Q4_K_M.gguf,考察其在禁用推理的情况下,对正整数求和并用英文单词输出精确结果的能力。测试包含 5070 个禁用推理的样例,并与 169 组对照样例配对比较。现有摘要未披露最终比较结论。
来源:https://simonwillison.net/2026/Oct/4/qwen38-addition-in-words/
行业动态
Token“白菜价”:9.9 元 1000 万 Token 套餐与地方国资涌入
中国电信今年推出月付 9.9 元购买 1000 万 Token 的尝鲜套餐,用户可在同一账户调用星辰大模型、DeepSeek、GLM 等主流模型;按一次普通问答消耗约 2000 Token 计算,额度约覆盖 5000 次问答。地方国资也在进入 Token 市场:嘉兴城投运营长三角 Token 运营中心,温州数据集团旗下公司上线“词元天下”,北京国资公司建设 Token 工厂,广州国资平台开出模型超市。资本侧,硅基流动在 2026 年 9 月 20 日宣布完成 B+ 轮二期和 C 轮融资,年内累计融资近 29 亿元,投资方包括中国互联网投资基金、国新基金、中国移动链长基金以及多家地方国资和产业资本。Token 已从 API 账单中的计费单位,变成运营商、城投、推理平台和模型公司共同销售的商品。
Harvey 联创:应用公司靠开源与外部研究团队建立研究能力,估值 155 亿美元
Harvey 联合创始人兼总裁 Gabe Pereyra 在 Sequoia Capital 活动上表示,AI 应用公司很难在资金、人才和算力上正面对标基础模型公司,但仍可利用开源模型、专业训练平台和外部研究团队建立研究能力。Harvey 2026 年 9 月 9 日宣布完成 5.5 亿美元融资,估值达到 155 亿美元,并披露全美百大律所中超过 80% 已使用其产品。其方法分三步:先建立评测与训练数据,再与研究团队合作做后训练,最后搭建分层评测、模型路由和持续反馈的部署基础设施。Harvey 已公开三套数据集:按初级律师实际工作设计的 LegalAgentBench、用于合同谈判的合同数据集,以及包含约 8000 万 token 虚拟资料室、1000 多个单元测试的尽职调查数据集。法律材料高度敏感,Harvey 让领域专家先定义问题、材料关系和评分标准,再由 AI 生成合成数据,并用 Mercor、Snorkel 等公司协助校正与扩产。合作训练方包括 Fireworks、Baseten、Trajectory、Applied Compute。
Armadin 完成 2.555 亿美元 B 轮,估值超 25 亿美元主攻 AI 黑客智能体集群
AI 网络安全公司 Armadin 完成 2.555 亿美元 B 轮融资,估值超过 25 亿美元,累计融资达 4.45 亿美元。本轮由 Andreessen Horowitz 和 Accel 共同领投,Bain Capital Ventures 和 Redpoint 新进投资,原有股东包括 Google Ventures、Kleiner Perkins、Menlo Ventures 和 In-Q-Tel。Armadin 用一群模拟黑客行为的 AI 智能体发现组织防御弱点,新资金将用于扩展平台、研究、训练和市场体系。公司 CEO Kevin Mandia 曾创立 Mandiant 并将其出售给 Google,联合创始人还包括 CTO Travis Lanham、首席攻击安全官 Evan Peña 和首席架构师 David Slater。
前瞻与传闻
据报亚马逊考虑 80 亿美元英伟达芯片售后回租为 AI 基建融资
据报道,亚马逊正在考虑一项涉及英伟达芯片、规模 80 亿美元的售后回租交易,为大规模 AI 基础设施建设寻找新融资方式。该消息目前来自 TechRepublic,交易尚未确认。
来源:https://www.techrepublic.com/article/news-amazon-8-billion-nvidia-chip-sale-leaseback/
暂无评论。