Anthropic 950 个 AI Agent 连续工作 21 小时独立发现类 CRIS【AI 早报 2026-09-25】

Anthropic 950 个 AI Agent 连续工作 21 小时独立发现类 CRIS【AI 早报 2026-09-25】

今日看点:Anthropic 用 950 个 Claude Agent 在自建实验室独立发现 ART 酶系统;OpenAI GPT-6 Sol/Luna API 价格砍半;TypeSafe AI 估值一周暴涨 50 倍至 100 亿美元;DeepSeek 公开单日承载 38 万沙箱实例的 DSec 报告。

今日概览

  1. Anthropic 950 个 AI Agent 连续工作 21 小时独立发现类 CRISPR 新酶系统
  2. OpenAI 发布 GPT-6 Sol 和 Luna,API 价格较 GPT-5.6 促销价下降 50%
  3. 北大&谷歌提出 Harness-Zero:Agent 当脚手架蒸馏后扔掉外壳,宏平均成功率反超 21 个百分点
  4. 小米公开 MiMo-V3 核心架构 HySparse2:token 级稀疏选择,强制保留最近 128 个 token
  5. DeepSeek 公开 DSec 技术报告,单日峰值承载 38 万沙箱实例
  6. 北大开源 DataFlex-RL:591 次实验验证动态数据策略,登 HuggingFace 日榜第二
  7. Jev 开发商 TypeSafe AI 洽谈超 10 亿美元融资,估值一周暴涨 50 倍至 100 亿美元
  8. Claude 网页版因汉字触发双字节字符串限速,首个代码块高亮耗时从 1 秒降至 0.35 秒
  9. Meta Connect 2026 发布 43 克音频眼镜与 100 克 VR 眼镜,起售价 349 美元
  10. 中国电信开源 TeleOCR:1.2B 参数文档解析模型,OmniDocBench v1.6 总分 96.87 登顶
  11. 阿里云百炼上线 Qwen-Audio-3.1,Google 发布 Gemini 3.8 Flash TTS 系列
  12. Google Cloud API Gateway 原生支持 MCP:REST API 直接转为 AI 代理工具
  13. 清华&无问芯穹开源 RLark:5 分钟纳管机器人,10 秒启动跨集群任务
  14. 七校联合开源 OpenWAM:面向世界动作模型的模块化研究全栈
  15. Black Forest Labs 发布 FLUX 3 Action:70 亿参数开放机器人模型,RoboLab-120 破纪录

前沿研究与模型架构

Anthropic 950 个 AI Agent 连续工作 21 小时独立发现类 CRISPR 新酶系统

Anthropic 在自建的 BSL-1/BSL-2 分子生物学实验室里,用约 950 个 Claude Agent 完成了一次此前未知的生物酶系统发现。整个过程中人类科学家只给出一个宏观方向——去海量 DNA 数据库中寻找有趣的逆转录酶,随后 950 个 Agent 消耗 2.1 亿 token、连续分析 21 小时,从超过 20 万个逆转录酶中筛选出 3500 个新候选系统,最终锁定 20 个最具价值的目标。其中一个 Agent 在一段巨型噬菌体原始 DNA 序列旁注意到串联重复阵列,自主完成重复序列长度与间距计算、已知逆转录酶系统结构比对、全球文献检索,最终生成完整假说报告。这套被命名为 ART(阵列关联逆转录酶)的系统包含一个逆转录酶、一个伴生基因和一整串等间距排列的非编码 DNA 重复序列。首轮湿实验已证实,ART 系统的阵列确实会在细胞内表达为一组特定的短 RNA。CRISPR 先驱、MIT 及 Broad 研究所教授张锋公开评价这是 AI Agent 推动生物学发现的令人兴奋案例。Anthropic CEO Dario Amodei 表示该研究达到了他读博士时会为之骄傲的标准。

来源:https://mp.weixin.qq.com/s?__biz=Mzg3MTkxMjYzOA==&mid=2247519201&idx=1&sn=e03335f671de6d77e8e59adb13db3704

OpenAI 发布 GPT-6 Sol 和 Luna,API 价格较 GPT-5.6 促销价下降 50%

OpenAI 在 GPT-6 Astra 发布不到一个月后推出 GPT-6 Sol 和 GPT-6 Luna,采用与 Astra 相似的训练方法,并通过缓存和推理效率优化降低成本。API 价格相比 GPT-5.6 促销价直接下降 50%:Sol 每百万输入 token 从 4 美元降至 2 美元,输出从 20 美元降至 10 美元;Luna 每百万输入 token 从 0.20 美元降至 0.10 美元,输出从 1.20 美元降至 0.50 美元。在 AutomationBench 的 xhigh 推理级别下,Sol 表现超过最高推理级别的 Claude Opus 5,但单项任务成本仅为后者的 9%;在 Agents’ Last Exam 最高推理级别取得 56.4% 成绩,比 Opus 5 成本低 60%;在 DeepSWE v1.1 最高推理级别取得 68.8%,与 Claude Fable 5 的 69.9% 相差 1.1%,但单项任务成本低约 80%。Luna 在 DeepSWE v1.1 最高推理级别取得 66.6%,成本比 Opus 5 低 93%、比 Fable 5 低 96%。官方测试显示 Sol 事实错误次数约为上一代一半,Luna 在更高推理级别下可达 GPT-5.6 Sol 水平但成本仅约百分之一。

来源:https://mp.weixin.qq.com/s?__biz=MzkzMDY1NDgyOQ==&mid=2247836318&idx=3&sn=67a99c2a2a4b0d306bb555f035856dba

北大&谷歌提出 Harness-Zero:Agent 当脚手架蒸馏后扔掉外壳,宏平均成功率反超 21 个百分点

北大与谷歌针对同一模型套不套脚手架表现差异巨大的问题,提出 Harness-Zero 范式,核心概念是 agent-as-harness:不用代码当脚手架,而用另一个 Agent(harnessing agent)当脚手架,把优化 harness 的指导逐条翻译成学生动作空间里可执行的修正。在 GPT-5.6 Sol 和 DeepSeek-V4-Pro 两个前沿模型、三个基准上,agent-as-harness 配进化出的 K 拿到平均 81.1%,超过 code-as-harness 的 78.1%,远超裸 mini-SWE-agent 的 68.6%;空 K 的审查只有 69.2%,说明增益主要来自 K 里的领域知识。蒸馏阶段用 Qwen3.5-9B 当学生、GPT-5.6 Sol 当 harnessing agent,训练完撤掉 h⋆、K 和 harnessing agent,学生只挂极简 h 上阵,宏平均成功率从 23.3% 升至 44.3%,绝对提升 21.0 个百分点、相对提升 90.1%,超过基座模型挂着 h⋆ 时的 41.7%。对照组中 DeepAgents 把 9B 模型拖到 20.5%,Claude Code 拖到 15.9%。行为分析显示,蒸馏模型对 28 个 harness 独有行为模式的平均恢复率达到 82.3%。

来源:https://mp.weixin.qq.com/s?__biz=Mzk0MTYzMzMxMA==&mid=2247512157&idx=2&sn=c387f6b005b1e07f457d61ccca71c038

小米公开 MiMo-V3 核心架构 HySparse2:token 级稀疏选择,强制保留最近 128 个 token

小米公开面向 MiMo-V3 的新一代架构 HySparse2,针对长程多轮 Agent 任务中高效读入、节省显存和精准检索三个要求设计。架构借鉴 YOCO 分为 Self-Decoder 和 Cross-Decoder,并引入两级 KV 共享:KV Bridging 让后半部分 Full Attention 层直接从前半部分对应层的输入隐藏状态生成 KV Cache,不必逐层等待;KV Reuse 在同一 Hybrid Block 内让后续 Sparse Attention 层复用 Full Attention 层的 KV Cache 和选择索引。稀疏选择从第一代的块级改为 token 级,模型强制选中最近的 128 个 token,再从窗口外选择 1,024 个全局 token,两部分共同读取共享 KV Cache,不再需要单独的 SWA 分支和局部 KV Cache。在相同全局 token 预算下,token 级选择在 RULER-v2、多轮检索 MRCR-v2 和图推理 GraphWalks 上均获得提升。

来源:https://mp.weixin.qq.com/s?__biz=MzUxMDQxMDMyNg==&mid=2247520397&idx=1&sn=586bffd5f97e396711c400816f7d1262

DeepSeek 公开 DSec 技术报告,单日峰值承载 38 万沙箱实例

DeepSeek 发布 DSec(DeepSeek Elastic Compute)技术报告,公开支撑从 V3.2 到 V4.1 所有 RL 训练和评测的沙箱基础设施。统一入口是 libdsec Python SDK,刻意不做全语义抽象,提供 FnCall、容器、Firecracker microVM、完整 VM 四种后端,分别适配 OJ 判题、软件工程、安全类和 computer-use 等负载。规模上,一个单元一天服务约 300 万个沙箱实例,峰值并发约 38 万个,创建速率超过每秒 5000 个。生产采样显示,容器任务每个任务创建的沙箱数量中位数 2528 个、p99 达 16388 个;约 90% 的容器和 microVM 平均 CPU 用量不到申请量的 5%,单节点稳定跑过 3200 个容器或 800 个 microVM。镜像侧一周活跃环境产物超 130 TB,容器镜像 fanout 中位数仅 3,各语言镜像运行时真正被访问的数据只占 4.2% 到 13.3%,DSec 因此采用可组合环境层和 EROFS 只读文件系统按需加载。

来源:https://mp.weixin.qq.com/s?__biz=Mzk0MTYzMzMxMA==&mid=2247512157&idx=1&sn=dbadbc4ee000f166c350a6f76606074b

北大开源 DataFlex-RL:591 次实验验证动态数据策略,登 HuggingFace 日榜第二

北大 DCAI 团队联合 UCAS、上海算法创新研究院、中关村学院发布 DataFlex-RL,复用 verl 训练流程,把数据选择、样本重加权和领域配比调整做成可配置组件,让开发者可以在同一套 RLVR/GRPO 流程中配置三类动作:选择哪些 rollout 参与当前更新、给样本或 token 分配多大学习权重、决定下一批数据从哪些领域采样。策略直接复用 RL 循环已经产生的奖励、优势、token 概率和 prompt 分组等信号,rollout、验证和策略更新代码基本不变。论文组织 591 次实验,在多种模型和数学、逻辑、科学任务上检验数据策略,发布后登上 HuggingFace #2 Paper of the day。具体策略包括 difffilter 只保留解出率严格处于 0.2 与 0.8 之间的组、maxvar 保留组内奖励方差最大的子集、gfpo 按奖励与回答长度比值选择、topk 保留 advantage 幅值排名靠前的回答。

来源:https://mp.weixin.qq.com/s/iQpB2u3KJW84MwkXyAMmrg

产品、终端与行业应用

Jev 开发商 TypeSafe AI 洽谈超 10 亿美元融资,估值一周暴涨 50 倍至 100 亿美元

Jev 的开发商 TypeSafe AI 正在洽谈一轮 10 亿美元以上的融资,有投资人愿意按 100 亿美元以上估值进场。上周这家公司刚宣布 4000 万美元种子轮,PitchBook 记录估值 2 亿美元,一周多一点估值暴涨 50 倍。创始人 Diogo Almeida 曾在 OpenAI 参与 RLHF 和 InstructGPT 核心工作,2024 年离开后与 Erik Gafni、Sasha Sheng 创立公司。Jev 定位“System One 模型”,只做三件事:选一个选项、打一个分、判一个是或否,每个答案附带概率,不做文本生成。定价为输入每百万 token 0.042 美元、输出免费,一次判断几十到几百毫秒完成。上线 Vercel AI Gateway 后 24 小时内将近 13% 的付费团队用过它,采用比例是 GPT-5.6 家族的 2 倍、Fable 5.1 的 6 倍多;TypeSafe 测试显示同一套工作流比语言模型快 194 倍、便宜 445 倍。

来源:https://mp.weixin.qq.com/s?__biz=MzI3MTA0MTk1MA==&mid=2652729480&idx=2&sn=c678eeed296f7b4ec3b754909b530eb5

Claude 网页版因汉字触发双字节字符串限速,首个代码块高亮耗时从 1 秒降至 0.35 秒

Anthropic 工程复盘显示,Claude 网页版语法高亮时,若文本中混入破折号或一个汉字,V8 引擎会将字符串从单字节格式转为双字节格式,导致处理正则表达式的速度变慢,页面可能冻死近 1 秒钟。修复方法只需约 20 行代码:在上色之前把每个代码块单独拷贝一份,强行存成单字节字符串。改动后第一个代码块的上色时间从 1.0 秒降到 0.35 秒。实测中纯英文回复首个代码块高亮只要 188 毫秒,混入破折号或弯引号后时间直接飙升,中文用户只要回复里有一个汉字,带代码的回复都会被直接限速。这项优化连同其他改进,让 claude.ai 网页版和桌面端整体速度提升 3 倍。

来源:https://mp.weixin.qq.com/s/pNRtgjNGeIGb0N1864vk2Q

Meta Connect 2026 发布 43 克音频眼镜与 100 克 VR 眼镜,起售价 349 美元

Meta 在 Connect 2026 主题演讲上发布 Ray-Ban Meta Audio、Meta VR Glasses 等硬件。Ray-Ban Meta Audio 去掉摄像头,只保留开放式扬声器、六麦克风系统和 Muse 智能助手,重量降至 43 克,续航 12 小时,比带摄像头版本长约 3 小时,提供 Burbank 和 Clubmaster 两款镜框、23 种颜色和镜片组合,起售价 349 美元。该产品增加 Hearing Enhancement 助听功能,需 150 美元一次性买断或订阅 Meta One 会员。带摄像头的 Ray-Ban Meta Gen 3 起售价从 379 美元涨至 449 美元,保持 1200 万像素相机、支持 3K 视频录制,麦克风增至 6 个。Meta Glasses 自有品牌 Adventurer 入门版降价 50 美元至 249 美元。Meta VR Glasses 重量约 100 克,采用分体式设计,计算模块约 300 克,搭载高通 Snapdragon Reality Elite 芯片,运行与 Quest 3 相同系统并兼容同样内容。

来源:https://www.ifanr.com/1682116?utm_source=rss&utm_medium=rss&utm_campaign=

中国电信开源 TeleOCR:1.2B 参数文档解析模型,OmniDocBench v1.6 总分 96.87 登顶

中国电信星辰通用人工智能实验室开源约 1.2B 参数的轻量级视觉语言模型 TeleOCR,在单一框架内统一处理数字文档与相机拍摄文档,将文字、版面、表格、公式和科学图表转换为结构化结果。该模型在 OmniDocBench v1.6 取得 96.87 总分登顶,超过 MinerU2.5-Pro、PaddleOCR-VL-1.6、OvisOCR2 等模型,其中文本识别 97.22、表格解析 TEDS 97.05、公式 CDM 96.36。TeleOCR 同步拿下 PureDocBench 榜首和 ICDAR-2026 科学图解析挑战赛冠军(总分 41.81)。数据工程上采用多节点共识投票、几何感知数据合成、图像到图像自验证和渐进式数据清洗,形成千万级文档解析训练数据池,大部分生成数据不依赖人工标注。模型可感知文档区域的几何形变,精准恢复扭曲区域空间位置,输出 Markdown、JSON 等结构化形式。

来源:https://mp.weixin.qq.com/s/__biz=Mzk3NTc1NTU0Mw==&mid=2247514127&idx=1&sn=e69ae50f2bb9aec79813217b37164c80

阿里云百炼上线 Qwen-Audio-3.1,Google 发布 Gemini 3.8 Flash TTS 系列

Qwen-Audio-3.1 系列已在阿里云百炼提供调用入口,覆盖录音转写、流式识别、语音合成和实时语音交互。其中 TTS-Next 可在一次生成中组合人声、音效与环境声,适合多人对白、播客和影视游戏音频,播客单次最长 4 分钟、其他场景最长 2 分钟,支持参考音频保持角色声音一致性。Realtime-Plus 面向双向实时语音对话,支持文字与音频输入输出、声音克隆和工具调用,但联网搜索与 Function Calling 不能同时开启。Google 同期发布 Gemini 3.8 Flash TTS 和 Flash-Lite TTS,通过 Gemini API 与 Google AI Studio 提供服务。Flash 侧重角色声音设计与精细表演控制,可根据自然语言描述创建声音并指定角色、口音与音色;Flash-Lite 侧重大规模、成本敏感的语音生成。两版本均支持逐句安排语气和节奏、双人对白轮流发言,还能加入笑声、叹气等非语言表达,官方提供基于 30 秒参考音频的声音复刻。

来源:https://mp.weixin.qq.com/s/__biz=MzkyMzcwMDIyMQ==&mid=2247503772&idx=1&sn=db9231ee9444e62d10d6e5f9ee7a3a2a

Google Cloud API Gateway 原生支持 MCP:REST API 直接转为 AI 代理工具

Google Cloud API Gateway 已升级为原生远程 Model Context Protocol(MCP)服务器,开发者无需构建自定义中间件,即可将现有 REST API 直接暴露给 AI 代理。实现方式是在现有 OpenAPI 3.x 规范中添加特定注解(如 x-google-api-management.mcp),把标准 REST 操作转换为可被 AI 代理发现的即用型工具。该网关会自动将传入的 MCP JSON-RPC 请求转码为 REST 调用,确保现有身份验证、配额和日志记录策略无缝覆盖代理流量,且无需部署额外基础设施。

来源:https://developers.googleblog.com/turn-your-rest-apis-into-mcp-tools-with-google-cloud-api-gateway/

机器人与具身智能

清华&无问芯穹开源 RLark:5 分钟纳管机器人,10 秒启动跨集群任务

清华大学与无问芯穹共同打造并开源面向具身智能的云原生纳管平台 RLark,核心是自研的具身设备运行时(embodied-runtime)和任务级跨集群网络互联技术。平台将机器人、相机等具身设备的运行时环境统一管理,让设备像 GPU 一样被申请、调度和复用,并对不同任务和网络流量特征的跨集群通信进行任务级隔离。目前 RLark 已完成 3 个集群、近百个云边端节点的统一纳管,覆盖 4 种型号的具身设备,设备纳管从小时级缩短至约 5 分钟,任务提交后 10 秒内即可启动运行。团队将 RLark 与强化学习基础设施框架 RLinf 结合,在广东云端 GPU 集群与北京机器人现场之间完成跨地域真机实测,现场设备负责交互和数据采集,云端 GPU 承担训练计算,共同支撑采集、训练与真机验证闭环。平台从用户界面、API、后端服务到任务编排、跨集群互联和具身设备运行时的整套能力已开放。

来源:https://mp.weixin.qq.com/s/BbI4sgDYojxgX3b-ABKNNQ

七校联合开源 OpenWAM:面向世界动作模型的模块化研究全栈

新加坡国立大学、清华大学、北京大学等七所高校开源 OpenWAM,面向世界动作模型(WAM)提供开源研究全栈与基座模型,核心思路是把视频生成预训练中的视觉动态先验和机器人轨迹提供的可执行动作监督放进同一个模型。OpenWAM-Infra 定义可组合模型、训练运行时、部署运行时和评测协议四个有明确接口的部分,模型由视觉编码器、数据流骨干网络和可见性注意力掩码组合而成,支持单系统、双系统和三系统三类架构。评测协议覆盖 LIBERO、LIBERO-Plus、VLABench、RoboTwin2.0、RoboDojo、RoboCasa365、EBench 和 RoboCasa-GR1 八个仿真基准,涵盖单臂、双臂、移动操作和灵巧手等具身形态。研究结论指出,充足的生成式世界先验、紧凑且信息丰富的视觉表征、明确的世界到动作信息流以及跨域具身预训练是构建高性能 WAM 的关键。

来源:https://mp.weixin.qq.com/s/VhDj6wqrnBoJL4dYFq8eUw

Black Forest Labs 发布 FLUX 3 Action:70 亿参数开放机器人模型,RoboLab-120 破纪录

Black Forest Labs 进入机器人领域,发布开放世界动作模型 FLUX 3 Action。该模型使用相机画面预测机器人下一步应该采取的动作,参数量仅 70 亿,在 RoboLab-120 基准上创下纪录,同时运行速度比此前最强模型快至 3.95 倍。

来源:https://the-decoder.com/black-forest-labs-launches-flux-3-action-an-open-robotics-ai-model/

评论

暂无评论。

登录后可发表评论。