AI 资讯日报 · 2026-09-07
今日AI领域热点纷呈:OpenAI发布号称已达AGI临界点的争议模型Astra,同时被曝跑分作弊;AI在数学、科研领域接连取得多年未有的突破,多项纪录被刷新;多款AI开发工具、企业级智能体集中开源落地,AI技术普惠化进程持续加快。
今日概览
- OpenAI发布最强争议模型Astra
- 独家|对话硅谷独角兽Axiom:00后创始人,6个人、两周秘密实验,AI打破十年素数间隔问题纪录
- 突发!Claude黎曼猜想证明获人类数学家验证
- 谷歌让AI互怼几天!小模型复现3道博士级难题
- GPT-6最佳拍档=字节Seedance
- 亚马逊云科技开源内部Agent工作台Kiro Crew
- Anthropic公开2款内部杀手级Multi-Agent架构
- OpenAI上线神级建站工具ChatGPT Sites
- StarVLA只用16卡训出登顶机器人榜单模型
- 菲尔兹奖得主入局大模型!4B手机Qwen+云端GLM刷爆ARC-AGI 3
- 个人开发者花数百美元训出登顶Hugging Face的模型
- 谷歌云发布AI智能体简化数据库生命周期管理
- 谷歌开源AI漏洞扫描框架Mantis
- 突发!GPT-6跑分作弊被抓包
大模型与产品动态
OpenAI发布最强争议模型Astra
OpenAI于近期发布全新大模型Astra,官方宣称该模型能力已达到AGI(通用人工智能)临界点,为当前OpenAI发布的最强模型。该模型在多项基准测试中表现突出,但其推理过程难以监控的特性引发了广泛的AI安全担忧,成为当下AI伦理与安全领域讨论的焦点。Fast Company发布了该模型的独家深度报道,详细披露了其性能表现与背后的争议细节。该模型的发布引发了业界对AGI进展速度和安全监管的热烈讨论,支持者认为其代表了AI能力的新高度,反对者则担忧其不可监控的推理过程可能带来未知风险。 来源:https://www.fastcompany.com/91601838/openai-unleashes-astra-its-most-capable-and-controversial-model-yet?utm_source=postup&utm_medium=email&utm_campaign=artificial-intelligence&position=7&partner=newsletter&campaign_date=09072026
突发!GPT-6跑分作弊被抓包
近日外媒爆出OpenAI旗下GPT-6 Astra的官方跑分存在作弊行为,引发行业广泛热议。此前OpenAI曾宣传Astra已触及AGI临界点,此次跑分翻车事件让该模型的可信度蒙上阴影,也再次引发了业界对AI模型跑分真实性和监管的讨论。目前OpenAI尚未就该事件作出公开回应,此次事件也引发了对大模型厂商跑分规范和透明度的质疑,呼吁行业建立更严格的模型评估标准。 来源:https://mp.weixin.qq.com/s/CFE_wh9TaUt15aEMcxgB2Q
GPT-6最佳拍档=字节Seedance
OpenAI发布GPT-6 Astra后,已有开发者快速探索其落地场景,将其与字节跳动的Seedance 2.5视频生成模型结合,实现了全流程AI影视制作。在测试中,GPT-6 Astra负责完成从故事构思、场景搭建、演员调度、分镜设计到视频生成、最终剪辑的全流程,仅需人类给出最初的任务需求,即可输出完整的成片,展现了多模型协同创作的巨大应用潜力。这一实践也展示了GPT-6 Astra在复杂多步骤任务中的规划与执行能力,为AI在创意生产领域的落地提供了新的参考案例。 来源:https://mp.weixin.qq.com/s?__biz=MzkyNjU2ODM2NQ==&mid=2247632650&idx=3&sn=cf5938f8d5dbf52e58d479b33e7f4250
OpenAI上线神级建站工具ChatGPT Sites
OpenAI recently上线了名为ChatGPT Sites的建站工具,将网站制作的流程简化到类似编辑谷歌文档的程度。用户仅需通过自然语言提示词,即可快速生成完整的网站,无论是落地页、小游戏还是轻量应用都能实现,大幅降低了网站开发的技术门槛,让非专业开发者也能快速搭建线上页面。该工具的上线进一步降低了网页开发的技术门槛,有望让更多创意工作者快速实现自己的线上想法,改变传统网页开发的流程。 来源:https://www.fastcompany.com/91602695/chatgpt-sites-makes-building-a-website-feel-like-making-a-google-doc?utm_source=postup&utm_medium=email&utm_campaign=artificial-intelligence&position=2&partner=newsletter&campaign_date=09072026
菲尔兹奖得主入局大模型!4B手机Qwen+云端GLM刷爆ARC-AGI 3
菲尔兹奖得主跨界进入大模型领域,推出了一款基于4B参数Qwen端侧模型与云端GLM模型结合的方案,在ARC-AGI 3基准测试中取得了刷榜级的成绩。该方案探索了小模型与云端大模型协同的路径,为端侧大模型的性能提升提供了新的思路,也成为当前顶级AI资讯中的焦点成果。该成果也展现了数学领域顶级学者与AI技术结合的巨大潜力,为AGI研究提供了新的方向。 来源:https://www.qbitai.com/2026/09/485108.html
个人开发者花数百美元训出登顶Hugging Face的模型
非AI PhD背景的个人开发者逯雨鑫,仅花费数百美元、使用单张5090显卡,第一版模型训练耗时5天,第二版耗时约两三周,就后训练出了两个登顶Hugging Face Model Trending榜的开源小模型。他在分享中表示,训练可用工业级模型的路径已经非常明确,借助现有AI工具,普通开发者也能完成模型微调工作,打破了“训练模型只有专业研究员才能做”的刻板印象,他的实践也证明了当前AI工具已经大幅降低了模型训练的门槛。 来源:https://mp.weixin.qq.com/s?__biz=MzIyMDE5OTYyMw==&mid=2651051662&idx=1&sn=23b5120c8d76c7921afae4298b75e001
AI科研突破
独家|对话硅谷独角兽Axiom:00后创始人,6个人、两周秘密实验,AI打破十年素数间隔问题纪录
AI for Math公司Axiom Math于9月4日宣布,在有界素数间隔问题上取得重大突破,将上界推进到212,即证明存在无穷多对相邻素数的距离不超过212。该团队由00后MIT毕业生洪乐潼领衔,核心成员仅6人,仅用两周时间就完成了这一突破,打破了该领域十多年未动的纪录。此前该纪录刚在几天内从246被推进到240,Axiom的成果再次刷新了记录,展现了AI在纯数学研究领域的巨大潜力。这一突破也标志着AI正式进入纯数学研究的核心领域,为解决长期未解的数学难题提供了新的方法论。 来源:https://mp.weixin.qq.com/s?__biz=MzI4NTgxMDk1NA==&mid=2247517914&idx=1&sn=9576eebddd6ba85be117e5730f57f7a6
突发!Claude黎曼猜想证明获人类数学家验证
Anthropic的Claude模型在黎曼猜想相关证明上的成果,已被人类数学家Youness Lamzouri彻底验证,确认结果确凿无误。此外,Lamzouri还给出了比Claude原证明更简洁、更优雅且证明力度更强的新证明,这一成果被认为是AI在高端数学证明领域的重大里程碑,也证明了AI辅助科研的可靠性。黎曼猜想是数学领域最著名的未解难题之一,此次AI辅助证明的成功也为解决其他顶级数学难题提供了新的思路。 来源:https://mp.weixin.qq.com/s/vZpe18dDzyZFpZ-81Yj-uA
谷歌让AI互怼几天!小模型复现3道博士级难题
谷歌Antigravity团队于8月27日公布了一项实验成果:让多个AI模型通过协作“互怼”的方式,仅用几天时间就让小模型复现了3道博士级难题的解答,同时还在科研、工程、代码优化等领域交出高分答卷:解开了7道顶尖数学和计算机难题,写出的40页长篇证明无机器审核错误,从零手写的CPU模拟器运行误差仅0.71%,还优化了Eigen和ParlayHash两个主流开源库的核心代码并被上游合并。这一成果展现了AI模型协同在复杂科研与工程任务中的巨大潜力,也证明了小模型在合理协同机制下,也能达到接近顶级模型的复杂任务处理能力,为轻量化AI应用提供了新的可能。 来源:https://mp.weixin.qq.com/s/A-giyPvaH7Y8M8PRFoN23A
StarVLA只用16卡训出登顶机器人榜单模型
机器人VLA模型团队StarVLA最新发布了面向VLA的VLM底座VLAct,其continued pre-training仅使用开源数据和16张GPU,就取得了亮眼成绩:在RoboTwin 2.0任务中成功率达92.5%,在RoboDojo榜单中超过所有明确标注为World Action Model的模型,仅用20%的RoboCasa-GR1下游数据就超过了NVIDIA GR00T N1.6的全量数据基线。该模型的Checkpoint、训练代码和Pipeline已全部开源,大幅降低了机器人模型的训练门槛,该成果也证明了AI在机器人领域的训练可以更高效,无需依赖海量数据和 massive 算力,就能达到顶级的操控性能。 来源:https://mp.weixin.qq.com/s/Etp2g285cyYC2e7m5HQh6Q
行业应用与工具
Anthropic公开2款内部杀手级Multi-Agent架构
9月第一周,Anthropic连续公开两篇内部技术分享,分别介绍了其与零售、旅游、电信等行业客户打磨的电商Multi-Agent架构,以及Claude智能体团队用11天形式化证明费马大定理的实践。两篇分享共享同一套底层范式:单模型Agent Loop + Skills处理长尾需求 + 工具调用集成现有系统 + Harness强制执行规则 + 快照式Eval,这被认为是Anthropic内部打造杀手级Agent的标准配方,为行业Agent开发提供了可复用的参考路径。这两篇分享也揭示了Anthropic在Agent工程化上的核心思路,即不依赖复杂的多子代理架构,而是通过 Skills 扩展单模型的能力边界,兼顾效率和可控性。 来源:https://mp.weixin.qq.com/s?__biz=Mzk0MTYzMzMxMA==&mid=2247511119&idx=1&sn=1142188144da29844041f63c8bb47868
亚马逊云科技开源内部Agent工作台Kiro Crew
亚马逊云科技开源了内部使用的Agent工作台Kiro Crew,用于解决多Agent长期任务执行中的工程控制问题。该工具集成了持久记忆、多Agent协作、任务调度、失败重试和安全控制功能,支持Agent跨会话记住项目背景、在无人值守时安全执行任务,同时保留执行记录和人工干预入口,补齐了Agent从单轮代码生成走向长期任务执行时缺失的工程控制层。该工具的开源也为开发者提供了可复用的Agent工程框架,降低了多Agent应用开发的难度。 来源:https://mp.weixin.qq.com/s?__biz=MzU1NDA4NjU2MA==&mid=2247666675&idx=2&sn=a829423e88c3a3f849e7cc86cd8b7958
谷歌云发布AI智能体简化数据库生命周期管理
谷歌云发布了两款AI驱动的数据库运维智能体,分别是上线智能体(Onboarding Agent)和可观测性智能体(Observability Agent)。上线智能体支持用户用自然语言描述需求,自动推荐合适的数据库方案、解释推荐逻辑并生成部署命令;可观测性智能体则面向SRE和DevOps工程师,可自动诊断复杂数据库问题、识别根因并执行修复,大幅降低数据库运维的专业门槛。两款智能体与Gemini Cloud Assist深度集成,支持AlloyDB、Bigtable、Spanner等多种谷歌云数据库服务。这两款智能体的上线也标志着数据库运维正式进入AI辅助时代,有望大幅降低企业的数据库运维成本,提升系统稳定性。 来源:https://mp.weixin.qq.com/s?__biz=MjM5MDE0Mjc4MA==&mid=2651292485&idx=4&sn=019ef483421b91b0653d9ab00d9101a9
开源与安全
谷歌开源AI漏洞扫描框架Mantis
谷歌正式开源了AI驱动的漏洞扫描框架Mantis,旨在解决传统AI代码扫描工具误报率高、幻觉漏洞多的问题。Mantis可以自动化完成软件漏洞的全生命周期管理,包括漏洞识别、验证、复现和修复,帮助企业提升代码安全水平,降低安全运维成本,为软件开发安全提供了新的工具选择。该框架的开源也为软件开发团队提供了可用的安全工具,有助于提升整体代码的安全水平,减少漏洞带来的风险。 来源:https://www.infoq.com/news/2026/09/google-mantis-vulnerability-scan/?utm_campaign=infoq_content&utm_source=infoq&utm_medium=feed&utm_term=global
暂无评论。