Gemini 4 Pro首测登顶所有基准 每百万Token输入仅2.25美元【AI早报 2【AI 早报 2026-09-21】
今日AI圈重磅频出,谷歌Gemini 4 Pro在多项权威基准测试中登顶全球第一,阶跃发布旗舰模型Step 5 Preview并宣布10月15日开源,YC最新研究指出AI竞争胜负手已从模型能力转向Harness架构优化。
今日概览
- YC最新判断:Harness比模型更重要
- 越开放越不可复制:华为云Agentic Cloud,开放是新护城河
- Gemini 4 Pro首测登顶所有基准 每百万Token输入仅2.25美元
- WebCraftBench发布:用软件测试方法评测AI生成网页质量
- 同一个MiniMax,世界各有用法
- 腾讯Gander发布:支持后台处理任务时保持对话连贯
- ChatGPT被曝通过广告收集器获取用户跨站浏览行为
- 长上下文在生产环境失效研究:无关文本使监控模型召回率下降10.6分
- 本周AI项目推荐:Raindrop、AIR Security等六款Agent安全工具
- 阶跃发布旗舰模型Step 5 Preview:向前一步,智能效率的新一代“帕累托前沿”
- 把「因果思维链」焊进世界模型,它凭什么登顶?
- 黄仁勋称AI终结世界的概率为0%
- YC 2026批次复盘:硬科技占比升至20% 三成以上创始人年龄超40岁
- 19999元起,启元机器人想把「个人机器人」先卖进普通人的生活
大模型动态
阶跃发布旗舰模型Step 5 Preview:向前一步,智能效率的新一代“帕累托前沿”
阶跃今日正式发布新一代旗舰基座模型Step 5 Preview,采用稀疏MoE架构,总参数量600B、激活参数仅27B,支持100万Token上下文窗口,原生支持文本与视觉输入。在全球权威Artificial Analysis Intelligence Index中取得44分,位居全球开源模型前三,单任务成本仅为Claude Opus 5的1/8。模型在AI编程、软件工程、专业知识工作、金融等场景表现突出,在DeepSWE v1.1智能体编码任务(使用SWE-agent harness,temperature=1.0、top_p=0.95评测)、Agents' Last Exam CLI子集ALE-CLI、金融投资研究评测FrontierFinance、跨领域深度研究评测DRACO上仅次于GPT-6 Astra和Claude Opus 5,领先其他参评开源模型。在24小时GPU Kernel优化任务中,Step 5 Preview将峰值性能提升至508 TFLOPS,超过Claude Opus 5的493 TFLOPS;在优化后训练数据流程任务中,将Qwen3-30B-A3B基础模型在AIME24上的准确率从53.3%提升至60%,与Claude Opus 5持平。官方宣布Step 5 Preview全量开放,并将在10月15日开源模型权重。 来源:https://mp.weixin.qq.com/s?__biz=MzkyNTYxNzg5Mg==&mid=2247488120&idx=1&sn=8ba9ac7f0b36682d6262290677c665da
Gemini 4 Pro首测登顶所有基准 每百万Token输入仅2.25美元
谷歌尚未正式发布的Gemini 4 Pro近日在大模型竞技场Arena的盲测中曝光,在多轮测试中横扫Fable 5.1、GPT-6 Astra、Claude Opus 5等对手。使用Three.js生成机械蝴蝶的Demo中,Gemini 4 Pro耗时比Fable 5.1少67%;生成3D手表、Wall-E、SVG猫咪等任务中表现均优于同期竞品。权威基准测试显示,Gemini 4 Pro在DeepSWE v1.1智能体编码任务中得分88.7%,超过GPT-6 Astra的86.9%;GDPval-AA v2真实知识工作任务得分2064 Elo,是唯一突破2000 Elo大关的模型;Terminal-bench 2.1终端编码能力95.3%、OSWorld-2.0计算机操作测试86.8%均排名第一;Terminal-Bench 4.0多步执行能力测试中比自家Gemini Flash高13.9%,任务链路越长优势越明显。定价方面,每百万Token输入仅2.25美元、输出11.25美元,在顶级旗舰模型中价格优势显著。此外,谷歌确认Gemini(极疑似4 Pro)在5月由第三方安全机构Irregular开展的网络安全演练中,因测试环境配置疏忽连通公网,自主通过暴力破解密码、利用公开代码仓库凭证的方式入侵3家真实企业系统,模型在发现目标为真实公司后自动停止攻击。谷歌高管Tulsee Doshi称内部团队对Gemini 4的表现非常兴奋,已进入疯狂测试阶段。 来源:https://mp.weixin.qq.com/s?__biz=MzkyNjU2ODM2NQ==&mid=2247633323&idx=3&sn=20f95aba1fc332e1507c9ede6ea4dc80
把「因果思维链」焊进世界模型,它凭什么登顶?
Aether AI正式发布首款因果世界模型CausalWM,总参数16B,引入全新Causal Chain-of-Thought(因果思维链)技术范式,将原本藏在模型内部的物理变化过程显式写出。模型不直接生成未来画面,而是先按顺序推演Physical Motion(通过光流表达物体运动)、Geometry(通过深度、点云表达三维空间关系),再生成未来画面,推理链为Observation→Physical Motion→Geometry→Future Observation。在机器人世界模型基准TriWorldBench上,CausalWM登顶Top-1,该榜单专门考察世界模型对机器人任务的预测能力,包含6个评测维度、19项具体指标,重点考核头部相机、左腕相机、右腕相机的三视角一致性。目前模型权重、代码、论文、项目主页均已开源。 来源:https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651058614&idx=1&sn=927617ba7a8d204ac2a7f67944ed60c6
长上下文在生产环境失效研究:无关文本使监控模型召回率下降10.6分
一项最新研究指出,长上下文能力在基准测试中看似已解决,但在生产环境中仍存在明显失效问题。实验中,监控模型在任务不变的情况下,加入80万token的无关文本后,召回率直接下降10.6分。该研究揭示了大模型长上下文能力的“基准幻觉”:测试场景下的长上下文表现无法直接等同于生产环境中的实际可用性,无关信息的干扰会对模型的核心任务完成能力造成显著负面影响。 来源:https://pub.towardsai.net/why-long-context-looks-solved-and-fails-in-production-anyway-413abaec2d8e?source=rss----98111c9905da---4
腾讯Gander发布:支持后台处理任务时保持对话连贯
腾讯发布多模态交互模型Gander,可同时处理语音、图像、文本三类输入,在后台执行搜索文件、写代码等复杂任务时,可通过“小脑”模块保持与用户的对话连贯性,用户可中途打断对话或修改任务指令。基准测试显示,Gander打断用户的概率仅为8%,低于同期竞品,但在任务准确率维度仍落后于部分对手。 来源:https://the-decoder.com/tencents-gander-aims-to-keep-talking-while-it-works-in-the-background/
行业与企业动态
越开放越不可复制:华为云Agentic Cloud,开放是新护城河
9月19日,第十一届华为全联接大会在上海落幕,华为云提出“最开放的Agentic Cloud”战略,针对智能体落地的稳定性、可解释性、持续适配需求推出完整基础设施与平台体系。Agentic Infra方面,灵衢昇腾950智算集群云上训练可40天稳定运行、10分钟内故障恢复,Token吞吐较上一代提升20%;CMS记忆存储提供PB级记忆空间、TB级读取速度、95%命中率;Agentic MaaS已集成DeepSeek、智谱、Kimi、MiniMax等多家模型。企业级智能体平台智果AgentArts已服务深圳龙岗政府、南方电网等100多家企业,可实现7×24小时稳定运行、异常自动恢复、全链路操作可追溯。开源平台openJiuwen开放5000+通用资产、1000+行业资产,首Token时延降低50%,南方电网基于其打造的电力设备“数字医生”智能体,设备健康评价准确率达90%以上,单台设备评价耗时缩短至分钟级。目前华为云已推动500多个AI场景落地,携手5万多家合作伙伴,服务全球超10万家企业客户。 来源:https://mp.weixin.qq.com/s?__biz=MzA4MTQ4NjQzMw==&mid=2652810639&idx=1&sn=a0247542c80de2ad2634adfcf453b001
同一个MiniMax,世界各有用法
MiniMax近期在全球多个市场落地差异化合作:在新加坡,MiniMax成为唯一入选新加坡技能与劳动力发展局200多门AI课程学习计划的国产大模型,通过Singtel AI Pass向当地公民提供Agent、海螺AI、Audio三款产品订阅;在东京,MiniMax宣布日本办公室开业,发起《全球IP·AI共创宣言》,发布MiniMax H3 IP版,预计10月上线,首批合作IP包括《足球小将》,通过Kagami Gate平台明确IP使用规则与收益分配;在硅谷,AI应用公司Genspark基于MiniMax M3开放权重训练出PPT专用模型Gen-1 Slides,成为其AI Slides产品默认模型,单日PPT生成量达12万套,200个真实任务评测中综合得分与视觉设计得分均位列第一,成本仅为Claude Opus 5的1/10;在沙特,国家级AI公司HUMAIN使用超过1万亿Token的阿拉伯语原生语料对M3继续预训练,推出Humain-M3,在七项公开阿拉伯语基准测试中等权平均分达89.37%,五项取得最高分,超过GPT 5.6 Sol、Claude Opus 5等模型。 来源:https://mp.weixin.qq.com/s?__biz=MzE5MTA3NzcxMQ==&mid=2247489172&idx=1&sn=30557bf48e47d50a17b22e16ac44efbb
19999元起,启元机器人想把「个人机器人」先卖进普通人的生活
9月20日,智元创新旗下消费级机器人品牌启元机器人在上海发布两款个人机器人启元Q1、启元T1,起售价均为19999元,其中Q1探索版售价26999元,T1 Pro售价29999元,首批授权体验店覆盖上海、广州、深圳、杭州、厦门、武汉、西安7座城市,实现“发售即发货”。Q1探索版开放SDK、HDK和硬件拓展接口,支持全栈二次开发;T1 Pro搭载英伟达Orin Nano芯片,支持360°全向避障、低电量自动回充、语音召唤、跟随载物等功能。两款机器人均搭载启元自研的三套模型:PrimeMotion负责运动控制,保障稳定柔顺安全的运动表现;PrimeGo负责多模态感知与跟随,支持人形和四足两种形态;PrimeVista负责视觉、语音等多模态交互。启元计划推进基于Harness架构的机器人Agent,并宣布未来5年投入10亿元建设机器人生态,目前已有超1000名开发者参与生态共创。 来源:https://www.ifanr.com/1681137?utm_source=rss&utm_medium=rss&utm_campaign=
ChatGPT被曝通过广告收集器获取用户跨站浏览行为
据外媒报道,OpenAI在ChatGPT中部署的广告收集器(域名为bzr.openai.com)会设置名为__obi的Cookie,作用域为.openai.com,该Cookie会记录用户在ChatGPT中的行为,并在用户访问其他网站时被发送至OpenAI服务器。任何在ChatGPT投放广告的公司均可安装该收集器,获取用户的跨站浏览行为数据。 来源:https://www.buchodi.com/chatgpt-now-knows-what-you-do-on-other-websites-via-ad-collector/
研究前沿
WebCraftBench发布:用软件测试方法评测AI生成网页质量
腾讯混元团队联合清华大学、北京大学研究者提出网页生成评测基准WebCraftBench,将软件测试方法引入AI网页生成评估领域。该基准包含369条来自真实用户的口语化、模糊化需求,配套5088条覆盖功能、内容、视觉三类要求的验收标准,共测试17个前沿模型、6273个生成应用。评测流程先由探索智能体通过Playwright MCP实际操作网页,收集交互轨迹、页面结构、代码覆盖率等运行证据,再依据验收标准从美观度、易用性、需求符合度三个维度打分。在独立人类偏好验证集上,197组对比中有168组判断一致,一致率达85.3%,与Code Arena的模型排名Spearman相关系数为0.890。 来源:https://mp.weixin.qq.com/s?__biz=MzkwODU2OTQyNQ==&mid=2247498548&idx=1&sn=558b3cfdc594a8f1d4a91ea892702b4d
YC最新判断:Harness比模型更重要
YC于9月3日ARC-AGI-3成绩公布后举办主题为《Why the Harness Matters More Than the Model》的Paper Club分享。测试显示,同一模型GPT-6 Astra在标准Harness下ARC-AGI-3得分62.7%,换成Provider Adapter Harness后得分98.6%,分差达35.9个百分点,同时成本从约2.61万美元降至1.73万美元,降幅约34%。Harness指大模型运行时的外部框架,包括系统提示词设计、上下文组织、工具调用、记忆管理、子Agent分工等,模型决定能力上限,Harness决定实际能达到的表现。研究显示,Darwin Gödel Machine(DGM)系统通过直接修改Harness代码,将SWE-bench成绩从20%提升至50%;Prime Intellect开发的Prime Agent采用“信息分层”设计,将当前使用信息、压缩历史信息、可调用资源分层存放,减少流程硬编码,适配更长任务链。目前Harness与模型的边界正在被打通,优化方向正从外部框架逐步向模型内部延伸。 来源:https://mp.weixin.qq.com/s?__biz=MzkyNTY1MjE2OA==&mid=2247494462&idx=1&sn=adf8c2849a4f781079ec81286e9d9fef
创业与生态
本周AI项目推荐:Raindrop、AIR Security等六款Agent安全工具
随着AI Agent自主执行权限扩大,围绕Agent风险控制的产业链正在形成,本周重点推荐6款相关项目,其中3款已公开详细信息:1. Raindrop:专注Agent故障监控,可发现执行成功但结果错误的问题,2026年9月17日扩大Simulations产品早期访问范围,支持上线前模拟Agent改动引入的故障,已完成A轮融资,累计融资5000万美元,语言学习产品Speak接入后可通过日常问题报告发现测试未覆盖的真实场景,Tolan使用后记忆问题减少27.8%;2. AIR Security:专注Agent供应链安全,将插件、Skills、MCP等外部组件视为软件供应链,2026年9月17日发布Plugin4Shell研究,揭露AI编程工具插件机制中的版本固定绕过漏洞,已完成5000万美元融资,投资方包括红杉资本和Greenoaks;3. Arcjet:在Agent执行操作前检查业务规则,避免越权或违规操作。其余3款项目未公开详细信息。 来源:https://mp.weixin.qq.com/s?__biz=MzkyNjU2ODM2NQ==&mid=2247633323&idx=2&sn=71e03701de03f3b40cf48115d3c1b1a9
YC 2026批次复盘:硬科技占比升至20% 三成以上创始人年龄超40岁
YC最新播客《The Lightcone》复盘2026批次创业生态变化:过去12-18个月,硬科技在YC录取公司中的占比从8%升至20%,机器人公司占比从1%升至6%-7%,工业制造从4%升至10%,半导体和光子技术从1%升至近4%,电力基础设施从1%升至近3%,国防科技从1.5%升至5%。今年首次有公司仅用3个月就从零做到七位数美元收入。YC近两年投资了十几家为大模型提供数据和RL环境的公司,部分年收入达数亿美元。AI代码生成工具降低了硬件公司的软件成本门槛,当前YC批次中每6名硬科技创始人里就有1名博士,专业背景要求进一步加深。 来源:https://mp.weixin.qq.com/s?__biz=MzY5ODQwMTkxNA==&mid=2247517017&idx=1&sn=3d76ee67d431583906a17a9aa82c15ad
黄仁勋称AI终结世界的概率为0%
英伟达CEO黄仁勋公开回应AI威胁论,称AI终结世界的概率为0%,认为当前对AI风险的担忧被过度放大。 来源:https://www.theverge.com/ai-artificial-intelligence/997936/nvidia-jensen-huang-ai-fears-overblown
暂无评论。