小米直播大模型训练两天烧掉800万【AI 早报 2026-09-17】
今日AI圈动态密集:小米首次公开直播大模型强化学习训练过程,两天累计花费超113万美元;OpenAI总裁宣布GPT-6 Astra已达标AGI标准;DeepSeek发布V4.1-Flash模型,多项跑分超越Claude Opus-5.0;此外黄仁勋、Anthropic离职研究员等就AI安全、开源等议题发表观点。
今日概览
- GPT-6 Astra、Loop Transformer与隐藏推理链分析
- 黄仁勋再谈AI危险论:很多预测都是编的,中国会成为全球开源重要力量
- 小米直播大模型训练,两天烧掉800万
- OpenAI总裁:AGI时代来了!GPT-6已能自主干活24小时
- DeepSeek发布V4.1-Flash:552B backbone、KV cache砍到1/4,agent跑分压过Opus-5.0
- Apple Siri AI全面重构:与Google Gemini联训,端侧AFM+Private Cloud Compute协同
- 谷歌Gemini 3.8 Live上线:主打实时语音交互与多步推理
- Anthropic研究员辞职警告:自我改进AI或导致人类灭绝
- Cursor发布Projects beta:协调Agent在云端并行调度子代理
- Anthropic开源claude-code/mods
- 2026年1-5月LLM研究论文清单发布
- Mistal发布Medium 3.5模型,Vibe平台支持远程编码Agent
- 华为发布3D数据中心:AI集群规模可超10万卡
- 美团多业务落地复盘:由浅入深拆解Agent评测体系
- 努比亚豆包手机正式开卖:App可自主声明是否允许AI自动化操作
- MIT报告谈生成式AI冲击本科教育
大模型动态
小米直播大模型训练,两天烧掉800万
小米MiMo大模型负责人、原DeepSeek核心成员罗福莉宣布,小米新一代模型MiMo-V2.6正处于强化学习(RL)训练阶段,训练过程实时对外直播,为行业首次。本次训练同时推进MiMo-V2.6-Pro和MiMo-V2.6-Flash两条线,每步约消耗20亿token,单步需完成1568个提示词各16次推演,完全异步执行。截至直播两天时,两条训练线累计花费已超113万美元(约合人民币800万元),其中Pro线每步约7.4万美元,单步模型答题耗时58分钟、参数更新耗时64分钟;Flash线每步约2万美元。本次训练的题型以代码为主(占比三分之二),单道题平均需55轮工具调用、9万token上下文,一步需完成2.5万道题。在DeepSWE v1.1评测中,Pro线训练至第10步得63.72分,追平DeepSeek-V4-Pro,Flash线第12步得60.77分。团队表示相关训练细节将在未来几周逐步开源,直播界面同时公开了训练故障、数据配比等实时信息。 来源:https://mp.weixin.qq.com/s?__biz=MzIwNzc2NTk0NQ==&mid=2247621797&idx=1&sn=51b89ee34ced88753c958518e395a22a
DeepSeek发布V4.1-Flash:552B backbone、KV cache砍到1/4,agent跑分压过Opus-5.0
DeepSeek正式发布V4.1-Flash模型,采用CED架构,总参数量552B,prefill阶段激活参数8B,decode阶段激活参数16B。模型支持1M上下文长度,采用45T多模态训练数据,通过SWA+CSA2稀疏注意力、FP4 KV cache(E2M1格式)、DSpark推测解码技术,将KV cache体积压缩至890B/token,仅为V4-Flash版本的1/4。在多项评测中,该模型跑分超过Claude Opus-5.0:Codeforces 3471得分、Terminal-Bench 2.1得分90.6、HLE w/tools得分63.9。模型采用MIT协议开源,支持1-100整数推理effort可调,兼容Transformers、vLLM、SGLang、Docker等框架。 来源:https://mp.weixin.qq.com/s?__biz=MzIzOTkwMjM0OQ==&mid=2247549781&idx=1&sn=07db3f88d6c429d1f0c3026dc6bb2c11
刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一
中科院团队正式开源ZDTaichu5.0-9B通用多模态大模型,该模型参数规模为9B,在九大国际权威空间基准测试中拿下8项同参数通用组别全球第一。在复杂空间推演任务MindCube-tiny上,该模型得分为78.27,分别高出Qwen3.5-9B 20.67个百分点、STEP3-VL-10B 15.46个百分点,空间具身能力同档第一。除空间能力外,该模型的图文、OCR、数学、代码等通用能力也未打折,可支撑机器人在物理世界的长程任务执行。 来源:https://mp.weixin.qq.com/s?__biz=MzI3MTA0MTk1MA==&mid=2652726535&idx=1&sn=e05160c1d148a80baa4cdeca2158eabd
Mistal发布Medium 3.5模型,Vibe平台支持远程编码Agent
Mistral AI正式发布Medium 3.5模型,同步上线Vibe平台远程编码Agent功能,以及Le Chat的Work模式,可支持复杂任务处理。Medium 3.5模型将应用于Vibe平台的远程编码Agent,为开发者提供代码生成与调试能力支持。 来源:https://mistral.ai/news/vibe-remote-agents-mistral-medium-3-5
谷歌Gemini 3.8 Live上线:主打实时语音交互与多步推理
Google DeepMind正式发布Gemini 3.8 Live及Gemini 3.8 Live Extended Thinking两款实时对话模型,是谷歌迄今最先进的实时语音交互模型。其中Extended Thinking版本在Artificial Analysis语音质量榜上以82.6分拿下总榜第一,在ServiceNow语音Agent测试中首次同时实现回答准确率与对话流畅度的提升。两款模型支持97种语言,可自动检测对话中的语种切换无需提前设置,同时支持近实时视觉输入,可直接基于摄像头画面进行对话。Extended Thinking版本支持多步推理任务,遇到复杂问题时可通过“Let me check that…”承接对话,边推理边同步进度,工具调用与API请求可在后台执行无需打断对话。 来源:https://mp.weixin.qq.com/s?__biz=MzI3MTA0MTk1MA==&mid=2652726535&idx=2&sn=5eca6ab7ed4d6420460736e052f3e1e1
AI产品与硬件
Apple Siri AI全面重构:与Google Gemini联训,端侧AFM+Private Cloud Compute协同
苹果宣布自iOS 27起对Siri进行全面AI重构,采用Apple Foundation Models与Google Gemini联合训练的架构,端侧运行AFM Core Advanced模型,复杂任务通过Private Cloud Compute处理。新Siri新增个人上下文记忆、屏幕感知、跨应用Agent操作能力,Visual Intelligence功能扩展至iPad、Mac、Vision Pro设备。该功能要求设备为iPhone 15 Pro及以上机型,依托S11芯片的Secure Exclave硬件隔离处理音频数据,于9月14日正式上线,欧盟与中国大陆地区暂不可用。 来源:https://mp.weixin.qq.com/s?__biz=MzIzOTkwMjM0OQ==&mid=2247549781&idx=1&sn=07db3f88d6c429d1f0c3026dc6bb2c11
Cursor发布Projects beta:协调Agent在云端并行调度子代理
Cursor正式发布Projects beta功能,可通过协调Agent在云端并行调度子智能体执行代码编写任务,支持长生命周期跨任务复用。每个Project独立运行在云端,不会因本地电脑中断而停止,云端与本地共享文件系统,支持研究与代码理解能力的跨任务积累。该功能采用订阅模式,支持监听Slack等协作工具的消息触发任务。 来源:https://mp.weixin.qq.com/s?__biz=MzIzOTkwMjM0OQ==&mid=2247549781&idx=1&sn=07db3f88d6c429d1f0c3026dc6bb2c11
Anthropic开源claude-code/mods
Anthropic正式开源claude-code/mods工具集,为开发者提供更灵活的Claude代码集成能力,支持自定义扩展与工作流适配。 来源:https://mp.weixin.qq.com/s?__biz=MzIzOTkwMjM0OQ==&mid=2247549781&idx=1&sn=07db3f88d6c429d1f0c3026dc6bb2c11
努比亚豆包手机正式开卖:App可自主声明是否允许AI自动化操作
努比亚NaviX Ultra于9月16日正式发布开卖,售价5999元起,国补后5499元,京东预约量超36万台,是首款搭载豆包手机助手消费者版的AI智能体手机。随消费者版一同发布的还有屏幕自动化操作声明协议(SAEP),首次将第三方应用是否允许AI助手进行自动化操作的规则成文化,设置30天公示期。公示期内,豆包手机助手仅操作系统自带、字节跳动自有、以及明确同意接入的应用,其余应用默认不操作;开发者可通过接入协议或邮件声明允许或拒绝,明确拒绝的应用将永久不被操作。App可在全局、特定页面、特定业务意图三个层面,声明全局禁用、禁止操作、禁止内容修改等七类限制,将AI Agent操作的裁判权从技术攻防转移到系统层公开规则。 来源:https://mp.weixin.qq.com/s?__biz=MTMwNDMwODQ0MQ==&mid=2653113693&idx=1&sn=7393952e689d036b7abcdb27ffb2a5a1
华为发布3D数据中心:AI集群规模可超10万卡
华为正式发布专为超大规模AI集群打造的3D数据中心,采用预制标准化基础设施,支持AI集群规模扩展至10万卡以上,可支撑超大规模AI模型的训练与推理任务。 来源:https://www.techrepublic.com/article/news-huawei-3d-data-center-ai-clusters/
行业观点与安全
黄仁勋再谈AI危险论:很多预测都是编的,中国会成为全球开源重要力量
英伟达CEO黄仁勋于9月14日在All-In Summit 2026活动上,围绕AI安全、递归自我改进(RSI)、开源模型、AGI等议题接受访谈。针对Anthropic CEO达里奥·阿莫迪提出的“减速前沿AI发展”的呼吁,黄仁勋认为安全与创新并不矛盾,已发生的安全事件应按工程问题做根因分析,通过技术、流程和测试控制,无需将两者对立。他列举“放射科医生将被AI取代、90%代码将由AI生成、50%初级岗位消失”等此前被证明不准确的预测,认为这类缺乏科学依据的预测不应被用来制造社会恐慌。谈及RSI时,他表示RSI并非神秘技术,而是上下文、强化学习、合成数据、LoRA等已有技术的组合。对于开源与闭源模型之争,他认为两者都不可缺少,中国拥有大量工程师和科学、数学人才,未来可能成为全球开源生态的重要贡献者。当被问及AGI是否已经到来时,他简单回答“现在已经达到了”。 来源:https://mp.weixin.qq.com/s?__biz=MjM5OTE0ODA2MQ==&mid=2650998818&idx=1&sn=00a55762e8f49e55278bb5a70a885ac6
OpenAI总裁:AGI时代来了!GPT-6已能自主干活24小时
OpenAI总裁Greg Brockman在近日的a16z访谈中宣布,人类已经进入AGI时代,判断标准是GPT-6 Astra已能够自主连续工作24小时。他认为AGI不是一个明确的时间点,而是一段模糊的光谱,当前Astra的能力仍呈锯齿状,部分领域表现突出,部分领域仍有不足,例如写作能力首次不再“油腻”,但还未达到优秀水平。Brockman回忆2016-2017年他与Ilya Sutskever曾按摩尔定律推算AGI到来时间,正常需要15年,若投入数千亿美元建设巨型超算可压缩至10年,当前时间节点已到达。同时他指出,当前算力已追不上需求,将AI能力低成本普及到每个人是被严重低估的难题。 来源:https://mp.weixin.qq.com/s/0elUb0shRSZdDqOUqqxN4w
微软CEO纳德拉:AI应用的机会正在变大,模型成本将继续下降
微软CEO萨提亚·纳德拉于9月15日在All-In Summit 2026活动上表示,模型层不会长期拿走AI产品创造的全部经济价值,随着模型竞争加剧、Token成本持续下降,应用层的商业模型将变得更成立。他认为当前AI产业价值集中在基础模型、GPU和云基础设施层,但这种结构正在变化,随着开源模型提供替代方案,Memory、Harness、Orchestration以及嵌入企业工作流的AI应用将获得更大价值空间。纳德拉提出当前存在明显的“模型能力过剩”,模型能力已跑在产品和企业落地前面,若发现阻断发布的严重问题应停下来修复,但即使前沿实验室转向可靠性与对齐研究,AI产品创新也不会停止,因为大量模型能力尚未被真正使用。针对AI安全,他认为AI系统首先需要服务于人并保持在人类控制下,企业需将核心数据、知识、IP掌握在自己手中,不能将核心信息放入无法控制的黑盒。 来源:https://mp.weixin.qq.com/s?__biz=Mzg3NDkyMTQ5Mw==&mid=2247501753&idx=1&sn=daf1b3ef72070b32a980f5c92dc1f125
Anthropic研究员辞职警告:自我改进AI或导致人类灭绝
Anthropic研究员Jacob Coxon离职后在社交媒体发布公开警告,称前沿AI公司正在“拿我们的生命赌博”,其开发的系统“真诚相信可能在十年内灭绝全人类”。他表示生存风险并非来自当前模型,而是来自即将到来的“自我改进超级智能”,这类系统将具备“破解任何系统、一夜之间革新任何领域、获取真实权力与资源”的能力。他认为部分从业者要么没有意识到相关的文明级风险,要么相信需要“速通”超级智能竞赛,避免不负责任的方率先达到。Anthropic对齐科学负责人Evan Hubinger随后发声支持,称“Jacob是正确的,我们确实真诚相信AI可能在十年内杀死所有人类,我个人认为概率超过10%”。 来源:https://arstechnica.com/ai/2026/09/anthropic-researcher-quits-with-a-warning-self-improving-ai-could-kill-us-all/
研究与评测
GPT-6 Astra、Loop Transformer与隐藏推理链分析
AI研究者Sebastian Raschka发布长文,围绕OpenAI最新发布的GPT-6 Astra展开分析,探讨其性能表现、Loop Transformer(循环Transformer)架构传闻,以及Astra是否“隐藏”推理链(Chain of Thought)的传闻。文章指出Astra是截至发文时作者使用过的最佳模型,在绝大多数类别(写作、数学、编程等)上都超越了前代GPT-5.6,尤其在3D渲染和动画任务上表现突出。文章还详细解释了Loop Transformer的概念,分析其与隐藏推理链的关联,并梳理了近期该领域研究论文的新发现。 来源:https://magazine.sebastianraschka.com/p/gpt-6-astra-looped-transformers-and
美团多业务落地复盘:由浅入深拆解Agent评测体系
美团技术团队发布博客,系统介绍Agent评测的核心目的、与传统模型评测的差异,以及美团两年实践中总结的Agent评测方法论。文章指出Agent评测的核心目的是回答“模型放进真实系统后,能否稳定交付好结果”,评测对象是“模型+系统+工具+流程”的复杂系统,不能只看最终结果,还需覆盖过程层(规划合理性、步骤稳定性)、效率层(耗时、Token消耗、工具调用次数)、风险层(是否越权、误操作)四个维度。美团认为Agent评测正在从“打分动作”走向“基础设施能力”,观测是评测的基石,需通过工程视角弥合模型的随机性与可靠性之间的鸿沟。 来源:https://mp.weixin.qq.com/s?__biz=MzkzMjYzNjkzNw==&mid=2247637810&idx=1&sn=d955f9e09e1864f74c9376bc6ca4f817
2026年1-5月LLM研究论文清单发布
AI研究者Sebastian Raschka发布2026年上半年(1-5月)LLM研究论文精选清单,该清单基于作者个人阅读、bookmark的论文整理,重点覆盖推理模型、强化学习、高效推理三大方向。作者表示该清单并非2026年所有发表论文的完整列表,仅收录其认为有趣或与自身工作相关的论文,部分论文仅阅读了标题和摘要,未详细阅读全文。 来源:https://magazine.sebastianraschka.com/p/llm-research-papers-2026-part1
MIT报告谈生成式AI冲击本科教育
MIT发布相关报告,探讨生成式AI对本科教育的影响。报告指出生成式AI已深度融入学生的学习与科研过程,对传统的作业考核、课程设计等环节带来冲击,高校需要调整教学与评估方式以适应这一变化。 来源:https://mp.weixin.qq.com/s?__biz=MzIzOTkwMjM0OQ==&mid=2247549781&idx=1&sn=07db3f88d6c429d1f0c3026dc6bb2c11
暂无评论。