AI 资讯日报 · 2026-08-22
今日多方信号指向同一趋势:具身智能迎来“机器人 ChatGPT 前夜”,宇树股价暴涨、GEN 1.5 发布、零代码机器人学习方案获黄仁勋等大佬押注;大模型侧,DeepSeek 多模态版本低价登场,OpenAI 开源 Codex Harness,Claude 最强模型切入网络安全;研究层面,dLLM、长程 Agent 纠错与可追责记忆等新范式同步推进。
今日概览
- DeepSeek 多模态版「长眼」了:1000 张图只要 1 块钱
- 再上新!GLM-5.3、Deepseek-V4-Pro 等多款模型上线千问 AI 平台
- 我们为什么做 dLLM,它能否取代自回归模型?
- ICML 2026:浙大 BEACON 让长程 Agent 成功率近翻倍
- Semantica:把 Agent 的记忆升级成一张可追责的上下文图
- 宇树暴涨 629% 那天,GEN 1.5 发布!机器人的 ChatGPT 前夜终于来了?
- 机器人 GPT-3 时刻震动硅谷:0 行代码看一遍秒会,黄仁勋李飞飞参投
- 英伟达没搞定的转笔,被银河通用攻克:通用小脑的 Scaling Law 生效了?
- WRC 交卷:机器人长程任务总断片?墨奇用 Agentic-Native 重构具身大脑
- OpenAI 开源 Codex Harness 集成底座,商汤发布 SenseNova-U1.5-8B-MoT 统一多模态模型
- OpenAI 与 Hugging Face 事件究竟意味着什么?
- Anthropic 将最强模型 Claude Mythos 5 投入网络防御工作
- 腾讯视频智创开源 CoinVE-200K 数据集,视频编辑迈向复合多指令新范式
大模型与多模态
DeepSeek 多模态版「长眼」了:1000 张图只要 1 块钱
DeepSeek 视觉模型正式亮相,补齐了其在多模态方向的关键拼图。这次发布的版本具备很强的视觉理解能力,被评价为“多模态再升级、极限突破”。更受关注的是定价策略:据称推理成本低至 1000 张图只要 1 块钱,堪称“性价比炸裂”。这样的价格大幅拉低了多模态能力的试用门槛,对开发者尤其友好。开源社区对此反应热烈,认为这会加速多模态应用在更多长尾场景落地。视觉能力叠加极低价格,也让 DeepSeek 在与头部多模态模型的竞争中打出差异化牌。
再上新!GLM-5.3、Deepseek-V4-Pro 等多款模型上线千问 AI 平台
千问 AI 平台再次迎来一批重磅模型上线,GLM-5.3、Deepseek-V4-Pro 等赫然在列。这意味着第三方优秀开源模型正在通过大厂的模型服务平台加速触达企业级用户。平台方称这些新上架模型“性能炸裂”,并面向开发者开放调用。对用户来说,不再需要自己部署基础设施,就能一站式体验多个最新模型,选型更加灵活。这类“模型集市”的出现,也在事实上改变着大模型的交付与分发方式。
研究前沿
我们为什么做 dLLM,它能否取代自回归模型?
关于扩散式大语言模型(dLLM)的讨论正在升温,这篇深度分享给出了一个审慎的判断:dLLM 或许不会取代自回归模型(AR),两者更可能走向共存。文章详细拆解了团队研发 dLLM 的动机,以及它在生成机制、推理效率等方面与 AR 路线的本质差异。作者进一步分析了 dLLM 未来的生态位:哪些任务更适合扩散式生成,哪些仍是 AR 的主场。这种“不站队、看共存”的视角,给当下关于下一代大模型架构的争论提供了更冷静的参考坐标。
ICML 2026:浙大 BEACON 让长程 Agent 成功率近翻倍
浙江大学团队在 ICML 2026 上提出了 BEACON,针对长程 Agent 任务中“一步错、全盘输”的痛点给出新的解决方案。传统 Agent 在执行长链条任务时,单次错误容易沿链路放大,最终导致整条任务失败。BEACON 的设计让模型具备更好的容错与恢复能力,即使局部出错也不至于全盘崩溃。实验结果显示,引入 BEACON 后长程 Agent 的成功率接近翻倍。这项研究对 Agent 落地的实用价值显著,也指向了长程任务可靠性这一关键瓶颈。
Semantica:把 Agent 的记忆升级成一张可追责的上下文图
Semantica 提出了一种新的 Agent 记忆组织方式:将传统的文本记忆替换为一张“可追责的上下文图”。其核心观点是,Agent 真正缺的不是文本,而是结构化的事实与推理依据。通过上下文图,Agent 每一步决策都能在图谱上找到对应依据,推理过程变得透明,告别黑箱。这为 Agent 的可解释性与故障排查提供了新抓手。伴随多步推理 Agent 走向生产环境,这类“可追责记忆”可能成为基础设施级能力。
具身智能与机器人
宇树暴涨 629% 那天,GEN 1.5 发布!机器人的 ChatGPT 前夜终于来了?
在宇树股价单日暴涨 629% 的同一天,机器人基础模型 GEN 1.5 正式发布。文章将这一节点称为“机器人的 ChatGPT 前夜”,认为行业正在从专用方案走向通用智能的临界点。宇树在资本市场的异动叠加全新模型发布,让具身智能的关注度被迅速点燃。作者提醒,切勿低估未来十年即将发生的巨变。对行业而言,这或许标志着机器人从“演示惊艳”迈向“量产落地”的新阶段。
机器人 GPT-3 时刻震动硅谷:0 行代码看一遍秒会,黄仁勋李飞飞参投
一家硅谷团队被形容为“机器人 GPT-3 时刻”的创造者:其机器人只需观摩 3-12 秒的人类演示,就能学会对应任务,全程 0 行代码、无需训练与微调。这种“看一遍就会”的能力,大幅降低了机器人部署门槛。更引人关注的是其投资阵容,黄仁勋、李飞飞等 AI 重量级人物均参与投资。业界认为,这类方法可能重新定义机器人技能获取的方式,从“编程控制”走向“演示即编程”。机器人通用性的临界点,似乎正在被提前推近。
英伟达没搞定的转笔,被银河通用攻克:通用小脑的 Scaling Law 生效了?
银河通用在灵巧操作领域做出突破:完成了连英伟达都没能搞定的机器人转笔动作。转笔要求手指高频协调与实时力控,是衡量灵巧手和“小脑”能力的经典难题。该成果被马斯克点赞,进一步推高了讨论热度。团队核心成员王鹤放出判断,称 2028 年将见分晓。文章将这次突破视作“通用小脑 Scaling Law”生效的证据,认为精细操作能力正在遵循可扩展的规律增长。谁将定义机器人的“iPhone 时刻”,答案或许就在这类硬核进展中。
WRC 交卷:机器人长程任务总断片?墨奇用 Agentic-Native 重构具身大脑
在 WRC 世界机器人大会上,墨奇交出了一份针对长程任务的答卷,核心方案是 Agentic-Native 架构。其团队指出,当前机器人普遍面临“单点动作容易、整事连续很难”的困境,长程任务中经常中途断片。墨奇的做法是从底层重构具身大脑,使机器人能够在连续任务中一气呵成地完成多个步骤。这意味着机器人不再只是执行孤立动作,而是具备任务级规划与执行力。长程稳定性,正在成为具身智能下半场竞争的焦点。
行业动态
OpenAI 开源 Codex Harness 集成底座,商汤发布 SenseNova-U1.5-8B-MoT 统一多模态模型
OpenAI 全面开源 Codex Harness 集成底座,开发者可以自由获取这套面向代码智能体的评测与运行基础设施,为代码生成 Agent 的开发与测试提供了标准化起点。同期,商汤正式发布 SenseNova-U1.5-8B-MoT,一款统一多模态模型,主打在单一框架下处理多种输入模态。此外,百度文心助手也同步升级,多款 AI 工具扎堆上线。OpenAI 的开源姿态与国内大厂的密集发版,共同推高了本轮 AI 工具的供给水位。
OpenAI 与 Hugging Face 事件究竟意味着什么?
OpenAI 与 Hugging Face 之间的一场风波,正在引发全球 AI 社区的讨论,该视频解析认为其核心冲突远超表面矛盾。事件暴露出的问题,触及开源生态、模型托管与商业利益之间的微妙关系。视频作者断言,这起事件的影响波及全球,未来 AI 生态的格局可能因此发生巨变。它被视作行业从“理想主义开源”转向“利益再平衡”的一个标志性节点。无论最终走向如何,这次事件都已经成为理解当下 AI 产业张力的一把钥匙。
来源:https://www.youtube.com/watch?v=LJmwOojvMik
Anthropic 将最强模型 Claude Mythos 5 投入网络防御工作
Anthropic 正把其最强大的模型 Claude Mythos 5 用于网络防御场景。在具体应用中,该模型驱动安全扫描器对代码库进行自动审查,并按照 CWE 标准对发现的漏洞进行分类分级。更重要的是,它能针对漏洞直接给出补丁建议,缩短从发现到修复的闭环时间。Claude Mythos 5 还接入了合作伙伴的安全产品,用于保护关键基础设施。这标志着顶级大模型正在从“办公助手”走向“安全运营核心组件”。
腾讯视频智创开源 CoinVE-200K 数据集,视频编辑迈向复合多指令新范式
腾讯视频智创团队开源了 CoinVE-200K 数据集,并同步发布 CoinVE-Edit 22B 模型,推动视频编辑走向“复合多指令”新范式。传统视频编辑模型往往只能处理单一指令,而 CoinVE 支持在一次编辑中完成多种复杂操作组合。为配合模型评估,团队还上线了对应评测集,方便研究者横向对比。这一套“数据集+模型+评测”的完整开源组合,有望加速视频编辑领域的技术迭代。多指令复合编辑能力,正成为视频生成模型竞争的新高地。
暂无评论。