AI 资讯日报 · 2026-08-22
今日聚焦大模型发布与智能体落地:DeepSeek 终于推出首个视觉模型 V4 Flash,GLM 5.3 以三分之一参数量逼平 GPT-5.6,OpenAI 开源 Codex Harness;"模拟"被推举为新的 Scaling Law,具身智能与 GUI 智能体赛道也迎来密集进展。
今日概览
- 极佳视界发布 GigaBrain-O.7:开源第一,首创 System-3+双塔体系
- 模拟逆袭:效果仅差一成,成本便宜百倍、速度快万倍
- 模拟成为新 Scaling Law:Simile AI 创始人谈 80 亿数字孪生
- OpenAI 全面开源 Codex Harness
- 实测 GLM 5.3:三分之一参数量配合后训练逼平 GPT-5.6
- 机器人"GPT-3 时刻":0 行代码看一遍秒会,黄仁勋李飞飞参投
- DeepSeek 发布实验性 V4 Flash 视觉模型,智能体基准逼近 Opus 4.8
- 中国 AI 热潮的中心:一个意想不到的地方
- 阿里把 AI 扔进 100 台真机里"军训",玩转各种屏幕
- 再上新!GLM-5.3、DeepSeek-V4-Pro 等模型上线千问 AI 平台
- AI 向癌症发起猛攻:4000 种抗癌药虚拟试杀,谷歌 Gemma 下载破 10 亿
- ICML 2026:浙大 BEACON 让长程智能体成功率近翻倍
大模型与模型发布
极佳视界发布 GigaBrain-O.7:开源第一,首创 System-3+双塔体系
介绍:极佳视界正式发布新一代开源模型 GigaBrain-O.7,并以"开源第一"作为市场定位。官方称该模型颠覆性地首创了 System-3+双塔体系,在架构设计上做出了新的尝试,并宣称性能表现"炸裂"。作为国内团队推出的开源力作,它的出现为开源大模型阵营再添一名新选手,也让外界对国产模型的架构创新有了更多期待。目前摘要中尚未披露具体的基准评测数据,实际表现仍有待社区进一步验证。
实测 GLM 5.3:三分之一参数量配合后训练逼平 GPT-5.6
介绍:卡尔的 AI 沃茨发布了对 GLM 5.3 的实测,结果显示这款模型以仅为 GPT-5.6 三分之一的参数量,配合后训练技术,竟在多项评测中逼平 GPT-5.6。这一结果让"参数规模决定性能上限"的传统认知受到冲击,后训练的价值被再度放大。评测者透露,GLM 5.3 预计下周将开源,并有望放出 demo 供公众体验。若兑现承诺,它将成为开源社区在高效率路线上强有力的竞争者。这一案例也再次点燃了关于模型效率与规模之争的讨论。
DeepSeek 发布实验性 V4 Flash 视觉模型,智能体基准逼近 Opus 4.8
介绍:DeepSeek 终于补上多模态短板,推出实验性视觉模型 V4 Flash,使其首次"长出眼睛"。据 The Decoder 报道,该模型支持图像理解等视觉能力,在智能体基准测试中表现逼近 Anthropic 的 Opus 4.8,部分指标甚至反超。这也是 DeepSeek 首个多模态模型,据称可覆盖图像、语音、视频等多种模态的理解。官方以实验性版本快速迭代,显示出 DeepSeek 在多模态赛道的进取姿态。此次发布标志着其正式进入多模态战场,并直接向顶级闭源模型发起挑战。
再上新!GLM-5.3、DeepSeek-V4-Pro 等模型上线千问 AI 平台
介绍:千问 AI 平台宣布再上新,一次性汇聚多款热门模型。GLM-5.3、DeepSeek-V4-Pro 等大模型同步上线,用户可在同一平台直接调用多家头部厂商的最新模型。此次上新也标志着 GLM-5.3 等模型正式进入落地交付阶段,而非停留在论文与演示层面。对开发者而言,多模型聚合大幅降低了对比与切换成本,便于按场景择优使用。平台的上新节奏,正成为观察国产大模型迭代速度的重要窗口。
研究前沿
模拟逆袭:效果仅差一成,成本便宜百倍、速度快万倍
介绍:Latent.Space 的 AI 资讯指出,基于模拟的方法正在快速"接管"AI 领域,其核心卖点是效果仅比真实方案差约 10%,成本却便宜 100 倍、速度快 10000 倍。文章认为,模拟的价值不止于训练环节,还可能延伸到递归自改进等方向。当差距拉大到两到三个数量级,工程与产品重心会不可避免地向模拟倾斜。这种"足够好、极便宜、极快"的路线,正在成为"模拟是新 Scaling Law"论调的核心论据。对行业而言,这意味着精度崇拜可能让位于成本与速度的综合权衡。
来源:https://www.latent.space/p/ainews-10-worse-100x-cheaper-10000x
模拟成为新 Scaling Law:Simile AI 创始人谈 80 亿数字孪生
介绍:Simile AI 创始人 Joon Sung Park 在 Latent.Space 的访谈中提出,模拟正成为新的 Scaling Law。他曾凭借生成式智能体的爆火研究为人熟知,如今创办公司,目标直指构建高达 80 亿个数字孪生。在他看来,模拟已从实验室里的"玩票"变成严肃的 AI 业务方向。海量数字孪生所模拟的真实世界交互,有望成为驱动智能规模化的关键路径。这个从研究到创业的转型故事,也是模拟路线走向产业化的标志性信号。
来源:https://www.latent.space/p/simile
ICML 2026:浙大 BEACON 让长程智能体成功率近翻倍
介绍:浙江大学研究团队的 BEACON 方案被 ICML 2026 接收,直击长程智能体"一步错、全盘输"的痛点。在长程任务中,单步失误往往导致整条链路失败,严重制约了 Agent 在真实复杂场景中的可用性。BEACON 通过引入纠错与恢复机制,让智能体出错后能够及时调整,实验显示长程任务成功率接近翻倍。这一成果为构建更稳健的智能体系统提供了新思路。它也表明,任务执行中的容错设计正成为智能体研究的关键课题。
AI 产品与智能体
OpenAI 全面开源 Codex Harness
介绍:OpenAI 宣布全面开源 Codex Harness,令开发者社区为之振奋。Codex Harness 是支撑 Codex 编程智能体的核心评测与运行框架,开源后开发者可在此基础上自由复现、扩展与二次开发。这意味着 AI 编程领域的研发门槛进一步降低,编程效率有望显著提升。从闭源到开源,OpenAI 正在以更开放的姿态拥抱开发者生态。这一框架很可能成为编程智能体社区的重要基础设施。
机器人"GPT-3 时刻":0 行代码看一遍秒会,黄仁勋李飞飞参投
介绍:一家引发"机器人 GPT-3 时刻"讨论的初创公司正震动硅谷。其技术让机器人无需编写任何代码,只需观看一遍演示即可学会新技能。整个过程不需要训练与微调,机器人在 12 秒内就能掌握新任务,刷新了机器人技能获取的效率纪录。该公司的投资方包括黄仁勋、李飞飞等 AI 重量级人物,足见行业对其前景的看好。这一突破有望大幅降低机器人的部署门槛,加速具身智能走向通用化。
阿里把 AI 扔进 100 台真机里"军训",玩转各种屏幕
介绍:阿里巴巴将 AI 智能体投放到 100 台真实手机中进行大规模"军训",训练其操控各种屏幕界面。这种真机训练方式,反映了大厂对 GUI 智能体赛道的加码投入。报道提出了一个值得思考的问题:能直接在真实 App 界面上操作的 AI,与传统 AI 手机究竟有何区别。相比模拟器环境,真机训练更贴近真实使用场景,也能暴露更多长尾兼容问题。若这一方向跑通,AI 与移动终端的交互方式可能被重新定义。
行业动态
中国 AI 热潮的中心:一个意想不到的地方
介绍:Wired 的报道揭示了中国 AI 热潮背后一个意想不到的地理中心:内蒙古的一座小城。凭借廉价能源与土地资源,以及毗邻北京的地理优势,这里正吸引大量数据中心疯狂涌入。在大模型训练对电力与算力需求持续爆炸的背景下,该地区成为中国 AI 基础设施布局的隐形推手。这篇报道展现了 AI 竞赛的另一面:算力竞争的本质,也是能源与选址的竞争。中国 AI 产业的扩张,正在深刻重塑区域经济与能源格局。
来源:https://www.wired.com/story/the-unlikely-place-at-the-center-of-chinas-ai-boom/
AI 向癌症发起猛攻:4000 种抗癌药虚拟试杀,谷歌 Gemma 下载破 10 亿
介绍:AI 在抗癌领域再下一城:相关研究利用虚拟筛选手段,对 4000 种抗癌药物进行"虚拟试杀",以加速新药发现与验证流程。这种 AI 驱动的虚拟试验有望大幅压缩传统药物研发的时间与资金成本。与此同时,谷歌开源模型 Gemma 累计下载量突破 10 亿次,成为开源模型生态的又一里程碑。两条动态分别展示了 AI 在生命科学与基础模型赛道的纵深渗透。AI 技术的规模化效应,正在多个行业同时显现。
暂无评论。