见过太多"AI 帮你操作手机"的演示:视频里顺滑得像开了挂,点外卖、订机票、查攻略一气呵成。可一旦自己上手,同样是那个模型,点错按钮、滑错页面、在广告弹窗上原地打转,三分钟就能让你血压上来。
问题出在哪?绝大多数 GUI 智能体是在模拟器里练出来的。模拟器里的屏幕是干净的、流程是固定的、像素是标准的,但真实世界不是这样——真机上有弹窗、有网络延迟、有 A/B 测试、有三天一改版的 App。模拟器里拿 100 分的 AI,落到真机上可能连 60 分都不到。
这就是"从模拟到真实"的最后一公里,也是阿里千问这次发布 Qwen-UI-Agent 想解决的问题:不装了,直接把模型拉到真机上练。
100 台真机,150 个应用,只为一件事
Qwen-UI-Agent 最硬核的地方不在模型本身,而在训练环境:一套覆盖 100+ 台真实手机、150+ 应用的真机集群,用于任务构建、轨迹采集、模型训练与评测。模拟器全部靠边站,轨迹直接从真实设备上采。
光有环境还不够,还得有能证明"真机真的行"的基准。团队自建了 MobileWorld-Real 真机基准(400+ 任务、100+ 应用),专门测"模拟器学到的能力能不能迁移到真机"。
结果是这样的:

- 移动端:MobileWorld **82.1%**,领先 GPT-5.6 Sol 12.0 个百分点、Claude Opus 4.8 达 14.6 个百分点;真机基准 MobileWorld-Real **92.2%**;AndroidDaily **97.5%**,接近满分
- 电脑端:OSWorld-Verified **79.5%**,超越 GPT-5.5、Gemini 3.1 Pro;OSWorld-v2 相比基线省 58% 执行步数
- 浏览器 & DeepSearch:WebArena **73.6%**,所有对比模型第一
- GUI 定位:ScreenSpot-Pro **81.5%**,四个 grounding 基准全部刷新 SOTA
能干多复杂的事?咖啡、高铁、出差一条龙
官方放出的演示里,最直观的是三个真实场景。找咖啡馆,一条指令串起高德、大众点评、小红书三个 App:

这类任务过去需要开发者在每个 App 里写自动化脚本,现在直接说人话就行。模型的通用能力让它可以即插即用地面对没有 API 的老软件——银行 App、政务系统、企业内部工具,只要有屏幕,它就上手。
会点屏幕,也会敲命令
真机上跑 GUI 智能体有个老问题:光是"点屏幕"效率太低,一个任务二三十步操作,慢且容易错。Qwen-UI-Agent 的动作空间是混合的——GUI 操作之外,还能直接执行 CLI 命令,并且支持单次决策批量输出多个动作(Batched Actions)。
官方数据:电脑任务里 CLI 动作占比近半,约 40% 的动作以批量形式输出,执行轨迹被大幅压缩。跨网站调研产品、核对价格、生成比价方案这类活,一半靠点、一半靠命令行,两条腿走路。
更夸张的是长程任务能力:支持 100 步以上超长轨迹的在线强化学习,约 10000 个并发环境同时 rollout。演示里有个 170 步的调研任务——采集并交叉核验 Alphabet 财报数据、跑可复现分析脚本、生成 Excel/PPT/Word 三件套、再多轮视觉检查修正排版。GUI 负责找数据和看效果,CLI 负责下载和分析,最后交付的是一整套文件,不是一段聊天记录。
主动服务:不等你开口,它先把事办了
跑分之外,有个更贴近普通人的亮点:主动服务。依托 Harness 框架,收到航班取消通知时,Agent 会主动识别受影响的行程、检索备选航班与高铁、结合日程给出改签方案,经确认后执行。注意顺序——它是在你提出请求之前就开始查方案了。
跨端接力也一样:手机相册里的收据,自动挪到远程桌面的 receipts 文件夹、按日期重命名、再生成一张 Excel 账单汇总。手机和电脑之间的活,一个 Agent 接力干完。

安全边界也没落下:违法或高风险请求直接拒绝执行;支付、数据删除、隐私授权等敏感场景,会在关键步骤主动停手、向用户说明,等确认再继续。
该冷静看待的地方
先说清楚:以上数据全部来自阿里官方技术报告(arXiv: 2607.28227)和官方演示,属于项目方自述,还没看到大规模第三方独立复测。模型是否能稳定应对真实 App 频繁改版(很多团队卡死在这),需要拿到权重后自己跑才知道。
另外值得注意的:Qwen-UI-Agent 对标的是 GPT-5.6 Sol、Claude Opus 4.8 这些闭源旗舰,但按报告里的对比表,它在通用能力(MMMU-Pro、MMLU-Pro 等)上与训练基座持平、大幅领先 GUI 专用小模型——说明它没有为了 GUI 牺牲通用能力。不过真机集群这类基础设施的门槛极高,100 台真机 + 万级并发 rollout 的训练成本,不是一般团队能复现的,普通人更现实的期待,是它什么时候以 API 或端侧形态落地。
屏幕,就是最后的通用接口
CLI、MCP 正在快速拓展智能体的能力边界,但绝大多数软件一辈子不会开放 API。GUI 是数字世界里覆盖最广的交互入口——不改造世界,先学会用世界本来的样子。
Qwen-UI-Agent 押的就是这条路:不去等世界 API 化,直接把屏幕当成最大的接口。跑分反超 GPT-5.6、Claude Opus 4.8 是一个信号——GUI 智能体这条赛道上,国产模型这次不是追平,是抢到了身位。
相关链接:
暂无评论。