AI 开始自己点我的手机屏幕了:没 root、没数据线

AI 开始自己点我的手机屏幕了:没 root、没数据线

AI 能写代码、能画图、能替你跟客服扯皮,但有一件事卡了好几年:它玩不了你的手机

不是模型不行,是"把手伸进手机"这条路一直在绕远。以前想让 AI 操作手机,标准动作是:电脑开 ADB、手机插数据线、uiautomator dump 一整屏 UI 树。可那一屏 XML 动辄 4 万到 20 万字符——喂给模型的不是屏幕,是一本说明书;而且 AI 每点一下,都要隔着电脑这台"传话筒",一步操作 1 到 4 秒,急死个人。

直到我刷到一个开源项目:android-remote-control-mcp。一个 APK,装进手机,手机自己就是 MCP Server。AI 不 root、不连电脑、不走 ADB,直接读屏、点击、滑动、打字、开 App、拍照、看通知。

先看 GitHub 数据(2026-08-23 实测):540 星、71 forks、937 次提交、16 个 release,最新版已到 v1.12.0,最后一次提交就在两天前,open issues 只有 3 个。作者 Daniele Albano——cachegrand 的作者,GitHub Arctic Code Vault 贡献者。这不是那种发了 README 就跑路的玩具项目,是天天在提交的活工程。

读一屏 1000 token:说明书 vs 便利贴

这个项目最值钱的设计,藏在 token 里。

ADB 方案的读屏,是把整张 UI 树原样倒给模型——控件 id、坐标、父子结构、隐藏节点,全给你。读"设置"页可能就要好几万 token,一次对话十几轮操作,上下文直接爆炸。

它不一样。它把 UI 节点压缩成紧凑结构,读一整屏只返回约 4000 字符、约 1000 token;再配合按编号标注的截图和可调节的截图清晰度,模型看屏的成本被压到一个极低的水平。

打个比方:ADB 是塞给 AI 一本 20 万字的《手机使用说明书》,这个 App 是递过去一张 4000 字的楼层索引卡——同一个"找到设置按钮"的问题,前者要 AI 自己翻书,后者直接告诉它按钮在几楼几号。

57 个工具,但真正值钱的是 10-100ms

仓库里注册了 57 个 MCP 工具,分 14 类:读屏节点、手势点击、系统应用、文件相机、通知定位……手机上能干的活基本全覆盖。文件操作带 50MB 限制,录像最长 30 秒,写文件前还会校验 MIME 类型——细节抠得挺细。

但比工具数量更关键的是延迟。官方 README 的对比表里写得很直白:本项目操作延迟 10-100ms,而所有 ADB 类方案是 1-4 秒。差 10 到 100 倍。为什么?因为 ADB 方案每一步都要"手机→电脑→模型→电脑→手机"绕一大圈,而它直接在设备上执行,省掉了中间商。

540 星对 5.8k 星:星少不代表活少

写到这里你可能有疑问:这项目才 540 星,凭什么?让我把同赛道的真实数据摆出来(2026-08-23 实测):

项目 Stars 运行方式 操作延迟
mobile-mcp 5.8k 主机跑 ADB,支持 iOS 1-4s
Android-MCP 821 主机跑 ADB 1-4s
android-mcp-server 800 主机跑 ADB 1-4s
android-remote-control-mcp 540 手机本体运行 10-100ms

星数最高的 mobile-mcp 是 5.8k 星的大热门,但它需要一台电脑在手机旁边跑 ADB;而 540 星的这个是唯一一个纯手机运行、不需要电脑和数据线的方案,也是唯一支持 Cloudflare/ngrok 公网隧道直连的。README 的对比表里,它 11 项能力有 9 项打勾,剩下两项里有一项是因为不支持 iOS。

星少,是因为它做的路别人没做过——手机本体当 MCP Server 这个方向太新了。

三个源文章没展开的细节

OAuth 2.1 自建授权服务器。 它内置了一个完整的 OAuth Authorization Server,Claude.ai 网页版、Claude Desktop 甚至 chatgpt.com 都能以"自定义连接器"的方式直连,不用预注册任何账号,手机屏幕上点头确认就授权。这比手工填 Bearer token 安全一个量级。

per-tool 粒度权限。 57 个工具可以单独开/关,甚至可以按参数授权——这很关键,因为每个工具定义每轮对话都要占 token,关掉不用的工具本身就是在省钱。

Claude Code 插件是反向的。 它不只是"AI 遥控手机",还能让手机主动推事件进 Agent 会话:通知、WiFi 状态、地理围栏,按内容哈希去重,会话空闲时间自动延长到 7 天。

隐私模式:检测率 100% 和 0.8% 的差距

这是我认为最值得展开的部分。它内置一个 Privacy Mode:手机上的邮件、信用卡、身份证号、地址、姓名等敏感信息,在离开设备发给 AI 之前,先本地脱敏(伪名化或打码),检测全在设备端完成,不走云。

项目方自己跑了个 8 语言的 benchmark,实测检测率:

类别 检测率
邮箱 100.0%
身份证号 93.0%
账号密码 90.9%
手机号 84.4%
地址 77.9%
卡号/IBAN 75.3%
姓名 0.8%

看到了吗?姓名检测率只有 0.8%——项目方自己承认,内置的本地模型只认常见西方名字,全球多样化的名字基本抓不到,fine-tune 模型已经上了 roadmap。

这不是坏事,反而是我见过的最诚实的开源项目之一:敢把弱点写成数字贴出来。但代价清醒地说——别把隐私模式当保险箱,它标注了"best-effort mitigation, not a guarantee"。姓名、地址这类数据依赖模型判断,模型漏了,数据就原样发给 AI 了。

再说几句反话

  • 无障碍服务权限极高,只装在自己完全可控的设备上,别借给朋友"试试"。
  • 公网隧道 URL 视同密钥,用完即停。把手机长期挂在公网 MCP 上,等于给全世界留了一扇带锁的门——锁还在,但别赌。
  • 这项目在 HN 上刚发了 Show HN,只有 6 分 1 条评论——它还没火,也还没被大规模验证。540 星是真实的,但"真实"不等于"久经考验"。
  • 源文章作者实测过云手机(Airtap)跑通短信任务,但真机上的长任务稳定性、多设备管理,都还需要更多人来踩。

趋势:MCP 正在下沉到设备层

把手机变成 MCP Server,这件事的意义不在"能用 AI 点外卖"。

它标志着一个转变:MCP 正在从"电脑上的协议"沉到"设备上的协议"。以前 Agent 能碰的只有你电脑里的文件、终端、浏览器;现在手机——这个离你物理距离最近的设备——第一次变成了一台"可执行的主机"。读屏、点击、拍照、发短信,对 AI 来说不再是黑盒,而是 57 个可调用的工具。

当 Agent 的操作边界从屏幕扩展到物理世界,真正值得问的问题不是"它能不能替我操作手机",而是——你准备好让它替你操作手机了吗?


相关链接:

评论

暂无评论。

登录后可发表评论。