Mano-P 1.0:我第一次觉得,AI 真有机会把桌面操作这件事接过去了
我刚看到 Mano-P 这个项目时,停了一下。
不是因为它又在讲什么“通用 Agent”,而是它压根没从浏览器开始。它盯的就是最麻烦的那块:桌面软件、各种 App、乱七八糟的 GUI 界面。
这事过去一直不太顺。
很多所谓自动化方案,本质还是吃 DOM、吃 API、吃系统层协议。页面结构熟一点还好,一旦 UI 改版、控件换位置、软件不是网页,识别马上开始飘。你让它点按钮,它可能盯着一块根本不能点的地方来回试。
所以我看到 Mano-P 的第一反应,不是“又一个模型”,而是它终于把入口换了。
它不靠插件,不靠协议,也不要求目标软件专门开放接口。就是直接看屏幕截图,按视觉去理解当前界面,然后完成操作。哪个按钮能点,哪个输入框该填,弹窗是不是挡住了流程,它看到什么就处理什么。
这个味道就对了。
因为真实世界里的软件环境,本来就不是给自动化脚本精心准备的。设计师会改布局,产品经理会换文案,不同平台还有一堆细碎差异。你越依赖底层结构,后面维护越重。纯视觉路线至少有个很直白的好处:界面怎么变,先看一眼再说。
我点进去看介绍时,另一个让我在意的点,是它不是只做一两步演示。
Mano-P 1.0 说的是数十步到上百步的复杂任务。这个差别挺大。因为 GUI 自动化最怕的不是“能不能点一下”,而是流程一长就乱:中间跳转、状态变化、窗口切换、偶发弹框,全都会把链条打断。真能把长流程接住,才算从玩具往工具走了一步。
它接到 Claude Code、OpenClaw 这类 Agent 工具里,意思也很直接:以前 AI 会写、会调、会规划,但碰到图形界面,经常还是卡在最后一米。现在等于给它补上了眼睛和手,能真的去看屏幕、点界面、把操作做完。
这就不是“辅助理解界面”了,是开始接管界面。
还有一个现实因素也很重要:它是本地跑的。
这句话现在看多了容易麻,但放在 GUI 操作上,分量不一样。因为你让模型去碰桌面、碰 App、碰业务系统,本来就很容易碰到敏感数据。全程本地推理,数据不出设备,至少让它从“看起来很酷”变成“有机会真进生产环境”。
部署门槛也没想象中那么高。在 M4 芯片、32GB 内存的 Mac 上,4B 量化版就能直接跑。看到这里大概能判断,它不是那种只适合论文演示的东西,开发者自己拿来试一轮,成本并不夸张。
当然,纯视觉也不是没代价。
速度、误触、复杂场景下的稳定性,后面肯定还是要继续磨。但 Mano-P 1.0 至少把方向拧过来了:别再假设所有软件都会乖乖给你接口,AI 就该先学会看屏幕,再学会动手。
这可能才是 GUI Agent 真正能出浏览器的一步。
GitHub地址:MININGLAMP-AI/MANO-P