让 Agent 直接操控电脑的神器,开源了!
我们对 AI Agent 的要求越来越高,除了写代码、查资料、帮忙规划执行任务。
还想让它帮我们操作电脑,访问浏览器、填写表单、打开软件,恨不得把它当牛马来使。
但现实,真让它来接管时,鼠标和屏幕全被占了,我们反倒无法使用电脑,只能干等着。
直到前阵子,刚好在 GitHub 上看到 Cua 这个开源项目,已经斩获了 18000+ Star。
它核心就做一件事,让 AI Agent 安全流畅地操作整个桌面系统。
看屏幕、移动鼠标、键盘输入、运行命令,打开各种桌面软件全都可以。
更重要支持操作 Linux、macOS、Winodws 甚至安卓系统,运行环境可放到云端或本地。
只需几行代码,就能建立起一个沙箱,类似一台虚拟电脑,让 Agent 在这里面进行操作。
这样 Agent 就不会抢占我们在真实电脑上的鼠标焦点,也不会影响到我们任何操作。
如果我们想查看 Agent 在沙箱里的操作,可以通过 Cua 内置的 VNC 服务。
在浏览器里打开一个窗口,实时查看 Agent 在虚拟电脑系统上的操作。
也可以通过 MCP,接入到 Claude Code、Codex 等 Agent 工具,下达指令指挥它操作。
另外全程都是在本地机器上运行,不会把屏幕里的数据往外传,隐私安全也得到保障。
在我看来,Cua 不止是一个单一工具,而是一个整套 Agent 操作系统。
通过 Sandbox 来管跨系统的运行环境,用 Driver 管进行后台操控。
而 Cua-Bench 拿来评测和训练 Agent,Lume 专门创建虚拟 macOS。
除此之外,它还有个比较贴心的设计,就是能给系统状态建立快照。
万一哪个任务中途执行失败,还能照原样复现回来,在调试的时候能省心不少。
所以 Cua 不光适合个人用来提升生产力,团队也能用它来做大批量训练、评测 Computer Use Agent 的底座。
比如跑 UI 自动化测试、把桌面里那些重复操作批量处理掉、给 Agent 积累训练数据等等。
而且已经有不少知名团队都在用它,我们熟悉的 Google DeepMind、Nous Research 的 Hermes、还有 Snorkel 它们都在用。
就在昨天,Cua 刚发表一篇博客,讲述使用 Cua-Bench 这套基准评测集,测试 Gemini 3.5 Flash 的 Computer Use 表现。
在它们那套 KiCad 里设计的自动化操作任务共有 25 个,将 Gemini 3.5 Flash 与几大顶级大模型进行了一次横向测试对比。
包括 Claude Opus 4.8、GPT 5.5、Gemini 3.5 Pro 等模型,得到的数据非常惊讶。
Gemini 3.5 Flash 的得分最高,比 GPT 5.5、Claude Sonnet 4.5 这些模型都要好。
最后再来说下,怎么上手体验 Cua,支持 macOS、Windows 和 Linux 系统。
只需要一条命令即可,macOS 和 Linux 系统执行如下命令:
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/trycua/cua/main/libs/cua-driver/scripts/install.sh)"而 Windows 系统,则可以使用 PowerShell,执行下面这条命令:
irm https://raw.githubusercontent.com/trycua/cua/main/libs/cua-driver/scripts/install.ps1 | iex然后将其接入到 Claude Code 或 Codex 等支持 MCP 服务器的 Agent 工具,即可在后台操作 Cua 创建好的虚拟电脑系统桌面。
claude mcp add --transport stdio cua-driver -- cua-driver mcp注意,目前 Linux 系统还处于预发布状态,建议在 Windows 或 macOS 上安装体验。
以前我们都害怕,把电脑控制权交给 Agent,会带来很多操作上的风险。
现在用 Cua 在沙箱和测试环境里跑,可以减少不必要的风险值得一试。
写在最后
Agent 的瓶颈正从「脑子」挪到「动手」,而操作电脑,恰好是动手这关里最硬的一块骨头。
盯着这块的大厂其实不少,Anthropic 的 Claude Computer Use、OpenAI 的 Operator、Google 的 Project Mariner,都在往这个方向探索。
但他们走的是闭源道路,对我们来说数据安全能否得到保障还真不知道,而这些也恰恰是团队最注重的。
而 Cua 选择开源,并且采用的是 MIT 协议,允许我们商用,可部署到自己的服务器或机器上使用。
关于数据和执行过程,全都是我们自己说了算,不绑定在某一家厂商身上,不按次数掏钱,这才是大家想要的。
现在的 Computer Use 有点像五年前的浏览器自动化,谁先探索明白,谁就先把这波红利攥手里。
GitHub 项目地址:https://github.com/trycua/cua
今天的分享到此结束,感谢大家抽空阅读,我们下期再见,Respect!