GitHubDaily

让 Agent 直接操控电脑的神器,开源了!

我们对 AI Agent 的要求越来越高,除了写代码、查资料、帮忙规划执行任务。

还想让它帮我们操作电脑,访问浏览器、填写表单、打开软件,恨不得把它当牛马来使。

但现实,真让它来接管时,鼠标和屏幕全被占了,我们反倒无法使用电脑,只能干等着。

直到前阵子,刚好在 GitHub 上看到 Cua 这个开源项目,已经斩获了 18000+ Star。

image-20260625161756446

它核心就做一件事,让 AI Agent 安全流畅地操作整个桌面系统。

看屏幕、移动鼠标、键盘输入、运行命令,打开各种桌面软件全都可以。

更重要支持操作 Linux、macOS、Winodws 甚至安卓系统,运行环境可放到云端或本地。

只需几行代码,就能建立起一个沙箱,类似一台虚拟电脑,让 Agent 在这里面进行操作。

这样 Agent 就不会抢占我们在真实电脑上的鼠标焦点,也不会影响到我们任何操作。

如果我们想查看 Agent 在沙箱里的操作,可以通过 Cua 内置的 VNC 服务。

在浏览器里打开一个窗口,实时查看 Agent 在虚拟电脑系统上的操作。

也可以通过 MCP,接入到 Claude Code、Codex 等 Agent 工具,下达指令指挥它操作。

另外全程都是在本地机器上运行,不会把屏幕里的数据往外传,隐私安全也得到保障。

image-20260625163212941

在我看来,Cua 不止是一个单一工具,而是一个整套 Agent 操作系统。

通过 Sandbox 来管跨系统的运行环境,用 Driver 管进行后台操控。

而 Cua-Bench 拿来评测和训练 Agent,Lume 专门创建虚拟 macOS。

image-20260625163451566

除此之外,它还有个比较贴心的设计,就是能给系统状态建立快照。

万一哪个任务中途执行失败,还能照原样复现回来,在调试的时候能省心不少。

所以 Cua 不光适合个人用来提升生产力,团队也能用它来做大批量训练、评测 Computer Use Agent 的底座。

比如跑 UI 自动化测试、把桌面里那些重复操作批量处理掉、给 Agent 积累训练数据等等。

而且已经有不少知名团队都在用它,我们熟悉的 Google DeepMind、Nous Research 的 Hermes、还有 Snorkel 它们都在用。

image-20260625163515272

就在昨天,Cua 刚发表一篇博客,讲述使用 Cua-Bench 这套基准评测集,测试 Gemini 3.5 Flash 的 Computer Use 表现。

在它们那套 KiCad 里设计的自动化操作任务共有 25 个,将 Gemini 3.5 Flash 与几大顶级大模型进行了一次横向测试对比。

包括 Claude Opus 4.8、GPT 5.5、Gemini 3.5 Pro 等模型,得到的数据非常惊讶。

Gemini 3.5 Flash 的得分最高,比 GPT 5.5、Claude Sonnet 4.5 这些模型都要好。

image-20260625162034651

最后再来说下,怎么上手体验 Cua,支持 macOS、Windows 和 Linux 系统。

只需要一条命令即可,macOS 和 Linux 系统执行如下命令:

/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/trycua/cua/main/libs/cua-driver/scripts/install.sh)"

而 Windows 系统,则可以使用 PowerShell,执行下面这条命令:

irm https://raw.githubusercontent.com/trycua/cua/main/libs/cua-driver/scripts/install.ps1 | iex

然后将其接入到 Claude Code 或 Codex 等支持 MCP 服务器的 Agent 工具,即可在后台操作 Cua 创建好的虚拟电脑系统桌面。

claude mcp add --transport stdio cua-driver -- cua-driver mcp

注意,目前 Linux 系统还处于预发布状态,建议在 Windows 或 macOS 上安装体验。

image-20260625162909116

以前我们都害怕,把电脑控制权交给 Agent,会带来很多操作上的风险。

现在用 Cua 在沙箱和测试环境里跑,可以减少不必要的风险值得一试。

写在最后

Agent 的瓶颈正从「脑子」挪到「动手」,而操作电脑,恰好是动手这关里最硬的一块骨头。

盯着这块的大厂其实不少,Anthropic 的 Claude Computer Use、OpenAI 的 Operator、Google 的 Project Mariner,都在往这个方向探索。

但他们走的是闭源道路,对我们来说数据安全能否得到保障还真不知道,而这些也恰恰是团队最注重的。

而 Cua 选择开源,并且采用的是 MIT 协议,允许我们商用,可部署到自己的服务器或机器上使用。

关于数据和执行过程,全都是我们自己说了算,不绑定在某一家厂商身上,不按次数掏钱,这才是大家想要的。

现在的 Computer Use 有点像五年前的浏览器自动化,谁先探索明白,谁就先把这波红利攥手里。

GitHub 项目地址:https://github.com/trycua/cua

今天的分享到此结束,感谢大家抽空阅读,我们下期再见,Respect!