Google放大招!Gemini 2.5能“自己用电脑”,AI终于学会点鼠标了
这条消息一出来,AI圈又炸了—— Google 的 Gemini 2.5 Computer Use 模型正式上线。
听名字你可能还没反应过来,但看完这几句话你大概就懂了: 它能 打开网页、填写表单、点击按钮; 能 登录网站、下载资料; 甚至能在网页 App 里 拖拽便签、预定时间。
换句话说,AI 终于不是“纸上谈兵”了, 它真的能像人类一样——“动手”操作电脑。
对,我第一反应也是: 这不就是“AI实习生上线”吗?
Google 官方说,他们在各种网页和移动端控制的基准测试中都拿了第一。 这意味着什么?意味着这玩意儿能比你点鼠标还快。
目前开发者已经能在 Google AI Studio 和 Vertex AI 的 Gemini API 里体验这个功能。
有兴趣的可以直接去试试👉 https://gemini.browserbase.com/
说实话,这一步挺吓人的。 之前 AI 都只是“说得好”,比如 ChatGPT、Claude、DeepSeek 它们能写代码、能想策略,但都得靠人来“执行”。 而这次,Gemini 是能真的执行操作了。
想象一下,你说一句:
“帮我登录公司后台,下载那份销售数据,然后整理成表格发我邮箱。”
Gemini 不用你点鼠标,它自己就能一步步完成。 这已经不是“智能助手”了,简直是个能上手干活的数字员工。
更恐怖的是, 它还能跨应用工作。 比如它可以先在 Gmail 里查收文件,再去 Docs 里编辑,然后上传到 Drive,最后发个通知给你。 整套流程,全程自动。
这跟以前那种只能调用单个 API 的 AI 完全不是一个层级的能力, 而是真正意义上的 Computer Use——AI 直接操作电脑界面。
我突然想起一句话:
“AI 最后不是取代你,而是取代你的鼠标。”
从自动化写稿,到自动化操作软件, AI 的边界正在从“语言”跨进“行为”。
而这一步,或许就是未来“AI Agent”真正落地的起点。
顺带一提,现在各家都在往这条路冲。 OpenAI 在搞「Computer Control」实验, Anthropic 在 Claude Code 里做「自动执行任务」, 美团的 LongCat 则干脆直接往「通用生活 Agent」方向冲。
而现在,Google 的 Gemini 2.5 已经率先把「能动手」这件事,变成了现实。
我现在已经在想, 未来会不会真的出现这么个场景: 你早上打开电脑,AI 已经帮你把昨天的工作做完了, 桌面上留着一条消息:
“报告都写好了,老板9点要你汇报。”
——然后你一边刷牙一边心想: 我是不是得请它喝杯咖啡。
反正现在,这个世界的鼠标,已经开始自己动了。
-END-
我为大家打造了一份RPA教程,完全免费:songshuhezi.com/rpa.html