微软强大AI工具OmniParser,它能“看”电脑屏幕、“摸”界面,AI小白也能靠它让电脑自动干点活,省时省力!
微软推出强大AI工具—OmniParser,它能“看”电脑屏幕、“摸”界面, 让 AI 从“嘴炮王”变成了“实干家”,AI小白也能靠它让电脑自动干点活,省时省力!
OmniParser 是个啥?
简单说,OmniParser 是微软开发的一个工具,能让 AI(比如 GPT-4o 这样的大语言模型)看懂电脑屏幕上的东西,还能动手操作。想象一下,你给它一张电脑界面的截图,它就能分析出上面有哪些按钮、图标、文字,然后告诉 AI 这些是干嘛用的,甚至让 AI 去点一下、填个表啥的。
打个比方:它就像给 AI 装了一双“眼睛”和一双“手”,让 AI 不只停留在聊天,而是真的能帮你干活。
它咋工作的?
OmniParser 把屏幕截图“翻译”成 AI 能理解的格式,过程分两步:
找东西(检测)
用一个叫 YOLOv8 的模型(微软调教过的),从截图里找出哪些地方是可以点的东西,比如按钮、图标啥的。说明白(描述)
再用另一个模型 Florence-2(也被调教过),给这些东西贴上标签,告诉 AI“这个按钮是‘保存’,那个图标是‘关闭’”。
最后,AI 拿到这些信息,就知道屏幕上有什么,能干啥了。
V2 比以前强在哪儿?
最新的 OmniParser V2 升级了不少地方:
更准了:能认出更小的按钮和图标,不会漏掉细节。 更快了:比 V1 快了 60%,以前可能要等一下,现在几乎秒出结果。 更聪明了:跟 GPT-4o 搭配,在一个叫 ScreenSpot Pro 的测试里,准确率从 0.8 跳到 39.6%,进步超级大。
有啥用?
自动化干活
比如你老是要填一些重复的表单,OmniParser 可以让 AI 直接帮你填,不用你手动点来点去。测试软件
开发者可以用它自动检查界面有没有问题。帮你操作电脑
想让 AI 打开某个软件、点某个按钮?交给它就行。
OmniParser咋用?
好消息是,OmniParser 是免费开源的,代码就在 GitHub 上(https://github.com/microsoft/OmniParser)。但如果你完全不懂编程,别慌,微软还弄了个叫 OmniTool 的东西,简单来说就是个现成的“套装”,你装上就能试着玩。它支持好多模型,比如 GPT-4o、DeepSeek R1、Qwen 啥的,你挑一个喜欢的就行。
步骤(超简单版)
下个截图(随便拍你电脑屏幕)。 用 OmniTool 跑一下(具体咋装,GitHub 上有说明,找个会电脑的朋友帮下忙也不难)。 看结果:它会告诉你截图里有什么,AI 能不能操作。
为啥牛?
以前 AI 只能读文字、聊聊天,现在有了 OmniParser,它能“看”屏幕、“摸”界面,等于从只会说话变成了能干活的小助手。而且它不挑系统,Windows、手机界面啥都能用。
-END-
推荐阅读:
👉Python matplotlib保姆级教程 👉Python seaborn保姆级教程 交流学习