手机AI帮你点咖啡,App们同意了吗?
3、如果AI调用App不需要获得App的同意,移动互联网生态将会发生什么改变?
图:举例Mobile Agent自主打开天气预报软件,并跨越App,完成天气分析报告的过程
通俗来讲,这意味着Ferret模型能够识别图像中指定区域的元素,并将其精确框选。
例如,如果用户在图像中圈出一个物体并询问其种类,Ferret不仅能够识别出该物种,还能理解用户所指的特定动物或植物。讲到这里,是不是立刻就能联想到今年各大手机厂商纷纷推出的“圈搜”功能。
用户可以通过圈选屏幕上的内容,快速获取相关信息,支持跨应用服务,方便用户直接跳转到所需的应用或功能,比如荣耀手机支持“一圈即搜”功能的YOYO智能体;vivo提供了“小V圈搜”功能;OPPO的“小布助手”也具备相似的圈选功能。
图:在iPhone环境下,Ferret UI在初级UI任务中超越了GPT4-V,在包含高级任务的全任务平均得分非常相近,在安卓环境下表现略差
图:谷歌Spotlight模型架构和用户界面任务示例的说明图
图:谷歌Screen AI范例——一张带有生成注释的移动应用截图,这些注释包括用户界面元素及其描述,例如,文本(TEXT)元素也包含来自光学字符识别(OCR)的文本内容,图像(IMAGE)元素包含图片说明,列表项(LIST_ITEM)包含它们所有的子元素。
从荣耀、Vivo、智谱AI、阿里,到苹果和谷歌,端侧AI在现阶段的实现路径上似乎达成了一个共识,那就是基于视觉理解大模型的技术基础,让手机直接“看懂”屏幕上的内容,并做出后续的类似于手机智能体的动作。
AI手机,不是把大模型App
装到手机上而已
手机拥有用户使用手机的本地化数据,具有天然的优势。
●设备信息:型号、系统、硬件配置(CPU、内存、分辨率)和状态(电量、信号、网络)。
● 应用信息:名称、版本、开发者;安装和更新详情;使用情况(启动次数、时长、功能)。
● 用户行为:操作记录(点击、滑动、输入);浏览、搜索、下载历史;个人设置(主题、字体、语言)。
● 位置信息:当前和历史位置;位置服务使用(导航、地图、搜索)。
● 通信记录:通话、短信、邮件。
● 网络使用:连接详情(Wi-Fi、蓝牙);流量使用(上网时间、消耗)。
● 传感器和环境:传感器数据(加速度计、陀螺仪、摄像头);环境信息(温度、湿度、光线)。
● 账户信息:注册、登录信息;账户关联(邮箱、电话、社交账号)。
这意味着对于一台手机来说,几乎所有的操作、细致到屏幕上任何一个文字和按钮,都可以被“原子化”写入到AI理解的范围内。
“这个问题的关键是看手机厂商究竟想解决什么问题。如果要解决‘简单调用’的问题,通过 API是可行的,但是这在目前的手机生态中是很难实现的,因为没有App有足够的动力向手机厂商开放API。但是,模拟点击不需要,只要手机在系统级别支持就好了,而手机的操作系统是有动力的,因为大家都想让自己的操作系统变得更智能。”
理想的AI手机体验,是无形的服务