谷歌I/O超全总结:AI搜索大变样,AR眼镜复活,大模型全家桶升级,史上最贵订阅费1800元
Gemini时代,谷歌的模型和产品发布速度都比以往更快。上届I/O大会至今,谷歌已经宣布10余款模型重大突破、20余款重大AI产品。
自第一代Gemini模型发布以来,Gemini模型的Elo分数已提升300多分。编程方面,Gemini 2.5 Pro成为编程平台Cursor上年度增长最快的模型,每分钟产出数十万行被采纳的代码。
在LMArena排行榜中,Gemini系列模型包揽了每秒生成输出token数最高的前三名,并且模型价格也在下降。
皮查伊提到谷歌大模型相关的几组数据:
去年同期谷歌每月通过产品和API处理的token数量为9.7万亿,目前其每月处理的token数达到480万亿,一年内增长了约50倍;
超过700万名开发者通过Gemini API进行开发,涵盖谷歌AI Studio和Vertex AI两大平台,同比增长超过五倍,同时Vertex AI平台上的Gemini使用率较去年增长40倍;
Gemini应用目前拥有超过4亿月活用户,在Gemini应用中使用2.5 Pro版本的用户使用量增长了45%;
在搜索方面,AI概览功能的每月用户超15亿。皮查伊认为AI Mode是搜索领域的下一个重大进展,我们正处在AI平台转型的新阶段。
▲谷歌Jules用户界面
AI Mode背后的关键技术是“查询扇出(query fan-out)”,可跨子主题和多个数据源同时发出多个相关搜索,然后将这些结果汇总在一起,提供易于理解的响应。
AI Mode在体育数据、金融分析中的深度应用会于今年夏天推出。如让其展示本赛季和上赛季使用鱼类球棒球员的打击率和上垒率,这个问题包含不同赛季、使用特定球棒的球员、打击率、上垒率等多个要素。其会动态为用户生成如图表等适应用户观看的界面。
AI Mode将Gemini与购物图谱相结合,拥有超过500亿个产品,并附有评论、价格、颜色选项和可用性等详细信息,同时会根据用户特定需求定制产品浏览面板。
基于AI Mode,用户选中衣服点击“试穿”图标、上传全身照,就能进行虚拟试穿。这一效果由时尚定制图像生成模型提供支持,该模型能够理解人体结构和服装的细微差别,例如不同面料在不同人体上的折叠、拉伸和悬垂效果。
同时,用户在商品详情上点击“跟踪价格”,然后设置合适的尺码、颜色以及期望的支付金额,AI Mode就会自动在不同网站监控降价信息,并向用户发送降价通知,将商品添加到用户购物车并通过Google Pay完成结账。这项视觉购物、结账功能将在未来几个月内陆续推出。
皮查伊重点提到了目前正改变谷歌产品的三个例子:
第一个项目是在Project Starline之上,谷歌推出一个以AI为核心的全新视频通话平台Google Beam,该平台采用新一代视频模型将2D视频流转换为3D体验,通过6台摄像机组成的阵列捕捉用户动作,借助AI将这些视频流进行合并,实时处理呈现用户影像,精度达毫米级,每秒60帧。谷歌与惠普合作的首批Google Beam设备将于今年晚些时候向其测试用户推出。
此外,谷歌致力于将Project Starline的底层技术引入Google Meet视频会议平台,包括实时语音翻译功能。今天谷歌将直接在Google Meet中推出实时语音翻译功能,订阅用户可以使用英语和西班牙语,未来几周之内将会支持更多语言,今年晚些时候面向企业用户推出。
第二个项目是实时、多模态的AI助手项目Project Astra,如今Gemini Live已具备Project Astra的摄像头和屏幕共享功能,让用户可以畅聊所见的一切。
第三个项目是Project Marina,这是一个能够与网络交互并且完成任务的Agent,谷歌将Agent视为结合了先进AI模型智能与工具访问能力的系统。
其中,计算机使用是一项使Agent能与浏览器和其他软件进行交互和操作的重要能力。谷歌引入了多任务处理能力,Project Marina可以同时监管十项任务,用户展示一次任务,Agent还可以学会为未来类似的任务去制定相应的计划。
谷歌将通过Gemini API将Project Marina的计算机使用能力带给开发者,今年夏天会面向更广泛用户开放。
Gemini SDK现在兼容MCP工具,谷歌会逐步将整体功能引入到谷歌搜索以及Gemini应用。