Gemini 2.0: 我们智能体时代的最新 AI 模型
信息是人类进步的基石。26 年来,我们始终专注于我们的使命——整合全球信息,供大众使用,让人人受益。这也是我们持续拓展人工智能前沿领域的原因。我们整合来自世界各地的信息,并通过多样化的输出方式,让这些信息触手可及,真正为您所用。
正是基于这个愿景,我们在去年年底推出了 Gemini 1.0。作为首个原生多模态模型,Gemini 1.0 和 1.5 在多模态和长上下文处理方面取得了重大进展,能够理解跨越文本、视频、图像、音频和代码等多种形式的信息,并处理更为庞大的信息。
现在,数百万开发者正在基于 Gemini 进行开发。Gemini 也正在帮助我们自己重新构想所有的产品——包括我们拥有 20 亿用户的 7 款产品——并打造新的产品。NotebookLM 就是个很好的例子,它展示了多模态和长上下文能够为人们带来什么,以及为什么如此受大家喜爱。
在过去一年里,我们在持续开发更多智能体模型,这也意味着它们可以更好地理解周围的世界,提前思考多个步骤,并在您的监督下代表您行动。
今天,我们很高兴推出了为新智能体时代构建的下一代模型: Gemini 2.0,这是我们迄今为止最强大的模型。凭借在多模态方面的新进展——例如原生图像和原生音频的输出以及原生工具使用——Gemini 2.0 使我们能够构建新的 AI 智能体,从而让我们离构建通用助手的愿景更进一步。
今天,我们将 2.0 开放给开发者以及受信任的测试人员。我们也正在积极推进将其整合到我们的产品中,率先从 Gemini 和 Search 开始。从今天开始,Gemini 2.0 Flash 体验版模型将对所有 Gemini 用户开放。同时,我们还推出了 Deep Research 的新功能,它运用高级推理和长上下文处理能力,承担研究助手的角色,帮助您探索复杂的主题并撰写报告。该功能自今日起对 Gemini Advanced 用户开放。
Search 无疑是受到人工智能影响最深远、变革最显著的产品。如今,AI Overviews 已触达 10 亿用户,该功能使用户能够提出全新的问题类型,迅速成为 Search 有史以来最受欢迎的功能之一。接下来,我们会将 Gemini 2.0 的高级推理能力融入 AI Overviews,以攻克更复杂的主题和多步骤问题,包括高等数学方程、多模态查询和编码。我们本周已经在小范围进行了测试,并计划于明年年初在更大范围推出。同时,我们还计划明年将 AI Overviews 功能面向更多国家开放,适配更多语言。
2.0 的进展得益于我们所特有的长达 10 年全栈式 AI 创新研究的投入。它基于我们定制的硬件第六代 TPU Trillium 构建而成。TPU 为 Gemini 2.0 的训练和推理提供 100% 算力支持,今天 Trillium 也全面向用户开放,以便他们能够基于此进行开发。
如果说 Gemini 1.0 是整合和理解信息,那么 Gemini 2.0 能够让信息更加有用。我非常期待 Gemini 2.0 时代的无限可能!
向下滑动,查看更多
作者:
Demis Hassabis, Google DeepMind CEO
Koray Kavukcuoglu, Google DeepMind CTO
代表 Gemini 团队
Gemini 2.0 Flash
点击查看大图
Gemini 2.0 应用于
我们 AI 助手 Gemini app
同样从今天开始,全球的 Gemini 用户可以通过在电脑端和移动端网页的模型下拉菜单中进行选择,来开启基于 2.0 Flash 体验版优化后的聊天对话,并且该版本将很快在 Gemini 移动应用中推出。同时,基于这个新模型,用户还可以体验到更加有用的 Gemini 助手。
明年初,我们还会将 Gemini 2.0 扩展到更多 Google 产品中。
解锁 Gemini 2.0 智能互动新体验
Gemini 2.0 Flash 的原生用户界面操作能力,以及多模态推理、长文本理解、复杂指令跟随和规划能力、组合函数的调用,原生工具使用以及延迟优化等一系列优化改进,共同促进了全新的、更智能化的交互体验。
AI 智能体在现实中的应用是一个令人振奋且充满可能性的研究领域。我们正在探索这个全新的领域,开发出了一系列原型,这些原型能够帮助人们完成任务,达成相应的目标。其中包括:
Project Astra 的升级版,用于探索未来通用 AI 助手能力的研究原型;
全新的 Project Mariner,从浏览器入手,探索人与智能体交互的未来发展;
Jules,能够帮助开发者的 AI 驱动的编码智能体。
目前,我们仍处于开发初期,但我们非常期待看到受信任的测试人员来使用这些新功能,并从他们的反馈中汲取经验,不断完善,进而帮助我们在未来将新功能应用到更广泛的产品中。
Project Astra: 使用多模态理解现实世界的智能体
更流畅的对话: Project Astra 现在可以在多种语言和混合语言之间进行对话,并且能够更好地理解不同口音和生僻单词。
新工具的使用: 借助 Gemini 2.0,Project Astra 可以使用 Google Search、Google Lens 和 Google Maps,从而在日常生活中更好地发挥助手作用。
更强的记忆力: 我们增强了 Project Astra 的记忆能力,同时确保你可以掌控对话。现在,它最多可以记住长达 10 分钟的会话内容,并且可以回忆起过去与它进行的更多对话,以便为您提供更好的个性化服务。
更低的延迟: 借助新的流式处理技术和原生音频理解能力,该智能体能够以近于人类对话的延迟来理解语言。
Project Mariner: 帮您完成
复杂任务的智能体
Jules: 面向开发者的智能体
游戏和其他领域的智能体
在智能体时代负责任地进行构建
例如
作为我们安全管理流程的一部分,我们一直与内部审查小组,责任与安全委员会 (RSC) 积极合作,以识别和评估潜在风险。
借助 Gemini 2.0 强大的推理能力,我们在 AI 辅助的红队测试中取得了重大进展。除了能检测潜在风险,还能够自动生成评估报告和训练数据来帮助我们减少风险,从而让我们可以更有效地大规模优化模型,提升安全性。
随着 Gemini 2.0 多模态能力的增强,潜在输出的复杂性也随之增加。为了应对这种复杂性,我们将持续评估和训练模型处理图像和音频的输入输出,提升模型的安全性。
通过 Project Astra,我们正在积极探索可能有效的措施,防止用户无意中将敏感信息泄露给 AI 智能体,并且我们已经内置了隐私控制功能,用户可以轻松删除会话。我们还在继续研究如何确保 AI 智能体作为可靠的信息来源,同时避免执行未经授权的操作。
通过 Project Mariner,我们尝试确保模型能够优先处理用户指令,并有效抵御外部尝试输入的提示词,从而识别外部来源的潜在恶意指令并防止滥用。这有助于保护用户免受隐藏在电子邮件、文档或网站中的恶意指令的侵害,降低用户遭受欺诈和网络钓鱼攻击的风险。
我们深信,AI 的构建必须从一开始就秉持高度的责任感。我们将始终将安全和责任置于模型开发过程的优先位置,不断完善我们的模型和智能体。
Gemini 2.0、AI 智能体以及更多
今天的发布标志着 Gemini 模型迈入了新的发展阶段。随着 Gemini 2.0 Flash 以及一系列探索 AI 智能体可能性的研究原型的推出,我们非常开心在 Gemini 时代达到了一个重要的里程碑。我们也期待着继续安全地探索所有的可能性,向构建通用人工智能 (AGI) 不断迈进。
谷歌开发者特别招募活动进行中
诚邀热爱技术的你加入
通过多种形式 (文章/视频/coding 等) 创作与 Google 技术相关的讲解分享、实践案例或活动感受等内容,以及分享您应用 AI 技术的故事经历与成果。我们将为您提供平台和资源,助力您在分享中提升技能。更有惊喜权益等您领取,快来报名参与吧!