谷歌Jeff Dean 2022「年终汇报」,大模型、AI 绘画神器交出满意答卷
选自
谷歌博客
作者:
Jeff Dean
机器之心编译
编
辑:杜伟、陈萍
我们已经在现有研究工作中展示了一些功能的早期版本,并将其中一些功能交付给触及数十亿用户日常生活的谷歌产品中。
从这篇博客开始,我将开启一个系列文章,将重点介绍 2022 年取得的一些振奋人心的进展,并描绘对 2023 年及以后的美好愿景。 本文首先讨论语言模型、计算机视觉、多模态模型和生成机器学习模型 。接下来的几周,我们将继续深入探讨负责任 AI、算法、计算机系统以及科学、健康和机器人等研究课题的新进展。 语言模型 过去十年,规模更大、性能更强的语言模型一直是机器学习研究中最令人兴奋的领域之一,如序列到序列学习和谷歌 Transformer 模型成为了过去数年该领域大多数进展的基础。当大模型在足够大和多样化文本语料库中进行训练时,可以生成连贯、上下文相关、听上去自然的响应,并用于创意内容生成、语言翻译等广泛的任务。 谷歌关于 LaMDA 的工作探索了如何将这些模型用于安全、扎实和高质量的对话以实现上下文多轮对话。
2022 年 4 月,谷歌描述了 PaLM 的工作, 这是一个使用 Pathways 软件基础设施构建并在多个 TPU v4 Pods 上训练的 5400 亿参数的大型语言模型 。强大的系统和算力投入带来了惊艳的结果。研究者在数百个语言理解和生成任务上评估了 PaLM,发现它在大多数任务上实现了 SOTA 小样本学习性能,可以出色地完成笑话解读、bug 修复、从表情符号中猜电影等语言、代码任务。
人工智能面临的关键挑战之一是构建可以执行多步推理的系统,学习将复杂问题分解为更小的任务,并结合这些任务的解决方案来解决更大的问题。谷歌提出了 思维提示链(chain of thought prompting) ,提示语言模型生成一系列短句,这些短句模仿一个人在解决推理任务时可能采用的推理过程。
在多种语言上训练的大型语言模型可以帮助从一种语言翻译成另一种语言。 谷歌解锁了零资源机器翻译以支持谷歌翻译中的新语言 ,以及为接下来的 1000 种语言构建机器翻译系统,其中描述了一系列技术,使用在单语言(非平行)数据集上训练的大规模多语言语言模型将 3 亿人使用的 24 种新语言添加到谷歌翻译中。
计算机视觉
计算机视觉不断发展并取得快速进步,从 2020 年我们提出的 Vision Transformers 开始,AI 领域逐渐发展出一个趋势,即视觉模型中更多的使用 Transformer 架构而不是卷积神经网络。 在「MaxViT: Multi-Axis Vision Transformer」中,我们探索了一种在视觉模型的每个阶段结合本地和非本地信息的方法,其比 Vision Transformer 其扩展性更好。这种方法在 ImageNet-1k 分类任务和各种目标检测任务上优于其他 SOTA 模型,但计算成本显着降低。
过去,大多数 ML 研究都集中在处理单一数据模态模型上(例如,语言模型、图像分类模型或语音识别模型)。虽然这些领域已经取得了惊人进展,但多模态模型能够灵活地处理不同的模态,既可以作为模型输入,也可以作为模型输出。在过去的一年里,我们以多种方式朝着这个方向努力。
在 「 Multi-modal Bottleneck Transformers」和「Attention Bottlenecks for Multimodal Fusion」中,我们发现在特定于模态的处理之后将模态组合在一起,然后混合来自不同模态的特征比其他技术更有效(如下图中的 Bottleneck Mid Fusion 所示)。 这种方法通过学习使用多种数据模态来做出分类决策,从而大大提高了各种视频分类任务的准确性。
在「Look and Talk: Natural Conversations with Google Assistant」中,我们展示了设备上的多模态模型如何使用视频和音频输入来与 Google Assistant 交互更加自然。该模型学习使用多种视觉和听觉线索,例如凝视方向、面部匹配、语音匹配和意图分类,以更准确地确定附近的人是否真的试图与 Google Assistant 设备交谈。 在「4D-Net for Learning Multi-Modal Alignment for 3D and Image Inputs in Time」中,来自激光雷达的 3D 点云数据与来自摄像头的 RGB 数据实时融合,不同模态的组合和面向时间的特征使用大大提高了 3D 目标识别准确性。
2022 年,谷歌在媒体生成方面取得了令人振奋的进步。现在计算机可以与自然语言交互,更好地理解人们的创作过程以及想要创作的内容,开启了计算机帮助用户创建图像、视频和音频的新方式。但同时也引起了一些担忧,这些 AI 模型可能生成各种有害或者难以区分的虚假图像或音视频内容,因此如何负责任地部署这些模型需要更加全面认真的思考。 2023 年及以后肯定会更加关注媒体生成内容本身的质量和速度,还将致力于提升全新的用户体验,实现更多的创意表达。 负责任 AI 强大的语言模型帮助人们完成了很多任务,但一不小心,它们也会产生错误信息、有毒文本或有害图像。 因此,我们必须负责任地追求人工智能。
AI 和 ML 领域的领导者不仅要引领最先进的技术,还要在负责任和实施方面兼顾。谷歌是这么做的,它是最早阐明「将有益使用、用户、安全和避免伤害放在首位」的 AI 原则的公司之一,并开创了很多最佳实践,例如模型和数据卡的使用等。 我们负责任 AI 包括以下内容:
Jeff Dean 表示仅仅开发最先进的技术是不够的,还必须确保它们在广泛应用到实际场景之前是安全的,这也是谷歌非常重视的一项责任。 原文链接:https://ai.googleblog.com/2023/01/google-research-2022-beyond-language.html
© THE END 转载请联系本公众号获得授权 投稿或寻求报道:[email protected]
今日,谷歌研究院高级研究员及高级副总裁 Jeff Dean 代表谷歌研究社区,发表了一篇博客,回顾了 2022 年在语言模型、CV、多模态模型和生成 ML 模型等领域取得的新进展,并对 2023 年及之后的发展进行了展望。
我们已经在现有研究工作中展示了一些功能的早期版本,并将其中一些功能交付给触及数十亿用户日常生活的谷歌产品中。
从这篇博客开始,我将开启一个系列文章,将重点介绍 2022 年取得的一些振奋人心的进展,并描绘对 2023 年及以后的美好愿景。 本文首先讨论语言模型、计算机视觉、多模态模型和生成机器学习模型 。接下来的几周,我们将继续深入探讨负责任 AI、算法、计算机系统以及科学、健康和机器人等研究课题的新进展。 语言模型 过去十年,规模更大、性能更强的语言模型一直是机器学习研究中最令人兴奋的领域之一,如序列到序列学习和谷歌 Transformer 模型成为了过去数年该领域大多数进展的基础。当大模型在足够大和多样化文本语料库中进行训练时,可以生成连贯、上下文相关、听上去自然的响应,并用于创意内容生成、语言翻译等广泛的任务。 谷歌关于 LaMDA 的工作探索了如何将这些模型用于安全、扎实和高质量的对话以实现上下文多轮对话。
2022 年 4 月,谷歌描述了 PaLM 的工作, 这是一个使用 Pathways 软件基础设施构建并在多个 TPU v4 Pods 上训练的 5400 亿参数的大型语言模型 。强大的系统和算力投入带来了惊艳的结果。研究者在数百个语言理解和生成任务上评估了 PaLM,发现它在大多数任务上实现了 SOTA 小样本学习性能,可以出色地完成笑话解读、bug 修复、从表情符号中猜电影等语言、代码任务。
人工智能面临的关键挑战之一是构建可以执行多步推理的系统,学习将复杂问题分解为更小的任务,并结合这些任务的解决方案来解决更大的问题。谷歌提出了 思维提示链(chain of thought prompting) ,提示语言模型生成一系列短句,这些短句模仿一个人在解决推理任务时可能采用的推理过程。
在多种语言上训练的大型语言模型可以帮助从一种语言翻译成另一种语言。 谷歌解锁了零资源机器翻译以支持谷歌翻译中的新语言 ,以及为接下来的 1000 种语言构建机器翻译系统,其中描述了一系列技术,使用在单语言(非平行)数据集上训练的大规模多语言语言模型将 3 亿人使用的 24 种新语言添加到谷歌翻译中。
计算机视觉
计算机视觉不断发展并取得快速进步,从 2020 年我们提出的 Vision Transformers 开始,AI 领域逐渐发展出一个趋势,即视觉模型中更多的使用 Transformer 架构而不是卷积神经网络。 在「MaxViT: Multi-Axis Vision Transformer」中,我们探索了一种在视觉模型的每个阶段结合本地和非本地信息的方法,其比 Vision Transformer 其扩展性更好。这种方法在 ImageNet-1k 分类任务和各种目标检测任务上优于其他 SOTA 模型,但计算成本显着降低。
MaxViT 计算过程。
用于目标检测的 Pix2Seq 架构。
通过结合 LFNR 和 GPNR,模型能够在给定几张图的情况下进行合成。
上图:来自 AFHQ 的猫图片示例;底部:由 LOLNeRF 创建的 3D 视图合成。
过去,大多数 ML 研究都集中在处理单一数据模态模型上(例如,语言模型、图像分类模型或语音识别模型)。虽然这些领域已经取得了惊人进展,但多模态模型能够灵活地处理不同的模态,既可以作为模型输入,也可以作为模型输出。在过去的一年里,我们以多种方式朝着这个方向努力。
- 在合并学习到的表示之前,应该进行多少模态处理?
- 混合表示最有效的方法是什么?
在 「 Multi-modal Bottleneck Transformers」和「Attention Bottlenecks for Multimodal Fusion」中,我们发现在特定于模态的处理之后将模态组合在一起,然后混合来自不同模态的特征比其他技术更有效(如下图中的 Bottleneck Mid Fusion 所示)。 这种方法通过学习使用多种数据模态来做出分类决策,从而大大提高了各种视频分类任务的准确性。
多模态示例。
LiT-tuning 对文本编码器进行对比训练,以匹配预训练的图像编码器。
PaLI 经过训练以支持 100 多种
语言,并经过调整以多语言执行多种语言图像任务。
在对训练期间未知的目标类型和类进行测试时,FindIt 可以准确响应,例如,找到桌子(第四张图)。
在「Look and Talk: Natural Conversations with Google Assistant」中,我们展示了设备上的多模态模型如何使用视频和音频输入来与 Google Assistant 交互更加自然。该模型学习使用多种视觉和听觉线索,例如凝视方向、面部匹配、语音匹配和意图分类,以更准确地确定附近的人是否真的试图与 Google Assistant 设备交谈。 在「4D-Net for Learning Multi-Modal Alignment for 3D and Image Inputs in Time」中,来自激光雷达的 3D 点云数据与来自摄像头的 RGB 数据实时融合,不同模态的组合和面向时间的特征使用大大提高了 3D 目标识别准确性。
4D-Net 有效地将 3D LiDAR 点云与 RGB 图像结合。
2022 年,谷歌在媒体生成方面取得了令人振奋的进步。现在计算机可以与自然语言交互,更好地理解人们的创作过程以及想要创作的内容,开启了计算机帮助用户创建图像、视频和音频的新方式。但同时也引起了一些担忧,这些 AI 模型可能生成各种有害或者难以区分的虚假图像或音视频内容,因此如何负责任地部署这些模型需要更加全面认真的思考。 2023 年及以后肯定会更加关注媒体生成内容本身的质量和速度,还将致力于提升全新的用户体验,实现更多的创意表达。 负责任 AI 强大的语言模型帮助人们完成了很多任务,但一不小心,它们也会产生错误信息、有毒文本或有害图像。 因此,我们必须负责任地追求人工智能。
AI 和 ML 领域的领导者不仅要引领最先进的技术,还要在负责任和实施方面兼顾。谷歌是这么做的,它是最早阐明「将有益使用、用户、安全和避免伤害放在首位」的 AI 原则的公司之一,并开创了很多最佳实践,例如模型和数据卡的使用等。 我们负责任 AI 包括以下内容:
- 专注于对用户和社会有益的 AI;
- 有意识地应用 AI 原则(有益的使用和避免危害)、流程等来指导我们在 AI 方面的工作,从研究到产品化和使用;
- 将科学的方法应用于 AI R&D,包括严谨性、同行评审以及负责任的访问和外化方法;
- 与多学科专家合作,包括社会科学家、伦理学家和其他具有社会技术专业知识的团队;
- 倾听、学习和改进来自开发者、用户、政府和社区代表的反馈;
- 对我们的 AI 研究和应用开发进行定期审查,提供信息透明度;
- 掌握当前和不断发展的风险、偏见等,并进行解决、研究和创新以应对出现的挑战和风险;
- 引领并帮助形成负责任的治理、问责制和监管,鼓励创新,在降低风险的同时最大限度地利用 AI;
- 帮助用户和社会理解 AI 是什么,以及如何从其潜力中受益。
Jeff Dean 表示仅仅开发最先进的技术是不够的,还必须确保它们在广泛应用到实际场景之前是安全的,这也是谷歌非常重视的一项责任。 原文链接:https://ai.googleblog.com/2023/01/google-research-2022-beyond-language.html
© THE END 转载请联系本公众号获得授权 投稿或寻求报道:[email protected]