GenAI新世界

一图流| Google 深夜发布全新开源模型 Gemma ,能力碾压 Llama2

Image

关于 Gemma

Gemma 这个名字本身源自拉丁语,意思是“宝石”。分为两种规格——Gemma 2B 和 Gemma 7B,由 Google DeepMind 和 Google 的其他团队开发,其灵感来自 Gemini。此外,连同 Gemma 一起发布的还有一些相关的开发者工具。

哪里可以使用 Gemma?

你可以在个人计算机、工作站、Google Cloud 上使用 Gemma 模型。您可以轻松部署 Gemma 模型到 Vertex AI 和 Google Kubernetes Engine (GKE) 上。另外,Gemma 模型也支持在 NVIDIA GPU 和 Google Cloud TPU 等多种 AI 硬件平台上优化运行。无论您是在开发、研究还是商业用途中,都可以使用 Gemma 模型。Gemini 模型的技术和基础设施组件也与 Gemma 模型共享,使得 Gemma 2B 和 7B 在其尺寸方面表现出色,超越了其他开放模型。你可以通过 ai.google.dev/gemma 了解更多信息并访问快速入门指南。

Google 如何优化 Gemma 在不同 AI 硬件平台上的性能?

Google 与 NVIDIA 合作,针对 NVIDIA GPU 优化了 Gemma 模型,确保在数据中心、云端到本地 RTX AI PC 上都能提供行业领先的性能。同时,Gemma 也针对 Google Cloud TPU 进行了优化。

Gemma 提供哪些大小的模型?

Gemma 提供了 Gemma 2B 和 Gemma 7B 两种模型。较小的模型(如2B)适合于需要较低计算资源的应用,而较大的模型(如7B)则能提供更高的性能和准确度,适用于复杂的AI应用。

Gemma 模型在技术基准上超越了哪些指标,与其他开放模型相比如何?

Gemma 模型在关键基准测试上超越了其他更大模型,具体的性能指标可参见下方的评测报告。

 Gemma 的相关评测信息(来自官方)

MMLU

MMLU基准测试是一项测试,用于衡量大型语言模型在预训练期间所获得的知识广度和问题解决能力

Image

HellaSwag

HellaSwag基准测试挑战语言模型理解和运用常识推理的能力,通过选择故事的最合乎逻辑的结局。

Image

PIQA

PIQA基准测试检验语言模型理解和运用日常物理常识的能力,通过回答关于日常物理互动的问题。

Image

SIQA

SIQA基准测试评估语言模型对社交互动和社交常识的理解,通过提问关于人们行为及其社交含义的问题。

Image

Boolq

BoolQ基准测试了语言模型回答自然发生的(在未提示和无约束的情况下生成的)是/否问题的能力,测试模型在真实世界自然语言推理任务中的表现能力。Image

Winogrande

Winogrande基准测试了语言模型解决具有二元选项的模棱两可的填空任务的能力,需要通用常识推理。

Image

CQA

CQA基准评估了语言模型在多项选择问答上的表现,需要不同类型的常识知识。

Image

OBQA

OBQA基准评估了语言模型在多步推理、常识知识和丰富文本理解方面执行高级问答的能力,模拟了开放式书面考试。

Image

ARC-e

ARC-e基准测试了语言模型在真实的小学级别多项选择科学问题上的高级问答能力。

Image

ARC-c

ARC-c基准是ARC-e数据集的一个更专注的子集,只包含常见(检索基础和词共现)算法回答错误的问题。

Image

TriviaQA

TriviaQA基准测试了阅读理解能力,包括问题-答案-证据三元组。Image

HumanEval

HumanEval基准通过评估语言模型的代码生成能力,检查其解决编程问题的解决方案是否通过了功能单元测试。

Image

MBPP

MBPP基准测试了语言模型解决基本Python编程问题的能力,重点关注基本编程概念和标准库的使用。

Image

GSM8K

GSM8K基准测试了语言模型解决常需要多步推理的小学级数学问题的能力。

Image

MATH

MATH基准评估了语言模型解决复杂数学问题的能力,需要推理、多步问题解决和对数学概念的理解。

Image

AGIEval

AGIEval基准通过使用源自真实世界考试的问题来测试语言模型的智能,这些考试旨在评估人类的智力能力(大学入学考试、法律考试等)。

Image

BBH

BBH(BIG-Bench Hard)基准专注于被认为超出当前语言模型能力范围的任务,测试它们在各种推理和理解领域的极限。

Image

 Gemma 7B Vs Mistral 7B,实际上手

先直接试试 Gemma 7B

能知道问题之间的相关性,但对于2008年电影票房这种需要搜索的内容,就开始胡言乱语了

Image

Image

Image

Image

Image

⬆ 能准确的将德语中的 "Regisseur" 改为了 "Regisseurin"(从男导演换成女导演),以及冠词“einen”和“der”也都做了相应的调整。

同样的问题, 交给 Mistral 7B

对比很明显,没能完全执行Prompt的内容,出的内容也不对。

Image

Image

Image

— GenAI 出品 —