性能超LLaMA2、Grok-1!1320亿参数的开源大模型DBRX来了
DBRX:1320亿参数的开源大模型
前言
Databricks在其最新文章《介绍DBRX:一个新的行业领先开源大语言模型[1]》中宣布了一个激动人心的消息:1320亿参数的 DBRX 是该公司开发的一个开放、通用的大型语言模型(LLM),在众多标准基准测试中,它设定了新的行业最高标准。
DBRX的主要优势
• 开放性与功能性:DBRX提供了之前仅限于封闭模型API的功能,这不仅有利于开放社区,也有助于企业构建自己的LLMs。
• 卓越的性能:在性能上,DBRX超越了GPT-3.5,并与Gemini 1.0 Pro相媲美。
• 编程能力:DBRX不仅是一款通用LLM,还是一个在编程方面表现出色的代码模型,甚至超越了像CodeLLaMA-70B这样的专业模型。
• 高效的推理速度:得益于其MoE(混合专家模型)架构,DBRX的推理速度是LLaMA2-70B的两倍。
• 参数效率:在总参数计数和活跃参数计数方面,DBRX大约是Grok-1的40%。
• 高速文本生成:当在Mosaic AI Model Serving上托管时,DBRX能够以每用户150 tok/s的速度生成文本。
• 训练效率:与密集模型相比,训练DBRX的MoEs在FLOP效率上高出约两倍,使用更少的计算量即可达到上一代MPT模型的质量。
开源与下载
DBRX的基础模型((DBRX Base[2])和微调模型(DBRX Instruct[3])的权重已在Hugging Face上以开放许可的形式提供。用户可以从Hugging Face下载DBRX,或在其 HF Space[4] 尝试使用DBRX Instruct,或在其GitHub模型仓库databricks/dbrx[5] 中查看更多信息。
基准测试结果
DBRX在语言理解(MMLU)、编程(HumanEval)和数学(GSM8K)方面的基准测试中均优于现有的开源模型。在综合基准测试、编程和数学基准测试以及MMLU方面,DBRX Instruct均处于领先地位,超越了所有聊天或指令微调模型。
在与领先闭源模型的比较中,DBRX Instruct的表现超越了GPT-3.5,并与Gemini 1.0 Pro和Mistral Medium具有竞争力。在多个基准测试中,DBRX Instruct的表现超过了或至少与GPT-3.5相当,特别是在编程和数学推理方面表现尤为出色。
长上下文任务与RAG质量
DBRX Instruct在处理长上下文任务时表现出色,其性能与Mixtral Instruct以及GPT-3.5 Turbo和GPT-4 Turbo的最新版本API相当。在检索增强生成(RAG)方面,DBRX Instruct的性能与开放模型如Mixtral Instruct和LLaMA2-70B Chat以及当前版本的GPT-3.5 Turbo相当。
训练与推理效率
DBRX的训练效率显著提高,特别是在使用MoE架构和更好的预训练数据的情况下。在推理效率方面,DBRX的推理吞吐量比非MoE的132B模型高出2-3倍。这使得DBRX在模型质量和推断效率之间实现了更好的权衡。
结语
Databricks坚信,每个企业都应该掌握其在GenAI新兴世界中的数据和命运。DBRX作为其下一代GenAI产品的重要支柱,预示着客户在使用DBRX的能力和构建工具时将面临激动人心的旅程。
随着DBRX的推出,Databricks期待与客户和开放社区一起,在其基础上构建更多创新的应用。
引用链接
[1] 介绍DBRX:一个新的行业领先开源大语言模型: https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm[2] DBRX Base: https://huggingface.co/databricks/dbrx-base[3] DBRX Instruct: https://huggingface.co/databricks/dbrx-instruct[4] HF Space: https://huggingface.co/spaces/databricks/dbrx-instruct[5] databricks/dbrx: https://www.github.com/databricks/dbrx