ITPUB

Meta Llama 3震撼发布,国内云计算企业或将全面支持

大模型王位轮流坐,今日来到真OpenAI-Meta家!

4月18日,Meta正式发布Llama 3,包括8B和70B参数的大模型。官方号称,Llama 3 8B和Llama3 70B是目前同体量下最强大的开源大模型,可以供外部开发者免费使用。

Image

Meta给出了诸多数据,主要强调Llama 3性能更好,训练效率更好,也更安全。Llama 3是在由24000块GPU组成的定制集群上,使用15万亿个token训练的,数据规模几乎是Llama 2的七倍。

性能对标GPT4,赶超Claude 3

测试数据显示,70B 版本的 Llama 3 明显优于其他主流大模型。

Image

Llama 3在指令调优后,比 Claude Sonnet、Mistral Medium、GPT-3.5 和 Llama 2 的表现都更优秀,其胜率分别达到了 52.9%、59.3%、63.2%、63.7%。Meta称,自己还在训练超过4000亿(400B)参数的模型,但不确定是否开源。

Llama 3一经发布便引发了热议。业界认为,Llama 3-400B+模型将成为社区获得GPT-4级别模型的重要里程碑。它将改变许多研究工作和草根初创公司的计算方式。

根据官方公布的资料来看,Llama 3能够重新抢回王位,主要在模型架构、预训练数据、扩大预训练规模和指令微调能力以及安全性等方面,都具有卓越表现。

在模型架构上,Llama 3采用了标准的纯解码器 Transformer 架构,通过128K token 的 tokenizer,更有效地编码语言,从而大幅提高了模型性能。同时,Llama 3的推理能力也更强,在80亿和700亿参数大小的模型中,采用了分组查询关注。他们在8192个 token 的序列上对模型进行训练,并使用掩码来确保不跨越文档边界。

在训练数据层面,Llama 3 在超过 15T 的 token 上进行了预训练,训练数据集是 Llama 2 的七倍,包含的代码数量是 Llama 2 的四倍。为了确保采用高质量数据进行训练,Meta 还开发了整套数据过滤管道,包括使用启发式过滤器、NSFW 过滤器、语义重复数据删除方法和文本分类器等。

为了训练处最大模型,Llama 3结合了数据并行化、模型并行化和管道并行化三种方式。在16K GPU 上进行训练时,高效实现实现了每 GPU 超过 400 TFLOPS 的计算利用率。同时,通过训练堆栈的改进,将总体训练时间缩短了95%以上,比 Llama 2 提高了三倍。

Llama 3在指令微调上也进行了创新,结合监督微调(SFT)、拒绝采样、近似策略优化(PPO)等方法,可以更好地释放模型训练的潜力。

最后,Llama 3在安全性上也有明显进步,配备了Llama Guard 2、Code Shield等新一代的安全工具。

主流云服务商将快速跟进

就在Meta刚刚发布Llama 3不久,已经有部分云服务商及时进行跟进。

亚马逊云科技在4月19宣布,Llama 3基础模型Llama 3 8B和Llama 3 70B已在Amazon SageMaker JumpStart中提供。客户可以在Amazon SageMaker Studio中通过几次点击,或通过SageMaker Python SDK编程方式发现并部署Llama 3模型,还可以利用SageMaker Pipelines、SageMaker Debugger或容器日志等功能,提升模型性能并实施MLOps控制。目前,Meta Llama 3已经在Amazon SageMaker Studio的美东(北弗吉尼亚州)、美东(俄亥俄州)、美西(俄勒冈州)、欧洲(爱尔兰)和亚太(东京)区域提供部署和推理服务。

国内云服务商阵营中,百度云这次反应相对较快,表示已经在千帆大模型平台中推出针对Llama 3全系列版本的训练推理方案,便于开发者进行再训练,搭建专属大模型,现已开放邀约测试。

其他家云服务中,阿里云、腾讯云、华为云等虽然没有明确表态,但从他们对Llama 2的全面支持来看,未来也一定会有进一步的动作。

Image