Meta Llama 3震撼发布,国内云计算企业或将全面支持
大模型王位轮流坐,今日来到真OpenAI-Meta家!
4月18日,Meta正式发布Llama 3,包括8B和70B参数的大模型。官方号称,Llama 3 8B和Llama3 70B是目前同体量下最强大的开源大模型,可以供外部开发者免费使用。
性能对标GPT4,赶超Claude 3
测试数据显示,70B 版本的 Llama 3 明显优于其他主流大模型。
Llama 3在指令调优后,比 Claude Sonnet、Mistral Medium、GPT-3.5 和 Llama 2 的表现都更优秀,其胜率分别达到了 52.9%、59.3%、63.2%、63.7%。Meta称,自己还在训练超过4000亿(400B)参数的模型,但不确定是否开源。
Llama 3一经发布便引发了热议。业界认为,Llama 3-400B+模型将成为社区获得GPT-4级别模型的重要里程碑。它将改变许多研究工作和草根初创公司的计算方式。
根据官方公布的资料来看,Llama 3能够重新抢回王位,主要在模型架构、预训练数据、扩大预训练规模和指令微调能力以及安全性等方面,都具有卓越表现。
在模型架构上,Llama 3采用了标准的纯解码器 Transformer 架构,通过128K token 的 tokenizer,更有效地编码语言,从而大幅提高了模型性能。同时,Llama 3的推理能力也更强,在80亿和700亿参数大小的模型中,采用了分组查询关注。他们在8192个 token 的序列上对模型进行训练,并使用掩码来确保不跨越文档边界。
在训练数据层面,Llama 3 在超过 15T 的 token 上进行了预训练,训练数据集是 Llama 2 的七倍,包含的代码数量是 Llama 2 的四倍。为了确保采用高质量数据进行训练,Meta 还开发了整套数据过滤管道,包括使用启发式过滤器、NSFW 过滤器、语义重复数据删除方法和文本分类器等。
为了训练处最大模型,Llama 3结合了数据并行化、模型并行化和管道并行化三种方式。在16K GPU 上进行训练时,高效实现实现了每 GPU 超过 400 TFLOPS 的计算利用率。同时,通过训练堆栈的改进,将总体训练时间缩短了95%以上,比 Llama 2 提高了三倍。
Llama 3在指令微调上也进行了创新,结合监督微调(SFT)、拒绝采样、近似策略优化(PPO)等方法,可以更好地释放模型训练的潜力。
主流云服务商将快速跟进
就在Meta刚刚发布Llama 3不久,已经有部分云服务商及时进行跟进。
亚马逊云科技在4月19宣布,Llama 3基础模型Llama 3 8B和Llama 3 70B已在Amazon SageMaker JumpStart中提供。客户可以在Amazon SageMaker Studio中通过几次点击,或通过SageMaker Python SDK编程方式发现并部署Llama 3模型,还可以利用SageMaker Pipelines、SageMaker Debugger或容器日志等功能,提升模型性能并实施MLOps控制。目前,Meta Llama 3已经在Amazon SageMaker Studio的美东(北弗吉尼亚州)、美东(俄亥俄州)、美西(俄勒冈州)、欧洲(爱尔兰)和亚太(东京)区域提供部署和推理服务。
国内云服务商阵营中,百度云这次反应相对较快,表示已经在千帆大模型平台中推出针对Llama 3全系列版本的训练推理方案,便于开发者进行再训练,搭建专属大模型,现已开放邀约测试。
其他家云服务中,阿里云、腾讯云、华为云等虽然没有明确表态,但从他们对Llama 2的全面支持来看,未来也一定会有进一步的动作。