开源模型新阶段开始了,Meta开源Llama 2,免费商用。
Llama2发布了,这版本可以商用了,国内的大模型有救了,基本模型看起来非常强大(超越 GPT3),并且经过微调的聊天模型看起来与 ChatGPT 处于同一水平。这对开源来说是一个巨大的飞跃,对闭源提供商来说是一个巨大的打击,因为使用这种模型将为大多数公司提供更多的可定制性和更低的成本。
我详细整理了一些信息:
Llama2 的性能和参数
如何使用和限制条件
Llama2 的模型架构
Llama2 的训练方法论
下面是详细的信息:
Llama2 的性能和参数
Llama2有三个大小的版本分别是7B 13B和70B
Llama 2 的训练数据比 Llama 1 多 40%,上下文长度是 Llama 1 的两倍。
预训练的Token为2 万亿,上下文长度为4096
据Meta所说,Llama 2 在许多外部基准测试中都优于其他开源语言模型,包括推理、编码、熟练程度和知识测试。
如何使用和限制条件
与第一次泄漏的版本不同,这次Meta开放了商业使用的权限。
日活大于7亿的产品需要单独申请商用权限
不得使用 Llama 材料或 Llama 材料的任何输出或结果来改进任何其他大型语言模型。
除上述内容外,使用、复制、分发、拷贝、创建 Llama-2 的衍生作品以及对其进行修改都是免版税的。
现在可以直接在这个页面申请下载模型:https://ai.meta.com/resources/models-and-libraries/llama-downloads/
Llama2 的模型架构
Llama 2-Chat 的基础是 Llama 2 系列预训练语言模型。Llama 2 使用标准的Transformer架构。
Llama 2-Chat 通过监督微调和强化学习人类反馈进行了优化。先进行监督微调,然后应用包括拒绝采样和PPO在内的强化学习算法进行迭代改进。
采用了一些优化,比如预规范化、SwiGLU激活函数和旋转位置嵌入(RoPE)。
Llama 2-Chat有70亿、34亿、13亿和7亿参数的版本。训练使用公开可获得的数据,没有使用任何Meta用户数据。
Llama2 的训练方法论
1. 预训练
使用公开可获得的在线数据进行预训练,总计2万亿个标记。
对数据进行了清洗,移除了一些包含大量个人信息的网站。
采用标准的Transformer架构,以及一些优化如RoPE等。
2. 监督微调
使用高质量的人工标注数据(约3万示例)进行监督微调。
优化回答标记,而不是提示标记。
3. 基于人类反馈的强化学习
收集人类偏好数据: letting人类比较并选择更好的回复。
训练奖励模型,给回复打分。
使用拒绝抽样和PPO算法进行迭代调优。
4. 安全性
收集安全/有帮助的数据进行监督微调。
训练独立的安全性奖励模型。
使用内容蒸馏等方法增强安全性。
5. 评估
在4K提示上进行有用性人类评估,与ChatGPT等旗鼓相当。
在2K提示上进行安全性人类评估,优于多个基准模型。
对齐技术
论文里面还介绍了一些Llama 2训练过程中使用的对齐技术:
监督微调 (Supervised Fine-Tuning, SFT)
使用高质量人工标注数据进行监督微调,教会模型基本的有用性和安全性。
基于人类反馈的强化学习 (Reinforcement Learning with Human Feedback, RLHF)
收集人类偏好数据,让人类比较并选择更好的回复。
训练独立的有用性和安全性奖励模型。
通过拒绝采样和PPO优化使回复更符合人类偏好。
系统消息进行多轮一致性控制
提出了“Ghost注意力”(GAtt)机制,在多轮对话中保持对系统消息的注意力。
安全性内容蒸馏
为不安全的提示添加安全的前序话,生成更安全的回复。
在不安全的用例上应用内容蒸馏。
红队攻击
由专家进行的详尽的测试,发现模型中的风险。
使用红队结果进一步提高模型的安全性。
其他相关链接
Llama 2官网:https://ai.meta.com/llama/
Llama 2训练的论文介绍:https://ai.meta.com/research/publications/llama-2-open-foundation-and-fine-tuned-chat-models/
Huggingface的模型下载地址:https://huggingface.co/meta-llama
如果觉得有帮助可以帮忙转发给你的朋友或者点个再看,感谢各位。