鹅厂内部万亿大模型训练加速框架上线公有云!
自研 AngelPTM 大模型训练框架上线公有云,助力降本增效
AngelPTM 技术原理简介
ZeRO-Cache 优化策略
统一视角存储管理
ZeRO-Cache 显存管理器
PipelineOptimizer
多流异步化
ZeRO-Cache SSD 框架
大模型训练加速效果
| DeepSpeed | Megatron-DeepSpeed | |
|---|---|---|
| 社区方案 | 0.8.1+258d2831 | 7212b58 |
| AngelPTM 方案 | 0.6.1+474caa20 | c5808e0 |
注意:其他环境,例如 OS/python/CUDA/cuDNN/pytorch 等版本二者一致。
注意:4机32卡训练性能提升比例(26.8%)相比单机有所下降主要是由于网络带宽限制。这里使用的是 100Gbps RDMA 网络,未来腾讯云会推出更高带宽 RDMA 的高性能计算集群,预期性能提升会与单机接近。
AngelPTM 已加入 TACO Train 加速组件,助力大模型训练显存上限、性能大幅提高
AngelPTM 将单机 A100 40G 容纳的模型规模提升了94.71% 基于社区方案能容纳的最大模型规模,AngelPTM 性能提升了44.42% 千亿模型规模下,AngelPTM 多机扩展比接近线性