Geek Savvy

DeepSeek第二天开源DeepE,附相关解析

开源周第二天,DeepSeek发布通信库DeepEP! DeepSeek 官方: 很高兴介绍 DeepEP——第一个用于 MoE 模型训练和推理的开源 EP 通信库。 ✅高效、优化的全员沟通 ✅节点内和节点间均支持 NVLink 和 RDMA ✅用于训练和推理预填充的高吞吐量内核 ✅用于推理解码的低延迟内核 ✅原生 FP8 调度支持 ✅灵活的 GPU 资源控制,实现计算-通信重叠 🔗 GitHub地址: https://github.com/deepseek-ai/DeepEP DeepEP 简介: 其功能特性、性能表现、相关技术原理及使用方法等内容,具体重点如下: 1. DeepEP发布概况:DeepEP 是首个用于MoE模型训练和推理的开源EP通信库,支持低精度运算,针对DeepSeek-V3论文算法优化,发布后备受关注。 2. 关键技术与性能 ○ 高性能核心:为非对称域带宽转发提供优化核心,内节点通信NVLink带宽达153 - 158GB/s,跨节点通信RDMA带宽达43 - 47GB/s。 ○ 低延迟:纯RDMA低延迟核心用于推理解码,分发操作延迟163 - 194微秒,合并操作延迟318 - 369微秒,保持39 - 46GB/s的RDMA带宽。 ○ 通信 - 计算重叠:基于钩子的方法,不占SM资源,提升效率。 3. 相关技术解析 ○ MoE与EP:MoE将多个“专家”网络组合,由门控网络路由数据;EP把MoE中不同专家分配到不同设备,DeepEP解决其通信效率问题。 ○ 全对全GPU核心操作:MoE架构中的分发和合并操作需全对全通信,DeepEP优化该过程。 ○ 通信域与低精度运算:优化NVLink和RDMA域数据传输,支持FP8低精度运算提升效率、减少内存需求。 ○ 其他技术:组限制门控算法平衡MoE计算负载;针对Hopper GPU架构优化;可控制SM数量 。 4. 使用指南 ○ 安装部署:需Hopper GPU、Python 3.8+、CUDA 12.3+、PyTorch 2.1+、NVLink和RDMA网络,依赖修改版NVSHMEM,提供Python API 。 ○ 网络配置:生产环境通过InfiniBand虚拟通道隔离流量,支持自适应路由,需选择最佳路由策略。