DeepSeek 开源周看点总结
DeepSeek 开源周看点总结
DeepSeek团队在2025年开源周发布了一系列AI基础设施工具集合,覆盖大模型训练与推理中的计算加速、通信优化、并行策略、存储系统等关键环节。其目标是通过透明化生产级代码,推动社区共建AGI基础设施 。
一、DeepSeek开源项目及其核心功能
Day 1 - FlashMLA
功能:高效的 MLA(Multi-Length Attention)解码内核,专为 Hopper GPU 优化。 特点: 支持 BF16 数据类型。 分页 KV 缓存(块大小为 64)。 性能:内存带宽 3000 GB/s,计算性能 580 TFLOPS(BF16,H800 GPU)。 GitHub 链接:FlashMLA
Day 2 - DeepEP
功能:首个开源的 EP(Expert Parallelism)通信库,用于 MoE(Mixture of Experts)模型的训练和推理。 特点: 高效优化的 all-to-all 通信。 支持 NVLink 和 RDMA 的节点内和节点间通信。 高吞吐量内核(训练和推理预填充)。 低延迟内核(推理解码)。 原生 FP8 调度支持。 灵活的 GPU 资源控制,支持计算-通信重叠。 GitHub 链接:DeepEP
Day 3 - DeepGEMM
功能:支持 FP8 的 GEMM(通用矩阵乘法)库,适用于密集和 MoE 矩阵乘法。 特点: 在 Hopper GPU 上达到 1350+ FP8 TFLOPS。 无重型依赖,代码简洁如教程。 完全即时编译(JIT)。 核心逻辑仅约 300 行,性能优于专家调优的内核。 支持密集布局和两种 MoE 布局。 GitHub 链接:DeepGEMM
Day 4 - 优化并行策略
DualPipe:双向管道并行算法,用于 V3/R1 训练中的计算-通信重叠。 GitHub 链接:DualPipe EPLB:专家并行负载均衡器,用于 V3/R1。 GitHub 链接:EPLB Profile Data:分析 V3/R1 中的计算-通信重叠。 GitHub 链接:Profile Data
Day 5 - 3FS
功能:Fire-Flyer 文件系统(3FS),一个并行文件系统,充分利用现代 SSD 和 RDMA 网络的带宽。 特点: 在 180 节点集群中实现 6.6 TiB/s 的聚合读取吞吐量。 在 25 节点集群中实现 3.66 TiB/min 的 GraySort 基准吞吐量。 每个客户端节点的 KVCache 查找峰值吞吐量为 40+ GiB/s。 解耦架构,具有强一致性语义。 支持训练数据预处理、数据集加载、检查点保存/重载、嵌入向量搜索和推理中的 KVCache 查找。 GitHub 链接:3FS Smallpond:基于 3FS 和 DuckDB 的数据处理框架。 GitHub 链接:Smallpond
二、核心技术解析
DeepSeek Open Infra 系列项目涵盖了从高效解码内核、专家并行通信库到并行文件系统的多个领域,展示了 DeepSeek 在 AI 基础设施领域的全面优化和创新。通过开源这些项目,团队希望与社区共同推动 AGI 技术的发展。
DeepSeek Open Infra 的开源理念是“透明分享,共同进步”。团队希望通过开源这些经过生产验证的代码,推动 AI 基础设施领域的集体创新。这些项目不仅展示了 DeepSeek 的技术实力,也为社区提供了实用的工具和参考。
1. 计算加速层
FlashMLA:专为Hopper架构GPU优化的注意力解码核,支持BF16精度与分页KV缓存,在H800上实现580 TFLOPS的算力峰值。 DeepGEMM:FP8精度的矩阵计算库,支持稠密矩阵与MoE稀疏计算,Hopper GPU上达到1350+ TFLOPS。核心代码仅300行,通过JIT编译实现高性能。
2. 通信优化层
DeepEP:首个开源的专家并行(EP)通信库,支持NVLink/RDMA跨节点通信、FP8数据传输,实现计算-通信流水线重叠。
3. 并行策略创新
DualPipe:双向流水线并行算法,优化计算与通信的重叠效率。 EPLB:动态负载均衡器,解决MoE模型中专家分配不均匀问题。
4. 存储系统突破
3FS文件系统:分布式存储系统,支持6.6 TiB/s聚合吞吐,满足训练数据加载、KV缓存查询等场景。采用存算分离架构,兼容强一致性语义。
三、技术亮点
生产验证:所有组件均经过实际业务验证,如V3/R1模型训练(2048 H800 GPU集群)。 极致性能:通过FP8精度、JIT编译、通信重叠等优化,逼近硬件算力极限。 架构轻量化:核心代码精简(如DeepGEMM仅300行),降低二次开发门槛。
四、开源意义
填补空白:首次开源MoE通信库(DeepEP)、FP8计算库(DeepGEMM)等关键组件。 技术透明:公开生产环境验证过的代码,如3FS文件系统吞吐数据。 社区共建:通过模块化工具链,助力开发者复现千亿参数模型训练。
五、其他参考资料
https://github.com/deepseek-ai/open-infra-index
2024 AI 基础设施相关论文(SC24)
标题:Fire-Flyer AI-HPC: A Cost-Effective Software-Hardware Co-Design for Deep Learning 内容:介绍了 DeepSeek 在 AI-HPC(人工智能高性能计算)领域的软硬件协同设计,展示了其成本效益和性能优化。 论文链接: ACM 论文 Arxiv 论文
六、深层意义
各行业的AI+正在加速, 就像当年的互联网+. 各行业都将依赖AI, 例如未来也许软件也是AI直接生成, 手机应用入口大部分被AI占据, ... 如果大多数的AI应用软件都是基于deepseek等国产化软硬件生态打造的, 我们将在产业链上游占有一席之地, 不会被动的随意的被卡.
这可能不是哪个公司和公司之间的竞争, AI的发展速度只会越来越快, 可能真会应验“方生方死”的速度. 所以啥也别说了, 修炼AI, 修炼国产化软硬件生态.