PostgreSQL码农集散地

DeepSeek 开源周看点总结

DeepSeek 开源周看点总结

DeepSeek团队在2025年开源周发布了一系列AI基础设施工具集合,覆盖大模型训练与推理中的计算加速、通信优化、并行策略、存储系统等关键环节。其目标是通过透明化生产级代码,推动社区共建AGI基础设施 。

一、DeepSeek开源项目及其核心功能

Day 1 - FlashMLA

  • 功能:高效的 MLA(Multi-Length Attention)解码内核,专为 Hopper GPU 优化。
  • 特点:
    • 支持 BF16 数据类型。
    • 分页 KV 缓存(块大小为 64)。
    • 性能:内存带宽 3000 GB/s,计算性能 580 TFLOPS(BF16,H800 GPU)。
  • GitHub 链接:FlashMLA

Day 2 - DeepEP

  • 功能:首个开源的 EP(Expert Parallelism)通信库,用于 MoE(Mixture of Experts)模型的训练和推理。
  • 特点:
    • 高效优化的 all-to-all 通信。
    • 支持 NVLink 和 RDMA 的节点内和节点间通信。
    • 高吞吐量内核(训练和推理预填充)。
    • 低延迟内核(推理解码)。
    • 原生 FP8 调度支持。
    • 灵活的 GPU 资源控制,支持计算-通信重叠。
  • GitHub 链接:DeepEP

Day 3 - DeepGEMM

  • 功能:支持 FP8 的 GEMM(通用矩阵乘法)库,适用于密集和 MoE 矩阵乘法。
  • 特点:
    • 在 Hopper GPU 上达到 1350+ FP8 TFLOPS。
    • 无重型依赖,代码简洁如教程。
    • 完全即时编译(JIT)。
    • 核心逻辑仅约 300 行,性能优于专家调优的内核。
    • 支持密集布局和两种 MoE 布局。
  • GitHub 链接:DeepGEMM

Day 4 - 优化并行策略

  • DualPipe:双向管道并行算法,用于 V3/R1 训练中的计算-通信重叠。
    • GitHub 链接:DualPipe
  • EPLB:专家并行负载均衡器,用于 V3/R1。
    • GitHub 链接:EPLB
  • Profile Data:分析 V3/R1 中的计算-通信重叠。
    • GitHub 链接:Profile Data

Day 5 - 3FS

  • 功能:Fire-Flyer 文件系统(3FS),一个并行文件系统,充分利用现代 SSD 和 RDMA 网络的带宽。
  • 特点:
    • 在 180 节点集群中实现 6.6 TiB/s 的聚合读取吞吐量。
    • 在 25 节点集群中实现 3.66 TiB/min 的 GraySort 基准吞吐量。
    • 每个客户端节点的 KVCache 查找峰值吞吐量为 40+ GiB/s。
    • 解耦架构,具有强一致性语义。
    • 支持训练数据预处理、数据集加载、检查点保存/重载、嵌入向量搜索和推理中的 KVCache 查找。
  • GitHub 链接:3FS
  • Smallpond:基于 3FS 和 DuckDB 的数据处理框架。
    • GitHub 链接:Smallpond

二、核心技术解析

DeepSeek Open Infra 系列项目涵盖了从高效解码内核、专家并行通信库到并行文件系统的多个领域,展示了 DeepSeek 在 AI 基础设施领域的全面优化和创新。通过开源这些项目,团队希望与社区共同推动 AGI 技术的发展。

DeepSeek Open Infra 的开源理念是“透明分享,共同进步”。团队希望通过开源这些经过生产验证的代码,推动 AI 基础设施领域的集体创新。这些项目不仅展示了 DeepSeek 的技术实力,也为社区提供了实用的工具和参考。

1. 计算加速层

  • FlashMLA:专为Hopper架构GPU优化的注意力解码核,支持BF16精度与分页KV缓存,在H800上实现580 TFLOPS的算力峰值。
  • DeepGEMM:FP8精度的矩阵计算库,支持稠密矩阵与MoE稀疏计算,Hopper GPU上达到1350+ TFLOPS。核心代码仅300行,通过JIT编译实现高性能。

2. 通信优化层

  • DeepEP:首个开源的专家并行(EP)通信库,支持NVLink/RDMA跨节点通信、FP8数据传输,实现计算-通信流水线重叠。

3. 并行策略创新

  • DualPipe:双向流水线并行算法,优化计算与通信的重叠效率。
  • EPLB:动态负载均衡器,解决MoE模型中专家分配不均匀问题。

4. 存储系统突破

  • 3FS文件系统:分布式存储系统,支持6.6 TiB/s聚合吞吐,满足训练数据加载、KV缓存查询等场景。采用存算分离架构,兼容强一致性语义。

三、技术亮点

  1. 生产验证:所有组件均经过实际业务验证,如V3/R1模型训练(2048 H800 GPU集群)。
  2. 极致性能:通过FP8精度、JIT编译、通信重叠等优化,逼近硬件算力极限。
  3. 架构轻量化:核心代码精简(如DeepGEMM仅300行),降低二次开发门槛。

四、开源意义

  • 填补空白:首次开源MoE通信库(DeepEP)、FP8计算库(DeepGEMM)等关键组件。
  • 技术透明:公开生产环境验证过的代码,如3FS文件系统吞吐数据。
  • 社区共建:通过模块化工具链,助力开发者复现千亿参数模型训练。

五、其他参考资料

https://github.com/deepseek-ai/open-infra-index

2024 AI 基础设施相关论文(SC24)

  • 标题:Fire-Flyer AI-HPC: A Cost-Effective Software-Hardware Co-Design for Deep Learning
  • 内容:介绍了 DeepSeek 在 AI-HPC(人工智能高性能计算)领域的软硬件协同设计,展示了其成本效益和性能优化。
  • 论文链接:
    • ACM 论文
    • Arxiv 论文

六、深层意义

  • 各行业的AI+正在加速, 就像当年的互联网+. 各行业都将依赖AI, 例如未来也许软件也是AI直接生成, 手机应用入口大部分被AI占据, ... 如果大多数的AI应用软件都是基于deepseek等国产化软硬件生态打造的, 我们将在产业链上游占有一席之地, 不会被动的随意的被卡.

这可能不是哪个公司和公司之间的竞争, AI的发展速度只会越来越快, 可能真会应验“方生方死”的速度. 所以啥也别说了, 修炼AI, 修炼国产化软硬件生态.