DeepSeek开源周第一天重磅发布FlashMLA!
DeepSeek 开源周重磅开启,开源周第一天就放出大招,开源了FlashMLA项目,迅速在GitHub上引发关注,2小时就收获3300多Star! DeepSeek 官方: 很荣幸与大家分享 FlashMLA - 我们为 Hopper GPU 开发的高效 MLA 解码内核,针对可变长度序列进行了优化,目前已投入生产。 ✅ BF16支持 ✅ 分页KV缓存(块大小 64) ⚡ H800上内存受限 3000 GB/s,计算受限 580 TFLOPS 🔗GitHub 地址 :https://github.com/deepseek-ai/FlashMLA 主要内容简介: 1️⃣ 专为Hopper GPU深度优化FlashMLA是针对NVIDIA Hopper架构GPU(如H800 )打造的高效MLA解码内核。Hopper架构是NVIDIA第九代架构,专为超大规模AI和超算设计。FlashMLA在H800上性能惊人,内存带宽达3000GB/s ,计算能力达580 TFLOPS,几乎将硬件性能拉到极限。 2️⃣ 聚焦解码阶段,加速大模型输出大模型有训练和推理解码两个主要阶段。在解码阶段,序列变长会导致计算开销剧增。FlashMLA的“MLA”(多头潜在注意力)能优化解码过程,让大模型更快产出结果,对长上下文对话等场景意义重大。 3️⃣ 性能卓越,对标FlashAttentionFlashMLA的灵感源自FlashAttention。相比FlashAttention - 2,其速度接近翻倍,与FlashAttention - 3也相差无几,而FlashAttention - 3针对H100优化,FlashMLA则专为H800优化。 4️⃣ 适配可变长度序列,贴合实际应用在大模型实际应用中,用户输入长度往往不规则。FlashMLA对可变长度序列场景进行了优化,不仅适合固定batch,还能在输入长度随时变更时保持高效运行。 5️⃣ 开箱即用,上手简单FlashMLA使用方便,按照说明安装和测试即可。安装:python setup.py install;基准测试:python tests/test_flash_mla.py 。使用时,按照代码示例调用相应函数就行。 开源周第一天,FlashMLA 就点燃整个AI圈,接下来还有4天,会是什么重磅项目呢,期待一下!