叶小钗

NSA技术浅析:如何通过稀疏注意力降低AI推理成本?

关注公众号回复1

获取一线、总监、高管《管理秘籍》

我们这些追AI的,真的是学不过来,完全学不过来!

DeepSeek最近发布了一项新技术:原生稀疏注意力(Native Sparse Attention, NSA),他旨在通过减少长上下文场景下的注意力计算复杂度,显著降低推理成本。

NSA的核心思想是通过对KV序列进行稀疏化处理,减少注意力计算中的KV数量,从而降低计算复杂度。

不用勉强了,我知道各位理解不了,所以接着往下看吧...

NSA的核心价值

随着AI模型在处理长上下文(如长文本生成、复杂推理任务)时的需求增加,推理成本也随之飙升。

传统的注意力机制(如Transformer中的多头注意力MHA)在长上下文场景下,计算复杂度呈平方级增长,导致推理速度变慢、成本增加。

NSA的诞生就是为了解决这个问题。它通过减少注意力计算中的KV数量,显著降低了计算复杂度,尤其是在长上下文场景下,推理速度提升了9倍,反向传播速度提升了6倍。

分层稀疏注意力

NSA的核心设计是通过三种不同的注意力机制(压缩、选择、窗口)来减少注意力计算中的KV数量,从而降低计算复杂度。

以下是NSA的三种注意力机制的通俗解释:

一、压缩注意力:全局把控

压缩注意力的目的是将一段KV序列压缩成一个全局的KV向量,代表该片段的全局信息。

就像你在阅读一篇文章时,先快速浏览每一段的主题句,抓住文章的核心思想。

通过这种方式,NSA能够减少注意力计算中的KV数量,从而降低计算复杂度。

二、选择注意力:精细提取

选择注意力是在压缩注意力的基础上,选择出最相关的KV片段进行精细的特征提取。

在阅读文章时,找到最相关的段落进行深入阅读。

通过这种方式,NSA能够在全局信息的基础上,进一步捕捉局部信息。

三、窗口注意力:就近捕捉

窗口注意力是捕捉与当前query最近的KV片段,假设越相近的KV越重要。

重点关注当前段落和前后几段的内容。

通过这种方式,NSA能够捕捉到与当前query最相关的局部信息。

四、注意力聚合:动态权重

NSA通过门控机制将三种注意力机制的输出进行聚合,最终得到注意力输出。门控机制是可学习的,能够根据输入动态调整三种注意力的权重。

也就是,根据文章的不同部分动态调整阅读重点。

NSA的优势

NSA的设计不仅能够减少计算量,还能保持较高的模型性能,尤其是在长上下文场景下表现出色。以下是NSA的几大优势:

第一,计算复杂度降低

NSA通过减少注意力计算中的KV数量,显著降低了计算复杂度。在64k上下文长度下,推理速度相比Flash Attention提升了9倍,反向传播速度提升了6倍。

第二,推理成本降低

NSA的设计能够显著降低推理成本,尤其是在长上下文场景下。通过减少KV数量,NSA能够在不牺牲模型性能的情况下,显著降低推理成本。

第三,模型性能保持

NSA通过分层稀疏化建模,能够在减少计算量的同时,保持较高的模型性能。实验结果表明,NSA的精度与传统的多头注意力(MHA)相当。

应用场景

综上,NSA的设计特别适合以下场景:

  1. 长文本生成:如生成长篇文章、复杂推理任务等。
  2. 多轮对话系统:如客服系统、虚拟助手等,需要处理长上下文对话。
  3. 复杂推理任务:如数学推理、代码生成等,需要处理长上下文信息。

总结

NSA是DeepSeek团队在推理成本优化方面的一次重要突破。

通过减少注意力计算中的KV数量,NSA能够显著降低推理成本,尤其是在长上下文场景下表现出色。

NSA的设计不仅能够减少计算量,还能保持较高的模型性能,为AI模型的长上下文处理提供了新的解决方案。

综上,原生稀疏注意力与MLA一样,属于模型应用层面的算法创新。

这一优化直接转化为工程上的两大优势:

  1. 一是降低硬件资源消耗,减少GPU/TPU的使用成本,支持更大规模部署;
  2. 二是提升用户体验,实现更快的响应速度,尤其在长文本生成、多轮对话等场景中表现突出;

对于上层AI开发者而言,NSA的集成无需深入底层实现细节,只需关注其带来的性能提升和成本优化,从而更专注于业务逻辑和用户体验的提升。

Image