NSA技术浅析:如何通过稀疏注意力降低AI推理成本?
关注公众号回复1
获取一线、总监、高管《管理秘籍》
我们这些追AI的,真的是学不过来,完全学不过来!
DeepSeek最近发布了一项新技术:原生稀疏注意力(Native Sparse Attention, NSA),他旨在通过减少长上下文场景下的注意力计算复杂度,显著降低推理成本。
NSA的核心思想是通过对KV序列进行稀疏化处理,减少注意力计算中的KV数量,从而降低计算复杂度。
不用勉强了,我知道各位理解不了,所以接着往下看吧...
NSA的核心价值
随着AI模型在处理长上下文(如长文本生成、复杂推理任务)时的需求增加,推理成本也随之飙升。
传统的注意力机制(如Transformer中的多头注意力MHA)在长上下文场景下,计算复杂度呈平方级增长,导致推理速度变慢、成本增加。
NSA的诞生就是为了解决这个问题。它通过减少注意力计算中的KV数量,显著降低了计算复杂度,尤其是在长上下文场景下,推理速度提升了9倍,反向传播速度提升了6倍。
分层稀疏注意力
NSA的核心设计是通过三种不同的注意力机制(压缩、选择、窗口)来减少注意力计算中的KV数量,从而降低计算复杂度。
以下是NSA的三种注意力机制的通俗解释:
一、压缩注意力:全局把控
压缩注意力的目的是将一段KV序列压缩成一个全局的KV向量,代表该片段的全局信息。
就像你在阅读一篇文章时,先快速浏览每一段的主题句,抓住文章的核心思想。
通过这种方式,NSA能够减少注意力计算中的KV数量,从而降低计算复杂度。
二、选择注意力:精细提取
选择注意力是在压缩注意力的基础上,选择出最相关的KV片段进行精细的特征提取。
在阅读文章时,找到最相关的段落进行深入阅读。
通过这种方式,NSA能够在全局信息的基础上,进一步捕捉局部信息。
三、窗口注意力:就近捕捉
窗口注意力是捕捉与当前query最近的KV片段,假设越相近的KV越重要。
重点关注当前段落和前后几段的内容。
通过这种方式,NSA能够捕捉到与当前query最相关的局部信息。
四、注意力聚合:动态权重
NSA通过门控机制将三种注意力机制的输出进行聚合,最终得到注意力输出。门控机制是可学习的,能够根据输入动态调整三种注意力的权重。
也就是,根据文章的不同部分动态调整阅读重点。
NSA的优势
NSA的设计不仅能够减少计算量,还能保持较高的模型性能,尤其是在长上下文场景下表现出色。以下是NSA的几大优势:
第一,计算复杂度降低
NSA通过减少注意力计算中的KV数量,显著降低了计算复杂度。在64k上下文长度下,推理速度相比Flash Attention提升了9倍,反向传播速度提升了6倍。
第二,推理成本降低
NSA的设计能够显著降低推理成本,尤其是在长上下文场景下。通过减少KV数量,NSA能够在不牺牲模型性能的情况下,显著降低推理成本。
第三,模型性能保持
NSA通过分层稀疏化建模,能够在减少计算量的同时,保持较高的模型性能。实验结果表明,NSA的精度与传统的多头注意力(MHA)相当。
应用场景
综上,NSA的设计特别适合以下场景:
长文本生成:如生成长篇文章、复杂推理任务等。 多轮对话系统:如客服系统、虚拟助手等,需要处理长上下文对话。 复杂推理任务:如数学推理、代码生成等,需要处理长上下文信息。
总结
NSA是DeepSeek团队在推理成本优化方面的一次重要突破。
通过减少注意力计算中的KV数量,NSA能够显著降低推理成本,尤其是在长上下文场景下表现出色。
NSA的设计不仅能够减少计算量,还能保持较高的模型性能,为AI模型的长上下文处理提供了新的解决方案。
综上,原生稀疏注意力与MLA一样,属于模型应用层面的算法创新。
这一优化直接转化为工程上的两大优势:
一是降低硬件资源消耗,减少GPU/TPU的使用成本,支持更大规模部署; 二是提升用户体验,实现更快的响应速度,尤其在长文本生成、多轮对话等场景中表现突出;
对于上层AI开发者而言,NSA的集成无需深入底层实现细节,只需关注其带来的性能提升和成本优化,从而更专注于业务逻辑和用户体验的提升。