DeepSeek-V4核心公开?梁文锋署名新论文发布,实习生挑大梁
Engram的核心优势在于记忆检索完全依赖输入token,而非运行时的隐藏状态。这种确定性机制实现了参数存储与计算资源的解耦,支持训练和推理阶段采取专门的优化策略:
▲Engram训练和推理阶段可采用不同优化策略
训练优化:通过将超大嵌入表分片至多张GPU,利用All-to-All通信按需收集对应行,使总记忆容量随GPU数量线性扩展。
推理优化:由于可提前确定待查询记忆,系统可从主机内存异步预取,同时在前几层计算期间隐藏通信延迟,实现预取与计算的重叠,避免GPU停顿。
硬件-算法协同设计:Engram在模型中的放置位置需平衡建模性能与系统延迟。较早引入有助于局部模式重建,较深放置则延长延迟隐藏窗口,需兼顾二者优化。
层次化存储:基于自然语言𝑁-gram的Zipf分布特性,可采用多级缓存策略,高频嵌入存放于GPU HBM或主机DRAM,低频嵌入置于SSD。这使Engram能扩展至超大规模记忆,同时保持低延迟与高效率。
具体而言,DeepSeek训练了四个模型:Dense-4B、MoE-27B、Engram-27B、Engram-40B。训练时的语料库、分词器都使用了相同的设置,而后两个模型引入了Engram机制,用于研究在模型大小不变和Engram进一步扩展后的特性。
结果显示,在相同算力和参数量的情况下,Engram-27B能在MoE-27B的基线上去取得持续提升,并且这些增益并不仅限于知识密集型任务。通用推理任务、代码与数学推理任务从中得到的提升甚至更为显著,
这些结果支持了DeepSeek的假设:引入专门的知识查找原语(knowledge lookup primitive)能够提升表示效率,这超出了仅将整个稀疏预算用于条件计算所能达到的效果。
最后,将模型扩展到Engram-40B进一步降低了预训练损失,并在大多数基准上提升了性能。虽然它尚未在每个任务上严格优于Engram-27B,但这很可能是训练不足的结果。
DeepSeek团队观察到,在训练结束时,Engram-40B与基线模型之间的训练损失差距仍在扩大,这表明在当前的token预算下,扩展的记忆容量尚未完全发挥其潜力。
▲长上下文性能比较基准测试
▲表征对齐和收敛速度分析
▲结构消融实验结果
▲功能敏感性分析结果
▲门控机制激活