DeepSeek 元旦发新论文:如何用数学给大模型训练装上“稳定器”
去年 12 月 1 日,DeepSeek 发布了 V3.2 和 V3.2‑Speciale,时隔一个月,DeepSeek 元旦发布了新论文:mHC: Manifold-Constrained Hyper-Connections
地址:https://huggingface.co/papers/2512.24880
DeepSeek R1 年初爆火似乎过去了很久,其实一年不到。AI 时代的时间被压缩了。前一阵豆包说自己投放少,少得过 DeepSeek 吗?我感觉 DeepSeek 零投放,这方面都没做商业化,投放啥啊。
昨天新年,我出去玩了半天,今天上午看了下这篇论文。这真是个好时代,利用 AI 工具我们可以快速理解一篇精深的技术论文。
DeepSeek 这项新的研究主要讲的是:mHC(流形约束超连接)。
这件事的背景还挺有意思的,深度学习能走到今天,2016 年提出的 ResNet(残差网络) 功不可没。它引入了“恒等映射”(Identity Mapping),简单说就是给信号开了一条“直达电梯”,解决了深层网络训练不动的难题。
简单解释一下,传统深层网络的问题是,层越多越难训练,梯度在反向传播时要么逐层变小(消失),要么被放大(爆炸),最终学不动。ResNet的关键做法,是把每一层的输出拆成两部分:一部分是这层学到的“增量”(残差),另一部分是不动的“恒等映射”——也就是把输入直接绕过去加到输出上。这样做的直觉是:如果这一层啥也学不到,至少还能把原始信息原封不动地传下去;如果能学到东西,就在稳稳的“底座”上叠加一个小改动。训练时,梯度也能沿着这条直通道顺利返回,不再在层层非线性里迷路。
换个更生活化的比喻:你在高层建筑里搬运物品,普通楼梯每层都得拐弯、走很久,东西可能在中途丢失或变形;残差连接等于给你加了一部贯穿全楼的电梯,保证原样到达,再在目标楼层做微调。于是网络可以从几十层一路扩到上百层甚至更深,性能提升的同时,训练稳定性也大幅改善。
但是,随着模型规模冲向千亿甚至万亿,传统的“单车道”残差连接有点不够用了。
怎么办呢?既然路窄,那就拓宽一点。
为了突破瓶颈,学术界提出了 HC(Hyper-Connections,超连接)。逻辑是这样的:既然传统的残差流太窄,那我们就把它的宽度拓宽(比如翻 4 倍),并引入可学习的矩阵来灵活调节连接强度。
直观一点讲:原来的残差像一根直管,把水原样并回主干;HC 的作用是把直管变成多股粗管,并在管口装了一个可调节的“分流阀”(也就是可学习矩阵),让水流按需重新分配。好处是信息更丰富、更灵活;风险是如果这个分流阀没有约束,每层都稍微放大或失衡,叠加多了就会数值爆炸,表现出来就是数值不稳定。
在深层网络里,信号每经过一层就可能被放大或缩小一点点。经过几十层、上百层的累积,这种偏差会呈指数级爆炸,这个应该很容易理解。在 DeepSeek 的实验中,HC 的信号增益峰值竟然达到了 3000 倍,这就像音响回授产生的尖叫声,直接让模型训练“炸掉”了。
为了解决这个问题,DeepSeek 的工程师们提出了 mHC(Manifold-Constrained Hyper-Connections)。
解题的思路非常优雅:既然放任自流会出事,那我们就把这些连接矩阵关进“数学的笼子”里。
这个笼子在数学上叫作“流形约束”,具体来说是约束在双随机矩阵(Doubly Stochastic Matrices)构成的流形上。所谓双随机矩阵,就是矩阵的每一行和每一列的和都严格等于 1,且矩阵元素是非负的。
这一招妙在哪里?
能量守恒:信号在传播过程中,特征的均值保持不变。
抑制爆炸:这种矩阵的谱范数被限制在 1 以内,确保信号不会在层层传递中无限膨胀。
结构稳定:双随机矩阵的乘积依然是双随机矩阵。这意味着,无论你的网络叠到 100 层还是 1000 层,这种稳定性是“自带闭环”的。
怎么理解呢?所谓能量守恒,就是不管阀门怎么调,整体水的平均流量不变,相当于不给系统平白添油加火。抑制爆炸,说的是把阀门的“最大增益”限定在 1 以内,信号每过一层都不会被无限放大,叠上百层也不会出现啸叫反馈。结构稳定的意思是,这类阀门串联多少个,性质都不变——前一个守恒、后一个也守恒,连起来还是守恒,这就是“自带闭环”,让深层网络像搭积木一样可靠。
我大概就能理解到这里了 😂
为了在代码里实现这种约束,DeepSeek 用到了 Sinkhorn-Knopp 算法。这个算法通过不断的迭代归一化,强行把一个乱糟糟的矩阵修正成双随机矩阵。在 DeepSeek 的实践中,迭代 20 次就能达到非常理想的稳定状态。
数学在哪个时代里,都是神啊。
当然,如果只有数学公式,就只是论文,能跑在大规模集群上,才是 DeepSeek 的风格。
mHC 引入了更宽的残差流,理论上会带来巨大的内存访问(I/O)压力,甚至可能触发“内存墙”瓶颈。DeepSeek 团队为此又做了一系列硬核优化:
算子融合(Kernel Fusion):利用 TileLang 将多个操作融合进一个 GPU 核函数,减少数据在显存里的搬运。
选择性重算(Recomputing):为了省显存,有些中间结果不存了,回头要用的时候现算。
流水线优化:在他们自研的 DualPipe 调度中,巧妙地让通信和计算互相重叠,把那点额外的计算开销降到了最低。
实际的结果是,在 27B(270亿参数)模型的测试中,mHC 把原本 3000 倍的混乱增益压低到了 1.6 倍左右,模型训练稳如老狗。而且相比 baseline,它在推理(BBH)、数学(DROP)等任务上都有了显著的提升。最重要的是,这么复杂的结构,训练时间只增加了 6.7%。
我们常说,底层的突破往往来自于对基础规律的敬畏。
残差连接流行了十年,大家都在上面盖房子,DeepSeek 这个团队往深处看了一眼,发现地基的“恒等映射”属性在大规模下松动了,于是用流形约束重新加固了地基。
这种数学直觉 + 极致工程的组合,正是目前 AI 竞争最核心的护城河。
最后,如果你都没看懂,可以这么理解一下:以前的 HC 是一个没有红绿灯、车流横冲直撞的巨大立交桥,那么 mHC 就是通过双随机约束,为每一辆车(信号)制定了精准的流量平衡守恒定律,确保无论车流如何汇聚和分流,整个城市的交通永远不会瘫痪。
DeepSeek 真是一家了不起的公司。