0.01%参数就能接近全量微调!低数据微调极致省参方案来了 | ACL'26
BEFT 团队 投稿
量子位 | 公众号 QbitAI
大模型微调的极致省参方案,要先回答一个更基本的问题:模型里的偏置项,究竟哪个最值得训练?
来自瑞典隆德大学与Google DeepMind的研究团队,系统比较了注意力模块中Query、Key、Value三类偏置b(q)、b(k)、b(v)。团队给出的核心结论非常直接:在低数据场景下,直接微调Value投影中的b(v),通常比微调b(q)或b(k)获得更好的下游性能。
该工作已被ACL 2026主会接收(已集成进Hugging Face-PEFT库),由Baichuan Huang、Ananth Balashankar和Amir Aminifar共同完成。其中Baichuan Huang、Amir Aminifar来自隆德大学,Ananth Balashankar来自Google DeepMind。
只调Bias,还能再省一层吗?
全参数微调效果强,但训练成本、显存占用和能耗都很高;LoRA、Adapter、Prefix Tuning等参数高效微调方法虽然大幅降低了开销,往往仍需新增模块、配置秩或长度,并进行额外重参数化。相比之下,Bias-only微调直接更新模型中已有的偏置项,几乎不改网络结构,天然具备“开箱即用”的优势。
此前的BitFit等工作已经发现:尤其在样本有限时,微调全部偏置项可以接近全参数微调。但“全部Bias”仍然把不同位置一视同仁。Transformer注意力中,b(q)、b(k)、b(v)究竟谁更关键?如果只保留最有效的一类,是否还能进一步减少参数?这正是BEFT要解决的问题。
△在SST-2低数据实验中,微调b(v)(绿色)相比b(q)(红色)和b(k)(蓝色)获得更高准确率,并以更少可训练参数接近或超过多种PEFT方案。
技术方案|为什么是Value Bias?
注意力模块可以写为Q=XW(q)+[b(q)]、K=XW(k)+[b(k)]、V=XW(v)+[b(v)],再通过缩放点积注意力计算输出。BEFT的关键并非经验上“碰巧选中了b(v)”,而是从softmax结构解释了三者为何不等价。
b(k):在softmax前被“抵消”
将同一个b(k)加到每个Key向量后,对于任意Query,所有注意力logit都会同时增加相同常数。由于softmax具有平移不变性,注意力权重不会改变。直观地说,这就像给所有候选项同时加同样的分数,排序自然不变,因此b(k)几乎不能提升注意力映射的表达能力。
b(q):能影响注意力,但容易被softmax压缩
b(q)确实能改变softmax之前的打分,但影响必须经过softmax传递。论文在编码器和解码器模型中观察到,注意力权重普遍呈现尖锐且高度稀疏的分布,此时softmax的雅可比矩阵中大多数元素接近0,b(q)带来的变化容易被压缩,表达能力提升有限。
b(v):直接写入注意力输出
由于每一行注意力权重之和为1,有A(V+[b(v)])=AV+[b(v)]。也就是说,b(v)不需要绕过一层“容易饱和”的softmax,而是等价于直接在缩放点积注意力的输出后增加一个完整维度的线性自由度。
△b(k)对注意力映射基本无效,b(q)提升有限,b(v)则等价于在SDPA输出后直接增加可训练自由度;右侧分布展示注意力权重的尖锐与稀疏。
从“变化大”到“变化有效”
仅看参数变化的绝对幅度并不可靠。论文发现,传统Magnitude方法经常把变化更大的b(q)排在前面,但真正微调时,b(v)的下游表现反而更好;Fisher信息方法又容易给出跨数据规模不变的静态排序,难以反映b(v)与b(q)性能差距随样本量变化而缩小的趋势。
BEFT因此把微调前后偏置向量的模长变化与夹角变化结合起来,并在Transformer各层上聚合,得到更贴近真实下游性能的偏置重要性排序。需要说明的是,论文在研究阶段通过全偏置微调分析三类偏置的变化;一旦得到“直接微调b(v)”的结论,实际使用时无需针对每个新任务再进行事后搜索。
0.01%参数,效果并不打折
在BERT(BASE)的GLUE实验中,b(v)在低、中、高三种数据规模下都稳定领先。论文汇总指标显示,低数据时b(v)平均得分为64.5%,b(q)和b(k)分别为57.8%、53.5%;中等数据时为70.8%,对比63.3%、50.4%;高数据时为71.7%,对比64.7%、50.4%。
参数效率更直观。在RTE低数据实验中,BEFT只训练全模型0.01%的参数,准确率达到58.53±1.88%;全部Bias微调需要0.09%的参数,准确率为56.40±2.88%;全参数微调使用100%的参数,准确率为57.46±2.20%。对应训练时间分别为132.9秒、144.9秒和206.1秒。需要强调的是,这是论文给出的一个具体实验案例,但它清楚展示了“选对位置”比“多训练参数”更重要。
关键结果一览:
△注:不同任务采用论文对应评价指标;RTE结果为3次不同随机种子实验的均值±标准差。
这一规律并不局限于BERT。论文进一步覆盖RoBERTa(BASE)、BERT(LARGE)、OPT-1.3B和OPT-6.7B,并延伸到分类、多项选择和生成任务。对于原本不含注意力Bias的LLaMA2-7B、GPT-J-6B和DeepSeek-Coder-Base-1.3B,研究者手动加入b(v)后再训练,结果依然优于加入并训练b(q)或b(k)。
在自回归模型实验中,BEFT使用的可训练参数比LoRA少约30倍、比Prefix Tuning少约10倍,同时在多项任务上保持有竞争力或更好的性能。BEFT也可以与LoRA、VeRA、DoRA等方法组合;无论直接训练还是叠加这些PEFT方法,b(v)整体仍优于b(q)和b(k)。
更少参数,也是一条设计规则
BEFT的价值不只在于把可训练参数压到更低。更重要的是,它给出了一条清晰、可解释、可迁移的设计原则:在标准softmax注意力中,可训练自由度放在哪里,比单纯增加自由度更关键。
对于样本有限、算力受限的下游适配任务,直接微调Value Bias几乎不需要额外结构和复杂配置;对于已有LoRA、VeRA、DoRA方案,b(v)又可以作为进一步削减参数的组合策略;对于无Bias模型,添加并训练b(v)也提供了一条轻量改造路径。
当然,论文也明确了边界:目前主要研究标准softmax注意力及Query、Key、Value投影,尚未覆盖线性注意力;不同偏置对特征叠加与Scaling Law的影响,也留待后续研究。
从“微调所有Bias”到“只微调最有用的Bias”,BEFT把大模型低数据适配再向前推进了一步。它提醒了从业者们:参数高效微调的下一步,未必是设计更复杂的模块,也可能是更准确地理解模型中那些早已存在、却长期被忽略的小参数。
论文标题:《BEFT: Bias-Efficient Fine-Tuning of Language Models in Low-Data Regimes》
论文链接:https://aclanthology.org/2026.acl-long.1799/
Hugging Face: https://huggingface.co/docs/peft/v0.20.0/en/package_reference/beft
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
【学术投稿】请在工作日发送邮件至:[email protected],标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目/主页链接,以及联系方式。
🌟 点亮星标 🌟