小红书技术REDtech

ACL 2025 | Revisiting Self-Consistency: 动态分布对齐视角下的大模型投票策略

Image

思维链(Chain of Thought, CoT)作为大规模语言模型推理能力的关键技术,其性能在很大程度上取决于解码策略的设计。自洽性(Self-Consistency, SC)方法通过对同一输入生成多条推理轨迹,并以多数投票的方式选取最终答案,从而在无需额外模块的前提下显著提升了模型的推理准确性和鲁棒性。然而,关于SC机制的深层次原理尚未得以充分阐明,其中多样性采样参数对SC效果的影响也常被忽视。

在ACL 2025会议上,小红书搜索团队从动态分布对齐的视角出发,系统性地考察了SC采样过程中的温度调整机制,并提出了一种基于置信度驱动的动态温度校准方法。该方法能够根据生成推理答案的置信度动态调节采样温度,以实现推理路径多样性与答案分布收敛速度的平衡。

随后,北京理工大学与小红书的研究者在数学推理任务上对该方法进行了大规模评估,涵盖多种主流基座模型。实验结果显示,与固定多样性参数的对照方法相比,置信度驱动的动态采样策略在有限样本环境下具有更优的性能表现,无需额外训练数据或模块支撑,即可实现推理效果的稳步提升。这一现象揭示了SC方法实质上是动态采样机制与渐进演化答案分布之间的同步优化问题,为进一步理论分析与实践应用奠定了基础。

论文标题:

Revisiting Self-Consistency from Dynamic Distributional Alignment Perspective on Answer Aggregation

论文地址:

https://www.arxiv.org/abs/2502.19830

Image

自洽性方法(Self-Consistency, SC)是一种经过长期验证的解码策略,通过对同一输入进行多次采样并以多数投票方式聚合结果,从而提升模型性能。大量研究表明,SC在多种任务中均能显著增强语言模型的推理能力,但其潜在机制迄今尚未得到深入探究。

近期研究表明,通过对多条推理轨迹进行多数投票,SC方法能够有效避免陷入局部最优并减少单次采样所引入的高方差,从而使聚合结果逐步逼近模型的潜在真实答案分布(参见图1(a))。基于此见解,本文首次从形式化层面给出SC方法的收敛性定义,并设计了对应的采样过程收敛判据。系统性分析表明,传统观点中对“固定真实分布”的假设在实际解码过程中并不成立,而解码参数(如温度设置)对SC的收敛行为具有关键影响(参见图1(b))。

Image

基于上述发现,本文围绕以下两个关键问题展开研究:

  1. 在可用样本数量受限的情况下,不同采样多样性策略如何影响采样分布与潜在真实答案分布之间的对齐?

  2. 能否通过主动校准解码参数以加速并稳健收敛,而非依赖渐近收敛?

为此,我们对温度参数在SC过程中的作用进行了深入探讨。

研究结果表明,温度不仅调节采样随机性,而且直接塑造潜在答案分布。当样本数量趋于无穷大时,较高温度有助于获得更理想的真实分布;然而在样本有限的情况下,最佳采样温度会随样本量减少而降低。该现象揭示了一种权衡:低多样性采样可迅速集中投票结果并抑制噪声,但存在放大模型固有偏差的风险;高多样性采样虽然分散结果、需更多样本以实现稳定,却有助于探索潜在的更优分布,从而在总体上提升SC方法的性能。

言而总之,我们的分析表明,SC的有效性取决于采样分布的置信度与真实答案分布的内在不确定性之间的动态对齐——这种关系受样本数量的影响。理想情况下,应该控制采样分布,以便多数投票结果与真实分布紧密匹配,并在此基础上探索更优的真实分布。

基于以上分析,我们提出了一种置信度驱动的采样温度优化机制,该机制根据答案分布计算实时置信度从而动态调整温度。当早期样本在前两次投票答案之间仅显示出很小的概率差距时,我们的机制锐化采样分布,以更好地将其与真实分布对齐。相反,当置信度较高时,升高温度以探索潜在的更优分布。我们推导出一个置信度阈值来确定温度调整的方向,为这一过程提供理论支持。这种闭环控制动态地将采样分布与潜在答案分布对齐,确保高效收敛,同时积极追求更好的分布。

Image

2.1分布视角下的SC有效性分析

从概率的角度来看,SC可以看作是真实答案分布p(y | x) 的蒙特卡罗估计。随着样本数量的增加,样本形成的经验分布近似于真实分布,最高频的答案与真实分布下采样概率最高的答案一致:

Image

随着采样样本数量的增加,聚合估计的可靠性显著提升,多数投票机制亦逐步收敛于模型的潜在真实答案。为验证该见解,我们考察了top-1答案匹配率随样本规模变化的曲线特性。真实top-1答案,指通过从大规模采样结果中构造的近似真实分布中抽取所得的最优答案。

Image

图2 的结果表明随着样本量的增加,top-1 答案匹配率逐渐接近 100%,准确率不断提高。这给予我们一个见解:SC性能的提高源于采样分布中的top-1 答案逐渐与真实分布对齐的事实,最终达到了真实分布水平的准确性。

2.2SC收敛性分析

根据以上观察和见解,由于真实分布的准确性是固定的,因此保证SC的答案收敛。为了进一步研究,我们根据柯西收敛准则提供以下定义:

Image

基于定义2.1,我们证明了SC在数据集上准确率也收敛:

Image

最后,我们给出在在实际采样过程中SC的收敛判别准则:

Image

图3 描述了各种模型在GSM8K数据集上的收敛行为,准确率曲线根据定义2.3 绘制到收敛点,从中我们可以得到:

  • 收敛速度与准确率呈正相关。

  • 收敛速度与温度成反比。

  • 最终收敛的准确率在不同的温度设置下是不同的。

基于它们,我们得出了:采样多样性会影响真实分布,影响SC的收敛效果和收敛速度。

Image

2.3 多样性解码策略对SC的影响

为了更深入地了解多样性对SC的影响,我们研究了准确率随温度变化的关系。

收敛条件下

Image

图4 展示了在采样至SC收敛情况下温度和准确率的变化曲线,这结果表明随着温度升高,单个样本的准确率呈下降趋势,收敛后SC的准确率呈上升趋势(最佳点通常接近1.0)。集成学习中的分歧消解定理提供了一定的解释性,这表明集成的整体性能是由单个模型的准确性与其多样性之间的权衡决定的。

我们获得了结论:当样本量足够时,应该增加温度以更好地探索具有更高准确度的真实分布。

有限采样

Image

图5 表示在有限采样的情况下温度和准确率的热力图。我们发现:当样本量有限时,随着样本量的减小,最佳温度逐渐向较低的值移动。根据以上分析,我们得出:样本量决定了能可靠建模最大top-1 的置信水平。置信度较低的真实分布需要更大的数据量,以确保采样的top-1 答案与收敛结果一致。

根据不同情况下的温度和准确率分析,我们推导出:SC的有效性取决于采样分布的置信度与真实答案分布的内在不确定性的动态对齐。

Image

基于第二部分的分析,我们提出了自适应置信分布对齐机制,以克服传统SC在固定样本大小与温度下的局限性。具体而言,我们根据实时计算的样本分布置信度动态调整采样温度:当置信度偏低且样本量有限时,降低温度以提高聚合决策的稳定性;而在置信度较高的情形下,适当升高温度以促进对潜在真实分布的探索。该机制通过主动收敛和探索的平衡,使SC在有限样本条件下亦能迅速逼近真实答案,同时在必要时保持多样性以发掘更优解,从而显著提升整体准确性与鲁棒性。

3.1 多样性控制策略

动态温度调整

我们引入了一种置信度驱动的多样性优化机制,将采样分布与潜在答案分布动态对齐。FSD被用作置信度度量来量化Top-1答案和Top-2答案之间的差距。形式上,在解码步骤t,有:

Image

为了确保稳定的优化,我们设计了一个保守的调整规则,其不变区间在置信阈值 τ 附近。温度 T 通过FSD进行更新:

Image

其中 ε 是稳定性余量,为简单起见,我们将其设置为 0.05。温度 T 被限制在 [0.1, 1.0] 的区间以避免极值。

阶段采样策略

为了平衡探索和效率,我们设计了三阶段抽样规则:

  • 探索阶段:以预设 收集少量样本 作为估计初始 的窗口。
  • 自适应阶段:通过等式7 调整,然后生成(N : 总采样数)个样本。
  • 利用阶段:通过等式7 获得最终并生成剩余的个样本。

阶段性方法逐渐从广泛的探索转向集中利用。最后,准确度由 N 个样本总数的多数投票计算。

3.2 理论推导

为了确保 FSD 阈值 τ 的合理有效选择,我们构建了一个单边 z 检验进行分析。该测试采用零假设如下:

H0:当前采样的top-1 答案不是无限采样下给定问题的真实答案。

为了简化这个问题,我们假设只有当前的top-2 答案可能会在无限采样下成为真实答案。因此,我们很自然地关注FSD 和置信度之间的关系。因此,这个单边 z 检验可以描述为:

Image

假设当前样本量接近无穷大,并且根据多项式分布和 Jensen 不等式,我们得到检验量z的下界为:

Image

当时,其对应的值约为 0.05。在此情形下,我们可以以较高置信度认为模型输出的最可能答案即为真实答案分布下的 top-1 答案。因此,可将 FSD 阈值设定为:

Image
Image

4.1 主实验

实验设置

  • 数据集及模型:我们在两个广泛使用的数学推理基准上评估我们的方法:GSM8K和 MATH。实验使用多个不同类别的基座模型来评估方法的效果和泛化性,包括Qwen、Llama、Mistral、DeepSeek、Gemma 和 Phi。

  • 参数设置:为了系统地比较动态和静态温度策略,我们测试了初始温度 T0 ∈ {0.1, 0.2,.., 1.0},采样数 N ∈ {10, 20, 40}。

  • 评估指标:为了直观地有效地评估方法之间的差异,我们计算了所有温度下固定温度采样和动态温度采样的平均准确率和最大准确率。

Image

动态温度采样减轻了固定温度采样带来的性能损失。我们发现,动态温度采样在不同温度下的平均准确率优于固定温度采样。这表明我们的方法不受温度范围的限制,可以识别对不同温度下SC性能更有效的样本。对于最优温度而言,这种方法减轻了样本在单个固定温度下无效采样引起的性能损失。

对于不同的样本,动态温度采样为每个样本搜索更合适的温度。同样,我们观察到动态温度采样在最大准确率方面也提供了一定的改进。这可以归因于不同的样品需要不同的温度区间。固定温度采样只能在整体上追求期望准确率,而动态温度采样自动搜索每个单独样本的最佳温度,最大限度地优化SC在各个初始温度下的性能。

4.2 分析实验

我们对模型在不同温度下的准确性进行了详细的分析。图 7 显示了 Qwen2.5-Math-7B 模型的准确度和温度曲线。我们观察到,在采样大小为 20 和 40 的情况下,低温范围 (0.1-0.4) 和高温范围 (0.7-1.0) 都表现出显着的改进。这表明动态温度采样产生更稳健的结果。

Image

温度调整方向分析

考虑样本层级,我们首先分析了在整个动态温度采样过程中经历温度增加、减少或保持不变的样本的比例,如图8所示。我们观察到,在低温范围内,至少80%的样本经历了温度升高。这一观察结果与我们从数据集层面考虑得出的假设一致,这表明升高温度往往会导致更高的预期准确度。随着初始温度升高,温度向上调整的样本比例逐渐减小,表明对于当前采样的某些样本,过高的温度不足以自信地选择正确的答案。因此,降低温度对于提高置信度是必要的。此外,我们注意到,在采样数扩大的情况下,样本温度上升的比例更高,这与我们在第 2 部分的分析是一致的。

Image

样本在最佳温度范围的比例

我们分析了最终到达FSD阈值范围样本的比例。我们认为到达FSD阈值范围是样本处于最佳温度范围内的标志。如图9 所示,与固定温度采样相比,动态温度采样使得样本进入FSD阈值范围的比例更高。这表明我们的方法可以更好地动态对齐数据集中更大范围的样本。

Image
Image

本工作通过动态分布对齐的视角重新审视SC,打破被动收敛到固定答案分布的传统观点。我们证明了基于温度的解码塑造了采样行为和潜在答案分布,揭示了多样性驱动的探索和有限样本收敛之间的权衡。通过引入置信度感知机制,该机制根据与分布的实时对齐动态调整温度,弥合这一差距,从而实现动态采样和演化答案分布之间的有效同步。

实验结果表明,这种方法优于静态策略,在没有外部资源介入的情况下实现了稳健的性能改进。我们的研究结果将SC定位为有限样本下的主动对齐挑战,为推理任务中的自适应聚合框架开辟了新途径。

Image

李易为

现博士就读于北京理工大学,小红书社区搜索组实习生。在 NeurIPS、ICLR、ACL、NAACL、AAAI 等机器学习、自然语言处理领域顶级会议上发表数篇一作论文,主要研究方向为大语言模型、开放域对话生成等。

张骥

现本科就读于北京理工大学,小红书社区搜索组实习生。在ACL发表一篇论文。主要研究方向为大语言模型推理。

冯少雄

现负责小红书社区搜索机制和垂类。曾负责个性化和长冷向量召回、大模型满意度标注/答案生成(基于后验行为RLHF)。兼职北京理工大学校外博导,在 ICLR、NeurIPS、AAAI、ACL、EMNLP 等机器学习、自然语言处理领域顶级会议上发表多篇论文,主要研究方向大模型推理/评测/蒸馏、生成式检索、开放域对话生成。

Image
小红书社区搜索算法工程师(全职 / 实习)