告别无效思考 | 小红书Hi Lab 提出Think When You Need
深度思考模型通过 Test-Time Scaling (测试时扩展) 大幅提升了模型推理能力,但同时也出现了大量冗余和无效思考。小红书 Hi Lab 团队提出了Think When You Need 的强化学习训练方式;在不影响最终效果的前提下,实现动态CoT能力,大幅降低平均思考长度。实验证明,这种思想在推理和非推理等各种任务上广泛适用。团队还发现了一种现象:即在相同任务下,越聪明(参数量大)的模型,需要的思考长度越短;这与当前深度思考模型表现相违背,却十分符合人类的认知。
论文标题:
Think When You Need: Self-Adaptive Chain-of-Thought Learning
论文地址:
https://arxiv.org/abs/2504.03234
GitHub地址:
https://github.com/lefttt/TWYN
近年来,大语言模型通过链式思考(Chain-of-Thought, CoT)在复杂推理任务上取得了显著进步。以OpenAI发布的o3为例,其在抽象推理和技能获取方面展现了卓越能力。
然而,强大能力的背后,其“思考”效率的短板也日益凸显。一个引人深思的案例是:o3-high模型为了解决一个10岁孩子仅用四分钟便能攻克的ARC-AGI题目,进行了长达4300万token的“思考”,期间历经1024次尝试才最终找到正确方案。这种看似“深思熟虑”的过程,实则充斥着大量冗余和无效的步骤。部分深度推理模型在面对如“hi”这样的简单输入时,也会生成上千token的思考过程(o3-pro 会生成百万token)。这不仅大幅增加了模型的推理时间和用户的等待成本,也使其运行成本居高不下。
现有解决方法大多通过在原始reward基础上增加长度惩罚来实现,比如Kimi k1.5的Length Penalty,对所有数据按照长度差异进行直接奖励或惩罚。
但这种一刀切的策略需要精细调参,且难以动态的根据不同难度的问题和不同能力的模型来调整思考长度。同时,现有的算法都是针对有标准答案的任务,如数学和代码类问题,而对于开放类问题,没有很好的优化思考长度的方法。
针对上述问题,小红书团队提出了全新方法“Think When You Need”,整体遵循这样一种思想:相同的任务,如果思考了更久,那么就应该得到更好的结果。
方法核心在于对比奖励(PairwiseReward)假设。团队设计了一套面向答案质量和篇幅的成对比较机制:对于同一问题的多个生成答案,两两进行对比评估,根据效果的偏序和思考长度差异综合给予奖励。
Think When You Need 思想在 verify 任务上的实现
这种方法不仅不需要人为设置长度惩罚系数,还能自然融入其他奖励结构,能保证模型始终将正确性放在第一位,而不会出现多个优化目标带来的Reward-hacking问题,在后文也会提供清晰的理论假设支持。
通过强化学习训练,团队验证了此方法的可行性。核心发现有以下几点。
广泛适用性。这是一种在不同训练任务上都能有效降低模型思考冗余的训练方法。数学任务的思考长度降低47.3%,开放性任务上减低99%。并且整体效果持平或微涨。
自适应思考能力。模型的在简单问题上降低了更多冗余思考,而不影响复杂问题。1.5b模型在aime2024(美国数学邀请赛)题目上,思考长度降低2.6%,而在math500(初中到大学数学题)上,思考长度下降33%。
思考长度与模型本身能力相关。经过此方法训练后,我们发现越聪明(参数越大)的模型,思考长度下降越明显。在消融实验中,1.5b模型思考长度8.2k->6.7k (-22.3%),而更聪明的7b模型则是7.2k -> 3.8k (-47.3%),这与我们的生活认知一致,聪明学生往往做题更快。
TWYN输出
对比实验输出
候选答案采样
针对每个输入问题,模型同步生成 N 条不同思考深度的候选回答。
两两成对比较
枚举所有对回答 ,分别为候选回答 (Candidate)和参考回答 (Reference)。根据参考回答的对比来建立候选回答的奖励(reward),具体分值如上图。
除了正常的对错对比分数外,当两个回答都正确的情况下,我们给予思考长度更短的回答额外的固定奖励。
汇总对比奖励
针对每条回答 ,将它与所有其他回答的对比奖励累加得到其最终的奖励:
为了定量比较思维链长短与回复好坏的优先级,论文设置了长短的参数β=1,并提出了一系列理论假设与对应的好坏参数α需要满足的关系:
效果优先,最终reward分数的排序与只考虑效果的排序一致。即不会因为思考长度更短,使某条样本的reward分数超过比它表现好的任意其他样本。
效果影响大于思考长度差异。如在数学任务中,正例和负例的reward差值,要恒大与任意两个正例之间的reward差值。
根据以上关系,我们能推导出参数所需满足的条件(具体过程见论文):
在多项推理基准上,Think When You Need展现了优异表现:模型生成的回答长度显著缩短,而准确率与传统方法持平或略有提升。以DeepScaleR数据集为例,模型的回答长度从原先超过6000个Token减少到不足4000 Token(而基准模型约为6500),但测试准确率与基线相比并未下降。类似地,在AIME 2024和MATH 500等标准测试集中,论文提出的方法在保持或微升的准确率条件下,大幅减少了推理篇幅。这些结果证明:Think When You Need 能显著降低模型的“过度思考”,同时保持解决问题的质量。大规模实验也表明,该方法在各种设置下均优于传统方法,验证了其实用性和通用性。
Think When You Need 通过简单调整对比奖励表来支持在开放式任务(fuzzy tasks)。并同样展现出卓越能力。
针对没有标准参考答案的主观评估场景,该方法在AlpacaFarm进行了人类偏好测试。结果显示,Think When You Need 生成的回答不仅在偏序打分中平均领先偏序 CoT RL 方法,同时使思考链长度几乎降至零,在保证回答流畅度与合理性的同时,大幅提升响应速度,同时相对比不做RL训练的SFT模型有明显提升。整体来说,论文提出的方法提供了一种可以在开放类任务上大幅缩减思维链长度的,同时还能进一步提高模型效果的方法。
“Think When You Need”以自适应成对奖励为核心,打破了“思考深度与效率”的传统权衡,实现了模型在不同难度任务间的智慧切换。它不仅在多项基准测试中大幅缩减推理长度,又保持甚至超越了原有准确率,更具备不依赖调参、奖励模型易兼容,支持开放任务等优势。面向可验证以及开放任务等多种应用场景,为下一代高效、精准的 AI 大模型注入了新的可能。
林客
小红书hi lab团队算法工程师,主要研究方向是强化学习,Agent,AI-Human Interaction
斯丁
小红书hi lab团队算法工程师,主要研究方向是强化学习, RM , AI-Human Interaction
部门介绍
小红书 hi lab 团队(人文智能实验室,Humane Intelligence Lab)致力于突破人工智能的边界,通过发展人际智能、空间智能、音乐智能等多元智能形态,不断拓展人机交互的可能性,愿景是"让AI成为人类贴心和有益的伙伴"。
正式员工招聘
以上岗位点击链接即可直达投递入口~
Redstar顶尖实习生招聘
也可以发送简历至:
并抄送至:
添加小助手,了解更多内容
微信号 / REDtech01