ICML 2025 | 小红书 hi lab 团队提出多模态奖励模型泛化新方法
多模态奖励模型(Multimodal Reward Models,MM-RMs)在将大语言模型(Large Language Models,LLMs)与人类偏好对齐方面发挥着至关重要的作用,尤其是在 LLMs 越来越多地处理多模态数据的背景下。然而,现有的 MM-RMs 在泛化到分布外(o.o.d.)数据时面临挑战,主要原因是它们依赖于单模态虚假关联(Unimodal Spurious Correlations),尤其是独立同分布(i.i.d.)的训练数据中的纯文本捷径(Text-only Shortcuts),这阻碍了它们学习真正的多模态奖励函数。
论文标题:
The Devil Is in the Details: Tackling Unimodal Spurious Correlations for Generalizable Multimodal Reward Models
论文地址:
https://arxiv.org/abs/2503.03122
随着大语言模型(LLMs)的广泛应用,如何将其与人类偏好对齐成为了一个关键问题。奖励模型(Reward Models, RMs)作为人类偏好的代理,在对齐 LLMs 的行为方面发挥了重要作用。然而,随着 LLMs 越来越多地以多模态的方式感知世界,例如处理图像、文本和语音等多种类型的数据,传统的单模态奖励模型已经无法满足需求。因此,多模态奖励模型(Multimodal Reward Models, MM-RMs)应运而生,成为解决多模态任务中对齐问题的重要工具。
尽管多模态奖励模型在捕捉人类偏好上具有关键意义,关于其泛化能力的研究却仍然处于空白。泛化能力是指模型在未见过的数据上保持性能的能力,这对于 MM-RMs 的实用性至关重要。如果一个 MM-RM 在训练数据上表现良好,但在分布外(o.o.d.)数据上无法泛化,那么它可能会导致模型在实际应用中产生与人类意图不一致的输出,甚至出现奖励黑客(Reward Hacking)的问题。因此,理解与提高 MM-RMs 的泛化能力对确保其在现实世界中的鲁棒性而言至关重要。
我们发现了一个值得关注的现象:现有的 MM-RMs 在多模态数据的训练过程中往往会过度依赖单模态的虚假关联(Unimodal Spurious Correlations)。具体来说,这些模型倾向于学习纯文本捷径(Text-only Shortcuts),而忽视了视觉或其他模态的信息。这种现象在训练数据中可能表现良好,但在分布外数据上则会失效,从而严重影响多模态奖励模型的泛化能力。
这一现象促使我们思考:如何衡量 MM-RMs 的泛化性能,并且量化单模态虚假关联对其泛化表现的影响?我们能否建立更加有效的多模态奖励模型构建方法,从而缓解 MM-RMs 中的单模态虚假关联,进而提升其泛化性能?在本研究中,我们系统性地探讨了上述问题,并提出了一种针对单模态虚假相关性的解决方案,构建了一个更具鲁棒性的多模态奖励建模框架。
2.1多模态奖励建模
在本工作中,多模态奖励建模被形式化为成对偏好标注(Pairwise Preference Labeling)任务。具体来说,在多模态偏好数据集的每个样本中,输入包含一幅图像、一个查询问题以及两个不同的回答;输出则是被选择(更符合人类偏好)的回答索引(或)。我们考虑多模态奖励模型作为一个点预测器,将图像、查询与一个回答映射到一个标量奖励值上。在训练阶段,我们遵循经典的 Bradley-Terry 模型来优化奖励模型,通过最小化训练集上的经验损失来调整模型参数:
在评估阶段,我们通过比较模型对测试集上成对回答的奖励值大小,来衡量模型的性能:
2.2跨分布泛化框架
在经典的机器学习设置中,训练集与测试集是从同一环境中独立同分布(i.i.d.)采样的,即存在分布,使得和均独立同分布于。为了系统地研究多模态奖励模型在未见但相关环境中的泛化行为,我们引入了跨分布的实验框架。
具体来说,我们考虑从一组环境中获得的一系列不同分布,其中是环境索引。尽管这些环境在标注方法和采样模型等因素上存在差异,但它们共享一个共同目标:追求更真实、有帮助、符合人类偏好的回答。更正式地说,每个环境都满足不变性条件假设,即存在一个对所有环境都通用的表示,允许在不同概率分布之间进行一致的标签预测。
进一步地,我们获得了不同的数据集,每个可以划分为训练集和测试集。这使得我们能够在 i.i.d. 和 o.o.d. 情景下研究多模态奖励模型的泛化性能:我们将训练数据限制在任何一个环境中,记作,那么对于在这个数据集上训练的模型,就构成了 i.i.d. 测试情景,而任何不同于的则构成了 o.o.d. 测试情景。通过评估模型在这些情景下的性能变化,我们能够洞察其鲁棒性和泛化能力。
2.3单模态虚假关联
以往的研究将机器在泛化上的不足归因于虚假关联,也称为捷径学习。具体来说,尽管模型在学习输入与标签之间的相关性方面表现出色,但其中一些相关性只是捷径,仅在训练分布内有效,无法泛化到未见数据上。
在本文中,我们识别了多模态奖励模型中的一种特定类型的虚假关联,称为单模态虚假关联(Unimodal Spurious Correlations)。更具体地说,单模态虚假关联是指 MM-RMs 在训练数据上学习到的纯文本捷径(Text-only Shortcuts),这些捷径在 i.i.d. 场景下意外地取得了成功,但在 o.o.d. 设置中却会失败,从而阻碍了 MM-RMs 对未见数据的泛化。
为了系统地分析和诊断单模态虚假关联,我们引入了两个专门的纯文本设置:
纯文本训练(Text-only Training):在移除数据集中图像的情况下训练奖励模型,通过修改训练损失函数来实现,如下所示:
纯文本测试(Text-only Test):在测试阶段的推理过程中移除视觉模态,从而修改准确率指标,如下所示:
3.1 具体设置
数据:我们使用三个已有的Vision-Language 偏好数据集:VLFeedback、POVID、RLHF-V,并将每个数据集划分成训练集和测试集,以模拟不同环境之间的分布迁移。这些数据集专注于视觉相关任务,如视觉问答(VQA)和图像描述,但在构建方法上有所不同。
模型:我们使用 InternVL2-8B 作为奖励模型的基础架构。为了将 Vision-Language Model 适配为多模态奖励模型(MM-RM),我们移除了语言建模头,并添加了一个奖励模型头,这是一个将 LLM 解码器最后一层的隐藏状态转换为标量奖励分数的线性层。
3.2 泛化表现
我们对于标准的多模态奖励模型进行了跨分布测试,并以泛化矩阵的形式呈现。该矩阵中的元素表示在上训练的模型在上测试的性能。实验结果(如图1(a)所示)揭示了一个重要发现:标准多模态奖励模型在分布外数据上的准确率显著下降,与同分布场景相比差距明显。具体来说,三种 i.i.d. 测试场景和六种 o.o.d. 测试场景的平均准确率分别为 91.4 与 68.1,性能差距为 23.2。
3.3 纯文本捷径
在明确了多模态奖励模型的泛化性能以后,我们进一步分析了纯文本捷径(Text-only Shortcuts)作为 MM-RMs 构建过程中一种不容忽视的虚假关联,并得出一系列洞察性的见解。首先,现有的多模态偏好数据集不可避免地存在纯文本捷径,这些捷径仅在其对应的分布中有效。具体来说,基于纯文本训练以及纯文本测试的设置,我们得出了纯文本奖励模型(Text-only RM)的泛化矩阵(如图1(b)所示)。与标准的多模态奖励模型相比,Text-only RM 在所有数据的 i.i.d. 场景下实现了相当的准确率,然而却在 o.o.d. 场景下严重失效。其次,即使在多模态偏好环境中进行训练,MM-RMs 仍然会利用单模态虚假关联。我们在训练和测试过程中交替使用多模态和纯文本模式,检查奖励模型在 i.i.d. 条件下的性能。我们发现即使在纯文本测试中,在多模态偏好数据上训练的模型仍然能够实现相当的 i.i.d. 性能,这表明它们所学到的相关性中存在纯文本捷径。
3.4 捷径失效退化
为了系统地检验纯文本捷径对 MM-RMs 泛化能力的影响,我们提出了捷径失效退化(Shortcut-Failure Degradation, SFD)指标,该指标量化了当单模态虚假相关性未能泛化到 o.o.d. 数据时 MM-RMs 的性能下降程度。
捷径失效退化:给定一个在数据集上训练的多模态奖励模型,我们使用纯文本奖励模型作为纯文本捷径的代理。我们利用将 o.o.d. 测试集划分为两部分:一部分是预测正确的样本,称为捷径成功子集(Shortcut-success subset);另一部分是失效的样本,称为捷径失效子集(Shortcut-fail subset)。捷径失效退化是指多模态奖励模型在这两个子集之间准确率的差异。
我们观察到,MM-RMs 的泛化能力受到单模态虚假相关性的严重限制。具体来说,在不同的分布外情景中,MM-RMs 的 SFD 值范围从 14.2 到 57.5,平均值为 39.5。这表明 MM-RMs 的奖励过程主要受纯文本捷径的支配,当这些捷径未能泛化到 o.o.d. 数据时,尤其是在需要真正多模态理解的情景中,模型表现出显著的性能下降。
4.1 捷径感知的训练范式
基于对单模态虚假关联的洞察,我们提出了一种更加鲁棒的多模态奖励模型学习算法,能够在任何有偏数据集上学习可泛化的 MM-RM。具体来说,该方法的核心在于识别并突出单模态捷径失效的场景,在此基础上实现训练分布的迁移。为了实现这一目标,我们在训练阶段提出了一个双分支架构。每个分支都使用相同初始化的奖励模型,但它们在模态处理上有所不同:主分支在标准的多模态偏好数据上进行训练,作为我们的捷径感知的多模态奖励模型(Shortcut-aware MM-RM);辅助分支则在移除了图像模态的偏好数据上进行训练,作为纯文本捷径的代理。为了量化并利用这两个分支之间的差异,我们引入了单模态虚假关联系数(Shortcut-Failure Coefficient, SFC):
单模态虚假关联系数:该指标从样本层面衡量辅助分支(单模态捷径代理)对总训练目标损失的贡献比例,从而表明单模态虚假相关性在多大程度上未能捕捉完整的偏好模式。形式上,我们定义 SFC 为:,其中,与代表样本级别的损失值,分别为如下所示:
基于单模态虚假关联系数,我们将主分支的损失函数重新表述为捷径感知(shortcut-aware)的形式,其中 SFC 值仅作为加权系数:
本质上,该训练范式利用 SFC 值动态地重新加权训练分布中的样本:具有较高 SFC 值的样本表明纯文本分支难以建模偏好,这意味着多模态融合对于鲁棒学习至关重要,因此会获得更高的权重;相反,具有较低 SFC 值的样本表明纯文本分支可以轻松区分它们,从而获得较低的权重。我们将这种加权机制视为一种适应性方法,将训练数据分布转向那些多模态理解至关重要的环境。
4.2 分支解耦的推理范式
在完成捷径感知的模型训练后,我们可以简单地移除辅助分支,因为该分支仅在训练期间作为纯文本捷径的代理。在推理阶段,我们只需要部署主分支,这意味着推理过程与标准多模态奖励模型完全相同,没有任何额外开销。
5.1 跨分布泛化评估
捷径感知的多模态奖励模型(Shortcut-aware MM-RMs)在跨分布转移测试中取得泛化性能的显著提升,如图1(c)所示。与标准多模态奖励模型相比,Shortcut-aware MM-RMs 在六个 o.o.d. 场景下的平均准确率从 68.1 提高到 78.5。进一步地,我们分析了捷径失效退化指标的变化。Shortcut-aware MM-RMs 在所有 o.o.d. 场景中均展现出稳健的鲁棒性提升,与标准 MM-RMs 相比,SFD 值显著降低。这表明捷径感知模型较少依赖纯文本捷径进行奖励评分,并且在单模态虚假关联无法泛化的情景中能够做出更准确的判断。
5.2 下游性能验证
我们进一步在下游任务中验证模型的真实性能,采用最佳候选选择(Best-of-N, BoN)策略。该过程涉及从 InternVL2-8B 为每对图像-查询生成 64 个候选回答,多个多模态奖励模型随后对这些候选回答进行评分,得分最高的回答被选中用于下游基准评估。Shortcut-aware MM-RMs 在所有基准测试中均展现出显著的 Best-of-64 性能提升,突显了该算法强大的泛化能力和实际应用价值。我们还发现,捷径感知的多模态奖励模型展现出了更好的可扩展性,在面对奖励过度优化(Reward Overoptimization)时具有更强的鲁棒性。
本研究解决了多模态奖励模型(MM-RMs)面临的一个关键挑战:单模态虚假关联对其泛化能力的限制。我们的跨分布实验揭示了 MM-RMs 在同分布(i.i.d.)和分布外(o.o.d.)情景之间的显著性能差异。此外,我们发现即使在多模态训练环境中,MM-RMs 仍然能够利用多模态偏好数据集中存在的纯文本捷径,这对其泛化能力产生了负面影响。为了克服这一局限性,我们提出了一种捷径感知(Shortcut-aware)的多模态奖励模型学习算法,该算法通过动态识别并强调单模态捷径失效的样本,显著增强了它们的泛化能力和实际应用的有效性。
李梓超
部门介绍
招聘岗位
以上岗位点击链接即可直达投递入口~
也可以发送简历至:
并抄送至:
添加小助手,了解更多内容
微信号 / REDtech01