基于对比的评估(CBE)方案迎来重要突破,小红书搜索团队最新论文《UniCBE:基于多目标优化的统一对比评估框架》提出创新性解决方法,全面提升现有对比评估方法的准确性、收敛速度与扩展性。
传统 CBE 方法受限于单一优化目标,难以平衡评估精度与效率。团队通过理论推导发现:抑制采样偏差需保证组合均匀性,加速收敛需平衡胜率不确定性下降过程,增强扩展性需保障新模型评估资源分配均匀。基于此,UniCBE 创新性地构建三个解耦的采样概率矩阵,分别对应三大核心目标,最终通过矩阵融合结合贪心采样策略实现多目标协同优化。
实验证明,在 AlpacaEval 基准测试中,UniCBE 仅用 83% 的标注预算即可达成与全量评估 0.995 + 的皮尔逊相关性。在新模型持续随机加入的场景下,评估成本更是直降 50% 以上,为动态场景下的模型评估树立新标杆。
论文标题:
UniCBE: An Uniformity-driven Comparing Based Evaluation Framework with Unified Multi-Objective Optimization
论文地址:
https://arxiv.org/pdf/2502.11454
随着大语言模型的快速迭代,基于人类偏好的对比评估(CBE)已被广泛应用于衡量模型能力,如Chatbot Arena平台。但现有方法面临三重挑战:现有对比评估方法(CBE)在有限预算下存在系统性偏差: 跨样本偏差:当仅在部分样本上评估时,模型得分与全量评估结果的绝对偏差均值超过0.25(图2-a、图2-b展示偏差分布)
跨模型偏差:模型对战结果存在不可传递性(Non-transitivity)问题,在统计的对战数据中,81组三元组出现循环压制现象,也即A>B, B>C, C>A。(图2-a、图2-c展示偏差分布)
理论证明:我们通过公式推导证明当偏好预算在模型m和样本s之间构成的三元对 上均匀分配时,能够最大程度减少采样偏差,从而使评分估计误差最小化。CBE依赖采样结果,通常通过Elo Rating System等聚合方案来计算胜率矩阵。团队通过公式推导认为:在全局层面稳定胜率矩阵不确定性的下降过程,能够有效加速评测结果的收敛过程。其中,不确定性矩阵 处的元素计算公式为: 为在采样L次时对于胜率矩阵的无偏估计, 为第 次采样结果。当新模型 加入评估池时,由于采样数据稀疏导致评估结果存在较高不确定性。传统方法针对此场景缺少额外的应对措施与约束,导致采样资源难以迅速倾斜来加速新模型评估进程,损害了评估架构的可扩展性。以上三个问题构成CBE方法的根本性挑战:采样偏差破坏评估准确性,不确定性下降失衡阻碍快速收敛,资源分配失焦限制扩展能力。研究团队通过理论推导发现:这三个问题本质都与“均匀性”密切相关。就像体育联赛需要公平赛程安排才能准确排名,模型评估也需要在组合采样、不确定性下降、资源分配三个维度实现动态均衡。UniCBE 的核心创新在于针对准确性、收敛性、可扩展性,构建三个动态调整的采样概率矩阵:偏差抑制矩阵
通过哈达玛积(Hadamard Product)集成以上三矩阵: 归一化后形成全局采样概率分布,来统一优化采样的准确性、收敛性和可扩展性。在得到联合优化采样矩阵的基础上,我们进一步考虑如下采样策略:下图展示了以 GPT4-turbo 作为评判者时,不同 CBE 方法在 AlpacaEval 基准上的对比结果。为了更好地展示结果,我们还计算了各方法在达到相同性能时相较于Random 基线所节省的偏好预算百分比。在性能排序上,AlpacaEval<Random<Arena<UniCBE。为了理解各方法的性能差异,我们基于第二节总结的原则进行了定量分析。为实现准确性、收敛性和可扩展性,偏好预算的分配需要满足三个维度的均匀性:元组间的均匀性、模型对胜率不确定性的均匀性以及模型间的均匀性。我们通过计算各方法分配结果与各目标对应的理想均匀向量之间的余弦相似度来衡量这些属性,如下表所示:AlpacaEval 在元组选择中固定包含参考模型的设计破坏了多方面的均匀性,导致其值较低且性能显著落后。Arena 和 Random 分别通过提升不确定性均衡和抑制采样偏差,实现了更高的和值。而 UniCBE 遵循我们的原则,同步优化了三者,在胜率误差(Δ)值接近 0.01 的情况下相比 Random 节省了超过 17% 的采样预算,展现了更优的准确性与收敛性。为分析可扩展性,我们设计了一个包含11个待评估模型的初始场景,并设定每进行2000次采样后依次新增模型的实验条件。如下图所示,每当引入新模型时,UniCBE能够通过自适应地倾斜偏好预算分配迅速稳定新模型的性能评估,相比Random基线节省超过50%的预算。而Arena和Random由于未将可扩展性纳入优化目标,表现出较差的扩展适应性。值得注意的是,尽管AlpacaEval对参考模型的预算分配显著多于其他模型,但自动向新增模型分配预算的策略仍使其具备良好的扩展能力。如下图所示,在多个聚合策略下,我们系统验证了我们所提出的多个优化目标和采样策略的有效性。除 GPT-4o 外,我们还测试了 GPT-3.5-turbo 和 Qwen-Plus 作为 AlpacaEval 的评估模型,以及人类为 MT-Bench 提供的评估信号。如下图上半部分所示:当使用 GPT-3.5-turbo 时,整体结论与 GPT-4o 基本一致,但存在两点差异:(1) Arena 方法的性能不再优于 Random;(2) 所有方法的性能均出现一定程度的下降,这可能源于 GPT-3.5-turbo 提供的偏好判断存在更高噪声,导致收敛速度减缓。如下图所示,我们通过改变模型数量M和采样次数N进行实验验证。可以发现,在不同参数设置下 UniCBE 相较基线方法均取得显著优势,尤其在M和N较大时优势更为突出。UniCBE 同样适用于列表式偏好场景 (每次为多于两个模型进行偏好排序)。假设评判者每次对K个模型提供偏好排序,我们可以推导出K(K-1)/2对两两偏好关系。下图展示了K=3时的实验结果。在此设置下,UniCBE 相比 Random 实现了超过 30% 的预算节省。这种现象可能源于:列表式偏好产生的对两两偏好集中于K个模型之间,加剧了采样偏差。因此,在列表式偏好场景下更需 UniCBE 来抑制这种偏差效应。针对当前基于比较的评估方法因优化目标受限的问题,团队通过系统分析发现,提升对比基准评估效果的关键在于三重优化:缓解采样偏差、均衡不确定性下降过程、抑制更新不确定性。基于此,我们提出了 UniCBE 框架,通过促进多维度均衡分布实现上述目标的联合优化,从而提升评估的准确性、收敛速度与可扩展性。系统性实验验证了该框架在评估效能上提升显著(较基线方法最高节省 30% 预算),同时展现出优越的模型扩展适应能力(新增模型评估效率提升 50%)及跨评判者场景的稳定泛化性能。论文地址:https://arxiv.org/pdf/2502.11454现博士就读于北京理工大学,小红书社区搜索组实习生。在 NeurIPS、ICLR、ACL、EMNLP、AAAI 等机器学习、自然语言处理领域顶级会议上发表十余篇一作论文,主要研究方向为语言模型评测与推理。现负责小红书社区搜索精排LTR、先验满意度、大模型qd标注/answer后验RLHF,曾负责个性化和长冷向量召回。兼职北京理工大学校外博导,在 ICLR、NeurIPS、AAAI、ACL、EMNLP 等机器学习、自然语言处理领域顶级会议上发表数篇论文,主要研究方向大模型推理/评测/蒸馏、对话系统、搜索系统。小红书社区搜索算法工程师(全职 / 实习)
岗位职责:
1、对小红书搜索效果进行优化,包括搜索算法和策略的调研、设计、开发、评估等环节,提升用户体验;
2、发现并解决搜索场景中在查询分析、意图识别、向量召回、排序模型、去重等方向的问题;
3、解决小红书搜索实际问题,更好地满足用户的搜索需求;
4、跟进业内搜索相关模型和算法的前沿进展,并在实际业务中进行合理应用。
任职资格:
1、本科及以上学历,计算机相关专业背景;
2、有搜索、推荐、广告、图像识别等相关背景优先;
3、熟悉机器学习、NLP、数据挖掘、知识工程的经典算法,并能在业务中灵活解决实际问题;
4、在国际顶级会议(KDD、SIGIR、WSDM、ICLR、NeurIPS、ICML、ACL、EMNLP 等)以第一作者发表过高水平论文者、知名数据挖掘比赛(例如 KDD Cup 等)中取得领先名次者优先;
5、积极向上,踏实勤奋,自我驱动,善于沟通,解决问题优先。
欢迎感兴趣的同学发送简历至:
[email protected]、[email protected]
添加小助手,了解更多内容
微信号 / REDtech01