ACL 2025 | 效率最高提升300倍:TailoredBench实现大模型定制化高效评估
定制化高效评测技术迎来关键突破。小红书搜索团队最新论文《Beyond One-Size-Fits-All: Tailored Benchmarks for Efficient Evaluation》提出 TailoredBench 框架,协同提升大模型评估的效率、精度与跨模态稳健性,树立评测新范式。
传统高效评测方法依赖源模型预测构建固定的Benchmark子集,默认待评测的目标模型与源模型集合高度一致,难以应对真实场景中的分布偏移,导致表现估计失真。TailoredBench基于实证揭示这一局限,并提出四步式高效评估流程:先以Global-set (G-set)探针捕获目标模型的预测特征,再为目标模型适应选择高一致性“专属”源模型,随后用可扩展的K-Medoids算法生成目标模型专属的N-set精简评测集,最后通过校准估计还原目标模型在Benchmark上的全量表现,实现针对性的精准、低消耗评估。
实验结果表明,在5个自然语言和多模态Benchmark以及300+模型的实测中,TailoredBench在相同的推理预算(20–40条)条件下,平均将MAE降低了31.4%。在Kendall's 评估指标上,其表现也显著优于多种主流方法。论文实验中,在实现最高约300倍效率提升的情况下,TailoredBench充分展现了其高效性与良好的通用性。
论文标题:
Scalable Overload-Aware Graph-Based Index Construction for 10-Billion-Scale Vector Similarity Search
论文地址:
https://arxiv.org/abs/2502.20695
随着LLM发展和迭代不断加快,在已有Benchmark上对LLM进行测评已经变成了迭代中的瓶颈之一,目前对LLM的测评存在如下两个挑战:
1.1 评测成本高昂,模型迭代受限
业界通用的HELM Benchmark涵盖 50 + 任务、上万道题目。文献统计显示,若要在 HELM 上完整评测一款 10B参数的语言模型,一次性就要支付约 1,700 美元的 API 费用,或消耗超过 1,200 GPU小时;如果在模型研发过程中反复微调和回归测试,开销将按迭代次数呈倍数累计。
1.2 静态子集假设失效,表现估计失真
现有高效评测方法通常先依赖一组源模型的预测结果聚类,提取固定的“代表样本集”(coreset),再以目标模型在该子集上的得分推估其全量表现。但源模型与目标模型的预测分布往往存在显著偏移:如 Fig. 1 所示,在 Hellaswag 数据集上,当用目标模型嵌入重新聚类时,基于源模型嵌入聚类的Benchmark簇内距离显著增大,表示静态coreset已无法精准表现数据分布,最终导致对目标模型表现的估计失真、模型排名错位。
2.1 方法目标
给定完整Benchamrk,已公开预测结果的源模型集合以及待评估的目标模型集合,目标是在尽量少的推理次数下,估计每个在全量上的表现并获得可靠的能力排名。方法流程如Fig. 2所示。
2.2 构建全局探针集G-set
目标:用极少量样本刻画所有源模型的主要预测模式,为后续度量“目标模型-源模型相似度”提供参考。
1.基于源模型的预测结果构造Benchmark中每个数据点的全局表示:
其中的表示源模型在数据点上的正确性 correctness (该值可以为连续值或离散的0/1).
2.基于K-Medoids聚类获取探针集:
2.3 获取专属源模型集合
目标:为每个目标模型动态挑选与其预测分布最相似的专属源模型集用于后续预测,减小分布偏移。
1.构造源模型与目标模型在全局探针集上的表示:
2. 全局阈值法选专属源模型:
全局阈值确定:
全局阈值的源模型挑选:
其中的Dis为曼哈顿距离(下同)。
2.4 生成专属评测子集
目标:基于专属源模型集构造数据点表示,使用可扩展K-medoid方法对进行再次聚类,为每个目标模型选出约 20-40 条代表样本,连同探针集一起构成专属的评测子集。
可扩展K-medoid方法流程如下:
的中点保持不变,只更新其他点,直至所有中点不再变化;
2.5 效果校准还原
目标:利用每个目标模型与所有源模型在上的少量预测结果校准恢复其在整个Benchmark上的结果
其中表示属于的数据点,表示其余数据点。
2. 校准并还原目标模型在整个Benchmark上的表现:
3.1 方法效果
下表展示了 TailoredBench 方法与三个基线方法(Random、AnchorPoints 和 GP-IRT)在五个单/多模态Benchmark(ARC Challenge、Hellaswag、GSM8K、Winogrande 和 POPE)上,对目标模型集合的排名效果及其绝对性能评估的对比结果。从表中可以看出,在设置 G-set 为 10、总推理次数在 20 至 40 的范围内时,TailoredBench 在模型间排名估计与模型绝对性能估计两个方面均显著、持续地优于各基线方法。其中,在包含 6000 个样本的 HellaSwag 数据集上,方法在仅使用 20 个数据点的条件下依然取得了出色的表现,相当于实现了约 300 倍的推理效率提升。
3.2 消融实验
距离度量选择
消融实验对比了相关系数、余弦距离和曼哈顿距离三种相似度度量在五个基准数据集上的表现。结果表明,整体而言,曼哈顿距离在所有数据集上平均获得了最高的 Kendall's分数和最低的 MAE 分数。这一结果表明,逐元素距离能够同时捕捉连续性与离散性方面的正确性差异,因而最适用于本任务。结果如下表所示:
校准估计策略
在保持其他步骤不变的前提下,只停用最后的校准策略,整体的Kendall's平均下降约0.016,MAE 上升 0.003;加入校准后,五个数据集全部实现更低误差与更高排名一致性,验证了簇内比例校正对恢复全量得分的必要性。结果如下表所示:
3.3 方法分析实验
专属源模型数量与一致性对方法性能的影响
当选取的专属源模型与目标模型保持相同的一致性水平时,随着模型数量从总数的20%增加到100%,评估性能持续提升,因为更多模型提供了更丰富、更稳定的预测特征(图3a)。另一方面,在固定模型数量的情况下,提高专属源模型与目标模型之间的预测一致性也能显著改善性能——当一致性越高(从20%~40%区间到80%~100%区间)时,性能优劣差距越明显(图3b),说明一致性是维持评估准确性的关键因素。
TailoredBench的自适应最优专属源模型选择
TailoredBench依据目标模型与各源模型的全局一致性阈值,自适应地为每个目标模型选取最优规模的专属源模型集,从而在该基准上几乎达到全局最优,显著优于固定选取策略。如下图所示,在GSM8K数据集上,方法自适应地选择了与目标模型最为相近的40个专属源模型,达到了接近最优的效果。
探针集规模探究
把 G-set 从 5 扩到 25 条,方法性能先升后降:10 条样本时平均Kendall's 达峰值 0.740、MAE 最低 0.027;G-set规模过大会稀释 N-set 代表性,过小则难以捕获源-目标目标差异,这佐证了论文中“10 例探针足矣”的设定。整体结果如下表所示:
推理预算扩展效果分析
在 Hellaswag 将推理样本数从 50 增至 150 时,TailoredBench 的Kendall's 由 0.923 升至 0.943、MAE 由 0.016 降至 0.012,且始终领先次佳基线 ,表明方法在更充裕预算下仍能持续收敛,而非被动依赖“小样本”场景。整体效果如下表所示:
面对LLM评测成本飙升和静态压缩集评测方法分布偏移这两大评测痛点,本研究从目标模型视角出发,重新设计了评测流程:用少量探针快速刻画差异、以匹配源模型缩小估计误差、再借助可扩展K-medoid方法与簇内校准把数十条预测外推到整套 Benchmark。通过这条 “探针-匹配-缩减-校准” 链路,TailoredBench 将评测开销压缩到 1%~2 %左右,同时在五项公开基准与 300 余个模型上的效果持续显著超过已有方法。并且,当新模型持续接入或预算上限变化时,框架无需重跑全量评测即可动态更新估计,为大模型快速迭代提供了可扩展、可负担且可信赖的新范式。
袁沛文
现博士就读于北京理工大学,小红书社区搜索组实习生。在 NeurIPS、ICLR、ACL、EMNLP、AAAI 等机器学习、自然语言处理领域顶级会议上发表十余篇一作论文,主要研究方向为语言模型评测与推理。
张岳琪
现博士就读于北京理工大学,小红书交易算法组实习生。在ACL会议上发表一篇论文,主要研究方向为语言模型评测与推理。
冯少雄
现负责小红书社区搜索机制和垂类。曾负责个性化和长冷向量召回、大模型满意度标注/答案生成(基于后验行为RLHF)。兼职北京理工大学校外博导,在 ICLR、NeurIPS、AAAI、ACL、EMNLP 等机器学习、自然语言处理领域顶级会议上发表多篇论文,主要研究方向大模型推理/评测/蒸馏、生成式检索、开放域对话生成。
小红书社区搜索算法工程师(全职 / 实习)
【岗位职责】
1、对小红书搜索效果进行优化,包括搜索算法和策略的调研、设计、开发、评估等环节,提升用户体验;
2、发现并解决搜索场景中在查询分析、意图识别、向量召回、排序模型、去重等方向的问题;
3、解决小红书搜索实际问题,更好地满足用户的搜索需求;
4、跟进业内搜索相关模型和算法的前沿进展,并在实际业务中进行合理应用。
【任职资格】
1、本科及以上学历,计算机相关专业背景;
2、有搜索、推荐、广告、图像识别等相关背景优先;
3、熟悉机器学习、NLP、数据挖掘、知识工程的经典算法,并能在业务中灵活解决实际问题;
4、在国际顶级会议(KDD、SIGIR、WSDM、ICLR、NeurIPS、ICML、ACL、EMNLP 等)以第一作者发表过高水平论文者、知名数据挖掘比赛(例如 KDD Cup 等)中取得领先名次者优先;
5、积极向上,踏实勤奋,自我驱动,善于沟通,解决问题优先。
欢迎感兴趣的同学发送简历至 [email protected],
并抄送至