NeurIPS 2025 | TANDEM:基于双层优化的数据配比学习方法
本文入选顶会NeurIPS 2025
大模型的能力极大地依赖于不同来源数据/任务的组合配置: SlimPajama
The Pile Natural Instruction 传统方法依赖人工经验和试错来确定最优的数据混合比例(如Llama),成本高、耗时长且容易陷入次优。自动化确定最优数据配置的方法研究仍非常欠缺。 优化不同任务/来源样本分配,根据不同来源数据的学习难度、收敛状态以及对整体泛化能力的贡献,自动化组织训练数据,最大化模型的综合能力。
2.1 基于双层优化的数据配比方法
2.2 使用孪生网络求解双层优化
在当前数据配比α下,在训练集上训练代理模型u K步。 在同样的数据配比下,在训练集和验证集上训练参考模型w K步。 用二者在每个领域数据上的损失差来更新数据混合比例:该损失差代表了增加额外验证数据能够带来的额外收益。损失差大的领域说明增加额外数据带来的收益大,其配比应该增加,反之则应该减少。 训练过程包含同源的代理模型u和参考模型w的交互,因此本方法被命名为TANDEM(双人自行车)。数据混合比例学习完成后,根据学到的比例重新构造训练数据,并训练模型。
2.3 理论保障: 收敛性分析
2.4 与已有数据配比方法对比
2.5 更多讨论--什么情况下数据配比调整更有效果?
3.1 通用任务上的实验效果
3.2 京东商品理解任务的实验效果:
电商平台涵盖海量商品理解任务,如判别(同品识别)、抽取(产品词识别,属性识别,品牌,型号识别)等。构建统一的商品理解模型是降低维护成本强化模型泛化能力的有效方案。TANDEM方法应用于京东商品理解模型训练,取得了超过默认数据配比的效果。
参考文献:
[1] SM. Xie et.al. DoReMi: Optimizing Data Mixtures Speeds Up Language Model Pretraining. NeurIPS 2023.
[2] S. Fan et.al. DoGE: Domain Reweighting with Generalization Estimation. ICML 2024.
[3] J. Wang et.al. TANDEM: Bi-level Data Mixture Optimization with Twin Networks. NeurIPS 2025.