基于DPO多目标优化:京东生成式推荐的探索与实践 | 京东零售技术实践
a)商品离散化
b)行为序列建模
a)背景知识
PPO in InstructGPT
DPO
引入BT/PL model
Bradley-Terry[4]
Plackett-Luce[5]
怎么定义r∗呢
对PPO求解
将r(x,y)带入BT/PL模型
Softmax-DPO
multi-negatives
损失函数
gradient comparison
β-DPO
β矫正
β样本过滤
b)数据构造
| 点击测试集hit@1 | 转化测试集hit@1 | |
c)目标函数调整
| 点击测试集 hit@1 | 转化测试集 hit@1 | |
| uctr | uctr | |
更多有关生成式推荐的应用实践
技术为本 让生活更美好