小红书信息流推荐多样性解决方案
摘要
来自小红书的研究者在多样化推荐中,从用户体验和系统应用的视角出发,提出了一种滑动频谱分解(SSD)的方法,该方法可以捕捉用户在浏览长项目序列时对多样性的感知。通过理论分析、离线实验和在线 A/B 测试,验证了该方法的有效性。
背景
SSD
与SSD最相近的工作是DPP。DPP本是物理中用于描述粒子随机过程的概率框架,全程determinantal point process,基于体积来描述粒子的扩散程度(多样性)。回忆体积的物理意义,体积这一概念其实是无关乎顺序的。在基于DPP的多样化推荐中,是贪心求解过程赋予了顺序 [3],而SSD在Tensor构造中就引入了顺序这一概念,当Tensor退化成Matrix时即可得到DPP的结果,因此 SSD可以看做是DPP在序列推荐上的一种推广 。另一方面,在Diversity与Quality的组合上,SSD和DPP也有明显的不同,DPP延续了体积的概念,将Quality作为向量的boost系数,即体积中的因子来融合,而SSD更推荐用EE的组合方式,我们认为EE更符合用户的浏览诉求。除此之外,在窗口的处理上,DPP本身定义上不存在窗口的概念,因此在求解过程中会完全忽略掉窗口外的内容,这在长序列中是很不符合用户感知的,SSD通过Tensor的构造引入了体积的概念,虽然在原始定义上需要求解NP-hard的Tensor SVD,但我们在[1]中给出了一种近似的贪心求解, 最终的复杂度会优于基于DPP的工作 。
CB2CF
在多样性定义中,我们依赖于Item的向量表示来计算体积,向量之间两两之间的相似性需要能够符合用户对于多样性的感知,也需要考虑最开始我们提到的公平性。 有两种直观的思路来得到这些向量。 一是content-based方法,即我们构造一个基于图片和文字内容的监督任务,将监督模型的中间层结果作为向量表示。 二是基于协同过滤方法,即我们通过全体用户的交互历史,构造CF向量。
实验效果
参考文献
[1] Huang, Yanhua, et al. "Sliding Spectrum Decomposition for Diversified Recommendation." Proceedings of the 27th ACM SIGKDD Conference on Knowledge Discovery & Data Mining. 2021.
招聘信息
小红书目前在算法和工程上都有着很多有趣并富有挑战的问题。除了推荐多样性外,我们还在召回、排序、强化学习、图神经网络、CV、NLP等多个方向进行着持续探索和落地。 岗位职级、薪水open,base上海/北京。 欢迎感兴趣的朋友发送简历至: [email protected] 并抄送至: [email protected] [email protected]
惊喜彩蛋
论文太艰深读不透怎么办?专家带你一起看。
关注小红书技术团队公众号,回复关键词『 KDD21论文 』,即可获得由【小红书基础模型团队负责人王树森】批注的论文全文,围观技术专家如何阅读与解读论文~快戳👇