多场景多任务学习在美团到店餐饮推荐的实践
- 1. 背景
- 2. 层次化信息抽取网络
- 2.1 问题定义
- 2.2 方法介绍
- 2.3 训练目标
- 3. 实验
- 3.1 实验设置
- 3.2 性能比较
- 3.3 消融研究
- 3.4 在线A/B测试
- 4. 总结与展望
1. 背景
随着网络信息和服务的爆炸式增长,推荐系统已经成为为用户提供高质量个性化决策建议和体验的关键组件。传统的推荐系统,模型服务通常需要为特定场景单独进行定制化的开发,以适配不同场景下数据分布和特征空间的差异。然而在美团等工业互联网平台中通常存在多种多样的推荐场景( 例如首页信息流、垂类子频道等 )作用于用户访问的决策链路,同时基于每个场景的个性化推荐模型再对展示项目进行排序最终呈现给用户。 在美团到店餐饮( 以下简称到餐 )平台中,伴随业务精细化的发展趋势,越来越多的场景需要对推荐系统进行定制化的建设,以满足用户到店就餐的个性化需求。如下图1所示,现实中用户往往会在多个不同场景之间进行浏览、点击,并最终成交。2. 层次化信息抽取网络
| 2.1 问题定义
如上所述,我们主要关注的是多场景多任务推荐的优化问题。我们将该问题定义为: ,其中 表示第 个场景指示, 是第 个场景下任务 的预估值, 表示输入的稠密特征。 原始的特征输入中主要包括了用户画像特征、用户行为特征、当前场景特有特征和商品特征,其中的数值特征首先被转化为分类特征,然后将所有分类特征映射到低维向量空间来获得 。考虑到美团到餐平台中具体的优化目标,我们分别为每个场景设置了CTR和CTCVR两个任务。| 2.2 方法介绍
本小节将展开介绍层次化信息抽取网络模型HiNet。如下图2-(A)所示,HiNet模型中主要包括场景抽取层和任务抽取层两个核心模块。其中在场景抽取层主要包括了场景共享专家( Scenario-shared expert )模块、当前 场景特有专家 (Scenario-specific expert )模块以及场景感知注意力网络,通过这三部分的信息抽取,最终形成了场景层次的信息表征;而在任务抽取层中,我们使用自定义门控网络模块CGC( Customized Gate Control )来对当前场景的多任务学习进行建模。下文将详细介绍上述提到的HiNet模型的关键部分。2.2.1 场景抽取层(Scenario Extraction Layer)
场景抽取层的作用是提取场景特有的信息表征和场景间共享的有价值信息表征,这是提高任务层次信息表征能力的基础。在场景抽取层,主要包括场景共享专家网络、场景特有专家网络和场景感知注意力网络三部分,下文将依次进行介绍。 1. 场景共享/特有专家网络 考虑到用户跨场景的穿插式行为以及多个场景间商品重叠的现象,到餐业务中多个场景的数据之间存在着有价值的共享信息。因此在策略上,我们设计了场景共享专家网络。这里受到混合专家网络架构MoE( Mixture of Expert )的影响,场景共享专家网络是通过使用子专家集成模块SEI( Sub-Expert Integration module,如图2-(C) )生成的。 具体来说,场景共享专家网络的最终输出为 ,其公式为: 其中, 表示第 个子专家网络,该网络是由多层感知器( Multilayer perceptron,MLP )和激活函数组成, 表示子专家网络 的数量, 表示门控网络的输出,它是通过带有Softmax激活函数的简单线性变换得到: 除了使用场景共享专家网络提取不同场景间的共享信息,我们还为每个场景分别设计了场景特有专家网络来学习场景特有的信息,该网络也是由SEI模块组成。具体地,第 个场景的场景特有专家网络的输出 表示如下: 其中 表示第 个子专家网络, 是 的数量, 表示场景特有专家网络所对应的门控网络的输出。 2. 场景感知注意力网络 如上文所述,不同场景之间存在一定程度的相关性,因此来自其他场景的信息也可以对当前场景的信息表征做出贡献,从而增强当前场景的信息表达能力。考虑到不同场景间对彼此的表征能力贡献不同,我们设计了场景感知注意力网络( Scenario-aware Attentive Network,SAN )来衡量其他场景信息对当前场景信息表征贡献的重要性。具体来说,SAN包含两部分输入: a. 场景指示 生成的嵌入向量 ,该向量通过带有Softmax函数的门控网络后可以计算出其他场景对当前场景信息表征的重要性权重。b. , 对应了一系列其他场景生成的信息表示。 通过SAN模块计算的第 个场景的输出 是场景表示 的加权和: 其中 表示场景指示投影为嵌入向量, 表示基于权重 的门控网络, 表示 的维数, 是场景的个数。 通过SAN模块可以根据复杂的场景相关性不同程度地传递跨场景信息,有效地增强了场景的表示学习,从而提高了HiNet模型的性能。 综上所述,场景抽取层的整体输出 可以表示为: 2.2.2 任务抽取层(Task Extraction Layer)为了解决多任务学习中的负迁移问题,在任务抽取层,我们受到PLE( Progressive Layered Extraction )模型的启发,采用了自定义门控网络CGC模块。 自定义门控网络 自定义门控网络主要由两部分组成:任务共享专家网络和任务特有专家网络。前者主要负责学习当前场景中所有任务中的共享信息,后者用于提取当前场景中各个任务的特有信息。 类似地,该结构通过门控网络计算所有专家网络的加权和作为输出。此外,为了避免不同场景之间的任务互相干扰,场景抽取层中第 个场景的输出 将被输入到特定场景的CGC模块中。最终,第 场景中任务 的塔单元输入 如下: 其中, 和 分别表示在第 个场景中任务共享专家网络和任务 的特有专家网络的集合。 是一个门控网络,通过线性变换层和Softmax层来计算第 场景的任务 的权重向量: 其中, 是参数矩阵, 和 分别是 和 的维度, 是 的维数。 最后,在第 个场景下任务 的预测值可表示为: 其中, 表示第 个场景下任务 的塔单元,由具有激活函数的MLP组成。
| 2.3 训练目标
我们提出的HiNet的最终损失函数是: 其中, 表示第个 场景下的任务数, 是控制不同损失比例的超参数。3. 实验
| 3.1 实验设置
1. 数据收集 :我们收集了美团到餐平台中的六个场景( 场景编号为 到 ) 的用户日志数据作为我们的多场景多任务训练和评估数据集,其中场景 和 是大场景数据集。相比之下, 到 被作为小场景数据集。- Shared Bottom:该模型是一个具有硬参数共享的神经网络模型。
- MMoE:该方法使用灵活的门控网络调整专家网络表示信息,并最终使用塔单元融合每个任务的所有专家网络表示信息。
-
PLE:该模型基于MMoE,将专家网络显式划分为任务共享专家和任务特有专家,有效缓解了“跷跷板”现象带来的负迁移问题。
- HMoE:该方法由MMoE改进而来,对多个场景的预测值进行建模,并针对当前场景优化任务预测结果。
-
STAR:该方法通过星型拓扑结构构造一个共享的和场景特有的网络,用于学习当前场景的信息表征。
| 3.2 性能比较
| 3.3 消融研究
为了研究HiNet模型中每个关键组件的效果,我们设计了两个HiNet模型的变体用于消融分析。具体如下:- HiNet( w/o hierarchy ):表示去掉了信息抽取的层级架构,直接采用CGC网络进行多场景多任务学习建模。
- HiNet( w/o SAN ):表示的是在场景抽取层中删除SAN模块后的HiNet模型。
| 3.4 在线A/B测试
为了进一步验证我们提出的HiNet模型的在线性能,我们在美团到餐平台中的场景 和 中部署了HiNet模型,并与基线模型进行了为期一个月的在线A/B测试。4. 总结与展望
多场景多任务建模是目前推荐系统中最关键和最具挑战性的问题之一。以往的模型主要通过将所有信息投影到同一个特征空间来优化不同场景下的多个任务,这导致模型性能存在不足。 在本文中,我们提出了层次化信息抽取网络HiNet模型,它利用分层优化架构对多场景多任务问题进行建模。在此基础上,我们在场景抽取层设计了场景感知注意力网络模块SAN来增强场景的表示学习能力。离线和在线A/B测试实验都验证了HiNet模型的优越性。 值得一提的是,目前业界已经出现了大量的图神经网络在推荐模型上的应用。受此启发,在未来的工作中,美团到餐算法团队将图神经网络的信息传递能力结合到多场景多任务学习建模的方案中,继续实践我们的方法,并进一步设计更加完善的模型,来解决在美团到餐平台中存在的复杂的多场景多任务建模问题。作者简介
周杰、先帅、文豪、薄琳、张琨等,均来自美团到店/平台技术部。参考文献
[1] P. Li, R. Li, Q. Da, A.-X. Zeng, and L. Zhang, “Improving multi-scenario learning to rank in e-commerce by exploiting task relationships in the label space,” in Proceedings of the 29th ACM International Conference on * Information & Knowledge Management (CIKM), 2020, pp. 2605–2612. [2] X.-R. Sheng, L. Zhao, G. Zhou, X. Ding, B. Dai, Q. Luo, S. Yang, J. Lv, C. Zhang, H. Deng et al., “One model to serve all: Star topology adaptive recommender for multi-domain ctr prediction,” in Proceedings of the 30th * ACM International Conference on Information & Knowledge Management (CIKM), 2021, pp. 4104–4113. [3] J. Ma, Z. Zhao, X. Yi, J. Chen, L. Hong, and E. H. Chi, “Modeling task relationships in multi-task learning with multi-gate mixture-of-experts,” in Proceedings of the 24th ACM SIGKDD international conference on * knowledge discovery & data mining (SIGKDD), 2018, pp. 1930–1939. [4] H. Tang, J. Liu, M. Zhao, and X. Gong, “Progressive layered extraction (ple): A novel multi-task learning (mtl) model for personalized recommendations,” in Proceedings of the 14th ACM Conference on Recommender Systems (RecSys), 2020, pp. 269–278. [5] L. Torrey and J. Shavlik, “Transfer learning,” in Handbook of research on machine learning applications and trends: algorithms, methods, and techniques. IGI global, 2010, pp. 242–264. [6] S. J. Pan and Q. Yang, “A survey on transfer learning,” IEEE Transactions on Knowledge and Data Engineering, vol. 22, no. 10, pp. 1345–1359, 2010. [7] F. Zhu, Y. Wang, C. Chen, J. Zhou, L. Li, and G. Liu, “Cross-domain recommendation: challenges, progress, and prospects,” in 30th International Joint Conference on Artificial Intelligence (IJCAI). International Joint * Conferences on Artificial Intelligence, 2021, pp. 4721–4728. [8] Y. Zhang and Q. Yang, “A survey on multi-task learning,” IEEE Transactions on Knowledge and Data Engineering, 2021. [9] S. Ruder, “An overview of multi-task learning in deep neural networks,” arXiv preprint arXiv:1706.05098, 2017. [10] O. Sener and V. Koltun, “Multi-task learning as multi-objective optimization,” in Thirty-second Conference on Neural Information Processing Systems (NeurIPS), 2018. [11] C. Rosenbaum, T. Klinger, and M. Riemer, “Routing networks: Adaptive selection of non-linear functions for multi-task learning,” in International Conference on Learning Representations (ICLR), 2018. [12] J. Wang, S. C. Hoi, P. Zhao, and Z.-Y. Liu, “Online multi-task collaborative filtering for on-the-fly recommender systems,” in Proceedings of the 7th ACM conference on Recommender systems (RecSys), 2013, pp. 237–244. [13] R. Caruana, “Multitask learning,” Machine learning, vol. 28, no. 1, pp. 41–75, 1997. [14] K. Weiss, T. M. Khoshgoftaar, and D. Wang, “A survey of transfer learning,” Journal of Big data, vol. 3, no. 1, pp. 1–40, 2016. [15] N. Shazeer, A. Mirhoseini, K. Maziarz, A. Davis, Q. Le, G. Hinton, and J. Dean, “Outrageously large neural networks: The sparsely-gated mixture-of-experts layer,” arXiv preprint arXiv:1701.06538, 2017. [16] D. Eigen, M. Ranzato, and I. Sutskever, “Learning factored representations in a deep mixture of experts,” Computer Science, 2013. [17] M. I. Jordan and R. A. Jacobs, “Hierarchical mixtures of experts and the em algorithm,” Neural computation, vol. 6, no. 2, pp. 181–214, 1994. [18] R. A. Jacobs, M. I. Jordan, S. J. Nowlan, and G. E. Hinton, “Adaptive mixtures of local experts,” Neural computation, vol. 3, no. 1, pp. 79–87, 1991. [19] S. E. Yuksel, J. N. Wilson, and P. D. Gader, “Twenty years of mixture of experts,” IEEE transactions on neural networks and learning systems, vol. 23, no. 8, pp. 1177–1193, 2012. [20] Y. Zhang, C. Li, I. W. Tsang, H. Xu, L. Duan, H. Yin, W. Li, and J. Shao, “Diverse preference augmentation with multiple domains for cold-start recommendations,” in IEEE International Conference on Data Engineering (ICDE), 2022.---------- END ---------- 美团科研合作 美团科研合作致力于搭建美团技术团队与高校、科研机构、智库的合作桥梁和平台,依托美团丰富的业务场景、数据资源和真实的产业问题,开放创新,汇聚向上的力量,围绕机器人、人工智能、大数据、物联网、无人驾驶、运筹优化等领域,共同探索前沿科技和产业焦点宏观问题,促进产学研合作交流和成果转化,推动优秀人才培养。面向未来,我们期待能与更多高校和科研院所的老师和同学们进行合作。欢迎老师和同学们发送邮件至: [email protected] 。
推荐阅读
| 美团综合业务推荐系统的质量模型及实践 | 大规模异构图召回在美团到店推荐广告的应用 | KDD 2021|美团联合多高校提出多任务学习模型,已应用于联名卡获客场景