RecSys 2025 | 小红书推荐团队提出视频时长预估新方法:EGMN
小红书推荐算法团队提出基于指数-高斯先验分布的视频时长预估新方法EGMN,入选 RecSys 2025,并获得Best Paper Nomination。
论文标题:Multi-Granularity Distribution Modeling for Video Watch Time Prediction via Exponential-Gaussian Mixture Network
论文地址:https://arxiv.org/abs/2508.12665
作为中国领先的生活兴趣社区,小红书已经从 2015年的 5000万 MAU 增长到 2024年的 3.5亿 MAU 以上。在这个规模基础上,推荐系统预测模型的每一个小改进都会在用户体验和业务成果方面产生有意义的收益。而在所有反馈信号中,观看时长是一个至关重要的基础信号,它是衡量平台内容质量与用户满意度的关键指标,尤其在小红书视频单列场景中,观看时长信号是最为稠密的(覆盖率 100%)。在预估观看时长方面的精准和精细化,可以有效地提升留存和 DAU。
预估观看时长是大部分推荐场景都要面临的基础问题,也是经典的回归问题。对于回归问题而言,目标数据的分布是非常重要的,它很大程度上决定了回归任务的难度。然而我们都知道,短视频观看时长的分布是复杂的,这也使得传统的值回归难以取得好的效果。针对这个问题,很多已有的方法往往通过目标转化的方式(归一化、离散化等等)来规避掉直接建模复杂分布带来的挑战,却也不可避免地造成信息失真或者引入额外误差。
我们选择直面这个挑战,为此我们对小红书的短视频观看时长数据分布做了全面分析,发现主要有以下几个特点:
从整体维度来看,几秒内快速跳过的行为大量聚集。
从 duration 维度来看,观看时长在各自 duration 分桶内呈现双峰分布。
从用户视角来看,不同用户存在显著差异。一些用户非常挑剔,快速跳过去找感兴趣的视频;一些用户更加宽容,倾向于以更大的耐心观看每个系统推荐的视频。
从视频视角来看,情况更为复杂,快速跳过、中间跳出、完播、重播等等行为,构成了形状各异的多峰分布。
通过对上述特点的总结,我们得出短视频观看时长预估面临以下两个核心挑战:
粗粒度的偏态性:由大量快速跳过行为引起,使得数据整体而言非常右偏。
细粒度的多样性:由各种用户视频交互模式引起,大大增加了预测的复杂性。
2.1 先验概率假设
据此,我们提出 Exponential-Gaussian Mixture(EGM)分布作为观看时长的生成假设:用指数分布刻画“快速滑过”带来的偏斜,用高斯混合刻画细粒度的多样性。具体地,给定特征向量 ,我们假设该样本对应的播放时长分布服从一个指数分布和 个高斯分布组成的混合概率分布,概率密度公式如下:
为避免混合分布中高斯分布和指数分布的“混淆”现象,并使指数项专注于“零附近的偏斜密度”,我们在上述假设的基础上约束高斯均值大于指数均值:
2.2 概率模型参数化
在上述先验概率假设下,我们尝试使用神经网络来对EGM分布进行参数化,来对混合分布中的各个子分布以及权重进行拟合,整体为“共享编码器 + 多头参数生成 + 门控混合”的架构:
2.2.1 隐表示编码器
模型输入:用户特征、视频特征、上下文特征,经嵌入后拼接为向量 。
通过特征交叉Backbone得到共享隐式表征:
Backbone 可选:DCN、DIN、SENet、Transformer、MMoE/PLE 等,EGMN 与之解耦。
2.2.2 混合分布参数生成器
指数分布指数率生成,通过 softplus 激活函数确保正值:
高斯分布均值生成,通过如下公式保证高斯分布均值大于指数分布均值:
高斯分布方差生成:
混合权重生成,通过 softmax 进行归一化:
2.3 训练目标
采用“分布拟合 + 去塌陷 + 值回归”的三目标联合优化:
通过极大似然函数来进行分布拟合(MLE):
熵正则损失,防止权重塌到单一成分,让模型尽量激活更多的子分布:
回归损失,对混合分布的期望与真实 label 进行直接进行回归优化,在分布拟合的同时进行单点拟合:
总损失:
经验上,该组合既保证了分布刻画能力(MLE)、避免组件塌陷(熵正则)、又兼顾业务所需的数值精度(回归)。
2.4 推理与策略衍生
标准预测:输出条件期望 。
置信与分位数:通过混合分布 CDF 做数值反解获得分位数;或给出区间概率。
快速滑过识别:根据预估的概率密度分布直接计算快速滑过行为概率 。
3.1 实验设置
3.1.1 数据集
Indust:951,870 交互,25,947 用户,7155 视频。
KuaiRec:12,530,806 交互,7176 用户,10,728 视频
WeChat:7,310,108 交互,20,000 用户,96,418 视频。
CIKM:搜索会话时长数据,310,302 sessions,122,991 items(验证可迁移性)。
3.1.2 对比方法
VR(直接回归)、TPM(树分解序回归)、D2Q(分位数去时长偏)、CREAD(分类-重构,误差自适应离散)、D2CO(去偏+降噪)。
统一 Backbone 与特征处理,公平对比。
3.1.3 评价指标
MAE:绝对误差
XAUC:成对排序一致性
KL:预测分布与真实分布的 KL 散度(线上校准评估)
3.1.4 训练与实现
嵌入维度 16、学习率 0.1、batch size 2048、Adagrad。
EGMN 默认 ,高斯分量数不经精调即达优。
损失权重: 。
公共数据集用随机切分;工业数据离线用时间切分,线上实时流训练+部署。
3.2 离线实验
我们将 EGMN 模型与五种基线方法进行离线观看时长预测效果对比。如上表所示的主要实验结果表明:在四个数据集上,EGMN 模型的平均绝对误差(MAE)平均降低 14.11%,XAUC 指标平均提升7.76%,这证明该模型在跨平台观看时长预测任务中达到了最先进水平。具体对比表现次优的模型(主要为CREAD),EGMN 在 Indust 数据集上 MAE 降低6.75%、XAUC 提升5.09%;在 KuaiRec 上分别提升5.04%和 4.67%;在微信数据集上提升 1.72%和1.39%;在CIKM数据集上提升 2.42% 和 0.49%。其中 Indust 和微信数据集的提升最为显著,我们的模型在两项指标上均保持稳定进步,有力验证了 EGMN捕捉复杂特征以实现跨数据集精准观看时长预测的有效性。
值得注意的是,三个公开数据集采用随机划分策略,但是按照时序的数据划分方式对工业场景确保线上线下一致性至关重要,因此我们额外提供了公开数据集在时序划分下的结果:EGMN 在 KuaiRec 上以XAUC 提升1.77%和 MAE 降低 1.36%超越次优基线;在微信数据集上实现XAUC提升 2.41%和 MAE降低 1.23%;在 CIKM 上以 XAUC 提升 0.5%和MAE 显著降低 2.37%领先。结合上表数据可知,无论采用何种划分策略,EGMN 均能持续保持最先进性能。
3.3 在线实验
为深入验证 EGMN 的有效性,我们在小红书工业级短视频推荐系统中进行了为期 7天的线上 A/B 测试。将10%的真实流量分别分配至EGMN及现有基线模型CREAD(每组实验覆盖 1500万真实用户,确保结果可靠性)。该排序阶段的预测主干网络采用MMOE模型。上表左侧的线上 A/B 测试结果显示:相比CREAD,EGMN 显著提升用户观看时长0.681%且未对其他指标产生负面影响。此外,EGMN 在视频播放量指标上也实现 0.189% 的显著提升,这归因于其更精准匹配用户兴趣,从而有效提升用户参与度。
众所周知,相较无噪声的离线评估,线上准确性更能可靠衡量推荐系统模型的泛化能力。因此除用户参与度指标的 A/B 测试外,我们严格对比了 EGMN 与CREAD 的实时预测精度。如上表右侧所示,EGMN在 MAE 和 XAUC 指标上均显著优于 CREAD,与离线评估结论一致。进一步通过 KL 散度评估预测时长与实际分布的线上对齐程度:EGMN 较 CREAD 降低 KL 散度近 20%,表明其更逼近真实分布,直接验证了其在实时观看时长分布建模中的有效性。
3.4 快滑行为识别能力
为评估 EGMN 识别快滑的能力(该行为在短视频推荐系统中是重要的隐性负反馈信号),上图展示了多个模型在三个快滑阈值(2秒、4秒及6秒)下的区分能力。针对每个阈值,我们构建二分类任务并对比预测观看时长的 AUC 值。EGMN 在所有阈值下均持续优于 CREAD 和 D2Q 模型,取得最高 AUC 评分。进一步地,我们在上图中评估了移除指数分布的模型变体(EGMN w/o exp)。实验发现:在全部三个跳过阈值下,该变体的 AUC 值均出现超过6%的显著下降,这证明 EGM 分布中的指数分量对捕捉瞬时跳过行为具有关键作用。
3.5 跨粒度分布拟合
3.5.1 整体分布拟合
我们对比了 EGMN 与其他基线模型的预测观看时长分布与实际分布的拟合效果。我们计算了模型预测与真实分布间的 KL 散度:KL 散度越低表明分布拟合能力越强。如上图琐事,除 EGMN 与 D2Q 外,所有方法的分布拟合能力均较差(KL散度>1.0),其中 VR模型甚至未能学习到有效规律。EGMN 收敛至 0.5 的KL 散度,而 D2Q 达到 0.1。上图下方展示了 EGMN 与 D2Q 的 MAE 趋势对比分析。关键发现在于:D2Q 的 MAE 在第6轮训练后呈现先降后升的急剧波动,而 EGMN 则保持近似单调下降趋势。这种对比表明:尽管 D2Q 通过刚性约束(直接拟合预计算分位数)实现了最小 KL 散度,却严重损害了数值回归精度;反观 EGMN,其 KL 散度与 MAE 在整个训练周期中呈现同步优化的联合收敛态势。总体而言,EGMN 能更优地平衡分布建模与数值回归间的权衡关系。
3.5.2 视频长度粒度
本节中,我们对比了 EGMN 与基线模型 CREAD 在视频长度粒度的分布建模能力。如上图所示,我们展示了四个不同视频长度区间内实际观看时长分布与EGMN、CREAD 预测分布的对比结果。如前所述:虽然整体观看时长分布在零值附近呈现显著偏态,但相同长度视频的观看分布始终表现出双峰特性(一个峰值在3秒附近,另一峰值接近视频长度)。EGMN的预测分布与真实分布高度吻合,精准保留了双峰特征。值得注意的是,EGMN 没有显式的视频长度纠偏操作,仅将视频长度作为模型特征即可捕捉时长相关的分布规律,这证明其混合架构天然具备跨特征粒度的分布建模能力。相较之下,CREAD 在所有时长区间均近似高斯分布(仅存在微小均值偏移),表明其无法捕捉时长层面的分布规律。
3.5.3 User-Video 粒度
为进一步评估 EGMN 的分布建模能力,我们在User-Video 粒度进行了精细化评估。如背景中所述,我们选取两类典型用户:User1 呈现挑剔型的观看模式,User2 展现宽容型的观看模式;同时选择两类视频:Video1(美妆类视频)呈现双峰观看分布,Video2(电影混剪)具有扁平化多峰分布特征。上图中,User/Video边缘概率分布面板(左列与顶部行)以直方图展示真实概率密度分布,叠加曲线为 EGMN 预测概率密度。可以看到 EGMN 对用户与视频的边缘分布均实现精准拟合,证实其能准确建模个体用户消费习惯与特定视频的播放时长分布。
黄色背景的 2×2 矩阵展示了 EGMN 对特定 User-Video的观看时长分布预测。这些分布揭示了模型融合用户行为模式与视频特征的能力。例如在 𝑃(𝑡|𝑈𝑠𝑒𝑟2,𝑉𝑖𝑑𝑒𝑜2)分布中:指数分量权重趋近于零(反映 User2 的低快滑倾向),而分布中的四个峰值精准对应 Video2 边缘分布的四峰特征。这证明 EGMN 不仅能分别建模用户与视频分布,更能有效融合生成精确的联合预测分布——成功捕获用户偏好与视频特性间的交互效应,使预测结果同时反映用户观看习惯与视频特定的播放模式。
上述实验验证了 EGMN 卓越的由粗到细粒度分布建模能力,这对于需要完整理解用户观看时长分布以实现精准推荐的系统具有重要价值。
我们从分布角度揭示了观看时长预测面临的两大核心难题:
由大量快速跳过行为引发的粗粒度偏态分布
多样化用户-视频交互模式导致的细粒度多样性分布。为此,我们提出观看时长遵循指数-高斯混合分布的假设,其中指数分布刻画偏态特征,高斯分布刻画多样性特征。
我们进一步提出指数-高斯混合网络来实现上述分布的参数化建模,该框架包含两大核心模块:隐式表征编码器和混合参数生成器。我们在工业级短视频平台上进行了大量离线实验和在线A/B测试,验证了该方法相对于现有最优方法的优越性。
该模型通过预估观看时长的概率密度函数,不仅可以直接求解期望作为观看时长的预估值,还可以灵活的提供额外信息:
快速跳过行为的识别
特定观看时长区间的累积概率计算
面向用户/视频的分位数估计
不确定性量化的统计置信度
这种灵活性使得工业推荐系统能基于同一底层模型支持多样化策略设计,无需开发专用模型变体。
硕风
硕士毕业于清华大学计算机系,负责小红书视频推荐场景的模型以及策略优化。在 SIGIR RECSYS ACL EMNLP 等机器学习、推荐系统、自然语言处理顶会发表多篇一作论文。主要研究方向:推荐系统多目标优化、时长预估、多目标融合等。
觞阙
小红书视频推荐团队算法工程师,毕业于北京邮电大学,小红书视频内流LTR、Rerank等技术模块的负责人,主要研究时长建模、LTV建模等方向。
姬昊
小红书单列视频推荐团队负责人,毕业于中科院自动化所, 曾在WWW、Recsys、PR等机器学习、推荐系统、数据挖掘会刊发表论文数篇,曾获Recsys25 Best Paper Nomination。主要研究方向:多任务建模、跨域学习、时长建模、Learning2Rank、序列生成等。
陈佳琦(实习生)
小红书视频推荐实习生,现硕士就读于北京理工大学,主攻推荐系统中时长建模与排序方向。
岗位
工作职责
负责推荐技术的落地;实现个性化推荐,分发策略,用户理解,内容理解等方向的技术突破;
沉淀社区推荐技术,并探索业务的边界。能够从复杂的业务环境中抽象出清晰具体的技术问题,并将机器学习等推荐技术有效应用于小红书App社区图文及视频推荐,提升海量用户体验,Inspire Life;
与各部门(包括并不限于产品,基础技术等)的同事一起深入交流合作,共同迭代和优化社区信息流推荐产品;
任职资格
编程基本功扎实,熟悉常用的数据结构和算法,擅长Java/C++/Python中至少一门语言;
熟悉机器学习、数据挖掘、数理统计等领域知识,有搜广推相关领域算法的工作经验;
踏实勤奋,自我驱动,善于沟通,勤于思考,具有较强的动手实践能力和技术热情。
加分项
有运筹学、博弈机制、图神经网络、大规模机器学习等领域的研究和实践经验;
机器学习/数据挖掘竞赛成绩优异者,如Kaggle/KDD Cup等; 或有ACM/NOI获奖经历;
在国际顶级会议(Recsys、KDD、NIPS、ICML、ACL等)以第一作者发表过高水平论文者。
欢迎感兴趣的朋友发送简历至:
添加小助手,了解更多内容
微信号 / REDtech01