搜狐技术产品

GPR:基于One Model端到端的生成式广告推荐新范式

图片

导读在人工智能领域,"One Model"(单一模型)范式正在成为一种新的技术信仰。从GPT系列统一自然语言处理任务,到DALL·E统一图像生成;从国内快手 OneRec 再到如今腾讯广告提出的GPR(Generative Pre-trained Recommender)——这种范式转变背后的核心理念是:用一个端到端的生成式模型替代传统的多阶段级联系统,实现目标一致、流程简化和全局最优。

本文将深度解读腾讯广告与清华大学联合发表的这篇突破性论文,重点关注GPR如何首次在工业级大规模广告推荐业务中落地了端到端生成式框架,以及这一范式为何能在微信视频号广告系统中取得显著的商业成功。

01

传统范式的困境

为什么需要One Model?

1.1 级联系统的固有难点

传统的广告推荐系统采用"检索-预排序-排序"的多阶段级联架构,这种设计在工业界已经运行多年并高度优化。但论文指出,级联系统是一个"局部最优"的系统,而非"全局最优"的系统,这种范式存在三个根本性问题:

  • 目标错位 Objective Misalignment:系统各部分在相互'掣肘',而非'协同'。检索的优化,不等于排序的优化。检索阶段优化覆盖率,排序阶段优化业务指标(CTR、CVR等),各阶段目标不一致,导致无法达到全局最优。

  • 错误传播 /信息瓶颈 Error Propagation:检索阶段的早期模型能力有限,可能过早地"错杀”了高潜力的候选物料。一旦"金子"在第一关被丟掉,后续的排序模型(即使能力再强)也"永不"可能纠正这个错误。

  • 工程负担 Engineering Complexity:维护跨多个阶段(模型、特征、目标)的一致性需要巨大的工程资源,这极大地阻碍了算法的快速迭代和系统扩展。每次优化都需要协调多个模块,牵一发而动全身。

1.2 生成式推荐的挑战

近年来,以LLM为代表的生成式模型展现了强大的能力。其核心理念是不再"排序",而是"直接生成"。模型直接根据对用户兴趣和上下文的"整体理解","生成"最优的推荐结果。这样做的理论优势是从根本上保证了"优化目标的一致性"彻底摆脱了级联系统的多阶段束缚。

Image

虽然HSTU等工作已经将生成式建模引入推荐系统,但在大规模工业级广告系统中仍面临三大核心挑战:

  • 数据的极端异构性 Extreme Heterogeneity:广告与有机内容在用户序列中交错,用户行为异构(点击、转化、观着、阅读),数据分布极其嘈杂。这对模型的"统一表示能力"提出了极高要求。

  • 效率与灵活性的权衡 Efficiency-Flexibility Trade-off:Decoder-only阶段,训练高效但推理灵活性差;Encoder-Decoder阶段,推理灵活但训练成本极高。广告系统需要"两者兼得":既要高效训练,又要灵活解码。

  • 收入与多方价值优化 Revenue & Multi-stakeholder Value:广告的"终极目标"不是点击率,而是"生态系统总价值"(用户体验、广告主ROI、平台收入)的平衡。现有预训练方法只关注单一的兴趣建模,无法满足实际需求,导致商业价值错位。

这些挑战使得现有生成式推荐模型难以在真实的工业广告环境中落地。GPR的核心价值就在于系统性地解决了这些问题,实现了首次在工业级大规模广告推荐业务中落地了端到端生成式框架。

02

One Model 的设计哲学

GPR 的整体架构设计思路

Image

在GPR的整体架构设计中,腾讯广告率先在广告行业构建了一个统一的生态一体化模型:

在生成与排序阶段深度融合了丰富的商业信息,从最底层通过基础大模型的预训练,全面捕捉用户兴趣偏好。在此基础上,GPR构建了复杂的强化学习框架,精准模拟线上用户行为,这对提升广告的商业价值和企业效益起到了关键作用。与此同时,GPR在模型中整合了多项与大模型相关的先进技术,如思维链等机制,并进行了深入的探索与实践,取得了显著的效果提升。

2.1 统一表示:四类 Token 构建语义空间

GPR 的第一个创新是设计了统一输入模式(Unified Input Schema),将用户的完整历程表示为四类Token的序列:

  • U-Token:用户属性和偏好

  • O-Token:自然内容(视频、文章)

  • E-Token:环境/请求上下文(时间、场景)

  • I-Token:交互过的广告物料

这种设计的深刻之处在于:所有信息都被统一为连续的 Token 序列。无论是广告还是有机内容,都被编码为离散的语义ID,实现了真正的"万物皆Token"。

RQ-KMeans+:解决"码本崩溃"

为了将多模态内容转化为语义ID,GPR提出了RQ-KMeans+量化模型。传统的RQ-VAE和RQ-Kmeans存在"码本崩溃"(codebook collapse)问题——大量向量(码字)变得"死亡"(从末被激活),导致语义空间利用率低下。这会严重降低模型的表达能力和泛化性能,无法有效捕获物料的丰富语义信息。

RQ-KMeans+的创新在于:

  • 用RQ-Kmeans初始化高质量码本,避免随机初始化导致的崩溃

  • 引入残差连接,确保早期训练阶段输出分布接近输入分布

  • 保持潜在空间灵活性,允许码本根据训练数据自适应更新

2.2 异构分层解码器(HHD):理解与生成的分离

GPR的核心架构是异构分层解码器(Heterogeneous Hierarchical Decoder, HHD),它包含三个关键模块:

① HSD:异构序列解码器(主解码器)

HSD的任务是理解用户 User lntent Modeling,处理超长异构行为序列 (U/O/E/I Tokens),生成高质量的 "意图嵌入" 解决  "我是谁?我〔用户〕的意图是什么?"的问题。

它引入了三个关键技术:

  • 混合注意力(Hybrid Attention):在U/O/E Tokens区域使用双向注意力,允许这些"提示词"(prompt)Token之间自由交互;在物品预测区域使用因果注意力。这种设计使模型能充分利用上下文信息。

  • Token感知归一化和FFN:为不同类型Token分配独立的归一化层和前馈网络,将它们投影到各自的语义子空间,充分捕捉异构序列的语义多样性。

  • 混合递归(MoR)和外部知识注入:通过Mixture-of-Recursions机制增加模型深度和推理能力;同时集成微调的LLM生成的"思考过程",增强语义理解。

② PTD:渐进式Token解码器(思考-精炼-生成)

PTD (Progressive Token-wise Decoder)的核心任务是生成物品 Ad Generation。在 HSD 生成的"意图"指导下,逐步生成目标广告的语义 ID。解决 "基于我的意图,我〔模型〕应该生成哪个广告?"的问题。

PTD采用了独特的"Thinking-Refining-Generation"范式:

  • Thinking(思考):生成K个思考Token,从意图嵌入中提取关键信息,过滤无关成分

  • Refining(精炼):受LLM推理研究启发,引入基于扩散范式的精炼模块,迭代去噪提升推理质量

  • Generation(生成):基于思考Token和精炼Token,生成多级语义代码表示目标广告

这种分层设计实现了用户理解与广告生成的解耦,使得模型能够更精细地捕捉用户偏好,从而实现更准确的预测。

③ HTE:分层Token评估器(价值估计)

HTE (Hierarchical Token-wise Evaluator)的任务是评估价值Value Estimation, 预测每个语义 ID 和最终物品的"业务价值”,用于指导解码和 RL 训练。解决 "这个生成的广告值多少钱〔eCPM, final_value〕?"的问题。

广告推荐不同于内容推荐,必须同时优化多个业务指标(CTR、CVR、eCPM等)。HTE模块为每个语义代码和最终物品估计价值,这种端到端的价值估计使得生成过程能够直接对齐商业目标,而不是孤立优化单一指标。

2.3 价值引导的Trie树解码

在推理阶段,基于生成式的推理往往存在 "陷阱",生成式模型虽然强大,但容易"放飞自我" :

  • 生成不存在的 ID 或已下线的广告。

  • 生成不符合 "定向约束"(Targeting)的广告(如:把女性化妆品推给男性)。

  • 传统的 Beam Search 不仅慢,而且可能保留大量低价值候选。

为此,GPR提出了Value-Guided Trie-Based Beam Search高效的解码方案:

  • 个性化索引树 Trie-based Pruning:根据用户画像(年龄、性别等)动态构建 Trie 树约束。在解码每一步,直接 "屏蔽" 掉所有不符合定向规则的分支。

  • 价值剪枝 Value-Guided Beam Width:利用 HTE 模块实时预测每个分支的价值 (Value)。对高价值路径给予更大的 Beam Width,低价值路径尽早截断。

这确保了每一毫秒的算力都花在 '最可能赚钱' 且 '合规' 的广告上。

03

多阶段联合训练

MTP → VAFT → HEPO

Image

GPR的训练策略是One Model范式成功的关键,它分为三个阶段,构建了一个无缝统一"兴趣建模"、"价值对齐"和"策略优化"的完整训练流程。

3.1 预训练:多Token预测(MTP)

传统的Next-Token Prediction(NTP)假设用户有单一主导兴趣轨迹,容易对多重兴趣进行平均化,限制覆盖范围。GPR采用Multi-Token Prediction(MTP),捕获用户的"多重并行兴趣"。通过扩展解码器,使其"并行"(N个Head)预测N个不同的物料。这种设计使得GPR能够同时建模用户的多重并行兴趣,而不是将它们混合成一个平均化的表示。

3.2 价值感知微调(VAFT)

虽然MTP能有效捕捉多兴趣,但它对所有广告赋予同等权重,忽略了经济价值的差异。Value-Aware Fine-Tuning(VAFT):通过引入每个位置的价值权重,由"eCPM"和"行为类型"(转化 > 点击 > 曝光)共同决定。这使得模型在保持多兴趣覆盖的同时,将梯度更新偏向高价值广告,实现兴趣和价值的平衡,找到有价值的兴趣。

3.3 强化学习:分层增强策略优化(HEPO)

监督学习只能从历史曝光和交互中学习,存在行为覆盖有限的问题——许多高价值候选从未被探索过。GPR引入强化学习来突破这一限制,提出了Hierarchy Enhanced Policy Optimization(HEPO)算法,通过"反事实探索"发现高价值策略。使用强化学习在"高保真模拟环境"中训练,探索日志之外的优化空间。实现了"从模仿者到探索者的关键转变"。

04

实验验证

从离线到线上的全面突破

4.1 离线实验:

不同编码器的性能:

Image

最终的实验表明,RQ-KMeans+的码本利用率达到99.36%,碰撞率仅为20.60%,显著优于基线方法。这为后续的统一生成奠定了坚实基础。

HHD 架构性能:

Image

GPR在百万级物品库的预测任务上达到27.32% HitR@100,比基线提升40%以上。消融实验显示HSD增强意图编码、PTD提升生成质量、MTP捕捉多兴趣(+17.9%最大增益)、HTE对齐竞价目标,各组件协同发挥作用。

扩展实验:

Image

扩展实验验证了scaling law,模型越大性能越好。

训练与对齐性能:

Image

实验对比了四种训练策略的商业价值对齐效果。MTP+VAFT通过价值重加权小幅提升nDCG和OPR,MTP+DPO通过成对偏好优化显著改善排序质量(nDCG 0.4383)和final_value,而MTP+HEPO表现最佳(nDCG 0.4413、平均final_value 0.2630、最大final_value 0.7619),证明分层过程奖励和模拟环境探索能最有效地将生成策略与业务目标对齐。

4.2 线上A/B测试:商业指标全面提升

GPR已在微信视频号广告系统全面上线,面向数亿用户和千万级广告库。线上测试经历五轮演进:

Image

整体提升:

  • GMV(商品交易总额):首轮+2.11%,第二轮+0.70%,累计提升持续叠加

  • CTCVR(点击转化率):显著提升

  • CTR、CVR:全部正向增长

  • 成本指标:优化改善

Image

分组效果:

  • 新广告冷启动:GMV +2.97%(老广告+1.65%)

  • 新用户:各指标显著提升

  • 低/高活跃用户:所有分组均录得多项指标增长

这些结果证明:GPR作为端到端单一模型,在高度优化的成熟级联系统面前仍保持强竞争力,并在冷启动、复杂场景下表现更加优异。

05

结语

GPR代表了广告推荐系统从多阶段级联向端到端生成式单一模型范式的重要转变。通过统一表示、分层解码、价值对齐三位一体的设计,GPR成功将整个模型和广告主的商业价值进行了对齐,在理论创新和工业落地之间找到了优雅的平衡点。

在微信视频号这样数亿用户规模的真实生产环境中取得的显著商业成功,证明了One Model范式不仅是学术探索,更是具有实际经济价值的技术革新。这为推荐系统乃至整个AI领域的范式演进提供了宝贵的实践经验。

One Model不是终点,而是新的起点。随着生成式AI技术的持续演进,我们有理由期待更多统一、端到端、全局最优的智能系统出现,推动人工智能从"多模型拼接"走向"单一模型统御"的新时代。