MacTalk

看完快手这场沙龙,我对生成式推荐的判断变了

上周又参加了一次快手的技术沙龙,不得不说,快手这家公司的技术底气相当厚,这一两年,其他公司在 AI 的“端”层面搞的热热闹闹,你方唱罢我登场,只有快手,就一直在深耕他们的工业推荐系统,这里面当然有 AI 技术,但不止于此。

这次沙龙的内容,放在快手过去一年多围绕生成式推荐、生成式搜索、生成式广告持续释放的技术路线里看,更像是第二场真正意义上的“生成式推荐系统专场”。

之前讲的是 OneRec、OneSearch、广告出价这些生成式推荐技术如何进入具体业务场景。现在这个主题已经成了“快手生成式推荐技术的体系化演进——统一基座、池化预估与场景实践”。

这个变化是很有意思的。

从 OneRec 到 OneReason(会思考的推荐基础模型),从 OneSearch 到 OneSearch V2(端到端生成式电商搜索框架),然后是面向广告的生成式推荐 GR4AD,现在开始做算力底座 Pool-Rec(算力和系统底座),再加上同步发布的快手探索者 LLM-Rec 挑战赛,快手这一次在讲的是“这一整套东西正在长成一个系统”。

过去一段时间,很多公司做生成式推荐,容易停留在一个表层问题上:能不能把用户行为序列、物料 ID、上下文信息,像文本一样编码成 token,然后让模型一步步生成推荐结果?

这是一个重要问题,但只是第一步。

真正进入工业级场景之后,问题会变得更复杂:模型能不能理解用户为什么喜欢某个内容?能不能处理冷启动、长尾物料、跨域迁移?算力能不能撑住?搜索和广告这种对延迟、收益、转化都极其敏感的场景,能不能上主链路?技术路线能不能开放给外部团队一起验证?

我的判断也因此发生了一点变化:生成式推荐已经不再只是“推荐模型的一次升级”,它正在重构推荐系统底座。

1

先说 OneReason。

以前我写过 OneRec,它解决的是“推荐结果能不能被生成”,OneReason 要解决的问题是:推荐系统能不能学会思考。

传统推荐系统,本质上很擅长记忆。它知道看过 A 的人也可能看 B,买过某类商品的人也可能喜欢另一类商品。这套基于协同过滤、深度模型、序列建模的体系已经非常强大,也支撑了过去十年内容平台、电商平台和广告系统的增长。

但它也有天然边界。

冷启动用户数据少的时候,模型不知道怎么推荐;长尾物料缺少行为反馈,很难获得露出机会;跨域迁移时,用户在短视频、电商、直播、本地生活之间的兴趣变化,并不是简单的共现关系等等。

到了大模型时代,一个新的问题出现了:既然 LLM 已经从 Scaling 走向 Reasoning,再进一步走向 Agentic,那么推荐系统能不能也经历一次类似的跃迁?

快手 OneReason 的答案是:可以,但不能简单照搬大模型的 CoT(思维链)。

推荐里的 Reasoning,是让模型从用户行为这个“果”,反推出潜在兴趣这个“因”。这是一种溯因推理。用户看过一堆内容,停留、点赞、下单、跳出,这些行为混在一起,有噪声、有时间变化、有跨域迁移。推荐模型要判断的是:“为什么这个用户此刻可能需要这个东西”。

OneReason 要构建的,是推荐模型理解物料和用户的底层能力。

在预训练阶段,OneReason 做了 578B token 的三阶段训练,把 itemic token(物料 Token)和自然语言做深度语义对齐。简单说,过去 item token 更像一个离散编号,模型知道它和哪些东西共现,但未必真正理解它是什么。OneReason 要让模型不仅知道这个 token 出现在哪里,还要知道它代表的物料内容、关系、用户行为上下文,以及它和人的兴趣之间的连接。

接下来是 SFT(监督微调) 和 RL(强化学习)。快手把推荐 CoT 拆成了更适合推荐任务的结构:从感知物料,到推导物料关系,再到理解用户兴趣演化,最后做推荐决策。

要的就是准确性,这一点特别重要。

大模型里的长链推理,有时会带来更强的数学和代码能力;但在推荐里,过度思考可能反而有害。因为推荐任务不是证明题,答案并不唯一,很多时候是在不完整信息下做概率判断。OneReason 的价值,恰恰在于它把“思考”这件事变成了推荐模型的正资产。

从数据看,这不是一个纯离线探索。OneReason 在快手本地生活广告 10 天 A/B 实验中,带来了曝光和广告收入提升,ROI 也超过 5;在推荐 Benchmark 上,thinking 模式首次稳定超过 non-thinking 模式,Pass@4(模型有 4 次机会,只要其中一次推荐命中正确答案,就算通过)平均领先 13.45%。这说明推荐系统里的 Reasoning,不再只是一个好听的概念。

Image

OneReason 让生成式推荐从“生成”进入“理解”的阶段,前者解决了推荐系统的表达形式,后者开始真正触及推荐系统的能力边界。

2

只有模型还不够。

生成式推荐比大模型还吃算力。推荐系统要面对的是亿级用户、海量物料、极高 QPS、毫秒级响应,以及每一天超过千亿次的推荐决策。用户刷一下页面,系统就必须把结果给出来。

这就是 Pool-Rec 的意义,也是沙龙的第二讲。

Pool-Rec 是“基于异构算力池化的推荐预估系统”,解决的就是高效利用算力的问题。

OneRec 系列模型之所以能够上线推全,不光是因为模型结构变了,还因为有 Pool-Rec。这个系统做的事情,是通过基础设施、算力调度和推理引擎的协同优化,实现 AZ 级异构资源——把多个可用区里不同类型的 CPU、GPU 等算力统一放进一个大资源池,由系统按需调度给推荐模型使用,让模型算力利用率——也就是 MFU——大幅提升。

过去推荐系统有一个长期问题:算力利用率并不高。原因在于传统推荐链路非常碎,召回、粗排、精排、重排,各种模型、特征、算子、服务拼在一起,单个算子计算密度不高,调度复杂,访存和通信开销很大。和大语言模型那种大矩阵密集计算相比,传统推荐系统更像一个堆满小零件的车间,忙滴很,但效率一般。

OneRec 已经证明,生成式架构可以提升推荐系统的算力效率,Pool-Rec 则更进一步,把这个问题从单模型优化推进到系统层。谁能把异构资源调度好,谁能把推理引擎做深,谁能让高密 GPU 架构和分布式推理稳定服务主链路,谁才有机会长期把模型 scale 上去。

生成式推荐到了今天,已经是算法、工程、算力和业务协同推进了。

3

我们再看看搜索和广告。

如果 OneReason 和 Pool-Rec 分别代表“模型能力”和“算力底座”,那么 OneSearch V2 和 GR4AD 则代表场景化的实践。

先说搜索场景,之前 OneSearch V1 解决的是端到端生成式搜索的可行性。到了 OneSearch V2,重点已经变成复杂 query 理解、潜在意图挖掘,以及推理能力如何内化到模型权重里。

这个方向和 OneReason 是呼应的。

OneSearch V2 用 LLM 生成紧凑的关键词级 CoT,再通过自蒸馏把显式推理能力放到模型参数里,最后在线推理时不增加额外成本和时延。换句话说,它不是每次都让模型“慢慢想”,而是训练时学会怎么想,上线时像直觉一样快速给出结果。

这是不是和我们人类非常像了?平时做各种训练,真上了现场,很多时候要靠直觉反应。

Image

4

面向广告的生成式推荐(GR4AD )更是如此,广告推荐和普通内容推荐完全不一样,它面对的是平台收入、广告主转化、用户体验这三方目标,而且要在极高 QPS 和低于 100ms 的延迟约束下完成多候选生成。

直接套 LLM 肯定不行。

快手在 GR4AD 里做的是推荐原生设计:广告物料要 token 化,但不能只编码内容语义,还要把转化类型、广告账户、投放策略这些商业信号编码进去;训练目标不能只是预测点击,而要面向 eCPM、NDCG、收入和转化做价值感知学习;推理也不能照搬 LLM,而要针对短序列、多候选、Beam Search 做优化。

Image

听完 OneSearch V2 和 GR4AD 的分享,我知道,生成式推荐已经进入了业务的主流程。

5

LLM-Rec 挑战赛是这场沙龙里大家最喜欢的环节。

快手每天为数亿用户完成超过千亿次推荐决策。在这样的规模下,推荐系统的每一点提升,都不是纸面指标,而是真实用户体验、创作者分发效率、商家转化和平台生态的变化。

但推荐系统也是一个典型的工业深水区。学界有论文,有想法,有各种 benchmark;工业界有数据,有场景,有工程约束。两边之间长期隔水相望:真实用户行为数据拿不到,物料规模模拟不了,评测标准不统一,很多方法只能停留在小数据、小模型、离线评估上。

LLM-Rec 挑战赛在水面上打了座桥。

快手提供了 0.8B 量级的推荐基座模型、50 万条脱敏线上活跃用户行为 log、内容 Caption 与 Semantic ID、部分通识 SFT 数据、训练 pipeline 脚本,以及官方训练与评测环境。评估维度要同时看模型是否懂用户、懂物料、懂推荐、懂世界。

Image

这里面有个判断:下一代推荐模型应该具备世界理解能力。

OneReason 回答“推荐系统能不能思考”;挑战赛则把这个问题开放给外部团队,让更多人一起回答,快手则把基座、数据、评测和人才入口也拿出来共享了。这种开放的态度,本身就是一种技术路线上的自信。

6

看完整场沙龙,和快手的同学也交流了很久,我最大的感受是:快手在生成式推荐这件事上已经形成了持续的演化路径。

从生成式推荐到思考,从搜索到生成式广告,再到算力,过手如登山,一步一重天,可以说快手走的非常稳。

模型当然重要,但模型只是整套系统里的核心引擎。真正决定它能跑多远的,是背后的数据燃料、算力底座、业务场景和开放的生态。对快手来说,OneReason 是会思考的大脑,Pool-Rec 是动力系统,OneSearch 和 GR4AD 是真实场景,LLM-Rec 挑战赛则是把更多建设者邀请进了这条技术路线。

热闹的沙龙结束了,挑战赛和竞争才刚刚开始。点击下方阅读原文了解详情。