MacTalk

快手出了 AgentX:推荐系统也开始自我迭代了

最近快手出了个 AgentX,没看他们技术报告之前,我还以为快手也要做 Agent 工具了,最近这个领域还真是挺火的。看完才知道,AgentX 是快手面向工业推荐系统做的一套 Agent 驱动研发闭环。

AgentX 把业务目标分解成这么几个:实验方案、生成代码、上线安全的 A/B 实验,最后是读取线上反馈判断成败。每次实验的成功和失败都会沉淀成经验,成为下一轮推荐的助燃剂,让推荐更快、更稳、也更准确,如同一个可以自我进化的研发系统。

1、推荐系统的瓶颈,正在从模型能力转向研发流程

过去十年,推荐系统的主线还是很清晰的:模型变大,特征更细致,序列更长,系统也更复杂了。推荐模型从传统排序走向深度模型、生成式推荐和推荐大模型。在工业推荐的日常迭代里,最大的瓶颈正从模型能力转向研发链路本身。

这也是 AgentX 值得被拿出来讲的原因。

一个推荐策略从想法到上线,要经过数据分析、方案设计、生产代码修改、实验配置、A/B 观测、指标归因和复盘沉淀。每一步都要求工程师理解业务语义、系统边界、平台规则和线上风险。最后,一个想法能不能变成有效实验,经常取决于少数有经验的人能不能把这个流程走完。

这事看起来不容易,做起来那真是一点也不简单。

两个问题。第一,吞吐受限于人,一个工程师同一时间只能推进少量实验。第二,经验很难变成系统能力,很多失败实验暴露了特征缺口、平台约束、策略风险和业务边界,这些信息你自己记住了也写了文档,如果没有融入下一轮推荐,踩坑依然是大概率事件。

AgentX 要解决的就是这个事:把推荐系统研发里最耗时、最依赖经验的过程,通过工程化的方法,把“这个过程”改造成一个可以持续运转、积累经验的闭环。如图所示:

Image

人工接力式推荐迭代与 AgentX 闭环对比

2、让 Agent 成为迭代执行主体

AgentX 会直接进入推荐迭代的主流程,持续提出方案,完成实现,上线实验,读取结果,并把每一次轨迹沉淀为下一轮的燃料。这让它更接近一个研发系统,而非单次工具调用。

这背后是生产方式的变化。传统流程里,工程师亲自把每个环节串起来,从发现问题到写代码,从配实验到看数据,再从结果里总结经验。AgentX 做的是把这条长链拆成多个可执行、可验证、可复用的环节,让 Agent 负责大量执行工作,人主要负责目标设定、关键审核和高阶判断。

普通代码助手通常解决的是“把代码写出来实现功能”,AgentX 要回答的是“把一个推荐实验持续做成”。工业推荐不是一个单点推理任务,里面有模糊业务目标,有复杂代码库,有实验平台,有线上用户反馈,还有各种安全防护。AgentX 的难点,恰恰在于它要把这些真实约束都纳入到研发系统的闭环里。

3、那么,AgentX 如何跑完一次真实推荐实验呢?

一次完整的推荐实验包含四个部分:Brainstorm Agent、Developing Agent、Evaluation Agent 和 Harness Evolution。前三个模块负责实现想法然后上线看结果,最后一个模块负责让系统从历史轨迹中变强。这是它能够形成复利的前提。

Brainstorm Agent 负责把模糊目标变成可落地方案。真实业务输入往往并不完整,可能只是“提升观看时长”“优化某类用户转化”。如果任由模型自由发挥,很容易得到看上去漂亮、实际上不能实现的方案。Brainstorm Agent 会综合历史实验、系统知识、数据分析和论文研究,最终形成有优先级、有证据、有边界的候选方案。

Developing Agent 负责把方案变成生产代码。工业代码库里,语法正确只是起点,字段是否真实存在、策略是否注册到正确队列、开关是否默认关闭、实验参数是否和平台一致,都会影响线上实验的可靠性。AgentX 用仓库知识库、特征 schema 查询、DSL 检查、C++ 语法检查和 dryrun 验证(上线前彩排),保证代码在正式工程里的可用性。

Evaluation Agent 负责把线上 A/B 变成系统的真实奖励。推荐系统不能只看离线分数,因为一个策略可能提升了某个内部指标,却伤害了用户体验或业务护栏。Evaluation Agent 会做安全部署、流量分桶、参数冲突检查、指标读取和 guardrail veto,最后给出 KEEP、EXTEND 或 DISCARD 这样的结构化判断。

Harness Evolution 是 AgentX 自我迭代的部分,这部分我看了好几遍才明白是咋回事,这套方法叫 SGPO,也就是 Semantic-Gradient-based Prompt Optimization。简单来说,就是把 Agent 执行失败的原因总结成“语义上的改进方向”。

比如:这次 Agent 漏掉了业务约束、证据引用不充分、输出字段不完整、代码检查顺序不对,这些自然语言诊断就相当于“语义梯度”。

系统会根据这些诊断去修改某个子 Agent 的工作规则、Prompt、校验项或输出格式,再用历史任务做 replay 对比:新版确实比旧版好,才允许进入生产流程。也就是说,SGPO 是 AgentX 用历史执行轨迹来改进 Agent 自身工作方式的一套机制。

Image

AgentX 总体框架图

4、效果咋样呢?374 个想法,10 个可发布结果

快手在三周生产窗口中部署了 3 个 AgentX worker,覆盖主站推荐和生活服务两个场景。系统一共推进 374 个实验想法,其中 106 个通过方案审核,100 个完成代码实现与上线,10 个获得正向评估并达到可发布标准。

这个漏斗本身很有意思。374 个想法进入系统,idea pass rate 是 28.34%;通过审核之后,code-and-launch rate 达到 94.3%;最后 positive evaluation rate 是 9.9%。AgentX 没有让每个想法都上线,也没有假装每个想法都有效。它真正做的是把大量候选方向放进一个有审查、有工程验证、有线上反馈的漏斗里。

从业务线看,主站推荐 361 个想法产生 8 个可发布结果,生活服务 13 个想法产生 2 个可发布结果。这些实验带来了可观收益:主站推荐用户 App 消费时长累计提升 +0.561%,生活服务为快手平台贡献年化超 1 亿元人民币收入。对于推荐系统来说,这类百分比落在大规模流量上,往往就是很真实的业务价值。

效率变化同样关键。单个 AgentX worker 平均维持约 12 个并发实验,而传统人工流程中工程师约为 1.5 个,并发能力提升 8 倍。单 worker 每周产出 1.1 个可发布结果,是人工方式的 13.8 倍;单位人力贡献的累计 App 时长收益达到人工的 3.7 倍。

更有价值的是,AgentX 在三周里出现了自我加速。周并发实验数从 15 增至 60,idea 通过率从 15% 提升到 45%,每周可发布结果从 2 个提升到 5 个。随着技能沉淀、失败模式积累和 dryrun 模板成熟,系统不仅跑得更快,也更快地排除无效方向。

Image

三周自我演化曲线,展示并发实验数、idea 通过率和可发布结果变化

5、一个案例看懂“自我迭代”:PCV 两轮实验

如果只看整体数据,AgentX 容易被理解成“更快地跑实验”。我们来看个案例,就知道为什么 AgentX 能自我迭代了。

PCV 是 Post-Consumption Value,在推荐场景里,PCV 指用户看完内容之后产生的行为价值,比如分享、收藏、重播等。这类行为比单纯点击或短时观看更能反映内容的长期价值,但也有风险,因为低质或噱头内容同样可能激发部分消费后行为。

实验的目标,是在保持真实曝光和用户体验稳定的前提下提升用户观看时长。第一轮 Brainstorm Agent 选择直接引入 PCV boosting(加权),Developing Agent 把它实现为带实验开关保护的乘法打分公式,Evaluation Agent 通过线上 A/B 读取结果。结果显示,方向上有弱正向:人均观看时长 +0.034%,用户观看时长 +0.021%。但统计显著性不足,同时部分人群和多样性指标出现风险。

好,AgentX 把这次实验转化成了下一轮输入:直接提升高 PCV 内容可能放大噪声,需要更明确地区分高质量消费后价值和噱头式消费后行为。于是第二轮方案加入了质量门控、用户活跃度自适应权重和时长导向底分。最终,改进后的 constrained PCV ranking 带来用户观看时长 +0.071%、真实曝光 +0.118%,同时用户体验护栏保持稳定。

这个案例说明,AgentX 的能力不在于一次给出完美答案,而在于把真实反馈转化为下一轮更好的假设。工业推荐里最有价值的经验,就在“第一轮不够好”的实验里,现在它们有机会进入系统记忆,影响下一次方案生成、代码实现和实验判断。

Image

PCV 第二轮实验的 Agent 输入与输出表

6、AgentX 对推荐研发分工的影响

AgentX 带来了更深层次的变化,推荐研发的分工正在被重新定义。过去,算法工程师的大量时间花在亲自做实验:找数据、改代码、配参数、看结果、写复盘。AgentX 之后,更多的人是基于目标、约束和实验结果,决定什么问题更值得探索,哪些风险不能越过,什么结果可以进入更大的场景。

工程师需要把更多注意力放到系统设计上:如何构建更好的 Agent 工具链,如何把业务知识写进知识库,如何让失败实验形成可检索的反例,如何设计更稳的 guardrail。

这些工作就是在建设一套能长期复利的研发基础设施。

从行业角度看,AgentX 真正进入工业系统之后,它需要面对真实数据、真实代码、真实流量和真实责任,它要做的就是,把这些约束做成闭环,让正确的事情,持续发生。

Agent 正在通过自我进化的方式,改变工业级的推荐系统。点击下方阅读原文,可查看技术报告。