小红书技术REDtech

小红书 Relax 开源发布:面向全模态 Agentic 的异步 RL 训练引擎

Image

小红书 AI 平台团队今日正式开源 Relax —— 一款面向全模态与 Agentic 场景设计的大模型强化学习训练引擎。Relax 基于 Megatron-LM 和 SGLang 高性能后端构建,以协同设计为核心理念,将全模态数据支持、服务化容错架构和异步训练流水线三个维度统一解决。在 Qwen3-Omni-30B 上,Relax 验证了图像、文本、音频和视频四种模态的 RL 训练稳定收敛;在 16xH800 多机下,训练全异步相比 Colocate 基线端到端提速 76%,相比 veRL 的全异步端到端提速 20%。

获取资源

GitHub 项目主页:https://github.com/redai-infra/Relax

论文地址:https://arxiv.org/abs/2604.11554 

Image

困境一:数据异构。  高质量的图片和音视频原始数据传输体积大、CPU 预处理开销高、编码后 token 爆炸,mm encoder 无法和已有并行策略高效协同——在小红书内极其丰富的多模场景下,我们需要一款定制优化的框架。

困境二:系统脆弱。  多模态下较高的 OOM 风险叠加上千卡长时训练,硬件故障、NCCL 超时随时出现——传统方案缺乏分钟级故障恢复和单角色弹性伸缩能力。

困境三:角色耦合。 Colocate 方案下各角色共享 GPU 只能串行执行,Trainer 空闲等待最慢的 Rollout 完成;现有全异步方案虽然把 Rollout 和 Train 拆到不同组,但缺少细粒度的流水线调度。

Image

上述三个挑战紧密耦合,协同设计比逐个击破更有效。多模态数据带来的低效与不稳定,推动系统走向服务化隔离与全异步架构进而演化出统一的数据总线,而总线的结构又天然适配多模态数据,最终形成一条自洽的闭环。

服务化容错架构:所有角色皆服务

Relax 将每个 RL 角色(Actor、Critic、Rollout 等)封装为独立的 Ray Serve 部署,拥有独立的故障域、资源配额和健康监控,从而获得三个核心能力:

故障隔离:某个 Serve 故障(如OOM)不会传播到其他角色——两级恢复策略区分无状态角色(原地重启)和有状态角色(全局恢复),避免一个角色故障导致全局重启的代价。

独立伸缩:无需整体调整,可以单独增加 Rollout 副本而不影响 Critic 集群。

生命周期管理:每个角色从初始化到 checkpoint 到重启,都在服务级别管理,而非纠缠在全局训练循环中。

Image

此外,Relax 提供了 分布式 Checkpoint 服务(DCS)——一个独立部署的权重同步服务。DCS 低延迟地将更新后的权重分发到所有推理引擎,使故障恢复无需回退到磁盘 checkpoint 并支持 NCCL(集群内 GPU-GPU 传输)和 TCP(跨集群传输)双通道,适配不同的部署拓扑。

Image

异步训练流水线

Relax 集成 TransferQueue(TQ) 作为所有服务间的异步数据总线。TQ 的 Field-Level 存储使得同一样本的不同字段(生成结果、log-probs、奖励)可以在不同时刻独立写入和读取,直接匹配 RL 训练中各阶段在不同时间产生不同字段的多阶段计算模式。基于 TQ,Relax 仅通过一个 max_staleness 参数即可控制 On/Off-Policy 的模式切换,全异步下 On-Policy 相比 Colocate 性能提升 12%,Off-Policy 则提升 76%。

Image
Image

两项关键机制驱动了这一性能优势:

流式微批调度(Streaming Micro-Batch Scheduling):传统框架采用全局 batch 同步——rollout 必须生成整个 batch 后才能交付下游,比如一个 20k token 的长尾样本可能就会阻塞整个 step。Relax 将全局 batch 拆分为微批,每个微批完成后立即写入 TQ 供下游消费。

Actor Train 资源分离:将 logp 和 ref_logp 计算部署在独立 GPU 资源上并行执行,通过异步传输完全掩盖在训练时间内。

全模态原生支持(Omni-Native)

Relax 支持图像、音频、视频等输入的统一处理与灵活接入,结合模态感知并行与端到端异步流水,提升多模态训练效率与可扩展性。在 Qwen3-Omni-30B 上,分别基于图文音频数据(AVQA-R1-6K)和视频数据(NextQA)进行 RL 训练(其中视频数据持续训练 2,000+ 步稳定收敛)

Image

对于 Agentic RL 多轮推理、工具调用和搜索增强等场景,Relax 将 infra 与算法关注点剥离,支持业务灵活敏捷接入:

自定义 Rollout 与 Reward:支持多轮 Agentic 工作流(每个推理轮次可接收新的视觉输入),Rollout 服务维护会话状态,TQ 独立追踪每轮的字段就绪状态。Reward 计算支持规则奖励、生成式奖励模型(GenRM)和自定义 Reward 接口三种模式。

Tool Use:工具调用作为异步服务调用融入 rollout 循环。

Image
Image

端到端性能:对比 veRL

在2机16卡 DAPO-Math 任务上较 veRL 提速 20%!加速来源于:流式微批调度消除全局 batch 同步瓶颈,资源分离将前向推理计算完全掩盖,消除 sleep/wakeup 开销。

Image

全异步训练对比实验 Qwen3-30B-A3B / 16×H800 / DAPO-MATH-17k / Megatron-LM + SGLang

MoE 训练稳定性:Near-Zero-Overhead R3

Relax 实现了性能近无损退化版的 R3(Rollout Routing Replay)。在Qwen3-30B-A3B 下 mismatch 降低 38%,仅增加 +1.9% 的额外耗时,而 veRL 开启 R3 后端到端耗时增加了 34%。Relax 通过重写序列化路径(把路由数据从 pickle 通道拆出来,走 NCCL 原生广播)和 GPU 驻留式的异步传输,使 R3 的数据传输和 replay 开销极低。

Image

Qwen3-30B-A3B / 16×H800 / DAPO-MATH-17k 上的 2×2 对比实验(Relax/veRL × 有/无 R3)

Image

当 RL 训练从纯文本单轮走向全模态 Agentic,数据异构、系统脆弱、角色耦合三重困境不再是可以分别解决的独立问题。Relax 的回答是一套协同设计:全模态原生 pipeline解决数据异构,服务化隔离 + DCS 快速恢复解决系统脆弱,micro batch 级全异步流水线解决资源利用率——三者因果闭环,缺一不可。未来将继续结合公司内多模态与 Agentic RL 等实际业务需求,不断完善训练能力与系统优化,支撑更大规模、更高复杂度的训练任务落地。

Image

我们是小红书 AI 平台团队,专注打造领先易用的「AI 大模型全链路基础设施」!团队深耕大模型「数-训-压-推-评」技术闭环,在大模型训练加速、模型压缩、推理优化、部署提效等方向积累了深厚的技术优势,基于 RedAccel 训练引擎、RedSlim 压缩工具、RedServing 推理部署引擎、DirectLLM 大模型 API 服务、QuickSilver 大模型生产部署平台等核心产品,持续赋能社区、商业、交易、安全、数平、研效等多个核心业务,实现 AI 技术高效落地!

本工作主要作者包括席德(李佳兴)、佳佳(于笑颜)、无幻(杨睿)、禹哲(宁本哲)、月天(张留杰)。

Image

我们招募大模型Infra全栈工程师/专家啦~ 核心方向四选一(全栈更佳):

🚀 后训练引擎:RLHF/DPO/GRPO,Megatron/veRL/slime,千卡分布式优化

⚡ 高性能推理:vLLM/SGLang,KV Router,PD 分离,万亿 Token 并发

🔬 模型压缩:W8A8/W4A8 量化、投机采样、蒸馏剪枝落地

🖥 异构计算:昇腾 NPU/GPU 软硬协同,CUDA Kernel 调优,NCCL/RDMA 通信优化

基础要求:精通 C++/Python,具备 PyTorch 源码级改造能力,熟悉底层硬件架构;加分:能熟练用 Cursor/Claude Code 等 AI 工具搞 Agentic Engineering。有主流开源框架贡献(Megatron/vLLM/SGLang 等)、MLSys/OSDI/SOSP 顶会论文、千卡生产集群实战经验者超级优先!社招/校招均可,欢迎投简历 🎯

投递邮箱:[email protected]

Image