智东西

小红书全模态新作开源!最高提速76%

ImageImage

小红书想用一个设计解决RL三大挑战。
作者 |  陈骏达
编辑 |  李水青
智东西4月15日报道,今天,小红书AI平台团队开源了一款面向全模态与Agentic场景设计的大模型强化学习训练引擎——Relax,将全模态模型的强化学习大幅提速。
从技术栈来看,Relax基于Megatron-LM(英伟达的大模型训练框架)和SGLang(LMSYS开发的高性能LLM推理框架)打造,以协同设计为核心,统一解决全模态数据支持、服务化容错架构和异步训练流水线这三大RL训练中的挑战。
实验结果显示,在Qwen3-Omni-30B上,Relax在图像、文本、音频和视频四种模态的RL训练中,都能实现稳定收敛。其全异步训练相比Colocate(训练与推理共用同一批显卡)基线端到端提速76%。
基于2机16卡的DAPO-Math任务上,小红书的Relax相比字节跳动火山引擎推出的veRL,取得了20%的端到端提速。这一加速效果来源于两项关键技术:流式微批调度有效消除了全局批次同步带来的长尾阻塞瓶颈;资源分离则将前向推理计算完全掩盖在训练时间之内,同时消除了共用显卡模式下的休眠与唤醒开销。
Image
此外,Relax实现了性能近乎无损的R3(Rollout Routing Replay,用于MoE模型RL训练的稳定机制)。在Qwen3-30B-A3B模型上,Relax+R3机制将训练与推理之间的路由不匹配度降低了38%,而额外耗时仅增加1.9%。相比之下,veRL开启R3后,端到端耗时增加了34%。
Image
目前,小红书的Relax框架已在GitHub上开源,论文也一并发布。
GitHub项目主页:
https://github.com/redai-infra/Relax
论文地址:
https://arxiv.org/abs/2604.11554
01.
多模态信息引发token爆炸
传统方案面临三大挑战
小红书为什么要自研一个新型强化学习引擎?这与全模态RL训练中,面临的多重挑战有关。
首先是数据异构。小红书中有丰富的多模态信息,但是高质量的图片和音视频原始数据传输体积大、CPU预处理开销高、编码后token爆炸,多模态编码器也无法和已有并行策略高效协同。
此外,在多模态强化学习场景中,爆内存(OOM)风险更高,叠加上千卡长时训练,硬件故障、NCCL超时等问题随时可能出现。面对这种挑战,传统方案缺乏分钟级故障恢复和单角色弹性伸缩能力,无法满足训练需求。
最后,在强化学习训练过程中,不同计算任务(如生成样本和更新模型)因为共享或弱解耦的计算资源,导致一方必须低效地等待另一方,从而造成整体训练速度的瓶颈。
对于Colocate方案而言,也就是“训练与推理共用同一批显卡”的部署方式,所有任务都挤在有限的几张显卡上。
为了解决这一问题,现有的“全异步方案”做了改进:把生成任务和训练任务拆分到两个独立的、不同的显卡组上。但这又带来了新的困境:缺少细粒度的流水线调度。
02.
全异步模式性能最高提升76%
视频数据可持续训练超过2000步
小红书AI平台团队判断,这三个挑战紧密耦合,协同设计比逐个击破更有效。
Relax正是对上述挑战的回应。首先,在容错机制维度,Relax将每个RL角色(Actor、Critic、Rollout等)封装为独立的Ray Serve部署,拥有独立的故障域、资源配额和健康监控,从而获得三个核心能力:

第一,故障隔离机制确保单个服务(例如因内存溢出而崩溃的推理服务)的故障不会扩散到其他角色。系统采用两级恢复策略,能够区分无状态角色和有状态角色,避免了因某一个角色出错而导致整个训练任务全局重启的高昂代价。

第二,独立伸缩能力允许用户根据实际负载灵活调整资源。例如,可以单独增加用于生成样本的推理服务副本数量,而完全不影响Critic集群的规模。这使得资源调整不再需要整体协调,大大简化了运维操作。

第三,生命周期管理将每个角色的完整运行过程(初始化、检查点、重启)都提升到服务层面进行统一管理。这样一来,各个角色的生命周期逻辑就不再纠缠于全局训练循环中,既降低了代码复杂度,也提升了系统的模块化与可维护性。

Image

此外,Relax提供分布式Checkpoint服务,能低延迟地将更新后的权重分发到所有推理引擎,使故障恢复无需回退到磁盘检查点。该服务同时支持集群内高速传输和跨集群传输两种通道,可适配不同的部署拓扑。

Image
在异步训练的支持上,Relax集成TransferQueue(TQ)异步数据总线作为所有服务间的数据交换通道。该总线支持字段级存储,使同一样本的不同字段(如生成结果、概率值和奖励)可在不同时刻独立读写,匹配强化学习训练的多阶段计算模式。
基于此,系统仅通过一个“最大陈旧度”参数即可控制在线或离线策略模式的切换。全异步模式下,在线策略相比共用显卡方案性能提升12%,离线策略提升76%。
Image
这一性能优势来自两项关键机制:一是流式微批调度,将全局批次拆分为微批,每个微批完成后立即交付下游消费,避免长尾样本阻塞整个步骤;二是Actor Train资源分离,将概率计算部署在独立显卡资源上并行执行,通过异步传输完全掩盖在训练时间内。
最后,Relax还实现了对全模态数据的原生支持,可统一处理图像、音频、视频等输入,结合模态感知并行与端到端异步流水,提升多模态训练效率与可扩展性。
在30亿参数的多模态模型上,基于图文音频数据和视频数据进行的强化学习训练均能稳定收敛,其中视频数据可持续训练超过2000步。
Image

针对Agentic RL多轮推理、工具调用和搜索增强等场景,Relax将基础设施与算法关注点剥离,支持业务灵活接入。

比如,用户可以自定义Rollout与Reward。Relax支持多轮Agentic工作流,每个推理轮次可接收新的视觉输入,生成服务维护会话状态,数据总线独立追踪每轮的字段就绪状态。奖励计算支持规则奖励、生成式奖励模型和自定义接口三种模式。

此外,工具调用可以作为异步服务调用,融入rollout循环。

Image
03.
结语:小红书持续加码多模态
小红书AI平台团队今天开源的Relax,通过三个紧密耦合的维度,即全模态数据处理、服务隔离部署以及异步训练,来应对下一代强化学习工作负载所面临的挑战。
该团队透露,未来他们将继续结合多模态与Agentic RL等实际业务需求,完善训练能力与系统优化,支撑更大规模、更高复杂度的训练任务落地。
值得注意的是,小红书近期已在多模态方面连续发布了多个成果,包括图像编辑模型、OCR模型和今天开源的RL框架,这些方向与小红书自身的社区生态产生了协同,有望在小红书的服务场景中找到应用落地点。
图片
2026中国生成式AI大会预告
图片
图片
图片
图片
图片
图片
图片
图片
图片
图片
Image