小红书全模态新作开源!最高提速76%
第一,故障隔离机制确保单个服务(例如因内存溢出而崩溃的推理服务)的故障不会扩散到其他角色。系统采用两级恢复策略,能够区分无状态角色和有状态角色,避免了因某一个角色出错而导致整个训练任务全局重启的高昂代价。
第二,独立伸缩能力允许用户根据实际负载灵活调整资源。例如,可以单独增加用于生成样本的推理服务副本数量,而完全不影响Critic集群的规模。这使得资源调整不再需要整体协调,大大简化了运维操作。
第三,生命周期管理将每个角色的完整运行过程(初始化、检查点、重启)都提升到服务层面进行统一管理。这样一来,各个角色的生命周期逻辑就不再纠缠于全局训练循环中,既降低了代码复杂度,也提升了系统的模块化与可维护性。
此外,Relax提供分布式Checkpoint服务,能低延迟地将更新后的权重分发到所有推理引擎,使故障恢复无需回退到磁盘检查点。该服务同时支持集群内高速传输和跨集群传输两种通道,可适配不同的部署拓扑。
针对Agentic RL多轮推理、工具调用和搜索增强等场景,Relax将基础设施与算法关注点剥离,支持业务灵活接入。
比如,用户可以自定义Rollout与Reward。Relax支持多轮Agentic工作流,每个推理轮次可接收新的视觉输入,生成服务维护会话状态,数据总线独立追踪每轮的字段就绪状态。奖励计算支持规则奖励、生成式奖励模型和自定义接口三种模式。
此外,工具调用可以作为异步服务调用,融入rollout循环。