Z Tech | LMSYS 团队发布大规模 MoE 强化学习框架 Miles,不积跬步无以至千里
True On-Policy(严格在线策略):为了消除训练与推理之间的微小偏差,Miles 采用了基于基础设施的方法,结合 Flash Attention 3 和 DeepGEMM,实现了训练与推理的严格一致性。 引入 MTP Online Training 的投机采样: 针对 RL 场景,Miles 在训练过程中对 Draft Model 进行在线 SFT,解决了分布偏移问题,实现了 25%+ 的 Rollout 加速。 极致的显存优化:Miles 实施了包括 NCCL 显存余量控制、部分 Offloading 及 Host 峰值内存节省在内的一系列改进,大幅减少大规模 MoE 训练中的 OOM 风险。
原生高性能:对 SGLang 和 Megatron 的全栈优化提供原生支持,紧跟推理与训练框架的快速迭代。 清晰的模块化设计: 算法(Algorithm)、数据(Data)、采样(Rollout)与评估(Eval)四大组件完全解耦。研究人员仅需极少的代码修改即可插入新的 Agent 类型或奖励函数。 对模型科学家友好: 所有抽象层均保持高可读性。算法研究员无需触碰底层代码即可修改重要性采样(Importance Sampling)或 Loss 动态,且框架提供了独立的 Inference-only 和 Training-only 调试模式,便于快速诊断。
引入了传播机制以规避良性 OOM 导致的错误; 实现了显存余量机制(Memory Margin)以修复 NCCL 导致的 OOM; 修复了 FSDP 中的额外显存占用问题; 支持基于 Move 的部分 Offloading 以及 Host 端峰值内存节省策略。
性能提升: 相比于冻结 MTP(Medusa-Tree-Pruning)基线,该方法实现了 25% 以上 的 Rollout 加速,尤其在训练后期效果显著。 功能完备: 支持带 Sequence Packing 和 Context Parallel (CP) 的 MTP;处理了 Loss Mask 的边缘情况;实现了 LM Head/Embedding 的梯度隔离,以及 Megatron 与 SGLang 之间的权重同步。
增强 FSDP 后端: 提升了大规模分布式训练的稳定性。 独立部署 Rollout: 允许 Rollout 子系统脱离框架独立部署,适应更灵活的集群调度。 调试工具集: 新增了更多监控指标、Post-hoc 分析器及增强型 Profiler。 数学形式化验证: 提供了包含 SFT/RL 脚本的 Lean 语言形式化数学示例。
新硬件支持: 在 GB300 等下一代硬件上运行大规模 MoE RL 的示例。 多模态训练: 扩展对 Multi-modal 模型的支持。 Rollout 加速: 兼容 SGLang Spec v2 以获得更高性能;推进 EAGLE3 及 Multi-spec layer 等更先进的投机训练技术。 弹性训练: 实现针对大规模异步训练的计算资源均衡分配,以及对 GPU 故障的弹性容错(Elastic to GPU failures)。