后训练时代如何延续Scaling Law?这是你该读的LLM后训练综述
机器之心报道
论文标题:LLM Post-Training: A Deep Dive into Reasoning Large Language Models 论文地址:https://arxiv.org/abs/2502.21321 资源库:https://github.com/mbzuai-oryx/Awesome-LLM-Post-training
RAG 可通过动态检索外部知识来提高事实准确性,从而缓解静态训练数据的局限性。 分布式训练框架可利用并行处理来管理大规模模型的高计算需求。 测试时扩展可根据任务复杂性动态调整参数来优化推理。 修改深度、宽度或活动层可以平衡计算效率和输出质量,使其适应资源有限或多变的条件。
显示显式奖励建模 隐式奖励建模 结果奖励建模 过程奖励建模 使用自适应奖励模型的迭代式强化学习
胜算比偏好优化(ORPO) LLM 中的近端策略优化(PPO) 基于人类反馈的强化学习(RLHF) 基于 AI 反馈的强化学习(RLAIF) 信任区域策略优化(TRPO) 直接偏好优化(DPO) 离线推理优化(OREO) 组相对策略优化(GRPO) 多样本比较优化
冷启动强化学习阶段 拒绝采样和微调 面向推理的强化学习 用于人类对齐的第二个强化学习阶段 蒸馏以获得较小模型
指令微调 对话(多轮)微调 CoT 推理微调 特定于具体领域的(专业)微调 基于蒸馏的微调 偏好和对齐 SFT 高效微调
集束搜索 Best-of-N 搜索(拒绝抽样) 计算最优扩展 思维链提示 自我一致性解码 思维树(Tree-of-thoughts) 思维图谱(Graph of Thoughts) 基于置信度的采样 针对验证者进行搜索 通过优化实现自我改进 蒙特卡洛树搜索(MCTS) 行动-思维链推理 预训练与测试时扩展
推理 强化学习对齐 多语言评估 通用理解 对话和搜索