刚刚,DeepSeek R1论文更新,增加了64页
DeepSeek R1 的论文有了大更新,足足增加了64页! 我们用 Gemini 快速总结了一下,发现新增了许多细节内容: 1. 训练全路径首次大公开:四阶段管线 v2 版本详细披露了 R1 从零到 1 的 4 个关键阶段。 Stage 1:冷启动。利用数千条高质量长 CoT 数据进行 SFT,让模型先「学会思考」。 Stage 2:推理导向 RL。专注于数学、代码等硬核任务,引入「语言一致性奖励」解决 v1 中提到的语种混杂问题。 Stage 3:拒绝采样与再微调。收集约 60 万条推理数据和 20 万条通用数据(如写作、创意),让 R1 既会算题也会写诗。 Stage 4:全场景对齐 RL。最终提升模型的助人性与安全性。 2. 「Aha Moment」的数据化验证 v1 只是提到了模型会自发「反思」,而 v2 通过词频分析给出了科学证据。 关键发现:在训练到约 8000 步时,模型对「Wait」(等等)、「Retry」(重试)等词汇的调用频率暴增 5-7 倍。 结论:RL 确实让模型自发产生了检查、自我修正和重新验证的行为,这是推理能力进化的铁证。 3. 推理也有「缩放法则」:自适应算力分配 v2 新增了对 CoT 长度自适应的深入分析。 动态分配:模型学会了根据题目难度动态调整思考时间。简单的「1+1」只用不到 100 token,而超难数学题会调用超过 18,000 token。 性能提升:这种算力缩放(Scaling)让 R1 在 2024 年数学竞赛题上的 solve rate 达到了 61.8%,远超 GPT-4o。 4. 「诚实」的失败总结:PRM 和 MCTS 为什么不行? DeepSeek 在 v2 中非常大方地分享了没跑通的路径,这对学术界极具参考价值: PRM(过程奖励模型):难以定义细粒度的步骤,且容易遭受「奖励作弊(Reward Hacking)」。 MCTS(蒙特卡洛树搜索):在棋类中很强,但在 Token 生成的无限搜索空间中容易陷入局部最优,且计算开销巨大。 5. 跨越时间的验证:AIME 2025 战绩 为了证明 R1 不是靠记忆刷题,v2 补充了在模型训练完成后才发布的 AIME 2025 结果。 战绩:R1 在 AIME 2025 上取得了 75% 的解决率,接近 OpenAI o1 的 80%。这有力回击了关于「数据污染」的质疑。 6. 关于模型规模的「毒药」警告 v2 明确指出:RL 推理能力对模型基础规模有门槛 。 策略建议:小模型提升推理能力的最佳路径是蒸馏大模型(如 R1)的推理逻辑,而不是强行在 base 上做 RL。 不过有网友指出,新增内容之前在 Nature 接收的 R1 论文中已经发布过。 不知道你们有没发现更多有价值的信息?