DeepSeek-R1通过强化学习激励大语言模型的推理能力 |《自然》论文
近期来自DeepSeek的研究团队在《自然》发表了论文“DeepSeek-R1通过强化学习激励大语言模型的推理能力”(DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning),欢迎阅读文章了解详情。
通用推理能力一直是人工智能(AI)领域中长期存在且艰巨的挑战。近年来,以大语言模型(LLMs)和思维链(CoT)提示为代表的技术突破,在基础推理任务上取得了显著进展。然而,这些进展在很大程度上依赖于大量人工标注的示范数据,且现有模型的能力仍不足以应对更复杂的问题。
在本研究中,来自DeepSeek的研究团队展示了如何通过纯强化学习激励大语言模型的推理能力,从而无需依赖人工标注的推理轨迹。他们所提出的强化学习框架能够促生出高级推理模式,例如自我反思、验证以及动态策略调整。因此,训练后的模型在数学、编程竞赛以及STEM领域等可验证任务上表现出了更优性能,其表现超越了通过基于人工示范的传统监督学习所训练的同类模型。此外,这些大规模模型所涌现出的高级推理模式还可系统性地用于指导和提升小规模模型的推理能力。
论文表1:DeepSeek-R1-Zero在整个训练过程中的准确率与输出长度变化。
扫码免费阅读论文全文
通讯作者:Wenfeng Liang(DeepSeek)
第一作者:Daya Guo(DeepSeek)
DOI:10.1038/s41586-025-09422-z
发表日期:2025年9月17日
《自然》
2024 Journal Metrics
影响因子:48.5
五年影响因子:55.0
学科排名:2/135,多学科科学
引用量:965,275
下载量:170,810,295
*数据来源:2024年Journal Citation Reports, Clarivate Analytics 2025和期刊官网
《自然》系列期刊产品试用申请
Nature Portfolio期刊是多学科研究和综述期刊的合集,自1869年起一直致力于理解、 探讨和分享科学。《自然》系列期刊目前包含42种《自然》系列研究期刊,涵盖生命科学、物理科学、临床医学和社会科学领域,以及26种《自然综述》系列期刊,为您提供权威、易于理解、意义重大的综述内容。
▲ 如果您对《自然》系列期刊产品感兴趣,愿意推荐您所在的院校或机构申请试用,欢迎扫码提交表单申请。
欢迎扫描图片二维码或点击“阅读原文”了解《自然》及其系列期刊。
版权声明:本文由施普林格∙自然上海办公室负责整理翻译。中文内容仅供参考,一切内容请以英文论文为准。欢迎转发分享本文,如需转载,请留言或联系[email protected]。
© 2025 Springer Nature Limited. All Rights Reserved