Nature Portfolio

《自然》封面故事:DeepSeek-R1的科学 ︱2025年9月18日刊

Image
Image

封面图片:Nik Spencer/ Nature.

封面故事

DeepSeek-R1通过强化学习激励大语言模型进行推理

大语言模型(LLM)如果能被训练成在解答过程中设定步骤,就能更好地解决问题。这种“推理”过程类似于人类解决复杂问题的方法,但对人工智能非常困难,需要人类干预来添加标签和注释。在本期《自然》中,DeepSeek 的研究者揭示了他们如何训练模型不仅能以这种方式推理,而且尽量减少人为干预。DeepSeek-R1模型使用强化学习训练,当它正确解答数学问题时能得到高分奖励,错误时则受到惩罚。从中它学到,推理——逐步解决问题并揭示这些步骤——更可能实现正确解答。这让DeepSeek-R1能自我验证和自我反思,在给出答案前检查自身表现,从而提升在编程问题以及研究生水平的科学问题上的表现。

《自然》论文:DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning

长按并识别右方二维码,阅读全文→

Image

相关阅读

《自然》封面故事:碳排放大户与热浪︱2025年9月11日刊

《自然》封面故事:万物有时︱2025年9月4日刊

《自然》封面故事:活立木的微生物组︱2025年8月28日刊

点击“阅读原文”发现更多新鲜Nature精彩内容