Geek Savvy

DeepSeek R1科普,推理模型进入“1美元时代”

Image

最近,AI 界发生了许多事情,加上春节这个节点,由于国家层面对 DeepSeek 的高度重视,以及诸多媒体的报道,身边的家人朋友们也开始谈论起来 AI,是不是让你眼花缭乱?其实许多业内人士也有同感。


一会冒出一个 R1,一会冒出一个 o1、o3...,这篇文章将最近一些的重要东西梳理清楚,一文让你了解清楚一些重要的 AI 事件。

时间线:过去几个月的关键事件

过去一些激动人心时刻:

Image
  • 2024年9月12日:o1预览版发布

  • 2024年12月5日:o1正式版及o1-pro发布

  • 2024年12月20日:o3宣布,全面攻克ARC-AGI基准测试,被誉为“AGI”

  • 2024年12月26日:DeepSeek V3发布(基础大语言模型)

  • 2025年1月20日:DeepSeek R1发布,性能媲美o1且开源

  • 2025年1月25日:香港大学成功复现R1结果

  • 2025年1月25日:Huggingface推出开源项目open-r1,完全复现R1

  • 2025年2月1日:o3-mini发布

划重点

o1、o3、R1:均为推理模型,通过对基础模型微调实现。

DeepSeek V3:基础大语言模型(LLM),推理模型的训练起点。

ARC-AGI:一项旨在对人类简单但对 AI 极难的基准测试。AI 若通过此测试,表明其具备人类水平的适应性思维。

根据 François Chollet 的修正:“ARC-AGI-1是设计为对流体智能的最基础评估。未通过意味着AI在陌生场景中几乎无法适应或解决问题。”

推理模型 ≠ 智能体

Image

推理模型:通过生成大量“思考”标记(token)寻找答案,本质是生成文本。

智能体(Agents):需具备自主决策能力和与外界交互能力,依赖软件系统(甚至硬件)实现。

当前瓶颈:推理能力是智能体的核心。若推理能力达标,智能体的其他挑战(如行动规划)或将迎刃而解。

为何 R1 如此重要

成本低廉:运行成本仅为o1的1/30,性能相当。

开源验证:R1的论文几乎完全揭示了OpenAI的o1技术路径(OpenAI科学家已证实),证明其核心是简单强化学习(RL),而非复杂方法(如DPO、MCTS)。

引爆创新:开源后,社区迅速复现R1(有人声称仅花费30美元),推动快速迭代。例如:

  • R1-Zero:仅用GRPO训练的版本,性能更强但会中英文混杂输出(可能与多语言概念表达效率有关)。

  • 1.5B参数临界点:模型若大于此规模,无论使用GRPO、PPO还是PRIME,推理能力均会自发涌现。

AI 技术轨迹:四大驱动力

1、推理时间缩放定律:模型“思考”越久(生成更多标记),表现越好。

  • 早期尝试:蒙特卡洛树搜索(MCTS)、Entropix路径优化等。

  • 最终答案:链式思考(CoT)结合强化学习(R1/o1已验证)。

2、模型小型化:GPT-4 Turbo、Claude等模型体积持续缩小,以降低延迟、提升推理效率。

3、强化学习(RL):R1使用基础RL(如GRPO)训练CoT,无需复杂验证器或外部LLM。

4、模型蒸馏:通过迭代式“自我蒸馏”(用旧版本生成训练数据),学生模型可超越教师模型。

  • 行业推测:OpenAI/Anthropic可能通过“大模型训练→蒸馏→再放大”的循环持续突破。

2025年预测:加速无休止

预训练瓶颈:数据与算力驱动的传统缩放定律失效,但新路径(推理缩放、蒸馏、小型化、RL)已填补空白。

地缘政治:盗蒸(Distealing)

中美博弈:美国重金投入,中国工程师突破出口限制寻求廉价方案,欧洲聚焦监管/开源。

技术窃取争议:DeepSeek是否“盗蒸”o1技术?复现实验表明可能性低,但中美技术竞争将加剧。

结论

R1 的横空出世,正在逐步揭开了 OpenAI 的技术黑箱,为 AI 发展提供了清晰路线图。尽管信息洪流令人眩晕,但未来路径已逐渐明朗,AI 进化正在加速,且无减速迹象。

内容参考:

https://timkellogg.me/blog/2025/01/25/r1


关注公众号,用极客视角洞察未来!

Image

往期精彩文章推荐:

1.深度分析丨下一个3000亿美元Agents市场,附案例分析

2.深入解析DeepSeek-R1丨以惊人低成本实现与o1比肩的推理能力

3.DeepSeek-R1推理模型全面对标OpenAI o1模型