DeepSeek R1科普,推理模型进入“1美元时代”
最近,AI 界发生了许多事情,加上春节这个节点,由于国家层面对 DeepSeek 的高度重视,以及诸多媒体的报道,身边的家人朋友们也开始谈论起来 AI,是不是让你眼花缭乱?其实许多业内人士也有同感。
一会冒出一个 R1,一会冒出一个 o1、o3...,这篇文章将最近一些的重要东西梳理清楚,一文让你了解清楚一些重要的 AI 事件。
时间线:过去几个月的关键事件
过去一些激动人心时刻:
2024年9月12日:o1预览版发布
2024年12月5日:o1正式版及o1-pro发布
2024年12月20日:o3宣布,全面攻克ARC-AGI基准测试,被誉为“AGI”
2024年12月26日:DeepSeek V3发布(基础大语言模型)
2025年1月20日:DeepSeek R1发布,性能媲美o1且开源
2025年1月25日:香港大学成功复现R1结果
2025年1月25日:Huggingface推出开源项目open-r1,完全复现R1
2025年2月1日:o3-mini发布
划重点
o1、o3、R1:均为推理模型,通过对基础模型微调实现。
DeepSeek V3:基础大语言模型(LLM),推理模型的训练起点。
ARC-AGI:一项旨在对人类简单但对 AI 极难的基准测试。AI 若通过此测试,表明其具备人类水平的适应性思维。
根据 François Chollet 的修正:“ARC-AGI-1是设计为对流体智能的最基础评估。未通过意味着AI在陌生场景中几乎无法适应或解决问题。”
推理模型 ≠ 智能体
推理模型:通过生成大量“思考”标记(token)寻找答案,本质是生成文本。
智能体(Agents):需具备自主决策能力和与外界交互能力,依赖软件系统(甚至硬件)实现。
当前瓶颈:推理能力是智能体的核心。若推理能力达标,智能体的其他挑战(如行动规划)或将迎刃而解。
为何 R1 如此重要
成本低廉:运行成本仅为o1的1/30,性能相当。
开源验证:R1的论文几乎完全揭示了OpenAI的o1技术路径(OpenAI科学家已证实),证明其核心是简单强化学习(RL),而非复杂方法(如DPO、MCTS)。
引爆创新:开源后,社区迅速复现R1(有人声称仅花费30美元),推动快速迭代。例如:
R1-Zero:仅用GRPO训练的版本,性能更强但会中英文混杂输出(可能与多语言概念表达效率有关)。
1.5B参数临界点:模型若大于此规模,无论使用GRPO、PPO还是PRIME,推理能力均会自发涌现。
AI 技术轨迹:四大驱动力
1、推理时间缩放定律:模型“思考”越久(生成更多标记),表现越好。
早期尝试:蒙特卡洛树搜索(MCTS)、Entropix路径优化等。
最终答案:链式思考(CoT)结合强化学习(R1/o1已验证)。
2、模型小型化:GPT-4 Turbo、Claude等模型体积持续缩小,以降低延迟、提升推理效率。
3、强化学习(RL):R1使用基础RL(如GRPO)训练CoT,无需复杂验证器或外部LLM。
4、模型蒸馏:通过迭代式“自我蒸馏”(用旧版本生成训练数据),学生模型可超越教师模型。
行业推测:OpenAI/Anthropic可能通过“大模型训练→蒸馏→再放大”的循环持续突破。
2025年预测:加速无休止
预训练瓶颈:数据与算力驱动的传统缩放定律失效,但新路径(推理缩放、蒸馏、小型化、RL)已填补空白。
地缘政治:盗蒸(Distealing)
中美博弈:美国重金投入,中国工程师突破出口限制寻求廉价方案,欧洲聚焦监管/开源。
技术窃取争议:DeepSeek是否“盗蒸”o1技术?复现实验表明可能性低,但中美技术竞争将加剧。
结论
R1 的横空出世,正在逐步揭开了 OpenAI 的技术黑箱,为 AI 发展提供了清晰路线图。尽管信息洪流令人眩晕,但未来路径已逐渐明朗,AI 进化正在加速,且无减速迹象。
内容参考:
https://timkellogg.me/blog/2025/01/25/r1
关注公众号,用极客视角洞察未来!
往期精彩文章推荐:
1.深度分析丨下一个3000亿美元Agents市场,附案例分析