TimYang

林俊旸离职后首次复盘 Qwen 路线

刚看完 Qwen 前负责人林俊旸在 X 上新帖:
From "Reasoning" Thinking to "Agentic" Thinking
在离职后首次系统地复盘了 Qwen 的思考 thinking / 指令 instruct 路线。
重要的一句是:we did not get everything right。
回顾技术路线的内部复盘,思考和指令不是简单合并就行,两种模式的数据分布和行为目标天然互相拉扯,做不好就是两头平庸。所以 Qwen 后来把 Instruct 和 Thinking 拆开,我理解更像现阶段工程边界下的务实选择,不是终态。
因此 Anthropic 那条路更像终态:推理是内置能力,不需要用户手动切换 Thinking / Instruct,而是模型自己根据任务复杂度、成本和环境反馈决定推理力度。成熟系统不该反问用户"你要我先想一下吗",而应该自己判断。
文章后半段也很重要:从"训练模型"到"训练智能体"再到"训练系统"。这其实是在说,下一阶段的核心竞争力不再只是模型会不会想,而是系统能不能在真实环境里把事做成。环境设计、rollout 基础设施、评估器鲁棒性、反作弊协议,这些东西会越来越像硬约束。
这篇文章也某种程度把行业讨论从"谁更会推理"往前推进了一步:下一阶段真正拉开差距的,可能是环境、工具链和系统工程。
几个要点 👇
1️⃣ thinking / instruct 分开的问题仍然是个难点。
2️⃣ 终态大概率不是让用户选模式,而是模型自己决定该花多少推理预算。
3️⃣ Agent 时代的核心变量,正在从数据多样性转向环境质量。
4️⃣ Reward hacking 会在智能体场景下变成真正的大问题,所以环境设计会是研究前沿。
原文地址:
https://x.com/JustinLin610/status/2037116325210829168
#AI #大模型 #AgenticAI #智能体 #推理模型 #Qwen #Claude #强化学习 #模型训练 #AI趋势