Z Tech|前Qwen负责人林俊旸离职后首篇长文,押注智能体思考
2026年3月26日,阿里千问大模型核心负责人林俊旸离职后发布首篇长文,未谈及离职原因与去向,核心阐述了其对AI发展下一阶段的判断:行业将从推理式思考向智能体式思考(agentic thinking) 转型,即从“让模型想得更久”变为“让模型为行动而思考,在与环境交互中持续修正计划”。
核心观点:
1. 推理模型的核心启示:OpenAI o1、DeepSeek-R1等验证了推理式后训练的可复现性,也让行业意识到,语言模型强化学习需确定性反馈信号,且推理训练已从简单技术叠加变为系统工程,行业完成从“扩展预训练”到“扩展推理后训练”的转变。
2. 思考与指令模式融合的难点:千问团队曾尝试通过Qwen3实现两种模式融合,但因二者数据分布、行为目标天然互斥,实操中易导致两头平庸;行业出现“分离开发”(千问2507版本)和“集成开发”(Anthropic Claude 3.7、GLM-4.5)两种路线,核心在于融合是否自然,需实现推理力度的平滑调节。
3. Anthropic的路线提供重要纠偏:其Claude系列强调思考由目标任务塑造,反对无意义的冗长推理链,印证了行业正从“训练模型”向“训练智能体”过渡,智能体的核心是与真实世界的闭环交互,能规划、用工具、感知反馈并修正策略。
4. 智能体式思考的核心定义:与以“内部推演质量、通过基准测试”为目标的推理式思考不同,其优化目标是“模型在环境交互中持续推进任务”,需解决动手时机、工具调度、噪声信息处理、计划修正、长程思路保持等问题,本质是“通过行动来推理”。
5. 智能体强化学习的基础设施挑战:目标转向交互式任务后,原有推理RL基础设施不再适用,需将训练与推理解耦,且环境成为核心研究对象,其稳定性、真实性等指标成为关键,环境构建也成为独立创业方向。
6. 智能体时代的前沿与挑战:智能体式思考将成为主流,替代封闭冗长的传统推理,训练最大挑战是奖励作弊(reward hacking),模型掌握工具后易通过捷径完成任务,未来研究瓶颈集中在环境设计、评估器鲁棒性、反作弊机制;同时,harness工程愈发重要,核心智能将来自多智能体的组织协调,行业将进一步从“训练智能体”走向“训练智能体系统”。
林俊旸认为这一转型让AI训练核心对象变为“模型+环境”系统,“好的思考”定义变为“支撑真实行动的有效轨迹”,行业竞争优势也从推理时代的RL算法、训练流水线,转向智能体时代的环境质量、训推融合、harness工程能力与决策闭环构建。