为什么 2025 的基模公司都押注 Interleaved Thinking?
这两年看大模型的迭代过程,感觉像在追剧一样,最初是对话框,后面是多模态,然后是长上下文、深度思考和工具调用,最近一集打开,台词又变了。
前几天刚发布的 DeepSeek V3.2 提到了“Thinking in Tool Use”,Kimi K2 也提出“边思考,边使用工具的能力”,其实是一个意思,就是边推理边调工具。你去看社区里的各种编程助手、托管平台,也纷纷在 changelog 里加了一句话:Interleaved Thinking 支持。
Interleaved Thinking 其实就是思维链的概念,是 Agent 时代真正的“底层能力”。
为什么想起来说这个事儿呢?因为最近所有厂商都在谈思维链。
1
大模型刚出现的时候,行业的关注点还在“它能不能把话说清楚”。那时候最常听到的词是 CoT(Chain-of-Thought),大家争论的是要不要显式展示推理过程,展示多少、怎么控制成本。
等到 Agent 的概念和工具出现之后,问题变成了:模型不仅要会想,还要会做事,还得和一堆工具打交道。单轮对话的“想清楚”显然不够用了,模型得在一长串调用里持续“记得自己刚才是怎么想的”。
Anthropic 最早在 Claude 里提出 Extended Thinking 这种机制,允许模型在回答前先有一段内部推理,再把必要的信息暴露出来。OpenAI 开源 gpt-oss 时,也跟进了类似的能力,但当时更多还停留在“少数模型、少部分应用在尝试”的阶段,是非主流。
到了 2025 年,剧情开始加速。MiniMax 在今年 10 月发布新模型 M2 上,把 Interleaved Thinking 作为设计重点之一,同时在社区里反复强调了这种机制对于 Agent 和 Coding 场景的重要性。紧接着,Gemini 3 Pro、DeepSeek V3.2 等新模型相继发布,都明确宣称支持“思考+工具调用”和“Thinking in Tool Use”的能力——这就是 Interleaved Thinking。
拉远一点看我们会发现,大模型和 Agent 的叙事在发生迁移:从“我也能用工具”“我有多少插件”,到“我怎么在工具之间保持一条连续的思维链”。
这就是今天的大模型新共识:只有把思维链真正纳入工作流,大模型才有机会变成可靠的 Agent。
2
什么是 Interleaved Thinking?为什么 Agent 会需要思维链?
举个栗子:我当年写代码修 bug 的时候,从来没有“坐在椅子上想半小时,一次性写完所有代码”的情况,更常见的做法是:想一小段、改几行、跑一下看测试结果,debug,看日志,调整代码……思考、操作、反馈,这三件事是交错发生的。
Interleaved Thinking 做的事情,其实就是把这种工作方式,变成模型的默认行为。
用技术一点的语言描述就是:模型在显式推理(reasoning)与工具调用(tool use)之间交替进行,并且在多轮交互中,持续保留和传递之前每一步的推理状态。
不是“先想完再干”,而是“边想边干,并且记得自己刚才是怎么想的”。
对 Agent 来说,这件事的重要性几乎可以直接等同于“能不能工作”。
在复杂任务里,一个 Agent 需要不断地:
规划下一步行动;
根据工具返回的结果,调整自己的策略;
记住已经尝试过哪些方案,避免重复踩坑;
在多轮交互里保持目标不跑偏,避免状态漂移。
如果每一轮调用之间,模型的推理过程都被丢掉,那就意味着它每次都要从零开始判断,计划割裂,状态漂移就成了常态。看起来很忙,但事情始终做不完。
Interleaved Thinking 把这件事机制化了:把“计划 → 行动 → 反思”变成一种可以被 API、被框架理解和承载的格式,让模型在工具调用之间保留自己的假设、约束、中间结论和纠错记录。它是一种在长链路任务中显著提升规划能力、自我修正能力和可靠性的工作方式。
从开发者的角度看,还有一个额外好处:可调试性。
有了 Interleaved Thinking,Agent 的失败不再是一个黑盒,而多了很多“快照”:在哪一步产生了错误假设、工具返回了什么、模型是怎么理解的。
3
Interleaved Thinking 从非共识到共识,其中 MiniMax 团队起到了关键作用。众所周知,MiniMax M2 的突出能力之一就是 Agent。事实上他们在内部研发 M2 的早期阶段就注意到,大多数模型在设计上并没有真正支持 Interleaved Thinking——即便模型本身已经有了比较强的推理能力,真正落地到 API、SDK、框架里的并不多。
更现实的问题是,即便模型支持了,很多上层应用也没有用对:
有的应用在调用 Chat Completions API 时,只把上一次的对话内容放回去,却把模型真正的推理过程丢在一边;
有的在做二次封装时,直接忽略了模型返回的推理字段,只把最终 content 当作“答案”。
很多产品选了个强模型,可能只发挥了一半的能力。
这时候 M2 做了一件什么事呢?他们把 Interleaved Thinking 放到了产品设计和社区叙事的中心。有了交错思维链之后,在第三方榜单 SWE-Bench(Soft Engineering Agents) 的最新测评中,M2 表现优异。
MiniMax 的设计意图很清楚:当 Interleaved Thinking 被正确使用,Agent 和 Coding 类应用的体验会发生显著改善。
等到 Kimi K2、DeepSeek V3.2、Gemini 3 Pro 等模型也开始把“边思考边用工具”“Thinking in Tool Use”写进官方文档,Interleaved Thinking 终于从少数团队的实践,变成了高性能 Agent 模型的“标配能力”。
4
我和 MiniMax 这家公司交流过挺多次,也评测过他家的产品,我觉得这家公司挺有技术理想的。一个技术走向行业标准的过程,少不了大量脏活累活。在 Interleaved Thinking 这件事上,MiniMax 做了很多推动行业向前走的事儿。
很多人不知道,我觉得值得拿出来说说。
在 MiniMax 自己的开放平台上,他们提供了 OpenAI 兼容 API 和 Anthropic 兼容 API 两种接口形式,但都做了一件共同的事:把推理内容和最终回答分离开来。以 OpenAI 兼容接口为例,M2 会通过独立的 reasoning_details 字段返回推理过程,而不是把一切混在 content 里,让开发者在下一轮可以完整地把这些思考再传回去。
这件事产生的两个连锁反应:一是提醒应用层正视“推理链”这个实体,而不是只把模型当作一个黑盒问答系统;二是给后续的标准化提供了一个可参考的范式——什么叫“结构清晰、容易解析的 Interleaved Thinking”。
M2 发布之后,社区很快给出了反馈:在 Agent 和 Coding 场景中,只要把 reasoning_details 正确保留和回传,模型的规划能力、自我修正能力会有明显提升,长期任务的稳定性会好很多。
但是,要让 Interleaved Thinking 真正成为行业标准,只在自己平台上支持还远远不够。
在过去一段时间里,MiniMax 和多个社区伙伴一起,把大量精力花在了“生态开荒”上:给 Kilo Code、RooCode、Cline、OpenRouter、Ollama 等编程工具和 API 平台提 PR,补齐它们在 Interleaved Thinking + 原生工具调用(native tool call)上的支持,保证 M2 以及其他支持该机制的模型,可以在这些平台上“开箱即用”。
这个过程并不风光,其实是很繁琐的事务,需要和不同团队来回讨论接口设计,和上游一块对齐模型字段的命名方式,写完实现之后,还要基于内部 Benchmark 和合作方一起做回归测试,确保这些实现真正对性能有帮助。
在 11 月纽约的 AI.Engineer Summit 上,MiniMax 的研究员 Olive 也专门分享了 M2 和 Interleaved Thinking 的机制设计,这些经验后来被社区多次引用和转述。
当一个概念开始在不同团队的理解里越来越趋同的时候,在某种意义上它已经在走向“事实标准”了。
MiniMax 为此还开源了项目 Mini-Agent——这是一个支持 Interleaved Thinking 的 Coding CLI(编程命令行工具)。它把如何组织多轮对话、如何保留和回传推理链、如何在工具调用之间复用中间结论这些“经验”,写成了能 run 的代码,开发者可以直接看最佳实践。该项目目前已经收获了 700 多个 Star。
对整个生态来说,Mini-Agent 起到的是“样板间”的作用:它把 Interleaved Thinking 从一个抽象概念,变成了一组可复用的工具和代码。
5
当 Interleaved Thinking 从少数模型的“特色功能”走向行业共识,它的角色也从“技巧”升级为“基建”。
对模型而言,它提供了更先进的推理机制,让模型不必在“长考一次性给答案”与“每轮从头开始”之间二选一,而能在工具调用的节奏里持续修正与累积理解。
对 Agent 应用,它提升可靠性:长链路任务的关键不在单步最优,而在反复尝试后仍沿着同一轨道推进。有了 Interleaved Thinking,Agent 能把既往计划、失败记录与中间结论当作路标继续前进,而不是每次从起点抛硬币。
对开发者,它带来更强的可观察性与调试能力。推理链被结构化保留,可做细粒度日志、错误定位、回放与 A/B;在需合规与审计的场景,过程可见性本身就是条件。
对生态,它推动接口与协议一致。随着各平台在 API 层面对齐 Interleaved Thinking 的支持,开发者不必为每个模型与平台单独适配“思维链协议”,可在统一语义下自由切换模型与运行环境。
这些基础工作,恰恰决定技术能否落地。今天谈 Agent,已不满足于 Demo。只有当这类底层机制成为行业基建,Agent 才能从实验室走向生产环境,从个人玩具走向真正的业务系统。
6
2025 这一年,我最大的感受是,国内的基座模型公司不仅在技术上突飞猛进,同时在技术标准和基础建设上做出了自己的贡献。是的,我们在创新并参与建立打磨新时代的工业标准。
像 MiniMax 公司,他们在 Interleaved Thinking 这件事上就和社区一起做了很多卓有成效的工作:在模型早期就押注更先进推理机制,并把这套机制用在真实 Agent 和 Coding 任务上,通过 Benchmark 和 OpenRouter 上的调用量证明其实践价值。
Invent2025大会上,AWS CEO宣布
Amazon Bedrock模型库迎来新成员MiniMax M2
在生态上,是愿意花时间和社区一起改代码、写文档、做开源工具,把一项能力从“少数人的技巧”变成“多数人的常识”的贡献者。
这非常不容易做到。
大模型这场“秀”还会演很多年,Agent 时代也才刚刚开始,未来还会出现新的机制、新的范式,今天的 Interleaved Thinking 也许会被进一步扩展和重构,但有一种力量永远不会轻易过时——那就是在行业喧嚣的时候,仍然有人愿意盯住底层能力,拉着社区和行业人员一起往前走。推动这件事发生的人和团队,值得被看见。