MiniMax M2 发布即爆,拿下开源模型第一名
前阵子和一位设计师聊天,他们公司在做一款 Vibe Coding 产品,他自己都快转产品经理了,成天写提示词,测试产品,一通操作猛如虎,钱花了,效果还是很拉垮。
我总感觉这方向有点问题,当时有个直觉,纯粹的 Vibe Coding 工具,有可能被基座模型厂商顺手推出的 Agent 给收敛掉。
这个直觉很快被验证了,ChatGPT 在今年 7 月推出 Agent 之后,一直在优化 Agent 的动手能力。国内当然也没闲着,这不,10 月 27 日大模型厂商 MiniMax 发布了新一代文本大模型 M2,并推出由 M2 驱动的 MiniMax Agent。
这款开源模型相当厉害,推出即成爆款,发布三天登上 OpenRouter 平台全球调用量第四、编程场景第一。在第三方评测机构 Artificial Analysis 的测试中,Minimax M2 以 61 分获得了开源模型第一名,全球第五。
MiniMax-M2 是一个庞大的 Mixture of Experts(专家混合)模型,总参数量达 230B,但每次激活参数只有 10B。也就是说,它能在需要时像巨型模型一样思考,却只花费小模型的推理成本。
M2 驱动 Agent,实现了从模型到 Agent 的一体化方案:大脑足够聪明,手脚也要灵活高效。MiniMax 称其为一款“轻量级模型”,却拥有“最大”的编程与智能体工作流能力。
M2 的目标很明确:以更低成本和更快速度支撑 Agent 与编程的端到端(从输入到输出全流程一次搞定,无需中间干预)工作流,在复杂工具调用、深度搜索与代码开发等场景,接近世界前沿的智能表现,同时将价格压至 Claude Sonnet 的约 8%、推理速度提升至约 2 倍,让高效 Agent 更智能,更可用,价格也更加实惠。
更具体地说,M2 不仅能够提升多步任务的规划和稳定性,还能协同调用 Shell、Browser、Python 和各类 MCP 工具;写代码支持多文件编辑、运行和调试;同时通过高效激活参数的设计与长上下文窗口,在智能、速度与成本之间取得更好的平衡。
1
过去两年,AI 世界吵得最热的就是“Vibe Coding”“长程规划”“多文件协同”等等,但真正能把“编码—运行—调试—修复”闭环跑通的模型并不多。现在看起来,M2 是要从模型层面把这条链补齐:既能写代码、改代码,还能自己把项目跑起来、对着测试用例过一遍,再把失败的用例修复掉。从 Chat 到 Action,Agent 不再停留在 demo 里。
更值得关注的是明确的数据信号:M2 在 Artificial Analysis(AA)综合榜单进入全球前五,开源第一;在 OpenRouter 调用量跻身全球第四、编程场景第一。这种实打实的数据说明:这不是一次仅仅参数好看的升级,而是一个能把任务端到端跑通、可以被开发者持续调用、并且能在成本与速度上进入可用区间的“生产力大模型”。
榜单数据最容易误读的地方在于“单项冠军”式的幻觉。M2 这次的定位更像“全能工程师”:数学、科学、编码三条线全方位出击,网页端编程能力在 LMArena Web Dev 评测中全球第四(超过 Claude 4.5);
同时,MiniMax-M2 在一系列强调端到端编码和智能体工具使用的基准测试中表现优异。这些任务(如 SWE-bench, Terminal-Bench, BrowseComp, HLE (w/ tools), FinSearchComp-global 等)的执行,和开发者在终端、IDE 和 CI 中的日常体验是高度相关的。
这也解释了 M2 为什么会在开发者社区里的迅速扩散,x.com 和 reddit 上的 AI 从业者和开发者对 M2 称赞有加。比如 HuggingFace 的联合创始人 Thomas Wolf 就说:
2
在我看来,M2 这次祭出了三件武器:代码、Agent、Deep Search。
一、代码闭环。M2 支持多文件、多步长交互,能在本地/沙箱里把项目跑起来;配合 Terminal-Bench 与(Multi-)SWE-Bench 类任务,体现的是“把编译过一遍”的确定性。编码—运行—调试这条链条顺畅与否,决定了它是否能真正替人分担。
二、Agent 能力。M2 不是单点模型,而是 Agent 的底座:会规划、会拆解、会调度工具。它能调用 Shell、Python、浏览器以及第三方 MCP 工具,遇到错误能自我纠错、从断点恢复。在 BrowseComp 这类强调检索、验证与可追溯性的基准里表现稳健,这种“可追责的自动化”是工程场景的刚需。
三、Deep Search。复杂任务成败常常取决于“找到对的材料”。M2 在 Xbench-DeepSearch 全球前二(仅次于 GPT-5),在 字节的 FinSearchComp-global 金融搜索基准上全球前二(仅次于 Grok4),意味着它在结构化事实搜集与证据拼接方面具备相当竞争力。
围绕上述能力,MiniMax Agent 给出了两种模式:专业和高效。
专业模式:面向复杂长程任务,如全栈开发、深度研究、PPT 生成。
高效模式:轻量高速,适合问答、轻代码、快速搜索等大多数任务,通过 Agentic 的工具协同来“降维打击”传统 Chat 模型。
用户可以根据自己需求在这两种模式之间切换。
3
能干活的模型是什么样呢?纸面上的指标终究要回到屏幕上的结果。目前 M2 全球限时免费两周,那我肯定是要试试看,M2 的“手”到底有多稳。
我首先把一篇 27 页的英文 pdf 丢给 MiniMax Agent(https://agent.minimax.io),这是一份 2025 年 AI 相关的人才就业信息,给出的任务是:
把这篇 2025 年 AI 人才就业报告翻译成中文并作成 20 页左右的 PPT,格式简洁,参考乔布斯演讲的幻灯片风格。
后面就是 MiniMax Agent 的 show time 了:
最后,一份极简风格的幻灯片就做出来了:
https://lyyxopngoyfe.space.minimax.io
这个任务的难点是,27 页的英文报告需要整合成 20 页的中文幻灯片,幻灯片还要采用乔布斯演讲的极简风格,从结果看,MiniMax Agent 完成得相当不错。
第二个任务是基于墨问的知识库设计稿,做一个可以动态交互的知识库首页。事实上这正是我们当下在做的工作。设计稿如下:
任务指令是:
这是墨问知识库的首页设计稿,知识库的名字叫(让时间为你证明),请根据设计稿完成动态首页的实现,能够简单交互和演示。
MiniMax 又开始干活了:
经过几次交互确认之后,MinxMax Agent 完成了这份工作:
https://f32vvzk842fm.space.minimax.io
第三个任务是研究报告,我的提示词是:
目前很多大模型厂商都在把自家模型和 Agent 集成在一起,可以直接完成类似 Vibe Coding 的任务,那么之前独立的 Vibe Coding 产品会不会被取代并失去使用价值。另外研究一下 Vibe Coding 工具和类似 Cursor、Trae 这样的 AI IDE 未来的发展方向。
MinxMax Agent 在深度研究和搜索方面的表现更加驾轻就熟,很快给出了一份翔实的报告,包括摘要、发现、产品分析、趋势预测和战略建议等等。如果我是一个 Vibe Coding 产品的创始人,相信这份报告是有价值的。
把这些案例合在一起,会发现一个共同点:提示词清晰简短即可,AI 不明白的地方会和用户进行二次确认,结果却是越来越完整了。当模型开始在系统里调度工具、尊重设计规范、对齐实现目标时,“写提示词”的技能边际价值下降,“交付成果”的能力上升了。
4
功能强不意味着价格贵,特别是在 2025 年。M2 的输入 tokens 每百万单位是 $0.3 / 输出是 $1.2(约合人民币 2.1 元 / 8.4 元)的标价,价格仅仅是 Claude 的 8%;再加上 ~100 TPS 的吞吐和阶段性的全球限时免费,它把“强模型”拉进了规模使用的区间里。对于个人开发者与中小团队,这等于把迭代成本和试错半径都缩小了一圈。
简单来说就是,赶紧用啊,有羊毛薅的时候别犹豫,薅完羊毛价格也能接受。
更重要的是模型和产品的打磨:“模型和 Agent 一体化”把模型与应用端到端优化到一体化系统里,延迟更低、吞吐更高,同时“更懂任务”。这就是模型和 Agent 结合的优势:跨系统的“胶水”越少,Agent 的反馈回路就越短。
5
如果说当年的 ChatGPT 把自然语言和 AI 对话变成了一种可能,Claude 把自然语言编程变成了一种可能,现在,M2 这一类强调工具链协作与自动调整的模型,就是把“能干活”这件事大规模地推了下去。
从 Chat 到 Action,从语言智能到行动智能,应该是这代模型的分水岭。M2 与 MiniMax Agent 的组合把“模型”与“Agent”焊接在一起,成为一个协作者:它像一个会自己找资料的新人,会照着规范写页面、会看测试修 bug、会把研究笔记整理成 PPT。我们需要的不再是一段灵感,而是一个会干活、能复盘、敢上生产线的数字同事。
可以用起来了:agent.minimax.io