MiniMax M2.5 实测,正面硬刚 Opus 4.6 和 GPT 5.3
一、引言
昨天,我刚刚放松下来,准备放假了,哪里料到一转头就看到, MiniMax 和 DeepSeek 几乎同时更新了。
MiniMax 发布了新旗舰模型 M2.5[1],DeepSeek 是小版本的参数更新。这是暗战吗,还是大家都赶在春节前发布新模型……没办法,我只能坐下来细看,新版本有什么改进。
MiniMax 的 M2 系列是国内顶尖的编程模型之一,之前一段时间,我日常用的就是它的 M2.1 模型。这次肯定要跟着升级。
我问 MIniMax 的同学要了内测账号,测了一下它的编程能力,比较了最新的两个国外旗舰模型 —— Claude Opus 4.6 和 GPT-5.3-Codex —— 看看它们之间有没有差距,能不能用国产替代进口。赶在放假前,把测评文章写出来。
二、M2.5 简介
根据官方说明,这次的 M2.5 在好几个方面都做了增强。
(1)编程与智能体性能(Coding & Agentic)对标 Opus 4.6,基准测试 SWE verified 得分(80.2)与 Opus 4.6 持平(下图)。
(2)智能体架构深度优化,具备极强的任务规划与长链路执行能力,适配国内外各类 agent。
(3)运行速度快,吞吐量可以达到 100 TPS(每秒100个 Token),是 Opus 的近2倍。
(4)适合私有化部署,激活参数量仅为 10B,是参数规模最小的旗舰模型。显存占用和推理能效比,也具有优势。
三、测试方法
我上周专门做了一个测试库 ruanyf/ai-test-case[2],收集各种 AI 编程的测试用例。
这些用例都能在本地运行,但又有一定的复杂性,不那么容易搞定。
我打算,以后不管什么模型,都用它们跑一下,为生成结果打分(比如,最高5分,最低1分)。加一下总分,就知道模型的强弱了。
我已经有 Opus 4.6 和 GPT 5.3 的测试结果,可以看前面的文章[3]。现在,就来测 MiniMax 2.5。
四、网页设计测试
第一个测试是网页的重构和设计能力,要求将下面这个简陋的网页,重构为美观、易用、有专业感的登陆页。
下面是 MiniMax M2.5 的重构结果,原始文件和提示词见上面的仓库[4]。
这个重构可以说达到了要求:信息分类清晰呈现,设计简洁合理,滚动流畅,页面代码看不出毛病,电脑和手机都正确展示。
如果要说问题,就是这个设计太“素”了,颜色比较冷淡,不活泼,中规中矩,难以第一眼就打动人。不过,对于 TO B 类工具,这不算大问题,而且配色是 AI 后期可以调整的。
为了方便对比,我把前面文章的 Opus 4.6 生成结果复制过来。
以及 GPT-5.3 的生成结果。
我觉得,MiniMax 2.5 至少不输给 Opus 4.6,但好于 GPT 5.3。
五、网页游戏测试
第二个测试要求生成网页游戏《愤怒的小鸟》。
这次的生成结果不错。
游戏的运行效果正确,整体是可玩的,而且有一定的趣味。
将小鸟从弹弓发射出去,它会击碎砖块。
从图片上看不出来,整体的动画效果非常流畅,没有任何滞碍,砖块碎裂带有粉碎效果。
另外,每一轮都会计算得分,小猪都被清除后,就会出现过关动画和音效。
需要改进的地方是,小鸟落地后不会弹起来,小猪只有命中才会消失,否则就挂在空中,不掉下来。
下面是 Opus 4.6 的生成结果。
GPT-5.3 的生成结果令人尴尬,小鸟根本弹不出去,游戏不能玩。
我认为这一轮,MiniMax M2.5 只在画面上稍逊于 Opus 4.6,游戏性是相当的,跟 GPT-5.3 相比,则是大胜。
六、Laravel 转 Next.js
第三个测试要求将一个 PHP 语言 Laravel 框架的网页应用,转为 JavaScript 语言的 Next.js 框架。
MiniMax 的生成结果很正常,完全符合预期,运行起来很顺利。
搜索一个城市,可以查看它的天气、日出日落时间、空气质量和地图。
Opus 4.6 和 GPT 5.3 的生成结果也都很成功,这一轮就算打平。
七、网页动画测试
最后是 2D 动画测试,要求 AI 模型生成“麦克斯韦小恶魔[5]”的动画演示。
“麦克斯韦小恶魔”指的是,物理学家麦克斯韦设想的一个场景。两个相连的房间,里面有无数高速运动的粒子,中间的大门由一个小恶魔控制。它只允许左侧房间的高速粒子进入右侧房间,右侧房间的低速例子进入左侧房间。
下面就是 MiniMax M2.5 的生成结果,两个房间刚开始都分布着许多运动的粒子。
过了一段时间,高速运动的红色粒子逐渐集中到了右侧房间。这就跟麦克斯韦预想的结果一致,属于违反热力学第二定律的一个场景。
从技术上来看,这次的动画没有大问题,大量粒子的个体运动都很平滑,机器处理起来比较轻松,拿到手机上也可以正常运行(下图)。
下面是 Opus 4.6 的生成结果,
以及 GPT 5.3 的生成结果。
这三个结果都达到了要求,在动画上可以算打平,但是在视觉效果和数据面板方面,MiniMax M2.5 看上去更吸引眼球。
八、总结
经过上面四轮测试,可以看到 MiniMax M2.5 的表现都是可圈可点,不输给当前的顶尖模型。
它可以作为 Opus 4.6 和 GPT 5.3 的国产替代。即使某些方面有差距,更多表现在细节上,而不是实质上。更何况,它的价格只是两个国外模型的几分之一。
MiniMax 公司的规模并不大,相比国外巨头,算是小公司,算力资源也不足,能取得这样的成绩,真的很不简单。我非常期待未来 M3 版本的发布。
(完)
References
[1] 新旗舰模型 M2.5: https://www.minimaxi.com/news/minimax-m25[2] ruanyf/ai-test-case: https://github.com/ruanyf/ai-test-case[3] 前面的文章: https://www.ruanyifeng.com/blog/2026/02/glm-5.html[4] 仓库: https://github.com/ruanyf/ai-test-case[5] 麦克斯韦小恶魔: https://baike.baidu.com/item/%E9%BA%A6%E5%85%8B%E6%96%AF%E9%9F%A6%E5%A6%96/618888