阮一峰的网络日志

MiniMax M2.5 实测,正面硬刚 Opus 4.6 和 GPT 5.3

一、引言

昨天,我刚刚放松下来,准备放假了,哪里料到一转头就看到, MiniMax 和 DeepSeek 几乎同时更新了。

Image

MiniMax 发布了新旗舰模型 M2.5[1],DeepSeek 是小版本的参数更新。这是暗战吗,还是大家都赶在春节前发布新模型……没办法,我只能坐下来细看,新版本有什么改进。

MiniMax 的 M2 系列是国内顶尖的编程模型之一,之前一段时间,我日常用的就是它的 M2.1 模型。这次肯定要跟着升级。

我问 MIniMax 的同学要了内测账号,测了一下它的编程能力,比较了最新的两个国外旗舰模型 —— Claude Opus 4.6 和 GPT-5.3-Codex —— 看看它们之间有没有差距,能不能用国产替代进口。赶在放假前,把测评文章写出来。

二、M2.5 简介

根据官方说明,这次的 M2.5 在好几个方面都做了增强。

(1)编程与智能体性能(Coding & Agentic)对标 Opus 4.6,基准测试 SWE verified 得分(80.2)与 Opus 4.6 持平(下图)。

Image

(2)智能体架构深度优化,具备极强的任务规划与长链路执行能力,适配国内外各类 agent。

(3)运行速度快,吞吐量可以达到 100 TPS(每秒100个 Token),是 Opus 的近2倍。

(4)适合私有化部署,激活参数量仅为 10B,是参数规模最小的旗舰模型。显存占用和推理能效比,也具有优势。

三、测试方法

我上周专门做了一个测试库 ruanyf/ai-test-case[2],收集各种 AI 编程的测试用例。

Image

这些用例都能在本地运行,但又有一定的复杂性,不那么容易搞定。

我打算,以后不管什么模型,都用它们跑一下,为生成结果打分(比如,最高5分,最低1分)。加一下总分,就知道模型的强弱了。

我已经有 Opus 4.6 和 GPT 5.3 的测试结果,可以看前面的文章[3]。现在,就来测 MiniMax 2.5。

四、网页设计测试

第一个测试是网页的重构和设计能力,要求将下面这个简陋的网页,重构为美观、易用、有专业感的登陆页。

Image

下面是 MiniMax M2.5 的重构结果,原始文件和提示词见上面的仓库[4]。

Image
Image
Image
Image
Image

这个重构可以说达到了要求:信息分类清晰呈现,设计简洁合理,滚动流畅,页面代码看不出毛病,电脑和手机都正确展示。

Image

如果要说问题,就是这个设计太“素”了,颜色比较冷淡,不活泼,中规中矩,难以第一眼就打动人。不过,对于 TO B 类工具,这不算大问题,而且配色是 AI 后期可以调整的。

为了方便对比,我把前面文章的 Opus 4.6 生成结果复制过来。

Image
Image
Image

以及 GPT-5.3 的生成结果。

Image
Image
Image

我觉得,MiniMax 2.5 至少不输给 Opus 4.6,但好于 GPT 5.3。

五、网页游戏测试

第二个测试要求生成网页游戏《愤怒的小鸟》。

这次的生成结果不错。

Image

游戏的运行效果正确,整体是可玩的,而且有一定的趣味。

Image

将小鸟从弹弓发射出去,它会击碎砖块。

Image
Image

从图片上看不出来,整体的动画效果非常流畅,没有任何滞碍,砖块碎裂带有粉碎效果。

另外,每一轮都会计算得分,小猪都被清除后,就会出现过关动画和音效。

Image

需要改进的地方是,小鸟落地后不会弹起来,小猪只有命中才会消失,否则就挂在空中,不掉下来。

下面是 Opus 4.6 的生成结果。

Image
Image
Image

GPT-5.3 的生成结果令人尴尬,小鸟根本弹不出去,游戏不能玩。

Image
Image

我认为这一轮,MiniMax M2.5 只在画面上稍逊于 Opus 4.6,游戏性是相当的,跟 GPT-5.3 相比,则是大胜。

六、Laravel 转 Next.js

第三个测试要求将一个 PHP 语言 Laravel 框架的网页应用,转为 JavaScript 语言的 Next.js 框架。

MiniMax 的生成结果很正常,完全符合预期,运行起来很顺利。

Image

搜索一个城市,可以查看它的天气、日出日落时间、空气质量和地图。

Image
Image

Opus 4.6 和 GPT 5.3 的生成结果也都很成功,这一轮就算打平。

七、网页动画测试

最后是 2D 动画测试,要求 AI 模型生成“麦克斯韦小恶魔[5]”的动画演示。

“麦克斯韦小恶魔”指的是,物理学家麦克斯韦设想的一个场景。两个相连的房间,里面有无数高速运动的粒子,中间的大门由一个小恶魔控制。它只允许左侧房间的高速粒子进入右侧房间,右侧房间的低速例子进入左侧房间。

下面就是 MiniMax M2.5 的生成结果,两个房间刚开始都分布着许多运动的粒子。

Image

过了一段时间,高速运动的红色粒子逐渐集中到了右侧房间。这就跟麦克斯韦预想的结果一致,属于违反热力学第二定律的一个场景。

Image

从技术上来看,这次的动画没有大问题,大量粒子的个体运动都很平滑,机器处理起来比较轻松,拿到手机上也可以正常运行(下图)。

Image

下面是 Opus 4.6 的生成结果,

Image

以及 GPT 5.3 的生成结果。

Image

这三个结果都达到了要求,在动画上可以算打平,但是在视觉效果和数据面板方面,MiniMax M2.5 看上去更吸引眼球。

八、总结

经过上面四轮测试,可以看到 MiniMax M2.5 的表现都是可圈可点,不输给当前的顶尖模型。

它可以作为 Opus 4.6 和 GPT 5.3 的国产替代。即使某些方面有差距,更多表现在细节上,而不是实质上。更何况,它的价格只是两个国外模型的几分之一。

MiniMax 公司的规模并不大,相比国外巨头,算是小公司,算力资源也不足,能取得这样的成绩,真的很不简单。我非常期待未来 M3 版本的发布。

(完)

References

[1] 新旗舰模型 M2.5: https://www.minimaxi.com/news/minimax-m25
[2] ruanyf/ai-test-case: https://github.com/ruanyf/ai-test-case
[3] 前面的文章: https://www.ruanyifeng.com/blog/2026/02/glm-5.html
[4] 仓库: https://github.com/ruanyf/ai-test-case
[5] 麦克斯韦小恶魔: https://baike.baidu.com/item/%E9%BA%A6%E5%85%8B%E6%96%AF%E9%9F%A6%E5%A6%96/618888