我们离理想大模型还有多远:MiniMax M3 测评
一、引言
我问大家一个问题,普通用户的理想大模型应该什么样?
在我看来,如果你要天天使用一个大模型,它最好同时满足四个条件。
(1)性能强,尤其具有强大的编程能力。
(2)上下文窗口大,最好达到100万 Token,原因见后文。
(3)多模态,不仅处理文本,还处理图片、视频、音频等,最好还能操作计算机。
(4)价格不贵,量大,便宜,管饱。
那么,有符合这些条件的理想模型吗?
很可惜,据我所知,好像没有。国外的旗舰模型倒是符合前三个条件,但是太贵了;国内的开源模型虽然不贵,但往往是单模态,做不到(文本、图像、视频、音频)全兼容,而且上下文窗口也不大。
二、MiniMax M3
本周一,MiniMax 发布了他们最新的旗舰模型 M3[1]。
我原来没在意,心想只是一次常规的版本升级,但是看了一眼发布报告[2],突然震惊地发现,它竟然同时符合上面的四个条件。
相比上一个版本 M2.7,这次升级后,上下文窗口从20万增大到100万,单模态的文本模型升级为多模态,基准测试的得分也没有降低。至于价格,有提供配套的 Token Plan。
看上去,它完全是理想大模型的候选人。
这激发了我的兴趣,第一时间就做了一些简单测试。
三、100万上下文窗口
开始之前,先解释一下,更大的上下文窗口有什么好处。
上下文窗口(context)指的是模型一次能够处理的最大 Token 数量。这个值越大,能够一次向模型提供的背景信息就越多,理论上生成的结果也会越准确。
对于大型项目和长程操作,每一轮跟模型交互,都会附带从头开始的所有操作结果。显然,大的上下文窗口对它们非常重要,不会有材料放不下的顾虑。
上下文窗口比较常见的是20万 Token,为什么不放得更大一些呢?
原因是 Token 越多,计算量越大。每一个 Token 都要计算跟其他 Token 的关系,随着上下文窗口的增大,计算量会急剧增长,从而影响模型的性能和成本。
MiniMax M3 的上下文窗口是100万 Token,属于普通用户能够接触到的最大级别。
它敢做这么大,是因为使用了新的技术方案:稀疏注意力架构 MSA。这种方案将 Token 分块和筛选,选出代表性的 Token 参与计算,从而避免了全量计算。官方介绍[3]说,同样数量 Token 的情况下,计算量仅为“上代模型的 1/20”。
“在100万上下文下,M3 每 token 计算量仅为上代模型的 1/20。在 prefilling 阶段,我们实现了超过 9 倍的加速倍率,在 decoding 阶段有超过 15 倍的加速优势。而且在多个对照实验中,MSA 的绝大部分能力与全注意力打平。”
这就是说,跟上一代相比,虽然上下文窗口增大了5倍,但是计算量反而是下降的,而且还不影响生成质量(“绝大部分能力与全注意力打平”)。
四、编程能力测试
从官方提供的测试基准成绩来看,新的技术方案的表现非常好。
“在衡量 Coding 能力的 SWE-Bench Pro 上,MiniMax M3 超过 GPT-5.5 和 Gemini 3.1 Pro,接近 Opus 4.7。
在综合评估 SVG 生成性能的基准 SVG-Bench 上,MiniMax M3 超过 Opus 4.7。”
从这些得分来看,它跟美国头部模型的能力在同一个级别。
下面,我用自己常用的那套测试题[4],测一下它的编程能力。所有生成结果,都已经部署到官方沙盒,大家可以点击每个测试的链接,进行查看。
需要说明的是,现在的顶级大模型,一般的编程题已经测不出能力极限了,只能用来看看表现。
测试一:网页 UI 重构[5]
测试二:网页 3D 动画《天文轨道模拟器》[6]
测试三:网页游戏《愤怒的小鸟》[7]。
测试四:网页 2D 动画《麦克斯韦小恶魔》[8]
测试五:SVG 图片生成《鹈鹕骑自行车》[9]
做完这些测试,我可以肯定地告诉大家,每一题的表现都比上个版本 M2.7 好,生成结果的质量都非常高,都是完全可以接受的。
就连“网页 UI 重构”这种上个版本已经做得很好的测试,这次都有改进提高,建议大家自己点进去,查看比较。
就这几个测试而言,MiniMax M3 的表现确实不输给其他顶级模型。当然,限于时间精力,这些测试都是前端相关,没有涉及更复杂的后端编程场景。
五、多模态能力
MiniMax M3 的另一大改进,是从单模态变为多模态,接受图片和视频的输入,并能操作电脑桌面。这项能力也得到了很高的测试基准成绩。
“多模态测试集 OmniDocBench 上,MiniMax M3 得分超过 Gemini 3.1 Pro,在面向自主 Agent 的端到端评测框架 Claw-Eval 上,MiniMax M3 得到最高分。”
我猜测,这个版本加入多模态,应该跟上下文窗口变大有一定关系,毕竟较大的 Token 处理能力能保证图像和视频有较好的处理效果。下面是几个简单测试。
测试六:图片理解,下面有几块红色积木?
M3 的回答:
测试七:OCR(文字识别),解读下面的财务报表截图。
M3 的回答:
测试八:视频理解,这段视频[10]0:16处的小动物是什么?
M3 的回答:
从这几个测试来看,M3 的多模态效果还不错,不仅能用来编程,还能用它处理图像和视频。
六、MiniMax Code 和 Token Plan
最后提一下,这次除了大模型以外,还发布了一个桌面客户端:MiniMax Code[11]。
它对标 Claude Code 和 Codex,主要用来编程。
它的底层是开源项目 OpenCode 和 Pi Agent,针对 M3 做了优化,官方推荐两者一起使用。
这个桌面端除了编程,还具备 Computer Use 能力,可以连接手机,通过手机来操作电脑。
官方举了一个例子,你可以对着手机说:“帮我打开本地 ERP 客户端,按这份 Excel 批量录入发票信息”。这个桌面端就会按照命令操作。我这次主要测大模型,就没测这个桌面端,但是我觉得,这个软件本身就有着巨大的想象空间。
这个桌面端和网页端还有配套的 Token Plan[12],提供按量计费的套餐。
这次的套餐,跟以前相比,有所变化。据官方说明[13],因为 M3 的 Token 消耗增加,套餐从按次改成了按 Token 计费,并且增加了每周限额。最便宜套餐是每月49元,6亿 Token,一般个人使用应该够了。即使如此,相比其他 Token 套餐,还是十分有性价比。
以前没有周限额的 Token Plan,在二手平台上,现在变成高价出售。这也从一个侧面说明,它的套餐还是挺受欢迎的。
七、总结
初步试用后,我对 MiniMax M3 的印象非常正面。因为以前从 M2.5 升级到 M2.7 时变化不大,我对它的期望并不高,但是测试下来,M3 的这次升级非常有感,在各个方面都明显强于 M2.7。
再加上,它的上下文窗口加大到100万 Token,以及原生支持多模态,所以我觉得,这个模型值得推荐,国内好像没有其他开源模型同时做到这些点。
综合来看,MiniMax M3 是一个各方面很均衡、都不弱的模型,符合理想大模型的条件:性能强,适用面广,价格不高,适合日常使用,也可以给龙虾那样的智能体使用。
这次只是简单测测,我后面还会进一步测试,也建议大家试试这个模型,共同探索它在复杂场景下的表现。
(完)
References
[1] 旗舰模型 M3:https://www.minimaxi.com/models/text/m3[2]发布报告:https://www.minimaxi.com/blog/minimax-m3[3]介绍:https://www.minimaxi.com/blog/minimax-m3[4]测试题:https://github.com/ruanyf/ai-test-case[5]网页 UI 重构:https://rclbzya2xln3.space.minimaxi.com/[6]《天文轨道模拟器》:https://f1qk78kfu1tx.space.minimaxi.com/[7]《愤怒的小鸟》:https://5a98vxbyruy2.space.minimaxi.com[8]《麦克斯韦小恶魔》:https://jlxev7520nc1.space.minimaxi.com[9]《鹈鹕骑自行车》:https://yv6thlmhtvfg.space.minimaxi.com[10]这段视频:https://www3.cde.ca.gov/download/rod/videosample1.html[11]MiniMax Code:https://agent.minimaxi.com/download[12]Token Plan: https://www.minimaxi.com/
[13] 官方说明: https://platform.minimaxi.com/docs/token-plan/migration