MiniMax 是在“卷”自己吗: M2.7 的自进化
一、简介
昨天,MiniMax M2.7[1] 发布了。
我都惊了,上一个版本 M2.5 发布才一个月,中间还有春节,居然这么快就有新版本。
官方的宣传语这次是“开启 AI 自我进化”。
这是什么意思,难道模型自己进化出了新版本,所以升级这么快?
二、模型的自进化
我读了一下发布说明,这次确实是“模型自己迭代自己”。
根据介绍,这个模型接受用户输入后,会自动生成一个 Agent Harness。这是跟以前不一样的地方。
我查了一下,这个英文词组好像是“测试框架”的意思,指的是一组约束条件。
模型会根据这组约束条件,自主评估本次的表现,根据评估结果,进入下一轮迭代,直到取得最优结果,从而实现“自己迭代自己”的效果。
“运行过程中,Agent 完成每轮迭代后会形成一个短时记忆 md 文件,同时对当前轮次的结果进行自反馈,从而给下一轮次提供潜在的优化方向,下一轮次基于所有历史轮次的记忆及自反馈链进行下一步的自优化。”
如果是软件项目,模型的行为就是“优化某一个点 → 自我评估优化结果 → 结果不理想,修改代码 → 运行评测 → 对比结果 → 决定保留或回退”,这样的迭代循环可以超过100轮。
官方说,采用这种机制训练出来的模型,表现非常好。
“在 MLE Lite 22道高难度竞赛中,取得9金5银1铜,得牌率 66.6%,仅次于 Opus-4.6(75.7%)、GPT-5.4(71.2%),与 Gemini-3.1 持平。”
业内最看重的 SWE Bench Pro,得分也是仅次于 Sonnet 4.6、Opus 4.6、GPT 5.4 等国外旗舰模型。
三、编程能力
看了官方介绍,我着手测了一下它的实际编程能力。
我用的是自己的测试题库[2]。这个题库以前也测过 MiniMax M2.5,这样就能比较结果。
我直接说结论:编程能力比上一个版本有进步,但是幅度不算大,体现在细节有改进。
(1)网页设计测试。结果跟上次类似,表现非常好,设计要求都做到了,可以不修改,直接上线。
(2)网页游戏《愤怒的小鸟》测试。跟上次一样,生成的游戏是可玩的,细节有进步,但是小鸟和弹弓的形状还是不逼真。
(3)全栈测试。PHP Laravel 框架转 JS 的 Next.js 框架,结果堪称完美,上次有一个小接口的数据没有正常显示,这次没有这个问题。
(4)网页 2D 动画测试。物理实验《麦克斯韦小恶魔》的动画展示,比上次的效果更好,粒子运动更逼真,运行起来资源占用小。
大家可以跟上一个版本的评测对比一下。
四、Skill 能力
官方这次对于编程能力其实没有多谈,提到的亮点之中,更显著的是 Skill 能力的提升。
调用各种 skills 和工具、并在长程交互中保持稳定的指令遵循。M2.7 在这些方面有大幅提升,……能保持 97% 的 skills 遵循率。
他们还发布了一个官方 Skill 仓库[3]。我印象中,这好像是第一家国内大模型公司这么做的。
因为刚刚发布,里面的 Skill 还不多,只有6个。
提供的能力包括了前端、全栈、iOS、安卓和 3D 渲染。
官方 Skill 的安装,可以参考仓库说明[4],根据你的 Coding Agent 进行选择,我的是 Claude Code。
我做了一个小测试,先测一下不用 Skill 的效果。
生成一个网页,用户可以加载 SQLite 数据库文件,在页面展示该数据库的实体关系图。生成时不要使用 Skill。
页面结果如下(不带 Skill)。
第二次同样的提示词,但要求使用 Skill。
调用 frontend-dev skill,生成一个网页,用户可以加载 SQLite 数据库文件,在页面展示该数据库的实体关系图。
可以看到,调用技能以后,页面更美观,细节处理更到位。
更重要的是,不用 Skill 时,生成的应用带有后端,需要起一个后端 Python 服务来读取数据库。使用前端 Skill后,变成了一个纯静态页面,没有了后端,全部在前端,SQLite 数据库由前端 WebAssembly 脚本处理。
五、数字化办公
发布说明还提到另一个亮点:Office 文件处理能力有大幅提高。
M2.7 对 Office 三件套 Excel/PPT/Word 的复杂编辑能力显著提升,能更好地完成多轮修改和高保真的编辑。
我试了一下,要求它生成上市公司的研究报告。
收集贵州茅台年报和新闻信息,撰写一份 Word 文档研究报告和 Excel 图表,并基于 PPT 模版产出 PPT。
模型反馈的生成结果如下。
下面就是实际生成的 Office 文件。
因为我没有提供模版,页面单调了一点,但是基本内容是完整的。
根据说明,MiniMax M2.7 的强项是,可以根据指令,对 Office 文件进行高保真的多轮编辑,而且能够处理复杂的 Excel 报表,支持数据处理的金融公式和脚本,这里暂时就不测了。
六、其他功能
发布报告还提到了其他一些亮点,比如科研能力,可以求解高难度的数学题。
还有角色扮演,可以覆盖群聊、游戏等多种场景,具备人设保持和对话能力,很适合与 OpenClaw 配合使用。
我看到一个示意图,在游戏里面,对不同角色调用不同 AI 完成任务。
我对这个功能很感兴趣,可惜不知道怎么测,希望官方能出一个教程。
七、总结
使用以后,我觉得 MiniMax M2.7 比上一个版本确实有明显提升,而且支持的场景多,许多场合都能用。
编程和文字处理是它的强项,尤其是复杂问题。
如果它真的做到了“自我迭代”,可能距离全自动的“自进化”也不远了。我很好奇,下一个版本会是什么样,又需要多久。
(完)
References
[1] MiniMax M2.7: https://minimaxi.com/models/text/m27[2] 测试题库: https://github.com/ruanyf/ai-test-case[3] 官方 Skill 仓库: https://github.com/MiniMax-AI/skills[4] 仓库说明: https://github.com/MiniMax-AI/skills/blob/main/README_zh.md