可能是国内最好的编程养虾利器,自我进化模型 MiniMax M2.7 来了
自从入了 Vibe Coding 和养龙虾的坑,我就成了 Token 消耗大户,但我一点不慌,因为我的 Claude Code 和 OpenClaw 都用了 MiniMax M2.5,“Coding Plan 年度会员”为我提供了编程养虾利器,Token 基本上敞开用,五小时回一次血,我从来没用完过。
上周 MiniMax 的同学告诉我,M2.7 已经来了,池老师先用为快呗,白名单开起来。于是我把 Claude Code 和 OpenClaw 都改成 M2.7 极速版,继续燃烧 Token,完成我的任务。
对了,这次我把 M 家的 Skills 都装了,MiniMax 全家桶和 Claud 全家桶,大概几十个 Skill,M2.7 调度起来游刃有余。这次 M2.7 的核心能力之一就是加强指令遵循、Skills 调用和复杂任务拆解能力,加装上这些 Skill,对于用户来说可谓是如虎添翼,用起来十分方便。
Skills 是开源的,地址在这里:
https://github.com/MiniMax-AI/skills
安装方式也很简单:
claude plugin marketplace add https://github.com/MiniMax-AI/skillsclaude plugin install minimax-skills
我记得上次开白测试 M2.5 还是在 2 月初,时隔一个多月 M2.7 就发出来了,速度不可谓不快,那么这次 M2.7 要解决的问题是什么呢?我觉得核心就是增强了模型的工具属性和多 Agent 能力,能够很好的实现 Agent Teams 研发模式,让工具找到工具,工具调用工具,实现 Agent 之间的原生写作,完成高度复杂的生产力任务。
这几天用下来,感觉 MiniMax M2.7 开始从一个强模型向工程级别的生产系统进化了。
1
我们先来看看 M2.7 的工程能力。
新模型到手,正好用来分析和构建我之前的 Vibe 项目:RSS-Reader。这个项目是我之前基于 M2.5 做的一个 Vibe 项目,一行代码没写过,最多编辑一下配置文件,从零开始完成了一个可以用的多媒体阅读器,我现在每天都在用,大概长这样:
左侧是我日常订阅的信息员:包括 Blog、播客、视频和推特作者的内容等等,中间是文章或推文列表,右侧是文章或播客主题。Rss-Reader 目前可以记录文章和音频的播放位置,已读未读状态,如果播客里有带时间轴的 shownotes,会自动展示。侧边栏可以收起,有阅读器,主题,支持沉浸式阅读。所有项目都是基于 MiniMax M2.5 + Claude Code 完成,中途用 Codex 做了些交叉验证。
后面这个项目还有很多规划中的特性要做,不过我现在打算让 M2.7 先给我诊断一下这个项目,我告诉它:分析和检查一下 @rss-reader/ 项目,看看有什么问题,如何继续完善技术和产品特性,把分析报告做成 Solarized light 主题风格的网页。结果就是,我得到了一份详尽的项目分析报告:
最神奇的是,M2.7 不仅给出了技术栈分析、主要代码问题、技术债务,还包括我缺失的功能——或者说我后续想做的部分功能——总结了一份“产品功能缺失”,最后直接给出了 P0、P1、和 P2 三个修复建议,这个工程能力就有点逆天了。
看完这份报告,我有一种错觉:不是我在使用 M2.7,而是它要带着我把这个玩具项目,迭代成真正的产品。
2
好,现在我们来试试 M2.7 的 Agent Harness(调度框架) 能力,能不能完美实现 Agent Teams 研发模式。
我们通过 Claude Code 创建一个 Agent Team 进行多 Agent 协作开发,这应该就是 M2.7 的强项:
现在我就有了一个 Leader Agent,三个模块 Agent,开始协作开发:
然后我把 accept edits 设置成 on,四个小伙伴就自己商量着干活去了:
当一个 Agent 的工作完成之后,Leader 会自动重新分配任务。另外,如果你额外分配一些任务 Leader 会直接接手开始干活,而不是打断其他 Agent 的工作。
好,以前的技术债和风险基本都搞定了,我们现在开发一个新功能:点开一个订阅源的时候,在文章列表的顶部增加一个全部已读的功能,再加一个手动刷新的功能。手动刷新可以主动拉取订阅源的最新内容。这个功能不复杂,Agent 很快就完活儿了:
效果如下:
后面我又随手加了一个阅读列表,把喜欢或者待看的文章扔进去,也轻松完成了。全程使用了 accept edits on 模式,我只需要提出修改意见的时候和 Agent 沟通就好了,这是成品:
这是我订阅的 AK 大神的推特列表:
整体用下来我的感觉是,M2.7 不仅工程能力大大增强,多 Agent 协作不会乱,速度也非常快。尤其是完成一个单点功能,几分钟就搞定了,当然这也得益于我开通了 Coding Plan 极速版的原因。
在多 Agent Team 的使用上,我倾向于让多 Agent 做并行开发独立的功能点,效率高也不容易出错。目前 M2.7 的编程能力、工程能力、设计和审美都很强,基本上一个 Agent 一个功能模块,并行做,速度贼快。只要规划得好,只有你想不到,没有它做不到的。
3
编程厉害,养虾自然不在话下。我家里 Mac mini 上的模型也上了 M2.7:
用起来一样得心应手。有用户咨询我开源项目 PaddleOCR 的用法,我把问题直接丢给龙虾,让它出了一份墨问笔记:
然后直接给我保存了一份墨问笔记,我用预览的方式发给了用户,照着做去了:
早上用户在墨问群里聊天,我有点摸不着头脑(夫妻双方的名字都写错了)。丢给龙虾问是咋回事:
龙虾给了准确的解读和纠错,并且默默把正确的名字加粗了。给 M2.7 点个赞 😂
如果你也养虾,推荐你试试 MiniMax M2.7,就我的体感,真的是非常能打,Token 足,聪明,速度快,还有自我进化能力。
4
对,这次 M2.7 最吸引我的一点,是它展示了模型真正的自我进化路径。
第一步,它可以在给定的 Agent Harness 调度框架下,把一条完整的研发流水线跑起来。比如在一个 RL 实验里,从启动实验、监控状态,到自动看日志、排查问题、看指标、改代码、提 merge request、做冒烟测试——大量原本需要多团队配合的活——都可以交给 Agent 做,人类研究员只在关键节点做决定即可。
第二步,它不只是用 harness,还会“改造工具箱”本身。看 MiniMax 的技术报告,M2.7 在内部 scaffold 上优化模型的软件工程过程里,会自己跑一个循环:分析失败原因 → 规划修改 → 改 scaffold 代码 → 评测 → 对比结果 → 决定保留还是回退。这个循环自动跑了一百多轮,最后在评测集上的效果提升了 30%。
第三步,也是最有想象力的一步:它开始直接优化别的机器学习模型。在 MLE Lite 的 22 道高难度竞赛题上,M2.7 通过 Agent 连续迭代,每一轮都会写一份短时记忆 md 文件,总结本轮得失,再给下一轮提供改进方向。就这样滚动下去,最好的一次拿到了 9 金 5 银 1 铜,整体得牌率 66.6%,已经逼近当下顶级模型,只比 Opus-4.6 和 GPT-5.4 略逊一筹,与 Gemini-3.1 打成平手。
这样的进化持续进行,未来的路线就比较清晰了:模型不再只是“被训练”,而是能在相对封闭、安全的环境里,自己搭建数据、调整训练、改推理架构、设计评测,用一整套自动化流水线,逐步把自己打磨得更好。
5
每次有国产模型发新品我都特开心,尤其是自己常用的模型,因为真切感觉到中国大模型正变得越来越好,进而成为能融入日常工作流的 AI 生产力系统。
这次 M2.7 给我的感觉,就是从“一个聪明的大模型”,走向了“一个可以交付具体工程任务的生产力工具”。它能帮你分析项目、建团队,拆解任务、带着多 Agent 一起协作开发,甚至在一个相对封闭的环境里,自己迭代代码、优化模型。过去很多需要人盯着干的活,现在可以放心交给它试一试。
如果你也在 Vibe Coding 和养虾,挺推荐试试 MiniMax 的 Coding Plan 计划。我这半年一直用它做 Vibe Coding,春节后开始养龙虾也不在话下,最大的感受就是两个字:省心。
模型够快够聪明、额度够用,不用天天算着 Token 过日子,才能把 AI 工具用到极致。
毕竟,未来个人和组织比拼的,都是谁有想象力和创造力,谁能把 AI 用得更好~~
感兴趣的朋友可以体验下,通过我的邀请码,咱都有 Token Plan 的福利。