MacTalk

最近试了一个有意思的新模型,聊聊 Macaron V1

Kimi K3 暂停订阅了,GLM 5.2 是抢不到,海外模型封号,咋整呢?其实还有选择,比如我最近在试用的 Macaron V1——Mind Lab 昨天刚刚发布的面向个人 Agent 场景的开源模型。

新模型发布,大家总是习惯先找排行榜、价格和参数量,我更感兴趣的是它真实的 Coding 和 Agent 能力。Mind Lab 把这条路线概括为“适应”与“协作”:先用 LoRA 给不同能力留下相对独立的训练空间,再通过强化学习持续优化,最后用基础设施和 Harness 把这些能力带进真实任务。Macaron V1 值得聊,也在于这些环节已经连成了一套可以实战的模型系统。

这么说估计大家还是有点晕,简单来讲,Macaron V1 是心洲科技旗下 Mind Lab 面向个人 Agent 场景发布的开源模型,包含 Venti 与 Tall 两个版本:

Venti 共 748B 参数,由 744B 基础模型和四个 1B LoRA 组成,采用 GLM-5.2 基座,原生支持 2M 上下文;

Tall 为 35B,基于 Qwen3.6 后训练,面向本地部署。

一个大,偏前沿能力;一个小,适合本地部署,Mac 上就能跑。参数大家都能明白,不过呢,Venti 更值得关注的是,744B 基座之外的四个 LoRA。它们决定了 Macaron V1 如何组织不同能力,也牵出这款模型的一个关键问题:为什么要把能力拆开训练,又怎样避免它们相互干扰?要回答这个问题,得先从 LoRA 说起。

1

LoRA 是 Low-Rank Adaptation 的缩写,中文通常译为“低秩适配”。

可以这么理解:一个大模型拥有几千亿参数,想让它学会新技能,直接重新训练全部参数成本很高。LoRA 会冻结原来的大模型,只在部分网络层旁边增加一组很小的可训练参数。训练时只更新这些小模块,就能调整模型的行为。也就是说:

基础模型提供通用知识和推理能力;

LoRA是装在基础模型上的“技能插件”;

不同 LoRA:可以分别负责聊天、编程、工具调用、生成界面等能力,它的优势是训练成本低、文件较小、容易切换和回滚,还能在同一个基础模型上挂载多个专业版本。

Macaron V1 用了四个 LoRA,解决大模型后训练中的“能力干扰”。

在后训练中,如果把聊天、工具调用、编程和界面生成的数据放在一起,训练同一组参数,不同任务的优化方向可能发生冲突。例如:

聊天希望语言自然、有弹性;

编程要求语法严格、输出精确;

Agent 强调规划和工具调用;

GenUI 需要生成结构完整的交互界面。

当这些能力共同修改一套参数时,增强编程能力可能让聊天变得生硬;加强自由对话,又可能降低代码输出的稳定性。这就是“互相打架”。

Macaron V1 的做法是把这四类能力分别放进四个 LoRA:

L0:Chat

L1:Agent

L2:Coding

L3:GenUI

基础模型负责共享的知识和推理能力,每个 LoRA 在相对独立的参数空间中优化自己的专业能力。收到新请求后,L0 判断任务类型并路由到合适的 LoRA。这样可以减少不同任务在训练时相互干扰,也方便单独升级、评测和回滚某项能力。

过去,人们通常把 LoRA 看成一种节省训练成本的微调方法。Mind Lab 更看重它的另一层价值:让一个很小的模块长期保存模型在特定场景中形成的偏好、技能和工具使用习惯,而基础模型继续提供通用知识和能力。

研究显示,用 LoRA 做强化学习,算力和通信开销大约只有全参数训练的十分之一;即使把模块压缩到每层只调整一个方向,它仍然可以稳定学习。因为模块足够小,每项能力都可以单独训练、测试、上线和回滚,也可以与其他能力灵活组合。

Image

MoE、Skills 与 MoL 三种能力扩展路径

2

今天的 Agent 已经高度依赖 Memory、RAG、Skill 和 Harness。这些方法有一个共同特点:经验保存在模型外部,需要使用时再放进上下文,让模型重新阅读。它们更新快,也适合保存事实、规则和操作流程,但随着内容不断积累,上下文会越来越长,信息冲突和维护成本也会随之增加。模型读过一段历史,并不意味着它真正学会了其中反复出现的规律;参数学习则更进一步,把经过验证的经验写进可训练状态,让新的行为成为模型下一次工作的起点。

我更愿意把这两条路径理解为不同时间尺度的记忆。临时信息放进上下文,常用事实交给 Memory 和 RAG,逐渐稳定的行为习惯写入 LoRA,经过长期验证的通用能力再回到基础模型。这样的分层既能控制学习和更新成本,也为评估与回滚保留空间。

对于长期维护同一代码库的 Coding Agent,这种方式比不断增加上下文更有吸引力。

当 LoRA 可以被低成本地复制、训练和组合,增加模型数量也成为提升能力的一条路径。在一组控制实验中,Qwen3-30B 的单个 Adapter 在 AIME24 上准确率为 36.44%;让 198 个拥有不同学习经历的 Adapter 分别作答,再进行多数投票,准确率提升到 48.67%。相比之下,对同一个 Adapter 重复采样,最高只能达到 43.78%。这说明不同训练经历能够形成互补能力,而 MoL 可以通过路由选择合适的专家,让“这项任务交给谁”也成为推理过程的一部分。

Image

不同学习轨迹的 adapter协作随模型数量扩展

3

这种技术选型真正难的部分在基础设施。

在 30B 模型上进行强化学习,已经需要很强的工程能力;当模型扩大到千亿参数级的 MoE 架构,训练难度还会显著上升。训练和推理在数值精度或执行路径上稍有偏差,奖励信号和生成结果就可能发生漂移,最终导致训练难以收敛。模型被拆分到多张 GPU 后,还必须保证各个切片之间的通信、计算和状态同步始终一致。

Macaron V1-Venti 的意义,正在于它把 LoRA强化学习带到了 748B 规模。

做模型研发的同学应该能理解,这个很了不起。

MinT 就是支撑这件事的后训练基础设施。也是核心竞争力。

在这套系统中,负责生成训练经验的 Actor 与负责更新模型的 Learner 之间,只需要传递轻量的 Adapter,无需反复搬运完整的模型权重。系统可以统一管理上百万个拥有独立身份和版本记录的 LoRA,并支持最高万亿参数规模模型的训练与部署。模型版本、GPU 集群和分布式训练被纳入同一套管理体系后,一个共享基座上就能运行大量不同的个性化状态,LoRA 也由此从一种实验性的训练方法,走向可以长期运行的服务能力。

Image

MinT 连接用户可控训练与底层分布式基础设施

长上下文强化学习是另一道硬骨头。传统强化学习需要保留训练过程中的大量中间结果,还要对同一个提示词生成多个回复、计算奖励并更新参数,因此模型能在推理时读完一百万 Token,并不意味着训练时也能处理同样长的内容。

Mind Lab 为“超长上下文强化学习”设计了一套训练方法和执行系统,叫 LongStraw,在 8 张 H20 GPU 上,这套方法把 Qwen3.6-27B 的 GRPO 训练长度推进到 210 万 Token,也为 Macaron V1 的 2M 长上下文提供了后训练层面的支撑。

4

看了Mind Lab 的技术说明,Macaron V1 还有一处容易被忽略的设计:Harness 与模型是一起训练的。

模型训练时使用的工作环境,尽量与上线后的真实环境保持一致。如果把模型看作“大脑”,Harness 就是它调用工具、保存状态和完成任务的“工作台”。UI4A 让模型通过代码把回答变成可交互的页面;REPL Harness 则允许模型把已经验证过的代码保存成工具,以后遇到类似任务时直接复用。HCP 负责统一管理运行过程中需要的规则、技能和模型配置,MindForge 再把这套工作台带进强化学习。这样一来,模型在训练中学会的工具和工作方式,到了真实产品里依然可以使用,从而减少“实验环境表现很好,上线后却无法正常工作”的问题。

模型在各个领域基准线上的评分也很亮眼。

Image

5

目前 MinT 官方 API 已经上线了,我这周就在用 Claude Code + Macaron-V1-Coding-Venti 做功能,官方提供了 CC Switch 的配置,可以一键导入:

Image

配置完成打开 CC,模型已经就位了:

Image

我用 Coding Venti 做了 CatReader 智能翻译其中的一个功能 — 默认显示翻译好的译文:

Image

速度很快,完成度也很不错。

使用过程里我还在 CC 里安装了他家的插件 Macaron Artifacts,启动后访问:http://localhost:7878,如下:

Image

我们可以通过这一套 WebUI 观察模型和项目的运行情况,也可以直接在这套控制台里做任务,还是非常方便的。

Macaron V1 给我们打开了一个新视野,它把个人 Agent 最难的几个问题解决了:经验如何形成学习信号,如何用轻量参数吸收经验,如何让大量专家共存协作,又如何让训练条件贴近真实运行环境。这条路现在已经从论文概念走到模型、Infra 和开发工具。

对关心 Agent 未来发展的朋友,Macaron V1 绝对值得认真用一下。