后训练才是答案?用外挂专家 LoRA 改造 GLM 5.2
一、
大家关注衍生模型吗?
说实话,我以前是不关注的。基于其他模型加工出来的模型,能力都由底层模型决定,给人一种仿制品和正品的感觉,好像没啥可关注的。
但是,我最近遇到一个朋友,他让我的想法发生了变化。
他说,不少前沿团队其实都在探索“衍生模型”这条路子。在这些实验室里,大家甚至都认为,后训练是目前创新最多的领域。
因为对于模型开发来说,开发衍生模型其实是更合理的行为。别人花了大价钱训练出来的权重,免费开源出来,为什么不利用呢? 对于原始模型,做一些强化,以较小的代价获取想要的结果,这很值得探索。
听上去好像很有道理啊。
他进一步举例,他们现在就在做强化学习模型,基于目前很红的 GLM 5.2 打造出来了 Macaron V1[1](马卡龙),做了后训练和功能增强。
GLM 5.2 的评分已经很好了,他们修改以后,自己测了基准,分数还更高了。
上图中,蓝色柱子是 Macaron V1,绿色柱子是 GLM 5.2。
下面我就说说他们的做法,如何基于别人的模型进行开发。大家可以从中了解衍生模型是怎么来的。
二、
他们采用的方法叫做 Mixture-of-LoRA(MoL)。
根据我的理解,MoL 架构大概就是下图这个样子。这是我画的,不一定准确。
简单说,就是额外增加一个路由层,下面挂载了四个 1B 参数的 LoRA 专家(微模型)。
LoRA 是 Low Rank(低序)的缩写,表示这里的专家比 GLM 5.2 内置的专家,级别要低。
路由层收到用户输入的内容,会在四个专家里面挑选一个进行处理,再将专家的处理结果与原始模型 GLM 5.2 的结果进行加权融合,得到最终结果。
这种结构的好处,就是专家是外挂的,可以根据需要进行增加,不会动摇已有知识。不同的专家还可以组合。缺哪方面的行业专家,直接外挂一个就行了,不需要改变原始模型。
有些同学可能已经看出来了,这种 MoL 架构跟“混合专家模型(MoE)”很像。确实如此,我觉得原理是一样的,不同之处是 MoE 是模型的内部专家,MoL 是模型的外部专家。
三、
回到上面这张图,可以看到 Macaron V1 挂载了四个外部专家。
•LoRA0:对话(chat)。•LoRA1:智能体(agent),可以理解成对应 OpenClaw 的能力。•LoRA2:编程(coding)。•LoRA3:可视化渲染(UI4A)。
这就是它为 GLM 5.2 优化的四个能力,目标是微调原始模型的行为,让它更符合用户需求。
这种外挂专家,不仅可以加强能力,还能改变原始模型的很多参数。
比如,GLM 5.2 的上下文窗口是100万 Token,但是 Macaron V1 加大到200万 Token。他们将这种方法开源了,项目名为 LongStraw[2],好像对于各种模型都适用,可以增大现有模型的上下文窗口。
读到这里,大家应该明白了,衍生模型不是原始模型的简单复刻,而是深度加工,可以改变行为和增强功能。
四、
我要来了 Macaron V1 的 API,测了一下,看看跟原始的 GLM 5.2 有没有差异。
我主要测它外挂的专家,第一个就是测试对话和文本处理。
测试一:以一男一女对话的形式,介绍北京的生活。
Macaron V1
GLM 5.2
这两段对话差异很大,一段是介绍老北京的生活,一段是介绍北京打工人的生活。但是从各方面看,文学性、内容丰富、阅读感受等,还是前一段的结果更理想。
看来 Macaron V1 的外挂专家,对 GLM 5.2 的改变相当大。
五、
接下来,测试代码能力。要求是生成一个 2D 的网页游戏《愤怒的小鸟》。
Macaron V1
GLM 5.2
首先,两者的 UI 很相似,小鸟和砖头的样式都很接近,说明 Macaron V1 确实是基于 GLM 5.2 衍生的。
但是,Macaron V1 明显实现得更好,不仅多出了砖头上面的小猪,而且撞击砖头的效果也更生动,游戏性更强,说明外挂的 Coding 专家也是起作用了。
我顺便测了上周刚发布的 Kimi K3,让它也生成《愤怒的小鸟》。不知为何,结果很不理想,小鸟甚至都弹不出去。
Kimi K3
六、
Macaron V1 还有一个 GLM 5.2 没有的特色功能,就是可视化渲染的专家 UI4A。它能够在 Web 窗口实时可视化展示模型的生成结果。
这个功能最好跟开源工具 macaron-artifacts[3] 配套使用。那是一个定制的大模型 Web 界面,里面就实现了 UI4A 的可视化展示。
安装以后,它会起一个本地服务 http://localhost:7878,就是基于浏览器的大模型 Web 使用前端。
这个对话框的生成结果就是可视化展示,即对话结果会以图形方式展示,用户还能跟图形互动。
举例来说,你要求生成一个 3D 魔方,它就实时展示出来,你还可以在窗口直接操作魔方,请看视频。
Macaron V1 UI4A
作为对比,GLM 5.2 的官方 Web 界面[4],同样的提示词只会展示代码和文字(下图)。
七、
经过上面的简单测试,可以看到,Macaron 的 Coding 表现要比 GLM 5.2 好一些,还加入了自己的特点,比如生活化对话、GUI、2M 长上下文等。
作为 GLM 5.2 的衍生模型,Macaron V1 不仅具有 GLM 5.2 的功能和表现,还做了深化和拓展,优化了代码的生成结果。
费用方面,两者的定价是一样的。
因此,个人的日常使用可以考虑这个模型。它相当于 GLM 5.2 + 外挂的四个专家,而且这四个专家都针对个人生活场景(对话、Agent、代码和可视化渲染),实用性很强。
总之,如果你要使用某个大模型,可以同时关注它的衍生模型,有时候可能是更好的选择。
(完)
References
[1] Macaron V1: https://macaron.im/mindlab/research/introducing-macaron-v1[2] LongStraw: https://github.com/MindLab-Research/longstraw[3] macaron-artifacts: https://github.com/mindverse-ltd/macaron-artifacts[4] 官方 Web 界面: https://bigmodel.cn/trialcenter/modeltrial/text?modelCode=glm-5.2