alitrack

把 Opus 和 GPT 揉在一起,跑分超了它俩

6 月 26 日,Nous Research 在 Hermes Agent 里上线了一个新功能——Mixture of Agents 2.0,简称 MoA。

效果很直观:把 GPT-5.5 和 DeepSeek V4 Pro 当"顾问",让 Claude Opus 4.8 当"总编辑",三个模型协同工作,最终在 HermesBench 上拿了 0.8202 分。

作为对比:Opus 4.8 单独跑是 0.7607,GPT-5.5 单独跑是 0.7412。

组合体比最强单体高了 8%。

● ● ●

不是「换模型」,是「组模型」

过去我们选 AI 的逻辑很简单:哪个模型跑分高用哪个。Opus 4.8 出来了换 Opus,GPT-5.5 出来了切 GPT。

MoA 2.0 换了一个思路:不让一个模型单打独斗,组一个"虚拟模型"出来。

做法是这样的:你定义一个 preset,里面配几个 reference model(顾问)和一个 aggregator(总编辑)。每次你发消息,系统先让顾问们各自分析一遍,然后把它们的看法喂给总编辑,由总编辑最终执笔。

默认 preset 的配置:

  • 顾问:GPT-5.5 + DeepSeek V4 Pro
  • 总编辑:Claude Opus 4.8

选这个 preset 之后,你用 /model --provider moa 就行了,跟切换普通模型一模一样。想单次体验的话,/moa 你的问题,用完自动切回去。

● ● ●

怎么做到的 8% 提升

三个模型各司其职,不是简单平均。

顾问模型只看到纯文本对话——不接触系统提示词,不接触工具调用记录。这么设计有两层用意:一是省 token,顾问调用的上下文很短;二是某些严格模型不接受 Hermes 的工具 schema,剥离掉就不会拒绝。

顾问们输出各自的看法之后,Hermes 把这些内容追加到你的问题尾部,作为私有上下文喂给 Opus 4.8。Opus 看到的是:原始问题 + GPT-5.5 的观点 + DeepSeek 的观点。然后它综合判断,给出最终回答,需要时照样调用工具。

顾问的输出追加在末端,不会插入历史对话。主对话的 prompt cache 完全不受影响——切换 MoA 不比换模型多花钱。

你可能会想:万一某个顾问挂了怎么办?比如 DeepSeek 的 API 临时抽风。Hermes 的处理是:把失败信息注入上下文,用剩下的顾问继续跑。不会因为一个模型掉线就整个崩掉。

MoA 架构

MoA 架构

● ● ●

跑分是真的,方向更值得聊

HermesBench 的分数(0.8202 vs 0.7607 vs 0.7412)目前来自 Nous Research 自己的内部基准。我倾向于认真对待这个数字,但不过度解读——它最有说服力的不是绝对值,是方向:两个不同的模型协作,确实比各自单干强。

这和 2024 年 Together AI 那篇 MoA 论文的结论一致。那篇论文只用开源模型,就在 AlpacaEval 2.0 上拿了 65.1%,超过了当时的 GPT-4 Omni(57.5%)。论文后来被 ICLR 2025 接收,方法论是经过同行评审的。

但这个方向的背后是更大的变化:Agent 的竞争维度在变。

以前大家比的是"谁的模型最强"。Opus vs GPT,DeepSeek vs Gemini,榜单上反复拉扯。

MoA 2.0 提了一个新问题:如果单模型的天花板就在那里,能不能通过"怎么组"来突破?

答案是能。而且一旦被工程化进 Agent 框架——变成一个 /moa 命令——就从实验室进了日常。

● ● ●

对正在做模型融合的人来说

我最近在做 OpenFusion,一个独立的模型融合引擎,对标的是 OpenRouter Fusion 的思路——把多模型融合做成一个 API,任何客户端都能调。

Hermes MoA 2.0 出来后我重新审视了一下,结论是:它在帮我验证市场,不是在跟我抢市场。

MoA 2.0 是 Agent 内嵌式的融合——你必须是 Hermes 用户才能用。它的融合策略也只有一种:reference → aggregator。

OpenFusion 要做的不同:它是一个独立的 API 层,不绑定任何 Agent 框架。融合策略也可以更丰富——分层的、投票的、成本感知路由的。简单问题走单模型省钱,复杂问题启动全融合,这些 MoA 2.0 目前做不到。

更有意思的可能性是:OpenFusion 可以作为 Hermes MoA 的一个 provider——Hermes 调用 OpenFusion API,OpenFusion 在内部做更复杂的融合,Hermes 只看到一个"虚拟模型"。这是竞争变互补的最短路径。

● ● ●

说到底

MoA 2.0 把一个问题摆到了台面上:Agent 的竞争,从「谁的模型强」变成了「谁组得好」。 8 个百分点的提升只是这个结论的注脚。

怎么选顾问、怎么分工、怎么让它们互相纠错而不是互相迎合、怎么把这一套流程变成可复用的 preset——这些问题比"等 GPT-6"更实际,也更有意思。


数据来源:Hermes Agent 官方文档 Mixture of Agents,Together AI MoA 论文 arXiv:2406.04692