量子位

异构分组混合专家架构上线:参数瘦身20%,推理反超传统MoE | ACL'26

MoHGE团队 投稿
量子位 | 公众号QbitAI

对于工业落地中的大语言模型,推理成本一直是核心制约因素。

传统的混合专家模型(MoE)虽然实现了稀疏激活,但强制所有专家具备相同的参数规模。这种“一刀切”的模式,往往导致面对简单词汇时算力严重浪费。

而现有的异构专家架构(如MoDSE、HMoE)虽然尝试引入多样化尺寸的专家,却极易在系统层面引发GPU负载不均衡及参数利用率低等问题,极大地限制了其在实际生产环境中的扩展。

针对这一业界痛点,中国联通数据科学与人工智能研究院团队借鉴动物智能进化规律,提出了综合性价比优于主流MoE架构的异构分组混合专家架构MoHGE(Mixture of Heterogeneous Grouped Experts)。

该成果成功入选自然语言处理顶级学术会议ACL2026,代码已经开源。

Image

技术创新:容量自适应与负载解耦的新架构

MoHGE的核心贡献在于打破了传统MoE同质化的枷锁,在保证计算高效的同时,彻底解决了异构架构的硬件调度难题。主要包含以下三大核心机制:

异构分组与两级路由(Two-level Routing)

MoHGE创新性地将专家划分为多个“组”。组内的专家尺寸完全相同,而不同组之间的专家尺寸按阶梯递增。推理时,架构采用两级路由机制:

  • 组级门控(Group Gating)首先评估当前Token的复杂度,并选出最匹配的专家组。
  • 专家级门控(Expert Gating)随后在选定的组内精准定位具体的专家。这一设计在控制路由通信开销的同时,极大丰富了专家组合的多样性。
Image

难度驱动的参数高效利用(Group-Wise Auxiliary Loss)

为了避免模型在训练中过度依赖参数量庞大、表达能力强的专家,MoHGE引入了组级辅助损失:

Image

该机制巧妙地对大规模专家组施加了基于参数量的轻微惩罚,引导模型主动将简单的Token路由到参数量更小的专家组,从而实现了模型容量与认知任务难度的动态匹配。

Image
Image

化解硬件瓶颈:全尺寸解耦分配(All-size Group-decoupling Allocation)

为解决GPU负载不均衡的落地死穴,团队设计了全尺寸解耦分配策略。

  • 该策略确保在集群分布式部署时,每张GPU都被均等地分配一套来自不同组别、涵盖所有尺寸的专家组合。
  • 辅以专门设计的组内专家辅助损失(Intra-Group Experts Auxiliary Loss),保证了被激活的同组专家在各GPU上分布均匀。
  • 双管齐下,从根本上熨平了异构架构带来的算力和显存波动
Image

实验结果:以更少参数刷新SOTA表现

在主流的多维度Benchmark(如MMLU、MATH、GSM8K等)测试中,MoHGE展现了极佳的性能与资源平衡收益:

  • 极限参数瘦身:在3B和14B规模下,相较于同等精度的传统基线MoE,MoHGE削减了约20%的整体参数量,并将每次推理实际激活的专家参数量降低了近四分之一。
  • 性能反超:在缩减参数的同时,MoHGE依然实现了媲美甚至超越传统架构的准确率,在数学逻辑推理等复杂任务上尤为突出。
  • 绝对负载均衡:严苛的路由监控数据证实,无论模型规模如何扩展,各GPU节点处理的Token数量始终保持高度一致,展现出极强的工业级扩展潜力。
Image

总结与展望

MoHGE作为一种轻量化、资源感知的混合专家架构,首次在工业应用层面完美调和了“异构专家按需计算”与“硬件底层负载均衡”之间的矛盾。该方案在确保语言模型高质量生成的前提下,大幅削减了不必要的冗余计算,为降低企业级大模型的部署成本开辟了新路径。

本文第一作者为马志骋和刘想,通讯作者为刘兆祥和廉士国,所有作者均来自中国联通数据科学与人工智能研究院(联通数据智能有限公司)。本工作聚焦于工业级大语言模型(LLM)的计算资源高效分配与大规模部署优化。

论文标题:Mixture of Heterogeneous Grouped Experts for Language Modeling
论文链接:https://arxiv.org/abs/2604.23108
代码地址:https://github.com/UnicomAI/MoHGE

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

— 完 —

【学术投稿】请在工作日发送邮件至:[email protected],标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目/主页链接,以及联系方式。

🎓 我们会 (尽量) 及时回复你 :)

🌟 点亮星标 🌟

科技前沿进展每日见