华为+DeepSeek,推理性能创新高!技术报告也公布出来了
金磊 发自 凹非寺
量子位 | 公众号 QbitAI
部署
超大规模MoE
这件事,
国产芯片
的推理性能,已经再创新高了——
不仅是“英伟达含量为0”这么简单,更是性能
全面超越
英伟达Hopper架构!
- CloudMatrix 384超节点 部署DeepSeek V3/R1,在50ms时延约束下单卡Decode吞吐突破 1920 Tokens/s
- Atlas 800I A2推理服务器 部署DeepSeek V3/R1,在100ms时延约束下单卡吞吐达到 808 Tokens/s ,可支持灵活的分布式部署
在华为昇腾上推理DeepSeek
在深挖华为昇腾背后技术创新之前,我们且需了解一下为什么要这么做。 从2017年Google提出的Transformer架构,到2025年DeepSeek V3/R1的爆红,大语言模型的重心正在从训练开发转向推理应用落地。 推理能力不仅是大模型能力的“试金石”,各大企业已从 “拼模型参数” 转向 “拼推理效率”: 谁能让大模型在实际应用中跑得更快、更稳、更省资源,谁就能在商业化浪潮中抢占先机。 然而,以6710亿参数的DeepSeek V3为例,这类超大规模MoE模型虽然强大,却给硬件带来三大 “成长烦恼”:- 内存压力山大 一个模型包含257个专家,每个专家 “体重” 2.5G,普通64GB内存的AI硬件根本 “扛不动”,必须依赖集群协作。
- 通信开销爆炸 专家分布在不同芯片上,数据传输耗时甚至超过计算时间,就像团队成员频繁开会沟通,效率大打折扣。
- 架构创新的 “甜蜜负担” 例如 “多头隐式注意力机制(MLA)” 虽然压缩了数据空间,却导致中间变量激增,对芯片的计算能力提出更高要求。
还有更多优化技术
在 推理框架优化 方面,针对高并发场景下单点API Server这一性能瓶颈,华为团队设计了API Server横向扩展方案,采用水平扩展技术提升框架的请求响应能力,显著降低用户请求延迟并提高整体服务吞吐量(QPS)。 针对MoE模型中的负载不均问题,基于动态调整专家部署与缩小通信域、热专家冗余部署、实时调度与动态监控机制等核心技术,降低显存占用的同时实现动态负载均衡。 在 投机推理技术 的工程化应用中,如何将其从小批量低时延场景扩展至高吞吐量场景,是行业面临的共性难题。 华为团队基于昇腾芯片高计算带宽比的硬件特性,提出FusionSpec投机推理引擎,针对性优化多Token预测(MTP)场景下的推理性能:- 流程重构 将投机模型后置於主体模型,直接复用主体模型的输出结果与控制参数,大幅减少框架耗时,完美适配参数-数据分离(PD 分离)的分布式部署架构;
- 轻量步间优化 对投机推理场景中的框架和算子优化实现了轻量步间准备,适配多核并行的全异步框架。
- 计算通信并发 通过Gate函数计算与AllGather通信的解耦,结合共享专家的数据并行(DP)策略,利用昇腾多流机制实现计算与通信的并发执行,最大化硬件利用率;
- 通信通信并发 针对DeepSeek模型的量化场景,将激活值与scale的传输任务并行处理,在不增加带宽压力的前提下掩盖小数据量通信的启动开销;
- 通信和权重预并发 利用通信阶段HBM带宽低占用特性,提前将后续算子权重预取至缓存,降低计算阶段的数据搬运开销,实测MLA层计算性能提升10%。
- 算法重构:提出AMLA算法,通过二进制编码与存内计算,将乘性计算转换为加性等价形式,直接在全局内存完成输出更新,减少数据搬运耗时;
- 缓存策略:通过L1/L2缓存精细化管理与K-buffer流水排布,提升缓存命中率与计算效率,实现张量计算与向量计算的相互掩盖;
- 前序算子融合:在Prefill与Decode阶段分别采用双流并发与算子融合技术,结合权重预取、分块策略及定制指令集优化,构建端到端高效计算链路。
- 通算融合算子:针对EP部署模式下MoE专家的跨卡调度难题,设计MoeDistributeDispatch/Combine算子,通过 Token 粒度的流水排布与内存语义通信技术,将通信与计算并行化,减少卡间同步开销;
- SMTurbo-CPP技术:针对小数据量通信效率问题,通过读写混合、聚合流水等硬件并发技术,提升AllToAll(v)算子的吞吐能力,降低Dispatch/Combine场景时延;
- 细粒度分级流水算法:基于Atlas 800I A2组网特性,实现节点内/节点间的集合通信并发执行,大幅提升集群环境下的带宽利用率。
性能创新高
在Decode性能测试方面,Atlas 800I A2所采用的方式是:- 序列长度为2K输入+2K输出和1K输入+2K输出两种情况
- 在使能MTP进行推理加速的情况下,由于不同测试数据集和业务场景的MTP接受率不同,性能测试结果会有比较大的偏差。因此在计算时延和吞吐的时候默认按照70%接受率来折算。
- TPOT(Decode平均每Token时延)不超过100ms。
One More Thing
就在本周,华为昇腾还将举办一个 技术披露周! 大家可以关注https://gitcode.com/ascend-tribe/ascend-inference-cluster/中每天的上新。 具体详情放下面喽,小伙伴们可以蹲一波了~https://gitcode.com/ascend-tribe/ascend-inference-cluster/blob/main/Overview/%E5%8D%8E%E4%B8%BA%E6%98%87%E8%85%BE%E6%9C%8D%E5%8A%A1%E5%99%A8_DeepSeek_V3_R1_%E6%8E%A8%E7%90%86%E9%83%A8%E7%BD%B2%E6%9C%80%E4%BD%B3%E5%AE%9E%E8%B7%B5.pdf 技术博客:
https://gitcode.com/ascend-tribe/ascend-inference-cluster/blob/main/Overview/ascend-inference-cluster-overview.md 一键三连 「点赞」「转发」「小心心」 欢迎在评论区留下你的想法! — 完 — 🌟 点亮星标 🌟 科技前沿进展每日见