英伟达发布低延迟分布式推理框架 Dynamo,赋能 AI 模型规模化推理
原文:https://developer.nvidia.com/blog/introducing-nvidia-dynamo-a-low-latency-distributed-inference-framework-for-scaling-reasoning-ai-models/
英伟达今日在GTC 2025大会 上宣布推出NVIDIA Dynamo 框架。该开源推理服务框架具备高吞吐、低延迟特性,专为大规模分布式环境下部署生成式AI与推理模型而设计。在英伟达Blackwell架构上运行开源DeepSeek-R1模型时,该框架可将处理请求量提升高达30倍。NVIDIA Dynamo兼容PyTorch、SGLang、英伟达TensorRT-LLM 及vLLM等开源工具,与不断壮大的推理工具社区共同赋能开发者和AI研究人员加速人工智能进程。
NVIDIA Dynamo框架包含多项核心创新技术:
• 通过分离预填充与解码推理阶段,提升单图形处理器的吞吐量 • 基于动态波动的需求对图形处理器进行动态调度,以优化性能表现 • 基于大语言模型感知的请求路由策略,规避键值缓存重复计算开销 • 图形处理器间加速异步数据传输,降低推理响应时延 • 跨不同内存层级结构的键值缓存卸载技术,提升系统吞吐量
即日起,开发者可通过GitHub仓库ai-dynamo/dynamo 获取英伟达Dynamo框架。对于追求快速投产周期及企业级安全防护、技术支持和系统稳定性的企业用户,英伟达Dynamo将集成于NVIDIA NIM 微服务套件,该套件隶属于英伟达AI企业版 产品体系。
加速多节点部署环境中的AI推理效能
通过将推理模型融入应用工作流,AI推理技术将助力开发者创建突破性应用,使程序能以更直观的方式理解用户意图并实现智能交互。然而,这也意味着持续性的重大成本支出,对于那些希望以经济高效的方式扩展模型以满足市场对AI永无止境需求的企业而言,构成了严峻挑战。
当英伟达于2018年首次推出NVIDIA Triton推理服务器时,其目标便是加速AI创新并降低推理成本。Triton是首个开源 AI推理服务器,它将定制化框架专属的推理服务——包括TensorFlow、PyTorch、ONNX、OpenVINO等——整合至统一平台,显著降低推理成本并加速新AI模型的上市时间(TTM)。
Triton在英伟达NGC平台 上的下载量已突破100万次,目前被亚马逊 、微软 、甲骨文云 、DocuSign 、Perplexity 等全球顶尖机构用于生产环境中的AI模型部署。Snap 、以及众多其他案例。
自Triton发布以来,开源模型规模已实现近2000倍的爆发式增长,并越来越多地集成到需要与多个其他模型交互的自主型AI 工作流中。在生产环境中部署这些模型及工作流程需要将其分布到多个计算节点,这要求对大规模图形处理器集群进行精细化的编排协调。随着解耦式推理服务等新型分布式推理优化方法的引入——该方法将单个用户请求的响应拆分到不同图形处理器上执行——系统复杂性进一步加剧,使得跨设备协作与高效数据传输面临更大挑战。
为应对分布式生成式AI推理服务的挑战,我们正式推出英伟达Dynamo。该框架基于Triton的成功经验,采用全新模块化架构设计,专为在多节点分布式环境中部署生成式AI模型而打造。
英伟达Dynamo能够实现跨GPU节点的推理工作负载无缝扩展,并支持动态分配GPU工作节点,从而高效应对用户需求的波动变化,处理多模型AI推理管道中的流量瓶颈。英伟达Dynamo支持所有主流大语言模型框架,包括NVIDIA TensorRT-LLM 、vLLM和SGLang。该框架整合了最先进的大语言模型推理服务优化技术,例如解耦式推理服务——通过将推理过程的不同阶段分配到独立的GPU设备上,显著提升推理性能。
在英伟达GB200 NVL72平台上实现推理性能30倍提升
传统的大语言模型部署方式将推理过程的预填充和解码阶段都部署在单一GPU或节点上,尽管这两个阶段对计算资源的需求存在显著差异。这种方法限制了性能优化空间,导致开发者无法充分利用GPU计算资源。
预填充阶段通过处理用户输入生成首个输出标记(token),该阶段受计算资源限制;而解码阶段生成后续标记时则受内存带宽限制。将这些阶段共置于同一图形处理器或图形处理器节点会导致资源使用效率低下,尤其对于长输入序列而言。此外,各阶段对硬件的差异化需求限制了模型并行的灵活性,导致错失性能优化机会。
为解决这些问题,解耦式推理服务将预填充阶段与解码阶段分离至不同的图形处理器或计算节点。这种架构使开发者能够独立优化每个阶段:应用不同的模型并行策略,并为各阶段分配不同类型的图形处理器设备(图1)。
图1. 解耦式推理服务将预填充(prefill)和解码(decode)阶段分配至不同的图形处理器(GPU),以优化性能表现。
例如,在预填充阶段可采用低张量并行配置以减少通信开销,而在解码阶段则可通过高张量并行配置提升内存操作效率。该方法实现了更高效的资源分配,降低了推理服务成本,并增强了对服务级别目标(SLOs)的控制能力,例如首令牌生成时间(TTFT)和令牌间延迟(ITL)。
在英伟达GB200 NVL72 平台上部署开源DeepSeek-R1模型时,采用解耦式推理服务的英伟达Dynamo框架,使可处理请求量最高提升达30倍。在英伟达Hopper架构上运行Llama 70B模型时,英伟达Dynamo实现了超过两倍的吞吐量性能提升。
图2. 英伟达Dynamo在NVIDIA GB200 NVL72平台上运行DeepSeek-R1 671B模型时展现出卓越的吞吐性能,实现高达30倍的性能提升。在基于NVIDIA Hopper架构图形处理器运行的Llama 70B模型上,该框架使性能提升两倍以上。
左图:TensorRT-LLM,FP4精度,内部存储链路/对象存储链路配置为32K/8K。 未使用Dynamo:动态批处理(Inflight Batching),张量并行度TEP16PP4DP4。使用Dynamo:解耦式推理服务,上下文阶段EP4DP16,生成阶段EP64DP3。图示性能为预测值可能变动。右图:vLLM,FP8精度,内部存储链路/对象存储链路配置为3K/50。 未使用Dynamo:动态批处理(Inflight Batching),张量并行度TP8DP2。使用Dynamo:解耦式推理服务,上下文阶段TP2DP4,生成阶段TP8。
为实现大规模分布式解耦式推理服务,英伟达Dynamo包含四项关键技术创新:
• 英伟达Dynamo规划器 • NVIDIA Dynamo智能路由系统 • 英伟达Dynamo分布式键值缓存管理系统 • 英伟达推理传输库(NIXL)
图3. 英伟达Dynamo架构
英伟达Dynamo规划器:优化GPU计算资源实现分布式推理
在大规模分布式解耦式推理系统中,高效管理GPU计算资源对于最大化吞吐量和最小化延迟至关重要。尽管解耦式推理服务能显著提升推理吞吐量和效率,但对于每个接入请求而言,它未必总是最优解决方案。
设想这样的场景:大量具有长输入序列长度(ISL)但短输出序列长度(OSL)的摘要请求涌入,导致预填充GPU过载。此时解码GPU仍处于低利用率状态,而预填充GPU却成为性能瓶颈。在此场景下,允许解码图形处理器以传统聚合方式同时执行预填充和解码任务,或将其调度至执行预填充任务,可能会获得更高的效率。该方法有助于均衡负载分配,缓解预填充图形处理器的运算压力,从而有效提升整体吞吐量。
在解耦式与聚合式服务架构之间进行选择,或确定各阶段应分配的图形处理器数量,需要审慎考量多重关键因素。这些因素包括预填充与解码图形处理器间键值缓存的传输耗时、图形处理器在请求队列中的等待时长,以及解耦式与聚合式配置下各自的预估处理时间。在部署数百个图形处理器的大规模环境中,此类决策的复杂度将呈指数级增长。
这正是英伟达Dynamo规划器发挥核心作用的领域。该组件持续监测分布式推理环境中图形处理器的关键性能指标,并结合首字节响应时间(TTFT)与交互延迟(ITL)等应用级服务目标,智能决策请求应采用解耦式还是聚合式处理架构,以及是否需要向特定阶段动态增配图形处理器资源。NVIDIA Dynamo规划器可确保在预填充和解码阶段高效分配GPU计算资源,在维持系统峰值性能的同时适应波动的工作负载。
图4. GPU规划器通过分析GPU容量指标,做出如何服务传入请求或分配GPU工作节点的最优决策
NVIDIA Dynamo智能路由系统:降低键值缓存的高成本重复计算
在响应用户提示前,大语言模型需构建输入请求的上下文理解框架(即键值缓存)。 该过程计算密集度高,且计算量随输入请求规模的扩大呈平方级增长。复用键值缓存可避免从头开始重复计算,从而减少推理时间并节省计算资源。这在需要频繁执行相同请求的应用场景中尤为有利,例如系统提示、单用户多轮聊天机器人交互以及自主代理工作流场景。需要建立高效的数据管理机制,以确定何时何地可复用键值缓存。
NVIDIA Dynamo智能路由系统能够追踪多节点和分解式部署中大规模图形处理器集群的键值缓存,并智能路由传入请求,最大限度减少昂贵的重复计算需求。该系统通过哈希算法处理输入请求,并将其存储在基数树数据结构中,从而实现对大规模分布式推理环境中键值存储位置的精准追踪。该系统还采用专门的键值缓存插入与淘汰算法,确保保留关联性最高的数据区块。
图5. NVIDIA Dynamo智能路由系统通过避免键值缓存重新计算,加速模型响应时间并提升用户体验
2个HGX-H100节点 · 8个DeepSeek-R1-Distill-Llama-70B模型 · vLLM框架 · FP8精度 · 张量并行度:2
数据来源:10万条真实R1请求 · 平均内部存储链路/对象存储链路:4K/800_
当新推理请求到达时,NVIDIA Dynamo智能路由系统会计算传入请求与分布式集群中所有GPU内存内已激活键值缓存块之间的重叠分数。通过综合考量重叠分数和GPU集群的工作负载分布,该系统可智能地将请求路由至最合适的工作节点,在最小化键值缓存重新计算的同时确保集群负载均衡。
与轮询或基于负载的路由机制不同,该方法通过综合缓存命中率、工作负载平衡和GPU容量等要素优化系统整体性能,确保高效处理请求并消除资源瓶颈。通过减少键值缓存的不必要重新计算,NVIDIA Dynamo智能路由系统可释放GPU计算资源。这使得AI服务提供商能够响应更多用户请求,从而最大化其加速计算投资回报。
NVIDIA Dynamo分布式键值缓存管理器:将键值缓存卸载至更具成本效益的存储设备
为用户请求计算键值缓存需要大量资源,因此成本高昂。复用键值缓存以尽量减少其重新计算需求是常见做法。然而随着AI需求增长,必须存储在显存中供复用的键值缓存容量可能会迅速达到难以承受的成本水平。这对试图在预算范围内高效管理键值缓存复用的AI推理团队构成了重大挑战。
NVIDIA Dynamo键值缓存管理器功能通过支持将较旧或访问频率较低的键值缓存块卸载至更具成本效益的存储解决方案(如CPU主机内存、本地存储或网络化对象存储)来解决这一挑战。该功能使企业能够以显存存储成本的一小部分,存储高达PB级别的键值缓存数据。通过将键值缓存卸载至替代性内存层级结构,开发者可释放宝贵的GPU计算资源,同时仍能保留并复用历史键值缓存以降低推理计算成本。
图6. 英伟达Dynamo分布式KV缓存管理器将访问频次较低的键值缓存卸载至更经济高效的内存层级结构
英伟达Dynamo KV缓存管理器采用先进的缓存策略,优先将高频访问数据置于显存中,而将低频访问数据迁移至共享CPU主机内存、SSD或网络化对象存储。该框架采用了智能驱逐策略,在过度缓存(可能引入查找延迟)与缓存不足(导致查找未命中和键值缓存重新计算)之间取得了平衡。
此外,该功能能够跨多个GPU节点管理键值缓存,支持分布式和分解式推理服务,并提供分层缓存能力,可在GPU、节点和集群级别创建卸载策略。
英伟达Dynamo键值缓存管理器采用框架无关设计,支持包括PyTorch、SGLang、TensorRT-LLM和vLLM在内的多种后端,并通过英伟达NVLink 、英伟达Quantum 交换机和英伟达Spectrum 交换机,助力键值缓存存储在大规模分布式集群中的扩展。
英伟达推理传输库(NIXL):低延迟、硬件无关的通信
大规模分布式推理采用张量并行、流水线并行和专家并行等模型并行技术,这些技术依赖于节点间和节点内通过GPUDirect RDMA实现的低延迟、高吞吐量通信。此类系统还需要在解耦式推理服务环境中,实现预填充(prefill)和解码(decode)GPU工作节点间键值缓存的快速传输。
此外,系统必须支持硬件和网络无关的加速通信库,能够高效地在GPU和各种内存层级结构(包括CPU内存、块存储、文件存储、对象存储等)之间迁移数据,并与多种网络协议保持兼容。
图7. 英伟达推理传输库(NIXL)通过抽象化异构内存与存储设备间的数据移动复杂性,简化跨设备数据传输流程
英伟达推理传输库(NIXL) 是一款高吞吐、低延迟的点对点通信库,通过统一的数据移动API,采用相同语义实现跨不同层级内存和存储设备的快速异步数据传输。该库专门针对推理场景下的数据移动进行优化,支持各类内存与存储设备间的非阻塞及非连续数据传输。
NIXL支持异构数据路径、多种类型内存与本地SSD,以及英伟达核心存储合作伙伴提供的网络存储解决方案。
通过通用API接口,NIXL使英伟达Dynamo能够与GPUDirect Storage、UCX和S3等其他通信库协同工作,无论数据传输通过NVLink(C2C或NVSwitch)、InfiniBand、RoCE还是以太网实现。结合英伟达Dynamo策略引擎,NIXL可自动选择最优后端连接方案,并抽象化不同类型内存与存储间的底层差异。这一功能通过通用的“内存模块”实现,这些模块可以是高带宽内存(HBM)、动态随机存取存储器(DRAM)、本地SSD或网络存储(块存储、对象存储或文件存储)。
开始使用英伟达Dynamo
现代大型语言模型的参数规模持续扩大,具备推理能力,并日益融入智能体AI工作流程。因此,它们在推理过程中生成的标记数量激增,需要部署在分布式环境中,这显著推高了部署成本。因此,优化推理服务策略以降低成本并支持分布式环境中的无缝扩展至关重要。
英伟达Dynamo 基于英伟达Triton的成功经验,采用新型模块化架构,具备分布式推理能力并支持解耦式推理服务,使其能够在大规模多节点部署中实现卓越的扩展性能。
诚邀AI推理开发者和研究人员通过GitHubai-dynamo/dynamo 为英伟达Dynamo贡献代码,并加入全新英伟达Dynamo Discord服务器 ——这是面向英伟达Dynamo开发者与用户的官方社区。英伟达Dynamo计划通过英伟达AI Enterprise 提供支持,并整合英伟达NIM 微服务实现快速便捷的部署。使用Triton的英伟达AI Enterprise客户将继续为其现有Triton部署获得生产分支支持。