黄仁勋105分钟对话实录:万亿美元这么赚!谈中国、H200、养虾、Groq,炮轰DLSS 5批评者
黄仁勋:首先,你面前站着的是“推理之王”。我可以这么说,(因为)有人曾封我为“推理之王”。2025年,我们决定将巨额资源投入到推理领域。在2024年底2025年初,我们推出了NVLink 72系统,推出了NVFP4(英伟达Blackwell GPU架构引入的4位浮点格式),在此之前还推出了Dynamo(英伟达的开源、低延迟、模块化推理框架)。
Dynamo几乎提前两年诠释了我昨天才公布的完整战略。在那之前,我们就已经知道推理在NVLink 72上表现完美,这就是NVLink 72如此重要的原因。35倍的性能提升,成本只有原来的1/50。或者说每瓦性能提升了50倍,成本只有原来的1/35。
▲英伟达在采访现场展示全系列产品
Q10:您展示了Vera独立机架的部署形态。随着AI需求的持续增长,这些CPU的适用场景越来越清晰。您是否认为它们最终将承担x86架构在数据中心中传统承担的角色?这是否是一个数十亿美元级别的市场机会?
黄仁勋:这些CPU是为数据密集型工作负载而设计的。它们针对的是高单线程性能需求,同时也面向电力受限的数据中心环境。在这种场景下,它们的每瓦性能可以实现2倍提升。
目前市场上没有其他CPU能做到这一点——除了Vera和Grace。在电力受限的数据中心中,实际上,所有采用英伟达产品的数据中心基本都是电力受限的,因为一旦你拥有兆瓦级的电力,你会希望尽可能把电力用在GPU上,而不是浪费在CPU上。
原因很简单:GPU在生成token、创造价值,而CPU并不是主要的价值生产者。因此,如果可以,你会希望把绝大部分电力预算分配给GPU。
当然,我们仍然需要CPU,但我们要让它们极其节能。这也是为什么我们使用LPDDR内存。同时,我们的CPU在单线程性能、带宽效率方面都处于全球领先水平,带宽甚至达其他方案的三倍。
之所以把带宽做得这么高,是因为我们需要处理海量数据的移动。因此,我们设计了Vera、Grace等CPU,它们是专门为AI时代打造的。
它们适用于所有场景吗?未必。比如“每美元性能”可能不是最优,但那并不是我们要解决的问题。
举个例子,在过去十年的超大规模数据中心中,CPU设计的核心目标是最大化每颗芯片的核心数量。因为在云计算模式下,用户是按“核心数”租用资源的。所以,对于云厂商来说,“每美元核心数最多”的CPU就是赢家。
但AI不一样。AI关注的是“完成多少工作”,而不是“有多少核心”。
如果你有价值500亿美元的GPU在那里运行,你绝不会让它们因为CPU处理不过来而闲置,这些CPU可能就价值10亿美元。你需要的是让CPU尽快完成任务,让500亿美元GPU持续高效运转。
所以,我们的优化方向完全不同。我们打造出了一种截然不同的CPU架构。我们始终从“要完成什么工作”出发来设计系统。一旦这一判断最终变成显示,我们就构建出最合适的整体系统。
无论是Vera、Rubin,还是存储、CPU、网络、甚至整个机架,都是围绕我昨天提到的那类工作负载来设计的,也就是智能体。
事实上,OpenClaw就是一个很好的例子。在数据中心中运行OpenClaw,配合Vera Rubin整套系统,是非常理想的组合。
所以,我想这应该回答了你的问题。
Q11:看起来Feynman将采用某种3D堆叠工艺。请问您能否介绍一下主Die、IO Die)以及先进封装技术的规划方向?供应链稳健性是否也在你们的考量之内?
黄仁勋:供应链的弹性、多样性总是影响我们的业务,因为我们规模很大。然而,如果我告诉你,那明年参加GTC还有什么意义?到时候就只剩你和我,两个人。
Q12:你昨天介绍了LPU的集成,OpenClaw的出现似乎真的让您眼前一亮。OpenClaw如何改变了你的日常生活?如何改变了英伟达的战略?
黄仁勋:当OpenClaw出现,我们意识到世界终于拥有了一个开源智能体——我们现在几乎可以将其当作一个行业标准。我们希望尽可能多地向这个开源项目贡献能力,避免世界因此分裂成太多互不兼容的分支项目。