TimYang

Google和Nvidia首席科学家在GTC聊了什么

在 GTC 2026 上,Jeff Dean 和 Bill Dally 两位 Google 和 Nvidia 的首席科学家,对谈信息密度极高。
视频开始是 Bill Dally 关于推理延迟的分析,他指出优化到极致之后瓶颈在通信而非计算,并给出了具体的工程路径:
片上通过静态调度去掉路由开销,实现 30 纳秒穿越芯片的极致速度;片间则通过降低带宽来换取个位数时钟周期的延迟。这种级别的优化意味着传统的分布式推理栈必须面临重构。
Jeff Dean 提到的「工具速度成为瓶颈」极具共鸣。当 Agent 操作速度比人类快 50 倍时,依然跑在 CPU 上的编译器和文档处理器就成了阿姆达尔定律中的那个“串行死角”,直接把端到端的加速效果锁死。
Nvidia 收购 Groq 这件事放在这场对话的语境下看就特别清晰。Jeff 和 Bill 花了大量时间讨论推理延迟、数据搬运能耗、Prefill/Decode 分离,而 Groq 的 LPU 架构几乎是这些观点的硬件实体化:纯 SRAM、确定性执行、专为逐 token 解码设计。做过分布式推理的人会意识到,这不是简单的收购,而是 Nvidia 在为异构推理栈补上最后一块拼图。
更有意思的是 TurboQuant 和 Groq 的关系,在社区这几天也有网友在讨论。Groq 的 SRAM 容量是它最大的短板,500MB 塞不下长上下文的 KV Cache。但 Google 的 TurboQuant 能做到 6-8 倍无损压缩,直接把 Groq 从「只能跑短文本」变成了「能撑 10 万 token 的 Agent 推理引擎」。
视频要点:
1️⃣ 分而治之的硬件策略:推理硬件应按预填充、前馈解码、注意力解码三种模式分别优化,告别一刀切的通用配置。
2️⃣ IO 即命运:Agent 系统的天花板往往不在模型本身,而在工具链的冷启动和数据 IO。
3️⃣ 空间换时间:注意力机制的未来是分层信息检索架构,而非盲目追求无限长的原生上下文窗口。
这场对话最震撼的是,当大众还在讨论模型参数量时,顶尖科学家已经在思考如何让数据搬运少消耗 1 飞焦耳,以及如何让工具链快出 50 倍。AI 的下一个十年,不在于更大,而在于更自主与更极致的物理效率。
右滑图片了解对话精华。
原视频:www.youtube.com/watch?v=g8BuAtM3fp4