梁斌penny

梁博谈一谈:黄仁勋GTC喊出万亿订单,deep thinking催生算力盛宴

昨天英伟达GTC大会,黄仁勋宣布:agentic scaling law已成为继pre-training、post-training之后的第四条AI scaling定律,而deep thinking/ agentic reasoning正是这一定律的直接体现。
他直言,始终在线的AI代理将驱动全球推理算力需求呈指数级爆炸,并抛出:Blackwell + Vera Rubin系统到2027年订单将达1万亿美元的超级指引——这正是deep thinking产品化催生万亿算力盛宴的最强现实佐证。
自从Gemini 3把Deep Think模式产品化,推理时间/算力消耗乘法级放大,现在已经成为2026年所有前沿大模型的标配技术路径。
去年底,我就跟大家说过,谷歌的这篇博客《A new era of intelligence with Gemini 3》非常值得一读。虽然当时没开发布会,但是里面首次正式介绍了Deep Think这个“增强推理模式”,强调通过多花点时间、多用点计算,就能换来明显更好的效果——尤其在ARC-AGI-2这个超级难的测试上,当时Gemini 3 初版就拿到了45.1%的成绩,此前其他模型基本被压在30%以下。
鉴于Gemini3的惊艳效果,我当时的判断是,Deep Think这类机制必将成为未来所有大模型在实际应用中的主要技术手段。
现在看,事实远超预期。2月12日,谷歌发布了Deep Think的重大升级版,直接把ARC-AGI-2拉到84.6%(ARC Prize Foundation验证SOTA),天花板给砸出一个代际差距。
昨天GTC上,老黄更是把“reasoning + agentic”定为全场核心主题,NVIDIA直接推出NemoClaw(基于OpenClaw的安全代理栈)来让Deep Think式代理真正企业级落地。
Image
去年我提到“Deep Think必将成为主流”,现在看已全面实现:OpenAI的o3/o4系列、Claude的Thinking模式、Grok的reasoning、甚至NVIDIA的Nemotron都在跟进“inference-time compute放大”。但Google的Deep Think仍是目前最极致的体现,而NVIDIA的Vera Rubin + NemoClaw则是让它真正规模化落地的硬件+软件闭环。

什么是deep thinking:

从“直觉”到“论证”的范式转变

“deep thinking”(或厂商称作 “Deep Think”/“Deep Think mode”)不是一项单一的技术,而是大型语言模型(LLM)在面对复杂挑战时,所采用的一种迭代、多路径、自我验证的工作模式。
Google 在 Gemini 3 中将这种模式产品化,并在高难度基准上给出了显著的性能跃迁,称其可用于更复杂的数学、科学与多模态问题。
传统LLM 擅长“直觉式回答”(即单次快速生成)。然而,在处理复杂设计、学术推理、或长链条逻辑问题时,这种单次预测很容易导致逻辑断裂和错误。deep thinking模拟了人类的“慢想”过程:
  • 并行启动多条推理线索:通过思维树(Tree-of-Thought) 或多重采样,同时探索多个潜在的解决方案。
  • 内部自检与反复验证:在模型内部进行论证、反驳、自我纠错,甚至调用代码执行器或外部检索工具进行事实核查。
  • 收敛输出:最终将多条路径的结论进行交叉比对和整合,输出可靠性更高的结果。
这种从“一次性直觉”到“多轮论证”的范式转变,正是提升AI解决难题能力的关键,但计算资源绝不免费。
昨天GTC上,老黄把这种模式升级为“agentic AI”——AI不再只是回答问题,而是要自主规划、长期记忆、调用工具、持续行动。这正是Deep Think从实验室走向生产力的关键一步!

GPU消耗量级:

从线性到乘法的级联放大效应

deep thinking把推理成本推到新高度,更多思考步骤意味着更多矩阵乘法、更大激活存储、更高带宽占用。
Image
现在看,甚至在ARC-AGI-2这类极难任务上已轻松破百倍(并行多路径+递归+工具链),幅度比我当时预估得还大。
老黄昨天提出“agentic scaling law”——代理式AI的通信、规划、长期运行、以及多代理间交互会让算力需求呈指数级爆炸!他反复强调:一个始终在线的AI代理(always-on agent),其推理消耗不是10倍、50倍,而是百倍甚至千倍于传统单次生成或浅层聊天模式。这直接源于deep thinking/ agentic reasoning的本质——从“一次性直觉”转向“多轮论证+自主行动+长期记忆+工具链调用”,每个步骤都触发海量token生成、上下文维护和跨组件通信。
这直接为AI加速器注入了新动能,对H200/B200/GB200/Vera Rubin级数据中心的需求暴增——老黄直言“这是历史上最大规模的基础设施建设”,并抛出Blackwell + Vera Rubin系统到2027年订单将达1万亿美元的超级指引,打消“AI资本支出见顶”的市场疑虑!

架构适配与市场影响:

NVIDIA的生态防御

Image
对英伟达股价的影响:昨天GTC后短期虽有波动,但老黄现场抛出“1万亿美元订单”+ Vera Rubin H2 2026量产,中长期仍是超级利好!
  • deep thinking/ Agentic AI的推广,意味着全球推理算力需求量级直接上一个数量级。
  • 绝大多数非Google生态的企业和云服务商,必须继续依赖NVIDIA的Blackwell / GB200 /Vera Rubin等产品。

未来:

NVIDIA对TPU竞争的应对策略

面对TPU和AMD Instinct等定制/异构硬件的威胁,NVIDIA的策略已从“卖芯片”转向“卖系统+锁生态”,并通过Vera Rubin平台强化领先:
  • 软件生态壁垒:强化CUDA +NemoClaw(OpenClaw安全代理栈)+ OpenShell runtime,让企业级Deep Think代理“一键安全部署”,迁移成本几乎为零。
  • 系统级集成:推出Vera Rubin平台(含全新Vera CPU,专为agentic推理优化,比传统CPU快50%+)、GB200后续、AI Factory DSX参考设计(含Omniverse数字孪生蓝图),让AWS/Google Cloud/Microsoft/Oracle等hyperscaler首批部署;甚至宣布Space-1 Vera Rubin要把AI数据中心送上太空!
  • 定制化系统合作:与hyperscaler深度协作+新增Groq LPU集成(低延迟推理加速),提供定制集群。即使Meta等引入AMD双供应商,NVIDIA仍凭借生态+性能+agentic全栈锁定大部分前沿份额。
  • GTC 2026最新亮点:老黄推出Nemotron Coalition(联合Mistral、Perplexity等共建开源前沿模型),Nemotron reasoning系列直接对标Deep Think,搭配Vera Rubin实现“一人公司+AI员工”级生产力!

deep thinking

能力提升的方向

单纯增加算力难以持续。要将deep thinking的能力推向更高峰,必须实现软硬协同和更智能的推理分解,让“长考”从烧钱变成高效生产力。老黄已把这套方向明确升级为agentic AI的核心进化路径,并通过Vera Rubin + NemoClaw全栈落地。
  • 更高效的推理编排(Runtime Orchestration):研发专属运行时软件,将深度思考任务拆分为可缓存、可并行、可重用的子任务,减少重复计算。Vera Rubin平台新增的Vera CPU正是为此而生。
  • 长效记忆与情境管理(Long-term Memory & Context):结合RAG 2.0、向量数据库和持久化记忆系统,使模型能够低成本地访问和整合数以年计的历史知识和思考记录,打破传统上下文窗口限制。NVIDIA在GTC上展示了NemoClaw内置的长期记忆路由机制,支持企业级始终在线代理持续积累经验。
  • 混合引擎与异构计算(Hybrid & Heterogeneous Engines):将最耗费GPU资源的矩阵运算(Transformer核心)与低成本的外部逻辑校验、检索、工具调用工作进行分离,由不同的加速器或CPU/ASIC承担,实现成本优化。Vera Rubin全栈正是这一方向的硬件实现,整体推理token成本降低10倍。
  • 元认知与经济学约束(Meta-cognition & Compute Budgeting):引入“思考预算”机制,让模型学会判断问题的难度,并智能地选择所需算力的级别(是进行5倍浅层思考还是40倍深度思考),以优化算力使用效率。NemoClaw新增的安全策略与元认知层,使Deep Think代理在企业部署时自带安全与预算控制,避免无谓算力浪费。

结语:

AI万亿级基础设施序幕已开启

deep thinking产品化不是简单的技术升级,而是直接催生了万亿级算力盛宴。GTC 2026用Vera Rubin、NemoClaw、agentic scaling law和1万亿美元订单给出最硬核佐证:AI从“回答问题”转向“自主做事”,推理需求指数级爆炸,全球基础设施建设进入史上最大规模。

短期看,它是当下最热的AI推理框架;长期看,它正在重塑生产力基础设施,就像Linux当年重塑服务器一样。没人能预判deep thinking会不会成为AI的“新Linux”,但有一点能确定:这个“长考龙虾”已把Agentic时代的万亿盛宴提前拉到眼前。
接下来,就看谁先把它养成改变世界的超级生产力引擎。