梁博谈一谈:黄仁勋GTC喊出万亿订单,deep thinking催生算力盛宴
什么是deep thinking:
从“直觉”到“论证”的范式转变
并行启动多条推理线索:通过思维树(Tree-of-Thought) 或多重采样,同时探索多个潜在的解决方案。 内部自检与反复验证:在模型内部进行论证、反驳、自我纠错,甚至调用代码执行器或外部检索工具进行事实核查。 收敛输出:最终将多条路径的结论进行交叉比对和整合,输出可靠性更高的结果。
GPU消耗量级:
从线性到乘法的级联放大效应
架构适配与市场影响:
NVIDIA的生态防御
deep thinking/ Agentic AI的推广,意味着全球推理算力需求量级直接上一个数量级。 绝大多数非Google生态的企业和云服务商,必须继续依赖NVIDIA的Blackwell / GB200 /Vera Rubin等产品。
未来:
NVIDIA对TPU竞争的应对策略
软件生态壁垒:强化CUDA +NemoClaw(OpenClaw安全代理栈)+ OpenShell runtime,让企业级Deep Think代理“一键安全部署”,迁移成本几乎为零。 系统级集成:推出Vera Rubin平台(含全新Vera CPU,专为agentic推理优化,比传统CPU快50%+)、GB200后续、AI Factory DSX参考设计(含Omniverse数字孪生蓝图),让AWS/Google Cloud/Microsoft/Oracle等hyperscaler首批部署;甚至宣布Space-1 Vera Rubin要把AI数据中心送上太空! 定制化系统合作:与hyperscaler深度协作+新增Groq LPU集成(低延迟推理加速),提供定制集群。即使Meta等引入AMD双供应商,NVIDIA仍凭借生态+性能+agentic全栈锁定大部分前沿份额。
GTC 2026最新亮点:老黄推出Nemotron Coalition(联合Mistral、Perplexity等共建开源前沿模型),Nemotron reasoning系列直接对标Deep Think,搭配Vera Rubin实现“一人公司+AI员工”级生产力!
deep thinking
能力提升的方向
更高效的推理编排(Runtime Orchestration):研发专属运行时软件,将深度思考任务拆分为可缓存、可并行、可重用的子任务,减少重复计算。Vera Rubin平台新增的Vera CPU正是为此而生。 长效记忆与情境管理(Long-term Memory & Context):结合RAG 2.0、向量数据库和持久化记忆系统,使模型能够低成本地访问和整合数以年计的历史知识和思考记录,打破传统上下文窗口限制。NVIDIA在GTC上展示了NemoClaw内置的长期记忆路由机制,支持企业级始终在线代理持续积累经验。 混合引擎与异构计算(Hybrid & Heterogeneous Engines):将最耗费GPU资源的矩阵运算(Transformer核心)与低成本的外部逻辑校验、检索、工具调用工作进行分离,由不同的加速器或CPU/ASIC承担,实现成本优化。Vera Rubin全栈正是这一方向的硬件实现,整体推理token成本降低10倍。 元认知与经济学约束(Meta-cognition & Compute Budgeting):引入“思考预算”机制,让模型学会判断问题的难度,并智能地选择所需算力的级别(是进行5倍浅层思考还是40倍深度思考),以优化算力使用效率。NemoClaw新增的安全策略与元认知层,使Deep Think代理在企业部署时自带安全与预算控制,避免无谓算力浪费。
结语:
AI万亿级基础设施序幕已开启