程序员老鬼

NVIDIA发布新一代AI超算平台:Rubin,将推理 token 成本降低 10 倍

今天早上刷新闻的时候,我困得一批,结果被黄仁勋给整精神了: NVIDIA 又整了个新的——Rubin AI 超算平台。

简单一句话:Blackwell 才刚铺开,Rubin 已经踩着它开始“卷自己”了。

Image

你刚发的那几条,其实就是整场发布会里最狠的几个点,我给你串一下:

  • 推理 token 成本:降到 Blackwell 的 1/10官方说法是:在大模型 MoE 场景下,每百万 token 的推理成本,比 Blackwell 再砍一刀到 1/10。 这什么意思? 就是以后你跟 AI 连续叨叨一整天,它后台烧的钱,可能只剩现在的零头。

  • 训练同样规模模型,用 1/4 的 GPU 就够了Rubin 针对万亿参数的 MoE 模型,训练同样的活儿,Blackwell 需要 4 份卡,它只要 1 份卡。

  • 能效再干一波:最高 5 倍用更少的电,干更多的活,数据中心老板看到这个,可能比我们还激动。

  • GPU 间带宽:一个机架 260 TB/s这个 260 TB/s 是机架级 NVLink 6 叠出来的总带宽,72 块 Rubin GPU 在一个 NVL72 机架里互相“嘴对嘴喂数据”。

  • 机架级保密计算之前都是某块 GPU / 某颗 CPU 支持可信执行,这次直接把“机架”当成一个安全边界,官方号称是首个机架级可信计算平台。

  • 完全重新设计的机柜:没电缆、没软管、没风扇这点真的离谱。新的 Vera Rubin NVL72 机柜里面是模块化抽屉 + 全液冷,安装时间从原来两小时,干脆缩到五分钟,说白了就是“插卡即用”。

就这几条放在一起,我第一反应就是:大模型厂商接下来可以更疯,而普通用户用 AI 的价格,有机会再往下跳一大截。

Image

如果把 一个 GPU 比喻成显卡, 那 Rubin 想做的是:把整个机房当成“一块卡”来设计。

里面那个完整体,官方名字叫:

NVIDIA Vera Rubin NVL72 —— 一机架 36 颗 Vera CPU + 72 块 Rubin GPU,外加一整套网络、安全、以太网的配套芯片,组合成一台“机架级 AI 超算”。

以前是“买一台服务器,再想办法把一堆服务器连起来”; 现在直接变成“买一整架大脑,往机房一插就开干”。

你列的那六大件,其实就是 Rubin 的“六脏俱全”。

1)Vera CPU:不是主角,但特别聪明的调度大脑

  • 88 个 NVIDIA 自研的 Arm Olympus 核心
  • 单颗集成高达 1.5 TB 内存(LPDDR5x),专门给 AI 推理和数据搬运优化过。

它更像是一个“任务调度 + 数据交通指挥中心”, 不是拼算力,而是保证 GPU 永远喂得饱、网络永远不堵车。

2)Rubin GPU:下一代 Transformer 引擎猛兽

  • 每块 Rubin GPU:推理 50 PFLOPS、训练 35 PFLOPS(NVFP4 精度)。
  • 自带 HBM4,高带宽显存做到 288GB 一块,直接往“超长上下文、Agent 连环调用”那个方向冲。

简单粗暴一点说:一块卡干 5 块 Blackwell 的活,功耗和晶体管数量才涨 1.x 倍。

3)NVLink 6:GPU 之间的“神经系统”

  • 单 GPU 可用到 3.6 TB/s 的 NVLink 带宽,整机架往上叠,总带宽干到 260 TB/s。

以前多 GPU 训练有点像多家公司邮件互发文件; 现在 Rubin 更像是“公司内部全部上了 1,000G 的高速专线”。

4)ConnectX-9 SuperNIC:对外社交的嘴

这个就是那块超级网卡:

  • 面向数据中心,把 Rubin 机架和外部世界连起来
  • 官方口径:最高 1.6 Tb/s 通信能力,用在 AI 集群之间“横向扩展”上。 简单理解:这是 Rubin 超算在整个数据中心里的“光纤大舌头”。

5)BlueField-4 DPU:安全 + 存储打包丢给它

DPU 这块,其实这几年 NVIDIA 一直在铺:

  • 专门负责网络、安全、存储这些“杂活”
  • Rubin 里把它用来做 共享上下文内存 + 安全隔离,让多个租户可以共享一大坨上下文,又不互相泄露。

有点像“既当保安又当仓库管理员”。

6)Spectrum-6 Ethernet:为 AI 重做了一次以太网

  • 单交换机带宽最高 409.6 Tb/s
  • 针对 AI 流量模式重新做了调度和拥塞控制,官方说能量效拉到上一代的 5 倍。

以前以太网更多是“通用选手”, Spectrum-6 是直接写着“AI 专用”四个大字。

这两年一个新词叫 “AI 工厂” —— 不再是几台服务器跑个模型,而是整个园区都在 24 小时产“智能”。

NVIDIA 在技术博客里说得很直白:Rubin 把“数据中心而不是单机”,当作一个计算单位来设计。

这带来几个很现实的变化:

  1. 长上下文 + Agent 成为常态AI 不再是问一句答一句,而是长期挂在那儿,帮你跑流程、看文档、打电话、下单——这一切都意味着:

  • token 数暴涨
  • 上下文越拉越长
  • 推理链路越来越复杂
  • 推理成本比训练更重要训练是一次性投入,但推理是所有人每天在消耗。 Rubin 直接把推理 token 成本压到 Blackwell 的 1/10,明牌告诉你:

    “我就是为大规模上线 Agent 和长对话准备的。”

  • 电力、散热、部署速度,统统变成一线 KPI

    • 能效要高,不然电费把你干死
    • 散热要好,不然机房直接变蒸桑拿
    • 部署要快,否则你项目排期会被硬件卡爆

    Rubin 在这三件事上就是往死里卷:更省电、全液冷、模块化抽屉,整机架“像插 U 盘一样”插上就能用。

    那个“没有电缆和风扇”的机柜,到底有什么鬼

    我看到这句的时候也愣了一下: “完全重新设计,没有电缆软管和风扇。”

    其实不是说整个机房不需要这些东西,而是说:

    • 机柜内部不再是“满墙扎带 + 一坨线”: 电源、液冷、信号都做成模块化 backplane, GPU/CPU 模块像抽屉一样滑进滑出,维护、扩容非常简单。

    • 散热交给统一的液冷循环,风扇从节点里搬走,集中做。

    这对谁最舒服?

    • 做运维的人: 以前拔一根线手心冒汗,现在就是“抽一块、换一块”。

    • 买整柜的云厂商: 交付速度直接提升,机房停机时间少一大截。

    • 我们这种用云上模型的人: 不直接看到,但会在“更便宜、更稳定、更快”的 API 价格和体验里,慢慢被动享受。

    Image

    Rubin 什么时候落地?跟我们啥关系?

    时间线上,大概是这样:

    • Rubin 架构 2024 年就提过名字
    • 这次 CES 2026 是完整平台 + NVL72 机架的正式亮相
    • 黄仁勋说:Rubin 平台已经在全面量产,2026 下半年各大合作伙伴会开始供货。

    对普通人来说,说真的,你我大概率一辈子摸不到 Rubin 机柜本体。 但是:

    • 大模型推理价格有机会再往下杀一轮
    • 长上下文(百万级 token)、超复杂 Agent 工作流,会慢慢变成“标配”而不是“高价 VIP 功能”
    • 一些以前算起来太贵的方向(比如大规模视频理解、超长时间序列预测),会突然被人玩起来

    反正我是那种很俗的人: 看到“成本降 10 倍”这种数字,第一反应不是科技进步,而是 ——“好,那你们 API 别涨价了。”

    就先唠这么多吧。 Rubin 这波感觉就是 NVIDIA 在给“AI 工厂”打地基, 后面各家模型厂、云厂商、Agent 平台,都会站在这堆硬件上继续卷。

    -END-

    我为大家打造了一份RPA教程,完全免费:songshuhezi.com/rpa.html

    最后给大家分享一份不错的副业资料,点击下方公众号,回复关键字: 副业 领,也可以链接我微信:hls404