梁斌penny

梁博谈一谈:Deep Thinking的代价,大模型为何正在“吃光”全球HBM?

一、模型朝着「Deep Thinking」方向发展 → 内存爆炸的核心驱动力

当前 AI 模型正在从“浅层预测”走向“深度思考”(Deep Thinking / Multi-hop Reasoning)。这个转变有几个直接的内存压力来源:

  • 上下文长度指数级增长
    • 早期模型(GPT-3)上下文4K,现在       GPT-4/Claude-3 已经是200K甚至1M tokens。
    • 上下文越长,模型在每个推理步都要把所有token放进KV Cache(Key-Value Cache)中保存中间注意力结果。
    • KV Cache 全部存在显存或高带宽内存里,容量线性增长、带宽需求几乎翻倍。
  • 多分支推理(branching reasoning)与 evaluate
    • 比如DeepMind的“Tree-of-Thought”、OpenAI的“Reasoning       Model”,一次请求不再是单一路径,而是并行展开多个推理分支(像树状搜索)。
    • 每个分支都要占用独立的内存上下文空间(cache + state),意味着一次请求内存消耗是以前的N倍。
  • 长链推理中间状态暂存
    • 在multi-step reasoning中,模型会生成中间结论、再调用自我评估,这些“中间状态”也会暂存在显存或HBM中,而不是立即丢弃。
    • 尤其在MoE(Mixture of Experts)结构下,每个Expert会被动态激活,也需要临时内存存储中间激活值。
结论:
这部分是高带宽内存(HBM)需求最核心的增长点。推理时每个token都要频繁读写attention cache,带宽越高延迟越低,越能显著提升吞吐率。

二、用户数量增加 & 长期历史存储 → 系统级的存储层次需求

  • 短期上下文(RAM/HBM)
    • 当模型在与用户对话时,最近几轮上下文仍需留在模型的KV缓存中,这会直接影响显存消耗。
  • 长期记忆(SSD / 分布式存储)
    • 未来AI助手普遍需要「长期记忆」,记录用户多轮历史、习惯、偏好。
    • 这些数据虽然主要存放在SSD或分布式存储(例如向量数据库中),但在“激活”用户会话时,需要加载一部分embedding到RAM甚至GPU内存。
    • 这意味着整个系统的存储层次(memory hierarchy)都被动扩张:
      SSD → RAM → VRAM → HBM
      而且数据在各层之间迁移频繁。
  • 缓存层(Memory Pool)
    • 例如在大规模AI服务(ChatGPT、Claude、Gemini)中,为了加快用户响应,会给高活跃用户建立“session cache”。
    • 这类cache也是内存密集型。

结论:
这不是HBM本身的主需求来源,但却在系统层面推高了整个内存和存储需求链条(DDR5、CXL内存池、SSD、HBM同步增长)。


三、训练阶段的「多轮推理」与「高维激活」→ HBM消耗持续放大

  • 训练时激活值(activation)存储占主导
    • 训练时不仅要存参数(weights),还要保留每一层的激活值(activation maps)以便反向传播。
    • 这部分内存消耗远超推理阶段。对于大模型(数千亿参数),显存往往成为训练瓶颈。
  • 多步推理训练(reasoning fine-tuning)
    • 当前的推理模型往往训练多步链式思考(chain-of-thought       distillation),每步都要计算、缓存中间状态。
    • 每一个token的中间计算都会暂存下来再进行评估和蒸馏,这使得训练时内存占用翻倍。
  • 并行专家结构(MoE)与高维路由
    • MoE模型的每个“专家”都有独立参数组,虽然只有部分被激活,但在大批训练时,会同时加载多个专家。
    • 激活频繁切换 → 内存随机访问密集 → 需要HBM提供极高带宽支持。

结论:
训练与推理都在“多轮、多状态”方向发展,使得显存和HBM既要高容量(能存下长上下文)、又要高带宽(支持并行token处理),这正是当前HBM价格和需求上涨的物理根因。

四、总体逻辑链总结

Image