谷歌一篇论文,存储芯片巨头市值蒸发数百亿:TurboQuant如何用3-bit改写AI推理规则
没有新硬件,没有新架构,只靠一套更聪明的数学算法,谷歌让大模型的KV缓存压缩了6倍,注意力计算提速8倍。存储芯片的“AI红利”故事,一夜之间被动摇了。
本周三美股开盘,存储芯片板块遭遇了一场“黑色时刻”。截至收盘,美光科技下跌4%,西部数据下跌4.4%,希捷下跌5.6%,闪迪重挫6.5%。
引发这场抛售的导火索,是谷歌刚刚发布的一篇论文——TurboQuant。
一篇学术研究,为何能搅动万亿级市场?答案藏在AI推理的“内存黑洞”里,也藏在谷歌给出的那套近乎“暴力”的压缩方案中。
KV缓存:大模型推理的“吞金兽”
要理解TurboQuant的分量,先得搞清楚它瞄准的靶心——KV缓存,到底有多吃内存。
大语言模型在生成每一个新Token时,都需要“回看”之前所有Token的信息。为了避免重复计算,模型会把每一层注意力机制产生的Key和Value向量全部缓存下来,形成一张“速查表”。随着上下文从4K扩展到128K甚至百万级别,这张表会线性膨胀,最终吞掉的显存往往反超模型参数本身,成为推理阶段最大的内存瓶颈。
传统的优化手段是向量量化——把16-bit浮点数压缩成4-bit整数。但这类方法几乎都需要为每一小块数据额外存储一组全精度的量化常数,相当于每笔交易都要付一笔“手续费”。压到4-bit,实际占用往往是5到6-bit,压缩效率大打折扣。
TurboQuant的野心,正是彻底消灭这笔附加费。
两步“绝杀”:极坐标变换 + 1-bit误差校验
谷歌的这套算法,核心是一个精巧的两阶段流程,全程不依赖任何校准数据,对GPU加速器极其友好。
第一阶段:PolarQuant——换一个坐标系看世界
传统量化在笛卡尔坐标系下操作,每个轴的取值范围不固定,必须额外存储归一化参数来“对齐”。TurboQuant的第一步,是对数据向量做一次随机旋转。
在高维空间里,随机旋转会让向量的每个坐标分量收敛到一种高度集中的Beta分布,且各分量近似独立同分布。无论原始数据长什么样,旋转之后都变成“一个模子刻出来的”。这让复杂的高维量化问题,降格为一组简单的一维标量量化问题。
随后,PolarQuant把旋转后的向量从“笛卡尔坐标系”转换成“极坐标系”——就像描述一个位置时,不说“向东3个街区、向北4个街区”,而说“朝37度方向走5个街区”。转换之后,数据被拆成半径(信号强度)和角度(信号方向)两组信息。
接下来是“递归配对”:把坐标两两分组进行极坐标变换,得到一组半径和一组角度;再把这些半径两两配对,做第二轮变换……如此往复,最终整个高维向量被浓缩为一个最终半径和一系列描述性角度。因为角度的分布模式在数学上已知且高度集中,整个过程不需要存储任何归一化常数。开销,归零。
第二阶段:QJL——用1-bit消灭残余误差
再精准的压缩,也会留下误差。而且有一个隐蔽的陷阱:一个在均方误差意义上最优的1-bit量化器,在高维空间中会引入一个系统性偏差,导致用它算内积(注意力分数的核心操作)时结果偏斜。
TurboQuant的第二步,专门来“杀”这个偏差。它将Johnson-Lindenstrauss变换应用到第一阶段的残余误差上,把每个误差值压缩为一个符号位(+1或-1),然后配合一个特殊的估计器,用高精度的Query向量和低精度的压缩Key做联合计算。
这套组合拳在数学上被证明是“无偏”的——压缩前后的内积期望值严格相等。只消耗最后1个bit,就把第一阶段残留的系统性偏差彻底抹平。
跑分全面碾压:3-bit逼近无损,注意力提速8倍
论文在LongBench、Needle In A Haystack、RULER等五大长上下文基准上,对TurboQuant进行了严格验证,测试模型覆盖Gemma、Mistral和Llama-3.1-8B-Instruct。
结果相当硬核:
压缩效果:在3-bit的总预算下,TurboQuant实现了接近无损的压缩效果,全程零额外开销。论文给出的理论证明显示,其均方误差失真率在所有位宽下都控制在理论下限的约2.7倍以内,1-bit极端压缩时更是只有最优值的约1.45倍——几乎贴着信息论的“物理极限”在运行。
“大海捞针”测试:在10万Token的文本中精准检索一条特定信息,4倍压缩比下,TurboQuant的检索精度一路保持到10.4万Token,与全精度模型完全一致。6倍压缩后,该记住的仍然一字没丢。
速度提升:在H100 GPU上,4-bit TurboQuant计算注意力logits的速度,相比32-bit未量化基线提升了8倍。需要说明的是,这是注意力计算环节的加速比,并非端到端推理的整体提速——但注意力计算恰恰是长上下文推理中最吃资源的那一环。
向量搜索:在GloVe数据集(200维)上,TurboQuant击败了PQ和RabbiQ两大前沿方法,拿下最优召回率。而对手还依赖庞大的密码本和针对性调优,TurboQuant全程“裸奔”通杀。
对芯片存储巨头而言,这无异于一场“底层逻辑地震”。
美光、西数等巨头的估值基石,长期建立在“AI服务器单机容量红利”之上——大模型对内存的贪婪需求,被视作高性能存储持续增长的核心驱动力。一旦单次推理任务的比特需求发生结构性骤降,这个增长故事就面临“缩水”风险。
Cloudflare首席执行官Matthew Prince将其形容为“谷歌的DeepSeek时刻”——一个算法层面的突破,直接冲击了硬件厂商的估值逻辑。
但存储芯片的天,真的塌了吗?
科技行业有一条反复被验证的铁律——杰文斯悖论:资源使用效率越高,总消耗量反而越大。KV缓存压缩6倍,最可能的结果不是少买内存,而是同样的显存跑更长的上下文、更多的并发、更大的模型。压缩算法从未从根本上改变过采购量。
不过,有两件事确实在发生改变。
第一,推理成本的地板价被改写了。TurboQuant的核心思想向全行业敞开,当3-bit能做到过去16-bit的事情,受益的是每一个做推理服务的公司,感到压力的是那些指望“量价齐升”永远持续的存储厂商。
第二,从论文到落地的路正在缩短。谷歌博客发出不到24小时,就有独立开发者基于PyTorch和Triton kernel在RTX 4090上复现了2-bit精度下的Gemma 3 4B,输出与未压缩版本逐字符一致。另一位开发者实测后惊叹:面对8.5K到64.2K不等的大跨度上下文,2.5-bit量化让KV缓存缩小了4.9倍。
当然,冷静看待:TurboQuant目前仅在8B参数级别的开源模型上得到验证,70B以上的模型、MoE架构、百万级上下文窗口上的表现尚未证实。谷歌也没有宣布它已部署到Gemini或任何生产系统中。
但这次事件传递出的信号足够清晰:在算力军备竞赛里,最锋利的武器未必是更大的芯片,也可能是更聪明的数学。技术不关心股票代码,只关心比特的边界在哪里。
参考资料:
https://arstechnica.com/ai/2026/03/google-says-new-turboquant-compression-can-lower-ai-memory-usage-without-sacrificing-quality/https://research.google/blog/turboquant-redefining-ai-efficiency-with-extreme-compression/ https://x.com/StockSavvyShay/status/2036799431144804648?s=20
以为能躺赚,结果“养虾”变成了“养雷”,第一批“养虾人”已经失眠了……
DeepSeek被针对,Anthropic指控三家中国AI蒸馏剽窃,马斯克硬刚“贼喊抓贼”!
明明大厂裁员滚滚,为什么运维还这么难招?
在 SQL 中写了 in 和 not in,技术总监让我明天不用来了
年底了!系统稳如狗,甲方觉得我们没工作量,怎么收运维费?
为什么DeepSeek火之后,人们想到的是大量裁员,而不是实行上三休四?
《AI数据分析之ChatBI发展与应用实践》白皮书(附下载)正式上线啦
号外!《核心系统分布式数据库选型指南》电子书(附下载)正式上线
解锁数据架构现代化密码,《实时数仓选型指南》电子书(附下载)正式上线啦