赛博禅心

清华TsinghuaNLP团队,登上Nature子刊封面:“模型的能力密度,每3.5个月翻倍”

Image
Nature Machine Intelligence 封面

《Densing Law of LLMs》 论文,登上 Nature Machine Intelligence 封面

这篇论文,提出了一个很有趣的点

Densing Law
模型的能力密度,每 3.5 个月翻倍

通过分析了 51 个开源模型,量化了一个现象:

  • • 模型能力密度,呈指数级增长,倍增周期约 3.5 个月
  • • 这意味着达到同等性能水平,所需的参数量每 3.5 个月减少一半
  • • 伴随参数效率的提升,同等性能下的推理成本每 2.6 个月腰斩

本论文的第一作者为肖朝军,通讯作者为韩旭、刘知远、孙茂松,来自清华TsinghuaNLP团队

论文回顾

让我先用简明的方式,简单讲下论文:能力密度,每 3.5 个月翻倍,这里的能力密度是什么?

能力密度 = 等效参数量 ÷ 实际参数量

Image
「能力密度」是怎么得来的

换句话说:
2B 模型跑出 4B 的成绩,密度就是 2

Llama-1 发布时,密度不到 0.1

两年后,Gemma-2-9B 和 MiniCPM-3-4B 接近 2

Image
模型能力密度趋势图

两年,能力密度提高 20 倍
和体感是不是很接近?模型咔咔在变聪明

那么...怎么涨的?
你可能听说过小模型变强的两种做法:

  • • 剪枝:把大模型参数砍掉一部分
  • • 量化:把参数精度从 32 位降到 8 位

但论文发现,这两种方法都会让密度下降

  • • Llama-3.2-3B/1B 从 8B 剪枝来,密度比原模型低
  • • Llama-3.1-minitron-4B 也是,密度也低
  • • GPTQ 量化后,密度同样下降
Image
剪枝/量化都没啥用,图自论文 Fig.3b

论文解释:
压缩过程中训练不充分,能力没塞回去

密度提升靠的是更好的预训练数据,更好的架构,后期压缩是没用的
那如果 3.5 个月翻倍这个规律持续下去,会怎样?
论文给了几个推论

密度提升靠的是更好的预训练数据,更好的架构,后期压缩是没用的

那如果 3.5 个月翻倍这个规律持续下去,会怎样?

论文给了几个推论

推论一:推理成本指数下降

密度翻倍,同等性能所需参数量减半,算力显存跟着减半

论文算了一下:同等性能的推理成本,每 2.6 个月腰斩

Image
各种模型的调用价格,飞速下降,图自论文 Fig.3a

推论二:ChatGPT 加速了密度增长

ChatGPT 发布前,密度增长斜率是 0.0048,发布后变成了 0.0073

Image
ChatGPT 发布后,斜率明显上升,图自论文 Fig.3c

增速提升 50%

这说明... AI 大火之后,人、钱、资源都涌了进来,增速实打实提高了

推论三:端侧设备会越来越能打

在过去几年里,相同价格芯片的计算能力大约每 2.1 年翻一番

而根据上面的结论,模型密度每 3.5 个月翻倍

叠加一下:固定价格端侧设备,能跑的有效参数量每 88 天翻番

emmmmnm...未来可期

Image
又不是不可能...

历史回顾

这部分和论文无关,是我自己整理的行业数据,我们来看看实际价格

Image

先说量贩式

2022 年底,ChatGPT 发布的时候,能用到的模型叫text-davinci-003 ,后面也被称作 GPT-3,定价是 20 美元/百万 token

2024 年 7 月,GPT-4o mini 出来了,0.15 美元/百万输入 token,比 GPT-3.5 Turbo 便宜 60%,MMLU 跑分还更高——82% vs 69.8%

2024 年 8 月,Gemini-1.5-Flash,0.075 美元/百万 token

从 text-davinci-003 到 Gemini Flash,20 个月,降了 266 倍

旗舰模型呢?

最开始的 GPT-4,是 23年6月13日发布的,输入是 60 美元/百万 token。还有个更贵的 GPT-4-32k,输入是 60美金/百万 token

而最新的 GPT-5.1 则只需要 1.25 美元/百万 token

Image
OpenAI 的模型价格

顺便说一下,国产平替 GLM-4.6 更是低至 0.3 美元/百万 token,要啥自行车

Image
GLM 的模型价格

不仅仅是价格巨幅降低,性能也是节节攀升,曾经的模型能力,从现在的角度,完全不够看

Image
模型能力进化史

再看小模型

2024 年 2 月,MiniCPM-2.4B 发布,参数量只有 Mistral-7B 的 35%,跑分接近 Mistral-7B,中文、数学、代码还更强,整体超过 Llama2-13B、MPT-30B、Falcon-40B

Image
还是看这个图,圈子大小表示参数量

考虑到 Mistral-7B 是 2023 年 9 月发布的,那么...

4 个月,参数量砍到 35%,性能不降

这样的例子还很多,大致都可以和论文的 Densing Law 对得上,未来大模型的发展都可以参照这个来评判

穿插个题外话:Dense vs MoE

上文中,我提到过两种模型,一种是几百B的,另一种则是几B的...

一些朋友可能会好奇,为啥都是大模型,有的贼大,有的贼小...

这其实是个架构问题,有些是 MoE 架构,体积大,适合服务器部署(训练/规模化推理成本有优势);有些是 Dense 架构,体积小,适合本地部署(尺寸上有优势),详细的解释可以看这里:大,就聪明吗?

Image
大,就聪明吗?

总结

一句话展望
按这个发展速度,在小天才手表上,跑 Nano Banana,指日可待

Image
图是ai画的,但我是认真的...现在的小天才,已经比安尼亚克(ENIAC)强太多了