清华TsinghuaNLP团队,登上Nature子刊封面:“模型的能力密度,每3.5个月翻倍”
《Densing Law of LLMs》 论文,登上 Nature Machine Intelligence 封面
这篇论文,提出了一个很有趣的点
Densing Law
模型的能力密度,每 3.5 个月翻倍
通过分析了 51 个开源模型,量化了一个现象:
• 模型能力密度,呈指数级增长,倍增周期约 3.5 个月 • 这意味着达到同等性能水平,所需的参数量每 3.5 个月减少一半 • 伴随参数效率的提升,同等性能下的推理成本每 2.6 个月腰斩
本论文的第一作者为肖朝军,通讯作者为韩旭、刘知远、孙茂松,来自清华TsinghuaNLP团队
论文回顾
让我先用简明的方式,简单讲下论文:能力密度,每 3.5 个月翻倍,这里的能力密度是什么?
能力密度 = 等效参数量 ÷ 实际参数量
换句话说:
2B 模型跑出 4B 的成绩,密度就是 2
Llama-1 发布时,密度不到 0.1
两年后,Gemma-2-9B 和 MiniCPM-3-4B 接近 2
两年,能力密度提高 20 倍
和体感是不是很接近?模型咔咔在变聪明
那么...怎么涨的?
你可能听说过小模型变强的两种做法:
• 剪枝:把大模型参数砍掉一部分 • 量化:把参数精度从 32 位降到 8 位
但论文发现,这两种方法都会让密度下降
• Llama-3.2-3B/1B 从 8B 剪枝来,密度比原模型低 • Llama-3.1-minitron-4B 也是,密度也低 • GPTQ 量化后,密度同样下降
论文解释:
压缩过程中训练不充分,能力没塞回去
密度提升靠的是更好的预训练数据,更好的架构,后期压缩是没用的
那如果 3.5 个月翻倍这个规律持续下去,会怎样?
论文给了几个推论
密度提升靠的是更好的预训练数据,更好的架构,后期压缩是没用的
那如果 3.5 个月翻倍这个规律持续下去,会怎样?
论文给了几个推论
推论一:推理成本指数下降
密度翻倍,同等性能所需参数量减半,算力显存跟着减半
论文算了一下:同等性能的推理成本,每 2.6 个月腰斩
推论二:ChatGPT 加速了密度增长
ChatGPT 发布前,密度增长斜率是 0.0048,发布后变成了 0.0073
增速提升 50%
这说明... AI 大火之后,人、钱、资源都涌了进来,增速实打实提高了
推论三:端侧设备会越来越能打
在过去几年里,相同价格芯片的计算能力大约每 2.1 年翻一番
而根据上面的结论,模型密度每 3.5 个月翻倍
叠加一下:固定价格端侧设备,能跑的有效参数量每 88 天翻番
emmmmnm...未来可期
历史回顾
这部分和论文无关,是我自己整理的行业数据,我们来看看实际价格
先说量贩式
2022 年底,ChatGPT 发布的时候,能用到的模型叫text-davinci-003 ,后面也被称作 GPT-3,定价是 20 美元/百万 token
2024 年 7 月,GPT-4o mini 出来了,0.15 美元/百万输入 token,比 GPT-3.5 Turbo 便宜 60%,MMLU 跑分还更高——82% vs 69.8%
2024 年 8 月,Gemini-1.5-Flash,0.075 美元/百万 token
从 text-davinci-003 到 Gemini Flash,20 个月,降了 266 倍
旗舰模型呢?
最开始的 GPT-4,是 23年6月13日发布的,输入是 60 美元/百万 token。还有个更贵的 GPT-4-32k,输入是 60美金/百万 token
而最新的 GPT-5.1 则只需要 1.25 美元/百万 token
顺便说一下,国产平替 GLM-4.6 更是低至 0.3 美元/百万 token,要啥自行车
不仅仅是价格巨幅降低,性能也是节节攀升,曾经的模型能力,从现在的角度,完全不够看
再看小模型
2024 年 2 月,MiniCPM-2.4B 发布,参数量只有 Mistral-7B 的 35%,跑分接近 Mistral-7B,中文、数学、代码还更强,整体超过 Llama2-13B、MPT-30B、Falcon-40B
考虑到 Mistral-7B 是 2023 年 9 月发布的,那么...
4 个月,参数量砍到 35%,性能不降
这样的例子还很多,大致都可以和论文的 Densing Law 对得上,未来大模型的发展都可以参照这个来评判
穿插个题外话:Dense vs MoE
上文中,我提到过两种模型,一种是几百B的,另一种则是几B的...
一些朋友可能会好奇,为啥都是大模型,有的贼大,有的贼小...
这其实是个架构问题,有些是 MoE 架构,体积大,适合服务器部署(训练/规模化推理成本有优势);有些是 Dense 架构,体积小,适合本地部署(尺寸上有优势),详细的解释可以看这里:大,就聪明吗?
总结
一句话展望
按这个发展速度,在小天才手表上,跑 Nano Banana,指日可待