为什么算力不足才会涌现出智能?
最近,读了一篇论文,让我重新思考了一个很根本的问题:智能到底是什么?
你有没有想过,为什么我们需要"智能"?
而上帝不需要,就可以全能全知,算力无限,任何问题都知道答案。他不需要压缩信息,不需要总结规律,不需要预测未来——因为一切都摆在那儿。
但人类需要。我们的大脑每秒处理的信息极其有限,记忆力也有限。面对浩瀚的世界,我们只能做一件事:压缩。
把无穷无尽的细节压缩成几个规律,把复杂的现象抽象成几个模型。这些被压缩出来的规律和模型,就是我们说的"智能"。
这篇CMU和NYU的新论文,本质上在说同样的事:AI模型的智能,也源于算力不足。
01 从无限算力到受限算力
经典信息论里有个默认假设:观察者有无限计算能力。
这个假设听起来很抽象,但后果很实在。
举个例子:给你一个用DES加密的序列。
对有无限算力的人来说,这个序列很简单——就是个加密算法+密钥。你可以说:"这是用密钥123456加密的'Hello World'",描述长度很短。
但对算力有限的人来说,这个序列看起来完全是随机的。你破解不了,只能记下来:"0x7a3f... 0x9b2c...",描述长度和序列本身一样长。
信息量变了?当然变了。不是序列本身变了,而是观察者的计算能力变了。
论文里把这个差异形式化成了两个概念:
时间受限熵:算力有限的观察者看来,数据里随机、不可预测的部分。
Epiplexity(认知复杂度) :算力有限的观察者,从数据中提取并压缩出来的结构化程序长度。
用人类的话说:时间受限熵是你记不住的细节,Epiplexity是你学到的规律。
02 为什么需要智能?
想象你是个原始人,看到太阳每天升起又落下。
有无限算力的人会怎么做?记录每一次日出的精确时间、位置、天气,然后说:"明天日出会是某个具体的时刻"。
但你没这本事。你的大脑记不住那么多细节。
所以你学会了压缩: "太阳每天都会升起" 。
这句话很短,但它丢掉了很多信息——今天的日出和昨天有什么细微差别?云层会不会挡住?精确到哪一秒?
但这些细节,对你够用了。
更重要的是,这个规律还可以用来做预测:明天会日出,后天也会日出。甚至可以推广:如果今天日落了,明天大概率还会升起。
这就是智能的起源——因为算力不足,所以必须压缩;因为压缩,所以产生规律;因为规律,所以能预测。
03 AI模型在做同样的事
论文用大量实验证明,AI模型的训练过程,和人类智能的形成过程本质上是一样的。
他们研究了康威生命游戏,一个经典的复杂系统。
游戏规则极其简单:在一个二维网格里,每个格子根据周围邻居的状态,决定下一刻是死是活。
就这么个简单规则,演化出来的东西却极其复杂:有稳定的方块,有周期性闪烁的振荡器,有到处移动的滑翔机,有能不断发射滑翔机的"枪"。
对有无限算力的观察者,直接运行规则就行了。程序很短:"for each cell, count neighbors, apply rule"。
但算力有限的观察者(比如神经网络),要预测未来的棋盘状态,直接模拟太慢了。
所以它学会了压缩:识别滑翔机、振荡器这些模式,记住它们的移动规律和碰撞规则。
这个压缩出来的程序,比直接运行生成规则要长——因为要多加一层模式识别的逻辑。但它能让你用更少的计算,做同样的预测。
论文把这个现象叫Epiplexity增加:算力不足迫使模型学到比生成过程更多的结构。
04 一个反直觉的发现:算力越多,Epiplexity可能越低
这篇论文有个实验特别有意思。
他们训练transformer来预测元胞自动机的演化,比较两种模型:
- 1.直接预测模型:直接从初始状态预测演化48步后的状态
- 2.循环展开模型:预测第1步,再预测第2步,一直展开48步
结果呢?
在算力不足时,直接预测模型表现更好——因为循环展开48步太贵了,算不过来。模型被迫学会识别模式,Epiplexity增加。
但当算力提升到某个临界点后,突然逆转:循环展开模型表现更好。
为什么?因为算力够的时候,模型就不用学那些复杂的模式了,直接暴力模拟就行。暴力模拟的程序更短,Epiplexity更低。
这说明了什么?算力越足,越不需要"智能" 。
上帝不需要智能,因为他能暴力模拟一切。人类需要智能,因为我们算力不够。
AI模型也一样。小模型必须学会压缩、抽象、总结,因为算力不够。大模型如果算力太足,反而可能退化到暴力搜索。
为什么文本数据能训练出通用智能?
论文还解释了一个业界观察了很多年的现象:为什么语言数据特别适合预训练?
他们测量了不同模态数据的Epiplexity:
- 文本数据(OpenWebText):Epiplexity最高
- 国际象棋对局:中等
- 图像数据(CIFAR-5M):Epiplexity最低
翻译过来:文本数据的"结构化信息"最多,图像数据的"随机噪声"最多。
为什么?
想想你读小说和看照片的区别。
读小说时,你的大脑在进行大量的压缩和推理:记住人物关系,理解剧情逻辑,预测接下来会发生什么。每一个字都承载着结构化信息。
看照片时,你看到的是像素:这只猫的毛是黑白的,背景是绿色的窗帘,光照从右边来...大部分这些像素变化是随机的、无关紧要的。同一只猫换个角度拍,像素完全不同,但语义信息一样。
所以模型在图像上学到的东西,大部分是"记住这些像素的组合",很难压缩成可复用的结构。
文本不一样。语言有语法、有逻辑、有长程依赖,模型被迫学会压缩这些结构——而这些结构恰恰是智能的基础。
06 涌现是什么?
就是被迫学会更聪明的压缩
论文还用这个框架解释了AI里一个神秘的概念:emergence(涌现) 。
大语言模型训练到某个规模时,突然会展现出一些能力——数学推理、代码生成、多语言理解。这些能力在小模型上完全不存在,训练曲线也是突然跳变的。
为什么?
用Epiplexity的视角看,这很简单。
小模型算力不足,学到的压缩方式比较粗糙。比如,看到"2+2=",它可能只是记住了训练数据里这个模式后面通常跟"4",但不理解加法的本质。
算力提升后,模型可以"买得起"更复杂的压缩方式了——它学会真正理解加法是什么,而不仅仅是记住模式。
但学到这个更复杂的压缩方式,需要跨过一个计算阈值。在此之前,模型一直用简单的模式匹配;一旦跨过去,突然学会了更本质的规律——这就是涌现。
涌现在本质上是:算力提升允许模型学会更高效的压缩方式,而更高效的压缩意味着更深刻的理解。
07 数据选择的启示:不是降低loss,而是提高Epiplexity
论文最后一部分,用Epiplexity重新思考了一个很实际的问题:预训练数据应该怎么选?
传统方法是看loss:哪些数据能让模型perplexity更低,就多喂一点。
但论文说,这个方法有根本问题。
降低loss可能只是让模型更好地"记住"训练数据,不一定学到可迁移的结构。就像你死记硬背了一本字典,但不懂这些词怎么用在句子里。
真正重要的是Epiplexity:哪些数据能让模型学到更多结构化信息,即使这些数据不一定让loss更低。
他们研究了一种叫ADO的算法,动态调整训练数据分布,优先喂给模型那些"学得快"的数据。
结果发现:ADO选出来的数据,Epiplexity更高,下游任务表现也更好。
这验证了一个直觉:优质数据不是让模型"记住"的东西,而是让模型"理解"的东西。
08 往大了说:AGI的核心是什么?
说到AGI(通用人工智能),这篇论文给了我一些新的思考。
很多人把AGI理解为"更聪明"、"更强大"、"更接近人类"。
但从Epiplexity的视角看,AGI的核心可能不是这些,而是 "更高效的压缩" 。
一个真正的AGI,应该能从任意模态的数据中提取结构化信息,压缩成可复用的模式,然后在完全不同的场景下复用这些模式。
它能从文本中学到逻辑,从图像中学到因果关系,从行为中学到意图,然后把这些全部压缩成一套统一的世界模型。
这就需要极高的Epiplexity——从一切可能的数据源中提取结构的能力。
但这也带来一个问题:当算力无限时,还需要AGI吗?
如果未来的计算设备强大到可以暴力模拟一切物理过程,还需要压缩吗?还需要规律吗?
我觉得答案还是需要。即使算力无限,某些问题的搜索空间还是太大。从无限的可能中找到最优解,还是需要启发式、需要抽象、需要压缩。
智能的价值不在于能不能暴力穷举,而在于能不能用有限的资源做无限的事。
最后:算力不足是一种祝福
说起来,这篇论文让我重新理解了一个很反直觉的观点。
我们总觉得算力不足是种限制,是种缺陷。如果有无限算力,多好。
但也许,算力不足恰恰是智能的起源,是智能的必要条件。
如果上帝创造了人类,但给了我们无限的算力和记忆力,我们还会发展出科学、艺术、哲学吗?
可能不会。我们会像一台超大硬盘的服务器,记录一切但不理解任何。
正是因为我们记不住那么多细节,所以才学会了总结规律;正是因为我们算不过来那么多情况,所以才学会了抽象和推理。
这些被压缩出来的规律和推理能力,就是我们说的"智能"。
AI模型也一样。它们的智能,不是来自算力充足,而是来自算力不足时被迫学会的压缩和抽象。
论文最后一句话说得好:
We argue that the amount of structural information a computationally bounded observer can extract from a dataset is a fundamental concept that underlies many observed empirical phenomena.
翻译过来:我们认为,计算受限的观察者能从数据中提取的结构化信息量,是许多实证现象背后的根本概念。
智能的本质,或许就是:因为算力不够,所以学会了压缩;因为学会了压缩,所以产生了规律;因为有了规律,所以能够预测和创造。
从这个角度看,上帝不需要智能,但我们需要。
而AGI,就是让机器也学会这种"因算力不足而被迫产生的智慧"。
参考资料:
- 论文原文:https://arxiv.org/abs/2601.03220
- 康威生命游戏:https://en.wikipedia.org/wiki/Conway%27s_Game_of_Life
- ADO算法:Jiang et al. (2025) Adaptive Data Optimization
关注公众号,有极客视角洞察未来!