最小表征识别:AI测试的新方向
一、为什么"太简单"的任务反而最深
这里有两个老悖论叠在一起。
第一个是 Moravec 悖论:对人类最难的事(下棋、证明定理、算积分),对机器往往相对容易;对人类最轻松的事(认脸、走路、抓东西),对机器反而最难。原因不神秘。下棋是人类很晚才发明的能力,大脑为它做的专门优化很少,所以"难"。认出一个熟人则有几亿年的视觉进化和几十年的个人经验打底,高度优化,于是显得毫不费力。我们感觉"简单",恰恰因为底层工作量太大、自动化得太彻底,意识根本看不到。
第二个是 Polanyi 悖论:"我们知道的比我们能说出来的多。"你能从背影认出父亲,却说不清靠的是肩膀的角度、步幅的节奏还是头部的晃动。这类知识是默会的,不走语言通道。
这两点合在一起,对今天的 AI 有一个很具体的推论。当前主流系统的能力很大程度上来自人类留下的数据,尤其是文本。人类能说清楚的东西,互联网上就有大量描述、讲解和示范;人类说不清的东西,数据里只有结果(照片、录音、作品),没有过程。没有人写过"我是如何通过三个音认出《茉莉花》的"。所以你挑的这类任务,正好落在训练数据最稀薄、最没有捷径可抄的区域。它们不是简单,而是语言无法代劳。
二、"稳定的对象"到底指什么:不变量
"系统是否形成了稳定的对象"这句话,可以换成一个更可操作的说法:一个对象,就是在一组变换下保持不变的东西。
这个思路来自数学。克莱因的埃尔朗根纲领把各种几何定义为"在某个变换群下保持不变的性质":欧氏几何保长度和角度,射影几何只保共线性和交比。认知里的"对象"也是这样。所谓认识一个东西,就是知道哪些变化无关紧要,哪些变化会让它不再是它。
用这个视角重看你的例子,会发现每个例子在测一种不同的不变性。
旋律的例子最清楚。一首歌换个调、换个速度、换件乐器、只剩开头几个音,每个音的绝对音高、时长、音色全变了,人照样认得出。剩下的只有音与音之间的音程关系和节奏比例。这说明人类记住的"这首歌"根本不是一串声音,而是一个关系结构。一个只记住绝对频率的系统,换调就会崩溃。
步态认人把外观信息全部删掉。Johansson 在 1973 年做过经典的"点光源"实验:在人的关节上贴几个光点,在黑暗中拍摄,静止时只是一团无意义的点,一动起来,人立刻看出这是一个在走路的人。后来 Cutting 和 Kozlowski(1977)发现,人甚至能从这种光点录像里认出自己的朋友。剩下的只有运动动力学:质量分布、关节协同、节奏习惯。
极简漫画测的东西更微妙。漫画并不忠实,它扭曲度量,却保留甚至放大关系。心理学里有个"漫画效应"(Rhodes、Brennan 和 Carey,1987):夸张过的漫画像,有时比精确描摹的线稿认得更快。这说明人脑存的面孔不是一张照片,而更像"这张脸偏离平均脸的方向和幅度"。漫画家的三两笔,画的正是这个偏离向量。
旋转、遮挡、变形测的是三维结构和"非模态补全":看到被遮住一半的杯子,你感知到的是一个完整的杯子,而不是半个杯子形状的色块。
潦草字测的是书写的生成结构:笔画顺序、结构部件、字形的拓扑关系。草书可以扭曲到几何上面目全非,但熟练的读者知道它是怎么"写"出来的。
最后两个例子(认画家、认作者)和前面方向相反,值得单独说。前面几个是在风格和呈现方式剧烈变化时认出内容(是什么);认画家、认作者是在内容完全不同时认出生成者(谁做的)。一个是"换了画法还是这只猫",一个是"换了题材还是毕加索"。人类能在这两个方向上同时做分离,把"是什么"和"怎么做的"拆成两个独立的轴。一个真正形成了稳定表征的系统,应该在两个方向上都能做到;如果它的内容识别和风格识别互相纠缠,比如因为画风陌生就认不出画的是猫,或者因为题材陌生就认不出画家,那就暴露出它没有完成这种分解。
三、为什么"删除"能暴露差异:冗余会掩盖理由
这是你那段话里最有洞察力的部分,可以再往深推一步。
一张完整的照片里,几十种特征同时指向同一个答案:形状、纹理、颜色、背景、光照、常见的拍摄角度。一个系统给出正确答案时,你无法知道它用的是哪一个。正确答案完全可以出于错误的理由。机器学习里把这叫"捷径学习"(shortcut learning):模型学会了某个在训练分布中恰好有效、但并非本质的线索。
最著名的例子是 Geirhos 等人 2019 年的研究。他们发现在 ImageNet 上训练的卷积网络严重偏向纹理而非形状:给一张猫形状、大象皮肤纹理的图,人说是猫,网络说是大象。Baker 和 Kellman 等人 2018 年的研究也发现,这类网络对物体剪影和整体形状的利用很弱。在完整照片上,这些网络和人一样准确,差异完全被冗余掩盖了。
所以删除本质上是一种因果干预,相当于神经科学里的损毁实验,或者机器学习里的消融实验。你每删掉一类信息,就迫使系统暴露它是否依赖这类信息。
还有一点更深:真正的"骨架"往往不是像素的子集,而是关系。旋律的骨架是音程,不是某几个音符;漫画的骨架是相对于平均脸的偏离,不是某几根线条。所以"最小表征"更准确的说法,大概是统计学里的最小充分统计量:保留了判断身份所需全部信息的最简压缩。而人类在删除过程中何时崩溃、以何种方式崩溃,恰好揭示了人类的充分统计量是什么形式。AI 的崩溃点则揭示了 AI 的形式。两者不重合的地方,就是表征差异所在。
这也关系到"理解即压缩"的老观点。能从极少线索中认出对象,意味着系统内部有一个足够强的生成模型,能把缺失的部分"补"回来。这有点像认知科学里的"合成分析"(analysis by synthesis):识别不是被动匹配,而是主动用内部模型去解释输入。线索越少,对内部模型的依赖越重,于是越能看出内部模型的质量。
四、前人已经走到了哪里
这个方向不是空白,这其实是好消息:说明它确实可行,也说明哪里还留着空地。
1954 年,Attneave 画了一只著名的"睡猫":只取猫轮廓上曲率最大的几十个点,用直线连起来,人一眼就认出是猫。他由此提出,形状信息集中在曲率极值处。
Biederman 1987 年的"成分识别理论"做了一个很漂亮的对照:从物体线稿里删去同样多的轮廓,删在线段中间,人很容易补全;删在顶点和凹角处,物体几乎无法识别。删多少不重要,删在哪里才重要。这个设计至今都值得直接搬到 AI 测试里。
Mooney 在 1957 年做了只有黑白两色的高反差人脸图,阴影和轮廓混在一起,人通常能看出脸,而且一旦看出就再也"看不回去"。这说明识别涉及强烈的自上而下的解释。
最接近你想法的是 Ullman 等人 2016 年发表在 PNAS 上的《人类与计算机视觉中的识别原子》。他们把图像不断裁小、降低分辨率,找到"最小可识别构型"(MIRC):再小一点点,人类识别率就断崖式下跌。这个断崖本身就很说明问题,意味着人类识别依赖某种结构性的"最小单元"。而当时的深度网络在这些最小图像上表现很差,也没有表现出人类那种断崖式的转变。作者推测,人类在这种情况下的识别涉及对局部结构的内部解释,而不只是一次前馈的特征匹配。
在字符上,Lake、Salakhutdinov 和 Tenenbaum 2015 年的 Omniglot 研究表明,人看一个陌生文字系统的字符一次,就能认出别人手写的同一个字、甚至自己写出来。他们的模型之所以接近人类,是因为它学的是"字是怎么一笔一笔写出来的"这一生成过程,而不是字的外观。这正好是你说的"稳定对象"的一个具体实现。
在多模态大模型上,2024 年有一篇论文标题就叫《视觉语言模型是盲的》,测的是两个圆是否重叠、两条线相交几次这类小学生都会的任务,当时的顶尖模型错得很离谱。另外,Geirhos 等人 2021 年发现,用海量数据训练的大模型在各种图像失真下的准确率已经接近甚至达到人类水平,但它们和人类"在同一批图上犯错"的一致性,仍然明显低于人与人之间的一致性。这一点很关键,下面会用到。
需要说明的是,模型进步很快,上面有些具体失败可能已经被新模型部分解决。所以这个方向的价值不在于找到一个"AI 永远做不到"的静态题目,而在于建立一种能持续测量表征差异的方法。
五、怎么把它做成真正有效的测试
直觉很好,但要成为可靠的研究工具,设计上有几个关键点,否则很容易测出假结论。
第一,测曲线,不测点。单个"能不能认出"是一个点,信息量很小。应该沿一条删除轴逐级削减(轮廓保留比例、分辨率、帧数、音符数、字数),分别画出人类和 AI 的识别率曲线。要比较的不只是准确率,还有三样东西:崩溃阈值在哪里,曲线是平缓下降还是人类那种断崖,以及崩溃后错成了什么。
第二,看错误一致性,而不是平均准确率。两个系统平均准确率都是 80%,可能在完全不同的题上出错。心理物理学里可以用超出随机的一致性(类似 Cohen's kappa)来衡量:AI 失败的那些图,是不是人类也觉得难的那些图?如果 AI 恰好在人类觉得最容易的骨架图上崩溃,在人类觉得很难的图上反而没问题,这比任何准确率数字都更能说明它的表征和人不同。前面提到的 2021 年研究说明,规模扩大后准确率差距在缩小,一致性差距却没跟上,这恰恰说明准确率不够用。
第三,删在哪里比删多少重要。借鉴 Biederman 的设计:同样删除 50% 的信息,一组按人类的诊断性去删(删掉顶点、删掉旋律里决定性的音程、删掉步态里的关键关节),一组随机或删在非关键处。人类对两组的敏感度差异很大。如果 AI 对两组敏感度一样,说明它根本没有抓住"哪些是骨架"。
第四,做双向对照。一类刺激保留低层统计特征但破坏结构,比如把线稿切块打乱、把旋律的音按原音高分布随机重排;另一类保留结构但改变统计特征,比如漫画换成完全陌生的画风、旋律移到极高音区用陌生乐器演奏。一个真正抓住骨架的系统,应该在前者上失败、在后者上成功。如果它对打乱版本照样"认得出",那它用的就是统计纹理。
第五,"熟悉"必须在测试内部建立。这一点对你的例子特别关键。人认熟人、认熟悉作者,前提是真的熟悉。AI 的"熟悉"来自训练数据,而名画、名曲、名人的极简版本很可能本来就在训练数据里:毕加索的公牛线稿、流行歌的前奏片段、名人漫画都被反复传播过。认出它们可能只是记忆,不是抽象。更干净的做法是:在测试中先让系统认识一个全新的对象,比如一个虚构人物的若干照片和视频、一段新写的旋律、一位不存在作者的几篇文章,然后测它对这些新对象的极简版本的识别。人类被试也走同样的流程。这样比较的才是"形成对象"的能力,而不是记忆的覆盖面。
第六,必须测拒识能力。一个对所有简笔画都说"是人脸"的系统,在只含人脸的测试集上表现完美。所以要放入近邻干扰项:前三个音相同的两首歌、步态相似的两个人、风格接近的两位画家、一个"看着像但其实不是"的构型。真正的对象表征不只要能认出,还要能区分。人类在这里也会犯错(比如幻想性错觉,在云里看到脸),这些错误本身也是有价值的对照数据。
第七,防止刷分。一旦成为基准,大家就会专门用草图、剪影、残缺旋律去训练,这时通过测试就不再说明什么。验证码的历史就是现成的教训:扭曲文字当年正是"人类轻松、机器困难"的典型,后来被针对性训练攻破,可攻破它的系统并没有因此获得人类那种一般性的字形理解。所以测试应该程序化无限生成,而且核心指标应该是向没见过的删除类型迁移:用某几种退化方式做开发,用完全不同的退化方式做最终测试。一个真正抓住骨架的系统,不需要专门见过"只剩顶点的线稿",也能认出它。
第八,加上反向任务:让 AI 生成最小表征。人不仅能认出三笔漫画,还能画出来,能哼出一首歌最有辨识度的那几个音。让 AI 用最少的笔画画出某个物体,或者选出最少的几个音让人认出旋律,再让人类去识别。这测的是系统知不知道哪些特征有诊断性。识别可以靠模糊匹配侥幸通过,生成最小表征则必须明确地"知道骨架在哪"。
六、几个需要警惕的地方
这个方向很有价值,但有几处容易讲过头,想讲透就要把它们也讲清楚。
人类的"最小识别"并不都是纯粹的对象表征,有一部分是文化约定。火柴人、表情符号、漫画里的汗珠和速度线,是需要习得的视觉符号,儿童要学,不同文化也不同。草书更明显,没受过训练的人根本认不出。所以"人类一眼认出"未必意味着触及了深层结构,有时只是学会了一套编码。一个在互联网图画上训练过的系统同样可以学会这套编码。设计时要区分约定性的极简(符号)和结构性的极简(点光源步态、换调旋律),后者才更接近你想测的东西。
AI 失败不等于它没有对象,可能只是它的不变量和人类不同。人类也有自己的"捷径"和盲区:视错觉、变化盲视、对倒置人脸识别能力骤降。一个系统也许在人类看不出的维度上有很稳定的表征。所以这类测试的首要功能应该是诊断,画出两种表征的差异地图,而不是简单地把"像人"当成唯一正确答案。当然,如果目标是让 AI 在人类世界里可靠工作,和人类一致的不变性确实非常重要:路口被遮挡一半的行人,对人和自动驾驶系统都必须是"一个人"。
"最小"对人和机器可能根本不在同一个维度上。作者识别就是个好反例。计算文体学的经典方法(比如 Burrows 的 Delta)靠的是"的、了、而且、然而"这类虚词的频率分布,人几乎意识不到,机器用统计在足够长的文本上可以做得很准,某些条件下甚至超过人。但它通常需要成千上万字。而熟悉的读者读两句话就能认出鲁迅或张爱玲,靠的是另一种东西:意象的选择、句子的节奏、观察世界的角度。所以同一个任务,人的最小线索和机器的最小线索可能处于完全不同的维度。这恰恰支持了你的核心判断:比较"最小线索是什么",比比较"最终答没答对"更能揭示表征差异。
规模在缩小一部分差距,关键问题是它怎么缩小的。更大的模型、更多样的数据确实让很多失真测试上的表现接近人类。开放的问题是:这是因为模型形成了更接近骨架的结构,还是因为数据覆盖了更多失真形态,把"分布外"变成了"分布内"?两者从准确率上看一模一样,只有靠错误一致性和向新型退化的迁移才能区分。这也是为什么第五部分的第二点和第七点是整个方法的核心。
七、为什么值得做
回到你那句"只有当世界被削到只剩骨架时,才知道谁真正抓住了骨架",可以把它说得更精确一点:
删除过程真正在检验的是,系统内部的"对象"是一个能被少量结构线索唤起的生成模型,还是一张高维表面相关性的地图。在信息丰富时,这两者的外在表现几乎无法区分;在信息稀薄时,前者还能补全,后者就会失去支撑。
这件事的意义远超基准测试本身。它关系到鲁棒性(现实世界充满遮挡、模糊、残缺),关系到数据效率(抓住骨架的系统需要的样本少得多),关系到安全(系统在陌生情境里的失败方式是否可预测),也关系到一个更根本的问题:我们说一个 AI "理解"了什么,到底是什么意思。
复杂难题测的是系统能在知识的边界上走多远;最小表征测的是它脚下的地基是否结实。前者已经有很多人在做,后者可能才是更容易被忽视、也更能说明问题的那一半。