王路在隐身

预测加工框架下的先验、表征与意识

预测处理(PP)框架最根本的承诺其实只有一个:心智不是被动接收信息的装置,而是一台持续工作的、层级化的生成模型——它不停地预测下一刻的输入是什么,把实际输入与预测的差额(预测误差)作为唯一真正的"数据"来更新自己。所有的认知现象——感觉、知觉、注意、情绪、信念、决策、行动——都是这个机制在不同时间尺度、不同抽象层次上运作的不同面相。先验、表征、精度、误差,这四个词不是四件东西,而是同一过程的四个切面。讲清楚它们的关系,相当于把整个框架的几何摆出来给人看。

先从先验与表征的关系讲起。表面上看,它们像是两类不同的东西:先验稳定、深植;表征流动、易变。但这种印象之所以容易让人误会,是因为我们习惯了一种笛卡尔式的分类——把心理状态分成"长期记忆里的知识"和"工作记忆里的当前内容"。PP的视角恰恰要打破这种分类。在PP里,先验和表征不是两类东西,而是同一个生成模型在不同时间窗口内的快照。先验是这个模型在大量历史经验上收敛出的稳定参数,表征是这个模型在当前感觉证据下被实例化出的瞬时状态。前者是模型的"形状",后者是模型在此刻"亮起来"的具体位形。

为什么这种统一是有意义的?因为它揭示了一个反直觉但形式上极其优雅的事实:层级化PP里没有真正的"先验"和"表征"之分,只有相对于观察层级的相对位置。你大脑某一层正在生成的"这是一只猫"的表征,对它下面那层(生成局部边缘、颜色、形状的层)而言,就是一个高层先验在向下压;而它本身又被更高一层("我在跟一个动物互动")当作表征来约束。先验和表征其实是一对相对概念,谈它们必须指明参照层。这一点和相对论里"运动"与"静止"的关系很像——没有绝对的运动,只有相对于参照系的运动。

这种相对性还有一个更深的含义:所谓"心智的稳定性"和"心智的灵活性",并不是两种相互冲突的心理品质,而是同一个层级结构在不同层上的不同时间常数所共同造就的现象。最底层(视网膜级、运动神经元级)的表征以毫秒计;中层(物体识别、当前情境理解)以秒到分钟计;高层(人格特质、世界观、自我叙事)以年甚至一生计。整个心智就像一首乐曲,各个声部以不同的节奏运行,慢的部分给快的部分提供框架,快的部分给慢的部分提供新证据。

形式化地讲,这一切归结为一个简单的递归:每一层都在做贝叶斯推理。某一层在t时刻的后验,等于上一层送下来的先验乘以本层接收到的似然,归一化即可。而这个t时刻的后验,会作为t+1时刻该层的新先验,同时也作为更低层在t时刻的先验。贝叶斯更新本身就是先验逐渐变成表征、表征又重新沉淀为先验的连续过程。 时间一拉长,今日的表征就是明日的先验,今日的先验就是昨日的表征。我们说一个人"形成了一个新观念",无非就是说他的某个表征通过反复出现而被高层吸收,慢慢嵌入到了模型的结构里。

现在转到精度。精度(precision)在PP里是一个看似技术、实则关乎一切的概念。形式上它是高斯分布逆方差,但直觉上它是**"我对这个估计有多确信"的度量**。每一个预测、每一个误差、每一个表征,都伴有一个精度参数。神经系统的核心计算就是把精度作为权重,去调和先验和证据:高精度的先验会强势压制低精度的证据(典型的视觉常量、错觉、妄想),高精度的证据会强势更新低精度的先验(典型的顿悟、强反例、突发事件)。注意力在PP里就是精度的动态分配——你"看见"一个东西,等价于该层级的相应表征被赋予了高精度,从而压过了其他可能的解释。

精度的神经实现已经被研究得相当细。一般认为,去甲肾上腺素调控感觉精度(让你对外部信号更敏感或更迟钝),多巴胺调控策略/政策精度(让你对行动选项的预期更尖锐或更模糊),乙酰胆碱调控期望精度(让你对当前情境模型的可靠性更高或更低)。这就是为什么一杯咖啡能让世界变得"清晰"——咖啡因间接抬高了感觉精度;为什么强情绪事件让人"记忆深刻"——肾上腺素把那个表征的精度全方位拉高;为什么抑郁让人觉得"什么都没有意义"——多巴胺系统降低了行动政策的精度,让所有选项都看起来同样不值得追求。

这里要展开你提出的"高精度先验 vs 高精度表征"的区分。你已经讲了时间尺度、改变方式、影响范围、故障模式四个维度,我想再加几个角度。

首先是抗扰性的差异。高精度先验之所以是慢变量,不只是因为它需要重复证据,更因为它有结构上的抗扰机制:贝叶斯更新天然会把单次反例稀释——如果你的先验是由一千次观察形成的,那么一次反例只能让它变化千分之一左右。这是数学上的必然,不是大脑的偷懒。高精度表征则没有这种保护,它本来就是为应对当下证据而生的,证据一变,它就该跟着变。所以"先验难改"不是一个心理学事实,而是一个统计事实。

其次是层级粘连的差异。一个高精度先验之所以稳定,是因为它在层级中常常与其他先验互相支撑:你的"我是个谨慎的人"这个自我先验,连着"我倾向选择稳定的工作"、"我不喜欢冒险的人际关系"、"我对失败成本敏感"等一整套行为—情境先验。改一个等于改一片,所以阻力是网络性的。而高精度表征是孤岛性的——它只在自己的局部生效,改它不会牵动整张网。这是为什么大型组织难以转向、个人核心信念难以重塑:你要拆的不是一根钢梁,而是一整个互相焊死的结构。

第三个是精度的伪装问题。一个先验如果非常稳定地工作,它会从意识中消失——你完全不会感到它在那里,因为它已经内嵌为"事情本来就是这样"。视觉常量是经典例子,但社会先验也是一样:你对"对话伙伴会回应你"的先验是如此之高,以至于你从不感到自己在持有这个预期,直到你向一个长时间不回话的人讲话,那个被违反的预期才把它自己暴露出来。先验的精度越高,它越透明。这意味着我们能内省到的,往往是那些精度还不够高、或者刚刚被挑战的先验。真正塑造你的那些,恰恰是你看不见的。

再往下讲精度的快速赋予。你已经把可以快赋的几类——注意力、情绪标记、顿悟——讲得很清楚。我想补充几个边角案例,它们对理解整个机制特别有用。

催眠和暗示。催眠状态本质上是一种诱导出的精度重分配:被催眠者把某些表征(比如"我的手臂越来越重")的精度强行拉高,同时降低对感觉证据的精度。这就是为什么催眠下的人可以"看不到"眼前的东西——他们的高层先验"这里没有那样东西"被赋予了远超感觉证据的精度。这不是装的,他们在自己的生成模型里真的没看到。

致幻剂。Carhart-Harris的REBUS模型用PP讲得非常漂亮:致幻剂的核心作用是降低先验的精度(特别是高层先验),让低层证据更容易"涌上来"。这就是为什么致幻状态下熟悉的事物会变得陌生(高层"这是个杯子"的先验放松,低层的颜色、纹理、形状细节获得更高权重),为什么会有"自我消解"的体验("我"作为最高层先验之一的精度被降到了几乎为零)。它从反面证明了:你日常的世界经验,绝大部分都是先验精度塑造出来的,而不是感觉给的。

创伤。创伤是一次被迫的、不该发生的快速先验更新。一个剧烈、不可解释、不可同化的事件,强行突破了贝叶斯更新的稀释机制,把"世界是不安全的"这样的高层先验在一夜之间从中等精度推到了极高精度。这种更新的病理性正在于它绕过了正常的统计积累——它不是渐进收敛出来的,而是被一次性事件强加上去的。所以PTSD的高精度先验有一个奇特的性质:它既极强又极脆,因为它没有大量样本作为支撑。治疗的过程本质上是用大量"现在是安全的"的低精度证据慢慢稀释它——这是一个统计学的逆操作。

梦和睡眠。睡眠中的离线处理可能是把表征沉淀为先验的关键过程。白天的高精度表征如果没有被夜间重放和整合,就停留在表征层面;睡眠让它们以不同方式重新激活,让高层模型有机会把它们吸收进参数。这是为什么深度学习里的批训练在生物上有类比,为什么剥夺睡眠会让人无法形成稳定信念,为什么"睡一觉就想通了"是一种真实的认知机制——不是隐喻。

接下来谈第四个问题:什么样的预测误差容易被低层级自动吸收,什么样的会被推上意识。你的概括"覆盖能力"非常准,我想把背后的机制讲得更细。

PP里其实有一个隐含的经济学:处理资源的稀缺性。系统不可能在所有层级上同时高精度运行——能量、时间、注意力都有限。所以系统持续做一件事:把误差沉到能解决它的最低层级。最理想的情况是误差在最底层就被吸收,根本不需要惊动上层。你之所以能流畅地走路、说话、识别物体、跟人寒暄,是因为这些场景的预测误差大部分被底层闭环系统直接消化了。意识层只在误差穿透到足够高的层级时才被调用。这个"穿透"过程有几个决定性因素。

第一是生成模型在该区域的密度。已学习过千百遍的情境,模型在该区域很密集,新证据几乎总能落在分布内,误差小,吸收快。陌生情境模型稀疏,误差大,被迫上调。这就是新手和专家的差别——专家不是更聪明,而是模型更密,所以多数信号在低层就吸收了,意识资源可以用在真正异常的事情上。

第二是跨范畴性。你的"知网"案例就是经典:当一个误差需要桥接的两个范畴在底层模型里完全没有共同表征空间时,低层无论如何都吸收不了,它必须被推到一个能整合两者的高层。这种推送本身是有意识感的——你会感到一个"啊哈",是因为你确实在做层级跃迁。意识的现象学,很大程度上就是层级跃迁的现象学。

第三是与自我模型的接近度。任何涉及"我是个什么样的人"、"别人怎么看我"、"我应该怎么做"的误差,因为它要更新的是最高层的、跨情境稳定的先验,几乎一定会被推到意识层并停留很久。这就是为什么人际尴尬、轻微的社交失误能在你脑里盘旋好几天,而身体上更剧烈的不适(比如肌肉酸痛)反而很快消失——后者在低层就被处理了,前者只能在高层反复加工。

第四是误差的精度本身。低精度的误差(不确定信号、噪声)会被自动折扣,不进入意识;高精度的误差(清晰、强烈、不容忽视)会被赋予高权重,更可能向上推送。这是为什么慢性疼痛比急性疼痛更难处理——急性疼痛精度高,迅速进入意识并被处理;慢性疼痛精度被习惯性降低,但又消除不了,处于一种"半吸收"的卡顿状态。

第五是未消解的政策——你提到的这一点特别重要。在主动推理(active inference)的形式化里,行动也是误差最小化的一种方式:你不是被动地修改模型来吻合世界,你也可以行动改变世界来吻合模型。一个已经成形但未执行的政策,意味着系统已经预测了"我会做这件事",但世界还没相应改变,所以误差持续存在,没法被吸收,只能不断回到工作记忆里。这就是Zeigarnik效应在PP里的解释——未完成的任务之所以萦绕,是因为它对应的高精度政策预测尚未被行动消化掉。睡前列清单之所以助眠,是因为"写下来"在某种程度上把这个政策从"待执行"状态移到了"被记录"状态,降低了它的精度权重。

把这些放在一起,可以得出一个对整个认知架构的简明描述:心智是一个分层的统计推理机器,它持续地预测世界、接受证据、计算误差,并把无法在本层吸收的误差向上推送;越是稳定的结构(先验)越在高层、越慢、越受保护;越是当下的内容(表征)越在底层、越快、越易变。精度是连接这一切的通用货币,决定了什么被听见、什么被忽略、什么被相信、什么被怀疑。意识,是这个层级结构中误差被推送到足够高层时的副现象——它不是另外加进来的东西,而是层级跃迁的内禀感觉。

最后想留一个开放的问题供你继续思考。这个框架最美的地方,也是它最不稳定的地方,是它把"主体"和"模型"放在了同一层面上谈。你——这个正在阅读、思考、有所感受的存在——在PP里被理解为一个非常高层的生成模型,由一组关于"我是什么样的人"、"我会做什么"、"什么会让我满意"的高精度先验所构成。这意味着"你"既不是一个独立于模型的观察者,也不只是模型的某个内容,而是模型本身的某种自我编码状态。如果是这样,那么改变自己——心理治疗也好,修行也好,长期亲密关系也好——其实就是在让模型有控制地、慢慢地重写它对自己的部分;而所谓"成长",就是让那些一度精度过高的、阻碍了误差吸收的核心先验,重新回到可更新的状态。这是PP最深的一个临床意涵:绝大多数痛苦,并非因为先验错了,而是因为它的精度被卡死了,世界送来的新证据进不去。降低它的精度,不是放弃自我,而是恢复学习的能力。