关于判断如何形成和改变的一次细密梳理
起点
在预测编码和主动推断的框架下讨论心智时,最容易出错的地方不是框架本身,而是框架被使用时的颗粒度。在通常的简化描述里,"一个人的想法变了"被描述为"某条先验的精度变了"。这个描述在某些场合够用,但它把好几样不同的东西压成了一件事。要把现象看清楚,需要把被压缩的几层分开。
一、不同的信念不是同一类东西
日常语言用"信念"、"想法"、"观点"这些词指称许多东西,但在生成模型里这些东西的形态和可变性完全不同。至少要区分三类。
关于状态的信念——"这家公司有前途"、"这个人值得信任"、"我是个专业的人"。这些是对世界某部分处于某种状态的表征。它们在网络里被稳定存储,精度可以高可以低,变化通常慢,需要持续证据的积累或一次足够剧烈的反证。
偏好先验——"人应该诚实"、"工作应该有意义"、"孩子应该得到尊重"。这些不是关于世界实际如何的信念,而是对世界状态的偏好分布。它们决定了在 policy 评估时哪些状态会被赋予正值、哪些被赋予负值。它们也是被稳定存储的,而且往往比状态信念更深——它们是评估的标尺本身,很少被直接反省。
关于该做什么的判断——"我应该接受这份 offer"、"我应该结束这段关系"、"我应该搬到另一个城市"。这一类在表面上看起来和前两类同级,日常语言也这样处理它们,但它们在机制上是完全不同的东西。它们不是被存储的先验,而是一次 policy 评估的派生输出。它们每次被调用时都是重新计算的——取偏好先验、取状态信念、取关于各种可能结果的预测、做 expected free energy 的评估、产出一个"该做什么"的结论。
这三类的可变性截然不同。前两类稳定变化慢,最后一类原则上可以在一次评估里彻底翻转,而不需要前两类发生任何真实变化。
但这个区分不是绝对的。反复产出同样输出的计算会在网络里留下痕迹——装配路径被反复走会被固化,派生结论可以凝固成被直接使用的稳定约束,功能上就是先验。这是为什么宗教仪式不靠提供新证据就能加强信念:它让同一装配路径被反复运行,直到计算输出的产生变得低代价、接近自动,最终这个输出自身开始对下游推断做约束。存储与计算之间是一条连续的梯度,不是一个清晰的切换。
这个区分还带出一个观察:越高精度的先验越透明。中等精度的先验仍然呈现为可被内省的信念——你知道你持有它,能考虑替代方案。精度高到一定程度的先验失去了作为信念的可感特征,它们从被思考的对象变成了思考的介质。一个人不体验自己"相信重力",他体验的是物品会掉下来。"人应该对自己的选择负责"这样的偏好先验之所以很少被质疑,部分是因为它处于透明态——不是一个被持有的信念,而是世界就这样呈现的某种方式。被透明态的先验组织的感知和行为,当事人不会体验为"基于某个信念的选择",而体验为"事情显然就是这样"。
二、在判断层面发生的剧烈变化,底层结构常常没动
理解了上述区分,才能解释一个常见但容易被误读的现象:一个人可以在短短一小时内"想法发生翻天覆地的变化",而他的深层偏好先验和核心状态信念几乎纹丝不动。
一次朋友间的通话、一段意外读到的文字、一个偶然瞥见的画面,可以让一个持有许久的强烈判断彻底翻转。比如一个人一年来反复筹划辞职创业,和人讨论了无数细节,已经在评估办公地点,突然在一次和老同学的饭局之后放弃了这个计划。主观上当事人体验到的是深刻的想法改变,事后叙事也往往是"我想通了"。但在机制层面,什么都没变得那么深。
变的是那次 policy 评估里 rollout 采样了什么。
policy 评估不是简单查询存储的结论,它每次都是一次对可能轨迹的模拟。"如果我辞职创业,接下来会怎样"——系统启动一次 rollout,模拟一组状态:产品被做出来、第一批用户、融到第一轮、团队组建起来。这组被模拟到的状态在偏好先验的评价下产生 pragmatic value——高正值,因为"做有意义的事"、"不受约束"这些偏好先验被满足。policy 评估的输出是正的:应该辞职。
关键在于,这次 rollout 采样了什么状态不是固定的。系统有它的默认采样模式——在持续做某类决策的过程中,某些状态会被典型地采样进 rollout,另一些状态不会。这个人在过去一年里反复考虑"辞职"时,他的默认 rollout 稳定地包含产品愿景、市场空间、能力证明,但不包含"账户余额第十八个月、没人回邮件、妻子问什么时候能稳定下来、凌晨三点醒着盯天花板"——这些状态不是他不知道,是它们不在默认采样清单里。
老同学在饭局上讲自己创业第三年的日常——不是抱怨,也不是劝阻,就是讲——做的不是提供新信息,也不是改变任何深层先验的精度。它做的是 rollout 干预:强制启动一次平时不会自发产生的模拟轨迹。一旦这条轨迹被激活,expected free energy 的计算就自动包含了它——因为"生活要稳定"、"不想让家人担心"这些偏好先验一直在那里,一旦模拟到的状态包含"长期不稳",pragmatic cost 进入计算,policy 评估产出反向的结论。
所以真正翻转的是一个派生量。底下的东西:"我是有能力的人"、"做有意义的工作很重要"、"不应该浪费这些年的积累"——都没动。动的只是在这一次 policy 评估里,把哪些状态装配进了 rollout。
这解释了两件事。一是为什么"翻天覆地"的变化在当事人那里是真实的主观体验——他的 policy 评估输出确实彻底翻了,而这个输出就是他在意识层面作为"我的想法"直接体验到的东西。二是为什么它可以在没有任何深层结构改变的情况下发生——因为被改变的不是深层结构,是对这次评估的 rollout 采样内容。
这也给"想法"这个词一次祛魅。日常语言中"我的想法"常常被当作一个稳定的、位于某处的、代表自己的东西。但在这里能看到,至少有一部分"想法"——那些以"我该 X"形式出现的——其实是每次被重新计算的派生输出,不在任何稳定的位置。它看起来稳定只是因为默认 rollout 稳定地采样同样的内容。
三、精度、routing、rollout 是三样不同的东西
前面用了几个词——精度、routing、rollout 采样——在宽泛的讨论里它们容易被混着用。要把判断形成和改变的过程说清楚,需要把它们分开。
精度——某条先验在被使用时对推断的权重。是参数层面的东西。
routing——在当前情境下,哪些先验被调用来做推断。是路径选择。高精度的先验更容易主导 routing,但 routing 还受情境、神经调质状态、当前任务的影响。
rollout 采样——在一次 policy 评估里,具体哪些状态被装配进了预测轨迹。是计算的内容。
这三者紧密交互但不是同一件事。精度影响 routing 倾向,routing 倾向影响 rollout 的典型内容,但在一次具体的评估里,rollout 的具体内容可以独立地被外部输入干预——在精度和 routing 结构都没变的情况下,rollout 可以采样和默认完全不同的状态。
这个三层区分解释了一个看似矛盾的组合:短时间内发生深刻的主观变化,同时底层网络几乎没动。动的只是一次 rollout 的内容。
但这不意味着三层是完全独立的。一次被激活的非典型 rollout,如果在接下来反复被调用,它所采样的状态会在下游留下痕迹——那些原本低精度的表征因为被反复在场,其运行精度上升;routing 结构逐渐调整以更容易再次激活同类 rollout;直到最后长期权重本身也改变。所以 rollout 的干预是一个入口,它如果被锚定下来可以最终引起深层变化。但入口本身和深层变化不是同一回事。
这也改变了对某些干预的理解。有些对话、书、教育尝试显得"只是让人想到了一些什么"而没有提供新信息——它们的工作恰恰在 rollout 层面,不在精度层面。它们做的是强制启动那些平时不被采样的模拟轨迹,让评估在一次扩展的 rollout 下重新运行。效果是否持续,取决于接下来这条轨迹是否反复被激活,是否在行动层面被锚定。
四、问题空间的打开与评估结构的永久变化
到这里还不够。前面描述了一次 policy 评估的输出如何翻转,但有一个更深的层面在那种时刻也发生了变化,这个层面比具体 policy 评估更持久,也更不容易被当事人觉察。
具体 policy 评估可以波动。今天觉得不该辞职,明天在公司受了气、老同学的话淡了、新的顾虑重新激活默认 rollout,又觉得应该辞职。这种波动是常见的。一次 rollout 干预造成的翻转如果没有后续锚定(告诉别人、做一些不可逆的小动作),具体 policy 的评估输出可能回弹。
但与此同时,一些东西不会回弹——评估结构本身。
老同学的话做的深层工作不是改变这一次评估的输出,是在这个人的 policy 评估的默认采样清单里插入了一个新的维度。"创业第三年的日常是什么样的"这个考虑从此在场。下一次他做任何涉及职业风险的决策——不止是辞职创业,还有接受一个不稳定的项目、拒绝一个稳妥的机会、评估一个朋友的新业务——这个维度都会自动被采样进 rollout。他不需要被重新提醒。它是默认的一部分了。
这种变化是单向的。一旦一个维度被加入了默认采样清单,它不会退出。当事人可以选择在某次具体决策里不给它大权重,但他不能让它不在场。知道"稳定的中期日常是什么样的"这个考虑的人,不能回到不知道它的状态。
这个单向性有一个很重要的含义:真正在一个人长期决策轨迹上起作用的变化,常常不在"哪一次具体 policy 翻转了"的层面,而在"哪些维度从此进入了默认评估结构"的层面。前者可波动,后者不可逆。而后者恰恰是当事人最不容易内省到的——他报告的是"我想通了 X",他不报告"我的评估结构多了一个永久维度",因为后者不在可以被内省的层面。那一小时里他最看不见的变化,往往是最持久的变化。
这也把"问题空间"这个说法落到了具体机制上。所谓"问题空间的打开",在机制上就是 policy 评估的默认采样清单增加了新的维度。所谓"打开了就不会关上",是因为已经进入默认清单的维度不会退出。知道的东西不会不知道。
所以一次对话、一本书、一次经历,在不同层面造成不同持久度的变化。最短暂的是它让某一次具体评估产出了新的输出(这个可能隔天就回弹);中间的是它在某段时间里改变了 routing 倾向和某些运行精度(这个可能持续数天到数周);最持久的是它在评估结构里插入了新的维度(这个不会退出)。判断一次输入的真正影响,不应该只看它当下让人产生了什么判断,而要看它在这三个层面各自留下了什么。
五、为什么特定的干预在特定时刻有效
前面说了干预如何在机制上起作用,但还有一个问题没处理——为什么恰好是这次、这句话、这个人有效,而不是之前无数次同类的输入。
在一个长期的立场里,当事人的身边往往有持续的反对声音——配偶、父母、同事。这些声音按理应该比一个偶然的输入更全面深刻。但它们经常没有穿透力,而一个偶然的短话穿透了。这不是偶然,是结构性的。
当一个人持有一个强烈的立场一段时间,他的主导网络已经把反对方位置化了。配偶在这个网络里的位置是"反对方",她说的任何内容都会在到达处理层之前被预编码为"反对方的输入",并自动应用一个预设框架来解释("她不理解"、"她被顾虑绑住了"、"她没看到更大的图景")。她说什么具体的内容在这个预编码下几乎不起作用,因为预编码发生在内容被认真处理之前。
一个不在这个对立结构里的人——一个老同学、一个偶遇的陌生人、一本无关的书——绕过了预编码,话直接进到处理层,能够激活原本被压制的 rollout 轨迹。
这是一个在长期冲突中很普遍的结构性困境:恰恰是最关心你、最直接卷入决定的人,他们的话被路由最严密地过滤。能改变你的话往往来自边缘——旁观者、朋友、偶遇的陌生人。不是因为他们更聪明或更有洞察,而是因为他们的话没有被预编码为对立方的输入。
但仅有不被预编码的输入还不够,还要有 routing 松动的窗口。长期维持一个和内部张力相抗的立场,需要主导网络持续主动工作——持续地把反证读成确证、把不适读成疲劳、把动摇压回去。这种工作消耗精度预算,有疲劳期。疲劳期通常出现在一些特定的状态下:独处时、通勤中、等待时、睡前、酒后、刚醒来、在做某件无关紧要的事的间隙。这些时刻的共同点是主导网络的主动维持暂时松弛,它管制其他网络激活的能力减弱。
所以一次干预真正起作用需要几个条件的合拢:输入来自不在对立结构里的位置(绕过预编码);输入激活的是一个内部已经存在但平时被压制的网络(有现成的激活对象);时机落在 routing 松动窗口里(主导网络的管制能力减弱);输入之后没有立即的行动压力强制重新激活主导网络(让新的 rollout 有时间稳定)。
这些条件不是任何一个独立充分的。强的输入落在错的时机会被消化掉;对的时机没有合适的输入只会让人感到模糊的不适;绕过了预编码但没有激活对象的话产生不了实质效果。一次"翻天覆地的变化"实际上是这些条件的合拢。
还有一个更底的条件值得单独说。一个长期持有的强立场如果从一开始就和当事人的所有其他深层先验完全一致,那么激活"被压制的网络"也不会真的动摇什么——两个网络各司其职,不冲突。但如果这个立场从一开始就有一点错位——它承载了某些当事人不愿承认的需要、某些地位竞争的成分、某些对自己某个角色的表演——那么这些错位一直在后台累积张力。主导网络持续维持的不只是这个立场本身,还有对这种张力的压制。当 routing 松动时,松动的不只是这个立场的精度,还有压制这种错位的能力。在这种情况下,干预看起来是被偶然触发的,实际上是给一个已经承压的结构一个最后的触动。
一个立场对外界干预的脆弱性,因此并不取决于它表面上有多"强烈"或持续多久。持续一年以上的强立场并不意味着它的支撑深。它可能完全依靠主导网络的持续主动工作在维持——这样的立场可以在一个合拢的窗口里在一小时内翻转。也可能它真的有深层网络结构的支撑——这样的立场几乎任何外部输入都难以撼动。只从外部看这两种情形区别不大,只有在被正确的干预触到时它们才显示出差别。
六、把这些放在一起
梳理到这里,对"一个人的判断如何形成和改变"可以给出一个比较细密的描述。
一个具体判断——"我该做 X"——在任何时刻都不是一条被简单存储的先验。它是每次被调用时的 policy 评估输出,由偏好先验、状态信念、这次 rollout 采样了什么一起决定。前两者稳定,最后一项可以被输入干预。一次 policy 评估的输出因此可以在短时间内翻转,而底层的偏好先验和状态信念几乎不动。
输入如何起作用,涉及三个不同持久度的层面:当下 rollout 的内容(最短暂)、运行精度和 routing 倾向(中期)、评估结构的默认采样清单(持久、单向)。同一次输入在不同层面留下不同的印记。当事人能内省到的主要是第一层,但真正在长期轨迹上起作用的常常是第三层——那些不再会退出评估结构的维度。
一次干预能否成功,不只取决于内容本身,也取决于输入位置是否在对立结构之外(能否绕过预编码)、时机是否落在 routing 松动窗口、是否有现成可激活的对象、之后有没有行动锚定、以及被触的立场在多深层面有真实支撑还是主要靠主动维持。
长期存储的结构——偏好先验、深层状态信念、自我身份相关的先验——变化慢,但它们是每一次 policy 评估的约束,每次评估都绕不过它们。而它们自身的变化,反过来,几乎只能通过长期的、被反复激活的非典型 rollout、被行动锚定、在新的环境里被新的默认所替代——来实现。短时间的强刺激可能让判断翻转,但不足以让这一层真的改变。要让一个人的深层结构变,需要一段足够长的时间里,新的 rollout 模式被反复调用,行动上有持续的锚定,外部环境对新配置提供确证,旧的主导网络逐渐失去它的在场条件。
这其中大部分过程是当事人看不见的。他能看见的是自己"想通了"、"感觉不一样了"、"决定做 Y"。他看不见的是具体哪条通路被激活、哪些维度进入了默认采样清单、哪次 rollout 干预因为落在对的窗口而产生了永久效果、哪个时刻他其实是被一组条件的合拢推入了一次切换。意识层面的自我报告追不上这些机制,它给这些机制套上一个便于叙述的叙事——"我的想法变了"、"我看清楚了"、"我被朋友点醒了"——这些叙事保护自我模型的完整性,但代价是它们遮蔽了实际的机制。要把这些机制看清楚,需要暂时悬置这些叙事,去问:在这个所谓"想法变了"的事件里,具体变的是哪一层?是那一次评估的 rollout?是运行精度的暂时重分配?还是评估结构获得了一个新的永久维度?这三个问题的答案往往很不一样,区分它们是理解判断如何形成和改变的核心工作。