深层先验的改写
1. 证据路由:深层先验怎么在感知层面就赢了
一个具体的场景:你有一个深层先验"我是负担"。一个朋友某天晚上真诚地说"和你聊天我很放松"。在理论上,这是一条清晰的违预测证据——但它几乎永远不会作为这条证据抵达那个先验节点。路由发生在证据被明确意识到之前:
可能被路由到"她的性格"节点:"她就是这样,对谁都会这么说"——证据被归因给她的礼貌倾向,从那里它不再传播。
可能被路由到"具体情境"节点:"今天的话题正好轻松"——变成关于话题的信息,不是关于你的。
可能被路由到"她的需求"节点:"她最近孤独,所以任何在场都让她觉得放松"——变成关于她状态的信息。
可能被路由到"她不了解真实的我"节点:"她只看到我状态好的时候"——证据被关在一个永远触及不到核心先验的腔室里。
这四种路由里,每一种都是一个完整的、内部一致的、感觉完全正确的解释。当事人完全不体验到自己在做路由决策——他体验到的是"显然她只是在客气"。防御的精妙之处在于它从不以防御的形式出现;它以感知的形式出现。
机制上这是因为 precision 同时控制两件事:相信什么、以及注意什么。深层先验通过调高某些特征的 precision(她说话时眼睛往别处看的那一瞬、她用了"放松"而不是"开心"这个词、她之前看过手机一次),调低另一些特征的 precision(她专程来、她多待了两小时、她主动约下一次),使得进入高层推断的证据样本本身就已经被筛过。到了"她说和你聊天很放松"这个命题上层时,它周围已经伴随着一堆让它显得不可信的上下文,这些上下文是你的先验自己生产的。
同一个人如果持有"我被人珍视"的深层先验,路由会走另一条路:她的话直接进入自我价值节点,小的负面线索(她看手机)被路由到"她那天有事"节点。同一个夜晚、同一段对话,在两个人的后验更新里产生的效果几乎完全相反,而两人都会说"我只是在看到的东西上做反应"。这就是 Seligman 归因风格的机制实质——不是两套不同的结论,而是两套不同的路由表,结论只是下游输出。
2. 透明度的吊诡:前台占用为什么让对抗性使用无效
考虑一个在 CBT 里练习了两年"我值得被爱"的人。每天早上写日记、重复肯定语、挑战负面想法。他可以流利地列出十条证据证明自己值得,可以在焦虑发作时用这个命题做 grounding。但他在新的约会对象没回消息的那二十分钟里,体验到的仍然是完全熟悉的、核心身份级的被弃感——仿佛两年的工作从未发生。
这不是因为工作没效果。是因为工作根本没碰到那个先验。
区别在于前台是什么。每次他"使用""我值得被爱"这个命题时:
前台:一个新的、脆弱的、需要被有意维持的语义命题。
背景:深层先验"我是多余的"照常运行,在无需注意的层面上调节身体状态、注意走向、记忆检索。
这个新命题和深层先验在机制上不在同一层,不共享推断回路。它们是两个并行的系统,其中一个需要意志才能上线,另一个是默认的。当他在写日记时,意志资源在维持前台命题,深层先验在后台照常运行,两者互不产生预测误差——因为前台命题不对身体状态做预测,所以它产生不了可以被身体数据证伪的任何东西;而深层先验在产生预测(预测被弃、预测被看穿),但这些预测是在前台命题不在场的时候运行的。
更精细的细节:注意肯定语有一种特殊的空洞感——说"我值得被爱"时几乎所有人都能感到这句话的分量低于它的语义。这种空洞就是 precision 签名。大脑"知道"这个命题先验权重极低——它不是被相信的,它是被持有的。说它和说"重力往上"在体验结构上类似:你能发出声音,但内在模型纹丝不动。
最关键的机制性事实是:深层先验只在它相关的情境里上线。"我不值得被爱"不是在人独处写日记时上线的——它上线在被看见、被想要、被拒绝、被亲近的时刻。而那些时刻恰恰是前台命题最难维持的时刻,因为注意被真实情境占满了。两年的练习都在先验不在场时进行;先验上线的每一刻都没有练习在场。所以先验从未被挑战过。它不是赢了——它根本没参加比赛。
真正能改变先验的对抗性使用(如果存在的话)必须满足一个苛刻条件:在先验实际上线的时刻,把前台维持在反命题上,并同时处理真实证据流。这几乎不可能单独完成,因为上线时注意带宽被身体的警报占满了。这是为什么纯自助几乎从来不动深层先验——机制上的原因。
3. 分布式冗余:五个副本同时唱歌,合唱赢了
一个具体的人:四十岁,来访者,十年认知治疗,现在能非常清晰地论述"我并不是根本有缺陷的人"。他能引用证据、识别扭曲、反驳自我攻击。在语义-陈述层面,命题已经更新。
然后他进入一段新的亲密关系。对方某天晚上看着他说"我很想你"。在接下来的八秒里发生了这些事:
程序性记忆:他的脸自动组成一个半微笑的、稍微后撤的表情——这是他三十几年来面对被人靠近时的程序性反应,编码"我需要让他们不要太靠近,否则他们会发现"。这个表情的产生不经过语义层的审查,和握筷子一样自动。
内感受先验:胸口有一阵紧缩,胃往下沉。身体解读当前情境为"危险/不对劲"。这个解读在意识知道"对方在表达爱"之前就已经发生了,它直接调用身体在被注视时的基线预期。
自传体记忆检索:在"被想念"这个线索下,系统自动检索到的不是对方上次的温暖,而是十二岁那年被一个人表白后第二周在学校被嘲笑的片段。检索是 precision-weighted 的,老先验控制着检索的 salience landscape。
注意先验:他的注意力在对方脸上扫描的不是爱,是即将到来的反转——对方眼神里的一丝勉强、停顿、语调下降。扫描模式被老先验决定。
叙事-情感:一个极轻微的、几乎察觉不到的预演在后台进行——"当他发现真实的我会怎样"。这个预演带出熟悉的羞耻基底。
同时,语义层在说"他爱我,我可以接受这个"。
这是六个子系统,其中一个说"是的",五个说"不是"。下一秒他会做什么?他的身体会略微后撤,他的回应会比他感觉到的那份温暖小一档,他的脸会保持那个半微笑。对方看到一个比预期更冷淡的反应,对方的下一步调整——哪怕是很微小的——被他的系统记录为"他开始撤回了",这 confirms 老先验。循环闭合。
这就是为什么纯认知工作几乎不起作用:它只更新了六个副本里的一个,而其他五个副本在实时生产行为,这些行为又在生产证据来喂养老先验。语义层孤军作战,而且它的声音是最小的那个——因为它是意志性的、耗能的、有延迟的,而其他五个是自动的、免费的、即时的。
要真正改变,需要的是让五个子系统同时、反复地被更新。这需要身体介入的工作(让程序性反应有机会改变)、真实关系中的暴露(让内感受先验产生新预测)、记忆工作(改变检索的 salience 地图)、注意训练(改变扫描模式)。年和年是因为这五条线都要走。
4. 三十年叙事的重解释:局部峰为什么拦得住一个理性上想越过的人
具体化一下"re-inference 的计算成本"。一个四十岁的人,长期持有"我不配被爱"。他进入一段关系,对方清楚、稳定、持久地爱他——以一种他很难解释掉的方式。如果他真的接受这一点,他需要处理下面这一连串后续:
童年需要被重新叙述。"妈妈总是不耐烦因为我太吵了"——这个解释在老先验下自洽,提供了一个完整的、可以带着走的因果故事。在新先验下,这个解释被取消,但取消后会留下一个空洞:妈妈为什么不耐烦?答案必须是"她自己有问题"或"她当时抑郁"或"她自己也没被爱过"。这些新答案本身不痛——但它们触发悲伤。一个从未完整哀悼过的、三十年的、关于自己有过一个无法在情感上在场的母亲的悲伤。这是一个新的计算负担:需要处理的 affect 量级很大。
过去的关系需要被重新叙述。他在二十几岁有三段关系都以对方离开告终。在老先验下,这些都被吸收为证据:当然会这样,我本来就不配。叙事闭合,感觉上完整。在新先验下,每一段都需要新的解释——而新的解释不是舒服的:其中一段是因为他当时太封闭,一段是因为时机不对,一段是因为对方本身的问题。这些解释每一个都打开新的 affect:对自己当时封闭的悔、对时机不对的惋惜、对识人不清的愤怒。老先验把这些 affect 都压缩成一个集中的"我不配",新先验要求它们被分开处理。
自我保护的选择需要被重新评估。他没有全力追求过想要的工作、没有向两个喜欢过的人表白、在三个重要时刻选择了退让。在老先验下这些都是"明智的止损——反正结果一样"。在新先验下,它们变成可能不必要的损失——变成悔。三十年的累积的悔一次性降临是系统无法处理的。
当前的友谊需要被重新叙述。那些他一直觉得"被勉强容忍"的朋友关系——如果他被真的重视,那么这些人是真的在意他。但他为什么一直在情感上对他们保持距离?他损失了什么?这又开一个悲伤口。
把这些加在一起:要从老先验移动到新先验,系统需要短时间内处理大量新开放的 affect(悲伤、悔、愤怒、羞耻的重新分配),同时维持日常功能。这个中间态——老叙事部分解构、新叙事尚未成形、所有旧记忆都处于未决状态、身份感悬置——的自由能极高。它比老状态的自由能高得多(旧状态虽然痛但 coherent),也比目标状态高得多(目标状态重新 coherent 了)。
系统不是全局优化器。它是局部梯度下降。面对"前方是一座山,山背后是更低的谷",它不会翻山——它会回到当前的谷底。这不是怯懦,是机制。
现象学上这表现为什么:sabotage。他会在关系开始真正变好的时刻、在对方真正可靠的时刻、在他真正感到被珍视的时刻,做一件让关系退回一格的事——挑一个架、在一个关键时刻缺席、重新激活一段旧的暧昧。事后他自己无法解释为什么。机制解释是:那一刻他在逼近局部峰,系统感到了 incipient avalanche,它选择了一个让自己回到熟悉基底的动作。sabotage 在主观上常常伴随如释重负——这个如释重负正是回到老基底的 free energy 下降的信号。
这也是为什么治疗里有"好了几个月然后崩溃"的经典模式。不是治疗没用。是当事人走到了峰的脚下,看到了前面要翻的东西,退回了。有效的长程治疗做的就是一次只拆一点:这一年只处理和母亲的关系,下一年只处理二十几岁那段关系——让每次 re-inference 打开的 affect 量小到可以被代谢掉,再进行下一次。把一个不可跨的峰切成一百个可跨的小丘。这就是为什么需要年。
5. 重固化窗口:为什么必须同时激活并 mismatch
分四种情境,每种里先验的命运不同。
情境 A:谈论 but 不激活。 来访者在治疗里说:"我母亲是抑郁的,她无法回应我的需要,所以我学会了不表达需要。"他说得流畅,分析清晰,表情平稳。发生了什么:他在关于那个先验说话,不是在那个先验里。深层先验此刻没有上线——没有产生预测、身体没在待机、没有 affect 激活。这是纯语义操作。窗口不打开。治疗师听到一个深刻的叙述,但什么都没变。这是许多年只产生 insight 不产生变化的治疗的样子。
情境 B:使用 but 不激活。 来访者在家写日记练习肯定语。深层先验"我的需求不重要"不在线——写日记是一个安静的、自选的、无真实他者的情境,那个先验没有理由上线。他在练习一个命题,但那个命题和他要改变的那个先验在大脑里是两个不同的回路。窗口不打开。可以练二十年,核心节点未被触及。
情境 C:激活 but 无 mismatch。 来访者在新关系里被触发——对方晚回信息。深层先验完全上线:"他在撤退,我又一次不值得被留下,这就是我的模式。"身体激活、affect 翻涌、记忆被重新检索,整个先验进入 labile 状态。此刻是可塑窗口。然后对方回信息并解释(他在开会)。发生了什么?来访者此刻还在先验内部,他的路由系统正在全速运行,他把解释读作"他在编理由""他在管理我"。证据被先验的过滤器吸收,没有产生真正的预测误差。窗口打开了,但填进去的是和原先验一致的内容。结果:再固化加强。很多人经历了无数次触发而先验越来越强,就是这个机制——每次 labile 状态都被同一套路由关闭了。
情境 D:激活 + 真实 mismatch + 可代谢。 这是实际改变发生的样子。需要三件事对齐:
激活:先验真的在线。不是在谈论童年被忽视,是在此刻的身体里感到被忽视的那种东西——胸口的空、眼泪、想消失的冲动都在。
mismatch:证据以一种无法被老先验的过滤器吸收的方式出现。通常这意味着证据在感觉通道里直接到达,绕过了语义路由。在 couples therapy 的转折时刻:防御型的一方终于说出"我怕你离开",脆弱完全暴露,深层先验"暴露需要会导致被抛弃"全面在线——然后另一方没有退开,反而身体靠近,手放在他手上。不是口头保证,是身体的在场。这个证据绕过了语言层。它不能被路由为"他在演"因为身体语言的 precision 太高,身体读身体比语义读语义直接得多。
可代谢:系统此刻没有被淹没。来访者能保持在那个感觉里几秒钟、十几秒钟而不解离、不切断、不把对方推开。这需要前期工作积累的容受窗口——这也是为什么直接做这种工作对早期的人常常失败,他们一触到那个先验就抽离了,labile 状态被迅速关闭。
当三件事同时发生,身体会有一个可观察的shift——呼吸加深一档、肩膀放下、胸口的紧 inexplicably 松开、某种液态的东西经过。这个 shift 不是"我意识到他会留下"的思想,是内感受层面的、实时的模型更新。来访者常常描述为"身体第一次相信"或"有什么东西换了位置"。这就是实际重固化的现象学签名。
关键的、被低估的事实:这种时刻每次只移动一点点。一个编码了数千个数据点的深层先验,一次 mismatch 事件只能产生一小步的后验移动。这是为什么即使在非常有效的深度工作里,改变也需要许多次这样的时刻,跨越许多个月或年——不是因为当事人"悟得慢",是因为先验的权重本身就需要被大量反向证据稀释才能真的轻下来。理论上可计算的:如果老先验由 N 个事件的证据支持,那么需要大致同阶的 mismatch 事件数才能显著改变后验。
所以整个治疗的机制本质可以被描述为:反复创造激活-mismatch-代谢的合流事件,并提供一个足够安全的结构让这种合流能一次一次发生。洞见是辅助的(它帮助识别激活、帮助保持在场),但不是机制。机制是反复的、身体在场的、可代谢的违预测。