漂移扩散模型
漂移扩散模型是同一个手术的第二次成功,做在另一个器官上。
原来的民间概念是反应速度,"这个人反应快"。八十年代 Ratcliff 把它分解成三样东西:证据积累的速率,也就是漂移率;积累到多少才肯下决定,也就是边界间距;以及所有跟决策无关的时间,编码加上运动执行,叫非决策时间。同样,这三样在实验上分得干干净净。你改指导语说"快一点,错了没关系",动的是边界间距,漂移率不动。你改刺激难度,动的是漂移率。你给被试戴上手套让按键变笨,动的是非决策时间。你给一个先验偏向,动的是起点。
然后是我认为最有说服力的那一类证据,因为它来自实验室之外。老年人反应慢,这是几百年的常识。分解之后发现,老年人的漂移率在很多任务里并没有显著下降,下降的主要是边界间距和非决策时间——也就是说,老人不是脑子慢了,是他更保守、更不愿意在证据不足的时候下注,加上运动环节慢了。这个结论跟"老化=全面退化"的旧图景完全不同,而且它是可操作的:你要改善老年人的表现,该动的是策略而不是训练感知。同样地,多种精神障碍表现为漂移率下降而边界不变,丘脑底核在冲突条件下抬高决策边界,多巴胺操纵动的是特定参数。原来一团混沌的"反应变慢",现在变成了三个可以分别归因、分别干预、分别对应神经机制的量。
视觉判定背后的神经机制一点都不简单,它涉及的皮层面积、细胞数量、动力学复杂度,不比"自尊"这个概念背后的东西少。它们成功不是因为对象简单,是因为它们同时拥有三样东西,而这三样恰好就是可识别性理论要求的全部条件。
第一样,个体内的密集重复。一个心理物理被试一下午可以跑两千试次,一个 DDM 研究可以在单个被试身上拿到上万个反应时。这意味着什么?意味着你可以在个体内部估计参数,而不需要跨人平均。这一点的重要性怎么强调都不过分。Molenaar 那篇关于遍历性的檄文说的就是这件事:跨个体的结构和个体内的结构没有任何先验理由相同,除非过程是遍历的,而心理过程几乎从来不是。你用一百个人各测一次去推断一个人的内部机制,这个推断在数学上就是无效的。d′ 之所以是个真概念,是因为它是从这一个人身上的两千次试次里长出来的。
第二样,受控的干预。这是"关节"这个隐喻的实质内容。所谓两个参数是不同的东西,操作性的定义就是:存在一个操作,只动其中一个而不动另一个。这在纯观察数据里是原则上做不到的。你观察到一千个人的击中率和虚报率,你可以做因子分析,你可以做各种协方差建模,但你永远无法确定你分出来的成分对应真实的分离机制,还是只是这个样本的相关结构。分离性是干预性概念,不是相关性概念。所以只有能施加干预的领域才可能完成这个手术。
第三样,显式的生成模型。这一样最容易被低估。生成模型的意思是,你能从参数出发,正向地生成一整个可观测数据的分布——不只是均值,是整条反应时分布,包括它右偏的尾巴,包括正确和错误反应各自的分布形状,包括它们随难度怎么变。这带来两个东西:第一,参数有了唯一解的可能性,因为约束远多于自由度;第二,模型可以被杀死,因为它对形状做了大量它不必做的承诺,任何一处不对都会露馅。
对照一下因子分析。因子分析看上去也在做分解,也在提取潜变量。但它有一个致命性质:旋转不定性。给定同一个相关矩阵,无穷多组因子载荷在数学上完全等价。这就是为什么斯皮尔曼的 g 和瑟斯顿的多重能力吵了一百年吵不出结果——那不是数据不够,那是这个问题在数据层面本来就没有唯一答案。你不可能用更多被试解决一个不可识别的问题。这是高层心理学最大的一个体制性误解:以为样本量能救概念结构。
现在我们可以给高层的失败下诊断了。人格、智力、执行功能、幸福感、自我控制——这些概念到今天为止仍然处在"阈限"那个阶段:一个民间词,一套测量流程,一堆互相矛盾的文献。标准解释是"太复杂了"。我认为这个解释是错的,而且是一种智力上的偷懒。真实的解释是,这些领域三样条件一样都没有。密集重复没有:一个人一辈子填五次人格量表。干预没有:你不能随机分配童年。生成模型没有:大五不是一个能生成数据的模型,它是一个对相关矩阵的压缩描述,它对任何具体行为的形状不做任何承诺,因此它也不可能被任何数据杀死。
再补一个更尖锐的病例。执行功能领域有个"信度悖论":斯特鲁普效应是心理学最稳健的实验效应之一,几乎在每个被试身上都能重现;但斯特鲁普效应作为个体差异指标,重测信度低得没法用。为什么?因为实验传统追求的是压小个体差异——一个好范式就是让所有人都表现出同一个效应;而相关传统需要的恰恰是个体差异的方差。这两件事结构上互斥。Cronbach 1957 年就写过那篇著名的《科学心理学的两个学科》,说这两支永不交汇。它们不交汇的技术原因就在这里。
所以,结论可以说得很干脆:这个纲领不是猜想,它在心理学的低层已经被完整地证明可行。高层至今没成功,不是因为高层太复杂,是因为高层至今没有那三样东西。
而现在,这三样第一次同时开始变得可获得。
密集重复:手机、可穿戴、经验取样、被动数字表型。一个抑郁症患者过去一个月给你一个 HAMD 分数,现在一天可以给你几十个数据点,睡眠、活动、语音、交互节律,连续几个月。个体内的时间序列长度已经跨过了参数估计所需要的门槛。
可施加的微干预:这一样比数据更关键,也更容易被忽略。微随机试验的整个方法论就是为此而生的——不是把人随机分到两个组,而是把同一个人在成千上万个时间点上随机分配到"此刻推送 / 此刻不推送"。这就是在个体内部制造正交操纵,也就是把心理物理学那套判据操纵搬到了日常生活里。加上闭环神经刺激、精确控时的光照、可调度的睡眠时相——真正意义上的"只动一个参数"的操作,第一次出现在了实验室之外。
机制性生成模型:强化学习模型、序列采样模型、层级贝叶斯,这些都已经成熟。而更重要的是拟合技术的变化。过去一个模型只要似然函数写不出来就基本没法用,这个约束把可用模型限制在很窄的一类里。现在基于模拟的推断、摊销推断这些方法,让你可以拟合只能正向模拟、写不出似然的模型。这直接扩大了"可以被认真对待的机制假设"的空间。
那么,先在哪儿长出来?
我的判断是:临床、学习、决策、睡眠。理由不是这四个领域重要——理由是这四个领域恰好同时具备密集数据和真实干预。而在这四个之间的先后顺序,取决于一件很朴素的事:外层时钟转得多快。
我想把这句话说得再重一点,因为我认为它其实是整个论证的隐藏主干。
回头看心理学各个分支的成功程度,它跟对象的复杂度关系不大,跟对象的时间尺度关系极大。心理物理学的外层时钟是毫秒,一次试次半秒钟,一下午两千次——所以它在六十年代就完成了概念手术。学习和记忆的外层时钟是分钟到小时,一次实验几十上百个学习事件——所以它有一批站得住的模型,但比感知弱一档。情绪和临床的外层时钟是天,一天一个心境状态、一次发作间隔以周计——所以它现在才刚刚够得着门槛。人格和发展的外层时钟是年——所以它一百年没有进展。文化变迁的外层时钟是几十年——所以那里根本不存在这个问题的答案。
这个梯度太整齐了,整齐到不像巧合。它说明的是:所谓"高层太复杂",很大程度上是"高层的样本获取速率太慢"的一个错觉性重述。你在感知领域一下午拿到的观测数,人格领域要花两百年。在这种数据密度下,任何领域都会显得混沌不清、概念含糊、结论互相矛盾。
而内层——建模、拟合、模拟、假设生成、参数恢复检验——这一层现在可以跑得任意快。你可以在一夜之间跑完几万次模型比较,可以自动搜索模型空间,可以为每一个候选机制生成可判别的预测。但这一层跑得再快,也不能替你多过一个晚上。睡眠研究里一个被试一天只能给你一夜,这个数字不会因为算力增长而变成两夜。抑郁的复发间隔不会因为你的推断算法更好而缩短。技能的巩固需要真实的时间。
所以真正的瓶颈已经从内层转移到了外层,而外层的速度上限就是现实本身的节律。这带来一个非常具体的策略含义:在选择下注方向的时候,该问的第一个问题不是"这个问题多重要",也不是"我有多少数据",而是"这个系统的自然时钟多快,我能不能加速它"。睡眠之所以是我名单上被低估的那一个,正是因为它的时钟虽然只有一天一格,但每一格给你的是几小时连续的高维生理信号,而且它是少数几个你可以在夜里精确施加微干预、并且当晚就能读出后果的系统。它的单位时间信息密度远高于它的表面频率。
最后一句提醒,关于这个纲领能给出什么。它不会给出社会科学的元素周期表,我同意这个说法,但我想把否定的理由说得更准确一点。元素周期表之所以可能,是因为底下有一条离散的、普适的物理律,元素的身份不依赖于你怎么测它。心理学的参数不是这样的:d′ 只在特定的刺激—反应体制下有定义,离开那个体制它就不是一个量。它更像温度,不像碳。温度是一个了不起的概念,它是真的,是可测的、可干预的、有深刻理论地位的,但它只在接近平衡的条件下有定义,而且它不是宇宙的一块砖,是一个体制下的状态变量。
我们能指望的最好结果,就是在临床、学习、决策、睡眠这几个角落里,长出十几个这种量级的状态变量:定义域有限,条件明确,但在自己的定义域内是真的、可分离的、可干预的。那已经比现在多得多了。而且,这才是我认为值得下注的原因——它不需要一场革命,它只需要那三样条件在某个具体角落里同时到位,然后剩下的事情,历史上已经演示过一遍了。