王路在隐身

遍历性:描述"人和人的差别"的变量,未必描述"一个人"

在一群人里做统计:打字快的人,错误更少。相关是负的,很强。因为人和人的差别主要是熟练度,熟练的人又快又准。

在一个人身上做统计:这个人打字越快,错误越多。相关是正的。因为对固定的一个人来说,速度和准确性是此消彼长的。

同样两个变量,人和人之间是负相关,一个人自己身上是正相关。 不是测量误差,不是样本不够——两个都对,因为它们回答的根本是两个问题。

再换个说法可能更直观:知道"为什么有的车比别的车快"(发动机排量),完全不告诉你"怎么让你这辆车在接下来十秒变快"(踩油门)。 车与车的差异是发动机,同一辆车的波动是油门。你研究了一辈子发动机,却在给人开油门的建议。

心理学的问题就出在这一步

几乎所有心理构念,都是这么造出来的:找几千人填问卷,看哪些题目的答案在人与人之间一起高一起低,把它们归成一堆,起个名字——"外向性""责任心""心理韧性"。

这套程序提取的,全是人际间的协方差结构。而"遍历"这个数学条件(时间平均 = 群体平均)要成立,需要两件事:所有人的内部结构是同一个,且这个结构不随时间变。对人来说,这两条明显都是假的。

有研究把同样的分析在个体身上做(同一个人连续几个月每天多次报告状态),结果是:每个人的因子结构都不一样,而且和群体的因子结构对不上。个体内的波动幅度往往远大于人际间的差异。

后果有多严重

第一,几乎所有干预都作用在个体身上,而几乎所有证据都来自群体截面。 "责任心高的人更健康"这个人际间发现,不蕴含"你提高责任心会更健康"。前者可能完全由一个共同的第三方原因(比如童年环境、某种气质基础)造成。

第二,"平均人"可能不存在。 美国空军上世纪四十年代按几千名飞行员的平均体型设计驾驶舱,事后发现在十个关键尺寸上都接近平均的人,一个都没有。平均值是一个统计构造物,不是任何一个真实个体。

第三,这解释了心理学一个长期的尴尬:横截面上那么漂亮的相关,一到随机对照干预就消失。不一定是研究做得差,可能是在错误的层级上找规律。

第四,医学里的对应物是"平均治疗效应"。一种药平均有效 20%,可能意味着"每个人都改善两成",也可能意味着"两成人痊愈,八成人无效"。这两种情况在群体统计里长得一模一样,而对你个人的意义天差地别。

出路

出路不是更大的样本,而是换轴:从"一万个人测一次"改成"一个人测一万次"。这就是密集纵向测量(每天多次自我报告、可穿戴设备被动记录)和 N-of-1 试验(在同一个人身上随机地开关某个干预)的意义。

注意这和可识别性理论是同一件事:你需要时间上的变异和干预,来分离出真实结构。横截面问卷再大,原理上就是不够。