王路在隐身

可信度革命和数据造假

一、Bem 的"预知未来" + 2015 可重复性项目

这两件事是理解整个可信度革命的"创世神话",一个是导火索,一个是把危机从传闻坐实成数据的那一锤。

Bem 这篇论文到底干了什么

2011 年,康奈尔的资深社会心理学家 Daryl Bem 在心理学顶刊《人格与社会心理学杂志》(JPSP)发表了《Feeling the Future》。这篇论文报告了 9 个实验、超过 1000 名被试,方法是把一批"早已被确立"的经典心理学效应在时间上倒过来做——也就是说,把"原因"放在"结果"之后。比如对色情刺激的"预知性趋近"和对负面刺激的"预知性回避"、逆向启动、逆向习惯化、以及对记忆的逆向促进。一个典型范式是:屏幕上有两道帘子,背后一张藏着图片,被试先猜哪道帘子后面有图,然后计算机才随机决定把图放在哪——结果 Bem 报告,当图是色情图片时,被试的"猜中率"显著高于随机水平。换句话说,未来的随机事件似乎"反向"影响了此刻的选择。九个实验里有八个达到了统计显著,平均效应量 d 约为 0.22。

为什么这篇论文会引爆整个学科?关键不在于结论荒诞("预知未来"当然违反物理因果),而在于Bem 用的全是当时整个领域天天在用的标准方法,却"证明"出了一个不可能为真的现象。这就构成了一个归谬:如果一套标准的实验设计加标准的统计分析,能稳稳地产出"人能感知未来"这种结果,那只能说明——这套标准方法本身有毛病。Bem 后来自己也承认他抄了不少近路,但他抄的恰恰是当时领域里大家都在抄的那些近路。他甚至在采访中相当坦率地说,自己向来把数据当成一种修辞工具、一种说服手段,并不太操心"这能不能被重复出来"。这句话后来成了整场危机的注脚:它暴露的不是 Bem 一个人的问题,而是一代人共享的研究习惯——事后挑显著的指标报告(HARKing)、可以一直加被试直到出显著就停(optional stopping)、灵活地拆分和组合数据(后来 Simmons 等人命名为"研究者自由度"和 p-hacking)。

接下来发生的事同样是教科书级别的。Wagenmakers 等人 2011 年发文,用贝叶斯方法重新分析 Bem 的数据,指出在更合理的统计框架下证据其实非常薄弱,并直接以"为什么心理学家必须改变分析数据的方式"为题。更刺眼的是出版偏倚的现形:Ritchie、Wiseman 和 French 三人按 Bem 的方法做了重复实验、没能复现,结果几家期刊(包括发表原文的 JPSP)拒收,最后只能发在 PLOS ONE;Galak 等人做了七次重复、跨多个实验室,也找不到任何证据。JPSP 拒绝发表用 Bem 自己方法做出的失败重复,这件事本身就把"期刊只爱新奇正面结果、不要重复研究"的结构性病灶摆到了台面上。

可重复性项目:把传闻变成数据

Bem 事件之后,业内弥漫着"很多结论可能靠不住"的不安,但那还停留在轶事和直觉层面。真正把它量化的,是 Brian Nosek 牵头、开放科学中心协调的"心理学可重复性项目"(Reproducibility Project: Psychology)。2015 年 8 月,270 名研究者在《科学》上发表了结果,这是当时对一个学科可重复性做过的最全面的考察。

具体做法是:从三本顶级期刊(《心理科学》《人格与社会心理学杂志》《实验心理学杂志:学习、记忆与认知》)2008 年发表的论文里抽取 100 项研究,用原始材料和高统计功效的设计去重做。结果是一组让整个领域沉默的数字:原始研究里 97% 报告了统计显著的结果,但重复实验中只有 36% 达到显著;重复出来的效应量平均只有原始效应的一半(Mr 从 .403 降到 .197);47% 的原始效应量落在重复研究效应量的 95% 置信区间内,39% 被主观判定为成功重复。一句话:原来发表的"确定结论",独立重做时大约只有三分之一站得住,而且即便站住了,效应也明显缩水。

这里要补两点平衡。第一,这不等于说心理学一半是假的——"没复现"可能源于原始假阳性,也可能源于隐藏的调节变量、样本差异或重复实验本身的不完美,并不能一一区分。Gilbert 等人 2016 年在《科学》上发表了著名的反驳,认为该项目存在统计上的问题、重复设计功效偏低、且存在与原始实验不一致之处,因而严重低估了真实的可重复率,他们甚至主张数据其实和"可重复性相当高"相容。这场争论本身就很健康——元科学也要接受科学的检验。第二,正如项目作者强调的,发现问题恰恰是科学在做它该做的事:自我怀疑、自我纠错。

这两件事合起来,催生了今天我们熟悉的整套规范:预注册、注册报告(先审方案、过了不论结果都发)、开放数据与代码、更大样本、更多用贝叶斯和效应量估计而非只看 p<.05。可以说,Bem 提的那个问题——"标准方法为什么能证明假东西"——直接定义了之后十五年心理学方法论的议程。

二、Gino 与 Ariely:从"可疑操作"到"涉嫌造假"

如果说 Bem 暴露的是"灰色地带的坏习惯",那么 Gino 和 Ariely 这两案把学科推进到更黑的地带:不是无意的偏倚,而是数据本身疑似被人为编造。揭发者都是 Data Colada 博客的三人组——Uri Simonsohn、Joseph Simmons、Leif Nelson,正是当年提出"假阳性心理学"和 p-hacking 概念的那批人。两案常被一起提,因为它们交汇在同一篇论文上,但性质和处理结果其实不同,需要分开讲清。

Ariely 与那篇"诚实承诺"论文

故事的中心是 2012 年发在 PNAS 的一篇论文(作者包括 Shu、Mazar、Gino、Ariely、Bazerman),结论极其"好用":把"我已如实填写"的诚实声明从表格末尾挪到开头,人就更不容易作假。这个又便宜又有效的反欺诈技巧被至少一家保险公司采用、被各国政府机构测试、被教给企业高管,学术上被引用了 400 多次。其中一个关键研究用的是某保险公司(后经媒体确认是 The Hartford)的真实车险客户数据。

Data Colada 在 2021 年 8 月发布第 98 号博文,分析了作为补充材料公开的那个 Excel 数据文件,给出的是这场风波里"最赤裸"的证据。破绽在里程数:正常情况下,多数人一年开个一万四千英里左右,开极少或极多的人会很少;但在这份数据里,开 1000 英里、10000 英里、50000 英里的人数几乎一样多——呈现出一个不可能的均匀分布。Simonsohn 说他这辈子没见过这么明目张胆的造假。更要命的是数据复制的痕迹:一组里程读数被复制了一份、每个数字加上 1 到 1000 之间的随机数来伪装,原始数字用的是 Calibri 字体,而它们的"孪生兄弟"用了 Cambria 字体;在一百万次模拟实验里,这种程度的相似从未出现过一次。三位作者写道,这些数据不只是"过于相似",而是"相似到不可能"。

责任归属是这案最微妙的地方,必须讲准。文件元数据显示 Dan Ariely 是该文件的创建者;Ariely 也是五位作者里唯一与那家保险公司直接对接的人。Ariely 几乎立刻回应说,在这个团队里他是唯一对此负责的人,但他的"负责"指的是流程经手,而非编造:他表示数据是保险公司收集、录入、合并并匿名化之后发给他的,他用这份文件做了分析并公开。而 The Hartford 告诉 NPR,他们找到了自己当初提供的数据,但发现数据是在他们交出之后被人篡改以契合研究结论的;Ariely 本人坚决否认,称自己从未操纵或歪曲过任何数据。Ariely 承认只有他经手过已知最早那版含造假数据的文件,但强调自己没有编造,并说已主动报告杜克大学的科研诚信办公室;杜克拒绝透露是否在调查。最终五位作者都同意 Data Colada 的结论、对未能及早察觉表示遗憾,论文于 2021 年被 PNAS 撤稿。所以 Ariely 这条线的准确表述是:数据被证明几乎确定是伪造的,但"是谁造的"在公开层面始终没有定论——这跟 Gino 那条有正式认定的线不一样。

Gino 与哈佛的四项研究

Gino 案是 Ariely 风波之后另起的、更重的一条线。Data Colada 早在 2021 年就把他们对 Gino 的发现送交了哈佛,随后在 2023 年 6 月连发系列博文,指出她参与的四项研究(涉及诚实、创造力、本真性等主题)存在数据被操纵的明显迹象,由此触发哈佛长达约 18 个月的内部调查。调查最终形成一份约 1300 页的报告,哈佛商学院认定 Gino"有意、明知或不计后果地实施了科研不端";调查结果导致她合著的三篇论文在 2023 年被撤稿,另有一篇(即上面那篇含造假数据的诚实研究)此前已在 2021 年撤稿。2023 年 6 月,商学院院长 Datar 通知 Gino,她将被处以两年无薪行政休假、停发薪资和福利,并启动撤销终身教职的程序。

Gino 否认所有指控,并把战火烧到了法庭。她以诽谤、性别歧视(援引 Title IX)、违约、侵犯隐私等为由起诉哈佛和 Data Colada 三位博主,索赔 2500 万美元,指控他们合谋损害她的声誉和事业,并称男性教授有类似行为却未受同等审查。诉讼也带来一个意外副产品:因为打官司,哈佛那份 1288 页的调查报告被公开,Data Colada 随后在第 118 号博文里,通过比对所谓"原始"数据集和"已发表"数据集,逐格演示了数据到底是怎么被改动以产出已发表结果的,并指出他们当初对篡改方式的推断是对的。

官司目前的走向(截至我能查到的 2025 年年中)对 Gino 相当不利。2024 年 9 月,联邦法官 Joun 驳回了她对 Data Colada 以及对哈佛的诽谤指控,认定她未能合理主张校方构成诽谤、侵犯隐私或不当干涉,但允许其中一项——指控哈佛在纪律和教职程序上违反自身规定、构成违约——继续推进。法院的理由是,诽谤本就是不受青睐的诉因,在学术和科学辩论领域尤其如此,而 Data Colada 在博文里披露了支撑其判断的事实依据,属于基于已披露的非诽谤性事实得出的结论,因而不构成可诉的诽谤。2025 年 5 月,哈佛最高治理机构哈佛公司投票撤销了 Gino 的终身教职、终止其在哈佛商学院的聘任——这是极其罕见的举动。2025 年 7 月,法官又驳回了 Data Colada 要求 Gino 赔付其诉讼费的动议。

为什么这两件事意义重大

第一,它把学科的反思从"可疑研究操作"(灰色、常常无意)抬升到"造假"(黑色、蓄意)这个此前大家讳莫如深的层面。第二,它证明了事后数据侦查的威力——仅凭公开的 Excel 文件,靠分布形状、字体、元数据这些"数字指纹",第三方就能重建造假过程,这反过来强化了"强制公开原始数据"的制度诉求。第三,Gino 起诉博主这一招,本身成了对学术批评自由的一次压力测试;法院最终站在博主一边,认同了"放任此类诉讼会对学术博客批评同行的能力产生寒蝉效应"的担忧,这对元科学共同体是个重要的判例信号。一个让人不安的反讽贯穿始终:这些被质疑的研究,主题恰恰是诚实。