多年研究发现,半数社会科学论文无法重复?
原文作者:Nicola Jones
这项研究规模庞大、备受期待,其结果使人们越发担心科学的可信度,但也为寻求解决方案带来了希望。
在一项调查实验和数据分析能否重复的大型项目中,数百位科学家审查了数千份研究论文。来源:ridvan celik/Getty
一项长达7年的大规模项目调查了3900篇社会科学论文,结果令人不安:在得到测试的研究中,研究者仅能重复一半[1]。
这一“开放研究和证据系统化可信度(Systematizing Confidence in Open Research and Evidence,SCORE)”项目的结论“备受期待”,美国斯坦福大学的元科学家John Ioannidis说,他未参与此项目。他说该项目的规模和广度都令人印象深刻,但结果“并不意外”,它与此前规模较小的研究结果是一致的。
研究者调查科研可靠性“危机”已有十余年。他们发现,许多科学实验无法重复——不仅是在社会科学领域,在生物医学领域也一样。
SCORE的发现来自865位研究者对发表在62本期刊上的论文的深入分析,涵盖经济学、教育、心理学和社会学;开放科学中心(Center for Open Science,一家协调部分项目的机构)研究主管Tim Errington说,这些结果不必然意味着这些研究质量不佳。当然,有些结果不能重复是因为科研诚信问题或罕见的学术不端,但SCORE发现,大多数情况下,只是因为研究没有提供足够的数据或细节以供实验准确重复。新的方法或分析可能导致不同结果。这意味着研究者不应仅考虑论文本身,而应该将任何单一研究视作“拼图的一块”。
这一项目的结果于4月发表在《自然》的三篇论文中[1,2,3]。SCORE团队通过三个特征检验了已发表结果:可再现性、稳健性和可复制性。研究经费来自美国国防高级研究计划局(US Defense Advanced Research Projects Agency),旨在开发能够为社会科学研究成果分配置信评分的自动化工具。
Ioannidis 说,SCORE项目“带来了希望,即广大科学界正在非常严肃地面对此类问题。”
测试、复测、重复
对一篇论文可信度的测试标准之一,是其结果是否可再现,即对相同数据的相同分析是否能产生同样的结果。SCORE团队的一些成员尝试再现了600篇论文的数据分析,发现仅145篇包含了足够详细的内容以供再现。在这145篇论文中,仅53%能准确再现[2]。但许多未能再现的情况可能是因为SCORE团队需要猜测过程或重构原始数据,Errington说。更开放地分享数据、更透明地描述所用方法,应有助于解决这个问题。
SCORE团队也检验了论文的稳健性:对一篇论文数据进行另一种合理分析,仍能产生同样的结论。在这一类别下检验的100篇论文中,大约四分之三通过了检验[3]。但有2%的情况下,新的分析与原始研究结论南辕北辙。“这让人担忧。” Errington 说。他补充说,新型的自动化工具能对同样的数据进行多种合理的分析(称为“多元宇宙分析”,multiverse analysis),这能改善未来研究的稳健性,因为研究者能在发表之前看到各种方法是否会产生同样的结果。
SCORE还检查了论文的可复制性,这在三项任务中耗时最久。研究者致力于重现完整的实验过程,从头开始收集和分析数据。在他们关注的164项研究中,仅49%的复制具有统计显著性[1]。这一结果与其他复制科学发现的尝试大致相符。
此前研究曾试图通过采用最佳实践(best practice)建立详细的实验方案,以促进研究可复制性。2023年,一项引人注目的研究(共同作者之一为SCORE项目的领导者)表明遵循这些方案产生了令人印象深刻的结果,但因人们对论文程序的质疑,该论文于2024年撤回。
鉴于SCORE和其他类似项目的结果,渥太华大学复制研究所(Institute for Replication)的创始人、经济学家Abel Brodeur说,他对新发表的研究始终保持一定怀疑。他补充说,“我会等上几年,等许多其他研究作了类似的分析,得出了类似结果”,才会产生信心。
Brodeur近期在《自然》发表了独立研究[4],研究经济学和政治科学研究的可再现性和稳健性。他和同事使用了两种策略——由专家个人评估研究论文,以及小组在为期一天的活动中共同审查论文。这一团队得出了比SCORE更鼓舞人心的结论。在110篇论文中,85%在计算上可再现。一个可能的解释是,这项研究仅检查了2022-23年间发表的论文,Brodeur说这段时期论文数据和代码披露遵循的标准要优于早些时候。SCORE检查的论文范围在2009-18年间。Brodeur 认为,“情况变得更好了”。
探究可预测性
Errington说,由于复制工作耗时且昂贵,自动化工具能够推动科学研究实践,包括借助人工智能模型判断一篇论文是否可靠。
这些工具的价值一般以人们完成任务情况来衡量,因此SCORE团队从调查人类能否准确预测论文可复制性入手。他们测试了两种策略:其一涉及在线市场,另一种使用结构化小组讨论和研究者独立评估。根据发表在预印本服务器MetaArXiv上的一篇论文[5],这两种方法在预测可复制性方面的准确率约达76-78%。
据MetaArXiv上发表的另一篇论文[6],SCORE团队起初用自动化工具进行类似工作的尝试不太成功。但这里涉及的三个团队都没有使用当代AI工具,如大语言模型。
开放科学中心的Andrew Tyner正主导一项独立的“预测可重复性挑战”,如今正在测试大语言模型等更现代的计算机工具。获胜者将赢得现金奖励。
在去年十月举行的第一轮比赛中,10个使用AI工具的团队在预测论文是否可复制方面的表现甚至不如随机猜测。但在3月举行的第二轮比赛中,表现优秀的AI模型准确率分数达到68.5%。
这些结果十分鼓舞人心,表明AI工具有朝一日或可用于评估科研,Errington说。但距离实现目标还有很长的路要走,他补充说,“它们还差得远呢。”
参考文献:
Tyner, A. H. et al. Nature 652, 143–150 (2026).
Miske, O. et al. Nature 652, 126–134 (2026).
Aczel, B. et al. Nature 652, 135–142 (2026).
Brodeur, A. et al. Nature 652, 151–158 (2026).
Mody, F. et al. Preprint at MetaArXiv https://osf.io/preprints/metaarxiv/vgyed_v1 (2026).
Rajtmajer, S. et al. Preprint at MetaArXiv https://osf.io/preprints/metaarxiv/bdmte_v1 (2026).
原文以Half of social-science studies fail replication test in years-long project标题发表在2026年4月1日《自然》的新闻版块上
©nature
Doi:10.1038/d41586-026-00955-5
点击阅读原文查看英文原文
眼睛就看得懂的研究,就在视频号
往期精彩文章
版权声明:
本文由施普林格·自然上海办公室负责翻译。中文内容仅供参考,一切内容以英文原版为准。欢迎转发至朋友圈,如需转载,请邮件[email protected]。未经授权的翻译是侵权行为,版权方将保留追究法律责任的权利。
© 2026 Springer Nature Limited. All Rights Reserved
星标我们🌟,喜欢就点亮小爱心哦!