当我们让AI帮忙审稿,科学还剩下什么? | 自然职场
当研究人员将科学判断让渡给机器时,我们失去了一些重要的东西。
原文作者:Carl T. Bergstrom & Joe Bak-Coleman(文中采用缩写C.T.B. 和 J.B.-C.)
原文以AI, peer review and the human activity of science 标题发表在2025年6月25日《自然》的职业栏目
时间对科研人员而言是一种宝贵的资源。学生时代起,我们就开始学习如何管理时间,并在职业生涯的不同阶段不断磨练这些技能。我们往往很快会采用能减轻负担的新技术。从统计软件和数字排版,到在线文献检索和高通量数据收集,科技帮助我们做得更多、效率更高。然而,我们工作的某些方面似乎与自动化无关,比如阅读文献、撰写论文以及参与同行评审。
使用大型语言模型来加速或自动化同行评审,忽略了一个事实:这些模型缺乏真实评审人的独特视角。来源:Peshkova/Getty
过去几年中,生成式人工智能(AI)的进步似乎让人看到自动化这些耗时任务的可能性。有关将AI引入科研流程的提议五花八门——从生成研究假设、收集数据、执行分析、撰写论文、进行审稿、识别错误,到评估已发表研究的可靠性。有人甚至提出,AI可以完成博士级别的研究,或作为一个完全自主的科学家来运作。
作为研究数字信息技术如何影响社会的研究人员,我们也在思考是否以及如何将AI纳入我们的科研工作流程。我们同样面临时间压力,但伦理考量和准确性问题始终挥之不去。期刊和资助机构努力跟上变化,不断调整着AI使用政策。一些知名研究人员,包括AI专家,却已经在这方面遇到了麻烦。
那些问题都是重要的现实问题。但在表面之下,还隐藏着一个更深层的问题。我们工作中那些难以实现自动化的部分,其根本原因是:它们依赖的不是时间,而是我们进行科学判断的能力。后者显然更加宝贵。值得思考的是,当我们将这种判断力——以及我们的能动性——交给机器时,我们到底失去了什么。
同行评审
在过去十年里,发表的科研论文数量增长速度远远快于科学家的增长速度。同行评审系统已不堪重负。作为编辑,我们比以往更难找到愿意担任审稿人的研究者;作为作者,我们眼睁睁地看着自己的稿件在编辑部停滞不前;作为审稿人,我们收到的审稿请求远多于我们所能承担的数量。
进化生物学家Carl Bergstrom。来源:Kris Tsujikawa
我们(C.T.B. 和 J.B.-C.)合作了近十年,逐渐发现我们在撰写审稿意见方面有着相似的方法。我们通常先通读一遍论文,边读边做笔记。在对整篇文章的逻辑脉络有了基本了解之后,我们会再读一遍,更加深入地推敲细节:查阅相关文献、核查代码、画图,甚至进行一些辅助分析。最终,我们会将这些笔记提炼、整理并扩展成一份成文的审稿报告。这一过程通常毫无报酬,几乎也得不到认可,但却可能耗费我们数小时,甚至几天。
大语言模型(LLM)能不能加快这一流程呢?一些工程师正在试图构建全自动的同行评审系统,但在我们看来,这种目标显然是荒谬的:这毕竟是“同行”评审,重点就在“同行”二字。
也有人提出更温和的建议,比如《自然》的一位专栏作家提议,审稿人可以在初读论文时先使用语音转录工具记录下笔记,然后将这些内容输入LLM,让其帮忙组织反馈意见。他表示,用这种方法写一份审稿意见只需30到40分钟,如果论文问题很明显,甚至还能更快完成。
但在我们看来,撰写一份优秀的同行评审报告,并不是一种机械重复的任务。就像任何形式的批判性分析一样,它要求我们对零散的思考进行筛选、排序和梳理。我们可能从积极评价开始,然后提出最关键、最需要改进的问题,再接着列出一些可以快速修改的小问题、次要担忧以及容易产生误解的地方。整个过程其实是一种“自我协商”的过程,探讨哪些内容值得写进报告中,进而才能与编辑和作者协商哪些地方需要修改。我们也常常会在写作过程中发现,自己的初始印象并不准确,有些评论需要修改或删除,而看似细枝末节的问题,实则可能隐藏着根本性的缺陷。正是这个总结与整合的过程,让我们更深入地理解稿件。
所以,从笔记整理到撰写完整审稿意见这一过程,本质上需要的是LLM不具备的能力——我们每个人独特的视角、训练背景、价值判断、伦理意识、专业知识、对编辑优先事项的理解,以及对作者立场的感知。即便AI工具能写出一份“审稿意见”,它也永远无法写出“你的审稿意见”,或“任何一个同行”的审稿意见。如果我们将这个过程交给LLM来完成,那我们实际上是在放弃自己改善科学文献质量的主动权。正如历史学家David McCullough在2003年接受采访时说的那样:“写作就是思考。写得好,才能想得清楚。这正是它如此困难的原因。”
AI科研、自动化与“去技能化”
这件事的影响远远超出了同行评审本身。AI科研的支持者认为,人工智能可以通过减轻研究者的重复性负担,从而提升科研效率。对一些真正机械的任务来说,比如排版参考文献,我们完全认同这个观点。但通常情况下,它们还包含着科研工作的关键任务。
有人这样主张:“如果科学家能把阅读和写作的工作交给AI,那他们就可以有更多时间用来思考和动手。”但这种逻辑存在两个根本性的问题。
集体行为科学家Joseph Bak-Coleman。来源:Alex Bielen
首先,这种思维方式错误地衡量了生产力。它混淆了科学进展与一些“附带性成果”之间的区别——比如同行评审、经费申请、学术论文等等。论文并不是科研的终极成果,就像铸造厂的产品不只是那些铁件本身。研究论文只是传递科学活动中所孕育的“人类理解”的一种载体,而不是衡量科学进展的唯一标准。如果我们只是改变“什么样的内容才算一篇合格论文”的出版标准,理论上就可以让排版页面的数量翻倍——可这并不意味着人类知识有任何实质性的增加。
其次,这种逻辑忽视了“阅读”和“写作”对于深度思考的价值——更糟的是,它还低估了深度思考本身在科学进步中的关键作用。
大语言模型(LLM)在自动处理枯燥任务方面确实很有用,比如数据格式化等。但在效率的驱动下,我们很容易滑入另一个陷阱:开始轻率地把某些工作当作“纯机械劳动”。把一堆粗糙的笔记转化为一份润色过的审稿意见,听起来像是在“干杂活”,但这背后其实包含了无数个细微的判断——它构成了我们参与塑造科学文献的过程。而当我们把任务交给LLM时,往往并不会意识到,自己其实也把很多判断权拱手让出。这是因为,只有在真正去做决策的时候,我们才会意识到:原来看起来“没什么技术含量”的工作,其实处处都是选择。
自动化的本质,是一种从人类到机器的知识的转移。而每一次这样的转移,都会削弱人的能力,甚至可能是不可逆的。如果自动化的结果能够百分百媲美人类,那么这种“去技能化”也许无可厚非。但问题在于,随着自动化的范围越来越广,我们也越来越难区分“机械劳动”和“专业技能”之间的界限。我们冒着一个很大的风险:用不如人类的自动化系统,去替代人类真正的专业判断,却浑然不觉自己失去了什么。
每当一位科学家把某项工作交给AI工具去完成时,某种程度上其实就是在默认:“这事儿,不值得我来亲自做”。如果我们只是让AI去排参考文献,那也还好。但现实是,在时间压力下,这条界限不可避免地会变得模糊。也许我们不再去参加讲座,只看AI生成的摘要;也许我们不再读同事的新书,只听Google生成的15分钟播客;也许我们开始让LLM代劳写论文引言时的文献综述。表面上看,我们节省了时间,可实际上我们放弃了许多东西:对科学的沉思、对同行实践的理解、对知识的延展、对新想法的激发,以及作为研究者的成长机会。
关于AI与科学的争论中,谨慎派通常会强调:LLM无法对它生成的内容负责。如果你要使用它,那你就必须为它写下的每一个词负责。这确实是个好建议。但我们认为,科学家还应该走得更远。如果你习惯让LLM代替你完成某项任务,那也等于在暗示:你自己完成这项任务的能力,并不值得珍惜。
我们建议,科学界应该更认真地思考:我们所做的事情中,哪些才真正有价值。而LLM正在一点一点侵蚀那个空间。我们不应忘记人类科学活动本身的深度和复杂性。
© nature
doi:10.1038/d41586-025-01839-w
点击阅读原文,查看英文原文
往期推荐
版权声明
本文由施普林格·自然上海办公室负责翻译。中文内容仅供参考,一切内容以英文原版为准。欢迎转发至朋友圈,如需转载,请邮件[email protected]。未经授权的翻译是侵权行为,版权方将保留追究法律责任的权利。
© 2025 Springer Nature Limited. All Rights Reserved