AI要抢我饭碗?真相:它让我更忙了!| 自然职场
一次与充满伪影的AI分析结果的交锋,让Lei Zhu意识到,机器学习并没有让他的工作变得无关紧要——相反,它让他的角色比以往任何时候都更重要。
原文作者:Lei Zhu
原文以‘Am I redundant?’: how AI changed my career in bioinformatics标题发表在2025年10月13日《自然》的职业版块上
当我开始读研究生时,首先要做的就是选择研究方向。我加入的实验室主要专注于两个领域:功能实验和生物信息学。那是十多年前的事了,当时的典型工作流程是——生物信息学研究人员分析大型数据集,以识别与特定表型或疾病相关的基因,然后交由功能实验团队进行验证。
当时,生物信息学还是一个新兴而充满希望的领域,我毫不犹豫地选择了这条路。但由于我没有编程背景,入门的过程十分艰难。我从学习编程语言开始——先是Perl,然后是R和Python。
代理式人工智能(Agentic AI)的兴起促使Lei Zhu重新思考自己在生物信息学领域的定位。来源:Lei Zhu
回过头看,我很庆幸当初的决定。那是一个激动人心的时代,高通量技术和新方法——如转录组学、基因组学,以及后来出现的单细胞生物学——都在快速发展,给了我大量可以探索的数据。通过自己编写的代码解决生物学问题,让我获得了强烈的自我价值感。
后来,包括ChatGPT、Manus和Grok在内的人工智能(AI)工具出现了。它们能够直接生成功能性代码,这一度让我有被取代的威胁感。但起初我并不担心,因为AI生成的代码往往存在错误,只有在测试时才会暴露出来,需要手动调试。然而,新出现的“代理式人工智能(Agentic AI)”改变了这一切。它让Manus这样的工具不仅能生成代码,还能直接在云端运行代码,形成一个无缝循环:从我提出问题,到AI编写并执行代码,再到我收到结果。那是我真正开始担心的一刻:在这个AI时代,我还有存在的必要吗?
如今的AI工具确实能高效地写代码执行生物学分析。我只需上传数据,并输入简单的提示词,例如:“假设你是一名生物信息学专家。请基于你的理解为上述数据集生成十个用于展示不同数据的可视化图,每个图请单独呈现,并附上一段简短说明。”AI便会给出我想要的答案,有时甚至超出预期。但这让我产生了新的疑问——在这个过程中,我的角色到底是什么?
我在一项肺癌研究中得到了答案。我们有几百个肿瘤组织的基因表达谱,我让AI来设置分析流程。它运行迅速,甚至生成了一份简洁的报告。初步结果看起来相当不错——好得有点不真实。AI发现了一个时间点前后基因表达水平存在统计学上的显著差异。但我在深入检查后发现,在实验进行到一半时,实验室更改了数据采集方式。模型检测到的差异,并非生物学差异,而是技术伪影(译注:技术伪影指医学成像技术中,图像上出现的与真实物体无关的虚假影像或异常)。当我调整了这项变动后,差异虽然不再那么显著,但反映的才是真实的生物学信号。
那一刻我意识到:我的角色已经从“写代码的人”变成了“监督者”。如今真正重要的,是明确提出问题、识别计算机看不到的漏洞,并且对结果负责。
给AI监督者的实用技巧
人们常对我说:“你可以通过在提示词里加入更多背景信息,让AI变得更智能。”但我的AI似乎总是装傻——无论我写得多么详细,它总能找到新的方式误解我的意思。过去几年里,我逐渐摸索出一些验证AI结果的方法。
创建验证集。保留一小部分你非常熟悉的数据集——比如已发表的结果或人工验证过的数据子集——作为“阳性对照”。在把新的AI生成流程应用到完整数据之前,先在这组数据上测试。如果AI输出的结果异常或前后不一致,你就能立即判断出问题出在提示词或算法本身。
打乱数据。AI模型很容易对数据过拟合,或被技术性伪影误导——就像我在肺癌研究中遇到的情况一样。为了检验一个结果是否具有生物学意义,你可以打乱样本标签、轻微扰动数值,或引入一些人工噪声。如果“显著的模式”依旧存在,那它很可能只是伪影,而不是真实信号。
分批分析。如果数据集足够大,我会让AI在随机抽取的不同子集上分别进行相同分析。若各子集的结果一致,就能增加信心;若差异极大,则说明结论可能不稳健。
检查假设。许多AI生成的模型对数据有隐含假设——比如数据服从正态分布、随时间线性变化、或与混杂变量独立。这些假设通常不会被明确说明,但可能极大影响分析结果。因此,我总会检查AI是否正确地应用了统计方法。举例来说,如果它在不服从正态分布的数据上使用了学生t检验,我会用另一种方法(例如Wilcoxon检验)再验证一次,因为后者在这些情况下往往更可靠。
用简化提示词重复分析。根据我的经验,提供更少的背景信息,有时反而能得到更可靠的结果。如果我曾用过非常详细的提示——例如指定要使用的数据库和算法——我会再用更简单的提示重复分析,看看结果是否一致。这样可以避免AI过拟合于提示词的表述而非数据本身。
建立共识。市面上有很多AI工具,最好在多个平台上运行同一个分析并进行结果对比。我常用一个名为ChatALL的网页工具,它能让研究者一次性将同一个提示输入多个AI系统。如果不同工具得出一致结论,结果的可信度就会更高,你也会对自己的分析更有信心。
咨询专家。尽管AI能迅速生成答案,但它并非无所不知,尤其在处理复杂的生物学问题时。因此,我常会把AI的分析结果拿给相关领域的专家同事看,确保这些结果符合当前的生物学认知,并在现实情境中可被应用。
无论如何,生成式AI在生物信息学中的兴起并没有削弱我的角色,而是重新定义了它。它迫使我成为一名更好的科学家。无论好坏,AI似乎都不会离开我们的世界。我鼓励你们拥抱这项技术——不是为了取代你的专业能力,而是让它放大你的力量。
© nature
doi:10.1038/d41586-025-03135-z
点击阅读原文,查看英文原文
往期推荐
版权声明
本文由施普林格·自然上海办公室负责翻译。中文内容仅供参考,一切内容以英文原版为准。欢迎转发至朋友圈,如需转载,请邮件[email protected]。未经授权的翻译是侵权行为,版权方将保留追究法律责任的权利。
© 2026 Springer Nature Limited. All Rights Reserved