pythonic生物人

Anthropic/Genentech/Roche最新测评:Claude在生物信息学/计算生物学领域开始超越人类专家

Genentech和Roche计算生物学领域测评

Genentech和Roche联合发布CompBioBench评估基准,涉及computational biology领域。

Image

CompBioBench旨在测试智能体系统在计算生物学领域的性能。针对生物数据噪声大、解释开放的特点,该基准通过合成数据与真实数据改造,构建了100个涵盖多学科、具有明确答案的复杂任务。评估在最小化初始环境中进行,要求系统自主获取资源解决问题。

测试结果显示,主流系统表现突出:Codex CLI整体准确率达83%,Claude Code为81%;而在最难题型上,Claude Code以69%的准确率优于Codex CLI的59%。该基准为衡量智能体在计算生物学中的进展提供了实用工具,并为未来评估标准的设计提供了参考。

Image

同时,Anthropic也发布了一份关于AI模型在生物信息学领域能力评估的研究报告。这份报告基于他们开发的BioMysteryBench评估基准,对Claude模型进行了全面评估,结果显示出一些值得关注的趋势。

Image

科研能力评估的复杂现状

在当前的AI发展浪潮中,评估模型在科学领域的能力一直是个挑战。与软件工程领域拥有SWE-bench这样的标准化测试不同,科学领域,特别是生物信息学,面临着独特的评估困境。

科学研究往往不存在唯一正确的答案。以药物反应研究为例,同一个问题可以通过多种途径探索,每条路径都可能得出合理但不同的结论。此外,生物数据的复杂性和噪声干扰使得分析结果对方法选择极为敏感。更重要的是,那些人类尚未解决的尖端科学问题,恰恰是最需要AI协助的领域,但这些问题的评估标准又最难确定。


一项精心设计的测试

为了应对这些挑战,研究团队构建了BioMysteryBench,包含了99个真实的生物信息学问题,涵盖基因组学、转录组学、蛋白质组学等多个子领域。

部分问题包括:

这个单细胞RNA测序数据集源自人体的哪个器官?

根据RNA测序数据,实验样本与对照样本相比敲除了哪个基因?

基于全基因组测序(WGS)数据,样本X的母亲是哪份样本,父亲是哪份样本?

哪些bigWig文件来自染色质免疫沉淀(ChIP)样本,哪些来自输入对照?

已知一种未知细胞类型的H3K27ac染色质免疫沉淀测序(ChIP-seq)峰,请鉴定出该细胞类型。

测试设计注重真实性和实用性。所有问题都基于真实的实验数据,包括全基因组测序、单细胞RNA测序、宏基因组学等数据类型。测试环境模拟了实际工作场景,AI可以在包含标准生物信息学工具的容器中操作,并能访问常用的科学数据库。每个问题都配有验证材料,确保问题本身具有科学上的可解性。


人机对比的测试结果

研究团队邀请了五位领域专家参与测试,并将问题分为两类:人类可解题(至少一位专家能够解决)和人类难解题(所有专家都无法解决)。

Image

测试结果显示,在76道人类可解题上,最新版的Claude模型表现与人类专家相当,能够完成大部分分析任务。

而在23道人类难解题上,Claude模型解决了其中约30%的问题,这意味着在一些人类专家束手无策的领域,AI展现出了独特的解决问题的能力。

图1:在76个人类可解问题上,经过5次试验的平均准确率。误差线通过在问题内部进行Bootstrap抽样计算得出。
图1:在76个人类可解问题上,经过5次试验的平均准确率。误差线通过在问题内部进行Bootstrap抽样计算得出。

AI解题策略的观察

分析解题过程可以发现,AI的思考方式与人类专家有所不同。

在一些情况下,AI依赖于其庞大的知识储备。例如,在序列识别任务中,人类专家可能需要查询多个数据库并进行序列比对,而Claude模型能够直接从其训练数据中识别出相关模式。这种能力类似于一位经验丰富的学者,能够快速联想到相关领域的知识。

Image

在更多情况下,AI采用了一种“多路径验证”的策略。当对答案不确定时,AI不会沿着单一思路深入,而是同时尝试多种分析方法,寻找不同方法得出的结论之间的共识。这种思路体现了科学方法的基本原则——通过多重证据提高结论的可靠性。

对AI科研能力的理性评估

图3. BioMysteryBench 中各模型的逐题解题一致性。每个模型对所有问题均进行了五次求解尝试;柱状图展示了在五次尝试中,能解决0、1、2、3、4或5次的问题所占的比例。在人类可解集上(左侧),所有三个模型都表现出强烈的双峰分布——问题几乎总是要么每次都能解决,要么一次也解决不了。在人类困难集上(右侧),分布的中部变得充实:每个模型的正确答案中,有更大一部分来源于那些在五次尝试中仅解决了一两次的问题。这表明,在困难集上取得的成功,往往来自于偶然的推理路径,而非可稳定复现的解决方案。
图3. BioMysteryBench 中各模型的逐题解题一致性。每个模型对所有问题均进行了五次求解尝试;柱状图展示了在五次尝试中,能解决0、1、2、3、4或5次的问题所占的比例。在人类可解集上(左侧),所有三个模型都表现出强烈的双峰分布——问题几乎总是要么每次都能解决,要么一次也解决不了。在人类困难集上(右侧),分布的中部变得充实:每个模型的正确答案中,有更大一部分来源于那些在五次尝试中仅解决了一两次的问题。这表明,在困难集上取得的成功,往往来自于偶然的推理路径,而非可稳定复现的解决方案。

尽管测试结果令人鼓舞,但研究者对AI的科研能力持谨慎态度。

首先,AI的表现在不同问题间存在较大波动。同一道难题,AI可能这次能解决,下次却无法完成。这表明其解题策略还不够稳定,尚不能完全替代人类在关键科学决策中的作用。

其次,AI目前还缺乏“科学直觉”或“研究品味”。它能够解决问题,但难以判断哪些科学问题更具价值,或者哪种解释在生物学上更为合理。这就像一位解题高手,但还不是能够提出深刻科学问题的研究者。

最重要的是,AI得出的结论最终需要人类来验证和解释。生物学研究不是简单的计算问题,需要综合考虑实验证据、理论框架和领域专业知识。

https://www.anthropic.com/research/Evaluating-Claude-For-Bioinformatics-With-BioMysteryBench

https://doi.org/10.64898/2026.04.06.716850