Nature Portfolio

AlphaFold要让位了?开源模型预测10亿蛋白质形状

Image

原文作者:Ewen Callaway & Miryam Naddaf

称为ESMFold2的AI工具开发的一个开源图谱,极大扩展了已知的蛋白质世界。

Image

这款AI工具设计的可以结合细胞毒性T淋巴细胞相关抗原4(CTLA-4)的蛋白质。来源:Molekuul/SPL

已知蛋白质世界扩大了。一个新发布的人工智能工具产生的图谱包含了超过10亿个蛋白预测结构,以及数十亿条蛋白质序列信息。

该数据库被称为ESM Atlas,由陈-扎克伯格倡议(Chan Zuckerberg Initiative)旗下的Biohub研究人员发布,这是一家位于美国旧金山的生物医学机构,由Facebook创始人马克·扎克伯格(Mark Zuckerberg)和妻子,医生及教育家普莉希拉·陈(Priscilla Chan)创立。

这一图谱在条目数量上比AlphaFold数据库的预测蛋白质结构多8亿条,比之前的ESM Atlas多约3亿条。

该预测来自ESMFold2,这是一个AI模型,据Biohub称,其性能已超越AlphaFold3——新版Google DeepMind系统——和其他蛋白质结构预测的人工智能模型。相关内容发表于5月底发布的一个报告中。

“这个图谱展现了蛋白质生物学的全貌,尤其是我们了解很少的部分。” Biohub科学负责人、领导该项目的Alex Rives说。“我们认为它将成为新生物学发现的有力基础。”

其他科学家对这些结果印象深刻,尤其是,ESMFold2是完全开源的。不过Biohub进入的是一个日渐拥挤的领域,竞争性的开源和专有蛋白质模型正在以极快速度取得进展。

抗体预测

ESMFold2的基础是Rives团队2024年发布的一个“蛋白质语言”模型,该模型利用生命之树上数以十亿计的各种蛋白质训练,包括了来自土壤、海洋和其他环境的“宏基因组”序列。

Rives团队表示,在确定相互作用蛋白复合物的正确结构(包括抗体分子与其抗原靶标的结合)方面,ESMFold2优于或可媲美包括AlphaFold3在内的现有方法。

在报告中,研究者描述了他们如何使用ESMFold2来设计新的抗体和其他蛋白质,它们能有力附着于癌症和免疫疾病相关蛋白质。在实验室中制造和测试时,很大一部分设计能够如预测一样发挥作用。

Rives团队用这一工具创造出了一个含有11亿预测蛋白质结构以及68亿蛋白质序列信息的图谱。这当中大多数来自尚未被充分表征的宏基因组序列。Rives希望,这一免费开放图谱将帮助科学家在蛋白质世界的已知与未知之间构建起桥梁。利用该图谱,研究者发现,在CRISPR微生物防御蛋白和另一种基因编辑蛋白之间存在结构相似性,后者于2023年于一种土壤真菌中被鉴定出来,也存在于在其他真核生物中[1]。

补充数据库

这一新发布图谱应能成为“生物学的非凡资源”,瑞典隆德大学计算生物学家Gemma Atkinson说。“见证大规模蛋白语言模型能捕捉蛋白质生物学领域的基本规则,真是激动人心。”

伦敦大学学院的计算生物学家Christine Orengo说,这些预测能帮助研究者发现新的蛋白折叠和功能,从而影响蛋白质设计和生物学的基础认识,不过需要先对其进行评估。

韩国首尔国立大学的计算生物学家Martin Steinegger说,他主要的疑问在于,ESMFold2能多好地预测那些与目前已知结构差异较大的蛋白质。他的团队发现,第一版ESMFold在预测不常见蛋白质结构时表现不理想,特别是存在于宏基因组数据中的结构[2]。

麻省理工学院的计算生物学家Sergey Ovchinnikov认为,ESM Atlas会是广泛使用的AlphaFold数据库(包含2亿蛋白质结构)的补充,而非替代。

Ovchinnikov补充道,ESMFold2预测相互作用蛋白的表现令人印象深刻,但也不算完全意外。今年早些时候,Google DeepMind分拆成立的生物制药公司Isomorphic Labs发布了一个专有模型,在该类结构预测方面有了明显进展。Biohub团队未作直接对比的其他一些开源模型也在预测蛋白质相互作用中有了长足进展,Ovchinnikov说。

ESMFold2完全开源、不限制商业使用,意味着它可能会被广泛使用,Ovchinnikov说。“我预计有许多人会对用上ESMFold2跃跃欲试了。”

参考文献:

  1. Saito, M. et al. Nature 620, 660–668 (2023).

  2. Yeo, J. et al. Preprint at bioRxiv https://doi.org/10.1101/2025.04.23.650224 (2025).


原文以Move over, AlphaFold: open-source model predicts shape of 1 billion proteins标题发表在2026年5月27日《自然》的新闻版块上

©nature

Doi:10.1038/d41586-026-01686-3

点击阅读原文查看英文原文

眼睛就看得懂的研究,就在视频号

往期精彩文章

Image
Image

版权声明:

本文由施普林格·自然上海办公室负责翻译。中文内容仅供参考,一切内容以英文原版为准。欢迎转发至朋友圈,如需转载,请邮件[email protected]。未经授权的翻译是侵权行为,版权方将保留追究法律责任的权利。

© 2026 Springer Nature Limited. All Rights Reserved

星标我们🌟,喜欢就点亮小爱心哦!