分子之心创始人许锦波:AI蛋白质设计最新进展
编辑 | 绿萝
1 月 11 日,在机器之心 AI 科技年会上,分子之心创始人、美国芝加哥丰田计算技术研究所终身教授、清华大学智能产业研究院(AIR)卓越访问教授许锦波发表主题演讲《AI 蛋白质设计最新进展》,在演讲中,他介绍了蛋白质结构预测与蛋白质设计,他表示 AI 蛋白质结构预测只是一个开始,分享了分子之心开发的 AI 蛋白优化和设计平台——MoleculeOS,以及在蛋白质侧链、抗体抗原复合物结构预测的最新研究成果。「人工智能颠覆了蛋白质结构预测,并正在改变蛋白质优化设计。」
以下为许锦波在机器之心 AI 科技年会上的演讲内容, ScienceAI 进行了不改变原意的编辑、整理:
以下为许锦波在机器之心 AI 科技年会上的演讲内容, ScienceAI 进行了不改变原意的编辑、整理:
蛋白质与蛋白质结构预测
首先,我简单介绍一下蛋白质。蛋白质是一个非常大的分子,由 20 种氨基酸通过化学键串联在一起。在这里看一下蛋白质的分子式。这是一个很小的蛋白质,只有 8 个氨基酸。每个氨基酸都是由很多原子构成的,它有主链的原子,也有侧链的原子。自然界有 20 种氨基酸,它们的主链原子构成都是一样的,只是在侧链原子构成上不一样。有些氨基酸有很多侧链原子,有些氨基酸几乎没有侧链原子。这些原子在细胞里面相互作用,最后形成一个稳定的状态。
AI 蛋白质结构预测,这只是一个开始
所以,另一种思路,就是我们利用计算的方法把蛋白质结构预测出来。现在,我们有高通量测序,可以很容易得到蛋白质的氨基酸序列。所以,假设我们有了蛋白质的氨基酸序列,能不能利用计算的方法把蛋白质的所有原子的三维坐标给计算出来,也就是蛋白结构预测。当然,这个问题是个很难的问题,已经研究了五六十年,一直没有很好的结果。直到最近几年,通过使用人工智能的方法,我们在蛋白质结构预测方面取得了很大的突破。人工智能预测蛋白质结构,在 2020 年和 2021 年都被《科学》杂志评为十大科学突破。去年 2022 年也入选了《麻省理工科技评论》的十大突破性技术。 从这里可以看出,蛋白质结构预测是个很难的问题,本身也是非常重要的问题,所以受到学术界的高度关注。AI 预测蛋白质结构取得了很大成功,但这只是一个开始,也只是用 AI 去研究蛋白质的一个开始。AI 蛋白质结构预测改变了分子生物学家的研究范式。以前大家都是基于蛋白质的氨基酸序列来研究一个蛋白质结构,但现在我们可以很容易地预测蛋白质结构。所以很多分子生物学家现在都可以基于蛋白质结构去研究蛋白质的功能。从另外一个角度,AI 预测蛋白质结构的成功,其实也证明了 AI 对蛋白质分子的研究是非常有效的。 AlphaFold2(AF2)可以把单一蛋白结构预测得很好,也有做得不是很好的地方,比如预测两个或多个蛋白质形成的复合物结构。虽然 AF2 在目前的方法里算是不错的,但是它的成功率还是远远不能让你满意的。特别是在一个非常重要的应用——抗体抗原相互作用预测方面,AF2 结果还是不那么好。当然也有很多 AF2 本身是不能做的,比如 AF2 没办法对蛋白质进行优化和重头设计,也没法预测单点突变对蛋白质结构和功能的影响。另外,AF2 可以预测蛋白质与蛋白质的相互作用,但是它没办法预测蛋白质和其他分子(小分子、DNA 和 RNA)的相互作用。
MoleculeOS:AI 蛋白优化和设计平台
蛋白质优化设计是创造自然界中不存在的蛋白质,即找到一个结构和功能可满足特定需求的氨基酸序列。蛋白质优化设计是一个非常难的问题,它面临的挑战,首先就是蛋白质序列空间是非常巨大的。假设我们只考虑一个 100 个氨基酸的蛋白质,自然界有 20 种氨基酸,其实序列空间就是 20 的 100 次方,这是个非常巨大的一个序列空间。但是巨大的序列空间里面其实只有很小比例的氨基酸序列可以折叠成一个稳定的构象,并且具有某种特定的功能。所以我们要在巨大的空间里面搜索,可以折叠成一个稳定的构象且具有我们所需要功能的氨基酸系列。这相当于大海捞针,是一个非常困难的问题。预测蛋白质结构和功能是蛋白质设计的一个基础,也就是我们在蛋白质设计的时候,往往需要对蛋白质结构和功能进行预测。 蛋白质设计在诊断、治疗和预防里面都有非常重要的应用。比如我们可以设计一个小蛋白,它可以用来做新冠病毒的诊断。当然我们也可以设计疫苗,用来预防新冠病毒。也可以用蛋白设计的方法去设计一个小蛋白,功能有点类似于抗体,它可以阻断新冠病毒进入人体。 分子之心在过去一段时间里,专门开发了一个 AI 蛋白优化和设计平台——MoleculeOS。这个平台主要是用来发明而不是发现蛋白质,实现「可编程」的蛋白质疗法。这个平台一共分为 4 层,在基础层上,是我们的一些 AI 算法,以及一些大数据库,还有一些算力平台。在能力层上,包含了不同的功能模块。比如我们可以做单个蛋白质预测,也可以用来做蛋白质复合物预测,当然也可以预测蛋白质功能,还有单点突变对蛋白质功能和结构的影响,以及蛋白质从头设计。在应用层上,我们会把这种功能模块用到各种不同模态的蛋白质上,比如我们可以把它用在酶和抗体上。最后产品层,我们就利用 MoleculeOS 设计不同的,满足我们所需要的蛋白质,用来做大分子药物研究或者合成生物学。
研究成果:蛋白质侧链、抗体抗原复合物结构预测
接下来,更详细地讲讲我们最近的一些结果。 在蛋白质侧链结构预测上,我们取得了比较好的进展。所谓的蛋白质侧链结构预测,也就是假设我们已经有了蛋白质的主链接结构,我们可以通过预测把侧链的原子位置确定下来。传统的方法主要是使用能量优化。首先,因为侧链原子在空间的分布不是随机的,他们需要对侧链原子在空间分布进行做 cluster,把它分成不同的组。然后再针对某一个特定的氨基酸去搜索它的侧链分组,同时优化能量。这是传统的方法。最近我们设计了一个 AI 算法,用来预测蛋白质侧链结构。 这张表里面展示一些结果。首先我们在 CASP13 这些测试蛋白上面测试了我们算法,使用的主链结构是实验结构。把我们的方法跟其他方法比较,有三种传统的方法, RosettaPacker, SCWRL 和 FASPR,也有深度学习方法,比如 DLPacker。我们这里使用了两种策略。从这里可以看到,我们的方法无论使用哪一种测量指标,都是要好于以前的方法。比如 RMSD,就是我们预测出原子的位置与它实验结构测出的位置的误差——当然误差是越小越好——从这里可以看到,我们两种方法得到的 RMSD 都是有远低于以前的四种方法的。在二面角预测的误差上面也是一样的。在二面角预测误差上面,我们的结果也是要好于以前的 4 种方法,特别是在第一个二面角上面,我们的结果是远好于以前的 4 种方法。