专访MIT贾皓钧&段辰儒博士:AI4S时代的化学材料发现——「AI炼金术」
将
ScienceAI
设为
星标
第一时间掌握
新鲜的 AI for Science 资讯
作者 | MIT 贾皓钧&段辰儒博士
编辑 | 凯霞
大家可能从小就听说过爱迪生尝试上千种材料作为灯丝,凭着不断试错方法以及永不言弃的精神,最后研发出日用白炽灯的故事——天才靠的是百分之一的灵感和百分之九十九的汗水。
然而,随着科学的进步和现代社会的发展,新型材料的研发变得愈发复杂。现在,研究者经常需要在上百万大小的材料空间同时优化数十个不同的性质,以寻找适用于电池、半导体、催化剂和合金等领域的新材料。
如果说爱迪生需要 99% 的汗水,那现在研究者可能需要 99.99% 的汗水。
而新型材料的研发历程就有点像人们去「沙滩」上捡「贝壳」,在「沙滩」表面好找的贝壳在大家不断发掘下已经被拾的差不多了,更漂亮的「贝壳」却还埋在在更深的「沙滩」下面。
这些「贝壳」可能用传统的方法很难发掘,但 AI for Science(简称 AI4S)为我们带来了新的可能。
Microsoft Azure Quantum 研究科学家、麻省理工学院(MIT)段辰儒博士在吸光团簇的研发方面遇到了和「爱迪生类似的难题」——寻找吸收长波可见光并且激发态稳定的过渡金属吸光团簇。吸光团簇的发现在现阶段有两大难点,首先其设计空间有三千万个分子,比爱迪生当年大的多。此外,长波可见光吸收与稳定激发态是化学上接近互斥的两个性质,增加了探索难度。
段博士首先使用了「爱迪生式」的随机采样,尝试了两千个分子,发现无一同时满足这两种性质。继续类似探索带来的希望非常有限。于是,段博士带着 AI4S 的角度重新审视了这个问题:在这两千个分子的数据下建立了机器学习模型来快速预测分子的吸收波长和激发态时长;同时,使用主动学习与贝叶斯优化引导探索这硕大材料空间。在新的探索方式之下,模型找到目标分子的概率随着探索过程的进行迅速增长。达到在五百个分子后,每尝试五个分子,就可以找到一个吸收长波可见光并且激发态时间长的过渡金属吸光团簇。
保守估计,这种方法的改进带来了将近 1000 倍的加速,相当于将原本三年的研发周期缩短到了一天!
段博士的工作也于近期作为封面文章发表在 JACS Au。
贾皓钧(左)和段辰儒(右)
ScienceAI:两位能介绍一下自己吗?
段辰儒:
我目前在 Microsoft Azure Quantum 做研究科学家,主要研究生成式 AI 和大模型在化学方面的应用,和微软 AI4S 研究的产品化。两年前在 MIT 获得化学博士学位,博士期间主要做 AI4Chemistry 的研究,开创了 AI 决策模型在高通量计算中的整合,使得 AI+计算更好的服务于化学和材料发现。工作之余,我也一直参与组织在机器学习会议上的
AI4S workshop
(
https://ai4sciencecommunity.github.io/neurips23.html
) 系列,推动社区发展。
贾皓钧:
我目前在 MIT 化学系和化工系博士第五年,博士期间师从 AI 助力化学设计领军人物 Heather Kulik,主要研究方向是结合高通量量子化学和人工智能来帮助发现用于碳中和的新型催化材料。我之前也曾在陶氏化学核心研发部门进行研发工作,致力于使用 AI 来研发催化剂配方以及预测化学反应的路径。除了科研方面,我之前也担任过麻省理工学院中国学生学者联合会(MIT CSSA)2022-2023 主席。
ScienceAI:我们了解到两位之前本科都毕业于物理系,能给我们讲一下从本科到现在的这段科研和工作经历吗?因何与 AI 结缘的?
贾皓钧:
我本科是学物理的,在上学期间研究比较广泛,主要做过二维材料,电池,超导,合金的第一性原理计算模拟。而那时 PyTorch 和 TensorFlow 还没流行,但大量的数据也让我意识到材料筛选的重要性,这也因此打下了我与 AI 结缘的伏笔。后来到美国之后,发现结合 AI 算法可以大规模的来进行高通量筛选和预测。之前几个模拟等很多天出的结果,现在结合 AI 算法可以进行million 材料数量级别的高通量筛选和预测。从我迈入科研的大门到如今短短十年时间,计算模拟已经不再是单纯的验证实验,而是真实应用到工业界。AI4S 的范式是一个真实在发生的事,有很大的市场潜力。
至于为什么转向偏化学,是因为后来我发现物理离现实稍微有点远。我当时做学术的一个大的目标是想「做出的成果既能上得了书架,也能上得了货架」。我更想做一些偏实际的东西,所以本科也在约翰霍普金斯大学化学系待过,做一些气相表面化学的实验研究。其实那个时候是第一次接触化学,但发现了很多有意思的地方。例如,
物理多数情况关注现象本身,即宇宙本身的规律。化学更多关注的是过程和改变,是我们可以进行人为调控的。
在这之中,我们能找到一些真正有价值的东西。这也是我从物理专业转向化学的原因。
段辰儒:
我跟皓钧的经历比较相像,我本科做的是理论凝聚态,研究有趣的量子相变等现象。尽管这些研究领域引人入胜,但与实际应用之间存在一定距离。在这过程中,
我慢慢意识到相比于探索世界底层的物理规律,我更加享受使用物理规律改造这个世界。
于是在攻读博士学位时,我渴望朝着更接近应用的方向发展。来到 MIT 之后也跟很多老师交谈,其中与我导师聊天时,有一个点非常吸引我,她提到组里一名学生一篇文章产生的数据量比她来 MIT 之前整整 8 年的研究总和还多。这让我在 2017 年就意识到了计算化学领域的发展速度迅猛。
我开始阅读与研究相关的几篇论文,并发现尽管计算化学的计算能力和通量不断增加,但整个计算流程,即如何整合各种计算,尚未得到充分的发展。因此,我猜想将 AI 融入高通量计算体系,构建更优秀的工作流会是学术方面的一个增长点。2017 年,我在 MIT 开始自己的博士生涯。虽然当时还没有 AI4S 的概念,但我已经认识到高通量计算和人工智能相结合的潜力巨大,以及它可能对各学科带来范式的变革。于是我就坚定的选择了这个领域,实现了从物理到化学及工程应用方向的转变。
ScienceAI:两位博士目前都专注于「AI+化学/材料」计算领域的研究,能给我们讲一下 AI 如何助力计算化学吗
贾皓钧
:量子化学是通过第一性原理计算模拟材料的性质,具体的思路是:先固定原子位置解薛定谔方程,得到材料的电子结构,然后基于电子结构获得这个材料的性质,例如:电子能量、力学性质和结构性质等等。
第一步解薛定谔方程是计算量极大的量子多体问题,它的计算量随着模拟的原子数指数增加,也是目前最难解决的,甚至可以说是从头算模拟领域的「卡脖子」问题。
薛定谔方程的复杂性使其难以求解。但随着 AI 技术的发展,我们可以通过元素的內禀属性(原子半径、电负性、价电子等等)、材料的键长键角等等,「绕过」薛定谔方程多体问题,直接预测材料的性质。有两种主要思路:
通过 AI 预测电子结构来获取材料性质:
这一方法的优点在于其物理基础,即从电子结构到性质的转化是清晰的,没有黑箱。然而,挑战在于处理材料的波函数,它涉及到大量的矩阵,并且受到电子数量的限制,这限制了模拟的规模。AI预测波函数也很具挑战性。一种可行的方法是将材料的电子波函数投影到原子基组上,然后通过 AI 预测投影系数。然而,这会引发物理和数学上的问题,如基组的完备性等,这些问题在将其应用于实际系统时会带来技术挑战。
通过 AI 预测材料性质而不考虑电子结构:
这种方法的优势在于完全规避了多体问题,理论上可以用于处理大型体系。然而,这种方法高度依赖于大量的训练数据。相较之下,第一种方法可能有助于发现新的物理机制。不过,第二种方法已广泛用于新材料的探索和设计,显著加速了材料研发周期。例如,结合高通量计算与 AI 来预测性质,可以快速筛选出受关注的催化剂、电池、二维材料等。AI也能用于预测原子受力,加速分子动力学模拟或结构搜索,从而提高材料模拟的规模和精度。
段辰儒:
皓钧已经说了很多量子化学怎么样来帮助我们来算一些材料的性质。但其实还有一个问题:这么多量子化学方法,都会涉及到一些近似,那选取不同的近似就会给出不一样的结果。那怎么样来用 AI 帮助我们从怎么多计算方法中选择一个「最合适」的?或者怎么样能够利用多个「近似的结果」得到一个「更加准确的结果」?
最近受抖音「用户—短视频」匹配逻辑的启发,我想到可以做「化学材料—计算方法」匹配。通过搭建「密度泛函推荐器」,
我们首次将金属有机配合物的高通量计算的准确度逼近了实验测量的误差精度。
这个文章也发表在了 Nature 大子刊 Nature Computational Science 上,并获得了 Nature 新闻评论的关注。我认为这些把 AI 决策模型融合进计算流程的想法是「抹平」计算和实验结果差距的关键。