《自然-生物技术》新文上线︱Han Xiao/Xiongyi Huang团队开发“序列展示”新技术:通过大规模序列—活性数据集驱动蛋白质快速进化
研究背景
蛋白质工程在生物医药和工业催化等领域具有核心地位,但通过传统的定向进化(Directed Evolution)获得高性能蛋白质变体通常需要经历多轮繁琐、耗时的筛选与优化过程。虽然现有的高通量筛选和深度突变扫描(DMS)技术已显著提升了效率,但它们往往侧重于富集高活性变体,难以系统性地获取包含低活性或无活性序列在内的全量程“序列—活性”数据集。这种高质量大规模数据集的匮乏,直接制约了预训练蛋白质语言模型(pLMs)在准确预测蛋白质功能活性方面的潜力。因此,开发一种能够快速、高通量地将蛋白质序列与其生物活性直接关联,并构建完整活性图谱的新型技术,已成为加速蛋白质进化研究的迫切需求 。
结果与展望
研究团队开发了一种名为“Sequence Display”(序列展示)的新型蛋白进化平台,其核心逻辑是将蛋白质的生物活性实时转化为可被测序的碱基突变频率。该技术通过将目标蛋白活性与碱基编辑系统偶联,使得蛋白质变体的序列(基因型)与其对应的条形码突变率(表型)能够利用高通量测序技术进行同步读取,从而在单轮实验中快速构建出包含万级数据点的全量程“序列—活性”数据集。依托Sequence Display生成的大规模数据集,团队结合ESM-2和SaProt等预训练蛋白质语言模型进行迁移学习与集成建模,实现了对蛋白质功能景观(Activity Landscape)的高精度预测,实现了对蛋白质功能活性的精准预测与高效进化。
实验结果显示,该平台在胞嘧啶脱氨酶、氨酰-tRNA合成酶(aaRS)及SlugCas9等多种蛋白系统中均表现出卓越的普适性。例如,团队成功进化出具备广谱PAM识别能力的SlugCas9突变体;同时,研究还通过进化MbPylRS突变体,显著提升了其对多种非天然氨基酸的识别效率。这项研究量化证实了Sequence Display生成的大规模数据集对提升机器学习预测精度的决定性作用,为AI驱动的蛋白质进化提供了强有力的技术支撑。
图1. 序列展示Sequence Display 流程概览:构建大规模序列—活性数据集,推进通用蛋白质进化。
本研究开发的 Sequence Display 平台通过将蛋白质活性转化为可测序的碱基编辑信号,实现了单轮实验内大规模、全量程“序列—活性”数据集的快速构建,突破了传统定向进化中数据获取通量低、缺乏全景图谱的瓶颈。通过将海量实验数据与预训练蛋白质语言模型(pLMs)深度结合,该平台实现了对蛋白质功能活性景观的高精度预测,显著提升了 AI 驱动下蛋白质性能优化与理性设计的成功率。实验证明该技术在多种蛋白系统中均表现出极佳的普适性,为生物医药和合成生物学等领域开发高性能蛋白质工具提供了一种全新的高效技术范式。
作者简介
本研究由莱斯大学Han Xiao课题组与约翰霍普金斯大学Xiongyi Huang课题组合作完成。莱斯大学博士生程麟棋、科研助理郑昕哲以及研究生江世宇为该论文的共同第一作者。此外,微软研究院的 Kevin Yang研究员作为计算生物学方向的技术指导,为本研究的机器学习部分提供了深度支持。Han Xiao (https://xiao.rice.edu/) 现任莱斯大学 SynthX 中心主任,并担任化学系、生物科学系和生物工程系教授。课题组研究方向包括:基于ML蛋白质进化与工程;基因密码子扩展;新型药物递送系统;新型疾病诊断分子。
《自然-生物技术》Nature Biotechnology
DOI:10.1038/s41587-026-03087-3
扫码查看论文原文
Sequence Display enables large-scale sequence–activity datasets for rapid protein evolution
《自然-生物技术》
2024年期刊指标
影响因子:41.7
五年影响因子:59.5
学科排名:2/177,生物技术与应用微生物学
引用量:100,474
下载量:11,360,539
*数据来源:2024年Journal Citation Reports, Clarivate Analytics 2025和期刊官网
欢迎扫描图片二维码或点击“阅读原文”了解《自然》及其系列期刊。
版权声明:
本文内容由 Nature Biotechnology 刊发文章的原文作者提供,本文所表述的观点均为原文作者的观点。中文内容仅供参考, 一切内容以英文原版为准,欢迎转发至朋友圈。未经允许,请勿转载。未经授权的翻译是侵权行为,版权方将保留追究法律责任的权利。
© 2026 Springer Nature Limited. All Rights Reserved.