基于多重序列比对的基因组语言模型精确预测人类全基因组变异效应
基因组语言模型(genomic language model, gLM)采用自然语言处理中广泛应用的自监督学习框架,通过大规模无标注的DNA序列数据训练,从中学习基因组序列的特征及功能约束。此前,基于类似框架的蛋白质语言模型已在蛋白质序列变异效应预测中取得了显著成果,但由于人类基因组序列包含大量非编码区域和重复序列,其建模复杂性和难度更高,现有基因组语言模型在这一问题上的表现尚不理想。
在多项基准测试中,GPN-MSA 展现了高预测准确性,包括在临床数据库(如 ClinVar、COSMIC、OMIM)、高通量实验数据(如 ProteinGym、DepMap)以及群体基因组数据(如 gnomAD)等。这些数据集覆盖了不同基因组区域和功能分类的序列变异,全面验证了 GPN-MSA 在不同场景下的适用性和鲁棒性,特别是在遗传变异的致病性预测及罕见遗传病诊断方面表现出极大的潜力。
《自然-生物技术》Nature Biotechnology
DOI: 10.1038/s41587-024-02511-w
版权声明:
本文内容由Nature Biotechnology 刊发文章的原文作者提供,本文所表述的观点均为原文作者的观点。中文内容仅供参考, 一切内容以英文原版为准,欢迎转发至朋友圈。未经允许,请勿转载。未经授权的翻译是侵权行为,版权方将保留追究法律责任的权利。