阿里云&中大:全新模型有助于解码生物学语言 |《自然-机器智能》论文
近期来自阿里云和中山大学的研究团队在《自然-机器智能》发表了论文“统一核酸与蛋白质语言的通用生物基础模型”(Generalized biological foundation model with unified nucleic acid and protein language),欢迎阅读文章了解详情。
论文导读:
生物学语言被编码在DNA、RNA和蛋白质中,构成了生命的基础,但由于其十分复杂,解码工作仍然具有挑战性。传统的计算方法往往难以整合这些分子中的信息,因而制约了对生物系统的全面理解。基于预训练模型的自然语言处理的发展为解读生物学语言提供了可能性。
来自阿里云和中山大学等单位的研究团队构建了一种名为LucaOne的预训练基础模型,在169,861个物种的核酸和蛋白质序列数据上进行训练。通过大规模数据集成和半监督学习,LucaOne展现出对DNA翻译成蛋白质等关键生物学原理的理解。利用小样本学习,该模型能有效地理解分子生物学的中心法则,并在涉及DNA、RNA或蛋白质输入的任务中表现出色。这项研究凸显了统一基础模型在解决复杂生物学问题中的潜力,为生物信息学研究和解读生命的复杂性提供了一个灵活的框架。
论文表1:LucaOne的工作流程。
扫码阅读论文
第一作者:Yong He(阿里云)
DOI:10.1038/s42256-025-01044-4
发表日期:2025年6月18日
《自然-机器智能》
2024 Journal Metrics
影响因子:23.9
五年影响因子:31.8
学科排名:1/175,计算机科学,跨学科应用;2/204,计算机科学-人工智能
引用量:15,338
下载量:2,486,397
*数据来源:2024年Journal Citation Reports, Clarivate Analytics 2025和期刊官网
《自然》系列期刊产品试用申请
Nature Portfolio期刊是多学科研究和综述期刊的合集,自1869年起一直致力于理解、 探讨和分享科学。《自然》系列期刊目前包含42种《自然》系列研究期刊,涵盖生命科学、物理科学、临床医学和社会科学领域,以及26种《自然综述》系列期刊,为您提供权威、易于理解、意义重大的综述内容。
▲ 如果您对《自然》系列期刊产品感兴趣,愿意推荐您所在的院校或机构申请试用,欢迎扫码提交表单申请。
欢迎扫描图片二维码或点击“阅读原文”了解《自然》及其系列期刊。
版权声明:
本文由施普林格∙自然上海办公室负责整理翻译。中文内容仅供参考,一切内容请以英文论文为准。欢迎转发分享本文,如需转载,请留言或联系[email protected]。
© 2025 Springer Nature Limited. All Rights Reserved