平均准确率达96.4%,中山大学&重庆大学开发基于Transformer的单细胞注释方法
将
ScienceAI
设为
星标
第一时间掌握
新鲜的 AI for Science 资讯
图示:内部数据集的细胞类型注释的性能。(来源:论文)
此外,针对粗略细胞类型识别,SANGO 在 EpiAnno 选择的数据集上也表现出色,优于其他五种方法。总体来看,SANGO 在各类内部数据集上的稳健性能证明了其在单细胞类型注释任务上的优越性。
跨平台与跨组织数据集上的单细胞类型注释效果
面对来自不同测序平台(如10x Genomics、snATAC-seq、sciATAC-seq)的 19 对配对数据集,SANGO 取得了最高的平均准确率 77.6%,较次优方法高出约 10%。
图示:跨平台或组织数据集的性能。(来源:论文)
UMAP 可视化显示,SANGO 成功分离了原始数据中混杂的内皮细胞和小胶质细胞,而竞争方法则未能将内皮细胞与星形胶质细胞有效区分。
此外,针对跨越七种组织(骨髓、肝脏等)的 22 对跨组织数据集,SANGO 以平均 86.3% 的准确率显著超越所有竞争方法,揭示了其在处理不同来源及组织背景下细胞类型识别任务的强大通用性和准确性。
在使用不同参考数据源进行单细胞类型注释时的性能
当以多源组织(如脑、肠)数据作为参考时,SANGO 在 7 组多参考与查询数据集上的平均准确率为 93.2%。通过分析相关基因(如 TCL1A、FCGR2B、TEX9)周边的峰值信号,SANGO 的标注得到了确认,显示了其在不同参考数据来源下的稳定性和可靠性。