Nature Portfolio

检索信息只会用Google?这款工具专业且强大

Image

当今时代,科学快速发展,由AI驱动的发现突飞猛进。在这样的背景下,研究人员应如何在海量的资源中发现可靠的信息来源并确保信息质量,以做出明智的决策?

Image

从学术研究、医疗诊断到市场趋势分析,越来越多的领域都在使用TDM从繁杂的数据集中获得可付诸实践的见解,进而做出充分知情的决策和创新。那究竟什么是TDM?

TDM全称text and data mining文本和数据挖掘,是指以检索、寻找模式、发现关系和语义分析等为目的,对大量的文本或数据资源进行自动选择和分析的过程,将原始数据转化为有用的信息。TDM近年来已逐渐发展成为一种强大的工具,为研究人员提供了一种高效处理并充分利用工作中大量信息的方法。

施普林格·自然正在加紧与科研机构和企业的信息专业人士合作,制定许可协议并开发资源,赋予您的科研人员以“传统”渠道所不具备的检索和发现能力。把TDM的强大功能与特定科研工具相结合,将有助于驱动变革性发现和一些重大社会挑战的创新解决方法。

在本篇文章中,我们邀请到了施普林格·自然数据解决方案及战略主管Prathik Roy博士,带您详细了解什么是TDM、如何将其应用到科研活动中,以及如何通过应用程序编程接口(API)更好地发挥TDM的价值。我们希望能够借此为您提供专业的见解,助您了解如何将这一强大的工具引入到贵机构的研发架构中,让您的研究人员无需为了获取有用信息而研读数百篇文章。

什么是TDM?为何它对研究人员如此重要?

数字时代为研究人员带来了前所未有的海量信息,面对让人眼花缭乱的资源,仅仅是确定哪些内容与自己的工作有关就充满挑战,更不要说从中提取有用信息并形成见解了。

TDM使用计算工具和技术来分析大型文本数据集,从学术论文、期刊和其他科学出版物中的大量科学数据里提取有价值的信息,并识别出通过传统人工分析难以或无法发现的模式、关联和趋势。它能够帮助研究人员更高效地处理大量信息,但只有配置合适的工具和支持,他们才能充分、负责任地发挥TDM的最大价值。

Image

TDM的两大用途

TDM用途广泛,可应用至多种实践,如AI如何改变药物发现、机器学习用于分子和材料科学等。在诸多用途中,提高内容的可发现性和从大量文本和数据中发现模式和关系最为重要。

可发现性

是指基于检索关键词以及关键词之间的逻辑关系,来检索高度相关的论文全文。它反映了TDM将不同来源的信息高效联系起来的能力,这些来源包括研究论文、专利、临床试验,乃至研究机构或企业内部的数据集。

Roy博士表示,可发现性的终极目标是“匹配你的查找目标,并在此过程中排除一切不相关的材料。”这意味着,当你在检索某些关键词或短语时,系统返回的都是与你的检索条件高度相关的论文。

例如,你正在检索那些证实烟草中的致癌物与某种癌症(如肺癌)存在关联的论文。传统检索方式返回的结果可能包括所有提及致癌物、烟草和/或肺癌的论文。而借助TDM技术,你检索到的只有那些发现特定致癌物对肺部有影响的论文。

模式识别

是指发现数据集中的模式和趋势。在这种情况下,模式识别的结果不是论文或相关资料,而是基于数据的猜想或预测。例如,研究人员可利用这种技术来匹配分子的生化性质和病毒蛋白的性质,以识别那些可能结合病毒的分子。

如果您觉得施普林格·自然的TDM及其API工具还不错,想要进一步了解我们能够提供的支持,欢迎扫码联系我们。

Image

机器可读格式:使信息可供TDM所用

要实现TDM的价值,PDF文件中的信息必须转化成XML一类的机器可读格式。XML(可扩展标记语言)是一种用于数据储存和传输的灵活、结构化的格式,用户可在其中定义标签及其他数据结构。这类文件中的信息结构化且带标签,这样机器就能迅速发现数据点并将其用于各种用途。

施普林格·自然为旗下的出版物和其他资源创建了详尽的全文XML文件,专供机器读取并用于TDM。在这些XML文件中,单个元数据和各种类型的信息都会按照不同学科、领域以及用途(例如化学式)加上标签。这使得信息可供TDM所用。

Image

API:传递TDM输出的信使

TDM输出的所有结果都是通过应用程序编程接口(API)呈递的。API是数字生态系统的基础模块。它们允许应用利用其他软件的丰富资源和功能,从而实现系统整合,促进自动化并驱动创新。

API就像携带需求的信使,它告诉系统你想要什么,然后将系统的响应返回给你。API无法替代数据库,也不是概括工具。它们填补了人人可用的AI工具和一篇篇论文之间的空缺。API和TDM在这方面配合完美。因此,不管贵机构的研究人员手头有什么AI工具,API都能将其与所需的信息相连接,以产出见解。

为了更直观地理解API,我们可以用餐厅来打比方。设想您是一家餐厅的顾客,拿着一份菜单准备点餐。服务员(API)将您的订单(请求)送到后厨(系统/数据库,如施普林格·自然旗下的数据库),随后端回您点的食物(数据/响应,机器可读格式)。

厨房(系统)完成了这项工作,但您是通过服务员(API)进行沟通。正如您在餐厅用餐无需知道烹饪过程一样,有了API,您无需了解系统运行的细节,只需要清楚自身的需求并提出需求。

利用先进的API解决方案为科研赋能

API能用来发现研究或商业领域的趋势。随着科学出版物数量的增加和TDM软件工具的发展,施普林格·自然创建了一套正式的TDM流程,旨在让TDM尽可能简单易行。使用施普林格·自然的API时,贵机构的研究人员可以灵活运用我们在API中创建的约束(就像过滤器一样,有助于筛选出全文中最相关的信息),以获得最佳结果。关键词、国家、主题领域或内置约束的不同组合使输出结果得到进一步精炼。其应用涵盖产品发现、寻找合作者、发现研究领域或论文中的最新趋势等。

数据源(用以提取信息)是TDM和API使用中的根基。研究人员和机构使用的各种AI系统都有赖于优质信息的输入,而这正是施普林格·自然的优势所在。施普林格·自然丰富的出版物资源包含大量扎实且经过验证的研究,能提供各个学科领域的高质量信息。

施普林格·自然开发了多个TDM API工具,旨在方便研究人员充分利用我们的海量出版物进行文本和数据挖掘。我们提供以下三种API:

  • Meta API:允许用户访问元数据和数百万份科学文献(期刊论文、图书章节、实验室指南)的摘要,便于发现和探索相关内容。

  • 开放获取内容API:允许用户从施普林格·自然OA出版物中检索全文内容。覆盖来自不同学科领域、超64w+篇在线文献,其中包括BioMed Central和SpringerOpen期刊,并支持XML、JSON等多种数据输出格式。

  • 付费订阅内容全文API:解锁施普林格·自然丰富的订阅内容合集,为深度分析提供全面的数据。除知名的《自然》系列期刊、Springer期刊及图书外,施普林格·自然还拥有SpringerMaterials、AdisInsight、SpringerProtocols等专业数据库。

施普林格·自然的开发者门户网站的设计和运营始终将终端用户的需求置于中心,提供了大量的用户指南。施普林格·自然为学术和政府机构提供了单独的许可协议,此外还有面向科技公司和制药企业商业用途的许可协议。当您与施普林格·自然签署API许可协议后,贵机构的研究人员可以:

  • 系统地下载并储存机器可读文件;

  • 提取、整理、构建本体和分类体系,转化、总结、创建知识模型或图表等;

  • 将TDM用于药物发现、疾病研究、监管等商业或非商业用途;

  • 将TDM与内部AI工具相结合。

施普林格·自然的TDM API与我们旗下的多个优质数据库直接相连,能输出高质量的结果,确保用户获得最新且值得信赖的信息——如有任何论文或图书章节进行了修改、更新或撤回,这些变化都会反映在TDM输出的结果中,这是API用户独享的权益。

施普林格·自然TDM的四种使用场景示例:

  1. 接入API和密钥(api_key=**********)在Metadata中搜索化学(Chemistry)相关数据;

  2. 搜索关键词“患者(patients)”相关数据;

  3. 搜索1993年相关数据;

  4. 展示pam格式数据和json格式数据(我们同时支持jat、xml等多种数据格式输出)

Image

如果您觉得施普林格·自然的TDM及其API工具还不错,想要进一步了解我们能够提供的支持,欢迎扫码联系我们。

Image

案例分享:了解国际知名生物科技公司和制药企业如何使用施普林格·自然的TDM为其研究人员赋能

•AI医疗独角兽BenevolentAI如何利用文本和数据挖掘,助力其药物研发?

•AI时代,你的团队还在用传统方式检索文献吗?

•将不可能变为可能!文本和数据挖掘如何助力这家大型抗体搜索引擎公司?

•打开全新思路!这家公司引入TDM让文献主动找上门

版权声明:

本文由施普林格∙自然上海办公室负责整理翻译。中文内容仅供参考,一切内容请以原文为准。欢迎转发分享本文,如需转载,请留言或联系[email protected]。

© 2024 Springer Nature Limited. All Rights Reserved

Image

欢迎点击“阅读原文”访问官网详细了解施普林格·自然的TDM