Skip to main content
QUICK REVIEW

[论文解读] An Information Extraction and Knowledge Graph Platform for Accelerating Biochemical Discoveries

Matteo Manica, Christoph Auer|arXiv (Cornell University)|Jul 19, 2019
Biomedical Text Mining and Ontologies参考文献 14被引用 8
一句话总结

该论文提出了一种可扩展的知识图谱平台 BCKG,通过自然语言处理(NLP)和图分析技术,整合结构化的生化数据库与非结构化的科学文献(PDF),以加速生化发现。通过将来自10多个数据库的数据进行标准化,并利用云原生管道从文本和表格中提取事实,BCKG 支持复杂的查询,从而揭示了新型酶候选物——如此前未列在数据库中的海藻糖-1-磷酸磷酸酶 TPP1——展示了其在系统生物学中实现意外发现的潜力。

ABSTRACT

Information extraction and data mining in biochemical literature is a daunting task that demands resource-intensive computation and appropriate means to scale knowledge ingestion. Being able to leverage this immense source of technical information helps to drastically reduce costs and time to solution in multiple application fields from food safety to pharmaceutics. We present a scalable document ingestion system that integrates data from databases and publications (in PDF format) in a biochemistry knowledge graph (BCKG). The BCKG is a comprehensive source of knowledge that can be queried to retrieve known biochemical facts and to generate novel insights. After describing the knowledge ingestion framework, we showcase an application of our system in the field of carbohydrate enzymes. The BCKG represents a way to scale knowledge ingestion and automatically exploit prior knowledge to accelerate discovery in biochemical sciences.

研究动机与目标

  • 解决存储在孤立数据库和非结构化文献中的生化知识碎片化且未被充分利用的问题。
  • 开发一种可扩展的、基于云的平台,将多样化数据源标准化并统一为一个可查询的知识图谱。
  • 利用自然语言处理技术,实现从科学PDF中自动、大规模地提取实体和事实。
  • 展示该平台在识别具有工业相关性的新型、此前未报告的酶方面的实用性,例如合成海藻糖的酶。
  • 通过支持基于图的分析和复杂查询工作流,加速生化发现,实现意外洞察的生成。

提出的方法

  • 使用具有标准化键的规范化JSON表示,从10多个生化数据库(如UniProt、CAZy、KEGG、PubChem)摄取结构化数据。
  • 通过语料转换服务(CCS)处理非结构化PDF(如科学论文、手册),将文本、表格和元数据提取为结构化JSON格式。
  • 应用命名实体识别(NER)在文本和表格中识别生化实体(如基因、蛋白质、EC编号)。
  • 执行事实提取(FE),识别实体之间的关系,如酶-底物或酶-生物体关联。
  • 通过共现关系和语义标准化,将数据库和文献中的实体与事实链接,构建统一的知识图谱。
  • 实现基于DAG的查询引擎,以支持复杂、多步骤的工作流,包括图遍历、中心性分析和洞察生成。

实验结果

研究问题

  • RQ1可扩展的、基于云的平台能否有效将异构的生化数据库与非结构化的科学文献整合为一个统一的、可查询的知识图谱?
  • RQ2自然语言处理技术(如NER和FE)如何应用于从扫描PDF和科学文本中提取可操作的生化事实?
  • RQ3基于图的分析在多大程度上能够揭示尚未列在CAZy等权威数据库中的新型、此前未报告的酶候选物?
  • RQ4该平台能否支持复杂、多步骤的查询,以实现生化发现中的‘为意外发现做规划’?
  • RQ5该知识图谱在加速识别参与高价值碳水化合物(如海藻糖)合成的酶方面有多高效?

主要发现

  • BCKG平台摄取了来自10多个结构化数据库和1000多篇科学文献的数据,构建的知识图谱包含约600万个节点和6100万条边。
  • 该平台成功识别出TPP1(来自水稻的海藻糖-1-磷酸磷酸酶)为一种新型酶,该酶尚未列在CAZy数据库中。
  • 该系统发现stf0(结核分枝杆菌中的海藻糖-2-硫酸转移酶)为一种此前未在CAZy中报告的候选酶。
  • 基于DAG的查询引擎支持复杂、多步骤的工作流,结合图遍历与过滤,成功识别出罕见或被忽视的生化关系。
  • 通过NER和FE从文献中整合事实,显著扩展了已知酶功能的覆盖范围,超越了仅依赖人工整理数据库的范围。
  • 该平台通过支持对生化网络的系统性探索,特别是在碳水化合物代谢背景下,展示了生成新型洞察的能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。