Skip to main content
QUICK REVIEW

[论文解读] Towards context in large scale biomedical knowledge graphs

Jens Dörpinghaus, Andreas Stefan|arXiv (Cornell University)|Jan 23, 2020
Scientific Computing and Data Management参考文献 39被引用 10
一句话总结

本文提出一种使用Neo4j中带标签属性图的多语言持久化架构,将引用、命名实体和BEL关系等上下文数据整合到从PubMed和SCAIView衍生的大规模生物医学知识图谱中。该图谱包含超过7100万个节点和8.5亿条关系,支持复杂查询以实现知识发现,27个真实世界用例证明其在情境化生物学研究中的实用性。

ABSTRACT

Contextual information is widely considered for NLP and knowledge discovery in life sciences since it highly influences the exact meaning of natural language. The scientific challenge is not only to extract such context data, but also to store this data for further query and discovery approaches. Here, we propose a multiple step knowledge graph approach using labeled property graphs based on polyglot persistence systems to utilize context data for context mining, graph queries, knowledge discovery and extraction. We introduce the graph-theoretic foundation for a general context concept within semantic networks and show a proof-of-concept based on biomedical literature and text mining. Our test system contains a knowledge graph derived from the entirety of PubMed and SCAIView data and is enriched with text mining data and domain specific language data using BEL. Here, context is a more general concept than annotations. This dense graph has more than 71M nodes and 850M relationships. We discuss the impact of this novel approach with 27 real world use cases represented by graph queries.

研究动机与目标

  • 解决在大规模生物医学知识图谱中存储和查询上下文信息的挑战。
  • 通过采用具有更丰富结构语义的带标签属性图,克服RDF三元组存储的局限性。
  • 将多种数据源(包括PubMed元数据、文本挖掘实体和领域特定语言(BEL))整合到统一的、上下文感知的图谱中。
  • 支持复杂、上下文敏感的查询,以促进生物医学中的假设生成和知识发现。
  • 通过使用真实生物医学数据的原型系统,证明可扩展性和查询性能。

提出的方法

  • 使用PubMed元数据(如作者、关键词、期刊)作为节点和边,构建初始文档图谱。
  • 通过文本挖掘工具(如JProMiner)和本体(如MeSH)丰富图谱中的命名实体和关系。
  • 使用生物学表达语言(BEL)集成领域特定语言数据,以表示生物关系。
  • 将知识图谱存储在原生的Neo4j带标签属性图数据库中,以支持复杂遍历和子图匹配。
  • 实施多语言持久化方法,以管理可扩展性并提升异构数据源上的查询性能。
  • 将上下文定义为一个通用概念,其中任意实体(如文档、基因、作者)都可作为另一实体的上下文,支持递归和多级上下文推理。

实验结果

研究问题

  • RQ1如何系统性地将来自多样化来源(如引用、命名实体、本体)的上下文信息整合到大规模生物医学知识图谱中?
  • RQ2传统RDF三元组存储在支持生命科学中复杂、上下文感知查询方面存在哪些局限性?
  • RQ3带标签属性图模型结合多语言持久化是否能够支持可扩展、高效的复杂生物知识发现查询?
  • RQ4包含上下文元数据(如作者隶属关系、引用网络)如何提升知识抽取的准确性和深度?
  • RQ5哪些真实世界用例可以有效利用富含上下文的大规模生物医学知识图谱进行建模和查询?

主要发现

  • 该知识图谱包含超过7100万个节点和8.5亿条关系,源自PubMed和SCAIView数据,并通过文本挖掘和BEL关系进行了增强。
  • 在Neo4j中使用带标签属性图支持复杂查询(如子图匹配和中心性分析),而这些功能在RDF三元组存储中并不原生支持。
  • 图查询成功识别出与多种疾病相关的基因(如APP和TNF),证明了上下文感知发现的实用性。
  • 该系统支持27个真实世界用例,包括通过Cypher的`algo.degree`识别高中心性基因,表明其在识别关键生物因子方面的有效性。
  • 由于图谱规模庞大,部分语义查询仍存在性能瓶颈,但多语言持久化架构显示出可扩展性改进的潜力。
  • 作者消歧和OCR处理数据质量等挑战依然存在,凸显未来工作中需整合先进消歧技术的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。