Skip to main content
QUICK REVIEW

[論文レビュー] Towards context in large scale biomedical knowledge graphs

Jens Dörpinghaus, Andreas Stefan|arXiv (Cornell University)|Jan 23, 2020
Scientific Computing and Data Management参考文献 39被引用数 10
ひとこと要約

本論文では、PubMed および SCAIView から得られる大規模な生物医学的知識グラフに、引用情報、固有表現、BEL 関係などの文脈的情報を統合するため、Neo4j におけるラベル付きプロパティグラフを用いた多言語永続化アーキテクチャを提案する。得られたグラフは 7100 万以上のノードと 8.5 億以上の関係を含み、複雑なクエリを可能にし、知識発見を支援する。27 件の実世界のユースケースが、文脈的な生物学的研究における有用性を示している。

ABSTRACT

Contextual information is widely considered for NLP and knowledge discovery in life sciences since it highly influences the exact meaning of natural language. The scientific challenge is not only to extract such context data, but also to store this data for further query and discovery approaches. Here, we propose a multiple step knowledge graph approach using labeled property graphs based on polyglot persistence systems to utilize context data for context mining, graph queries, knowledge discovery and extraction. We introduce the graph-theoretic foundation for a general context concept within semantic networks and show a proof-of-concept based on biomedical literature and text mining. Our test system contains a knowledge graph derived from the entirety of PubMed and SCAIView data and is enriched with text mining data and domain specific language data using BEL. Here, context is a more general concept than annotations. This dense graph has more than 71M nodes and 850M relationships. We discuss the impact of this novel approach with 27 real world use cases represented by graph queries.

研究の動機と目的

  • 大規模な生物医学的知識グラフにおける文脈的情報の格納およびクエリ処理の課題に対処すること。
  • RDF 三元組ストアの制限を克服するため、より豊かな構造的意味論を有するラベル付きプロパティグラフを採用すること。
  • PubMed のメタデータ、テキストマイニングで抽出されたエンティティ、ドメイン固有の言語(BEL)を含む多様なデータソースを統合し、統一的かつ文脈に配慮したグラフを構築すること。
  • 仮説生成および生物医学分野における知識発見のための複雑な文脈に依存するクエリを可能にすること。
  • 実世界の生物医学データを用いたプロトタイプシステムを通じて、スケーラビリティおよびクエリパフォーマンスを実証すること。

提案手法

  • PubMed のメタデータ(例:著者、キーワード、ジャーナル)をノードおよびエッジとして用い、初期のドキュメントグラフを構築する。
  • テキストマイニングツール(例:JProMiner)およびオントロジー(例:MeSH)を用いて、固有表現および関係をグラフに拡張する。
  • 生物学的関係を表現するために、生物学的表現言語(BEL)を用いてドメイン固有の言語データを統合する。
  • 複雑なトラバーサルおよびサブグラフマッチングをサポートするため、Neo4j ネイティブのラベル付きプロパティグラフデータベースに知識グラフを格納する。
  • 異種のデータソース間でのスケーラビリティとクエリパフォーマンスの向上を図るために、多様な永続化アプローチを実装する。
  • 文脈を一般化された概念として定義し、任意のエンティティ(例:ドキュメント、遺伝子、著者)が他のエンティティの文脈として機能できることを可能にし、再帰的かつ多次元の文脈的推論を可能にする。

実験結果

リサーチクエスチョン

  • RQ1引用情報、固有表現、オントロジーなどの多様なソースからの文脈的情報を、大規模な生物医学的知識グラフに体系的に統合する方法は何か?
  • RQ2従来の RDF 三元組ストアは、生命科学分野における複雑な文脈に配慮したクエリをサポートする上で、どのような制限を抱えているか?
  • RQ3多様な永続化アーキテクチャを備えたラベル付きプロパティグラフモデルは、スケーラブルかつ効率的な複雑な生物学的知識発見のクエリをサポートできるか?
  • RQ4著者所属情報や引用ネットワークなどの文脈的メタデータの統合は、知識抽出の正確性および深さをどのように向上させるか?
  • RQ5文脈に富んだ大規模な生物医学的知識グラフを用いて、効果的にモデル化およびクエリ可能な実世界のユースケースは何か?

主な発見

  • 知識グラフは、PubMed および SCAIView のデータにテキストマイニングおよび BEL 関係を統合することで、7100 万以上のノードと 8.5 億以上の関係を含む。
  • Neo4j におけるラベル付きプロパティグラフの使用により、RDF 三元組ストアではネイティブにサポートされていないような複雑なクエリ(例:サブグラフマッチング、中心性分析)が可能になった。
  • グラフクエリは、複数の疾患に関連する遺伝子(例:APP および TNF)を効果的に同定した。これは、文脈に配慮した発見の有用性を示している。
  • システムは 27 件の実世界のユースケースをサポートしており、Cypher の `algo.degree` を用いた高次数中心性遺伝子の同定など、主要な生物学的プレイヤーを特定するのに有効である。
  • グラフの規模の影響により一部の意味的クエリでパフォーマンスボトルネックが生じているが、多様な永続化アーキテクチャはスケーラビリティの向上に期待が持てる。
  • 著者の一意特定の困難さや OCR 処理済みデータの品質問題は依然として課題であり、今後の作業において高度な一意特定技術の統合が求められる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。