Skip to main content
QUICK REVIEW

[論文レビュー] An Information Extraction and Knowledge Graph Platform for Accelerating Biochemical Discoveries

Matteo Manica, Christoph Auer|arXiv (Cornell University)|Jul 19, 2019
Biomedical Text Mining and Ontologies参考文献 14被引用数 8
ひとこと要約

本論文では、NLPおよびグラフ分析を用いて構造化された生化学データベースと非構造化された科学文献(PDF)を統合するスケーラブルな知識グラフプラットフォーム、BCKGを提示する。10以上のデータベースからのデータ正規化とクラウドネイティブパイプラインを介したテキストおよび表からの事実抽出により、BCKGは複雑なクエリを可能にし、これまでにリストにない酵素候補(例:トリアゾールホスファターゼとしてのTPP1)を同定するなど、システム生物学における偶然の発見を促進する力を示している。

ABSTRACT

Information extraction and data mining in biochemical literature is a daunting task that demands resource-intensive computation and appropriate means to scale knowledge ingestion. Being able to leverage this immense source of technical information helps to drastically reduce costs and time to solution in multiple application fields from food safety to pharmaceutics. We present a scalable document ingestion system that integrates data from databases and publications (in PDF format) in a biochemistry knowledge graph (BCKG). The BCKG is a comprehensive source of knowledge that can be queried to retrieve known biochemical facts and to generate novel insights. After describing the knowledge ingestion framework, we showcase an application of our system in the field of carbohydrate enzymes. The BCKG represents a way to scale knowledge ingestion and automatically exploit prior knowledge to accelerate discovery in biochemical sciences.

研究の動機と目的

  • 分離されたデータベースや非構造化文献に格納された散在的かつ未活用の生化学的知識の課題に対処すること。
  • 多様なデータソースを統一し、単一で照会可能な知識グラフに変換する、スケーラブルでクラウドネイティブなプラットフォームの開発。
  • エンティティおよび事実の自動的大規模抽出を可能にするNLP技術を用いて、科学的PDFからの情報抽出を実現すること。
  • トリアゾールを合成する酵素など、産業的関連性を持つ、これまで報告のない新規酵素の同定におけるプラットフォームの有効性を示すこと。
  • グラフベースの分析と複雑なクエリワークフローを可能にすることで、生化学的発見を加速し、偶然のインサイト生成を促進すること。

提案手法

  • 標準化されたキーを用いた正規化されたJSON表現を用いて、10以上の生化学データベース(例:UniProt, CAZy, KEGG, PubChem)からの構造化データを統合。
  • 科学的論文やハンドブックなどの非構造化PDFを、コロナコンバージョンサービス(CCS)を介して処理し、テキスト、表、メタデータを構造化されたJSON形式に抽出。
  • テキストおよび表全体にわたる生化学的エンティティ(例:遺伝子、タンパク質、EC番号)を同定するための名前付きエンティティ認識(NER)を適用。
  • エンティティ間の関係(例:酵素-基質、酵素-生物)を同定するための事実抽出(FE)を実施。
  • 共起性および意味的正規化を用いて、データベースと文献間のエンティティおよび事実をリンクすることで、統一された知識グラフを構築。
  • グラフ走査、中心性分析、インサイト生成を可能にする、DAGベースのクエリエンジンを実装。

実験結果

リサーチクエスチョン

  • RQ1スケーラブルでクラウドネイティブなプラットフォームは、多様な生化学データベースと非構造化科学文献を、単一で照会可能な知識グラフに効果的に統合できるか?
  • RQ2NERやFEなどのNLP技術を、スキャンされたPDFや科学的テキストから、実行可能な生化学的事実を抽出するためにどのように適用できるか?
  • RQ3グラフベースの分析は、CAZyのような既存のデータベースに記載のない、新規の未報告酵素候補をどの程度効果的に同定できるか?
  • RQ4プラットフォームは、生化学的発見における「偶然の発見のための計画」を可能にする複雑なマルチステップクエリをサポートできるか?
  • RQ5知識グラフは、トリアゾールのような高付加価値炭水化物の合成に関与する酵素の特定をどの程度効果的に加速できるか?

主な発見

  • BCKGプラットフォームは、10以上の構造化データベースおよび1000以上の科学的文書からのデータ統合を実施し、約600万ノードおよび6100万エッジを有する知識グラフを構築した。
  • プラットフォームは、イネ由来の可能性のあるトリアゾールホスファターゼとしてのTPP1が、CAZyデータベースにまだ登録されていない新規酵素であることを同定した。
  • システムは、マイコバクテリウム・チラエルスのトリアゾール2-硫酸転移酵素であるstf0が、CAZyに以前報告されていなかった酵素候補として同定された。
  • DAGベースのクエリエンジンにより、グラフ走査とフィルタリングを組み合わせた複雑なマルチステップワークフローが可能となり、まれなまたは見過ごされがちな生化学的関係が同定された。
  • NERおよびFEを用いた文献由来の事実統合により、キュレートされたデータベースのみに依存する場合よりも、既知の酵素機能のカバレッジが顕著に拡大された。
  • プラットフォームは、特に炭水化物代謝の文脈において、生化学的ネットワークの体系的探索を可能にすることで、新規のインサイトを生成する能力を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。