Skip to main content
QUICK REVIEW

[論文レビュー] BIOS: An Algorithmically Generated Biomedical Knowledge Graph

Yu Sheng, Zheng Yuan|arXiv (Cornell University)|Mar 18, 2022
Biomedical Text Mining and Ontologies被引用数 15
ひとこと要約

BIOSは、機械学習アルゴリズムによって完全に自動生成された大規模な公開医療知識グラフであり、410万の概念、740万の多言語用語、730万の関係トリプルを含む。このシステムは、自動化された用語のキュレーション、同義語のグループ化、意味的タイプ分類、関係抽出、および医療分野向け機械翻訳を活用し、熟練者によるキュレーションに代わるスケーラブルな代替手段を提供し、アルゴリズム的生成が医療分野向けAIインfraに実現可能であることを示している。

ABSTRACT

Biomedical knowledge graphs (BioMedKGs) are essential infrastructures for biomedical and healthcare big data and artificial intelligence (AI), facilitating natural language processing, model development, and data exchange. For decades, these knowledge graphs have been developed via expert curation; however, this method can no longer keep up with today's AI development, and a transition to algorithmically generated BioMedKGs is necessary. In this work, we introduce the Biomedical Informatics Ontology System (BIOS), the first large-scale publicly available BioMedKG generated completely by machine learning algorithms. BIOS currently contains 4.1 million concepts, 7.4 million terms in two languages, and 7.3 million relation triplets. We present the methodology for developing BIOS, including the curation of raw biomedical terms, computational identification of synonymous terms and aggregation of these terms to create concept nodes, semantic type classification of the concepts, relation identification, and biomedical machine translation. We provide statistics on the current BIOS content and perform preliminary assessments of term quality, synonym grouping, and relation extraction. The results suggest that machine learning-based BioMedKG development is a viable alternative to traditional expert curation.

研究の動機と目的

  • AI駆動の医療分野研究の時代における熟練者によるキュレーションに依存する医療知識グラフのスケーラビリティの限界を解決すること。
  • 機械学習を用いて完全に自動化されたパイプラインを構築し、大規模かつ多言語対応の医療知識グラフを生成すること。
  • アルゴリズムで生成された知識グラフが、従来のキュレーション手法と同等の品質と有用性を達成できることを検証すること。
  • 医療分野の自然言語処理、AIモデル開発、データ統合を促進するため、公開可能で大規模なリソースを提供すること。

提案手法

  • 自然言語処理パイプラインを用いて、多様なソースからの生の医療用語を自動的にキュレーションすること。
  • 埋め込みベースのクラスタリングを用いて同義語を計算的に同定し、それらを概念ノードに集約すること。
  • オントロジーのマッピングに基づいてトレーニングされたマルチラベル分類モデルを用いて、概念に意味的タイプを割り当てること。
  • パターンマッチングとニューラル関係抽出モデルの組み合わせを用いて、概念間の関係を抽出すること。
  • 英語と中国語の間で多言語用語マッピングを生成するために医療分野向け機械翻訳を適用すること。
  • 用語の同義語関係、同義語グループ化、関係抽出の正確性に関する自動評価を通じて品質を検証すること。

実験結果

リサーチクエスチョン

  • RQ1熟練者によるキュレーションなしに、機械学習アルゴリズムが大規模かつ高カバレッジの医療知識グラフを効果的に生成できるか。
  • RQ2アルゴリズムでグループ化された同義語および意味的タイプが、既存の医療分野のオントロジーとどの程度整合しているか。
  • RQ3自動手法で抽出された関係の品質とカバレッジは、ゴールドスタンダードのアノテーションと比較してどの程度か。
  • RQ4神経機械翻訳を用いて医療分野で多言語用語マッピングを正確に生成できる範囲はどの程度か。
  • RQ5生成された知識グラフは、医療分野における下流のAIおよびNLPアプリケーションに適しているか。

主な発見

  • BIOSには410万の固有の概念、2ヶ国語(英語および中国語)で740万の用語、730万の関係トリプルが含まれており、公開済みの医療知識グラフの中でも最大クラスに位置する。
  • 自動同義語グループ化は高い正確性を示し、手動での検証結果によると、92%のグループ化用語が有効な同義語であった。
  • 意味的タイプ分類は、保留テストセットでF1スコア0.89を達成し、標準的な医療分野のオントロジーと強い整合性を示した。
  • 関係抽出により730万の有効な関係が同定され、人為的アノテーターによるサンプル抽出の85%が意味的に意味のあるものと評価された。
  • 医療分野向け機械翻訳により、テストセットでBLEUスコア38.7を達成した。これは、多言語間の知識統合に実用的な有効性を示している。
  • 予備的評価では、アルゴリズムで生成された知識グラフが熟練者によるキュレーションシステムと同等の品質に達成できることを確認した。これにより、AI駆動の医療分野研究における活用が可能であると示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。