Skip to main content
QUICK REVIEW

[論文レビュー] Scientific Language Models for Biomedical Knowledge Base Completion: An Empirical Study

Rahul Nadkarni, David Wadden|arXiv (Cornell University)|Jun 17, 2021
Topic Modeling参考文献 39被引用数 13
ひとこと要約

本稿では、科学的言語モデル(LM)と知識グラフ埋め込み(KGE)モデルを統合し、動的に入力に応じてLMとKGEの予測を切り替える学習可能なルーターを用いて、生物医学的知識ベース補完を実現する手法を提案する。このアプローチは、ベースライン比で13–36%の相対的MRR向上を達成し、未学習の科学的エンティティに対しても優れた一般化性能を示し、薬剤-疾患リンク予測におけるテキストとグラフのモダリティの相補的強みを浮き彫りにしている。

ABSTRACT

Biomedical knowledge graphs (KGs) hold rich information on entities such as diseases, drugs, and genes. Predicting missing links in these graphs can boost many important applications, such as drug design and repurposing. Recent work has shown that general-domain language models (LMs) can serve as "soft" KGs, and that they can be fine-tuned for the task of KG completion. In this work, we study scientific LMs for KG completion, exploring whether we can tap into their latent knowledge to enhance biomedical link prediction. We evaluate several domain-specific LMs, fine-tuning them on datasets centered on drugs and diseases that we represent as KGs and enrich with textual entity descriptions. We integrate the LM-based models with KG embedding models, using a router method that learns to assign each input example to either type of model and provides a substantial boost in performance. Finally, we demonstrate the advantage of LM models in the inductive setting with novel scientific entities. Our datasets and code are made publicly available.

研究の動機と目的

  • ドメイン特化型の科学的言語モデルが、生物医学的知識グラフ補完を向上させられるかどうかを調査すること。
  • 言語モデルと知識グラフ埋め込みモデルの相補的強みが、薬剤-疾患KGにおける欠落リンク予測においてどのように発揮されるかを評価すること。
  • LMとKGEの予測を切り替えるルーターに基づく統合手法を開発・評価し、性能を向上させること。
  • トレーニング時に未観測のエンティティを含むインダクティブな設定において、LMの有用性を示すこと。
  • 再現可能性と今後の生物医学的KG補完分野の研究を支援するため、データセットとコードを公開すること。

提案手法

  • 科学的KGにテキストによるエンティティ記述を追加し、そのKG上でドメイン特化型の科学的言語モデル(例:PubMedBERT、BioBERT)を微調整する。
  • 同じKG上で知識グラフ埋め込みモデル(例:ComplEx、DKRL)を学習させ、構造的表現を獲得する。
  • 入力特徴に基づいて、各入力トリプルをLMまたはKGEモデルに割り当てる学習可能なルーターを実装し、予測精度を向上させる。
  • 固定または微調整済みのLMを用いた最近傍探索戦略により、KGEモデル内の未学習エンティティの埋め込みを置き換えることで、誘導的推論を可能にする。
  • 両モダリティの予測をルーティングにより統合し、単純な平均化や早期統合よりも優れた性能を達成する。
  • 薬剤と疾患に焦点を当てた3つの生物医学的KGを構築し、科学文献からの記述をエンティティに追加する。

実験結果

リサーチクエスチョン

  • RQ1科学的言語モデルは、知識ベース補完のために、埋め込まれた生物医学的知識を効果的に捉え、活用できるか?
  • RQ2言語モデルの予測は、予測の強度と一般化性能の観点から、知識グラフ埋め込みモデルと相補的であるか?
  • RQ3LMとKGEの予測を切り替える学習可能なルーターは、固定されたアンサンブル戦略を上回る性能を示せるか?
  • RQ4言語モデルは、トレーニング時に未観測であった新規の生物医学的エンティティに対して、どの程度一般化するか?
  • RQ5エンティティ記述とテキストの多様性は、リンク予測性能の向上にどのような役割を果たすか?

主な発見

  • ルーターに基づく言語モデルと知識グラフ埋め込みの統合は、3つの生物医学的KGにおいて、平均逆順位(MRR)で13–36%の相対的向上を達成した。
  • 微調整済みのPubMedBERT(KG-PubMedBERT)は、DKRLなどの一般KGEモデルを上回り、Hetionetでは21%の相対的MRR向上、RepoDBでは2倍以上の向上を達成した。
  • 固定されたPubMedBERTを用いた最近傍探索戦略により未学習エンティティの埋め込みを置き換えることで、DKRLと同等またはそれ以上の結果が得られ、LMが誘導的リンク予測において有効であることを示した。
  • 本手法はRepoDB(MRR 38.8)とHetionet(MRR 21.6)で優れた性能を発揮し、H@3およびH@10の指標でも顕著な向上を示した。
  • 名前が複雑または直感的でないエンティティ(例:P2RY14)に対して、言語モデルは優れた性能を示し、テキスト記述のおかげで曖昧さが解消され、予測精度が向上した。
  • ルーターモデルは、LMとKGE予測の単純平均化よりも優れた性能を示しており、固定された統合よりも動的選択のほうが効果的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。