Skip to main content
QUICK REVIEW

[論文レビュー] Improving Biomedical Pretrained Language Models with Knowledge

Zheng Yuan, Yijia Liu|arXiv (Cornell University)|Apr 21, 2021
Topic Modeling参考文献 36被引用数 9
ひとこと要約

本稿では、テキストのみおよびテキスト-エンティティ統合符号化を用いてUMLS知識ベースからのエンティティおよび関係を統合し、エンティティ検出とリンクの共同事前学習を実施する、知識強化型の生物医学的言語モデルKeBioLMを提案する。KeBioLMはBLURBベンチマークにおけるNERおよび関係抽出タスクで最先端の性能を達成し、UMLS三項組のプローブタスクにおいても、BioBERT、ClinicalBERT、BlueBERTなどのモデルを上回る優れた知識吸収能力を示している。

ABSTRACT

Pretrained language models have shown success in many natural language processing tasks. Many works explore incorporating knowledge into language models. In the biomedical domain, experts have taken decades of effort on building large-scale knowledge bases. For example, the Unified Medical Language System (UMLS) contains millions of entities with their synonyms and defines hundreds of relations among entities. Leveraging this knowledge can benefit a variety of downstream tasks such as named entity recognition and relation extraction. To this end, we propose KeBioLM, a biomedical pretrained language model that explicitly leverages knowledge from the UMLS knowledge bases. Specifically, we extract entities from PubMed abstracts and link them to UMLS. We then train a knowledge-aware language model that firstly applies a text-only encoding layer to learn entity representation and applies a text-entity fusion encoding to aggregate entity representation. Besides, we add two training objectives as entity detection and entity linking. Experiments on the named entity recognition and relation extraction from the BLURB benchmark demonstrate the effectiveness of our approach. Further analysis on a collected probing dataset shows that our model has better ability to model medical knowledge.

研究の動機と目的

  • 大規模な生物医学的知識ベース(例:UMLS)からの構造的知識を明示的に統合することで、生物医学的事前学習言語モデルを改善すること。
  • 一般ドメインPLMがドメイン特異的医学的事実、用語、関係を捉える能力に制限を受ける問題に対処すること。
  • エンティティ検出とエンティティリンクのタスクを共同で事前学習することで、強固なエンティティ表現を学習するモデルを開発すること。
  • 知識強化型モデルが標準の生物医学的PLMよりも、関係的医学知識をよりよく捉えられるかどうかを評価すること。
  • UMLS関係三項組を用いたプローブタスクを通じて、PLMにおける医学的知識理解のベンチマークを提供すること。

提案手法

  • モデルは二重符号化アーキテクチャを採用:生テキストを処理するテキストのみの符号化層と、トークンレベルおよびエンティティレベル表現を統合するテキスト-エンティティ統合符号化層。
  • エンティティ表現は、UMLS知識グラフからのエンティティおよび関係情報を符号化するTransE埋め込みによって初期化される。
  • エンティティ検出とエンティティリンクの2つの追加事前学習目的を導入し、テキスト内でのエンティティの同定および接地能力を向上させる。
  • PubMed要約内のエンティティはScispaCyを用いてUMLSにリンクされ、350万件の文書にわたり6億6000万件のエンティティがアノテートされた。
  • プローブ評価では、マスキングされたUMLS関係三項組を用いたクローズ形式のタスクが実施され、デコードには信頼度ベース選択およびビームサーチ戦略が用いられた。
  • 評価には、マスクされたエンティティの正しいCUIを回復できる能力を測る関係レベルのマクロリcall@5が用いられた。

実験結果

リサーチクエスチョン

  • RQ1UMLSからの構造的知識を統合することで、生物医学的言語モデルの名前付きエンティティ認識および関係抽出タスクの性能が向上するか?
  • RQ2エンティティ検出とリンクの共同事前学習は、標準的な事前学習に比べて、より優れたエンティティ表現学習をもたらすか?
  • RQ3KeBioLMのような生物医学的PLMは、希少または複雑な関係に対しても、UMLSからの関係的知識をどれほど正確に捉え、活用できるか?
  • RQ4KeBioLMは、BioBERT、ClinicalBERT、BlueBERTなどの既存の生物医学的PLMと比較して、医学的知識をどのようにモデル化するか?
  • RQ5UMLS三項組に基づくプローブタスクは、モデルが生物学的医学的知識を内部化しているかどうかを効果的に測定できるか?

主な発見

  • KeBioLMはBLURBベンチマークの5つのNERデータセットで平均F1スコア87.1、3つのREデータセットで81.2を達成し、以前の手法を上回った。
  • UMLSプローブタスクでは、関係レベルのマクロリcall@5が全体で3.26を記録し、SciBERT(2.75)、ClinicalBERT(0.79)、BlueBERT(1.02)、BioBERT(層が欠落しているため直接評価不可)を顕著に上回った。
  • タイプ2クエリ(回答が入力に存在しないもの)では、KeBioLMは1.48のリcall@5を達成し、未観測または複雑な関係への一般化能力が優れていることを示した。
  • 定性的分析では、KeBioLMが同義語(例:'liver' は 'hepatic' と同義)や関係的事実(例:'vaccination may prevent tetanus')を正しく同定しており、正確な知識の接地が行われていることが示された。
  • タイプ1クエリ(24,260件)では、KeBioLMが14.01のリcall@5を達成し、文脈からの知識抽出における高い信頼性を示した。
  • ビームサーチと信頼度ベース選択を用いたマルチトークンエンティティのデコード能力は、複雑な生物医学的エンティティスパンを効果的に処理できるモデルの堅牢性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。