Skip to main content
QUICK REVIEW

[論文レビュー] BERE: An accurate distantly supervised biomedical entity relation extraction network

Lixiang Hong, Jinjian Lin|arXiv (Cornell University)|Jun 17, 2019
Topic Modeling参考文献 32被引用数 9
ひとこと要約

本論文では、Gumbel Tree-GRUを用いて文構造を捉え、共同エンベッディングを活用して関係分類を向上させる、深層学習モデルBEREを提案する。DDIExtraction 2013と新たに構築されたDTIEデータセット上で評価された結果、最先端のF1スコアと優れたPR曲線性能を達成し、リソースが限られた設定下でも精度と頑健性が向上していることが示された。

ABSTRACT

Automated entity relation extraction (RE) from literature provides an important source for constructing biomedical database, which is more efficient and extensible than manual curation. However, existing RE models usually ignore the information contained in sentence structures and target entities. In this paper, we propose BERE, a deep learning based model which uses Gumbel Tree-GRU to learn sentence structures and joint embedding to incorporate entity information. It also employs word-level attention for improved relation extraction and sentence-level attention to suit the distantly supervised dataset. Because the existing dataset are relatively small, we further construct a much larger drug-target interaction extraction (DTIE) dataset by distant supervision. Experiments conducted on both DDIExtraction 2013 task and DTIE dataset show our model's effectiveness over state-of-the-art baselines in terms of F1 measures and PR curves.

研究の動機と目的

  • 既存の関係抽出モデルが、バイオメディカルテキストにおける文構造やターゲットエンティティ情報の活用を十分に行っていないという限界を是正すること。
  • 弱教師付き関係抽出における性能向上を図ること。弱教師付き学習はノイズの多い学習信号と限られたラベル付きデータをもたらすため、その影響を軽減する必要がある。
  • 遠隔教師付き学習を用いて、より大規模で高品質な薬物-標的相互作用抽出(DTIE)データセットを構築すること。これにより、より頑健なモデルの訓練と評価が可能になる。
  • 単語レベルと文レベルのアテンションメカニズムを効果的に統合し、特徴表現と関係分類の精度を向上させるモデルの開発

提案手法

  • 微分可能な木操作を通じて依存木を学習することで、階層的な文構造をGumbel Tree-GRUでモデル化する。
  • エンティティペアの共同埋め込みを統合し、エンティティ固有の文脈と意味情報を表現に強化する。
  • 単語レベルのアテンションを適用し、関係に関連する語に注目することで、特徴選択を改善する。
  • 文レベルのアテンションを用いて、遠隔教師付きデータに内在するノイズを処理し、より情報量の多い文に重みを付ける。
  • BEREモデルをDDIExtraction 2013データセットおよび新たに構築されたDTIEデータセット上でエンドツーエンドで学習させ、汎化性能を向上させる。
  • 遠隔教師付き学習を活用して、高価な手動アノテーションに依存せずに大規模な学習データを自動生成する。

実験結果

リサーチクエスチョン

  • RQ1文構造とエンティティ情報の統合的符号化が、遠隔教師付きバイオメディカル関係抽出においてより優れた性能を達成できるか?
  • RQ2標準的なRNNや自己アテンションと比較して、Gumbel Tree-GRUはリソースが限られたバイオメディカル設定下で構文的依存関係をどれほど効果的にモデル化できるか?
  • RQ3単語レベルと文レベルのアテンションを組み込むことで、ノイズが多く弱教師付きのデータセット上での関係分類精度はどの程度向上するか?
  • RQ4新たに構築されたDTIEデータセットは、既存のベンチマークデータセットと比較して、モデルの汎化性能と性能向上に寄与するか?

主な発見

  • BEREはDDIExtraction 2013ベンチマークで最先端のF1スコアを達成し、関係抽出の精度において既存手法を上回った。
  • モデルはPR曲線において優れた性能を示し、リソースが限られたノイズの多い環境下でも、適合率と再現率のトレードオフが良好であることが示された。
  • Gumbel Tree-GRUの統合により、構文的構造のモデル化が顕著に向上し、関係分類性能の向上に寄与した。
  • 共同エンティティ埋め込みとマルチレベルアテンション機構は、遠隔教師付きデータにおけるノイズ低減と特徴表現の向上に効果を発揮した。
  • 新たに構築されたDTIEデータセットは、より頑健な評価と訓練を可能にし、多様なバイオメディカル関係にわたるモデルの汎化を支援した。
  • 実験により、BEREは訓練データが限られた状況下でも高い性能を維持することが確認され、リソースが限られたシナリオにおける有効性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。