Skip to main content
QUICK REVIEW

[論文レビュー] Supporting Medical Relation Extraction via Causality-Pruned Semantic Dependency Forest

Yifan Jin, Jiangmeng Li|arXiv (Cornell University)|Aug 29, 2022
Topic Modeling被引用数 9
ひとこと要約

本稿では、外部パーサーの句構造情報とマルチヘッドアテンションベースの意味表現を統合することで、因果関係に基づくエッジの刈り込みを施した意味的依存木フォレストを構築する新規手法CP-GCNを提案する。タスク固有の因果説明モデルを、Granger因果に基づく説明データセット上で学習させ、不要なエッジを刈り込むことで、グラフ畳み込みネットワークがより頑健な表現を学習可能となる。CP-GCNは、PGRベンチマークで92.9のF1スコアを達成し、最先端性能を実現した。

ABSTRACT

Medical Relation Extraction (MRE) task aims to extract relations between entities in medical texts. Traditional relation extraction methods achieve impressive success by exploring the syntactic information, e.g., dependency tree. However, the quality of the 1-best dependency tree for medical texts produced by an out-of-domain parser is relatively limited so that the performance of medical relation extraction method may degenerate. To this end, we propose a method to jointly model semantic and syntactic information from medical texts based on causal explanation theory. We generate dependency forests consisting of the semantic-embedded 1-best dependency tree. Then, a task-specific causal explainer is adopted to prune the dependency forests, which are further fed into a designed graph convolutional network to learn the corresponding representation for downstream task. Empirically, the various comparisons on benchmark medical datasets demonstrate the effectiveness of our model.

研究の動機と目的

  • 外部ドメインのパーサーが生成する低品質な1-best依存木による医療関係抽出(MRE)性能の低下を是正すること。
  • パーサー固有のバイアスに依存せずに、医療テキストにおける構文的および意味的情報を偏りなく統合的にモデリングすること。
  • 因果説明理論を用いて、タスクに不要なエッジを同定・削除することで、モデルの頑健性と解釈可能性を向上させること。
  • 新規な因果駆動型刈り込み機構を用いて、ベンチマークMREデータセットで最先端の性能を達成すること。

提案手法

  • 外部パーサーが生成する1-best依存木と、マルチヘッドアテンションベースの意味表現を統合して依存木フォレストを構築し、構文的および意味的情報を豊かにする。
  • タスク固有の因果説明モデルを、Granger因果に基づく説明データセット上で学習させ、MRE性能に因果的に関連するエッジを同定する。
  • 説明モデルが割り当てた因果重みに基づいて依存木フォレストを刈り込み、関係予測タスクに不要とされるエッジを削除する。
  • 刈り込まれた依存木フォレストを、関係分類のための文脈に適した表現を学習する専用のグラフ畳み込みネットワーク(DCGCN)で符号化する。
  • フォレスト構築段階で、構文的および意味的情報の統合を動的にバランスさせるスイッチゲート機構を導入する。
  • フォレスト生成プロセスを通じてキルホフの行列-木定理を暗黙的に活用し、妥当な依存構造の網羅性と構造的多様性を確保する。

実験結果

リサーチクエスチョン

  • RQ1依存木フォレストにおける構文的および意味的情報を統合的にモデリングすることで、1つの1-best木に依存するのではなく、医療関係抽出の性能が向上するか?
  • RQ2タスク固有の因果説明モデルを用いた刈り込みによって、刈り込みなしまたはヒューリスティックに刈り込んだフォレストよりも性能が向上するか?
  • RQ3提案された因果刈り込み機構は、複雑な医療文におけるノイズや不要な構文的接続をどれほど効果的にフィルタリングできるか?
  • RQ4従来手法と比較して、長文や複雑な医療文における性能をどの程度維持できるか?

主な発見

  • CP-GCNは、PGRベンチマークデータセットで92.9の最先端F1スコアを達成し、AC-GCN(92.4)やLF-GCN(91.9)といった先行手法を上回った。
  • CPRデータセットではF1スコア67.3を達成し、医療テキストの複雑さを考慮しても、文単位の関係抽出において強力な性能を示した。
  • アブレーションスタディの結果、タスク固有の因果刈り込みモジュールを削除するとF1スコアが65.7に低下し、ノイズのフィルタリングとモデル一般化の向上におけるその重要性が示された。
  • すべての文長グループですべてのベースラインを上回ったが、特に長文(50トークン以上)において顕著な改善が見られ、長距離依存関係の捉え込み能力が優れていることが示された。
  • 事例スタディにより、因果説明モデルが『induced』と『feature』の間の重要な意味的および構文的リンクを効果的に保持しており、正しい関係予測を支援していることが確認された。
  • 意味表現モジュールを削除するとF1スコアが66.7に低下し、強化された意味表現がモデル性能に有意義に寄与していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。