Skip to main content
QUICK REVIEW

[論文レビュー] Attending to All Mention Pairs for Full Abstract Biological Relation Extraction

Patrick Verga, Emma Strubell|arXiv (Cornell University)|Oct 23, 2017
Topic Modeling被引用数 8
ひとこと要約

本稿では、自己注意機構と二重アフィンスコアリングを用いて、全生物医学的要約文書内のすべてのメンションペア間の関係を同時に予測するニューラルモデルであるBi-アフィン関係注意ネットワーク(BRAN)を提案する。外部知識ベースを用いずにBiocreative V CDRデータセットで最先端の性能を達成した。モデルは、共同エンティティ認識と弱教師付きデータを活用し、スパarsなメンションレベルのアノテーションからのノイズを低減する文書レベルのマルチインスタンス学習を用いることで一般化性能を向上させる。

ABSTRACT

Most work in relation extraction forms a prediction by looking at a short span of text within a single sentence containing a single entity pair mention. However, many relation types, particularly in biomedical text, are expressed across sentences or require a large context to disambiguate. We propose a model to consider all mention and entity pairs simultaneously in order to make a prediction. We encode full paper abstracts using an efficient self-attention encoder and form pairwise predictions between all mentions with a bi-affine operation. An entity-pair wise pooling aggregates mention pair scores to make a final prediction while alleviating training noise by performing within document multi-instance learning. We improve our model's performance by jointly training the model to predict named entities and adding an additional corpus of weakly labeled data. We demonstrate our model's effectiveness by achieving the state of the art on the Biocreative V Chemical Disease Relation dataset for models without KB resources, outperforming ensembles of models which use hand-crafted features and additional linguistic resources.

研究の動機と目的

  • 既存の関係抽出モデルが単一文、単一エンティティペアのスパンに限定されているという限界に対処すること。これは、生物医学的テキストに一般的な文間関係を捉えるのには不十分である。
  • 文書内に存在するすべてのメンションペアを同時にモデル化することで、生物テキストにおける関係抽出を向上させ、長距離の文脈認識を可能にすること。
  • スパarsなメンションレベルのアノテーションからのトレーニングノイズを低減するために、文書レベルのマルチインスタンス学習を適用すること。
  • 外部知識ベースや手作業で作成された言語的特徴に依存せずに、Biocreative V CDRデータセットで最先端の性能を達成すること。

提案手法

  • モデルは、サブワードトークンを扱えるようにするため、バイトペアエンコーディング(BPE)を用いたTransformerベースの自己注意エンコーダーを採用している。これにより、希少または未知語の生物用語に対しても頑健に対応できる。
  • 各トークンは、マルチレイヤーパーセプトロン(MLP)を介して別個のヘッドおよびテール表現に変換され、関係固有の重み行列を用いた二重アフィン演算により、ペairワイズの関係スコアが計算される。
  • LogSumExpプーリング操作により、同じエンティティペアに属するすべてのメンションペアのスコアが集約され、関係タイプごとの最終的なエンティティレベル予測が得られる。
  • 名前付きエンティティ認識(NER)と関係抽出を同時に学習することで、共有された文脈表現を通じて全体の性能を向上させる。
  • 追加のコーパスから得られる弱教師付きラベルデータをトレーニング中に統合することで、完全にアノテートされたデータへの依存を減らし、一般化性能を向上させる。
  • 文書レベルでのマルチインスタンス学習が適用され、文書内に少なくとも1つの正例メンションペアが存在する場合、そのエンティティペアの予測を正例とみなす。これにより、欠落したメンションレベルのアノテーションに起因するノイズが軽減される。

実験結果

リサーチクエスチョン

  • RQ1全要約文書内のすべてのメンションペアを同時に考慮するニューラルモデルが、孤立した文レベルのスパンに焦点を当てたモデルよりも、生物関係抽出で優れた性能を発揮できるか?
  • RQ2BPEトークン化を用いた全要約文書における自己注意機構は、生物医学的テキストの文間関係をどれほど効果的に捉えられるか?
  • RQ3名前付きエンティティ認識と関係抽出を同時に学習することで、リソースが限られた関係抽出タスクの性能はどの程度向上するか?
  • RQ4文書レベルでのマルチインスタンス学習は、生物医学的関係抽出におけるノイズや不完全なメンションレベルのアノテーションの影響をどの程度軽減できるか?

主な発見

  • BRANモデルは、外部知識ベースを用いないモデルの中で、Biocreative V CDRデータセットで62.1%のF1スコアを達成し、新たな最先端性能を記録した。
  • 手作業で作成された特徴や言語的リソースを用いたアンサンブルモデルよりも優れた性能を示し、完全な文脈を考慮するエンドツーエンドのニューラルモデルが、従来の特徴豊富なアプローチを凌駕できることを示した。
  • アブレーションスタディの結果、NERの監視を除去するとF1スコアは7.0ポイント低下(62.1% → 55.5%)し、共同エンティティ認識の重要性が浮き彫りになった。
  • 追加の弱教師付きデータを用いることで、F1スコアは62.1%から68.4%に上昇し、弱教師付き学習がモデルの一般化性能を顕著に向上させることを示した。
  • 幅5の畳み込み層を除去するとF1スコアは55.7%に低下し、局所的な畳み込み特徴が性能に有意義に寄与していることが示された。
  • 10,000語のBPE語彙を用いて学習した場合のF1スコアは66.2%であり、2,500語の語彙を用いた場合の62.1%よりも高い。語彙サイズが性能に影響を与えることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。