Skip to main content
QUICK REVIEW

[論文レビュー] Three Sentences Are All You Need: Local Path Enhanced Document Relation Extraction

Quzhe Huang, Shengqi Zhu|arXiv (Cornell University)|Jun 3, 2021
Topic Modeling参考文献 14被引用数 5
ひとこと要約

本稿では、文書レベルの関係抽出のための単純ながら効果的な手法を提案する。この手法は、連続する文、マルチホップの経路、またはデフォルトの経路として、最大3文の文の組み合わせ(エンティティペアを結ぶ局所的証拠経路)をヒューリスティックに選択する。これらの最小限で解釈可能な経路に限定して、BiLSTMに入力することで、DocREDで最先端の性能を達成し、複雑なグラフニューラルネットワーク(GNN)モデルを上回る。これは、明示的で人間が想起する証拠選択が、GNNにおける暗黙的なフィルタリングを上回ることを示している。

ABSTRACT

Document-level Relation Extraction (RE) is a more challenging task than sentence RE as it often requires reasoning over multiple sentences. Yet, human annotators usually use a small number of sentences to identify the relationship between a given entity pair. In this paper, we present an embarrassingly simple but effective method to heuristically select evidence sentences for document-level RE, which can be easily combined with BiLSTM to achieve good performance on benchmark datasets, even better than fancy graph neural network based methods. We have released our code at https://github.com/AndrewZhe/Three-Sentences-Are-All-You-Need.

研究の動機と目的

  • 文書レベルの関係抽出において、人間のアノテーターがエンティティペア間の関係を特定するために、どの程度の少数の文で十分であるかを調査すること。
  • 全文を用いることの非効率性を是正し、関係推論を支援する最小限で関連性のある文のサブセットを同定すること。
  • 複雑なモデルに依存せずに、人間がアノテートした支援証拠を近似できる、ヒューリスティックで解釈可能な経路選択メカニズムを設計すること。
  • 選択された経路のみを入力として与えた場合に、単純なBiLSTMモデルが、より複雑なグラフベースの手法と比較して最先端の性能を達成できるかを評価すること。

提案手法

  • 本手法は、3つのヒューリスティックなルールを定義して局所的証拠経路を抽出する:連続経路(3文以内に連続するエンティティ)、マルチホップ経路(非隣接の文をはさんでブリッジエンティティで接続されるエンティティペア)、デフォルト経路(他のルールが適用されない場合、ヘッドおよびテイルエンティティを含むすべての文ペア)。
  • 選択された経路は、GloVe-100の単語埋め込みと256の隠れ層サイズを用いたBiLSTMエンコーダーに供給される。
  • 特定のエンティティペアに対する予測を、全経路のうち最も信頼性の高い関係予測を選択することで集約する:$ P_{ij}(r) = \max_c P^c_{ij}(r) $。
  • 本手法は、グラフニューラルネットワークにおける暗黙のアテンションやメッセージパッシング機構とは対照的に、関係のない文書コンテンツを明示的にフィルタリングする。
  • 標準のF1スコアを用いて、DocRED、CDR、GDAの3つのベンチマークデータセットで評価される。
  • モデルはエンドツーエンドで訓練・評価され、シーケンスベースおよびグラフベースの最先端モデルと性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1文書レベルの関係抽出において、人間のアノテーターが2つのエンティティ間の関係を特定するために通常どの程度の文数を必要としているか?
  • RQ2単純で解釈可能な経路選択ヒューリスティックが、関係抽出のための人間がアノテートした支援証拠を効果的に近似できるか?
  • RQ3全文を使用するのではなく、関係の関連性のある少数の文を明示的に選択することで、特に軽量なモデル(例:BiLSTM)と組み合わせた場合、性能が向上するか?
  • RQ4選択された経路のみを入力として与えたBiLSTMモデルが、情報のフィルタリングを暗黙的に行うより複雑なGNNモデルを上回るか?
  • RQ5自然言語文書において、わずか数文で関係推論が可能となる背後にある言語的または認知的要因は何か?

主な発見

  • DocREDデータセットでは、95%以上の関係インスタンスが3文以内の支援文で十分であり、そのうち87%は2文以下で十分である。
  • 提案されたヒューリスティックな経路選択手法は、人間がアノテートした支援証拠の最大87.5%をカバーしており、人間のアノテーションパターンと強い整合性を示している。
  • 選択された経路のみを入力として与えたBiLSTMモデルは、テストF1スコア56.23%を達成し、同じベンチマークでベースラインのBiLSTMおよび最先端のグラフベースのモデルを上回った。
  • ベースラインのBiLSTMと比較して、開発セットにおける文内関係F1は5.68%、文間関係F1は5.62%向上した。
  • 同じ設定下で、開発セットとテストセットにおいて、最先端のグラフベースモデルと比較してそれぞれ1.25%および1.15%高いF1スコアを達成した。
  • 結果から、複雑なモデルにおける暗黙のフィルタリングよりも、明示的でルールベースの証拠選択が効果的である可能性が示され、文書レベルの関係抽出において解釈可能性と最小限の文脈の重要性が浮き彫りになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。