Skip to main content
QUICK REVIEW

[論文レビュー] TPLinker: Single-stage Joint Extraction of Entities and Relations Through Token Pair Linking

Yucheng Wang, Bowen Yu|arXiv (Cornell University)|Oct 26, 2020
Topic Modeling参考文献 23被引用数 16
ひとこと要約

本稿では、新しいハンドシェイキングタギング方式を用いて、エンティティと関係抽出をトークンペアリンクタスクとして定式化する一括処理の共同抽出モデル、TPLinkerを提案する。逐次的依存性と露出バイアスを排除することで、NYTおよびWebNLGデータセットにおいて最先端の性能を達成し、特に重複関係や複数関係抽出において優れた性能を発揮する。

ABSTRACT

Extracting entities and relations from unstructured text has attracted increasing attention in recent years but remains challenging, due to the intrinsic difficulty in identifying overlapping relations with shared entities. Prior works show that joint learning can result in a noticeable performance gain. However, they usually involve sequential interrelated steps and suffer from the problem of exposure bias. At training time, they predict with the ground truth conditions while at inference it has to make extraction from scratch. This discrepancy leads to error accumulation. To mitigate the issue, we propose in this paper a one-stage joint extraction model, namely, TPLinker, which is capable of discovering overlapping relations sharing one or both entities while immune from the exposure bias. TPLinker formulates joint extraction as a token pair linking problem and introduces a novel handshaking tagging scheme that aligns the boundary tokens of entity pairs under each relation type. Experiment results show that TPLinker performs significantly better on overlapping and multiple relation extraction, and achieves state-of-the-art performance on two public datasets.

研究の動機と目的

  • 訓練時に正解を必要とする逐次的共同抽出モデルが推論時に完全に予測を生成する際の露出バイアス問題を解消すること。
  • 既存のモデルが困難であるとされる重複関係、特にSingleEntityOverlap(SEO)およびEntityPairOverlap(EPO)を効果的に共同抽出可能にするための手法を提供すること。
  • 段階的な予測の誤差伝搬を回避するための一括でエンドツーエンドに最適化されたフレームワークを設計すること。
  • 現実世界のテキストに見られる複数関係および複雑な重複関係パターンにおける性能向上を図ること。

提案手法

  • TPLinkerは、各関係タイプに対してエンティティ境界リンク、主語開始リンク、目的語終了リンクという3つの二値タギングタスクを関連付けることで、共同抽出をトークンペアリンク問題として定式化する。
  • エンティティ境界と関係ヘッドの正確なアラインメントを可能にするために、関係タイプごとに3つの独立したトークンリンク行列をアノテートするための新しいハンドシェイキングタギング方式を導入する。
  • モデルは一回の順伝播処理ですべてのエンティティおよび関係スパンを同時に予測し、過去の予測に依存しないため露出バイアスが軽減される。
  • デコード処理では、3つのリンク行列からの予測を組み合わせることで、自己回帰的生成を用いずに有効なエンティティペアおよび関係を抽出する。
  • TPLinkerはBERTをベースエンコーダーとして用い、トークン表現の上に線形分類器ヘッドを適用してトークンペア間のリンクスコアを予測する。
  • モデルは3つのリンク行列に対する交差エントロピー損失を用いてエンドツーエンドで訓練され、エンティティと関係予測の共同最適化が可能となる。

実験結果

リサーチクエスチョン

  • RQ1一括処理モデルは、重複関係や複数関係の抽出において、逐次的で多段階の共同抽出モデルを上回ることができるか?
  • RQ2自己回帰的でない設計によって露出バイアスを排除することで、複雑な関係パターンにおける性能にどのような影響を与えるか?
  • RQ3トークンペアリンクに基づく統一タギング方式は、エンティティと関係抽出を同時に効果的にモデル化できるか?
  • RQ4提案されたハンドシェイキングタギング方式は、EntityPairOverlap(EPO)およびSingleEntityOverlap(SEO)の状況において、どれほど性能向上をもたらすか?
  • RQ5CasRelなどの自己回帰的ベースラインと比較して、TPLinkerの効率性とスケーラビリティはどの程度か?

主な発見

  • TPLinkerは、BERTベースアーキテクチャを用いてNYTで90.1のF1スコア、WebNLGで87.9のF1スコアを達成し、両データセットで最先端の性能を示した。
  • 5つ以上の関係を含む文では、TPLinker BERTがCasRel BERTを6.3ポイント上回り(96.1対89.9 F1)、関係密度の高い複雑なケースにおいて優れた性能を発揮した。
  • WebNLG-SEOでは93.4 F1、WebNLG-EPOでは94.0 F1を達成し、重複関係パターンにおいて従来手法を大きく上回った。
  • バッチ処理下では、TPLinkerの推論速度はCasRel BERTの約3.6倍高速で、1サンプルあたり平均15.2ms(CasRel BERTは54.0ms)を記録した。
  • バッチサイズが1の場合でも、TPLinker BERTは82.7msの推論速度を維持し、効率性と実装可能性が確認された。
  • 広範なアブレーション実験から、ハンドシェイキングタギング方式が特にEPOおよびSEOの状況において重複関係をモデル化する上で極めて重要であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。