Skip to main content
QUICK REVIEW

[論文レビュー] Exploiting Entity BIO Tag Embeddings and Multi-task Learning for Relation Extraction with Imbalanced Data

Wei Ye, Bo Li|arXiv (Cornell University)|Jun 21, 2019
Topic Modeling参考文献 31被引用数 5
ひとこと要約

本稿では、関係抽出におけるデータの不均衡問題に対処するため、交差エントロピー損失を用いた関係特定(2値分類)とランク付け損失を用いた関係分類(多クラス分類)を同時に学習するマルチタスク学習フレームワークを提案する。さらに、命名抽出タスクから学習した文字レベルおよび語彙レベルのBIOタグ埋め込みを入力表現に組み込むことで、ACE 2005の中国語および英語データセットにおいてベースラインモデル比で10%以上の絶対的F1スコア向上を達成した。

ABSTRACT

In practical scenario, relation extraction needs to first identify entity pairs that have relation and then assign a correct relation class. However, the number of non-relation entity pairs in context (negative instances) usually far exceeds the others (positive instances), which negatively affects a model's performance. To mitigate this problem, we propose a multi-task architecture which jointly trains a model to perform relation identification with cross-entropy loss and relation classification with ranking loss. Meanwhile, we observe that a sentence may have multiple entities and relation mentions, and the patterns in which the entities appear in a sentence may contain useful semantic information that can be utilized to distinguish between positive and negative instances. Thus we further incorporate the embeddings of character-wise/word-wise BIO tag from the named entity recognition task into character/word embeddings to enrich the input representation. Experiment results show that our proposed approach can significantly improve the performance of a baseline model with more than 10% absolute increase in F1-score, and outperform the state-of-the-art models on ACE 2005 Chinese and English corpus. Moreover, BIO tag embeddings are particularly effective and can be used to improve other models as well.

研究の動機と目的

  • 関係抽出における極端なクラス不均衡問題に取り組むこと、特に否定的(非関係)インスタンスが肯定的インスタンスを大幅に上回る状況を想定する。
  • 関係特定と関係分類の共同学習フレームワークを導入することで、不均衡データに対するモデルの汎化性能とロバスト性を向上させる。
  • エンティティメンチョンの系列における構造的パターン(BIOタグ埋め込みで捉えたもの)を活用し、入力表現を豊かにすることで、肯定的および否定的インスタンスの区別を高める。
  • BIOタグ埋め込みが、異なるモデルに一般化可能な特徴として有効であることを実証する。

提案手法

  • 関係特定(2値分類)に交差エントロピー損失、関係分類にランク付け損失を用いたマルチタスクモデルを同時に学習する。
  • 別個のNERタスクから学習した文字単位および語彙単位のBIOタグ埋め込みを、関係抽出モデルの入力埋め込みに統合する。
  • CNNやRNNベースの深層ニューラルネットワークアーキテクチャを用いて文を符号化し、両タスクに共有層を設けることで知識の転送を実現する。
  • 関係分類ヘッドにペairワイズランク付け損失を適用し、多数の否定的インスタンスに対するモデルの感受性を低減する。
  • ACE 2005データセット上で、中国語および英語のコーパスを用いてエンドツーエンドでモデルをファインチューニングする。
  • アテンションメカニズムおよび位置埋め込みを用いて、長距離依存関係および相対的なエンティティ位置のモデリングを向上させる。

実験結果

リサーチクエスチョン

  • RQ1関係特定と関係分類の共同学習は、関係抽出におけるデータ不均衡に起因する性能低下を緩和できるか?
  • RQ2命名抽出タスクから得たBIOタグ埋め込みの導入は、関係抽出性能の向上にどの程度有効か?
  • RQ3不均衡な設定下で、関係分類にランク付け損失を用いることで、交差エントロピー損失を上回る性能が得られるか?
  • RQ4提案されたマルチタスクアーキテクチャは、ACE 2005ベンチマークにおいてSOTAモデルと比較してF1スコアをどの程度向上させるか?
  • RQ5BIOタグ埋め込みは、他の関係抽出モデルに対しても一般化可能な特徴強化として有効に機能するか?

主な発見

  • 提案されたマルチタスクモデルは、ベースライン比で1.5%の絶対的F1スコア向上(61.4%から62.9%)を達成し、関係特定のための共同学習の有効性を示した。
  • 同じマルチタスク設定下で、ランク付け損失を用いた関係分類は交差エントロピー損失より0.9%高いF1スコア(62.9% vs. 62.0%)を達成し、不均衡へのロバスト性の向上を示した。
  • BIOタグ埋め込みの追加により顕著な性能向上が得られ、ACE 2005の中国語および英語データセットにおいて、ベースラインモデル比で10%以上の絶対的F1スコア向上を達成した。
  • 中国語および英語版のACE 2005ベンチマークにおいて、SOTAアプローチを上回る性能を示し、汎化能力の有効性を確認した。
  • アブレーションスタディの結果、主な性能向上要因は関係特定タスクに起因しており、損失関数の選択そのものだけではないことが判明し、設計の妥当性を裏付けた。
  • BIOタグ埋め込みは特に効果的であり、他のモデルに容易に統合可能な汎用的な入力表現強化として利用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。