Skip to main content
QUICK REVIEW

[論文レビュー] DARE: Data Augmented Relation Extraction with GPT-2

Yannis Papanikolaou, Andrea Pierleoni|arXiv (Cornell University)|Apr 6, 2020
Topic Modeling参考文献 28被引用数 16
ひとこと要約

DARE は、関係抽出のためのデータ拡張手法を提案する。GPT-2 を関係タイプごとに微調整し、合成学習例を生成し、それを本物のデータと組み合わせて BERT を用いた分類器を微調整する。この手法は、強力なベースラインよりも最大で 11 F1 スコアの向上を達成し、3 つのバイオメディカル関係抽出ベンチマークで新たな SOTA 結果を樹立し、平均して 4.7 F1 ポイントの向上を達成した。

ABSTRACT

Real-world Relation Extraction (RE) tasks are challenging to deal with, either due to limited training data or class imbalance issues. In this work, we present Data Augmented Relation Extraction(DARE), a simple method to augment training data by properly fine-tuning GPT-2 to generate examples for specific relation types. The generated training data is then used in combination with the gold dataset to train a BERT-based RE classifier. In a series of experiments we show the advantages of our method, which leads in improvements of up to 11 F1 score points against a strong base-line. Also, DARE achieves new state of the art in three widely used biomedical RE datasets surpassing the previous best results by 4.7 F1 points on average.

研究の動機と目的

  • 実世界のバイオメディカル NLP 応用において一般的な、クラス不均衡と限られた学習データという課題に対処する。
  • 生成のみを目的としないで、自己回帰的言語モデル(例:GPT-2)を、下流の分類タスクのためのデータ拡張エンジンとして用いる可能性を検討する。
  • GPT-2 の制御された微調整により、本物のラベル付きデータと合成された例を組み合わせ、BERT を用いた関係抽出器の性能を向上させる。
  • GPT-2 が生成するデータが、データ不足やクラス不均衡を効果的に緩和でき、モデル性能を低下させるような顕著なノイズを導入しないことを示す。
  • 3 つの広く使われているバイオメディカル関係抽出ベンチマークで、新たな SOTA を確立する。

提案手法

  • Gold データセットからの正例のみを用いて、関係タイプごとに別個の GPT-2 モデルを微調整する。
  • 微調整済みの GPT-2 モデルを用いて、ターゲットの関係タイプの文法的・意味的パターンを反映した合成学習インスタンスを生成する。
  • 生成された合成データと元のゴールドデータセットを組み合わせ、拡張された学習データセットを構築する。
  • 拡張データセットの異なるサブセットで学習する、BERT を用いた関係分類器のアンサンブルを訓練し、ばらつきを低減し、モデルの頑健性を向上させる。
  • 実験的アブレーションに基づき、1:1 の生成データ対ゴールドデータの比率が最適であると判明したため、関係タイプごとにこの比率を採用する。
  • 最終的な BERT 分類器を、拡張された全データセットで微調整して最終モデルを生成する。

実験結果

リサーチクエスチョン

  • RQ1GPT-2 を高品質で関係固有の学習例を生成できるように効果的に微調整できるか。その結果、下流の関係抽出性能が向上するか。
  • RQ2GPT-2 を用いたデータ拡張は、クラス重み付けやバランスバギングといった従来のクラス不均衡学習手法と比較して、F1 スコアの向上においてどのように異なるか。
  • RQ3ノイズが分類器性能を低下させるおそれがある場合を除き、性能を最大化するための生成データ対ゴールドデータの最適な比率は何か。
  • RQ4GPT-2 が生成するデータを用いることで、標準的なバイオメディカル関係抽出ベンチマークで SOTA の性能が達成できるか。
  • RQ5提案手法は、データ不足やクラス不均衡の度合いが異なる多様なバイオメディカル関係抽出データセットに一般化可能か。

主な発見

  • DARE は、強力なベースラインよりも最大で 11 F1 スコアポイントの向上を達成し、関係抽出性能の顕著な向上を示した。
  • CDR データセットでは、F1 を 0.70(SOTA)から 0.73 に向上(+3 ポイント)し、評価されたすべての手法の中で最高の F1 を達成した。
  • ChemProt では、F1 を 0.65(SOTA)から 0.73 に向上(+8 ポイント)し、新たな SOTA を樹立した。
  • DDI2013 では、F1 を 0.75(SOTA)から 0.78 に向上(+3 ポイント)し、すべてのベースラインを上回った。
  • 3 つのベンチマーク全体で、前回の SOTA に対して平均 4.7 F1 ポイントの向上を達成し、新たな SOTA を確立した。
  • 実験的アブレーションにより、生成データ対ゴールドデータの比率が 1:1 のとき性能がピークに達することが判明し、さらに比率を増加させるとノイズの影響で性能が低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。