Skip to main content
QUICK REVIEW

[論文レビュー] Generative Data Augmentation for Commonsense Reasoning

Yiben Yang, Chaitanya Malaviya|arXiv (Cornell University)|Apr 24, 2020
Topic Modeling参考文献 66被引用数 18
ひとこと要約

本稿では、事前学習言語モデルを用いて多様で高品質な常識的推論例を合成する、生成的データ拡張フレームワークG-DAug$^c$を提案する。インフルエンスに基づくフィルタリングと多様性最大化選択を組み合わせることで、WinoGrande、CommonsenseQA、CoDaHなどのベンチマークで分布内性能とロバスト性が向上し、最大4%の絶対的精度向上を達成し、最先端の結果を実現する。

ABSTRACT

Recent advances in commonsense reasoning depend on large-scale human-annotated training data to achieve peak performance. However, manual curation of training examples is expensive and has been shown to introduce annotation artifacts that neural models can readily exploit and overfit on. We investigate G-DAUG^C, a novel generative data augmentation method that aims to achieve more accurate and robust learning in the low-resource setting. Our approach generates synthetic examples using pretrained language models, and selects the most informative and diverse set of examples for data augmentation. In experiments with multiple commonsense reasoning benchmarks, G-DAUG^C consistently outperforms existing data augmentation methods based on back-translation, and establishes a new state-of-the-art on WinoGrande, CODAH, and CommonsenseQA. Further, in addition to improvements in in-distribution accuracy, G-DAUG^C-augmented training also enhances out-of-distribution generalization, showing greater robustness against adversarial or perturbed examples. Our analysis demonstrates that G-DAUG^C produces a diverse set of fluent training examples, and that its selection and training approaches are important for performance. Our findings encourage future research toward generative data augmentation to enhance both in-distribution learning and out-of-distribution generalization.

研究の動機と目的

  • 常識的推論タスクにおける人手によるアノテーションデータの高コスト性と脆さに対処する。
  • 人手で収集されたデータセットで学習されたニューラルモデルにおけるアノテーションアーチファクトと過学習を軽減する。
  • 合成データを用いた低リソースでスケーラブルな一般化性能向上のための解決策を開発する。
  • 常識的推論において分布内性能と分布外ロバスト性の両方を向上させる。
  • 合成例が情報量が多く多様性があることを保証するデータ選択パイプラインを設計する。

提案手法

  • GPT-2などの事前学習言語モデルを用いて、大量の合成された常識的推論の質問と回答を生成する。
  • 微調整されたタスクモデルを用いて生成例のラベルを再ラベル付けすることで、ラベル品質を向上させる。
  • インフルエンス関数を適用し、学習に与える影響に基づいて最も情報量の多い合成例を同定する。
  • 意味的多様性を最大化するためのヒューリスティックを実装する。
  • 2段階の訓練スキームを採用する:まずフィルタリングされた合成データで学習し、その後元の人工アノテーションデータで微調整する。
  • 生成された例の多様性を活用して、元の訓練セットに存在しない新しい意味的ユニットを導入する。

実験結果

リサーチクエスチョン

  • RQ1生成モデルは、常識的推論のデータ拡張に適した高品質で多様な合成例を生成できるか?
  • RQ2大量に生成されたプールから最も情報量が多く多様性のある合成例をどのように選択できるか?
  • RQ3合成データ拡張は、常識的推論ベンチマークにおける分布内性能を向上させるか?
  • RQ4合成データは、敵対的摂動や分布外例に対するモデルのロバスト性を向上させられるか?
  • RQ5データ選択および訓練パイプラインのどの要素が性能向上に最も寄与しているか?

主な発見

  • G-DAug$^c$は、WinoGrande、CommonsenseQA、CoDaHを含む4つの常識的推論ベンチマークで1–4%の絶対的精度向上を達成し、WinoGrande、CommonsenseQA、CoDaHでは最先端の性能を実現した。
  • フレームワークはロバスト性を向上させ、摂動を加えた評価セットでも高い精度を示し、敵対的攻撃に対しても耐性を示した。
  • 人的評価では、生成された質問の74.04%が「受け入れ可能」(4段階評価基準で3以上)と評価され、平均の流暢さ評価は3.34であった。
  • 合成データは、元の訓練セットよりも顕著に多くの固有の意味的ユニットを導入しており、有効なデータ多様性が確保されたことが示された。
  • モデル性能はシャープネス(ヘッセ行列のトレース)では十分に説明されず、最適化ダイナミクスよりもデータ品質と選択の重要性が示された。
  • G-DAug$^c$は、バックトランスレーションベースラインおよび微調整済みジェネレータのアンサンブルを上回り、その選択および訓練戦略の優位性を実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。