[論文レビュー] Improving Robustness by Augmenting Training Sentences with Predicate-Argument Structures
本稿では、特定のバイアスに焦点を当てることなく、複数の種類のデータセットバイアスに対してトランスフォーマーモデルのロバスト性を向上させるために、訓練文に述語項構造を追加することを提案する。この手法は、意味的役割を強調することで注意メカニズムを強化し、訓練データにバイアスが存在しない場合でも、敵対的ベンチマークでの一般化性能を向上させる。
Existing NLP datasets contain various biases, and models tend to quickly learn those biases, which in turn limits their robustness. Existing approaches to improve robustness against dataset biases mostly focus on changing the training objective so that models learn less from biased examples. Besides, they mostly focus on addressing a specific bias, and while they improve the performance on adversarial evaluation sets of the targeted bias, they may bias the model in other ways, and therefore, hurt the overall robustness. In this paper, we propose to augment the input sentences in the training data with their corresponding predicate-argument structures, which provide a higher-level abstraction over different realizations of the same meaning and help the model to recognize important parts of sentences. We show that without targeting a specific bias, our sentence augmentation improves the robustness of transformer models against multiple biases. In addition, we show that models can still be vulnerable to the lexical overlap bias, even when the training data does not contain this bias, and that the sentence augmentation also improves the robustness in this scenario. We will release our adversarial datasets to evaluate bias in such a scenario as well as our augmentation scripts at https://github.com/UKPLab/data-augmentation-for-robustness.
研究の動機と目的
- 特定のバイアスにのみ焦点を当てている既存のデバイアス化手法の制限を解決すること。
- 訓練データにそのバイアスが存在しない場合でも、モデルがバイアスに脆弱であるかどうかを調査すること。
- モデルに依存せず、テスト時の推論を変更せずにロバスト性を向上させる、入力レベルの拡張技術を開発すること。
- 複数のモデル、タスク、敵対的評価セットにおいて、言語的拡張の有効性を評価すること。
- 多様なベンチマークとモデルアーキテクチャでデバイアス化手法をテストするよう促す、より広範な評価慣行の促進。
提案手法
- 事前学習済みの意味解析器を用いて、訓練文から述語項構造(PAS)を抽出する。
- 各入力文を、構造化された形式(例:"[V: predict] [ARG0: student] [ARG1: result]")で対応するPASを挿入することで拡張する。
- 微調整の際、拡張された入力文を事前学習済みトランスフォーマーモデル(例:BERT、RoBERTa、XLNet)に供給する。
- モデル推論のために元の入力文を保持し、テスト時のオーバーヘッドを回避する。
- 拡張された入力文を用いて、注意メカニズムが表面的な語彙的キーワードではなく、意味的役割に注目するように促進する。
- HANS、SWAG、MultiNLIを含む複数の敵対的ベンチマークでロバストネスを評価し、さまざまなバイアス条件下で検証する。
実験結果
リサーチクエスチョン
- RQ1訓練データに語彙的オーバーラップバイアスが存在しない場合でも、トランスフォーマーモデルがそのバイアスに脆弱である可能性はあり得るか?
- RQ2述語項構造を用いた訓練文の拡張は、特定のバイアスに焦点を当てることなく、複数の種類のバイアスに対してロバストネスを向上させるか?
- RQ3バイアスが訓練データに存在しない状況でも、提案手法の拡張は有効であるか?
- RQ4異なる事前学習済みトランスフォーマーモデル(例:BERT、RoBERTa、XLNet)において、この拡張手法はどのように機能するか?
- RQ5自然言語推論や常識的推論といった異なるNLPタスクにおいても、この手法は一般化可能か?
主な発見
- 語彙的オーバーラップバイアスを含まないSWAGデータで微調整したモデルでさえ、このバイアスを含む敵対的セットではランダムベースライン未満の性能を示し、訓練データにバイアスが存在しない場合でも脆弱であることが確認された。
- 提案手法による文の拡張は、特定のバイアスに焦点を当てず、複数の敵対的ベンチマーク(HANS、SWAG、MultiNLI)でロバストネスを向上させた。
- HANSベンチマークでは、拡張後、XLNetとRoBERTaの両モデルが語彙的オーバーラップおよび文法的不変性プローブで精度が向上し、XLNetは元のデータと比較して60.6%(対象:57.6%)を達成した。
- ベースモデルがもともとロバストである場合(例:MultiNLIにおけるRoBERTa)でも、本手法はストレステストおよび否定プローブで一貫した改善を示した。
- BertVizによる可視化では、拡張により注意がより集中したパターンを示し、述語項構造および関連する前提・仮説語に強い注意が向かうようになった。
- 本手法はモデルに依存せず、テスト時の推論を変更しないため、実世界の展開において実用的である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。