Skip to main content
QUICK REVIEW

[論文レビュー] Not All Attention Is All You Need

Hongqiu Wu, Hai Zhao|arXiv (Cornell University)|Apr 10, 2021
Topic Modeling参考文献 51被引用数 10
ひとこと要約

本稿では、事前学習言語モデルにおけるサンプル固有でレイヤーごとのドロップアウトパターンを自己注意機構を用いて生成する動的ドロップアウト手法 AttendOut を提案する。この手法は、微調整段階におけるロバスト性と性能を著しく向上させ、複数の下流NLPタスクで最先端の結果を達成する。AttendOut は、自己注意正則化を学習することで、固定確率および静的ドロップアウト手法を凌駃し、複数のベンチマークで優れた性能を発揮する。

ABSTRACT

Beyond the success story of pre-trained language models (PrLMs) in recent natural language processing, they are susceptible to over-fitting due to unusual large model size. To this end, dropout serves as a therapy. However, existing methods like random-based, knowledge-based and search-based dropout are more general but less effective onto self-attention based models, which are broadly chosen as the fundamental architecture of PrLMs. In this paper, we propose a novel dropout method named AttendOut to let self-attention empowered PrLMs capable of more robust task-specific tuning. We demonstrate that state-of-the-art models with elaborate training design may achieve much stronger results. We verify the universality of our approach on extensive natural language processing tasks.

研究の動機と目的

  • 限られたデータでのタスク固有の微調整中に生じる過学習およびコアドアプティベーションを緩和すること。
  • 固定確率とサンプルレベルでの適応性に欠けるため、自己注意モデルでは効果が限定的である静的かつランダムベースのドロップアウト手法の限界を克服すること。
  • 各サンプルおよび各レイヤーごとに動的で注意駆動のドロップアウトパターンを生成する、学習可能でエンドツーエンドのドロップアウトメカニズムを開発すること。
  • AttendOut の普遍性と有効性が、多様なNLPタスクおよびモデルアーキテクチャにわたって確認できることを示すこと。

提案手法

  • AttendOut は、自己注意メカニズムを用いて各注意ヘッドおよび各サンプルに対して動的ドロップアウトマスクを生成する学習可能な注意ベースのドロップアウトモジュール(G-Net)を導入する。
  • この手法は、訓練中にこれらの学習済みマスクを注意行列に適用し、サンプル固有でレイヤーごとのドロップアウトを通じて注意のコアドアプティベーションを効果的に正則化する。
  • ドロップアウトパターンの生成は微分可能であり、バックプロパゲーションを介してエンドツーエンドで訓練可能であり、最適な注意正則化パターンの学習が可能である。
  • AttendOut の動的パターンを近似するためのスケジュール付きベルヌーイドロップアウトベースラインを導入し、学習された構造の有効性を検証する。
  • 標準的な事前学習モデル(例:RoBERTa)に適用可能であり、アーキテクチャへの変更が最小限で、推論コストの増加も発生しない。
  • 標準ベンチマークを用いて、テキスト分類や自然言語推論を含む複数のNLPタスクで評価が行われる。

実験結果

リサーチクエスチョン

  • RQ1動的で注意駆動のドロップアウトパターンは、自己注意ベースの事前学習言語モデルの微調整段階における一般化性能とロバスト性を向上させることができるか?
  • RQ2固定確率ドロップアウトおよびレイヤー単位の正則化手法(例:LayerDrop)と比較して、AttendOut の性能と安定性はどのように異なるか?
  • RQ3学習されたドロップアウトパターンは、トレーニングのダイナミクスから観察されるように、タスク固有およびレイヤー固有の正則化ニーズをどの程度反映しているか?
  • RQ4AttendOut のパターンをスケジュール付きランダムベースで近似した場合、同等の性能が達成できるか?これは、学習された構造の妥当性を示唆する。
  • RQ5AttendOut は、データ量や複雑さが異なる多様なNLPタスクにおいて普遍的かつ有効に機能するか?

主な発見

  • AttendOut は、CoLA ベンチマークにおいて、バニラドロップアウトよりも 4.1% の絶対的向上を達成し、動的正則化の効果が顕著に示された。
  • QNLI では、RoBERTa の精度を 92.0 から 93.1 に向上(1.1ポイント向上)させ、あらゆるタスクで一貫した改善を示した。
  • LayerDrop や Attn.LayerDrop よりも優れた性能を示し、MNLI では 1.0 ポイント、CoLA では 1.7 ポイントの向上を達成した。
  • 学習されたドロップアウトパターンは、低レイヤーで高い確率を示し、動的適応が行われており、特に CoLA では最大 0.9 まで上昇するなど、小規模データセットに対して強い正則化が行われていることが示された。
  • スケジュール付きベルヌーイドロップアウトベースラインは、AttendOut の性能をよく近似しており(CoLA で 0.8 ポイントの向上)、動的パターン学習の正しさが裏付けられた。
  • 収束曲線から、AttendOut はより速く安定した学習が可能であり、エポックを経て性能が着実に向上するのに対し、ベースラインモデルは停滞または低下する傾向にあった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。