Skip to main content
QUICK REVIEW

[論文レビュー] Scheduled DropHead: A Regularization Method for Transformer Models

Wangchunshu Zhou, Tao Ge|arXiv (Cornell University)|Apr 28, 2020
Topic Modeling参考文献 30被引用数 6
ひとこと要約

本稿では、モデルの支配的になる少数のアテンションヘッドを防ぐために訓練中に一括してアテンションヘッドをランダムにドロップする構造的ドロップアウト手法、Scheduled DropHeadを提案する。この手法は、訓練の前半と後半でドロップアウト率を増やすV字型のドロップアウト率スケジューラーを導入し、アーキテクチャの変更なしにWMT14 En-De翻訳タスクで0.9 BLEU向上、テキスト分類タスクで約1.0の精度向上を達成する。

ABSTRACT

In this paper, we introduce DropHead, a structured dropout method specifically designed for regularizing the multi-head attention mechanism, which is a key component of transformer, a state-of-the-art model for various NLP tasks. In contrast to the conventional dropout mechanisms which randomly drop units or connections, the proposed DropHead is a structured dropout method. It drops entire attention-heads during training and It prevents the multi-head attention model from being dominated by a small portion of attention heads while also reduces the risk of overfitting the training data, thus making use of the multi-head attention mechanism more efficiently. Motivated by recent studies about the learning dynamic of the multi-head attention mechanism, we propose a specific dropout rate schedule to adaptively adjust the dropout rate of DropHead and achieve better regularization effect. Experimental results on both machine translation and text classification benchmark datasets demonstrate the effectiveness of the proposed approach.

研究の動機と目的

  • マルチヘッドアテンション機構において、出力に顕著に寄与するのは僅か数個のヘッドに限定されるというヘッドの支配問題に対処すること。
  • アテンションヘッド間の共適応を低減させることで、トランスフォーマーモデルの一般化性能を向上させること。
  • 訓練のダイナミクスに適応した正則化手法を設計し、アテンションヘッドへの構造的ドロップアウトの有効性を高めること。
  • 多数のアテンションヘッドをプルーニングした後でも、モデルのロバスト性と性能を向上させること。

提案手法

  • DropHeadは、個々のユニットや接続ではなく、訓練中に一括してアテンションヘッド全体をランダムにドロップする構造的ドロップアウトを適用する。
  • 各アテンションヘッドは、ドロップされる固定確率を有し、これによりすべてのヘッドがモデル性能に意味のある寄与を強制する。
  • V字型のドロップアウト率スケジューラーを導入し、訓練の前半と後半でドロップアウト率を増やし、中盤では減少させる。
  • このスケジューラーは、ヘッドの支配が訓練の初期および終盤に最も顕著に現れるという訓練ダイナミクスに起因する。
  • この手法は、トランスフォーマーアーキテクチャ内のエンコーダ-エンコーダ、エンコーダ-デコーダ、デコーダ-デコーダのアテンションモジュールに適用可能である。
  • このアプローチはアーキテクチャの変更を必要とせず、標準的なトランスフォーマー訓練パイプラインと互換性がある。

実験結果

リサーチクエスチョン

  • RQ1アテンションヘッド全体への構造的ドロップアウトが、トランスフォーマーモデルの性能と一般化性能を向上させるか?
  • RQ2訓練中に変化する動的ドロップアウト率スケジューラーが、DropHeadの正則化効果をさらに強化できるか?
  • RQ3Scheduled DropHeadはアテンションヘッドの重要度とプルーニングに対するモデルのロバスト性にどのように影響を与えるか?
  • RQ4提案手法は、翻訳やテキスト分類を含む多様なNLPタスクで性能向上を達成できるか?
  • RQ5V字型のドロップアウト率スケジュールは、定数または線形に変化するスケジュールよりも効果的か?

主な発見

  • Scheduled DropHeadは、標準的なトランスフォーマーに対してWMT14 En-De翻訳タスクで0.9 BLEUポイントの向上を達成した。
  • 複数のテキスト分類ベンチマークで約1.0の精度向上を達成した。
  • エンコーダ-エンコーダおよびエンコーダ-デコーダのアテンションモジュールにScheduled DropHeadを適用すると、最も大きな性能向上が得られた。
  • V字型のドロップアウト率スケジューラーは、定数および線形(カリキュラム/アンチカリキュラム)スケジュールを上回る性能を示した。
  • Scheduled DropHeadで訓練されたモデルは、多数のアテンションヘッドをプルーニングしても性能を維持するという、改善されたロバスト性を示した。
  • DropHeadはアテンションヘッド間の過剰な共適応を低減させ、より多くのヘッドが有用な情報をエンコードするよう促進した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。