Skip to main content
QUICK REVIEW

[論文レビュー] On the Effectiveness of Adapter-based Tuning for Pretrained Language Model Adaptation

Ruidan He, Linlin Liu|arXiv (Cornell University)|Jun 6, 2021
Topic Modeling参考文献 24被引用数 14
ひとこと要約

この論文は、事前学習言語モデル(PrLM)における完全微調整のパラメータ効率的な代替手法としてアダプタベースのチューニングを調査し、元のPrLMからの表現のずれを低減することで、訓練をより良い正則化にすると示している。低リソースおよびクロスリンガル設定において、アダプタは微調整を上回る性能を示し、学習率の変化に対してより頑健で、過学習が軽減される。

ABSTRACT

Adapter-based tuning has recently arisen as an alternative to fine-tuning. It works by adding light-weight adapter modules to a pretrained language model (PrLM) and only updating the parameters of adapter modules when learning on a downstream task. As such, it adds only a few trainable parameters per new task, allowing a high degree of parameter sharing. Prior studies have shown that adapter-based tuning often achieves comparable results to fine-tuning. However, existing work only focuses on the parameter-efficient aspect of adapter-based tuning while lacking further investigation on its effectiveness. In this paper, we study the latter. We first show that adapter-based tuning better mitigates forgetting issues than fine-tuning since it yields representations with less deviation from those generated by the initial PrLM. We then empirically compare the two tuning methods on several downstream NLP tasks and settings. We demonstrate that 1) adapter-based tuning outperforms fine-tuning on low-resource and cross-lingual tasks; 2) it is more robust to overfitting and less sensitive to changes in learning rates.

研究の動機と目的

  • アダプタベースのチューニングがパラメータ効率性を超えてPrLM適応において利点を提供するかどうかを評価すること。
  • 完全微調整と比較して、アダプタが崩壊的忘却(catastrophic forgetting)をより効果的に緩和するかどうかを調査すること。
  • 多様なNLPタスクおよび設定において、アダプタベースのチューニングと微調整の一般化性能および頑健性を比較すること。
  • 低リソースおよびクロスリンガル転移学習のシナリオにおけるアダプタの有効性を分析すること。
  • 学習率やモデル容量などのハイパーパrameterへの感受性を評価すること。

提案手法

  • 事前学習言語モデルのトランスフォーマーレイヤー間へ、ダウンプロジェクション、非線形関数(tanh)、アッププロジェクションから成る軽量なアダプタモジュールを挿入する。
  • すべての元のPrLMパラメータを固定し、微調整中にアダプタモジュールのパラメータのみを更新する。
  • 微調整後の隠れ表現が元のPrLMからどれほどずれているかを測定するために、表現類似度分析(RSA)を用いる。
  • アダプタ重みがほぼゼロのときでもアイデンティティマッピングを可能にするため、アダプタにスキップ接続を導入する。
  • GLUE、XNLI、および下流分類タスクを含む、複数のNLPタスクでBERT-baseを用いて性能を比較する。
  • 学習率、データサイズ、ゼロショットクロスリンガル転移設定の変化に対する一般化性能と安定性を評価する。

実験結果

リサーチクエスチョン

  • RQ1アダプタベースのチューニングは、微調整と比較して、元のPrLMからの表現のずれをより効果的に低減するか。これは、より良い正則化を示唆する。
  • RQ2低リソースおよび高リソース設定において、アダプタベースのチューニングは微調整と比較してどのように性能を発揮するか。
  • RQ3アダプタベースのチューニングは、特に学習率の変化に対して、微調整よりも優れた頑健性を示すか。
  • RQ4ゼロショットクロスリンガル転移学習において、アダプタベースのチューニングは微調整と比較してどれほど有効か。
  • RQ5ミックスアウト正則化を組み合わせた場合、アダプタベースのチューニングは微調整を上回る性能を発揮できるか。

主な発見

  • アダプタベースのチューニングは、微調整よりも元のPrLMからの表現のずれをより効果的に低減し、より良い正則化と忘却の軽減を示している。
  • 低リソース設定では、アダプタベースのチューニングが微調整を上回るが、特にドメイン特化タスクで顕著であり、データサイズが増加するにつれて性能差は縮小する。
  • すべてのデータ設定において、ゼロショットクロスリンガル転移タスクでアダプタベースのチューニングが優れた結果を達成し、未学習言語への一般化能力が顕著に優れている。
  • アダプタベースのチューニングは、微調整と比較して学習率ハイパーパrameterの変化に対してはるかに頑健であり、さまざまな学習率での性能ばらつきが小さい。
  • ミックスアウト正則化のアブレーションでは、アダプタベースのチューニング単体がミックスアウト正則化を施した微調整を上回る性能を発揮し、アダプタにミックスアウトを適用すると、トレーニング可能なパラメータが限られるため性能が低下する。
  • アダプタと微調整の性能差は、低リソースおよびクロスリンガルシナリオで最も顕著であり、パラメータ効率的な適応におけるアダプタの強みが浮き彫りになる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。