[論文レビュー] AdaMix: Mixture-of-Adaptations for Parameter-efficient Model Tuning
AdaMixは、各Transformer層内でアダプテーションモジュール(例:アダプターやLoRA)の混合を学習することで、パラメータ効率的な微調整の性能を向上させる手法を提案する。入力ごとに確率的ルーティングにより1つのモジュールを選択することで、単一モジュールと同一のFLOPsおよびトレーニング可能なパラメータ数を維持する。モデルパラメータの0.1–0.2%のみをチューニングすることで、NLUおよびNLGタスクにおいて標準的なフル微調整および最先端のPEFT手法を上回る性能を達成する。
Standard fine-tuning of large pre-trained language models (PLMs) for downstream tasks requires updating hundreds of millions to billions of parameters, and storing a large copy of the PLM weights for every task resulting in increased cost for storing, sharing and serving the models. To address this, parameter-efficient fine-tuning (PEFT) techniques were introduced where small trainable components are injected in the PLM and updated during fine-tuning. We propose AdaMix as a general PEFT method that tunes a mixture of adaptation modules -- given the underlying PEFT method of choice -- introduced in each Transformer layer while keeping most of the PLM weights frozen. For instance, AdaMix can leverage a mixture of adapters like Houlsby or a mixture of low rank decomposition matrices like LoRA to improve downstream task performance over the corresponding PEFT methods for fully supervised and few-shot NLU and NLG tasks. Further, we design AdaMix such that it matches the same computational cost and the number of tunable parameters as the underlying PEFT method. By only tuning 0.1-0.2% of PLM parameters, we show that AdaMix outperforms SOTA parameter-efficient fine-tuning and full model fine-tuning for both NLU and NLG tasks.
研究の動機と目的
- 大規模な事前学習言語モデル(PLM)におけるフル微調整の高コストなストレージ、共有、およびサービング問題に対処する。これは、各タスクごとに数十億のパラメータを更新・保存する必要があるためである。
- トレーニング可能なパラメータ数を削減しているにもかかわらず、通常はフル微調整に劣る性能を示す既存のパラメータ効率的微調整(PEFT)手法の性能を向上させること。
- 計算コストを増加させることなく、任意のベースとなるPEFT手法(例:アダプターまたはLoRA)を強化できる汎用的なPEFTフレームワークを提供すること。この強化は、アダプテーションモジュールの混合を用いる。
- ベースとなるPEFT手法と同一のトレーニング可能なパラメータ数およびFLOPsを維持することで、効率性を確保する。同時に、モジュールの統合と一貫性正則化により、ロバスト性と性能を向上させる。
提案手法
- AdaMixは、標準的なPEFTで使用される単一のモジュールに代わり、各Transformer層に複数のアダプテーションモジュール(例:アダプターまたはLoRA行列)を導入する。
- 確率的ルーティングを用いて、各入力に対して1つのアクティブなアダプテーションモジュールを選択する。これは、エキスパートの混合(MoE)にインspiredされ、単一モジュールと同一のFLOP数を保証する。
- 複数のランダムに初期化されたモジュールを用いる場合のトレーニング安定化を図るため、一貫性正則化と共有初期化を導入する。
- トレーニング後の統合機構により、複数のアダプテーションモジュールの重みを平均化し、1つの効果的なモジュールに統合する。これにより、ベースとなるPEFT手法と同一のトレーニング可能なパラメータ数を維持する。
- 統合プロセスは、モデル重み平均化(例:モデルスープ)にインspiredされ、フルモデルではなくPEFTアダプテーションモジュールに特化して適用される。
- 本手法は、既存のPEFT技術と直交的であり、アダプター、LoRA、プロンプトチューニング、またはプレフィックスチューニングを含む、任意のPEFT手法に上書きして適用可能である。
実験結果
リサーチクエスチョン
- RQ1計算コストを増加させることなく、アダプテーションモジュールの混合が、パラメータ効率的微調整における下流タスクの性能を向上させることができるか?
- RQ2複数のアダプテーションモジュールにわたる確率的ルーティングは、単一モジュールPEFTと比較して、より優れた一般化性能とロバスト性をもたらすか?
- RQ3一貫性正則化と重み統合により、複数のランダムに初期化されたアダプテーションモジュールを用いた場合に、トレーニングが安定化され、性能が維持されるか?
- RQ4AdaMixは、モデルパラメータの0.1–0.2%のみをチューニングしながら、標準的なフル微調整および最先端のPEFT手法を上回る性能を達成するか?
- RQ5AdaMixフレームワークは、アダプターおよびLoRAを含む、さまざまなPEFT手法に一般化可能か?
主な発見
- RoBERTa-largeを用いたGLUEベンチマークでは、AdaMixがわずか0.1–0.2%のパラメータのみをチューニングすることで、91.0%の平均スコアを達成し、フルモデル微調整を上回った。
- SuperGLUEベンチマークでは、アダプターを用いたAdaMixが90.7%の平均スコアを達成し、標準的なLoRAの89.2%および標準的なアダプターの90.9%を上回った。
- CNN/DailyMail要約タスクでは、LoRAを用いたAdaMixがROUGE-Lスコア42.1を達成し、標準的なLoRAの40.8および標準的なアダプターの41.5を上回った。
- AdaMixは、ベースとなるPEFT手法と同一のFLOPsおよびトレーニング可能なパラメータ数を維持しながら、NLUおよびNLGタスクの両方で性能を向上させた。
- AdaMixは、わずか0.1–0.2%のモデルパラメータのみをチューニングしながらも、GLUEおよびSuperGLUEベンチマークで最先端の結果を達成した。
- 統合機構により、複数のアダプテーションモジュールを1つに統合することで、性能に劣化を来すことなくストレージコストを削減できた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。