Skip to main content
QUICK REVIEW

[論文レビュー] Conditional Adapters: Parameter-efficient Transfer Learning with Fast Inference

Tao Lei, Junwen Bai|arXiv (Cornell University)|Apr 11, 2023
Domain Adaptation and Few-Shot Learning被引用数 6
ひとこと要約

この論文では、柔らかく上位k個のルーティング機構を通じて重要な入力トークンのみを効果的に活性化することにより、推論を高速化するパラメータ効率的な転移学習手法である条件付きアダプタ(CoDA)を紹介する。CoDAは、自然言語処理、画像、音声のタスクにおいて、標準アダプタと比較して2倍から8倍の高速化を達成し、精度の低下は最小限または全くないため、再トレーニングを伴わずに大規模な事前学習モデルの効率的導入が可能になる。

ABSTRACT

We propose Conditional Adapter (CoDA), a parameter-efficient transfer learning method that also improves inference efficiency. CoDA generalizes beyond standard adapter approaches to enable a new way of balancing speed and accuracy using conditional computation. Starting with an existing dense pretrained model, CoDA adds sparse activation together with a small number of new parameters and a light-weight training phase. Our experiments demonstrate that the CoDA approach provides an unexpectedly efficient way to transfer knowledge. Across a variety of language, vision, and speech tasks, CoDA achieves a 2x to 8x inference speed-up compared to the state-of-the-art Adapter approaches with moderate to no accuracy loss and the same parameter efficiency.

研究の動機と目的

  • アダプタのような標準的なパラメータ効率的手法では、パラメータ更新が減少しても推論速度がそのままであるという非効率性に対処すること。
  • 大規模事前学習モデルの転移学習において、パラメータ効率性と推論効率性の両方を達成すること。
  • 重い計算を実行する対象となる最も関連性の高い入力トークンを動的に選択するルーティング機構を開発すること。
  • 柔らかく上位k個のルーティングにより条件付き計算を実現することで、モデルの精度を維持しつつ、著しく推論速度を向上させられることを示すこと。
  • 既存の密度型モデルを、最小限または全くルーターの事前学習を伴わずにCoDAモデルに効率的に変換できることを示すこと。

提案手法

  • CoDAは、入力トークンのスパースなサブセットを、完全なTransformer計算に割り当てるために、学習可能なルーターを導入することで標準アダプタを拡張する。
  • ルーターはエントロピー正則化最適化を用い、トークン選択の意思決定を微分可能かつ高速に反復計算可能にする。
  • 選択されたトークンのみが完全な事前学習済みTransformerブロックで処理され、残りのトークンは軽量なアダプタ層を通過するため、計算量が削減される。
  • この手法は事前学習済みモデルの重みを保持し、新たに追加された少数のパラメータのみを微調整するため、パラメータ効率性が保たれる。
  • 柔らかく上位k個の操作は、ハードな上位k個の操作を一般化し、最適なタスクパフォーマンスを達成するためのルーティング方針のエンドツーエンド学習を可能にする。
  • CoDAは、LoRAなどの他のパラメータ効率的手法と組み合わせることで、さらに推論を高速化できる。

実験結果

リサーチクエスチョン

  • RQ1条件付き計算を用いることで、転移学習におけるパラメータ効率性と推論効率性の両方を達成できるか?
  • RQ2柔らかく上位k個のルーティング機構は、精度を損なわず、意味のある入力トークンをスパース計算に適切に選択できるか?
  • RQ3既存の密度型事前学習モデルを、最小限または全く追加学習を伴わずにCoDAモデルに変換できる範囲はどの程度か?
  • RQ4多様なモダリティにおいて、標準アダプタと比較してCoDAの速度-精度トレードオフはどの程度か?
  • RQ5ドキュメントや画像ベースの質問応答のような、入力スパarsityが高いタスクにおいても、CoDAは性能を維持できるか?

主な発見

  • OCR-VQAタスクにおいて、CoDAは標準アダプタと比較して最大8倍の高速化を達成し、正確一致精度の低下はたった0.1%にとどまる。
  • Librispeechでは、モデルサイズにかかわらず2.2倍から19.4倍の高速化を達成し、語彙誤り率が1.4~2.8%を維持しており、完全微調整ベースラインと同等の性能を示した。
  • 画像タスクでは、ルーティング対象のトークンをシーケンス長の1/16に減らしても、OCR-VQAのEMスコアが1ポイント低下するのみで、13.5倍の高速化を達成した。
  • 可視化結果から、ルーターが意味のある代表的な画像パッチを選択し、情報量の少ない領域(例:余白)を回避することが確認された。
  • w2v-BERT や BEST-RQ などの完全微調整モデルと同等の性能を達成しながら、はるかに高速かつパラメータ効率的であることが示された。
  • ルーターの事前学習にほとんどまたは全く必要とされないため、既存の密度型モデルを迅速に効率的なCoDAモデルに変換できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。