Skip to main content
QUICK REVIEW

[論文レビュー] KronA: Parameter Efficient Tuning with Kronecker Adapter

Ali Edalati, Marzieh S. Tahaei|arXiv (Cornell University)|Dec 20, 2022
Topic Modeling被引用数 11
ひとこと要約

KronAは、低ランク因子分解の代わりにクロネッカー積分解を用いることで、Transformerベースの事前学習言語モデルに対するパラメータ効率の良いチューニング手法を提案する。低ランクアダプタの代わりにクロネッカーに基づくモジュールを採用することで、推論遅延に変化がないままGLUEベンチマークで最先端の性能を達成し、$ ext{KronA}^{ ext{B}}$および$ ext{KronA}^{ ext{B}}_{ ext{res}}$によってさらに性能向上が図れるが、その代わりに遅延が増加する。

ABSTRACT

Fine-tuning a Pre-trained Language Model (PLM) on a specific downstream task has been a well-known paradigm in Natural Language Processing. However, with the ever-growing size of PLMs, training the entire model on several downstream tasks becomes very expensive and resource-hungry. Recently, different Parameter Efficient Tuning (PET) techniques are proposed to improve the efficiency of fine-tuning PLMs. One popular category of PET methods is the low-rank adaptation methods which insert learnable truncated SVD modules into the original model either sequentially or in parallel. However, low-rank decomposition suffers from limited representation power. In this work, we address this problem using the Kronecker product instead of the low-rank representation. We introduce KronA, a Kronecker product-based adapter module for efficient fine-tuning of Transformer-based PLMs. We apply the proposed methods for fine-tuning T5 on the GLUE benchmark to show that incorporating the Kronecker-based modules can outperform state-of-the-art PET methods.

研究の動機と目的

  • 大規模事前学習言語モデルに対するパラメータ効率の良いチューニング(PET)手法における低ランク因子分解の表現力の限界を解消すること。
  • 推論遅延を増加させることなく、LoRA やアダプタなどの既存の PET 手法を上回る性能を達成すること。
  • ファインチューニングにおける低ランク更新のより表現力のある代替手段として、クロネッカー積分解の使用を検討すること。
  • KronAおよびその変種($\text{KronA}^{\text{B}}$、$\text{KronA}^{\text{B}}_{\text{res}}$)のGLUEベンチマーク上での有効性を評価すること。
  • クロネッカーに基づくモジュールが、パラメータ効率を保ちながらも、完全なファインチューニングの精度に達成または上回ることを実証すること。

提案手法

  • KronAは、低ランクアダプタモジュールの代わりにクロネッカー積に基づく可学習パラメータを採用し、重み更新を2つの小さな行列の積として分解する。
  • T5のアテンション層およびフィードフォワード層における更新行列にクロネッカー分解を適用することで、低ランク因子分解よりも表現力の高いパラメータ更新が可能になる。
  • 変種の$\text{KronA}^{\text{B}}$は、フィードフォワードネットワークと並列にクロネッカーモジュールを挿入し、より強力なモデリング能力を実現する。
  • $\text{KronA}^{\text{B}}_{\text{res}}$では、学習可能な残差接続を導入することで、さらに表現力の向上を図る。
  • 推論時にはすべてのトレーニング可能なパラメータが固定され、低遅延を維持する。最終的なタスク固有の重みは、元のモデルとマージ可能である。
  • 学習率、クロネッカー要因の形状、スケーリング要因といったハイパーパrameterは、開発セットの性能に基づき、タスクごとに最適化された。

実験結果

リサーチクエスチョン

  • RQ1クロネッカー積分解は、事前学習言語モデルのパラメータ効率の良いファインチューニングにおいて、低ランク因子分解を上回ることができるか?
  • RQ2提案されたKronAモジュールは、LoRA やアダプタなどの最先端のPET手法を上回る性能を発揮するが、推論遅延を増加させないか?
  • RQ3フィードフォワードパスにKronA($\text{KronA}^{\text{B}}$)を並列に挿入することで、完全なファインチューニングを上回る性能が達成できるか?
  • RQ4$\text{KronA}^{\text{B}}_{\text{res}}$に学習可能な残差接続を追加することで、遅延の増加を伴いながらもさらに精度向上が図れるか?
  • RQ5クロネッカー要因のハイパーパrameterは、多様なGLUEタスクにおいてモデル性能にどのように影響を与えるか?

主な発見

  • KronAは、推論遅延に変化がないまま、LoRA やアダプタなどの最先端のPET手法をGLUEベンチマークで上回る。
  • $\text{KronA}^{\text{B}}$変種は、MNLI や QNLI を含む複数のタスクで完全なファインチューニングを上回るGLUEスコアを達成する。
  • $\text{KronA}^{\text{B}}_{\text{res}}$変種は、学習可能な残差接続を組み込むことでさらに性能を向上させ、いくつかのGLUEタスクで最先端の結果を達成する。
  • クロネッカーに基づくモジュールは、パラメータ数が少ないにもかかわらず、低ランク因子分解よりも優れた表現力を持つことが実証された。
  • 本手法は低推論遅延を維持するため、遅延が制限される応用に適している。
  • クロネッカー要因の形状のハイパーパラメータチューニングは、性能に顕著な影響を与え、最適な設定はタスクごとに異なる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。