[論文レビュー] FacT: Factor-Tuning for Lightweight Adaptation on Vision Transformer
本稿では、Vision Transformer向けのパラメータ効率の良い微調整手法FacTを提案する。FacTは、テンソル化と分解を用いて重み増分を低ランクテンソルに因子分解することで、極めて高いパラメータ効率を実現する。VTAB-1Kでは、わずか8Kの学習可能なパラメータ(ViTの0.01%)でSOTA性能を達成し、フル微調整や既存のPETL手法を上回る性能を示す。特に、少データ学習設定下で顕著な優位性を示す。
Recent work has explored the potential to adapt a pre-trained vision transformer (ViT) by updating only a few parameters so as to improve storage efficiency, called parameter-efficient transfer learning (PETL). Current PETL methods have shown that by tuning only 0.5% of the parameters, ViT can be adapted to downstream tasks with even better performance than full fine-tuning. In this paper, we aim to further promote the efficiency of PETL to meet the extreme storage constraint in real-world applications. To this end, we propose a tensorization-decomposition framework to store the weight increments, in which the weights of each ViT are tensorized into a single 3D tensor, and their increments are then decomposed into lightweight factors. In the fine-tuning process, only the factors need to be updated and stored, termed Factor-Tuning (FacT). On VTAB-1K benchmark, our method performs on par with NOAH, the state-of-the-art PETL method, while being 5x more parameter-efficient. We also present a tiny version that only uses 8K (0.01% of ViT's parameters) trainable parameters but outperforms full fine-tuning and many other PETL methods such as VPT and BitFit. In few-shot settings, FacT also beats all PETL baselines using the fewest parameters, demonstrating its strong capability in the low-data regime.
研究の動機と目的
- 実際のアプリケーションにおいて、ユーザーまたはタスクごとにモデルを保存する必要がある状況における、フル微調整のストレージ非効率性を解消すること。
- 微調整中のViT重み増分における、重み内および重み間のランク冗長性を活用すること。
- 現在の最先端手法を凌駕するパラメータ効率の高い転移学習(PETL)フレームワークを開発すること。
- 特にデータが少ない状況下で、極めて厳しいストレージ制約下でも優れた性能を示すことを実証すること。
提案手法
- 本手法は、全層およびヘッドにおける重み増分行列を統合することで、ViT全体を1つの3次元テンソルにテンプレート化する。
- テンソル分解(Tensor-TrainまたはTucker形式)を適用し、テンプレート化された重み増分を軽量で共有可能な構成要素に因子分解する。
- 微調整中は、これらの学習済み要因のみを更新・保存し、ViTバックボーンは固定されたままに保つ。
- このフレームワークはアーキテクチャに依存せず、Swin Transformerを含むさまざまなViTバージョンに適用可能である。
- マトリクス・バッチ形式を用いる場合、LoRAはFacTの特殊ケースであることが示されている。
- 本手法は、重み内ランク冗長性(行列内)および重み間ランク冗長性(層およびヘッド間)の両方を低減する。
実験結果
リサーチクエスチョン
- RQ1微調整されたViTにおける重み増分行列は、低ランク分解を越えて、層間およびヘッド間の冗長性を活用することでさらに圧縮可能か?
- RQ2統一されたテンプレート化・分解フレームワークは、LoRA や VPT などの既存のPETL手法よりも優れたパラメータ効率を達成可能か?
- RQ3パrameter予算が減少するに従ってFacTの性能はどのように変化するか、特に少データ学習状況下でどうか?
- RQ4Swin Transformerのような異なるViTアーキテクチャに対しても、テンプレート化・分解フレームワークを適用可能か?
主な発見
- FacT-TTは、VTAB-1KでSOTA手法NOAHと同等の性能を達成しながら、NOAHの学習可能なパラメータの19%しか使用しない。
- わずか8Kの学習可能なパラメータ(ViTの0.01%)を有するFacTのミニチュア版は、VTAB-1Kでフル微調整およびVPTやBitFitを上回る性能を示す。
- 少データ学習状況下では、FacT-TTはすべての他のPETLベースラインを上回り、データ不足下でも優れた一般化性能を示す。
- MHSAブロックのみをテンプレート化すると、FFNブロックのみをテンプレート化する場合よりも優れた性能を示す。MHSA + FFNの完全なテンプレート化が、特化型および構造的タスクにおいて最適である。
- 分解ランクr=16で性能が飽和しており、より高いランクは要因のサイズ増加に伴い効果が小さくなることが示唆される。
- Swin-Bに対しても有効であり、FacT-TT 16はわずか0.135Mの学習可能なパラメータで平均77.4%の精度を達成し、VPT-Deep や BitFit を上回る。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。