[論文レビュー] MAPL: Parameter-Efficient Adaptation of Unimodal Pre-Trained Models for Vision-Language Few-Shot Prompting
MAPLは、視覚と言語の事前学習済み単モodalモデルの表現空間の間で軽量なマッピングを学習することで、固定された単モダリティの視覚・言語モデルを視覚言語少数-shotプロンプティングに効率的に適応するパrameter効率の高い手法である。MAPLは、先行手法と比較して訓練パラメータ数が桁違いに少ないにもかかわらず、VQAおよび画像キャプションベンチマークで競争力のある性能を達成しており、低データおよびドメイン内設定でも同様の効果を示す。
Large pre-trained models have proved to be remarkable zero- and (prompt-based) few-shot learners in unimodal vision and language tasks. We propose MAPL, a simple and parameter-efficient method that reuses frozen pre-trained unimodal models and leverages their strong generalization capabilities in multimodal vision-language (VL) settings. MAPL learns a lightweight mapping between the representation spaces of unimodal models using aligned image-text data, and can generalize to unseen VL tasks from just a few in-context examples. The small number of trainable parameters makes MAPL effective at low-data and in-domain learning. Moreover, MAPL's modularity enables easy extension to other pre-trained models. Extensive experiments on several visual question answering and image captioning benchmarks show that MAPL achieves superior or competitive performance compared to similar methods while training orders of magnitude fewer parameters. MAPL can be trained in just a few hours using modest computational resources and public datasets. We release our code and pre-trained model weights at https://github.com/mair-lab/mapl.
研究の動機と目的
- 少数のコンテキスト例を用いて、視覚言語タスクにおける少数-shot一般化を可能にすること。
- 大規模な事前学習済みモデルに対して微調整やアダプタ層を適用する従来手法と比較して、トレーニング可能なパラメータ数を削減すること。
- 固定された単モダリティの基盤モデルを再利用することで、効果的な低データおよびドメイン内学習を可能にすること。
- 新しいまたは改善された事前学習モデルに容易に適応可能なモジュラーかつ拡張可能なフレームワークを提供すること。
- パrameter効率が、下流の視覚言語ベンチマークにおける性能を損なわないことを実証すること。
提案手法
- MAPLは、微調整やアダプタ層を一切用いずに、固定された事前学習済み視覚エンコーダー(例:CLIP)と自己回帰的言語モデル(例:GPT)を再利用する。
- ペアドされた画像・テキストデータを用いて、固定された視覚エンコーダーと言語エンコーダーの表現空間を一致させる、軽量で学習可能なマッピングヘッドを導入する。
- マッピングは画像・キャプションペア上でエンドツーエンドに訓練され、その結果、コンテキスト内学習を介して未観測の視覚言語タスクへ一般化可能となる。
- この手法はモジュラーであり、任意の事前学習済み単モダリティモデルに適用可能で、より新しいまたは優れたモデルへの容易な拡張が可能である。
- 訓練は、一般的なデータセットを用いて、限定的な計算リソースで実施され、数時間で完了する。
- 固定された言語モデルのコンテキスト内学習能力を活用することで、少数の少数-shot例からの一般化が可能となる。
実験結果
リサーチクエスチョン
- RQ1固定された単モダリティモデル間の軽量なマッピングが、視覚言語タスクにおいて強力な少数-shot性能を達成できるか?
- RQ2大規模なマルチモーダルデータ上で微調整またはアダプタ層を用いる手法と比較して、MAPLはどのように性能を発揮するか?
- RQ3MAPLは、パラメータ更新を最小限に抑えた状態で、低データおよびドメイン内学習設定においても効果的に一般化できるか?
- RQ4MAPLのパrameter効率が性能を低下させるのか、それともより複雑な手法と同等または上回る性能を発揮できるのか?
- RQ5MAPLの性能は、重み初期化のランダム性に対してどれほど感受的か。また、ばらつきは軽減可能か?
主な発見
- MAPLは、Frozen や Eichenberg et al. (2021)、Dai et al. (2022) といった手法と比較して、訓練パラメータ数が桁違いに少ないにもかかわらず、複数の画像キャプションおよびVQAベンチマークで優れたまたは競争力のある性能を達成している。
- 低データ学習(マルチモーダルデータの1%)において、MAPLはFrozenを顕著に上回り、顕著なパrameter効率を示している。
- ドメイン内学習において、MAPLは事前学習なしに100%または1%のタスク固有データに対して直接訓練された状況でも、同じ条件下でFrozenを上回っている。
- MAPLは、一般的なデータセットと限定的な計算リソースを用いて数時間で訓練可能であり、小規模な研究ラボや個人研究者にとってもアクセス可能である。
- 異なるランダムシード間で、MAPLは非軽視できる性能のばらつきを示しているが、これはトレーニング可能なパラメータ数が少ないことに起因すると考えられる。一方で、シード間の平均性能は安定している。
- MAPLは、コンテキスト内学習におけるより多くのショットを有効に活用できていない可能性がある。これは、複数の例からなるシーケンスではなく、単一の画像・キャプションペアで訓練されているためであり、より良い事前学習タスクの必要性が示唆される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。