[論文レビュー] MAGMA -- Multimodal Augmentation of Generative Models through Adapter-based Finetuning
MAGMAは、アダプタベースの微調整を用いて、凍結された生成的言語モデルに視覚機能を追加するパラメータ効率の良い手法を導入し、任意の視覚的およびテキスト的入力を用いたエンドツーエンドのマルチモーダル生成を可能にした。OKVQAでは最先端の性能を達成し、他のベンチマークでも競争力のある結果を示したが、SimVLMが使用したデータ量の約0.2%での訓練にとどまっている。
Large-scale pretraining is fast becoming the norm in Vision-Language (VL) modeling. However, prevailing VL approaches are limited by the requirement for labeled data and the use of complex multi-step pretraining objectives. We present MAGMA - a simple method for augmenting generative language models with additional modalities using adapter-based finetuning. Building on Frozen, we train a series of VL models that autoregressively generate text from arbitrary combinations of visual and textual input. The pretraining is entirely end-to-end using a single language modeling objective, simplifying optimization compared to previous approaches. Importantly, the language model weights remain unchanged during training, allowing for transfer of encyclopedic knowledge and in-context learning abilities from language pretraining. MAGMA outperforms Frozen on open-ended generative tasks, achieving state of the art results on the OKVQA benchmark and competitive results on a range of other popular VL benchmarks, while pretraining on 0.2% of the number of samples used to train SimVLM.
研究の動機と目的
- 言語モデルの重みを微調整せずに、凍結された自己回帰的言語モデルに視覚機能を統合するパラメータ効率の良い手法を開発すること。
- 単一で統一された言語モデルの目的関数を用いて、オープンエンドで生成的なマルチモーダルタスクを可能にすること。
- アダプタ層と吟味された事前学習データセットを導入することで、Frozen手法を改善し、モデルの知識と文脈内学習を維持しながら性能を向上させること。
- 少量の高品質なデータが、大規模でノイズの多いデータセットよりもマルチモーダル事前学習において優れた結果をもたらす可能性があることを示すこと。
- さまざまな下流の視覚言語タスクにおいて、異なる視覚エンコーダーとアダプタ構成の有効性を調査すること。
提案手法
- MAGMAは、GPT-Jなどの凍結された自己回帰的言語モデル(LM)をコアデコーダーとして用い、CLIPベースのResNet視覚エンコーダーを視覚のバックボーンとして採用する。
- アダプタ層を言語モデルの注意とフィードフォワードサブレイヤーに挿入し、主なLM重みは凍結したままアダプタ層のみを微調整する。
- CLIPエンコーダーから得られる視覚プレフィックスを入力トークンに連結することで、言語モデルに画像特徴を条件づける。
- 下流タスクのデータを含む約2500万件の画像・テキストペアから構成される吟味されたデータセット上で、標準的な次トークン予測目的を用いて事前学習を実施する。
- タスク固有のヘッドの微調整なしに、ゼロショットおよびフェイントショット推論を可能にする。
- VQA、OKVQA、NoCapsなどのベンチマークでゼロショット推論によるモデル性能の評価を実施し、単一タスクの性能を向上させるために訓練スプリットでの追加微調整を実施する。
実験結果
リサーチクエスチョン
- RQ1アダプタベースの微調整は、事前学習済みの知識を保持したまま、凍結された言語モデルに視覚機能を効果的に追加できるか?
- RQ2高品質な画像・テキストペアから構成される少量の吟味されたデータセットで学習することで、大規模でノイズの多いデータセットよりもマルチモーダル事前学習で優れた結果が得られるか?
- RQ3異なる視覚エンコーダー(例:CLIP-RN50x16 と 他のもの)やアダプタ構成は、多様な視覚言語タスクにおける下流性能にどのように影響するか?
- RQ4明示的な教師信号なしに、凍結された言語モデルが複雑な推論やOCRタスクをどれほど正確に実行できるか?
- RQ5要因分解された認知プロンプティングにより、マルチステップ推論タスクへの一般化がどの程度可能か?
主な発見
- MAGMAはOKVQAベンチマークで最先端の精度を達成し、FrozenやSimVLMを凌駆える結果を示した。
- NoCapsや他のベンチマークでも競争力のある結果を示し、SimVLMが使用した事前学習データ量の約0.2%しか使用していないにもかかわらず、Frozenベースラインを上回る性能を示した。
- アブレーションスタディにおいて、CLIP-RN50x16視覚エンコーダーが他の視覚バックボーンよりも顕著に優れており、特にオープンエンドの推論タスクで顕著な性能を示した。
- アダプタ微調整モデルは、視覚プレフィックスのみの方法よりも一貫して優れた性能を示し、言語モデルの内部表現におけるパラメータ効率の良い適応の重要性を示した。
- 事前学習データセットに下流タスクのデータを含めることで、特にVQAと画像キャプションタスクで顕著な性能向上が見られた。
- MAGMAはCLIPをだます悪意のあるタイプの攻撃に対して頑健であり、教師あり微調整なしに強力なフェイントショットOCRおよびテキスト補完能力を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。