QUICK REVIEW
[論文レビュー] PaliGemma: A versatile 3B VLM for transfer
Lucas Beyer, Andreas Steiner|arXiv (Cornell University)|Jul 10, 2024
Advanced Fiber Optic Sensors被引用数 11
ひとこと要約
PaliGemma はオープンで、サブ3B のビジョン-言語モデルで、SigLIP-So400m 画像エンコーダと Gemma-2B デコーダを組み合わせ、VLMベンチマーク、リモートセンシング、セグメンテーションを含む多様なオープンワールドタスクへ転移するよう訓練。
ABSTRACT
PaliGemma is an open Vision-Language Model (VLM) that is based on the SigLIP-So400m vision encoder and the Gemma-2B language model. It is trained to be a versatile and broadly knowledgeable base model that is effective to transfer. It achieves strong performance on a wide variety of open-world tasks. We evaluate PaliGemma on almost 40 diverse tasks including standard VLM benchmarks, but also more specialized tasks such as remote-sensing and segmentation.
研究の動機と目的
- 広範なタスクセットに対して転移性能が高い、汎用的なベースのビジョン-言語モデルを提供する。
- 小規模でオープンな VLM が標準タスクおよびニッチなタスクで大規模モデルと同等または上回ることを示す。
- 多様な出力に対する効果的なマルチステージ事前学習と転移戦略を示す。
- マルチモーダル前処理学習と転移性能に影響を与える設計選択を調査する。
- ハイパーパラメータと解像度処理の指針を含む、実用的な転移レシピを提供する。
提案手法
- 三要素VLMを組み立てる: SigLIP 画像エンコーダ、Gemma-2B デコーダLM、画像トークンを言語モデル入力へ接続する線形射影。
- ステージドプロセスで訓練: Stage0 単模態事前学習、Stage1 広範なタスク混合での凍結なしのマルチモーダル事前学習、Stage2 より高解像度のファインチューニング、Stage3 多様なベンチマークへのタスク特異的転移。
- 入力(画像とプレフィックス)に完全な注意を与える prefix-LM マスキングを使用し、自己回帰的サフィックス生成を行い、サフィックスのみを監督する。
- Gemma の語彙を 1024 の location トークンと 128 の segmentation トークンで拡張し、転移を最適化するよう新しいトークンを慎重に初期化する。
- 単純な線形コネクターを用い(MLP ではなく)、Stage1 で画像エンコーダを凍結しないことで、空間的理解と転移性を高める。
- 30以上の学術ベンチマークにわたる、解像度、エポック数、学習率、ラベル平滑化、ドロップアウトなど、タスク固有のハイパーパラメータを組み込んだ統一転移レシピを採用し、画像が事前学習データからデデュプリケーションされていないことを保証する。

実験結果
リサーチクエスチョン
- RQ1コンパクトなオープンVLM(≈3B パラメータ)は、より大きなモデルと比較して、視覚言語タスク全般でどの程度の性能を示すか?
- RQ2オープンVLMの転移性能に最も影響を与える事前学習と訓練設計の選択は何か?
- RQ3指示チューニングなしで、データや計算量の指数成長を伴わずに、段階的な前処理学習を通じて転送時の高解像度を効果的に達成できるか?
- RQ4標準的なVLMベンチマークと専門タスク(リモートセンシング、インフォグラフィックQA、セグメンテーション、動画タスク)で強力な結果を生む、実用的な転移レシピ(ハイパーパラメータ、データ増強、アーキテクチャの選択)は何か?
主な発見
- PaliGemma (3B スケール) は、標準的な VLM ベンチマーク(例: COCO, VQA, TextVQA)および専門タスク(リモートセンシング VQA、インフォグラフィック QA、動画キャプション、 referring expression segmentation)で競争力のある性能を示す。
- 3 段階の前処理計画(単模態、凍結されていない画像エンコーダを用いたマルチモーダル、次いで解像度の増加)は、様々なタスクへの広範な転移性を生み出す。
- Prefix-LM マスキングは入力全体の注意と suffix 自己回帰を組み合わせる方法が他の方法より優れており、タスクプレフィックスはあいまいなタスクで役立ち、サフィックスのみの監督が有効。
- 新しいトークンの追加(location トークンと segmentation トークン)は慎重な初期化が必要で、AvgEmb は長期的な転送を傷つける可能性があり、標準的なガウス初期化が転送を改善する。
- Stage1 で画像エンコーダを凍結しないことは空間理解と転移性を向上させ、LLM を凍結すると性能が低下する。この設定では、線形コネクターが MLP よりも優れている。
- 複数の解像度チェックポイント(224, 448, 896)を提供し Stage2 を経ることは有益で、高解像度コンテンツとより長いシーケンス長の影響が分離される。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。