[論文レビュー] PaLI: A Jointly-Scaled Multilingual Language-Image Model
PaLI は、共同でスケールされた多言語ビジョン-言語モデルで、テキスト対テキストのインターフェースを使用して、多くの言語にわたる多様な画像-言語タスクを実行し、大規模な単一モダルバックボーンと10B-image WebLI pretraining datasetを活用。
Effective scaling and a flexible task interface enable large language models to excel at many tasks. We present PaLI (Pathways Language and Image model), a model that extends this approach to the joint modeling of language and vision. PaLI generates text based on visual and textual inputs, and with this interface performs many vision, language, and multimodal tasks, in many languages. To train PaLI, we make use of large pre-trained encoder-decoder language models and Vision Transformers (ViTs). This allows us to capitalize on their existing capabilities and leverage the substantial cost of training them. We find that joint scaling of the vision and language components is important. Since existing Transformers for language are much larger than their vision counterparts, we train a large, 4-billion parameter ViT (ViT-e) to quantify the benefits from even larger-capacity vision models. To train PaLI, we create a large multilingual mix of pretraining tasks, based on a new image-text training set containing 10B images and texts in over 100 languages. PaLI achieves state-of-the-art in multiple vision and language tasks (such as captioning, visual question-answering, scene-text understanding), while retaining a simple, modular, and scalable design.
研究の動機と目的
- 多くの言語に跨る多様なビジョン-言語タスクのための、画像-テキストからテキスト生成への統一的な機能を有効化する。
- 視覚と語りバックボーンを共同でスケールさせることの利点を示す、片寄ったスケーリングではなく。
- 再利用可能な単一モダルのチェックポイントを活用して、 multilingual 機能を保持しつつ訓練コストを削減する。
- 100言語以上と広範なタスクカバレッジをサポートする大規模なマルチリンガル WebLI データセットで訓練する。
提案手法
- 画像エンコーダとして Vision Transformer (ViT) を用い、エンコーダ-デコーダ Transformer を使用し、言語部品は事前学習済みの mT5 ベースで構成する。
- ViT-e、4Bパラメータの視覚バックボーンを導入し、より大きな視覚容量の影響を検討する。
- OCR注釈付きで、100+言語の10B画像と数千億の画像-テキストペアを含む WebLI で事前学習する。
- 分割キャプション、キャプション生成、OCR、VQA、VQG などを含む8つのタスクのマルチタスク事前学習混合を採用し、一般的なマルチモーダル理解を促進する。
- 高解像度(224–588)で英語および多言語ベンチマークの微調整と評価を行い、クロスリンガルおよびクロスタスク転移を評価する。
実験結果
リサーチクエスチョン
- RQ1視覚と語りバックボーンを共同でスケールさせることは、片寄ったスケーリングよりも多模態性能を向上させるか?
- RQ2大規模なマルチリンガル多模態モデルは、英語および非英語のV&Lタスク(キャプション生成やVQA など)を言語横断でどの程度こなすか?
- RQ3多様な事前学習タスクの混合がマルチリンガル V&L 能力に与える影響はどの程度か?
- RQ4単一モダアルのチェックポイントの再利用は、言語性能を保持しつつマルチモーダルタスクを可能にできるか?
主な発見
- PaLI-17B は Karpathy 分割で CIDEr 149.1 の COCO Captioning の最先端を達成。
- PaLI-17B は open-vocabulary generation で VQAv2 の精度 84.3 を達成し、従来のSOTAモデルを上回る。
- PaLI-17B は OKVQA 精度 64.5 を達成し、従来の事前学習-微調整の結果を10.1ポイント上回る。
- Multilingual Crossmodal-3600 の結果は、7言語での強力なパフォーマンスと35言語平均を示し、従来の研究に比べて大幅な向上を示す。
- 視覚バックボーン(ViT-e)のスケーリングは、視覚-言語タスクで大きな利得をもたらし、時には言語スケーリングだけより効率的である。
- ハイレゾリューション事前学習を用いた PaLI-17B は、視覚-言語ベンチマークで約2ポイントの性能向上をさらに達成。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。