Skip to main content
QUICK REVIEW

[論文レビュー] VLP: A Survey on Vision-Language Pre-training

Feilong Chen, Duzhen Zhang|arXiv (Cornell University)|Feb 18, 2022
Multimodal Machine Learning Applications参考文献 151被引用数 4
ひとこと要約

本サーベイは、特徴抽出、モデルアーキテクチャ、事前学習目的、データセット、および下流タスクをカバーする、ビジョン・ランゲージ・プレトレーニング(VLP)の包括的概要を提供する。最新のSOTA VLPモデルを体系的にレビューし、プロンプトチューニング、モデル圧縮、ドメイン外事前学習、拡散モデルや幾何的ディープラーニングなどの新規アーキテクチャといった、新たなフロンティアを特定する。

ABSTRACT

In the past few years, the emergence of pre-training models has brought uni-modal fields such as computer vision (CV) and natural language processing (NLP) to a new era. Substantial works have shown they are beneficial for downstream uni-modal tasks and avoid training a new model from scratch. So can such pre-trained models be applied to multi-modal tasks? Researchers have explored this problem and made significant progress. This paper surveys recent advances and new frontiers in vision-language pre-training (VLP), including image-text and video-text pre-training. To give readers a better overall grasp of VLP, we first review its recent advances from five aspects: feature extraction, model architecture, pre-training objectives, pre-training datasets, and downstream tasks. Then, we summarize the specific VLP models in detail. Finally, we discuss the new frontiers in VLP. To the best of our knowledge, this is the first survey focused on VLP. We hope that this survey can shed light on future research in the VLP field.

研究の動機と目的

  • コンピュータビジョンおよび自然言語処理分野の研究者を対象に、ビジョン・ランゲージ・プレトレーニング(VLP)について体系的かつ包括的なサーベイを提供すること。
  • 特徴抽出、モデルアーキテクチャ、事前学習目的、データセット、および下流タスクを含む、VLPの主要な構成要素を特定・分析すること。
  • 最新のSOTA VLPモデルを要約し、そのアーキテクチャ的および目的的革新を強調すること。
  • プロンプトチューニング、モデル圧縮、ドメイン外事前学習、および新規アーキテクチャといった、VLPにおける新たなフロンティアを探索すること。
  • 現在の分野の状態を統合し、未解決の課題を特定することで、今後の研究の基盤となる基盤的リファレンスを提供すること。

提案手法

  • オブジェクト検出に基づく領域特徴とCLIPスタイルの画像エンコーダーを含む、特徴抽出技術に基づいてVLPモデルを分類する。
  • シングルストリーム対ダブルストリーム、およびエンコーダー専用対エンコーダー・デコーダー構成に分類してモデルアーキテクチャを分類する。
  • 埋め込み補完、マッチング、時間的、およびマスクド言語モデリングなどの特殊目的を含む、4つの主な事前学習目的をレビューする。
  • COCO、Conceptual Captions、MS-COCOなどの主要な事前学習データセットを収集・分析し、その規模とモダリティカバー範囲に焦点を当てる。
  • 画像キャプション生成、視覚的質問応答、動画・言語理解などの下流タスクを検討し、評価目的を明確にする。
  • 効率性と一般化性能の向上を目的とした、プロンプトチューニング、知識蒸留、モデル量子化といった新技術を検討する。

実験結果

リサーチクエスチョン

  • RQ1現代のビジョン・ランゲージ・プレトレーニングモデルにおける、主な構成要素と設計選択とは何か?
  • RQ2異なる事前学習目的は、視覚と言語の間のクロスモodalな整合性学習をどのように導くのか?
  • RQ3最も影響力のあるVLPモデルは何か? また、それらはどのようなアーキテクチャ的・目的的革新を導入しているか?
  • RQ4特に効率性、一般化、認知統合に関する観点から、VLPにおける主な課題と未解決の研究方向性は何か?
  • RQ5プロンプトチューニングや知識インジェクションといった新技術は、VLPモデルの性能と適合性をどのように向上させうるか?

主な発見

  • 本サーベイは、ビジョン・ランゲージ・プレトレーニングに特化した最初の包括的サーベイであり、特徴抽出、モデル設計、目的、データセット、および下流タスクにわたる進展を統合している。
  • オブジェクト検出に基づく領域特徴(例:Faster R-CNN)とCLIPスタイルの対照的学習が、特徴抽出で支配的であり、後者はゼロショット一般化を可能にする。
  • エンコーダー専用およびエンコーダー・デコーダーのアーキテクチャが広く使われており、モダリティ固有の処理を要するタスクでは、ダブルストリームモデルがシングルストリームを上回ることが多い。
  • マスクド言語モデリング、対照的学習、マスクド領域モデリングといった事前学習目的は、クロスモダリティの整合性学習に不可欠である。
  • VATT や OPT といった最近のモデルは、テキスト・画像・音声の共同事前学習が、マルチレベルのマスクと生成機能を備えて実現可能であることを示している。
  • プロンプトチューニング、知識インジェクション、モデル圧縮といった新たなフロンティアは、VLPにおける効率性、一般化、スケーラビリティの向上に強く期待できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。