Skip to main content
QUICK REVIEW

[論文レビュー] E2E-VLP: End-to-End Vision-Language Pre-training Enhanced by Visual Learning

Haiyang Xu, Ming Yan|arXiv (Cornell University)|Jun 3, 2021
Multimodal Machine Learning Applications参考文献 37被引用数 8
ひとこと要約

E2E-VLPは、一貫したTransformerエンコーダデコーダアーキテクチャを用いて、画像ピクセルから直接視覚的表現とクロスモーダル整合性を共同で学習する、最初のエンドツーエンドのビジョン・ランゲージの事前学習モデルを提案する。オブジェクト検出と画像キャプション生成を事前学習タスクとして統合することで、2段階手法よりも高速な推論を実現しつつ、下流のビジョン・ランゲージタスクで最先端の性能を達成した。

ABSTRACT

Vision-language pre-training (VLP) on large-scale image-text pairs has achieved huge success for the cross-modal downstream tasks. The most existing pre-training methods mainly adopt a two-step training procedure, which firstly employs a pre-trained object detector to extract region-based visual features, then concatenates the image representation and text embedding as the input of Transformer to train. However, these methods face problems of using task-specific visual representation of the specific object detector for generic cross-modal understanding, and the computation inefficiency of two-stage pipeline. In this paper, we propose the first end-to-end vision-language pre-trained model for both V+L understanding and generation, namely E2E-VLP, where we build a unified Transformer framework to jointly learn visual representation, and semantic alignments between image and text. We incorporate the tasks of object detection and image captioning into pre-training with a unified Transformer encoder-decoder architecture for enhancing visual learning. An extensive set of experiments have been conducted on well-established vision-language downstream tasks to demonstrate the effectiveness of this novel VLP paradigm.

研究の動機と目的

  • 2段階のビジョン・ランゲージ事前学習の限界、特にキャッシュされたオブジェクト特徴に依存し、誤差伝搬と非効率性を引き起こす問題を解決すること。
  • 生の画像ピクセルから直接視覚的表現とクロスモーダル整合性を共同で学習するエンドツーエンドのフレームワークを開発すること。
  • 一貫したTransformerアーキテクチャ内での細分化された事前学習タスク(オブジェクト検出や画像キャプションなど)を通じて、視覚的学習を強化すること。
  • 1つのモデルアーキテクチャでビジョン・ランゲージ理解と生成の両方のタスクを統合的に処理できるようにすること。

提案手法

  • E2E-VLPは、一貫したTransformerエンコーダデコーダアーキテクチャを用い、画像ピクセルから直接視覚的特徴とクロスモーダル表現を共同で学習する。
  • オブジェクト検出をバイパライトマッチングを用いたセット予測タスクとして扱い、クロスモーダルエンコーダとともにエンドツーエンドで学習する。
  • 画像キャプション生成は、エンコーダが画像を処理し、デコーダがテキストを生成する自己回帰的言語モデリング目的として定式化する。
  • 事前学習段階でマスク言語モデリング、画像・テキストマッチング、オブジェクト検出、画像キャプション生成の4つの目的を同時に最適化する。
  • 視覚的特徴は領域提案ではなくグリッドベースの表現から抽出されるため、より高速で効率的な推論が可能になる。
  • フレームワークは、下流タスクにおける微調整の際、理解用にエンコーダオンリーモード、生成用にエンコーダデコーダモードをサポートする。

実験結果

リサーチクエスチョン

  • RQ1生のピクセル入力を用いたエンドツーエンドのビジョン・ランゲージ事前学習は、2段階手法に比べ、クロスモーダル理解と生成タスクで優れた性能を発揮できるか?
  • RQ2オブジェクト検出と画像キャプションを事前学習タスクとして統合することで、視覚的表現学習はどのように向上するか?
  • RQ3領域ベースの特徴ではなくグリッド特徴を使用した場合、推論効率と性能にどのような影響を与えるか?
  • RQ4検出とキャプションの両方のタスクで共同事前学習を行うことで、より良いクロスモーダル統合と整合性が達成できるか?
  • RQ5エンドツーエンドVLPにおける入力画像サイズの変更は、推論速度とモデル精度のトレードオフにどのように影響するか?

主な発見

  • E2E-VLPは、VQA、NLVR2、画像キャプションなど複数のビジョン・ランゲージベンチマークで最先端または競争力のある性能を達成した。
  • 入力サイズを800×1333にした場合、VQA正答率は73.25%、NLVR2正答率は77.25%を達成し、448×448に縮小すると5倍の高速化が達成され、性能低下は僅か2%〜3%にとどまった。
  • MSCOCOにおけるオブジェクト検出性能は41.9 mAPに達し、元のDETR(40.6 mAP)を上回り、強力な視覚的特徴学習を示した。
  • より深いResNet-152バックボーンを用いることで、Transformerエンコーダ層を増やすよりも顕著な性能向上が得られ、視覚的特徴の質の重要性を示した。
  • モデルは優れた一般化性能を示し、1つの統合アーキテクチャでビジョン・ランゲージ理解と生成の両タスクに良好な性能を発揮した。
  • 入力画像を448×448にダウンサンプリングすることで、推論時間を5倍短縮でき、精度の低下は最小限に抑えられ、ワンステージ設計の効率性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。