Skip to main content
QUICK REVIEW

[論文レビュー] Vision-and-Language Pretrained Models: A Survey

Siqu Long, Feiqi Cao|arXiv (Cornell University)|Apr 15, 2022
Multimodal Machine Learning Applications被引用数 7
ひとこと要約

本調査は、ビジョンアンドランゲージプリトレーニングモデル(VLPMs)の包括的な概要を提供し、そのアーキテクチャ、入力符号化手法、プリトレーニングおよびファインチューニング戦略、および下流タスクを詳細に説明している。マルチモodalトランスフォーマーが連携された視覚的・言語的表現を学習する役割を強調し、クロスモーダルアライメント、マルチタスクプリトレーニング、およびトレーニング評価に関する主な課題と今後の方向性を特定している。

ABSTRACT

Pretrained models have produced great success in both Computer Vision (CV) and Natural Language Processing (NLP). This progress leads to learning joint representations of vision and language pretraining by feeding visual and linguistic contents into a multi-layer transformer, Visual-Language Pretrained Models (VLPMs). In this paper, we present an overview of the major advances achieved in VLPMs for producing joint representations of vision and language. As the preliminaries, we briefly describe the general task definition and genetic architecture of VLPMs. We first discuss the language and vision data encoding methods and then present the mainstream VLPM structure as the core content. We further summarise several essential pretraining and fine-tuning strategies. Finally, we highlight three future directions for both CV and NLP researchers to provide insightful guidance.

研究の動機と目的

  • CVおよびNLP分野の研究者を対象に、ビジョンアンドランゲージプリトレーニングモデル(VLPMs)について体系的かつ包括的なレビューを提供すること。
  • VLPMsの主要な構成要素、すなわち入力符号化、相互作用モデリング、およびプリトレーニング戦略を特定・分析すること。
  • 主流のVLPMアーキテクチャと、多様なビジョン・ランゲージタスクにおけるそのパフォーマンスを要約すること。
  • クロスモーダルアライメント、マルチタスクプリトレーニング、およびトレーニング評価に関する未解決の課題を強調し、今後の研究方向性を提案すること。

提案手法

  • 本論文は、一般的な4要素アーキテクチャ(視覚/言語の原始入力、モダリティ固有の表現学習、トランスフォーマーにおけるマルチヘッド自己注意を用いたビジョン・ランゲージ相互作用、および統合されたクロスモーダル表現出力)を用いて主要なVLPMsを調査している。
  • BERTスタイルの入力表現を用いた言語符号化を分析し、トークン埋め込み、位置埋め込み、セグメント埋め込みを含む。また、モダリティ固有の戦略やイ早融合戦略(例:入力レベルまたは表現レベルでのV2L)も含む。
  • 領域ベースの特徴(例:RoI特徴)を用いた視覚符号化と、それらをトランスフォーマー・エンコーダー内でのテキスト埋め込みと統合する方法を検討している。
  • ペアド画像・テキストデータに適用されるマスクド言語モデリング、コントラスト学習、マスクド画像モデリングなどのプリトレーニング目的をレビューしている。
  • VQA、画像キャプション生成、ビジョン・グラウディング、ビジョン・ランゲージナビゲーションなど、多様な下流タスクにおけるファインチューニング戦略を評価している。
  • 今後の研究方向性として、改善されたクロスモーダルアライメント、段階的およびマルチタスクプリトレーニング、およびトレーニング時間評価指標の強化を提案している。

実験結果

リサーチクエスチョン

  • RQ1マルチモーダルトランスフォーマーを用いて、ビジョンアンドランゲージプリトレーニングモデルは、画像とテキストの連携表現をどのように学習するか?
  • RQ2最先端のVLPMsで使用されている支配的アーキテクチャと入力符号化戦略は何か?
  • RQ3プリトレーニング目的とファインチューニング戦略は、ビジョン・ランゲージタスクにおける下流パフォーマンスにどのように影響を与えるか?
  • RQ4クロスモーダルアライメントにおける主な課題は何か、そしてそれらはどのように解決できるか?
  • RQ5モデルの効率性、一般化性能、および評価を向上させるための今後の方向性は何か?

主な発見

  • マルチヘッド自己注意を備えたBERTスタイルのトランスフォーマー・アーキテクチャに基づくVLPMsは、視覚的・言語的表現間のクロスモーダル相互作用を効果的にモデル化できる。
  • 視覚的特徴を言語入力に早期に統合すること(例:オブジェクトタグを介して)により、ビジョン・ランゲージタスクにおけるアライメントとパフォーマンスが向上する。
  • ドメイン内データセットでプリトレーニングすると、特にオープンボキャブラリーおよび生成的タスクにおいて、データサイズが小さくても下流タスクでのパフォーマンスが向上する。
  • 12-in-1などのマルチタスクプリトレーニング戦略は、タスク内およびタスク間の協調作用によりパフォーマンス向上をもたらすが、最適なタスクグループ化と順序付けは未解決の課題のままである。
  • トレーニング時間評価指標(例:Perplexity)は、モデル欠陏の早期検出に役立ち、下流計算の無駄を減らす可能性を秘めている。
  • 多様で大規模なペアド画像・テキストデータでプリトレーニングされたモデルは、ビジョン・ランゲージベンチマーク全体で強力なゼロショットおよびファインチューニングパフォーマンスを達成する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。