Skip to main content
QUICK REVIEW

[論文レビュー] PEVL: Position-enhanced Pre-training and Prompt Tuning for Vision-language Models

Yuan Yao, Qianyu Chen|arXiv (Cornell University)|May 23, 2022
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

PEVLは、検出器に依存しない視覚言語事前学習のための統合的言語モデリングフレームワークを提案する。このフレームワークでは、離散的オブジェクト位置とテキストトークンを統合し、一般化されたマスクド言語モデリング(GMLM)目的関数と柔軟なプロンプトチューニングを通じて明示的なオブジェクト位置モデリングを可能にする。この手法は、参照表現理解やフレーズグランドイングといった位置に依存するタスクで最先端の性能を達成するとともに、グランド付き入力を用いる位置に依存しないタスクの性能向上も実現する。

ABSTRACT

Vision-language pre-training (VLP) has shown impressive performance on a wide range of cross-modal tasks, where VLP models without reliance on object detectors are becoming the mainstream due to their superior computation efficiency and competitive performance. However, the removal of object detectors also deprives the capability of VLP models in explicit object modeling, which is essential to various position-sensitive vision-language (VL) tasks, such as referring expression comprehension and visual commonsense reasoning. To address the challenge, we introduce PEVL that enhances the pre-training and prompt tuning of VLP models with explicit object position modeling. Specifically, PEVL reformulates discretized object positions and language in a unified language modeling framework, which facilitates explicit VL alignment during pre-training, and also enables flexible prompt tuning for various downstream tasks. We show that PEVL enables state-of-the-art performance of detector-free VLP models on position-sensitive tasks such as referring expression comprehension and phrase grounding, and also improves the performance on position-insensitive tasks with grounded inputs. We make the data and code for this paper publicly available at https://github.com/thunlp/PEVL.

研究の動機と目的

  • 検出器に依存しない視覚言語事前学習(VLP)モデルにおいて、明示的なオブジェクト位置モデリングが欠如していることによる、位置に依存するタスクにおける性能の制限を是正すること。
  • 視覚的オブジェクト位置と言語トークンを、単一の言語モデリングフレームワーク内で統合し、共同事前学習と柔軟なプロンプトチューニングを可能にすること。
  • 同じGMLMヘッドをさまざまな下流タスクにわたってプロンプトチューニングに再利用することで、事前学習と微調整のギャップを軽減すること。
  • バウンディングボックスアノテーションのノイズに敏感でないよう、順序に配慮した目的関数を導入することで、位置学習のロバスト性を向上させること。

提案手法

  • オブジェクトのバウンディングボックス座標を離散的な位置トークンに変換し、対応するオブジェクト記述トークンの直後に連結する。
  • 事前学習を一般化されたマスクド言語モデリング(GMLM)タスクとして定式化し、モデルがクロスモodalな文脈からマスクされたテキストおよび位置トークンを予測する。
  • 離散化による影響を受けても空間的順序を保持できるように、近接する位置に高いソフトラベルを割り当てる順序に配慮した目的関数を導入し、位置トークンの再構築を実現する。
  • 同じGMLMヘッドを用いて下流VLタスクを埋め込み問題に再定式化することでプロンプトチューニングを可能にし、事前学習と微調整の間の分布シフトを最小限に抑える。
  • 事前学習とプロンプトチューニングの両方をサポートする同一のTransformerエンコーダ・デコーダアーキテクチャを用いて、一貫性を維持する。位置入力および位置出力タスクを両方処理可能である。
  • BERTと同様に、テキストと位置トークンのマスク率を同一に保つことで、事前学習中のバランスの取れた学習を確保する。

実験結果

リサーチクエスチョン

  • RQ1検出器に依存しない視覚言語事前学習に、明示的なオブジェクト位置モデリングを効果的に統合できるか?
  • RQ2離散的かつ空間的順序を保持し、アノテーションノイズに強く、位置トークンをどのようにモデリングできるか?
  • RQ3統合されたGMLMフレームワークは、言語と位置表現の共同事前学習を可能にするとともに、多様な視覚言語タスクにおける柔軟なプロンプトチューニングを実現できるか?
  • RQ4提案された位置再構築のための順序に配慮した目的関数は、標準的なマスク処理と比較して、局所化および推論性能を向上させるか?
  • RQ5同じGMLMヘッドを、位置に依存するタスクと位置に依存しないタスクの両方のプロンプトチューニングに効果的に再利用でき、事前学習と微調整のギャップを軽減できるか?

主な発見

  • PEVLは、検出器に依存しないVLPモデルの中で、参照表現理解およびフレーズグランドイングタスクで最先端の性能を達成し、明示的な位置モデリングを欠いた先行手法を上回る。
  • 表7に示すように、中間的事前学習段階において、提案された順序に配慮した目的関数は、RefCOCOでの収束速度の向上と性能の向上をもたらす。
  • グランド付き入力を用いる場合、視覚的質問応答などの位置に依存しないタスクの性能が向上し、強化されたロバスト性と一般化能力が示された。
  • 図2に図示されたように、小形オブジェクトに対しても、回帰ベースのモデルと同等の局所化結果を達成した。
  • アブレーションスタディの結果、高いマスク率と、マスクされた位置の包括的カバーが、効果的な位置学習にとって不可欠であることが確認された。
  • 共有されたGMLMヘッドを用いた統合的プロンプトチューニングフレームワークにより、多様な下流タスクにおける一貫性と効果的な適応が可能となり、事前学習と微調整の間の分布シフトが最小限に抑えられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。