Skip to main content
QUICK REVIEW

[論文レビュー] Grid-VLP: Revisiting Grid Features for Vision-Language Pre-training

Ming Yan, Haiyang Xu|arXiv (Cornell University)|Aug 21, 2021
Multimodal Machine Learning Applications参考文献 22被引用数 6
ひとこと要約

この論文は、オブジェクト検出器に依存せず、事前学習済みの畳み込みニューラルネットワーク(CNN)から得られるグリッドベースの畳み込み特徴量を用いて、領域ベースの特徴量に代わる視覚言語予学習(VLP)手法であるGrid-VLPを提案する。これにより、より高速で単純かつ効果的なクロスマダル学習が可能になる。MS-COCOとVisual Genomeというドメイン内データのみを用いても、VQA、NLVR2、GQAの各ベンチマークで、多くの領域ベースVLPモデルを上回り、エンドツーエンドのPixelBERTでさえも上回る結果を示しており、グリッド特徴量が効率的かつ高性能なVLPに大きな可能性を秘めていることが示された。

ABSTRACT

Existing approaches to vision-language pre-training (VLP) heavily rely on an object detector based on bounding boxes (regions), where salient objects are first detected from images and then a Transformer-based model is used for cross-modal fusion. Despite their superior performance, these approaches are bounded by the capability of the object detector in terms of both effectiveness and efficiency. Besides, the presence of object detection imposes unnecessary constraints on model designs and makes it difficult to support end-to-end training. In this paper, we revisit grid-based convolutional features for vision-language pre-training, skipping the expensive region-related steps. We propose a simple yet effective grid-based VLP method that works surprisingly well with the grid features. By pre-training only with in-domain datasets, the proposed Grid-VLP method can outperform most competitive region-based VLP methods on three examined vision-language understanding tasks. We hope that our findings help to further advance the state of the art of vision-language pre-training, and provide a new direction towards effective and efficient VLP.

研究の動機と目的

  • 既存の領域ベースの視覚言語予学習(VLP)手法がオブジェクト検出器に依存することによる非効率性と制約を解消すること。
  • グリッドベースの畳み込み特徴量が、VLPにおける領域ベースの特徴量の代替として有効かつ優れた選択肢であるかどうかを検証すること。
  • オブジェクト検出器への依存を排除することで、より高速で単純かつエンドツーエンドで学習可能なVLPモデルを実現すること。
  • 複雑なデータ拡張やファインチューニングのテクニックを用いずに、標準的な視覚言語理解ベンチマークでグリッドベース特徴量の性能を評価すること。

提案手法

  • Grid-VLPは、オブジェクト検出器による領域提案の代わりに、事前学習済みのCNN(例:ResNeXt)を用いて画像からグリッドベースの特徴マップを抽出する。
  • テキストトークンと2次元グリッド特徴マップの間で、LXMERTに類似した二重ストリームTransformerアーキテクチャを用いてクロスマダル統合を実行する。
  • 学習中にランダムなグリッドサンプリングを適用することで、シーケンス長を短縮し、学習を高速化するとともに、長大な視覚的シーケンスに対する耐性を高める。
  • 標準的なVLPの目的関数(マスク言語モデリング、画像・テキストマッチング、画像質問応答)を用いて、MS-COCOとVisual Genomeでモデルを予学習する。
  • 画像の解像度は、短辺を600にリサイズし、長辺を1000まで制限する。予学習段階では、1枚の画像あたり100個のランダムグリッドをサンプリングする。
  • 学習には8台のV100 GPU、バッチサイズ512、AdamW最適化手法、ベース学習率$10^{-4}$を用い、全30エポックで実行する。

実験結果

リサーチクエスチョン

  • RQ1オブジェクト検出器に依存せず、グリッドベースの畳み込み特徴量が、視覚言語予学習において領域ベースの特徴量を上回る性能を発揮できるか?
  • RQ2画像エンコーダーベース(例:ResNeXt-50, -101, -152)の選択が、グリッドベースVLPの性能に与える影響は何か?
  • RQ3入力画像の解像度が、Grid-VLPの精度および推論速度に与える影響は何か?
  • RQ4単純なグリッドベースのアプローチが、ドメイン内データのみを用いても最先端の性能を達成できるか?

主な発見

  • Grid-VLPは、VQA、NLVR2、GQAの3つの下流タスクすべてにおいて、多くの競合する領域ベースVLP手法を上回り、データ拡張や敵対的学習を一切用いずに優れた性能を発揮した。
  • VQA v2.0ベンチマークにおいて、ResNeXt-152を用いたGrid-VLPは76.05%の精度を達成し、オブジェクト検出器を用いた領域ベースのResNeXt-152ベースライン(75.12%)を上回ったが、特徴抽出時間は顕著に短縮された。
  • 入力画像サイズを448×448に縮小することで、推論速度が3倍に向上し、VQA精度は600×1000解像度と比較してわずか0.34%低下した。
  • 画像エンコーダーの深さをResNeXt-50からResNeXt-152に引き上げることで、VQA精度は74.34%から76.05%に向上し、強力な視覚的バックボーンの重要性が裏付けられた。
  • GQAおよびNLVR2ベンチマークにおいて、Grid-VLPは、大規模なドメイン外検出データを用いたモデルをも凌駆する性能を、ドメイン内データのみを用いた予学習で達成した。
  • ランダムグリッドサンプリングに対してモデルの性能が頑健であり、100個から64個や128個にグリッド数を減らしても、顕著な性能低下が見られなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。