Skip to main content
QUICK REVIEW

[論文レビュー] KD-VLP: Improving End-to-End Vision-and-Language Pretraining with Object Knowledge Distillation

Yongfei Liu, Chenfei Wu|arXiv (Cornell University)|Sep 22, 2021
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

KD-VLPは、2つの新しい事前学習タスクであるオブジェクト指向のマスキングビジョンモデリングとフレーズ・リージョンアライメントを通じて、外部の検出器からオブジェクトレベルの知識を蒸留することで、マルチモodal表現学習を向上させるエンドツーエンドのビジョンアンドランゲージプレトレーニングフレームワークを提案する。この手法は、微調整段階でオブジェクト検出器を必要とせず、複数のビジョン・ランゲージベンチマークで最先端または競争力のある性能を達成する。

ABSTRACT

Self-supervised vision-and-language pretraining (VLP) aims to learn transferable multi-modal representations from large-scale image-text data and to achieve strong performances on a broad scope of vision-language tasks after finetuning. Previous mainstream VLP approaches typically adopt a two-step strategy relying on external object detectors to encode images in a multi-modal Transformer framework, which suffer from restrictive object concept space, limited image context and inefficient computation. In this paper, we propose an object-aware end-to-end VLP framework, which directly feeds image grid features from CNNs into the Transformer and learns the multi-modal representations jointly. More importantly, we propose to perform object knowledge distillation to facilitate learning cross-modal alignment at different semantic levels. To achieve that, we design two novel pretext tasks by taking object features and their semantic labels from external detectors as supervision: 1.) Object-guided masked vision modeling task focuses on enforcing object-aware representation learning in the multi-modal Transformer; 2.) Phrase-region alignment task aims to improve cross-modal alignment by utilizing the similarities between noun phrases and object labels in the linguistic space. Extensive experiments on a wide range of vision-language tasks demonstrate the efficacy of our proposed framework, and we achieve competitive or superior performances over the existing pretraining strategies.

研究の動機と目的

  • 外部のオブジェクト検出器に依存する2段階のVLP手法が直面する、制限されたオブジェクトコンセプト空間と非効率な計算という限界を克服すること。
  • CNNグリッド特徴を直接使用しながらも、オブジェクトレベルの意味を捉えることができるエンドツーエンドのビジョンアンドランゲージプレトレーニングを可能にすること。
  • オブジェクト検出器から得られる意味的および特徴レベルの知識をマルチモーダルトランスフォーマーに蒸留することで、クロスモーダルアライメントを向上させること。
  • エンドツーエンドの方法でオブジェクトに敏感な表現とフレーズ・リージョン対応関係を学習できる事前学習タスクを設計すること。

提案手法

  • CNNバックボーンから得られる画像グリッド特徴を入力とし、マルチモーダルトランスフォーマーで処理するエンドツーエンドのVLPフレームワークを導入することで、推論段階で外部の検出器に依存しなくなるようにする。
  • オブジェクト指向のマスキングビジョンモデリング(OMVM)を提案し、周囲の視覚的および言語的文脈を用いて、オブジェクト領域特徴と意味的ラベルを再構築する。
  • 名詞フレーズとオブジェクトラベルの類似度に基づいて、再構築の対象となるオブジェクト候補を選択する、知識に基づいたマスキング戦略を設計する。
  • フレーズ・リージョンアライメント(PRA)を導入し、言語的フレーズ埋め込みとオブジェクト領域埋め込みを、言語的空間における類似度スコアを用いてアライメントさせる。
  • 標準的なITMとMLMに加え、OMVMとPRAを組み合わせたマルチタスク学習目的関数を採用し、マルチモーダル表現学習を統合的に最適化する。
  • プレトレーニング段階で、オフザシェルのオブジェクト検出器(例:BUTD、Faster R-CNN)を用いてオブジェクト特徴とラベルを抽出し、それらをエンドツーエンドモデルに蒸留する。

実験結果

リサーチクエスチョン

  • RQ1エンドツーエンドのVLPモデルは、推論段階でそれらに依存しない外部の検出器からのオブジェクトレベルの知識を統合することで、より優れた性能を達成できるか?
  • RQ2標準的な特徴マスキング再構築と比較して、オブジェクト指向のマスキングビジョンモデリングは表現学習をどのように向上させるか?
  • RQ3フレーズ・リージョンアライメントは、言語的エンティティと視覚的オブジェクト間のクロスモーダルアライメントをどの程度向上させるか?
  • RQ4より豊富なオブジェクトコンセプト空間(例:1600カテゴリ)から得られる知識蒸留は、より小さいコンセプト空間(例:80カテゴリ)よりも、下流タスクのパフォーマンスを向上させるか?

主な発見

  • KD-VLPはNLVR2で66.71%、VQA-test devで68.19%の精度を達成し、SOHOをそれぞれ1.87%、1.50%上回った。
  • フレーズ・リージョンアライメントタスクは、MSCOCO-TRではR@1を0.78%、MSCOCO-IRでは1.87%向上させ、クロスモーダルアライメントにおける有効性を示した。
  • BUTD(1600カテゴリ)をオブジェクト検出器として使用した場合、COCO(80カテゴリ)でFaster R-CNNよりも優れた性能を示し、より大きなオブジェクトコンセプト空間がプレトレーニングを向上させることを示した。
  • アブレーションスタディの結果、提案されたすべての事前学習タスク(MRC、MRFR、PRA)がパフォーマンス向上に寄与しており、NLVR2ではベースラインから4.58%の向上を達成した。
  • 可視化の結果、知識に基づいたマスキング戦略がフレーズに関連する画像領域に注目していることが確認された一方で、アテンションマップは『すうっとしている』などの語を、対応する顔領域に正確に局在化していた。
  • オブジェクト知識の蒸留による性能向上は、モデルサイズにかかわらず一貫しており、より大きなモデルは外部のオブジェクト意味をより効果的に活用できる能力を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。