Skip to main content
QUICK REVIEW

[論文レビュー] Probing Inter-modality: Visual Parsing with Self-Attention for Vision-Language Pre-training

Hongwei Xue, Yupan Huang|arXiv (Cornell University)|Jun 25, 2021
Multimodal Machine Learning Applications参考文献 43被引用数 9
ひとこと要約

本論文は、自己注意機構(視覚解析)を用いて長距離の視覚的関係をよりよく捉えるために、畳み込みニューラルネットワーク(CNN)の代わりに完全にTransformerに基づく視覚埋め込みを提案する。視覚言語事前学習において、相互モダリティ最適化のためのマスク特徴回帰(MFR)と、クロスモダリティ相互作用を測定するための相互モダリティフロー(IMF)を導入し、複数の視覚言語タスクで最先端の性能を達成するとともに、優れた相互モダリティ整合性を示した。

ABSTRACT

Vision-Language Pre-training (VLP) aims to learn multi-modal representations from image-text pairs and serves for downstream vision-language tasks in a fine-tuning fashion. The dominant VLP models adopt a CNN-Transformer architecture, which embeds images with a CNN, and then aligns images and text with a Transformer. Visual relationship between visual contents plays an important role in image understanding and is the basic for inter-modal alignment learning. However, CNNs have limitations in visual relation learning due to local receptive field's weakness in modeling long-range dependencies. Thus the two objectives of learning visual relation and inter-modal alignment are encapsulated in the same Transformer network. Such design might restrict the inter-modal alignment learning in the Transformer by ignoring the specialized characteristic of each objective. To tackle this, we propose a fully Transformer visual embedding for VLP to better learn visual relation and further promote inter-modal alignment. Specifically, we propose a metric named Inter-Modality Flow (IMF) to measure the interaction between vision and language modalities (i.e., inter-modality). We also design a novel masking optimization mechanism named Masked Feature Regression (MFR) in Transformer to further promote the inter-modality learning. To the best of our knowledge, this is the first study to explore the benefit of Transformer for visual feature learning in VLP. We verify our method on a wide range of vision-language tasks, including Image-Text Retrieval, Visual Question Answering (VQA), Visual Entailment and Visual Reasoning. Our approach not only outperforms the state-of-the-art VLP performance, but also shows benefits on the IMF metric.

研究の動機と目的

  • 畳み込みニューラルネットワーク(CNN)が長距離の視覚的関係をモデル化する能力に限界を示すため、視覚言語事前学習における効果的な相互モダリティ統合を妨げる点を是正する。
  • 視覚言語モデルにおける視覚特徴学習に自己注意機構を用いる利点を検討し、CNNベースの視覚エンコーダーを越えるアプローチを模索する。
  • 視覚解析の依存関係を活用して言語にガイドされた視覚表現学習を促進する、新たなマスキングメカニズム(MFR)を設計する。
  • 訓練中の視覚と言語モダリティ間の情報フローを定量化・探査するため、相互モダリティフロー(IMF)を導入する。
  • 提案手法の有効性を多様な視覚言語タスクで評価し、アブレーションおよびプロービング研究を通じて相互モダリティ統合ダイナミクスを分析する。

提案手法

  • 自己注意を用いてグローバルかつ長距離の視覚的関係モデリングを可能にするために、CNNベースの視覚エンコーダーを完全にTransformerに基づく視覚埋め込みネットワークに置き換える。
  • 視覚特徴内のトークン間依存関係を学習するための視覚解析を導入し、各視覚トークンが学習された注意重みを通じて他のすべてのトークンに注目する。
  • 高依存性を持つ視覚トークンをマスキングすることで、マルチモーダルTransformerが言語信号に依存するよう強制する、新たなマスキング最適化メカニズムとしてマスク特徴回帰(MFR)を設計する。
  • 視覚と言語モダリティ間の情報フローを層ごとに定量化するための指標として、Transformer層を横断する入力から出力への注意フローとして計算される相互モダリティフロー(IMF)を提案する。
  • 標準的なVLP目的関数(MLM、MFR)を用いてモデルをエンドツーエンドで訓練し、IMFを診断ツールとして活用してモダリティ間相互作用ダイナミクスを分析する。
  • 各層における視覚的および言語的特徴にk-meansクラスタリングを適用し、正規化相互情報量(NMI)を計算することで、データ分布の統合度を評価し、IMFとは補完的な分析を提供する。

実験結果

リサーチクエスチョン

  • RQ1完全にTransformerに基づく視覚エンコーダーは、視覚的関係の学習と視覚言語事前学習における相互モダリティ統合の向上において、CNNベースのエンコーダーを上回ることができるか?
  • RQ2自己注意による視覚解析は、CNNの局所的受容野と比較して、長距離の視覚的依存関係をどのように改善するか?
  • RQ3提案されたMFRマスキング機構は、高依存性を持つ視覚トークンに注目することで、クロスモダリティ注意をどの程度向上させるか?
  • RQ4相互モダリティフロー(IMF)指標は、下流タスクの性能とどの程度相関しているか?また、真の相互モダリティ相互作用を反映する有効な診断ツールとして機能するか?
  • RQ5NMIによるプロービングによるデータ分布統合とIMFの両方から、異なるVLPアーキテクチャにおけるモダリティ相互作用の度合いとダイナミクスについて、どのような知見が得られるか?

主な発見

  • 提案された完全にTransformerに基づく視覚埋め込みは、画像・テキスト検索、VQA、視覚的含意、視覚的推論を含む複数のベンチマークで、最先端のVLPモデルを上回る性能を達成した。
  • 全Transformer層にわたり一貫して高い相互モダリティフロー(IMF)スコアを達成しており、視覚と言語モダリティ間のより強く持続的な情報フローが示された。
  • MFRは高依存性を持つ視覚トークンをマスキングすることで、アライメント過程で言語コンテキストに依存するようモデルを強制し、性能を顕著に向上させた。
  • IMF指標は下流タスクの性能と正の相関を示し、相互モダリティ学習の診断ツールとしての有効性が裏付けられた。
  • アブレーションスタディにより、視覚解析とMFRの両方が不可欠な要素であることが確認され、前者はより良い視覚的関係モデリングを、後者はより強化されたクロスモダリティ注意を実現した。
  • NMI分析から、エンドツーエンドの視覚バックボーンを備えたモデル(SOHOおよび本研究のモデル)は、UNITERよりも低いNMIスコアを示しており、モダリティ分離が軽減され、統合度が高まっていることが示された。ただし、IMFはNMIよりも相互作用の測定により正確であることが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。