Skip to main content
QUICK REVIEW

[論文レビュー] Behind the Scene: Revealing the Secrets of Pre-trained Vision-and-Language Models

Jize Cao, Zhe Gan|arXiv (Cornell University)|May 15, 2020
Multimodal Machine Learning Applications参考文献 47被引用数 14
ひとこと要約

本論文は、事前学習済みビジョンアンドランゲージモデルのマルチモodal知識のエンコーディング方法を解明するために、ターゲットタスクを通じて分析するプローブフレームワークであるVALUEを導入する。この研究により、これらのモデルが推論時にテキスト入力をより重視しており、構造的なクロスモーダル注意を示し、視覚的関係と言語的知識をエンコードしていることが明らかになった。これにより、より良いモデル設計のための知見が得られる。

ABSTRACT

Recent Transformer-based large-scale pre-trained models have revolutionized vision-and-language (V+L) research. Models such as ViLBERT, LXMERT and UNITER have significantly lifted state of the art across a wide range of V+L benchmarks with joint image-text pre-training. However, little is known about the inner mechanisms that destine their impressive success. To reveal the secrets behind the scene of these powerful models, we present VALUE (Vision-And-Language Understanding Evaluation), a set of meticulously designed probing tasks (e.g., Visual Coreference Resolution, Visual Relation Detection, Linguistic Probing Tasks) generalizable to standard pre-trained V+L models, aiming to decipher the inner workings of multimodal pre-training (e.g., the implicit knowledge garnered in individual attention heads, the inherent cross-modal alignment learned through contextualized multimodal embeddings). Through extensive analysis of each archetypal model architecture via these probing tasks, our key observations are: (i) Pre-trained models exhibit a propensity for attending over text rather than images during inference. (ii) There exists a subset of attention heads that are tailored for capturing cross-modal interactions. (iii) Learned attention matrix in pre-trained models demonstrates patterns coherent with the latent alignment between image regions and textual words. (iv) Plotted attention patterns reveal visually-interpretable relations among image regions. (v) Pure linguistic knowledge is also effectively encoded in the attention heads. These are valuable insights serving to guide future work towards designing better model architecture and objectives for multimodal pre-training.

研究の動機と目的

  • 事前学習済みビジョンアンドランゲージモデルの成功を支える内部メカニズムを解明すること。
  • ビジョンとランゲージのモダリティ間で、マルチモーダル表現がどのように統合され、整合化されているかを分析すること。
  • モデルが視覚的関係、言語的知識、クロスモーダル相互作用をどの程度エンコードしているかを評価すること。
  • シングルストリームとツーストリームアーキテクチャの間で、モダリティの注目度と知識エンコードの観点から比較すること。
  • 注目パターンの分析に基づき、将来のモデル設計に役立つ実用的知見を提供すること。

提案手法

  • 注目ヘッドと表現における知識を評価するためのプローブタスクのセットを設計する—視覚的共参照解消、視覚的関係検出、SentEvalベースの言語的プローブ。
  • 比較的分析のため、2つの代表的なモデルであるUNITER(シングルストリーム)とLXMERT(ツーストリーム)にプローブフレームワークを適用する。
  • ネットワークの各レイヤーにおけるマルチモーダル統合度を測定するために、画像およびテキスト表現のクラスタリング分析を実施する。
  • 最終予測におけるモダリティの重要性を評価するため、[CLS]トークンからの注目トレースを分析する。
  • 画像領域とテキスト語の間の注目パターンをプローブすることで、クロスモーダル相互作用を評価する。
  • 微調整をSentEvalタスクで実施し、モデルの各レイヤーにおける性能を比較することで、言語的知識のエンコード度を測定する。

実験結果

リサーチクエスチョン

  • RQ1レイヤーごとのマルチモーダル統合度において、シングルストリームとツーストリームアーキテクチャにはどのような違いがあるか?
  • RQ2最終予測において、画像とテキストのどちらのモダリティが優勢であり、モデルごとにその傾向はどのように異なるか?
  • RQ3注目ヘッドはクロスモーダル統合を捉えるために特化しているか?もしそうなら、その分布はどのようになっているか?
  • RQ4モデルは画像領域間の視覚的関係をどの程度エンコードしているか?また、入力の不一致に対してどれほど頑健か?
  • RQ5事前学習済みV+Lモデルは、BERTと比較して言語的知識をどの程度効果的にエンコードしているか?アーキテクチャによってその差は顕著か?

主な発見

  • 事前学習済みモデルは推論時に視覚的入力よりもテキスト的入力をより多く注目する傾向が強く、最終予測は言語的入力に依存している。
  • 両モデルの一部の注目ヘッドはクロスモーダル相互作用を特に捉えるようにチューニングされており、特にUNITERのようなシングルストリームモデルではより自然に発現している。
  • 事前学習済みモデルの注目行列は一貫性があり、視覚的に解釈可能なパターンを示しており、画像領域と関連するテキスト語とが一致している。
  • 不一致したキャプションが与えられても、視覚的関係検出のパフォーマンスは依然として高いまま維持されており、両モデルとも視覚的関係のエンコードが頑健であることが示された。
  • 言語的知識は注目ヘッドに効果的にエンコードされているが、BERTベースの初期化のおかげで、シングルストリームモデル(例:UNITER)はツーストリームモデル(例:LXMERT)よりもSentEvalベンチマークで優れた性能を示した。
  • ツーストリームアーキテクチャは、関係のないテキスト入力に対してより感受性が高く、不一致したキャプションとペairedされた場合、視覚的表現が著しく劣化するのに対し、シングルストリームモデルではその影響が小さい。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。