Skip to main content
QUICK REVIEW

[論文レビュー] What Vision-Language Models `See' when they See Scenes

Michele Cafagna, Kees van Deemter|arXiv (Cornell University)|Sep 15, 2021
Multimodal Machine Learning Applications参考文献 47被引用数 8
ひとこと要約

この論文は、視覚言語モデルがオブジェクトレベルおよびシーンレベルの画像説明とどのようにアライメントするかを調査し、唯一CLIPが両者で一貫して優れた性能を示すことを発見した。CLIPは視覚的オブジェクト特徴を活用してシーンレベルのキャプションを接地している。研究では、CLIPの優位性がその対照的事前学習目的とVision Transformerバックボーンに起因することを明らかにした。一方、LXMERT や VisualBERT はスタイル的および意味的分布シフトに対して弱いことが判明した。

ABSTRACT

Images can be described in terms of the objects they contain, or in terms of the types of scene or place that they instantiate. In this paper we address to what extent pretrained Vision and Language models can learn to align descriptions of both types with images. We compare 3 state-of-the-art models, VisualBERT, LXMERT and CLIP. We find that (i) V&L models are susceptible to stylistic biases acquired during pretraining; (ii) only CLIP performs consistently well on both object- and scene-level descriptions. A follow-up ablation study shows that CLIP uses object-level information in the visual modality to align with scene-level textual descriptions.

研究の動機と目的

  • 視覚言語モデルがオブジェクトレベルおよびシーンレベルの画像説明と信頼性を持ってアライメントできるかどうかを評価すること。
  • モデルがシーンの意味とその構成オブジェクトとの関連を学習しているかどうかを調査すること。
  • 3つの最先端のV&Lモデルの多様なキャプションスタイルにおけるゼロショット性能を比較すること。
  • アブレーションを通じて、CLIPにおける成功した接地に寄与する視覚的および言語的コンponentsを同定すること。

提案手法

  • 研究は、ADE20K、Localized Narratives (LN)、および新規のHL1Kデータセットの3つのデータセットを用いて、ゼロショット画像テキストマッチング設定でVisualBERT、LXMERT、CLIPを評価した。
  • 画像テキストマッチングは、微調整なしに正しい画像-キャプションペアをどれだけうまく検索できるかを測定するゼロショットリtrieval性能によって評価された。
  • CLIPにおけるアブレーションスタディを実施し、視覚的オブジェクト特徴と言語的シーン記述のアライメント性能への寄与を分離した。
  • モデルは、事前学習データのスケール、アーキテクチャ(二重ストリーム対シングルストリーム)、および目的関数(CLIPでは対照的学習、他はマスク言語モデリング)の観点から比較された。
  • HL1Kデータセットは、アマゾンMechanical Turkを介したクラウドソーシングで収集されたシーンレベルの記述から構成される。
  • 性能評価には、画像テキストマッチングタスクにおけるトップ1およびトップ5正答率などの標準的なリtrieval指標が用いられた。

実験結果

リサーチクエスチョン

  • RQ1視覚言語モデルは、事前学習データとは異なるスタイルのシーンレベルの記述にも一般化できるか?
  • RQ2オブジェクト中心のキャプションで学習したモデルは、シーンレベルの記述に対しても優れた性能を示せるか?
  • RQ3視覚的および言語的コンponentsの中で、シーンレベルの記述の接地に最も重要であるのはどれか?
  • RQ4なぜCLIPはオブジェクトおよびシーンレベルの両方の接地タスクで他のモデルを上回るのか?

主な発見

  • オブジェクトレベルおよびシーンレベルの両方の画像テキストマッチングにおいて、唯一CLIPが一貫して優れた性能を示した。一方、LXMERTおよびVisualBERTはシーンレベルの記述において顕著な性能低下を示した。
  • CLIPは、事前学習中に見られなかったシーンレベルの記述を含むHL1Kデータセットにおいても、強力なゼロショット性能を達成した。
  • アブレーションスタディの結果、CLIPはシーンレベルの言語的記述とアライメントするためにオブジェクトレベルの視覚的特徴に依存していることが判明した。これは、オブジェクト認識がシーン理解を支援していることを示唆している。
  • LXMERTよりもパラメータ数が少ないにもかかわらず、CLIPはそれを上回った。これは、モデルサイズそのものが接地能力を決定づけるわけではないことを示している。
  • CLIPの優れた性能の鍵となる要因は、対照的事前学習目的とVision Transformerバックボーンであり、スケール単体ではなく、アーキテクチャおよび学習目的の選択が重要であることが示唆された。
  • LXMERTおよびVisualBERTは、事前学習データのスタイル的バイアスに敏感であり、それとは異なる言語的スタイルの記述には一般化できなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。