Skip to main content
QUICK REVIEW

[論文レビュー] Multimodal Integration of Human-Like Attention in Visual Question Answering

Ekta Sood, Fabian Kögel|arXiv (Cornell University)|Sep 27, 2021
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

本稿では、テキストおよび画像モダリティからの人間らしい注目機構をトランスフォーマー基盤のVQAモデルに統合する初の手法MULANを提案する。最先端のテキストおよび画像のサリエンシー・モデルからの予測を用いて自己注意スコア関数を変更することで、MULANはVQAv2 test-stdで73.98%、test-devで73.72%の最先端性能を達成し、従来モデルと比較して学習可能なパラメータを約80%削減した。

ABSTRACT

Human-like attention as a supervisory signal to guide neural attention has shown significant promise but is currently limited to uni-modal integration - even for inherently multimodal tasks such as visual question answering (VQA). We present the Multimodal Human-like Attention Network (MULAN) - the first method for multimodal integration of human-like attention on image and text during training of VQA models. MULAN integrates attention predictions from two state-of-the-art text and image saliency models into neural self-attention layers of a recent transformer-based VQA model. Through evaluations on the challenging VQAv2 dataset, we show that MULAN achieves a new state-of-the-art performance of 73.98% accuracy on test-std and 73.72% on test-dev and, at the same time, has approximately 80% fewer trainable parameters than prior work. Overall, our work underlines the potential of integrating multimodal human-like and neural attention for VQA

研究の動機と目的

  • 従来の研究が視覚的注目のみに人間らしい注目を統合しているのに対し、テキストに対しても人間らしい注目を統合するという限界を解消すること。
  • マルチモーダルな人間らしい注目が、VQAモデルにおける推論力および一般化性能を向上させることを検証すること。
  • 人間の注目から得られるインダクティブバイアスを用いることで、モデルの複雑さを軽減しながら性能を維持または向上させること。
  • マルチモーダルな人間らしい注目が、長文または構成的質問に与える影響を評価すること。
  • 注目分布と失敗事例の分析を通じて、解釈可能性を提供すること。

提案手法

  • MULANは、テキストサリエンシー・モデル(TSM)と画像サリエンシー・モデル(マルチ・デュレーション・モデル)の予測を、MCANベースのVQAトランスフォーマーの注意スコア関数に統合する。
  • 本手法は、クエリ・キー相互作用の計算中に、人間らしい注目マップをインダクティブバイアスとして統合することで、自己注意メカニズムを変更する。
  • モデルは、VQAv2データセット上でMCAN smallアーキテクチャをバックボーンとして、エンドツーエンドに訓練される。
  • テキストにおける人間の注目は、最近提案されたText Saliency Model(TSM)をVQAに適応することでモデル化する。
  • 画像サリエンシー予測は、視覚的注目の時間的ダイナミクスを捉えるマルチ・デュレーション・サリエンシー・モデルから得られる。
  • 統合は、特徴統合の直前に行われる注意層レベルで実施され、注意重みを直接修正する。

実験結果

リサーチクエスチョン

  • RQ1テキストおよび画像からのマルチモーダルな人間らしい注目が、単一モーダルな監視を超えてVQA性能を向上させることができるか?
  • RQ2人間らしい注目を統合することで、特に長文または複雑な質問において、データセットバイアスへの依存が軽減されるか?
  • RQ3人間の注目マップは、モデルの一般化性能を向上させるとともに、パラメータ数を削減する有効なインダクティブバイアスとして機能するか?
  • RQ4マルチモーダルな人間らしい注目が、注目分布およびモデルの解釈可能性に与える影響は何か?
  • RQ5標準モデルと比較して、統合により訓練中の注目収束がより安定するか?

主な発見

  • MULANは、VQAv2 test-stdスプリットで73.98%、test-devで73.72%という、新たな最先端性能を達成した。
  • 従来の最先端モデルと比較して、学習可能なパラメータを約80%削減しながらも、優れた性能を維持した。
  • 長文の質問(7語以上)において顕著な相対的改善が見られ、相対的増加が0.3%以上に達した。これは、複雑なクエリをより効果的に処理できることを示している。
  • 注目可視化により、MULANが関連する画像領域や重要な質問語(例:'digging'、'fridge')に注目しているのに対し、ベースラインモデルは注目をより広く分散させていることが確認された。
  • モデルは、初期の注目マップが効果的な学習を導くため、より速やかに安定した注目分布に収束した。
  • カテゴリ別分析では、12のカテゴリのうち10で最高の正答率を達成し、特に行動認識およびセンチメント分析分野で顕著な向上が見られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。