Skip to main content
QUICK REVIEW

[論文レビュー] Question Type Guided Attention in Visual Question Answering

Yang Shi, Tommaso Furlanello|arXiv (Cornell University)|Apr 6, 2018
Multimodal Machine Learning Applications参考文献 31被引用数 8
ひとこと要約

本稿では、質問の種類に応じて、下向き(Faster R-CNN)と上向き(ResNet)の視覚特徴の動的バランスをとる、Question Type-guided Attention(QTA)と呼ばれる新しいアテンションメカニズムを提案する。QTAは、『アクティビティ認識』や『カウント』といった重要な質問タイプで5%以上、MCBモデルでは3%の精度向上を達成し、教師なし質問タイプのゼロショット推論を可能にするマルチタスク拡張を備えている。

ABSTRACT

Visual Question Answering (VQA) requires integration of feature maps with drastically different structures and focus of the correct regions. Image descriptors have structures at multiple spatial scales, while lexical inputs inherently follow a temporal sequence and naturally cluster into semantically different question types. A lot of previous works use complex models to extract feature representations but neglect to use high-level information summary such as question types in learning. In this work, we propose Question Type-guided Attention (QTA). It utilizes the information of question type to dynamically balance between bottom-up and top-down visual features, respectively extracted from ResNet and Faster R-CNN networks. We experiment with multiple VQA architectures with extensive input ablation studies over the TDIUC dataset and show that QTA systematically improves the performance by more than 5% across multiple question type categories such as "Activity Recognition", "Utility" and "Counting" on TDIUC dataset. By adding QTA on the state-of-art model MCB, we achieve 3% improvement for overall accuracy. Finally, we propose a multi-task extension to predict question types which generalizes QTA to applications that lack of question type, with minimal performance loss.

研究の動機と目的

  • 視覚質問応答モデルにおける、高レベルの意味的情報(特に質問タイプ)の未利用状態を是正すること。
  • 質問タイプに応じて、下向きと上向きの視覚特徴の統合を動的に重み付けすることで、マルチモodal特徴統合を向上させること。
  • 推論時に質問タイプのアノテーションが利用できない状況でも、効果的なVQAを実現すること。
  • 特に『意味が通らない』質問に関して、TDIUCデータセットに存在するバイアスを分析すること。

提案手法

  • QTAは質問タイプの埋め込みを用いて、ResNet(上向き)とFaster R-CNN(下向き)の視覚特徴の融合を制御する。
  • 各質問タイプごとに学習可能なアテンションゲートを計算し、各視覚特徴ストリームの寄与度を調整する。
  • 質問埋め込みから質問タイプを同時に予測するマルチタスクヘッドを用いて、エンドツーエンドでモデルを訓練する。
  • マルチタスクヘッドにより、推論時に真の質問タイプが与えられていないケースにも一般化できるようにする。
  • 12の質問タイプカテゴリにわたる広範なアブレーションスタディを含め、TDIUCデータセットで手法を評価する。
  • アブレーション実験により、質問タイプのガイダンスが異なる質問タイプごとの性能に与える影響を分離して分析する。

実験結果

リサーチクエスチョン

  • RQ1質問タイプ情報は、VQAモデルにおける視覚特徴選択と統合を改善できるか?
  • RQ2質問タイプに応じて視覚特徴を動的にルーティングすることは、異なる質問カテゴリにおける性能にどのように影響するか?
  • RQ3マルチタスク学習の設定により、訓練時に質問タイプを予測することで、真のラベルなしでの推論がどの程度可能になるか?
  • RQ4『意味が通らない』といったバイアスをもつ質問タイプの存在が、モデルの一般化性能に悪影響を及えるか、QTAはこれを緩和できるか?
  • RQ5QTAが全体的およびタイプ別VQA精度に与える定量的影響は何か?

主な発見

  • QTAは、TDIUCデータセットにおいて『アクティビティ認識』『ユーティリティ』『カウント』といった複数の質問タイプで5%以上の性能向上を達成した。
  • 最先端のMCBモデルにQTAを追加すると、全体の精度が3%向上した。
  • マルチタスク拡張により、訓練時における質問タイプ予測精度が95%以上に達し、VQA性能はほぼ同等を維持した。
  • 訓練時に『意味が通らない』質問を除外すると、ベースラインに比べて単純精度が17%向上し、QTAはさらにその恩恵を拡大した。
  • マルチタスク学習で質問タイプを予測した場合、混同行列はクラス別に高い精度(例:『シーン認識』では99.5%)を示した。
  • 質問タイプが推論時に非表示にされた状態でも、QTAはタイプ別精度の調和平均(MPT)を66.88%、単純精度を80.95%に達成し、優れた一般化性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。