Skip to main content
QUICK REVIEW

[論文レビュー] Overcoming Language Priors in Visual Question Answering via Distinguishing Superficially Similar Instances

Yike Wu, Yu Zhao|arXiv (Cornell University)|Sep 18, 2022
Multimodal Machine Learning Applications被引用数 7
ひとこと要約

本論文では、質問タイプが同一だが正解が異なる訓練サンプル(表面的に類似したインスタンス)を明示的に区別することで、視覚的質疑応答(VQA)における言語的バイアスを克服するための新しいトレーニングフレームワークを提案する。この手法は、そのようなインスタンス間の答え空間距離を拡大する区別モジュールを導入し、モデルが質問タイプに依存するのではなく、入力の文脈に注目するよう強制することで、VQA-CP v2で最先端の性能を達成し、VQA v2でも優れた結果を維持する。

ABSTRACT

Despite the great progress of Visual Question Answering (VQA), current VQA models heavily rely on the superficial correlation between the question type and its corresponding frequent answers (i.e., language priors) to make predictions, without really understanding the input. In this work, we define the training instances with the same question type but different answers as extit{superficially similar instances}, and attribute the language priors to the confusion of VQA model on such instances. To solve this problem, we propose a novel training framework that explicitly encourages the VQA model to distinguish between the superficially similar instances. Specifically, for each training instance, we first construct a set that contains its superficially similar counterparts. Then we exploit the proposed distinguishing module to increase the distance between the instance and its counterparts in the answer space. In this way, the VQA model is forced to further focus on the other parts of the input beyond the question type, which helps to overcome the language priors. Experimental results show that our method achieves the state-of-the-art performance on VQA-CP v2. Codes are available at \href{https://github.com/wyk-nku/Distinguishing-VQA.git}{Distinguishing-VQA}.

研究の動機と目的

  • VQAモデルが、質問タイプと頻出答えの間にある表面的な相関に依存するという広範な問題に対処すること。
  • 『表面的に類似したインスタンス』という概念を定義・形式化すること。これは、同じ質問タイプだが異なる正解を持つ訓練サンプルを指す。
  • このようなインスタンスを明示的に区別するようVQAモデルを促すトレーニングフレームワークを提案すること。
  • 視覚的・文脈的手がかりに注目する能力を強化することで、VQA-CP v2のような分布シフトベンチマークにおけるモデルの一般化性能と耐障害性を向上させること。

提案手法

  • 各訓練インスタンスに対して、データセット内の実際のインスタンスとデータ拡張によって生成された合成インスタンスを含む、表面的に類似した類似インスタンスの集合を構築する。
  • 与えられたインスタンスの予測答え分布と、その表面的に類似した類似インスタンス群の答え分布との間の距離を、答え空間で拡大する区別モジュールを設計する。
  • 各類似インスタンスに対するモデルの予測の信頼度に基づいて、損失を動的にスケーリングするための調節要因 $ p_{jm} $ を導入する。
  • 標準的なVQA損失 $ \mathcal{L}_{vqa} $ と区別損失 $ \mathcal{L}_{dis} $ を組み合わせた二重損失のトレーニング目的関数を定式化し、両者のバランスを調整するハイパーパramータ比 $ \lambda_2 / \lambda_1 $ を用いる。
  • 表面的に類似したインスタンス集合からのサンプリングを可能にするよう、低レベルの入力ではなく高レベル特徴上で動作することで、リソース効率の高いトレーニングを実現する。
  • データ拡張を用いて多様な合成類似インスタンスを生成し、区別に必要なトレーニング信号の多様性と量を顕著に増加させる。

実験結果

リサーチクエスチョン

  • RQ1同じ質問タイプだが異なる答えを持つ表面的に類似したインスタンスを明示的に区別することで、VQAモデルの言語的バイアスへの依存度を低下させることができるか?
  • RQ2提案された区別モジュールは、VQA-CP v2のような分布シフトベンチマークにおけるモデルの一般化性能向上にどの程度有効か?
  • RQ3実際のインスタンスと合成インスタンスの両方が、モデル性能と耐障害性の向上に果たす寄与度はそれぞれどの程度か?
  • RQ4標準的なVQA損失と区別損失のバランスが、モデルの性能と一般化性能に与える影響は何か?
  • RQ5提案手法は、SAN や UpDn といった異なるVQAモデルアーキテクチャにも一般化可能か?

主な発見

  • 提案手法は、VQA-CP v2のテストセットにおいて、61.13%という最先端の全体精度を達成した。
  • 区別モジュールを削除すると性能は44.62%に低下し、言語的バイアスの緩和にそのモジュールが果たす重要性が明確になった。
  • 合成インスタンスは実インスタンスよりも寄与度が顕著に高く、その量と多様性のおかげでモデルの一般化性能が向上した。
  • この手法はアーキテクチャを問わず良好に一般化され、SAN および UpDn モデルの両方でVQA-CP v2で性能向上を達成した。特に、SAN+DMは61.17%の精度を達成した。
  • 区別損失の最適な比 $ \lambda_2 / \lambda_1 $ は中程度の範囲にあり、値が高すぎると過学習が生じ、低すぎると言語的バイアスが抑制されない。
  • アブレーションスタディにより、区別モジュールおよび調節要因 $ p_{jm} $ が両方とも性能に不可欠であることが確認され、いずれかを除去すると著しい精度低下が生じた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。