Skip to main content
QUICK REVIEW

[論文レビュー] MUTANT: A Training Paradigm for Out-of-Distribution Generalization in Visual Question Answering

Tejas Gokhale, Pratyay Banerjee|arXiv (Cornell University)|Sep 18, 2020
Multimodal Machine Learning Applications参考文献 42被引用数 6
ひとこと要約

この論文では、視覚的質疑応答(VQA)における分布外(OOD)一般化を向上させるためのトレーニングパラダイムであるMUTANTを紹介する。MUTANTは、画像または質問の両方において、知覚的に類似しているが意味的に異なる入力の変異(mutants)をモデルに露出させることで、元の入力と変異入力の予測の一貫性を、投影された答え表現に対するノイズ対比推定損失(noise-contrastive estimation loss)によって強制することで、VQA-CP-v2で69.52%の新たなSOTA精度を達成し、従来手法より10.57%の向上を実現した。

ABSTRACT

While progress has been made on the visual question answering leaderboards, models often utilize spurious correlations and priors in datasets under the i.i.d. setting. As such, evaluation on out-of-distribution (OOD) test samples has emerged as a proxy for generalization. In this paper, we present MUTANT, a training paradigm that exposes the model to perceptually similar, yet semantically distinct mutations of the input, to improve OOD generalization, such as the VQA-CP challenge. Under this paradigm, models utilize a consistency-constrained training objective to understand the effect of semantic changes in input (question-image pair) on the output (answer). Unlike existing methods on VQA-CP, MUTANT does not rely on the knowledge about the nature of train and test answer distributions. MUTANT establishes a new state-of-the-art accuracy on VQA-CP with a $10.57\%$ improvement. Our work opens up avenues for the use of semantic input mutations for OOD generalization in question answering.

研究の動機と目的

  • スプライアスなデータセットバイアスや言語的先行確率に依存するVQAモデルの分布外一般化の悪さを是正すること。
  • 有用なインダクティブバイアスを捨てることなく、モデルが重要な入力変化を認識することを暗黙的に学習させることで、ネガティブバイアス(スプライアス相関)を軽減すること。
  • トレーニング/テストの答え分布のシフトを事前に知らない状態でも、VQA-CP-v2のようなOODベンチマークでのロバストネスを向上させること。
  • 入力画像・質問ペアの構造的意味的変異を学習させることで、「もしも~なら」的推論をモデルが学習できるようにすること。
  • 入力変異と一貫性学習を通じて、肯定的バイアスを強化し、否定的バイアスを暗黙的に弱める新しいトレーニングパラダイムを確立すること。

提案手法

  • モデルは、元の入力(画像・質問)と、知覚的に類似しているが意味的に異なる変異(例:色の変更、語の置換、否定)を持つペairedサンプルでトレーニングされる。
  • 投影層が、クロスモodal特徴量と正解の答えを共通の潜在空間にマップすることで、意味的比較を可能にする。
  • ノイズ対比推定(NCE)損失が、投影された答えベクトルと投影された入力特徴量の距離を最小化することで、元の入力と変異入力の両方で予測の一貫性を強制する。
  • タイプ露出(Type Exposure)モジュールは、特定の質問タイプに対するすべての有効な答えを等確率の候補として扱うことで、予測を言語的先行確率に依存させにくくする。
  • ペairワイズトレーニングプロトコルにより、正しい答えが変化しても、元の入力と変異入力の両方で一貫した答えを出力するようモデルを訓練する。
  • トレーニングに際し、明示的なバイアス除去や、トレーニングとテストの答え分布のシフトに関する事前知識を必要としない。

実験結果

リサーチクエスチョン

  • RQ1構造的意味的変異を施した入力画像・質問ペアのトレーニングは、VQAにおける分布外一般化を向上させることができるか?
  • RQ2明示的なバイアス除去に依存せずに、モデルが答えを変える重要な入力変化を認識できるようにするにはどうすればよいか?
  • RQ3元の入力と変異入力の両方で予測の一貫性を保つことで、VQA-CP-v2のようなOODベンチマークでのロバストネスが向上するか?
  • RQ4明示的なバイアス除去手法よりも、肯定的バイアスを強化し、否定的バイアスを暗黙的に弱めるアプローチが、VQAで優れた性能を発揮するか?
  • RQ5答え空間への投影と一貫性制約を課したトレーニング目的関数は、標準的な分類損失を上回る一般化性能を発揮するか?

主な発見

  • MUTANTは、VQA-CP-v2ベンチマークで69.52%という新たなSOTA精度を達成し、前回の最良モデルより10.57%の向上を示した。
  • 標準的なVQA-V2データセットでも70.24%の精度を達成し、インハウスおよびアウトオブ分布両設定で優れた性能を示した。
  • テストセットの答え分布の事前知識や明示的なバイアス除去を一切必要とせず、一般化性能が向上した。
  • 投影された答えベクトルに対するNCEに基づく一貫性損失は、意味的類似性を効果的に捉え、入力変異に対するロバストネスを向上させた。
  • タイプ露出モジュールは、特定の質問タイプに対するすべての有効な答えを等確率の候補として扱うことで、言語的先行確率への依存を成功裏に低減した。
  • ランダムなアドバーシャル摂動を用いる手法よりも、構造的で意味的に意味のある入力変異を活用することで、本手法は優れた性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。