[論文レビュー] Overcoming Language Priors in Visual Question Answering with Adversarial Regularization
この論文は質問のみの敵対的手法と、VQAにおける言語 priors を低減する差分エントロピー正則化を導入し、VQA-CP におけるバイアス感度の高い性能を向上させつつ、標準的な VQA 精度を維持する。
Modern Visual Question Answering (VQA) models have been shown to rely heavily on superficial correlations between question and answer words learned during training such as overwhelmingly reporting the type of room as kitchen or the sport being played as tennis, irrespective of the image. Most alarmingly, this shortcoming is often not well reflected during evaluation because the same strong priors exist in test distributions; however, a VQA system that fails to ground questions in image content would likely perform poorly in real-world settings. In this work, we present a novel regularization scheme for VQA that reduces this effect. We introduce a question-only model that takes as input the question encoding from the VQA model and must leverage language biases in order to succeed. We then pose training as an adversarial game between the VQA model and this question-only adversary -- discouraging the VQA model from capturing language biases in its question encoding. Further,we leverage this question-only model to estimate the increase in model confidence after considering the image, which we maximize explicitly to encourage visual grounding. Our approach is a model agnostic training procedure and simple to implement. We show empirically that it can improve performance significantly on a bias-sensitive split of the VQA dataset for multiple base models -- achieving state-of-the-art on this task. Further, on standard VQA tasks, our approach shows significantly less drop in accuracy compared to existing bias-reducing VQA models.
研究の動機と目的
- Visual Question Answering (VQA) における言語 priors の問題と、それらが grounding に与える影響を動機付け、定量化する。
- 質問のみの判別力を最小化するトレーニング時正則化を提案する。
- 画像から回答への情報量の獲得を最大化する第二の正則化項を導入する。
- バイアス感度の高い分割(VQA-CP)での改善と、標準的な VQA ベンチマークでの頑健性を実証する。
- 本手法がモデルに依存しないこと、既存の VQA アーキテクチャの上に適用可能であることを示す。
提案手法
- 画像エンコーダと質問エンコーダを含むベースの VQA モデルを定義する(f, g, h)。
- 質問エンコーディング q = g(Q) のみを用いて回答を予測する質問のみの敵対的手法 f_Q を導入する。
- VQA 損失を最小化しつつ、質問のみの損失を最大化する敵対的目的で訓練する(q に対する勾配反転)。
- 回答についての不確実性を低減するよう画像の情報を促す差分エントロピー正則化項 L_H を追加する(最大化 H(A|Q) - H(A|I,Q)。
- 結合目的: min_f,g,h max_f_Q L_VQA - lambda_Q L_QA - lambda_H L_H、ここで lambda_Q と lambda_H は正則化の強さを制御する。
- 実装の詳細を説明する: f_Q は小さな 2-layer MLP; エンドツーエンド訓練; DoE の活用で訓練を安定化。
実験結果
リサーチクエスチョン
- RQ1質問のみの敵対手法は VQA モデルの言語 priors への依存を低減できるか?
- RQ2敵対的正則化は標準の VQA パフォーマンスを犠牲にすることなく grounding を改善するか?
- RQ3差分エントロピー項を組み込むことは視覚 grounding とバイアス緩和をさらに強化するか?
- RQ4提案する正則化項はモデル非依存で、既存の VQA アーキテクチャと互換性があるか?
- RQ5バイアス感度の高い(VQA-CP)と標準的な(VQA-v2)ベンチマークで結果はどのように異なるか?
主な発見
- Q-Adv、DoE、あるいは両方を追加した場合、ベースモデル(SAN および UpDn)で VQA-CP v2 の顕著な改善。
- SAN + Q-Adv + DoE が最良のバイアス耐性を示し、VQA-CP v2 で従来の最先端 GVQA を上回る。
- DoE と Q-Adv は補完的な利得をもたらし、両者の組み合わせが最大の改善を生む。
- 標準的な VQA ベンチマークでは、提案された正則化が精度をわずかに低下させる程度で、GVQA のようなバイアスのあるベースラインに比べて低下は小さい。
- 質問のみ正則化は VQA-CP v2 の訓練時に質問のみモデルの精度を低下させる(質問埋め込みの言語識別性が低下していることを示す)。
- 本アプローチは VQA-CP で最先端の結果をもたらし、分布とアテンションヒートマップがより安定することを示し、 grounding の改善を示唆する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。