Skip to main content
QUICK REVIEW

[論文レビュー] Regularizing Attention Networks for Anomaly Detection in Visual Question Answering

Doyup Lee, Yeongjae Cheon|arXiv (Cornell University)|Sep 21, 2020
Multimodal Machine Learning Applications参考文献 33被引用数 5
ひとこと要約

本稿では、視覚質問応答(VQA)モデル向けに、クロスモーダル注意の信頼度を活用して分布外(OOD)画像、OOD質問、不適切な画像-質問ペairを検出する注目型異常検出手法を提案する。従来の手法(最大ソフトマックス確率(MSP)、オーバーエキスポージャー(OE))を上回る性能を発揮する。さらに、注目分布に対する最大エントロピー正則化を導入し、VQAの精度を損なうことなく、著しく高い耐障害性を実現した。これにより、マルチモーダル異常検出においてクロスモーダル注意が不可欠であることが明らかになった。

ABSTRACT

For stability and reliability of real-world applications, the robustness of DNNs in unimodal tasks has been evaluated. However, few studies consider abnormal situations that a visual question answering (VQA) model might encounter at test time after deployment in the real-world. In this study, we evaluate the robustness of state-of-the-art VQA models to five different anomalies, including worst-case scenarios, the most frequent scenarios, and the current limitation of VQA models. Different from the results in unimodal tasks, the maximum confidence of answers in VQA models cannot detect anomalous inputs, and post-training of the outputs, such as outlier exposure, is ineffective for VQA models. Thus, we propose an attention-based method, which uses confidence of reasoning between input images and questions and shows much more promising results than the previous methods in unimodal tasks. In addition, we show that a maximum entropy regularization of attention networks can significantly improve the attention-based anomaly detection of the VQA models. Thanks to the simplicity, attention-based anomaly detection and the regularization are model-agnostic methods, which can be used for various cross-modal attentions in the state-of-the-art VQA models. The results imply that cross-modal attention in VQA is important to improve not only VQA accuracy, but also the robustness to various anomalies.

研究の動機と目的

  • OOD状態および回答可能性に基づき、VQAにおける5つの異なる異常タイプを定義・評価し、現実世界の耐障害性のギャップを解消すること。
  • 単モーダル異常検出手法(例:MSP、OE)がマルチモーダルVQAタスクに適用された際の限界を特定すること。
  • クロスモーダル注意の信頼度を用いた、モデルに依存しない注目型異常検出手法の開発。
  • 注目分布の最大エントロピー正則化を活用し、VQAモデルの耐障害性を向上させつつ、精度を維持すること。
  • クロスモーダル注意が、精度の向上だけでなく、マルチモーダル入力における多様な異常を検出するために不可欠であることを実証すること。

提案手法

  • 画像/質問のOOD状態と回答可能性に基づき、異常を5つのタイプに分類し、失敗モードを完全かつ排他的にカバーする。
  • 最大注目確率(MAP)を検出器として提案:画像と質問間の注目信頼度が低い場合、異常と判定する。
  • トレーニング段階でクロスモーダル注目分布に対する最大エントロピー正則化を導入し、異常検出の耐障害性を向上させる。
  • トレーニング後の段階で正則化を適用し、異常入力における注目分布の均一性を向上させ、オーバーエキスポージャー(OE)で見られる精度の低下を回避する。
  • アーキテクチャの変更なしに、最先端のVQAモデル(例:BUTD、VQA-Transformer)の注目モジュールを用いることで、モデルに依存しない適用性を確保する。
  • 追加のモデルやファインチューニングを必要としない、単純な信頼度ベースの検出メカニズムを採用する。

実験結果

リサーチクエスチョン

  • RQ1最大ソフトマックス確率(MSP)は、VQAにおいてOOD画像、OOD質問、不適切な画像-質問ペアを効果的に検出できるか?
  • RQ2標準的な単モーダル異常検出手法(例:オーバーエキスポージャー(OE))は、なぜマルチモーダルVQAタスクにおいて耐障害性を向上させないのか?
  • RQ3クロスモーダル注目信頼度は、VQAにおける異常検出の信頼できる代理指標として機能するか?出力ベースの手法と比較してどうなるか?
  • RQ4注目分布の最大エントロピー正則化は、異常検出性能を向上させつつ、VQAの精度を維持できるか?
  • RQ5bimodal入力を持つマルチモーダルモデルの耐障害性を最大化するために、トレーニング後の段階で異常をどのように選別すべきか?

主な発見

  • MSPは、単モーダルタスクでは成功しているが、VQAにおいてはOOD画像、OOD質問、不適切な画像-質問ペアを検出できない。
  • オーバーエキスポージャー(OE)は、特に注目モジュールの更新を伴うと、VQAの精度を著しく低下させ、VQAの耐障害性向上には不適切である。
  • クロスモーダル注目信頼度を用いた最大注目確率(MAP)は、不適切な質問およびOOD入力の検出において、最先端の性能を達成した。
  • 注目分布の最大エントロピー正則化は、VQAの精度を損なわず、異常検出性能を著しく向上させた。
  • 提案手法はモデルに依存せず、異なる注目メカニズムを備えた多数の最先端VQAモデルに適用可能である。
  • クロスモーダル注目は、VQAの精度向上に不可欠であるだけでなく、マルチモーダル入力における多様な現実世界の異常を検出するためにも不可欠である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。