Skip to main content
QUICK REVIEW

[논문 리뷰] Regularizing Attention Networks for Anomaly Detection in Visual Question Answering

Doyup Lee, Yeongjae Cheon|arXiv (Cornell University)|2020. 09. 21.
Multimodal Machine Learning Applications참고 문헌 33인용 수 5
한 줄 요약

이 논문은 시각질문응답(VQA) 모델을 위한 주의 기반 이상 탐지 방법을 제안하며, 다중모달 주의 신뢰도를 활용해 분포 외(OOD) 이미지, OOD 질문 및 관련 없는 이미지-질문 쌍을 탐지한다. 이는 기존의 최대 소프트맥스 확률(MSP) 및 이상치 노출(OE)과 같은 전통적 방법들을 능가한다. 또한 주의 분포의 최대 엔트로피 정규화를 도입하여 정확도를 저하시키지 않은 채 강건성을 크게 향상시켰으며, 다중모달 이상 탐지에서 다중모달 주의가 핵심임을 입증한다.

ABSTRACT

For stability and reliability of real-world applications, the robustness of DNNs in unimodal tasks has been evaluated. However, few studies consider abnormal situations that a visual question answering (VQA) model might encounter at test time after deployment in the real-world. In this study, we evaluate the robustness of state-of-the-art VQA models to five different anomalies, including worst-case scenarios, the most frequent scenarios, and the current limitation of VQA models. Different from the results in unimodal tasks, the maximum confidence of answers in VQA models cannot detect anomalous inputs, and post-training of the outputs, such as outlier exposure, is ineffective for VQA models. Thus, we propose an attention-based method, which uses confidence of reasoning between input images and questions and shows much more promising results than the previous methods in unimodal tasks. In addition, we show that a maximum entropy regularization of attention networks can significantly improve the attention-based anomaly detection of the VQA models. Thanks to the simplicity, attention-based anomaly detection and the regularization are model-agnostic methods, which can be used for various cross-modal attentions in the state-of-the-art VQA models. The results imply that cross-modal attention in VQA is important to improve not only VQA accuracy, but also the robustness to various anomalies.

연구 동기 및 목표

  • OOD 상태와 답변 가능성에 기반해 VQA에서 다섯 가지의 구분 가능한 이상 유형을 정의하고 평가함으로써 실제 세계의 강건성 격차를 해결한다.
  • 단모달 이상 탐지 방법(예: MSP, OE)이 다중모달 VQA 작업에 적용되었을 때의 한계를 규명한다.
  • 다중모달 주의 신뢰도를 사용해 이상을 탐지하는 모델 독립적, 주의 기반 방법을 개발한다.
  • 주의 분포의 최대 엔트로피 정규화를 통해 VQA 모델의 강건성을 향상시키며 정확도를 유지한다.
  • 다중모달 입력에서 다양한 이상을 탐지하는 데 있어 다중모달 주의가 정확도뿐 아니라 필수적임을 입증한다.

제안 방법

  • 이미지/질문의 OOD 상태와 답변 가능성에 기반해 다섯 가지 이상 유형으로 VQA 이상을 분류하여 실패 모드의 완전하고 상호배타적인 분할을 구축한다.
  • 최대 주의 확률(MAP)을 탐지기로 제안: 이미지와 질문 간의 주의 신뢰도가 낮을수록 이상임을 나타낸다.
  • 학습 중 다중모달 주의 분포의 최대 엔트로피 정규화를 도입하여 이상 탐지의 강건성을 향상시킨다.
  • 학습 후 정규화를 적용하여 이상에서 주의 분포의 균일성을 향상시켜, 이상치 노출(OE)에서 관찰되는 정확도 저하를 피한다.
  • 아키텍처 변경 없이 최신 VQA 모델(예: BUTD, VQA-Transformer)의 주의 모듈을 사용하여 모델 독립적 적용 가능성을 확보한다.
  • 추가 모델이나 미세조정 없이도 주의 정규화만으로도 간단한 신뢰도 기반 탐지 메커니즘을 적용한다.

실험 결과

연구 질문

  • RQ1최대 소프트맥스 확률(MSP)은 VQA에서 OOD 이미지, OOD 질문 또는 관련 없는 이미지-질문 쌍을 효과적으로 탐지할 수 있는가?
  • RQ2표준 단모달 이상 탐지 기법(예: 이상치 노출(OE))은 왜 다중모달 VQA 작업에서 강건성을 향상시키지 못하는가?
  • RQ3다중모달 주의 신뢰도가 VQA에서 이상 탐지의 신뢰할 수 있는 대체 지표가 될 수 있으며, 출력 기반 방법과 비교해 어떻게 성능을 내는가?
  • RQ4주의 분포의 최대 엔트로피 정규화는 이상 탐지 성능을 향상시키며 VQA 정확도를 유지하는가?
  • RQ5이중모달 입력을 가진 다중모달 모델에서 강건성을 극대화하기 위해 학습 후 이상을 어떻게 선택해야 하는가?

주요 결과

  • MSP는 단모달 작업에서는 성공했지만, VQA에서 OOD 이미지, OOD 질문 또는 관련 없는 이미지-질문 쌍을 탐지하지 못한다.
  • 이상치 노출(OE)은 주의 모듈을 업데이트할 경우 특히 VQA 정확도를 심각하게 떨어뜨려 VQA 강건성에 효과적이지 않다.
  • 다중모달 주의를 활용한 최대 주의 확률(MAP)은 관련 없는 질문과 OOD 입력을 탐지하는 데 최신 기술 수준의 성능을 달성한다.
  • 주의 분포의 최대 엔트로피 정규화는 VQA 정확도를 저하시키지 않으면서도 이상 탐지 성능을 크게 향상시킨다.
  • 제안된 주의 기반 방법은 다양한 최신 VQA 모델에 적용 가능하며, 서로 다른 주의 메커니즘을 가진 모델에도 모델 독립적으로 적용된다.
  • 다중모달 주의는 정확도뿐 아니라 실제 세계의 다양한 이상을 탐지하는 데 필수적임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.