Skip to main content
QUICK REVIEW

[논문 리뷰] Visual Grounding Methods for VQA are Working for the Wrong Reasons!

Robik Shrestha, Kushal Kafle|arXiv (Cornell University)|2020. 04. 12.
Multimodal Machine Learning Applications참고 문헌 23인용 수 5
한 줄 요약

이 논문은 최근 VQA를 위한 시각적 기반 방법이 성능 향상을 이루는 이유가 더 나은 시각적 정렬 덕분이 아니라 언어적 편향에 대한 의존도를 줄이는 정규화 덕분임을 보여준다. 저자들은 학습 중 진짜 답변을 0으로 설정하는 간단한, 애너테이션 없이도 가능한 정규화 기법을 제안하며, 이는 VQA-CPv2에서 거의 최고 성능(48.9%)을 달성함으로써 성능 향상 요인이 개선된 기반 시각 정렬이 아니라 잘못된 사전 지식을 잊는 데 있음을 입증한다.

ABSTRACT

Existing Visual Question Answering (VQA) methods tend to exploit dataset biases and spurious statistical correlations, instead of producing right answers for the right reasons. To address this issue, recent bias mitigation methods for VQA propose to incorporate visual cues (e.g., human attention maps) to better ground the VQA models, showcasing impressive gains. However, we show that the performance improvements are not a result of improved visual grounding, but a regularization effect which prevents over-fitting to linguistic priors. For instance, we find that it is not actually necessary to provide proper, human-based cues; random, insensible cues also result in similar improvements. Based on this observation, we propose a simpler regularization scheme that does not require any external annotations and yet achieves near state-of-the-art performance on VQA-CPv2.

연구 동기 및 목표

  • VQA에서의 시각적 기반 방법이 진정으로 시각적 정렬을 향상시키는지, 아니면 정규화 효과를 통해 언어적 편향에 대한 의존도를 줄이는지 조사하기 위해.
  • 인간이 애너테이션한 주의 맵이나 시각적 강조 신호가 편향된 VQA 벤치마크에서 성능 향상에 필수적이라는 가정을 도전하기 위해.
  • VQA-CPv2에서 최고 성능을 내는 최소한의, 애너테이션 없이 가능한 정규화 체계를 제안하기 위해.
  • 진정한 시각적 기반과 정규화에 의해 유도된 성능 향상 간의 차이를 구분할 수 있는 평가 프로토콜을 개선할 것을 주장하기 위해.
  • 모델 행동을 검증하기 위해 더 큰 규모의 완전한 애너테이션 기반 기반 데이터셋 또는 명시적인 기반 평가 작업을 요구하기 위해.

제안 방법

  • 학습 중 모든 답변에 대해 점수를 0으로 설정하는 간단한 정규화 손실을 제안하여, 정확성과 관계없이 모델이 정규화된 예측을 하도록 유도한다.
  • 전체 손실를 표준 BCE 손실과 정규화 항의 조합으로 정의한다: $ L := BCE(P(\mathcal{A}), \mathcal{A}_{gt}) + \lambda BCE(P(\mathcal{A}), \mathbf{0}) $, $ \lambda = 1 $.
  • VQA-CPv2 데이터셋의 1% 서브셋을 사용하여 고정된, 무작위 재샘플링된, 전체 데이터셋 변형을 포함해 모델을 훈련하여 정확도의 안정성을 테스트한다.
  • 실제 기반과 관련된, 관련이 없는, 무작위 시각적 신호를 사용해 훈련된 모델 간의 성능을 비교하여 정규화 효과가 진정한 기반과 어떻게 다를지 분리한다.
  • 예측이 관련된 시각적 영역과 일치하는지 평가하기 위해 CPIG(정확한 예측의 기반 여부)와 같은 지표를 사용한다.
  • 훈련 정확도 감소율을 사전 기억 상실의 Proxy로 분석하여, 분포 이탈 데이터에서의 향상된 테스트 성능과 연결한다.

실험 결과

연구 질문

  • RQ1VQA에서의 시각적 기반 방법이 진정으로 시각적 정렬을 향상시키는가, 아니면 정규화를 통해 언어적 사전 편향에 대한 의존도를 줄이는가?
  • RQ2외부 시각적 신호나 주의 맵 없이도 VQA-CPv2에서 성능 향상을 달성할 수 있는가?
  • RQ3편향된 VQA 벤치마크에서의 일반화 향상에 인간이 애너테이션한 주의 맵이나 강조 맵이 필수적인가?
  • RQ4모든 예측에 동일하게 페널티를 주는 단순한 정규화 체계가 복잡한 기반 기반 방법보다 성능이 뛰어나게 되는가?
  • RQ5훈련 정확도를 향상시키지 않으면서도 VQA-CPv2에서 최고 성능을 달성할 수 있는가? 이는 모델이 진정으로 기반되어 있지 않다는 것을 시사한다.

주요 결과

  • 시각적 기반 방법이 가져오는 성능 향상은 향상된 시각적 정렬 때문이 아니라 언어적 편향에 대한 과적합을 줄이는 정규화 덕분이다.
  • 사람이 애너테이션한 신호가 아닌 무작위 또는 관련 없는 시각적 영역에 주의를 기울이는 모델도 인간이 애너테이션한 신호를 사용한 모델와 유사한 정확도 향상을 보인다.
  • 관련, 무관, 무작위 시각적 신호를 사용해 훈련된 모델 간의 예측 차이는 통계적으로 유의미하지 않으며, 이는 의미 있는 기반의 부재를 시사한다.
  • 제안된 0-정규화 기법은 VQA-CPv2에서 48.9%의 정확도를 달성하여 시각적 신호나 애너테이션 없이도 최고 성능을 내며, 이는 기존 최고 성능와 동일하다.
  • 모든 테스트된 방법에서 훈련 정확도가 유의미하게 감소함을 확인하여, 이는 진정한 기반이 아니라는 것을 시사한다 — 진정한 기반이라면 훈련 성능에 해를 끼치지 않는다.
  • CPIG 지표는 HINT와 SCR에서 각각 29.76%와 19.78%의 정확한 예측만이 관련된 시각적 영역에 기반하고 있음을 보여주며, 인간 기반 신호가 있음에도 불구하고 이는 여전히 낮은 수준이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.