Skip to main content
QUICK REVIEW

[논문 리뷰] Loss re-scaling VQA: Revisiting the LanguagePrior Problem from a Class-imbalance View

Yangyang Guo, Liqiang Nie|arXiv (Cornell University)|2020. 10. 30.
Multimodal Machine Learning Applications참고 문헌 55인용 수 6
한 줄 요약

이 논문은 시각질문응답(VQA)에서 언어 사전 문제를 해결하기 위해 손실 재스케일링 기법을 제안한다. 이는 언어 사전 문제를 클래스 불균형 문제로 해석함으로써, 질문 유형별로 정답 빈도에 따라 동적 손실 가중치를 할당함으로써 빈도가 높고 잘못된 정답에 대한 모델의 편향을 줄인다. 이 방법은 여섯 개의 강력한 기초 모델에 대해 VQA-CP 벤치마크에서 성능을 크게 향상시키며, VQA-CP v2에서 최대 14.6%의 성능 향상을 기록한다.

ABSTRACT

Recent studies have pointed out that many well-developed Visual Question Answering (VQA) models are heavily affected by the language prior problem, which refers to making predictions based on the co-occurrence pattern between textual questions and answers instead of reasoning visual contents. To tackle it, most existing methods focus on enhancing visual feature learning to reduce this superficial textual shortcut influence on VQA model decisions. However, limited effort has been devoted to providing an explicit interpretation for its inherent cause. It thus lacks a good guidance for the research community to move forward in a purposeful way, resulting in model construction perplexity in overcoming this non-trivial problem. In this paper, we propose to interpret the language prior problem in VQA from a class-imbalance view. Concretely, we design a novel interpretation scheme whereby the loss of mis-predicted frequent and sparse answers of the same question type is distinctly exhibited during the late training phase. It explicitly reveals why the VQA model tends to produce a frequent yet obviously wrong answer, to a given question whose right answer is sparse in the training set. Based upon this observation, we further develop a novel loss re-scaling approach to assign different weights to each answer based on the training data statistics for computing the final loss. We apply our approach into three baselines and the experimental results on two VQA-CP benchmark datasets evidently demonstrate its effectiveness. In addition, we also justify the validity of the class imbalance interpretation scheme on other computer vision tasks, such as face recognition and image classification.

연구 동기 및 목표

  • VQA에서 언어 사전 문제의 근본 원인을 규명하여, 모델이 시각적 추론 대신 통계적 단서에 의존하게 되는 이유를 밝히는 것.
  • 언어 사전 문제를 클래스 불균형 문제로 재해석하여, 빈도가 높은 정답이 모델 예측을 지배하는 방식으로 설명하는 것.
  • 훈련 데이터의 편향을 보완하기 위해 희귀하지만 올바른 정답에 대해 더 높은 가중치를 할당하는 손실 재스케일링 기법을 개발하는 것.
  • 이 방법의 효과성을 여러 강력한 VQA 기초 모델과 표준 VQA-CP 벤치마크에서 검증하는 것.
  • 클래스 불균형 해석을 VQA를 초월한 다른 시각-언어 작업, 예를 들어 이미지 분류 및 얼굴 인식 작업으로 일반화하는 것.

제안 방법

  • 질문 유형별로 레이블 분포가 비대칭해지면서 모델이 빈도가 높은 정답에 과적합되는 언어 사전 문제를 클래스 불균형 문제로 해석한다.
  • 주어진 질문 유형에서 훈련 세트 내 정답 빈도에 기반해 각 정답에 대한 동적 손실 가중치를 계산하는 손실 재스케일링 기법을 도입한다.
  • Sigmoid-BCE 또는 Softmax-Cross-Entropy를 사용하여 재가중된 손실을 훈련 중에 적용하며, backpropagation 효율성을 유지하는 유도된 기울기를 활용한다.
  • 예측 대상 외의 정답(예: 'how many' 질문에 대해 'yes')을 억제하는 정답 마스크 모듈을 통합하여 일반화 성능을 향상시킨다.
  • 질문 유형별 통계를 활용해 손실 가중치를 계산함으로써 희귀하지만 올바른 정답이 더 높은 기울기 신호를 받도록 보장한다.
  • 훈련 안정성과 수렴 성능 향상을 위해 손실 가중 함수에 소프트플러스-G 활성화 함수를 활용한다.

실험 결과

연구 질문

  • RQ1왜 VQA 모델은 정답이 명백하게 시각적으로 확인 가능한 경우에도 빈도가 높은 잘못된 정답(예: 'how many' 질문에 대해 '2')을 지속적으로 예측하는가?
  • RQ2언어 사전 문제를 VQA 맥락에서 클래스 불균형 문제로 공식적으로 해석할 수 있는가?
  • RQ3질문 유형별로 정답 빈도에 따라 손실을 재가중하는 것이 빈도가 높은 정답에 대한 모델 편향을 효과적으로 줄일 수 있는가?
  • RQ4제안된 손실 재스케일링 방법은 언어 사전 문제를 완화하는 데 기존의 Focal Loss와 비교해 어떤가?
  • RQ5클래스 불균형 해석과 손실 재스케일링 기법은 VQA를 초월한 다른 시각-언어 작업으로 일반화될 수 있는가?

주요 결과

  • 언어 사전 문제의 근본 원인은 질문 유형별로 빈도가 높은 정답에 대해 훈련 데이터에서 과적합되기 때문이다. 특히 정답 분포가 비대칭인 질문 유형에서 두드러진다.
  • 제안된 손실 재스케일링 방법은 기초 모델에 비해 VQA-CP v2에서 최대 14.6%까지 정확도 향상을 기록하며, 평가된 여섯 개의 모든 기초 모델에서 일관된 성능 향상을 보였다.
  • UpDn 모델의 경우, 정답 마스킹과 손실 재스케일링을 병행 적용했을 때 VQA-CP v2에서 절대 정확도 향상이 14.6%에 달했으며(38.80%에서 53.26%로), 이는 매우 높은 성능 향상이다.
  • 빈도 기반 손실 가중치 부여를 통해 질문 유형별로 더 명확한 지침을 제공함으로써, Focal Loss보다 더 명시적이고 효과적인 성능 향상을 제공한다.
  • 시각화 결과는 재스케일링을 적용한 모델이 언어적 단서에 혼란을 겪지 않고, 정확히 관련 시각적 영역(예: 올바른 아이 또는 동물)에 집중함을 보여준다.
  • 클래스 불균형 해석은 얼굴 인식 및 이미지 분류 작업에서도 검증되었으며, 이는 VQA를 초월한 보편적 적용 가능성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.