Skip to main content
QUICK REVIEW

[논문 리뷰] Greedy Gradient Ensemble for Robust Visual Question Answering

Xinzhe Han, Shuhui Wang|arXiv (Cornell University)|2021. 07. 27.
Multimodal Machine Learning Applications참고 문헌 51인용 수 5
한 줄 요약

이 논문은 언어 편향을 줄이기 위해 순차적으로 편향된 모델을 앙상블하는 모델에 종속적이지 않은 프레임워크인 탐욕적 기울기 앙상블(Greedy Gradient Ensemble, GGE)을 제안한다. GGE는 편향된 데이터 분포에 탐욕스럽게 오버피팅함으로써 기초 모델이 어려운 예시에 집중하도록 유도하여 시각적 기반 능력을 향상시킨다. VQA-CP에서 기존의 추가 애너테이션 없이 기준 모델 대비 17.34%의 정확도 향상을 달성하며, 최신 기술 수준(SoTA) 성능을 확보한다.

ABSTRACT

Language bias is a critical issue in Visual Question Answering (VQA), where models often exploit dataset biases for the final decision without considering the image information. As a result, they suffer from performance drop on out-of-distribution data and inadequate visual explanation. Based on experimental analysis for existing robust VQA methods, we stress the language bias in VQA that comes from two aspects, i.e., distribution bias and shortcut bias. We further propose a new de-bias framework, Greedy Gradient Ensemble (GGE), which combines multiple biased models for unbiased base model learning. With the greedy strategy, GGE forces the biased models to over-fit the biased data distribution in priority, thus makes the base model pay more attention to examples that are hard to solve by biased models. The experiments demonstrate that our method makes better use of visual information and achieves state-of-the-art performance on diagnosing dataset VQA-CP without using extra annotations.

연구 동기 및 목표

  • VQA에서 언어 편향의 근본 원인을 분석하여 두 가지 별개의 형태인 분포 편향과 단서 편향을 규명한다.
  • 기존의 편향 제거 방법이 시각적 및 언어 정보를 충분히 활용하지 못하는 한계를 해결한다.
  • 일반화 가능하고 모델에 종속적이지 않은 프레임워크를 개발하여 분포 외 데이터에 대한 강건성과 시각적 설명 능력을 향상시킨다.
  • 탐욕스럽게 편향된 모델에 오버피팅하는 것이 기초 모델이 어려운, 시각적으로 기반된 예시에 집중하도록 유도할 수 있음을 입증한다.
  • GGE가 추가 애너테이션 없이도 정확도와 시각적 설명 품질을 모두 향상시킬 수 있음을 검증한다.

제안 방법

  • GGE는 언어 편향을 분포 편향(긴 꼬리형 답변 분포)과 단서 편향(의심스러운 QA 상관관계)으로 분해하고, 단계적으로 이를 해결한다.
  • 이 프레임워크는 탐욕 전략을 사용하여 언어 사전 지식에 오버피팅하도록 하는 데이터에서 순차적으로 편향된 모델을 훈련시으며, 기초 모델이 어려운 예시에서 학습하도록 유도한다.
  • GGE는 기능 공간에서 여러 편향된 모델을 앙상블하여 기초 모델의 예측을 정밀하게 보정한다. 이는 기울기 하강법을 모방한다.
  • 자기 앙성(GGE-SF)을 위해 $ r_i = m(e_v(v_i), e_q(q_i)) $ 와 같은 공동 표현을 편향된 특징으로 사용하여 모델에 종속적이지 않은 적용을 가능하게 한다.
  • 이 방법은 두 단계 과정을 적용한다: 먼저 분포 편향 제거(GGE-D), 그 다음 단서 편향 감소와 조합(GGE-DQ)하여 일반화 능력을 향상시킨다.
  • GGE는 다양한 손실 함수(BCE, CE 등)와 기초 모델(UpDn, BAN, S-MRL 등)과 호환되어 광범위한 적용 가능성을 보여준다.

실험 결과

연구 질문

  • RQ1VQA에서 언어 편향을 분포 편향과 단서 편향으로 의미 있게 분해할 수 있으며, 이 둘은 모델 성능에 상호 보완적인 영향을 미치는가?
  • RQ2편향된 모델에 탐욕스럽게 오버피팅하는 앙성 전략이 기초 모델이 시각적으로 기반된 어려운 예시에 집중하도록 유도하는가?
  • RQ3GGE는 추가 애너테이션 없이 VQA-CP에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ4GGE는 주의 집중 기반 및 예측 신뢰도를 측정함으로써 시각적 설명 품질 향상에 얼마나 효과적인가?
  • RQ5GGE는 다양한 기초 모델과 손실 함수에 대해 얼마나 일반화 가능한가?

주요 결과

  • GGE는 VQA-CP 벤치마크에서 UpDn 기준 모델 대비 17.34%의 정확도 향상을 기록하며, 추가 애너테이션 없이도 최신 기술 수준의 성능을 확보한다.
  • GGE-DQ 변종은 VQA-CP에서 전체 정확도 56.25%를 기록하여 기준 모델과 기존 최신 기술 수준 방법들을 뛰어넘는다.
  • 정성적 분석 결과, GGE-DQ는 시각적 기반 능력을 향상시켜 기준 모델이 실패하는 경우(예: 기린이 잎을 뜯는, 물속에 있는 TV) 관련 이미지 영역을 정확히 식별한다.
  • 자기 앙성 변종(GGE-SF)은 사전 정의된 편향된 특징 없이도 44.53%의 정확도를 달성하여 GGE의 일반화 능력을 입증한다.
  • 제거 실험 결과, 분포 편향과 단서 편향 감소가 최적의 성능을 위해 필요하고 상호 보완적임을 확인한다.
  • GGE는 다양한 기초 모델(UpDn, BAN, S-MRL)과 손실 함수(BCE, CE)에서 강력한 성능을 유지하여, 모델에 종속적이지 않고 손실 함수에 종속적이지 않은 설계임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.