[논문 리뷰] Overcoming Language Priors in Visual Question Answering with Adversarial Regularization
이 논문은 질문 전용 적대적 모델과 엔트로피 차이 정규화를 도입하여 VQA의 언어 편향을 줄이고, VQA-CP에서 바이어스 민감한 성능을 개선하는 한편 표준 VQA 정확도를 유지합니다.
Modern Visual Question Answering (VQA) models have been shown to rely heavily on superficial correlations between question and answer words learned during training such as overwhelmingly reporting the type of room as kitchen or the sport being played as tennis, irrespective of the image. Most alarmingly, this shortcoming is often not well reflected during evaluation because the same strong priors exist in test distributions; however, a VQA system that fails to ground questions in image content would likely perform poorly in real-world settings. In this work, we present a novel regularization scheme for VQA that reduces this effect. We introduce a question-only model that takes as input the question encoding from the VQA model and must leverage language biases in order to succeed. We then pose training as an adversarial game between the VQA model and this question-only adversary -- discouraging the VQA model from capturing language biases in its question encoding. Further,we leverage this question-only model to estimate the increase in model confidence after considering the image, which we maximize explicitly to encourage visual grounding. Our approach is a model agnostic training procedure and simple to implement. We show empirically that it can improve performance significantly on a bias-sensitive split of the VQA dataset for multiple base models -- achieving state-of-the-art on this task. Further, on standard VQA tasks, our approach shows significantly less drop in accuracy compared to existing bias-reducing VQA models.
연구 동기 및 목표
- Visual Question Answering (VQA)에서 언어 priors의 문제와 그것이 grounding에 미치는 영향을 동기화하고 정량화한다.
- 질문 전용 구별력을 최소화하는 학습 시 규제을 제안한다.
- 이미지에서 정답으로의 정보 이득을 극대화하는 두 번째 규제자를 도입한다.
- 편향 민감한 분할(VQA-CP)에서의 개선과 표준 VQA 벤치마크에서의 강건성을 보여준다.
- 제안된 방법이 모델-비의존적이며 기존 VQA 아키텍처 위에 적용 가능함을 보여준다.
제안 방법
- 이미지 인코더와 질문 인코더(f, g, h)가 있는 기본 VQA 모델을 정의한다.
- 질문 인코딩 q = g(Q)만을 사용해 답을 예측하는 질문 전용 적대적 모델 f_Q를 도입한다.
- VQA 손실을 최소화하면서 질문 전용 손실을 최대화하는 적대적 목표로 학습한다( q에 대한 그래디언트 역전).
- 이미지로부터 답에 대한 불확실성을 줄이도록 엔트로피 차이 정규화 항 L_H를 추가한다(H(A|Q) - H(A|I,Q) 최대화).
- 합동 목표: min_f,g,h max_f_Q L_VQA - lambda_Q L_QA - lambda_H L_H, 여기서 lambda_Q와 lambda_H는 규제 강도를 제어한다.
- 구현 세부사항 설명: f_Q를 위한 작은 2층 MLP; 엔드-투-엔드 학습; 학습 안정화를 위한 DoE 사용.
실험 결과
연구 질문
- RQ1질문 전용 적대적 모델이 VQA 모델의 언어 priors 의존성을 줄일 수 있는가?
- RQ2적대적 규제가 표준 VQA 성능을 해치지 않으면서 grounding을 개선하는가?
- RQ3엔트로피 차이 항을 도입하면 시각적 grounding 및 편향 완화가 더 향상되는가?
- RQ4제안된 규제들이 모델에 독립적이고 기존 VQA 아키텍처와 호환되는가?
- RQ5편향 민감한(VQA-CP) 벤치마크와 표준(VQA-v2) 벤치마크에서 결과가 어떻게 달라지는가?
주요 결과
- 질문-적대적 모델(Q-Adv), DoE 또는 두 가지를 모두 추가했을 때 기본 모델(SAN and UpDn)에서 VQA-CP v2에 대한 상당한 개선이 나타난다.
- SAN + Q-Adv + DoE가 가장 우수한 바이어스-강건 성능을 달성하며 VQA-CP v2에서 이전의 최첨단 GVQA를 능가한다.
- DoE와 Q-Adv는 보완적 이득을 제공하며, 이들의 조합이 가장 큰 개선을 이끈다.
- 표준 VQA 벤치마크에서 제안된 규제가 GVQA와 같은 바이어스 기반 기법에 비해 정확도 감소가 작게 나타난다.
- 질문-전용 규제가 VQA-CP v2에서 질문 임베딩의 언어 구별력을 감소시키는 것을 시사한다(학습 중 질문-전용 모델의 정확도 감소).
- 이 접근법은 VQA-CP에서 최첨단 결과를 낳고 분포 및 주의 heatmap의 안정성을 높여 더 나은 grounding을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.