[논문 리뷰] Towards Robust Visual Question Answering: Making the Most of Biased Samples via Contrastive Learning
이 논문은 편향된 학습 샘플을 폐기하는 대신 활용하여 시각질문응답(VQA)의 강인성을 향상시키는 대trastive 학습 방법인 MMBS를 제안한다. 편향 제거된 양성 샘플을 구성하고 편향 유무를 구분함으로써, MMBS는 VQA-CP v2와 같은 OOD 데이터에서 일반화 능력을 향상시키면서도 VQA v2와 같은 ID 데이터에서의 성능를 유지하여 일반적으로 발생하는 ID-OOD 정확도 상충 문제를 해결한다.
Models for Visual Question Answering (VQA) often rely on the spurious correlations, i.e., the language priors, that appear in the biased samples of training set, which make them brittle against the out-of-distribution (OOD) test data. Recent methods have achieved promising progress in overcoming this problem by reducing the impact of biased samples on model training. However, these models reveal a trade-off that the improvements on OOD data severely sacrifice the performance on the in-distribution (ID) data (which is dominated by the biased samples). Therefore, we propose a novel contrastive learning approach, MMBS, for building robust VQA models by Making the Most of Biased Samples. Specifically, we construct positive samples for contrastive learning by eliminating the information related to spurious correlation from the original training samples and explore several strategies to use the constructed positive samples for training. Instead of undermining the importance of biased samples in model training, our approach precisely exploits the biased samples for unbiased information that contributes to reasoning. The proposed method is compatible with various VQA backbones. We validate our contributions by achieving competitive performance on the OOD dataset VQA-CP v2 while preserving robust performance on the ID dataset VQA v2.
연구 동기 및 목표
- 기존의 편향 제거 방법이 초래하는 VQA 모델의 ID-OOD 성능 상충 문제를 해결하기 위해.
- VQA 데이터셋에서의 언어 사전 지식에 대한 과도한 의존이 OOD 테스트 세트로의 일반화 능력을 해치는 문제를 해결하기 위해.
- 편향된 샘플의 유용성을 유지하면서도 그로 인한 해로운 영향을 줄이는 방법을 개발하기 위해.
- 표준 VQA 벤치마크에서 높은 ID 정확도를 유지하면서도 VQA-CP v2와 같이 언어 편향 민감도가 높은 OOD 벤치마크에서 강력한 성능을 내는 VQA 모델을 가능하게 하기 위해.
- 다양한 VQA 아키텍처와 편향 제거 전략과 호환되는 일반화 가능한, 백본에 종속되지 않는 프레임워크를 제공하기 위해.
제안 방법
- 기존 학습 샘플에서 언어 사전 지식 관련 정보를 제거하여 두 가지 유형의 양성 샘플을 구성함으로써, 작업에 관련된 시각적 및 언어적 특징을 유지한다.
- 구축된 양성 샘플을 대비 학습에 효과적으로 활용하기 위해 네 가지의 서로 다른 학습 전략을 설계한다.
- 샘플을 편향 유무로 자동으로 분류할 수 있는 새로운 알고리즘을 도입하여 대비 학습 과정에서 차별화된 대응을 가능하게 한다.
- 크로스 모odal 임베딩 공간에서 원본 샘플과 편향 제거된 양성 샘플 간의 거리를 최소화하는 보조 대비 목표를 수립한다.
- 학습 중에 대비 목표를 적용하여 모델이 더 일반적이고 강인한 표현을 학습하도록 유도함으로써, 부정확한 상관관계에 의존하는 정도를 줄인다.
- 대비 모듈을 플러그인 구성 요소로 통합함으로써 다양한 VQA 백본과 기존의 편향 제거 방법과의 호환성을 확보한다.
실험 결과
연구 질문
- RQ1ID 데이터에서 성능이 떨어지지 않으면서 OOD 데이터에서의 VQA 강인성을 향상시킬 수 있는가?
- RQ2억제하는 대신 편향된 학습 샘플을 효과적으로 활용하여 언어 사전 지식을 줄일 수 있는가?
- RQ3편향 유무를 구분할 수 있는 대비 학습 프레임워크를 어떻게 설계할 수 있는가? 이는 일반화 능력을 향상시키는 데 기여한다.
- RQ4제안된 방법은 표준 VQA 벤치마크에서 강력한 성능을 유지하면서도 VQA-CP v2와 같이 편향 민감도가 높은 OOD 벤치마크에서 뛰어난 성능을 내는가?
- RQ5편향 제거된 양성 샘플을 기반으로 한 대비 학습 전략이 관련 시각적 및 언어적 신호에 더 잘 대응하는 주의 메커니즘을 유도하는가?
주요 결과
- 제안된 MMBS 방법은 ID 데이터인 VQA v2에서 높은 정확도를 유지하면서도 OOD 벤치마크인 VQA-CP v2에서 경쟁적인 성능을 달성하여 ID-OOD 상충 문제를 해결한다.
- LMH 및 RUBi와 같은 기존의 편향 제거 베이스라인보다 VQA-CP v2에서 더 뛰어난 성능을 보이며, 테스트 세트와의 답변 분포 일치도 향상되었다.
- 주의 시각화 결과, MMBS는 '색상'과 같은 편향 질문 카테고리 단어에서 '플립-flop'과 같은 더 정보적인 주어진 단어로 주의를 이동시켜 언어 사전 지식 의존도를 감소시켰다.
- LMH와 달리, MMBS는 VQA v2의 일반적이고 편향된 샘플에서도 강력한 성능을 유지하며, 편향 데이터에서의 약화된 지도 신호로 인한 성능 저하가 발생하지 않았다.
- 보조 대비 목표는 원본 샘플과 양성 샘플 간의 임베딩 거리를 효과적으로 좁혀, 강인한 표현 학습을 촉진하였다.
- 여러 VQA 백본과 편향 제거 기법과의 호환성을 입증하여 광범위한 적용 가능성과 일반화 잠재력을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.