[논문 리뷰] MUTANT: A Training Paradigm for Out-of-Distribution Generalization in Visual Question Answering
이 논문은 시각질문응답(VQA)에서 분포 외(OOD) 일반화를 향상시키기 위해 모델이 시각적으로 유사하지만 의미적으로 다른 입력 변형(이미지 또는 질문에서의 변형)에 노출되도록 하는 훈련 프레임워크 MUTANT을 소개한다. 원본 입력과 변형된 입력에 대한 예측 간 일관성을, 투영된 답변 표현에 대한 노이즈 대비 추정(NCE) 손실을 통해 강제함으로써, MUTANT는 VQA-CP-v2에서 기존 최고 성능을 상회하는 새로운 최고 성능 기록인 69.52%의 정확도를 달성하였으며, 이는 이전 방법 대비 10.57% 향상된 성과이다.
While progress has been made on the visual question answering leaderboards, models often utilize spurious correlations and priors in datasets under the i.i.d. setting. As such, evaluation on out-of-distribution (OOD) test samples has emerged as a proxy for generalization. In this paper, we present MUTANT, a training paradigm that exposes the model to perceptually similar, yet semantically distinct mutations of the input, to improve OOD generalization, such as the VQA-CP challenge. Under this paradigm, models utilize a consistency-constrained training objective to understand the effect of semantic changes in input (question-image pair) on the output (answer). Unlike existing methods on VQA-CP, MUTANT does not rely on the knowledge about the nature of train and test answer distributions. MUTANT establishes a new state-of-the-art accuracy on VQA-CP with a $10.57\%$ improvement. Our work opens up avenues for the use of semantic input mutations for OOD generalization in question answering.
연구 동기 및 목표
- 불필요한 데이터셋 편향과 언어적 사전 지식에 의존하는 VQA 모델의 분포 외 일반화 성능이 열 劣한 문제를 해결하기 위해.
- 유용한 인도크티브 편향을 버리지 않고도 부정적 편향(불필요한 상관관계)을 완화하기 위해, 모델이 중요한 입력 변화를 인식하도록 암묵적으로 가르치기 위해.
- 훈련/테스트 세트 간 답변 분포의 변화를 사전에 알지 못해도, VQA-CP-v2와 같은 OOD 벤치마크에서의 강건성을 향상시키기 위해.
- 입력 이미지-질문 쌍의 구조적 의미적 변형을 기반으로 훈련하여 모델이 '만약 그렇다면' 추론을 학습할 수 있도록 하기 위해.
- 입력 변형과 일관성 훈련을 통해 긍정적 편향을 강화하고 부정적 편향을 암묵적으로 감소시키는 새로운 훈련 프레임워크를 수립하기 위해.
제안 방법
- 모델은 원본 입력(이미지-질문 쌍)과 시각적으로 유사하지만 의미적으로 다른 변형 입력(예: 색상 변경, 단어 교체, 否정)을 포함한 쌍으로 구성된 샘플을 훈련한다.
- 교차 모odal 특징과 정답을 공통 잠재 공간으로 매핑하기 위해 투영층을 사용하여 의미 비교를 가능하게 한다.
- 노이즈 대비 추정(NCE) 손실을 통해 투영된 답변 벡터와 투영된 입력 특징 간의 거리를 최소화함으로써, 원본 및 변형된 입력 쌍 간의 일관성을 강제한다.
- 타입 노출(Type Exposure) 모듈은 특정 질문 유형에 대한 모든 유효한 답변을 동일한 확률의 후보로 간주함으로써 예측을 정규화하여 언어적 사전 지식에 대한 의존도를 감소시킨다.
- 쌍별 훈련 프로토콜을 통해, 정답이 변경되더라도 원본 및 변형된 입력에 대해 일관된 답변을 생성하도록 보장한다.
- 훈련 및 테스트 세트 간의 답변 분포 변화를 사전에 알지 못하거나, 명시적인 편향 제거가 필요 없이도 프레임워크가 작동한다.
실험 결과
연구 질문
- RQ1입력 이미지-질문 쌍의 구조적 의미적 변형이 VQA에서 분포 외 일반화를 향상시킬 수 있는가?
- RQ2명시적인 편향 제거 없이도, 정답을 변화시키는 중요한 입력 변화를 인식하도록 모델을 훈련할 수 있는가?
- RQ3원본 및 변형된 입력에 대한 예측 일관성이 VQA-CP-v2와 같은 OOD 벤치마크에서 더 강건한 성능을 이끌 수 있는가?
- RQ4명시적인 편향 제거 방법에 비해, 긍정적 편향을 강화하고 부정적 편향을 암묵적으로 감소시키는 방식이 VQA에서 더 우수한 성능을 낼 수 있는가?
- RQ5답변 공간 투영과 일관성 제약을 가진 훈련 목표 함수가 표준 분류 손실을 넘어서 일반화 성능을 향상시킬 수 있는가?
주요 결과
- MUTANT는 VQA-CP-v2 벤치마크에서 이전 최고 성능 모델 대비 10.57% 향상된 새로운 최고 성능 기록인 69.52%의 정확도를 달성하였다.
- 표준 VQA-V2 데이터셋에서 70.24%의 정확도를 기록하여, 분포 내 및 분포 외 설정 모두에서 뛰어난 성능을 보였다.
- 테스트 세트의 답변 분포를 사전에 알지 못하거나, 명시적인 편향 제거가 필요 없이도 일반화 성능 향상을 달성하였다.
- 투영된 답변 벡터에 기반한 NCE 기반 일관성 손실이 의미적 유사성을 효과적으로 포착하고 입력 변형에 대한 강건성을 향상시켰다.
- 타입 노출 모듈은 질문 유형에 대한 모든 유효한 답변을 동일하게 가능성 있는 후보로 간주함으로써 언어적 사전 지식에 대한 의존도를 성공적으로 감소시켰다.
- 무작위 적대적 변형을 사용하는 방법에 비해, 구조적이고 의미적으로 유의미한 입력 변형을 활용함으로써 성능이 뛰어나졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.