[논문 리뷰] Overcoming Language Priors in Visual Question Answering via Distinguishing Superficially Similar Instances
이 논문은 동일한 질문 유형을 가진데도 다른 정답을 가진 표면적으로 유사한 인스턴스들 간의 명확한 구분을 통해 시각질문응답(VQA)에서 언어 선호도 문제를 해결하기 위한 새로운 훈련 프레임워크를 제안한다. 이 방법은 이러한 인스턴스들 간의 정답 공간 거리를 증가시키는 구분 모듈을 도입하여 모델이 질문 유형을 넘어서 시각적 맥락에 주의를 기울이도록 유도하며, VQA-CP v2에서 최신 기술 수준의 성능을 달성하면서도 VQA v2에서도 뛰어난 성능을 유지한다.
Despite the great progress of Visual Question Answering (VQA), current VQA models heavily rely on the superficial correlation between the question type and its corresponding frequent answers (i.e., language priors) to make predictions, without really understanding the input. In this work, we define the training instances with the same question type but different answers as extit{superficially similar instances}, and attribute the language priors to the confusion of VQA model on such instances. To solve this problem, we propose a novel training framework that explicitly encourages the VQA model to distinguish between the superficially similar instances. Specifically, for each training instance, we first construct a set that contains its superficially similar counterparts. Then we exploit the proposed distinguishing module to increase the distance between the instance and its counterparts in the answer space. In this way, the VQA model is forced to further focus on the other parts of the input beyond the question type, which helps to overcome the language priors. Experimental results show that our method achieves the state-of-the-art performance on VQA-CP v2. Codes are available at \href{https://github.com/wyk-nku/Distinguishing-VQA.git}{Distinguishing-VQA}.
연구 동기 및 목표
- 질문 유형과 빈번한 정답 간의 표면적인 상관관계에 기반해 입력 맥락을 이해하지 못하고 언어 선호도에 의존하는 VQA 모델의 광범위한 문제를 해결하기 위해.
- 표면적으로 유사한 인스턴스라는 개념을 정의하고 수식적으로 명시하기 위해 — 즉, 동일한 질문 유형을 공유하지만 다른 참값 정답을 가진 훈련 샘플들.
- 이러한 인스턴스들 간의 구분을 명시적으로 장려함으로써 VQA 모델이 언어 선호도에 의존하는 것을 줄이기 위한 훈련 프레임워크를 제안하기 위해.
- 시각적 및 맥락적 신호에 대한 주의를 질문 유형을 초월하도록 강화함으로써, 분포 이탈 벤치마크인 VQA-CP v2에서의 모델 일반화 및 강건성 향상시키기 위해.
제안 방법
- 각 훈련 인스턴스에 대해, 데이터셋에서 실제로 존재하는 인스턴스들과 데이터 증강을 통해 생성된 합성 인스턴스들을 포함한 표면적으로 유사한 대응 인스턴스 집합을 구성한다.
- 주어진 인스턴스의 예측 정답 분포와 그 표면적으로 유사한 대응 인스턴스들의 정답 분포 간의 거리를 정답 공간에서 증가시키는 구분 모듈을 설계한다.
- 각 대응 인스턴스에 대해 모델의 예측 신뢰도에 따라 손실을 동적으로 조정하기 위해 모odulating 요소 $ p_{jm} $ 를 도입한다.
- 표준 VQA 손실 $ \mathcal{L}_{vqa} $ 와 구분 손실 $ \mathcal{L}_{dis} $ 를 조합한 이중 손실 훈련 목표를 제안하며, 이 두 손실 간의 균형을 맞추기 위해 하이퍼파라미터 비율 $ \lambda_2 / \lambda_1 $ 을 사용한다.
- 표면적으로 유사한 인스턴스 집합에서 샘플링을 통해 자원 효율적인 훈련이 가능하도록 고수준 특징 위에서 작동하도록 효율적으로 구현한다.
- 다양한 합성 대응 인스턴스를 생성하기 위해 데이터 증강을 활용하여, 구분을 위한 훈련 신호의 다양성과 양을 크게 증가시킨다.
실험 결과
연구 질문
- RQ1동일한 질문 유형을 가진데도 다른 정답을 가진 표면적으로 유사한 인스턴스들 간의 명시적 구분이 VQA 모델의 언어 선호도 의존도를 줄이는가?
- RQ2제안된 구분 모듈이 VQA-CP v2와 같은 분포 이탈 벤치마크에서 모델 일반화 능력을 얼마나 효과적으로 향상시키는가?
- RQ3실제 대응 인스턴스와 합성 대응 인스턴스 중 어느 쪽이 성능 향상과 강건성 향상에 더 기여하는가?
- RQ4표준 VQA 손실과 구분 손실 간의 균형 비율이 모델 성능과 일반화 능력에 어떤 영향을 미치는가?
- RQ5제안된 방법이 SAN 및 UpDn과 같은 다양한 VQA 모델 아키텍처로 일반화 가능한가?
주요 결과
- 제안된 방법은 VQA-CP v2 테스트 세트에서 최신 기술 수준의 전체 정확도 61.13% 를 달성하며 이전 방법들을 능가한다.
- 구분 모듈을 제거하면 성능이 44.62% 로 떨어지며, 언어 선호도를 완화하는 데서 이 모듈의 핵심적 역할을 입증한다.
- 합성 대응 인스턴스가 실제 대응 인스턴스보다 더 크게 기여한다. 이는 더 많은 수와 높은 다양성 덕분에 모델의 일반화 능력 향상에 기여하기 때문이다.
- 이 방법은 아키텍처 간에 잘 일반화되며, SAN 및 UpDn 모델 모두 VQA-CP v2 에서 성능 향상을 이룬다. 특히 SAN+DM 은 61.17% 의 정확도를 기록한다.
- 구분 손실에 대한 최적의 비율 $ \lambda_2 / \lambda_1 $ 은 중간 범위에 위치한다. 너무 높은 값은 과적합을 유도하고, 너무 낮은 값은 언어 선호도를 억제하지 못한다.
- 절단 실험 결과, 구분 모듈과 모odulating 요소 $ p_{jm} $ 둘 다 성능 향상에 필수적임을 확인하였으며, 둘 중 하나를 제거하면 정확도가 크게 떨어진다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.