Skip to main content
QUICK REVIEW

[논문 리뷰] Visual Perturbation-aware Collaborative Learning for Overcoming the Language Prior Problem

Yudong Han, Liqiang Nie|arXiv (Cornell University)|2022. 07. 24.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

이 논문은 시각적 편향 인식 보완 학습 프레임워크를 제안하여, 정교한 이미지 편향을 통한 보정을 통해 시각질의 질문 응답(VQA)에서 언어 우선 문제를 완화한다. 이는 정교한 이미지 편향을 기반으로 내부 인스턴스의 불변성과 외부 인스턴스의 구별성을 강제함으로써 달성된다. 이는 VQA-CP v1에서 기준 모델보다 최대 22.91% 향상되고 VQA-CP v2에서 19.67% 향상되며, 균형 잡힌 벤치마크에서도 뛰어난 내성성을 보인다.

ABSTRACT

Several studies have recently pointed that existing Visual Question Answering (VQA) models heavily suffer from the language prior problem, which refers to capturing superficial statistical correlations between the question type and the answer whereas ignoring the image contents. Numerous efforts have been dedicated to strengthen the image dependency by creating the delicate models or introducing the extra visual annotations. However, these methods cannot sufficiently explore how the visual cues explicitly affect the learned answer representation, which is vital for language reliance alleviation. Moreover, they generally emphasize the class-level discrimination of the learned answer representation, which overlooks the more fine-grained instance-level patterns and demands further optimization. In this paper, we propose a novel collaborative learning scheme from the viewpoint of visual perturbation calibration, which can better investigate the fine-grained visual effects and mitigate the language prior problem by learning the instance-level characteristics. Specifically, we devise a visual controller to construct two sorts of curated images with different perturbation extents, based on which the collaborative learning of intra-instance invariance and inter-instance discrimination is implemented by two well-designed discriminators. Besides, we implement the information bottleneck modulator on latent space for further bias alleviation and representation calibration. We impose our visual perturbation-aware framework to three orthodox baselines and the experimental results on two diagnostic VQA-CP benchmark datasets evidently demonstrate its effectiveness. In addition, we also justify its robustness on the balanced VQA benchmark.

연구 동기 및 목표

  • 모델이 시각적 콘텐츠보다는 통계적 질문-응답 상관관계에 의존하는 VQA의 언어 우선 문제를 해결하기 위해.
  • 시각적 신호가 응답 표현에 미치는 영향을 명시적으로 모델링하여, 굵은 클래스 수준의 구별성 이상의 세밀한 수준의 표현을 가능하게 하기 위해.
  • 내부 인스턴스의 불변성과 외부 인스턴스의 구별성을 강제하여 세밀한 인스턴스 수준의 표현 학습을 향상시키기 위해.
  • 정보 블로킹 모듈레이터를 사용해 학습된 표현을 校정함으로써 편향 감소와 일반화 능력 향상을 위해.
  • 특수 작업 재학습이 필요 없이 기존 VQA 기준 모델을 향상시킬 수 있는 모델에 종속되지 않는 프레임워크를 개발하기 위해.

제안 방법

  • 시각적 컨트롤러가 클래스 활성도 맵을 기반으로 소프트 및 하드 편향된 이미지 특징 두 가지 유형을 동적으로 생성한다.
  • 내부 인스턴스의 불변성(편향 간 일관성)과 외부 인스턴스의 구별성(다른 샘플 간 가시성)을 강제하기 위해 두 개의 구별기(Discriminator)를 학습한다.
  • 잠재 공간에 정보 블로킹 모듈레이터를 적용하여 유의미한 정보를 유지하면서도 편향을 감소시킨다.
  • 불변성과 구별성에 동시에 최적화하는 공동 학습 기반으로 표준 VQA 모델과 통합한다.
  • 내부 인스턴스 학습을 향상시키기 위해 음성 응답 마이닝을 사용하며, 하이퍼파라미터가 상위 음성 후보 수를 제어한다.
  • λvib 및 λb와 같은 하이퍼파라미터를 조정하여 편향 강도와 표현 보정 간 균형을 맞춘다.

실험 결과

연구 질문

  • RQ1세밀한 시각적 영향이 응답 표현에 미치는 영향을 모델링함으로써, 시각적 편향 인식 보완 학습이 언어 편향을 효과적으로 감소시킬 수 있는가?
  • RQ2내부 인스턴스의 불변성과 외부 인스턴스의 구별성을 강제하면 편향된 벤치마크에서 모델의 내성성과 성능이 향상되는가?
  • RQ3진단용 VQA-CP 데이터셋에서 제안된 방법은 최신 기술 대비 어떻게 비교되는가?
  • RQ4N′ 및 λb와 같은 하이퍼파라미터가 모델 성능과 표현 보정에 미치는 영향은 어떠한가?
  • RQ5이 프레임워크는 표준 균형 잡힌 VQA 벤치마크로 일반화되어 기존 기준 모델을 향상시킬 수 있는가?

주요 결과

  • VQA-CP v1에서 최신 기술 대비 총 정확도에서 1.83%p의 절대적 향상을 달성했고, VQA-CP v2에서는 1.86%p 향상되었다.
  • VQA-CP v1에서는 UpDn 기준 모델에 대해 22.91% 향상되었고, VQA-CP v2에서는 19.67% 향상되어 강력한 일반화 능력을 입증했다.
  • 균형 잡힌 VQA 벤치마크에서도 뛰어난 성능을 유지하여 데이터 편향 감소와 더불어 더 나은 추론 능력을 보였다.
  • N′(음성 후보 수)가 약 20일 때 성능이 최고에 이르며, 이 이상이 되면 저신뢰도 음성 후보들이 포함되어 성능이 저하된다.
  • λb ≈ 2일 때 최적의 성능을 달성하며, 이 이상일 경우 과도한 불변성 강조로 성능이 급격히 떨어진다.
  • 시각화 결과 모델이 잔여 요소(예: 플라이스비, 사람)에 집중한 더 정확한 어텐션 맵을 학습하는 것으로 나타났다. 이는 잡음 요소(예: 잔디, 공)에 의한 편향을 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.