Skip to main content
QUICK REVIEW

[논문 리뷰] Estimating semantic structure for the VQA answer space

Corentin Kervadec, Grigory Antipov|arXiv (Cornell University)|2020. 06. 10.
Multimodal Machine Learning Applications참고 문헌 31인용 수 8
한 줄 요약

이 논문은 언어 편향을 줄이고 일반화 능력을 향상시키기 위해 답변 클래스 간의 의미 관계를 모델링하는 의미적 손실을 제안한다. 단어 임베딩 또는 인간 주석 통계를 통해 의미적 유사도를 추정함으로써, 편향이 있는 VQAv2 데이터셋에서 성능 저하 없이 VQAv2-CP에서 정확도를 향상시켜 SOTA 수준의 성능을 달성한다.

ABSTRACT

Since its appearance, Visual Question Answering (VQA, i.e. answering a question posed over an image), has always been treated as a classification problem over a set of predefined answers. Despite its convenience, this classification approach poorly reflects the semantics of the problem limiting the answering to a choice between independent proposals, without taking into account the similarity between them (e.g. equally penalizing for answering cat or German shepherd instead of dog). We address this issue by proposing (1) two measures of proximity between VQA classes, and (2) a corresponding loss which takes into account the estimated proximity. This significantly improves the generalization of VQA models by reducing their language bias. In particular, we show that our approach is completely model-agnostic since it allows consistent improvements with three different VQA models. Finally, by combining our method with a language bias reduction approach, we report SOTA-level performance on the challenging VQAv2-CP dataset.

연구 동기 및 목표

  • 표준 VQA 분류의 한계를 해결하기 위해, 답변 클래스를 상호 독립적인 것으로 간주하고 의미 관계를 忽시하는 문제를 해결한다.
  • 의미 유사도 기반으로 답변 공간을 구성함으로써 모델의 언어 편향에 대한 의존도를 줄인다.
  • 구조적 변경 없이도 일반화 능력을 향상시킬 수 있는 아키텍처에 종속되지 않는 손실 함수를 설계한다.
  • UpDn, MCAN, NSM 등 다양한 VQA 모델과 데이터셋(VQAv2-CP 및 VQAv2)에서 일관된 성능 향상을 입증한다.
  • 의미적 손실이 기존의 편향 제거 기법과 보완되어 VQAv2-CP에서 SOTA 성능을 달성함을 보여준다.

제안 방법

  • 학습된 의미 공간에서 예측값과 정답 답변 간의 거리를 최소화하는 의미적 손실 함수를 제안한다.
  • 분포 유사도를 위해 사전 학습된 단어 임베딩(예: Word2Vec, GloVe)을 사용하여 답변 클래스 간의 의미적 유사도를 추정한다.
  • 다른 유사도 추정 방법으로는 VQA 데이터셋 내 다수의 인간 주석 답변을 활용하여 의미 모호성과 유사도를 유추한다.
  • 의미적 손실은 학습 중 표준 크로스 엔트로피 손실과 결합되어 엔드 투 엔드 최적화가 가능하다.
  • 학습된 매핑 함수 γ(·)를 사용하여 예측값과 정답 답변을 공통의 의미 공간에 투영한다.
  • UpDn, MCAN, NSM 등 세 가지 다른 VQA 아키텍처에 적용하여 모델에 종속되지 않는 효과를 입증한다.

실험 결과

연구 질문

  • RQ1VQA 답변 클래스 간의 의미 관계를 모델링하면 시각-언어 모델의 언어 편향을 줄일 수 있는가?
  • RQ2의미 유사도 기반의 학습된 의미 공간이 표준 분류 손실을 넘어서 일반화 능력을 향상시키는가?
  • RQ3의미 유사도 기반의 아키텍처에 종속되지 않는 손실 함수가 다양한 VQA 아키텍처에서 일관되게 성능 향상을 이끌 수 있는가?
  • RQ4제안된 방법은 편향이 있는 데이터셋(VQAv2 등)에서는 성능을 유지하면서도, 편향이 제거된 벤치마크(VQAv2-CP 등)에서는 성능 향상을 이룰 수 있는가?
  • RQ5의미적 손실은 정확도와 강건성 측면에서 최신의 편향 제거 기법과 비교해 어떻게 성능을 내는가?

주요 결과

  • 의미적 손실은 의미적으로 먼 잘못된 답변(예: 정답이 'woman'일 때 'boy'는 'girl'보다 더 나쁜 오류로 간주됨)에 더 무거운 페널티를 주어 언어 편향을 줄인다.
  • VQAv2-CP 데이터셋에서 RUBi와 조합했을 때 47.5%의 정확도를 기록하여 추가 주석이 필요 없이 SOTA 성능을 달성한다.
  • DLR 및 SCR(VQA-X)와 달리, 원본 VQAv2 데이터셋에서 최대 -4.9점까지 성능 저하를 겪는 것과는 달리, 의미적 손실은 편향이 있는 VQAv2 세트에서 성능을 유지하거나 약간 향상시킨다.
  • UpDn, MCAN, NSM 등 세 가지 다른 VQA 모델에서 일관된 성능 향상을 보이며, 이는 모델에 종속되지 않는 성질을 확인한다.
  • 낮은 통계적 커버리지에도 불구하고, 인간 주석 기반의 의미 유사도 추정이 단어 임베딩보다 효과적으로 작용한다.
  • 의미적 손실과 RUBi의 조합은 기준 UpDn 모델 대비 VQAv2-CP에서 3.3점의 성능 향상을 이끌어내어 상호보완적 성능 향상을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.