Skip to main content
QUICK REVIEW

[논문 리뷰] Question Type Guided Attention in Visual Question Answering

Yang Shi, Tommaso Furlanello|arXiv (Cornell University)|2018. 04. 06.
Multimodal Machine Learning Applications참고 문헌 31인용 수 8
한 줄 요약

이 논문은 질문 유형에 기반하여 하향식(Faster R-CNN)과 상향식(ResNet) 시각적 특징 간의 동적 균형을 조절하는 새로운 어텐션 메커니즘인 질문 유형 유도 어텐션(QTA)을 제안한다. QTA는 '활동 인식' 및 '세는 것'과 같은 핵심 질문 유형에서 5퍼센트 이상의 성능 향상을 이끌어내며, MCB 모델에 적용했을 때 정확도를 3퍼센트 향상시킨다. 또한 다중 작업 확장 기능을 통해 지도 학습이 없는 질문 유형에 대해서도 제로샷 추론을 가능하게 한다.

ABSTRACT

Visual Question Answering (VQA) requires integration of feature maps with drastically different structures and focus of the correct regions. Image descriptors have structures at multiple spatial scales, while lexical inputs inherently follow a temporal sequence and naturally cluster into semantically different question types. A lot of previous works use complex models to extract feature representations but neglect to use high-level information summary such as question types in learning. In this work, we propose Question Type-guided Attention (QTA). It utilizes the information of question type to dynamically balance between bottom-up and top-down visual features, respectively extracted from ResNet and Faster R-CNN networks. We experiment with multiple VQA architectures with extensive input ablation studies over the TDIUC dataset and show that QTA systematically improves the performance by more than 5% across multiple question type categories such as "Activity Recognition", "Utility" and "Counting" on TDIUC dataset. By adding QTA on the state-of-art model MCB, we achieve 3% improvement for overall accuracy. Finally, we propose a multi-task extension to predict question types which generalizes QTA to applications that lack of question type, with minimal performance loss.

연구 동기 및 목표

  • 시각질문응답(VQA) 모델에서 고수준 의미 정보—특히 질문 유형—의 활용 부족 문제를 해결하기 위해.
  • 질문 유형에 따라 하향식 및 상향식 시각적 특징의 동적 가중치 조정을 통해 다중 모odal 특징 통합을 향상시키기 위해.
  • 추론 시 질문 유형 레이블이 제공되지 않는 상황에서도 효과적인 VQA를 가능하게 하기 위해.
  • 특히 '비현실적' 질문에 대한 편향을 분석하기 위해.

제안 방법

  • QTA는 질문 유형 임베딩을 사용하여 ResNet(상향식)과 Faster R-CNN(하향식)의 시각적 특징 융합을 제어한다.
  • 각 질문 유형별로 학습 가능한 어텐션 게이트를 계산하여 각 시각적 특징 스트림의 기여도를 조절한다.
  • 질문 임베딩에서 질문 유형을 동시에 예측하는 다중 작업 헤드를 사용하여 엔드 투 엔드로 모델을 훈련시킨다.
  • 다중 작업 헤드 덕분에 훈련 중에 질문 유형을 예측함으로써, 지도 없는 레이블이 있는 테스트 케이스에 대해서도 일반화가 가능해진다.
  • 12개의 질문 유형 카테고리에 걸쳐 광범위한 추론 실험을 수행하기 위해 TDIUC 데이터셋에서 평가한다.
  • 추론 실험을 통해 질문 유형 유도가 다양한 질문 유형에 미치는 영향을 고립적으로 분석한다.

실험 결과

연구 질문

  • RQ1질문 유형 정보는 VQA 모델에서 시각적 특징 선택 및 융합을 향상시킬 수 있는가?
  • RQ2질문 유형에 따라 시각적 특징을 동적으로 라우팅하면 다양한 질문 카테고리에서 성능에 어떤 영향을 미치는가?
  • RQ3다중 작업 학습 설정을 통해 훈련 중에 질문 유형을 예측할 수 있는 정도는 어느 정도이며, 이는 지도 없는 레이블 추론을 가능하게 하는가?
  • RQ4비현실적인 질문 유형과 같은 편향된 질문 유형이 모델 일반화에 악영향을 미치는가, 그리고 QTA는 이를 완화할 수 있는가?
  • RQ5QTA는 전체 및 각 유형별 VQA 정확도에 대해 어떤 정량적 영향을 미치는가?

주요 결과

  • QTA는 TDIUC 데이터셋에서 '활동 인식', '기능', '세는 것'과 같은 여러 질문 유형에서 5퍼센트 이상의 성능 향상을 이룬다.
  • 최신 기술인 MCB 모델에 QTA를 추가하면 전체 정확도가 3퍼센트 향상된다.
  • 다중 작업 확장 기능은 훈련 중 질문 유형 예측 정확도가 95퍼센트를 초과하면서도 VQA 성능은 거의 동일하게 유지한다.
  • '비현실적' 질문을 훈련에서 제외했을 때 기준 모델 대비 단순 정확도가 17퍼센트 향상되었으며, QTA는 이 성과를 더욱 향상시킨다.
  • 다중 작업 학습을 통해 질문 유형을 예측했을 때 혼동 행렬에서 높은 클래스별 정확도(예: '장면 인식'의 경우 99.5퍼센트)를 보였다.
  • 질문 유형이 추론 중에 숨겨져 있을 때도 모델은 66.88퍼센트의 조화 평균 유형별 정확도(MPT)와 80.95퍼센트의 단순 정확도를 달성하여 강력한 일반화 능력을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.