Skip to main content
QUICK REVIEW

[논문 리뷰] Hierarchical Co-Attention for Visual Question Answering

Jiasen Lu, Jianwei Yang|arXiv (Cornell University)|2016. 05. 31.
Multimodal Machine Learning Applications참고 문헌 16인용 수 22
한 줄 요약

이 논문은 1D-CNN 기반의 계층적 구조에서 시각적 및 질문 주의를 공동으로 학습하는 계층적 공주의 모델을 제안한다. 이미지에서 어디를 보고, 질문에서 어떤 단어에 주의를 기울일지 모델링함으로써, VQA에서 최신 기준 성능을 달성하며, VQA에서 62.1%의 정확도와 COCO-QA에서 65.4%의 정확도를 달성한다.

ABSTRACT

A number of recent works have proposed attention models for Visual Question Answering (VQA) that generate spatial maps highlighting image regions relevant answering the question. In this paper, we argue that in addition modeling where look or visual attention, it is equally important model what words listen to or question attention. We present a novel co-attention model for VQA that jointly reasons about image and question attention. In addition, our model reasons about the question and consequently the image via the co-attention mechanism in a hierarchical fashion via a novel 1-dimensional convolution neural networks (CNN) model. Our final model outperforms all reported methods, improving the state-of-the-art on the VQA dataset from 60.4% 62.1%, and from 61.6% 65.4% on the COCO-QA dataset.

연구 동기 및 목표

  • 기존의 VQA 모델이 시각적 주의에만 집중하고 질문에 특화된 주의를 간과하는 한계를 해결한다.
  • 이미지 영역과 질문 단어 양쪽에 대한 주의를 공동으로 모델링하여 VQA 성능을 향상시킨다.
  • 이미지 및 질문 특징 간의 공주의 모델링을 위해 1D-CNN를 활용한 계층적 추론 기반 메커니즘을 도입한다.
  • 개선된 다중 모odal 주의를 통해 기준 VQA 및 COCO-QA 데이터셋에서 최신 기준 성능을 달성한다.

제안 방법

  • 이미지 특징과 질문 단어 양쪽에 대한 주의 가중치를 공동으로 계산하는 공주의 메커니즘을 제안한다.
  • 이미지 및 질문 표현 간의 상호작용을 계층적으로 모델링하기 위해 1차원 합성곱 신경망(1D-CNN)을 활용한다.
  • 질문 내용에 기반한 관련 이미지 영역과 반대로, 이미지 기반의 질문 단어를 추론할 수 있도록 双중 주의 메커니즘을 도입한다.
  • 이미지 및 질문 특징 간의 다중 수준 추론을 가능하게 하기 위해 공주의 메커니즘을 계층적으로 적용한다.
  • 학습된 주의 맵을 최종 분류 레이어에 통합하여 답변을 생성한다.

실험 결과

연구 질문

  • RQ1시각적 주의와 질문 주의를 공동으로 모델링하는 것이, 시각적 주의에만 집중하는 모델에 비해 VQA 성능을 향상시키는가?
  • RQ21D-CNN를 통한 계층적 추론이 VQA에서 다중 모달 주의를 어떻게 향상시키는가?
  • RQ3질문 수준의 주의를 통합함으로써 VQA 벤치마크에서 더 나은 일반화 및 정확도를 달성할 수 있는가?
  • RQ4제안된 공주의 메커니즘이 기존의 주의 기반 VQA 모델에 비해 어느 정도 뛰어난가?

주요 결과

  • 제안된 모델은 VQA 데이터셋에서 테스트 정확도 62.1%를 달성하여 이전 최신 기준 대비 1.7% 향상되었다.
  • COCO-QA 데이터셋에서는 정확도 65.4%를 기록하여 이전 최신 기준인 61.6% 대비 3.8% 향상되었다.
  • 계층적 공주의 메커니즘이 표준 주의 메커니즘보다 더 효과적인 다중 모달 특징 정렬을 가능하게 한다.
  • 모델는 관련 이미지 영역과 의미적으로 중요한 질문 단어에 주의를 기울임으로써 더 뛰어난 강건성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.