Skip to main content
QUICK REVIEW

[논문 리뷰] Multimodal Integration of Human-Like Attention in Visual Question Answering

Ekta Sood, Fabian Kögel|arXiv (Cornell University)|2021. 09. 27.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

이 논문은 텍스트 및 이미지 모odal에서 인간과 유사한 주의를 트랜스포머 기반 VQA 모델에 통합하는 데 있어 최초의 방법인 MULAN을 제안한다. 최신 텍스트 및 이미지 샐리언시 모델의 예측을 활용해 자기 주의 스코어링 함수를 수정함으로써, MULAN은 기존 모델 대비 약 80% 적은 학습 가능한 파라미터를 사용하면서도 VQAv2 test-std에서 73.98%의 최고 성능을 기록하고, test-dev에서는 73.72%의 성능을 달성한다.

ABSTRACT

Human-like attention as a supervisory signal to guide neural attention has shown significant promise but is currently limited to uni-modal integration - even for inherently multimodal tasks such as visual question answering (VQA). We present the Multimodal Human-like Attention Network (MULAN) - the first method for multimodal integration of human-like attention on image and text during training of VQA models. MULAN integrates attention predictions from two state-of-the-art text and image saliency models into neural self-attention layers of a recent transformer-based VQA model. Through evaluations on the challenging VQAv2 dataset, we show that MULAN achieves a new state-of-the-art performance of 73.98% accuracy on test-std and 73.72% on test-dev and, at the same time, has approximately 80% fewer trainable parameters than prior work. Overall, our work underlines the potential of integrating multimodal human-like and neural attention for VQA

연구 동기 및 목표

  • 기존 연구에서 시각적 질문 응답에서 인간과 유사한 주의를 이미지에만 통합하는 데 그친 점을 해결하기 위해.
  • 다중모odal 인간과 유사한 주의가 VQA 모델의 추론 및 일반화 능력을 향상시킬 수 있는지 탐색하기 위해.
  • 인간 주의에서 유도된 인덕티브 바이어스를 통해 모델 복잡성을 줄이면서도 성능을 유지하거나 향상시키기 위해.
  • 장문의 질문이나 복합 질문에서 다중모달 인간과 유사한 주의의 영향을 평가하기 위해.
  • 주의 분포와 실패 케이스 분석을 통해 해석 가능성 제공하기 위해.

제안 방법

  • MULAN은 MCAN 기반 VQA 트랜스포머의 주의 스코어링 함수에 텍스트 샐리언시 모델(TSM)과 이미지 샐리언시 모델(다중 지속 시간 모델)의 예측을 통합한다.
  • 모델은 질의-키 상호작용 계산 중에 인간과 유사한 주의 맵을 인덕티브 바이어스로 통합함으로써 자기 주의 메커니즘을 수정한다.
  • 모델은 VQAv2 데이터셋에서 MCAN 소형 아키텍처를 백본으로 사용하여 엔드 투 엔드로 훈련된다.
  • 텍스트에서의 인간 주의는 최근 제안된 텍스트 샐리언시 모델(TSM)을 VQA에 맞게 변형하여 모델링한다.
  • 이미지 샐리언시 예측은 시각적 주의의 시간 동적 특성을 포착하는 다중 지속 시간 샐리언시 모델에서 확보된다.
  • 통합은 주의 레이어 수준에서 수행되며, 특징 융합 이전에 주의 가중치를 직접 수정한다.

실험 결과

연구 질문

  • RQ1텍스트와 이미지 양쪽에서 다중모달 인간과 유사한 주의가 단일 모달 감독을 초월해 VQA 성능을 향상시킬 수 있는가?
  • RQ2인간과 유사한 주의를 통합함으로써 장문의 질문이나 복잡한 질문에서 데이터셋 편향에 대한 의존도가 감소하는가?
  • RQ3인간 주의 맵이 모델 일반화 능력을 향상시키고 파라미터 수를 줄이는 데 효과적인 인덕티브 바이어스로 기능할 수 있는가?
  • RQ4다중모달 인간과 유사한 주의가 주의 분포와 모델의 해석 가능성에 어떤 영향을 미치는가?
  • RQ5표준 모델 대비 훈련 중에 안정적인 주의 수렴을 이끌어내는가?

주요 결과

  • MULAN은 VQAv2 test-std 스플릿에서 73.98%의 새로운 최고 성능을 기록하고, test-dev에서는 73.72%의 성능을 달성하여 기존 방법을 능가한다.
  • 기존 최고 성능 모델 대비 학습 가능한 파라미터를 약 80% 감소시켰지만, 뛰어난 성능을 유지한다.
  • 7개 이상의 토큰을 포함하는 장문의 질문에서 상대적 성능 향상이 뚜렷하게 나타나며, 상대적 향상률이 0.3% 이상으로 나타나 복잡한 질의를 더 잘 처리하는 것으로 나타났다.
  • 주의 시각화 결과 MULAN은 관련된 이미지 영역과 핵심 질문 토큰(예: 'digging', 'fridge')에 집중하는 반면, 기준 모델은 더 광범위하게 주의를 산산이 흩트린다.
  • 모델는 안정적인 주의 분포로 빠르게 수렴함으로써, 초기 인간 주의 맵이 효과적인 학습을 이끄는 것으로 나타났다.
  • 카테고리별 분석에서 MULAN은 12개 카테고리 중 10개에서 가장 높은 정확도를 기록했으며, 활동 인식 및 감성 분석 분야에서 두드러진 성과를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.