Skip to main content
QUICK REVIEW

[논문 리뷰] MMFT-BERT: Multimodal Fusion Transformer with BERT Encodings for Visual Question Answering

Aisha Urooj Khan, Amir Mazaheri|arXiv (Cornell University)|2020. 10. 27.
Multimodal Machine Learning Applications참고 문헌 50인용 수 10
한 줄 요약

이 논문은 질문, 영상 프레임, 자막에 대해 별도의 BERT 인코더를 사용하고, 이후에 새로운 트랜스포머 기반 융합 메커니즘을 통해 다중모odal 특징 표현을 공동으로 주시하는 다중모달 융합 트랜스포머인 MMFT-BERT를 제안한다. 이 방법은 기존 방법 대비 Q+V 기준 2.41% 향상되고 Q+V+S 기준 1.1% 향상되어 TVQA 데이터셋에서 최신 기술 수준을 달성한다. 또한 시각적 모달 의존도 평가를 위해 TVQA-Visual이라는 진단용 서브셋을 도입한다.

ABSTRACT

We present MMFT-BERT(MultiModal Fusion Transformer with BERT encodings), to solve Visual Question Answering (VQA) ensuring individual and combined processing of multiple input modalities. Our approach benefits from processing multimodal data (video and text) adopting the BERT encodings individually and using a novel transformer-based fusion method to fuse them together. Our method decomposes the different sources of modalities, into different BERT instances with similar architectures, but variable weights. This achieves SOTA results on the TVQA dataset. Additionally, we provide TVQA-Visual, an isolated diagnostic subset of TVQA, which strictly requires the knowledge of visual (V) modality based on a human annotator's judgment. This set of questions helps us to study the model's behavior and the challenges TVQA poses to prevent the achievement of super human performance. Extensive experiments show the effectiveness and superiority of our method.

연구 동기 및 목표

  • 질문, 영상, 자막 등 여러 모달리티를 동시에 모델링하여 시각적 질의 응답 성능을 향상시키기.
  • 실제 영상 질의 응답 환경에서 시각적 및 언어적 신호를 효과적으로 통합해야 하는 다중모달 이해 과제를 해결하기.
  • 질문의 맥락에 따라 각 모달리티에 대한 중요도를 동적으로 학습하는, 더 해석 가능한 융합 메커니즘 개발하기.
  • 모델의 시각적 모달 의존도를 평가하기 위해 시각적 모달에만 초점을 맞춘 진단용 서브셋인 TVQA-Visual을 도입하기.
  • 다중 스트림 BERT 인코딩과 구조화된 융합 방식이 단순 연결 또는 단일 스트림 접근 방식보다 우수한 성능을 내는지 입증하기.

제안 방법

  • 모델는 세 가지 별도의 BERT 인코더를 사용한다: 질문-답안 쌍을 위한 Q-BERT, 시각적 개념을 위한 V-BERT, 자막을 위한 S-BERT로 각각의 모달리티를 독립적으로 처리한다.
  • 각 BERT 인코더는 질문 + 후보 답변 쌍과 같은 쌍화된 입력에 대해 피팅되어 다중 헤드 자기주의를 통한 모달리티 특화 주의를 가능하게 한다.
  • 새로운 다중모달 융합 트랜스포머(MMFT) 모듈은 각 모달리티의 특징을 연결한 후, 학습 가능한 [FUSE] 토큰을 사용하여 모든 입력 소스 간의 교차주의를 수행한다.
  • MMFT 모듈은 다중 헤드 주의를 사용하여 질문 맥락에 따라 각 모달리티에 대한 중요도 가중치를 동적으로 할당함으로써 맥락 인식 융합을 가능하게 한다.
  • MMFT의 최종 출력은 선형 분류기로 전달되어 후보 답변들에 대한 답변 확률을 예측한다.
  • 모델는 다중 손실 항목(각 모달리티 스트림의 개별 및 공동 손실)을 포함하여 엔드 투 엔드로 훈련되어 최적화 및 성능 향상을 도모한다.

실험 결과

연구 질문

  • RQ1각 모달리티에 대해 별도의 BERT 인코더를 사용할 경우, 공유 인코더 대비 시각적 질의 응답 성능 향상이 이루어지는가?
  • RQ2단순 연결 또는 조기 융합 대비 전용 트랜스포머 기반 융합 메커니즘이 다중모달 추론에 어떻게 기여하는가?
  • RQ3모델가 시각적 정보에 얼마나 의존하는가? 그리고 진단용 서브셋을 통해 이 의존도를 분리하여 평가할 수 있는가?
  • RQ4훈련 중에 다중 손실 항목(개별 및 공동 손실)을 사용할 경우, 단일 공동 손실 대비 모델 수렴 및 성능 향상이 이루어지는가?
  • RQ5융합 모듈 내의 어텐션 헤드 수와 인코더 레이어 수 등의 아키텍처 선택이 최종 성능에 어떤 영향을 미치는가?

주요 결과

  • MMFT-BERT는 TVQA 검증 세트에서 새로운 최신 기술 수준 성능을 달성하였으며, 질문과 영상 입력(Q+V)만을 사용할 경우 기존 방법 대비 2.41% 향상되었다.
  • 세 모달리티(Q+V+S)를 모두 사용할 경우, 이전 최신 기술 수준 대비 1.1%p의 절대적 향상률을 기록하여 정확도 73.10%에 도달했다.
  • 훈련 중에 개별 및 공동 손실 항목을 모두 사용할 경우 성능이 73.10%로 향상되었고, 단일 공동 손실만 사용할 경우 71.82%로 성능이 떨어졌다.
  • MMFT 융합 모듈의 다중 헤드 주의 메커니즘(H=12)은 단일 헤드 주의(72.66% 대비 73.55%)보다 우수한 성능을 보였으며, 이는 국소적 주의 패tern이 특징 통합에 중요하다는 것을 시사한다.
  • MMFT 내 단일 레이어 융합 모듈(L=1)이 가장 우수한 성능(73.55%)을 기록했고, 스킵 연결이 있는 두 레이어 이상의 구조는 성능 저하를 보였으며, 이는 깊이 있는 융합에서 과적합 또는 중복이 발생할 수 있음을 시사한다.
  • 시각 입력으로 객체 레이블 대신 ResNet-101 특징을 사용할 경우 성능 저하(71.82%)가 발생했으며, 이는 이 작업에 있어서 객체 수준의 개념이 원시 시각적 특징보다 더 유용하다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.