Skip to main content
QUICK REVIEW

[논문 리뷰] MSAF: Multimodal Split Attention Fusion

Lang Su, Chuqing Hu|arXiv (Cornell University)|2020. 12. 13.
Emotion and Mood Recognition참고 문헌 54인용 수 44
한 줄 요약

MSAF은 CNN/RNN 아키텍처를 위한 다중 모달 특징을 통합하는 경량 채널-별 분할 어텐션 융합 모듈을 도입하여, 감정 인식, 감정 분석, 행동 인식 전반에서 강력한 성능을 달성하되 추가 파라미터는 적게 사용합니다.

ABSTRACT

Multimodal learning mimics the reasoning process of the human multi-sensory system, which is used to perceive the surrounding world. While making a prediction, the human brain tends to relate crucial cues from multiple sources of information. In this work, we propose a novel multimodal fusion module that learns to emphasize more contributive features across all modalities. Specifically, the proposed Multimodal Split Attention Fusion (MSAF) module splits each modality into channel-wise equal feature blocks and creates a joint representation that is used to generate soft attention for each channel across the feature blocks. Further, the MSAF module is designed to be compatible with features of various spatial dimensions and sequence lengths, suitable for both CNNs and RNNs. Thus, MSAF can be easily added to fuse features of any unimodal networks and utilize existing pretrained unimodal model weights. To demonstrate the effectiveness of our fusion module, we design three multimodal networks with MSAF for emotion recognition, sentiment analysis, and action recognition tasks. Our approach achieves competitive results in each task and outperforms other application-specific networks and multimodal fusion benchmarks.

연구 동기 및 목표

  • 모듈 비교를 통한 다중 모달 신호의 효율적 융합을 촉진한다.
  • 사전 학습된 단일 모달 가중치를 사용하여 CNN 및 RNN 아키텍처와 상호 운용 가능한 경량 모듈을 개발한다.
  • MSAF의 효과를 감정 인식, 감정 분석, 액션 인식 데이터셋에서 입증한다.
  • 실용적 멀티모달 시스템에 대한 하이퍼파라미터 및 배포 고려사항에 대한 지침을 제공한다.

제안 방법

  • 각 모달의 특징 채널을 동등한 크기의 블록으로 분할한다.
  • 모달리티 블록을 결합하여 멀티모달 디스크립터를 형성하고 글로벌 풀링을 통해 공유 채널 디스크립터를 계산한다.
  • 공유 변환과 softmax를 사용하여 블록 간 per-block 어텐션을 생성하고 억제를 제어하는 정규화 파라미터 lambda를 도입한다.
  • 각 모달리티 내에서 블록의 가중치를 재조정하고 재결합하여 향상된 모달리티 특징을 생성한다.
  • 과적합을 줄이고 견고성을 높이기 위해 선택적으로 BlockDropout을 적용한다.
  • 연속 구간을 분할하고 각 구간 내에서 블록 단위 어텐션을 적용하여 MSAF를 RNN으로 확장한다.

실험 결과

연구 질문

  • RQ1MSAF가 CNN 및 RNN 아키텍처 전반에서 최소한의 매개변수 증가로 다중 모달 특징을 효과적으로 융합할 수 있는가?
  • RQ2감정 인식, 감정 분석, 액션 인식에서 MSAF가 최첨단 융합 방법과 어떻게 비교되는가?
  • RQ3성능과 로버스트니스를 최적화하는 하이퍼파라미터(C, r, lambda, p, q)는 무엇인가?

주요 결과

  • MSAF는 세 가지 작업에서 경쟁력 있는 결과를 많은 baselines보다 적은 파라미터로 달성한다.
  • 감정 인식(RAVDESS)에서 MSAF는 MMTM보다 우수한 성능을 보이면서 파라미터가 더 적고(MSAF 25.94 M vs MMTM 31.97 M) 보고된 설정에서 74.86% 정확도를 달성한다.
  • 감정 분석(CMU-MOSEI)에서 MSAF는 간단한 아키텍처로 이전의 다중 모달 방법과 일치하거나 능가한다.
  • 액션 인식(NTU RGB+D CS)에서 MSAF의 중간 및 최종 융합은 최첨단 성능(92.24% CS)을 달성한다.
  • BlockDropout과 lambda는 특히 작은 데이터셋에서 과도한 억제 및 과적합을 완화하는 데 도움을 준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.