Skip to main content
QUICK REVIEW

[논문 리뷰] Cross-Modality Gated Attention Fusion for Multimodal Sentiment Analysis

Ming Jiang, Shaoxiong Ji|arXiv (Cornell University)|2022. 08. 25.
Sentiment Analysis and Opinion Mining인용 수 4
한 줄 요약

이 논문은 다중모态 감성 분석을 위한 크로스모달리티 게이팅 어텐션 통합 모델인 CMGA를 제안한다. 이 모델은 모달리티 쌍 간의 크로스어텐션과 무시 게이트를 사용하여 잡음이 많은 신호를 필터링한다. CMGA는 크로스모달리티 상호작용을 강화하면서도 고유한 모달리티 특징을 유지함으로써 MOSI 및 MOSEI 데이터셋에서 최신 기준 성능을 달성한다.

ABSTRACT

Multimodal sentiment analysis is an important research task to predict the sentiment score based on the different modality data from a specific opinion video. Many previous pieces of research have proved the significance of utilizing the shared and unique information across different modalities. However, the high-order combined signals from multimodal data would also help extract satisfied representations. In this paper, we propose CMGA, a Cross-Modality Gated Attention fusion model for MSA that tends to make adequate interaction across different modality pairs. CMGA also adds a forget gate to filter the noisy and redundant signals introduced in the interaction procedure. We experiment on two benchmark datasets in MSA, MOSI, and MOSEI, illustrating the performance of CMGA over several baseline models. We also conduct the ablation study to demonstrate the function of different components inside CMGA.

연구 동기 및 목표

  • 다중모달 상호작용 과정에서 발생하는 잡음이 많고 중복된 신호 문제를 해결하기 위해.
  • 모든 모달리티 쌍(텍스트-비디오, 비디오-오디오, 텍스트-오디오) 간의 상호작용을 명시적으로 모델링하여 크로스모달 특징 통합을 향상시키기 위해.
  • 공유된 신호를 효과적으로 통합하면서도 고유한 모달리티 특징을 유지하기 위해.
  • 무시 게이트 메커니즘을 통해 관련 없거나 중복된 어텐션 특징을 필터링함으로써 감성 예측 성능을 향상시키기 위해.
  • 모달리티 중요도 및 아키텍처 모듈에 대한 추론을 위해 아블레이션 연구를 통해 구성 요소 설계의 효과성을 검증하기 위해.

제안 방법

  • 텍스트에는 사전학습된 BERT를 사용하고, 시각 및 청각 특징에는 양방향 LSTM과 완전히 연결된 신경망을 사용하며, 모든 특징을 공통 차원 $ d_k $로 투영한다.
  • 세 가지 모달리티 쌍인 (텍스트, 비디오), (비디오, 오디오), (텍스트, 오디오)에 대해 크로스모달 어텐션을 적용한다. 이는 쌍으로 구성된 모달리티에서 유도된 쿼리, 키, 밸류 행렬을 사용한다.
  • 각 쌍에 대해, 한 모달리티가 쿼리로, 다른 한 모달리티가 키/밸류로 작용함으로써 가중치 기반의 상호작용을 계산하고, 크로스모달 정렬을 가능하게 한다.
  • 크로스어텐션 출력에 대해 무시 게이트를 적용하여 잡음이 많거나 중복된 특징을 억제함으로써 융합된 표현의 신호 대 잡음 비율을 향상시킨다.
  • 잔차 연결을 사용하여 원본 모달리티 특징을 유지하고 학습 중 특징 열화를 방지한다.
  • 트랜스포머 기반의 융합 레이어가 정제된 크로스어텐션 특징을 집계하여 최종 감성 점수를 예측한다.

실험 결과

연구 질문

  • RQ1제안된 CMGA 모델은 기존의 다중모달 융합 방법에 비해 감성 예측 정확도를 어떻게 향상시키는가?
  • RQ2무시 게이트 메커니즘이 크로스모달 어텐션 과정에서 중복되거나 잡음이 많은 신호를 어떻게 필터링하는가?
  • RQ3다양한 모달리티 상호작용 순서((예: 텍스트-비디오 대 비디오-텍스트)가 모델 성능에 미치는 영향은 어떠한가?
  • RQ4각 모달리티(텍스트, 비디오, 오디오)가 최종 예측에 기여하는 비중은 얼마이며, 이를 제거했을 경우 성능에 어떤 영향을 미치는가?
  • RQ5크로스어텐션 및 잔차 연결과 같은 아키텍처 구성 요소가 모델의 효과성에 미치는 영향은 어떠한가?

주요 결과

  • MOSI 데이터셋에서 CMGA는 MAE 0.790과 Acc-7 43.29를 기록하여 대부분의 평가 지표에서 베이스라인 모델을 초월한다.
  • MOSEI 데이터셋에서는 MAE 0.545와 Acc-7 53.03를 기록하여 다양한 데이터셋에 대한 강력한 일반화 능력을 보여준다.
  • 아블레이션 연구 결과, 무시 게이트를 제거할 경우 MOSI에서 MAE가 0.856으로 상승하고, MOSEI에서는 0.594로 증가하여 무시 게이트의 잡음 억제 역할을 확인한다.
  • 크로스어텐션 메커니즘을 제거할 경우 성능 저하가 심각하게 발생하여 MOSI에서 MAE가 0.845로 상승하고, MOSEI에서는 0.587로 증가하여 크로스모달 학습에서의 중요성을 입증한다.
  • 아블레이션 연구 결과, 텍스트 모달리티가 성능에 가장 크게 기여하며, 이를 제거했을 경우 MOSI에서 정확도가 30.51%로 가장 크게 하락한다.
  • 모달리티 쌍 순서를 뒤집었을 때, 텍스트에서 비디오로의 어텐션보다 비디오에서 텍스트로의 어텐션이 더 중요하다는 점이 드러났다. 예를 들어, (텍스트, 비디오) 쌍을 (비디오, 텍스트)로 뒤집었을 때 MOSI에서 MAE가 0.790에서 0.814로 상승하여 성능 저하가 더 크다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.