Skip to main content
QUICK REVIEW

[논문 리뷰] Text-oriented Modality Reinforcement Network for Multimodal Sentiment Analysis from Unaligned Multimodal Sequences

Yuxuan Lei, Dingkang Yang|arXiv (Cornell University)|2023. 07. 25.
Sentiment Analysis and Opinion MiningComputer Science인용 수 3
한 줄 요약

이 논문은 비정렬 시퀀스에서 다중모odal 감성 분석을 위한 텍스트 중심의 모odal 강화 네트워크(TMRN)를 제안한다. 텍스트를 중심 모odal로 활용하여 시각 및 청각 모달 간의 교차주의 및 자기주의 주의 메커니즘을 이끌어내며, 텍스트 중심의 상호작용과 적응형 융합을 통해 노이즈와 중복을 줄임으로써 MOSI 및 MOSEI 벤치마크에서 최신 기술(SOTA) 성능을 달성한다.

ABSTRACT

Multimodal Sentiment Analysis (MSA) aims to mine sentiment information from text, visual, and acoustic modalities. Previous works have focused on representation learning and feature fusion strategies. However, most of these efforts ignored the disparity in the semantic richness of different modalities and treated each modality in the same manner. That may lead to strong modalities being neglected and weak modalities being overvalued. Motivated by these observations, we propose a Text-oriented Modality Reinforcement Network (TMRN), which focuses on the dominance of the text modality in MSA. More specifically, we design a Text-Centered Cross-modal Attention (TCCA) module to make full interaction for text/acoustic and text/visual pairs, and a Text-Gated Self-Attention (TGSA) module to guide the self-reinforcement of the other two modalities. Furthermore, we present an adaptive fusion mechanism to decide the proportion of different modalities involved in the fusion process. Finally, we combine the feature matrices into vectors to get the final representation for the downstream tasks. Experimental results show that our TMRN outperforms the state-of-the-art methods on two MSA benchmarks.

연구 동기 및 목표

  • 강한 모달(예: 텍스트)이 미흡하게 사용되고 약한 모달(예: 청각/시각)이 과도하게 평가되는 다중모달 감성 분석에서 모달 기여의 불균형을 해결한다.
  • 모든 모달을 동일하게 취급하는 기존 방법의 한계를 극복하며, 의미적 풍부성의 격차를 간과하지 않는다.
  • 텍스트의 의미를 가이드로 삼아 시각 및 청각 모달에서 융합 시 노이즈와 중복을 줄인다.
  • 수동적 정렬 없이도 비정렬 다중모달 시퀀스를 효과적으로 융합할 수 있는 프레임워크를 개발하며, 장기적 의존성을 유지한다.
  • 표준 벤치마크에서 감성 분류 성능 향상에 있어 텍스트 중심 설계의 우수성을 입증한다.

제안 방법

  • 텍스트와 각각의 다른 두 모달(청각 및 시각) 간의 이중적 상호작용을 가능하게 하는 텍스트 중심 교차모달 주의(TCCA) 모듈을 제안하여 상호모달 정렬에 집중한다.
  • 텍스트 표현을 사용해 시각 및 청각 모달의 자기주의 주의를 게이팅하고 개선하는 텍스트 게이팅 자기주의 주의(TGSA) 모듈을 도입하여 노이즈를 줄이고 의미적 관련성을 향상시킨다.
  • 학습된 중요도 기반으로 융합 중 모달 가중치를 동적으로 할당하는 적응형 융합 메커니즘을 설계하여 강인성과 성능을 향상시킨다.
  • 모든 모달 간에 공유된 파rameter를 사용하는 다중헤드 주의 메커니즘을 TCCA 및 TGSA에 적용하여 파라미터 폭발을 줄이고 일반화 성능을 향상시킨다.
  • 학습 안정성 향상과 다중 레이어 간의 특징 학습 향상을 위해 잔차 연결 및 레이어 정규화를 적용한다.
  • 최종 특징 행렬을 전역 평균 풀링을 통해 모든 모달의 특징을 하나의 벡터 표현으로 통합하여 후속 감성 분류에 활용한다.

실험 결과

연구 질문

  • RQ1텍스트의 의미적 풍부성을 활용함으로써 텍스트 중심 아키텍처가 비정렬 시퀀스에서 다중모달 감성 분석 성능을 향상시킬 수 있는가?
  • RQ2텍스트 모달의 지배성이 청각 및 시각과 같은 약한 모달의 표현 품질에 어떤 영향을 미치는가?
  • RQ3기본 교차주의와 비교했을 때 제안된 TCCA 및 TGSA 모듈이 시각 및 청각 특징에서 노이즈와 중복을 어느 정도 감소시키는가?
  • RQ4모달 강화와 모델 용량을 균형 잡는 데 최적의 TCCA 및 TGSA 레이어 수는 얼마인가?
  • RQ5비정렬 다중모달 환경에서 적응형 융합 전략이 고정 또는 동일 가중치 융합 전략보다 우월한가?

주요 결과

  • TMRN은 MOSI 및 MOSEI 벤치마크에서 모두 최신 기술(SOTA) 성능을 달성하여 이전 SOTA 방법인 Self-MM을 초월한다.
  • MOSI에서 TMRN은 83.27% 정확도(Acc7), 0.7824 F1 점수, 45.33 MAE를 기록하여 이전 SOTA인 Self-MM을 뛰어넘었다.
  • MOSEI에서 TMRN은 84.75% 정확도(Acc7), 0.7817 F1 점수, 44.75 MAE를 기록하여 모든 지표에서 일관된 우수성을 입증했다.
  • 제거 실험 결과 TCCA 또는 TGSA 모듈을 제거할 경우 성능 저하가 심각하게 발생하여 이들의 필수성을 입증했다.
  • 제거 실험 결과 텍스트 모달이 청각 또는 시각 모달보다 더 핵심적임을 확인했으며, 텍스트를 제거할 경우 성능 저하가 더 심했다.
  • TCCA 및 TGSA 레이어의 최적 수는 N=3이며, 이 이상으로 레이어 수를 늘릴 경우 과적합 또는 지시 간섭으로 인해 성능이 저하됨을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.