Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-scale Cooperative Multimodal Transformers for Multimodal Sentiment Analysis in Videos

Lianyang Ma, Yue Yu|arXiv (Cornell University)|2022. 06. 16.
Sentiment Analysis and Opinion Mining인용 수 6
한 줄 요약

이 논문은 시각, 텍스트 및 청각 모odalities에서 유도된 다중 척도 표현을 활용하여 교차모달 상호작용을 향상시키는 새로운 아키텍처인 다중 척도 협업 다중모달 트랜스포머(MCMulT)를 제안한다. 다중 척도 교차모달 어텐션을 통한 협업적 계층적 특징 학습을 가능하게 함으로써, MCMulT는 정렬된 및 정렬되지 않은 다중모달 데이터셋에서 기존의 MulT와 같은 방법들을 초월하는 최신 기술 성능을 달성한다.

ABSTRACT

Multimodal sentiment analysis in videos is a key task in many real-world applications, which usually requires integrating multimodal streams including visual, verbal and acoustic behaviors. To improve the robustness of multimodal fusion, some of the existing methods let different modalities communicate with each other and modal the crossmodal interaction via transformers. However, these methods only use the single-scale representations during the interaction but forget to exploit multi-scale representations that contain different levels of semantic information. As a result, the representations learned by transformers could be biased especially for unaligned multimodal data. In this paper, we propose a multi-scale cooperative multimodal transformer (MCMulT) architecture for multimodal sentiment analysis. On the whole, the "multi-scale" mechanism is capable of exploiting the different levels of semantic information of each modality which are used for fine-grained crossmodal interactions. Meanwhile, each modality learns its feature hierarchies via integrating the crossmodal interactions from multiple level features of its source modality. In this way, each pair of modalities progressively builds feature hierarchies respectively in a cooperative manner. The empirical results illustrate that our MCMulT model not only outperforms existing approaches on unaligned multimodal sequences but also has strong performance on aligned multimodal sequences.

연구 동기 및 목표

  • 영상 감성 분석에서 시각, 텍스트 및 청각 스트림 간 시간적 정렬이 어긋난 다중모달 시퀀스 문제를 해결하기 위해.
  • 교차모달 어텐션 중 단일 척도 특징 대신 다중 척도 표현을 활용하여 다중모달 융합의 강건성을 향상시키기 위해.
  • 다양한 척도에서 방향성 있는 교차모달 상호작용을 통해 다중 모달 간 협업적 계층적 특징 학습을 가능하게 하기 위해.
  • 지역 및 전역 어텐션을 조합한 블록-스케일 메커니즘을 통해 계산 복잡도를 줄이면서도 높은 성능 유지하기 위해.
  • 정렬된 및 정렬되지 않은 다중모달 감성 분석 벤치마크에서 뛰어난 성능을 입증하기 위해.

제안 방법

  • MCMulT 아키텍처는 각 모달리티에서 유도된 다중 척도 표현을 통합하여 교차모달 어텐션을 수행하는 다중 척도 교차모달 트랜스포머 블록(MCTB)을 사용한다.
  • 각 모달리티는 소스 모달리티의 다수준 특징을 주시하기 위해 다중 척도 교차모달 어텐션(MACT) 레이어를 활용하며, 이는 다양한 의미적 해상도에서 특징 표현을 향상시킨다.
  • 방향성 있는 교차모달 상호작용은 협업 방식으로 수행되며, 각 모달리티는 다른 모달리티로부터 향상된 특징을 이용해 점진적으로 자신의 계층적 표현을 구축한다.
  • 윈도우 기반 국소적 맥락과 전역 어텐션을 조합한 블록-스케일 메커니즘이 계산 복잡도를 줄이면서도 장거리 의존성을 유지한다.
  • MCTB의 스택에 다수의 교차모달 트랜스포머(CT) 레이어를 배치하며, 각 CT 레이어는 소스 모달리티의 다중 척도 특징을 주시한다.
  • 아키텍처는 수동 정렬이나 특징 공학 없이도 정렬되지 않은 다중모달 시퀀스에서 엔드 투 엔드로 훈련된다.

실험 결과

연구 질문

  • RQ1다중 척도 표현은 정렬되지 않은 다중모달 시퀀스에서 교차모달 상호작용의 강건성을 향상시키는가?
  • RQ2다양한 모달리티 간 협업적 계층적 특징 학습은 감성 분류 성능을 향상시키는가?
  • RQ3블록-스케일 메커니즘은 다중모달 트랜스포머에서 계산 효율성과 성능 간의 균형을 어떻게 유지하는가?
  • RQ4MCMulT는 정렬된 및 정렬되지 않은 다중모달 감성 분석 벤치마크에서 기존 최신 기술 방법들을 초월하는가?
  • RQ5성능을 극대화하기 위해 MCTB 블록과 CT 레이어의 최적 설정은 무엇인가?

주요 결과

  • MCMulT는 CMU-MOSEI 데이터셋에서 7클래스 감성 작업(Acc²₇)에서 51.83%의 정확도와 2클래스 작업(Acc²₂)에서 83.00%의 정확도를 기록하여 MulT-12보다 Acc²₂에서 5.6个百分点 높게 기록한다.
  • 7클래스 작업에서 F1 점수는 82.77%이며 상관계수는 0.699를 기록하여, 모든 MulT 변종 및 단일 모달리티 기반 베이스라인을 초월한다.
  • MCMulT-LocalDense 버전은 Acc²₇에서 51.36%와 Acc²₂에서 82.41%를 기록하여, 국소 맥락 어텐션 기반 모델이 밀도 어텐션 대비 성능 향상을 보임을 보여준다.
  • 최적 설정은 블록당 4개의 MCTB 블록과 3개의 CT 레이어로, 이 이상 설정할 경우 성능이 정점에 도달한 후 약간 감소함을 확인하였다.
  • 단일 모달리티 기반 베이스라인 대비, 시각 및 청각 모달리티를 타겟 모달리티로 사용할 경우 MCMulT가 성능을 10–15% 향상시킨다.
  • 다양한 모달리티 조합(V,A→T; T,A→V 등)에서도 강력한 성능 유지를 보이며, 다양한 교차모달 융합 설정에서의 일반화 능력을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.