Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-modal Attention for Speech Emotion Recognition

Zexu Pan, Zhaojie Luo|arXiv (Cornell University)|2020. 09. 09.
Emotion and Mood Recognition참고 문헌 30인용 수 7
한 줄 요약

이 논문은 음성, 시각적, 텍스트 모odal 간의 병렬적 방향성 주의를 적용하여 초기 융합에서의 연결 방식 대신 사용하는 새로운 cLSTM-MMA 메커니즘을 활용한 하이브리드 다중모odal 주의 네트워크(MMAN)를 제안한다. 이 방법은 기존 모델들보다 훨씬 적은 파라미터를 사용하면서도 IEMOCAP 데이터셋에서 최신 기준 성능인 73.94%의 정확도를 달성한다.

ABSTRACT

Emotion represents an essential aspect of human speech that is manifested in speech prosody. Speech, visual, and textual cues are complementary in human communication. In this paper, we study a hybrid fusion method, referred to as multi-modal attention network (MMAN) to make use of visual and textual cues in speech emotion recognition. We propose a novel multi-modal attention mechanism, cLSTM-MMA, which facilitates the attention across three modalities and selectively fuse the information. cLSTM-MMA is fused with other uni-modal sub-networks in the late fusion. The experiments show that speech emotion recognition benefits significantly from visual and textual cues, and the proposed cLSTM-MMA alone is as competitive as other fusion methods in terms of accuracy, but with a much more compact network structure. The proposed hybrid network MMAN achieves state-of-the-art performance on IEMOCAP database for emotion recognition.

연구 동기 및 목표

  • 음성의 억양 외에 보완적인 시각적 및 텍스트적 단서를 효과적으로 융합하여 음성 정서 인식 성능을 향상시키기 위해.
  • 기존의 초기 융합 방식의 한계(예: 특징의 비일치, 파라미터 비효율성)를 학습 가능한 주의 기반 메커니즘으로 해결하기 위해.
  • 세 모달 간의 상호작용을 동시에 모델링할 수 있도록 처음으로 삼중 모달 교차 주의를 탐색하기 위해.
  • 초기 융합과 후기 융합을 조합함으로써 컴act한 네트워크 아키텍처를 통해 최신 기준 성능을 달성하기 위해.

제안 방법

  • 음성, 시각, 텍스트 특징 간의 다중모달 주의를 계산하기 위해 세 개의 병렬적 방향 주의 모듈을 사용하는 다중모달 주의 서브넷인 cLSTM-MMA를 도입한다.
  • 각 주의 모듈은 하나의 모달에서 쿼리, 키, 밸류 표현을 생성하고, 코사인 유사도 기반 주의 점수를 사용해 나머지 두 모달에 주의를 기울인다.
  • 이 주의 메커니즘은 단순한 연결 방식 대신 선택적이고 동적 융합을 가능하게 하여 초기 융합에서의 특징 융합을 대체한다.
  • cLSTM-MMA는 유니모달 cLSTM 서브넷(음성, 시각, 텍스트)을 먼저 처리한 후 예측 결과를 밀집층과 소프트맥스층을 통해 융합하는 하이브리드 후기 융합 프레임워크(MMAN)에 통합된다.
  • 학습 안정성을 높이기 위해 주의 계산 이전에 유니모달 임bedding을 표준화한다.
  • 모달 고유의 표현과 다중모달 상호작용을 효율적으로 모델링할 수 있도록 아키텍처를 설계하였다.

실험 결과

연구 질문

  • RQ1다중모달 주의 메커니즘이 음성 정서 인식에서 단순 연결 기반의 전통적 초기 융합 방식을 능가할 수 있는가?
  • RQ2세 모달 간의 교차 주의(동시적으로 음성, 시각, 텍스트에 주의)가 쌍방 주의 또는 후기 융합 대비 성능 향상에 기여하는가?
  • RQ3주목적 기반의 초기 융합 네트워크가 주의 메커니즘을 통합함으로써 더 큰 후기 융합 모델과 유사한 성능을 달성할 수 있는가?
  • RQ4시각적 및 텍스트적 단서는 음성 전용 정서 인식에서의 모호성을 어떻게 완화하는가?

주요 결과

  • cLSTM-MMA 모델은 IEMOCAP에서 71.66%의 정확도를 달성하여 초기 융합 기반 모델(cLSTM-EF)보다 2% 높은 성능을 보였으며, 파라미터 수도 127만 개로 cLSTM-EF보다 40% 적게 사용하였다.
  • 제안된 하이브리드 MMAN 네트워크는 IEMOCAP 데이터셋에서 최신 기준 성능인 73.94%의 정확도를 기록하여, 향후 컨텍스트를 접근 가능한 BLSTM 기반 모델을 포함한 모든 이전 방법들을 초월하였다.
  • 혼동 행렬 분석 결과, cLSTM-MMA는 음성 전용 기반 모델(cLSTM-Speech)에 비해 중립 및 분노 정서의 재현율을 크게 향상시켰다. 특히 cLSTM-Speech는 중립 정서의 재현율이 매우 낮았다.
  • 이진 감성 분류에서 cLSTM-MMA는 '행복'에 대해 92.68%의 정확도, '분노'에 대해 93.32%의 정확도를 기록하여, MulT 및 기타 쌍방 주의 모델보다 뛰어난 성능을 보였다.
  • MMAN 모델은 큰 cLSTM-LF 후기 융합 모델(71.78% 정확도)과 유사한 성능을 439만 개의 파라미터로 달성했으며, cLSTM-LF는 473만 개의 파라미터가 필요했다.
  • 결과적으로 다중모달 주의는 연결 방식보다 더 효과적이고 효율적인 융합을 가능하게 하며, 모달 고유의 특징과 다중모달 상호작용이 고성능 정서 인식에 필수적임을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.