Skip to main content
QUICK REVIEW

[논문 리뷰] Key-Sparse Transformer for Multimodal Speech Emotion Recognition

Weidong Chen, Xiaofeng Xing|arXiv (Cornell University)|2021. 06. 22.
Emotion and Mood Recognition참고 문헌 32인용 수 4
한 줄 요약

이 논문은 IEMOCAP 및 LSSED에서 최고 성능을 기록하며 다중모态 음성 감정 인식에서 우수한 강건성과 효율성을 보여주는 키-스parser 트랜스포머(KS-Transformer)를 제안한다. 이 모델은 감정 관련 음성 프레임과 단어에 동적으로 초점을 맞추고 불필요한 노이즈 토큰을 억제하기 위해 가중치에 학습 가능한 희소성 메커니즘을 적용한다. 주어진 수식 및 숫자는 그대로 유지되며, IEMOCAP에서 75.3%의 언웨이트드 정확도와 LSSED에서 55.7%의 정확도를 달성하여 상태의 기준을 초월한다.

ABSTRACT

Speech emotion recognition is a challenging research topic that plays a critical role in human-computer interaction. Multimodal inputs further improve the performance as more emotional information is used. However, existing studies learn all the information in the sample while only a small portion of it is about emotion. The redundant information will become noises and limit the system performance. In this paper, a key-sparse Transformer is proposed for efficient emotion recognition by focusing more on emotion related information. The proposed method is evaluated on the IEMOCAP and LSSED. Experimental results show that the proposed method achieves better performance than the state-of-the-art approaches.

연구 동기 및 목표

  • 음성 및 텍스트 입력에서 성능 저하를 초래하는 불필요하고 감정과 관련 없는 정보 문제를 해결하기 위해.
  • 음성 및 텍스트 모odal에서 감정 관련 특징에 대한 선택적 주의를 가능하게 하여 다중모달 융합의 효율성을 향상시키기 위해.
  • 감정적으로 중요한 프레임과 단어를 자동으로 식별하고 우선순위를 부여하는 희소 어텐션 메커니즘을 개발하기 위해.
  • 개선된 모odal 상호작용과 특징 집중을 통해 IEMOCAP 및 LSSED와 같은 벤치마크 데이터셋에서 최고 성능을 달성하기 위해.

제안 방법

  • 학습 가능한 임계값에 기반해 어텐션 가중치를 계산한 후 가장 작은 가중치를 0으로 재설정함으로써 어텐션 헤드에서 희소성을 달성하는 키-스퍼스 어텐션 메커니즘을 제안한다.
  • 키-스퍼스 처리 이후 음성과 텍스트 모달 간의 깊고 다단계적인 상호작용을 가능하게 하는 캐스케이드형 크로스어텐션 블록(CCAB)을 도입한다.
  • 강력한 초기 특징 표현을 위해 각각 음성 및 텍스트 임베딩을 추출하기 위해 사전학습된 wav2vec 및 RoBERTa 모델을 사용한다.
  • 정보 유지와 노이즈 억제 사이의 최적 균형을 확보하기 위해 k=0.5(어텐션 가중치의 50%가 0으로 재설정됨)를 선택하여 미분 가능한 희소 전략을 적용한다.
  • 각 헤드에 대해 희소성을 적용함으로써 어텐션 다양성을 유지하는 다중헤드 어텐션 메커니즘을 활용한다.
  • 최종 분류를 위한 특징 추출, 모달 상호작용(CCAB를 통한), 심층 융합을 포함하는 세 모듈 아키텍처에 KS-Transformer를 통합한다.

실험 결과

연구 질문

  • RQ1학습 가능한 키-스퍼스 어텐션 메커니즘이 음성 및 텍스트에서 감정과 관련 없는 노이즈 토큰을 걸러내어 음성 감정 인식 성능을 향상시킬 수 있는가?
  • RQ2캐스케이드형 크로스어텐션 블록(CCAB)의 수가 다중모달 감정 인식에서 모달 상호작용과 전체 성능에 어떤 영향을 미치는가?
  • RQ3제안된 KS-Transformer가 IEMOCAP 및 LSSED와 같은 벤치마크 데이터셋에서 표준 트랜스포머 및 기존 최고 수준의 모델보다 우월한 성능을 보일 수 있는가?
  • RQ4정보 유지와 노이즈 감소 사이의 균형을 확보하기 위해 최적의 희소 수준(하이퍼파라미터 k로 제어)은 무엇인가?
  • RQ5특히 대규모 LSSED 데이터셋에서 클래스 불균형 상황에서 모델의 성능은 어떠한가?

주요 결과

  • 제안된 KS-Transformer는 IEMOCAP에서 75.3%의 언웨이트드 정확도를 달성하여 CMA(72.8%), STSER(72.1%), GBAN(70.1%)을 포함한 모든 이전 최고 수준의 방법들을 능가한다.
  • LSSED 데이터셋에서는 55.7%의 언웨이트드 정확도를 기록하여 PyResNet(42.9%) 및 STSER(51.2%)를 포함한 비교 모델들 중에서 가장 높은 성능을 보였다.
  • 최적의 희소 수준은 k=0.5로, 이는 두 데이터셋에서 성능 유지와 노이즈 억제 사이의 균형을 잘 맞춘다.
  • 세 개의 캐스케이드형 크로스어텐션 블록(CCAB)을 사용할 경우 최고의 성능를 기록하여, 여러 차례의 모달 상호작용이 효과적인 융합을 위해 필수적임을 시사한다.
  • 시각화 결과는 KS-Transformer가 'it', 'a', 'look'과 같은 감정과 관련 없는 단어에 대한 어텐션을 감소시키고, 'beautiful'이나 'arguing'과 같은 감정적으로 중요한 어휘에 대한 집중을 증가시킴을 확인한다.
  • IEMOCAP에서 과적합에 대한 저항력이 향상되었고, k가 0.5를 초과할 경우 LSSED에서 성능 저하가 감소함을 확인하여, 대규모 및 불균형 데이터 처리에 있어 희소성의 이점이 입증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.