Skip to main content
QUICK REVIEW

[논문 리뷰] Temporal Modeling Matters: A Novel Temporal Emotional Modeling Approach for Speech Emotion Recognition

Jiaxin Ye, Xin-Cheng Wen|arXiv (Cornell University)|2022. 11. 14.
Emotion and Mood Recognition참고 문헌 24인용 수 5
한 줄 요약

이 논문은 확장된 인과 컨벌루션, 이중 방향 시간 인식, 동적 융합을 활용하여 장기적 의존성과 다양한 감정 시간 스케일에 적응할 수 있도록 하는 새로운 이중 방향 다중 척도 시간 모델링 네트워크인 TIM-Net을 제안한다. TIM-Net은 여섯 개인 벤치마크 데이터셋에서 두 번째로 우수한 방법에 비해 평균 UAR과 WAR를 각각 2.34%와 2.61% 향상시켜 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Speech emotion recognition (SER) plays a vital role in improving the interactions between humans and machines by inferring human emotion and affective states from speech signals. Whereas recent works primarily focus on mining spatiotemporal information from hand-crafted features, we explore how to model the temporal patterns of speech emotions from dynamic temporal scales. Towards that goal, we introduce a novel temporal emotional modeling approach for SER, termed Temporal-aware bI-direction Multi-scale Network (TIM-Net), which learns multi-scale contextual affective representations from various time scales. Specifically, TIM-Net first employs temporal-aware blocks to learn temporal affective representation, then integrates complementary information from the past and the future to enrich contextual representations, and finally, fuses multiple time scale features for better adaptation to the emotional variation. Extensive experimental results on six benchmark SER datasets demonstrate the superior performance of TIM-Net, gaining 2.34% and 2.61% improvements of the average UAR and WAR over the second-best on each corpus. The source code is available at https://github.com/Jiaxin-Ye/TIM-Net_SER.

연구 동기 및 목표

  • 기존의 SER 모델이 장기적 시간 의존성을 포착하는 데에 한계가 있음과, 변동하는 감정 시간 스케일에 적응하지 못하는 문제를 해결하기 위해.
  • 고정된 수신장이 아닌 동적이고 다중 척도 수신장을 학습하여 모델의 일반화 능력을 향상시키기 위해.
  • 새로운 이중 방향 아키텍처를 통해 과거와 미래의 보완적 정보를 통합하여 맥락 표현 학습을 향상시키기 위해.
  • 도메인 이동이 있는 다양한 음성 코퍼스 간에 효과적으로 일반화할 수 있는 방법을 개발하기 위해.
  • 다양한 시간 척도에서의 내부 및 상호 의존성을 포괄하여 정서적 표현을 향상시키는 통합 프레임워크를 제공하기 위해.

제안 방법

  • TIM-Net은 확장된 인과 컨벌루션(DC Conv) 기반의 시간 인식 블록을 사용하여 수신장을 확장하고, 인과성 위반 없이 장기적 시간 의존성을 모델링한다.
  • 이중 방향 모듈은 정방향 및 역방향 시퀀스를 별도로 처리한 후 과거와 미래의 보완적 맥락을 융합하여 표현을 풍부하게 한다.
  • 동적 융합 모듈은 다중 척도에서 유래한 특징을 적응적으로 통합하며, 입력의 동적 특성에 따라 융합 가중치를 조정하여 일반화 능력을 향상시킨다.
  • 모델은 입력으로 멜 주파수 페르스터컬 계수(MFCCs)를 사용하며, 50ms 프레임과 12.5ms 이격을 적용한 후 멜 필터 백과 DCT를 통해 39개의 계수를 추출한다.
  • 다양한 시간 스케일에서 감정 패턴을 포착하기 위해 증가하는 확장률을 가진 DC Conv를 사용하여 다중 척도 특징을 추출한다.
  • 최종 표현은 연결 및 비선형 변환을 거친 후 정서 예측을 위한 분류 헤드를 통해 도출된다.

실험 결과

연구 질문

  • RQ1다중 척도 이중 방향 시간 모델링 접근법이 음성 정서 인식에서 표현 학습을 향상시킬 수 있는가?
  • RQ2다중 척도 특징의 동적 융합이 다양한 음성 코퍼스 간 모델 일반화 능력을 향상시키는가?
  • RQ3제안된 TIM-Net 아키텍처는 기존 방법에 비해 벤치마크 SER 데이터셋에서 성능과 내구성 측면에서 어떻게 비교되는가?
  • RQ4장기적 의존성을 포착하는 능력이 정서 인식 정확도를 얼마나 향상시키는가?
  • RQ5미세조정 없이도 모델이 새로운 도메인 또는 교차 코퍼스 설정에서 효과적으로 일반화할 수 있는가?

주요 결과

  • TIM-Net은 여섯 개의 벤치마크 SER 데이터셋에서 두 번째로 우수한 방법에 비해 평균 UAR과 WAR를 각각 2.34%와 2.61% 향상시켰다.
  • 제거 실험 결과, 특히 역방향 시간 인식 블록이나 다중 척도 융합을 제거할 경우 성능 저하가 심각하게 발생함을 확인하여 이들의 필수성을 입증했다.
  • 동적 융합 모듈은 평균 융합보다 우수한 성능을 보이며, 다중 척도 특징의 적응적 가중치 조정이 모델 일반화 능력을 향상시킨다는 것을 입증했다.
  • t-SNE 시각화 결과, TIM-Net은 GM-TCN에 비해 더 명확한 군집 경계를 가지며 더 클래스 구별 능력이 뛰어난 표현을 학습하는 것으로 나타났다.
  • 교차 코퍼스 일반화 실험에서 TIM-Net은 TCN과 CAAM(최근의 도메인 적응 방법)을 모두 뛰어넘어 도메인 이동에 대한 강력한 내구성을 보였다.
  • 10겹 교차 검증 하에서 모델은 평균 UAR 88.76%와 평균 WAR 88.97%를 기록하여 모든 데이터셋에서 일관된 우수성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.