Skip to main content
QUICK REVIEW

[논문 리뷰] Speech Emotion Recognition with Multiscale Area Attention and Data Augmentation

Mingke Xu, Fan Zhang|arXiv (Cornell University)|2021. 02. 03.
Speech and Audio Processing참고 문헌 22인용 수 4
한 줄 요약

이 논문은 음성 정서 인식(SER)을 위한 다중 척도 영역 주의 메커니즘과 후각도관 길이 변형(VTLP)을 조합하여 다양한 공간 해상도에서의 특징 표현을 향상시키고, 데이터 증강을 통해 강건성을 향상시킨다. IEMOCAP 데이터셋에서 79.34%의 가중 정확도와 77.54%의 비가중 정확도를 기록하여 새로운 최고 성능을 달성한다.

ABSTRACT

In Speech Emotion Recognition (SER), emotional characteristics often appear in diverse forms of energy patterns in spectrograms. Typical attention neural network classifiers of SER are usually optimized on a fixed attention granularity. In this paper, we apply multiscale area attention in a deep convolutional neural network to attend emotional characteristics with varied granularities and therefore the classifier can benefit from an ensemble of attentions with different scales. To deal with data sparsity, we conduct data augmentation with vocal tract length perturbation (VTLP) to improve the generalization capability of the classifier. Experiments are carried out on the Interactive Emotional Dyadic Motion Capture (IEMOCAP) dataset. We achieved 79.34% weighted accuracy (WA) and 77.54% unweighted accuracy (UA), which, to the best of our knowledge, is the state of the art on this dataset.

연구 동기 및 목표

  • 고정된 해상도 주의 메커니즘이 음성 스펙트로그램의 다양한 척도에서 다양하게 나타나는 정서 에너지 패턴을 포착하지 못하는 한계를 해결하기 위해.
  • IEMOCAP 데이터셋에 VTLP 기반 데이터 증강을 적용하여 데이터가 적은 환경에서 모델의 일반화 성능을 향상시키기 위해.
  • 다양한 공간 해상도에서 정서 특징을 동적으로 주의 집중할 수 있는 새로운 다중 척도 영역 주의 메커니즘을 개발하기 위해.
  • 음성 정서 인식 분야에서 IEMOCAP 벤치마크에서 최고 성능을 달성하기 위해.

제안 방법

  • 스펙트로그램 표현 내에서 크기가 가변적인 영역(예: 1x1, 2x2, 3x3, 4x4)에 대해 주의를 계산하는 다중 척도 영역 주의 메커니즘을 도입하여, 국소적이고 광범위한 정서적 단서 모두에 집중할 수 있도록 한다.
  • 특징 맵에서 유도된 쿼리, 키, 밸류 행렬을 사용하여 자기 주의 메커니즘을 변형하고, 스케일된 닷 프로덕트 주의를 통해 소프트맥스를 통한 주의 점수를 계산한다.
  • 후각도관 길이를 변형시켜 학습 데이터를 증강함으로써 정서 레이블을 유지하면서 데이터 다양성과 강건성을 향상시킨다.
  • 배치 정규화를 적용한 5층의 CNN을 사용하고, 이후 주의 레이어와 완전 연결 레이어를 통해 분류를 수행하며, 로그멜 스펙트로그램을 입력으로 사용한다.
  • 주의 표현 최적화를 위해 키포인트로 최댓값, 평균, 샘플(편중된 평균)을, 밸류로 최댓값, 평균, 합계를 사용한다.
  • 주의 유형, VTLP, 영역 크기, 특징 선택의 영향을 평가하기 위해 추론 분석을 수행한다.

실험 결과

연구 질문

  • RQ1다중 척도 영역 주의가 스펙트로그램의 다양한 공간 해상도에서 정서 패턴을 포착함으로써 SER 성능을 향상시킬 수 있는가?
  • RQ2VTLP 기반 데이터 증강이 자원이 부족한 SER 환경에서 모델의 일반화 능력과 정확도를 향상시키는가?
  • RQ3다중 척도 영역 주의에서 최적의 최대 영역 크기와 특징 조합(예: 최댓값, 평균, 샘플)은 무엇인가?
  • RQ4다중 척도 주의와 데이터 증강의 통합은 IEMOCAP 데이터셋에서 이전 최고 성능 모델과 비교해 어떻게 성능을 냅니다?

주요 결과

  • 제안된 다중 척도 영역 주의 메커니즘은 IEMOCAP 데이터셋에서 79.34%의 가중 정확도와 77.54%의 비가중 정확도를 기록하여 문헌에 보고된 모든 이전 방법을 능가한다.
  • VTLP 기반 데이터 증강은 다중 척도 영역 주의와 결합되었을 때 약 0.5%p의 정확도 향상을 보였으며, 자원이 부족한 상황에서의 효과를 입증한다.
  • VTLP로 증강된 데이터에서 학습할 경우 최적의 최대 영역 크기는 3x3였고, 원본 데이터에서는 4x4가 가장 우수한 성능을 보였으며, 이는 데이터 분포에 민감함을 시사한다.
  • 키 특징으로 샘플, 밸류 특징으로 최댓값 조합이 가장 높은 정확도(78.44%)를 기록하여, 키 계산에서의 확률적 변형이 모델의 강건성을 향상시킨다는 것을 시사한다.
  • 추론 분석 결과 다중 척도 영역 주의와 VTLP 모두 성능 향상에 기여하며, 최고 성능 모델은 79.34% WA와 77.54% UA를 달성했다.
  • 특징 맵의 시각화 결과, 영역 주의가 표준 CNN보다 더 넓은 시간적 맥락을 포착하는 것으로 나타났으며, 이는 장기적인 정서 패턴 인식에 유리하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.