Skip to main content
QUICK REVIEW

[논문 리뷰] Transfer Learning From Sound Representations For Anger Detection in Speech

Mohamed Ezzeldin A. Elshaer, Scott Wisdom|arXiv (Cornell University)|2019. 02. 06.
Emotion and Mood Recognition참고 문헌 19인용 수 14
한 줄 요약

이 논문은 일반적인 소리에 대해 사전 훈련된 자기지도 학습 음성 표현 모델인 SoundNet에서의 전이 학습을 통해 저지연성 분노 탐지 시스템을 제안한다. IEMOCAP과 같은 소량의 음성 정서 데이터셋에서 SoundNet의 특징를 미세 조정함으로써, 자연스럽고 다국어 음성에서 특히 뛰어난 성능 향상을 달성하였으며, 사전 훈련 과정에서 정서에 대한 직접적인 지도 학습이 이루어지지 않았음에도 불구하고 일반적인 소리 표현이 정서적 음성에 잘 일반화됨을 입증하였다.

ABSTRACT

In this work, we train fully convolutional networks to detect anger in speech. Since training these deep architectures requires large amounts of data and the size of emotion datasets is relatively small, we use transfer learning. However, unlike previous approaches that use speech or emotion-based tasks for the source model, we instead use SoundNet, a fully convolutional neural network trained multimodally on a massive video dataset to classify audio, with ground-truth labels provided by vision-based classifiers. As a result of transfer learning from SoundNet, our trained anger detection model improves performance and generalizes well on a variety of acted, elicited, and natural emotional speech datasets. We also test the cross-lingual effectiveness of our model by evaluating our English-trained model on Mandarin Chinese speech emotion data. Furthermore, our proposed system has low latency suitable for real-time applications, only requiring 1.2 seconds of audio to make a reliable classification.

연구 동기 및 목표

  • 대규모 음성 정서 데이터가 부족한 문제를 해결하기 위해 대규모 일반 음성 표현 모델에서의 전이 학습을 활용한다.
  • 완전 컨volution 신경망(FCN)을 사용하여 분노 탐지 성능를 향상시키며, 최소한의 지연(1.2초)을 확보한다.
  • 일반적인 소리 이벤트(예: SoundNet)에서 사전 훈련한 것이 정서 기반 또는 음성 기반 사전 훈련보다 분노 탐지에 더 잘 일반화되는지 조사한다.
  • 영어로 훈련된 모델을 중국어 방언 정서 음성 데이터에 적용하여 다국어 전이 능력을 평가한다.
  • 실시간 응답 시간이 중요한 사회적 로봇 및 IVR 시스템 등에 적합한 실시간 구동이 가능한 시스템을 개발한다.

제안 방법

  • 사전 훈련된 SoundNet 모델의 가중치로 초기화된 완전 컨볼루션 신경망(FCN)을 사용하여 분노 탐지에 대해 미세 조정한다.
  • SoundNet — 200만 개의 영상 클립을 사용해 시각 기반 레이블을 기반으로 일반 음성 이벤트를 분류하도록 훈련된 5층의 완전 컨볼루션 네트워크 — 를 소스 모델로 사용한다.
  • 미세 조정 중 SoundNet의 첫 두 층을 동결하여 저수준 음향 표현을 유지하면서 고수준 층은 정서 분류에 맞게 적응시킨다.
  • IEMOCAP 데이터셋에서 분류 불균형 문제를 완화하기 위해 균형 잡힌 샘플링 전략을 사용하여 엔드 투 엔드 FCN을 훈련시킨다.
  • 1.2초 클립과 600ms 힙 크기를 갖는 슬라이딩 윈도우 추론 전략을 적용하고, 짧은 클립은 제로 패딩하여 실시간 저지연 예측을 가능하게 한다.
  • 교차 엔트로피 손실을 사용하여 모델을 최적화하고, 클래스 불균형을 다루며 훈련 후 유연한 임계값 설정이 가능한 주요 평가 지표로 AU-ROC를 사용한다.

실험 결과

연구 질문

  • RQ1일반적인 소리 표현 모델(SoundNet)에서의 전이 학습이 무작위 초기화보다 음성 분노 탐지 성능을 향상시키는가?
  • RQ2일반적인 음성 이벤트에서 사전 훈련한 것이 기존의 음성 기반 사전 훈련보다 다양한 음성 조건(예: 연기된, 유도된, 자연스러운)에서 더 잘 일반화되는가?
  • RQ3영어 데이터로 훈련된 모델이 중국어 방언 정서 음성 데이터에 대해 얼마나 효과적인가?
  • RQ4높은 성능를 달성하면서도 1.2초의 저지연을 유지할 수 있는가? 이는 실시간 응용에 적합한가?
  • RQ5SoundNet이 음성 또는 정서 레이블 없이 훈련되었음에도 불구하고, SoundNet이 학습한 저수준 음향 특징이 음성 정서 인식에 전이 가능한가?

주요 결과

  • SoundNet에서의 전이 학습은 IEMOCAP 유도 영어 데이터셋에서 무작위 초기화 시 AU-ROC 0.719에서 0.736으로 향상되었으며, 통계적으로 유의미한 개선이었다(p < 3e-4).
  • 자연스러운 영어 데이터셋인 AngerSES에서는 전이 학습 모델이 AU-ROC 0.669를 달성하여 무작위 초기화 모델의 0.581보다 뚜렷한 향상을 보였다.
  • 연기된 중국어 방언 음성 데이터셋인 MASC에서는 전이 학습 모델이 AU-ROC 0.626을 기록하여 무작위 초기화 기반 모델의 0.481보다 유의미하게 뛰어났다.
  • SoundNet이 학습한 음향 표현의 강건성 덕분에, 배경 소음이 있는 자연스러운 음성 및 다양한 녹음 환경에서도 모델이 잘 일반화됨을 확인하였다.
  • EmoProsody를 제외한 모든 성능 향상은 99% 신뢰수준에서 통계적으로 유의미했으며(p < 3e-4), 전이 학습 접근법의 효과를 확인하였다.
  • 시스템은 오직 1.2초의 오디오 지연만을 가지며, 인간의 분노 인식 시간(700ms)과 유사하여 대화형 AI 및 사회적 로봇 등 실시간 응용에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.