Skip to main content
QUICK REVIEW

[논문 리뷰] emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation

Ziyang Ma, Zhisheng Zheng|arXiv (Cornell University)|2023. 12. 23.
Emotion and Mood Recognition인용 수 6
한 줄 요약

emotion2vec는 온라인 디스틸레이션을 사용하여 262시간의 레이블이 없는 감정 데이터로 사전 훈련된 자기지도 학습형 보편적인 음성 감정 표현 모델로, 병합된 문장 수준 및 프레임 수준의 손실을 사용한다. IEMOCAP에서 최고 성능을 기록하고 10개의 언어 및 다양한 감정 작업으로의 일반화 능력을 보이며, 단순한 선형 헤드 미세조정을 통해 일반 목적 및 감정 전문 모델을 모두 능가한다.

ABSTRACT

We propose emotion2vec, a universal speech emotion representation model. emotion2vec is pre-trained on open-source unlabeled emotion data through self-supervised online distillation, combining utterance-level loss and frame-level loss during pre-training. emotion2vec outperforms state-of-the-art pre-trained universal models and emotion specialist models by only training linear layers for the speech emotion recognition task on the mainstream IEMOCAP dataset. In addition, emotion2vec shows consistent improvements among 10 different languages of speech emotion recognition datasets. emotion2vec also shows excellent results on other emotion tasks, such as song emotion recognition, emotion prediction in conversation, and sentiment analysis. Comparison experiments, ablation experiments, and visualization comprehensively demonstrate the universal capability of the proposed emotion2vec. To the best of our knowledge, emotion2vec is the first universal representation model in various emotion-related tasks, filling a gap in the field.

연구 동기 및 목표

  • 다양한 감정 작업과 언어로의 일반화 능력을 갖춘 보편적인 음성 감정 표현 모델의 부족을 해결하기 위해.
  • 사전 훈련 중에 문장 수준 및 프레임 수준의 자기지도 학습 손실을 병합하여 음성 감정 표현 학습을 향상시키기 위해.
  • 광범용 SSL 모델과 작업별 감정 모델을 모두 능가하는 모델을 개발하여 광범위한 미세조정 없이도 성능을 확보하기 위해.
  • 학습된 표현이 SER, 노래 감정 인식, 감성 분석과 같은 후행 작업으로 제로샷 전이 가능성을 입증하기 위해.
  • 온라인 디스틸레이션과 다중 수준 감독이 감정 인식 표현 학습에 효과적인지 검증하기 위해.

제안 방법

  • 온라인 디스틸레이션 프레임워크를 사용하여 262시간의 오픈소스 레이블이 없는 감정 데이터로 emotion2vec을 사전 훈련하여 자기지도 학습을 가능하게 한다.
  • 전반적인 감정적 맥락과 국소적인 음성 세부 정보를 모두 포착하기 위해 사전 훈련 중에 문장 수준 및 프레임 수준의 대비 손실을 통합한다.
  • 문장 수준 손실의 양성 샘플로 청크 임베딩을 사용하며, 이는 토큰 수준 및 글로벌 수준 방법보다 성능이 뛰어나다.
  • 문장 수준 손실과 프레임 수준 손실 간 1:1 비율의 가중 조합을 적용하여 최적의 성능을 달성한다.
  • 학습된 표현을 분석하고 모델 간 클래스 분리 가능성 비교를 위해 UMAP 시각화를 수행한다.
  • 정확한 베이스라인 비교를 보장하기 위해 후행 평가를 위해 emotion2vec 특징 위에 단순 선형 분류기를 훈련시킨다.

실험 결과

연구 질문

  • RQ1병합된 문장 수준 및 프레임 수준의 손실을 사용한 자기지도 사전 훈련 접근법이 기존 SSL 모델보다 더 구분력 있는 음성 감정 표현을 학습할 수 있는가?
  • RQ2emotion2vec은 음성 감정 인식을 넘어서 다양한 언어와 감정 작업으로 일반화되는가?
  • RQ3문장 수준 및 프레임 수준 감독의 조합이 단일 감독 전략 대비 표현 품질을 어떻게 향상시키는가?
  • RQ4emotion2vec은 단순한 선형 헤드 미세조정만으로 IEMOCAP에서 최고 성능을 기록하며, 광범용 SSL 모델과 감정 전문 모델을 모두 능가하는가?
  • RQ5emotion2vec에서 학습된 표현은 내부 클래스의 조밀성과 외부 클래스 간 간격 측면에서 어떻게 시각적·정량적으로 비교되는가?

주요 결과

  • emotion2vec는 선형 헤드만을 사용하여 IEMOCAP 데이터셋에서 72.13%의 가중 정확도를 기록하며, 모든 주요 SSL 모델과 전문 모델을 능가한다.
  • 문장 수준 및 프레임 수준 손실을 모두 적용한 모델(71.79% WA)은 프레임 수준 손실만 사용한 모델(70.85% WA)이나 문장 수준 손실만 사용한 모델(28.96% WA)보다 유의미하게 뛰어난 성능을 보인다.
  • emotion2vec는 10개 언어를 포함한 13개의 다양한 데이터셋에서 일관된 향상을 보이며, 강력한 언어 일반화 능력을 입증한다.
  • 노래 감정 인식 및 대화 속 감정 예측 작업에서 emotion2vec 특징는 뛰어난 성능을 기록하여 작업 일반화 능력을 확인한다.
  • UMAP 시각화 결과 emotion2vec 특징는 WavLM과 data2vec보다 더 높은 내부 클래스 조밀성과 더 큰 외부 클래스 간격을 보이며, 더 나은 클래스 분리 가능성(구분 능력)을 나타낸다.
  • 제거 실험 결과 1:1 손실 가중치와 청크 임베딩 기반의 문장 수준 손실이 최고의 성능을 내며, 설계 선택의 타당성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.