[논문 리뷰] Speech Emotion Recognition using Self-Supervised Features
이 논문은 자기지도 학습 음성 특징을 활용하여 엔드 투 엔드 모듈러형 말하기 정서 인식(SER) 시스템을 제안한다. 상游-하유 아키텍처를 통해 다양한 사전 훈련된 모델을 통합한다. 오직 음성 모odal리티만을 사용하여 IEMOCAP 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하며, 잘 튜닝된 자기지도 학습 특징이 텍스트 입력 없이도 다중모달 SOTA 시스템에 맞먹을 수 있음을 보여준다.
Self-supervised pre-trained features have consistently delivered state-of-art results in the field of natural language processing (NLP); however, their merits in the field of speech emotion recognition (SER) still need further investigation. In this paper we introduce a modular End-to- End (E2E) SER system based on an Upstream + Downstream architecture paradigm, which allows easy use/integration of a large variety of self-supervised features. Several SER experiments for predicting categorical emotion classes from the IEMOCAP dataset are performed. These experiments investigate interactions among fine-tuning of self-supervised feature models, aggregation of frame-level features into utterance-level features and back-end classification networks. The proposed monomodal speechonly based system not only achieves SOTA results, but also brings light to the possibility of powerful and well finetuned self-supervised acoustic features that reach results similar to the results achieved by SOTA multimodal systems using both Speech and Text modalities.
연구 동기 및 목표
- 자연어 처리를 초월하여 자기지도 학습 사전 훈련된 특징이 말하기 정서 인식(SER)에서 얼마나 효과적인지 조사하기 위해.
- 다양한 자기지도 학습 특징 추출기의 유연한 통합을 지원하는 모듈러형 엔드 투 엔드 SER 시스템을 개발하기 위해.
- 튜닝 전략, 특징 집계 방법, 분류기 아키텍처가 SER 성능에 미치는 영향을 분석하기 위해.
- 자기지도 학습 특징을 사용하는 단모달 음성 전용 시스템이 다중모달 SOTA 성능을 따라할 수 있는지 확인하기 위해.
- IEMOCAP 데이터셋에서 자기지도 학습 특징의 최적 구성에 대한 경험적 통찰을 제공하기 위해.
제안 방법
- 시스템은 상유-하유 아키텍처를 채택하여, 상유 모델이 원시 음성에서 자기지도 학습 특징을 추출하고, 하유 모델이 감정을 분류한다.
- 프레임 단위 표현은 통계 풀링(평균 및 표준편차)과 시간 풀링을 사용하여 발화 수준 표현으로 집계된다.
- 하유 분류기는 ReLU 활성화 함수와 드롭아웃 Regularization을 갖춘 피드포워드 신경망이다.
- 하이퍼파라미터는 그리드 서치를 통해 튜닝되며, 모델들은 IEMOCAP 데이터셋에서 교차 엔트로피 손실을 사용해 테스트된다.
- 프레임워크는 비교 분석을 위한 다양한 자기지도 학습 모델의 플러그 앤 플레이 통합을 지원한다.
실험 결과
연구 질문
- RQ1자기지도 학습 음성 특징이 단모달 말하기 정서 인식에서 최신 기술 수준 성능을 달성할 수 있는가?
- RQ2자기지도 학습 모델의 선택이 IEMOCAP 데이터셋에서 SER 성능에 어떤 영향을 미치는가?
- RQ3자기지도 학습 SER에 가장 적합한 특징 집계와 분류기 아키텍처의 조합은 무엇인가?
- RQ4자기지도 학습 특징을 사용하는 음성 전용 시스템이 다중모달 SOTA 시스템의 성능을 어느 정도 따라할 수 있는가?
- RQ5튜닝 전략이 자기지도 학습 특징의 SER에서의 효과성에 어떤 영향을 미치는가?
주요 결과
- 제안된 단모달 음성 전용 시스템은 IEMOCAP 데이터셋에서 최신 기술 수준 성능을 달성하며, 이전의 SOTA 결과를 초월한다.
- 자기지도 학습 모델의 튜닝은 고정된 특징을 사용할 때보다 감정 인식 정확도를 크게 향상시킨다.
- 성능이 가장 뛰어난 모델은 통계 풀링을 사용한 HuBERT를 상유 인코더로 사용하고, 하유 분류기를 철저히 튜닝한 것이다.
- 시스템은 IEMOCAP 데이터셋에서 가중 평균 F1 스코어 72.3%를 기록하여 이전의 단모달 접근 방식을 능가한다.
- 자기지도 학습 특징만으로도 음성과 텍스트를 모두 사용하는 다중모달 시스템과 비교할 만한 성능을 달성할 수 있다.
- 제거 실험을 통해 특징 집계와 분류기 설계가 자기지도 학습 특징을 최대한 활용하기 위해 필수적임을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.