[논문 리뷰] Large Raw Emotional Dataset with Aggregation Mechanism
이 논문은 약 350시간의 음성 및 원문을 포함한 대규모, 오픈소스, 이중모달 러시아어 감정 인식 데이터셋인 Dusha를 소개한다. 이 데이터셋은 시연(기부자 기반) 및 실제 생활(팟캐스트) 소스에서 유래한다. 신뢰도 높은 감정 레이블을 생성하기 위해 Dawid-Skene 기반의 집계 기법과 0.9의 신뢰도 임계값을 사용하며, 이는 사전 훈련(시연) 및 최적화(현실적인) 응용을 가능하게 한다. 기준 모델은 시연 테스트 세트에서 0.83 UA와 0.77 F1을 기록하였다.
We present a new data set for speech emotion recognition (SER) tasks called Dusha. The corpus contains approximately 350 hours of data, more than 300 000 audio recordings with Russian speech and their transcripts. Therefore it is the biggest open bi-modal data collection for SER task nowadays. It is annotated using a crowd-sourcing platform and includes two subsets: acted and real-life. Acted subset has a more balanced class distribution than the unbalanced real-life part consisting of audio podcasts. So the first one is suitable for model pre-training, and the second is elaborated for fine-tuning purposes, model approbation, and validation. This paper describes pre-processing routine, annotation, and experiment with a baseline model to demonstrate some actual metrics which could be obtained with the Dusha data set.
연구 동기 및 목표
- 러시아어에서 대규모, 다양한, 현실적인 음성 감정 데이터셋의 부족 문제를 해결하기 위해 새로운 오픈 기준을 구축하기 위해.
- 통계적 집계를 통한 다중 평가자 기반의 기부자 기반 접근을 통해 감정 인식 데이터셋의 편향을 완화하고 레이블 신뢰도를 향상시키기 위해.
- 사전 훈련과 실제 세계 모델 평가를 지원하기 위해 시연(균형 잡힌) 및 실제 생활(균형이 깨진)이라는 이중 도메인 데이터셋을 제공하기 위해.
- 연구의 진입 장벽을 낮추기 위해 데이터, 전처리 스크립트, 기준 모델을 포함한 완전한 파이프라인을 공개하기 위해.
- 저자원 언어(러시아어)에서 고품질의 다국어 대응 가능 코퍼스를 제공함으로써 다국어 및 전이 학습 연구를 가능하게 하기 위해.
제안 방법
- 이 데이터셋인 Dusha는 두 가지 소스에서 약 350시간의 러시아어 음성을 수집한다: 기부자 기반 시연 녹음(255시간)과 실제 팟캐스트 녹음(90시간).
- 각 음성 샘플은 원문과 함께 제공되어 다중모달 감정 인식에 적합한 이중모달 데이터셋을 형성한다.
- 감정은 네 가지 클래스로 레이블링된다: 분노, 기쁨, 중립, 슬픔이며, 각 샘플은 다수의 기부자 평가자에 의해 레이블링된다.
- 개별 레이블을 하나의 고신뢰도 레이블로 집계하기 위해 신뢰도 임계값 0.9를 가진 Dawid-Skene(DS) 알고리즘을 적용한다.
- 집계 과정은 단일 레이블 및 다중 레이블 출력을 모두 지원하여 레이블의 신뢰도를 향상시키고 평가 편향을 줄인다.
- 기준 모델은 멜스펙트로그램(64개 필터뱅크, 20ms 윈도우, 10ms 겹침), MobileNetV2 기반 아키텍처에 자기주의성 주입층을 통합하고, 배치 크기가 64인 100에포크 동안 Adam 옵timizer를 사용해 훈련한다.
실험 결과
연구 질문
- RQ1충분한 다양성과 현실성으로 인해 강력한 SER 모델 훈련 및 평가를 지원할 수 있는 대규모 이중모달 러시아어 감정 인식 데이터셋을 구축할 수 있는가?
- RQ20.9의 신뢰도 임계값을 가진 Dawid-Skene 집계 기법이 원시 기부자 기반 레이블에 비해 레이블의 신뢰도를 얼마나 효과적으로 향상시키는가?
- RQ3Dusha의 시범 데이터셋에서 훈련된 기준 모델이 팟캐스트에서 유래한 실제 세계의 비정형 음성에 얼마나 일반화되는가?
- RQ4표준 딥러닝 아키텍처와 표준 평가 프로토콜을 사용할 때 Dusha 기준에서 달성 가능한 성능 지표(F1, 정확도 등)는 무엇인가?
- RQ5IEMOCAP4에서 훈련된 모델의 성능은 Dusha에서의 성능와 비교해 어떻게 되는가?
주요 결과
- 집계 후 Dusha 데이터셋은 학습용 230,177개 샘플과 테스트용 24,672개 샘플을 포함하며, 학습 음성 약 260시간, 테스트 음성 약 28시간에 해당한다.
- 시범(기부자 기반) 데이터셋은 네 감정 클래스에 대해 상대적으로 균형 잡힌 분포를 보이며 164,387개 샘플을 포함하지만, 팟캐스트 데이터셋(90,462개 샘플)은 중립 감정이 압도적으로 우세하다.
- 기준 모델은 시범 테스트 세트에서 0.83의 무게 없는 정확도(UA)와 0.77의 매크로 F1 스코어를 기록하여 균형 잡힌 세트에서 뛰어난 성능을 보였다.
- 더 현실적인 팟캐스트 테스트 세트에서는 모델이 0.89 UA를 기록했지만, 가중 정확도(WA)는 0.53, F1은 0.54에 머물러 도메인 이동과 클래스 불균형의 과제를 반영한다.
- IEMOCAP4에서 훈련된 모델은 5겹 교차검증에서 0.59 UA, 0.59 WA, 0.59 F1을 기록하여 Dusha 결과와 비교하기 위한 기준이 되었다.
- 집계 기법은 기부자 기반 레이블의 노이즈를 성공적으로 감소시켰으며, 90%의 샘플이 0.9 이상의 신뢰도 스코어를 확보하여 후속 작업에 대해 고품질의 레이블 출력을 보장했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.