[논문 리뷰] The ICML 2022 Expressive Vocalizations Workshop and Competition: Recognizing, Generating, and Personalizing Vocal Bursts
이 논문은 ICML 2022 ExVo 경쟁 대회를 소개하며, 미국, 중국, 남아프리카공화국, 베네수엘라의 1,702명의 화자로부터 촬영한 자연스러운 환경에서의 59,201개의 비어휘적 음성 표현을 포함한 Hume-VB 데이터셋을 바탕으로, 표현적인 음성 돌발음의 인식, 생성 및 개인화에 중점을 둔 대규모 연구를 수행한다. 세 가지 트랙을 제시하며, 다중 작업 학습의 기준 점수는 0.335, 생성 모델의 품질 평가 점수(S_Gen)는 0.174, 소수의 예시를 통한 개인화 학습의 경우 CCC는 0.444를 기록한다.
The ICML Expressive Vocalization (ExVo) Competition is focused on understanding and generating vocal bursts: laughs, gasps, cries, and other non-verbal vocalizations that are central to emotional expression and communication. ExVo 2022, includes three competition tracks using a large-scale dataset of 59,201 vocalizations from 1,702 speakers. The first, ExVo-MultiTask, requires participants to train a multi-task model to recognize expressed emotions and demographic traits from vocal bursts. The second, ExVo-Generate, requires participants to train a generative model that produces vocal bursts conveying ten different emotions. The third, ExVo-FewShot, requires participants to leverage few-shot learning incorporating speaker identity to train a model for the recognition of 10 emotions conveyed by vocal bursts. This paper describes the three tracks and provides performance measures for baseline models using state-of-the-art machine learning strategies. The baseline for each track is as follows, for ExVo-MultiTask, a combined score, computing the harmonic mean of Concordance Correlation Coefficient (CCC), Unweighted Average Recall (UAR), and inverted Mean Absolute Error (MAE) ($S_{MTL}$) is at best, 0.335 $S_{MTL}$; for ExVo-Generate, we report Fréchet inception distance (FID) scores ranging from 4.81 to 8.27 (depending on the emotion) between the training set and generated samples. We then combine the inverted FID with perceptual ratings of the generated samples ($S_{Gen}$) and obtain 0.174 $S_{Gen}$; and for ExVo-FewShot, a mean CCC of 0.444 is obtained.
연구 동기 및 목표
- 비어휘적 음성 표현에 대한 기계 학습 연구에서의 심각한 데이터 부족 문제를 해결하고자 하며, 이는 정서 표현의 핵심 요소이지만 데이터 부족으로 인해 여전히 탐색이 부족한 분야이다.
- 일반적인 정서 카테고리로의 분류를 넘어서, 웃음, 숨결, 울음과 같은 표현적인 음성 돌발음을 대규모로 실생활 환경에서 모델링할 수 있도록 하기 위함이다.
- 다양하고 자연스러운 환경에서 촬영된 데이터셋을 기반으로 하여, 음성 돌발음에 대한 다중 작업 학습, 생성 모델링, 소수의 예시를 통한 개인화에 대한 벤치마크를 제공하고자 한다.
- 다양한 언어와 문화권을 포함한 대규모 다국어 음성 돌발음 데이터셋을 공개함으로써 정서 강도 연속 측정값이 포함된 데이터를 제공함으로써 정서 컴퓨팅 분야의 연구를 가속화하고자 한다.
- 정서적 음성 돌발음의 인식, 생성, 화자 인식 기반 소수의 예시 예측이라는 세 가지 새로운 기계 학습 과제에 대한 기준 성능 지표를 수립하고자 한다.
제안 방법
- Hume-VB 데이터셋은 미국, 중국, 남아프리카공화국, 베네수엘라에서 수집된 1,702명의 화자로부터의 59,201개의 음성 돌발음을 포함하며, 다양한 음향 조건에서 자연스러운 주거 환경에서 기록되었다.
- ExVo-MultiTask의 경우, 다중 작업 학습 모델이 10개의 연속 정서 차원(예: 유머, 공포), 나이, 모국어 국가를 예측하며, CCC, UAR, 역행 MAE의 조화 평균을 기반으로 한 통합 점수(S_MTL)를 사용한다.
- ExVo-Generate의 경우, 특정 정서를 담고 있는 음성 돌발음을 생성하기 위해 조건부 생성 적대 신경망(cGAN)을 훈련시키며, 성능 평가에는 프리셰트 인ception 거리(FID)와 청각 평가 점수(S_Gen)를 사용한다.
- ExVo-FewShot의 경우, 화자당 두 개의 예시만을 사용하는 소수의 예시 설정에서 10개의 정서 차원을 예측하기 위해 256개의 은닉 유닛을 가진 2층의 LSTM을 사용하며, 성능 평가에는 일致성 상관계수(CCC)를 사용한다.
- 기준 모델은 최신 기술을 활용한다: 학습 안정성을 높이기 위해 ExtraAdam 최적화기를 사용하고, 생성 모델 수렴을 향상시키기 위해 데이터 필터링(예: 미국 샘플에 국한)을 시행한다.
- 평가에는 생성된 샘플과 실제 샘플 간의 FID, 청각 평가(HEEP), 그리고 회귀 과제의 경우 CCC를 포함하며, 결과는 각 정서 및 종합적으로 보고된다.
실험 결과
연구 질문
- RQ1표현적인 음성 돌발음에서 10개의 연속 정서 차원, 나이, 모국어 국가를 동시에 인식할 수 있는 다중 작업 모델의 성능은 어떠한가?
- RQ2생성 모델이 다양한 정서에 걸쳐 실제 음성 표현의 정서 내용과 음향 품질을 잘 반영하는 고해상도 음성 돌발음을 생성할 수 있는가?
- RQ3소수의 예시 학습 모델이 화자당 두 개의 예시만을 사용하여 음성 돌발음의 정서 강도를 얼마나 정확하게 예측할 수 있는가?
- RQ4언어, 기록 조건 등의 데이터 다양성이 음성 돌발음 생성 및 인식 모델의 성능과 학습 안정성에 어떤 영향을 미치는가?
- RQ5최신 딥 러닝 기법을 활용한 음성 돌발음의 인식, 생성, 개인화에 대한 기준 성능 수준은 어떠한가?
주요 결과
- ExVo-MultiTask의 기준 점수는 S_MTL = 0.335로, 정서, 나이, 인구 통계 예측에 대한 CCC, UAR, 역행 MAE의 조화 평균을 반영한다.
- ExVo-Generate의 경우, 다양한 정서에 대해 FID 점수는 4.81에서 8.27 사이를 오가며, 가장 낮은 FID는 유머와 경외심에 관찰되어 이 두 정서에 대해 더 우수한 생성 품질을 보인다.
- 청각 평가 점수(HEEP)를 종합하여 산정한 생성 샘플의 청각 품질(S_Gen) 기준 점수는 모든 정서 평균 0.174이며, 유머 정서에서 최고 0.347를 기록한다.
- ExVo-FewShot의 기준 모델은 256개의 은닉 유닛을 가진 LSTM을 사용하여 평균 CCC = 0.444 ± 0.006를 달성하며, 64 또는 128개 유닛을 사용한 모델보다 우수한 성능을 보이며, 더 높은 은닉 차원이 시간적 동역학을 더 잘 포착함을 시사한다.
- 생성 모델의 학습 안정성은 미국 샘플로 제한함으로써 크게 향상되며, 이는 지역 간 음향 품질과 잡음 프로파일의 다양성이 모델 수렴에 영향을 미친다는 것을 시사한다.
- 성취도가 낮은 FID와 낮은 S_Gen 점수를 보이는 정서(예: 승리, 공포)에 대해선 여전히 향상 여지가 크며, 이는 복합적인 정서 혼합을 모델링하는 데 도전 과제가 있음을 나타낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.