[논문 리뷰] The Singing Voice Conversion Challenge 2023
이 논문은 NHSS 데이터셋의 정제된 서브셋을 사용하여 도메인 내 및 도메인 간 작업에서 노래하는 음성 변환(SVC) 시스템에 대한 대규모 평가를 수행하는 2023년 노래하는 음성 변환 챌린지(SVCC)를 제시한다. 인간 수준의 자연스러움을 달성했음에도 불구하고, 어느 시스템도 목표 화자와의 유사도를 충족시키지 못했으며, 객관적 평가 지표와 주관적 평가 점수 사이에 약한 상관관계가 나타나, SVC 성능 평가의 과제를 드러냈다.
We present the latest iteration of the voice conversion challenge (VCC) series, a bi-annual scientific event aiming to compare and understand different voice conversion (VC) systems based on a common dataset. This year we shifted our focus to singing voice conversion (SVC), thus named the challenge the Singing Voice Conversion Challenge (SVCC). A new database was constructed for two tasks, namely in-domain and cross-domain SVC. The challenge was run for two months, and in total we received 26 submissions, including 2 baselines. Through a large-scale crowd-sourced listening test, we observed that for both tasks, although human-level naturalness was achieved by the top system, no team was able to obtain a similarity score as high as the target speakers. Also, as expected, cross-domain SVC is harder than in-domain SVC, especially in the similarity aspect. We also investigated whether existing objective measurements were able to predict perceptual performance, and found that only few of them could reach a significant correlation.
연구 동기 및 목표
- 표준화된 데이터셋과 공통 평가 프로토콜을 사용하여 최신 기술의 노래하는 음성 변환(SVC) 시스템을 평가하고 비교하기 위해.
- SVC에서 청각적 성능(자연스러움과 유사도)과 객관적 평가 지표 사이의 격차를 조사하기 위해.
- 대규모 주관적 청취 테스트를 통해 도메인 간 SVC가 도메인 내 SVC보다 얼마나 어려운지 평가하기 위해.
- SVC에서 인간의 청각을 신뢰할 수 있게 예측할 수 있는 객관적 지표는 무엇인지 특정하기 위해, 특히 화자 유사도와 자연스러움에 초점하여.
- 해결되지 않은 과제를 규명하고 향후 SVC 시스템의 객관적 평가 분야의 연구 방향을 제시하기 위해.
제안 방법
- NHSS 데이터셋을 바탕으로 새로운 데이터베이스를 구축하여, '어느 것에서든 한 명의 화자로의 도메인 내 SVC'와 '어느 것에서든 한 명의 화자로의 도메인 간 SVC' 두 가지 작업을 지원하였다.
- 참가자들은 제공된 데이터셋을 기반으로 SVC 시스템을 훈련하고, 평가를 위한 변환된 노래 샘플을 제출하였다.
- 자연스러움과 화자 유사도를 평가하기 위해 영어 및 일본어 모국어 청취자들을 대상으로 대규모 커뮤니티 기반 청취 테스트를 실시하였다.
- 객관적 지표로는 멜 체프스트랄 왜곡(MCD), F0 RMSE 및 상관관계, 두 개의 음성 인식 모델(ASR)에서 유도된 문자 오류율(CER), 가수 임베딩 코사인 유사도, 신경망 기반 MOS 예측기(UTMOS 및 SSL-MOS)를 포함하였다.
- 객관적 지표와 주관적 점수 사이의 상관관계를 평가하기 위해 스피어만 상관계수를 계산하였다.
- 공통 데이터셋과 표준화된 청취 절차를 사용함으로써 평가 프레임워크의 일관성과 재현 가능성을 확보하였다.
실험 결과
연구 질문
- RQ1최고의 SVC 시스템은 도메인 내 및 도메인 간 설정 모두에서 인간 수준의 자연스러움을 얼마나 달성하는가?
- RQ2기존의 객관적 지표들이 왜 SVC에서 주관적 유사도 점수와 강한 상관관계를 가지지 못하는가?
- RQ3자연스러움과 화자 유사도 측면에서 도메인 간 SVC는 도메인 내 SVC보다 어떻게 다른가?
- RQ4MCD, F0 지표, 또는 ASR 기반 CER와 같은 현재의 객관적 지표들이 SVC에서 청각적 품질을 안정적으로 예측할 수 있는가?
- RQ5UTMOS와 같은 신경망 기반 MOS 예측기(Utmos)는 음성 변환에서 자연스러움을 얼마나 잘 예측하는가?
주요 결과
- 최고의 SVC 시스템은 도메인 내 및 도메인 간 작업 모두에서 인간 수준의 자연스러움을 달성하여 음성 품질 향상의 상당한 진전을 보였다.
- 어느 시스템도 목표 화자 수준의 화자 유사도 점수를 달성하지 못했으며, 이는 신원 유지 측면에서 지속적인 격차가 있음을 시사한다.
- 도메인 간 SVC는 도메인 내 SVC보다 유의미하게 더 어려웠으며, 평균 자연스러움 및 유사도 점수가 낮았다.
- 주관적 유사도 점수와 통계적으로 유의미한 상관관계를 보인 객관적 지표는 소수에 불과하였으며, 특히 ASR 모델에서 유도된 CER 및 가수 임베딩 코사인 유사도였다.
- 유사도 예측에 가장 우수한 객관적 지표로 나타난 가수 임베딩 코사인 거리조차도, 특히 도메인 간 설정에서 모국어 청취자 평가와는 약한 상관관계를 보였다.
- UTMOS와 같은 신경망 기반 MOS 예측기(Utmos)는 자연스러움과 중간 정도의 상관관계를 보였으며, 음성에서 노래로의 일반화 가능성은 있으나 여전히 예측 능력이 제한되어 있어 과제로 남아 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.