Skip to main content
QUICK REVIEW

[논문 리뷰] CN-Celeb: multi-genre speaker recognition

Lantian Li, Ruiqi Liu|arXiv (Cornell University)|2020. 12. 23.
Speech Recognition and Synthesis참고 문헌 68인용 수 9
한 줄 요약

이 논문은 11개 장르에 걸쳐 3,000명의 화자 포함한 대규모 다장르 화자 인식 코퍼스인 CN-Celeb를 소개하고, 화자 인식에서 장르 불일치가 미치는 영향에 대한 종합적인 연구를 수행한다. CN-Celeb2(520,000개의 발화, 2,000명의 화자)와 CN-Celeb1을 사용하여, 다장르 학습이 성능을 크게 향상시킴을 입증한다—x-vector 시스템을 사용해 EER을 단일 장르 학습(SG 학습)의 16.59%에서 다장르 학습(MG 학습)의 13.44%로 감소시킴으로써, 이는 이면 간 변동성에 대한 내성을 높이는 데 있어 장르 간 데이터의 핵심적 역할을 시사한다.

ABSTRACT

Research on speaker recognition is extending to address the vulnerability in the wild conditions, among which genre mismatch is perhaps the most challenging, for instance, enrollment with reading speech while testing with conversational or singing audio. This mismatch leads to complex and composite inter-session variations, both intrinsic (i.e., speaking style, physiological status) and extrinsic (i.e., recording device, background noise). Unfortunately, the few existing multi-genre corpora are not only limited in size but are also recorded under controlled conditions, which cannot support conclusive research on the multi-genre problem. In this work, we firstly publish CN-Celeb, a large-scale multi-genre corpus that includes in-the-wild speech utterances of 3,000 speakers in 11 different genres. Secondly, using this dataset, we conduct a comprehensive study on the multi-genre phenomenon, in particular the impact of the multi-genre challenge on speaker recognition and the performance gain when the new dataset is used to conduct multi-genre training.

연구 동기 및 목표

  • 등록 및 테스트 조건이 상당히 다를 수 있는(예: 독서 vs. 노래하기) 장르 불일치 문제를 해결하기 위해.
  • 기존 코퍼스가 작고 통제된 환경에서 촬영된 데 기인한 한계를 극복하기 위해, 대규모 실외 다장르 데이터셋인 CN-Celeb2를 도입하기 위해.
  • 최신 시스템이 다장르 조건에서 성능 저하되는 정도를 조사하고, 다장르 학습의 효과성을 평가하기 위해.
  • 부분적 또는 전체적인 다장르 데이터 수집이 화자 인식 시스템의 성능 향상에 의미 있는 기여를 하는지 확인하기 위해.

제안 방법

  • 저자들은 11개 장르(실외 및 통제된 기록 포함)에서 2,000명의 중국 유명인으로부터 520,000개의 발화를 포함한 대규모 다장르 코퍼스인 CN-Celeb2를 수집 및 공개하였다.
  • 이전에 발표된 CN-Celeb1(1,000명의 화자, 270시간)과 CN-Celeb2를 결합하여 종합적인 학습 및 평가를 위한 전체 CN-Celeb 데이터셋을 구성하였다.
  • i-vector 및 x-vector 프론트엔드 모델과 PLDA 백엔드 스코링을 사용하여 화자 인식 성능을 평가하였으며, 단일 장르(SG) 및 다장르(MG) 학습 방식을 비교하였다.
  • 장르 다양성의 영향을 분리하기 위해, 전체 MG 학습(장르 간 화자 포함), 부분 MG 학습(장르 간 화자 제외), 및 SG 학습을 비교하는 분석 실험을 수행하였다.
  • 주요 평가 지표로 코사인 스코링과 등오류율(EER)을 사용하여, 다양한 학습 및 테스트 조건에서 시스템의 내성 여부를 평가하였다.
  • 특히 i-vector와 같은 생성 모델의 경우, 학습 및 테스트 세트 간의 데이터 불균형과 일관성의 영향을 분석하였다.

실험 결과

연구 질문

  • RQ1실제 환경에서 실외 조건에서 최신 화자 인식 시스템의 성능에 장르 불일치가 미치는 영향은 어떠한가?
  • RQ2다장르 학습은 화자 인식에서 이면 간 변동성에 대한 내성 향상에 얼마나 기여하는가?
  • RQ3장르 간 화자를 포함하지 않은 부분적 다장르 데이터(전체 다장르 데이터가 아님)는 단일 장르 학습보다 성능 향상에 기여하는가?
  • RQ4프론트엔드(i-vector/x-vector) 및 백엔드(PLDA) 모델은 다장르 학습에서 어떤 방식으로 이점을 얻는가? 그리고 어느 구성 요소에서 가장 큰 향상이 이루어지는가?
  • RQ5시스템 일반화 능력에 있어 데이터 크기, 장르 다양성, 학습 일관성의 상대적 영향은 무엇인가?

주요 결과

  • 다장르 학습은 화자 인식 성능을 상당히 향상시키며, PLDA 스코링을 사용한 x-vector 시스템의 경우 EER을 단일 장르 학습(SG 학습)의 16.59%에서 다장르 학습(MG 학습)의 13.44%로 감소시켰다.
  • i-vector 시스템은 MG 학습을 사용할 경우 SG 학습 대비 EER이 1.58% 향상되어 20.88%에서 19.29%로 개선되었으며, 이는 데이터 일관성의 이점임을 시사한다.
  • 장르 간 화자를 포함하지 않은 부분적 다장르 학습도 단일 장르 학습보다 우수한 성능을 보였으며, x-vector 시스템의 EER은 16.59%에서 14.76%로 감소하였다. 이는 전체 장르 간 커버리지 없이도 다장르 데이터가 유의미한 가치를 지닌다는 것을 시사한다.
  • 프론트엔드 및 백엔드 모델을 모두 다장르 데이터로 학습한 전체 MG 학습이 가장 뛰어난 성능을 보였으며, x-vector 시스템의 EER은 13.44%, i-vector 시스템의 EER은 14.81%였다.
  • SG 학습 대비 MG 학습의 성능 격차는 x-vector 시스템에서 더 두드러졌으며, EER은 20.35%에서 20.13%로 감소하였다. 이는 균형 잡힌 학습 데이터에서 딥 러닝 모델이 다장르 데이터로부터 더 큰 이점을 얻는다는 것을 시사한다.
  • 이 연구는 다장르 과제가 실제 환경 화자 인식에서 주요 성능 저하 요인임을 확인하였으며, SITW에서 CN-Celeb로 전환할 경우 EER이 3.75%에서 15.52%로 300% 증가함에 따라 성능 저하가 심각하다는 점을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.