[논문 리뷰] Hi-Fi Multi-Speaker English TTS Dataset
이 논문은 고음질, 다중 발화자 영어 TTS 데이터셋인 Hi-Fi Multi-Speaker English TTS를 소개한다. 이 데이터셋은 10명의 모국어 영어 사용자(여성 6명, 남성 4명)로부터 292시간의 음성 데이터를 포함하며, 각 발화자는 최소 17시간 이상의 44.1 kHz 음성 데이터를 기여하였다. 데이터셋은 신호 대역폭 ≥13 kHz, 신호 대 잡음비(SNR) ≥32 dB, 그리고 ASR 검증을 통한 0% 단어 오류율(WER)을 통해 철저한 필터링을 거쳐 고품질을 확보하였으며, 이는 표현력 있는 고음질 TTS 모델을 훈련시키기에 적합하다. 이로 인해 일반화 능력이 향상되고 잡음이 감소한다.
This paper introduces a new multi-speaker English dataset for training text-to-speech models. The dataset is based on LibriVox audiobooks and Project Gutenberg texts, both in the public domain. The new dataset contains about 292 hours of speech from 10 speakers with at least 17 hours per speaker sampled at 44.1 kHz. To select speech samples with high quality, we considered audio recordings with a signal bandwidth of at least 13 kHz and a signal-to-noise ratio (SNR) of at least 32 dB. The dataset is publicly released at http://www.openslr.org/109/ .
연구 동기 및 목표
- 충분한 음질과 발화자 다양성을 갖춘 고품질의 다중 발화자 영어 TTS 데이터셋이 부족한 문제를 해결하기 위해.
- 더 나은 일반화 능력, 더 적은 잡음, 더 넓은 음성 변형을 제공하는 TTS 모델 훈련을 가능하게 하기 위해.
- 검증된 텍스트-음성 정렬과 고수준의 신호 품질을 확보한 공개 가능한 윤리적 출처의 데이터셋을 제공하기 위해.
- 저샘플링 레이트와 철저한 음성 품질 검증이 부족한 기존 데이터셋(LJSpeech 및 M-AILABS)의 한계를 극복하기 위해.
- 비전문가인 LibriVox 독자들로부터 전문가 수준의 음성 품질을 확보한 데이터셋을 제공함으로써 표현력 있는 고음질 TTS 연구를 지원하기 위해.
제안 방법
- 데이터셋은 모두 공공 영역에 속하는 LibriVox 오디오북과 Project Gutenberg 텍스트에서 수집되었다.
- 발화자 선정 기준은 최소 50시간 이상의 음성 자료와 신호 대역폭 ≥13 kHz, SNR ≥32 dB의 고품질 녹음 자료였다.
- 음성 파일은 16 kHz로 다운샘플링되었으며, WER 계산을 위해 QuartzNet 및 Citrinet ASR 모델을 사용하여 텍스트-음성 정렬 검증을 수행하였다.
- 텍스트-음성 정렬은 CTC-Segmentation을 활용하였으며, 정확도가 낮은 정렬을 걸러내기 위해 로그 공간에서 -2의 신뢰도 임계값을 설정하였다.
- 두 ASR 모델 모두에서 WER가 0%인 음성만 유지되어 고정밀도의 텍스트-음성 일치를 보장하였다.
- 최종 데이터셋은 'clean'(SNR ≥40 dB)과 'other'(SNR ≥32 dB)라는 두 개의 하위집합으로 구성되었으며, 10명의 발화자와 각각 최소 17시간 이상의 음성 자료를 포함하고 있다.

실험 결과
연구 질문
- RQ1공공 영역 오디오북에서 유래한 다중 발화자 TTS 데이터셋이 상업적 라이센스 제약 없이 전문가 수준의 음성 품질을 달성할 수 있는가?
- RQ2다중 ASR 모델을 통한 0% WER 필터링이 비전문가 녹음 자료에서 정확한 텍스트-음성 정렬을 확보하는 데 얼마나 효과적인가?
- RQ3고 SNR와 넓은 대역폭 신호가 TTS 모델의 일반화 능력 향상과 합성 잡음 감소에 얼마나 기여하는가?
- RQ4음성 품질과 텍스트 정렬이 철저히 검증된 경우, 비전문가 녹음 자료에서 고음질 TTS 모델을 효과적으로 훈련시킬 수 있는가?
- RQ5비전문가 독자들로부터 유래한 다양한 고품질 음성의 포함이 TTS 시스템의 표현력과 내구성에 어떤 영향을 미치는가?
주요 결과
- Hi-Fi TTS 데이터셋은 10명의 모국어 영어 사용자로부터 총 292시간의 음성 데이터를 포함하며, 각 발화자는 최소 17.7시간 이상의 음성 자료를 기여하였다.
- 모든 음성 샘플은 44.1 kHz로 샘플링되었으며, 최소 SNR 32 dB 및 최소 13 kHz의 신호 대역폭을 기준으로 선별되었다.
- 데이터셋은 'clean'(SNR ≥40 dB)과 'other'(SNR ≥32 dB)라는 두 개의 하위집합으로 구성되어 있으며, 일부 발화자는 책 간 음질의 변동성으로 인해 둘 다에 포함되었다.
- 텍스트-음성 정렬은 두 개의 ASR 모델(QuartzNet 및 Citrinet)을 사용하여 검증되었으며, 오직 WER가 0%인 샘플만 포함되어 고정밀도 정렬을 보장하였다.
- 데이터셋은 http://www.openslr.org/109/ 에서 CC BY 4.0 라이선스로 공개되었으며, 모든 발화자로부터 음성 복제에 대한 윤리적 동의를 확보하였다.
- 데이터셋은 LJSpeech나 M-AILABS와 겹치지 않으며, LibriTTS와 일부 발화자를 공유할 가능성이 있으나, 훨씬 뛰어난 음성 품질과 일관성을 제공한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.