Skip to main content
QUICK REVIEW

[论文解读] Hi-Fi Multi-Speaker English TTS Dataset

Evelina Bakhturina, Vitaly Lavrukhin|arXiv (Cornell University)|Apr 3, 2021
Speech Recognition and Synthesis参考文献 29被引用 7
一句话总结

本文介绍了Hi-Fi多说话人英语TTS数据集,这是一个高保真、多说话人的语料库,包含来自10位母语英语说话人(6位女性,4位男性)的292小时音频,每位说话人至少有17小时的44.1 kHz音频。通过严格筛选信号带宽≥13 kHz、信噪比(SNR)≥32 dB,并通过自动语音识别(ASR)验证实现零词错误率(WER),确保了数据集的高质量,使其非常适合用于训练具有更好泛化能力、更少伪影的表达性强、高保真度的TTS模型。

ABSTRACT

This paper introduces a new multi-speaker English dataset for training text-to-speech models. The dataset is based on LibriVox audiobooks and Project Gutenberg texts, both in the public domain. The new dataset contains about 292 hours of speech from 10 speakers with at least 17 hours per speaker sampled at 44.1 kHz. To select speech samples with high quality, we considered audio recordings with a signal bandwidth of at least 13 kHz and a signal-to-noise ratio (SNR) of at least 32 dB. The dataset is publicly released at http://www.openslr.org/109/ .

研究动机与目标

  • 为解决高质量、多说话人英语TTS数据集在音频质量与说话人多样性方面不足的问题。
  • 支持训练泛化能力更强、噪声更少、语音变化更丰富的TTS模型。
  • 提供一个公开可用、伦理合规的数据集,具备经验证的文本-音频对齐与高信号保真度。
  • 克服现有数据集(如LJSpeech和M-AILABS)的局限性,后者使用低采样率且缺乏严格的音频质量验证。
  • 通过提供来自非专业LibriVox朗读者的、专业级音频质量的数据,支持富有表现力的高保真TTS研究。

提出的方法

  • 数据集构建自LibriVox有声读物和Project Gutenberg文本,二者均属公共领域。
  • 说话人基于至少50小时音频、高质量录音(信号带宽≥13 kHz,信噪比≥32 dB)进行筛选。
  • 音频文件下采样至16 kHz,并使用QuartzNet和Citrinet ASR模型处理,以计算词错误率(WER)用于文本-音频对齐验证。
  • 使用CTC-Segmentation方法进行文本-音频对齐,置信度阈值设为log空间中的-2,以过滤低质量对齐。
  • 仅保留两个ASR模型均显示零WER的语音片段,确保文本-音频匹配的高精度。
  • 最终数据集包含两个子集:'clean'(信噪比≥40 dB)和'other'(信噪比≥32 dB),共10位说话人,每位说话人至少17小时音频。
Figure 1: Spectrograms of LibriVox recordings: (a) good audio quality (wideband signal, low noise); (b) not acceptable audio quality (narrowband signal); (c) not acceptable audio quality (low SNR); (d) not acceptable audio quality (both narrowband and noisy).
Figure 1: Spectrograms of LibriVox recordings: (a) good audio quality (wideband signal, low noise); (b) not acceptable audio quality (narrowband signal); (c) not acceptable audio quality (low SNR); (d) not acceptable audio quality (both narrowband and noisy).

实验结果

研究问题

  • RQ1能否从公共领域有声读物中构建一个多说话人TTS数据集,实现在无商业许可限制下达到专业级音频质量?
  • RQ2通过多个ASR模型实现零WER过滤,在非专业录音中确保准确文本-音频对齐的有效性如何?
  • RQ3高信噪比与宽带信号内容在多大程度上能提升TTS模型的泛化能力并减少合成伪影?
  • RQ4如果对音频质量与文本对齐进行严格验证,能否在非专业录音上有效训练高保真TTS模型?
  • RQ5非专业朗读者提供的多样化、高质量语音在多大程度上提升了TTS系统的表达力与鲁棒性?

主要发现

  • Hi-Fi TTS数据集包含来自10位母语英语说话人的292小时语音,每位说话人贡献至少17.7小时音频。
  • 所有音频样本均以44.1 kHz采样,并基于最低32 dB信噪比和至少13 kHz信号带宽进行筛选。
  • 数据集包含两个子集:'clean'(信噪比≥40 dB)和'other'(信噪比≥32 dB),部分说话人因不同书籍间音频质量差异而同时出现在两个子集中。
  • 使用两种ASR模型(QuartzNet和Citrinet)验证了文本-音频对齐,仅包含WER为零的样本,确保了高保真度对齐。
  • 该数据集以CC BY 4.0许可公开发布,网址为http://www.openslr.org/109/,所有说话人均已提供伦理同意用于语音复刻。
  • 该数据集与LJSpeech或M-AILABS无重叠,可能与LibriTTS共享部分说话人,但音频质量与一致性更优。
Figure 2: Energy-based VAD applied to a LibriVox recording.
Figure 2: Energy-based VAD applied to a LibriVox recording.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。