[论文解读] GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio
该论文介绍了 GigaSpeech,一个大规模、持续演进的多领域英语自动语音识别(ASR)语料库,包含从有声读物、播客和 YouTube 获取的 10,000 小时高质量转录音频,涵盖阅读和即兴口语,主题多样。该研究提出了一种新颖的强制对齐与分割流程,用于过滤低质量转录,从而实现从 10 小时到 10,000 小时的训练子集,词错误率(WER)上限为 0%(XL 子集除外,上限为 4%),并为 Kaldi、ESPnet、Athena 和 Pika 等主流工具包提供了基线系统,其在测试集上的 WER 低至 10.80%。
This paper introduces GigaSpeech, an evolving, multi-domain English speech recognition corpus with 10,000 hours of high quality labeled audio suitable for supervised training, and 40,000 hours of total audio suitable for semi-supervised and unsupervised training. Around 40,000 hours of transcribed audio is first collected from audiobooks, podcasts and YouTube, covering both read and spontaneous speaking styles, and a variety of topics, such as arts, science, sports, etc. A new forced alignment and segmentation pipeline is proposed to create sentence segments suitable for speech recognition training, and to filter out segments with low-quality transcription. For system training, GigaSpeech provides five subsets of different sizes, 10h, 250h, 1000h, 2500h, and 10000h. For our 10,000-hour XL training subset, we cap the word error rate at 4% during the filtering/validation stage, and for all our other smaller training subsets, we cap it at 0%. The DEV and TEST evaluation sets, on the other hand, are re-processed by professional human transcribers to ensure high transcription quality. Baseline systems are provided for popular speech recognition toolkits, namely Athena, ESPnet, Kaldi and Pika.
研究动机与目标
- 为解决因使用过时且规模有限的语料库而导致的 ASR 性能停滞问题,创建一个大规模、持续演进、多领域的语音识别数据集。
- 开发一种可扩展、可靠的流程,用于从多样化音频源生成高质量、分段的语音识别语料库。
- 提供不同规模的训练与评估子集(10 小时至 10,000 小时),并实施严格的转录质量控制,以支持稳健的模型训练与基准测试。
- 通过提供原始与标准化转录对,支持端到端 ASR 训练,便于后处理。
- 在主流 ASR 工具包(Kaldi、ESPnet、Athena、Pika)中提供可复现的基线系统,以实现公平比较与系统开发。
提出的方法
- 从有声读物、播客和 YouTube 收集约 40,000 小时的原始音频,覆盖多样主题与说话风格。
- 应用一种新颖的强制对齐与分割流程,生成逐句音频段落并附带对齐转录。
- 使用词错误率(WER)阈值过滤低质量段落:所有子集的 WER 上限为 0%(XL 子集除外,上限为 4%)。
- 创建五个训练子集(XS 至 XL),按音频来源与风格进行比例分配。
- 通过专业人工转录员重新处理 DEV 和 TEST 集,以确保高转录准确率。
- 在 Kaldi、ESPnet、Athena 和 Pika 中提供基线模型,采用标准架构(如 conformer、RNN-T、chain 模型)并遵循统一的训练与解码协议。

实验结果
研究问题
- RQ1能否从多样化网络来源系统性地构建一个大规模、多领域、多说话风格、具备高质量转录的 ASR 语料库?
- RQ2所提出的强制对齐与分割流程在过滤低质量转录的同时,对保留高质量段落的效率如何?
- RQ3在像 GigaSpeech 这样标准化且高质量的大规模语料库中,随着训练数据规模增加,模型性能提升的幅度有多大?
- RQ4在相同标准化评估集上,主流 ASR 工具包中的基线系统表现如何,其相对 WER 值是多少?
- RQ5所提出的语料库与流程能否支持可复现的基准测试,并推动端到端 ASR 研究的进展?
主要发现
- 使用 ESPnet conformer/transformer-AED 模型,GigaSpeech XL 训练子集在测试集上的词错误率为 10.80%,表明在大规模高质量语料库上表现强劲。
- Kaldi chain 模型基线在 XL 子集上的 WER 为 14.84%,表明即使标准架构也能从语料库的规模与质量中获益。
- 性能随训练子集规模增大而持续提升:Kaldi 基线 WER 从 XS 子集(10 小时)的 22.59% 降至 XL 子集(10,000 小时)的 14.84%,证实了数据规模的优势。
- Pika RNN-T 模型在 DEV 和 TEST 集上的 WER 均为 12.30%,表明其在 XL 子集上具备出色的泛化能力。
- Athena Transformer-AED 模型在 TEST 集上的 WER 为 12.70%,表明其在不同工具包间表现具有竞争力。
- 评估集经专业转录员重新处理,确保了高转录质量,从而支持可靠的基准测试。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。