QUICK REVIEW
[论文解读] AISHELL-1: An Open-Source Mandarin Speech Corpus and A Speech Recognition Baseline
Hui Bu, Jiayu Du|arXiv (Cornell University)|Sep 16, 2017
Speech Recognition and Synthesis参考文献 6被引用 50
一句话总结
AISHELL-1 是最大的开源普通话 ASR 语料库(400 名说话人,170+ 小时),提供 Kaldi 基线和即插即用设置,以及详细的录音、转写和词表流水线。
ABSTRACT
An open-source Mandarin speech corpus called AISHELL-1 is released. It is by far the largest corpus which is suitable for conducting the speech recognition research and building speech recognition systems for Mandarin. The recording procedure, including audio capturing devices and environments are presented in details. The preparation of the related resources, including transcriptions and lexicon are described. The corpus is released with a Kaldi recipe. Experimental results implies that the quality of audio recordings and transcriptions are promising.
研究动机与目标
- 提供一个开放、适用于 ASR 研究和产品级开发的大规模普通话语料库。
- 详细记录录音过程、元数据、转写和词表准备,以确保数据质量和可重复性。
- 提供一个可直接使用的 Kaldi 参考方案,以建立可靠的普通话 ASR 基线。
- 通过在多种声学模型和通道上的基线实验展示语料库质量。
提出的方法
- 作为更大范围的 AISHELL-ASR0009 语料子集发布的 AISHELL-1,包含 400 名说话人和 170+ 小时。
- 多设备录音设置,包括高保真麦克风、Android 和 iPhone 通道;数据重采样为 16 kHz,16-bit WAV。
- 人工转写、文本规范化,以及具有初-末音节的中文词表。
- 基于 Kaldi 的 ASR 基线,从 GMM-HMM 到 TDNN-HMM 和 LFMMI,结合 MFCC 和音高特征,以及 i-vector 适配。
- 使用音频增强和基于 i-vector 的适配来提高 DNN 的鲁棒性。
- 从 1.3 百万词构建的语言模型,带三元平滑和 OOV 处理。

实验结果
研究问题
- RQ1AISHELL-1 能否在多设备环境中支持稳健的普通话 ASR 研究和实际系统开发?
- RQ2模型架构(GMM-HMM、TDNN-HMM、LFMMI)如何影响 AISHELL-1 上的普通话 ASR 性能?
- RQ3设备不匹配对使用 AISHELL-1 的 ASR 性能有何影响?
- RQ4AISHELL-1 基线是否能泛化到无关领域(如 THCHS30)和不同语言模型领域?
主要发现
- AISHELL-1 由 120,098 条训练 utterances 来自 340 名说话人,14,326 条来自 40 的开发集,7,176 条来自 20 的测试集(每个说话人约 26 分钟)。
- 基线结果显示 LFMMI 优于 TDNN-HMM 和 MLLT+SAT,LFMMI 的 CER 分别为 dev 6.44%、test 7.62%。
- TDNN-HMM 的 devCER 7.23%、testCER 8.42%,而 MLLT+SAT 的 devCER 10.43%、testCER 12.23%。
- 设备不匹配测试(iOS 与 Android)显示 LFMMI 在 Android 的 dev 10.90%、test 10.09% 而 MLLT+SAT 为 dev 12.64%、test 11.88%,TDNN-HMM 最高 12.42%/10.81%。
- AISHELL-1 模型应用于 THCHS30 时所有模型的 CER 较高,例如 LFMMI 在 THCHS30 的 CER 为 25.00%,表明域自适应有益。
- 结果表明该语料库在音系上丰富,适合用 Kaldi 配方建立普通话 ASR 基线。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。