Skip to main content
QUICK REVIEW

[论文解读] Open Source Automatic Speech Recognition for German

Benjamin Milde, Arne Köhn|arXiv (Cornell University)|Jul 26, 2018
Speech Recognition and Synthesis被引用 12
一句话总结

本论文提出了一款免费可用的开源自动语音识别(ASR)模型,用于德语,该模型基于 Tuda-De 和 Spoken Wikipedia Corpus 数据集中的 412 小时朗读语音数据,使用 Kaldi 工具包进行训练。通过引入 Spoken Wikipedia 数据,作者实现了相对于先前最佳开源模型 26% 的相对词错误率(WER)降低,在 Tuda-De 测试集上达到最终 WER 为 14.38%,且对说话人差异和麦克风类型具有较强的鲁棒性。

ABSTRACT

High quality Automatic Speech Recognition (ASR) is a prerequisite for speech-based applications and research. While state-of-the-art ASR software is freely available, the language dependent acoustic models are lacking for languages other than English, due to the limited amount of freely available training data. We train acoustic models for German with Kaldi on two datasets, which are both distributed under a Creative Commons license. The resulting model is freely redistributable, lowering the cost of entry for German ASR. The models are trained on a total of 412 hours of German read speech data and we achieve a relative word error reduction of 26% by adding data from the Spoken Wikipedia Corpus to the previously best freely available German acoustic model recipe and dataset. Our best model achieves a word error rate of 14.38 on the Tuda-De test set. Due to the large amount of speakers and the diversity of topics included in the training data, our model is robust against speaker variation and topic shift.

研究动机与目标

  • 使用免费获取的训练数据,开发高质量、开源的德语 ASR 语音模型。
  • 通过提供完全可分发的模型和训练流程,降低德语 ASR 的入门门槛。
  • 通过数据扩展和模型优化,超越此前最佳的开源德语 ASR 模型。
  • 通过避免依赖云服务语音 API,实现保护隐私、可本地部署的 ASR 系统。
  • 证明利用志愿者贡献、自动对齐的语音数据(Spoken Wikipedia)训练鲁棒 ASR 模型的可行性。

提出的方法

  • 使用 Kaldi ASR 工具包,在两个开源数据集(Tuda-De 和 Spoken Wikipedia Corpus,SWC)上训练语音模型。
  • 应用基于 Sphinx 的对齐自动语音识别流程,并通过迭代式模型重训练处理长时长、部分对齐的音频记录。
  • 采用基于语音活动检测(VAD)的片段提取方法,分离出有效且连续的语音段用于训练。
  • 使用 GMM-HMM 和 TDNN-HMM 架构,结合标准 Kaldi 流程,包括语言模型重排序。
  • 对 SWC 数据采用保守且最小化的剪枝策略,以在数据质量和数量之间取得平衡。
  • 自动生成子词或 OOV 词素词典条目,以处理开放词汇设置下的未登录词。

实验结果

研究问题

  • RQ1能否仅使用免费获取、公共许可的语音数据,训练出高性能的开源德语 ASR 模型?
  • RQ2Spoken Wikipedia Corpus 的引入在多大程度上提升了现有开源德语 ASR 模型的性能?
  • RQ3仅在朗读语音上训练的模型,在泛化到自发性、对话式语音(如 Verbmobil 语料库所示)方面的能力如何?
  • RQ4在真实录音条件下,模型性能在不同麦克风和说话人类别之间如何变化,尤其是面对实际录音环境?
  • RQ5考虑到 Spoken Wikipedia 项目持续增长,该模型能否在未来通过新增数据有效扩展?

主要发现

  • 在引入 Spoken Wikipedia 数据后,该模型在 Tuda-De 测试集上的词错误率(WER)达到 14.38%,相比之前最佳开源模型实现了 26% 的相对 WER 降低。
  • 引入 285 小时的 Spoken Wikipedia 数据显著提升了性能,最终模型对说话人差异和麦克风多样性表现出较强的鲁棒性。
  • 在 Verbmobil(VM1)测试集上,该模型在使用领域特定词汇表时达到 WER 20.04%,表明尽管仅在朗读语音上训练,其在对话式语音上的表现仍属合理。
  • 该模型在多种录音条件下表现良好,仅在 Realtek 麦克风数据上出现轻微性能下降,该数据因硬件引起的失真而未被纳入正式评估。
  • 训练流程和预训练模型已公开发布于 GitHub,支持未来研究和应用的可复现性与可扩展性。
  • 该模型性能对词汇表大小高度敏感,大词汇量模型表现出显著更高的错误率,表明在德语 ASR 中需要采用子词或分词分解方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。