Skip to main content
QUICK REVIEW

[论文解读] Scribosermo: Fast Speech-to-Text models for German and other Languages

Daniel Bermuth, Alexander Poeppel|arXiv (Cornell University)|Oct 15, 2021
Speech Recognition and Synthesis参考文献 19被引用 4
一句话总结

本文提出Scribosermo,一种针对德语、西班牙语和法语的小型高效语音转文字模型家族,在实现德语基准测试最先进性能的同时,可在树莓派等低功耗硬件上实时运行。这些模型利用预训练英语模型进行迁移学习,并结合一种新颖的字母表适配技术,实现仅用少量数据和消费级训练硬件即可获得高精度。

ABSTRACT

Recent Speech-to-Text models often require a large amount of hardware resources and are mostly trained in English. This paper presents Speech-to-Text models for German, as well as for Spanish and French with special features: (a) They are small and run in real-time on microcontrollers like a RaspberryPi. (b) Using a pretrained English model, they can be trained on consumer-grade hardware with a relatively small dataset. (c) The models are competitive with other solutions and outperform them in German. In this respect, the models combine advantages of other approaches, which only include a subset of the presented features. Furthermore, the paper provides a new library for handling datasets, which is focused on easy extension with additional datasets and shows an optimized way for transfer-learning new languages using a pretrained model from another language with a similar alphabet.

研究动机与目标

  • 开发适用于德语及其他语言的小型、快速语音转文字模型,使其能在树莓派等嵌入式系统上高效运行。
  • 实现在消费级硬件上使用相对较小数据集训练这些模型,减少对高端服务器资源的依赖。
  • 提升德语语音识别性能,在Tuda数据集上实现最先进结果。
  • 提供一个简洁、可扩展的框架,用于处理数据集和在具有相似字母表的语言之间进行多语言迁移学习。
  • 展示通过单步适配过程,从英语到其他罗曼语系语言实现有效的零样本或少样本迁移学习。

提出的方法

  • 模型基于轻量级神经网络架构,针对推理速度和低内存占用进行优化,支持在微控制器上实现实时推理。
  • 使用一种新颖的字母表适配技术,对预训练英语语音转文字模型进行微调,通过单次训练步骤重新配置输出层以适配目标语言的字符集。
  • 引入一个新的开源库corcua,以简化多种语音识别框架之间的数据集加载、预处理和转换。
  • 数据预处理包括基于时长、转录长度和语音速率阈值自动清理音频和转录文件,以提高训练稳定性和速度。
  • 解码后应用语言模型重排序(使用5-gram模型)以提升转录质量,尤其在德语中效果显著。
  • 在具有相似字母表的语言之间(如英语→西班牙语、西班牙语→意大利语)应用迁移学习,共享编码器,仅调整输出层。

实验结果

研究问题

  • RQ1小型高效ASR模型是否能在德语、西班牙语和法语基准测试中实现有竞争力的性能,同时在低功耗设备上实现实时运行?
  • RQ2从预训练英语模型进行迁移学习是否能显著降低新语言模型训练所需的数据量和硬件资源?
  • RQ3单步字母表适配技术在新语言的推理速度和性能方面是否优于传统微调方法?
  • RQ4像corcua这样的统一、可扩展的数据集处理流水线是否能简化多样多语言数据集在ASR训练中的集成?
  • RQ5在不依赖大规模数据或高端训练基础设施的前提下,结合多个小型数据集在多大程度上能提升模型性能?

主要发现

  • Scribosermo模型在德语CommonVoice数据集上的词错误率(WER)达到6.6%,优于以往模型,在德语语音识别中创下新的最先进水平。
  • 在德语Tuda数据集上,模型的WER为10.2%,与现有最佳模型(包括IMS-Speech的模型)相比具有竞争力。
  • 模型可在树莓派上实现实时运行,证明其在低功耗边缘设备和嵌入式部署中的适用性。
  • 仅使用2.4千小时的德语数据(来自多个来源)即可实现优异性能,表明其具有极高的数据效率。
  • 迁移学习方法使从英语到西班牙语(WER: 10.0%)和法语(WER: 11.0%)的模型适应成为可能,分别仅需817小时和1028小时数据。
  • corcua库将777小时数据集的转换时间从audiomate的12小时缩短至3小时以内,显著提升了数据流水线效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。