Skip to main content
QUICK REVIEW

[论文解读] MediaSpeech: Multilanguage ASR Benchmark and Dataset

Rostislav Kolobov, Ольга Владимировна Охапкина|arXiv (Cornell University)|Mar 30, 2021
Speech Recognition and Synthesis参考文献 14被引用 13
一句话总结

MediaSpeech 引入了一个涵盖西班牙语、法语、土耳其语和阿拉伯语的10小时开源多语言自动语音识别(ASR)基准数据集,数据源自官方YouTube频道,经人工转录,估计词错误率(WER)低于5%。该研究评估了多种商业及开源ASR系统,并为每种语言发布了微调后的QuartzNet基线模型,实现了在多样化媒体内容上的标准化多语言ASR评估。

ABSTRACT

The performance of automated speech recognition (ASR) systems is well known to differ for varied application domains. At the same time, vendors and research groups typically report ASR quality results either for limited use simplistic domains (audiobooks, TED talks), or proprietary datasets. To fill this gap, we provide an open-source 10-hour ASR system evaluation dataset NTR MediaSpeech for 4 languages: Spanish, French, Turkish and Arabic. The dataset was collected from the official youtube channels of media in the respective languages, and manually transcribed. We estimate that the WER of the dataset is under 5%. We have benchmarked many ASR systems available both commercially and freely, and provide the benchmark results. We also open-source baseline QuartzNet models for each language.

研究动机与目标

  • 为解决现有真实媒体内容中缺乏开放、多样化且具代表性的多语言ASR基准的问题。
  • 为四种主要语言(西班牙语、法语、土耳其语和阿拉伯语)提供标准化的ASR系统评估数据集。
  • 减少对专有或简单化数据集(如有声读物、TED演讲)进行ASR性能评估的依赖。
  • 为每种语言提供在该数据集上微调的开源QuartzNet基线模型,以实现一致的基准测试。
  • 实现对商业与开源ASR系统在真实媒体音频上的公平且可复现的比较。

提出的方法

  • 数据集MediaSpeech从四个语言的媒体机构官方YouTube频道收集:西班牙语、法语、土耳其语和阿拉伯语。
  • 音频片段经人工转录,以确保高转录质量,估计词错误率(WER)低于5%。
  • 在该数据集上评估了多种多样化的ASR系统(包括商业与开源系统),以建立基准性能。
  • 为四种语言中的每一种分别在MediaSpeech数据集上对QuartzNet基线模型进行微调,作为标准化参考模型。
  • 基准评估包括系统间WER的比较,实现对真实媒体语音的直接性能分析。
  • 所有数据、转录结果及训练模型均以开源形式发布,以支持可复现性与进一步研究。

实验结果

研究问题

  • RQ1当在多样化的真实世界多语言语音数据集上评估时,不同ASR系统的性能表现如何变化?
  • RQ2在从官方YouTube频道收集的多语言媒体语音数据集上,可实现的词错误率(WER)是多少?
  • RQ3在非技术性、媒体领域语音上,开源与商业ASR系统在鲁棒性与准确性方面有何差异?
  • RQ4标准模型如QuartzNet在该新型多语言基准上可被多大程度有效微调?
  • RQ5标准化、开源且多样化的多语言ASR基准在多大程度上能提升ASR研究的可复现性与公平性?

主要发现

  • MediaSpeech数据集在所有四种语言上均实现了低于5%的估计词错误率(WER),表明转录质量极高。
  • 对多种商业及开源ASR系统在该数据集上进行了评估,实现了跨语言的全面性能对比。
  • 已成功为四种语言中的每一种训练并发布了微调后的QuartzNet模型,作为可靠的基线。
  • 该基准实现了对真实媒体内容中ASR系统的一致且可复现的评估,减少了对合成或领域受限数据集的依赖。
  • 数据集与模型的开源促进了透明度、可复现性,并推动了多语言ASR领域的未来研究。
  • 该数据集展现出对真实媒体语音的强大代表性,涵盖多样的口音、说话风格及背景噪声。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。