Skip to main content
QUICK REVIEW

[论文解读] A Benchmarking on Cloud based Speech-To-Text Services for French Speech and Background Noise Effect

Binbin Xu, Chongyang Tao|arXiv (Cornell University)|May 7, 2021
Speech Recognition and Synthesis参考文献 10被引用 10
一句话总结

本研究在40,158个音频文件(约101小时)的法语语音上,对四种基于云的语音识别(STT)服务——Google Cloud、Microsoft Azure、Amazon Transcribe和IBM Watson——进行了基准测试,涵盖从40 dB到0 dB SNR的五个噪声水平。Microsoft Azure在中位词错误率(9.09%)方面表现最佳,且在背景噪声下的鲁棒性最强,尤其在低SNR条件下优于其他服务。

ABSTRACT

This study presents a large scale benchmarking on cloud based Speech-To-Text systems: {Google Cloud Speech-To-Text}, {Microsoft Azure Cognitive Services}, {Amazon Transcribe}, {IBM Watson Speech to Text}. For each systems, 40158 clean and noisy speech files about 101 hours are tested. Effect of background noise on STT quality is also evaluated with 5 different Signal-to-noise ratios from 40dB to 0dB. Results showed that {Microsoft Azure} provided lowest transcription error rate $9.09\%$ on clean speech, with high robustness to noisy environment. {Google Cloud} and {Amazon Transcribe} gave similar performance, but the latter is very limited for time-constraint usage. Though {IBM Watson} could work correctly in quiet conditions, it is highly sensible to noisy speech which could strongly limit its application in real life situations.

研究动机与目标

  • 对法语语言的云STT服务进行大规模基准测试,填补多语言STT评估中的空白。
  • 评估背景噪声对STT性能的影响,特别是不同信噪比(SNR)下的表现。
  • 在真实环境下比较四种主要STT API的响应时间、错误率和鲁棒性。
  • 为开发者和组织在具有噪声约束的法语应用中选择STT服务提供可操作的见解。

提出的方法

  • 收集并处理了6,693个干净的法语语音文件(约17小时),通过在五个SNR水平(40 dB至0 dB)下添加18种背景噪声,生成了33,465个含噪版本。
  • 使用了四种基于云的STT API:Google Cloud Speech-to-Text、Microsoft Azure Cognitive Services、Amazon Transcribe和IBM Watson Speech to Text。
  • 对全部40,158个音频文件(总计101小时)执行批量转录,测量词错误率(WER)、作业完成时间及错误类型分布。
  • 采用标准指标:WER的中位数和四分位距、错误类型分析(替换、删除、插入),以及每项作业的响应时间。
  • 通过分析42位不同法语说话者的WER,评估说话人之间的差异性。
  • 将SNR作为关键变量,评估抗噪能力,结果按SNR水平和不同服务聚合。

实验结果

研究问题

  • RQ1在不同噪声水平下,四种主流云STT服务在法语语音上的词错误率(WER)表现如何?
  • RQ2哪种STT服务在低SNR(如0–10 dB)条件下展现出最强的抗噪鲁棒性?
  • RQ3音频时长与四种STT服务的转录作业完成时间之间存在何种关系?
  • RQ4随着噪声水平升高,错误类型(替换、删除、插入)在不同STT提供商之间如何变化?
  • RQ5响应时间与系统约束(如Amazon S3依赖)对实时或时间受限应用的实际影响是什么?

主要发现

  • Microsoft Azure在干净法语语音上的中位WER最低,为9.09%,优于Google Cloud(11.76%)、Amazon Transcribe(14.00%)和IBM Watson(14.29%)。
  • Microsoft Azure在抗噪方面表现出色,即使在0 dB SNR下,中位WER仅上升至16.67%,显著优于IBM Watson,后者在相同条件下WER高达约70%。
  • Google Cloud是速度最快的STT服务,每音频文件的中位作业完成时间为1.76秒,其次为Microsoft Azure(3.51秒)、IBM Watson(5.43秒),而Amazon Transcribe最慢,平均为27.00秒。
  • Amazon Transcribe的每项作业延迟最长(平均27秒),且需要将音频上传至Amazon S3,增加了复杂性和延迟,尤其在大规模批量处理中更为明显。
  • 在干净和中等噪声语音中,替换错误是主要错误类型;当SNR < 10 dB时,删除率显著上升,尤其对IBM Watson和Amazon Transcribe影响更大。
  • 餐厅环境噪声对所有STT服务最具挑战性,显著提高了所有提供商的WER,尤其对IBM Watson和Amazon Transcribe影响最大。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。