Skip to main content
QUICK REVIEW

[论文解读] Earnings-22: A Practical Benchmark for Accents in the Wild

Miguel del Río, Peter Ha|arXiv (Cornell University)|Mar 29, 2022
Natural Language Processing Techniques被引用 4
一句话总结

Earnings-22 引入了一个119小时、免费使用的全球英语收益电话会议基准,涵盖7种区域口音,用于评估自动语音识别(ASR)模型在真实世界口音语音上的表现。研究揭示了不同口音之间在词错误率(WER)上存在统计上显著的差异,尤其是在亚洲、其他罗曼语系以及西班牙语/葡萄牙语地区,凸显了尽管整体WER有所改善,商业ASR系统中仍存在持续的偏见。

ABSTRACT

Modern automatic speech recognition (ASR) systems have achieved superhuman Word Error Rate (WER) on many common corpora despite lacking adequate performance on speech in the wild. Beyond that, there is a lack of real-world, accented corpora to properly benchmark academic and commercial models. To ensure this type of speech is represented in ASR benchmarking, we present Earnings-22, a 125 file, 119 hour corpus of English-language earnings calls gathered from global companies. We run a comparison across 4 commercial models showing the variation in performance when taking country of origin into consideration. Looking at hypothesis transcriptions, we explore errors common to all ASR systems tested. By examining Individual Word Error Rate (IWER), we find that key speech features impact model performance more for certain accents than others. Earnings-22 provides a free-to-use benchmark of real-world, accented audio to bridge academic and industrial research.

研究动机与目标

  • 为解决ASR系统基准测试中缺乏真实世界口音语音语料的问题。
  • 评估商业ASR模型在来自全球企业的真实世界口音英语语音上的表现。
  • 使用WER和IWER度量指标,识别不同区域口音之间的系统性性能差异。
  • 分析特定转录特征(如填充词和单词片段)如何影响不同口音的ASR错误率。
  • 通过公开可用的多样化数据集,暴露当前模型中的偏见,推动ASR的公平发展。

提出的方法

  • 从27个不同国家的125场收益电话会议中收集数据,根据公司总部位置划分为7个区域口音组别。
  • 通过人工转录并经过事后验证和命名实体识别(NER)标记,生成高质量的逐字转录稿。
  • 将转录稿转换为带有元数据和分词的标准化$.nlp$格式。
  • 应用蒙特卡洛置换检验,比较不同口音区域及转录特征之间的IWER差异。
  • 使用WER和IWER度量模型在不同区域和语言特征(如填充词和单词片段)下的性能差异。
  • 基于语言和地理分组定义区域,特别关注尼日利亚和加纳等代表性不足的口音。

实验结果

研究问题

  • RQ1商业ASR模型在真实世界收益电话会议中,对不同区域口音的表现如何?
  • RQ2不同口音之间的性能差异是否具有统计显著性,还是仅由随机波动引起?
  • RQ3哪些转录特征(如填充词或单词片段)对不同口音的ASR错误率影响最大?
  • RQ4模型错误在多大程度上与特定区域口音的语言或语音特征相关?
  • RQ5一个公开可用的多样化口音语音语料库,能否提升ASR系统中偏见的检测与缓解?

主要发现

  • 亚洲地区与英语地区相比,在0.005显著性水平下表现出统计上显著的WER差异,表明性能显著下降。
  • 其他罗曼语系地区以及西班牙语/葡萄牙语地区也与英语地区在0.05显著性水平下表现出统计上显著的WER差异。
  • 单词片段对所有区域的IWER均有显著影响,所有情况的p值均为0.000∗∗,表明具有高度统计显著性。
  • 填充词在大多数区域影响了IWER,与先前研究发现的无影响结果相矛盾,表明不同区域在停顿产生方式上的差异会影响模型识别效果。
  • 在英语和日耳曼语系地区,模型在填充词前的词语上表现更差;而在亚洲地区,模型在填充词前的词语上表现反而更好,表明模型存在区域特异性混淆。
  • 所有区域中,模型识别单词片段的能力均表现欠佳,p值均为0.000∗∗,显示出一种持续存在的错误模式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。