Skip to main content
QUICK REVIEW

[论文解读] Global Performance Disparities Between English-Language Accents in Automatic Speech Recognition

Alex DiChristofano, Henry Shuster|arXiv (Cornell University)|Aug 1, 2022
Speech Recognition and Synthesis被引用 7
一句话总结

本研究利用来自171个国家的2,713名讲英语者的全球数据集,审计了主要英语自动语音识别(ASR)服务的表现,发现即使在控制语言协变量后,来自与美国地缘政治距离较远国家的说话者,其性能仍显著下降。主要发现是,与说话者原产国的政治立场相关的系统性偏差具有统计显著性,表明这种偏差根植于历史权力结构,而不仅仅是语言复杂性本身。

ABSTRACT

Past research has identified discriminatory automatic speech recognition (ASR) performance as a function of the racial group and nationality of the speaker. In this paper, we expand the discussion beyond bias as a function of the individual national origin of the speaker to look for bias as a function of the geopolitical orientation of their nation of origin. We audit some of the most popular English language ASR services using a large and global data set of speech from The Speech Accent Archive, which includes over 2,700 speakers of English born in 171 different countries. We show that, even when controlling for multiple linguistic covariates, ASR service performance has a statistically significant relationship to the political alignment of the speaker's birth country with respect to the United States' geopolitical power. This holds for all ASR services tested. We discuss this bias in the context of the historical use of language to maintain global and political power.

研究动机与目标

  • 调查ASR性能是否系统性地因说话者原产国与美国之间的地缘政治关系而异。
  • 利用大规模、多样化的全球英语口音数据集,审计主要商业ASR服务。
  • 检验诸如第一语言或口音类型等语言协变量是否能完全解释ASR性能差异。
  • 将观察到的ASR偏差置于语言权力和殖民主义的历史模式中加以语境化。
  • 挑战一种假设,即仅通过数据收集,ASR偏差将随时间自然缓解。

提出的方法

  • 本研究使用The Speech Accent Archive这一公开数据集,其中包含来自171个国家的2,700多名说话者,每位说话者均提供录音及人口统计元数据。
  • 评估ASR服务(如Google、Microsoft、Amazon、IBM)对每位说话者音频的词错误率(WER)。
  • 统计建模控制了包括第一语言、母语是否为声调语言以及母语英语熟练度在内的语言协变量。
  • 地缘政治对齐通过北约成员身份和历史上的美国外交政策对齐情况来操作化,非对齐或敌对国家被编码为与美国权力距离较远。
  • 通过多元回归模型评估地缘政治距离与ASR WER之间的关系,同时调整语言和人口统计因素。
  • 分析包括稳健性检验和子群分析,以验证地缘政治效应在不同ASR提供商和说话者群体中的一致性。

实验结果

研究问题

  • RQ1ASR性能是否因说话者出生国与美国之间的地缘政治关系而异?
  • RQ2第一语言或声调母语等语言协变量在多大程度上能解释ASR系统中的性能差异?
  • RQ3观察到的性能差距是否在多个商业ASR服务中保持一致?
  • RQ4英语作为殖民和全球权力工具的历史使用,如何与当前的ASR偏差相关联?
  • RQ5观察到的偏差可归因于数据稀缺,还是根植于语言与权力更深层次的系统性不平等?

主要发现

  • 所有测试的ASR服务在来自与美国地缘政治距离较远国家的说话者中,词错误率均显著更高,即使在控制语言因素后依然如此。
  • 来自非北约国家的说话者,特别是那些历史上与美国敌对的国家,其ASR表现持续劣于北约盟友国家的说话者。
  • 在调整第一语言、声调母语和母语英语熟练度后,性能差距依然存在,表明语言复杂性本身无法完全解释这一差异。
  • 研究未发现仅通过数据收集就能自然缓解ASR偏差的证据,因为反馈回路会强化训练数据中既有的不平等。
  • 结果表明,ASR偏差并非仅仅是数据不平衡的技术问题,而是与历史和地缘政治权力结构系统性相关。
  • 研究结果挑战了技术乐观主义观点,即改进数据收集将自然解决ASR差异,反而指出了算法偏差的结构性和政治维度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。