Skip to main content
QUICK REVIEW

[论文解读] On Word Error Rate Definitions and their Efficient Computation for Multi-Speaker Speech Recognition Systems

Thilo von Neumann, Christoph Boeddeker|arXiv (Cornell University)|Nov 29, 2022
Speech Recognition and Synthesis被引用 4
一句话总结

本文提出了一种广义的多输入多输出(MIMO)词错误率(WER)框架,用于多说话人、多通道自动语音识别(ASR)系统,通过在多维Levenshtein距离张量上使用动态规划高效计算WER,确保每个语音段一致地匹配到单一假设通道。该方法将原本指数级复杂度的ORC WER计算降低为多项式时间,使其在长时录音和多样化评估场景中具备实用性。

ABSTRACT

We propose a general framework to compute the word error rate (WER) of ASR systems that process recordings containing multiple speakers at their input and that produce multiple output word sequences (MIMO). Such ASR systems are typically required, e.g., for meeting transcription. We provide an efficient implementation based on a dynamic programming search in a multi-dimensional Levenshtein distance tensor under the constraint that a reference utterance must be matched consistently with one hypothesis output. This also results in an efficient implementation of the ORC WER which previously suffered from exponential complexity. We give an overview of commonly used WER definitions for multi-speaker scenarios and show that they are specializations of the above MIMO WER tuned to particular application scenarios. We conclude with a discussion of the pros and cons of the various WER definitions and a recommendation when to use which.

研究动机与目标

  • 解决多说话人、多通道ASR系统(MIMO)在处理重叠语音并生成多个输出序列时,缺乏统一且高效的WER定义的问题。
  • 克服现有WER定义(如ORC WER)的指数级计算复杂度,该问题曾使长时录音的评估变得不可行。
  • 将现有WER定义(如uWER、SA-WER、cpWER、ORC WER)作为统一MIMO WER框架下的特例进行泛化。
  • 实现无需依赖说话人标签或精确时间信息的WER评估,使其适用于广泛ASR系统,包括端到端模型。
  • 开发并发布开源工具MeetEval,支持高效MIMO WER计算,涵盖ORC WER及其他变体。

提出的方法

  • 将MIMO WER形式化为在参考序列与假设序列之间进行多维Levenshtein距离计算,约束条件为每个语音段必须一致匹配到单一假设通道。
  • 在动态规划公式中引入通道切换标记,以惩罚跨多个输出通道的语音段拆分,确保转录评估的一致性。
  • 通过将搜索空间结构化为张量并施加约束,避免指数级枚举,推导出具有多项式时间复杂度的高效动态规划算法。
  • 利用相同框架将ORC WER的计算复杂度从指数级降低为关于语音段数量的多项式时间,从而实现对长时录音的评估。
  • 在开源MeetEval工具包中实现该算法,支持灵活的输入格式,并可与现有ASR评估流水线集成。
  • 在真实会议识别场景中,将该方法与暴力计算的ORC WER、asclite及其他WER变体进行基准测试,以验证其效率与准确性。

实验结果

研究问题

  • RQ1如何为处理多说话人并生成多通道输出的MIMO ASR系统,制定一种统一且通用的WER定义?
  • RQ2现有WER定义(如ORC WER)的计算复杂度是多少?能否将其从指数时间降低为多项式时间?
  • RQ3所提出的MIMO WER框架与现有WER定义(如uWER、SA-WER、cpWER、ORC WER)之间有何关系?是否能对其实现泛化?
  • RQ4在何种场景下,MIMO WER框架优于或避免了现有WER定义的缺陷,特别是在对语音段拆分和说话人误判的鲁棒性方面?
  • RQ5该框架能否在不依赖时间或说话人级别标注的情况下高效实现?与asclite等现有工具相比,其运行时间和可扩展性表现如何?

主要发现

  • 所提出的MIMO WER框架泛化了现有WER定义,其中uWER、SA-WER、cpWER和ORC WER在不同约束条件下均为其特例。
  • 通过在多维Levenshtein张量上应用动态规划,将ORC WER的计算复杂度从指数级降低为多项式时间,使超过20个语音段的录音评估成为可能——此前难以实现。
  • MIMO WER与ORC WER在语音段数量上的运行时间均呈多项式复杂度,经100个语音段的基准测试验证,其日志尺度运行时间曲线呈凹形。
  • asclite工具在基准测试中表现出接近线性的性能,因其使用了时间标注;但在复杂场景(如mms_msg)中,其复杂度急剧上升,仅本方法实现的ORC WER仍具可行性。
  • MIMO WER框架不依赖说话人标签与时间信息,适用于端到端ASR系统及其他缺乏此类标注的架构。
  • 开源MeetEval工具包实现了MIMO系统的高效、可扩展WER评估,并支持与现有评估流水线集成,包括对ORC WER不兼容的系统。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。