Skip to main content
QUICK REVIEW

[论文解读] Semantic-WER: A Unified Metric for the Evaluation of ASR Transcript for End Usability

Somnath Roy|arXiv (Cornell University)|Jun 3, 2021
Speech Recognition and Synthesis参考文献 25被引用 6
一句话总结

本文提出语义WER(SWER),一种统一的评估指标,通过基于词语对下游可用性的影响(特别是在命名实体识别和情感分析等任务中)的语义重要性权重,对词错误率(WER)进行增强。通过为关键词语(如命名实体或情感词)分配更高权重,SWER相较于WER与人类判断的相关性更高,在使用默认权重时与人类评估分数(HWER)的相关性达到0.85。

ABSTRACT

Recent advances in supervised, semi-supervised and self-supervised deep learning algorithms have shown significant improvement in the performance of automatic speech recognition(ASR) systems. The state-of-the-art systems have achieved a word error rate (WER) less than 5%. However, in the past, researchers have argued the non-suitability of the WER metric for the evaluation of ASR systems for downstream tasks such as spoken language understanding (SLU) and information retrieval. The reason is that the WER works at the surface level and does not include any syntactic and semantic knowledge.The current work proposes Semantic-WER (SWER), a metric to evaluate the ASR transcripts for downstream applications in general. The SWER can be easily customized for any down-stream task.

研究动机与目标

  • 为解决WER在评估自动语音识别转录文本在下游可用性方面(特别是在语义理解与信息检索任务中)的局限性。
  • 开发一种统一且可定制的指标,反映转录错误对语义理解真实世界影响。
  • 通过更严厉惩罚关键词语(如命名实体或情感词)的错误,提升评估的保真度,而非对功能词过度敏感。
  • 确保指标输出范围在[0, 1]之间,并更好地与人类对错误严重性的感知对齐。
  • 为使用CRM数据的组织提供一种实用且可扩展的框架,支持对专有名词拼写错误的部分宽容。

提出的方法

  • SWER通过引入反映词语对整体话语语义影响的词级重要性权重(IW),扩展了WER。
  • 重要性权重基于语义距离以及词语被省略或替换对句子意图的影响计算,尤其关注命名实体和情感词。
  • 对于实体,该指标支持可配置的折扣机制(例如,将‘harvey’拼写为‘h r v e y’时仅轻微惩罚),并利用CRM数据实现上下文感知的容错能力。
  • 通过同时使用参考转录和假设转录的长度对错误数进行归一化,确保输出范围在[0, 1]之间,与标准WER不同。
  • SWER可自定义:用户可为特定词语或短语定义自定义重要性权重,当语义距离不足以判断时使用。
  • 该方法使用Levenshtein对齐进行词级编辑操作,但根据受影响词语的重要性重新加权替换、删除和插入操作。

实验结果

研究问题

  • RQ1WER在多大程度上无法反映自动语音识别转录在情感分析和命名实体识别等下游任务中的真实可用性?
  • RQ2引入语义重要性权重在多大程度上能提升自动指标与人类对转录质量判断之间的相关性?
  • RQ3能否设计一种统一且可定制的指标,更好地反映自动语音识别错误在现实世界中的影响,同时保持在[0, 1]范围内?
  • RQ4SWER在命名实体和情感相关语句中,与WER和人类评估(HWER)相比表现如何,尤其是在不同类型错误上的表现?
  • RQ5在包含不同数量命名实体的句子中,SWER的最优默认重要性权重是多少?

主要发现

  • SWER在默认重要性权重(IW=1)下与人类评估分数(HWER)的相关性达到0.85,显著优于标准WER(相关性低于0.7)。
  • 对于含一个命名实体的句子(Cat-I),SWER_IW=1与HWER的相关性最高,表明默认权重在简单场景下有效。
  • 对于含两个或更多实体的句子(Cat-II和Cat-III),SWER使用IW=2时与HWER的相关性高于IW=1,表明复杂句子需要更高的权重。
  • 当命名实体部分被转录时(如‘h r v e y’而非‘h a r v e y’),SWER通过可配置的实体级折扣机制应用更小的惩罚,反映现实中的容错能力。
  • 该指标能有效区分WER相同但语义影响截然不同的假设——例如‘thank you’与‘f*ck you’——对语义危害更大的错误赋予更高的SWER。
  • 误差分数分布显示,SWER更贴近人类感知,SWER与HWER在所有类别中均显著优于WER与HWER的对齐程度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。