Skip to main content
QUICK REVIEW

[论文解读] Evaluating User Perception of Speech Recognition System Quality with Semantic Distance Metric

Suyoun Kim, Manh Duc Le|arXiv (Cornell University)|Oct 11, 2021
Speech Recognition and Synthesis被引用 4
一句话总结

本文提出 SemDist,一种基于预训练语言模型嵌入的语义距离度量方法,通过衡量语义正确性而非词级错误来评估自动语音识别(ASR)输出质量。结果表明,与词错误率(WER)相比,SemDist在与人类用户感知及下游自然语言理解(NLU)任务的相关性上显著更高,其中基于成对词元的 XLM 嵌入在 71K 和 36K 个用户标注的 ASR 评估中表现最佳。

ABSTRACT

Measuring automatic speech recognition (ASR) system quality is critical for creating user-satisfying voice-driven applications. Word Error Rate (WER) has been traditionally used to evaluate ASR system quality; however, it sometimes correlates poorly with user perception/judgement of transcription quality. This is because WER weighs every word equally and does not consider semantic correctness which has a higher impact on user perception. In this work, we propose evaluating ASR output hypotheses quality with SemDist that can measure semantic correctness by using the distance between the semantic vectors of the reference and hypothesis extracted from a pre-trained language model. Our experimental results of 71K and 36K user annotated ASR output quality show that SemDist achieves higher correlation with user perception than WER. We also show that SemDist has higher correlation with downstream Natural Language Understanding (NLU) tasks than WER.

研究动机与目标

  • 解决传统 WER 与人类用户对 ASR 质量感知之间相关性差的问题。
  • 评估通过预训练语言模型嵌入测量的语义正确性是否比词级错误率更能反映用户判断。
  • 比较多种语义距离计算策略,识别最稳健的用户感知建模方法。
  • 展示 SemDist 在预测用户满意度及提升语音驱动应用中的模型选择方面的实用性。

提出的方法

  • 使用预训练的基于 Transformer 的语言模型(如 RoBERTa、XLM)为参考转录和假设转录计算语义嵌入。
  • 将语义距离(SemDist)计算为参考和假设的均值池化或 [CLS] 标记嵌入之间的余弦距离。
  • 探索四种 SemDist 变体:RoBERTa-均值池化、XLM-均值池化、XLM-[CLS] 和 XLM-成对词元嵌入方法。
  • 使用皮尔逊相关系数将 SemDist 和 WER 与用户判断(UserChoice、UserRating)以及下游 NLU 任务(意图准确率、EM、EMTree)进行比较。
  • 训练线性回归模型,使用 WER、SemDist 或两者作为输入特征来预测用户评分。
  • 分析 WER 与 SemDist 之间的排名差异,以理解其评估行为的分歧原因。

实验结果

研究问题

  • RQ1与词错误率(WER)相比,SemDist 是否与人类用户对 ASR 质量的感知具有更强的相关性?
  • RQ2计算语义嵌入的方法(如均值池化、[CLS]、成对词元)中,哪种能产生最稳健的 SemDist 以反映用户感知?
  • RQ3在预测下游 NLU 任务(如意图识别和语义解析)性能方面,SemDist 与 WER 相比如何?
  • RQ4是否可以使用 SemDist 训练出准确预测用户满意度的模型,而无需依赖昂贵的人工标注?

主要发现

  • 在所有测试数据集中,SemDist 与用户感知(UserChoice 和 UserRating)的皮尔逊相关系数显著高于 WER。
  • XLM-成对词元 SemDist 方法与用户判断的相关性最高,优于基于 RoBERTa 和均值池化的方法。
  • SemDist 与下游 NLU 任务(1 - 意图准确率、1 - EM、1 - EMTree)的相关性高于 WER,表明其与系统级性能的对齐更优。
  • 仅使用 SemDist 作为输入特征的线性回归模型在预测用户评分时 R² 达到 0.35,优于仅使用 WER 的模型(R² = 0.12)。
  • 基于 SemDist 的模型实现了 0.29 的平均绝对误差(MAE),与使用 WER 和 SemDist 两者的最佳模型性能相当,表明 SemDist 具有强大的预测能力。
  • SemDist 能够有效惩罚语义无意义的错误(例如 'cancel an alarm' 与 'set a alarm'),而 WER 无法区分此类错误,凸显其语义敏感性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。