Skip to main content
QUICK REVIEW

[论文解读] ASR-GLUE: A New Multi-task Benchmark for ASR-Robust Natural Language Understanding

Lingyun Feng, Jianwei Yu|arXiv (Cornell University)|Aug 30, 2021
Speech Recognition and Synthesis参考文献 48被引用 9
一句话总结

本文提出了 ASR-GLUE,一个新型多任务基准,用于评估在自动语音识别(ASR)错误下的自然语言理解(NLU)鲁棒性。该基准涵盖六个多样化的 NLU 任务,共 18 种音频变体(3 种噪声水平 × 6 位说话人),揭示了 ASR 错误——尤其是发音相似的替换和删除——会显著降低 NLU 性能,而 BERT 展现出有限的鲁棒性,凸显了模型与人类在真实语音应用中鲁棒性之间的关键差距。

ABSTRACT

Language understanding in speech-based systems have attracted much attention in recent years with the growing demand for voice interface applications. However, the robustness of natural language understanding (NLU) systems to errors introduced by automatic speech recognition (ASR) is under-examined. %To facilitate the research on ASR-robust general language understanding, In this paper, we propose ASR-GLUE benchmark, a new collection of 6 different NLU tasks for evaluating the performance of models under ASR error across 3 different levels of background noise and 6 speakers with various voice characteristics. Based on the proposed benchmark, we systematically investigate the effect of ASR error on NLU tasks in terms of noise intensity, error type and speaker variants. We further purpose two ways, correction-based method and data augmentation-based method to improve robustness of the NLU systems. Extensive experimental results and analysises show that the proposed methods are effective to some extent, but still far from human performance, demonstrating that NLU under ASR error is still very challenging and requires further research.

研究动机与目标

  • 为解决在多样化、通用的自然语言理解任务中,缺乏全面评估 NLU 鲁棒性在真实 ASR 错误下的基准问题。
  • 系统分析 ASR 错误类型(如发音相似、连读、插入和删除)对不同噪声水平和说话人差异下 NLU 模型性能的影响。
  • 在 ASR 错误下评估模型与人类的表现,以建立鲁棒性的基线,并识别当前 NLU 系统中的差距。
  • 为跨多个领域和语言现象开发与评估 ASR 鲁棒的 NLU 模型,提供一个标准化、可扩展的测试平台。

提出的方法

  • 作者通过从现有的 GLUE 基准任务中选取测试样本构建了 ASR-GLUE,排除了长句或非标准句,以确保音频质量和一致性。
  • 六名母语者在三种不同的噪声条件(低、中、高)下录制了选定的测试句子,以模拟真实世界的声学变化。
  • 每个 NLU 任务(SST-2、STS-B、QQP、QNLI、RTE、SciTail)均生成了 18 种不同的音频版本(3 种噪声水平 × 6 位说话人),以支持对说话人相关和噪声相关错误效应的分析。
  • 从音频录音中生成 ASR 假设,并将错误类型手动划分为四类:发音相似、连读、插入和删除。
  • 使用标准指标(准确率、相关性)在 ASR 转录文本上评估模型性能,并与干净文本基线进行比较,以量化性能下降。
  • 在相同噪声条件下开展了人工评估,以基准化人类鲁棒性,并与模型性能进行对比。

实验结果

研究问题

  • RQ1不同类型的 ASR 错误(如发音相似替换、删除、插入和连读)如何影响最先进 NLU 模型的性能?
  • RQ2随着背景噪声强度的增加,NLU 模型在多样化 NLU 任务中的鲁棒性如何变化?
  • RQ3说话人特有的语音特征(如音高、发音清晰度)在多大程度上影响 ASR 错误率及后续的 NLU 性能?
  • RQ4与人类水平的鲁棒性相比,BERT 及其他 SOTA 模型在 ASR 错误下的性能下降程度如何?

主要发现

  • ASR-GLUE 揭示,发音相似替换和删除是最常见的错误类型,且随噪声强度增加而显著上升,而连读和插入错误则保持相对稳定。
  • BERT 在 ASR 错误下性能显著下降,当将干净文本与高噪声、高 WER 转录文本对比时,SST-2 任务的准确率最高下降达 32%。
  • 说话人差异导致显著的性能差距:BERT 在说话人 1(S1)上的准确率始终比在说话人 6(S6)上高出 27–32 个百分点,表明对说话人相关错误具有强烈敏感性。
  • 模型对连读错误表现出相对鲁棒性,性能下降最小,而发音相似和删除错误导致准确率下降最为显著。
  • 人类表现显著优于模型,尤其在高噪声条件下,表明当前 NLU 模型与人类在鲁棒性方面存在巨大差距。
  • 该基准表明,ASR 错误下的 NLU 仍然是一个极具挑战性的问题,尤其对通用模型而言,强调了需要采用多任务、多鲁棒性训练方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。