[论文解读] Enhancing ASR for Stuttered Speech with Limited Data Using Detect and Pass
本文提出了一种轻量级方法 'Detect and Pass',通过少量标注数据提升语音识别(ASR)系统在口吃语音上的性能。该方法训练一个上下文感知分类器以检测口吃帧,并在推理阶段将这些帧及其后验概率传递给ASR模型,使基于最先进RNN-T模型的词错误率(WER)最高降低71.24%,尤其显著提升了小型ASR模型的性能。
It is estimated that around 70 million people worldwide are affected by a speech disorder called stuttering. With recent advances in Automatic Speech Recognition (ASR), voice assistants are increasingly useful in our everyday lives. Many technologies in education, retail, telecommunication and healthcare can now be operated through voice. Unfortunately, these benefits are not accessible for People Who Stutter (PWS). We propose a simple but effective method called 'Detect and Pass' to make modern ASR systems accessible for People Who Stutter in a limited data setting. The algorithm uses a context aware classifier trained on a limited amount of data, to detect acoustic frames that contain stutter. To improve robustness on stuttered speech, this extra information is passed on to the ASR model to be utilized during inference. Our experiments show a reduction of 12.18% to 71.24% in Word Error Rate (WER) across various state of the art ASR systems. Upon varying the threshold of the associated posterior probability of stutter for each stacked frame used in determining low frame rate (LFR) acoustic features, we were able to determine an optimal setting that reduced the WER by 23.93% to 71.67% across different ASR systems.
研究动机与目标
- 解决由于训练数据中存在多数性偏差,导致ASR系统在口吃语音上表现不佳的问题。
- 开发一种方法,提升在低资源数据场景下口吃人群(PWS)的ASR鲁棒性。
- 评估一种简单、轻量的检测与重定向机制是否能在不微调主ASR模型的前提下显著降低WER。
- 确定帧级最优阈值及投票策略,以实现分类器输出与ASR推理结果的有效结合。
提出的方法
- 将语音分割为非重叠的100ms帧,并使用训练好的声学分类器预测每帧是否包含口吃。
- 分类器输出每帧的后验概率,表示口吃的可能性。
- 将后验概率较高的口吃帧(即高置信度口吃帧)作为独立输入流传递给ASR模型进行推理。
- 通过堆叠三个连续帧生成低帧率(LFR)特征,并应用多种投票策略(如多数投票、任意投票、平均阈值)以确定每个LFR帧的最终口吃标签。
- ASR模型同时处理原始输入和检测到的口吃帧,使其能够更专注地关注不连贯区域。
- 该方法应用于基于RNN-T的ASR模型,无需微调,可作为即插即用的增强模块。
实验结果
研究问题
- RQ1一个简单、数据高效的分类器能否以高准确率检测语音中的口吃帧?
- RQ2将检测到的口吃帧及其后验概率传递给ASR模型,是否能降低口吃语音的WER?
- RQ3Detect and Pass方法在不同训练数据量的ASR模型上的性能表现如何?
- RQ4哪种帧级聚合策略(如多数票选、平均阈值)能实现最佳WER降低效果?
- RQ5在基于LFR的推理流程中,后验概率的最优阈值是多少,能最大化WER降低效果?
主要发现
- 在仅使用200K小时数据训练的RNN-T1模型上,Detect and Pass方法将WER最高降低了71.24%。
- 对于更大的模型(RNN-T2、RNN-T3),WER降低幅度虽较小但仍具显著性,分别降低了38.03%和12.18%。
- 平均后验概率的最优阈值为0.8,在RNN-T3上实现了23.93%的WER降低。
- 'any_0'投票策略在小型模型(如RNN-T1)上表现最佳,而较大模型则最优阈值为0.8。
- 该方法表现出可叠加的改进效果,尤其在小型ASR模型上收益更大,表明其在低资源场景下的价值。
- 分类器在测试集上的PR-AUC > 75%,证实其在数据有限场景下作为“足够好”的检测器具有有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。