[论文解读] Attentional Speech Recognition Models Misbehave on Out-of-domain Utterances
该论文指出,自回归序列到序列(AR-S2S)语音识别模型(包括Transformer和自注意力CTC模型)在解码域外语音时会产生过长且重复的('回声式')转录结果,尽管其在域内数据上表现良好。作者提出使用双向LSTM训练一个独立的长度预测模型,以估计预期的词片数量,从而在不增加LibriSpeech数据集上WER的情况下,对退化输出进行截断,有效缓解了该问题,且无需修改主ASR模型。
We discuss the problem of echographic transcription in autoregressive sequence-to-sequence attentional architectures for automatic speech recognition, where a model produces very long sequences of repetitive outputs when presented with out-of-domain utterances. We decode audio from the British National Corpus with an attentional encoder-decoder model trained solely on the LibriSpeech corpus. We observe that there are many 5-second recordings that produce more than 500 characters of decoding output (i.e. more than 100 characters per second). A frame-synchronous hybrid (DNN-HMM) model trained on the same data does not produce these unusually long transcripts. These decoding issues are reproducible in a speech transformer model from ESPnet, and to a lesser extent in a self-attention CTC model, suggesting that these issues are intrinsic to the use of the attention mechanism. We create a separate length prediction model to predict the correct number of wordpieces in the output, which allows us to identify and truncate problematic decoding results without increasing word error rates on the LibriSpeech task.
研究动机与目标
- 调查为何AR-S2S端到端ASR模型在域外语音上会产生异常长且重复的转录结果,尽管其在域内表现优异。
- 确定这种行为是序列到序列模型中注意力机制的固有特性,还是受解码超参数(如束宽或长度归一化)的影响。
- 开发一种方法,检测并缓解这些退化输出,同时不降低在域内基准上的性能。
- 将AR-S2S模型的行为与帧同步的DNN-HMM模型进行比较,后者不表现出此问题。
提出的方法
- 使用AR-S2S模型的编码器特征,训练一个双向LSTM模型,以预测给定音频输入在参考转录中的词片数量。
- 长度预测模型采用泊松回归头,并在编码后的音频帧上应用ReLU激活的仿射变换,以估计期望输出长度。
- 将解码输出在预测长度的倍数处截断(例如1.3倍预测长度),该倍数通过最小化域外错误率并保持域内WER不变来调优。
- 在LibriSpeech开发集上微调该模型,并在推理过程中将预测长度用作动态截断阈值。
- 在1,607个BNC语句的干净子集上评估该方法,这些语句在AR-S2S解码中WER较低,确保对域外行为的可靠评估。
- 该方法在多个模型上得到验证,包括ESPnet Transformer和自注意力CTC模型,证实该问题源于注意力机制本身。
实验结果
研究问题
- RQ1为何AR-S2S ASR模型在域外语音上会产生过长且重复的转录结果,尽管其在域内表现优异?
- RQ2回声式行为是由注意力机制引起的,还是由束宽或长度归一化等解码超参数引起的?
- RQ3能否通过一个独立的长度预测模型检测并截断退化输出,而不损害在域内基准上的性能?
- RQ4为何帧同步的DNN-HMM模型不表现出此行为,这是否暗示架构鲁棒性存在根本性差异?
- RQ5在不同注意力机制ASR架构中,学习到的长度预测器在多大程度上可缓解此问题?
主要发现
- 在39,323个BNC语句中,AR-S2S模型在170个语句中生成的转录超过700个字符,部分输出重复同一短语超过100次,而DNN-HMM模型未产生此类退化输出。
- 该问题在预训练的ESPnet Transformer模型中可复现,在自注意力CTC模型中程度较轻,表明其源于注意力机制本身。
- 在预测长度的1.3倍处截断解码输出,可去除170个回声式样本中的160个,且LibriSpeech测试集WER未上升。
- 长度预测模型在LibriSpeech测试集上的平均绝对误差为2.7个词片,支持精确的动态截断。
- 观察到AR-S2S模型中的注意力机制反复关注同一音频片段而未随时间推进,解释了重复输出的成因。
- 调整长度归一化可减少回声式行为,但显著增加WER,因此在鲁棒性方面是不可行的折中方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。