[论文解读] A Fully Differentiable Beam Search Decoder
本文提出了一种完全可微分的束搜索解码器(DBD),通过在束搜索过程中反向传播梯度,实现了声学模型与语言模型的端到端训练,消除了暴露偏差和标签偏差。该方法通过联合优化未归一化的得分并使用序列级归一化,在更小的束宽和更简单的模型下实现了WSJ数据集上的最先进词错误率(WER)。
We introduce a new beam search decoder that is fully differentiable, making it possible to optimize at training time through the inference procedure. Our decoder allows us to combine models which operate at different granularities (e.g. acoustic and language models). It can be used when target sequences are not aligned to input sequences by considering all possible alignments between the two. We demonstrate our approach scales by applying it to speech recognition, jointly training acoustic and word-level language models. The system is end-to-end, with gradients flowing through the whole architecture from the word-level transcriptions. Recent research efforts have shown that deep neural networks with attention-based mechanisms are powerful enough to successfully train an acoustic model from the final transcription, while implicitly learning a language model. Instead, we show that it is possible to discriminatively train an acoustic model jointly with an explicit and possibly pre-trained language model.
研究动机与目标
- 通过在训练过程中使梯度能够通过束搜索流动,消除序列建模中的暴露偏差。
- 通过使用未归一化的得分并结合全局序列级归一化,克服局部归一化模型中的标签偏差。
- 在无需在验证集上进行超参数调优的情况下,实现不同粒度(如词级和子词级)模型的联合训练。
- 通过避免昂贵的归一化项,实现对长序列和大词汇量的高效扩展。
- 证明使用可微分束搜索训练时,更简单、更小的声学模型也能实现具有竞争力的性能。
提出的方法
- 解码器使用声学模型输出的未归一化帧得分以及词级和字级语言模型的未归一化转移得分。
- 通过一种新颖的目标序列追踪机制执行束搜索,以在搜索过程中保持梯度流动。
- 在所有有效对齐到目标序列的基础上计算全局归一化项,避免局部归一化和标签偏差。
- 采用可微分的log-sum-exp(logadd)运算来近似束搜索,从而实现对n个最佳假设的反向传播。
- 系统支持任意粒度模型(包括预训练语言模型)的组合。
- 通过整个架构(包括束搜索)的反向传播计算梯度,实现端到端优化。
实验结果
研究问题
- RQ1束搜索能否被完全可微分化,以实现声学模型与语言模型的端到端训练?
- RQ2可微分束搜索是否能消除序列建模中的暴露偏差与标签偏差?
- RQ3能否在无需超参数调优的情况下,实现不同粒度(如词级与子词级)模型的联合训练?
- RQ4该方法是否能高效扩展到大词汇量和长序列,且不会带来显著计算开销?
- RQ5当使用可微分束搜索训练时,更简单、更小的声学模型是否能实现具有竞争力的性能?
主要发现
- DBD在WSJ数据集上实现了具有竞争力的词错误率(WER),与仅使用转录文本和声学数据的最先进模型相当。
- 在束宽为500时,WER显著降低,优于需要8000束宽的精心调优的ASG基线模型。
- 当使用DBD训练时,感受野减半且参数更少的简化声学模型也达到了同等性能。
- 该方法消除了在验证集上对解码参数(如语言模型权重)进行超参数调优的需求。
- 使用DBD训练使声学模型能够专注于有效词序列,减轻了学习隐式语言建模的负担。
- 在WSJ数据集上,使用500束宽的完整训练周期约需30分钟,证明了其可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。