[论文解读] Transformer with Bidirectional Decoder for Speech Recognition
本文提出了一种带有双向解码器的语音转换器(STBD),通过共享编码器和双单向解码器,同时从左到右和从右到左两个方向联合预测语音标记。在推理阶段采用双向束搜索,并从两个方向中选择得分最高的假设,STBD在无需语言模型重排序或数据增强的情况下,在AISHELL-1数据集上实现了相对于单向基线3.6%的相对CER降低,其中STBD-Big模型的CER达到6.64%。
Attention-based models have made tremendous progress on end-to-end automatic speech recognition(ASR) recently. However, the conventional transformer-based approaches usually generate the sequence results token by token from left to right, leaving the right-to-left contexts unexploited. In this work, we introduce a bidirectional speech transformer to utilize the different directional contexts simultaneously. Specifically, the outputs of our proposed transformer include a left-to-right target, and a right-to-left target. In inference stage, we use the introduced bidirectional beam search method, which can not only generate left-to-right candidates but also generate right-to-left candidates, and determine the best hypothesis by the score. To demonstrate our proposed speech transformer with a bidirectional decoder(STBD), we conduct extensive experiments on the AISHELL-1 dataset. The results of experiments show that STBD achieves a 3.6\% relative CER reduction(CERR) over the unidirectional speech transformer baseline. Besides, the strongest model in this paper called STBD-Big can achieve 6.64\% CER on the test set, without language model rescoring and any extra data augmentation strategies.
研究动机与目标
- 为解决传统从左到右自回归语音转换器在序列生成过程中忽略从右到左上下文的局限性。
- 通过在训练和推理阶段同时引入双向上下文,缓解自回归解码中的暴露偏差问题。
- 在不依赖外部语言模型或数据增强的前提下,提升自动语音识别性能。
- 探究双向目标和双向束搜索在端到端ASR中的有效性。
提出的方法
- 该模型使用共享编码器和两个单向解码器——一个用于从左到右(L2R),一个用于从右到左(R2L)序列生成,实现两个方向的并行预测。
- 在训练过程中,通过交叉熵损失同时优化L2R和R2L目标,使网络能够从双向上下文中学习。
- 推理阶段采用双向束搜索,分别维护L2R和R2L解码的独立束,并动态更新两个方向的候选。
- 最终假设基于所有L2R和R2L候选中得分最高的整体结果选择,提升鲁棒性并减少误差传播。
- 模型在两个解码器之间共享参数,在保持效率的同时实现双向上下文学习。
- 该方法在AISHELL-1数据集上通过字符级ASR进行评估,并对束大小和解码策略进行了消融研究。

实验结果
研究问题
- RQ1同时从左到右和从右到左两个方向进行联合预测,能否提升自动语音识别性能?
- RQ2与单向束搜索相比,双向束搜索是否能带来更优的假设选择?
- RQ3在训练中使用双向目标,是否能有效减少推理过程中的误差累积?
- RQ4在不使用语言模型或数据增强的情况下,双向解码在多大程度上提升了模型鲁棒性?
主要发现
- 与单向语音转换器基线相比,STBD模型在AISHELL-1测试集上实现了3.6%的相对CER降低。
- STBD-Big模型在AISHELL-1测试集上达到6.64%的CER,且无需语言模型重排序或数据增强。
- 即使使用相同的训练模型,双向束搜索方法在性能上仍优于标准的单向束搜索。
- 49.4%的测试句子由从右到左解码器更准确地解码,表明两个方向具有互补优势。
- 消融研究显示,增大束大小可提升性能,但当束大小超过2后增益趋于饱和。
- 注意力对齐的可视化结果表明,L2R解码器的注意力沿从左下到右上的对角线分布,而R2L解码器的注意力则从右下到左上分布,验证了其方向性行为。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。