Skip to main content
QUICK REVIEW

[论文解读] Research on Modeling Units of Transformer Transducer for Mandarin Speech Recognition

Li‐Chen Fu, Xiaoxiao Li|arXiv (Cornell University)|Apr 26, 2020
Speech Recognition and Synthesis参考文献 24被引用 4
一句话总结

本文提出一种混合自注意力Transformer与RNN的架构——Transformer Transducer,用于端到端普通话语音识别,表明以带调音节作为建模单元可获得最佳性能。该方法在8kHz和16kHz音频上均实现了鲁棒识别,通过一种新颖的混合带宽训练方法,相较于以音节声母韵母(带调)为建模单位的模型,实现了14.4%的相对WER降低,相较于字符级建模则实现了44.1%的相对WER降低。

ABSTRACT

Modeling unit and model architecture are two key factors of Recurrent Neural Network Transducer (RNN-T) in end-to-end speech recognition. To improve the performance of RNN-T for Mandarin speech recognition task, a novel transformer transducer with the combination architecture of self-attention transformer and RNN is proposed. And then the choice of different modeling units for transformer transducer is explored. In addition, we present a new mix-bandwidth training method to obtain a general model that is able to accurately recognize Mandarin speech with different sampling rates simultaneously. All of our experiments are conducted on about 12,000 hours of Mandarin speech with sampling rate in 8kHz and 16kHz. Experimental results show that Mandarin transformer transducer using syllable with tone achieves the best performance. It yields an average of 14.4% and 44.1% relative Word Error Rate (WER) reduction when compared with the models using syllable initial/final with tone and Chinese character, respectively. Also, it outperforms the model based on syllable initial/final with tone with an average of 13.5% relative Character Error Rate (CER) reduction.

研究动机与目标

  • 通过Transformer Transducer架构提升端到端普通话语音识别性能。
  • 探究不同建模单元(如字符、带调音节、音节声母韵母组件)对识别准确率的影响。
  • 通过一种新颖的训练策略,开发一种能够处理多种采样率(8kHz和16kHz)的通用模型。
  • 在低资源、大词汇量普通话语音识别场景下,优化模型复杂度与识别准确率之间的权衡。

提出的方法

  • 提出一种混合Transformer Transducer模型,结合自注意力机制与RNN组件,以增强上下文建模能力。
  • 采用一种新颖的混合带宽训练方法,联合在8kHz和16kHz音频数据上进行训练,以生成单一鲁棒模型。
  • 评估多种建模单元:单个汉字、带调音节,以及带调音节声母韵母组件。
  • 在两种采样率下,基于约12,000小时的普通话语音数据进行模型训练与微调。
  • 在Transformer模块中使用带标签平滑的交叉熵损失以及Conformer风格的前馈网络。
  • 在训练过程中应用联合CTC-注意力对齐,以稳定注意力学习并改善声学输出与文本输出之间的对齐。

实验结果

研究问题

  • RQ1在普通话语音识别中,哪种建模单元——字符、带调音节,或带调音节声母韵母组件——能实现最高的识别准确率?
  • RQ2一个单一的Transformer Transducer模型是否能在不重新训练的情况下,对8kHz和16kHz音频均实现鲁棒性能?
  • RQ3与标准单带宽训练相比,所提出的混合带宽训练方法在泛化能力和错误率方面表现如何?
  • RQ4与纯Transformer或RNN-T模型相比,结合自注意力与RNN组件是否能更好地建模普通话语音中的长距离依赖关系?
  • RQ5与字符级建模相比,使用带调音节建模在WER和CER上的相对性能提升是多少?

主要发现

  • 以带调音节作为建模单元的模型实现了最低的词错误率(WER),相较于使用带调音节声母韵母的模型,实现了14.4%的相对WER降低。
  • 带调音节模型相较于字符级建模,实现了44.1%的相对WER降低,显示出显著的性能提升。
  • 该带调音节模型相较于带调音节声母韵母基线模型,还将字符错误率(CER)相对降低了13.5%。
  • 混合带宽训练方法使单一模型能够在8kHz和16kHz音频上均实现良好泛化,且无需微调即可保持高准确率。
  • 混合Transformer Transducer架构在普通话语音识别任务中,相较于标准RNN-T和纯Transformer模型,在鲁棒性与准确率方面表现更优。
  • 结果证实,建模单元对性能有显著影响,带调音节是最适合普通话这一声调语言且具有高形态复杂性的建模方式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。