[论文解读] An investigation of phone-based subword units for end-to-end speech recognition
本文提出基于电话的字节对编码(BPE)作为端到端自动语音识别的子词单元,利用发音词典和多级语言模型提升准确率。通过一种新颖的一次性联合束搜索方法,结合基于电话和基于字符的BPE系统,实现了最先进性能——在Switchboard数据集上WER为6.3%/13.3%,在Fisher+Switchboard数据集上WER为4.9%。
Phones and their context-dependent variants have been the standard modeling units for conventional speech recognition systems, while characters and subwords have demonstrated their effectiveness for end-to-end recognition systems. We investigate the use of phone-based subwords, in particular, byte pair encoder (BPE), as modeling units for end-to-end speech recognition. In addition, we also developed multi-level language model-based decoding algorithms based on a pronunciation dictionary. Besides the use of the lexicon, which is easily available, our system avoids the need of additional expert knowledge or processing steps from conventional systems. Experimental results show that phone-based BPEs tend to yield more accurate recognition systems than the character-based counterpart. In addition, further improvement can be obtained with a novel one-pass joint beam search decoder, which efficiently combines phone- and character-based BPE systems. For Switchboard, our phone-based BPE system achieves 6.8\%/14.4\% word error rate (WER) on the Switchboard/CallHome portion of the test set while joint decoding achieves 6.3\%/13.3\% WER. On Fisher + Switchboard, joint decoding leads to 4.9\%/9.5\% WER, setting new milestones for telephony speech recognition.
研究动机与目标
- 探究基于电话的子词单元(特别是BPE)是否在端到端语音识别中优于基于字符的子词单元。
- 开发一种多级语言模型,将子词级和词级语言建模相结合,用于基于电话的BPE序列解码。
- 设计一种高效的单次遍历联合束搜索解码器,融合基于电话和基于字符的BPE系统输出。
- 通过避免专家提供的语音知识或复杂预处理步骤,保持端到端系统的简洁性。
- 在不依赖外部语言模型或大量调优的前提下,实现在Switchboard和Fisher基准上的最先进性能。
提出的方法
- 通过在发音词典导出的电话序列上应用BPE算法,将电话视为子词单元,提取基于电话的BPE。
- 使用基于电话的BPE目标训练声学模型,采用混合CTC/注意力损失,保持端到端学习,无需上下文相关电话建模。
- 构建基于前缀树的多级语言模型,通过浅层融合在束搜索过程中整合子词级和词级语言模型得分。
- 实现一种贪婪且确定性的单词发音分解方法,将其分解为电话BPE序列,以高效构建前缀树用于解码。
- 设计一种单次遍历的联合束搜索解码器,通过加权组合动态融合来自基于电话和基于字符的BPE系统的假设。
- 在推理过程中利用发音词典查找,将解码后的电话BPE序列转换回单词,避免同音词带来的歧义。
实验结果
研究问题
- RQ1基于电话的子词单元(如BPE)是否能在端到端语音识别中优于基于字符的子词单元?
- RQ2如何有效结合子词级和词级语言建模,以提升基于电话的BPE解码性能?
- RQ3一次遍历的联合束搜索解码器能否高效融合基于电话和基于字符的BPE系统,从而提升识别准确率?
- RQ4使用基于电话的BPE是否能在避免语音词典训练或HMM/GMM组件的同时,保持端到端系统的简洁性?
- RQ5在Switchboard和Fisher等标准基准上,基于电话和基于字符的BPE系统联合解码能带来多大的性能提升?
主要发现
- 基于电话的BPE系统在Switchboard/CALLHome测试集上达到6.8%/14.4% WER,优于基于字符的BPE系统。
- 与基于电话和基于字符的BPE系统联合解码后,Switchboard上的WER降低至6.3%/13.3%,创下该设置下的新最先进记录。
- 在额外使用Fisher语料库数据后,联合解码系统在Switchboard部分达到4.9% WER,甚至超越了大型集成模型的先前结果。
- 当$k=75$时,基于电话的BPE系统与基于字符的系统表现相当,但在较小的$k$值下显著优于后者,表明其泛化能力更强。
- 单次遍历的联合束搜索解码器高效融合了两种系统,实现了稳定提升,且无需迭代解码或复杂重排序。
- 该方法通过仅依赖发音词典,避免了语音问题集、状态绑定或HMM/GMM训练,从而保持了端到端系统的简洁性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。