[论文解读] Advancing CTC-CRF Based End-to-End Speech Recognition with Wordpieces and Conformers
该论文通过整合子词模型单元和Conformer神经网络,推进了基于CTC-CRF的端到端语音识别技术,在Switchboard、Librispeech和CommonVoice German数据集上实现了最先进性能。结果表明,与BLSTM和VGG-BLSTM相比,Conformer显著提升了识别准确率;而在德语等音形对应关系较高的语言中,基于子词的系统性能与基于音素的系统相当,但在英语上略逊一筹。
Automatic speech recognition systems have been largely improved in the past few decades and current systems are mainly hybrid-based and end-to-end-based. The recently proposed CTC-CRF framework inherits the data-efficiency of the hybrid approach and the simplicity of the end-to-end approach. In this paper, we further advance CTC-CRF based ASR technique with explorations on modeling units and neural architectures. Specifically, we investigate techniques to enable the recently developed wordpiece modeling units and Conformer neural networks to be succesfully applied in CTC-CRFs. Experiments are conducted on two English datasets (Switchboard, Librispeech) and a German dataset from CommonVoice. Experimental results suggest that (i) Conformer can improve the recognition performance significantly; (ii) Wordpiece-based systems perform slightly worse compared with phone-based systems for the target language with a low degree of grapheme-phoneme correspondence (e.g. English), while the two systems can perform equally strong when such degree of correspondence is high for the target language (e.g. German).
研究动机与目标
- 研究将子词建模单元集成到基于CTC-CRF的自动语音识别系统中的可行性。
- 评估Conformer神经网络在CTC-CRF框架中的有效性,以提升自动语音识别性能。
- 分析模型规模、数据增强和输入特征对CTC-CRF在Conformer架构下性能的影响。
- 比较在音形对应关系各异的语言中,基于子词和基于音素的系统表现。
- 证明CTC-CRF框架在不依赖发音词典的情况下,也能通过现代神经网络架构和建模单元实现最先进性能。
提出的方法
- 在CTC-CRF框架中采用Conformer神经网络作为声学模型,取代旧有的BLSTM和VGG-BLSTM架构。
- 使用子词分词(如BPE)作为建模单元,替代传统的音素级建模单元。
- 应用基于比例的SpecAug进行数据增强,提升模型鲁棒性与泛化能力。
- 采用三通道120维Fbank特征(含一阶和二阶差分)作为输入,增强特征表示能力。
- 使用学习率调度器训练模型,并针对CTC-CRF设置下的Conformer训练优化超参数。
- 通过消融实验分析模型规模、输入特征和数据增强对性能提升的贡献。
实验结果
研究问题
- RQ1与BLSTM和VGG-BLSTM相比,Conformer神经网络是否能提升基于CTC-CRF的语音识别准确率?
- RQ2在音形对应关系低和高的语言中,基于子词的建模与基于音素的建模在CTC-CRF系统中的表现有何差异?
- RQ3输入特征表示和数据增强对Conformer架构下CTC-CRF性能有何影响?
- RQ4增加Conformer模型规模是否能在CTC-CRF语音识别中带来持续的性能提升?
- RQ5CTC-CRF框架是否能有效利用如Conformer等现代神经网络架构,而无需依赖发音词典?
主要发现
- 基于Conformer的CTC-CRF模型相比BLSTM实现了5.3%的相对WER降低,且参数量更少。
- Conformer-M+模型(5100万参数)在Switchboard Eval2000上达到12.1%的WER,优于BLSTM和VGG-BLSTM。
- 在英语数据集(Switchboard和Librispeech)上,基于子词的系统性能略低于基于音素的系统,绝对WER差距为0.4–0.5%。
- 在德语CommonVoice数据集上,基于子词和基于音素的系统性能相当,表明高音形对应关系使子词建模得以成功。
- 采用基于比例的SpecAug进行数据增强,使Switchboard数据集WER降低7.1%,CommonVoice数据集降低9.3%,优于固定帧数的SpecAug。
- 使用80维Fbank特征而非40维特征,使各测试集WER降低0.3–0.4%,表明高维特征具有优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。