[论文解读] A Conformer Based Acoustic Model for Robust Automatic Speech Recognition
本论文提出了一种基于Conformer的声学模型,用卷积增强的注意力编码器替代了当前最先进(SOTA)WRBN系统中的循环BLSTM组件,在CHiME-4真实测试集上实现了6.25%的WER,相较之前SOTA相对提升8.4%,同时通过话语级归一化和迭代说话人自适应,将模型大小减少了18.3%,训练时间减少了79.6%。
This study addresses robust automatic speech recognition (ASR) by introducing a Conformer-based acoustic model. The proposed model builds on the wide residual bi-directional long short-term memory network (WRBN) with utterance-wise dropout and iterative speaker adaptation, but employs a Conformer encoder instead of the recurrent network. The Conformer encoder uses a convolution-augmented attention mechanism for acoustic modeling. The proposed system is evaluated on the monaural ASR task of the CHiME-4 corpus. Coupled with utterance-wise normalization and speaker adaptation, our model achieves $6.25\%$ word error rate, which outperforms WRBN by $8.4\%$ relatively. In addition, the proposed Conformer-based model is $18.3\%$ smaller in model size and reduces total training time by $79.6\%$.
研究动机与目标
- 通过基于Conformer的声学模型提升在噪声环境和远场语音识别中的鲁棒性。
- 解决循环BLSTM模型在训练时间和模型大小方面的低效问题。
- 集成话语级归一化和迭代说话人自适应,以增强鲁棒性和可靠性。
- 在CHiME-4单声道ASR基准上评估所提模型,该基准是真实世界噪声语音识别的标准测试平台。
- 证明基于Conformer的模型可在不使用域外预训练数据的情况下,超越端到端(E2E)和混合系统在CHiME-4上的表现。
提出的方法
- 将先前SOTA系统中的宽残差BLSTM网络(WRBN)替换为结合卷积与自注意力机制的Conformer编码器,以提升序列建模能力。
- 在所有归一化层中采用话语级层归一化(LN),以防止话语间干扰,提升每句话的可靠性。
- 将迭代说话人自适应作为后处理步骤,进一步优化未见说话人的识别性能。
- 在Conformer的前馈网络(FFN)模块中采用预归一化架构、Swish激活函数和残差连接。
- 在多头自注意力(MHSA)模块的输入中应用带缩放的绝对位置编码,遵循原始Transformer设计。
- 在单张V100 GPU上采用5轮训练和11轮微调的训练策略,初始WRCNN前端使用批量归一化和ELU激活函数。
实验结果
研究问题
- RQ1基于Conformer的声学模型是否能在CHiME-4单声道ASR任务中,以词错误率(WER)衡量,超越先前SOTA的WRBN系统?
- RQ2用Conformer编码器替代循环BLSTM是否能在保持或提升性能的同时,减少训练时间和模型大小?
- RQ3话语级归一化在噪声条件下对端到端ASR的鲁棒性和可靠性提升程度如何?
- RQ4与现有系统相比,所提模型在不同噪声环境(如:公交车、咖啡馆、行人、街道)下的表现如何?
- RQ5迭代说话人自适应是否能在不增加额外数据或重新训练模型的情况下,进一步提升识别准确率?
主要发现
- 所提的基于Conformer的模型在CHiME-4真实测试集上实现了6.25%的WER,相较先前SOTA系统(Wang et al., 2019)相对提升8.4%。
- 尽管仅使用2个Conformer编码器块,该模型相较先前SOTA,总训练时间减少了79.6%,模型大小减少了18.3%。
- 该系统优于ESPnet的E2E Conformer基线和基于Kaldi的混合基线,表明架构改进可在无需自监督预训练的情况下超越E2E系统。
- 在公交车、咖啡馆和行人环境中的表现更优,其WER在模拟和真实数据上均低于先前SOTA系统。
- 在街道环境中的表现略逊于先前SOTA系统,表明可能存在特定领域限制或数据稀缺效应。
- 使用超过2个Conformer块的实验未带来性能提升,表明CHiME-4数据集可能不足以有效训练更深的模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。