[论文解读] Attention-based Wav2Text with Feature Transfer Learning
该论文提出了首个端到端的基于注意力机制的编码器-解码器模型,即基于注意力的Wav2Text,可直接将原始语音波形转录为文本,无需使用频谱特征。通过采用特征迁移学习——即使用在梅尔频谱图特征上预训练的模型的权重初始化编码器——该模型实现了更优的收敛性和性能,优于原始波形基线模型以及使用标准滤波器组特征训练的模型,在WSJ-SI284数据集上达到了6.54%的CER。
Conventional automatic speech recognition (ASR) typically performs multi-level pattern recognition tasks that map the acoustic speech waveform into a hierarchy of speech units. But, it is widely known that information loss in the earlier stage can propagate through the later stages. After the resurgence of deep learning, interest has emerged in the possibility of developing a purely end-to-end ASR system from the raw waveform to the transcription without any predefined alignments and hand-engineered models. However, the successful attempts in end-to-end architecture still used spectral-based features, while the successful attempts in using raw waveform were still based on the hybrid deep neural network - Hidden Markov model (DNN-HMM) framework. In this paper, we construct the first end-to-end attention-based encoder-decoder model to process directly from raw speech waveform to the text transcription. We called the model as "Attention-based Wav2Text". To assist the training process of the end-to-end model, we propose to utilize a feature transfer learning. Experimental results also reveal that the proposed Attention-based Wav2Text model directly with raw waveform could achieve a better result in comparison with the attentional encoder-decoder model trained on standard front-end filterbank features.
研究动机与目标
- 开发一种端到端的自动语音识别系统,可直接将原始语音波形映射为文本转录,无需手工设计的特征或混合框架。
- 解决在高维、低层次的原始波形上训练深层注意力机制编码器-解码器模型的挑战,此类训练常因输入维度高而难以收敛。
- 探究从基于频谱的模型迁移学习是否能提升原始波形ASR训练的稳定性和性能。
- 使用WSJ-SI84和WSJ-SI284等标准ASR数据集,将所提出的基于注意力的Wav2Text模型与现有基准进行评估。
提出的方法
- 提出一种端到端的基于注意力机制的编码器-解码器架构,可直接处理原始语音波形,替代传统的特征提取器(如MFCC或滤波器组)。
- 引入一种特征迁移学习策略:先在梅尔频谱图特征上预训练卷积编码器,以学习有意义的表示,再在原始波形上进行微调。
- 采用混合编码器结构,结合卷积层、NIN(网络中网络)模块和双向LSTM,以建模原始音频中的长程依赖关系。
- 使用注意力机制,根据当前解码器隐藏状态和编码器输出计算上下文向量,实现输入与输出序列之间的动态对齐。
- 通过将前一个上下文向量与当前输入嵌入拼接,引入输入反馈,以改善自回归生成。
- 使用交叉熵损失函数,结合真实转录文本,端到端训练完整模型,并利用迁移的编码器权重以稳定优化过程。
实验结果
研究问题
- RQ1当直接在原始语音波形上训练而无需频谱特征时,端到端的基于注意力机制的编码器-解码器模型是否能实现具有竞争力的ASR性能?
- RQ2从在梅尔频谱图上预训练的模型进行迁移学习,是否能改善端到端原始波形ASR系统的收敛性和性能?
- RQ3所提出的基于注意力的Wav2Text模型与基于滤波器组或MFCC特征训练的标准模型相比,性能如何?
- RQ4不同的迁移学习方案(例如,来自fbank、MFCC或多目标)对最终ASR准确率有何影响?
主要发现
- 在未使用迁移学习的情况下,所提出的基于注意力的Wav2Text模型无法收敛,表明在原始波形上从随机权重初始化时存在训练不稳定性。
- 通过迁移学习,该模型在WSJ-SI284数据集上实现了6.54%的字符错误率(CER),优于在滤波器组特征上训练的基线注意力模型(7.69% CER)。
- 当从多目标预训练方案迁移时,性能最佳,表明多任务表示学习能增强特征迁移的有效性。
- 从MFCC特征迁移的模型实现了6.58%的CER,略优于基于fbank的迁移(6.78% CER),表明基于MFCC的预训练对原始波形微调更具优势。
- 结果表明,特征迁移学习对于在原始波形上训练稳定且准确的端到端ASR系统至关重要,可实现收敛,并使性能达到或超过基于标准频谱特征的模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。