[论文解读] Multiresolution and Multimodal Speech Recognition with Transformers
该论文提出了一种基于Transformer的音视频语音识别系统,通过跨模态注意力机制融合视觉特征以提升ASR性能,并采用多分辨率训练方案联合优化字符级与子词级转录。在How2数据集上的实验结果表明,引入视觉输入后相对WER提升了3.76%,而通过多分辨率训练实现相对WER降低18.3%,且收敛速度比单分辨率模型快50%。
This paper presents an audio visual automatic speech recognition (AV-ASR) system using a Transformer-based architecture. We particularly focus on the scene context provided by the visual information, to ground the ASR. We extract representations for audio features in the encoder layers of the transformer and fuse video features using an additional crossmodal multihead attention layer. Additionally, we incorporate a multitask training criterion for multiresolution ASR, where we train the model to generate both character and subword level transcriptions. Experimental results on the How2 dataset, indicate that multiresolution training can speed up convergence by around 50% and relatively improves word error rate (WER) performance by upto 18% over subword prediction models. Further, incorporating visual information improves performance with relative gains upto 3.76% over audio only models. Our results are comparable to state-of-the-art Listen, Attend and Spell-based architectures.
研究动机与目标
- 开发一种基于Transformer的端到端音视频ASR系统,利用视觉上下文信息提升语音识别性能。
- 探究在真实世界非受限环境下,利用视觉特征进行多模态定位对音频输入上下文建模的有效性。
- 评估一种联合优化字符级与子词级转录的多分辨率训练方案,以正则化模型并提升泛化能力。
- 评估当视觉输入缺失或退化时,AV-ASR模型的鲁棒性。
- 与最先进的Listen, Attend and Spell架构在WER与收敛速度方面进行对比。
提出的方法
- 模型使用Transformer编码器处理音频特征,并通过跨模态缩放点积注意力层将视觉特征映射到音频特征空间。
- 视觉与音频特征通过标量加法融合方式结合,再输入解码器进行序列生成。
- 采用多任务损失函数,联合优化子词级与字符级交叉熵损失,以正则化模型并提升泛化能力。
- 通过帧堆叠对输入音频序列进行下采样,以减少序列长度,并缓解自注意力机制的二次方内存复杂度。
- 系统在How2数据集上端到端训练,同时使用音频与视频输入,消融实验评估了视觉输入缺失时的性能表现。
- 视觉特征表示通过基于ResNeXt的主干网络提取,推理时通过门控机制或用噪声替换视觉输入以测试模型鲁棒性。
实验结果
研究问题
- RQ1在真实世界非受限环境中,通过多模态定位,视觉特征能否提升ASR性能?
- RQ2通过多分辨率损失联合训练字符级与子词级转录,是否能带来更好的泛化能力与更快的收敛速度?
- RQ3当视觉输入缺失或退化时,模型性能如何?是否能在不重新训练的情况下保持鲁棒性?
- RQ4所提出的跨模态注意力融合机制与现有音视频Transformer架构相比,在ASR任务中表现如何?
- RQ5与单分辨率子词或字符级模型相比,多分辨率训练在降低WER方面有多大改善?
主要发现
- 通过跨模态注意力机制引入视觉特征,在How2数据集上相较纯音频模型实现了3.76%的相对WER提升。
- 多分辨率训练方案相较仅使用子词的模型,实现了18.3%的相对WER降低,表明其具有显著的正则化效果。
- 采用多分辨率监督训练的模型,收敛速度比单分辨率模型快约50%。
- 帧堆叠用于输入下采样优于分块处理,因其能更好地保留长距离上下文信息。
- 当视觉输入缺失时,AV-ASR模型的性能相较纯音频模型相对下降约6%,但当视觉特征被替换为标准差σ=0.2的高斯噪声时,性能表现最佳。
- 尽管未依赖显式的音素信息,该方法在性能上可与最先进的Listen, Attend and Spell架构相媲美。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。