[论文解读] Resource aware design of a deep convolutional-recurrent neural network for speech recognition through audio-visual sensor fusion
本文提出了一种资源感知的音视频深度学习语音识别模型,通过轻量级CNN-LSTM架构结合注意力机制,融合声学与视觉(唇读)特征。在TCD-TIMIT数据集上,该模型在干净音频下的音素准确率达到75.70%,在0 dB信噪比下达到58.55%,较先前最先进方法提升超过14个百分点,同时在嵌入式部署中实现了计算效率与内存使用的良好平衡。
Today's Automatic Speech Recognition systems only rely on acoustic signals and often don't perform well under noisy conditions. Performing multi-modal speech recognition - processing acoustic speech signals and lip-reading video simultaneously - significantly enhances the performance of such systems, especially in noisy environments. This work presents the design of such an audio-visual system for Automated Speech Recognition, taking memory and computation requirements into account. First, a Long-Short-Term-Memory neural network for acoustic speech recognition is designed. Second, Convolutional Neural Networks are used to model lip-reading features. These are combined with an LSTM network to model temporal dependencies and perform automatic lip-reading on video. Finally, acoustic-speech and visual lip-reading networks are combined to process acoustic and visual features simultaneously. An attention mechanism ensures performance of the model in noisy environments. This system is evaluated on the TCD-TIMIT 'lipspeaker' dataset for audio-visual phoneme recognition with clean audio and with additive white noise at an SNR of 0dB. It achieves 75.70% and 58.55% phoneme accuracy respectively, over 14 percentage points better than the state-of-the-art for all noise levels.
研究动机与目标
- 设计一种低资源、高性能的音视频语音识别系统,适用于嵌入式部署。
- 通过深度学习融合声学与视觉模态,提升在噪声环境下的鲁棒性。
- 在所有组件中优化模型性能、FLOPS与内存使用之间的权衡。
- 评估注意力机制在不同噪声水平下动态加权音视频特征的影响。
- 在TCD-TIMIT数据集的“唇读”子集上建立音视频音素识别的新最先进水平。
提出的方法
- 在TCD-TIMIT数据集上使用交叉熵损失和Adam优化方法,训练双向LSTM网络以实现仅声学的语音识别。
- 采用3D-CNN-LSTM架构从视频帧中提取时空特征,用于唇读任务,性能在音位与音位群识别上进行评估。
- 声学与视觉网络分别独立预训练后,通过共享注意力机制整合为单一音视频模型。
- 一个包含三个512个神经元全连接层的注意力网络,根据输入质量动态分配声学与视觉特征的权重,提升噪声环境下的鲁棒性。
- 使用学习率衰减策略进行端到端微调,训练在连续5个周期内验证损失无改善时停止。
- 在整个过程中优先考虑资源效率:在每个阶段测量并最小化FLOPS与模型大小,最终系统仅需30×10⁹ FLOPS与137.4 MB内存。
实验结果
研究问题
- RQ1如何设计一种深度音视频自动语音识别系统,以最小化计算与内存开销,同时保持高性能?
- RQ2声学与视觉神经网络组件在性能与资源使用之间应如何实现最优权衡?
- RQ3与固定权重融合相比,基于注意力的特征融合在噪声音频条件下如何提升识别准确率?
- RQ4在干净与噪声环境中,音视频融合系统相较于单模态系统在多大程度上表现更优?
- RQ5结合CNN-LSTM视觉建模与双向LSTM声学建模,并引入注意力机制,能带来多大的性能提升?
主要发现
- 采用注意力机制的音视频模型在干净TCD-TIMIT音频上的音素准确率达到75.70%,较先前最先进方法(59.09%)提升16.6个百分点。
- 在0 dB信噪比下,模型达到58.55%的音素准确率,较先前最先进方法(44.03%)提升14.5个百分点。
- 仅视觉网络在0 dB信噪比下准确率为51.02%,但在无注意力机制融合时噪声下性能显著下降,凸显自适应融合的必要性。
- 注意力机制实现了对声学与视觉特征的动态加权,显著提升了鲁棒性:在所有噪声水平下,性能均显著优于固定权重融合或单模态系统。
- 最终系统仅需30×10⁹ FLOPS与137.4 MB模型大小,实现了面向嵌入式部署的性能与资源效率之间的良好平衡。
- CNN-LSTM视觉网络在音位群识别准确率上比仅CNN架构高出11.15个百分点(68.46% vs. 56.31%),证实了时序建模的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。