[论文解读] Auxiliary Multimodal LSTM for Audio-visual Speech Recognition and Lipreading
该论文提出了一种辅助多模态LSTM(am-LSTM)模型,这是一种端到端的深度学习模型,通过LSTM实现平衡的时间与模态融合,结合辅助连接进行正则化,从而联合融合音频和视觉特征。该模型在音频-视觉语音识别(AVSR)和唇读任务中达到最先进性能,在AVLetters2数据集上达到89.11%的准确率,在跨模态唇读任务中达到88.83%。
The Aduio-visual Speech Recognition (AVSR) which employs both the video and audio information to do Automatic Speech Recognition (ASR) is one of the application of multimodal leaning making ASR system more robust and accuracy. The traditional models usually treated AVSR as inference or projection but strict prior limits its ability. As the revival of deep learning, Deep Neural Networks (DNN) becomes an important toolkit in many traditional classification tasks including ASR, image classification, natural language processing. Some DNN models were used in AVSR like Multimodal Deep Autoencoders (MDAEs), Multimodal Deep Belief Network (MDBN) and Multimodal Deep Boltzmann Machine (MDBM) that actually work better than traditional methods. However, such DNN models have several shortcomings: (1) They don't balance the modal fusion and temporal fusion, or even haven't temporal fusion; (2)The architecture of these models isn't end-to-end, the training and testing getting cumbersome. We propose a DNN model, Auxiliary Multimodal LSTM (am-LSTM), to overcome such weakness. The am-LSTM could be trained and tested once, moreover easy to train and preventing overfitting automatically. The extensibility and flexibility are also take into consideration. The experiments show that am-LSTM is much better than traditional methods and other DNN models in three datasets.
研究动机与目标
- 为解决传统及深度多模态模型在音频-视觉语音识别(AVSR)中的局限性,特别是时间与模态融合不平衡的问题。
- 克服先前深度模型(如MDAEs和MDBNs)非端到端训练与测试流程带来的复杂性,从而阻碍优化。
- 通过集成辅助连接、Dropout和早停策略,提升多模态序列建模中的泛化能力与收敛速度。
- 通过联合表示学习,实现在仅使用视频进行测试时的高效跨模态唇读——即在音频-视觉数据上训练,仅在视频上测试。
- 开发一种灵活、可扩展且可训练的架构,将模态与时间融合统一于单一、统一的训练过程中。
提出的方法
- am-LSTM模型使用两个并行LSTM分别处理音频和视觉特征,通过共享的投影头与识别头实现多模态融合。
- 受残差学习启发,采用辅助连接以稳定训练过程并防止过拟合,损失函数结合主损失与辅助损失。
- 损失函数定义为:$\text{Loss} = \frac{1}{n}\sum_{i=1}^{n} \left[ \max\{0, (1 - x_{\text{main}} + y)^2\} + 0.2\max\{0, (1 - x_{\text{aux}}^{v} + y)^2\} + 0.2\max\{0, (1 - x_{\text{aux}}^{a} + y)^2\} \right] $,其中$x_{\text{main}}$、$x_{\text{aux}}^{v}$和$x_{\text{aux}}^{a}$分别为视频与音频的主输出与辅助输出。
- 视觉特征通过在Viola-Jones算法裁剪的嘴部区域上使用预训练的VGG-16网络提取,随后通过PCA降维至100维。
- 音频特征从梅尔频谱图中提取,采用20ms汉明窗、10ms重叠,并通过PCA降维至50维。
- 通过将音频与视频特征分别向前或向后偏移±10帧,实施数据增强以提升时间泛化能力。
实验结果
研究问题
- RQ1端到端深度学习模型能否在音频-视觉语音识别中有效平衡时间与模态融合?
- RQ2辅助连接与正则化策略的整合是否能提升多模态RNN的收敛性与泛化能力?
- RQ3在仅使用视频进行测试时,联合训练音频与视频在多大程度上能提升唇读性能?
- RQ4与现有深度多模态模型(如MDAEs、MDBNs和RTMRBM)相比,所提出的am-LSTM在准确率与鲁棒性方面表现如何?
- RQ5am-LSTM架构是否能通过单一统一的训练过程,有效应用于AVSR与跨模态唇读任务?
主要发现
- 在AVLetters2数据集上,am-LSTM达到89.11%的准确率,显著优于先前模型如RTMRBM(74.77%)和MDAE(67.89%)。
- 在AVDigits数据集上,am-LSTM达到85.23%的准确率,超过RTMRBM(71.77%)和MDBN(55.00%)。
- 在跨模态唇读任务中,am-LSTM达到88.83%的准确率,远超次佳模型RTMRBM(66.21%)。
- 仅在视频上测试时,该模型在唇读任务中的表现证明了联合音视频学习对视觉仅推理的有效性。
- 辅助连接、Dropout与早停策略的使用促进了更快收敛并减少了过拟合,实现了单一训练与测试流程。
- 该模型架构支持端到端训练与推理,无需分离的训练阶段,显著提升了实际可用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。