[论文解读] Multi-task Learning Of Deep Neural Networks For Audio Visual Automatic Speech Recognition
该论文提出了一种用于音视频自动语音识别(AV-ASR)的多任务学习(MTL)框架,采用深度神经网络实现。其中,主任务将融合的音视频特征映射到音素标签,辅助任务则将视觉特征映射到来自独立GMM/HMM的视觉标签。MTL模型在-3 dB信噪比(SNR)条件下,相较于基线DNN-HMM模型,相对词错误率(WER)最高提升7.23%,尤其在高噪声环境下显著增强了鲁棒性。
Multi-task learning (MTL) involves the simultaneous training of two or more related tasks over shared representations. In this work, we apply MTL to audio-visual automatic speech recognition(AV-ASR). Our primary task is to learn a mapping between audio-visual fused features and frame labels obtained from acoustic GMM/HMM model. This is combined with an auxiliary task which maps visual features to frame labels obtained from a separate visual GMM/HMM model. The MTL model is tested at various levels of babble noise and the results are compared with a base-line hybrid DNN-HMM AV-ASR model. Our results indicate that MTL is especially useful at higher level of noise. Compared to base-line, upto 7\% relative improvement in WER is reported at -3 SNR dB
研究动机与目标
- 通过利用共享表示的多任务学习(MTL)提升音视频ASR中的噪声鲁棒性。
- 探究在音视频融合与独立视觉识别任务上同时训练DNN是否能增强泛化能力。
- 评估MTL在传统DNN-HMM系统性能下降的低信噪比(SNR)条件下的有效性。
- 在不同噪声水平下,将MTL-DNN性能与标准单任务学习(STL)DNN-HMM基线进行比较。
- 探索辅助任务权重(λ)对模型性能与泛化能力的影响。
提出的方法
- 主任务通过训练DNN将音视频融合特征映射到基于音频数据GMM/HMM对齐生成的帧级标签。
- 辅助任务通过独立训练DNN将视觉特征(来自唇部区域的64×64 DCT特征)映射到基于仅视觉数据训练的GMM/HMM生成的帧级标签。
- 两个任务采用共享DNN架构,损失函数组合形式为:$ C_{mtl} = C_{main} + \lambda C_{aux} $,其中$ \lambda $控制辅助任务的贡献程度。
- 特征经过归一化(均值与方差),音视频特征通过拼接方式融合后输入共享DNN。
- 训练采用小批量随机梯度下降,学习率根据验证准确率提升进行衰减。
- 测试时仅使用主任务输出;在消融实验中抑制视觉模态以隔离模态影响。
实验结果
研究问题
- RQ1在噪声环境下,使用仅视觉的辅助任务进行多任务学习是否能改善音视频ASR中的词错误率(WER)?
- RQ2辅助任务的相对权重(λ)如何影响主音视频识别任务的性能?
- RQ3与单任务学习(STL)相比,MTL是否能减少过拟合并提升低SNR环境下的泛化能力?
- RQ4当仅使用视觉特征(即唇读)时,MTL性能与STL相比如何?
- RQ5特征融合层级(低层级与中层级)对MTL在AV-ASR中有效性的影响是什么?
主要发现
- 在-3 dB SNR条件下,λ=0.3的MTL-DNN相较于STL-DNN基线实现7.23%的相对WER提升(从27.1%降至25.14%)。
- 在0 dB SNR条件下,λ=0.3的MTL-DNN相较基线实现7.4%的相对WER降低,表明其在噪声环境下的显著鲁棒性优势。
- 在纯唇读(音频被抑制)条件下,λ=0.3的MTL-DNN相较STL-DNN实现3%的相对WER提升,表明其在视觉特征学习方面更优。
- 当λ=0.1时,在-3 dB SNR条件下仅实现1.6%的相对提升,表明正则化强度不足。
- 在纯净语音条件下,STL-DNN表现略优于MTL-DNN,表明在低噪声环境下辅助任务可能存在过拟合或干扰。
- 当λ超过0.3后性能下降,表明在正则化与主任务优化之间存在权衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。