Skip to main content
QUICK REVIEW

[论文解读] Multi-task Learning Of Deep Neural Networks For Audio Visual Automatic Speech Recognition

Abhinav Thanda, Shankar M. Venkatesan|arXiv (Cornell University)|Jan 10, 2017
Speech and Audio Processing参考文献 19被引用 15
一句话总结

该论文提出了一种用于音视频自动语音识别(AV-ASR)的多任务学习(MTL)框架,采用深度神经网络实现。其中,主任务将融合的音视频特征映射到音素标签,辅助任务则将视觉特征映射到来自独立GMM/HMM的视觉标签。MTL模型在-3 dB信噪比(SNR)条件下,相较于基线DNN-HMM模型,相对词错误率(WER)最高提升7.23%,尤其在高噪声环境下显著增强了鲁棒性。

ABSTRACT

Multi-task learning (MTL) involves the simultaneous training of two or more related tasks over shared representations. In this work, we apply MTL to audio-visual automatic speech recognition(AV-ASR). Our primary task is to learn a mapping between audio-visual fused features and frame labels obtained from acoustic GMM/HMM model. This is combined with an auxiliary task which maps visual features to frame labels obtained from a separate visual GMM/HMM model. The MTL model is tested at various levels of babble noise and the results are compared with a base-line hybrid DNN-HMM AV-ASR model. Our results indicate that MTL is especially useful at higher level of noise. Compared to base-line, upto 7\% relative improvement in WER is reported at -3 SNR dB

研究动机与目标

  • 通过利用共享表示的多任务学习(MTL)提升音视频ASR中的噪声鲁棒性。
  • 探究在音视频融合与独立视觉识别任务上同时训练DNN是否能增强泛化能力。
  • 评估MTL在传统DNN-HMM系统性能下降的低信噪比(SNR)条件下的有效性。
  • 在不同噪声水平下,将MTL-DNN性能与标准单任务学习(STL)DNN-HMM基线进行比较。
  • 探索辅助任务权重(λ)对模型性能与泛化能力的影响。

提出的方法

  • 主任务通过训练DNN将音视频融合特征映射到基于音频数据GMM/HMM对齐生成的帧级标签。
  • 辅助任务通过独立训练DNN将视觉特征(来自唇部区域的64×64 DCT特征)映射到基于仅视觉数据训练的GMM/HMM生成的帧级标签。
  • 两个任务采用共享DNN架构,损失函数组合形式为:$ C_{mtl} = C_{main} + \lambda C_{aux} $,其中$ \lambda $控制辅助任务的贡献程度。
  • 特征经过归一化(均值与方差),音视频特征通过拼接方式融合后输入共享DNN。
  • 训练采用小批量随机梯度下降,学习率根据验证准确率提升进行衰减。
  • 测试时仅使用主任务输出;在消融实验中抑制视觉模态以隔离模态影响。

实验结果

研究问题

  • RQ1在噪声环境下,使用仅视觉的辅助任务进行多任务学习是否能改善音视频ASR中的词错误率(WER)?
  • RQ2辅助任务的相对权重(λ)如何影响主音视频识别任务的性能?
  • RQ3与单任务学习(STL)相比,MTL是否能减少过拟合并提升低SNR环境下的泛化能力?
  • RQ4当仅使用视觉特征(即唇读)时,MTL性能与STL相比如何?
  • RQ5特征融合层级(低层级与中层级)对MTL在AV-ASR中有效性的影响是什么?

主要发现

  • 在-3 dB SNR条件下,λ=0.3的MTL-DNN相较于STL-DNN基线实现7.23%的相对WER提升(从27.1%降至25.14%)。
  • 在0 dB SNR条件下,λ=0.3的MTL-DNN相较基线实现7.4%的相对WER降低,表明其在噪声环境下的显著鲁棒性优势。
  • 在纯唇读(音频被抑制)条件下,λ=0.3的MTL-DNN相较STL-DNN实现3%的相对WER提升,表明其在视觉特征学习方面更优。
  • 当λ=0.1时,在-3 dB SNR条件下仅实现1.6%的相对提升,表明正则化强度不足。
  • 在纯净语音条件下,STL-DNN表现略优于MTL-DNN,表明在低噪声环境下辅助任务可能存在过拟合或干扰。
  • 当λ超过0.3后性能下降,表明在正则化与主任务优化之间存在权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。