Skip to main content
QUICK REVIEW

[论文解读] Multimodal Integration for Large-Vocabulary Audio-Visual Speech Recognition

Wentao Yu, Steffen Zeiler|arXiv (Cornell University)|Jul 28, 2020
Speech Recognition and Synthesis参考文献 22被引用 5
一句话总结

该论文提出了一种判别式流融合网络,通过使用时变可靠性指标动态融合音频与视觉语音特征,以提升大规模词汇量语音-视觉语音识别性能。通过使用多种可靠性度量进行融合网络训练,并采用混合损失函数(MMI + MSE)进行优化,该方法在LRS2数据集上相较于最佳纯音频模型实现了24.97%的相对WER降低,在噪声环境下优于早期融合与端到端基线模型。

ABSTRACT

For many small- and medium-vocabulary tasks, audio-visual speech recognition can significantly improve the recognition rates compared to audio-only systems. However, there is still an ongoing debate regarding the best combination strategy for multi-modal information, which should allow for the translation of these gains to large-vocabulary recognition. While an integration at the level of state-posterior probabilities, using dynamic stream weighting, is almost universally helpful for small-vocabulary systems, in large-vocabulary speech recognition, the recognition accuracy remains difficult to improve. In the following, we specifically consider the large-vocabulary task of the LRS2 database, and we investigate a broad range of integration strategies, comparing early integration and end-to-end learning with many versions of hybrid recognition and dynamic stream weighting. One aspect, which is shown to provide much benefit here, is the use of dynamic stream reliability indicators, which allow for hybrid architectures to strongly profit from the inclusion of visual information whenever the audio channel is distorted even slightly.

研究动机与目标

  • 为解决利用多模态融合提升大规模词汇量语音-视觉语音识别(LVCSR)的挑战。
  • 探究基于可靠性指标的动态流加权是否能显著提升识别准确率,超越纯音频或端到端模型。
  • 评估不同可靠性度量与损失函数在优化混合语音-视觉ASR系统多模态融合中的有效性。
  • 从鲁棒性与性能角度,对比混合融合、早期融合与端到端学习在噪声语音-视觉数据上的表现。
  • 识别在音频轻微退化时仍能有效利用视觉模态的最优融合策略。

提出的方法

  • 训练一个流融合网络,基于可靠性指标 σₜᴬ, σₜᵛᴬ, σₜᵛˢ,预测音频与两种视觉模态(外观与形态)的动态流权重 λₜⁱ。
  • 融合通过加权求和对数后验概率实现:log p̃(s|oₜ) = Σᵢ λₜⁱ · log p(s|oₜⁱ),其中权重由融合网络生成。
  • 可靠性指标包括熵、频谱平坦度、信噪比(SNR)以及来自DNN的后验方差。
  • 融合网络使用交叉熵(CE)与均方误差(MSE)损失函数进行训练,采用两阶段训练:先使用MMI进行预训练,再使用MSE进行微调。
  • 使用三种模型:纯音频(AO)、视觉外观(VA)与视觉形态(VS),并以早期融合(EI)与最优权重(OW)作为基线。
  • 在LRS2数据集上,通过在不同SNR条件下进行实验,评估鲁棒性与性能增益。

实验结果

研究问题

  • RQ1与固定或端到端融合相比,使用学习得到的可靠性指标进行动态流加权,是否能显著提升大规模词汇量语音-视觉ASR性能?
  • RQ2在多种噪声条件下,哪组可靠性指标能实现最有效的融合?
  • RQ3在LVCSR中,判别式流融合的混合识别是否优于早期融合与端到端模型?
  • RQ4损失函数的选择(如CE、MSE、MMI)如何影响流融合网络的性能?
  • RQ5当音频轻微退化时,视觉信息能在多大程度上提升识别性能?该效果能否通过动态加权捕捉?

主要发现

  • 所提出的混合语音-视觉模型(采用学习到的流融合,MM)在LRS2数据集上实现29.89%的WER,相较于最佳纯音频模型(39.84% WER)实现了24.97%的相对WER降低。
  • 使用所有可靠性指标(MB, SB, AB, VB, All)的组合性能最佳,优于单一可靠性指标集合。
  • MM损失(MMI预训练 + MSE微调)在低SNR条件(≤3 dB)下表现最佳,优于仅使用MSE或CE的情况。
  • 采用动态流融合的混合模型显著优于端到端AV Align模型,后者在LRS2上未表现出对纯音频模型的性能提升。
  • 最优权重(OW)模型实现23.23% WER,表明相较于最佳学习模型(29.89% WER)仍有较大改进空间,凸显与最优融合之间的差距。
  • 即使在清洁条件下,混合模型相比纯音频基线仍降低了9.95个百分点的WER,表明在所有SNR水平下均具有一致的性能增益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。