Skip to main content
QUICK REVIEW

[论文解读] Leveraging Modality-specific Representations for Audio-visual Speech Recognition via Reinforcement Learning

Chen Chen, Yu‐Chen Hu|arXiv (Cornell University)|Dec 10, 2022
Speech and Audio Processing被引用 4
一句话总结

该论文提出MSRL,一种基于强化学习的框架,通过动态整合模态无关与模态特定的视觉表征,提升在噪声环境下的音视频语音识别(AVSR)性能。通过使用与词错误率(WER)对齐的自定义奖励函数,MSRL在干净及多样化的噪声设置下(包括未见噪声类型)均优于最先进方法,展现出卓越的鲁棒性与泛化能力。

ABSTRACT

Audio-visual speech recognition (AVSR) has gained remarkable success for ameliorating the noise-robustness of speech recognition. Mainstream methods focus on fusing audio and visual inputs to obtain modality-invariant representations. However, such representations are prone to over-reliance on audio modality as it is much easier to recognize than video modality in clean conditions. As a result, the AVSR model underestimates the importance of visual stream in face of noise corruption. To this end, we leverage visual modality-specific representations to provide stable complementary information for the AVSR task. Specifically, we propose a reinforcement learning (RL) based framework called MSRL, where the agent dynamically harmonizes modality-invariant and modality-specific representations in the auto-regressive decoding process. We customize a reward function directly related to task-specific metrics (i.e., word error rate), which encourages the MSRL to effectively explore the optimal integration strategy. Experimental results on the LRS3 dataset show that the proposed method achieves state-of-the-art in both clean and various noisy conditions. Furthermore, we demonstrate the better generality of MSRL system than other baselines when test set contains unseen noises.

研究动机与目标

  • 解决现有AVSR模型对音频模态的过度依赖问题,尤其是在信噪比(SNR)较低时视觉模态变得至关重要的场景。
  • 克服固定融合策略的局限性,这些策略在真实场景中面对动态、非平稳噪声分布时无法有效适应。
  • 通过在自回归解码过程中有效利用噪声无关的视觉模态特定表征,提升模型泛化能力。
  • 开发一种灵活的集成机制,基于任务特定性能指标平衡模态无关与模态特定表征。
  • 证明强化学习在学习AVSR最优融合策略方面的有效性,特别是在低资源与未见噪声设置下。

提出的方法

  • 使用预训练视觉模型从唇部运动中提取与音频流无关的模态特定视觉表征。
  • 引入一个强化学习(RL)智能体,在自回归解码过程中动态选择模态无关或模态特定表征。
  • 设计基于词错误率(WER)的任务特定奖励函数,引导RL智能体学习最优集成策略。
  • 推理时使用束搜索生成多个假设,使RL智能体能够探索多样化的词级别集成策略。
  • 使用策略梯度方法端到端训练策略网络,使智能体学习根据噪声条件与上下文动态加权表征。
  • 将基于RL的融合机制集成到自回归ASR解码器中,实现在每个解码步骤的上下文感知、自适应融合。

实验结果

研究问题

  • RQ1当音频受噪声污染时,模态特定的视觉表征是否能提升AVSR性能,特别是在低信噪比(SNR)条件下?
  • RQ2在不同噪声分布下,如何有效学习模态无关与模态特定表征之间的动态融合策略?
  • RQ3与固定融合基线相比,使用与WER对齐的奖励函数的强化学习是否能在未见噪声类型上实现更好的泛化?
  • RQ4模态特定表征在低资源训练场景中能在多大程度上提升数据效率?
  • RQ5所提方法是否能在干净及多样化噪声条件(包括未见噪声类型)下均超越最先进AVSR模型?

主要发现

  • 在LRS3数据集的干净条件下,MSRL实现1.33%的WER,相较于最佳基线(AV-HuBERT)在正常资源模式下相对降低5%。
  • 在低资源模式下,MSRL将WER降低至2.82%,相较AV-HuBERT相对提升14.5%,展现出卓越的数据效率。
  • 在未见噪声类型(咖啡馆、会议、河流、餐厅)下,MSRL在低资源模式下相较AV-HuBERT相对提升12.5%至27.1%,表现出强大的泛化能力。
  • 在噪声条件下,MSRL在低资源模式下相较AV-HuBERT在混响噪声中提升32.5%(相对),在语音噪声中提升25.7%,且在所有信噪比(SNR)水平下均保持一致增益。
  • 即使仅有30小时标注数据,MSRL仍优于使用34,000小时数据的RNN-T模型,凸显其数据效率。
  • 模型集成基线在干净条件下表现较差,原因在于对视觉模态特定表征的过度依赖;而MSRL通过学习上下文感知融合策略,避免了该问题,在所有设置下均保持鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。