Skip to main content
QUICK REVIEW

[论文解读] Learning Speech Representations from Raw Audio by Joint Audiovisual Self-Supervision

Abhinav Shukla, Stavros Petridis|arXiv (Cornell University)|Jul 8, 2020
Speech and Audio Processing参考文献 22被引用 4
一句话总结

本文提出一种联合音视频自监督方法,通过结合仅音频自监督(预测音频属性)与视觉自监督(从音频生成说话人脸),直接从原始音频波形中学习语音表征。该方法在低资源和噪声条件下显著优于完全监督训练及现有自监督方法,证明了多模态预训练在语音表征学习中的有效性。

ABSTRACT

The intuitive interaction between the audio and visual modalities is valuable for cross-modal self-supervised learning. This concept has been demonstrated for generic audiovisual tasks like video action recognition and acoustic scene classification. However, self-supervision remains under-explored for audiovisual speech. We propose a method to learn self-supervised speech representations from the raw audio waveform. We train a raw audio encoder by combining audio-only self-supervision (by predicting informative audio attributes) with visual self-supervision (by generating talking faces from audio). The visual pretext task drives the audio representations to capture information related to lip movements. This enriches the audio encoder with visual information and the encoder can be used for evaluation without the visual modality. Our method attains competitive performance with respect to existing self-supervised audio features on established isolated word classification benchmarks, and significantly outperforms other methods at learning from fewer labels. Notably, our method also outperforms fully supervised training, thus providing a strong initialization for speech related tasks. Our results demonstrate the potential of multimodal self-supervision in audiovisual speech for learning good audio representations.

研究动机与目标

  • 开发一种自监督方法,通过跨模态监督从原始音频波形中学习鲁棒的语音表征。
  • 探索视觉自监督(特别是从音频生成说话人脸)作为掩蔽任务,以丰富音频表征的效用。
  • 评估联合音视频自监督是否能提升下游语音分类任务的性能,特别是在标注数据稀缺的情况下。
  • 将所提方法与仅音频自监督方法及完全监督训练进行比较,尤其关注低资源和噪声环境下的表现。

提出的方法

  • 该方法采用1D ResNet18作为音频编码器,通过原始音频和视觉模态的联合自监督进行训练。
  • 仅音频自监督通过训练解码器从音频编码器的潜在表征中重建关键音频属性(MFCC、对数梅尔频谱图和原始波形)实现。
  • 视觉自监督通过一个视频生成头实现,该头从第一帧和音频嵌入重建说话人脸帧序列,强制音频与唇部动作对齐。
  • 音频编码器通过音频和视觉任务的重建损失联合优化,使其学习到融合视觉信息的表征。
  • 最终的音频编码器通过使用BiGRU分类器和交叉熵损失在下游分类任务上进行微调。
  • 该方法在孤立词分类任务(SPC和LRW数据集)上进行评估,包括在10%有限数据和信噪比从-5 dB到20 dB的噪声条件下的消融研究。

实验结果

研究问题

  • RQ1与单模态仅音频自监督相比,联合音视频自监督能否提升从原始音频中学习语音表征的效果?
  • RQ2通过说话人脸生成实现的视觉自监督是否能增强音频表征的泛化能力,特别是在低数据场景下?
  • RQ3当在下游语音分类任务上微调时,所提方法能否超越完全监督训练?
  • RQ4在噪声条件下该方法表现如何?其在低信噪比环境下的泛化能力是否优于基线方法?

主要发现

  • 在完整SPC数据集上,所提方法达到95.21%的准确率,在自监督方法中排名第二,并优于完全监督训练。
  • 在完整LRW数据集上,该方法达到95.37%的准确率,是所有对比方法中的最佳表现。
  • 仅使用10%的训练数据时,SPC数据集上准确率达到90.63%,LRW数据集上达到77.13%,显著优于其他自监督和完全监督基线方法。
  • 在噪声条件下(信噪比从-5 dB到20 dB),联合音视频方法在SPC和LRW数据集上均持续优于MFCC和所有其他自监督基线方法。
  • 通过联合音视频自监督训练的模型泛化能力优于仅音频或仅视觉的基线模型,证明了多模态监督的互补价值。
  • 该方法显著优于从零开始的完全监督训练,表明利用跨模态信号进行自监督预训练是语音任务中一种强大的初始化方式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。