Skip to main content
QUICK REVIEW

[论文解读] Multimodal Self-Supervised Learning of General Audio Representations

Luyu Wang, Pauline Luc|arXiv (Cornell University)|Apr 26, 2021
Music and Audio Processing参考文献 40被引用 20
一句话总结

该论文提出了一种多模态自监督框架,利用视频、频谱图和原始波形来学习无标签的一般音频表征。通过使用低分辨率视频和样本混合增强技术,该方法在 AudioSet 上实现了最先进性能——mAP 达到 42.4,缩小了与监督模型的差距,并在多种音频下游任务中超越了先前的无监督方法。

ABSTRACT

We present a multimodal framework to learn general audio representations from videos. Existing contrastive audio representation learning methods mainly focus on using the audio modality alone during training. In this work, we show that additional information contained in video can be utilized to greatly improve the learned features. First, we demonstrate that our contrastive framework does not require high resolution images to learn good audio features. This allows us to scale up the training batch size, while keeping the computational load incurred by the additional video modality to a reasonable level. Second, we use augmentations that mix together different samples. We show that this is effective to make the proxy task harder, which leads to substantial performance improvements when increasing the batch size. As a result, our audio model achieves a state-of-the-art of 42.4 mAP on the AudioSet classification downstream task, closing the gap between supervised and self-supervised methods trained on the same dataset. Moreover, we show that our method is advantageous on a broad range of non-semantic audio tasks, including speaker identification, keyword spotting, language identification, and music instrument classification.

研究动机与目标

  • 通过在不依赖高分辨率视频的情况下引入视频中的视觉信号,改进自监督音频表征学习。
  • 探究在对比学习中对音频、频谱图和视频输入进行样本混合是否能提升特征质量。
  • 评估在 AudioSet 之外的多样化下游任务中所学音频特征的泛化能力。
  • 缩小自监督音频模型与监督基线模型在标准基准上的性能差距。

提出的方法

  • 采用包含三个编码器的对比学习框架:一个用于视频(V),一个用于频谱图(S),一个用于原始波形(W),在同步的视频片段上进行训练。
  • 应用模态特定的增强方法:对视频使用空间裁剪和颜色抖动,对频谱图使用频率偏移,对波形则不使用特定格式的增强。
  • 在所有模态之间引入样本混合(mixup),其中混合输入是两个批次样本的加权平均,从而增加掩蔽任务的难度。
  • 采用成对对比损失,使同一样本的增强视图在嵌入空间中更接近,同时将负样本对推开。
  • 利用先前工作中的多格式设置,通过相互监督方式训练频谱图和波形网络,提升鲁棒性和泛化能力。
  • 端到端训练音频编码器,即使使用低分辨率帧,也以视频作为监督信号,从而在保持性能的同时降低计算成本。

实验结果

研究问题

  • RQ1低分辨率视频是否能提供足够的监督信号以改善自监督音频表征学习?
  • RQ2在音频、频谱图和视频模态输入之间进行样本混合是否能提升所学音频特征的质量?
  • RQ3在视频数据上训练的自监督音频模型在非语义音频任务(如说话人识别和关键词检测)上的泛化能力如何?
  • RQ4自监督音频模型在 AudioSet 和其他基准上的性能与监督基线模型相比有多接近?

主要发现

  • 所提方法在 AudioSet 分类基准上实现了新的最先进 mAP 为 42.4,接近监督模型的性能(43.1 mAP)。
  • 基于波形的模型在相同基准上达到 40.5 mAP,优于此前监督方法的最先进水平(36.5 mAP)。
  • 在下游任务中,该模型相比 COLA [14] 将平均准确率提高了 5.5 个百分点,尤其在说话人识别(VoxCeleb 上为 38.2% 对比 29.9%)和关键词检测(Speech Commands v2 上为 82.2%)任务中提升显著。
  • 该方法在多样化任务中泛化良好,包括语言识别(79.0% 对比先前工作的 71.3%)、乐器识别(68.3% 对比 63.4%)和声学场景分类(90.4% 对比先前工作的 94.0%)。
  • 使用低分辨率视频不会降低性能,反而可支持更大的批量大小并减少计算成本,同时保持高质量的特征表示。
  • 样本混合显著提升性能,尤其在批量大小增加时,通过使对比学习的掩蔽任务更具挑战性与鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。