Skip to main content
QUICK REVIEW

[论文解读] Co-Separating Sounds of Visual Objects

Ruohan Gao, Kristen Grauman|arXiv (Cornell University)|Apr 16, 2019
Speech and Audio Processing参考文献 49被引用 10
一句话总结

本文提出一种协同分离训练范式,使深度神经网络能够从无标签、自然发生的多源视频中学习对象级音频分离,利用相似视觉对象间音频嵌入的一致性。该方法在MUSIC、AudioSet和AV-Bench数据集上的音视频源分离与去噪任务中均达到最先进性能,即使在训练过程中从未单独观察到这些对象。

ABSTRACT

Learning how objects sound from video is challenging, since they often heavily overlap in a single audio channel. Current methods for visually-guided audio source separation sidestep the issue by training with artificially mixed video clips, but this puts unwieldy restrictions on training data collection and may even prevent learning the properties of "true" mixed sounds. We introduce a co-separation training paradigm that permits learning object-level sounds from unlabeled multi-source videos. Our novel training objective requires that the deep neural network's separated audio for similar-looking objects be consistently identifiable, while simultaneously reproducing accurate video-level audio tracks for each source training pair. Our approach disentangles sounds in realistic test videos, even in cases where an object was not observed individually during training. We obtain state-of-the-art results on visually-guided audio source separation and audio denoising for the MUSIC, AudioSet, and AV-Bench datasets.

研究动机与目标

  • 解决现有混合-分离训练范式依赖人工混合音频片段且假设训练数据为单源的问题。
  • 实现从现实世界中无标签的多源视频中学习对象级音频分离,其中声音自然重叠。
  • 通过利用真实音频混合中共同出现的声音源之间的相关性,提升泛化能力。
  • 使模型能够在测试视频中分离从未在训练中单独出现过的对象的声音。
  • 开发一种自监督训练目标,强制在视频对之间对视觉上相似的对象保持一致的音频表征。

提出的方法

  • 该方法使用包含多个声音源的无标签视频对,应用协同分离目标,鼓励在视频对中对视觉上相似的对象保持一致的音频嵌入。
  • 利用视频中的噪声对象检测作为弱监督信号,将分离出的音频轨道与每个视频中对应的视觉对象对齐。
  • 设计一种新型损失函数,确保同一对象类别(如吉他)在不同训练视频对中分离出的音频始终可一致识别,即使背景或上下文发生变化。
  • 框架联合优化视频内分离(在单个视频中识别每个对象的声音)和视频间一致性(在不同视频中匹配相似对象)。
  • 采用基于ResNet-18的音频分类器从分离的频谱图中提取音频嵌入,用于可视化和下游任务。
  • 通过使用检测到的最高置信度视觉对象引导环境噪声的分离,实现视觉引导的音频去噪,无需显式建模噪声结构。

实验结果

研究问题

  • RQ1自监督方法能否在无需单独录制的干净音频片段的情况下,从未人工混合的自然多源视频中学习分离对象级声音?
  • RQ2在视觉上相似的对象之间强制音频嵌入一致性,相比标准的混合-分离训练,能否显著提升分离性能?
  • RQ3该模型在分离训练中从未单独出现过的对象声音方面,泛化能力能达到何种程度?
  • RQ4与人工混合相比,协同分离目标是否能提升对真实音频混合和自然源相关性的鲁棒性?
  • RQ5所学习的音视频表征能否有效用于下游任务,如音频去噪和视觉对象发现?

主要发现

  • 协同分离方法在MUSIC数据集上达到最先进性能,各项指标(SDR、SIR、SAR)均优于先前方法。
  • 在AudioSet数据集上,该方法在音视频去噪任务中取得14.5 dB(Wooden Horse视频)、8.53 dB(Violin Yanni)和11.9 dB(Guitar Solo)的SDR,超越先前最先进方法。
  • 在零样本泛化测试中,模型成功分离了训练中从未单独出现过的对象声音,证明其具备强大泛化能力。
  • 音频嵌入的t-SNE可视化显示,分离出的声音按对象类别聚类,证实模型学习到了语义上有意义的音频表征。
  • 在AV-Bench数据集上,该方法在视觉辅助音频去噪任务中取得14.5 dB的SDR,优于AV-Loc和AV-MIML等方法,尽管未显式建模噪声结构。
  • 消融研究证实,协同分离损失对性能至关重要,若移除一致性损失,性能显著下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。