Skip to main content
QUICK REVIEW

[论文解读] Visually Guided Sound Source Separation and Localization using Self-Supervised Motion Representations

Lingyu Zhu, Esa Rahtu|arXiv (Cornell University)|Apr 17, 2021
Speech and Audio Processing被引用 7
一句话总结

该论文提出AMnet,一种用于声音源分离与定位的自监督两阶段音视频模型,通过独立利用外观和运动线索。通过引入音频-运动嵌入(AME)框架和音频-运动Transformer(AMT)进行融合,AMnet在MUSIC-21和AVE数据集上实现了最先进性能,且无需依赖预训练的关键点检测器或人体运动先验。

ABSTRACT

The objective of this paper is to perform audio-visual sound source separation, i.e.~to separate component audios from a mixture based on the videos of sound sources. Moreover, we aim to pinpoint the source location in the input video sequence. Recent works have shown impressive audio-visual separation results when using prior knowledge of the source type (e.g. human playing instrument) and pre-trained motion detectors (e.g. keypoints or optical flows). However, at the same time, the models are limited to a certain application domain. In this paper, we address these limitations and make the following contributions: i) we propose a two-stage architecture, called Appearance and Motion network (AMnet), where the stages specialise to appearance and motion cues, respectively. The entire system is trained in a self-supervised manner; ii) we introduce an Audio-Motion Embedding (AME) framework to explicitly represent the motions that related to sound; iii) we propose an audio-motion transformer architecture for audio and motion feature fusion; iv) we demonstrate state-of-the-art performance on two challenging datasets (MUSIC-21 and AVE) despite the fact that we do not use any pre-trained keypoint detectors or optical flow estimators. Project page: https://ly-zhu.github.io/self-supervised-motion-representations

研究动机与目标

  • 解决现有音视频分离模型依赖预训练关键点检测器或假设人体运动的局限性。
  • 开发一种自监督方法,学习与声音产生直接关联的运动表征,实现对不同类型声音源的泛化能力。
  • 通过在共享嵌入空间中显式建模音频与运动之间的相关性,提升声音源定位与分离性能。
  • 在具有挑战性的基准测试(MUSIC-21和AVE)上展示最先进性能,且不使用光流或预训练运动检测器。

提出的方法

  • 提出两阶段架构AMnet,分别处理外观和运动线索,实现专业化并提升特征学习效果。
  • 引入音频-运动嵌入(AME)框架,通过在共享嵌入空间中对齐音频与运动,实现自监督方式下的运动表征学习。
  • 设计音频-运动Transformer(AMT)模块,实现有效的特征融合,支持上下文感知的注意力机制融合。
  • 采用音视频对比学习方式,端到端自监督训练整个系统,避免依赖预训练模型。
  • 以视频关键帧和频谱图作为输入,利用外观特征加权频谱分量,并生成二值掩码以实现分离。
  • 将学习到的运动表征不仅用于分离,还用于在视频帧中定位声音源。

实验结果

研究问题

  • RQ1能否在不依赖预训练关键点检测器或光流估计器的情况下,有效学习自监督的运动表征?
  • RQ2与联合处理相比,分离外观与运动处理的两阶段架构是否能提升音视频源分离的性能?
  • RQ3基于音频-运动嵌入的学习是否能优于基于光流或动态图像的运动表征,实现更优的声音源定位与分离?
  • RQ4外观与运动线索在分离性能中的贡献如何比较?二者能否被有效结合?
  • RQ5该模型能否泛化到非人体运动引起的声音源(如乐器或非人类运动物体)?

主要发现

  • AMnet在MUSIC-21数据集上达到最先进性能,SDR为11.08 dB,优于所有基线模型,包括基于关键点的SoM和COF。
  • 在AVE数据集上,AMnet的SDR达到10.35 dB,显著优于先前最先进方法(SoM)的1.21 dB。
  • 当使用所提出的音频-运动Transformer(AMT)而非早期融合时,SDR提升1.11 dB,证明了注意力机制融合的有效性。
  • 消融实验证明,在两阶段设置中结合外观与运动线索,SDR相比单阶段仅使用外观或运动的设置提升1.59 dB。
  • 即使在分离相同乐器源(如两把大提琴)的挑战性场景下,AMnet对大提琴的SDR仍达到2.47 dB,优于复制粘贴基线模型及其他所有方法。
  • 音频-运动嵌入(AME)框架可实现精确的声音源定位,如图1所示,运动线索有助于识别视频中的活跃声源。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。