Skip to main content
QUICK REVIEW

[论文解读] Multiple Sound Sources Localization from Coarse to Fine

Rui Qian, Di Hu|arXiv (Cornell University)|Jul 13, 2020
Speech and Audio Processing参考文献 30被引用 8
一句话总结

本文提出了一种用于在非受限视频中定位多个声音源的两阶段音视频学习框架,通过多任务学习和类激活映射(CAM)解耦音频与视觉表征,然后以粗到精的方式对齐它们。该方法在公开数据集上实现了最先进性能,并利用定位到的视觉线索实现了有效的声音分离。

ABSTRACT

How to visually localize multiple sound sources in unconstrained videos is a formidable problem, especially when lack of the pairwise sound-object annotations. To solve this problem, we develop a two-stage audiovisual learning framework that disentangles audio and visual representations of different categories from complex scenes, then performs cross-modal feature alignment in a coarse-to-fine manner. Our model achieves state-of-the-art results on public dataset of localization, as well as considerable performance on multi-source sound localization in complex scenes. We then employ the localization results for sound separation and obtain comparable performance to existing methods. These outcomes demonstrate our model's ability in effectively aligning sounds with specific visual sources. Code is available at https://github.com/shvdiwnkozbw/Multi-Source-Sound-Localization

研究动机与目标

  • 解决在无成对声音-物体标注的情况下,于复杂非受限视频中定位多个声音源的挑战。
  • 从杂乱场景中解耦不同类别的音频与视觉表征,以改善对齐效果。
  • 在视频级监督过于粗略的多源场景中,建立准确的音视频对应关系。
  • 开发一种新型评估流程,用于多源声音定位,以衡量类特定的定位性能。
  • 利用定位结果,在下游任务中通过视觉引导实现有效的声音源分离。

提出的方法

  • 提出一种两阶段框架:首先,采用多任务学习设置联合执行音视频分类与对应关系学习。
  • 应用类激活映射(CAM)提取类别特定的视觉特征,实现从复杂场景中解耦声音源对象。
  • 执行粗到精的音视频对齐:将类别级对应关系细化为视频级与类别级关联。
  • 使用定位到的对象的视觉表征作为后续任务中声音源分离的引导。
  • 采用加权池化方法从混合谱图中解耦音频表征,提升源特定特征学习效果。
  • 该框架通过时间同步和类别级标签的自监督方式端到端训练。

实验结果

研究问题

  • RQ1在无一一对应标注的情况下,能否有效从复杂场景中解耦音视频表征?
  • RQ2如何利用粗粒度的视频级监督在多源环境中实现细粒度的声音源定位?
  • RQ3粗到精的对齐策略是否能提升非受限视频中音视频对应关系的准确性?
  • RQ4定位结果在多大程度上能提升声音源分离性能?
  • RQ5所提出的评估指标与现有基线相比,能否更准确地反映多源定位中的性能表现?

主要发现

  • 所提方法在公开声音定位数据集上实现了最先进性能,尤其在多源场景中表现突出。
  • 在AudioSet level-2基准上,该模型能精确地定位声音源,例如正确识别长笛,而不会像AVC和多任务基线那样错误地将声音定位到竖琴。
  • 当用作视觉引导时,该模型的定位结果在声音分离性能上可与现有方法相媲美,在独奏视频上达到SDR 6.53和SIR 12.15,在多源(独奏+二重奏)训练上达到SDR 6.57和SIR 11.90。
  • 基于视觉表征的引导优于Grad-CAM和基于音频表征的引导,后者因分辨率低和解耦能力有限而表现较差。
  • 该模型在比竞争方法更少的音视频配对样本下取得优异结果,且无需额外检测器即可完成声音源提取。
  • 所提出的评估流程能够实现对复杂场景中类特定定位性能的公平且细致的评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。