Skip to main content
QUICK REVIEW

[论文解读] Sep-Stereo: Visually Guided Stereophonic Audio Generation by Associating Source Separation

Hang Zhou, Xudong Xu|arXiv (Cornell University)|Jul 20, 2020
Speech and Audio Processing参考文献 50被引用 13
一句话总结

本文提出 Sep-Stereo,一种统一的深度学习框架,通过将源分离视为空间音频生成的极端情况,联合学习立体声音频生成与音频源分离。该模型采用共享主干网络并结合关联金字塔网络(APNet)实现音视频特征融合,利用大量单声道音频数据提升双耳音频合成性能,在仅使用 67% 的立体声训练数据的情况下,实现了最先进(SOTA)的性能,同时保持了具有竞争力的分离准确率。

ABSTRACT

Stereophonic audio is an indispensable ingredient to enhance human auditory experience. Recent research has explored the usage of visual information as guidance to generate binaural or ambisonic audio from mono ones with stereo supervision. However, this fully supervised paradigm suffers from an inherent drawback: the recording of stereophonic audio usually requires delicate devices that are expensive for wide accessibility. To overcome this challenge, we propose to leverage the vastly available mono data to facilitate the generation of stereophonic audio. Our key observation is that the task of visually indicated audio separation also maps independent audios to their corresponding visual positions, which shares a similar objective with stereophonic audio generation. We integrate both stereo generation and source separation into a unified framework, Sep-Stereo, by considering source separation as a particular type of audio spatialization. Specifically, a novel associative pyramid network architecture is carefully designed for audio-visual feature fusion. Extensive experiments demonstrate that our framework can improve the stereophonic audio generation results while performing accurate sound separation with a shared backbone.

研究动机与目标

  • 通过利用大量未标注的单声道音频数据,缓解标注立体声音频数据稀缺的问题,以提升音频生成性能。
  • 将立体声音频生成与音频源分离统一于单一框架中,实现共享表征学习。
  • 通过在单声道数据上预训练并在有限的立体声数据上微调,提升低数据场景下的泛化能力。
  • 通过一种新颖的关联特征融合机制,实现更高效且可解释的音视频关联。

提出的方法

  • 该框架将音频源分离视为一种特殊形式的双耳音频生成,其中声源位于视觉感知的边缘位置。
  • 提出一种关联金字塔网络(APNet),通过可学习的关联卷积(Associative-Conv)操作,显式关联视觉特征与频谱响应。
  • 采用多任务学习策略,配备两个独立的输出头:一个用于立体声音频生成(使用 FAIR-Play 数据集),另一个用于源分离(使用 MUSIC 数据集)。
  • 共享主干网络处理两种模态,实现参数效率,并支持跨任务的联合优化。
  • 通过将显著的视觉区域映射到频谱图中对应的音频能量响应,强制实现音视频对齐。
  • 模型采用端到端训练方式,结合立体声重建损失与分离损失,利用单声道和立体声数据进行联合训练。

实验结果

研究问题

  • RQ1音频源分离能否被有效重新诠释为一种极端的空间音频生成形式?
  • RQ2能否通过共享表征学习,将统一框架用于联合优化立体声音频生成与源分离?
  • RQ3在大规模单声道音频数据上进行预训练,能否提升低数据场景下立体声音频生成的性能与泛化能力?
  • RQ4所提出的音视频关联融合机制在对齐视觉线索与空间音频特征方面的有效性如何?

主要发现

  • 所提出的 Sep-Stereo 框架在仅使用 FAIR-Play 数据集中 67% 的训练数据情况下,性能与最先进立体声音频生成模型相当。
  • 该模型在音频源分离任务上保持了具有竞争力的性能,表明共享主干网络能有效捕捉解耦的源表征。
  • 用户研究表明,60% 的参与者在音视频匹配质量方面更偏好生成的音频而非基线模型 Mono2Binaural。
  • 由于在大规模单声道数据上进行预训练,模型在分布外和真实场景的单声道数据上泛化能力更强。
  • 可视化结果表明,模型能够有效关注到视觉显著的声音源,如乐器和人物,证实了有效的音视频对齐。
  • 相对性能提升曲线显示,在不同数据规模下均呈现持续改进,验证了在低数据条件下的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。