Skip to main content
QUICK REVIEW

[论文解读] Deep Audio Prior

Yapeng Tian, Chenliang Xu|arXiv (Cornell University)|Sep 25, 2019
Speech and Audio Processing参考文献 50被引用 6
一句话总结

本文提出深度音频先验(DAP),一种利用随机初始化的深度神经网络与时间音频结构来解决具有挑战性的音频任务(如盲源分离、音频编辑和纹理合成)的方法,且无需任何训练数据。DAP在Universal-150基准测试中达到最先进水平,展现出对多样化音频源的强大鲁棒性与泛化能力。

ABSTRACT

Deep convolutional neural networks are known to specialize in distilling compact and robust prior from a large amount of data. We are interested in applying deep networks in the absence of training dataset. In this paper, we introduce deep audio prior (DAP) which leverages the structure of a network and the temporal information in a single audio file. Specifically, we demonstrate that a randomly-initialized neural network can be used with carefully designed audio prior to tackle challenging audio problems such as universal blind source separation, interactive audio editing, audio texture synthesis, and audio co-separation. To understand the robustness of the deep audio prior, we construct a benchmark dataset \emph{Universal-150} for universal sound source separation with a diverse set of sources. We show superior audio results than previous work on both qualitative and quantitative evaluations. We also perform thorough ablation study to validate our design choices.

研究动机与目标

  • 开发一种无需任何标注或预训练数据的深度学习方法,用于音频重建与操作。
  • 探究仅通过单个音频样本中的时间结构,随机初始化的神经网络是否可作为强大的音频先验。
  • 在无训练数据条件下解决通用盲源分离问题,支持音频共分离与交互式编辑等应用。
  • 通过新构建的基准测试,验证所提方法在多样化音频源上的鲁棒性与泛化能力。

提出的方法

  • 使用随机初始化的深度卷积神经网络作为先验,其网络结构与学习到的时间动态特性共同引导音频重建。
  • 通过精心设计的网络结构嵌入时间建模,以捕捉音频波形中的长程依赖关系。
  • 通过最小化一个损失函数来优化音频重建,该损失函数强制保持与音频内在结构和内容的一致性。
  • 通过可微分损失函数施加音频先验,以保留感知与频谱特性,而无需外部数据。
  • 该框架在单个音频文件上端到端训练,仅使用信号内部结构作为监督信号。
  • 构建了一个新基准Universal-150,用于评估在多样化真实世界音频源上的通用声音源分离性能。

实验结果

研究问题

  • RQ1随机初始化的深度神经网络是否可在无任何训练数据的情况下,作为音频重建与操作的强先验?
  • RQ2所提方法在无成对或标注数据的情况下,从单一混合音频信号中分离多个声源的效率如何?
  • RQ3该方法在包括语音、音乐和环境声音在内的多样化音频类型上,其泛化能力达到何种程度?
  • RQ4网络架构与损失函数中的哪些设计选择对性能与鲁棒性影响最大?

主要发现

  • 在Universal-150基准测试中,所提出的深度音频先验在定性与定量评估上均优于先前最先进方法。
  • 该方法在包括语音、音乐和环境声音在内的多样化音频源上展现出强大泛化能力,且无需任何针对特定数据的适配。
  • 消融实验表明,网络架构与时间建模的结合对性能至关重要,仅靠随机初始化本身不足以实现良好效果。
  • 该方法仅需单个音频样本作为输入,即可实现高质量的通用盲源分离、音频共分离与交互式音频编辑。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。