Skip to main content
QUICK REVIEW

[论文解读] Source Separation with Deep Generative Priors

Vivek Jayaram, John Thickstun|arXiv (Cornell University)|Feb 19, 2020
Speech and Audio Processing参考文献 57被引用 10
一句话总结

本文提出了一种贝叶斯源分离方法,利用预训练的深度生成模型作为先验,从单一混合信号中推断出合理的源成分。通过采用噪声退火的朗之万动力学(BASIS),该方法从源的后验分布中进行采样,在MNIST上取得了最先进结果,在CIFAR-10和LSUN上也表现出色,评估指标和定性结果均显示其能生成真实且多样的分离结果,且无需微调训练。

ABSTRACT

Despite substantial progress in signal source separation, results for richly structured data continue to contain perceptible artifacts. In contrast, recent deep generative models can produce authentic samples in a variety of domains that are indistinguishable from samples of the data distribution. This paper introduces a Bayesian approach to source separation that uses generative models as priors over the components of a mixture of sources, and noise-annealed Langevin dynamics to sample from the posterior distribution of sources given a mixture. This decouples the source separation problem from generative modeling, enabling us to directly use cutting-edge generative models as priors. The method achieves state-of-the-art performance for MNIST digit separation. We introduce new methodology for evaluating separation quality on richer datasets, providing quantitative evaluation of separation results on CIFAR-10. We also provide qualitative results on LSUN.

研究动机与目标

  • 为解决图像和音频等丰富结构化数据在源分离中出现的可察觉伪影问题。
  • 通过使用预训练的生成模型作为先验,将源分离与生成建模解耦。
  • 为丰富数据分布中模糊且不可识别的源分离构建稳健的评估框架。
  • 实现基于采样的推理,以生成可能的源分解,而非依赖于确定性回归。
  • 通过使用最先进生成模型,在MNIST、CIFAR-10和LSUN等多样化数据集上展示该方法的有效性。

提出的方法

  • 将基于似然的深度生成模型(如NCSN或Glow)作为源成分的先验 $p(\mathbf{x})$。
  • 应用噪声退火的朗之万动力学(BASIS)从后验 $p(\mathbf{x}|\mathbf{m})$ 中采样,其中 $\mathbf{m}$ 为观测到的混合信号。
  • 后验通过贝叶斯规则定义:$p(\mathbf{x}|\mathbf{m}) \propto p(\mathbf{m}|\mathbf{x}) p(\mathbf{x})$,其中 $p(\mathbf{m}|\mathbf{x})$ 由线性混合模型 $\mathbf{m} = \sum_{i=1}^k \alpha_i \mathbf{x}_i$ 推导得出。
  • 采用基于得分的采样方法,通过逐步降低噪声来探索后验分布,生成多样且高质量的源重构结果。
  • 无需修改架构即可利用预训练的生成模型,实现即插即用,与最先进模型兼容。
  • 将方法扩展至图像着色任务,将灰度图像视为颜色通道的混合,使用相同的先验模型。

实验结果

研究问题

  • RQ1能否将深度生成模型用作先验,以改善图像等高维模糊数据中的源分离性能?
  • RQ2当真实源成分不可识别时(尤其是在丰富数据分布中),应如何评估源分离性能?
  • RQ3通过噪声退火朗之万动力学进行基于采样的推理,是否能生成比确定性回归更真实、更多样化的源分离结果?
  • RQ4分离质量更多取决于生成先验还是推理算法?
  • RQ5同一生成模型能否同时用于源分离和图像着色任务,以体现方法的通用性?

主要发现

  • 在MNIST上,该方法通过从后验采样实现了最先进性能,能够捕捉多种合理的分离结果,包括图1中用橙色高亮的模糊情况。
  • 在CIFAR-10上,使用NCSN作为先验时,BASIS在类别无关设置下实现了8.29 ± 0.16的Inception Score和22.12的FID,优于先前方法。
  • 在着色任务中,基于NCSN的分离方法实现了10.53 ± 0.17的Inception Score和11.58的FID,接近真实CIFAR-10图像的表现(IS: 11.24, FID: 0.00)。
  • LSUN的分离结果表明,分离成分的平均对数似然与真实测试图像相当,表明伪影源于生成模型本身,而非分离算法。
  • 该方法在多种数据类型上表现一致,包括图像分离、图像着色和多类别混合,且对生成先验的网络架构修改极少。
  • 所提出的评估方法成功捕捉了丰富数据中源的不可识别性,突破了对严格真实标签对比的依赖。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。