Skip to main content
QUICK REVIEW

[论文解读] Learning to Generate Samples from Noise through Infusion Training

Florian Bordes, Sina Honari|arXiv (Cornell University)|Mar 20, 2017
Music and Audio Processing被引用 11
一句话总结

本文提出了一种名为融合训练(infusion training)的新颖训练方法,用于学习一个马尔可夫链转移算子,该算子能将随机噪声逐步去噪为符合目标数据分布的高质量样本。通过在训练链中注入目标数据样本,模型能够在较少步骤内生成多样化且高保真的样本,其 inception 分数表现具有竞争力,且样本质量优于基线 GAN 模型。

ABSTRACT

In this work, we investigate a novel training procedure to learn a generative model as the transition operator of a Markov chain, such that, when applied repeatedly on an unstructured random noise sample, it will denoise it into a sample that matches the target distribution from the training set. The novel training procedure to learn this progressive denoising operation involves sampling from a slightly different chain than the model chain used for generation in the absence of a denoising target. In the training chain we infuse information from the training target example that we would like the chains to reach with a high probability. The thus learned transition operator is able to produce quality and varied samples in a small number of steps. Experiments show competitive results compared to the samples generated with a basic Generative Adversarial Net

研究动机与目标

  • 开发一种生成模型,通过渐进式去噪学习将随机噪声转换为逼真样本。
  • 解决自回归模型的局限性,后者依赖于任意排序,且在高维数据上速度较慢。
  • 相比标准 GAN 模型,提升样本质量和多样性,后者需要训练两个网络,且易发生模式崩溃和训练不稳定。
  • 通过学习直接的输入空间转移算子,实现高效快速采样,避免潜在空间瓶颈。
  • 探索一种基于目标注入的新颖训练目标,指导模型在学习过程中趋向期望的数据点。

提出的方法

  • 模型学习一个随机转移算子,通过包含 T 步的马尔可夫链,将输入噪声映射为符合数据分布的样本。
  • 提出一种新颖的“目标注入”技术,通过注入真实训练数据点的信息来偏置训练链,引导去噪过程。
  • 在训练过程中,模型接触的是经过修改的链,其中目标数据点在特定步骤被注入,以促使链收敛至该点。
  • 推理过程仅使用学习到的转移算子,对因子化噪声输入迭代应用该算子以生成样本。
  • 通过基于去噪性能的启发式代理损失避免对抗训练,且有实证证据表明对数似然持续增加。
  • 该方法在 MNIST、CelebA、CIFAR-10 和 Toronto Face Dataset 上通过 inception 分数、视觉质量及图像修复任务进行了评估。

实验结果

研究问题

  • RQ1单个神经网络能否通过学习的马尔可夫链逐步去噪随机噪声,生成高质量且多样化的样本?
  • RQ2与标准扩散或基于 GAN 的方法相比,训练过程中引入目标注入是否能提升样本质量和收敛速度?
  • RQ3与对抗模型(如 GAN)相比,该方法在样本质量和训练稳定性方面表现如何?
  • RQ4该模型能否泛化到条件生成任务(如图像修复),其中提供部分输入?
  • RQ5尽管使用启发式损失,该融合训练过程是否仍能带来有意义的对数似然估计提升?

主要发现

  • 在 CIFAR-10 上,融合训练模型的 inception 分数达到 4.62 ± 0.06,优于无监督基线(-L)的 4.36 ± 0.06 和半监督基线(SP)的 8.09 ± 0.07。
  • 生成的样本清晰且多样化,经与最近邻训练样本比较,未发现记忆训练数据的迹象。
  • 图像修复实验表明,该模型能够基于部分输入生成多样且连贯的缺失区域补全。
  • 与 Sohl-Dickstein 等人的基于扩散的方法相比,该模型所需去噪步骤更少,表明收敛更快,且每步生成质量更高。
  • 该方法在性能上与 GAN 模型相当,同时避免了判别器的使用及其带来的训练不稳定性。
  • 基于下界的融合训练与启发式损失产生相似结果,表明方法具有鲁棒性,并具备理论扩展的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。