[论文解读] Learning to Generate Samples from Noise through Infusion Training
本文提出了一种名为融合训练(infusion training)的新颖训练方法,用于学习一个马尔可夫链转移算子,该算子能将随机噪声逐步去噪为符合目标数据分布的高质量样本。通过在训练链中注入目标数据样本,模型能够在较少步骤内生成多样化且高保真的样本,其 inception 分数表现具有竞争力,且样本质量优于基线 GAN 模型。
In this work, we investigate a novel training procedure to learn a generative model as the transition operator of a Markov chain, such that, when applied repeatedly on an unstructured random noise sample, it will denoise it into a sample that matches the target distribution from the training set. The novel training procedure to learn this progressive denoising operation involves sampling from a slightly different chain than the model chain used for generation in the absence of a denoising target. In the training chain we infuse information from the training target example that we would like the chains to reach with a high probability. The thus learned transition operator is able to produce quality and varied samples in a small number of steps. Experiments show competitive results compared to the samples generated with a basic Generative Adversarial Net
研究动机与目标
- 开发一种生成模型,通过渐进式去噪学习将随机噪声转换为逼真样本。
- 解决自回归模型的局限性,后者依赖于任意排序,且在高维数据上速度较慢。
- 相比标准 GAN 模型,提升样本质量和多样性,后者需要训练两个网络,且易发生模式崩溃和训练不稳定。
- 通过学习直接的输入空间转移算子,实现高效快速采样,避免潜在空间瓶颈。
- 探索一种基于目标注入的新颖训练目标,指导模型在学习过程中趋向期望的数据点。
提出的方法
- 模型学习一个随机转移算子,通过包含 T 步的马尔可夫链,将输入噪声映射为符合数据分布的样本。
- 提出一种新颖的“目标注入”技术,通过注入真实训练数据点的信息来偏置训练链,引导去噪过程。
- 在训练过程中,模型接触的是经过修改的链,其中目标数据点在特定步骤被注入,以促使链收敛至该点。
- 推理过程仅使用学习到的转移算子,对因子化噪声输入迭代应用该算子以生成样本。
- 通过基于去噪性能的启发式代理损失避免对抗训练,且有实证证据表明对数似然持续增加。
- 该方法在 MNIST、CelebA、CIFAR-10 和 Toronto Face Dataset 上通过 inception 分数、视觉质量及图像修复任务进行了评估。
实验结果
研究问题
- RQ1单个神经网络能否通过学习的马尔可夫链逐步去噪随机噪声,生成高质量且多样化的样本?
- RQ2与标准扩散或基于 GAN 的方法相比,训练过程中引入目标注入是否能提升样本质量和收敛速度?
- RQ3与对抗模型(如 GAN)相比,该方法在样本质量和训练稳定性方面表现如何?
- RQ4该模型能否泛化到条件生成任务(如图像修复),其中提供部分输入?
- RQ5尽管使用启发式损失,该融合训练过程是否仍能带来有意义的对数似然估计提升?
主要发现
- 在 CIFAR-10 上,融合训练模型的 inception 分数达到 4.62 ± 0.06,优于无监督基线(-L)的 4.36 ± 0.06 和半监督基线(SP)的 8.09 ± 0.07。
- 生成的样本清晰且多样化,经与最近邻训练样本比较,未发现记忆训练数据的迹象。
- 图像修复实验表明,该模型能够基于部分输入生成多样且连贯的缺失区域补全。
- 与 Sohl-Dickstein 等人的基于扩散的方法相比,该模型所需去噪步骤更少,表明收敛更快,且每步生成质量更高。
- 该方法在性能上与 GAN 模型相当,同时避免了判别器的使用及其带来的训练不稳定性。
- 基于下界的融合训练与启发式损失产生相似结果,表明方法具有鲁棒性,并具备理论扩展的潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。