[论文解读] Conditional Image Generation by Conditioning Variational Auto-Encoders
本文提出一种高效训练条件变分自编码器(cVAE)的方法,通过利用预训练的无条件 VAE 作为基础模型,避免从零开始训练的高昂成本。通过仅训练一个轻量级推理模块(即‘生成物’),将条件输入映射到潜在空间编码,该方法在样本质量和真实后验分布覆盖方面达到 GAN 水平——尤其在具有忠实不确定性表征的随机图像修复任务中表现卓越,同时避免了模式崩溃。
We present a conditional variational auto-encoder (VAE) which, to avoid the substantial cost of training from scratch, uses an architecture and training objective capable of leveraging a foundation model in the form of a pretrained unconditional VAE. To train the conditional VAE, we only need to train an artifact to perform amortized inference over the unconditional VAE's latent variables given a conditioning input. We demonstrate our approach on tasks including image inpainting, for which it outperforms state-of-the-art GAN-based approaches at faithfully representing the inherent uncertainty. We conclude by describing a possible application of our inpainting model, in which it is used to perform Bayesian experimental design for the purpose of guiding a sensor.
研究动机与目标
- 通过复用预训练的无条件 VAE 来解决条件 VAE 训练时间过长的问题。
- 实现在无需从头训练整个模型的前提下,对 cVAE 进行高效微调。
- 实现高质量、多样化的图像补全,并忠实表征后验不确定性。
- 在捕捉模式多样性方面,特别是在随机图像修复任务中,证明该方法优于基于 GAN 的方法。
- 支持需要完整后验覆盖的应用,例如用于传感器引导的贝叶斯实验设计。
提出的方法
- 该方法使用预训练的无条件 VAE 作为固定解码器和先验,冻结其参数。
- 训练一个新的推理网络(即“生成物”),将条件输入(例如掩码图像)映射到 VAE 潜在空间上的近似后验分布。
- 通过标准 VAE 目标进行训练,最大化关于条件数据分布的 ELBO。
- 推理生成物执行近似推理,实现在生成过程中快速、可扩展的采样。
- 该方法支持迁移学习:单个预训练的 VAE 可被适配到多个条件任务(例如图像修复、着色)。
- 该方法被证明能最小化质量覆盖 KL 散度,从而在后验覆盖方面优于 GAN。
实验结果
研究问题
- RQ1预训练的无条件 VAE 是否能被有效重用于条件图像生成,且仅需极少的额外训练?
- RQ2与当前最先进的基于 GAN 的方法相比,该方法在图像修复任务中是否实现了具有竞争力的样本质量和多样性?
- RQ3该模型是否能忠实表征图像补全中的不确定性,避免 GAN 中常见的模式崩溃?
- RQ4该方法是否可在使用单一基础 VAE 的前提下,跨多种条件图像生成任务实现可扩展性和可迁移性?
- RQ5该模型是否能在需要完整后验覆盖的下游应用中有效使用,例如贝叶斯实验设计?
主要发现
- 所提方法在 CIFAR-10、ImageNet-64 和 FFHQ-256 上的图像补全质量与当前最先进的 GAN(如 CoModGAN)相当。
- 与 GAN 不同,该方法避免了模式崩溃:在 20 张测试图像中,CoModGAN 出现了 5 次模式崩溃,而 IPA 始终生成多样化的补全结果。
- 该模型表现出更优的真实后验分布覆盖能力,表现为在不确定性下生成更多样化且更合理的补全结果。
- 使用预训练 VAE 显著减少了训练时间,相比从零开始训练 cVAE,同时保持了高质量的样本输出。
- 该方法在不同数据集间具有泛化能力:在 ImageNet 上预训练的 VAE 可成功实现对 FFHQ 和 CIFAR-10 等图像数据集的高质量图像修复。
- 该模型在贝叶斯实验设计中表现有效,其中准确的后验表征对于实现最优传感器引导至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。