[论文解读] Harmonizing Maximum Likelihood with GANs for Multimodal Conditional Generation
本文提出了一种时刻重建(MR)损失,用于替代条件生成对抗网络(conditional GANs)中的传统重建损失,从而在训练稳定性和多模态生成方面均取得提升。通过最大似然估计匹配真实数据分布的条件均值与方差,该方法在Cityscapes和CelebA数据集上的图像到图像翻译、超分辨率和图像修复任务中,实现了最先进的多样性与视觉保真度。
Recent advances in conditional image generation tasks, such as image-to-image translation and image inpainting, are largely accounted to the success of conditional GAN models, which are often optimized by the joint use of the GAN loss with the reconstruction loss. However, we reveal that this training recipe shared by almost all existing methods causes one critical side effect: lack of diversity in output samples. In order to accomplish both training stability and multimodal output generation, we propose novel training schemes with a new set of losses named moment reconstruction losses that simply replace the reconstruction loss. We show that our approach is applicable to any conditional generation tasks by performing thorough experiments on image-to-image translation, super-resolution and image inpainting using Cityscapes and CelebA dataset. Quantitative evaluations also confirm that our methods achieve a great diversity in outputs while retaining or even improving the visual fidelity of generated samples.
研究动机与目标
- 解决条件生成对抗网络中重建损失导致模式崩溃、输出多样性降低的关键局限性。
- 克服生成对抗网络损失与重建损失之间的不匹配,从而实现训练稳定性与多模态生成的最优平衡。
- 开发一种可泛化的训练方案,仅以时刻重建损失替代重建损失,而无需修改模型架构。
- 在图像到图像翻译、超分辨率和图像修复等多种条件生成任务中,实现多样化且高保真的图像生成。
- 证明仅匹配一阶统计量(均值)即可实现有效的生成对抗网络训练,降低复杂度而不损失性能。
提出的方法
- 提出时刻重建(MR)损失,作为传统L1/L2重建损失的替代方案,其中生成器预测真实数据分布的条件统计量(均值与方差)。
- 使用最大似然估计(MLE)训练生成器,使其在给定条件时预测真实图像的条件均值与方差。
- 通过一种新型损失函数,强制生成分布的统计量与预测的真实数据统计量相匹配,从而提升训练稳定性和多样性。
- 提出代理MR损失,利用独立网络预测统计量,将生成器与像素级重建的直接监督解耦。
- 将MR损失与代理MR损失与生成对抗网络损失联合使用,既保持了生成对抗网络的保真度优势,又实现了多模态输出。
- 端到端训练模型,采用联合损失函数:生成对抗网络损失用于提升真实感,MR/代理MR损失用于保证统计一致性与多样性。
实验结果
研究问题
- RQ1为何现有采用重建损失的条件生成对抗网络在训练于一对一多映射任务时仍无法生成多样化输出?
- RQ2是否可用基于统计矩的损失替代重建损失,从而同时提升条件生成的训练稳定性和输出多样性?
- RQ3是否必须匹配高阶统计量(如方差),还是仅匹配均值即可实现有效的多模态生成?
- RQ4与BicycleGAN或注入噪声的基线方法相比,所提出的时刻重建损失在真实感与多样性方面表现如何?
- RQ5该方法能否在图像到图像翻译、超分辨率和图像修复等多种条件生成任务中实现良好泛化?
主要发现
- 所提出的高斯代理MR 2损失在Pix2Pix–Cityscapes任务上实现了0.519的多样性得分,显著优于BicycleGAN(0.191)和Pix2Pix+噪声(0.004)。
- 在SRGAN–CelebA任务中,该方法实现了0.050的多样性得分与0.52的真实感得分,优于SRGAN+噪声(0.005多样性,0.60真实感)。
- 在GLCIC–CelebA任务中,该方法实现了0.060的多样性得分与0.33的真实感得分,优于GLCIC+噪声(0.004多样性,0.28真实感)。
- MR 1与代理MR 1损失在性能上与MR 2及代理MR 2损失相当或更优,表明在许多情况下仅匹配均值可能已足够。
- 该方法在所有任务中均一致提升了多样性,同时保持或改善了真实感,证实时刻重建损失能有效解耦保真度与多样性的权衡。
- 人工评估确认生成样本具有高度真实感与多样性,其中代理MR 1损失在Pix2Pix–Cityscapes基准上取得了最高的多样性得分(0.519)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。