[论文解读] Diverse Image Synthesis from Semantic Layouts via Conditional IMLE
本文提出一种基于条件IMLE的方法,用于从语义布局生成多样化图像,能够在不发生模式崩溃的情况下实现每张布局的任意数量图像生成。通过利用单一神经网络和噪声向量采样,该方法在多样性方面优于先前的SOTA方法(如CRN),同时生成更少的伪影,并在无监督条件下学习到语义结构化的潜在空间。
Most existing methods for conditional image synthesis are only able to generate a single plausible image for any given input, or at best a fixed number of plausible images. In this paper, we focus on the problem of generating images from semantic segmentation maps and present a simple new method that can generate an arbitrary number of images with diverse appearance for the same semantic layout. Unlike most existing approaches which adopt the GAN framework, our method is based on the recently introduced Implicit Maximum Likelihood Estimation (IMLE) framework. Compared to the leading approach, our method is able to generate more diverse images while producing fewer artifacts despite using the same architecture. The learned latent space also has sensible structure despite the lack of supervision that encourages such behaviour. Videos and code are available at https://people.eecs.berkeley.edu/~ke.li/projects/imle/scene_layouts/.
研究动机与目标
- 解决现有条件图像生成方法仅能为每个输入布局生成单个或固定数量图像的局限性。
- 实现在不发生模式崩溃的前提下,从同一语义布局生成任意数量多样化、高保真度图像。
- 在无显式监督条件下,学习一个解耦且语义有意义的噪声向量潜在空间。
- 相比基于GAN或多生成器的方法,提升训练稳定性并减少伪影。
提出的方法
- 采用隐式最大似然估计(IMLE)而非GAN框架,以避免训练过程中的模式崩溃。
- 使用单一前馈卷积神经网络,输入为语义布局和随机噪声向量,生成多样化图像。
- 基于预训练VGG网络的特征表示,采用感知损失进行训练,以优化图像质量和多样性。
- 引入噪声编码器以通过学习更结构化的噪声分布来提升多样性,同时采用再平衡方案增强训练稳定性。
- 使用潜在空间插值评估语义连续性,证明生成图像之间过渡平滑。
- 在不同语义布局间复用同一噪声向量,确保场景编辑过程中风格一致性。
实验结果
研究问题
- RQ1非GAN框架能否在不发生模式崩溃的前提下,从单一语义布局生成多样化、高保真度图像?
- RQ2仅通过采样不同的噪声向量,单一神经网络能否生成任意数量的多样化图像?
- RQ3所学习的潜在空间是否在无显式监督条件下展现出有意义的语义结构?
- RQ4与SOTA基线方法(如CRN和BicycleGAN)相比,该方法在多样性与伪影减少方面表现如何?
- RQ5当使用相同噪声向量时,模型能否在不同语义布局间保持一致的风格?
主要发现
- 我们的方法在所有模型和消融实验中取得了最高的LPIPS分数(0.19),表明生成图像的多样性最高。
- 人工评估显示,仅36.4%的由我们方法生成的图像表现出明显的合成图案,显著低于CRN的63.6%。
- 消融研究证实,噪声编码器和再平衡方案均至关重要,移除任一都会导致伪影率上升且多样性下降。
- 对白天与夜晚场景的噪声向量进行线性插值,产生了平滑且感知连贯的过渡,证明潜在空间具有语义结构。
- 在不同语义布局间复用同一噪声向量,成功保持了风格一致性,实现了具有统一视觉风格的有效场景编辑。
- 尽管与CRN采用相同架构,我们的方法生成的伪影更少、多样性更高,证明了IMLE框架的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。