[论文解读] Example-Guided Style Consistent Image Synthesis from Semantic Labeling
本文提出了一种基于条件生成对抗网络(conditional GAN)的框架,用于从语义标签图生成风格一致的图像,采用新颖的风格一致性判别器、自适应语义一致性损失以及数据采样策略。该方法在人脸、舞蹈和街景合成任务中均实现了逼真、语义准确且风格一致的生成结果,在定性和定量评估中均优于现有方法。
Example-guided image synthesis aims to synthesize an image from a semantic label map and an exemplary image indicating style. We use the term "style" in this problem to refer to implicit characteristics of images, for example: in portraits "style" includes gender, racial identity, age, hairstyle; in full body pictures it includes clothing; in street scenes, it refers to weather and time of day and such like. A semantic label map in these cases indicates facial expression, full body pose, or scene segmentation. We propose a solution to the example-guided image synthesis problem using conditional generative adversarial networks with style consistency. Our key contributions are (i) a novel style consistency discriminator to determine whether a pair of images are consistent in style; (ii) an adaptive semantic consistency loss; and (iii) a training data sampling strategy, for synthesizing style-consistent results to the exemplar.
研究动机与目标
- 为解决从抽象语义标签图生成逼真图像,同时保持与输入标签图语义一致性和与参考图像风格一致性的挑战。
- 克服现有方法在高分辨率生成中难以同时保持语义保真度与参考图像风格的问题。
- 开发一种弱监督训练策略,利用视频数据学习风格一致性,而无需为每个标签-参考图像组合提供配对的真实标签图像。
- 实现在肖像、全身姿态和场景解析等多样化领域中的灵活、示例引导式图像生成。
- 在图像生成任务中实现最先进的性能,兼具强风格一致性和语义一致性。
提出的方法
- 引入一种风格一致性判别器,通过基于块的对抗性损失评估生成图像与参考图像是否具有相同风格。
- 提出一种自适应语义一致性损失,根据特征在保持标签图保真度中的重要性动态调整权重。
- 采用一种数据采样策略,从视频序列中选取风格一致和风格不一致的图像对,用于训练风格判别器。
- 基于 pix2pixHD 架构构建,以确保生成图像的逼真度,同时集成风格感知组件。
- 采用条件生成对抗网络框架,其中生成器以语义标签图和参考图像作为输入,输出风格化且逼真的图像。
- 应用多组件损失函数,结合对抗性损失、感知损失(VGG)和语义一致性损失,以优化生成器。
实验结果
研究问题
- RQ1条件生成对抗网络框架能否有效在从抽象语义标签图生成逼真图像时,保持参考图像的风格?
- RQ2在不为每个标签-参考图像组合提供真实配对图像的情况下,如何实现风格一致性的强制约束?
- RQ3在图像生成中,哪些损失组件和训练策略最有效,以同时实现语义一致性和风格一致性?
- RQ4该模型能否泛化到未见过的参考图像以及多样化领域,如人脸、舞蹈姿态和街景?
- RQ5与现有图像到图像转换和风格迁移方法相比,该方法在定性和定量评估中表现如何?
主要发现
- 在 Sketch → Face 生成任务中,所提方法的 Fréchet Inception Distance (FID) 达到 31.26,优于包括 pix2pixHD 和 PairedMUNIT 在内的基线方法。
- 在人类偏好评估中,该方法在风格一致性方面优于 PairedMUNIT 的比例为 90.88%,优于 pix2pixHD 的比例为 89.12%。
- 消融实验表明,若移除自适应权重,FID 上升至 35.59;若移除风格一致性对抗性损失,FID 上升至 58.08,证实了二者的重要性。
- 在街景生成任务中,该模型的语义一致性分数(SPS)达到 0.333,优于 pix2pixHD(0.310)和 PairedMUNIT(0.160)。
- 生成图像与参考图像之间的 VGG 特征距离为 0.643,表明具有较强的感知相似性;当移除语义一致性损失后,该距离上升至 0.898。
- 定性结果表明,即使参考图像与标签图在内容上(如背景或场景细节)不完全对齐,该模型仍能生成逼真且风格一致的图像。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。