[论文解读] High-Quality Facial Photo-Sketch Synthesis Using Multi-Adversarial Networks
本文提出 PS²-MAN,一种用于高保真人脸照片-素描合成的多对抗生成对抗网络(GAN)框架,通过在多个特征图分辨率上应用对抗监督,生成高分辨率图像。通过在基于 CycleGAN 的结构中整合循环一致性损失与 L1 重建损失,该方法在 CUHK 和 CUFSF 数据集上均实现了图像质量与人脸匹配准确率的最先进性能。
Synthesizing face sketches from real photos and its inverse have many applications. However, photo/sketch synthesis remains a challenging problem due to the fact that photo and sketch have different characteristics. In this work, we consider this task as an image-to-image translation problem and explore the recently popular generative models (GANs) to generate high-quality realistic photos from sketches and sketches from photos. Recent GAN-based methods have shown promising results on image-to-image translation problems and photo-to-sketch synthesis in particular, however, they are known to have limited abilities in generating high-resolution realistic images. To this end, we propose a novel synthesis framework called Photo-Sketch Synthesis using Multi-Adversarial Networks, (PS2-MAN) that iteratively generates low resolution to high resolution images in an adversarial way. The hidden layers of the generator are supervised to first generate lower resolution images followed by implicit refinement in the network to generate higher resolution images. Furthermore, since photo-sketch synthesis is a coupled/paired translation problem, we leverage the pair information using CycleGAN framework. Both Image Quality Assessment (IQA) and Photo-Sketch Matching experiments are conducted to demonstrate the superior performance of our framework in comparison to existing state-of-the-art solutions. Code available at: https://github.com/lidan1/PhotoSketchMAN.
研究动机与目标
- 为解决从照片生成高分辨率、逼真素描,以及反向生成的挑战,该挑战源于照片与素描模态之间的域差距。
- 克服现有基于 GAN 的照片-素描合成方法在高分辨率下产生的伪影与真实感不足的问题。
- 通过提升照片-素描合成质量,改善下游匹配任务中的人脸识别性能。
- 利用成对数据与循环一致性训练,确保翻译过程中身份信息的保留。
- 开发一种多阶段生成框架,通过在每一级均应用对抗监督,从低分辨率到高分辨率逐步优化特征。
提出的方法
- 该框架采用两个生成器 $G_A$(照片到素描)和 $G_B$(素描到照片),在 CycleGAN 框架内训练,以实现无配对图像到图像的翻译。
- 在生成器的多个转解卷积层上应用对抗监督,实现从低分辨率到高分辨率特征图的渐进式优化。
- 采用多判别器架构,每个判别器在特定分辨率层级上评估生成图像的真实性,从而提升保真度并减少伪影。
- 训练目标结合了循环一致性损失与 L1 重建损失,以正则化生成器并保留身份与结构细节。
- 生成器架构采用编码器-解码器结构,结合步长大于 1 的卷积与转置卷积,并通过跳跃连接保留空间细节。
- 通过联合使用对抗损失、循环一致性损失与 L1 损失,实现端到端训练,确保生成结果具有真实感且分辨率高。
实验结果
研究问题
- RQ1在多个分辨率层级上进行多对抗训练,是否能提升照片-素描合成的逼真度并减少伪影?
- RQ2在 CycleGAN 框架中整合 L1 重建损失与循环一致性损失,是否能增强身份保留与合成质量?
- RQ3所提出的多阶段对抗生成器与单阶段 GAN 相比,在生成高分辨率人脸图像方面表现如何?
- RQ4PS²-MAN 框架在使用合成照片或素描时,对人脸识别性能的提升程度如何?
- RQ5该方法能否在不同素描风格(包括过度夸张的刑侦素描)下保持泛化能力?
主要发现
- 在 CUHK 数据集上,PS²-MAN 实现了 100% 的 rank-1 照片匹配率与 99% 的素描匹配率,优于所有基线方法。
- 在更具挑战性的 CUFSF 数据集上,PS²-MAN 实现了 47% 的 rank-1 照片匹配率与 51% 的素描匹配率,显著优于 Pix2Pix(37% 与 40%)和 CycleGAN(25% 与 44%)。
- 在 SSIM 与 FSIM 指标上,PS²-MAN 在照片与素描合成方面均取得最高分,SSIM 分别为 0.7915 与 0.6156,FSIM 分别为 0.8062 与 0.7361。
- 视觉对比显示,与 Pix2Pix、CycleGAN 和 DualGAN 相比,PS²-MAN 最小化了伪影,尤其是在面部特征区域。
- 消融研究证实,多分辨率层级上的多对抗监督显著提升了图像质量并减少了伪影。
- 循环一致性损失与 L1 重建损失的结合提供了有效的正则化,从而实现了更好的身份保留与更高的合成保真度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。