Skip to main content
QUICK REVIEW

[论文解读] Unpaired Photo-to-Caricature Translation on Faces in the Wild

Ziqiang Zheng, Chao Wang|arXiv (Cornell University)|Nov 29, 2017
Generative Adversarial Networks and Image Synthesis参考文献 42被引用 5
一句话总结

本文提出一种基于GAN的方法,用于在无约束的真实人脸图像上进行无配对的摄影图像到漫画像的转换,采用双路径生成器结合粗粒度和细粒度判别器、感知损失以及辅助噪声以实现风格控制。该方法在生成具有表现力、夸张且逼真的漫画像的同时,保持了面部表情和整体结构,实现了当前最先进的性能。

ABSTRACT

Recently, image-to-image translation has been made much progress owing to the success of conditional Generative Adversarial Networks (cGANs). And some unpaired methods based on cycle consistency loss such as DualGAN, CycleGAN and DiscoGAN are really popular. However, it's still very challenging for translation tasks with the requirement of high-level visual information conversion, such as photo-to-caricature translation that requires satire, exaggeration, lifelikeness and artistry. We present an approach for learning to translate faces in the wild from the source photo domain to the target caricature domain with different styles, which can also be used for other high-level image-to-image translation tasks. In order to capture global structure with local statistics while translation, we design a dual pathway model with one coarse discriminator and one fine discriminator. For generator, we provide one extra perceptual loss in association with adversarial loss and cycle consistency loss to achieve representation learning for two different domains. Also the style can be learned by the auxiliary noise input. Experiments on photo-to-caricature translation of faces in the wild show considerable performance gain of our proposed method over state-of-the-art translation methods as well as its potential real applications.

研究动机与目标

  • 解决摄影图像到漫画像转换中高层次图像到图像转换的挑战,该挑战需要夸张、讽刺、艺术性和逼真性。
  • 通过引入具有不同感受野的双判别器,提升判别器在区分真实面部结构与夸张特征方面的能力。
  • 通过引入额外的感知损失,对齐生成图像与目标域统计特征,从而增强特征一致性和感知质量。
  • 通过引入辅助噪声作为风格控制机制,实现风格多样性与鲁棒性。
  • 在多样化的无约束人脸数据集上展示模型的泛化能力与真实世界适用性,超越精心筛选的数据集。

提出的方法

  • 采用双路径GAN架构,包含两个判别器:一个粗粒度判别器专注于全局面部结构,一个细粒度判别器捕捉局部面部统计特征。
  • 生成器网络通过对抗损失、循环一致性损失以及额外的感知损失进行训练,以在夸张条件下保持身份一致性和增强真实感。
  • 将辅助噪声注入生成器,以解耦并控制夸张强度和艺术风格等风格属性。
  • 通过噪声增强训练提升模型鲁棒性,即使在高比例噪声输入下也能保持一致输出。
  • 在无配对的摄影图像与漫画像数据集上端到端训练模型,采用改进的CycleGAN目标并引入增强监督。
  • 感知损失通过预训练的VGG网络提取的特征计算,以强制输入图像与转换后图像之间的语义和结构一致性。

实验结果

研究问题

  • RQ1基于GAN的方法能否在无配对训练数据的情况下,有效学习将无约束的真实人脸照片转换为多样化、艺术化的漫画像?
  • RQ2使用双判别器(粗粒度与细粒度)是否能提升模型在夸张局部特征的同时保持全局面部结构的能力?
  • RQ3额外的感知损失在多大程度上提升了生成漫画像的真实感与身份保留能力?
  • RQ4辅助噪声能否被有效用于控制和多样化生成漫画像的艺术风格?
  • RQ5该模型在面对高噪声输入和复杂背景时,尤其在真实世界无约束人脸图像中,表现出多强的鲁棒性?

主要发现

  • 所提方法在多个基准测试(包括IIIT-CFW、PHOTO-SKETCH和CelebA)上优于当前最先进的无配对图像到图像转换方法,能够生成高质量的漫画像。
  • 双判别器设计显著提升了性能,使模型能够更好地捕捉全局面部布局与局部面部细节(如眼睛、鼻子和嘴巴)。
  • 引入感知损失后,生成的漫画像更具真实感且身份保留更佳,尤其在面部表情与器官对齐方面表现更优。
  • 辅助噪声注入实现了可控的风格变化,不同噪声比例可生成具有明显差异的艺术风格输出。
  • 模型对高噪声输入(最高达50%)表现出强鲁棒性,仍能保持有意义且连贯的漫画像生成。
  • 该方法在多样化数据集(包括KDEF、Yale、FEI和CelebA)上泛化良好,能在无约束人脸图像中保持情绪表达与结构一致性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。