Skip to main content
QUICK REVIEW

[论文解读] FacialGAN: Style Transfer and Attribute Manipulation on Synthetic Faces

Ricard Durall, Jireh Jam|arXiv (Cornell University)|Oct 18, 2021
Face recognition and analysis被引用 8
一句话总结

FacialGAN 提出了一种统一框架,可在合成人脸图像上实现同时进行风格迁移与交互式面部属性操控,利用分割掩码实现细粒度控制,并通过多目标优化实现高保真结果。该方法在身份保持(89.8% 准确率)和属性迁移方面均达到当前最优性能,优于先前方法在风格迁移与几何感知编辑方面的表现。

ABSTRACT

Facial image manipulation is a generation task where the output face is shifted towards an intended target direction in terms of facial attribute and styles. Recent works have achieved great success in various editing techniques such as style transfer and attribute translation. However, current approaches are either focusing on pure style transfer, or on the translation of predefined sets of attributes with restricted interactivity. To address this issue, we propose FacialGAN, a novel framework enabling simultaneous rich style transfers and interactive facial attributes manipulation. While preserving the identity of a source image, we transfer the diverse styles of a target image to the source image. We then incorporate the geometry information of a segmentation mask to provide a fine-grained manipulation of facial attributes. Finally, a multi-objective learning strategy is introduced to optimize the loss of each specific tasks. Experiments on the CelebA-HQ dataset, with CelebAMask-HQ as semantic mask labels, show our model's capacity in producing visually compelling results in style transfer, attribute manipulation, diversity and face verification. For reproducibility, we provide an interactive open-source tool to perform facial manipulations, and the Pytorch implementation of the model.

研究动机与目标

  • 解决现有方法仅聚焦于风格迁移或属性迁移的局限性,缺乏交互性与细粒度控制。
  • 实现在保留源身份的前提下,同时进行高质量的风格迁移与像素级属性操控。
  • 通过将分割掩码作为几何引导信号,整合以克服以往模型在可扩展性与真实感方面的缺陷,实现局部化编辑。
  • 提供用户友好的交互式工具,支持实时面部操控,提升研究与工业应用中的可复现性与实用性。

提出的方法

  • 整合风格编码器与内容感知生成器,将参考图像中的多样化风格迁移到源图像,同时保持身份一致性。
  • 使用分割掩码作为几何引导信号,实现对面部属性(如眼睛、鼻子、嘴巴)的细粒度、局部化操控。
  • 应用结合对抗损失、身份保持损失、属性一致性损失与分割掩码一致性损失的多目标损失函数。
  • 通过判别器训练生成器,以确保在极端掩码修改下生成的人脸依然保持逼真。
  • 利用预训练的分割模型(CelebAMask-HQ)在训练过程中生成精确的解析图以提供监督。
  • 通过允许用户实时修改分割掩码,实现交互式编辑,模型据此生成相应的逼真人脸图像。

实验结果

研究问题

  • RQ1统一的生成框架是否能同时在合成人脸图像上实现高保真风格迁移与细粒度、交互式属性操控?
  • RQ2与全局属性迁移相比,集成分割掩码引导如何提升面部属性编辑的精度与多样性?
  • RQ3在结合风格迁移与属性操控时,模型在面对涉及大尺度几何变化的目标属性时,身份保持能力如何?
  • RQ4多目标训练策略如何在竞争性目标(如风格迁移、身份保持、掩码一致性)之间取得平衡,以生成高质量输出?
  • RQ5当分割掩码包含不切实际或不一致结构时,模型的失效模式是什么?

主要发现

  • 在同时应用风格迁移与属性操控时,FacialGAN 的身份保持面部识别准确率达到 89.8%,优于基线方法在类似条件下的表现。
  • 男性属性迁移准确率达到 100%,微笑属性迁移准确率为 81.4%,显著优于先前方法如 MaskGAN(77.3%)与 SPADE(73.8%)。
  • 输入掩码与预测解析结果之间的像素级分割一致性达到 96.40%(所有属性),各属性单独准确率分别为:眼睛 98.39%、鼻子 99.30%、嘴巴 98.78%。
  • 即使在极端掩码修改(如放大眼睛或眉毛)下,模型仍能生成逼真的人脸,表明其对大规模几何变化具有鲁棒性。
  • 框架保持了高视觉质量与真实感,定性结果表明面部结构连贯,属性过渡自然可信。
  • 当掩码包含不现实配置(如缺失眼睛)时,模型开始忽略掩码输入,这是由于判别器约束导致的现实感与编辑自由度之间的权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。