Skip to main content
QUICK REVIEW

[论文解读] MagGAN: High-Resolution Face Attribute Editing with Mask-Guided Generative Adversarial Network

Yi Wei, Zhe Gan|arXiv (Cornell University)|Oct 3, 2020
Face recognition and analysis参考文献 45被引用 6
一句话总结

MagGAN 提出了一种基于掩码引导的生成对抗网络,用于高分辨率(1024×1024)人脸属性编辑,利用预训练解析器生成的语义人脸掩码,精确引导局部编辑,同时保留属性无关区域。通过掩码引导的重建损失、新颖的掩码引导条件机制以及多层级局部感受野判别器,该方法在图像质量和编辑精度方面显著优于先前方法,达到当前最优性能。

ABSTRACT

We present Mask-guided Generative Adversarial Network (MagGAN) for high-resolution face attribute editing, in which semantic facial masks from a pre-trained face parser are used to guide the fine-grained image editing process. With the introduction of a mask-guided reconstruction loss, MagGAN learns to only edit the facial parts that are relevant to the desired attribute changes, while preserving the attribute-irrelevant regions (e.g., hat, scarf for modification `To Bald'). Further, a novel mask-guided conditioning strategy is introduced to incorporate the influence region of each attribute change into the generator. In addition, a multi-level patch-wise discriminator structure is proposed to scale our model for high-resolution ($1024 imes 1024$) face editing. Experiments on the CelebA benchmark show that the proposed method significantly outperforms prior state-of-the-art approaches in terms of both image quality and editing performance.

研究动机与目标

  • 解决人脸属性编辑中定位不准确的问题,即无关区域(如帽子、围巾)被意外修改。
  • 实现高分辨率(1024×1024)人脸属性编辑,该问题在以往研究中仍较少被探索。
  • 通过利用语义人脸掩码,仅在属性相关区域进行引导,提升编辑保真度。
  • 开发一种显式建模每种属性变化空间影响区域的条件机制。
  • 通过多层级局部感受野判别器,稳定训练过程并提升高分辨率生成的逼真度。

提出的方法

  • 引入一种掩码引导的重建损失,仅约束由预训练人脸解析器识别出的属性相关面部区域进行编辑,从而保留帽子、围巾等属性无关区域。
  • 提出一种新颖的掩码引导条件机制,学习每种属性变化对应的空间对齐影响区域,提升属性编辑与目标面部部位之间的对齐精度。
  • 采用具有从粗到精感受野的多层级局部感受野判别器,以稳定训练过程并提升1024×1024图像生成的逼真度。
  • 利用预定义的属性-面部部件关系矩阵(AR⁺, AR⁻)编码属性与面部组件之间的语义关系,同时指导重建与条件生成。
  • 在STGAN架构基础上构建编码器-解码器框架,并引入差异属性向量输入,通过掩码监督与空间条件机制进行扩展。
  • 利用预训练人脸解析器生成软分割掩码,为细粒度编辑提供几何与语义约束。

实验结果

研究问题

  • RQ1语义人脸掩码能否通过仅限制在相关面部区域进行编辑,从而提升人脸属性编辑的定位准确性?
  • RQ2如何将属性变化信息基于空间感知表示进行条件建模,以避免对无关区域的意外修改?
  • RQ3何种网络架构设计能够实现1024×1024人脸属性编辑的稳定且高质量训练?
  • RQ4与标准GAN方法相比,掩码引导监督在图像保真度与编辑一致性方面提升程度如何?
  • RQ5该模型能否在多样化属性编辑中保持身份与背景细节的一致性?

主要发现

  • 在CelebA基准上,MagGAN在图像质量和编辑性能方面显著优于当前最优方法(如STGAN),用户研究结果验证了这一点。
  • 用户研究表明,尽管STGAN产生的编辑效果更明显,但MagGAN更受青睐,因其避免了对帽子、围巾等属性无关区域的修改。
  • 掩码引导的重建损失有效保留了不可编辑区域,减少了帽子、围巾等属性无关区域的伪影。
  • 多层级局部感受野判别器实现了1024×1024分辨率下的稳定训练与高保真度生成,发丝与皮肤等精细细节得到良好保留。
  • 定量评估显示,重建图像的PSNR与SSIM值更高,表明在无属性变化时,重建结果与原始输入的保真度更高。
  • 属性-面部部件关系矩阵(AR⁺, AR⁻)实现了属性变化到特定面部组件的精确映射,显著提升了编辑精度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。