[论文解读] GuidedStyle: Attribute Knowledge Guided Style Manipulation for Semantic Face Editing
GuidedStyle 提出了一种新颖的框架,用于在 StyleGAN 中实现解耦且可控的语义人脸编辑,通过使用预训练的人脸属性分类器和稀疏注意力机制,仅选择一个风格层进行编辑,从而引导潜在空间的操控。该方法在合成图像和真实人脸(包括艺术肖像)上均优于当前最先进方法,在身份保持和属性解耦方面表现卓越。
Although significant progress has been made in synthesizing high-quality and visually realistic face images by unconditional Generative Adversarial Networks (GANs), there still lacks of control over the generation process in order to achieve semantic face editing. In addition, it remains very challenging to maintain other face information untouched while editing the target attributes. In this paper, we propose a novel learning framework, called GuidedStyle, to achieve semantic face editing on StyleGAN by guiding the image generation process with a knowledge network. Furthermore, we allow an attention mechanism in StyleGAN generator to adaptively select a single layer for style manipulation. As a result, our method is able to perform disentangled and controllable edits along various attributes, including smiling, eyeglasses, gender, mustache and hair color. Both qualitative and quantitative results demonstrate the superiority of our method over other competing methods for semantic face editing. Moreover, we show that our model can be also applied to different types of real and artistic face editing, demonstrating strong generalization ability.
研究动机与目标
- 为解决无条件 GAN 在语义人脸编辑中控制性不足的问题,特别是针对微笑、眼镜等特定属性的编辑。
- 克服潜在空间编辑中的特征纠缠问题,即修改某一属性时意外影响其他属性。
- 实现在不依赖潜在空间中预定义线性方向的前提下,实现可控且解耦的编辑。
- 在多样化的脸部分布上实现泛化,包括真实图像和艺术肖像,超越合成训练数据的限制。
- 在联合学习框架中将生成模型与预训练的属性分类器统一,以实现语义引导。
提出的方法
- 基于预训练的人脸属性分类器的知识网络,为潜在空间中的操控网络提供监督信号。
- 稀疏注意力机制动态选择 StyleGAN 生成器中的单个风格层进行目标属性编辑,增强解耦性。
- 通过属性分类器的预测结果作为监督信号,联合训练生成器与操控网络,确保属性更改的正确性。
- 该方法在 StyleGAN2 的潜在空间中运行,可在保持身份和其他面部属性的同时实现高保真度编辑。
- 基于投影的推理流程通过先将真实人脸图像编码到潜在空间,实现对真实图像的编辑。
- 采用 FID、SWD、余弦相似度和欧氏距离对方法进行评估,以衡量图像质量和身份保持程度。
实验结果
研究问题
- RQ1来自预训练分类器的属性引导知识是否能提升 StyleGAN 中语义人脸编辑的可控性与解耦性?
- RQ2通过注意力机制自适应选择单个风格层,是否能带来更精确且隔离的属性编辑?
- RQ3所提出的方法是否能泛化到训练分布之外的真实人脸图像与艺术肖像?
- RQ4该方法在定量与定性上与现有最先进的人脸编辑技术相比表现如何?
- RQ5该方法在多大程度上保持了身份特征,并避免对非目标属性的意外更改?
主要发现
- GuidedStyle 实现了 41.79 的 Fréchet Inception 距离(FID),显著优于 InterFaceGAN(49.90)和 Image2StyleGAN(53.08),表明图像质量与分布相似性更优。
- 该方法实现了 0.64 的余弦相似度(CS)与 0.79 的欧氏距离(ED),相比竞争方法展现出更强的身份保持能力。
- 定性结果表明,对微笑、眼镜、胡须和发色等属性的编辑高度解耦,对其他面部特征的非预期影响极小。
- 该模型在艺术肖像上也表现出有效的泛化能力,成功编辑了眼镜与面部表情等属性,同时保持了合适的画框适配与色彩一致性。
- 在真实人脸图像上,该方法成功添加了逼真的眼镜,而未改变姿态、肤色或发型,证实了其强大的泛化能力。
- 稀疏注意力机制实现了对单一风格层的聚焦编辑,有助于提升编辑的解耦性与对属性操控的控制力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。