Skip to main content
QUICK REVIEW

[论文解读] Training and Tuning Generative Neural Radiance Fields for Attribute-Conditional 3D-Aware Face Generation

Jichao Zhang, Aliaksandr Siarohin|arXiv (Cornell University)|Aug 26, 2022
Generative Adversarial Networks and Image Synthesis被引用 6
一句话总结

本文提出了一种用于3D感知人脸生成的条件生成神经辐射场(GNeRF)模型,实现解耦属性控制。通过引入带有归一化流模块和潜在变量优化的‘训练即初始化’与‘为微调而优化’(TRIOT)方法,该模型在保持身份和几何结构的同时,实现了高保真度、视角一致的编辑,其属性编辑精度和3D一致性优于先前方法。

ABSTRACT

Generative Neural Radiance Fields (GNeRF)-based 3D-aware GANs have showcased remarkable prowess in crafting high-fidelity images while upholding robust 3D consistency, particularly face generation. However, specific existing models prioritize view consistency over disentanglement, leading to constrained semantic or attribute control during the generation process. While many methods have explored incorporating semantic masks or leveraging 3D Morphable Models (3DMM) priors to imbue models with semantic control, these methods often demand training from scratch, entailing significant computational overhead. In this paper, we propose a novel approach: a conditional GNeRF model that integrates specific attribute labels as input, thus amplifying the controllability and disentanglement capabilities of 3D-aware generative models. Our approach builds upon a pre-trained 3D-aware face model, and we introduce a Training as Init and Optimizing for Tuning (TRIOT) method to train a conditional normalized flow module to enable the facial attribute editing, then optimize the latent vector to improve attribute-editing precision further. Our extensive experiments substantiate the efficacy of our model, showcasing its ability to generate high-quality edits with enhanced view consistency while safeguarding non-target regions. The code for our model is publicly available at https://github.com/zhangqianhui/TT-GNeRF.

研究动机与目标

  • 解决现有3D感知GAN在人脸生成中语义解耦不足和属性控制不精确的问题。
  • 在保持3D几何结构和多视角身份一致性的同时,实现对人脸属性的细粒度、属性条件化编辑。
  • 开发一种高效的微调框架,在不重新训练主干GNeRF模型的前提下提升编辑精度。
  • 支持复杂编辑任务,如多属性编辑和基于参考的几何迁移。

提出的方法

  • 该方法基于预训练的3D感知GNeRF主干网络,避免重新训练。
  • 引入一种条件化归一化流模块,通过‘训练即初始化’策略进行训练,以实现潜在空间的解耦操作。
  • 提出两阶段TRIOT框架:第一阶段训练流模块;第二阶段优化潜在码以提升属性编辑精度。
  • 优化阶段采用多分量损失函数,结合纹理一致性和几何一致性,以保护非目标区域。
  • 通过优化潜在码使生成结果匹配参考网格,同时保持外观特征,实现基于参考的几何迁移。
  • 通过重建3D感知人脸模型并应用属性编辑,实现真实图像的GAN反演。

实验结果

研究问题

  • RQ1能否有效利用属性标签来条件化3D感知GAN,实现解耦的人脸属性编辑?
  • RQ2如何在不重新训练主干模型的前提下,在3D感知GAN中实现潜在空间的解耦?
  • RQ3何种优化策略能在保证属性编辑精度的同时,兼顾身份和几何结构的保留?
  • RQ4所提方法能否支持复杂编辑任务,如多属性编辑和基于参考的几何迁移?
  • RQ5在视角一致性和编辑保真度方面,该方法与先前方法相比表现如何?

主要发现

  • 所提出的TRIOT方法在属性编辑精度方面表现优越,相较于基线方法在CA(属性准确率)和LP(LPIPS)得分上均有定量提升。
  • 优化阶段显著提升了身份和几何结构的保留效果,尤其在非目标区域(如头发和背景)方面,定性对比结果表明效果明显。
  • 在100–150次优化步骤下,该方法在编辑精度与身份保留之间达到最佳平衡,LP和CA得分的下降趋势验证了这一点。
  • 即使在连续编辑多个属性(如表情、性别、发色)后,模型仍能保持强大的3D视角一致性。
  • 通过优化潜在码使其匹配参考网格,同时保留外观特征(包括身份和纹理),成功实现了基于参考的几何迁移。
  • 该方法实现了高质量的GAN反演,能够对真实图像生成准确的重建结果,并在非目标区域保持最小失真,实现精确的属性编辑。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。