Skip to main content
QUICK REVIEW

[论文解读] FENeRF: Face Editing in Neural Radiance Fields

Jingxiang Sun, Xuan Wang|arXiv (Cornell University)|Nov 30, 2021
Face recognition and analysis被引用 4
一句话总结

FENeRF 提出了一种3D感知、可局部编辑的人像生成框架,通过解耦的潜在码分别表示形状与纹理,并通过对抗生成网络反演,在空间对齐的3D体积中联合优化语义场与纹理场。该方法仅使用单目图像和配对的语义掩码,实现了视图一致且高保真度的编辑,优于当前最先进方法在编辑保真度与几何精度方面的表现。

ABSTRACT

Previous portrait image generation methods roughly fall into two categories: 2D GANs and 3D-aware GANs. 2D GANs can generate high fidelity portraits but with low view consistency. 3D-aware GAN methods can maintain view consistency but their generated images are not locally editable. To overcome these limitations, we propose FENeRF, a 3D-aware generator that can produce view-consistent and locally-editable portrait images. Our method uses two decoupled latent codes to generate corresponding facial semantics and texture in a spatial aligned 3D volume with shared geometry. Benefiting from such underlying 3D representation, FENeRF can jointly render the boundary-aligned image and semantic mask and use the semantic mask to edit the 3D volume via GAN inversion. We further show such 3D representation can be learned from widely available monocular image and semantic mask pairs. Moreover, we reveal that joint learning semantics and texture helps to generate finer geometry. Our experiments demonstrate that FENeRF outperforms state-of-the-art methods in various face editing tasks.

研究动机与目标

  • 为解决2D GAN在视图不一致性方面的局限性,以及3D感知GAN在人像合成中缺乏局部可编辑性的问题。
  • 实现在严格视图一致性下,对自由视角人像进行交互式、局部编辑。
  • 从单目图像和语义掩码中学习3D感知、空间对齐的面部语义、几何与纹理表示。
  • 通过语义与纹理的联合学习,提升3D几何质量。
  • 支持风格迁移、属性编辑与风格混合等下游应用,适用于3D自由视角场景。

提出的方法

  • 生成器使用两个解耦的潜在码 $\mathbf{Z}_s$(形状)与 $\mathbf{Z}_t$(纹理),生成共享的3D体积,其中包含空间对齐的密度场、语义场与纹理场。
  • 可学习的坐标嵌入 $e_{\text{coord}}$ 被注入MLP中,以在渲染图像中保留高频细节。
  • 模型采用双Discriminator结构:颜色判别器 $D_c$ 负责图像真实感,语义判别器 $D_s$ 负责图像与语义图之间的内容对齐。
  • 通过对抗生成网络反演将真实图像映射为潜在码,实现通过在3D体积中操作语义掩码来实现局部编辑。
  • 联合训练时同时引入图像与语义监督,确保空间对齐,提升几何与细节质量。
  • 方法在仅含单目图像与配对语义掩码的数据上进行训练,无需多视角或3D监督。

实验结果

研究问题

  • RQ13D感知的GAN生成器能否在人像合成中同时实现视图一致性和局部可编辑性?
  • RQ2能否有效利用单目图像与语义掩码,在无需多视角或3D监督的情况下训练3D感知的人像生成器?
  • RQ3语义与纹理的联合学习是否能提升3D几何重建质量?
  • RQ4语义掩码能否作为交互式、局部化编辑3D人像几何与纹理的有效接口?
  • RQ5可学习的坐标嵌入在生成人像中对高频细节保留的影响如何?

主要发现

  • FENeRF 在多个基准测试(包括 CelebAMask-HQ 与 FFHQ)中,于视图一致性、编辑保真度与几何精度方面均优于当前最先进方法。
  • 联合使用图像与语义监督显著提升了几何质量,表现为重建网格与深度图更准确、更平滑。
  • 在颜色分支中引入可学习坐标嵌入 $e_{\text{coord}}$ 能够保留锐利的图像细节,同时最小化伪影,优于早期注入或完全省略的方式。
  • 通过对抗生成网络反演实现的语义图编辑,可实现对人脸属性(如鼻部大小、形状)的精确、局部化操控,且在不同视角下保持几何与纹理的一致性。
  • 该方法成功支持复杂编辑任务,如风格混合、风格迁移与支持显式相机控制的自由视角虚拟人像生成。
  • 消融实验证实,语义监督对可靠几何学习至关重要,仅依赖图像渲染无法生成准确的人脸结构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。