Skip to main content
QUICK REVIEW

[论文解读] Controllable 3D Face Synthesis with Conditional Generative Occupancy Fields

Keqiang Sun, Shangzhe Wu|arXiv (Cornell University)|Jun 16, 2022
Face recognition and analysis被引用 16
一句话总结

本文提出了一种基于NeRF的条件3D人脸生成框架,采用条件生成占据场(cGOF),通过3D可变形模型(3DMM)网格强制实现3D形状一致性,同时结合3D关键点损失和体素形变损失以实现细粒度控制。与最先进2D方法相比,该方法在3D可控性和高保真度3D感知人脸生成方面表现更优。

ABSTRACT

Capitalizing on the recent advances in image generation models, existing controllable face image synthesis methods are able to generate high-fidelity images with some levels of controllability, e.g., controlling the shapes, expressions, textures, and poses of the generated face images. However, these methods focus on 2D image generative models, which are prone to producing inconsistent face images under large expression and pose changes. In this paper, we propose a new NeRF-based conditional 3D face synthesis framework, which enables 3D controllability over the generated face images by imposing explicit 3D conditions from 3D face priors. At its core is a conditional Generative Occupancy Field (cGOF) that effectively enforces the shape of the generated face to commit to a given 3D Morphable Model (3DMM) mesh. To achieve accurate control over fine-grained 3D face shapes of the synthesized image, we additionally incorporate a 3D landmark loss as well as a volume warping loss into our synthesis algorithm. Experiments validate the effectiveness of the proposed method, which is able to generate high-fidelity face images and shows more precise 3D controllability than state-of-the-art 2D-based controllable face synthesis methods. Find code and demo at https://keqiangsun.github.io/projects/cgof.

研究动机与目标

  • 为解决2D方法在大姿态和表情变化下常产生不一致结果的局限性。
  • 通过利用显式3D先验,实现在合成人脸图像中的精确3D可控性。
  • 开发一种生成模型,在保持高保真细节的同时,确保在不同人脸形状和表情下的几何一致性。
  • 将多监督信号——3D关键点和体素形变——整合到神经渲染框架中,以提升3D形状保真度。

提出的方法

  • 核心方法采用条件生成占据场(cGOF),通过3DMM网格对隐式3D表示进行条件化,以强制实现形状一致性。
  • 模型使用神经辐射场(NeRF)架构,隐式表示3D人脸体素,并从学习到的3D几何中渲染新视角。
  • 引入3D关键点损失,以监督生成结果与真实人脸关键点之间的对齐,提升局部形状准确性。
  • 应用体素形变损失,通过最小化预测体积与目标体积之间的形变,将生成的3D形状与参考3DMM网格对齐。
  • 框架采用端到端训练,结合多监督信号:占据监督、视图合成、关键点和形变损失。
  • 通过3DMM参数的条件控制,可在推理阶段实现身份、表情和姿态的解耦控制。

实验结果

研究问题

  • RQ1通过利用如3DMM网格等显式3D先验,神经隐式场模型是否能在人脸生成中实现精确的3D可控性?
  • RQ2与仅使用标准视图合成损失相比,引入3D关键点和体素形变监督在3D人脸生成中如何提升几何保真度?
  • RQ3所提出的cGOF框架在处理大姿态和表情变化时,相较于2D方法在多大程度上表现更优?
  • RQ4该模型是否能够在各种条件下生成高保真、视角一致的3D感知人脸图像,同时保持准确的3D形状结构?

主要发现

  • 所提方法在3D可控性方面显著优于最先进2D方法,尤其在大姿态和表情变化下表现更优。
  • 3D关键点和体素形变损失的整合显著提升了3D人脸几何的准确性,表现为关键点对齐改善和形状偏差降低。
  • 模型生成了高保真、视角一致的3D人脸图像,即使在挑战性条件下也能保持一致的3D结构。
  • 定量评估显示,在3D形状重建指标(如3DMM参数重建误差和关键点准确性)方面,该方法优于基线方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。