Skip to main content
QUICK REVIEW

[논문 리뷰] Controllable 3D Face Synthesis with Conditional Generative Occupancy Fields

Keqiang Sun, Shangzhe Wu|arXiv (Cornell University)|2022. 06. 16.
Face recognition and analysis인용 수 16
한 줄 요약

이 논문은 3D 모형 모델(3DMM) 메쉬를 통해 3D 형상 일致성을 강제하고, 세밀한 제어를 위해 3D 랜드마크 및 볼륨 왜곡 손실을 통합한 조건부 생성 점유도 필드(cGOF)를 사용하는 NeRF 기반의 조건부 3D 얼굴 합성 프레임워크를 제안한다. 이 방법은 최신 2D 기반 접근법에 비해 뛰어난 3D 제어 가능성과 고해상도의 3D 인식 얼굴 생성 성능을 달성한다.

ABSTRACT

Capitalizing on the recent advances in image generation models, existing controllable face image synthesis methods are able to generate high-fidelity images with some levels of controllability, e.g., controlling the shapes, expressions, textures, and poses of the generated face images. However, these methods focus on 2D image generative models, which are prone to producing inconsistent face images under large expression and pose changes. In this paper, we propose a new NeRF-based conditional 3D face synthesis framework, which enables 3D controllability over the generated face images by imposing explicit 3D conditions from 3D face priors. At its core is a conditional Generative Occupancy Field (cGOF) that effectively enforces the shape of the generated face to commit to a given 3D Morphable Model (3DMM) mesh. To achieve accurate control over fine-grained 3D face shapes of the synthesized image, we additionally incorporate a 3D landmark loss as well as a volume warping loss into our synthesis algorithm. Experiments validate the effectiveness of the proposed method, which is able to generate high-fidelity face images and shows more precise 3D controllability than state-of-the-art 2D-based controllable face synthesis methods. Find code and demo at https://keqiangsun.github.io/projects/cgof.

연구 동기 및 목표

  • 큰 자세 및 표정 변화에서 일관성 없는 결과를 유도하는 2D 기반의 제어 가능한 얼굴 합성의 한계를 해결하기 위해.
  • 명시적 3D 사전 지식을 활용하여 합성된 얼굴 이미지에서 정확한 3D 제어 가능성을 보장하기 위해.
  • 다양한 얼굴 형상과 표정에서 기하학적 일관성을 유지하면서도 고해상도 세부 사항을 유지하는 생성 모델을 개발하기 위해.
  • 3D 랜드마크 및 볼륨 왜곡과 같은 다중 감독 신호를 신경 렌더링 프레임워크에 통합하여 3D 형상 정확도를 향상시키기 위해.

제안 방법

  • 핵심 방법은 3DMM 메쉬를 조건으로 삼아 3D 표현의 형상 일관성을 강제하는 조건부 생성 점유도 필드(cGOF)를 사용한다.
  • 모델은 신경 렌더링 필드(내르프) 아키텍처를 사용하여 암묵적인 3D 얼굴 볼륨을 표현하고, 학습된 3D 기하학에서 새로운 시점의 렌더링을 수행한다.
  • 생성된 얼굴 랜드마크와 진짜 랜드마크 간의 키포인트 정렬을 향상시키기 위해 3D 랜드마크 손실을 도입한다.
  • 예측된 볼륨과 목표 볼륨 간의 변형을 최소화하여 생성된 3D 형상을 기준 3DMM 메쉬와 정렬하기 위해 볼륨 왜곡 손실을 적용한다.
  • 점유도 감독, 시각 합성, 랜드마크, 왜곡 손실을 포함한 다중 감독 신호를 통해 엔드 투 엔드로 프레임워크를 훈련시킨다.
  • 3DMM 파라미터에 대한 조건부 조건화는 추론 중에 정체성, 표정, 자세에 대한 분리된 제어를 가능하게 한다.

실험 결과

연구 질문

  • RQ1명시적 3D 사전 지식인 3DMM 메쉬를 활용함으로써 신경 암묵적 필드 모델이 얼굴 합성에서 정밀한 3D 제어 가능성을 달성할 수 있는가?
  • RQ23D 랜드마크 및 볼륨 왜곡 감독을 통합할 경우, 표준 시각 합성 손실만을 사용하는 것에 비해 기하학적 정확도가 어떻게 향상되는가?
  • RQ3제안된 cGOF 프레임워크는 큰 자세 및 표정 변화를 다룰 때 2D 기반의 제어 가능한 얼굴 합성 방법에 비해 어느 정도 뛰어난 성능을 보이는가?
  • RQ4모델은 다양한 조건에서 고해상도의, 시점 일관성이 있는 3D 인식 얼굴 이미지를 생성하면서도 정확한 3D 형상 구조를 유지할 수 있는가?

주요 결과

  • 제안된 방법은 특히 큰 자세 및 표정 변화 상황에서 최신 2D 기반 얼굴 합성 방법에 비해 훨씬 뛰어난 3D 제어 가능성을 확보한다.
  • 3D 랜드마크 및 볼륨 왜곡 손실의 통합은 향상된 랜드마크 정렬과 감소된 형상 이탈을 통해 더 정확한 3D 얼굴 기하학을 보여준다.
  • 모델은 도전적인 조건에서도 일관된 3D 기하학을 유지하면서 고해상도의, 시점 일관성이 있는 얼굴 이미지를 생성한다.
  • 정량적 평가 결과, 기준 방법에 비해 3D 형상 복원 메트릭스(예: 3DMM 파라미터 복원 오차, 랜드마크 정확도)에서 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.