[논문 리뷰] FENeRF: Face Editing in Neural Radiance Fields
FENeRF는 형태와 질감을 분리된 잠재 코드로 표현하고, GAN 역전치를 통해 공간적으로 정렬된 3D 볼륨에서 의미 및 질감 필드를 공동 최적화함으로써 단일 영상과 쌍체화된 의미 마스크만을 사용하여, 시각 일致성 있고 고해상도의 국소 편집이 가능한 3D 인식 포트레이트 생성 프레임워크를 제안한다. 이는 편집 정확도와 기하학적 정확도에서 기존 최고 성능(SOTA)을 초월한다.
Previous portrait image generation methods roughly fall into two categories: 2D GANs and 3D-aware GANs. 2D GANs can generate high fidelity portraits but with low view consistency. 3D-aware GAN methods can maintain view consistency but their generated images are not locally editable. To overcome these limitations, we propose FENeRF, a 3D-aware generator that can produce view-consistent and locally-editable portrait images. Our method uses two decoupled latent codes to generate corresponding facial semantics and texture in a spatial aligned 3D volume with shared geometry. Benefiting from such underlying 3D representation, FENeRF can jointly render the boundary-aligned image and semantic mask and use the semantic mask to edit the 3D volume via GAN inversion. We further show such 3D representation can be learned from widely available monocular image and semantic mask pairs. Moreover, we reveal that joint learning semantics and texture helps to generate finer geometry. Our experiments demonstrate that FENeRF outperforms state-of-the-art methods in various face editing tasks.
연구 동기 및 목표
- 2D GAN의 뷰 일관성 문제와 3D 인식 GAN의 국소 편집 불가능성 문제를 해결하기 위해 포트레이트 합성에서의 한계를 해결한다.
- 엄격한 뷰 일관성을 유지하면서 자유 뷰 포트레이트에 대한 상호작용적 국소 편집을 가능하게 한다.
- 단일 영상과 의미 마스크로부터 3D 인식 공간 정렬 표현을 학습하여 얼굴 의미, 기하학, 질감을 동시에 추출한다.
- 의미와 질량의 공동 학습을 통해 3D 기하학 품질을 향상시킨다.
- 스타일 트랜스퍼, 속성 편집, 스타일 믹싱과 같은 후속 응용을 3D 자유 뷰 환경에서 지원한다.
제안 방법
- 생성자는 형태를 위한 잠재 코드 $\mathbf{Z}_s$와 질감을 위한 잠재 코드 $\mathbf{Z}_t$를 분리하여, 공간적으로 정렬된 밀도, 의미, 질감 필드를 공유하는 3D 볼륨을 생성한다.
- 렌더링된 이미지의 고주파 세부 정보를 유지하기 위해, MLP에 학습 가능한 좌표 임bedding $e_{\text{coord}}$를 통합한다.
- 이중 판별자 구조를 사용한다: 이미지의 현실성에 대해 평가하는 색상 판별자 $D_c$와 이미지와 의미 맵 간의 콘텐츠 정렬도를 평가하는 의미 판별자 $D_s$.
- 실제 이미지를 잠재 코드로 역전치하는 GAN 역전치 기법을 활용하여, 3D 볼륨 내 의미 마스크의 조작을 통해 국소 편집을 가능하게 한다.
- 이미지 및 의미 지도의 공통 학습을 통해 공간 정렬을 보장하고, 기하학적 구조와 세부 정보 품질을 향상시킨다.
- 다중 뷰 또는 3D 지도 없이도 단일 영상와 쌍체화된 의미 마스크만을 사용하여 학습한다.
실험 결과
연구 질문
- RQ13D 인식 GAN 생성자로는 포트레이트 합성에서 시각 일관성과 국소 편집 가능성을 동시에 달성할 수 있는가?
- RQ2다중 뷰 또는 3D 지도 없이도 단일 영상와 의미 마스크를 효과적으로 활용하여 3D 인식 포트레이트 생성자를 학습시킬 수 있는가?
- RQ3의미와 질감의 공동 학습이 3D 기하학 재구성 품질을 향상시키는가?
- RQ4의미 마스크는 3D 포트레이트 기하학과 질감에 대한 상호작용적 국소 편집 인터페이스로 효과적으로 기능하는가?
- RQ5학습 가능한 좌표 임bedding의 통합이 생성된 포트레이트의 고주파 세부 정보 유지에 미치는 영향은 무엇인가?
주요 결과
- FENeRF는 CelebAMask-HQ와 FFHQ를 포함한 여러 벤치마크에서 시각 일관성, 편집 정확도, 기하학적 정확도에서 기존 최고 성능(SOTA)을 능가한다.
- 이미지 및 의미 지도의 공통 학습은 기하학적 품질 향상에 기여하며, 더 정확하고 부드러운 메쉬 및 깊이 맵 재구성 결과를 보여준다.
- 색상 브랜치에 학습 가능한 좌표 임bedding $e_{\text{coord}}$를 통합하면 날카운 이미지 세부 정보를 유지하면서 잡음 최소화가 가능하며, 초기 통합 또는 무시하는 것보다 우수한 성능을 보인다.
- GAN 역전치를 통한 의미 지도 편집은 얼굴 속성(예: 코 크기, 형태)을 정밀하게 국소적으로 조작할 수 있으며, 뷰 간 일관된 기하학과 질감을 유지한다.
- 이 방법은 스타일 믹싱, 스타일 트랜스퍼, 명시적 카메라 제어 기능을 갖춘 자유 뷰 애벌러 생성과 같은 복잡한 편집 작업을 성공적으로 지원한다.
- 절단 실험 결과 의미 지도 지도가 신뢰할 수 있는 기하학 학습을 위해 필수적임을 확인하였으며, 이미지 렌더링만으로는 정확한 얼굴 구조를 생성하기에는 부족함을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.