[논문 리뷰] Portrait Neural Radiance Fields from a Single Image
논문은 라이트 스테이지 초상화 데이터셋에서 메타러닝으로 NeRF를 사전 학습하고 입력 주체를 일반 얼굴 공간에서 미세 조정하여 단일 헤드샷으로 초상화 Neural Radiance Fields를 합성하는 방법을 제시합니다.
We present a method for estimating Neural Radiance Fields (NeRF) from a single headshot portrait. While NeRF has demonstrated high-quality view synthesis, it requires multiple images of static scenes and thus impractical for casual captures and moving subjects. In this work, we propose to pretrain the weights of a multilayer perceptron (MLP), which implicitly models the volumetric density and colors, with a meta-learning framework using a light stage portrait dataset. To improve the generalization to unseen faces, we train the MLP in the canonical coordinate space approximated by 3D face morphable models. We quantitatively evaluate the method using controlled captures and demonstrate the generalization to real portrait images, showing favorable results against state-of-the-arts.
연구 동기 및 목표
- 하나의 이미지로 초상화의 사진 수준의 시점 합성을 가능하게 한다.
- 여러 장의 촬영 없이 보지 못한 피사체에 NeRF를 일반화한다.
- 헤어, 상안면, 상체를 다루기 위해 표준 얼굴 공간을 통한 얼굴 기하학 사전 정보를 도입한다.
- 정량적 평가를 위한 다중 시점 초상 데이터셋을 제공한다.
- 새 시점 합성 및 원근/시야(FOV) 조작과 같은 응용을 보여준다.
제안 방법
- 일반 얼굴 사전을 학습하기 위해 라이트 스테이지 초상 데이터셋에서 MLP 기반 NeRF를 사전 학습한다.
- 3D 모핑 모델 기하학에서 유도된 강체 변환을 사용해 세계 좌표를 표준 얼굴 공간으로 매핑한다.
- 단일 입력 전면 뷰에서 사전 학습된 NeRF를 미세 조정하여 대상(subject, theta_s)에 적합하게 한다.
- 광선들을 표준 공간으로 왜곡한 후 볼륨 렌더링을 통해 새로운 시점을 렌더링한다.
- 그라디언트 기반 메타러닝으로 학습하여 보지 못한 피사체에 신속히 적응할 수 있게 한다.
- 헤어스타일, 악세서리, 상두부 영역 전반에서 일반화와 사실감을 높이기 위해 표준 좌표를 사용한다.
실험 결과
연구 질문
- RQ1단일 초상 이미지에서 NeRF를 효과적으로 학습시켜 동일 피사체의 새로운 시점을 합성할 수 있는가?
- RQ2메타 러닝과 표준 얼굴 공간이 보지 못한 피사체에 대한 일반화를 향상시키는가?
- RQ3제안된 방법이 제어된 데이터와 실제 데이터에서 최신 초상 뷰 합성 방법과 어떻게 비교되는가?
- RQ4학습 데이터 규모와 입력 뷰 수가 합성 품질에 미치는 영향은?
- RQ5실세계 이미지에 단일 이미지 초상 NeRF를 적용할 때의 한계와 실패 모드은 무엇인가?
주요 결과
- 당사 방법은 라이트 스테이지 데이터셋에서 이전 초상 뷰 합성 방법보다 더 높은 PSNR, SSIM, 더 낮은 LPIPS를 달성했다(PSNR 23.92, SSIM 0.7688, LPIPS 0.161).
- 메타 학습과 표준 얼굴 좌표를 함께 사용한 사전 학습은 무작위 초기화나 일반적인 사전 학습에 비해 보지 못한 피사체에 대한 일반화를 크게 향상시킨다.
- 표준 얼굴 공간 왜곡은 눈과 턱의 왜곡을 줄이고 세계 좌표를 사용할 때보다 더 나은 정량적 지표를 제공한다.
- 단일 전면 뷰에서의 미세 조정은 머리카락과 액세서리를 포함한 다양한 피사체에서 사실적이고 정체성을 보존하는 새 시점 합성을 가능하게 한다.
- 테스트 시 더 많은 입력 시점으로 확장 가능하며 1에서 5 시점으로의 증가로 성능이 향상된다(예: 제거 실험에서 PSNR 24.98에서 32.45로).
- 이 방법은 3D 신경 표현 덕분에 초점 길이 조정으로 원근감 조작(도롤링)이 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.