[논문 리뷰] HeadNeRF: A Real-time NeRF-based Parametric Head Model
HeadNeRF는 인간의 얼굴을 고해상도 및 다중 시점 일致성 렌더링을 가능하게 하는 실시간 NeRF 기반 매개변수화된 헤드 모델을 제안한다. 신경 렌디언스 필드(NeRF)를 3D 프록시로 활용하여, 정체성, 표정, 외모 및 카메라 자세에 대해 분리 제어가 가능한 고해상도 렌더링을 실현한다. 2D 신경 렌더링과 NeRF를 통합하고 새로운 손실 항목을 도입함으로써, 렌더링 속도를 5초에서 1프레임당 25ms로 향상시켰으며, 이는 40fps 이상의 실시간 성능을 달성한다.
In this paper, we propose HeadNeRF, a novel NeRF-based parametric head model that integrates the neural radiance field to the parametric representation of the human head. It can render high fidelity head images in real-time on modern GPUs, and supports directly controlling the generated images' rendering pose and various semantic attributes. Different from existing related parametric models, we use the neural radiance fields as a novel 3D proxy instead of the traditional 3D textured mesh, which makes that HeadNeRF is able to generate high fidelity images. However, the computationally expensive rendering process of the original NeRF hinders the construction of the parametric NeRF model. To address this issue, we adopt the strategy of integrating 2D neural rendering to the rendering process of NeRF and design novel loss terms. As a result, the rendering speed of HeadNeRF can be significantly accelerated, and the rendering time of one frame is reduced from 5s to 25ms. The well designed loss terms also improve the rendering accuracy, and the fine-level details of the human head, such as the gaps between teeth, wrinkles, and beards, can be represented and synthesized by HeadNeRF. Extensive experimental results and several applications demonstrate its effectiveness. The trained parametric model is available at https://github.com/CrisHY1995/headnerf.
연구 동기 및 목표
- 실시간 고해상도 렌더링과 다중 시점 일치성을 지원하는 매개변수화된 헤드 모델을 개발하는 것.
- NeRF의 계산 복잡도 문제를 해결하기 위해 2D 신경 렌더링을 통합하여 렌더링 속도를 향상시키면서도 이미지 품질을 유지하는 것.
- 정체성, 표정, 외모 및 렌더링 자세와 같은 의미적 속성에 대해 효과적인 분리 제어를 가능하게 하는 것.
- 3D 스캔 데이터의 고비용이 요구되는 것을 방지하기 위해 오직 2D 이미지만을 사용하여 모델을 훈련시키는 것.
- 새로운 시각 합성, 속성 편집 및 얼굴 재연역과 같은 새로운 애플리케이션을 가능하게 하는 것. 이는 기하학적 일致성을 유지한다.
제안 방법
- 기존의 텍스처가 있는 메esh가 아닌, 신경 렌디언스 필드(신경 렌디언스 필드, NeRF)를 미분 가능한 3D 표현으로 사용한다.
- 粗-세밀한 2D 신경 렌더링을 NeRF 볼륨 렌더링과 통합하여 추론 속도를 1프레임당 25ms(40+fps)로 가속화한다.
- 장면에서 샘플링된 광선을 따라 3D 점의 밀도 σ(x)와 특징 벡터 F(x)를 예측하기 위해 다중 지점 신경망(Multi-branch MLP)을 활용한다.
- 저해상도 특징 맵 IF에서 최종 이미지 I를 복원하는 데 사용되는 새로운 2D 신경 렌더링 모듈 πψ를 적용한다.
- 훈련 중에 정체성, 표정, 외모 및 조명 속성을 분리 제어할 수 있도록 특수 설계된 손실 함수를 설계한다.
- 명시적인 3D 감독 없이 대규모 데이터셋(예: FFHQ, FaceSEIP)의 2D 이미지만을 사용하여 엔드 투 엔드로 훈련한다.
실험 결과
연구 질문
- RQ1NeRF 기반 매개변수화된 헤드 모델은 고해상도와 다중 시점 일치성을 유지하면서도 실시간 렌더링을 달성할 수 있는가?
- RQ2NeRF의 고비용 렌더링 과정을 시각 품질을 훼손하지 않으면서도 실시간 추론를 위해 어떻게 가속화할 수 있는가?
- RQ3정체성, 표정 및 외모와 같은 의미적 속성이 NeRF 기반 매개변수화된 헤드 모델에서 효과적으로 분리 제어될 수 있는가?
- RQ42D 이미지 감독만으로도 NeRF 기반 모델이 새로운 시점과 속성 편집에 얼마나 잘 일반화되는가?
- RQ5모델이 기하학적 일치성을 유지하면서도 실용적인 애플리케이션, 예를 들어 얼굴 재연역 및 새로운 시점 합성을 지원할 수 있는가?
주요 결과
- HeadNeRF는 렌더링 시간을 5초에서 1프레임당 25ms로 단축시켜 현대 GPU에서 40fps 이상의 실시간 추론를 가능하게 했다.
- 특히 자세 편집 상황에서 2D GAN 기반 방법(예: pi-GAN, GIRAFFE)보다 뛰어난 다중 시점 일치성을 확보했다.
- 분리된 잠재 공간 제어를 통해 이가 벌어진 틈, 주름, 수염과 같은 세밀한 디테일을 성공적으로 합성했다.
- 정량적 평가에서 PSNR 및 SSIM 측면에서 pi-GAN과 GIRAFFE를 모두 능가했으며, 더 낮은 과적합 및 더 우수한 일반화 성능을 보였다.
- 기본 영상의 표정을 타겟 이미지로 전이하기 위해 잠재 코드 교체를 통해 고품질의 얼굴 재연역을 구현할 수 있었다.
- 헤드기어나 복잡한 조명 조건과 같은 분포 외의 경우 처리에 한계가 있으며, 더 큰 다각도의 데이터셋이 필요로 함을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.