Skip to main content
QUICK REVIEW

[논문 리뷰] Novel View Synthesis for High-fidelity Headshot Scenes

Satoshi Tsutsui, Weijia Mao|arXiv (Cornell University)|2022. 05. 31.
3D Shape Modeling and Analysis인용 수 4
한 줄 요약

이 논문은 신경 렌디언스 필드(NeRF)와 3차원 형태 모델(3DMM)을 제너레이티브 적대적 네트워크(GAN)-기반 융합 네트워크를 사용하여 융합함으로써, 다양한 조명, 표정, 배경을 가진 실세계 장면에서 고정밀도의 새로운 시점 합성 헤드샷을 위한 새로운 방법을 제안한다. 이 방법은 NeRF로부터 기하 일관성을 유지하고 3DMM로부터 피부 세부 정보를 확보하여, 인간의 시각적 현실감과 정밀도에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Rendering scenes with a high-quality human face from arbitrary viewpoints is a practical and useful technique for many real-world applications. Recently, Neural Radiance Fields (NeRF), a rendering technique that uses neural networks to approximate classical ray tracing, have been considered as one of the promising approaches for synthesizing novel views from a sparse set of images. We find that NeRF can render new views while maintaining geometric consistency, but it does not properly maintain skin details, such as moles and pores. These details are important particularly for faces because when we look at an image of a face, we are much more sensitive to details than when we look at other objects. On the other hand, 3D Morpable Models (3DMMs) based on traditional meshes and textures can perform well in terms of skin detail despite that it has less precise geometry and cannot cover the head and the entire scene with background. Based on these observations, we propose a method to use both NeRF and 3DMM to synthesize a high-fidelity novel view of a scene with a face. Our method learns a Generative Adversarial Network (GAN) to mix a NeRF-synthesized image and a 3DMM-rendered image and produces a photorealistic scene with a face preserving the skin details. Experiments with various real-world scenes demonstrate the effectiveness of our approach. The code will be available on https://github.com/showlab/headshot .

연구 동기 및 목표

  • 사람의 얼굴에서 고정밀도의 피부 세부 정보(예: 모공, 잔주름)를 유지하는 것이 시각적 현실감에 매우 중요하므로, 이러한 세부 정보를 새로운 시점 합성 과정에서 손실 없이 유지하는 데 도전한다.
  • NeRF는 기하 일관성을 유지하지만 세밀한 얼굴 질감 정보가 부족하고, 3DMM는 피부 세부 정보를 유지하지만 기하 정확도가 떨어지고 장면의 맥락을 누락한다는 한계를 극복한다.
  • NeRF(정확한 기하학적 구조와 장면 맥락)의 강점을 3DMM(세밀한 얼굴 질감)와 유기적으로 융합하여 사진 수준의 새로운 시점 합성을 달성하는 방법을 개발한다.
  • NeRF로 렌더링된 장면과 3DMM로 렌더링된 얼굴를 아티팩트 없는 방식으로 융합하여, 단순한 붙여넣기 방식에서 발생하는 눈에 띄는 융합 아티팩트를 방지한다.

제안 방법

  • 이 방법은 NeRF로 합성된 새로운 시점과 3DMM로 렌더링된 정면 얼굴 이미지를 입력으로 사용하는 GAN 기반 융합 네트워크를 사용한다.
  • 융합 네트워크는 NeRF의 기하 일관성과 3DMM의 피부 세부 정보 정확도를 동시에 확보한 사진 수준의 출력을 생성하도록 적대적으로 학습된다.
  • 3DMM는 얼굴의 사전 기반 고해상도 질감 맵을 제공하고, NeRF는 배경을 포함한 전체 장면의 신경 암시적 표현을 제공한다.
  • 융합 과정은 엔드 투 엔드로 미분 가능하여, 적대적 손실과 인지적 손실을 통해 NeRF와 3DMM 구성 요소를 함께 최적화할 수 있다.
  • 학습 과정에서는 융합 네트워크를 최소화하도록 설정하여 인지적 손실과 적대적 손실을 최소화함으로써, 현실적인 얼굴 질감과 장면에 자연스럽게 통합된 융합을 확보한다.
  • 이 방법은 다양한 표정, 조명, 배경을 가진 실세계 장면에서 평가되었으며, 실내, 실외, 말하는 얼굴 영상 등 다양한 시퀀스를 포함한다.

실험 결과

연구 질문

  • RQ1NeRF와 3DMM를 융합한 하이브리드 접근 방식이 단독으로 사용하는 경우보다 헤드샷 장면의 새로운 시점 합성에서 열등한 성능을 내지 않고도 우수한 성능을 달성할 수 있는가?
  • RQ2NeRF의 기하 일관성과 3DMM의 피부 세부 정보 정확도를 눈에 띄는 아티팩트나 융합 오류 없이 효과적으로 융합할 수 있는가?
  • RQ3GAN 기반 융합 네트워크에서의 적대적 학습이 합성된 헤드샷 이미지의 인지적 품질과 현실감을 얼마나 향상시키는가?
  • RQ4제안된 방법은 복잡한 배경, 동적인 표정, 다양한 조명 조건과 같은 다양한 실세계 조건에서도 성능을 유지하는가?
  • RQ53DMM의 사전과 융합 네트워크가 최종 이미지 품질에 기여하는 비율은 어떻게 되며, 단순 융합 또는 분리된 모델과 비교해 볼 때 어떤가?

주요 결과

  • 제안된 방법은 평균 사용자 평가 점수 3.331 ± 0.134를 기록하여 D-NeRF(3.075 ± 0.094), NerFace(2.569 ± 0.125), PoseGAN(1.006 ± 0.012)를 상당히 앞서며, 뛰어난 인지적 품질을 확인했다.
  • 정량적 평가 지표에서, 모든 장면에서 평균 PSNR 28.84, SSIM 0.8263, LPIPS 0.0826을 달성하여, 정밀도와 인지적 유사성 측면에서 모든 기준 모델을 능가했다.
  • 절단 실험 결과, 3DMM 구성 요소를 제거하면 성능 저하가 발생함(비교: LPIPS 0.0938 vs. 0.0826)을 확인하여, 피부 세부 정보 유지에 있어 3DMM의 핵심적 역할을 입증했다.
  • 융합 네트워크를 제거하면 성능에 심각한 하락이 발생함(비교: LPIPS 0.1425 vs. 0.0826)을 확인하여, GAN 기반 융합이 아티팩트 없는 융합을 위해 필수적임을 입증했다.
  • 모든 장면에서 LPIPS 측면에서 모든 기준 모델을 뛰어넘었으며, 평균 LPIPS 0.0826을 기록하여 인간의 인지와의 높은 일치도를 보였다.
  • 절단 실험을 통해 3DMM와 융합 네트워크 모두가 필수적임을 확인하였으며, 둘 중 하나라도 제거하면 결과가 악화되었고, 특히 융합 네트워크가 원활한 통합을 위해 핵심적인 역할을 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.