Skip to main content
QUICK REVIEW

[논문 리뷰] 3D-Aware Encoding for Style-based Neural Radiance Fields

Yu-Jhe Li, Tao Xu|arXiv (Cornell University)|2022. 11. 12.
Generative Adversarial Networks and Image Synthesis인용 수 4
한 줄 요약

이 논문은 스타일 기반 신경 렌디언스 필드(NeRF)의 3D 인식 가능한 잠재 공간으로의 단일 이미지 복원을 위한 이중 단계 인코더 프레임워크인 NeRF-3DE를 제안한다. 이는 고해상도의 단일 이미지에서 다중 시점 렌더링을 가능하게 한다. 시점에 관계없이 일관된 기본 인코더와 신원을 유지하는 보정 기반의 조합을 통해, 기존의 GAN 복원 및 최적화 기반 방법들보다 뛰어난 3D 일관성과 신원 유지 성능을 달성한다. 재구성 및 새로운 시점 렌더링 품질 측면에서 베이스라인을 모두 능가한다.

ABSTRACT

We tackle the task of NeRF inversion for style-based neural radiance fields, (e.g., StyleNeRF). In the task, we aim to learn an inversion function to project an input image to the latent space of a NeRF generator and then synthesize novel views of the original image based on the latent code. Compared with GAN inversion for 2D generative models, NeRF inversion not only needs to 1) preserve the identity of the input image, but also 2) ensure 3D consistency in generated novel views. This requires the latent code obtained from the single-view image to be invariant across multiple views. To address this new challenge, we propose a two-stage encoder for style-based NeRF inversion. In the first stage, we introduce a base encoder that converts the input image to a latent code. To ensure the latent code is view-invariant and is able to synthesize 3D consistent novel view images, we utilize identity contrastive learning to train the base encoder. Second, to better preserve the identity of the input image, we introduce a refining encoder to refine the latent code and add finer details to the output image. Importantly note that the novelty of this model lies in the design of its first-stage encoder which produces the closest latent code lying on the latent manifold and thus the refinement in the second stage would be close to the NeRF manifold. Through extensive experiments, we demonstrate that our proposed two-stage encoder qualitatively and quantitatively exhibits superiority over the existing encoders for inversion in both image reconstruction and novel-view rendering.

연구 동기 및 목표

  • 단일 이미지를 스타일 기반 신경 렌디언스 필드(모델명: NeRF)의 3D 인식 가능한 잠재 공간으로 복원하는 데 도전하는 것. 이는 신원 유지와 3D 시점 일관성의 두 가지 조건을 동시에 충족해야 한다.
  • 기존 GAN 복원 방법이 NeRF에 적용되었을 때 나타나는 한계를 해결하는 것. 특히, 잠재 코드가 시점에 따라 일관성이 없고 유효한 잠재 다양체 외부에 위치하는 경향이 있다는 점이다.
  • 먼저 동일한 객체의 여러 시점에서의 시점에 관계없는 잠재 코드를 학습하는 인코더를 설계하고, 이후 세부 정보를 보완하여 이미지 품질을 향상시키는 이중 단계 인코더 아키텍처를 제안하는 것.
  • 잠재 코드가 NeRF 다양체 근처에 위치하도록 보장하여 효과적인 보정과 안정적인 최적화를 가능하게 하는 것.
  • 학습된 잠재 코드가 PTI 및 W+ 최적화와 같은 온라인 최적화 방법의 효과적인 초기화로 활용될 수 있음을 보여주는 것.

제안 방법

  • 이중 단계 인코더 아키텍처: 기본 인코더가 입력 이미지를 W 공간의 잠재 코드로 매핑하고, 이후 보정 인코더가 신원 세부 정보를 향상시킨다.
  • 기본 인코더는 동일 객체의 여러 시점에서의 시점에 관계없는 일관성을 확보하기 위해 신원 대비 학습(contrastive learning)을 통해 훈련된다.
  • 실제 이미지와 합성된 이미지 간의 특징 수준 손실(L_feat)을 적용하여 구조적 및 의미적 일관성을 유지한다.
  • 훈련 중 3D 구조와 신원 유지 성능을 향상시키기 위해 삼중 평면 특징 손실(L_tri)을 도입한다.
  • 실제 이미지와 합성된 시점 렌더링을 모두 사용하여 훈련하며, 후자는 잠재 코드의 다중 시점 일반화를 감독하는 데 사용된다.
  • PTI 및 W+ 최적화와 같은 온라인 최적화 기법과의 통합을 지원하기 위해 고품질의 초기 잠재 코드를 제공한다.

실험 결과

연구 질문

  • RQ1이중 단계 인코더 아키텍처가 스타일 기반 NeRF에 대해 단일 이미지에서 3D 일관성과 신원 유지 성능을 동시에 확보할 수 있는가?
  • RQ2기본 인코더에서 사용된 신원 대비 학습이 표준 GAN 복원 방법에 비해 시점 일관성과 3D 일관성을 얼마나 향상시키는가?
  • RQ3두 번째 단계 인코더를 통해 잠재 코드를 보정함으로써 신원 및 세부 정보 유지 성능이 향상되지만, 3D 구조는 손상되지 않는가?
  • RQ4학습된 잠재 코드가 PTI나 W+ 최적화와 같은 온라인 최적화 방법의 초기화로써 랜덤 또는 기존 인코더보다 더 우수한 성능을 보일 수 있는가?
  • RQ5실제 이미지, 합성된 시점, 특징 수준 손실이 강건한 NeRF 복원을 달성하는 데 기여하는 상대적 기여도는 얼마인가?

주요 결과

  • 제안된 NeRF-3DE는 네 가지 요각(yaw angles)에서 모든 베이스라인 대비 가장 높은 신원(ID) 점수를 기록했으며, 재구성 성능은 뛰어나지만 신원 유지에 실패하는 PTI를 포함해도 모두 능가한다.
  • 실제 이미지와 합성된 시점, 전체 특징 수준 손실(L_feat)을 모두 사용한 모델이 3D 일관성과 신원 충실도 사이의 최적 균형을 달성했으며, 분석 결과에서 어떤 구성 요소라도 생략할 경우 성능 저하가 발생한다.
  • 실제 이미지를 사용하지 않고 합성된 이미지만으로 학습할 경우 신원 유지 성능이 떨어지며, 이는 신원 정렬을 위해 실재 이미지의 감독이 필수적임을 보여준다.
  • 삼중 평면 특징 손실(L_tri)은 다른 구성 요소보다 더 중요한 역할을 하며, 분석 결과에서 3D 구조와 신원 유지 성능 향상에 기여도가 높은 것으로 나타났다.
  • 이중 단계 인코더 설계가 신규 시점 렌더링 품질을 크게 향상시켰으며, 기반 인코더만 사용하는 것보다 보정된 잠재 코드가 더 선명하고 일관성 있는 시점을 생성한다.
  • NeRF-3DE에서 유도된 잠재 코드는 온라인 최적화 방법에서 뛰어난 초기화로 기능하며, PTI 및 W+ 최적화에서 수렴 속도를 가속화하고 이미지 품질과 3D 일관성을 모두 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.