Skip to main content
QUICK REVIEW

[논문 리뷰] SinNeRF: Training Neural Radiance Fields on Complex Scenes from a Single Image

Dejia Xu, Yifan Jiang|arXiv (Cornell University)|2022. 04. 02.
Image Enhancement Techniques인용 수 4
한 줄 요약

SinNeRF는 단일 이미지에서 복잡한 시점에서 신경 렌더링 필드를 훈련하기 위한 준감독 학습 프레임워크를 제안한다. 기하학적 및 의미적 가짜 레이블을 사용하여 다중 시점 일致성과 시각적 품질을 강화한다. 다중 시점 감독이나 대규모 데이터셋에서의 사전 훈련 없이도 최신 기술 수준의 새로운 시점 합성 성능을 달성한다.

ABSTRACT

Despite the rapid development of Neural Radiance Field (NeRF), the necessity of dense covers largely prohibits its wider applications. While several recent works have attempted to address this issue, they either operate with sparse views (yet still, a few of them) or on simple objects/scenes. In this work, we consider a more ambitious task: training neural radiance field, over realistically complex visual scenes, by "looking only once", i.e., using only a single view. To attain this goal, we present a Single View NeRF (SinNeRF) framework consisting of thoughtfully designed semantic and geometry regularizations. Specifically, SinNeRF constructs a semi-supervised learning process, where we introduce and propagate geometry pseudo labels and semantic pseudo labels to guide the progressive training process. Extensive experiments are conducted on complex scene benchmarks, including NeRF synthetic dataset, Local Light Field Fusion dataset, and DTU dataset. We show that even without pre-training on multi-view datasets, SinNeRF can yield photo-realistic novel-view synthesis results. Under the single image setting, SinNeRF significantly outperforms the current state-of-the-art NeRF baselines in all cases. Project page: https://vita-group.github.io/SinNeRF/

연구 동기 및 목표

  • 다중 시점 커버리지가 필요 없이 단일 기준 이미지만으로도 복잡한 시점에서 신경 렌더링 필드를 훈련시킬 수 있도록 하는 것.
  • 깊이 및 구조적 사전 지식의 부족으로 이전 방법이 실패하는 단일 이미지에서 3D 기하학적 재구성과 시점 합성 문제를 해결하는 것.
  • 다중 시점 감독이 없는 상황에서 가짜 레이블을 활용하여 훈련 과정을 안정화하고 이끌어내는 준감독 훈련 전략을 개발하는 것.
  • 대규모 다중 시점 데이터셋에서의 사전 훈련이나 특수 아키텍처에 의존하지 않고도 사진 수준의 새로운 시점 합성 성능을 달성하는 것.

제안 방법

  • 기준 시점과 미리보지 않은 시점 간의 이미지 워핑을 통해 기하학적 가짜 레이블을 생성하고 전파하여 다중 시점 기하학적 일치성을 확보하는 준감독 훈련 프레임워크를 도입한다.
  • 지역적 질감의 현실성과 새로운 시점에서의 전반적 구조적 무결성을 이끄는 데 사용하기 위해 판별기와 사전 훈련된 비전 트랜스포머(ViT)를 활용해 의미적 가짜 레이블을 생성한다.
  • 기하학적 감독, 국소 질감의 현실성에 대한 적대적 손실, 그리고 DINO-ViT의 [CLS] 토큰 기반 대비 손실을 조합한 다중 손실 훈련 목표를 사용한다.
  • 깊이 감독은 기준 시점에서만 적용하고, 나머지 시점은 훈련 중에 기하학적 및 의미적 가짜 레이블을 통해 정규화한다.
  • 이미지 워핑을 활용해 기준 시점의 깊이를 다른 시점으로 재투영함으로써 명시적인 다중 시점 감독 없이도 일관된 3D 기하학적 구조를 확보한다.
  • 가짜 레이블을 반복적으로 개선하고 전파하여 일반화 성능을 향상시키고 모드 붕괴를 줄이기 위해 점진적 훈련 전략을 활용한다.

실험 결과

연구 질문

  • RQ1다중 시점 감독 없이 단일 이미지에서 복잡한 시점에서 신경 렌더링 필드를 효과적으로 훈련시킬 수 있는가?
  • RQ2단일 이미지에서 기하학적 및 의미적 사전 지식을 어떻게 합성하여 NeRF 훈련을 안정화할 수 있는가?
  • RQ3기하학적 가짜 레이블과 의미적 가짜 레이블 중 어느 것이 새로운 시점 합성 품질 향상에 더 큰 기여를 하는가?
  • RQ4가짜 레이블을 활용한 준감독 프레임워크가 기존 최신 기술 수준의 방법보다 단일 이미지 NeRF 훈련에서 뛰어난 성능을 낼 수 있는가?

주요 결과

  • SinNeRF는 다중 시점 데이터에서의 사전 훈련 없이도 NeRF 합성, LLFF, DTU 데이터셋을 포함한 복잡한 시점 벤치마크에서 최신 기술 수준의 성능을 달성한다.
  • DTU 데이터셋에서 SinNeRF는 PSNR 20.97, SSIM 0.82, LPIPS 0.0932를 기록하며, DS-NeRF, PixelNeRF, DietNeRF와 비교해 정량적·정성적 성능 모두에서 승리한다.
  • 절단 실험 결과, 기하학적 가짜 레이블을 제거할 경우 심각한 기하학적 오류가 발생하고, 의미적 가짜 레이블을 제거할 경우 구조적 아티팩트와 잘못된 전반적 레이아웃이 발생함을 확인했다.
  • DINO-ViT의 [CLS] 토큰을 활용한 전반적 구조 사전 지식이 VGG 기반의 콘텐츠, 스타일, 또는 자기 유사성 손실보다 뛰어난 성능을 보이며, 픽셀 정렬 오류에 대해 뛰어난 강건성을 입증했다.
  • 적대적 훈련이 없는 변형은 흐릿한 아티팩트를 보이며, 판별기를 통한 국소 질감 안내의 중요성을 확인한다.
  • 모든 구성 요소를 포함한 전체 모델이 최고의 성능을 보였으며, 전반적 구조 사전 지식이 없는 변형 대비 2.77 PSNR 향상과 기본 모델 대비 0.0987 LPIPS 향상을 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.