Skip to main content
QUICK REVIEW

[논문 리뷰] NeRFocus: Neural Radiance Field for 3D Synthetic Defocus

Yinhuai Wang, Shuzhou Yang|arXiv (Cornell University)|2022. 03. 10.
Image Processing Techniques and Applications인용 수 6
한 줄 요약

NeRFocus는 역광선 추적과 프루스트 기반 볼륨 렌더링을 통해 얇은 렌즈 영상 모델링을 통해 3D 합성 심도 허용 범위 효과를 직접 렌더링하는 새로운 NeRF 기반 프레임워크를 제안한다. 이는 조절 가능한 조리개 크기, 초점 거리, 카메라 자세를 지원하는 제어 가능한 심도 허용 범위 효과를 제공하며, 대규모 심도 허용 범위 이미지에 대해 NeRF 수준의 훈련 시간, 파라미터 수 및 렌더링 품질을 유지한다.

ABSTRACT

Neural radiance fields (NeRF) bring a new wave for 3D interactive experiences. However, as an important part of the immersive experiences, the defocus effects have not been fully explored within NeRF. Some recent NeRF-based methods generate 3D defocus effects in a post-process fashion by utilizing multiplane technology. Still, they are either time-consuming or memory-consuming. This paper proposes a novel thin-lens-imaging-based NeRF framework that can directly render various 3D defocus effects, dubbed NeRFocus. Unlike the pinhole, the thin lens refracts rays of a scene point, so its imaging on the sensor plane is scattered as a circle of confusion (CoC). A direct solution sampling enough rays to approximate this process is computationally expensive. Instead, we propose to inverse the thin lens imaging to explicitly model the beam path for each point on the sensor plane and generalize this paradigm to the beam path of each pixel, then use the frustum-based volume rendering to render each pixel's beam path. We further design an efficient probabilistic training (p-training) strategy to simplify the training process vastly. Extensive experiments demonstrate that our NeRFocus can achieve various 3D defocus effects with adjustable camera pose, focus distance, and aperture size. Existing NeRF can be regarded as our special case by setting aperture size as zero to render large depth-of-field images. Despite such merits, NeRFocus does not sacrifice NeRF's original performance (e.g., training and inference time, parameter consumption, rendering quality), which implies its great potential for broader application and further improvement. Code and video are available at https://github.com/wyhuai/NeRFocus.

연구 동기 및 목표

  • 표준 NeRF가 편광 카메라 모델에 기반하여 자연스러운 3D 심도 허용 범위 효과 지원이 부족한 문제를 해결하기 위해.
  • 후처리나 추가 데이터셋 없이도 현실적인 3D 심도 허용 범위 효과를 직접 렌더링할 수 있도록 하기 위해.
  • 조리개 크기, 초점 거리, 카메라 자세에 대한 민감한 제어 기능을 유지하면서도 NeRF의 효율성과 렌더링 품질을 그대로 유지하기 위해.
  • 기본적인 대규모 심도 허용 범위 데이터만을 사용하여 다양한 심도 허용 범위 효과에 잘 일반화되는 훈련 전략을 개발하기 위해.

제안 방법

  • 각 센서 평면의 점으로부터 시나리오 점으로의 빔 경로를 역추적하여 얇은 렌즈 영상 과정을 반전시키고, 픽셀 수준의 빔 경로로 일반화한다.
  • 유한한 조리개로 인해 시나리오 점에서 산산이 흩어지는 레이의 분포를 표현하기 위해 혼탁도 원판(CoC) 모델을 사용하며, 각 픽셀에 대해 복합 콘을 형성한다.
  • 각 복합 콘을 프루스트로 나누고, 각 프루스트 내에서 복사율과 밀도에 대해 3D 가우시안 분포를 가정하여 볼륨 렌더링을 가능하게 한다.
  • 지상 진술 이미지에 다양한 크기의 가우시안 블러 커널을 적용하여 지도 학습하는 확률적 훈련(p-training) 전략을 제안하며, 훈련 중에는 조리개 크기를 0으로 설정한다.
  • 렌더링된 색상(복합 콘에서 유도)과 블러 처리된 지상 진술 이미지 간의 손실을 사용하여 MLP를 훈련시키며, 이는 테스트 시 비영제 조리개 설정으로의 일반화를 가능하게 한다.
  • 위치 인코딩과 다층퍼셉트론(MLP)을 활용하여 예측된 위치 인코딩을 입력으로 사용해 각 프루스트의 예상 복사율과 밀도를 예측한다.

실험 결과

연구 질문

  • RQ1NeRF는 조리개 크기 및 초점 거리와 같은 제어 가능한 파rameter를 통해 자연스럽게 3D 심도 허용 범위 효과를 렌더링할 수 있는가?
  • RQ2후처리나 심도 허용 범위 레이블이 포함된 추가 데이터셋 없이도 현실적인 심도 허용 범위 효과를 달성할 수 있는가?
  • RQ3블러 처리된 지상 진술 이미지 기반의 훈련 전략이 NeRF의 효율성과 렌더링 품질을 유지하면서 다양한 심도 허용 범위 설정으로 일반화될 수 있는가?
  • RQ4제안된 p-training 전략은 표준 NeRF 훈련 대비 계산 비용과 모델 성능 측면에서 어떻게 비교되는가?

주요 결과

  • NeRFocus는 조리개 크기 = 0인 대규모 심도 허용 범위 설정에서 PSNR 28.26을 기록하여 NeRF(29.00) 및 mip-NeRF(28.83)와 유사한 성능을 보이며 성능 저하 없음을 확인한다.
  • 모델은 훈련 시간(55.6시간)과 파라미터 수(613k) 모두에서 mip-NeRF와 동일하여 추가적인 계산 비용이 없음을 입증한다.
  • 정성적 결과는 조리개 크기를 증가시킬수록 블러가 증가하고(얕은 DOF), 초점 거리를 증가시킬수록 DOF가 앞으로 이동하는 것으로 확인되며, 이는 광학 원리와 일치한다.
  • p-training이 오직 다섯 가지의 블러 커널 스케일만을 사용했음에도 불구하고, 예상치 못한 심도 허용 범위 설정으로의 일반화가 잘 이루어져 확률적 훈련 전략의 강건성을 입증한다.
  • NeRFocus는 카메라 자세, 초점 거리, 조리개 크기 등에 대해 분리된 제어 기능을 제공하여 고품질의 3D 심도 허용 범위 효과를 렌더링할 수 있으며, 동적이고 현실적인 심도 허용 범위 효과를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.