[논문 리뷰] Deceptive-NeRF/3DGS: Diffusion-Generated Pseudo-Observations for High-Quality Sparse-View Reconstruction
Deceptive-NeRF는 조악한 NeRF 렌더링을 조건으로 하는 확산 모델을 사용하여 사진처럼 사실적인 가짜 관측값을 생성함으로써 소수의 관측값에서 NeRF 재구성에 대한 새로운 프레임워크를 제안한다. 다양한 벤치마크에서 5-뷰 및 10-뷰 설정에서 Hypersim 및 LLFF 데이터셋을 포함하여 PSNR, SSIM 및 LPIPS 측정치에서 기존 방법들을 능가하는 최신 기술 성능을 달성한다.
Novel view synthesis via Neural Radiance Fields (NeRFs) or 3D Gaussian Splatting (3DGS) typically necessitates dense observations with hundreds of input images to circumvent artifacts. We introduce Deceptive-NeRF/3DGS to enhance sparse-view reconstruction with only a limited set of input images, by leveraging a diffusion model pre-trained from multiview datasets. Different from using diffusion priors to regularize representation optimization, our method directly uses diffusion-generated images to train NeRF/3DGS as if they were real input views. Specifically, we propose a deceptive diffusion model turning noisy images rendered from few-view reconstructions into high-quality photorealistic pseudo-observations. To resolve consistency among pseudo-observations and real input views, we develop an uncertainty measure to guide the diffusion model's generation. Our system progressively incorporates diffusion-generated pseudo-observations into the training image sets, ultimately densifying the sparse input observations by 5 to 10 times. Extensive experiments across diverse and challenging datasets validate that our approach outperforms existing state-of-the-art methods and is capable of synthesizing novel views with super-resolution in the few-view setting.
연구 동기 및 목표
- 실제 사용자가 촬영한 데이터에서 흔히 발생하는 극도로 희박한 입력 시야 조건에서 NeRF 재구성 품질이 열 劣하는 문제를 해결한다.
- 수백 개의 시야가 필요로 하는 기존 NeRF의 제한을 극복하고, 희박한 지도 하에서 성능을 유지한다.
- 사전 훈련된 2D 확산 모델을 정규화 요소로 사용하는 대신, 의미적으로 일관되고 사진처럼 사실적인 가짜 관측값을 생성하는 생성기로 활용하여 훈련 데이터를 보강한다.
- 점진적 훈련 전략을 도입하여 새로 생성된 가짜 관측값을 반복적으로 이용해 NeRF를 점진적으로 개선함으로써 재구성 정밀도와 일반화 능력을 향상시킨다.
- 가짜 관측값 생성 과정에서 다중 시야 일관성과 시나리오 의미를 유지하여 잡음과 환각 현상을 방지한다.
제안 방법
- 희박한 입력 이미지와 카메라 포즈에서 조악한 NeRF를 훈련시켜 초기 새로운 시야 렌더링 및 깊이 맵을 생성한다.
- 새로운 위장 확산 모델을 사용하여 RGB 및 깊이 입력을 조건으로 하여 조악한 NeRF 렌더링에서 고해상도의 가짜 관측값을 합성한다.
- 위장 확산 모델은 조악한 NeRF 출력과 의미적으로 일관되면서도 시각적으로 현실적인 이미지를 생성하도록 훈련된다.
- 점진적 훈련 전략을 적용: 각 반복 단계에서 현재 NeRF가 생성한 렌더링을 바탕으로 다음 반복 단계의 NeRF를 훈련하기 위한 새로운 가짜 관측값을 생성한다.
- 최종 NeRF 훈련에 진짜 입력 이미지와 생성된 가짜 관측값을 모두 포함시키며, 다중 시야 지도를 통해 시야 간 일관성을 강제한다.
- 이미지 캡셔닝과 텍스트 인version을 통한 텍스트 기반 조건을 통합하여 가짜 관측값의 스타일과 콘텐츠 일치도를 향상시킨다.
실험 결과
연구 질문
- RQ1확산 모델을 정규화 요소가 아닌 데이터 생성기로 재활용함으로써 희박한 지도 하에서 NeRF 재구성 품질을 향상시킬 수 있는가?
- RQ2조악한 NeRF 렌더링을 조건으로 하는 확산 모델이 시나리오 의미와 다중 시야 일관성을 유지하는 가짜 관측값을 얼마나 잘 생성할 수 있는가?
- RQ3새로 생성된 가짜 관측값을 반복적으로 이용해 NeRF를 점진적으로 개선하는 점진적 훈련 전략이 단일 단계 생성 방식보다 더 나은 재구성 품질을 제공하는가?
- RQ4깊이 조건과 다중 모odal 텍스트 조건(이미지 캡처 + 텍스트 인버전)이 생성된 가짜 관측값의 현실성과 일관성 향상에 기여하는 정도는 어떠한가?
- RQ5제안된 방법이 극도로 희박한 시야 간격에서 소수의 관측값으로 새로운 시야를 재구성하는 데 있어 기존 최신 기술 방법들을 얼마나 능가하는가?
주요 결과
- Deceptive-NeRF는 Hypersim 및 LLFF 데이터셋에서 평가된 모든 측정치에서 최신 기술 성능을 달성하였으며, 20-뷰 설정에서 PSNR 22.41, SSIM 0.812를 기록하였다.
- 5-뷰 설정에서는 Deceptive-NeRF가 가장 높은 PSNR와 SSIM를 기록하였고, LPIPS 기준으로는 유일하게 두 번째로 높은 순위를 차지하여 뛰어난 시각적 품질을 입증하였다.
- 절단 실험 결과, 점진적 훈련, 깊이 조건, 데이터 증강, 이중 텍스트 임베딩(캡처링 + 텍스트 인버전) 등 모든 구성 요소가 최적의 성능을 내기 위해 필수적임을 확인하였다.
- 모든 구성 요소를 포함한 전체 모델은 PSNR 22.41을 기록하였으며, 점진적 훈련이 없는 변형(PSNR 19.90)과 깊이 조건이 없는 변형(PSNR 18.79)보다 뚜렷이 뛰어난 성능을 보였다.
- 정성적 결과에서는 Deceptive-NeRF가 기존 기반 모델 대비 더 선명하고 세부 사항이 풍부한 새로운 시야를 생성하며 잡음이 적은 것으로 나타났다. 특히 물체 수준의 질감과 기하학적 구조에서 뛰어난 성능을 보였다.
- 매우 희박한 입력 조건에서도, 예를 들어 5개의 입력 뷰만으로도 사진처럼 사실적인 시야를 성공적으로 합성함으로써 극도로 희박한 입력에 대한 강건성을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.