Skip to main content
QUICK REVIEW

[논문 리뷰] Harnessing Low-Frequency Neural Fields for Few-Shot View Synthesis

Liangchen Song, Zhong Li|arXiv (Cornell University)|2023. 03. 15.
Advanced Vision and Imaging인용 수 4
한 줄 요약

이 논문은 소수의 뷰에서의 시각 합성에서 고주파 신경 렌디언스 필드를 정규화하기 위해 저주파 신경 필드를 활용하는 HALO라는 방법을 제안한다. 렌더링된 이미지의 주파수 일관성을 강제하여 과적합을 방지한다. 거친 기하 구조 예측(저주파)과 세부 사항 모델링(고주파)을 분리함으로써 일반화 성능을 향상시키고 정적 및 동적 장면에서의 잡음과 기법을 줄인다. 효율적인 학습을 통해 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Neural Radiance Fields (NeRF) have led to breakthroughs in the novel view synthesis problem. Positional Encoding (P.E.) is a critical factor that brings the impressive performance of NeRF, where low-dimensional coordinates are mapped to high-dimensional space to better recover scene details. However, blindly increasing the frequency of P.E. leads to overfitting when the reconstruction problem is highly underconstrained, \eg, few-shot images for training. We harness low-frequency neural fields to regularize high-frequency neural fields from overfitting to better address the problem of few-shot view synthesis. We propose reconstructing with a low-frequency only field and then finishing details with a high-frequency equipped field. Unlike most existing solutions that regularize the output space (\ie, rendered images), our regularization is conducted in the input space (\ie, signal frequency). We further propose a simple-yet-effective strategy for tuning the frequency to avoid overfitting few-shot inputs: enforcing consistency among the frequency domain of rendered 2D images. Thanks to the input space regularizing scheme, our method readily applies to inputs beyond spatial locations, such as the time dimension in dynamic scenes. Comparisons with state-of-the-art on both synthetic and natural datasets validate the effectiveness of our proposed solution for few-shot view synthesis. Code is available at \href{https://github.com/lsongx/halo}{https://github.com/lsongx/halo}.

연구 동기 및 목표

  • 고주파 위치 인코딩이 낮은 일반화 성능을 유도하는 소수의 뷰 설정에서 NeRF의 과적합 문제를 해결하기 위해.
  • 저주파 및 고주파 신경 필드의 상호 보완적 보간 및 외삽 성질을 활용하여 더 나은 새로운 뷰 합성 성능을 달성하기 위해.
  • 사전 학습된 사전 지식이나 진짜 주파수 조정에 의존하지 않는 데이터 없음 입력 공간 정규화 전략을 개발하기 위해.
  • 시간을 추가 입력 차원으로 간주하여 동적 장면로의 확장으로, 효율성을 유지하면서 시간적 번짐을 줄이기 위해.
  • 렌더링된 이미지의 주파수 도메인 일관성에 기반한 단순하면서도 효과적인 주파수 조정 기준을 제공하기 위해.

제안 방법

  • 이 방법은 두 개의 스트림 아키텍처를 사용한다: 저주파만을 다루는 레이 기반 필드로 거친 기하 구조와 깊이를 예측하고, 고주파 기반의 점 기반 반사율 필드로 세부 사항을 모델링한다.
  • 저주파 레이 기반 필드는 각 레이에 대한 깊이 값을 예측하도록 훈련되어 부드럽고 저주파 신호에서 효율적이고 안정적인 최적화를 가능하게 한다.
  • 고주파 세부 사항은 별도의 점 기반 반사율 필드를 통해 추가되며, 저주파 기하 예측으로 정규화되어 과적합을 방지한다.
  • 주파수 조정 전략이 도입되었으며, 렌더링된 이미지의 주파수 도메인이 소규모 뷰포인트 변화에 대해 안정성을 유지할 때까지 위치 인코딩 주파수를 반복적으로 감소시킨다.
  • 주파수 일관성 기준은 2차원 이미지 주파수 도메인에 적용되며, 스펙트럼 변화에 대한 임계값을 사용해 최적의 인코딩 주파수를 결정한다.
  • 시간을 입력 차원으로 포함함으로써 동적 장면로의 확장이 가능하며, 동일한 정규화 전략이 시간 주파수 도메인에 적용된다.

실험 결과

연구 질문

  • RQ1저주파 신경 필드가 소수의 뷰에서의 시각 합성에서 고주파 NeRF를 효과적으로 정규화하여 과적합을 방지할 수 있는가?
  • RQ2입력 공간 정규화가 출력 공간 정규화보다 일반화 성능 향상과 잡음 감소 측면에서 더 우수한가?
  • RQ3렌더링된 이미지의 스펙트럼 일관성에 기반한 주파수 조정 기준이 인간 또는 진짜 주파수 가이드를 사용한 주파수 선택을 대체할 수 있는가?
  • RQ4희소 다중 뷰 및 시간 관측이 있는 동적 장면에서 이 방법의 성능은 어떠한가?
  • RQ5시간 차원의 주파수를 제어함으로써 동적 NeRF에서의 시간적 번짐을 줄일 수 있는가?

주요 결과

  • StanfordLF 데이터셋에서 HALO는 4코너 뷰 설정에서 PSNR 25.687을 기록하여, DietNeRF(22.815)와 RegNeRF(23.995)를 크게 앞서며 뛰어난 성능을 보였다.
  • LLFF 데이터셋에서 HALO는 PSNR 25.687과 SSIM 0.914를 기록하여, 단 4개의 훈련 뷰만으로도 강력한 일반화 성능을 입증했다.
  • 동적 장면에서는 HALO가 시간적 번짐을 줄이고 시각 품질을 향상시켰으며, TiNeuVox-S(0.182) 대비 LPIPS가 11.6% 감소한 0.116를 기록했다.
  • 훈련 시간은 1장당 0.67 GPU 시간으로, DietNeRF(4.25)와 RegNeRF(3.33)보다 훨씬 빠르게 효율적인 학습을 가능하게 했다.
  • 진짜 주파수나 사전 학습된 사전 지식이 필요 없이도 주파수 조정 전략이 최적의 인코딩 주파수를 성공적으로 식별하여, 낮은 데이터 환경에서의 강인성을 향상시켰다.
  • 시각적 비교 결과, HALO는 TiNeuVox 및 기타 기준 모델 대비 더 선명한 세부 사항과 더 적은 부유 잡음 기법을 생성했으며, 특히 관측되지 않은 영역 및 동적 시퀀스에서 두드러진 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.