Skip to main content
QUICK REVIEW

[논문 리뷰] Robustifying the Multi-Scale Representation of Neural Radiance Fields

Nishant Jain, Suryansh Kumar|arXiv (Cornell University)|2022. 10. 09.
Robotics and Sensor-Based Localization인용 수 6
한 줄 요약

이 논문은 시점의 강성과 그래프 신경망 기반 운동 평균화 프레임워크를 활용하여 다중 척도 영상과 카메라 자세 추정 오차를 동시에 다루는 강력한 다중 척도 신경 렌디언스 필드 방법인 RM-NeRF를 제안한다. 기준 데이터셋에서 Mip-NeRF와 BARF를 능가하며, 합성 및 실제 다중 시점 데이터를 사용한 실제 노이즈 있는 실생활 조건에서도 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Neural Radiance Fields (NeRF) recently emerged as a new paradigm for object representation from multi-view (MV) images. Yet, it cannot handle multi-scale (MS) images and camera pose estimation errors, which generally is the case with multi-view images captured from a day-to-day commodity camera. Although recently proposed Mip-NeRF could handle multi-scale imaging problems with NeRF, it cannot handle camera pose estimation error. On the other hand, the newly proposed BARF can solve the camera pose problem with NeRF but fails if the images are multi-scale in nature. This paper presents a robust multi-scale neural radiance fields representation approach to simultaneously overcome both real-world imaging issues. Our method handles multi-scale imaging effects and camera-pose estimation problems with NeRF-inspired approaches by leveraging the fundamentals of scene rigidity. To reduce unpleasant aliasing artifacts due to multi-scale images in the ray space, we leverage Mip-NeRF multi-scale representation. For joint estimation of robust camera pose, we propose graph-neural network-based multiple motion averaging in the neural volume rendering framework. We demonstrate, with examples, that for an accurate neural representation of an object from day-to-day acquired multi-view images, it is crucial to have precise camera-pose estimates. Without considering robustness measures in the camera pose estimation, modeling for multi-scale aliasing artifacts via conical frustum can be counterproductive. We present extensive experiments on the benchmark datasets to demonstrate that our approach provides better results than the recent NeRF-inspired approaches for such realistic settings.

연구 동기 및 목표

  • 실생활 다중 시점 영상에서 척도 변화와 정확하지 않은 카메라 자세를 다루는 데에 한계가 있는 NeRF 및 그 변종의 문제를 해결하기 위해.
  • COLMAP과 같은 외부 자세 추정기 의존도를 제거하고 자체적으로 강력한 카메라 자세 추정을 가능하게 하기 위해.
  • 다중 척도 표현과 강력한 최적화를 통합하여 다중 척도 및 자세 오차 조건 하에서 신경 볼륨 렌더링 품질을 향상시키기 위해.
  • 다중 척도 렌더링만으로는 조건이 불완전할 경우 실패할 수 있음을 입증하기 위해, 즉 Mip-NeRF의 애니(aliasing) 방지 기능이 있더라도 그렇다.
  • 다중 시점 기하학, 다중 척도 NeRF, 그래프 신경망의 원리를 통합하여 더 강력한 신경 장면 표현을 위한 통합 원칙을 제공하기 위해.

제안 방법

  • 레이 스페이스에서 애니 패턴을 줄이기 위해 Mip-NeRF의 다중 척도 원뿔 캐비티 렌더링을 통합한다.
  • 신경 볼륨 렌더링 프레임워크 내에 그래프 신경망 기반 다중 운동 평균화(MRA) 모듈을 제안하여 동시에 강력한 카메라 자세를 추정한다.
  • 최적화 과정을 정규화하기 위해 강성 있는 시점 사전 지식을 사용하여 자세 오차에 대한 강건성을 향상시킨다.
  • 색상 렌더링 손실과 강력한 MRA 손실의 동시 최적화에서 냉각 전략을 적용하여 수렴성과 정확성의 균형을 맞춘다.
  • 다중 척도 렌더링과 강력한 자세 추정을 하나의 엔드 투 엔드 미분 가능한 프레임워크에 통합하여 번들 조정(BA)에 의존하지 않는다.
  • 시점의 강성을 활용하여 운동 평균화 과정을 제약함으로써 척도 및 자세 변화가 있는 다수의 시점 간 일관성을 향상시킨다.

실험 결과

연구 질문

  • RQ1통합된 신경 렌디언스 필드 프레임워크가 동시에 다중 척도 영상과 카메라 자세 추정 오차를 강건하게 처리할 수 있는가?
  • RQ2Mip-NeRF의 다중 척도 렌더링은 정확하지 않은 카메라 자세와 함께 사용될 경우 실패할 수 있으며, 이러한 문제는 해결될 수 있는가?
  • RQ3외부 자세 해법기 없이도 그래프 신경망 기반 운동 평균화가 신경 볼륨 렌더링에서 카메라 자세 추정의 강건성을 향상시킬 수 있는가?
  • RQ4강성 있는 시점 사전 지식을 통합할 경우 실생활 영상 조건에서 새로운 시점 합성 품질에 어떤 영향을 미치는가?
  • RQ5노이즈가 많은 실생활 환경에서 시나리오 표현과 카메라 자세의 동시 최적화가 별도 또는 BA 기반 접근보다 더 효과적인가?

주요 결과

  • RM-NeRF는 다중 척도 블렌더 데이터셋의 Mic 시나리오에서 합성 자세 오차 조건에서 PSNR 32.80을 기록하여 BARF(27.03)와 Mip-NeRF(21.90)를 크게 앞서며 성능을 냈다.
  • 동일한 벤치마크에서 RM-NeRF는 Mic 시나리오에서 LPIPS 0.008을 기록했으며, Mip-NeRF(0.064)와 BARF(0.060)보다 훨씬 낮아 더 뛰어난 시각적 품질을 나타냈다.
  • 제거 실험 결과, 냉각 가중치 λ=0.5로 고정할 경우 Mic 시나리오에서 PSNR가 32.80에서 22.20으로 감소함을 확인하여 적응적 최적화 전략의 중요성을 입증했다.
  • RM-NeRF는 Mic 시나리오에서 SSIM 0.963을 기록하여 BARF(0.96)와 Mip-NeRF(0.93)를 초월하여 구조적 정밀도 향상을 입증했다.
  • 카메라 자세가 왜곡된 조건에서도 애니 패턴을 줄이고 새로운 시점 합성을 향상시켜 실제 노이즈에 대한 강건성을 입증했다.
  • 강성 있는 시점 사전 지식을 통합한 동시 최적화는 색상 또는 자세 손실에만 의존하는 방법보다 더 일관되고 정확한 장면 재구성 결과를 도출했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.