Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Neural Light Fields with Ray-Space Embedding Networks

Benjamin Attal, Jia‐Bin Huang|arXiv (Cornell University)|2021. 12. 02.
Advanced Vision and Imaging참고 문헌 58인용 수 11
한 줄 요약

이 논문은 4차원 레이 공간을 임베딩하는 레이-스페이스 임베딩 네트워크를 사용하는 새로운 신경 라이트 필드 표현을 제안한다. 이 네트워크는 4차원 레이 공간을 해석 가능한 잠재 공간으로 매핑하여, 픽셀당 하나 또는 몇 번의 네트워크 평가로도 빠르고 메모리 효율적인 뷰 합성을 가능하게 한다. 이 방법은 스탠포드 라이트 필드와 같은 고밀도 전방향 데이터셋에서 최신 기술 수준의 성능을 달성하며, 반사 및 굴절과 같은 복잡한 뷰 의존 효과를 고려할 때 특히 렌더링 속도, 품질, 메모리 효율성 면에서 NeRF 기반 접근법을 능가한다.

ABSTRACT

Neural radiance fields (NeRFs) produce state-of-the-art view synthesis results. However, they are slow to render, requiring hundreds of network evaluations per pixel to approximate a volume rendering integral. Baking NeRFs into explicit data structures enables efficient rendering, but results in a large increase in memory footprint and, in many cases, a quality reduction. In this paper, we propose a novel neural light field representation that, in contrast, is compact and directly predicts integrated radiance along rays. Our method supports rendering with a single network evaluation per pixel for small baseline light field datasets and can also be applied to larger baselines with only a few evaluations per pixel. At the core of our approach is a ray-space embedding network that maps the 4D ray-space manifold into an intermediate, interpolable latent space. Our method achieves state-of-the-art quality on dense forward-facing datasets such as the Stanford Light Field dataset. In addition, for forward-facing scenes with sparser inputs we achieve results that are competitive with NeRF-based approaches in terms of quality while providing a better speed/quality/memory trade-off with far fewer network evaluations.

연구 동기 및 목표

  • 렌더링 속도와 메모리 사용량의 한계를 해결하기 위해 신경 라이트 필드 표현을 학습함으로써 NeRF의 한계를 보완한다.
  • 고밀도 및 희소 입력 라이트 필드 모두에 대해 효율적이고 고품질의 뷰 합성을 가능하게 한다.
  • 반사 및 굴절과 같은 복잡한 뷰 의존 효과를 체계적으로 모델링한다. 이러한 효과들은 체적 표현에 의해 잘 포착되지 않는다.
  • 기존 방법보다 더 나은 렌더링 속도, 메모리 사용량, 재구성 품질 간의 균형을 달성한다.
  • 부분 관측에서 4차원 레이 스페이스에서 정확한 보간을 지원하는 학습 가능하고 미분 가능한 표현을 개발한다.

제안 방법

  • 레이-스페이스 임베딩 네트워크는 4차원 레이 매개변수(예: 두 평면 매개변수화)를 학습 가능한, 보간 가능한 잠재 공간으로 매핑하여 일반화 및 보간 성능을 향상시킨다.
  • 공간을 다중 해상도 볼록 격자로 분할하여 국소 라이트 필드를 생성함으로써, 희소 입력을 더 잘 모델링하면서도 빠른 추론을 유지한다.
  • 국소 아핀 변환 임베딩을 도입하여 국소적으로 선형적인 색상 수준 집합을 암묵적으로 장려함으로써, 보간 중 뷰 일致성을 향상시킨다.
  • 예측된 새로운 뷰와 진짜 뷰 간의 픽셀 단위 차이를 최소화하는 볼륨 렌더링 손실을 통해 네트워크를 훈련한다.
  • 임베딩 네트워크의 표현 능력을 향상시키기 위해 레이 좌표에 위치 인코딩을 적용한다.
  • 작은 기준 거리의 라이트 필드에서는 픽셀당 하나의 네트워크 평가로, 더 큰 기준 거리에서는 몇 번의 평가로도 렌더링을 지원한다.

실험 결과

연구 질문

  • RQ14차원 레이 스페이스에 직접 신경 표현을 학습시켜, 빠르고 정확한 뷰 합성을 가능하게 할 수 있는가?
  • RQ2반사 및 굴절과 같은 복잡한 뷰 의존 효과를 신경 라이트 필드에서 충실하게 모델링할 수 있는가?
  • RQ3직접 NeRF 스타일의 5차원 레디언스 필드 학습보다 학습 가능한 임베딩 네트워크가 레이 스페이스에서 보간 품질을 향상시킬 수 있는가?
  • RQ4신경 라이트 필드에서 공간 분할을 사용할 경우, 렌더링 속도, 메모리 사용량, 재구성 품질 간의 상호 상충 관계는 어떻게 되는가?
  • RQ5제안된 방법이 렌더링 속도, 품질, 메모리 효율성 면에서 NeRF 기반 및 명시적 격자 기반 접근법을 모두 능가할 수 있는가?

주요 결과

  • 스탠포드 라이트 필드 데이터셋에서 제안된 방법은 PSNR 27.454, SSIM 0.905를 기록했으며, 렌더링 속도와 메모리 효율성에서 NeRF(PSNR: 27.928, SSIM: 0.916)를 능가한다.
  • 희소 전방향 시나리오에서는 16³ 격자로 0.69 FPS에서 PSNR 27.350을 달성했으며, 유사 해상도에서 AutoInt(PSNR: 25.531, 0.26 FPS)를 능가한다.
  • 절단 분석 결과, 국소 아핀 임베딩은 베이스라인 및 특징 기반 임베딩보다 보간 품질을 향상시키며, 뷰 일치성에서 최적의 균형을 이룬다.
  • 32³ 분할에서 렌더링 시간은 0.34 FPS로 줄었으며, 높은 품질(PSNR: 27.454)을 유지했고, NeRF의 0.07 FPS에 비해 빠르다.
  • 표준 NeRF가 잘 모델링하지 못하는 복잡한 뷰 의존 효과인 왜곡된 반사 및 굴절 효과에서도 경쟁적인 결과를 달성했다.
  • 플루커 좌표를 사용한 360° 시나리오에 대한 초도 결과에서는 AutoInt를 능가했지만, 색상 수준 집합이 더 이상 아핀이 아니므로 향후 개선 여지가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.