Skip to main content
QUICK REVIEW

[논문 리뷰] Generalizable Neural Radiance Fields for Novel View Synthesis with Transformer

Dan Wang, Xinrui Cui|arXiv (Cornell University)|2022. 06. 10.
Advanced Vision and Imaging인용 수 9
한 줄 요약

이 논문은 임의의 수의 소스 뷰와 타겟 노바르 뷰 사이의 복잡한 비선형적 관계를 모델링함으로써 일반화 가능한 시점 표현을 학습하는 Transformer 기반 신경 렌디언스 필드 프레임워크인 TransNeRF를 제안한다. 통합 아키텍처에서 자기 및 크로스 어텐션 메커니즘을 활용함으로써 TransNeRF는 MLP 기반 NeRF보다 지역 기하학적 및 외관 일관성을 더 효과적으로 포착하며, 특히 큰 뷰포인트 차이가 있는 상황에서 시나리오 무관 및 개별 시나리오 미세조정 설정 모두에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

We propose a Transformer-based NeRF (TransNeRF) to learn a generic neural radiance field conditioned on observed-view images for the novel view synthesis task. By contrast, existing MLP-based NeRFs are not able to directly receive observed views with an arbitrary number and require an auxiliary pooling-based operation to fuse source-view information, resulting in the missing of complicated relationships between source views and the target rendering view. Furthermore, current approaches process each 3D point individually and ignore the local consistency of a radiance field scene representation. These limitations potentially can reduce their performance in challenging real-world applications where large differences between source views and a novel rendering view may exist. To address these challenges, our TransNeRF utilizes the attention mechanism to naturally decode deep associations of an arbitrary number of source views into a coordinate-based scene representation. Local consistency of shape and appearance are considered in the ray-cast space and the surrounding-view space within a unified Transformer network. Experiments demonstrate that our TransNeRF, trained on a wide variety of scenes, can achieve better performance in comparison to state-of-the-art image-based neural rendering methods in both scene-agnostic and per-scene finetuning scenarios especially when there is a considerable gap between source views and a rendering view.

연구 동기 및 목표

  • MLP 기반 NeRF의 한계를 해결하기 위해 임의의 수의 소스 뷰를 처리하고 소스 뷰와 타겟 뷰 사이의 복잡한 비선형적 관계를 포착하는 것.
  • 지역 기하학적 및 외관 일관성을 유지하는 통합적이고 뷰 일관성 있는 시점 표현을 학습함으로써 노바르 뷰 합성의 일반화 능력을 향상시키는 것.
  • 이전의 이미지 조건 기반 NeRF에서 풀링 기반 융합에 의존하는 것의 문제점을 해결하여 소스 뷰와 렌더링 뷰 사이의 깊은 고수준 의존성을 모델링하는 것.
  • 소스 뷰가 타겟 뷰와 크게 다를 경우, 특히 도전적인 시점 갭이 있는 실세계 환경에서도 안정적인 성능을 제공하는 것.
  • 합성 및 실세계 데이터셋에서 시나리오 무관 및 개별 시나리오 미세조정 설정 모두에서 뛰어난 성능을 입증하는 것.

제안 방법

  • 다양한 소스 뷰의 2차원 투영 픽셀과 쿼리 레이를 따라 있는 3차원 점을 통합 어텐션 공간에서 동시에 처리하는 통합 Transformer 인코더-디코더 아키텍처를 도입한다.
  • 소스 뷰 간의 장거리 의존성을 모델링하기 위해 멀티헤드 자기어텐션을 사용하고, 레이를 따라 소스 뷰 특징과 3차원 쿼리 점을 정렬하기 위해 크로스어텐션을 활용한다.
  • 3차원 공간 좌표와 2차원 카메라 자세에 대한 위치 인코딩을 통합하여 기하학적 및 뷰 특화된 맥락을 유지한다.
  • 주의 집합 특징에 기반한 조건부 시점 표현을 사용하여 렌디언스 필드를 다수의 소스 뷰로부터의 특징에 조건화한다.
  • 각 3차원 점에 대해 학습 가능한 쿼리 임베딩을 사용하여 관련된 특징을 소스 뷰 전반에서 참조함으로써 동적 특징 융합을 가능하게 한다.
  • 다양하고 대규모인 다중 시나리오 데이터셋에서 모델을 엔드 투 엔드로 훈련시켜 일반화 가능한 노바르 뷰 합성을 위한 일반적인 사전 지식를 학습한다.

실험 결과

연구 질문

  • RQ1Transformer 기반 아키텍처가 신경 렌디언스 필드에서 임의의 수의 소스 뷰와 타겟 노바르 뷰 사이의 복잡한 비선형적 관계를 효과적으로 모델링할 수 있는가?
  • RQ2어느 정도 어텐션 기반 특징 융합이 고수준 의존성을 포착하여 뷰 일관성 있는 시점 표현을 구현하는 데 풀링 기반 융합보다 우월한가?
  • RQ3단일의 시나리오 무관 TransNeRF 모델이 개별 시나리오 미세조정 없이도 새로운 시나리오에 효과적으로 일반화될 수 있는가, 특히 큰 뷰포인트 차이가 있는 경우에도 말이다?
  • RQ4TransNeRF는 시나리오 무관 및 개별 시나리오 미세조정 시나리오에서 최신 기술 수준의 이미지 기반 렌더링 방법과 비교해 어떻게 성능을 내는가?
  • RQ5어느 정도 어휘 메커니즘이 레이와 주변 뷰 간의 형태 및 외관의 국소 일관성을 향상시키는가?

주요 결과

  • TransNeRF는 합성 및 실세계 데이터셋 모두에서 시나리오 무관 및 개별 시나리오 미세조정 설정에서 최신 기술 수준의 성능을 달성한다.
  • 실세계 프론트 포워딩 데이터셋에서 시나리오 무관 설정에서 TransNeRF는 PSNR 29.41과 SSIM 0.942를 기록했으며, IBRNet(PSNR: 28.73, SSIM: 0.930)과 PixelNeRF(PSNR: 28.55, SSIM: 0.927)를 모두 앞서나간다.
  • 개별 시나리오 미세조정 설정에서 실세계 데이터셋에서 TransNeRF는 PSNR 30.12와 SSIM 0.951을 달성했으며, IBRNet(PSNR: 29.31, SSIM: 0.940)과 MVSNeRF(PSNR: 29.05, SSIM: 0.935)를 크게 앞서나간다.
  • 고도의 뷰포인트 차이가 있는 상황(예: S3)에서 TransNeRF는 기준 모델 대비 LPIPS를 15-20% 감소시켜 더 적은 시각적 오류를 유발한다.
  • 정성적 결과에서는 TransNeRF가 얇은 가지나 잎 가장자리와 같은 미세 구조를 기준 모델보다 더 정확하게 유지하는 것으로 나타났으며, 특히 소스 뷰가 타겟 뷰에서 멀리 떨어져 있을 경우 두드러진다.
  • 소스 뷰와 타겟 뷰 간의 차이가 커질수록 TransNeRF와 기준 모델 간의 성능 격차가 더욱 벌어지며, 이는 도전적인 뷰 구성에 대한 강건성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.