Skip to main content
QUICK REVIEW

[논문 리뷰] Is Attention All That NeRF Needs?

Mukund Varma T, Peihao Wang|arXiv (Cornell University)|2022. 07. 27.
Advanced Vision and Imaging인용 수 6
한 줄 요약

이 논문은 일반화 가능한 신경 렌디언스 필드 트랜스포머(GNT)를 제안한다. GNT는 명시적인 渲染 방정식 없이도 신경 렌디언스 필드를 재구성하고 새로운 시점의 영상을 렌더링할 수 있는 트랜스포머 기반 아키텍처이다. 시점 트랜스포머를 통해 기하학적 특징 집합을 수행하고, 레이 트랜스포머를 통해 주목사용 렌더링을 수행함으로써, GNT는 새로운 시점에서 최고 성능을 기록하며, 다양한 시나리오 간 일반화 성능을 평균 약 10% 향상시켰다. 또한 주목사용 메커니즘을 통해 물리적으로 타당한 깊이 및 가림 정보를 학습한다.

ABSTRACT

We present Generalizable NeRF Transformer (GNT), a transformer-based architecture that reconstructs Neural Radiance Fields (NeRFs) and learns to renders novel views on the fly from source views. While prior works on NeRFs optimize a scene representation by inverting a handcrafted rendering equation, GNT achieves neural representation and rendering that generalizes across scenes using transformers at two stages. (1) The view transformer leverages multi-view geometry as an inductive bias for attention-based scene representation, and predicts coordinate-aligned features by aggregating information from epipolar lines on the neighboring views. (2) The ray transformer renders novel views using attention to decode the features from the view transformer along the sampled points during ray marching. Our experiments demonstrate that when optimized on a single scene, GNT can successfully reconstruct NeRF without an explicit rendering formula due to the learned ray renderer. When trained on multiple scenes, GNT consistently achieves state-of-the-art performance when transferring to unseen scenes and outperform all other methods by ~10% on average. Our analysis of the learned attention maps to infer depth and occlusion indicate that attention enables learning a physically-grounded rendering. Our results show the promise of transformers as a universal modeling tool for graphics. Please refer to our project page for video results: https://vita-group.github.io/GNT/.

연구 동기 및 목표

  • NeRF의 각 시나리오 최적화 및 시나리오 간 일반화 능력 부족 문제를 해결하기 위해 이식 가능하고 종단 간 신규 시점 합성 기능을 제공한다.
  • NeRF의 수작업으로 구성된 부피 렌더링 방정식을 학습 가능한 주목사용 기반 렌더링 메커니즘으로 대체한다.
  • 트랜스포머가 3차원 시나리오 표현 및 렌더링을 위한 일반적인, 미분 가능한 집합 함수로 기능할 수 있는지 조사한다.
  • GNT의 주목사용 메커니즘이 명시적 지도나 기하학적 사전 지식 없이도 깊이 및 가림 신호를 암묵적으로 학습하는지 분석한다.
  • 주목사용 기반 학습을 사용할 경우, 명시적 3차원 기하학이나 고정된 렌더링 공식과 같은 인도적 편향이 더 이상 필요하지 않음을 보여준다.

제안 방법

  • 시점 트랜스포머는 에피포어라 기하학을 인도적 편향으로 사용하여 다중 시점 이미지 특징을 집계하며, 에피포어라 선을 따라 픽셀에 주목하여 좌표에 맞춰진 특징을 예측한다.
  • 시점 트랜스포머는 다중 척도 특징을 추출하기 위해 U-Net 백본을 사용하고, 이후 자기 주목사용을 통해 교차 시점 특징 매칭을 수행하는 트랜스포머 인코더를 사용한다.
  • 레이 트랜스포머는 추적된 레이를 따라 좌표에 맞춰진 특징을 복원하며, 고정된 렌더링 공식 없이도 새로운 시점의 색상 렌더링을 학습한다.
  • 레이 트랜스포머는 레이를 따라 점들에 주목하며, 주목 가중치가 은밀히 가시성과 깊이를 모델링하여 시나리오 적응형 렌더링을 가능하게 한다.
  • 모델은 소스 시점에서 종단 간으로 훈련되며, 각 시나리오에 대한 미세조정이 필요 없어, 새로운 시나리오에서 제로샷 추론이 가능하다.
  • 아키텍처는 완전히 미분 가능하며, 명시적 기하학적 지도 없이 표준 역전파를 통해 최적화가 가능하다.

실험 결과

연구 질문

  • RQ1트랜스포머 기반 아키텍처가 명시적 부피 렌더링 방정식을 대체하면서도 렌더링 품질을 유지하거나 향상시킬 수 있는가?
  • RQ2주목사용 메커니즘이 명시적 지도나 기하학적 사전 지식 없이 깊이 및 가림 인식을 어느 정도 학습할 수 있는가?
  • RQ3단일 GNT 모델이 재훈련이나 미세조정 없이 다양한 새로운 시나리오에 일반화될 수 있는가?
  • RQ4GNT의 주목사용 메커니즘은 반사나 그림자와 같은 물리적 현상을 모델링하는 데 있어 전통적인 비용 부피 또는 특징 집합 방법과 비교해 어떤가?
  • RQ5시점 트랜스포머에서 에피포어라 기하학을 인도적 편향으로 사용할 경우, 기하학적 지식이 없는 방법에 비해 특징 정렬 및 일반화 능력이 향상되는가?

주요 결과

  • GNT는 다양한 벤치마크에서 시나리오 간 일반화 성능에서 최고 성능을 기록하며, 이는 모든 이전 방법보다 평균 약 10% 향상된 결과이다.
  • LLFF 데이터셋에서 GNT는 PSNR 0.963, SSIM 0.846, LPIPS 0.055를 기록하여 NeRF 및 기타 최고 성능 방법을 초월한다.
  • 레이 트랜스포머의 주목 맵은 깊이 및 가림과 강한 상관관계를 보이며, GNT가 암묵적으로 물리적으로 타당한 렌더링을 학습하고 있음을 시사한다.
  • 정성적 결과는 GNT가 명시적 빛 전달 모델 없이도 복잡한 조명 효과, 예를 들어 반사 및 그림자를 모델링할 수 있음을 보여준다.
  • 모델은 복잡한 기하학적 구조나 외관을 가진 새로운 시나리오에도 잘 일반화되며, 시나리오별 적응 조정 없이도 성능을 유지한다.
  • 강력한 성능에도 불구하고, 경계 픽셀에서 에피포어라 대응이 누락되어 경미한 아티팩트가 발생함을 확인하여, 모서리 케이스 처리에 한계가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.