Skip to main content
QUICK REVIEW

[논문 리뷰] End-to-end View Synthesis via NeRF Attention

Zelin Zhao, Jiaya Jia|arXiv (Cornell University)|2022. 07. 29.
Advanced Vision and Imaging인용 수 6
한 줄 요약

이 논문은 트랜스포머를 사용하여 볼륨 렌더링를 소프트 특징 조절로 모델링하고, 다단계 레이 및 픽셀 트랜스포머를 적용함으로써 일련의 시퀀스에서 시퀀스로의 과제로 새로운 시야 합성을 재정의하는 새로운 엔드 투 엔드 시야 합성 프레임워크인 NeRF Attention (NeRFA)를 제안한다. NeRFA는 네트워크의 인덕티브 바이어스를 통합함으로써 NeRF와 NerFormer에 비해 고주파 세부 정보 복원 능력과 계산 효율성이 크게 향상된 네 가지 벤치마크에서 최고 성능을 기록한다.

ABSTRACT

In this paper, we present a simple seq2seq formulation for view synthesis where we take a set of ray points as input and output colors corresponding to the rays. Directly applying a standard transformer on this seq2seq formulation has two limitations. First, the standard attention cannot successfully fit the volumetric rendering procedure, and therefore high-frequency components are missing in the synthesized views. Second, applying global attention to all rays and pixels is extremely inefficient. Inspired by the neural radiance field (NeRF), we propose the NeRF attention (NeRFA) to address the above problems. On the one hand, NeRFA considers the volumetric rendering equation as a soft feature modulation procedure. In this way, the feature modulation enhances the transformers with the NeRF-like inductive bias. On the other hand, NeRFA performs multi-stage attention to reduce the computational overhead. Furthermore, the NeRFA model adopts the ray and pixel transformers to learn the interactions between rays and pixels. NeRFA demonstrates superior performance over NeRF and NerFormer on four datasets: DeepVoxels, Blender, LLFF, and CO3D. Besides, NeRFA establishes a new state-of-the-art under two settings: the single-scene view synthesis and the category-centric novel view synthesis.

연구 동기 및 목표

  • 표준 트랜스포머가 시야 합성에서 높은 주파수 세부 정보 복원 능력이 떨어지고 계산 비용이 높다는 한계를 해결하기 위해.
  • 명시적인 3D 밀도 및 색상 예측 없이도 신경 볼륨 렌더링 필드(NeRF)의 인덕티브 바이어스를 트랜스포머 기반 아키텍처에 통합하기 위해.
  • 세부적인 시나리오 세부 정보를 유지하면서 계산 오버헤드를 줄이는 효율적인 어텐션 메커니즘을 설계하기 위해.
  • 단일 시나리오 및 카테고리 중심 설정 모두에서 NeRF와 NerFormer을 능가하는 완전한 어텐션 솔루션을 위한 시야 합성 프레임워크를 수립하기 위해.
  • 명시적인 3D 기하학 또는 렌더링 파이프라인 없이도 레이 포ints에서 픽셀 색상으로의 엔드 투 엔드 학습을 가능하게 하기 위해.

제안 방법

  • 볼륨 렌더링 과정을 소프트 특징 조절 절차로 모델링하고 NeRF의 인덕티브 바이어스를 어텐션 메커니즘에 통합하는 트랜스포머 기반 아키텍처인 NeRF Attention (NeRFA)를 제안한다.
  • 레이 스트림 어텐션 메커니즘: 레이-포인트 특징을 처리하고, 픽셀 스트림 어텐션 메커니즘: 픽셀 간 상관관계를 모델링하여 공간 일관성을 향상시킨다.
  • 전역 어텐션 대비 계산 비용을 줄이기 위해 별도의 레이 및 픽셀 어텐션 헤드를 사용하는 다단계 어텐션을 적용한다.
  • 표준 자기어텐션을 특징 조절 레이어로 대체하며, 위치 임bedding을 사용해 특징을 조절함으로써 명시적인 밀도 및 색상 예측 없이도 NeRF의 볼륨 렌더링를 모방한다.
  • 입력이 레이 포인트 집합이고 출력이 해당하는 픽셀 색상인 시퀀스에서 시퀀스로의 공식화를 적용하여 엔드 투 엔드 학습을 가능하게 한다.
  • 공간적 구조를 유지하고 어텐션이 기하학적 관계를 학습할 수 있도록 레이 포인트와 픽셀에 위치 임베딩을 적용한다.

실험 결과

연구 질문

  • RQ1표준 트랜스포머는 시야 합성에서 볼륨 렌더링 과정을 효과적으로 모델링할 수 있는가, 아니면 고주파 세부 정보 복원에 필요한 인덕티브 바이어스가 부족한가?
  • RQ2모든 레이와 픽셀에 대한 전역 자기어텐션의 계산 비용을 렌더링 품질을 훼손하지 않으면서 어떻게 줄일 수 있는가?
  • RQ3NeRF의 인덕티브 바이어스를 트랜스포머 기반 어텐션 메커니즘에 효과적으로 전달할 수 있는가, 이는 렌더링 정밀도 향상에 기여하는가?
  • RQ4완전한 어텐션 엔드 투 엔드 프레임워크는 명시적인 NeRF 스타일 렌더링 파이프라인 또는 하이브리드 아키텍처를 유지하는 모델보다 성능이 뛰어나게 되는가?
  • RQ5통합된 어텐션 기반 모델은 단일 시나리오와 카테고리 중심 시야 합성 벤치마크 모두에 일반화될 수 있는가?

주요 결과

  • DeepVoxels 데이터셋에서 NeRFA는 PSNR 40.30을 기록하여 바닐라 트랜스포머(23.42)를 크게 앞서며, NeRF와 NerFormer 모두 PSNR 및 SSIM 측면에서 슈퍼리어하다.
  • Blender 데이터셋에서 NeRFA는 PSNR 33.17과 SSIM 0.941을 기록하여, 특히 날카운 에지와 텍스처에서 NeRF와 NerFormer보다 뛰어난 세부 정보 유지 능력을 보였다.
  • LLFF 데이터셋에서 NeRFA는 PSNR 28.15와 SSIM 0.833를 기록하여, 어려운 조명 조건과 복잡한 기하학적 구조를 가진 실생활 장면에서도 뛰어난 강건성을 보였다.
  • 제거 실험 결과, 특징 조절(FM)이 고주파 세부 정보 복원에 핵심적임을 확인하였으며, DeepVoxels에서 이를 제거하면 PSNR가 15점 이상 감소한다.
  • 레이 트랜스포머(RT)와 픽셀 트랜스포머(PT) 구성 요소 모두 기여가 크며, Blender에서 RT를 제거하면 PSNR가 10.5점 감소하고, DeepVoxels에서 PT를 제거하면 PSNR가 3.5점 감소한다.
  • CO3D에서 카테고리 중심 시야 합성에 대해 NeRFA는 NerFormer과 NeRF-WCE를 능가하는 새로운 최고 기록을 수립하였으며, 특히 미리보지 않은 영상과 도전적인 목표 시야에서 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.