[논문 리뷰] GARF: Gaussian Activated Radiance Fields for High Fidelity Reconstruction and Pose Estimation
GARF는 위치 임bedding을 사용하지 않는 신경 렌디언스 필드를 제안하며, 고정밀 3D 시각 재구성과 낮은 품질의 초기 카메라 자세 추정에 대해 강건한 성능을 보인다. 기존의 활성화 함수보다 일阶 도함수를 더 효과적으로 유지함으로써, BARF 및 ref-NeRF와 같은 최첨단 기법들보다 우수한 성능을 내며, 특히 텍스처가 적은 환경에서 복잡한 초모수 조정이나 초기화 전략이 필요하지 않다.
Despite Neural Radiance Fields (NeRF) showing compelling results in photorealistic novel views synthesis of real-world scenes, most existing approaches require accurate prior camera poses. Although approaches for jointly recovering the radiance field and camera pose exist (BARF), they rely on a cumbersome coarse-to-fine auxiliary positional embedding to ensure good performance. We present Gaussian Activated neural Radiance Fields (GARF), a new positional embedding-free neural radiance field architecture - employing Gaussian activations - that outperforms the current state-of-the-art in terms of high fidelity reconstruction and pose estimation.
연구 동기 및 목표
- 공동 NeRF 및 자세 최적화에서 번거로운 계층적 위치 임베딩 스케줄링이 필요 없도록 제거하는 것.
- 불완전하거나 노이즈가 있는 카메라 자세 초기화 조건 하에서 시각 재구성 및 자세 추정의 강건성을 향상시키는 것.
- 좌표 MLP에서 위치 인코딩의 대체로 가우시안 활성화 함수의 효과성을 탐색하는 것.
- 복잡한 초모수 조정에 의존하지 않고도 시각 합성 및 자세 정확도에서 최첨단 성능을 달성하는 것.
- SfM 파이프라인이 종종 실패하는 실세계의 낮은 텍스처 환경에서 가우시안 활성화 네트워크의 가능성과 타당성을 입증하는 것.
제안 방법
- 기존의 ReLU나 사인 활성화 함수 대신 가우시안 활성화 함수를 사용하는 새로운 좌표 MLP 아키텍처를 도입한다.
- 입력 임bed딩에서 위치 인코딩 레이어가 필요 없도록 자체 포함형 네트워크 설계를 구현한다.
- 백프로파게이션 중 목표 함수의 일阶 도함수를 더 효과적으로 유지하는 이론적 통찰을 활용한다.
- 신규 시각 합성에 대해 볼륨 렌더링 프레임워크 내에서 가우시안 활성화 MLP를 적용하며, 레이디언스 필드와 카메라 자세를 동시에 최적화한다.
- 위치 임베딩 스케줄링 없이도 표준 훈련 프로토콜(Adam 옵tim자, 학습률 감소, 계층적 샘플링)을 사용한다.
- 최적화된 자세를 기준으로 SfM 추정치와 정렬하기 위해 프로크루스테스 분석을 적용한다.
실험 결과
연구 질문
- RQ1가우시안 활성화 함수가 NeRF에서 위치 인코딩을 대체할 수 있을까? 그리고 공동 시각 재구성 및 자세 추정 성능을 유지하거나 향상시킬 수 있을까?
- RQ2가우시안 활성화 함수 사용이, 특히 노이즈가 많거나 정확도가 떨어지는 초기 카메라 자세가 존재할 경우 최적화 과정에서 더 나은 기울기 흐름을 유도할까?
- RQ3GARF와 같이 위치 임베딩이 없는 아키텍처가 실세계의 시각 자료, 특히 낮은 텍스처 영역에서도 최첨단의 시각 합성 및 자세 정확도 성능을 달성할 수 있을까?
- RQ4초기 카메라 자세가 불완전할 경우 GARF가 BARF 및 ref-NeRF와 비교해 강건성과 수렴 성능에서 어떻게 다른가?
- RQ5활성화 함수 선택이 공동 레이디언스 필드 및 자세 학습 최적화 다이내믹스에 어떤 영향을 미칠까?
주요 결과
- GARF는 폭포 시나리오에서 PSNR 29.09를 기록하여 BARF(28.48)와 ref-NeRF(25.62)를 모두 초월하며, 더 높은 시각 합성 정밀도를 입증한다.
- 어려운 잎 시나리오에서는 PSNR 19.72를 기록하여 BARF(23.53)와 ref-NeRF(14.42)를 크게 앞서며, 낮은 텍스처 영역에서의 강건성을 보여준다.
- 잎 시나리오에서 GARF는 평균 회전 오차를 0.13°로 줄였고, BARF의 1.00°와 비교해 자세 추정 정확도가 향상됨을 보였다.
- 방 시나리오에서는 PSNR 31.90과 SSIM 0.94를 기록하여, BARF 및 ref-NeRF보다 사진 수준의 정확한 시각 합성 성능을 확보했다.
- GARF는 복잡한 기하학적 구조와 낮은 텍스처를 포함한 모든 시나리오에서 높은 성능을 유지했으며, 정밀한 초모수 조정이나 초기화 전략이 필요하지 않았다.
- 그림 6과 그림 7의 정성적 결과에서 GARF는 iPhone으로 촬영한 낮은 텍스처 영역에서도 날카롭고 잡음이 없는 새로운 시각을 생성했으며, ref-NeRF가 실패하는 상황에서도 성능을 유지를 하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.