Skip to main content
QUICK REVIEW

[논문 리뷰] LENS: Localization enhanced by NeRF synthesis

Arthur Moreau, Nathan Piasco|arXiv (Cornell University)|2021. 10. 13.
Robotics and Sensor-Based Localization참고 문헌 33인용 수 17
한 줄 요약

LENS는 NeRF-W를 통해 씬의 3D 기하학적 구조를 기반으로 기하학적으로 일관된 합성 신시야를 생성함으로써 카메라 자세 회귀 성능을 향상시킨다. 이는 씬 전역에 걸쳐 균일하게 샘플링된 가상 카메라 자세를 사용하여 이루어지며, 데이터 증강을 통해 Cambridge Landmarks와 7-Scenes에서 중앙값 위치 오차를 60% 감소시켜 기하학적 방법과 유사한 성능을 달성한다. 이는 아키텍처 변경 없이도 가능하다.

ABSTRACT

Neural Radiance Fields (NeRF) have recently demonstrated photo-realistic results for the task of novel view synthesis. In this paper, we propose to apply novel view synthesis to the robot relocalization problem: we demonstrate improvement of camera pose regression thanks to an additional synthetic dataset rendered by the NeRF class of algorithm. To avoid spawning novel views in irrelevant places we selected virtual camera locations from NeRF internal representation of the 3D geometry of the scene. We further improved localization accuracy of pose regressors using synthesized realistic and geometry consistent images as data augmentation during training. At the time of publication, our approach improved state of the art with a 60% lower error on Cambridge Landmarks and 7-scenes datasets. Hence, the resulting accuracy becomes comparable to structure-based methods, without any architecture modification or domain adaptation constraints. Since our method allows almost infinite generation of training data, we investigated limitations of camera pose regression depending on size and distribution of data used for training on public benchmarks. We concluded that pose regression accuracy is mostly bounded by relatively small and biased datasets rather than capacity of the pose regression model to solve the localization task.

연구 동기 및 목표

  • 비디오 시퀀스에서 유도된 편향되고 비균일한 학습 데이터로 인해 카메라 자세 회귀기의 일반화 성능이 떨어지는 문제를 해결하기 위해.
  • NeRF를 사용하여 다양하고 공간적으로 균형 잡힌 합성 데이터셋을 생성함으로써 자세 회귀 정확도를 향상시키기 위해.
  • 큰 규모이자 잘 분포된 합성 데이터로 훈련할 경우, 학습 기반 방법이 기하학적 방법의 성능을 따라잡을 수 있음을 입증하기 위해.
  • 모델 용량과 무관하게 데이터 양과 분포가 자세 회귀 성능에 미치는 영향을 조사하기 위해.
  • 합성 데이터 증강을 통해 임베디드 로봇 시스템에서 실시간, 저메모리 재현위치 설정을 가능하게 하기 위해.

제안 방법

  • LENS는 실재 이미지와 알려진 자세를 기반으로 NeRF-W를 사용해 신경 레디언스 필드를 훈련시으며, 3D 씬 기하학과 외관을 학습한다.
  • 가상 카메라 자세는 씬 전역에 걸쳐 균일한 3D 격자 위에 생성되며, NeRF의 내부 기하학 정보를 활용해 가림되거나 열악한 시야를 거부한다.
  • 최적화된 가상 자세에서 합성 이미지가 렌더링되며, 이는 기하학적 일관성과 사진 수준의 사실감을 보장한다.
  • 자세 회귀기는 실재 이미지와 NeRF로 생성된 합성 이미지의 병합된 데이터셋으로 훈련되어 일반화 성능이 향상된다.
  • 온라인 재현위치 설정 동안 빠르고 실시간 추론을 위해 경량 모델인 CoordiNet을 사용한다.
  • 합성 데이터와 실재 데이터를 혼합함으로써 도메인 갭을 방지하여, 합성 이미지와 실재 이미지 분포 간 격차를 줄인다.

실험 결과

연구 질문

  • RQ1NeRF 기반의 새로운 시야 합성 기법이 고품질의 기하학적으로 일관된 이미지를 생성하여 카메라 자세 회귀 성능을 향상시킬 수 있는가?
  • RQ2실제 영상 기반 훈련과 비교해 전체 씬에 걸쳐 균일하게 분포된 합성 데이터셋으로 훈련할 경우, 국소화 오차가 크게 감소하는가?
  • RQ3자세 회귀 정확도가 모델 용량이 아닌 데이터 분포에 의해 얼마나 제한되는가?
  • RQ4합성 데이터 증강이 학습 기반과 기하학적 방법 간의 성능 격차를 메울 수 있는가?
  • RQ5훈련 데이터의 크기와 분포가 실제 환경에서 자세 회귀기의 일반화 성능에 어떤 영향을 미치는가?

주요 결과

  • Cambridge Landmarks 데이터셋에서 LENS는 기준 자세 회귀 모델 대비 중앙값 이동 오차와 회전 오차를 60% 감소시켰다.
  • 7-Scenes의 Fire 씬에서, 훈련 데이터를 LENS가 생성한 합성 시야로 교체함으로써 중앙값 오차가 27cm/11.7°에서 8cm/3.5°로 감소했다.
  • 합성 데이터로 최대 5000% 이상의 훈련 데이터를 확보함으로써 7-Scenes에서 중앙값 오차 0.03m/1.4°를 달성했으며, 이는 기하학적 방법의 성능과 동일한 결과를 보였다.
  • 연구 결과, 자세 회귀 정확도는 주로 모델 용량이나 아키텍처보다는 데이터 편향과 부족함에 의해 제한된다는 결론을 내렸다.
  • 합성 데이터 전용 훈련은 도메인 갭으로 인해 실패했으며, 실재 테스트 이미지에서의 강건성을 확보하기 위해 실재 및 합성 데이터 혼합이 필수적임을 확인했다.
  • LENS는 이미지당 <50ms 이내의 실시간 추론과 <50MB 이내의 메모리 사용량을 제공하여 임베디드 로봇 응용 분야에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.