Skip to main content
QUICK REVIEW

[논문 리뷰] Geometry-Aware Learning of Maps for Camera Localization

Samarth Brahmbhatt, Jinwei Gu|arXiv (Cornell University)|2017. 12. 09.
Robotics and Sensor-Based Localization참고 문헌 21인용 수 4
한 줄 요약

이 논문은 시각, GPS, 시각 옵티컬 플로우 입력을 융합하여 카메라 위치 추정을 위한 데이터 기반, 기하학적 인지 가능한 지ap 표현을 학습하는 딥 뉴럴 네트워크인 MapNet을 제안한다. 학습 및 추론 중 기하학적 제약 조건(예: 상대 자세, 이동, 회전)을 손실 함수에 통합함으로써 MapNet은 이전의 DNN 기반 방법보다 현저히 향상된 정밀도를 달성하며, 레이블이 없는 영상 시퀀스를 사용한 자기지도 학습적 적응을 통해 추가로 성능 향상을 이룬다.

ABSTRACT

Maps are a key component in image-based camera localization and visual SLAM systems: they are used to establish geometric constraints between images, correct drift in relative pose estimation, and relocalize cameras after lost tracking. The exact definitions of maps, however, are often application-specific and hand-crafted for different scenarios (e.g. 3D landmarks, lines, planes, bags of visual words). We propose to represent maps as a deep neural net called MapNet, which enables learning a data-driven map representation. Unlike prior work on learning maps, MapNet exploits cheap and ubiquitous sensory inputs like visual odometry and GPS in addition to images and fuses them together for camera localization. Geometric constraints expressed by these inputs, which have traditionally been used in bundle adjustment or pose-graph optimization, are formulated as loss terms in MapNet training and also used during inference. In addition to directly improving localization accuracy, this allows us to update the MapNet (i.e., maps) in a self-supervised manner using additional unlabeled video sequences from the scene. We also propose a novel parameterization for camera rotation which is better suited for deep-learning based camera pose regression. Experimental results on both the indoor 7-Scenes dataset and the outdoor Oxford RobotCar dataset show significant performance improvement over prior work. The MapNet project webpage is https://goo.gl/mRB3Au.

연구 동기 및 목표

  • 시각 SLAM 및 이미지 기반 위치 추정에서 전통적인 수작업으로 만든 지도 표현의 유연성 부족과 응용 분야에 국한된 특성 해결
  • 다양한 환경과 센서 입력에 적응할 수 있는 일반 목적의 지도 표현을 엔드 투 엔드로 학습 가능하게 만들기
  • 기하학적 제약 조건(예: 상대 자세, 이동, 회전)을 딥 러닝 학습 과정에 직접 통합하여 카메라 위치 추정 정확도 향상
  • 절대 자세 지도 없이도 레이블이 없는 영상 시퀀스를 사용해 지속적인 자기지도 학습적 지도 갱신 지원
  • 딥 러닝 기반 자세 회귀 성능 향상을 위해 단위 허니터니언의 로그를 활용한 새로운 회전 파arameterization 개발

제안 방법

  • 이미지를 입력으로 받아 카메라 자세를 예측하는 딥 뉴럴 네트워크(MapNet)로 지도를 표현하며, 지도는 네트워크 가중치에 암묵적으로 포함됨
  • 학습 중에 기하학적 제약 조건(예: 시각 옵티컬 플로우로부터의 상대 자세, GPS 이동, IMU 회전)을 미분 가능한 손실 항목으로 제작
  • 딥 네트워크에서 최적화 안정성과 회귀 정확도 향상을 위해 단위 허니터니언의 로그를 활용한 새로운 회전 파arameterization 도입
  • 레이블이 없는 영상 시퀀스에서 기하학적 제약 조건을 활용해 네트워크 가중치를 미세 조정함으로써 MapNet+를 통한 자기지도 학습적 적응 가능
  • 움직이는 윈도우에서 MapNet 예측값과 시각 옵티컬 플로우를 포즈 그래프 최적화(PGO)를 통해 융합하여 국소적 부드러움과 전역 일관성을 결합, 결과적으로 MapNet+PGO 도출
  • 어텐션 맵을 활용해 MapNet이 기하학적으로 의미 있는 영상 영역에 집중하고 있음을 시각화 및 검증함으로써 시간적 일관성 향상

실험 결과

연구 질문

  • RQ1다양한 환경에 일반화 가능한 일반 목적의 데이터 기반 지도 표현을 학습할 수 있는 딥 뉴럴 네트워크를 개발할 수 있는가?
  • RQ2보조 센서에서 유도된 기하학적 제약 조건(예: 상대 자세, 이동, 회전)을 손실 함수에 통합하면 카메라 위치 추정 정확도가 어떻게 향상되는가?
  • RQ3레이블이 없는 영상 시퀀스를 사용해 MapNet을 지속적으로 자기지도 학습 방식으로 갱신할 수 있는가? 이는 정확도와 적응성 향상에 기여하는가?
  • RQ4제안된 로그 허니터니언 파arameterization은 기존 표현 방식에 비해 딥 러닝 기반 카메라 자세 회귀 성능을 향상시키는가?
  • RQ5PGO를 통해 MapNet 예측값과 시각 옵티컬 플로우를 융합하면 장거리 시퀀스에서 드리프트를 줄이고 정확도를 향상시킬 수 있는가?

주요 결과

  • MapNet은 실내 7-Scenes 및 실외 Oxford RobotCar 데이터셋에서 이전의 DNN 기반 방법인 PoseNet보다 뚜렷이 뛰어난 성능을 보이며, 이동 및 회전 오차가 모두 낮아졌다.
  • 학습 손실에 기하학적 제약 조건을 통합함으로써 시각 옵티컬 플로우, GPS, IMU로부터의 상대 자세, 이동, 회전 정보를 활용해 위치 추정 오차를 감소시켰다.
  • MapNet+는 레이블이 없는 영상 시퀀스를 사용해 자기지도 학습적 적응을 가능하게 하여, 진단 자세가 필요 없이도 시간이 지남에 따라 성능 향상을 이룬다.
  • 움직이는 윈도우에서 PGO를 통해 MapNet 예측값과 시각 옵티컬 플로우를 융합한 MapNet+PGO는 최고의 성능을 기록하였으며, 장거리 시퀀스에서 드리프트를 줄이고 정확도를 향상시켰다.
  • 제안된 로그 허니터니언 파arameterization은 7-Scenes 데이터셋에서의 정량적 분석을 통해 PoseNet과 MapNet 양쪽 모두의 성능 향상을 입증하였다.
  • MapNet+PGO에서 발생하는 오류 예측(일반적으로 과노출 또는 동적 영역으로 인한 것)은 단순한 시간적 중앙값 필터링을 통해 효과적으로 제거되었으며, 이는 그림 12에서 확인할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.