Skip to main content
QUICK REVIEW

[논문 리뷰] CMRNet++: Map and camera agnostic monocular visual localization in lidar maps

Daniele Cattaneo, Domenico G. Sorrenti|arXiv (Cornell University)|2020. 04. 01.
Robotics and Sensor-Based Localization인용 수 2
한 줄 요약

CMRNet++는 재학습 없이도 미리 보지 않은 환경에서 정확한 정위치를 가능하게 하는 카메라 및 지ap 무관성 단안 시각 정위치 방법을 도입한다. 깊이 학습과 기하학적 校정을 조합함으로써 KITTI, Argoverse, Lyft5 데이터셋에서 최신 기술 수준의 성능을 달성하며, 다양한 카메라와 환경에서 강건한 일반화 능력을 보여준다.

ABSTRACT

Localization is a critically essential and crucial enabler of autonomous robots. While deep learning has made significant strides in many computer vision tasks, it is still yet to make a sizeable impact on improving capabilities of metric visual localization. One of the major hindrances has been the inability of existing Convolutional Neural Network (CNN)-based pose regression methods to generalize to previously unseen places. Our recently introduced CMRNet effectively addresses this limitation by enabling map independent monocular localization in LiDAR-maps. In this paper, we now take it a step further by introducing CMRNet++, which is a significantly more robust model that not only generalizes to new places effectively, but is also independent of the camera parameters. We enable this capability by combining deep learning with geometric techniques, and by moving the metric reasoning outside the learning process. In this way, the weights of the network are not tied to a specific camera. Extensive evaluations of CMRNet++ on three challenging autonomous driving datasets, i.e., KITTI, Argoverse, and Lyft5, show that CMRNet++ outperforms CMRNet as well as other baselines by a large margin. More importantly, for the first-time, we demonstrate the ability of a deep learning approach to accurately localize without any retraining or fine-tuning in a completely new environment and independent of the camera parameters.

연구 동기 및 목표

  • 기존의 CNN 기반 단안 시각 정위치 방법이 아직 보지 않은 환경에서 일반화 능력이 부족한 문제를 해결한다.
  • 기존 딥 러닝 모델이 특정 카메라 파라미터와 LiDAR 지도 구조에 의존하는 문제를 해결한다.
  • 재학습이나 미세조정 없이도 새로운 환경에서 즉시 정위치를 가능하게 한다.
  • 메트릭 추론을 신경망 가중치에서 분리하여 카메라 독립성을 확보한다.
  • 다양한 자율주행 데이터셋에서 카메라 설정과 지도 유형이 상이한 환경에서도 강건한 성능을 입증한다.

제안 방법

  • 이미지 특징 추출을 위한 딥 네트워크와 자세 추정을 위한 기하학적 추론을 조합한 이단계 파이프라인을 도입한다.
  • 특징 추출 후 기하학적 校정을 적용하여 메트릭 추론을 네트워크 가중치에서 분리함으로써 카메라 무관성 추론을 보장한다.
  • 다양한 카메라 구성에서 훈련된 카메라 내재 매개변수에 대해 불변인 학습된 특징 인코더를 사용한다.
  • LiDDR 지도를 활용해 지도 특징에 의존하지 않고 이미지 특징에서 절대 카메라 자세를 추정하는 기하학적 제약 조건을 적용한다.
  • 훈련 중에는 LiDAR 지도를 활용해 메트릭 감독을 제공하면서도 추론 시에는 카메라 독립성을 유지한다.
  • 이미지 특징을 지도의 3차원 좌표로 매핑하는 미분 가능한 기하학적 레이어를 적용하여 기하학적 일관성을 확보하고 엔드 투 엔드 훈련을 가능하게 한다.

실험 결과

연구 질문

  • RQ1딥 러닝 기반 단안 정위치 시스템이 재학습 없이도 완전히 새로운 환경에서 정확한 정위치를 수행할 수 있는가?
  • RQ2학습된 시각 정위치 모델이 다양한 카메라 파라미터에 대해 얼마나 잘 일반화되는가?
  • RQ3신경망 가중치에서 메트릭 추론을 분리하는 것이 일반화 능력과 카메라 독립성 향상에 얼마나 효과적인가?
  • RQ4딥 러닝과 기하학적 추론을 조합했을 때, 실제 자율주행 환경에서 순수 학습 기반 또는 순수 기하학적 접근보다 우수한 성능을 내는가?
  • RQ5다양한 지도 구조와 카메라 설정을 가진 데이터셋 간에도 모델이 높은 성능을 유지할 수 있는가?

주요 결과

  • CMRNet++는 KITTI, Argoverse, Lyft5 데이터셋에서 최신 기술 수준의 성능을 달성하며, CMRNet 및 기타 베이스라인을 모두 앞서간다.
  • 재학습이나 미세조정 없이도 새로운 환경에서 즉시 정위치를 수행하는 것을 입증하여, 딥 러닝 기반 시각 정위치 분야에서 처음으로 이뤄진 일이다.
  • CMRNet++는 카메라 무관성 성능을 확보하여, 다양한 카메라 내재 매개변수에서도 모델 적응 없이 높은 정확도를 유지한다.
  • 메트릭 추론을 네트워크 가중치에서 분리함으로써 강건한 일반화 능력을 확보하면서도 높은 정위치 정확도를 유지한다.
  • 광범위한 평가를 통해 CMRNet++가 다양한 실제 자율주행 데이터셋에서 지도 및 카메라 특성의 다양성에도 효과적으로 일반화됨을 확인했다.
  • 특히 도전적인 환경과 새로운 환경에서 CMRNet에 비해 정위치 정확도가 크게 향상됨을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.