Skip to main content
QUICK REVIEW

[논문 리뷰] Self-Supervised Visual Place Recognition Learning in Mobile Robots

Sudeep Pillai, John J. Leonard|arXiv (Cornell University)|2019. 05. 11.
Robotics and Sensor-Based Localization참고 문헌 40인용 수 6
한 줄 요약

이 논문은 모바일 로봇을 위한 시각적 장소 인식을 위한 자기지도 학습 메트릭 학습 방법을 제안한다. GPS 보조 항법을 활용해 훈련을 위한 양성 및 음성 이미지 쌍을 부트스트랩하고, 시amese 네트워크를 훈련시킨다. 이 방법은 유사한 장소가 밀집된 校정된 임bedding 공간을 학습하여 루프 클로저 탐지 성능을 크게 향상시키고, 시각 SLAM 시스템에서 노이즈 없는 드리프트 없는 궤적 추정을 가능하게 한다.

ABSTRACT

Place recognition is a critical component in robot navigation that enables it to re-establish previously visited locations, and simultaneously use this information to correct the drift incurred in its dead-reckoned estimate. In this work, we develop a self-supervised approach to place recognition in robots. The task of visual loop-closure identification is cast as a metric learning problem, where the labels for positive and negative examples of loop-closures can be bootstrapped using a GPS-aided navigation solution that the robot already uses. By leveraging the synchronization between sensors, we show that we are able to learn an appropriate distance metric for arbitrary real-valued image descriptors (including state-of-the-art CNN models), that is specifically geared for visual place recognition in mobile robots. Furthermore, we show that the newly learned embedding can be particularly powerful in disambiguating visual scenes for the task of vision-based loop-closure identification in mobile robots.

연구 동기 및 목표

  • 시각적 장소 인식에서 수작업으로 설계된 기술자와 고정된 거리 메트릭의 한계를 해결하기 위해.
  • 모바일 로봇이 경험을 통해 자기지도 학습 방식으로 시각적 표현을 학습하고 적응할 수 있도록 하기 위해.
  • 환경에 특화된 메트릭을 학습함으로써 외관 변화(예: 날씨, 조명)에 대한 강건성을 향상시키기 위해.
  • 수동 레이블링 없이 실제 로봇 운영 환경에서 사전 훈련된 CNN을 미세조정할 수 있는 방법을 개발하기 위해.
  • 정확하고 校정된 루프 클로저 제약 조건을 생성함으로써 시각 SLAM 성능을 향상시키기 위해.

제안 방법

  • 모델은 공유 가중치를 가진 시amese 신경망을 사용하여 이미지 쌍을 위한 메트릭 임베딩 공간을 학습한다.
  • 양성 및 음성 이미지 쌍은 시간적 및 공간적 동기화를 활용해 GPS 보조 항법 데이터를 기반으로 자동으로 생성된다.
  • 거리 가중 샘플링 전략을 사용한 대비 손실을 통해 모델을 훈련시키며, 더 많은 음성 예제를 선호한다.
  • 샘플링 임계값 τ^Rt = 0.9는 시각 프루즘에 상당한 겹침이 있는 이미지만 잠재적 양성 예로 간주하도록 보장한다.
  • 사전 훈련된 Places205 AlexNet은 최종 완전 연결층(fc6, fc7)에 대해서만 미세조정되며, 이전 층은 동결된다.
  • 루프 클로저 제약 조건은 자세 그래프에 약한 영점 회전 및 이동 상대 자세 제약 조건으로 통합되며, 공분산은 3m와 0.3rad로 설정된다.

실험 결과

연구 질문

  • RQ1GPS 보조 동기화를 활용한 자기지도 학습 메트릭 학습 프레임워크가 시각적 장소 인식 성능을 향상시킬 수 있는가?
  • RQ2학습된 임베딩 공간이 표준 CNN 기술자보다 시각적으로 유사한 장소를 더 잘 구분할 수 있는가?
  • RQ3이 방법이 사전 훈련된 모델을 실제 로봇 운영 환경에 효과적으로 미세조정할 수 있는가?
  • RQ4학습된 메트릭이 오도메트리 드리프트 하에서 장기적인 궤적 정확도를 향상시킬 수 있는가?
  • RQ5훈련 중에 볼 수 없었던 새로운 세션에 대해 시스템의 일반화 성능은 얼마나 좋은가?

주요 결과

  • 제안된 방법은 음성 및 양성 예제 간 겹침을 줄이는 잘 校정된 임베딩 공간을 학습함으로써 루프 클로저 탐지 정확도를 크게 향상시켰다.
  • 학습된 메트릭은 KITTI 및 St. Lucia 데이터셋을 포함한 다양한 환경에서 강건한 성능을 보이며, 오도메트리 드리프트 하에서도 일관된 궤적 복원이 가능했다.
  • 학습된 루프 클로저 제약 조건을 사용한 자세 그래프 최적화는 그림 9에서 KITTI 시퀀스 00 및 St. Lucia 데이터 모두에 대해 드리프트 없는 정확한 궤적을 생성하였다.
  • 훈련에 사용되지 않은 새로운 세션에 대해서도 모델이 잘 일반화되어, 새로운 환경에 대한 전이 가능성과 적응성을 보였다.
  • 클래스 가중치를 적용한 10배 이상의 음성 예제 사용이 훈련 안정성과 메트릭 일반화 성능 향상에 기여했다.
  • 수동 레이블링 없이 자기지도 학습 및 GPS 보조 지도를 활용해 사전 훈련된 CNN(Places205 AlexNet)을 효과적으로 미세조정할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.