Skip to main content
QUICK REVIEW

[논문 리뷰] Self-Supervised Deep Visual Odometry with Online Adaptation

Shunkai Li, Xin Wang|arXiv (Cornell University)|2020. 05. 13.
Robotics and Sensor-Based Localization참고 문헌 42인용 수 5
한 줄 요약

이 논문은 실시간 환경 적응을 가능하게 하기 위해 온라인 메타학습과 특징 정렬을 통합한 자기지도 학습 딥 비전 오도메트리 방법을 제안한다. 시간적 메모리로 convLSTM를 활용하고 동적 특징 분포 정렬을 적용함으로써, 지도 데이터 없이도 빠르고 지속적인 적응을 달성하며, 새로운 실외, 실내 및 시뮬레이션 데이터셋에서 SOTA 기법 대비 상대적 자세 오차에서 최대 30% 향상되었고, 32 FPS로 실시간으로 작동한다.

ABSTRACT

Self-supervised VO methods have shown great success in jointly estimating camera pose and depth from videos. However, like most data-driven methods, existing VO networks suffer from a notable decrease in performance when confronted with scenes different from the training data, which makes them unsuitable for practical applications. In this paper, we propose an online meta-learning algorithm to enable VO networks to continuously adapt to new environments in a self-supervised manner. The proposed method utilizes convolutional long short-term memory (convLSTM) to aggregate rich spatial-temporal information in the past. The network is able to memorize and learn from its past experience for better estimation and fast adaptation to the current frame. When running VO in the open world, in order to deal with the changing environment, we propose an online feature alignment method by aligning feature distributions at different time. Our VO network is able to seamlessly adapt to different environments. Extensive experiments on unseen outdoor scenes, virtual to real world and outdoor to indoor environments demonstrate that our method consistently outperforms state-of-the-art self-supervised VO baselines considerably.

연구 동기 및 목표

  • 자신이 본 적이 없는 환경에서 성능이 급격히 떨어지는 자기지도 학습 비전 오도메트리의 도메인 시프트 문제를 해결하기 위해.
  • 지상 진실 데이터에 접근할 수 없는 상황에서도 환경 변화에 지속적으로 실시간으로 적응할 수 있도록 VO 네트워크를 구현하기 위해.
  • 과거 경험과 동적 특징 정렬을 활용하여 온라인 적응 중 정확도 향상과 수렴 속도 향상을 도모하기 위해.
  • 다양한 환경에서 견고한 성능을 내기 위해 온라인 적응을 학습 목표에 통합한 메타학습 프레임워크를 개발하기 위해.

제안 방법

  • 이 방법은 슬라이딩 윈도우를 통해 과거 프레임의 시공간적 의존성을 인코딩하기 위해 순환 컨볼루션 리커런트 네트워크(convLSTM)를 사용하여, 장기적인 경험을 유지하고 활용함으로써 더 나은 자세 및 깊이 추정을 가능하게 한다.
  • 새로운 환경에 신속히 적응할 수 있도록 현재 및 과거 데이터를 기반으로 향후 프레임 성능을 최적화하는 새로운 온라인 메타학습 기법을 도입한다.
  • 시간에 따라 특징 정렬을 적용하여 빛의 세기, 질감 또는 시나리오의 동적 변화로 인한 특징 분포의 이탈을 줄여, 개방형 환경에서의 일반화 능력을 향상시킨다.
  • 지상 진실 자세나 깊이 정보가 필요 없도록, 광학 일致성 손실을 사용하여 자기지도 학습 방식으로 네트워크를 훈련시킨다.
  • 단일 GPU에서 32 FPS로 실시간으로 작동하여, 배포 중에도 온라인으로 개선이 가능하다.
  • 적응 속도와 정확도의 균형을 맞추기 위해 N=15 크기의 슬라이딩 윈도우를 사용하며, 이 크기에서 성능이 최고로 나타난다.

실험 결과

연구 질문

  • RQ1지상 진실 데이터에 접근할 수 없는 상황에서 자기지도 학습 비전 오도메트리 네트워크가 새로운 환경에 대해 신속하고 안정적으로 적응할 수 있는가?
  • RQ2convLSTM를 통한 과거 경험 통합이 개방형 환경에서 정확도 향상과 적응 속도 향상에 어떤 영향을 미치는가?
  • RQ3온라인 특징 분포 정렬이 비전 오도메트리에서 도메인 시프트로 인한 성능 저하를 어느 정도 완화하는가?
  • RQ4수렴 속도와 최종 정확도 측면에서 온라인 메타학습은 단순한 온라인 미세조정보다 어떻게 다를까?

주요 결과

  • 제안된 방법은 TUM-RGBD fr3/str_ntex_near 시퀀스에서 상대적 자세 오차(RPE) 0.128 m/s를 달성하여, SAVO(0.204 m/s)와 GeoNet(0.198 m/s)를 능가하며 뛰어난 일반화 능력을 입증한다.
  • KITTI 데이터셋에서, 새로운 시퀀스를 테스트했을 때 기준 모델 대비 이동 오차를 11.65 m/s에서 4.79 m/s로 감소시켜, 강력한 제로샷 일반화 능력을 보였다.
  • 절단 실험 결과, 메타학습과 함께 convLSTM 및 특징 정렬을 통합할 경우 최고의 성능을 기록하였으며, 기준 모델 대비 오차를 58% 감소시켰다.
  • GeForce 1080Ti에서 32 FPS로 작동하여 실시간 온라인 적응이 가능하며, 실질적인 배포에 적합하다.
  • 적응에 최적의 슬라이딩 윈도우 크기는 N=15이며, 이보다 큰 윈도우 크기는 수렴 속도 저하와 정확도 감소를 초래한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.