Skip to main content
QUICK REVIEW

[논문 리뷰] TartanVO: A Generalizable Learning-based VO

Wenshan Wang, Yaoyu Hu|arXiv (Cornell University)|2020. 10. 31.
Robotics and Sensor-Based Localization참고 문헌 44인용 수 6
한 줄 요약

TartanVO는 TartanAir에서 유도한 합성 데이터와 최신 아키텍처 구성 요소인 업-투-스케일 손실 및 내재성 레이어를 활용하여, 미세조정 없이 다양한 데이터셋과 실제 환경에서 일반화되는 학습 기반 시각 옹도메트리 모델이다. KITTI, EuRoC 및 실제 RealSense 데이터에서 도전적인 궤적에서 기하 기반 방법보다 뛰어난 성능을 보이며, 특징이 부족하고 동적인 환경에서 최신 기술 수준의 내구성을 입증한다.

ABSTRACT

We present the first learning-based visual odometry (VO) model, which generalizes to multiple datasets and real-world scenarios and outperforms geometry-based methods in challenging scenes. We achieve this by leveraging the SLAM dataset TartanAir, which provides a large amount of diverse synthetic data in challenging environments. Furthermore, to make our VO model generalize across datasets, we propose an up-to-scale loss function and incorporate the camera intrinsic parameters into the model. Experiments show that a single model, TartanVO, trained only on synthetic data, without any finetuning, can be generalized to real-world datasets such as KITTI and EuRoC, demonstrating significant advantages over the geometry-based methods on challenging trajectories. Our code is available at https://github.com/castacks/tartanvo.

연구 동기 및 목표

  • 미세조정 없이 다양한 실제 및 합성 데이터셋에 일반화되는 학습 기반 시각 옹도메트리 모델을 개발하는 것.
  • 기존 학습 기반 VO 모델의 한계를 해결하기 위해, 데이터 다양성 부족과 스케일 및 내재성 모호성에 대한 처리 부족으로 인한 일반화 실패 문제를 해결하는 것.
  • 저조도, 동적, 고속 운동 환경과 같은 도전적인 시각 옹도메트리 시나리오에서의 내구성을 향상시키는 것.
  • 합성 데이터로만 훈련된 단일 모델이 KITTI 및 EuRoC와 같은 실제 벤치마크에서 경쟁 가능한 성능을 달성할 수 있음을 입증하는 것.
  • 단일 카메라 스케일 모호성과 다양한 데이터셋 간 카메라 내재 매개변수 변화를 명시적으로 다루는 아키텍처 혁신을 도입하는 것.

제안 방법

  • 다양하고 고해상도이며 도전적인 단안 영상 시퀀스를 제공하는 TartanAir 합성 데이터셋을 활용하며, 정확한 카메라 운동과 장면 변화를 포함한다.
  • 절대 스케일 감독이 필요 없도록, 모델이 알려지지 않은 스케일까지 상대적 카메라 운동을 예측하도록 하는 업-투-스케일 손실 함수를 적용한다.
  • 카메라 내재 매개변수를 네트워크에 명시적으로 인코딩하는 내재성 레이어(IL)를 도입하여, 다양한 카메라와 센서 설정 간의 일반화를 가능하게 한다.
  • 광학 흐름을 중간 표현으로 사용하며, 모델이 왜곡된 광학 흐름 특징에서 카메라 운동을 예측함으로써 운동 및 외관 변화에 대한 내구성을 향상시킨다.
  • 백엔드 최적화나 반복적 보정이 필요 없이, 카메라 운동에 대한 지도 학습을 통해 엔드 투 엔드 방식으로 모델을 훈련한다.
  • 훈련 중에 데이터 증강 및 도메인 랜덤라이제이션을 적용하여, 조명, 텍스처, 운동 패턴 등의 실제 환경 변화에 대한 내구성을 향상시킨다.

실험 결과

연구 질문

  • RQ1합성 데이터로만 훈련된 학습 기반 시각 옹도메트리 모델이 어떤 미세조정 없이도 실제 데이터셋에 효과적으로 일반화될 수 있는가?
  • RQ2훈련 데이터의 다양성이 다양한 환경과 운동 패턴 간의 학습 기반 VO 모델의 일반화 성능에 어떤 영향을 미치는가?
  • RQ3업-투-스케일 손실 함수가 단안 시각 옹도메트리 모델의 내구성과 일반화 능력을 얼마나 향상시킬 수 있는가?
  • RQ4네트워크에 카메라 매개변수를 통합하는 내재성 레이어가 다양한 카메라 모델과 내재 설정 간의 데이터셋 간 일반화를 가능하게 할 수 있는가?
  • RQ5저조도, 동적 또는 고속 운동 시퀀스와 같은 도전적인 실제 환경에서 학습 기반 VO 모델의 성능은 기하 기반 방법과 비교해 어떻게 되는가?

주요 결과

  • TartanVO는 도전적인 EuRoC 시퀀스 VR1-03과 VR2-03에서 각각 ATE 0.64와 1.04를 기록하며, ORB-SLAM 및 DSO와 같은 기하 기반 방법을 능가하는 최신 기술 수준의 성능을 보였다.
  • KITTI 데이터셋에서 TartanVO는 MH-04에서 ATE 0.74, MH-05에서 ATE 0.68를 기록하며, SVO 및 ORB-SLAM을 능가했고, 어려운 시퀀스에서 뛰어난 내구성을 보였다.
  • TartanAir 테스트 세트에서 TartanVO는 8개 시퀀스 전부에서 경쟁력 있는 ATE 성능을 기록했으며, MH004에서는 1.07, MH005에서는 3.19를 기록하여 합성이지만 도전적인 환경에 대한 강력한 일반화 능력을 입증했다.
  • 실제 환경의 RealSense D345i IR 데이터에서, TartanVO는 훈련 중에 실제 IR 데이터를 한 번도 보지 못했음에도 불구하고, 점점 어려워지는 운동 난이도를 가진 세 개의 루프 트랙에 걸쳐 T265 추적 카메라 출력과 매우 유사한 옹도메트리 추정을 제공했다.
  • 업-투-스케일 손실 덕분에 훈련 손실과 테스트 손실 간 격차가 최소화되어, 훈련 분포에 대한 과적합이 감소하고 강력한 일반화 능력을 보였다.
  • 내재성 레이어 덕분에 데이터셋 간 효과적인 일반화가 가능해, 동일한 모델이 재학습 없이도 다른 카메라 내재 설정을 가진 데이터셋에서도 우수한 성능을 발휘할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.