Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Scale Consistent Monocular Visual Odometry by Learning from the Virtual World

Sen Zhang, Jing Zhang|arXiv (Cornell University)|2022. 03. 10.
Advanced Vision and Imaging인용 수 4
한 줄 요약

이 논문은 실재 영상에서만 훈련 및 추론을 수행하면서도 합성 가상 데이터를 활용해 스케일 보조 정보를 제공하는 스케일 일관성 있는 단안 시각적 오도메트리 프레임워크인 VRVO를 제안한다. 적대적 도메인 적응, 가상 스테레오 최적화 목표 함수, 학습과 최적화 간 상호 강화 파이pline을 조합함으로써 VRVO는 KITTI 및 vKITTI2에서 최신 기술 수준의 정확도를 달성하면서도 스케일 드리프트를 크게 감소시킨다.

ABSTRACT

Monocular visual odometry (VO) has attracted extensive research attention by providing real-time vehicle motion from cost-effective camera images. However, state-of-the-art optimization-based monocular VO methods suffer from the scale inconsistency problem for long-term predictions. Deep learning has recently been introduced to address this issue by leveraging stereo sequences or ground-truth motions in the training dataset. However, it comes at an additional cost for data collection, and such training data may not be available in all datasets. In this work, we propose VRVO, a novel framework for retrieving the absolute scale from virtual data that can be easily obtained from modern simulation environments, whereas in the real domain no stereo or ground-truth data are required in either the training or inference phases. Specifically, we first train a scale-aware disparity network using both monocular real images and stereo virtual data. The virtual-to-real domain gap is bridged by using an adversarial training strategy to map images from both domains into a shared feature space. The resulting scale-consistent disparities are then integrated with a direct VO system by constructing a virtual stereo objective that ensures the scale consistency over long trajectories. Additionally, to address the suboptimality issue caused by the separate optimization backend and the learning process, we further propose a mutual reinforcement pipeline that allows bidirectional information flow between learning and optimization, which boosts the robustness and accuracy of each other. We demonstrate the effectiveness of our framework on the KITTI and vKITTI2 datasets.

연구 동기 및 목표

  • 장거리 궤적에서 발생하는 스케일 비일관성 문제를 해결함으로써 최적화 기반 단안 시각적 오도메트리의 드리프트를 완화한다.
  • 훈련 중에 고비용의 진짜 레이블 또는 스테레오 데이터가 필요한 기존 방법의 한계를 극복한다.
  • 외부 센서나 레이블이 없는 환경에서 실재 영상 추론을 유지하면서도 쉽게 확보할 수 있는 가상 데이터로부터 절대 스케일 복원을 가능하게 한다.
  • 학습과 최적화 간 단방향 정보 흐름으로 인한 부분 최적화 문제를 해결하기 위해 이원적 피드백을 도입한다.
  • 실제 환경 구현에서 외부 센서나 레이블 데이터에 의존하지 않고도 강건하고 정확한 시각적 오도메트리를 달성한다.

제안 방법

  • 기본 거리와 진짜 디스패리가 알려진 스테레오 가상 데이터와 함께 단안 실재 영상으로 스케일 인식 디스패리 네트워크를 훈련한다.
  • 실재 영상과 가상 영상의 특징 분포를 일치시키기 위해 적대적 도메인 적응을 적용하여 가상에서 실재로의 도메인 갭을 줄인다.
  • 예측된 디스패리를 직접적인 VO 시스템에 통합하여 깊이를 초기화하고, 장거리 궤적에서 스케일 일관성을 강제하는 가상 스테레오 목표 함수를 구성한다.
  • 최적화 백엔드에서 유도된 피드백을 학습 과정에 반영할 수 있도록 상호 강화 파이프라인을 제안함으로써 강건성과 정확도를 향상시킨다.
  • 상호 강화 손실을 균형 잡기 위해 학습 가능한 가중치 하이퍼파rameter $\lambda^{*}_{p}$ 를 도입하여 최적화 오차에 대한 과적합을 방지한다.
  • 가상 환경을 활용해 저비용으로 대규모이고 사진처럼 사실적인 훈련 시퀀스를 생성하고 정확한 기하학적 레이블을 제공한다.

실험 결과

연구 질문

  • RQ1실재 도메인에서 스테레오 또는 진짜 레이블 데이터가 없이도 가상 데이터를 효과적으로 활용해 단안 시각적 오도메트리에서 절대 스케일을 학습할 수 있는가?
  • RQ2합성 가상 데이터와 실재 영상 간의 도메인 갭을 최소화하여 스케일 인식 표현을 전이할 수 있는가?
  • RQ3학습과 최적화 간 이원적 정보 흐름이 단안 시각적 오도메트리의 정확도와 강건성에 얼마나 기여하는가?
  • RQ4제안된 방법이 추론 시에 오직 단안 실재 영상만을 사용하면서도 KITTI와 같은 실세계 벤치마크에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ5가상 데이터에서 학습한 스케일 인식 능력이 카메라 내장 매개변수와 다른 새로운 실세계 데이터셋으로 일반화되는 정도는 어느 정도인가?

주요 결과

  • VRVO는 KITTI Seq.09 및 Seq.10에서 모두 최고의 회전 오차 ($r_{err}$) 를 달성하였으며, Seq.10에서 $r_{err} = 0.280^\circ/100m$ 로서 옵티컬 플로우나 온라인 미세조정을 사용하는 방법들을 능가한다.
  • 상호 강화 모듈을 통합함으로써 Seq.09에서의 이동 오차 ($t_{err}$) 는 $1.546\% \pm 0.021$ 로 감소하여 기준 방법 대비 뚜렷한 향상을 보였다.
  • 상호 강화 파이프라인을 통합함으로써 $t_{err}$ 의 표준편차는 $0.368$ 에서 $0.021$ 으로 감소하여 강건성이 향상됨을 입증했다.
  • 예측된 깊이와 진짜 깊이 간 중앙값 깊이 스케일 비율은 KITTI Seq.09 및 Seq.10에서 각각 $1.011$ 으로 강력한 스케일 정확도를 나타낸다.
  • 이 방법은 카메라 내장 매개변수가 다른 새로운 데이터셋인 Make3D에도 일반화 가능하여 스케일 비율 $1.594$ 를 달성했지만, 카메라 내장 매개변수의 차이로 인해 성능 저하가 발생했다.
  • 제거 실험을 통해 상호 강화 모듈이 필수적임을 확인했다: $\lambda^{*}_{p} = 0.01$ 으로 설정할 경우 최적의 성능을 달성하였고, 0.1과 같은 높은 값은 최적화 오차에 과적합을 유도하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.