Skip to main content
QUICK REVIEW

[논문 리뷰] DF-VO: What Should Be Learnt for Visual Odometry?

Huangying Zhan, Chamara Saroj Weerasekera|arXiv (Cornell University)|2021. 03. 01.
Advanced Vision and Imaging참고 문헌 55인용 수 26
한 줄 요약

DF-VO는 깊이 예측과 광류 예측을 다중 뷰 기하학과 결합하여 단안 비주얼 오도메트리의 스케일 드리프트와 동적 장면 문제를 해결하고, KITTI에서 최첨단 성능을 달성한다.

ABSTRACT

Multi-view geometry-based methods dominate the last few decades in monocular Visual Odometry for their superior performance, while they have been vulnerable to dynamic and low-texture scenes. More importantly, monocular methods suffer from scale-drift issue, i.e., errors accumulate over time. Recent studies show that deep neural networks can learn scene depths and relative camera in a self-supervised manner without acquiring ground truth labels. More surprisingly, they show that the well-trained networks enable scale-consistent predictions over long videos, while the accuracy is still inferior to traditional methods because of ignoring geometric information. Building on top of recent progress in computer vision, we design a simple yet robust VO system by integrating multi-view geometry and deep learning on Depth and optical Flow, namely DF-VO. In this work, a) we propose a method to carefully sample high-quality correspondences from deep flows and recover accurate camera poses with a geometric module; b) we address the scale-drift issue by aligning geometrically triangulated depths to the scale-consistent deep depths, where the dynamic scenes are taken into account. Comprehensive ablation studies show the effectiveness of the proposed method, and extensive evaluation results show the state-of-the-art performance of our system, e.g., Ours (1.652%) v.s. ORB-SLAM (3.247%}) in terms of translation error in KITTI Odometry benchmark. Source code is publicly available at: \href{https://github.com/Huangying-Zhan/DF-VO}{DF-VO}.

연구 동기 및 목표

  • 딥러닝과 기하학을 모두 활용하는 견고한 단안 VO 시스템을 고안한다.
  • 밀집 광류에서 고품질 대응점을 샘플링하여 신뢰할 수 있는 자세 추정을 수행한다.
  • 스케일 일관성 깊이 예측을 사용하여 긴 영상에서 전역 스케일을 회복하고 유지한다.
  • 반복적 스케일 회복과 강건한 대응점 선택을 통해 동적 장면을 처리한다.
  • 에피폴라 기하학과 PnP 기반 추적 간의 하이브리드 트래커 선택 프레임워크를 제공한다.

제안 방법

  • 각 이미지 쌍에 대해 밀집 광류와 단일 뷰 깊이를 예측한다.
  • 순방향-역방향 흐름 일관성을 사용하여 고품질 2D-2D 대응점을 선택한다.
  • 에피폴라 기하 기반 E-트래커와 PnP-트래커의 두 트래커의 모션을 추정한다.
  • 삼각측정된 깊이를 스케일 일관 네트워크 깊이와 맞춰 스케일을 회복하고, 동적 요소를 위한 반복 보정이 있다.
  • 기하학적 강건 정보 기준(GRIC)을 사용해 트래커를 선택하고 강건성을 위해 RANSAC을 적용한다.
  • 광측정(포토매트릭) 및 깊이 일관성 손실을 이용한 자기감독 프레임워크에서 깊이 및 자세 네트워크를 학습한다.

실험 결과

연구 질문

  • RQ1깊이와 광류의 딥러닝 예측을 고전적 다중 뷰 기하학과 어떻게 통합하여 견고한 단안 VO를 달성할 수 있는가?
  • RQ2삼각측정된 깊이를 스케일 일관 깊이 예측과 맞추어 스케일 드리프트를 완화할 수 있는가?
  • RQ3긴 궤적에서 정확도를 유지하기 위해 동적 장면을 다루는 최적의 전략은 무엇인가?
  • RQ4GRIC 기반 모델 선택이 포함된 하이브리드 E-트래커와 PnP-트래커가 단일 기하학 모델을 사용하는 것보다 강인성을 향상시키는가?
  • RQ5매우 동적인 환경에서 반복적 스케일 회복은 어떤 성능을 보이는가?

주요 결과

  • DF-VO는 KITTI Odometry에서 변환 오차 1.652%로 최첨단 성능을 달성했으며, ORB-SLAM의 3.247%에 비해 우수하다.
  • 양방향 흐름 일관성 기반 샘플링 방식이 2D-2D 대응점의 품질을 향상시킨다.
  • 스케일 일관 깊이 예측은 긴 시퀀스에서 강건한 스케일 회복과 추적을 가능하게 한다.
  • 동적 장면에서 깊이-흐름 쌍을 일관성으로 필터링하여 반복적 스케일 회복 방법이 성능을 향상시킨다.
  • GRIC 기반 모델 선택이 E-트래커와 PnP-트래커 간의 전환을 효과적으로 수행하여 비특이적 상태를 피한다.
  • 다양한 추가 실험에서 제안된 구성 요소의 효과를 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.