[논문 리뷰] Deep Virtual Stereo Odometry: Leveraging Deep Depth Prediction for Monocular Direct Sparse Odometry
이 논문은 심층 단안 깊이 예측을 활용하여 기하학적 비디오 오도메트리에서의 스케일 드리프트와 운동 파라랄랙스 제약를 극복하는 단안 시각 오도메트리 시스템인 Deep Virtual Stereo Odometry(DVSO)를 제안한다. 직접 희소 오도메트리에 심층 비디오 오도메트리 기반의 가상 스테레오 측정값을 통합함으로써 단일 카메라로도 스테레오 방법 수준의 정확도를 달성한다.
Monocular visual odometry approaches that purely rely on geometric cues are prone to scale drift and require sufficient motion parallax in successive frames for motion estimation and 3D reconstruction. In this paper, we propose to leverage deep monocular depth prediction to overcome limitations of geometry-based monocular visual odometry. To this end, we incorporate deep depth predictions into Direct Sparse Odometry (DSO) as direct virtual stereo measurements. For depth prediction, we design a novel deep network that refines predicted depth from a single image in a two-stage process. We train our network in a semi-supervised way on photoconsistency in stereo images and on consistency with accurate sparse depth reconstructions from Stereo DSO. Our deep predictions excel state-of-the-art approaches for monocular depth on the KITTI benchmark. Moreover, our Deep Virtual Stereo Odometry clearly exceeds previous monocular and deep learning based methods in accuracy. It even achieves comparable performance to the state-of-the-art stereo methods, while only relying on a single camera.
연구 동기 및 목표
- 단안 시각 오도메트리의 본질적 스케일 모호성과 운동 파라랄랙스 의존성 문제를 해결한다.
- 순수 기하학적 단안 오도메트리의 한계를 심층 학습 기반 깊이 추정을 통합하여 극복한다.
- 비용이 많이 드는 LiDAR 데이터 수집을 피하기 위해 반감독 학습 기반의 깊이 예측 방법을 개발한다.
- 심층 깊이 예측을 직접 희소 오도메트리 프레임워크에 통합하여 메트릭 스케일 궤적 추정을 가능하게 한다.
- 단일 카메라만을 사용하여도 스테레오 기반 시각 오도메트리 시스템과 동등한 성능을 달성한다.
제안 방법
- 자기감독된 광학 일致성과 Stereo DSO로부터의 희소 깊이 감독을 활용해 이중 단계 스택드 리스크 네트워크를 단안 깊이 예측을 위해 훈련한다.
- 예측된 깊이 맵을 가상 스테레오 역량으로 사용하여 DSO 최적화 파이프라인 내에서 합성 스테레오 제약 조건을 생성한다.
- 창문 기반 직접 백업 조정에 가상 스테레오 항목을 통합하여 예측된 깊이와 관측된 이미지 강도 간의 일관성을 강제한다.
- 전체 LiDAR 감독 없이도 스테레오 이미지 쌍의 광학 일치 손실과 좌우 일치 조건을 활용해 깊이 예측을 감독한다.
- 희소 3D 재구성 결과를 활용해 훈련 중 깊이 예측을 개선하기 위해 약한 감독으로서 Stereo DSO의 결과를 활용한다.
- 가상 스테레오 기준거리 파라미터를 조정하여 성능을 추가로 향상시키며, 이는 최신 스테레오 방법들을 능가하는 성능을 가능하게 한다.
실험 결과
연구 질문
- RQ1심층 단안 깊이 예측이 단안 시각 오도메트리에서의 스케일 드리프트를 효과적으로 완화할 수 있는가?
- RQ2단지 스테레오 이미지와 희소 DSO 재구성 결과만을 사용하는 반감독 깊이 학습이, 감독 학습 방법과 비교해 얼마나 높은 성능을 달성할 수 있는가?
- RQ3심층 깊이 예측에서 유도된 가상 스테레오 제약 조건이 단안 환경에서 직접 희소 오도메트리의 정확도를 향상시킬 수 있는가?
- RQ4제안된 방법이 단일 카메라에 의존하면서도 스테레오 기반 시각 오도메트리 시스템과 동등한 성능을 달성할 수 있는가?
- RQ5이 시스템은 훈련 도메인 외의 다양한 시퀀스와 카메라 궤적에 대해 얼마나 잘 일반화되는가?
주요 결과
- DVSO는 KITTI 벤치마크에서 최신 스테레오 방법들인 Stereo LSD-SLAM과 Stereo DSO와 유사한 이동 및 회전 오차를 기록한다.
- 가상 기준거리 조정을 통해 DVSO는 평가된 모든 단안 및 스테레오 방법들—Stereo LSD-SLAM과 루프 클로징 없이 동작하는 ORB-SLAM2를 포함하여—를 능가한다.
- 제안된 반감독 깊이 네트워크는 KITTI 벤치마크에서 최신 기술보다 뛰어난 성능을 보였다.
- DVSO는 DeepVO, UnDeepVO, SfMLearner 및 Yin 등 [46] 과 같은 엔드 투 엔드 심층 학습 기반 오도메트리 시스템보다 이동 및 회전 오차 측면에서 뚜렷한 우수성을 보였다.
- 보조 자료에 제시된 Cityscapes 프랑크푸르트 시퀀스에서의 궤적 추정 결과를 통해 시스템이 훈련 도메인 외부의 시퀀스에 잘 일반화됨을 입증했다.
- 심층 깊이 예측을 가상 스테레오 제약 조건으로 통합함으로써 단안 시스템에서도 메트릭 스케일 추정이 가능해졌으며, 이는 스케일 드리프트를 효과적으로 제거했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.