Skip to main content
QUICK REVIEW

[논문 리뷰] MagicVO: End-to-End Monocular Visual Odometry through Deep Bi-directional Recurrent Convolutional Neural Network

Jian Jiao, Jichao Jiao|arXiv (Cornell University)|2018. 11. 27.
Robotics and Sensor-Based Localization참고 문헌 17인용 수 9
한 줄 요약

MagicVO는 연속적인 영상 시퀀스에서 6-자유도 절대 스케일 카메라 자세를 추정하기 위해 딥 양방향 순환 합성곱 신경망을 사용하는 엔드 투 엔드 단안 시각적 오도메트리 시스템을 제안한다. 공간적 특징 추출을 위한 CNN과 양방향으로 정방향 및 역방향 모두에서 장거리 시간적 의존성을 모델링하는 Bi-LSTM을 결합함으로써, 전통적인 VO 방법에 비해 KITTI 및 ETH-ASL 데이터셋에서 뛰어난 정확도와 일반화 능력을 달성한다.

ABSTRACT

This paper proposes a new framework to solve the problem of monocular visual odometry, called MagicVO . Based on Convolutional Neural Network (CNN) and Bi-directional LSTM (Bi-LSTM), MagicVO outputs a 6-DoF absolute-scale pose at each position of the camera with a sequence of continuous monocular images as input. It not only utilizes the outstanding performance of CNN in image feature processing to extract the rich features of image frames fully but also learns the geometric relationship from image sequences pre and post through Bi-LSTM to get a more accurate prediction. A pipeline of the MagicVO is shown in Fig. 1. The MagicVO system is end-to-end, and the results of experiments on the KITTI dataset and the ETH-asl cla dataset show that MagicVO has a better performance than traditional visual odometry (VO) systems in the accuracy of pose and the generalization ability.

연구 동기 및 목표

  • 실세계 환경에서 정확한 6-자유도 절대 스케일 단안 시각적 오도메트리의 과제를 해결하기 위해.
  • 영상 시퀀스의 공간적 및 시간적 의존성을 활용하여 자세 추정 정확도를 향상시키기 위해.
  • 기존 VO 파이프라인에서 흔히 사용되는 수작업으로 구성된 구성 요소가 제거된 엔드 투 엔드 학습 프레임워크를 개발하기 위해.
  • 시간적 맥락을 양방향으로 모델링하여 다양한 시퀀스 간 일반화 능력을 향상시키기 위해.

제안 방법

  • 개별 단안 영상에서 풍부한 공간적 특징을 추출하기 위해 깊이 있는 합성곱 신경망(CNN)을 사용한다.
  • 양방향 장기 단기 기억(LSTM, Bi-LSTM) 네트워크는 영상 시퀀스를 정방향 및 역방향 모두에서 처리하여 시간적 의존성을 모델링한다.
  • CNN과 Bi-LSTM의 융합을 통해 네트워크가 프레임 간 기하학적 관계를 학습할 수 있게 되어 자세 추정의 강건성이 향상된다.
  • 전체 시스템은 입력 영상 시퀀스로부터 직접 절대 스케일 6-DoF 카메라 자세를 예측하기 위해 엔드 투 엔드로 훈련된다.
  • 아키텍처는 공간적 맥락과 시간적 일관성을 유지하도록 설계되어 장기적 운동 추정을 향상시킨다.

실험 결과

연구 질문

  • RQ1CNN 특징 추출과 함께 깊이 있는 양방향 RNN을 사용하면 기존 방법에 비해 단안 시각적 오도메트리 정확도를 향상시킬 수 있는가?
  • RQ2영상 시퀀스의 양방향 모델링이 단안 시스템의 자세 추정에 얼마나 기여하는가?
  • RQ3엔드 투 엔드 학습 프레임워크가 다양한 시퀀스 간 일반화 능력에서 기존 파이프라인을 능가하는가?
  • RQ4명시적인 깊이 감독 없이도 모델이 절대 스케일 6-DoF 자세 추정을 얼마나 잘 수행하는가?

주요 결과

  • MagicVO는 KITTI 데이터셋에서 최신 기술 수준의 성능을 달성하여 기존 VO 시스템에 비해 이동 및 회전 정확도 모두에서 뛰어난 성능을 보였다.
  • 모델은 ETH-ASL 데이터셋에서 강력한 일반화 능력을 보이며, 다양한 환경와 운동 패턴 간의 강건성을 입증하였다.
  • 양방향 LSTMs의 사용은 시간적 모델링을 크게 향상시켜 보다 일관되고 정확한 자세 예측을 가능케 하였다.
  • 엔드 투 엔드 훈련 전략은 최적의 특징 표현과 자세 회귀를 동시에 학습시켜 오차 누적를 감소시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.