Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Global-Relative Networks for End-to-End 6-DoF Visual Localization and Odometry

Yimin Lin, Zhaoxiang Liu|arXiv (Cornell University)|2018. 12. 19.
Robotics and Sensor-Based Localization참고 문헌 25인용 수 10
한 줄 요약

이 논문은 단일 렌즈 6-자유도 시각적 국소화 및 온도미터 성능을 향상시키기 위해 상대적이고 전역적 자세 추정을 위한 순환 합성곱 신경망(RCNN)을 융합하는 새로운 엔드 투 엔드 딥 러닝 프레임워크인 딥 글로벌-상대 네트워크를 제안한다. 크로스 변환 제약(Cross Transformation Constraints, CTC)과 평균 제곱 오차(Mean Square Error, MSE)를 함께 최적화하여 궤적의 왜곡을 크게 줄이고, KITTI 및 7-Scenes 데이터셋에서 최신 기술 수준(SOTA)의 정확도를 달성하여 DeepVO에 비해 이동 정확도에서 71%, 회전 정확도에서 76% 향상된다.

ABSTRACT

Although a wide variety of deep neural networks for robust Visual Odometry (VO) can be found in the literature, they are still unable to solve the drift problem in long-term robot navigation. Thus, this paper aims to propose novel deep end-to-end networks for long-term 6-DoF VO task. It mainly fuses relative and global networks based on Recurrent Convolutional Neural Networks (RCNNs) to improve the monocular localization accuracy. Indeed, the relative sub-networks are implemented to smooth the VO trajectory, while global subnetworks are designed to avoid drift problem. All the parameters are jointly optimized using Cross Transformation Constraints (CTC), which represents temporal geometric consistency of the consecutive frames, and Mean Square Error (MSE) between the predicted pose and ground truth. The experimental results on both indoor and outdoor datasets show that our method outperforms other state-of-the-art learning-based VO methods in terms of pose accuracy.

연구 동기 및 목표

  • 기계 학습 기반 방법에서 오차가 누적되어 발생하는 장기적인 단일 렌즈 시각적 온도미터의 지속적인 궤적 왜곡 문제를 해결하기 위해.
  • 엔드 투 엔드 프레임워크에서 상대 운동과 전역 장소 인식을 함께 모델링하여 6-자유도 시각적 국소화 정확도를 향상시키기 위해.
  • 기존의 VLocNet와 같은 방법에서 전역 및 상대 네트워크를 별도로 최적화하는 데서 비롯되는 한계를 극복하기 위해.
  • 시간적 기하학적 일관성과 3D 구조 제약 학습을 통해 도전적인 환경에 대한 강건성을 향상시키기 위해.
  • 정확한 장거리 자세 추정을 위해 엔드 투 엔드 학습 중 절대 척도를 유지하기 위해.

제안 방법

  • 아키텍처는 CNN 기반 특징 추출 서브넷(CNN1), 상대 자세 RCNN(RCNN1), 전역 자세 RCNN(RCNN2), 그리고 양 방향 스트림을 융합하는 완전 연결 퓨전 레이어(FCFL)를 통합한다.
  • 상대 자세 추정은 RCNN1을 통해 순차적인 RGB 프레임을 사용하여 자가 운동를 모델링하고 운동 공간을 제약한다.
  • 전역 자세 회귀는 RCNN2를 통해 장기적인 맥락를 사용하여 환경의 3D 구조 제약을 모델링함으로써 달성된다.
  • 배치 내 연속 프레임 간 시간적 기하학적 일관성을 강제하기 위해 새로운 크로스 변환 제약(Cross Transformation Constraints, CTC) 손실이 도입된다.
  • 엔드 투 엔드 학습을 위해 예측된 자세와 진짜 자세 간의 CTC와 평균 제곱 오차(MSE)를 함께 최적화한다.
  • 시간적 시퀀스 길이 K로 설정된 엔드 투 엔드 학습을 수행하며, 다양한 환경에서 안정성과 일반화 능력을 최적화한다.

실험 결과

연구 질문

  • RQ1상대 자세 및 전역 자세 네트워크의 공동 최적화가 단일 렌즈 시각적 온도미터의 궤적 왜곡을 줄일 수 있는가?
  • RQ2CTC 손실을 통한 시간적 기하학적 일관성의 통합이 장시간 시퀀스에서 자세 추정 정확도를 향상시키는가?
  • RQ3상대 운동과 전역 장소 인식의 융합이 도전적인 환경에서 국소화의 강건성을 향상시키는가?
  • RQ4정확도와 일반화를 균형 잡는 데 최적의 시간적 시퀀스 길이 K는 얼마인가?
  • RQ5제안된 방법이 절대 척도를 유지하고 최신 기술 수준의 기계 학습 기반 VO 접근법을 초월할 수 있는가?

주요 결과

  • 제안된 방법은 KITTI 데이터셋에서 DeepVO에 비해 이동 정확도에서 71% 향상되고, 회전 정확도에서 76% 향상된다.
  • 모델은 KITTI 및 7-Scenes 데이터셋 모두에서 최신 기술 수준의 성능을 달성하여 장거리 자세 추정에서 뛰어난 정확도와 안정성을 보여준다.
  • 절단 분석을 통해 전역 및 상대 네트워크의 융합은 단독으로 사용할 경우보다 유의미하게 더 좋은 결과를 얻는다.
  • 최적의 성능는 시퀀스 길이 K = 5에서 달성되며, K를 더 늘릴 경우 수익 감소와 과적합 위험이 증가한다.
  • CTC 손실은 시간적 일관성을 효과적으로 향상시켜 기준 방법 대비 더 매끄럽고 정확한 궤적을 생성한다.
  • 모델는 엔드 투 엔드 학습 전반에 걸쳐 절대 척도를 성공적으로 유지하여 정확한 장기적 국소화를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.