Skip to main content
QUICK REVIEW

[논문 리뷰] Convolutional networks for real-time 6-DOF camera relocalization.

Alex Kendall, Matthew Koichi Grimes|arXiv (Cornell University)|2015. 05. 27.
Robotics and Sensor-Based Localization참고 문헌 22인용 수 51
한 줄 요약

이 논문은 전이 학습과 23층의 딥 아키텍처를 사용하여 단일 RGB 이미지에서 직접 카메라 자세를 회귀함으로써 실시간 단일 카메라 6-도르 회수(relocalization)를 위한 엔드 투 엔드 컨볼루션 신경망(CNN)을 제안한다. 이로써 대규모 실외 환경에서는 2m 및 3°의 정확도를 달성하고, 실내에서는 0.5m 및 5°의 정확도를 확보한다. 프레임당 추론 시간은 5ms이다.

ABSTRACT

Figure 1: Convolutional neural network monocular camera relocalization. Relocalization results for an input image (top), the predicted camera pose of a visual reconstruction (middle), shown again overlaid in red on the original image (bottom). Our system relocalizes to within approximately 2m and 3 ◦ for large outdoor scenes spanning 50, 000m2. We present a robust and real-time monocular six de-gree of freedom relocalization system. Our system trains a convolutional neural network to regress the 6-DOF cam-era pose from a single RGB image in an end-to-end man-ner with no need of additional engineering or graph op-timisation. The algorithm can operate indoors and out-doors in real time, taking 5ms per frame to compute. It obtains approximately 2m and 3◦accuracy for large scale outdoor scenes and 0.5m and 5◦accuracy indoors. This is achieved using an efficient 23 layer deep convnet, demon-strating that convnets can be used to solve complicated out of image plane regression problems. This was made possi-ble by leveraging transfer learning from large scale classi-fication data. We show the convnet localizes from high level features and is robust to difficult lighting, motion blur and different camera intrinsics where point based SIFT registra-tion fails. Furthermore we show how the pose feature that is produced generalizes to other scenes allowing us to regress pose with only a few dozen training examples. 1.

연구 동기 및 목표

  • 특징 매칭이나 그래프 최적화에 의존하지 않고 단일 RGB 이미지에서 실시간으로 강건한 6-도르 카메라 회수를 가능하게 하기 위해.
  • 기존의 SIFT 기반 방법이 실패하는 조건인 조도 변화, 운동 왜곡, 다른 카메라 내재 매개변수 등의 과제를 해결하기 위해.
  • 딥 CNN이 소수의 훈련 예제(약 수십 개)만으로도 새로운 환경에 일반화할 수 있음을 보여주기 위해.
  • 실제 실외 및 실내 환경에 구현 가능한 높은 정확도와 낮은 추론 지연(프레임당 5ms)을 달성하기 위해.

제안 방법

  • 단일 RGB 이미지에서 직접 6-도르 카메라 자세(3개의 이동, 3개의 회전)를 회귀하기 위해 엔드 투 엔드로 훈련된 23층의 딥 컨볼루션 신경망을 사용한다.
  • 재현성 향상을 위해 사전 훈련된 네트워크를 대규모 이미지 분류 데이터셋에서 초기화한 후, 회수 작업에 맞게 미세 조정한다.
  • 조도 변화, 운동 왜곡, 다양한 카메라 내재 매개변수에 대해 강건한 고수준 시각적 특징을 학습한다.
  • 기하학적 제약 조건이나 후처리 최적화 없이도 추론을 수행함으로써 실시간 동작이 가능하다.
  • 소수의 훈련 예제(각 환경당 수십 개)만으로도 새로운 환경에 일반화되며, 재학습 요구 사항을 최소화한다.
  • 추론 시간을 최적화하여 표준 하드웨어에서 프레임당 5ms 이내로 작동하도록 한다.

실험 결과

연구 질문

  • RQ1딥 CNN이 단일 RGB 이미지에서 높은 정확도와 낮은 지연으로 6-도르 카메라 자세를 회귀시킬 수 있는가?
  • RQ2운동 왜곡이나 조도 변화와 같은 어려운 시각 조건에 대해 CNN 기반의 회수 시스템은 얼마나 강건한가?
  • RQ3학습된 자세 특징이 최소한의 재학습으로 다양한 환경 간에 얼마나 잘 일반화되는가?
  • RQ4대규모 분류 데이터에서의 전이 학습이 새로운 환경에서 소수의 예제로 회수 성능을 향상시키는 데 기여하는가?
  • RQ5기존의 SIFT 기반 또는 그래프 최적화 방법과 비교해 볼 때, 엔드 투 엔드 CNN 접근법은 정확도와 속도 측면에서 어떤가?

주요 결과

  • 대규모 실외 환경(50,000m² 범위)에서 2m 및 3°의 회수 정확도를 확보한다.
  • 실내에서는 0.5m 및 5°의 정확도를 달성하여 복잡한 환경에서도 뛰어난 성능을 보인다.
  • 모델은 프레임당 5ms 내로 카메라 자세를 계산하여 표준 하드웨어에서 실시간 운영이 가능하다.
  • 소수의 훈련 예제(수십 개)만으로도 새로운 환경에 일반화되어 배포에 필요한 데이터 요구량을 줄인다.
  • 운동 왜곡이나 조도 변화와 같은 어려운 조건에서 점기반 SIFT 정렬보다 성능이 뛰어나다.
  • 대규모 분류 데이터에서의 전이 학습이 자세 회귀 작업의 성능과 강건성을 크게 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.