Skip to main content
QUICK REVIEW

[논문 리뷰] 3D Scene Geometry-Aware Constraint for Camera Localization with Deep Learning

Mi Tian, Qiong Nie|arXiv (Cornell University)|2020. 05. 13.
Robotics and Sensor-Based Localization참고 문헌 36인용 수 4
한 줄 요약

이 논문은 깊이, 운동 정보 및 이미지 콘텐츠를 활용하여 픽셀 수준의 광학 손실과 이미지 수준의 구조적 유사도 손실을 통해 3D 환경 기하학에 민감한 제약 조건을 통합함으로써 절대 카메라 자세 회귀를 위한 컴act한 딥러닝 네트워크를 제안한다. 이 방법은 기존 최첨단 기술 대비 다양한 실내 및 실외 환경에서 국소화 정확도와 수렴 속도 모두에서 뚜렷한 향상을 이룬다.

ABSTRACT

Camera localization is a fundamental and key component of autonomous driving vehicles and mobile robots to localize themselves globally for further environment perception, path planning and motion control. Recently end-to-end approaches based on convolutional neural network have been much studied to achieve or even exceed 3D-geometry based traditional methods. In this work, we propose a compact network for absolute camera pose regression. Inspired from those traditional methods, a 3D scene geometry-aware constraint is also introduced by exploiting all available information including motion, depth and image contents. We add this constraint as a regularization term to our proposed network by defining a pixel-level photometric loss and an image-level structural similarity loss. To benchmark our method, different challenging scenes including indoor and outdoor environment are tested with our proposed approach and state-of-the-arts. And the experimental results demonstrate significant performance improvement of our method on both prediction accuracy and convergence efficiency.

연구 동기 및 목표

  • 복잡한 3D 환경에서 절대 카메라 자세 회귀의 정확도와 효율성을 향상시키는 것.
  • 기하학적 사전 지식을 통합하여 엔드 투 엔드 딥러닝과 전통적인 3D 기하 기반 방법 간 격차를 메우는 것.
  • 운동, 깊이 및 이미지 콘텐츠를 효과적으로 활용하여 강력한 카메라 국소화를 위한 컴act한 네트워크를 개발하는 것.
  • 실제 환경 조건에서 도전적인 실내 및 실외 환경에서의 성능을 벤치마킹하는 것.
  • 딥 신경망에 기하학적 정규화를 통해 수렴 속도와 예측 안정성을 향상시키는 것.

제안 방법

  • 픽셀 수준의 광학 손실과 이미지 수준의 구조적 유사도 손실을 조합하여 3D 환경 기하학에 민감한 제약 조건을 도입한다.
  • 광학 손실은 깊이 및 운동 정보를 사용하여 예측된 이미지 재구성과 진짜 이미지 재구성 간의 일관성을 강제한다.
  • 구조적 유사도 손실은 뷰 간 고수준 이미지 구조를 유지하여 기능 정렬을 향상시킨다.
  • 이 제약 조건은 엔드 투 엔드 카메라 자세 회귀를 위한 컴act한 컨volution 신경망의 정규화 항으로 통합된다.
  • 운동 및 깊이 데이터는 학습 중에 보조 supervision을 위해 왜곡된 이미지를 합성하는 데 사용된다.
  • 자세 회귀 및 기하 일관성 손실의 공동 최적화를 통해 네트워크를 엔드 투 엔드로 학습시킨다.

실험 결과

연구 질문

  • RQ1딥러닝 기반 카메라 국소화 시스템이 3D 환경 기하 제약 조건을 통합함으로써 더 높은 정확도를 달성할 수 있는가?
  • RQ2광학 손실과 구조적 유사도 손실의 통합이 수렴 속도와 안정성에 어떤 영향을 미치는가?
  • RQ3제안된 방법이 실내 및 실외 환경 모두에서 최첨단 기술을 초월하는가?
  • RQ4운동, 깊이 및 이미지 콘텐츠의 사용이 다양한 환경에서 일반화 능력을 얼마나 향상시키는가?
  • RQ5기하학적 정규화를 갖춘 컴act한 네트워크가 기존의 전통적인 3D 기하 기반 방법과 비교해 성능을 동등하거나 뛰어나게 달성할 수 있는가?

주요 결과

  • 제안된 방법은 도전적인 실내 및 실외 환경에서 예측 정확도와 수렴 효율성 모두에서 뚜렷한 성능 향상을 이룬다.
  • 3D 환경 기하에 민감한 제약 조건의 통합은 기준 딥러닝 모델 대비 더 강력하고 정밀한 카메라 자세 추정을 가능하게 한다.
  • 이 방법은 복잡한 실내 및 실외 설정을 포함한 다양한 환경에서 뛰어난 일반화 능력을 보여준다.
  • 광학 손실과 구조적 유사도 손실을 병합한 사용은 기능 학습을 향상시키고 최적화의 불안정성을 감소시킨다.
  • 컴act한 네트워크 설계는 높은 정확도를 유지하면서도 효율적인 추론을 가능하게 하여 기존 엔드 투 엔드 접근법을 능가한다.
  • 이 방법은 ICRA 2020에서 발표를 수락하여 로봇공학 및 컴퓨터 비전 분야에서의 인정을 받았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.