Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Monocular Depth and Ego-motion Learning with Structure and Semantics

Vincent Casser, Sören Pirk|arXiv (Cornell University)|2019. 06. 12.
Advanced Vision and Imaging인용 수 22
한 줄 요약

이 논문은 개별 객체의 3D 운동을 SE3 변환을 사용하여 모델링하고 의미적 인스턴스 마스크를 통합함으로써, 단일 영상에서 동시 깊이 및 자율 주행 운동 추정을 위한 비지도 학습 방법을 제안한다. 기하학적 구조와 의미 정보를 유연한 왜곡 프레임워크에 통합하고 온라인 정밀 조정을 적용함으로써, KITTI 및 Cityscapes에서 최신 기준 성능을 달성하였으며, 특히 큰 운동을 보이는 다이나믹한 환경에서 깊이 및 자율 주행 운동 지표에서 이전 방법들에 비해 크게 승리한다.

ABSTRACT

We present an approach which takes advantage of both structure and semantics for unsupervised monocular learning of depth and ego-motion. More specifically, we model the motion of individual objects and learn their 3D motion vector jointly with depth and ego-motion. We obtain more accurate results, especially for challenging dynamic scenes not addressed by previous approaches. This is an extended version of Casser et al. [AAAI'19]. Code and models have been open sourced at https://sites.google.com/corp/view/struct2depth.

연구 동기 및 목표

  • 모델링되지 않은 객체 운동으로 인해 기존 방법이 실패하는 다이나믹한 환경에서 비지도 단일 영상 깊이 및 자율 주행 운동 추정 문제를 해결하기 위해.
  • SE3 변환을 사용하여 개별 객체의 3D 운동을 명시적으로 모델링하여 깊이 및 자율 주행 운동 예측 정확도를 향상시키기 위해.
  • 실시간으로 모델을 새로운 환경에 적응시키는 온라인 정밀 조정 기법을 통해 미세조정 없이도 도메인 일반화 및 전이 학습을 가능하게 하기 위해.
  • 더 나은 시cene 이해를 위해 학습 과정에 기하학적 구조(3D 시cene 복원)와 의미 정보(객체 인스턴스 마스크)를 통합하기 위해.

제안 방법

  • 이 방법은 단일 RGB 영상에서 밀도 높은 깊이 맵을 예측하기 위해 완전 컨volution형 인코더-디코더 네트워크를 사용한다.
  • 자신의 운동 네트워크를 별도로 활용하여 연속 프레임 간 6차원 SE3 변환(이동 및 회전)을 예측한다.
  • 예측된 깊이 맵에 SE3 변환을 적용하여 인스턴스 세그멘테이션 마스크를 사용해 각 객체의 3D 운동 추정을 가능하게 한다.
  • 자기 운동과 깊이 정보를 사용해 소스 영상을 왜곡함으로써 타겟 프레임을 재구성하는 유연한 이미지 왜곡 연산자를 사용하며, 이때 객체 마스크를 활용해 움직이는 영역을 분리한다.
  • 추론 중에 온라인 정밀 조정 기법을 적용하여 타겟 도메인의 몇 장의 프레임을 사용해 예측을 정밀 조정함으로써 모델을 새로운 환경에 적응시킨다.
  • 손실은 왜곡된 이미지와 원본 타겟 프레임 간의 광학 일致성에 기반하며, 움직이는 객체 및 유효하지 않은 영역을 제외하기 위해 마스크링을 적용한다.

실험 결과

연구 질문

  • RQ13D에서 개별 객체 운동을 명시적으로 모델링하면 다이나믹한 환경에서 비지도 단일 영상 깊이 및 자율 주행 운동 추정 성능이 향상되는가?
  • RQ2의미적 인스턴스 마스크와 3D 운동 제약 조건을 통합할 경우, 높은 운동 내용을 포함한 도전적인 데이터셋에서의 성능에 어떤 영향을 미치는가?
  • RQ3미세조정 없이도 온라인 정밀 조정이 새로운 데이터셋에서 테스트할 때 도메인 전이 성능을 얼마나 향상시킬 수 있는가?
  • RQ4객체 운동 모델링과 온라인 정밀 조정을 결합할 경우, 각각의 구성 요소만 사용할 때보다 상호 보완적인 성능 향상이 이루어지는가?
  • RQ5KITTI 및 Cityscapes와 같은 벤치마크에서 최신 기준 방법들과 비교했을 때, 특히 다이나믹한 환경에 대한 강인성 측면에서 제안된 방법은 어떻게 성능을 내는가?

주요 결과

  • 제안된 방법은 KITTI 데이터셋에서 새로운 최고 성능을 달성하였으며, 운동 모델링과 온라인 정밀 조정을 모두 사용할 경우 절대 상대 오차(Abs Rel)를 0.1052로 감소시켰고, 기준 모델 대비 0.1563보다 크게 향상되었다.
  • 높은 운동성을 보이는 다이나믹한 환경을 특징으로 하는 Cityscapes 데이터셋에서는 기존 비지도 접근 방식보다 뚜렷이 승리하였으며, 복잡한 실제 환경에서의 효과성을 입증하였다.
  • 운동 모델링(M)과 온라인 정밀 조정(R)의 조합은 RMSE를 3.5591(50m 캡)과 4.7619(80m 캡)으로 줄여 기준 모델 대비 주요 지표에서 10% 이상 향상되었다.
  • 온라인 정밀 조정만으로도 다양한 데이터셋에서 성능 향상이 이루어졌으며, 특히 KITTI에서 Abs Rel을 0.1388에서 0.1175로 감소시켜 강력한 도메인 적응 능력을 보였다.
  • 운동 모델링만으로도 두 데이터셋 모두에서 성능 향상이 있었으며, 특히 Cityscapes에서 Abs Rel을 0.1388에서 0.1377로 감소시켜 다이나믹한 환경에서의 가치를 입증하였다.
  • 수정된 KITTI 평가 코드로 평가했을 때도, 동일한 평가 설정을 사용한 이전 방법들 전부를 뛰어넘었으며, 이는 방법의 강인성과 일반화 능력을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.