Skip to main content
QUICK REVIEW

[논문 리뷰] M4Depth: A motion-based approach for monocular depth estimation on video sequences.

Michaël Fonder, Damien Ernst|arXiv (Cornell University)|2021. 05. 20.
Advanced Vision and Imaging참고 문헌 30인용 수 6
한 줄 요약

M4Depth는 드론에서 RGB 비디오와 현장 운동 데이터를 사용하여 운동 보정이 적용된 단안 심도 추정 방법을 제안한다. 이는 시간적 반복성과 기하학적 제약 조건을 갖춘 피라미드형 컨볼루션 신경망을 활용하여 정확하고 시공간적으로 일관된 심도 맵을 생성하며, 운동 정보를 핵심 요소로 활용함으로써 Mid-Air 드론 데이터셋에서 최신 기술들을 능가한다.

ABSTRACT

Getting the distance to objects is crucial for autonomous vehicles. In instances where depth sensors cannot be used, this distance has to be estimated from RGB cameras. As opposed to cars, the task of estimating depth from on-board mounted cameras is made complex on drones because of the lack of constrains on motion during flights. In this paper, we present a method to estimate the distance of objects seen by an on-board mounted camera by using its RGB video stream and drone motion information. Our method is built upon a pyramidal convolutional neural network architecture and uses time recurrence in pair with geometric constraints imposed by motion to produce pixel-wise depth maps. In our architecture, each level of the pyramid is designed to produce its own depth estimate based on past observations and information provided by the previous level in the pyramid. We introduce a spatial reprojection layer to maintain the spatio-temporal consistency of the data between the levels. We analyse the performance of our approach on Mid-Air, a public drone dataset featuring synthetic drone trajectories recorded in a wide variety of unstructured outdoor environments. Our experiments show that our network outperforms state-of-the-art depth estimation methods and that the use of motion information is the main contributing factor for this improvement. The code of our method is publicly available on GitHub; see this https URL

연구 동기 및 목표

  • 심도 센서가 없고 운동이 제약이 없는 드론 환경에서 정확한 심도 추정 문제를 해결하기 위해.
  • 현장의 RGB 비디오와 운동 데이터를 활용하여 비정형 외부 환경에서의 단안 심도 추정을 향상시키기 위해.
  • 비디오 프레임 간 시공간적으로 일관된 심도 추정 프레임워크를 개발하기 위해.
  • 드론 비디오 시퀀스에서 운동 정보가 심도 추정 성능에 기여하는 정도를 평가하기 위해.
  • 항공 로봇 분야에서 공개 가능하고 최신 기술 수준의 단안 심도 추정 솔루션을 제공하기 위해.

제안 방법

  • 각 수준에서 이전 관측치와 이전 수준의 특징을 기반으로 심도 추정치를 생성하는 피라미드형 합성곱 신경망을 사용한다.
  • 시계열 반복성을 통합하여 순차적 비디오 데이터를 활용하고 시간이 지남에 따라 심도 추정 성능을 향상시킨다.
  • 드론 운동에서 유도된 기하학적 제약 조건을 강제 적용하여 연속 프레임 간 일관성을 확보한다.
  • 피라미드 수준 간 시공간 정렬을 유지하기 위해 공간 재투영 레이어를 도입한다.
  • M4Depth는 Mid-Air 데이터셋의 합성 드론 비행 경로를 기반으로 엔드 투 엔드로 훈련된다.
  • RGB 비디오와 운동 데이터를 융합하여 기존의 비디오 전용 접근 방식을 뛰어넘는 정확도 향상을 달성한다.

실험 결과

연구 질문

  • RQ1드론 운동 데이터 통합이 제약이 없는 공중 환경에서 단안 심도 추정에 어떻게 기여하는가?
  • RQ2시간 반복성과 기하학적 제약 조건이 심도 맵의 정확도와 일관성에 어느 정도 기여하는가?
  • RQ3제안된 방법은 드론 비디오 시퀀스에서 최신 기술 수준의 단안 심도 추정 기법과 비교해 어떻게 성능을 냈는가?
  • RQ4심도 추정 성능에서 운동 정보와 시각적 외관 중 어느 것이 더 기여하는가?
  • RQ5크로스 레벨 특징 정제 기능을 갖춘 피라미드 아키텍처는 기존의 단일 스케일 네트워크보다 더 정확한 심도 맵을 생성할 수 있는가?

주요 결과

  • M4Depth는 Mid-Air 드론 데이터셋에서 기존 최신 기술 수준의 단안 심도 추정 기법들을 능가한다.
  • 운동 정보 통합이 심도 추정 정확도를 크게 향상시켜, 이는 본 방법의 성공에 핵심적인 역할을 한다는 것을 시사한다.
  • 공간 재투영 레이어는 피라미드 수준 간 및 비디오 프레임 간 시공간 일관성을 효과적으로 유지한다.
  • 합성된 Mid-Air 데이터셋의 다양한 비정형 외부 환경에서도 본 방법은 강력한 심도 추정 성능을 달성한다.
  • 드론 운동에서 유도된 시간 모델링과 기하학적 제약 조건이 네트워크 성능을 향상시킨다.
  • M4Depth의 코드는 GitHub에서 공개되어 있어 재현성과 향후 연구를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.