Skip to main content
QUICK REVIEW

[논문 리뷰] Exploiting temporal consistency for real-time video depth estimation

Haokui Zhang, Chunhua Shen|arXiv (Cornell University)|2019. 08. 10.
Advanced Vision and Imaging참고 문헌 45인용 수 13
한 줄 요약

이 논문은 2D CNN와 순환 합성곱 LSTM을 조합하여 공간적 특징과 프레임 간 시간적 상관관계를 모두 포착하는 새로운 공간-시간 CLSTM(ST-CLSTM) 아키텍처를 사용하여 시간적 일관성을 활용하는 실시간 영상 깊이 추정 프레임워크를 제안한다. 또한 생성적 적대적 학습 기반의 시간적 일관성 손실을 도입하여 최신 기술 수준의 성능을 달성하면서도 계산 비용을 최소화하였으며, 병렬 데이터 로딩을 통해 표준 하드웨어에서 174.83 fps로 실시간 추론을 구현하였다.

ABSTRACT

Accuracy of depth estimation from static images has been significantly improved recently, by exploiting hierarchical features from deep convolutional neural networks (CNNs). Compared with static images, vast information exists among video frames and can be exploited to improve the depth estimation performance. In this work, we focus on exploring temporal information from monocular videos for depth estimation. Specifically, we take the advantage of convolutional long short-term memory (CLSTM) and propose a novel spatial-temporal CSLTM (ST-CLSTM) structure. Our ST-CLSTM structure can capture not only the spatial features but also the temporal correlations/consistency among consecutive video frames with negligible increase in computational cost. Additionally, in order to maintain the temporal consistency among the estimated depth frames, we apply the generative adversarial learning scheme and design a temporal consistency loss. The temporal consistency loss is combined with the spatial loss to update the model in an end-to-end fashion. By taking advantage of the temporal information, we build a video depth estimation framework that runs in real-time and generates visually pleasant results. Moreover, our approach is flexible and can be generalized to most existing depth estimation frameworks. Code is available at: https://tinyurl.com/STCLSTM

연구 동기 및 목표

  • 자율 주행 및 로봇과 같은 애플리케이션을 위해 실시간 영상 시퀀스의 깊이 추정 과제를 해결한다.
  • 정적 이미지 방법을 초월하여 연속 영상 프레임 간 시간 정보를 활용하여 깊이 추정 정확도를 향상시킨다.
  • 지나친 계산 비용 없이도 높은 성능을 유지하는 경량이고 효율적인 프레임워크를 개발한다.
  • 영상 프레임 간 예측된 깊이 맵의 시간적 일관성을 확보하여 시각적으로 유사한 결과를 생성한다.
  • 기존의 대부분의 깊이 추정 아키텍처와 호환되는 일반화된 프레임워크를 설계한다.

제안 방법

  • 2D CNN를 공간적 특징 추출에 사용하고 CLSTM를 활용해 영상 프레임 간 시간적 의존성을 모델링하는 새로운 ST-CLSTM 아키텍처를 제안한다.
  • GAN 프레임워크에서 3D CNN을 디스커미네이터로 사용하여 시간적 일관성 손실을 학습시키며, 이는 프레임 간 일관성 없는 깊이 예측에 대해 페널티를 가한다.
  • 예측된 깊이와 진짜 깊이 간의 공간 손실(L1 또는 L2)과 적대적 시간 손실을 조합하여 엔드 투 엔드 학습을 수행한다.
  • 병렬 데이터 로딩(PS-mode)을 적용하여 추론 속도를 가속화하고, 표준 하드웨어에서 실시간 성능을 달성한다.
  • 공간 손실과 시간 손실을 동시에 사용하여 엔드 투 엔드로 모델을 학습시켜 깊이 정확도와 시간적 매끄러움을 함께 최적화한다.
  • 낮은 추론 비용을 유지하면서도 경쟁력 있는 성능을 달성하기 위해 얕은 ResNet-18 백본을 활용한다.

실험 결과

연구 질문

  • RQ1단일 영상 시퀀스에서 시간적 상관관계를 효과적으로 활용하여 정적 이미지 방법을 초월한 깊이 추정 성능 향상을 이룰 수 있는가?
  • RQ2딥 러닝 모델은 어떻게 연속 영상 프레임 간 예측된 깊이 맵의 시간적 일관성을 유지할 수 있는가?
  • RQ3GAN 기반의 적대적 손실이 시간적 일관성과 깊이 추정의 시각적 품질에 미치는 영향은 무엇인가?
  • RQ4경량화된 ST-CLSTM 아키텍처는 성능을 희생시키지 않고도 실시간 추론을 달성할 수 있는가?
  • RQ5이 프레임워크는 기존의 깊이 추정 모델에 최소한의 아키텍처 수정으로 얼마나 일반화될 수 있는가?

주요 결과

  • 제안된 ST-CLSTM 프레임워크는 NYU Depth V2 및 KITTI 데이터셋에서 모두 최신 기술 수준의 성능을 달성하였으며, 많은 더 깊은 모델들을 능가한다.
  • NYU Depth V2 데이터셋에서 ResNet-18를 사용하여 상대 오차(Rec)는 0.131, RMS는 0.571, δ1는 0.833을 기록하였으며, 더 깊은 백본을 사용한 방법들을 능가한다.
  • KITTI 데이터셋에서 상대 오차(Rec)는 0.101, RMS는 4.137, δ1는 0.890을 기록하였으며, 대부분의 이전 영상 및 정적 이미지 방법을 뛰어넘는다.
  • 병렬+직렬 로딩 모드에서 174.83 fps로 실행되어 실시간 요구 조건(30 fps)을 초월하며 강력한 실용성 가능성을 입증한다.
  • 제거 실험을 통해 ST-CLSTM와 GAN 기반 시간 손실이 모두 시간적 일관성과 전체 성능 향상에 기여한다는 것이 확인되었다.
  • 이 프레임워크는 대부분의 기존 깊이 추정 아키텍처에 최소한의 수정으로 통합 가능하여 매우 높은 일반화 능력을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.