Skip to main content
QUICK REVIEW

[논문 리뷰] From Big to Small: Multi-Scale Local Planar Guidance for Monocular Depth Estimation

Jin Han Lee, Myung Kyu Han|arXiv (Cornell University)|2019. 07. 24.
Advanced Vision and Imaging참고 문헌 49인용 수 483
한 줄 요약

이 논문은 다중 해상도 로컬 평면 가이던스(LPG) 계층을 여러 디코딩 단계에 배치하여 밀집 특성 맵을 전체 해상도 깊이로 안내하고, NYU Depth V2 및 KITTI에서 단안 깊이 추정의 최신 성능을 달성합니다. 또한 LPG의 효과를 검증하는 광범위한 어블레이션을 제공합니다.

ABSTRACT

Estimating accurate depth from a single image is challenging because it is an ill-posed problem as infinitely many 3D scenes can be projected to the same 2D scene. However, recent works based on deep convolutional neural networks show great progress with plausible results. The convolutional neural networks are generally composed of two parts: an encoder for dense feature extraction and a decoder for predicting the desired depth. In the encoder-decoder schemes, repeated strided convolution and spatial pooling layers lower the spatial resolution of transitional outputs, and several techniques such as skip connections or multi-layer deconvolutional networks are adopted to recover the original resolution for effective dense prediction. In this paper, for more effective guidance of densely encoded features to the desired depth prediction, we propose a network architecture that utilizes novel local planar guidance layers located at multiple stages in the decoding phase. We show that the proposed method outperforms the state-of-the-art works with significant margin evaluating on challenging benchmarks. We also provide results from an ablation study to validate the effectiveness of the proposed method.

연구 동기 및 목표

  • 정확한 단안 깊이 추정이 잘 정의되지 않은 문제임을 동기화하고 전역 및 로컬 단서를 활용한다.
  • LPG 계층을 여러 디코딩 단계에 도입하여 명시적 기하학적 가이던스를 제공한다.
  • LPG 기반 가이던스가 실내 및 실외 벤치마크에서 깊이 정확도를 개선하는지 보여준다.
  • 여러 백본 인코더(ResNet, DenseNet 등)를 평가하여 강건성과 일반화를 입증한다.
  • LPG의 기여와 학습 손실 설계의 효과를 검증하는 어블레이션 분석을 제공한다.

제안 방법

  • 밀집 특징 추출기(백본 네트워크)를 갖춘 인코더–디코더 구조를 사용한다.
  • 백본 뒤에 ASPP(확장 비율이 다른 확장 모듈)로 컨텍스추얼 추출기를 삽입한다.
  • 해상도 H/8, H/4, H/2인 디코딩 단계에 로컬 평면 가이던스(LPG) 계층을 삽입하여 k×k 패치당 4D 평면 계수를 생성한다.
  • 평면 계수를 광선-평면 교차를 통해 지역 깊이 신호로 변환하여 패치당 깊이 가이던스를 얻는다.
  • 여러 스케일의 LPG 출력과 1×1으로 축소된 특징을 연결(concatenate)하고 최종 컨볼루션 계층으로 최종 깊이를 예측한다.
  • 로그 깊이 오차 기반의 스케일 의존적 손실(SiLog 변형)과 최종 손실 L = alpha * sqrt(D(g))를 사용해 학습한다.
  • 다양한 백본(ResNet-101/ResNext-101/DenseNet-161) 및 데이터셋(NYU Depth V2, KITTI)을 실험해 효과를 입증한다.

실험 결과

연구 질문

  • RQ1다중 스케일 LPG 계층 도입이 강력한 baselines 대비 단안 깊이 추정을 개선하는가?
  • RQ2다른 디코딩 단계의 LPG 계층이 최종 깊이 품질에 어떻게 기여하는가?
  • RQ3다양한 백본 인코더가 LPG-enabled 네트워크의 성능에 어떤 영향을 미치는가?
  • RQ4제안된 손실 구성은 학습 수렴 및 정확도에 어떤 영향을 미치는가?
  • RQ5실내(NYU)와 실외(KITTI) 데이터셋에서 이득이 일관적인가?

주요 결과

  • LPG 장착 네트워크가 NYU Depth V2 및 KITTI 벤치마크에서 최신 성능을 달성하여 대부분의 지표에서 기존 방법을 능가합니다.
  • 어블레이션 결과 LPG 계층이 핵심 구성 요소 중 가장 큰 성능 향상을 제공합니다.
  • Backbone으로 DenseNet-161이 NYU에서 최상의 결과를 내고, ResNext-101은 KITTI에서 가장 강력할 수 있어 데이터셋에 따른 이점이 나타납니다.
  • 평면 내 점수(delta) 임계값 등 내부 측정치 및 깊이 정확도 지표에서 평가 분할 간 현저한 향상을 보입니다.
  • 경량 백본(MobileNetV2)에서도 파라미터 효율이 큰 이득과 함께 경쟁력 있는 성능을 유지합니다.
  • 정성적 결과는 경쟁 방법들과 비교해 물체 경계가 더 명확하고 지역 세부가 잘 보존됩니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.