Skip to main content
QUICK REVIEW

[논문 리뷰] Hierarchical Normalization for Robust Monocular Depth Estimation

Chi Zhang, Wei Yin|arXiv (Cornell University)|2022. 10. 18.
Advanced Vision and Imaging인용 수 8
한 줄 요약

이 논문은 계층적 깊이 정규화(Hierarchical Depth Normalization, HDN)를 제안하며, 공간적 및 깊이 도메인의 맥락 그룹화를 통해 세밀한 깊이 세부 정보를 유지함으로써 단안 깊이 추정 성능을 햖थ한다. 여러 계층적 수준에서 깊이 표현을 정규화함으로써 HDN은 인스턴스 수준 정규화를 능가하며, 다섯 개의 제로샷 전이 벤치마크에서 정확도와 에지 선명도 향상으로 새로운 최고 성능(SOTA)을 달성한다.

ABSTRACT

In this paper, we address monocular depth estimation with deep neural networks. To enable training of deep monocular estimation models with various sources of datasets, state-of-the-art methods adopt image-level normalization strategies to generate affine-invariant depth representations. However, learning with image-level normalization mainly emphasizes the relations of pixel representations with the global statistic in the images, such as the structure of the scene, while the fine-grained depth difference may be overlooked. In this paper, we propose a novel multi-scale depth normalization method that hierarchically normalizes the depth representations based on spatial information and depth distributions. Compared with previous normalization strategies applied only at the holistic image level, the proposed hierarchical normalization can effectively preserve the fine-grained details and improve accuracy. We present two strategies that define the hierarchical normalization contexts in the depth domain and the spatial domain, respectively. Our extensive experiments show that the proposed normalization strategy remarkably outperforms previous normalization methods, and we set new state-of-the-art on five zero-shot transfer benchmark datasets.

연구 동기 및 목표

  • 단안 깊이 추정에서 인스턴스 수준 정규화의 한계를 해결하기 위해, 전반적인 시점 구조를 강조하지만 세밀한 깊이 차이를 간과하는 문제를 해결한다.
  • 학습 중 전반적인 시점 구조와 국소 깊이 세부 정보 보존 간 균형을 이루는 정규화 전략을 설계한다.
  • 스케일 및 이동 불일치가 있는 다양한 깊이 주석을 가진 혼합 데이터셋 학습을 효과적으로 가능하게 한다.
  • 모델의 제로샷 일반화 성능을 향상시키기 위해 실제 환경 이미지의 변동성에 대한 강건성을 향상시킨다.
  • 공간 및 깊이 도메인에서 작동하며 구성 가능한 맥락 수준을 가진 융통성 있는 정규화 메커니즘을 개발한다.

제안 방법

  • 공간적 및 깊이 도메인에서 다중 척도 맥락을 사용하여 깊이 표현을 정규화하는 계층적 깊이 정규화(HDN)를 제안한다.
  • 공간 도메인에서는 이미지를 격자로 나누고, 각 셀 단위로 정규화하여 국소 깊이 차이를 강조한다.
  • 깊이 도메인에서는 지표 깊이 값에 따라 픽셀을 버킷으로 묶어 깊이 크기에 기반한 맥락 인식 정규화를 가능하게 한다.
  • 학습 중에 다중 정규화 수준을 조합하여 국소 세부 정보와 전반적 구조 간 균형을 이룬다.
  • 다양한 맥락 척도 간 상대 깊이 차이를 유지하는 학습 가능한 정규화 손실을 사용한다.
  • 기본적인 단안 깊이 추정 네트워크에 통합되며, 아키텍처 변경이 필요 없다.

실험 결과

연구 질문

  • RQ1계층적 정규화는 인스턴스 수준 정규화에 비해 세밀한 깊이 세부 정보 보존에 효과적인가?
  • RQ2공간 및 깊이 도메인에서의 다중 척도 정규화는 다양한 벤치마크에서 제로샷 일반화 성능을 향상시키는가?
  • RQ3계층적 맥락 수준의 수가 모델 성능과 강건성에 어떤 영향을 미치는가?
  • RQ4HDN은 일관되지 않은 깊이 스케일을 가진 혼합 데이터셋 학습에서 도메인 이동 문제를 효과적으로 다룰 수 있는가?
  • RQ5제안된 방법은 제로샷 전이 설정에서 기존 최고 성능(SOTA) 모델을 능가하는가?

주요 결과

  • HDN-S(공간 도메인)는 KITTI 벤치마크에서 AbsRel을 8.58로 감소시켜 인스턴스 수준 정규화(9.81)를 능가한다.
  • HDN-DR(깊이 및 공간 도메인)는 NYU에서 6.9의 AbsRel을 기록하며 이전 SOTA(9.0) 대비 24.3% 향상되었다.
  • ETH3D에서 HDN-DR는 8.0의 AbsRel과 83.3%의 δ1을 달성하여 두 지표 모두 새로운 SOTA를 수립했다.
  • DIODE, KITTI, NYU, ScanNet, ETH3D를 포함한 다섯 개의 제로샷 전이 벤치마크에서 일관되게 베이스라인을 능가했다.
  • 절단 실험 결과, 다수의 맥락 수준을 사용할수록 성능 향상이 있었으며, 최저 수준만 사용할 경우 정확도가 저하됨을 확인했다.
  • 정성적 결과는 인스턴스 수준 정규화에 비해 더 부드러운 표면, 선명한 에지, 더 세밀한 예측을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.