Skip to main content
QUICK REVIEW

[논문 리뷰] DepthFormer: Exploiting Long-Range Correlation and Local Information for Accurate Monocular Depth Estimation

Zhenyu Li, Zehui Chen|arXiv (Cornell University)|2022. 03. 27.
Advanced Vision and Imaging인용 수 5
한 줄 요약

DepthFormer는 단안 영상 깊이 추정을 위한 하이브리드 트랜스포머-CNN 인코더를 제안하며, 자기주의 주목을 통한 장거리 상관관계 모델링과 컨volution 브랜치를 통한 국소적 세부사항 보존을 동시에 구현한다. 또한 특징 병합 성능을 향상시키기 위해 새로운 계층적 통합 및 이종 상호작용(Hierarchical Aggregation and Heterogeneous Interaction, HAHI) 모듈을 도입하였다. 이는 KITTI, NYU, SUN RGB-D 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하였으며, 특히 정확도와 효율성 향상으로 인해 KITTI에서 새로운 SOTA를 수립하였다.

ABSTRACT

This paper aims to address the problem of supervised monocular depth estimation. We start with a meticulous pilot study to demonstrate that the long-range correlation is essential for accurate depth estimation. Therefore, we propose to leverage the Transformer to model this global context with an effective attention mechanism. We also adopt an additional convolution branch to preserve the local information as the Transformer lacks the spatial inductive bias in modeling such contents. However, independent branches lead to a shortage of connections between features. To bridge this gap, we design a hierarchical aggregation and heterogeneous interaction module to enhance the Transformer features via element-wise interaction and model the affinity between the Transformer and the CNN features in a set-to-set translation manner. Due to the unbearable memory cost caused by global attention on high-resolution feature maps, we introduce the deformable scheme to reduce the complexity. Extensive experiments on the KITTI, NYU, and SUN RGB-D datasets demonstrate that our proposed model, termed DepthFormer, surpasses state-of-the-art monocular depth estimation methods with prominent margins. Notably, it achieves the most competitive result on the highly competitive KITTI depth estimation benchmark. Our codes and models are available at https://github.com/zhyever/Monocular-Depth-Estimation-Toolbox.

연구 동기 및 목표

  • 단안 영상 깊이 추정에서 CNN의 장거리 상관관계 모델링 한계와 트랜스포머의 국소 세부사항에 대한 공간적 인덕티브 바이어스 부족 문제를 해결하기 위해.
  • 트랜스포머의 글로벌 컨텍스트와 CNN의 국소 구조적 특징을 동시에 활용하여 깊이 추정 정확도를 향상시키기 위해.
  • 독립된 브랜치의 후기 병합 방식에서 발생하는 특징 병합 병목 현상을 해결하기 위해 전용 상호작용 메커니즘을 도입하기 위해.
  • 전역 자기주의의 메모리 비용을 고해상도 특징에 대해 감소시키기 위해 탈형 변형 주목 기법을 사용하기 위해.
  • 주요 깊이 추정 벤치마크에서 새로운 최신 기술 수준 성능을 확립하기 위해, 특히 KITTI에서의 성능 향상에 초점을 맞추기 위해.

제안 방법

  • 모델은 이중 브랜치 인코더를 사용한다: 장거리 의존성을 모델링하기 위한 비전 트랜스포머 브랜치와 국소 공간적 세부사항을 보존하기 위한 CNN 브랜치.
  • 특징을 향상시키기 위해 계층적 통합 및 이종 상호작용(Hierarchical Aggregation and Heterogeneous Interaction, HAHI) 모듈을 도입하였다. 이는 다중 수준 자기주의와 트랜스포머 및 CNN 특징 간의 교차 주목을 통해 기능 통합을 강화한다.
  • HAHI 모듈은 전체 픽셀이 아닌 학습 가능한 키 포인트 부분집합에만 주목하는 탈형 자기주의(Deformable Self-Attention, DSA) 기법을 사용하여 계산 비용을 절감한다.
  • 탈형 교차 주목(Deformable Cross-Attention, DCA) 모듈은 집합 간 이동 방식으로 이종 특징 간의 유사도를 모델링하여 구조화된 특징 상호작용을 가능하게 한다.
  • 깊이 예측을 위해 표준 디코더 헤드를 사용하며, 감독 손실을 기반으로 엔드 투 엔드로 훈련된다.
  • 탈형 주목 기법은 모든 계층적 단계에 적용되어 고해상도 특징 표현을 유지하면서도 메모리 사용량을 줄인다.

실험 결과

연구 질문

  • RQ1하이브리드 트랜스포머-CNN 인코더가 단안 영상 깊이 추정에서 기존 CNN 또는 순수 트랜스포머 인코더를 능가할 수 있는가?
  • RQ2HAHI와 같은 전용 특징 상호작용 모듈이 장거리 특징과 국소 특징 간의 병합 성능을 얼마나 효과적으로 향상시킬 수 있는가?
  • RQ3탈형 주목 기법을 사용하면 고해상도 특징 맵에서 성능을 유지하면서도 메모리 비용을 줄일 수 있는가?
  • RQ4제안된 방법이 KITTI, NYU, SUN RGB-D와 같은 표준 벤치마크에서 최신 기술 수준 성능을 달성할 수 있는가?
  • RQ5장거리 모델링과 국소 세부사항 보존 중 어느 것이 깊이 추정 정확도에 더 큰 기여를 하는가?

주요 결과

  • DepthFormer는 매우 경쟁이 치열한 KITTI 깊이 추정 벤치마크에서 새로운 최신 기술 수준 성능을 달성하였으며, 뛰어난 정확도를 입증하였다.
  • 다중 수준 탈형 자기주의(Deformable Self-Attention, DSA)를 사용할 경우 단일 수준 주목 대비 RMS 오차가 4.9% 향상되었다.
  • 탈형 교차 주목(Deformable Cross-Attention, DCA)을 추가하면 RMS 오차가 2.2% 향상되었으며, 이는 이종 특징 상호작용에서의 효과를 확인한다.
  • HAHI 모듈은 특히 국소 일관성이 중요한 근접 물체 깊이 추정에서 성능 향상에 크게 기여한다.
  • DepthFormer는 높은 추론 속도를 유지하며, KITTI 검증 세트에서 정확도(δ₁)와 속도 면에서 이전 최신 기술 수준 방법들을 능가한다.
  • 제거 실험 결과, 다중 수준 DSA와 DCA의 조합이 최적 성능을 내기 위해 필수적임을 확인하였으며, 둘 중 하나를 제거하면 성능이 크게 떨어졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.