Skip to main content
QUICK REVIEW

[논문 리뷰] Lite-Mono: A Lightweight CNN and Transformer Architecture for Self-Supervised Monocular Depth Estimation

Ning Zhang, Francesco Nex|arXiv (Cornell University)|2022. 11. 23.
Image Processing Techniques and Applications인용 수 7
한 줄 요약

Lite-Mono는 자기지도 학습 기반 단안 깊이 추정을 위한 경량 하이브리드 CNN-Transformer 아키텍처를 제안한다. 다중 척도 국소 특징 추출을 위해 연속 확장 컨볼루션(CDC)을 사용하고, 장거리 맥락을 인코딩하기 위해 교차공분산 자기어텐션을 사용하는 국소-글로벌 특징 상호작용(LGFI) 모듈을 통합한다. KITTI에서 Monodepth2 대비 80% 적은 파라미터를 사용하면서도 최신 기술 수준의 정확도를 달성하여 엣지 디바이스에서 뛰어난 효율성과 성능을 입증한다.

ABSTRACT

Self-supervised monocular depth estimation that does not require ground truth for training has attracted attention in recent years. It is of high interest to design lightweight but effective models so that they can be deployed on edge devices. Many existing architectures benefit from using heavier backbones at the expense of model sizes. This paper achieves comparable results with a lightweight architecture. Specifically, the efficient combination of CNNs and Transformers is investigated, and a hybrid architecture called Lite-Mono is presented. A Consecutive Dilated Convolutions (CDC) module and a Local-Global Features Interaction (LGFI) module are proposed. The former is used to extract rich multi-scale local features, and the latter takes advantage of the self-attention mechanism to encode long-range global information into the features. Experiments demonstrate that Lite-Mono outperforms Monodepth2 by a large margin in accuracy, with about 80% fewer trainable parameters.

연구 동기 및 목표

  • 엣지 배포에 적합한 경량이면서도 정확한 자기지도 학습 기반 단안 깊이 추정 모델을 설계하기.
  • 표준 트랜스포머의 높은 계산 비용을 피하면서도 CNN의 장거리 의존성 파악 능력의 한계를 보완하기.
  • 지상 진짜 깊이 지도 없이도 어려운 시나리오, 예를 들어 가림, 움직이는 물체가 있는 환경에서도 깊이 추정 정확도를 향상시키기.
  • 실시간 응용 프로그램을 고려할 때 모델 크기, FLOPs, 추론 속도 간의 유리한 트레이드오프를 달성하기.

제안 방법

  • 다양한 척도의 국소 특징을 추가적인 파라미터 없이 추출하기 위해 순차적으로 증가하는 확장률을 적용하는 연속 확장 컨볼루션(CDC) 모듈을 도입한다.
  • 채널 차원에서 교차공분산 자기어텐션을 사용하여 국소 특징에 효율적으로 글로벌 맥락을 통합하는 국소-글로벌 특징 상호작용(LGFI) 모듈을 제안한다.
  • 에코더 스테이지 간의 특징 전파와 정보 융합을 향상시키기 위해 크로스스테이지 스킵 연결을 활용한다.
  • 다운샘플링 과정에서 공간 해상도를 유지하기 위해 풀링된 연결(concatenation)을 사용하여 정보 손실을 최소화하고 파라미터 추가 비용을 극소화한다.
  • 각 스테이지에서 CDC 블록 뒤에 LGFI 모듈을 이어붙이는 하이브리드 에코더 아키텍처를 채택하여 국소 및 글로벌 특징 학습의 균형을 맞춘다.
  • 얕은 층에서는 작은 확장률을 시작으로 깊이가 증가할수록 확장률을 두 배로 늘리는 방식으로 CDC 블록의 확장률을 최적화하여 국소 세부 정보와 다중 척도 인식 능력 간의 균형을 확보한다.

실험 결과

연구 질문

  • RQ1경량 CNN-Transformer 하이브리드 아키텍처가 훨씬 적은 파라미터로 자기지도 학습 기반 단안 깊이 추정에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ2제안된 CDC 모듈이 모델 복잡도를 증가시키지 않고도 다중 척도 국소 특징 추출 능력을 얼마나 향상시키는가?
  • RQ3LGFI 모듈이 국소 특징에 장거리 글로벌 맥락을 통합함으로써 성능 향상에 얼마나 기여하는가?
  • RQ4CDC 모듈 내에서 다양한 확장률 설정이 소형 및 중형 객체 인식 능력에 어떤 영향을 미치는가?
  • RQ5엣지 플랫폼에서 모델 효율성, 정확도, 추론 속도 간의 트레이드오프는 어떠한가?

주요 결과

  • Lite-Mono는 Monodepth2 대비 80% 적은 학습 가능한 파라미터를 사용함에도 불구하고 KITTI 데이터셋에서 절대 상대 오차(Abs Rel)가 0.107로 낮아 최신 기술 수준의 정확도를 확보한다.
  • RMSE는 4.561로 감소하고 δ1은 0.886으로 증가하여 어려운 깊이 추정 작업에서 뛰어난 정확도를 입증한다.
  • 제거 실험 결과 LGFI 블록을 제거할 경우 정확도가 크게 떨어지며, 이는 장거리 맥락을 포착하는 데서 LGFI의 핵심적 역할을 확인한다.
  • 최적화된 확장률 설정(1, 2, 3 → 2, 4, 6)을 가진 CDC 모듈이 매우 큰 확장률을 사용한 구성보다 우수한 성능을 보이며, 국소 특징 인식 능력이 떨어지는 것을 방지한다.
  • Jetson Xavier 플랫폼에서의 추론 결과는 Lite-Mono의 효율성을 확인하며, 엣지 배포에 적합한 속도와 정확도 간의 유리한 트레이드오프를 보여준다.
  • Make3D 데이터셋에서의 일반화 성능 검증을 통해 KITTI 벤치마크를 초월한 모델의 강건성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.