Skip to main content
QUICK REVIEW

[논문 리뷰] Rethinking Skip Connections in Encoder-decoder Networks for Monocular Depth Estimation

Zhitong Lai, Haichao Sun|arXiv (Cornell University)|2022. 08. 29.
Advanced Vision and Imaging인용 수 4
한 줄 요약

이 논문은 단일 렌즈 깊이 추정을 위한 풀 스킵 커넥션 네트워크(Full Skip Connection Network, FSCN)를 제안하며, 동일 해상도의 특징만이 아니라 모든 인코더 및 디코더 특징 수준을 연결하여 특징 전파를 향상시킵니다. 적응형 병합 모듈(Adaptive Concatenation Module, ACM)을 도입하여 학습 가능한 가중치와 채널 주의 메커니즘을 활용해 특징 융합을 향상시켰으며, KITTI 및 NYU Depth V2 데이터셋에서 최고 성능을 기록하여 더 낮은 오차와 높은 정확도 지표를 확보했습니다.

ABSTRACT

Skip connections are fundamental units in encoder-decoder networks, which are able to improve the feature propagtion of the neural networks. However, most methods with skip connections just connected features with the same resolution in the encoder and the decoder, which ignored the information loss in the encoder with the layers going deeper. To leverage the information loss of the features in shallower layers of the encoder, we propose a full skip connection network (FSCN) for monocular depth estimation task. In addition, to fuse features within skip connections more closely, we present an adaptive concatenation module (ACM). Further more, we conduct extensive experiments on the ourdoor and indoor datasets (i.e., the KITTI dataste and the NYU Depth V2 dataset) for FSCN and FSCN gets the state-of-the-art results.

연구 동기 및 목표

  • 동일 해상도 특징 융합을 넘어서 스킵 커넥션의 재고찰을 통해 깊이 있는 인코더-디코더 네트워크에서의 정보 손실 문제를 해결하기 위해.
  • 인코더와 디코더의 다중 수준 특징을 활용하여 단일 렌즈 깊이 추정의 특징 표현을 향상시키기 위해.
  • 표준 연결 방식보다 더 효과적인 특징 융합 메커니즘을 설계하기 위해.
  • 표준 단일 렌즈 깊이 추정 벤치마크(KITTI 및 NYU Depth V2)에서 최고 성능을 달성하기 위해.

제안 방법

  • 모든 공간 수준의 인코더와 디코더 간에 조밀한 스킵 커넥션을 구축하는 풀 스킵 커넥션 네트워크(Full Skip Connection Network, FSCN)를 제안하며, 동일 해상도의 특징만 연결하는 방식이 아님.
  • 채널별 가중치를 학습하고 Squeeze-Excitation(SE) 주의 메커니즘을 적용하여 특징 융합의 균형을 동적으로 조정하는 적응형 병합 모듈(Adaptive Concatenation Module, ACM)을 도입함.
  • 연결 이전에 서로 다른 수준의 특징을 적응적으로 스케일링하기 위해 학습 가능한 연결 가중치를 사용하여 융합 품질을 향상시킴.
  • 잔차 블록과 스킵 커넥션을 갖춘 유-넷 유사 인코더-디코더 아키텍처를 사용하여 깊이 예측을 수행함.
  • RGB-D 데이터셋에서 감독 손실 함수를 사용하여 네트워크를 엔드 투 엔드로 훈련하며, 깊이 범위 정규화를 적용함.
  • 표준 지표인 abs_rel, log10, rms, δ<1.25를 사용하여 KITTI 및 NYU Depth V2 데이터셋에서 방법을 검증함.

실험 결과

연구 질문

  • RQ1모든 인코더 및 디코더 특징 수준 간의 조밀한 스킵 커넥션은 정보 손실을 줄이고 깊이 추정 정확도를 향상시키는가?
  • RQ2학습 가능한 가중치와 주의 메커니즘을 통한 적응형 특징 융합은 스킵 커넥션에서 표준 연결 방식과 비교해 어떻게 성능을 높이는가?
  • RQ3제안된 FSCN 아키텍처는 기존의 표준 스킵 커넥션을 갖춘 인코더-디코더 네트워크보다 단일 렌즈 깊이 추정 벤치마크에서 슈퍼리어한 성능을 내는가?
  • RQ4적응형 병합 모듈에서 연결 가중치와 Squeeze-Excitation 모듈 간의 상대 기여도는 어떻게 되는가?

주요 결과

  • FSCN는 KITTI 데이터셋에서 최고 성능을 기록하여, 동일 스킵 커넥션 기반의 abs_rel을 0.112에서 0.111로 감소시키고 δ<1.25를 0.878에서 0.884로 향상시켰다.
  • NYU Depth V2 데이터셋에서는 abs_rel = 0.111, log10 = 0.047, δ<1.25 = 0.884를 기록하여 이전 방법들을 능가하는 최고의 성능을 달성했다.
  • 절단 실험 결과, 연결 가중치 또는 Squeeze-Excitation 모듈을 제거할 경우 성능이 크게 떨어지며, 이는 두 구성 요소의 중요성을 확인한다.
  • 두 구성 요소를 모두 포함한 ACM이 가장 우수한 성능을 내었으며, Squeeze-Excitation 모듈이 학습 가능한 가중치만 있는 경우보다 더 큰 기여를 했다.
  • 풀 스킵 커넥션 메커니즘은 표준 스킵 커넥션 대비 일관되게 성능 향상을 이끌었으며, 스킵 커넥션 없이도 놀라울 정도로 잘 작동하는 베이스라인 기반에서도 여전히 유의미한 개선 효과를 보였다.
  • 제안된 방법은 다양한 데이터셋에 대해 잘 일반화되어 있으며, 외부 환경(KITTI)과 실내 환경(NYU Depth V2) 벤치마크에서 모두 최고 성능을 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.