Skip to main content
QUICK REVIEW

[논문 리뷰] BridgeNet: A Joint Learning Network of Depth Map Super-Resolution and Monocular Depth Estimation

Qi Tang, Runmin Cong|arXiv (Cornell University)|2021. 07. 27.
Advanced Vision and Imaging참고 문헌 53인용 수 4
한 줄 요약

이 논문은 추가적인 지도 학습 없이 동시에 깊이 맵 초해상도 향상(DSR)과 단안 깊이 추정(MDE)을 수행하는 공동 학습 프레임워크인 BridgeNet을 제안한다. 고주파 주의 브리지(HABdg)와 콘텐츠 가이던스 브리지(CGBdg)라는 두 가지 전문화된 브리지 모듈을 도입함으로써, 작업 간에 고주파 및 구조적 정보를 효과적으로 전달함으로써 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, 특히 큰 스케일링 인자에서 뛰어난 성능을 보였다.

ABSTRACT

Depth map super-resolution is a task with high practical application requirements in the industry. Existing color-guided depth map super-resolution methods usually necessitate an extra branch to extract high-frequency detail information from RGB image to guide the low-resolution depth map reconstruction. However, because there are still some differences between the two modalities, direct information transmission in the feature dimension or edge map dimension cannot achieve satisfactory result, and may even trigger texture copying in areas where the structures of the RGB-D pair are inconsistent. Inspired by the multi-task learning, we propose a joint learning network of depth map super-resolution (DSR) and monocular depth estimation (MDE) without introducing additional supervision labels. For the interaction of two subnetworks, we adopt a differentiated guidance strategy and design two bridges correspondingly. One is the high-frequency attention bridge (HABdg) designed for the feature encoding process, which learns the high-frequency information of the MDE task to guide the DSR task. The other is the content guidance bridge (CGBdg) designed for the depth map reconstruction process, which provides the content guidance learned from DSR task for MDE task. The entire network architecture is highly portable and can provide a paradigm for associating the DSR and MDE tasks. Extensive experiments on benchmark datasets demonstrate that our method achieves competitive performance. Our code and models are available at https://rmcong.github.io/proj_BridgeNet.html.

연구 동기 및 목표

  • 색상 기반 깊이 초해상도 향상에서 발생하는 텍스처 복제 및 깊이 누출 문제를 해결하기 위해, RGB와 깊이 모odal 간의 차이로 인한 특징 전달이 저해되는 문제를 다루기 위해.
  • 추가적인 지도 학습 없이 단안 깊이 추정을 보조 작업으로 활용하여 깊이 맵 초해상도 향상 성능을 향상시키기 위해.
  • DSR와 MDE 네트워크 간 이중 방향 지식 전달을 가능하게 하는 이식 가능하고 다중 작업 학습 프레임워크를 설계하기 위해.
  • 기존 방법들이 직접적인 특징 또는 에지 맵 전달에 의존함으로써 모달 특화된 구조의 비일치를 유발하는 한계를 극복하기 위해.
  • 구조화되고 작업에 특화된 상호작용 모듈을 통해 깊이 초해상도 향상과 단안 깊이 추정 간의 새로운 공동 학습 패러다임을 수립하기 위해.

제안 방법

  • 프레임워크는 종단 간(end-to-end) 방식으로 깊이 맵 초해상도 네트워크(DSRNet)와 단안 깊이 추정 네트워크(MDENet)를 동시에 학습시킨다.
  • 고주파 주의 브리지(HABdg)는 MDENet 인코더에서 유도된 고주파 특징을 선택적으로 DSRNet 인코더로 전달하여 에지 및 텍스처 세부 정보 복구를 향상시킨다.
  • 콘텐츠 가이던스 브리지(CGBdg)는 DSRNet 디코더에서 유도된 콘텐츠 인식 특징을 MDENet 디코더로 제공하여 재구성된 깊이 컨텍스트를 통해 깊이 추정 정확도를 향상시킨다.
  • 모달 특화된 정보가 적절히 전달되도록 차별화된 가이던스 전략을 적용함으로써 RGB와 깊이 구조 간의 비일치를 방지한다.
  • 두 작업을 동시에 최적화하기 위해 L1 손실과 인지적 손실을 조합한 다중 작업 손실 함수를 사용한다.
  • 아키텍처는 매우 모듈식이며 이식 가능하여 다른 깊이 관련 작업에 쉽게 통합할 수 있다.

실험 결과

연구 질문

  • RQ1추가적인 지도 학습 없이 깊이 맵 초해상도 향상과 단안 깊이 추정 간의 공동 학습이 성능 향상에 기여할 수 있는가?
  • RQ2RGB 이미지의 고주파 세부 정보를 깊이 초해상도 향상으로 효과적으로 전달하면서 텍스처 복제를 방지할 수 있는가?
  • RQ3모달 특화된 구조 일관성을 유지하기 위해 교차 작업 특징 상호작용을 어떻게 설계할 수 있는가?
  • RQ4단안 깊이 추정을 보조 작업으로 사용할 경우, 특히 높은 스케일링 인자에서 깊이 맵 초해상도 향상 성능이 향상되는가?
  • RQ5제안된 HABdg와 CGBdg 구성 요소가 특징 연결 또는 에지 기반 가이던스에 비해 성능과 내성 면에서 어떻게 비교되는가?

주요 결과

  • BridgeNet은 ×8 및 ×16 스케일링 인자에서 Middlebury 2005 데이터셋에서 최고 성능을 기록하였으며, MAD가 0.343으로 모든 기준 모델을 초월하였다.
  • 제거 실험 결과, HABdg와 CGBdg 모두 필수적임을 확인하였다. 둘 중 하나를 제거하면 성능 저하가 발생했으며, HABdg는 고주파 세부 정보 복구에 크게 기여하였다.
  • HABdg는 단순한 특징 연결보다 MAD에서 0.033 향상(0.343 vs. 0.376)을 기록하여 선택적 주의 기반 특징 전달의 효과성을 입증하였다.
  • 시각적 비교 결과, 복잡한 텍스처 영역에서 DSRNet 단독 모델 대비 BridgeNet이 더 선명한 경계와 더 정확한 깊이 값을 생성하는 것으로 나타났다.
  • NYUv2 데이터셋에서도 경쟁 가능한 성능을 기록하여 다양한 실세계 환경에서의 일반화 능력을 확인하였다.
  • 공동 학습 프레임워크는 상호 보완적 향상을 가능하게 하였다: DSRNet은 MDE의 고주파 특징에서 유의미한 이점을 얻었고, MDENet는 DSRNet의 콘텐츠 인식 재구성에서 이점을 확보하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.