Skip to main content
QUICK REVIEW

[논문 리뷰] Spherical Space Feature Decomposition for Guided Depth Map Super-Resolution

Zixiang Zhao, Jiangshe Zhang|arXiv (Cornell University)|2023. 03. 15.
Advanced Vision and Imaging인용 수 4
한 줄 요약

이 논문은 지도형 깊이 맵 초해상도 분석을 위한 새로운 구면 공간 특징 분해 네트워크인 SSDNet을 제안한다. 이는 Restormer 기반 인코더를 활용해 다중 모odal 특징을 추출하고, 이를 구면 공간으로 매핑하여 도메인 공유 및 도메인 전용 특징을 효과적으로 분리하며, 흐린 가장자리, 노이즈가 많은 표면 및 과도하게 이관된 RGB 텍스처와 같은 문제를 해결하기 위해 구면 대비 정밀화 모듈을 도입한다. 제안된 방법은 파rameter 수가 적고 실제 환경에서 뛰어난 일반화 성능을 보이며 최첨단 성능을 달성한다.

ABSTRACT

Guided depth map super-resolution (GDSR), as a hot topic in multi-modal image processing, aims to upsample low-resolution (LR) depth maps with additional information involved in high-resolution (HR) RGB images from the same scene. The critical step of this task is to effectively extract domain-shared and domain-private RGB/depth features. In addition, three detailed issues, namely blurry edges, noisy surfaces, and over-transferred RGB texture, need to be addressed. In this paper, we propose the Spherical Space feature Decomposition Network (SSDNet) to solve the above issues. To better model cross-modality features, Restormer block-based RGB/depth encoders are employed for extracting local-global features. Then, the extracted features are mapped to the spherical space to complete the separation of private features and the alignment of shared features. Shared features of RGB are fused with the depth features to complete the GDSR task. Subsequently, a spherical contrast refinement (SCR) module is proposed to further address the detail issues. Patches that are classified according to imperfect categories are input into the SCR module, where the patch features are pulled closer to the ground truth and pushed away from the corresponding imperfect samples in the spherical feature space via contrastive learning. Extensive experiments demonstrate that our method can achieve state-of-the-art results on four test datasets, as well as successfully generalize to real-world scenes. The code is available at \url{https://github.com/Zhaozixiang1228/GDSR-SSDNet}.

연구 동기 및 목표

  • 지도형 깊이 맵 초해상도 분석에서 RGB 및 깊이 모달리티 간의 도메인 공유 및 도메인 전용 특징을 효과적으로 추출하고 구분하는 문제를 해결하기 위해.
  • 깊이 맵 초해상도 분석에서 발생하는 세 가지 핵심 세부 문제인 흐린 가장자리, 노이즈가 많은 표면, 과도하게 이관된 RGB 텍스처를 완화하기 위해.
  • 유클리드 거리의 척도 민감도 제약을 피하기 위해, 구면 특징 공간을 활용하여 다중 모달 특징의 정렬 및 분리 성능을 향상시키기 위해.
  • 세분화된 트레이닝 없이도 합성 및 실제 환경 깊이 맵 데이터셋 모두에서 우수한 성능을 보이는 경량화되고 일반화 능력이 뛰어난 모델을 개발하기 위해.

제안 방법

  • 저해상도 깊이 맵과 고해상도 RGB 이미지에서 국소적 및 전역적 특징을 추출하기 위해 Restormer 블록을 인코더로 활용한다.
  • 추출된 특징들은 구면 공간으로 매핑되어 도메인 전용 특징의 강건한 분離와 도메인 공유 특징의 정렬을 가능하게 한다.
  • 구면 대비 정밀화(SCR) 모듈은 대비 학습을 통해 구면 공간에서 패치 특징을 참값에 가깝게 끌어오고, 불완전한 샘플에서 멀리 떼어내는 데 사용된다.
  • 픽셀 단위 재구성 손실, 특징 분리 손실, 그리고 구면 공간 내 정렬 손실을 포함한 다중 손실 학습 목표를 사용한다.
  • 정련된 특징에서 고해상도 깊이 맵을 재구성하기 위해 디코더 또한 Restormer 블록 기반으로 구성된다.
  • 전체 프레임워크는 끝에서 끝까지 엔드 투 엔드로 학습되며, 깊이 불연속성 유지와 텍스처 아티팩트 감소에 중점을 둔다.

실험 결과

연구 질문

  • RQ1구면 공간 특징 분해가 지도형 초해상도 분석에서 RGB와 깊이 특징 간의 다중 모달 상관관계 모델링에 어떻게 기여하는가?
  • RQ2구면 대비 학습이 깊이 맵 재구성에서 흔히 발생하는 아티팩트, 예를 들어 흐린 가장자리와 과도하게 이관된 RGB 텍스처를 얼마나 효과적으로 줄일 수 있는가?
  • RQ3구면 공간에서 도메인 공유 및 도메인 전용 특징을 분리함으로써, 유클리드 기반 방법에 비해 실제 깊이 맵 데이터에 대해 더 나은 일반화 성능을 달성하는가?
  • RQ4다양한 데이터셋과 초해상도 인자에서 기존 최첨단 기법에 비해 제안된 방법이 정량적 지표와 주관적 품질 측면에서 얼마나 뛰어나게 성능을 발휘하는가?

주요 결과

  • SSDNet은 ×4, ×8, ×16의 스케일링 인자에서 RGBDD, Middlebury 등 네 가지 벤치마크 데이터셋에서 최첨단 성능을 달성하였으며, PSNR 및 SSIM 측면에서 뚜렷한 향상을 보였다.
  • 세분화된 트레이닝 없이도 실제 환경의 장면에서 뛰어난 일반화 성능을 보였으며, RGBDD 데이터셋의 실제 환경 분류에서 RMSE 측면에서 이전 방법들을 능가했다.
  • 제거 실험 결과, 구면 특징 분해와 SCR 모듈이 성능 향상에 핵심적인 역할을 하며, 이들 중 하나라도 제거될 경우 성능 저하가 발생하는 것으로 확인되었다.
  • 경쟁 기법들보다 파rameter 수가 적은 경량 아키텍처를 유지하여 계산 효율성을 확보하였으며, 실시간 배포 가능성까지 보여주었다.
  • 구면 공간 거리 측정 방식이 특징 분리 및 정렬에서 ℓ₂ 거리보다 뛰어난 성능을 보이며, 이는 다중 모달 특징 학습에 적합함을 입증한다.
  • 시각적 비교 결과, SSDNet은 더 선명한 가장자리와 더 깔끔한 표면, 감소된 텍스처 아티팩트를 보이며 핵심 세부 문제 해결에 효과적임을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.