Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Fast and Accurate Real-World Depth Super-Resolution: Benchmark Dataset and Baseline

Lingzhi He, Hongguang Zhu|arXiv (Cornell University)|2021. 04. 13.
Advanced Vision and Imaging참고 문헌 40인용 수 7
한 줄 요약

이 논문은 스마트폰과 Lucid Helios에서 촬영한 실제 센서 대응 관계를 반영한, 처음으로 대규모 실세계 쌍체 저해상도 및 고해상도 깊이 맵 데이터셋인 RGB-D-D 벤치마크 데이터셋을 소개한다. 이는 RGB 이미지에서 고주파 지도 다중 척도 확장 특징을 사용하여 재구성 정확도와 효율성을 향상시키는 빠른 깊이 초해상도(FDSR) 기반 모델을 제안한다. 이 모델은 공개 및 실세계 깊이 맵 초해상도 작업에서 최고 성능을 기록하며, 경계 보존 능력은 뛰어나고 깊이 오차는 감소시킨다.

ABSTRACT

Depth maps obtained by commercial depth sensors are always in low-resolution, making it difficult to be used in various computer vision tasks. Thus, depth map super-resolution (SR) is a practical and valuable task, which upscales the depth map into high-resolution (HR) space. However, limited by the lack of real-world paired low-resolution (LR) and HR depth maps, most existing methods use downsampling to obtain paired training samples. To this end, we first construct a large-scale dataset named "RGB-D-D", which can greatly promote the study of depth map SR and even more depth-related real-world tasks. The "D-D" in our dataset represents the paired LR and HR depth maps captured from mobile phone and Lucid Helios respectively ranging from indoor scenes to challenging outdoor scenes. Besides, we provide a fast depth map super-resolution (FDSR) baseline, in which the high-frequency component adaptively decomposed from RGB image to guide the depth map SR. Extensive experiments on existing public datasets demonstrate the effectiveness and efficiency of our network compared with the state-of-the-art methods. Moreover, for the real-world LR depth maps, our algorithm can produce more accurate HR depth maps with clearer boundaries and to some extent correct the depth value errors.

연구 동기 및 목표

  • 실제 센서의 특성을 반영한 실제 쌍체 학습 데이터 부족으로 인한 실세계 깊이 맵 초해상도(SR)의 격차를 해소하기 위해.
  • 실세계 환경에서 세밀한 디테일과 경계를 잘 보존하는 빠르고 정확한 깊이 SR 모델을 개발하기 위해.
  • 실제 센서 특성을 반영하고 합성된 다운샘플링 데이터를 넘어서 일반화 능력을 향상시키는 벤치마크 데이터셋과 기반 모델을 제공하기 위해.
  • 기존의 다운샘플링 기반 방법과 비교하여 실제 쌍체 데이터로 학습하는 것이 실세계 저해상도 깊이 맵에서 성능 향상에 크게 기여함을 입증하기 위해.

제안 방법

  • 스마트폰과 Lucid Helios 센서에서 촬영한 실세계 저해상도(LR) 및 고해상도(HR) 깊이 맵 쌍 4,811개로 구성된 RGB-D-D 데이터셋을 구축하였다. 이는 실내 및 실외 환경을 포함한다.
  • RGB 이미지에서 고주파 성분을 추출하고 지도하는 고주파 레이어를 설계하여 깊이 맵 재구성 성능을 향상시키는 FDSR 기반 모델을 제안하였다.
  • 다양한 수용 영역을 고려한 맥락 정보를 캡처하기 위해 다중 척도 확장 컨볼루션 구조를 구현하였으며, 저주파 성분을 억제하여 파rameter 수를 줄였다.
  • 두 단계 학습 전략을 적용: 먼저 다운샘플링된 데이터로 초기화하고, 이후 실제 쌍체 LR/HR 깊이 맵으로 미세조정하여 실제 센서 노이즈 및 잡음을 모델링하였다.
  • 테스트 시 실제 입력 조건을 시뮬레이션하기 위해, 원시 저해상도 깊이 맵의 누락된 구멍을 색채우기 기법을 적용하였다.
  • 픽셀 수준 정확도와 구조적 충실도를 균형 있게 유지하기 위해 L1 손실과 인지적 손실을 조합한 손실 함수를 사용하였다.

실험 결과

연구 질문

  • RQ1합성된 다운샘플링 데이터와 비교하여 실세계 벤치마크 데이터셋이 실저해상도 깊이 맵 초해상도 모델의 성능 향상에 기여하는가?
  • RQ2RGB 이미지에서 유도된 고주파 지도가 깊이 맵 초해상도의 품질과 효율성에 어떤 영향을 미치는가?
  • RQ3실제 쌍체 저해상도 및 고해상도 깊이 맵으로 학습하는 것이 다운샘플링된 데이터로 학습하는 것보다 더 나은 일반화 능력과 정확도를 제공하는가?
  • RQ4제안된 FDSR 모델이 도전적인 실세계 환경에서 날카운 경계 보존과 깊이 값 오차 감소에 얼마나 효과적인가?
  • RQ5제안된 방법이 이동 및 임베디드 플랫폼에 적합한 고정밀도 및 고속 추론 속도를 동시에 달성할 수 있는가?

주요 결과

  • RGB-D-D 데이터셋에서 ×4 스케일링 시 FDSR 모델은 RMSE 1.11을 기록하여 기존 방법들을 능가하였으며, ×8 스케일링 시에도 1.11로 유지되고, ×16 스케일링 시 3.01로 향상되었다.
  • 실세계 저해상도 깊이 맵(구멍과 노이즈 존재)에서 FDSR은 ×4 스케일링 시 RMSE를 1.15로 감소시켰으며, 기존 기반 모델이 정확한 깊이 값을 복원하지 못한 것과 대비해 뚜렷한 성능 향상을 보였다.
  • 절단 실험 결과, 고주파 레이어(HFL)와 고주파 지도 블록(HFGB)이 모두 필수적임을 확인하였으며, HFL만 존재할 경우 RMSE가 0.07 감소하고, HFGB만 존재할 경우 0.03 감소함을 확인하였다.
  • 다운샘플링된 데이터로 학습하는 것과 비교해 실제 쌍체 데이터(RGB-D-D)로 학습함으로써 RMSE가 12.47% 감소하여, 실세계 성능 향상에 있어 현실적인 데이터의 중요성을 입증하였다.
  • 시각적 결과에서는 FDSR이 날카운 경계와 더 정확한 깊이 값을 생성함을 확인하였으며, 특히 어두운 조명 조건이나 누락된 영역이 있는 경우에도 뛰어난 성능을 보였다.
  • FDSR 모델은 표준 GPU에서 1장당 0.10초의 추론 속도를 기록하여 이동 및 임베디드 장치에서 실시간 응용에 적합함을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.