Skip to main content
QUICK REVIEW

[논문 리뷰] Joint convolutional neural pyramid for depth map super-resolution

Yi Xiao, Xiang Cao|arXiv (Cornell University)|2018. 01. 03.
Advanced Vision and Imaging참고 문헌 2인용 수 7
한 줄 요약

이 논문은 두 개의 컨volution 신경망 피라미드를 융합 CNN로 연결하여 넓은 수신장(field)을 활용함으로써 깊이 맵 초해상도 향상 성능을 향상시키는 공동 컨volution 신경 피라미드(Joint Convolutional Neural Pyramid, JCNP) 모델을 제안한다. 이 방법은 RGB/깊이, 색상/주의 유도, 색상 스케치/이미지 쌍 등 다양한 케이스에서 최신 기술(SOTA)을 초월하여 더 낮은 RMSE와 더 선명한 결과를 내며 잡음 요소를 줄였다. 이는 지도 이미지로부터 구조적 세부 정보를 효과적으로 전달함으로써 달성된다.

ABSTRACT

High-resolution depth map can be inferred from a low-resolution one with the guidance of an additional high-resolution texture map of the same scene. Recently, deep neural networks with large receptive fields are shown to benefit applications such as image completion. Our insight is that super resolution is similar to image completion, where only parts of the depth values are precisely known. In this paper, we present a joint convolutional neural pyramid model with large receptive fields for joint depth map super-resolution. Our model consists of three sub-networks, two convolutional neural pyramids concatenated by a normal convolutional neural network. The convolutional neural pyramids extract information from large receptive fields of the depth map and guidance map, while the convolutional neural network effectively transfers useful structures of the guidance image to the depth image. Experimental results show that our model outperforms existing state-of-the-art algorithms not only on data pairs of RGB/depth images, but also on other data pairs like color/saliency and color-scribbles/colorized images.

연구 동기 및 목표

  • 고해상도 무늬 또는 지도 이미지의 특징을 활용하여 깊이 맵 초해상도 향상 성능을 향상시키기 위해.
  • 기존 방법들이 제한된 수신장으로 인해 세부 정보를 과도하게 부드럽게 만들거나 잡음 요소를 유발하는 문제를 해결하기 위해.
  • 더 나은 복원 성능을 위해 장거리 맥락 정보를 효율적으로 캡처할 수 있는 딥러닝 아키텍처를 개발하기 위해.
  • 깊이 맵을 넘어서 색상성 및 주의 맵과 같은 다른 이미지 초해상도 작업으로의 적용 가능성을 확장하기 위해.

제안 방법

  • 모델은 저해상도 깊이 맵과 고해상도 지도 이미지에서 다중 척도 특징을 추출하기 위해 두 개의 별도된 컨volution 신경 피라미드(CNPs)를 사용한다.
  • 각 CNI는 계층적 수준을 통해 점진적으로 수신장을 확장하면서도 계산 비용을 증가시키지 않는다.
  • 중앙에 위치한 컨볼루션 신경망(CNN)은 두 피라미드의 특징을 융합하여 고해상도 깊이 맵을 재구성한다.
  • 피라미드 수준을 통해 확장된 컨볼루션을 중첩함으로써 넓은 효과적 수신장을 달성하고 맥락 모델링 능력을 향상시킨다.
  • 예측된 고해상도 깊이 맵과 진짜 고해상도 깊이 맵 간의 재구성 오차를 최소화하기 위해 픽셀 단위의 손실 함수를 사용해 엔드 투 엔드로 학습된다.
  • 이 프레임워크는 동일한 네트워크 아키텍처를 사용하여 다른 입력 쌍을 활용함으로써 색상성 및 주의 맵 향상과 같은 다른 초해상도 작업으로도 이식 가능하다.

실험 결과

연구 질문

  • RQ1넓은 수신장을 가진 딥 네트워크가 현재 최신 기술(SOTA)을 초월하여 깊이 맵 초해상도 향상에 기여할 수 있는가?
  • RQ2고해상도 지도 이미지에서 유도된 구조적 세부 정보가 고해상도 깊이 맵 재구성에 얼마나 효과적으로 전달될 수 있는가?
  • RQ3제안된 공동 컨볼루션 신경 피라미드 아키텍처가 깊이 맵을 넘어서 다른 이미지 초해상도 작업으로 일반화 가능한가?
  • RQ4넓은 수신장이 초해상도 결과에서 과도하게 매끄럽게 만드는 현상이나 기울기 반전과 같은 잡음 요소에 어떤 영향을 미치는가?

주요 결과

  • JCNP 모델은 Middlebury, Lu, NYUv2 데이터셋에서 가장 낮은 RMSE를 기록했으며, 특히 8× 및 16× 확대에서 뛰어난 성능을 보였다.
  • Middlebury 데이터셋에서 모델은 2× 확대 시 RMSE 1.16, 4× 시 1.79, 8× 시 3.22, 16× 시 5.54를 기록했으며, 모든 기준 모델을 압도했다.
  • 색상성 맵 초해상도 향상에서는 2× 확대 시 RMSE 6.73, 4× 시 13.41을 기록했으며, Bicubic 및 다른 SOTA 방법보다 유의미하게 낮았다.
  • 주의 맵 초해상도 향상에서는 2× 확대 시 RMSE 11.19, 4× 시 15.46를 기록했으며, 높은 가장자리 유지 능력과 낮은 색상 번짐 현상을 보였다.
  • 시각적 비교 결과 JCNP는 He [3], Li [6], Kopf [2]와 비교해 더 선명한 가장자리와 더 적은 잡음 요소를 생성했으며, 특히 무늬가 풍부하고 경계가 뚜렷한 영역에서 뛰어난 성능을 보였다.
  • 모델은 비깊이 작업으로의 일반화 능력이 뛰어나, 색상 스케치 및 색상화된 이미지 초해상도 향상 작업에서도 최소한의 아키텍처 수정으로도 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.