Skip to main content
QUICK REVIEW

[논문 리뷰] Hierarchical Regression Network for Spectral Reconstruction from RGB Images

Yuzhi Zhao, Lai-Man Po|arXiv (Cornell University)|2020. 05. 10.
Advanced Image Fusion Techniques참고 문헌 38인용 수 7
한 줄 요약

이 논문은 RGB 입력에서 고해상도 고스펙트럼 영상을 복원하기 위해 픽셀셰플 기반의 계층 간 연결, 잔차 밀집 블록(ResDB), 잔차 글로벌 블록(ResGB)을 갖춘 4단계 계층적 회귀 네트워크(HRNet)를 제안한다. 이 방법은 NTIRE 2020 고스펙트럼 영상 복원 경연 대회에서 트랙 2(실제 이미지)에서 우승하고 트랙 1(청결한 이미지)에서 3위를 기록하여 최신 기술 수준을 확립했다.

ABSTRACT

Capturing visual image with a hyperspectral camera has been successfully applied to many areas due to its narrow-band imaging technology. Hyperspectral reconstruction from RGB images denotes a reverse process of hyperspectral imaging by discovering an inverse response function. Current works mainly map RGB images directly to corresponding spectrum but do not consider context information explicitly. Moreover, the use of encoder-decoder pair in current algorithms leads to loss of information. To address these problems, we propose a 4-level Hierarchical Regression Network (HRNet) with PixelShuffle layer as inter-level interaction. Furthermore, we adopt a residual dense block to remove artifacts of real world RGB images and a residual global block to build attention mechanism for enlarging perceptive field. We evaluate proposed HRNet with other architectures and techniques by participating in NTIRE 2020 Challenge on Spectral Reconstruction from RGB Images. The HRNet is the winning method of track 2 - real world images and ranks 3rd on track 1 - clean images. Please visit the project web page https://github.com/zhaoyuzhi/Hierarchical-Regression-Network-for-Spectral-Reconstruction-from-RGB-Images to try our codes and pre-trained models.

연구 동기 및 목표

  • RGB 영상에서 고스펙트럼 복원의 불안정한 성질을 해결하기 위해 강건한 역함수 매핑을 학습하는 것.
  • 기존 인코더-디코더 네트워크에서 손실되는 공간적 세부 정보를 보존하기 위해 다운샘플링을 학습 가능한 픽셀셰플 연산으로 대체하는 것.
  • 잔차 밀집 블록을 통한 아티팩트 제거 및 잔차 글로벌 블록을 통한 장거리 맥락 모델링을 통해 특징 표현을 향상시키는 것.
  • 모델 추론 시 8세트의 앙상블 전략을 통해 일반화 능력과 강인성을 향상시키는 것.
  • 실제 이미지 및 청결한 이미지 벤치마크에서의 성능을 검증하여 고스펙트럼 복원 품질 측면에서 뛰어난 성능을 보여주는 것.

제안 방법

  • HRNet는 각 수준에서 다양한 스케일의 특징을 처리하기 위해 픽셀언셰플을 사용하여 공간 해상도를 유지하는 4단계 계층적 아키텍처를 채택한다.
  • 학습 가능한 픽셀셰플 및 픽셀언셰플 레이어를 통해 계층 간 특징 융합을 실현하여 공간 정보 손실 없이 정보 흐름을 보장한다.
  • 잔차 밀집 블록(ResDB)은 조밀한 수신 영역을 통해 특징을 융합하여 실제 RGB 영상에서의 노이즈와 아티팩트를 효과적으로 억제한다.
  • 잔차 글로벌 블록(ResGB)은 장거리 픽셀 상관관계를 모델링하고 수신 영역을 확장하여 고스펙트럼 복원 품질을 향상시킨다.
  • 과적합 방지를 위해 다양한 테스트 이미지에 대해 일반화 능력을 향상시키기 위해 추론 시 8세트의 앙상블 전략을 적용한다.
  • L1 손실과 시각적 손실의 조합을 사용하여 엔드 투 엔드로 네트워크를 훈련시키며, Adam 최적화 및 학습률 스케줄링을 적용한다.

실험 결과

연구 질문

  • RQ1학습 가능한 다운샘플링 및 업샘플링 연산을 갖춘 계층적 네트워크가 기존 오토에인코더 기반 아키텍처보다 고스펙트럼 복원 성능에서 뛰어나게 되는가?
  • RQ2잔차 밀집 및 글로벌 블록이 아티팩트 억제 및 장거리 의존성 모델링을 통해 복원 품질을 얼마나 향상시키는가?
  • RQ38세트의 앙상블 전략은 다양한 실제 및 청결한 이미지 분포에서 모델의 일반화 능력을 얼마나 효과적으로 향상시키는가?
  • RQ4제안된 HRNet는 더 작은 모델 크기로 압축되어도 높은 성능을 유지할 수 있는가?
  • RQ5표준 스트라이드 컨볼루션 대비 픽셀셰플을 학습 가능한 샘플링 연산자로 사용할 경우 정보 손실을 얼마나 효과적으로 줄일 수 있는가?

주요 결과

  • HRNet는 NTIRE 2020 경연 대회 트랙 2에서 앙상블 후 MRAE 0.039893을 기록하여 최고 성능을 달성했으며, 실생활 이미지 복원 트랙에서 우승했다.
  • 트랙 1(청결한 이미지)에서는 테스트 세트에서 MRAE 0.06201로 3위를 기록했으며, U-Net 및 U-ResNet 기준선을 초월했다.
  • 절단 실험 결과, ResDB 또는 ResGB를 제거할 경우 성능이 심각하게 저하되며, 둘 다 제거할 경우 MRAE가 0.042328에서 0.048033으로 증가함을 확인했다.
  • 모델를 원래 크기의 1/8(2.410 Mb)로 압축해도 MRAE가 0.048443으로 약간 증가할 뿐이므로 수용 가능한 품질을 유지한다.
  • 8세트의 앙상블 전략은 트랙 1에서 MRAE를 0.042328에서 0.039893으로 감소시켜 국소 최적화를 피하는 데 효과적임을 입증했다.
  • 픽셀셰플 및 픽셀언셰플의 사용은 계층 간 손실 없는 특징 전파를 가능하게 하여 공간적 및 스펙트럼적 세부 정보의 보존에 기여했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.