Skip to main content
QUICK REVIEW

[논문 리뷰] Multimodal Sensor Fusion In Single Thermal image Super-Resolution

Feras Almasri, Olivier Debeir|arXiv (Cornell University)|2018. 12. 21.
Advanced Image Processing Techniques참고 문헌 19인용 수 8
한 줄 요약

이 논문은 심층 신경망을 활용한 단일 열화상 초해상도 프레임워크를 제안하며, 시각적(RGB) 고해상도 이미지와 저해상도 열화상 이미지를 잔차 신경망을 통해 융합하고, 지각적 및 적대적 손실을 적용한다. 이 방법은 시각적 품질 향상과 고주파 수치 복원에 뚜렷한 개선을 이룩하여 새로운 기준 데이터셋에서 기존 최고 수준의 모델들을 능가한다.

ABSTRACT

With the fast growth in the visual surveillance and security sectors, thermal infrared images have become increasingly necessary ina large variety of industrial applications. This is true even though IR sensors are still more expensive than their RGB counterpart having the same resolution. In this paper, we propose a deep learning solution to enhance the thermal image resolution. The following results are given:(I) Introduction of a multimodal, visual-thermal fusion model that ad-dresses thermal image super-resolution, via integrating high-frequency information from the visual image. (II) Investigation of different net-work architecture schemes in the literature, their up-sampling methods,learning procedures, and their optimization functions by showing their beneficial contribution to the super-resolution problem. (III) A bench-mark ULB17-VT dataset that contains thermal images and their visual images counterpart is presented. (IV) Presentation of a qualitative evaluation of a large test set with 58 samples and 22 raters which shows that our proposed model performs better against state-of-the-arts.

연구 동기 및 목표

  • 고해상도 열화상 센서가 비용이 많이 들기 때문에 감시 및 산업 응용 분야에서 저해상도 열화상 촬영 문제를 해결한다.
  • 기존 초해상도 방법들이 MSE 손실 함수 의존성으로 인해 고주파 수치 복원에 실패하는 한계를 극복한다.
  • 다중모달 센서 융합을 통해 고해상도 시각적 이미지를 활용하여 저해상도 열화상 이미지의 고주파 콘텐츠 결손을 보완한다.
  • 초해상도 방법 평가 및 비교를 지원하기 위해 새로운 기준 데이터셋(ULB17-VT)을 구축한다.
  • PSNR/SSIM과 같은 기존 지표를 넘어서 인간의 시각적 인지 방식을 반영하여 시각적 품질을 향상시킨다.

제안 방법

  • 저해상도 열화상 및 고해상도 시각적 이미지를 입력으로 사용하는 다중모달 융합 프레임워크를 제안하며, 심층 잔차 신경망을 활용해 초해상도를 수행한다.
  • 내용 손실(MSE)과 적대적 손실을 조합하여 저주파 수치 콘텐츠 유지 및 고주파 세부 정보 향상에 기여한다.
  • 사전 학습된 VGG 네트워크에서 유도된 지각적 손실을 통합하여 구조 유사성과 시각적 정확도를 향상시킨다.
  • 학습 안정성 향상과 특징 표현 향상을 위해 잔차 학습 방식을 구현한다.
  • 시각적 및 열화상 특징를 효과적으로 융합하기 위해 공유 및 모odal 전용 컨볼루션 계층을 갖춘 이중 브랜치 아키텍처를 설계한다.
  • 22명의 평가자와 58개의 테스트 샘플을 대상으로 대규모 정성 평가를 수행하며, 실제 값과의 시각적 유사도 기반으로 모델 출력을 투표 시스템을 통해 순위 매긴다.

실험 결과

연구 질문

  • RQ1고해상도 시각적 이미지를 저해상도 열화상 이미지의 초해상도 향상에 효과적으로 활용할 수 있는가?
  • RQ2시각적 및 열화상 데이터의 다중모달 융합은 단일 모달 접근 방식에 비해 고주파 세부 정보 복원에 얼마나 기여하는가?
  • RQ3지각적 손실 및 적대적 손실은 기존의 PSNR/SSIM 지표를 넘어서 시각적 품질 향상에 얼마나 기여하는가?
  • RQ4제안된 모델은 인간의 시각적 인지와 목적적 지표 측면에서 기존 최고 수준의 방법들과 비교해 어떤가?
  • RQ5다양한 네트워크 아키텍처와 손실 함수는 열화상 초해상도 성능에 어떤 영향을 미치는가?

주요 결과

  • 제안된 VTSRCNN 및 VTSRGAN 모델은 ULB17-VT 기준 데이터셋에서 각각 PSNR 51.727 dB, SSIM 0.9434를 기록하여 모든 최고 수준의 기존 방법들을 능가한다.
  • 22명의 평가자와 58개의 테스트 이미지를 대상으로 한 정성 평가에서 VTSRCNN은 총 투표의 39%를 확보했고, VTSRGAN은 17%를 확보하여 융합 모델에 대한 인간의 선호도가 높음을 시사한다.
  • 그림 8의 색상별 투표 흐름도는 다중모달 융합 모델이 단일 모달 또는 융합되지 않은 모델보다 일관되게 높은 순위를 차지하고 있음을 확인한다.
  • 적대적 손실 및 지각적 손실의 사용은 MSE 기반 기준 모델 대비 블러 감소와 질감 세부 정보 향상으로 인해 시각적 품질을 크게 향상시킨다.
  • ULB17-VT 기준 데이터셋은 쌍체의 시각적 및 열화상 이미지를 포함하는 표준화된 데이터셋을 제공하여 향후 방법의 신뢰성 있는 평가 및 비교를 가능하게 한다.
  • 센서의 비정렬 또는 물체 이동으로 인한 재구성 이미지의 아티팩트가 관찰되어 실제 구현 시 더 나은 동기화 필요성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.