[논문 리뷰] Simultaneous Enhancement and Super-Resolution of Underwater Imagery for Improved Visual Perception
이 논문은 잔차-잔차 네트워크를 사용하여 동시에 수중 영상 품질 향상과 최대 4× 해상도의 초해상도를 수행하는 통합 딥러닝 프레임워크인 Deep SESR을 제안한다. 다중 모odal 손실을 통해 시각적 품질 향상, 초해상도 및 주목도 예측을 공동으로 학습함으로써 수중 및 육상 영상에서 최신 기술 수준의 성능을 달성하며, NVIDIA AGX Xavier와 같은 단일 보드 플랫폼에서도 실시간 추론을 가능하게 한다.
In this paper, we introduce and tackle the simultaneous enhancement and super-resolution (SESR) problem for underwater robot vision and provide an efficient solution for near real-time applications. We present Deep SESR, a residual-in-residual network-based generative model that can learn to restore perceptual image qualities at 2x, 3x, or 4x higher spatial resolution. We supervise its training by formulating a multi-modal objective function that addresses the chrominance-specific underwater color degradation, lack of image sharpness, and loss in high-level feature representation. It is also supervised to learn salient foreground regions in the image, which in turn guides the network to learn global contrast enhancement. We design an end-to-end training pipeline to jointly learn the saliency prediction and SESR on a shared hierarchical feature space for fast inference. Moreover, we present UFO-120, the first dataset to facilitate large-scale SESR learning; it contains over 1500 training samples and a benchmark test set of 120 samples. By thorough experimental evaluation on the UFO-120 and other standard datasets, we demonstrate that Deep SESR outperforms the existing solutions for underwater image enhancement and super-resolution. We also validate its generalization performance on several test cases that include underwater images with diverse spectral and spatial degradation levels, and also terrestrial images with unseen natural objects. Lastly, we analyze its computational feasibility for single-board deployments and demonstrate its operational benefits for visually-guided underwater robots. The model and dataset information will be available at: https://github.com/xahidbuffon/Deep-SESR.
연구 동기 및 목표
- 저해상도 영상에서 발생하는 색상 왜곡, 흐림, 낮은 대비로 인한 수중 로봇의 시각적 인식 성능 저하 문제를 해결하기 위해.
- 근접 실시간 로봇 응용을 위한 계산 효율성이 높은 단일 프레임워크로 영상 향상과 초해상도를 통합하기 위해.
- 동시 향상 및 초해상도 모델의 훈련 및 벤치마킹을 지원하기 위해 대규모 및 주석이付け된 데이터셋(UFO-120)을 개발하기 위해.
- 최소한의 계산 오버헤드로 다양한 수중 및 육상 영상 조건에서 강력하고 일반화 가능한 성능을 달성하기 위해.
- 단일 보드 컴퓨터에서의 모델 배포 가능성을 입증하여 실시간, 시각 기반 수중 로봇 운영을 가능하게 하기 위해.
제안 방법
- Deep SESR는 공동 향상 및 초해상도를 위한 공유된 계층적 특징 학습을 위한 잔차-잔차 U-Net 아키텍처를 사용한다.
- 모델은 시각적 품질, 적대적, 구조적 손실을 조합한 다중 모달 손실 함수로 훈련되어 색상 열화, 선명도, 대비 및 고수준 특징 표현을 해결한다.
- 주목도 예측은 초해상도와 함께 공동으로 훈련되어 밀도 기울기 추정을 통한 주목도 기반 영역 선택(ROI)을 가능하게 한다.
- 특징 추출 백본으로 FENet-1d와 FENet-2d를 사용하며, FENet-2d는 병렬 3×3 및 5×5 필터를 사용하여 특징 표현을 향상시킨다.
- 종단 간 훈련 파이프라인을 통해 동일한 특징 공간에서 향상, 초해상도 및 주목도 예측의 공동 최적화를 가능하게 한다.
- 모델은 분리된 추론을 지원하며, NVIDIA AGX Xavier에서 주목도 및 향상 분기(10.02 FPS) 또는 전체 SESR(7.75 FPS)를 구현한다.
실험 결과
연구 질문
- RQ1단일 딥러닝 모델이 수중 시각 시스템에서 동시에 영상 향상 및 초해상도를 효과적으로 수행할 수 있는가?
- RQ2주목도 예측의 공동 학습이 시각적 품질 향상과 효율적인 ROI 기반 처리를 어떻게 향상시키는가?
- RQ3수중 및 육상 영상에서 PSNR, SSIM, UIQM 측정 기준으로 기존 최신 기술 수준의 방법에 비해 제안된 Deep SESR 모델의 성능 향상은 어느 정도인가?
- RQ4모델이 예측되지 않은 수중 환경과 자연적인 육상 장면으로의 일반화 능력은 어느 정도인가?
- RQ5이러한 모델을 임베디드 단일 보드 플랫폼에 배포하는 데 있어 계산 가능성은 어느 정도인가?
주요 결과
- Deep SESR는 UFO-120 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, 2×, 3×, 4× 초해상도에서 각각 PSNR 점수 26.14, 26.89, 21.05를 기록하여 이전 방법들을 능가한다.
- Set5에서 4× 초해상도에서 SSIM 0.925와 UIQM 0.855를 달성하여 뛰어난 시각적 품질과 색상 정확도를 입증한다.
- Sun80 데이터셋에서 2× 초해상도에서 SSIM 0.802와 PSNR 25.73을 기록하여 자연 이미지로의 강력한 일반화 능력을 보였다.
- NVIDIA AGX Xavier에서 7.75 FPS(129 ms/프레임)로 실행되며, 10 MB 메모리 프로필을 유지하여 임베디드 로봇 배포에 적합하다.
- 주목도 및 향상 분기를 분리하면 추론 속도가 10.02 FPS로 향상되어 추가 25 ms 내에 세부 분석을 위한 실시간 ROI 처리가 가능하다.
- 정성적 결과는 다양한 스펙트럼적 및 공간적 열화 조건에서도 색상, 대비, 선명도를 효과적으로 복원함을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.