[논문 리뷰] Adaptive deep learning framework for robust unsupervised underwater image enhancement
이 논문은 조건부변량자기부(encoder) (cVAE)와 확률적 적응형 인스턴스 정규화(PAdaIN)를 사용한 새로운 비지도 수중 영상 향상 프레임워크인 UDnet을 제안한다. 또한 통계적으로 지도된 다중색상공간 스트레치 모듈을 포함한다. 이 모델은 지도 학습에 필요한 진짜 레이블 없이 참조 영상 분포에서 학습함으로써, 8개의 공개 데이터셋에서 최신 기술 수준(SOTA)의 성능을 달성하며, 쌍이 맞지 않는 설정에서도 뛰어난 일반화 능력을 보인다.
One of the main challenges in deep learning-based underwater image enhancement is the limited availability of high-quality training data. Underwater images are difficult to capture and are often of poor quality due to the distortion and loss of colour and contrast in water. This makes it difficult to train supervised deep learning models on large and diverse datasets, which can limit the model's performance. In this paper, we explore an alternative approach to supervised underwater image enhancement. Specifically, we propose a novel unsupervised underwater image enhancement framework that employs a conditional variational autoencoder (cVAE) to train a deep learning model with probabilistic adaptive instance normalization (PAdaIN) and statistically guided multi-colour space stretch that produces realistic underwater images. The resulting framework is composed of a U-Net as a feature extractor and a PAdaIN to encode the uncertainty, which we call UDnet. To improve the visual quality of the images generated by UDnet, we use a statistically guided multi-colour space stretch module that ensures visual consistency with the input image and provides an alternative to training using a ground truth image. The proposed model does not need manual human annotation and can learn with a limited amount of data and achieves state-of-the-art results on underwater images. We evaluated our proposed framework on eight publicly-available datasets. The results show that our proposed framework yields competitive performance compared to other state-of-the-art approaches in quantitative as well as qualitative metrics. Code available at https://github.com/alzayats/UDnet .
연구 동기 및 목표
- 감독 학습을 위한 고품질의 정규화된 수중 영상 데이터셋이 부족한 문제를 해결하기 위해.
- 지상 진짜 레이블이 필요 없는 비지도 딥 러닝 프레임워크를 개발하여 수중 영상 향상 기능을 향상시키기 위해.
- 참조 영상의 통계 모델링을 통해 수중 영상의 시각적 품질과 색상 일관성을 향상시키기 위해.
- 지상 진짜 레이블이 제공되지 않는 쌍이 맞지 않는 데이터셋에서도 강력한 일반화 능력을 확보하기 위해.
- 로봇 공학 및 환경 모니터링 애플리케이션에서 수중 영상 인식 능력을 향상시키기 위해.
제안 방법
- 프레임워크는 특징 추출을 위해 U-Net 기반의 인코더-디코더 아키텍처를 사용한다.
- 특징 공간 내 불확실성을 확률적 참조 영상 분포를 사용하여 PAdaIN(확률적 적응형 인스턴스 정규화)을 통해 인코딩한다.
- 강화 분포를 모델링하고 비지도 학습을 가능하게 하기 위해 조건부변량자기부(encoder) (cVAE)를 사용한다.
- 색상 채널 분포를 모델링하여 시각적 일관성과 색상 정확도를 확보하기 위해 통계적으로 지도된 다중색상공간 스트레치 모듈을 사용한다.
- 매 학습 단계에서 무작위로 선택된 참조 영상만을 활용하여 수동 레이블 없이 원시 수중 영상만으로 학습한다.
- 쌍이 맞는 실재 대 향상된 영상 쌍이 필요 없이, 전체 네트워크를 엔드 투 엔드 방식으로 완전히 학습할 수 있다.
실험 결과
연구 질문
- RQ1쌍이 맞는 진짜 데이터에 의존하지 않고도 딥 러닝 모델이 고성능의 수중 영상 향상 기능을 달성할 수 있는가?
- RQ2약한 지도 학습 설정에서 확률적 정규화를 사용하여 영상 향상의 불확실성을 효과적으로 모델링할 수 있는가?
- RQ3통계적으로 지도된 색상공간 스트레칭이 향상된 수중 영상의 시각적 일관성과 현실감을 얼마나 향상시킬 수 있는가?
- RQ4제안된 비지도 프레임워크는 지상 진짜 레이블이 제공되지 않는 쌍이 맞지 않는 데이터셋에 어떻게 일반화되는가?
- RQ5기존의 지도 학습 및 약한 지도 학습 방법보다 표준 수중 영상 향상 벤치마크에서 더 뛰어난 성능을 내는가?
주요 결과
- 제안된 UDnet 프레임워크는 8개의 공개 수중 영상 데이터셋에서 7개의 정량적 지표에서 최신 기술 수준(SOTA)의 성능을 달성한다.
- 지상 진짜 레이블이 제공되지 않는 쌍이 맞는 설정에서도 강력한 일반화 능력을 보이며, 기존의 10가지 방법보다 뛰어난 성능을 보인다.
- PAdaIN의 사용은 다양한 수중 영상 왜곡(예: 색조 이탈, 저대비)에 대한 적응형 불확실성 모델링을 가능하게 하여 강건성을 향상시킨다.
- 통계적으로 지도된 다중색상공간 스트레칭 모듈은 진짜 레이블이 없더라도 시각적 일관성을 효과적으로 유지하고 색상 정확도를 향상시킨다.
- 제한된 학습 데이터 조건에서도 경쟁 가능한 성능을 내어, 낮은 데이터 환경에서의 효과성을 확인한다.
- 제거 실험 결과, PAdaIN과 다중색상공간 스트레칭 모두 최종 향상 품질에 크게 기여하는 것으로 확인된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.