[논문 리뷰] Single Underwater Image Restoration by Contrastive Learning
이 논문은 대조적 학습과 생성적 적대적 네트워크를 활용하여 원시 및 복원된 수중 영상 패치 간 상호정보를 최대화하는 새로운 비지도 이미지-이미지 번역 방법인 대비 수중 복원(CWR)을 제안한다. 이는 새로운 대규모 실수중 영상 데이터셋(HICRD)에서 최신 기술 수준(SOTA)의 성능을 달성한다. CWR는 잡음 감소와 함께 영상의 구조 및 색상 충실도를 유지하는 데서도 기존 방법들을 능가한다.
Underwater image restoration attracts significant attention due to its importance in unveiling the underwater world. This paper elaborates on a novel method that achieves state-of-the-art results for underwater image restoration based on the unsupervised image-to-image translation framework. We design our method by leveraging from contrastive learning and generative adversarial networks to maximize mutual information between raw and restored images. Additionally, we release a large-scale real underwater image dataset to support both paired and unpaired training modules. Extensive experiments with comparisons to recent approaches further demonstrate the superiority of our proposed method.
연구 동기 및 목표
- 빛 흡수, 산산이 흩어짐, 파장에 따른 감쇠로 인한 수중 영상의 낮은 시각적 품질 문제를 해결하기 위해.
- 쌍화된 학습 데이터가 필요 없이도 실제 수중 영상을 복원할 수 있는 강력한 비지도 이미지-이미지 번역 프레임워크를 개발하기 위해.
- 모델의 일반화 능력을 향상시키기 위해 쌍화된 및 비쌍화된 학습 지원을 제공하는 대규모 고해상도 실수중 영상 데이터셋(HICRD)을 구축하기 위해.
- 원시 및 복원된 영상 패치 간의 상호정보를 최대화하여 콘텐츠 및 색상 대응 관계를 유지하기 위해.
- 대조적 학습과 GAN 기반 생성 모델링을 융합하여 수중 영상 복원에서 최신 기술 수준의 성능을 달성하기 위해.
제안 방법
- CWR는 ResNet 기반 생성자와 PatchGAN 판별자를 사용하여 수중 영상 복원을 이미지-이미지 번역 문제로 공식화한다.
- 모델은 원시 및 복원된 영상의 국소 패치 간 상호정보를 최대화하기 위해 PatchNCE 손실을 활용하는 대조적 학습 프레임워크를 채택한다.
- ResNet 인코더에서 추출한 특징을 처리하기 위해 이중층 MLP 프로젝션 헤드를 사용하여 대조적 표현 학습을 가능하게 한다.
- 실제성, 특징 대응 관계, 구조적 일致성을 보장하기 위해 생성적 적대적 손실(L_GAN), PatchNCE 대조 손실(L_PatchNCE), 정체성 손실(L_IDT)을 조합한 목적 함수를 사용한다.
- 총 손실는 다음과 같이 정의된다: L(G,D,H) = λ_GAN·L_GAN + λ_NCE·L_PatchNCE + λ_IDT·L_IDT, 여기서 λ_GAN = λ_NCE = λ_IDT = 1이다.
- 판별자에 대해 스펙트럼 정규화를, 생성자에 대해 인스턴스 정규화를 사용하며, Adam 옵timizer를 사용하고 초기 학습률을 0.0002로 선형 감소시키며 훈련한다.
실험 결과
연구 질문
- RQ1쌍화된 감독 없이도 대조적 학습이 원시 및 복원된 수중 영상 패치 간의 콘텐츠 및 색상 대응 관계를 효과적으로 포착할 수 있는가?
- RQ2기존의 이미지-이미지 번역 및 수중 복원 모델과 비교할 때 제안된 CWR 방법은 영상의 구조 및 색상 충실도를 얼마나 잘 유지하는가?
- RQ3대규모 실수중 영상 데이터셋(HICRD)이 수중 영상 복원 모델의 성능 및 일반화 능력을 어느 정도 향상시키는가?
- RQ4대조적 학습 기반 접근 방식이 기존의 및 학습 기반 수중 영상 향상 방법보다 정량적 및 정성적 지표에서 뛰어나게 성능을 내는가?
- RQ5대조적 학습을 GAN과 통합함으로써 더 현실적이며 잡음이 적은 수중 영상 복원이 가능해지는가?
주요 결과
- HICRD 테스트 세트에서 CWR는 모든 비교 방법 중에서 가장 낮은 MSE(127.23)와 가장 높은 PSNR(26.88)를 기록했다.
- CWR는 원시 및 복원된 영상 간의 구조적 보존 능력이 뛰어나 가장 높은 SSIM(0.834)을 기록했다.
- CWR는 FID(18.20)에서 두 번째로 높은 순위를 차지하여 생성된 영상의 높은 현실성과 UIQM(5.25)에서 강력한 성능을 보이며 인간의 시각 인지와의 일치성을 나타냈다.
- 정성적 결과에서는 CWR가 잡음이 최소화되고 색상 복원이 정확하며 더 선명하고 자연스러운 영상을 생성함으로써 기존의 전통적 및 학습 기반 기준보다 뛰어난 성능을 보였다.
- 1842×980 해상도에서 6,003장의 저품질, 3,673장의 양호한 품질, 2,000장의 복원된 영상이 포함된 HICRD 데이터셋은 쌍화된 및 비쌍화된 설정 모두에서 강력한 평가 및 훈련을 가능하게 한다.
- CWR는 모든 전반적 기준 및 비기준 지표에서 CUT, CycleGAN, UWCNN, Retinex, Fusion, DCP, IBLA 등의 최신 기술 수준 방법들을 크게 능가했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.