[논문 리뷰] Iterative Prompt Learning for Unsupervised Backlit Image Enhancement
이 논문은 쌍이 없는 데이터 없이 대조적 언어-이미지 사전 훈련(Contrastive Language-Image Pre-Training, CLIP)을 반복적 프롬프트 학습을 통해 활용하는 새로운 비지도 백라이트 이미지 강화 방법인 CLIP-LIT을 제안한다. CLIP 잠재 공간에서 학습 가능한 프롬프트와 강화 네트워크를 동시에 최적화함으로써, 다양한 백라이트 환경에서 최신 기술 수준의 시각적 품질과 일반화 능력을 달성한다. 기존의 비지도 및 지도 학습 방법보다 뛰어난 성능을 발휘한다.
We propose a novel unsupervised backlit image enhancement method, abbreviated as CLIP-LIT, by exploring the potential of Contrastive Language-Image Pre-Training (CLIP) for pixel-level image enhancement. We show that the open-world CLIP prior not only aids in distinguishing between backlit and well-lit images, but also in perceiving heterogeneous regions with different luminance, facilitating the optimization of the enhancement network. Unlike high-level and image manipulation tasks, directly applying CLIP to enhancement tasks is non-trivial, owing to the difficulty in finding accurate prompts. To solve this issue, we devise a prompt learning framework that first learns an initial prompt pair by constraining the text-image similarity between the prompt (negative/positive sample) and the corresponding image (backlit image/well-lit image) in the CLIP latent space. Then, we train the enhancement network based on the text-image similarity between the enhanced result and the initial prompt pair. To further improve the accuracy of the initial prompt pair, we iteratively fine-tune the prompt learning framework to reduce the distribution gaps between the backlit images, enhanced results, and well-lit images via rank learning, boosting the enhancement performance. Our method alternates between updating the prompt learning framework and enhancement network until visually pleasing results are achieved. Extensive experiments demonstrate that our method outperforms state-of-the-art methods in terms of visual quality and generalization ability, without requiring any paired data.
연구 동기 및 목표
- 쌍이 없는 훈련 데이터가 존재하는 비지도 백라이트 이미지 강화 과제를 해결함으로써 일반화 능력이 제한되고 과강화/저강화 문제가 발생하는 문제를 해결하고자 한다.
- 복잡한 조명 조건에서 CLIP 기반 이미지 강화에 적합한 정적 프롬프트를 찾는 데 어려움이 존재하는 문제를 해결하고자 한다.
- 데이터 기반의 동적 프롬프트를 학습시켜 CLIP의 텍스트-이미지 임베딩 간의 정렬도를 향상시킴으로써 픽셀 수준의 강화 정확도를 향상시키고자 한다.
- 분포 갭을 줄이기 위해 순위 학습을 사용해 프롬프트와 강화 네트워크를 반복적으로 개선함으로써 강건성과 시각적 품질을 향상시키고자 한다.
- CLIP의 시각-언어 사전 지식이 분류나 생성을 넘어서 저수준 이미지 복원 작업에 효과적으로 적용될 수 있음을 입증하고자 한다.
제안 방법
- 메서드는 백라이트 이미지와 음성 프롬프트 사이의 CLIP 임베딩 거리와, 밝은 조명 이미지와 양성 프롬프트 사이의 거리를 최소화하여 프롬프트를 초기화한다.
- 강화 네트워크를 CLIP-Enhance 손실을 사용해 훈련하며, 이는 강화된 이미지와 양성 프롬프트 간의 유사도를 최대화하고 음성 프롬프트와의 유사도를 최소화하도록 한다.
- 반복적인 개선 루프는 백라이트 이미지, 강화된 결과, 밝은 조명 이미지 간의 분포 갭을 줄이기 위해 순위 기반 손실 함수를 사용해 프롬프트 임베딩을 정교화하고 강화 네트워크를 업데이트하는 방식으로 번갈아 수행한다.
- 프롬프트 학습 프레임워크는 순위 학습을 통해 업데이트되며, 이는 강화된 결과가 음성 프롬프트보다 양성 프롬프트와 더 유사하고, 밝은 조명 이미지와도 더 유사하도록 보장한다.
- 시각적으로 매력적인 결과가 도출될 때까지 프롬프트 개선과 강화 네트워크 훈련을 번갈아 수행하며, 지도 학습에 대한 지식 기반의 지도 없이도 가능하다.
- 강화를 이끄는 데 대비 학습 목표를 CLIP 임베딩 공간에서 사용하며, 적대적 훈련을 더 해석 가능하고 밝기 민감도가 높은 손실로 대체한다.

실험 결과
연구 질문
- RQ1CLIP의 시각-언어 사전 지식은 비지도 픽셀 수준의 이미지 강화에 효과적으로 활용될 수 있는가, 특히 백라이트 이미지에 대해 말이다?
- RQ2학습 가능한 프롬프트는 복잡한 조명 조건에서 고정된 텍스트 프롬프트보다 CLIP 기반 이미지 분류의 강건성과 정확도를 어떻게 향상시킬 수 있는가?
- RQ3반복적 프롬프트 개선은 고정 프롬프트나 적대적 훈련 기반 접근 방식을 초월해 백라이트 이미지 강화의 일반화 능력과 시각적 품질을 향상시킬 수 있는가?
- RQ4기준으로 사용하는 밝은 조명 이미지의 선택이 강화 네트워크 성능에 어느 정도의 영향을 미치는가?
- RQ5CLIP 기반 손실이 저수준 이미지 복원 작업에서 적대적 손실을 능가할 수 있는가?
주요 결과
- 제안된 방법은 BAID 테스트 세트에서 PSNR 21.579와 SSIM 0.883을 기록하며 최신 기술 수준의 방법들을 크게 앞서간다.
- 고정 프롬프트(백라이트/밝은 조명)를 사용하는 것보다 학습된 프롬프트를 사용할 경우 PSNR가 6.831 향상되고 SSIM이 0.060 향상된다.
- 순위 학습 손실(식 7과 8)을 제거할 경우 PSNR는 20.884로 감소하고 SSIM은 0.865로 떨어지며, 이는 이 손실 항목이 성능에 결정적인 역할을 한다는 것을 입증한다.
- 메서드는 MUSIQ 점수 55.682를 기록하여 강력한 지각적 품질을 보이며, 적대적 손실 기반 훈련(MUSIQ: 52.416)을 능가한다.
- 사용자 연구 결과, 참가자 60% 이상이 모든 기준 방법보다 본 메서드의 결과를 선호함으로써 뛰어난 시각적 품질을 확인할 수 있었다.
- 이 방법은 얼굴, 풍경, 동물, 건축, 야경 등 다양한 장면에서 특별한 장면별 튜닝 없이도 잘 일반화된다.
![Figure 3: Visual comparison between our method and the state-of-the-art light enhancement methods, including exposure correction method (Afifi et al. [ 1 ] ), backlit enhancement method (ExCNet [ 32 ] ), low-light image enhancement methods (SCI [ 21 ] , Zero-DCE [ 9 ] , SNR-aware [ 29 ] , EnlightenG](https://ar5iv.labs.arxiv.org/html/2303.17569/assets/x3.png)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.