Skip to main content
QUICK REVIEW

[논문 리뷰] Prompt-In-Prompt Learning for Universal Image Restoration

Zilong Li, Yiming Lei|arXiv (Cornell University)|2023. 12. 08.
Image Enhancement Techniques인용 수 6
한 줄 요약

이 논문은 보편적인 이미지 복원을 위한 프롬프트-인-프롬프트(Prompt-in-Prompt, PIP) 학습을 제안하며, 고수준의 복원 불확실성 개념을 반영하는 복원 인식 프롬프트(고수준)와 기본 복원 프롬프트(저수준)를 프롬프트 간 상호작용 모듈을 통해 융합하는 이중 프롬프트 프레임워크를 도입한다. 선택적 프롬프트-특징 상호작용을 통해 특징 조절이 향상되어 경량이며 플러그 앤 플레이 모듈로, 노이즈 제거, 비 제거, 안개 제거, 블러 제거, 저조도 강화 등 다양한 작업에서 성능을 향상시키며, 더 높은 강인성, 해석 가능성, 효율성을 제공한다.

ABSTRACT

Image restoration, which aims to retrieve and enhance degraded images, is fundamental across a wide range of applications. While conventional deep learning approaches have notably improved the image quality across various tasks, they still suffer from (i) the high storage cost needed for various task-specific models and (ii) the lack of interactivity and flexibility, hindering their wider application. Drawing inspiration from the pronounced success of prompts in both linguistic and visual domains, we propose novel Prompt-In-Prompt learning for universal image restoration, named PIP. First, we present two novel prompts, a degradation-aware prompt to encode high-level degradation knowledge and a basic restoration prompt to provide essential low-level information. Second, we devise a novel prompt-to-prompt interaction module to fuse these two prompts into a universal restoration prompt. Third, we introduce a selective prompt-to-feature interaction module to modulate the degradation-related feature. By doing so, the resultant PIP works as a plug-and-play module to enhance existing restoration models for universal image restoration. Extensive experimental results demonstrate the superior performance of PIP on multiple restoration tasks, including image denoising, deraining, dehazing, deblurring, and low-light enhancement. Remarkably, PIP is interpretable, flexible, efficient, and easy-to-use, showing promising potential for real-world applications. The code is available at https://github.com/longzilicart/pip_universal.

연구 동기 및 목표

  • 이미지 복원을 위한 태스크 특화 딥 러닝 모델의 높은 저장 비용과 유연성 부족 문제를 해결하기 위해.
  • 재학습 없이도 다양한 복원 불확실성 유형(예: 노이즈, 비, 안개, 블러, 저조도)을 포괄하는 단일 모델이 일반화할 수 있도록 하기 위해.
  • 고수준의 복원 불확실성 개념과 저수준의 복원 특징을 명시적으로 모델링하여 모델의 해석 가능성과 제어 가능성을 향상시키기 위해.
  • 기존 복원 아키텍처에 구조적 변경 없이도 성능을 향상시킬 수 있는 경량이며 플러그 앤 플레이 모듈을 개발하기 위해.
  • 학습된 프롬프트를 사용해 태스크 특화 복원 성능을 위한 효과적이고 선택적인 특징 조절을 실현하기 위해.

제안 방법

  • 복원 불확실성 개념(예: '노이즈', '비')을 반영하는 고수준의 복원 인식 프롬프트와 저수준의 질감 및 세부 구조를 포착하는 기본 복원 프롬프트를 도입한다.
  • 복원 인식 프롬프트와 기본 복원 프롬프트를 통합하여 보편적인 복원 프롬프트로 만드는 프롬프트 간 상호작용(P2P) 모듈을 설계한다.
  • 유니버설 프롬프트를 기반으로 복원 불확실성 관련 특징을 동적으로 조절하는 선택적 프롬프트-특징 상호작용 모듈을 구현하여, 태스크 특화 특징 정렬을 향상시킨다.
  • 복원 인식 프롬프트 간 의미적 분리를 강제하기 위해 임계 각도 $\theta_{\text{thre}}$를 가진 대비 학습 손실 ($\mathcal{L}_{\text{ddl}}$)을 사용하여 프롬프트의 엉키는 것을 방지한다.
  • 프롬프트 분리도와 복원 정확도를 균형 있게 유지하기 위해 종합 손실 $\mathcal{L} = \alpha \mathcal{L}_{\text{ddl}} + (1-\alpha) \mathcal{L}_{\text{recon}}$ 을 사용해 프롬프트를 엔드 투 엔드로 훈련한다.
  • 기존 복원 모델(예: Restormer) 위에 PIP를 플러그 앤 플레이 모듈로 구현하여 브레인의 재학습 없이도 적용 가능하게 한다.

실험 결과

연구 질문

  • RQ1태스크 특화 미세조정 없이도 통합 프롬프트 프레임워크가 다양한 이미지 복원 작업에 효과적으로 일반화할 수 있는가?
  • RQ2고수준의 복원 불확실성 개념과 저수준의 복원 특징을 함께 모델링하면 복원 성능이 어떻게 향상되는가?
  • RQ3프롬프트 분리도가 다양한 복원 불확실성 유형 간 모델 일반화 및 강인성에 얼마나 기여하는가?
  • RQ4선택적 프롬프트-특징 상호작용 메커니즘이 특징 조절 및 복원 품질을 향상시키는가?
  • RQ5PIP의 플러그 앤 플레이 설계는 효율성, 해석 가능성, 기존 모델과의 호환성에 어떤 영향을 미치는가?

주요 결과

  • PIP는 노이즈 제거, 비 제거, 안개 제거, 블러 제거, 저조도 강화 등 다섯 가지 이미지 복원 작업에서 최신 기술 수준의 성능을 달성하며 기준 모델 대비 일관된 성능 향상을 보였다.
  • 절삭 실험 결과, 선택적 프롬프트-특징 상호작용 모듈이 복원 불확실성 관련 특징에 집중함으로써 성능 향상을 이끌어내며, 특히 프롬프트-인-프롬프트 학습과 결합했을 때 효과가 뚜렷했다.
  • 손실 $\mathcal{L}_{\text{ddl}}$ 에서 임계 각도 $\theta_{\text{thre}} = 90^\circ$ 로 설정할 경우 최고의 성능을 기록했으며, $\theta_{\text{thre}} = 0^\circ$ 대비 0.3 dB 향상되었고, 이는 분리된 프롬프트가 복원 성능 향상에 기여함을 시사한다.
  • t-SNE 시각화 결과, 유니버설 복원 프롬프트가 복원 불확실성 유형별로 잘 군집되어 있어 모델의 해석 가능성과 복수의 복원 불확실성 개념을 학습할 수 있음을 확인했다.
  • 사전 학습된 CLIP 텍스트 인코더를 사용해 복원 인식 프롬프트를 초기화하면 제약 없는 설정 대비 성능 향상을 보였지만, 제안된 $\theta_{\text{thre}} = 90^\circ$ 설정에는 미치지 못했다.
  • 플러그 앤 플레이 설계 덕분에 PIP는 Restormer과 같은 기존 모델을 최소한의 오버헤드로 향상시킬 수 있었으며, 높은 효율성과 광범위한 적용 가능성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.