[논문 리뷰] SeeSR: Towards Semantics-Aware Real-World Image Super-Resolution
SeeSR는 사전 훈련된 텍스트-이미지 확산 모델을 향상시키기 위해 미세조정된 프롬프트 추출기를 통해 복잡한 열화에 민감한 소프트 및 하드 의미 프롬프트를 생성하는 의미 인식 기반 실세계 이미지 초해상도 복원 방법을 제안한다. 저해상도 이미지와 함께 이러한 프롬프트를 통합하고, 저해상도 특징을 초기 노이즈에 통합함으로써 SeeSR는 더 선명하고 의미적으로 정확한 결과를 생성하며 잡음 요소를 줄여 기존의 확산 기반 방법보다 감각적 품질과 의미 충실도에서 뛰어난 성능을 발휘한다.
Owe to the powerful generative priors, the pre-trained text-to-image (T2I) diffusion models have become increasingly popular in solving the real-world image super-resolution problem. However, as a consequence of the heavy quality degradation of input low-resolution (LR) images, the destruction of local structures can lead to ambiguous image semantics. As a result, the content of reproduced high-resolution image may have semantic errors, deteriorating the super-resolution performance. To address this issue, we present a semantics-aware approach to better preserve the semantic fidelity of generative real-world image super-resolution. First, we train a degradation-aware prompt extractor, which can generate accurate soft and hard semantic prompts even under strong degradation. The hard semantic prompts refer to the image tags, aiming to enhance the local perception ability of the T2I model, while the soft semantic prompts compensate for the hard ones to provide additional representation information. These semantic prompts encourage the T2I model to generate detailed and semantically accurate results. Furthermore, during the inference process, we integrate the LR images into the initial sampling noise to mitigate the diffusion model's tendency to generate excessive random details. The experiments show that our method can reproduce more realistic image details and hold better the semantics. The source code of our method can be found at https://github.com/cswry/SeeSR.
연구 동기 및 목표
- 심각한 열화와 모호한 局부 구조로 인해 발생하는 실세계 이미지 초해상도 복원에서의 의미적 정확도 결여 문제를 해결하기 위해.
- 사전 훈련된 텍스트-이미지 확산 모델에서 유도된 의미 사전 지식을 활용하여 생성된 고해상도 이미지의 충실도와 현실감을 향상시키기 위해.
- 단지 저해상도 이미지나 일반적인 의미 프롬프트에 의존하는 기존 방법의 한계를 극복하기 위해, 강한 열화 조건에서도 성능이 떨어지지 않도록 하기 위해.
- 복잡한 실세계 이미지 열화에 대해 강건하고 의미적 내용을 유지하는 프롬프트 추출 기반 메커니즘을 개발하기 위해.
제안 방법
- 열화에 민감한 프롬프트 추출기(DAPE)를 미세조정하여 저해상도 이미지에서 하드 의미 프롬프트(이미지 태그)와 소프트 의미 프롬프트(표현 임베딩)를 모두 생성한다.
- 하드 프롬프트는 개체 수준의 의미적 가이던스를 제공함으로써 국소적 인식을 향상시키고, 소프트 프롬프트는 특징 이해를 향상시키기 위한 보완적 표현 정보를 제공한다.
- 저해상도 특징을 확산 샘플링 과정의 초기 노이즈에 통합하여 매끄러운 영역에서 잡음 생성을 줄인다.
- 이중 단계 프레임워크를 사용한다: 첫 번째 단계에서는 데이터 증강을 통해 열화에 강인한 의미를 학습하기 위해 열화된 데이터에서 DAPE를 훈련한다; 두 번째 단계에서는 추론 시 두 가지 유형의 프롬프트를 모두 사용한다.
- 저해상도 이미지와 의미 프롬프트를 조합하는 제어 신호 메커니즘을 사용하여 T2I 확산 모델이 감각적으로 현실적이면서도 의미적으로 정확한 출력을 유도한다.
- 훈련과 추론 간의 분포 일치를 위해 확산 과정의 시작 단계에서 저해상도 잠재 표현을 통합하는 새로운 LRE(LR-embedded) 전략을 도입한다.
![Figure 1 : The comparison of different styles of prompts and their corresponding Real-ISR results with PASD [ 59 ] . (a) Input LR image. (b)-(d) show the extracted classification-style, caption-style and tag-style prompts from LR image and the corresponding Real-ISR results. (e) Null prompt and its](https://ar5iv.labs.arxiv.org/html/2311.16518/assets/x1.png)
실험 결과
연구 질문
- RQ1심각하게 열화된 저해상도 이미지에서 의미 프롬프트를 효과적으로 추출하여 초해상도 복원 시 이미지 의미를 유지할 수 있는가?
- RQ2하드 프롬프트(태그)와 소프트 프롬프트(임베딩 특징)는 생성된 고해상도 이미지의 의미 정확도와 시각적 품질 향상에 어떤 역할을 하는가?
- RQ3실세계 초해상도 복원에서 열화에 민감한 프롬프트 추출 방식은 일반적 또는 즉시 사용 가능한 의미 추출 방법보다 어떻게 비교되는가?
- RQ4확산 과정의 초기 노이즈에 저해상도 잠재 표현을 통합하는 것이 잡음 생성을 완화하고 재구성 충실도를 향상시키는가?
- RQ5소프트 프롬프트와 하드 프롬프트 중 어느 것이 더 높은 감각적 품질과 의미 정확도를 달성하는 데 기여하는가?
주요 결과
- SeeSR는 StableSR, PASD, DiffBIR와 같은 기존의 확산 기반 방법보다 감각적 품질에서 뛰어나며, 더 낮은 LPIPS 및 CLIPIQA 점수를 기록하여 더 현실적인 시각적 결과와 낮은 왜곡을 보였다.
- 제거 실험 결과, 하드 프롬프트만 사용할 경우 의미 오류(예: 잘못된 객체 레이블)가 발생하는 반면, 소프트 프롬프트만 사용할 경우 블러되거나 의미적으로 손상된 출력이 나타났다.
- DAPE를 통해 하드 및 소프트 프롬프트를 조합하면 가장 균형 잡힌 결과를 얻을 수 있었으며, 사례 연구에서 선명한 윤곽선과 의미적으로 충실한 세부 정보가 확인되었다.
- DAPE를 RAM으로 교체할 경우 모든 감각적 지표가 저하되고 의미적 일관성이 떨어지며, 열화에 민감한 프롬프트 설계의 필요성을 입증했다.
- LRE 전략은 확산 모델의 훈련 및 추론 분포를 일치시켜 매끄러운 영역에서 잡음을 효과적으로 줄였다.
- SeeSR는 실세계 이미지 초해상도 복원 분야에서 최고 성능을 기록했으며, 단일 V100 GPU에서 7.24초의 추론 시간을 기록하여 확산 기반 방법들 중에서 속도와 품질의 균형을 잘 유지했다.
![Figure 2 : Overview of SeeSR. (a) In the first stage, we train a degradation-aware prompt extractor (DAPE), which is initialized from a tag model. DAPE is trained to align the encoding of the degraded LR image to the encoding of the corresponding HR image by a tag model ( e.g . , RAM [ 71 ] in our w](https://ar5iv.labs.arxiv.org/html/2311.16518/assets/x2.png)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.