Skip to main content
QUICK REVIEW

[논문 리뷰] TAPE: Task-Agnostic Prior Embedding for Image Restoration

Lin Liu, Lingxi Xie|arXiv (Cornell University)|2022. 03. 11.
Advanced Image Processing Techniques인용 수 4
한 줄 요약

이 논문은 트랜스포머 기반 아키텍처를 사용하여 다양한 복원 작업에 일반화된, 작업에 종속되지 않는 사전 지식을 학습하는 이중 단계 프레임워크인 작업에 종속되지 않는 사전 임베딩(TAPE)을 제안한다. 픽셀 단위의 대비 손실을 사용해 다양한 청소화 이미지 데이터로 사전 훈련한 후 특정 작업에 대해 미세조정함으로써, TAPE는 여러 복원 작업에서 최대 1.45dB까지 PSNR를 향상시키며, 예측되지 않은 복원 유형으로의 일반화 능력이 뛰어나 전용 모델을 능가한다.

ABSTRACT

Learning a generalized prior for natural image restoration is an important yet challenging task. Early methods mostly involved handcrafted priors including normalized sparsity, l_0 gradients, dark channel priors, etc. Recently, deep neural networks have been used to learn various image priors but do not guarantee to generalize. In this paper, we propose a novel approach that embeds a task-agnostic prior into a transformer. Our approach, named Task-Agnostic Prior Embedding (TAPE), consists of two stages, namely, task-agnostic pre-training and task-specific fine-tuning, where the first stage embeds prior knowledge about natural images into the transformer and the second stage extracts the knowledge to assist downstream image restoration. Experiments on various types of degradation validate the effectiveness of TAPE. The image restoration performance in terms of PSNR is improved by as much as 1.45dB and even outperforms task-specific algorithms. More importantly, TAPE shows the ability of disentangling generalized image priors from degraded images, which enjoys favorable transfer ability to unknown downstream tasks.

연구 동기 및 목표

  • 특정 한 가지 복원 작업에 종속되지 않는 일반화된, 이식 가능한 이미지 사전 지식을 학습하는 데 도전한다.
  • 특정 복원 작업에 종속되지 않도록 청소화 이미지 사전 지식과 오염 요소를 분리하여 예측되지 않은 이미지 복원 작업으로의 이식성을 가능하게 한다.
  • 특정 작업에 맞게 재학습이 필요 없이 다양한 저수준 시각 작업에서 성능을 향상시킬 수 있는 통합 프레임워크를 개발한다.
  • 단일 사전 훈련된 사전 지식 모듈이 다양한 후행 복원 작업을 효과적으로 지원할 수 있는지 탐색한다.

제안 방법

  • TAPE는 청소화 이미지에서의 작업에 종속되지 않는 사전 훈련과 오염된 데이터에서의 작업 특정 미세조정을 거치는 이중 단계 훈련 파이프라인을 사용한다.
  • 청소화 이미지에서 일반화된 특징을 학습하기 위해 픽셀 단위의 대비 손실을 사용해 사전 지식 학습 모듈(PLM)을 훈련하며, 이를 쿼리 임베딩으로 인코딩한다.
  • 트랜스포머 디코더는 이러한 쿼리 임베딩을 사용해 입력에서 관련 특징에 주목함으로써 오염된 이미지의 효과적인 복원을 가능하게 한다.
  • 사전 훈련 단계에서는 실제 오염 정보가 없는 다양한 복원 데이터셋(비가림, 노이즈 제거, 모리이징 제거 등)을 사용하며, 청소화 이미지 데이터만 활용한다.
  • 특정 오염 유형에 종속되지 않는 사전 지식 표현을 학습함으로써 청소화 이미지 사전 지식과 오염 요소를 명시적으로 분리한다.
  • 다양한 트랜스포머 백본과 호환되며, 특정 작업에 대해 엔드 투 엔드로 미세조정이 가능하다.

실험 결과

연구 질문

  • RQ1청소화 이미지에서 단일의 작업에 종속되지 않는 사전 지식을 학습하고 다양한 이미지 복원 작업으로 효과적으로 이식할 수 있는가?
  • RQ2청소화 이미지에서 픽셀 단위의 대비 손실을 사용해 사전 훈련하면 예측되지 않은 오염 유형으로의 일반화 능력이 향상되는가?
  • RQ3청소화 이미지 사전 지식과 오염 요소를 분리함으로써 미지의 작업에서의 성능에 어떤 영향을 미치는가?
  • RQ4제안된 사전 지식 임베딩이 PSNR와 일반화 능력 측면에서 전용 모델보다 어느 정도 뛰어나게 성능을 발휘하는가?

주요 결과

  • TAPE는 Rain200L 데이터셋에서 전용 모델을 능가하며 최대 1.45dB까지 PSNR를 향상시켰다.
  • 눈송이 제거, 그림자 제거, 초해상도 복원, 흐림 제거와 같은 예측되지 않은 작업에서 각각 0.91dB, 0.29dB, 0.41dB, 0.48dB의 PSNR 향상을 달성했다.
  • SIDD 데이터셋에서 실제 노이즈 이미지에 접근할 수 없음에도 불구하고 청소화 이미지 사전 지식을 사전 훈련함으로써 PSNR가 0.31dB 향상되어 청소화 이미지 사전 지식의 가치를 입증했다.
  • 절단 실험 결과, 백본 φ보다 네트워크 θ와 PLM 모듈의 사전 훈련이 더 중요하며, 이를 생략할 경우 각각 0.22dB와 0.34dB의 PSNR 감소가 발생했다.
  • 사전 훈련 단계에서 사용된 픽셀 단위의 대비 손실은 특징의 일반화 능력을 향상시켜 다양한 작업에서의 성능 향상에 기여한다.
  • 시각화 결과, PLM의 출력 특징이 청소화 이미지의 구조적 정보와 윤곽선을 유지하면서 오염 요소를 효과적으로 억제하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.