Skip to main content
QUICK REVIEW

[논문 리뷰] InstructIR: High-Quality Image Restoration Following Human Instructions

Marcos V. Conde, Gregor Geigle|arXiv (Cornell University)|2024. 01. 29.
Advanced Image Processing Techniques인용 수 4
한 줄 요약

InstructIR는 자연어 지시문을 사용하여 다중 복원 유형(노이즈 제거, 비 오름 제거, 블러 제거, 안개 제거, 저조도 향상 포함)에 걸쳐 고품질 이미지 복원을 유도하는 최초의 텍스트 유도 이미지 복원 모델을 소개한다. 동결된 텍스트 인코더와 NAFNet 기반 이미지 복원 백본을 활용하여 InstructIR은 기존의 통합형 모델 대비 +1dB 향상된 최신 기술 성능(SOTA)을 달성한다.

ABSTRACT

Image restoration is a fundamental problem that involves recovering a high-quality clean image from its degraded observation. All-In-One image restoration models can effectively restore images from various types and levels of degradation using degradation-specific information as prompts to guide the restoration model. In this work, we present the first approach that uses human-written instructions to guide the image restoration model. Given natural language prompts, our model can recover high-quality images from their degraded counterparts, considering multiple degradation types. Our method, InstructIR, achieves state-of-the-art results on several restoration tasks including image denoising, deraining, deblurring, dehazing, and (low-light) image enhancement. InstructIR improves +1dB over previous all-in-one restoration methods. Moreover, our dataset and results represent a novel benchmark for new research on text-guided image restoration and enhancement. Our code, datasets and models are available at: https://github.com/mv-lab/InstructIR

연구 동기 및 목표

  • 자연어 지시문을 활용하여 다양한 복원 유형에 걸쳐 일반화된 이미지 복원 문제를 해결하기 위한 것이다.
  • 사용자가 제공한 텍스트 지시문에 기반해 복원하는 단일 통합 모델을 가능하게 하여 사전 정의된 복원 임베딩이 아닌, 사용자 의도 기반 복원을 가능하게 하기 위한 것이다.
  • 실제 인간이 작성한 프롬프트를 사용하여 텍스트 유도 이미지 복원 및 향상에 대한 새로운 벤치마크를 수립하기 위한 것이다.
  • 자연어를 통한 인간의 의도 통합을 통해 실제 환경에서의 일반화 능력과 성능을 향상시키기 위한 것이다.
  • 텍스트 기반 지시 따르기 방식이 기존의 프롬프트 임베딩 또는 분류 기반 접근 방식보다 블라인드 이미지 복원에서 뛰어난 성능을 낼 수 있음을 입증하기 위한 것이다.

제안 방법

  • 모델은 인간이 작성한 지시문을 맥락 임베딩으로 변환하기 위해 동결된 텍스트 인코더(BGE-micro-v2)를 사용한다.
  • NAFNet 기반 이미지 복원 백본은 복잡한 이미지와 텍스트 임베딩을 크로스 어텐션 메커니즘을 통해 처리하여 지시문에 따라 복원을 조정한다.
  • 모델은 복합 손실 함수로 훈련되며, 복원된 이미지와 진짜 이미지 간의 L1 재구성 손실과 프롬프트에서의 의도 분류를 위한 교차 엔트로피 손실이 포함된다.
  • 학습 중 텍스트 인코더는 동결되어 일반화 능력을 유지하고 계산 비용을 절감한다.
  • 모델은 임의의 자연어 프롬프트를 지원하여 사용자 의도 기반의 민첩하고도 영리한 이미지 복원을 가능하게 한다.
  • 모델은 노이즈 제거, 비 오름 제거, 블러 제거, 안개 제거, 저조도 향상에 대한 표준 벤치마크에서 평가된다.

실험 결과

연구 질문

  • RQ1자연어 지시문이 다양한 복원 유형에 걸쳐 이미지 복원 모델을 효과적으로 유도할 수 있는가?
  • RQ2학습된 프롬프트 임베딩이나 복원 유형 분류 기반 접근 방식과 비교해 인간이 작성한 지시문을 사용할 경우 성능 향상이 이루어지는가?
  • RQ3단일 통합 모델이 오직 텍스트 기반 유도만으로 다양한 실제 복원 시나리오에 일반화될 수 있는가?
  • RQ4텍스트 인코더의 선택이 텍스트 유도 이미지 복원 성능에 미치는 영향은 어떠한가?
  • RQ5모델은 새로운 복원 유형과 지시문에 대해서도 일반화 능력을 유지하면서 최신 기술 성능(SOTA)을 달성할 수 있는가?

주요 결과

  • InstructIR은 다섯 가지 이미지 복원 작업 전반에서 최신 기술 성능(SOTA)을 달성하며, 이전의 통합형 모델 대비 +1dB 향상된 성능을 보였다.
  • 모델은 실제 복원 시나리오에 잘 일반화되어 있으며, 애매하거나 전문적인 용어가 없는 지시문에도 고품질 결과를 생성한다.
  • 절단 실험 결과, 다양한 텍스트 인코더 간 성능 차이가 유의미하지 않으며, BGE-micro-v2가 크기와 성능 사이의 최적의 균형을 이룬다.
  • 의도 분류 손실이 빠르게 수렴함을 확인하여, 모델이 지시문과 올바른 복원 작업을 효과적으로 연관 짓는 것을 학습함을 시사한다.
  • 정성적 비교 결과, AirNet 및 PromptIR과 같은 베이스라인 모델 대비 모든 작업에서 시각적 품질과 세부 정보 복구 능력에서 InstructIR이 뛰어난 성능을 보였다.
  • 모델는 강력한 제로샷 일반화 능력을 보이며, 미세조정 없이도 다양한 인간이 작성한 프롬프트에 기반해 이미지를 복원할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.