Skip to main content
QUICK REVIEW

[논문 리뷰] Exploring CLIP for Assessing the Look and Feel of Images

Jianyi Wang, Kelvin C. K. Chan|arXiv (Cornell University)|2022. 07. 25.
Visual Attention and Saliency Detection인용 수 8
한 줄 요약

이 논문은 CLIP 모델의 시각-언어적 사전 지식을 활용하여 작업 특화 미세조정 없이도 이미지 품질(외관)과 추상적 인지적 특성(감성)을 평가할 수 있는 제로샷 방법인 CLIP-IQA를 제안한다. '좋은 사진.'과 '나쁜 사진.'과 같은 반의어 프롬프트 쌍을 사용함으로써 다양한 IQA 벤치마크와 추상적 특성에서 인간 인식과 높은 상관관계를 달성하며, 비학습 기반 방법을 능가하고 합성 데이터셋에서 학습 기반 모델과 맞먹거나 뛰어난 성능을 보인다.

ABSTRACT

Measuring the perception of visual content is a long-standing problem in computer vision. Many mathematical models have been developed to evaluate the look or quality of an image. Despite the effectiveness of such tools in quantifying degradations such as noise and blurriness levels, such quantification is loosely coupled with human language. When it comes to more abstract perception about the feel of visual content, existing methods can only rely on supervised models that are explicitly trained with labeled data collected via laborious user study. In this paper, we go beyond the conventional paradigms by exploring the rich visual language prior encapsulated in Contrastive Language-Image Pre-training (CLIP) models for assessing both the quality perception (look) and abstract perception (feel) of images in a zero-shot manner. In particular, we discuss effective prompt designs and show an effective prompt pairing strategy to harness the prior. We also provide extensive experiments on controlled datasets and Image Quality Assessment (IQA) benchmarks. Our results show that CLIP captures meaningful priors that generalize well to different perceptual assessments. Code is avaliable at https://github.com/IceClear/CLIP-IQA.

연구 동기 및 목표

  • 작업 특화 학습 없이도 이미지 품질(외관)과 추상적 인지적 특성(감성)을 평가할 수 있는 제로샷 방법을 개발하는 것.
  • CLIP의 사전 훈련된 시각-언어적 사전 지식이 객관적 이미지 특성 외에도 다양한 인지적 평가에 일반화될 수 있는지 조사하는 것.
  • CLIP 기반 인식 평가에서 언어적 모호성과 프롬프트 민감도 문제를 체계적인 프롬프트 설계 전략을 통해 해결하는 것.
  • 실제 세계 및 합성 IQA 데이터셋에서의 성능 평가를 통해 세분화된 품질 및 추상적 인식 특성에 대한 성능을 점검하는 것.
  • CLIP가 품질과 미학적 차원을 아우르는 유일한 인식 평가 도구로 기능할 수 있음을 보여주는 것.

제안 방법

  • 이 방법은 CLIP의 시각-언어 임베딩 공간을 활용하여 이미지 특징을 '좋은 사진.'과 '나쁜 사진.'과 같은 반의어 프롬프트 쌍과 비교함으로써 인지적 점수를 유추한다.
  • 언어적 모호성을 줄이고 일관성을 향상시키기 위해 프롬프트 쌍 전략을 도입하며, 각 특성은 대조적인 프롬프트 쌍(예: '행복' 대비 '우울')을 사용해 평가된다.
  • 품질 인식 평가에 있어서는 표준 IQA 데이터셋(TID2013, KonIQ-10k 등)을 사용하여 '밝음' 대비 '어두움'과 같은 프롬프트를 적용해 세분화된 특성 평가를 수행한다.
  • 추상적 인식 평가에 있어서는 AVA 데이터셋에서 '복잡함' 대비 '단순함' 등의 프롬프트를 사용해 '미학', '감정 분위기', '복잡성' 등의 특성을 평가한다.
  • 최종 점수는 두 반의어 프롬프트 간 CLIP의 로짓 점수 차이를 정규화하여 계산되며, 이는 인지적 품질 또는 감성의 대리 척도로 기능한다.
  • 합성 벤치마크에서 성능을 추가로 향상시키기 위해 레이블된 데이터를 사용해 분류기 헤드를 미세조정한 CLIP-IQA+라는 개선 버전을 도입한다.

실험 결과

연구 질문

  • RQ1CLIP의 사전 훈련된 시각-언어적 사전 지식을 작업 특화 미세조정 없이도 이미지 품질 평가에 효과적으로 활용할 수 있는가?
  • RQ2특히 반의어 쌍 프롬프트 설계의 선택이 인식 평가의 일관성과 정확성에 어떤 영향을 미치는가?
  • RQ3감정, 미학, 복잡성과 같이 명확한 수치 기준이 없는 추상적 인지적 특성에 대해서도 CLIP가 일반화될 수 있는가?
  • RQ4실제 세계 및 합성 데이터셋에서 CLIP-IQA는 기존의 학습 기반 및 비학습 기반 IQA 방법과 비교해 어떻게 성능을 내는가?
  • RQ5반의어 프롬프트 전략이 시각적 인식 평가에서 언어적 모호성을 얼마나 효과적으로 완화할 수 있는가?

주요 결과

  • CLIP-IQA는 TID2013 합성 IQA 벤치마크에서 스피어만 순서상관계수(SROCC) 0.632와 피어슨 선형상관계수(PLCC) 0.692를 기록하며, 비학습 기반 방법을 능가하고 최신 학습 기반 모델과 맞먹는 성능을 보였다.
  • KonIQ-10k 데이터셋에서 CLIP-IQA는 총합 이미지 품질 평가 시 SROCC 0.51과 PLCC 0.571을 기록하여, 어떤 미세조정 없이도 인간 인식과 강력한 일치를 보였다.
  • 이 방법은 밝기, 노이즈, 선명도와 같은 세분화된 품질 특성을 성공적으로 포착했으며, 그림 8에서 시각화한 바와 같이 합성 데이터에서 특성 변화에 양의 상관관계를 보였다.
  • 추상적 인식 평가에서는 AVA 데이터셋에서 '행복/우울', '공포스러움/평온함', '아름다움/지저분함' 등의 특성에 대해 일관되고 의미 있는 점수를 기록했으며, 결과는 그림 9와 10에 시각화되어 있다.
  • 미세조정된 버전인 CLIP-IQA+는 TID2013에서 SROCC 0.632와 PLCC 0.692를 기록하며, MUSIQ나 HyperIQA와 같은 학습 기반 모델마저 초월하는 성능을 보였다.
  • 반의어 프롬프트 쌍 전략은 특히 언어적 모호성이 높은 맥락에서 성능의 안정성과 인간 판단과의 상관관계를 크게 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.