Skip to main content
QUICK REVIEW

[논문 리뷰] Perceptual Image Quality Assessment with Transformers

Manri Cheon, Sungjun Yoon|arXiv (Cornell University)|2021. 04. 30.
Image and Video Quality Assessment참고 문헌 56인용 수 5
한 줄 요약

이 논문은 CNN 기반 백본을 사용해 기준 이미지와 손상된 이미지에서 추출한 인지적 특징을 비교함으로써 전반적인 참조 기반 인지적 영상 품질 평가를 수행하는 이미지 품질 트랜스포머(IQT)를 제안한다. 모델은 상태의 기술(SOTA) 성능을 달성하여 NTIRE 2021 인지적 IQA 도전 대회에서 메인 스코어 1.5885(PLCC: 0.7896, SRCC: 0.7990)로 1위를 기록하였다.

ABSTRACT

In this paper, we propose an image quality transformer (IQT) that successfully applies a transformer architecture to a perceptual full-reference image quality assessment (IQA) task. Perceptual representation becomes more important in image quality assessment. In this context, we extract the perceptual feature representations from each of input images using a convolutional neural network (CNN) backbone. The extracted feature maps are fed into the transformer encoder and decoder in order to compare a reference and distorted images. Following an approach of the transformer-based vision models, we use extra learnable quality embedding and position embedding. The output of the transformer is passed to a prediction head in order to predict a final quality score. The experimental results show that our proposed model has an outstanding performance for the standard IQA datasets. For a large-scale IQA dataset containing output images of generative model, our model also shows the promising results. The proposed IQT was ranked first among 13 participants in the NTIRE 2021 perceptual image quality assessment challenge. Our work will be an opportunity to further expand the approach for the perceptual IQA task.

연구 동기 및 목표

  • 현대의 GAN 기반 복원 알고리즘에 의해 손상된 이미지에 대해 인간이 인지하는 영상 품질을 정확하게 예측할 수 있는 딥러닝 기반의 전반적인 참조 기반 영상 품질 평가 방법을 개발하는 것.
  • 성공적으로 자연어 처리(NLP) 및 비전 작업에서 활용된 트랜스포머 아키텍처가 인지적 영상 품질 평가에 효과적으로 적용될 수 있는지 조사하는 것.
  • 실제의 잡음이 포함된 이미지에서 인지적 품질을 포착하지 못하는 기존의 객관적 지표인 PSNR 및 SSIM을 향상시키는 것.
  • 품질 예측에서 특징 수준의 차이 표현 방식과 픽셀 수준의 차이 표현 방식 간의 성능을 평가하는 것.
  • 생성 모델에서 유래한 다양한 종류의 손상 유형에 대해 강건하고 일반화 능력이 뛰어난 성능을 달성하는 것.

제안 방법

  • 기준 이미지와 손상된 이미지에서 양측 모두로부터 깊이 있는 인지적 특징 맵을 추출하기 위해 CNN 백본(예: ResNet)을 사용한다.
  • 추출된 특징 맵은 일렬로 펼쳐진 시퀀스 토큰으로 변환되며, 학습 가능한 품질 임베딩과 위치 임베딩을 포함한 트랜스포머 인코더-디코더 아키텍처에 의해 처리된다.
  • 모델은 특징 공간 내 이미지 패치 간의 장거리 의존성을 모델링하기 위해 다중 헤드 자기주의 어텐션 메커니즘을 사용한다.
  • 학습 가능한 품질 임베딩이 특징 토큰과 연결되어 트랜스포머가 품질 점수를 예측하는 데 도움을 준다.
  • 시퀀스 표현에 공간 정보를 유지하기 위해 위치 임베딩이 추가된다.
  • 트랜스포머 디코더의 최종 출력은 최종 영상 품질 점수(예: MOS)를 회귀하기 위해 예측 헤드를 통과한다.

실험 결과

연구 질문

  • RQ1트랜스포머 기반 아키텍처가 기준 이미지와 손상된 이미지 간의 인지적 영상 품질 차이를 효과적으로 모델링할 수 있는가?
  • RQ2CNN 백본에서 추출한 인지적 특징을 사용하는 것이 직접적인 픽셀 수준 처리에 비해 품질 평가 성능을 향상시키는가?
  • RQ3트랜스포머 프레임워크 내에서 학습 가능한 품질 및 위치 임베딩의 사용이 품질 점수 예측에 유익한가?
  • RQ4기존의 전통적 지표와 비교해, 현대의 GAN 기반 영상 복원 모델에서 유래한 잡음이 포함된 데이터셋에서 모델의 성능은 어떠한가?
  • RQ5모델은 다양한 손상 유형에 대해 일반화가 가능한가, 아니면 PIPAL과 같은 특정 데이터셋에 과적합되는가?

주요 결과

  • IQT 모델은 NTIRE 2021 인지적 IQA 도전 대회에서 참가자 13명 중 가장 높은 메인 스코어 1.5885를 기록하여 1위를 차지하였다.
  • PIPAL 검증 세트에서 IQT-C 버전은 PLCC 0.7896과 SRCC 0.7990을 기록하여 인간 평가 점수와 강한 상관관계를 보였다.
  • 기존 방법보다 표준 IQA 데이터셋(LIVE, CSIQ, TID2013)에서 뛰어난 성능을 보였으며, LIVE에서 SRCC/KRCC는 각각 0.970/0.845, CSIQ에서 0.947/0.805를 기록하였다.
  • 인지적 특징 공간에서의 차이 표현 방식을 사용할 경우 픽셀 수준의 차이 표현보다 더 뛰어난 성능을 보였으며, 이는 고수준 의미 정보의 중요성을 확인시켰다.
  • PIPAL 데이터셋으로 훈련된 IQT-C 모델는 자체 테스트 세트에서는 뛰어난 성능를 보였지만, 표준 데이터셋에서는 일반화 능력이 떨어지는 경향을 보여, 과적합의 위험성을 시사하였다.
  • GAN 생성 손상이 포함된 대규모 데이터셋에서 모델는 뛰어난 강건성과 일반화 능력을 보였으며, 이는 현대 영상 복원 평가에 적합함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.