Skip to main content
QUICK REVIEW

[논문 리뷰] Transformer for Image Quality Assessment

Junyong You, Jari Korhonen|arXiv (Cornell University)|2020. 12. 30.
Image and Video Quality Assessment참고 문헌 14인용 수 5
한 줄 요약

이 논문은 이미지 품질 평가를 위한 새로운 Transformer 기반 아키텍처인 TRIQ를 제안한다. 이는 적응형 위치 임베딩을 사용하여 컨볼루션 신경망 특징과 浅층 Transformer 인코더를 결합한다. 이 방법은 장거리 의존성을 효과적으로 모델링하면서도 임의의 입력 해상도를 지원함으로써 여러 공개 이미지 품질 데이터베이스에서 최신 기준 성능을 달성한다.

ABSTRACT

Transformer has become the new standard method in natural language processing (NLP), and it also attracts research interests in computer vision area. In this paper we investigate the application of Transformer in Image Quality (TRIQ) assessment. Following the original Transformer encoder employed in Vision Transformer (ViT), we propose an architecture of using a shallow Transformer encoder on the top of a feature map extracted by convolution neural networks (CNN). Adaptive positional embedding is employed in the Transformer encoder to handle images with arbitrary resolutions. Different settings of Transformer architectures have been investigated on publicly available image quality databases. We have found that the proposed TRIQ architecture achieves outstanding performance. The implementation of TRIQ is published on Github (https://github.com/junyongyou/triq).

연구 동기 및 목표

  • 기존에 CNN에 의해 지배되어 온 이미지 품질 평가 작업에 Transformer 아키텍처의 적용을 탐색한다.
  • 기본 Transformer에서 고정된 해상도 입력의 한계를 해결하기 위해 임의의 이미지 해상도를 처리할 수 있도록 적응형 위치 임베딩을 도입한다.
  • 이미지 특징 내 장거리 의존성을 모델링하기 위해 자기주의 메커니즘을 활용하여 이미지 품질 평가 벤치마크 성능을 향상시킨다.
  • 하이브리드 CNN-Transformer 아키텍처를 사용하여 이미지 품질 평가의 새로운 최신 기준 베이스라인을 수립한다.

제안 방법

  • 이 방법은 사전 훈련된 컨볼루션 신경망으로부터 추출된 특징 맵 위에 쌓인 얕은 Transformer 인코더를 사용한다.
  • 모델이 위치 편향 없이 임의의 해상도의 이미지를 처리할 수 있도록 적응형 위치 임베딩을 도입한다.
  • 이미지 패치 간의 전역 의존성을 포착하기 위해 다중 헤드 자기주의 메커니즘을 사용한다.
  • CNN의 특징 맵은 Transformer의 입력 토큰으로 사용되며, 최종 회귀 또는 분류를 위해 학습 가능한 클래스 토큰을 사용한다.
  • 표준 회귀 손실을 사용하여 공개된 이미지 품질 평가 데이터베이스에서 엔드 투 엔드로 아키텍처를 훈련시킨다.
  • 재현 가능성과 향후 연구를 위해 구현 코드를 GitHub에 공개한다.

실험 결과

연구 질문

  • RQ1Transformer 기반 아키텍처가 기존의 CNN 기반 방법보다 이미지 품질 평가에서 승리할 수 있는가?
  • RQ2적응형 위치 임베딩의 통합이 다양한 해상도의 이미지에서 성능에 어떤 영향을 미치는가?
  • RQ3이미지 품질 평가 작업에 최적의 Transformer 인코더 깊이와 구성은 무엇인가?
  • RQ4제안된 방법은 표준 이미지 품질 평가 벤치마크에서 최신 기준 모델과 비교해 어떻게 성능을 내는가?

주요 결과

  • 제안된 TRIQ 모델은 여러 공개 이미지 품질 평가 데이터베이스에서 최신 기준 성능을 달성한다.
  • 적응형 위치 임베딩의 사용으로 인해 모델은 성능 저하 없이 임의의 해상도의 이미지로 일반화할 수 있다.
  • 얕은 Transformer 인코더(예: 2~4층)가 최적의 성능을 내며, 이는 이 작업에 깊은 아키텍처가 필수적이지 않음을 시사한다.
  • 표준 벤치마크에서 PLCC 및 SROCC와 같은 상관 계수 지표에서 기존의 CNN 기반 및 하이브리드 모델보다 성능이 뛰어나다.
  • 제거 실험을 통해 자기주의 메커니즘이 이미지 특징 내 장거리 의존성을 모델링함으로써 성능 향상에 크게 기여한다는 것이 확인되었다.
  • 구현 코드는 GitHub에 공개되어 있어 연구 공동체의 재현성과 향후 개발을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.