[논문 리뷰] Multi-Scale Features and Parallel Transformers Based Image Quality Assessment
이 논문은 다중 척도 컨볼루션 특징과 병렬 트랜스포머를 통합하여 인지적 품질 예측 성능을 향상시키는 새로운 전참고형 이미지 품질 평가 모델인 MSFPT를 제안한다. 다중 척도 입력과 트랜스포머 기반 아키텍처를 활용함으로써, 기준 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, DISTS 및 LPIPS와 같은 기존 모델들보다 NTIRE 2022 챌린지에서 SRCC 기준 최대 0.068 향상되었다.
With the increase in multimedia content, the type of distortions associated with multimedia is also increasing. This problem of image quality assessment is expanded well in the PIPAL dataset, which is still an open problem to solve for researchers. Although, recently proposed transformers networks have already been used in the literature for image quality assessment. At the same time, we notice that multi-scale feature extraction has proven to be a promising approach for image quality assessment. However, the way transformer networks are used for image quality assessment until now lacks these properties of multi-scale feature extraction. We utilized this fact in our approach and proposed a new architecture by integrating these two promising quality assessment techniques of images. Our experimentation on various datasets, including the PIPAL dataset, demonstrates that the proposed integration technique outperforms existing algorithms. The source code of the proposed algorithm is available online: https://github.com/KomalPal9610/IQA
연구 동기 및 목표
- 멀티미디어에서 이미지 왜곡의 복잡성이 증가하는 문제를 해결하기 위해 비참조형 및 전참고형 이미지 품질 평가를 향상시키기 위해.
- 이미지 품질 평가 분야에서 다중 척도 특징 추출과 트랜스포머 기반 모델링 간 격차를 메우기 위해.
- 인간의 인지와 밀접하게 일치하는 강건한 엔드 투 엔드 딥 러닝 프레임워크를 개발하기 위해.
- PIPAL 및 NTIRE 2022를 포함한 다양한 IQA 벤치마크에서 기존 최신 기술 수준의 방법들을 능가하기 위해.
- 병렬 트랜스포머와 다중 척도 입력의 조합이 인지적 품질 추정에 효과적인지 검증하기 위해.
제안 방법
- 입력 이미지를 1x, 2x, 3x 및 0.5x 해상도의 네 가지 다른 척도에서 처리하여 다중 척도 특징 추출을 수행한다.
- CNN 기반 백본을 통해 다중 척도 특징을 추출한 후, 다중 척도 간 특징 융합 및 주목적 기반 표현 학습을 위해 병렬 트랜스포머 인코더-디코더 아키텍처에 입력한다.
- 이동 가능한 위치 임베딩을 사용한 멀티헤드 자기주목적 메커니즘을 통해 이미지 패치 간 장거리 의존성을 모델링한다.
- 다양한 척도에서의 패치 수준 품질 점수의 가중 평균을 사용하여 최종 이미지 품질 예측을 생성한다.
- 배치 크기가 16인 환경에서 Adam 옵timizer, 가중치 감소, 코즈인 안내링 학습률 스케줄링을 사용하여 L1 손실로 네트워크를 훈련시킨다.
- 일반화 성능 향상을 위해 훈련 중에 무작위 컷, 플립 및 회전 등의 데이터 증강 기법을 적용한다.
실험 결과
연구 질문
- RQ1다중 척도 특징과 병렬 트랜스포머의 통합이 전참고형 이미지 품질 평가 성능을 향상시킬 수 있는가?
- RQ2제안된 MSFPT 모델은 다양한 데이터셋에서 최신 기술 수준의 딥 러닝 기반 IQA 방법들과 비교해 어떻게 성능을 내는가?
- RQ3다중 척도 입력과 병렬 주목적 메커니즘이 모델의 강건성과 정확성에 기여하는 정도는 어떠한가?
- RQ4다양한 척도에 걸쳐 공유된 트랜스포머 아키텍처를 사용함으로써 특징 학습 및 일반화 성능이 향상되는가?
- RQ5딥 러닝 기반 및 얕은 학습 기반 IQA 메트릭과 비교해 모델의 성능은 어떠한가?
주요 결과
- NTIRE 2022 FR 챌린지 검증 세트에서 MSFPT는 주요 점수 1.598, SRCC 0.81, PLCC 0.788을 기록하여 모든 베이스라인 모델을 능가했다.
- NTIRE 2022 테스트 세트에서 MSFPT는 주요 점수 1.45, SRCC 0.738, PLCC 0.713을 기록하여 DISTS(1.342, 0.655, 0.687)와 LPIPS-VGG(1.228, 0.595, 0.633)를 모두 앞섰다.
- KADID-10k 데이터셋에서 MSFPT는 VSI보다 PLCC 0.01, SRCC 0.004, KRCC 0.009 높게 기록하여 인간 평가와의 상관관계가 뛰어나다는 것을 입증했다.
- TID2013에서 기존 딥 러닝 모델들보다 SRCC 0.021, KRCC 0.034 높은 성능을 기록하여 다양한 왜곡 상황에서의 성능 향상을 확인했다.
- LIVE 데이터셋에서 MSFPT는 IQT 방법보다 SRCC 0.07, KRCC 0.029 높게 기록하여 전참고형 환경에서의 효과성을 확인했다.
- 절단 실험 결과, 'Attention is All You Need' 트랜스포머 아키텍처를 사용할 경우 BERT 기반 변종보다 더 높은 성능을 기록함을 확인하여 IQA에 적합한 아키텍처 선택의 타당성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.