Skip to main content
QUICK REVIEW

[논문 리뷰] Blind Predicting Similar Quality Map for Image Quality Assessment

Da Pan, Ping Shi|arXiv (Cornell University)|2018. 05. 22.
Image and Video Quality Assessment참고 문헌 44인용 수 10
한 줄 요약

이 논문은 완전히 컨volution 신경망(FCNN)을 사용하는 블라인드 이미지 품질 평가 모델인 BPSQM을 제안한다. 이 모델은 전체 참조(IQA) 방법에서 유도된 유사도 맵을 통해 지도 학습을 받으며, 픽셀 단위의 품질 맵을 예측하고, 이후 심층 풀링 네트워크를 통해 전역 품질 점수를 회귀한다. 이 방법은 손실 인식 특징 맵에 대한 지도 학습을 통해 인간 시각 시스템의 특성을 효과적으로 모델링하여 여러 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

A key problem in blind image quality assessment (BIQA) is how to effectively model the properties of human visual system in a data-driven manner. In this paper, we propose a simple and efficient BIQA model based on a novel framework which consists of a fully convolutional neural network (FCNN) and a pooling network to solve this problem. In principle, FCNN is capable of predicting a pixel-by-pixel similar quality map only from a distorted image by using the intermediate similarity maps derived from conventional full-reference image quality assessment methods. The predicted pixel-by-pixel quality maps have good consistency with the distortion correlations between the reference and distorted images. Finally, a deep pooling network regresses the quality map into a score. Experiments have demonstrated that our predictions outperform many state-of-the-art BIQA methods.

연구 동기 및 목표

  • 참조 이미지 없이 인간 시각 시스템(HVS) 특성을 모델링하는 데 어려움을 해결하기 위해.
  • 왜곡된 이미지에서만 입력을 받는 데이터 기반의 종단 간 딥 러닝 프레임워크를 개발하여, 인간의 인지에 의미 있는 픽셀 수준의 품질 맵을 예측하기 위해.
  • 기존의 전체 참조 방법에서 유도된 중간 유사도 맵을 감독 신호로 활용하여, 비참조 IQA의 일반화 능력과 정확도를 향상시키기 위해.
  • 패치 수준의 접근 방식과 비교하여 인간 인지와 더 잘 일치하는 픽셀 수준의 품질 맵 예측의 효과성을 탐색하기 위해.
  • HVS 관련 맵을 사용한 지도 학습이 블라인드 IQA 모델의 성능을 향상시키는지 입증하기 위해.

제안 방법

  • 프레임워크는 완전히 컨볼루션 신경망(FCNN)을 사용하여, 전체 참조 IQA 방법(예: FSIM)에서 유도된 유사도 맵을 기반으로 왜곡된 이미지에서 픽셀 단위의 품질 맵을 예측한다.
  • 유사도 맵은 학습 중에 감독 신호 역할을 하며, FCNN가 인간의 인지적 열화를 반영하는 국소 픽셀 왜곡 특징을 학습할 수 있도록 돕는다.
  • 예측된 품질 맵을 단일 전역 품질 점수로 집계하기 위해 심층 풀링 네트워크(DPN)를 사용하며, 기존의 표준 풀링 전략보다 우수한 성능을 보인다.
  • 모델은 이중 단계 학습 프로세스를 사용한다: 첫 번째로 FCNN는 유사도 맵 감독 하에 학습되고, 두 번째로 DPN은 예측된 품질 맵을 주관적 점수로 매핑하도록 학습된다.
  • 특히 CLIVE와 같은 더 작은 데이터셋에서의 일반화 능력을 향상시키기 위해 Koniq10k 데이터셋에서 사전 학습을 통해 초기화된다.
  • 검증 데이터 기반으로 학습된 함수를 사용하여 비선형 회귀(Eq. 5)를 적용하여 최종 품질 점수를 정밀하게 조정한다.

실험 결과

연구 질문

  • RQ1딥 러닝 모델은 참조 이미지 없이 오직 왜곡된 이미지에서만 픽셀 수준의 품질 맵을 예측할 수 있는가?
  • RQ2전체 참조 IQA 방법에서 유도된 유사도 맵을 감독 신호로 사용하면 예측된 품질 맵의 인지 일관성이 향상되는가?
  • RQ3픽셀 수준의 품질 맵 예측 성능가 패치 수준 또는 전역 특징 기반 접근 방식과 비교해 블라인드 IQA에서 어떻게 다른가?
  • RQ4심층 풀링 네트워크는 예측된 픽셀 수준의 품질 맵에서 전역 품질 점수를 효과적으로 회귀시킬 수 있는가?
  • RQ5Koniq10k와 같은 더 큰 다각도의 데이터셋에서의 사전 학습은 CLIVE와 같은 더 작은, 다각도가 적은 데이터셋에서의 일반화 능력을 향상시키는가?

주요 결과

  • Koniq10k 데이터셋에서 BPSQM은 SRCC 0.756과 PLCC 0.734를 기록하며 대부분의 최신 기술 수준 방법들을 능가한다.
  • CLIVE 데이터셋에서 BPSQM-Pre는 SRCC=0.716과 PLCC=0.721을 기록하며, Koniq10k에서의 사전 학습 이후에 상당한 향상이 있었고(SRCC=0.789, PLCC=0.773) 이를 확인했다.
  • 모델는 강력한 일반화 능력을 보이며, TID2008에서 네 가지 왜곡 유형(JP2K, JPEG, WN, BLUR)에 대해 중앙값 SRCC 0.910을 기록했으며, BRISQUE와 BIECON을 능가했다.
  • BPSQM에서 예측된 품질 맵은 인간 인지와 강한 일치를 보이며, 노이즈가 많거나 흐린 얼굴 영역이 어두운 영역으로 나타나는 것으로 확인되었다.
  • 픽셀 수준의 품질 맵 사용은 패치 기반 맵보다 더 나은 인지 일치를 이끌어내었으며, BIECON 및 FSIM과의 시각적 비교에서 이를 입증했다.
  • Koniq10k에서의 사전 학습은 작은 데이터셋에서의 성능 향상에 상당한 기여를 하였으며, 이는 모델의 일반화 능력이 훈련 데이터의 다양성과 규모에 크게 의존한다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.