Skip to main content
QUICK REVIEW

[논문 리뷰] An Attention-Driven Approach of No-Reference Image Quality Assessment

Diqi Chen, Yizhou Wang|arXiv (Cornell University)|2016. 12. 12.
Image and Video Quality Assessment참고 문헌 22인용 수 4
한 줄 요약

이 논문은 강화학습을 활용해 작업에 유의미한 이미지 영역을 샘플링하는 동적 인지 과정으로서의 이미지 품질 평가(IQA)를 모델링하는 주의 기반 비기준 이미지 품질 평가(NR-IQA) 방법을 제안한다. 시각적 주의, 강건한 평균화, 다중 작업 학습을 통합함으로써, 최소한의 시선(fixation)으로도 높은 정확도와 효율성을 확보한 상태에서 TID2008 데이터셋에서 최신 기술을 초월하는 성능을 달성한다.

ABSTRACT

In this paper, we present a novel method of no-reference image quality assessment (NR-IQA), which is to predict the perceptual quality score of a given image without using any reference image. The proposed method harnesses three functions (i) the visual attention mechanism, which affects many aspects of visual perception including image quality assessment, however, is overlooked in the NR-IQA literature. The method assumes that the fixation areas on an image contain key information to the process of IQA. (ii) the robust averaging strategy, which is a means \--- supported by psychology studies \--- to integrating multiple/step-wise evidence to make a final perceptual judgment. (iii) the multi-task learning, which is believed to be an effectual means to shape representation learning and could result in a more generalized model. To exploit the synergy of the three, we consider the NR-IQA as a dynamic perception process, in which the model samples a sequence of "informative" areas and aggregates the information to learn a representation for the tasks of jointly predicting the image quality score and the distortion type. The model learning is implemented by a reinforcement strategy, in which the rewards of both tasks guide the learning of the optimal sampling policy to acquire the "task-informative" image regions so that the predictions can be made accurately and efficiently (in terms of the sampling steps). The reinforcement learning is realized by a deep network with the policy gradient method and trained through back-propagation. In experiments, the model is tested on the TID2008 dataset and it outperforms several state-of-the-art methods. Furthermore, the model is very efficient in the sense that a small number of fixations are used in NR-IQA.

연구 동기 및 목표

  • 기본적인 왜곡 유형, 공간 분포, 정보 통합에 대한 도전 과제를 해결하기 위해 비기준 이미지 품질 평가(NR-IQA)의 과제를 해결한다.
  • 인간의 시선 행동을 모방하여 주의 기반의 시각적 주의를 NR-IQA에 통합함으로써 품질 판단에 핵심적인 이미지 영역을 식별한다.
  • 이미지 품질 점수와 왜곡 유형을 동시에 예측하는 다중 작업 학습을 통해 표현 학습과 일반화 능력을 향상시킨다.
  • 선택된 이미지 패치에서의 단계적 증거를 통합하는 강건한 평균화 전략을 통해 예측의 강건성과 효율성을 향상시킨다.
  • 정확하고 효율적인 IQA를 위해 동적이고 강화학습 기반의 샘플링 정책을 개발한다.

제안 방법

  • 스토캐스틱 정책 네트워크(위치 샘플링 모듈)가 이전에 주목한 영역로부터 누적된 정보에 기반해 고정점(fixation point)을 선택하는 강화학습 프레임워크를 사용한다.
  • 각 고정점에서 중심이 되는 다중 크기의 이미지 패치(세 가지 크기)를 추출하고, 이를 공유된 CNN(다중 척도 이미지 분석 모듈)를 통해 처리하여 작업에 관련된 특징을 추출한다.
  • 정보 통합 모듈에 포함된 순환 신경망(RNN)은 이전 고정점의 특징을 통합하는 은닉 상태를 유지하여 동적 표현을 형성한다.
  • 모델은 다중 작업 학습 설정을 통해 이미지 품질 점수 예측과 왜곡 유형 분류라는 두 가지 목적을 동시에 최적화하여 특징 표현의 품질을 향상시킨다.
  • 강건한 평균화 전략은 주목한 패치의 예측값을 가중 평균으로 계산하여, 시간에 따라 인간의 인지 통합을 모방한다.
  • 정책 기반 강화학습을 통해 두 작업(품질 점수 예측 및 왜곡 유형 분류)의 보상을 역전파하여 샘플링 정책을 업데이트함으로써 엔드 투 엔드 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ1강화학습 기반의 주의 메커니즘은 가장 정보가 많은 이미지 영역을 학습함으로써 비기준 이미지 품질 평가의 성능을 향상시킬 수 있는가?

주요 결과

  • 제안된 RL+M+R 모델은 TID2008 데이터셋에서 SROCC 0.833과 LCC 0.841을 기록하여 여러 최신 NR-IQA 방법을 능가한다.
  • 절단 실험을 통해 강건한 평균화 전략이 성능 향상에 크게 기여하는 것으로 확인되었으며, SROCC는 RL+M의 0.819에서 RL+M+R로 0.833으로 상승했다.
  • 다중 작업 학습은 필수적이다: 단일 강화학습 모델(RL-only)은 SROCC 0.646과 LCC 0.701에 그치며, 공동 학습이 표현 품질을 향상시킨다는 것을 시사한다.
  • 다중 작업 CNN 기반 베이스라인(CNN_MT)과 시각적 주목 지도 기반 버전(CNN_MT+S)보다 모델이 뛰어난 성능을 보이며, 정적 시각적 주목 지도보다 작업 기반 주의의 우수성을 입증한다.
  • 지역적 왜곡에 뛰어난 성능을 보이며, 특히 유형 14(비중심성 패턴 노이즈)와 유형 15(지역 블록 단위 왜곡)에 대해 강한 민감도를 보여, 국소적 열화에 매우 민감함을 입증한다.
  • 15종의 왜곡 유형을 87.7%의 정확도로 분류할 수 있었으며, 혼동은 주로 유사한 유형 간에 발생한다(예: 유형 1과 유형 2, 둘 다 가우시안 노이즈를 포함하지만 다른 색상 채널에서 발생함).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.