Skip to main content
QUICK REVIEW

[논문 리뷰] Active Fine-Tuning from gMAD Examples Improves Blind Image Quality Assessment

Zhihua Wang, Kede Ma|arXiv (Cornell University)|2020. 03. 08.
Image and Video Quality Assessment참고 문헌 59인용 수 5
한 줄 요약

이 논문은 그룹 최대 차별도(gMAD) 경쟁을 통해 식별된 어려운 이미지 쌍을 반복적으로 선택하고 레이블링함으로써 맹검 이미지 품질 평가(BIQA)의 정확도를 향상시키는 주동적 피지터링 프레임워크를 제안한다. 인간이 레이블링한 gMAD 예제를 기반으로 DNN 기반 BIQA 모델을 피지터링함으로써, 표준 벤치마크에서 성능 저하 없이도 모델의 강건성과 일반화 능력을 향상시킨다.

ABSTRACT

The research in image quality assessment (IQA) has a long history, and significant progress has been made by leveraging recent advances in deep neural networks (DNNs). Despite high correlation numbers on existing IQA datasets, DNN-based models may be easily falsified in the group maximum differentiation (gMAD) competition with strong counterexamples being identified. Here we show that gMAD examples can be used to improve blind IQA (BIQA) methods. Specifically, we first pre-train a DNN-based BIQA model using multiple noisy annotators, and fine-tune it on multiple subject-rated databases of synthetically distorted images, resulting in a top-performing baseline model. We then seek pairs of images by comparing the baseline model with a set of full-reference IQA methods in gMAD. The resulting gMAD examples are most likely to reveal the relative weaknesses of the baseline, and suggest potential ways for refinement. We query ground truth quality annotations for the selected images in a well controlled laboratory environment, and further fine-tune the baseline on the combination of human-rated images from gMAD and existing databases. This process may be iterated, enabling active and progressive fine-tuning from gMAD examples for BIQA. We demonstrate the feasibility of our active learning scheme on a large-scale unlabeled image set, and show that the fine-tuned method achieves improved generalizability in gMAD, without destroying performance on previously trained databases.

연구 동기 및 목표

  • 표준 데이터셋에서 높은 상관관계를 보이지만 딥러닝 기반 BIQA 모델의 강건성 부족 문제를 해결하기 위해.
  • gMAD 경쟁을 활용하여 인간의 인지 품질 예측에서의 실패를 체계적으로 드러내어 모델의 약점을 파악하기 위해.
  • 인간이 레이블링한 gMAD 예제를 활용한 주동적 학습을 통해 BIQA의 일반화 능력을 향상시키기 위해.
  • 기존의 합성 왜곡 데이터베이스에서 강력한 성능을 유지하면서 동시에 악성 이미지 쌍에 대한 저항성을 높이기 위해.
  • 최소한의 인간 레이블링 데이터로도 실제 세계 왜곡에 효과적으로 전이할 수 있도록 하기 위해.

제안 방법

  • 레이블링의 불확실성을 다루기 위해 다수의 노이즈 있는 레이블러를 사용하여 DNN 기반 BIQA 모델을 사전 학습한다.
  • 기본 모델을 네 개의 합성 IQA 데이터베이스에 대해 피지터링하여 강력한 초깃값을 확보한다.
  • 기본 모델과 참조 기반 IQA 방법 간의 예측 차이를 최대화하는 이미지 쌍을 gMAD 경쟁을 통해 식별한다.
  • 통제된 실험실 환경에서 가장 분류 능력이 뛰어난 gMAD 쌍을 인간 레이블링 대상으로 선정한다.
  • gMAD 레이블링 이미지와 기존 데이터베이스의 조합을 재학습하여 반복적인 주동적 피지터링을 수행한다.
  • 모델이 어려운 왜곡을 다룰 수 있는 능력을 점진적으로 향상시키기 위해 주동적 학습 루프를 적용한다.

실험 결과

연구 질문

  • RQ1gMAD로 식별된 이미지 쌍은 DNN 기반 BIQA 모델의 맹점(盲점)을 효과적으로 드러내는가?
  • RQ2인간이 레이블링한 gMAD 예제를 기반으로 한 주동적 피지터링이 BIQA 모델의 강건성과 일반화 능력을 향상시키는가?
  • RQ3제안된 방법은 표준 IQA 데이터베이스에서의 성능을 유지하면서도 악성 이미지 쌍에 대한 저항성을 향상시키는가?
  • RQ4gMAD 예제에서의 주동적 피지터링은 얼마나 효과적으로 합성 왜곡에서 실제 왜곡으로의 일반화 능력을 향상시키는가?
  • RQ5주동적 학습의 여러 라운드 동안 모델의 성능은 어떻게 변화하는가?

주요 결과

  • 첫 번째 주동적 피지터링 라운드에서 워터루 탐색 데이터베이스의 D-test와 P-test 점수가 향상되었으며, D-test는 0.881에서 0.890으로 상승했다.
  • 두 번째 피지터링 라운드 후 D-test 점수가 0.881로 약간 하락하여 gMAD 예제에 대한 과적합 가능성은 확인되었다.
  • 합성에서 실제로의 일반화 능력이 향상되었으며, SPAQ에서의 SRCC는 기준 모델의 0.575에서 두 번의 피지터링 후 0.633으로 상승했다.
  • KonIQ-10k에서 SRCC는 기준 모델의 0.403에서 두 번의 라운드 후 0.533으로 향상되어 실제 왜곡에서의 성능 향상을 입증했다.
  • 시각적 분석 결과, 모델이 점차 gMAD 예제에 적응하여 어두운 이미지나 무늬가 있는 이미지와 같은 이전에 잘못 분류되었던 유형의 예측 능력이 향상된 것으로 나타났다.
  • 모델의 공격성(예측의 분류 능력)이 향상되었으며, 유사한 인지적 품질을 가진 이미지 간의 구분 능력이 향상되었고, 동시에 표준 데이터베이스에서의 강력한 성능를 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.