[논문 리뷰] Deep Optimization model for Screen Content Image Quality Assessment using Neural Networks
이 논문은 컨volution 신경망을 사용하여 전체 기준(FR) 및 비기준(NR) 스크린 컨텐츠 이미지(SCI) 품질 평가를 위한 딥 최적화 모델 QODCNN을 제안한다. 적응형 품질 풀링, 인지적 관련성 기반 데이터 선택, 노이즈에 강건한 특징 융합을 통합함으로써, 기준 데이터셋에서 최신 기술 성능(SOTA)을 달성하여 기존의 FR 및 NR 방법보다 정확도와 일반화 능력에서 뛰어난 성능을 발휘한다.
In this paper, we propose a novel quadratic optimized model based on the deep convolutional neural network (QODCNN) for full-reference and no-reference screen content image (SCI) quality assessment. Unlike traditional CNN methods taking all image patches as training data and using average quality pooling, our model is optimized to obtain a more effective model including three steps. In the first step, an end-to-end deep CNN is trained to preliminarily predict the image visual quality, and batch normalized (BN) layers and l2 regularization are employed to improve the speed and performance of network fitting. For second step, the pretrained model is fine-tuned to achieve better performance under analysis of the raw training data. An adaptive weighting method is proposed in the third step to fuse local quality inspired by the perceptual property of the human visual system (HVS) that the HVS is sensitive to image patches containing texture and edge information. The novelty of our algorithm can be concluded as follows: 1) with the consideration of correlation between local quality and subjective differential mean opinion score (DMOS), the Euclidean distance is utilized to measure effectiveness of image patches, and the pretrained model is fine-tuned with more effective training data; 2) an adaptive pooling approach is employed to fuse patch quality of textual and pictorial regions, whose feature only extracted from distorted images owns strong noise robust and effects on both FR and NR IQA; 3) Considering the characteristics of SCIs, a deep and valid network architecture is designed for both NR and FR visual quality evaluation of SCIs. Experimental results verify that our model outperforms both current no-reference and full-reference image quality assessment methods on the benchmark screen content image quality assessment database (SIQAD).
연구 동기 및 목표
- 스크린 컨텐츠 이미지(SCI)는 자연 이미지와는 구조적·내용적으로 크게 다름에도 불구하고, 기존의 IQA 방법이 이를 평가하는 데에 한계를 보이고 있는 점을 해결하기 위해.
- 특히 무늬와 에지가 풍부한 영역에서 인지적 품질 차이를 효과적으로 포착할 수 있는 딥 러닝 기반 모델을 개발하기 위해.
- 최적화된 훈련 및 특징 융합 전략을 통해 전체 기준 및 비기준 설정 모두에서 일반화 능력과 강건성을 향상시키기 위해.
- 인간 시각 시스템(HVS)이 무늬와 에지에 민감한 점을 고려하여 고영향도 이미지 패치에 집중함으로써 모델 성능을 향상시키기 위해.
- 배치 정규화와 L2 정규화를 통해 과적합을 줄이고 훈련 효율성을 향상시키기 위해.
제안 방법
- 배치 정규화(BN)와 L2 정규화를 적용하여 수렴 속도를 가속화하고 피팅 성능를 향상시키기 위해 엔드 투 엔드 딥 CNN을 훈련한다.
- 이중 단계 훈련 과정을 적용: 먼저, 주관적 DMOS 점수와 상관관계가 높은 훈련 샘플을 우선순위로 정하는 데이터 선택 방법(TMED)을 사용해 사전 훈련된 모델을 미세조정한다.
- 노이즈에 강건한 지수(VLSD)를 기반으로 국소 품질 예측을 융합하기 위한 적응형 가중 전략(WLQVLSD)을 도입하며, 무늬 및 에지 콘텐츠가 포함된 패치에 초점을 맞춘다.
- 모델은 FR 및 NR 입력을 모두 처리할 수 있도록 연결 레이어를 사용하여 양 설정에 대한 통합 아키텍처를 구현한다.
- 크롭을 통한 데이터 증강을 적용하여 훈련 데이터의 다양성을 증가시키고 과적합을 줄인다.
- 최종 품질 점수는 VLSD에서 유도된 적응형 가중치를 사용하여 국소 품질 예측을 풀링함으로써 인지적 관련성을 향상시킨다.
실험 결과
연구 질문
- RQ1기존의 IQA 방법에 비해 스크린 컨텐츠 이미지(SCI)의 시각적 품질을 더 잘 예측할 수 있도록 딥 CNN 모델을 어떻게 최적화할 수 있는가?
- RQ2주관적 관련성(DMOS 상관관계) 기반으로 훈련 데이터를 선택하는 것이 FR 및 NR 설정 모두에서 모델 성능에 어떤 영향을 미치는가?
- RQ3노이즈에 강건한 지수(VLSD)를 사용한 적응형 풀링이 평균 풀링에 비해 SCI IQA에서 품질 예측을 어떻게 향상시키는가?
- RQ4제안된 최적화 방법(TMED 및 WLQVLSD)이 다양한 데이터베이스 간 일반화 능력과 강건성에 얼마나 기여하는가?
- RQ5모델은 새로운 데이터에 대해 강력한 일반화 능력을 유지하면서도 FR 및 NR 시나리오 모두에서 뛰어난 성능을 달성할 수 있는가?
주요 결과
- QODCNN-NR 모델은 CNN 기반의 NR 모델인 PICNN에 비해 뚜렷한 성능 향상을 보이며, 더 뛰어난 일반화 능력을 확보한다.
- SIQAD 벤치마크에서 제안된 FR 및 NR 모델은 PSNR, SSIM, GMSD, VSI, PICNN을 모두 능가하며, FR 모델은 특수 설계된 ESIM 지표와 유사한 성능을 달성한다.
- 미세조정 단계에서 훈련 데이터의 70%를 사용할 경우 최적의 성능을 기록하여 데이터 다양성과 모델 일반화 간의 균형을 이루고 있음을 시사한다.
- TMED(훈련 데이터 선택)과 WLQVLSD(적응형 풀링)의 사용은 FR 및 NR 모델 모두에서 일관된 성능 향상을 이끌어내며, 초기 정확도가 높은 NR 모델에서 더 큰 향상이 관찰된다.
- SCID에서의 교차 데이터베이스 평가를 통해 모델의 강력한 일반화 능력이 확인되었으며, 제안된 최적화 전략의 효과성이 입증되었다.
- 배치 정규화와 L2 정규화의 통합은 과적합을 효과적으로 줄여 unseen SCI 데이터셋에 대한 모델의 강건성과 일반화 능력을 향상시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.