Skip to main content
QUICK REVIEW

[논문 리뷰] Prediction of Satisfied User Ratio for Compressed Video

Haiqiang Wang, Ioannis Katsavounidis|arXiv (Cornell University)|2017. 10. 30.
Image and Video Quality Assessment참고 문헌 11인용 수 3
한 줄 요약

이 논문은 지역적 VMAF 품질 점수, 전역 집계, 마스킹 효과 및 서포트 벡터 회귀(SVR)를 사용하여 H.264 압축 영상의 만족 사용자 비율(SUR) 곡선을 예측하는 기계학습 프레임워크를 제안한다. 이 방법은 낮은 예측 오차(MAE = 0.038)와 함께 720p 해상도 영상에서 첫 번째 JND 지점 추정에 높은 정확도를 보이며, 평균 절대 오차가 1.273 QP이다.

ABSTRACT

A large-scale video quality dataset called the VideoSet has been constructed recently to measure human subjective experience of H.264 coded video in terms of the just-noticeable-difference (JND). It measures the first three JND points of 5-second video of resolution 1080p, 720p, 540p and 360p. Based on the VideoSet, we propose a method to predict the satisfied-user-ratio (SUR) curves using a machine learning framework. First, we partition a video clip into local spatial-temporal segments and evaluate the quality of each segment using the VMAF quality index. Then, we aggregate these local VMAF measures to derive a global one. Finally, the masking effect is incorporated and the support vector regression (SVR) is used to predict the SUR curves, from which the JND points can be derived. Experimental results are given to demonstrate the performance of the proposed SUR prediction method.

연구 동기 및 목표

  • H.264로 압축된 영상 클립에 대해 기계학습 기반 접근법을 사용하여 만족 사용자 비율(SUR) 곡선을 예측하는 것.
  • 직접 JND를 예측하는 대신 사용자 만족도를 모델링하여 JND 지점 추정을 향상시키는 것.
  • 지역적 품질 저하와 공간-시간 마스킹 효과를 예측 프레임워크에 통합하는 것.
  • 대규모 VideoSet 데이터셋을 활용하여 SUR 예측 모델의 훈련 및 검증을 수행하는 것.
  • 영상 품질 평가를 위한 정확한 JND 지점 유도를 가능하게 하는 예측된 SUR 곡선을 제공하는 것.

제안 방법

  • 고정된 창 크기(W×H)를 사용하여 각 영상 클립을 지역적 공간-시간 세그먼트로 분할하여 시간적 및 공간적 분석을 수행한다.
  • 각 세그먼트에 대해 VMAF 품질 지수를 계산하여 지역적 품질 저하를 평가한다.
  • 20개의 품질 수준에 대해 누적 분포를 사용하여 지역적 VMAF 점수를 전역 품질 저하 특징 벡터로 집계한다.
  • 기준 영상에서 공간 랜덤니스(SR)와 시간 랜덤니스(TR)를 사용하여 마스킹 특징을 추출하고, 20차원 히스토그램 특징 벡터를 형성한다.
  • 20차원의 품질 저하 벡터와 20차원의 마스킹 특징 벡터를 연결하여 40차원 입력 특징 벡터를 생성한다.
  • 40차원 특징 벡터로부터 SUR 곡선을 예측하기 위해 라디얼 기저 함수 커널과 ε-감도 없는 손실을 사용한 서포트 벡터 회귀기(SVR)를 훈련한다.

실험 결과

연구 질문

  • RQ1기계학습 프레임워크는 H.264 압축 영상의 Satisfied User Ratio(SUR) 곡선을 정확하게 예측할 수 있는가?
  • RQ2지역적 품질 저하와 마스킹 효과를 통합할 경우 SUR 예측 성능는 어떻게 향상되는가?
  • RQ3예측된 SUR 곡선으로부터 첫 번째 JND 지점은 어느 정도 정확하게 도출될 수 있는가?
  • RQ4다양한 영상 해상도(1080p, 720p, 540p, 360p)에서 예측 정확도는 어떻게 달라지는가?
  • RQ5고정된 공간-시간 세그먼트 파rameter는 특히 낮은 해상도에서 예측 오차에 어떤 영향을 미치는가?

주요 결과

  • 제안된 SUR 예측 방법은 720p 영상 클립에 대해 SUR 곡선에서 평균 절대 오차(MAE) 0.038를 달달한다.
  • 720p 해상도에서 첫 번째 JND 지점의 예측 오차는 평균 1.273 QP로, JND 추정의 높은 정확도를 나타낸다.
  • 저해상도에서 성능이 약간 저하되며, 360p에서는 QP 오차가 1.605로 나타나, 고정된 세그먼트 창 크기의 영향일 가능성이 있다.
  • 예측된 SUR 곡선은 실제값과 강한 상관관계를 보이며, JND 예측 대비 실제값 플롯에서 점들이 45도 선에 밀집해 있음을 통해 이를 입증한다.
  • 누적 품질 저하 곡선 특징 벡터는 QP 수준 간의 인지적 품질 변화를 효과적으로 포착한다.
  • 공간 및 시간 랜덤니스 기반 마스킹 특징의 포함은 복잡한 시각 콘텐츠 하에서 사용자 만족도 예측 능력을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.