[논문 리뷰] FAVER: Blind Quality Prediction of Variable Frame Rate Videos
FAVER는 가변 프레임 레이트(VFR) 및 고프레임 레이트(HFR) 영상 전용으로 특별히 설계된 최초의 비참조 영상 품질 평가 모델이다. 공간-시간 웨이블릿 분해된 영상 신호를 활용하여 확장된 자연 풍경 통계 및 시간적 대역통과 필터링을 적용함으로써 높은 정확도와 낮은 계산 비용으로 인지 품질을 예측하며, HFR 데이터셋에서 기존의 블라인드 VQA 모델들을 능가한다.
Video quality assessment (VQA) remains an important and challenging problem that affects many applications at the widest scales. Recent advances in mobile devices and cloud computing techniques have made it possible to capture, process, and share high resolution, high frame rate (HFR) videos across the Internet nearly instantaneously. Being able to monitor and control the quality of these streamed videos can enable the delivery of more enjoyable content and perceptually optimized rate control. Accordingly, there is a pressing need to develop VQA models that can be deployed at enormous scales. While some recent effects have been applied to full-reference (FR) analysis of variable frame rate and HFR video quality, the development of no-reference (NR) VQA algorithms targeting frame rate variations has been little studied. Here, we propose a first-of-a-kind blind VQA model for evaluating HFR videos, which we dub the Framerate-Aware Video Evaluator w/o Reference (FAVER). FAVER uses extended models of spatial natural scene statistics that encompass space-time wavelet-decomposed video signals, to conduct efficient frame rate sensitive quality prediction. Our extensive experiments on several HFR video quality datasets show that FAVER outperforms other blind VQA algorithms at a reasonable computational cost. To facilitate reproducible research and public evaluation, an implementation of FAVER is being made freely available online: \url{https://github.com/uniqzheng/HFR-BVQA}.
연구 동기 및 목표
- 가변 프레임 레이트(VFR) 및 고프레임 레이트(HFR) 영상에 특화된 블라인드/비참조 VQA 모델의 부족을 해결하기 위해.
- 기준 영상이 없는 조건에서 계산 비용이 저렴하고 인지 품질 예측 정확도가 높은 VQA 모델을 개발하기 위해.
- 시간적 및 공간적 자연 풍경 통계를 활용하여 VFR/HFR 콘텐츠에서 발생하는 프레임 레이트 유도 왜곡을 포착하기 위해.
- 실시간 스트리밍 및 사용자 생성 콘텐츠 워크플로우에서 품질 평가의 확장 가능한 구현을 가능하게 하기 위해.
- 미래의 VFR 영상 품질 평가 연구를 위해 공개된, 재현 가능한 구현을 제공하기 위해.
제안 방법
- FAVER는 영상 신호에서 다중 척도의 시공간 특징을 추출하기 위해 공간-시간 웨이블릿 분해를 사용한다.
- 시간 도메인에서 인지적으로 관련성이 높은 주파수 대역을 분리하기 위해 시간적 대역통과 필터(Haar, Daubechies-2, Bior22)를 적용한다.
- 영상의 밝기(Y) 및 색채도(U, V) 성분에서 특징을 추출하며, 기울기 및 라플라시안-오브-가우시안(LoG) 반응을 포함한다.
- 영상 왜곡의 통계적 성질을 포착하기 위해 일반화된 가우시안 분포를 사용하여 특징을 모델링한다.
- 공간적 및 시간적 특징을 조합하여 총합 영상 품질 점수를 예측하기 위해 회귀기의 앙상블을 사용한다.
- 다양한 프레임 레이트에서 계산 비용을 유지하기 위해 1초 간격의 시간 샘플링 전략을 사용한다.
실험 결과
연구 질문
- RQ1기준 콘텐츠에 접근할 수 없는 조건에서, 블라인드 VQA 모델이 가변 프레임 레이트(VFR) 영상의 인지 품질을 효과적으로 예측할 수 있는가?
- RQ2시간적 및 공간적 자연 풍경 통계는 고프레임 레이트(HFR) 영상에서 정확한 품질 예측에 어떻게 기여하는가?
- RQ3다양한 시간 하위대역 중에서 어떤 것이 다이내믹 프레임 레이트 유도 왜곡을 포착하는 데 가장 중요한가?
- RQ4기존 모델들과 비교해 FAVER의 계산 복잡도는 증가하는 영상 프레임 레이트에 따라 어떻게 변화하는가?
- RQ5FAVER는 압축 및 샘플링 아티팩트가 다양하게 포함된 다양한 VFR 영상 데이터셋에 일반화될 수 있는가?
주요 결과
- FAVER는 LIVE-YT-HFR 데이터셋에서 최고의 SROCC(0.917)와 PLCC(0.902)를 기록하여 모든 경쟁 블라인드 VQA 모델을 능가했다.
- 15에서 120fps의 프레임 레이트 전역에서 일관된 성능을 유지하였으며, 거의 일정한 계산 비용을 기록했다.
- 공간적 및 시간적 특징을 결합한 FAVER-All-Db2가 개별적으로 사용할 경우보다 유의미하게 높은 성능을 보였으며, 이는 상호보완적인 인지 정보를 제공함을 확인했다.
- 3단계 대역통과 필터에서 유도된 중간 주파수 대역의 시간 하위대역이 인간 평가와 가장 높은 상관관계를 보였으며, 이는 시간적 대비 감도 함수와 일치했다.
- 1080p@30fps에서 FAVER는 TLVQM보다 6배~9배, VIDEVAL보다 9배~17배 더 빠르게 동작하면서도 뛰어난 정확도를 확보했다.
- 내용 변화가 제한되고 압축 왜곡이 없는 BVI-HFR 데이터셋에서도 FAVER는 모든 베이스라인 모델을 능가했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.