Skip to main content
QUICK REVIEW

[論文レビュー] FAVER: Blind Quality Prediction of Variable Frame Rate Videos

Qi Zheng, Zhengzhong Tu|arXiv (Cornell University)|Jan 5, 2022
Image and Video Quality Assessment被引用数 6
ひとこと要約

FAVERは、可変フレームレート(VFR)および高フレームレート(HFR)動画を対象として特に設計された、最初の非参照動画品質評価モデルである。空間時間ウェーブレット分解と拡張された自然シーン統計、および時間的バンドパスフィルタリングを活用することで、高い精度と低い計算コストで知覚的品質を予測し、HFRデータセットにおいて既存のブレインドVQAモデルを上回る性能を発揮する。

ABSTRACT

Video quality assessment (VQA) remains an important and challenging problem that affects many applications at the widest scales. Recent advances in mobile devices and cloud computing techniques have made it possible to capture, process, and share high resolution, high frame rate (HFR) videos across the Internet nearly instantaneously. Being able to monitor and control the quality of these streamed videos can enable the delivery of more enjoyable content and perceptually optimized rate control. Accordingly, there is a pressing need to develop VQA models that can be deployed at enormous scales. While some recent effects have been applied to full-reference (FR) analysis of variable frame rate and HFR video quality, the development of no-reference (NR) VQA algorithms targeting frame rate variations has been little studied. Here, we propose a first-of-a-kind blind VQA model for evaluating HFR videos, which we dub the Framerate-Aware Video Evaluator w/o Reference (FAVER). FAVER uses extended models of spatial natural scene statistics that encompass space-time wavelet-decomposed video signals, to conduct efficient frame rate sensitive quality prediction. Our extensive experiments on several HFR video quality datasets show that FAVER outperforms other blind VQA algorithms at a reasonable computational cost. To facilitate reproducible research and public evaluation, an implementation of FAVER is being made freely available online: \url{https://github.com/uniqzheng/HFR-BVQA}.

研究の動機と目的

  • 可変フレームレート(VFR)および高フレームレート(HFR)動画に特化したブレインド/非参照VQAモデルの不足に対処すること。
  • 参照動画が不要な計算効率的で知覚的に正確なVQAモデルを構築すること。
  • 時間的および空間的自然シーン統計を活用して、VFR/HFRコンテンツにおけるフレームレート由来の歪みを捉えること。
  • リアルタイムストリーミングおよびユーザーゲンレーテッドコンテンツワークフローにおける品質評価のスケーラブルな展開を可能にすること。
  • 今後のVFR動画品質評価分野の研究を促進するため、公開可能で再現可能な実装を提供すること。

提案手法

  • FAVERは、動画信号からのマルチスケールな空間時間的特徴を抽出するために空間時間ウェーブレット分解を用いる。
  • 時間領域における知覚的に関連の深い周波数帯域を抽出するために、時間的バンドパスフィルタ(ハール、ダービーチェス-2、バイオ22)を適用する。
  • 輝度(Y)および彩度(U、V)成分からの特徴抽出に加え、勾配およびラプラシアン・オブ・ガウスィアン(LoG)応答も抽出する。
  • 特徴は一般化ガウス分布を用いてモデル化され、動画歪みの統計的特性を捉える。
  • 空間的および時間的特徴を統合するアンサンブル回帰器が、総合的な動画品質スコアを予測する。
  • 計算効率を維持するため、1秒間の時間的サンプリング戦略を採用する。

実験結果

リサーチクエスチョン

  • RQ1参照コンテンツが入手不可な状況下でも、ブレインドVQAモデルが可変フレームレート(VFR)動画の知覚的品質を効果的に予測できるか?
  • RQ2時間的および空間的自然シーン統計は、高フレームレート(HFR)動画における正確な品質予測にどのように寄与するか?
  • RQ3フレームレート関連の歪みを捉えるために、時間的サブバンドのうちどのものが相対的に重要であるか?
  • RQ4既存のモデルと比較して、FAVERの計算複雑性は増加するフレームレートに伴いどのようにスケーリングされるか?
  • RQ5FAVERは、圧縮やサンプリングアーチファクトが異なる多様なVFR動画データセットに一般化可能か?

主な発見

  • FAVERはLIVE-YT-HFRデータセットで最高のSROCC(0.917)とPLCC(0.902)を達成し、すべての競合するブレインドVQAモデルを上回った。
  • 15〜120 fpsのフレームレート範囲で一貫した性能を維持し、計算コストはほぼ一定であった。
  • 空間的および時間的特徴を組み合わせた(FAVER-All-Db2)モデルは、単独で用いた場合よりも顕著に優れた性能を示し、補完的な知覚的情報の存在を裏付けた。
  • 中周波数帯域(3レベルバンドパスフィルタから得られる)が、人間の判断と最も高い相関を示し、時間的コントラスト感度関数と整合的であった。
  • 1080p@30fpsにおいて、FAVERはTLVQMの6倍〜9倍、VIDEVALの9倍〜17倍の高速性を発揮しながらも、優れた精度を達成した。
  • BVI-HFRデータセットにおいても、コンテンツの変動が限定的で圧縮歪みが存在しないにもかかわらず、すべてのベースラインを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。