Skip to main content
QUICK REVIEW

[論文レビュー] FAST-VQA: Efficient End-to-end Video Quality Assessment with Fragment Sampling

Haoning Wu, Chaofeng Chen|arXiv (Cornell University)|Jul 6, 2022
Advanced Image Processing Techniques被引用数 5
ひとこと要約

本稿では、高解像度動画から品質を保持した断片を生成するためのグリッド・ミニパッチ・サンプリング(GMS)を用いる、効率的なエンドツーエンド型動画像品質評価フレームワーク、FAST-VQAを提案する。これにより、正確で計算負荷の低い推論が可能となる。断片を処理するためのフラグメントアテンションネットワーク(FANet)を活用することで、最先端手法と比較して10%高い精度と99.5%少ないFLOPsを達成した。

ABSTRACT

Current deep video quality assessment (VQA) methods are usually with high computational costs when evaluating high-resolution videos. This cost hinders them from learning better video-quality-related representations via end-to-end training. Existing approaches typically consider naive sampling to reduce the computational cost, such as resizing and cropping. However, they obviously corrupt quality-related information in videos and are thus not optimal for learning good representations for VQA. Therefore, there is an eager need to design a new quality-retained sampling scheme for VQA. In this paper, we propose Grid Mini-patch Sampling (GMS), which allows consideration of local quality by sampling patches at their raw resolution and covers global quality with contextual relations via mini-patches sampled in uniform grids. These mini-patches are spliced and aligned temporally, named as fragments. We further build the Fragment Attention Network (FANet) specially designed to accommodate fragments as inputs. Consisting of fragments and FANet, the proposed FrAgment Sample Transformer for VQA (FAST-VQA) enables efficient end-to-end deep VQA and learns effective video-quality-related representations. It improves state-of-the-art accuracy by around 10% while reducing 99.5% FLOPs on 1080P high-resolution videos. The newly learned video-quality-related representations can also be transferred into smaller VQA datasets, boosting performance in these scenarios. Extensive experiments show that FAST-VQA has good performance on inputs of various resolutions while retaining high efficiency. We publish our code at https://github.com/timothyhtimothy/FAST-VQA.

研究の動機と目的

  • 高解像度動画におけるディープな動画像品質評価(VQA)の高い計算コストを低減し、エンドツーエンド学習とモデルの精度を向上させること。
  • リサイズやクロッピングといった単純なサンプリング手法の限界を克服し、局所的なテクスチャやグローバルな品質関係を歪めないこと。
  • 局所的(空間的)および時間的品質情報を両方保持するようなサンプリング方式を設計し、より優れたVQA表現学習を実現すること。
  • 多様な動画解像度で高い精度を維持しながら、FLOPsを著しく削減する効率的でエンドツーエンド型のディープVQAモデルを開発すること。
  • 学習済み表現を、より小さい低解像度VQAデータセットへと転移可能にし、データ量が少ない状況での性能向上を実現すること。

提案手法

  • 動画を均一な空間グリッドに分割し、元解像度のまま各グリッドから1つのミニパッチをサンプリングし、時間的に整合した断片に合成する、グリッド・ミニパッチ・サンプリング(GMS)を提案する。
  • フレーム間の歪み(例:モーションブラー、カメラシェイク)を保持できるように、ミニパッチの時間的整合性を確保する。
  • 断片を処理し、品質関連特徴を抽出することを目的とした、トランスフォーマーに基づくアーキテクチャであるフラグメントアテンションネットワーク(FANet)を導入する。
  • パッチ単位の独立した回帰をIP-NLRヘッドを用いて行い、局所的品質マップを生成することで、解釈可能性とテクスチャレベルの歪みへの感受性を向上させる。
  • 断片を入力として、エンドツーエンドで全システムを学習し、サンプリングと表現学習の共同最適化を可能にする。
  • 断片のスパarsityと構造的特徴を活用することで、フル解像度ベースラインと比較してFLOPsを99.5%削減しつつ、高い精度を維持する。

実験結果

リサーチクエスチョン

  • RQ1リサイズやクロッピングといった単純な手法よりも、局所的なテクスチャやフレーム間歪みといった、品質関連情報の保持を効果的に行えるサンプリング戦略は可能か?
  • RQ2断片ベースのサンプリングは、高解像度動画における精度を損なわずに、ディープVQAモデルのエンドツーエンド学習をどの程度可能にするか?
  • RQ3提案されたフラグメントアテンションネットワーク(FANet)は、標準的な動画像トランスフォーマーと比較して、断片入力からの品質関連表現学習においてどの程度有効か?
  • RQ4高解像度の断片から学習された表現は、低解像度または小規模なVQAデータセットへ効果的に転移可能か?
  • RQ5断片による単一サンプリングの予測はどの程度安定的で信頼性が高く、最小限の推論オーバーヘッドで実用的導入が可能か?

主な発見

  • FAST-VQAは、1080P動画において最先端のPVQ手法と比較して10%高いPLCC(0.806)を達成し、FLOPsを99.5%削減した。
  • LSVQ_1080Pテストセットにおいて、断片の単一サンプリングによる正規化標準偏差はわずか0.0079にとどまり、予測の安定性が高いことが示された。
  • LSVQ_1080Pセットにおいて、単一サンプリングの相対的精度は6サンプルアンサンブルと比較して99.40%に達し、最小限の計算量で信頼性が確認された。
  • FAST-VQAは、LIVE-VQCの全解像度グループ(1080P、720P、≤540P)において、強力な性能(SRCC ≥ 0.80、PLCC ≥ 0.82)を維持した。
  • 定性的な局所的品質マップでは、FAST-VQAがぼやけたテクスチャを効果的に検出でき、動きのある領域と背景を区別できることを示し、局所的およびグローバル品質への感受性が高かった。
  • アブレーションスタディにより、FANet内のGRPBモジュールが性能向上に顕著な寄与をしていることが確認され、全ベンチマークで、このモジュールを含まないバリアントと比較して、FAST-VQAの完全モデルが優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。