[論文レビュー] Deep Learning based Full-reference and No-reference Quality Assessment Models for Compressed UGC Videos
本稿では、圧縮されたユーザーゲンレーテッドコンテンツ(UGC)動画向けに、畳み込みニューラルネットワーク(CNN)からのマルチレベル特徴抽出を活用した、深層学習ベースの動画品質評価(VQA)フレームワークを提案する。フルレファレンス(FR)およびノーレファレンス(NR)設定の両方で、高い性能を達成している。Compressed UGC VQAデータベースでは最先端性能を示し、実世界のUGCベンチマークでも優れた結果を達成している。これは、構造的・テクスチャ的類似性(FR)と階層的特徴統計(NR)を、人的な知覚を模倣した時間的プーリング戦略と組み合わせることで実現している。
In this paper, we propose a deep learning based video quality assessment (VQA) framework to evaluate the quality of the compressed user's generated content (UGC) videos. The proposed VQA framework consists of three modules, the feature extraction module, the quality regression module, and the quality pooling module. For the feature extraction module, we fuse the features from intermediate layers of the convolutional neural network (CNN) network into final quality-aware feature representation, which enables the model to make full use of visual information from low-level to high-level. Specifically, the structure and texture similarities of feature maps extracted from all intermediate layers are calculated as the feature representation for the full reference (FR) VQA model, and the global mean and standard deviation of the final feature maps fused by intermediate feature maps are calculated as the feature representation for the no reference (NR) VQA model. For the quality regression module, we use the fully connected (FC) layer to regress the quality-aware features into frame-level scores. Finally, a subjectively-inspired temporal pooling strategy is adopted to pool frame-level scores into the video-level score. The proposed model achieves the best performance among the state-of-the-art FR and NR VQA models on the Compressed UGC VQA database and also achieves pretty good performance on the in-the-wild UGC VQA databases.
研究の動機と目的
- 標準的な圧縮アーティファクトを超える多様な歪みに苦しむ、圧縮されたユーザーゲンレーテッドコンテンツ(UGC)動画の品質を正確に評価する課題に対処すること。
- 専門的品質のコンテンツに主に焦点を当てた既存のVQAモデルの限界を克服し、UGCにおける低レベルの視覚的特徴と高レベルの意味論の間の相互作用を無視しないこと。
- 実世界のUGC動画品質評価において、フルレファレンス(FR)およびノーレファレンス(NR)両設定で効果的に動作する統合された深層学習フレームワークを開発すること。
- 人的知覚を模倣したプーリング戦略を用いて、時間的ダイナミクスを品質評価に統合し、時間的経過に伴う動画品質の人的知覚を反映させること。
提案手法
- 事前学習済みCNNバックボーンの中間層からの特徴を統合し、品質に敏感な表現を生成することで、低レベルのテクスチャと高レベルの意味論の両方に感度を高める。
- FR VQAでは、複数の層からの特徴マップにおける構造的およびテクスチャ的類似性を計算し、入力表現とする。
- NR VQAでは、ステップアラウンディング風の階層的特徴統合を適用し、最終的な統合特徴マップのグローバル平均および標準偏差を計算して表現とする。
- 全結合(FC)層を用いて、品質に敏感な特徴をフレーム単位の品質スコアに回帰する。
- 人的知覚を模倣した時間的プーリング戦略を適用し、フレーム単位のスコアを1つの動画単位の品質スコアに集約する。
- トレーニングでは、初期値が0.00001の低学習率とバッチサイズ6を用いたAdam最適化手法を採用し、V100 GPU上で実行。トレーニング中にランダムクロップを用いたデータ拡張を実施。

実験結果
リサーチクエスチョン
- RQ1統合された深層学習フレームワークは、フルレファレンスおよびノーレファレンス両設定において、圧縮されたUGC動画の品質を効果的に評価できるか?
- RQ2中間層からのマルチレベル特徴統合は、単一レベルまたはエンド層特徴と比較して、品質評価性能をどのように向上させるか?
- RQ3特徴マップにおける構造的およびテクスチャ的類似性(FR)と、統合特徴のグローバル統計(NR)は、人的な動画品質知覚とどの程度相関しているか?
- RQ4人的知覚を模倣した時間的プーリング戦略は、標準的なプーリング手法を上回る人間の評価スコア予測性能を示すか?
- RQ5本モデルは、撮影条件が多様で複雑な歪みを含む実世界のUGCデータセットにも、どの程度一般化可能か?
主な発見
- 提案されたFR VQAモデルは、Compressed UGC VQAデータベースにおいて、最先端のモデルと比較して最高の性能を示し、SROCCが0.9215、RMSEが0.2483を達成した。
- KoNViD-1kデータセットでは、NR VQAモデルがSROCC 0.8134、KROCC 0.6201、PLCC 0.8143、RMSE 0.3695を達成し、比較対象の全NRモデルを上回った。
- LIVE-VQCデータセットでは、NRモデルがSROCC 0.7466、PLCC 0.7815を記録し、動画の動きを明示的にモデル化していないにもかかわらず、比較対象モデルの中で2番目に高いスコアを達成した。
- KoNViD-1kおよびLIVE-VQCの両データセットにおいて、BRISQUE、V-BLIINDS、TLVQM、VIDEVALよりも顕著に優れた性能を示し、多様なUGC歪みに対して強いロバストネスを示した。
- アブレーションスタディの結果、NRブランチにおけるマルチレベル特徴統合と階層的統合戦略が、特に複雑なUGCアーティファクトの処理において性能向上に不可欠であることが確認された。
- 人的知覚を模倣した時間的プーリング戦略は、動的コンテンツを含む動画において、人的品質スコアとの相関を向上させる寄与を示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。