Skip to main content
QUICK REVIEW

[論文レビュー] A strong baseline for image and video quality assessment

Shaoguo Wen, Junle Wang|arXiv (Cornell University)|Nov 13, 2021
Image and Video Quality Assessment参考文献 31被引用数 8
ひとこと要約

本稿では、グローバル特徴を抽出するために単一のResNet-18バックボーンを用い、トレーニング最適化を組み合わせた、シンプルでありながら強力な統合型ディープラーニングモデルを提案する。このモデルは、公開および非公開データセットで最先端の性能を達成し、VGG-19 や ResNet-50 といった標準ベースラインを上回る。圧縮を伴うUGC、PGC、ゲーム動画など、実世界の応用に向けた3つの事前学習済みモデルをリリースする。

ABSTRACT

In this work, we present a simple yet effective unified model for perceptual quality assessment of image and video. In contrast to existing models which usually consist of complex network architecture, or rely on the concatenation of multiple branches of features, our model achieves a comparable performance by applying only one global feature derived from a backbone network (i.e. resnet18 in the presented work). Combined with some training tricks, the proposed model surpasses the current baselines of SOTA models on public and private datasets. Based on the architecture proposed, we release the models well trained for three common real-world scenarios: UGC videos in the wild, PGC videos with compression, Game videos with compression. These three pre-trained models can be directly applied for quality assessment, or be further fine-tuned for more customized usages. All the code, SDK, and the pre-trained weights of the proposed models are publicly available at https://github.com/Tencent/CenseoQoE.

研究の動機と目的

  • 複雑なアーキテクチャを用いずに、既存の手法を上回る性能を発揮する、強力でシンプルかつ効果的なベースラインを確立すること。
  • マルチブランチ特徴統合や過度に複雑なネットワークに依存する従来のモデルの限界を是正すること。
  • ユーザー生成コンテンツ、圧縮されたプロフェッショナルコンテンツ、ゲームストリーミングなど、多様な商業的シナリオにおける実世界の品質評価の実用的解決策を提供すること。
  • 産業および研究現場での即時利用やファインチューニングを可能にするために、事前学習済みモデルとコードをリリースすること。
  • 訓練テクニックによる性能向上に依存しない、公平なベンチマークを実現する強固なベースラインを提供すること。

提案手法

  • モデルは、入力画像または動画フレームからグローバル特徴表現を抽出するために、単一のResNet-18バックボーンを用いる。マルチブランチや複雑なアーキテクチャを回避する。
  • 一般化性能を向上させるために、トレーニング中にランダムな水平反転およびランダムクロッピングなどのデータ拡張技術を適用する。
  • 安定したトレーニングと過学習の防止を目的に、重み減衰とモーメンタムを併用したコサインスケジューリングの学習率スケジュールを用いる。
  • 予測された品質スコアと人間によるアノテーションスコアの差を最小化する損失関数を用いて、平均意見スコア(MOS)回帰によりトレーニングを行う。
  • 初期学習率1e-4、最小学習率1e-7、L2重み減衰5e-4を含むハイパーパramータチューニングを含むトレーニングプロセスを実施する。
  • 最終的なモデルは、3つの異なる実世界のデータセットでファインチューニングされる:圧縮を伴う野生のUGC動画、圧縮を伴うPGC動画、圧縮を伴うゲーム動画。

実験結果

リサーチクエスチョン

  • RQ1複雑なアーキテクチャやマルチブランチ特徴統合を用いずに、単一ブランチのディープラーニングモデルが、画像および動画品質評価で強力な性能を達成できるか?
  • RQ2VGG-19 や ResNet-50 といった確立されたベースラインと比較して、本モデルは公開および非公開データセットにおいて人間の知覚とどの程度相関するか?
  • RQ3多様な実世界の動画シナリオにトレーニングされた統合モデルが、圧縮や自然な歪みといった異なる品質劣化タイプにどの程度一般化できるか?
  • RQ4データ拡張や学習率スケジューリングなどの標準的なトレーニング技術の使用が、単純なベースライントレーニングに比べて性能を顕著に向上させるか?
  • RQ5本モデルが、将来的な研究および産業分野における品質評価の信頼性の高い高パフォーマンスベースラインとして機能できるか?

主な発見

  • LIVE-VQCデータセットでは、本モデルがPLCC 0.7575、SRCC 0.7390を達成し、VGG-19をPLCC 0.04、SRCC 0.08上回る。
  • KoNViD-1Kデータセットでは、PLCC 0.8245、SRCC 0.8185を達成し、比較対象手法の中で2位を記録する。
  • YouTube-UGCデータセットでは、PLCC 0.7691、SRCC 0.7554を達成し、ユーザー生成コンテンツにおける優れた一般化性能を示す。
  • 非公開データセットでは、圧縮を伴うゲーム動画に対してPLCC 0.971、SRCC 0.968を達成し、高圧縮環境下での優れた性能を示す。
  • 圧縮を伴うPGC動画ではPLCC 0.961、SRCC 0.959、野生のUGC動画ではPLCC 0.902、SRCC 0.880を達成し、実世界の状況下でも堅牢であることを確認する。
  • UGC、PGC、ゲーム動画用にリリースされた事前学習済みモデルは、即時利用可能またはファインチューニング可能であり、コードと重みが公開されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。