Skip to main content
QUICK REVIEW

[論文レビュー] Towards Deep Learning Methods for Quality Assessment of Computer-Generated Imagery

Markus Utke, Saman Zadtootaghaj|arXiv (Cornell University)|May 2, 2020
Image and Video Quality Assessment被引用数 4
ひとこと要約

本稿では、コンピュータ生成画像(CGI)の分野、特にゲームコンテンツを対象として、深層学習に基づく参照なし(NR)動画品質評価指標を提案する。本研究では、VMAFスコアでアノテーションされたフレーム上で事前学習済みXceptionネットワークを微調整することで、転移学習を活用し、約5,000フレームの訓練データでの高精度を達成した。これは、畳み込みニューラルネットワーク(CNN)が、合成された品質指標で訓練された場合に、ゲーム動画の品質を効果的に予測できる可能性を示している。

ABSTRACT

Video gaming streaming services are growing rapidly due to new services such as passive video streaming, e.g. Twitch.tv, and cloud gaming, e.g. Nvidia Geforce Now. In contrast to traditional video content, gaming content has special characteristics such as extremely high motion for some games, special motion patterns, synthetic content and repetitive content, which makes the state-of-the-art video and image quality metrics perform weaker for this special computer generated content. In this paper, we outline our plan to build a deep learningbased quality metric for video gaming quality assessment. In addition, we present initial results by training the network based on VMAF values as a ground truth to give some insights on how to build a metric in future. The paper describes the method that is used to choose an appropriate Convolutional Neural Network architecture. Furthermore, we estimate the size of the required subjective quality dataset which achieves a sufficiently high performance. The results show that by taking around 5k images for training of the last six modules of Xception, we can obtain a relatively high performance metric to assess the quality of distorted video games.

研究の動機と目的

  • コンピュータ生成画像(CGI)、特にゲームコンテンツに特化した深層学習ベースの参照なし(NR)動画品質評価指標の開発。
  • 参照信号が入手できない状況下で、事前学習済み畳み込みニューラルネットワーク(CNN)を用いたゲーム動画の品質評価の可能性の調査。
  • CGI品質評価における有効な転移学習を実現するための最適なCNNアーキテクチャ、微調整戦略、最小データセットサイズの特定。
  • 主観的品質の代理指標としてVMAFスコアを用いて訓練したモデルが、実際の平均意見スコア(MOS)データに移行する前に、高精度なモデルを生成できるかどうかの評価。

提案手法

  • VMAFスコアを正例として使用し、ゲームのフレーム約5,000枚のデータセットを用いて、事前学習済みXception CNNの最後の6モジュールを微調整する。
  • 事前学習済みCNNアーキテクチャを、コンピュータ生成動画コンテンツの特性に適応させるために、転移学習を適用する。
  • 冗長性を低減しつつモデル性能を維持するため、n番目のフレーム(n = 53)を間隔をあけて抽出するデータサンプリング手法を適用する。
  • VGGやXceptionなどの異なるCNNアーキテクチャと、微調整対象のモジュール数(1、4、6モジュール)を変化させた場合の性能を比較する。
  • フレームレベルおよび動画レベルの品質予測において、RMSEとSRCCを用いてモデル性能を評価する。
  • 一般化性能の向上を図るため、データオーグメンテーション戦略(ランダムクロッピング対比センタークロッピング)を検討する。

実験結果

リサーチクエスチョン

  • RQ1機械学習ベースの品質評価手法は、コンピュータ生成画像に適しているか?
  • RQ2事前学習済みディープCNNを、CGI品質評価に適した性能を得られるように再訓練するには、どのようにすべきか?
  • RQ3最先端のモデルの中から、CGI品質評価において最も優れた性能を示す事前学習済みCNNアーキテクチャはどれか?
  • RQ4この文脈における有効な転移学習を実現するには、何フレーム分の訓練データが必要か?

主な発見

  • Xceptionネットワークの最後の6モジュールを約5,000フレームで微調整した結果、動画レベルのSRCCが0.987、RMSEが3.11の高精度な指標が得られた。
  • Xceptionアーキテクチャは他のモデルを上回り、5,287フレーム(n=53)で微調整した場合、動画レベルのPCCが0.987、RMSEが3.11を達成した。
  • 微調整対象のモジュール数を増やすことで性能向上が見られたが、小さなデータセットでは効果の逓減と過学習のリスクが増加した。
  • トレーニング時にランダムクロッピングを適用した場合、センタークロッピングよりも優れた性能を示し、より多様なデータが一般化性能の向上に寄与することが示唆された。
  • 53フレームおきにフレームを抽出(n=53)することで、データセットサイズとモデル性能のバランスが良く、精度に顕著な低下は認めなかった。
  • トレーニングおよび検証セットに重複するゲームが含まれても性能に顕著な向上が見られなかったため、この設定ではドメインの重複に対してもモデルが頑健であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。