Skip to main content
QUICK REVIEW

[論文レビュー] Deep Optimization model for Screen Content Image Quality Assessment using Neural Networks

Xuhao Jiang, Liquan Shen|arXiv (Cornell University)|Mar 2, 2019
Image and Video Quality Assessment参考文献 42被引用数 11
ひとこと要約

本稿では、畳み込みニューラルネットワークを用いて、フルレファレンス(FR)およびノーレファレンス(NR)スクリーンコンテンツ画像(SCI)の品質評価のための深層最適化モデル、QODCNNを提案する。アダプティブ品質プーリング、知覚的関連性に基づくデータ選択、ノイズに強い特徴統合を統合することで、ベンチマークデータセット上で最先端の性能を達成し、精度および一般化性能の両面で既存のFRおよびNR手法を上回った。

ABSTRACT

In this paper, we propose a novel quadratic optimized model based on the deep convolutional neural network (QODCNN) for full-reference and no-reference screen content image (SCI) quality assessment. Unlike traditional CNN methods taking all image patches as training data and using average quality pooling, our model is optimized to obtain a more effective model including three steps. In the first step, an end-to-end deep CNN is trained to preliminarily predict the image visual quality, and batch normalized (BN) layers and l2 regularization are employed to improve the speed and performance of network fitting. For second step, the pretrained model is fine-tuned to achieve better performance under analysis of the raw training data. An adaptive weighting method is proposed in the third step to fuse local quality inspired by the perceptual property of the human visual system (HVS) that the HVS is sensitive to image patches containing texture and edge information. The novelty of our algorithm can be concluded as follows: 1) with the consideration of correlation between local quality and subjective differential mean opinion score (DMOS), the Euclidean distance is utilized to measure effectiveness of image patches, and the pretrained model is fine-tuned with more effective training data; 2) an adaptive pooling approach is employed to fuse patch quality of textual and pictorial regions, whose feature only extracted from distorted images owns strong noise robust and effects on both FR and NR IQA; 3) Considering the characteristics of SCIs, a deep and valid network architecture is designed for both NR and FR visual quality evaluation of SCIs. Experimental results verify that our model outperforms both current no-reference and full-reference image quality assessment methods on the benchmark screen content image quality assessment database (SIQAD).

研究の動機と目的

  • スクリーンコンテンツ画像(SCIs)は構造的・コンテンツ的特徴が自然画像と著しく異なるため、従来のIQA手法がSCIsの評価において限界を示す点を是正する。
  • 特にテクスチャやエッジが豊富な領域における知覚的品質差を効果的に捉えることができる、深層学習ベースのモデルを開発する。
  • 最適化されたトレーニング戦略および特徴統合戦略により、フルレファレンスおよびノーレファレンス設定の両方における一般化性能とロバストネスを向上させる。
  • 人間視覚系(HVS)のテクスチャおよびエッジへの感受性を活用し、高影響度の画像パッチに注目することでモデル性能を向上させる。
  • バッチ正則化およびL2正則化を用いることで、過学習を低減し、トレーニング効率を向上させる。

提案手法

  • バッチ正則化(BN)およびL2正則化を用いて、収束を加速し、フィッティング性能を向上させるエンド・ツー・エンドの深層CNNをトレーニングする。
  • 二段階トレーニングプロセスを採用:まず、主観的DMOSスコアとの相関が高いかつ高いトレーニングサンプルを優先するデータ選択法(TMED)を用いて、事前学習済みモデルをファインチューニングする。
  • ノイズに強いインデックス(VLSD)に基づく適応的重み付け戦略(WLQVLSD)を導入し、テクスチャおよびエッジを含むパッチに重点を置いた局所的品質予測の統合を実現する。
  • FRおよびNR入力を処理できるように、結合層を用いて両設定を統合したアーキテクチャを実現する。
  • クロップを用いたデータオーグメンテーションを適用し、トレーニングデータの多様性を高め、過学習を低減する。
  • 最終的な品質スコアは、VLSDから導出された適応的重みを用いて局所的品質予測をプーリングすることで得られ、知覚的関連性が向上する。

実験結果

リサーチクエスチョン

  • RQ1従来のIQA手法と比較して、スクリーンコンテンツ画像(SCIs)における視覚的品質予測をより効果的に行うために、深層CNNモデルをどのように最適化できるか?
  • RQ2知覚的関連性(DMOS相関)に基づくトレーニングデータ選択が、FRおよびNR設定におけるモデル性能に与える影響は何か?
  • RQ3ノイズに強いインデックス(VLSD)を用いた適応的プーリングは、SCI-IQAにおける平均プーリングと比較して、品質予測をどのように改善するか?
  • RQ4提案された最適化手法(TMEDおよびWLQVLSD)は、異なるデータベース間で一般化性能およびロバストネスをどの程度向上させるか?
  • RQ5モデルは、未学習データに対して強い一般化性能を維持しつつ、FRおよびNR両設定で優れた性能を達成できるか?

主な発見

  • QODCNN-NRモデルは、CNNベースのNRモデルPICNNと比較して顕著な性能向上を示し、より優れた一般化能力を示した。
  • SIQADベンチマークでは、提案されたFRおよびNRモデルがPSNR、SSIM、GMSD、VSI、PICNNを上回り、FRモデルは特化型のESIM指標と同等の性能を達成した。
  • ファインチューニング段階でトレーニングデータの70%を使用した場合に最適な性能が得られ、データ多様性とモデル一般化のバランスが取れていることを示した。
  • TMED(トレーニングデータ選択)およびWLQVLSD(適応的プーリング)の使用により、FRおよびNRモデルの両方で一貫した性能向上が得られた。NRモデルでは初期精度が高いため、より顕著な改善が見られた。
  • SCIDを用いたクロスデータベース評価により、モデルの強力な一般化能力が確認され、提案された最適化手法の有効性が裏付けられた。
  • バッチ正則化およびL2正則化の統合により、過学習が効果的に低減され、未学習のSCIデータセットに対してもモデルのロバストネスと一般化性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。