Skip to main content
QUICK REVIEW

[論文レビュー] Blind Predicting Similar Quality Map for Image Quality Assessment

Da Pan, Ping Shi|arXiv (Cornell University)|May 22, 2018
Image and Video Quality Assessment参考文献 44被引用数 10
ひとこと要約

本稿では、完全畳み込みニューラルネットワーク(FCNN)を用い、完全参照型IQA手法からの類似度マップによってガイドされた、ピクセル単位の品質マップを予測する盲目的画像品質評価モデルBPSQMを提案する。その後、深層プーリングネットワークを用いてグローバル品質スコアを回帰する。本手法は、歪みに敏感な特徴マップにおけるガイド付き学習を通じて人間視覚系の特性を効果的にモデル化し、複数のデータセットで最先端の性能を達成する。

ABSTRACT

A key problem in blind image quality assessment (BIQA) is how to effectively model the properties of human visual system in a data-driven manner. In this paper, we propose a simple and efficient BIQA model based on a novel framework which consists of a fully convolutional neural network (FCNN) and a pooling network to solve this problem. In principle, FCNN is capable of predicting a pixel-by-pixel similar quality map only from a distorted image by using the intermediate similarity maps derived from conventional full-reference image quality assessment methods. The predicted pixel-by-pixel quality maps have good consistency with the distortion correlations between the reference and distorted images. Finally, a deep pooling network regresses the quality map into a score. Experiments have demonstrated that our predictions outperform many state-of-the-art BIQA methods.

研究の動機と目的

  • 参照画像が存在しない盲目的地図品質評価(BIQA)において、人間視覚系(HVS)の特性をモデル化する課題に取り組む。
  • 歪んだ画像からのみ、知覚的に意味のあるピクセル単位の品質マップを予測するデータ駆動型でエンドツーエンドの深層学習フレームワークを開発する。
  • 確立された完全参照型手法からの中間類似度マップを監視信号として活用することで、非参照型IQAの一般化性能と精度を向上させる。
  • 人間の知覚により整合性の高いピクセル単位の品質マップ予測が、パッチ単位のアプローチよりも優れているかを検証する。
  • HVS関連のマップを用いたガイド付き学習が、盲目的地図品質評価モデルの性能向上に寄与することを示す。

提案手法

  • フレームワークは、歪んだ画像からピクセル単位の品質マップを予測する完全畳み込みニューラルネットワーク(FCNN)を用い、完全参照型IQA手法(例:FSIM)から得られる類似度マップによってガイドする。
  • 類似度マップは学習中の監視信号として機能し、FCNNが知覚的劣化を反映する局所的なピクセル歪み特徴を学習できるようにする。
  • 予測された品質マップを1つのグローバル品質スコアに集約するために、深層プーリングネットワーク(DPN)を用いる。これは標準的なプーリング戦略を上回る性能を示す。
  • モデルは2段階のプロセスで訓練される:まず、FCNNを類似度マップの監視のもとで訓練し、次にDPNを予測品質マップから主観的スコアへのマッピングを学習させる。
  • Koniq10kデータセットでの事前学習を用いて初期化することで、特にCLIVEのような小さなデータセットにおける一般化性能を向上させる。
  • 検証データに基づく学習関数を用いた非線形回帰(式5)を適用し、最終的な品質スコアを精緻化する。

実験結果

リサーチクエスチョン

  • RQ1深層学習モデルは、歪んだ画像のみを用いて盲目的地図品質評価においてピクセルレベルの品質マップを予測できるか?
  • RQ2完全参照型IQA手法からの類似度マップを監視信号として用いることで、予測された品質マップの知覚的一致性が向上するか?
  • RQ3ピクセル単位の品質マップ予測の性能は、パッチ単位またはグローバル特徴ベースのアプローチと比較してどのように異なるか?
  • RQ4深層プーリングネットワークは、予測されたピクセル単位の品質マップからグローバル品質スコアを効果的に回帰できるか?
  • RQ5Koniq10kのような大規模で多様なデータセットでの事前学習は、CLIVEのような小さな、多様性に欠けるデータセットにおける一般化性能を向上させるか?

主な発見

  • Koniq10kデータセットにおいて、BPSQMはSRCC=0.756およびPLCC=0.734を達成し、大多数の最先端手法を上回る性能を示した。
  • CLIVEデータセットでは、BPSQM-PreがSRCC=0.716およびPLCC=0.721を達成したが、Koniq10kでの事前学習により、SRCC=0.789およびPLCC=0.773に顕著な向上を示した。
  • モデルは強力な一般化性能を示し、TID2008の4つの歪みタイプ(JP2K、JPEG、WN、BLUR)において中央値SRCCが0.910に達し、BRISQUEやBIECONを上回った。
  • BPSQMが予測する品質マップは、人間の知覚と強い一貫性を示しており、特にノイズやぼやけた顔の領域が暗く表示される点で裏付けられた。
  • ピクセル単位の品質マップの使用は、BIECON や FSIM との視覚的比較によって、パッチベースのマップよりも知覚的整合性に優れていることが示された。
  • Koniq10kでの事前学習は、小さなデータセットにおける性能を顕著に向上させた。これは、モデルの一般化性能が、訓練データの多様性と規模に大きく依存していることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。