Skip to main content
QUICK REVIEW

[論文レビュー] RAN4IQA: Restorative Adversarial Nets for No-Reference Image Quality Assessment

Hongyu Ren, Diqi Chen|arXiv (Cornell University)|Dec 14, 2017
Image and Video Quality Assessment参考文献 29被引用数 11
ひとこと要約

本論文では、自由エネルギー脳理論にインspiredされたGANベースの非参照画像品質評価モデル、RAN4IQAを提案する。このモデルは、歪みのある画像パッチを復元し、復元のための知覚的利得(GoR)を測定することで、人間の視覚系の挙動を模倣する。TID2013およびLIVEデータセットにおいて、SROCCが0.948、PLCCが0.937を達成し、最先端の性能を示し、優れた一般化能力とロバストネスを示している。

ABSTRACT

Inspired by the free-energy brain theory, which implies that human visual system (HVS) tends to reduce uncertainty and restore perceptual details upon seeing a distorted image, we propose restorative adversarial net (RAN), a GAN-based model for no-reference image quality assessment (NR-IQA). RAN, which mimics the process of HVS, consists of three components: a restorator, a discriminator and an evaluator. The restorator restores and reconstructs input distorted image patches, while the discriminator distinguishes the reconstructed patches from the pristine distortion-free patches. After restoration, we observe that the perceptual distance between the restored and the distorted patches is monotonic with respect to the distortion level. We further define Gain of Restoration (GoR) based on this phenomenon. The evaluator predicts perceptual score by extracting feature representations from the distorted and restored patches to measure GoR. Eventually, the quality score of an input image is estimated by weighted sum of the patch scores. Experimental results on Waterloo Exploration, LIVE and TID2013 show the effectiveness and generalization ability of RAN compared to the state-of-the-art NR-IQA models.

研究の動機と目的

  • 歪みのある画像を評価する際の人間の視覚系の挙動を模倣する非参照画像品質評価モデルの開発。
  • 従来のNR-IQA手法が品質評価時に使用する知覚的復元プロセスを無視するという限界を解決すること。
  • 歪みのあるパッチと復元されたパッチ間の知覚的距離に基づく、新たな指標である復元の利得(GoR)の導入。
  • 敵対的学習と知覚的損失を用いることで、多様な歪みタイプとデータセットにわたる一般化能力とロバストネスの向上。
  • 標準ベンチマーク上での最先端NR-IQA手法との比較において、モデルの優位性を検証すること。

提案手法

  • モデルは3つのコンponentから構成される:歪みのある画像パッチを復元するrestorator、復元パッチと完全なパッチを区別するdiscriminator、GoRに基づいて品質スコアを予測するevaluator。
  • restoratorは、人間の知覚に整合する視覚的に妥当な再構成を保証するため、知覚的損失で訓練される。
  • 敵対的学習では、GANの学習プロセスを安定化させ、生成器の品質を向上させるためにWasserstein距離が用いられる。
  • GoRは、歪みのあるパッチと復元されたパッチ間の知覚的距離として定義され、歪みレベルに対して単調性を示す。
  • 最終的な画像品質スコアは、歪みの深刻度に応じて重み付けがなされたパッチ単位のスコアの重み付き和として計算される。
  • evaluatorは、FSIMに基づくラベルを用いてWaterloo Explorationで事前学習され、TID2013およびLIVEで微調整され、データセット間の一般化が図られる。

実験結果

リサーチクエスチョン

  • RQ1人間の視覚系の復元挙動を模倣するGANベースのモデルは、優れた非参照画像品質評価性能を達成できるか?
  • RQ2復元の知覚的利得(GoR)は歪みレベルに対して単調性を示すか?その場合、信頼性の高い品質予測が可能か?
  • RQ3知覚的損失とWasserstein GANの学習を組み合わせることで、画像復元の品質とその後続する品質評価がどのように向上するか?
  • RQ4提案されたモデルは、歪みタイプとレベルが異なるさまざまなデータセットにどの程度一般化できるか?
  • RQ5restorator、discriminator、evaluator、重み付けスコアリング戦略の各コンponentが、全体の性能に果たす寄与度は何か?

主な発見

  • RAN4IQAはTID2013データセットでSROCC 0.948、PLCC 0.937を達成し、すべての最先端NR-IQA手法を上回る性能を示した。
  • TID2013上でのSROCCおよびPLCCにおいて、すべての他のNR-IQAモデルと比較して統計的に有意(p < 0.05)であった。
  • LIVEデータセットでも、比較されたすべてのNR-IQA手法の中で最高の性能を示し、強力な一般化能力を示した。
  • アブレーションスタディの結果、discriminatorを削除すると性能低下が最も顕著(SROCCが0.854に低下)し、restoratorを指導する上でその重要性が示された。
  • 知覚的損失や重み付けスコアリング戦略を削除した場合も顕著な性能低下が見られ、これらが知覚的一致性と空間忠実性を維持する上で重要であることが確認された。
  • Wasserstein損失を含まないモデルは、完全なモデルに比べてわずかに性能が劣り(SROCC: 0.936)、学習の安定化に寄与していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。