Skip to main content
QUICK REVIEW

[論文レビュー] A Novel Just-Noticeable-Difference-based Saliency-Channel Attention Residual Network for Full-Reference Image Quality Predictions

Soomin Seo, Sehwan Ki|arXiv (Cornell University)|Feb 14, 2019
Image and Video Quality Assessment参考文献 77被引用数 5
ひとこと要約

本稿では、人間視覚系(HVS)の特徴——特に最小識別差(JND)と視覚的注目性——を、注目性に基づくチャネルおよび空間アテンションを備えた残差ネットワークに統合した、フルレファレンス画像品質評価のための新しい深層学習フレームワーク、JND-SalCARを提案する。視覚的注目性マップを事前知識として用いてパッチ重み学習をガイドすることで、大規模なIQAデータセットにおいて最先端の性能を達成し、人的評価スコアとのスピアマンおよびピアソン相関係数が顕著に向上した。

ABSTRACT

Recently, due to the strength of deep convolutional neural networks (CNN), many CNN-based image quality assessment (IQA) models have been studied. However, previous CNN-based IQA models likely have yet to utilize the characteristics of the human visual system (HVS) fully for IQA problems when they simply entrust everything to the CNN, expecting it to learn from a training dataset. However, in this paper, we propose a novel saliency-channel attention residual network based on the just-noticeable-difference (JND) concept for full-reference image quality assessments (FR-IQA). It is referred to as JND-SalCAR and shows significant improvements in large IQA datasets with various types of distortion. The proposed JND-SalCAR effectively learns how to incorporate human psychophysical characteristics, such as visual saliency and JND, into image quality predictions. In the proposed network, a SalCAR block is devised so that perceptually important features can be extracted with the help of saliency-based spatial attention and channel attention schemes. In addition, a saliency map serves as a guideline for predicting a patch weight map in order to afford stable training of end-to-end optimization for the JND-SalCAR. To the best of our knowledge, our work presents the first HVS-inspired trainable FR-IQA network that considers both visual saliency and the JND characteristics of the HVS. When the visual saliency map and the JND probability map are explicitly given as priors, they can be usefully combined to predict IQA scores rated by humans more precisely, eventually leading to performance improvements and faster convergence. The experimental results show that the proposed JND-SalCAR significantly outperforms all recent state-of-the-art FR-IQA methods on large IQA datasets in terms of the Spearman rank order coefficient (SRCC) and the Pearson linear correlation coefficient (PLCC).

研究の動機と目的

  • 既存のCNNベースのIQAモデルが、視覚的注目性や最小識別差(JND)といった人間視覚系(HVS)の特徴を十分に活用できないという限界に対処すること。
  • HVSの事前知識を明示的に組み込んだ学習可能でエンドツーエンドの深層学習フレームワークを構築すること。
  • 視覚的注目性マップを用いてパッチ重み予測をガイドすることで、トレーニングの安定性と収束性を向上させること。
  • 最先端の手法と比較して、大規模なフルレファレンスIQAデータセットにおいて優れた性能を達成すること。
  • JND確率マップと注目性マップを組み合わせた事前知識が、予測精度とモデルの頑健性を向上させることを実証すること。

提案手法

  • 視覚的注目性マップに基づいて空間アテンションとチャネルアテンションを適用する新しいSalCARブロックを提案し、知覚的に重要な特徴を強調する。
  • 視覚的注目性マップを用いてパッチ重みマップの予測をガイドすることで、JND-SalCARネットワークにおけるエンドツーエンドトレーニングの安定性を向上させる。
  • 人間の知覚閾値をモデル化するために最小識別差(JND)の概念を採用し、JND確率マップを追加の事前知識として統合する。
  • 複数スケールにわたるアテンション機構を適用することで特徴表現を強化する、残差ネットワークアーキテクチャを設計する。
  • トレーニング中に明示的な事前知識(注目性とJNDマップ)を用いることで、人間の知覚との整合性を高め、品質予測を最適化する。
  • 予測品質スコアと人的評価スコアの差を最小化する損失関数を用いて、ネットワークをエンドツーエンドで訓練する。

実験結果

リサーチクエスチョン

  • RQ1人間視覚系(HVS)の特徴——特に視覚的注目性とJND——を明示的に統合することで、深層学習ベースのフルレファレンス画像品質評価が向上するか?
  • RQ2パッチ重み学習のガイドとして視覚的注目性マップを用いることで、IQAネットワークにおけるトレーニングの安定性と収束性にどのような影響を与えるか?
  • RQ3標準的なCNNベースのIQAモデルと比較して、JNDおよび注目性事前知識が予測精度をどの程度向上させるか?
  • RQ4学習可能でHVSにインspiredされたネットワークは、多様な歪みタイプにおいて、既存の最先端のFR-IQA手法を上回る性能を発揮できるか?
  • RQ5JND確率マップと注目性マップを組み合わせることで、IQAタスクにおける収束速度と一般化性能が向上するか?

主な発見

  • 提案されたJND-SalCARモデルは、大規模なフルレファレンスIQAデータセットにおいて最先端の性能を達成し、最近のすべてのSOTA手法を上回った。
  • KADID-10Kデータセットにおいて、スピアマン順位相関係数(SRCC)は0.948、ピアソン線形相関係数(PLCC)は0.945を達成した。
  • 注目性とJNDの事前知識の統合により、それらを備えないベースラインモデルと比較して、収束が速く、トレーニングがより安定した。
  • SalCARブロックは、空間的およびチャネル的アテンションを統合することで、知覚的に重要な特徴を効果的に強調し、特徴の識別能を向上させた。
  • パッチ重み予測のガイドとして視覚的注目性マップを用いることで、品質スコア回帰の頑健性と精度が顕著に向上した。
  • 多様な歪みタイプにわたる一般化性能が強く、HVSにインspiredされた設計が深層IQAにおいて有効であることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。