Skip to main content
QUICK REVIEW

[論文レビュー] A study of deep perceptual metrics for image quality assessment

Rémi Kazmierczak, Gianni Franchi|arXiv (Cornell University)|Feb 17, 2022
Image and Video Quality Assessment被引用数 6
ひとこと要約

本稿では、複数のネットワーク層および解像度における深層特徴を統合することで、画像品質評価を向上させるマルチスケール知覚的メトリック(MR-Perceptual)を提案する。さまざまな歪みに対して標準的な知覚的メトリックを上回り、教師あり学習とマルチスケール特徴統合が人間の知覚とより良好に一致することを示している。

ABSTRACT

Several metrics exist to quantify the similarity between images, but they are inefficient when it comes to measure the similarity of highly distorted images. In this work, we propose to empirically investigate perceptual metrics based on deep neural networks for tackling the Image Quality Assessment (IQA) task. We study deep perceptual metrics according to different hyperparameters like the network's architecture or training procedure. Finally, we propose our multi-resolution perceptual metric (MR-Perceptual), that allows us to aggregate perceptual information at different resolutions and outperforms standard perceptual metrics on IQA tasks with varying image deformations. Our code is available at https://github.com/ENSTA-U2IS/MR_perceptual

研究の動機と目的

  • 深層ニューラルネットワークに基づく知覚的メトリックの有効性を、画像品質評価(IQA)に対して調査すること。
  • 異なるDNNアーキテクチャ、学習手順、ハイパーパrameterが知覚的類似度推定に与える影響を評価すること。
  • さまざまな画像歪みにおいて、人間の知覚とより良好に一致する汎用的な知覚的メトリックを開発すること。
  • IQAタスクにおける最適な特徴抽出戦略および正規化技術を同定すること。

提案手法

  • AlexNet や ResNet50 などの異なるアーキテクチャを用いた深層ニューラルネットワーク(DNN)を用いて、知覚的メトリックを実験的に評価する。
  • 特徴抽出戦略として、特徴マップの線形連結とグラム行列による2次特徴の2通りを適用する。
  • 元画像と×2にアップサンプリングされた画像の2つの解像度を用いて、異なるスケールの知覚的情報を捉える。
  • 潜在空間における深層特徴間のL2距離を不一致度測度として使用する。
  • 教師あり、自己教師あり(SimCLR, MoCo, DINO)、ランダム初期化のさまざまな事前学習戦略を比較する。
  • 複数のブロックおよび解像度からの特徴を組み合わせるマルチスケール知覚的損失を提案する。

実験結果

リサーチクエスチョン

  • RQ1異なるDNNアーキテクチャは、IQAにおける知覚的メトリックの性能にどのように影響するか?
  • RQ2学習手順(教師あり vs. 自己教師あり vs. ランダム初期化)は、知覚的メトリックの品質にどのような影響を与えるか?
  • RQ3特徴抽出戦略(線形 vs. 2次)のどちらがより優れた知覚的類似度推定を実現するか?
  • RQ4マルチスケール入力は、知覚的メトリックのロバストネスおよび正確性にどのように影響するか?
  • RQ5どのような画像歪みタイプに対して、どのネットワーク層が最も判別力のある特徴を提供するか?

主な発見

  • ImageNet での教師あり学習は、すべてのIQAベンチマークで自己教師ありおよびランダム初期化を一貫して上回り、平均スコアは66.92を記録。次に良い手法の平均スコア65.30と比較して顕著な優位性を示した。
  • 『Trad』歪みセットでは、AlexNet の4番目および5番目の層が最良の性能を示した。一方、『CNN』、『SuperRes』、『Deblur』、『Color』セットでは、より前の層(2〜3番目)が最良の性能を示した。
  • 提案されたMR-Perceptualメトリックは、2AFCベンチマークで平均69.8%のスコアを達成し、Watching、Split-Brain、Puzzle、BiGANを含むすべてのベースラインを上回った。
  • マルチスケール特徴統合は性能を顕著に向上させ、すべての歪みタイプで単一解像度設定を上回った。
  • 2次特徴(グラム行列を介して)とマルチスタティスティクス集約は、特定の歪みに対して性能をさらに向上させた。
  • 自己教師あり学習の進展にもかかわらず、知覚的IQAにおいて教師あり事前学習が依然として最も効果的な戦略であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。