Skip to main content
QUICK REVIEW

[論文レビュー] Eigen-Distortions of Hierarchical Representations

Alexander Berardino, Johannes Ballé|arXiv (Cornell University)|Oct 6, 2017
Visual Attention and Saliency Detection参考文献 16被引用数 21
ひとこと要約

本稿では、人間の視覚と人工モデルの間の知覚的類似性を評価するため、Fisher情報に基づく手法を導入し、モデルが予測する最も顕著で、最も顕著でない画像歪みを生成する。その結果、局所的ゲイン制御を備えた生物学的にインspiredな初期視覚モデルが、VGG16 や歪み学習済みCNNなど深層ネットワークを上回り、人間の歪みへの感受性をよりよく予測することが明らかになった。

ABSTRACT

We develop a method for comparing hierarchical image representations in terms of their ability to explain perceptual sensitivity in humans. Specifically, we utilize Fisher information to establish a model-derived prediction of sensitivity to local perturbations of an image. For a given image, we compute the eigenvectors of the Fisher information matrix with largest and smallest eigenvalues, corresponding to the model-predicted most- and least-noticeable image distortions, respectively. For human subjects, we then measure the amount of each distortion that can be reliably detected when added to the image. We use this method to test the ability of a variety of representations to mimic human perceptual sensitivity. We find that the early layers of VGG16, a deep neural network optimized for object recognition, provide a better match to human perception than later layers, and a better match than a 4-stage convolutional neural network (CNN) trained on a database of human ratings of distorted image quality. On the other hand, we find that simple models of early visual processing, incorporating one or more stages of local gain control, trained on the same database of distortion ratings, provide substantially better predictions of human sensitivity than either the CNN, or any combination of layers of VGG16.

研究の動機と目的

  • 人工階層的表現が人間の知覚的感受性とどの程度一致するかを体系的にテストするための手法を開発すること。
  • 人間の識別閾値を用いて、モデルが予測する極端な歪み(最も顕著で、最も顕著でないもの)を特定・テストすること。
  • 深層ネットワーク(例:VGG16)と生物学的にインspiredなモデルの、人間の知覚に対する予測性能を比較すること。
  • 分類タスクで優れた性能を示すにもかかわらず、なぜ深層ニューラルネットワークが人間のような知覚的感受性に一般化できないかを調査すること。
  • 既知の生理的メカニズム(例:局所的ゲイン制御)を組み込むことで、知覚モデリングがどの程度改善されるかを評価すること。

提案手法

  • 本手法は、知覚モデルのFisher情報行列(FIM)を用い、最大および最小固有値に対応する固有ベクトルを計算することで、与えられた画像に対して最も顕著で、最も顕著でない歪みを特定する。
  • FIMは、r(内部神経応答)とx(画像入力)の条件付き密度p(r|x)から導出される。
  • これらの歪みに対する識別閾値は、人間被験者を用いて実験的に測定され、検出可能性が評価される。
  • 最も顕著でない歪みと最も顕著な歪みの間の、実験的に測定された閾値の比が、人間の知覚との整合性の絶対的指標として用いられる。
  • 本手法は、VGG16の各層、人間の歪み評価に基づいて学習された4段階のCNN、および局所的ゲイン制御を備えたLGNの生物学的構造モデルに適用された。
  • 本手法により、人間の知覚に類似した刺激ではなく、モデル最適化された刺激を用いた「チューリングテスト」が可能になる。

実験結果

リサーチクエスチョン

  • RQ1Fisher情報は、人工モデルと人間の知覚の間の乖離を露呈する、標的化されたモデル予測歪みを生成するために利用可能か?
  • RQ2VGG16の初期層と深層層は、画像歪みに対する人間の感受性をどの程度正しく予測できるか?
  • RQ3既知の視覚系メカニズム(例:オン/オフ経路、局所的ゲイン制御)を備えた生物学的にインspiredなモデルは、一般の深層ネットワークを上回り、人間の知覚閾値をよりよく予測できるか?
  • RQ4分類タスクで優れた性能を示すにもかかわらず、なぜ深層ネットワークは人間のような知覚的感受性に一般化できないのか?
  • RQ5特に生理的制約を含むモデル構造は、一般化性能および知覚予測精度をどの程度向上させるか?

主な発見

  • VGG16の初期層(フロント、レイヤー3)は、深さが進むにつれて精度が低下するが、後続のレイヤーに比べて人間の知覚的感受性をよりよく予測している。
  • 人間の歪み評価に基づいて学習された4段階のCNNは、より深いVGG16のレイヤーを上回ったが、初期VGG16レイヤーには及ばなかった。
  • 局所的ゲイン制御や初期視覚系生理学的構造(例:LGNモデル)を組み込んだモデルは、VGG16および歪み学習済みCNNを著しく上回り、最も複雑なLGNモデル(LGG)は人間データとの相関係数ρ = .83を達成した。
  • 複数のLGN機能的要素を含むLGGモデルは、任意のVGG16レイヤーやVGG-IQAモデルよりも高い予測精度を持つ固有歪みを生成した。
  • 深層ネットワークが人間の知覚と一致しないことは、人間評価の標準的交差検証では検出できなかったが、モデルが合成した固有歪みを用いたテストにより明らかになった。
  • 霊長類の視覚生理学に基づく構造的制約(例:局所的ゲイン制御)は、構造のない深層ネットワークよりも優れた正則化因子となり、より良い一般化性能を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。