Skip to main content
QUICK REVIEW

[論文レビュー] Human perception in computer vision

Ron Dekel|arXiv (Cornell University)|Jan 17, 2017
Visual Attention and Saliency Detection参考文献 47被引用数 4
ひとこと要約

この論文は、ImageNetで訓練された深層ニューラルネットワーク(DNN)が、人間の視覚的知覚の計算的側面を示しているかどうかを調査する。それは、DNNの活性化変化を心理学的に測定された知覚感受性と比較することで行っている。その結果、中程度のDNN層が画像変化への感受性と相関しており、後段の層がセグメンテーション、クラウディング、形状知覚と相関していることが判明した。これは、異なるアーキテクチャを持つにもかかわらず、一般化された視覚的計算が、DNNと人間の両方で同様の最適解に収束する可能性を示唆している。

ABSTRACT

Computer vision has made remarkable progress in recent years. Deep neural network (DNN) models optimized to identify objects in images exhibit unprecedented task-trained accuracy and, remarkably, some generalization ability: new visual problems can now be solved more easily based on previous learning. Biological vision (learned in life and through evolution) is also accurate and general-purpose. Is it possible that these different learning regimes converge to similar problem-dependent optimal computations? We therefore asked whether the human system-level computation of visual perception has DNN correlates and considered several anecdotal test cases. We found that perceptual sensitivity to image changes has DNN mid-computation correlates, while sensitivity to segmentation, crowding and shape has DNN end-computation correlates. Our results quantify the applicability of using DNN computation to estimate perceptual loss, and are consistent with the fascinating theoretical view that properties of human perception are a consequence of architecture-independent visual learning.

研究の動機と目的

  • ImageNetで訓練された深層ニューラルネットワーク(DNN)の計算プロセスが、人間の視覚的知覚と相関しているかどうかを調査すること。
  • 画像変化、セグメンテーション、クラウディング、形状への知覚感受性が、DNN処理のどの段階で最も強く反映されているかを特定すること。
  • DNNの表現が、タスクの難易度や分類の一貫性とは無関係に、人間の心理物理学的反応を予測するモデルとして機能できるかどうかを評価すること。
  • DNNが脳機能のモデル化や画像処理における知覚損失メトリクスの設計に、どのような可能性を秘めているかを評価すること。

提案手法

  • 人間の知覚感受性を画像変化に対して測定するための制御された心理物理学データセット(Local Image Masking Database)を用い、1,080枚の画像と変動するノイズ摂動を用いる。
  • ImageNetで訓練されたDNN(例:AlexNet、VGG)を用い、平均絶対活性化差と相互情報量を用いて、各層における表現の変化を計算する。
  • 各層における知覚感受性とDNN活性化変化を定量的に比較し、人間の知覚を最もよく予測する層を特定する。
  • 画像変化の顕著さ、ゲシュタルト効果(セグメンテーション、クラウディング、形状)、コントラスト定常性といった知覚現象に焦点を当てる。
  • カテゴリ間で同じ固有の難易度を持つ簡素化された非自然な刺激を用いることで、タスク固有の混同要因を分離する。
  • DNNに基づく知覚メトリクスを、単純な画像統計と詳細な心理物理学モデルと比較し、予測力の評価を行う。

実験結果

リサーチクエスチョン

  • RQ1異なる層における深層ニューラルネットワークの計算が、人間の画像変化への知覚感受性と相関しているか?
  • RQ2セグメンテーション、クラウディング、形状といった複雑な視覚的現象に対する人間の知覚を最もよく予測するのはどのDNN層か?
  • RQ3DNNの表現が、コントラスト定常性やバンドパスフィルタリングといった知覚メカニズムをどの程度反映しているか?
  • RQ4DNNベースの表現が、タスク固有のバイアスとは無関係に、人間の視覚的知覚の正確で汎用的なモデルとして機能できるか?
  • RQ5DNNの予測力は、従来の画像統計と詳細な知覚モデルに比べて、知覚損失を推定する際にどの程度優れているか?

主な発見

  • 画像変化への知覚感受性は、中程度のDNN層における活性化変化と強く相関しており、これらの層が文脈依存の顕著さを捉えていることを示している。
  • ゲシュタルト現象(セグメンテーション、クラウディング、形状)への感受性は、後段のDNN計算と最も強く相関しており、ネットワーク終端部の表現がシステムレベルの知覚処理を反映している可能性を示唆している。
  • コントラスト定常性は、初期層でのバンドパスフィルタリングに続く、深層での補正を経て、DNNの計算にも反映されており、人間の視覚伝受と整合している。
  • DNNベースの知覚メトリクスは、単純な画像統計を上回り、詳細な心理物理学モデルと同等の性能を示して、人間の知覚反応を予測している。
  • 結果は、一般化された視覚的計算が、アーキテクチャの違いに関係なく、DNNと生物学的システムの両方で同様の最適解に収束する理論的見解を支持している。
  • 3次元構造や対称性に関連する知覚効果には、強いDNN相関が認められないため、フィードフォワードDNNが特定の高レベル知覚現象をモデル化する上で限界がある可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。