Skip to main content
QUICK REVIEW

[論文レビュー] Deep saliency: What is learnt by a deep network about saliency?

Sen He, Nicolas Pugeault|arXiv (Cornell University)|Jan 12, 2018
Visual Attention and Saliency Detection参考文献 8被引用数 6
ひとこと要約

本稿では、深層畳み込みニューラルネットワークが視覚的注目度検出のために学習する内容を解釈するための可視化手法を提案する。活性を逆伝播させて画像空間に再構築することで、微調整によってより深い層のニューロンの受容野が中心周囲パターンに変化することが明らかになった。これは人間の視覚的注目度理論と一致しており、タスク固有の適応を通じて生物学的に妥当な注目度特徴が学習されていることを示している。

ABSTRACT

Deep convolutional neural networks have achieved impressive performance on a broad range of problems, beating prior art on established benchmarks, but it often remains unclear what are the representations learnt by those systems and how they achieve such performance. This article examines the specific problem of saliency detection, where benchmarks are currently dominated by CNN-based approaches, and investigates the properties of the learnt representation by visualizing the artificial neurons' receptive fields. We demonstrate that fine tuning a pre-trained network on the saliency detection task lead to a profound transformation of the network's deeper layers. Moreover we argue that this transformation leads to the emergence of receptive fields conceptually similar to the centre-surround filters hypothesized by early research on visual saliency.

研究の動機と目的

  • 深層畳み込みニューラルネットワークが注目度検出に学習する表現、特により深い層におけるものを探る。
  • 個々のニューロンの受容野を可視化することで、特徴の鋭敏化を理解する。
  • 事前学習済みネットワークが注目度検出タスクに微調整された際の特徴表現の変化を、特に特徴表現の変化に注目して検討する。
  • 学習された特徴が、中心周囲フィルタリングと呼ばれる視覚的注目度理論と整合するかを検証する。
  • 元のネットワークアーキテクチャに再び入力することで、可視化されたパターンの妥当性を検証する。

提案手法

  • 中間層の個々のニューロンの活性を一定値(例:0.5 から 3)に手動で固定し、反応を分離する。
  • 逆伝播をデコンボリューション、ReLU、アップサンプリングの順序を逆転させて実行し、各ニューロンを最大に活性化する入力パターンを再構築する。
  • プーリングによる空間解像度の損失を回避するため、スパarsな特徴マップ(1つの非ゼロ値を有する)を繰り返し適用してアップサンプリングする。
  • 学習済みフィルタの転置を用いてデコンボリューションを実行し、特徴マップの活性を生成した入力パターンを再構築する。
  • 逆伝播中にReLU非線形性を適用し、ネットワークの非線形活性化挙動を保持する。
  • 再び可視化されたパターンをネットワークに供給し、ターゲットニューロンおよび隣接ニューロンの活性レベルを測定することで、可視化パターンの妥当性を検証する。

実験結果

リサーチクエスチョン

  • RQ1注目度検出タスクに微調整した後、深層ネットワークのニューロンの受容野は、事前学習済み状態と比較してどのように変化するか?
  • RQ2より深い層の学習済み受容野は、初期視覚的注目度理論で提唱された中心周囲フィルタリング機構と整合するパターンを示すか?
  • RQ3可視化されたパターンは、ターゲットニューロンおよび隣接ニューロンをどの程度活性化するか?これは特徴符号化の冗長性および側方抑制のメカニズムに何を示唆するか?
  • RQ4逆伝播によって得られたパターンは、元のネットワークアーキテクチャにおいて、選択されたニューロンの真の活性化要因として信頼できるか?
  • RQ5微調整は、一般的なImageNet特徴をタスク固有の注目度表現に変換する上で、果たす役割は何か?

主な発見

  • 注目度検出タスクにVGG-19ネットワークを微調整した後、より深い層のニューロンの受容野は、一般的なエッジやテクスチャパターンから明確な中心周囲構造に変化した。
  • 中心周囲受容野の出現は、事前学習済みImageNetモデルには存在せず、タスク固有の微調整によってのみ生じた。
  • 可視化されたパターンは、意図したとおりターゲットニューロンを活性化した。複数回の実行において一貫した活性化レベルが得られた。
  • 同じ層内の隣接ニューロンに対しても活性化が観察されたため、中心周囲特徴の符号化にネットワーク全体で冗長性が存在することが示された。
  • 一部のニューロンは活性化時に抑制されたため、生物学的視覚系と類似した側方抑制メカニズムが存在することが示唆された。
  • 活性化エネルギーが増加するにつれてパターンの伝播が波のように広がる様子が観察され、高い活性化値では受容野応答がより広範かつぼんやりとしたものになることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。