[論文レビュー] What Catches the Eye? Visualizing and Understanding Deep Saliency Models
本稿では、残差型デコーダと新しい指数的絶対距離(EAD)損失関数を備えた単純な深層注目度モデルを提案し、画素単位の注目予測において最先端の性能を達成した。また、高性能なモデルが特に動物や身体部位といった意味的特徴を学習していることを可視化する手法を導入し、人間の注目度が低レベルの特徴を越えた高レベルの意味的知識を含むことを示唆している。
Deep convolutional neural networks have demonstrated high performances for fixation prediction in recent years. How they achieve this, however, is less explored and they remain to be black box models. Here, we attempt to shed light on the internal structure of deep saliency models and study what features they extract for fixation prediction. Specifically, we use a simple yet powerful architecture, consisting of only one CNN and a single resolution input, combined with a new loss function for pixel-wise fixation prediction during free viewing of natural scenes. We show that our simple method is on par or better than state-of-the-art complicated saliency models. Furthermore, we propose a method, related to saliency model evaluation metrics, to visualize deep models for fixation prediction. Our method reveals the inner representations of deep models for fixation prediction and provides evidence that saliency, as experienced by humans, is likely to involve high-level semantic knowledge in addition to low-level perceptual cues. Our results can be useful to measure the gap between current saliency models and the human inter-observer model and to build new models to close this gap.
研究の動機と目的
- 手作業で設計された特徴に基づく従来のモデルと比較して、深層注目度モデルがなぜ優れた性能を発揮するのかを理解すること。
- 深層モデルが注目予測に際して意味的知識を学習しているのか、それとも単に低レベルの知覚的特徴に依存しているのかを調査すること。
- 深層注目度モデルの内部表現を可視化し解釈可能にする手法を開発すること。
- 深層注目度モデルと人間の被験者間の注目パターンの乖離を定量化すること。
- モデルの性能が、人間の注視点を予測できる活性化マップの割合と相関するかどうかを評価すること。
提案手法
- 単一解像度入力とGAN訓練を一切使用せず、残差型デコーダを備えたシンプルな完全畳み込みエンコーダ・デコーダアーキテクチャを提案。
- 標準的な損失関数(BCE やバタチャリヤ距離)を上回る性能を示す新しい画素単位損失関数、指数的絶対距離(EAD)を導入。
- 人間の注視点を予測できる活性化マップを特定するための新規可視化技術を開発(「正の注視点検出器」と呼称)。
- 正規化平均検出頻度 $ f_n(c) = f_d(c)/f_t(c) $ を用いて、正の注視点検出器がどの視覚的クラスや部位に鋭敏であるかを分析。
- SALICON や Broden などのデータセットを用い、提案モデルに加え、SalGAN、Deepnet、OpenSalicon などの複数のモデルに本手法を適用。
- 各モデルにおける正の注視点検出器の割合を定量化し、NSS などの性能指標と相関関係を分析。
実験結果
リサーチクエスチョン
- RQ1深層注目度モデルが、高い注視点予測性能を達成するために学習する視覚的パターンは何か?
- RQ2深層注目度モデルが、意味的知識(例:物体カテゴリ、身体部位)にどれほど依存しているのか、低レベルの知覚的特徴に依存しているのかはどの程度か?
- RQ3人間の注視点を予測できる活性化マップの割合と、全体的なモデル性能の関係は何か?
- RQ4深層注目度モデルの内部表現を可視化し解釈することで、その意思決定プロセスを理解できるか?
- RQ5ImageNetで事前学習された特徴から学習するモデルは、訓練を再開から行うモデルと比較して、より意味的に意味のある注視点検出器を学習するのか?
主な発見
- EAD損失を用いた単純なモデルが、Deepfix や SalGAN といった複雑なアーキテクチャを上回る最先端の性能を達成した。
- NSSスコアが2.21に達し、全評価モデルの中で最高であり、正の注視点検出器の割合(4.1%)も最高であった。
- モデル性能(NSSで測定)と人間の注視点を予測できる活性化マップの割合との間に強い正の相関(r = 0.94)が確認された。
- 正の注視点検出器は主に動物(犬、猫、牛)、人間、身体部位(頭、髪、首)といった意味的カテゴリに鋭敏であることが示され、高レベルの意味的符号化が行われていることが示唆された。
- ImageNetで事前学習されたモデル(例:SalGAN、Salicon)は一般的な動物の検出頻度が高かったが、訓練を再開から行うモデル(例:Deepnet)は人工物の検出頻度が高かった。
- 分析から、非予測的ニューロンには明確な中央負のバイアスが存在することが判明し、一部のネットワークユニットが注視度とは無関係な空間的事前知識を符号化している可能性が示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。