Skip to main content
QUICK REVIEW

[論文レビュー] DeepFeat: A Bottom Up and Top Down Saliency Model Based on Deep Features of Convolutional Neural Nets

Ali Mahdi, Jun Qin|arXiv (Cornell University)|Sep 8, 2017
Visual Attention and Saliency Detection参考文献 38被引用数 9
ひとこと要約

本稿では、事前学習済み畳み込みニューラルネットワーク(CNN)特徴を用いて、ボトムアップおよびトップダウンの視覚的キューを統合する、DeepFeatと呼ばれるサリエンシー・モデルを提案する。低レベルのエッジやテクスチャ特徴と、より深いCNN層からの高レベルの意味的表現を組み合わせることで、MIT1003データセットにおいて4つの評価指標で最先端の性能を達成し、全体で2位を記録し、個々のボトムアップおよびトップダウン手法を上回った。

ABSTRACT

A deep feature based saliency model (DeepFeat) is developed to leverage the understanding of the prediction of human fixations. Traditional saliency models often predict the human visual attention relying on few level image cues. Although such models predict fixations on a variety of image complexities, their approaches are limited to the incorporated features. In this study, we aim to provide an intuitive interpretation of convolu- tional neural network deep features by combining low and high level visual factors. We exploit four evaluation metrics to evaluate the correspondence between the proposed framework and the ground-truth fixations. The key findings of the results demon- strate that the DeepFeat algorithm, incorporation of bottom up and top down saliency maps, outperforms the individual bottom up and top down approach. Moreover, in comparison to nine 9 state-of-the-art saliency models, our proposed DeepFeat model achieves satisfactory performance based on all four evaluation metrics.

研究の動機と目的

  • 従来のサリエンシー・モデルが手作業で設計された低レベル特徴に依存しており、タスク駆動の注意を捉えきれていないという限界を是正すること。
  • CNNの事前学習済み深層特徴から低レベルおよび高レベルの視覚的キューを活用する解釈可能なフレームワークを提供すること。
  • 深層特徴を用いてボトムアップ(刺激駆動)およびトップダウン(目的指向)注意メカニズムを統合することで、サリエンシー予測を向上させること。
  • MIT1003ベンチマークを用いて、複数の標準的指標と比較して、提案モデルの性能を評価すること。
  • 複数のCNN層からの深層特徴を統合することで、サリエンシー予測の正確性と頑健性が向上することを示すこと。

提案手法

  • モデルは、事前学習済みCNNの複数の層から深層特徴を抽出し、畳み込み層、バッチ正則化層、プーリング層の活性化マップを視覚的キューとして使用する。
  • ボトムアップのサリエンシーは、CNNの初期層から計算され、エッジ、色、明るさのコントラストといった低レベル特徴を捉える。
  • トップダウンのサリエンシーは、より深いCNN層から得られ、オブジェクトカテゴリーやシーンの文脈といった高レベルの意味的情報をエンコードする。
  • 最終的なサリエンシー・マップは、ボトムアップおよびトップダウンマップを、学習されたまたは固定された重み付け戦略を用いて統合することで生成される。
  • 人間の注視パターンに一致させるために、中心バイアスが予測に組み込まれており、これにより真値の注視点との相関が向上する。
  • モデルは、MIT1003データセット上で4つの指標(AUC、AUC Borji、CC、KLダイバージェンス)を用いて評価される。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みCNNからの深層特徴は、ボトムアップおよびトップダウンの視覚的注意成分を効果的に表現できるか?
  • RQ2深層特徴からのボトムアップおよびトップダウンのサリエンシー・マップを統合することで、個別の手法と比較して注視点予測の正確性が向上するか?
  • RQ3DeepFeatモデルは、複数の評価指標において9つの最先端サリエンシー・モデルと比較してどのように評価されるか?
  • RQ4中心バイアスを組み込むことで、DeepFeatモデルの性能がどの程度向上するか?
  • RQ5多層の深層特徴を統合することで、より解釈可能で頑健なサリエンシー予測が可能になるか?

主な発見

  • 中心バイアス統合付きのDeepFeatモデルは、自身のバリエーションの中で最高の性能を示し、中心バイアスを含まない実装を上回った。
  • MIT1003データセットにおいて、AUCおよびAUC Borjiの指標で、eDNモデルに次いで2位を記録した。
  • CCスコアは0.728を達成し、10のモデルの中で2位を記録し、人間の注視マップとの強い相関を示した。
  • KLダイバージェンス評価では4位を記録し、GBVS、ML-Net、UHFがより優れていたため、やや広い予測領域を示した。
  • 1枚の画像あたり約150秒の計算時間が必要であり、高品質なサリエンシー予測に対して中程度の計算コストであることが示された。
  • 結果から、CNNの低レベルおよび高レベルの両方の層からの深層特徴を統合することで、従来のモデルに比べてサリエンシー予測が顕著に向上することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。