Skip to main content
QUICK REVIEW

[論文レビュー] WEPSAM: Weakly Pre-Learnt Saliency Model

Avisek Lahiri, Sourya Roy|arXiv (Cornell University)|May 3, 2016
Visual Attention and Saliency Detection参考文献 27被引用数 4
ひとこと要約

WEPSAMは、限られた眼動画データでの微調整の前に、ドメイン固有の事前学習としてImageNetを活用することで、視覚的注目度予測のための弱い事前学習を施した畳み込みニューラルネットワークを提案する。この手法は、最先端のモデルと比較してMIT300でより高速な収束と優れた性能を達成し、弱い事前学習が注目度検出の効率性と正確性を顕著に向上させることを示している。

ABSTRACT

Visual saliency detection tries to mimic human vision psychology which concentrates on sparse, important areas in natural image. Saliency prediction research has been traditionally based on low level features such as contrast, edge, etc. Recent thrust in saliency prediction research is to learn high level semantics using ground truth eye fixation datasets. In this paper we present, WEPSAM : Weakly Pre-Learnt Saliency Model as a pioneering effort of using domain specific pre-learing on ImageNet for saliency prediction using a light weight CNN architecture. The paper proposes a two step hierarchical learning, in which the first step is to develop a framework for weakly pre-training on a large scale dataset such as ImageNet which is void of human eye fixation maps. The second step refines the pre-trained model on a limited set of ground truth fixations. Analysis of loss on iSUN and SALICON datasets reveal that pre-trained network converges much faster compared to randomly initialized network. WEPSAM also outperforms some recent state-of-the-art saliency prediction models on the challenging MIT300 dataset.

研究の動機と目的

  • 注目度予測における真値の眼動画データの不足を解決するため、弱い事前学習を施したCNNフレームワークを導入すること。
  • 人間の注視アノテーションを必要としない、ImageNetのような大規模な未ラベル付きデータセットを用いた注目度モデルの事前学習の可能性を検討すること。
  • 事前学習を正則化子として用いることで、注目度予測タスクにおける学習効率と一般化性能を向上させること。
  • ドメイン固有の事前学習が、ImageNet上で行い、下流の注目度データセットにおける収束速度と性能を、ランダム初期化よりも顕著に向上させることを示すこと。

提案手法

  • 3段階のCONV-ReLU-MAX_POOLに続く、3つの全結合層を含む浅い5層のCNNアーキテクチャが使用される。最終層にはマックスアウト処理が施される。
  • モデルは、真値の注視マップを必要としない、人間の注視パターンを近似する自己教師的目的関数を用いて、ImageNet上で弱い事前学習が行われる。
  • 事前学習後、小規模な真値の注視データセット(iSUNおよびSALICON)上で微調整が行われる。この際、要素ごとの二乗誤差を用いた1024次元の回帰損失が使用される。
  • 事前学習段階では、ネットワークの重みが注視に関連する特徴をエンコードするように初期化され、微調整段階での大規模なバックプロパゲーションの必要性が低減される。
  • 入力画像サイズは128×128 RGBに固定され、最終1024次元ベクトルのアップサンプリングによって32×32の注視マップが出力される。
  • 最初、2番目、3番目の畳み込み段階には、それぞれ5×5、3×3、3×3の受容 field が使用され、2×2のマックスプーリング層が配置される。

実験結果

リサーチクエスチョン

  • RQ1ランダム初期化と比較して、ImageNet上で弱い事前学習を施すことで、注視度予測の微調整段階における収束が著しく早まるか?
  • RQ2大規模で注視アノテーションのないデータセットでの事前学習が、下流の注視度予測タスクにおける一般化性能と性能向上に寄与するか?
  • RQ3ImageNet上でドメイン固有の事前学習が、ベンチマークデータセットにおける損失の減少速度と最終的な性能において、ランダム重み初期化をどれほど上回るか?
  • RQ4MIT300データセットにおいて、WEPSAMは最先端の注視度モデルと比較して、定量的指標および定性的な注視マップの正確性においてどのように差をつけるか?
  • RQ5弱い自己教師的学習によりImageNetで事前学習された、軽量なCNNアーキテクチャが、ラベル付き注視データに依存せずして競争力のある性能を達成できるか?

主な発見

  • 事前学習済みWEPSAMモデルは、400エポック後、訓練損失が7.2×10⁻³、検証損失が7.3×10⁻³に低下するなど、収束が速い。ランダム初期化ネットワークと比較して、それぞれ7.7×10⁻³および7.8×10⁻³である。
  • 学習開始時、WEPSAMの訓練損失と検証損失はそれぞれ8.2×10⁻³および8.4×10⁻³であり、ランダム初期化ネットワークの10.6×10⁻³および9.6×10⁻³と比較して2.4×10⁻³の改善が見られた。
  • MIT300データセットにおいて、WEPSAMはCIW、CAS、RARE-2012などの非学習ベースのモデルをAUC-Judd、AUC-Borji、CC、SIM、KL、NSSの指標すべてで上回った。
  • 128×128の入力解像度と3つの畳み込み層のみを用いながらも、WEPSAMはより複雑なMR-CNNモデルをAUC-JuddやCCなどの複数の指標で上回った。
  • 定性的な結果では、WEPSAMは顔や注目すべき物体といった意味論的に重要な領域を強調している一方、比較モデルはエッジや勾配に注目したぼやけたマップを生成していた。
  • 事前学習後のモデルの予測は、すでに真値の注視パターンと整合性を示しており、弱い事前学習が注視に関連する特徴を効果的に捉えていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。