Skip to main content
QUICK REVIEW

[論文レビュー] Edge-guided Non-local Fully Convolutional Network for Salient Object Detection

Zhengzheng Tu, Yan Ma|arXiv (Cornell University)|Aug 7, 2019
Visual Attention and Saliency Detection参考文献 52被引用数 7
ひとこと要約

本稿では、エッジの事前知識をガイドブロックを通じて統合することで正確なオブジェクト境界を保持する、エッジガイドド非局所全畳み込みネットワークであるENFNetを提案する。階層的な非局所特徴とエッジに敏感な空間的・チャネルワイド変換を統合することで、5つのベンチマークデータセットで最先端の性能を達成し、従来手法と比較してF-measureを向上させるとともにMAEを低減した。

ABSTRACT

Fully Convolutional Neural Network (FCN) has been widely applied to salient object detection recently by virtue of high-level semantic feature extraction, but existing FCN based methods still suffer from continuous striding and pooling operations leading to loss of spatial structure and blurred edges. To maintain the clear edge structure of salient objects, we propose a novel Edge-guided Non-local FCN (ENFNet) to perform edge guided feature learning for accurate salient object detection. In a specific, we extract hierarchical global and local information in FCN to incorporate non-local features for effective feature representations. To preserve good boundaries of salient objects, we propose a guidance block to embed edge prior knowledge into hierarchical feature maps. The guidance block not only performs feature-wise manipulation but also spatial-wise transformation for effective edge embeddings. Our model is trained on the MSRA-B dataset and tested on five popular benchmark datasets. Comparing with the state-of-the-art methods, the proposed method achieves the best performance on all datasets.

研究の動機と目的

  • 畳み込みネットワークベースの顕著オブジェクト検出におけるストライドおよびプーリング操作に起因するオブジェクト境界の劣化を是正すること。
  • 階層的な非局所構造を用いて、局所的コントラストとグローバルコンテキストの両方を統合することで特徴表現を向上させること。
  • 空間的およびチャネルワイド特徴変換を実行する専用のガイドブロックを用いてエッジ事前知識を統合することで、境界の正確性を向上させること。
  • 後処理に依存せずに、複数のベンチマークデータセットで最先端の性能を達成すること。

提案手法

  • 空間的・チャネルワイドなアフィン変換を用いて、ガイドブロックを導入し、特徴マップにエッジ事前知識を埋め込むことで、チャネルワイドおよび空間ワイドな特徴操作を可能にした。
  • FCNの複数の層で階層的な非局所特徴を計算し、長距離依存性を捉え、グローバルコンテキストを豊かにした。
  • エッジマップはEdgeNetを用いて抽出され、各畳み込み層での特徴学習プロセスをガイドする事前知識として用いられた。
  • 最終的な顕著マップは、エッジに敏感な局所的コントラスト特徴と、FCNからの非局所的グローバルコンテキスト特徴を統合することで生成された。
  • ネットワークはMSRA-Bでエンドツーエンドに訓練され、5つの標準ベンチマーク(HKU-IS、PASCAL-S、DUT-OMRON、ECSSD、SOD)で評価された。
  • アブレーションスタディにより、エッジガイドブロックの有効性および複数層にわたる配置の有効性が検証された。

実験結果

リサーチクエスチョン

  • RQ1エッジ事前知識を、完全畳み込みネットワークに効果的に統合することで、顕著オブジェクト検出における境界の保持が向上するか?
  • RQ2提案されたエッジガイドド非局所機構は、標準的なFCNおよび非局所ネットワークと比較して、特徴表現および局所化の正確性においてどのように差をつけるか?
  • RQ3エッジでガイドされた局所的コントラストとグローバルコンテキスト特徴の階層的統合は、多様なデータセットで一貫した性能向上をもたらすか?
  • RQ4ガイドブロックの数および配置が、検出性能に与える影響は何か?

主な発見

  • ENFNetは、5つのベンチマークデータセットすべてで最高のF-measureを達成し、DUT-OMRONでは2番目に優れた手法NLDFと比較して2.6%向上、SODでは2.1%向上した。
  • DUT-OMRONではMAEを15%、SODでは9%低減した。これは、優れた境界の正確性を示している。
  • HKU-ISではF-measureが0.915、MAEが0.040を達成し、両方の指標で比較手法を上回った。
  • 可視化比較では、複数の顕著オブジェクトを含む複雑なシーンにおいても、ENFNetはより鋭い顕著マップと一貫性のある境界予測を生成した。
  • アブレーションスタディにより、エッジガイドブロックが性能向上に顕著に寄与することが確認され、初期層に3つのガイドブロックを配置した場合が最適な結果をもたらした。
  • CRF後処理を用いない状態でも、CRF精錬を用いる手法DCLを上回った。これは、提案されたアーキテクチャの堅牢性を裏付けている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。