Skip to main content
QUICK REVIEW

[論文レビュー] Contrast-Oriented Deep Neural Networks for Salient Object Detection

Guanbin Li, Yizhou Yu|arXiv (Cornell University)|Mar 30, 2018
Visual Attention and Saliency Detection参考文献 62被引用数 3
ひとこと要約

本稿では、密な画素単位のsalientな予測を実現する多スケール畳み込みニューラルネットワーク(MS-FCN)と、領域レベルの対比モデリングを実行するセグメントレベルの空間プーリングストリームを組み合わせたハイブリッド対比指向の深層ニューラルネットワークを提案する。アテンションベースの統合モジュールにより、両ストリームからの予測を動的に統合し、特徴的な輪郭特徴を組み込んだカスタム化された全結合CRFにより空間的整合性と境界の正確性が向上し、6つのベンチマークデータセットで最先端の性能を達成した。

ABSTRACT

Deep convolutional neural networks have become a key element in the recent breakthrough of salient object detection. However, existing CNN-based methods are based on either patch-wise (region-wise) training and inference or fully convolutional networks. Methods in the former category are generally time-consuming due to severe storage and computational redundancies among overlapping patches. To overcome this deficiency, methods in the second category attempt to directly map a raw input image to a predicted dense saliency map in a single network forward pass. Though being very efficient, it is arduous for these methods to detect salient objects of different scales or salient regions with weak semantic information. In this paper, we develop hybrid contrast-oriented deep neural networks to overcome the aforementioned limitations. Each of our deep networks is composed of two complementary components, including a fully convolutional stream for dense prediction and a segment-level spatial pooling stream for sparse saliency inference. We further propose an attentional module that learns weight maps for fusing the two saliency predictions from these two streams. A tailored alternate scheme is designed to train these deep networks by fine-tuning pre-trained baseline models. Finally, a customized fully connected CRF model incorporating a salient contour feature embedding can be optionally applied as a post-processing step to improve spatial coherence and contour positioning in the fused result from these two streams. Extensive experiments on six benchmark datasets demonstrate that our proposed model can significantly outperform the state of the art in terms of all popular evaluation metrics.

研究の動機と目的

  • 重複領域の繰り返し処理による計算量と記憶容量の増大という、パッチ単位のCNNの限界を克服すること。
  • 領域的文脈の欠如と境界局在の悪さにより、多スケールオブジェクトや弱い意味的領域の処理に苦労する、完全畳み込みネットワーク(FCNs)の欠点を是正すること。
  • 補完的なディープラーニングストリームを用いて、画素レベルおよびセグメントレベルの両方で視覚的対比を明示的にモデリングすることで、salientなオブジェクト検出を向上させること。
  • 特徴的な輪郭特徴の埋め込みを組み込んだカスタム化された全結合CRFを用いて、空間的整合性と境界の正確性を向上させること。
  • 2本のストリームと後処理の共同最適化を可能にするエンドツーエンドで学習可能なフレームワークを用いて、多様なベンチマークで最先端の性能を達成すること。

提案手法

  • 多スケール受容野を活用して、異なる空間スケールでの視覚的対比を捉えることで、MS-FCNを用いて密なsalientマップを予測する。
  • 複数の画像セグメンテーションレベルからのスーパーピクセルを処理するセグメントレベルの空間プーリングストリームにより、隣接領域間の対比に基づいたスパースなsalientマップを計算する。
  • アテンションベースの統合モジュールは、MS-FCNとセグメントレベルのストリームからの予測を動的重みで統合し、画素単位と領域単位の対比情報の適応的統合を可能にする。
  • カスタム化された全結合CRFを後処理ステップとして適用し、特徴的な輪郭特徴の埋め込みを組み込んで、空間的整合性の向上と境界局在の改善を図る。
  • 事前学習済みベースラインモデルを用いて、2本のストリームのアーキテクチャの効果的な共同最適化を可能にする、特化した交互微調整スキームを用いてモデルを学習する。
  • MS-FCNストリームでは、オブジェクトサイズの変動に強い対応を図るため、多スケール入力供給(スケーリング係数 1, 0.75, 0.5)を採用する。

実験結果

リサーチクエスチョン

  • RQ1密な予測ストリームとスパースな予測ストリームを組み合わせたハイブリッド深層ネットワークアーキテクチャは、現在の完全畳み込みネットワークやパッチベースの手法を上回るsalientオブジェクト検出を実現できるか?
  • RQ2多スケール特徴学習とセグメントレベルの対比モデリングが、多様なスケールおよび弱い意味的コンテンツを持つオブジェクトの検出をどの程度効果的に向上させられるか?
  • RQ3アテンションベースの統合機構は、画素単位と領域単位のsalient予測の統合をどの程度改善できるか?
  • RQ4CRFの後処理ステップに特徴的な輪郭特徴を組み込むことで、境界の正確性と空間的整合性が著しく向上するか?
  • RQ5提案されたフレームワークは、標準評価指標に基づき、複数のベンチマークデータセットで一貫した最先端の性能を達成できるか?

主な発見

  • MS-FCNストリームでVGG-16の代わりにResNet-101を使用した場合、DUT-OMRONデータセットにおいて最大F-measureが3.62%向上し、MAEが7.32%低下した。
  • 多スケール入力(スケーリング係数 1, 0.75, 0.5)を採用した場合、DUT-OMRONデータセットで最大F-measureが2.46%向上し、MAEが6.58%低下した。
  • 複数レベルの画像セグメンテーション(3段階のセグメンテーションレベル)を採用した場合、DUT-OMRONデータセットで最大F-measureが0.88%向上し、MAEが1.40%低下した。
  • 輪郭ガイド付きCRFの後処理を適用した場合、VGG-16ベースのモデルと比較して、最大F-measureが1.50%向上し、MAEが8.57%低下した。
  • ResNet-101ベースのモデルに多スケール入力と輪郭ガイド付きCRFを組み合わせた場合、DUT-OMRONデータセットで最大F-measureが89.6%、MAEが0.048に達し、先行する最先端手法を上回った。
  • 6つのベンチマークデータセットにおける広範な実験により、F-measure、MAE、E-measureを含むすべての標準評価指標で、提案手法が一貫して既存手法を上回ることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。