Skip to main content
QUICK REVIEW

[論文レビュー] F3Net: Fusion, Feedback and Focus for Salient Object Detection

Jun Wei, Shuhui Wang|arXiv (Cornell University)|Nov 26, 2019
Visual Attention and Saliency Detection参考文献 35被引用数 113
ひとこと要約

F3 Net は、クロス特徴モジュールによる選択的マルチレベル特徴融合、連結フィードバックデコーダによる反復的洗練、そして難易度の高いピクセルを強調するピクセル位置認識 loss を導入し、5つのデータセットにおいて最先端の顕著領域検出を達成します。

ABSTRACT

Most of existing salient object detection models have achieved great progress by aggregating multi-level features extracted from convolutional neural networks. However, because of the different receptive fields of different convolutional layers, there exists big differences between features generated by these layers. Common feature fusion strategies (addition or concatenation) ignore these differences and may cause suboptimal solutions. In this paper, we propose the F3Net to solve above problem, which mainly consists of cross feature module (CFM) and cascaded feedback decoder (CFD) trained by minimizing a new pixel position aware loss (PPA). Specifically, CFM aims to selectively aggregate multi-level features. Different from addition and concatenation, CFM adaptively selects complementary components from input features before fusion, which can effectively avoid introducing too much redundant information that may destroy the original features. Besides, CFD adopts a multi-stage feedback mechanism, where features closed to supervision will be introduced to the output of previous layers to supplement them and eliminate the differences between features. These refined features will go through multiple similar iterations before generating the final saliency maps. Furthermore, different from binary cross entropy, the proposed PPA loss doesn't treat pixels equally, which can synthesize the local structure information of a pixel to guide the network to focus more on local details. Hard pixels from boundaries or error-prone parts will be given more attention to emphasize their importance. F3Net is able to segment salient object regions accurately and provide clear local details. Comprehensive experiments on five benchmark datasets demonstrate that F3Net outperforms state-of-the-art approaches on six evaluation metrics.

研究の動機と目的

  • 多層CNN特徴のサルエンシー検出における(異なる受容野)不一致を緩和して融合品質を改善する。
  • 冗長な情報を抑制しつつ補完的な細部を保持する選択的融合メカニズムを導入する。
  • 境界をシャープにし局所的なディテールを強化するため、反復的かつ階層的なフィードバックを通じて多層特徴を洗練させる。
  • 難易度の高いピクセル、境界領域、ディテール豊富な領域を強調するよう、局所構造文脈でピクセルをウェイト付けするロスを組み込む。
  • MLS、CFM、CFD を統合した場合の標準的サルエンシー指標に対する経験的影響を、包括的なアブレーションで示す。

提案手法

  • 低レベルおよび高レベルの特徴を要素ごとの乗算で融合し、共通部を抽出した上で元の特徴を再加算して表現を refinne する Cross Feature Module (CFM) を提案する。
  • CFM を介したボトムアップの集約と前の層へのトップダウン特徴フィードバックを行う複数のサブデコーダを備えた Cascaded Feedback Decoder (CFD) を開発し、格子状の洗練ネットワークを形成する。
  • Hard ピクセルを強調し局所構造を維持するため、Location-aware weighting BCE と重み付き IoU ロスを組み合わせた Pixel Position Aware (PPA) ロスを導入する。
  • CFD ステージ全体で MLS を通じたマルチレベル監出を行い、最適化を安定化させ学習を強化する。
  • バックボーンとして ResNet-50 を用い、ポスト処理なしで最終サルエンシマップを生成する段階的に洗練されたデコーディング路を採用する。
  • 5つのデータセットで評価し、CFM、CFD、PPA の寄与をアブレーションで示す。

実験結果

リサーチクエスチョン

  • RQ1サルエンシー マップにおける冗長性を減らし、意味論的および空間的ディテールをどのようにより効果的に統合できるか。
  • RQ2フィードバックに基づくデコード方式が境界精度と局所構造を回復するために特徴を反復的に洗練できるか。
  • RQ3ピクセル位置認識ロスは標準的な BCE や IoU ロスと比べて難易度の高いピクセルや境界領域の検出を改善するか。
  • RQ4MLS、CFM、CFD を統合した場合のベンチマークにおける標準的サルエンシー指標に対する実証的影響はどの程度か。

主な発見

  • F3 Net は六つの指標で五つのデータセットにおいて最先端の性能を達成し、最先端の方法を上回る。
  • CFM はバックグラウンドノイズを効果的に抑制し、高レベルの境界を選択的な融合を通じて鋭敏化する。
  • CFD は refined features を前の層へフィードバックすることで反復的な洗練を可能にし、サルエンシマップの品質を向上させる。
  • PPA ロスは hard ピクセルを強調し局所構造を組み込むことで境界とディテールの表現を改善する。
  • アブレーション研究により、CFM、CFD、MLS、PPA が総じて最良の結果に寄与することが示された。
  • モデルはポスト処理なしで背景ノイズが減少した、より明瞭なサルエンシマップを提供し、堅牢な性能を発揮する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。