Skip to main content
QUICK REVIEW

[論文レビュー] Richer and Deeper Supervision Network for Salient Object Detection

Sen Jia, Neil D. B. Bruce|arXiv (Cornell University)|Jan 8, 2019
Visual Attention and Saliency Detection参考文献 43被引用数 17
ひとこと要約

本論文は、より豊かなグローバルおよびローカル表現を用いてマルチスケール出力間の特徴統合を向上させる、より豊かで深い監視(RDS)ネットワークを提案する。オブジェクト検出データセット(ImageNet-DETおよびPASCAL-VOC)で事前学習することで粗いグローバルな文脈を注入することで、5つのベンチマークデータセットで最先端の性能を達成し、F-measureスコアは最大0.953、MAEは最小0.028を記録した。

ABSTRACT

Recent Salient Object Detection (SOD) systems are mostly based on Convolutional Neural Networks (CNNs). Specifically, Deeply Supervised Saliency (DSS) system has shown it is very useful to add short connections to the network and supervising on the side output. In this work, we propose a new SOD system which aims at designing a more efficient and effective way to pass back global information. Richer and Deeper Supervision (RDS) is applied to better combine features from each side output without demanding much extra computational space. Meanwhile, the backbone network used for SOD is normally pre-trained on the object classification dataset, ImageNet. But the pre-trained model has been trained on cropped images in order to only focus on distinguishing features within the region of the object. But the ignored background information is also significant in the task of SOD. We try to solve this problem by introducing the training data designed for object detection. A coarse global information is learned based on an entire image with its bounding box before training on the SOD dataset. The large-scale of object images can slightly improve the performance of SOD. Our experiment shows the proposed RDS network achieves the state-of-the-art results on five public SOD datasets.

研究の動機と目的

  • 既存の深く監視されたネットワークにおける浅いグローバル特徴伝搬の制限を解消すること。
  • 計算コストを著しく増加させることなく、マルチスケールのサイド出力間の特徴統合効率を向上させること。
  • 大規模なオブジェクト検出データセットを活用して事前学習することで、セマンティック検出におけるデータ不足問題を軽減すること。
  • ImageNet分類データよりも情報量が多いオブジェクト検出アノテーションから得られる背景を意識した特徴を統合することで、性能を向上させること。
  • オブジェクト検出データでの事前学習とImageNet分類データでの事前学習の、セマンティック検出への影響を調査すること。

提案手法

  • より豊かで深い監視パスを用いてサイド出力間の特徴統合を向上させる、新しいRDSネットワークアーキテクチャを提案する。
  • 2段階のトレーニング戦略を導入:まず、統合されたオブジェクト検出データセット(ImageNet-DET + PASCAL-VOC)で微調整して粗い位置情報の文脈を学習し、その後SODデータセットで微調整する。
  • 残差ネットワーク(ResNet-152)をバックボーンとして用い、複数の層にサイド出力を配置することで、深い監視と多段階の特徴集約を実現する。
  • オブジェクト検出データセットのボクシングボックスアノテーションを活用し、事前学習段階で文脈的で背景を意識した特徴を注入することで、一般化性能を向上させる。
  • サイド出力に対するクロスエントロピー損失とL1損失を適用し、高レベルの意味的特徴と低レベルのエッジ詳細の両方を保持することに焦点を当てる。
  • カーリーキャスティックフォールディングを緩和するため、2段階の微調整プロセスを採用し、SOD微調整の前に低い初期学習率(0.001)をオブジェクト検出データで使用する。

実験結果

リサーチクエスチョン

  • RQ1より豊かで深い監視メカニズムは、計算コストを増加させることなく、セマンティック検出ネットワークにおける特徴統合を改善できるか?
  • RQ2全体画像の文脈を持つオブジェクト検出データセットで事前学習することで、ImageNet分類事前学習に比べてセマンティック検出性能が向上するか?
  • RQ3ボクシングボックスアノテーションからの背景およびオブジェクト文脈の統合は、顕著なオブジェクト検出にどのように影響するか?
  • RQ4複数段階の事前学習を用いる場合、オブジェクト検出からセマンティック検出への知識の転送において、カーリーキャスティックフォールディングの影響はどの程度か?
  • RQ5提案されたRDSネットワークは、多様な公開SODベンチマークで、既存の最先端手法を上回る性能を発揮できるか?

主な発見

  • RDS-152モデルはHKU-ISデータセットで最高のF-measure 0.953を達成し、他のすべての最先端手法を上回った。
  • DUT-OMRONデータセットでは、RDS-152はF-measure 0.837、MAE 0.050を達成し、比較対象すべての手法の中で最高の順位を獲得した。
  • オブジェクト検出データで事前学習されたRDS-152-OBJバージョンは、PASCAL-SODサブセットでF-measure 0.818を記録し、AMUやSRMを含む他の手法を上回った。
  • PRカーブ分析により、RDS-152-OBJは5つの公開SODデータセットすべてで、特に高再現率領域において、競合他手法を一貫して上回っていることが確認された。
  • アブレーションスタディの結果、オブジェクト検出データでの事前学習により、境界精度およびグローバル文脈理解の両面でわずかだが一貫した性能向上が得られた。
  • オブジェクト検出事前学習によるわずかな改善にもかかわらず、モデルは依然としてカーリーキャスティックフォールディングに苦しんでおり、今後の研究ではより効果的な継続的学習戦略の導入が求められる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。