[論文レビュー] Weakly-Supervised Salient Object Detection via Scribble Annotations
本稿では、密度の高いピクセル単位のラベルではなく、疎なスクリッチアノテーションから学習する弱教師あり顕著オブジェクト検出手法を提案する。境界局所化の向上のため、補助的なエッジ検出ネットワークとゲート付き構造に配慮した損失関数を導入し、アノテーションの密度化のためのスクリッチブースティング方式を採用することで、6つのベンチマークで完全教師ありの最先端モデルと同等の性能を達成し、既存の弱教師あり手法を顕著に上回る。
Compared with laborious pixel-wise dense labeling, it is much easier to label data by scribbles, which only costs 1$\sim$2 seconds to label one image. However, using scribble labels to learn salient object detection has not been explored. In this paper, we propose a weakly-supervised salient object detection model to learn saliency from such annotations. In doing so, we first relabel an existing large-scale salient object detection dataset with scribbles, namely S-DUTS dataset. Since object structure and detail information is not identified by scribbles, directly training with scribble labels will lead to saliency maps of poor boundary localization. To mitigate this problem, we propose an auxiliary edge detection task to localize object edges explicitly, and a gated structure-aware loss to place constraints on the scope of structure to be recovered. Moreover, we design a scribble boosting scheme to iteratively consolidate our scribble annotations, which are then employed as supervision to learn high-quality saliency maps. As existing saliency evaluation metrics neglect to measure structure alignment of the predictions, the saliency map ranking metric may not comply with human perception. We present a new metric, termed saliency structure measure, to measure the structure alignment of the predicted saliency maps, which is more consistent with human perception. Extensive experiments on six benchmark datasets demonstrate that our method not only outperforms existing weakly-supervised/unsupervised methods, but also is on par with several fully-supervised state-of-the-art models. Our code and data is publicly available at https://github.com/JingZhang617/Scribble_Saliency.
研究の動機と目的
- 顕著オブジェクト検出におけるアノテーション負荷を、ピクセル単位のラベルではなく疎なスクリッチアノテーションを用いることで低減すること。
- 疎なスクリッチが持つ構造的詳細の欠如によって引き起こされる境界局所化の悪化を、明示的なエッジ監視と構造に配慮した制約によって是正すること。
- 反復的な精練を通じてアノテーションの密度と品質を向上させるスクリッチブースティング機構を構築すること。
- 予測された顕著マップにおける構造的整合性を人間の知覚とよりよく一致させるために、新しい評価指標である顕著構造尺度($B_{\mu}$)を導入すること。
- スクリッチからの弱教師あり学習が、完全教師ありの最先端モデルと同等の性能を達成できることを示すこと。
提案手法
- DUTSデータセットを再ラベルし、平均3%のピクセルカバレッジを持つ疎なスクリッチを用いた新しいスクリッチベースのデータセット、S-DUTSを構築することで、スクリッチベースSODの評価を可能にする。
- RCFまたはSobelエッジマップを監視信号として用いる補助的なエッジ検出ネットワーク(EDN)を導入し、モデルが正確なオブジェクト境界を学習するのを支援する。
- 予測された顕著マップが顕著領域の画像エッジと整合するよう制約を課すゲート付き構造に配慮した損失を提案する。同時に、背景の構造を抑制する。
- 高信頼度の予測を伝搬することで、元のスクリッチアノテーションを反復的精練を通じてより密度の高い疑似ラベルに拡張するスクリッチブースティング方式を設計する。
- 主ネットワークが顕著性を予測し、補助ネットワークがエッジ検出を行うマルチブランチネットワークアーキテクチャを採用。両者はそれぞれの損失関数とともに共同で学習される。
- 顕著性予測とエッジ検出の両方のための交差エントロピー損失に加え、ゲート付き構造に配慮した損失を組み合わせ、精度と構造的整合性の両方を共同最適化する。
実験結果
リサーチクエスチョン
- RQ1疎なスクリッチアノテーション(ピクセル単位のラベルに比べて著しく安価)のみを用いて顕著オブジェクト検出を効果的に学習できるか?
- RQ2構造的詳細に欠ける疎なスクリッチに限定された学習データにおいて、オブジェクト境界をどのように改善できるか?
- RQ3補助的なエッジ検出タスクを組み込むことで、予測された顕著マップの構造的整合性が向上するか?
- RQ4反復的にアノテーション品質を向上させるスクリッチブースティング機構が、モデル性能の向上に寄与するか?
- RQ5提案された顕著構造尺度($B_{\mu}$)は、MAEなどの従来の指標よりも人間の知覚とより一貫性があるか?
主な発見
- 提案手法は、DUT-OSR、DUTS-TE、ECSSD、PASCAL-S、HKU-IS、DIB-Rを含む6つのベンチマークデータセットにおいて、すべての既存の弱教師ありおよび非教師あり顕著オブジェクト検出手法を上回る性能を示した。
- いくつかの完全教師あり最先端モデルと同等の性能を達成しており、スクリッチからの弱教師あり学習が完全教師あり学習と同等の性能を達成できることを示している。
- ゲート付き構造に配慮した損失は境界局所化を顕著に改善し、標準の滑らかさ損失と比較して$B_{\mu}$指標を0.025低減した。これは、より良い構造的整合性を示している。
- スクリッチブースティング方式はベースラインと比較して$B_{\mu}$指標を0.011向上させ、疎なアノテーションの精練における有効性を示している。
- 補助的なエッジ検出タスクを導入することで、それなしの学習と比較して$B_{\mu}$指標が0.038低減した。これは、構造的正確性の向上に寄与していることを証明している。
- アノテーションのばらつきに対してロバストであることが示され、複数のアノテーターが作成した異なるスクリッチアノテーションにおいても一貫した性能を示しており、スパarsityや重複の違いにもかかわらず信頼性が高いことが裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。