Skip to main content
QUICK REVIEW

[論文レビュー] Semi-Supervised Video Salient Object Detection Using Pseudo-Labels

Pengxiang Yan, Guanbin Li|arXiv (Cornell University)|Aug 12, 2019
Visual Attention and Saliency Detection参考文献 16被引用数 10
ひとこと要約

本稿では、光学的フローとスパARSEな人間によるアノテーションを用いて高品質なピクセル単位の疑似ラベルを生成する半教師付き動画顕著オブジェクト検出フレームワークを提案する。これにより、真値ラベルの約20%でのみ、最先端の性能を達成できる。本手法は、空間的・時間的整合性を活用するため、残差リファインメントネットワークと非局所的に強化された再帰モジュールを組み合わせ、DAVIS、FBMS、VOSベンチマークにおいて完全教師ありSOTA手法を上回る性能を発揮する。

ABSTRACT

Deep learning-based video salient object detection has recently achieved great success with its performance significantly outperforming any other unsupervised methods. However, existing data-driven approaches heavily rely on a large quantity of pixel-wise annotated video frames to deliver such promising results. In this paper, we address the semi-supervised video salient object detection task using pseudo-labels. Specifically, we present an effective video saliency detector that consists of a spatial refinement network and a spatiotemporal module. Based on the same refinement network and motion information in terms of optical flow, we further propose a novel method for generating pixel-level pseudo-labels from sparsely annotated frames. By utilizing the generated pseudo-labels together with a part of manual annotations, our video saliency detector learns spatial and temporal cues for both contrast inference and coherence enhancement, thus producing accurate saliency maps. Experimental results demonstrate that our proposed semi-supervised method even greatly outperforms all the state-of-the-art fully supervised methods across three public benchmarks of VOS, DAVIS, and FBMS.

研究の動機と目的

  • 完全教師あり動画顕著オブジェクト検出の高いアノテーションコストを、スパARSEな人間によるアノテーションと疑似ラベルを活用することで低減すること。
  • 動きに敏感な疑似ラベル生成を用いて、顕著性予測における時間的整合性と境界の正確性を向上させること。
  • 追加の訓練なしに、未教師あり動画オブジェクトセグメンテーションタスクに一般化可能なフレームワークを開発すること。
  • 光学的フローとリファインメントネットワークを用いて生成された疑似ラベルが、完全教師ありベースラインを上回ることを実証すること。

提案手法

  • 高解像度の顕著マップを生成するアップサンプリングベースのリファインメントを備えた残差リファインメントネットワーク(RCRNet)を提案する。
  • 空間的・時間的長距離依存関係をモデル化するため、非局所的に強化された再帰(NER)モジュールを導入する。
  • フレーム間の光学的フローを推定するためにFlowNet 2.0を用い、スパARSEな真値ラベルを動きに従って伝搬する。
  • 光学的フローを用いて隣接するアノテーションをワープし、RGBおよび動き特徴と統合することで疑似ラベルを生成し、改良されたRCRNetで処理する。
  • 空間的および時間的モデリングを強化するため、スパARSEな真値ラベルとフローガイドド疑似ラベルの両方を用いて、モデルをエンドツーエンドで訓練する。
  • マルチスケールの監視とスキップ接続を採用することで、細粒度のディテールを保持し、勾配消失を低減する。

実験結果

リサーチクエスチョン

  • RQ1スパARSEなアノテーションと光学的フローから生成された疑似ラベルは、動画顕著オブジェクト検出の性能を向上させることができるか?
  • RQ2提案されたフローガイドド疑似ラベル生成は、境界ディテールと時間的整合性をどれほど効果的に保持できるか?
  • RQ3わずか約20%の真値ラベルでのみ訓練された半教師ありモデルは、完全教師ありSOTA手法を上回ることができるか?
  • RQ4非局所的に強化された再帰モジュールは、顕著性予測における空間的・時間的整合性をどの程度向上させるか?
  • RQ5提案されたフレームワークは、未教師あり動画オブジェクトセグメンテーションタスクに一般化可能か?

主な発見

  • DAVISベンチマークにおいて、本手法は平均Fスコア0.861を達成し、すべての完全教師ありSOTA手法を上回った。
  • FBMSデータセットでは、ジャッカード指数75.9%を達成し、2番目に良い手法(LVOで65.1%)を顕著に上回った。
  • アブレーションスタディの結果、疑似ラベル生成により、疑似ラベルなしのベースライン(0.821 vs. 0.847)に対してFスコアが0.026向上した。
  • 非局所的に強化された再帰モジュールは、標準的なConvGRUベースラインに比べてFスコアを0.004向上させ、長距離依存関係のモデル化における有効性を示した。
  • 未教師あり動画オブジェクトセグメンテーションタスクにおいても、DAVISで74.7、FBMSで75.9のジャッカードスコアを達成し、優れた一般化性能を示した。
  • 本手法は完全教師あり手法で使用される真値アノテーションの約20%でのみ実行可能であり、顕著なアノテーションコストの低減が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。