Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised RGBD Video Object Segmentation Using GANs

M. Sultana, Arif Mahmood|arXiv (Cornell University)|Nov 5, 2018
Video Surveillance and Tracking Methods参考文献 27被引用数 10
ひとこと要約

本稿では、色と深度のモダリティを統合的に活用する生成的対抗ネットワーク(GAN)を用いた教師なしRGBD動画オブジェクトセグメンテーション手法、ForeGAN_RGBDを提案する。この手法は、RGBおよび深度データに対して独立してGANを訓練し、シーン固有の背景を生成し、テストフレームからそれを差し引いて動くオブジェクトを検出する。さらに、両モダリティの結果を統合することで、照明の変化、影、色・深度のカモフラージュといった困難な条件下でも精度が向上する。

ABSTRACT

Video object segmentation is a fundamental step in many advanced vision applications. Most existing algorithms are based on handcrafted features such as HOG, super-pixel segmentation or texture-based techniques, while recently deep features have been found to be more efficient. Existing algorithms observe performance degradation in the presence of challenges such as illumination variations, shadows, and color camouflage. To handle these challenges we propose a fusion based moving object segmentation algorithm which exploits color as well as depth information using GAN to achieve more accuracy. Our goal is to segment moving objects in the presence of challenging background scenes, in real environments. To address this problem, GAN is trained in an unsupervised manner on color and depth information independently with challenging video sequences. During testing, the trained GAN generates backgrounds similar to that in the test sample. The generated background samples are then compared with the test sample to segment moving objects. The final result is computed by fusion of object boundaries in both modalities, RGB and the depth. The comparison of our proposed algorithm with five state-of-the-art methods on publicly available dataset has shown the strength of our algorithm for moving object segmentation in videos in the presence of challenging real scenarios.

研究の動機と目的

  • 照明の変化、影、色または深度のカモフラージュを伴う複雑な背景条件を有する実世界の動画における前景オブジェクトセグメンテーションの課題に対処すること。
  • 動的または曖昧な背景シーンにおいて性能が低下する従来のハンドクラフト手法およびディープラーニングベースの手法の限界を克服すること。
  • アノテーション付き学習データを必要とせず、RGBおよび深度モダリティを活用する教師なし学習フレームワークの構築。
  • 前景オブジェクトがほぼすべてのフレームに存在するブートストラップ状況においても、安定した背景モデルを学習できるよう強化すること。
  • GANが生成する背景から得られるRGBおよび深度モダリティの予測を統合することで、優れたセグメンテーション性能を達成すること。

提案手法

  • RGBおよび深度動画シーケンスに対して、教師なしの対抗訓練スキームを用いて、シーン固有の背景表現を学習する2つの独立したGANを訓練する。
  • 推論段階では、オプティカルフローを用いて動きマスクを推定し、テストフレームから動きのあるオブジェクトをマスクして背景コンテンツを分離する。
  • マスク処理を施したテストフレームを入力として、訓練済みのGANを用いて背景画像を生成し、逆誤差伝搬を活用して妥当な背景シーンを再構成する。
  • 生成された背景を元のテストフレームから差し引くことで、RGBおよび深度モダリティの両方において前景オブジェクト候補を抽出する。
  • 両モダリティからのバイナリセグメンテーションマスクを要素ごとの平均化または投票法で統合し、最終的な前景セグメンテーションを生成する。
  • GANが低ランクの背景構造をモデル化できる能力を活かし、時間的空間的一致性を確保することで、動的背景やノイズに対してより高い耐性を発揮する。

実験結果

リサーチクエスチョン

  • RQ1教師なしのGANベースのアプローチは、実世界の課題に直面した状況下でも、RGBおよび深度モダリティにおける背景表現を効果的に学習できるか?
  • RQ2RGBおよび深度GANの予測を統合することで、単一モダリティ手法に比べてセグメンテーションの耐性がどのように向上するか?
  • RQ3影、照明の変化、色のカモフラージュの状況において、GANが生成する背景は、従来の背景モデリング手法をどれほど上回るか?
  • RQ4前景オブジェクトがほぼすべてのフレームに存在するブートストラップ状況において、本手法はどの程度の性能を示すか?
  • RQ5RGBおよび深度予測の統合は、最先端の手法に比べて、より正確かつ一貫性のある前景セグメンテーションを達成できるか?

主な発見

  • 提案手法であるForeGAN_RGBDは、シャドウズカテゴリで最高のF-measureスコア(0.9271)を達成し、cwisardH+を含むすべての比較手法を上回った。
  • カラーカモフラージュカテゴリでは、ForeGAN_RGBDが最高のF-measure(0.8923)を記録し、前景オブジェクトが背景色に近い場合の耐性を示した。
  • ディープネスカモフラージュカテゴリでは、ForeGAN_RGBDが最高のF-measure(0.8891)を記録し、前景オブジェクトが背景と深さで類似する状況でも優れた性能を示した。
  • レンジ外れカテゴリでは、ForeGAN_RGBDが2番目のF-measure(0.8726)を記録し、極端な深度外れの状況においても強いがわずかに制限された性能を示した。
  • ブートストラップカテゴリでは、ForeGAN_RGBDが最高のF-measureを達成し、前景オブジェクトがほぼ常に存在する状況でも安定した背景モデルを学習できる能力を確認した。
  • 図2および図3の定性的な結果から、特に影や動きぼけを伴う複雑なシーンにおいて、他の比較手法に比べてより正確で完全な前景マスクを生成していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。