Skip to main content
QUICK REVIEW

[論文レビュー] Deep Neural Network Concepts for Background Subtraction: A Systematic Review and Comparative Evaluation

Thierry Bouwmans, Sajid Javed|arXiv (Cornell University)|Nov 13, 2018
Video Surveillance and Tracking Methods参考文献 149被引用数 10
ひとこと要約

本稿は、静止カメラの動画シーケンスにおける背景差分法に応用された深層ニューラルネットワーク(DNN)手法について、体系的レビューおよび比較評価を提示する。CDnet 2014ベンチマーク上で、畳み込みニューラルネットワーク(CNN)、オートエンコーダ、GAN、ハイブリッドモデルなどのDNNアーキテクチャを評価し、現代のDNNベースの手法が従来の非教師あり手法を著しく上回ることを示している。特に、トップモデルは複数のカテゴリでF-measureスコアが0.98を超える結果を達成した。

ABSTRACT

Conventional neural networks show a powerful framework for background subtraction in video acquired by static cameras. Indeed, the well-known SOBS method and its variants based on neural networks were the leader methods on the largescale CDnet 2012 dataset during a long time. Recently, convolutional neural networks which belong to deep learning methods were employed with success for background initialization, foreground detection and deep learned features. Currently, the top current background subtraction methods in CDnet 2014 are based on deep neural networks with a large gap of performance in comparison on the conventional unsupervised approaches based on multi-features or multi-cues strategies. Furthermore, a huge amount of papers was published since 2016 when Braham and Van Droogenbroeck published their first work on CNN applied to background subtraction providing a regular gain of performance. In this context, we provide the first review of deep neural network concepts in background subtraction for novices and experts in order to analyze this success and to provide further directions. For this, we first surveyed the methods used background initialization, background subtraction and deep learned features. Then, we discuss the adequacy of deep neural networks for background subtraction. Finally, experimental results are presented on the CDnet 2014 dataset.

研究の動機と目的

  • 本分野に新たに参入する研究者を対象に、背景差分に応用された深層ニューラルネットワークの概念を包括的にレビューすること。
  • 畳み込みニューラルネットワーク(CNN)、オートエンコーダ、生成対抗ネットワーク(GAN)などのさまざまなDNNアーキテクチャの、背景初期化、前景検出、特徴学習における有効性を分析すること。
  • 現在のDNNベースの手法における性能のギャップや制限要因を特定すること。特に、PTZカメラや複雑な背景といった困難なシナリオにおける課題を対象とする。
  • 今後の改善のためのマルチモーダル入力(例:RGB-D)や代替DNNアーキテクチャ(例:ピラミッド型CNN、深層信念ネットワーク)の可能性を検討すること。
  • 今後の研究を導くために、最適なネットワーク設計や入力表現の最適化といった未解決の課題を特定すること。

提案手法

  • DNNベースの背景差分手法を、背景初期化、前景検出、深層特徴学習の3つの主要なコンponentに分類・調査した。
  • CDnet 2014ベンチマークデータセット上で、20以上の最先端DNNモデル(3次元CNN、注目メカニズム付きConvLSTM、GANなど)を標準指標(F-measure、精度、再現率)を用いて評価した。
  • PTZ、影、悪天候、低フレームレートを含む11の動画カテゴリで性能を比較した。
  • 公平な比較のため、changedetection.netのウェブサイトと元論文を用いてF-measureスコアを収集・標準化した。
  • ResNet や UNet などのモデルにおける空間的・時間的モデリング、スキップ接続、残差学習などのアーキテクチャ的選択を分析した。
  • 入力モality(RGB、RGB-D、学習済み特徴分布など)の役割を検討し、パフォーマンスに与える影響を評価した。

実験結果

リサーチクエスチョン

  • RQ1静止カメラの動画シーケンスにおいて、背景初期化および前景検出に最も効果的な深層ニューラルネットワークアーキテクチャは何か?
  • RQ2CDnet 2014ベンチマークにおいて、DNNベースの手法は、多コーラー・マルチフィーチャーなどの従来の非教師あり手法と比べて、どのように性能を発揮するか?
  • RQ3カメラのジャイブ、PTZモーション、動的背景といった複雑なシナリオに対処するにあたり、現在のDNN手法の主な制限要因は何か?
  • RQ4マルチモーダル入力(例:RGB-D)を用いることで、深層学習ベースの背景差分法のロバスト性と正確性はどの程度向上するか?
  • RQ5GAN、注目メカニズム、3次元CNNなどの新興DNNアーキテクチャは、今後の背景差分システムにおいて、どの程度の可能性を示しているか?

主な発見

  • 最高性能を示した手法BScGANは、'Baseline'カテゴリでF-measure 0.9930、'Camera Jitter'で0.9796を記録し、優れたロバスト性を示した。
  • 3D Atrous CNNは、'Baseline'でF-measure 0.9897、'Bad Weather'で0.9833を達成し、時間的モデリングにおいて優れた性能を示した。
  • PSLとCRFを組み合わせた注目メカニズム付きConvLSTMは、'Dynamic Background'でF-measure 0.92以上、'Night Videos'で0.94以上を達成し、複雑な運動シナリオでも有効性を示した。
  • GANベースのモデル、特にBPVGANとBGANは、'Thermal'シーケンスでF-measure 0.9501および0.9339を記録し、低視界条件下でも優れた一般化性能を示した。
  • 多数のカテゴリで高い性能を発揮しているものの、多くのモデルが'PTZ'カテゴリではF-measureが0.90未満にとどまり、移動カメラの処理に課題を抱えていることが示された。
  • ForeGAN-RGBDモデルが示すように、RGB-D入力を用いることは、今後のDNNベースの背景差分法において強く有望な方向性であり、特に camouflage や深度に敏感なシナリオにおいて有効である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。