Skip to main content
QUICK REVIEW

[論文レビュー] A Foreground Inference Network for Video Surveillance Using Multi-View Receptive Field

Thangarajah Akilan|arXiv (Cornell University)|Jan 19, 2018
Video Surveillance and Tracking Methods参考文献 44被引用数 4
ひとこと要約

本論文は、複数の受容 field サイズを活用して多スケール特徴抽出と空間的精度を向上させる、マルチビュー受容 field 全畳み込みネットワーク(MV-FCN)を提案する。インセプションモジュールと残差接続を用いて、動画監視における前景セグメンテーションを向上させる。アノテートされたフレーム上でエンドツーエンドに学習されたモデルは、11のベンチマークデータセットで最先端の性能を達成し、複雑な後処理に依存することを減らす。1フレームあたりの平均推論時間は 0.445 秒(2.25 FPS)である。

ABSTRACT

Foreground (FG) pixel labelling plays a vital role in video surveillance. Recent engineering solutions have attempted to exploit the efficacy of deep learning (DL) models initially targeted for image classification to deal with FG pixel labelling. One major drawback of such strategy is the lacking delineation of visual objects when training samples are limited. To grapple with this issue, we introduce a multi-view receptive field fully convolutional neural network (MV-FCN) that harness recent seminal ideas, such as, fully convolutional structure, inception modules, and residual networking. Therefrom, we implement a system in an encoder-decoder fashion that subsumes a core and two complementary feature flow paths. The model exploits inception modules at early and late stages with three different sizes of receptive fields to capture invariance at various scales. The features learned in the encoding phase are fused with appropriate feature maps in the decoding phase through residual connections for achieving enhanced spatial representation. These multi-view receptive fields and residual feature connections are expected to yield highly generalized features for an accurate pixel-wise FG region identification. It is, then, trained with database specific exemplary segmentations to predict desired FG objects. The comparative experimental results on eleven benchmark datasets validate that the proposed model achieves very competitive performance with the prior- and state-of-the-art algorithms. We also report that how well a transfer learning approach can be useful to enhance the performance of our proposed MV-FCN.

研究の動機と目的

  • 変動する照明条件や動的背景の下でも、動画監視における正確な前景ピクセルレベルのラベル付けを実現すること。
  • 手動による特徴工学や複雑な背景モデリング、反復的後処理に依存する従来手法の限界を克服すること。
  • 多スケールおよびマルチパス特徴学習を用いた深層学習により、一般化性能と空間的精度を向上させること。
  • 限られた学習データにおける転移学習の有効性を実証すること。
  • 最大プーリングや全結合層を排除し、空間的表現をより良く保てる、完全畳み込み型でエンドツーエンドで学習可能なネットワークを構築すること。

提案手法

  • MV-FCN は、コアパスと2つの補完的特徴フローパスを備えたエンコーダデコーダアーキテクチャを採用し、多スケール特徴を捉える。
  • インセプションモジュールを初期段階および後段階に適用し、3種類のカーネルサイズ(例:1×1、3×3、5×5)を用いて多スケールの認識を模倣する。
  • 残差接続により、エンコード済み特徴とデコード済み特徴マップを統合し、空間的詳細の保持と勾配の流れの向上を実現する。
  • ネットワークは完全畳み込み型であり、最大プーリングや全結合層を排除することで、空間分解能を全体的に維持する。
  • モデルは、真値の前景・背景セグメンテーションを教師信号として用い、エンドツーエンドで学習することでピクセル単位分類を可能にする。
  • 転移学習は、ImageNet で事前学習済み重みでネットワークを初期化することで実施され、限られたデータセット上での収束性と性能向上が図られる。

実験結果

リサーチクエスチョン

  • RQ1マルチビュー受容 field を備えた完全畳み込みネットワークは、従来の深層学習モデルと比較して、前景セグメンテーションの精度を向上させることができるか?
  • RQ2インセプションモジュールと残差接続の統合は、前景検出における複数スケールの特徴表現をどのように向上させるか?
  • RQ3転移学習は、学習サンプルが限られたデータセット上での MV-FCN の性能をどの程度向上させるか?
  • RQ4提案されたアーキテクチャは、反復的後処理や複雑な背景モデリングなしで、競争力のある性能を達成できるか?
  • RQ5MV-FCN の推論速度と、標準ハードウェア上でのリアルタイム実行可能性はいかほどか?

主な発見

  • MV-FCN は、11のベンチマーク動画監視データセットにおいて、競争的な性能を示し、前景セグメンテーション精度で最先端の手法を上回るか同等の結果を達成した。
  • インセプションモジュールによる多スケール特徴学習のおかげで、照明の変化や動的背景に対しても頑健であることが示された。
  • 残差接続により空間的精度が顕著に向上し、境界のぼかしやアーチファクトが低減され、物体の境界が明確に抽出された。
  • 標準 CPU 上で 1 フレームあたり 0.445 秒(2.25 FPS)の平均推論時間を達成しており、実用的なリアルタイム実行可能性を示している。
  • 転移学習により性能が顕著に向上し、特に学習データが限られたデータセット上での有効性が確認された。事前学習済み特徴初期化の価値が裏付けられた。
  • 複雑な後処理や反復的背景モデリングの必要がなくなり、パイプラインが簡素化されながらも高い精度を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。