Skip to main content
QUICK REVIEW

[論文レビュー] ReMotENet: Efficient Relevant Motion Event Detection for Large-scale Home Surveillance Videos

Ruichi Yu, Hongcheng Wang|arXiv (Cornell University)|Jan 6, 2018
Video Surveillance and Tracking Methods参考文献 3被引用数 3
ひとこと要約

ReMotENet は、空間的・時間的注意機構とフレーム差分を備えた統合的でエンドツーエンドの 3D ConvNet を提案し、家庭用監視映像における関連する運動イベント(例:人物、車両)を検出する。15秒の動画クリップを一度の順方向伝搬で処理し、従来の二段階手法に比べ最大20,000倍の高速化を達成しながら、精度を維持または向上させ、GPUでは4–8ms、CPUでは0.4秒未満の推論時間を実現。モデルサイズは1MB未満。

ABSTRACT

This paper addresses the problem of detecting relevant motion caused by objects of interest (e.g., person and vehicles) in large scale home surveillance videos. The traditional method usually consists of two separate steps, i.e., detecting moving objects with background subtraction running on the camera, and filtering out nuisance motion events (e.g., trees, cloud, shadow, rain/snow, flag) with deep learning based object detection and tracking running on cloud. The method is extremely slow and therefore not cost effective, and does not fully leverage the spatial-temporal redundancies with a pre-trained off-the-shelf object detector. To dramatically speedup relevant motion event detection and improve its performance, we propose a novel network for relevant motion event detection, ReMotENet, which is a unified, end-to-end data-driven method using spatial-temporal attention-based 3D ConvNets to jointly model the appearance and motion of objects-of-interest in a video. ReMotENet parses an entire video clip in one forward pass of a neural network to achieve significant speedup. Meanwhile, it exploits the properties of home surveillance videos, e.g., relevant motion is sparse both spatially and temporally, and enhances 3D ConvNets with a spatial-temporal attention model and reference-frame subtraction to encourage the network to focus on the relevant moving objects. Experiments demonstrate that our method can achieve comparable or event better performance than the object detection based method but with three to four orders of magnitude speedup (up to 20k times) on GPU devices. Our network is efficient, compact and light-weight. It can detect relevant motion on a 15s surveillance video clip within 4-8 milliseconds on a GPU and a fraction of second (0.17-0.39) on a CPU with a model size of less than 1MB.

研究の動機と目的

  • 大規模な家庭用監視システムにおける従来の二段階運動検出パイプラインの非効率性と高レイテンシーを解消すること。
  • 背景差分とクラウドベースの物体検出を逐次処理するのではなく、統合的で軽量なニューラルネットワークに置き換えることで、計算コストを低減し、スケーラビリティを向上させること。
  • 監視映像における空間的・時間的冗長性を活用し、注目対象の物体の外観と運動パターンを統合的にモデル化すること。
  • CPUおよびGPU上で最小限のモデルサイズ(<1MB)と低レイテンシーを実現し、エッジデバイスに最適なリアルタイム検出を可能にすること。
  • 物体検出の結果から得られる疑似正例を用いた弱教師付き学習戦略を構築し、高コストな手動アノテーションを回避すること。

提案手法

  • ReMotENet は、空間的・時間的注意(STA)を備えた 3D ConvNet を用い、動画クリップにおける外観と運動を統合的にモデル化し、関連する移動物体に焦点を当てる。
  • 局所的基準フレーム(RefL)を用いたフレーム差分処理を実施し、静的背景を抑制し、動的前景を強調することで、入力の複雑さを低減する。
  • 従来手法のフレーム単位処理のボトルネックを解消するため、15秒の動画クリップを一度の順方向伝搬で処理する。
  • 疑似正例生成パイプラインでは、10FPSで動作する Faster R-CNN(信頼度閾値 >0.8)を用い、学習用のバイナリマスクを生成する。
  • 空間的注意メカニズムは、疑似ラベルと特徴マップのアライメントを実現するため、5×3グリッドプーリングを用いる。これにより、注意モジュールの弱教師付き学習が可能になる。
  • 物体検出の結果からの弱教師付き学習を用いて、エンドツーエンドでモデルを学習し、完全なアノテーションコストを回避する。

実験結果

リサーチクエスチョン

  • RQ1統合的でエンドツーエンドのディープラーニングモデルは、家庭用監視における従来の二段階運動検出パイプラインを、速度と精度の両面で上回ることができるか?
  • RQ2局所的基準フレーム(RefL)を用いたフレーム差分処理は、グローバル基準フレームや生フレームと比較して、運動検出の性能向上にどの程度寄与するか?
  • RQ3空間的・時間的注意機構は、関連する移動物体への注目を高めると同時に、計算負荷をどの程度低減できるか?
  • RQ4物体検出の疑似正例を用いた弱教師付き学習は、完全教師付き手法と同等の性能を達成できるか?
  • RQ5エッジデバイスにリアルタイムで展開可能なコンactで効率的なネットワークの推論レイテンシとモデルサイズはどの程度か?

主な発見

  • ReMotENet は、二段階物体検出ベースラインと同等またはそれ以上の平均精度を達成し、人物の運動検出では82.3% mAP、車両の運動検出では73.0% mAP(RefL-C3D 入力)を達成した。
  • 推論時間をGPUでは4–8ms、CPUでは0.17–0.39秒にまで短縮し、従来手法に比べ3–4桁の高速化(最大20,000倍)を実現した。
  • 局所的基準フレーム差分(RefL)を用いることで、グローバル基準フレームに比べ4.5%、生フレームに比べ5.5%のmAP向上を達成し、背景抑制の有効性が裏付けられた。
  • 数100回程度の学習イテレーションで良好な収束を示し、安定的かつ効率的な学習ダイナミクスを示した。
  • 最終的なモデルはコンパクトで、1MB未満のサイズであり、リソース制限のあるエッジデバイスへの展開に適している。
  • 物体検出の疑似正例から得た情報が、注意層の性能向上に顕著に寄与した。これにより、弱教師付き学習アプローチの有効性が検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。