Skip to main content
QUICK REVIEW

[論文レビュー] An Adaptive Training-less System for Anomaly Detection in Crowd Scenes

Arindam Sikdar, Ananda S. Chowdhury|arXiv (Cornell University)|Jun 3, 2019
Anomaly Detection Techniques and Applications参考文献 42被引用数 6
ひとこと要約

本稿では、事前学習データが不要なトレーニングフリーで、リアルタイムで動作する、適応的かつ動的である群衆シーンの異常検出システムを提案する。本手法は、3次元離散コサイン変換(3D-DCT)を用いた適応的アプローチにより複数対象の関連付けを実現し、局所的運動記述には明著性を考慮した光流を採用し、異常スコアリングには地球移動距離(EMD)を用いる。これにより、モデル学習を一切行わず、UCSD、UMN、CHUK-Avenue、ShanghaiTechの各データセットで最先端のAUC性能(例:UMNで0.982、ShanghaiTechで0.768)を達成した。

ABSTRACT

Anomaly detection in crowd videos has become a popular area of research for the computer vision community. Several existing methods generally perform a prior training about the scene with or without the use of labeled data. However, it is difficult to always guarantee the availability of prior data, especially, for scenarios like remote area surveillance. To address such challenge, we propose an adaptive training-less system capable of detecting anomaly on-the-fly while dynamically estimating and adjusting response based on certain parameters. This makes our system both training-less and adaptive in nature. Our pipeline consists of three main components, namely, adaptive 3D-DCT model for multi-object detection-based association, local motion structure description through saliency modulated optic flow, and anomaly detection based on earth movers distance (EMD). The proposed model, despite being training-free, is found to achieve comparable performance with several state-of-the-art methods on the publicly available UCSD, UMN, CHUK-Avenue and ShanghaiTech datasets.

研究の動機と目的

  • ラベル付きトレーニングデータが入手不可能な監視環境、特に遠隔地やデータ量が少ない環境において、異常検出の課題に取り組むこと。
  • 群衆の運動における粒子的相互作用に関する仮定を一切設けず、事前学習を必要としないリアルタイムな異常検出システムの開発。
  • 明著性駆動型の運動記述子とリアルタイムでの領域提案に注目することで、非定常な異常への動的適応を可能にすること。
  • モデルの微調整や分布に基づく事前学習を必要とせず、トレーニングベースの最先端手法と同等の性能を達成すること。

提案手法

  • 動的3次元離散コサイン変換(3D-DCT)モデルを用いて、動画クリップから空間的・時間的特徴を抽出し、トラッキングを必要とせずに複数対象の検出と関連付けを実現する。
  • 局所的運動構造を記述するために明著性を考慮した光流を採用し、明著な領域に注目することで、異常な運動パターンへの感受性を向上させる。
  • 地球移動距離(EMD)を用いて、局所的運動記述子の分布を学習済みの正常パターンと比較し、分布のずれに基づいて異常を同定する。
  • 明著性と運動構造に基づいて動的に領域提案を生成することで、計算を異常な可能性のある領域に集中させ、リアルタイムかつ適応的な推論を実現する。
  • 分類器の学習や分布適合を一切行わない、エンドツーエンドのトレーニングフリーなパイプラインを統合し、リアルタイムで動作させる。
  • 3D-DCTとEMDの本質的な頑健性を活用し、照明、視点、群衆密度の変化に対しても再学習なしに耐性を持つ。

実験結果

リサーチクエスチョン

  • RQ1トレーニングデータや事前学習モデルに依存せず、多様な群衆動画ベンチマークで競争力のある異常検出性能を達成できるか?
  • RQ2適応的領域提案と明著性駆動型光流は、動的で非定常かつ希少な異常を効果的に検出できるか?
  • RQ33D-DCTとEMDの組み合わせにより、粒子動力学に関する仮定を一切設けず、トレーニングなしで頑健かつリアルタイムな異常検出が可能になるか?
  • RQ4複数のベンチマークデータセットにおいて、本手法は最先端のトレーニングベース手法と比較して、性能と効率の両面で優れているか?

主な発見

  • 提案手法はUMNデータセットでAUC 0.982を達成し、[6] や H-MDT-CRF といった複数のトレーニングベース手法を上回った。
  • CHUK-AvenueデータセットではAUC 0.8099を達成し、第2位となり、Conv-AE [14]、Del et al. [13]、TSC [23] を上回った。
  • より複雑なShanghaiTech Campusデータセットでは、AUC 0.768を記録し、最高水準となり、sRNN [23] よりも8.8%高い性能を示した。
  • 標準的なハードウェア(3 GHz CPU、8GB RAM)上でも、1フレームあたり2.17~3.25秒で動画フレームを処理でき、GPU加速やコード最適化なしで実現した。
  • 明著性検出部はUMNデータセットでAUC 0.9823を達成し、RWRV(0.9702)を上回り、SP-Liu(0.9896)に近い性能を示した。
  • 完全にトレーニングフリーであるにもかかわらず、分布適合や分類器学習に依存する最先端手法と同等の性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。