[論文レビュー] Hybrid Classifiers for Spatio-temporal Real-time Abnormal Behaviors Detection, Tracking, and Recognition in Massive Hajj Crowds
本稿では、小型および大規模なハッジ集団映像における異常行動のリアルタイム検出、追跡、認識を目的としたハイブリッドCNN-RFフレームワークを提案する。空間的異常検出には微調整されたResNet-50を、運動ベースの局所化にはHorn-Schunckオプティカルフローを、追跡にはカルマンフィルタを、時間的分類には統計的運動特徴に基づくランダムフォレストを用い、UMNで99.77%、新規のHAJJv2データセットで76.08%のAUCを達成した。
Individual abnormal behaviors vary depending on crowd sizes, contexts, and scenes. Challenges such as partial occlusions, blurring, large-number abnormal behavior, and camera viewing occur in large-scale crowds when detecting, tracking, and recognizing individuals with abnormal behaviors. In this paper, our contribution is twofold. First, we introduce an annotated and labeled large-scale crowd abnormal behaviors Hajj dataset (HAJJv2). Second, we propose two methods of hybrid Convolutional Neural Networks (CNNs) and Random Forests (RFs) to detect and recognize Spatio-temporal abnormal behaviors in small and large-scales crowd videos. In small-scale crowd videos, a ResNet-50 pre-trained CNN model is fine-tuned to verify whether every frame is normal or abnormal in the spatial domain. If anomalous behaviors are observed, a motion-based individuals detection method based on the magnitudes and orientations of Horn-Schunck optical flow is used to locate and track individuals with abnormal behaviors. A Kalman filter is employed in large-scale crowd videos to predict and track the detected individuals in the subsequent frames. Then, means, variances, and standard deviations statistical features are computed and fed to the RF to classify individuals with abnormal behaviors in the temporal domain. In large-scale crowds, we fine-tune the ResNet-50 model using YOLOv2 object detection technique to detect individuals with abnormal behaviors in the spatial domain.
研究の動機と目的
- 高密度、オクルージョン、カメラの制限要因により性能が低下する中で、大規模なハッジ集団における異常行動の検出、追跡、認識の課題に対処すること。
- 小型および大規模な集団状況の両方で、走る、流れと逆方向に歩行するなど複数の異常行動タイプを区別できる、耐障害性の高いリアルタイムシステムを開発すること。
- ハッジ集団における異常行動検出を目的とした、大規模でアノテーション済みのラベル付き新規データセットであるHAJJv2を提供すること。
- 深層学習(CNN)と従来の機械学習(ランダムフォレスト)を統合し、空間的・時間的異常認識を向上させることで、精度と一般化性能を向上させること。
- 公開ベンチマーク(UMN, UCSD)と、新たに収集された極めて困難な大規模データセット(HAJJv2)の両方で、手法の評価を行うこと。
提案手法
- 小型スケールの動画に対して事前学習済みのResNet-50 CNNを微調整し、各フレームを空間ドメインで正常または異常と分類する。
- Horn-Schunckオプティカルフローを適用して運動の大きさと方向特徴を抽出し、異常行動を示す個体の局所化と追跡に用いられるバイナリマスクを生成する。
- カルマンフィルタを用いて、大規模な動画のフレーム間で個体を予測・追跡し、オクルージョンや運動ぼやけに対して耐性を高める。
- 各追跡対象の運動軌跡について、平均、分散、標準偏差といった時間的統計特徴を計算する。
- これらの時間的特徴を用いてランダムフォレスト分類器を学習させ、個体を特定の異常行動カテゴリに分類する。
- 大規模な状況では、高密度なシーンにおける物体検出精度を向上させるために、YOLOv2と微調整済みのResNet-50を統合する。
実験結果
リサーチクエスチョン
- RQ1ハイブリッドCNN-RFモデルは、小型集団の動画において、複数の異常行動タイプをリアルタイムで効果的に検出し、識別できるか?
- RQ2オプティカルフローとカルマンフィルタの統合は、オクルージョンを伴う大規模で高密度な集団における追跡の耐障害性をどのように向上させるか?
- RQ3UMNやUCSDといった公開ベンチマークにおいて、提案手法は最先端の手法をどの程度上回るか?
- RQ4極めて困難な大規模集団データセット(HAJJv2)において、モデルの有効性はどの程度か?特に、重度のオクルージョンと遠距離カメラ視点が課題となる状況で。
- RQ5統計的運動特徴(平均、分散、標準偏差)は、異常行動の時間的分類を向上させるために果たす役割は何か?
主な発見
- UMNベンチマークデータセットでは99.77%の平均AUCを達成し、最先端手法を1.67ポイント上回った。
- UCSD Ped1データセットでは93.71%の平均AUCを達成し、SOTAを6.06ポイント上回った。
- UCSD Ped2データセットでは98.55%の平均AUCを記録し、SOTAを2.85ポイント上回った。
- 大規模集団では、HAJJv2データセットで76.08%の平均AUCを達成し、重度のオクルージョンや遠距離視点といった極めて困難な課題にもかかわらず、満足できる性能を示した。
- 解像度が低く、カメラアングル、影、照明が悪いなどの要因により、UCSD Ped1では性能が低く抑えられた。これは、画像品質に感受性があることを示している。
- HAJJv2のマサアシーンは、カメラが近接しており、オクルージョンも中程度であったため、分類が比較的容易であった。一方、タワーフおよびジャマラットシーンは、高密度と遠距離視点のため、依然として最も困難な課題であった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。