[論文レビュー] Weakly-Supervised Spatio-Temporal Anomaly Detection in Surveillance Video
本稿では、動画レベルのラベルのみを用いて、非トリムド動画内の異常イベントを空間的・時間的チューブとして局所化する、弱教師付き時空間異常検出(WSSTAD)という新しいタスクを提案する。マルチスケールの時空間的特徴を活用するため、相互ガイド付き段階的精錬と関係性推論を組み合わせた二本のブランチからなるネットワークを導入し、2つの新しいベンチマークで最先端の性能を達成した。ST-UCF-Crimeでは87.65%のVAUCと8.98%のMIoUを達成し、STRAでは92.88%のVAUCと7.23%のMIoUを達成した。
In this paper, we introduce a novel task, referred to as Weakly-Supervised Spatio-Temporal Anomaly Detection (WSSTAD) in surveillance video. Specifically, given an untrimmed video, WSSTAD aims to localize a spatio-temporal tube (i.e., a sequence of bounding boxes at consecutive times) that encloses the abnormal event, with only coarse video-level annotations as supervision during training. To address this challenging task, we propose a dual-branch network which takes as input the proposals with multi-granularities in both spatial-temporal domains. Each branch employs a relationship reasoning module to capture the correlation between tubes/videolets, which can provide rich contextual information and complex entity relationships for the concept learning of abnormal behaviors. Mutually-guided Progressive Refinement framework is set up to employ dual-path mutual guidance in a recurrent manner, iteratively sharing auxiliary supervision information across branches. It impels the learned concepts of each branch to serve as a guide for its counterpart, which progressively refines the corresponding branch and the whole framework. Furthermore, we contribute two datasets, i.e., ST-UCF-Crime and STRA, consisting of videos containing spatio-temporal abnormal annotations to serve as the benchmarks for WSSTAD. We conduct extensive qualitative and quantitative evaluations to demonstrate the effectiveness of the proposed approach and analyze the key factors that contribute more to handle this task.
研究の動機と目的
- 監視動画における異常イベントの局所化を、粗い動画レベルのアノテーションのみで行う課題に対処すること。
- 空間的および時間的関係を複数のスケールで同時にモデル化することで、異常検出性能を向上させること。
- トレーニング時にインスタンスレベルやチューブレベルのアノテーションを一切必要としない、細粒度な時空間的局所化を可能にすること。
- 2つの新しいデータセット、ST-UCF-CrimeとSTRAを用いて、弱教師付き時空間異常検出のための新しいベンチマークを確立すること。
提案手法
- 異常概念のマルチスケールな捉え方を可能にするために、異なる空間的・時間的スケールでチューブ候補を処理する二本のブランチを持つネットワークアーキテクチャを提案。
- マルチヘッド自己注意に基づく関係性推論モジュールを採用し、物体間やチューブ間の相互作用をモデル化することで、文脈的・関係的特徴を統合し、異常推論を向上。
- 再帰的な二パス相互ガイドを用いた、相互ガイド付き段階的精錬(MGPR)フレームワークを導入。両ブランチ間で学習済みの概念を伝達することで、反復的に予測を精錬。
- スコアの崩壊を防ぎ、監視効果を高めるために、ランク損失($\mathcal{L}_{\textit{Rank}}$)と交差エントロピー損失($\mathcal{L}_{\textit{CE}}$)を組み合わせたハイブリッド損失関数を採用。
- 重複する物体をチューブにグループ化するためのマルチ変数チューブ(MVT)モジュールと、チューブ間の動的関係を学習する関係性モデリングモジュール(RMM)を統合。
- 本番のタスクを複数インスタンス学習(MIL)として扱う、新しいトレーニングパラダイムを設計。動画内に少なくとも1つの異常チューブが存在する場合、その動画は動画レベルラベルで示される。
実験結果
リサーチクエスチョン
- RQ1チューブレベルやフレームレベルのアノテーションが一切ない状況下でも、弱教師付き手法が非トリムド監視動画における時空間的異常を効果的に局所化できるか?
- RQ2マルチスケールの空間的・時間的チューブ候補を効果的に活用することで、異常検出性能をどのように向上させられるか?
- RQ3二本のブランチ間での相互ガイドが、モデルの精錬および異常局所化の正確性をどの程度向上させるか?
- RQ4物体間の相互作用を伴う複雑な異常行動の検出において、異なる相互作用メカニズム(例:MVT, RMM, GCN)が性能に与える影響は何か?
- RQ5再帰的最適化スキームにおいて、一方のブランチで学習された概念が、他方のブランチの精錬にどの程度寄与するか?
主な発見
- 提案されたMGPRフレームワークは、ST-UCF-Crimeで87.65%のVAUCと8.98%のMIoUを達成し、ベースラインを大きく上回った。
- STRAデータセットでは92.88%のVAUCと7.23%のMIoUを達成し、多様な異常タイプにわたる強力な汎化性能を示した。
- 時間的または空間的チューブブランチのいずれかを削除すると性能が低下し、マルチスケールモデリングの補完的役割が裏付けられた。
- 相互ガイドを用いた$\mathcal{L}_{\textit{MG-Rank}}$の使用は、単独のランク損失や交差エントロピー損失よりも顕著に性能を向上させた。
- 関係性モデリングモジュール(RMM)は、ST-UCF-CrimeとSTRAの両方でGCNベースのアプローチを0.66%および0.79%上回り、学習された適応的アテンション重みのおかげで優れた性能を発揮した。
- アブレーションスタディの結果、MVTとRMMの両方が不可欠であることが確認され、それらを削除すると顕著な性能低下が生じた。これは、マルチレベルの物体間相互作用モデリングの重要性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。