[論文レビュー] Dual Memory Units with Uncertainty Regulation for Weakly Supervised Video Anomaly Detection
本稿では、弱教師付き動画異常検出(WS-VAD)のための新規な不確実性制御型デュアルメモリユニット(UR-DMU)モデルを提案する。本モデルは、正常および異常プロトタイプのためのデュアルメモリバンクを活用し、正常データの不確実性学習スキームを用いて誤検出を低減する。グローバルかつローカルなマルチヘッド自己注意モジュールとデュアルメモリ分離損失を統合することで、UCF-CrimeおよびXD-Violenceで最先端の性能を達成し、XD-ViolenceではAUCが94.02%、APが82.85%を記録する。これは先行手法を顕著に上回る結果である。
Learning discriminative features for effectively separating abnormal events from normality is crucial for weakly supervised video anomaly detection (WS-VAD) tasks. Existing approaches, both video and segment-level label oriented, mainly focus on extracting representations for anomaly data while neglecting the implication of normal data. We observe that such a scheme is sub-optimal, i.e., for better distinguishing anomaly one needs to understand what is a normal state, and may yield a higher false alarm rate. To address this issue, we propose an Uncertainty Regulated Dual Memory Units (UR-DMU) model to learn both the representations of normal data and discriminative features of abnormal data. To be specific, inspired by the traditional global and local structure on graph convolutional networks, we introduce a Global and Local Multi-Head Self Attention (GL-MHSA) module for the Transformer network to obtain more expressive embeddings for capturing associations in videos. Then, we use two memory banks, one additional abnormal memory for tackling hard samples, to store and separate abnormal and normal prototypes and maximize the margins between the two representations. Finally, we propose an uncertainty learning scheme to learn the normal data latent space, that is robust to noise from camera switching, object changing, scene transforming, etc. Extensive experiments on XD-Violence and UCF-Crime datasets demonstrate that our method outperforms the state-of-the-art methods by a sizable margin.
研究の動機と目的
- 弱教師付き動画異常検出(WS-VAD)における高い誤検出率を低減するため、正常データのパターンをよりよくモデル化すること。
- 既存手法が異常特徴の判別的学習に注力する一方で、正常データの表現を軽視するという限界を克服すること。
- カメラ切り替え、物体の変化、シーン遷移に起因するノイズに対して、より高い耐性を持つこと。
- 正常および異常プロトタイプを分離するデュアルメモリバンクを用いた、より効果的なメモリ機構の開発。
- 不確実性モデリングを通じてノイズに強い潜在的正常空間を学習し、異常検出性能を向上させること。
提案手法
- 動画シーケンスにおける長距離および局所的時間的依存性をより表現力豊かに捉えるために、グローバルかつローカルなマルチヘッド自己注意(GL-MHSA)モジュールを導入する。
- ビデオレベルのラベルを用いて、正常プロトタイプ用と異常プロトタイプ用の2つのメモリバンクを設け、代表的な特徴を格納・分離する。
- 正常と異常メモリ表現のマージンを最大化するように設計されたデュアルメモリ分離損失を導入し、判別能力を向上させる。
- 正常特徴を学習可能な平均と分散を持つガウス分布としてモデリングする正常データ不確実性学習(NUL)スキームを提案し、ノイズ耐性を向上させる。
- 特徴の大きさに基づくパラダイムを用いて正例の選択を誘導し、異常検出において効果的なRTFM戦略に整合させる。
- GL-MHSA、デュアルメモリユニット、NULを統合した統一フレームワーク内で、特徴学習、メモリ表現、不確実性モデリングを共同最適化する。

実験結果
リサーチクエスチョン
- RQ1正常データの潜在的構造をモデリングすることで、弱教師付き動画異常検出における検出性能の向上と誤検出の低減が図れるか?
- RQ2正常および異常プロトタイプのためのデュアルメモリバンクを用いることで、単一のメモリバンクよりも正常と異常パターンの分離が向上するか?
- RQ3正常特徴の不確実性モデリングにより、カメラ切り替え、物体の変化、シーン遷移に起因するノイズに対する耐性が向上するか?
- RQ4GL-MHSAモジュールは、異常動画表現においてグローバルおよびローカルな時間的依存性を効果的に捉えられるか?
- RQ5各損失成分(三重損失、デュアルメモリ損失、KL損失、分離損失)が全体の検出性能に果たす寄与度は何か?
主な発見
- 完全なUR-DMUモデルは、XD-ViolenceデータセットでAUCが94.02%、APが82.85%を達成し、最先端の手法を上回る。
- UCF-Crimeでは、AUCが86.97%、APが37.25%を記録し、多様なデータセットにおいて優れた性能を示している。
- アブレーションスタディの結果、DMUモジュールの追加によりAUCとAPが向上し、誤検出率(FAR)が4.86%から1.05%に低下した。
- NULモジュール単体でも、AUCが2.37ポイント、APが2.20ポイント向上し、正常空間正則化における有効性が顕著に示された。
- GL-MHSAモジュールは特徴表現に顕著な寄与を示し、全アブレーション設定において最高の性能を達成した。
- 定性的な結果から、本手法はRTFMよりもより正確な異常局所化を実現し、滑らかな遷移を伴う複雑なシーンでも誤検出率が低いことが確認された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。