Skip to main content
QUICK REVIEW

[論文レビュー] Weakly-supervised Video Anomaly Detection with Robust Temporal Feature Magnitude Learning

Yu Tian, Guansong Pang|arXiv (Cornell University)|Jan 25, 2021
Anomaly Detection Techniques and Applications被引用数 5
ひとこと要約

本稿では、弱教師あり動画異常検出のための新規手法であるロバスト時系列特徴マグニチュード(RTFM)学習を提案する。この手法は、異常スニペットが極めてまれである状況において、MILに基づくモデルの性能を向上させるために特徴マグニチュードを学習することで、異常動画内の正常スニペットに対するロバスト性を向上させる。RTFMは、4つのベンチマークで最先端の性能を達成し、微細な異常の検出性能とサンプル効率の両方を向上させた。

ABSTRACT

Anomaly detection with weakly supervised video-level labels is typically formulated as a multiple instance learning (MIL) problem, in which we aim to identify snippets containing abnormal events, with each video represented as a bag of video snippets. Although current methods show effective detection performance, their recognition of the positive instances, i.e., rare abnormal snippets in the abnormal videos, is largely biased by the dominant negative instances, especially when the abnormal events are subtle anomalies that exhibit only small differences compared with normal events. This issue is exacerbated in many methods that ignore important video temporal dependencies. To address this issue, we introduce a novel and theoretically sound method, named Robust Temporal Feature Magnitude learning (RTFM), which trains a feature magnitude learning function to effectively recognise the positive instances, substantially improving the robustness of the MIL approach to the negative instances from abnormal videos. RTFM also adapts dilated convolutions and self-attention mechanisms to capture long- and short-range temporal dependencies to learn the feature magnitude more faithfully. Extensive experiments show that the RTFM-enabled MIL model (i) outperforms several state-of-the-art methods by a large margin on four benchmark data sets (ShanghaiTech, UCF-Crime, XD-Violence and UCSD-Peds) and (ii) achieves significantly improved subtle anomaly discriminability and sample efficiency. Code is available at https://github.com/tianyu0207/RTFM.

研究の動機と目的

  • 動画レベルでのラベル付けのみが行われる状況において、異常イベントがほとんど存在しない正常スニペットに埋もれてしまう稀な異常スニペットを検出する課題に対処すること。
  • 特に微細な異常に対して、異常動画からのネガティブインスタンスに対して強いロバスト性を示す複数インスタンス学習(MIL)手法を改善すること。
  • ドーナツ型畳み込みと自己注意機構を用いて、短距離および長距離の時系列依存関係を捉えることで、特徴学習を強化すること。
  • 分類スコアよりも強力なトレーニング信号として特徴マグニチュードを用いることで、異常動画データのより効果的な活用を可能にすること。
  • 既存の最先端手法と比較して、微細な異常の判別能を向上させるとともに、より高いサンプル効率を達成すること。

提案手法

  • スニペットをスカラー値のマグニチュードにマップする特徴マグニチュード学習関数を提案する。ここで、高いマグニチュードは異常を、低いマグニチュードは正常を示す。
  • スニペット内の長距離および短距離の時系列依存関係をモデル化するために、ドーナツ型畳み込みと自己注意メカニズムを統合する。
  • トップ-kインスタンスMILに基づく学習目的を定式化し、トップ-kの異常スニペットと正常スニペットの平均特徴マグニチュードの差を最大化する。
  • 特徴マグニチュード学習とMIL分類を同時に最適化することで、特徴空間における正常スニペットと異常スニペットの間のマージンを大きくする。
  • 特徴のℓ₂ノルムを異常スコアの代理として用いることで、異常スニペットが微細であっても効果的な検出が可能になる。
  • トップ-kの異常スニペットの平均マグニチュードが正常スニペットの平均マグニチュードを上回ることを理論的に裏付けたフレームワークを設計する。

実験結果

リサーチクエスチョン

  • RQ1特徴マグニチュード学習は、異常動画内の支配的である正常スニペットに対して、MILベースの動画異常検出のロバスト性を向上させることができるか?
  • RQ2長距離および短距離の時系列依存関係を捉えることで、弱教師あり設定下での微細な異常の判別能が向上するか?
  • RQ3分類スコアよりも特徴マグニチュードが、MILにおけるポジティブインスタンスの特定に強力なトレーニング信号として機能するか?
  • RQ4既存の最先端手法と比較して、RTFMはどれほどサンプル効率と稀な・微細な異常の検出性能を向上させるか?
  • RQ5トップ-kの異常スニペットの平均特徴マグニチュードが正常スニペットの平均マグニチュードを上回るという仮定は、実世界のデータセットにおいて実証的に妥当か?

主な発見

  • RTFMはShanghaiTechで97.21%のAUC、UCF-Crimeで84.30%のAUCを達成し、ベースラインおよび最先端手法を顕著に上回った。
  • アブレーションスタディの結果、特徴マグニチュード(FM)モジュールを追加するだけで、ShanghaiTechで7%以上、UCF-Crimeで4%以上のAUC向上が見られ、その強力な影響を示した。
  • FMに加えてドーナツ型畳み込み(PDC)と時系列自己注意(TSA)を組み合わせることで、ShanghaiTechで92.32%のAUC、UCF-Crimeで82.12%のAUCを達成し、相乗効果が確認された。
  • 実証的検証により、トップ-kの異常スニペットの平均特徴マグニチュード(53.4)が正常スニペットの平均マグニチュード(7.7)を顕著に上回ることが確認され、理論的仮定の妥当性が裏付けられた。
  • モデルは、視覚的差がほとんどない状況下でも、盗難や店舗強盗などの微細な行動を含め、1本の動画内で複数の異常イベントを正常に検出できた。
  • 異常スニペット(平均0.85)と正常スニペット(平均0.13)の間で、異常スコアに大きなマージンが観察され、特徴空間における分離性の高さが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。