Skip to main content
QUICK REVIEW

[論文レビュー] MGFN: Magnitude-Contrastive Glance-and-Focus Network for Weakly-Supervised Video Anomaly Detection

Yingxian Chen, Zhengzhe Liu|arXiv (Cornell University)|Nov 28, 2022
Anomaly Detection Techniques and Applications被引用数 7
ひとこと要約

本論文は、弱教師付き動画異常検出のための新規なグレース・アンド・フォーカスネットワーク(MGFN)を提案する。特徴強調とマグニチュード対照的損失を組み合わせることで、人間の視覚的注意に倣い、まず全体的な文脈を捉え、次に局所的な異常を注目する。また、対照的損失を用いてシーンに適応した特徴マグニチュードを学習することで、UCF-Crimeで86.98% AUC、XD-Violenceで80.11% APを達成し、最先端の性能を実現した。

ABSTRACT

Weakly supervised detection of anomalies in surveillance videos is a challenging task. Going beyond existing works that have deficient capabilities to localize anomalies in long videos, we propose a novel glance and focus network to effectively integrate spatial-temporal information for accurate anomaly detection. In addition, we empirically found that existing approaches that use feature magnitudes to represent the degree of anomalies typically ignore the effects of scene variations, and hence result in sub-optimal performance due to the inconsistency of feature magnitudes across scenes. To address this issue, we propose the Feature Amplification Mechanism and a Magnitude Contrastive Loss to enhance the discriminativeness of feature magnitudes for detecting anomalies. Experimental results on two large-scale benchmarks UCF-Crime and XD-Violence manifest that our method outperforms state-of-the-art approaches.

研究の動機と目的

  • 長時間の動画における異常の局所化に課題を抱える既存の弱教師付き動画異常検出手法の、全体的文脈認識の不足を是正する。
  • 単一のマグニチュードベースの監視に依存する場合に、シーン間で特徴マグニチュードの不一致が生じ、異常検出性能を低下させることを是正する。
  • 正常と異常イベントをより明確に分離できるように、シーンに適応した特徴マグニチュードの分布を学習することで、特徴の判別能を向上させる。
  • 全体的な時間的文脈と局所的な空間的詳細を統合する包括的なフレームワークを構築し、より正確で頑健な異常局所化を実現する。

提案手法

  • 最初に全動画シーケンスを処理して長期的な時間的文脈(グレース)を捉え、次に局所的セグメントで検出を精緻化する(フォーカス)という、グレース・アンド・フォーカス(GF)ネットワークアーキテクチャを提案する。
  • 特徴マグニチュードの変動に対するモデルの感受性を高め、異常検出のための表現学習を向上させるため、特徴強調機構(FAM)を導入する。
  • 同じカテゴリ(正常または異常)の動画間で特徴マグニチュードの類似性を高めるとともに、カテゴリ間の分離性を最大化するように設計されたマグニチュード対照的(MC)損失を提案する。
  • フレームレベルのアノテーションを必要とせず、動画レベルの弱教師付き学習を用い、MC損失を通じて判別性の高い特徴マグニチュードを学習する。
  • GFモジュールとFAM、MC損失をエンド・トゥ・エンドでトレーニング可能なフレームワークに統合し、全体的文脈モデリングと局所的異常感受性の共同最適化を可能にする。
  • グローバルおよびローカル特徴を別々に処理する二重ストリーム特徴抽出戦略を採用し、GF機構がグローバルからローカルレベルへの情報伝達を効果的に実現する。

実験結果

リサーチクエスチョン

  • RQ1グレース・アンド・フォーカスメカニズムにより、全体的文脈と局所的詳細を統合することで、長時間動画における異常局所化が向上するか?
  • RQ2シーン間で特徴マグニチュードの不一致が、マグニチュードベースの異常検出手法の性能を低下させるか?
  • RQ3シーンに適応した特徴マグニチュード分布を学習する対照的損失により、正常と異常特徴の分離性が向上するか?
  • RQ4提案された特徴強調機構(FAM)は、微細なまたは低マグニチュードの異常を検出する能力をどの程度向上させるか?
  • RQ5グレース・アンド・フォーカス、FAM、MC損失の組み合わせが、既存の最先端手法に比べて弱教師付き設定でどのように優れているか?

主な発見

  • MGFNはUCF-Crimeデータセットで86.98% AUC、XD-Violenceデータセットで80.11% APを達成し、最先端の手法を上回った。
  • アブレーションスタディの結果、グレース・アンド・フォーカス機構を追加することで、UCF-CrimeのAUCが82.66%(FF)から85.80%に向上し、グローバルおよびローカル特徴の統合の有効性が示された。
  • 特徴強調機構(FAM)単体で、UCF-CrimeのAUCが1.65ポイント、XD-ViolenceのAPが1.02ポイント向上し、特徴感受性の向上が裏付けられた。
  • マグニチュード対照的(MC)損失単体でも、UCF-CrimeのAUCが2.85ポイント、XD-ViolenceのAPが3.69ポイント向上し、特徴の判別能向上におけるその役割が確認された。
  • FAMとMC損失を併用すると、最高の性能(86.98% AUCおよび80.11% AP)が達成され、両者の相乗効果が検証された。
  • 定性的な結果から、MGFNは複数の異常クリップを含む複雑なシーンでも正確に異常を局所化でき、動的な動きを伴う正常動画でも偽陽性を低く抑えることができた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。