[論文レビュー] Weakly-supervised Video Anomaly Detection with Contrastive Learning of Long and Short-range Temporal Features.
本論文は、マルチスケールの短時間および長時間の時間的依存関係をモデル化するため、膨張畳み込みのピラミッドと自己注意機構を組み合わせた弱教師あり動画異常検出手法MTN-KMILを提案する。さらに、特徴量およびスコアレベルの両方で上位K個の正常スニペットと異常スニペットの間に大きなマージンを確保するため、top-K対照的複数インスタンス学習(KMIL)を用いる。この手法により、ShanghaiTech、UCF-Crime、XD-Violenceの3つのデータセットで最先端の性能を達成した。
In this paper, we address the problem of weakly-supervised video anomaly detection, in which given video-level labels for training, we aim to identify in test videos, the snippets containing abnormal events. Although current methods based on multiple instance learning (MIL) show effective detection performance, they ignore important video temporal dependencies. Also, the number of abnormal snippets can vary per anomaly video, which complicates the training process of MIL-based methods because they tend to focus on the most abnormal snippet -- this can cause it to mistakenly select a normal snippet instead of an abnormal snippet, and also to fail to select all abnormal snippets available. We propose a novel method, named Multi-scale Temporal Network trained with top-K Contrastive Multiple Instance Learning (MTN-KMIL), to address the issues above. The main contributions of MTN-KMIL are: 1) a novel synthesis of a pyramid of dilated convolutions and a self-attention mechanism, with the former capturing the multi-scale short-range temporal dependencies between snippets and the latter capturing long-range temporal dependencies; and 2) a novel contrastive MIL learning method that enforces large margins between the top-K normal and abnormal video snippets at the feature representation level and anomaly score level, resulting in accurate anomaly discrimination. Extensive experiments show that our method outperforms several state-of-the-art methods by a large margin on three benchmark data sets (ShanghaiTech, UCF-Crime and XD-Violence). The code is available at this https URL
研究の動機と目的
- 既存のMILベースの手法が時間的依存関係を無視し、異常スニペットの数が変動する場合に困難を抱えるという限界を是正すること。
- 動画スニペット内の短時間および長時間の時間的依存関係をモデル化することで、異常検出を改善すること。
- 特徴量レベルおよびスコアレベルの両方で上位K個の正常スニペットと異常スニペットの間に大きなマージンを強制する対照的学習戦略を開発すること。
- クラス不均衡や異常継続時間の変動にかかわらず、すべての異常スニペットを正確に識別できるようにすること。
提案手法
- 短い時間的依存関係を複数の受容 field をカバーするように、膨張畳み込みのピラミッドを用いてマルチスケール時間ネットワーク(MTN)を設計する。
- 遠く離れた動画スニペット間の長時間的依存関係をモデル化するため、MTNに自己注意機構を統合する。
- 上位K個の最も異常なスニペットと上位K個の最も正常なスニペットを比較する、top-K対照的複数インスタンス学習(KMIL)フレームワークを提案する。
- 特徴表現レベルおよび異常スコアレベルの両方で、正常スニペットと異常スニペットの分離を高めるために、大きなマージン制約を適用する。
- 対照的損失を適用して、上位K個の異常スニペットの特徴量が、上位K個の正常スニペットの特徴量から埋め込み空間上で分離されるようにする。
- スニペットレベルのアノテーションが不要で、動画レベルのラベルのみを用いてエンドツーエンドで学習可能であるため、弱教師あり学習が可能になる。
実験結果
リサーチクエスチョン
- RQ1短時間および長時間の時間的依存関係を同時にモデル化することで、弱教師あり動画異常検出の性能が向上するか?
- RQ2対照的学習を複数インスタンス学習に適応させることで、正常スニペットと異常スニペットの分離がより良くなるか?
- RQ3特徴量レベルおよびスコアレベルの両方で大きなマージンを強制することで、異常継続時間が変動する動画における異常識別性能が向上するか?
- RQ4提案されたMTN-KMIL手法は、標準ベンチマークで既存の最先端手法を上回るか?
主な発見
- MTN-KMILはShanghaiTechデータセットで最先端の性能を達成し、従来手法を顕著に上回った。
- UCF-Crimeデータセットでは、既存のSOTAアプローチを上回る高い平均平均精度(mAP)を達成した。
- XD-Violenceデータセットでは、複数または長期間にわたる異常の検出精度が特に優れており、優れた検出性能を示した。
- アブレーションスタディの結果、マルチスケール時間モデリングと対照的KMIL損失の両方が、性能向上に顕著な貢献をしていることが確認された。
- 異常スニペットの数が変動する状況でもモデルは頑健であり、最も異常なスニペットにのみ注目するという一般的な問題を回避できた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。