[論文レビュー] MIST: Multiple Instance Self-Training Framework for Video Anomaly Detection
MISTは、偽ラベル生成のためのスパarsな連続サンプリング戦略と自己ガイドドアテンションモジュールを用いて、弱教師付き動画異常検出のための複数インスタンス自己訓練フレームワークを提案する。これにより、判別性の高い特徴表現学習が向上し、最先端の性能を達成。ShanghaiTechでフレームレベルAUCが94.83%に達し、従来手法よりも高速な推論と低いFLOPsを実現した。
Weakly supervised video anomaly detection (WS-VAD) is to distinguish anomalies from normal events based on discriminative representations. Most existing works are limited in insufficient video representations. In this work, we develop a multiple instance self-training framework (MIST)to efficiently refine task-specific discriminative representations with only video-level annotations. In particular, MIST is composed of 1) a multiple instance pseudo label generator, which adapts a sparse continuous sampling strategy to produce more reliable clip-level pseudo labels, and 2) a self-guided attention boosted feature encoder that aims to automatically focus on anomalous regions in frames while extracting task-specific representations. Moreover, we adopt a self-training scheme to optimize both components and finally obtain a task-specific feature encoder. Extensive experiments on two public datasets demonstrate the efficacy of our method, and our method performs comparably to or even better than existing supervised and weakly supervised methods, specifically obtaining a frame-level AUC 94.83% on ShanghaiTech.
研究の動機と目的
- 動画レベルのアノテーションのみを用いる弱教師付き動画異常検出(WS-VAD)の課題に対処し、表現学習を制限する要因を軽減すること。
- 既存手法におけるノイズの多い偽ラベルの問題を、複数インスタンス学習(MIL)フレームワークを用いてクリップレベルのラベルを精緻化することで克服すること。
- 外部アノテーションを一切用いずに、異常領域に適応的に注目するタスク固有の特徴エンコーダーを開発すること。
- 2段階の自己訓練スキームにより、偽ラベル生成と特徴エンコーディングを同時に最適化することで、効率性と正確性を向上させること。
- リアルタイムストリーミング動画における高い検出性能を維持しながら、ドメインギャップと計算コストを低減すること。
提案手法
- スパースで連続的なサンプリングを用いる複数インスタンス偽ラベル生成器を提案し、異常動画のクリップレベル偽ラベルをより信頼性の高いものに生成する。
- クリップレベルのアノテーションと偽ラベルを用いて、動的に異常領域を強調する自己ガイドドアテンションを備えた特徴エンコーダー(E_SGA)を導入する。
- スパース連続サンプリングを組み合わせた深層MILランクイング損失を採用し、異常クリップの周囲の文脈的情報に注目することで、偽ラベルの品質を向上させる。
- 2段階の自己訓練スキームを適用:まず事前学習済みエンコーダーから偽ラベルを生成し、次に正常動画および偽ラベル付き異常動画を用いて特徴エンコーダーを精緻化する。
- 繰り返し最適化を回避するため、最小-最大正規化と時系列スムージングなどの後処理技術を用いてラベルノイズを低減する。
- 大バッチサイズにおける勾配蓄積を活用し、訓練中にさらにラベルノイズを抑制する。

実験結果
リサーチクエスチョン
- RQ1自己訓練フレームワークは、動画レベルのアノテーションのみを用いる弱教師付き動画異常検出において、特徴表現学習をどのように向上させ得るか?
- RQ2動画レベルの監視によるノイズの多いラベル生成を、どのようにしてより頑健に改善できるか?
- RQ3人為的バウンディングボックスが存在しない状況でも、自己ガイドドアテンション機構は効果的に異常領域を局所化できるか?
- RQ42段階の自己訓練プロセスは、既存の反復的またはエンドツーエンドの訓練戦略に比べ、正確性と効率性の面で優れているか?
- RQ5提案手法は、低い計算コストと高速な推論速度を維持しながら、最先端の性能を達成できるか?
主な発見
- MISTはShanghaiTechデータセットでフレームレベルAUCが94.83%を達成し、従来の教師ありおよび弱教師あり手法を上回った。
- MIST-I3Dモデルは324.46 FPSで実行され、FLOPsは45.68Gにとどまり、Zhongら[35]の10クロップ推論と386.2G FLOPsに比べて顕著に高速かつ効率的だった。
- 自己ガイドドアテンションモジュールは、可視化された7例中5例で異常領域を効果的に強調した。空間的アテンションの有効性が示された。
- 精緻化後、ShanghaiTechでAUCが+8.48ポイント(58.66%から67.14%)向上した。ノイズ低減技術の有効性が裏付けられた。
- MIST-C3Dモデルは精緻化後、73.37%のAUCを達成し、軽量バックボーンでも優れた性能を示した。
- フレームワークは、精度と推論速度の両面で、最先端手法であるZhongら[35]を上回った。特にShanghaiTechデータセットにおいて顕著な優位性を示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。