Skip to main content
QUICK REVIEW

[論文レビュー] Multiple Instance-Based Video Anomaly Detection using Deep Temporal Encoding-Decoding

Ammar Mansoor Kamoona, Amirali Khodadadian Gosta|arXiv (Cornell University)|Jul 3, 2020
Anomaly Detection Techniques and Applications被引用数 9
ひとこと要約

本稿では、複数インスタンス学習を用いて、時間的アノテーションが欠落した異常動画の弱教師あり動画異常検出のための弱教師あり深層時系列符号化・復元ネットワークを提案する。動画クリップを順序データとしてモデル化することで、空間的・時間的進化を捉える。本稿では、正常と異常予測の間の距離を最大化する新しい損失関数を導入し、UCF-Crimeで最先端の性能と低誤検出率を達成し、ShanghaiTechでも競争力のある結果を示した。

ABSTRACT

In this paper, we propose a weakly supervised deep temporal encoding-decoding solution for anomaly detection in surveillance videos using multiple instance learning. The proposed approach uses both abnormal and normal video clips during the training phase which is developed in the multiple instance framework where we treat video as a bag and video clips as instances in the bag. Our main contribution lies in the proposed novel approach to consider temporal relations between video instances. We deal with video instances (clips) as a sequential visual data rather than independent instances. We employ a deep temporal and encoder network that is designed to capture spatial-temporal evolution of video instances over time. We also propose a new loss function that is smoother than similar loss functions recently presented in the computer vision literature, and therefore; enjoys faster convergence and improved tolerance to local minima during the training phase. The proposed temporal encoding-decoding approach with modified loss is benchmarked against the state-of-the-art in simulation studies. The results show that the proposed method performs similar to or better than the state-of-the-art solutions for anomaly detection in video surveillance applications.

研究の動機と目的

  • 異常動画に時間的アノテーションが欠落しているため、弱教師あり動画異常検出の課題に対処すること。
  • 個々のインスタンスとして扱うのではなく、動画クリップを順序データとしてモデル化することで、従来の複数インスタンス学習フレームワークを改善すること。
  • 正常予測が誤って異常と分類されるのを抑えるために、より滑らかで頑健な損失関数を設計することで、監視下の応用における誤検出率を低減すること。
  • 時系列モデリングを用いたエンドツーエンドの深層学習により、UCF-Crime や ShanghaiTech などのベンチマークデータセットで最先端の性能を達成すること。
  • 階層的空間的・時系列特徴抽出により、実世界の監視動画における異常イベントの有効な局所化を可能にすること。

提案手法

  • 複数インスタンス学習フレームワークにおいて、各動画を「バッグ」とし、個々のクリップを「インスタンス」として扱い、訓練時に正常および異常動画の両方を用いる。
  • 時系列の動画クリップにわたる低レベル、中間レベル、高レベルの空間的・時系列的特徴を捉える深層時系列符号化・復元ネットワークを採用する。
  • インスタンスレベルの予測をバッグレベルの予測に集約するために平均プーリングを用い、従来の研究で用いられる最大プーリングよりも滑らかなマッピングを実現する。
  • 正常インスタンスと異常インスタンスの予測埋め込みの平均距離を最大化する新しい損失関数を設計し、正常インスタンスが誤って異常と分類された場合にペナルティを与える。
  • 訓練中に損失関数を適用し、正常と異常予測の間に明確なマージンを強制することで、誤検出を最小限に抑える。
  • C3D特徴量を用いてエンドツーエンドでモデルを訓練し、提案された損失関数に基づいて確率的勾配降下法で最適化することで、フレームレベルのアノテーションなしに弱教師あり学習を可能にする。

実験結果

リサーチクエスチョン

  • RQ1弱教師あり動画異常検出において、動画クリップ間の時間的依存性をどのように効果的にモデル化できるか?
  • RQ2階層的空間的・時系列表現を捉えることで、深層時系列符号化・復元ネットワークが異常検出性能を向上させられるか?
  • RQ3正常と異常予測の間に大きなマージンを強制することで、誤検出をペナルティ化する修正された損失関数が、より良い一般化性能をもたらすか?
  • RQ4提案手法は、ベンチマークデータセットにおける異常検出精度と誤検出率の観点で、最先端の手法と比較してどのように差がつくか?
  • RQ5弱教師ありの動画異常検出における効果的な順序モデリングを実現するための最適な時系列畳み込みカーネルサイズは何か?

主な発見

  • 提案手法は、UCF-Crimeデータセットで最先端の誤検出率を達成し、ベースライン手法や従来の最先端手法を顕著に上回った。
  • ShanghaiTechデータセットでは、AUCが87.42%を達成し、Zhongら[20]を11.23%、Zhaeerら[53]を3%上回ったが、Zaheerら[21]に2.36%劣った。
  • アブレーションスタディの結果、ED-TCNネットワークに提案された損失関数を適用した場合のAUCは76.56%にとどまり、提案手法の79.49%より低かった。これは、組み合わせたアーキテクチャと損失関数の有効性を示している。
  • バッグレベルの集約において最大プーリングを平均プーリングに置き換えることで、より滑らかな予測マッピングが得られ、誤検出の低減に寄与した。
  • UCF-Crimeにおける時系列畳み込みカーネルサイズ4が、最高のAUC性能(79.49%)を示し、この設定で最適な順序モデリング能力を示した。
  • 提案された損失関数は、正常クリップが高めの異常スコアを割り当てられるケースをペナルティ化することで、誤検出を効果的に低減した。これは、50%の閾値における低誤検出率が裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。