Skip to main content
QUICK REVIEW

[論文レビュー] A Hybrid Video Anomaly Detection Framework via Memory-Augmented Flow Reconstruction and Flow-Guided Frame Prediction

Zhian Liu, Yongwei Nie|arXiv (Cornell University)|Aug 16, 2021
Anomaly Detection Techniques and Applications参考文献 46被引用数 16
ひとこと要約

本稿では、最初にマルチレベルメモリ拡張オートエンコーダーとスキップ接続を備えたML-MemAE-SCを用いて光-flowを再構築し、その後その再構築済み光-flowを条件付けとして用いる条件付き変分オートエンコーダー(CVAE)により将来のフレームを予測することで、異常イベントの予測誤差を拡大させることで異常検出性能を向上させるハイブリッド動画異常検出フレームワークHF²-VADを提案する。本手法は、光-flowの再構築品質を向上させることで、UCSD Ped2データセットで99.31%のAUROCを達成し、最先端の性能を発揮した。

ABSTRACT

In this paper, we propose $ ext{HF}^2$-VAD, a Hybrid framework that integrates Flow reconstruction and Frame prediction seamlessly to handle Video Anomaly Detection. Firstly, we design the network of ML-MemAE-SC (Multi-Level Memory modules in an Autoencoder with Skip Connections) to memorize normal patterns for optical flow reconstruction so that abnormal events can be sensitively identified with larger flow reconstruction errors. More importantly, conditioned on the reconstructed flows, we then employ a Conditional Variational Autoencoder (CVAE), which captures the high correlation between video frame and optical flow, to predict the next frame given several previous frames. By CVAE, the quality of flow reconstruction essentially influences that of frame prediction. Therefore, poorly reconstructed optical flows of abnormal events further deteriorate the quality of the final predicted future frame, making the anomalies more detectable. Experimental results demonstrate the effectiveness of the proposed method. Code is available at \href{https://github.com/LiUzHiAn/hf2vad}{https://github.com/LiUzHiAn/hf2vad}.

研究の動機と目的

  • ラベル付き異常データが乏しい動画において、まれで境界のない異常イベントを検出する課題に対処すること。
  • 統合的で相乗効果のあるフレームワークとして、光-flow再構築とフレーム予測を組み合わせることで異常検出性能を向上させること。
  • 光-flowの再構築誤差を活用して異常イベントにおける予測誤差を拡大することで、検出感度を向上させること。
  • 正常な空間時間的パターンをよりよく記憶できるメモリ拡張アーキテクチャを設計し、再構築の正確性を向上させること。

提案手法

  • ML-MemAE-SCネットワークは、異なる特徴レベルに複数のメモリモジュールを配置し、正常な光-flowパターンを記憶することで、正常イベントの再構築品質を向上させる。
  • メモリ圧縮による情報損失を軽減するため、エンコーダーとデコーダーのブロック間にスイッチバック接続を組み込む。
  • 光-flowは、ML-MemAE-SCを用いて再構築された後、CVAEベースの将来フレーム予測モデルに供給される。
  • CVAEは過去のフレームと再構築済み光-flowを条件として用い、フレームと光-flowの整合性を活用することで、予測精度を向上させる。
  • 異常スコアは、光-flow再構築誤差とフレーム予測誤差の合計として計算され、誤差が大きいほど異常イベントと判定される。
  • モデルは正常な動画データのみを用いてエンドツーエンドで訓練され、再構築誤差と予測誤差の損失関数を通じて正常なダイナミクスを学習する。

実験結果

リサーチクエスチョン

  • RQ1光-flow再構築とフローファイルドフレーム予測を統合したハイブリッドフレームワークは、単独の再構築または予測手法を上回る動画異常検出性能を達成できるか?
  • RQ2メモリ拡張型光-flow再構築は、異常イベントの再構築誤差を増大させることで、検出性能をどのように向上させるか?
  • RQ3生の光-flowではなく再構築済み光-flowを用いることで、異常検出におけるフレーム予測の品質と感度はどの程度向上するか?
  • RQ4マルチレベルメモリモジュールとスイッチバック接続は、光-flow再構築と下流の予測性能の向上にどの程度寄与するか?

主な発見

  • UCSD Ped2データセットにおいて、HF²-VADの完全モデルは99.31%のAUROCを達成し、すべてのアブレーションバージョンおよび最先端のベースラインを上回った。
  • アブレーションスタディの結果、3つのメモリモジュールを備えたML-MemAE-SCとCVAEによる予測が最高の性能を示し、ハイブリッド設計の有効性を確認した。
  • 再構築のみのモデルは、ML-MemAE-SC(3メモリ)を用いることで98.81%のAUROCを達成し、光-flow再構築そのものによっても強い異常感度を示した。
  • 再構築済み光-flowを条件としてCVAEを用いた予測のみのモデルは98.28%のAUROCを達成し、光-flow条件なしのVAEベースの予測を著しく上回った。
  • 故障事例分析の結果、絶対値が小さい光-flow値を示す遠方の物体は検出が難しく、今後の改善には深度認識モデリングの導入が必要であることが示唆された。
  • モデルは約10フレーム/秒で実行可能であり、1フレームあたり0.015秒の推論時間であるため、リアルタイム応用に適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。