Skip to main content
QUICK REVIEW

[論文レビュー] Video Abnormal Event Detection by Learning to Complete Visual Cloze Tests

Siqi Wang, Guang Yu|arXiv (Cornell University)|Aug 5, 2021
Anomaly Detection Techniques and Applications参考文献 74被引用数 6
ひとこと要約

本稿では、視覚的穴埋めテスト(VCT)の完成を学習する形で異常イベント検出(VAD)を定式化する、新しい動画異常イベント検出(VAD)手法である視覚的穴埋め完成(VCC)を提案する。時間的・空間的立方体(STC)に、外見的および運動的特徴を用いてイベントを局所化し、その一部を削除してVCTを作成し、深層ネットワークを用いて欠落した部分と光流を再構築するように学習させることで、VCCは複数のベンチマークで最先端の性能を達成し、局所化の精度が向上するとともに、包括的な文脈モデリングが可能となる。

ABSTRACT

Although deep neural networks (DNNs) enable great progress in video abnormal event detection (VAD), existing solutions typically suffer from two issues: (1) The localization of video events cannot be both precious and comprehensive. (2) The semantics and temporal context are under-explored. To tackle those issues, we are motivated by the prevalent cloze test in education and propose a novel approach named Visual Cloze Completion (VCC), which conducts VAD by learning to complete "visual cloze tests" (VCTs). Specifically, VCC first localizes each video event and encloses it into a spatio-temporal cube (STC). To achieve both precise and comprehensive localization, appearance and motion are used as complementary cues to mark the object region associated with each event. For each marked region, a normalized patch sequence is extracted from current and adjacent frames and stacked into a STC. With each patch and the patch sequence of a STC compared to a visual "word" and "sentence" respectively, we deliberately erase a certain "word" (patch) to yield a VCT. Then, the VCT is completed by training DNNs to infer the erased patch and its optical flow via video semantics. Meanwhile, VCC fully exploits temporal context by alternatively erasing each patch in temporal context and creating multiple VCTs. Furthermore, we propose localization-level, event-level, model-level and decision-level solutions to enhance VCC, which can further exploit VCC's potential and produce significant performance improvement gain. Extensive experiments demonstrate that VCC achieves state-of-the-art VAD performance. Our codes and results are open at https://github.com/yuguangnudt/VEC_VAD/tree/VCC.

研究の動機と目的

  • 既存のDNNベースのVAD手法が、異常イベントの正確かつ包括的な局所化を達成する点での限界を克服する。
  • 現在のVADアプローチにおいて未だ十分に活用されていない動画の意味的特徴と時間的文脈を克服する。
  • 視覚的穴埋めテストを活用して、正常な動画パターンを暗黙的に学習する自己教師付き学習の枠組みを構築する。
  • 局所化、イベント、モデル、意思決定の各レベルでのマルチレベルアンサンブル戦略を通じて、VAD性能を向上させる。
  • 異常イベントのアノテーションを必要とせず、ワンクラス分類の原則に整合した効果的な異常検出を可能にする。

提案手法

  • 外見的および運動的特徴を補完的特徴として用いて、正確かつ包括的な注目領域(RoI)の提案を生成する。
  • 検出されたRoIの周囲の正規化されたパッチ列を積み重ねることで、時間的・空間的立方体(STC)を抽出する。
  • 各STCから中心部分のパッチ(およびその光流)を意図的に削除することで、視覚的穴埋めテスト(VCT)を作成する。
  • 削除されたパッチとその光流を再構築するための別個の深層ニューラルネットワーク(ST-UNets)を訓練し、完成の過程で動画の意味的特徴を学習する。
  • 異なる時間的位置でパッチを削除することで、複数のVCTタイプを生成し、時間的文脈を序列的に活用する。
  • モダリティおよびモデルのアンサンブル戦略(VCTタイプアンサンブルおよびモダリティアンサンブル)を適用し、耐性および性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1異常データを用いた学習が不要な状況でも、視覚的穴埋め完成を用いて正常な動画パターンを効果的に学習できるか?
  • RQ2スライディングウィンドウ法やフレームレベルのアプローチと比較して、提案されたVCC手法は、局所化の精度と包括性をどのように向上させるか?
  • RQ3欠落したパッチおよび光流の再構築を学習することで、VADにおける意味的および時間的文脈理解はどの程度向上するか?
  • RQ4局所化、イベント、モデル、意思決定の各レベルでのマルチレベルアンサンブル戦略は、VCCにおける性能向上にどの程度寄与するか?
  • RQ5VCCは、フレームレベルおよびピクセルレベルの異常検出ベンチマークにおいて、既存の最先端手法を上回ることができるか?

主な発見

  • VCCはUCSD Ped2、Avenue、ShanghaiTechの各データセットで最先端の性能を達成し、フレームレベルおよびピクセルレベルの評価指標において、先行手法を上回っている。
  • 正常なイベントでは再構築誤差が顕著に低減しており、完成誤差は物体の輪郭付近に一様に分布する一方、異常イベントでは、高レベルの物体部品に鋭く集中する誤差を示している。
  • アブレーションスタディの結果、VCTを標準的な再構築に置き換えるとAUCが3%〜7%低下するため、穴埋めテストの定式化が不可欠であることが裏付けられた。
  • UCSD Ped2では1フレームあたり平均0.16秒、Avenueでは0.19秒、ShanghaiTechでは0.21秒の推論コストであり、妥当な計算効率を示している。
  • 動画イベント抽出ステップが主な計算ボトル neck であるが、独立したST-UNetモデルの並列化によりさらなる高速化が可能である。
  • 可視化結果から、異常イベントの完成誤差は意味的に解釈可能であり、しばしば四肢、鞄、投げられた物体などの誤分類または歪みを生じた物体部品に集中している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。