Skip to main content
QUICK REVIEW

[論文レビュー] Context Recovery and Knowledge Retrieval: A Novel Two-Stream Framework for Video Anomaly Detection

Congqi Cao, Yue Lu|arXiv (Cornell University)|Sep 7, 2022
Anomaly Detection Techniques and Applications被引用数 6
ひとこと要約

本稿では、局所的な運動パターンと学習された正常性の知識の両方を活用することで、異常検出性能を向上させる、文脈回復と知識取得を組み合わせた新規な二ストリームフレームワークを提案する。この手法は、再構成に基づく異常スコア算出に時間的空間的U-Netと最大局所誤差を用い、正常性知識の取得には改良された学習可能な局所性に敏感なハッシュ化(iL2SH)を採用し、4つのベンチマークデータセットで最先端の性能を達成した。

ABSTRACT

Video anomaly detection aims to find the events in a video that do not conform to the expected behavior. The prevalent methods mainly detect anomalies by snippet reconstruction or future frame prediction error. However, the error is highly dependent on the local context of the current snippet and lacks the understanding of normality. To address this issue, we propose to detect anomalous events not only by the local context, but also according to the consistency between the testing event and the knowledge about normality from the training data. Concretely, we propose a novel two-stream framework based on context recovery and knowledge retrieval, where the two streams can complement each other. For the context recovery stream, we propose a spatiotemporal U-Net which can fully utilize the motion information to predict the future frame. Furthermore, we propose a maximum local error mechanism to alleviate the problem of large recovery errors caused by complex foreground objects. For the knowledge retrieval stream, we propose an improved learnable locality-sensitive hashing, which optimizes hash functions via a Siamese network and a mutual difference loss. The knowledge about normality is encoded and stored in hash tables, and the distance between the testing event and the knowledge representation is used to reveal the probability of anomaly. Finally, we fuse the anomaly scores from the two streams to detect anomalies. Extensive experiments demonstrate the effectiveness and complementarity of the two streams, whereby the proposed two-stream framework achieves state-of-the-art performance on four datasets.

研究の動機と目的

  • 局所的再構成や予測誤差に依存する既存の動画異常検出手法が、グローバルな正常性をモデル化していないという限界を解決すること。
  • 標準的な文脈回復モデルが認識できない、シーン依存の異常(例:道路でサッカーをやる)を検出する課題を克服すること。
  • データの不均衡によってしばしば異常と誤分類されるレアなまたは稀な正常行動の検出を改善すること。
  • 短期的な運動の一貫性と長期的な正常行動の知識の両方を統合することで、モデルのロバスト性を向上させること。
  • 物体検出や外部データセットに依存せずに、多様なシナリオに一般化可能な最先端の性能を達成すること。

提案手法

  • 入力スニペットからの運動情報を利用して将来のフレームを予測する文脈回復ストリームとして、時間的空間的U-Net(STU-Net)を提案する。
  • 異常領域の回復誤差を隔離・強調することで、異常スコアの精度を向上させる最大局所誤差(MLE)機構を導入する。
  • シアンペアネットワークと相互差分損失を用いてハッシュ関数を最適化する、改良された学習可能な局所性に敏感なハッシュ化(iL2SH)を開発する。
  • iL2SHを用いて正常行動をハッシュコードとしてコンactな知識ベースにエンコードする。
  • テストスニペットの表現と知識ベースの最も近いエントリとの距離に基づいて異常スコアを算出し、正常行動との整合性を反映する。
  • 両ストリームからの異常スコアを学習可能または重み付き結合により統合し、最終的な検出スコアを生成する。

実験結果

リサーチクエスチョン

  • RQ1文脈回復と知識取得を統合した二ストリームフレームワークは、シーン依存の異常を検出する点で単一ストリーム手法を上回ることができるか?
  • RQ2学習可能な局所性に敏感なハッシュ化機構は、動画の正常行動に関する知識を効果的に符号化・取得できるか?
  • RQ3最大局所誤差機構を組み込むことで、再構成に基づく異常検出の局所的異常への感受性が向上するか?
  • RQ4提案フレームワークは物体検出や外部データセットに依存せずに最先端の性能を達成できるか?
  • RQ5二つのストリームは、短期的な運動異常とレアまたは文脈的に異常なイベントの検出において、どのように補い合っているか?

主な発見

  • 提案された二ストリームフレームワークは、ShanghaiTech、Avenue、Corridor、Ped2の4つのベンチマークデータセットで最先端の性能を達成した。
  • ShanghaiTechデータセットでは、物体検出を用いない状態で、マイクロ-AUCが83.7%を達成し、次善の手法(CAC)を4.4%、VADBを5.5%上回った。
  • 手動での領域クロッピングなしの公平な設定下でCorridorデータセットに適用したところ、マイクロ-AUCが73.1%に達し、比較されたすべての手法の中で最高となった。
  • Avenueデータセットではマクロ-AUCが99.3%を記録し、評価されたすべての手法の中で最高の結果を出した。
  • アブレーションスタディの結果、両ストリームは相補的であることが確認された:文脈回復ストリームは運動異常の検出に優れており、知識取得ストリームは文脈的に異常なイベントの検出を向上させた。
  • 異常が物体関連のPed2データセットでさえも、本手法は競争力を持ち、物体検出と光流の統合によりさらなる向上が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。