Skip to main content
QUICK REVIEW

[論文レビュー] A Discriminative Framework for Anomaly Detection in Large Videos

A. Giorno, J. Andrew Bagnell|arXiv (Cornell University)|Sep 28, 2016
Anomaly Detection Techniques and Applications参考文献 13被引用数 22
ひとこと要約

本論文は、トレーニングシーケンスや時系列順序の仮定を一切用いずに、大規模な動画における異常検出のための新しい教師なしフレームワークを提案する。異常を、同じ動画内の他のフレームと容易に区別できるフレームとして扱うことで、フレーム埋め込みの順列検定を用いて外れ値を同定する。この手法は、トレーニングデータなしの厳しい設定下でも、標準ベンチマークで最先端の性能を達成している。

ABSTRACT

We address an anomaly detection setting in which training sequences are unavailable and anomalies are scored independently of temporal ordering. Current algorithms in anomaly detection are based on the classical density estimation approach of learning high-dimensional models and finding low-probability events. These algorithms are sensitive to the order in which anomalies appear and require either training data or early context assumptions that do not hold for longer, more complex videos. By defining anomalies as examples that can be distinguished from other examples in the same video, our definition inspires a shift in approaches from classical density estimation to simple discriminative learning. Our contributions include a novel framework for anomaly detection that is (1) independent of temporal ordering of anomalies, and (2) unsupervised, requiring no separate training sequences. We show that our algorithm can achieve state-of-the-art results even when we adjust the setting by removing training sequences from standard datasets.

研究の動機と目的

  • トレーニング用の別個シーケンスが利用できない動画における異常検出を解決すること。異常は時系列順序に依存せずにスコアリング可能であるべきである。
  • 事前に正常行動のモデルを用いない、テスト動画そのものからのみ文脈を抽出する手法を開発すること。
  • ラベル付きデータが入手できないロボット工学、監視、個人用動画分析などの実世界のシナリオにおける異常検出を可能にすること。
  • ハイパーパrameterの変動に強く、事前の仮定なしに複雑で長時間の動画コンテンツを処理できるフレームワークを構築すること。

提案手法

  • 異常を、同じ動画内の他のフレームと容易に区別できるフレームとして定義することで、密度推定から判別学習へとアプローチを転換する。
  • 順列に基づく検定手順を用いる:フレームを動画全体でシャッフルし、実フレームとシャッフルされたフレームを区別する二値分類器を訓練する。
  • フレーム埋め込みは事前学習済みのCNN(例:Inflated 3D ConvNet)を用いて抽出され、分類器はこれらの特徴量上で訓練され、通常フレームと異常フレームの間の意思決定境界を学習する。
  • 各フレームの異常スコアは、分類器がそのフレームをランダムなフレーム順列から区別する際の信頼度から導出される。
  • 異常フレームの順序に依存しない不変性を有する。シャッフルによってフレーム特徴の分布が保持されるためである。
  • 正則化(λ)やウィンドウサイズ(tw)といったハイパーパrameterは調整され、複数回のシャッフルを用いることで、最適でない設定下でも耐性を高める。

実験結果

リサーチクエスチョン

  • RQ1トレーニングシーケンスや正常行動に関する事前知識が一切ない動画において、異常検出を効果的に行うことは可能か?
  • RQ2異常フレームの順序が検出スコアに影響しない場合、どのように高い性能を達成できるか?
  • RQ3シャッフルされたフレーム上で訓練された判別的分類器は、明示的な教師信号なしに真の異常をどの程度正確に同定できるか?
  • RQ4複雑で現実世界の動画環境において、順列ベースの検定戦略は従来の密度推定法を上回る性能を示せるか?
  • RQ5ラベル付きデータが欠如する状況下で、ハイパーパrameterの選択や特徴表現の質にどの程度頑健か?

主な発見

  • 本手法は、トレーニングシーケンスを一切使用しない最適設定下でも、AvenueデータセットでフレームベースAUC 0.8958を達成し、最先端の性能を示した。
  • Subwayデータセットでは、出口(exit)でAUC 0.8236、入り口(entrance)でAUC 0.6913を達成し、監視用途においても優れた性能を示した。
  • UMNデータセットでは、1つのシーンを除き[2]を上回り、動画全体の平均AUCは0.91であった。
  • トレーニング中にフレームをシャッフルすることで、ハイパーパrameterが最適でない場合でも性能が向上し、過学習や不適切な正則化に対する耐性が示された。
  • 15フレームの時系列ウィンドウのため、真のイベントの15フレーム前から異常を検出できるが、動的シーンでは誤検出を引き起こす可能性がある。
  • 強力な性能を発揮しているものの、右側から人物が入ってくるような曖昧なケースでは、正解ラベルがトレーニングデータに依存するため、依然として困難を抱えている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。