Skip to main content
QUICK REVIEW

[論文レビュー] Spatio-temporal Video Parsing for Abnormality Detection

Borislav Antić, Björn Ommer|Open access LMU (Ludwid Maxmilian's Universitat Munchen)|Feb 22, 2015
Anomaly Detection Techniques and Applications参考文献 37被引用数 10
ひとこと要約

本論文は、異常訓練データを必要とせず、学習データから正常オブジェクト仮説を共同で推論することで間接的に異常を検出する、空間時間的動画解析フレームワークを提案する。グラフィカルモデルにおける凸最適化問題として定式化することにより、UCSD ped1 や ped2 などの混雑したベンチマークデータセットにおいて、異常分類および局所化の両面で最先端の性能を達成した。

ABSTRACT

Abnormality detection in video poses particular challenges due to the infinite size of the class of all irregular objects and behaviors. Thus no (or by far not enough) abnormal training samples are available and we need to find abnormalities in test data without actually knowing what they are. Nevertheless, the prevailing concept of the field is to directly search for individual abnormal local patches or image regions independent of another. To address this problem, we propose a method for joint detection of abnormalities in videos by spatio-temporal video parsing. The goal of video parsing is to find a set of indispensable normal spatio-temporal object hypotheses that jointly explain all the foreground of a video, while, at the same time, being supported by normal training samples. Consequently, we avoid a direct detection of abnormalities and discover them indirectly as those hypotheses which are needed for covering the foreground without finding an explanation for themselves by normal samples. Abnormalities are localized by MAP inference in a graphical model and we solve it efficiently by formulating it as a convex optimization problem. We experimentally evaluate our approach on several challenging benchmark sets, improving over the state-of-the-art on all standard benchmarks both in terms of abnormality classification and localization.

研究の動機と目的

  • 異常訓練データが存在しない動画におけるレアかつ未知の異常イベントを検出する課題に対処すること。
  • 既存手法が異常検出を独立した局所的パッチ分類として扱うという限界を克服すること。
  • 前景ピクセルを説明するため、空間時間的オブジェクト仮説を共同で推論する統一フレームワークを構築すること。
  • いかなる正常訓練プロトタイプでも説明できない仮説を特定することで、間接的に異常を検出すること。
  • 異常ラベルなしでピクセル単位の異常確率推定を可能にすること。

提案手法

  • 判別的背景分類器と動きに基づく時間的連結を用いて、各フレームで前景オブジェクト候補を検出し、空間時間的仮説を形成する。
  • 潜在変数が仮説選択および正常プロトタイプへの一致を表すグラフィカルモデルを構築する。
  • 推論問題をMAP推定問題として定式化し、凸最適化問題に変換することでグローバル収束を保証する。
  • 形状、位置、外観、運動の一貫性を用いて、仮説と正常プロトタイプ間の対応スコアを計算する。
  • 前景の説明を対数尤度項の和としてモデル化し、対数および指数変換により凸性を保証する。
  • パーサーインジケータに関して仮説説明項の線形近似を導出し、効率的な最適化を可能にする。

実験結果

リサーチクエスチョン

  • RQ1正常オブジェクト仮説の共同空間時間的パーサーが、異常訓練データに依存せずに動画における異常検出を改善できるか?
  • RQ2前景カバレッジに不可欠だが、正常プロトタイプでは説明できない仮説を特定することで、どのように異常を間接的に局所化できるか?
  • RQ3推論問題の凸最適化定式化が、複雑で混雑したシーンにおけるロバストネスと性能をどの程度向上させるか?
  • RQ4提案手法が標準ベンチマークで異常分類および局所化の両面で最先端の結果を達成できるか?
  • RQ5ピクセル単位の異常確率マップは、異常ラベルなしで異常を効果的にセグメンテーションできるか?

主な発見

  • 提案手法は、UCSD ped1 や ped2 を含むすべての標準ベンチマークで最先端の性能を達成し、従来手法を両分類および局所化の面で上回った。
  • 本フレームワークは、車両が歩行者専用区域に入る、または人々が歩道を自転車で走るといった、事前に定義されていない自発的異常を効果的に検出できた。
  • 凸最適化の使用によりグローバル収束と安定した推論が保証され、重なり合う複雑なシーンでも信頼性の高い検出が可能になった。
  • 異常訓練サンプルが一切不要な状態でピクセル単位の異常確率マップが生成され、間接的推論により効果的に異常をセグメンテーションした。
  • 相互に重なり合う関係や空間時間的一致性を考慮する共同推論機構のおかげで、極めて混雑したシーンにおいてもロバストであることが示された。
  • 理論的分析により、目的関数の凸性が確認され、最適化プロセスがグローバル最適解に収束することが保証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。