Skip to main content
QUICK REVIEW

[論文レビュー] Self-trained Deep Ordinal Regression for End-to-End Video Anomaly Detection

Guansong Pang, Yan Cheng|arXiv (Cornell University)|Mar 15, 2020
Anomaly Detection Techniques and Applications参考文献 41被引用数 22
ひとこと要約

本論文は、手動でラベル付けされた正常データに依存しないエンドツーエンドの動画異常検出のための自己学習型ディープ順序回帰フレームワークを提案する。このフレームワークは、表現学習と異常スコアリングを統合的に最適化でき、8つの実世界データセットで最先端の性能を達成する。異常検出を反復的自己学習を用いた二クラス順序回帰の代理タスクとして定式化することで、優れた異常局所化性能と人間によるフィードバック統合の柔軟性を実現した。

ABSTRACT

Video anomaly detection is of critical practical importance to a variety of real applications because it allows human attention to be focused on events that are likely to be of interest, in spite of an otherwise overwhelming volume of video. We show that applying self-trained deep ordinal regression to video anomaly detection overcomes two key limitations of existing methods, namely, 1) being highly dependent on manually labeled normal training data; and 2) sub-optimal feature learning. By formulating a surrogate two-class ordinal regression task we devise an end-to-end trainable video anomaly detection approach that enables joint representation learning and anomaly scoring without manually labeled normal/abnormal data. Experiments on eight real-world video scenes show that our proposed method outperforms state-of-the-art methods that require no labeled training data by a substantial margin, and enables easy and accurate localization of the identified anomalies. Furthermore, we demonstrate that our method offers effective human-in-the-loop anomaly detection which can be critical in applications where anomalies are rare and the false-negative cost is high.

研究の動機と目的

  • 大量の手動ラベル付き正常データを必要とする従来の動画異常検出手法の限界を解消すること。
  • 二段階アプローチにおける特徴学習の最適化が不十分である問題を克服し、特徴学習と異常スコアリングの統合的最適化を可能にすること。
  • 自己学習による偽ラベルを用いた弱教師あり学習を可能にするエンドツーエンドで学習可能なフレームワークを構築すること。
  • 高リスクな応用分野における効果的な人間によるフィードバック統合を可能にする、異常検出のための人的介入型アーキテクチャを実現すること。
  • クラス活性マップ(CAM)技術を用いて、空間的・時間的局所化の精度を高める異常領域の特定を実現すること。

提案手法

  • エンドツーエンド学習を可能にするために、動画異常検出を代理の二クラス順序回帰タスクとして定式化する。
  • 事前学習済みバックボーン(例:ResNet-50)を初期化に用い、汎用的な非教師あり異常検出器によって生成された偽ラベルを活用する。
  • 複数エポックにわたり反復的自己学習を適用し、偽ラベルの精度を向上させるとともに、異常スコア予測の性能を改善する。
  • 微分可能でない特徴抽出器(CNNベース)と全結合層による異常スコアリングヘッドを統合し、両者の統合的最適化を実現する。
  • 初期の偽ラベルをiForest や Sp+ といった非教師ありベースラインから生成する弱教師あり学習の枠組みを採用する。
  • クラス活性マップ(CAM)を活用し、正確な異常局所化のためのサリエンシーマップを生成する。

実験結果

リサーチクエスチョン

  • RQ1自己学習型ディープ順序回帰は、正常データのラベルが一切不要な状態で、従来の最先端の非教師あり動画異常検出手法を上回る性能を達成できるか?
  • RQ2特徴学習と異常スコアリングのエンドツーエンド学習は、二段階アプローチに比べてより優れた検出性能をもたらすか?
  • RQ3反復的自己学習は、異常率が異なる多様な動画データセットにおいて、どの程度検出性能を向上させるか?
  • RQ4本手法は、専門家のフィードバックを容易に統合できる人間によるフィードバック統合型異常検出を実現できるか?
  • RQ5本手法は、ベースライン手法と比較して、異常領域の局所化においてどの程度の精度を示し、異なる動画ドメインに一般化できるか?

主な発見

  • 提案手法は、8つの実世界動画データセットにおいて、ラベルなしで学習可能な従来の非教師あり手法を著しく上回る最先端の性能を達成した。
  • UMNデータセットではAUCが97.4%に達し、多様な異常タイプと動画シーンにわたる強力な一般化性能を示した。
  • 自己学習により、すべてのデータセットでAUC性能が向上し、特に最初の数ステップで顕著な向上が観察され、4〜5ステップ目で安定化した。
  • 同一の特徴入力を用いても、Del Giornoら [8] #2 に相当する二段階ベースラインを常に上回った。これは、エンドツーエンド最適化の優位性を裏付けた。
  • CAMに基づくサリエンシーマップを用いて、正確な異常局所化が可能であり、歩行者区域を横切る車両や、あらゆる方向に走る人々といった異常領域を的確に特定した。
  • 本手法はバックボーンアーキテクチャの変更に対しても頑健であり、VGG、3DConv、ResNet-50のいずれの構成でも高い性能を発揮した。これは、異なるネットワーク設計にわたる一般化性能の高さを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。