Skip to main content
QUICK REVIEW

[論文レビュー] Skeletal Video Anomaly Detection using Deep Learning: Survey, Challenges and Future Directions

Pratik K. Mishra, Alex Mihailidis|arXiv (Cornell University)|Dec 31, 2022
Anomaly Detection Techniques and Applications被引用数 6
ひとこと要約

本論文は、顔貌や外見特徴を含まない人体関節位置を用いて、プライバシーを保護しながら異常行動を検出する深層学習ベースのスケルトン動画異常検知手法を調査する。このアプローチは、スケルトン系列における再構成、予測、ハイブリッドモデルを活用して、高い精度で異常を検出する。医療機関や住宅環境におけるRGBベースのシステムに対するプライバシー保護型の代替手段を提供する。

ABSTRACT

The existing methods for video anomaly detection mostly utilize videos containing identifiable facial and appearance-based features. The use of videos with identifiable faces raises privacy concerns, especially when used in a hospital or community-based setting. Appearance-based features can also be sensitive to pixel-based noise, straining the anomaly detection methods to model the changes in the background and making it difficult to focus on the actions of humans in the foreground. Structural information in the form of skeletons describing the human motion in the videos is privacy-protecting and can overcome some of the problems posed by appearance-based features. In this paper, we present a survey of privacy-protecting deep learning anomaly detection methods using skeletons extracted from videos. We present a novel taxonomy of algorithms based on the various learning approaches. We conclude that skeleton-based approaches for anomaly detection can be a plausible privacy-protecting alternative for video anomaly detection. Lastly, we identify major open research questions and provide guidelines to address them.

研究の動機と目的

  • 外見特徴を代替するスケルトン表現を用いることで、動画ベースの異常検知におけるプライバシー懸念を軽減する。
  • 照明の変化や背景の雑音、顔認識の懸念など、RGB動画手法の限界を克服し、臨床的および家庭環境での導入を容易にする。
  • 学習アプローチに基づく新しい分類法を用いて、深層学習ベースのスケルトン異常検知手法を体系的に調査・分類する。
  • 現在のデータセットおよび手法における主な研究ギャップを特定する。特に、在宅および長期介護環境への焦点の欠如に注目する。
  • スケルトンを用いた堅牢でプライバシー保護型の異常検知システムを開発するための実行可能なガイドラインと今後の研究方向性を提示する。

提案手法

  • MediaPipe、OpenPose、HRNetなどのポーズ推定モデルを用いて、RGB動画から2次元または3次元の人体関節座標を抽出する。
  • 人体の動きを関節座標の時系列系列として表現し、コンパクトで意味的豊かなスケルトン系列を形成する。
  • 再構成ベースのアプローチ(例:オートエンコーダ)を用いて、正常な動きパターンを学習し、その逸脱を検出する。
  • 予測ベースのモデル(例:LSTM、Transformer)を用いて、将来の関節位置を予測し、予測誤差から異常スコアを計算する。
  • 再構成損失と予測損失を組み合わせることで、異常検知のロバスト性と一般化性能を向上させる。
  • オプティカルフロー、セグメンテーションマスク、オブジェクトバウンディングボックスなどのマルチモodal信号をスケルトンと統合し、人間と物体、人間同士の相互作用をモデル化しながらプライバシーを保護する。

実験結果

リサーチクエスチョン

  • RQ1スケルトン表現をどのように活用することで、プライバシー保護型の異常行動検知が可能になるか?
  • RQ2住宅や介護施設のような機微な環境において、外見特徴に基づく動画異常検知の主な限界は何か?
  • RQ3オートエンコーダ、LSTM、Transformerなどの深層学習アーキテクチャの中で、スケルトンベースの異常検知に最も効果的なものはどれか?
  • RQ4スケルトンベースのモデルを、人間と物体や人間同士の相互作用を含む複雑な異常を検出できるように拡張するにはどうすればよいか?
  • RQ5実際の住宅および臨床環境への導入において、主なオープンチャレンジは何か?

主な発見

  • スケルトンベースの異常検知は、顔貌や外見特徴を排除することで、RGBベースの手法に対する強力なプライバシー保護型の代替手段を提供する。
  • 再構成ベースのモデル、特にオートエンコーダは、不規則な姿勢や異常行動の検出において優れた性能を示し、複数のデータセットでAUCスコアが0.9を超える。
  • LSTMやTransformerを用いた予測ベースのモデルは、予測された関節軌道からの逸脱を測定することで、高い異常検知精度を達成する。
  • 再構成損失と予測損失を組み合わせたハイブリッドモデルは、多様な異常を検出する上で、単一目的のアプローチを上回る性能を示す。
  • 現在のデータセットは主に屋外または制御された環境を対象としており、在宅および長期介護環境の代表的表現が不足している。
  • 今後のオプティカルフロー、セグメンテーションマスク、フェデレーテッドラーニングとの統合により、プライバシー保護、ロバストネス、リアルタイム導入の可能性がさらに向上する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。