Skip to main content
QUICK REVIEW

[論文レビュー] Improving Video Violence Recognition with Human Interaction Learning on 3D Skeleton Point Clouds

Yukun Su, Guosheng Lin|arXiv (Cornell University)|Aug 26, 2023
Human Pose and Action RecognitionComputer Science被引用数 3
ひとこと要約

本稿では、3次元スケルトン点群と二重ブランチのスケルトンポイント相互作用学習(SPIL)フレームワークを用いた、動画内の暴力的行動を認識する新規手法を提案する。局所的およびグローバルなスケルトンポイント間の相互作用を、マルチヘッド局所アテンション機構と順列不変の自己アテンション層によってモデル化することで、複数人の複雑な状況下でも優れた特徴抽出能力と耐性を示し、複数の暴力認識ベンチマークで最先端の性能を達成した。

ABSTRACT

Deep learning has proved to be very effective in video action recognition. Video violence recognition attempts to learn the human multi-dynamic behaviours in more complex scenarios. In this work, we develop a method for video violence recognition from a new perspective of skeleton points. Unlike the previous works, we first formulate 3D skeleton point clouds from human skeleton sequences extracted from videos and then perform interaction learning on these 3D skeleton point clouds. Specifically, we propose two types of Skeleton Points Interaction Learning (SPIL) strategies: (i) Local-SPIL: by constructing a specific weight distribution strategy between local regional points, Local-SPIL aims to selectively focus on the most relevant parts of them based on their features and spatial-temporal position information. In order to capture diverse types of relation information, a multi-head mechanism is designed to aggregate different features from independent heads to jointly handle different types of relationships between points. (ii) Global-SPIL: to better learn and refine the features of the unordered and unstructured skeleton points, Global-SPIL employs the self-attention layer that operates directly on the sampled points, which can help to make the output more permutation-invariant and well-suited for our task. Extensive experimental results validate the effectiveness of our approach and show that our model outperforms the existing networks and achieves new state-of-the-art performance on video violence datasets.

研究の動機と目的

  • 従来の手法が遮蔽や不要な背景ノイズのため失敗する、複雑で多人数が登場する動画シーンにおける暴力的行動の認識という課題に取り組む。
  • RGBやオプティカルフロー特徴に依存するのではなく、3次元スケルトンシーケンスから直接動的かつ人間の相互作用をモデル化することで、特徴表現を向上させる。
  • 局所的な運動ダイナミクスとスケルトンポイント間のグローバルな構造的関係を捉える、ロバストで順列不変の手法を開発する。
  • 混雑または動的な環境において暴力行動検出に最適化されていない既存のアクション認識モデルの限界を克服する。
  • より洗練されたスケルトン特徴学習により、類似したが暴力的でない身体的接触と本物の暴力的行動を正確に区別できるようにする。

提案手法

  • 各動画フレームに対して2次元の人体ポーズシーケンスを3次元スケルトン点群に変換し、空間的・時間的構造を保持する。
  • 局所的関係を特徴および空間的・時間的近接性に基づいて重み付けされた関係性として学習するマルチヘッドアテンション機構であるLocal-SPILを導入する。
  • 順序なし3次元点群に対して直接作用する自己アテンション層を用いるGlobal-SPILは、長距離依存性を捉え、順列不変性を保証する。
  • 2つのモジュールをスタックする:まずLocal-SPILが局所的ポイント間の相互作用を精緻化し、その後Global-SPILが全ポイントにわたるグローバルな文脈を精緻化する。
  • マルチヘッド機構により、並列で多様な種類の関係特徴を統合し、複雑な運動パターンを捉える能力を向上させる。
  • フレームワークはエンドツーエンドで学習可能であり、追加のデータや暴力に関する事前知識を必要としない。

実験結果

リサーチクエスチョン

  • RQ1RGBやオプティカルフロー特徴と比較して、3次元スケルトン点群は暴力的行動をより効果的に表現できるか?
  • RQ2複雑で多人数が登場するシーンにおける認識性能を向上させるために、スケルトンポイント間の局所的およびグローバルな相互作用をどのようにモデル化できるか?
  • RQ3順序なし点群に適用する自己アテンション機構は、スケルトンベースの暴力認識に適した順列不変の特徴学習を提供できるか?
  • RQ4提案されたSPILフレームワークは、多様な暴力認識ベンチマークで既存の最先端手法を上回る性能を示すか?
  • RQ5単一のスケルトン運動特徴に依存するモデルは、非暴力的物理的接触と本物の暴力的行動を区別できるか?

主な発見

  • 提案されたLG-SPILモデルは、4つの公開動画暴力認識データセットで、既存手法を上回る新たな最先端性能を達成した。
  • 外見的特徴に依存するのではなく、スケルトン運動パターンに注目することで、非暴力的物理的接触の誤分類を低減した。
  • Local-SPILモジュールは、近接するスケルトンポイント間の意味的および空間的・時間的関係を効果的に捉え、局所的特徴表現を向上させた。
  • Global-SPILモジュールは、全スケルトンポイントにわたる長距離依存性をモデル化することで、特徴学習を強化し、グローバルな文脈理解を高めた。
  • パラメータ数が27.18M、GFLOPsが35.26に抑えられ、4枚の2080Ti GPUで1サンプルあたり0.32秒の高速推論を実現した。
  • 可視化結果から、モデルがスケルトンポイント間の意味のある対応関係を学習しており、暴力的行動時には運動に関連する関節に注目していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。