[論文レビュー] A Novel Approach for Robust Multi Human Action Detection and Recognition based on 3-Dimentional Convolutional Neural Networks.
本論文は、人物固有の行動シーケンス分析を通じて空間時間的特徴をモデル化することにより、監視映像におけるロバストな複数人行動認識のための3次元畳み込みニューラルネットワーク(3D-CNN)アーキテクチャを提案する。本手法は、カスタムの複数人データセットで98%の精度を達成し、前処理なしでUCF101、Hollywood2、HDMB51、YouTubeでも最先端の手法を上回る性能を発揮する。
In recent years, various attempts have been proposed to explore the use of spatial and temporal information for human action recognition using convolutional neural networks (CNNs). However, only a small number of methods are available for the recognition of many human actions performed by more than one person in the same surveillance video. This paper proposes a novel technique for multiple human action recognition using a new architecture based on 3Dimdenisional deep learning with application to video surveillance systems. The first stage of the model uses a new representation of the data by extracting the sequence of each person acting in the scene. An analysis of each sequence to detect the corresponding actions is also proposed. KTH, Weizmann and UCF-ARG datasets were used for training, new datasets were also constructed which include a number of persons having multiple actions were used for testing the proposed algorithm. The results of this work revealed that the proposed method provides more accurate multi human action recognition achieving 98%. Other videos were used for the evaluation including datasets (UCF101, Hollywood2, HDMB51, and YouTube) without any preprocessing and the results obtained suggest that our proposed method clearly improves the performances when compared to state-of-the-art methods.
研究の動機と目的
- 複数の人物が同時に行動をとる複雑な監視映像において、複数人の行動認識を困難とする課題に対処すること。
- 主に単一人物または限定的な複数人行動認識に焦点を当てた従来のCNNベースの手法の限界を克服すること。
- 複雑なシーンにおける複数のアクター間の空間時間的特徴を効果的に捉えるロバストなディープラーニングフレームワークの開発。
- 汎用性と実世界への適用可能性を保証するため、標準ベンチマークおよび新たに構築された複数人データセットの両方で手法を評価すること。
提案手法
- ビデオシーン内の各人物の個別行動シーケンスを抽出することで、複数人間の相互作用を分離する新しいデータ表現を構築する。
- 抽出された人物固有の行動シーケンスから空間的および時間的特徴を学習するため、3D-CNNアーキテクチャを適用する。
- 2段階のモデルを実装する:第一段階は人物シーケンスの抽出、第二段階は3D-CNN分類による行動認識。
- KTH、Weizmann、UCF-ARGデータセットでモデルを学習し、新たに作成された複数人行動データセットで検証する。
- UCF101、Hollywood2、HDMB51、YouTubeを含む多様なデータセットでモデルを評価し、前処理なしでロバスト性を評価する。
実験結果
リサーチクエスチョン
- RQ13D-CNNベースのアーキテクチャは、複雑で混雑した監視映像における複数人の行動認識を効果的に行えるか?
- RQ2提案された人物シーケンスベースのデータ表現は、標準的な動画レベルモデリングと比較して、複数人行動認識の精度をどのように向上させるか?
- RQ3本手法は、前処理なしで多様なデータセットにどの程度一般化できるか?
- RQ4本手法は、既存の最先端の手法と比較して、複数人行動認識分野でどの程度の性能向上を達成するか?
主な発見
- 提案手法は、新たに構築された複数人行動認識データセットで98%の精度を達成し、複雑なシーンにおける高いロバスト性を示している。
- UCF101、Hollywood2、HDMB51、YouTubeデータセットにおいて、最先端の手法と比較して顕著な性能向上が見られた。
- YouTubeおよび他のデータセットでの評価において前処理が一切不要であったことは、モデルの強力な一般化能力とロバスト性を示している。
- 人物固有の行動シーケンス表現の使用により、特徴学習が向上し、複数人シナリオにおける認識精度が向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。