Skip to main content
QUICK REVIEW

[論文レビュー] Skeleton-based Action Recognition of People Handling Objects

Sunoh Kim, Kimin Yun|arXiv (Cornell University)|Jan 21, 2019
Human Pose and Action Recognition参考文献 37被引用数 9
ひとこと要約

本稿では、スケルタルデータを用いて人間のポーズグラフと物に関連する人間のポーズグラフの両方をモデル化することで、物に関連する人間の行動を認識するグラフ畳み込みニューラルネットワークフレームワークOHA-GCNを提案する。高信頼度のフレームを選択し、ポーズ推定と背景差分法を用いて物体のポーズを統合することで、リアルタイム性能を達成し、ベンチマークおよび独自のデータセット(違法なごみ捨てデータセットを含む)において、最先端のスケルトンベースの行動認識手法を上回る性能を発揮する。

ABSTRACT

In visual surveillance systems, it is necessary to recognize the behavior of people handling objects such as a phone, a cup, or a plastic bag. In this paper, to address this problem, we propose a new framework for recognizing object-related human actions by graph convolutional networks using human and object poses. In this framework, we construct skeletal graphs of reliable human poses by selectively sampling the informative frames in a video, which include human joints with high confidence scores obtained in pose estimation. The skeletal graphs generated from the sampled frames represent human poses related to the object position in both the spatial and temporal domains, and these graphs are used as inputs to the graph convolutional networks. Through experiments over an open benchmark and our own data sets, we verify the validity of our framework in that our method outperforms the state-of-the-art method for skeleton-based action recognition.

研究の動機と目的

  • ポーズ推定が誤りやすい非制約的監視環境において、物に関連する人間の行動を認識する課題に対処すること。
  • グラフ表現に物体のポーズを組み込むことで、スケルトンベースの行動認識を向上させ、人間と物体の相互作用の文脈的理解を強化すること。
  • 誤ったポーズ推定や曖昧なフレームに対処するため、情報的なフレーム選択と二重ストリームGCNアーキテクチャを用いたリアルタイムで頑健なフレームワークを開発すること。
  • 本フレームワークを、公開ベンチマークおよび現実の非制約的環境下で収集した違法なごみ捨てのための新規データセットにおいて検証すること。

提案手法

  • ポーズ推定と背景差分法を用いて、人間と物体のポーズからスケルタルグラフを構築し、ノードは関節と物体の位置を表す。
  • ポーズ信頼度スコアに基づき、1つの高信頼度フレームを1つの動画セグメントあたり選択するフレーム選択戦略を適用して、ノイズと曖昧性を低減する。
  • 2種類のグラフを形成する:(1) 時間的・空間的動きを捉える人間のポーズグラフ、(2) 人間と物体の空間的・時間的関係をモデル化する物に関連する人間のポーズグラフ。
  • 二重ストリームGCNアーキテクチャにより、両方のグラフタイプを独立して処理し、ノードとその近隣ノードにグラフ畳み込みを適用して、時空間特徴を抽出する。
  • 最終的な予測は、両ストリームからの特徴を統合することで行われ、人間の運動と人間-物体相互作用の両方を統合的にモデル化可能となる。
  • ポーズ推定にはOpenPoseを用い、複数人シーンにおける個々のアクターを特定するためにハンガリアンマッチングを統合する。

実験結果

リサーチクエスチョン

  • RQ1非制約的環境において、スケルタルグラフに物体のポーズを統合することで、物に関連する人間の行動認識が向上するか?
  • RQ2ポーズ信頼度スコアに基づく情報的なフレーム選択は、スケルトンベースの行動認識の頑健性と性能にどのように影響するか?
  • RQ3人間のポーズと物に関連する人間のポーズグラフを処理する二重ストリームGCNフレームワークは、単一ストリーム手法よりも高い精度を達成できるか?
  • RQ4本手法は、フル監視パイプラインに実装された場合、リアルタイム性能を発揮できるか?

主な発見

  • OHA-GCNフレームワークは、ICVL-4データセットで91.86%の精度を達成し、最先端のST-GCN手法(80.23%)を上回った。
  • 本手法は1秒間に約3571フレームの処理速度を示し、1フレームあたり17.26msの処理時間を要するRGBベースのCNN(例:ResNet50)よりも顕著に高速であった。
  • ポーズ推定とGCN推論を含む全体のパイプラインは、1フレームあたり平均94.78ms(10.6 FPS)で動作し、リアルタイム監視システムへの実装可能性を示した。
  • 情報的なフレーム選択の活用により、トレーニングおよび推論中に低信頼度または曖昧なポーズの影響が低減され、モデルの頑健性が向上した。
  • 本稿で提示された違法なごみ捨て(IRD)データセットは、現実の状況下で物に関連する行動認識を評価するためのリアルな非制約的動画データを提供する。
  • 人間のポーズグラフと物に関連する人間のポーズグラフを統合する二重ストリームGCNアーキテクチャが、最高の性能を発揮した。これは、人間と物体の相互作用を明示的にモデル化することの価値を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。