Skip to main content
QUICK REVIEW

[論文レビュー] Mining Mid-level Features for Action Recognition Based on Effective Skeleton Representation

Pichao Wang, Wanqing Li|arXiv (Cornell University)|Sep 14, 2014
Human Pose and Action Recognition参考文献 23被引用数 11
ひとこと要約

本論文は、Kinectで得られたスケルトンデータから中位レベルの特徴を抽出することで、3次元人体行動認識のための新規手法を提案する。肢の方向を離散的な空間的状態としてモデル化し、それらを部分にグループ化し、頻出パターン抽出を用いて判別性が高く代表的で重複のない「頻出局所部分」(Frequent Local Parts; FLPs)を同定する。その後、これらのFLPsを用いて強力なbag-of-FLP表現を構築し、MSR DailyActivity3DおよびMSR ActionPairs3Dデータセットで最先端の性能を達成する。

ABSTRACT

Recently, mid-level features have shown promising performance in computer vision. Mid-level features learned by incorporating class-level information are potentially more discriminative than traditional low-level local features. In this paper, an effective method is proposed to extract mid-level features from Kinect skeletons for 3D human action recognition. Firstly, the orientations of limbs connected by two skeleton joints are computed and each orientation is encoded into one of the 27 states indicating the spatial relationship of the joints. Secondly, limbs are combined into parts and the limb's states are mapped into part states. Finally, frequent pattern mining is employed to mine the most frequent and relevant (discriminative, representative and non-redundant) states of parts in continuous several frames. These parts are referred to as Frequent Local Parts or FLPs. The FLPs allow us to build powerful bag-of-FLP-based action representation. This new representation yields state-of-the-art results on MSR DailyActivity3D and MSR ActionPairs3D.

研究の動機と目的

  • スケルトンデータから判別性のある空間的・時間的パターンを捉える中位レベルの特徴を活用することで、3次元人体行動認識の性能を向上させること。
  • 局所的低レベル特徴の限界を補うために、部分レベルの表現を通じてクラスレベルの情報を統合すること。
  • 連続する動画フレームにおけるスケルトン部分の状態に対して頻出パターン抽出を適用し、頑健で判別性の高い行動表現を構築すること。
  • 効果的なスケルトンベースの特徴学習フレームワークを用いて、ベンチマーク3次元行動認識データセットで最先端の性能を達成すること。

提案手法

  • 接続されたスケルトン関節間の肢の方向を、相対的な関節位置を表す27個の離散的空間状態のいずれかに符号化する。
  • 個々の肢を身体の部分にグループ化し、それらの方向状態を集約して部分状態を形成することで、より高レベルの表現を構築する。
  • 連続するフレームにわたって頻出パターン抽出を適用し、最も頻出で代表的かつ重複のない部分状態(Frequent Local Parts; FLPs)を同定する。
  • 動画シーケンス全体でFLPの出現回数を数えることで、bag-of-FLP表現を構築し、コンactかつ判別性の高い行動記述子を形成する。
  • スケルトンシーケンスにおける時間的連続性を活用し、安定した部分構成を通じて動的運動パターンを捉える。
  • 最終的な行動認識は、bag-of-FLP特徴に対して標準的な分類手法を用いて行う。

実験結果

リサーチクエスチョン

  • RQ1スケルトンデータから導出される中位レベルの特徴は、従来の低レベル特徴を上回る3次元人体行動認識を実現できるか?
  • RQ2スケルトン関節間の空間的関係を効果的に符号化することで、意味のある身体部分構成を捉えることは可能か?
  • RQ3スケルトンシーケンスにおいて、行動認識のための判別性と代表的であるパターンを最適に同定する方法は何か?
  • RQ4部分状態に対する頻出パターン抽出により、コンパクトで強力な表現が得られるか?

主な発見

  • 提案されたbag-of-FLP表現は、MSR DailyActivity3Dデータセットで最先端の性能を達成した。
  • 本手法はMSR ActionPairs3Dデータセットでも既存の手法を上回り、優れた判別力を持つことが示された。
  • 中位レベル特徴の導入により、低レベルの局所的特徴のみを用いた場合と比較して、認識精度が顕著に向上した。
  • FLP抽出プロセスは、複数の行動クラスにわたる非冗長で代表的な運動パターンを効果的に捉えていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。