Skip to main content
QUICK REVIEW

[論文レビュー] Learning discriminative trajectorylet detector sets for accurate skeleton-based action recognition

Ruizhi Qiao, Lingqiao Liu|arXiv (Cornell University)|Apr 20, 2015
Human Pose and Action Recognition参考文献 28被引用数 4
ひとこと要約

本稿では、局所的記述子であるトラジェクトリレット(短い時間間隔における静的・動的運動を捉える)と、例示SVMを用いて学習された判別的検出器セットを組み合わせた、骨格ベースの行動認識フレームワークを提案する。本手法は、MSR Action3DおよびMSR DailyActivityデータセットで最先端の性能を達成し、L=5のトラジェクトリレットと学習済み検出器セットを用いることで、MSR Action3Dで95.9%の正確度を達成し、既存手法を著しく上回る。

ABSTRACT

The introduction of low-cost RGB-D sensors has promoted the research in skeleton-based human action recognition. Devising a representation suitable for characterising actions on the basis of noisy skeleton sequences remains a challenge, however. We here provide two insights into this challenge. First, we show that the discriminative information of a skeleton sequence usually resides in a short temporal interval and we propose a simple-but-effective local descriptor called trajectorylet to capture the static and kinematic information within this interval. Second, we further propose to encode each trajectorylet with a discriminative trajectorylet detector set which is selected from a large number of candidate detectors trained through exemplar-SVMs. The action-level representation is obtained by pooling trajectorylet encodings. Evaluating on standard datasets acquired from the Kinect sensor, it is demonstrated that our method obtains superior results over existing approaches under various experimental setups.

研究の動機と目的

  • 行動認識におけるノイズが多く、時間的に変化する骨格シーケンスから判別的特徴を抽出する課題に対処すること。
  • 全シーケンスや単一フレームではなく、短く情報量の多い時間的区間に注目することで、行動認識を向上させること。
  • キーパターンとなるトラジェクトリレットパターンのための専用検出器の集合を学習することで、強力で判別的な表現を構築すること。
  • 新しい特徴学習フレームワークを用いて、従来のBag-of-Features手法を凌駕する骨格ベースの行動認識を実現すること。

提案手法

  • 短い時間間隔(L=3,5,7)における静的ポーズ、相対関節変位、速度、および任意の加速度を符号化する局所的記述子としてトラジェクトリレットを導入する。
  • 正例のトラジェクトリレットサンプル上で、例示SVMを用いて多数の候補となるトラジェクトリレット検出器を学習する。
  • トレーニング用のトラジェクトリレット上で検出器の性能を評価し、クラスタリングによって冗長性を除去することで、判別的な検出器を選別する。
  • 選別された検出器の検出スコアを各トラジェクトリレットのコーディングベクトルとして用い、判別的な特徴表現を構築する。
  • シーケンス全体にわたるトラジェクトリレットコーディングベクトルをプーリングし、長距離の時間的文脈を捉えるために、時間的ピラミッドプーリングをオプションで使用する。
  • 比較のため、標準的な特徴学習ベースライン(VLAD, LLC, LSC)を用い、コードブックサイズK=128および近傍サイズκ=10を設定する。

実験結果

リサーチクエスチョン

  • RQ1短い時間間隔における静的および動的運動を捉える局所的記述子が、骨格ベースの行動認識を向上させることができるか?
  • RQ2多数の候補検出器から学習された判別的トラジェクトリレット検出器セットは、従来の特徴コーディング手法よりも優れた行動表現を実現するか?
  • RQ3トラジェクトリレット区間の長さが認識性能に与える影響は何か?
  • RQ4トラジェクトリレット記述子のどの要素(例:ポーズ、変位、速度)が判別力に最も寄与しているか?
  • RQ5提案された検出器セットフレームワークは、異なる行動データセットに一般化可能であり、最先端の特徴学習技術を凌駆できるか?

主な発見

  • 提案手法は、MSR Action3Dデータセットで95.9%の正確度を達成し、先行研究の最先端手法を著しく上回る。
  • L=5のトラジェクトリレットが最良の性能を示しており、判別的な運動パターンを捉えるには中程度の時間間隔が最適であることが示された。
  • 静的ポーズ(x₀)と動的成分(x₁, x₂)の組み合わせが最も高い性能を達成しており、加速度(x₃)を追加しても改善が得られなかった。
  • 学習済み検出器セットを用いたフレームワークは、VLAD, LLC, LSCを上回り、MSR DailyActivityで75.0%の正確度を達成した(LSCは66.9%、VLADは51.9%)。
  • 可視化結果から、検出器セットが、手をたたいたり振ったりするような代表的な運動パターンを、異なる行動クラスにわたり特定していることが確認された。
  • アブレーションスタディの結果、動的成分(x₁またはx₂)のみを用いると性能が著しく低下し、静的と動的特徴を併用する必要性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。