Skip to main content
QUICK REVIEW

[論文レビュー] Combining ConvNets with Hand-Crafted Features for Action Recognition Based on an HMM-SVM Classifier

Pichao Wang, Zhaoyang Li|arXiv (Cornell University)|Feb 1, 2016
Human Pose and Action Recognition参考文献 24被引用数 4
ひとこと要約

本論文は、深度マップからの畳み込みニューラルネットワーク(ConvNets)の特徴と、手作業で作成したスケルトン特徴を統合する、RGB-Dアクション認識の新規フレームワークを提案する。IGMMを用いたセグメンテーションとHMM-SVMを用いた時系列モデリングにより、局所的な運動パターンとグローバルな系列モデリングを組み合わせることで、純粋に深層学習に依存する手法や手作業特徴に比べて、より高い耐障害性を達成する。

ABSTRACT

This paper proposes a new framework for RGB-D-based action recognition that takes advantages of hand-designed features from skeleton data and deeply learned features from depth maps, and exploits effectively both the local and global temporal information. Specifically, depth and skeleton data are firstly augmented for deep learning and making the recognition insensitive to view variance. Secondly, depth sequences are segmented using the hand-crafted features based on skeleton joints motion histogram to exploit the local temporal information. All training se gments are clustered using an Infinite Gaussian Mixture Model (IGMM) through Bayesian estimation and labelled for training Convolutional Neural Networks (ConvNets) on the depth maps. Thus, a depth sequence can be reliably encoded into a sequence of segment labels. Finally, the sequence of labels is fed into a joint Hidden Markov Model and Support Vector Machine (HMM-SVM) classifier to explore the global temporal information for final recognition.

研究の動機と目的

  • 純粋な深層学習モデルがアクション認識において、グローバルな平行移動、回転、スケーリングに対処できないという限界を解消すること。
  • HODのような手作業で作成したスケルトン特徴の不変性特性を活用し、局所的な時系列モデリングの耐障害性を高めること。
  • HMM-SVMを用いて、ConvNetsによる局所的な空間時系列特徴とグローバルな系列依存関係を効果的に統合すること。
  • 深度とスケルトンシーケンスのデータ拡張により、視点のばらつきに対する感受性を低減すること。
  • スケルトンに基づく運動ヒストグラムを用いて、信頼性の高い深層ネットワークの学習に適した意味的な意味を持つ動画セグメントを生成すること。

提案手法

  • スケルトンジョイントの運動ヒストグラムに基づく手作業特徴を用いて、局所的な時系列ダイナミクスを捉えるため、深度シーケンスをセグメント化する。
  • ベイズ推定を用いた無限ガウス・ミックスチャネル(IGMM)を適用し、トレーニングセグメントをクラスタリングし、ConvNetのトレーニング用にラベルを付与する。
  • 最初のフレームの処理を特別に扱うことで、初期ポーズを保持し、時系列コントラストを向上させるように、変更された深さの運動マップ(DMMs)を構築する。
  • ルビーフォーム変換を用いてDMMに擬似色コードを適用し、ConvNet入力の識別性を向上させる。
  • 3つの直交投影平面からの擬似色DMMを用いて、3つの並列ConvNetsをトレーニングし、出力を平均化してセグメントラベルを決定する。
  • ConvNetが予測したラベルの系列を、HMMとSVMを統合した共同分類器(HMM-SVM)の入力として用い、HMMがグローバルな時系列構造をモデル化し、SVMが最終的な識別的分類を実行する。

実験結果

リサーチクエスチョン

  • RQ1手作業で作成したスケルトン特徴と深度マップからの深層特徴を統合することで、アクション認識性能が向上するか?
  • RQ2スケルトン特徴を用いたIGMMベースの深度シーケンスセグメンテーションが、局所的な時系列モデリングをどの程度効果的に向上させるか?
  • RQ3HMM-SVMフレームワークは、単独のモデルと比較して、アクションシーケンス内のグローバルな時系列依存関係をどの程度効果的に活用するか?
  • RQ4DMMへの擬似色コード化が、アクション認識におけるConvNetの識別能力を向上させるか?
  • RQ5深度とスケルトンシーケンスのデータ拡張により、アクション認識における視点のばらつきに対する感受性が低減するか?

主な発見

  • 提案されたフレームワークは、HMM-SVMによるグローバルな系列モデリングとConvNetsによる局所的な空間時系列特徴を効果的に統合することで、優れた性能を達成する。
  • スケルトンに基づくセグメントのIGMMクラスタリングにより、トレーニングデータのラベル付けが信頼性が高まり、ConvNetの一般化性能が向上する。
  • 初期ポーズを保持し、運動エネルギーを強化した変更されたDMMは、向かい合った方向への手を振るなどの類似アクション間の識別性を向上させる。
  • DMMへの擬似色コード化により、特徴の識別性が顕著に向上し、図2の可視化で明確な分離が確認された。
  • HMM-SVM分類器は、単独のHMMやSVMを上回る性能を示し、時系列構造と識別的パワーの共同モデリングの利点を実証した。
  • トレーニング段階で深度とスケルトンシーケンスのデータ拡張を実施したため、視点のばらつきに対してフレームワークは耐障害性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。