Skip to main content
QUICK REVIEW

[論文レビュー] Robust 3D Action Recognition through Sampling Local Appearances and Global Distributions

Mengyuan Liu, Hong Liu|arXiv (Cornell University)|Dec 4, 2017
Human Pose and Action Recognition参考文献 71被引用数 5
ひとこと要約

本論文では、動きに基づくおよび形状に基づく空間時間的特徴点(STIP)を用いて、動きと形状の手がかりを共同でモデリングすることで、3次元行動認識を向上させる2段階のBag-of-Visual-Wordsモデルを提案する。局所的動き外観を捉えるためのマルチスケール3次元局所ステアリングカーネル(M3DLSK)と、グローバルな形状分布を記述するための空間時間的ベクトル(STV)記述子を導入し、MSRAction3Dで91.00%の正確度を達成。ノイズ、遮蔽、類似クラス間の類似性に対して、最先端の手法を上回る耐性を示す。

ABSTRACT

3D action recognition has broad applications in human-computer interaction and intelligent surveillance. However, recognizing similar actions remains challenging since previous literature fails to capture motion and shape cues effectively from noisy depth data. In this paper, we propose a novel two-layer Bag-of-Visual-Words (BoVW) model, which suppresses the noise disturbances and jointly encodes both motion and shape cues. First, background clutter is removed by a background modeling method that is designed for depth data. Then, motion and shape cues are jointly used to generate robust and distinctive spatial-temporal interest points (STIPs): motion-based STIPs and shape-based STIPs. In the first layer of our model, a multi-scale 3D local steering kernel (M3DLSK) descriptor is proposed to describe local appearances of cuboids around motion-based STIPs. In the second layer, a spatial-temporal vector (STV) descriptor is proposed to describe the spatial-temporal distributions of shape-based STIPs. Using the Bag-of-Visual-Words (BoVW) model, motion and shape cues are combined to form a fused action representation. Our model performs favorably compared with common STIP detection and description methods. Thorough experiments verify that our model is effective in distinguishing similar actions and robust to background clutter, partial occlusions and pepper noise.

研究の動機と目的

  • ノイズ、遮蔽、背景のごみによる類似行動の認識困難を解決すること。
  • 既存手法でしばしば無視される動きと形状の手がかりを共同で符号化することで、3次元行動認識を向上させること。
  • 視点の変化、部分的遮蔽、深度の不連続性に対して耐性を持つフレームワークを構築すること。
  • 局所的外観とSTIPのグローバル分布を統合する2段階のBoVWモデルを設計し、行動表現を強化すること。
  • 行動タイプの多様性と現実世界の変動(クラス内相違、クラス間類似性を含む)を有するベンチマークデータセットで、手法の有効性を検証すること。

提案手法

  • 背景モデリングの新規手法を提案し、深度データのゴミを低減することで、STIP検出のための前景抽出を向上させる。
  • 動きに基づくSTIPは動きの手がかりを用いて検出され、形状に基づくSTIPは深度マップ内の特徴的な空間的構造から抽出される。
  • 動きに基づくSTIPの周囲の局所的動き外観を立方体特徴を用いて捉えるため、マルチスケール3次元局所ステアリングカーネル(M3DLSK)記述子を導入する。
  • 形状に基づくSTIPの空間時間的分布を符号化するため、空間時間的ベクトル(STV)記述子を提案する。
  • M3DLSKとSTV表現を統合する2段階のBag-of-Visual-Words(BoVW)モデルが、統一された行動表現を形成する。
  • STIP検出、記述子計算、BoVWベースの集約を統合した、3次元行動認識のための耐性のあるパイプラインを構築する。

実験結果

リサーチクエスチョン

  • RQ1局所的動き外観とグローバルな形状分布を統合する2段階のBoVWモデルは、3次元行動認識の耐性を向上させることができるか?
  • RQ2M3DLSK記述子は、既存の記述子と比較して、ノイズの多い深度データからの局所的動き構造をどれほど効果的に捉えられるか?
  • RQ3形状に基づくSTIPの空間時間的分布を符号化することで、STV記述子はどの程度認識性能を向上させるか?
  • RQ4提案された背景モデリング手法は、ごみが多い深度シーンにおけるSTIP検出をどの程度向上させるか?
  • RQ5動きと形状の手がかりを統合することで、'highWave'と'circle'のような類似行動の混同を軽減できるか?

主な発見

  • 提案手法はMSRAction3Dデータセットで91.00%の正確度を達成し、HON4D(80.00%)およびDSTIP+DCSF(83.60%)を上回った。
  • SmartHomeデータセットでは85.31%の正確度を達成し、クラス内相違およびクラス間類似性に対しても耐性があることを示した。
  • 動きと形状の両方の手がかりを効果的にモデル化することで、'highWave'と'circle'のような類似行動の混同が低減された。
  • 背景モデリング手法は、平均フィルターやViBeを上回り、正確度と計算効率の両面で優れており、1フレームあたり31.25 msの時間コストであった。
  • 一部の最先端手法よりも高い計算コスト(1フレームあたり74.64 ms)を要するが、顕著に高い正確度を達成した。
  • 修正されたMSRAction3DおよびUTKinect-Actionデータセットでの評価を通じて、部分的遮蔽、視点の変化、深度ノイズに対して強い耐性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。