Skip to main content
QUICK REVIEW

[論文レビュー] Real-time 3D human action recognition based on Hyperpoint sequence

Xing Li, Qian Huang|arXiv (Cornell University)|Nov 16, 2021
Human Pose and Action Recognition被引用数 5
ひとこと要約

本稿では、リアルタイム3次元人体行動認識を実現するフレームレベル並列な点群時系列ネットワーク「SequentialPointNet」を提案する。点群フレームをハイパーポイント列にフラット化し、フレーム内チャネル混合とフレーム間混合を分離する新しいハイパーポイントミキサー(Hyperpoint-Mixer)モジュールを用いることで、従来モデル比最大10倍の高速化を達成しながら、NTU RGB+D 60、NTU RGB+D 120、MSR Action3D、UTD-MHADの各データセットで最先端の精度を上回った。

ABSTRACT

Real-time 3D human action recognition has broad industrial applications, such as surveillance, human-computer interaction, and healthcare monitoring. By relying on complex spatio-temporal local encoding, most existing point cloud sequence networks capture spatio-temporal local structures to recognize 3D human actions. To simplify the point cloud sequence modeling task, we propose a lightweight and effective point cloud sequence network referred to as SequentialPointNet for real-time 3D action recognition. Instead of capturing spatio-temporal local structures, SequentialPointNet encodes the temporal evolution of static appearances to recognize human actions. Firstly, we define a novel type of point data, Hyperpoint, to better describe the temporally changing human appearances. A theoretical foundation is provided to clarify the information equivalence property for converting point cloud sequences into Hyperpoint sequences. Secondly, the point cloud sequence modeling task is decomposed into a Hyperpoint embedding task and a Hyperpoint sequence modeling task. Specifically, for Hyperpoint embedding, the static point cloud technology is employed to convert point cloud sequences into Hyperpoint sequences, which introduces inherent frame-level parallelism; for Hyperpoint sequence modeling, a Hyperpoint-Mixer module is designed as the basic building block to learning the spatio-temporal features of human actions. Extensive experiments on three widely-used 3D action recognition datasets demonstrate that the proposed SequentialPointNet achieves competitive classification performance with up to 10X faster than existing approaches.

研究の動機と目的

  • 3次元行動認識のための点群時系列モデルにおける非効率さと高い計算コストを解消すること。
  • 点群時系列において完全な空間的・時間的情報を保持しつつ、効率的かつ並列処理可能な処理を可能にすること。
  • 高効率で軽量なアーキテクチャを構築し、最先端の認識精度を維持または上回ること。
  • 空間的および時間的特徴学習を分離することで、3次元行動認識における表現学習の向上を図ること。

提案手法

  • PointNetに基づく共有で学習可能なハイパーポイント埋め込みモジュールを用いて、各点群フレームをハイパーポイントにフラット化する。
  • 各フレームの完全な空間構造を保持するための新しいデータ型「ハイパーポイント列」を導入する。
  • フレーム内チャネル混合とフレーム間混合を明示的に分離するハイパーポイントミキサー(Hyperpoint-Mixer)モジュールを設計する。
  • フレーム混合処理を特徴混合パイプラインの最終段階に配置することで、フレームレベルの並列処理を可能にする。
  • 相互に依存しないフレームレベルのユニットに主なモデリング処理を分割し、フレーム間の計算依存関係を排除する。
  • 性能と効率のバランスを最適化するため、2層のマルチスケールピラミッド特徴抽出戦略を採用する。

実験結果

リサーチクエスチョン

  • RQ1フレームレベル並列アーキテクチャは、精度を損なわずに3次元行動認識における推論速度を著しく向上させることができるか?
  • RQ2ハイパーポイント列表現は、行動認識において空間的・時間的情報を効果的に保持できるか?
  • RQ3空間的および時間的特徴混合の分離は、モデル性能および学習効率を向上させるか?
  • RQ4精度と計算コストのバランスを考慮した場合、最適なピラミッド層数と点群フレーム数は何か?
  • RQ5提案手法は、既存の最先端の点群時系列モデルと比較して、速度および精度の点で優れているか?

主な発見

  • SequentialPointNetは、従来の点群時系列モデル比で10倍の高速化を達成し、1枚のGPUで1シーケンスあたりわずか5ミリ秒の推論時間にまで短縮された。
  • NTU RGB+D 60データセットではクロスビュー精度が97.6%に達し、先行研究を上回った。
  • NTU RGB+D 120データセットではクロスセット精度が95.4%に達し、異なるカメラセットアップ間での一般化性能が優れていることが示された。
  • MSR Action3Dでは91.94%のクロスサブジェクト精度、UTD-MHADでは92.31%のクロスサブジェクト精度を達成し、多様な行動認識ベンチマークにおける頑健性が確認された。
  • 比較対象のすべての手法と比較して最も軽量であり、パラメータ数はわずか372万で、MeteorNet、P4Transformer、PSTNetを大きく下回った。
  • アブレーションスタディの結果、2層のピラミッドと20フレームが最適な性能を発揮し、20フレームを超えると精度が安定することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。