Skip to main content
QUICK REVIEW

[論文レビュー] Towards a Deeper Understanding of Skeleton-based Gait Recognition

Torben Teepe, Johannes Gilg|arXiv (Cornell University)|Apr 16, 2022
Gait Recognition and Analysis被引用数 8
ひとこと要約

本論文は、骨格に基づく歩行認識のための新しいグラフ畳み込みニューラルネットワーク(GCN)アーキテクチャを提案する。マルチブランチ入力(関節、運動、骨)と残差接続を活用することで、最先端の性能を達成する。OUMVLP-Poseデータセットにおいて、先行手法比で3倍の向上を達成し、足や手といった動的で外側の肢節関節に注目することで、優れた時間的モデリングを示している。

ABSTRACT

Gait recognition is a promising biometric with unique properties for identifying individuals from a long distance by their walking patterns. In recent years, most gait recognition methods used the person's silhouette to extract the gait features. However, silhouette images can lose fine-grained spatial information, suffer from (self) occlusion, and be challenging to obtain in real-world scenarios. Furthermore, these silhouettes also contain other visual clues that are not actual gait features and can be used for identification, but also to fool the system. Model-based methods do not suffer from these problems and are able to represent the temporal motion of body joints, which are actual gait features. The advances in human pose estimation started a new era for model-based gait recognition with skeleton-based gait recognition. In this work, we propose an approach based on Graph Convolutional Networks (GCNs) that combines higher-order inputs, and residual networks to an efficient architecture for gait recognition. Extensive experiments on the two popular gait datasets, CASIA-B and OUMVLP-Pose, show a massive improvement (3x) of the state-of-the-art (SotA) on the largest gait dataset OUMVLP-Pose and strong temporal modeling capabilities. Finally, we visualize our method to understand skeleton-based gait recognition better and to show that we model real gait features.

研究の動機と目的

  • 衣服の影響、遮蔽、外観アーチファクトへの感受性といったシルエットベースの歩行認識の限界を克服するため、モデルベースの骨格表現に移行すること。
  • 骨格ベースの歩行認識の性能を向上させること。これは、外見ベースの手法に比べてロバスト性と運動に焦点を当てた利点があるものの、性能が遅れ気味であるため。
  • 可視化とアブレーションを通じて、学習された歩行表現の理解を深め、モデルが視覚的再識別キューではなく真の歩行特徴を捉えていることを確認すること。
  • ポーズ推定器の品質に応じたスケーラビリティを示し、異なるキーポイント検出器において一貫した性能向上を示すこと。

提案手法

  • 本手法は、3種類の骨格入力(元の関節座標、関節の運動ベクトル、骨ベクトル)を処理するマルチブランチGCNアーキテクチャを採用する。
  • 各ブランチは、グラフ畳み込みニューラルネットワークを用いて、人体骨格内の空間的および時間的依存関係をモデル化する。
  • 各ブランチ内で残差接続を適用することで、学習の安定化と勾配の流れの改善が図られ、モデルの深さと性能が向上する。
  • 運動特徴をエンドツーエンドで学習するのではなく、事前に計算された時間的情報を用いることで、学習の高速化と安定性の向上が達成される。
  • モデルは交差エントロピー損失とテスト時増強(TTA)を用いて訓練され、未学習の視点における一般化性能が向上する。
  • 推論時のネットワークの注目箇所を特定するため、活性化可視化技術を用いて関節活性化マップを計算する。

実験結果

リサーチクエスチョン

  • RQ1マルチブランチ入力処理を備えたGCNベースアーキテクチャは、先行手法と比較して骨格ベースの歩行認識の性能を顕著に向上させることができるか?
  • RQ2活性化パターンの証拠に基づいて、モデルは外見ベースのキューではなく、真の歩行特徴をどれほど学習しているか?
  • RQ3ポーズ推定器の品質(例:AlphaPose と OpenPose)が向上するに従って、モデルの性能はどのようにスケーリングするか?
  • RQ4既存のグラフベースの歩行認識モデルと比較して、提案アーキテクチャは優れた時間的モデリング能力を示すか?
  • RQ5異なる視点角度に一般化可能であり、衣服や持物の変化に対してもロバストであるか?

主な発見

  • 提案手法は、OUMVLP-Poseデータセットにおいてクロスビュー設定下で63.1%のランク1精度を達成し、以前の最先端手法比で3倍の向上を示した。
  • CASIA-Bデータセットでは、クロスビュー設定で72.8%のランク1精度を達成し、異なるデータセット間での強力な一般化性能を示した。
  • 関節活性化の可視化により、モデルは主に動的で外側の肢節関節(特に足と手)に注目していることが確認され、実際に歩行運動特徴を学習していることが裏付けられた。
  • 振れ動く脚に相当する関節に高い活性化が割り当てられる傾向があることから、歩行サイクルの効果的な時間的モデリングが行われていることが示された。
  • 異なるポーズ推定器(AlphaPose と OpenPose)において一貫した性能向上が見られたことから、キーポイント検出精度の向上に伴うスケーラビリティが確認された。
  • アブレーションスタディにより、マルチブランチ設計(関節、運動、骨)が性能に不可欠であることが確認され、各コンponentが強固な特徴学習に寄与していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。