[論文レビュー] Learning Rich Features for Gait Recognition by Integrating Skeletons and Silhouettes
本稿では、マルチスケール・ゲイトグラフ(MSGG)ネットワークを用いてボディジョイントの階層的意味を活用することで、スケルトンとシルエットを統合する新しい二モード融合(BiFusion)ネットワークを提案する。この手法は最先端の性能を達成し、CASIA-Bデータセットにおいて衣服の異なる状況下でも92.1%のランク-1正答率を達成した。これは、判別的スケルトン特徴の学習と特徴レベルの統合の有効性を示している。
Gait recognition captures gait patterns from the walking sequence of an individual for identification. Most existing gait recognition methods learn features from silhouettes or skeletons for the robustness to clothing, carrying, and other exterior factors. The combination of the two data modalities, however, is not fully exploited. Previous multimodal gait recognition methods mainly employ the skeleton to assist the local feature extraction where the intrinsic discrimination of the skeleton data is ignored. This paper proposes a simple yet effective Bimodal Fusion (BiFusion) network which mines discriminative gait patterns in skeletons and integrates with silhouette representations to learn rich features for identification. Particularly, the inherent hierarchical semantics of body joints in a skeleton is leveraged to design a novel Multi-Scale Gait Graph (MSGG) network for the feature extraction of skeletons. Extensive experiments on CASIA-B and OUMVLP demonstrate both the superiority of the proposed MSGG network in modeling skeletons and the effectiveness of the bimodal fusion for gait recognition. Under the most challenging condition of walking in different clothes on CASIA-B, our method achieves the rank-1 accuracy of 92.1%.
研究の動機と目的
- 既存のゲイト認識手法がスケルトンデータの内在的判別力を利用し切れていないという限界に対処すること。
- シルエット(ボディパーツの詳細情報の欠落)とスケルトン(形状情報の欠落)の補完的欠険を効果的に両モダリティを統合することで克服すること。
- 生のスケルトンシーケンスからゲイティングパターンを捉えるための階層的でマルチスケールのグラフニューラルネットワークを構築し、表現学習を向上させること。
- 衣服の変化や視点の違いといった困難な条件下でも、外見の変動が性能に大きく影響する状況において、頑健なゲイト認識を達成すること。
提案手法
- マルチスケール・ゲイトグラフ(MSGG)ネットワークは、ボディジョイントを3つの意味的レベルに階層的に分割することでスケルトンデータをモデル化する:個々のジョイント、四肢、ボディパーツ。
- タスク固有のノード分割戦略を導入し、解剖学的および運動論的意味に基づいて関節を意味のあるサブグラフにグループ化することで、構造的表現を向上させる。
- MSGGは、空間的および時間的次元において異なるスケールのサブグラフを処理する3本の並列ブランチを持つピラミッド構造を採用し、マルチレベルの特徴学習を可能にする。
- スケール間のメッセージパッシングは意味的プーリング操作を介して実装され、スケール間で特徴を集約・精錬することで、耐障害性と判別性を向上させる。
- シルエット(GaitPartを介して)とスケルトン(MSGGを介して)から抽出された判別的特徴を統合する特徴レベルの統合モジュールにより、包括的なゲイティング表現を形成する。
- BiFusionネットワーク全体は、特徴空間におけるクラス間分離性とクラス内compactnessを強化するために、コントラスト型損失を用いてエンドツーエンドで訓練される。
実験結果
リサーチクエスチョン
- RQ1ボディジョイントの意味的階層を活用することで、生のスケルトンシーケンスから内在するゲイティングパターンを階層的グラフニューラルネットワークアーキテクチャが効果的にモデル化できるか?
- RQ2特徴レベルでのシルエットとスケルトンの特徴統合は、単一モダリティまたは弱い統合手法よりも顕著な性能向上をもたらすか、特に困難な条件下で?
- RQ3MSGGネットワークのマルチスケール設計は、衣服の変化や視点の違いに対してどのように耐性を向上させるか?
- RQ4スケール間メッセージパッシングは、独立したスケール処理と比較して、特徴表現をどの程度向上させるか?
- RQ5提案された二モード統合戦略は、スケルトンを局所化のための補助的ヒントとしてのみ使用する既存のマルチモーダルゲイティング認識手法を上回るか?
主な発見
- 提案されたMSGGネットワークは、スケルトンベースのゲイティング認識手法の中で優れた性能を達成し、スケルトンデータの階層的でマルチスケールのモデリングの有効性を示している。
- CASIA-Bデータセットにおいて、BiFusionネットワークは最も困難な条件(異なる衣服で歩行)下で92.1%のランク-1正答率を達成し、以前の最先端手法を顕著に上回った。
- 二モード統合戦略により、シルエット単体のベースライン(GaitPart)と比較して、クロスクロージング条件下でランク-1正答率が+12.6%向上した。これは、補完的特徴統合の価値を示している。
- マルチスケール構造は段階的に性能を向上させる:ジョイントレベルブランチに四肢とボディパーツを追加することで、NM条件下で+3.8%、BG条件下で+5.9%の正答率向上が見られた。これは階層的モデリングの利点を示している。
- スケール間メッセージパッシングは顕著な貢献を示し、CL条件下で特徴を結合するだけの手法と比較して、正答率が+9.7%向上した。
- アブレーションスタディにより、提案されたピラミッド構造と意味的ノード分割が性能に不可欠であることが確認され、完全なMSGG(ジョイント+四肢+ボディパーツ)が最良の結果をもたらした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。