[論文レビュー] Combining the Silhouette and Skeleton Data for Gait Recognition
本稿では、畳み込みニューラルネットワーク(CNN)を用いたシルエットと、グラフカルニューラルネットワーク(GCN)を用いたスケルトンデータの融合により、頑健な歩行認識を実現する2本のブランチからなる深層学習フレームワークを提案する。長距離の関節依存関係を捉えるために完全結合型グラフ畳み込み演算子を導入し、空間的・時間的・チャネルワイドな注目メカニズムを統合したSTC-Attモジュールを採用することで、衣服の変化下でも最先端の性能を達成し、CASIA-Bでは91.0%の平均正答率、OUMVLPでは90.7%を記録した。
Gait recognition, a long-distance biometric technology, has aroused intense interest recently. Currently, the two dominant gait recognition works are appearance-based and model-based, which extract features from silhouettes and skeletons, respectively. However, appearance-based methods are greatly affected by clothes-changing and carrying conditions, while model-based methods are limited by the accuracy of pose estimation. To tackle this challenge, a simple yet effective two-branch network is proposed in this paper, which contains a CNN-based branch taking silhouettes as input and a GCN-based branch taking skeletons as input. In addition, for better gait representation in the GCN-based branch, we present a fully connected graph convolution operator to integrate multi-scale graph convolutions and alleviate the dependence on natural joint connections. Also, we deploy a multi-dimension attention module named STC-Att to learn spatial, temporal and channel-wise attention simultaneously. The experimental results on CASIA-B and OUMVLP show that our method achieves state-of-the-art performance in various conditions.
研究の動機と目的
- 外見ベースの歩行認識の限界、特に衣服や持ち物の変化に敏感である点を是正すること。
- ポーズ推定誤差やスカスのスケルトンデータによる精度の上限に起因するモデルベース手法の限界を克服すること。
- 外見的特徴とモデルベース特徴の相補的利点を統合し、より頑健な性能を実現すること。
- 事前に定義された骨格接続に依存せずに、多スケールおよび長距離の関節依存関係を効果的に捉えるGCNベースのモジュールを設計すること。
- 空間的・時間的・チャネルワイドな相関を同時にモデル化する多次元注目メカニズムにより、特徴表現を強化すること。
提案手法
- 2本のブランチからなるニューラルネットワークアーキテクチャを採用:1本目のブランチはGaitPartをバックボーンとして用いたCNNでシルエットを処理し、2本目のブランチはGCNベースのモデルでスケルトン系列を処理する。
- 複数の隣接行列に代わる完全結合型グラフ畳み込み演算子を提案し、自然な関節接続に依存せず、多スケールの関節依存関係を適応的に統合可能にした。
- STC-Attモジュールは1つのモジュール内で空間的・時間的・チャネルワイドな注目を学習し、GCNブランチにおける判別性の高い特徴学習を強化する。
- 両ブランチからの特徴量は、学習可能な重み比λを用いてバランスをとった後、外見的および構造的表現を統合する。
- 統合された特徴量に対してグローバル平均プーリングとソフトマックス分類器を適用し、最終的な分類を実行する。
- 標準的な交差エントロピー損失関数を用いて、CASIA-BおよびOUMVLPデータセット上でエンドツーエンドでモデルを訓練する。
実験結果
リサーチクエスチョン
- RQ1シルエットとスケルトンを統合する2本のブランチネットワークが、多様な条件下で既存の最先端手法を上回る性能を発揮できるか?
- RQ2固定された隣接行列を用いる従来のGCNと比較して、完全結合型グラフ畳み込み演算子が長距離の関節依存関係をどれほど効果的にモデル化できるか?
- RQ3STC-Attモジュールが空間的・時間的・チャネルワイドな注目を統合的にモデル化することで、歩行特徴表現にどの程度向上効果をもたらすか?
- RQ4外見的特徴とモデルベース特徴の統合が、衣服や視点の変化に対して顕著に頑健性を向上させるか?
- RQ5最適な統合比λは、さまざまな条件下で認識精度を最大限に高めるためにどの程度の値をとるか?
主な発見
- 提案手法はCASIA-Bで91.0%、OUMVLPで90.7%の平均正答率を達成し、すべての先行最先端手法を上回った。
- CASIA-BのCL(衣服変更)条件下では92.1%の正答率を記録し、GaitGLと比較して9.1%の向上を示し、衣服変化に対する強い頑健性を示した。
- アブレーションスタディにより、完全結合型グラフ畳み込みがNM条件下で平均1.5%(89.8% → 91.3%)の正答率向上をもたらし、その有効性を裏付けた。
- STC-Attモジュールはさらに平均0.5%の向上(91.3% → 91.8%)をもたらし、特徴の精錬における価値を示した。
- 最適な統合比λ = 400が、すべての条件下で最高の平均正答率94.74%を達成し、バランスの取れた特徴統合の利点を確認した。
- λ = 400の2本のブランチネットワークは、NMで97.7%、BGで93.8%、CLで92.7%を達成し、個別のブランチ(例:モデルベースのみで91.8%)を著しく上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。