[論文レビュー] On Learning Disentangled Representations for Gait Recognition
本稿では、衣服や視覚角度などの混同要因に対して認識の頑健性を向上させるために、RGB歩行動画から外見、標準的、ポーズ特徴を分離する、新しい自己符号化器ベースの深層学習フレームワーク、GaitNetを提案する。LSTMを用いた時系列モデリングと独自の損失関数を活用することで、CASIA-B、USF、および新規の正面視歩行データセット(FVG)において最先端の性能を達成し、従来手法に比べて優れた正確性、特徴の分離品質、計算効率を示した。
Gait, the walking pattern of individuals, is one of the important biometrics modalities. Most of the existing gait recognition methods take silhouettes or articulated body models as gait features. These methods suffer from degraded recognition performance when handling confounding variables, such as clothing, carrying and viewing angle. To remedy this issue, we propose a novel AutoEncoder framework, GaitNet, to explicitly disentangle appearance, canonical and pose features from RGB imagery. The LSTM integrates pose features over time as a dynamic gait feature while canonical features are averaged as a static gait feature. Both of them are utilized as classification features. In addition, we collect a Frontal-View Gait (FVG) dataset to focus on gait recognition from frontal-view walking, which is a challenging problem since it contains minimal gait cues compared to other views. FVG also includes other important variations, e.g., walking speed, carrying, and clothing. With extensive experiments on CASIA-B, USF, and FVG datasets, our method demonstrates superior performance to the SOTA quantitatively, the ability of feature disentanglement qualitatively, and promising computational efficiency. We further compare our GaitNet with state-of-the-art face recognition to demonstrate the advantages of gait biometrics identification under certain scenarios, e.g., long distance/lower resolutions, cross viewing angles.
研究の動機と目的
- 衣服、荷物、視点角度などの混同要因に敏感である既存の歩行認識手法の限界を解消すること。
- RGB動画内の歩行関連特徴(標準的およびポーズ)を外見(衣服)および非歩行要因から自動的に分離するエンドツーエンドの深層学習フレームワークの開発。
- 最小限の歩行特徴と高い変動性を有する状況下での評価を目的として、新規の正面視歩行データセット(FVG)を収集・公開すること。
- 分離可能な表現学習が、特に低解像度または困難な視点条件下でも、より頑健で汎用性の高い歩行認識を実現することの実証。
- 類似条件下での最先端の顔認識システムと比較し、長距離または非理想的な状況下での歩行認識の優位性を強調すること。
提案手法
- GaitNetは自己符号化器ベースのCNNであり、各動画フレームをポーズ(動的)、標準的(個人特異的ボディーシェイプ)、外見(衣服/テクスチャ)という3つの分離可能な潜在特徴に符号化する。
- 融合特徴(あるフレームの標準的+外見と別のフレームのポーズを組み合わせたもの)がターゲットフレームを再構築できるようにするため、クロス再構築損失を用いる。
- ポーズ類似性損失により、同じ被験者のフレーム間でポーズ特徴の時系列的一致性が保証され、さまざまな条件下でも安定する。
- 標準的安定性損失により、同じ被験者の異なる動画間で標準的特徴が安定し、識別子不変性を促進する。
- ポーズ特徴はマルチレイヤーLSTMで処理され、時系列ダイナミクスがモデル化され、判別力の向上を図るためインクリメンタル識別損失が適用される。
- 最終的な歩行特徴は、時間平均された静的標準的特徴とLSTM処理済みの動的ポーズ特徴を統合し、分類に共同で使用される。
実験結果
リサーチクエスチョン
- RQ1エンドツーエンドの深層学習モデルは、RGB歩行動画における外見および混同要因から、歩行関連特徴(標準的およびポーズ)を効果的に分離できるか?
- RQ2提案された分離フレームワークは、衣服、荷物、歩行速度、視点角度の変動下でも認識正確性と頑健性を向上させるか?
- RQ3低解像度や非正面視などの困難な条件下で、GaitNetの性能は最先端の顔認識システムと比較してどうなるか?
- RQ4分離可能な表現学習は、異なるデータセットおよび歩行モダリティ間での一般化をどの程度向上させるか?
- RQ5提案手法は低コストの計算負荷で高い正確性を達成できるか。これにより、実世界への展開が可能になるか?
主な発見
- GaitNetはCASIA-B、USF、および新規に収集されたFVGデータセットにおいて、さまざまな変動下でも最先端の正確性を達成し、既存手法を上回った。
- FVGデータセットでは、NM-BGHTプロトコル下で98.2%、NM-ALL*下で97.6%の正確性を達成し、衣服や付属品の変動に対して強い頑健性を示した。
- 解像度の低下や非正面視においても高い正確性を維持したが、顔認識は一貫して性能を発揮できなかった。
- GaitNetは計算効率に優れ、FVGデータセットでは1フレームあたり90.5 msの総推論時間を記録し、ポーズベース手法を上回り、最近のCNNベースの歩行モデルと同等の速度を達成した。
- 可視化による定性的な評価から、分離された特徴は意味的に意味を持つことが確認された:外見特徴は衣服を捉え、標準的特徴はボディーシェイプを反映し、ポーズ特徴は動きを追跡した。
- 長距離および低解像度の状況下では、GaitNetはArcFaceを常に上回り、特に顔認識が失敗する側面視や非正面状況でも顕著な優位性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。