Skip to main content
QUICK REVIEW

[論文レビュー] Learning Effective Representations from Global and Local Features for Cross-View Gait Recognition

Beibei Lin, Shunli Zhang|arXiv (Cornell University)|Nov 3, 2020
Gait Recognition and Analysis参考文献 19被引用数 16
ひとこと要約

本稿では、特殊な畳み込み層を用いてグローバルな外観特徴とローカル領域特徴を統合することで、歩行認識を向上させるためのグローバル・ローカル特徴抽出器(GLFE)とローカル時間的集約(LTA)を提案する。この手法は特徴の識別性を向上させ、CASIA-BおよびOUMVLPデータセットで最先端の性能を達成した。

ABSTRACT

Gait recognition is one of the most important biometric technologies and has been applied in many fields. Recent gait recognition frameworks represent each human gait frame by descriptors extracted from either global appearances or local regions of humans. However, the representations based on global information often neglect the details of the gait frame, while local region based descriptors cannot capture the relations among neighboring regions, thus reducing their discriminativeness. In this paper, we propose a novel feature extraction and fusion framework to achieve discriminative feature representations for gait recognition. Towards this goal, we take advantage of both global visual information and local region details and develop a Global and Local Feature Extractor (GLFE). Specifically, our GLFE module is composed of our newly designed multiple global and local convolutional layers (GLConv) to ensemble global and local features in a principle manner. Furthermore, we present a novel operation, namely Local Temporal Aggregation (LTA), to further preserve the spatial information by reducing the temporal resolution to obtain higher spatial resolution. With the help of our GLFE and LTA, our method significantly improves the discriminativeness of our visual features, thus improving the gait recognition performance. Extensive experiments demonstrate that our proposed method outperforms state-of-the-art gait recognition methods on popular widely-used CASIA-B and OUMVLP datasets.

研究の動機と目的

  • 従来の歩行認識手法が、グローバル特徴のみに依存する(ローカル詳細を無視)か、領域間の空間的関係を欠く(ローカル特徴のみに依存)という限界を是正すること。
  • グローバルな視覚的文脈と詳細なローカル領域特徴を効果的に統合する包括的なフレームワークを構築し、より優れた特徴表現を実現すること。
  • 時間的シーケンスにおける空間情報を、時間的解像度を低下させることで空間的解像度を向上させる新しい操作により、保持すること。
  • クロスビュー環境下での認識精度を向上させるために、歩行特徴の識別性を高めること。

提案手法

  • グローバルおよびローカル特徴を体系的かつ一貫して抽出・統合できるように、新たに設計された複数のグローバルおよびローカル畳み込み層(GLConv)を用いたグローバル・ローカル特徴抽出器(GLFE)モジュールを提案する。
  • 時間的解像度を低下させることで空間的解像度を向上させる、新しい操作であるローカル時間的集約(LTA)を導入する。これにより、フレーム間での空間構造が保持される。
  • GLConv層を用いてグローバル外観記述子とローカル領域記述子を統合するマルチスケール特徴統合戦略を採用し、特徴の識別性を向上させる。
  • グローバル特徴が全体の歩行ポーズを捉え、ローカル特徴が四肢や身体部位の動きの詳細を記述する、階層的な特徴学習アプローチを採用する。
  • チャネルレベルでの特徴統合を適用することで、空間的整合性を維持し、下流の認識タスクにおける表現品質を向上させる。
  • 標準的な分類損失を用いてエンドツーエンドのネットワークを訓練し、クロスビュー歩行認識に最適化された識別的特徴学習を促進する。

実験結果

リサーチクエスチョン

  • RQ1グローバル外観特徴とローカル領域特徴を統合することで、クロスビュー認識における歩行表現の識別性が向上するか?
  • RQ2歩行認識における時間的シーケンスモデリングにおいて、ローカル領域間の空間的関係をどのように保持できるか?
  • RQ3時間的解像度を低下させることで空間的解像度を向上させることで、特徴品質および認識精度が向上するか?
  • RQ4提案されたGLFEおよびLTAフレームワークは、ベンチマーク歩行データセットで既存の最先端手法をどの程度上回るか?

主な発見

  • 提案手法はCASIA-B歩行データセットで最先端の性能を達成し、クロスビュー歩行認識において従来手法を顕著に上回った。
  • OUMVLPデータセットでは、既存の最先端手法と比較して優れた認識精度を示し、一般化能力の有効性を確認した。
  • GLFEを用いたグローバルおよびローカル特徴の統合により、より識別的な表現が得られ、クラス内変動が低減し、クラス間分離性が向上した。
  • ローカル時間的集約(LTA)操作は、空間的解像度を向上させ、構造的詳細を効果的に保持し、特徴品質の向上に寄与した。
  • アブレーションスタディの結果、グローバルおよびローカル特徴の両方が不可欠であり、併用することで最も高い性能向上が得られた。
  • 本手法は異なるカメラアングルや照明条件下でも頑健であることが示され、実環境での展開に向けた強力な一般化能力を有している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。