[論文レビュー] Robust Cross-View Gait Recognition with Evidence: A Discriminant Gait GAN (DiGGAN) Approach
本論文では、視覚的不変特徴を生成し、ターゲット視点における歩行エネルギー画像(GEI)を解釈可能な証拠として合成する、耐障害性のあるクロスビュー歩行認識のための判別的GANベースのフレームワーク、DiGGANを提案する。モデルはOU-MVLPおよびCASIA-Bデータセットで最先端の手法を上回り、1.2%のランク-1識別誤差と2.4%の検証EERを達成した。同時に、意思決定の検証に適した一貫性があり人間が解釈可能な証拠の生成を可能にした。
Gait as a biometric trait has attracted much attention in many security and privacy applications such as identity recognition and authentication, during the last few decades. Because of its nature as a long-distance biometric trait, gait can be easily collected and used to identify individuals non-intrusively through CCTV cameras. However, it is very difficult to develop robust automated gait recognition systems, since gait may be affected by many covariate factors such as clothing, walking speed, camera view angle etc. Out of them, large view angle changes has been deemed as the most challenging factor as it can alter the overall gait appearance substantially. Existing works on gait recognition are far from enough to provide satisfying performances because of such view changes. Furthermore, very few works have considered evidences -- the demonstrable information revealing the reliabilities of decisions, which are regarded as important demands in machine learning-based recognition/authentication applications. To address these issues, in this paper we propose a Discriminant Gait Generative Adversarial Network, namely DiGGAN, which can effectively extract view-invariant features for cross-view gait recognition; and more importantly, to transfer gait images to different views -- serving as evidences and showing how the decisions have been made. Quantitative experiments have been conducted on the two most popular cross-view gait datasets, the OU-MVLP and CASIA-B, where the proposed DiGGAN has outperformed state-of-the-art methods. Qualitative analysis has also been provided and demonstrates the proposed DiGGAN's capability in providing evidences.
研究の動機と目的
- 歩行認識における大きな視点角度の変化が認識性能を著しく低下させることに起因する課題に対処する。
- 異なる視点における合成GEIという解釈可能な証拠を提供するフレームワークを導入し、セキュリティおよびプライバシー関連の応用における意思決定の透明性を高める。
- 局所強化モジュールを用いて特徴の判別性を向上させ、視点角度にわたる一般化性能を向上させる。
- 証拠の一貫性とクロスビュー比較を実現するため、任意の視点から任意の視点への歩行画像翻訳を可能にする。
- 自動化された歩行認識と実世界への導入のギャップを、証拠に基づく推論を組み込むことで埋める。
提案手法
- 視点とアイデンティティの要因を分離することで、視点に依存しない歩行特徴を学習するための条件付きGANフレームワークを設計する。
- ジェネレータネットワークは、ソースGEIとターゲット視点角度を入力とし、視覚的不変特徴抽出器と視点条件モジュールを用いて指定された視点のGEIを合成する。
- 視覚的不変特徴の精錬を図るため、局所強化モジュールを導入する。
- 特徴の凝縮性とアイデンティティの保存を保証するため、敵対的損失、再構成損失、および対照的またはトリプルット損失の組み合わせを用いてモデルを訓練する。
- ジェネレータのボトルネックから得られる視覚的不変特徴を抽出し、クロスビュー照合と証拠生成を可能にする。
- フレームワークは任意の視点間の翻訳をサポートし、訓練データセットに含まれるすべての視点角度から任意の入力視点に対してGEIの生成が可能である。
実験結果
リサーチクエスチョン
- RQ1GANベースのモデルは、大きな視点変化にわたって一般化可能な視覚的不変歩行特徴を学習できるか?
- RQ2異なる視点における合成歩行画像(GEI)は、歩行認識における意思決定の検証に信頼性があり解釈可能な証拠として機能するか?
- RQ3歩行サンプルを照合する際、特徴レベルの類似性と証拠レベルの類似性はどれほど一貫しているか?
- RQ4局所強化モジュールの導入により、学習された歩行特徴表現の判別性が向上するか?
- RQ5モデルはクロスデータセット評価にも一般化可能であり、学習データを超えた耐障害性を示すか?
主な発見
- OU-MVLPデータセットでは、DiGGANは1.2%のランク-1識別誤差率を達成し、以前の最先端手法を上回った。
- OU-MVLPにおける検証タスクでは、DiGGANは等価誤差率(EER)2.4%を達成し、既存のアプローチを上回る優れた性能を示した。
- CASIA-Bデータセットでは、対照的損失設定下で、DiGGANはランク-1誤差率1.3%およびEER2.6%を達成し、強力な一般化性能を示した。
- 定性的な分析により、生成されたGEIが異なる視点角度においても、四肢および首のポーズといった重要な歩行特徴を保持していることが確認された。
- 特徴レベルの類似性と証拠レベルの類似性の整合性が高く、生成されたGEIが意思決定支援証拠として信頼できることが検証された。
- 異なる入力に対して同じ視点角度で生成されたGEIの分散が低く、視点情報がアイデンティティ特徴から分離されていることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。