Skip to main content
QUICK REVIEW

[論文レビュー] Automatic learning of gait signatures for people identification

Francisco M. Castro, Manuel J. Marín‐Jiménez|arXiv (Cornell University)|Mar 3, 2016
Gait Recognition and Analysis参考文献 29被引用数 11
ひとこと要約

本論文は、光学フロー特徴量から直接歩行特徴を学習するエンドツーエンドの畳み込みニューラルネットワーク(CNN)を提案し、TUM-GAIDデータセットにおいて80×60解像度の動画フレーム(従来手法の8分の1)で最先端の性能を達成した。これは、手作業で作成したシルエットや複雑な特徴工学を用いずに、低レベルの運動データから高レベルの歩行表現を効果的に学習できることを示している。

ABSTRACT

This work targets people identification in video based on the way they walk (i.e. gait). While classical methods typically derive gait signatures from sequences of binary silhouettes, in this work we explore the use of convolutional neural networks (CNN) for learning high-level descriptors from low-level motion features (i.e. optical flow components). We carry out a thorough experimental evaluation of the proposed CNN architecture on the challenging TUM-GAID dataset. The experimental results indicate that using spatio-temporal cuboids of optical flow as input data for CNN allows to obtain state-of-the-art results on the gait task with an image resolution eight times lower than the previously reported results (i.e. 80x60 pixels).

研究の動機と目的

  • バイナリシルエットのような手作業特徴を回避するエンドツーエンドのディーブラーニングフレームワークを構築すること。
  • 光学フロー地図が単独で、判別性のある歩行特徴を学習するのに十分な入力として機能するかどうかを調査すること。
  • 多様な条件(衣服、荷物、視点)下で、挑戦的なTUM-GAIDデータセット上で提案手法を検証すること。
  • 従来の研究と比較して顕著に低減された入力解像度でも、高い識別精度を達成できることを示すこと。
  • 学習された歩行特徴が、性別識別などの補助的タスクに有効に再利用可能かどうかを検討すること。

提案手法

  • バイナリシルエットの計算を回避するため、動画シーケンスから空間的・時間的コブイド(3次元)の光学フローを抽出し、CNNの入力とする。
  • 階層的かつ判別性の高い歩行表現を学習できるように、3次元光学フロー体積を処理するCNNアーキテクチャを設計する。
  • 最終全結合層からのL2正規化特徴量を、分類用の歩行特徴量として使用する。
  • 人物識別には、学習済み特徴量に対して1対すべての線形SVMまたは最近傍分類器を適用する。
  • 最近傍分類の前に特徴量の次元削減にPCAを適用し、学習ステップを省略する。
  • 3つのテストシナリオ(通常:N、荷物持参:B、スカーフ着用:S)でモデルを評価し、実世界の変動要因を模擬する。

実験結果

リサーチクエスチョン

  • RQ1光学フロー特徴量のみでトレーニングされたCNNが、手作業で作成したシルエットに依存せずに最先端の歩行認識性能を達成できるか?
  • RQ2低解像度入力下で、本手法の性能はGEIや密な軌道を用いる古典的手法と比較してどの程度優れているか?
  • RQ3学習された歩行特徴量が、衣服の変化、持ち物の有無、視点の違いといった変動に対してどの程度一般化可能か?
  • RQ4学習された歩行特徴量は、性別識別などの関連タスクに効果的に再利用可能か?
  • RQ580×60という低解像度入力が、高解像度入力と比較して識別精度を損なうか?

主な発見

  • 提案されたCNNは、80×60解像度の光学フロー入力のみを用いてTUM-GAIDデータセットでランク1精度98.0%を達成し、640×480解像度を用いた従来手法の最先端結果と同等またはそれを上回った。
  • CNN-SVMの変種は、全シナリオ(N、B、S)で平均98.0%のランク1精度を達成し、PFMを除くすべての先行手法を上回った。
  • CNN-NN128分類器は、3つのテストシナリオで平均59.4%の精度を示し、非線形分類が線形SVMよりも優れていることから、歩行特徴量が非線形に分離可能であることが示された。
  • モデルは、運動特徴(光学フロー)のみを用いて性別識別で平均89.0%の精度を達成し、低解像度入力であるにもかかわらずHofmannら[14]を上回った。
  • 混同行列の結果、男性被験者は約96%の精度で識別されたが、女性被験者は約77%の精度にとどまり、データセット内のクラス不均衡が原因であると推測された。
  • 結果から、光学フローに基づく特徴量のみで、視点や外見の変化に対し良好に一般化する判別性のある歩行特徴量を学習可能であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。