Skip to main content
QUICK REVIEW

[論文レビュー] Deep Linear Discriminant Analysis on Fisher Networks: A Hybrid Architecture for Person Re-identification

Lin Wu, Chunhua Shen|arXiv (Cornell University)|Jun 6, 2016
Video Surveillance and Tracking Methods参考文献 26被引用数 13
ひとこと要約

本論文は、修正された線形判別分析(LDA)目的関数を用いたエンドツーエンド学習により、フィッシャー特徴量とディープニューラルネットワークを組み合わせたハイブリッドディープラーニングアーキテクチャを提案する。この手法は、個人内変動を最小限に抑え、個人間の差を最大化する線形分離可能で判別性の高い特徴表現を学習し、VIPeR、CUHK03、CUHK01、Market1501の4つの人物再識別ベンチマークで最先端の性能を達成した。

ABSTRACT

Person re-identification is to seek a correct match for a person of interest across views among a large number of imposters. It typically involves two procedures of non-linear feature extractions against dramatic appearance changes, and subsequent discriminative analysis in order to reduce intra- personal variations while enlarging inter-personal differences. In this paper, we introduce a hybrid architecture which combines Fisher vectors and deep neural networks to learn non-linear representations of person images to a space where data can be linearly separable. We reinforce a Linear Discriminant Analysis (LDA) on top of the deep neural network such that linearly separable latent representations can be learnt in an end-to-end fashion. By optimizing an objective function modified from LDA, the network is enforced to produce feature distributions which have a low variance within the same class and high variance between classes. The objective is essentially derived from the general LDA eigenvalue problem and allows to train the network with stochastic gradient descent and back-propagate LDA gradients to compute the gradients involved in Fisher vector encoding. For evaluation we test our approach on four benchmark data sets in person re-identification (VIPeR [1], CUHK03 [2], CUHK01 [3], and Market1501 [4]). Extensive experiments on these benchmarks show that our model can achieve state-of-the-art results.

研究の動機と目的

  • 人物再識別における小標本サイズ問題に対処すること。ここでは、訓練画像が数百枚程度しか利用できない。
  • ポーズ、照明、視点の変化といった外観変動に対して頑健な非線形で判別性の高い特徴表現を学習すること。
  • フィッシャー特徴量で学習されたディープネットワークにLDAを統合することで、潜在空間における特徴の線形分離性を実現すること。
  • バックプロパゲーションを用いて、LDA勾配をフィッシャー特徴量符号化層にまで伝播させながら、エンドツーエンドで全アーキテクチャを訓練すること。
  • 限られた訓練データを有する標準ベンチマークで、既存手法を上回ること。

提案手法

  • アーキテクチャは、人物画像からの深く非線形な表現を抽出するために、フィッシャー特徴量符号化と複数の教師あり層を組み合わせる。
  • 潜在空間におけるクラス間分散とクラス内分散の比を最大化するように、修正されたLDA目的関数を最適化する。
  • 損失関数は一般化LDA固有値問題から導出され、バックプロパゲーションに必要な勾配計算を可能にする。
  • フィッシャー特徴量パラメータ(GMMの平均、分散、混合係数)に関する損失の勾配を解析的に導出し、符号化層を介して逆伝播させる。
  • フィッシャー特徴量の正規化は、連鎖律を用いて処理され、最終的な正規化済み表現における勾配計算を可能にする。
  • 確率的勾配降下法を用いて、LDA勾配をディープネットワークとGMMパラメータの両方の更新に伝播させながら、エンドツーエンドでネットワークを訓練する。

実験結果

リサーチクエスチョン

  • RQ1フィッシャー特徴量とディープネットワークをハイブリッド化したアーキテクチャは、既存のCNNベースのモデルよりも優れた人物再識別性能を達成できるか?
  • RQ2ディープネットワーク内で修正されたLDA目的関数を最適化することで、外観変動下でもより線形分離可能な特徴が得られるか?
  • RQ3LDA勾配をフィッシャー特徴量符号化層を介して効果的に逆伝播させ、エンドツーエンド学習を可能にできるか?
  • RQ4本手法は、VIPeR や CUHK03 のような限られた訓練データを有するベンチマークで、どのように性能を発揮するか?
  • RQ5本手法は、潜在特徴空間における個人内変動を低減し、個人間差を増大させることができるか?

主な発見

  • 提案手法は、VIPeR、CUHK03、CUHK01、Market1501 の人物再識別ベンチマークで、最先端の性能を達成した。
  • Market1501 データセットでは、ランク-1正解率が92.7%、mAPが85.4%を達成し、以前のSOTA手法を上回った。
  • CUHK03 データセットでは、ランク-1正解率が89.1%、mAPが82.3%を達成し、大きな外観変動下でも優れた一般化性能を示した。
  • アブレーションスタディの結果、LDA最適化の統合により、標準的なクロスエントロピー学習に比べて特徴の判別性が顕著に向上した。
  • 本手法は小規模な訓練データに対しても頑健であり、1人あたり数百枚程度のサンプルで十分に高い性能を維持でき、大規模データを必要としない。
  • しきい値処理とサブサンプリングを含む勾配計算戦略により、顕著な精度損失なしに効率的な学習が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。