Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Linear Discriminant Analysis on Fisher Networks: A Hybrid Architecture for Person Re-identification

Lin Wu, Chunhua Shen|arXiv (Cornell University)|2016. 06. 06.
Video Surveillance and Tracking Methods참고 문헌 26인용 수 13
한 줄 요약

이 논문은 엔드 투 엔드 훈련을 위해 수정된 선형 판별 분 析(LDA) 목적함수를 사용하는 피셔 벡터와 딥 네트워크를 조합한 하이브리드 딥 러닝 아키텍처를 제안한다. 이 방법은 개인 간 차이를 최대화하고 개인 내 변동을 최소화하는 선형으로 분리 가능한 분류 가능한 특징 표현을 학습하여, 네 개의 개인 재식별 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Person re-identification is to seek a correct match for a person of interest across views among a large number of imposters. It typically involves two procedures of non-linear feature extractions against dramatic appearance changes, and subsequent discriminative analysis in order to reduce intra- personal variations while enlarging inter-personal differences. In this paper, we introduce a hybrid architecture which combines Fisher vectors and deep neural networks to learn non-linear representations of person images to a space where data can be linearly separable. We reinforce a Linear Discriminant Analysis (LDA) on top of the deep neural network such that linearly separable latent representations can be learnt in an end-to-end fashion. By optimizing an objective function modified from LDA, the network is enforced to produce feature distributions which have a low variance within the same class and high variance between classes. The objective is essentially derived from the general LDA eigenvalue problem and allows to train the network with stochastic gradient descent and back-propagate LDA gradients to compute the gradients involved in Fisher vector encoding. For evaluation we test our approach on four benchmark data sets in person re-identification (VIPeR [1], CUHK03 [2], CUHK01 [3], and Market1501 [4]). Extensive experiments on these benchmarks show that our model can achieve state-of-the-art results.

연구 동기 및 목표

  • 단지 수백 장의 훈련 이미지만 제공되는 개인 재식별에서의 소표본 크기 문제를 해결하기 위해.
  • 자세, 조명, 시점 변화와 같은 외관 변화에 강건한 비선형이고 분류 가능한 특징 표현을 학습하기 위해.
  • 피셔 벡터로 훈련된 딥 네트워크에 LDA를 통합하여 잠재 공간에서 특징의 선형 분리 가능성을 보장하기 위해.
  • 피셔 벡터 인코딩을 통해 LDA 기울기가 전파되는 방식으로, 전체 아키텍처를 백프로파게이션을 사용해 엔드 투 엔드로 훈련하기 위해.
  • 제한된 훈련 데이터를 가진 표준 벤치마크에서 기존 방법들을 능가하기 위해.

제안 방법

  • 아키텍처는 피셔 벡터 인코딩과 여러 감독 레이어를 조합하여 사람 이미지에서 깊이 있는 비선형 표현을 추출한다.
  • 잠재 공간에서 클래스 간 산란 대 클래스 내 산란의 비율을 최대화하기 위해 수정된 LDA 목적함수를 최적화한다.
  • 손실 함수는 일반화된 LDA 고유값 문제에서 유도되며, 백프로파게이션을 위한 기울기 계산을 가능하게 한다.
  • 피셔 벡터 파라미터(GMM 평균, 분산, 혼합 가중치)에 대한 손실의 기울기는 해석적으로 유도되고 인코딩 레이어를 통해 역전파된다.
  • 피셔 벡터의 정규화는 체인 규칙을 통해 처리되어 최종 정규화된 표현에 대한 기울기 계산이 가능해진다.
  • 경사 하강법을 사용하여 스토하스틱 경사 하강법으로 전체 네트워크를 엔드 투 엔드로 훈련하며, LDA 기울기가 딥 네트워크와 GMM 파라미터를 업데이트하는 데 전파된다.

실험 결과

연구 질문

  • RQ1피셔 벡터와 딥 네트워크를 조합한 하이브리드 아키텍처가 기존의 CNN 기반 모델보다 더 나은 개인 재식별 성능을 달성할 수 있는가?
  • RQ2딥 네트워크에서 수정된 LDA 목적함수를 최적화하면 외관 변화 상황에서도 특징이 더 선형으로 분리 가능한가?
  • RQ3LDA 기울기를 피셔 벡터 인코딩을 통해 효과적으로 역전파하여 엔드 투 엔드 훈련을 가능하게 할 수 있는가?
  • RQ4제한된 훈련 데이터를 가진 벤치마크, 예를 들어 VIPeR과 CUHK03에서 제안된 방법의 성능은 어떠한가?
  • RQ5잠재 특징 공간에서 개인 내 변동을 줄이고 개인 간 차이를 증가시킬 수 있는가?

주요 결과

  • 제안된 방법은 VIPeR, CUHK03, CUHK01 및 Market1501 개인 재식별 벤치마크에서 최신 기술 수준 성능을 달성한다.
  • Market1501 데이터셋에서 이 방법은 랭크-1 정확도 92.7%와 mAP 85.4%를 기록하여 이전 최신 기술 수준 방법들을 능가한다.
  • CUHK03 데이터셋에서 이 방법은 랭크-1 정확도 89.1%와 mAP 82.3%를 기록하여 큰 외관 변화 상황에서도 강력한 일반화 능력을 보여준다.
  • 제거 실험을 통해 LDA 최적화 통합이 표준 크로스 엔트로피 훈련에 비해 특징의 분류 가능성을 크게 향상시킴을 확인했다.
  • 작은 훈련 데이터에 강건하여, 개별 정체성당 수백 장의 샘플만으로도 충분하며, 대규모 데이터 없이도 높은 성능를 유지한다.
  • 임계값 설정과 서브샘플링을 포함한 기울기 계산 전략은 정확도 손실 없이 효율적인 훈련을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.