Skip to main content
QUICK REVIEW

[논문 리뷰] Person Re-identification by Local Maximal Occurrence Representation and Metric Learning

Shengcai Liao, Yang Hu|arXiv (Cornell University)|2014. 06. 17.
Video Surveillance and Tracking Methods참고 문헌 26인용 수 4
한 줄 요약

이 논문은 시각적 변형에 강건한 거리 학습을 위해 局소 최대 발생(Large Maximal Occurrence, LOMO) 특징 표현과 Cross-view Quadratic Discriminant Analysis(XQDA)를 결합한 새로운 인물 재식별 방법을 제안한다. LOMO는 수평 윈도우를 기준으로 局소 특징의 최대 발생 수를 극대화하여 시점 변화에 대한 강건성을 향상시키며, XQDA는 일반화 고유값 분해를 통해 분류 가능한 저차원 부분공간과 거리함수를 동시에 학습하는 방법으로, 네 개의 벤치마크 데이터셋에서 최신 기준 성능을 2.2%에서 31.55%까지 향상시킨다.

ABSTRACT

Person re-identification is an important technique towards automatic search of a person's presence in a surveillance video. Two fundamental problems are critical for person re-identification, feature representation and metric learning. An effective feature representation should be robust to illumination and viewpoint changes, and a discriminant metric should be learned to match various person images. In this paper, we propose an effective feature representation called Local Maximal Occurrence (LOMO), and a subspace and metric learning method called Cross-view Quadratic Discriminant Analysis (XQDA). The LOMO feature analyzes the horizontal occurrence of local features, and maximizes the occurrence to make a stable representation against viewpoint changes. Besides, to handle illumination variations, we apply the Retinex transform and a scale invariant texture operator. To learn a discriminant metric, we propose to learn a discriminant low dimensional subspace by cross-view quadratic discriminant analysis, and simultaneously, a QDA metric is learned on the derived subspace. We also present a practical computation method for XQDA, as well as its regularization. Experiments on four challenging person re-identification databases, VIPeR, QMUL GRID, CUHK Campus, and CUHK03, show that the proposed method improves the state-of-the-art rank-1 identification rates by 2.2%, 4.88%, 28.91%, and 31.55% on the four databases, respectively.

연구 동기 및 목표

  • 시각적 변형에 강건한 특징 표현을 통해 인물 재식별의 시점 및 조도 변화 문제를 해결한다.
  • 두 단계 거리 학습(예: PCA 이후 거리 학습)의 한계를 극복하기 위해 부분공간과 거리함수를 동시에 학습한다.
  • 다양한 공개 인물 재식별 벤치마크에서 최신 기준 성능을 향상시키는 효율적이고 효과적인 방법을 개발한다.
  • 실제 적용을 위한 실용적인 계산 솔루션(정규화 및 차원 선택 포함)을 제공한다.
  • 미래 연구 및 벤치마크를 지원하기 위해 코드를 오픈소스로 배포한다.

제안 방법

  • 시점 변화에 대한 강건성을 향상시키기 위해 슬라이딩 윈도우를 기준으로 局소 특징의 수평 발생 수를 극대화하는 局소 최대 발생(Large Maximal Occurrence, LOMO) 특징 표현을 제안한다.
  • 조도 변화를 완화하기 위해 Retinex 변환과 척도 불변 무늬 연산자를 적용한다.
  • 일반화 레일리 셰오언(Generalized Rayleigh Quotient)으로 공식화된 부분공간과 거리함수를 동시에 학습하는 방법인 Cross-view Quadratic Discriminant Analysis(XQDA)를 도입한다.
  • 일반화 고유값 분해를 이용해 XQDA에 대해 닫힌 형태의 해를 유도함으로써 효율적인 계산을 가능하게 한다.
  • 고유값 임계값 기반 자동 차원 선택과 정규화를 포함한 실용적인 XQDA 계산 방법을 구현한다.
  • LOMO와 XQDA를 통합한 단일 프레임워크로 인물 재식별을 구현하며, 여러 데이터셋에서 종단간 평가를 수행한다.

실험 결과

연구 질문

  • RQ1국소 특징의 수평 발생 수를 극대화하는 것이 인물 재식별에서 시점 변화에 대한 강건성을 향상시키는가?
  • RQ2XQDA와 같은 부분공간과 거리함수를 동시에 학습하는 접근 방식이 기존의 두 단계 방법(예: PCA + 거리 학습)보다 인물 재식별에서 우수한 성능을 내는가?
  • RQ3LOMO와 XQDA의 조합은 다양한 데이터셋에서 조도 및 자세 변화를 효과적으로 다룰 수 있는가?
  • RQ4XQDA의 최적 부분공간 차원은 무엇이며, 성능과 계산 비용에 어떤 영향을 미치는가?
  • RQ5제안된 방법은 계산 효율성을 유지하면서도 최신 기준 성능을 달성할 수 있는가?

주요 결과

  • 기본 모델에서 국소 최대 발생 연산을 적용하지 않은 경우 대비 VIPeR 데이터셋에서 LOMO 특징은 순위-1 정확도를 11.39%에서 20.25%로 8.86%p 향상시켰다.
  • VIPeR 데이터셋에서 XQDA는 부분공간 차원 100일 때 순위-1 정확도 30.1%를 기록했으며, 100 이상의 차원에서도 안정적인 성능을 유지했다.
  • 제안된 방법은 VIPeR에서 2.2%, QMUL GRID에서 4.88%, CUHK Campus에서 28.91%, CUHK03에서 31.55%까지 최신 기준 순위-1 식별률을 향상시켰다.
  • LOMO 특징 추출기는 $128 \times 48$ 이미지당 0.012초 내에 실행되어 높은 계산 효율성을 입증했다.
  • XQDA 학습 시간은 VIPeR에서 단 1.86초로, 반복적 방법인 ITML(36.78초)과 LMNN(265.28초)보다 훨씬 빠르게 작동했다.
  • 제안된 방법은 네 개의 모든 벤치마크 데이터셋에서 일관된 성능 향상을 보였으며, 이는 강건성과 일반화 능력을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.