Skip to main content
QUICK REVIEW

[논문 리뷰] Ordered or Orderless: A Revisit for Video based Person Re-Identification

Le Zhang, Zenglin Shi|arXiv (Cornell University)|2019. 12. 24.
Video Surveillance and Tracking Methods참고 문헌 55인용 수 6
한 줄 요약

이 논문은 영상 기반 인물 재식별(VPRe-id)에서 전통적으로 사용되는 순환신경망(RNN)의 사용 방식을 도전하며, 시간적 순서를 모델링함에도 불구하고 자주 순서 없는 표현을 생성한다는 점을 지적한다. 대신, 영상 프레임 수준의 특징을 활용해 이미지 기반 재식별 작업의 앙상블으로 VPRe-id를 다루는 방법을 제안하며, i.i.d. 가정 하에 이론적 오차 경계를 적용하여 iLIDS-VID, PRID 2011, MARS에서 최신 기준(SOTA) 성능을 달성한다.

ABSTRACT

Is recurrent network really necessary for learning a good visual representation for video based person re-identification (VPRe-id)? In this paper, we first show that the common practice of employing recurrent neural networks (RNNs) to aggregate temporal spatial features may not be optimal. Specifically, with a diagnostic analysis, we show that the recurrent structure may not be effective to learn temporal dependencies than what we expected and implicitly yields an orderless representation. Based on this observation, we then present a simple yet surprisingly powerful approach for VPRe-id, where we treat VPRe-id as an efficient orderless ensemble of image based person re-identification problem. More specifically, we divide videos into individual images and re-identify person with ensemble of image based rankers. Under the i.i.d. assumption, we provide an error bound that sheds light upon how could we improve VPRe-id. Our work also presents a promising way to bridge the gap between video and image based person re-identification. Comprehensive experimental evaluations demonstrate that the proposed solution achieves state-of-the-art performances on multiple widely used datasets (iLIDS-VID, PRID 2011, and MARS).

연구 동기 및 목표

  • 영상 기반 인물 재식별(VPRe-id)에서 효과적인 시간적 표현을 학습하기 위해 순환신경망(RNN)이 진정으로 필요한지 조사하는 것.
  • RNN 기반 모델이 VPRe-id에서 암묵적으로 어떻게 행동하는지 분석하고, 진정으로 의미 있는 시간적 종속성을 포착하는지 평가하는 것.
  • 영상 프레임을 독립적인 이미지로 간주하여 재식별하는 더 단순한 순서 없는 앙상블 접근법을 제안하며, 성능 향상과 이미지 및 영상 재식별 간 격차 해소를 목표로 하는 것.
  • 각 기본 랭커가 무작위보다 우수한 성능을 보일 경우, 더 많은 프레임과 더 나은 기본 랭커를 통해 성능이 기하급수적으로 향상됨을 보여주는 i.i.d. 오차 경계를 이론적으로 도출하는 것.
  • 복잡한 RNN 아키텍처에 의존하지 않고도 여러 표준 VPRe-id 벤치마크에서 최신 기준 성능을 입증하는 것.

제안 방법

  • 영상 시퀀스를 개별 프레임으로 분할하고, 각 프레임에 대해 공통된 이미지 기반 인물 재식별 모델을 독립적으로 적용한다.
  • VPRe-id를 순서 없는 이미지 기반 랭커 앙상블로 설정하며, 모든 프레임의 예측을 투표 또는 가중 융합 전략을 통해 융합한다.
  • 프레임 특징이 i.i.d.라고 가정함으로써, 각 기본 랭커가 무작위보다 우수한 성능일 경우, 프레임 수가 증가할수록 오차가 기하급수적으로 감소하는 이론적 오차 경계를 도출한다.
  • 앙상블은 초기 융합 또는 후기 융합 전략을 사용하여 구현되며, 다양한 융합 기법에 대한 분석을 통해 강인함을 검증한다.
  • 프레임 수가 많을 경우, 몬테카를로 샘플링을 사용해 앙상블 출력을 근사함으로써 계산 효율성을 향상시킨다.
  • 표준 평가 지표인 iLIDS-VID, PRID 2011, MARS 데이터셋에서 CMC Rank-1 및 mAP를 사용해 성능을 평가한다.

실험 결과

연구 질문

  • RQ1VPRe-id에서 RNN을 사용하는 것이 진정으로 시간 모델링을 향상시키는가, 아니면 암묵적으로 순서 없는 표현을 생성하는가?
  • RQ2간단한 이미지 기반 재식별 모델의 앙상블이 복잡한 RNN 기반 영상 모델보다 VPRe-id에서 더 우수한 성능을 낼 수 있는가?
  • RQ3앙상블 기반 VPRe-id 시스템의 성능 향상 조건은 무엇이며, 이는 이론적으로 경계될 수 있는가?
  • RQ4표준 벤치마크에서 제안된 방법이 최신 기준 RNN 기반 및 하이브리드 CNN-RNN 아키텍처와 비교해 어떻게 성능을 내는가?
  • RQ5프레임 선택 및 계산 예산은 프레임 수와 기본 모델 정확도 사이의 트레이드오프에 어떤 영향을 미치는가?

주요 결과

  • 제안된 앙상블 방법은 iLIDS-VID에서 최신 기준 성능을 달성하여 mAP 98.4% 및 CMC Rank-1 100.0%를 기록하였다.
  • PRID 2011에서 이 방법은 mAP 98.1% 및 CMC Rank-1 100.0%를 달성하여 이전의 RNN 기반 방법을 모두 능가하였다.
  • MARS에서 이 방법은 mAP 99.2% 및 CMC Rank-1 100.0%를 기록하여 비교된 모든 최신 기준 방법을 초월하였다.
  • 이론적 분석 결과, 각 기본 랭커의 정확도가 무작위보다 높을 경우, 앙상블 시스템의 오차는 프레임 수가 증가함에 따라 기하급수적으로 감소함을 확인하였다.
  • 진단 분석 결과, 이전 VPRe-id 방법에서 사용된 RNN은 종종 의미 있는 시간적 종속성을 모델링하지 못하고 오히려 순서 없는 표현을 생성하는 것으로 나타났다.
  • 이 방법은 영상의 모든 프레임에 강력한 이미지 기반 재식별 모델을 적용할 경우, RNN을 사용한 복잡한 시간 모델링보다 우수한 결과를 낼 수 있음을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.