Skip to main content
QUICK REVIEW

[논문 리뷰] STNReID : Deep Convolutional Networks with Pairwise Spatial Transformer Networks for Partial Person Re-identification

Hao Luo, Xing Fan|arXiv (Cornell University)|2019. 03. 17.
Video Surveillance and Tracking Methods참고 문헌 27인용 수 9
한 줄 요약

STNReID는 쌍방향 공간 변환망(STN)을 사용하여 부분 이미지와 통합 이미지 간의 정렬을 학습하는 새로운 딥러닝 프레임워크를 제안한다. 이는 애핀 변환을 학습함으로써 부분 이미지와 통합 이미지를 정렬한다. 두 단계 훈련 전략을 통해 표준 통합 ReID 데이터셋만을 사용하여 훈련함으로써 Partial-ReID에서 66.7%의 랭크-1 정확도, Partial-iLIDS에서 54.6%의 랭크-1 정확도를 달성하여 최신 기술 수준을 확립한다.

ABSTRACT

Partial person re-identification (ReID) is a challenging task because only partial information of person images is available for matching target persons. Few studies, especially on deep learning, have focused on matching partial person images with holistic person images. This study presents a novel deep partial ReID framework based on pairwise spatial transformer networks (STNReID), which can be trained on existing holistic person datasets. STNReID includes a spatial transformer network (STN) module and a ReID module. The STN module samples an affined image (a semantically corresponding patch) from the holistic image to match the partial image. The ReID module extracts the features of the holistic, partial, and affined images. Competition (or confrontation) is observed between the STN module and the ReID module, and two-stage training is applied to acquire a strong STNReID for partial ReID. Experimental results show that our STNReID obtains 66.7% and 54.6% rank-1 accuracies on partial ReID and partial iLIDS datasets, respectively. These values are at par with those obtained with state-of-the-art methods.

연구 동기 및 목표

  • 장애물과 시점 변화가 있는 실생활 감시 환경에서 부분 이미지와 통합 이미지 간의 매칭 문제를 해결한다.
  • 슬라이딩 윈도우 매칭이나 희소 재구성과 같은 기존 방법의 한계를 극복한다. 이는 높은 계산 비용이나 비효율적인 일대일 매칭으로 인한 문제를 야기한다.
  • 추가적인 부분 이미지 애너테이션 없이도 표준 통합 ReID 데이터셋에서 훈련할 수 있도록 한다.
  • 일대다 배치 추론을 통해 매칭 효율성을 향상시켜 일대일 매칭 대비 시간 소모를 줄인다.
  • 두 단계 훈련 전략을 통해 STN과 ReID 모듈 간의 경쟁을 통해 공간 정렬을 학습하는 강력한 프레임워크를 개발한다.

제안 방법

  • 부분 이미지와 통합 이미지의 고수준 특징를 이용해 2차원 애핀 변환 매개변수(스케일링, 회전, 반사)를 예측하는 공간 변환망(STN) 모듈을 통합한다.
  • STN을 사용하여 통합 이미지에서 의미적으로 정렬된 패치(애핀 이미지)를 추출하여 부분 이미지와 매칭한다.
  • ReID 모듈을 활용해 부분 이미지와 애핀 이미지에서 전역 특징을 추출하여 매칭한다.
  • 두 단계 훈련 전략을 구현한다: 먼저 약한 ReID를 통해 STN을 최적화하고, 이후 STN의 예측 결과를 사용해 ReID를 미세 조정하여 정렬 성능을 향상시킨다.
  • 추론 중에 일대다 매칭을 엔드 투 엔드로 구현한다. 이는 단일 부분 이미지를 배치 내 여러 통합 이미지와 동시에 매칭함으로써 효율성을 향상시킨다.
  • 표준 통합 ReID 데이터셋(예: Market1501)을 활용해 사전 훈련을 수행함으로써, 추가 애너테이션 없이도 부분 ReID에 대해 제로샷 적응이 가능하다.

실험 결과

연구 질문

  • RQ1공간 변환망이 고수준 특징만을 사용하여 부분 인체 이미지와 통합 이미지 간의 정렬을 효과적으로 학습할 수 있는가?
  • RQ2STN과 ReID 모듈 간의 경쟁과 상호 개선을 통해 두 단계 훈련 전략이 부분 ReID 벤치마크에서 성능 향상에 기여하는가?
  • RQ3추가적인 부분 이미지 애너테이션 없이도 STNReID가 부분 ReID 데이터셋에서 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ4다양한 갤러리 크기 하에서 기존 방법(DSR 등)과 비교해 STNReID의 계산 효율성은 어떻게 되는가?
  • RQ5표준 데이터셋에서 훈련된 STNReID가 통합 ReID 작업으로 일반화되는 정도는 어느 정도인가?

주요 결과

  • STNReID는 Partial-ReID 데이터셋에서 66.7%의 랭크-1 정확도를 달성하여 최신 기술 수준의 성능을 확보한다.
  • Partial-iLIDS 데이터셋에서 STNReID는 54.6%의 랭크-1 정확도를 기록하여 도전적인 부분 ReID 벤치마크에서 뛰어난 일반화 성능을 입증한다.
  • 더 큰 배치 크기에서 추론 시간을 크게 줄였다: Partial-iLIDS에서 N=1일 경우 1.899초에서 N=48일 경우 0.303초로 감소하여 일대일 매칭 방식을 능가한다.
  • Market1501에서는 93.8%의 랭크-1 정확도와 84.9%의 mAP를 기록하여 통합 ReID 작업에서도 뛰어난 성능을 보였다.
  • 두 단계 훈련 전략은 STN과 ReID 모듈 간의 학습 균형을 효과적으로 유지하여 모듈 간 간섭으로 인한 성능 저하를 방지한다.
  • 프레임워크는 단일 순방향 전파 내에서 효율적인 일대다 매칭을 가능하게 하여, DSR와 같은 일대일 접근 방식보다 더 확장 가능한 성능을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.