Skip to main content
QUICK REVIEW

[논문 리뷰] Resolution-invariant Person Re-Identification

Shunan Mao, Shiliang Zhang|arXiv (Cornell University)|2019. 06. 24.
Video Surveillance and Tracking Methods참고 문헌 28인용 수 8
한 줄 요약

이 논문은 복수의 속성에 기반한 초점 맞춤 초해상도(FFSR) 모듈과 해상도 불변 특징 추출기(RIFE)를 공동으로 훈련시켜 해상도에 영향을 받지 않는 인물 재식별 방법을 제안한다. FFSR는 스킵 연결을 갖춘 완전 컨volution 신경망 기반 오토인코더를 사용하여 저해상도 인물 이미지를 향상시키며, 특히 인물의 전경에 초점을 맞춘다. RIFE는 이중 분지 컨volution 신경망과 이중 주의 퓨전 블록을 활용하여 저해상도 및 고해상도 입력으로부터 강력한 특징을 학습한다. 제안된 방법은 최신 기준 성능을 달성하였으며, MLR-CUHK03에서 73.3%의 랭크-1 정확도와 CAVIAR에서 36.4%를 기록하여 이전 방법보다 각각 2.6%, 2.9% 향상되었다.

ABSTRACT

Exploiting resolution invariant representation is critical for person Re-Identification (ReID) in real applications, where the resolutions of captured person images may vary dramatically. This paper learns person representations robust to resolution variance through jointly training a Foreground-Focus Super-Resolution (FFSR) module and a Resolution-Invariant Feature Extractor (RIFE) by end-to-end CNN learning. FFSR upscales the person foreground using a fully convolutional auto-encoder with skip connections learned with a foreground focus training loss. RIFE adopts two feature extraction streams weighted by a dual-attention block to learn features for low and high resolution images, respectively. These two complementary modules are jointly trained, leading to a strong resolution invariant representation. We evaluate our methods on five datasets containing person images at a large range of resolutions, where our methods show substantial superiority to existing solutions. For instance, we achieve Rank-1 accuracy of 36.4% and 73.3% on CAVIAR and MLR-CUHK03, outperforming the state-of-the art by 2.9% and 2.6%, respectively.

연구 동기 및 목표

  • 실세계 감시 시스템에서 극단적인 해상도 변동이 있는 상황에서 인물 재식별(Re-ID) 문제를 해결하기 위해.
  • 일반적인 초해상도 방법이 Re-ID 정확도를 최적화하지 않으며 배경과 전경을 구분하지 못하는 한계를 극복하기 위해.
  • 저해상도 및 고해상도 입력으로부터 직접적으로 특징을 학습하여 해상도 변동에 대한 강건성을 향상시키기 위해.
  • 초해상도 및 특징 추출 모듈을 종합적으로 엔드 투 엔드로 훈련시켜 Re-ID 성능을 최적화하기 위해.

제안 방법

  • FFSR는 스킵 연결을 갖춘 완전 컨volution 신경망 오토인코더를 사용하여 인물 이미지를 업샘플링하며, 전경에 초점을 맞춘 손실 함수를 통해 신체 부분의 재구성을 우선시한다.
  • 전경 초점 손실은 인물 신체 영역의 재구성을 강조하여 Re-ID에 대한 의미적 관련성을 향상시킨다.
  • RIFE는 저해상도 및 고해상도 입력을 위한 두 개의 병렬 컨volution 신경망 스트림을 사용하며, 각각 독립적으로 특징을 추출한다.
  • 이중 주의 블록은 학습된 주의 가중치를 사용하여 두 스트림의 특징을 동적으로 융합하여 해상도 불변 표현을 생성한다.
  • FFSR와 RIFE 모듈은 종합적인 Re-ID 손실 함수를 함께 사용하여 엔드 투 엔드로 공동 훈련되며, 다양한 해상도 간의 매칭 정확도를 최적화한다.
  • 이 프레임워크는 해상도 변동이 큰 새로운 데이터셋인 VR-Market1501과 VR-MSMT17 포함 5개 데이터셋에서 평가되었다.

실험 결과

연구 질문

  • RQ1초해상도 및 특징 추출을 공동으로 훈련시키는 것이 극단적인 해상도 변동 하에서 인물 Re-ID 성능을 향상시키는가?
  • RQ2전경 중심 초해상도가 표준 초해상도 방법보다 더 나은 Re-ID 특징을 제공하는가?
  • RQ3주의 기반 융합을 사용한 이중 분지 특징 학습이 해상도 변동에 대한 강건성을 향상시키는가?
  • RQ4제안된 방법은 해상도 차이가 큰 데이터셋에서 최신 기준 Re-ID 모델과 비교해 어떻게 성능을 내는가?

주요 결과

  • MLR-CUHK03에서 제안된 방법은 73.3%의 랭크-1 정확도를 달성하여 이전 최신 기준인 CSR-GAN보다 2.6% 높았다.
  • CAVIAR에서 방법은 36.4%의 랭크-1 정확도를 기록하여 최신 기준을 2.9% 초월하였다.
  • RIFE 모듈만으로도 ResNet50 기준보다 5.7% 랭크-1 정확도가 향상되어 해상도 변동에 대한 강건성을 입증하였다.
  • FFSR와 RIFE를 결합하면 모든 5개 데이터셋에서 최고의 성능을 기록하였으며, VR-Market1501에서 SING보다 6.4% 향상되었다.
  • 제거 분석 결과, 학습된 주의 가중치를 사용한 이중 분지 설계는 동일 가중치 융합 대비 1.3% 성능 향상을 확인하였다.
  • FFSR는 SRCNN 및 VDSR 대비 최소한의 계산 오버헤드를 유발하면서도, SRCNN보다 6.2% 높은 랭크-1 정확도를 달성하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.