Skip to main content
QUICK REVIEW

[논문 리뷰] Spatial-Temporal Synergic Residual Learning for Video Person Re-Identification

Xinxing Su, Yingtian Zou|arXiv (Cornell University)|2018. 07. 16.
Video Surveillance and Tracking Methods참고 문헌 6인용 수 4
한 줄 요약

이 논문은 공간 잔차 특징 추출, 시간 잔차 RNN 처리, 그리고 새로운 공간-시간 스무딩 모듈(STSM)을 통합하여 노이즈에 대한 강건성과 특징 표현을 향상시키는 파라미터 효율적인 딥러닝 프레임워크인 공간-시간 융합 잔차 신경망(STSRN)을 제안한다. STSRN은 기존 방법보다 훨씬 적은 파라미터로 iLIDS-VID, PRID2011, MARS에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

We tackle the problem of person re-identification in video setting in this paper, which has been viewed as a crucial task in many applications. Meanwhile, it is very challenging since the task requires learning effective representations from video sequences with heterogeneous spatial-temporal information. We present a novel method - Spatial-Temporal Synergic Residual Network (STSRN) for this problem. STSRN contains a spatial residual extractor, a temporal residual processor and a spatial-temporal smooth module. The smoother can alleviate sample noises along the spatial-temporal dimensions thus enable STSRN extracts more robust spatial-temporal features of consecutive frames. Extensive experiments are conducted on several challenging datasets including iLIDS-VID, PRID2011 and MARS. The results demonstrate that the proposed method achieves consistently superior performance over most of state-of-the-art methods.

연구 동기 및 목표

  • 영상 재식별에서 이질적인 공간-시간 정보를 가진 영상 시퀀스로부터 강건하고 구분력 있는 표현을 학습하는 데 도전하는 것.
  • 기존 모델이 영상 데이터에서 노이즈, 정렬 오차, 장거리 시간적 의존성 문제를 해결하지 못하는 한계를 극복하는 것.
  • 실시간 감시 시스템에 구현 가능한 파라미터 효율적이고 종단간(end-to-end) 프레임워크를 개발하는 것.

제안 방법

  • 모델은 수신장이 증가한 잔차 블록을 사용하여 프레임 수준의 구분력 있는 특징를 학습하는 공간 잔차 추출기를 활용한다.
  • 장거리 의존성을 모델링하고 순차적 프레임 간의 중복을 줄이기 위해 잔차 RNN(ResRNN) 기반의 시간 잔차 프로세서를 사용한다.
  • 공간 및 시간 영역 간 표현 전환을 부드럽게 하여 변환 과정에서의 노이즈를 감소시키기 위해 공간-시간 스무딩 모듈(STSM)을 도입한다.
  • 종단간 훈련을 위해 신원 및 검증 손실을 사용하여 특징 학습과 메트릭 학습을 공동 최적화할 수 있도록 한다.
  • 추론 효율성을 향상시키기 위해 GoogLeNet과 같은 무거운 백본을 피하는 경량 아키텍처를 설계한다.

실험 결과

연구 질문

  • RQ1영상 재식별에서 공간 및 시간 특징를 어떻게 융합적으로 학습하여 강건성을 향상시킬 수 있는가?
  • RQ2공간 및 시간 브랜치에서의 잔차 학습이 특징 표현과 노이즈 저항성에 얼마나 기여하는가?
  • RQ3경량이며 파라미터 효율적인 네트워크가 영상 Re-ID 벤치마크에서 복잡하고 큰 모델을 능가할 수 있는가?

주요 결과

  • iLIDS-VID에서 STSRN은 DoubleResBlocks+TemRes+STSM 구성으로 순위 1 정확도 70.0%를 달성하여 기준 모델(60.3%)보다 9.7%p 향상되었다.
  • PRID2011에서 전체 STSRN 구성으로 88.0%의 순위 1 정확도를 기록하여 기준 모델(75.0%)보다 13.0%p 향상되었다.
  • STSM 모듈을 추가함으로써 iLIDS-VID에서 순위 1 정확도가 약 2.0%p 향상되었고, PRID2011에서는 1.3%p 향상되었다.
  • 시간 잔차 RNN(TemRes)는 비잔차 대비 iLIDS-VID에서 2.0%p, PRID2011에서 1.0%p의 순위 1 정확도 향상을 기여하여 노이즈 저항성 향상을 입증했다.
  • PRID2011에서의 교차 데이터셋 평가를 통해 도메인 이동에도 불구하고 강력한 일반화 능력을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.