Skip to main content
QUICK REVIEW

[논문 리뷰] BiCnet-TKS: Learning Efficient Spatial-Temporal Representation for Video Person Re-Identification

Ruibing Hou, Hong Chang|arXiv (Cornell University)|2021. 04. 30.
Video Surveillance and Tracking Methods참고 문헌 50인용 수 5
한 줄 요약

이 논문은 영상 인물 재식별을 위한 계산 효율적인 아키텍처인 BiCnet-TKS를 제안한다. 이는 공간적 및 시간적 표현을 동시에 모델링한다. 이는 원본 해상도에서 입력 프레임를 처리하는 세부 브랜치와 다운샘플링을 통해 수신장역할을 확대하는 컨텍스트 브랜치를 갖춘 이중 상보적 네트워크(BiCnet)를 사용하여, 다양한 공간적 특징을 프레임 간에 캡처하고, 짧고 긴 기간의 시간적 신호를 적응적으로 융합하는 시간 커널 선택(TKS) 블록을 결합하여, 이전 방법들보다 약 50% 적은 계산량으로 최신 기술 수준의 성능을 달성한다.

ABSTRACT

In this paper, we present an efficient spatial-temporal representation for video person re-identification (reID). Firstly, we propose a Bilateral Complementary Network (BiCnet) for spatial complementarity modeling. Specifically, BiCnet contains two branches. Detail Branch processes frames at original resolution to preserve the detailed visual clues, and Context Branch with a down-sampling strategy is employed to capture long-range contexts. On each branch, BiCnet appends multiple parallel and diverse attention modules to discover divergent body parts for consecutive frames, so as to obtain an integral characteristic of target identity. Furthermore, a Temporal Kernel Selection (TKS) block is designed to capture short-term as well as long-term temporal relations by an adaptive mode. TKS can be inserted into BiCnet at any depth to construct BiCnetTKS for spatial-temporal modeling. Experimental results on multiple benchmarks show that BiCnet-TKS outperforms state-of-the-arts with about 50% less computations. The source code is available at https://github.com/ blue-blue272/BiCnet-TKS.

연구 동기 및 목표

  • 기존 영상 재식별 방법들이 영상 시퀀스에서 공간적 및 시간적 단서를 충분히 활용하지 못하는 한계를 해결하기 위해.
  • 효율적인 아키텍처를 설계하여 계산 비용을 줄이면서도 정확도를 유지하거나 향상시키기 위해.
  • 영상 콘텐츠 특성에 기반하여 짧고 긴 기간의 시간적 의존성을 적응적으로 모델링하기 위해.
  • 다양한 신체 부위에 주의를 기울이도록 하는 어텐션 모듈을 장려하여, 프레임 간 특징의 다양성을 향상시키기 위해.
  • 기존 네트워크에 삽입할 수 있는 경량이고 조합 가능한 구성 요소(TKS)를 개발하여 효과적인 시간 모델링을 가능하게 하기 위해.

제안 방법

  • BiCnet는 두 개의 병렬 브랜치를 사용한다: 원본 해상도에서 입력 프레임를 처리하는 세부 브랜치는 미세한 시각적 세부 정보를 유지하고, 다운샘플링을 사용하여 수신장역할을 확대하는 컨텍스트 브랜치는 장거리 컨텍스트 모델링을 위해 사용된다.
  • 각 브랜치에 대해 다수의 병렬이고 다양한 공간 어텐션 모듈을 적용하여, 연속된 프레임 간에 서로 다른 신체 부위에 집중하도록 유도함으로써 공간적 상보성을 향상시킨다.
  • 시간 커널 선택(TKS) 블록은 시간 차원에 따라 다양한 커널 크기(예: 3, 5, 7)를 가진 다중 병렬 3D 합성곱 경로를 사용하여 짧고 긴 기간의 운동 패턴을 모두 캡처한다.
  • TKS는 전역 특징 정보를 기반으로 가장 관련성이 높은 시간 커널을 적응적으로 선택하여, 고정된 융합 가중치 없이 동적 시간 모델링을 가능하게 한다.
  • TKS 블록은 경량이며 BiCnet의 어느 단계에나 삽입할 수 있어, 점진적인 공간-시간 특징 학습을 위한 BiCnet-TKS 아키텍처를 형성한다.
  • 두 브랜치의 특징 맵은 TKS를 통한 시간 모델링 이전에 종합적인 공간 표현을 형성하기 위해 집계된다.
Figure 1: An example of class activation maps [ 53 ] of a pair of input video sequences of existing method [ 50 ] and our method.
Figure 1: An example of class activation maps [ 53 ] of a pair of input video sequences of existing method [ 50 ] and our method.

실험 결과

연구 질문

  • RQ1상보적인 공간 브랜치를 갖춘 이중 브랜치 네트워크가 영상 재식별에서 특징의 다양성과 정체성 표현을 향상시킬 수 있는가?
  • RQ2다양한 시간 커널 크기의 적응적 선택이 영상 시퀀스에서 짧고 긴 기간의 운동 패턴을 모델링하는 데 향상된 성능을 제공하는가?
  • RQ3제안된 TKS 블록이 다중 스케일 시간 특징의 고정된 가중치 융합 방식보다 성능은 높이고 계산 비용은 낮게 유지하는가?
  • RQ4네트워크 아키텍처 내에서 TKS 블록을 어디에 배치할 경우 성능 향상이 가장 크며 최적인가?
  • RQ5BiCnet와 TKS의 조합이 FLOPs를 크게 줄였음에도 불구하고 최신 기술 수준의 정확도를 달성할 수 있는가?

주요 결과

  • BiCnet-TKS는 MARS 벤치마크에서 86.0% mAP와 90.2% 상위 1위 정확도를 기록하여 최신 기술 수준의 방법들을 능가한다.
  • 모델은 단지 1.99 GFLOPs의 계산량을 요구하여 이전 최신 기술 수준 모델 대비 약 50% 감소한 계산 비용을 기록한다.
  • BiCnet의 스테이지 2 이후에 TKS 블록을 추가하면 파rameter와 FLOPs의 증가가 최소이면서도 mAP와 상위 1위 정확도가 각각 0.4% 향상된다.
  • TKS 내의 적응적 선택 메커니즘이 필수적이다. 단순 평균(=TK 블록)을 사용할 경우 성능 향상이 없으며, 이는 동적 커널 선택의 가치를 확인한다.
  • 스테이지 1이나 스테이지 4에 TKS를 위치시키면 성능 저하가 발생하므로, 시간 모델링에 있어 스테이지 2와 3가 최적임을 시사한다.
  • 세 개의 시간 커널(K3, K5, K7)을 사용하는 것보다 두 개의 커널을 사용하는 것이 성능 향상에 유사하거나 더 좋으며, 이는 두 개의 커널만으로도 필수적인 시간 역학을 캡처하는 데 충분하다는 것을 의미한다.
Figure 2: Short and long-term temporal relations have varying importance for different sequences. (a) A sequence with partial occlusion. The long-term temporal clues are desired to alleviate occlusion. (b) A sequence of a fast-moving pedestrian. The short-term temporal clues are desired to model det
Figure 2: Short and long-term temporal relations have varying importance for different sequences. (a) A sequence with partial occlusion. The long-term temporal clues are desired to alleviate occlusion. (b) A sequence of a fast-moving pedestrian. The short-term temporal clues are desired to model det

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.