Skip to main content
QUICK REVIEW

[논문 리뷰] Factorized Distillation: Training Holistic Person Re-identification Model by Distilling an Ensemble of Partial ReID Models

Pengyuan Ren, Jianmin Li|arXiv (Cornell University)|2018. 11. 20.
Video Surveillance and Tracking Methods참고 문헌 12인용 수 7
한 줄 요약

이 논문은 다수의 부분 ReID 모델로부터의 지식을 특징 분해를 통해 추출함으로써, 보다 컴팩트한 통합형(person re-identification, ReID) 모델을 훈련시키는 Factorized Distillation (FD)을 제안한다. 특징 연결 대신 특징 맵과 검색 특징을 모두 분해하여 다수의 부분 모델을 모방함으로써, 추가 모듈 없이도 통합형 학생 모델이 강력한 국소적 주의를 학습할 수 있도록 하여, 더 적은 파라미터로 최신 성능(SOTA)을 달성한다.

ABSTRACT

Person re-identification (ReID) is aimed at identifying the same person across videos captured from different cameras. In the view that networks extracting global features using ordinary network architectures are difficult to extract local features due to their weak attention mechanisms, researchers have proposed a lot of elaborately designed ReID networks, while greatly improving the accuracy, the model size and the feature extraction latency are also soaring. We argue that a relatively compact ordinary network extracting globally pooled features has the capability to extract discriminative local features and can achieve state-of-the-art precision if only the model's parameters are properly learnt. In order to reduce the difficulty in learning hard identity labels, we propose a novel knowledge distillation method: Factorized Distillation, which factorizes both feature maps and retrieval features of holistic ReID network to mimic representations of multiple partial ReID models, thus transferring the knowledge from partial ReID models to the holistic network. Experiments show that the performance of model trained with the proposed method can outperform state-of-the-art with relatively few network parameters.

연구 동기 및 목표

  • 복잡한 아키텍처 없이도 강력한 국소적 특징 분류 성능을 달성할 수 있는 컴팩트한 통합형 ReID 모델을 훈련시키는 데 도전한다.
  • 다수의 부분 ReID 모델에서 한 명의 통합형 학생 네트워크로 지식을 전달하여 어려운 신원 레이블 학습의 난이도를 낮춘다.
  • 많은 교사 모델에서 지식을 추출할 때 발생하는 차원의 폭발 문제를 피하기 위해, 특징 연결 대신 분해 기법을 사용한다.
  • 자신감 있는 전역 특징 네트워크가 품질 높은 국소적 특징을 학습할 수 있도록 지식 정련을 통해 자세 추정 또는 부위 탐지 헤드가 필요 없도록 한다.
  • 기존의 대규모 모델보다 훨씬 적은 파라미터로 최신 성능을 달성한다.

제안 방법

  • 다양한 부분 ReID 모델(예: 4스트립, 7스트립 분할)을 사전 훈련된 교사 모델로 사용하여, 세부적인 소프트 레이블 역할을 하는 Supervisory Representations (SRs)를 생성한다.
  • SRs를 메트릭 학습의 기준으로 사용: 학생의 특징 맵을 분해하여 각 SR의 표현 공간에 맞추어 국소화된 지식 전달을 가능하게 한다.
  • 학생 네트워크는 교차 엔트로피 손실(신원 분류용), SRs와의 일치를 위한 속성 학습 손실, SRs와 유사성을 강제하는 메트릭 학습 손실을 조합하여 훈련된다.
  • 특징 분해를 특징 맵과 최종 검색 특징 양쪽에 적용함으로써, 고차원 특징을 연결하지 않고도 다수의 부분 모델의 주의 패턴을 모방할 수 있다.
  • 이 프레임워크는 확장 가능하고 유연하여, 신체 부위 마스크나 더 강력한 교사 네트워크 등 추가 교사 모델을 지원할 수 있다.
  • 도메인 일반화 및 다중 데이터셋 전이 성능을 향상시키기 위해 Stabilized Global Metric Pooling (GMP)을 사용한다.

실험 결과

연구 질문

  • RQ1다수의 부분 ReID 모델에서 지식을 정련함으로써 컴팩트한 통합형 ReID 모델이 최신 성능을 달성할 수 있는가?
  • RQ2특징 연결 대비 분해 기법을 사용할 경우, 지식 전달 성능는 향상되며, 동시에 컴팩트한 검색 특징을 유지할 수 있는가?
  • RQ3명시적인 부위 탐지나 자세 추정 없이도 일반 전역 특징 네트워크가 강력한 국소적 주의 메커니즘을 학습할 수 있는가?
  • RQ4교사 수가 성능에 미치는 영향은 무엇이며, 교사 수 증가에 따라 이 방법이 확장 가능한가?
  • RQ5목표 도메인에서의 미세조정 없이도, 정련된 모델이 다양한 데이터셋 간에 잘 일반화되는가?

주요 결과

  • 2770만 파라미터를 가진 R50b+FD 모델은 CUHK03에서 MGN(7030만 파라미터)을 능가하여 Rank-1 95.07%, mAP 87.1%를 기록하며, 더 뛰어난 파라미터 효율성을 입증한다.
  • 1000만 파라미터 이하 그룹에서 S+FD(270만 파라미터)는 Market-1501에서 HA-CNN(1480만 파라미터)보다 mAP 기준 2.54% 향상되었고, DukeMTMC에선 3.34% 향상되었다.
  • 홀리스틱과 파트 그룹 1 교사 외에 파트 그룹 2 교사(7스트립 분할)를 추가로 통합함으로써 성능 향상이 이루어졌으며, 이는 확장성과 점진적 성능 향상을 보여준다.
  • 절단 실험 결과, 속성 학습 손실과 메트릭 학습 손실 모두 성능 향상에 기여하며, 둘을 함께 사용할 경우 최고의 성능를 기록한다.
  • 다중 데이터셋 전이 결과에서 강력한 일반화 성능을 입증: R50b+FD는 미세조정 없이도 Market-1501에서 Rank-1 44.75%, mAP 26.97%를 기록하며, SPGAN 및 PUL과 같은 도메인 적응 방법을 능가한다.
  • ResNet-152 백본과 FD를 결합한 모델은 CUHK03에서 Rank-1 95.07%, mAP 87.1%를 기록하며, 800만 개의 파라미터가 적은 MGN을 초월한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.