Skip to main content
QUICK REVIEW

[논문 리뷰] Diverse Knowledge Distillation for End-to-End Person Search

Xinyu Zhang, Xinlong Wang|arXiv (Cornell University)|2020. 12. 21.
Video Surveillance and Tracking Methods인용 수 4
한 줄 요약

이 논문은 사전에 훈련된 외부 Re-ID 모델을 활용하여 종합적 인식 성능를 향상시키기 위해 다양한 지식 증류 프레임워크를 제안한다. 이는 추론 효율성을 희생시키지 않은 채 정확도를 향상시킨다. 공간 불변 증강과 관계 인식 증류를 도입하여 Re-ID 헤드의 검출 오류에 대한 강건성과 더불어 분류 능력을 향상시켜 CUHK-SYSU와 PRW에서 최신 기준(mAP)을 달성하면서도 단일 모델 추론을 유지한다.

ABSTRACT

Person search aims to localize and identify a specific person from a gallery of images. Recent methods can be categorized into two groups, i.e., two-step and end-to-end approaches. The former views person search as two independent tasks and achieves dominant results using separately trained person detection and re-identification (Re-ID) models. The latter performs person search in an end-to-end fashion. Although the end-to-end approaches yield higher inference efficiency, they largely lag behind those two-step counterparts in terms of accuracy. In this paper, we argue that the gap between the two kinds of methods is mainly caused by the Re-ID sub-networks of end-to-end methods. To this end, we propose a simple yet strong end-to-end network with diverse knowledge distillation to break the bottleneck. We also design a spatial-invariant augmentation to assist model to be invariant to inaccurate detection results. Experimental results on the CUHK-SYSU and PRW datasets demonstrate the superiority of our method against existing approaches -- it achieves on par accuracy with state-of-the-art two-step methods while maintaining high efficiency due to the single joint model. Code is available at: https://git.io/DKD-PersonSearch.

연구 동기 및 목표

  • 이중 방법과 종합적 인식 방법 간의 성능 격차를 해소하고자 하며, 특히 Re-ID 정확도에서의 격차를 다루고자 한다.
  • 검출 오류와 상충되는 목표로 인해 종합적 인식 모델의 Re-ID 헤드가 주요 성능 저하 요인임을 규명하고자 한다.
  • 잘 훈련된 외부 Re-ID 모델로부터의 지식 증류를 통해 종합적 인식 모델의 Re-ID 헤드의 분류 능력을 향상시키고자 한다.
  • 이미지 수준와 특징 수준에서의 공간 불변 데이터 증강을 통해 잘못된 검출 박스에 대한 강건성을 향상시키고자 한다.
  • 외부 모델의 추가 추론 비용 없이 단일 통합 모델만을 사용하여 추론 효율성을 유지하고자 한다.

제안 방법

  • 이미지 수준의 공간 불변 증강(ISA)을 사용해 외부 Re-ID 모델을 사전 훈련하여 일반화 능력을 향상시킨다.
  • 특징 수준의 공간 불변 증강(FSA)을 적용하여 훈련 중 특징 맵에서 이동된 RoI를 생성함으로써 검출 오류를 시뮬레이션한다.
  • 세 가지 지식 증류 브랜치를 구현: 확률 인식 증류, 쌍별 관계 인식 증류, 삼중 관계 인식 증류.
  • 관계 인식 증류를 통해 외부 Re-ID 모델의 샘플 수준 관계(예: 유사도/비유사도)를 내부 Re-ID 헤드로 전달한다.
  • 파rameter 공유 없이 증류된 지식을 활용해 검출 및 Re-ID 헤드를 함께 훈련하는 종합적 인식 모델을 훈련한다.
  • 외부 모델의 추가 추론 비용 없이 단일 통합 모델만을 사용하여 추론 효율성을 확보한다.

실험 결과

연구 질문

  • RQ1추론 효율성이 더 높음에도 불구하고 종합적 인식 모델이 이중 방법보다 성능이 열 劣하는 이유는 무엇인가?
  • RQ2종합적 인식 모델의 Re-ID 헤드가 전체 성능에 미치는 제약 정도는 어느 정도이며, 그 원인은 무엇인가?
  • RQ3사전에 훈련된 외부 Re-ID 모델로부터의 지식 증류가 종합적 인식 Re-ID 헤드의 성능 향상에 효과적으로 기여할 수 있는가?
  • RQ4공간 불변 데이터 증강은 잘못된 검출 박스에 대한 강건성을 어떻게 향상시킬 수 있는가?
  • RQ5확률 증류를 넘어서 관계 인식 지식 증류가 Re-ID에서 더 나은 특징 분류 능력을 유도하는가?

주요 결과

  • Re-ID 헤드가 종합적 인식 모델의 주요 성능 저하 요인임을 확인했다. 이는 이중 방법과 종합적 인식 모델 간의 검출 정확도는 거의 동일하지만, Re-ID 정확도는 크게 다름을 시사한다.
  • CUHK-SYSU에서 제안된 방법은 93.09% mAP를 달성하여 이전 최신 기준인 BINet(87.88% mAP)을 5.21%p 초월한다.
  • PRW에서의 성능은 50.51% mAP를 기록하여 최고의 이중 방법인 TCTS(49.50% mAP)와 모든 다른 종합적 인식 기반 모델을 능가한다.
  • 추론 속도는 NAE와 유사하거나 더 빠르며, 이중 방법보다는 훨씬 빠르게 유지되어 높은 효율성을 확보한다.
  • 제거 실험 결과, 외부 Re-ID 모델에서 랜덤 에리징 또는 BNNeck를 제거해도 성능가 약간 감소하지만 여전히 최근의 모든 방법을 능가한다.
  • 대규모 갤러리에 대해서도 잘 일반화되며, 갤러리 이미지 수가 50에서 4000으로 증가해도 mAP가 거의 감소하지 않아 강력한 확장성 잠재력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.