Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Scale Body-Part Mask Guided Attention for Person Re-identification

Honglong Cai, Zhiguan Wang|arXiv (Cornell University)|2019. 04. 24.
Video Surveillance and Tracking Methods참고 문헌 40인용 수 6
한 줄 요약

이 논문은 훈련 중에 상체 및 하체 마스크를 사용하여 주의 학습을 안내하는 다중 척도 신체 부위 마스크 유도 주의 네트워크(MMGA)를 제안한다. 이를 통해 유의미한 신체 부위의 정밀한 국소화를 가능하게 하고 배경 혼잡도 및 자세 변화로부터 간섭을 줄일 수 있다. 이 방법은 추론 시 마스크가 필요하지 않지만, Market1501에서 95.0%의 rank-1 및 87.2%의 mAP, DukeMTMC-reID에서 89.5%의 rank-1 및 78.1%의 mAP를 기록하여 기존의 주의 기반 모델을 능가하는 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Person re-identification becomes a more and more important task due to its wide applications. In practice, person re-identification still remains challenging due to the variation of person pose, different lighting, occlusion, misalignment, background clutter, etc. In this paper, we propose a multi-scale body-part mask guided attention network (MMGA), which jointly learns whole-body and part body attention to help extract global and local features simultaneously. In MMGA, body-part masks are used to guide the training of corresponding attention. Experiments show that our proposed method can reduce the negative influence of variation of person pose, misalignment and background clutter. Our method achieves rank-1/mAP of 95.0%/87.2% on the Market1501 dataset, 89.5%/78.1% on the DukeMTMC-reID dataset, outperforming current state-of-the-art methods.

연구 동기 및 목표

  • 자세 변화, 가림, 배경 혼잡도, 정렬 불일치 등의 문제를 해결하기 위해.
  • 주목적 기반 메커니즘을 통해 전반적이고 국소적인 특징을 동시에 캡처하여 특징 학습을 향상시키기 위해.
  • 훈련 중에 신체 부위 마스크를 사용하여 주의를 유도함으로써 배경 영역에 대한 의존도를 줄이기 위해.
  • 추론 시 마스크가 필요 없도록 하여 추론 효율성을 유지하기 위해.
  • 다중 척도의 부분 전용 마스크가 주의 기반 특징 추출에 얼마나 효과적인지 탐색하기 위해.

제안 방법

  • 이 방법은 전체 신체, 상체 및 하체 마스크를 사용하여 해당 주의 모듈의 훈련을 유도하는 다중 척도의 신체 부위 마스크 유도 주의 네트워크(MMGA)를 도입한다.
  • 상체 및 하체 마스크는 전체 신체 마스크를 중선에서 분할하여 생성되며, 이는 부분 전용 주의 학습을 가능하게 한다.
  • 주의 맵은 이러한 마스크에서 유도된 감독을 통해 최적화되며, 이는 네트워크가 유의미한 신체 영역에 집중하고 배경 노이즈를 억제하도록 유도한다.
  • 주의 기반 메커니즘은 훈련 중에만 적용되며, 이는 추론 시 마스크 입력 없이도 모델을 효율적으로 배포할 수 있도록 한다.
  • 전반적 및 부분 기반 주의 헤드를 통합한 네트워크 아키텍처는 마스크 유도 감독을 통해 특징의 분류 능력을 향상시킨다.
  • 이 방법은 표준 사전 훈련된 ResNet 백본과 호환되어 이전 연구에서 관찰된 아키텍처 호환성 문제를 피한다.
Figure 1: Examples of challenges in person re-identification and how our attention mechanism can handle the challenges. (a-b) occlusions, (c-d) inaccurate bounding-box detection, (e-f) variation of pose. The second to forth images in each group are the global attention map in original image, upper-b
Figure 1: Examples of challenges in person re-identification and how our attention mechanism can handle the challenges. (a-b) occlusions, (c-d) inaccurate bounding-box detection, (e-f) variation of pose. The second to forth images in each group are the global attention map in original image, upper-b

실험 결과

연구 질문

  • RQ1다중 척도의 신체 부위 마스크는 인식 재정의에서 주의 기반 특징 학습을 향상시킬 수 있는가?
  • RQ2부분 전용 마스크 유도는 배경 혼잡도 및 자세 변화의 부정적 영향을 줄일 수 있는가?
  • RQ3전체 신체 마스크만 사용하는 것보다 부분 마스크로 훈련된 주의 네트워크가 더 높은 성능을 낼 수 있는가?
  • RQ4마스크 유도 주의를 사용하면서도 높은 추론 효율성을 유지할 수 있는가?
  • RQ5마스크 유도 주의의 성능는 최신 기술 수준의 재정의 모델과 비교해 어떻게 되는가?

주요 결과

  • MMGA는 Market1501 데이터셋에서 95.0%의 rank-1 및 87.2%의 mAP를 기록하여 현재 최신 기술 수준의 방법인 MGN을 mAP 기준 +0.3% 향상시켰다.
  • DukeMTMC-reID에서 MMGA는 89.5%의 rank-1 및 78.1%의 mAP를 달성하여 MGN을 rank-1 기준 +0.8% 향상시키며, mAP는 동일하게 유지했다.
  • 제거 분석 결과, 상체 및 하체 마스크를 사용할 경우 전체 마스크 기반 기준(MMGA) 대비 mAP +0.7%, rank-1 +0.8% 향상됨을 확인했다.
  • 분할 마스크 기반 기준(DMGA)과 비교했을 때, MMGA는 Market1501에서 mAP -0.6%, DukeMTMC-reID에서 mAP -0.9% 향상되어 의미 있는 신체 부위 마스크의 우수성을 입증했다.
  • 정확한 바운딩 박스가 없거나 심한 가림이 있는 이미지에서도 정확도를 유지하는 것으로 나타났으며, 어려운 쿼리에 대해 정확한 상위 5개 검색 결과가 얻어짐을 정성적 결과로 확인했다.
  • MGN과 같이 무게 공유 없이 세 개의 별도 ResNet50 브랜치를 사용하는 모델보다도 더 효율적이면서도 최신 기술 수준의 성능을 달성했다.
Figure 2: Split mask from the middle-line may suffer misalignment problem. The first row shows the original images, the second row shows whole-body masks. The left pair of the third row is the result of divide whole-body mask into upper-half part and bottom-half part according to the middle line. Th
Figure 2: Split mask from the middle-line may suffer misalignment problem. The first row shows the original images, the second row shows whole-body masks. The left pair of the third row is the result of divide whole-body mask into upper-half part and bottom-half part according to the middle line. Th

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.