Skip to main content
QUICK REVIEW

[논문 리뷰] Segmentation Mask Guided End-to-End Person Search

Dingyuan Zheng, Jimin Xiao|arXiv (Cornell University)|2019. 08. 27.
Video Surveillance and Tracking Methods참고 문헌 46인용 수 4
한 줄 요약

이 논문은 세그멘테이션 마스크를 활용하여 특징 학습을 안내함으로써 보행자 바운딩 박스 내 배경 혼잡도의 부정적 영향을 줄이는 새로운 엔드 투 엔드 인물 검색 프레임워크를 제안한다. 통합 네트워크에서 검출, 재식별, 세그멘테이션을 함께 최적화함으로써, CUHK-SYSU 벤치마크에서 86.3% mAP 및 86.5% 상위 1 정확도를 달성하여 최신 기술 수준을 확립한다.

ABSTRACT

Person search aims to search for a target person among multiple images recorded by multiple surveillance cameras, which faces various challenges from both pedestrian detection and person re-identification. Besides the large intra-class variations owing to various illumination conditions, occlusions and varying poses, background clutters in the detected pedestrian bounding boxes further deteriorate the extracted features for each person, making them less discriminative. To tackle these problems, we develop a novel approach which guides the network with segmentation masks so that discriminative features can be learned invariant to the background clutters. We demonstrate that joint optimization of pedestrian detection, person re-identification and pedestrian segmentation enables to produce more discriminative features for pedestrian, and consequently leads to better person search performance. Extensive experiments on benchmark dataset CUHK-SYSU, show that our proposed model achieves the state-of-the-art performance with 86.3% mAP and 86.5 top-1 accuracy respectively.

연구 동기 및 목표

  • 인물 검색에서 보행자 바운딩 박스 내 배경 혼잡도로 인한 특징의 구별 능력 저하 문제를 해결한다.
  • 검출, 재식별, 세그멘테이션을 별도의 단계로 다루는 기존 방법의 한계를 극복한다.
  • 엔드 투 엔드 방식으로 보행자 검출, 인물 재식별, 세그멘테이션을 함께 최적화하여 인물 검색 성능을 향상시킨다.
  • 부분적으로 레이블이 붙은 세그멘테이션 마스크를 사용하여 통합 프레임워크 내에서 특징 학습을 안내하는 효과를 입증한다.
  • 제안된 방법의 훈련 및 평가를 지원하기 위해 1,833장의 이미지에 세그멘테이션 마스크가 레이블링된 새로운 데이터셋을 구축한다.

제안 방법

  • 특징 학습을 안내하기 위해 네트워크에 병렬 마스크 브랜치를 도입하여 전경 특징 추출을 향상시킨다.
  • 엔드 투 엔드로 훈련하여 보행자 검출, 인물 재식별, 보행자 세그멘테이션을 함께 최적화한다.
  • 훈련 이미지의 16% (11,206장 중 1,833장)의 서브셋을 진짜 세그멘테이션 마스크로 사용하여 마스크 안내 특징 학습을 지도한다.
  • 세그멘테이션 마스크를 소프트 어텐션 메커니즘으로 활용하여 배경 특징을 억제하고 구별 가능한 인간 신체 부위를 강조한다.
  • 특징 추출을 위해 ResNet-50 또는 ResNet-101 백본을 사용하고, 모든 구성 요소를 동시에 최적화하기 위해 다중 작업 학습 전략을 채택한다.
  • 전역 이미지 특징과 마스크 조건부 로컬 특징을 결합하는 마스크 인식 특징 집계 모듈을 적용하여 표현의 강건성을 향상시킨다.

실험 결과

연구 질문

  • RQ1세그멘테이션 마스크가 배경 혼잡도의 영향을 줄이기 위해 인물 검색에서 특징 학습을 효과적으로 안내할 수 있는가?
  • RQ2검출, 재식별, 세그멘테이션을 엔드 투 엔드로 함께 최적화하는 것이 단계별 접근 방식보다 성능을 향상시키는가?
  • RQ3세그멘테이션 마스크가 레이블링된 훈련 이미지의 비율이 최종 인물 검색 성능에 미치는 영향은 어떠한가?
  • RQ4오염 및 저해상도와 같은 도전적인 조건에서도 제안된 방법이 뛰어난 성능을 유지할 수 있는가?
  • RQ5제안된 프레임워크는 다양한 갤러리 크기와 실제 감시 환경에서 강건한가?

주요 결과

  • 제안된 방법은 CUHK-SYSU 데이터셋에서 86.3% mAP 및 86.5% 상위 1 정확도를 달성하여 새로운 최신 기술 성능을 확립한다.
  • 50에서 4,000까지 다양한 갤러리 크기에서 일관되게 뛰어난 성능을 유지하여 척도 변화에 강건함을 입증한다.
  • 저해상도 및 오염 서브셋에서 모델은 각각 66.7% mAP 및 66.8% 상위 1 정확도(저해상도)와 70.8% mAP 및 71.3% 상위 1 정확도(오염)를 기록하여 이전 방법들을 능가한다.
  • 제거 분석 결과, 훈련 이미지의 12%가 세그멘테이션 마스크를 포함할 경우 성능이 크게 향상되며, 15%에서 안정화되고 16%에서 포화 상태에 도달함을 확인하였다.
  • 시각적 비교에서 기준 모델인 OIM 및 E2E-PS와 비교해 제안된 모델이 더 자주 목표 인물을 정확히 검색함을 확인하였다. 특히 복잡한 배경에서 유의미한 성능 향상을 보였다.
  • 세그멘테이션 마스크를 가이던스 신호로 통합함으로써, 정량적 비교에서 개선된 랭킹 결과를 통해 더 구별 가능한 특징을 얻게 되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.