Skip to main content
QUICK REVIEW

[논문 리뷰] Re-ID Driven Localization Refinement for Person Search

Chuchu Han, Jiacheng Ye|arXiv (Cornell University)|2019. 09. 18.
Video Surveillance and Tracking Methods참고 문헌 37인용 수 4
한 줄 요약

이 논문은 Differentiable ROI 변환 레이어를 통해 Re-ID 손실을 통해 검출기 박스 좌표를 감독함으로써, 보행자 검출과 개인 재식별을 동시에 최적화하는 엔드 투 엔드 Re-ID 주도 국소화 정밀화 프레임워크를 제안한다. 이 방법은 배경 노이즈를 줄이고 구분 가능한 특징을 유지함으로써 검출 품질을 향상시키며, CUHK-SYSU에서 93.0%의 SOTA mAP 및 PRW에서 42.9%의 mAP를 달성한다.

ABSTRACT

Person search aims at localizing and identifying a query person from a gallery of uncropped scene images. Different from person re-identification (re-ID), its performance also depends on the localization accuracy of a pedestrian detector. The state-of-the-art methods train the detector individually, and the detected bounding boxes may be sub-optimal for the following re-ID task. To alleviate this issue, we propose a re-ID driven localization refinement framework for providing the refined detection boxes for person search. Specifically, we develop a differentiable ROI transform layer to effectively transform the bounding boxes from the original images. Thus, the box coordinates can be supervised by the re-ID training other than the original detection task. With this supervision, the detector can generate more reliable bounding boxes, and the downstream re-ID model can produce more discriminative embeddings based on the refined person localizations. Extensive experimental results on the widely used benchmarks demonstrate that our proposed method performs favorably against the state-of-the-art person search methods.

연구 동기 및 목표

  • 사람 검색에서 개인 재식별을 위한 최적의 경계 상자(box)를 도출하지 못하는 독립적으로 훈련된 검출기의 한계를 해결한다.
  • 하류의 Re-ID 작업과 일치하는 검출기 감독을 통해 국소화 정확도를 향상시킨다.
  • ROI 자르기 연산을 Differentiable하게 만들어 검출 및 Re-ID의 엔드 투 엔드 최적화를 가능하게 한다.
  • 기존 트리플릿이 불가능한 사람 검색 파이프라인에서 하드 샘플 마이닝을 가능하게 하기 위해 프록시 트리플릿 손실을 제안한다.
  • 다양한 검출기와 데이터셋, 특히 대규모 갤러리 설정에서도 강력한 성능 향상을 입증한다.

제안 방법

  • 원본 이미지에서 검출된 경계 상자를 애핀 변환 기반으로 자르는 Differentiable ROI 변환 레이어를 도입하여, 기울기 흐름이 상자 좌표로 전파되도록 한다.
  • 검출기의 상자 좌표를 회귀 손실 외에도 Re-ID 모델의 손실로 감독함으로써, 검출이 Re-ID 목표와 일치하도록 한다.
  • 검출기와 Re-ID 모델을 엔드 투 엔드 방식으로 공동으로 훈련시켜, 검출기가 더 구분력 있고 노이즈가 적은 경계 상자를 학습할 수 있도록 한다.
  • 사람 검색에서 하드 네거티브를 정의하기 어려운 점을 고려해, 기존 트리플릿 마이닝이 불가능한 상황을 해결하기 위해 프록시 트리플릿 손실을 제안한다.
  • 정밀화된 검출 상자를 Re-ID 파이프라인에 통합하여, 가방과 신발과 같은 핵심 특징을 집중적으로 강조한 특징 임bedding을 향상시킨다.
  • Faster R-CNN과 RetinaNet 모두에 이 프레임워크를 적용하여, 다양한 검출기 아키텍처에 대한 일반화 능력을 입증한다.

실험 결과

연구 질문

  • RQ1Re-ID 손실을 Differentiable하고 엔드 투 엔드 방식으로 보행자 검출 상자 정밀화에 효과적으로 활용할 수 있는가?
  • RQ2표준 검출 훈련과 비교했을 때, Re-ID 주도 감독이 국소화 정확도를 얼마나 향상시키는가?
  • RQ3제안된 프록시 트리플릿 손실이 사람 검색에서 하드 샘플 마이닝을 얼마나 향상시키는가?
  • RQ4이 프레임워크는 다양한 검출기 아키텍처와 갤러리 크기에 대해 일반화되는가?
  • RQ5대규모 벤치마크인 CUHK-SYSU와 PRW에서 최신 기술을 초월할 수 있는가?

주요 결과

  • 제안된 방법은 CUHK-SYSU 벤치마크에서 93.0%의 mAP를 달성하여, 기존 최고 성능 기술을 크게 앞서 간다.
  • PRW 데이터셋에서는 42.9%의 mAP를 기록하여, 대규모이고 오픈 월드 조건의 사람 검색에서 강력한 성능을 보였다.
  • 기본 성능가(93.24% Rank-1, 92.23% mAP)에서 분류 손실과 프록시 트리플릿 손실을 결합한 결과, 각각 94.24% Rank-1과 93.09% mAP로 향상되었다.
  • Faster R-CNN에 적용했을 때 Rank-1은 1.0%, mAP는 0.86% 향상되었고, RetinaNet에 적용했을 땐 각각 1.76%와 0.94% 향상되었다.
  • 시각화 결과, 정밀화된 상자들이 간섭하는 사람과 배경을 제거하면서도 가방과 신발과 같은 핵심 특징을 유지하고 있음을 확인할 수 있었다.
  • 모든 갤러리 크기에서 기준 성능을 뛰어넘었으며, 특히 대규모 설정에서 뚜렷한 성능 향상이 있었고, 이는 확장성과 강건성을 확인시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.