[논문 리뷰] Re-ID Driven Localization Refinement for Person Search
이 논문은 Differentiable ROI 변환 레이어를 통해 Re-ID 손실을 통해 검출기 박스 좌표를 감독함으로써, 보행자 검출과 개인 재식별을 동시에 최적화하는 엔드 투 엔드 Re-ID 주도 국소화 정밀화 프레임워크를 제안한다. 이 방법은 배경 노이즈를 줄이고 구분 가능한 특징을 유지함으로써 검출 품질을 향상시키며, CUHK-SYSU에서 93.0%의 SOTA mAP 및 PRW에서 42.9%의 mAP를 달성한다.
Person search aims at localizing and identifying a query person from a gallery of uncropped scene images. Different from person re-identification (re-ID), its performance also depends on the localization accuracy of a pedestrian detector. The state-of-the-art methods train the detector individually, and the detected bounding boxes may be sub-optimal for the following re-ID task. To alleviate this issue, we propose a re-ID driven localization refinement framework for providing the refined detection boxes for person search. Specifically, we develop a differentiable ROI transform layer to effectively transform the bounding boxes from the original images. Thus, the box coordinates can be supervised by the re-ID training other than the original detection task. With this supervision, the detector can generate more reliable bounding boxes, and the downstream re-ID model can produce more discriminative embeddings based on the refined person localizations. Extensive experimental results on the widely used benchmarks demonstrate that our proposed method performs favorably against the state-of-the-art person search methods.
연구 동기 및 목표
- 사람 검색에서 개인 재식별을 위한 최적의 경계 상자(box)를 도출하지 못하는 독립적으로 훈련된 검출기의 한계를 해결한다.
- 하류의 Re-ID 작업과 일치하는 검출기 감독을 통해 국소화 정확도를 향상시킨다.
- ROI 자르기 연산을 Differentiable하게 만들어 검출 및 Re-ID의 엔드 투 엔드 최적화를 가능하게 한다.
- 기존 트리플릿이 불가능한 사람 검색 파이프라인에서 하드 샘플 마이닝을 가능하게 하기 위해 프록시 트리플릿 손실을 제안한다.
- 다양한 검출기와 데이터셋, 특히 대규모 갤러리 설정에서도 강력한 성능 향상을 입증한다.
제안 방법
- 원본 이미지에서 검출된 경계 상자를 애핀 변환 기반으로 자르는 Differentiable ROI 변환 레이어를 도입하여, 기울기 흐름이 상자 좌표로 전파되도록 한다.
- 검출기의 상자 좌표를 회귀 손실 외에도 Re-ID 모델의 손실로 감독함으로써, 검출이 Re-ID 목표와 일치하도록 한다.
- 검출기와 Re-ID 모델을 엔드 투 엔드 방식으로 공동으로 훈련시켜, 검출기가 더 구분력 있고 노이즈가 적은 경계 상자를 학습할 수 있도록 한다.
- 사람 검색에서 하드 네거티브를 정의하기 어려운 점을 고려해, 기존 트리플릿 마이닝이 불가능한 상황을 해결하기 위해 프록시 트리플릿 손실을 제안한다.
- 정밀화된 검출 상자를 Re-ID 파이프라인에 통합하여, 가방과 신발과 같은 핵심 특징을 집중적으로 강조한 특징 임bedding을 향상시킨다.
- Faster R-CNN과 RetinaNet 모두에 이 프레임워크를 적용하여, 다양한 검출기 아키텍처에 대한 일반화 능력을 입증한다.
실험 결과
연구 질문
- RQ1Re-ID 손실을 Differentiable하고 엔드 투 엔드 방식으로 보행자 검출 상자 정밀화에 효과적으로 활용할 수 있는가?
- RQ2표준 검출 훈련과 비교했을 때, Re-ID 주도 감독이 국소화 정확도를 얼마나 향상시키는가?
- RQ3제안된 프록시 트리플릿 손실이 사람 검색에서 하드 샘플 마이닝을 얼마나 향상시키는가?
- RQ4이 프레임워크는 다양한 검출기 아키텍처와 갤러리 크기에 대해 일반화되는가?
- RQ5대규모 벤치마크인 CUHK-SYSU와 PRW에서 최신 기술을 초월할 수 있는가?
주요 결과
- 제안된 방법은 CUHK-SYSU 벤치마크에서 93.0%의 mAP를 달성하여, 기존 최고 성능 기술을 크게 앞서 간다.
- PRW 데이터셋에서는 42.9%의 mAP를 기록하여, 대규모이고 오픈 월드 조건의 사람 검색에서 강력한 성능을 보였다.
- 기본 성능가(93.24% Rank-1, 92.23% mAP)에서 분류 손실과 프록시 트리플릿 손실을 결합한 결과, 각각 94.24% Rank-1과 93.09% mAP로 향상되었다.
- Faster R-CNN에 적용했을 때 Rank-1은 1.0%, mAP는 0.86% 향상되었고, RetinaNet에 적용했을 땐 각각 1.76%와 0.94% 향상되었다.
- 시각화 결과, 정밀화된 상자들이 간섭하는 사람과 배경을 제거하면서도 가방과 신발과 같은 핵심 특징을 유지하고 있음을 확인할 수 있었다.
- 모든 갤러리 크기에서 기준 성능을 뛰어넘었으며, 특히 대규모 설정에서 뚜렷한 성능 향상이 있었고, 이는 확장성과 강건성을 확인시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.