[논문 리뷰] Identity-Guided Human Semantic Parsing for Person Re-Identification
ISP는 identity-guided cascaded clustering을 사용하여 픽셀 수준의 부품(개인 소지품 포함)을 학습하고, 차폐에 강인하며 정렬 없이 재식별(re-ID)을 가능하게 하되 추가적인 의미 감독은 필요하지 않습니다.
Existing alignment-based methods have to employ the pretrained human parsing models to achieve the pixel-level alignment, and cannot identify the personal belongings (e.g., backpacks and reticule) which are crucial to person re-ID. In this paper, we propose the identity-guided human semantic parsing approach (ISP) to locate both the human body parts and personal belongings at pixel-level for aligned person re-ID only with person identity labels. We design the cascaded clustering on feature maps to generate the pseudo-labels of human parts. Specifically, for the pixels of all images of a person, we first group them to foreground or background and then group the foreground pixels to human parts. The cluster assignments are subsequently used as pseudo-labels of human parts to supervise the part estimation and ISP iteratively learns the feature maps and groups them. Finally, local features of both human body parts and personal belongings are obtained according to the selflearned part estimation, and only features of visible parts are utilized for the retrieval. Extensive experiments on three widely used datasets validate the superiority of ISP over lots of state-of-the-art methods. Our code is available at https://github.com/CASIA-IVA-Lab/ISP-reID.
연구 동기 및 목표
- 사전 학습된 파싱 모델에 의존하지 않고 사람 재식별에서의 정합성 문제를 동기 부여하고 해결한다.
- 약하게 지도되는 identity-guided 방법을 도입하여 픽셀 수준의 신체 부위와 개인 소지품을 학습한다.
- 일치 과정에서 보이는 부위를 식별하고 가려진 영역을 제외하여 가려짐에 강인한 정합을 가능하게 한다.
- 다수의 전체적 및 가려진 재식별 벤치마크에서 최첨단 성능을 시연한다.
제안 방법
- 백본 특징 맵에서 계단식 클러스터링을 개발하여 개인 소지품을 포함한 인간 부위에 대한 의사 라벨을 생성한다.
- 전역 특징 맵에서 픽셀 단위 활성화를 계산하여 전경/배경을 구분하고 동일 신원(identity)의 모든 이미지에 걸쳐 전경 픽셀을 클러스터링한다.
- 의사 라벨과 파트 인식 풀링을 통해 파트 표현을 반복적으로 정련하여 신체 부위와 소지품에 대한 로컬화된 특징을 얻는다.
- 프로브-갤러리 쌍에서 공유되거나 보이는 부분만을 사용한 파트 레벨 매칭을 구성하고 전역 및 전경 특징으로 보완한다.
- 파트, 전경, 전역 표현에 대해 트립렛 손실과 라벨 스무딩이 적용된 교차 엔트로피 손실의 조합으로 학습하고 약하게 감독되는 파싱 손실을 추가한다.
실험 결과
연구 질문
- RQ1 identity-guided, 픽셀 수준의 파트 파싱이 추가적인 의미 감독 없이 신체 부위와 개인 소지품을 모두 찾을 수 있는가?
- RQ2가려짐 인식 기반의 파트 레벨 매칭이 영역 기반 또는 주의 기반 방법과 비교해 재식별 성능을 향상시키는가?
- RQ3클러스터링 중심 수(K)의 변화가 재식별 성능 및 파싱 품질에 어떤 영향을 미치는가?
- RQ4학습된 시맨틱 파싱이 데이터셋 간의 가려짐 및 정합 오류에 대해 견고한가?
주요 결과
- ISP는 DukeMTMC-reID에서 Rank-1 89.6, Rank-5 95.5, mAP 80.0으로 최첨단 성능을 달성한다.
- Market-1501에서 ISP는 Rank-1 95.3, Rank-5 98.6, mAP 88.6을 달성한다.
- CUHK03-NP에서 ISP는 Rank-1 76.5, mAP 74.1을 달성한다.
- Occluded-DukeMTMC에서 ISP는 Rank-1 62.8, Rank-5 78.1, Rank-10 82.9, mAP 52.3으로 새로운 최첨단을 기록한다.
- ablation 연구는 K가 {4,5,6,7,8}에서 강건하며, K=7 근처에서 최고 성능을 보이고 데이터셋 간 추가적 시맨틱 근사보다 학습된 시맨틱 파싱이 우수하다는 것을 보여준다.
- ISP는 가시적 부위를 명시적으로 식별하고 매칭 시 가려진 영역을 제외하여 베이스라인 및 다수의 선행 방법에 비해 의미 있는 개선을 가져온다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.