[논문 리뷰] Dynamic Prototype Mask for Occluded Person Re-Identification
이 논문은 고정된 또는 사전 정의된 주의 맵을 피하기 위해 각 샘플에 맞게 적응하는 동적 마스크를 통해 고질적인 전반적 프로토타입에서 가시 특징 부분공간을 선택함으로써 추가 사전 학습된 네트워크에 의존하지 않는, 막힘 있는 사람 재식별을 위한 새로운 엔드 투 엔드 프레임워크인 동적 프로토타입 마스크(DPM)를 제안한다. 계층적 마스크 생성기와 헤드 리치 모듈을 통합함으로써 DPM은 자동으로 프로토타입 기반 특징 정렬을 가능하게 하며, 막힘 있는 ReID 벤치마크에서 최신 기술 수준의 성능을 달성한다. Occluded-Duke에서 71.0%의 랭크-1 정확도와 61.0%의 mAP를 기록한다.
Although person re-identification has achieved an impressive improvement in recent years, the common occlusion case caused by different obstacles is still an unsettled issue in real application scenarios. Existing methods mainly address this issue by employing body clues provided by an extra network to distinguish the visible part. Nevertheless, the inevitable domain gap between the assistant model and the ReID datasets has highly increased the difficulty to obtain an effective and efficient model. To escape from the extra pre-trained networks and achieve an automatic alignment in an end-to-end trainable network, we propose a novel Dynamic Prototype Mask (DPM) based on two self-evident prior knowledge. Specifically, we first devise a Hierarchical Mask Generator which utilizes the hierarchical semantic to select the visible pattern space between the high-quality holistic prototype and the feature representation of the occluded input image. Under this condition, the occluded representation could be well aligned in a selected subspace spontaneously. Then, to enrich the feature representation of the high-quality holistic prototype and provide a more complete feature space, we introduce a Head Enrich Module to encourage different heads to aggregate different patterns representation in the whole image. Extensive experimental evaluations conducted on occluded and holistic person re-identification benchmarks demonstrate the superior performance of the DPM over the state-of-the-art methods. The code is released at https://github.com/stone96123/DPM.
연구 동기 및 목표
- 실제 감시 환경에서 장애물로 인해 분류에 유용한 신체 부위가 가려지는 상황에서 지속적인 막힘 있는 사람 재식별 문제를 해결하기 위해.
- 도메인 갭과 오류 전파를 유발할 수 있는 추가 사전 학습된 네트워크(예: 키포인트 또는 파싱용)에 대한 의존도를 제거하기 위해.
- 사람의 신체 부위를 수동으로 설계한 지도 없이도 자동으로 엔드 투 엔드로 학습 가능한 특징 정렬을 가능하게 하기 위해, 막힘 정렬을 동적 부분공간 선택 과제로 변환하기 위해.
- 다양한 트랜스포머 헤드 간의 주의 패턴 다양성을 장려함으로써 프로토타입 표현을 향상시키기 위해.
제안 방법
- 고품질의 전반적 프로토타입에서 가시 패턴 부분공간을 동적으로 선택함으로써 막힘 특징의 자동 정렬을 가능하게 하는 계층적 마스크 생성기(HMG)를 제안한다.
- 트랜스포머의 서로 다른 주의 헤드가 서로 다른 공간 패턴에 주의를 기울이도록 명시적으로 장려함으로써 주의 상관관계를 감소시키고 특징 표현을 풍부하게 하는 헤드 리치 모듈(HEM)을 도입한다.
- 최종 분류에 사용하기 전에 L2 정규화 이전에 프로토타입 행렬에 마스크를 적용함으로써 유의미한 가시 성분들만 사용되도록 보장한다.
- 프로토타입 학습, 마스크 학습, 주의 다양성 간의 균형을 맞추기 위해 초수기수 α와 β를 사용하는 다성분 손실 함수를 적용한다.
- 고정되거나 사전 정의된 주의 맵이 아닌, 각 샘플의 가시 콘텐츠에 따라 적응하는 동적 마스크 메커니즘을 사용한다.
- 전체 네트워크를 엔드 투 엔드로 학습함으로써 프로토타입 학습, 마스크 생성, 특징 표현의 공동 최적화를 가능하게 한다.
실험 결과
연구 질문
- RQ1추가 사전 학습된 네트워크가 필요 없이 성능을 유지하거나 향상시킬 수 있는가?
- RQ2사람이 설계한 신체 부위 지도 없이도 자동으로 엔드 투 엔드로 학습 가능한 특징 정렬을 달성할 수 있는가?
- RQ3다양한 트랜스포머 헤드 간의 주의 패턴 다양성을 장려함으로써 프로토타입 표현을 향상시킬 수 있는가?
- RQ4프로토타입 학습, 마스크 학습, 주의 다양성 간의 균형을 맞추는 데 최적의 초수기수 α와 β는 무엇인가?
- RQ5L2 정규화 이전에 프로토타입에 마스크를 적용하는 것이 이후에 적용하는 것보다 더 좋은 성능을 낼 수 있는가?
주요 결과
- 제안된 DPM은 Occluded-Duke 데이터셋에서 71.0%의 랭크-1 정확도와 61.0%의 mAP를 기록하며 최신 기술 수준의 방법들을 능가한다.
- 프로토타입 학습과 마스크 학습 간 균형을 맞추는 데 최적의 초수기수 α는 0.5이며, 이를 초과하면 마스크 학습에 과도하게 초점이 맞춰져 성능이 저하된다.
- 주의 다양성에 대한 최적의 초수기수 β는 0.10이며, 이는 mAP를 최대화하면서도 높은 랭크-1 정확도를 유지한다.
- L2 정규화 이전에 프로토타입에 마스크를 적용하는 것이 정규화 이후에 적용하는 것보다 더 뛰어난 성능을 낸다.
- 헤드 리치 모듈은 교차 상관행렬 값의 감소를 통해 헤드 간 주의 상관관계를 크게 감소시킴으로써 패턴 다양성이 향상되었음을 확인한다.
- DPM 프레임워크는 어떤 추가 사전 학습된 네트워크도 사용하지 않음으로써 실제 막힘 있는 ReID 환경에서 뛰어난 강건성과 일반화 능력을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.