[논문 리뷰] Do Not Disturb Me: Person Re-identification Under the Interference of Other Pedestrians
이 논문은 교란되는 보행자로부터의 영향을 억제함으로써 붐비는 장면에서의 인물 재식별 성능을 향상시키는 쿼리 유도형 딥러닝 프레임워크인 보행자 간섭 억제 네트워크(Pedestrian-Interference Suppression Network, PISNet)를 제안한다. 쿼리 유도형 어텐션 블록(QGAB), 가이던스 반전 어텐션 모듈(GRAM), 다중 인물 분리 손실(MPSL)을 사용하여 PISNet은 두 개의 새로운 보행자 간섭 Re-ID 데이터셋에서 최신 기술 수준의 성능을 달성하며, 다중 인물 가림 현상에 대한 정확성과 견고성 측면에서 기존 방법들을 능가한다.
In the conventional person Re-ID setting, it is widely assumed that cropped person images are for each individual. However, in a crowded scene, off-shelf-detectors may generate bounding boxes involving multiple people, where the large proportion of background pedestrians or human occlusion exists. The representation extracted from such cropped images, which contain both the target and the interference pedestrians, might include distractive information. This will lead to wrong retrieval results. To address this problem, this paper presents a novel deep network termed Pedestrian-Interference Suppression Network (PISNet). PISNet leverages a Query-Guided Attention Block (QGAB) to enhance the feature of the target in the gallery, under the guidance of the query. Furthermore, the involving Guidance Reversed Attention Module and the Multi-Person Separation Loss promote QGAB to suppress the interference of other pedestrians. Our method is evaluated on two new pedestrian-interference datasets and the results show that the proposed method performs favorably against existing Re-ID methods.
연구 동기 및 목표
- 감지 박스에 여러 보행자가 포함되어 있어 간섭으로 인해 특징이 손상되는 붐비는 장면에서의 인물 재식별 문제를 해결하기 위해.
- 다중 인물 이미지에서 관련 없는 보행자 특징을 억제함으로써 특징의 구별성과 위치 정확도를 향상시키기 위해.
- 쿼리 유도형 어텐션과 대비 손실을 통해 간섭 억제를 명시적으로 모델링하는 새로운 프레임워크를 제안하기 위해.
- 보행자 간섭 Re-ID 평가를 위한 두 개의 새로운 벤치마크 데이터셋—PI-CUHK-SYSU와 PI-PRW—을 제안하기 위해.
- 제안된 방법이 간섭이 심한 환경을 대상으로 설계되었음에도 불구하고 표준 Re-ID 벤치마크에 잘 일반화됨을 보여주기 위해.
제안 방법
- PISNet은 사람 이미지에서 깊은 특징을 추출하기 위해 전체 컨volution 네트워크(FCN) 백본을 사용한다.
- 쿼리 유도형 어テン션 블록(QGAB)은 쿼리 임bedding에 의해 유도되어 갤러리 이미지의 대상 특징을 강화한다.
- 가이던스 반전 어텐션 모듈(GRAM)은 개선된 갤러리 특징을 사용하여 다른 다중 인물 이미지에서의 어텐션 학습을 유도함으로써 공간적 국소화 정확도를 향상시킨다.
- 다중 인물 분리 손실(MPSL)은 동일한 갤러리 이미지에 적용된 서로 다른 쿼리 간의 특징 거리를 최대화함으로써 특징의 구별성을 증진시킨다.
- 모델는 트리플릿 손실과 MPSL의 조합을 통해 엔드 투 엔드로 훈련되며, 정체성 식별성과 간섭 억제성 양쪽을 최적화한다.
- 어텐션 맵을 시각화하여 네트워크가 비대상 보행자를 억제하고 대상에 집중하는 것을 검증한다.
실험 결과
연구 질문
- RQ1쿼리 유도형 어텐션 메커니즘이 다중 인물 Re-ID 이미지에서 다른 보행자로부터 오는 간섭을 효과적으로 억제할 수 있는가?
- RQ2가이던스 반전 어텐션 모듈(GRAM)이 붐비는 장면에서 어텐션 국소화 정확도를 어떻게 향상시키는가?
- RQ3다중 인물 분리 손실(MPSL)이 동일한 갤러리 이미지에 적용된 서로 다른 쿼리 간의 특징 구별성을 어느 정도 향상시키는가?
- RQ4PISNet은 간섭 특화 데이터셋에서 훈련되었음에도 불구하고 표준 Re-ID 벤치마크에 일반화되는가?
- RQ5손실 가중치 α와 β와 같은 하이퍼파rameter의 변화에 모델 성능가 얼마나 민감한가?
주요 결과
- PISNet은 Market-1501에서 랭크-1 정확도 95.6%와 mAP 87.1%를 달성하여 최신 기술 수준의 가림 현상 Re-ID 방법들을 능가한다.
- DukeMTMC-ReID 데이터셋에서는 랭크-1 정확도 88.8%와 mAP 78.7%를 기록하여 표준 Re-ID 벤치마크에 대한 강력한 일반화 능력을 입증한다.
- 제거 실험 결과, QGAB, GRAM, MPSL 각각의 구성 요소가 개별적으로 효과적이며, 조합 시 상호 보완적임을 확인하였다.
- 시각화 결과 어텐션 맵이 비대상 보행자를 성공적으로 억제하고 대상에 집중하고 있음을 보여주어 모델의 어텐션 메커니즘이 타당함을 검증한다.
- 모델는 하이퍼파rameter 변화에 대해 뛰어난 내구성을 보이며, α와 β 값의 넓은 범위에서 안정적인 성능을 유지한다.
- 일반 Re-ID 데이터셋에서 기존의 가림 현상 Re-ID 방법들보다 PISNet이 뚜렷이 승리하며, 간섭 특화 설정 외부에도 광범위하게 적용 가능함을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.