Skip to main content
QUICK REVIEW

[논문 리뷰] CGUA: Context-Guided and Unpaired-Assisted Weakly Supervised Person Search

Chengyou Jia, Minnan Luo|arXiv (Cornell University)|2022. 03. 27.
Video Surveillance and Tracking Methods인용 수 7
한 줄 요약

CGUA는 인간 레이블이 없는 정체성 없이도 성능을 향상시키기 위해 맥락 유도 클러스터링과 비쌍화자 인식 메모리 기반의 새로운 약한 지도 학습(person search) 프레임워크를 제안한다. 장면 맥락과 이중 메모리 백업을 통한 비쌍화자 식별을 통합함으로써, CGUA는 CUHK-SYSU에서 기존의 약한 지도 학습 방법보다 5% 이상 mAP 향상을 달성하고, 경계 상자(annotation)만을 사용하는 감독 학습 방법과도 동등한 성능을 기록한다.

ABSTRACT

Recently, weakly supervised person search is proposed to discard human-annotated identities and train the model with only bounding box annotations. A natural way to solve this problem is to separate it into detection and unsupervised re-identification (Re-ID) steps. However, in this way, two important clues in unconstrained scene images are ignored. On the one hand, existing unsupervised Re-ID models only leverage cropped images from scene images but ignore its rich context information. On the other hand, there are numerous unpaired persons in real-world scene images. Directly dealing with them as independent identities leads to the long-tail effect, while completely discarding them can result in serious information loss. In light of these challenges, we introduce a Context-Guided and Unpaired-Assisted (CGUA) weakly supervised person search framework. Specifically, we propose a novel Context-Guided Cluster (CGC) algorithm to leverage context information in the clustering process and an Unpaired-Assisted Memory (UAM) unit to distinguish unpaired and paired persons by pushing them away. Extensive experiments demonstrate that the proposed approach can surpass the state-of-the-art weakly supervised methods by a large margin (more than 5% mAP on CUHK-SYSU). Moreover, our method achieves comparable or better performance to the state-of-the-art supervised methods by leveraging more diverse unlabeled data. Codes and models will be released soon.

연구 동기 및 목표

  • 기존의 약한 지도 학습 person search 방법들이 장면 맥락과 비쌍화자(한 번만 등장하는 사람)를 간과하는 한계를 해결하기 위해.
  • 비용이 많이 드는 인간 레이블 정체성에 의존도를 줄이기 위해 경계 상자(annotation)만을 사용해 학습하는 것을 목적으로 한다.
  • 맥락 정보와 비쌍화자 정보를 통합함으로써 클러스터링 및 재식별(Re-ID) 성능을 향상시키기 위해.
  • 경계 상자(annotation)만을 사용하는 약한 지도 학습 데이터로도 감독 학습 방법과 비슷한 성능을 달성하기 위해.

제안 방법

  • 시각적 유사성과 맥락적 유사성을 통합하여 클러스터링의 강건성을 향상시키는 맥락 유도 클러스터링(CGC) 알고리즘을 도입한다.
  • 시각적 유사성과 장면 맥락을 조합한 하이브리드 유사성으로 클러스터링을 유도하고, 노이즈가 많은 클러스터를 걸러내기 위한 제약 조건을 적용한다.
  • 쌍화자와 비쌍화자 특징을 분리시키기 위해 쌍화자 및 비쌍화자 특징 메모리 백업을 갖춘 비쌍화자 보조 메모리(UAM) 유닛을 제안한다.
  • 객체 검출 후 맥락 인식 및 비쌍화자 인식 Re-ID를 수행하는 이중 단계 파이프라인을 활용하여 특징 학습을 향상시킨다.
  • 비쌍화자와 전체 장면 이미지를 포함한 다양한 레이블이 없는 데이터를 활용하여 모델의 일반화 능력을 향상시킨다.
  • t-SNE 시각화를 통해 CGC와 UAM로 인해 향상된 특징의 밀도와 분리 가능성( separability )을 검증한다.

실험 결과

연구 질문

  • RQ1전체 장면 이미지에 포함된 맥락 정보를 약한 지도 학습 person search에서 효과적으로 활용할 수 있는가?
  • RQ2데이터셋에서 한 번만 등장하는 비쌍화자(비쌍화자)가 클러스터링 및 Re-ID 성능에 미치는 영향은 무엇인가?
  • RQ3이중 메모리 백업 메커니즘이 쌍화자와 비쌍화자 간의 구별 능력을 향상시킬 수 있는가?
  • RQ4경계 상자(annotation)만을 사용하는 약한 지도 학습 모델이 얼마나 감독 학습 모델의 성능에 근접할 수 있는가?
  • RQ5맥락 정보와 비쌍화자 인식을 통합할 경우 클러스터링 품질과 특징의 구별 능력은 어떻게 영향을 받는가?

주요 결과

  • CUHK-SYSU 데이터셋에서 CGUA는 92.0%의 top-1 정확도와 91.0%의 mAP를 달성하여, 최신의 약한 지도 학습 방법보다 5% 이상 mAP 향상을 기록했다.
  • PRW 데이터셋에서 CGUA는 86.9%의 top-1 정확도를 기록하여 기존의 약한 지도 학습 방법을 초월하고 감독 학습 최상위 성능(SOTA)과도 동등한 성능을 달성했다.
  • CGC 알고리즘은 CUHK-SYSU에서 기준선인 FINCH 클러스터링 방법 대비 mAP를 12% 이상 향상시켰고, PRW에서는 5% 이상 향상시켰다.
  • UAM 유닛은 비쌍화자와 쌍화자 간의 혼동을 크게 줄였으며, 정성적 결과에서 최종 모델이 질의를 정확히 식별하면서도 잘못된 매칭을 피하는 것으로 확인되었다.
  • 비쌍화자와 전체 장면 이미지를 포함한 다양한 레이블이 없는 데이터를 활용함으로써, 감독 학습 방법과 유사한 성능을 달성했다.
  • 실행 시간 분석 결과, CGUA는 이중 단계 설계임에도 불구하고 1단계 방법과 유사한 효율성(2023년 기준 V100에서 68ms)을 보이며 뛰어난 실용성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.