Skip to main content
QUICK REVIEW

[논문 리뷰] DSSL: Deep Surroundings-person Separation Learning for Text-based Person Retrieval

Aichun Zhu, Zijie Wang|arXiv (Cornell University)|2021. 09. 12.
Video Surveillance and Tracking Methods참고 문헌 31인용 수 11
한 줄 요약

이 논문은 서로 배타적인 제약 조건을 사용하여 사람 고유의 특징과 주변 환경 정보를 명시적으로 분리하는 DSSL이라는 새로운 딥러닝 프레임워크를 제안한다. 다섯 가지 정렬 파라다임과 신호 노이즈 제거 모듈을 활용하여 DSSL은 CUHK-PEDES에서 최고 성능을 달성하며, 향후 연구를 위한 새로운 실생활 벤치마크인 RSTPReid를 도입한다.

ABSTRACT

Many previous methods on text-based person retrieval tasks are devoted to learning a latent common space mapping, with the purpose of extracting modality-invariant features from both visual and textual modality. Nevertheless, due to the complexity of high-dimensional data, the unconstrained mapping paradigms are not able to properly catch discriminative clues about the corresponding person while drop the misaligned information. Intuitively, the information contained in visual data can be divided into person information (PI) and surroundings information (SI), which are mutually exclusive from each other. To this end, we propose a novel Deep Surroundings-person Separation Learning (DSSL) model in this paper to effectively extract and match person information, and hence achieve a superior retrieval accuracy. A surroundings-person separation and fusion mechanism plays the key role to realize an accurate and effective surroundings-person separation under a mutually exclusion constraint. In order to adequately utilize multi-modal and multi-granular information for a higher retrieval accuracy, five diverse alignment paradigms are adopted. Extensive experiments are carried out to evaluate the proposed DSSL on CUHK-PEDES, which is currently the only accessible dataset for text-base person retrieval task. DSSL achieves the state-of-the-art performance on CUHK-PEDES. To properly evaluate our proposed DSSL in the real scenarios, a Real Scenarios Text-based Person Reidentification (RSTPReid) dataset is constructed to benefit future research on text-based person retrieval, which will be publicly available.

연구 동기 및 목표

  • 교차 모달 사람 검색에서 노이즈가 많고 잘못 정렬된 특징 문제를 해결하기 위해 사람 정보를 주변 환경에서 명시적으로 분리함으로써.
  • 특징 학습 중 사람과 주변 환경 특징 간의 상호 배타성을 모델링하여 검색 정확도를 향상시킴으로써.
  • 특징의 분류 능력과 교차 모달 매칭을 향상시키기 위해 다중 해상도, 다중 모odal 정렬 메커니즘을 개발함으로써.
  • 실생활 감시 조건에서의 방법 평가를 더 잘 하기 위해 현실적이고 대규모의 벤치마크 데이터셋(RSTPReid)을 구축함으로써.

제안 방법

  • 주변 환경-사람 분리 및 융합 메커니즘은 사람과 주변 환경 특징 간의 상호 배타성을 강제하여 깔끔하고 분류 능력이 뛰어난 사람 표현을 보장한다.
  • 서로 다른 다섯 가지 정렬 파라다임(AlignI–AlignIII 및 추가 두 가지)이 상호 배타성 제약 조건 하에서 특징 학습을 유도하는 데 사용된다.
  • 신호 노이즈 제거 모듈(SDM)은 입력 벡터 요소를 무작위로 0으로 설정한 후 랭킹 손실을 사용한 오토인코더 기반 복원을 적용하여 노이즈를 제거하면서도 핵심 사람 특징을 유지한다.
  • 주목적 주의 모듈(SAM)은 추출된 사람 정보를 활용하여 분류 능력이 뛰어난 신체 부위에 집중함으로써 국소 시각적 특징을 향상시킨다.
  • SDM에서 랭킹 손실을 사용한 복원은 유사도 거리 측정 방식인 유클리드 거리보다 검색 성능에서 뛰어나다는 게 입증되었다.
  • 모델은 모든 구성 요소 간의 공동 최적화를 통해 엔드 투 엔드로 훈련되어 효과적인 교차 모달 정렬을 가능하게 한다.

실험 결과

연구 질문

  • RQ1사람과 주변 환경 특징의 명시적 분리가 텍스트 기반 사람 검색에서 검색 정확도 향상에 기여하는가?
  • RQ2사람과 주변 환경 특징 간의 상호 배타성 강제가 특징 품질과 모델 일반화 능력에 어떤 영향을 미치는가?
  • RQ3불필요한 시각적 노이즈를 제거하면서도 분류 능력 있는 사람 신호를 유지하기 위한 최적의 신호 노이즈 제거 전략은 무엇인가?
  • RQ4다양한 정렬 파라다임이 상호 배타성 하에서 효과적인 교차 모달 특징 학습에 어떻게 기여하는가?
  • RQ5기존 벤치마크와 비교해 볼 때, 제안된 방법이 실생활 시나리오에 얼마나 잘 일반화되는가?

주요 결과

  • DSSL은 CUHK-PEDES에서 최고 성능을 기록하여 각각 59.98%, 80.41%, 87.56%의 top-1, top-5, top-10 정확도를 달성한다.
  • 교차 모달 재랭킹 전략을 적용한 DSSL은 top-1 정확도가 62.33%로 향상되어 이전 최고 성능 방법들을 능가한다.
  • 신호 노이즈 제거 모듈(SDM)은 0.5의 제거 비율(r=0.5)에서 최적 성능을 기록하며, r=0.9와 같이 높은 비율에서는 성능 저하가 발생한다.
  • SDM에서 랭킹 손실을 사용할 경우 유클리드 거리 사용 대비 top-1 정확도가 1.05% 높게 나타나, 검색 작업에 있어 랭킹 손실의 우수성을 입증한다.
  • 주목적 주의 모듈(SAM)을 제거할 경우 top-1 정확도가 2.03% 감소하여, 국소 특징 분류 능력 향상에 기여하는 역할을 확인한다.
  • 신규로 구축된 RSTPReid 데이터셋은 MSMT17 기반으로, 복잡한 실내 및 실외 환경에서 15개의 다양한 카메라에서 각 사람당 5장의 이미지를 포함하며, 더 현실적인 평가를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.