Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Unified Text-based Person Retrieval: A Large-scale Multi-Attribute and Language Search Benchmark

Shuyu Yang, Yinan Zhou|arXiv (Cornell University)|2023. 06. 05.
Video Surveillance and Tracking Methods인용 수 6
한 줄 요약

이 논문은 151만 개의 이미지-텍스트 쌍과 각 이미지당 27개의 속성을 가진 대규모 합성 벤치마크인 MALS를 소개한다. 이는 확산 모델과 캡션 생성 파이프라인을 사용하여 생성되었다. 또한 속성 인식과 텍스트 기반 검색을 동시에 학습하기 위한 APTM 프레임워크를 제안하며, CUHK-PEDES, ICFG-PEDES, RSTPReid에서 각각 Recall@1이 +6.96%, +7.68%, +16.95% 향상되어 최신 기술 수준을 달성한다.

ABSTRACT

In this paper, we introduce a large Multi-Attribute and Language Search dataset for text-based person retrieval, called MALS, and explore the feasibility of performing pre-training on both attribute recognition and image-text matching tasks in one stone. In particular, MALS contains 1,510,330 image-text pairs, which is about 37.5 times larger than prevailing CUHK-PEDES, and all images are annotated with 27 attributes. Considering the privacy concerns and annotation costs, we leverage the off-the-shelf diffusion models to generate the dataset. To verify the feasibility of learning from the generated data, we develop a new joint Attribute Prompt Learning and Text Matching Learning (APTM) framework, considering the shared knowledge between attribute and text. As the name implies, APTM contains an attribute prompt learning stream and a text matching learning stream. (1) The attribute prompt learning leverages the attribute prompts for image-attribute alignment, which enhances the text matching learning. (2) The text matching learning facilitates the representation learning on fine-grained details, and in turn, boosts the attribute prompt learning. Extensive experiments validate the effectiveness of the pre-training on MALS, achieving state-of-the-art retrieval performance via APTM on three challenging real-world benchmarks. In particular, APTM achieves a consistent improvement of +6.96%, +7.68%, and +16.95% Recall@1 accuracy on CUHK-PEDES, ICFG-PEDES, and RSTPReid datasets by a clear margin, respectively.

연구 동기 및 목표

  • 텍스트 기반 인물 검색에서 데이터 부족과 표시 품질 문제를 해결하기 위해 대규모 고품질 합성 데이터셋을 생성한다.
  • 공유된 표현을 활용해 텍스트 기반 검색 및 보행자 속성 인식 작업을 동시에 사전 학습할 수 있도록 한다.
  • 확장 가능하고 프라이버시를 보호하는 벤치마크를 개발하여 세밀한 시각적 및 언어적 표시를 지원하고 실세계 적용을 가능하게 한다.
  • 속성 프롬프팅과 텍스트 매칭 간의 통합 학습이 검색 성능 향상에 기여하는지 검증한다.

제안 방법

  • 자신의 포즈, 외관, 배경에 대한 제어된 변화를 가진 고해상도이고 다양한 보행자 이미지를 생성하기 위해 사전 학습된 확산 모델을 활용한다.
  • 실세계의 텍스트 기반 검색 기술을 프롬프트로 사용하여 이미지 생성을 유도함으로써 실제 검색어와의 의미적 일치를 확보한다.
  • 자동화된 속성 추출 파이프라인을 적용하여 생성된 캡션에서 27개의 속성을 추출하고, 표시의 다양성을 향상시킨다.
  • 두 개의 병렬 스트림(속성 프롬프트 학습 및 텍스트 매칭 학습)을 가진 APTM 프레임워크를 제안하며, 대비 학습과 마스크된 모델링을 통해 공동 최적화한다.
  • 텍스트를 속성 프롬프트로 매핑하고 일치도를 향상시키기 위해 명시적 매칭(EM)과 암묵적 확장(IE) 메커니즘을 통합한다.
  • 이미지-텍스트 대비 학습(ITC), 이미지-속성 대비 학습(IAC), 마스크된 모델링(MLM/MAM)을 활용해 표현 학습을 정규화한다.

실험 결과

연구 질문

  • RQ1확산 모델을 통해 생성된 합성 데이터가 텍스트 기반 인물 검색을 위한 효과적인 사전 학습을 지원하기에 충분한 현실성과 일치도를 확보할 수 있는가?
  • RQ2속성 인식과 텍스트 기반 검색에 대한 동시 사전 학습이 하류 벤치마크에서 일반화 능력과 성능 향상에 기여하는가?
  • RQ3합성 데이터의 규모가 제로샷 및 미세조정 설정에서 검색 성능에 어떤 영향을 미치는가?
  • RQ4속성 프롬프트 학습이 표준 텍스트 매칭보다 검색 정확도 향상에 기여하는 비율은 어느 정도인가?

주요 결과

  • MALS에서의 사전 학습으로 CUHK-PEDES에서 Recall@1이 +6.96%, ICFG-PEDES에서 +7.68%, RSTPReid에서 +16.95% 향상되어 강력한 일반화 능력을 입증한다.
  • APTM 프레임워크는 RethinkPAR 벤치마크에서 기준 모델 대비 평균 정확도(mA)가 0.97% 향상되었다.
  • 사전 학습 데이터 규모가 증가할수록 성능 향상이 이루어지나, 30만 건을 초과하면 성능 향상 폭이 감소하여 포화 상태에 도달함을 확인하였다.
  • 제거 실험을 통해 제안된 속성 프롬프트 학습(APL) 손실이 단순 분류 기반 베이스라인보다 명확한 우월성을 보였다.
  • 텍스트 매칭과 속성 프롬프트 학습을 동시에 최적화하는 것이 각각의 작업을 별도로 학습하는 것보다 더 우수한 특징 표현을 도출함을 확인하였다.
  • 보행자 속성 인식에서 경쟁적인 성능을 달성하여 통합 학습의 효과성을 검증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.