[논문 리뷰] Unified Pre-training with Pseudo Texts for Text-To-Image Person Re-identification
이 논문은 텍스트-이미지 인물 재식별(T2I-ReID)을 위한 통합 사전학습 프레임워크인 UniPT를 제안한다. 데이터 및 훈련의 일관성 문제를 해결하기 위해 CLIP 기반의 분할-정복-통합 전략을 사용하여 대규모 가짜 레이블이 부여된 인물 데이터셋인 LUPerson-T를 생성한다. 이 방법은 대조 및 마스킹 언어 모델링을 통해 시각 및 언어 인코더를 공동으로 사전학습시켜 CUHK-PEDES에서 68.50%의 Rank-1 정확도로 최신 기준(SOTA) 성능을 달성한다.
The pre-training task is indispensable for the text-to-image person re-identification (T2I-ReID) task. However, there are two underlying inconsistencies between these two tasks that may impact the performance; i) Data inconsistency. A large domain gap exists between the generic images/texts used in public pre-trained models and the specific person data in the T2I-ReID task. This gap is especially severe for texts, as general textual data are usually unable to describe specific people in fine-grained detail. ii) Training inconsistency. The processes of pre-training of images and texts are independent, despite cross-modality learning being critical to T2I-ReID. To address the above issues, we present a new unified pre-training pipeline (UniPT) designed specifically for the T2I-ReID task. We first build a large-scale text-labeled person dataset "LUPerson-T", in which pseudo-textual descriptions of images are automatically generated by the CLIP paradigm using a divide-conquer-combine strategy. Benefiting from this dataset, we then utilize a simple vision-and-language pre-training framework to explicitly align the feature space of the image and text modalities during pre-training. In this way, the pre-training task and the T2I-ReID task are made consistent with each other on both data and training levels. Without the need for any bells and whistles, our UniPT achieves competitive Rank-1 accuracy of, ie, 68.50%, 60.09%, and 51.85% on CUHK-PEDES, ICFG-PEDES and RSTPReid, respectively. Both the LUPerson-T dataset and code are available at https;//github.com/ZhiyinShao-H/UniPT.
연구 동기 및 목표
- 일반적인 사전학습 데이터와 인물 중심의 T2I-ReID 데이터 사이의 데이터 도메인 갭을 해소하기 위해.
- 이미지 및 텍스트 인코더가 별도로 사전학습되지만 교차 모odal 정렬이 필요함에도 불구하고 훈련의 일관성 문제를 해결하기 위해.
- 데이터 및 훈련 수준에서 사전학습과 최종 작업 분포를 정렬함으로써 T2I-ReID 성능을 향상시키기 위해.
- 수동 레이블링 없이 정교한 인물 중심의 텍스트 기술을 자동으로 생성할 수 있는 확장 가능한 방법을 개발하기 위해.
제안 방법
- CLIP 기반의 분할-정복-통합 전략을 사용해 가짜 기술이 부여된 대규모 이미지-텍스트 데이터셋인 LUPerson-T를 구축한다.
- 인물 특징을 어휘 조각(예: '파란 무늬 셔츠')으로 분할하고, 고정된 CLIP를 사용해 이를 이미지에 매칭한 후 템플릿을 활용해 전체 기술로 통합한다.
- 동의어 치환을 적용하여 기술의 다양성을 증가시키고 중복을 줄인다.
- 이미지-텍스트 쌍 간의 대조 손실과 마스킹 언어 모델링을 사용하여 과적합을 방지하는 시각-언어 사전학습 프레임워크를 구현한다.
- 대조 및 마스킹 언어 목표를 동시에 사용해 시각적 및 텍스트 인코더를 공동으로 사전학습시켜 특징 공간을 정렬한다.
- 통합 사전학습 출력을 최종 T2I-ReID 작업의 강력한 초기화로 사용한다.
실험 결과
연구 질문
- RQ1자동화된 가짜 레이블이 부여된 인물 중심의 텍스트 기술이 T2I-ReID 사전학습에서 데이터 도메인 갭을 효과적으로 줄일 수 있는가?
- RQ2시각 및 언어 인코더의 공동 사전학습이 별도 사전학습보다 최종 T2I-ReID 성능을 향상시키는가?
- RQ3최종 작업의 데이터 및 훈련 형식을 반영하는 통합 사전학습 파이프라인은 더 나은 일반화 및 성능을 이끌 수 있는가?
- RQ4가짜 텍스트의 품질과 다양성이 제로샷 및 크로스 도메인 설정에서 모델 성능에 어떤 영향을 미치는가?
주요 결과
- DeiT-small를 사용하여 CUHK-PEDES에서 UniPT는 68.50%의 Rank-1 정확도를 기록하며, 이는 이전 SOTA인 LGUR(+1.58%) 및 IVT(+2.91%)를 초월한다.
- ICFG-PEDES에서 UniPT는 DeiT-small를 사용해 60.09%의 Rank-1 정확도를 기록하고, ViT-B/16를 사용하면 61.42%에 이를 정도로 LGUR 및 IVT를 능가한다.
- 크로스 도메인 일반화에서 UniPT는 C→I 설정에서 SSAN(w/ BERT)보다 +6.27% 향상되었고, I→C 설정에서는 +7.41% 향상되었다.
- 모델는 강력한 도메인 일반화 능력을 보이며, C→I 및 I→C 설정에서 각각 LGUR보다 +1.26% 및 +3.04% 높은 성능을 기록했다.
- 절단 실험 결과, 다양한 템플릿과 통제된 데이터 규모(130만 쌍)의 조합이 성능을 최대화하는 것으로 확인되었으며, 과도한 데이터는 노이즈를 증가시킨다.
- Lpgu(프로토타입 기반 정밀도 통합)의 사용은 특징 표현을 더욱 향상시켜 통합 사전학습 환경에서의 효과성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.