Skip to main content
QUICK REVIEW

[논문 리뷰] CLIP-ReID: Exploiting Vision-Language Model for Image Re-Identification without Concrete Text Labels

Siyuan Li, Sun Li|arXiv (Cornell University)|2022. 11. 25.
Multimodal Machine Learning Applications인용 수 9
한 줄 요약

이 논문은 구체적인 텍스트 레이블 없이 CLIP의 시각-언어 사전학습을 활용하는 두 단계 방법인 CLIP-ReID를 제안한다. 각 ID당 학습 가능한 텍스트 토큰을 도입하고, 이미지 인코더를 크로스모달 감독 하에 피지터링하기 전에 대비 손실을 통해 최적화함으로써, 사람과 차량 ReID 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, 기존 방법보다 최대 2.4%의 mAP 향상을 기록한다.

ABSTRACT

Pre-trained vision-language models like CLIP have recently shown superior performances on various downstream tasks, including image classification and segmentation. However, in fine-grained image re-identification (ReID), the labels are indexes, lacking concrete text descriptions. Therefore, it remains to be determined how such models could be applied to these tasks. This paper first finds out that simply fine-tuning the visual model initialized by the image encoder in CLIP, has already obtained competitive performances in various ReID tasks. Then we propose a two-stage strategy to facilitate a better visual representation. The key idea is to fully exploit the cross-modal description ability in CLIP through a set of learnable text tokens for each ID and give them to the text encoder to form ambiguous descriptions. In the first training stage, image and text encoders from CLIP keep fixed, and only the text tokens are optimized from scratch by the contrastive loss computed within a batch. In the second stage, the ID-specific text tokens and their encoder become static, providing constraints for fine-tuning the image encoder. With the help of the designed loss in the downstream task, the image encoder is able to represent data as vectors in the feature embedding accurately. The effectiveness of the proposed strategy is validated on several datasets for the person or vehicle ReID tasks. Code is available at https://github.com/Syliz517/CLIP-ReID.

연구 동기 및 목표

  • 사전 학습된 비전-언어 모델(예: CLIP)을 이미지 재식별에 적용하는 데 있어, 기술적 설명이 없는 정체성 인덱스 레이블만 존재하는 문제를 해결하기 위해.
  • 정체성에 대한 구체적인 텍스트 기술이 없음에도 불구하고 CLIP의 크로스모달 이해 능력을 ReID에 어떻게 활용할 수 있는지 탐색하기 위해.
  • 학습 가능한 토큰을 통해 모호한 ID 전용 텍스트 기술을 생성함으로써 ReID에서 효과적인 특징 학습을 가능하게 하는 방법을 개발하기 위해.
  • 여러 ReID 데이터셋에서 CNN 및 비전 트랜스포머 백본을 대상으로 제안된 두 단계 학습 전략의 효과를 검증하기 위해.

제안 방법

  • 각 정체성당 학습 가능한 텍스트 토큰의 집합을 도입하여, 구체적인 레이블 대신 모호한 텍스트 기술을 형성한다.
  • 첫 번째 단계에서는 CLIP의 이미지 및 텍스트 인코더를 고정하고, 배치 내에서 대비 손실을 사용해 오직 학습 가능한 텍스트 토큰만 최적화한다.
  • 두 번째 단계에서는 최적화된 텍스트 토큰과 CLIP의 텍스트 인코더를 고정하고, 이를 통해 이미지 인코더의 피지터링을 위한 크로스모달 감독을 제공한다.
  • 이미지 인코더의 정밀화를 위해 정체성 손실($\mathcal{L}_{id}$), 트리플릿 손실($\mathcal{L}_{tri}$), 이미지-텍스트 대비 손실($\mathcal{L}_{i2tce}$)을 포함하는 복합 손실 함수를 사용한다.
  • ViT 기반 모델에서 특징의 강건성과 일반화 능력을 향상시키기 위해 SIE(Spatial-Enhanced Prompt)와 OLP(Occlusion-robust Prompt) 기법을 활용한다.
  • ResNet-50 및 ViT-B/16 백본 모두를 지원하며, 토큰 수(M=4), 손실 구성 요소, 프롬프트 엔지니어링에 대한 추론 분석을 수행한다.

실험 결과

연구 질문

  • RQ1정체성에 대해 구체적인 텍스트 기술이 없을 경우 CLIP의 시각-언어 사전학습이 이미지 재식별에 효과적으로 활용될 수 있는가?
  • RQ2먼저 학습 가능한 텍스트 토큰을 최적화하고, 그 다음에 이를 사용해 이미지 인코더의 피지터링을 감독하는 두 단계 학습 전략이, 동시에 최적화하는 것보다 더 나은 성능을 내는가?
  • RQ3고정된 또는 프롬프트 기반의 텍스트 기술 대비, 모호하고 ID 전용의 학습 가능한 텍스트 토큰을 사용할 경우 ReID에서 어떤 성능 차이가 발생하는가?
  • RQ4최적의 성능을 내기 위해 학습 가능한 텍스트 토큰의 구성(예: 수 M)과 손실 구성 요소는 어떻게 설정해야 하는가?
  • RQ5제안된 방법은 표준 ReID 기반 모델 대비 특징의 구분 능력과 강건성을 향상시킬 수 있는가?

주요 결과

  • 두 단계 학습 전략은 한 단계 학습보다 유의하게 뛰어난 성능을 보이며, ViT-B/16를 사용할 경우 MSMT17에서 73.4% mAP와 88.7% Rank-1을 달성한 반면, 한 단계 변형은 68.9% mAP와 85.9% Rank-1을 기록한다.
  • 학습 세트의 모든 정체성을 사용해 이미지-텍스트 대비 손실($\mathcal{L}_{i2tce}$)을 계산할 경우, 현재 배치만 사용하는 것보다 성능이 뛰어나며, $\mathcal{L}_{id}$, $\mathcal{L}_{tri}$, $\mathcal{L}_{i2tce}$를 조합할 경우 mAP가 2.4% 향상된다.
  • SIE-cls와 OLP 기법의 조합은 MSMT17에서 mAP를 2.4% 향상시키고 Rank-1을 1.0% 향상시켜, 특징 품질 향상에 효과적임을 입증한다.
  • 학습 가능한 텍스트 토큰 수(M)를 4로 설정할 경우 최고의 성능를 기록하며, M=1은 부족하고 M=8은 불필요하게 중복된다.
  • 다양한 사람과 차량 ReID 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하며, ViT 기반 모델이 모든 벤치마크에서 ResNet-50 버전을 앞서는 성능을 기록한다.
  • 시각화 결과 CLIP-ReID는 기존 기반 모델이 국소적이고 구분력 있는 패치에 집중하는 데 비해, 더 포괄적인 신체 부위에 주목하는 경향을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.