Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Semantic-Aligned Feature Representation for Text-based Person Search

Shiping Li, Min Cao|arXiv (Cornell University)|2021. 12. 13.
Video Surveillance and Tracking Methods인용 수 5
한 줄 요약

이 논문은 텍스트 기반 인물 검색을 위한 부분 인식 가능하고 교차 모odal 간 정렬된 특징을 학습하기 위해 비전 트랜스포머(ViT)와 BERT 백본을 활용하는 의미론적 정렬 특징 집합 네트워크를 제안한다. 다중 헤드 어텐션과 교차 모달 부분 정렬 손실, 다양성 손실을 사용함으로써, 외부 모델이나 복잡한 어텐션 메커니즘 없이도 CUHK-PEDES(64.13% Rank-1)와 Flickr30K(50.74% Rank-1)에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Text-based person search aims to retrieve images of a certain pedestrian by a textual description. The key challenge of this task is to eliminate the inter-modality gap and achieve the feature alignment across modalities. In this paper, we propose a semantic-aligned embedding method for text-based person search, in which the feature alignment across modalities is achieved by automatically learning the semantic-aligned visual features and textual features. First, we introduce two Transformer-based backbones to encode robust feature representations of the images and texts. Second, we design a semantic-aligned feature aggregation network to adaptively select and aggregate features with the same semantics into part-aware features, which is achieved by a multi-head attention module constrained by a cross-modality part alignment loss and a diversity loss. Experimental results on the CUHK-PEDES and Flickr30K datasets show that our method achieves state-of-the-art performances.

연구 동기 및 목표

  • 이미지와 텍스트 간의 세분화된 의미론적 정렬 특징 학습을 가능하게 함으로써 텍스트 기반 인물 검색에서의 교차 모달 갭 문제를 해결한다.
  • 사전 정의된 영역에 의존하거나 복잡한 어텐션 메커니즘을 사용하는 기존의 전역 매칭 및 국소 매칭 방법의 한계를 극복한다.
  • 추가 모델이나 높은 추론 비용 없이도 자동으로 부분 인식 특징을 학습할 수 있는 엔드 투 엔드 학습 가능한 아키텍처를 개발한다.
  • 통합적이고 경량화된 프레임워크를 통해 전역 및 국소 매칭 신호를 통합함으로써 검색 성능을 향상시킨다.

제안 방법

  • 이미지와 텍스트에서 강력하고 고차원적인 표현을 추출하기 위해 모odal 전용 특징 인코더로 비전 트랜스포머(ViT)와 BERT를 사용한다.
  • 공유된 의미론적 특징을 가진 모달 간에 특징을 적응적으로 집계하기 위해 다중 헤드 어텐션을 사용하는 의미론적 정렬 특징 집합 네트워크(SAFA)를 도입한다.
  • 주목한 시각적 패치와 텍스트 단어가 의미적으로 대응하도록 하기 위해 교차 모달 부분 정렬 손실을 도입한다.
  • 어侁션 헤드가 서로 다른 의미론적 부분에 집중하도록 유도하기 위해 다양성 손실을 적용하여 부정확성과 특징 커버리지 향상을 방지한다.
  • [CLS] 토큰의 전역 특징과 패치/단어 특징을 결합하여 통합된 프레임워크 내에서 전역 및 국소 매칭을 가능하게 한다.
  • 최종 검색 성능 최적화를 위해 대조 학습 목표를 사용하여 전체 모델을 엔드 투 엔드로 훈련한다.

실험 결과

연구 질문

  • RQ1외부 모델 없이도 경량이며 엔드 투 엔드 학습 가능한 네트워크가 이미지 및 텍스트 모달 간에 의미론적 정렬된 부분 인식 특징을 학습할 수 있는가?
  • RQ2제안된 의미론적 정렬 특징 집합 네트워크는 기존의 어텐션 기반 또는 규칙 기반 국소 매칭 방법과 비교해 성능 및 효율성 면에서 어떻게 다른가?
  • RQ3교차 모달 부분 정렬 손실과 다양성 손실이 검색 정확도 향상에 얼마나 기여하는가?
  • RQ4제안된 방법이 CUHK-PEDES와 Flickr30K와 같은 다양한 벤치마크에서 일관된 최신 기술 수준 성능을 달성할 수 있는가?
  • RQ5최적의 검색 성능를 얻기 위해 초모수 K(부분 수)와 λ(다양성 손실 가중치)의 최적 설정은 무엇인가?

주요 결과

  • 제안된 방법은 CUHK-PEDES 데이터셋에서 64.13%의 Rank-1 정확도를 달성하여 이전의 모든 최신 기술 수준 방법을 능가한다.
  • Flickr30K 데이터셋에서는 50.74%의 Rank-1 정확도를 기록하여 이전 SOTA 방법보다 8个百分点 이상 뛰어나다.
  • 절단 분석 결과, SAFA 모듈은 전역 특징 전용 기반선 대비 Rank-1 정확도 4.34% 향상을 기록하여 국소 매칭의 효과성을 입증한다.
  • 전역 특징과 부분 인식 특징의 조합이 가장 높은 성능을 내며, 전역 인코더가 강력한 보조 신호를 제공함을 확인하였다.
  • 초모수 분석 결과, K=10과 λ=0.2가 최적의 성능를 내며, 이보다 높거나 낮은 값은 성능 저하를 초래함을 확인하였다.
  • 어텐션 맵의 시각화 결과 각 헤드가 이미지 및 텍스트에서 서로 다른 의미론적 부분에 집중하는 것을 확인하여 효과적인 교차 모달 정렬을 검증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.