Skip to main content
QUICK REVIEW

[논문 리뷰] Pose-Guided Multi-Granularity Attention Network for Text-Based Person Search

Ya Jing, Chenyang Si|arXiv (Cornell University)|2018. 09. 22.
Video Surveillance and Tracking Methods참고 문헌 32인용 수 15
한 줄 요약

이 논문은 텍스트 기반 인물 검색을 위한 포즈 가이드드 멀티그레인룰러티브 어텐션 네트워크(PMA)를 제안한다. 이는 전반적인 텍스트-이미지 유사도를 통한 굵은 정렬과 인간의 자세를 이용한 세분화된 정렬을 통해 명사구를 특정 신체 부위에 연결한다. 제안된 방법은 포즈 인식 어텐션 메커니즘을 통해 멀티그레인룰러티브 시각-텍스트 정렬을 효과적으로 모델링하여 CUHK-PEDES 데이터셋에서 최신 기술 대비 상위 1위 정확도에서 15% 향상된 성능을 달성한다.

ABSTRACT

Text-based person search aims to retrieve the corresponding person images in an image database by virtue of a describing sentence about the person, which poses great potential for various applications such as video surveillance. Extracting visual contents corresponding to the human description is the key to this cross-modal matching problem. Moreover, correlated images and descriptions involve different granularities of semantic relevance, which is usually ignored in previous methods. To exploit the multilevel corresponding visual contents, we propose a pose-guided multi-granularity attention network (PMA). Firstly, we propose a coarse alignment network (CA) to select the related image regions to the global description by a similarity-based attention. To further capture the phrase-related visual body part, a fine-grained alignment network (FA) is proposed, which employs pose information to learn latent semantic alignment between visual body part and textual noun phrase. To verify the effectiveness of our model, we perform extensive experiments on the CUHK Person Description Dataset (CUHK-PEDES) which is currently the only available dataset for text-based person search. Experimental results show that our approach outperforms the state-of-the-art methods by 15 \% in terms of the top-1 metric.

연구 동기 및 목표

  • 텍스트 기반 인물 검색에서 교차 모odal 매칭 문제를 해결하기 위해 텍스트 기술과 시각적 특징 간의 멀티그레인룰러티브 의미 관련성을 모델링하는 것.
  • 배경 및 관련 없는 콘텐츠의 간섭을 줄이기 위해 기술에 관련된 이미지 영역에 집중함으로써 시각적 특징 선택을 향상시키는 것.
  • 인간의 자세를 감독 신호로 사용하여 텍스트의 명사구와 특정 인간 신체 부위 간의 세분화된 정렬을 향상시키는 것.
  • 균일한 프레임워크를 개발하여 굵은 정렬 및 세분화된 정렬 어텐션 메커니즘을 통합함으로써 검색 성능을 향상시키는 것.

제안 방법

  • 粗역정렬 네트워크(CA)는 유사도 기반 하드 어텐션을 사용하여 전체 텍스트 기술에 가장 관련성이 높은 이미지 영역을 선택한다.
  • 포즈 신뢰도 맵을 입력 이미지에 연결하여 전반적인 표현을 향상시키고 영역 선택을 안내한다.
  • 세분화된 정렬 네트워크(FA)는 포즈 정보를 활용하여 개별 명사구와 해당 시각적 신체 부위 간의 어텐션을 안내한다.
  • FA는 포즈 가이드드 피처 정렬과 함께 소프트 어텐션을 사용하여 문장 수준의 잠재적 의미 대응을 모델링한다.
  • 일반화 및 매칭 정확도 향상을 위해 랭킹 손실과 식별 손실을 모두 사용하여 모델을 훈련시킨다.
  • CA에서는 낮은 유사도 영역을 필터링하기 위해 하드 어텐션을 적용하고, FA에서는 더 부드러운 피처 가중치를 위해 소프트 어텐션을 사용한다.

실험 결과

연구 질문

  • RQ1텍스트와 이미지 간의 멀티그레인룰러티브 정렬이 텍스트 기반 인물 검색 성능을 향상시키는가?
  • RQ2인간의 자세 정보를 통합할 경우 세분화된 시각-텍스트 매칭 정확도는 어떻게 향상되는가?
  • RQ3개별 단어 대신 명사구를 사용할 경우 특정 신체 부위와의 정렬이 더 나아지는가?
  • RQ4하드 어텐션은 기술에 관련된 이미지 영역을 선택할 때 소프트 어텐션보다 얼마나 더 우수한가?
  • RQ5포즈 가이드드 어텐션 메커니즘은 관련 시각적 특징의 해석 가능성과 국소화를 얼마나 향상시키는가?

주요 결과

  • 제안된 PMA 모델은 CUHK-PEDES 데이터셋에서 상위 1위 정확도 53.81%를 달성하여 최신 기술 대비 15% 상대적 향상을 보였다.
  • 粗역정렬 네트워크(CA)는 양성 이미지-기본 쌍에 대해 약 6개의 관련 영역을 선택하고, 음성 쌍에 대해서는 최대 20개의 영역을 선택하여 관련 없는 콘텐츠를 효과적으로 필터링하는 것으로 나타났다.
  • 제거 실험 결과, 포즈 정보를 제거하면 상위 1위 정확도가 52.54%로 떨어지며, 이는 포즈 정보가 세분화된 정렬에서 핵심적인 역할을 한다는 것을 확인한다.
  • 명사구 가이드를 제거하면 상위 1위 정확도가 52.71%로 떨어지며, 이는 문장 수준의 의미 정보가 단어 수준의 특징보다 더 유용하다는 것을 시사한다.
  • CA에서 하드 어텐션을 사용한 모델이 소프트 어텐션보다 성능이 뛰어나, 낮은 유사도 영역을 필터링함으로써 매칭의 강건성이 향상됨을 입증한다.
  • 정성적 시각화 결과, 모델이 관련 신체 부위(예: '테니스 신발'에 대해 발)와 해당 텍스트 문장을 주의 집중하는 것으로 확인되어, 모델의 해석 가능성과 투명성을 높였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.