Skip to main content
QUICK REVIEW

[논문 리뷰] Pose-guided Feature Disentangling for Occluded Person Re-identification Based on Transformer

Tao Wang, Hong Liu|arXiv (Cornell University)|2021. 12. 04.
Human Pose and Action Recognition인용 수 16
한 줄 요약

이 논문은 인간 자세 키포인트 감독을 활용하여 가림된 영역과 가시 신체 부위를 명시적으로 분리함으로써 가림된 인체 재식별을 위한 Transformer 기반의 자세 유도 특징 분리(Pose-guided Feature Disentangling, PFD) 네트워크를 제안한다. PFA(자세 유도 특징 집합) 모듈, 디코더 내의 학습 가능한 의미적 시야, 그리고 새로운 자세 유도 푸시 손실을 갖춘 자세-시야 매칭(Pose-View Matching, PVM) 모듈을 통합함으로써 PFD는 분류 가능한 특징을 분리하고 노이즈 간섭을 줄이며, Occluded-Duke와 Market-1501을 포함한 다섯 개의 벤치마크 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Occluded person re-identification is a challenging task as human body parts could be occluded by some obstacles (e.g. trees, cars, and pedestrians) in certain scenes. Some existing pose-guided methods solve this problem by aligning body parts according to graph matching, but these graph-based methods are not intuitive and complicated. Therefore, we propose a transformer-based Pose-guided Feature Disentangling (PFD) method by utilizing pose information to clearly disentangle semantic components (e.g. human body or joint parts) and selectively match non-occluded parts correspondingly. First, Vision Transformer (ViT) is used to extract the patch features with its strong capability. Second, to preliminarily disentangle the pose information from patch information, the matching and distributing mechanism is leveraged in Pose-guided Feature Aggregation (PFA) module. Third, a set of learnable semantic views are introduced in transformer decoder to implicitly enhance the disentangled body part features. However, those semantic views are not guaranteed to be related to the body without additional supervision. Therefore, Pose-View Matching (PVM) module is proposed to explicitly match visible body parts and automatically separate occlusion features. Fourth, to better prevent the interference of occlusions, we design a Pose-guided Push Loss to emphasize the features of visible body parts. Extensive experiments over five challenging datasets for two tasks (occluded and holistic Re-ID) demonstrate that our proposed PFD is superior promising, which performs favorably against state-of-the-art methods. Code is available at https://github.com/WangTaoAs/PFD_Net

연구 동기 및 목표

  • 수목이나 보행자와 같은 장애물에 의해 신체 부위가 가려지는 상황에서의 가림된 인체 재식별 문제를 해결하기 위해.
  • 그래프 기반 자세 유도 방법의 복잡성과 노이즈 또는 유사한 외관을 가진 가림에 대한 민감성 등의 한계를 극복하기 위해.
  • 자세 감독을 활용하여 신체 부위를 가림 특징으로부터 명시적으로 분리함으로써 특징 학습을 향상시키기 위해.
  • 임베딩 공간에서 가시 및 가려진 특징을 서로 멀리 밀어내어 가림에 의한 간섭을 줄이기 위해.
  • 노이즈가 있거나 정확도가 떨어지는 자세 추정 환경에서도 강건한 성능을 유지하고, 다양한 데이터셋 간 일반화 능력을 확보하기 위해.

제안 방법

  • 강력한 표현 능력을 지닌 전역 패치 특징을 추출하기 위해 비전 트랜스포머(Vision Transformer, ViT) 인코더를 사용한다.
  • 자세 유도 특징 집합(Pose-guided Feature Aggregation, PFA) 모듈은 추정된 자세 히트맵과 패치 특징을 매칭시켜 가시 신체 부위를 초도적으로 식별한다.
  • 부분 시야 기반 트랜스포머 디코더는 학습 가능한 의미적 시야를 도입하여 암묵적으로 분리된 신체 부위 특징을 향상시킨다.
  • 자세-시야 매칭(Pose-View Matching, PVM) 모듈은 의미적 시야와 자세 유도 특징 간 가장 유사한 특징을 명시적으로 매칭시켜, 가림 영역과 인간 신체 특징을 자동으로 분리한다.
  • 가시 신체 특징과 가려진 특징 간의 유사도를 임베딩 공간에서 최소화함으로써 노이즈 간섭을 줄이기 위해 새로운 자세 유도 푸시 손실을 설계한다.
  • 전체 프레임워크는 특징 분리와 재식별 손실의 공동 최적화를 통해 엔드 투 엔드로 훈련된다.

실험 결과

연구 질문

  • RQ1자세 유도 기반의 트랜스포머 아키텍처가 자세 지도를 활용하여 가시 인간 신체 부위를 가려진 영역으로부터 효과적으로 분리할 수 있는가?
  • RQ2학습 가능한 의미적 시야와 자세 유도 특징 간의 명시적 매칭이 가림된 재식별에서 특징의 분류 능력을 향상시키는가?
  • RQ3실세계 상황에서 노이즈가 있거나 정확도가 떨어지는 자세 추정에 대해 제안된 방법이 얼마나 강건한가?
  • RQ4자세 유도 푸시 손실이 가림 관련 노이즈를 효과적으로 억제하고 특징 학습을 향상시키는가?
  • RQ5이 방법은 가림된 인체 재식별뿐만 아니라 전체 신체 재식별 벤치마크에서도 잘 일반화되는가?

주요 결과

  • PFD는 Occluded-Duke를 포함한 다섯 개의 벤치마크 데이터셋에서 최신 기술 수준 성능을 달성하였으며, 자세 추정 임계값 γ를 0으로 설정한 상태에서도 65.5%의 Rank-1 정확도를 기록하여 자세 노이즈에 대한 강건성을 입증하였다.
  • HRNet, AlphaPose, OpenPose와 같은 다양한 자세 추정 모델에 대해 높은 성능 유지를 보이며, 자세 품질의 다양성에 대한 일반화 능력을 입증하였다.
  • 제거 분석 결과, 디코더의 최적 레이어 수는 2이며, 의미적 시야 수가 17개를 초과하면 성능이 정체됨을 확인하였는데, 이는 관절 키포인트의 수와 일치하여 효과적인 특징 정렬을 의미한다.
  • PVM 모듈의 임계값 γ는 0.2일 때 가장 효과적이며, 이때 성능이 최고에 이르렀다. 너무 낮거나 너무 높은 값은 노이즈 또는 신체 부위 누락으로 인해 성능 저하를 초래한다.
  • 주의 히트맵의 시각화 결과, 학습된 의미적 시야가 정확하게 차단되지 않은 신체 영역을 국소화하고 있음을 확인하였으며, 이는 분리 메커니즘의 타당성을 검증한다.
  • 자세 유도 푸시 손실은 특히 도전적인 가림 상황에서 가시 특징과 가려진 특징 간의 유사도를 감소시켜 성능 향상에 기여함을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.