Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Clothing and Pose Invariant 3D Shape Representation for Long-Term Person Re-Identification

Feng Liu, Minchul Kim|arXiv (Cornell University)|2023. 08. 21.
Video Surveillance and Tracking MethodsComputer Science인용 수 3
한 줄 요약

이 논문은 3D 옷 입은 인간 표현에서 자세, 옷 형태 및 질감과 같은 신원 외 요소를 분리하여 장기적 인물 재식별(LT-ReID)을 위한 새로운 방법 3DInvarReID를 제안한다. 이는 양면 음성 신경망 표현을 통한 공동 2단계 암묵적 신경망 표현을 사용한다. 자기지도 기반 이미지 복원 및 신원 손실을 통해 정확한 3D 옷 입은 신체를 동시에 복원하고, 분류 가능한 벗은 신체 형태 특징을 학습함으로써, 실제 세계 데이터셋 CCDA에서 LT-ReID 분야에서 최고 성능을 기록하며 36.3%의 Rank-1 정확도를 달성한다.

ABSTRACT

Long-Term Person Re-Identification (LT-ReID) has become increasingly crucial in computer vision and biometrics. In this work, we aim to extend LT-ReID beyond pedestrian recognition to include a wider range of real-world human activities while still accounting for cloth-changing scenarios over large time gaps. This setting poses additional challenges due to the geometric misalignment and appearance ambiguity caused by the diversity of human pose and clothing. To address these challenges, we propose a new approach 3DInvarReID for (i) disentangling identity from non-identity components (pose, clothing shape, and texture) of 3D clothed humans, and (ii) reconstructing accurate 3D clothed body shapes and learning discriminative features of naked body shapes for person ReID in a joint manner. To better evaluate our study of LT-ReID, we collect a real-world dataset called CCDA, which contains a wide variety of human activities and clothing changes. Experimentally, we show the superior performance of our approach for person ReID.

연구 동기 및 목표

  • 장기간의 시간 간격 동안 의류 및 자세 변화가 심한 상황에서 장기적 인물 재식별(LT-ReID) 문제를 해결하기 위해.
  • 공동 3D 표현 및 피팅 프레임워크를 사용하여 3D 옷 입은 인간 신체를 모델링함으로써, 신원(벗은 신체 형태)을 비신원 성분(자세, 옷 형태, 질감)에서 분리하기 위해.
  • 쌍방향 3D 스캔이나 옷에 대한 애너테이션 없이, 오직 신원 레이블만 있는 2D 이미지를 활용하는 자기지도 학습 방법을 개발하기 위해.
  • 다양한 인간 활동과 옷 변화 상황을 고려하여 LT-ReID 평가를 위한 새로운 실생활 데이터셋 CCDA를 수집하고 공개하기 위해.
  • 공동 3D 복원 및 신원 인식을 통해 의류 및 자세에 강인한 3D 형태 특징을 학습함으로써 LT-ReID 성능을 향상시키기 위해.

제안 방법

  • 이 방법은 3D 옷 입은 인간 신체를 모델링하기 위해 양면 음성 신경망 표현을 사용하며, 신원, 옷 형태, 질감이 별도의 잠재 코드로 분리된다.
  • 가능한 신경 렌더러를 사용해 3D 암묵적 표현에서 2D 이미지를 합성함으로써, 이미지 복원 손실을 통한 자기지도 학습이 가능해진다.
  • 오직 2D 이미지와 신원 레이블만을 사용하여 이미지 복원 손실과 신원 분류 손실의 조합을 통해 엔드 투 엔드로 모델을 훈련시킨다.
  • 분리 모듈은 신원 코드가 오직 벗은 신체 형태만 캡처하도록 보장하며, 자세 및 옷 성분은 별도의 잠재 공간에 고립된다.
  • 모호한 분리 과정을 안정화시키기 위해 사전 훈련 단계를 포함하며, 이는 특징 품질 향상과 수렴성 향상에 기여한다.
  • 3D 신체 형태는 캐논리컬 공간에서 복원되며, 복원 정확도는 HBW 벤치마크에서 Chamfer 거리(CD-L2)로 평가된다.
Figure 1: Illustration of the differences between various person re-identification (ReID) settings. Both (a) conventional/short-term and (b) cloth-changing person ReID benchmarks often restrict subjects to walking or standing, limiting their applications in real-world scenarios. This paper expands o
Figure 1: Illustration of the differences between various person re-identification (ReID) settings. Both (a) conventional/short-term and (b) cloth-changing person ReID benchmarks often restrict subjects to walking or standing, limiting their applications in real-world scenarios. This paper expands o

실험 결과

연구 질문

  • RQ1공동 3D 암묵적 표현이 2D 이미지에서 신원(벗은 신체 형태)을 비신원 성분(자세, 옷 형태, 질감)에서 효과적으로 분리할 수 있는가?
  • RQ23D 형태 사전 지식과 자기지도 기반 3D 복원을 통합할 경우, 의류 및 자세 변화 상황에서 장기적 인물 재식별 성능이 어떻게 향상되는가?
  • RQ33D 옷 형태 및 질감을 모델링할 경우, LT-ReID에서 신원 특징의 분류 능력이 얼마나 향상되는가?
  • RQ4실생활의 다양한 활동 상황에서 기존 2D 및 3D ReID 기준 모델 대비 제안된 방법의 효과성은 어떠한가?
  • RQ5사전 훈련 및 공동 3D 복원이 분리 및 인식 성능에 기여하는 정도는 어느 정도인가?

주요 결과

  • 제안된 3DInvarReID 방법은 CCDA 데이터셋에서 36.3%의 Rank-1 정확도를 기록하며, 아블레이트드 모델 및 최신 기준 모델을 크게 앞서간다.
  • 3D 모듈을 제거할 경우 Rank-1 정확도가 28.4%로 감소하여, 3D 형태 모델링이 LT-ReID에서 핵심적인 역할을 함을 입증한다.
  • 3D 옷 모델링을 생략할 경우 성능은 32.1% Rank-1로 떨어지며, 옷 형태 및 질감을 모델링함으로써 신원 특징의 분류 능력 향상이 이루어짐을 보여준다.
  • 사전 훈련은 Rank-1 정확도를 7.0%포인트 향상시켜(29.3%에서 36.3%로), 분리 과정의 안정화에 중요한 역할을 함을 확인한다.
  • HBW 벤치마크에서 3D 벗은 신체 복원의 CD-L2는 0.610을 기록하며, LVD(0.654)와 SHAPY(0.632)를 모두 앞서나간다.
  • 정성적 결과에서는 3DInvarReID가 LVD 및 SHAPY보다 더 정확한 3D 벗은 신체 형태를 생성하며, ICON 및 ClothWild와 유사한 수준의 옷 입은 신체 복원 성능도 확보한다.
Figure 2: Overview of the proposed joint learning framework for long-term person re-identification and $3$ D clothed body shape reconstruction. During the inference of ReID, the identity shape feature $\mathbf{z}_{id}$ is utilized for matching.
Figure 2: Overview of the proposed joint learning framework for long-term person re-identification and $3$ D clothed body shape reconstruction. During the inference of ReID, the identity shape feature $\mathbf{z}_{id}$ is utilized for matching.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.