[논문 리뷰] Discovering Underlying Person Structure Pattern with Relative Local Distance for Person Re-identification
이 논문은 자세 애너테이션을 필요로 하지 않고 사람 재식별에서 잠재적인 사람 구조를 모델링하는 새로운 엔드 투 엔드 방법인 상대 국소 거리(RLD)를 제안한다. 특징 맵에서 상대 국소 거리 행렬을 계산하고 이를 정규화 요소로 사용함으로써, RLD는 구조 인식 능력을 갖춘 글로벌 특징 학습을 향상시켜 마켓-1501, CUHK03, DukeMTMC-reID에서 최신 기술 수준의 성능을 달성하며 더 빠른 훈련을 실현한다.
Modeling the underlying person structure for person re-identification (re-ID) is difficult due to diverse deformable poses, changeable camera views and imperfect person detectors. How to exploit underlying person structure information without extra annotations to improve the performance of person re-ID remains largely unexplored. To address this problem, we propose a novel Relative Local Distance (RLD) method that integrates a relative local distance constraint into convolutional neural networks (CNNs) in an end-to-end way. It is the first time that the relative local constraint is proposed to guide the global feature representation learning. Specially, a relative local distance matrix is computed by using feature maps and then regarded as a regularizer to guide CNNs to learn a structure-aware feature representation. With the discovered underlying person structure, the RLD method builds a bridge between the global and local feature representation and thus improves the capacity of feature representation for person re-ID. Furthermore, RLD also significantly accelerates deep network training compared with conventional methods. The experimental results show the effectiveness of RLD on the CUHK03, Market-1501, and DukeMTMC-reID datasets. Code is available at \url{https://github.com/Wanggcong/RLD_codes}.
연구 동기 및 목표
- 큰 자세 변화와 시야 변화가 있는 상황에서 비용이 많이 드는 자세 애너테이션에 의존하지 않고 사람 재식별에서 사람의 구조를 모델링하는 데 도전하는 것.
- 딥 네트워크에 구조적 인덕티브 바이어스를 통합하여 사람 재식별에서 특징 표현을 향상시키는 방법을 개발하는 것.
- 기존 방법과 비교해 성능을 유지하거나 향상시키면서 딥 네트워크의 훈련 속도를 빠르게 하는 것.
- 사람 이미지 내의 상대적 공간 관계를 학습하여 글로벌 및 로컬 특징 표현 간 격차를 해소하는 것.
제안 방법
- 컨볼루션 특징 맵의 열 기반 특징 벡터에서 계산된 상대 국소 거리(RLD) 행렬을 도입하여 구조적 관계를 캡처한다.
- 엔드 투 엔드 훈련 체계에서 RLD 행렬을 정규화 요소로 사용하여 네트워크가 구조 인식 글로벌 특징을 학습하도록 이끈다.
- 표준 분류 네트워크에 상대 국소 거리 제약을 학습하는 작은 보조 브랜치를 추가한다.
- 개인 식별 손실과 구조 인식 손실을 공동 최적화하여 특징의 구분 능력을 향상시킨다.
- 메인 네트워크 이후 글로벌 평균 풀링을 적용한 후 분류 및 구조 학습을 위한 완전 연결 층을 사용한다.
- 패치 매칭 방법에서 흔히 볼 수 있는 반복적 또는 비미분 가능한 연산의 필요성을 줄여 더 빠른 훈련을 가능하게 한다.
실험 결과
연구 질문
- RQ1자세 애너테이션을 추가로 사용하지 않고도 사람 재식별에서 잠재적인 사람 구조를 모델링할 수 있는가?
- RQ2이미지 패치 간의 상대 국소 거리를 어떻게 활용하여 딥 네트워크의 글로벌 특징 표현을 향상시킬 수 있는가?
- RQ3미분 가능하고 엔드 투 엔드로 학습 가능한 구조 정규화 요소가 사람 재식별에서 정확도와 훈련 속도를 모두 향상시킬 수 있는가?
- RQ4신체 부위 간의 상대적 공간 관계를 학습하면 자세 및 시점 변화에 대한 일반화 능력이 향상되는가?
주요 결과
- RLD는 마켓-1501에서 순위-1 88.4%와 mAP 71.3%를 기록하며, 부품 애너테이션 없이도 최신 기술 수준의 방법들을 능가한다.
- Era 재랭킹 전략을 추가한 RLD+Era는 마켓-1501에서 순위-1 90.2%와 mAP 76.1%를 달성하여 최신 기술 수준의 성능을 초월한다.
- CUHK03에서 RLD는 순위-1 52.5%와 mAP 48.5%를 기록하며, SVDNet 및 PAN과 같은 이전 방법들보다 뚜렷이 뛰어난 성능을 보였다.
- DukeMTMC-reID에서 RLD는 순위-1 77.7%와 mAP 59.7%를 기록하여 다양한 데이터셋 간 강력한 일반화 능력을 입증했다.
- 패치 매칭 기반 방법과 비교해 상대 거리의 단일 이미지 계산이 가능하고, 이는 훈련 시간을 단축시킨다.
- 메가톤 기능 없이도 효과적이며, 최소한의 아키텍처 수정으로도 경쟁 가능한 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.