Skip to main content
QUICK REVIEW

[논문 리뷰] Enhancing the Discriminative Feature Learning for Visible-Thermal Cross-Modality Person Re-Identification

Haijun Liu, Jian Cheng|arXiv (Cornell University)|2019. 07. 23.
Video Surveillance and Tracking Methods참고 문헌 30인용 수 10
한 줄 요약

이 논문은 스위치 연결을 통한 중위수 특징 통합과 이중 모odal 트리플릿 손실을 사용하여 가시-열화상 인체 재식별의 교차 모odal 불일치와 내부 모달 변동을 줄이는 간단하면서도 효과적인 방법인 구분성 특징 학습 향상(EDFL)을 제안한다. EDFL은 RegDB 및 SYSU-MM01 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하며, 이전 방법들보다 크게 뛰어나다.

ABSTRACT

Existing person re-identification has achieved great progress in the visible domain, capturing all the person images with visible cameras. However, in a 24-hour intelligent surveillance system, the visible cameras may be noneffective at night. In this situation, thermal cameras are the best supplemental components, which capture images without depending on visible light. Therefore, in this paper, we investigate the visible-thermal cross-modality person re-identification (VT Re-ID) problem. In VT Re-ID, there are two knotty problems should be well handled, cross-modality discrepancy and intra-modality variations. To address these two issues, we propose focusing on enhancing the discriminative feature learning (EDFL) with two extreme simple means from two core aspects, (1) skip-connection for mid-level features incorporation to improve the person features with more discriminability and robustness, and (2) dual-modality triplet loss to guide the training procedures by simultaneously considering the cross-modality discrepancy and intra-modality variations. Additionally, the two-stream CNN structure is adopted to learn the multi-modality sharable person features. The experimental results on two datasets show that our proposed EDFL approach distinctly outperforms state-of-the-art methods by large margins, demonstrating the effectiveness of our EDFL to enhance the discriminative feature learning for VT Re-ID.

연구 동기 및 목표

  • 야간에 가시 카메라가 기능을 잃는 24시간 감시 시스템에서 가시-열화상 교차 모달 인체 재식별(VT Re-ID)의 과제를 해결한다.
  • 두 가지 주요 장애요소를 극복한다: 다른 감지 모달리티로 인한 큰 교차 모달 불일치와 자세 및 시점 변화로 인한 내부 모달 변동.
  • 중위수 표현에 집중하고, 교차 모달 및 내부 모달 제약 조건을 동시에 모델링하는 새로운 학습 목표를 통해 구분성 특징 학습을 향상시킨다.
  • 간단한 아키텍처 및 손실 설계 선택(스위치 연결과 이중 모달 트리플릿 손실)이 복잡한 최신 기술 수준의 방법들보다 크게 뛰어나다는 것을 입증한다.

제안 방법

  • 공유 레이어를 갖춘 이중 스트림 CNN 아키텍처를 사용하여 모달 특징을 추출하고 공유 특징 공간에 통합함으로써 다중 모달 공유 표현 학습을 가능하게 한다.
  • 중위수 합성곱 레이어에서의 스위치 연결을 도입하여 구분성 특징를 연결하고 강화함으로써 강건성과 의미적 풍부함을 향상시킨다.
  • 이중 모달 트리플릿 손실(DMTL)을 제안하여 내부 모달 거리의 최소화와 외부 모달 마진의 최대화를 동시에 수행함으로써, 내부 모달 변동과 교차 모달 불일치를 명시적으로 모델링한다.
  • 미니배치에서 하드 트리플릿 마이닝 전략을 사용한다: 각 P개의 신원에 대해 K장의 가시 이미지와 K장의 열화상 이미지를 샘플링하여 총 배치 크기를 2PK로 구성함으로써, 하드 양성 샘플의 효과적인 마이닝을 가능하게 한다.
  • DMTL 손실을 사용하여 엔드 투 엔드 최적화로 모델을 훈련함으로써, 네트워크가 모달리티 및 자세 변화에 강인한 구분성 특징를 학습하도록 유도한다.
  • Grad-CAM를 사용하여 주의 맵을 시각화하여, 다양한 네트워크 레이어가 관련 있는 신체 부위에 집중하고 있음을 확인함으로써 중위수 특징 융합의 효과성을 검증한다.

실험 결과

연구 질문

  • RQ1스위치 연결을 통한 중위수 특징 융합이 가시-열화상 교차 모달 설정에서 인체 재식별 특징의 구분 능력을 크게 향상시킬 수 있는가?
  • RQ2동시에 내부 모달 및 교차 모달 제약 조건을 모델링하는 이중 모달 트리플릿 손실이 기존의 대비 또는 트리플릿 손실보다 더 나은 일반화 성능을 보일 수 있는가?
  • RQ3제안된 방법은 다양한 데이터셋과 쿼리 설정에서 최신 기술 수준의 방법들과 비교해 성능 및 강건성 측면에서 어떻게 비교되는가?
  • RQ4간단한 아키텍처 설계(스위치 연결)와 새로운 손실 함수(DMTL)의 조합이, 적대적 학습이나 이미지 번역 구성 요소를 갖춘 복잡한 모델들을 능가할 수 있는가?

주요 결과

  • 제안된 EDFL 방법은 RegDB 데이터셋에서 순위-1 정확도 52.58%와 mAP 52.98%를 달성하여 이전 최신 기술 수준 방법인 D2RL보다 각각 9.18점과 8.88점 높게 기록한다.
  • SYSU-MM01 데이터셋에서 EDFL은 순위-1 정확도 36.94%와 mAP 40.77%를 기록하며 D2RL을 각각 8.04점과 11.57점 뛰어넘어 일관된 우수성을 입증한다.
  • 제거 실험 결과, 중위수 특징 통합(MFI)과 이중 모달 트리플릿 손실(DMTL)이 각각 성능 향상에 기여하며, 두 요소의 조합이 가장 우수한 성능을 낸다.
  • ResNet50 기반 백본과 제안된 샘플링 전략을 갖춘 베이스라인 모델조차도 AlexNet과 K=1 샘플링을 사용하는 DCTR를 능가함을 보여주며, 백본 선택과 하드 마이닝의 중요성을 입증한다.
  • 쿼리가 가시에서 열화상으로 전환되었을 때(열화상-가시), EDFL은 RegDB에서 순위-1 정확도 51.89%와 mAP 52.13%를 기록하여 DMTL 손실의 대칭성 덕분에 양방향 일반화 능력이 뛰어나다는 것을 보여준다.
  • cmGAN과 D2RL(모두 ResNet50와 보조 작업을 사용)을 사용하되, 적대적 학습이나 이미지 번역을 전혀 사용하지 않음에도 불구하고 EDFL이 더 뛰어난 성능을 보이며, 핵심 구성 요소의 효과성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.