[논문 리뷰] Learning Progressive Modality-shared Transformers for Effective Visible-Infrared Person Re-identification
이 논문은 회색조 이미지를 보조 모odal로 사용하고 점진적 학습 전략을 통해 모달 간 격차를 줄이는 새로운 프레임워크인 프로그레시브 모달리티 공유 트랜스포머(PMT)를 제안한다. 모달리티 공유 향상 손실(MSEL)과 분류 중심 손실(DCL)을 도입하여 신뢰할 수 있는 공유 특징을 향상시켜, 모든 검색 모드에서 SYSU-MM01 및 RegDB 데이터셋에서 SOTA 성능을 달성하며, Rank-1가 67.53%, mAP가 76.52%를 기록한다.
Visible-Infrared Person Re-Identification (VI-ReID) is a challenging retrieval task under complex modality changes. Existing methods usually focus on extracting discriminative visual features while ignoring the reliability and commonality of visual features between different modalities. In this paper, we propose a novel deep learning framework named Progressive Modality-shared Transformer (PMT) for effective VI-ReID. To reduce the negative effect of modality gaps, we first take the gray-scale images as an auxiliary modality and propose a progressive learning strategy. Then, we propose a Modality-Shared Enhancement Loss (MSEL) to guide the model to explore more reliable identity information from modality-shared features. Finally, to cope with the problem of large intra-class differences and small inter-class differences, we propose a Discriminative Center Loss (DCL) combined with the MSEL to further improve the discrimination of reliable features. Extensive experiments on SYSU-MM01 and RegDB datasets show that our proposed framework performs better than most state-of-the-art methods. For model reproduction, we release the source code at https://github.com/hulu88/PMT.
연구 동기 및 목표
- 가시 이미지와 적외선 이미지 간의 큰 모달 간 격차를 해결하기 위해.
- 가시 및 적외선 모달 간의 모달리티 공유 표현을 활용하여 특징의 신뢰도를 향상시키기 위해.
- 교차 모달 특징 학습에서 내부 클래스 분산을 줄이고 클래스 간 분리도를 향상시키기 위해.
- 기존 SOTA 방법보다 표준 벤치마크에서 뛰어난 성능을 내는 강건하고 일반화 능력이 뛰어난 프레임워크를 개발하기 위해.
제안 방법
- 가시 및 적외선 특징를 점진적으로 정렬하기 위해 보조 모달로 회색조 이미지를 사용하는 점진적 학습 전략을 도입한다.
- 모달 간에 공유되는 특징를 명시적으로 향상시키고 모달 특유의 노이즈를 줄이기 위해 모달리티 공유 향상 손실(MSEL)을 제안한다.
- 모달리티 공유 특징 공간에서 내부 클래스 분산을 최소화하고 클래스 간 간격을 최대화하기 위해 분류 중심 손실(DCL)을 설계한다.
- 장거리 의존성을 포착하고 공유 공간에서의 특징 표현을 향상시키기 위해 트랜스포머 기반 백본을 사용한다.
- 모달 특유의 세부 정보를 유지하면서 특징 정렬을 장려하기 위해 공유 어텐션 메커니즘을 갖춘 듀얼 스트림 아키텍처를 사용한다.
- MSEL과 DCL를 하드 트리플릿 손실과 결합하여 모달 불변성과 분류 능력을 동시에 최적화한다.
실험 결과
연구 질문
- RQ1가시-적외선 ReID에서 회색조 이미지를 보조 모달로 사용한 감독이 교차 모달 특징 정렬을 향상시킬 수 있는가?
- RQ2어떻게 하면 모달리티 공유 특징를 향상시켜 신뢰도를 높이고 모달 특유의 노이즈를 줄일 수 있는가?
- RQ3큰 외관 변화가 존재하는 상황에서 분류 중심 손실이 내부 클래스 분산을 효과적으로 줄일 수 있는가?
- RQ4제안된 점진적 학습 전략이 다양한 ReID 벤치마크에서 일반화 능력을 얼마나 향상시키는가?
주요 결과
- SYSU-MM01 데이터셋에서 PMT는 모든 검색 모드에서 67.53%의 Rank-1 및 76.52%의 mAP를 기록하며, 이는 이전 SOTA 방법보다 Rank-1에서 12% 이상, mAP에서 11% 이상 향상된 성능이다.
- RegDB 데이터셋에서 V to T 모드에서 PMT는 84.83%의 Rank-1 및 76.55%의 mAP를 기록하여 기존 최고 성능 방법보다 4% 향상된 성능을 보였다.
- RegDB의 더 도전적인 T to V 모드에서 PMT는 84.16%의 Rank-1 및 75.13%의 mAP를 기록하여 쿼리 모달의 변화에 강력한 내성성을 보였다.
- 제거 분석 결과 MSEL과 DCL 모두 성능 향상에 기여하며, MSEL은 모달리티 공유 특징 품질을 향상시키고 DCL은 내부 클래스 분산을 감소시킴을 확인했다.
- 프레임워크는 다양한 CNN 백본에서 잘 일반화되어 있어, 단일 아키텍처를 초월한 호환성과 효과성을 보였다.
- 보조 모달로 회색조 이미지를 사용함으로써 특징 정렬이 크게 향상되었으며, 특히 시점 및 조명 변화가 큰 상황에서 두드러진다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.