[논문 리뷰] 1st Place Solution to VisDA-2020: Bias Elimination for Domain Adaptive Pedestrian Re-identification
이 논문은 보행자 재식별을 위한 이중 단계 도메인 적응 프레임워크를 제안하며, 이는 도메인 간 격차와 도메인 내 카메라 편향을 모두 해결한다. SPGAN을 통해 전이된 데이터와 CamStyle 데이터 증강을 활용하고, DBSCAN을 통한 의사 레이블링과 점진적 개선을 결합한 이중 도메인 훈련 전략을 통해, VisDA-2020 테스트 세트에서 76.56% mAP와 84.25% rank-1을 달성하여 모든 경쟁자들을 앞서며 최고의 성능을 기록한다.
This paper presents our proposed methods for domain adaptive pedestrian re-identification (Re-ID) task in Visual Domain Adaptation Challenge (VisDA-2020). Considering the large gap between the source domain and target domain, we focused on solving two biases that influenced the performance on domain adaptive pedestrian Re-ID and proposed a two-stage training procedure. At the first stage, a baseline model is trained with images transferred from source domain to target domain and from single camera to multiple camera styles. Then we introduced a domain adaptation framework to train the model on source data and target data simultaneously. Different pseudo label generation strategies are adopted to continuously improve the discriminative ability of the model. Finally, with multiple models ensembled and additional post processing approaches adopted, our methods achieve 76.56% mAP and 84.25% rank-1 on the test set. Codes are available at https://github.com/vimar-gu/Bias-Eliminate-DA-ReID
연구 동기 및 목표
- 보행자 재식별에서 합성 소스 도메인과 실제 세계 타겟 도메인 간 큰 도메인 격차를 해결하기 위해.
- 카메라 시점, 조명, 해상도, 가림 등의 변화로 인한 도메인 내 편향을 완화하기 위해.
- 데이터 증강 및 도메인 적응을 통해 도메인 이동 상황에서의 모델 일반화 능력과 분류 능력을 향상시키기 위해.
- 도메인 적응 보행자 재식별 분야에서 최신 기준 성능을 달성하기 위해.
제안 방법
- 합성 소스 이미지를 실제 타겟 도메인 이미지의 외관과 유사하게 만들기 위해 SPGAN을 활용하여 도메인 간 격차를 감소시킨다.
- StarGAN 기반의 데이터 증강을 적용하여 다양한 카메라 스타일의 이미지(CamStyle)를 생성함으로써 카메라 특성에 의한 변동성에 대한 내성 강화를 도모한다.
- 공통 백본과 도메인 전용 분류기를 갖춘 이중 단계 도메인 적응 프레임워크를 도입하여 소스 도메인과 타겟 도메인을 동시에 훈련한다.
- DBSCAN 클러스터링을 통해 타겟 도메인 데이터의 의사 레이블을 생성하고, 두 번째 단계에서 높은 신뢰도와 낮은 샘플 수를 가진 클래스를 추가하여 점진적 개선을 수행한다.
- 이중 단계 의사 레이블링 전략을 적용한다: 첫 번째 단계에서는 샘플 수 기준 상위 500개 클래스를 선별하고, 두 번째 단계에서는 추가로 200개의 단일 샘플 클래스를 추가하여 분류 능력 향상을 도모한다.
- 다양한 백본(ResNet50-ibn-a, ResNet101-ibn-a, HRNetv2-w18) 간 모델 앙상블을 통합하고, 가중치 거리 행렬 융합을 통한 후처리를 적용하여 최종 성능을 향상시킨다.
실험 결과
연구 질문
- RQ1보행자 재식별에서 합성 소스 도메인과 실제 세계 타겟 도메인 간 도메인 격차를 어떻게 효과적으로 줄일 수 있는가?
- RQ2감시 카메라 간의 카메라 스타일 변화가 모델 일반화 능력을 얼마나 떨어뜨리며, 이를 어떻게 완화할 수 있는가?
- RQ3DBSCAN 기반 점진적 의사 레이블링 전략은 비지도 도메인 적응에서 재식별 성능 향상에 기여하는가?
- RQ4도메인 격차 감소에 있어 데이터 증강(SPGAN 및 CamStyle)과 도메인 적응의 기여도는 각각 어느 정도인가?
- RQ5모델 앙상블과 후처리는 VisDA-2020 벤치마크에서 최종 재식별 성능 향상에 어떻게 기여하는가?
주요 결과
- 제안된 방법은 VisDA-2020 테스트 세트에서 76.56% mAP와 84.25% rank-1의 성능을 기록하여 대회에서 1등을 차지했다.
- 제거 분석 결과, CamStyle 데이터를 추가함으로써 mAP가 SPGAN만 사용했을 때의 24.7%에서 30.7%로 상승하여 카메라 편향 완화의 중요성을 입증했다.
- 이중 단계 의사 레이블링을 통한 도메인 적응은 mAP를 44.9%에서 48.6%로 상승시켜 점진적 개선 전략의 효과를 입증했다.
- 가중치 거리 행렬 융합을 통한 후처리로 인해 기준 단일 모델 대비 mAP가 22.3个百分点 상승했다.
- 다양한 백본과 이미지 크기 간 모델 앙상블로 인해 최고의 단일 모델 대비 mAP가 5.5个百分点 이상 향상되었다.
- 최종 모델은 모든 경쟁자 중에서 가장 높은 rank-1 정확도(84.25%)를 기록하여 프레임워크의 강건성을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.