Skip to main content
QUICK REVIEW

[논문 리뷰] Improved Mutual Mean-Teaching for Unsupervised Domain Adaptive Re-ID

Yixiao Ge, Shijie Yu|arXiv (Cornell University)|2020. 08. 24.
Domain Adaptation and Few-Shot Learning참고 문헌 28인용 수 6
한 줄 요약

이 논문은 비지도 학습(person re-identification)에서 합성 데이터와 실제 세계 데이터 간의 큰 도메인 갭을 해결하기 위해 개선된 상호 평균 교육(MMT+) 프레임워크와 구조적 도메인 적응(SDA)을 결합한 방법을 제안한다. SDA를 활용해 사전 훈련을 위해 실제와 유사한 소스-타겟 이미지를 생성하고, MMT에 도메인 간 샘플 간 관계 모델링과 MoCo 기반의 인스턴스 식별 기능을 통합함으로써, 74.78%의 mAP를 달성하여 VisDA 2020 대회에서 2위를 기록하였다.

ABSTRACT

In this technical report, we present our submission to the VisDA Challenge in ECCV 2020 and we achieved one of the top-performing results on the leaderboard. Our solution is based on Structured Domain Adaptation (SDA) and Mutual Mean-Teaching (MMT) frameworks. SDA, a domain-translation-based framework, focuses on carefully translating the source-domain images to the target domain. MMT, a pseudo-label-based framework, focuses on conducting pseudo label refinery with robust soft labels. Specifically, there are three main steps in our training pipeline. (i) We adopt SDA to generate source-to-target translated images, and (ii) such images serve as informative training samples to pre-train the network. (iii) The pre-trained network is further fine-tuned by MMT on the target domain. Note that we design an improved MMT (dubbed MMT+) to further mitigate the label noise by modeling inter-sample relations across two domains and maintaining the instance discrimination. Our proposed method achieved 74.78% accuracies in terms of mAP, ranked the 2nd place out of 153 teams.

연구 동기 및 목표

  • 비지도 도메인 적응에서 합성 데이터와 실제 세계 데이터 간의 큰 도메인 갭을 해결하기 위해.
  • 노이즈가 많은 예측을 완화함으로써 타겟 도메인의 가짜 레이블링의 정확도를 향상시키기 위해.
  • 도메인 번역 기반 및 가짜 레이블링 기반 방법을 상호보완적으로 융합하여 성능을 향상시키기 위해.
  • 도메인 간 샘플 간 관계를 모델링하고 인스턴스 식별 기능을 유지함으로써 최신 기술인 MMT 프레임워크를 개선하기 위해.
  • 합성 데이터에서 실제 데이터로의 person re-identification에 있어 VisDA 2020 벤치마크에서 최상위 성능을 달성하기 위해.

제안 방법

  • 이 방법은 세 단계로 구성된 파ipeline을 사용한다: (1) SDA를 학습하여 소스 도메인의 합성 이미지를 타겟 도메인의 실제와 유사한 이미지로 변환한다.
  • 제2단계에서는 진짜 레이블이 있는 소스-타겟 이미지를 사용하여 re-ID 네트워크를 사전 훈련한다.
  • 제3단계에서는 제안된 MMT+ 프레임워크를 사용하여 레이블이 없는 타겟 도메인에서 네트워크를 미세 조정한다. 이 단계는 소스 및 타겟 이미지를 동시에 학습한다.
  • MMT+는 도메인 간 내·외부 정체성 간 관계를 모델링하여 가짜 레이블을 개선함으로써 원래 MMT보다 향상된 성능을 달성한다.
  • 모멘텀 기반 인코더를 활용하여 MoCo 손실을 도입함으로써 인스턴스 식별 기능을 유지하고, 더 높은 안정성을 확보한다.
  • 후처리로 특징 앙상블, 카메라 유사도 모델링, 재정렬 기법을 적용하여 성능을 추가로 향상시킨다.

실험 결과

연구 질문

  • RQ1도메인 번역과 가짜 레이블링 프레임워크를 융합하면 비지도 도메인 적응에서 person re-identification 성능을 향상시킬 수 있는가?
  • RQ2도메인 간 샘플 간 관계를 모델링하면 가짜 레이블의 품질과 UDA re-ID의 mAP에 어떤 영향을 미치는가?
  • RQ3MoCo 손실을 통한 인스턴스 식별 기능 통합은 타겟 도메인 학습에서 노이즈가 많은 가짜 레이블의 영향을 어느 정도 감소시키는가?
  • RQ4SDA가 생성한 이미지로 사전 훈련을 수행하면 원본 소스 이미지 사용 대비 더 나은 일반화 성능을 달성하는가?
  • RQ5어려운 합성-실제 도메인 간 UDA 환경에서 개선된 MMT+ 프레임워크는 원래 MMT 대비 얼마나 더 높은 성능을 보이는가?

주요 결과

  • 제안된 방법은 VisDA 2020 대회에서 153개 팀 중 2위를 기록하며 74.78%의 mAP를 달성하였다.
  • SDA가 생성한 이미지로 사전 훈련을 수행함으로써 mAP가 원본 소스 이미지 사용 시 61.0%에서 71.2%로 향상되었으며, 도메인 번역의 효과를 입증하였다.
  • 개선된 MMT+ 프레임워크는 검증 세트에서 81.2%의 mAP를 기록하여 원래 MMT(78.4% mAP) 대비 2.6% 향상되었다.
  • 다양한 백본 중에서 DenseNet169-IBN은 MMT+에서 검증 세트에서 최고의 mAP 84.1%를 기록하였다.
  • 여러 백본(ResNeSt50, ResNeSt101, DenseNet169-IBN, ResNeXt101-IBN)을 앙상블하여 검증 세트에서 mAP를 86.3%까지 상향 조정하였다.
  • 절단 분석 결과, SDA 기반 사전 훈련과 MMT+ 미세 조정이 모두 최고 성능 달성에 필수적임을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.