Skip to main content
QUICK REVIEW

[논문 리뷰] Transformer-Based Source-Free Domain Adaptation

Guanglei Yang, Hao Tang|arXiv (Cornell University)|2021. 05. 28.
Domain Adaptation and Few-Shot Learning참고 문헌 70인용 수 21
한 줄 요약

이 논문은 원천 데이터 없이도 일반화 능력을 향상시키기 위해 객체 영역에 주의를 기울이도록 유도하는 Transformer 기반 프레임워크인 TransDA를 제안한다. 컨볼루션 기반 백본에 Transformer 모듈을 통합하고, 가짜 레이블을 사용한 자기지도 학습 기반 지식 정복을 통해 주의 집중을 향상시킴으로써 TransDA는 닫힘 집합, 부분 집합, 열린 집합 적응 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

In this paper, we study the task of source-free domain adaptation (SFDA), where the source data are not available during target adaptation. Previous works on SFDA mainly focus on aligning the cross-domain distributions. However, they ignore the generalization ability of the pretrained source model, which largely influences the initial target outputs that are vital to the target adaptation stage. To address this, we make the interesting observation that the model accuracy is highly correlated with whether or not attention is focused on the objects in an image. To this end, we propose a generic and effective framework based on Transformer, named TransDA, for learning a generalized model for SFDA. Specifically, we apply the Transformer as the attention module and inject it into a convolutional network. By doing so, the model is encouraged to turn attention towards the object regions, which can effectively improve the model's generalization ability on the target domains. Moreover, a novel self-supervised knowledge distillation approach is proposed to adapt the Transformer with target pseudo-labels, thus further encouraging the network to focus on the object regions. Experiments on three domain adaptation tasks, including closed-set, partial-set, and open-set adaption, demonstrate that TransDA can greatly improve the adaptation accuracy and produce state-of-the-art results. The source code and trained models are available at https://github.com/ygjwd12345/TransDA.

연구 동기 및 목표

  • 사전 학습된 원천 모델의 일반화 능력을 간과하는 기존 원천 없는 도메인 적응(SFDA) 방법의 한계를 해결한다.
  • SFDA에서 객체 영역에 대한 주의 집중과 모델 정확도 간의 상관관계를 조사한다.
  • 원천 데이터를 요구하지 않고도 타겟 도메인에서의 모델 일반화 능력을 향상시키기 위해 주의 메커니즘을 강화한다.
  • 타겟 가짜 레이블을 기반으로 한 자기지도 학습 기반 지식 정복 전략을 개발하여 주의 집중을 정교화한다.
  • 닫힘 집합, 부분 집합, 열린 집합 적응과 같은 다양한 SFDA 설정에서의 효과성을 입증한다.

제안 방법

  • ResNet-50 백본의 최종 컨볼루션 레이어 뒤에 비전 트랜스포머 모듈을 통합하여 장거리 의존성을 모델링하고 객체 영역에 대한 주의를 유도한다.
  • Grad-CAM 시각화를 통해 타겟 도메인에서 객체에 대한 주의 집중이 높은 예측 정확도와 실제로 상관관계가 있음을 경험적으로 검증한다.
  • 타겟 가짜 레이블을 사용한 자기지도 학습 기반 지식 정복을 적용하여 주의 집중을 추가로 정교화하며, 학생 모델이 자신의 예측에서 학습한다.
  • 지식 정복의 안정성을 높이기 위해 지수 이동 평균(EMA)을 사용한 티처-학생 학습 전략을 도입하지만, 분석 결과 주요 성과 향상 요인은 지식 정복이지 티처 모델이 아님을 확인한다.
  • 가짜 레이블에 대한 교차 엔트로피 손실과 지식 정복 손실을 동시에 사용하여 특징을 정렬하고 주의 집중을 향상시키기 위해 엔드 투 엔드로 모델을 훈련한다.
  • 닫힘 집합, 부분 집합, 열린 집합 설정에서의 SFDA 벤치마크인 Office-31, Office-Home, VisDA에서 방법을 평가한다.

실험 결과

연구 질문

  • RQ1원천 없는 도메인 적응에서 객체 영역에 대한 주의 집중은 모델 정확도에 어떤 영향을 미치는가?
  • RQ2CNN 백본에 트랜스포머 모듈을 통합하면 예측 불가능한 타겟 도메인에서의 일반화 능력 향상에 기여하는가?
  • RQ3가짜 레이블을 사용한 자기지도 학습 기반 지식 정복은 주의 집중과 적응 성능을 추가로 향상시키는가?
  • RQ4제안된 방법은 다양한 도메인 이동 설정에서 최신 기술 수준의 SFDA 접근법과 비교해 어떻게 성능을 내는가?
  • RQ5성능 향상 요인이 더 나은 주의 집중 때문인지, 아니면 단지 지식 정복 메커니즘 때문인지?

주요 결과

  • TransDA는 세 가지 SFDA 벤치마크에서 최신 기술 수준 성능을 달성한다: Office-Home에서 닫힘 집합 설정에서 79.3%의 정확도를 기록했으며, 이는 이전 SOTA의 71.8%에서 향상된 것이다.
  • VisDA 데이터셋에서 TransDA는 열린 집합 설정에서 정확도를 81.9%에서 87.6%로 향상시켜 강력한 일반화 능력을 입증한다.
  • 절단 분석 결과, 트랜스포머 모듈을 추가함으로써 Office-Home에서 정확도가 72.1%에서 78.8%로 향상됨을 확인하여 일관된 성과 향상을 입증한다.
  • 자기 지식 정복은 성능 향상에 추가 기여하여 Office-Home에서 정확도를 78.8%에서 79.3%로 끌어올렸으며, 이는 그 효과성을 확인한다.
  • Grad-CAM 시각화 결과, TransDA는 기준 모델 대비 객체 영역에 대한 주의 집중을 크게 증가시킴을 보여준다.
  • t-SNE 시각화 결과, 클래스 내 특징들이 더 컴팩트해지고, 원천과 타겟 도메인 간의 도메인 갭이 감소함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.