Skip to main content
QUICK REVIEW

[논문 리뷰] Safe Self-Refinement for Transformer-based Domain Adaptation

Tong Sun, Cheng Lu|arXiv (Cornell University)|2022. 04. 16.
Domain Adaptation and Few-Shot Learning인용 수 5
한 줄 요약

이 논문은 시각 트랜스포머 백본과 흐름이 있는 타겟 데이터를 이용한 안전한 자기 개선 전략을 결합한 새로운 비지도 도메인 적응 방법인 SSRT를 제안한다. 흐름이 있는 잠재 토큰의 예측에 기반한 KL 발산 정규화를 적용하고 적응형 안전 학습 메커니즘을 활용하여 일반화 성능을 향상시킨다. SSRT는 최신 기술 수준(SOTA) 성능을 달성하였으며, Office-Home에서 85.43%, VisDA-2017에서 88.76%, DomainNet에서 45.2%의 성능을 기록하였다.

ABSTRACT

Unsupervised Domain Adaptation (UDA) aims to leverage a label-rich source domain to solve tasks on a related unlabeled target domain. It is a challenging problem especially when a large domain gap lies between the source and target domains. In this paper we propose a novel solution named SSRT (Safe Self-Refinement for Transformer-based domain adaptation), which brings improvement from two aspects. First, encouraged by the success of vision transformers in various vision tasks, we arm SSRT with a transformer backbone. We find that the combination of vision transformer with simple adversarial adaptation surpasses best reported Convolutional Neural Network (CNN)-based results on the challenging DomainNet benchmark, showing its strong transferable feature representation. Second, to reduce the risk of model collapse and improve the effectiveness of knowledge transfer between domains with large gaps, we propose a Safe Self-Refinement strategy. Specifically, SSRT utilizes predictions of perturbed target domain data to refine the model. Since the model capacity of vision transformer is large and predictions in such challenging tasks can be noisy, a safe training mechanism is designed to adaptively adjust learning configuration. Extensive evaluations are conducted on several widely tested UDA benchmarks and SSRT achieves consistently the best performances, including 85.43% on Office-Home, 88.76% on VisDA-2017 and 45.2% on DomainNet.

연구 동기 및 목표

  • 원천 도메인과 타겟 도메인이 크게 다를 때 발생하는 큰 도메인 갭 문제를 해결한다.
  • 기존의 컨volution 네트워크 백본을 넘어서 이동 가능성을 향상시키기 위해 시각 트랜스포머(ViT)의 강력한 특징 표현 능력을 활용한다.
  • 특히 큰 도메인 이동으로 인해 타겟 데이터 예측이 노이즈가 많을 경우 모델 붕괴를 방지하기 위한 견고한 학습 메커니즘을 개발한다.
  • 통제적이고 적응형 방식으로 흐름이 있는 타겟 샘플의 예측을 활용해 원천 도메인에서 타겟 도메인으로 지식 이동을 향상시킨다.

제안 방법

  • 원천 도메인과 타겟 도메인 양쪽에서 강력하고 이동 가능한 특징를 추출하기 위해 시각 트랜스포머(ViT-B/16)를 백본으로 사용한다.
  • 학습 중에 타겟 도메인 데이터의 잠재 토큰 시퀀스에 무작위 오프셋 흐름을 적용하여 적대적 시각을 생성한다.
  • 원본 및 흐름이 있는 타겟 샘플 간의 예측 불일치를 최소화하기 위해 칼리브-라이블러(KL) 발산을 사용하여 강건성과 일관성을 강제한다.
  • 트랜스포머 블록 간의 다층 흐름 및 이중 방향 감독을 통해 특징 개선을 향상시킨다.
  • 예측 다양성을 타겟 데이터에서 모니터링하여 모델 붕괴를 감지하고 설정 재설정을 통해 모델 롤백을 트리거하는 안전 학습 메커니즘을 구현한다.
  • 다이나믹 다양성 측정을 사용해 학습 중 하이퍼파ram터를 적응적으로 조정함으로써 수동 조정을 피하고 과도한 과제에서의 신뢰성을 향상시킨다.

실험 결과

연구 질문

  • RQ1큰 도메인 이동 하에서 시각 트랜스포머가 전통적인 컨volution 네트워크보다 비지도 도메인 적응에서 더 우수한 성능을 내는가?
  • RQ2고용량 모델인 시각 트랜스포머를 사용할 때 노이즈가 많은 타겟 예측을 활용한 자기 학습 중 모델 붕괴를 어떻게 방지할 수 있는가?
  • RQ3KL 정규화를 사용한 흐름 기반 자기 개선 전략이 UDA에서 일반화 및 강건성을 향상시키는가?
  • RQ4적응형 동적 학습 전략은 수동 하이퍼파ram터 조정 없이 다양한 UDA 벤치마크에서 성능 향상을 이끌 수 있는가?
  • RQ5제안된 안전한 자기 개선 전략은 Mixup 및 VAT와 같은 기존의 SSL 기반 방법과 비교해 도메인 적응 환경에서 어떻게 성능을 냅니다?

주요 결과

  • SSRT는 Office-Home 벤치마크에서 85.43%의 상위-1 정확도를 달성하여 이전의 ResNet 백본을 사용한 최신 기술 수준 결과를 초월하였다.
  • VisDA-2017에서 SSRT는 88.76%의 정확도를 기록하여 도메인 이동이 크고 도전적인 대규모 벤치마크에서 강력한 일반화 능력을 보였다.
  • DomainNet에서 SSRT는 평균 45.2%의 정확도를 달성하였으며, 이는 이전 최신 기술 수준인 ResNet-101를 사용한 33.3%보다 뚜렷한 향상이다.
  • 제거 분석 결과, 안전 학습 메커니즘이 Pr→Cl 및 Cl→Pr 분할과 같은 어려운 적응 과제에서 성능 저하를 방지함을 확인하였다.
  • 22M의 파라미터를 가진 ViT-small 버전(SSRT-S)이 DomainNet에서 ResNet-101(45M 파라미터)을 사용한 MDD+SCDA보다 5.1% 높은 성능을 기록하였다.
  • 실증 분석을 통해 SSRT가 추론 중 흐름에 더 강건하며, 큰 흐름 크기(α=0.4) 조건에서도 높은 정확도를 유지함을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.