Skip to main content
QUICK REVIEW

[논문 리뷰] On Target Shift in Adversarial Domain Adaptation

Yitong Li, Michael Murias|PubMed|2019. 03. 15.
Domain Adaptation and Few-Shot Learning참고 문헌 1인용 수 7
한 줄 요약

이 논문은 도메인 적대적 네트워크인 DATS를 제안하며, 표본 분포 매칭을 통해 타겟 도메인의 레이블 비율을 추정하고, 소스 도메인을 타겟 도메인과의 유사도에 따라 가중치를 부여하여 레이블 분포의 변화가 큰 상황에서도 일반화 성능을 향상시킨다. 이 방법은 합성 및 실제 EEG/LFP 데이터셋에서 DANN과 MDANs를 능가하는 유의미한 정확도 향상을 보이며, 레이블 분포 변화가 큰 상황에서도 성능을 유지한다.

ABSTRACT

Discrepancy between training and testing domains is a fundamental problem in the generalization of machine learning techniques. Recently, several approaches have been proposed to learn domain invariant feature representations through adversarial deep learning. However, label shift, where the percentage of data in each class is different between domains, has received less attention. Label shift naturally arises in many contexts, especially in behavioral studies where the behaviors are freely chosen. In this work, we propose a method called Domain Adversarial nets for Target Shift (DATS) to address label shift while learning a domain invariant representation. This is accomplished by using distribution matching to estimate label proportions in a blind test set. We extend this framework to handle multiple domains by developing a scheme to upweight source domains most similar to the target domain. Empirical results show that this framework performs well under large label shift in synthetic and real experiments, demonstrating the practical importance.

연구 동기 및 목표

  • 소스 도메인과 타겟 도메인 간 클래스 레이블 비율이 다를 때 발생하는 타겟 분포 변화 문제를 해결하고자 한다. 이는 일반적으로 적대적 도메인 적응에서 간과되는 문제이다.
  • 표본 분포 매칭을 통해 추정된 레이블 비율을 고려하여, 레이블 비율을 알 수 없는 타겟 도메인의 레이블 비율을 추정하는 방법을 개발하고자 한다.
  • 소스 도메인을 타겟 도메인과의 유사도에 따라 가중치를 매김으로써 다중 소스 도메인 적응의 성능을 향상시키고, 관련성이 없는 소스 도메인으로 인한 성능 저하를 방지하고자 한다.
  • 레이블 비율 추정과 도메인 가중치 부여를 하나의 종단 간 훈련 가능한 프레임워크로 통합하고자 한다.
  • 특히 EEG 및 LFP 기록과 같은 실제 생물의학 데이터셋에서 레이블 분포 변화가 큰 상황에서도 강건한 성능을 보여주고자 한다.

제안 방법

  • 공유된 특징 추출기로 도메인 불변 표현을 학습하며, 도메인 구분기법을 적대적으로 훈련시켜 도메인 혼동을 유도한다.
  • 소스와 타겟 특징 간의 마진 분포 간격을 최소화하기 위해 레이블 비율 추정기 모듈을 도입한다.
  • 타겟 도메인의 레이블 비율은 평균 매칭 및 분포 매칭을 통해 추정되며, 예측된 레이블 분포와 추정된 레이블 분포를 일치시키는 손실 항목을 사용한다.
  • 특징 수준의 유사도를 기반으로, 타겟 도메인과 가장 유사한 소스 도메인에 대해 더 높은 중요도를 가중치 벡터가 할당하여 관련성이 없는 도메인을 억제한다.
  • 특징 추출, 도메인 불변성, 레이블 예측, 레이블 비율 추정을 동시에 최적화하는 방식으로 반복적으로 종단 간 훈련을 수행한다.
  • 다중 소스 환경에 맞게 도메인 관련성 가중치 부여 기법을 통합하여 동적으로 가장 정보가 많은 소스 도메인을 선택하는 프레임워크로 확장한다.

실험 결과

연구 질문

  • RQ1타겟 도메인이 소스 도메인과 상당히 다른 클래스 분포를 가질 경우, 레이블 비율 추정이 도메인 적응 성능 향상에 기여할 수 있는가?
  • RQ2다중 소스 도메인 적응에서 타겟 도메인과의 관련성을 기반으로 소스 도메인을 어떻게 가중치를 매겨 일반화 성능을 향상시킬 수 있는가?
  • RQ3레이블 비율의 분포 매칭이 단순한 평균 매칭보다 타겟 도메인 클래스 분포 추정에 더 우수한 성능을 보일 수 있는가?
  • RQ4통합된 프레임워크를 통해 레이블 비율 추정과 소스 도메인 가중치 부여를 동시에 수행함으로써 관련성이 없거나 노이즈가 많은 소스 데이터의 악영향을 줄일 수 있는가?
  • RQ5실제 생물의학 데이터셋에서 소수의 불균형한 도메인을 가진 상황에서 레이블 분포 변화가 큰 상황에서도 제안된 방법이 어떻게 성능을 유지하는가?

주요 결과

  • DATS는 타겟 분포 변화가 큰 상황에서 모든 디지털 이미지 분류 작업에서 DANN과 MDANs를 능가하며, ASD EEG 데이터셋에서 67.2%의 정확도를 기록하여 DANN의 63.8%를 상회한다.
  • LFP 데이터셋에서는 DATS가 77.2%의 정확도를 기록하여 DANN(75.1%)과 MDANs(71.4%)를 모두 능가하며, 레이블 분포 변화가 큰 상황에서도 강건함을 입증한다.
  • 평균 매칭 전략만으로도 기존 기반 모델 대비 성능 향상을 보였으며, 분포 매칭은 소량이지만 일관된 성능 향상을 제공한다.
  • 소스 도메인 수가 21개(ASD) 및 28개(LFP)로 증가하는 상황에서도 모델이 높은 성능을 유지하며, 다중 소스 설정에서 흔히 발생하는 과적합을 방지한다.
  • 최소한의 하이퍼파rameter 튜닝으로도 효과적인 성능를 보이며, 다양한 레이블 비율을 가진 실제 응용 분야에서 강력한 실용성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.