[논문 리뷰] Adversarial Style Mining for One-Shot Unsupervised Domain Adaptation
본 논문은 Adversarial Style Mining (ASM)을 제시합니다. 이는 Random AdaIN 스타일 생성기와 태스크 모델을 결합한 엔드투엔드 프레임워크로, 태스크 모델의 피드백에 의해 점진적으로 더 어려운 타깃 유사 스타일을 탐색하도록 하여 한 샷 비지도 도메인 적응(OSUDA)을 수행합니다.
We aim at the problem named One-Shot Unsupervised Domain Adaptation. Unlike traditional Unsupervised Domain Adaptation, it assumes that only one unlabeled target sample can be available when learning to adapt. This setting is realistic but more challenging, in which conventional adaptation approaches are prone to failure due to the scarce of unlabeled target data. To this end, we propose a novel Adversarial Style Mining approach, which combines the style transfer module and task-specific module into an adversarial manner. Specifically, the style transfer module iteratively searches for harder stylized images around the one-shot target sample according to the current learning state, leading the task model to explore the potential styles that are difficult to solve in the almost unseen target domain, thus boosting the adaptation performance in a data-scarce scenario. The adversarial learning framework makes the style transfer module and task-specific module benefit each other during the competition. Extensive experiments on both cross-domain classification and segmentation benchmarks verify that ASM achieves state-of-the-art adaptation performance under the challenging one-shot setting.
연구 동기 및 목표
- 학습 중에 단 하나의 라벨이 없는 타깃 샘플만 사용할 수 있는 OSUDA 문제를 해결한다.
- 모델이 한 샷 샘플을 넘어 타깃 도메인 스타일을 탐색하도록 하여 일반화 성능을 향상시킨다.
- 스타일 생성과 태스크 성능을 함께 최적화하는 미분 가능하고 적대적 프레임워크를 제안한다.
- ASM 내에서 미분 가능 스타일 검색을 가능하게 하는 novel Random AdaIN (RAIN) 모듈을 소개한다.
- 한 샷 설정에서 최첨단 성능을 달성하기 위해 교차 도메인 분류 및 시맨틱 세분화에 대한 성능을 입증한다.
제안 방법
- ASM을 stylized 이미지 생성기 G와 태스크 특화 모델 M 사이의 엔드투엔드 적대적 루프로 형성하되, G는 앵커 타깃 스타일에 의해 구동되고 Random AdaIN (RAIN) 모듈로 보강됩니다.
- RAIN은 AdaIN을 스타일 VAE로 확장하여 스타일을 인코딩하고 샘플링하므로 스타일 생성이 미분 가능하고 엔드투엔드 학습에 적합합니다.
- 한 샷 타깃으로부터 학습된 스타일 분포에서 샘플링 벡터 ε를 뽑아 태스크 손실의 그래디언트를 기반으로 반복적으로 교란시켜 더 어려운 스타일을 마이닝합니다.
- M의 학습 손실은 스타일링된 샘플에 대한 태스크 손실과 서로 다른 스타일링 간의 의미적 안정성을 유도하는 일관성 손실을 합친 L_M = L_task + λ L_consist로 구성됩니다.
- 스타일 마이닝 절차는 앵커 스타일 주위에서 점진적으로 더 어려운 스타일링 샘플을 생성하기 위해 사전 정의된 깊이 n에 대해 ε를 반복적으로 업데이트합니다.
- 학습은 타깃 레이블이 필요 없는 스타일 앵커로서 단일 타깃 샘플과 레이블이 있는 소스 데이터를 사용합니다.
실험 결과
연구 질문
- RQ1적은 데이터(OSUDA)에서 라벨이 없는 단일 타깃 데이터를 적대적 스타일 마이닝을 통해 강건한 도메인 적응 모델 학습에 활용할 수 있는가?
- RQ2미분 가능한 스타일 생성 메커니즘(RAIN)이 끝-to-end OSUDA를 효과적으로 가능하게 하여 점진적으로 더 어렵고 관련 있는 타깃 스타일 변형을 지속적으로 제공하는가?
- RQ3ASM은 분류 및 세그먼테이션 벤치마크에서 기존 OSUDA 및 한 샷 스타일 전송 방법과 어떻게 비교되는가?
- RQ4훈련 중 mined 스타일의 안정성 특성과 스타일 분포 특성은 어떠한가?
주요 결과
- ASM은 MNIST-USPS-SVHN에서의 한 샷 교차 도메인 분류 벤치마크에서 최첨단 결과를 달성하며 여러 UDA 및 한 샷 스타일 전송 베이스라인을 능가합니다.
- 분류 작업에서 ASM은 M→S에서 46.3%, U→S에서 40.3%를 달성하여 한 샷 설정에서 경쟁 방법을 능가합니다.
- 세그먼테이션 벤치마크(SYNTHIA/GTA5 및 Cityscapes)에서 ASM은 하나의 샷 조건에서 여러 DA 방법보다 우수한 mean IoU를 보이며 일부 소수샷 벤치마크에 접근하거나 이를 능가합니다.
- 전통적(데이터 풍부) UDA에서도 경쟁력 있는 성능을 유지하고 한 샷 제약 하에서 성능 저하를 더 작게 보이며 강건한 스타일 마이닝을 시사합니다.
- M과 스타일 벡터 ε 사이의 적대적 루프가 안정적이며 L_M은 작은 값으로 수렴하고 마이닝된 스타일은 앵커 타깃 스타일 주위에 위치합니다.
- 경험적 시각화(t-SNE)는 마이닝된 스타일이 앵커 스타일 주위의 보이지 않는 관련 타깃 스타일들을 포괄한다는 것을 시사합니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.