Skip to main content
QUICK REVIEW

[논문 리뷰] Domain-Unified Prompt Representations for Source-Free Domain Generalization

Hongjing Niu, Hanting Li|arXiv (Cornell University)|2022. 09. 29.
Domain Adaptation and Few-Shot Learning인용 수 9
한 줄 요약

이 논문은 시각-언어 모델(CLIP)에서 유도된 도메인 통합 프롬프트 표현을 사용하여 학습 중에 소스 도메인 데이터가 필요 없는 소스-free 도메인 일반화 방법을 제안한다. 다양한 텍스트 프롬프트를 대규모 도메인 백업에서 생성하고, 도메인에 관계없이 동일한 표현을 만들 수 있도록 학습 가능한 어댑터(CAE)를 적용함으로써, 표준 벤치마크에서 최고 성능을 달성하고, 소스 데이터 없이도 오픈 월드 도메인에서 기존 방법보다 뚜렷하게 뛰어난 성능을 보인다.

ABSTRACT

Domain generalization (DG), aiming to make models work on unseen domains, is a surefire way toward general artificial intelligence. Limited by the scale and diversity of current DG datasets, it is difficult for existing methods to scale to diverse domains in open-world scenarios (e.g., science fiction and pixelate style). Therefore, the source-free domain generalization (SFDG) task is necessary and challenging. To address this issue, we propose an approach based on large-scale vision-language pretraining models (e.g., CLIP), which exploits the extensive domain information embedded in it. The proposed scheme generates diverse prompts from a domain bank that contains many more diverse domains than existing DG datasets. Furthermore, our method yields domain-unified representations from these prompts, thus being able to cope with samples from open-world domains. Extensive experiments on mainstream DG datasets, namely PACS, VLCS, OfficeHome, and DomainNet, show that the proposed method achieves competitive performance compared to state-of-the-art (SOTA) DG methods that require source domain data for training. Besides, we collect a small datasets consists of two domains to evaluate the open-world domain generalization ability of the proposed method. The source code and the dataset will be made publicly available at https://github.com/muse1998/Source-Free-Domain-Generalization

연구 동기 및 목표

  • 소스 도메인 데이터가 확보되지 않은 오픈 월드 환경에서의 도메인 일반화 문제를 해결하기 위해.
  • 실제 응용에서 확보하기 어려운 대규모 소스 도메인 이미지 데이터에 대한 의존도를 줄이기 위해.
  • 희귀하거나 아티스틱 스타일(예: 픽셀화된, 기하학적 스타일 등)과 같은 새로운 도메인에도 효과적으로 일반화할 수 있는 방법을 개발하기 위해.
  • 시각-언어 모델에 내재된 풍부한 사전 도메인 지식을 활용하여 제로샷 도메인 일반화를 실현하기 위해.

제안 방법

  • PACS, VLCS, OfficeHome, DomainNet 등의 다수 기존 데이터셋에서 유래한 다양한 텍스트 프롬프트를 포함하는 도메인 백업을 구성하여 다양한 도메인을 포괄한다.
  • CLIP를 사용해 이러한 프롬프트를 텍스트 임베딩으로 인코딩함으로써 도메인 표현 학습의 기초를 마련한다.
  • 클래스에 특화된 특징을 유지하면서 도메인 특화 정보를 제거하기 위해 학습 가능한 크로스 어텐션 인코더(CAE)를 도입하여 도메인 통합 프롬프트 표현을 생성한다.
  • CAE 출력에 평균 풀링을 적용하여 각 클래스별로 하나의 도메인 불변 표현을 생성한다.
  • 도메인 통합 프롬프트 표현을 클래스 프로토타입으로 사용하여, 타겟 도메인 데이터만으로 모델을 훈련시킨다.
  • CAE 훈련 중에 대비 학습 목표를 적용하여 클래스에 특화된 클러스터링과 도메인 불변성을 유도한다.

실험 결과

연구 질문

  • RQ1소스 도메인 이미지를 사용하지 않고도 텍스트 프롬프트에서 도메인 통합 프롬프트 표현을 효과적으로 학습할 수 있는가?
  • RQ2제안된 방법은 소스 데이터가 필요한 기존 최고 성능(SOTA) 방법과 비교해 표준 도메인 일반화 벤치마크에서 어떻게 성능을 내는가?
  • RQ3학습 중에 볼 수 없었던 진정한 오픈 월드 도메인(예: 픽셀화된, 기하학적 스타일 등)에 대해 얼마나 잘 일반화되는가?
  • RQ4풍부하고 다양한 도메인 백업을 사용할 경우, 분포 외 도메인에 대한 강건성이 향상되는가?
  • RQ5CAE 모듈은 클래스 수준의 의미를 유지하면서 도메인 특화 특징을 얼마나 효과적으로 필터링하는가?

주요 결과

  • PACS 데이터셋에서 제안된 방법은 타겟 도메인 데이터만을 사용해 97.1%의 정확도를 달성했으며, DPL(사진: 94.9%, 스케치: 90.8%)와 같은 다중 소스 SOTA 방법보다 뛰어난 성능을 보였다.
  • OfficeHome에서 방법은 오픈 월드 픽셀화된 및 기하학적 스타일 도메인에서 95.1%의 정확도를 기록했으며, ERM(51.5%) 및 GroupDRO(52.2%) 기반 모델보다 뚜렷하게 높은 성능을 보였다.
  • CAE 모듈은 서로 다른 도메인에서 유도된 프롬프트 표현을 공통 중심 주변으로 클러스터링하는 데 성공하여, 효과적인 도메인 불변성 학습을 보여주었다. t-SNE 시각화 결과에서 이를 확인할 수 있었다.
  • 모든 네 가지 표준 DG 데이터셋(PACS, VLCS, OfficeHome, DomainNet)에서 최고 성능을 달성했으며, 통합 도메인 백업 설정에서 평균 정확도 73.2%를 기록했다.
  • 제거 실험을 통해 도메인 백업의 확장이 오픈 월드 도메인에서의 성능 향상에 기여하며, 더 풍부하고 다양한 프롬프트 백업이 유의미한 이점을 제공한다는 점을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.