Skip to main content
QUICK REVIEW

[논문 리뷰] PromptStyler: Prompt-driven Style Generation for Source-free Domain Generalization

Junhyeong Cho, Gilhyun Nam|arXiv (Cornell University)|2023. 07. 27.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

PromptStyler는 소스 도메인 이미지를 사용하지 않고도 합성된 시각-언어 공간에서 학습 가능한 스타일 워드 벡터를 사용해 다양한 이미지 스타일을 생성하는 프롬프트 기반 스타일 생성 방법을 제안한다. CLIP의 잠재 공간에서 스타일 다양성을 극대화하고 콘텐츠 일관성을 유지함으로써, PACS, VLCS, OfficeHome, DomainNet 벤치마크에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

In a joint vision-language space, a text feature (e.g., from "a photo of a dog") could effectively represent its relevant image features (e.g., from dog photos). Also, a recent study has demonstrated the cross-modal transferability phenomenon of this joint space. From these observations, we propose PromptStyler which simulates various distribution shifts in the joint space by synthesizing diverse styles via prompts without using any images to deal with source-free domain generalization. The proposed method learns to generate a variety of style features (from "a S* style of a") via learnable style word vectors for pseudo-words S*. To ensure that learned styles do not distort content information, we force style-content features (from "a S* style of a [class]") to be located nearby their corresponding content features (from "[class]") in the joint vision-language space. After learning style word vectors, we train a linear classifier using synthesized style-content features. PromptStyler achieves the state of the art on PACS, VLCS, OfficeHome and DomainNet, even though it does not require any images for training.

연구 동기 및 목표

  • 학습 중에 소스 도메인 데이터가 가용하지 않을 경우 도메인 일반화 문제를 해결하고자 한다.
  • 실제 이미지를 접근하지 않고도 사전 훈련된 시각-언어 모델의 잠재 공간에서 다양한 분포 이탈을 시뮬레이션하고자 한다.
  • 학습 가능한 스타일 워드 벡터를 통해 다양하고 현실적인 스타일을 생성하면서도 콘텐츠 정보를 유지하고자 한다.
  • 소스 도메인 이미지를 사용하지 않고도 텍스트 프롬프트와 사전 훈련된 특징만을 사용해 다수의 도메인 일반화 벤치마크에서 최신 기술 수준의 성능을 달성하고자 한다.

제안 방법

  • 합성된 시각-언어 공간에서 '클래스에 대한 $\boldsymbol{S_{*}}$ 스타일'와 같은 프롬프트를 통해 학습 가능한 스타일 워드 벡터 $\boldsymbol{S_{*}}$ 를 학습하여 스타일 특징을 생성한다.
  • 스타일 특징 간의 수직성을 유도함으로써 초구면 잠재 공간에서의 스타일 다양성을 극대화하기 위해 $\mathcal{L}_{\mathrm{style}}$ 를 사용한다.
  • 스타일-콘텐츠 특징가 해당 콘텐츠 특징과 가까워지도록 보장함으로써 콘텐츠 일관성을 강화하기 위해 $\mathcal{L}_{\mathrm{content}}$ 를 사용한다.
  • 콘텐츠 프롬프트에서 얻은 클래스 레이블을 사용해 합성된 스타일-콘텐츠 특징에 대해 선형 분류기를 훈련하고, 이미지 인코더를 통해 실재 이미지에 대한 추론을 가능하게 한다.
  • CLIP의 사전 훈련된 텍스트 및 이미지 인코더를 사용해 프롬프트와 이미지를 공통 임베딩 공간으로 매핑한다.
  • 실제 데이터 없이도 효과적인 도메인 이탈 시뮬레이션을 가능하게 하기 위해 스타일 다양성과 콘텐츠 일관성 손실을 모두 최적화함으로써 학습 가능한 스타일 워드 벡터를 최적화한다.
Figure 1: Motivation of our method. (a) Text features could effectively represent various image styles in a joint vision-language space. (b) PromptStyler synthesizes diverse styles in a joint vision-language space via learnable style word vectors for pseudo-words $\boldsymbol{S_{*}}$ without using a
Figure 1: Motivation of our method. (a) Text features could effectively represent various image styles in a joint vision-language space. (b) PromptStyler synthesizes diverse styles in a joint vision-language space via learnable style word vectors for pseudo-words $\boldsymbol{S_{*}}$ without using a

실험 결과

연구 질문

  • RQ1사용 가능한 소스 도메인 이미지를 전혀 사용하지 않고도 사전 훈련된 시각-언어 모델의 잠재 공간에서 도메인 이탈을 효과적으로 시뮬레이션할 수 있는가?
  • RQ2학습 가능한 워드 벡터와 텍스트 프롬프트만을 사용해 다양하면서도 콘텐츠를 유지하는 스타일을 어떻게 생성할 수 있는가?
  • RQ3프롬프트 기반 접근 방식이 소스 없는 도메인 일반화에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ4스타일 다양성과 콘텐츠 일관성은 제로샷 도메인 적응 설정에서 모델의 일반화에 어떤 영향을 미치는가?

주요 결과

  • PromptStyler는 소스 도메인 이미지를 전혀 사용하지 않고도 PACS(93.2%), VLCS(82.3%), OfficeHome(73.6%), DomainNet(49.5%)에서 최신 기술 수준의 정확도를 달성한다.
  • 모든 벤치마크에서 CLIP를 크게 앞서며, 소스 데이터를 사용하지 않았음에도 불구하고 Terra Incognita에서 30.5%의 top-1 정확도를 기록한다.
  • 단지 5개의 학습 가능한 스타일 워드 벡터만으로도 CLIP의 성능을 초월함으로써 높은 샘플 효율성을 입증한다.
  • 절단 실험 결과, $\mathcal{L}_{\mathrm{style}}$ 와 $\mathcal{L}_{\mathrm{content}}$ 모두 필수적임을 확인: 둘 중 하나를 생략하면 성능이 저하된다.
  • 단지 20개의 스타일 워드 벡터와 각 벡터당 20회의 훈련 반복만으로도 최적의 성능을 달성함으로써 빠른 수렴과 낮은 계산 비용을 입증한다.
  • ArcFace 손실의 사용은 표준 Softmax보다 정확도를 향상시키며, 초구면 임베딩 최적화의 유용성을 입증한다.
Figure 2: Important factors in the proposed method. PromptStyler learns style word vectors for pseudo-words $\boldsymbol{S_{*}}$ which lead to diverse style features (from “a $\boldsymbol{S_{*}}$ style of a”) while preserving content information encoded in style-content features (from “a $\boldsymbo
Figure 2: Important factors in the proposed method. PromptStyler learns style word vectors for pseudo-words $\boldsymbol{S_{*}}$ which lead to diverse style features (from “a $\boldsymbol{S_{*}}$ style of a”) while preserving content information encoded in style-content features (from “a $\boldsymbo

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.