[논문 리뷰] Diffusion Guided Domain Adaptation of Image Generators
이 논문은 텍스트 프롬프트만을 사용하여 새로운 이미지 도메인으로 GAN을 안내하기 위해 고정된 고품질의 비평가로 분류기 없는 확산 모델을 Score Distillation Sampling (SDS)를 통해 활용하는 새로운 도메인 적응 방법을 제안한다. 사전 훈련된 확산 모델에서의 소스 희석과 확산 유도 정규화 및 레이어 선택 기법을 도입함으로써, 실세계 타겟 도메인 이미지가 없더라도 최신 기술(FID 및 CLIP 점수)을 달성하며 이미지 품질과 제어 가능성도 향상된다. 복잡한 프롬프트에 대해서도 이전 작업을 능가한다.
Can a text-to-image diffusion model be used as a training objective for adapting a GAN generator to another domain? In this paper, we show that the classifier-free guidance can be leveraged as a critic and enable generators to distill knowledge from large-scale text-to-image diffusion models. Generators can be efficiently shifted into new domains indicated by text prompts without access to groundtruth samples from target domains. We demonstrate the effectiveness and controllability of our method through extensive experiments. Although not trained to minimize CLIP loss, our model achieves equally high CLIP scores and significantly lower FID than prior work on short prompts, and outperforms the baseline qualitatively and quantitatively on long and complicated prompts. To our best knowledge, the proposed method is the first attempt at incorporating large-scale pre-trained diffusion models and distillation sampling for text-driven image generator domain adaptation and gives a quality previously beyond possible. Moreover, we extend our work to 3D-aware style-based generators and DreamBooth guidance.
연구 동기 및 목표
- 실세계 타겟 도메인 이미지가 필요 없이 사전 훈련된 GAN 생성기의 제로샷 도메인 적응을 가능하게 하기 위해.
- CLIP 기반 가이던스의 한계(예: 일치하지 않는 잠복 공간, CLIP 손실 최소화의 어려움)를 극복하기 위해, 더 정보가 풍부한 비평가로 확산 모델을 사용하기 위해.
- StableDiffusion와 같은 대규모 확산 모델의 생성 사전 지식을 활용하여 텍스트 기반 도메인 적응에서 이미지 품질과 다양성을 향상시키기 위해.
- 모델 붕괴를 방지하고 의미적 세부 정보를 유지하기 위해 새로운 정규화 기법—확산 유도 방향성 및 재구성 정규화—를 도입하기 위해.
- 이를 3D 인식 생성기(예: EG3D) 및 DreamBooth로 미세조정된 확산 모델에까지 확장하여 더 넓은 적용 가능성을 확보하기 위해.
제안 방법
- 사전 훈련된 텍스트-이미지 확산 모델(예: StableDiffusion)에서 유도된 Score Distillation Sampling (SDS)를 사용하여, 이미지 공간에서의 미분 가능하고 고정된 비평가로 GAN 생성기 최적화를 이끌기 위해.
- 최적화 중 얼굴 표정과 색상 같은 의미적 세부 정보를 유지하기 위해 확산 유도 방향성 정규화($\mathcal{L}_{SDS}^{dir}$)를 도입하기 위해.
- 구조적 정밀도를 유지하고 블러를 줄이기 위해 재구성 기반 정규화($\mathcal{L}_{SDS}^{rec}$)를 적용하기 위해, 특히 레이어 선택과 조합할 경우에 효과적이다.
- 특정 특징 레이어에 최적화를 집중시켜 블러를 줄이고 세부 정보 유지 성능을 향상시키기 위해 SDS 미세조정에서 레이어 선택을 적용하기 위해.
- SDS 샘플링 단계 수 $T_{SDS}$를 통해 이미지 수정의 크기를 제어하며, 높은 값은 전반적인 구조적 변화를 가능하게 하고 낮은 값은 국소적 세부 정보 유지에 유리하다.
- 모든 파rameter를 冻결하고 트리플레인 Conv 레이어만 제외하여 3D 인식 생성기(EG3D)에 프레임워크를 확장하고 기하학적 정밀도 유지를 위해 LPIPS 손실을 추가하기 위해.
실험 결과
연구 질문
- RQ1사전 훈련된 확산 모델이 실세계 타겟 도메인 이미지가 없이도 효과적이고 고품질의 비평가로 기능할 수 있는가?
- RQ2제로샷 도메인 적응에서 이미지 품질, 다양성, 제어 가능성 측면에서 CLIP 기반 가이던스와 비교해 볼 때 확산 기반 가이던스는 어떻게 성능을 내는가?
- RQ3적응 과정에서 구조적 변경과 국소적 세부 정보 변경의 정도를 제어하는 데 $T_{SDS}$의 선택이 어떤 역할을 하는가?
- RQ4확산 유도 정규화 기법이 모델 붕괴를 효과적으로 방지하고 얼굴 표정, 색상 등의 의미적 세부 정보를 유지하는 데 기여하는가?
- RQ5이 방법이 3D 인식 생성기와 DreamBooth로 미세조정된 개인화된 확산 모델까지 얼마나 넓게 확장 가능한가?
주요 결과
- 짧은 프롬프트에 대해서도 CLIP 손실 최소화 없이도 이전 작업보다 훨씬 낮은 FID 점수를 달성하여 뛰어난 이미지 품질을 입증한다.
- 긴 프롬프트와 복잡한 프롬프트에 대해서는 정성적·정량적으로 모두 베이스라인을 능가하며, 더 일관되고 다양한 이미지를 생성한다.
- 확산 유도 방향성 정규화($\mathcal{L}_{SDS}^{dir}$)는 목표 스타일에 더 빠르게 수렴하고 얼굴 표정과 귀걸이 같은 세부 정보를 유지하지만, 정규화 없이 최적화한 베이스라인은 단일한 어두운 이미지로 악화되는 반면에 이를 방지한다.
- SDS 미세조정에서의 레이어 선택은 블러를 줄이고 세부 정보 유지 성능을 향상시키며, 더 적은 수의 레이어를 선택할수록 더 선명한 이미지와 더 나은 헤어 세부 정보 유지도 가능하다.
- 재구성 정규화($\mathcal{L}_{SDS}^{rec}$)는 더 많은 구조적 세부 정보를 유지하지만 색상 변화를 제한하는 반면, $\mathcal{L}_{SDS}^{dir}$는 약간의 세부 정보 정밀도 손실을 감수하면서도 더 많은 색상 변형을 허용한다.
- 이 방법은 3D 인식 생성기(EG3D)로도 성공적으로 확장되어 더 매끄러운 메쉬 기하학적 형태와 더 큰 눈 영역을 생성하며, 요청된 텍스트 프롬프트와 정확히 일치한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.